歡迎來到數據假設的世界!

在你的 CP2 學習之旅中,你很快就會發現現實世界中的數據鮮少是完美的。它們可能雜亂無章、缺失不全,甚至顯得怪異。這就是假設(Assumptions)發揮作用的地方。你可以將假設視為一座「橋樑」,連接你所獲得的不完美數據與你需要建立的工作模型。在本章中,我們將學習當數據無法提供完整資訊時,如何做出明智且專業的選擇。

如果起初覺得這有點像是在憑空猜測,不必擔心。精算假設並非隨意的盲目臆測;它們是基於我們現有資訊所作出的合理辯證(reasoned justifications)。讀完這份筆記,你將會更有信心處理那些「棘手」的數據!


1. 為什麼我們需要做出假設?

當你收到一份 CP2 專案的數據集時,可能會發現其中存在缺漏。也許有些保單持有人忘了填寫年齡,或者某一欄數字中出現了明顯的輸入錯誤。如果我們直接忽略這些問題,模型可能會崩潰或得出錯誤的結果。

我們做出假設是為了:
• 填補缺失的資訊
• 修正明顯的錯誤(異常值)。
簡化複雜的數據,使模型運作更有效率。
• 在無法取得所需特定數據時,建立一個替代指標(proxy)

生活類比:想像你正在按照食譜烤蛋糕,但食譜頁面破損,你看不到該用多少糖。根據你烤其他蛋糕的經驗,你假設用一杯糖大概就可以了。這正是我們處理數據時所做的事——利用已知的知識來填補空白。


2. 處理缺失數據

缺失數據是最常見的障礙。處理缺失數據主要有兩種方法,具體取決於數據缺失的程度。

A. 刪除數據(「刪除」法)

如果數據缺失的比例極小(例如 10,000 筆紀錄中只有 2 筆缺失),最安全的做法可能是直接剔除它們。你假設這幾筆紀錄不會影響整體的計算結果。

B. 填補數據(「填補」法)

如果缺失的數據量較大,刪除它們可能會導致結果產生偏差。此時,你應做出假設來填補空缺。例如:
平均值:如果「投保年齡」缺失,你可以假設該人員為其餘群體的平均數(mean)中位數(median)年齡。
謹慎原則(Prudence):在某些情況下,為了安全起見,你可以採取「最壞情況」假設(例如,在壽險模型中,假設缺失吸菸狀態的樣本為「吸菸者」)。

快速檢視:務必問自己——「我的假設會實質性地改變最終答案嗎?」如果答案是肯定的,你必須在審計追蹤(audit trail)中非常仔細地解釋你的選擇!


3. 處理異常值與特例

異常值(Outlier)是指那些偏離其他數據太多,看起來明顯錯誤的數據點。例如,你看到某位保單持有人的年齡被標記為 150 歲,或者月繳保費為 \$-5,000。

該如何處理這些數據?
1. 設定上限與下限(Cap and Floor):如果那是保單的限制,你可以假設該年齡實際上為 100 歲(設上限)或 18 歲(設下限)。
2. 修正:如果數值明顯是輸入錯誤(例如 202.3 而非 2023),你可以根據周邊背景來假設其預期的數值。
3. 刪除:如果該數據點在物理上是不可能的,且你無法推斷出正確數值,則直接將其排除。

你知道嗎?在 CP2 考試中,評分員較不在意你做了什麼假設,而更在意你為什麼做這個假設。通常沒有唯一的「正確」答案,只有「論證充分」的答案。


4. 使用替代指標(Proxies)

有時,你需要的數據根本不存在。在這些情況下,你會使用替代指標(proxy)——一種行為與缺失數據相似的替代方案。

例子:你正在為電動車(EV)進行汽車保險索賠建模,但你只有汽油車的數據。你可以假設電動車駕駛的行為與汽油車駕駛相似,並可能因為電動車零件較昂貴,而將維修成本假設略微調高幾個百分點。

記憶法:P.A.R. 原則
做出假設時,檢查它是否符合:
Practical(實用性):它能被輕易地建模嗎?
Appropriate(適當性):它對於這個特定問題合適嗎?
Reasonable(合理性):其他精算師會同意你的看法嗎?


5. 審計追蹤:記錄你的假設

在 CP2 中,如果沒有紀錄下來,就等於沒發生過!這是「數據準備與分析」部分最重要的環節。你必須寫下你對所提供數據所作出的每一項假設。

文件應包含的內容:
假設內容(例如:「假設缺失的年齡均為 45 歲」)。
假設原因(例如:「45 歲是有效紀錄的平均年齡」)。
潛在影響(例如:「由於僅有 1% 的數據缺失,預計對最終保費的影響微乎其微」)。

避免常見錯誤:不要只寫「我假設缺失值為 0」。你必須解釋為什麼 0 是一個合理的選擇。如果不合理,就不要這樣做!


總結檢查清單

在進入建模階段前,請確保你已經:
• 識別出所有缺失或不一致的數據點。
• 決定了是否要排除或調整這些數據點。
• 檢查了你的假設是否與任務的整體目標保持一致
• 在摘要文件中為每一項假設寫下了清晰的論證

關鍵收穫:假設並非「作弊」——它們是使模型運作的必要工具。只需對你的操作保持誠實,並清楚解釋你的邏輯即可!