歡迎來到預測分析(Predictive Analytics)的基礎!
你好!在開始編寫程式碼或為 Exam PA 建構複雜模型之前,你需要精確地釐清你所要解決的問題類型。將這一章節視為你的「藍圖規劃階段」。就像建築師在動工前必須先有藍圖一樣,精算師在定義問題特性之前,也不應貿然開始建模。
在本節中,我們將學習如何識別數據的本質、模型的目標以及我們面臨的限制。如果其中一些術語對你來說很陌生,不用擔心——我們會逐一為你拆解!
1. 問題的核心:監督式學習與非監督式學習
你需要問自己的第一個問題是:「我是否有一個具體的目標(Target)需要預測?」
監督式學習(Supervised Learning)
在監督式學習中,我們擁有一個「導師」(即目標變數)。我們為模型提供輸入(特徵,Features)以及已知的結果(標籤,Label)。模型透過學習兩者之間的關係,從而對新的、未見過的數據進行預測。
比喻:想像你在教導孩子辨識水果。你給他們看一個蘋果並說:「這是蘋果。」你給他們看一個橘子並說:「這是橘子。」這就是監督式學習,因為你提供了標籤。
非監督式學習(Unsupervised Learning)
在非監督式學習中,沒有目標變數。我們單純是在數據本身中尋找模式(Patterns)或群組(Clusters)。
比喻:你給孩子一桶混在一起的積木,告訴他們:「把看起來相似的東西放在一起。」他們可能會根據顏色或形狀將積木分組,而你並沒有告訴他們每一組具體叫什麼名稱。
快速複習:大多數 Exam PA 的考題都屬於監督式學習任務,因為身為精算師,我們通常需要預測具體的數值,例如索賠成本或保單失效情況。
2. 迴歸與分類(目標變數的類型)
一旦確定是在進行監督式學習,我們必須判斷目標變數的類型。這是 Exam PA 中最重要的步驟之一!
迴歸(Regression,連續型目標)
當目標變數是數值且連續時,我們使用迴歸。如果你可以測量它,且它具有明確的順序(例如金額或時間),那它很可能是一個迴歸問題。
範例:
- 預測保險索賠的美元金額。
- 估計處理一宗法律案件所需的時間。
- 計算業務組合的損失率(Loss Ratio)。
分類(Classification,類別型目標)
當目標變數屬於離散類別(Discrete Category)時,我們使用分類。
範例:
- 客戶會續保(Renew)還是失效(Lapse)?(二元分類:是/否)
- 索賠是欺詐(Fraudulent)還是合法(Legitimate)?
- 駕駛屬於哪一個「風險等級」:低、中或高?(多類別分類)
你知道嗎?有時候界線可能較為模糊。例如,你可以將「年齡」視為連續數值(迴歸),也可以將其分組為「年齡區間」,如 18-25 歲、26-40 歲等(分類)。具體選擇取決於你的商業目標!
3. 預測與解釋:兩者之間的取捨(The Great Trade-off)
在定義預測模型問題時,你必須決定什麼更重要:準確性(Accuracy)還是可解釋性(Understanding/Interpretability)。
預測目標(「黑盒」模型)
有時候,我們只在乎得到盡可能準確的預測。如果一個模型能完美預測索賠成本,但我們並不完全了解它為什麼做出這些選擇,對於某些自動化系統來說,這或許是可以接受的。
解釋目標(「白盒」模型)
身為精算師,我們經常需要向利害關係人或監管機構解釋我們的結果。我們必須知道哪些特徵(例如年齡或地點)正在驅動預測,以及影響程度有多大。簡單的模型如廣義線性模型(GLMs)非常適合解釋;而複雜的模型如隨機森林(Random Forests)通常在原始預測能力上較強,但卻較難解釋。
關鍵要點:在 Exam PA 考試中,你經常被要求平衡這兩者。務必考量:如果是一個你無法解釋的模型,監管機構是否會接受?
4. 數據結構:結構化與非結構化數據
在進行建模之前,你必須了解數據的「形狀」。
結構化數據(Structured Data)
這是「經典」的數據格式。想像一個帶有行與列的試算表。每一行是一個觀察值(Observation)(例如一位保單持有人),每一列是一個特徵(Feature)(例如車齡)。
非結構化數據(Unstructured Data)
這包含索賠記錄中的文字、車禍照片或客戶服務通話的錄音檔等。雖然資訊量大,但非結構化數據通常需要先轉換為結構化格式,大多數預測模型才能使用它們。
記憶小技巧:記得結構化數據的 "ROC":Rows(行/觀察值)、Observations(觀察值)、Columns(列/特徵)。
5. 道德考量與數據隱私
這是 SOA 課程中的一個重要主題。並非所有數據在倫理上都是「公平」使用的,即使它能提高模型的準確性。
在定義問題時,你必須過濾掉受保護的特徵(Protected Characteristics)。這些是基於法律或道德原因,不應被用於決策的變數,例如:
- 種族或族群
- 宗教
- 健康狀況(在某些類型的保險中)
- 性別(取決於司法管轄區和產品)
常見錯誤:使用「代理變數(Proxy Variable)」。即使你移除了「種族」,但如果你使用了與特定種族高度相關的「郵遞區號」,你的模型可能仍然存在偏見。這被稱為間接歧視(Indirect Discrimination)。
問題定義總結清單
在進入下一章之前,請確保你能夠回答任何場景下的以下問題:
1. 是否有目標?(監督式 vs. 非監督式)
2. 目標是什麼類型?(迴歸/連續型 vs. 分類/類別型)
3. 優先考量為何?(準確性 vs. 可解釋性)
4. 是否存在道德隱憂?(潛在偏見或受保護族群)
快速複習框:
- 迴歸:預測一個數值(例如 \( \hat{y} = \$1,250 \))。
- 分類:預測一個標籤(例如 \( \text{Result} = \text{'Lapse'} \))。
- 監督式:我們擁有已知的結果來進行學習。
- 非監督式:我們正在尋找隱藏的結構。
如果現在覺得這些聽起來還很理論化,別擔心!在接下來的章節中,我們將開始接觸實際數據,並學習如何為模型進行資料清理。你做得很好!