歡迎來到統計學習的基礎!
各位未來的精算師,歡迎你們!當你深入了解 Exam SRM 時,你會發現統計學習 (Statistical Learning) 是現代數據分析的核心。你可以把這一章當作準備考試的「GPS」。在我們構建複雜模型來預測保險索賠或股票價格之前,我們必須明確了解我們到底要解決什麼樣的問題。
在本節中,我們將學習如何將所有模型歸類為兩大「風格」(監督式學習 vs. 非監督式學習)和兩大「目標」(回歸 vs. 分類)。別擔心這些術語聽起來很高深;讀完這些筆記後,你就會對它們瞭如指掌!
1. 監督式學習 vs. 非監督式學習
統計學習中最重大的區別在於:我們是有一個「老師」在引導模型,還是模型必須靠自己摸索出規律。
監督式學習:在老師的指導下學習
在監督式學習 (Supervised Learning) 中,對於每一個輸入數據觀測值 \( (x_i) \),我們都有一個對應的輸出或「標籤」\( (y_i) \)。我們的目標是找到一個函數,將輸入映射到輸出,精確到當我們看到新的輸入時,可以準確預測新的輸出。
類比:想像你正在教一個孩子辨認水果。你拿一個蘋果給他看並說:「這是蘋果。」拿一個橙子給他看並說:「這是橙子。」因為你提供了「答案」(標籤),這就是監督式學習。
精算範例:根據駕駛年齡和車輛類型(輸入 \( X \))來預測索賠成本(輸出 \( Y \))。我們使用過去已知索賠成本的數據來「監督」模型進行訓練。
非監督式學習:通過探索學習
在非監督式學習 (Unsupervised Learning) 中,我們有輸入 \( (x_i) \),但沒有對應的輸出 \( (y_i) \)。這裡沒有「答案卷」,也沒有「老師」。目標是在數據中找出有趣的模式、結構或分組。
類比:想像給同一個孩子一大桶隨機形狀和顏色的積木,但什麼也不說。孩子可能會開始把所有圓形積木放在一堆,方形積木放在另一堆。他們並沒有「命名」這些積木,只是根據相似性找到了規律。
精算範例:市場細分 (Market Segmentation)。你擁有數千名保單持有人的數據。你沒有要預測的特定目標,但你想看看他們是否自然地分成了不同群體(例如:「城市年輕專業人士」與「退休鄉村屋主」),以便更精準地進行行銷。
快速回顧:主要區別
• 監督式:我們有 \( X \) 和 \( Y \)。我們想要預測 \( Y \)。
• 非監督式:我們只有 \( X \)。我們想要在 \( X \) 中找出模式。
2. 回歸 vs. 分類
如果你正在進行監督式學習(意味著你有輸出 \( Y \)),下一步就是決定你面對的是回歸 (Regression) 問題還是分類 (Classification) 問題。這完全取決於你擁有的輸出變量類型。
回歸:預測數值
當響應變量 \( Y \) 是定量 (quantitative)(數值型)時,我們使用回歸。這些變量的數值具有數學意義,並且可以進行排序。
關鍵詞:定量變量取數值(例如:$100、55.5 歲、12 英寸)。
\n範例:
\n• 預測股票的價格。
\n• 估計設備發生故障前的時間。
\n• 計算颶風造成的總損失。
分類:預測類別
\n當響應變量 \( Y \) 是定性 (qualitative)(分類型)時,我們使用分類。這些變量代表的是「類別」或「標籤」,而非測量值。
\n關鍵詞:定性變量在 \( K \) 個不同的類別中取值(例如:是/否、藍/綠/紅、合格/不合格)。
\n範例:
\n• 保單持有人是否會續保?(是或否)。
\n• 一筆信用卡交易是欺詐還是合法?
\n• 分配信用評級(A、B、C 或 D)。
記憶技巧:「C」與「R」速記法
\n• Classification(分類)是用於 Categories(類別,如「A 組」或「B 組」)。
\n• Regression(回歸)是用於 Real numbers(實數,如 $5.50 或 100 度)。
3. 重要細微差別與常見錯誤
如果界限有時顯得模糊也不要擔心!以下是學生經常踩坑的幾點:
「邏輯回歸」的困惑
警告! 有一種技術叫做邏輯回歸 (Logistic Regression)。儘管它的名字裡有「回歸」,但它幾乎總是用於分類。它估計的是一個觀測值屬於某個類別的概率(例如某人在保單期限內死亡的概率)。
我們可以將數字視為類別嗎?
有時,我們會將數值變量視為類別。例如,如果我們在預測星級評分(1、2、3、4 或 5),我們可以將其視為回歸問題(因為 5 分優於 4 分),也可以視為分類問題(將每個星級視為不同的桶)。通常,分析的目標決定了你選擇哪種方式。
你知道嗎?
大多數 Exam SRM 的考綱集中在監督式學習。不過,主成分分析 (PCA) 和聚類分析 (Clustering)(你稍後會看到)是你必須掌握的兩個重要的非監督式技術!
4. 總結與關鍵要點
為了總結本節,讓我們看一個建模思維的決策樹:
第一步:我有目標輸出 (\( Y \)) 嗎?
• 有:這是監督式學習。(進入第二步)
• 沒有:這是非監督式學習。
第二步:我的目標 (\( Y \)) 是數字還是類別?
• 數字:使用回歸模型。
• 類別:使用分類模型。
需要記住的關鍵點:
• 監督式模型用於預測。
• 非監督式模型用於探索和了解數據結構。
• 定量 (Quantitative) = 數字 = 回歸。
• 定性 (Qualitative) = 標籤/類別 = 分類。
做得好!你剛剛為整個 SRM 的學習內容打下了基礎。在接下來的章節中,我們將開始研究實際執行這些任務所需的數學和模型!