歡迎來到統計學習的基礎!

各位未來的精算師,歡迎你們!當你深入了解 Exam SRM 時,你會發現統計學習 (Statistical Learning) 是現代數據分析的核心。你可以把這一章當作準備考試的「GPS」。在我們構建複雜模型來預測保險索賠或股票價格之前,我們必須明確了解我們到底要解決什麼樣的問題。

在本節中,我們將學習如何將所有模型歸類為兩大「風格」(監督式學習 vs. 非監督式學習)和兩大「目標」(回歸 vs. 分類)。別擔心這些術語聽起來很高深;讀完這些筆記後,你就會對它們瞭如指掌!

1. 監督式學習 vs. 非監督式學習

統計學習中最重大的區別在於:我們是有一個「老師」在引導模型,還是模型必須靠自己摸索出規律。

監督式學習:在老師的指導下學習

監督式學習 (Supervised Learning) 中,對於每一個輸入數據觀測值 \( (x_i) \),我們都有一個對應的輸出或「標籤」\( (y_i) \)。我們的目標是找到一個函數,將輸入映射到輸出,精確到當我們看到的輸入時,可以準確預測的輸出。

類比:想像你正在教一個孩子辨認水果。你拿一個蘋果給他看並說:「這是蘋果。」拿一個橙子給他看並說:「這是橙子。」因為你提供了「答案」(標籤),這就是監督式學習。

精算範例:根據駕駛年齡車輛類型(輸入 \( X \))來預測索賠成本(輸出 \( Y \))。我們使用過去已知索賠成本的數據來「監督」模型進行訓練。

非監督式學習:通過探索學習

非監督式學習 (Unsupervised Learning) 中,我們有輸入 \( (x_i) \),但沒有對應的輸出 \( (y_i) \)。這裡沒有「答案卷」,也沒有「老師」。目標是在數據中找出有趣的模式、結構或分組。

類比:想像給同一個孩子一大桶隨機形狀和顏色的積木,但什麼也不說。孩子可能會開始把所有圓形積木放在一堆,方形積木放在另一堆。他們並沒有「命名」這些積木,只是根據相似性找到了規律。

精算範例:市場細分 (Market Segmentation)。你擁有數千名保單持有人的數據。你沒有要預測的特定目標,但你想看看他們是否自然地分成了不同群體(例如:「城市年輕專業人士」與「退休鄉村屋主」),以便更精準地進行行銷。

快速回顧:主要區別

監督式:我們有 \( X \) 和 \( Y \)。我們想要預測 \( Y \)。
非監督式:我們只有 \( X \)。我們想要在 \( X \) 中找出模式。

2. 回歸 vs. 分類

如果你正在進行監督式學習(意味著你有輸出 \( Y \)),下一步就是決定你面對的是回歸 (Regression) 問題還是分類 (Classification) 問題。這完全取決於你擁有的輸出變量類型

回歸:預測數值

當響應變量 \( Y \) 是定量 (quantitative)(數值型)時,我們使用回歸。這些變量的數值具有數學意義,並且可以進行排序。

關鍵詞:定量變量取數值(例如:$100、55.5 歲、12 英寸)。

\n

範例:
\n• 預測股票的價格
\n• 估計設備發生故障前的時間
\n• 計算颶風造成的總損失

\n\n

分類:預測類別

\n

當響應變量 \( Y \) 是定性 (qualitative)(分類型)時,我們使用分類。這些變量代表的是「類別」或「標籤」,而非測量值。

\n

關鍵詞:定性變量在 \( K \) 個不同的類別中取值(例如:是/否、藍/綠/紅、合格/不合格)。

\n

範例:
\n• 保單持有人是否會續保?(是或否)。
\n• 一筆信用卡交易是欺詐還是合法
\n• 分配信用評級(A、B、C 或 D)。

\n\n
記憶技巧:「C」與「R」速記法
\n

Classification(分類)是用於 Categories(類別,如「A 組」或「B 組」)。
\n• Regression(回歸)是用於 Real numbers(實數,如 $5.50 或 100 度)。

3. 重要細微差別與常見錯誤

如果界限有時顯得模糊也不要擔心!以下是學生經常踩坑的幾點:

「邏輯回歸」的困惑

警告! 有一種技術叫做邏輯回歸 (Logistic Regression)。儘管它的名字裡有「回歸」,但它幾乎總是用於分類。它估計的是一個觀測值屬於某個類別的概率(例如某人在保單期限內死亡的概率)。

我們可以將數字視為類別嗎?

有時,我們會將數值變量視為類別。例如,如果我們在預測星級評分(1、2、3、4 或 5),我們可以將其視為回歸問題(因為 5 分優於 4 分),也可以視為分類問題(將每個星級視為不同的桶)。通常,分析的目標決定了你選擇哪種方式。

你知道嗎?

大多數 Exam SRM 的考綱集中在監督式學習。不過,主成分分析 (PCA)聚類分析 (Clustering)(你稍後會看到)是你必須掌握的兩個重要的非監督式技術!

4. 總結與關鍵要點

為了總結本節,讓我們看一個建模思維的決策樹:

第一步:我有目標輸出 (\( Y \)) 嗎?
有:這是監督式學習。(進入第二步)
沒有:這是非監督式學習。

第二步:我的目標 (\( Y \)) 是數字還是類別?
數字:使用回歸模型。
類別:使用分類模型。

需要記住的關鍵點:

監督式模型用於預測
非監督式模型用於探索和了解數據結構。
定量 (Quantitative) = 數字 = 回歸。
定性 (Qualitative) = 標籤/類別 = 分類。

做得好!你剛剛為整個 SRM 的學習內容打下了基礎。在接下來的章節中,我們將開始研究實際執行這些任務所需的數學和模型!