主成分分析 (PCA) 簡介
歡迎來到這一章!我們將一起探索精算師數據工具箱中最強大的工具之一:主成分分析 (Principal Component Analysis,簡稱 PCA)。如果你曾面對擁有數十個欄位的數據集而感到不知所措,PCA 正好可以幫到你。這是一種用來「簡化」複雜數據的技術,同時能確保不會丟失數據背後的重要故事。
想像一下,PCA 就像是為一個複雜的物體進行高解像度的 3D 掃描,然後找一個完美的 2D 角度來拍攝它,讓你依然能一眼認出它的絕大部分特徵。在精算學術語中,我們稱之為降維 (dimensionality reduction)——將眾多變量轉化為少數幾個核心變量。
什麼是降維?
在許多精算問題中,我們需要處理大量的解釋變量 (explanatory variables)。例如,在為保險定價時,你可能擁有司機的年齡、駕照年資、引擎容量、當地犯罪率,甚至是汽車顏色等數據。這就是所謂的「高維」數據。
降維是指透過獲取一組「主成分」變量,來減少所考慮的變量數量的過程。其目標是:
- 簡化數據集。
- 去除雜訊和冗餘(具有相關性的變量)。
- 使數據更易於視覺化和建模。
核心要點:PCA 透過專注於提供最多「資訊」的變量來幫助我們壓縮數據(在統計學中,我們用方差 (variance) 來衡量資訊量)。
PCA 如何運作:概念步驟
如果底層的線性代數讓你感到畏縮,請不用擔心;在 CS1 考試中,重點在於該方法的目的和應用。以下是 PCA 轉換數據的邏輯流程:
1. 數據標準化 (Standardizing the Data)
由於變量通常以不同的單位衡量(例如:以「年」為單位的年齡 vs 以「千元」為單位的收入),我們通常會先進行標準化。這能確保數值較大的變量不會不公平地主導整個分析結果。
2. 識別主成分 (Principal Components, PCs)
PCA 會為數據尋找一組新的坐標軸。
第一主成分 (\(PC_1\)) 是數據中捕捉到最大方差的方向。
第二主成分 (\(PC_2\)) 是捕捉到次高方差的方向,但有一個重要規則:它必須與 \(PC_1\) 不相關(正交)。
3. 轉換變量
每個主成分都是原始變量的線性組合 (linear combination)。如果你的原始變量是 \(X_1, X_2, \dots, X_p\),那麼主成分 \(Z_i\) 看起來會像這樣:
\(Z_i = a_{i1}X_1 + a_{i2}X_2 + \dots + a_{ip}X_p\)
這些系數 (\(a_{i1}, a_{i2}, \dots\)) 被稱為載荷 (loadings)。它們告訴我們每個原始變量在該特定主成分中所佔的權重。
主成分的關鍵特性
關於主成分,有幾條在考試題目中非常常見的「黃金法則」:
- 最大方差:\(PC_1\) 總是解釋了數據中總方差的最大部分。
- 不相關:每個主成分之間完全不相關。這對於之後進行回歸建模是一個巨大的優勢!
- 重要性遞減:主成分是有順序的。\(PC_1\) 的「資訊量」比 \(PC_2\) 多,\(PC_2\) 又比 \(PC_3\) 多,依此類推。
- 總方差不變:所有主成分的方差總和等於原始變量的方差總和。我們並沒有「創造」新資訊,只是重新排列了它。
你知道嗎?在許多精算數據集中,首兩個或三個主成分通常就能解釋超過 80% 的總方差,這讓你可以在幾乎不損失資訊的情況下,捨棄其餘數十個變量!
解讀結果
在 Paper B 考試中,你可能會使用 R 等軟件來執行 PCA。你需要解讀兩個主要部分:
1. 解釋方差比例 (Proportion of Variance Explained, PVE)
這告訴你每個成分承載了總「資訊量」的百分比。
如果 \(PC_1\) 的 PVE 為 \(0.60\),這意味著它解釋了整個數據集中 60% 的方差。
2. 累積比例 (Cumulative Proportion)
這是 PVE 的累計總額。如果你決定保留前三個成分,你會查看 \(PC_3\) 的累積比例,看看你保留了原始數據中多少的故事內容。
常見錯誤:學生有時會認為必須保留所有成分。PCA 的核心意義在於降低維度。如果你有 10 個原始變量並保留了 10 個主成分,那你根本沒有簡化任何東西!
選擇主成分的數量
我們該如何決定何時停止?多少個主成分才算「足夠」?在數據分析中,有兩種常用的方法:
- 碎石圖 (Scree Plot):一個顯示每個主成分所解釋方差的折線圖。我們會尋找「肘部 (elbow)」——即圖形趨於平緩的點。通常我們會保留肘部之前的所有成分。
- 閾值法 (Threshold Method):我們先設定一個目標,例如「解釋 80% 或 90% 的總方差」,然後保留達到該目標所需的最少主成分數量。
快速回顧:為什麼在精算工作中使用 PCA?
1. 簡化:處理 3 個變量比處理 50 個變量要容易得多。
2. 視覺化:我們無法想像 10 維數據,但我們可以輕鬆地在 2D 散點圖上繪製 \(PC_1\) 與 \(PC_2\) 的關係,從而觀察保單持有人數據中是否存在任何天然的群聚或模式。
3. 避免多重共線性 (Multicollinearity):在回歸分析(你將在第 4 單元學習)中,高度相關的解釋變量會導致問題。由於主成分之間是不相關的,將它們作為回歸模型的輸入可以完美解決這個問題。
總結:PCA 是一種降維工具,它將一組大量且具相關性的變量,轉換為一組較小且不相關的變量,稱為「主成分」,並按其解釋方差的多寡進行排序。