歡迎來到主成分分析 (Principal Component Analysis, PCA) 的世界!
各位準精算師們好!今天我們要深入探討非監督式學習 (Unsupervised Learning) 工具箱中最強大的工具之一:主成分分析,簡稱 PCA。
別被這個名稱嚇倒了。如果你曾經嘗試將一本 500 頁的書濃縮成 1 頁的執行摘要,那麼你已經做過一次「腦內 PCA」了。在數據的世界裡,我們經常需要處理數十(甚至數百)個變數。PCA 能協助我們找出幾個「超級變數」,在剔除雜訊的同時捕捉數據的核心精髓。讓我們一步一步來拆解它!
1. 到底什麼是 PCA?
PCA 是一種用於降維 (dimension reduction) 的技術。在許多數據集中,變數之間往往存在相關性(彼此相關)。例如,在房價數據集中,「坪數」和「房間數量」通常會同步變動。PCA 並非分開檢視這兩個變數,而是找到一種方法將它們結合成一個單一的分數。
目標:在盡可能保留變異數 (variation) 的前提下,找到數據集的低維度表示。
類比:想像你要幫一座 3D 雕像拍一張 2D 照片。你會希望站在一個能看見最多細節和「深度」的角度。PCA 就是在幫你的數據找到那個最完美的拍攝角度。
快速複習:PCA 是非監督式的,因為這裡沒有「目標」或「反應」變數 (\(y\))。我們只關注預測變數 (\(x_1, x_2, \dots, x_p\))。
2. 第一主成分 (\(PC_1\))
第一主成分是指變數的某種線性組合,該組合具有最大的變異數。
在數學上,對於一組特徵 \(x_1, x_2, \dots, x_p\),第 \(i\) 個觀察值的第一主成分得分為:
\( Z_{i1} = \phi_{11}x_{i1} + \phi_{21}x_{i2} + \dots + \phi_{p1}x_{ip} \)
需要記住的關鍵術語:
負荷量 (Loadings, \(\phi\)):這些是權重。例如,\(\phi_{11}\) 是第一個變數在第一主成分中的負荷量。它們告訴我們每個變數在新的成分中佔了多少「比重」。
得分 (Scores, \(Z\)):這是轉換後的數據點在新的「PCA 空間」中的實際數值。
限制條件:
為了讓數學運算成立,我們有一個規則:負荷量的平方和必須等於 1。
\( \sum_{j=1}^{p} \phi_{j1}^2 = 1 \)
為什麼?如果沒有這條規則,我們只要隨意選取巨大的權重,就能讓變異數無限大!這個限制條件能確保數據標準化。
關鍵要點:第一主成分是數據中觀察值變異程度最大的「方向」。
3. 計算後續成分
在找到第一主成分 (\(PC_1\)) 後,我們可以接著找到第二主成分 (\(PC_2\)),以此類推。
正交性原則 (Rule of Orthogonality):第二主成分 (\(PC_2\)) 必須與 \(PC_1\) 不相關 (uncorrelated)。從幾何角度來看,這意味著 \(PC_2\) 的方向與 \(PC_1\) 垂直 (orthogonal)。
你知道嗎?主成分的數量最多只能有 \(min(n-1, p)\) 個,其中 \(n\) 為觀察值的數量,\(p\) 為變數的數量。
逐步計算邏輯:
1. 找出捕捉最多變異數的方向 (\(PC_1\))。
2. 在與第一個方向垂直的前提下,找出捕捉剩餘最多變異數的下一個方向 (\(PC_2\))。
3. 重複上述步驟,直到解釋了所有變異數或達到成分數量的上限。
4. 標準化的重要性
千萬別跳過這步!這是考試非常熱門的考點。在進行 PCA 計算之前,幾乎總是應該對變數進行標準化 (scaling),使其平均數為 0,標準差為 1。
為什麼?PCA 對測量單位非常敏感。想像一個數據集同時包含「年收入」(以美元計算)和「年齡」(以歲計算)。僅僅因為單位差異,收入的數值會大得多,變異數也會大得多。如果不進行標準化,PCA 會因為數值較大,而誤以為收入是唯一重要的變數。
小撇步:如果所有變數的測量單位相同(例如都是 0-100 的考試成績),則可能不需要標準化。但在大多數 SRM 題目中,標準化是安全且正確的做法。
常見錯誤:忘記將數據置中(減去平均數)。PCA 尋找的是圍繞平均數的變異數。
5. 變異數解釋比例 (PVE)
我們應該保留多少個主成分?為了解答這個問題,我們要看變異數解釋比例 (Proportion of Variance Explained, PVE)。
我們想知道的是:「前 \(m\) 個主成分捕捉了原先 \(p\) 個變數中多少比例的總資訊?」
數據集的總變異數等於每個個別變數變異數的總和。第 \(m\) 個成分的 PVE 計算公式如下:
\( PVE_m = \frac{\text{Variance explained by } PC_m}{\text{Total Variance}} \)
陡坡圖 (Scree Plot)
我們通常會使用陡坡圖 (Scree Plot) 來視覺化 PVE。這是一個簡單的圖表,橫軸為成分編號,縱軸為 PVE。
「肘部」法則 (Elbow Method):觀察 PVE 下降幅度顯著變小且曲線趨於平緩的轉折點(即「肘部」)。這通常是保留成分數量的理想位置。
關鍵要點:累計 PVE 告訴我們擁有了多少「總資訊量」。如果前 3 個成分就能解釋 95% 的變異數,那我們通常就可以忽略其他 20 個變數了!
6. 總結與最後建議
PCA 就像一支強力手電筒。它能照亮混亂、高維度空間中最關鍵的模式。
記憶口訣(PCA 的 3 個 S):
1. Scale the data first! (優先標準化數據!)
2. Scores are the new data points. (得分是轉換後的數據點。)
3. Scree plots help you decide when to stop. (利用陡坡圖決定何時停止。)
快速複習箱:
- PCA 是監督式還是非監督式學習? 非監督式。- 負荷量 (Loadings) 代表什麼? 成分中各原始變數的權重。
- PC1 與 PC2 的關係為何? 它們不相關(正交)。
- 為什麼要標準化? 防止測量單位大的變數主導整個分析。
如果剛開始覺得數學很難,別擔心!對於 SRM 考試,請專注於概念:我們為何使用 PCA(降維)、標準化的重要性,以及如何解讀 PVE。你一定行的!