歡迎來到主成分分析(PCA)的世界!

你好!如果你曾面對包含數十個變量的大型數據集而感到不知所措,那麼你來對地方了。在非監督式學習(Unsupervised Learning)的世界裡,主成分分析(Principal Components Analysis, PCA)就像一種超能力,讓你能夠將複雜的數據濃縮成幾個關鍵的「主題」。

在本章中,我們不只是進行計算,更重要的是學會詮釋(interpret)這些計算結果告訴我們關於數據的資訊。讀完這些筆記後,你將能夠解釋什麼是「載荷(loading)」、為什麼標準化(scaling)如此重要,以及如何解讀那些看似複雜的雙標圖(Biplots)。讓我們開始吧!


1. PCA 的「食譜」:理解載荷(Loadings)

想像一下你正在描述一個人的健康狀況。你擁有關於體重、身高、血壓和心率的數據。與其分開查看每個數值,你可能想創造一個單一的「健康指數(Fitness Score)」。這個指數就是一個主成分(Principal Component, PC)

我們如何建立這個指數?我們使用載荷(Loadings)

關鍵術語:載荷(\(\phi\))
載荷告訴我們每個原始變量對特定主成分的貢獻程度。把它們想像成食譜中的「配料」。如果一個變量的載荷很高(接近 1 或 -1),它就是該主成分中非常重要的一部分。如果接近 0,則表示該變量對這個主成分影響不大。

載荷向量(Loading Vector):
對於第一個主成分(PC1),載荷向量表示為:
\( \phi_{1} = (\phi_{11}, \phi_{21}, ..., \phi_{p1}) \)

重要限制:
為了公平起見,單一主成分的所有載荷平方和必須等於 1:
\( \sum_{j=1}^{p} \phi_{j1}^2 = 1 \)
這確保了演算法不會僅僅為了「製造」高變異數而將載荷無限放大。

重點總結:載荷告訴我們每個變量在構建主成分時的方向重要性


2. 「新的座標」:理解得分(Scores)

一旦我們有了「食譜」(載荷),我們將其應用到實際數據點上。結果就是得分(Score)

關鍵術語:主成分得分(Principal Component Scores, \(z\))
得分是特定觀測值在特定主成分上的數值。如果 PC1 代表「整體體型」,那麼大象的得分會非常高,而老鼠的得分則會非常低。

公式:
對於觀測值 \(i\),第一個主成分的得分為:
\( z_{i1} = \phi_{11}x_{i1} + \phi_{21}x_{i2} + ... + \phi_{p1}x_{ip} \)

如果這看起來有點難別擔心! 只要記住:載荷定義了主成分,而得分則是將個別數據點轉換成該主成分的「語言」。


3. 為什麼標準化(Scaling)是必要步驟

這是考試中非常熱門的主題!在進行 PCA 之前,我們幾乎總是要對變量進行標準化(scale),使其平均數為 0,標準差為 1。

為什麼?
PCA 非常看重變異數(variance)。如果一個變量以「日圓」(數千)計量,而另一個以「百分比」(0 到 1)計量,僅因為數字較大,日圓變量的變異數就會大得多。PCA 會誤以為日圓變量是世界上最重要的東西,即便事實並非如此!

應避免的常見錯誤:
除非所有變量原本就已經在相同的單位下(例如全部都是公分),否則千萬不要跳過標準化。如果單位不同,一定要標準化!

快速回顧:
- 未標準化:具有大單位的變量會主導結果。
- 標準化:每個變量都能獲得「公平的發言權」。


4. PCA 可視化:雙標圖(Biplot)

雙標圖(Biplot)是一種同時顯示得分(Scores)載荷(Loadings)的特殊圖表。這就像是買一送一的超值組合!

如何解讀:
1. 點(Dots):代表個別觀測值(得分)。距離接近的點表示彼此相似。
2. 箭頭(Vectors):代表原始變量(載荷)。
3. 方向:如果兩個箭頭指向相同方向,表示這些變量呈現正相關;如果指向相反方向,則呈現負相關。
4. 長度:較長的箭頭表示該變量對圖中顯示的主成分有更強的影響力。

你知道嗎? 雙標圖的座標軸通常是 PC1(x 軸)和 PC2(y 軸)。PC1 永遠比 PC2 捕捉到更多的資訊。


5. 解釋變異比例(PVE)

既然 PCA 的核心目的是在保留盡可能多資訊的前提下壓縮數據,我們需要一種方法來衡量保留了多少資訊。這就是 PVE(Proportion of Variance Explained)

總變異數(Total Variance):這是所有個別變量變異數的總和(如果我們進行了標準化,總變異數通常等於變量的個數 \(p\))。
第 \(m\) 個主成分的 PVE:
\( PVE_m = \frac{Variance \, explained \, by \, PC_m}{Total \, Variance} \)

碎石圖(Scree Plot):
這是一個顯示每個主成分 PVE 的簡易條形圖或折線圖。通常它看起來像一個滑梯:左側高,隨著向右延伸而下降。
- 「肘部」法則(Elbow Method):為了決定保留多少主成分,尋找下降趨勢變平緩的那個點(即「肘部」)。這是選擇主成分個數的常用經驗法則。

記憶口訣:將 PVE 想像成「獲得的能量值(Power Value Earned)」。你希望用最少的主成分獲得最多的「能量」(變異數)。


6. 總結與最後建議

重點總結:
- PC1 是數據變化最劇烈的方向。
- 載荷定義方向;得分則是投影後的數據點。
- 標準化對於確保單位不會干擾結果至關重要。
- 碎石圖透過「肘部」幫助我們選擇主成分的個數。
- PCA 是一種非監督式技術——沒有「y」變量,也沒有我們試圖預測的「正確答案」。

備考小撇步:如果看到關於 PCA 詮釋的題目,首先檢查變量是否經過標準化。接著,觀察雙標圖中的箭頭,看看哪些變量會「一起移動」。如果 PC1 解釋了 70% 的變異,而 PC2 解釋了 20%,那麼你僅用兩個主成分就捕捉到了 90% 的資訊!

繼續努力練習——你做得很好!PCA 是那種在看過幾個例子後,就會突然「開竅」的課題。