歡迎來到多元迴歸的世界!

在之前的學習中,我們探討了簡單線性迴歸 (Simple Linear Regression, SLR),利用一個變數(例如市場報酬率)來預測另一個變數(例如股票報酬率)。但說實話,現實世界往往沒那麼簡單!一檔股票的價格不僅受市場影響,還同時受利率、油價及公司獲利等多重因素影響。

在本章中,我們將踏入現實世界,學習多元線性迴歸 (Multiple Linear Regression, MLR)。這讓我們能利用多個解釋變數來解釋單一應變數。如果起初覺得數學有點複雜,請別擔心;我們會把它拆解成小部分來學習。讀完這些筆記後,你會發現它其實只是你所學知識的延伸!

1. 多元迴歸模型

在多元迴歸中,我們試圖在多維數據點組成的「雲狀分佈」中找到一條「最佳擬合」線。其數學公式如下:

\( Y_i = \beta_0 + \beta_1 X_{1i} + \beta_2 X_{2i} + ... + \beta_k X_{ki} + \epsilon_i \)

其中:
- \( Y_i \):應變數(我們想預測的對象)。
- \( \beta_0 \):截距項(若所有 \(X\) 均為零時,\(Y\) 的數值)。
- \( \beta_1, \beta_2... \)偏迴歸係數 (Partial regression coefficients)
- \( X_1, X_2... \):自變數(解釋變數)。
- \( \epsilon_i \):誤差項(其他影響 \(Y\) 但未納入模型的因素)。

理解「偏」效應

對於 FRM 考試,最重要的一點是如何解讀這些係數。我們使用「其他條件不變」(ceteris paribus) 這一概念。

範例:假設我們根據房屋面積 (\(X_1\)) 和臥室數量 (\(X_2\)) 來預測房價 (\(Y\))。如果 \(\beta_1 = 150\),這意味著在保持臥室數量不變的前提下,房屋面積每增加 1 個單位,房價將增加 150 美元。

快速複習:在多元迴歸中,每個係數都告訴我們在保持模型中所有其他變數不變的情況下,該特定變數的影響。

2. 適合度:\(R^2\) 與調整後 \(R^2\)

在簡單迴歸中,我們使用 \(R^2\) 來觀察模型對數據的解釋程度。但在多元迴歸中,標準 \(R^2\) 存在一個「陷阱」。

問題所在:每當你在模型中增加一個新變數時——即使它完全沒用(例如用「天空中的鳥類數量」來預測「股票價格」)——\(R^2\) 永遠會保持不變或上升。它絕對不會下降!

解決方案:調整後 \(R^2\) (Adjusted \(R^2\))

為了修正這個問題,我們使用調整後 \(R^2\)(記作 \(\bar{R}^2\))。這個版本會針對那些無法有效解釋應變數的變數進行「懲罰」。這有助於我們判斷增加一個新變數是否真的值得。

\( \bar{R}^2 = 1 - \frac{(1-R^2)(n-1)}{n-k-1} \)

其中:
- \( n \) = 樣本數
- \( k \) = 自變數個數

你知道嗎?由於增加了對變數個數的懲罰機制,調整後 \(R^2\) 永遠會小於或等於標準 \(R^2\)。如果在考試題目中看到調整後 \(R^2 > R^2\),那肯定是一個陷阱題!

關鍵結論:使用 \(R^2\) 來查看被解釋的變異量,但在比較不同變數個數的模型時,請務必使用調整後 \(R^2\)。

3. 假設檢定:T 檢定與 F 檢定

建立模型後,我們需要知道這些變數是否真的重要。我們主要使用兩種類型的檢定:

T 檢定(個別顯著性)

我們使用 T 檢定來檢查單一變數是否具備統計顯著性。
虛無假設 (\(H_0\)): \(\beta_i = 0\)(該變數無影響)。
公式: \( t = \frac{\text{估計係數} - \text{假設值}}{\text{係數標準誤}} \)

F 檢定(聯合顯著性)

F 檢定用於檢查所有解釋變數作為一個整體是否具有預測力。它檢定的是至少有一個 \(\beta\) 係數不為零。
虛無假設 (\(H_0\)): \(\beta_1 = \beta_2 = ... = \beta_k = 0\)。
類比:如果 T 檢定像是檢查球隊中某位球員的個人能力,那麼 F 檢定就像是檢查整支球隊是否有贏球的能力。

常見錯誤:學生常誤以為若所有個別 T 檢定都失敗,F 檢定也一定會失敗。事實並非如此!有時變數在一起工作時的效果比單獨存在時更好。

4. 陷阱:遺漏變數偏差與多重共線性

多元迴歸功能強大,但 FRM 考試中必須辨識兩大「死敵」。

死敵一:遺漏變數偏差 (Omitted Variable Bias, OVB)

當你遺漏了一個既重要(會影響 \(Y\))又與模型中現有變數高度相關的變數時,就會發生這種情況。

結果:你的估計係數將會是有偏差的 (biased)不一致的 (inconsistent)。模型會把遺漏變數的功勞(或責任)「歸咎」到你納入的變數上。

死敵二:多重共線性 (Multicollinearity)

當兩個或多個「自變數」之間高度相關時就會發生。例如,如果你試圖用「左腿長度」和「右腿長度」來預測一個人的身高。

如何察覺:
1. \(R^2\) 非常高,且 F 檢定顯著。
2. 但是,個別 T 檢定並不顯著(單看這些變數似乎沒用)。
3. 係數的標準誤非常大。

類比:想像兩個人同時大喊相同的訊息。你知道訊息正在傳遞(高 \(R^2\)),但你無法分辨是誰在傳遞哪部分的訊息(低 T 統計量)。

快速複習:OVB 讓你的結果錯誤(偏差);多重共線性則讓你的結果不可靠(高變異數/高標準誤)。

5. 多元迴歸模型的假設

為了使我們的 OLS(普通最小平方法)估計量成為「最佳線性不偏估計量」(BLUE),必須滿足某些假設。這些是延伸至多元迴歸的高斯-馬可夫假設 (Gauss-Markov Assumptions)

1. 線性:變數間的關係是線性的。
2. 隨機抽樣:數據為具代表性的樣本。
3. 無完全共線性:沒有任何自變數是其他變數的完全線性組合。
4. 零條件期望:給定 \(X\) 時,誤差項的期望值為零。\(E(\epsilon | X) = 0\)。(這是關於偏差最重要的一點!)
5. 同質變異性 (Homoskedasticity):誤差項的變異數在所有觀察值中保持恆定。

總結重點:
- 係數:解讀時記得「保持其他變數不變」。
- 調整後 \(R^2\):用於比較模型;它會懲罰模型的複雜度。
- F 檢定:檢定整體模型;T 檢定檢定單一變數。
- 多重共線性:\(X\) 變數間高度相關會導致標準誤過大、T 統計量過低。
- OVB:當遺漏了相關變數時發生,導致估計值出現偏差。