歡迎來到多元迴歸的世界!

在 Level I,你已經學過簡單線性迴歸——即使用單一變量(例如市場回報)來預測另一件事(例如股票回報)。但說實話,現實世界遠比這複雜。房價不僅僅取決於面積,還受限於地理位置、樓齡以及浴室數量等因素。

多元線性迴歸 (Multiple Linear Regression, MLR) 正是你處理這些「現實世界」複雜性的工具。它讓我們能夠利用兩個或以上的自變量來解釋一個因變量。別擔心,如果這些公式一開始看起來有點嚇人,我們會一步步為你拆解!

1. 多元迴歸模型

多元迴歸的基本方程如下:

\( Y_i = b_0 + b_1X_{1i} + b_2X_{2i} + ... + b_kX_{ki} + \epsilon_i \)

其中:
- \( Y_i \):因變量(你試圖預測的目標)。
- \( b_0 \):截距(當所有 \( X \) 都為零時,\( Y \) 的數值)。
- \( b_1, b_2, ..., b_k \)偏迴歸係數 (Partial regression coefficients)
- \( X_{1}, X_{2}, ..., X_{k} \):自變量(預測因子)。
- \( \epsilon_i \):誤差項(模型無法解釋的「雜訊」)。
- \( k \):自變量的數量。

核心概念:偏斜率係數

這是考試中的熱門考點!一個係數(例如 \( b_1 \))告訴你,在保持其他所有自變量不變的前提下,\( X_1 \) 每變動一個單位,\( Y \) 會隨之改變多少。這部分「保持不變」非常重要,意味著我們正在抽離出該特定變量的獨特影響。

例子: 如果我們根據工作年資 (\( X_1 \)) 和教育程度 (\( X_2 \)) 來預測薪資,那麼工作年資的係數就代表了在教育程度完全相同的情況下,每多工作一年所帶來的薪資增長。

快速回顧:
- 因變量 (Dependent Variable) = 結果
- 自變量 (Independent Variables) = 原因/預測因子
- 解讀 \( b_j \):ceteris paribus(其他條件不變)的情況下,\( X_j \) 每變動 1 個單位時,\( Y \) 的變化量。

2. MLR 的 6 大基礎假設

為了確保迴歸模型可靠,它必須遵循一些規則。如果這些規則被破壞,我們的結論可能會出現「偏差」或根本錯誤。以下是有效 MLR 的「食譜」:

1. 線性關係 (Linearity): 因變量與自變量之間必須是線性關係。(不容許曲線!)
2. 無多重共線性 (No Multicollinearity): 自變量之間不存在高度相關性。
3. 同方差性 (Homoscedasticity): 誤差項的方差在所有觀測值中保持不變。(如果誤差的「散佈」會改變,我們稱之為異方差性 (Heteroscedasticity))。
4. 誤差項獨立性 (Independence of Errors): 一個觀測值的誤差項與另一個觀測值的誤差項無關。(無自相關性 (Autocorrelation))。
5. 常態性 (Normality): 誤差項呈常態分佈。
6. 自變量與誤差項獨立 (Independence of X and Error): 自變量與誤差項之間沒有相關性。

助記口訣: "LINE-M"
- Linear relationship (線性關係)
- Independent errors (誤差獨立)
- Normal errors (誤差呈常態分佈)
- Equal variance (等方差性,即同方差性)
- Multicollinearity (無多重共線性!)

重點: 如果這些假設成立,我們的估計量就是 BLUE(最佳線性不偏估計量,Best Linear Unbiased Estimators)。

3. 評估模型:ANOVA 與 R-平方

模型運行後,我們如何判斷它是否真的好用?我們可以使用 ANOVA(變異數分析) 表格。

三個平方和

1. 總平方和 (Total Sum of Squares, SST): 因變量的總變異。
2. 迴歸平方和 (Regression Sum of Squares, RSS): 由你的模型所解釋的變異。
3. 殘差平方和 (Sum of Squared Errors, SSE): 模型未能解釋的「剩餘」變異。

關係式: \( SST = RSS + SSE \)

R-平方 (\( R^2 \)) 與 調整後 R-平方 (\( R^2_{adj} \))

\( R^2 \)(判定係數)告訴我們因變量中由自變量解釋的變異百分比。
\( R^2 = \frac{RSS}{SST} \)

你知道嗎? 如果你在模型中添加*任何*新變量,\( R^2 \) 要麼保持不變,要麼上升。它永遠不會下降!這是一個問題,因為我們可能會僅僅為了讓模型看起來更好看而添加無用的變量。

為了修正這個問題,我們使用 調整後 \( R^2 \) (Adjusted \( R^2 \)):
\( R^2_{adj} = 1 - [(\frac{n-1}{n-k-1}) \times (1 - R^2)] \)

調整後 \( R^2 \) 會對那些不能提供實際價值的變量進行懲罰。它永遠小於或等於 \( R^2 \)。

4. 假設檢定:結果顯著嗎?

我們主要使用兩個檢定來查看模型是否真正提供了有用的訊息。

t 檢定 (個別顯著性)

某個特定的自變量是否有用?
- 虛無假設 (\( H_0 \)): \( b_j = 0 \)(該變量無效)。
- 對立假設 (\( H_a \)): \( b_j \neq 0 \)(該變量顯著)。
- 計算: \( t = \frac{\text{估計係數}}{\text{係數標準誤}} \)

F 檢定 (整體顯著性)

所有自變量放在一起是否能解釋 \( Y \) 的變異?
- 虛無假設 (\( H_0 \)): \( b_1 = b_2 = ... = b_k = 0 \)(整個模型無效)。
- 計算: \( F = \frac{MSR}{MSE} = \frac{RSS/k}{SSE/(n-k-1)} \)

注意:F 檢定永遠是單尾檢定。如果計算出的 F 值大於臨界 F 值,我們拒絕虛無假設,並稱該模型顯著。

常見錯誤: 不要混淆 t 檢定和 F 檢定。使用 t 檢定 來檢測單一變量,使用 F 檢定 來檢測整個變量群組。

5. 估計標準誤 (SEE)

SEE 用來衡量誤差項的標準差。它告訴我們實際數據點圍繞迴歸線變動的程度。
- 較小的 SEE 意味著模型的預測更「精確」。
- 公式: \( SEE = \sqrt{MSE} = \sqrt{\frac{SSE}{n-k-1}} \)

核心重點: 將 SEE 視為模型的「平均誤差」。數值越低越好!

成功清單

在進入下一章之前,請確保你能:
- [ ] 區分因變量與自變量。
- [ ] 解讀係數(記住:「其他條件不變」)。
- [ ] 列出 6 大假設 (LINE-M)。
- [ ] 解釋為何調整後 \( R^2 \) 通常比 \( R^2 \) 更準確。
- [ ] 計算 t 統計量與 F 統計量。
- [ ] 理解 \( SST = RSS + SSE \) 的關係。

如果這些計算讓你看起來感到吃力,別擔心!大多數 CFA 題目都會為你提供 ANOVA 表格;你的工作是理解這些數字之間的關聯以及它們對你的投資分析代表什麼意義。加油,你做得到的!