歡迎來到「評估迴歸模型」!

你好!如果你已經來到 CFA Level II,你肯定知道「數量方法」(Quantitative Methods) 這座山確實不太好爬。但別擔心——評估迴歸模型其實就像當偵探。我們有一個「嫌疑人」(我們的自變量),而我們想知道的是:「這個嫌疑人能在多大程度上解釋所發生的事情?」

在這一章中,我們不僅僅是建立模型,更是在檢查它們是否真的管用。我們會學習如何閱讀「成績單」(ANOVA 表格),檢查係數的「生命體徵」,並判斷我們的模型究竟是傑作還是雜訊。讓我們開始吧!

1. 基礎知識:我們到底在看什麼?

當我們執行多元線性迴歸 (Multiple Linear Regression, MLR) 時,我們所看的方程式如下:
\( Y_i = b_0 + b_1X_{1,i} + b_2X_{2,i} + ... + b_kX_{k,i} + \epsilon_i \)

重要術語回顧:
因變量 (Dependent Variable, \( Y \)): 我們試圖預測的目標(例如:股票回報)。
自變量 (Independent Variables, \( X \)): 我們認為會影響 \( Y \) 的「驅動因素」(例如:利率、GDP 增長)。
截距 (Intercept, \( b_0 \)): 當所有 \( X \) 都為零時,\( Y \) 的數值。
斜率係數 (Slope Coefficients, \( b_j \)):保持所有其他變量不變的情況下,當該特定的 \( X \) 變動一個單位時,\( Y \) 會隨之變動多少。

現實生活中的例子: 想像你在預測房價。房屋面積(平方呎)和房間數量就是你的 \( X \) 變量。截距是土地的基礎價格,而「房間數量」的斜率則告訴你,在房屋面積不變的情況下,每增加一個房間,房價會上升多少。

總結: 迴歸分析能幫助我們量化多個因素與單一結果之間的關係。

2. 評估擬合優度:模型好用嗎?

當電腦跑出迴歸分析結果後,我們需要知道它是否有效。我們會用到幾個關鍵指標。

A. 決定係數 (\( R^2 \))

\( R^2 \) 告訴我們因變量 (\( Y \)) 的變異中有多少百分比是由自變量 (\( X \)s) 所解釋的。
• 它的範圍從 0 到 1。
• \( R^2 \) 為 0.80 意味著我們的模型解釋了 80% \( Y \) 的變動。這很棒!

B. \( R^2 \) 的問題與「調整後 \( R^2 \)」的解決方案

你知道嗎?如果你不斷往模型中添加變量——即使是像「公園裡的松鼠數量」這種無用的變量——你的 \( R^2 \) 也幾乎總會上升。這是一個陷阱!為了修正這個問題,我們使用調整後 \( R^2 \) (Adjusted \( R^2 \))

調整後 \( R^2 \) 會對那些沒有顯著幫助的變量進行「懲罰」。其計算公式為:
\( \bar{R}^2 = 1 - [(\frac{n-1}{n-k-1}) \times (1-R^2)] \)

重要規則: 調整後 \( R^2 \) 永遠小於或等於 \( R^2 \)。如果你加入一個變量後,調整後 \( R^2 \) 反而下降了,那麼這個變量就是「累贅」,不應該出現在模型中。

C. 估計標準誤差 (Standard Error of Estimate, SEE)

SEE 告訴我們實際數據點與迴歸線之間的平均距離。你可以把它想像成模型所犯的「平均錯誤」。
低 SEE = 高準確度(數據點緊貼迴歸線)。
高 SEE = 低準確度(數據點散落在各處)。
\( SEE = \sqrt{\frac{SSE}{n-k-1}} \)

快速回顧: \( R^2 \) 是「我們解釋了多少」,而 SEE 是「我們漏掉了多少」。

3. ANOVA 表格:模型的成績單

別被「ANOVA」(變異數分析)這個詞嚇倒。它只是一張將總變異拆解為「已解釋」和「未解釋」部分的表格。

1. 總平方和 (SST): 數據中的總變異。
2. 迴歸平方和 (RSS): 由我們模型解釋的變異。
3. 殘差平方和 (SSE): 我們無法解釋的「剩餘」變異(即雜訊)。

黃金法則: \( SST = RSS + SSE \)

記憶技巧: 把 SST 想成一個披薩。你吃掉的部分是 RSS(成功!),而你丟棄的餅皮就是 SSE(錯誤/浪費)。

關鍵點: 從 ANOVA 表格中,我們可以透過 \( RSS / SST \) 計算出 \( R^2 \)。

4. 假設檢定:結果是真的嗎?

我們使用兩項主要檢定來確認結果是否具備統計顯著性,還是僅僅是運氣好。

A. t-檢定 (t-Test)(檢定個別係數)

我們使用 t-檢定 來看看某個單一自變量是否有用。
虛無假設 (\( H_0 \)): 係數為零 (\( b_j = 0 \)),意味著它沒有影響。
對立假設 (\( H_a \)): 係數不為零 (\( b_j \neq 0 \))。

檢定統計量: \( t = \frac{\hat{b}_j - 0}{s_{\hat{b}_j}} \)
(係數除以其標準誤)。

決策規則: 如果計算出的 \( t \) 的絕對值大於(查表所得的)臨界值 (critical t-value),我們就拒絕虛無假設。這意味著該變量具有「統計顯著性」。

B. F-檢定 (F-Test)(檢定整個模型)

F-檢定 用來檢查是否至少有一個自變量是有用的。它檢定的是整個模型。
虛無假設 (\( H_0 \)): 所有斜率係數皆為零 (\( b_1 = b_2 = ... = b_k = 0 \))。
對立假設 (\( H_a \)): 至少有一個斜率係數不為零。

\( F = \frac{MSR}{MSE} = \frac{RSS/k}{SSE/(n-k-1)} \)

常見錯誤: 學生常分不清何時用 \( t \) 何時用 \( F \)。記住:T 是用來 Tracking Tiny details(追蹤細節,即單個變量),而 F 是為了 Full Frame(觀察整體框架,即整個模型)。

5. 線性迴歸的假設

為了使我們的迴歸結果有效,必須遵守規則。如果打破了這些假設,我們的模型可能會誤導我們!使用口訣 "LINE" 來記住它們:

L - Linearity(線性): \( X \) 與 \( Y \) 之間的關係必須是直線。
I - Independence(獨立性): 觀測值(誤差項)之間互不相關。
N - Normality(常態性): 誤差項呈常態分佈。
E - Equal Variance / Homoskedasticity(同質變異性): 誤差的「散佈」是恆定的。它們不會隨著 \( X \) 的增大而變得更混亂。

總結: 如果 "LINE" 假設成立,我們的模型通常就是 "BLUE"(最佳線性不偏估計量)。

6. 預測值的信賴區間

一旦有了模型,我們就可以預測未來的 \( Y \)。但因為世界充滿不確定性,我們不會只給出一個數字,而是給出一個區間。

計算方式:
\( \hat{Y} \pm (t_c \times s_f) \)
其中 \( \hat{Y} \) 是我們的預測值,\( t_c \) 是臨界值,而 \( s_f \) 是預測標準誤 (standard error of the forecast)

重要提示: \( X \) 的值距離歷史平均值越遠,你的信賴區間就會變得越寬(不確定性越高)。預測未知的極端情況比預測「正常」的中間地帶要困難得多!

最後快速回顧箱

\( R^2 \): 解釋了多少「故事」(0 到 1)。
調整後 \( R^2 \): 與 \( R^2 \) 相同,但會懲罰加入無用變量。
t-檢定: 檢查 1 個變量是否顯著。(df = \( n - k - 1 \))
F-檢定: 檢查整個模型是否顯著。(df = \( k \) 和 \( n - k - 1 \))
SEE: 模型的平均「失誤」或誤差。
自由度 (Degrees of Freedom, \( df \)): \( n \) 是樣本數,\( k \) 是自變量的個數。

如果公式看起來很嚇人,別擔心。在 CFA 考試中,你更有可能被要求解釋 ANOVA 表格或 t-統計量,而不是從頭開始計算所有東西。重點在於理解這些數字告訴了你什麼!