歡迎來到線性回歸的世界!
你好,未來的 FRM 持證人!別被「線性回歸」(Linear Regression) 這個名字嚇到了。這個章節的核心其實非常簡單:就是尋找變數之間的關係。在金融領域,我們總是在探討一件事情(例如利率)如何影響另一件事情(例如債券價格)。線性回歸就是一種數學工具,它能幫助我們在雜亂的數據中畫出一條「最佳擬合線」(line of best fit),讓我們看清背後的邏輯。如果你曾經看過散點圖,並試著在點與點之間畫出一條直線,那你其實已經做過回歸分析的基本功了!
研讀完這份筆記後,你將會學會如何構建這些模型、理解「Beta」係數的真正含義,以及如何判斷你的模型是一個可靠的工具,還是僅僅是一次幸運的猜測。
1. 單變數線性回歸模型
在單變數線性回歸中,我們探討兩個變數之間的關係:應變數 (Dependent Variable, \(Y\)) 與 自變數 (Independent Variable, \(X\))。
方程式:
\( Y_i = \beta_0 + \beta_1 X_i + \epsilon_i \)
讓我們將其拆解,逐一理解:
• \(Y_i\)(應變數): 這是你試圖預測或解釋的目標(例如:股票回報率)。
• \(X_i\)(自變數/解釋變數): 這是你認為會影響 \(Y\) 的因素(例如:市場回報率)。
• \(\beta_0\)(截距項): 當 \(X\) 為零時,\(Y\) 的數值。在圖表上,它是直線與縱軸的交點。
• \(\beta_1\)(斜率係數): 這是最重要的部分!它告訴我們 \(X\) 每變動 1 個單位時,\(Y\) 會發生多少變動。
• \(\epsilon_i\)(誤差項): 這就是所謂的「雜訊」。現實世界的數據永遠不完美,誤差項代表了模型中未納入、但會影響 \(Y\) 的所有其他因素。
真實案例: 想像你的考試分數 (\(Y\)) 取決於溫習時數 (\(X\))。其中的 \(\beta_1\) 會告訴你每多溫習一小時能增加多少分數;而 \(\epsilon\) 則可能包括你的睡眠時間或考場環境是否吵雜等因素。
重點總結: 回歸分析能幫助我們精確量化一個變數改變時,另一個變數會產生多少程度的連動。
2. 普通最小平方法 (OLS) 估計
我們究竟該如何找出這條「最佳」直線呢?我們使用一種稱為普通最小平方法 (Ordinary Least Squares, OLS) 的技術。別擔心它聽起來很複雜,概念其實非常直觀。
OLS 的目標是找到一條直線,使得真實數據點與直線之間的垂直距離平方和**達到最小。我們之所以將距離取平方,是因為我們不希望正誤差與負誤差相互抵消,我們想要懲罰所有的「偏離」。
參考公式:
估計斜率 (\(\hat{\beta}_1\)) 的計算方式為:
\( \hat{\beta}_1 = \frac{Cov(X, Y)}{Var(X)} \)
截距 (\(\hat{\beta}_0\)) 的計算方式為:
\( \hat{\beta}_0 = \bar{Y} - \hat{\beta}_1 \bar{X} \)
快速回顧: OLS 通過最小化平方誤差給出「最佳擬合」線。這條線一定會通過 \(X\) 的平均值和 \(Y\) 的平均值。
3. 黃金法則:OLS 的假設條件
為了讓 OLS 產生可靠的結果(即成為「最佳線性不偏估計量」或稱 BLUE),必須滿足某些假設條件。如果這些規則被破壞,我們的模型可能會誤導我們!
1. 線性關係: \(X\) 與 \(Y\) 之間的關係必須是一條直線。
2. 隨機抽樣: 數據必須能代表總體情況。
3. 無完全共線性: \(X\) 必須具有變動性。如果 \(X\) 永遠是同一個數值,我們就無法觀察它如何影響 \(Y\)。
4. 外生性: 誤差項不能與 \(X\) 相關。這意味著 \(E(\epsilon | X) = 0\)。若違反此假設,將會產生遺漏變數偏差 (Omitted Variable Bias)。
5. 同質變異性 (Homoskedasticity): 誤差項的「散佈」或變異數在所有 \(X\) 的數值下應保持恆定。
你知道嗎? 如果上述假設成立,OLS 估計量就是現有方法中效率最高的。這被稱為高斯-馬可夫定理 (Gauss-Markov Theorem)。
4. 適配度:模型表現如何?
當我們畫出直線後,需要確認它是否表現良好。我們使用判定係數 (\(R^2\)) 來進行衡量。
\(R^2\) 解讀:
\(R^2\) 告訴我們 \(Y\) 的變異中有多少百分比是由 \(X\) 解釋的。
• \(R^2 = 0.80\) 代表 \(Y\) 的變動中有 80% 可以由我們的模型解釋。
• \(R^2\) 的數值範圍永遠在 0 到 1 之間。
公式:
\( R^2 = \frac{解釋變異平方和 (ESS)}{總變異平方和 (TSS)} \)
或者:\( 1 - \frac{殘差平方和 (SSR)}{TSS} \)
記憶小撇步: 將 TSS 想像成一個「完整的披薩」。ESS 是你真正吃掉的部分(已被解釋),而 SSR 則是留下的披薩邊(未被解釋的誤差)。
5. 假設檢定:關係是否真實存在?
僅僅因為我們找到了一個斜率 (\(\beta_1\)),並不代表它是「真實的」。它可能只是小樣本中的隨機巧合。我們使用 t-檢定 (t-test) 來進行驗證。
檢定步驟:
1. 設定虛無假設 (\(H_0\)): 通常我們假設 \(\beta_1 = 0\)(意味著 \(X\) 對 \(Y\) 沒有影響)。
2. 計算 t-統計量:
\( t = \frac{\hat{\beta}_1 - 假設數值}{ \hat{\beta}_1 的標準誤 } \)
3. 與臨界值比較: 如果你的 t-統計量絕對值大於臨界值(對於 5% 顯著水準,通常約為 2.0),你就可以拒絕虛無假設!
關鍵詞: p-值 (p-value) 指的是在虛無假設為真的情況下,觀察到此結果的機率。較低的 p-值(通常 < 0.05)意味著該關係具有「統計顯著性」。
常見誤區: 不要將統計顯著性與經濟顯著性混淆。一個變數可能具有統計顯著性 (p < 0.05),但其斜率 (\(\beta_1\)) 可能非常微小,以至於在現實金融操作中毫無意義。
6. 信賴區間
我們通常不會只給出一個估計點,而是提供一個範圍,這就是信賴區間 (Confidence Interval)。
公式:
\( \hat{\beta}_1 \pm (t_{臨界值} \times SE_{\hat{\beta}_1}) \)
如果我們想要 95% 的信賴區間,代表我們有 95% 的把握認為真實的總體參數落在這個範圍內。如果該區間包含了零,則表示該關係在統計上是不顯著的!
快速總結表:
• 高 t-統計量 (> 2): 具顯著關係。
• 低 p-值 (< 0.05): 具顯著關係。
• 信賴區間包含 0: 不顯著。
結語
線性回歸是量化金融的基石。無論你是計算股票的「Beta」,還是試圖預測通膨,你都在使用這些工具。請記住:OLS 最小化平方誤差、\(R^2\) 衡量適配度,以及 t-檢定檢查顯著性。掌握這三個支柱,你一定能在 FRM 考試的這部分拿到高分!