歡迎來到迴歸診斷:為你的模型進行「健康檢查」
在你的 FRM 學習旅程中,你已經學會了如何建立迴歸模型。但我們如何知道模型是否真正可靠?在金融界,一個「故障」的模型可能會導致災難性的風險管理決策。迴歸診斷 (Regression Diagnostics) 就是用來檢驗模型假設是否成立的過程。你可以把這一章想像成診斷工具箱——就像技師檢查引擎一樣——以確保我們的結果精確、無偏差,並且在現實世界中能夠派上用場。
1. 理解目標:為什麼診斷如此重要?
為了使普通最小平方法 (OLS) 迴歸成為「最佳線性無偏估計量」(BLUE),必須滿足某些假設。如果這些假設被違反,我們的結果在紙面上看起來可能很漂亮,但在實務上卻完全錯誤。我們主要在尋找四個「搗亂分子」:異質變異性 (Heteroskedasticity)、多重共線性 (Multicollinearity)、序列相關 (Serial Correlation) 以及 模型設定錯誤 (Model Specification Errors)。
快速複習:請記住,如果模型是「無偏的 (unbiased)」,代表它平均而言能命中目標。如果它是「有效的 (efficient)」,則代表它擁有盡可能小的變異數(也就是精確度高)。
2. 異質變異性:隨之變化的變異數
這是什麼?
在理想狀態下,我們模型的「誤差」(殘差) 應該具有恆定的變異數,這稱為同質變異性 (Homoskedasticity)。當誤差項的變異數不是恆定時,就會發生異質變異性 (Heteroskedasticity)。
類比: 想像你在練習射箭。如果你是一個穩定的射手,無論你站得多遠,你的失誤都會均勻地散佈在靶心周圍,這就是同質變異性。如果你站得越遠,動作就越鬆散、越難預測,你的「誤差變異數」會隨著距離增加而變大。這就是異質變異性!
異質變異性的類型
1. 無條件 (Unconditional): 變異數改變,但與我們的自變數無關。這對我們的測試通常不會造成重大問題。
2. 條件 (Conditional): 變異數與自變數的水準有關。這是我們在 FRM 中最擔心的情況,因為它會導致我們的統計檢定失效。
後果與檢測
後果: 係數 (\( \hat{\beta} \)) 仍然是無偏的,但標準誤 (Standard Errors) 通常會被低估。這會讓我們的 t 統計量看起來比實際大,誤導我們「發現」了並不存在的顯著關係!
如何識別它:
- 殘差圖 (Residual Plots): 查看殘差散佈圖中是否有「扇形」或「漏斗形」的形狀。
- Breusch-Pagan 檢定: 一種正式的統計檢定,將殘差平方對自變數進行迴歸。
- White 檢定: 一種更穩健的檢定,不需要預設異質變異性的具體形式。
如何修正它: 使用 White 的異質變異性穩健標準誤 (White’s Heteroskedasticity-Consistent Standard Errors)(也稱為穩健標準誤)。這可以在不改變係數的情況下修正 t 統計量。
關鍵結論: 異質變異性會讓你的模型看起來比實際更「確定」。使用穩健標準誤來保障安全性。
3. 多重共線性:當變數太過相似時
這是什麼?
多重共線性發生在兩個或多個自變數之間存在高度相關性時。
類比: 想像一個小組作業,兩名學生擁有完全相同的知識,並且說著完全一樣的話。這時就無法分辨到底是哪位學生對最終報告貢獻了哪一部分。每個人的「貢獻」都變得模糊不清。
後果與檢測
後果: 整個模型看起來可能很棒(R-squared 很高),但個別的 t 統計量會非常低。係數變得不穩定——數據的一點點變動就可能導致係數從正數變為負數!
如何識別它:
- 高 R-squared + 低 t 統計量: 這是最「經典」的危險訊號。
- 相關係數矩陣: 檢查自變數之間的相關性是否非常高(例如 > 0.8 或 0.9)。
- 變異數膨脹因子 (VIF): VIF 超過 5 或 10 則暗示存在嚴重的多重共線性。
如何修正它: 最簡單的修正方法是移除其中一個高度相關的變數。反正它們已經是冗餘的資訊了!
關鍵結論: 多重共線性不會導致結果產生偏差,但它讓你無法判斷到底是哪個變數在發揮作用。
4. 序列相關(自相關):習慣性的誤差
這是什麼?
當一個時期的誤差項與前一期的誤差項相關時,就會出現序列相關。這在時間序列數據中極為常見。
類比: 如果你今天心情不好是因為你昨天心情也不好,那麼你的「心情誤差」就是序列相關的,它們並非獨立事件。
後果與檢測
後果: 與異質變異性類似,OLS 係數仍然是無偏的,但標準誤會被低估。這會導致 t 統計量膨脹,並對模型的準確性產生虛假的安全感。
如何識別它:
- Durbin-Watson (DW) 檢定: 這是最常見的檢定。
- 若 \( DW \approx 2 \):無序列相關。
- 若 \( DW < 2 \):正序列相關(金融領域中最常見)。
- 若 \( DW > 2 \):負序列相關。
如何修正它: 使用 Newey-West 調整後標準誤,它可以同時修正異質變異性和序列相關。
快速複習表:
問題: 異質變異性 | 修正: White 標準誤
問題: 序列相關 | 修正: Newey-West 標準誤
5. 模型設定:打造正確的機器
有時候問題不在數據,而在於我們如何構建模型。這被稱為設定錯誤 (Specification Error)。
常見錯誤
1. 遺漏變數偏差 (Omitted Variable Bias): 你遺漏了一個實際上很重要且與自變數相關的變數。這確實會導致係數出現偏差!
2. 包含不相關的變數: 你加入了「垃圾」變數。這不會導致偏差,但會降低模型的有效性(精確度)。
3. 函數形式錯誤: 你使用直線(線性)來建模,但實際關係卻是曲線(非線性)。
常態性檢定
我們通常假設殘差服從常態分佈。為了測試這一點,我們使用 Jarque-Bera (JB) 檢定。
JB 檢定著眼於偏度 (Skewness)(對稱性)和峰度 (Kurtosis)(尾部厚度)。對於常態分佈,偏度 = 0 且峰度 = 3。如果 JB 檢定統計量很高,我們就會拒絕常態性假設。
如果起初覺得這些很棘手,別擔心: 只要記住大多數金融數據都有「厚尾」(高峰度),因此 JB 檢定在現實世界中經常無法通過!
6. 關鍵診斷檢定總結
為了幫你記憶,這裡有一份考前複習清單:
- 異質變異性: Breusch-Pagan 或 White 檢定。用 White 標準誤修正。
- 序列相關: Durbin-Watson 檢定。用 Newey-West 標準誤修正。
- 多重共線性: 尋找高 R-squared 配合低 t 統計量。透過移除變數來修正。
- 常態性: Jarque-Bera 檢定。
- 函數形式: Ramsey RESET 檢定(檢查是否應加入非線性成分)。
最後鼓勵: 你不需要成為數學天才也能精通這些!只要專注於識別症狀(檢定)和治療方法(修正)。如果你能做到這一點,你將為 FRM Part I 考試中的數量分析部分做好萬全準備。