歡迎來到模型誤設(Model Misspecification)的世界!

在之前的計量經濟學課程中,我們已經學會如何建立並解讀迴歸模型。但如果我們建立的模型從根本上就錯了,會發生什麼事呢?這就是所謂的模型誤設(Model Misspecification)。試著把迴歸模型想像成蓋房子的藍圖。如果藍圖本身有錯——比如少了一根支撐樑,或者用了錯誤的建材——那麼無論建築工人技術多好,整棟房子最終還是會倒塌。

在本章中,我們要學會如何找出這些「藍圖錯誤」、它們為何會發生,以及它們會如何干擾我們的投資分析。如果起初覺得有些抽象也不用擔心,我們會一點一點把它拆解開來!

1. 什麼是模型誤設?

模型誤設是指我們設定模型時違反了線性迴歸的基本假設。如果模型被誤設,迴歸係數(\(b_i\))就會產生偏差(Biased)且不一致(Inconsistent)。這代表我們的預測將會失準,而我們的假設檢定(如 t-檢定)也將不再可靠。

模型誤設的三大類別

我們通常將這些錯誤歸納為三大類:

  1. 函數形式(Functional Form): 我們選用了錯誤的數學關係(例如:明明數據是曲線,卻硬要用直線來擬合)。
  2. 解釋變數(Explanatory Variables): 我們遺漏了重要的變數,或者加入了一些不該加入的變數。
  3. 測量誤差(Measurement Error): 數據本身存在「雜訊」或記錄不準確。

快速複習: 如果模型誤設,誤差項(\(\epsilon\))就會與自變數(\(X\))產生相關性。這可是違反了迴歸分析的核心規則!

2. 遺漏變數偏差(缺失的成分)

想像你要預測房價。你加入了臥室數量作為變數,但卻遺漏了地區品質。由於地區品質通常與臥室數量相關(較大的房子往往位於較好的地段),模型會把原本由地區導致的價格上漲,錯誤地「怪罪」在臥室數量上。

遺漏變數的結果:

  • 模型呈現偏差(Biased):估計出的係數系統性地過高或過低。
  • 模型呈現不一致(Inconsistent):即使我們增加數千個數據點,誤差也不會消失。

你知道嗎? 在基礎統計學中,這常被稱為「潛在變數(Lurking variable)」偏差。在 CFA 課程中,我們關注的是它如何導致我們的 \(b\) 係數變得不可信。

3. 函數形式誤設

有時候,我們模型的「形狀」就是錯的。以下是我們最容易犯的錯誤:

A. 遺漏變數轉換

如果 \(X\) 和 \(Y\) 之間的關係是曲線(指數型),但我們卻使用了標準的線性迴歸(\(Y = b_0 + b_1X\)),我們的模型將無法擬合。這時我們可能需要對變數使用自然對數(Natural log)來使其線性化。

B. 不當地合併數據(Pooling Data)

如果你把 1990 年的數據和 2024 年的數據「混合」在一起做迴歸,這就叫合併數據。如果這段時間經濟發生了根本性的改變,你的係數將無法準確描述任何一個時期。這就像試圖通過測量幼兒和 NBA 球員的腳,來計算平均鞋碼一樣——這個平均值對誰都不適用!

關鍵點: 在合併數據前,務必確認它們來自同一個「母體」或時期。

4. 內生性(Endogeneity)與變數及誤差項的相關性

這聽起來是個可怕的詞,但內生性其實只是指自變數(\(X\))與誤差項(\(\epsilon\))相關。這是迴歸分析中的「彌天大罪」。通常由以下三個原因造成:

1. 遺漏變數(如前所述)

2. 測量誤差

如果你的 \(X\) 數據「模糊」或不準確,這些不準確性會進入誤差項中。這會讓變數(\(X\))看起來比實際影響力更小(這稱為衰減偏差(Attenuation bias))。

3. 同步性(雙向因果)

在標準迴歸中,我們假設 \(X\) 導致 \(Y\)。但如果 \(Y\) 也會導致 \(X\) 呢?
例子: 高行銷支出(\(X\))是否會帶來高銷售額(\(Y\))?還是說銷售額高的公司(\(Y\))本來就有更多錢花在行銷上(\(X\))?如果關係是雙向的,模型就是誤設的。

總結提示: 若看到「同步性」、「遺漏變數」或「測量誤差」,請馬上想到:係數不一致且具偏差。

5. 定性應變數(Qualitative Dependent Variables)

到目前為止,我們假設應變數(\(Y\))是一個數值(如股價)。但如果 \(Y\) 是「是/否」或「通過/不通過」的結果呢?我們稱這些為定性應變數

你不能對此使用標準的普通最小平方法(OLS),因為 OLS 可能會預測出 150% 或 -20% 的機率,這是不可能的!相反,我們使用以下三種模型:

  • Probit 模型: 基於常態分配,用來估計事件發生的機率。
  • Logit 模型: 基於邏輯分配(Logistic distribution)。與 Probit 相似,但使用了不同的數學「曲線」。
  • 判別分析(Discriminant Analysis): 這會創造一個「分數」來將觀察值分組(例如:「會破產」對「不會破產」)。知名的 Altman Z-score 就是一個很好的例子。

快速複習盒:
Y 是數值? 使用線性迴歸。
Y 是 是/否? 使用 Probit 或 Logit 模型。

6. 關鍵問題與後果總結

為了幫助你複習,這裡有一份當事情出錯時會發生的「作弊小抄」:

問題 後果
遺漏變數 係數具偏差且不一致。
變數縮放不當 標準誤(Standard errors)會出錯,導致 t-檢定不可信。
測量誤差 係數具偏差且不一致。
同步性 係數具偏差且不一致。

最後的鼓勵

計量方法有時候感覺就像在學一門新的語言。如果「內生性」和「同步性」讓你感到困惑,請記住核心訊息:自變數絕對不能跟誤差項「稱兄道弟」。 如果兩者相關,你的結果就會出現偏差,你就不能信任你的模型來做投資決策。你一定做得到的,加油!