歡迎來到多元迴歸的延伸探討!
你好!如果你已經掌握了基本的多元線性迴歸(Multiple Linear Regression, MLR),你一定知道它是預測變數的強大工具。但在現實世界中,數據往往很雜亂。有時候我們的數據不僅僅是數字,還包含類別(例如「行業」或「信用評級」);有時候變數之間會以複雜的方式產生交互作用。這正是多元迴歸延伸(Extensions of Multiple Regression)發揮作用的地方。
你可以把這一章看作是迴歸分析的「專業版」。我們將學習如何處理更複雜的情況,讓你的模型在財務分析中變得更精準、更有用。如果一開始覺得有點棘手,不用擔心,我們會把它拆解開來,一步一步為你分析!
1. 定性自變數(虛擬變數 / Dummy Variables)
標準迴歸通常使用「定量」數據(如價格或盈利)。但如果你想知道「科技行業」這一類別是否會影響股票回報呢?你無法直接將「科技」這個詞放入方程式中。這時,我們就需要使用虛擬變數(Dummy Variables)。
什麼是虛擬變數?
虛擬變數是一種「二元」變數,它只會取兩個值:1(如果條件成立)或 0(如果不成立)。你可以把它想像成針對特定特徵的開關(On/Off switch)。
「n-1」法則(虛擬變數陷阱 / The Dummy Variable Trap)
這是考試中非常常見的考點!如果你有 n 個類別,模型中只能包含 \( n-1 \) 個虛擬變數。例如,如果要為四季(春、夏、秋、冬)建立模型,你只需要 3 個虛擬變數。
為什麼呢? 因為如果你知道該數據既不是春天,也不是夏天或秋天,那它一定就是冬天。若放入全部 4 個變數,會導致「完全多重共線性」,令模型崩潰。這就是所謂的虛擬變數陷阱。
解讀截距(Intercept)
在包含虛擬變數的模型中,截距(\( b_0 \))代表「基準案例(base case)」——也就是那個被剔除在外、所有虛擬變數皆為 0 的類別。而虛擬變數的係數則告訴你,該類別與基準案例之間的差異。
重點複習:
- 虛擬變數: 取值為 1 或 0。
- 變數數量: 類別總數減一。
- 截距: 代表被剔除的基準類別。
2. 交互作用項(Interaction Terms)
有時候,一個變數的影響效果取決於另一個變數的值。例如,「工作年資」對「薪資」的影響,在「男性」與「女性」之間可能有所不同。為了捕捉這種情況,我們使用交互作用項。
運作機制
交互作用項是透過將兩個自變數相乘來創建的。模型如下所示:
\( Y = b_0 + b_1 X_1 + b_2 X_2 + b_3(X_1 \times X_2) \)
比喻:咖啡與糖
想像 \( X_1 \) 是咖啡,\( X_2 \) 是糖。\( b_1 \) 是你單喝咖啡的喜好程度,\( b_2 \) 是你單吃糖的喜好程度。但交互作用項 \( b_3 \) 捕捉了當兩者結合時產生的「化學反應」。糖的影響效果取決於它是加在咖啡裡,還是單獨食用!
核心要點: 如果交互作用項的係數(\( b_3 \))在統計上顯著(p-value < 0.05),意味著因變數與 \( X_1 \) 之間的關係會隨 \( X_2 \) 的水平而改變。
3. 定性因變數(Qualitative Dependent Variables)
到目前為止,我們預測的都是數字(如股價)。但如果我們要預測的是一個類別呢?例如:公司會不會破產?(會/不會)。債券會不會被升級?(會/不會)。
在這些情況下,我們的因變數 (Y) 是定性的。我們主要使用三種模型:
A. Probit 與 Logit 模型
這些模型用於結果為二元(0 或 1)的情況。它們不是預測 Y 的精確值,而是預測 Y 等於 1 的機率。
- Logit 模型: 基於「羅吉斯(logistic)」分佈。
- Probit 模型: 基於「常態(normal)」分佈。
注意:對於 CFA 考試,你不需要了解背後複雜的數學,只需知道它們是用來估算機率,並確保結果永遠在 0 到 1 之間即可。
B. 判別分析(Discriminant Analysis)
這會根據自變數建立一個「分數」,將觀察值歸類。想像用於預測破產的 Z-score。如果分數高於某個閾值,公司就是「健康」的;低於該值,則是「有風險」的。
常見錯誤: 當因變數為 0/1 時,不要使用標準線性迴歸(OLS)。它可能會算出 1.5 或 -0.2 這樣的預測值,這對於「是/否」的問題來說完全沒有意義!
4. 評估模型規格(Model Specification)
建立模型很簡單,但建立一個「好」模型就很難。模型規格指的是選擇正確的變數和正確的函數形式。
遺漏變數偏差(Omitted Variable Bias)
如果你遺漏了一個既重要又與現有變數相關的變數,你的模型結果將會出現偏差且不一致。這就像「忘了加調味料」的問題,它會讓剩下的變數係數顯得比實際更重要(或更不重要)。
變數形式不當
有時候關係並非直線。我們可能需要轉換數據:
- Log-Log 模型: 當你預期 X 的百分比變動會導致 Y 的百分比變動時使用(恆定彈性)。
- Log-Lin 模型: 當 Y 以恆定百分比增長時使用(如複利)。
- Lin-Log 模型: 當 X 對 Y 的影響具有邊際遞減效應時使用。
5. 處理極端值與影響點(Outliers and Influential Points)
一個「奇怪」的數據點可能會毀掉整個迴歸分析。我們需要識別並處理它們。
極端值 vs. 影響點
- 極端值(Outlier): 殘差非常大的觀察值(它遠離迴歸線)。
- 高槓桿點(High Leverage Point): 自變數 (X) 取值非常極端的觀察值。
- 影響點(Influential Point): 移除該點後,會顯著改變估計係數的點。
如何偵測?
庫克距離(Cook’s Distance, Cook’s D): 這是最常見的指標。如果 Cook's D 很大,說明該數據點具有高度影響力,可能正在扭曲你的結果。
如何修正?
如果你的數據「很髒」且包含許多極端值,你可以使用穩健迴歸(Robust Regression)或 M-估計(M-estimation)。這些方法會降低極端值的權重,讓它們不會把迴歸線拉得太偏離其餘數據。
總結檢核清單:
1. 我是否有使用 \( n-1 \) 個虛擬變數?
2. 是否有遺漏交互作用效應?
3. 因變數是否為類別?(如果是,請使用 Logit/Probit)。
4. 是否使用 Cook's D 檢查過具影響力的極端值?
繼續加油!你正在掌握現實世界量化分析師每天使用的工具。迴歸可能看起來數學味很重,但其實它只是關於如何用數據說故事!