歡迎來到簡單線性迴歸(Simple Linear Regression)!

在你的 CFA 學習之旅中,你已經學過如何計算平均值和描述數據。但如果你想利用一項資訊來預測另一項呢?例如,我們能否根據整體市場的表現來預測某隻股票的報酬?這正是簡單線性迴歸 (Simple Linear Regression, SLR) 的用途。你可以把它想像成在散佈圖的數據點中畫出一條「最合適」的線,幫助我們理解兩個變數之間的關係。

如果剛開始看到數學公式覺得有些頭痛,別擔心——我們會一步步為你拆解!

1. 基礎概念:我們在建立什麼?

在簡單線性迴歸中,我們探討的是兩個變數之間的關係:

1. 應變數 (Dependent Variable, Y): 這是我們試圖解釋或預測的目標。它也被稱為「反應 (Response)」「被解釋 (Explained)」變數。
2. 自變數 (Independent Variable, X): 這是我們用來解釋 Y 的因素。它也被稱為「解釋 (Explanatory)」「預測 (Predictor)」變數。

迴歸方程式:
\( Y_i = b_0 + b_1X_i + \epsilon_i \)

其中:
- \( Y_i \) 是應變數。
- \( b_0 \) 是截距 (Intercept)(線條與縱軸的交點)。
- \( b_1 \) 是斜率 (Slope)(X 每變動 1 個單位時,Y 的變動量)。
- \( \epsilon_i \) 是誤差項 (Error Term)(實際數據點與迴歸線之間的差距)。

現實生活中的例子: 想像一下你要根據室外溫度 (X) 來預測你的電費單 (Y)。截距 (\( b_0 \)) 就是即使你沒用電也要付的基本費。斜率 (\( b_1 \)) 則是每升高一度溫度,你的電費會增加多少錢。

快速重點:

應變數 (Y) = 我們想知道的東西。
自變數 (X) = 我們已經知道的東西。
斜率 (\( b_1 \)) = 關係的「強度」與「方向」。

2. 「最合適」的線:普通最小平方法 (OLS)

我們如何決定哪條線是「最合適」的?我們使用一種稱為普通最小平方法 (Ordinary Least Squares, OLS) 的技術。
OLS 方法會選擇一條線,使得實際數據點與迴歸線之間的垂直距離平方和最小化。我們將距離進行平方,是為了確保線條上方的「誤差」不會與下方的「誤差」互相抵銷。

你知道嗎? 我們將實際點與線上的預測點之間的垂直距離稱為殘差 (Residual, \( \hat{\epsilon} \))

3. 簡單線性迴歸的假設

為了確保我們的迴歸模型可靠,我們必須對數據做出一些假設。記憶這些假設的一個流行縮寫是 "LINE"

1. Linearity (線性): X 與 Y 之間的關係是一條直線。
2. Independence (獨立性): 觀測值(誤差項)之間彼此獨立。
3. Normality (常態性): 誤差項呈現常態分佈。
4. Equal Variance (等變異性): 誤差項在所有 X 水平下的變異數皆為固定(這是一個專業術語,稱為同質變異性 (Homoscedasticity))。

常見陷阱: 學生常會忘記「同質變異性」。只要記住:「Homo」代表相同,「scedasticity」代表散佈程度。我們希望誤差沿著整條線都有「相同的散佈程度」!

4. 評估模型:我們的「擬合度」有多好?

一旦有了迴歸線,我們需要知道它是否有用。我們使用三個主要工具:

A. 判定係數 (Coefficient of Determination, \( R^2 \))

\( R^2 \) 告訴我們 Y 的變異中有多少百分比是由 X 所解釋的。
- 範圍從 0 到 1
- \( R^2 \) 為 0.80 代表 Y 的變動中有 80% 可以由 X 解釋。
- 在簡單線性迴歸中,\( R^2 \) 簡單來說就是相關係數 (r) 的平方

B. 估計標準誤 (Standard Error of Estimate, SEE)

\( SEE \) 衡量的是數據點距離迴歸線的平均「距離」。
- 越低越好! \( SEE \) 越小,代表數據點越靠近迴歸線,我們的預測就越準確。

C. 變異數分析 (ANOVA)

ANOVA 將應變數的總變異分解為兩個部分:
1. SSR (迴歸平方和): 我們模型所解釋的變異。
2. SSE (殘差平方和): 我們模型無法解釋的變異(即「剩餘部分」)。
3. SST (總平方和): 總變異 (\( SST = SSR + SSE \))。

「披薩」比喻: 想像 SST 是一整個披薩。SSR 是你朋友吃掉的部分(已解釋)。SSE 是掉在地上的部分(未解釋/誤差)。\( R^2 \) 就是你朋友成功吃掉的披薩百分比 (\( SSR / SST \))。

5. 假設檢定:斜率顯著嗎?

計算出斜率 (\( b_1 \)) 並不代表真實關係一定存在,它可能是隨機誤差導致的!我們使用 t 檢定 (t-test) 來進行測試。

虛無假設 (Null Hypothesis, \( H_0 \)): \( b_1 = 0 \)(沒有關係)。
對立假設 (Alternative Hypothesis, \( H_a \)): \( b_1 \neq 0 \)(有顯著關係)。

為了進行檢定,我們計算:
\( t = \frac{\hat{b}_1 - 0}{s_{b1}} \)
其中 \( s_{b1} \) 是斜率係數的標準誤。

如果計算出的 t 統計量大於臨界 t 值,我們就拒絕虛無假設,並稱該關係在統計上是顯著的!

6. 進行預測

這是最有趣的部分!一旦你有了係數 (\( b_0 \) 和 \( b_1 \)),你就可以對任何 X 值預測 Y。

預測步驟:
1. 確定給定的截距 (\( b_0 \)) 和斜率 (\( b_1 \))。
2. 代入給定的 X 值。
3. 計算 \( \hat{Y} = b_0 + b_1(X) \)。

範例: 若 \( b_0 = 2 \),\( b_1 = 0.5 \),且我們想預測 X 為 10 時的 Y 值:
\( \hat{Y} = 2 + 0.5(10) = 2 + 5 = 7 \)。

7. 迴歸分析的限制

在你離開前,請記住迴歸並非萬能,它有其限制:
- 異常值 (Outliers): 一個極端的數據點可能會「拉動」線條並破壞整個模型。
- 相關性 vs. 因果關係: X 與 Y 同步變動並不代表 X 導致 Y。(例如:冰淇淋銷量和鯊魚攻擊事件在夏天都會增加,但冰淇淋並不會導致鯊魚攻擊!)
- 非線性關係: 如果真實關係是曲線,直線的擬合效果會很差。

快速複習箱:

OLS: 最小化殘差平方和。
\( R^2 \): 「計分卡」(越高代表擬合越好)。
標準誤 (SEE): 「錯誤」衡量指標(越低越好)。
t 檢定: 用於檢測斜率是否顯著不為零。

繼續練習!簡單線性迴歸是你未來在 Level II 和 Level III 中接觸到的所有進階建模的基石。你一定做得到的!