歡迎來到線性回歸的世界!

你好!歡迎來到 CS1 課程中最實用且應用最廣泛的章節之一。如果你曾好奇保險公司如何根據駕駛者的年齡來決定車保費率,或者經濟學家如何預測未來的通貨膨脹率,那麼你其實就是在思考線性回歸(Linear Regression)的課題。

在本章中,我們不只是要觀察兩者之間是否有關聯,而是要建立一個數學模型來描述這種關係。如果你覺得統計學有點深奧,別擔心——我們會透過簡單的類比和清晰的邏輯,一步步為你拆解。讓我們開始吧!

1. 什麼是線性回歸模型?

簡單線性回歸的核心,就是在一組數據點中找到一條「最佳擬合(best-fit)」的直線。我們利用一個變量(自變量/解釋變量,\( x \))來預測另一個變量(因變量/被解釋變量,\( Y \))。

公式

單次觀測的標準模型寫法如下:
\( Y_i = \alpha + \beta x_i + \epsilon_i \)

讓我們拆解其中的要素:

  • \( Y_i \)(因變量): 這是我們想要預測的目標(例如:索償金額)。
  • \( x_i \)(自變量/回歸量): 這是我們已知的資訊(例如:車齡)。
  • \( \alpha \)(截距): 當 \( x \) 為零時,\( Y \) 的數值。
  • \( \beta \)(斜率): 這告訴我們當 \( x \) 每增加 1 個單位時,\( Y \) 會改變多少。
  • \( \epsilon_i \)(誤差項): 這是「隨機噪音」。在現實世界中,數據點永遠無法完美地落在直線上。誤差項解釋了實際點與直線之間的距離。

類比: 想像你在烘焙蛋糕。蛋糕的高度(\( Y \))取決於你使用的發粉量(\( x \))。截距(\( \alpha \))是麵糊膨脹前的高度,斜率(\( \beta \))是每克發粉對高度的影響,而誤差(\( \epsilon \))則代表像是焗爐溫度略有誤差等隨機因素。

快速回顧: 回歸的目標是估計 \( \alpha \) 和 \( \beta \) 的值,以便我們能做出準確的預測。

2. 「必備」假設 (LINE)

為了使線性回歸模型有效且具備統計意義,我們需要滿足四大假設。你可以透過助記詞 LINE 來記憶:

  • L - 線性 (Linearity): \( x \) 和 \( Y \) 之間的關係必須是直線。
  • I - 獨立性 (Independence): 誤差項(\( \epsilon_i \))必須相互獨立。一個人的索償不應影響另一個人的索償。
  • N - 常態性 (Normality): 我們假設誤差服從常態分佈,平均值為零:\( \epsilon_i \sim N(0, \sigma^2) \)。
  • E - 等方差性 (Equal Variance / Homoscedasticity): 對於所有 \( x \) 的數值,誤差的「離散程度」應保持恆定。

常見錯誤: 學生經常忘記常態性假設是針對誤差項(\( \epsilon \))而言,而非指原始的 \( x \) 或 \( Y \) 數據本身!

3. 估計參數:普通最小二乘法 (OLS)

我們究竟如何找到那條「最佳」直線?我們使用一種稱為普通最小二乘法 (Ordinary Least Squares, OLS) 的方法。

「最佳」直線是指能使殘差平方和 (Sum of Squared Errors, SSE) 達到最小的直線。我們將誤差平方化,是因為我們希望正向和負向的距離被一視同仁,並對大幅偏離的數據點給予更重的懲罰。

魔法公式

透過微積分,我們可以推導出斜率和截距的估計量:

斜率 (\( \hat{\beta} \)):
\( \hat{\beta} = \frac{S_{xy}}{S_{xx}} \)
其中 \( S_{xy} = \sum (x_i - \bar{x})(y_i - \bar{y}) \) 及 \( S_{xx} = \sum (x_i - \bar{x})^2 \)。

截距 (\( \hat{\alpha} \)):
\( \hat{\alpha} = \bar{y} - \hat{\beta}\bar{x} \)

你知道嗎? 回歸直線總是會通過數據的平均值點 \( (\bar{x}, \bar{y}) \)。如果你算出的直線沒有經過數據的平均值,請務必重新檢查你的計算!

4. 模型效果如何? (擬合優度)

得到直線後,我們需要判斷它是否真的有效。我們使用判定係數 (Coefficient of Determination),即 \( R^2 \)。

\( R^2 = \frac{SSR}{SST} \)

  • SST (總平方和 - Total Sum of Squares): 數據的總變異。
  • SSR (回歸平方和 - Regression Sum of Squares): 由模型所解釋的變異。
  • SSE (殘差平方和 - Error Sum of Squares): 模型無法解釋的變異(即「剩餘部分」)。

解讀: \( R^2 \) 永遠介於 0 和 1 之間。
- \( R^2 = 1 \):完美擬合(所有點都在直線上)。
- \( R^2 = 0 \):模型無法解釋任何變異。

重點總結: \( R^2 = 0.85 \) 意味著 \( Y \) 的變異中有 85% 是由與 \( x \) 的關係所解釋的,其餘 15% 則是隨機噪音或其他因素。

5. 統計推論:斜率是否顯著?

在 CS1 考試中,你經常會被問到:「兩者之間是真的有關聯,還是純屬巧合?」

我們透過針對斜率 \( \beta \) 的假設檢定 (Hypothesis Test) 來進行驗證。

  • 虛無假設 (\( H_0 \)): \( \beta = 0 \)(沒有關聯)。
  • 對立假設 (\( H_1 \)): \( \beta \neq 0 \)(存在關聯)。

我們使用 t-檢定 (t-test),因為我們通常不知道真實的方差(\( \sigma^2 \)),必須從數據中進行估計。

檢定統計量:
\( t = \frac{\hat{\beta} - 0}{SE(\hat{\beta})} \)
其中 \( SE(\hat{\beta}) \) 是斜率的標準誤差。我們將此數值與自由度為 \( n - 2 \) 的 t-分佈進行比較。

別擔心: 大多數考試題目都會給你標準誤差,或者提供足夠的數據讓你利用 \( \hat{\sigma}^2 = \frac{SSE}{n-2} \) 算出來。

6. 進行預測

對於精算師而言,回歸的最終目的是預測。預測主要分為兩類:

  1. 預測平均回應值 (Mean Response): 預測給定 \( x \) 時的平均 \( Y \)。(例如:「所有 30 歲人士的平均索償額是多少?」)
  2. 預測個別值 (Individual Value): 預測單一個案的具體 \( Y \)。(例如:「John 這位 30 歲人士的具體索償額是多少?」)

重要提示: 針對個人(如 John)進行預測的不確定性總是更高。因此,預測區間 (Prediction Interval)(針對個人)總是比置信區間 (Confidence Interval)(針對平均值)來得寬。

總結與成功小貼士

重點回顧:

  • 模型為 \( Y = \alpha + \beta x + \epsilon \)。
  • 使用 OLS 透過最小化誤差平方和來求出 \( \hat{\alpha} \) 和 \( \hat{\beta} \)。
  • LINE 假設對於模型的有效性至關重要。
  • \( R^2 \) 告訴你模型能解釋變異的百分比。
  • 使用 t-檢定 來檢查斜率是否顯著不為零。

考試小貼士: 在計算 \( S_{xx} \) 和 \( S_{xy} \) 時,請保留計算過程中的小數點!過早四捨五入可能會導致最終答案出現顯著誤差,這可能會讓你失去 CS1 的寶貴分數。

你做得到的!回歸看起來或許充滿了複雜的公式,但它本質上就是一門在數據雲中畫出最佳直線的科學。持續練習計算,邏輯自然會變得清晰!