導論:超越「最佳擬合」線

在上一章中,我們學習了如何使用最小二乘估計 (Least Squares Estimation) 在散點圖上畫出一條「最佳擬合」線。但作為精算師,我們不能只畫條線就指望萬事大吉!我們需要知道:這種關係到底是真實存在的,還純屬巧合?我們的模型對數據的擬合程度究竟如何?如果我們用這個模型來預測未來,其可信度有多高?

在本章中,我們將從單純的「畫線」跨越到統計推論 (Statistical Inference)。我們將學習如何檢定結果,並為預測值加上「誤差條」。如果公式起初看起來有點嚇人,請不要擔心——我們會一步步將它們拆解!


1. 斜率參數 (\(\beta\)) 的統計推論

斜率 (\(\beta\)) 是我們回歸模型的核心。它告訴我們:解釋變數 (Explanatory Variable) (\(X\)) 每增加一個單位,回應變數 (Response Variable) (\(Y\)) 會隨之改變多少。

斜率是否顯著?

在精算工作中,我們經常檢定原假設 (Null Hypothesis) \(H_0: \beta = 0\)。如果斜率為零,則意味著解釋變數對回應變數沒有影響。如果我們「拒絕原假設」,即表示有統計證據顯示兩者之間存在關係。

斜率的標準誤差

要檢定斜率,我們首先需要知道它的標準誤差 (Standard Error),記作 \(se(\hat{\beta})\)。這衡量了如果我們抽取許多不同的樣本,估計值 \(\hat{\beta}\) 會產生多大的波動。

\(se(\hat{\beta}) = \sqrt{\frac{\hat{\sigma}^2}{S_{xx}}}\)

其中:

  • \(\hat{\sigma}^2\) 是估計的殘差方差(通常稱為殘差均方 Residual Mean Square)。
  • \(S_{xx}\) 是 \(x\) 值的平方和,計算公式為 \(\sum (x_i - \bar{x})^2\)。

斜率的 t 檢定

由於我們必須估計方差 \(\sigma^2\),因此我們使用 t 分佈 而非正態分佈。檢定統計量為:

\(t = \frac{\hat{\beta} - \text{假設值}}{se(\hat{\beta})}\)

對於標準的顯著性檢定 (\(H_0: \beta = 0\)),公式簡化為 \(t = \frac{\hat{\beta}}{se(\hat{\beta})}\)。我們將此結果與自由度為 \(n - 2\) 的 t 分佈進行比較。

小貼士:如果你的 \(t\) 統計量的絕對值很大(對於大多數樣本量來說通常大於 2),則 p 值會很小,斜率很可能是顯著的!


2. 擬合優度的衡量指標

即使斜率是顯著的,模型仍可能表現不佳。擬合優度 (Goodness of Fit) 告訴我們模型實際上解釋了多少數據背後的「故事」。

決定係數 (\(R^2\))

最常用的衡量指標是 \(R^2\)。它代表了回應變數的總變異中,能被回歸模型解釋的比例。

\(R^2 = \frac{SSR}{SST} = 1 - \frac{SSE}{SST}\)

其中:

  • SST (總平方和 Total Sum of Squares): 數據中的總變異。
  • SSR (回歸平方和 Regression Sum of Squares): 由我們的擬合線所解釋的變異。
  • SSE (誤差平方和 Error Sum of Squares): 擬合線未能解釋的變異(即殘差)。

解讀 \(R^2\):

  • \(R^2 = 1\):完美擬合!所有數據點都準確地落在直線上。
  • \(R^2 = 0\):模型毫無解釋力;解釋變數毫無用處。
  • 精算筆記: 在社會科學或複雜的保險理賠數據中,即使 \(R^2\) 只有 0.2 或 0.3 也可以被視為有用;而在物理科學中,我們通常追求 0.9 以上。

你知道嗎? 在簡單線性回歸(一個 \(X\) 和一個 \(Y\))中,\(R^2\) 正好是 Pearson 相關係數 (\(r\)) 的平方。所以如果 \(r = 0.7\),那麼 \(R^2 = 0.49\)。


3. 預測區間:平均值 vs. 個別值

一旦我們得到了擬合模型 \(\hat{y} = \hat{\alpha} + \hat{\beta}x\),我們就可以用它來預測未來的值。然而,預測分為兩種不同的類型,辨別它們的區別至關重要!

A. 平均回應的置信區間 (Confidence Interval for the Mean Response)

當我們想估計特定 \(x_0\) 值下的平均 \(Y\) 值時,使用此區間。例如:「所有 40 歲保單持有人的平均理賠金額是多少?」

因為我們平均掉了個體的隨機性,所以不確定性較小。

B. 個別回應的預測區間 (Prediction Interval for an Individual Response)

當我們想預測單個新觀測值的 \(Y\) 值時,使用此區間。例如:「那位 40 歲的史密斯先生,他個人的理賠金額是多少?」

金科玉律:個別值的預測區間永遠比平均值的置信區間更寬。為什麼?因為個體預測包含了「平均值」的所有不確定性,加上其自身的隨機波動 (\(\epsilon\))。

「額外加 1」的小竅門:
平均回應的方差包含類似 \([ \dots ]\) 的項。
個別回應的方差則包含 \([ 1 + \dots ]\) 的項。
那個額外的「1」就代表了單個觀測值固有的方差 (\(\sigma^2\))。


4. 使用軟件 (R) 與解讀輸出結果

在 Paper B 中,你不需要手算這些指標,而是使用 R。你需要具備閱讀線性模型 (lm) 的 summary() 輸出結果的能力。

R 輸出結果中的關鍵項:

  • Coefficients 表格: 查看 Estimate 欄位獲取 \(\hat{\beta}\),查看 Pr(>|t|) 欄位獲取 p 值。
  • Residual standard error: 這就是你的 \(\hat{\sigma}\)。
  • Multiple R-squared: 這就是你的 \(R^2\) 值。

預測的範例指令:
predict(model, newdata, interval = "confidence") — 用於平均值。
predict(model, newdata, interval = "prediction") — 用於個別值。


快速複習:應避免的常見錯誤

  • 混淆 \(R^2\) 與相關性: 請記住 \(R^2\) 不會告訴你關係的方向(正相關或負相關),只會告訴你強度。而相關係數 (\(r\)) 則兩者都會告訴你。
  • 自由度: 在簡單線性回歸中,進行 t 檢定和計算區間時,始終使用 \(n - 2\) 個自由度。這個「2」代表了我們估計的兩個參數 (\(\alpha\) 和 \(\beta\))。
  • 外推法 (Extrapolation): 使用模型預測遠遠超出原始數據範圍的 \(x\) 值時要非常小心。在那些區域,「擬合優度」可能不再成立!

重點總結: 統計推論讓我們能量化不確定性。我們使用 t 檢定 來檢查斜率,使用 \(R^2\) 來檢查模型擬合度,並使用預測區間在考慮隨機性的情況下預測未來值。