簡介:關聯與結論

歡迎來到統計學 A Level 中最實用的章節之一!在本指南中,我們將深入探討相關性與線性回歸 (Correlation and Linear Regression)。雖然你可能以前見過散點圖,但對於試卷 2:統計推論 (Statistical Inference),我們將重點關注如何利用樣本數據對整體總體 (population) 做出概括性的推論。

我們將學習如何衡量關係的強度,更重要的是,如何測試這種關係是「真實存在」的,還是僅由隨機誤差造成的。如果這些符號起初看起來有點陌生,不用擔心——我們會一起拆解它們!

1. 衡量關係:皮爾遜 (Pearson) 與 斯皮爾曼 (Spearman)

在測試關係之前,我們必須先衡量它。在 Edexcel 教學大綱中,我們主要使用兩種方法。

皮爾遜積差相關係數 (Pearson’s Product Moment Correlation Coefficient, PMCC)

用字母 \(r\) 表示(針對樣本),這衡量了兩個變量之間線性(直線)關係的強度。
關於 \(r\) 的關鍵事實:
- 它總是介於 -1+1 之間。
- +1 表示完美的正線性關係。
- -1 表示完美的負線性關係。
- 0 表示完全沒有線性相關性。

斯皮爾曼等級相關係數 (Spearman’s Rank Correlation Coefficient)

\(r_s\) 表示,當我們處理等級(例如比賽名次)或關係呈現「曲線」而非直線時,就會用到它。
- 類比: 想像一場賽跑。皮爾遜關心的是選手之間準確的秒數差距,而斯皮爾曼只關心誰得了第 1、第 2 和第 3 名。

我應該用哪一個?(教學大綱 7.3)

選擇正確的工具對考試至關重要:
- 如果數據看起來像一條直線,並且你可以假設總體遵循雙變量正態分佈 (bivariate normal distribution)(這是一種比較高級的說法,意指數據在 3D 鐘形曲線中聚集),則使用皮爾遜相關係數
- 如果數據是非線性的但仍然朝同一個方向變動,或者數據已經是等級資料,則使用斯皮爾曼相關係數。它對數據的分佈不需要任何假設

小貼士: 你應學會使用計算機來計算這些數值。請練習你所使用的型號上的「Stat」模式,直到操作變得像反射動作一樣自然!

重點總結: 皮爾遜 = 直線與正態分佈。斯皮爾曼 = 等級與「曲線」趨勢。

2. 顯著性檢定 (試卷 2 的核心)

這是本章「推論」的部分。僅僅因為你的樣本相關係數為 \(r = 0.4\),並不代表整個總體都存在相關性。這可能只是偶然!我們使用假設檢定 (Hypothesis Testing) 來找出答案。

第一步:設定假設

我們使用希臘字母 \(\rho\)(讀作 'rho')來代表總體中的相關性。
- \(H_0: \rho = 0\) (虛無假設:總體中沒有相關性)。
- \(H_1: \rho \neq 0\) (雙尾檢定:存在某種相關性)。
- \(H_1: \rho > 0\)\(H_1: \rho < 0\) (單尾檢定:存在特定的正相關或負相關)。

第二步:使用統計表 (教學大綱 7.2)

在考試中,你會得到一張臨界值 (Critical Values) 表。
1. 找到對應你的顯著水準 (Significance Level)(通常為 5% 或 1%)的正確列。
2. 找到對應你的樣本大小 \(n\) 的行。
3. 這個數值就是你的「門檻」。

第三步:做出決定

- 如果你計算出的 \(r\) 大於臨界值,則結果是顯著的。你拒絕 \(H_0\)。這表明存在相關性的證據!
- 如果數值較小,你無法拒絕 \(H_0\)。這種相關性可能只是因為運氣好(隨機誤差)。

重要假設: 進行皮爾遜相關係數檢定時,你必須假設總體具有雙變量正態分佈。如果題目問「你做了什麼假設?」,這通常就是答案!

重點總結: 我們將樣本的 \(r\) 與表中的臨界值進行比較,看看這種關係是「真實的」還是僅僅出於運氣。

3. 線性回歸:「最佳擬合線」

回歸的核心在於預測。我們希望找到一條盡可能靠近所有數據點的直線方程。這被稱為最小二乘回歸線 (Least Squares Regression Line)

方程

該直線寫為:\(y = a + bx\)
- \(a\) 是截距(直線與 y 軸相交的位置)。
- \(b\) 是斜率(\(x\) 每增加 1 個單位,\(y\) 的變化量)。
- 例子: 如果「冰淇淋銷量 (\(y\)) 對比 溫度 (\(x\))」的直線為 \(y = 10 + 5x\),這意味著在 0 度時你賣出 10 個冰淇淋,且氣溫每升高 1 度,你就會多賣 5 個。

內插法 (Interpolation) 與 外推法 (Extrapolation)

- 內插法: 預測數據範圍之內的數值。這通常是可靠的。
- 外推法: 預測數據範圍之外的數值(例如,使用 0-20°C 的數據來預測 50°C 時的銷量)。這是危險的,因為趨勢可能不會持續下去!

重點總結: 回歸方程幫助我們預測數值,但在已知數據範圍之外進行預測時要非常小心。

4. 殘差 (Residuals) 與 異常值 (Outliers)

即使是最好的直線也不完美。實際數據點與我們預測直線之間的垂直距離稱為殘差

計算殘差

公式為:殘差 = \(y_i - (a + bx_i)\)
簡單來說:實際值 - 預測值
- 正數殘差意味著實際點在直線上方
- 負數殘差意味著實際點在直線下方

識別異常值

回歸中的異常值是一個具有非常大殘差的點。它是一個「不符合」趨勢的點。透過觀察帶有最佳擬合線的散點圖,你可以輕鬆地發現它們——它們是離直線最遠的點。

重點總結: 殘差告訴我們模型的「誤差」程度。大的殘差指向異常值。

總結檢查清單

快速複習:
- 我會使用計算機計算 \(r\)、\(r_s\)、\(a\) 和 \(b\) 嗎?
- 我知道何時該用皮爾遜(線性/正態)與斯皮爾曼(等級/非線性)嗎?
- 我會使用 \(\rho\) 和統計表進行假設檢定嗎?
- 我能解釋為什麼外推法是有風險的嗎?
- 我記得殘差 = 觀察值 - 預測值嗎?

如果這些步驟看起來很多,請別擔心!統計學就是關於流程的學習。按照「假設檢定」的步驟一步一步來,並讓你的計算機處理繁重的數學計算。你一定可以做到的!