简介:关联与结论

欢迎来到统计学 A Level 中最实用的章节之一!在本指南中,我们将深入探讨相关性与线性回归 (Correlation and Linear Regression)。虽然你可能以前见过散点图,但对于试卷 2:统计推论 (Statistical Inference),我们将重点关注如何利用样本数据对整体总体 (population) 做出概括性的推论。

我们将学习如何衡量关系的强度,更重要的是,如何测试这种关系是“真实存在”的,还是仅由随机误差造成的。如果这些符号起初看起来有点陌生,不用担心——我们会一起拆解它们!

1. 衡量关系:皮尔逊 (Pearson) 与 斯皮尔曼 (Spearman)

在测试关系之前,我们必须先衡量它。在 Edexcel 教学大纲中,我们主要使用两种方法。

皮尔逊积差相关系数 (Pearson’s Product Moment Correlation Coefficient, PMCC)

用字母 \(r\) 表示(针对样本),这衡量了两个变量之间线性(直线)关系的强度。
关于 \(r\) 的关键事实:
- 它总是介于 -1+1 之间。
- +1 表示完美的正线性关系。
- -1 表示完美的负线性关系。
- 0 表示完全没有线性相关性。

斯皮尔曼等级相关系数 (Spearman’s Rank Correlation Coefficient)

\(r_s\) 表示,当我们处理等级(例如比赛名次)或关系呈现“曲线”而非直线时,就会用到它。
- 类比: 想象一场赛跑。皮尔逊关心的是选手之间准确的秒数差距,而斯皮尔曼只关心谁得了第 1、第 2 和第 3 名。

我应该用哪一个?(教学大纲 7.3)

选择正确的工具对考试至关重要:
- 如果数据看起来像一条直线,并且你可以假设总体遵循双变量正态分布 (bivariate normal distribution)(这是一种比较高级的说法,意指数据在 3D 钟形曲线中聚集),则使用皮尔逊相关系数
- 如果数据是非线性的但仍然朝同一个方向变动,或者数据已经是等级资料,则使用斯皮尔曼相关系数。它对数据的分布不需要任何假设

小贴士: 你应学会使用计算器来计算这些数值。请练习你所使用的型号上的“Stat”模式,直到操作变得像反射动作一样自然!

重点总结: 皮尔逊 = 直线与正态分布。斯皮尔曼 = 等级与“曲线”趋势。

2. 显著性检验 (试卷 2 的核心)

这是本章“推论”的部分。仅仅因为你的样本相关系数为 \(r = 0.4\),并不代表整个总体都存在相关性。这可能只是偶然!我们使用假设检验 (Hypothesis Testing) 来找出答案。

第一步:设定假设

我们使用希腊字母 \(\rho\)(读作 'rho')来代表总体中的相关性。
- \(H_0: \rho = 0\) (零假设:总体中没有相关性)。
- \(H_1: \rho \neq 0\) (双尾检验:存在某种相关性)。
- \(H_1: \rho > 0\)\(H_1: \rho < 0\) (单尾检验:存在特定的正相关或负相关)。

第二步:使用统计表 (教学大纲 7.2)

在考试中,你会得到一张临界值 (Critical Values) 表。
1. 找到对应你的显著性水平 (Significance Level)(通常为 5% 或 1%)的正确列。
2. 找到对应你的样本大小 \(n\) 的行。
3. 这个数值就是你的“门槛”。

第三步:做出决定

- 如果你计算出的 \(r\) 大于临界值,则结果是显著的。你拒绝 \(H_0\)。这表明存在相关性的证据!
- 如果数值较小,你无法拒绝 \(H_0\)。这种相关性可能只是因为运气好(随机误差)。

重要假设: 进行皮尔逊相关系数检验时,你必须假设总体具有双变量正态分布。如果题目问“你做了什么假设?”,这通常就是答案!

重点总结: 我们将样本的 \(r\) 与表中的临界值进行比较,看看这种关系是“真实的”还是仅仅出于运气。

3. 线性回归:“最佳拟合线”

回归的核心在于预测。我们希望找到一条尽可能靠近所有数据点的直线方程。这被称为最小二乘回归线 (Least Squares Regression Line)

方程

该直线写为:\(y = a + bx\)
- \(a\) 是截距(直线与 y 轴相交的位置)。
- \(b\) 是斜率(\(x\) 每增加 1 个单位,\(y\) 的变化量)。
- 例子: 如果“冰淇淋销量 (\(y\)) 对比 温度 (\(x\))”的直线为 \(y = 10 + 5x\),这意味着在 0 度时你卖出 10 个冰淇淋,且气温每升高 1 度,你就会多卖 5 个。

内插法 (Interpolation) 与 外推法 (Extrapolation)

- 内插法: 预测数据范围之内的数值。这通常是可靠的。
- 外推法: 预测数据范围之外的数值(例如,使用 0-20°C 的数据来预测 50°C 时的销量)。这是危险的,因为趋势可能不会持续下去!

重点总结: 回归方程帮助我们预测数值,但在已知数据范围之外进行预测时要非常小心。

4. 残差 (Residuals) 与 异常值 (Outliers)

即使是最好的直线也不完美。实际数据点与我们预测直线之间的垂直距离称为残差

计算残差

公式为:残差 = \(y_i - (a + bx_i)\)
简单来说:实际值 - 预测值
- 正数残差意味着实际点在直线上方
- 负数残差意味着实际点在直线下方

识别异常值

回归中的异常值是一个具有非常大残差的点。它是一个“不符合”趋势的点。通过观察带有最佳拟合线的散点图,你可以轻松地发现它们——它们是离直线最远的点。

重点总结: 残差告诉我们模型的“误差”程度。大的残差指向异常值。

总结检查清单

快速复习:
- 我会使用计算器计算 \(r\)、\(r_s\)、\(a\) 和 \(b\) 吗?
- 我知道何时该用皮尔逊(线性/正态)与斯皮尔曼(等级/非线性)吗?
- 我会使用 \(\rho\) 和统计表进行假设检验吗?
- 我能解释为什么外推法是有风险的吗?
- 我记得残差 = 观察值 - 预测值吗?

如果这些步骤看起来很多,请别担心!统计学就是关于流程的学习。按照“假设检验”的步骤一步一步来,并让你的计算器处理繁重的数学计算。你一定可以做到的!