欢迎来到线性回归的世界!
你好!欢迎来到 CS1 课程中最实用且应用最广泛的章节之一。如果你曾好奇保险公司如何根据驾驶者的年龄来决定车保费率,或者经济学家如何预测未来的通货膨胀率,那么你其实就是在思考线性回归(Linear Regression)的课题。
在本章中,我们不只是要观察两者之间是否有关联,而是要建立一个数学模型来描述这种关系。如果你觉得统计学有点深奥,别担心——我们会透过简单的类比和清晰的逻辑,一步步为你拆解。让我们开始吧!
1. 什么是线性回归模型?
简单线性回归的核心,就是在一组数据点中找到一条“最佳拟合(best-fit)”的直线。我们利用一个变量(自变量/解释变量,\( x \))来预测另一个变量(因变量/被解释变量,\( Y \))。
公式
单次观测的标准模型写法如下:
\( Y_i = \alpha + \beta x_i + \epsilon_i \)
让我们拆解其中的要素:
- \( Y_i \)(因变量): 这是我们想要预测的目标(例如:索赔金额)。
- \( x_i \)(自变量/回归量): 这是我们已知的信息(例如:车龄)。
- \( \alpha \)(截距): 当 \( x \) 为零时,\( Y \) 的数值。
- \( \beta \)(斜率): 这告诉我们当 \( x \) 每增加 1 个单位时,\( Y \) 会改变多少。
- \( \epsilon_i \)(误差项): 这是“随机噪音”。在现实世界中,数据点永远无法完美地落在直线上。误差项解释了实际点与直线之间的距离。
类比: 想象你在烘焙蛋糕。蛋糕的高度(\( Y \))取决于你使用的发粉量(\( x \))。截距(\( \alpha \))是面糊膨胀前的高度,斜率(\( \beta \))是每克发粉对高度的影响,而误差(\( \epsilon \))则代表像是烤箱温度略有误差等随机因素。
快速回顾: 回归的目标是估计 \( \alpha \) 和 \( \beta \) 的值,以便我们能做出准确的预测。
2. “必备”假设 (LINE)
为了使线性回归模型有效且具备统计意义,我们需要满足四大假设。你可以透过助记词 LINE 来记忆:
- L - 线性 (Linearity): \( x \) 和 \( Y \) 之间的关系必须是直线。
- I - 独立性 (Independence): 误差项(\( \epsilon_i \))必须相互独立。一个人的索赔不应影响另一个人的索赔。
- N - 常态性 (Normality): 我们假设误差服从常态分布,平均值为零:\( \epsilon_i \sim N(0, \sigma^2) \)。
- E - 等方差性 (Equal Variance / Homoscedasticity): 对于所有 \( x \) 的数值,误差的“离散程度”应保持恒定。
常见错误: 学生经常忘记常态性假设是针对误差项(\( \epsilon \))而言,而非指原始的 \( x \) 或 \( Y \) 数据本身!
3. 估计参数:普通最小二乘法 (OLS)
我们究竟如何找到那条“最佳”直线?我们使用一种称为普通最小二乘法 (Ordinary Least Squares, OLS) 的方法。
“最佳”直线是指能使残差平方和 (Sum of Squared Errors, SSE) 达到最小的直线。我们将误差平方化,是因为我们希望正向和负向的距离被一视同仁,并对大幅偏离的数据点给予更重的惩罚。
魔法公式
透过微积分,我们可以推导出斜率和截距的估计量:
斜率 (\( \hat{\beta} \)):
\( \hat{\beta} = \frac{S_{xy}}{S_{xx}} \)
其中 \( S_{xy} = \sum (x_i - \bar{x})(y_i - \bar{y}) \) 及 \( S_{xx} = \sum (x_i - \bar{x})^2 \)。
截距 (\( \hat{\alpha} \)):
\( \hat{\alpha} = \bar{y} - \hat{\beta}\bar{x} \)
你知道吗? 回归直线总是会通过数据的平均值点 \( (\bar{x}, \bar{y}) \)。如果你算出的直线没有经过数据的平均值,请务必重新检查你的计算!
4. 模型效果如何? (拟合优度)
得到直线后,我们需要判断它是否真的有效。我们使用判定系数 (Coefficient of Determination),即 \( R^2 \)。
\( R^2 = \frac{SSR}{SST} \)
- SST (总平方和 - Total Sum of Squares): 数据的总变异。
- SSR (回归平方和 - Regression Sum of Squares): 由模型所解释的变异。
- SSE (残差平方和 - Error Sum of Squares): 模型无法解释的变异(即“剩余部分”)。
解读: \( R^2 \) 永远介于 0 和 1 之间。
- \( R^2 = 1 \):完美拟合(所有点都在直线上)。
- \( R^2 = 0 \):模型无法解释任何变异。
重点总结: \( R^2 = 0.85 \) 意味着 \( Y \) 的变异中有 85% 是由与 \( x \) 的关系所解释的,其余 15% 则是随机噪音或其他因素。
5. 统计推论:斜率是否显著?
在 CS1 考试中,你经常会被问道:“两者之间是真的有关联,还是纯属巧合?”
我们透过针对斜率 \( \beta \) 的假设检验 (Hypothesis Test) 来进行验证。
- 虚无假设 (\( H_0 \)): \( \beta = 0 \)(没有关联)。
- 对立假设 (\( H_1 \)): \( \beta \neq 0 \)(存在关联)。
我们使用 t-检验 (t-test),因为我们通常不知道真实的方差(\( \sigma^2 \)),必须从数据中进行估计。
检验统计量:
\( t = \frac{\hat{\beta} - 0}{SE(\hat{\beta})} \)
其中 \( SE(\hat{\beta}) \) 是斜率的标准误差。我们将此数值与自由度为 \( n - 2 \) 的 t-分布进行比较。
别担心: 大多数考试题目都会给你标准误差,或者提供足够的数据让你利用 \( \hat{\sigma}^2 = \frac{SSE}{n-2} \) 算出来。
6. 进行预测
对于精算师而言,回归的最终目的是预测。预测主要分为两类:
- 预测平均响应值 (Mean Response): 预测给定 \( x \) 时的平均 \( Y \)。(例如:“所有 30 岁人士的平均索赔额是多少?”)
- 预测个别值 (Individual Value): 预测单一个案的具体 \( Y \)。(例如:“John 这位 30 岁人士的具体索赔额是多少?”)
重要提示: 针对个人(如 John)进行预测的不确定性总是更高。因此,预测区间 (Prediction Interval)(针对个人)总是比置信区间 (Confidence Interval)(针对平均值)来得宽。
总结与成功小贴士
重点回顾:
- 模型为 \( Y = \alpha + \beta x + \epsilon \)。
- 使用 OLS 透过最小化误差平方和来求出 \( \hat{\alpha} \) 和 \( \hat{\beta} \)。
- LINE 假设对于模型的有效性至关重要。
- \( R^2 \) 告诉你模型能解释变异的百分比。
- 使用 t-检验 来检查斜率是否显著不为零。
考试小贴士: 在计算 \( S_{xx} \) 和 \( S_{xy} \) 时,请保留计算过程中的小数点!过早四舍五入可能会导致最终答案出现显著误差,这可能会让你失去 CS1 的宝贵分数。
你做得到的!回归看起来或许充满了复杂的公式,但它本质上就是一门在数据云中画出最佳直线的科学。持续练习计算,逻辑自然会变得清晰!