欢迎来到统计推论(Statistical Inference)的世界!

在 CS1 的学习旅程中,你已经认识了各种概率分布。现在,我们将进入一个非常令人兴奋的领域:统计推论。这正是统计学的神奇之处!我们透过少量的数据(样本,sample)来对庞大的群体(总体,population)做出聪明的预测。

试着想像自己是一位厨师。你不需要喝掉整锅汤才能知道是否需要加盐,只要尝一匙搅拌均匀的汤就够了。在这一章中,我们将学习那一“匙”(样本)如何表现,以及它与整“锅”(总体)之间有什么关系。别担心,一开始这听起来可能有点抽象,我们会一步步拆解说明!

1. 什么是随机抽样(Random Sampling)?

为了确保我们那一“匙”汤能代表整锅汤,每一部分的汤都必须有平等的机会被选中。这就是随机抽样的核心。

在精算术语中,若 \(X_1, X_2, ..., X_n\) 为大小为 \(n\) 的随机样本,则必须满足:

  • 每个 \(X_i\) 都来自相同的分布(即同分布,identically distributed)。
  • 单个观测值不会影响其他观测值(即独立,independent)。

你通常会看到这个缩写为 i.i.d.(独立同分布)。如果在考试题目中看到 "i.i.d.",它其实就是“这是一个完美的随机样本”的代号。

2. 统计量(Statistics)与参数(Parameters)

在进一步探讨之前,我们先厘清两个学生常混淆的术语:

  • 参数 (Parameter): 描述整个总体的固定(通常未知)值。例如:总体平均数 (\(\mu\)) 或总体方差 (\(\sigma^2\))。
  • 统计量 (Statistic): 从你的样本计算出来的值。例如:样本平均数 (\(\bar{X}\)) 或样本方差 (\(S^2\))。

小贴士: 记住 P 代表 Population(总体)/ Parameter(参数),而 S 代表 Sample(样本)/ Statistic(统计量)!

什么是抽样分布(Sampling Distribution)?

想像你抽取了 10 个人的样本并计算他们的身高平均值。接着,你又抽取了另一个 10 个人的样本做同样的动作。每一次你都会得到略有不同的平均值。如果你重复这个动作数千次,并将所有这些平均值绘制在图表上,所得的分布就称为该统计量的抽样分布

3. 样本平均数(\(\bar{X}\))的分布

样本平均数是我们最常用的统计量,它的表现取决于它来自的总体。

情况 A:从正态分布(Normal Distribution)中抽样

如果你的总体本身就是正态分布,即 \(X \sim N(\mu, \sigma^2)\),那么样本平均数也会是正态分布!

\(\bar{X} \sim N(\mu, \frac{\sigma^2}{n})\)

重点总结: 样本平均数的平均值与总体平均数 (\(\mu\)) 相同,但其离散程度(方差)较小。样本量 (\(n\)) 越大,你对结果就越有把握,因此方差会随之降低。

情况 B:中心极限定理(Central Limit Theorem, CLT)

如果总体不是正态分布怎么办?(也许它是指数分布或 Gamma 分布)。这就是中心极限定理发挥作用的时候!它指出:如果样本量 \(n\) “足够大”(通常 \(n > 30\)),无论原始分布的形状如何,样本平均数的分布将会趋近于正态分布

\(\bar{X} \approx N(\mu, \frac{\sigma^2}{n})\)

比喻: 想像一群人。个别来看,他们的行为可能千奇百怪(不同的分布),但当你看著人群的“平均”行为时,它往往会遵循一个可预测的钟形曲线模式。

4. 样本方差(\(S^2\))的分布

样本平均数遵循正态分布,但样本方差则走不同的路。当我们从正态总体中抽样时,我们使用卡方分布(Chi-square distribution, \(\chi^2\))来描述方差。

要记住的公式是:

\(\frac{(n-1)S^2}{\sigma^2} \sim \chi^2_{n-1}\)

其中:

  • \(n\) 是样本大小。
  • \(S^2\) 是样本方差。
  • \(\sigma^2\) 是总体方差。
  • \(n-1\) 被称为自由度(degrees of freedom)

常见错误: 学生常忘记使用 \(n-1\) 而错用 \(n\)。在统计学中,我们因为使用了样本平均数来计算方差,所以“损失”了一个自由度。只要记住:方差要用 \(n-1\)!

5. Student's t-分布(t-distribution)

在现实世界中,我们几乎永远不知道真正的总体方差 (\(\sigma^2\))。如果不知道 \(\sigma^2\),我们就必须改用样本方差 (\(S^2\))。当我们这么做时,正态分布就不再完全准确,这时我们改用 t-分布

统计量为:\(T = \frac{\bar{X} - \mu}{S / \sqrt{n}}\)

它遵循 \(t_{n-1}\) 分布(自由度为 \(n-1\) 的 t-分布)。

你知道吗? t-分布看起来与正态分布非常相似,但它的“尾部较厚”(fatter tails)。这是为了考量当我们估计方差时产生的额外不确定性。随著 \(n\) 变得非常大,t-分布最终会趋近于正态分布!

6. 比较两个方差:F-分布(F-distribution)

有时精算师需要比较两个不同群组的波动率(方差)(例如:两个不同地区的理赔金额)。为了做到这一点,我们观察它们样本方差的比率。

如果我们有两个来自正态总体的独立样本,其比率:

\(F = \frac{S_1^2 / \sigma_1^2}{S_2^2 / \sigma_2^2} \sim F_{n_1-1, n_2-1}\)

这遵循 F-分布。它有两组不同的自由度——一组用于分子,另一组用于分母。

快速复习表

这里有一个摘要表帮助你厘清重点:

统计量 分布 何时使用?
样本平均数 (\(\bar{X}\)) 正态分布 (N) 已知 \(\sigma^2\) 或 \(n\) 够大 (CLT)
样本方差 (\(S^2\)) 卡方分布 (\(\chi^2\)) 针对 \(\sigma^2\) 的推论 (正态总体)
使用估计出的 \(S^2\) 的平均数 t-分布 未知 \(\sigma^2\) (正态总体)
两个方差的比率 F-分布 比较两个正态总体

总结与核心要点

  • 随机抽样要求观测值必须是独立且同分布的 (i.i.d.)。
  • 如果总体是正态分布,则样本平均数 (\(\bar{X}\)) 为正态分布;如果 \(n\) 够大,则根据中心极限定理,它也会趋近于正态分布。
  • 平均数的标准误(Standard Error)为 \(\sigma / \sqrt{n}\)。请注意,随著 \(n\) 增加,它会变得更小!
  • 卡方分布是处理样本方差的首选。
  • 当 \(\sigma^2\) 未知且必须使用 \(S^2\) 时,请使用 t-分布
  • 使用 F-分布来比较两个方差。

最后鼓励: 你刚刚掌握了统计推论的语言!在 CS1 课程的其余部分,你将运用这些分布作为工具,来建立置信区间并进行假设检验。持续练习公式,它们很快就会变成你的直觉!