欢迎来到估计与推论的世界!
在之前的学习中,我们探讨了描述统计学——即总结现有数据的方法。但在真实的金融世界里,我们很少拥有所有的数据。我们不可能预知这世上每一只股票的未来回报,对吧?这就是估计与推论 (Estimation and Inference) 的用武之地。本章旨在学习如何从一大桶数据中汲取一小杯样本 (sample),并以此对整体 (population) 做出聪明的预测。如果一开始觉得有点抽象别担心,我们会把它拆解成小块逐一击破!
1. 基本概念:母体与样本
在深入数学之前,我们需要厘清研究的对象。
母体 (Population):你想了解的整个群体(例如:全球所有上市公司)。
样本 (Sample):该群体中实际测量的一小部分(例如:我们挑选出来研究的 100 家公司)。
母体参数 (Parameter):对母体的描述性测量值(如“真实”平均回报)。
样本统计量 (Statistic):对样本的描述性测量值(如我们那 100 家公司的平均回报)。
小贴士:记住 P 代表 Population/Parameter(母体/参数),而 S 代表 Sample/Statistic(样本/统计量)!
抽样类型
我们如何挑选样本非常重要。如果挑选方式错误,结果就会失真。
- 简单随机抽样 (Simple Random Sampling):母体中每一位成员被选中的概率均等。想象从帽子里抽签。
- 分层随机抽样 (Stratified Random Sampling):我们根据特征(如行业)将母体分为子群组(称为层 (strata)),然后按比例从每一层中抽取样本。类比:如果你在做水果沙拉,你会希望每一匙都能吃到苹果、葡萄和哈密瓜,而不是只吃到满口的葡萄!
- 集群抽样 (Cluster Sampling):我们将母体划分为多个“集群”(如地理区域),然后随机选取整个集群来进行研究。
重点总结:
抽样让我们无需查看每一个数据点就能估计母体特征,从而节省时间和成本。
2. 中央极限定理 (CLT) 的魔力
这可以说是统计学中最核心的概念。中央极限定理 (Central Limit Theorem) 告诉我们一个惊人的事实:只要样本够大(通常 n ≥ 30),样本平均数 (sample means) 的分配就会呈现常态分配(钟形曲线),无论原始母体的分布长什么样子!
为什么这很厉害? 即使原始数据看起来怪异且偏态,这些“样本的平均值”却表现得相当规律。这让我们能利用常态分配的数学原理进行推论。
CLT 的性质:
- 所有样本平均数的期望值等于母体平均数:\( \mu_{\bar{x}} = \mu \)。
- 样本平均数的变异数等于母体变异数除以样本大小:\( \sigma^2_{\bar{x}} = \frac{\sigma^2}{n} \)。
- 样本平均数的标准差称为标准误 (Standard Error)。
标准误 (Standard Error)
样本平均数的标准误衡量样本平均数可能偏离真实母体平均数的程度。
公式:\( \sigma_{\bar{x}} = \frac{\sigma}{\sqrt{n}} \)
如果我们不知道母体标准差 (\( \sigma \)),我们就用样本标准差 (\( s \)) 来代替:
\( s_{\bar{x}} = \frac{s}{\sqrt{n}} \)
你知道吗? 当样本大小 (\( n \)) 越大,标准误就越小。这很有道理:你问的人越多,对平均值的信心就越充足!
3. 点估计与置信区间
当我们进行估计时,有两种方式:
1. 点估计 (Point Estimate):一个单一数值(例如:“我觉得平均回报是 8%”)。虽然简单,但通常很难完全精准。
2. 置信区间 (Confidence Interval):一个数值范围(例如:“我有 95% 的把握回报介于 6% 到 10% 之间”)。
建立置信区间
任何置信区间的通用公式为:
点估计 ± (可靠系数 × 标准误)
可靠系数 (Reliability Factor) 取决于你想要的“置信水平”以及你使用的分配类型(z 或 t)。
常见的 Z 分数 (当母体变异数已知时):
- 90% 置信水平:\( z = 1.645 \)
- 95% 置信水平:\( z = 1.960 \)
- 99% 置信水平:\( z = 2.575 \)
示例:若样本平均数为 10,标准误为 2,我们想要 95% 的置信区间:
\( 10 \pm (1.96 \times 2) = 10 \pm 3.92 \)
区间:[6.08 至 13.92]
重点总结:
置信区间越宽(例如 99% 相对于 95%),你对真实数值落在区间内的信心就越高,但范围的精确度会下降。
4. 如何选择 Z 分配与 T 分配
这是 CFA 考试常见的“陷阱题”!到底该查哪张表:Z 表还是 t 表?
当出现以下情况,请使用 t 分配:
- 母体变异数未知(现实世界中几乎总是如此)。
- 样本数很小 (\( n < 30 \)),但母体呈现常态分配。
当出现以下情况,请使用 Z 分配:
- 母体变异数已知。
- 母体变异数未知但样本数很大 (\( n \ge 30 \))。不过,许多从业者仍倾向使用 t 分配,因为它较为保守。
t 分配看起来像常态分配,但“尾部更厚 (fatter tails)”。这意味着它容许更多极端值的出现,因为我们对估计的把握度较低。随着自由度 (degrees of freedom, \( df = n - 1 \)) 增加,t 分配会变得越来越像 Z 分配。
5. 抽样偏差(那些陷阱!)
即使数学再精确,如果抽样本身有偏差,结果也会是“垃圾进,垃圾出”。以下是需要注意的偏差类型:
1. 生存者偏差 (Survivorship Bias):只看那些至今仍在运营的公司。(忽略了那些倒闭的公司,会让平均表现看起来比实际更好!)
2. 前瞻偏差 (Look-ahead Bias):在研究中使用了投资当时无法获得的信息。
3. 数据挖掘偏差 (Data-mining Bias):通过不断测试不同变量直到凑出想要的结果,导致某个结果仅仅是随机巧合。
4. 时间区段偏差 (Time-period Bias):结果仅适用于特定时间段(例如:只研究 90 年代繁荣期的科技股)。
5. 选择性偏差 (Selection Bias):样本不具随机性(例如:一个“随机”街头访问只找穿西装的人谈话)。
速查小框:
- 标准误: \( s / \sqrt{n} \)
- CLT: 当 \( n \ge 30 \) 时,样本平均数呈现常态分配。
- t 分配: 当 \( \sigma \) 未知时使用;尾部较厚。
- 自由度: \( n - 1 \)。
结语
估计与推论是连接原始数据与实际决策之间的桥梁。别担心公式看起来很繁重,重点在于逻辑:我们抽取样本、计算平均数、针对不确定性进行调整(标准误与可靠系数),并创造出一个我们认为真值存在的区间。你做得很好,继续练习查阅 Z 表吧!