歡迎來到估計與推論的世界!

在之前的學習中,我們探討了描述統計學——即總結現有數據的方法。但在真實的金融世界裡,我們很少擁有所有的數據。我們不可能預知這世上每一隻股票的未來回報,對吧?這就是估計與推論 (Estimation and Inference) 的用武之地。本章旨在學習如何從一大桶數據中汲取一小杯樣本 (sample),並以此對整體 (population) 做出聰明的預測。如果一開始覺得有點抽象別擔心,我們會把它拆解成小塊逐一擊破!

1. 基本概念:母體與樣本

在深入數學之前,我們需要釐清研究的對象。
母體 (Population):你想了解的整個群體(例如:全球所有上市公司)。
樣本 (Sample):該群體中實際測量的一小部分(例如:我們挑選出來研究的 100 家公司)。
母體參數 (Parameter):母體的描述性測量值(如「真實」平均回報)。
樣本統計量 (Statistic):樣本的描述性測量值(如我們那 100 家公司的平均回報)。

小貼士:記住 P 代表 Population/Parameter(母體/參數),而 S 代表 Sample/Statistic(樣本/統計量)!

抽樣類型

我們如何挑選樣本非常重要。如果挑選方式錯誤,結果就會失真。

  • 簡單隨機抽樣 (Simple Random Sampling):母體中每一位成員被選中的機率均等。想像從帽子裡抽籤。
  • 分層隨機抽樣 (Stratified Random Sampling):我們根據特徵(如行業)將母體分為子群組(稱為層 (strata)),然後按比例從每一層中抽取樣本。類比:如果你在做水果沙拉,你會希望每一匙都能吃到蘋果、葡萄和哈密瓜,而不是只吃到滿滿的葡萄!
  • 集群抽樣 (Cluster Sampling):我們將母體劃分為多個「集群」(如地理區域),然後隨機選取整個集群來進行研究。

重點總結:

抽樣讓我們無需查看每一個數據點就能估計母體特徵,從而節省時間和成本。

2. 中央極限定理 (CLT) 的魔力

這可以說是統計學中最核心的概念。中央極限定理 (Central Limit Theorem) 告訴我們一個驚人的事實:只要樣本夠大(通常 n ≥ 30),樣本平均數 (sample means) 的分配就會呈現常態分配(鐘形曲線),無論原始母體的分布長什麼樣子!

為什麼這很厲害? 即使原始數據看起來怪異且偏態,這些「樣本的平均值」卻表現得相當規律。這讓我們能利用常態分配的數學原理進行推論。

CLT 的性質:

  1. 所有樣本平均數的期望值等於母體平均數:\( \mu_{\bar{x}} = \mu \)。
  2. 樣本平均數的變異數等於母體變異數除以樣本大小:\( \sigma^2_{\bar{x}} = \frac{\sigma^2}{n} \)。
  3. 樣本平均數的標準差稱為標準誤 (Standard Error)

標準誤 (Standard Error)

樣本平均數的標準誤衡量樣本平均數可能偏離真實母體平均數的程度。
公式:\( \sigma_{\bar{x}} = \frac{\sigma}{\sqrt{n}} \)
如果我們不知道母體標準差 (\( \sigma \)),我們就用樣本標準差 (\( s \)) 來代替:
\( s_{\bar{x}} = \frac{s}{\sqrt{n}} \)

你知道嗎? 當樣本大小 (\( n \)) 越大,標準誤就越小。這很有道理:你問的人越多,對平均值的信心就越充足!

3. 點估計與信賴區間

當我們進行估計時,有兩種方式:

1. 點估計 (Point Estimate):一個單一數值(例如:「我覺得平均回報是 8%」)。雖然簡單,但通常很難完全精準。
2. 信賴區間 (Confidence Interval):一個數值範圍(例如:「我有 95% 的把握回報介於 6% 到 10% 之間」)。

建立信賴區間

任何信賴區間的通用公式為:
點估計 ± (可靠係數 × 標準誤)

可靠係數 (Reliability Factor) 取決於你想要的「信心水準」以及你使用的分配類型(z 或 t)。

常見的 Z 分數 (當母體變異數已知時):
  • 90% 信心水準:\( z = 1.645 \)
  • 95% 信心水準:\( z = 1.960 \)
  • 99% 信心水準:\( z = 2.575 \)

範例:若樣本平均數為 10,標準誤為 2,我們想要 95% 的信賴區間:
\( 10 \pm (1.96 \times 2) = 10 \pm 3.92 \)
區間:[6.08 至 13.92]

重點總結:

信賴區間越寬(例如 99% 相對於 95%),你對真實數值落在區間內的信心就越高,但範圍的精確度會下降。

4. 如何選擇 Z 分配與 T 分配

這是 CFA 考試常見的「陷阱題」!到底該查哪張表:Z 表還是 t 表

當出現以下情況,請使用 t 分配:

  • 母體變異數未知(現實世界中幾乎總是如此)。
  • 樣本數很小 (\( n < 30 \)),但母體呈現常態分配。

當出現以下情況,請使用 Z 分配:

  • 母體變異數已知
  • 母體變異數未知但樣本數很大 (\( n \ge 30 \))。不過,許多從業者仍傾向使用 t 分配,因為它較為保守。

t 分配看起來像常態分配,但「尾部更厚 (fatter tails)」。這意味著它容許更多極端值的出現,因為我們對估計的把握度較低。隨著自由度 (degrees of freedom, \( df = n - 1 \)) 增加,t 分配會變得越來越像 Z 分配。

5. 抽樣偏差(那些陷阱!)

即使數學再精確,如果抽樣本身有偏差,結果也會是「垃圾進,垃圾出」。以下是需要注意的偏差類型:

1. 生存者偏差 (Survivorship Bias):只看那些至今仍在營運的公司。(忽略了那些倒閉的公司,會讓平均表現看起來比實際更好!)
2. 前瞻偏差 (Look-ahead Bias):在研究中使用了投資當時無法獲得的資訊。
3. 資料挖掘偏差 (Data-mining Bias):通過不斷測試不同變數直到湊出想要的結果,導致某個結果僅僅是隨機巧合。
4. 時間區段偏差 (Time-period Bias):結果僅適用於特定時間段(例如:只研究 90 年代繁榮期的科技股)。
5. 選擇性偏差 (Selection Bias):樣本不具隨機性(例如:一個「隨機」街頭訪問只找穿西裝的人談話)。

速查小框:
- 標準誤: \( s / \sqrt{n} \)
- CLT: 當 \( n \ge 30 \) 時,樣本平均數呈現常態分配。
- t 分配: 當 \( \sigma \) 未知時使用;尾部較厚。
- 自由度: \( n - 1 \)。

結語

估計與推論是連接原始數據與實際決策之間的橋樑。別擔心公式看起來很繁重,重點在於邏輯:我們抽取樣本、計算平均數、針對不確定性進行調整(標準誤與可靠係數),並創造出一個我們認為真值存在的區間。你做得很好,繼續練習查閱 Z 表吧!