歡迎來到獨立性參數檢定與無參數檢定(Parametric and Non-Parametric Tests of Independence)的世界!

在你的 CFA 學習之旅中,你已經學過如何描述數據,並針對單一平均數或變異數進行假設檢定。但在真實的金融世界裡,我們很少只單獨看一件事。我們通常想了解的是:股票的表現是否與其所屬行業有關?執行長的學歷會影響公司回報嗎?

在本章中,我們將探討如何檢定兩個變數是獨立的(代表兩者沒有關係)還是相關的(代表兩者有關聯)。我們將探討兩個主要工具:卡方檢定(Chi-Square Test)斯皮爾曼等級相關係數(Spearman’s Rank Correlation)。不用擔心這些名字聽起來很複雜——我們會一步步拆解它們!

快速回顧:「獨立」是什麼意思?
如果兩個事件是獨立的,那麼其中一個事件的發生對於另一個事件的機率不會提供任何資訊。例如,擲硬幣的結果與倫敦的天氣是獨立的。然而,利率與債券價格則是相關的(dependent)


1. 參數檢定與無參數檢定:宏觀概覽

在深入研究具體的檢定方法之前,我們需要先了解統計檢定的這兩個「家族」。

參數檢定(Parametric Tests)

這類檢定對基礎數據有嚴格的假設。通常,它們假設數據遵循某種特定分佈(如常態分佈),並使用諸如平均數(mean)變異數(variance)等參數。想像一下,這就像一個嚴格的烘焙食譜——如果你的材料不夠精準,蛋糕就不會發起來。

無參數檢定(Non-Parametric Tests)

這些檢定更具彈性。它們不要求數據必須呈常態分佈。通常在我們有小樣本量異常值(outliers),或是處理的是等級數據(ranked data)(例如「第一名、第二名」)而非精確數值時使用。把它們想像成「Taco 自助餐」——你可以隨意替換配料,餐點依然美味!

關鍵要點:當我們的數據比較「混亂」或不符合參數檢定的嚴格要求時,我們就會使用無參數檢定。


2. 卡方(\(\chi^2\))獨立性檢定

當我們有類別數據(categorical data)時,我們會使用卡方檢定。這意味著數據是被分類到不同的組別或「桶子」中,而不是連續的數值。例如,將公司按產業(科技、能源、金融)和股利政策(發放股利、不發放股利)進行分類。

列聯表(Contingency Tables)

為了執行此檢定,我們使用列聯表(也稱為交叉表)。它能同時展示兩個類別變數的計數(頻率)。

假設(Hypothesis)

虛無假設(\(H_0\)):兩個變數是獨立的(沒有關係)。
對立假設(\(H_a\)):兩個變數是相關的(存在關係)。

計算檢定統計量

卡方統計量衡量的是我們實際觀察到的數據 (\(O\)) 與如果變數完全獨立時我們預期會看到 (\(E\)) 的數據之間的差異。

公式為:
\( \chi^2 = \sum \frac{(O - E)^2}{E} \)

逐步流程:
1. 計算期望值 (\(E\)): 對表格中的每個格子,使用這個技巧:
\( E = \frac{(\text{列總計} \times \text{行總計})}{\text{總計}} \)
2. 求出差異: 對於每個格子,用實際觀察值減去期望值 (\(O - E\))。
3. 平方並相除: 將差異平方後,除以期望值。
4. 加總: 將所有格子的計算值加在一起,即可得到你的 \(\chi^2\) 統計量。

自由度(Degrees of Freedom, \(df\))

對於卡方獨立性檢定,自由度的計算方式為:
\( df = (r - 1) \times (c - 1) \)
其中 \(r\) 是列數,\(c\) 是行數。

你知道嗎? 卡方分佈總是正值,且向右偏斜。隨著自由度增加,它會看起來越來越像常態分佈!

關鍵要點: 如果計算出的 \(\chi^2\) 遠大於表格中的「臨界值」,我們就會拒絕虛無假設,並推論這些變數之間存在關係。


3. 斯皮爾曼等級相關係數(Spearman’s Rank Correlation, \(r_s\))

有時候我們想知道關係的強度,但我們的數據是順序型的(ordinal/ranked),或者包含了會破壞標準相關係數計算的極端異常值。這時候就是斯皮爾曼等級相關係數出場的時候了。

類比: 想像兩位評審在選秀節目中給 10 位參賽者排名。即使評審給出的確切分數不同,但如果他們都同意參賽者 A 比參賽者 B 優異,那麼他們的排名就是相關的。

為什麼要用它?

  • 它是皮爾遜(Pearson)相關係數的無參數替代方案。
  • 當數據是非線性但仍遵循某種趨勢(單調)時使用。
  • 它對於異常值具有穩健性(robust),因為它看的是數據的順序,而非實際數值。

計算方式:

1. 將兩個變數的數據分別從小到大(或從大到小)進行排名。
2. 計算每一對排名之間的差異 (\(d_i\))。
3. 使用公式:
\( r_s = 1 - \frac{6 \sum d_i^2}{n(n^2 - 1)} \)

解讀結果:
\(r_s\) 的值永遠介於 -1 到 +1 之間。
- +1: 完美的正等級相關(當一個排名上升,另一個也總是上升)。
- -1: 完美的負等級相關。
- 0: 排名之間沒有關係。

常見錯誤: 別忘了分子裡的「6」!無論你的樣本量是多少,這都是公式中的常數。

關鍵要點: 當你的數據不呈常態分佈,或是處理的是排名而非原始測量數據時,斯皮爾曼等級相關係數是你的首選工具。


4. 何時使用無參數檢定?(快速指南)

在 CFA 考試中,你可能會被要求辨識何時使用無參數檢定比參數檢定更合適。請記住這四種情境:

  1. 數據是類別型的: 當你是在計算「桶子」裡的數量時,使用卡方檢定。
  2. 數據是順序型的(有排名的): 使用斯皮爾曼等級相關係數。
  3. 樣本量小: 當樣本過小,無法假設其為常態分佈時。
  4. 存在極端異常值: 當幾個異常數據點會將平均數或相關係數拉向某一極端時。

如果起初覺得這些很棘手,別擔心! 只要記住:參數檢定 = 精確/嚴格無參數檢定 = 排名/彈性


總結與快速回顧欄

卡方檢定: 使用列聯表檢定兩個類別變數之間的獨立性。使用 \(df = (r-1)(c-1)\)。

斯皮爾曼等級相關: 衡量排名數據之間關係的強度。範圍從 -1 到 +1。

獨立性: 虛無假設通常指出沒有關係。如果我們的檢定統計量很高,我們就「開除」(拒絕)虛無假設!

測試你的理解:
如果你正在比較「分析師評級」(買入/持有/賣出)與「行業」(科技/零售),你會使用哪種檢定?
答案: 卡方獨立性檢定(因為這些都是類別!)。