歡迎來到進階統計學!
歡迎來到數據的世界!在這個章節中,我們不僅僅是計算簡單的平均數,更要成為「數據偵探」。我們將學習如何觀察龐大數據背後的規律,衡量資訊的「分散程度」,並運用趨勢來預測未來。統計學的應用無處不在——從預測天氣和體育賽事結果,到判斷一種新藥是否有效。讓我們開始吧!
1. 理解離散度(數據有多分散?)
在之前的學習中,你已經認識了平均數 (Mean)、中位數 (Median) 和 眾數 (Mode)。這些數值告訴我們數據的「中心」在哪裡,但中心點並不能說明全部情況。我們還需要知道數據是集中在一起,還是分佈得非常開。
全距 (Range) 與 四分位距 (IQR)
全距 (Range) 是衡量分散程度最簡單的方法:即最大值與最小值之間的差。
例子:在一組分數為 10, 50, 90 的測試中,全距為 \( 90 - 10 = 80 \)。
四分位距 (Interquartile Range, IQR) 更可靠,因為它排除了「異常值」(極高或極低的數值)。要計算它,我們將數據分成四個等分,稱為四分位數 (Quartiles):
- 下四分位數 (\( Q_1 \)): 第 25 百分位數(下半部分的中心)。
- 中位數 (\( Q_2 \)): 第 50 百分位數(整組數據的中心)。
- 上四分位數 (\( Q_3 \)): 第 75 百分位數(上半部分的中心)。
公式: \( IQR = Q_3 - Q_1 \)
標準差 (Standard Deviation)
別被這個名稱嚇到了!標準差 (\( \sigma \)) 其實就是指「每個數值與平均數之間的平均距離」。
- 低標準差代表數據非常接近平均數(較穩定)。
- 高標準差代表數據分佈距離平均數較遠(較不穩定)。
比喻: 想像兩位射箭選手。選手 A 每次都能射中靶心或非常接近靶心;選手 B 有時能射中,但有時會射到靶邊。選手 A 的標準差較低,而選手 B 的標準差較高。
重點小結: 平均數告訴我們平均水平;四分位距和標準差則告訴我們,平均數作為代表性數值有多值得信賴。
2. 累積頻數:計算「累計總數」
累積頻數 (Cumulative Frequency) 就是頻數的累加總和。它能幫助我們快速找到大型數據集的中位數和四分位數。
如何繪製累積頻數曲線:
- 建立表格: 在頻數分佈表中增加一列,並在往下計算時將頻數累加起來。
- 繪圖: 始終將累積頻數繪製在垂直軸 (y軸),將數據值繪製在水平軸 (x軸)。
- 黃金法則: 務必在組距的上限 (upper boundary) 點繪圖。例如,若分組為「10 < x ≤ 20」,請在 20 的位置標點。
- 圖形形狀: 用平滑的 S 形曲線(有時稱為累積頻數曲線或 ogive)連接各點。
如何使用圖表:
若要尋找中位數,請在 y 軸找到一半的位置(總頻數 ÷ 2),向右畫線到曲線上,再垂直向下對應到 x 軸讀取數值。
常見錯誤: 不要從第一組的頻數開始畫!圖表應該從 x 軸的第一組起點開始(此時累積頻數為零)。
重點小結: 累積頻數圖就像一場「登山」,它永遠向上攀升,並能精準顯示 25%、50% 和 75% 的位置。
3. 箱形圖 (Box-and-Whisker Plots)
箱形圖 (Box-and-Whisker Plot) 透過五個關鍵數字(五數概括法, 5-Number Summary)對數據進行視覺化總結:
- 最小值
- 下四分位數 (\( Q_1 \))
- 中位數 (\( Q_2 \))
- 上四分位數 (\( Q_3 \))
- 最大值
「箱子」代表了數據中間的 50%(從 \( Q_1 \) 到 \( Q_3 \))。
「鬍鬚」則延伸至最小值和最大值。
為什麼要使用它?
它是比較兩組數據的絕佳工具。例如,繪製 A 班和 B 班的考試分數,你能一眼看出哪一班的中位數較高,或者哪一班的成績分佈更廣。
你知道嗎? 無論鬍鬚多長,中間的「箱子」永遠包含了一半的數據點!
重點小結: 箱子越窄,數據越一致;箱子越寬,數據差異越大。
4. 雙變量數據:兩者之間的關係
統計學不僅僅是一連串數字。我們通常想知道兩件事是否相關,例如「讀書時間會影響考試成績嗎?」或「冰淇淋銷量會隨著氣溫升高嗎?」。這稱為雙變量數據 (Bivariate Data)。
散佈圖與相關性
當我們將兩個變數繪製在圖表上時,我們會尋找相關性 (Correlation):
- 正相關: 兩者同時增加(例如身高和鞋碼)。點呈現「向上」趨勢。
- 負相關: 一個增加,另一個減少(例如山的高度和氣溫)。點呈現「向下」趨勢。
- 無相關: 點散亂分佈,像灑出的胡椒一樣,兩者之間沒有關係。
相關係數 (\( r \))
科學家和數學家使用 \( r \) 值來衡量關係的強弱:
- \( r = 1 \):完美的正相關(一條完美的直線)。
- \( r = -1 \):完美的負相關。
- \( r = 0 \):完全沒有相關性。
最佳擬合線 (回歸線)
最佳擬合線 (Line of Best Fit) 是穿過散佈圖中點群中間的直線,我們用它來進行預測。
- 內插法 (Interpolation): 預測數據範圍「內」的數值,通常相當可靠。
- 外推法 (Extrapolation): 預測數據範圍「外」的數值(例如預測一個嬰兒 50 歲時的身高)。要小心! 這通常不可靠。
重點小結: 相關性不等於「因果關係」。兩件事同時發生並不代表其中一件事導致了另一件事!
最終總結清單
在完成本章之前,請確保你能:
- 找出 IQR 並理解標準差的含義。
- 繪製累積頻數曲線並利用它找出中位數。
- 建立並比較箱形圖。
- 在散佈圖中識別正相關、負相關和零相關。
- 使用最佳擬合線進行預測(並知道何時會有風險!)。
如果一開始覺得很困難,別擔心! 統計學是一門視覺化的學科。練習繪圖越多,觀察圖形越多,你就會越得心應手。祝你計算順利!