歡迎來到數據處理!
在本章中,我們將學習如何將一堆雜亂無章的數字轉化為清晰的圖表和實用的摘要。請將統計學家想像成一位說故事的人——你的工作是利用數據講述一個每個人都能聽懂的故事。無論是分析樓價、考試成績,還是你心愛球隊的入球數,本章的工具都能助你釐清當中的奧秘!
1. 數據視覺化:圖表與表格
在進行繁複的計算之前,我們通常會先將數據畫成圖表。不同的數據類型需要使用不同的圖表呈現。
表格與點算表
整理數據最簡單的方法是使用頻數表 (frequency table)。我們使用點算表 (tallies)(即每五劃一組的短線)來快速統計項目,以免混亂。當我們想同時比較兩個不同的類別(例如「年級」與「最喜歡的學科」)時,雙向表 (two-way tables) 非常實用。
莖葉圖 (Stem and Leaf Diagrams)
這是一種巧妙的方法,既能顯示每一項數據,又能觀察整體的分佈形態。 重要:莖葉圖必須經過排序(葉子必須由小到大排列),並且必須包含圖例 (key),好讓讀者明白數字的含義。
例如:如果莖是 2,葉是 5,圖例會告訴我們這代表 25、2.5 還是 250。文氏圖與象形圖
文氏圖 (Venn Diagrams) 展示了不同群組之間的重疊情況。象形圖 (Pictograms) 則使用小圖案來代表特定數量的數據。 常見錯誤:在看象形圖時,務必檢查圖例!如果一個圓圈代表 4 個人,那麼半個圓圈就代表 2 個人。不要只會數圖案的數量。
分層設色圖與人口金字塔
- 分層設色圖 (Choropleth Maps):這些地圖透過不同深淺的顏色來顯示統計數據(例如英國地圖中,藍色越深代表降雨量越多)。
- 人口金字塔 (Population Pyramids):兩個背對背的長條圖,分別顯示不同年齡組別的男性和女性人數。它們有助我們判斷該地區人口是「年輕」還是「老齡化」。
快速回顧:每張圖表都需要一個標題、清晰的標籤,如有必要,還需附上圖例!
2. 「平均」的選擇:集中趨勢測度
平均數是一個能代表整組數據的單一數字。你需要掌握以下三種主要類型:
三個「M」
- 眾數 (Mode):出現最多次數的數值。(記憶小技巧:MOde = MOst)。
- 中位數 (Median):數據排序後位處中間的數值。(記憶小技巧:Median 就像公路中間的分隔帶)。
- 平均數 (Mean):最「刻薄」的一個,因為它讓你做最多工作!將所有數值相加,然後除以總數量。
分組數據的平均數
有時候數據是分組的(例如「10 至 20 分鐘」)。我們不知道精確數值,因此會計算平均數的估算值 (estimate of the mean)。 步驟: 1. 找出每組的組中點 (midpoint)(即區間的中間值)。 2. 將組中點乘以該組的頻數 (frequency)。 3. 將這些結果相加。 4. 除以總頻數(數據的總項數)。
我該選擇哪種平均數?
選擇正確的平均數很重要: - 用於非數值數據(如最喜歡的顏色)或你想知道商店中最熱門的商品時,請使用眾數。 - 如果數據中存在「極端值」(異常巨大或微小的數字),請使用中位數,因為它不會受極端值影響。 - 當你想將數據中的每一項都納入計算時,請使用平均數。
關鍵點:如果你將數據集中的每個數值都加上同一個數字,平均數、中位數和眾數都會增加該數值!
3. 數據有多分散?(離差)
兩個班級的平均考試成績可能相同,但一個班級的學生分數可能相近,而另一個班級則有天才也有成績落後的同學。我們使用以下方法來測量這種「分散程度」:
- 全距 (Range): \( \text{最大值} - \text{最小值} \)。雖然簡單,但可能會被一個異常高或低的數字破壞。
- 四分位數 (Quartiles):這些將你的數據分為四個相等的部分。下四分位數 (LQ) 位於數據的 25% 處,上四分位數 (UQ) 位於 75% 處。
- 四分位距 (IQR): \( \text{UQ} - \text{LQ} \)。這顯示了中間 50% 數據的分散程度。它比全距更可靠,因為它忽略了極端值。
箱線圖 (Box Plots)
箱線圖是一種以圖表形式呈現的「五數摘要」。它顯示: 1. 最小值 2. 下四分位數 3. 中位數 4. 上四分位數 5. 最大值
極端值 (Outliers)
極端值是指與其他數據明顯不符的數據點。 例如:如果班上每個人身高都是 1.5 米,而有一個學生是 2.1 米,那麼這個學生就是極端值。 請務必檢查極端值是人為錯誤(如打字錯誤)還是僅僅是一個非常特殊的結果。
4. 偏態:數據歪了嗎?
偏態 (Skewness) 告訴我們數據是呈對稱分佈,還是向某一側「傾斜」。 - 正偏態 (Positive Skew):數據的「尾巴」指向較大的數字。在此情況下,通常 \( \text{平均數} > \text{中位數} > \text{眾數} \)。 - 負偏態 (Negative Skew):「尾巴」指向較小的數字。 - 對稱 (Symmetrical):數據左右兩側看起來像鏡像一樣。
5. 散點圖與相關性
我們使用散點圖 (scatter diagrams) 來觀察兩件事物(雙變量數據)之間是否存在關係(相關性 correlation)。
相關性的類型
- 正相關 (Positive Correlation):一項增加,另一項也增加(例如身高與鞋碼)。
- 負相關 (Negative Correlation):一項增加,另一項則減少(例如車齡與價值)。
- 零相關 (Zero Correlation):完全沒有關係(例如頭髮長度與數學成績)。
最佳擬合線 (Line of Best Fit)
這是一條穿過點群中間的直線。 專家小貼士:要畫出準確的直線,先計算雙平均點 (double mean point) \( (\bar{x}, \bar{y}) \)。這是(所有 x 值的平均數,所有 y 值的平均數)。你的線必須穿過這個點!
相關性與因果關係
你知道嗎?兩件事物相關並不代表其中一項「導致」另一項。 例如:雪糕銷量與鯊魚襲擊次數呈正相關。難道雪糕會導致鯊魚襲擊嗎?當然不是!這兩者增加是因為天氣炎熱,這就是夏天。 這稱為關聯性 (association)。
6. 時間序列與趨勢
時間序列 (time series) 是一個顯示事物隨時間變化的圖表。由於這些圖表可能會非常「跳躍」,我們使用移動平均數 (moving averages) 來平滑數據。
考試時,你可能需要計算 4 點移動平均數。你取前 4 個數值並計算平均值,然後向後移一步,計算下 4 個數值的平均值,以此類推。這有助你觀察趨勢 (trend)(長期的方向),而不受季節性的起伏所干擾。
7. 指數與變化率
指數 (Index numbers) 用於比較相對於「基年」(固定為 100)隨時間變化的數值。 \( \text{指數} = \frac{\text{當前數值}}{\text{基年數值}} \times 100 \)
你還會看到變化率,例如粗出生率 (Crude Birth Rate)。 別擔心:這類複雜的公式通常會在題目中提供給你!你只需要知道如何代入數字即可。
例如:\( \text{粗出生率} = \frac{\text{出生人數}}{\text{總人口}} \times 1000 \)關鍵點:務必仔細閱讀單位!如果公式寫著「每 1000 人」,請確保你的最終答案在該情境下是合理的。
8. 誤導性圖表:別被騙了!
有時圖表會被刻意設計來欺騙你。務必檢查以下幾點: - 不正確的刻度:Y 軸是否從零開始?如果不是(稱為截斷坐標軸 truncated axis),差異看起來會比實際大得多。 - 扭曲的比例:在象形圖或 3D 圖表中,形狀的體積可能會具有誤導性。 - 缺少標籤:如果沒有圖例或單位,該圖表就毫無價值!
快速回顧:統計學就像做偵探。查看數字,查看圖表,然後問自己:「這真的合理嗎?」