簡介:統計學的基礎

歡迎踏出統計學之旅的第一步!在我們開始計算平均值或繪製漂亮的圖表之前,必須先蒐集資料。你可以將資料蒐集想像成烹飪:如果你一開始用的食材品質很差,無論食譜多好,最後做出來的餐點也不會美味。在本章中,你將學會如何規劃調查、識別不同類型的「食材」(即資料),並選擇最公正的方式來蒐集它們。如果起初覺得術語很多,請不用擔心;只要你了解它們在現實生活中的應用,學起來就會容易得多!


1. 規劃調查

每一項統計調查都始於一個稱為假設(Hypothesis)的想法。這是一個你可以透過測試來驗證真偽的陳述。

例子:「吃早餐的學生比不吃早餐的學生在考試中獲得更高的分數。」

限制因素與風險

在現實世界中,你很難做到完美的實驗。你會面臨各種限制因素(Constraints)

  • 時間: 你可能只有一週的時間來完成。
  • 成本: 印製 1,000 份問卷需要費用。
  • 倫理: 你必須將資料保密(Confidential),並確保參與者不會受到傷害。
  • 便利性: 詢問你的朋友很方便,但這樣做公平嗎?

緩解策略

「緩解」的意思是設法減輕問題的嚴重性。如果你擔心人們不會回覆你的問卷(即不回覆,non-response),你可以提供小獎勵或將問卷簡化。如果你無法找到整個城鎮的所有名單,你可以將目標總體(Target population)縮小到僅限一所學校。

重點複習: 一個好的計劃會在開始之前就考慮到可能會出錯的地方!


2. 資料類型

資料有很多種「口味」。為資料使用正確的稱呼,有助於你決定稍後使用哪種圖表或計算方式。

定性資料與定量資料

  • 定性資料(類別資料,Qualitative/Categorical): 用文字來描述。例子:眼睛顏色、汽車品牌。
  • 定量資料(數值資料,Quantitative/Numerical): 用數字來描述。例子:身高、溫度。

離散資料與連續資料

這是最容易混淆的地方!這裡有一個簡單的判斷技巧:

  • 離散(Discrete): 你能數出來的東西。它只能是特定的數值(例如鞋號 5 號或 5.5 號,但不會是 5.23 號)。
  • 連續(Continuous): 你能測量出來的東西。它可以是刻度上的任何數值。例子:時間(10.2 秒)、重量(65.43公斤)。

高階重點:雙變量與多變量資料

  • 雙變量資料(Bivariate Data): 涉及兩個變量,用以觀察彼此是否相關。例子:比較學習時數與考試成績。
  • 多變量資料(Multivariate Data): 涉及三個或以上的變量。例子:根據房屋大小、地點和屋齡來比較房價。

解釋變量與響應變量

當你在探討兩者之間的聯繫時:

  • 解釋變量(自變量,Explanatory/Independent variable): 你認為導致變化的原因。這會放在 x 軸上。
  • 響應變量(因變量,Response/Dependent variable): 你所測量的結果。這會放在 y 軸上。

重點歸納: 在開始分析之前,請務必先確認你的資料是測量出來的(連續)還是數出來的(離散)!


3. 總體與抽樣

總體(Population)是指你感興趣的整個群體(例如:英國所有的青少年)。樣本(Sample)則是你們實際進行調查的小組。

抽樣框

抽樣框(Sampling frame)是指你從中選擇樣本的實際人員或項目名單。例子:如果你的總體是「全校學生」,那麼你的抽樣框就是學校的學生登記冊。

高階:分層抽樣(Stratified Sampling)

有時總體中會有明顯的群體(分層,Strata),例如不同的年級或性別。為了公平起見,你的樣本應該按比例反映這些群體。

公式:
\( \text{該層抽樣數量} = \frac{\text{該層的人數}}{\text{總體總人數}} \times \text{總樣本大小} \)

例子:如果學校有 200 名男生和 300 名女生(總共 500 人),而你想要抽取 50 名學生作為樣本:
\( \text{男生樣本數} = \frac{200}{500} \times 50 = 20 \)

其他抽樣方法

  • 簡單隨機抽樣: 就像從帽子裡抽出名字一樣。每個人被選中的機率均等。
  • 系統抽樣: 每隔 \( n \) 個人抽取一人(例如名單上每 10 個人選 1 個)。
  • 配額抽樣: 你持續詢問,直到填滿你的「配額」(例如:「我需要 10 名男性和 10 名女性」)。
  • 機會/便利抽樣: 詢問當下隨手可得的人。這通常具有偏差(Biased)

你知道嗎? 當你從整個總體收集資料時,稱為普查(Census)。它的準確度很高,但非常昂貴且耗時!


4. 資料蒐集與避免偏差

偏差(Bias)是統計學的大敵。當資料因蒐集方式不當而無法反映真實情況時,就會產生偏差。

信度與效度

  • 信度(Reliability): 如果你再次進行測試,是否會得到相同的結果?(穩定性)。
  • 效度(Validity): 測試是否真的測量了它原本應該測量的東西?(準確性)。

高階重點:敏感資料與對照組

在詢問敏感問題(例如:「你有沒有觸犯過法律?」)時,人們往往會說謊。為了修正這一點,我們使用隨機回答技術(Random Response Technique)。這涉及參與者秘密地擲硬幣或擲骰子,來決定是如實回答還是直接回答「是」。這保護了參與者的隱私(Confidentiality),同時允許研究人員利用機率計算出整體的百分比。

對照組與配對樣本

在實驗中,我們使用對照組(Control group)。這一組不接受「處理」(例如新藥),讓我們能將結果與實驗組(Experimental group)進行比較。

為了使實驗更完善,我們使用配對樣本(Matched pairs)。我們找出兩個非常相似的人(年齡、體能、健康狀況相同),並將他們分別放入不同的組別。這有助於控制外來變量(Extraneous variables)(可能會干擾結果的外部因素)。

資料清理

在使用資料之前,你必須先進行「清理」。這包括:

  • 移除離群值(Outliers)(明顯錯誤或極端不同的數值)。
  • 修復格式(例如:將「10 分鐘」和「10m」統一改為「10」)。
  • 處理缺失的資料或未完成的回覆。

重點複習: 在正式調查之前,一定要先進行試點調查(Pilot surveys,小型試行),以便在正式開始前發現並修正令人困惑的問題!


總結檢查清單

- 你能定義什麼是假設嗎?
- 你知道離散資料與連續資料的區別嗎?
- 你會計算分層抽樣的樣本大小嗎?
- 你了解為什麼對照組和配對樣本能使實驗更公平嗎?
- 你能解釋隨機回答技術如何保護隱私嗎?