歡迎來到數據的世界!

你有沒有想過,為甚麼你喜愛的串流影音平台會知道該推薦甚麼節目給你?科學家又是如何判斷一種新藥是否有效呢?這一切都是從數據(Data)開始的。在這一章中,我們將會學習如何收集資料、挑選合適的調查對象,以及怎樣整理這些資料,讓它們變得清晰易明。如果你以為數學只是計算複雜的算式,不用擔心——這部分的數學其實是關於探索和調查我們身邊的世界!

1. 甚麼是數據?

數據其實就是資料的代名詞。在收集數據之前,我們需要先了解自己正在尋找哪種類型的數據。我們可以把數據分為兩大「家族」:

定性數據 vs. 定量數據(Qualitative vs. Quantitative)

定性數據(Qualitative Data): 用來描述「特徵」、「質素」或類別,通常是以文字表示。
例子:你最喜歡的顏色、你家狗狗的品種,或是你居住的地區。

定量數據(Quantitative Data): 這是「數值」數據,與數字及計數有關。
例子:你有多少個兄弟姊妹,或者你的身高。

離散數據 vs. 連續數據(兩種不同的數值數據)

定量數據還可以進一步細分:
1. 離散數據(Discrete Data): 透過點算(數出來)得到的數據。這些通常是整數,因為你不可能有「半個」人!
例子:入球的數目、停車場內的汽車數量。
2. 連續數據(Continuous Data): 透過量度得到的數據。這些數據可以是任何數值,包括小數和分數。
例子:你的身高(\(1.54\) 米)、一個蘋果的重量,或者跑 100 米所需的時間。

記憶小貼士: 記住「得出的用離散(Count for Discrete)」以及「得出的用連續(Measure for Continuous)」。

快速溫習:
- 定性數據: 文字/類別標籤
- 定量數據: 數字
- 離散數據: 點算得出(固定數值/整數)
- 連續數據: 量度得出(任何數值)

2. 我們從哪裏獲取數據?

我們可以從兩個主要來源獲取數據:

第一手數據(Primary Data): 這是由你親自收集的數據,你是第一個使用它的人!
例子:你站在學校門口,親自記錄經過的汽車顏色。

第二手數據(Secondary Data): 這是由其他人收集的數據,你只是直接引用或使用。
例子:在互聯網上查閱天氣統計資料,或者在教科書中使用人口普查數據。

你知不知道? 獲取第二手數據通常快得多,但第一手數據的好處在於你完全清楚它是如何被收集的!

3. 總體與抽樣(Population and Sampling)

想像一下,如果你想知道全英國每一位學生最喜歡的披薩配料。那裏有數以百萬計的學生!要逐一詢問可能要花上幾年時間。這時候我們就需要用到抽樣(Sampling)

總體(Population): 指的是你感興趣的整個群體(例如:全英國的每一位學生)。
樣本(Sample): 這是從總體中選出的較小群體(例如:來自不同學校的 100 位學生)。

生動比喻: 試想像大廚在試湯味時,只需喝一小匙羹。他們不需要喝光整鍋湯才能知道夠不夠鹹!那一匙羹的湯就是樣本,而整鍋湯就是總體

怎樣才算是一個好的樣本?

為了確保結果公正,你的樣本必須具有代表性(Representative)。這意味著它應該像是整個總體的「縮小版」。要做到這一點,最好的方法就是進行隨機抽樣(Random Sampling)

隨機抽樣: 總體中的每一個人都有均等機會被選中。
例子:把所有人的名字放進帽子裏,然後抽出 10 個名字。

提防偏差(Bias)!

當樣本選取不公當時,就會產生偏差(Bias)
例子:如果你想知道全校最受歡迎的運動,但你只訪問了足球隊的成員,你的調查結果就會偏向足球。

重點提示: 較大且隨機選取的樣本,通常比細小或特定挑選的樣本更準確,也較少出現偏差。

4. 設計問卷

問卷是用來收集數據的一系列問題。要收集到優質的數據,問題的設計必須清晰準確!

設計好問題的守則:
1. 用字清晰: 避免使用令人混淆的字眼。
2. 具體明確: 不要問「你常常做運動嗎?」,而應問「你每星期做運動多少小時?」。
3. 避免「誘導性問題」: 不要試圖引導受訪者的答案。(避免問:「難道你不覺得學校的午餐很好吃嗎?」)
4. 提供選項方格: 給受訪者明確的選項,這樣整理數據時就容易得多。

要避免的常見錯誤: 選項重疊!
看看以下關於「你讀過多少本書?」的選項:
選項 1:0 至 5 本
選項 2:5 至 10 本

如果有人剛好讀過 5 本書,他們應該選哪一格?這就是錯誤的設計!選項應該改為「0 至 4 本」和「5 至 9 本」。

5. 整理數據(計數符號與頻數分佈表)

收集好數據後,通常只是一大堆雜亂無章的數字。我們可以使用頻數分佈表(Frequency Tables)把數據整理得井井有條。

計數符號(Tally System)

我們在記錄點算時會使用計數符號(劃線記數)。記得每數到第五個時要劃一條斜線「關上閘門」!
\( \text{I} = 1, \text{ II} = 2, \text{ III} = 3, \text{ IIII} = 4, \text{ IIII (with a cross through)} = 5 \)

組別頻數分佈表(Grouped Frequency Tables)

如果你面對大量不同的數值(例如身高),我們會將它們分成不同的小組,稱為組區間(intervals)
例子:
身高(\(h\))厘米 | 頻數
\( 140 \leq h < 150 \) | 5
\( 150 \leq h < 160 \) | 8
\( 160 \leq h < 170 \) | 3

這些符號代表甚麼?
\( 140 \leq h < 150 \) 表示「任何由 140 厘米起,至小於(但不包括)150 厘米的身高」。這樣可以確保每個量度數值都剛好只屬於一個組別。

快速溫習:
- 使用計數符號(Tallies)可以快速點算。
- 頻數(Frequency)其實就是指「總數」或出現的次數。
- 各組區間(Intervals)之間絕對不能重疊!

總結自我檢測清單

在完成本課前,確保你能回答以下問題:
- 我能否分辨離散數據連續數據
- 我是否明白為甚麼隨機抽樣比單純詢問身邊朋友更好?
- 我能否找出帶有偏差或「誘導性」的問題?
- 我能否正確填寫頻數分佈表

你一定做得到的! 統計學的精髓在於用數據說故事。嘗試在日常生活的新聞或網絡資訊中發掘數據的蹤影,你很快就會成為這方面的專家!