歡迎來到數據的世界!

在本章中,我們要成為「數據偵探」。試想想,Netflix 是如何知道該向你推薦哪些電影,或者運動隊伍是如何決定要買入哪些球員的?他們全都是在使用數據分析 (Data Analysis)!我們將學習如何收集資訊、整理資訊,並找出數字背後所蘊含的「故事」。

如果你以前覺得數學有點「沉悶」,請別擔心——數據其實與我們周遭的現實世界息息相關。讓我們開始探索吧!

1. 數據類型:我們在看些什麼?

在分析數據之前,我們需要知道手頭上的是哪種數據。我們通常將數據分為兩大類:

定性數據 (Qualitative Data):描述「性質」或類別的數據。
例子:你最喜歡的顏色、你的手機品牌,或是你養的狗的品種。你無法對這些進行「數學運算」(你不能把「藍色」+「紅色」加起來)。

定量數據 (Quantitative Data):這與「數量」或數字有關。這才是數學發揮作用的地方!它分為兩種類型:
離散數據 (Discrete Data):你可以數出來的事物。你不可能有半個兄弟姊妹或 2.5 輛車。
連續數據 (Continuous Data):你需要測量出來的事物。例如你的身高、蘋果的重量,或是跑 100 米所需的時間。這些數據可以是任何數值(例如 1.65 米)。

快速複習:

如果你可以數出來(1, 2, 3...),它就是離散數據 (Discrete)。如果你需要用工具(尺、磅秤、秒錶)來測量,它就是連續數據 (Continuous)

2. 數據收集:抽樣 (Sampling)

如果你想知道全世界每個學生最喜歡的食物,你不可能去問每一個人。因此,你需要使用樣本 (Sample)

總體 (Population):你感興趣的整個群體(例如:你學校裡的所有學生)。
樣本 (Sample):你實際訪問的小型群體(例如:你學校裡的 50 名學生)。

抽樣的黃金法則:你的樣本必須是無偏差 (Unbiased) 的。這意味著它必須公平地代表整個群體。如果你只問籃球隊成員最喜歡的運動是什麼,你的數據將會產生偏差 (Biased),因為他們更有可能回答籃球!

重點總結:

一個好的樣本必須是隨機 (random) 的,且足夠大 (large enough),才能準確反映整個總體的情況。

3. 整理數據:頻數分佈表 (Frequency Tables)

原始數據通常雜亂無章。頻數分佈表能幫助我們進行整理。「頻數 (Frequency)」指的就是某件事發生的「次數」。

例子:如果我們問 10 個人他們養了多少隻寵物:0, 1, 1, 2, 0, 1, 3, 1, 0, 2。
我們可以這樣整理:
• 0 隻寵物:3 人
• 1 隻寵物:4 人
• 2 隻寵物:2 人
• 3 隻寵物:1 人

常見錯誤:一定要再三確認你的總頻數加起來等於你訪問的總人數!以上面的例子為例:\( 3 + 4 + 2 + 1 = 10 \)。完美!

4. 集中趨勢:三種「平均值」

當人們提到「平均」時,通常是指算術平均數 (Mean),但其實有三種方法可以找出數據的中心。這裡有一首著名的口訣可以幫助你記憶:

「中位數 (Median) 是中間值,
相加除以個數就是平均數 (Mean)。
眾數 (Mode) 是出現頻率最高者,
全距 (Range) 則是最大與最小的差!」

眾數 (Mode)

眾數是出現最頻繁的數值。
例子:在數列 2, 3, 3, 5, 8 中,眾數是 3
提示:如果沒有重複的數字,則沒有眾數。如果兩個數字重複出現的次數相同,你可能會得到兩個眾數(雙峰分佈)!

中位數 (Median)

中位數是將數據按順序排列後的中間數字
步驟 1:將數字由小到大排列!(這是大多數人最容易忘記的一步)。
步驟 2:找出中間的數。
例子:2, 5, 8, 10, 12。中位數是 8
如果中間有兩個數字怎麼辦?只要找出它們的中間值(相加後除以 2)。

算術平均數 (Mean)

平均數就是大多數人說「平均」時的意思。
步驟 1:將所有數字相加(即總和 (Sum))。
步驟 2:除以數字的個數。
公式:\( \text{Mean} = \frac{\text{Sum of values}}{\text{Number of values}} \)

重點總結:

眾數是最受歡迎的,中位數是在隊伍中間的那一位,而平均數則是將所有數據加總後「公平分配」的結果。

5. 測量離散程度:全距 (Range)

雖然平均值告訴我們中心在哪裡,但全距告訴我們數據有多麼「分散」。
公式:\( \text{Range} = \text{Largest Value} - \text{Smallest Value} \)

例子:如果考試分數是 60, 85, 92 和 100,則全距為 \( 100 - 60 = 40 \)。
全距小意味著數據非常穩定一致。全距大意味著數據變異很大。

6. 數據的可視化

有時候圖表勝過千言萬語!以下是我們在 IB MYP 第三學年展示數據的主要方式:

棒形圖 (Bar Charts) vs. 直方圖 (Histograms)

棒形圖:用於離散數據定性數據。條形之間有空隙。(例如:最喜歡的薄餅配料)。
直方圖:用於連續數據(分組數據)。條形之間是相連的,因為數據是連續的數字流。(例如:學生的身高分組,如 140cm 至 150cm, 150cm 至 160cm 等)。

散點圖 (Scatter Graphs) 與相關性 (Correlation)

我們用它們來觀察兩者之間是否有關聯。我們在 \( (x, y) \) 座標平面上繪製點。
正相關 (Positive Correlation):一項增加,另一項也增加。(例如:氣溫升高,雪糕銷量也增加)。點向右上方趨升
負相關 (Negative Correlation):一項增加,另一項則減少。(例如:玩電子遊戲的時間越多,複習時間就越少)。點向右下方趨降
不相關 (No Correlation):點分佈得雜亂無章。沒有關係!(例如:你的鞋碼和數學成績)。

小貼士:最佳擬合線 (Line of Best Fit)

在散點圖上,我們通常會畫出一條最佳擬合線。這是一條穿過點群中間的直線,能幫助我們對尚未測量的數值進行預測

7. 成功的最後小提示

時刻檢查刻度:在圖表上,留意每個方格代表什麼。它不一定總是代表 1!
整理數據:對於中位數和全距,你首先要做的事情就是將數字按從小到大排列。
仔細閱讀題目:題目問的是平均數 (Mean) 還是中位數 (Median)?它們聽起來很像,但計算步驟完全不同!

如果這些定義讓你感到眼花撩亂,不用擔心。只要多練習觀察現實生活中的圖表和數字列表,這些術語就會變得像直覺一樣自然。你做得到的!