歡迎來到統計學的世界!

在本章中,我們將學習如何收集、整理和分析數據。你可以把統計學想像成「用數字說故事」。無論是追蹤你在電子遊戲中的進度、查看天氣趨勢,還是看看食堂裡哪種水果最受歡迎,統計學都能幫助我們理解周遭的世界。

如果你剛開始面對一大堆數字感到不知所措,別擔心!我們會將所有內容拆解成簡單的步驟,讓你像專業人士一樣輕鬆駕馭數據。

1. 理解母體與樣本

在繪製圖表之前,我們需要先了解數據從哪裡來。

  • 母體 (Population):你感興趣的整個群體(例如:全校的每一位學生)。
  • 樣本 (Sample):從母體中挑選出來以代表整體的一小群人(例如:隨機抽樣的 30 名學生)。

為什麼要用樣本?想像一下,如果要問英國每一個人他們最喜歡的披薩配料是什麼,那要花上太久的時間了!所以,我們改為詢問一個樣本

重要提示:樣本必須是無偏差 (unbiased) 的。這意味著它必須公平地代表整個群體。如果你只在足球比賽現場詢問人們最喜歡什麼運動,你的結果將會出現偏差 (biased),因為你沒有詢問到足夠多樣化的人群。

快速複習:湯的類比

想像一大鍋湯(母體)。為了知道湯好不好喝,你不需要把整鍋喝完!你只需攪拌均勻,嚐一勺(樣本)。如果這一勺能很好地代表整鍋湯,這就是一個公平的樣本。

2. 呈現數據:表格與圖表

拿到數據後,我們需要清晰地呈現它們。對於基礎課程 (Foundation tier),你需要掌握以下常見類型:

象形圖 (Pictograms)

這些圖表使用圖片或符號來表示數據。一定要記得查看圖例 (Key)
例子:如果一個圓形圖片代表 4 個人,那麼半個圓形就代表 2 個人。

長條圖 (Bar Charts)

用於分類數據 (categorical data)(可以分組的事物,如「顏色」或「汽車品牌」)。
常見錯誤:記得長條圖中每個長條之間一定要留有間隙!

圓形圖 (Pie Charts)

這些圖表顯示總數是如何按比例分配的。繪製時,你需要計算每個扇形的圓心角:
\( \text{角度} = \frac{\text{頻數}}{\text{總頻數}} \times 360^\circ \)

時序圖 (Time Series Graphs)

這些是折線圖,用於顯示事物如何隨時間變化(例如:一週內的溫度變化)。我們觀察的是趨勢 (trends)(總體而言是在上升、下降還是保持不變?)。

重點總結:

分類數據(文字類)通常使用長條圖或圓形圖。離散數值數據(用數字計算的事物,如「兄弟姐妹的數量」)則使用頻數表或垂直線圖。

3. 平均數與離散程度

平均數告訴我們數據的「中心」在哪裡,而全距 (Range) 則告訴我們數據有多分散。

三個平均數(以及一個全距)

為了幫助記憶,試試這首著名的口訣:
「中位數 (Median) 在中間,
平均數 (Mean) 相加再除開。
眾數 (Mode) 出現次數最多,
全距 (Range) 是兩極之差!」

  • 眾數 (Mode):出現最頻繁的數值。(記憶小撇步:MOde = MOst)。
  • 中位數 (Median):當數字按順序排列時,位於中間的數值。
    步驟 1:將數字從小到大排列。
    步驟 2:從兩端逐一劃掉,直到找到中間的數。
  • 平均數 (Mean):將所有數字相加,然後除以數字的總個數。
    \( \text{Mean} = \frac{\text{總和}}{\text{數據個數}} \)。
  • 全距 (Range):最大值與最小值之間的差。
    \( \text{Range} = \text{最大值} - \text{最小值} \)。

分組數據

有時候數據會被分組(例如:0-10 分鐘,11-20 分鐘)。
- 你無法找到精確的眾數,所以我們稱它為眾數組 (Modal Class)
- 你無法找到精確的平均數,所以我們使用每組的組中值 (midpoint)估算 (estimate) 平均數。

別掉進陷阱!

常見錯誤:在找中位數之前忘記將數字排序。如果你不排序,答案肯定會錯!

4. 比較數據集

在考試中,你可能會被要求比較兩組人(例如:「比較甲班和乙班的測驗分數」)。

要做好這一點,你必須針對以下兩點進行評論:

  1. 平均數:使用平均數或中位數。(例如:「平均而言,甲班的得分較高,因為他們的平均分為 65,而乙班為 58。」
  2. 離散程度:使用全距。(例如:「乙班的分數較穩定,因為他們的全距較小。」

你知道嗎?較小的全距意味著數據較穩定 (consistent);較大的全距則意味著數據較不穩定 (inconsistent)

5. 散點圖與相關性

散點圖顯示兩種不同事物之間的關係(雙變量數據 Bivariate Data),例如「學習時數」與「考試分數」。

相關性的類型

  • 正相關 (Positive Correlation):一項增加,另一項也增加(點從左下向右上分佈)。
  • 負相關 (Negative Correlation):一項增加,另一項減少(點從左上向右下分佈)。
  • 無相關 (No Correlation):點散亂分佈,沒有任何規律。

最佳擬合線 (Lines of Best Fit)

這是一條畫在點群中間的直線,盡量讓線條兩側的點數量相等。

使用最佳擬合線:

  • 內插法 (Interpolation):預測數據範圍以內的值。這通常相當可靠。
  • 外推法 (Extrapolation):預測數據範圍以外的值。這是不可靠的,因為我們不知道趨勢是否會持續!
一個非常重要的警告!

相關性不代表因果關係 (Correlation does not mean Causation)!
僅僅因為兩件事有關聯,並不代表其中一件事導致了另一件事。
例子:冰淇淋銷量和鯊魚襲擊次數都在夏季增加。銷售更多冰淇淋並不會導致鯊魚攻擊——這僅僅是因為天氣變熱了!

最終快速複習盒

平均數:眾數 (出現最多)、中位數 (中間值)、平均數 (總和 ÷ 個數)。
離散程度:全距 (最大值 - 最小值)。
圖表:永遠檢查坐標刻度和圖例。
散點圖:用尺畫出最佳擬合線,且永遠不要輕信外推法!