歡迎來到統計學的世界!
在本章中,我們將學習如何收集、整理和分析數據。你可以把統計學想像成「用數字說故事」。無論是追蹤你在電子遊戲中的進度、查看天氣趨勢,還是看看食堂裡哪種水果最受歡迎,統計學都能幫助我們理解周遭的世界。
如果你剛開始面對一大堆數字感到不知所措,別擔心!我們會將所有內容拆解成簡單的步驟,讓你像專業人士一樣輕鬆駕馭數據。
1. 理解母體與樣本
在繪製圖表之前,我們需要先了解數據從哪裡來。
- 母體 (Population):你感興趣的整個群體(例如:全校的每一位學生)。
- 樣本 (Sample):從母體中挑選出來以代表整體的一小群人(例如:隨機抽樣的 30 名學生)。
為什麼要用樣本?想像一下,如果要問英國每一個人他們最喜歡的披薩配料是什麼,那要花上太久的時間了!所以,我們改為詢問一個樣本。
重要提示:樣本必須是無偏差 (unbiased) 的。這意味著它必須公平地代表整個群體。如果你只在足球比賽現場詢問人們最喜歡什麼運動,你的結果將會出現偏差 (biased),因為你沒有詢問到足夠多樣化的人群。
快速複習:湯的類比
想像一大鍋湯(母體)。為了知道湯好不好喝,你不需要把整鍋喝完!你只需攪拌均勻,嚐一勺(樣本)。如果這一勺能很好地代表整鍋湯,這就是一個公平的樣本。
2. 呈現數據:表格與圖表
拿到數據後,我們需要清晰地呈現它們。對於基礎課程 (Foundation tier),你需要掌握以下常見類型:
象形圖 (Pictograms)
這些圖表使用圖片或符號來表示數據。一定要記得查看圖例 (Key)!
例子:如果一個圓形圖片代表 4 個人,那麼半個圓形就代表 2 個人。
長條圖 (Bar Charts)
用於分類數據 (categorical data)(可以分組的事物,如「顏色」或「汽車品牌」)。
常見錯誤:記得長條圖中每個長條之間一定要留有間隙!
圓形圖 (Pie Charts)
這些圖表顯示總數是如何按比例分配的。繪製時,你需要計算每個扇形的圓心角:
\( \text{角度} = \frac{\text{頻數}}{\text{總頻數}} \times 360^\circ \)
時序圖 (Time Series Graphs)
這些是折線圖,用於顯示事物如何隨時間變化(例如:一週內的溫度變化)。我們觀察的是趨勢 (trends)(總體而言是在上升、下降還是保持不變?)。
重點總結:
分類數據(文字類)通常使用長條圖或圓形圖。離散數值數據(用數字計算的事物,如「兄弟姐妹的數量」)則使用頻數表或垂直線圖。
3. 平均數與離散程度
平均數告訴我們數據的「中心」在哪裡,而全距 (Range) 則告訴我們數據有多分散。
三個平均數(以及一個全距)
為了幫助記憶,試試這首著名的口訣:
「中位數 (Median) 在中間,
平均數 (Mean) 相加再除開。
眾數 (Mode) 出現次數最多,
全距 (Range) 是兩極之差!」
- 眾數 (Mode):出現最頻繁的數值。(記憶小撇步:MOde = MOst)。
- 中位數 (Median):當數字按順序排列時,位於中間的數值。
步驟 1:將數字從小到大排列。
步驟 2:從兩端逐一劃掉,直到找到中間的數。 - 平均數 (Mean):將所有數字相加,然後除以數字的總個數。
\( \text{Mean} = \frac{\text{總和}}{\text{數據個數}} \)。 - 全距 (Range):最大值與最小值之間的差。
\( \text{Range} = \text{最大值} - \text{最小值} \)。
分組數據
有時候數據會被分組(例如:0-10 分鐘,11-20 分鐘)。
- 你無法找到精確的眾數,所以我們稱它為眾數組 (Modal Class)。
- 你無法找到精確的平均數,所以我們使用每組的組中值 (midpoint) 來估算 (estimate) 平均數。
別掉進陷阱!
常見錯誤:在找中位數之前忘記將數字排序。如果你不排序,答案肯定會錯!
4. 比較數據集
在考試中,你可能會被要求比較兩組人(例如:「比較甲班和乙班的測驗分數」)。
要做好這一點,你必須針對以下兩點進行評論:
- 平均數:使用平均數或中位數。(例如:「平均而言,甲班的得分較高,因為他們的平均分為 65,而乙班為 58。」)
- 離散程度:使用全距。(例如:「乙班的分數較穩定,因為他們的全距較小。」)
你知道嗎?較小的全距意味著數據較穩定 (consistent);較大的全距則意味著數據較不穩定 (inconsistent)。
5. 散點圖與相關性
散點圖顯示兩種不同事物之間的關係(雙變量數據 Bivariate Data),例如「學習時數」與「考試分數」。
相關性的類型
- 正相關 (Positive Correlation):一項增加,另一項也增加(點從左下向右上分佈)。
- 負相關 (Negative Correlation):一項增加,另一項減少(點從左上向右下分佈)。
- 無相關 (No Correlation):點散亂分佈,沒有任何規律。
最佳擬合線 (Lines of Best Fit)
這是一條畫在點群中間的直線,盡量讓線條兩側的點數量相等。
使用最佳擬合線:
- 內插法 (Interpolation):預測數據範圍以內的值。這通常相當可靠。
- 外推法 (Extrapolation):預測數據範圍以外的值。這是不可靠的,因為我們不知道趨勢是否會持續!
一個非常重要的警告!
相關性不代表因果關係 (Correlation does not mean Causation)!
僅僅因為兩件事有關聯,並不代表其中一件事導致了另一件事。
例子:冰淇淋銷量和鯊魚襲擊次數都在夏季增加。銷售更多冰淇淋並不會導致鯊魚攻擊——這僅僅是因為天氣變熱了!
最終快速複習盒
平均數:眾數 (出現最多)、中位數 (中間值)、平均數 (總和 ÷ 個數)。
離散程度:全距 (最大值 - 最小值)。
圖表:永遠檢查坐標刻度和圖例。
散點圖:用尺畫出最佳擬合線,且永遠不要輕信外推法!