欢迎来到数据的世界!
在本章中,我们要成为“数据侦探”。试想想,Netflix 是如何知道该向你推荐哪些电影,或者运动队伍是如何决定要买入哪些球员的?他们全都是在使用数据分析 (Data Analysis)!我们将学习如何收集信息、整理信息,并找出数字背后所蕴含的“故事”。
如果你以前觉得数学有点“沉闷”,请别担心——数据其实与我们周遭的现实世界息息相关。让我们开始探索吧!
1. 数据类型:我们在看些什么?
在分析数据之前,我们需要知道手头上的是哪种数据。我们通常将数据分为两大类:
定性数据 (Qualitative Data):描述“性质”或类别的数据。
例子:你最喜欢的颜色、你的手机品牌,或是你养的狗的品种。你无法对这些进行“数学运算”(你不能把“蓝色”+“红色”加起来)。
定量数据 (Quantitative Data):这与“数量”或数字有关。这才是数学发挥作用的地方!它分为两类:
• 离散数据 (Discrete Data):你可以数出来的事物。你不可能有半个兄弟姐妹或 2.5 辆车。
• 连续数据 (Continuous Data):你需要测量出来的事物。例如你的身高、苹果的重量,或是跑 100 米所需的时间。这些数据可以是任何数值(例如 1.65 米)。
快速复习:
如果你可以数出来(1, 2, 3...),它就是离散数据 (Discrete)。如果你需要用工具(尺、磅秤、秒表)来测量,它就是连续数据 (Continuous)。
2. 数据收集:抽样 (Sampling)
如果你想知道全世界每个学生最喜欢的食物,你不可能去问每一个人。因此,你需要使用样本 (Sample)。
• 总体 (Population):你感兴趣的整个群体(例如:你学校里的所有学生)。
• 样本 (Sample):你实际访问的小型群体(例如:你学校里的 50 名学生)。
抽样的黄金法则:你的样本必须是无偏见 (Unbiased) 的。这意味着它必须公平地代表整个群体。如果你只问篮球队成员最喜欢的运动是什么,你的数据将会产生偏见 (Biased),因为他们更有可能回答篮球!
重点总结:
一个好的样本必须是随机 (random) 的,且足够大 (large enough),才能准确反映整个总体的情况。
3. 整理数据:频数分布表 (Frequency Tables)
原始数据通常杂乱无章。频数分布表能帮助我们进行整理。“频数 (Frequency)”指的就是某件事发生的“次数”。
例子:如果我们问 10 个人他们养了多少只宠物:0, 1, 1, 2, 0, 1, 3, 1, 0, 2。
我们可以这样整理:
• 0 只宠物:3 人
• 1 只宠物:4 人
• 2 只宠物:2 人
• 3 只宠物:1 人
常见错误:一定要再三确认你的总频数加起来等于你访问的总人数!以上面的例子为例:\( 3 + 4 + 2 + 1 = 10 \)。完美!
4. 集中趋势:三种“平均值”
当人们提到“平均”时,通常是指算术平均数 (Mean),但其实有三种方法可以找出数据的中心。这里有一首著名的口诀可以帮助你记忆:
“中位数 (Median) 是中间值,
相加除以个数就是平均数 (Mean)。
众数 (Mode) 是出现频率最高者,
全距 (Range) 则是最大与最小的差!”
众数 (Mode)
众数是出现最频繁的数值。
例子:在数列 2, 3, 3, 5, 8 中,众数是 3。
提示:如果没有重复的数字,则没有众数。如果两个数字重复出现的次数相同,你可能会得到两个众数(双峰分布)!
中位数 (Median)
中位数是将数据按顺序排列后的中间数字。
步骤 1:将数字由小到大排列!(这是大多数人最容易忘记的一步)。
步骤 2:找出中间的数。
例子:2, 5, 8, 10, 12。中位数是 8。
如果中间有两个数字怎么办?只要找出它们的中间值(相加后除以 2)。
算术平均数 (Mean)
平均数就是大多数人说“平均”时的意思。
步骤 1:将所有数字相加(即总和 (Sum))。
步骤 2:除以数字的个数。
公式:\( \text{Mean} = \frac{\text{Sum of values}}{\text{Number of values}} \)
重点总结:
众数是最受欢迎的,中位数是在队伍中间的那一位,而平均数则是将所有数据加总后“公平分配”的结果。
5. 测量离散程度:全距 (Range)
虽然平均值告诉我们中心在哪里,但全距告诉我们数据有多么“分散”。
公式:\( \text{Range} = \text{Largest Value} - \text{Smallest Value} \)
例子:如果考试分数是 60, 85, 92 和 100,则全距为 \( 100 - 60 = 40 \)。
全距小意味着数据非常稳定一致。全距大意味着数据变异很大。
6. 数据可视化
有时候图表胜过千言万语!以下是我们在 IB MYP 第三学年展示数据的主要方式:
棒形图 (Bar Charts) vs. 直方图 (Histograms)
• 棒形图:用于离散数据或定性数据。条形之间有空隙。(例如:最喜欢的披萨配料)。
• 直方图:用于连续数据(分组数据)。条形之间是相连的,因为数据是连续的数字流。(例如:学生的身高分组,如 140cm 至 150cm, 150cm 至 160cm 等)。
散点图 (Scatter Graphs) 与相关性 (Correlation)
我们用它们来观察两者之间是否有关联。我们在 \( (x, y) \) 坐标平面上绘制点。
• 正相关 (Positive Correlation):一项增加,另一项也增加。(例如:气温升高,冰淇淋销量也增加)。点向右上方趋升。
• 负相关 (Negative Correlation):一项增加,另一项则减少。(例如:玩电子游戏的时间越多,复习时间就越少)。点向右下方趋降。
• 不相关 (No Correlation):点分布得杂乱无章。没有关系!(例如:你的鞋码和数学成绩)。
小贴士:最佳拟合线 (Line of Best Fit)
在散点图上,我们通常会画出一条最佳拟合线。这是一条穿过点群中间的直线,能帮助我们对尚未测量的数值进行预测!
7. 成功的最后小提示
• 时刻检查刻度:在图表上,留意每个方格代表什么。它不一定总是代表 1!
• 整理数据:对于中位数和全距,你首先要做的事情就是将数字按从小到大排列。
• 仔细阅读题目:题目问的是平均数 (Mean) 还是中位数 (Median)?它们听起来很像,但计算步骤完全不同!
如果这些定义让你感到眼花缭乱,不用担心。只要多练习观察现实生活中的图表和数字列表,这些术语就会变得像直觉一样自然。你做得到的!