欢迎来到数据处理!
在本章中,我们将学习如何将一堆杂乱无章的数字转化为清晰的图表和实用的摘要。请将统计学家想象成一位讲故事的人——你的工作是利用数据讲述一个每个人都能听懂的故事。无论是分析楼价、考试成绩,还是你心爱球队的入球数,本章的工具都能助你厘清当中的奥秘!
1. 数据可视化:图表与表格
在进行繁复的计算之前,我们通常会先将数据画成图表。不同的数据类型需要使用不同的图表呈现。
表格与点算表
整理数据最简单的方法是使用频数表 (frequency table)。我们使用点算表 (tallies)(即每五划一组的短线)来快速统计项目,以免混乱。当我们想同时比较两个不同的类别(例如“年级”与“最喜欢的学科”)时,双向表 (two-way tables) 非常实用。
茎叶图 (Stem and Leaf Diagrams)
这是一种巧妙的方法,既能显示每一项数据,又能观察整体的分布形态。 重要:茎叶图必须经过排序(叶子必须由小到大排列),并且必须包含图例 (key),好让读者明白数字的含义。
例如:如果茎是 2,叶是 5,图例会告诉我们这代表 25、2.5 还是 250。文氏图与象形图
文氏图 (Venn Diagrams) 展示了不同群组之间的重叠情况。象形图 (Pictograms) 则使用小图案来代表特定数量的数据。 常见错误:在看象形图时,务必检查图例!如果一个圆圈代表 4 个人,那么半个圆圈就代表 2 个人。不要只会数图案的数量。
分层设色图与人口金字塔
- 分层设色图 (Choropleth Maps):这些地图透过不同深浅的颜色来显示统计数据(例如英国地图中,蓝色越深代表降雨量越多)。
- 人口金字塔 (Population Pyramids):两个背对背的条形图,分别显示不同年龄组别的男性和女性人数。它们有助我们判断该地区人口是“年轻”还是“老龄化”。
快速回顾:每张图表都需要一个标题、清晰的标签,如有必要,还需附上图例!
2. “平均”的选择:集中趋势测度
平均数是一个能代表整组数据的单一数字。你需要掌握以下三种主要类型:
三个“M”
- 众数 (Mode):出现最多次数的数值。(记忆小技巧:MOde = MOst)。
- 中位数 (Median):数据排序后位处中间的数值。(记忆小技巧:Median 就像公路中间的分隔带)。
- 平均数 (Mean):最“刻薄”的一个,因为它让你做最多工作!将所有数值相加,然后除以总数量。
分组数据的平均数
有时候数据是分组的(例如“10 至 20 分钟”)。我们不知道精确数值,因此会计算平均数的估算值 (estimate of the mean)。 步骤: 1. 找出每组的组中点 (midpoint)(即区间中间值)。 2. 将组中点乘以该组的频数 (frequency)。 3. 将这些结果相加。 4. 除以总频数(数据的总项数)。
我该选择哪种平均数?
选择正确的平均数很重要: - 用于非数值数据(如最喜欢的颜色)或你想知道商店中最热门的商品时,请使用众数。 - 如果数据中存在“极值”(异常巨大或微小的数字),请使用中位数,因为它不会受极值影响。 - 当你想将数据中的每一项都纳入计算时,请使用平均数。
关键点:如果你将数据集中的每个数值都加上同一个数字,平均数、中位数和众数都会增加该数值!
3. 数据有多分散?(离差)
两个班级的平均考试成绩可能相同,但一个班级的学生分数可能相近,而另一个班级则有天才也有成绩落后的同学。我们使用以下方法来测量这种“分散程度”:
- 全距 (Range): \( \text{最大值} - \text{最小值} \)。虽然简单,但可能会被一个异常高或低的数字破坏。
- 四分位数 (Quartiles):这些将你的数据分为四个相等的部分。下四分位数 (LQ) 位于数据的 25% 处,上四分位数 (UQ) 位于 75% 处。
- 四分位距 (IQR): \( \text{UQ} - \text{LQ} \)。这显示了中间 50% 数据分散的程度。它比全距更可靠,因为它忽略了极值。
箱线图 (Box Plots)
箱线图是一种以图表形式呈现的“五数摘要”。它显示: 1. 最小值 2. 下四分位数 3. 中位数 4. 上四分位数 5. 最大值
极值 (Outliers)
极值是指与其他数据明显不符的数据点。 例如:如果班上每个人身高都是 1.5 米,而有一个学生是 2.1 米,那么这个学生就是极值。 请务必检查极值是人为错误(如打字错误)还是仅仅是一个非常特殊的结果。
4. 偏态:数据歪了吗?
偏态 (Skewness) 告诉我们数据是呈对称分布,还是向某一侧“倾斜”。 - 正偏态 (Positive Skew):数据的“尾巴”指向较大的数字。在此情况下,通常 \( \text{平均数} > \text{中位数} > \text{众数} \)。 - 负偏态 (Negative Skew):“尾巴”指向较小的数字。 - 对称 (Symmetrical):数据左右两侧看起来像镜像一样。
5. 散点图与相关性
我们使用散点图 (scatter diagrams) 来观察两件事物(双变量数据)之间是否存在关系(相关性 correlation)。
相关性的类型
- 正相关 (Positive Correlation):一项增加,另一项也增加(例如身高与鞋码)。
- 负相关 (Negative Correlation):一项增加,另一项则减少(例如车龄与价值)。
- 零相关 (Zero Correlation):完全没有关系(例如头发长度与数学成绩)。
最佳拟合线 (Line of Best Fit)
这是一条穿过点群中间的直线。 专家小贴士:要画出准确的直线,先计算双平均点 (double mean point) \( (\bar{x}, \bar{y}) \)。这是(所有 x 值的平均数,所有 y 值的平均数)。你的线必须穿过这个点!
相关性与因果关系
你知道吗?两件事物相关并不代表其中一项“导致”另一项。 例如:雪糕销量与鲨鱼袭击次数呈正相关。难道雪糕会导致鲨鱼袭击吗?当然不是!这两者增加是因为天气炎热,这就是夏天。 这称为关联性 (association)。
6. 时间序列与趋势
时间序列 (time series) 是一个显示事物随时间变化的图表。由于这些图表可能会非常“跳跃”,我们使用移动平均数 (moving averages) 来平滑数据。
考试时,你可能需要计算 4 点移动平均数。你取前 4 个数值并计算平均值,然后向后移一步,计算下 4 个数值的平均值,以此类推。这有助你观察趋势 (trend)(长期的方向),而不受季节性的起伏所干扰。
7. 指数与变化率
指数 (Index numbers) 用于比较相对于“基年”(固定为 100)随时间变化的数值。 \( \text{指数} = \frac{\text{当前数值}}{\text{基年数值}} \times 100 \)
你还会看到变化率,例如粗出生率 (Crude Birth Rate)。 别担心:这类复杂的公式通常会在题目中提供给你!你只需要知道如何代入数字即可。
例如:\( \text{粗出生率} = \frac{\text{出生人数}}{\text{总人口}} \times 1000 \)关键点:务必仔细阅读单位!如果公式写着“每 1000 人”,请确保你的最终答案在该情境下是合理的。
8. 误导性图表:别被骗了!
有时图表会被刻意设计来欺骗你。务必检查以下几点: - 不正确的刻度:Y 轴是否从零开始?如果不是(称为截断坐标轴 truncated axis),差异看起来会比实际大得多。 - 扭曲的比例:在象形图或 3D 图表中,形状的体积可能会具有误导性。 - 缺少标签:如果没有图例或单位,该图表就毫无价值!
快速回顾:统计学就像做侦探。查看数字,查看图表,然后问自己:“这真的合理吗?”