简介:统计学的基础
欢迎踏出统计学之旅的第一步!在我们开始计算平均值或绘制漂亮的图表之前,必须先收集数据。你可以将数据收集想象成烹饪:如果你一开始用的食材品质很差,无论食谱多好,最后做出来的餐点也不会美味。在本章中,你将学会如何规划调查、识别不同类型的“食材”(即数据),并选择最公正的方式来收集它们。如果起初觉得术语很多,请不用担心;只要你了解它们在现实生活中的应用,学起来就会容易得多!
1. 规划调查
每一项统计调查都始于一个称为假设(Hypothesis)的想法。这是一个你可以通过测试来验证真伪的陈述。
例子:“吃早餐的学生比不吃早餐的学生在考试中获得更高的分数。”
限制因素与风险
在现实世界中,你很难做到完美的实验。你会面临各种限制因素(Constraints):
- 时间: 你可能只有一周的时间来完成。
- 成本: 印制 1,000 份问卷需要费用。
- 伦理: 你必须将数据保密(Confidential),并确保参与者不会受到伤害。
- 便利性: 询问你的朋友很方便,但这样做公平吗?
缓解策略
“缓解”的意思是设法减轻问题的严重性。如果你担心人们不会回复你的问卷(即不回复,non-response),你可以提供小奖励或将问卷简化。如果你无法找到整个城镇的所有名单,你可以将目标总体(Target population)缩小到仅限一所学校。
重点复习: 一个好的计划会在开始之前就考虑到可能会出错的地方!
2. 数据类型
数据有很多种“口味”。为数据使用正确的称呼,有助于你决定稍后使用哪种图表或计算方式。
定性数据与定量数据
- 定性数据(类别数据,Qualitative/Categorical): 用文字来描述。例子:眼睛颜色、汽车品牌。
- 定量数据(数值数据,Quantitative/Numerical): 用数字来描述。例子:身高、温度。
离散数据与连续数据
这是最容易混淆的地方!这里有一个简单的判断技巧:
- 离散(Discrete): 你能数出来的东西。它只能是特定的数值(例如鞋号 5 号或 5.5 号,但不会是 5.23 号)。
- 连续(Continuous): 你能测量出来的东西。它可以是刻度上的任何数值。例子:时间(10.2 秒)、重量(65.43公斤)。
高阶重点:双变量与多变量数据
- 双变量数据(Bivariate Data): 涉及两个变量,用以观察彼此是否相关。例子:比较学习时数与考试成绩。
- 多变量数据(Multivariate Data): 涉及三个或以上的变量。例子:根据房屋大小、地点和屋龄来比较房价。
解释变量与响应变量
当你在探讨两者之间的联系时:
- 解释变量(自变量,Explanatory/Independent variable): 你认为导致变化的原因。这会放在 x 轴上。
- 响应变量(因变量,Response/Dependent variable): 你所测量的结果。这会放在 y 轴上。
重点归纳: 在开始分析之前,请务必先确认你的数据是测量出来的(连续)还是数出来的(离散)!
3. 总体与抽样
总体(Population)是指你感兴趣的整个群体(例如:英国所有的青少年)。样本(Sample)则是你们实际进行调查的小组。
抽样框
抽样框(Sampling frame)是指你从中选择样本的实际人员或项目名单。例子:如果你的总体是“全校学生”,那么你的抽样框就是学校的学生登记册。
高阶:分层抽样(Stratified Sampling)
有时总体中会有明显的群体(分层,Strata),例如不同的年级或性别。为了公平起见,你的样本应该按比例反映这些群体。
公式:
\( \text{该层抽样数量} = \frac{\text{该层的人数}}{\text{总体总人数}} \times \text{总样本大小} \)
例子:如果学校有 200 名男生和 300 名女生(总共 500 人),而你想要抽取 50 名学生作为样本:
\( \text{男生样本数} = \frac{200}{500} \times 50 = 20 \)
其他抽样方法
- 简单随机抽样: 就像从帽子里抽出名字一样。每个人被选中的机率均等。
- 系统抽样: 每隔 \( n \) 个人抽取一人(例如名单上每 10 个人选 1 个)。
- 配额抽样: 你持续询问,直到填满你的“配额”(例如:“我需要 10 名男性和 10 名女性”)。
- 机会/便利抽样: 询问当下随手可得的人。这通常具有偏差(Biased)。
你知道吗? 当你从整个总体收集数据时,称为普查(Census)。它的准确度很高,但非常昂贵且耗时!
4. 数据收集与避免偏差
偏差(Bias)是统计学的大敌。当数据因收集方式不当而无法反映真实情况时,就会产生偏差。
信度与效度
- 信度(Reliability): 如果你再次进行测试,是否会得到相同的结果?(稳定性)。
- 效度(Validity): 测试是否真的测量了它原本应该测量东西?(准确性)。
高阶重点:敏感数据与对照组
在询问敏感问题(例如:“你有没有触犯过法律?”)时,人们往往会说谎。为了修正这一点,我们使用随机回答技术(Random Response Technique)。这涉及参与者秘密地掷硬币或掷骰子,来决定是如实回答还是直接回答“是”。这保护了参与者的隐私(Confidentiality),同时允许研究人员利用机率计算出整体的百分比。
对照组与配对样本
在实验中,我们使用对照组(Control group)。这一组不接受“处理”(例如新药),让我们能将结果与实验组(Experimental group)进行比较。
为了使实验更完善,我们使用配对样本(Matched pairs)。我们找出两个非常相似的人(年龄、体能、健康状况相同),并将他们分别放入不同的组别。这有助于控制外来变量(Extraneous variables)(可能会干扰结果的外部因素)。
数据清理
在使用数据之前,你必须先进行“清理”。这包括:
- 移除离群值(Outliers)(明显错误或极端不同的数值)。
- 修复格式(例如:将“10 分钟”和“10m”统一改为“10”)。
- 处理缺失的数据或未完成的回复。
重点复习: 在正式调查之前,一定要先进行试点调查(Pilot surveys,小型试行),以便在正式开始前发现并修正令人困惑的问题!
总结检查清单
- 你能定义什么是假设吗?
- 你知道离散数据与连续数据的区别吗?
- 你会计算分层抽样的样本大小吗?
- 你了解为什么对照组和配对样本能使实验更公平吗?
- 你能解释随机回答技术如何保护隐私吗?