欢迎来到抽样的世界!
你好!在准备 HKICPA QP 考试的过程中,你会发现商业经济学 (Business Economics) 和统计分析 (Statistical Analysis) 是每一位专业会计师的核心工具。这一章节,我们将探讨抽样技术 (Sampling Techniques)。别担心,就算你对数学不太感兴趣也没关系! 我们会将这些概念拆解成简单、合乎逻辑的步骤,并结合真实的商业环境来理解。
为什么需要抽样? 想象一下,如果你是一名审计师,客户有 1,000,000 张销售发票。你根本不可能检查每一张——那会花上好几年的时间!因此,你会选择一个较小的群体(样本,sample)来代表整个群体(总体,population)。如果样本的情况良好,你就可以合理地确信整个群体的情况也是良好的。让我们开始吧!
1. 核心概念:总体 vs. 样本
在学习“如何做”之前,我们必须先理解“是什么”。
• 总体 (Population, N): 你想要研究的全部对象或资料集合。例如:香港所有已注册的公司。
• 样本 (Sample, n): 你实际进行检查的总体中的一小部分。例如:从注册处中随机选取的 500 家公司。
• 普查 (Census): 当你对总体中的每一个成员进行研究时。(这既昂贵又耗时!)
• 参数 (Parameter): 描述总体的数值特征(例如:所有香港公司的平均利润)。
• 统计量 (Statistic): 描述样本的数值特征(例如:你挑选出来的那 500 家公司的平均利润)。
记忆小撇步:
Population(总体) = Parameter(参数)(两者都以 P 开头)
Sample(样本) = Statistic(统计量)(两者都以 S 开头)
快速回顾: 我们使用样本统计量来估算总体参数,因为这样既省时又省钱。
2. 概率抽样技术 (Probability Sampling Techniques)
在概率抽样中,总体的每一位成员都有已知且非零的机会被选中。这是统计学的“黄金标准”,因为它能避免偏差 (bias)。
A. 简单随机抽样 (Simple Random Sampling, SRS)
这就像抽奖一样。每个项目被选中的机会均等。你可能会使用随机数字生成器来选取发票号码。
例子: 把 100 个名字放进帽子里,然后抽出 10 个。
B. 系统抽样 (Systematic Sampling)
你随机选择一个起点,然后每隔 \(k\) 个项目选取一个。
间距的计算公式为: \(k = \frac{N}{n}\)
(其中 \(N\) 是总体大小,\(n\) 是样本大小)。
例子: 如果你有 1,000 张发票,并想要 50 个样本,你计算 \(1,000 / 50 = 20\)。你在 1 到 20 之间随机选一个起始点,然后每隔 20 张选取一张发票。
C. 分层随机抽样 (Stratified Random Sampling)
你根据某个特征(例如公司规模:小、中、大)将总体划分为不同的层 (strata),然后从每一层中进行随机抽样。
为什么要用它? 这能确保重要的子群体都被纳入代表性。你肯定不希望在“大型”公司占经济大部分比例的情况下,却意外地只选到了“小型”公司!
D. 整群抽样 (Cluster Sampling)
将总体划分为不同的群 (clusters)(通常基于地理位置)。你随机选取几个完整的群,然后研究该群内的所有人。
类比: 如果你想研究香港的学生,你随机选取 5 所学校(群),然后调查这 5 所学校里的每一位学生。
核心观点: 概率抽样是“公平”的,并允许我们使用数学公式来计算结果的准确性。
3. 非概率抽样技术 (Non-Probability Sampling Techniques)
有时候,由于太困难或太昂贵,我们无法使用随机抽样。在非概率抽样中,被选中的概率是未知的。请注意: 这些方法更容易产生偏差!
A. 便利抽样 (Convenience Sampling)
选择最容易接触到的人或项目。
例子: 站在地铁站出口询问经过的人。速度很快,但你的样本可能只代表在该特定时间、使用该特定车站的人。
B. 配额抽样 (Quota Sampling)
类似于分层抽样,但不是随机的。你被要求找到特定数量的对象(配额)。一旦达到该数量,就停止抽样。
例子: “找到 20 位男性购物者和 20 位女性购物者。”一旦研究人员找到 20 位男性,他们就会忽略其他所有男性,即使他们可能拥有有用的数据。
C. 判断(立意)抽样 (Judgmental / Purposive Sampling)
研究人员运用自己的“专家判断”来决定选择谁。
例子: 审计师专门挑选高价值发票或“看起来可疑”的项目进行测试。这对于找出错误很有用,但不能代表发票的平均情况。
D. 雪球抽样 (Snowball Sampling)
你找到一个人,然后让他们推荐其他人。这就像滚雪球一样“越滚越大”。
例子: 试图采访科技初创公司的 CEO。你找到一位,然后请他介绍三位同样身为 CEO 的朋友给你。
快速回顾: 非概率方法对于探索性研究非常出色,但不适合用来对整个总体做出广泛且具科学性的结论。
4. 抽样误差 vs. 非抽样误差
没有任何样本是完美的。样本结果与真实总体结果之间总会存在差异,我们称之为误差 (Error)。
抽样误差 (Sampling Error)
这是样本与总体之间天然的“落差”。因为样本只是整体中的一部分。即使你把一切都做得完美无缺,样本平均值很可能仍会与总体平均值略有不同。
你知道吗? 你可以通过增加样本大小来减少抽样误差。你询问的人越多,结果就会越准确!
非抽样误差 (Non-Sampling Error)
这些是“人为错误”或程序上的瑕疵。这些问题更危险,因为无法单靠增加样本量来解决。
• 选择偏差: 你的抽样方法排除了某些人(例如:网上问卷排除了没有网络的人)。
• 无回应偏差: 人们拒绝回答你的问卷。
• 测量误差: 措辞不明确的问题或损坏的测量工具。
• 数据输入误差: 当答案是“10”时,却输入了“100”。
常见的误区: 不要以为大样本量就能解决一切。如果你的问卷题目令人困惑(非抽样误差),那么询问 1,000,000 个人只会得到 1,000,000 个困惑的答案!
总结要点:
1. 抽样误差是自然的且预期之内的(这是抽样的“成本”)。
2. 非抽样误差是可以避免的,通常源于规划或执行不当。
5. 最终总结核对表
在你继续往下看之前,确保你能回答以下问题:
• 我能解释参数 (Parameter) 与统计量 (Statistic) 之间的区别吗?
• 我了解分层抽样 (Stratified)(从每个组别中抽一些)与整群抽样 (Cluster)(从某些组别中抽全部)的区别吗?
• 我能使用 \(k = N/n\) 计算系统抽样 (Systematic) 的间距吗?
• 我明白即使在普查中也可能出现非抽样误差吗?
你一定没问题的!抽样就像当侦探一样——选择正确的证据来拼凑出最真实的画面。继续练习那些定义吧!