M1 复习笔记:泊松分布

大家好!欢迎大家来到M1统计学最有趣的课题之一:泊松分布的复习笔记!这个名称听起来可能有些陌生,但不用担心。它是一个超级有用的工具,帮助我们理解在时间或空间上随机发生的事件。

在这个章节,我们会学习如何预测以下这些事情的概率:

你一个小时内收到的邮件数量。

一本书里面,一页纸上的打字错误数量。

十分钟内到达收银处的顾客数量。

复习完这份笔记之后,你就会明白什么是泊松分布、何时使用它、以及如何使用它来计算概率。我们一起开始吧!


1. 泊松分布究竟是什么?

想象一下你试图计算某件事发生了多少次,但这些事件都是随机且独立的。二项分布适用于有固定次数试验的情况(例如掷硬币10次)。但如果没有固定的“试验次数”呢?如果只是在固定的时间区间内,等待事件发生呢?

这个时候,泊松分布就派上用场了!它是一种离散概率分布,帮助我们找出在固定的时间、面积、体积或距离区间内,特定数量事件发生的概率。

关键参数:Lambda (\(\lambda\))

整个泊松分布都围绕着一个唯一而超级重要的参数:lambda,写作\(\lambda\)

\(\lambda\) (Lambda) = 在一个特定区间内,事件的平均发生数量。

可以将它视为“平均发生率”。例如:

如果一个客户服务中心平均每个小时收到10个电话,那么 \(\lambda = 10\)(对于一个小时的区间)。

如果一位生物学家在一片田野中,平均每平方米找到2朵稀有花朵,那么 \(\lambda = 2\)(对于 \(1\text{ m}^2\) 的区间)。

何时可以使用泊松分布?

泊松分布并非万能!一个情况要符合以下条件,才能使用泊松分布来建立模型:

1. 事件以恒定的平均发生率发生(即是 \(\lambda\) 的数值不会改变)。

2. 事件之间互相独立(即是一件事件的发生不会让另一件事件变得更可能或更不可能发生)。

3. 事件随机发生。

4. 两个事件不能在同一瞬间发生。

重点提示:第一部分

泊松分布用于计算在固定区间(例如时间或空间)内,随机、独立事件的数量。它唯一的参数是\(\lambda\) (lambda),即是该区间内事件的平均发生率


2. 泊松概率公式

好的,接下来是重头戏了!如果随机变量 \(X\) 遵循泊松分布,平均发生率为 \(\lambda\),我们会这样写:

\(X \sim Po(\lambda)\)

在该区间内观察到刚好k个事件的概率,可以使用以下公式表示:

\(P(X = k) = \frac{e^{-\lambda} \lambda^k}{k!} \quad \text{for } k = 0, 1, 2, \dots\)

不用被这条公式吓到!我们来拆解一下:

\(P(X=k)\) 是我们想找的:即是事件数量刚好是 \(k\) 的概率。

\(k\) 是你感兴趣的特定事件数量(例如,刚好有3个电话的概率)。

\(\lambda\) 是该区间内事件的平均数量。

\(e\) 是欧拉数(你的计算器认识它,它大约是 \(2.718\))。

\(k!\) 是“k阶乘”,即是 \(k \times (k-1) \times \dots \times 2 \times 1\)(例如,\(3! = 3 \times 2 \times 1 = 6\))。记住 \(0! = 1\)

逐步示例

一个客户服务热线平均每个小时收到5个电话。在一个特定的小时内,他们刚好收到2个电话的概率是多少?

步骤1:确认分布和参数。

事件(电话)在固定的区间(一个小时)内随机发生。这听起来就像泊松分布!

平均发生率是每个小时5个电话,所以 \(\lambda = 5\)

我们想找出刚好有2个电话的概率,所以 \(k = 2\)

所以,我们有 \(X \sim Po(5)\) 并且需要找出 \(P(X=2)\)。

步骤2:将数值代入公式。

\(P(X=2) = \frac{e^{-5} \cdot 5^2}{2!}\)

步骤3:计算结果。

\(P(X=2) = \frac{e^{-5} \cdot 25}{2 \times 1} = \frac{(0.006738) \cdot 25}{2} \approx 0.0842\)

所以,在那个小时内刚好收到2个电话的机会大约是8.42%。

常见错误要避开

混淆 \(\lambda\) 和 \(k\):记住,\(\lambda\) 是该区间的平均数,\(k\) 是你测试的特定数值。

忘记 \(0! = 1\):零事件的概率是 \(P(X=0) = \frac{e^{-\lambda} \lambda^0}{0!} = e^{-\lambda}\),因为 \(\lambda^0=1\) 和 \(0!=1\)。

计算器错误:输入阶乘以及 \(e\) 的次方时要小心。记得用你的计算器上面的 \(e^x\) 按钮。


3. 泊松分布的特性

这个部分简单又重要。课程要求你认识泊松分布的均值和方差。不需要证明!

均值和方差

对于一个随机变量 \(X \sim Po(\lambda)\):

均值(或者期望值)是:\(E(X) = \lambda\)

方差是:\(Var(X) = \lambda\)

记忆技巧

这有一个简单的记忆方法:“泊松分布很简单,均值方差都一样!”

这是泊松分布一个独特的性质!如果题目告诉你一个离散分布的均值和它的方差相等,那么这就是一个很大的提示,表示你可能正在处理泊松分布的问题了。

你知道吗?

标准差是方差的平方根。所以对于泊松分布来说,标准差就是 \(\sqrt{\lambda}\)。

快速回顾区

如果 \(X \sim Po(3)\),那么:

事件的平均数量是3。

均值 \(E(X)\) 是3。

方差 \(Var(X)\) 是3。


4. 独立泊松变量的相加

HKDSE M1 中一个很重要的性质就是将独立的泊松变量相加。

如果 \(X \sim Po(\lambda_1)\) 和 \(Y \sim Po(\lambda_2)\) 是独立的随机变量,那么它们的总和也遵循泊松分布:

\(X + Y \sim Po(\lambda_1 + \lambda_2)\)

示例

一间面包店平均每个早上收到4个网上订单(\(X \sim Po(4)\)),每个下午收到6个网上订单(\(Y \sim Po(6)\))。假设早上和下午的订单互相独立,求每天总订单数量的分布。

由于 \(X\) 和 \(Y\) 是独立的泊松变量:

\(T = X + Y \sim Po(4 + 6) = Po(10)\)

你现在就可以使用 \(\lambda = 10\) 来计算全日总数的任何概率了!


5. 调整发生率 (\(\lambda\))

这是考试问题中很常见的“考法”,所以要特别留意!\(\lambda\) 的数值必须要与题目中的区间相符

如果题目给你一个区间的平均发生率,但是问着另一个不同区间的概率,你必须要先调整 \(\lambda\)。

逐步示例

一个网站平均每个小时收到180次点击。在1分钟的时间内,刚好收到4次点击的概率是多少?

步骤1:找出原始发生率。

发生率是每60分钟180次点击。

步骤2:将发生率 (\(\lambda\)) 调整到新的区间(1分钟)。

平均每分钟发生率 = \(\frac{180 \text{ 次点击}}{60 \text{ 分钟}} = 3\) 次点击每分钟。

我们新的、已调整的 \(\lambda = 3\)

步骤3:在泊松公式中使用新的\(\lambda\)。

我们想找出在这个1分钟区间内有4次点击(\(k=4\))的概率。

所以,我们需要为 \(X \sim Po(3)\) 计算 \(P(X=4)\)。

\(P(X=4) = \frac{e^{-3} \cdot 3^4}{4!} = \frac{e^{-3} \cdot 81}{24} \approx 0.168\)


6. 使用泊松分布近似二项分布

有时,使用二项分布 \(X \sim B(n, p)\) 计算概率会很困难,尤其当 \(n\) 很大的时候。

近似的条件

如果你想使用泊松分布近似一个二项分布,需要满足以下条件:

1. \(n\) 很大(通常 \(n > 50\))。

2. \(p\) 很小(通常 \(p < 0.1\))。

如何进行近似

如果 \(X \sim B(n, p)\) 并且符合上面的条件,你可以用以下方法来近似:

\(Y \sim Po(\lambda) \quad \text{where} \quad \lambda = np\)

逐步示例

一间工厂生产大量电脑芯片。芯片有缺陷的概率是0.005。芯片每400块装一盒。找出一个盒子里面刚好有3块有缺陷芯片的近似概率。

这里 \(n = 400\)(很大)而 \(p = 0.005\)(很小)。

设定 \(\lambda = np = 400 \times 0.005 = 2\)。

设 \(Y \sim Po(2)\),因此:

\(P(Y=3) = \frac{e^{-2} \cdot 2^3}{3!} = \frac{e^{-2} \cdot 8}{6} \approx 0.180\)


7. 使用正态分布近似泊松分布

当发生率参数 \(\lambda\) 很大时,计算泊松概率可能会变得相当繁琐。在这种情况下,我们可以使用连续的正态分布来近似泊松分布。

正态近似的条件

\(\lambda > 15\)(或 \(\lambda\) 足够大)。

如何进行近似

如果 \(X \sim Po(\lambda)\) 且 \(\lambda > 15\),我们可以使用以下分布来近似 \(X\):

\(Y \sim N(\mu, \sigma^2) \quad \text{where } \mu = \lambda \text{ and } \sigma^2 = \lambda\)

连续性修正(关键步骤!)

因为我们是用连续分布来近似离散分布,所以必须进行连续性修正(\(\pm 0.5\)):

\(P(X = k) \approx P(k - 0.5 < Y < k + 0.5)\)

\(P(X \le k) \approx P(Y < k + 0.5)\)

\(P(X \ge k) \approx P(Y > k - 0.5)\)

\(P(a \le X \le b) \approx P(a - 0.5 < Y < b + 0.5)\)