欢迎来到预测的未来:时间序列分析

时间序列模型 (Time Series Models) 章节的前几部分,你已经学会了如何识别模式、检查平稳性 (stationarity),以及拟合 ARMAARMA 等模型。但为什么我们要费这么大劲做这些分析呢?大多数情况下,是因为我们想知道“下一步”会发生什么。

在本章中,我们将重点放在点预测 (Point Forecasts)(我们对未来的最佳猜测)和预测区间 (Prediction Intervals)(我们对该猜测的信心程度)。如果你曾看过飓风路径图,注意到随着风暴移动距离越远,“不确定性锥 (cone of uncertainty)”就会变得越宽,那么你已经掌握了本章的核心直觉!

如果这些数学公式起初看起来有点吓人,别担心。我们会一步步拆解,让你能够满怀信心地应对 SRM 考试中的相关题目。


1. 点预测:做出最佳猜测

点预测 (Point Forecast) 是一个单一数值,代表我们对时间序列未来数值的最佳估计。在 SRM 考试中,我们通常将时间 \(T\) 对未来时间 \(T+h\) 的预测表示为 \(\hat{y}_{T+h}\)。

预测的黄金法则

当我们从过去(已有数据)跨入未来(无数据)时,针对误差项 (\(\epsilon\)) 我们遵循一个简单的规则:
我们假设未来的随机误差为零。

为什么?因为白噪声 (white noise) 的期望值为零。我们无法预测这些“随机冲击 (random shocks)”,所以我们最好的策略就是假设它们不会将数列推向任何特定的方向。

如何计算不同模型的预测值

1. AR(1) 模型:
AR(1) 模型的公式为 \(y_{t} = \phi_0 + \phi_1 y_{t-1} + \epsilon_t\)。
预测未来一步 (\(h=1\)):
\(\hat{y}_{T+1} = \phi_0 + \phi_1 y_T\)
预测未来两步 (\(h=2\)):
\(\hat{y}_{T+2} = \phi_0 + \phi_1 \hat{y}_{T+1}\)

2. MA(1) 模型:
公式为 \(y_t = c + \epsilon_t + \theta_1 \epsilon_{t-1}\)。
预测未来一步:
\(\hat{y}_{T+1} = c + \theta_1 \epsilon_T\)(其中 \(\epsilon_T\) 是最后一个观测点的残差)。
预测未来两步:
\(\hat{y}_{T+2} = c\)。
等等,为什么 \(\theta\) 项消失了? 因为在预测两步时,我们处理的是 \(\epsilon_{T+1}\),而我们假设其值为零!

重点总结: 对于 MA(q) 模型,预测值在 \(q\) 步后会完全回归到均值。对于 AR(p) 模型,预测值会随着时间推移逐渐衰减至均值。


2. 预测区间:衡量不确定性

即使是最好的模型也不可能完全准确。预测区间 (Prediction Interval)(在此背景下通常也称为置信区间)为我们提供了一个未来数值可能落入的范围。

区间的构成

就像线性回归一样,区间的构建方式如下:
预测值 \(\pm\) (临界值 \(\times\) 标准误)

对于 95% 的区间,公式如下:
\(\hat{y}_{T+h} \pm 1.96 \times \sqrt{Var(e_{T+h})}\)

其中 \(e_{T+h}\) 是预测误差 (forecast error)(未来实际值与我们预测值之间的差额)。

为什么“锥状”会变宽?

试着这样想:你可能很精准地猜到 1 小时后的气温,但要准确猜猜 10 天后的气温就难多了。

在时间序列中:

  • 标准误 (Standard Error) 几乎总是随着预测步长 (\(h\)) 的增加而增加。
  • 当我们向更远的未来进行预测时,我们积累了更多“未知”的随机冲击。
  • 这导致了区间变宽(呈现“扇形”或“锥形”)。

快速复习: - 点预测 = 未来范围的“中点”。 - 预测区间 = 反映我们不确定性的“宽度”。 - 当 \(h\) 增加,不确定性也随之增加。


3. 计算预测误差的方差

这是学生经常卡住的地方,但混乱之中自有规律!让我们看看 AR(1) 模型:\(y_t = \phi y_{t-1} + \epsilon_t\)(为简化起见,假设均值为 0)。

一步预测 (h=1):

误差仅为下一个随机冲击:\(\epsilon_{T+1}\)。
方差仅为 \(\sigma^2_\epsilon\)。

两步预测 (h=2):

误差涉及第 1 步的冲击第 2 步的冲击。
方差为 \(\sigma^2_\epsilon (1 + \phi^2)\)。

h 步预测:

方差为 \(\sigma^2_\epsilon \sum_{j=0}^{h-1} \psi_j^2\)。
注意:\(\psi\) (psi) 权重代表将模型重写为无穷 MA 过程。对于 SRM 考试,你主要需要知道的是,当 \(h \rightarrow \infty\) 时,预测误差的方差会趋近于过程方差 (process variance)(即时间序列的总方差)。

你知道吗? 如果时间序列是平稳的,预测区间不会无限扩大。最终它会根据序列的总方差,稳定在一个最大宽度上。


4. 避免常见错误

错误 1:遗漏常数项。
计算 \(\hat{y}_{T+1}\) 时,别忘了截距项 (\(\phi_0\) 或 \(c\))。如果你漏掉它,你的预测将会向零偏倚。

错误 2:混淆“残差 (residual)”与“误差 (error)”。
MA(q) 模型中,请使用已计算出的现有残差。对于未来步骤,请使用 0。不要试图去“猜测”未来的误差!

错误 3:使用了错误的 Z 分数。
95% 的区间使用 1.96,90% 的区间使用 1.645。务必再三确认题目要求的是哪一个!


5. 总结与重点提示

Exam SRM 的“大局观”:

  • 预测是迭代的: 使用当前值预测下一个值,然后用该预测值去预测再下一个值。
  • 均值回归 (Mean Reversion): 在平稳模型中,长期预测总是会收敛于该过程的均值
  • 误差累积: 预测区间会随着预测时间越远而越宽,因为未来有更多我们目前无法预见的“冲击”(\(\epsilon\))。
  • MA 模型的局限性: MA 模型遗忘过去的速度很快。在 \(q\) 步之后,预测值就仅等于均值,且预测区间会保持恒定。

你做得到的!试着手动练习几个 AR(1) 预测计算,这些规律很快就会变得像直觉一样自然。