欢迎来到时间序列的世界!
各位未来的 FRM 考生,大家好!欢迎来到量化分析(Quantitative Analysis)科目中最重要的章节之一。今天,我们将深入探讨平稳时间序列(Stationary Time Series)。如果你曾经看着股价或利率走势图,心想:“我能预测接下来会发生什么吗?”,那你其实已经在思考时间序列的问题了。
如果刚开始觉得这些内容有点“数学味”太重,请别担心。试着把时间序列想象成一串随时间收集的数据点(例如每日股票回报率)。我们的目标是从过去的规律中寻找线索,借此了解未来。那我们现在就开始吧!
1. 什么是时间序列?
时间序列是一组在连续时间点上测量出的观测值,通常间隔相等(例如每日、每月、每季)。在 FRM 考试中,我们关注这些数列的特性,以便建立可靠的预测模型。
2. 平稳性(Stationarity)的概念
想象一个湖泊。如果水面平静,波浪维持在一定高度内,那么水位的变化是可以预测的。但如果一场大风暴袭来,水位开始无限上升,就很难预测了。平稳性就像那个平静的湖泊。
要让一个时间序列达到协方差平稳(Covariance Stationary)(这是我们采用的标准),它必须满足三个特定条件:
- 常数平均值(Constant Mean): 平均数 \( E(Y_t) \) 不随时间改变。
- 常数变异数(Constant Variance): 数据的“分散程度”或波动率 \( Var(Y_t) \) 保持不变。
- 常数协方差(Constant Covariance): 两个观测值之间的关系(例如今天与昨天)仅取决于它们之间的距离(滞后期,lag),而不取决于具体的时间点。
为什么这很重要? 如果一个序列不是平稳的(例如它具有趋势),我们标准的统计检验结果可能会完全失效。我们需要平稳性来确保过去的数据确实能作为预测未来的可靠依据。
小贴士: 如果你看到的图表显示数据有向上“漂移”的趋势,或者波动幅度越来越大,那么它就不是平稳的。
重点总结: 协方差平稳意味着平均值、变异数和自协方差在时间上都是稳定的。
3. 白噪音(White Noise):最纯粹的随机性
白噪音是平稳过程中最简单的形式。想象一下旧电视的雪花杂讯——那完全是随机的。在白噪音过程中:
- 平均值为零。
- 变异数为常数。
- 不同观测值之间没有相关性(零相关)。
在我们的模型中,我们将“随机误差项”称为 \( \epsilon_t \),即白噪音。它代表了我们无法预测的系统“冲击(shocks)”。
4. 自回归(AR)模型
“Auto”意指“自我”。因此,自回归模型(Autoregressive model)是指将变量对其自身的过去值进行回归的模型。
AR(1) 模型
最常见的版本是 AR(1) 模型,其中今日的数值取决于昨日的数值:
\( Y_t = \phi_0 + \phi_1 Y_{t-1} + \epsilon_t \)
其中:
- \( Y_t \) 是今日的数值。
- \( \phi_0 \) 是常数项(截距)。
- \( \phi_1 \) 是系数(表示昨日对今日影响的程度)。
- \( \epsilon_t \) 是随机冲击(白噪音)。
AR(1) 的平稳条件
要使 AR(1) 模型平稳,系数 \( |\phi_1| \) 必须小于 1。
- 如果 \( \phi_1 = 1 \),我们称之为“随机漫步(Random Walk)”(非平稳)。
- 如果 \( \phi_1 > 1 \),序列会发散至无穷大(非平稳)。
均值回归(Mean Reversion)
平稳的 AR(1) 模型具有均值回归特性。如果一个冲击将价格推高,它最终会回落至其长期平均水平(即“均值水平”)。
均值水平公式: \( \mu = \frac{\phi_0}{1 - \phi_1} \)
重点总结: AR 模型使用过去的数值。对于 AR(1) 来说,要达到平稳,斜率系数必须介于 -1 到 1 之间。
5. 移动平均(MA)模型
别被名字搞混了!这不是技术分析图表中的那种“移动平均线”。在时间序列中,移动平均(MA)模型是指今日的数值取决于过去的随机冲击(误差)。
MA(1) 模型
\( Y_t = \mu + \epsilon_t + \theta_1 \epsilon_{t-1} \)
其中:
- \( \mu \) 是该序列的平均值。
- \( \epsilon_t \) 是今日的冲击。
- \( \theta_1 \) 是给予昨日冲击的权重。
你知道吗? 无论 \( \theta_1 \) 的数值是多少,MA 模型永远是平稳的。这是因为它们只是平稳白噪音项的加权总和。
类比: 将 AR 模型视为“价格的记忆”,而 MA 模型则视为“冲击的记忆”。如果昨天发生了突发新闻,MA 模型会计算该特定冲击在今天仍对价格产生多少影响。
6. ARMA 模型
有时候,过去的数值 AND 过去的冲击同样重要。我们会将两者结合起来,成为 ARMA(p, q) 模型。
- p = AR(过去数值)的滞后期数。
- q = MA(过去误差)的滞后期数。
例子: ARMA(1,1) 看起来如下:
\( Y_t = \phi_0 + \phi_1 Y_{t-1} + \epsilon_t + \theta_1 \epsilon_{t-1} \)
简约原则(Principle of Parsimony): 在 FRM 的世界里,“少即是多”。我们想要的是能很好地解释数据的最简单模型。添加太多的滞后期会导致模型过度拟合(overfit)(在旧数据上表现很好,但在新数据上却失效)。
7. 模型选择:AIC 与 BIC
我们如何决定 ARMA(1,1) 是否优于 ARMA(2,1)?我们使用信息准则(Information Criteria)。这些就像是模型的“评分表”。
- AIC (赤池信息准则 - Akaike Information Criterion)
- BIC (贝叶斯信息准则 - Bayesian Information Criterion)
目标: 选择 AIC 或 BIC 值最低的模型。
重要区别: BIC 比 AIC 更“严格”。它对增加额外参数施加了更大的惩罚。如果你担心模型变得过于复杂,BIC 是你最好的朋友。
记忆技巧: BIC = 对复杂度有 Bigger(较大)的惩罚。
8. 常见陷阱要避免
1. 混淆 AR 和 MA: 请记住,AR 使用 \( Y_{t-1} \)(实际数据),而 MA 使用 \( \epsilon_{t-1} \)(误差)。
2. 平稳性检验: 对于 AR 模型,务必检查是否 \( |\phi| < 1 \)。如果 \( \phi = 1 \),这就是单位根(Unit Root),你的统计结果将会无效!
3. 滞后期选择: 不要只选择 R-squared 最高的一个。请使用 AIC 或 BIC,因为它们考虑了增加变量所带来的“成本”。
重点总结复习
平稳性: 平均值、变异数和自协方差保持不变。
AR(1): \( Y_t \) 取决于 \( Y_{t-1} \)。当 \( |\phi_1| < 1 \) 时平稳。
MA(1): \( Y_t \) 取决于 \( \epsilon_{t-1} \)。永远平稳。
选择: 选择 AIC 或 BIC 最低的模型。
简约: 保持模型简单,以避免过度拟合。
你已经完成了!时间序列可能很棘手,但只要专注于这些核心属性并理解模型背后的逻辑,你就能为考试做好充分准备。继续练习这些公式,你一定能掌握它!