欢迎来到风险度量质量评估:你的现实检查点

你好!欢迎来到 FRM Part II 课程中最实用的章节之一。在之前的章节中,你已经学会了如何计算像是风险价值 (VaR)预期缺口 (Expected Shortfall, ES) 等风险度量指标。但这里有一个大问题:我们怎么知道这些数字到底准不准?

把它想象成一个天气预报 App。如果 App 说降雨概率只有 1%,但却连续一周每天都倾盆大雨,你大概会直接删掉这个 App!评估风险度量的质量,其实就是给我们的模型“打分数”,看看它们预测未来的准确度如何。这一点至关重要,因为如果我们的模型过于乐观,我们可能无法持有足够的资本来度过金融危机。

在本章中,我们将探讨如何利用历史数据来测试这些模型,这个过程被称为回溯测试 (Backtesting)


1. 风险价值 (VaR) 的回溯测试

回溯测试是一个将 VaR 模型预测的损失与实际发生的损失进行比较的过程。我们主要寻找的是“例外情况”(也称为“违约 (Breaches)”或“异常值 (Outliers)”)。

什么是例外情况?
如果你的 1 日 99% VaR 是 100 万美元,而你今天实际亏损了 150 万美元,这就是一个例外情况。因为损失超过了你的 VaR 预估值。

例外情况的频率

如果我们使用 99% 的 VaR 模型,我们预期例外情况只会发生在 1% 的时间内。在 100 天里,我们预期会有 1 次例外;在 250 天(大约一个交易年度)内,我们预期会有 2.5 次例外。

金发女孩问题 (The Goldilocks Problem):
1. 例外太多: 表示你的模型低估了风险。这是很危险的,因为你对大额亏损毫无准备。
2. 例外太少: 表示你的模型高估了风险。虽然这很“安全”,但却缺乏效率,因为你占用了太多本可以用在其他地方的资金。

核心重点:

一个好的 VaR 模型应该要产生“刚刚好”的例外次数,并与所选择的置信水平保持一致。


2. VaR 的统计测试:Kupiec 测试

如果一开始看到数学公式觉得很可怕,不用担心!这些测试的目标只是为了确定我们看到的例外次数究竟是有统计显著性,还是仅仅因为随机运气。

失败比例 (POF) 测试

由 Kupiec 开发,该测试仅关注例外情况的总次数。它使用概似比 (Likelihood Ratio, LR) 测试来检验观察到的失败率是否与模型设定的目标失败率存在显著差异。

虚无假设 (\( H_0 \)) 为模型是准确的(失败率等于 \( p \))。

Kupiec POF 测试的公式为:
\( LR_{POF} = -2 \ln \left[ \frac{(1-p)^{n-x} p^x}{(1-\hat{p})^{n-x} \hat{p}^x} \right] \)

其中:
- \( n \) = 观察总次数
- \( x \) = 例外情况次数
- \( p \) = 理论失败率(例如:99% VaR 对应 0.01)
- \( \hat{p} \) = 观察失败率 (\( x/n \))

快速回顾: 该测试服从自由度为 1 的卡方 (\( \chi^2 \)) 分布。如果 \( LR \) 值高于临界值(在 95% 置信水平下通常为 3.84),我们就拒绝该模型!


3. 独立性测试:Christoffersen 测试

Kupiec 测试有一个缺陷:它只计算例外情况的总数,而不关心它们何时发生。试想如果一家银行在单周内出现了 5 次例外,即使他们全年总共只有 5 次例外,集中出现也暗示模型没有对不断变化的市场状况做出反应。这被称为波动率聚类 (Volatility Clustering)

Christoffersen 独立性测试检查例外情况是否彼此独立。它问的是:“如果昨天发生了例外,今天发生例外的概率是否会更高?”

回溯测试质量的三个阶段:
1. 无条件覆盖 (Unconditional Coverage): 我们得到的例外数量是否正确?(Kupiec 测试)
2. 独立性 (Independence): 例外情况是否随机分布
3. 条件覆盖 (Conditional Coverage): 两者的结合——我们是否得到了正确的数量,且它们是均匀分布的?

记忆小撇步: Kupiec 负责计算数量,Christoffersen 负责检查分布!


4. 巴塞尔“红绿灯”系统

监管机构(巴塞尔委员会)使用一套简单的颜色编码系统,根据银行在过去 250 天(以 99% 置信水平计算)的回溯测试结果来进行惩罚。

1. 绿灯区(0 到 4 次例外):
模型被认为是“好的”。没有监管惩罚。资本要求的“乘数因子”维持在基础水平(通常为 3)。

2. 黄灯区(5 到 9 次例外):
模型处于“有疑问”状态。监管机构会通过增加一个“加号 (plus)”因子到你的乘数中来提高你的资本要求。这就像收到一张警告罚单。

3. 红灯区(10 次及以上例外):
模型“失效”了。该模型几乎肯定有瑕疵。乘数会显著增加(通常增加 1.0),监管机构甚至可能强制银行完全停止使用该模型。

你知道吗?“红灯区”从 10 次开始是因为一个正确的 99% 模型在 250 天内产生 10 次以上例外的概率非常低(小于 0.01%)。


5. 预期缺口 (ES) 的回溯测试

预期缺口 (ES) 进行回溯测试比对 VaR 进行回溯测试要困难得多。这是因为 VaR 只关注亏损超过某个金额的频率,而 ES 关注的是当超过 VaR 时,实际亏损了多少

“可引出性 (Elicitability)”的挑战

用专业术语来说,VaR 是可引出的 (elicitable),这意味着存在一种数学评分函数,可以用来轻松比较不同模型。直到最近,人们还认为 ES 不具备可引出性,这使得对其进行回溯测试变得更加困难。

ES 回溯测试的标准化方法

由于我们不能单纯地计算“命中次数”,我们通常会使用条件分布。我们观察的是例外情况的“规模”。如果我们的 ES 是 200 万美元,但在出现例外时的实际平均损失高达 1000 万美元,那么这个 ES 模型就没有捕捉到“尾部风险”。

常见陷阱: 学生常认为 ES 更好,因为它能捕捉到尾部风险(这是事实),但他们忘了它比 VaR 更难验证和进行回溯测试!


6. 模型风险与验证

模型风险是指因使用错误或被误用的模型而导致损失的风险。评估风险度量的质量不仅仅是数学问题,更是治理问题。

模型验证的核心组成:

1. 概念健全性: 模型是否有意义?假设是否现实?
2. 持续监控: 回溯测试应该是持续进行的,而不是一年一次。
3. 结果分析: 将模型产出的结果与实际市场表现进行比较(这就是我们一直在讨论的)。

回溯测试中的“两类错误”:
- 第一类型错误 (Type I Error): 拒绝了一个的模型(模型本身没错,只是碰巧发生了一连串倒霉的市场波动)。
- 第二类型错误 (Type II Error): 接受了一个的模型(模型有瑕疵,但我们还没有观察到足够多的例外来证实它)。

快速回顾: 监管机构更担心第二类型错误(错失了一个糟糕的模型),因为这可能导致银行倒闭!


总结清单

- VaR 回溯测试: 通过计算例外次数,将预测损失与实际损失进行比较。
- Kupiec POF: 测试例外情况的总频率是否正确。
- Christoffersen: 测试例外情况是否独立(不出现聚类)。
- 巴塞尔红绿灯系统: 绿灯 (0-4)、黄灯 (5-9)、红灯 (10+)。惩罚随例外次数增加。
- ES 回溯测试: 难度较高,因为 ES 不易引出;需要观察损失的严重程度,而不仅仅是次数。
- 模型风险: 永远存在!验证需要检查假设,而不仅仅是进行回溯测试。

如果统计公式让你感到沉重,请别担心。对于 FRM 考试,重点在于理解逻辑:为什么我们需要这些测试、“聚类”意味着什么,以及巴塞尔红绿灯系统如何影响银行的资本要求。你一定没问题的!