欢迎来到运营韧性(Operational Resilience)的学习旅程!
你好!如果你一直在准备 FRM Part II,你可能花了很多时间学习如何预防风险。但让我们面对现实吧:在当今世界,问题必然会发生。网络攻击、电力网故障、全球疫情,这些都是现实。这一章节《追求运营韧性》标志着思维模式的转变。我们不再仅仅问:“我们如何防止这种情况发生?”,而是开始问:“当最坏的情况发生时,我们如何确保最重要的服务持续运作?”
如果这感觉与课程中那些充满数学运算的章节有所不同,不用担心。这一切都与策略、管治(Governance)以及常识有关。让我们开始吧!
1. 什么是运营韧性?(“吸收与恢复”的心态)
过去,银行专注于运营风险管理(Operational Risk Management),试图最大限度地减少损失的频率和严重程度。而运营韧性则更广泛。它是指企业在遭受重大干扰时,仍能提供其关键业务服务(Critical Business Services)的能力。
类比时间: 想象一位职业拳击手。
运营风险管理 是拳击手为了躲避拳击而进行的训练(规避风险)。
运营韧性 是拳击手在下巴挨了重击后,依然能站稳脚跟并继续比赛的能力(吸收冲击并从中恢复)。
关键差异:风险 vs. 韧性
运营风险: 关注原因(例如:系统故障)和损失(例如:金钱损失)。
运营韧性: 关注服务(例如:客户是否仍能提款?)和连续性。
快速复习: 韧性假设干扰一定会发生。它关注的是服务的生存,而不仅仅是预防事件发生。
2. 董事会与高层管理人员的角色
运营韧性不仅是 IT 问题,更是领导层的问题。 董事会和高层管理人员有责任树立基调。他们不需要知道如何修复服务器,但他们必须问对问题,以确保企业已做好准备。
领导层的“五大”关键问题
为了确保韧性,董事会应该提出以下五个基本问题:
问题 1:什么是我们的“关键业务服务”?
银行做很多事情,但并非所有事情都同等重要。如果“员工建议门户网站”宕机了,没关系。但如果“即时总额结算系统(RTGS)”宕机了,经济可能会停摆。
定义: 所谓关键服务,是指一旦中断,将会对客户或金融体系的稳定性造成不可容忍的损害的服务。
问题 2:我们的“影响承受力(Impact Tolerance)”是多少?
这就是“痛苦阈值”。对于每一项关键服务,董事会必须决定:在演变成灾难之前,我们能承受多大的干扰?
影响承受力通常以时间来衡量(例如:“此服务中断时间不得超过 4 小时”)。
问题 3:我们是否绘制了依赖关系图(Mapping)?
Mapping(映射/绘制)意味着识别提供关键服务所需的每一个人、每一项技术、每一栋建筑和每一家第三方供应商。如果你不知道你的支付系统依赖于海外的一家小型供应商,你就称不上具有韧性!
问题 4:我们是否针对“严重但合理(Severe but Plausible)”的情境进行了测试?
测试不应该流于形式。银行应该模拟那些很糟糕但有可能发生的情境——例如云服务供应商全面中断,或是对所有分行进行协调一致的网络攻击。
常见错误: 只测试“可能”发生的情境。韧性要求测试“极端”情境。
问题 5:我们在危机期间如何沟通?
当事情出错时,沉默是最大的敌人。管理层需要一个计划,以便能迅速、清晰地与监管机构、客户和员工进行沟通。
重点总结: 董事会的工作是将韧性从“科技勾选清单”提升为“战略优先事项”。
3. 定义影响承受力(“时间与严重程度”指标)
设定影响承受力是本章最重要的部分之一。它与“风险偏好(Risk Appetite)”不同。
风险偏好: “我们愿意今年因欺诈损失 1,000 万美元。”(关注企业的财务健康)。
影响承受力: “客户必须能在系统故障后的 2 小时内存取其账户。”(关注服务与客户体验)。
如何设定影响承受力:
1. 识别服务(例如:按揭贷款处理)。
2. 确定“不可容忍损害”的点(例如:如果停摆 3 天,客户会因为无法按时完成交易而失去住房)。
3. 设定限制(例如:“必须在 24 小时内恢复”)。
你知道吗? 监管机构(如英格兰银行或美联储)会密切审查这些承受力指标。如果银行将承受力设定得太高(例如:“我们可以停摆一周”),监管机构很可能会介入并要求更好的计划!
4. Mapping:韧性的“管路系统”
为了保护一项服务,你必须了解它是如何从头到尾运作的,这就是所谓的 Mapping。
一份“地图”包括:
- 人员(People): 关键员工是谁?如果他们生病了,我们有后备人员吗?
- 流程(Processes): 步骤操作说明是什么?
- 技术(Technology): 使用了什么硬件和软件?
- 数据(Data): 信息存储在哪里?
- 第三方(Third Parties): 涉及哪些外部供应商?
记忆小撇步: 记住缩写 P-P-T-D-T(人员、流程、技术、数据、第三方)。这些是每一项服务的基石。
重点总结: Mapping 有助于识别单点故障(Single Points of Failure)。例如,如果只有一名特定的软件程序设计师知道如何执行结算系统,这就是一个巨大的韧性风险!
5. 测试与经验教训
一旦你确定了关键服务、影响承受力和 Mapping,你就必须进行测试。
严重但合理的情境:
管理层应该问:“如果我们主要的数据中心被水淹了,同时我们的 IT 主管正在一架没有 Wi-Fi 的飞机上,会发生什么事?”
目标不是为了“通过”测试;目标是找出系统在哪里崩溃,以便在真正的危机发生前修复它。
反馈循环(Feedback Loop)
韧性是一个循环:
测试 -> 失败 -> 学习 -> 改进 -> 重复。
每一次干扰(无论是真实的还是模拟的)都应该为董事会提供一份“经验教训”报告。
要避免的常见错误: 不要以为只要有灾难恢复(DR)计划就代表具有韧性。DR 通常只与“备份数据”有关,而韧性则与“保持业务运作”有关。
6. 总结与最后检核
让我们总结一下所学内容。运营韧性是将重点从预防转向恢复的过程。
快速复习箱:
1. 关键服务: 识别对客户和市场真正重要的内容。
2. 影响承受力: 为服务中断时间设定硬性限制。
3. Mapping: 了解你的人员、流程、技术、数据和供应商。
4. 测试: 使用“严重但合理”的情境来找出你的崩溃点。
5. 管治: 董事会必须通过提出正确的问题来发挥领导作用。
最后鼓励: 本章探讨的是“宏观视野”。当你回答考试题目时,请时刻思考:“这是否有助于银行在灾难中继续为客户提供服务?” 如果答案是肯定的,你的思考方式就已经像一位韧性专家了!祝你考试顺利!