歡迎來到營運韌性(Operational Resilience)的學習旅程!

你好!如果你一直在準備 FRM Part II,你可能花了很多時間學習如何預防風險。但讓我們面對現實吧:在當今世界,問題必然會發生。網絡攻擊、電力網故障、全球疫情,這些都是現實。這一章節《追求營運韌性》標誌著思維模式的轉變。我們不再僅僅問:「我們如何防止這種情況發生?」,而是開始問:「當最壞的情況發生時,我們如何確保最重要的服務持續運作?」

如果這感覺與課程中那些充滿數學運算的章節有所不同,不用擔心。這一切都與策略、管治(Governance)以及常識有關。讓我們開始吧!

1. 什麼是營運韌性?(「吸收與恢復」的心態)

過去,銀行專注於營運風險管理(Operational Risk Management),試圖最大限度地減少損失的頻率和嚴重程度。而營運韌性則更廣泛。它是指企業在遭受重大干擾時,仍能提供其關鍵業務服務(Critical Business Services)的能力。

類比時間: 想像一位職業拳擊手。
營運風險管理 是拳擊手為了躲避拳擊而進行的訓練(規避風險)。
營運韌性 是拳擊手在下巴挨了重擊後,依然能站穩腳跟並繼續比賽的能力(吸收衝擊並從中恢復)。

關鍵差異:風險 vs. 韌性

營運風險: 關注原因(例如:系統故障)和損失(例如:金錢損失)。
營運韌性: 關注服務(例如:客戶是否仍能提款?)和連續性

快速複習: 韌性假設干擾一定會發生。它關注的是服務的生存,而不僅僅是預防事件發生。

2. 董事會與高層管理人員的角色

營運韌性不僅是 IT 問題,更是領導層的問題。 董事會和高層管理人員有責任樹立基調。他們不需要知道如何修復伺服器,但他們必須問對問題,以確保企業已做好準備。

領導層的「五大」關鍵問題

為了確保韌性,董事會應該提出以下五個基本問題:

問題 1:什麼是我們的「關鍵業務服務」?

銀行做很多事情,但並非所有事情都同等重要。如果「員工建議入口網站」當機了,沒關係。但如果「即時總額結算系統(RTGS)」當機了,經濟可能會停擺。
定義: 所謂關鍵服務,是指一旦中斷,將會對客戶或金融體系的穩定性造成不可容忍的損害的服務。

問題 2:我們的「影響承受力(Impact Tolerance)」是多少?

這就是「痛苦閾值」。對於每一項關鍵服務,董事會必須決定:在演變成災難之前,我們能承受多大的干擾?
影響承受力通常以時間來衡量(例如:「此服務中斷時間不得超過 4 小時」)。

問題 3:我們是否繪製了依賴關係圖(Mapping)?

Mapping(映射/繪製)意味著識別提供關鍵服務所需的每一個人、每一項技術、每一棟建築和每一家第三方供應商。如果你不知道你的支付系統依賴於海外的一家小型供應商,你就稱不上具有韌性!

問題 4:我們是否針對「嚴重但合理(Severe but Plausible)」的情境進行了測試?

測試不應該流於形式。銀行應該模擬那些很糟糕但有可能發生的情境——例如雲端服務供應商全面中斷,或是對所有分行進行協調一致的網絡攻擊。
常見錯誤: 只測試「可能」發生的情境。韌性要求測試「極端」情境。

問題 5:我們在危機期間如何溝通?

當事情出錯時,沉默是最大的敵人。管理層需要一個計劃,以便能迅速、清晰地與監管機構、客戶和員工進行溝通。

重點總結: 董事會的工作是將韌性從「科技勾選清單」提升為「戰略優先事項」。

3. 定義影響承受力(「時間與嚴重程度」指標)

設定影響承受力是本章最重要的部分之一。它與「風險胃納(Risk Appetite)」不同。

風險胃納: 「我們願意今年因欺詐損失 1,000 萬美元。」(關注企業的財務健康)。
影響承受力: 「客戶必須能在系統故障後的 2 小時內存取其帳戶。」(關注服務與客戶體驗)。

如何設定影響承受力:

1. 識別服務(例如:按揭貸款處理)。
2. 確定「不可容忍損害」的點(例如:如果停擺 3 天,客戶會因為無法按時完成交易而失去住房)。
3. 設定限制(例如:「必須在 24 小時內恢復」)。

你知道嗎? 監管機構(如英格蘭銀行或聯準會)會密切審查這些承受力指標。如果銀行將承受力設定得太高(例如:「我們可以停擺一週」),監管機構很可能會介入並要求更好的計劃!

4. Mapping:韌性的「管路系統」

為了保護一項服務,你必須了解它是如何從頭到尾運作的,這就是所謂的 Mapping
一份「地圖」包括:

  • 人員(People): 關鍵員工是誰?如果他們生病了,我們有後備人員嗎?
  • 流程(Processes): 步驟操作說明是什麼?
  • 技術(Technology): 使用了什麼硬體和軟體?
  • 數據(Data): 資訊儲存在哪裡?
  • 第三方(Third Parties): 涉及哪些外部供應商?

記憶小撇步: 記住縮寫 P-P-T-D-T(人員、流程、技術、數據、第三方)。這些是每一項服務的基石。

重點總結: Mapping 有助於識別單點故障(Single Points of Failure)。例如,如果只有一名特定的軟體程式設計師知道如何執行結算系統,這就是一個巨大的韌性風險!

5. 測試與經驗教訓

一旦你確定了關鍵服務、影響承受力和 Mapping,你就必須進行測試。

嚴重但合理的情境:
管理層應該問:「如果我們的主要資料中心被水淹了,同時我們的 IT 主管正在一架沒有 Wi-Fi 的飛機上,會發生什麼事?」
目標不是為了「通過」測試;目標是找出系統在哪裡崩潰,以便在真正的危機發生前修復它。

回饋循環(Feedback Loop)

韌性是一個循環:
測試 -> 失敗 -> 學習 -> 改進 -> 重複。
每一次干擾(無論是真實的還是模擬的)都應該為董事會提供一份「經驗教訓」報告。

要避免的常見錯誤: 不要以為只要有災難復原(DR)計劃就代表具有韌性。DR 通常只與「備份資料」有關,而韌性則與「保持業務運作」有關。

6. 總結與最後檢核

讓我們總結一下所學內容。營運韌性是將重點從預防轉向恢復的過程。

快速複習箱:
1. 關鍵服務: 識別對客戶和市場真正重要的內容。
2. 影響承受力: 為服務中斷時間設定硬性限制。
3. Mapping: 了解你的人員、流程、技術、數據和供應商。
4. 測試: 使用「嚴重但合理」的情境來找出你的崩潰點。
5. 管治: 董事會必須通過提出正確的問題來發揮領導作用。

最後鼓勵: 本章探討的是「宏觀視野」。當你回答考試題目時,請時刻思考:「這是否能幫助銀行在災難中繼續為客戶提供服務?」 如果答案是肯定的,你的思考方式就已經像一位韌性專家了!祝你考試順利!