歡迎來到營運韌性(Operational Resilience)的世界!
你好!歡迎來到 FRM Part II 課程中最實用、最「貼近現實」的章節之一。過去,銀行主要專注於預防問題發生。但時至今日,監管機構和管理層都意識到,無論我們多麼努力,事情終究會出錯(想想網絡攻擊、電力中斷或疫情)。
本章的主題是營運韌性。我們不再只問「如何防止這件事發生?」,現在我們問的是:「當事情發生時,我們該如何維持業務中最關鍵的部分運作,以確保不會損害客戶或經濟?」讓我們深入探討吧!
1. 什麼是營運韌性?
營運韌性是指企業在面對營運中斷時,預防、適應、應對、復原以及從中學習的能力。這是一種思維上的轉變,從單純的「業務連續性規劃(Business Continuity Planning)」轉向更宏觀的生存視角。
核心區別:
傳統風險管理通常會問:「伺服器故障的機率是多少?」
營運韌性則會問:「伺服器已經故障了。在修復的過程中,我們如何繼續為客戶提供服務?」
類比:現代汽車
想想汽車的安全功能。「預防性」措施是煞車(試圖阻止碰撞發生)。而「韌性」則是安全氣囊和車身潰縮區。即使碰撞已經發生,但「服務」(保護乘客生命)仍在持續。
重點總結:營運韌性假設中斷必然會發生,並專注於在這些時刻維持關鍵服務的運作。
2. 重要業務服務 (Important Business Services, IBS)
一家銀行會處理成千上萬的事情,從數十億美元的交易清算到印製大廳簡介。但並非所有服務都是平等的。為了具備韌性,我們必須識別出我們的重要業務服務 (IBS)。
IBS 是指企業向外部終端用戶或參與者提供的服務,若該服務中斷,會導致:
1. 對消費者造成不可容忍的損害。
2. 對市場誠信或金融穩定造成風險。
例子:
- 重要:能夠從自動櫃員機(ATM)提款,或使用扣帳卡購買日常用品。
- 非 IBS:員工存取內部假期預約系統的能力。
快速回顧:如何識別 IBS?
專注於外部結果。不要先看內部流程;要看客戶接收到了什麼。如果該服務停止時會導致客戶受到嚴重損害,或者動搖經濟穩定,那麼它就是 IBS。
3. 設定影響容忍度 (Impact Tolerances)
當我們明確了什麼是重要業務服務後,我們需要決定在情況變得不可接受之前,我們可以承受多少「痛苦」。這個限制稱為影響容忍度 (Impact Tolerance)。
影響容忍度是指對 IBS 產生中斷的最大容忍程度,通常以特定指標(通常是時間)來衡量。簡單來說,就是公司宣稱:「我們可以接受該服務中斷 4 小時,但到了 4 小時 1 分鐘,對客戶造成的損害便已達到無法容忍的程度。」
設定容忍度的關鍵因素:
1. 時間:最常見的指標(例如:「必須在 24 小時內恢復」)。
2. 容量:「我們可以承受 5% 的交易失敗,但不能再多了。」
3. 數據完整性:「我們可以丟失一些非必要數據,但帳戶餘額必須 100% 準確。」
如果覺得這部分很難理解,別擔心! 只要記住影響容忍度與風險胃納 (Risk Appetite) 不同。風險胃納是關於你為了獲利而願意承擔的風險;影響容忍度則是關於你為了不辜負客戶或市場,你所能承受的絕對極限。
重點總結:影響容忍度設定在 disruption(中斷)會導致不可容忍的損害之點,而不僅僅是「不便」。
4. 映射 (Mapping):了解依賴關係
要保護一項服務,你需要精確了解它是如何運作的。這就是映射 (Mapping)。你需要識別出使 IBS 能夠實現的所有「要素」。
對於資源映射,請記住助記詞 P.P.T.D.:
- People(人員):誰在執行工作?他們是否都集中在同一棟大樓?
- Processes(流程):具體的操作步驟說明是什麼?
- Technology(技術):使用了哪些伺服器、軟體和網絡?
- Data(數據):執行該服務需要什麼資訊?
常見的錯誤:
學生經常忽略第三方 (Third Parties)。如果你的銀行使用「雲端服務 X」來處理付款,那麼該第三方必須納入你的映射圖中。如果他們掛了,你也跟著掛了!
5. 情境測試:「嚴重但合理」 (Severe but Plausible)
你怎麼知道自己是否真的具備韌性?測試一下就知道了!但你不能只測試簡單的事情,你必須測試嚴重但合理 (Severe but Plausible) 的情境。
什麼是「嚴重但合理」?
- 嚴重:會造成真正打擊的情況,例如數據中心全面崩潰或大規模網絡攻擊。
- 合理:實際上可能會發生的情況。「殭屍末日」很嚴重,但不合理。「全球疫情」對某些人來說曾覺得不合理,但我們現在知道這是一個非常真實的情境!
測試步驟:
1. 選擇情境:例如,大型軟體更新失敗並導致資料庫損毀。
2. 測試應對:我們可以切換到備份嗎?我們可以使用手動替代方案嗎?
3. 對照容忍度進行衡量:我們是否在 4 小時的「影響容忍度」限度內恢復了服務?
4. 補救:如果測試失敗,我們必須投入更好的技術或更多的人力來修復缺口。
你知道嗎?情境測試不僅僅是一次「通過/不通過」的檢查,它的目的是找出你的最弱環節,讓你將預算花在真正需要改進的地方。
6. 溝通與治理 (Communication and Governance)
營運韌性不僅僅是 IT 部門的事,它始於高層。董事會最終負責批准 IBS 清單和影響容忍度。
內部與外部溝通:
當發生中斷時,你需要針對以下方面制定計劃:
- 內部:讓員工了解要做什麼以及如何協助客戶。
- 外部:對客戶、監管機構和媒體保持誠實。清晰的溝通可以防止「銀行擠提」或聲譽的完全崩潰。
重點總結:韌性是一種全公司範圍的文化。如果董事會不重視它,當「嚴重但合理」的事件真的發生時,公司將無法做好準備。
總結快速回顧
1. 識別:我們的重要業務服務 (IBS) 是什麼?(專注於客戶)。
2. 設定:我們的影響容忍度是多少?(時間/容量上的「崩潰點」)。
3. 映射:我們需要哪些資源 (PPTD) 來支撐這些服務?
4. 測試:運行嚴重但合理的情境測試。我們是否維持在容忍度之內?
5. 投入:如果測試失敗,請修復漏洞。
保持積極!營運韌性就是要做好準備並保護系統。一旦你理解了這是關於「在失敗中管理」而不是「避免失敗」,整章內容就會變得容易掌握許多!