歡迎來到大數據的世界!
你好!歡迎來到 CFA Level I 課程中量化方法(Quantitative Methods)最現代、最令人興奮的章節之一。如果你曾經好奇投資公司如何透過停車場的衛星圖像來預測零售銷售,或者 Netflix 如何精準地知道你下一部想看什麼電影,那你絕對來對地方了!
如果你不是「科技掛」的也不用擔心。在這一章中,我們不是要學習寫程式,而是要掌握大數據的概念與專業術語,讓你了解大數據如何改變金融世界。讓我們開始吧!
1. 到底什麼是大數據?
在「舊時代」,數據大多是指試算表裡的數字。今天,數據無處不在。大數據(Big Data)指的是那些規模極大且複雜,以至於傳統數據處理軟體無法應付的數據集。
要記住大數據的特徵,只要記得三個 V:
1. 容量(Volume):數據的絕對量。我們討論的是 TB(兆位元組)和 PB(拍位元組),而不僅僅是 MB(百萬位元組)。例子:紐約證券交易所(NYSE)歷史上的每一筆交易記錄。
2. 速度(Velocity):數據產生和移動的速度。在金融領域,價格以毫秒計在變動。例子:財報會議期間實時更新的社交媒體資訊流。
3. 多樣性(Variety):數據的形式多種多樣。它不僅僅是數字,還包括文字、影片和音訊。例子:PDF 報告、推文(tweets)和衛星照片。
快速複習:3 個 V
Volume(容量) = 大小
Velocity(速度) = 速度
Variety(多樣性) = 類型
2. 這些數據都從哪裡來?
課程將數據來源分為三大類。你可以把它們想成數據產生的「誰」和「哪裡」:
A. 金融市場:這是由交易所產生的數據。包括股票價格、交易量和「限價訂單簿(limit order books)」。這些數據通常非常快速(高速度/Velocity)。
B. 個人:這是你和我產生的數據!每當你在 Instagram 發文、在 Google 搜尋或是刷信用卡時,你都在產生數據。這些數據通常是非結構化(Unstructured)的(例如文字或照片)。
C. 企業/商業流程:這包括「廢氣數據(exhaust data)」(作為商業運作副產品產生的數據),例如庫存記錄,或是來自貨櫃或工廠機器傳感器的物聯網(IoT)數據。
類比:想像一家超市。「金融市場」數據是貨架上的標價。「個人」數據是顧客在 Twitter 上對產品的評價。「企業」數據是牛奶冷藏櫃裡的感應器,提醒經理溫度正在升高。
3. 結構化 vs. 非結構化數據
這是考試非常喜歡出的題目,了解數據組織方式的差異至關重要。
結構化數據(Structured Data):這種數據以高度定義的方式組織,通常是行列形式(如 Excel 試算表)。計算機很容易讀取。例子:財務報表、股票價格。
非結構化數據(Unstructured Data):這類數據雜亂無章,無法放入整齊的表格中。絕大多數大數據都是非結構化的。 例子:社交媒體貼文、新聞報導、公司通話記錄和衛星圖像。
半結構化數據(Semi-Structured Data):介於兩者之間。它具備一定的組織性,但無法完美契合標準表格。例子:HTML 網頁。
重點總結
投資經理正越來越努力將非結構化數據轉化為結構化的見解,以便在競爭中獲得優勢!
4. 機器學習(ML)簡介
如果說大數據是「燃料」,那麼機器學習就是「引擎」。機器學習是人工智慧(AI)的一個領域,計算機在沒有針對每一個步驟進行明確編程的情況下,學習如何在數據中尋找規律。
課程將機器學習分為三大類。別讓這些名字嚇倒你,概念其實相當簡單:
A. 監督式學習(Supervised Learning)
在監督式學習中,計算機被給予「已標籤(labeled)」的數據。這意味著我們給予計算機輸入內容以及正確答案,它學習兩者之間的關係。就像學生在老師提供答案卷的情況下學習一樣。
例子:你給計算機 1,000 張標記為「貓」的照片和 1,000 張標記為「狗」的照片。最終,它學會了自己識別貓。在金融領域,我們可以用它來根據過去破產公司的數據,預測一家公司是否會破產。
B. 非監督式學習(Unsupervised Learning)
在非監督式學習中,沒有標籤,也沒有提供「正確答案」。計算機觀察數據並試圖自己找出隱藏的規律或分組。就像給小孩一盒隨機的積木,看他們如何將其分類一樣。
例子:你給計算機 500 隻不同股票的數據,它根據它們的表現將它們分成不同類別,而不需要你告訴它哪些股票是「科技股」或「能源股」。
C. 深度學習(Deep Learning)
深度學習是一種更複雜的機器學習類型,使用神經網絡(Neural Networks)。這些網絡受到人類大腦的啟發,非常擅長處理語音識別或圖像處理等雜亂的非結構化數據。
記憶口訣:S.U.D.
Supervised(監督式) = Shown the answer(被告知答案)
Unsupervised(非監督式) = Unknown patterns(未知規律)
Deep Learning(深度學習) = Digital brain(數位大腦,即神經網絡)
5. 數據分析的步驟
即使擁有最強大的計算機,你也必須遵循一定的程序。如果輸入的是「垃圾」,得到的也會是「垃圾」!以下是典型的流程:
1. 設定目標:我們想解決什麼問題?(例如:「預測蘋果公司下季的銷售額」)。
2. 數據收集:從各種來源收集數據(API、網頁抓取等)。
3. 數據準備(清洗/整理):這通常是最困難的部分!你必須清洗數據、處理缺失值,並確保一切格式正確。
4. 數據探索:視覺化觀察數據,找出異常值或有趣的趨勢。
5. 模型訓練:這就是機器學習發揮作用的地方!執行算法來尋找規律。
6. 解釋與評估:檢視結果。模型真的有效嗎?它的準確度如何?
常見錯誤:學生常以為「模型訓練」是第一步。其實它是最後幾步之一!你大部分時間都花在清洗數據上(步驟 3)。
6. 神經網絡:深入觀察
你可能會看到關於神經網絡結構的問題。只要記住這三個部分:
1. 輸入層(Input Layer):數據進入系統的地方。
2. 隱藏層(Hidden Layers):這是魔法(以及數學)發生的地方。可以有很多層。它們分階段處理資訊。
3. 輸出層(Output Layer):最終的結果或預測。
類比:想像一個廚房。原始食材就是輸入。在後台工作的廚師和助理就是隱藏層。端給顧客的成品餐點就是輸出。
7. 最後總結清單
在進行練習題之前,確保你能回答以下問題:
- 我能說出 3 個 V 嗎?(容量 Volume、速度 Velocity、多樣性 Variety)
- 我知道結構化數據與非結構化數據的區別嗎?
- 我能解釋監督式(已標籤)與非監督式(未標籤)學習的區別嗎?
- 我理解「數據準備」是整個過程中非常重要的一部分嗎?
你能做到的!大數據聽起來可能很可怕,但它只是一套幫助我們做出更好投資決策的新工具。繼續努力吧!