歡迎來到數據探索:了解數據的「形態」
你好!在我們深入研究複雜模型和各種華麗的演算法之前,必須先從最重要的材料入手:數據 (data)。你可以把數據想像成建築房屋的材料。你不會用處理木材的工具去處理磚塊,對吧?同樣地,在 Exam PA 中,你需要辨識不同「類型」的數據,這樣才能知道應該使用哪些「工具」(統計方法)。
在本章中,我們將探討結構化數據 (Structured Data) 和非結構化數據 (Unstructured Data)。別擔心,這些術語聽起來可能有點專業——看完這一頁,你閉著眼都能分辨出它們的區別!
1. 結構化數據:整齊劃一的表格
結構化數據是精算工作的日常,也是最重要的基礎。如果你能想像它完美地存在 Excel 試算表中,且行與列都有明確的標籤,那它通常就是結構化數據。
什麼是結構化數據的特徵?
1. 它有預定義的格式(即「模式/schema」)。
2. 每一列 (column) 代表一個特定的變量(例如年齡、保費或性別)。
3. 每一行 (row) 代表一個獨立的觀察值(例如特定的保單持有人或單一保險理賠案件)。
真實世界範例:
想像一份汽車保單列表。每一條記錄都有「保單號碼」、「生效日期」和「車輛品牌」。這些資料是可以預測的,電腦搜尋起來非常方便。
比喻:
把結構化數據想像成一個瑪芬蛋糕烤盤。你知道每個瑪芬應該放在哪裡,而且因為烤盤的孔位早已固定,每個瑪芬的大小和形狀都差不多。
快速回顧:結構化數據的關鍵特徵
• 可輕鬆儲存在關聯式資料庫 (Relational Databases) (SQL) 中。
• 定量數據(通常是數值或定義明確的類別)。
• 在放入模型前,相較於非結構化數據,所需的「清洗」工作較少。
2. 非結構化數據:資訊的「蠻荒西部」
非結構化數據則是其他所有類型的數據。它沒有預定義的模式,也沒有整齊的表格可供存放。這類數據通常包含大量的文字、圖像或音訊。
在 Exam PA 的情境中,你可能會遇到調整員寫下的理賠備註或客戶電子郵件這類非結構化數據。由於沒有行列之分,電腦無法像讀取試算表那樣輕易地「閱讀」它們。我們通常需要使用特殊的技術(例如文字探勘/Text Mining),將這些數據轉化為數值後,才能進行建模。
真實世界範例:
醫生在醫療檔案上的手寫筆記。一位醫生可能會寫「患者有咳嗽症狀」,而另一位則可能寫「注意:呼吸窘迫」。這裡沒有固定的「欄位」來存放這些資訊,它們僅僅是原始文字。
比喻:
把非結構化數據想像成一個裝滿各種衣物的洗衣籃。襯衫、襪子和帽子全都糾纏在一起。為了釐清它們,你必須先把它們分門別類!
你知道嗎?
據估計,現今產生的所有數據中超過 80% 是非結構化數據!雖然精算師傳統上使用結構化數據,但「大數據」革命使得非結構化數據在預測欺詐或客戶情緒等方面變得越來越重要。
3. 中間地帶:半結構化數據
有時候,數據介於兩者之間,我們稱之為半結構化數據 (Semi-Structured data)。它不存放於整齊的表格中,但具有區分各元素的標籤 (tags) 或標記 (markers)。常見的格式包括 JSON 或 XML 檔案(當你從網站抓取資料時可能會看到)。
記憶小撇步:
• 結構化 = 一堵磚牆(排列完美)。
• 半結構化 = 一套樂高積木(零件各異,但有「凸點」幫助它們連接在一起)。
• 非結構化 = 一團黏土(在塑形前沒有任何固定形狀)。
4. 深入探討:變量的類型
一旦我們有了結構化數據,我們就需要對變量(欄位)進行分類。這在 Exam PA 中是一個非常常見的考點!
A. 數值型 (定量) 變量
這些代表可測量的數量。你可以對它們進行數學運算!我們將其細分為兩類:
1. 連續型 (Continuous): 在一定範圍內可取任何值(例如 \( X = 152.45 \))。範例:身高、保費、理賠金額。
2. 離散型 (Discrete): 可計數的值,通常是整數。範例:家庭汽車數量、一年內的理賠次數。
B. 分類型 (定性) 變量
這些代表群組或標籤。你無法以傳統方式計算它們的「平均值」。
1. 名義型 (Nominal): 沒有自然順序的類別。範例:汽車顏色(紅色、藍色、綠色)。紅色比藍色「更高」嗎?不,它們只是不同的顏色。
2. 次序型 (Ordinal): 具有明確邏輯順序的類別。範例:教育程度(高中、學士、碩士、博士)。我們知道碩士比高中「更高」,但我們無法用簡單的減法精確說明到底「高出多少」。
常見錯誤避雷區:
「數字」陷阱:並非使用了數字就代表它是數值型變量!
範例:郵遞區號 (90210) 是名義型變量。將兩個郵遞區號相加沒有任何意義——這些數字僅僅是用於定位地點的標籤!
逐步指南:如何在 Exam PA 中識別數據類型
當你在考試中看到數據集時,請遵循以下步驟:
步驟 1:觀察格式。它是表格形式嗎?(如果是,那就是結構化數據)。
步驟 2:觀察特定欄位。是數字還是文字?
步驟 3:如果是數字,請自問:「計算這欄的平均值有意義嗎?」(如果有,則為數值型;如果沒有,則可能是分類型/名義型)。
步驟 4:如果是文字/類別,請自問:「有明確的等級或順序嗎?」(如果有,則為次序型;如果沒有,則為名義型)。
總結與關鍵要點
• 結構化數據:以表格(行列)組織。準備好進行分析。
• 非結構化數據:無固定格式(文字、圖像)。需要先經過處理。
• 數值型變量:連續型(任何數值)或離散型(計數)。
• 分類型變量:名義型(無順序)或次序型(有排名)。
• 關鍵點:識別數據類型是數據探索的第一步,因為它決定了你將使用哪種圖表(例如:你會對數值型數據使用直方圖,而對分類型數據使用長條圖)。
別擔心這看起來是否太過基礎——掌握這些定義可以確保你在考試遇到複雜問題時,不會在基礎題上丟分!繼續加油!