歡迎踏上你的預測分析(Predictive Analytics)之旅!

剛開始準備 Exam PA 時,可能會覺得像是在學一種新語言,但別擔心——這裡面大多數的概念,其實都是你憑直覺就能理解的東西。在這章裡,我們將探討任何預測模型中的「原材料」:變數(Variables)。了解你手上的數據類型是「數據探索(Data Exploration)」的第一步,因為它決定了你將繪製什麼圖表以及建立什麼模型。讓我們開始吧!

1. 全局觀:變數的角色

在我們將數據按「類別」分門別類之前,我們需要先了解每一項數據在模型中扮演的角色。在預測建模中,我們通常有兩個主角:

目標變數(「目標」)

目標變數(Target Variable)(也稱為回應變數(Response)應變數(Dependent Variable))是你試圖預測或解釋的對象。在 Exam PA 的專案中,商業問題總會指引你找到一個明確的目標。
比喻: 如果你試圖預測烤蛋糕需要多久,那麼「烘烤時間」就是你的目標變數。

預測變數(「配料」)

預測變數(Predictors)(也稱為特徵(Features)自變數(Independent Variables)解釋變數(Explanatory Variables))是你用來進行預測的資訊。
比喻: 為了預測烘烤時間,你可能會查看烤箱溫度、麵糊重量以及你所在廚房的海拔高度。這些就是你的預測變數。

公式小檢查:
在許多教科書中,你會看到兩者的關係寫成:
\( Y = f(X) + \epsilon \)
其中:
\( Y \) = 目標變數。
\( X \) = 預測變數。
\( f \) = 我們試圖尋找的數學函數或模型。
\( \epsilon \) (epsilon) = 我們無法解釋的「雜訊」或隨機誤差。

關鍵點: 預測建模簡單來說,就是使用預測變數 (X) 來估計目標 (Y)

2. 定性(類別)變數

定性變數(Qualitative variables)代表的是描述或「組別」,而非測量值。這些變數描述了觀測對象的某種特質。我們將其分為兩大類:

名義變數(僅有名稱)

名義變數(Nominal variables)是指沒有邏輯順序的類別。一個類別並不會比另一個「更高」或「更好」。
例子: 性別、髮色、居住州份,或保險單類型(汽車險 vs. 房屋險)。
記憶小撇步: Nominal(名義)= Name(名稱)。

次序變數(順序很重要)

次序變數(Ordinal variables)是指類別之間有明確的順序,但類別之間的數學距離是不固定的。
例子: 教育程度(高中、學士、碩士、博士)或客戶滿意度(低、中、高)。
比喻: 想像一場賽跑。跑出第 1、第 2 和第 3 名是次序關係。你知道第 1 名比第 2 名快,但單看排名並不知道具體快了「多少」。

重點複習表:
- 名義: 沒有順序的類別(紅、藍、綠)。
- 次序: 有明確等級的類別(小、中、大)。

3. 定量(數值)變數

定量變數(Quantitative variables)是代表可測量數量的數字。你可以對這些數值進行運算(例如計算平均值)。我們將其分為兩組:

離散變數

離散變數(Discrete variables)是你數出來的東西。它們通常取整數值,且數值之間有「間隙」。
例子: 一個人提出的索賠次數、家庭擁有的汽車數量,或家庭中的子女數量。
檢查: 你能有 2.47 個孩子嗎?不能。這代表它是離散的。

連續變數

連續變數(Continuous variables)是你測量出來的東西。它們可以在某個範圍內取任何值,包括小數。
例子: 索賠損失的確切美元金額、一個人的年齡,或其年收入。
檢查: 一筆索賠金額可以是 $1,205.52 嗎?可以。這讓它是連續的。

你知道嗎? 有時在 Exam PA 中,離散與連續之間的界線會變得模糊。例如,年齡在技術上是連續的(你可以是 25.432 歲),但通常會記錄為離散的整數(25 歲)。如果發生這種情況,請不要驚慌,只需觀察數據在資料集中實際是如何存儲的即可。

4. 你需要知道的專門術語

當你閱讀 Exam PA 的教材時,你會經常看到這些術語。我們現在來釐清一下:

二元(或二分)變數(Binary / Dichotomous Variables):一種特殊的類別變數,只有兩個選項。通常為 0/1、是/否,或通過/不通過。
虛擬變數(Dummy Variables / Indicators):將類別變數轉化為數字以便電腦理解的過程。例如,如果你有「性別」,你可能會建立一個名為「Is_Female」的變數,其中 1 代表是,0 代表否。
水準(Levels):這是指定性變數中的不同類別。如果「顏色」有紅、藍、綠,我們就說該變數有 三個水準(three levels)
觀測值(Observations):這就是數據中的行(rows)。每一行代表被測量的一個獨立「個體」(例如一個保單持有人或一份索賠案件)。

5. 需避免的常見陷阱

陷阱 1:將次序變數視為名義變數。
如果你將「信用評分等級」(差、中、好)視為名義變數,你的模型就會丟失「好」優於「差」這一重要的資訊。

陷阱 2:混淆標籤與數字。
有時數據會用數字作為標籤。例如,「區域 1、區域 2、區域 3」。即使它們是數字,它們實際上是名義變數。將「區域 1」加上「區域 2」並不會變出「區域 3」。

陷阱 3:忘記目標變數的類型。
這是最重要的一點!如果你的目標連續的(如索賠成本),你處理的是迴歸(Regression)問題。如果你的目標類別的(如「客戶會續保嗎?」),你處理的是分類(Classification)問題。

本章總結

1. 預測變數 (X) 用於預測目標變數 (Y)
2. 定性數據是類別性的。分為名義(無順序)次序(有順序)
3. 定量數據是數值性的。分為離散(數出來的)連續(測量出來的)
4. 目標變數的類型決定了你的建模方法:數字型選迴歸,類別型選分類

如果這些標籤看起來很多,請別擔心!當你在接下來的章節中接觸實際數據時,這些定義就會變得自然而然。你一定可以的!