歡迎來到特徵工程的藝術世界!

哈囉!歡迎來到 Exam PA 當中最具創意的一部分。在本章中,我們將探討從現有數據中建立特徵。如果說數據科學是一門烹飪藝術,那麼原始數據就是你的基本食材(如麵粉和雞蛋),而特徵工程就是透過攪拌、揉捏和調味,將它們變成一道美味佳餚的過程。

這裡的目標很簡單:我們要將原始變數轉換為一種能幫助預測模型更清楚地「看見」規律的格式。如果現在覺得這有點抽象,別擔心——我們將會一步步拆解!


1. 什麼是特徵工程?

特徵工程是運用領域知識(domain knowledge),從現有變數中創造出新變數(特徵)的過程。如果數據沒有以正確的方式呈現,即使是最強大的機器學習演算法,也可能難以找出其中的規律。

類比:想像你在黑暗的房間裡看書。你可以看到物體的輪廓,但無法看清楚文字。特徵工程就像是打開一盞燈——它突顯了關鍵資訊,讓模型可以輕鬆地閱讀。

快速回顧:我們建立特徵的目的是為了:
• 捕捉非線性關係。
• 簡化複雜的數據。
• 讓模型對利益相關者而言更具可解釋性。


2. 建立指標變數(虛擬變數 / Dummy Variables)

大多數模型(如線性迴歸或廣義線性模型 GLMs)無法直接處理「文字」。它們需要數字。指標變數(通常稱為虛擬變數)能將類別標籤轉換為 0 和 1。

運作原理:

如果你有一個包含三個層級的變數「顏色」:紅、藍、綠,你需要為它們建立新的欄位。如果是紅色,「紅」欄位填入 1,其餘欄位填入 0。

「參考層級」陷阱:

重點提示:如果你有 n 個類別,通常只需要 n - 1 個虛擬變數。缺失的類別會自動成為參考層級(Reference Level)

範例:如果你知道一輛車既不是紅色也不是藍色,那它「一定」是綠色。因此,我們不需要額外的「綠色」欄位。加入它反而可能導致多重共線性(multicollinearity),這可能會導致某些模型失效!

常見錯誤:別忘了你選了哪一個類別作為參考基準!你的模型係數全都是相對於該基準進行解讀的。


3. 分箱(離散化 / Binning)

分箱是將連續數值變數(如年齡)轉換為類別(如「青年」、「中年」、「老年」)的過程。

為什麼要這樣做?

有時候,變數與目標變數之間的關係並非平滑的直線。例如,健康保險理賠率在嬰兒時期可能很高,青少年時期較低,到了老年又變高。一個簡單的線性模型可能會錯過這種「U 型」關係。透過將年齡分箱成不同組別,模型就能為每個組別賦予不同的權重。

你知道嗎?雖然分箱能讓結果更容易向管理層解釋,但你確實會損失一些細節。如果你對「收入」進行分箱,模型會將賺 50,001 元的人和賺 99,999 元的人視為相同,只要他們都落在同一個「中等收入」區間內。


4. 交互作用項(Interaction Terms)

這對 Exam PA 來說非常重要!當一個變數的影響效果取決於另一個變數的層級時,就會發生交互作用

數學公式: \( Y = \beta_0 + \beta_1 X_1 + \beta_2 X_2 + \beta_3 (X_1 \times X_2) \)

現實生活範例:考慮運動飲食。兩者對健康都有好處。但如果你既運動「又」吃得健康,其綜合效益可能大於兩者單獨效益的總和。這種額外的「加成」就是交互作用效應

類比:咖啡與糖。咖啡是苦的,糖是甜的。兩者結合後,創造出一種與單獨喝咖啡或單獨吃糖完全不同的風味。它們「交互作用」改變了整體的體驗。


5. 數學轉換

有時候,原始數據呈現「擠壓」狀態或帶有曲線。我們利用數學轉換來將其「拉直」。

對數轉換(Log Transformation)

當數據呈現右偏(right-skewed)時(意味著有一些極端大值,如房價或執行長薪水),我們通常使用對數 \( \log(x) \)。對數轉換能將這些極端離群值「拉回來」,並將較小的數值區間擴大。

多項式轉換(Polynomial Transformations)

如果關係看起來像曲線,我們可以加入平方項: \( X^2 \)。
範例:汽車煞車所需的距離取決於速度的「平方」。

記憶小撇步:遇到「長」尾巴(Long tail)就用「對數」(Log)!如果你的數據右側有長尾,對數轉換就是你最好的朋友。


6. 處理日期與時間

像「2023-10-15」這樣的原始日期對於迴歸模型來說是無用的。我們需要從中提取出「精華」!

常見的提取特徵:
星期幾:銷售額在週六是否較高?
月份/季節:人們是否在冬天購買更多暖氣機?
假日指標:是否為公眾假期(二元變數 0/1)?
經過時間:距離客戶上次購買已經過了多少天?


7. 關鍵總結

快速回顧箱:
虛擬變數:將文字轉換為 0/1。記得 n-1 規則!
分箱:將數字分組進「桶子」裡,以捕捉非線性步驟。
交互作用:當 X 的效果取決於 Y 時使用。
對數:用於修正右偏數據並穩定變異數。
日期:將它們拆解成「日」或「月」等片段。

最後建議:在 PA 考試中,請務必解釋你「為什麼」要建立這個特徵。不要因為可以做就去做。問問自己:「這能幫助模型更好地解釋目標變數嗎?」如果答案是肯定的,那你就走在正確的道路上!

繼續練習!特徵工程是你展現精算直覺的最佳舞台。你一定做得到的!