対決の時:線形モデル vs. 木ベースモデル!
未来のプロフェッショナルの皆さん、ようこそ!この章では、Exam ATPA(Advanced Topics in Predictive Analytics)において最も重要な実践スキルの一つ、線形モデルと木ベースモデルの結果比較について深掘りしていきます。これはまさに「巨頭対決」です。一方には、信頼性の高い定番である線形モデル(GLMなど)があり、もう一方には、現代的で柔軟な木ベースモデル(ランダムフォレストやXGBoostなど)があります。
「最適な」モデルを選ぶということは、単に誤差が最小のモデルを選ぶことではありません。なぜ一方のモデルが他方を上回るのか、そして予測結果がどのように異なるのかを理解することにあります。最初は少し抽象的に感じるかもしれませんが、大丈夫です。一つずつ丁寧に紐解いていきましょう!
1. 基本的な違いを理解する
結果を比較する前に、この二つのモデルの「思考プロセス」の違いを思い出しておきましょう。
線形モデル(直線アプローチ): これらのモデルは、入力データとターゲットの関係が直線(または滑らかな曲線)であると仮定します。これらは加法性(Additive)に基づいています。
例え話: ケーキを焼くときを想像してみてください。線形モデルはこう考えます。「小麦粉をどれだけ使おうと、砂糖を1カップ追加するごとに正確に100カロリー増える」と。
木ベースモデル(フローチャートアプローチ): これらのモデルは、「もし〜なら」という一連の分岐を使用します。これらは交互作用(Interaction)や非線形パターンを見つけるのが非常に得意です。
例え話: 木モデルはこう考えます。「砂糖を2カップ以上使っていて、かつオーブンの温度が400度を超えていればケーキは焦げる(『悪さ』の非線形な急上昇)が、オーブンの温度が低ければ砂糖の量はそれほど重要ではない」と。
クイック復習:核となる対比
線形モデル: 解釈性(Interpretability)が高い。ただし、手動で交互作用項を追加しない限り、複雑で「うねった」データ関係を扱うのは苦手です。
木ベースモデル: 柔軟性(Flexibility)が高い。複雑なパターンを自動的に捉えるのは得意ですが、取締役会などに説明するのが難しい場合があります(いわゆる「ブラックボックス」問題)。
2. 予測精度の比較
ATPAのプロジェクトでGLM(線形)とGBM(木ベース)の両方を実行する場合、実際の予測性能を比較する必要があります。通常は以下の指標を確認します。
注目すべき主要指標:
1. RMSE(二乗平均平方根誤差): 予測が平均してどれだけ外れているかを示します。値は小さいほど良いです!
2. MAE(平均絶対誤差): RMSEに似ていますが、大きな外れ値の影響を受けにくいです。
3. 逸脱度(Deviance): GLMにおいて、モデルがデータの分布にどれだけ適合しているかを評価するためによく使われます。
「なるほど!」の瞬間: もし木ベースモデルのRMSEが線形モデルよりも大幅に低いなら、それはデータに非線形性や複雑な交互作用が含まれており、線形モデルでは捉えきれていないという大きなヒントです。
避けるべきよくあるミス:
過学習の罠: 木ベースモデルがトレーニングデータで完璧なスコアを出したからといって、それが優れているとは限りません。必ずテストデータ(または交差検証)で結果を比較してください。木モデルはトレーニングセットのノイズを「丸暗記」してしまうことで悪名高いのです!
3. 予測の「形状」を比較する
これらのモデルを比較する最良の方法の一つは、予測値 vs. 実測値のプロットや、残差プロットを確認することです。
線形モデルの残差: 線形モデルの残差に「U字型」が見られる場合、それはモデルが曲線を捉え損ねていることを意味します。丸いボウルに定規を当てようとしているような状態です。
木モデルの予測: 木モデルは「階段状の関数」を生成します。予測値をプロットすると、階段のように見えます。もし本来の関係性が非常に滑らかな直線である場合、木モデルは滑らかな坂道を階段に変えようとするため、かえって性能が悪くなる可能性があります。
豆知識: 木ベースモデルは外挿(Extrapolation)ができません。トレーニングデータの住宅価格が最大100万ドルであれば、木モデルは新しい大きな家に対して200万ドルの価格を予測することはほぼありません。学習した範囲内の値しか予測できないのです。しかし、線形モデルなら喜んで直線を延長して予測してくれます!
4. 特徴量の重要度 vs. 回帰係数
モデルはどのように「何が重要か」を教えてくれるのでしょうか?これはATPA試験での主要な比較ポイントです。
線形モデルは係数(\(\beta\))を使用します:
係数の大きさ(絶対値)とp値を確認します。
例: 係数が0.5なら、「Xが1単位増えるごとに、ターゲットは0.5増える」という意味です。非常に正確です。
木ベースモデルは変数重要度(Variable Importance)を使用します:
これは通常、利得(Gain)(その変数で分岐したときにモデルの「純度」がどれだけ向上するか)に基づいています。「0.5増える」といった単純なルールは与えられず、どの変数が分岐を作るのに最も役に立ったかを示すだけです。
戦略的ヒント: もし両方のモデルが「年齢(Age)」を最も重要な変数だと一致して判断しているなら、その結論に非常に自信を持っていいでしょう!もし意見が分かれているなら、その理由を調査してください。おそらく「収入(Income)」が低いときだけ「年齢」が重要になる(交互作用)といった理由があるかもしれず、それを木モデルは見つけたのに線形モデルは見逃した可能性があります。
5. 「アクチュアリーの選択」:なぜどちらかを選ぶのか?
ATPAのレポートでは、モデル選択の正当性を説明する必要があります。決定に役立つこの「キーポイント」テーブルを活用しましょう:
線形モデル(GLM)を選ぶべき場合:
- 関係性が主に単純で加法的である。
- 規制当局が明確で数式に基づいた説明(例:\(Y = 2x_1 + 3x_2\))を求めている。
- データセットが小さく、複雑な木モデルだと過学習する恐れがある。
木ベースモデル(GBM/ランダムフォレスト)を選ぶべき場合:
- 予測精度が最優先である。
- 手動でコード化したくない複雑な交互作用がデータに含まれている。
- 欠損値や外れ値が多い(木モデルの方がはるかにうまく処理できます!)。
まとめと重要なポイント
1. ロジック: 線形モデルは加法的で滑らか。木モデルは分岐に基づき、階段状になる。
2. 交互作用: 木モデルは自動的に交互作用を見つける。線形モデルはどこに交互作用があるかを人間が教える必要がある。
3. 外挿: 線形モデルはトレーニング範囲外を予測できる。木モデルはできない。
4. 検証: 過学習の罠を避けるため、常にテストデータやホールドアウトデータを使ってRMSEなどの性能指標を比較する。
5. 解釈性: 線形モデルは明確な係数を提供する。木モデルは相対的な重要度の順位を提供する。
最後に一言: 常に最も「複雑な」モデルを選ばなければならないというプレッシャーを感じる必要はありません。単純な線形モデルの方が、結果として最も堅牢であることもよくあります。ATPAでは、モデルの精度と同じくらい、「なぜそのモデルを選んだのか」という説明が重要視されるのです!