決定木 vs. 線形モデル:勝負の時!
皆さん、こんにちは!これまで線形回帰の仕組みと、決定木がデータをどのように枝分かれさせるかを学んできましたね。では、いよいよ重要な問いに向き合いましょう。「結局、自分のモデルにはどちらを使えばいいの?」
この章では、この2つの強豪モデルを徹底比較します。結論から言うと、どんな状況でも勝てる「完璧なモデル」は存在しません。勝負の行方は、あなたが扱うデータによって決まります。このノートを読み終える頃には、どちらのツールを選ぶべきかが明確になり、Exam SRMの得点アップにつながるはずです!
1. 基本理念:直線か、箱(領域)か
どちらのモデルが優れているかを理解するために、まずはそれぞれの「世界の見方」を見てみましょう。最初は少し抽象的に感じるかもしれませんが、大丈夫です。シンプルなイメージで捉えていきましょう。
線形モデル
線形モデル(線形回帰など)は、予測変数と目的変数の関係が「直線」(高次元なら平坦な平面)であると仮定します。数式で表すと以下のようになります。
\( Y = \beta_0 + \beta_1X_1 + \beta_2X_2 + ... + \epsilon \)
決定木
決定木は直線など気にしません。その代わり、データを矩形(長方形)の領域に分割(パーティション化)します。類似したデータをグループ化するために「切り分けポイント」を探すのです。数式は「もし~ならば、こうする」という一連の命令のように見えます。
\( f(X) = \sum_{m=1}^M c_m \cdot I(X \in R_m) \)
たとえ話:庭を「花壇エリア」と「野菜エリア」に分けようとしている場面を想像してください。
- 線形モデルは、庭に一本の真っ直ぐなフェンスを引くようなもの。
- 決定木は、特定の植物を囲うためにいくつもの小さな長方形の箱を並べるようなもの。
ここがポイント:
自然界の真の関係性が線形であれば、線形モデルの方が通常うまく機能します。関係性が複雑で非線形であれば、決定木の方が有利になる可能性が高いです。
2. それぞれのモデルが輝くとき
どちらのモデルが適しているか、具体的なシナリオを見ていきましょう。これは試験の概念問題で非常によく出るポイントです!
シナリオA:線形関係
データが滑らかな対角線に沿って並んでいると想像してください。線形モデルなら、単一の傾きで完璧に捉えられます。一方、決定木はここで苦戦します。決定木は水平または垂直にしか分割できない(軸並行分割)ため、対角線を真似るには「階段状」のパターンを使わなければなりません。これは効率が悪く、精度も低くなりがちです。
シナリオB:非線形関係
データが別々の「クラスター」に分かれていたり、複雑な交互作用がある場合(例:特定の薬が「50歳以上」かつ「高血圧」の人にしか効かない)を想像してください。線形モデルでは、手動で複雑な交互作用項を追加しない限り、この関係を見逃してしまいます。決定木は、年齢で分割し、さらに血圧で分割することで、これらの交互作用を自動的に見つけ出します。
クイックレビュー:
- 線形モデルが勝つとき: 関係が概ね加法的かつ線形である。
- 決定木が勝つとき: 予測変数間に高度で複雑な交互作用がある。
3. メリットとデメリット:徹底比較
SRMの勉強をする際は、これら2つの手法のトレードオフをまとめた「チートシート」を持っておくと便利です。
決定木
メリット:
1. 解釈のしやすさ: 小規模な決定木は、専門外の人にも非常に説明しやすい(線形回帰の係数よりもずっと簡単です!)。
2. 人間的: 私たちが日常的に意思決定を行うプロセスと似ています。
3. カテゴリデータの扱い: 「ダミー変数」を使わずに定性的変数を簡単に扱えます(実装によりますが)。
4. 可視化: フローチャートとしてモデルをそのまま描き出せます。
デメリット:
1. 高い分散(High Variance): これが最大の問題です!データが少し変わるだけで、全く別の木が出来上がってしまいます。
2. 予測精度: 単一の木は、線形モデルやより高度な「アンサンブル」手法(ランダムフォレストなど)に比べて予測精度が劣ることが一般的です。
3. 滑らかさの欠如: ステップや箱を使うため、滑らかで緩やかな変化を予測するのが苦手です。
線形モデル
メリット:
1. 安定性: 通常、単一の決定木よりも分散が低いです。
2. 統計的推論: 変数が「統計的に有意」かどうかを判断するp値や信頼区間の計算が簡単です。
3. 効率: 世界が線形であるならば、これ以上の強力なツールはありません。
デメリット:
1. 硬直性: 世界を直線だと決めつけるため、しばしば単純化しすぎです。
2. 手作業: 変数同士が影響し合っていると考えられる場合、手動で「交互作用項」(\( X_1 \times X_2 \)など)を探して追加しなければなりません。
ここがポイント:
決定木は柔軟だが不安定(高分散)。線形モデルは硬直的だが安定(低分散。ただし、モデルが単純すぎると高バイアスになる可能性あり)。
4. よくある間違い
「決定木の方が新しいし、常に優れているのでは?」
間違い: 「より複雑」=「より優れている」と思い込むこと。もし真の関係が線形なら、決定木はノイズまで学習(オーバーフィット)してしまい、未知のデータに対しては低いパフォーマンスしか出せません。
「決定木はトレーニングデータの範囲外の値を予測できる?」
間違い: 決定木は外挿(Extrapolation)ができません。回帰木は葉ノードにある観測値の平均を予測します。トレーニング中に見た最大値よりも大きな値を予測することは決してできません。
豆知識:
現実世界のデータサイエンティストは、両方のモデルを構築し、テスト平均二乗誤差(MSE)を比較することがよくあります。テストセットでの誤差が小さい方を本番環境に採用するのです!
5. 試験対策:要点チェックリスト
この2つを比較する問題が出たら、次の「ルール・オブ・サム(経験則)」を思い出してください。
- 解釈性: 決定木の方が(小さければ)勝ち。
- 非線形データの扱い: 決定木の勝ち。
- 線形データの扱い: 線形モデルの勝ち。
- 分散: 決定木の方が高い(不安定)。
- 予測力: 単一の決定木は線形モデルより弱いことが多いが、木のアンサンブル(バギングやブースティング—他章で扱います)は非常に強力。
最後に:
数式に圧倒されないでください!「直線か、箱か」というイメージを常に頭に置いておきましょう。それぞれのモデルがどのようにデータを切り分けているかを可視化できれば、SOAが繰り出すこの章の概念問題はほぼ解けるはずです。自信を持って取り組んでくださいね!