モデルの精度評価へようこそ!

統計的学習の旅を進める中で、モデルを構築する方法は無数にあることを学びました。しかし、ここで最も重要な問いが浮かびます。「どのモデルが実際にベストなのか、どうすればわかるのでしょうか?」

ランニングシューズを選ぶことに例えてみましょう。お店で履いたときは最高に見えても(学習データ)、実際に走ってみると靴擦れしてしまう(テストデータ)なら、そのシューズはあまり役に立ちませんよね!この章では、私たちが作ったモデルが現実世界でしっかり機能するかを確認するための「ストレステスト」の方法を学びます。最初は少し数学的に見えるかもしれませんが、大丈夫です。一つずつ丁寧に紐解いていきましょう。

1. 当てはまり(適合度)の測定

モデルがどれだけうまく機能しているかを評価するには、実際値予測値の間の距離を測定する方法が必要です。(数値を予測する)回帰問題において、最も一般的なツールは平均二乗誤差(MSE: Mean Squared Error)です。

平均二乗誤差(MSE)を理解する

MSEは、私たちの予測が平均してどれくらい外れているかを教えてくれます。公式は以下の通りです。
\( MSE = \frac{1}{n} \sum_{i=1}^{n} (y_i - \hat{f}(x_i))^2 \)

ここで:
- \( y_i \) は実際値です。
- \( \hat{f}(x_i) \) はモデルによる予測値です。
- \( n \) は観測データの数です。

例え話:アーチェリーの的
あなたが的に向かって矢を射る場面を想像してください。的の中心(ブルズアイ)が実際値(\( y_i \))で、あなたの射た矢が予測値(\( \hat{f}(x_i) \))です。MSEは、矢が的の中心からどれだけ離れているかの「距離の二乗」の平均を測るものです。MSEが小さいということは、あなたは非常に精度の高い射手であるということです!

学習MSEとテストMSE

これはSRM試験において非常に重要な区別です:
1. 学習MSE(Training MSE): モデルの構築に使ったデータを使って計算されます。これは、何度も練習したことのある的で練習するようなものです。
2. テストMSE(Test MSE): モデルが一度も見たことのない新しいデータを使って計算されます。これが、モデルの精度を測る「真の」テストです。

重要なポイント: 私たちは、学習MSEがどれだけ低いかについては実のところあまり気にしません。重要なのはテストMSEです。なぜなら、モデルは学習データを丸暗記することで(これを過学習(Overfitting)と呼びます)「ズル」ができてしまい、未知のデータに対しては無惨にも失敗してしまう可能性があるからです。

クイック復習:
- 学習MSEが高い + テストMSEが高い = 未学習(Underfitting)(モデルが単純すぎる)。
- 学習MSEが低い + テストMSEが高い = 過学習(Overfitting)(モデルが複雑すぎる、あるいはノイズを暗記している)。
- 学習MSEが低い + テストMSEが低い = 「ちょうどいい」ゾーン(Goldilocks Zone)(モデルが完璧!)。

2. バイアスと分散のトレードオフ

なぜテストMSEはこのような挙動をするのでしょうか?実は、期待されるテストMSEは、3つの基本的な要素に分解できることがわかっています。この「トレードオフ」を理解することが、統計的学習における「聖杯」となります。

誤差の3つの構成要素

\( E(y_0 - \hat{f}(x_0))^2 = Var(\hat{f}(x_0)) + [Bias(\hat{f}(x_0))]^2 + Var(\epsilon) \)

1. 分散(Variance):
分散とは、別の学習データセットを使った場合にモデルの予測値がどれくらい変化するかを指します。
例: すべてのデータ点を通ろうとする非常に「波打った(複雑な)」モデルは高い分散を持ちます。データ点をたった1つ変えるだけで、曲線全体が形を変えてしまうからです。

2. バイアス(Bias):
バイアスとは、(非常に複雑かもしれない)現実の問題を、より単純なモデルで近似することから生じる誤差です。
例: 真のモデルが曲線であるにもかかわらず、直線でモデル化しようとすると、高いバイアスが生じます。現実とは合わない単純な形状に「偏っている(バイアスがかかっている)」状態です。

3. 削減不可能な誤差(Irreducible Error: \( Var(\epsilon) \)):
これはデータに含まれる「ノイズ」であり、モデルがいかに優れていても予測することはできません。空中で矢が風に煽られるようなもので、あなたのコントロールの及ばないものです。

バランスを見つける

モデルをより柔軟に(複雑に)していくと:
- バイアスは減少します(データにうまく当てはまるようになるため)。
- 分散は増加します(特定のデータ点に対して敏感になりすぎるため)。
- テストMSEはU字型を描きます。最初はバイアスの減少とともに下がりますが、やがて分散の影響が大きくなり、再び上昇に転じます。

重要な結論: テストMSEを最小にするには、分散の増加とバイアスの減少がちょうど釣り合う点を見つける必要があります。

3. 分類モデルの精度

ここまで数値(回帰)について話してきましたが、カテゴリー(「デフォルト」対「デフォルトなし」など)を予測する場合はどうでしょうか?これが分類(Classification)です。

学習誤差率

MSEの代わりに、モデルが犯した間違いの割合である誤差率(Error Rate)を使います:
\( \frac{1}{n} \sum I(y_i \neq \hat{y}_i) \)
簡単に言うと:(間違った予測の数)/(予測の合計数)です。

ベイズ分類器(Bayes Classifier)

ベイズ分類器は、理論上「完璧な」分類器です。各観測データに対し、その特徴に基づいて最も確率の高いクラスを割り当てます。
- ベイズ分類器によって生じる誤差率はベイズ誤差率(Bayes Error Rate)と呼ばれます。
- 豆知識: ベイズ誤差率は分類における「削減不可能な誤差」のようなものです。これが理論上の限界ですが、データの真の確率分布を知ることは通常できないため、現実でこれを計算することはできません。

K近傍法(KNN: K-Nearest Neighbors)

「ベイズ」という真実がわからないため、私たちはKNNのような手法を使ってそれを推定します。
- KNNは、予測したい点の近くにある \( K \) 個の観測データを見て「投票」を行います。
- \( K = 1 \) のとき、モデルは非常に柔軟(低バイアス、高分散)になります。これはしばしば過学習につながります。
- \( K = 100 \) のとき、モデルは柔軟性が低い(高バイアス、低分散)状態になります。これはしばしば未学習につながります。

KNNの覚え方:
小さい \( K \) = Komplicated(複雑=高分散)。
大きい \( K \) = Konservative(保守的=低分散)。

主要コンセプトのまとめ

避けるべきよくある間違い: 学習MSEがゼロだからといって完璧なモデルだと思い込まないでください。学習MSEがゼロであることは通常、過学習しすぎており、新しいデータには全く通用しないことを意味します!

クイックまとめ:
- MSE: 回帰精度の主要な指標。
- 過学習: 学習誤差は低いがテスト誤差が高い状態。
- バイアスと分散のトレードオフ: 単純すぎる(バイアス)か、過敏すぎる(分散)かという葛藤。
- ベイズ分類器: 分類における理論上の理想。
- KNN: \( K \) の選択によってバイアスと分散のバランスが決まる柔軟な手法。

よくできました!これでモデル精度評価の基礎をマスターしました。忘れないでください、統計的学習の目的は過去を完璧に説明することではなく、未来を正確に予測することです!