統計的学習の基礎へようこそ!
未来の保険数理士の皆さん、ようこそ!Exam SRM(統計的リスクモデリング試験)の学習を始めるにあたり、統計的学習(Statistical Learning)こそが現代データ分析の心臓部であることを実感することでしょう。この章は、試験全般を通じたあなたの「GPS」のようなものです。保険金や株価を予測するための複雑なモデルを構築する前に、私たちは「解決しようとしている問題が一体何なのか」を正確に把握する必要があります。
このセクションでは、すべてのモデルを2つの主要な「スタイル(教師あり学習 vs 教師なし学習)」と2つの主要な「目的(回帰 vs 分類)」に分類する方法を学びます。難しそうな用語に聞こえるかもしれませんが、このノートを読み終える頃には、自然に使いこなせるようになっているはずです!
1. 教師あり学習と教師なし学習
統計的学習における最大の区分は、モデルを導く「教師」がいるかどうか、あるいはモデルが自力でパターンを見つけ出す必要があるかという点にあります。
教師あり学習(Supervised Learning):教師がいる学習
教師あり学習では、入力データ \( (x_i) \) のすべての観測値に対して、対応する出力または「ラベル」 \( (y_i) \) が存在します。私たちの目標は、入力を出力へと正確に写像する関数を見つけ出し、新しい入力データが得られたときに、新しい出力を予測できるようにすることです。
たとえ話:子供に果物の名前を教える場面を想像してください。リンゴを見せて「これはリンゴだよ」、オレンジを見せて「これはオレンジだよ」と教えます。「答え(ラベル)」を与えているため、これが教師あり学習です。
アクチュアリーの例:運転者の年齢や車種(入力 \( X \))に基づいて、保険金の支払額(出力 \( Y \))を予測すること。過去のデータ(すでに支払額がわかっているデータ)を用いてモデルを「指導(監督)」します。
教師なし学習(Unsupervised Learning):発見による学習
教師なし学習では、入力データ \( (x_i) \) はありますが、対応する出力 \( (y_i) \) は存在しません。「解答キー」も「教師」もいない状態です。目的は、データの中に隠された興味深いパターン、構造、あるいはグループを見つけ出すことです。
たとえ話:先ほどの子供に、形も色もバラバラな積み木が入った巨大なバケツを渡して、何も言わずに放置してみたとします。すると子供は、丸い積み木を1つの山に、四角い積み木を別の山に分け始めるかもしれません。子供は「名前」を呼んでいるわけではなく、類似性に基づいてパターンを見つけているだけです。
アクチュアリーの例:市場セグメンテーション。数千人の契約者のデータがあるとします。予測すべき特定の指標はありませんが、マーケティングを最適化するために、契約者が自然にいくつかのグループ(例:「都市部に住む若手専門職」vs「退職した地方の住宅所有者」)に分かれるかどうかを確認したい場合に使います。
クイックレビュー:主な違い
• 教師あり: \( X \) と \( Y \) がある。\( Y \) を予測したい。
• 教師なし: \( X \) しかない。\( X \) の中のパターンを見つけたい。
2. 回帰と分類
教師あり学習(出力 \( Y \) がある場合)を行っているなら、次に決めるべきステップは、それが回帰(Regression)問題なのか、分類(Classification)問題なのかという点です。これは、あなたが扱う出力変数の型によって完全に決まります。
回帰:数値を予測する
応答変数 \( Y \) が定量的(quantitative)(数値的)である場合、回帰を用います。これは、数値が数学的な意味を持ち、順序付けが可能な変数です。
重要用語:定量的変数とは、数値的な値を取るものです(例:100ドル、55.5歳、12インチ)。
例:
• 株の価格を予測する。
• 機器が故障するまでの時間を推定する。
• ハリケーンによる損害総額を計算する。
分類:カテゴリを予測する
応答変数 \( Y \) が定性的(qualitative)(カテゴリ的)である場合、分類を用います。これらは測定値ではなく「クラス」や「ラベル」を表します。
重要用語:定性的変数とは、\( K \) 種類の異なるクラスのいずれかの値を取るものです(例:Yes/No、青/緑/赤、合格/不合格)。
例:
• 契約者が保険契約を更新するかどうか?(Yes または No)。
• クレジットカードの取引が不正か正当か?
• 信用格付け(A, B, C, または D)を割り当てる。
暗記のコツ:「C」のルール
• Classification(分類)は Categories(カテゴリ:例「グループA」や「グループB」)のため。
• Regression(回帰)は Real numbers(実数:例「$5.50」や「100度」)のため。
3. 重要なニュアンスとよくある間違い
境界線が曖昧に感じられても心配しないでください!学生がよくつまずくポイントをいくつか挙げておきます。
「ロジスティック回帰」の混乱
警告! ロジスティック回帰(Logistic Regression)という手法があります。名前に「回帰」とついていますが、これはほとんどの場合分類のために使われます。観測値があるカテゴリに属する確率(例:保険期間中に人が死亡する確率)を推定するものです。
数値をカテゴリとして扱えるか?
数値変数をカテゴリとして扱うこともあります。例えば、星評価(1、2、3、4、または5)を予測する場合、回帰(5は4より良いという順序があるため)として扱うことも、分類(各星のレベルを別々の箱として扱う)として扱うことも可能です。通常は、分析の目的によってどちらを選択するかが決まります。
豆知識
Exam SRMのシラバスの大部分は教師あり学習に焦点を当てています。しかし、主成分分析(PCA)とクラスタリング(後で学習します)は、知っておくべき重要な2つの教師なし学習手法です!
4. まとめと重要ポイント
このセクションを締めくくるために、モデリングのための判断基準をツリー形式で見てみましょう:
ステップ1:目標となる出力(\( Y \))はあるか?
• ある: 教師あり学習です。(ステップ2へ進む)
• ない: 教師なし学習です。
ステップ2:目標(\( Y \))は数値か、カテゴリか?
• 数値: 回帰モデルを使用。
• カテゴリ: 分類モデルを使用。
覚えておくべきポイント:
• 教師ありモデルは予測のために使われる。
• 教師なしモデルは発見およびデータ構造の理解のために使われる。
• 定量的(Quantitative) = 数値 = 回帰。
• 定性的(Qualitative) = ラベル/カテゴリ = 分類。
素晴らしい!これでSRMカリキュラム全体の基礎が固まりました。次のセクションからは、これらのタスクを実行するために使われる具体的な数学やモデルについて見ていきましょう!