二変数データ探索へようこそ!
前回のセクションでは、一変数(Univariate)分析、つまり一つの変数を個別に理解する方法を学びました。さあ、次はステップアップしましょう!二変数データ探索(Bivariate Data Exploration)とは、二つの変数を同時に見て、それらがどのように相互作用しているかを分析することです。
なぜこれがExam PAの「核心」なのでしょうか?それは、予測モデリングの本質が、予測変数(Predictors/features)とターゲット(予測したい対象)の間の関係を理解することにあるからです。この関係を視覚的かつ数値的に見抜く力さえ身につければ、優れたモデル作成まであと半分です!数学が得意でなくても心配はいりません。シンプルで視覚的なステップに分解して学んでいきましょう。
1. 数値型 vs 数値型:最強のペア
二つの連続変数(年齢と年収など)がある場合、それらが連動しているかを確認したくなりますよね。この二つは同じ方向に進む仲良しでしょうか?それとも互いを避けるような関係でしょうか?
散布図(Scatterplot)
ここでは散布図が一番の相棒です。片方の変数をx軸、もう片方をy軸に置きます。
- 正の相関: 点が「右上がり」に並びます。\(X\)が増えると\(Y\)も増える関係です。
- 負の相関: 点が「右下がり」に並びます。\(X\)が増えると\(Y\)が減る関係です。
- 相関なし: 点がバラバラで、まるで蜂の群れのように見えます。
相関係数(\(r\))
これは、線形(直線的)な関係の強さを表す一つの数値です。
- -1から+1の範囲をとります。
- +1は完璧な右上がりの直線。
- -1は完璧な右下がりの直線。
- 0は線形な関係が全くないことを意味します。
クイック復習ボックス:
相関係数は線形(直線の)関係しか測れません。データがきれいな「U字型」を描いている場合、明らかなパターンがあるのに相関係数は0になることがあります!数字だけを信じず、必ず図(プロット)を確認しましょう。
豆知識: Exam PAの文脈では、二つの予測変数の相関が非常に高い(例:\(r > 0.8\))場合、これを多重共線性(Multicollinearity)と呼びます。これはモデルを不安定にする原因となるため、どちらか一方を削除する必要があるかもしれません!
重要ポイント:
散布図を使ってトレンドを視覚化し、相関係数を使って二つの数値変数間の線形的な結びつきの強さを数値化しましょう。
2. 数値型 vs カテゴリ型:グループの比較
多くの場合、数値(請求金額など)がカテゴリ(性別や地域など)によって異なるかどうかを知りたくなります。
箱ひげ図(Side-by-Side Boxplot)
これはExam PAにおける「黄金標準」です。x軸にカテゴリを、y軸に数値を配置します。
- 見るべきポイント: 「箱」の高さは同じでしょうか?もし「グループA」の箱が「グループB」よりずっと高ければ、そのカテゴリはターゲットを予測する強力な変数である可能性が高いです!
密度プロット(重ね合わせ)
同じグラフ上に二つのなだらかな丘(曲線)が描かれているのを想像してください。丘が完全に重なっていれば、そのカテゴリはあまり重要ではありません。もし片方の丘がもう一方より大きく右にずれていれば、意味のある関係を見つけたことになります。
例え:バスケットボール選手 vs 体操選手
スポーツの種類(カテゴリ)でグループ分けして身長(数値)をプロットすると、バスケットボールの箱ひげ図は、体操選手のそれよりもグラフの上の方に来るはずです。これはスポーツが身長の優れた予測変数であることを示しています。
よくある間違い: 「中央(平均や中央値)」だけに注目することです。ばらつき(箱の幅)も忘れずに確認しましょう。もし一つのグループだけが極端に散らばっているなら、それはリスク管理において非常に重要な洞察になります!
重要ポイント:
カテゴリが数値にどう影響するかを見るには、並列箱ひげ図を使いましょう。中央値のラインや、箱の全体的な縦位置の違いに注目してください。
3. カテゴリ型 vs カテゴリ型:パターンの発見
両方の変数がカテゴリの場合はどうでしょう?例えば、喫煙状況(あり/なし)は保険の種類(基本/プレミアム)に関連しているでしょうか?
分割表(クロス集計表)
これは度数を表示するシンプルなグリッドです。
- プロのヒント: 単純な度数だけでなく、割合に注目しましょう。喫煙者の80%が「基本」を選んでいるのに、非喫煙者では20%しか選んでいなければ、明確な関係を見つけたことになります!
積み上げ棒グラフまたはグループ化棒グラフ
- 積み上げ棒グラフ: 各バーが一つのカテゴリを表し、もう一つのカテゴリで「色分け」されます。バーごとに色の比率が異なれば、相互作用があると言えます。
- 100%積み上げ棒グラフ: すべてのバーが同じ高さ(100%)になります。カテゴリの比率が変化しているかどうかを確認するのに非常に便利です。
記憶のコツ:「100%ルール」
規模の異なるカテゴリ(例:男性1,000人 vs 女性10人)を比較する際は、実数ではなく必ず割合(パーセンテージ)を使いましょう。そうしないと、小さい方のグループがグラフの中で「隠れて」見えなくなってしまいます。
重要ポイント:
あるカテゴリ変数の分布が、他の変数によって変化するかどうかを確認するには、100%積み上げ棒グラフを使いましょう。
4. なぜこれが試験で重要なのか
Exam PAでは、ただ楽しむためにグラフを作っているわけではありません。特徴量選択(Feature Selection)を行っているのです。
1. 予測変数 vs ターゲット: ここに関係が見られれば、その予測変数は使いましょう!役に立ちます。
2. 予測変数 vs 予測変数: ここに非常に強い関係が見られれば、冗長(重複)の可能性があります。両方使うとモデルの解釈可能性を損なうかもしれません。
最初は難しく感じるかもしれませんが、大丈夫です! Rでこれらのプロットを見る練習を重ねれば重ねるほど、データが語る物語を「読み取る」スピードは上がっていきます。レポートを書くときは、バスケットボール選手の例でしたように、何が見えるかを普通の言葉で説明しましょう。
二変数探索ツールまとめ:
1. 数値型 + 数値型: 散布図、相関係数 \(r\)
2. 数値型 + カテゴリ型: 並列箱ひげ図、重なり密度プロット
3. カテゴリ型 + カテゴリ型: 分割表、積み上げ棒グラフ
クイック復習ボックス:
二変数(Bivariate) = 二つの変数。
目的: 関係性の発見、多重共線性の検知、そしてモデルにとって最も重要な予測変数の特定。