記述統計学へようこそ!

皆さん、こんにちは!ビジネスエコノミクス学習の旅の中でも、特に実用的な章へようこそ。膨大な数字が並ぶスプレッドシートを見て、圧倒されてしまったことはありませんか?記述統計学は、そんな悩みを解決する強力な武器です。大量のデータを要約して、意味のあるいくつかの数字に整理することができるようになります。長いビジネスレポートの「要約(TL;DR)」を書くようなものだと考えてください。クライアントの監査をする時も、株価を分析する時も、これらのツールは皆さんの最高の味方になります。

1. 「中心」を理解する(代表値)

データを見る時、私たちはしばしば「典型的な」値がどれくらいかを知りたがります。そのために、主に3つのツールを使います。

平均値(Mean)

平均値は、すべての値の合計をデータの個数で割ったものです。友人たちと夕食の割り勘をするようなイメージです。
公式: \( \bar{x} = \frac{\sum x}{n} \)
例: 5社の利益が10ドル、20ドル、30ドル、40ドル、50ドルの場合、平均値は \( (10+20+30+40+50) / 5 = 30ドル \) です。
注意点! 平均値は「外れ値(極端に大きい値や小さい値)」に非常に弱いです。もし1社が100万ドルの利益を出していたら、他のすべてが10ドルのままでも平均値は跳ね上がってしまいます。

中央値(Median)

中央値は、データを小さい順に並べた時にちょうど真ん中に来る値です。
求め方:
1. データを小さい順に並べ替えます。
2. データの数(\( n \))が奇数の場合、真ん中の値は \( \frac{n+1}{2} \) 番目の数字です。
3. データの数(\( n \))が偶数の場合、真ん中の2つの数字の平均をとります。
たとえ: 高速道路の真ん中に引かれた「白線」をイメージしてください。車の半分は左側、半分は右側を走っていますよね。

最頻値(Mode)

最頻値は、最も頻繁に現れる値です。データセットには、最頻値が1つの場合もあれば、複数ある場合(二峰性)、あるいは存在しない場合もあります。
ヒント: 最頻値は、数値ではないデータ(「最も売れた車の色は?」など)にも使える唯一の代表値です。

まとめ:どれを使うべき?

- 平均値: 極端な値がなく、左右対称のデータに最適。
- 中央値: 不動産価格や給与のように、極端な外れ値がある場合に最適。
- 最頻値: カテゴリデータ(「最も人気のある商品」など)に最適。

2. 「ばらつき」を理解する(散布度)

平均を知るだけでは不十分です。例えば、ある都市の平均気温が25℃だと誰かが言ったとします。良さそうに聞こえますよね?でも、もし昼は50℃で夜は0℃だったらどうでしょう?大変なことになります!散布度は、データがどれくらい「ばらついているか」を示します。

範囲(レンジ)

範囲は、単純に最大値と最小値の差のことです。
公式: \( Range = Maximum - Minimum \)
よくある間違い: 最大値と最小値の2つの数字を並べるだけではいけません。範囲は引き算の結果です(例:最大が100、最小が20なら、範囲は80)。

分散と標準偏差(SD)

これらは、データが平均からどれくらい「逸脱しているか」を示します。
- 分散(\( s^2 \)): 平均からの差を2乗したものの平均値です。マイナスの差がプラスの差を打ち消さないように2乗します。
- 標準偏差(\( s \)): 分散の平方根をとったものです。元のデータと同じ単位になるため、最もよく使われる尺度です。
公式(標本標準偏差): \( s = \sqrt{\frac{\sum(x - \bar{x})^2}{n-1}} \)
なぜ \( n-1 \) なのか? 標本(サンプル)から母集団を推計する際、より慎重かつ正確にするために(ベッセルの補正を用いて)\( n-1 \) を使います。

変動係数(CV)

これは試験の救世主です!異なる単位やスケールであっても、2つの異なるもののリスク(ばらつき)を比較することができます。
公式: \( CV = (\frac{s}{\bar{x}}) \times 100\% \)
例: A株のSDが5ドル、B株のSDが500ドルだと、Bの方がリスクが高いと思うかもしれません。しかし、B株の価格が100万ドルであれば、その相対的なリスクは実はもっと低いかもしれません!CVを使えば、公平な比較が可能になります。

重要なポイント:

ばらつきが小さい=一貫性が高い。 ビジネスにおいて一貫性は、通常リスクが低いことを意味します。

3. データの形(歪度)

すべてのデータが完璧なベルの形をしているわけではありません。時にはどちらかに傾くこともあります。

左右対称分布

左側が右側の鏡像になっています。理想的な世界では:平均値=中央値=最頻値 となります。

右に歪んだ分布(正の歪度)

グラフの「裾」が右側(大きい数値の方)に伸びています。これは、少数の非常に大きな値が平均を上に引き上げる時に起こります。
覚え方: 自分の右足を見てください。親指が左側にあり、指先の「裾」が右を向いていますよね。
順序: 平均値 > 中央値 > 最頻値

左に歪んだ分布(負の歪度)

「裾」が左側(小さい数値の方)に伸びています。少数の非常に小さな値が平均を下に引き下げる時に起こります。
順序: 平均値 < 中央値 < 最頻値

4. 度数分布表を使った計算

個々の数字ではなく、「階級」でデータが与えられることもあります(例:20〜30歳が10人、30〜40歳が15人など)。
対処法:
1. 各階級の階級値(\( m \))を求めます: \( (下限 + 上限) / 2 \)。
2. その階級値を式の中の「\( x \)」として扱います。
3. 階級値に度数(\( f \))を掛けて合計を求めます: \( \sum (f \times m) \)。

5. まとめと成功のためのヒント

最初は難しく感じるかもしれませんが、大丈夫です! 統計学は言語のようなものです。問題を解いて練習すればするほど、自然に使いこなせるようになります。

クイック復習ボックス:

- 平均値:算術的な平均(外れ値に弱い)。
- 中央値:真ん中の点(外れ値に強い)。
- 標準偏差:平均からの平均的な距離。
- CV:相対的なリスク比較に使用 \( (SD / 平均値) \)。
- 右に歪んだ分布:平均値が中央値より大きい。

豆知識: 監査の世界では、会計士は「単位あたりの平均値推定」という手法を使い、在庫のごく一部をサンプリングすることで在庫全体の価値を推定します。皆さんは今まさに、世界最大級の企業を検証するために使われるツールを学んでいるのです!

最後のヒント: 自分の扱っているデータが母集団なのか標本(サンプル)なのかを常に確認してください。HKICPAの試験では、ほとんどの場合標本を扱うことになるので、分散や標準偏差の分母には \( n-1 \) を使うことを忘れないでくださいね!