平均・中央値・標準偏差
数の並びから平均・中央値・最頻値・分散・標準偏差・四分位をまとめて出します。
数を貼り付けるだけで基本統計量が出ます。改行・カンマ・空白のどれで区切っても読みます。標準偏差は標本(n−1で割る)と母集団(nで割る)の両方を示します — 表計算ソフトの STDEV と STDEVP が違う値を返す理由がこれで、どちらを使うべきかはデータが全体なのか一部なのかで決まります。
データ
カンマ・改行・空白のどれで区切っても読みます。
中心
平均
5
中心
- 中央値
- 4.5
- 最頻値
- 4
- 個数
- 8
- 合計
- 40
ばらつき
- 標本標準偏差 (n−1)
- 2.1381
- 標本分散
- 4.5714
- 母標準偏差 (n)
- 2
- 母分散
- 4
範囲と四分位
- 最小
- 2
- 最大
- 9
- 範囲
- 7
- 第1四分位
- 4
- 第3四分位
- 5.5
- 四分位範囲
- 1.5
- 外れ値
- 9
手元の数が全体なら母集団(n)、一部なら標本(n−1)です。現実のデータはたいてい標本です。
四分位は線形補間方式(ExcelのQUARTILE.INC)です。外れ値は四分位範囲の1.5倍を超える値 — 慣習であって、データへの判定ではありません。
初期値の八つで確かめると
2, 4, 4, 4, 5, 5, 7, 9 は合計40、平均5です。平均との差を二乗して足すと32で、8で割ると母集団分散4、7で割ると標本分散4.5714です。平方根が標準偏差なので母集団は2、標本は2.1381です。中央値は並べ替えて真ん中二つの平均の4.5、最頻値は三回出た4です。画面の数は小数第四位まで丸めて示します。
四分位は位置に小数を許します
線形補間は並べ替えたn個のうち (n−1)×p 番目の位置を見ます。八つならQ1は1.75番目で、二番目の4と三番目の4の間なので4、Q3は5.25番目で、六番目の5と七番目の7の間を四分の一だけ進んだ5.5です。IQRは1.5で、その1.5倍の外である Q3 + 2.25 = 7.75 を超える9が外れ値になります。値が一つだけなら標本分散は割るものが無いので0にします。
最頻値は複数のことも、無いこともあります
最も多く出た値が二つ以上あれば、すべてを小さい順に示します。すべての値が一度ずつなら最頻値は無いと書きます — このとき全部を最頻値とするとデータを読み違えます。数でない文字は黙って捨てて数えないので、個数の欄が貼り付けた行数と違えば読まれなかった値があります。
この画面がしないこと
加重平均・幾何平均・歪度・尖度は出しません。二列のデータを対として読まないので相関係数もありません。「1,000」のように桁区切りの入った数は1と0に割れて二つになるので、カンマを外して入れてください。貼り付けたデータは保存せず、開き直すと初期値に戻ります。
よくある質問
Q標本と母集団のどちらを使いますか
手元の数が知りたい対象の すべて なら母集団、一部 なら標本です。クラス30人全員の点数なら母集団、全国から選んだ30人なら標本です。迷うなら標本のほう(n−1)を使ってください — わずかに大きく出るので、ばらつきを過小評価しません。
Q四分位はどの方式ですか
線形補間方式(Excelの QUARTILE.INC と同じ)です。四分位の求め方には少なくとも9通りの流儀があり、方式によって値が変わります。他のソフトと突き合わせるときは、まず方式が同じかを確かめてください。
Q平均と中央値が大きく違います
分布が偏っているか、極端な値が混じっています。年収のようなデータでは一部の非常に大きな値が平均を引き上げるため、中央値のほうが「真ん中の人」を表します。この画面が両方を並べるのは、その差自体が情報だからです。
Q値が一つだと標準偏差はなぜ0ですか
母集団標準偏差は値一つが平均と同じなので0で、標本標準偏差は n−1 が0で割れないため0にします。ばらつきを言うには値が二つは必要です。
Q平均がデータに無い値でもよいのですか
かまいません。1, 2, 3, 4, 100 の平均は22ですがそんな値はデータに無く、中央値の3のほうが真ん中をよく表します。100は Q3 + 1.5×IQR の7を超えて外れ値になり、それが平均を引き上げた値です。