Figwise

ヒストグラム作成ツール

数値の列を貼り付けるだけで、ブラウザ上で階級分けされた度数分布図を作成——階級幅は自動・手動どちらも選べ、縦軸は度数と密度を切り替え、SVG/PNGで即書き出し。

縦軸
1 2 2 6 7 7 4 4 0 2 4 6 8 Frequency 55 60 65 70 75 80 85 90 95 Value
01使用例

同じヒストグラムでも、データが違えばこれだけ形が変わる

同じヒストグラム作成ツールで描いた4つの分布——あるクラスの試験の得点、繰り返し測定の誤差、右に裾を引くデータ、そして山が二つ隠れているデータ。

あるクラスの試験の得点

33人分の小テストの点数をFreedman–Diaconis則で自動的に階級分け。少数の低得点がクラス全体の塊から尾を引いており、わずかな左裾を示している。

繰り返し測定の誤差

同じ物理量を40回繰り返し測定した結果に正規分布曲線を重ねると、機器の誤差が真の値を中心にほぼ左右対称に散らばっている様子がわかる。

右に裾を引く待ち時間データ

コールセンターの待ち時間。大半の顧客はすぐつながるが、一部の長い待ち時間がヒストグラムの右側に尾を引き、平均値が中央値より明らかに大きくなるケース。

見えにくい二峰性の分布

始業時刻の異なる二つのシフトの通勤時間をまとめたデータ。階級幅を広げると二つの山が一つの山にならされ、狭めると隠れていたもう一方の集団が姿を現す。

02仕組み

ヒストグラムを作る4つの手順

数値のリストから、ラベル付きの階級別度数分布図ができるまで——このヒストグラム作成ツールが各手順で行っていること。

  1. 01

    数値を貼り付ける

    1列分の数値をデータ欄に貼り付ける。カンマ・空白・改行のどれで区切ってもよい。数値として読み取れない項目は、黙って捨てずにその場で指摘される。

  2. 02

    階級幅を自動計算させるか、自分で指定する

    デフォルトの階級幅は、データのばらつきとサンプルサイズからFreedman–Diaconis則で自動計算される。図にきりの良い間隔が必要なときは、数値を直接入力して上書きできる。

  3. 03

    縦軸を度数か密度から選ぶ

    各階級の生の度数と、密度(度数を階級幅で割った値)を切り替えられる。密度では棒の高さでなく面積同士が比較可能になる。必要に応じて正規分布曲線・平均線・中央値線も追加できる。

  4. 04

    形を確認して書き出す

    数値や階級幅を変更するたびにグラフが再描画され、階級ごとの集計もその場でやり直される。分布の形が意図通りになったら、編集用にSVG、スライド用にPNGで書き出す。

03概要

階級幅を変えると、同じデータが違う話を語り出す理由

ヒストグラムは連続データを等しい幅の区間(階級)に区切り、各階級に含まれる値の個数を高さとする棒を1本ずつ描く図である。本ツールは左閉右開([10, 20) は10を含み20を含まない、20は次の階級に入る)という統計学で一般的な約束に従う。ただし最後の階級だけは両端を閉じ、データの最大値が必ずどこかの階級に収まるようにしている。この境界の扱いが重要なのは、境界上にちょうど乗る値の帰属先が本来1つに定まるべきだからで、ここが食い違うと集計元が違うだけで度数がずれて見える。

階級幅の選び方は見た目の調整ではなく、統計的な判断そのものである。本ツールは既定でFreedman–Diaconis則(h = 2 × 四分位範囲 × n^(-1/3))を用いる。範囲全体ではなく四分位範囲でばらつきを測るため、極端な外れ値1つに階級幅全体が引きずられにくい。より古いSturges則はサンプルサイズだけからk = ⌈log2(n) + 1⌉個の階級数を決め、正規分布に近いという前提を暗に置くため、サンプルが大きい場合や歪んだ分布では階級が粗くなりすぎ、実際の構造をならしてしまいがちである。どちらの式も出発点にすぎず、階級幅欄はいつでも手動で書き換えられる。

同じデータでも階級幅がわずかに変わるだけで、単峰に見えたり二峰に見えたり、滑らかに見えたりでこぼこに見えたりする。狭い階級幅は細部を見せる代わりに標本のばらつきを偽の小さな山として拡大し、広い階級幅はそのノイズを均す代わりに本来別々の2集団を1つの山に押し込めてしまうことがある。あらゆる目的に通用する「正しい階級幅」は存在しない。実用的な習慣は、同じデータで幅を何通りか試し、現れたり消えたりする山が本当の構造なのか、たまたま階級の境界がそこに来ただけなのかを確かめることである。

同じデータを狭い階級幅と広い階級幅で描いたヒストグラムの比較図
04特徴

このヒストグラム作成ツールが引き受ける3つのこと

階級幅を編集すると即座に再計算されるヒストグラム作成ツールの入力欄
FD RULE

信頼できる自動階級幅、必要なら手動で上書き

自動階級幅はFreedman–Diaconis則で計算され、サンプルサイズに応じて調整されるうえ、範囲ではなく四分位範囲を使うため1つの外れ値に全体の階級が振り回されない。きりの良い一定間隔が必要な場面では、いつでも手動の階級幅に切り替えられる。

度数軸と密度軸のヒストグラムを並べて比較した図
COUNT · DENSITY

名ばかりでない、正真正銘の密度軸

縦軸を密度に切り替えると、各棒の高さは度数をサンプルサイズと階級幅で割った値になり、全ての棒の面積の合計がちょうど1になる。これはサンプルを当てはめた確率曲線と比較するときに使うべき軸で、単純な割合の目盛りとは意味が異なる。

正規分布曲線と平均線・中央値線を重ねたヒストグラム
MEAN · MEDIAN

正規分布曲線・平均線・中央値線の重ね描き

棒の上に正規分布曲線を重ねれば、標本が釣鐘型の分布からどれだけ離れているか一目でわかる。さらに平均線と中央値線を加えれば、この二つの統計量が一致しているのか、歪みによって引き離されているのかがすぐに見て取れる。

05比較

ヒストグラムと棒グラフの違い:連続区間と離散カテゴリの境界線

どちらも棒で表現するグラフだからこそ混同されやすいが、答えている問いも扱うデータの種類も違う。片方をもう片方の代わりに使うと、横軸が本来意味するものを取り違えて伝えてしまう。

ヒストグラム

1つの連続変数を、階級に区切ってから描く

  • 横軸が連続した数直線であり、各階級が前の階級の終わりからそのまま始まるため、棒同士は隙間なく接する。
  • 棒の並び順は数直線によって決まっており、階級を並べ替えると軸の意味そのものが崩れる。
  • 棒の高さ(密度表示では面積)は、その数値区間に入る観測値の個数を表し、1つのカテゴリの合計値ではない。

棒グラフ

離散的でラベル付きのカテゴリを描く、階級分けは不要

  • 棒と棒の間に隙間があり、各カテゴリが隣接する数値区間ではなく独立したラベルであることを示す。
  • カテゴリの並び順はアルファベット順・大きさ順・グループ順など任意に選べる設計上の選択であり、並べ替えてもデータ自体は変わらない。
  • 棒の高さは名前の付いた1つのカテゴリごとの集計値を表し、階級幅や境界の扱いはそもそも関係しない。
06FAQ

ヒストグラムについてよくある質問

初めてヒストグラムを作る前後によく聞かれる質問。

07関連ツール

データが実際どんな形をしているか確かめよう

数値の列をこのヒストグラム作成ツールに貼り付け、階級幅を調整して、レポートやスライドにそのまま使える図を書き出そう。

ヒストグラムを作成する