把一列数值粘贴进来,浏览器内直接生成分箱后的频数分布图——箱宽可自动可手动,纵轴可切频数或密度,SVG、PNG 即时导出。
同一个直方图生成器画出的四种典型分布:一个班的考试成绩、重复测量的仪器误差、一份右偏的等待时间数据,以及一份藏着两个峰的分布。
33 名学生的测验分数,按 Freedman–Diaconis 规则自动分箱,能看出轻微左偏——少数低分把尾部拉离了大多数人聚集的区间。
同一物理量的 40 次重复读数,叠加正态曲线后可以看到仪器噪声大致对称地分布在真值两侧。
呼叫中心的等待时长:多数来电很快接通,但少数拖长的等待把直方图的尾部向右拉伸,均值因此明显高于中位数。
两个班次通勤时间合并后的数据:箱宽偏宽时两个峰会被抹成一个鼓包,缩窄箱宽才会露出底下的第二个群体。
从一列数字到带标签的分箱频数图,这个直方图生成器每一步都做了什么。
把一列数字粘贴进数据框,逗号、空格或换行分隔均可。无法识别成数字的内容会被就地标出,不会被悄悄丢弃。
默认箱宽由 Freedman–Diaconis 规则按数据的离散程度与样本量算出;需要整数、便于口头交流的间隔时,直接填一个数字覆盖它。
在原始频数与密度之间切换——密度下柱高等于频数除以箱宽,比的是面积而不只是高度。需要的话再打开正态曲线、均值线或中位数线。
改动数值或箱宽时图表实时重绘、逐箱重新计数。形状确认无误后,导出 SVG 便于二次编辑,或导出 PNG 直接放进幻灯片。
直方图把连续数据切成等宽的区间(箱),每个箱画一根柱子,柱高等于落在这个区间里的数值个数。本工具遵循左闭右开的通行惯例:区间 [10, 20) 包含 10 但不包含 20,20 会被计入下一个箱;只有最后一个箱两端都闭合,确保数据集的最大值有处可归。这条开闭规则之所以重要,是因为恰好落在边界上的数值只应该有一个归属,规则不统一是不同工具算出不同频数、看着像是出错的常见原因。
箱宽的选择是一个真正的统计判断,不是排版细节。本工具默认用 Freedman–Diaconis 规则:h = 2 × 四分位距 × n^(-1/3),用四分位距而非全距衡量离散程度,一个极端离群值不会把所有箱宽都撑大。更早的 Sturges 规则只按样本量取 k = ⌈log2(n) + 1⌉ 个箱,隐含数据接近正态的假设,遇到样本量大或明显偏态的数据容易分箱过粗、把真实结构抹平。两条规则都只是起点,箱宽栏随时可以手动改写。
同一份数据,箱宽稍微一变,看起来可能从单峰变成双峰、从平滑变成锯齿——箱宽太窄会把抽样噪声放大成一个个假峰,箱宽太宽又可能把两个本来独立的群体压成一个宽鼓包。没有对所有场合都成立的“正确箱宽”,比较可靠的做法是在同一份数据上试几种箱宽,看看某个凸起是随箱宽忽隐忽现,还是在多数箱宽下都稳定存在。


自动箱宽按 Freedman–Diaconis 规则计算,会随样本量调整,并用四分位距而非全距衡量离散程度,一个离群值不会拖累整体分箱。需要整数或固定间隔时,随时切到手动箱宽。

切到密度纵轴后,每根柱子的高度等于频数除以样本量再除以箱宽,全部柱子的面积之和恰好为 1——这是拿样本去和一条拟合概率曲线比较时该用的口径,不是简单的百分比刻度。

在柱状图上叠加一条正态曲线,直观看出样本离钟形分布有多远;再加上均值与中位数参考线,一眼就能看出两个统计量是否吻合,还是被偏态拉开了距离。
两种图都用柱子表示数据,这也是它们最常被混用的原因——但它们回答的是两类不同问题,把一种数据硬套进另一种图,等于讲错了横轴的含义。
画一个连续数值变量,先分箱再画柱
画离散、带标签的类别,没有可分的箱
第一次做直方图前后,最常被问到的几个问题。
把一列数值粘贴进这个直方图生成器,调好箱宽,导出一张能直接放进报告或课件的图。