什么是箱线图

什么是箱线图

img

箱线图在文献中经常见到,是对数据分布的一种常用表示方法。但是所见资料中往往说的不是特别清楚,因此需要了解一下箱线图的绘制过程,与部分的意义。

计算过程:

  1. 计算上四分位数,中位数,下四分位数
  2. 计算上四分位数和下四分位数之间的差值,即四分位数差(IQR,interquartile range)
  3. 绘制箱线图的上下范围,上限为上四分位数,下限为下四分位数。在箱子内部中位数的位置绘制横线。
  4. 大于上四分位数1.5倍四分位数差的值,或者小于下四分位数1.5倍四分位数差的值,划为异常值(outliers)。
  5. 异常值之外,最靠近上边缘和下边缘的两个值处,画横线,作为箱线图的触须。
  6. 极端异常值,即超出四分位数差3倍距离的异常值,用实心点表示;较为温和的异常值,即处于1.5倍-3倍四分位数差之间的异常值,用空心点表示。
  7. 为箱线图添加名称,数轴等。

在SPSS,SigmaPlot, R,SPlus,Origin等软件中,绘制箱线图非常方便。

下面是R中的一个箱线图举例, 在R软件中输入如下命令:

1
2
3
4
x <- c(25, 45, 50, 54, 55, 61, 64, 68, 72, 75, 
75,78, 79, 81, 83, 84, 84, 84, 85, 86, 86,
86, 87, 89, 89, 89, 90, 91, 91, 92, 100)
boxplot(x)

对x向量绘制箱线图。