📊 数据

🎲标准差

平均数之外的第二只眼——两组平均分相同的数据,波动可以差上十倍,标准差把「散得多开」压成一个数。

两位同学五次测验都平均 70 分,水平一样吗?甲是 68、69、70、71、72,乙是 50、60、70、80、90。平均数一模一样,脾气天差地别:甲稳,乙像坐过山车。要描述这种差别,平均数、中位数与众数不够用了——它们只报中心,不报散布。补上第二只眼:标准差

平均数一样,脾气大不同

把每个数减去平均数,得到的差叫离均差。甲的离均差是 −2、−1、0、+1、+2,乙的是 −20、−10、0、+10、+20——同样的中心,偏离的幅度差了十倍。可惜离均差直接加起来永远是零:正负互相抵消,平均等于白算(甲:21+0+1+2=0-2 - 1 + 0 + 1 + 2 = 0)。想让「偏离」存活下来,得先平方——负号消失,大小保留。

先平方,再平均,最后开方

配方只需三步:

  1. 每个离均差平方
  2. 取平均,得到方差
  3. 开平方,回到标准差

套到两人身上:

  • 甲:平方是 4、1、0、1、4,和为 10,方差 =10÷5=2= 10 \div 5 = 2,标准差 =21.4= \sqrt{2} \approx 1.4
  • 乙:平方是 400、100、0、100、400,和为 1000,方差 =1000÷5=200= 1000 \div 5 = 200,标准差 =20014.1= \sqrt{200} \approx 14.1

最后一步开方是为了还原单位:成绩的单位是分,平方之后单位也跟着平方了,标准差把单位拉回「分」。它有一句直觉定义——数据到平均数的典型距离。甲的成绩离均值通常只有 1 分上下,乙则动辄十几分。

手算一遍

互动演示数据散布观察台
345689

个数

7

平均数

6.14

中位数

6

众数

8

添几个数、删几个数,看点阵摊开多宽:点越挤,标准差越小;点越散,标准差越大。组件算的是平均数、中位数与众数,「散得多开」这一眼,正好留给刚学会的标准差。

从零算到 σ = 2

八次投篮得分:2、4、4、4、5、5、7、9。总和 40,平均 =40÷8=5= 40 \div 8 = 5。离均差:−3、−1、−1、−1、0、0、2、4。平方:9、1、1、1、0、0、4、16,和为 32。方差 =32÷8=4= 32 \div 8 = 4,标准差 =4=2= \sqrt{4} = 2。平均 5、典型偏离 2——一句话说清整组数据。

总体、样本与钟形直觉

两个备忘。其一,计算器上常有 σ\sigmass 两个键:数据是全部对象(总体)时除以 nn;数据只是抽出来的样本时除以 n1n - 1,弥补样本天生的「偏挤」——细节以后再讲,选对键就好。其二,身高、测验分数这类数据常呈钟形堆叠:大部分挤在平均数附近,越远越稀少。标准差越大,钟形越矮胖;越小,越瘦高。对钟形数据,约七成落在均值 ±1 个标准差之内,±2 个标准差几乎全收。所以听说某群体「平均身高 170、标准差 6」,你脑中已经能画出整群人的样子。分布的形状可以到直方图里亲眼看;只用最远两端量散布的是极差;一个极端值如何拉偏平均数,见平均数的误用

动手检验

随堂小测

  1. 1. 标准差小,说明这组数据?

  2. 2. 数据 [2, 6] 的标准差是?

  3. 3. 某组数据的方差是 200,标准差约是?