📊 数据
🎲标准差
平均数之外的第二只眼——两组平均分相同的数据,波动可以差上十倍,标准差把「散得多开」压成一个数。
两位同学五次测验都平均 70 分,水平一样吗?甲是 68、69、70、71、72,乙是 50、60、70、80、90。平均数一模一样,脾气天差地别:甲稳,乙像坐过山车。要描述这种差别,平均数、中位数与众数不够用了——它们只报中心,不报散布。补上第二只眼:标准差。
平均数一样,脾气大不同
把每个数减去平均数,得到的差叫离均差。甲的离均差是 −2、−1、0、+1、+2,乙的是 −20、−10、0、+10、+20——同样的中心,偏离的幅度差了十倍。可惜离均差直接加起来永远是零:正负互相抵消,平均等于白算(甲:)。想让「偏离」存活下来,得先平方——负号消失,大小保留。
先平方,再平均,最后开方
配方只需三步:
- 每个离均差平方;
- 取平均,得到方差;
- 开平方,回到标准差。
套到两人身上:
- 甲:平方是 4、1、0、1、4,和为 10,方差 ,标准差 ;
- 乙:平方是 400、100、0、100、400,和为 1000,方差 ,标准差 。
最后一步开方是为了还原单位:成绩的单位是分,平方之后单位也跟着平方了,标准差把单位拉回「分」。它有一句直觉定义——数据到平均数的典型距离。甲的成绩离均值通常只有 1 分上下,乙则动辄十几分。
手算一遍
个数
7
平均数
6.14
中位数
6
众数
8
添几个数、删几个数,看点阵摊开多宽:点越挤,标准差越小;点越散,标准差越大。组件算的是平均数、中位数与众数,「散得多开」这一眼,正好留给刚学会的标准差。
从零算到 σ = 2
八次投篮得分:2、4、4、4、5、5、7、9。总和 40,平均 。离均差:−3、−1、−1、−1、0、0、2、4。平方:9、1、1、1、0、0、4、16,和为 32。方差 ,标准差 。平均 5、典型偏离 2——一句话说清整组数据。
总体、样本与钟形直觉
两个备忘。其一,计算器上常有 和 两个键:数据是全部对象(总体)时除以 ;数据只是抽出来的样本时除以 ,弥补样本天生的「偏挤」——细节以后再讲,选对键就好。其二,身高、测验分数这类数据常呈钟形堆叠:大部分挤在平均数附近,越远越稀少。标准差越大,钟形越矮胖;越小,越瘦高。对钟形数据,约七成落在均值 ±1 个标准差之内,±2 个标准差几乎全收。所以听说某群体「平均身高 170、标准差 6」,你脑中已经能画出整群人的样子。分布的形状可以到直方图里亲眼看;只用最远两端量散布的是极差;一个极端值如何拉偏平均数,见平均数的误用。
动手检验
随堂小测
1. 标准差小,说明这组数据?
2. 数据 [2, 6] 的标准差是?
3. 某组数据的方差是 200,标准差约是?