第!"卷第#期
$%%&年%’月
统 计 与 信 息 论 坛 ()*+!" ,)+#
-./0+,
!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!
$%%&
收稿日期:$%%&1%&1%&
作者简介:曲卫彬(!’2’1),男,辽宁大连人,教授。主要从事经济统计学、国有资产管理方面的教学与研究。
【统计理论与方法】
众数计算公式问题探讨
———与吴海建商榷
曲卫彬
(东北财经大学 财税学院,辽宁 大连!!3%$#)
摘 要:文章对吴海建先生的“众数计算问题之我见”一文的观点提出商榷意见,并对众数公式的证明方
法进行了讨论。
关键词:众数计算公式;次数分布;数学证明
中图分类号:4"!$ 文献标识码:5 文章编号:!%%61&!!3($%%&)%#1%%2%1%$
吴海建先生在《众数计算问题之我见》一文(见《统计研
究》$%%$年第"期,以下简称“吴文”)中,认为现行的众数计
算公式存在两个缺陷,故对众数公式进行了改进。笔者不同
意吴文的观点,现提出商榷意见。同时对众数公式的证明方
法发表个人之见,以求教于吴海建先生和统计学界同仁。
一、现行众数计算公式是否存在缺陷
在组距数列的条件下,确定众数需要运用公式计算。以
下限公式为例,现行的众数计算公式为:
7%89:
!!
!!:!$
;<
式中各字母的含义均遵从统计学的习惯约定。
吴文认为:上述众数计算公式存在的第一个“缺陷”,是
“忽略了(变量数列)组距大小对众数的影响”。按照吴文的
分析,这种忽略导致了(!)人们单纯依据数列中各组次数的
大小来确定众数组,因而是不合适的。($)对于同一批数据,
在等距、异距不同分组的情况下,按上述公式计算众数的结
果是不相同的。这果真是现行众数公式的“缺陷”吗?在此
笔者进行如下分析:
众数是一组数据中出现次数最多的变量值,从次数分布
图上看,众数就是分布曲线顶点所对应的变量值,即分布曲
线顶点的横坐标。在编制组距数列时(因为只有组距数列才
需要运用公式计算众数),在原始数据资料既定的情况下,所
划分的组数多少和组距大小以及等距、异距分组的不同,就
直接影响了组距数列中各组的次数分配状况(由此可见数据
整理在统计研究中的重要性)。也就是说,在进行组距分组
时,由于等距或异距分组等方面的差别,同一批数据所形成
的分布曲线的形态特征,如曲线的峰度、偏度等必定会有所
差异,因而根据公式计算众数的结果也必然要随之发生变
化,这是容易理解的。因此,对于同一批数据,在等距、异距
不同分组的情况下,运用众数公式计算众数必然会得到不同
的结果,这并非现行公式的“缺陷,而恰恰是其客观地反映了
分布曲线形态特征的表现。
由于等距或异距分组的不同影响到分布曲线的表现形
态,所以,为了尽可能客观认识总体的分布状态,在进行统计
分组时,人们总是优先考虑采用等距分组。事实上,由于只
有在等距数列中各组的次数才是能够直接比较的,所以等距
分组是确定众数组的前提条件,因而也是运用众数公式计算
众数的前提条件(当然还有另外一些前提条件)。吴文认为:
现行公式单纯依据各组次数的多少来确定众数组,是忽略了
组距大小的影响,其实这是作者自己忽略了在组距数列的条
件下计算众数的前提条件。异距数列是不能直接运用公式
计算众数的,因为在异距数列中,人们不能直接依据各组的
次数大小来确定众数组,例如吴文表$中给出的例子那样。
如果在统计研究中需要对异距数列计算众数,则必须先将其
改变为等距数列,或者先计算出各组的次数密度,然后才能
运用公式进行计算。
吴文认为:现行众数公式存在的第二个“缺陷”,是它只
考虑众数组前、后两组的次数来确定众数的具体位置,“忽略
了远离众数组的其它各组的次数对众数的影响”。于是提出
了按照累计的次数来计算众数的新公式(新公式具体见吴
文)。新公式比现行公式更科学吗?笔者认为恰恰相反。
根据众数公式计算众数,实际上是依据对众数在众数组
内所处位置状况(偏向下限还是偏向上限)的判断而进行的
一种估算,因而也叫插值估算法。那么,如何对众数在组内
的位置状况做出判断?显然,分布曲线在顶点区域的对称程
度和陡峭程度是据以判断的最有效信息。现行公式依据众
数组的次数与其相邻两组的次数之差来计算众数,是对这一
有效信息的充分利用,因而是科学的。吴文的新公式是依据
众数组的前、后各组的累计次数来计算众数的,这样所使用
的就不是判断分布曲线顶点位置的最有效信息———分布曲
线顶点的位置与该曲线前、后两尾部的次数密度是低相关
的。按照吴文的新公式计算众数,不但计算量大,而且随着
分布曲线偏斜度的增大,计算结果也将越来越不准确,这是
显而易见的。
吴文为了论证新公式的优越性,提出了以所计算的众数
是否更接近于算术平均数作为衡量不同公式优劣的标准,这
%2 万方数据
实际上混淆了众数与算术平均数的区别,忽视了众数的特点
和作用。众数属于位置平均数,它的最大特点亦即优点就是
不受数据极端值的影响;算术平均数是根据全部数据计算
的,因而有易受极端值影响的缺点。所以,当次数分布曲线
呈偏斜状态时,众数与算术平均数将产生差异,且偏态愈大,
两者的差异也愈大,而此时也就越有必要计算众数,以众数
反映变量值的一般水平。这就是说,众数和算术平均数(也
包括其它描述总体分布特征的指标)是由总体的分布形态决
定的,它们本身是一个客观的确定的数值。因此,我们评价
一个计算公式或计算方法优劣的首要标准,就是要看其能否
取得描述总体特征(众数或其它特征值)的这个确定值,或者
取得这个确定值的“有效统计量”,即通常所说的计算结果的
准确性,而不应当以接近算术平均数或者别的什么总体特征
值作为评价的标准。
这里,有必要对统计的准确性问题做进一步讨论。在本
论题的范围内,准确性的含义当然是指对统计数据整理、加
工的结果,能够确切反映出事物客观存在的数量关系。但有
两点需要明确:第一,统计的准确性是相对的。统计是对现
象总体进行研究的,为了实现从对现象个体量过渡到对总体
量的认识,统计需要对所收集的大量数据资料进行必要的加
工处理,例如统计分组。统计数据整理有利于反映总体特征
和现象内在的规律性,也便于进一步地计算和分析,这是我
们进行统计整理包括确定组数、组距以及等距、异距分组的
目的,也是进行统计整理的原则。但无论如何,相对于原始
数据而言,数据整理势必影响了后续的计算结果,在这一意
义上,统计的准确性是相对的而不是绝对的。这种相对的准
确性是由统计研究的对象———随机现象所决定的。因此,所
说的评价计算公式或计算方法优劣的准确性标准,也就是相
对的而不是绝对的。第二,要正确认识统计中的近似计算。
为了从数量方面认识现象总体的特征,统计研究中大量运用
了近似计算,比如通常采用的以组中值代替组内变量一般水
平的做法。合理的近似计算便于人们以较少的研究资源,透
过纷繁的表象,获得对总体基本特征和内在规律的认识。可
以说,近似计算也是由统计研究对象的特殊性所决定的一种
研究方法。但是,允许近似计算并不意味着可以不探索计算
公式或计算方法的科学性,因为如果计算公式或计算方法本
身不科学,就会产生系统性误差,误导人们对客观事物的认
识。这正是人们关注众数计算公式科学性的原因所在。
二、众数公式的几何证明方法是否正确
对现行众数公式的数学证明是一个尚未取得共识的问
题。有些教科书根据次数分布直方图,利用相似三角形的性
质来推导众数计算公式!,吴文也认同这种证明方法。但事
实上,这种证明方法是错误的。现将其证明过程简述如下:
附图 次数分布直方图
已知:在组距变量数列中众数组及其相邻两组的次数分
布直方图如附图所示。由附图可知:
!!"#"!$%#
&’(/)(*$%/!+
&(’(,)()/)(*($%,!+)/!+ (-)
将式(-)中的各线段以众数公式中相应的符号替换,得
到式(.):
/
)(*
!-,!.
!-
(.)
&)(*
!-
!-,!.
0/ (1)
&),)(*),
!-
!-,!.
0/ (2)
&(3*),
!-
!-,!.
0/ (4)
证毕。
这种证明方法的错误在于式(2)与式(4)之间缺乏逻辑
联系。由直方图可知:式(1)是线段)(的长度即!!+#之
高的表达式,于是可知式(2)表示的线段5(的长度,亦即线
段!$与+%交点(#)的横坐标。但是,该交点并非是次数
分布曲线的最高点,因为没有根据认定曲线!#%就是变量
的次数分布曲线,也不存在可以曲线!#%代替次数分布曲
线的理由。这样,式(4)所表明的实际上只是#点的横坐
标,而不是我们所要证明的分布曲线顶点的横坐标———众
数。可见,上述证明推导的结论并非是人们要求证明的结
论,由式(2)到式(4),在逻辑上违反了同一律,犯了偷换论题
的错误。
值得指出的是:类似上文的直方图在国外的统计学教材
中也偶有所见(见参考文献[-])。但国外教材并非利用此来
证明众数公式,而是将其作为估算众数的一种方法,这是不
是表明国外学者也认为采用相似三角形的证明方法存在着
逻辑漏洞?对众数公式的数学证明,成功的方法是运用微积
分学中的“微元法”,该法在周恒彤先生主编的《统计学》教材
中有详细介绍,有兴趣的读者可以参阅该教材。
!就笔者所见,采用这一证明方法的老一辈统计学家有金国宝教授;新中国著名统计学家有黄良文教授、张维达教授;目
前采用这一证明方法的学者有褚可邑(《统计理论与方法》,中国统计出版社-667年版)、满向昱(《统计学教程》,中国财经出版
社-666年版)、夏南新(《新概念统计学》,中国财经出版社.333年版),高等学校核心课教材《统计学》(高等教育出版社.333
年版)也采用了此种证明方法。
参考文献
[-] !89:;<=>?!@A:;<B@)BABCDE:E=>E=<>[(]?$C:9B;@F;:DE:;CBGHIF9;B>(JKLC=>IB9>))E@?,M%’$!NFK>B,-6O6?
[.] 周恒彤P社会经济统计学原理[(]P北京:中国统计出版社,
(责任编辑:郭诗梦)
-2
曲卫彬:众数计算公式问题探讨
万方数据