第四章 抽样理论和参数估计
知识引入
1970 年美国首次进行征兵抽签,组织者将 19-25 岁的适龄青年按年龄分组,使用编号
001-366 的等重量塑料球,001 代表 1 月 1 日出生者,031 代表 1 月 31 日…,366 代表 12
月 31 日。然后将所有塑料球放入滚筒中混合抽取号码,每组抽中号码对应生日的青年依次
应征,直到人数足够为止。
之后,有记者指出此次抽签产生了严重的偏差,他们注意到,年末生的人似乎倾向于被
抽到较前面的征兵顺序。其结果就是一堆 12 月份生的人去了越南战场。后来,经过统计学
家的分析,发现这种“偏差”确实存在;经过分析终于找到了原因,原来代表生日的号码塑料
球是一次按一整个月份装入滚筒中混合的,加上又没有均匀混合;于是 1 月份的生日容易
在滚筒底下,12 月份的是最后才装进去,容易在上面。
在抽样术语中,经常能够听到“随机抽样”、“随机选择”这样的表述,“随机性”原则其实
保证了总体中的每个个体被抽中的概率相等,因而被认为是保证各种抽签、选择过程公平、
公正的一个基本手段。上述抽样就没有保证这种随机性。
在本章中,我们还会看到,作为推断的基础,我们直接研究的样本是否“得当”对研究总
体十分关键,可以通过一定的抽样设计制定科学、合理、公正的抽样方法。如上述随机性原
则可以保证抽样可以使得样本和总体有相同的内部结构,也就是说有最大的可能使总体的某
些特征在样本中得以再现。本章在介绍必要的抽样概念和抽样方法基础上,重点介绍抽样分
布理论,并对参数估计进行简要介绍。
第一节 抽样和常用抽样方法
一、简单随机抽样
抽样(sampling)或取样,在整个研究过程中位于数据收集之前,恰当的抽样设计是保
证样本代表性的关键环节,是利用样本对总体进行假设检验或参数估计的基础。抽样涉及到
的一些基本概念在绪论中均已介绍。一个合理可行的抽样设计,一方面要求针对调查或实验
研究的具体情况选择一种适宜抽样方法;另一方面应该根据调查研究所要求的精确度及经费
状况确定样本容量。
一般所说的随机抽样,就是指简单随机抽样,它是最基本的抽样方法,适用范围广,最
能体现随机性原则且原理简单。抽取时,总体中每个个体应独立地、等概率地被抽取。常用
的实施方法有抽签法和随机数表法。
1、抽签法:是把总体中的每一个个体都编上号并做成签,充分混合后从中随机抽取一
部分,这部分签所对应的个体就组成一个样本。
2、随机数表法:所谓随机数表或乱码表,是由一些任意的数毫无规律地排列而的数表。
教材附表 17 即是一万个数字的随机数表。
随机数表的用法
:8080/courseware/0062/content/0004/tanchu/
许多计算机软件都可以自动生成随机数字。这里介绍教材附录 17 中乱码表的用法:首
先对总体中所有个体依次编号,接着从表中任一位置(任意行列交叉处)开始,依次往下找
足你所需要的随机数(均为 5 位),以这些随机数为编号的个体即组成一个样本。在查找随
机数时,有两点要注意,一是总体容量是几位数,就从表中随机数末尾截取相应位数(因而
最多可以截取 4 位数,抽取 9999 个)。如总体容量为 500,则可以看表中数据的末尾三位
数,并依次往下找;二是找到的数字若超过总体的容量范围,则跳过,比如总体容量为
500,要求抽取 30 个,则设定任意起始点往下找,找到一个数字末尾三位为 678,则跳过,
看到一个 098,则表示编号 098 号被抽中,…,直到找满 30 个为止 。
当然这两种方法都是针对有限总体的,在实际当中的无限总体可以采用其他方法来抽样。
简单随机抽样从理论上说是最符合随机性原则,但是这种方法在实际应用时,存在着一
些不足:首先,对大总体进行编号是相当困难的;其次,由于完全采用随机性,实际抽取的
那一个样本可能不具备总体本应该有的一些特性。
另外,对于大总体在制签或查表时都是相当困难的。对于已有顺序编号的大总体,实际
当中常常采用等距抽样简洁地实现。等距抽样也称系统抽样。顾名思义,它是按照抽样比例
(样本容量与总体容量之比)确定抽样间距(抽样比例的倒数),然后从任意起点间隔抽样
间距逐个获得样本中的个体。如一总体有 5000 个,要求抽取一个 500 人组成样本,即抽样
比例为 10%,则从任意位置开始(假设总体中所有个体均已编号,且一般地假设从 10 以内
开始),连续抽取 a、a+10、a+20、…、a+4990 共 500 个编号个体作为样本。
二、分层抽样
分层抽样是事先按总体已有的某些特征,将总体分成几个不同的部分,每一部分叫一层,
再分别在每一层中随机抽样。这种方法充分利用了总体的已有信息,因而是一种非常实用的
抽样方法。
对于一个总体如何分层,分多少层,要视具体情况而定。一个总的原则是,各层内个体
在该特征上的差异要少,而层与层之间的差异要越大越好。比如说,对大学生可以按其学校
是一流大学、重点大学、一般大学来分层。对于复杂问题还可以按几个分层标准来分层。如
韦克斯勒幼儿智力量表在制定常模时,就按年龄、性别、种族、地区、家长职业和城市农村
等六个因素来分层,使得样本中各种搭配下的人数比例都与总体尽量接近。
分层抽样在具体实施时,又根据是否知道各层内标准差分成两种办法:
按各层人数比例分配。这是在各层内标准差不知道时的分配方式,即让样本中各层人数
的比例与总体中各层人数的比例相同。
最佳分配。这是在已知各层内标准差时的分配方式,它是按标准差大小和总体中各层人
数比例共同来确定最终样本中各层人数的比例。任意一层中要抽取的人数可表示为:
其中 N 表示总体容量,n 表示样本容量,i 表示第 i 层。
确定了各层内的抽取人数,每层内的抽取可采用简单随机抽样法进行。
三、两阶段抽样
两阶段抽样也称为分群抽样,首先是将总体分成若干群,从中随机选出一些群,这是第
一阶段抽样;再从被选出的群中进行随机抽样,这是第二阶段抽样。这里分群的原则正好和
分层抽样中分层的原则相反,要求各群内个体之间的差异尽量地大,而各群之间就没多大的
差异。比如要进行一个全国范围内生活消费方面的调查,可以按大城市进行分群,显然各大
城市内的居民千差万别,而各个城市之间则相差无几,因此不必选取所有的大城市,可以只
从中选择一部分,然后再在这些城市进行抽样。
在一个复杂的抽样设计中,往往可能将分层抽样抽样和分群抽样反复应用,最终才得到
所要的样本。如上面的例子中,要在一个大城市里选取一部分居民,也不是件容易的事,这
时可再分群或分层,直到便于抽样时为止。
四、样本容量的确定
样本容量的大小对统计推断非常重要。样本容量过小,会影响样本的代表性,使抽样误
差增大而降低了统计推断的精确性;而样本容量过大,虽然减小了抽样误差,但可能增大过
失误差,且增大经费开支。另外,样本容量与抽样误差之间并不存在直线关系,随着样本容
量的增大,抽样误差减小的速度越来越慢。
对于样本容量的确定受到很多因素的影响,也有很多相应的计算公式,这里不一一介绍。
教材中介绍了对样本均值进行推断时利用最大允许抽样误差计算样本容量的方法。所谓“最
大允许抽样误差”是指某一总体参数与其点估计(抽样所得的统计量)之间的差异在实际中
所能接受的最大范围。比如,对于总体均值 μ,它的点估计是 ,那么在实际中用 来估
计 μ 时,研究者所能接受的最大范围就称为最大允许抽样误差,一般记为 d。确定样本容
量的目的就是使抽样的误差在研究者所能接受的的范围以内,因此样本容量与 d 是有直接
关系。根据下面的抽样分布知识,可以得知:
或
第二节 抽样分布理论
一、为什么要了解抽样分布
推断统计的核心思想是从特殊到一般,从部分到全体,即用样本统计量来推断总体参数。
然而,统计推断和直接推断的本质区别在于,后者往往不会关心样本和总体的差异,而直接
根据统计量来下结论;这会产生很多偏差。而统计推断则依据抽样分布理论进行推断,它用
概率的形式描绘出样本统计量在无限次抽样(在无限总体中总可以得到无限多个容量有限的
样本)中的分布规律,从而帮助我们判断一次抽样结果的意义。
以一个有限总体抽样的例子来说明抽样过程。
某班 25 名同学的某科成绩,它就是要研究的总体:
1 2 3 4 5 6 7 8 9 10 11 12 13
81 99 66 98 55 92 100 84 69 74 77 66 100
14 15 16 17 18 19 20 21 22 23 24 25
84 100 68 59 71 60 94 91 92 95 78 84
为了较快地估计该班该课程的平均成绩(总体参数),从中有放回地抽取 5 名学生(即
抽取一个学生的成绩登记后再放回去抽取下一个,所以已抽取的可能在后面再次被抽取
到),用他们的平均成绩(样本统计量)来反映总的平均情况(实际中,直接对 25 个数据
求平均即可,这里以具体数据说明抽样过程,想象这里的总体为无限容量)。下表列出了一
种可能的抽样情况:
X1 X2 X3 X4 X5
学号 18 15 2 13 25
第一次抽样
成绩 71 100 99 100 84
学号 10 23 12 15 17
第二次抽样
成绩 74 95 66 100 59
学号 5 15 2 21 10
第三次抽样
成绩 55 100 99 91 74
…… …… …… …… …… …… …… ……
这里只抽取了 3 个样本,但可看出每个样本的平均数都与总体均值 (实际情况中
总体参数往往未知)有些差异,第一个样本显然比总体均值大多了。如何判断哪个样本统计
量更具有代表性(总体参数未知时),这就需要了解样本平均数 的分布规律,以便更好
地对总体均值进行估计或推断。
从上面的例子可以看出抽样的实质就是对总体进行 n 次重复试验或 n 次重复观察,而每
一次试验或观察都是相互独立的(有放回抽样),即抽样问题就是研究 n 个“独立同分布”
的随机变量的函数问题。这里“独立”是指 n 次重复试验互不影响,即各样本独立;“同分布”
是这 n 个随机变量都从同一总体取值。所以对于用随机变量 X 表示的总体,常常用(X1,
X2,……,Xn)来表示它的一个容量为 n 的样本。注意,这里的每个 Xi 作为 X 的一次观
测值本身也是随机变量。
二、基本随机变量分布与抽样分布
一般的随机变量概率分布可称为基本随机变量分布,但上述我们要研究的是样本统计量
的概率分布。注意到,根据上述 n 个独立同分布随机变量计算而来的样本统计量本身也是随
机变量,则它们的概率分布就称为抽样分布,即样本统计量或基本随机变量函数的理论分布。
根据样本统计量的不同,可区分样本均值的抽样分布、样本方差的抽样分布、样本相关系数
的抽样分布、比例的抽样分布等。另外,从分布形态上看,常见的抽样分布主要包括是正态
分布、T 分布、χ2 分布、F 分布等,将在后文陆续介绍。
三、抽样分布理论
抽样分布理论是整个推断统计的理论基础,对它们的证明不用理会,只需掌握这些结论
及其应用条件。
假设某一个用随机变量 X 表示的抽样母总体的均值为 μ,方差为 σ2,从总体中抽取容
量为 n 的样本,则有如下结论:
(1)一切可能样本的平均数的均值(期望)等于母总体的均值,表示为:EX = μ
(2)一切可能样本的平均数的方差等于母总体方差的 n 分之一,表示为:DX = σ2/n
因此样本均值分布的标准差等于母总体标准差的 分之一,称其为标准误(SE),即 SE
= σ/ 。
(3)一切可能样本的方差的均值(期望)等于母总体方差的 n 分之 n-1,表示为:
ES2 = (n-1)σ2/n
注意以上结论都没有要求总体分布呈正态,所以对任意总体均有这些结论。
之前已经谈到中心极限定理(见第三章第三节),一般而言,抽样分布有如下结论:
(1)若母总体呈正态分布,一切可能样本的均值分布也是正态分布,表示为:
X~N(μ,σ2),则 ~N(μ,σ2/n)
(2)若母总体不呈正态分布,只要样本容量 n 足够大,则一切可能样本的均值分布趋
近正态分布,表示为:
X~?,当 n->∞时, ~N(μ,σ2/n)
(3)若母总体服从正态分布,则一切可能样本的方差服从 χ2 分布,表示为:
X~N(μ,σ2),则(n-1) /σ2~χ2(n-1)
(4)母总体服从正态分布的两样本方差之比服从 F 分布,表示为:
X1~N(μ1,σ21),X2~N(μ2,σ22),
则
(5)样本相关系数的抽样分布:
四、χ2 分布
若 n 个相互独立的随机变量 X1,X2,…,Xn,均服从标准正态分布(也称独立同分布
于标准正态分布),则这 n 个随机变量的平方和∑X2i 构成一新的随机变量,其分布规律称
为 χ2(n)分布,其中参数 n 称为自由度,自由度不同就是另一个 χ2 分布,正如正态分布中均
值或方差不同就是另一个正态分布一样。χ2 分布的概率密度函数比较复杂,这里不再给出。
:8080/courseware/0062/content/0004/tanchu/
自由度
许多统计量的抽样分布都有自由度(degree of freedom)这个参数,所谓自由度即统计
量中相互独立的随机变量的个数,这些随机变量的取值都能自由变动。故若为同一个标准正
态总体中抽取的 n 个独立随机变量,其平方和之和构成的X2 统计量自由度为 n;但若标准
化时,母总体均值未知,用样本均值 替代之,则该统计量中包含了一个约束条件,即这 n
个随机变量的均值要等于 ,从而使得统计量中真正自由变动的随机变量个数成为 n-1(剩
下的一个由这 n-1 个即可确定),即其自由度变为 n-1。
卡方分布是由正态分布构造而成的一个新的分布。其图形始终在第一象限内,呈正偏态,
随着参数 n 的增大,χ2 分布趋近于正态分布。
χ2 分布的均值为自由度 n,方差为 2 倍的自由度(2n)。从 χ2 分布的均值与方差可以看出,
随着自由度 n 的增大,χ2 分布向正无穷方向延伸(因为均值 n 越来越大),分布曲线也越来
越低阔(因为方差 2n 越来越大)。χ2 分布具有可加性:若有 K 个服从 χ2 分布且相互独立的
随机变量,则它们之和仍是 χ2 分布,新的 χ2 分布的自由度为原来 K 个 χ2 分布自由度之和。
表示为:
χ2 分布是连续分布,但有些离散分布也服从 χ2 分布,尤其在次数统计上非常广泛,这
个应用将放在第八章介绍。
实际上,对从任意一个正态总体中抽得的随机变量样本,其标准化后的 Z 分数之平方
和也服从自由度为 n 的 χ2 分布。若母总体的均值未知,可使用样本均值 代替,则得到的新
的统计量服从自由度为 n-1 的 χ2 分布。
上面这个公式在应用中更为常见;从统计量的构造可看出,它主要是采用“比商”的方式,
将样本方差和一个已知的总体方差相比从而对该样本方差所来源的总体方差进行推断。
五、T 分布
T 分布是由正态分布和卡方分布构造而成的一个新的分布。设 X,Y 为相互独立的随机
变量,X 服从标准正态分布,Y 服从 χ2(n)分布,则统计量 t =X/√Y/n 服从 T(n),其中参数 n
称为自由度。
T 分布的图象呈单峰对称状(以 Y 轴为对称轴),非常接近标准正态分布,峰部比标
准正分布低,两端比标准正态分布高,当自由度 n 很大时(n>30,120),T 分布与标准正
分布已无法区分,所以 T 分布常常用于样本容量小于 30 的小样本,故也称 T 分布理论为小
样本理论。
一般情况下,T 分布的均值为 0,方差随自由度 n 的增大从大于 1 的方向越来越接近
1,更准确的表示是:
和卡方分布一样,T 分布在实际应用中也有一个更常用的构造。前面的正态抽样分布中,
我们知道均值的抽样分布在很多时候是正态或近似正态分布,即便母总体的分布不是标准正
态分布,也可通过标准化过程进行转化。即总体分布明确,参数 μ 和 σ2 给出时:
但如果母总体参数 σ2 不知道,则可用样本标准差来代替之,则此时新的统计量不再服
从标准正态分布,而是一个新的分布,即自由度为 n-1 的 T 分布。
注意在总体方差未知时,样本平均数本身仍然服从正态分布,服从 T 分布的是包含样
本均值的类似于 Z 的新统计量。根据 T 分布的原始构造,这个结论可以这样来理解:
六、F 分布
F 分布是由两个卡方分布构造而成的一个新的分布。若随机变量 ,
,则统计量
其中参数 n1、n2 是两个自由度。和卡方分布一样,F 分布也在第一象限内,呈正偏态,
随着两个自由度的的增大,趋近于正态分布。不过其趋于正态分布的方式和卡方分布不同。
一般情况下,F 分布的均值接近 1,方差一般都小于 1,且随两自由度的增大方差越来
越小,即图形越来越收缩。更准确的公式是:
F 分布也有一个更常用的构造,即两个服从自由度为样本容量减去 1 的卡方分布的比值:
七、抽样分布的查表
对于这些抽样分布的应用,最重要的是知道如何在推断统计中查相应的概率分布表。在
标准正态分布中,由于曲线形状固定,因此在半边存在统计量 Z 值(分布的横坐标)和中
央概率(当然也可以是尾端概率)的一一对应关系,它们之间可通过查表进行换算。但卡方
分布和 T 分布都有一个自由度参数,自由度不同,曲线形状就不同;因而要对每个常用自
由度编制一个如同标准正态分布那样详细的统计量(χ2 或 T)和 P 的对应表会有很大篇幅。
因而,附表 2 和附表 11 的这两种表都采用仅列出一些常用自由度下若干最常用概率和
统计量间的对应表,而且概率都规定是尾端概率;其中 T 分布表是采用分布在两个尾端的
所谓“双侧概率”和统计量对应;卡方分布是采用右侧尾端概率和统计量对应。最后,F 分布
由于有两个自由度,因而在一个表中所能列出的 F 统计量和概率的对应更少,附表 3、4 中
行、列分别为两个自由度(根据实际需要,分母自由度变化范围更大)占用,则只能提供两
个最基本的概率与统计量相对应,且这概率也是尾端概率。注意,通常附表 4 的单(右)侧
概率分布表更为常用。
举几个简单例子说明如何查表:
上图 4-2 所示的单侧概率 χ(7)= 的查表方法是,在第一列找到自由度 7 这一行,
在第一行中找到概率 这一列,行列的交叉处即是 。这个对应关系意味着在自由度 7
时,χ2= 所割出的 χ2 分布曲线右侧概率为 。反过来也是如此。上图 4-3 所示 T 分布
中,查 8 这一行,在第一行中找到概率
这一列,行列的交叉处即是 。该对应关系意味着在自由度 8 时,T= 以及其所对
称的 所割出的双侧尾端概率为 。此时,若只使用单侧概率(表的下端),则显
然 T= 割出的单侧尾端概率就只有 的 1/2。
下图分别是 F 分布双侧和单侧表,查表方法不再赘述,需要注意的是,F 分布双侧表中,
尾端概率各为 α/2 时,其对应统计量并不具有相反关系,而是互为倒数。
双侧概率表(附表 3) 单侧概率表(附表 4)
第三节 参数估计
一般情况下,总体的情况是不清楚的,即总体的分布及总体的参数都可能未知,而参数估计
就是解决总体的参数未知时如何通过样本统计量来估计总体参数的问题。
参数估计有两种方法,一是直接用一个样本统计量来作为总体参数的估计值,如用样本
平均数估计总体均值,用样本标准差 Sn-1 估计总体标准差,这种参数估计称为点估计;另一
种是根据抽样分布理论,给出一个以样本统计量为中心的一个可能范围作为总体参数取值范
围的估计,且这种估计伴随着一定的把握程度(概率),称为区间估计。当然,如果将点估
计看成是区间估计的一种特例,可认为参数估计实际上是在估计精确度和估计把握度之间进
行权衡的结果,要追求精确度,估计的区间就要尽可能小,则此时把握度必然降低;反之,
若区间写得较大,则估计的把握度就越大。
一、点估计
点估计是用样本统计量来代替总体参数,一个好的点估计应具备的如下条件:
无偏性。用多个样本的某一统计量作为总体参数的估计值时,若这些样本统计量与总体
参数的偏差平均为零,则用该统计量来代替总体参数具有无偏性。无偏性更精确的表述为:
若样本的某个统计量的均值等于该被估计的总体参数,则该样本统计量是无偏的。
一致性。当样本容量越来越大时,估计值能越来越接近它所估计的参数。
有效性。当总体参数不止一个无偏估计时,其中方差最小者最有效。
充分性。若估计量反映了样本中每个数据的信息,则满足充分性。
根据这些条件,总体均值的点估计是样本平均数,总体方差的点估计是样本方差
S2n-1,两总体相关系数的点估计是从这两总体中抽样的两配对样本的相关系数。
二、区间估计
区间估计是给出包含总体参数的可能范围。根据正态分布理论和抽样分布理论可知,任
一样本的平均数落在总体均值左右 个标准差(指抽样分布的标准差)的范围内的概率
为 95%;则将此关系中总体均值反算回去,则任一样本平均数左右 个标准差范围内包
含总体均值的可能性为 95%。这就是总体均值区间估计的大体思路。
根据小概率事件原理,上述以样本均值为中心,半径为 个标准误的区间“不包含”
总体均值的概率只有(100-95)%,在一次抽样中不会发生,可忽略不计。因此就把这个范
围称为总体均值的 95%置信区间,概率 95%称为置信度,即区间估计的把握程度;剩下 5%
是基于这一次抽样(也就是基于所得样本均值)构造出的置信区间未包含总体参数的可能性
大小,即区间估计犯错误的概率,称为显著性水平,用 α 表示;小概率事件原理要求显著性
水平不能超过 5%。以下是一些常用的区间估计。
1、总体均值的区间估计:
2、总体方差、标准差的区间估计:
阅读材料
电梯载重量
注意到每部电梯中都有类似这样的
提示:载重负荷上限 1000 公斤,限乘 13
人,或者 1500 公斤,限乘 15 人等。这样
规定对于保证乘坐电梯时的安全非常重
要。这样规定有什么养的统计学依据呢?
可以用下面的例子做一个演示性的说明。
假设一个标准电梯的限载重量为
1000 公斤,准 13 人乘坐,已知人群体重的
平均数和标准差分别为 μ= 公斤,σ=
公斤。我们可以计算电梯因为超重发生事故的概率是多大(假设体重服从正态分布)。
利用人群体重的数据构造任意一个 13 人电梯乘客团体平均体重的抽样分布。我们所要
求的就是 P( )=P(Z> )=P(Z>14)。根据正态分布知识,Z 分数取值
在 以上的概率就已经不足 %,所以这个概率是一个极小概率。换句话说,只要限乘
人数不超过 13 人(假定每次都是 13 人乘坐是最多的情况),则他们的平均体重超过
(或总体重超过 1000 公斤载重负荷上限)的概率非常之小,以至于可以忽略不计。因而我
们可以放心乘坐。