第一节 等距抽样概述
第二节 等距抽样的实施方法
第三节 总体参数的估计
第四节 其它形式的等距抽样
第一节 等距抽样概述
一、等距抽样的概念
等距抽样也称系统抽样或机械抽样。它是将总体
各抽样单元按一定的标志和顺序排列以后,每隔
一定的距离(间隔)抽取一个单元组成样本进行调
查。
二、排序标志
等距抽样需要有作为排序依据的辅助标志。排序
标志各式各样,可自由选择,但归纳起来,可分
为两类,即无关标志和有关标志,它们对等距抽
样的作用和相应的估计精度各有不同的影响。
1、按无关标志排序
所谓无关标志排序,即用来对
总体单元进行排序的标志,与
所要调查研究的标志是不同性
质的,二者没有任何必然的关
系。如研究人口的收入状况时,
按身份证号码、按门牌号码排
序非常方便,一般说来,这些
号码与调查项目没有关系,因
此可以认为总体单元的次序排
列是随机的,所以也有人直接
称无关标志排序的等距抽样为
无序等距抽样。
2、按有关标志排序
所谓有关标志排序,即用来对
总体单元规定排列次序的辅助
标志,与调查标志具有共同性
质或密切关系。这种排序标志,
在我国抽样调查实践中有广泛
应用,如农产量调查,以本年
平均亩产为调查变量,以往年
已知平均亩产作为排序标志。
利用这些辅助标志排序,有利
于提高等距抽样的抽样效果。
三、等距抽样的特点
(1)将总体各单元按一定的顺序
排列后再抽样,使得样本单元
的分布更加均匀,因而样本也
就更具代表性,比简单随机抽
样更精确,在某些场合下甚至
可以不用抽样框。并且如果能
够利用好样本的相应顺序在总
体中均匀分布这一特点,则容
易形成一个按比例样本。
(2)等距抽样简单明了,快速经济,操作灵活方
便,使用面广,是单阶段抽样中变化最多的一种
抽样技术。等距抽样最初用于森林和土地使用情
况的调查,后来经过汉森、麦多、科克伦等学者
的努力,使其成为当今家计调查、记录抽样、空
间抽样、工业抽样和为普查取得附加信息及估计
非抽样误差的一种常用方法。在我国,等距抽样
已成了最主要、最基本的抽样方式,一些大规模
的抽样调查,如农产量抽样调查、城乡住户调查、
产品质量抽样检查中都普遍采用了等距抽样。
(3)当N=nK时,等距抽样就等同于每层只抽一
个单元的分层抽样或群的大小相等时只抽一个
群的整群抽样。
因为,这时,总体各单元可排列成如下方式:
y
11
y
21
… y
i1
y
k1
y
12
y
22
… y
i2
y
k2
┋ ┋ ┋ ┋ ┋
y
1n
y
2n
… y
in ykn
(4)等距抽样的样本常被视为一
个集体单元,一般不计算样本
调查变量的方差,所以它只能
抽象地进行理论分析,而不能
对抽样方差进行估计。
(5)若总体中的单元呈周期性的
变化,等距抽样的精度可能很
高也可能很差。这时要慎重地
选择K。
第二节 等距抽样的实施方法
一、随机起点等距抽样
二、循环等距抽样
三、中点等距抽样
四、对称等距抽样法
五、两端修正法
六、总体有周期性变化时的等
距抽样
七、累计和等距抽样
一、随机起点等距抽样
随机起点等距抽样就是前面概念所
描述的方法。具体地说,它是在总
体单元排序后的第1至K单元之间(第
一个抽样间隔之内)随机抽取一个整
数i,以它作为起始单元的编号,以
后按固定的顺序和间隔依次在每个
间隔之内各抽取一个单元组成等距
样本,则整个样本是由以下编号的
单元所组成的 。
i+(j-1)K (j=1,2,…,n)
由于N不一定恰好是K的整数倍,所以按上
述方法得到的等距样本的样本量可能为
为避免这种样本量不能确定的情况,确保
样本量为n,1952年拉希里提出了循环等距
抽样的方法。
二、循环等距抽样
在N≠nK时,把总体中的N个单元按一定顺序排
列成一个首尾相接的环(圆形图),取最接近于
N/n的整数为抽样间隔K,然后在1到N的单元中,
随机抽取一个单元(设为第i单元)作为起点,
再沿着圆圈按一定方向每间隔K抽取一个单元,
直到抽够n个单元为止。按此方法,可以保证
样本量n不变。不过此时首尾两个样本单元的
间隔不一定恰好为K,它可能小于K,也可能大
于K。
中,
循环等距抽样从本质上看仍然是随机起点等距抽
样。
我们注意到,当N=nK时,在上述两种抽样实施方
法中,无论按哪一种方法,总体中每个单元的入
样概率都相等,从而是一种严格的等概率抽样。
但当N≠nK时,按第一种方法每一个单元的入样
概率依赖于初始值i,对不同的i,稍有不同。以
下为了处理方便,我们假定N总是n的整数倍。在
实际工作中,若n充分大,则由于N/n非整数而带
来的影响就充分小,可以忽略不计。
三、中点等距抽样
1953年麦多为克服随机起点等
距抽样容易产生系统性偏差的
缺点,提出中点等距抽样(即抽
取中心位置的样本)法:计算出
抽样间隔K后,以第一组的组中
点为起点,等距抽取单元组成
样本。如果K为奇数,以
(K+1)/2为起点,K为偶数,
以K/2或(K+2)/2为起点。
四、对称等距抽样法
对称等距抽样也是针对有序等
距抽样所提出的,其基本思想
是使低标志值的单元与高标志
值的单元在样本中对等出现。
从而使样本的偏差缩小,代表
性增强。由于具体的方法不同,
对称等距抽样又有几种类型。
1.塞蒂的方法——两两对称等
距抽样
1965年塞蒂提出了一种新的等
距抽样方法——对称等距抽样
法,以克服总体的线性趋势对
估计效率的影响。
设N=nK,n为偶数。抽样时,先
把总体单元分成n/2个抽样间隔,
使每一抽样间隔含有2K个单元。
然后,在每一抽样间隔内,抽
取分别与两端距离相等的两个
单元,这样共抽取n个单元组成
等距样本。
即:如果随机起点为i,则在第一个抽样间隔所
抽两个样本单元的号码分别为i及2K-i+1;在第
二个抽样间隔所抽两个样本单元号码为i+2K及
2(2K)-i+1;如此,最后在第n/2个抽样间隔所抽
两个样本单元号码分别为i+(n-2)K及nK-i+1。
一般,若随机起为i,则抽中的n/2对样本单元的
号码可以表示为
i+2jK,2(j+1)K-i+1] [j=0,1,…,(n/2)-1]]
当n为奇数时,式中的j由0变到(n-1)/2-1为止,
并且,要加上接近末端的第i+(n-1)K个单元。
实际中,为便于对称等距抽样的实
施,当N=nK时,可以将原来由小到
大(或由大到小)顺序排列的单元按
照顺逆交替的次序排列在一个表中,
这样,按随机起点等距抽样所抽取
的样本即为对称等距样本。所谓顺
逆交替是指在单元的排序中,若第
一间隔由小到大排序,则第二间隔
按由大到小排序,以此类推。
2、辛的修正方法——中心对称
等距抽样
1968年,辛等人提出另一种对
称等距抽样法——中心对称等
距抽样法。即在有序排列的总
体单元中,从两端划分抽样间
隔。并从两端的抽样间隔开始,
成对地抽取到两端距离相等的
单元组成等距样本。
这里,仍假定N=nK。当n为偶数
时,若随机起点为i,则与之对
称的样本单元号为倒数第一个
抽样间隔中的N-i+1;与第二个
抽样间隔中i+K对称的是倒数第
二个抽样间隔的(N-K)-i+1;如
此,一直抽到中间两个抽样间
隔为止。一般,以i(i=1,2,
…,K)为随机起点的n/2对对称
等距样本单元的号码可以表示
为:
[i+jK,(N-jK)-i+1],[j=0,1,…,
(n/2)-1]
当n为奇数时,式中的j由0变到[(n-
1)/2]-1为止。然后,再加上中间一
个抽样间隔中的第i+(n-1)K/2个单
元。(我国抽样调查工作者提出在中
间一个抽样间隔抽取中点处的一个
单元。)
五、两端修正法
抽样方法同随机起点等距抽样
时的情形。但在计算总体均值
的估计量时,对第一个和最后
一个样本单元加权,其余单元
的权数仍为1(在除以n以前),
以矫正由于起点不在中心位置
而引起的系统偏差。
1、耶茨的方法:
设N=nK,i为1~K中的随机数,则两端的
样本单元的权数分别为:
其中“+”号用于第一个样本单元,“-”
号用于第n个样本单元(下同)。当总体单
元具有严格的线性趋势时,加权的样本均
值就是总体均值。
2、具尔豪斯与拉奥的方法
适用于N≠nK的情况,并采用循环等距抽
样法,设i为1~N中的随机数。
(1)若i+(n-1)K≤N,这时n个样本单元不
经过y
N
,则第1个样本单元和第n个样本单
元的权数分别为:
(2)若i+(n-1)K>N,设y
N
以后的样本单元
有n
2
个,则第1个样本单元和第n个样本单
元的权数分别为:
六、总体有周期性变化时的等距抽样
有一些总体,其单元的标志值在随时间的自然排
列顺序中,会呈现某种明显或不明显的周期变化
趋势。如季节性消费商品的销售量,随一年四季
的变化而呈现出周期变化。还有些总体,反映出
不明显的周期影响。对有周期变化趋势的总体进
行等距抽样时,抽样间隔K的选择,对估计效率的
影响是极为重要的。为了说明问题,我们不妨假
定总体单元标志值的变化为一正弦曲线。
七、累计和等距抽样
以上所讨论的等距抽样都是以
各单元大小相同为前提的,是
等概率抽样。如果抽样单元的
大小不同,且单元的大小又与
调查变量相关时,用上述方法
就不大合适了,此时,应采用
不等概率抽样。
其基本思路是:在总体各单元按某一标志排序后,
累计各单元的大小Mi(当各抽样单元的大小用所
含下一阶单元的数目表示时,也可直接累计其下
一阶单元数)并进行编码,以总的累计数除以n作
为抽样间隔,用K表示,然后在最初的1到K个数
中随机确定一个数j(1≤j≤K),j所对应的单元
即为第一个被抽中单元,以后每间隔K抽取一个
随机数,并按同样的方法确定出对应的单元作为
样本单元,组成等距样本。累计和等距抽样的原
理同上一章所讨论的群大小不等时群的代码法,
此法在实际工作中经常用到。
例:某街道50家企业,要调查企业生产经营状况。在
按工商登记注册资金排序后,下表列出了企业的职工
人数及累计人数:
第三节 总体参数的
估计
一、等概率抽样的情形
为讨论方便,仍假设N=nK,则在如下的排列
形式中,有:
(i=1,2,…,K)
(一)估计量
设等距样本为表中第i列单元,且i是随机
决定的,总体均值的估计量用表示,则:
是 的无偏估计。
若N≠nK,则上述估计量是有偏的,但当n
充分大时,其偏倚可以充分小。
(二)估计量的方差
如前所述,如果总体单元是按
无关标志排列的,则其方差可
按简单随机抽样去做。若总体
单元是按有关标志排列的,则
此时的等距抽样可以看作是整
群抽样或分层抽样的特例,因
此,等距抽样估计量的方差可
以比照整群抽样或分层抽样的
方法构造,有几种表示方法。
1、用等距样本内(群内)方差表示
设等距样本为表中第i列单元,且i是随机
决定的,则:
其中:
为等距样本(群)内方差;S2为总体方差。
这表明,当等距样本内部的方差大于整个
总体方差时,等距抽样比简单随机抽样有
更高的精度。因此,为了提高等距抽样的
精度,只要有可能就在对总体单元排序时
尽可能扩大各等距样本内的差异。
当且仅当 时,等距抽样比简单随机
抽样精度高。
2、用等距样本内(群内)相关系
数 表示
其中:
为同一等距样本内(群内)成对
的单元之间的相关系数。当
的值大于0时, 方差的值就
会变大。
3、用同一等距样本内单元对关
于层平均值的相关系数表示
其中
为
层内方差;
恰为比例分配分
层随机抽样的方差;
是第h层即第h间
隔的平均值;
是等距样本内单位对关于层
平均值的相关系数。
当 =0时,等距样本与每层取
一个单元的分层随机样本精度
相同;
当 >0时,等距抽样的精度
低于分层随机抽样;
当 <0时,等距抽样的精度
高于分层随机抽样。
(三) 线性趋势总体
线性趋势总体是指总体各单位标志值呈现直线变
动的趋势。在我国社会经济抽样调查实践中,如
农产量调查、职工家计调查、农村住户调查等,
总体抽样框有类似线型趋势的情况。
设线性趋势总体N的各单位i的标志值为
,
,将总体分成n层,每层含有K个单位,
当随机起点为r时,等距样本各单位标志值为:
那么,等距样本平均数为:
而总体平均数为:
可以证明,样本平均数是总体平均数的无偏估计
量
线性趋势总体下等距抽样方差与简单随机抽样方
差、分层抽样方差的比较:
等距抽样方差:
简单随机抽样方差:
分层抽样方差:
由总体 分成 层,每层含 个单位,在线性总
体各层方差 是相同的,因而
所以有:
(四)方差估计量
前已指出,等距抽样相当于群
的大小相等时的整群抽样,但
抽中的是一个群,这就使这个
受人欢迎的抽样方法有了一些
遗憾:等距抽样没有无偏的方
差估计量。这里只介绍两种方
差估计方法。而在冯士雍、施
锡铨著的《抽样调查—理论、
方法与实践》一书中,列举了
八种不同的方差估计量,并进
行了比较分析。
1、总体单元无序排列(即按无
关标志排列)时
可把等距样本看成是简单随机
样本,因此,其方差估计量可
表示为:
其中
2、总体单元有序排列(按相关
标志排列)时
前已指出,等距抽样可看成是
从每层抽取1个单元的分层抽样。
但凭一个单元的标志值无法估
计层内方差,于是把相邻两行
(层)的2K个单元组成一层,从
中抽取2个单元作为样本,这样
总体就被合成了n/2层(假设n为
偶数)。
第h层的层内方差
h=1,2,…,n/2
将诸 代入比例分配的分层随
机抽样的有关公式,则
(这里
)
将上式中的下标h改为j就得到
(1)
式中: 是相邻两个标
志值的一阶差分,它们间互不
重叠, 中利用了n/2个这样
的一阶差分,这就要求n必须是
偶数。为摆脱这个限制,增加
平方和的自由度,以每相邻两
个标志值的一阶差分(它们是重
叠的,共n-1个)代替n/2个不相
重叠的一阶差分,得:
(2)
研究表明:(1)式和(2)
式对大多数模型的总体都具有
一定的优良性,即使对总体的
性质知道得很少,它们也是一
个好的方差估计量。但(1)
式受到n必为偶数的限制,因而
(2)式更值得推荐。
此外,也有人建议采用交叉子
样本法来估计等距抽样的方差,
但这种方法在实际操作中有诸
多的不便,且当各子样本不大
时,效果也一般。对此感兴趣
的读者可参阅有关文献。
二、不等概率抽样的情形
等距抽样中每个单元的入样概
率也可以是不相等的。一般的
不等概率等距抽样定义如下:
令{π
i
}是一组入样概率,
i=1,2,…,N,且 , r是
[0,1]区间内的一个随机数,
则当:
(k=0,1,…,n-1)
时,总体中的第i
0
,i
1
,…,i
n-1
个
单元即为抽
中的样本单元。当每个π
i
≤1时,
抽样是严
格不放回的。最常用的也是最简
单的不等概
率等距抽样是πPS等距抽样,即
令π
i
与单元
大小M
i
成比例:
其中 等于 是总体所有单元大
小的总和。
不等概率等距抽样的实施方法
一般是累计和等距抽样法,这
在第二节中已作了介绍。
与其他不放回的不等概率抽样
一样,不等概率等距抽样对总
体总和Y的估计也是采用霍维茨
—汤普森估计
对于πPS等距抽样,又有
是无偏的,其方差可表示为(此
时,n是固
定的)
由于对一般的n, 的形式极为复杂,且
有可能为零,因此,关于 的估计可
按如下思路进行:
一种考虑是将不放回的πPS等距样本作为
放回的PPS样本处理可得到如下的方差估
计形式
因为实际抽样是不放回的,为此,应考虑乘上有
限总体修正系数(fpc)1-f,由于这里的单元实际上
是不平等的,因此,f不是简单的等于n/N。我们
使用f的以下估计:
则可以得到方差估计量的另一种形式:
对于随机排列的总体, 的效果很好。
若考虑用相邻样本观测值(但这里需用
代替等概率情形的 )差值的平方
和来表示方差,则得到
或
对于具有线性趋势的总体,这两个方差估
计量特别适用。
第四节 其它形式的等距
抽样
一、分层等距抽样
分层等距抽样,是对总体分层
后在各层独立地选取起点进行
等距抽样。由此看来,若按某
种标准分层,把等距抽样的若
干抽样间隔分为一层,则一般
的等距抽样实际上就是一种特
殊的比例分配分层抽样。所谓
特殊,是指在各层中起点的选
取不是相互独立的,而是由第
一层起点所决定的。
分层等距抽样可以集中发挥分
层抽样和等距抽样的优点。实
际中,如果需要知道各层的估
计资料,或者需要在各层安排
不同的抽样比,或者在各层内
等距抽样比简单随机抽样更精
确更方便,显然应该采用分层
等距抽样方法。
分层等距抽样时,总体平均数的估计量应
该是:将各层等距抽样的估计量加权平均。
即若 为第h层等距样本的平均数,则总
体平均数的估计量为:
其中 , 为第h层的权数,
为第h层抽中的样本单元数, 为第h层的
总体单元数。
估计量的方差为
其中 为第h层估计量的方差,
在相应的条件下,可由前面所
介绍的方差估计量进行估计。
二、二维等距抽样
二维等距抽样,是对分布在平面上的总体单元直
接进行的等距抽样。如农产量调查和森林木材积
蓄量调查中,从抽中地块抽取样本点,即属这种
情况。
实际上,我们所研究的总体单元绝大多数分布在
平面上,以前是通过对总体单元的编号,排队等
方法,将它化为“一维等距抽样”。但在一些情
况下,还需直接在平面上抽取样本。
二维等距抽样的方法很多,下面仅介绍几种最简
单、实用的方法。
1、方格法
是将总体所在的平面区域G,按
照需要抽取的样本单元数划分
为若干大小相同的方格,然后
以等距方式在每个方格抽取一
个样本单元组成样本。即抽样
间隔之长等于方格的边长,可
按下述公式计算:
其中, K=抽样间隔;G=总体
区域的面积; n=样本单元数
这里,为方便讨论,假定地块
的图形是长为a,宽为b的长方
形,置于平面直角坐标系的第
一象限。且a=Kp,b=Kq,p、q为
整数,pq=n。当然,实际中的
地块常常是不规则的,并不满
足上述条件,但可通过割补法
化成比较规则的几何图形,近
似按上述方法处理。
从方格中抽取样本点有多种方
法。①若取随机起点,并且它
的坐标为(i,j),则
所有样本点的坐标可表示为:
s=0,1,2,…,p
-1;
(i+Ks,j+Kt)
t=0,1,2,…,q
-1
②另一种方法是,把样本点放在
每一方格的中心处,称为中心
方格法。其样本的坐标为:
(K/2)+Ks,(K/2)+Kt).(s=0,1,2,
…,p-1; t=1,2,…,q-1)
这种方法在农产量调查中多用
于平播、撒播、窄垄和株行距
较小的作物,如麦、水稻等。
实际中,每个样本点是用测规
或测框划出的园形或方形小地
块,称为面积样本。每个样本
点的面积常为10平方市尺,这
样,便于计算。这种方法也称
为框测法。
2、垄测法
对于宽垄和株行距较大的作物,
如玉米、薯类等,常采用垄测
法。垄测法需先计算地块所有
垄的总垄长,依地块情况,可
按下述方法计算:
总垄长=平均垄长×垄数=地块
总面积/平均垄宽
其中:平均垄宽=地块两端宽
度之和/地块两端垄数之和
抽样间隔K=总垄长/样本单元数
抽取时,从地块的一角开始,
即从第一垄开始,按等距抽样
方法依次向各垄抽取,每个样
本点是长度为10市尺的垄段,
这种样本也称为长度样本。
实用中,还有许多方法,如将
地块划分为正三角形小块,形
成三角形网,使样本点散布于
正三角形的顶点上。也还可以
利用试验设计的方法安排样本。