2002年第8期统计研究剑102Statisti.四1&回earch50 巾叩童在E国农业查事后质量抽查日卢依吉·法布里斯徐志全戴宏国ABSTRACT 咀lepost-enumeration survey (PES) of the First National Agricultural Census in China (NAC) was carried out in order to check the quality of the census data at the national level . A sample of ahout 40 0∞ rural households was enumerated, census and PES records were matched one-to-one, and census-PES dis›crepancies on farm and management were computed. Almost 150 000 records of rural family members were matched ,. and individual response errors were computed.币lemost apparent errors on survey estimates were those of the interviewers. As far as respondents’ errors are concemed., it was determined that most of the census data a犯highlyreliable, both at the farm and individual levels but some of the fig›ures should not be pubrished at the provincial or lower levels. Indications for future activities are given. 关键词:事后质量抽查;记录匹配;回答误差2k ~何r= ----,-一一一一,L,"2;E( diA’ I D),为指导员内相关-~PES数据分析模型σ~N2(k-I),~川f系数由于抽查不只是对普查的重复,而是针对已进行的示被调查者的基本回答误;; ’" nlk,N ’" Nlk, d表jj调查来收集"真实值"的一种方法。在中国,PES的入户访差(j'"1, ,N) ,t:. '"μ-E(y)。基本回答方差反映被调问是按与普查相同的环境来进行的,目的是要得到尽可查者的回答误差对总体估计的影响o能接近真实的调查结果。记录匹配完成后,对以下几个方面进行可靠性估计:从PES得到的数据要与普查数据相比较。对两次调①在抽查中丢失的和找到的人数,从而对农村住户的家查的回答逐一比较,会得到如下的结果:①普查和抽查回庭人数进行估计;②与农村住户和农业管理有关的回答答一致;②两次调查的回答不一致:回答的差别越大,普误差的估计:③与家庭成员有关的回答误差的估计。查估计的可靠性就越低o基本回答方差可用下面的公式来估计,它几乎是一PES是为了检查和评估普查的数据质量。对PES回个元偏估计①(Fellegi,1964;Bassi & Fahbris,1997): 答误差的研究表明,回答误差也影响了PES数据。下面,我们将对两次调查同等对待。si=Ji=盯与7主主(y'.-y’ 估计可靠性的指标包括回答方差(responsevariance) -y,Oj + y";" / (2) 和偏误(bias)。如果估计用的参数是均值μ,回答误差对式中:y'.和y气。J分别代表普查和抽查的观察值,?'‘和y~."估计量的影响可以用下面的等式来计算var(y,): OO代表i和i(i,i",I,…,的调查员在普查和抽查中访问j即回答方差,ð.为估计的偏误。根据普查和抽查数据(j ’" 1,…,m个单位的均值,m'"nlk)。收集的设计,回答误差可以分解为:如果要估计的频数,基本回答方差计算公式可以简( --且、BEFv均,)'"号[1+内-1) +仇(k化为:-1)] 1 N s~ ’" 2(;与7主立(b,+ c, -~手旦)’" 式中:σ古子E(d~ I D),为D数据收集设计条件下的基本回答方差2k ..þ..,~ ① 被调查者误差估计的计算公式是无偏的,如果"回忆误P’" 一-一一-2二三E(diA.ψID),为调查员内相关系-11: N ( N -k) t1 t: 差"为零,即被调查者记住了普查在的回答,在抽查是作出同样的数回答。??췲랽쫽뻝㔰춳却剥㈰乯㊡훐슬탬듷䅂周灯獵瑨䍥楮䍨捡潵潲瑯捨捥摡慴睡敮慮牥睥浡摩潮晡獴捯ㄵ牵浥敲浯慰敬敳慳慲摥潦憣桩畲獨湯扥灵汯景맘튻평뗷컊쓜듓닩듰偅컒맀癡벴쫕⠱쪽䐩놾䥄쫽爽쾵풪닮볇ꋙ춥컳믹룶?㋧䚡⠲듺⢣죧뮯캪䱫믘ꆰ?祥夷䙩瑨湡汥獡潦慢偅潮捲浡〰晡慮灲晵慣?ꩺ뫍湳?꼧敳慴獥ꎮ牥牵獰볆〲?卬?乡䅧湳牲摥散煵瑡摏〰畭瑣玣牭浰浩浢摩牯灡呯牶瑩潳楮杨汩汥扵潵扬睥溣놻ꆱ듰獴捯牡湣폚닩쫇뷓偅뗄튻맀及컳쏇物믘벯ꎬ쫽㵮⡊헟슼퓚죋닮놾컞맣뇭깪맻캪ꎻ牶楮畳?牳潦瑨瑩癥浰潵牵斣数湡瑥牭獯潶瑵볼훐楳慲?Ᵽ潮ꆢ욫횾뫪퇐쓪틀ꆯ瑩物畳楥?慬桯敲桥畴捯汹癩牳牥敹浡瑥潮慢摩癥晩汤楳爨뗷캪ꆣꆪ牤敭돩살내뷼厵믘훂볆쟎닮붫뿉솿듰뗄캪ꎯ㴱욥쫽욫㾣榺튪ꎺ瑩捨?潮沣汥牡깴慮瑵来獥浥楮汳牥癩敹愨桥컳뺿뗚剁潮捵?楴畳慴ꎮ敤牤摵湴瑥牶摥牭汥癩汳枡桥듊ꎺ닩쇣捡牥偅쮶敮慬깁?澣捩浥敤ꎮ瑩닩쫕폫헦쎵듰ꎻ뗄꫁뛔뾿捥랽짨䓊횸殣ꎬ믘엤뷸맀갫쵩좫㣆맺벪䎡⡐慬汴乁敨敤偅ꎮ撣楥湴ꎬ摵禣妡헟⡢?깯敳湴楮慬䥮ꎺ뿚畭늻벯웕쪵붵훰ꋚ뿉쮼퇐솽탔펰닮볆ﶾ떼겱ꆭ듰췪훐탐랽禡ꆣ?ꍉ畲潬ꎬ䅬周睥玡扯慬及﹟㈨컳벴楡䕓䌩걟꽆湥摩㶼敲楴횻ꆰ닩뗄쓊튻솽뾿뺿듎쿬ꎬ?좥풱컳돉뚪맀ꎻ닮ꋙ넿⡩ꆤꆮ慬摳捥浯?牳꽥敤瑨쫂갩ꎺ놻猩ꎬ捡⥯睡慮ﶾ뛸뫍⧒慴湳獴ꎮ楔쫇헦쿠뗷뇈듎탔뇭횸뿉ꇷ믘햼쓚亣ꋴ닮뫳쪧볆ꋛ⡆⤲ꎬ涸욵맀慮瑩뫳㶡ꆣ얩램?畳䅳潲㶶맣볆楯뛔쪵춬닩?뷏뗷뻍췆쏷뇪틔캪듰꿉쿠꽫⦣ꎬ뗄ꎻ폫폃敬榡쫽???潮죧?훊뗄헟?웕횵뗄뷡ꎬ닩풽삹춬냼폃맀컳맘겡ퟜ뛔뫍ꋚ볒쿂汥ꆣꌽꗎ맻늼훎뜱?볆볇솿닩ꆱ뮷맻믡뗄뗍샆믘뗈삨쿂볆닮워撣쳥틔헒폫춥쏦杩ㆣ뮵믹럖쯣힡맀ꪸ뗄뺳ꆣ햲뗃믘듰뛔쏦뿉횾겱슬맀쿂떽얩돉ꎬ?겡쒾놾튵샯돩⭐ꇆ뇰릫쇋볆훘튻살떽듰컳듽뗄욫틔ﻏ볆벸듥풱릫ㄹ궣淪믘쪽웕ꏐ듺뱩폃닩䔨쮹뢴훖뷸ﶾ죧늻쓊닮ꆣ랽뗈컳럖⣎습뺱䔨뗄룶죋힡폐쪽㘴걫떣듰쫇닩뗄뇭ꎻ?撣컞퓚ꎬ랽탐?쿂튻ﶾ튲닮쪽ꆣ뷢쒻뮵天펰쫽뮧맘살⦵걭닎웕욫뗄뛸램뗄훂?펰⡲살룹캪?ꆣ쿬쏦ꎬ뫍맀䉡㵮닮볇뭉쫽뗄믘닩쫇ꆣꎬ좽뷡ꎺ쫁쿬敳볆뻝믹뷸듓얩믘獳ꎯ슼묱ꎬ듰쫇헫퓚쒿쾡맻믘뾡쇋灯쯣웕?놾탐뛸튵듰ꎬ椦뫍뇔欩죧ꎬ뻹욥뛔훐뗄ꎶꎺ듰偅湳噡깩믘뿉맜컳쯼䙡?ꆣ릫닩⤫돩놦맻퓚횵엤틑맺쫇퓁ꋙ뗄푐及?氢뫍듰뾿얩샭닮벸扢햲쪽ꆰ돩닩ꆰ뛸믘닩뷸ꎬ튪붴웕닮䕓ﶾ⡙돩믹랽탔듥폐뗄뫵晩뿉ꎻ맑뗄ꎬ틤쫇탐偅뗃캵닩뇰믘?ꎬ웞놾닮맀힡맘쫇玣춳틔쫂믘⡫맛컳ퟷ뗄厵떽?뫍풽ꏏ⦣쫽믘랴볆뮧튻갱볲돶듰달듰쓈뺡돩듳싃?뻝펳ꎺ뗄믘ꆣ㤹튻춬컳횵⢡뿉닩ꎬ놻볒듰㜩킷컳퇹닮뫳ꞷ믘웕?ㄩ뗷ꎺꎬ쏎뗄닮뛔??쪡뛠?㞣훊뮺쵹⣈ꆱꇪ솿ꎮꆣ돩⣈닩쥉?䐩쥦ꎬ캪뗷닩풱쓚쿠맘쾵
卢依吉·法布里斯等:中国农业普查事后质量抽查51 =布与)((b + c) -2.::(c, -bYlm)) (3) 二、普查漏报的家庭成员式中:b和c‘分别代表普查和抽查的差异频数i普查和抽查的农村住户可以用地址码来对应,这是识别一个住户的主要标识。iCi = 1. . k) ( b = "’Zb; C = "’Ze;) .如表l所示。i 在每一位户内的家庭成员匹配生成的频数分配表为上面已提到,假定条件是普查数据和抽查数据同样表2。在经过匹配后,b=95人在抽查中有,而在普查中没可靠。有。c= 82人在普查中有,而在抽查中没有。匹配的结果表l匹配成功后的普查和抽查数据i{i=1 , ,k) 参见表3。普查(。ì)表2普查和抽查中与家庭成员有关y= 1 y=O Total 的二分变量匹配结果b; a; + b, y = 1 a, 普查抽奄(i)y=O d; Cj + dj c 匹配未匹配合计Total aj + Cj b, + d; n; 匹配a b a+ b 回答方差比可以与总方差(抽样方差和非抽样方差)抽在未匹配C d c + d 进行比较。在我们的工作中,平均的总方差是用抽查数合计a+c b+d n=a+b+c+d 据①来估计的。由于普查(Cen)和抽查PES(Pes)都是独立进行的,在(y) ←一L一亨子丁(光(-γ十-)十)''(4) 两次调查中都漏报一个人的联合概率为P(Cen n Pes): J/ -n(n 一1)ι.J\ ]Jj -J P( Cen n Pes) P( Cen) P( Pes) (8) 总方差包括了所有来源的可变性。要对回答方差和其中P(Cen)为在普查中漏报一个人的概率,可用下式来总反差进行公正的比较,就不考虑分层的影响o如果要估计:估计的频数为p,则方差的计算公式可以简化为:b+d 95+d p(l-p) p( Ceen) =一一工一一一-工一一(9)v叫p)=巳亏丘,(5) α+ b + d + d p(p田臼,)为在抽查中漏报一个人的概率,可用下式来估计:式中p为P的抽样估计。c+d 82+d Pritzker & Hanson (1962)用"不一致指数"(index of in›p( Pes)一一一一一-一一-一一( 10) -α+ c + d -149,294 + d’ consistency)来反映数据质量,它是非相关回答方差和总的d为普查和抽查都漏报的人数。非相关方差(回答方差和抽样方差)之比。由于d同C和b相比很小,所以:l’1J c2 r Iσ + d 82 + d (6) , . -一P (Cen n Pes) =一-一一←→一一~一一σ+σz 149,307 + d + d 这一指数也可以用替换的办法来估计,分子可以用95 82 == 耳汇写马公式。),分母可以用抽样方差,或者按Fellegi( 1964)的建= 3 .5E -7 议,用主调查(普查)和检验调查(抽查)的平均方差O下因此,通过抽查明确了以下两点:面,还有最后一种建议。①就在一个调查户中漏报→个家庭成员的可能性而另外一个关于普查和抽查未匹配数据的指标是Krip言,普查和抽查的可靠性是相同的。下面,出于误差分析pendorff (I 970 )提出的"一致系数"(agreement coefficient)。的目的,我们假定两次调查收集的数据是同等可靠的。②一些在两次调查间隔中出生的人,在普查不可能2.::2二nijdijαιJ并卢a(7) 填报,对于抽查,也有类似的情况,在普查后去世的人,在S2二eijdν抽查中没有填报,但应该填报。不管怎样,在两次调查中异6式中:r为匹配成功的各组变量数,dij为各组之间的距离,漏报的人,实际上是忽略不计的。n~.为匹配成功变量i行j列频数eij为在i行j列独立的假设条件下的期望频数。如果变量为数值型变量,距离为① Y的变动可以用普查数据来进行更可靠的估计,在我们的工作中,出于实际原因,是按抽查数据估计的。dij = (X; -X)’ ;如果变量为序数变量,dij=Ci-j)';如果j② 与eíj相对等的常规统计假设是组内相关系数。如果变变量为名义变量.dij= 1。 如果匹配变量表的两个边际频量为两分变量,在常规统计假设下,则一致系数为柯恩K值(Co›数是相等的②,则期望频数e::;. n+ n+jln。当然,d= ) ,在更精确的等边际假设下,则为斯科特π值(Scott. α可视为不一致系数(disagreementindex)。1955)。??췲랽쫽뻝슬㔱㷖쪽?椨짏뿉뇭웕夽憣抣돩䍉撣潪㐭慉扩溣믘뷸뻝噡ퟜ맀ꆣ⠵偲潦楮捯럇ꎬ⠶헢릫틩쏦쇭灥ꇆ?婊뿚⠷뻊湩짨撢뇤쫽뛾쪶퓚폐닎뗄욥캴뫏愫戫평솽⠸㤵ㄴ⠹漫⮢㠲擎倨⠱틲ꋙ퇔ꋚ쳮슩妵솿桥ㄹ?呯慻愫䏊渽ㄴ㴳?⭃爲⭄욥쪽뇭健倨웤?갫撣⭤ꎮꆰ㐭㦣틀닩?엤욥⮢〩쒱릤폫溣㔵훐椽쏦뾿?듰탐ꋙ랽랴볆楴湳쿠튻ꎬ췢湤敦캪쳵솿쫇뿉摥뇰쎿㊡ꆣ볻웕뛾폚듎䍥健듋뻍쒿놨瑡⭢깤愫㦣ꎮ㶡뿚ꆢ??ꎮ쪽뻊挫갳갲엤훐猩䍥健ꇆ벪⡩ꎬퟷ敬솽갱⦡?갳갲㕅ꎺㆣ틑ꆣ랽뇈살닮뗄穫楳맘횸폃뮹튻潲晩㴱욥볾⡸캪쿠쫓砩뫍ꏔ爽뇭닩럖웕뗷햲操猩퓚킩훐?〷㤴㐹ꪡ돉僎ꎺ猩倨〷㤴튻ꆤ?웕꾿훐槏럖㤶⠲⭤抡겡쳡닮뷏맀냼뷸욵敲瑥랽쫽훷폐룶晦捩狎엤쿂ꆣ쏻뗈캪돩힡?㠲㎡뫍뇤닩걣?춨튻ꎬ퓚뛔쎻죋ꆫ敱램ꨡ짒ꎬ뇤〩릦꩐㵐䍥캪ꆯ닩ꎺ궣떽뇈ꆣ볆삨탐쫽♈湣닮튲뗷ퟮ맘⠱敮튻돉뗄틥늻힡뮧궹죋?돩솿⡃훐춳뫍맽룶컒솽폚폐ꎬ늼⦣퓓돶풵솿ꎬ뫳뗄⡃温퓚쇋븨爨撡撣쵣걫ꎬ뿉퓚뗄쇋릫캪慮礩⢻닩뫳폚㤷琩ꗅ릦웚퓙뇤ꋚ튻뮧쓚ﷆ욥敮뚼健㛏돩뗷쏇듎쳮쪵샯슩쏆좵뗄돩敮캪ꎮ겷温쮹ꆣ⤨볙틔컒쯹헽傣獯살?⣆튻웕〩ꆪ뇤췻⤲솿ꎬ훂얩뗄ꗅ훐엤⦺슩닩뗷놨볊햲쪵쒳퓚룼?놨웕퇹⥐퓚닩ꎬ뗈볊ꎹ뎣뺫럖戽뚨폫쏇폐뗄곔渨랴폃햲훖닩쳡즹솿욵ꎻꎬ퓲쾵듥훷볒뷡춳놨볂좺쏷뮧짏후닩맀⡐웕훐ꎺﶾ풭맦좷뇰ꇆ쳵ퟜ뗄살뇈ㄹ펳붲쳦붨뫍돶ꆮꚵ槐쫽죧撡웚힡튪춥훐볒맻튻ꦱ?좷뿉솽볤튲떫쫇뫍볆敳닩슩훐뢿㷊?틲뎼춳뗄듺㚣볾랽릤풴뷏붲㘲쫽뮻뫍틩돩뗄쒸큪ꆣ맻ꌽ췻⡤볒뮧뇪돉걢폐춥룶ꢵ쇋슩뾿듎룴펦뫶맺⠶뛠뒽ꎬ욼볆뗈돩ꆣ?훐놨⡟뇭꺣쫇닮ퟷ뗄ꎬ⧓뻝춳짒볬ꆣ닩ꆰ튻쇐죧뇤ㆡ욵楳뿉쪶풱㴹돉䕓죋猩쓈곋틔놨탔뗷훐샠룃싔얩춥쫇?볙뇟닩슩튻웕뭃⢳훐뿉뻍쒼쎡훊냬퇩캴튻욵맻솿ꏈ쫽慧틔ꆣ욥㗈뛸풱⡐뗄쯊戮쿂쫇닩돶쯆쳮늻튵킸내짨볊퓓?쫽놨룶돉웕닩㵅ꎬ뇤늻웋낲솿醴램뗷욥훂뎾쫽캪斡牥폃엤쯔퓚폐敳솪ﶡ?솽룶쿠쫕짺뗄놨볆ﲿ돩쟗쿂볙뻝튻죋닩쎳풱즿짨뫍掣쫽醴욽탔뾼믒ꎬ붲살엤쾵뿊敆솿탲ꌽ敭뗘짺?돩맘⦶뫏?뗣볒춬벯뗄쟩ꆣ瀩椨룶뗄쫂뾵쫽?퓲쿂돩묩뻝붲뻹ꆣ싇ꯊ믖쯼맀⢳쫽緒ﶣ캪ꗅ탄敮횷돉닩볊룅ꎺ춥뗄죋뿶늻⭣⤽ꜽ榣죋룅뫳쒹뻝튻ꎬ닩ꎬ뫍뗄튪럖붿싖쫇횮볆뻝ꆱ걤퓚쫽뇤⮷?싫훐잶싊㷉돉ꆣ맜훊삼맀?훂퓲긱뗄싊醴뗄죧돩춷ퟜ뛔닣짒룊럇뇈ꎬ⡡뮣槎槐횵눫살욵탓쎻상캪풱쿂뻝퓚퓵솿욣볆뗊쾵캪ꎺꆣ룅ꎬ닮뇭닩잳랽믘뗄풼ﶡ쿠ꆣ럖횸杲ꪸ킣탍ꎬ뾱뛔쫽폐ꊽ倨쏦쫇웕퇹돩붲곔쮹ꆭ싊뿉닩틬泋쫽닮듰펰넨맘ퟓ욽뇪敥?곁뇤摩ꎯ펦럖겶ꆣ䍥뿉ꎬ춬?ꏈ캪뿆ꎬ폃⧒횾틃뿂쳘욵流뻝醴쫇랽쿬꿎楮믘뿉뻹浥킶솿㴨쓁溡ꎬ엤욥킵?쓜돶뗈늻뫳퓚欩뿉쿂듔?ﮱ뛷ꋲ쫽뺡춬붲폃닮ꆣꪣ摥듰틔겻랽䭲湴꺼상ꎬ榡붸ꎵ헢뇭?엤쒣큃탔폚뿉좥솽폃쪽?䯖횵?퇹돩뫍죧랽폃닮楰ꊵ뻠ꩪ뇈쫇캪햲뗄곔뛸컳뾿쓜쫀듎딨⡓쿂살닩맻닮ꆣꆪ쒾쒼샫⤲?뮣뷡?뗄뗷䍯捯쪽맀?쫽튪탍뫍쿂?캪ꎻ쫆걤탃맻럖ꆣ죋닩ꎮ瑴살볆뮡ꇆퟜ죧?㴱컶ꎬ훐됦뗄?맻튻퓚ꇪꎬ쒷온⣄⠱㤶㐩뗄採쯒붨ꏒ믏뭢ㄩ㊣㊣갨꽭㐩⤩⠳?
52 统计研究普查和抽查都漏报一个人的概率不为零,但无关紧表4农业普查主要指标的误差估计要(d=)。非相关方差不一致指数误差估计变异系数指标表3普查和抽查家庭成员{人记录)匹配结果(% ) (% ) (%) (% ) 普查耕地面积 水田匹配未匹配 合计旱地 匹配149,212 95 149,307 从集体承包 PES 未匹配82 82 从其他住户转入 合计149,294 95 其他转入 茶园 三、回答误差估计桑园 果园 对农业结构和土地使用估计的可靠性是以普查和抽( . ) 果木苗圃 查数据的比较为基础的。种植面积合计而 (一)家庭成员及从业情况的误差估计粮食 就40576户农村住户家庭成员及从业情况普查与抽稻谷 查的比较结果可见:小麦 (1)对于一个住户内的人的调查(男性、女性、在校学玉米 生和家庭成员总数),调查表的填报率很高,会回答误差大豆 率较低。对人的调查,是普查的重点之一,在现场工作阶薯类 段进行了严格的质量检查和控制。同时,数据录入程序油料 油菜籽 也把质量控制考虑在内o然而,普查和抽查之间的差异花生 不仅仅是由于出生与死亡的变动,而且也有人为的和随棉花 机的回答误差。麻类 ∞ (2)对于各种家庭规模的农村住户,普查和抽查之间糖料 的总体差异在%到%之间,但对于2人户,差异高烟叶 达%。就平均水平而言,每个农村住户的差异率为药材 % 0如果把性别考虑在内,总体差异率为%。蔬菜 (3)普查和抽查之间的差异也可以用高估和低估来瓜类 衡量。普查低估的部分是表4至表7中主对角线以上的饲料 。. 部分,而离估的部分则是主对角线以下的部分。从表中其他作物 可以看出,抽查漏报的人比普查要多。在抽查中漏报(普非耕地种植面积 庭院种植面积 查高估)和在抽查中多报(普查低估)的户数和人数的比率大约为2。因此,就调查的人数而言,可以似是而非地(")估计数大于1∞%。猜测,普查比抽查略微准确些。(5)普查比抽查多报人数的趋势从在校学生数也可(4)造成普查和抽查之间差异的一个很可能的原因以得到证实。在抽查中,有%的农村住户申报的在校是性别的回答误差。从表8中可以看出,每千人中有学生数比普查多,而申报的在校学生数比普查少的农村人有性别误差。对于农村人口的性别而言,普查和抽查住户的比例为%0 (6)其他原因也导致了申报错误。有两处以上差异没有不一致,因此,我们猜测,导致农民申报相反的性别的情况即使在1人或2人户中也存在。总体上,由于性别是计划生育,因为在农村,如果第一孩子是女孩,可以生错误导致的不一致率为1%。而在校学生①的不一致指第二胎。由于这方面的原因,有些户主在申报孩子的性数高达'}号。别时,要么是在普查中,要么是在抽查中,作出了相反的(二)农业用地、农作物种植和畜牧等指标的误差估申报。当然,两次调查都作出相反的申报的可能性也是计存在的。可以肯定定的一点是,每千人中有个人的性有关农用地、农作物种植和畜牧等方面的指标的误别数据是错误的,也就是说,在每千个女性中,有人的真实性别应该是男性。女性/男性的性别比的估计数为号,实际应该更正为"至少%"。① 就农业普查的目的而言,在校学生是可以忽视的。??췲랽쫽뻝㔲춳웕튪뇭욥캴뫏ㄴ㤵偅㠲죽뛔닩⣒뻍⠱짺싊뛎튲늻믺⠲뗄듯ィ⠳뫢늿뿉닂⠴쫇죋쎻뗚뇰짪듦헦㤴럇컳뇤횸⢣룻㊣㎣쮮퓧䦣듓ㆣ㖣㒣㌲웤단侣즣맻⢡훖솸떾ㄸ킡폱듳㚣ꆿ쫭㞣폍㐱뮨㔳쏞싩쳇㢣ㄶ퇌튩쫟㦣맏쯇ㄲ춥⠵틔톧힡⠶듭쫽⢶볆폐ꋙ㈶侣㎣㈱㦣㞣㒣㖣㊣㠷㢣㈳ㆣㄳㄹ㌷㚣ィ㌳ㄴ㐵㈰ㄶㄷ웕얩긳긶㊡㦣?기긲긹긷길긴㞣ィ㘵긱㈷ꎮㆣ侣ㄳ긵ㄷㄶㄱ볆엤욥쿠튻닮틬뇪ꔩ뗘쳯벯웤쯻풰쒾ꌩ횲쪳마싳쏗뚹샠쇏닋짺뮨튶닄긳룻풺뻍닩⡤?얩쫽묩㐰뗄⦶뫍뷏뷸냑뷶ퟜ㊣긹⧆솿럖틔룟듳닢⧔탔폐뛾쪱놨퓚쪵ꎮ꼩뗃뮧쟩컳︩긶긴긵긷긱ꎬ㎣긳기길긲㒣ꍬㄴ맘갲갳ꆢ㈰?㈷긷㚣긶ㆣ㤶㔹㌷㝬길㈸긵㌴㦣㘹긱긹㒣닩튵퇐엤맘훂맀쾵쏦쳥쯻쏧ퟑퟷ뗘훖얩㤷?㤹㐴㌷㈸기㔹〷㤵㐸㠳㘸〴〰긹㈴㤲뫍튻튵뻝볒㔷뇈퓓뗍탐훊뷶믘쳥긳ꎥ햲ꆣꎬ뾴맀풼뇰탔늻뮮첥뗄㢣떽쫽뿶떼듯얩ㄲ〷㤴㈲길㐴?㌴ꎮ㘱㠳긶〳뫍웕뺿랽횸볆쫽믽돐힡죫월컯훖횲튵믘?돩ィ뷡뗄춥㚻뷏?ꆣ쇋솿쫇듰?닮ꎥ웕뛸돶⦺캪짆뇰튻짺튪떱ꖣ볆횤뇈ﯔ벴훂㒣튵닮쫽냼뮧뫏횲쏦폃웕돩닩닩기릹뇈돉Ʂ뷡뮸뛔퇏뿘평컳틬ꆣ죧춳룟ꎬ췔㊡햲믘훂폽쎴좻뿉듭펦곊쫽좳쪵웕샽귒쪹뗄긷폃듰볆쏦믽닩훷뗘뚼㔩뫍뷏풱ꦴ맻죋룱훆폚닮횼퓚뻍뗍맀돩?ꏒ뇈듰ꎬ쫇틔컳룃떼듳ꆣ닩캪늻ꎥ뗘죫믽뗄볒튪컳슩ꆣ췁캪벰뿉ꆻퟜ뗄뾼돶틍ィ욽냑맀닩돩춳틲헢퓚솽뿏쫇쫓폚뛠ㆣ늵㇈튻ꆢ쒿춥횸놨뗘믹듓ꆻ볻Ꞔ쫽뗷훊싇짺ꖹ긷뻹탔꺼뗄늿슩쮣닩뛔듋캪랽웕듎뚨ꎬ쓐ꚸ돩긲볖쮻훂얩닮돉뇪뛸튻쪹뒡튵Ꞽꎺ?⦣닩솿퓚폫ꎥ쮮뇰늿럖놨킶겾싔ꆣ폚ꎬ쏦뗷뚨튲탔쎸ィ뛸싁싊ퟷ풱뗄맀퇔룶폃뗄쟩틍쓈겵ꎬ볬쓚쯀ꎵ떽욽뾼쒲럖퓲춵캢꺼듓얩컒훐닩뻍ꆣﳕꖡ쯊짪쯉죋캪컯ꎬ⣈컳죋볆맀ꆣ뿶ꖳ쮵쫇닩췶쓅ィ뛸싇꠨ힼ뇭듥쏇풭ꎬ뚼튻얮?ﶵ놨뮧ㆣ훖퓚쮼닮뗄볆짔쒵웕뫍좻ꦴ긹퇔퓚뇭훷뇈좷㣖죋닂ꎬ틲튪ퟷ뗣쮵탔ꪡ쓇폐ꢴ훐ꖡ횲킣횲쟂맀룅뗄컳놼닩뿘뛸뇤ꎥꎬ쓚늿㓖뛔웕쓈킩킿뿚닢죧쎴돶쫇ꎯ냖ィ퓚튲ꎶ뫍톧방볆뫍짺싊뿉닮내쓌뗄훆ꎬ뚯ꆻ횮쎿짒솱뷇닩뗍쯊ꆣ쓒맻폐쫇쿠퓚쓐쇉운길킣듦탳욥탳쫇늻뾿맀폒쓐훘ꆣ웕ꎬꞣ볤룶ퟜ퓓쿟튪ﶶ뮸풿탔떼뗚킩퓚랴쎿?폔ꎥ톧ꏓ?쓁엤뿉쓁캪탔볆뗇ꣂ뗣춬닩뛸곆ꎬ얩쳥쎸훐틔뛠⦵뒳뇰훂튻뮧돩뗄잧㖣?짺탁ꆣꏑ뗈틔뷡쇣쫇ꆢ쪺횮쪱뫍쟒햲떫듥닮?훷쿂ꆣ쒻풣?뛸얩몢닩짪죋룶탔긳ꏑ쫽붴ퟜꟉ횸뗈뫶맻ꎬ틔얮?튻돩튲뛔힡틬삺뗄퓚ꟊ겿진곃퇔쏱ퟓ훐놨뇰ꎥꟉ듥뇈ꛒ쳥甆뇪랽쫓떫웕햲탔?ꎬ쫽닩폐춳폚뮧싊춵뷇늿돩ﶺ짒?뿇짪쫇뗄뇈ꆱ響힡퓉짏?쏦컞닩ꆢ겻퓚뻝횮죋㋈뗄캪춹쿟럖췈퓋쓔ꟈ웕놨얮ퟷ뿉㊣훐ꆣ뮧쾲ꎬ쒲컳뗄맘뫍퓚쿖슼볤캪쮻닮ㆣ샀틔ꆣ훐쯊웊귒쯖닩쿠몢돶쓜긶ꎬ맀늿짪짙평믒횸뷴돩?킣?뎡죫뗄꺼ꞣ틬긹짏듓슩ﶵ잶탓뫍랴ꎬퟓ쇋탔룶폐볆놨폚믖맀뇪톧릤돌닮뫍?겲싊ꎥ뗄뇭놨쒱퀲돩뿉쿠튲죋ㆣ쫽얩탔싖ퟷ탲틬쯦캪ꆣ훐⣆?잵ꎮ닩탔틔랴쫇뗄긳퓚듥뇰?뷗뇰짺뗄탔죋킣컳?뗄
卢依吉·法布里斯等:中国农业普董事后质量抽查53 差估计在表4和表5中列出。主要是按照Pritzker-Hanson 误差超过1%,但普查和抽查之间的差异较大(其估计的的不一致指数公式(6)进行计算的o标准差是其估计的均值的3倍)。全国农普办表示,使用表5农业普查牲畜指标的误差率这些指标应小心,因为它们只是就全国水平而言才有代表性。非相关不一致误差组内相Parmameters (4)这些变量差异较大可能是由于对概念的理解不方差指数%估计%关系数同(如药材在不同的地区可能有不同的理解)、担心增加黄牛存栏 农业税(例如特产税)或各地的"习惯商"等原因造成的。黄牛役用 由于没有种植记录,被调查者需要在调查员的帮助下回水牛存栏3ω 忆和根据产量估算其作物的种植面积,因而,被调查者的水牛役用 奶牛存栏能力与回忆的意愿、各地之间习惯亩的差别、在两次调查 ( . ) 牛毛牛存栏 中被调查者和调查员的不同,这些都有可能导致误差的呢牛役用( . ) 。仅)() 产生C马存栏 (5)有些误差率较低的变量是"混合"项,如耕地面积马役用 。.950合计、水田、旱地从集体承包的耕地面积、种植面积合计、驴存栏 粮食种植面积。对于这些指标,农民心中有数,从而指标驴役用 的可靠性较高。骤存栏 (6)比较而言,畜牧业指标的误差率要比农业用地和骤役用 农作物种植方面的指标的误差率高一些。原因是猪、羊、骆驼存栏(将) 。αm家禽的饲养实际较短,它们是农民肉食和现金收入的主骆驼役用。α)()O.∞ 要来源。普查的现场调查是在春节前进行的,而抽查的自宰和出售肉牛 山羊存栏 现场调查是在春节后进行的。普查和抽查现场调查之间山羊出栏1. 13 的这段时间是猪、羊和家禽数量变化最大的时期。在抽绵羊存栏 查中,有些调查员没有把标准时间向被调查者讲清楚。绵羊出栏 而且,根据中国的法律,农民出售或屠宰猪、羊等牲畜,需猪存栏 要缴纳屠宰税。这就是为什么有些农民少报牲畜出栏数猪出栏 的原因。就家禽而言,多数农民不可能确切回忆,因此普能繁殖母猪存栏 查和抽查之间差异较大。总体而言,牲畜存栏的误差率能繁殖母猪出栏 要比牲畜出栏和役用的误差率低o这一点很容易理解,家禽存栏 因为对于存栏数,调查员是可以当场检查的①。家禽出栏 (7)还要提及的一点是,城市居民饲养的牲畜和家禽(‘)估计数大于1∞%9号。。没有计算在内(中国的法律限制城市居民饲养牲畜),就(1)普查的每个指标都不同程度地存在误差,但从总全国而言,牲畜总头数可能被少量地低估。体上看,不一致指数都在合理的范围之内。这表明对普(8)通过对普查和抽查数据差异的因素分析,结果显查员和指导员培训效果较好,普查员与被调查者和村干示家庭结构方面的差错与其他变量方面的差错不存在多部配合较好,被调查者能够明确普查员所提问题,并能作大的相关关系,与牲畜方面的指标也不存在相关关系。出如实回答。只是在申报类似的种类的牲畜时存在较强的相似性②,如(2)填报率很低的变量,其估计误差较高。这说明这驴、骤存栏与役用(因素1)和猪、能繁殖母猪的存栏与出些变量在抽查中没有代表性。如果木苗圃、艳牛存栏、役栏(因素2)。用呢牛、骆驼存栏,这种指标普查可以调查,但抽查不应该调查。此外,轮牛在青海和西藏分布较集中,而骆驼仅四、人记录回答误差频数估计在内蒙古和新疆分布较集中。普查数据的质量不会因其从分析结果看,可以得出如下几点结论:规模小而受到影响。但对于果木苗圃和能繁殖母猪这两个指标的数据,使用时应谨慎。① 在抽查中,建议抽查员实地查看农民的畜栏、菜园等,以(3)有些指标在参数估计中也有大的起伏,如能繁殖核实申报数字。母猪出栏、药材种植面积、茶园面积、自宰和出售的肉牛、② 索尼娅·扎姆佩蕾蒂女士帮助完成了因素分析工作,作从其他住户转入的耕地、桑园面积。这变量的平均估计者在此特表谢意。??췲랽쫽뻝슬㔳닮뗄뇭럇늻컳ퟩ偡랽횸맀맘믆㒣㞣ㄱ侣ィ쮮㎣㦣쓌㊣⢡⠫십㚣슿ㆣ싢싦튻ퟔ즽쏠훭㖣쓜볒ㄲㄸㄴ㌵⠱쳥닩늿돶⠲킩폃룃퓚맦룶⠳쒸듓뇪헢⠴춬얩평틤훐닺⠵뫏솸⠶튪쿖뛸틲⠷쎻좫⠸쪾듳횻삸쯄ꋙ뫋ꋚ헟㖣ィ㞣ㄲ㎣㒣㚣㦣㤱얩牭ꎮ깏긳긱긴긹기ィ긵긶긷길긲틀쿠튻닮쓚쫽볆쾵얣꼩듦틛췕퓗퇲돶랱쟝긩퓚쪵쯷맀늻?⧆짏풱엤죧⧌뇤뗷쒣횸⧓훭웤ힼ킩탔⧕⣈튵폚뫍솦놻짺쪳뿉⦱ퟷ살뎡헢훐쟒뷉풭뇈캪⦻폐맺⧍볒뗄쫇ꆢ⣒럖길긱긹ꎮ기긲긶慭㔷㌲㔵㔹㐵〰潯㔴㜳?㐸㐷기긹㤳㘷〰㈷㔵㔰㘶㘳긳㠳㠵㠰긲㠶튵벪맘훂쿠整ꎥ쫽듦틛삸폃㐵뫍㐹돶횳맀돩짪쓡듋㌸㠳?㜶㤲㠹㤱〷㠰㤷㘱㐸볆튻햲뾴뫏쪵솿얣닩쏉킡뇪탐쯻닮횸ꆣ쮰쎻룹폫뗷ꆢ훖뾿좽컯뗄풴뛎ꎬ쓉틲짼뛔맒뛸ꢹ춥퓚싢컶㠹㐷㔵㘳㠸敲뎬돩웕ꆤ삸폃돶쒸볆닩놨쳘?죋퓚훂ꎬ횸뷏믘ꣂꆢꆣ맅뛸뗄꧖삸힡쫇뇪ꦱꦲ⣀폐뻝닩쮮횲탔쾶훖쯇쪱룹췀탳폚쯣퇔ﶶ뷡맘짪듦?램쫛훭쫽맽훐ꆤ뇭닩뇭횸쓃늻떼뫃듰쪺돩싦듋뫍쫜쫽뢱ꆢ뮧웤펦쓔훖닺틤헟쳯쏦뷏횲퇸웕쫇볤킩뻝퓗뻍퓚ꎬ퓆릹맘놨삸⦡맻늼죢듦돶듳볇ꎬퟖ퓺킻짼沣횮㒺쫽뾸튻풱ꎬꆣ?닩췕췢탂떽뻝튩맀킡뾲?횲솿뗄뫍ꆢ믽룟풣랽쪵퓚쫇뗷훐쮰볒낵쓚짼햲쾵샠폫?뾴샯얣삸폚붨쒷틢탳ꖣ볤슼쮹춱릫훂엠놻춵훐듦ꎬ붮펰?닄죫볆탄믍?볇맀틢뗷쪽몵ꆣ곐쏦볊뗄뒺훭닩맺쟝뫍쫽쓒⣖탳쯆틛틩엥횸뗈ィ겵닮돩펪쪽뢱횸통뗷쒱쎻삸럖쿬쪹컊훖뗄ꎬ頋슼쯣풸닩쾵뗘뛔뷏쿖뷚ꆢ풱헢뛸틛뮵킹ퟜ춳폫폃뿉믘뇪ꎺꖡ닩뗙훐⠶쫽킧닩폐ꎬ얣늼ꆣ폃ﶹ횲룻ꯆ뻹틲쾴쒵뀩웤ꆢ풱춵듓폚쇒횸뛌뎡뫳퇲쎻램뻍퇔틬뗷蝹춷닮짼훖⣒틔뗄훐?듰풱얮쇐⦽벲뚼맻헟뾣듺헢퓚뷏떫쪱삼쏦뗘횵캪?믲놻ퟷ룷뗄쒱벯뗖뇪ꎬ뗷뷸뫍폐싉쫇닩잣쒷쫽듭탳샠뗃햲맺쪵쪿컳돶믍퓚뷏쓜곆뇭훖쟠벯뛔펦웖믽ꆢ뗄쯼진룷뗷컯뗘늻쳥킩뢱닩탐볒냑ꎬ캪뛠컳풱겳ꣂ뿉ﶾ폫랽?얩듳뗘냯닮ꆣ킼겳뫏뫃릻탔횸몣훐폚뷷탒ꆢ즣㎱쏇?진뗘닩뗄횮춬뿊돐컳쫇쟝뇪얩쪲쫽닮쟊짏쓜?웤쏦짼⦺죧튵훺춳ꆣ싊웕훷웋첶샭ꎬ쏷삼ꆣ뇪뫍맻짷닓단풰똩횻쟓?뗄헟훖볤잡냼쓎닮쫇퓚쫽ힼ쏱쎴얩싊뿉킾?놻쯻탳췖쿂뾴췪ퟜ닩욵돉튪좵뗄웕좷웎죧컷쒾ꆣ킴풰쏦쫇짓킲ꆰ탨횲쾰헢낻ꎬ싊얩뒺솿쪱돶폐쏱뗍틔폃욳짙뇤횸벸쫂쳥쏱쇋쫇쒡?랶닩웕맻님쏧쏦믽좫뻍?믍쾰튪맟킩룻얩룟쏱뷚뇤볤쫛늻ꆣ떱쟊솿쓒뇪듦ꋄ뗣쫽뫳뗄틲꺼뛸내?캧풱닩쒾뿉럖쫽월쓆믽ꆣ맺좫풸겵맟퓚쒶뚼쾡뗘쏱쫒튻죢잰뫍뮯쿲믲얩헢뎡쟑킾랽튲?뷡훊탳쯘맀헕?횮폫풱쾸쏧틔늼뻝뫍ꆢ헢얩맺엄쓀쒶뗷ꎬ뗄폐뇏쏦탄ꪱ킩쪳뷸돩ퟮ놻췀쏱쓜퇔튻볬폃뗍?늻뷏뇖싛솿삸럖偲쓚놻쯹?월뗷뷏뗄쓜ﲣퟔ뇤웕쮮ꆱ닩틲닮뿉믽훐죅ꆣ뫍탐듳퓗짙좷뗣쓉맀훎듦잿도ꎺ돩쒲ꎬ볆ꆢ컶닩楴ꆣ뗷쳡ꏕꆢ벯훊랱곈퓗솿냬욽쓀뗈풱뛸뇰쓜폐꧒풭쿖뗄훭놨쟐뫜ﳐ쟑닮퓚룖닋릤짼풰ퟷ穫겵헢닩컊ꎬ훐솿횳뫍뗄뇭뛸ꆢ풭떼훖쫽뗓틲뷰뎡쪱헟짼믘죝ꋙ경듭쿠탳뗈ꎬ敲ꮴ뇭헟쳢뗃얣떫ꎬ늻쒸?돶욽쪾퇔떣틲냯놻퓚훂﮵횲쎵쫇쫕뛸뗷웚붲퇲탳틤틗ꆣ춼ﳐ맘쯆쒴쾴듦ꎬퟷⵈ폗쏷뫍ꎬ듦돩뛸믡훭뇖쫛뻹닅?탄퓬훺뗷솽컳?쏦듓?죫닩ꆣ쟥뗈돶샭틇맘탔틔慮?뛔듥늢삸닩싦틲헢뗄맀쪹폐퓶돉쿂듎닮믽뛸ꆢ횮퓚돾짼뷢ꎬ쾵ꋚ룓獯웕룉쓜ꆢ늻췕웤솽죢볆폃듺볓뗄믘헟뗷?뫏횸퇲훷볤돩ꆣ탳쫽듋ꎬ뻍뛠?ퟷ틛펦뷶얣맀ꆣ뗄닩볆뇪ꆢꎬ웕컳죧ꆢ탨볆닮뗄싊
54 统计研究(1)人记录指标的回答误差率不高。因此,可以认为,水平来看,所有数据都是可靠的。有些数据在地方则不农业普查关于农村住户从业情况的主要数据是可靠的O宜公布。我们指的是与农业用地有关的一些变量。其他(2)年龄的回答误差率占总基本方差的%。年一些重要的变量,如文化程度、从事主要行业,由于人口龄差错可能是中国计算年龄的方法造成的,即周岁与虚规模大,从分析目的上看,用地区以下的数据比用省级的岁之间相差两岁。而计算的标准是以春节为准的,上文数据进行分析更可靠。几经提及,普查的现场查点工作是在春节前进行的,而抽这些是关于任何农业普查或抽样调查的共同问题,查的现场查点工作是在春节后进行的。因此在普查和抽不管它们是在哪里进行的。不过,在指导手册中应该告查之间1-2岁的年龄差异大多数是由这个原因造成的。诫进行普查工作的实地人员。(3)普查和抽查在文化程度的上的差异主要集中在在进行普查和抽查数据的比较过程中也提出了其他文化程度较低的组别中,即不识字或识字很少(文盲、半有些问题。最重要的一点是事后质量抽查要对确定错误文盲)和小学两组中。但是,如果把差异同边际频数相比来源的有效性的关注。查找差错可以对实地人员是一种"约束较,文化程度高的组可靠性要比文化程度低的组差一些。一种可能是由于被调查者不是户主,而是别人代理申报唯→手段。的,另一种可能是被调查者把文化程度高报一个级别。要达到计算误差和理解误差来源这两个目的,怎样来进行一次或多次的检验调查呢?我们可以回过头看农总的来看,一致指数(公式7)为%。业普查中的有关误差o(4)普查和抽查数据在从业时间上的差异相对较大。1.对调查估计最有打击性的影响来自调查员误差。差异最大的是从事农业生产时间,不一致率达5~号。差异我们发现普查和抽查之间的大多数差异集中在少数村主要集中在最后一项"6个月以上"。如果是由别人代理中,也就是说,在一个调查员的任务范围内。如果没有抽户主回答的,不一致的情况会大大上升。样贯穿其中,要区分被调查者和调查员对调查估计的影(5)在对农业时间(有%的不一致)和非农业时间响是不可能的(Mahalanobis, 1946)。我们应该至少对两个(有%的不一致)两的相关的问题的回答,也存在不一调查员和它们负责的两个村进行交叉子抽样①,或者,如致的情况,即回答从业时间的问题时,有些活动在农业和果这样作费用太高的话,至少应在一个村进行(Fabbris, 非农业重复存在计算。对从事的主要行业的回答也有一1998)。为了区分抽样误差和回答误差,可以在普查和抽定的不确定性(有%的回答不一致)。查中对调查员的工作进行双重交叉子抽样(Fellegi,1964, (6)从事主要行业的差错率与从事什么行业有关,差1974)0这是抽选一支独立的抽查员队伍是关键,因为双错水平从%到%不等,加权平均为%。在多数重子抽样意味着,在检验调查中,调查员要交换它们以前情况下,这方面的差错是因调查员造成的。在普查现场的工作任务。如果进行的是多分层的数据收集设计的登记期间,全国农普办就发现,普查员对被调查者从事的话,指导员误差可以从调查员误差中分离出来。(B嗣si& 行业拿不准,其中有些普查员在不能确定时就更可能填Fabbr毡,1997)。无论是什么样的调查设计,必须输入调查"其他行业"。在普查现场登记期间,全国农晋办专门发员(普查员和抽查员)、指导员和参与数据收集与控制的文强调了这个问题。尽管如此,对从事的主要行业的回其他实地入员的代码。答仍有一定的不确定性。2.另一种威胁的误差是偏误(bias),特别是普查对象(7)对主要从业地区和从事非农业生产的主要地点(农村住户、及住户所属的全部土地、耕地等)的范围不全的回答,普查和抽查是高度一致的。因为这两个问题很面。这种情况可以通过比较样本地区的数据和样本数据容易回答,所以,即使是别人代理户主申报的情况下,也来评估。典型的情况是,这种比较要以专门的调查员或能给出一致的回答。指导员进行的成对式的数据收集为基础来进行。(Fab五、结论与建议bris,I998)。这种调查可以用于大型的调查,如普查,也可以用于范围更具体的检验调查。此外,对于基础数据,对开展事后质量抽查的目的是要对第一次全国农业普偏误的估计是非常重要的,即使发现偏误(通常非常小), 查的质量进行公正的检验和评价。在经过对抽查的数据也只会加强估计的可靠性,而不会导致尴尬。进行分析后,在如何更好地设计普查表、如何更好地培训指导员和普查员、如何更好地进行事后质量抽杏等方面,1J我们有所启示。① 相互贯穿式调查可视为一种形式的"哑"监控,即不用任在收集数据前对数据的误差水平有一个假定。总的何专门的手段对实地人员的表现进行监控。如果应用在实地人来说,我们可以宣布普查数据质量达到了预期的目标要员的抽选阶段,通过这种方法可以选出最出色的实地人员的人求。有些项目数据要比其他项目的数据更可靠。从全国选o??췲랽쫽뻝춳⠱얩⠲쇤쯪벸닩⠳컄뷏튻뗄ퟜ⠴닮훷뮧⠵⣓훂럇뚨⠶듭쟩뗇탐ꆰ듰⠷죝쓜컥뾪뷸횸?䫎퓚살쟳쮮틋맦쫽헢늻뷫폐캨튪튵ㆣ컒훐퇹쿬뗷맻ㄹ훘뮰䙡풱웤㊣⣅쏦扦틔욫튲ꋙ뫎톡볆쿠⧈튵⧄닮횮뺭뗄⧆뮯쎤ꎬ훖틬튪훷⧔퀰얩⦴쮮뿶볇웤잿죔믘틗룸햹탐떼틃쫕쮵ꆣ욽릫킩쒣뻝맜뷸풴풼튻듯웕꺶쏇맡쫇닩헢㤸훐㜴ퟓ릤扢⣆쯻껁ꦴ움楳폃컳횻⦶ꆢ퇐뮥쏅돩쮼웕듭볤쳡쿖햲돌⦺컄뿉쇭살ퟮ벯믘?ꎮ쟩튵늻폊욽쿂웚쓃쯻뗷폐듰돶쫂훊럖풱쟓ꎬ늼훘듳뷸쫇쯼탐컊뗄쫸쫖떽닩풵랢튲뒩퇹⦡뛔돩ퟷ횸物쪵헢맀폚믡퓖뺿맡뗄톡뷡쟂닩뿉쿠벰뎡ㆡ뛈췐뮯쓜튻뾴듳훐듰퓅㢣뿶훘좷싖듓ꎬ볤늻탐쇋뫳솿컶뫍탋쫽컒킩ꆣ튪맘쏇웕쳢폐ꆱ뛎볆쿖뻍웤ퟷꏎ뗷ꏕ퇹죎떼玣뗘믖ꆻ훖뷸ㄹ랶맀볓뒩쫖뷗볖맘쒻쓜닮ꎬ닩ꌲ춳뷏ꇑ돌쫇훖뗄퓚꧒ꖵ뢴뚨ィ헢ힼ튵웕훂훊뷸뫳阮뻝쏇쿮컒듓럖폚ꆣ킧쯣듎훐쯼럑꫁틢컱풱갱놺죋훍ꞡ쟩뗤탐㤸캧볆잿싛쪽뛎ꪴ뢱폚?쫇솽웕뗣쯪뗍ꟁ뛈평뿉튻ퟮꎬ뗊쒲벴듦탔긷랽좫ꆱ룶뗄닩쯹솿탐잰쒿쏇뇤럖컶죎퓚릤뫍뛸컳믲폐삼쮵폃쯇풱잳캶ꆣ㤹춳ﻐꊼ뿶탍⦡룼맀뗷뛔폒폫얩훐쯪닩릤뗄뷗룟폚쓜훂듓뫳늻놼믒믘퓚⣓탒ꎥ쏦맺웤ꆣ컊뫍틔돩릫풱뺡뛔쫽폐횸솿컶룼뫎쓄ퟷ훘쟒닮뛠맘웗ꎬ튪⡍뢺첫ퟅ죧㜩늵냗뿉돉ꏕ뻟럇볆쪵춨뗘맽쒻듥맺ꆣ뗄ퟷ쓪?ퟩ놻쫇횸ﶾ쫂튻믖듰볆퀰떵떽얩훐퓚쳢좷돩ꎬ닩헽죧ꆢ?쫽탻뻝쒿뿉샯튪맘뫍듎컳쟸慨퓰룟횳릤ꇒ맻듺쓎ꆻ틔쟩뛔쳥뎣붨쫓죋헢?힡볆뛸쿖쫇쇤쒻뇰킡ퟩ뗷놻쫽?얩쿮훂폐숩듓쯣ꎮ쒲㚣닮웕ꆣ뚨?닩벴뗄뫎죧뻝늼튪뾿튵뷸쪵힢샭킴튻럖慬ퟷ믖퓚틔컞넩싫춨뿶쪽횵훘뿉틩캪풱훖뮧쫕쯣볆뎡퓚닮꾳훐ꎵ뿉닩뗷⢹?튵ꆰ뗄ㆣ솽ꆣ㚣긶듭냬킩뺡탔쫇쪹쒿볬룼뫎웕뇈뚼폫컄짏탐뗘뻝튻쟥뷢횮룶놻慮뮰硫뷸Ꞷ듓싛ꆢ流맽튪뾿튻뗄랽듓볗쓪쯣닩뒺틬첶ꎬꯊ뾿헟폒짺㚸쟩긳뗄쪱뛔ꖵꎥ쫇뻍웕쿖맜ꆣ룟퇩뫃룼컳웤얩뮯뾴죋뗣닮볤뗷潢룶탐상횸쟆뇈쫽탔춴훖뇭램튵?쇤뗄뗣뷚듳좵벴잣탔늻헟봷뗊닺뿶ꎥ쿠볤듓쒻쫓틲랢닩뎡죧뛈뇰쫇뫍뗘뫃닮쫽쯻뿉돌ꎬ믲ꆣ풱뇈헒듭뗷풵楳듥훁쮫ꊵ쪲떼ꯎ쓈뷏헢뻝짒탎쿖폊쪲쟩鈴뗄뇪릤뫳뛠쓉늻곈튪쫇냑⧎놼쪱싒믡맘쫂?뗈뗷쿖풱뗇듋튻죋움짨뗘쮮뻝쿮뾿폃뛈돩ꆣ뷏닮살닩쓓듳헟ꎬ뷸짙춻훘쒳쎴ꮲ퇹훖쫕퓓벴뛸쪽틔슷톡뮸뿶뺷랽ힼퟷ뷸쫽쾵쪶뇈뮧컄볤퓉듳늻뗄컊폊ꎬ닩퓚볇훂듺뛔볛볆욽훊쒿뗘ꆢ퇹맽뫳듭풴쓘냏뛠뫍ㄹ탐펦?붻훐럖컳扩뿍놾벯쏓ꆣ쪹쟅ꆰ볠돶?뗄붲램쫇탐쒲ퟖﮰ컄훷뮯㚣쾵ꎬ쾡듳튻컊쳢믒싊볓풱웕늻웚뛔샭뗚ꆣ폐솿듓쟸뗷돌훊뿉튲헢㿎쫽죎㐶붻퓚닦닣닮닎慳솵뗘뷏캪?듋랢믡퇆뿘ퟮ꧒ꏒ훷퓬틔퓚뗄평믲톲뮯ꎬ돌긳쒲늻놡짏훂쳢쪱튪믖닃좨닩쓜볤듓ꆣ뮧튻쫂듯쫽폐맘훐솿쫇솽틃듗닮컱⦡닦ퟓ놶뗷폫⦣?쟸믹췢쿖떼ꆱꆣ돶튪쐲돉뒺ꆣ헢쪶돌뛸뛈ꎥ튻ꏈ짽⦺뗄ꎬ탐숩듐욽풱좷쫂뗉틲훷듎뺭뇭뫳룶떽뻝킩쿂횸튲돩뛔럀잿풵틬랶ꏎퟓ폎닩쫽럖곌ꊸ틔뒡춵욫훂볠죧즫쮣쫽ㆣ뗄뷚틲룶ퟖ뛈쫇룟ꆣ훂춷믘폐튵탒뻹뛔뚨좫캪짪맽ꆢ훊볙쇋룼튻튪릲떼쳡닩쪵횹쒿짒벯캧틃돩듥겿퇹풱뻝샫짨?﮵살쒵컳?者뿘맻겿뻝긷ꎬ캪잰듋풭ꪼ뫜겱뗍뇰놨싊쟅듰킩뗄뗓ꆣ놻쪱맺훷헢뛔죧솿뚨풤뿉탐쫽춬쫖돶튪뗘뫍풻훐쓚뗷쟓퇹뷸짒⡆잹쫕볆?쏅폚⣍?펦쪵蝹폃뗘짒쫇ꎥ벴ힼ뷸퓚틲꿖짙?뗄죋튻풽듯쟓꧒ꎬ믮믘킹㒣뗷뻍얩튪솽돩뫎ꆣ웚뾿뇤튵뻝컊닡쇋뛔복?뇎닩ꚸꋙ탐퓔敬?붻벯살쟆젩뫍믹ꢳ쓖늻퓚죋퓈뿉ꆣ훜뗄탐웕퓬탔⣎쫆ퟩ듺룶쾴㖣즱뗊튲뚯듰?긹닩룼쟩튵ퟜ뗘솿ꎬ뇈쳢훐웤좷풱짙퓵죧맀쏖⡆?汥ﲣ뮻짨뇘폫햲퇹뗷곈뒡ꎷ폃쪵풱쿎뾿쓪쯪ꎬ뗄닩돉?쓃뗊닮샭벶ꖡ놼듦퓚튲겲ꎥ헟뿉냬튵컊뿶웕뫃뗈쒿듓랽ꆣ평폃펦쯻뚨쫇춳퇹랿쫽맻볆쇉믲慢햲杩곒쯼⡂탫뿘랶놾⡆잳죎뗘뗄ꪵꪣ뗄폫짏ꎬ뫍꒡﷏튻짪뇰?ꎲ쮴퓚얩폐ꆣ쿖듓쓜쳢쿂쫽뗘랽뇪좫퓲웤폚쪡룃듭볆듅듥쎻?헟扲쏇慳쫤훆퓏캧풱慢햲뻝ꏐ죋??ꆣ탩컄뛸돩ꊰ킩놨變늻튵튻퓚뎡쫂쳮쏅믘뫜ꎬ뻝엠쏦튪맺쯻죋벶룦컳훖폐펰퓁楳춳ㄹ틔獩죫뗄믲ꆪꄩ돩?ꆣ튻뫍뛠뗄랢튲통ꎬ뿚닮붸죧㘴잰ꎦ뗷좫곒뛔쫽뗄?ꎬ닩늿?
统计研究z2ω2年第8期Statistical R四e!e刷arcbNo. 8 20ω02 55 固定样本在经济统计分析中的应用肖红叶董麓ABSTRACT Data is the material when people do economic statistics analysis. Because the data will directly affect the research result, the quality of data is verηyi mipmuprutratnantt.. Establishing data model and collecting data should be both under the guidance of the economic theory and statistic theory . Panel sample is one kind of research methods in analyzing social and economic problems, for it can joint cross-section data and time series data, the research result it provides is often very effective. People should pay attention to it. 关键词:数据;固定样本理论、方法和数据是经济统计分析赖以成功的三个固定样本(panelsample)是社会和经济问题研究中很基本要素。其中数据反映研究对象的活动水平、相互间有用的一类数据模型,它可以同时利用截面数据和时间的关系以及外部环境,是人们认识经济现象的基本依据,序列数据进行定量分析,因此在很多领域有很好的应用也是经济统计分析的原料。由于数据直接影响研究的结前景。但是目前在我国经济统计分析中固定样本还很少果,因此保证数据的质量是十分必要的。实践证明,要想被使用,即使使用固定样本的研究,大多也没有对它的作获得高质量的数据,必须在经济理论和统计理论的指导用和适用性进行充分讨论。这对于发展我国经济统计分下选择数据模型和收集数据,二者缺一不可。然丽而,实际析显然是不利的。本文从提高数据质量的角度研究固定研究中人们往往对数据的统计特性比较重视,而对于数样本在经济统计分析中的应用υ首先介绍固定样本及其据是否准确地反映它所描述的经济闵素的状态缺乏细致特点,然后通过一个具体研究案例,说明如何在统计理论地考察。即调查数据本身是客观、准确的,但是并不能满和经济理论指导下合理运用固定样本模型和对结果进行足建立经济模型的需要。深人分析。3.对于被调查者误差,抽查可以提供估计值的影响量>,20: 37 -46. 方面的信息。为了确定回答误差的原因,从而对普查和[ 3 l]Fabb巾,L.(1998){农业调查中抽样误差和非抽样误抽查的估计作相应的调整,我们应该记录以下信息:差的的控控制》制扎}。oIn:EUROSTA叭T(eedd..)H冈中《欧中国欧家国家的的农农业业统(I) 调查是由谁申报刊2)关于家庭成员的数据,是被调查者计}>. 丹Pr仰oC回c凹eedi咿nzgs 01 the盯fthlWG. AGRI Seminar (Bwúψ申报的,还是每个成员自己申报的,或者是他人代为申报田est仁,,12归14MNo刷v肥emb加er 1997) , European Communities, Lux›的;(3)为活动数据与住户接触的次数;(4)对同一问题的embourg: 123 -137. 作者简介:卢依吉·法布里斯,意大利怕多瓦大学教回答次序。对回答的核实①可通过子抽样的办法进行。授。如实地人员没有高度的自觉性的话,对抽查的全部样本的进行核实可能会危及检验数据的可靠性。徐志全,国家统计局农村社会经济调查总队,高级统参考文献计师。[ 1 ]lBBas凹s,i,F.. ,Fabb巾,L.(1997只有交叉子抽样的访问一再戴宏因,国家统计局网络信息管理协调办公室副主访问调查的非抽样误差估计量}In:Lyberg , L. , Beeirimr凹. 任,高级统计师责任编辑:何平)P. ,Collins, M. ,de Leeuw, E. , Dippo, C. , Schwar口z,, N. , Trewin, D. (eds. )(调查计量与处理质量>),Wiley, New ① 对回答的核实需要一个复杂的过程,以避免调查员查看York:733-751. 第一次调查的结果,而在第二次调查中照抄。需要记录三个值1[2 ]Cohen,J.(J960)(名义变量的一致系数,教育和生理计第一次和第二次的自然回答以及核实的结果。??췲랽쫽뻝㈰乯춳却剥㔵만키뚭슴䅂䑡楳瑨煵癥業摡浯獡潮歩潦牥浥楴捡橯䍲慮獨灡慴瑯맘샭믹뗄튲맻믱쿂퇐뻝뗘ퟣ폐탲잰놻폃컶퇹쳘뫍짮㎣랽돩뗷짪믘죧닎嬱럃傣䱥呲奯嬲솿嬳닮볆卥敳ㄴㄹ䍯敭ퟷ쫚탬듷죎⣔ꋙ뛔뗚㈰浡睨灥摯散獴慮摡睩摩慦瑨潦楳楮瑩獥?ꎮ慴獥特꺣敵牫璣癥浭〲볆瑡?牥慬灯摥捯摡獨扥扯畮浰湤瑨獯慮潓楴灲楳潦潵瑥쪦믘튻協싛놾맘쫇ꎬ뗃톡뺿뾼붨뚨폃쇐뺰쪹뫍쿔뗣뺭죫꺶쏦닩놨ꎻ듰쪵뷸嵂컊敷嵃ꆷ嵆뗄浩㤷헟ꆣ횾뫪楮볼瑥敮潰潮慴慬瑡汬牥晥瑨散灲浥物癥敦?楳慲걃瞣ꎺ旁갱浢畮畲뫬쓪퇐獥獵楴牴?汬瑡潵瑨摥杵潦汥慲潤捩匭潶瑥汤湴ꆣ듰듎剁ꆢ튪쾵뺭틲룟퓱훐럱달솢퇹뗄쫽ꆣ폃쫊좻퓚볃럖퓓쫇⠳듎뗘탐컄慳뗷楮潨慢뿘ꎮ湡⦣볲좫맺캱瑩捨物汥潭楳祳捴?散瑨慮祺潮潢敳ꎬ特晥潬걅㜳敲楴枣듊뚨뗚뺿慲汴?慮散汤楤獴捨慬獥楯뗄뗷뫍捡汩ꎮ㎡쑞楥먱䍔慬楣瑩楳汹潮敯?瑨楮潭汥捴랽쯘틔볃듋훊쫽죋ힼꆣ뺭놾⧊튻뻝떫ꎬ폃쫇좻샭컶?탅맀평⧎탲뫋쿗獩닩敮㈰扲훆偲爨걅뷩벶튶㣆捨ꎬ璣瑩慮慴捴敳ꎺ뫋닩뗚?湳ꬷ玣㈳捳ꎮ潭特敯?楣浳楶램ꆣ벰춳놣솿뻝쏇좷벴볃⡰쟉샠뷸쫇탔늻뫳싛뮵쾢볆쮭뮹ꪻ풱쪵ꎬ뗄䒣ꎺꆷ潣䉵畲맺궣?瑨깅湧捥楳楯ꎬ䑩㔱䥗걌ꆪ쪵뗄뛾쫽䉥楣特ꎬ斣퇹뫍웤췢볆횤뗄쒣췹뗘뗷慮쫽탐쒿뇣뷸샻춳춨횸ꆣퟷ짪쫇뛔쎻뿉䚣럇䶣灰긨ꎮ䪣㌷敥摡潰畸ㄳ슬볒몺?獴瑩탨뷡듎捡ꎮ景깐뻝꺣澣䞣ꆪ㞣慢?쫽훐늿럖탍췹랴닩敬뚨잰쪹탐뗄볆맽떼캪쿠놨쎿꿊믘폐쓜꺣돩敤긨ꆪ䲣䥮摩炡敡틀춳쪦컆튪맻畳偡?敯걤걃汩ꎺꎬퟔ뻝쫽뮷컶뫍뛔펳뗄춾쒣솿퓚폃돤ꆣ럖튻쿂?쇋펦ꎻ룶ﶾ듰룟믡걆퇹玣ㄹ㐶긨湧벪볆봩ꎮ깁놾?湥灬獨룶뛸좻만쫇뻝뺳뗄ꎬ쫕쫽쯼탨궼탍럖컒놾컶룶뫏좷⠲돉?뛈캣慢컳긩㘰ꎮㄹ䕕ꆤ뻖?楮卥䝒뢴퓚믘뺭랴ꎬ풭훊뇘벯뻝쯹놾튪쏎컶맺쳖컄훐뻟샭뗷⦹풱뫋뗄벰扲닮ꆶ⦡㤸剏램얩췸뚨桷?퓓뗚듰퓚볃펳쫇쇏솿탫쫽뗄쏨짭ꆣ쫌쯼ꎬ뺭싛듓쳥퓋겳믘헻?ퟔꆻ쪵볬楳맀慲뗷뛃⦡協?늼듥싧퇹뗄뛾틔窣춳퇐죋ꆣ쫇퓚뻝쫶뿉틲볃놾쳡펦폃듰ꎬ?벺ꞽꋜ뻵퇩볆닩뛅䅔샯짧탅맽듎벰놾걎볆뺿쏇평쪮ꎬ뗄뿍킾틔듋춳헢룟폃만컳컒틍짪펴뿉탔쫽䲣솿꧒⡥쮹믡쾢돌뗷뫋뺭ꎮꎬ닩쪵럖뛔죏폚볃뛾쳘뺭맛뿖춬퓚볆퇐쫽ꆣ낸뚨짒닮쏇ꖳ놨ꖵ춨뗄뻝긨絉솿떵撣맜틔훐뗄컶쿳쪶쫽뇘샭헟탔볃ꆢ킺쪱뫜럖뺿폚뻝쫗샽퇹퓌뗄펦짔쒴맽뮰ㄹ溣폫뾵긩틢볃뇜헕뷡삵뗄뺭뻝튪싛좱뇈틲ힼ?샻뛠컶ꎬ랢훊쿈놾풭룃놵컊ퟓ뿉㤷멌뒦쓒ꆶ듳뗷킭쏢뎭맻틔믮볃횱뗄뫍튻뷏쯘좷폃쇬훐듳햹솿뷩쮵쒣ꦹ틲볇쓊믲ﶣ돩뛔뾿⦡祢샭믖킳샻닩뗷뗷ꆣ춳돉뚯쿖뷓ꆣ늻훘뗄뷘폲만뛠컒짜쏷탍삼ꎬ슼ﶾ헟묨퇹돩탔뛓敲훊싏얷엁ퟜ냬닩탨릦쮮쿳펰쪵볆뿉쫓ힴꎬ쏦폐뚨튲맺뷇만죧뫍웖듓틔?쫇㐩뗄닩ꆣ킽枣솿뗊硫뛠뛓릫풱튪닩볇뗄욽쿬볹샭ꆣꎬ첬떫쫽뫜퇹쎻뺭뛈뚨뫎뛔떵뛸쿂곊쯻냬뮲걌ꆷﶣ볒췟쫒볆뾴슼죽ꆢ믹퇐횤싛좻뛸좱쫇뻝뫃놾폐볃퇹퓚뷡쓓뛔탅잱죋춬램좫ꎮꎬ경뗄듳룟뢱죽룶쿠놾뺿쏷뗄뛸뛔랦늢뫍뮹춳맻냏웕쾢뮵듺튻뷸늿펳ꎬ坩쳓춷얩톧벶훷룶럖뮥틀뗄ꎬ횸폚쾸늻쪱펦뫜쯼볆만벰뷸?닩ꎺ캪컊탐퇹䉥汥ﶺ잳튵뷌춳횵볤뻝뷡튪떼쪵쫽훂쓜폃짙뗄럖뚨웤샭탐뫍⠱짪쳢ꆣ놾例業禣췉춳ꎺꎬ쿫볊싺ퟷ싛?놨뗄쒷敲걎變硫컶쏎ꎬ敷?쫒?훐믔?뗄펦폃