本资料来源
第八章 参数估计
第7章介绍抽样设计和抽样分布,目的为什么?
根据样本统计量对总体的特征作出具有一定可靠
程度的推断,这种统计研究方法就称为抽样推断。
统计推断包括参数估计和假设检验。
参数估计指的是:根据样本统计量对总体的参数
作出具有一定可靠程度的推断;
假设检验指的是:根据样本统计量对总体参数的
某种假设作出检验,以验证总体是否具有某种性质或
数量特征的统计研究方法。
第八章 参数估计
第一节 参数估计概述
一.点估计和区间估计
点估计和区间估计是参数估计常用的两种方法
首先明确两个概念
估计量:用来对总体参数进行估计的相应的样本统计量。样本统
计量在对总体参数进行估计时有了一个新的名称。常见的估计量
有:
样本平均数
样本比率 或
样本标准差
样本方差
以上的几个的样本统计量通常可以成为相应总体参数的估计量。
估计值:估计值是样本统计量的具体观察值,是统计量中的一个具体数值。
第八章 参数估计
第一节 参数估计概述
点估计就是根据样本资料计算的一个估计值,也就是用样本资
料计算的某个统计量的具体点值作为总体参数的估计值。例如要估
计一批产品的平均使用寿命,其方法是:先从总体中随机抽取一个
样本,计算样本统计量,样本平均数=1000(小时)则可以说总体
平均数的估计值为1000(小时)。可以分别用样本方差的一个具体
的点值、样本比率的一个点值去作为总体相应参数的估计值。特点
是:
•1.方法简单,又能准确估计出总体参数。
•2.无法计算估计误差。
•3.不可能知道估计的可靠程度。
点估计法尽管方法简单,但因为无法计算估计误差,不可能知
道估计的可靠程度,因此在实际工作中很少使用。但是只要坚持了
估计量的优良标准,这种方法还是完全可行的。
参数估计使用较多的还是区间估计
第八章 参数估计
第一节 参数估计概述
区间估计:根据样本统计量估计总体参数所处
的具有一定可靠程度的区间,就称为区间估计。区
间估计就是要找出总体参数的上限和下限,并且给
出总体参数落入该区间的可靠程度。也就是找出我
们此前介绍过的总体参数的置信区间。特点是
1、可以计算估计误差,明确估计的精确度。
2、明确估计的可靠程度。
3、使用广泛。
上节内容回顾
1、统计推断、参数估计、假设检验、
2、估计量、估计值
3、点估计概念、特点
4、区间估计的概念、特点
第八章 参数估计
第一节 参数估计概述
二.估计量的优良标准
用样本统计量对总体参数进行估计时,并非所
有的估计量都是优良的,而对于区间估计,无
论如何,可计算出估计的可靠程度,也能根据
置信区间了解估计的精确度。但对于点估计来
讲,样本统计量是否可以作为总体参数的估计
量,要看其是否符合估计量的优良标准。一个
好的估计量有如下三个标准:
第八章 参数估计
第一节 参数估计概述
(一)无偏性
如果样本统计量的数学期望值等于该统计量所估计的总体参数,
则这个总体的估计量叫做无偏估计量。这是一个好的估计量的一
个首要条件。
根据样本平均数的抽样分布我们知道,对于正态总体,样本平均
数的分布服从正态分布,而且样本平均数的平均数就等于原总体
平均数,对于非正态总体,只要样本容量足够大,样本平均数的
分布也服从正态分布,而且样本平均数的平均数也等于原总体平
均数。第七章作过证明,并且用数学期望的方法也可以证明:样
本平均数的数学期望等于总体平均数。对正态总体或样本容量足
够的非正态总体而言,用样本平均数作为总体平均数的点估计时,
就符合这一要求
无偏性实际是指在估计时没有系统的偏差,并不是说
每次抽样,样本平均数就等于总体平均数,而是从平
均意义上讲的,即如果这种估计方法重复进行,则从
估计量所获得的平均数等于总体参数。
数学期望可以理解为:大量结果的平均数。显然,如
果说一个估计量是无偏的,并不是保证用于单独一次
估计中没有随机性误差,只是没有系统性的偏差而已。
同样可以证明,样本方差的数学期望等于总体方差。
如果用数学公式表示
E------数学期望
第八章 参数估计
第一节 参数估计概述
(二)一致性
当样本容量n增大时,如果估计量越来越接近总体参数
的真值时就称这个估计量为总体参数的一致估计量。
通过抽样分布的讨论我们知道,样本平均数、样本方
差和标准差、样本比率,样本容量越大,其数值就越
接近总体相应参数,可见它们具有一致性的性质。如
果一个估计量是一致估计量,那么,在进行估计时是,
样本容量越大,估计的可靠程度就越高。尽管我们不
知道具体的可靠程度。当然,在样本容量n增大时,估
计量的一致性虽会增强,但调查研究所需的人、财、
物力也相应增加。
第八章 参数估计
第一节 参数估计概述
(三)有效性
有效性实际是指估计量的离散程度大小。对同一
个总体参数来讲,如果两个估计量都是无偏的,其中
方差较小的(对给定的样本容量而言)就可认为相对
来说是更有效的。
例如:从一个总体中随机抽取一个容量为n的样本,可以计
算它的样本平均数和样本中位数,样本平均数和样本中位数
都是平均指标,可以证明,两种平均指标都可以作为总体平
均数的无偏、一致估计量,但是谁更有效呢?从第七章分析
中可以知道, ,对于同一个样本容量,样本
中位数m
d
的方差 (可以证明,省略),因此,
在满足了无偏性和一致性要求的同时,样本平均数比样本中
位数作为总体平均数的估计量更有效。
如果一个估计量同时满足这三个标准,那么就可以说这一个
估计量是一个好的估计量。样本平均数和样本方差标准差、
样本比率都是符合无偏性、一致性、有效性的总体参数估计
量。
第八章 参数估计
第一节 参数估计概述
三.参数估计的一般程序
1.提出估计的基本要求
对于区间估计,参数估计必须给出两个基本要求中的
一个。一是估计的允许误差,一个便是估计的可靠程
度。抽样允许误差要求越小越好,越小精确度越高,
太大失去了估计的意义。但是允许误差越小,则估计
的可靠程度越低。估计的可靠程度越高,则允许误差
越大。
2.确定最低的样本容量
(将在此后内容中详细介绍)
第八章 参数估计
第一节 参数估计概述
3.编制抽样框
抽样框是组织抽样的基础。抽样框是包含全部总体单位
及其主要标志特征的框,从中可以抽出样本单位及其基础资
料。抽样框常见的有两种①总体单位清单 可以是总体单位的
名单框架、盛有总体单位名单的篮子,也可以是按照适当标
志排队的总体单位顺序表。②地段抽样框 地段单位是明确
地划定了地理边界的单位。要根据地图来进行确定。
4.抽取样本
5.样本准确性和代表性检查
6.实地调查
7.估计
第八章 参数估计
第二节 总体平均数的区间估计
从第七章了解到,总体是否正态分布,总体方差是否
已知,大样本还是小样本,甚至重复抽样还是不重复
抽样,样本统计量的分布都有所不同,样本平均数的
分布固然也不相同,以下几种情况是我们要掌握的:
1、正态总体,方差已知
2、非正态总体,方差已知
3、总体方差未知,小样本
4、总体方差未知,大样本
一、正态总体、方差已知
1.基本原理
如果抽样总体服从正态分布,而且方差已知,设:总体平均数为 ,
标准差为 ,则样本平均数的分布服从正态分布,且样本平均数的平
均数 ,样本平均数的标准差 。既然 服从正态分布,
那么, 依然服从正态分布,因为 是一个常数,因此,
依然服从正态分布,对于新的变量 ,因为 ,
因此其平均数等于0;因为原变量在减去 同时缩小了 倍,则其
标准差应缩小 倍,所以其标准差就为1。因此由 转化而来的新
变量 就服从标准正态分布。我们知道在标准正态分布中,任意
一个变量出现的概率可以查表得到,而且我们还记住了常见的几个区
间概率。例:在标准正态分布中,落在(-2 , 2)区间的概率是
%。用公式表示为:
或
换成中文就是 的概率保证是%
移项整理 的概率保证是%
到此我们已经明白,如果给定了估计的可靠程度%,我们又
通过抽样,计算出了样本平均数为 ,那么我们就知道
第八章 参数估计
第二节 总体平均数的区间估计
• 从第七章我们也曾讨论过,变量落入置信区间
以外的概率叫做显著水平,那么,给定显著水
平a,也就是给定了置信概率。置信概率等于
1-a。我们可以查一定显著水下的正态分布
变量值,来确定总体平均数的置信区间了。
第八章 参数估计
第二节 总体平均数的区间估计
• 2.方法步骤
• (1)抽取样本,计算样本平均数
• (2)计算样本平均数标准差(均数标准差)
•
• 如果明确是不重复抽样,注意需要用 进行修正。
• (3)确定置信水平(置信概率、保证概率、保证水平)
,根据置信水平确定显著水平a
第八章 参数估计
第二节 总体平均数的区间估计
• (4)查标准正态分布表中显著水平为a时的变量值
Z
a
• ( 、 、 )
• (5)构造总体平均数的置信区间
第八章 参数估计
第二节 总体平均数的区间估计
• 例8-1某制造厂质量管理部门的负责人希望估计移交给
接收部门的5500包原材料的平均重量。一个250包原材
料组成的随机样本所给出的平均值 =65千克。总体标
准差 =15千克。试构造总体未知的平均值的置信区间,
假定95%的置信区间已能令人满意,并假定总体为正态
分布。
• 解:本题中,已知总体服从正态分布,所以样本平均
数也服从正态分布。并已知N=5500,n=250,
=65(克), =15(克),置信水平95%
第八章 参数估计
第二节 总体平均数的区间估计
• (1)抽取样本,计算样本平均数
•
• 对本题,样本已抽出,样本平均数已知 =65(克)
• (2)计算样本平均数标准差(均数标准差)
• 如果不明确是不重复抽样,均可以看作是重复抽样
• 对本题,
•
• (3)确定置信水平,根据置信水平确定显著水平a
• 对本题,已知置信水平95%,显著水平
• (4)查标准正态分布表中显著水平为a=时的变量值Z
• 对本题,Z
=
• (5)构造总体平均数的置信区间
•
•
• 结论:根据抽样研究,5500包原材料所组成的总体总体平均数,
,估计的可靠程度为95%。
第八章 参数估计
第二节 总体平均数的区间估计
• 二.非正态总体,方差已知
• 如果抽样总体不服从正态分布,则抽取的样本平均数也不
服从正态分布,但是随着样本容量的增大,样本平均数的
分布越来越接近于正态分布,如果样本容量足够大,样本
平均数的分布可近似看作正态分布。而且样本平均数的平
均数 ,样本平均数的标准差 ,我们自然可
以利用正态分布来解决总体平均数的区间估计问题了。
第八章 参数估计
第二节 总体平均数的区间估计
• 例8-2 某职业介绍所的职员从申请某一职业的1000名申请者中采
用不重复抽样方法随机抽取了200名申请者,借此来估计1000名申
请者考试的平均成绩。已知由200名申请者构成的样本平均数
=78分,由已往经验已知总体方差为 =90,但该职员不知
总体服从何种分布,试求90%的置信区间。
• 解:根据中心极限定理,由于这个问题的样本容量为200,远大于
30或50,足够大,因此,样本平均数的分布可看作近似服从正态
分布。又因为是有限总体的不重复抽样,所以在计算均数标准差
时需乘以有限总体修正系数即可。
第八章 参数估计
第二节 总体平均数的区间估计
• 方法步骤:
• (1)抽取样本,计算样本平均数
• 对本题,样本已抽出,样本平均数已知 =78(分)
• (2)计算样本平均数标准差(均数标准差)
• 明确是不重复抽样,需要校正。
• 对本题,
•
• (3)确定置信水平,根据置信水平确定显著水平a
• 对本题,已知置信水平90%,显著水平
第八章 参数估计
第二节 总体平均数的区间估计
• (4)查标准正态分布表中显著水平为a=时的变量
值Z
• 对本题,Z
=
• (5)构造总体平均数的置信区间
•
• 结论:根据抽样研究,1000申请者组成的总体总体平
均数在77~79,估计的可靠程度为90%。
第八章 参数估计
第二节 总体平均数的区间估计
• 三.总体方差未知,小样本
• 从一个正态总体中抽取样本,样本平均数的分布
服从正态分布,而且样本平均数分布的平均数等于原
总体平均数,样本平均数的标准差 ,变量
此时服从标准正态分布。
如果总体方差未知,那么变量 服从t分布。
如果样本容量足够大,t分布近似服从标准正态分布。
如果样本容量小于30或50,那么只能服从t分布。由此
可见,正态总体方差未知,小样本时,只能用t分布来
解决总体平均数区间估计问题。
第八章 参数估计
第二节 总体平均数的区间估计
• 如果总体是非正态总体,尽管方差已知,样本平均数的分布也
不服从正态分布。但如果样本容量足够大,样本平均数的分布近似
服从正态分布。也可以用正态分布来解决总体平均数区间估计问题。
(例题8-2)。
• 但非正态总体,且方差未知,那么只要样本容量足够大,即使
用样本方差代替总体方差,样本平均数转换变量 的分布仍然
近似服从t分布。因为样本容量足够大样本平均数的分布也近似服从
正态分布,变量 也近似服从标准正态分布。可以用t分布也
可以用正态分布来解决总体平均数区间估计问题。
第八章 参数估计
第二节 总体平均数的区间估计
• 如果总体是非正态总体,方差未知,且样本容量小于30或50,样本平均数
的分布难以确定是何种分布,用样本方差代替总体方差,变量 既不服
从t分布,也很难确定其属于何种分布。非正态总体总体方差未知且小样
本,如何进行总体参数的区间估计呢?
• 规定两个条件:
• 1.抽样总体近似服从正态分布。
• 2.总体中的变量相互独立。即抽取一个变量对剩余的变量数值无影响。
在总体变量不相互独立时,必须保证总体容量N很大,而样本容量n又很小,
抽取n个单位对独立性影响不大。此时, 近似服从t分布。
• 可以按照t分布解决区间估计问题。
第八章 参数估计
第二节 总体平均数的区间估计
例8-3 为了估计1分钟1次广告的平均费用,抽出了15
个电视台的随机样本。样本的平均值=2000元,其标准
差s=1000元。假定所有被抽样的这类电视台近似服从
正态分布,试构造总体平均值为95%的置信区间。
解:总体近似服从正态分布,但方差末知,n=15,
=2000,S=1000,置信水平95%,a=
• 方法步骤:
• (1)抽取样本,计算样本平均数
• 对本题,样本已抽出,样本平均数已知
=2000(元)
• (2)根据样本资料计算样本标准差
• 对本例已知 s=1000
• (3)计算样本平均数标准差(均数标准差)
• 虽未明确是抽样方法,但总体容量很大,不需
再作校正。
• 对本题,
• (4)确定置信水平,根据置信水平确定显著水平a
• 对本题,已知置信水平95%,显著水平
• (5)查自由度为n-1=15-1=14时的t分布表中显著水平
为a=时的变量值t
=(双尾)
• (6)构造总体平均数的置信区间
• 结论:根据抽样研究,总体平均数 ,估
计的可靠程度为95%。
第八章 参数估计
第二节 总体平均数的区间估计
• 四.总体方差未知,大样本
• 不管原总体服从何种分布,只要样本容量足够大,则
样本平均数的分布近似服从正态分布,且 ,
, 变量 近似服从标准正态分布。但当
总体方差未知时,只有用样本方差代替总体方差,那
么此时变量 就近似服从t分布。当样本容量远大
于30或50时,也可以认为变量 就近似服从正态分
布。下面用两种方法同时计算一个例题,看两种方法
的区别。
第八章 参数估计
第二节 总体平均数的区间估计
• 例8-4 某百货店通过100位顾客的随机样本研究购买
额,均值和标准差分别为元和元,试构造总
体均值的90%的置信区间。
• 解:不知总体属于何种分布,但样本是大样本,且样
本容量远大于30和50,总体方差未知,需用样本方差
来代替。代替后的变量 近似服从t分布,甚
至近似服从标准正态分布。
• 方法步骤:
• (1)抽取样本,计算样本平均数
•
• 对本题,样本已抽出,样本平均数已知=(元)
• (2)根据样本资料计算样本标准差
•
• 对本例已知 s=
• (3)计算样本平均数标准差(均数标准差)
• 对本题,
• (4)确定置信水平,根据置信水平确定显著水平a
• 对本题,已知置信水平90%,显著水平
• (5)查自由度为n-1=100-1=99时的t分布表中显著水平为a=
时的变量值t
=(双尾)。(单尾检验时查t
)。或者
• 查标准正态分布Z
=
• (6)构造总体平均数的置信区间
•
• 或者
• 估计的可靠程度为90%。
条 件 均数标准差 总体平均数置信区间
正态总体,方差已
知
非正态,方差已知,
大样本
(近似正态),方
差未知,小样本,
方差未知,大样本
或者
• 以上总结请注意:每种方法适用条件,每种方法最基
本的理论依据,主要就是样本平均数的抽样分布,基
本的方法步骤都是一样的。
• 1.
• 2. S
• 3.
• 4. 置信概率 即
• 5. Z 或t
• 6. 置信区间。
第八章 参数估计
第三节 两个总体平均数之差的区间估计
• 两个总体平均数之差的区间估计,最关键的还
是以样本平均数差数分布为理论依据。样本平
均数差数的分布因为两个抽样总体分布不同,
方差已知或未知,大样本还是小样本都有所不
同,具体情况只能采取具体的方法步骤。
第八章 参数估计
第三节 两个总体平均数之差的区间估计
• 一. 两个正态总体,方差已知
从第七章我们知道,如果两个总体服从正态分布,样本平均数
差数( )的分布服从正态分布,样本平均数差数(分布)
的平均数等于两个总体平均数之差( ),样本平均
数差数分布的标准差 。既然两个样本平均数差数
的分布服从正态分布。 作为一个变量减去其总体平均数
也就是( )-( )依然服从正态分布,该变量
再除以样本平均数差数分布的标准差即 自
然就服从标准正态分布。
第八章 参数估计
第三节 两个总体平均数之差的区间估计
• 例8-5某银行负责人想知道存户存入2家银行的钱数,
他从每一家银行各抽选了1个由25个存户组成的随
机样本。样本平均值如下:银行A: =450元;银
行B =325元。2个总体均服从方差分别为
• =750和 =850的正态分布。试构造 的
95%的置信区间。
• 解:由于2个总体均服从正态分布,因此 也服从正态分布,因此
可以通过变量转换采用标准正态分布来估计总体平均数差数的置信区
间。并且已知 =450元, =325元; =750, =850;置信概率95%,
即显著水平为=
• 方法步骤:
• 1.从两个总体各抽一个样本,计算 , 和 -
• 对本例 =450元, =325元已知,
• - =450-325=125(元)
• 2.计算样本平均数差数标准差
• 3. 确定置信水平,根据置信水平确定显著水平a
• 对本题,已知置信水平95%,显著水平
• 4.查标准正态分布表中显著水平为a=时的变量
值Z
• 对本题,Z
=
• (双尾概率为5%,如果查单尾概率表,则要查 ,即
)
• 5.构造总体平均数差数的置信区间
• 对本例
• 估计的可靠程度为95%。
第八章 参数估计
第三节 两个总体平均数之差的区间估计
• 二. 两个正态总体,方差未知但相等
• 从第七章我们知道,如果两个总体服从正态分布,样本平均数差数(
)的分布服从正态分布,样本平均数差数(分布)的平均数等于两个
总体平均数之差( ),样本平均数差数分布的标准差
。变量 服从标准正态分布。当总体方差未知时,
只能用样本方差去代替总体方差,如果两个总体方差相等,但因为存
在两个样本,究竟该用谁去代替总体呢?不能用其中任何一个样本方
差去估计总体方差,而是用两个样本的混合方差去估计总体方差。
• 混合方差
• 混合方差显然是两个样本方差的加权平均数,权数即是两个样本各自自
由度。
• 既然用混合方差 来代替总体方差,而混合方差
• 其实还是样本方差,平均数差数标准差可以用
• 计算,但是变量 却不服从标准正态分布而是服从
• 自由度为n
1
+n
2
-2的t分布。
• (证明从略)
• 因此,总体平均数的置信区间为:
第八章 参数估计
第三节 两个总体平均数之差的区间估计
• 例8-6 某工厂中有2台生产金属棒的机器。一个随机
样本由机器A生产的11根金属棒组成,另一个随机样本
由机器B生产的21根金属棒组成。2个样本分别给出2台
机器所生产金属棒的长度数据如下 =英寸。
=英寸;S
A
=,S
B
=。假定2个总体近似
服从正态分布,且总体方差相等,试构造μ
A
-μ
B
的
95%的置信区间。
• 解:两个总体方差相等但未知,可以用混合方差来作
为总体方差的估计值,计算样本平均数差数标准差,
用t分布估计总体平均数差数所处的置信区间。并且题
目已知 =英寸, =英寸;S2
A
=,
S2
B
=;置信概率95%。
• 方法步骤
• 1.从两个总体各抽一个样本,计算 , 和 -
• 对本例已知 =英寸, =英寸,
• - =- =(英寸)
• 2.计算两个样本的混合方差
• 3.计算样本平均数差数标准差
• 4. 确定置信水平,根据置信水平确定显著水平a
• 对本题,已知置信水平95%,显著水平
• 5.查自由度为n
1
+n
2
-2=(11-1)+(21-1)=30时的t分布
表中显著水平为a=时的变量值t
• 对本题,t
=
• (双尾概率为5%,如果查单尾概率,则要查,即)
• 6.构造总体平均数差数的置信区间
• 对本例
•
• 总体平均数差数即两台机器生产的金属棒平均长度差别在~
英寸之间,估计的可靠程度为95%。
第八章 参数估计
第三节 两个总体平均数之差的区间估计
• 三. 两个总体均服从正态分布,方差未知且不等
• 既然两个总体方差未知,我们只有用 然后去计算
平均数差数标准差 但是 此时服从
正态分布,但 却不服从自由度 的t分
布。这种情况其实总体平均数差数区间估计没有了办法。但经过研究
发现, 服从一种用两个样本方差和样本容量去修正
了的自由度的t分布。修正自由度 ,因此,我们
可以按t分布去解决差数分布及总体平均数差数区间估计了。
• 例8-7 为了说明问题,现假定例8-6中的2个总体方差不等,试构
造的95%的置信区间。
• 解:既然两个总体方差不等,只好用各自样本方差估计各自总体
方差,计算平均数差数标准差,然后修正自由度,其修正自由度
为:
由这个公式算出来的自由度往往不是整数,可以用四舍五人后的
整数查表求得置信区间。
• 方法步骤如下:
• 1. 从两个总体各抽一个样本,计算 、 、
• 2. 计算两个样本方差 (计算公式略)
• 3. 计算平均数差数标准差
• 注意: 却不服从自由度 的t
• 分布,但是他服从另外一个自由度的t分布
• 4. 计算自由度修正值
•
• (计算时四舍五入取整数)
• 5. 确定置信水平或显著水平
• 6. 查自由度为 时
• 7. 构建置信区间
•
• 或
• (5分钟按以上步骤整理例题8-7)
第八章 参数估计
第三节 两个总体平均数之差的区间估计
• 四. 两个总体均不服从正态分布,且方差未知
• 两个总体变量分布不详或明确均不服从正态分布,要
想清楚地知道样本平均数或样本平均数差数的分布,
只有按中心极限定理采用大样本,此时样本平均数的
差数分布近似服从正态分布。即使用 计算
那么变量 也近似服从
正态分布,按正态分布解决问题即可。
• 例8-8 A,B两所大学某学期期末英语考试采用同一
试题。A校认为该校学生英语考试成绩能比B校高出10
分。为了证实这一说法。主管部门从2校各抽取一个随
机样本并得到如下数据: n
A
=75人,n
B
=80人, =
分, =分,s
A
=分,s
B
=分。试在95%的置信
程度下确定2校平均分数之差的置信区间。
• 方法步骤如下:
• 1. 从两个总体各抽一个样本,计算 、 、
• 2. 计算两个样本方差 (计算公式略)
3. 计算平均差数标准差
• 均大于等于30或50
• 4. 确定置信水平 或显著水平
• 5. 查标准正态分布
• 6. 置信区间
• 该题目的结论是:我们有95%的把握说A、B 2校英语成
绩之差在分之间。这个结果说明A校的平均成
绩确实高于B校,但并末高出10分。
条 件 平均数差数
标准差
总体平均数置信区间
两个正态总体,
方差已知
两个正态总体,
方差未知但相
等
自由度df=n1+n2﹣2
两个正态总体,
方差未知且不
等
自由度
两个非正态总
体,方差未知
(大样本)
内容回顾
1、统计推断、参数估计、假设检验、估计量、估计值
2、点估计概念、特点
3、区间估计的概念、特点
4、估计量的优良标准,无偏性、一致性、有效性。数学期望
5、区间估计的一般程序,参数估计的两个基本条件
6、总体平均数的区间估计
7、两个总体平均数之差的区间估计
第八章 参数估计
第四节 总体比率的区间估计
• 当 或 大于5, 或 不接近0或1的时候,抽样分布接近正态分
布。样本比率(成数)的抽样分布近似服从平均数为(总体比率),标
准差为 的正态分布,此时我们按正态分布来解决总体比率
区间估计问题即可。
• 但是总体比率我们又常常是不知道的,(这本来就是要我们去估计的一
个数值)那我们只有用样本比率去代替总体比率从而计算 即:
。此时, 近似服从 , ,的正态分布。但毕竟我们仍能用正态
分布来解决的区间估计。
第八章 参数估计
第四节 总体比率的区间估计
• 方法步骤如下:
• 1. 抽取样本,计算样本比率
• 2.讨论样本比率是否近似服从正态分布。
• 3. 用样本比率 代替 计算
• 4. 确定置信水平,根据置信水平确定显著水平
• 5. 查标准正态分布
• 6. 构建置信区间
• 7. 有限总体不重复抽样要用 修正 ﹥时需
修正
• 条件: 样本容量足够大,保证 分布能服从正态分布
• >5, 或 不接近0或1
第八章 参数估计
第四节 总体比率的区间估计
• 例8-9某企业在一项关于寻找职工流动原因的研究中,
研究者从该企业前职工的总体中随机抽取了200人组成
一个样本。在对他们进行访问时,有140人说他们离开
该企业的原因是因为他们得到的收入太低。试对由于
这种原因而离开该企业的人员的真正比率构造95%的置
信区间。
• 解 企业职工流动情况,可看作是无限总体, =200
• =140
• 置信概率95% 不接近1
• 方法步骤:
• 1. 抽取样本,计算样本比率
•
• 2.讨论样本比率是否近似服从正态分布。
• 3.用样本比率 代替 计算样本比率标准差
• 4. 置信水平,根据置信水平确定显著水平
• 置信水平已知要求95%,显著水平 =
• 5. 查标准正态分布
• 6. 构建置信区间
• 结论:对总体来讲,因收入低而离开企业职工比重在
到之间,估计的可靠程度为95%。
• 例8-10某一大公司的人事处长希望知道本公司内专业不对
口的职员究竟占多大比率。于是他从2000名具有大专以上
学历的职员中随机抽取了一个由150人组成的样本进行研
究,结果表明,其中有45人说他们从事的工作与所学专业
不对口。试在%的置信程度下构造出不对口人员所占
真正比率的置信区间。
• 解:由于样本容量很大,n=150,n
1
=45, =45/150=,
n 和n(1- )都大于5,故可用正态分布逼近。总体为有
限总体,而且n/N =150/2000=﹥,故需用有
限总体修正系数修正 。
• 方法步骤:
• 1. 抽取样本,计算样本比率
• 2.讨论样本比率是否近似服从正态分布。
• 和 都大于5,故可用正态分布逼近
• 3.以样本比率 代替 计算
•
• 4.确定置信水平,根据置信水平确定显著水平
• 置信水平%,显著水平
• 5. 查标准正态分布
• 本题很清楚 =2
• 6. 构建置信区间
• 计算结果表明,我们有%的把握说,该公司具有大专以
上学历的人员中,有%%的人专业不对口。
第八章 参数估计
第五节 样本容量的确定
在此前关于样本容量我们多次提到大样本,小样本,足
够大等有关概念,这是讨论抽样分布时必须考虑的,但
是小到多少,大到多少合适呢?我们必须要考虑一个必
要的样本容量。
必要样本容量是:既满足抽样允许误差的大小,又能满
足一定概率保证程度的最小样本容量。
抽样允许误差就是:根据研究目的和任务确定的样本指
标与总体参数之间的最大误差。表现形式为绝对值形式,
实际是总体参数左右最大的差距。例如:估计允许误差
为1,样本平均数为5,总体平均数的估计区间即为4-6。
第八章 参数估计
第五节 样本容量的确定
• 一. 影响必要样本容量的因素
1. 总体变异程度 越大要求的样本容量应越大,反之越小。
2. 参数估计的可靠程度
相同精确程度情况下,保证程度越高,则要求样本容量越大;保
证程度越低,则要求样本容量越小。
3. 抽样允许误差
抽样允许误差越小,样本容量也越大,反之样本容量越小。
4. 抽样方法
重复抽样,抽样误差要大于不重复抽样,因此,重复抽样要有较
大的样本容量。
第八章 参数估计
第五节 样本容量的确定
二. 必要样本容量的计算
• (一)估计总体平均数时的样本容量
• 1. 重复抽样
重复抽样时,我们知道在总体方差已知时,总体平均数所处区间
那么可见抽样允许误差即为
• 计作:
• 两边平方
第八章 参数估计
第五节 样本容量的确定
• 2. 不重复抽样
• 样本平均数标准差
• 抽样允许误差
• 两边平方
大家知道以上公式获得很是简单,公式里的几个参数如 人为
设定,置信概率人为设定, 可容易找出,对有限总体只要确定
了范围N也为已知,但总体方差或标准差何在,如果知道,抽样估
计岂不毫无意义,应该怎么办呢?
• (1) 根据此前掌握的相同甚至类似的资料来估计
• (2) 组织一次小规模试验性抽样,用 ,再计算样本容
量,如果计算的必要样本容量 试验性样本的样本容量,则将
试验性样本作为正式研究的样本即可。如果大于试验性样本容量,
再补充部分样本单位组成样本去进行研究。
• (3) 根据资料的极差去估计标准差
正态分布 可认为全距为6个标准差,因此=全
距/6即可。
第八章 参数估计
第五节 样本容量的确定
• (二) 估计总体比率时样本容量确定
1. 重复抽样
抽样允许误差
两边平方
2.不重复抽样
抽样允许误差
两边平方
• 同样的问题是该公式中 从何而知(二项分布只要知
道一个 哪还了得)解决的方法:
• (1)用以往资料估计
• (2)试验性抽样(同总体平均数区间估计样本容量确
定)
• (3)专业工作者或研究者以经验判断,如生男生
• (4)以直接作为 来计算必要样本容量,
以 最大,因此必要样本容量也最大,区间估
计具有最高精确度和保证程度,稍许增加工作量,恰
好是非调查难度不大,算是补偿吧。
第八章 参数估计
第六节 正态总体方差和两个正态总体方差比的区间估计
• 一.正态总体方差的区间估计
在生产实践中我们可能碰见这种问题,例如一批产品
的质量问题,像电池,我们可以通过抽样估计、了解
平均使用寿命(总体平均数)来判断其是否合格,但
是否总体平均水平就是合格的唯一标准呢?如果平均
使用寿命不低,但产品之间相差很大,即变异程度很
大,是否就是合格呢?这时我们就需要对总体方差或
标准差进行估计。
• (一)基本原理
• 从一个正态总体( )中随机抽取一个样本( )我们可计算出
样本 。所以 。我们又知道
该变量服从 分布,如果用样本平均数代替总体平均数,那么
可以证明 服从 分布,也就是 近似服从
分布。 分布中某 值出现的概率是可以计算的,因此我
们就可以通过样本方差对总体方差利用 分布进行区间估计了。
[ 出现的概率可以计算] 所处区间的保证程度也就可
以计算了。
• 如果以保证程度为95%,则 必须介于 之间。意
即 的置信区间在 的区间就在
• 方法步骤:
• 1.抽出样本容量为n的样本,计算
• 2.确定置信水平 即显著水平
• 3.查自由度 时的 和
• 4.写出的置信区间
第八章 参数估计
第六节 正态总体方差和两个正态总体方差比的区间估计
• 例题8-15(P178)某制造厂的一名生产管理人员需要
知道完成某件工作所需要的时间。为此他进行了一项
研究,得出一个适于分析的31个观察值组成的随机样
本,从样本数据算出的方差为小时,试:(1)构
造 的95%的置信区间;(2)构造 的95%的置信区
间;(3)问构造置信区间时作了何种假定?
• 解: 已知样本容量 自由度 样本方差
置信水平为95%
第八章 参数估计
第六节 正态总体方差和两个正态总体方差比的区间估计
• 1. 抽出样本容量为n的样本,计算
本题已抽出样本
2.确定置信水平 即显著水平
置信水平95% 即
3.查自由度 时的 和
• 自由度df=31-1=30
• 4.写出置信区间
此估计的可靠程度为95%
被抽样的总体服从或近似服从正态分布是置信区间估
计的假定条件。
第八章 参数估计
第六节 正态总体方差和两个正态总体方差比的区间估计
• 二. 两个正态总体方差比的区间估计
生产实践中我们常常需要比较两个总体的方差,就需要对两个总体方
差的比值进行估计。
基本原理:从一个正态总体中随机抽取一对样本,s
1
2/s
2
2服从 F分布,
但是从两个( 和 )总体中各抽一个样本,s
1
2/s
2
2不服从F分布,
经研究, 却服从分子自由度n
1
-1,分母自由度n
2
-1的 F分布。
因为,F分布表中 所对应的显著水平指的是更大F值出现的概率,
那么某个F值如 所处的置信区间就应该是
整理该式子,
• 方法步骤:
• 1.从两个总体各抽一个容量为n
1
和 n
2
的样本,计算s
1
2和s
2
2
• 2.确定置信水平 即显著水平
• 3.查分子自由度n
1
-1,分母自由度n
2
-1的 ,和分子自由度
n
2
-1,分母自由度n
1
-1时的
• 4.计算 ( F分布性质可以证明)
• 5.构建置信区间
• 例8-16为了比较用2种不同方法生产的某种产品的寿命,
进行一项试验。试验中抽选了由方法1生产的16个产品
组成一个随机样本,其方差为1200。又抽选了用方法2
生产的21个产品组成另一个随机样本,得出的方差为
800。试以95%的可靠性估计 的置信区间。
• 解:已知n
1
=16 n
2
=21 s
1
2=1200,s
2
2=800 置信
水平95%
• 1.从两个总体各抽一个容量为n
1
和 n
2
的样本,计算
s
1
2和s
2
2
本例已知n
1
=16 n
2
=21 s
1
2=1200,s
2
2=800
• 2.确定置信水平 即显著水平
置信水平95%,显著水平 =
• 3.查分子自由度n
1
-1,分母自由度n
2
-1的 ,和分子自由度
n
2
-1,分母自由度n
1
-1时的
• = =
• 4.计算 ( F分布性质可以证明)
• 5.构建置信区间
估计的可靠程度为95%。
内容回顾
1、总体比率的区间估计(方法步骤6或者7)
2、必要样本容量,抽样允许误差
3、影响必要样本容量的因素
4、必要样本容量的4个重要公式
5、总体方差和总体比率未知情况下必要样本容量的确定
方法
6、正态总体方差的区间估计(重点掌握方法步骤)
7、两个正态总体方差比的区间估计(重点掌握方法步骤)
上节内容回顾
1、统计推断(抽样推断)、参数估计、假设检验
2、点估计和区间估计、估计量、估计值
3、点估计和区间估计主要的优缺点
4、估计量的优良标准 无偏性、一致性和有效性
5、参数估计的一般程序
6、总体平均数的区间估计
(1)正态总 体方差已知
内容回顾
1、两个样本平均数差数的抽样分布,几个特点,重点是,两个
正态总体差数标准差计算,这个公式还适用于非正态总体两
个独立样本,样本容量足够大的情况。
2、样本比率的抽样分布特点,样本比率的方差和标准差
3、样本比率抽样分布近似于正态分布的条件
4、t分布的由来、t分布的特点、t值表的应用。与正态分布的
异同点。
5、置信区间、置信概率、置信度、置信水平、显著水平
6、卡方分布的由来,特点,卡方值表的应用
7、F分布的由来,特点,F值表的应用。
8、统计推断、参数估计、假设检验、估计量、估计值
9、点估计概念、特点
10、区间估计的概念、特点
11、估计量的优良标准,无偏性、一致性、有效性。数学期望
12、区间估计的一般程序,参数估计的两个基本条件