第4章
统计学
学习目标
1. 掌握随机试验、事件和概率的概念及性质
2. 理解随机变量及其分布,计算各种分布的
概率
3. 理解抽样分布与总体分布的关系
4. 掌握总体均值、总体比例和总体方差的区
间估计
第一节 概率与概率分布
概率基础
随机变量及其分布
随机事件的基本概念
• 1.随即试验:
• 在相同条件下,对事物或现象所进行的
观察
• 2.事件:
• 随机试验的每一个可能结果(任何样本
点集合)
事件与样本空间
1. 基本事件
– 一个不可能再分的随机事件
– 例如:掷一枚骰子出现的点数
2. 样本空间
– 一个试验中所有基本事件的集合,用表示
– 例如:在掷枚骰子的试验中,
{1,2,3,4,5,6}
– 在投掷硬币的试验中,{正面,反面}
事件的关系和运算
1. 事件的包含
2. 事件的并或和
3. 事件的交或积
4. 互斥事件
5. 事件的逆
6. 事件的差
事件的关系和运算
(事件的性质)
• 设A、B、C为三个事件,则有
1. 交换律:A∪B=B∪A
2. A∩B=B∩A
2. 结合律:A∪(B∪C)=(A∪B)∪C
• A(BC) =(AB) C
3. 分配律:A∪(B∩C)=(A∪B)∩(A∪C)
• A∩(B∪C)=(A∩B)∪(A∩C)
事件的概率
1. 事件A的概率是对事件A在试验中出现的
可能性大小的一种度量
2. 表示事件A出现可能性大小的数值
3. 事件A的概率表示为P(A)
4. 概率的定义有:古典定义、统计定义和
主观概率定义
事件的概率
• 例如,投掷一枚硬币,出现正面和反面的频
率,
• 随着投掷次数 n 的增大,出现正面和反面的频
率
• 稳定在1/2左右
试验的次数试验的次数
正面正面 / /试验次数试验次数
00 2525 5050 7575 100100 125125
概率的古典定义
• 如果某一随机试验的结果有限,而且各个
结果在每次试验中出现的可能性相同,则事
件A发生的概率为该事件所包含的基本事件
个数 m 与样本空间中所包含的基本事件个数
n 的比值,记为
概率的古典定义
(实例)
• 【例】某钢铁公司所属三个工厂的职工人数如下表。
从
• 该公司中随机抽取1人,问:
• (1)该职工为男性的概率
• (2)该职工为炼钢厂职工的概率某钢铁公司所属企业职工人数
工厂 男职工 女职工 合计
炼钢厂
炼铁厂
轧钢厂
4000
3200
900
1800
1600
600
6200
4800
1500
合计 8500 4000 12500
概率的古典定义
(计算结果)
• 解:(1)用A 表示“抽中的职工为男性”这一事件;
A为全公司男职工的集合;基本空间为全公司职工的
集合。则
(2) (2) 用用B B 表表示示““抽抽中中的的职职工工为为炼炼钢钢厂厂职职工工””;;BB为为炼炼钢钢
厂厂
全体职工的集合;基本空间为全体职工的集合。则全体职工的集合;基本空间为全体职工的集合。则
概率的统计定义
• 在相同条件下进行n次随机试验,事件A出
现 m 次,则比值 m/n 称为事件A发生的频率。
随着n的增大,该频率围绕某一常数P上下摆
动,且波动的幅度逐渐减小,取向于稳定,
这个频率的稳定值即为事件A的概率,记为
概率的统计定义
(实例)
• 【例】:某工厂为节约用电,规定每天的用电量指
标
• 为1000度。按照上个月的用电记录,30天中有12天
的
• 用电量超过规定指标,若第二个月仍没有具体的节
电
• 措施,试问该厂第一天用电量超过指标的概率。
• 解:上个月30天的记录可以看作是重复进行了30
次
• 试验,试验A表示用电超过指标出现了12次。根据
概
• 率的统计定义有
主观概率定义
1. 对一些无法重复的试验,确定其结果的概率
只能根据以往的经验人为确定
2. 概率是一个决策者对某事件是否发生,根据
个人掌握的信息对该事件发生可能性的判断
3. 例如,我认为2001年的中国股市是一个盘整
年
概率的性质
1. 非负性
– 对任意事件A,有 0 P 1
2. 规范性
– 必然事件的概率为1;不可能事件的概率为0。
即P ( ) = 1; P ( ) = 0
3. 可加性
– 若A与B互斥,则P ( A∪B ) = P ( A ) + P ( B )
– 推广到多个两两互斥事件A1,A2,…,An,有
P ( A1∪A2 ∪… ∪An) = P ( A1 ) + P (A2 ) + …+ P (An
)
随机变量及其分布
一. 随机变量的概念
二. 离散型随机变量的概率分布
三. 连续型随机变量的概率分布
随机变量的概念
1. 一次试验的结果的数值性描述
2. 一般用 X、Y、Z 来表示
3. 例如: 投掷两枚硬币出现正面的数量
4. 根据取值情况的不同分为离散型随机变
量和连续型随机变量
离散型随机变量
1. 随机变量 X 取有限个值或所有取值都可以逐
个列举出来 X1 , X2,…
2. 以确定的概率取这些不同的值
3. 离散型随机变量的一些例子
试验 随机变量 可能的取值
抽查100个产品
一家餐馆营业一天
电脑公司一个月的销售
销售一辆汽车
取到次品的个数
顾客数
销售量
顾客性别
0,1,2, …,100
0,1,2, …
0,1, 2,…
男性为0,女性为1
连续型随机变量
1. 随机变量 X 取无限个值
2. 所有可能取值不可以逐个列举出来,而是取
数轴上某一区间内的任意点
3. 连续型随机变量的一些例子
试验 随机变量 可能的取值
抽查一批电子元件
新建一座住宅楼
测量一个产品的长度
使用寿命(小时)
半年后工程完成的百分比
测量误差(cm)
X 0
0 X 100
X 0
离散型随机变量的概率
分布
离散型随机变量的概率分布
1. 列出离散型随机变量X的所有可能取值
2. 列出随机变量取这些值的概率
3. 通常用下面的表格来表示
X = xi x1 ,x2 ,… ,xn
P(X =xi)=pi p1 ,p2 ,… ,pn
4. PP((X X ==xxii)=)=ppii称为离散型随机变量的概率函数称为离散型随机变量的概率函数
ppii00
0
离散型随机变量的概率分布
(实例)
【例】如规定打靶中域Ⅰ得3分,中域Ⅱ得2分,
中域Ⅲ得1分,中域外得0分。今某射手每100次
射击,平均有30次中域Ⅰ,55次中域Ⅱ,10次
中Ⅲ,5次中域外。则考察每次射击得分为
0,1,2,3这一离散型随机变量,其概率分布为
X = xi 0 1 2 3
P(X=xi)pi
离散型随机变量的概率分布
(0—1分布)
1. 一个离散型随机变量X只取两个可能的值
– 例如,男性用 1表示,女性用0表示;
合格品用 1 表示,不合格品用0表示
2. 列出随机变量取这两个值的概率
离散型随机变量的概率分布
(0—1分布实例)
【例】已知一批产品的次品率为p=,合格
率为q=1-p==。并指定废品用1表示,
合格品用0表示。则任取一件为废品或合格品这
一离散型随机变量,其概率分布为
X = xi 0 1
P(X=xi)=pi .5.5
11
11 xx
PP((xx))
离散型随机变量的概率分布
(均匀分布)
1. 一个离散型随机变量取各个值的概率相同
2. 列出随机变量取值及其取值的概率
3. 例如,投掷一枚骰子,出现的点数及其出
现各点的概率
离散型随机变量的概率分布
(均匀分布实例)
【例】投掷一枚骰子,出现的点数是个离散型
随机变量,其概率分布为
X = xi 1 2 3 4 5 6
P(X=xi)=pi 1/6 1/6 1/6 1/6 1/6 1/6
1/61/6
PP((xx))
11 xx22 33 44 55 66
离散型随机变量的数学期望
1. 在离散型随机变量X的一切可能取值的完备
组中,各可能取值xi与其取相对应的概率pi乘
积之和
2. 描述离散型随机变量取值的集中程度
3. 计算公式为
离散型随机变量的方差
1. 随机变量X的每一个取值与期望值的离差平方
和的数学期望,记为D(X)
2. 描述离散型随机变量取值的分散程度
3. 计算公式为
离散型随机变量的方差
(实例)
【【例例】】投投掷掷一一枚枚骰骰子子,,出出现现的的点点数数是是个个离离散散型型随随机机
变量,其概率分布为如下。计算数学期望和方差变量,其概率分布为如下。计算数学期望和方差
X = xi 1 2 3 4 5 6
P(X =xi)=pi 1/6 1/6 1/6 1/6 1/6 1/6
解:解:数学期望为数学期望为:
方差为:方差为:
常见的离散型概率分布
超几何分布
离散型随机变
量的概率分布
泊松分布二项分布
连续型随机变量的概率
分布
连续型随机变量的概率分布
指数分布
连续型随机变
量的概率分布
正态分布均匀分布 其他分布
连续型随机变量的概率分布
1. 连续型随机变量可以取某一区间或整个
实数轴上的任意一个值
2. 它取任何一个特定的值的概率都等于0
3. 不能列出每一个值及其相应的概率
4. 通常研究它取某一区间值的概率
5. 用数学函数的形式和分布函数的形式来
描述
概率密度函数
1. 设X为一连续型随机变量,x 为任意实数,
X的概率密度函数记为f(x),它满足条件
2. f(x)不是概率
概率密度函数
• 密度函数 f(x)表示X 的所有取值 x 及其频
数f(x)
值值
((值值, , 频数频数))频数频数
ff((xx))
aa bb
xx
概率密度函数
• 在平面直角坐标系中画出f(x)的图形,则对于任
何实数 x1 < x2,P(x1< X x2)是该曲线下从x1 到 x2的面
积
f(x)
xa b
概率是曲线下的面积概率是曲线下的面积
分布函数
1. 连续型随机变量的概率也可以用分布函数
F(x)来表示
2. 分布函数定义为
3. 根据分布函数,P(a<X<b)可以写为
分布函数与密度函数的图示
1. 密度函数曲线下的面积等于1
2. 分布函数是曲线下小于 x0 的面积
f(x)
x
x0
F F ( ( xx00 ))
连续型随机变量的期望和
方差
1. 连续型随机变量的数学期望为
2. 方差为
正态分布
正态分布的重要性
• 1. 描述连续型随机变量的最重要的分布
• 2. 可用于近似离散型随机变量的分布
– 例如: 二项分布
• 3. 经典统计推断的基础
xx
f f ((xx))
概率密度函数
•f(x) = 随机变量 X 的频数
• = 总体方差
• =; e =
•x = 随机变量的取值 (- < x < )
• = 总体均值
正态分布函数的性质
1. 概率密度函数在x 的上方,即f (x)>0
2. 正态曲线的最高点在均值,它也是分布的中位数和众数
3. 正态分布是一个分布族,每一特定正态分布通过均值的
标准差来区分。 决定曲线的高度,决定曲线的平缓
程度,即宽度
4. 曲线f(x)相对于均值对称,尾端向两个方向无限延伸,
且理论上永远不会与横轴相交
5. 正态曲线下的总面积等于1
6. 随机变量的概率由曲线下的面积给出
和 对正态曲线的影响
x
f(x)
CA
B
正态分布的概率
概率是曲线下的概率是曲线下的面积面积!!
aa bb
xx
ff((xx))
标准正态分布的重要性
1. 一般的正态分布取决于均值和标准差
2. 计算概率时 ,每一个正态分布都需要有
自己的正态概率分布表,这种表格是无穷
多的
3. 若能将一般的正态分布转化为标准正态分
布,计算概率时只需要查一张表
标准正态分布函数
2. 标准正态分布的概率密度函数标准正态分布的概率密度函数
1. 任何一个一般的正态分布,可通过下面的线性
变换转化为标准正态分布
3. 标准正态分布的分布函数标准正态分布的分布函数
标准正态分布
x
一般正态分布一般正态分布
1
Z
标准正态分布标准正态分布
标准正态分布表的使用
1. 将一个一般的转换为标准正态分布
2. 计算概率时 ,查标准正态概率分布表
3. 对于负的 x ,可由 (-x) x得到
4. 对于标准正态分布,即X~N(0,1),有
– P (a X b) b a
– P (|X| a) 2 a 1
5. 对于一般正态分布,即X~N( , ),有
标准化的例子
P(5 X )
x 5
1
一般正态分布一般正态分布
1
Z
标准正态分布标准正态分布
.
标准化的例子
P( X )
一般正态分布一般正态分布
.
.
标准正态分布标准正态分布
正态分布
(实例)
【例】【例】设设XX~~NN(5(5,,3322)),求以下概率,求以下概率
(1) (1) PP((XX 10) 10) ;; (2) (2) PP(2<(2<XX <10<10) )
解解:: (1) (1)
(2)(2)
为什么概率是近似的
.0
.1
.2
.3
0 2 4 6 8 10
x
P(x) 正态曲线增加的概率正态曲线增加的概率
正态曲线减少的概率正态曲线减少的概率
二项概率:矩形的面积二项概率:矩形的面积 正态概率:曲线下正态概率:曲线下
从从到到的面积的面积
增加的部分与减少增加的部分与减少
的部分不一定相等的部分不一定相等
总体、个体和样本
(概念要点)
总体(Population):调查研究的事物或现象的
全体
个体(Item unit):组成总体的每个元素
样本(Sample):从总体中所抽取的部分个体
样本容量(Sample size):样本中所含个体的数
量
抽样方法
(概念要点)
1. 概率抽样:根据已知的概率选取样本
简单随机抽样:完全随机地抽选样本
分层抽样:总体分成不同的“层”,然后在每一层内进
行抽样
整群抽样:将一组被调查者(群)作为一个抽样单位
等距抽样:在样本框中每隔一定距离抽选一个被调查者
2. 非概率抽样:不是完全按随机原则选取样本
非随机抽样:由调查人员自由选取被调查者
判断抽样:通过某些条件过滤来选择被调查者
3. 配额抽样:选择一群特定数目、满足特定条件的被调
查者
1. 所有样本指标(如均值、比例、方差等)
所形成的分布称为抽样分布
2. 是一种理论概率分布
3. 随机变量是 样本统计量
– 样本均值, 样本比例等
4. 结果来自容量相同的所有可能样本
抽样分布
(概念要点)
样本均值的抽样分布
(一个例子)
【【例例】】设设一一个个总总体体,,含含有有44个个元元素素((个个体体)),,即即总总体体单单
位位数数NN=4=4。。4 4 个个个个体体分分别别为为XX11=1=1、、XX22=2=2、、XX33=3 =3 、、XX44=4 =4
。总体的均值、方差及分布如下。总体的均值、方差及分布如下
均值和方差均值和方差 总体分布总体分布
11 4422 33
00
.
..
22
.
样本均值的抽样分布
(一个例子)
现现从从总总体体中中抽抽取取nn==22的的简简单单随随机机样样本本,,在在重重复复
抽抽样样条条件件下下,,共共有有4422=16=16个个样样本本。。所所有有样样本本的的结结果果
如下表如下表
3,43,33,23,13
2,42,32,22,12
4,44,34,24,14
1,4
4
1,3
321
1,21,11
第二个观察值第一个
观察值
所有可能的n = 2 的样本(共16个)
样本均值的抽样分布
(一个例子)
计算出各样本的均值,如下表。并给出样本均
值的抽样分布
4
321
第二个观察值第一个
观察值
16个样本的均值(x)
样本均值的抽样分布样本均值的抽样分布
00
.
.
. P P ( ( x x ))
xx
所有样本均值的均值和方差
式中:式中:MM为样本数目为样本数目
比较及结论:比较及结论:1. 1. 样本均值的均值(数学期望)等于总体均值样本均值的均值(数学期望)等于总体均值
2. 2. 样本均值的方差等于总体方差的样本均值的方差等于总体方差的1/1/nn
样本均值的分布与总体分布的比
较
抽样分布抽样分布
=
σ2 =
总体分布总体分布
11 4422 33
00
.
.
.
P P ( ( x x ))
00
.
.
.
xx
样本均值的抽样分布
与中心极限定理
= 50= 50
=10=10
XX
总体分布总体分布
nn = 4 = 4
抽样分布抽样分布
X
nn =16 =16
当当总总体体服服从从正正态态分分布布N N ~ ~ ((μμ,,σσ2 2 ))时时,,来来自自该该总总体体的的所所
有有容容量量为为nn的的样样本本的的均均值值XX也也服服从从正正态态分分布布,,XX 的的
数学期望为数学期望为μμ,方差为,方差为σσ22//nn。即。即XX~~NN((μμ,,σσ22//nn))
中心极限定理
(图示)
当样本容量足够当样本容量足够
大时大时((nn 30) 30) ,,
样本均值的抽样样本均值的抽样
分布逐渐趋于正分布逐渐趋于正
态分布态分布
中中心心极极限限定定理理::设设从从均均值值为为,,方方差差为为 22的的一一个个任任意意总总
体体中中抽抽取取容容量量为为nn的的样样本本,,当当nn充充分分大大时时,,样样本本均均值值的的抽抽
样分布近似服从均值为样分布近似服从均值为μμ、方差为、方差为σσ22//nn的正态分布的正态分布
一个任意分一个任意分
布的总体布的总体
XX
样本方差的抽样分布
样本方差的分布
设总体服从正态分布N ~ (μ,σ2 ), X1,X2,
…,Xn为来自该正态总体的样本,则样本方
差 s22 的分布为
将2(n – 1)称为自由度为(n-1)的卡方分布
卡方 (c2) 分布
选择容量为n 的
简单随机样本
计算样本方差S2
计算卡方值
2 = (n-1)S2/σ2
计算出所有的
2值
不同容量样本的抽样分布不同容量样本的抽样分布
cc22
nn=1=1
nn=4=4
nn=10=10
nn=20=20
总体
均值的标准误
1. 所有可能的样本均值的标准差,测度所
有样本均值的离散程度
2. 小于总体标准差
3. 计算公式为
第二节 参数估计基本方法
一. 点估计
二. 点估计的优良性准则
三. 区间估计
参数估计的方法
矩估计法矩估计法
最小二乘法最小二乘法
最大似然法最大似然法
顺序统计量法顺序统计量法
估 计 方 法
点 估 计 区间估计
被估计的总体参数
总体参数 符号表示
用于估计的
样本统计量
一个总体
均值
比例
方差
两个总体
均值之差
比例之差
方差比
点 估 计
点估计
(概念要点)
1. 从总体中抽取一个样本,根据该样本的统计
量对总体的未知参数作出一个数值点的估计
例如: 用样本均值作为总体未知均值的估计值
就是一个点估计
• 2. 点估计没有给出估计值接近总体未
知参数程度的信息
3. 点估计的方法有矩估计法、顺序统计量法、
最大似然法、最小二乘法等
• 1. 用于估计总体某一参数的随机变量
– 如样本均值,样本比例、样本中位数等
– 例如: 样本均值就是总体均值的一个估计量
– 如果样本均值 x = 3 ,则 3 就是 的估计值
2. 理论基础是抽样分布
估计量
(概念要点)
二战中的点估计二战中的点估计
C:%5CDocuments%20and%20Settings%5CAdministrator%5C%E6%A1%8C%E9%9D%A2%5C(6)%E5%BE%B7%E5%86%9B%E6%9C%89%E5%A4%9A%E5%B0%91%E8%BE%86%E5%9D%A6%E5%85%
C:%5CDocuments%20and%20Settings%5CAdministrator%5C%E6%A1%8C%E9%9D%A2%5C(6)%E5%BE%B7%E5%86%9B%E6%9C%89%E5%A4%9A%E5%B0%91%E8%BE%86%E5%9D%A6%E5%85%
估计量的优良性准则
(无偏性)
• 无偏性:估计量的数学期望等于被估计的总体
• 参数
PP( ( X X ))
XX
CA
无偏无偏 有偏有偏
估计量的优良性准则
(有效性)
A
B
中位数的抽样分布中位数的抽样分布
均值的抽样分布均值的抽样分布
XX
PP((X X ))
有效性:有效性:一个方差较小的无偏估计量称为一个更一个方差较小的无偏估计量称为一个更
有效的估计量。如,与其他估计量相比有效的估计量。如,与其他估计量相比
,样本均值是一个更有效的估计量,样本均值是一个更有效的估计量
估计量的优良性准则
(一致性)
• 一致性:随着样本容量的增大,估计量越来越
接
• 近被估计的总体参数
A
B
较小的样本容量较小的样本容量
较大的样本容量较大的样本容量
PP((X X ))
XX
区间估计
区间估计
(概念要点)
• 1.根据一个样本的观察值给出总体参数的估计范
围
2. 给出总体参数落在这一区间的概率
3. 例如: 总体均值落在50~70之间,置信度为 95%样本统计量样本统计量
((点估计点估计))置信区间置信区间
置信下限置信下限 置信上限置信上限
置信区间估计
(内容)
2已知 2未知
均 值 方 差比 例
置 信 区 间
落在总体均值某一区间内的样
本
x
_
X
X = Zx
95% 95% 的样本的样本
xx ++xx
99% 99% 的样本的样本
- - xx + +
90%90%的样本的样本
xx ++xx
1. 总体未知参数落在区间内的概率
2. 表示为 (1 -
– 为显著性水平,是总体参数未在区间内
的概率
3. 常用的显著性水平值有 99%, 95%, 90%
– 相应的为,,0.0
置信水平
区间与置信水平
均值的抽样分布均值的抽样分布
(1 - (1 - ) % ) % 区间包含了区间包含了
% % 的区间未包含的区间未包含
1 - 1 - //22//22
影响区间宽度的因素
• 1. 数据的离散程度,用来测度
2. 样本容量,
3. 3. 置信水平 (1 - ),影响 Z 的大小
第三节 总体均值和总体比例
的区间估计
一. 总体均值的区间估计
二. 总体比例的区间估计
三. 样本容量的确定
总体均值的区间估计
(2已知)
总体均值的置信区间
(2 已知)
• 1.假定条件
– 总体服从正态分布,且总体方差(2)已知
– 如果不是正态分布,可以由正态分布来近似 (n 30)
2. 使用正态分布统计量Z
3. 总体均值总体均值 在在1-1-置信水平下的置信水平下的置信区间为置信区间为
总体均值的区间估计
(正态总体:实例)
解解 :: 已已 知知 XX ~~NN((,, )),, xx== , ,
nn=9, 1-=9, 1- = = ,,ZZ/2/2==
总体均值总体均值的置信区间为的置信区间为
我我们们可可以以9595%%的的概概率率保保证证该该种种零零件件的的平平
均长度在均长度在~~ mm之间之间
【【例例】】某某种种零零件件
长长度度服服从从正正态态分分
布布,,从从该该批批产产品品
中中随随机机抽抽取取99件件,,
测测得得其其平平均均长长度度
为为 mmmm。。已已
知知总总体体标标准准差差
=0=0..1515mmmm,,试试建建
立立该该种种零零件件平平均均
长长度度的的置置信信区区间间,,
给给定定置置信信水水平平为为
。。
总体均值的区间估计
(非正态总体:实例)
解解::已已知知 xx==26, 26, =6=6,,nn=100, =100, 1-1- = =
,,ZZ/2/2==
我我们们可可以以9595%%的的概概率率保保证证平平均均每每天天
参参加加锻锻炼炼的的时时间间在在~~
分钟之间分钟之间
【【例例】】某某大大学学从从该该
校校学学生生中中随随机机抽抽取取
100100人人,,调调查查到到他他
们们平平均均每每天天参参加加体体
育育锻锻炼炼的的时时间间为为2626
分分钟钟。。试试以以9595%%的的
置置信信水水平平估估计计该该大大
学学全全体体学学生生平平均均每每
天天参参加加体体育育锻锻炼炼的的
时时间间((已已知知总总体体方方
差为差为3636小时)。小时)。
总体均值的区间估计
(2未知)
总体均值的置信区间
(2 未知)
• 1.假定条件
– 总体方差(2)未知
– 总体必须服从正态分布
2. 使用 t 分布统计量
3. 3. 总体均值总体均值 在在1-1-置信水平下的置信水平下的置信区间为置信区间为
总体均值的区间估计
(实例)
解解::已已知知XX~~NN((,,22)),,xx==50, 50, ss=8=8
,, nn=25, =25, 1-1- = = ,, tt/2/2==
。。
我我们们可可以以9595%%的的概概率率保保证证总总体体均均值值
在在~~ 之间之间
【【例例】】从从一一个个
正正态态总总体体中中抽抽
取取一一个个随随机机样样
本本,, nn = = 2525
,,其其均均值值xx ==
5050 ,,标标准准差差
ss = = 88。。 建建立立
总总体体均均值值 的的
95%95%的的置置信信区区
间。间。
总体比例的区间估计
总体比例的置信区间
• 1.假定条件
– 两类结果
– 总体服从二项分布
– 可以由正态分布来近似
2. 使用正态分布统计量Z
3. 3. 总体比例总体比例PP 的置信区间为的置信区间为
总体比例的置信区间
(实例)
解解::已已知知 nn=200 =200 ,, == , , n n ==140140>>55, , nn
(1- )=60>5(1- )=60>5,,= = ,,ZZ/2/2==
pp
pp
pp
我我们们可可以以9595%%的的概概率率保保证证该该企企业业职职
工工由由于于同同管管理理人人员员不不能能融融洽洽相相处处而而
离开的比例在离开的比例在%~%%~%之间之间
【【例例】】某某企企业业在在一一项项
关关于于职职工工流流动动原原因因的的
研研究究中中,,从从该该企企业业前前
职职工工的的总总体体中中随随机机选选
取取了了200200人人组组成成一一个个
样样本本。。在在对对其其进进行行访访
问问时时,,有有140140人人说说他他
们们离离开开该该企企业业是是由由于于
同同管管理理人人员员不不能能融融洽洽
相相处处。。试试对对由由于于这这种种
原原因因而而离离开开该该企企业业的的
人人员员的的真真正正比比例例构构造造
95%95%的置信区间。的置信区间。
样本容量的确定
1. 根据均值区间估计公式可得样本容量n为
估计总体均值时样本容量的确
定
2. 样本容量n与总体方差2、允许误差、可
靠性系数Z之间的关系为
与总体方差成正比与总体方差成正比
与允许误差成反比与允许误差成反比
与可靠性系数成正比与可靠性系数成正比
其中:
样本容量的确定
(实例)
解解 ::已已 知知 22=1800000=1800000,, ==,,
ZZ/2/2==,,=500=500
应抽取的样本容量应抽取的样本容量为为
【【例例】】一一家家广广告告公公
想想估估计计某某类类商商店店去去
年年所所花花的的平平均均广广告告
费费用用有有多多少少。。经经验验
表表明明,,总总体体方方差差约约
为为 18000001800000元元 。。 如如
置置信信度度取取 95%95%,,并并
要要使使估估计计处处在在总总体体
平平均均值值附附近近500500元元的的
范范围围内内,,这这家家广广告告
公公司司应应抽抽多多大大的的样样
本?本?
1. 根据比例区间估计公式可得样本容量n为
估计总体比例时样本容量的确
定
2. 若总体比例若总体比例PP未知时,可用样本比例未知时,可用样本比例 来代替来代替 pp̂̂
其中:
样本容量的确定
(实例)
•【例】一家市场
调研公司想估计
某地区有彩色电
视机的家庭所占
的比例。该公司
希望对比例p的估
计 误 差 不 超 过
,要求的可
靠程度为95%,
应抽多大容量的
样本(没有可利
用的p估计值)。
解解 :: 已已知知==,,==,,ZZ/2/2==,,
当当pp未知时用最大方差未知时用最大方差代替代替^
应抽取的样本容量应抽取的样本容量为为
抽样设计
类型抽样(分类抽样)
先对总体各单位按一定标志加以
分类(层),然后再从各类(层)中按随
机原则抽取样本,组成一个总的样本。
类型的划分:
一是必须有清楚的划类界限;
二是必须知道各类中的单位数目和比例;
三是分类型的数目不宜太多。
类型抽样(分类抽样)
类型抽样的优点是:
样本代表性高、抽样误差小、抽样调查
成本较低。如果抽样误差的要求相同的话则
抽样数目可以减少。
类型抽样(分类抽样)
两种类型:
1.等比例类型抽样(类型比例抽样);
2.不等比例类型抽样(类型适宜抽样)。
类型抽样(分类抽样)
类型抽样
重
复
抽
样
:
不重复抽样:
类型抽样(分类抽样)
整群抽样
整群抽样即从全及总体中成群地抽取样本单
位,对抽中的群内的所有单位都进行观察。
整群抽样的好处:组织工作比较简单方
便,适用于一些特殊的研究对象。其不足之处
是,一般比其它抽样方式的抽样误差大。
1.若按无关标志排
队
公式用以上纯随机抽样的公式,一般采用
不重复抽样公式:
整群抽样
2. 若按有关标志排队
公式用类型抽样的公式:
整群抽样
六、整群抽样的抽样平均误差
整群抽样的抽样平均误差受三个因素影响:
(1)抽出的群数(r)多少 (反比关系)
(2)群间方差( ) (正比关系)
整群抽样
计算方法如下:
整群抽样
(3) 抽样方法
整群抽样
假如某一机器大量生产某一种零件,现每隔一小时抽取5分钟
产品进行检验,用以检查产品的合格率,检查结果如下:
合格率 群数r pi pir
80% 2
85% 4
90% 12 …(太小不计
)
95% 3
98% 3
合计 24 - -
例
整群抽样
多阶段抽样
即把抽样本单位的过程分为两个或几个阶段来进
行。
(如果一次就直接抽选出具体样本单位,这叫单阶段
抽样)具体讲: ①先抽大单位(可以用类型抽样或机
械抽样), ②再在大单位中抽小单位(可用整群抽样
或简单随机抽),③小单位中再抽更小的单位;而不
是一次就直接抽取基层的调查单位。
多阶段抽样的抽样平均误差
以两阶段抽样为例
设总体分R组,每组包含 个单位,若各组
相等,则
在抽样第一阶段,从R组中抽出r组;
在抽样第二阶段,在中选的r组中随机抽选 个
单位,若各组m相等,则n=rm
多阶段抽样
则:在重复抽样下
在不重复抽样下
多阶段抽样
设某大学在学期初对学生进行体重抽样调查,先
从全校80个班以不重复抽样方法随机抽取8个班,然
后再从抽取的班中再分别抽取10个人作为第二阶段抽
样单位。计算所得的抽样平均体重为千克,抽样
各班内方差平均数 为50,各班之间体重方差 为
22。
假设全校各班均为40人。试以%(t=2)的概
率,推断该校学生平均体重的范围。
多阶段抽样
例:
已知:
解:
多阶段抽样
以上抽样平均误差的公式归纳如
下:
多阶段抽样
结 束