概率与正态曲线
1.研究随机性和规律性的两个例子
1)20世纪50年代,小儿麻痹症育苗的研究。
实验组
(疫苗)
20
万
56
对照组
(安慰
剂)
20
万
138
问题是:56和138之间的差别是否超过了随
机性所能解释的范围。
2)1970,美国越战的征兵
1 183 36630593
1/71/1 14/98/6 31/12
100
11
0
73
问题是:73和110之间的差别是否超过了随机性
所能解释的范围。
思考题
拧松水龙头,让其刚好到只有水滴下来,计算
并记录15分钟内每个20秒里的水滴数。利用你
的数据,请说出该水滴在什么方面是随机的?
什么方面又是有规律的?
1)随机性和规律性是统计学的两个重要概念。规律
性本身包含着随机性。统计可以定义为在随机性中寻
找规律性,当两种规律之间的差异超出了随机性本身
的影响(或者解释范围),变化趋势就发生了。
2)概率为我们从数据中得出结论提供了基础,统计
学家利用概率判断数据间的差异是否超出了随机性本
身的影响。
3)统计很少对总体进行直接的研究,都是通过对具
有代表性的样本的研究,来对总体的信息进行推断。
一、概率论发展简史
1. 概率论的起源
Pascal(1623~
1662)
Fermat, (1601-
1665)
1654年,赌
金分配问题
赌金分配问题
梅雷说:有一次他与某赌友(代称为A先生)掷骰
子时,各押32个金币为赌注,双方约定如果谁先
赢得3局,就可以把赌金全部拿走,但因为梅雷
临时有事,所以赌局不得不中途中断。此时梅雷
已经赢得2局,而A先生只赢1局,如何公平分配
赌金??
起点
费马:
情况 1 2 3 4
胜者 梅雷、梅雷 梅雷、A A、梅雷 A、A
帕斯卡尔:
1655年,荷兰数学家惠更斯 (Christopher
Huygens) 访问巴黎时,了解到帕斯卡尔与费马
的通信研究,对这类问题产生兴趣,后来,他撰
写《骰子游戏》(Dice Game, 1657) 来探讨机率
问题的原理,其中包含许多习题,被许多人认为
是机率史上第一本教科书。提出了期望的概念。
1713年,瑞士数学家伯努利(Jacob Bernoulli
,1654— 1705)出版了《猜度术》一书,提出
了大数定理 。
1765年,法国数学家棣莫弗(,1667
—1754)的《机会的学说》一书出版,1733年就
发现了正态曲线,以及论述了不存在运气。
1933年,俄罗斯数学家科尔莫戈罗夫(1903—
1987)以德文出版的经典性著作《概率论基础》,
标志着概率论的公理化完成,这就是我们现在看
到的概率论的情形。
2. 概率论专有名词
随机实验(Random trial):满足如下三个条件就可以称
之为随机实验:(1)在同一条件下可无限次重复;
(2)实验结果有多个,且不确定;(3)事前不知实验
结果(outcome)。抛硬币
基本事件(Elementary event):一次随机实验的可能结
果,称为基本事件或者基本随机事件。
若随机实验E是“抛两次硬币”,其基本事件就是“+、
—”,“+、+”,“—,—”,“—,+”。
样本空间(Sample space):所有基本事件所组成的集合,
称为样本空间或基本空间。
接上例,其样本空间就是集合{“+、—”,“+、+”,
“—,—”,“—,+”}。
随机事件(Random event):
简称事件,指一些由基本事件所组成的集合。
例如,接上例,事件“两次出现相同面”,就有两个
基本事件组成:+、+”,“—,—”。
不相容事件(Mutually exclusive events):
在随机试验中,不能同时发生或其交集为空集的几
个事件,称为不相容事件。反之为相容事件
接上例,事件“两次同时出现正面”和“两次同时出
现反面” 就是不相容事件。“至少出现一次正面”和
“至少出现反面”就是两个相容事件
3. 概率的含义
概率(Probability)是一个0到
1之间的数,描述了一个事件
发生的经常程度。小概率(接
近于0)的事件很少发生,而
大概率(接近于1)的事件则
经常发生。
概率对统计的意义:对于统计,
概率告诉我们,在样本数据的
基础上,如果试验重复多次,
各种结果发生的经常程度是多
大。
.5
0
1
不可能
必然
4.获得概率的基本方法
利用机会均等法则(Equality likely
approach)
使用相对频次(Relative frequency)的方
法
利用主观概率(Subjective approach)
利用机会均等法则
如果试验有n种可能的结果,使某特定事件出
现的结果数量为k,那么(k/n)就是出现该事
件的概率。
思考题:一副扑克52张(大、小王去掉),洗均匀,
随机取一张牌,那么该张牌是梅花的概率是多少?
k n
要注意两点:
(1)分清楚你求解问题中什么是你的n,什么
是你的k。
(2) 其实我们在这样做的时候,就已经接受
了两个前提假设:a)实验的可能结果是已
知的;b)由于对称性,每一个结果的可能
性都是相同的。往往这两个前提假设不一
定满足.
思考题
再求以下问题的概率中,以上的哪个前提假设
不满足:
1)一场赛马比赛,有6匹马,求某一匹马胜
出的概率。
2)求解生男孩和女孩的概率
1——4讲小结
一、霍桑实验中的群体实验
这个实验的目的就是要看看,当每个工人的工
作情况不但与自己的报酬、而且与同伴的报酬
紧密关联时,工人会如何办?怎样协作?
实验条件:
(1)人员:14名男职工,其中9名绕线工,
3名是焊接工,2名检验工;
(2)计件工作制度,但却不是按个人的产
量计酬,而是按集体的总产量计酬;报酬
由厂方直接支付给个人,而不是交由小组
自行分配。这样,工人完成的工作数额,
不但决定着自己的工资,而且直接影响着
一起干活的同事们的收入。。
实验结果:工人每天只完成了6000~
6600个焊接点(标准每个工人应该完成
7312个焊接点),且天天如此。为什么
?
解释1:可能是这些工人的智力或者动作协调
性有问题。
再做研究,研究测试结果否定了这一解释。
合理的解释:
工人们自动限制产量的理由是,如果他们过分努
力地工作,就可能造成群体内同伴的失业,或者
公司会制定出更高的生产定额来。所以群体会迫
使其中的个体进行一致限产。也就是工人会受到
非正式组织的影响。
证实在工人当中存在着一种非正式的组织,而且
这种非正式的组织对工人的生产率有着极其重要
的影响
总结一下该研究的研究过程
不支持
支持
提出假设 数 据 分
析
假设成为一
种假说,进
而为理论
数据支持假设么
?
理论研究(产生方式)2
通过实验或
其他方式收
集数据
二、变量(variable)
变量简单的说就是事物的特征或者属性。
研究者在研究项目开始的时候,就要确定他们所
要研究的变量是什么。
变量的值(value)通常是对某一个特定单位的
度量,这种单位常常被视为一个个体
(element)。什么是个体取决于你的研究问题。
2-1 变量的测量层次
1)思考题:请回答以下收集到的数据,可以进行“<、
>”,“+、—” ,“*,/”中的哪些运算?
(1)五个人的性别:1,0,0,1,1(1:男性;0:女
性)
(2)五个人的身高:170,173,165,180,161(单位:
厘米)
(3)七天的气温(摄氏温度℃):15,24,27,18,
34,30,19。
(4)五个人对一项政策满意程度的评分:
5,3,3,4,2
(1:十分不满意;2:不满意;3:一般或中立;4:满意;
5:十分满意)
2)思考题:
(1)我们用一个量表测量人们对一项法律的态度,
如果1表示不赞成,2表示无所谓,3表示赞成,对于
3个人我们测得的值分别为:3、1、2,这些数据为
_____数据。
(2)测量10个大学生所在的年级,如果用1表示大
一、2表示大二、3表示大三、4表示大四、5表示其
他。测量的值为:1、3、4、1、2、3、2、1、1、4
,这些数据为________数据。
(3)测得5个人的第一次结婚年龄(单位:周岁)
为:20、22、24、30和26,这些数据为_____数据。
三、频数分布数列
1.统计分组后,每个组分配的总体单位数称为
频数或次数(f)。
频数/总体单位总数=频率。
2.意义
整理了杂乱无章的数据,同时显示出一批数的
分布情况,是数理统计学中随机变量及其概
论分布概念在实际中的应用。
例1
家庭所拥有的电视机数对于广告行业来说是一
个重要的信息,下面的数据是随机抽取的50户
家庭中每个家庭所拥有的电视机数。
1 1 1 2 6 3 3 4 2 4 3 2 1 5 2 1 3 6 2 2 3 1 1 4
3 2 2 2 2 3 0 3 1 2 1 2 3 1 1 3 3 2 1 1 3 1 5 1
你能从中发现什么?
电视机数 频次 频率
0 1
1 16
2 14
3 12
4 3
5 2
6 2
思考题:
(1)如果要让你去获取你所在楼层的家
庭拥有的电视机数量的分布,你怎么去
获取??
(2)如果要让你去获取广州市家庭拥有
的电视机数量的分布,你怎么去获取?
?
四、集中趋势分析
集中趋势是数据分布的中心,描述集中趋势的指标有算
术平均数( )、几何平均数( )、中位
数( )、众数( )等。
众数
中位数
平均数平均数
位置平均数位置平均数
数值平均数数值平均数
算术平均数算术平均数
调和平均数调和平均数
几何平均数几何平均数
1.平均数的分类
2.算术平均数的计算公式
算术平均数
1.简单算术平均数: 假定变量假定变量XX有有NN个观察值:个观察值:XX11,,XX22,,
XX33,,…X…XNN,那么它的平均数,那么它的平均数 的计算公式是:的计算公式是:
2.加权算术平均数:
例1:应用条件:资料未分组,各组出现的次数都是
1。5名学生的学习成绩分别为:75、91、64、53、
82。则平均成绩为:
=73(分)
例2:某车间20名工人加工某种零件资料:
按日产量分组(件)x 工人数(人)f 日产总量 xf
14 2 28
15 4 60
16 8 128
17 5 85
18 1 18
合计 20 319
= 16(件)
1)概念
调和平均数是变量值倒数的
算术平均数的倒数,故又称
倒数平均数。
调和平均数是算术平均数的
一种,它是根据变量值的倒
数计算的。
3.调和平均数及计算公式
原来只是计算原来只是计算
时使用了不同时使用了不同
的数据!的数据!
(1)简单调和平均数
2)调和平均数的计算公式
某日三种蔬菜的销售数据某日三种蔬菜的销售数据
蔬菜蔬菜
名称名称
平均价格平均价格((元元
/kg)/kg)
xxii
销售额销售额((元元) )
mmii
销售量销售量((公斤公斤))
xxii /m /mii
甲
乙
丙
18000
12500
6400
15000
25000
8000
合计 — 36900 48000
例例.某某蔬蔬菜菜市市场场三三种种蔬蔬菜菜的的日日销销售售数数据据如如表表,,计计算算三三
种蔬菜该日的平均价格。种蔬菜该日的平均价格。
(2)加权调和平均数
例例.设某公司下属三个部门的销售资料如下表,设某公司下属三个部门的销售资料如下表,若缺若缺
少销售额资料而有利润额资料,如下表少销售额资料而有利润额资料,如下表
某公司下属三个部门销售情况某公司下属三个部门销售情况
部 门部 门
销售利润率销售利润率
((%%))
利润额(万元)利润额(万元)
xx mm
AA
BB
CC
1212
1010
77
120120
200200
105105
合 计合 计 -- 425425
则三个部门的平均利润率可以用各部门利润
额除以销售利润率得到销售额,然后用各部
门利润之和除以总销售额,便可得到平均利
润率。其计算公式:
【例3】水果甲级每元1公斤,乙级每元公斤,
丙级每元2公斤。问:
(1)若各买1公斤,平均每元可买多少公斤?
(2)各买公斤,平均每元可买多少公斤?
(3)甲级3公斤,乙级2公斤,丙级1公斤,平
均每元可买多少公斤?
(4)甲乙丙三级各买1元,每元可买几公斤?
【例4】自行车赛时速:甲30公里/小时,乙28
公里/小时,丙20公里/小时,全程200公里,
问三人平均时速是多少?若甲乙丙三人各骑车
2小时,平均时速是多少?
调和平均数 (例题分析)
【例3】解
(1)
(2)
【例3】解
(3)
(4)
【例4】解
4. 几何平均数的计算公式
几何平均数
1.简单几何平均数: =
2.加权几何平均数: =
例:1.某产品经过三个流水连续作业的车间
加工生产而成,本月第一车间的产品合格率
为90%,第二车间的产品合格率为80%,第
三车间的产品合格率为70%。则全厂的总合
格率为:
这样平均合格率为
例2:设某笔为期20年的投资按复利计算收益,前10
年的年利率为10%,中间5年的利率为8%,最后5年
的年利率为6%。求平均年利率。
解答:假设初始投资额为a,则20年后的本利和为A。
则
A=a(1+10%)10(1+8%)5(1+6%)5
所谓的平均年利率,设为r,就是要使得a(1+r)20=A,
即a(1+r)20= a(1+10%)10(1+8%)5(1+6%)5
几何平均数、算术平均数和调和平均数的关系几何平均数、算术平均数和调和平均数的关系
几何平均数、算术平均数和调和平均数之间存在着几何平均数、算术平均数和调和平均数之间存在着
一定的数量关系。这种数量关系表现在:一定的数量关系。这种数量关系表现在:根据同一根据同一
资料资料所计算的三种平均数,几何平均数大于调和平所计算的三种平均数,几何平均数大于调和平
均数而小于算术平均数,只有当所有变量值都相同均数而小于算术平均数,只有当所有变量值都相同
时,三种平均数才相等。用数学公式表示,它们之时,三种平均数才相等。用数学公式表示,它们之
间的关系为:间的关系为:
5.众数
1.众数的含义:总体中出现次数最多、频率最高的标志值。
2.确定众数的方法。
(1)单项数列确定众数
=21(件)
按日产量分组(件) 工人数(人)
20 15
21 30
22 20
23 10
众数的缺点
只考虑出現次数最多的资料,忽略了其他数值大
小,故较不具敏感性
除非知道全部的資料,否則我们无法由两组已知
众数,求出合并后的众数,故不适合代数运算。
众数不具存在唯一性,可能只有一个、可能不只
一个、也可能不存在
众数(不惟一性)
无众数
原始数据: 10 5 9 12 6 8
一个众数
原始数据: 6 5 9 8 5 5
多于一个众数
原始数据: 25 28 28 36 42 42
(2)由组距数列确定众数
下限公式:
上限公式:
6.中位数
1)概念
中位数是将总体各单位标志值按大小顺序排列
后,处于中间位置的那个数值。
2)意义
中位数是处于统计数列中间位置的数值。由于
其位置居中,不受极端数值大小的影响,因而
有时直接利用它来代表现象的一般水平。
例1:9个家庭的人均月收入数据
原始数据原始数据:: 1500 750 780 1080 850 1500 750 780 1080 850
960 2000 1250 1630960 2000 1250 1630
排排 序序:: 750 780 850 960 1080 750 780 850 960 1080
1250 1500 1630 20001250 1500 1630 2000
位位 置置:: 1 2 3 4 1 2 3 4 55 6 6
7 8 9 7 8 9
中位数 1080
例2:10个家庭的人均月收入数据
排排 序序:: 660660 750 780 850 960 1080 750 780 850 960 1080
1250 1500 1630 20001250 1500 1630 2000
位位 置置:: 1 2 3 4 1 2 3 4 5 65 6
7 8 9 10 7 8 9 10
3)由组距分组数列确定中位数
(1)确定“中位数组”。
向上累计次数等于
(2)假定中位数组内分布是均匀的,计算
出中位数来。
向
上
累
计
时
向下累计时
中位数计算公式
众数、中位数、平均数的特点和应用
众数众数
不受极端值影响不受极端值影响
具有不惟一性具有不惟一性
数据分布偏斜程度较大时应用数据分布偏斜程度较大时应用
中位数中位数
不受极端值影响不受极端值影响
数据分布偏斜程度较大时应用数据分布偏斜程度较大时应用
平均数平均数
易受极端值影响易受极端值影响
数学性质优良数学性质优良
数据对称分布或接近对称分布时应用数据对称分布或接近对称分布时应用
比较众数、中位数和算术平均数的相对
位置
>Me>Mo
<Me<Mo
=Me=Mo
•可以看出,对于单峰的分布,
对称态(正态分布):
左偏态:
右偏态:
比较众数、中位数和算术平均数的相对位置
众数、中位数和算术平均数的关系
在非对称分布时,算术平均数受极端值
的 影响最大,中位数只受极端值的位置
影响,不受其数值影响;众数不受极端
值的影响。
(1)当次数分布呈右偏(正偏)时,算术平
均数受极大值影响最大 。
(2)当次数分布呈左偏(负偏)时,算术平
均数受极小值影响最大 。
各种平均数的比较
(一)算术平均数、几何平均数和调和平均数
三者的关系。(证明略)
(二)数值平均数和位置平均数的比较
(1)数值平均数对于数据的概括能力比位置
平均数强。
(2)数值平均数和位置平均数对数据变化的
“灵敏度”“耐抗性”不同。
(3)数值平均数和位置平均数使用的数据类
型不同。
六、离散趋势分析
离中趋势是数据分布的又一特征,它表明变量值的差
异或离散程度。差异越大,平均数的代表性越差;反差异越大,平均数的代表性越差;反
之,越好。之,越好。
意义:
例:某车间有两个生产小组,都是某车间有两个生产小组,都是77名工人,各人日名工人,各人日
产件数:产件数:
甲组:甲组:2020,,4040,,6060,,7070,,8080,,100100,,120120;;
乙组:乙组:6767,,6868,,6969,,7070,,7171,,7272,, 73 73;;
甲、乙两组的平均每人日产量都为甲、乙两组的平均每人日产量都为7070件。件。
虽然两组平均日产量相等,但甲组各工人日产件数相差虽然两组平均日产量相等,但甲组各工人日产件数相差
很大,分布很散。很大,分布很散。
乙组各工人日产件数相差不大,分布相对集中。平均数乙组各工人日产件数相差不大,分布相对集中。平均数
7070件对甲组来说代表性不如对乙组的代表性大。件对甲组来说代表性不如对乙组的代表性大。
离散趋势测度经常用到的指标有:极差、四分位
差、方差与标准差、平均差、变异系数、偏态系
数。
1.极差:
例如:假定两组学生身高资料如下:(单位:
cm)
甲组:160,165,170,175,180。
乙组:168,169,170,171,172。
缺点:易受极端值的影响。
改进方法:计算四分位差。
2.四分位差
1.四分位差用数列中第3/4位次与1/4位次的变量值之
差除以2来表示。
2.意义:
——剔除了极端值,说明50%数据分布的范围;
——与中位数配合说明数据分布是否对称。
若分布对称,则Q2-Q1=Q3-Q2=(Q3-Q1)/2
若不相等,则是非对称的。
3.平均差
概念
总体中各单位对其平均数的离差绝对值的算术平
均数,通常用“.”表示。
意义
平均差能够综合反映总体中各单位标志值变动的影
响。平均差越大,表示标志变异程度越大,则平均数的平均差越大,表示标志变异程度越大,则平均数的
代表性就越小;反之,平均差越小,表示标志变异称度代表性就越小;反之,平均差越小,表示标志变异称度
越小,则平均数的代表性就越大。越小,则平均数的代表性就越大。
特点:
平均差是根据全部变量计算出来的,所以对整个变量平均差是根据全部变量计算出来的,所以对整个变量
值的离散程度有较充分的代表性。但平均差计算由于值的离散程度有较充分的代表性。但平均差计算由于
采用取离差绝对值的方法来消除正负离差,因而不适采用取离差绝对值的方法来消除正负离差,因而不适
合于代数方法的演算,使其应用受到限制合于代数方法的演算,使其应用受到限制。
计算公式:
((11)未分组资料:)未分组资料:
((22)分组资料:)分组资料:
例:假定某车间两个小组工人的月工资(元)资料
如下。
甲:800,900,1000,1100,1200。
乙:900,950,1000,1050,1100。
4.方差和标准差
概念
标准差又称标准差又称““均方差均方差””,是总体各样本标志值与其算,是总体各样本标志值与其算
术术
平均数的离差平方的算术平均数的算术平方根,通常平均数的离差平方的算术平均数的算术平方根,通常
用用“ ” “ ”“ ” “ ”表示。表示。
标准差的平方就是方差。
意义
其意义与平均差基本相同,也是根据各个标志值对其其意义与平均差基本相同,也是根据各个标志值对其
算术平均数求其平均离差后再来计算的,但是由于用算术平均数求其平均离差后再来计算的,但是由于用
离差平方的方法来消除正负离差,因此在数学处理长离差平方的方法来消除正负离差,因此在数学处理长
比平均差更为合理和优越。比平均差更为合理和优越。
4.方差与标准差:
方差:
未分组资料:
分组资料:
标准差
未分组资料:
分组资料:
例:假定某车间两个小组工人的月工资(元)资料如下。
甲:800,900,1000,1100,1200。
乙:900,950,1000,1050,1100。
5.变异系数与偏态系数
变异系数(标准差系数)
Pearson偏态系数以平均数与众数之差除以标准差来
衡量偏斜程度,用SK表示。其计算公式为:
当SK=0时, 呈对称分布; 当SK>0时, 分布是右偏
(正偏)的;当SK<0时, 分布是左偏(负偏)的。
SK是无量纲的量,取值通常在-3~+3之间,
其绝对值越大,表明偏斜程度越大。当分
布呈右偏态时,SK>0,故也称正偏态;当
分布为左偏态时,SK<0,故也称负偏态。
但除非是分组频数分布数据,否则SK公式
中的众数M
0
有很大的随易性。
例1:两种投资组合:甲、乙,表中是9笔过去半
年期投资报酬率,请问哪种投资组合的风险大
?
甲(%)9 17 2 6 19 10 4 13 8
乙(%)6 15 3 1 16 3 2 8 2
注意,两者的标准差相同:,但是
CV甲=%
CV乙=%
所以乙的风险较大。
例2:某地7岁男孩身高的均数为,标准
差为;体重均数为,标准差为
,比较其变异度?
七、抽样
统 计 量 参 数
样本容量:n 总体容量:N
样本平均数: 总体平均数:μ
样本比例: p 总体比例:P
样本标准差:s 总体标准差:σ
样本方差: S2 总体方差
:σ2
总体与样本
参数:
统计量
1.抽样基本概念
全及总体和样本总体
全及总体简称总体,是指根据研究的目的所确全及总体简称总体,是指根据研究的目的所确
定的研究事物的全体,也就是抽样调查所确定定的研究事物的全体,也就是抽样调查所确定
的调查对象,又叫母体,全及总体单位数一般的调查对象,又叫母体,全及总体单位数一般
用用NN表示表示..
样本总体简称样本,它是从全及总体中随机抽样本总体简称样本,它是从全及总体中随机抽
取出来的那部分单位组成的集合体,又叫子体。取出来的那部分单位组成的集合体,又叫子体。
样本总体的单位数一般用样本总体的单位数一般用nn表示表示..
1.抽样基本概念
根据全及总体计算的反映总体数量特征的指标称为全及指标,
又叫参数。常用的总体参数有总体平均数和总体标准差(或
总体方差)。
总体平均数: μ=
总体方差(或总体标准差):
σ=
1.抽样基本概念
样本指标是指根据样本总体计算的指标,又叫统计量。
样本平均数:
样本方差或样本标准差
S2 =
n-1为样本变量自由度
抽样平均数的平均误差例题:
某工厂有1500个工人,用简单随机重复抽
样的方法抽出50个工人作为样本,调查
其工资水平资料如下:
月平均工资
(元)
524 534 540 550 560 58
0
600 660
工人数
(个)
4 6 9 10 8 6 4 3
计算样本平均数和抽样平均误差
解:列表计算
x f xf
524 4 2096 1296 5184
534 6 3204 676 4056
540 9 4860 400 3600
550 10 5500 100 1000
560 8 4480 0 0
580 6 3480 400 2400
600 4 2400 1600 6400
660 3 1980 10000 30000
50 28000 52640
计算平均数即平均工资:
抽样调查的优点:
(1)经济性。
(2)时效性强。抽样调查可以迅速、及时地获
取到所需要的信息。
(3)准确性高。
抽样调查的一个原则: “确信锅里的汤被
搅拌均匀”。
2.抽样调查的方法
概率抽样(Probability sampling)
非概率抽样(Nonprobability sampling)
概率抽样
(Probability sampling)
1)简单随机抽样(simple random sampling)
就是等概率抽样,每个个体以相同的概率被抽中。这
也可以分为重复抽样和不重复抽样两种形式。
2)分层抽样(Stratified sampling)
在抽样之前将总体划分为不同的层(群),然后在各
个层中抽取一定数量的元素组成样本。
分层抽样的时候应该是各个层内之间的元素的差异比
较小,而使层之间的元素比较大。各个层的划分要根
据研究者的判断和研究目的。
概率抽样
(Probability sampling)
3)等距离抽样(systematic sampling,系统抽样)
首先将总体中的个体按照某种顺序排列起来,然后按
照某种规则确定一个随机起点,然后,每隔一定的间
隔抽取一个元素,直到抽满n个元素形成一个样本为
止。
4)整群抽样(Cluster sampling)
就是首先将总体划分为若干个群,然后以这些群为抽
样单位从中抽出部分群,在对抽选出的群中的所有元
素进行观察。
思考题:假如你要调查广州市市区内的居民月收入,假
设抽样容量为1000。你如何展开抽样?
1)便利抽样(Convenience sampling)
研究者出于收集数据的便利,而不考虑抽样的概率,
所进行的抽样。例如:街头访谈、电话访谈、向自己
的亲朋好友收集数据。
这种样本数据收集过程都加入了某中人为的干扰和选
择,所以从方便样本中得出的结果对于总体信息的推
论程度是有限的。
思考题:
有时候杂志要求读者回答某些问题并寄回答案,从而构
成一个样本。 请问这个样本能不能代表读者群总体?
为什么?
非概率抽样(Nonprobability
sampling)
2)判断抽样(Judgment sampling)
是指经过专家考虑后,以适当的方式进
行抽样。
例如:研究青少年吸毒问题。
3.抽样误差
一般而言,样本统计量的分布就叫作抽样分布
抽样平均误差就是抽样平均数(或抽样成数)的标
准差。反映抽样平均数(或抽样成数)与总体平均
数(或总体成数)的平均误差程度。
抽样误差=
数据收集、整理、记录和制表过程中产生的
误差是非抽样误差。
影响抽样误差大小因素
总体方差或总体标准差的大小(正比例)
样本容量的大小(反比例)
抽样组织方式和抽样方法
(一)抽样平均误差
抽样平均误差是反映抽样误差一般水平的指标。
常用抽样平均的标准差或抽样成数的标准差作
为衡量误差一般水平的尺度。
计算公式:
成 数
平均数
不重复抽
样
成 数
平均数
重复抽样
= =
= =
=
=
例1:从某厂生产的10000只日光灯管中随机抽取100只进行
检查,假如该厂日光灯管平均使用寿命的标准差为100小时,
试计算该厂日光灯管平均使用寿命的抽样平均误差。
在重复抽样条件下:
在不重复抽样条件下:
(二)抽样极限误差
是指在明确有一定把握程度的前提下,所允许的抽样误
差的可能范围,也可称之为允许误差。通常用Δ来表示:
抽样估计的概率度:
抽样极限误差:
抽样极限误差的计算:
4 .抽 样 估 计
点估计
区间估计
直接用样本指标作为总直接用样本指标作为总
体 指 标 的 估 计 值体 指 标 的 估 计 值
根据样本指标估计总体指标根据样本指标估计总体指标
估 计 值 的 上 限 和 下 限估 计 值 的 上 限 和 下 限
11.计算样本平均数.计算样本平均数
计算样本平均数的标准差计算样本平均数的标准差
计算抽样平均数的平均误差计算抽样平均数的平均误差
总体平均数的区间估计(模式一)
22.根据给定的概率保证程度.根据给定的概率保证程度FF((t)t),得概率度,得概率度tt
33.根据.根据tt求误差范围求误差范围
.对总体平均指标进行区间估计对总体平均指标进行区间估计::
总体平均数的区间估计(模式一)
1.计算样本成数
计算抽样成数的平均误差
总体成数(比率p)的区间估计(模式二)
2.根据给定的概率保证程度F(t),得概率度t
3.根据t求误差范围
4.对总体成数进行区间估计:
总体成数(比率p)的区间估计(模式二)
例1:对某市400名居民休息日的睡眠时间抽样调查的结果显
示,该市居民平均睡眠时间为535分钟,标准差为480分钟,
要求在95%的概率保证程度下,对该市全部居民的平均睡眠
时间进行区间估计。
解:
即可以以95%的把握说,该市居民在休息日的平
均睡眠时间在488-582分钟之间。
例2:通过对1000户居民家庭的耐用消费品抽样调查显示,
拥有电脑的家庭为85%,试以%的概率保证程度,估计
该市全部居民家庭中拥有电脑的家庭所占比率。
解:
该市全体居民家庭电脑拥有量在%至%之间,其
概率保证程度为%。
5.必要样本单位数的确定方法
((11)推断总体平均数所需的样本单位数:)推断总体平均数所需的样本单位数:
重复抽样条件下:重复抽样条件下: 不重复抽样条件下:不重复抽样条件下:
5.必要样本单位数的确定方法
((22)推断总体成数所需的样本单位数:)推断总体成数所需的样本单位数:
重复抽样条件下:重复抽样条件下: 不重复抽样条件下:不重复抽样条件下:
例1:某市开展职工家计调查,根据历史资料该市职
工家庭平均每人年收入的标准差为250元,而家庭消
费的恩格尔系数(即家庭食品支出占消费总支出的
比重)为65%,现在用重复抽样的方法,要求在
%的概率保证下,平均收入的极限误差不超过
20元,恩格尔系数的极限误差不超过4%,求样本必
要单位数。
解:在重复抽样条件下:
样本平均数的必要单位数:
样本成数的必要单位数:
两个抽样指标所要求的单位数为同一对象,应选
取其中比较多的单位数,即抽取625户进行家庭调
查以满足共同的要求。