数据模型与决策
统计研究的过程
收集数据
(取得数据)
整理数据
(处理数据)
解释数据
(结果说明)
分析数据
(研究数据)
实际问题
数据
雪要什么样的数据?
如何取得这些数据?
从数据提
取信息
统计分组或简单的统计指标
构建复杂的数学模型
决策管理
线性规划决策
第一讲 数据与统计指标
1、数据类型
2、数据来源
3、数据的整理与显示
4、常用的统计指标及其应用
什么是统计数据? (Data)
对现象进行计量的结果
不是指单个的数字,而是由多个数据构成的数据集
不仅仅是指数字,它可以是数字的,也可以是文字的
统计数据的分类
统计数据的分类
按计量层次
分类的数据
顺序的数据
数值型数据
按时间状况
截
面
的
数
据
时序的数据
按收集方法
观察的数据
试验的数据
统计数据的分类
(按计量层次分)
分类的数据(Categorical data)
对事物进行分类的结果
数据则表现为类别,用文字来表述的
例如,人口按性别分为男、女两类
顺序的数据(Rank data)
给出事物类别的顺序
数据表现为类别,用文字来表述的
例如,产品分为一等品、二等品、三等品、次品等
数值型数据(Metric data)
结果表现为具体的数值
对事物的精确测度
例如:身高为175cm、168cm、183cm
统计数据的分类(按收集方法分)
观测的数据(Observational data)
通过调查或观测而收集到的数据
在没有对事物人为控制的条件下而得到的
有关社会经济现象的统计数据几乎都是观测数据
试验的数据(Experimental data)
在试验中控制试验对象而收集到的数据
比如,对一种新药疗效的试验,对一种新的农作物品种的试验等
自然科学领域的数据大多数都为试验数据
统计数据的分类(按时间状况分)
截面数据(Cross-sectional data)
在相同或近似相同的时间点上收集的数据
描述现象在某一时刻的变化情况
比如,2009年我国各地区的国内生产总值数据
时间序列数据(Time series data)
在不同时间上收集到的数据
描述现象随时间变化的情况
比如,1996年至2010年国内生产总值数据
第二节 统计数据的来源
一. 统计数据的间接来源
二. 统计数据的直接来源
统计数据的间接来源
1. 公开出版物:《 中国统计年鉴》、《中国统计摘要》、《中国社会统计年鉴》、《中国工业经济统计年鉴》、《中国农村统计年鉴》、《中国人口统计年鉴》、《中国市场统计年鉴》、《世界经济年鉴》、《国外经济统计资料》、《世界发展报告》……
Internet
2. 网络
中国统计年鉴2001
中国人口统计年鉴
中国市场统计年鉴
世界发展报告
世界经济年检
工业普查数据
中国统计出版社
统计调查方式
统计数据的直接来源
统计调查方式
统计调查方式
抽样调查
普
查
统计报表
重点调查
典型调查
抽样调查(Sample survey)
1. 从总体中随机抽取一部分单位(样本)进行调查
总体
随机样本
具有经济性、时 效性强、适应面广、准确性高等特点
2. 目的是推断总体的未知数字特征
3. 最常用的调查方式
重点调查和典型调查
2. 典型调查(Model survey)
从调查对象的全部单位中选择少数典型单位进行调查
目的是描述和揭示事物的本质特征和规律
调查结果不能用于推断总体
重点调查(Key-point investigation)
从调查对象的全部单位中选择少数重点单位进行调查
调查结果不能用于推断总体
数据的搜集方法
数据的搜集方法
询问调查
访问调查
观察实验
电话调查
邮寄调查
观
察
电脑辅助
座
谈
会
个别深访
实
验
第三节 数据的整理与显示
1、 数据的预处理
2、 分类和顺序数据的整理与显示
3、 数值型数据的整理与显示
4、 统计表
数据的筛选
(Data filter)
对审核过程中发现的错误予以纠正
当数据中的错误不能予以纠正,或者有些数据不符合调查的要求而又无法弥补时,需要对数据进行筛选
数据筛选的内容包括:
将某些不符合要求的数据或有明显错误的数据予以剔除
将符合某种特定条件的数据筛选出来,而不符合特定条件的数据予以剔
数据的筛选
(Data filter)
用Excel进行数据筛选
8名学生的考试成绩数据
数据的排序(Data rank)
按一定顺序将数据排列,以发现一些明显的特征或趋势,找到解决问题的线索
排序有助于对数据检查纠错,以及为重新归类或分组等提供依据
在某些场合,排序本身就是分析的目的之一
排序可借助于计算机完成
分类数据的整理与显示
分类数据的整理(基本过程)
1. 列出各类别
2. 计算各类别的频数
3. 制作频数分布表
4. 用图形显示数据
分类数据的整理(可计算的指标)
频数(Frequency) :落在各类别中的数据个数
比例(Proportion) :某一类别数据占全部数据的比值
百分比(Percentage) 将对比的基数作为100而计算的比值
比率(Ratio) :不同类别数值的比值
分类数据整理—频数分布表
(实例)
【例】为研究广告市场的状况,一家广告公司在某城市随机抽取200人就广告问题做了邮寄问卷调查,其中的一个问题是“您比较关心下列哪一类广告?”
1.商品广告;2.服务广告;3.金融广告;4.房地产广告;5.招生招聘广告;6.其他广告。
某城市居民关注广告类型的频数分布
广告类型
人数(人)
比例
频率(%)
商品广告
服务广告
金融广告
房地产广告
招生招聘广告
其他广告
112
51
9
16
10
2
合计
200
1
100
分类数据的图示—条形图
(由 Excel 绘制的条形图)
人数(人)
51
9
16
10
2
112
0
40
80
120
商品广告
服务广告
金融广告
房地产广告
招生招聘广告
其他广告
广
告
类
型
某城市居民关注不同类型广告的人数分布
分类数据的图示—圆形图
(由 Excel 绘制的圆形图)
其他广告
%
房地产广告
%
商品广告
%
金融广告
%
服务广告
%
招生招聘广告
%
某城市居民关注不同类型广告的人数构成
顺序数据的整理
(可计算的指标)
1. 累积频数(Cumulative Frequencies):各类别频数的逐级累加
2. 累积频率(Cumulative Percentages):各类别频率(百分比)的逐级累加
顺序数据频数分布表
(实例)
【例】在一项城市住房问题的研究中,研究人员在甲乙两个城市各抽样调查300户,其中的一个问题是:“您对您家庭目前的住房状况是否满意?
1.非常不满意;2.不满意;3.一般;4.满意;5.非常满意。
甲城市家庭对住房状况评价的频数分布
回答类别
甲城市
户数
(户)
百分比
(%)
向上累积
向下累积
户数
(户)
百分比
(%)
户数
(户)
百分比
(%)
非常不满意
不满意
一般
满意
非常满意
24
108
93
45
30
8
36
31
15
10
24
132
225
270
300
300
276
168
75
30
92
56
25
10
合计
300
—
—
—
—
顺序数据频数分布表
(实例)
乙城市家庭对住房状况评价的频数分布
回答类别
乙城市
户数
(户)
百分比
(%)
向上累积
向下累积
户数
(户)
百分比
(%)
户数
(户)
百分比
(%)
非常不满意
不满意
一般
满意
非常满意
21
99
78
64
38
21
120
198
262
300
300
279
180
102
38
合计
300
—
—
—
—
顺序数据的图示—累计频数分布图
(由 Excel 绘制的累计频数分布图)
24
300
132
225
270
0
100
200
300
400
非常
不满意
不满意
一般
满意
非常
满意
累
积
户
数
(户)
(a)向下累积
276
168
30
300
75
0
100
200
300
400
非常
不满意
不满意
一般
满意
非常
满意
累
积
户
数
(户)
(b)向上累积
甲城市家庭对住房状况评价的累积频数分布
品质数据的图示—环形图
(Annular chart)
环形图中间有一个“空洞”,总体中的每一部分数据用环中的一段表示
环形图与圆形图类似,但又有区别
圆形图只能显示一个总体各部分所占的比例
环形图则可以同时绘制多个总体的数据系列,每一个总体的数据系列为一个环
环形图可用于结构比较研究
环形图主要用于展示分类和顺序数据
品质数据的图示—环形图
(由 Excel 绘制的环形图)
8%
36%
31%
15%
7%
33%
26%
21%
13%
10%
非常不满意
不满意
一般
满意
非常满意
甲乙两城市家庭对住房状况的评价
时间序列数据—线图(实例)
【例】已知1991~1998年我国城乡居民家庭的人均收入数据如表。试绘制线图
¥
$
1991~1998年城乡居民家庭人均收入
年份
城镇居民
农村居民
1991
1992
1993
1994
1995
1996
1997
1998
时间序列数据—线图
(由 Excel 绘制的线图)
0
2000
4000
6000
1991
1992
1993
1994
1995
1996
1997
1998
城镇居民
农村居民
收
入
(元)
城乡居民家庭人均收入
数值型数据的图示
两个变量间关系的图示—散点图
Excel
两个变量间的关系—散点图
(Scatter diagram)
【例】家庭储蓄与家庭收入之间有一定关系。现从某城市家庭中随机抽取12个家庭,所得月收入与月储蓄的样本数据如下表。试绘制散点图
家庭收入与储蓄相关系数计算表 单位:元
家庭编号
月收入(x)
月储蓄(y)
1
2
3
4
5
6
7
8
9
10
11
12
3300
1300
1500
1700
2800
2600
2200
2000
2300
1800
3000
900
1200
500
400
600
1100
900
800
700
1000
700
1000
300
$
两个变量间的关系—散点图
(实例)
不同形态的散点图
(Scatter diagram)
不相关
负线性相关
正线性相关
非线性相关
完全负线性相关
完全正线性相关
常用的统计指标及其应用
1、均值和方差
2、时间序列的描述性分析
工业中的6
表示一个总体的标准差。6是工业中使用的一个术语,它描述一个次品率不超过百万分之的过程。 6的含义指的是一个偏离正态分布的中心6个标准差,但是一个完美的稳定过程的假设被轻微偏离的假设所替代,因此次品率不超过。这个次品率非常低以致于可以忽略次品
接受了6质量标准,摩托罗拉公司在3年中节省的资金超过亿美元。Allied Signal报告说节省了15亿美元。采纳6目标的大公司还有通用电器(GE)、宝利来(Polaroid)h和德州仪器(Texas Instruments)
资料来源:Mario 著《初级统计学》
简单均值
(Simple mean)
设一组数据为:x1 ,x2 ,… ,xn(xN)
样本均值
总体均值
加权均值
(Weighted mean)
设各组的组中值为:M1 ,M2 ,… ,Mk
相应的频数为: f1 , f2 ,… ,fk
样本加权均值
总体加权均值
加权均值
(权数对均值的影响)
甲乙两组各有10名学生,他们的考试成绩及其分布数据如下
甲组: 考试成绩(x ): 0 20 100
人数分布(f ):1 1 8
乙组: 考试成绩(x): 0 20 100
人数分布(f ):8 1 1
众数
(Mode)
集中趋势的测度值之一
出现次数最多的变量值
不受极端值的影响
可能没有众数或有几个众数
主要用于分类数据,也可用于顺序数据和数值型数据
众数
(不唯一性)
无众数 原始数据: 10 5 9 12 6 8
一个众数 原始数据: 6 5 9 8 5 5
多于一个众数 原始数据: 25 28 28 36 42 42
中位数
(Median)
集中趋势的测度值之一
排序后处于中间位置上的值
Me
50%
50%
不受极端值的影响
主要用于顺序数据,也可用数值型数据,但不能用于分类数据
各变量值与中位数的离差绝对值之和最小,即
中位数
(位置的确定)
未分组数据:
组距分组数据:
数值型未分组数据的中位数
(9个数据的算例)
【例】:9个家庭的人均月收入数据
原始数据: 1500 750 780 1080 850 960 2000 1250 1630
排 序: 750 780 850 960 1080 1250 1500 1630 2000
位 置: 1 2 3 4 5 6 7 8 9
中位数 1080
数值型未分组数据的中位数
(10个数据的算例)
【例】:10个家庭的人均月收入数据
原始数据:1500 750 780 660 1080 850 960 2000 1250 1630
排序: 660 750 780 850 960 1080 1250 1500 1630 2000
位置: 1 2 3 4 5 6 7 8 9 10
众数、中位数和均值的关系
左偏分布
均值
中位数
众数
对称分布
均值
=
中位数
=
众数
右偏分布
众数
中位数
均值
总体方差和标准差
(Population variance and Standard deviation)
未分组数据:
组距分组数据:
未分组数据:
组距分组数据:
方差的计算公式
标准差的计算公式
方差与标准差(算例)
原始数据: 10 5 9 13 6 8
方差
标准差
县域经济发展的均衡性指标
最小值
最大值
平均值
标准差
标准差系数
1995
861
9173
2000
913
10078
2004
1471
28771
2005
1552
34533
2006
1797
46031
2007
2357
49566
2008
2966
52383
县域经济发展的不平衡性表现在以下几方面:
(1)县市之间的经济发展程度总体上越来越不均衡,各县之间的差异逐年增大。人均GDP的标准差系数(表1-6)逐年增大,从1995年的 增大到2008年的,表明96个县市之间经济发展程度越来越不均衡,贫富差距扩大。
(2)发达县市与贫困县市的差距越来越大。1995年,经济最差的县为文水县,其人均GDP为861元/人,经济发展最好的县为煤炭资源较为丰富的古交市,二者之间的差异为8312元/人,2008年经济发展最差的县为石娄县,经济发展最好的县为古县,二者之间人均GDP相差49417元/人,为消除通货膨胀的影响,我们用山西省的GDP指数进行缩减,将2008年的GDP缩减为1995年的价格,2008年经济最好的县与经济最差的县之间人均GDP仍然相差元/人,二者之间的差距仍然较大。
离散系数
(Coefficient of variation)
1. 标准差与其相应的均值之比
2. 消除了数据水平高低和计量单位的影响
3. 测度了数据的相对离散程度
4. 用于对不同组别数据离散程度的比较
5. 计算公式为
用Excel计算描述统计量
将120的销售量的数据输入到Excel工作表中,然后按下列步骤操作:
第1步:选择“工具”下拉菜单
第2步:选择“数据分析”选项
第3步:在分析工具中选择“描述统计”,然后选择“确定”
第4步:当对话框出现时
在“输入区域”方框内键入数据区域
在“输出选项”中选择输出区域
选择“汇总统计”
选择“确定”
实例计算
时间序列(Times Series)
1. 同一现象在不同时间上的相继观察值排列而成的数列
2. 形式上由现象所属的时间和现象在不同时间上的观察值两部分组成
3. 排列的时间可以是年份、季度、月份或其他任何时间形式
BOOK9
增长率
(Growth rate)
也称为增长速度
增长量与基期水平之比
说明现象的相对增长程度
有环比增长率与定期增长率之分
环比增长率:增长量与前一时期数量之比,也称为环比增长速度
定基增长率:增长量与某一固定时期的数量之比,也称为定基增长速度
增长率
(计算公式)
环比增长率
定期增长率
增长率
(算例)
我国第三产业国内生产总值数据
年 份
1994
1995
1996
1997
1998
国内生产总值(亿元)
环比增长率(%)
定基增长率(%)
—
—
【例】已知1994~1998年我国的国内生产总值及构成数据如表。计算各年的环比增长率和定基增长率
平均增长率
(Average rate of growth)
描述现象在整个观察期内平均增长的程度
通常采用几何平均法(水平法)计算
计算公式为
平均增长率
(算例)
【例】计算公式为计算1994~1998年间我国第三产业国内生产总值的年平均增长率
增长率的应用
(一个例子)
甲、乙两个企业的有关资料
年 份
甲 企 业
乙 企 业
利润额(万元)
增长率(%)
利润额(万元)
增长率(%)
2001
500
—
60
—
2002
600
20
84
40
【例】 假定有两个生产条件基本相同的企业,各年的利润额及有关的速度值如表
速度的分析与应用
(增长1%绝对值)
速度每增长一个百分点而增加的绝对量
用于弥补速度分析中的局限性
计算公式为
甲企业增长1%绝对值=500/100=5万元
乙企业增长1%绝对值=60/100=万元
*
:1, 1, 3
*
*
:1, 1, 3
*
:1, 1, 3
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
*
Shape
Concerned with extent to which values are symmetrically distributed.
Kurtosis
The extent to which a distribution is peaked (flatter or taller).
For example, a distribution could be more peaked than a normal distribution (still may be 慴ell-shaped). If values are negative, then distribution is less peaked than a normal distribution.
Skew
The extent to which a distribution is symmetric or has a tail. Values are 0 if normal distribution. If the values are negative, then negative or left-skewed.
*
*
*
*
*
*
*
*
*
*
*