第二章
计量资料的统计描述
1
基本内容
统计描述 统计推断(1) 统计推断(2)
计量资料 频数分布
集中趋势
离散趋势
统计图表
抽样误差
标准误
t u F检验
秩和检验
可信区间
直线相关与回归
偏相关
多元线性回归
计数资料 相对数
统计图表
u 、 2检验
秩和检验
可信区间
Logistic回归
2
本章在临床资料处理中的用途
资料整理阶段,判断资料适合何种方法
分析的初步阶段,对变量的特点进行描述
(求出均数和标准差)为假设检验做准备
3
为了比较国产药和进口药对治疗更年期妇女骨质疏松效果
是否相同,研究人员采取随机双盲的试验方法,对39名病
人进行随机分组,国产药组20例,进口药组19例,评价指
标为第2-4腰椎骨密度的改变值(骨密度.sav)。
1 1 1 1
1 1 1 1
1 1 1 1
1 1 1 1
1 1 1 1
2 2 2 2
2 2 2 2
2 2 2
如何建立数据库?
(注意:在研究的设计和分析阶段都用到统计学)
4
常用的设计类型
1. 一组样本与总体的比较
2. 两组样本的比较(成组和配对t、 2检验 )√
3. 单因素多组样本的比较(单因素F分析, 2检验 ) √
4. 双因素多组样本的比较(配伍组F方差分析) √
5. 三因素三组及以上设计(拉丁方设计)
6. 三个或以上因素并交互作用(正交设计)
5
主要内容
第一节 计量资料的频数分布
第二节 集中趋势
第三节 离散趋势
6
第一节 频数分布
什么是频数
频数分布的特点
频数分布的类型
7
8
SPSS建立数据库
进入SPSS操作窗口
进入数据编辑窗口(data editor)
Variable View 变量名 类型
整数位 小数位
输入数据:Data View
9
../../%E7%8E%8B%E6%99%93%E8%8E%89/2008%E7%A0%94%E7%A9%B6%E7%94%9F%E7%BB%9F%E8%AE%A1/2008-2/%E8%BA%AB%E9%AB%98%E5%A5%B3%E5%A4%A7%E5%AD%A6%E7%94%
检查输入的数据(打开数据库)
找出最大值、最小值(数据排序)
data View窗口-data-sort cases-身高
-sort by-身高
身高主要集中在什么阶段?
(这个程序能否看得出来大多数人身高在何处?
应该怎么办?)
10
11
变量变换:将身高转化成一个新变量(组段)
Transform-recode-into different variables(身
高-组段)--change-old and new-old value
(range)-new value (value)-old-new—add—
continue
(可以试用不同的分组方法,例如“5”“2”)
产生新变量(组段)
12
1998年100名18岁健康女大学生身高的频数分布
身高组段
(1)
划记 频数 f
(2)
154~ 11 2
156~ 1111 4
158~ 11111,11111,1 11
160~ 11111,11111,111 13
162~ 11111,11111,11111,11111,11 22
164~ 11111,11111,11111,1111 19
166~ 11111,11111,11111 15
168~ 11111,1111 9
170~ 1111 4
172~174 1 1
合 计 100
13
产生频数表
Analyze----Descriptive Statistics----
Frequencies-组段-display frequency
table
14
../../%E7%8E%8B%E6%99%93%E8%8E%89/2008%E7%A0%94%E7%A9%B6%E7%94%9F%E7%BB%9F%E8%AE%A1/2008-2/%E8%BA%AB%E9%AB%98%E5%A5%B3%E5%A4%A7%E5%AD%A6%E7%94%
频数表
计量资料→等级资料
15
16
频数:当汇总大量的原始数据时,把数
据按类型分组,其中每个组的数据个数,
称为该组的频数。
频数表(频数分布):表示各组及它们
对应的组频数的表格称为频数表或频数
分布。
(见前两张幻灯)
17
频数分布的两个特征:
集中趋势与离散趋势(共性与个性)
频数分布的类型:
对称分布与偏态分布(集中位置偏向小的一侧叫
正偏态,反之叫负偏态)
频数表的主要用途:
1. 揭示分布类型
2. 发现特大值和特小值
3. 计算集中趋势指标与离散趋势指标
总结前面
18
第二节 集中趋势
集中位置的描述,即大多数数值落在什么
位置上。(针对一个变量的若干个数值)
描述集中趋势的几种指标(用不同的方
法将不同类型数值的集中位置表示出来)
1.算术均数(均数mean)
2.几何均数(geometric mean)
3.中位数(median)
4.众数(Mode)
19
1.算术均数(均数)
意义:一组性质相同的观察值在数量上的平均
水平。
表示 (总体) X(样本)(spss:“mean”)
应用:正态分布或近似正态分布
注意:合理分组,才能求均数,否则没有意义。
计算方法:直接法和加权法
20
21
均数的特征
22
用SPSS计算均数
File---Open---Data---身高---Analyze--
--Descriptive Statistics----Frequencies-
---Statistics----Mean---Continue----OK
23
../../%E7%8E%8B%E6%99%93%E8%8E%89/2008%E7%A0%94%E7%A9%B6%E7%94%9F%E7%BB%9F%E8%AE%A1/2008-2/%E8%BA%AB%E9%AB%98%E5%A5%B3%E5%A4%A7%E5%AD%A6%E7%94%
有一组血中抗体滴度数据:32,2
,4, 8, 4,16,1,1,4,1,
1,2,2,2,4, 8,16,2,4
, 32,4, 8,4,求它们的平均水
平
24
首先看这组数据的频数分布,大概集中在什么位置。
用“mean”求,看结果如何。
File---Open---Data---抗体滴度---Analyze----
Descriptive Statistics----Frequencies----
Statistics----Mean---Continue----OK
25
../../%E7%8E%8B%E6%99%93%E8%8E%89/2008%E7%A0%94%E7%A9%B6%E7%94%9F%E7%BB%9F%E8%AE%A1/2008-2/%E8%BA%AB%E9%AB%98%E5%A5%B3%E5%A4%A7%E5%AD%A6%E7%94%
2.几何均数
意义:N个数值的乘积开N次方即为这N 个数
的几何均数。
表示:G
应用:原始数据分布不对称,经对数转换后
呈对称分布的资料。数值范围跨越多个数量级。
例如抗体滴度。
26
SPSS计算几何均数
File---Open---Data---抗体滴度---Analyze
----Reports----Case Summaries----抗体
滴度-Statistics----Geometric Mean----
Continue---OK
27
F:%5Cwxl%5C%E7%A0%94%E7%A9%B6%E7%94%9F%E6%95%99%E5%AD%A6%5C%E6%8A%97%E4%BD%93%E6%BB%B4%E5%BA%
Case Summaries a
23
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
N
Grouped Median
Total
抗体滴度
Limited to first 100 .
28
1、几何均数适用于对数正态分布,如
药物的效价、抗体的滴度、传染性疾病
的潜伏期等资料。
2、变量x服从对数正态分布,即表示变
量lg(xi)服从正态分布。对于lg(xi),具
有正态分布的所有特性。
几何均数的特征
29
3.中位数、百份位数
意义:将一组观察值从小到大排序后,居于中间
位置的那个值或两个中间值的平均值。(身高排队)
data editor-data-sort cases
表示:M 、PX
百分位数:将N个观察值从小到大依次排列,再
分成100等份,对应于X%位的数值即为第X百分位
数。中位数是百分位的特殊形式。
应用:偏态资料,开口资料
30
11个大鼠存活天数:
4,10,7,50,3,15,2,9,13,>60,
>60
平均存活天数?
(一)中位数(median)
是将每个变量值从小到大排列,位置
居于中间的那个变量值。
存活天数 2, 3, 4, 7, 9, 10, 13, 15, 50,>60,>60
秩次 1 2 3 4 5 6 7 8 9 10 11
31
计算
公式:
n为奇数时
n为偶数时
32
例 9名中学生甲型肝炎的潜伏期分别
为12,13,14, 14, 15, 15,
15, 17, 天,求其中位数。19
33
频数表资料的中位数
下限值L 上限值U
i; fm
中位数M
34
偏态资料用算术均数处理会产生什么样的
结果?
大家试举一个偏态资料的例子。
2503
1283
56000
1500
1520
1600
1680
1920
2000
2300
2300
2530
2580
9501
3000
3000
4210
3100
3120
3210
3210
4102
4520
68120
35
36
SPSS计算中位数、百分位数
File---Open---Data---收入(抗体滴度)--
--Analyze----Descriptive Statistics----
Frequencies----Statistics----
Median(mean)---Continue----OK
37
F:%5Cwxl%5C%E7%A0%94%E7%A9%B6%E7%94%9F%E6%95%99%E5%AD%A6%5C%E5%8F%91%E6%B1%
中位数的特征
1. 计算时只利用了位置居中的测量值
2. 优点:对极值不敏感
3. 缺点:并非考虑到每个观测值
2. 适用于各种分布类型的资料,
3. 特别适合于:大样本偏态分布资
料
4. 或者一端或两端无确切数值的
资料
38
四、众数(Mode)
是一群数据中出现次数(频数)最多的值。适用
于大样本;较粗糙。
例 有16例高血压病人的发病年龄 (岁 )为:
42,45,48,51,52,54,55,55,
,61,61,62,62,试求众数。
众数的特征
1、对于某些数据而言,例如均匀分布,并不存在众数;
2、对于某些数据存在两个或多于两个的众数;
3、定性数据可以存在众数;
众数对于进一步的统计学计算与分析不具备应用价值。
58,58,58,58
39
第三节 离散趋势
描述一组数据参差不齐的程度
40
全距
四分位数间距
方差
标准差
变异系数
常用指标
41
标准差
相关概念:离均差、离均差之和、离均差平方和、方
差(2 S2 )
标准差的符号: S (SPSS:Std. deviation)
意义:全面反映了一组观察值的变异程度 (大小)
应用:描述变异程度、计算标准误、计算变异系数、
描述正态分布、估计正常值范围
42
用SPSS计算标准差
File---Open---Data---身高---Analyze----
Descriptive Statistics----Frequencies----
---Continue----OK
43
../../%E7%8E%8B%E6%99%93%E8%8E%89/2008%E7%A0%94%E7%A9%B6%E7%94%9F%E7%BB%9F%E8%AE%A1/2008-2/%E8%BA%AB%E9%AB%98%E5%A5%B3%E5%A4%A7%E5%AD%A6%E7%94%
随机变量xi的标准化
如果随机变量xi服从正态分布,均数和标
准差分别为 和s,则随机变量xi的标准
化正态离差值(Standard normal
deviation)又称为标准化得分值
(Standard Scores )为:
44
变异系数
意义:标准差与均数之比用百分数表示。
符号: CV
计算: CV=(S/X)100%
无单位
应用:单位不同的多组数据比较
均数相差悬殊的多组资料
45
四分位数间距
(inter-quartile range)
四分位数间距,用IQR表示:
IQR=
第三四分位数:Q3
第一四分位数:Q1
46
多样性指数
( Indices of Diversity)
描述无序分类变量在各各义类别间频数的离
散度。
用熵与最大熵之比表达离散度
频率资料的公式
频数资料的公式
47
48
49
谢谢!
50