SPSS应用
解决问题
一、SPSS在描述统计中的应用
SPSS的背景
SPSS操作环境介绍
数据的输入和保存
数据的预处理
数据的描述
(一)SPSS的背景
SPSS (Statistics Package for Social Science) 社会科学统计软件包
应用领域涵盖了宽泛的社会科学应用
模块化统计分析软件
SPSS的基本特点和功能
使用简便
统计功能强
方便快捷的绘图
汉字操作
样本数据的描述和预处理
假设检验(包括参数检验、非参数检验及其
他检验)
方差分析(包括一般的方差分析和多元方差
分析)
列联表
相关分析
回归分析
对数线性分析
聚类分析
判别分析
因子分析
对应分析
时间序列分析
生存分析
可靠性分析
SPSS数据分析的基本步骤
建立SPSS数据文件
分析之前的预处理
统计分析
分析结果的解释说明
定义SPSS数据文件
的结构
录入、修改、保存SPSS数据文件
(二)SPSS操作环境介绍
1、操作窗口
变量编辑窗口
数据编辑窗口
结果输出窗口
变量编辑窗口
数据编辑窗口
数据输出窗口
2、SPSS的菜单
1、File:文件管理菜单,有关文件的调入、存储、显示和打印等;
2、Edit:编辑菜单,有关文本内容的选择、拷贝、剪贴、寻找和替换
3、View:视图
4、Data:数据管理菜单,有关数据变量定义、数据格式选定、观察对
象的选择、排序、加权、数据文件的转换、连接、汇总等;
5、Transform:数据转换处理菜单,有关数值的计算、重新赋值、缺
失值替代等;
6、Analyze(Statistics):统计菜单,有关一系列统计方法的应用;
7、Graphs:作图菜单,有关统计图的制作;
8、Utilities:用户选项菜单,有关命令解释、字体选择、文件信息、
定义输出标题、窗口设计等;
9、Windows:窗口管理菜单,有关窗口的排列、选择、显示等;
10、Help:求助菜单,有关帮助文件的调用、查寻、显示等。
(二)SPSS操作环境介绍
(三)数据的输入和保存
1、数据的类型
变量 每个变量都有10个属性,依次为Name, Type, Width, Decimals, Label, Values, Missing, Columns, Align, Measure
数据尺度
刻度级Scale数据 比率级Ratio(比如身高) 间距级Interval(比如气温)
序次级Ordinal(比如成绩等:ABCD)
名义级Nominal(比如喜欢的颜色)
(三)数据的输入和保存
2、定义一个变量和数据输入
新建一个数据文件,选择变量编辑窗口Variable View
依次定义变量的10项属性
切换到Data View输入数据
察看变量信息 菜单:Utilities—Variables命令
(三)数据的输入和保存
3、导入数据
SPSS可从Excel, Txt, Power Builder等格式的数据文件中导入数据
从Excel中导入数据 菜单:File—Open—Data命令
核对录入、导入的数据
(四)数据的预处理
1、个案的排序
菜单:Data—Sort Cases 在对话框中选择排序的字段和升降序
支持多个字段的联合排序
实例:职工数据.sav
按职称和工资收入排序
排序实例:职工数据
排序结果
(四)数据的预处理
2、分割文件
将当前的数据文件分割成若干组,对每个组分别进行分析。并非真正的分割文件
菜单:Data—Split File 命令
实例:将“职工数据.sav”按“职称”变量分割
分割实例:职工基本情况
分割结果
(四)数据的预处理
3、分类汇总
以指定的分类变量取值为依据,将另一个或多个变量分成若干类后再各类内部进行描述统计,并把统计结果生成新的数据文件
菜单:Data—Aggregate Aggregate Variables 汇总变量 Break Variables 分类变量
实例:对“职工数据.sav”中的“工资收入”变量按“文化程度” 进行分类汇总
汇总分类实例:职工数据
分类汇总结果
分类汇总结果
(四)数据的预处理
4、数据分组
(1)单变量值分组
把每一个变量值作为一组
菜单 :Transform Automatic Recode
实例:职工数据.sav按“工资收入”分组
这种分组方法通常只适合于离散变量且变量值较少的情况
实例:职工基本情况
单变量分组结果
(2)组距分组
将全部变量值依次分为若干个区间,并将这一区间的变量值作为一组
菜单:Transform Recode Into Different
Variables
实例:职工数据.sav按“工资收入”分组
实例:职工数据
组距分组结果
(五)数据描述统计分析
1、频数分析 Frequencies
最常用的统计分析之一,功能是描述变量的分布特征
菜单:Analyze Descriptive Statistics
Frequencies
在左侧源变量框中选择一个或多个变量送入Variables中;
根据需要选择相应的选择项
实例:对“居民储蓄.sav”中的“户口和职业”进行频数分析以及“存款金额”的分布,对比城镇和农村
实例:居民储蓄
实例:居民储蓄—户口和职业
实例:居民储蓄—存款金额(分组)
实例:居民储蓄—存款金额(频数分析)
居民存款金额描述统计分析
居民存款金额描述统计分析结果
居民存款金额频数分布表
居民存款金额直方图
居民存款金额—比较城镇和农村(分割)
(五)数据描述统计分析
2、计算基本描述统计量
集中趋势、离散趋势、分布形态三类;综合这三类统计量就能够极为准确和清晰地把握数据的分布特点。
菜单:Analyze Descriptive Statistics
Descriptives (Explore)
实例:居民储蓄.sav,计算“存款金额”基本描述统
计量,并分别对城镇和农村储户进行比较
城镇和农村储户进行比较结果
Explore过程
存(取)款金额 Stem-and-Leaf Plot for
a13= 城镇户口
a13= 城镇户口
Frequency Stem & Leaf
0 . 00111122222233334555555555555666778&
1 . 0000000000003455&
2 . 00000&
3 . 00000&
4 . 0&
5 . 000000
6 . 5&
7 . 000&
8 . 0&
9 . 0&
10 . 00000
Extremes (>=15000)
Stem width: 1000
Each leaf: 2 case(s)
& denotes fractional leaves.
存(取)款金额 Stem-and-Leaf Plot for
a13= 农村户口
a13= 农村户口
Frequency Stem & Leaf
0 . 0111111112222222222333334
0 . 555555555566777888
1 . 00000000000
1 . 5558
2 . 0000
.00 2 .
3 . 000
.00 3 .
4 . 00
Extremes (>=4900)
Stem width: 1000
Each leaf: 1 case(s)
3、交叉分组下的频数分析(列联表分析)
多变量的联合分布特征,分析变量之间的相互影响和关系
任务:第一,根据收集的样本数据,产生二维或多维交叉列
联表;
第二,在交叉列联表的基础上,对两两变量间是否存
在一定的相关性进行分析。
菜单:Analyze Descriptive Statistics Crosstabs
实例:居民储蓄.sav
分析城镇和农村储户对“未来两年内收入状况变化趋
势”是否持相同态度
分析城镇和农村储户对“存款是否合算”的意见是否一致
(五)数据描述统计分析
实例:A.城镇和农村储户对“未来两年内收入状况变化趋 势”是否持相同态度
城镇和农村储户对未来收入看法列联表
城镇和农村储户对未来收入看法条形图
城镇和农村储户对未来收入看法一致性检验
结论:城镇和农村储户对未来收入看法不一致
实例:B.城镇和农村储户对存款是否合算的意见是否一致
城镇和农村储户对存款是否合算的意见列联表
城镇和农村储户对存款是否合算的意见条形图
城镇和农村储户对存款是否合算的意见一致性检验
结论:城镇和农村储户对存款是否合算的意见不一致
二、SPSS在假设检验中的应用
单样本t检验
两个独立样本t检验
两个配对样本t检验
(一)单样本t检验(均值)
检验单个样本的均值是否与给定的常数之间存在差异。样本均数与总体均数之间的差异显著性检验属于单一样本t检验。给出的统计量有:均值、标准差、均值的标准误。计算每个数据值与总体均值之间差的平均值,进行该差值为0的T检验及计算该差值的置信区间,用户可以指定检验的显著性水平。
菜单:Analyze Compare means One--Sample T test
实例:居民储蓄.sav,推断储户总体一次平均存款金额是否为
4000元
实例:居民储蓄.sav(单样本t检验)
结果分析:
结论:由于P值大于α值,因此不能拒绝零假设,认为储户总体一次平均存款金额与4000元没有显著差异。且有95%的把握认为储户总体一次平均存款金额在元之间。
(一)单样本t检验(比例)
检验单个样本的比例是否与给定的常数之间存在差异。样本比例与总体比例之间的差异显著性检验属于单一样本t检验。给出的统计量有:比例、比例标准差、比例的标准误。计算每个数据值与总体比例之间差的平均值,进行该差值为0的T检验及计算该差值的置信区间,用户可以指定检验的显著性水平。
菜单:Analyze Compare means One--Sample T test
实例:保险公司人员构成.sav,对保险公司从业人员的受高等
教育程度不低于80%和年轻化程度达50%进行推断。
实例:保险公司人员构成.sav(高等教育程度)
结果分析:
结论:由于P/2(
实例:保险公司人员构成.sav(年轻人的比例)
结果分析:
结论:由于P值小于α值,因此拒绝零假设,认为保险公司年轻人的比例与存在显著差异,且有95%的把握认为总体其比例在%%之间。
二、两个独立样本t检验(均值)
独立样本的T检验用于检验是否两个不相关的样本来自具有相同均值的总体,注意使用这种检验的条件是必须具有来自两个不相关组的观测量。
两个样本方差相等与不相等时使用的计算t值的公式不同,因此,应该对方差进行齐性检验。SPSS的输出,在给出方差齐与不齐两种计算结果的t 值和t检验的显著性概率的同时,还给出对方差齐性检验的F值和F检验的显著性概率。用户需根据F检验的结果自己判断选择t检验输出中的哪个结果,得出结论
菜单:Analyze Compare Means Independent Sample T Test
实例:居民储蓄.sav,分析城镇与农村储户的一次平均存款金
额是否存在显著差异。
实例:居民储蓄.sav
结果分析:
结论:①由于F检验P值大于α值,认为两总体方差不存在显著差异;②由于t检验P值大于α值,因此不能拒绝零假设,即城镇和农村储户一次存款金额的平均值不存在显著差异。
(二)两个独立样本t检验(比例)
菜单:Analyze Compare Means Independent
Sample T Test
实例:保险公司人员构成.sav,分析全国性保险公司
与外资和合资保险公司中具有高等教育水平
员工比例有无显著差异。
实例:保险公司人员构成.sav
结果分析:
结论:①由于F检验P值大于α值,认为两总体方差不存在显著差异;②由于t检验P值小于α值,因此拒绝零假设,即全国性保险公司与外资和合资保险公司中具有高等教育水平员工比例二者存在显著差异。
(三)两个配对样本t检验
配对样本t检验要求被比较的两个样本有配对关系,要求两个样本均来自正态总体,要求均值是对于检验有意义的描述统计量。
菜单:Analyze Compare Means Paired Sample T Test
实例:减肥茶数据.sav, 减肥茶生产商对肥胖志愿者进行减肥
跟踪调查,分析喝减肥茶前体重和喝减肥茶三个月后
体重有无明显差异,减肥茶是否有效。
实例:减肥茶数据.sav
结果分析:
结论:①喝茶后的平均体重低于喝茶前的平均体重。
②喝茶前与喝茶后两组样本线性相关程度较弱
③由于P值小于α,应拒绝零假设,即认为喝
茶前与喝茶后体重平均值存在显著差异,可
以认为该减肥茶具有减肥效果。
三、SPSS在方差分析中的应用
单因素方差分析
双因素方差分析
(一)单因素方差分析
单因素方差分析用来研究一个控制变量(因素)的不同水平是否对观测变量产生了显著影响。
菜单:Analysis Compared Means One-Way ANOVA
实例:广告城市与销售额.sav,某企业在制定某商品的广告策略时,对不同广告形式在不同地区的广告效果(销售额)进行评估。
广告形式和地区为控制变量,通过单因素方差分析分别对广告形式、地区对销售额的影响进行分析。
H0:不同广告形式没有对销售额产生显著影响
H0: 不同地区的销售额没有显著差异
实例:广告城市与销售额.sav(广告形式)
结果分析:
结论:由于概率P值小于显著性水平α,则应拒绝原假设,
即认为不同广告形式对销售额产生了显著影响。
实例:广告城市与销售额.sav(地区)
结果分析:
结论:由于概率P值小于显著性水平α,则应拒绝原假设,
即认为不同地区对销售额产生了显著影响。
(二)单因素方差分析的进一步分析
多重比较检验
若单因素方差分析出控制变量对观测变量产生了显著影响,多重比较检验则可进一步确定控制变量的不同水平对观测变量的影响程度如何,其中哪个水平的作用明显区别于其他水平,哪个水平的作用是不显著的。
菜单:Analysis →Compared Means→One-Way ANOVA
点击:Post Hoc
实例:广告城市与销售额.sav,某企业在制定某商品的广告
策略时,对不同广告形式在不同地区的广告效果(销
售额)进行评估。(进一步分析)
H0:相应两水平下观测变量总体均值不存在显著差异
实例:广告城市与销售额.sav(广告形式)
结果分析:不同广告形式销售额的统计描述
结果分析:不同广告形式销售额均值折线图
结果分析:方差齐性
结论:不同广告形式下销售额的方差齐性检验值为,
概率P值,大与显著性水平α,不应拒绝原假
设,即认为不同广告形式下销售额的总体方差无显
著差异,满足方差分析的前提要求。
结果分析:多重比较检验
结论:以报纸广告与其他三种形式的两两检验结果为例,报纸与广播的
效果没有显著差异,与宣传品和体验均有显著差异。
实例:广告城市与销售额.sav(地区)
结果分析:不同地区销售额的统计描述
结果分析:不同地区销售额均值折线图
结果分析:方差齐性
结论:不同地区中销售额的方差齐性检验值为,
概率P值,大与显著性水平α,不应拒绝原假
设,即认为不同地区中销售额的总体方差无显
著差异,满足方差分析的前提要求。
结果分析:多重比较检验
结论:以1号地区与其他17个地区的两两检验结果为例,1 号地区与3、4、5、8
和10号地区的效果没有显著差异,与2、6、7、9、11、12、13、14、15、16、17、18号地区均有显著差异。
(三)双因素方差分析
在现实中,常常会遇到两个因素同时影响结果的情况。这就需要双因素方差分析
菜单:Analyze General linear model
Univariate
实例:广告城市与销售额.sav,某企业对不同广告形
式在不同地区的广告效果进行评估。
实例:广告城市与销售额.sav(交互作用)
饱和模型(交互作用)
结果分析:
结论:由于Fx1,FX2的概率p值小于显著性水平α,因此拒绝零假设,可以认为不同广告形式和不同地区下的销售额总体均值存在显著差异。由于Fx1,x2的概率p值大于显著性水平α,因此不应拒绝零假设,可以不同广告形式和不同地区没有对销售额产生显著的交互作用。
(四)双因素方差分析的进一步分析
非饱和模型(无交互作用)
多重比较检验
菜单:Analyze General linear model
Univariate
点击:Model
实例:广告城市与销售额.sav,某企业对不同广告形
式在不同地区的广告效果进行评估。
非饱和模型
交互图
多重比较检验
不同广告形式在不同地区销售额均值
结果分析:
结论:由于Fx1,FX2的概率p值小于显著性水平α,因此拒绝零假设,可以认为不同广告形式和不同地区下的销售额总体均值存在显著差异。
四、SPSS在时间序列分析中的应用
时间序列分析的数据准备
时间序列的图形化观察及检验
时间序列的预处理
时间序列的简单回归分析法
时间序列的趋势外推法
指数平滑法
自回归法
ARIMA模型分析
季节调整法
(一)时间序列分析的数据准备
指明时间序列每个数据所对应的时间点或时间段,以及整个数据所对应的期间。
菜单:Data Define Dates
案例:煤炭及成品油出口.sav
案例:煤炭及成品油出口.sav(数据处理)
定义结果:
(二)时间序列的图形化观察及检验
掌握时间序列的发展趋势、波动幅度的变化规律、是否存在异常点、不同时间点上数据的关系等。
菜单:1、序列图 Graph Sequence
2、自相关函数图和偏相关函数图
Graph Time Series Autocorrelations
3、互相关图
Graph Time Series Crosscorrelations
案例:煤炭及成品油出口.sav
案例:煤炭及成品油出口.sav(序列图)
煤炭及成品油出口序列图
从图看出,煤炭出口基本呈线性增长趋势,但同时伴有波动。成品油出口增长平缓,也伴有波动。
案例:煤炭及成品油出口.sav(自相关函数图和偏相关函数图)
煤炭自相关函数图和偏相关函数图
分析:有趋势且波动的煤炭出口其自相关函数值在一定阶数后逐渐趋向0,而
偏相关函数值则很快落入置信区间。
成品油自相关函数图和偏相关函数图
分析:无明显趋势且波动的成品油出口其自相关函数值在一定阶数后逐渐
趋向0,而偏相关函数值则很快落入置信区间。
(三)时间序列的预处理
使序列的特征体现得更加明显
使数据满足于某些特定模型的要求
菜单:1、序列缺失值处理
Transform Replace Missing Values
2、序列数据变换
Transform Create Time Series
(四)指数平滑法
对过去的观察值加权平均进行预测的一种方法。
观察值时间越远,其权数也跟着呈现指数的下降。
以一段时期的预测值与观察值的线性组合作为第t+1期的预测值。
菜单:Analyze Time Series Exponential
Smoothing
案例:彩电出口.sav,建立几种指数平滑模型,对彩电出口量的变化趋势进行分析和预测。
案例:彩电出口.sav(序列图)
从图看出,1999年前各年出口量基本在同一水平上下波动,1999年后,有较强的上升趋势。
各年波动有相似性,应当注意是否有一定的周期性因素。
案例:彩电出口.sav
案例:彩电出口.sav(简单指数平滑)
结果分析:
从表看出,最佳平滑常数为
简单平滑法拟合的变量值
简单指数平滑法拟合效果图
从图看出,简单指数平滑法基本能把握序列的变化规律,但预测值均比原值有所滞后。
(五)自回归法
针对模型误差项存在相关性而设计
自回归模型只考虑误差项中的一阶相关性
菜单:Analyze Time Series Autoregression
案例:我国激光唱机出口.sav,对激光唱机出口量
进行分析预测。
案例:我国激光唱机出口.sav(序列图)
案例:我国激光唱机出口.sav(自回归)
自回归拟合效果图
(六)ARIMA模型分析
自回归与移动平均的结合
用于平稳序列或通过差分而平稳的序列分析
菜单:Analyze Time Series ARIMA
案例:我国激光唱机出口.sav
我国激光唱机出口相关图
激光唱机出口量一阶差分
激光唱机出口量一阶差分结果
激光唱机出口量一阶差分序列图
激光唱机出口量一阶差分相关图
激光唱机出口量ARIAM分析
结果分析:
从表看出,各因素的系数显著性较差,可作进一步模
型调整。
激光唱机出口量ARIAM分析(调整)
结果分析:
从表看出,调整后各因素的系数通过显著检验,该模型
可用于预测。
激光唱机出口量MRIMA预测
激光唱机出口量MRIMA预测结果
(七)季节调整法
对时间序列的周期性进行识别和分解。
季节模型通常由季节指数构成,它们能够刻画出现
象在一个周期内各时段的典型数量特征。
菜单:Analyze Time Series
Seasonal Decomposition
案例:鲜苹果出口.sav,
案例:鲜苹果出口.sav(序列图)
由图看出,该序列存在明显周期性特征。
序列存在上升趋势,提示引入趋势因素。
序列上下波动幅度有逐年增大的趋势,提示可采用乘法模型。
案例:鲜苹果出口.sav(季节分析)
分析结果:详细
分析结果:简略
生成误差项、长期趋势、季节指数、循环波动
季节指数线图
五、SPSS在相关与回归分析中的应用
相关分析
偏相关分析
回归分析
曲线估计
(一)相关分析
1、散点图
是根据原始数据,在直角坐标中绘制出两个变量相对应的观察值的所有点,从这些点的分布情况观察分析两个变量间的关系,这个图也称为相关图。
菜单:Graphs Scatter
实例:高校科研研究.sav,研究高等院校人文社科研究中立项课题数受影响的因素及与因素间的关系。
实例:高校科研研究.sav(散点图)
结果分析:
散点图表明,立项课题数、投入具有高级职称的人年数以及论文数之间都有较强的线性相关关系。
(一)相关分析
2、相关系数
相关系数是说明两个变量之间有无直线相关关系及相关关系密切程度的统计指标。
菜单:Analyze Correlate Bivariate
实例:高校科研研究.sav,研究高等院校人文社科研
究中立项课题数受影响的因素及与因素间的关
系。
实例:高校科研研究.sav(相关系数)
结果分析:
结果分析:
由前表可知:立项课题总数与投入高级职称的人年数间的简单相关系数为,与论文数间的简单相关系数为。它们的概率P值都小于显著性水平α,应拒绝零假设,认为两总体之间存在线性相关关系。
(二)偏相关分析
偏相关分析是在控制其他变量的线性影响的条件下,分析两变量间的线性相关,所采用的工具是偏相关系数。
菜单:Analyze Correlate Partial
实例:高校科研研究.sav,研究高等院校人文社
科研究中立项课题数受影响的因素及与因
素间的关系。
实例:高校科研研究.sav(偏相关分析)
结果分析:
结果分析:
由前表可知:在投入高级职称的人年数作为控制变量的条件下,立项课题总数与论文数间的偏相关系数为。它们的概率P值都大于显著性水平α,应接受零假设,认为两总体之间不存在线性相关关系。与前分析差异很大。
分析原因发现,投入高级职称的人年数对立项课题总数有很大影响,该因素也充分作用在发表论文上,并对发表论文数起了决定性作用。
通过该分析可以看到,偏相关分析对辨别变量间的虚假相关有极为重要的作用。
(三)回归分析
回归分析就是对具有相关关系的两个或两个以上变量之间数量变化 的一般关系进行测定,建立一个相应的数学表达式,以便从一个已知量来推测另一个未知量,为估算预测提供一个重要的方法。
1、线性回归分析
菜单:Analyze Regression Linear
实例:高校科研研究.sav,研究高等院校人文社科研究中立项课题数受影响的因素,用线性回归分析法进行分析。
实例:高校科研研究.sav(线性回归)
结果分析:
由表可知,回归方程经过六步完成,随着解释变量(自变量)的不断减少,方程的拟合优度下降了。
结果分析:
从方差分析表看出,回归方程显著性检验的概率P小于显著性水平α,因此,被解释变量与解释变量间线性关系显著,且最后一个模型F值最大。
结果分析:
由表可知,前五个模型中除投入人年数外,其它变量的偏回归系数都不显著。
结果分析:
此表展示了变量剔除过程。
由表可知,随着标准化预值的变化,残差在0线(正态分布)周围随机分布,基本满足线性回归的基本条件。
结果分析:
结论:
由分析可知,回归方程为:
立项课题数=+投入人年数
(四)曲线估计
可线性化的非线性回归
菜单:Analyze Regression Curve Estimation
实例:人均消费支出和教育支出.sav,研究居民家庭消费
支出和教育支出的关系。
实例:人均消费支出和教育支出.sav(散点图)
实例:人均消费支出和教育支出.sav
结果分析:
Cubic
Compound
Power
Quadratic
Quadratic
Cubic
Compound
Power
Quadratic
Cubic
Compound
Power
结果分析:
由前系列表可知,消费支出和教育支出的回归方程为:
谢谢观看,祝一切顺利
结果分析:
由前系列表可知,消费支出和教育支出的回归方程为:
结果分析:
由前系列表可知,消费支出和教育支出的回归方程为:
结果分析:
由前系列表可知,消费支出和教育支出的回归方程为: