第三章
SPSS
数据的预处理
为什么要进行数据的预处理
在数据文件建立之后,通常还需要对分析的数据进行必要的预加工处理,这是数据分析过程中必不可少的一个关键步骤。
数据的预加工处理服务于数据分析和建模,主要包括以下几个问题:
数据的排序
变量计算
数据选取
计数
分类汇总
数据分组
数据预处理的其他功能:转置、加权、数据拆分、缺失值处理、数据排秩、定义变量集。
预处理的内容
数据的排序
SPSS
的数据排序是将数据编辑窗口中的数据按照某个或多个指定变量的变量值升序或降序重新排列。这里的变量也称为
排序变量
。排序变量只有一个时,排序称为
单值排序
。排序变量有多个时,排序称为
多重排序
。多重排序中,第一个指定的排序变量称为
主排序变量
,其他依次指定的变量分别称为
第二排序变量
、
第三排序变量
等。
数据排序便于数据的浏览,有助于了解数据的取值状况、缺失值数量的多少等;
通过数据排序能够
快捷找到
数据的最大值和最小值,进而可以计算出数据的
全距
,初步把握和比较数据的
离散程度
;
通过数据排序能够快捷地发现数据的
异常值
,为进一步明确它们是否会对分析产生重要影响提供帮助。
数据排序的目的
表
3-1
数据排序举例
SPSS
数据排序的基本操作步骤
(
1
)选择
菜单数据
-排序个案
(
2
)将主排序变量从左边的列表中选
到
排序依据
框
中,并
在
排序顺序
框
中选择按该变量的升序还是降序排序。
(
3
)如果是多重排序,还要一次指定第二、第三排序变量及相应的
排序顺序。
数据排序的基本操作
在左边的
源变量框
中选择排序变量进入
Sort by
框
。如果选择
2
个以上的变量
,列
于首位的为第一排序变量。
在
Sort Order
栏
内选择排序方式
——
升序与降序
1
、数据排序是整行数据排序,而不是只对某列变量排序;
2
、多重排序中指定排序变量的次序很关键。先指定的变量优先于后指定的变量。多重排序可以在按某个变量值升序(或降序)排序的同时再按其他变量值降序(或升序)排序;
3
、数据排序后,原有数据的排序次序必然被打乱。
说明
数据
排序应用举例
利用商品房购买意向的调查
数据,通过数据排序功能分别
找到出租房和自有房中住房开销的
最大值和
最小值。
变量计算
变量
的
转换处理是在原有数据的基础上,计算产生一些含有更丰富信息的
新变量。
例如根据职工的基本工资、失业保险、奖金等数据,计算实际月收入,这些新变量具有更直观更有效的特点
。
可以对变量的分布进行变换。如利用对数或多项式变换对非正态或非线性数据进行处理;对时间序列进行平稳化处理;利用区间变换调整数据的取值范围等等。
变量计算的目的
SPSS
变量计算是在原有数据的基础上,根据用户给出的
SPSS
算术表达式以及函数,对所有个案或满足条件的部分个案,计算产生一系列新变量。
(
1
)变量计算是针对所有个案(或指定的部分个案)的,每个个案都有自己的计算结果。
(
2
)变量计算的结果应保存到一个指定变量中,该变量的数据类型应与计算结果的数据类型相一致。
在变量计算过程中涉及到几个概念:
SPSS
算数表达式、
SPSS
条件表达式和
SPSS
函数。
指出按照什么方法计算变量;
SPSS
算术表达式(
Numeric Expression
)是由常量、变量、算术运算符、圆括号、函数等组成的式子。
字符型常量应当用引号括起来
变量是指那些已存在于数据编辑窗口中的原有变量
算术运算符主要包括
+、-、*、
/
、**
(乘方)
在同一算术表达式中的常量及变量,数据类型应该一致,否则无法
计算。例如:根据第
2
章职工基本情况数据计算职工实际收入的算术表达式为
sr-bx
。
SPSS
算术表达式
在变量计算中通常要求对不同的个案分别按照不同的方法进行计算,于是就需要通过一定的方式来指定个案;
SPSS
条件表达式是一个对条件进行判断的式子。其结果有两种取值:如果判断条件成立,则结果为真;如果判断条件不成立,则结果为假。条件表达式包括
简单条件表达式
和
复合条件表达式
。
SPSS
条件表达式
(
1
)简单条件表达式
由关系运算符、常量、变量以及算术表达式等组成的式子。其中关系运算符包括
>
、
<
、=、~=(不等于)、
>
=、
<
=
。(
nl
>35
)
(
2
)复合条件表达式
又称逻辑表达式,是由逻辑运算符号、圆括号和简单条件表达式等组成的式子。其中,逻辑运算符号包括
&
或
AND
(并且)、
|
或
OR
(或者)、~或
NOT
(非)
。
NOT
的运算优先级最高,其次是
AND
,最低是
OR
。可以通过圆括号改变运算的优先级。(
nl
<=35
)
and not
(
zc
<3
)
SPSS
函数是事先编好并存储在
SPSS
软件中,能够实现某些特定计算任务的一段计算机程序。这些程序都有各自的名字称为
函数名
。执行这些程序段得到的计算结果称为
函数值
。
函数书写的具体形式为:
函数名(参数)
SPSS
函数
其中,函数名是
SPSS
已经规定好的,参数可以是常量(字符型常量应用引号括起来),也可以是变量或算术表达式。参数可能是一个,也可能是多个,各参数之间用
逗号
分隔。
SPSS
函数大致可以分成八大类:
算术函数、统计函数
、分布函数、查找函数
、字符串函数、缺失值函数、日期函数和其他函数
。
(
1
)选择
菜单
转换-计算变量
,
弹
出
计算变量
对话框:
变量计算的基本操作
(
2
)
在
目标变量
框
中输入存放计算结果的变量名。该变量可以是一个新变量,也可以是已经存在的变量。如果指定存放计算结果的变量为新变量,
SPSS
会自动创建它;如果指定产生的变量已经存在,
SPSS
会提问是否以计算结果覆盖原有值。新的变量默认为数值型,用户可以根据需要
单击
类型与标签
按钮
修改,还可以对新变量加变量名标签。
(
3
)
在
数字表达式
框
给出
SPSS
算术表达式。可以手工输入,也可以按窗口的按钮以及函数下拉菜单输入。
(
4
)如果希望对符合一定条件的个案进行变量计算,则
单击
如果
按钮
,出现下面的窗口,
选择
如果个案满足条件则包括
选项
,然后输入条件表达式
。
1
、利用职工基本情况数据,依据职称级别计算实发工资。假设职称
1
至
4
职工的工资分别上调
50
%,
30
%,
20
%,
10
%
。
2
、在
计算变量
窗口中输入存放实发工资的变量名
sfgz
,输入计算方法
(
sr-bx
)
*系数,系数因不同职称而不同。
3
、在
如果
窗口中输入条件表达式,选择不同职称的职工分别计算实发工资。
变量计算的应用举例
数据选取
数据选取就是根据分析的需要,从已收集到的大批量数据(总体)中按照一定的规则抽取部分数据(样本)参与分析的过程,通常也
称为
样本抽样
。
SPSS
可根据指定的抽样方法从数据编辑窗口中选出部分样本以实现数据选取,这样后面的分析操作就只针对选出的数据,直到用户取消这种选取为止。
(
1
)选取
全部个案(
All cases
)
(
2
)按指定条件选取
(
If
condition is satisfied
)
SPSS
要求用户以条件表达式给出数据选取的条件,
SPSS
将自动对数据编辑窗口中的所有个案进行条件判断。那些满足条件的个案,即条件判断为真的个案将被自动选取出来,而那些条件判断为假的个案则不被选中。
数据选取的基本方式
(
3
)随机抽样(
Random sample of cases
),即对数据编辑窗口中的所有个案进行随机筛选,包括如下两种方式:
第一,近似抽样
(大约,
Approximately
)
近似抽样要求用户给出一个百分比数值,
SPSS
将按照这个比例自动从数据编辑窗口中随机抽取相应百分比数目的个案。
注:由于
SPSS
在样本抽样方面的技术特点,抽取出的个案总数不一定恰好精确地等于用户指定的百分比数目,会有小的偏差,因而称为近似抽样。
第二,精确抽样(
Exactly
)
精确抽样要求用户给出两个参数。第一个参数是希望选取的个案数,第二个参数是指定在前几个个案中选取。
SPSS
自动在数据编辑窗口的前若干个个案中随机精确地抽出相应个数的个案来。
(
4
)选取某一区域内的样本(
Based on time or case range
),即选取数据编辑窗口中样本号在指定范围内的所有个案,要求给出这个范围的上、下界个案号码
。
(
5
)使用筛选器选取
样本(
Use filter variable
),即依据过滤变量的取值进行样本选取。要求指定一个变量
作为筛选变量
,变量值为非
0
或非系统缺失值的个案将被选中。
这种方法通常用于排除包含系统缺失值的个案。
(
1
)选择
菜单
数据
—
选择个案
(
2
)根据分析需要选择数据选取方法
(
3
)指定
对未选中个案的处理方式
过滤掉未选中的个案
表示
在未被选中的个案号码上打一个
“
/
”
标记;
删除未选定个案
表示
将未被选中的个案从数据编辑窗口中删除。
数据选取的基本操作
说明:
:
(
1
)完成数据选取后,以后的
SPSS
分析操作仅针对那些被选中的个案直到用户再次改变数据的选取为止。
(
2
)采用指定条件选取和随机抽样方法进行数据选取后,
SPSS
将在数据编辑窗口中自动生成一个名为
filter_$
的新变量,取值为
1
或
0
。
1
表示本个案被选中,
0
表示未被选中。该变量是
SPSS
产生的中间变量,如果删除它则自动取消样本抽样。
利用商品房购买意向调查
数据,根据不同的分析要求采用不同的数据选取方法抽样:
(
1
)如果只希望
分析本市户籍的
情况,可以通过数据选择功能采用指定条件的抽样方法进行抽样;
(
2
)如果只希望对其中的
70
%的数据进行分析
,也可
通过数据选择功能采用随机抽样中的近似抽样方法进行抽样。
数据抽样的
应用举例
计数
计数目的
SPSS
的
计数
是计算
若干变量中有几个变量的值落在指定的区间内,并将计数结果存入一个新变量中的过程。例如对大学毕业班学生的成绩进行综合测评时,可以依次计算每个学生的若干门课程中有几门课程得了优,有几门课程得了良,有几门课程不及格。
SPSS
实现计数的关键步骤是:
指定哪些变量参与计数,计数的结果存入哪个新变量中
指定计数区间(尤为关键)
SPSS
中的计数区间可以有以下几种描述形式:
单个变量值(
Value
)
系统缺失值(
System-missing
)
系统缺失值或用户缺失值(
System or user-missing
)
给定最大值和最小值的区间(
n through m
)
小于等于某指定值的区间(
Lowest through n
)
大于等于某指定值的区间(
n through highest
)
计数区间
上述后三个计数区间很容易理解。
例如
评价学生成绩,成绩为优的计数区间可以指定为
90 through highest
,成绩为良的计数区间指定为
80 through 89
,不及格的计数区间指定为
Lowest through 59
。
前三个计数区间实际上是一些离散的数据点,严格讲并不是区间,但
SPSS
仍将其归在广义区间的范畴内,目的是方便一些其他的应用。
(
1
)选择
菜单
转换-对个案内的值计数
,
出现如下窗口:
计数的基本操作
(
2
)将参与计数的变量选到
数字变量
框
中
(
3
)
在
目标变量
框
中输入存放计数结果的变量名,并
在
目标标签
框
中输入相应的变量名标签。
(
4
)
单击
定义值
按钮
定义计数区间,出现如下图窗口:
通过
单击
添加、更改、删除
按钮
完成计数区间的增加、修改和删除。
(
5
)如果仅希望对满足某条件的个案进行计数,则
单击
如果
按钮
并输入相应的
SPSS
条件表达式。否则,本步可略去。
利用商品房购买意向调查数据,分析被访者对商品房价格调控政策的态度。
我们认为
如果被访者赞成有关部门直接干预房价,且认为目前一系列的楼市调控政策对抑制房价上涨效果明显,则认为被访者对调控政策持认可态度。如果计数结果为
2
,意味着被访者持认可态度。
计数的应用举例
分类汇总
分类汇总的目的
分类汇总是按照某分类变量进行分类汇总计算。
例如:某企业希望了解本企业不同学历职工的
基本工资是否
存在较大差距。最简单的做法就是分类汇总,即将职工按学历进行分类,分别计算不同学历职工的平均工资,然后可对平均工资进行比较。
结果如下:
再例如,某商厦希望分析假日周内不同职业和不同年龄段的顾客对某商品的
“
打折促销
”
反应是否存在较大差异,用以分析不同消费群体的消费心理。最初步的分析可以是分别计算不同职业中不同年龄段顾客的平均消费金额和平均消费金额差异程度(标准差),并对它们进行比较。这个过程也可以通过分类汇总过程完成。
SPSS
实现分类汇总涉及两个主要方面:
按照哪个变量(如上例中的学历、职业和年龄段)进行分类
对哪个变量(如上例中的基本工资、消费金额)进行汇总,并指定对汇总变量计算哪些统计量(如上例中的平均工资、平均消费金额和标准差)
(
1
)选择
菜单
数据-分类汇总
,
出现如下所示的窗口:
分类汇总的基本操作
(
2
)将分类变量选
到
分组变量
框
中
(
3
)将汇总变量选
到
变量摘要
框
中
(
4
)
单击
函数
按钮
,指定对汇总变量计算哪些统计量。
SPSS
默认计算均值。
(
5
)指定将分类汇总结果保存到何处。有三种选择:
第一
,
将汇总变量添加到活动数据集,
表示将结果存放到当前数据编辑窗口中。
第二
,
创建只包含汇总变量的新数据集
,表示将结果显示到指定名称的新数据集中;
第三
,写入只包含汇总变量的新数据文件,表示将结果存放到系统默认的名为
的
SPSS
数据文件中,可以单击
文件
按钮,重新指定文件名。
一般
选择后面二
种方式,结果比较清晰。
(
6
)
单击
变量名与标签
按钮
,重新指定结果文件中的变量名或添加变量名标签。
SPSS
默认的变量名为原变量名后加
_
统计量名称(如
a_mean
)
。
(
7
)如果希望在结果文件中保存各分类组的个案数,则
选择
个案数
选项
。于是,
SPSS
会在结果文件中自动生成一个默认名为
N_Break
的变量,可以修改该变量名。
说明:
分类汇总中的分类变量可以是多个,此时的分类汇总称为
多重分类汇总
。如上述不同职业和不同年龄段顾客消费的例子即是多重分类汇总的应用。
类似于数据的排序,在多重分类汇总中,指定多个分类变量的前后次序是很关键的。第一个指定的分类变量为主分类变量(如职业),其他的依次为第二(如年龄段)、第三分类变量等,它们决定了分类汇总的先后次序。
例:利用商品房购买意向调查数据,分析居住在出租房和自有住房的月住房开销是否存在显著差异
?
居住类型为
分类变量
,月住房开销为汇总变量,计算其均值和标准差。
分类汇总的应用举例
分类汇总结果
数据分组
数据分组的方法
数据分组就是根据统计研究的需要,将数据按照某种标准重新划分为不同的组别。在数据分组的基础上进行的频数分析更能够
概括数据
的分布特征。
为适用于不同的统计分析需要,
SPSS
提供了以下几种数据分组方法:
单变量值分组
组距
分组
分位数分组
居民家庭按人口数单项式分组
离散型变量如果变量值的变动范围不大,可以将一个变量值作为一
组。
如右表:
单变量值分
组
SPSS
单变量值分组的基本操作步骤:
(
1
)选择
菜单
转换-自动重新编码
(
2
)将分组变量选择
到
变量-新名称
框
中
(
3
)
在
新名称
框
后输入存放分组结果的变量名,并
单击
添加新名称
按钮
(
4
)
在
重新编码的起点
框
中选择单变量值分组按升序还是按降序进行
。
最低值
表示
升序
;
最高值
表示
降序。
SPSS
的
单变量值分组
单变量值分组举例
单变量值分组应用举例:
1
、利用职工情况数据按职工的基本工资升序进行分组。
2
、按职工的职称升序进行分组。
自动重新编码
在连续型变量或离散型变量值较多的情况下,可采用组距式分组形式。
组距式分组就是把全部变量值划分为几个区间,每一区间的变量值作为一组。如右表:
SPSS
的组距分组
例如:职工基本情况数据,可按基本工资对职工进行分组,见下表:
在组距式分组中涉及
到几
个
关键点
:
a.
组数
:组数的多少
以能
恰当
反映分布特征为
好
。
Sturges
提出的经验公式:
b.
组距
=(最大值
-
最小值)
÷
组数。
一个组的上下限之差。
c.
根据组距各组的组距是否相等,又可以分为等距分组和不等距分组两种方式。
d.
组限
:组距两端的数值称为组限,每组的最大值称为上限,用
U
(
Upper limit
)表示,每组的最小值称为下限,用
L
(
Lower limit
)表示。 统计数据时,注意
“
上组限不在内
”
法则。另外,极端组可采用开放式组距。
e.
组中值
:每组上、下限之间的中点数值。即:组中值
=
(上限十下限)
÷2
。
组数和组距确定后,便可实施分组操作了,在分组操作时应:
指定分组变量
定义分组区间(注意遵循
“
不重不漏
”
原则)
指定存放结果的变量
SPSS
对分组结果有两种存放策略,一种是用分组变量值覆盖原变量(
Into Same Variables
),另一种是将分组结果存到一个新变量中(
Into Different Variables
)。相应的操作也略有差异。通常采用第二种策略。
1
、
覆盖原变量值
的分组
操作
(
1
)选择
菜单
转换-重新编码为相同变量
。
(
2
)在出现的窗口中将分组变量选择
到
数字变量
框
中。
(
3
)
单击
旧值和新值
按钮
进行分组区间定义。
(
4
)在分组区间定义窗口中指定分组区间的下限和上限,并
在
新值
框
中给出该区间对应的分组值。
单击
添加
按钮
确认分组区间并加
到
旧
→
新
框
中。
单击
更改
和
删除
按钮
来修改和删除分组区间。
(
5
)如果仅对符合一定条件的个案分组,则
单击
如果
按钮
并输入
SPSS
条件表达式。否则,本步可略去。
2
、
生成新变量
的分组
操作
(
1
)选择
菜单
转换-重新编码为不同变量
。
(
2
)在出现的窗口中将分组变量选择
到
数字变量
→
输出变量
框
中。
(
3
)
在
名称
(N)
后
输入存放分组结果的变量名,并
单击
更改
按钮
确认。可以
在
标签
后
输入相应的变量名标签。
(
4
)
单击
旧值和新值
按钮
进行分组区间定义(方法与前面相似)。
(
5
)如果仅对符合一定条件的个案分组,则
单击
如果
按钮
并输入
SPSS
条件表达式。否则,本步可略去。
对职工
数据按职工基本工资分别
采用
覆盖原变量值
和
生成新变量
两种
方式进行如下分组:
组距
式分组的应用举例
覆盖原变量值
填写旧值和新值
生成新变量
SPSS
的分位数分组
分位数分组与组距分组很类似,不同的是,各组的下限值和上限值是由分位数决定的,且各分组中的个案数大致相当。
分位数是将全部数据按升序排序并等分成
n
份后相应分位点上的变量值。
SPSS
的分位数分组
(
1
)选择菜单
转换-可视离散化
。
(
2
)选择分组变量到
要离散的
变量
框中,按
继续
。
(
3
)
在离散的变量
(B)
中给出分组后的变量名。
(
4
)在
上端点
框中选择排除(
E
),单击
生成分割点
按钮。
(
5
)选择
基于已扫描个案的等百分位
选项,并在
分割点数量
后输入
3
,单击
应用
按钮返回上一窗口。单击
生成标签
按钮。
点击
确定
按钮,完成分位数分组。也称为
封装
。
转换
-
可视离散化
在离散的变量输入
SR2
,点击上端点
-
排除
单击
生成分割点
,点击
基于已扫描个案的等百分位
,分割点数量填
3
,
单击
应用
按钮
在数据文件中生成一个新的变量
SR2
数据预处理的其他功能
数据转置
SPSS
的数据转置就是将数据编辑窗口中数据的行列互换。基本操作步骤如下:
(
1
)选择
菜单
数据-转置
。
(
2
)指定数据转置后应保留哪些变量,将它们选
入
变量
框
中,未被选中的变量将在新文件中缺失。
(
3
)指定转置后数据文件中各变量如何取名。
选择
一个取值唯一的变量(如职工号)作为标记变量并放
到
名称变量
框
中。转置后数据各变量取名为
K_
标记变量值
(如
K_001
、
K_002
、
K_003
等)。如果略去本步,则转置后数据各变量名默认为
VAR00001
,
VAR00002
,
VAR00003
等。
同时,
SPSS
还会自动产生一个名为
CASE_LBL
的
新变量,用来存放原数据文件中的各变量名。
点击后的结果
转置后的结果
加权处理
统计分析中的加权处理是极为常见的,如计算加权平均数等。
例如,希望掌握菜市场某天蔬菜销售的平均价格。如果仅用各种蔬菜销售单价的平均数作为平均价格就很不合理,还应考虑到销售量对平均价格的影响。因此,以蔬菜的销售量为权数计算各种蔬菜销售单价的加权平均数,就能够较准确地
反映平均
价格水平。
SPSS
中指定加权变量的操作步骤是:
(
1
)打开
蔬菜销售
数据文件,选择菜单
数据-加权个案
。
(
2
)
选择
加权个案
选项
,并将某变量作为加权变量选
到
频率变量
框
中。
注意的是一旦指定了加权变量,那么以后的分析处理中加权是一直有效的,直到取消加权为止。取消加权应选
择
请勿对个案加权
选项
。
例:根据
蔬菜销售量数据对蔬菜
价格进行加权计算。
点击示例
加权后的单价的均值统计结果
SPSS
的数据拆分与数据排序很相似,但有一个重要的不同点,即数据拆分不仅是按指定变量进行简单排序,更重要的是根据变量对数据进行分组,为以后的
分组统计分析
提供便利。
数据拆分
打开职工数据文件
1
、
SPSS
数据拆分的基本操作步骤:
(
1
)选择
菜单
数据-拆分文件
,
出现窗口
(
2
)
拆分会使后面的分组统计产生两种不同格式的结果。其中
,
比较组
表示
将分组统计结果输出在同一表格中,以便于不同组之间的比较
;
按组织输出
表示
将分组统计结果分别输出在不同的表格中。通常选择第一种输出方式
。
(
3
)
将拆分变量选
到
分组方式
框中。
(
4
)如果数据编辑窗口中的数据已经事先按所指定的拆分变量进行了排序,则可以
选择
文件已排序
选项
,可以提高拆分执行的速度;否则,
选择
按分组变量排序文件
选项
。
拆分后的数据文件
2
、说明:
(
1
)数据拆分将对后面的分析一直起作用,即无论进行哪种统计分析,都将按拆分变量的不同组别分别分析计算。如果希望对所有数据进行整体分析,则需要重新执行数据拆分,在数据拆分窗口中
选择
分析所有个案,不创建组
项
。
(
2
)对数据可以进行多重拆分,类似于数据的多重排序。多重拆分的次序决定于选择拆分变量的前后次序。
大量的缺失值会给数据分析带来极大的影响,这就需要采用科学的方法对缺失值进行插补。操作步骤如下:
(
1
)选择菜单
Transform
-
replace missing values
(
2
)将需要插补的变量单击按钮送到
New Variables
框中,该变量自动会生成一个新的变量,变量名为原变量名
_1
(
3
)在
Method
中选择插补方法。
SPSS
缺失值处理
Series mean :
该变量所有非缺失值的均值
Mean of nearby points
:该变量相邻非缺失值的均值
Median of nearby points
:该变量相邻非缺失值的中位数
Linear interpolation
:线性内插法(用缺失值前后两点的中点值做替代,如果前后值有一个是缺失值,则得不到替换值 )
Linear trend at point
:用线性拟合方式确定替代值,自变量为
1-n
的数值。
数据排秩是根据某变量观测值的大小,按一定的顺序排秩,生成一个代表其秩次的新变量,但原始观测值本身顺序不发生改变。操作步骤如下:
(
1
)选择菜单
Transform
-
rank cases
(
2
)将需要排秩的变量单击按钮送到
Variables
框中,该变量自动会生成一个新的变量,变量名为
R+
原变量名;可选择分类变量到
By
框中,如果选择,系统将按照此变量的不同组别分别进行排秩。
(
3
)选择
Assign Rank 1 to
下面的复选框选择排秩的顺序。
(
4
)在
Rank Types
对话框中选择排秩方式;在
Ties
对话框中选择相同观测值排秩方式。
数据排秩
SPSS
变量集
SPSS
变量集是存放许多
SPSS
变量名的集合。
SPSS
变量集包括
系统变量集
和
用户变量集
两大类。
系统变量集
SPSS
事先定义好的的变量集,它包括两个集合,分别名为
ALLVARIABLES
和
NEWVARIABLES
。其中
ALLVARIABLES
变量集中存放数据编辑窗口中的所有变量名,
NEWVARIABLES
变量集中存放数据编辑窗口中所有尚未存盘的新定义的变量名。这两个系统变量集有时包含的变量名是完全相同的。
用户变量集
是用户根据实际需要自己定义的变量集,可以有若干个。如果用户仅希望对
SPSS
众多变量中的某几个变量进行相同的处理及分析,则可以先将这几个变量定义到一个用户变量集中,然后再指定使用这个变量集。于是,在数据处理或分析时,
SPSS
仅显示指定变量集中的变量名,进而大大减少了显示变量的个数,加快了变量选择的操作速度。
1
、
定义用户变量集
SPSS
定义用户变量集的操作步骤如下:
(
1
)选择菜单
Utilities
-
Define Sets
(
2
)在
Set Name
框中输入用户变量集的名称。
(
3
)选择若干变量单击小箭头按钮将它们送到
Variables in Set
框中,表示用户变量集将包含这些变量。
(
4
)单击
Add Set
按钮将定义的用户变量集加到
SPSS
变量集中。
Change Set
按钮可对已定义的用户变量集做修改。
Remove Set
按钮可从
SPSS
变量集中删去某个用户变量集。
2
、
变量集的使用
SPSS
有许多变量集,用户应告知将使用哪个变量集。系统默认使用的变量集是系统变量集。使用
SPSS
变量集的基本操作步骤如下:
(
1
)选择菜单
Utilities
-
Use Sets
(
2
)单击小箭头按钮将需使用的变量集选到
Set in Use
框中。还可将不需使用的变量集从
Set in Use
框中剔出。需要说明的是,在
SPSS
运行过程中应至少有一个变量集正在被使用,因此在
Set in Use
框中应至少有一个变量集。