第五章分类变量的统计描述与参数估计1
单变量频数分析步骤:菜单:Analyze Descriptive Statistics Frequencies 命令实例:对 中的 性别 和 血型 进行频数分析.实例:数据文件记录了110名男童的身高资料,变量groupmid代表所在组的组中值,freq代表组段频数,请求出资料的均数、标准差、中位数和四分位间距. 2
双变量频数分析 交叉分组下的频数分析交叉分组下的频数分析是对两个变量之间关系进行分析,也称为交叉列联表分析,一般应用于定类和定序的变量。若研究的两变量都是定量数据时,通常使用相关分析或者回归分析的方法研究它们之间的关系。一.交叉分组下的频数分析的主要任务1.产生交叉列联表(列联表)交叉列联表是按两种非定距变量对一组个案进行交叉分组所得的频数或频率分布表。若以频率表示,则可以理解为两变量间的联合分布表。其主要功能是分析事物间的关联性,如分析一个行变量和一个列变量的相关性。3
例:对中的 性别 和 血型 两变量描绘交叉列联表。性性 * 血血血血 Crosstabulation血血血血AABBOTotal性性男Count168173172% of %%%%%女Count51222054147% of %%%%%TotalCount67303785219% of %%%%%go交叉列联表的主要组成:1.表头2.行变量3.列变量4.单元格,包括:(1)观察频数(2)期望频数(3)行百分比(4)列百分比(5)总百分比(6)剩余(观察频数-期望频数)等等性性 * 血血血血 Crosstabulation血血血血AABBOTotal性性男Count168173172Expected 女Count51222054147Expected 返回
2.行列变量独立性分析思路:若期望频数分布与实际频数分布越一致,则说明其中一个变量对另一变量的影响越小,即两变量相关性越小,越独立。卡方检验法:检验的零假设为:行列变量之间彼此独立。2检验统计量为:2(f=∑0−f)χefe其中,f0表示实际观察频数,fe表示期望频数。χ2服从自由度为(行数-1)×(列数-1)的卡方分布22(f0−f)χ=∑e的值越小,说明两变量fe独立的概率越大,所对应的P值越大。反之,若两变量不独立,则对应的P值越小。若给定显著性水平α=(或者),当P值<(或者)时,拒绝原假设,即认为行列变量不相互独立,否则,即当P值>=(或者)时,接收原假设,即不能否认行列变量相互独立。5
注意:若交叉列联表中有20%以上单元中的期望频数小于5,则一般不适用于卡方检验。二.交叉分组下的频数分析的操作步骤菜单:Analyze Descriptive Statistics Crosstabs命令例:对中的 性别 和 血型 进行交叉列联表分析。分析 性别 是否与 血型 有关。6
例题结论:第一个表:显示个案的统计数目表。,对于在 性别和血型 的列联表中,有效的个案数为219个,占个案总数的百分之百,缺失值的个数为0,占个案总数的百分之零。总的个案数为219个。第二个表:显示交叉列联表。由 性别和血型 的列联表可知,就所有被调查者来看,有%的人的血型属于A型,%的人属于AB型,%的人属于B型,有%的人属于O型。具体来看,被调查者共有72名男生,占总人数的%,共有147名女生,占总人数的%;在72名男生中,属于A、AB、B、O型血型的人数分别为:16,8,17,31,比例为:% : % : % : %7
(接上)在147名女生中,属于A、AB、B、O型血型的人数分别为:51,22,20,54,比例为:%:15%:%:%第三个表:卡方检验表由卡方检验统计量可知,在的显著水平下,卡方双尾检验值(即P值)为,大于显著水平,因此在的显著水平下,认为性别与血型无关。即认为男性和女性的各种血型的比例是一致的,血型比例不因性别的不同而改变。8
9