第28卷第3期徐州工程学院学报(自然科学版)2013年9月Vol. 28 Journal of Xuzhou Institute of Technology CNatural Sciences Edition) 对数线性模型的统计信息功能胡桂华陈新华2(1.重庆工商大学数学与统计学院,重庆400067 ;2.广西财经学院,南宁530003) 摘要:通过一个四维列联表算例研究了对数线性模型在统计分析中的信息功能.结果表明z对数线性模型可通过拟合优度统计检验发现多维分类变量中存在的统计独立关系;可通过参数估计分别针对列联表的每一个组格回答各个单个变量以及2个、3个、4个变量的各种交互对形成该组格概率的贡献;无法提供变量问统计相依程度强弱的信息.关键词:对数线性模型;分类变量;多维列联表中固分类号:F222文献标志码:A文章编号:167 4-358X(2013) 03-0014-07 表1显示了现有对某地区人口普查日应该进行普查登记的全体人口34000人的调查资料.该资料是对表1各种类型人口普查登记表单位z人性别年龄受教育程度在人口普查中是否进行了登记w合计是<t=1) 否<t=2) Z y z 男。~14岁文盲半文盲Ck=1)1 193 179 1 372 (;=1) Cj=1) 小学及初中Ck=2)2 620 292 2 912 高中及以上Ck=3)。。。15~59岁文盲半文盲Ck=l)413 177 590 Cj=2) 小学及初中Ck=2)2 790 1 085 3875 高中及以上Ck=3)1 117 503 1 620 60岁及以上文盲半文盲Ck=1)597 141 738 Cj=3) 小学及初中Ck=2)4650 1 163 5 813 高中及以上Ck=3)886 194 1 080 女。~14岁文盲半文盲Ck=l)1014 76 1 090 (;=2) Cj=1) 小学及初中伪=2)Z 285 145 2430 高中及以上Ck=3)。。。15~59岁文盲半文盲Ck=1)335 111 446 Cj=2) 小学及初中Ck=2)2701 807 3 508 高中及以上Ck=3)1 094 346 1440 60岁及以上文盲半文盲Ck=l)743 121 864 Cj=3) 小学及初中Ck=2)4420 842 5262 高中及以上Ck=3)816 144 960 i口达计27200 6800 34000 注:文盲半文盲包括两部分人,即0~6岁人口与6周岁以上的文盲半文盲人口.收稿日期:2013-03-28基金项目:教育部人文社会科学研究规划基金项目(13YJA910004);国家社会科学基金项目(10XTJ003川全国统计科学研究计划重点项目C2012LZ044) ;全国统计科学研究计划重大项目C2009LD003);国家统计局委托项目(人口普查的事后质量抽查,2011);广西自然科学基金项目C2010GXNSFA013107);广西教育厅科研项目C201012MSllO)作者简介:胡桂华(1963一),男,湖北武汉人,教授,博士,硕士研究生导师,主要从事人口普查质量评估方法研究. 14
胡桂华,等2对数线性模型的统计信息功能总体中的每一个人调查其是否在人口普查中进行了登记以及该人的性别、年龄、受教育程度这3个人口统计特征以后进行分组整理的结果.这里关心的是性别、年龄、受教育程度这3个变量各自与"在普查中是否登记"这个变量是统计相依还是统计独立,若是统计相依,那么它们中哪一个与"在普查中是否登记"的相依关系最强,哪个次之,哪个最弱[IJ研究人员【2-3J决定选用对数线性模型做分析,本文对数线性模型能否对上述问题给出满意的回答进行了探讨.1 四维列联表的对数线性模型 对数线性模型:组格理论频数的对数的数据结构模型表1是由4个变量x,y、z、w进行交叉分组所形成的列联表,是一个四维列联表.这里用工、y,z、ω各自的组标i、j、h、t来表示表中的某一个组格,记πìjkt为普查应登记的人口总体中任意一个人落入组格ijkt(i= 1,2 ;j= 1 ,2 ,3 ;k= 1 ,2 ,3 ;t=l ,2)的概率,nijkt为n=34 000次观察中在组格ijkt"成功"的次数(η严格地说应写作n...,足标的4个点分别表示对移动足标i、j、k,t求和).于是,各组格频数(即"成功"次数)的期望值E(叫缸)= 34 0001["i卢.今后把这个期望频数记做J.!ijkt,与实际频数nijkt相对应,称μ叨的为理论频数.现在来考虑怎样写出理论频数μijkt的数据结构.所谓μ仰的数据结构,指的是把μijkt分解成在基础水平的基础上层层施加Z、y、z,W这4个变量各自的影响以及由它们的某2个的联合、某3个的联合以及它们4个的联合所形成的各种交互影响后所写出的μ仙与上述分解结果之间的适当等式关系.上面所说的"基础水平",用所有μ协(i=l,2;j=1 ,2,3 ;k=l ,2 ,3; t=1,2)的几何平均值表示.这里的平均值之所以不采用算术平均,是因为无论各个μz卢怎样变化,它们的算术平均数恒为1.与基础水平的几何平均形式相对应,各个变量的影响量也要用变量引发的理论频数数据水平与基础水平之商(而不是之差)来表示;将这个影响量施加于基础水平上面的时候要采用相乘的模式(而不是相加的模式).这样一种数据结构形式,在代数处理上显然很不方便.于是,对μ'}的以及它的数据结构式取对数.这样一来,数据结构式中的相除关系变成了两个对数的相减关系,而相乘关系则变成了两个对数的相加关系.这样,便从μ仰的数据结构派生出具有线性形式的lnμz卢的数据结构,称其为对数线性模型.它是ln μijkt = + f +λf十足+λ~+Àf/十λfkZ+À~十λ7k+ ],’ + k:" + wA;tz十Àij~W+ À:e十λ;w+λ;17抽,(1) 立有时为了便于书写,把上式简便地写为ln μijkt = + X + y + Z十w+ XY + XZ + XW + YZ十YW+ZW十XYZ + XYW + XZW + YZW十XYZW,后者并不是一个新的公式,只是前者的一种"简体字",其实就是式(1).例如,当写出XYZ的时候,实际上所写相当于为λr,所以不给它新的公式标号.式(1)中各种记号的含义如下:λ是lnμ叨的的基础水平,是用表1中所有36个lnμ纱的值计算的算术平均数;λ?是变量z的第i水平对lnμz卢的影响量,是表1中足标i为指定数值的所有lnμijkt的值计算的算术平均数与A之差(λ1、λ;、À:"同理);λ;y是变量Z的第i水平和变量y的第j水平对lnμ仙的交互影响量,是表1中足标z和1为指定数值的所有lnμ仰的值计算的算术平均数与λ7、λ了以及λ之差(À;k,À;;"、À7k, ],’ ,Àk:"同理);λ;T是变量工的第i水平、变量y的第j水平以及变量z的第h水平对lnμijkt的交互影响量,是表1中足标i、j和h为指定数值的所有lnμijkt的值计算的算术平均数与Àf、AY、挝、厅、AZ、研以及A之差(Àij~W,À~~w、À]:,W同理);Àij)~w是变量Z的第t水平、变量y的第j水平、变量z的第h水平以及变量w的第t水平对lnμijkt的交互影响量,可在式(1)中将等号右边的所有其它各项移到等号左边推出.对数线性模型式(1)满足下列约束条件: 15
徐州工程学院学报(自然科学版)2013年第3期~Àf = ~À;? = ~月=~À:' = ~λ;tz=2λZZU z 2JAZZU=ZA;17四=0~Àì = ~Àty = 三JAff= 2λT Z EJAr = 2λ;?回= 三JA主产=~λ;t;四=0 (2) ~Àk = ~Àf = ~λ主=~Àk:" = ~λ;tz zZA矿工2λZf=ZmE=O~À;V = ~À:' = ~Àf," ~Àk:" ~Àij~W ~λZ即=~À主f=2Jmw= 对数线性模型体系在lnμ仰的数据结构式(1)中,包含有x,y、z、w这4个变量各自的影响量以及由它们的某2个的联合、某3个的联合以及它们4个的联合所形成的各种交互影响量.其中的这些交互影响量,可能全都不为0,也可能某一个为0,或某2个为0,或更多个为O.把所有这些可能的情形全部列示出来,得到lnμ仰的若干个数据结构式,就形成了对数线性模型体系.张尧庭[4J介绍了三维列联表的对数线性模型体系以及体系中每个模型的统计意义.四维表体系中包含80个模型.为节省篇幅,这里只写出其中的第77、79和80模型,并给出其统计意义.模型77:ln μz卢=À+X+Y+Z+W+XY十XZ+XW+ YZ +YW + ZW+ XYZ十XYW+YZW.统计意义:给定y时x,Z、w中两两配对的优比分别对第3变量的不同状态取相同的值.模型79:ln μijkt =λ十X十Y十Z+W十XY十XZ+XW+YZ +YW +ZW+ XYZ+ XYW+ XZW+YZW. 统计意义:x,y,z、四中两两配对的优比分别对另外2个变量两两配对搭配的不同状态、取相同的值.模型80:1nμz卢=À+X+Y十Z+W+XY十XZ+XW+ YZ + YW + ZW+ XYZ+ XYW十XZW+YZW十XYZW.显然,该模型就是式(口,是对产生数据的现实世界的最一般的描述.把模型80叫做饱和模型,其他的79个模型叫做简约模型.四维表对数线性模型体系比三维表体系要繁杂得多.因此,有些研究人员在面临高维表分析任务的时候常常会采用折叠表的手段将高维表压缩成低维表.张尧庭[4J指出,这样做的结果相当于只对高维表的边缘分布进行分析,往往会导致不正确的结论,因此是不可取的.2 四维列联表对数线性模型的拟合优度检验模型80是由x,y,z、w四变量的影响形成数据lnμ仰的最一般数据结构形式.由于它是最一般的数据结构形式,所以现实世界是一定能够用它来描述的.这里关心的问题是,现实世界除了用模型80描述以外,是否同时还能够用另外的某个简约模型来描述?假若能够,就说这个简约模型与模型80没有差异.当1个简约模型与模型80没有差异的时候,就意味着现实问题中x,y,z,w四变量之间具有由该简约模型所提示的统计性质.在这里有下列原则:当1个简约模型与饱和模型(或者与1个比它复杂的简约模型)没有差异时,应当本着精简原则,用这个简约模型来描述现实世界;当1个简约模型与饱和模型(或者与1个比它复杂的简约模型)没有差异的假设被拒绝时,应当本着信息完整原则,用饱和模型(或者被比较的那个复杂的简约模型)来描述现实世界.四维列联表对数线性模型体系拟合优度检验町,就是要对简约模型1~79逐个进行检验,看它们各自与模型80是否没有差异.换句话说,就是要分别针对原假设"Ho:XX简约模型与模型80没有差异"进行79个显著性检验.完成上述检验所使用的检验统计量叫做似然比χ2统计量.在这里,首先定义似然比统计量11,它是所针对的检验中Ho成立时的似然函数与Ho不成立时的M然函数之比;其次引出似然比χ2统计量,它是A的自然对数的2倍的相反数,即称-21n 11为似然比χ2统计量.可以证明,一21n11的极限分布是自由度为特定数值的χ2分布.在这里,随着被检验的简约模型的不同,自由度的数值有所不同.对数线性模型的拟合优度检验可以用SPSS统计软件完成.在做79个中的每一个检验的时候,统计软件都会给出针对该检验的似然比x2统计量一21n11的样本值、似然比χ2统计量一21n11的自由度、以及由似然比χ2统计量一21n11的样本值所 16
胡桂华,等:对数线性模型的统计信息功能截断的上述自由度的χ2分布的右尾面积(称做Sig或P值).将这个面积数值与给定的显著水平比较,当它小于给定的显著水平时可以拒绝原假设.用IBMSPSS Statistics 统计软件进行79个统计检验操作的结果表明,除了模型77和79以外,其它的简约模型与模型80元差异的原假设都被拒绝.这里只列示统计软件给出的模型77和79的检验结果,如表2.表2拟合优度检验不能拒绝原假设的2个模型似然比卡方分布样本值截断的卡方是否拒绝原假设模型编号原假设卡方样本值自由度分布图右尾面积Sig(α工)77 77和80元差异 不能拒绝79 79和80元差异1. 392 4 不能拒绝上述检验结果意味着,产生样本数据的现实世界可以用模型77或模型79来描述.现在想要进一步知道,在模型77和模型79中,用哪一个来描述现实世界更好些.这就要对这2个模型进行拟合度比较的检验[6~7J检验所针对的原假设是:Ho:模型77与模型79没有差异,如果这个假设被拒绝,意味着现实世界应当用模型79来描述;反之,如果这个假设未能被拒绝,意味着现实世界应当用模型77来描述.与这个原假设相应的似然比卡方统计量是:21n 11 (模型77对模型79)=[-21n11(模型77对模型80J-[ -21n 11(模型79对模型80J=-1. 392=0. 799. 自由度是:[模型77的自由度一模型80的自由度J-[模型79的自由度一模型80的自由度J=(6-0)一(4一0)=2.对于的显著水平标准,自由度为2的卡方分布的临界值是,检验统计量的样本值小于临界值,落在接受域,(从p-值来说,所截断的自由度为2的卡方分布的右尾面积大约是,大于显著水平标准日,所以,模型77与模型79没有差异的原假设不能被拒绝.这意味着,现实世界应当用模型77来描述.对于上面的计算过程做三点说明:其一,在80个模型的各大类之间,越是简约的类的21n 11的值以及自由度的值一定会越大;其二,注意到模型77与模型79分属于2个不同的大类,2个(或几个)同时被接受的模型一定不会属于同一个大类,因为同一个大类中的某2个(或某几个)模型,会与前面适当的更简约的类中的某1个模型等价;其三,上面的算式,一定是模型77的似然比卡方样本值、自由度与模型79相减,而不能倒过来.3 对数线性模型意义3. 1 模型77的统计意义解读现在,通过对数线性模型的拟合度检验已然确认由人口的性别、年龄、受教育程度以及在人口普查中是否登记这4个变量所形成的表1中的lnμ仰的数据结构宜用模型77来描述.于是,下面就需要考察从模型77能够得到什么信息.模型77ln μ"的=λ+Àf+ J +心+λ:v+λf/+ ;k + ;" + Jk +λ),"+λk:' + ’:Jz + Àij~w +λJk:" , (3) 是在饱和模型80中交互项XZW和XYZW为O所得到的简约模型.这里,4个变量的意义分别是:X为性别。为年龄归为受教育程度;w为在人口普查中是否进行了登记.模型77的统计意义表述为:给定y时X,Z、w中两两配对的优比分别对第3变量的不同状态取相同的值.下面来解读这句话.这句话有3层意思:首先,要求分别在年龄y为0~14岁、15~59岁、60岁及以上这3种不同的情况下来谈问题;其次,在3个年龄组内分别有3种优比,即给定z考虑z与w之间关系的优比、给定Z考虑z与 17
徐州工程学院学报(自然科学版)2013年第3期w之间关系的优比以及给定w考虑Z与z之间关系的优tt;再次,在同一个年龄组内,上述3种优比都有这样的性质,即该种优比的给定值变量的不同给定值下分别计算的该种优比的各个结果相等.分别地看这3种优比,现在来说给定z考虑z与W之间关系的优比.一般地,记πZL川t为给定y,并且在变量工、z、w中给定z的取值的条件下z取z而w取t的概率;记π川tω[Jiβj]为给定y,并且在变量工、,Z、1vω中给定z的取值的条件下Z取i而w取(ωt+1υ)的概率;记π肌什lJ[ωj]仙为给定y川,并且在变量工、Z趴、t吼w且v中给定z的取值的条件下Z取(μi+lυ)而w取t的概率;川i己π忡lJ[jω1ω叶l为给定y,并且在变量工、z、w中给定z的取值的条件下Z取Ci+1)而w取(t+1)的概率.用这些记号来定义给定y,并且在变量X,Z、w中给定z的取值的条件下用以描述变量工与变量w之间统计相依性的优比比川剧·它是7r;. _ 】丘旦L且~-(4) 7r;+1 [jJW<+1 式(4)中各个记号的足标中,用圆括号来表示变量工、z、w中工和w这2个变量配对以后余下的给定取值的第3个变量Z,用方括号来表示变量X"Z"W以外取给定值的第4个变量y.当在0~14岁的人口中来谈问题的时候,式(的中各个记号方括号内的足标j一律为1.式(4)是给定z考虑x与w之间关系的优比,须分别就受教育程度z(给定为文盲半文盲、给定为小学及初中、给定为高中及以上)的3种情形进行计算.与这3种情形相对应,式(4)中各个记号圆括号内的足标h分别为1、2、3.模型77的统计意义告知,由式(4)定义的优比在0~14岁的人口中有α川(1)tα'[IJ山=α'[IJ(川·当在15~59岁人口中来谈问题的时候,由式(4)定义的优比有αi[2]{l)t=ai[巾),α'[巾),.当在60岁及以上人口中来谈问题的时候,由式(4)定义的优比有αi[3J(J)(α'[巾"α'[巾),.这3个等式意味着什么呢?试考察αl[l](l)t.它的分子是0~14岁文盲半文盲男性人口在人口普查中进行登记的概率与未进行登记的橄率之比,它的分母是0~14岁文盲半文盲女性人口在人口普查中进行登记的概率与未进行登记的概率之比,分子分母分别是0~14岁文盲半文盲男性人口与女性人口在普查中登记比不登记的优势,α川(1)1则是两个优势之比(优比).当这个优比的值等于1时,意味着任意的1个0~14岁文盲半文盲人口在普查中登记比不登记的优势与性别无关,这表明性别(x)与是否在人口普查中进行了登记(w)独立;优比的值不等于1则表明z与w统计相依;优比的值距离1越远,表明z与w统计相依的程度越强.3个等式中的其他优比比[1J(川、αi[1](3)t"Gi[2]{l)t、α'[加),、α1[2J(3)(、α1[3J(1)t’\ Gi[3](川、α'[巾汩的意义与α川(1)/相仿.不幸的是,现在并不知道这9个优比的值究竟是多少.所以,现在不知道在各个年龄组中z与w之间关系的状况(独立,还是较弱的统计相依,还是较强的统计相依?3个年龄组之间的优比不一定相等,3个年龄组中Z与w关系的情况不一定相同),而3个等式只是告诉我们,在给定的年龄下,无论性别Z与是否在人口普查中进行登记w之间具有何种关系,2变量之间的这种关系不会因受教育程度的不同而改变.现在再来说给定z考虑z与w之间关系的优比以及给定w考虑z与z之间关系的优比.对于前者,模型77的统计意义告知,在给定的年龄下,无论受教育程度z与是否在人口普查中进行登记w之间具有何种关系,2变量之间的这种关系不会因性别的不同而改变.对于后者,模型77的统计意义告知,在给定的年龄下,无论性别Z与受教育程度Z之间具有何种关系,2变量之间的这种关系不会因是否在人口普查中进行登记的不同而改变.本文开头提出的问题是t性别工、年龄y、受教育程度Z这3个变量各自与是否在人口普查中进行登记w之间具有何种关系.假若经过拟合优度检验选定的不是模型77而是比它更简约的其他某个模型,那么可以明确地得到变量之间独立关系的信息.现在,模型77的统计意义中没有关于独立性的表述,言外之意就是说,x,y、z,W之间不存在任何的独立性关系,所存在的是这种或那种程度的统计相依关系.至于说想要知道的事情:x,y、z这3个变量与w之间的统计相依程度哪个最强,哪个次之,哪个最弱,从模型77的统计意义中无法得到对这个问题的满意回答. 模型77的参数估计结果模型77的参数估计结果已经在进行关于模型77与模型80是否有差异的检验的时候由计算机一并给 18
胡桂华,等2对数线性模型的统计信息功能出.如表3.表3模型77的参数估计结果参数估计值参数估计值参数估计值常量λ λIt ik=11 λ~ll ijk=111 o. 751 i=l ik=12 ijk= 112 λf i=2 ik=13 ijk= 113 j=l 一=21 ijk=121 λ1 j=2 ik=22 ijk= 122 j=3 ik=23 ijk= 123 k=l o. 103 jk=11 ijk=131 -1. 189 .u λff k=2 1. 793 jk=12 ijk= 132 k=3 一 jk=13 一= 133 1. 199 λF t=l 1. 768 jk=21 一 ijk=211 t=2 一 jk=22 ijk=212 λti" it=11 jk=23 ijk= 213 o. 751 it= 12 jk=31 一=221 it=21 jk=32 ijk=222 it=22 jk=33 ijk=223 jt=11 -1. 464 λ孩Ujkt=l11 ijk= 231 1. 189 λF jt=12 1. 464 jkt= 112 ijk=232 jt=21 jkt= 121 ijk=233 一 λaqyt zu jt=22 jkt= 122 ijt=l11 jt=31 一= 131 ijt= 112 jt=32 jkt= 132 ijt= 121 λil" kt=11 jkt=211 ijt= 122 o. 013 kt=12 jkt= 212 ijt= 131 kt=21 o. 109 jkt= 221 ijt= 132 kt=22 o. 109 jkt=222 ijt=211 kt=31 一=231 ijt= 212 kt=32 jkt= 232 ijt=221 λy ij=11 jkt=311 一=222 一 ij=12 一=312 ijt=231 ij=13 jkt= 321 一=232 ij=21 jkt=322 ij=22 jkt=331 ij=23 jkt=332 记lJ走t格的组格概率为πijkt,记总样本量n=34000,按照对数线性模型中的定义,有μijkt= n7Cijkt ,于是,由式(3)(即模型77)写出1nn πijkt = -X ; X X eλk X ’; X ’[/ X Ø’: X Ø":" X é立;’ X ,!: X X eλij~W X e fi;V ( 5 ) 由式(5)及表3可知,表1各个组格的组格概率是怎样在基础水平的基础上施加各个变量以及官们的交互作用的影响而最终形成的.例如,在i=2,j=3,走=2,t=1(即,女性,60岁及以上,小学及初中,进行普查登记)4941一组的组格概率大致是在阳的基础上先后乘以、e川74、、、E川64、、、飞 19
徐州工程学院学报(自然科学版)2013年第3期, e 、E一等13个影响项以后形成的.进一步还可以对这13个影响项按影响作用的、、大小进行排序.这就是模型77的参数估计结果能够告诉的信息.显然,参数估计结果依然不能回答最关心的关于x,y、z这3个变量与w之间的统计相依程度哪个最强,哪个次之,哪个最弱这个问题.事实上,这个问题可以通过计算优比得到回答.笔者在另外的研究中对此作了论述.4 结论对数线性模型是筛选多元分类变量中存在的独立性关系的有力工具,它可以对变量间的元条件独立关系以及在给定其它变量取值的条件下的有条件独立关系做出细致的分析;对数线性模型可以给出多元分类变量联合概率分布中各个联合概率的数据结构模型,从而对每一个联合概率中各个单个变量的影响量以及变量的各种交互影响做出分解;对数线性模型无法对具有统计相依关系的分类变量间的相依程度做出描述.参考文献:[lJ Mary H M, Tamara S A. Overview of evaluations of the 2010 census coverage measurement program[J]. Section on Survey Research Methods-Jsm, 2009(8) : 3117-3128. 【2J陈文,俞顺章.Cox回归模型与对数线性回归模型在生存分析中应用的比较口].中国卫生统计,1997,14(4):16-18.[3J曹秀堂,李绍奎.对数线性模型处理大型列联表资料的方法口].中国卫生统计,1992,9(5):30-33. [4J张尧庭,定性资料的统计分析[M].桂林:广西师范大学出版社,1991.[5J李春红.对数线性模型在定性资料中的应用研究[0].南宁:广西大学,2011.[6J张忠平.线性回归模型与对数线性回归模型的优选:几种简便的检验方法的运用口J.统计研究,1993(1):57-59. [7J张岩波,何大卫.对数线性模型的最优模型筛选策略[JJ.中国卫生统计,1996,13(6): Information Functions of Log-linear Model 1 2 HU Gui-hua,CHENG Xin-hua(l. Schoo\ of Math and Statistics, Chongqing Techno\ogy and Business University, Chongqing 400067, China; 2. Guangxi University of Finance and Economics, Nanning 530003, China) Abstract: The paper discusses the information function in statistical analysis of log-linear models through an example of four dimension contingency table. Research shows that log-linear models can help find out the statistical independence relationship that exists in the multidimensional classification variables through a goodness-of-fit statistic test ;log-linear models can help work out the lattice probability contribu›tion of various interaction group formed by individual variable as wel1 as two, three, four variables through the parameter estimation for each group lattice of contingency table; log-linear models can not provide strength or weakness information of statistical dependence between variables. Key words: log linear model; class variable; multidimensional contingency table (编辑徐永铭) 20