[}/ 天津1‘学院学报第19卷第4期1999年7月
JOURNAL OF TIANJIN UNIVERSITY OF COMMERCE Vo1.19 No.4 July 1999
中国消费数据的统计诊断分析
赵 F\ f
丽 ⋯ ⋯ ⋯ ⋯ ⋯00o F 2 2牛
擅 l 利用现代纯计诊断理诗的有效工具.研宽了中田消费敷括 l952 l992年间田民驶
入甚藕与消费藕之
响 . 。
美■调 异常值.
分类号百五了
敷 的各 种移
然距 离
The Analysis of Statistics Diagnosis for the Data of Consumption in
China
Zhao Jinwen
(Budget Division of Tianjin Finance Bureau.Tin njin 300042)
Abatract Using the advanced tools of diagnostic theory of modern statistics.we have re
searched the influence evaltmtioas in establishing the function relationship between the total
national income and total value of consumption Ior data of 1952~ 1992-We have detected the
different kinds of influential points in this simple consumption function,
Key worth outlier,high Leverage caseIinfluential point,W -K statisticjAP statistic{Cook
distance,likelihood displacement
自从凯恩斯(J.M.Keynes)在《就业利息和货币通
论》(1 936)中首创消费函数理论以来 ,消费函数 的研究
一 直是经济学家们十分关注的研究领域 。到 目前为止,
经济学家对消费函数的实证研究都沿着这样一个轨迹
进行:依据古典或现代的宏观和微观经济理论 ,设计一
定形式的消费函数,采集相应变量在一定时期的样本
数据 ,利用数理统计或经济计量方法来拟舍经验消费
函数,尔后分析与消费函数密切相关的经济变量问的
依存结构关系,预测束来社会的消费行为。我们认为,
上述 传统的”研究方式存在一个 明显的缺结:它将该
时期有关经 济变量 的样本观测 值作为一个整体来对
待,未能考虑各个样车数据问的个体差异对拟合经验
消费函数的影响。本文利用统计诊断理论的有效工具,
研究了中国消费数据 1 952~1992年问国民收入总额
(x)和消费额(y)之间函数关系式确立的影响度量 ,具
体诊断出了这种简单消费函数的各种影响点
收稿 日期 t1999-05-10
1 预备知识
我们讨论下述一般的线性回归模型:
Y — Xu+ e,e~ (0, I ) (I)
其中.y为 X 1观测向量,X一(1 X)为n×( 一
I)列满秩设计阵,l 一 (1,⋯,I), 一 (口, )为未知
参数 向量,e为 一X I随机扰动误差。
1.1 异常值点及其判定准则
称 一y 一 ,i— I,⋯ ,n (2)
为第 i次观测的普通残差(Ordinary Residuals),残差
取大值的观测点称为该模型下的异常值点 (Outlier)
又记
H = (^,,)⋯ = ( t ) , (3)
并称 H 为“帽子矩阵”。可以证 明,H 中主对角元素 h .
与残差 d.满足关系 :
维普资讯
Var(d.)一 (1一 h ),i: 1,⋯ ,n (4)
此式证明每个观测点的普通残差的方差不满足齐性条
件,而与因变量 y的度量单位和帽子矩阵的主对角元
素有关,因而不宜直接比较普通残差 d.的大小来判定
异常值点 。下述学生化残差(Studentized Residuals)有
助于克服这种缺陷。
删 怖 一 ; 1+⋯ 。n (5)
一 ———— === . : l,⋯ ,n (6)
;( )√l—h,.
为学生化内残差和学生化外残差。这里, 一 ll y一
/(n— P一 1)为模型 (1)下 的无 偏估计,而
o(i)。为在模型(1)中剔除第i观攮I点后求得的 的无
偏估计 .满足 :
) 一 当P (7) 一 一Z
在正态性假定 e~N(O,a2I )下,可以证明
南 ~占(专,半 ) (8)
t ~ F(1,”一 P一 2) (9)
这里 ,B(n , )表示 自由度 为(n ,n 2)的 Beta分布,
F(n , )表示 自由度为(n ,” )的 F一 分布 。1961年,
T.S.Ferguson和 K.S.Srikantan分别建议使用式(9)
来诊断异常值点。
1.2 高杠杆点及其判定准则
由式(4)我们有 :
Var(8~)一 d。(1一 h )≤ 一 Var(e.),
i一 1,⋯ . (10)
此式表明 :普通残差较误差扰动所含信息更集 中,而
h .的作用之一是将信息空间进行了压缩。进一步,h
值越大,相应的Var( )就越小;特别当h,.一l时, =
0将概率1地成立,亦即,P(y,一Y )=l。这说明,当h,.
很大,亦即数据点 .距观测集主体很远时,观攮I值与
拟舍值将基本吻合。形象地讲,在自变量空间尺 中远
离试验中心的点 ,将使 尺¨ 中的点(sT, )把回归
直线拉向它 自身。这种拉动行 为的后果之一是牺牲其
它观攮I点的拟合效果来降低 自身处的残差 ,导致拟合
直线偏离正常位置。另外,由于这种点处的残差相对较
小,因而在残差图上难以识别出来。我们称 h,,取大值
的点为高杠杆点(High Leverage Case),而统称 h,.为
杠杆值 。
h .值究竟大到何种程度时,才可判定相应的观测
点为高杠杆点 ,这是一个相对不确定的问题,它与所讨
赵进文 :中国消费数据 的统计谚断分析
论问题的属性有关。一种参考标准是 D.A.Belsley等
人在 1980年提出的 :若 h > 2(p+ 1)/n,则认为第 i
个观攮I点为高杠杆点。此外,还有一种检验的方法:将
, :.⋯, 视为 服 从正 态 分布 的 随机 向量 一
( “, )的简单随机样本,则可以证明统计量:
一
n一--p--1.豢 1 户 1 ‘
~ F(P,”一 P 1) (11)
由此可判定观攮I点( , )是否为高杠杆点。
1 3 强影响点
现代统计学的研究表明:在建模过程中,各个样本
点对模型统计推断、假设捡验等的影响大小并不是相
同的。一般地讲 ,每个样本点对模型都有一定的影响.
但相对于整个数据来讲 ,都不应该单独地支配模型的
主体属性。具体说来,各个样本点的微小变动都不应该
引起模型参数的估计和假设检验的结论有太的变动,
甚至得出相反的结论。否则,所建的模型稳定性能差,
容易造成“伪 回归”,更难于实际应用。粗略地讲+称这
种对模型统计推断或假设捡验影响特别大的点为强影
响点(Influential Point)。
统计学家基于不同的角度提出了多种影响度量。
目前,应用 最为广泛 的是从 参数置信域观点提 出的
Cook距离和从模型拟合观点提 出的 w K统计量,以
及基于协方差 比而发展的刻划对方差估计影响的 AP
统计量和度量数据对估计量影响的似然距离
Cook距离 D 的一种方便而简洁的计算公式为:
1
D-一 h一’南 : 【1 2)
它表明 一组 数据对参数 估计影响的大小既与模
型在该点处拟合的好坏有关 ,还与该点在 自变量空间
中的位势有关。式(12)还表明}异常值点和高杠杆点都
有可能为强影响点 ,但又并不一定都是强影响点。它微
妙地刻划了三者之间的有机联系
l980年 ,D.A.Belsley,E.Kuh和 R.E.Welsch从
数据拟台角度提出了用于刻划删除数据( , .)对 .
处拟合值影 响的影响度量——w—K 统计量 WK ,它
的常用计算公式为:
^ 。
K = (_ 一) (13)
I — n
它与 Cook统计量间的关系为:
二2
(WKD (p+ 1)D (]4)
W—K统 计量综合考虑了别点前后位置参数和尺度参
·5 ·
维普资讯
天津商学院学报 1999年 第19卷 第4期
数整体问的差异,亦即度量了( ( ), ( )。)与(p, )间
的差异
AP统计量 是 D.F.Andrews和 D.Pregibon于
l 978年提 出的 ,它度量 了数 据( , )删除前后对
估计的影响,它可由下式方便地计算出来 :
AP 一 l二 (1一hil) (1 5)
P —
似然距离 (I ikelihood Displacement)则 由 R.D.
Cook和 S.Weisberg于 1 982年首次给出,它是研究数
据点对估计量影响的统一度量方法 ,适用于各种回归
模型 及其它模型的影响分析,它的出发点也为置信
域,但与 Cook距离不同处在于采用了参数的最大似
然估计。似然距离有几种不同的形式,在此我们介绍其
中的一种:
LD )一 In(1+ ) (【6)
它刻划了 作为多余参数时第 i个数据点对回归系
数 卢估计的影响。
一 般地讲 ,这四种影响度量的影响诊断功能基本
相同,我们可以从不 同的角度来分析和使用它们。
2 中国消费数据的诊断
表 1给出 1952~1 992年间我 国国民收人总额和
国民收人中消费总额的原始数据。
利用最小二乘理论 ,不难求得下述回归方程:
Y一 73.0741+ 0.6667X (17)
对(17)分别作 传统的回归 系数和 回归方程显著性检
验,它们均十分显著。但我们指出,(171还不能用于实
际的预测,因为它未能通过回归余项的序列相美性检
验一D.w 检验。这说 明模型(17)有待作进一步的改
进,例如可以引人新的解释变量(如人 口因素),此处我
们不作进一步讨论。
下面我们利用前面的预备知识来研究这批数据中
是否含有异常值点、高杠杆点和强影响点 。表 2和表 3
列出了该数据集下的有美诊断统计量值。
衰 l 中国国民收^总额与消费颤数据 亿元
国民收^总额 消费颤 国民收^总 新 精 贵额 年份 年甜
( 1 ( ) ( ) (y)
1 95Z 589 477 1 973 2 9l8
709 l974 2 348 l 55o
l954 748 570 l975 2 503 l 62l
1955 788 622 1976 2 427 l 676
l956 2 644
702 1978 1 888
l958 1 118 738 l979 3 35O 2 l95
】959 l 222 7l6 l980 3 686 2 53l
l船 O 769 3 941 2 799
l96l 996 818 l982 4 258 9 054
1962 【 924 849 l983 4 736 9 956
1963 1 000 664 1964 5 652 3 905
1 166 92l l985 7 020 4 879
1965 1 387 982 1986 7 B59 5 552
l966 l 065 l987 9 3l3 6 386
l967 l 487 l l24 l988 ll 738 6 038
l968 1 l1l l989 l3l76 9 005
l969 l 6l7 l990 14 384 9 669
1970 l 926 l 258 l99l l6 557 lO 969
197l 2 077 1 324 199Z 19 640 l2 945
l972 2136 1 404
资料来踩 :中国统计摘要 .北京;中国境计出短牡 .1999
·6’
维普资讯
表 2 消费数据模型下的部分诊断统计■值
赵进文 :中国消费数据的统计 诊断分析
年份 m . 年份 . h..
1952 l1 239 6 0.105 0 0.010 7 0 038 0 1973 —107·484 7 —0.998 6 0.9971 0·027 8
1953 1 3.235 6 0.123 6 0.014 9 O.037 0 1974 —88 485 7 一O 822 0 0.027 7
1954 一 1.765 7 —0.016 5 0.000 3 1975 —47.7501 一O.442 9 0.192l O.024 4
1955 23.566 3 0.219 9 0 047 2 0.036 4 — 15 159 0 — 0.140 8 0.019 3
1956 9.896 5 0 092 3 O.008 3 0.035 8 1977 —94 828 9 —0.880 5 0 770 7 O 026 6
1957 23.562 3 0.219 8 0.0471 0.035 6 1978 —191.841 1 — 1.780 3 3 361 0.025 6
1958 —0 749 8 0.555 8 0.0341 1979 — 38.445 0 一O 356 7 O 124 4 0.025 0
l959 —171 781 5 —0.6O0 6 2.671 7 O 033 5 1980 —0.863 7 ——0.008 0 0.0001 0.024 5
1960 —123.448 1 ——1.150 3 I.334 5 0 033 5 1981 98.461 2 0.913 7 0.830 3 O.024 4
196 80.892 7 0.754 3 0.562 6 0 035 O 1982 142.117 3 1.318 O 1.771 5 0.024 4
1962 l59.895 1 1.491 4 0.298 3 0.035 5 1983 1Z7.434 7 1.182 2 1.412 4 O 024 9
1963 124.225 9 1.158 4 1.3541 0.034 9 1984 136.811 6 1.270 7 1 B41 2 O.O27 2
1964 70.553 7 0.657 5 0.4Z5 9 0.033 8 1985 73.0741 0.681 2 0 457 6 O.034 3
1965 一l5.787 0 —0 147 O 0.02】1 O.O32 4 1986 243.330 6 2.275 7 5.818 7 0.040 6
l966 —65.460 3 —0.609 3 0.365 2 0.031 3 1987 103.948 8 0 979 8 0.959 0 0.055 5
1967 59.543 O 0.554 3 0.205 0 O.O31 8 1988 1S9.201 3 1 337 7 1.827 4 0.090 8
196 94.545 4 0.880 4 0.770 5 0.032 3 1989 149 486 7 1 458 1 2.19l 0 0.1l8 O
1969 28.872 0 0.268 7 0.070 5 0.03l1 1990 ——0 1131 — 0.O0】1 0.000 0 O 144 4
1970 —99.138 3 —0.921 9 0 846 6 0.029 5 1991 ——69 551 9 — 0.712 5 O.501 2 O.2O0 3
1971 — 133.8l0 0 ——1.243 9 1.569 9 0.028 9 1992 —222.062 1 — 2.427 3 6 762 3
l972 — 93.145 3 ——0.865 7 0.744 5 0.028 6
衰 3 消费数据模拟下的部分影响诊断统计■值
年份 D. WK, A LD.( ) 年份 n K. ^P n^ ( I )
l952 0.000 2 0.020 6 O 961 7 0.000 4 1973 0 014 3 — 0.168 9 O.947 3 0.O301
1953 0.000 3 0.023 9 0 962 6 1974 0.009 6 ——0.138 2 0.955 5 0 020 2
l954 ——0.003 4 0.963 3 1975 0.002 5 ——0.004 8 0.005 3
1955 0.000 9 0 042 2 0.962 4 0.001 9 1976 0.000 3 一O 023 3 0.9721
1956 0.000 2 0.017 5 0.964 0 1977 0.010 6 —0.1451 0.954 0
1957 0.000 9 0.041 7 0.963 2 O O01 9 1978 0.041 6 —0.297 2 0.895 2 0.087 4
1958 0.009 9 一 O.1401 0.952 0 0 018 9 0 O01 6 —0.O56 5 0.971 8 O 003 4
1959 0.006 3 ——0.304 3 0.95 7 6 0.01 3 2 1980 —0.001 8 0.975 5
1960 0.002 3 一O 2151 0.933 7 0.004 8 1981 0.O1O 4 0.1441 O 954 7 O 021 g
196l 0.010 3 0.142 8 0 950 9 0.021 7 】982 0.021 7 0.210 5 0.9321
1962 O.040 9 0.290 8 0.909 5 0.085 9 l983 0.0l7 8 0.189 9
】963 0.024 3 0.221 3 0.931 9 0.0511 1984 0.022 6 0.214 2 0 932 5
】964 0.007 6 0.】221 0.955 5 O Ol6 0 1985 O.008 2 0 127 5 0 954 2
1965 —0.026 6 0.9671 0 000 8 1986 O.109 6 0.496 2 0.832 0
1966 0.006 0 — 0.】08 6 O.959 5 0 O12 6 1987 0.028 2 0.237 4 0.921 3
1967 0.082】 O 960 6 0 010 5 1988 0 089 4 0.427 2 0.867 5 0 l87 5
1968 0.012 9 仉 160 4 0 948 5 0 027 1 1989 O 142 2 0.541 4 O 833 9 0 297 9
1969 0.001 2 0.047 6 0 9671 0.002 5 】990 0.000 0 ——0.000 4 0.855 B
O.012 9 —0.160 4 0 949 4 0.0271 】991 0.063 6 ——0.354 3 0 789 3 0.133 5
1971 O.023 0 —0.2】61 0.932 6 0.0 8 3 1g92 】.248 7 —1.6g31 0.596 2 2.544 8
】972 0.0l1 O 一0 1481 0.952 7 0.O231
利用 Ferguson—Srikantan方法 ,在显著性水平 口
一 0.05下 ,查 】=1, 2= 38的 F一 分布表,知:F(1,
40)= 4.08< F(1.38)< F(1.3O)一 4.1 7,而由表 2
知 ,1 986年和 1 992年对应的 F( )一 均大于F 。 (1,
38),其余点处的相应值均小于此 临界值,故应判定这
两 年所对应的数 据为异常值点。此外 ,1959年、1962
· 7 ·
维普资讯
天津商学院学报 1999年 第19卷 第4期
年、1 978年和 l989年对应的 F( )=f 均大于 2,明显
地高于 1_986年和 1992年以外其它年度相应的F( ),
故应判定它们为可疑异常值点。
现考虑高杠杆点是否存在 若采用比较法,则临
界值为 2( + 1)/n= 0.097 6,由表 2知,1 989~ 1 992
年的连续四个数据应判定为高杠杆点。若换用检验方
法,则在给定水平 =0.05下,应判定 1 990~ 1 992年
的连续三年数据为高杠杆点 ;在给定水平a—O.01下,
应判 1 991年和 1992年两年的数据为高杠杆点。可见 ,
我们所求得的拟合直线(17)确实存在偏离正常位置
的趋势。从经济意义上讲 ,我 国的消费结掏在 1952~
1988年与 1 989~ 1 992年间可能存在显著性差异,建
模时应考虑结构变动的影响。利用高杠杆点来测定结
构变动 ,这一新方法在现有文献中还未予报道 ,我们 已
专文讨论,在此不作详述。
表 3中列出的有关影响度量清晰地表明了每个样
本点对模型参数LS估计的影响大小 在Cook距离和
W—K统计量下 ,1 986年、1 989年和 1992年所对应点
的 D.和 WK.明显地高于其它点所对应 的相应值 ,故
应判定这三年的数据为强影 响点,而 1 988年所对应的
D.和 K、值也很大 ,应判定为可疑强影响点。
在 AP统 计量 下,1 986年 1989年、1 991年和
1 992年所对应的AP.较其它观测点处的相应值明显
较低 ,故应判定它们为强影响点。值得注意的是 ,1 991
年对应的数据在 Cook距离和W-K统计量下并未表
现出明显异常,但在 AP统计量下的影响量值仅次于
1992年而位居第二 由此进一步说明:不同的点对不
同的研究对象的影响不尽相同,而即使是相同的点对
不同的研究对象的影响也不尽相同。
至于在似然距离LDi=Ln( l )下判定,其结果
与 Cook距离和 W—K 统计量下相同。
表 4列 出了上述几个重要观测点对消费模型参数
估计的影响 从该表看 出,1 992年数据对模型参数估
计的影响最大,它的剔除使拟合直线的截距大幅度下
降,而使相应的斜率上升,并使模型误差方差的估计下
降,且在 ( ) 列中取最小值。这表明:将 1992年数据
剔除后再作经验拟合 ,所得拟合方程与原来的经验模
型(1 7)有实质性差异。此外,1991年数据对模型参数
估计的影响也很大,不过它与 1992年数据不同,它的
作用方式是使拟合直线的截距下降,使相应的斜率上
升,但使模型误差方差的估计上升(由 11 91 6.858 4升
到 1 2 071.258 2),这表明 :它的单独剔除无助于经验
模型的改善。这一事实揭示 :不同的杠杆点(1 991年和
· 8·
l 992年同为高杠杆点)在轻验建模中的影响机理不
同.它取决于这些 点在 自变量 空间 中的位 置 此处 ,
1991年和 1992年数据的重要区别还在于:1991年数
据仅为高杠杆点,而 1992年数据既为异常值点,又为
高杠杆点,同时还是强影响点。
囊4 几十t一样车点对辅■曩叠●t瞥计的嚣一
)
年份 ;(f)
Ⅱ( ) 口(f)
l959 76.4l6 5 m 666l l2ll7.337 5 ll 916.858 4
l962 0.667 3 l1 532.924 2
l978 75.167 8 0.666 4 ll 236.509 9
l986 75.997 3 m 665 9 l0 606.377 o
l988 77.552 7 o.665 6 ll 669.288 4
l989 79.145 8 0.665 2 l1 563.725 6
73.068 6 0.666 7 l2 230.459 6
65.614 6 0.667 7 l2 07】J 258 2
】992 52 406 3 0.67l 5 l0 382.787 0
另一方面,l 986年和 l 992年数据同为异常值点
和强影响点,但 l 986年数据束判定为高杠杆点,因此,
它们在作用机理上既有相同之处,也有不同地方;它们
都使剔除后模型的误差方差下降,但对截距作用却是
一 个使上升(1986年),一个使下降(1992年)#对斜率
的作用则与之相反。
由表 4还进一步看出,l990年数据的别除对回归
系数(截距和斜率)估计的影响极小,基本上未改变拟
合直线的位置,因而在o(i) 列中它的取值最大,超过
(1 7)的误差方差。在前面的判定中,我们只把它作为可
疑高杠杆点来处理 表 4的分析结果进一步捧除了把
它作为特殊点来考虑的必要性。
3 数据变换下的影响诊断
现在我们来讨论是否对模型(1 7)作数据变换。有
效数据变换的思想在 50年代中期即已形成。1957年,
J.W.Tukey首先提议在数据变换中引入一个新的参
数,并由样本数据集本身对它进行估计。1964年,G.
E.P.Box和 D.R.Cox对 Tukey的变换形式作了有效
修正,形成了著名的“Box—Cox幂变换簇”。对变换参数
的估计通常有两种方法:Atkinson估计法和最大似然
估计法。它们是在 l982年分别由 A.c.Atkinson和
维普资讯
R.D.Cook&S.Weisberg发展的。下面利用标准化数
据变换模型下的 Atkinson估计法来讨论我国 1952~
1 992年消费数据的变换诊断问膊。
对于全数据集,由残差图可见数据不满足方差齐
性,应对因变量或自变量进行适当的数据变换。我们现
考虑对因变量作变换。为此 ,取 =1,则构造变量的表
达式为 :
W.(1)=Y lny.一 ( 一1)FInG(Y)+ 1]
418)
其中,G(y)=4[Iy,) =1 743.611 1,且计算得:
Ⅳ (^ )QZ( )一~ 1 372 728.2
Ⅳ ( )QⅣ( )一 40 802 312.74
故变换参数的Atkinson估计为
— 一 一 . 33 64(19033 64 ^^一 o^一 丽巧 一
因而零假设 H。:^= 下的检验统计量为 :
丁从 一
一 1.973 4 (20)
其 一 )oz( )一 }/
( 一 P一 2) 421)
Q 一 1一 H (22)
查 t分布的临界值表有:f(38,0.05)=2.024 4,故在置
信水平 =0.05下还不能拒绝原假定 H。,即认为不必
对因变量作数据变换。
另一方面由前面的判定知;1986年、1989年、1991
年和 1992年的这四组数据最有可能对数据变换产生
影响,它们或为异常值点,或为高杠杆点和强影响点,
甚至同时是其中的两类或全部。现将它们同时剔除后
再考虑是否应作数据变换。为此,记 r一{1 986,1989,
1991,1992}为剔除数据的指标集,并取 =1,于是算
赵进文 中国消费数据的统 计诊断分析
得剩余数据下的有关统计量值如下:
G(y )= 1 448.251 4l4
0)(^。)Q c,)zff】(^。)=一870 669.4
wT,】(^0)Q( )W( ( )一 20 917 595.5
z )( )Q< z c¨( )= 309 796.7
(f1— 8 045.769 064
故剩余数据下变换参数的 Atkinson估计为:
k =1一 =1.041 623 78
(23)
而零假设 H。:^一 。^下的检验统计量值为 :
T (^。)= 2.122 3 (24)
查 t分布的临界值表有: (34,0.05)=2.032 2,故在置
信水平 =0.05下应拒绝原假设H。.即认为应对因变
量作数据变换 。
综上可见,1 986年、1 989年、1 991年和 1 992年的
数据共同构成了幂变换下变换的强影响点群 ,存在变
换遮被现象的证据。
参 考 文 越
1 韦博成,鲁圆斌,史建清 .统计诊断于1论 .南京:东南大学
出版社 ,】991
2 趄 进文 .统计假设括验的诊 断与数值影响 分析 .山西师大
学报(自然科学版),1994(2):1~6
3 Atkinson A C.Plots-Transformations snd Regression.Ox-
f0rd:Clarendon Press.1985
4 Atkinson A C.Diagnostics Tests for Transformations.
Technomterics.1986.28:29~ 87
5 Cook R D and Weisherg S.Residuals and influence in Re—
gression.New York,Chapman and Halt-1982
6 国家统计 局 .中田统计摘要 .北京 :中国境计 出版社 .1993
(责任编辑 赵新安)
· 9·
维普资讯