第2章 一元线性回归模型
通过案例学习回归分析
案例1 中国宏观消费分析(file:china)摘自经济蓝皮书《2004年:中国经济形势分析与预测》和《经济计量分析》第1章案例。
按照我国现行国民经济核算体系,国内生产总值(按支出法计算)是由最终消费、资本形成总额和货物与服务的净出口之和三部分组成。前两部分占绝大多数。其中最终消费又分为居民消费和政府消费两类。而居民消费又可分为农村居民消费和城镇居民消费。
在这种核算体系下,居民消费包括居民个人日常生活中衣、食、住、用等物质消费以及在文化生活服务性支出中属于物质产品的消费。
政府消费包括国家机关、国防、治安、文教、卫生、科研事业单位,经济建设部门的事业单位,人民团体等非生产机构使用的燃料、电力、办公用品、图书、设备等物质消费。
国内生产总值中最终消费与资本形成总额的比例关系,即旧核算体系下国民收入中消费与积累的比例关系是国民经济正常运行的最基本的比例关系。如果这一比例关系发生严重失调,最终会成为制约经济正常运行的严重障碍。
下面分析中国的消费问题。为消除物价变动因素以及异方差的影响,以下分析所用的数据均为不变价格数据(1952 = 1)以及分别取自然对数后的数据。
图给出不变价格的国内生产总值与消费曲线,图给出国内生产总值与消费的年增长率曲线。
图 国内生产总值与消费(不变价格)曲线 图 国内生产总值与消费年增长率曲线
由图、可以看出国内生产总值与消费的增长都很快。国内生产总值曲线的波动幅度相比较大。消费曲线的波动幅度相对较小。这与宏观消费行为具有“惯性”有关。它既不可能随时间突然大幅增加,也不可能随时间突然大幅减少。
1952-1978
1979-2002
平均增长率
年增长率的标准差
平均增长率
年增长率的标准差
GDP
%
%
消费
%
%
1952-1978年国民收入年平均增长率为%。1978-2002年的年平均增长率为%。后一时期是前一时期的倍(不变价格)。在后一时期里,经济增长速度如此之高,持续时间如此之长,发展趋势如此之稳定,在我国的经济发展史上是没有先例的。
图 年消费率曲线(1952-2002) 图 居民消费与总消费比的变化曲线(1952-2002)
图 宏观消费比率与居民消费比率曲线(1952-2002)
下面分析消费率(消费额 / 国内生产总值,1952-2002)序列的变化。见图,总的来说变化幅度较大。
(1)从趋势看,中国宏观消费比率值的变化是逐年下降。消费比率数据对时间t(1952 =1)的回归结果如下:
ratio = –
() () R2 = (1952-2002)
51年间消费比率值平均每年减少。
表 中国消费比率数据的特征数
特征数名称
消费比率的特征数(1952~1978)
消费比率的特征数(1979~2002)
均值
标准差
极大值
极小值
变异系数
样本容量
27
24
注:(1)消费比率 = 中国宏观消费 / GDP。
(2)1952~1999年消费和GDP数据摘自《新中国五十年统计资料汇编》,1999
中国统计出版社。2000~2002年消费和GDP数据摘自《中国统计年鉴》,
2003,中国统计出版社。
(3)消费比率数据的特征数用消费比率数据计算。
(2)以1978年为界,改革开放之前(1949(1978)消费比率曲线波动大,改革开放之后(1979(2002)消费比率曲线波动小(见图和表)。1952(1978年宏观消费比率值的均值是,标准差是。1979-2002年宏观消费比值的均值是。标准差是。改革开放以后宏观消费比率值平均比改革开放前下降。随着时间的推移,消费比率的均值减小,标准差减小。改革开放之后标准差减小说明宏观消费比率值的波动在减小,中央政府调控宏观经济的能力逐步在提高。
(3)宏观消费比率的最小值是,最大值是。都发生在上世纪50年代末和60年代初的经济困难时期。最小值发生在1959年是由于基本建设投资的极度扩张造成的(1958和1959年基本建设投资的年增长率分别是%和%)。最大值是发生在1962年是由于执行经济调整政策,首先解决人民生活所致。
(4)中国宏观消费比率值自1993年起跌破大关。1995年达到最低点。近10年来,宏观消费比率值基本上在以下徘徊,平均值是。在中央政府努力扩大消费的政策下虽然宏观消费比率值在1999和2000年回升至以上,但2001和2002年又跌落到以下。当然这并不意味着中国宏观消费绝对值的减少。相反,宏观消费总量一直在快速提高。因为固定资产投资以更快的速度增长,所以导致宏观消费比率值偏低。
(5)图给出居民消费占总消费的比率曲线。该比值从直线下降至。这一方面反映出政府消费越削越增的过程,同时也反映出居民消费占总消费的比率变得越小。
中国宏观消费比率的国际比较。
共选择6个工业发达国家和4个发展中国家和地区的GDP和宏观消费数据经计算后,与中国进行宏观消费比率的对比。6个工业发达国家是英国、美国、法国、意大利、加拿大和日本(GDP和消费均为年度数据,德国由于数据不全未选)。4个发展中国家和地区是菲律宾、墨西哥、香港(GDP和消费均为季节数据)和韩国(GDP和消费为年度数据)。上述10个国家和地区的宏观消费比率曲线与中国宏观消费比率曲线的对比分别见图和图。11个国家和地区宏观消费比数据的5个特征数见表2。结合图和图以及表,分析如下:
图 美国、英国、加拿大、法国、意大利、日本与中国的消费比率曲线比较
图 墨西哥、香港、菲律宾、韩国与中国大陆的消费比率曲线比较
(1)在这11个国家和地区中,无论是和工业发达国家还是发展中国家和地区相比,中国的宏观消费比率都是最低的。
(2)年平均消费比率在以上的国家按消费比率值大小顺序排列是英国、菲律宾、美国、法国、意大利、加拿大和墨西哥(见表中第一栏)。年平均消费比率在~之间的国家是日本、香港、韩国和中国(见表中第二栏)。显然,这种差别与文化传统有着密切的联系。前7个国家都是具有西方文化色彩的国家;而后4个国家都是具有东方文化色彩的国家。
(3)从消费比率的标准差和变异系数来看,排除菲律宾、墨西哥和香港(这3个国家的数据为季节数据,他们的方差与其他国家无可比性),中国和韩国是消费比率值变化最大的国家。中国消费比率标准差是变化最小的法国和意大利的3倍多。在消费比率低于的国家与地区中,日本和韩国的消费比率曲线是先降后升;香港呈震荡变化特征;而中国则是呈逐年下降趋势。
表 加拿大、中国等11个国家与地区宏观消费比数据的特征值比较
国别
均值
标准差
极大值
极小值
变异系数
样本容量
英国 (1980~2002,年度数据)
23
菲律宾(1982~2002,月度数据)
()
()
88
美国 (1980~2002,年度数据)
23
法国 (1980~2002,年度数据)
23
意大利(1980~2002,年度数据)
23
加拿大(1980~2002,年度数据)
23
墨西哥(1982~2002,月度数据)
()
()
88
日本 (1980~2002,年度数据)
23
香港 (1980~2002,月度数据)
()
()
92
韩国 (1980~2002,年度数据)
23
中国 (1980~2002,年度数据)
23
注:(1)香港、菲律宾和墨西哥宏观消费和GDP数据未经季节调整。
(2)英国、美国、法国、意大利、加拿大和日本的GDP和消费数据摘自国际货币基金组织数据库
(网站:)。菲律宾、墨西哥、韩国和香港的GDP和消费数据摘自经合组织
数据库(网站:)。消费比率数据是作者自己计算的。
(3)括号中的特征数不参与比较(这些特征数来自于月度数据,无可比性)。
(4)中国的消费比率值为什么呈一路下滑趋势?主要原因是全国固定资产投资增长率(2002年是%)多年来远远高于消费的增长率(2002年是%),从而导致消费比率值连年下滑。
(5)中国目前的宏观消费比率这样低好不好?从长期看不好,应该改变消费与GDP之间的这种低比例关系。原因有四。①宏观消费和固定资产投资是维持经济高增长的两个最重要因素。在经济高增长条件下,消费比率偏低是靠连年的固定资产投资高增长率维持的。而连年的固定资产投资高增长率必然带来人力、物力和财力的瓶颈现象。中国近年来之所以没有出现像大跃进时期的物力和财力的瓶颈现象,主要是依靠外国直接投资和借外债支撑的。但长期借外债后,还款将成为一个沉重负担,同时经济长期超高速发展,高素质人才的缺乏将变得越来越突出。这些因素制约固定资产投资的超高速增长将随着时间的延长越来越突出。②若没有一个合理的消费比率做支撑,高投资比率将得不到延续,最终导致产品相对过剩和积压,经济发展速度下降。③提高消费比率,维持消费的高增长同样能带来经济的高增长。因为提高消费比率主要刺激的是第三产业的发展。第三产业的发展在促进经济增长的同时,还可以扩大劳动力的就业。为人民政府解决待业问题减轻压力。目前在这方面还有很大的潜力。以2002年为例,全国第三产业产值占GDP的比例只有。④以经济建设为中心,不断提高中国人民的物质与精神生活水平是我们党和国家的工作重心,宏观消费比率长期保持低位不是我们的目的。
基于我国54年经济发展经验以及目前的经济发展规模,把年消费率平均值控制在是比较合理的模式。
下面通过建立宏观消费计量经济模型进一步分析我国消费与国民收入的定量关系。(以下所用数据(1952-2002)均以不变价格(1952 = 1,单位:亿元人民币)计算。)
用CPt表示消费额(不变价格),GDPt表示国内生产总值(不变价格),用1952-2002年数据得消费函数的OLS估计结果如下:
= + ()
() ()
R2 = , DW = , . =
以上模型的DW值很小,严格地说模型存在自相关。为消除自相关(( = ),对变量进行广义差分。定义
GCPt = CPt - CPt-1
GGDPt = GDPt - GDPt-1
得估计的回归模型为,
= + GGDPt
() ()
R2 = , DW = , . =
上模型中不存在自相关。消费函数的GLS估计结果是
= + ()
消费函数的时间序列模型估计结果是
CPt = + GDPt + +
() () ()
R2 = , DW = , . =
则长期关系是
CPt = + ()
综上消费与国内生产总值的真实比值是。
下面研究消费(不变价格)对国内生产总值的弹性系数。对消费和国内生产总值取自然对数并进行OLS回归,得如下结果,
= + LnGDPt ()
() ()
R2 = , DW = , . =
对变量进行广义差分。定义
GLnCPt = LnCPt - LnCPt-1
GLnGDPt = LnGDPt - LnGDPt-1
得GLS估计结果如下:
G= + G LnGDPt ()
() ()
R2 = , DW = , . =
对残差建立时间序列模型,
LnCPt = + LnGDPt + + ()
() () ()
R2 = , DW = , . =
综上消费对国内生产总值的真实弹性是。
一元线性回归模型
有一元线性回归模型如下,
yt = (0 + (1 xt + ut
上式表示变量yt 和xt之间的真实关系。其中yt 称被解释变量(因变量),xt称解释变量(自变量),ut称随机误差项,(0称常数项,(1称回归系数(通常未知)。上模型可以分为两部分。(1)回归函数部分,E(yt) = (0 + (1 xt,(2)随机部分,ut 。
图 真实的回归直线
这种模型可以赋予各种实际意义,收入与支出的关系;如脉搏与血压的关系;商品价格与供给量的关系;文件容量与保存时间的关系;林区木材采伐量与木材剩余物的关系;身高与体重的关系等。
以收入与支出的关系为例。假设固定对一个家庭进行观察,随着收入水平的不同,与支出呈线性函数关系。但实际上数据来自各个家庭,来自各个不同收入水平,使其他条件不变成为不可能,所以由数据得到的散点图不在一条直线上(不呈函数关系),而是散在直线周围,服从统计关系。随机误差项ut中可能包括家庭人口数不同,消费习惯不同,不同地域的消费指数不同,不同家庭的外来收入不同等因素。所以在经济问题上“控制其他因素不变”实际是不可能的。
回归模型的随机误差项中一般包括如下几项内容,(1)非重要解释变量的省略,(2)人的随机行为,(3)数学模型形式欠妥,(4)归并误差(粮食的归并)(5)测量误差等。
回归模型存在两个特点。(1)建立在某些假定条件不变前提下抽象出来的回归函数不能百分之百地再现所研究的经济过程。(2)也正是由于这些假定与抽象,才使我们能够透过复杂的经济现象,深刻认识到该经济过程的本质。
通常线性回归函数E(yt) = (0 + (1 xt 是观察不到的,利用样本得到的只是对E(yt) = (0 + (1 xt 的估计,即对(0和(1的估计。
在对回归函数进行估计之前应该对随机误差项ut做出如下假定。
(1) ut 是一个随机变量,ut 的取值服从概率分布。
(2) E(ut) = 0。
(3) D(ut) = E[ut - E(ut) ]2 = E(ut)2 = ( 2。称ui 具有同方差性。
(4) ut 为正态分布(根据中心极限定理)。以上四个假定可作如下表达:ut ( N (0, ( ( )。
(5) Cov(ui, uj) = E[(ui - E(ui) ) ( uj - E(uj) )] = E(ui, uj) = 0, (i ( j )。含义是不同观测值所对应的随机项相互独立。称为ui 的非自相关性。
(6) xi是非随机的。
(7) Cov(ui, xi) = E[(ui - E(ui) ) (xi - E(xi) )] = E[ui (xi - E(xi) ] = E[ui xi - ui E(xi) ] = E(ui xi) = 0.
ui 与xi 相互独立。否则,分不清是谁对yt的贡献。
(8) 对于多元线性回归模型,解释变量之间不能完全相关或高度相关(非多重共线性)。
在假定(1),(2)成立条件下有E(yt) = E((0 + (1 xt + ut ) = (0 + (1 xt 。
最小二乘估计(OLS)
对于所研究的经济问题,通常真实的回归直线是观测不到的。收集样本的目的就是要对这条真实的回归直线做出估计。
图
怎样估计这条直线呢?显然综合起来看,这条直线处于样本数据的中心位置最合理。怎样用数学语言描述“处于样本数据的中心位置”?设估计的直线用
=+ xt
表示。其中称yt的拟合值(fitted value),和分别是 (0 和(1的估计量。观测值到这条直线的纵向距离用表示,称为残差。
yt =+=+ xt +
称为估计的模型。假定样本容量为T。(1)用“残差和最小”确定直线位置是一个途径。但很快发现计算“残差和”存在相互抵消的问题。(2)用“残差绝对值和最小”确定直线位置也是一个途径。但绝对值的计算比较麻烦。(3)最小二乘法的原则是以“残差平方和最小”确定直线位置。用最小二乘法除了计算比较方便外,得到的估计量还具有优良特性。(这种方法对异常值非常敏感)设残差平方和用Q表示,
Q = = = ,
则通过Q最小确定这条直线,即确定和的估计值。以和为变量,把Q看作是和的函数,这是一个求极值的问题。求Q对和的偏导数并令其为零,得正规方程,
= 2(-1) = 0 ()
= 2(- xt) = 0 ()
下面用代数和矩阵两种形式推导计算结果。首先用代数形式推导。由()、()式得,
= 0 ()
xt = 0 ()
()式两侧用除T,并整理得,
= ()
把()式代入()式并整理,得,
xt = 0 ()
= 0 ()
= ()
因为= 0,= 0,分别在(8)式的分子和分母上减和得,
= ()
= ()
最小二乘估计量和的特性
线性特性
这里指和分别是yt的线性函数。
= ( kt yt
可见是yt的线性函数,是(1的线性估计量。同理(0也具有线性特性。
无偏性
E() = (1
(3) 有效性
(0, (1的OLS估计量的方差比其他估计量的方差小。
Gauss-Marcov定理:若ut满足E(ut) = 0,D(ut) = ( 2,那么用OLS法得到的估计量就具有最佳线性无偏性。估计量称最佳线性无偏估计量。最佳线性无偏估计特性保证估计值最大限度的集中在真值周围,估计值的置信区间最小。
注意:分清4个式子的关系。
(1) 真实的统计模型,yt = (0 + (1 xt + ut
(2) 估计的统计模型, yt =+ xt +
(3) 真实的回归直线,E(yt) = (0 +(1 xt
(4) 估计的回归直线,=+ xt
OLS回归直线的性质
(1) 残差和等于零,(= 0
(2) 估计的回归直线 =+ xt 过(,)点。
(3) yt 的拟合值的平均数等于其样本观测值的平均数,=。
yt的分布和的分布
yt ( N ((0 + (1 xt, ( ( )。
( N ((1, ( ( )。
( ( 的估计
定义
=
其中2表示待估参数的个数。可以证明E() = ( (。是( ( 的无偏估计量。因为是残差,所以又称作误差均方。可用来考察观测值对回归直线的离散程度。
的估计的方差是
() = EMBED , () = EMBED
拟合优度的测量
拟合优度是指回归直线对观测值的拟合程度。显然若观测值离回归直线近,则拟合程度好;反之则拟合程度差。
图 三种离差示意图
可以证明 ( (yt -) 2 = ( (-) 2 + ( (yt -)2 = ( (-) 2 + ( ()2。
SST(总平方和)= SSR(回归平方和) + SSE(残差平方和)
度量拟合优度的统计量是可决系数(确定系数)。
R2 = = (回归平方和)/(总平方和)= SSR/SST
所以R2的取值范围是 [0,1]。对于一组数据,SST是不变的,所以SSR↑(↓),SSE↓(↑)。
SSR:旧指回归平方和(regression sum of squares),现指残差平方和(sum of squared residuals)
SSE:旧指残差平方和(error sum of squares, sum of squared errors),现指回归平方和(explained sum of squares)
回归参数的显著性检验及其置信区间
主要是检验 (1 是否为零。通常用样本计算的不等于零,但应检验这是否有统计显著性。
H0:(1 = 0; H1:(1 ( 0
在H0成立条件下,
t = = =
若 ( t ( > t( (T-2) ,则 (1 ( 0;
若 ( t ( < t( (T-2) ,则 (1 = 0。
-t( (T-2) 0 t( (T-2)
图 双端假设检验
yF 的点预测
下面以时间序列数据为例介绍预测问题。预测可分为事前预测和事后预测。两种预测都是在样本区间之外进行,如图所示。
对于事后预测,被解释变量和解释变量的值在预测区间都是已知的。可以直接用实际发生值评价模型的预测能力。对于事前预测,解释变量是未发生的。(当模型中含有滞后变量时,解释变量则有可能是已知的。)当预测被解释变量时,则首先应该预测解释变量的值。对于解释变量的预测,通常采用时间序列模型。
T1 T2 T3(目前)
样本区间 事后预测 事前预测
预测还分为有条件预测和无条件预测。对于无条件预测,预测式中所有解释变量的值都是已知的。所以事后预测应该属于无条件预测。当一个模型的解释变量完全由滞后变量组成时,事前预测也有可能是无条件预测。例如
=+ xt-1
当预测T+1期的yt值时,xt用的是T期值,是已知值。
根据估计的回归函数,得
=+ xF
案例分析
案例1:用回归模型预测木材剩余物(file:b1c3)
伊春林区位于黑龙江省东北部。全区有森林面积万公顷,木材蓄积量为亿m3。森林覆盖率为%,是我国主要的木材工业基地之一。1999年伊春林区木材采伐量为532万m3。按此速度44年之后,1999年的蓄积量将被采伐一空。所以目前亟待调整木材采伐规划与方式,保护森林生态环境。为缓解森林资源危机,并解决部分职工就业问题,除了做好木材的深加工外,还要充分利用木材剩余物生产林业产品,如纸浆、纸袋、纸板等。因此预测林区的年木材剩余物是安排木材剩余物加工生产的一个关键环节。下面,利用一元线性回归模型预测林区每年的木材剩余物。显然引起木材剩余物变化的关键因素是年木材采伐量。
给出伊春林区16个林业局1999年木材剩余物和年木材采伐量数据如表。散点图见图。观测点近似服从线性关系。建立一元线性回归模型如下:
yt = (0 + (1 xt + ut
表 年剩余物yt和年木材采伐量xt数据
林业局名
年木材剩余物yt(万m3)
年木材采伐量xt(万m3)
乌伊岭
东风
新青
红星
五营
上甘岭
友好
翠峦
乌马河
美溪
大丰
南岔
带岭
朗乡
桃山
双丰
合计
图 年剩余物yt和年木材采伐量xt散点图
图 EViews输出结果
EViews估计结果见图。EViews进行OLS估计的操作步骤如下:
打开工作文件,从主菜单上点击Quick键,选Estimate Equation 功能。在出现的对话框中输入y c x。点击Ok键。立即会得到如图所示的结果。
下面分析EViews输出结果。先看图的最上部分。被解释变量是yt。估计方法是最小二乘法。本次估计用了16对样本观测值。输出格式的中间部分给出5列。第1列给出截距项(C)和解释变量xt。第2列给出第1列相应项的回归参数估计值(和)。第3列给出相应回归参数估计值的样本标准差(s(), s())。第4列给出相应t值。第5列给出t统计量取值大于用样本计算的t值(绝对值)的概率值。以t = 为例,相应概率表示统计量t取值(绝对值)大于的概率是一个比万分之一还小的数。换句话说,若给定检验水平为,则临界值为 (14) = 。t = >落在了H0的拒绝域,所以结论是(1不为零。输出格式的最下部分给出了评价估计的回归函数的若干个统计量的值。依纵向顺序,这些统计量依次是可决系数R2、调整的可决系数(第3章介绍)、回归函数的标准差(.,即均方误差的算术根)、残差平方和、对数极大似然函数值(第2章介绍)、DW统计量的值(第5章介绍)、被解释变量的平均数()、被解释变量的标准差()、赤池(Akaike)信息准则(是一个选择变量最优滞后期的统计量)、施瓦茨(Schwatz)准则(是一个选择变量最优滞后期的统计量)、F统计量(第3章介绍)的值以及F统计量取值大于该值的概率。
注意:.和.的区别。.和SSE的关系。
根据EViews输出结果(图),写出OLS估计式如下:
= + xt
() () R2 = , s. e. =
其中括号内数字是相应t统计量的值。.是回归函数的标准误差,即=。R2是可决系数。R2 = 说明上式的拟合情况较好。yt变差的91%由变量xt解释。检验回归系数显著性的原假设和备择假设是(给定( = )
H0:(1 = 0; H1:(1 ( 0
图 残差图
因为t = > (14) = ,所以检验结果是拒绝(1 = 0,即认为年木材剩余物和年木材采伐量之间存在回归关系。上述模型的经济解释是,对于伊春林区每采伐1 m3木材,将平均产生 m3的剩余物。
图给出相应的残差图。Actual表示yt的实际观测值,Fitted表示yt的拟合值,Residual表示残差。残差图中的两条虚线与中心线的距离表示残差的一个标准差,即.。通过残差图可以看到,大部分残差值都落在了正、负一个标准差之内。
下面求yt的点预测。假设乌伊岭林业局2000年计划采伐木材20万m3,求木材剩余物的点预测值。
2000 = - + x2000
= + ( 20 = 万m3
从而得出预测结果,2000年若采伐木材20万m3,产生木材剩余物的点估计值是万m3。平均木材剩余物产出量的置信区间估计是在 [, ] 万m3之间。从而为恰当安排2000年木材剩余物的加工生产提供依据。
问题:估计结果中没有显著性,去掉截距项 (0可以吗?
答:依据实际意义可知,没有木材采伐量就没有木材剩余物,所以理论上(0是可以取零的。而有些问题就不可以。例如家庭消费和收入的关系。即使家庭收入为零,消费仍然非零。一般来说,截距项的估计量没有显著性时,也不做剔出处理。
本案例剔出截距项后的估计结果是
= xt
() R2 = , s. e. =
点预测值是
2000 = x2000 = ( 20 = 万m3
附录:怎样用EViews预测。
以案例1为例,给定xt = 20,求=?EViews预测步骤如下。
(1)点击Procs键选Change workfile range功能。在弹出的对话框的End data选择框处改为17,如下图。
(2)点击OK键。双击工作文件的Sample:1 17区域,在弹出的对话框的Sample range pairs选择框处把16改为1 17,如下图。
(3)双击工作文件窗口中的x序列,打开x数据窗口。点击Edit+/-键,使x数据窗口处于可编辑状态。在t =17的x的观测值位置输入20。相当于给定x=20。
(4)打开估计式eq01窗口,点击Forecast键。在. 选择框处填入yfse,表示要yt的预测值(用YF表示)也要yt的预测标准差(用yfse表示)。点击OK键,工作文件窗口中已经出现一个yf序列。双击yf序列,可以看到。y17 = 。
PAGE
PAGE 74