第十五章
面板数据分析
面板数据模型概述
在经济学研究和实际应用中,我们经常需要同
时分析和比较横截面观察值和时间序列观察值结合
起来的数据,即:数据集中的变量同时含有横截面
和时间序列的信息。这种数据被称为面板数据
(panel data),它与我们以前分析过的纯粹的横截面
数据和时间序列数据有着不同的特点。简单地讲,
面板数据因同时含有时间序列数据和截面数据,所
以其统计性质既带有时间序列的性质,又包含一定
的横截面特点。因而,以往采用的计量模型和估计
方法就需要有所调整。
例1 表1中展示的数据就是一个面板数据的例子。
表1 华东地区各省市GDP历史数据
数据来源:中国统计年鉴1996-2000。
其他类似的例子还有:历次人口普查中有关不同年龄段的受教育状况;同行业不同公司在不同时间节点上的产值等。这里,不同的年龄段和公司代表不同的截面,而不同时间节点数据反映了数据的时间序列性。
山东
江西
福建
安徽
浙江
江苏
上海
1999
1998
1997
1996
1995
研究和分析面板数据的模型被称为面板数据模型(panel data model)。它的变量取值都带有时间序列和横截面的两重性。一般的线性模型只单独处理横截面数据或时间序列数据,而不能同时分析和对比它们。面板数据模型,相对于一般的线性回归模型,其长处在于它既考虑到了横截面数据存在的共性,又能分析模型中横截面因素的个体特殊效应。当然,我们也可以将横截面数据简单地堆积起来用回归模型来处理,但这样做就丧失了分析个体特殊效应的机会。
一般面板数据模型介绍
符号介绍:
-因变量在横截面i和时间t上的数值;
-第j个解释变量在横截面i和时间t上的数值;
假设:有K个解释变量,即j=1,2…..K;
有N个横截面,即i=1,2,…..N;
时间指标t=1,2,……T。
记第i个横截面的数据为
其中对应的 是横截面i和时间t时随机误差项。再记
这样,y是一个的向量;X是一个的矩阵;而μ是一个的向量。针对这样的数据,有以下以矩阵形式表达的面板数据模型: () 方程()代表一个最基本的面板数据模型。基于对系数β和随机误差项μ的不同假设,从这个基本模型可以衍生出各种不同的面板数据模型。最简单的模型就是忽略数据中每个横截面个体所可能有的特殊效应,如假设,而简单地将模型视为横截面数据堆积的模型。
但是由于面板数据中含有横截面数据,有时需要考虑个体可能存在的特殊效应及对模型估计方法的影响。例如在不同个体误差项存在不同分布的情况下,OLS估计量虽然是一致的,但不再是有效估计量,因此往往需要采用GLS。
一般为了分析每个个体的特殊效应,对随机误差项 的设定是 ().其中 代表个体的特殊效应,它反映了不同个体之间的差别。
最常见的两种面板数据模型是建立在 的不同假设基础之上。一种假设假定 是固定的常数,这种模型被称为固定效应模型(fixed effect model),另一种假设假定 不是固定的,而是随机的,这种模型被称为随机效应模型(random effect model)。
固定效应模型
在固定效应模型中假定 ,其中 是对每一个个体是固定的常数,代表个体的特殊效应,也反映了个体间的差异。 .整个固定效应模型可以用矩阵形式表示为:
其中i为 的单位向量。
进一步定义:
为 向量,是一个虚拟变量(dummy variable)。模型可以再写为:
其中D是一个有虚拟变量组成的矩阵。因此固定效应模型也被称为最小二乘虚拟变量模型(least squares dummy variable(LSDV) model),或简单称为虚拟变量模型。
固定效应模型的估计和检验
固定效应模型中有N个虚拟变量系数和K个解释变量系数需要估计,因此总共有N+K个参数需要估计。当N不是很大时,可直接采用普通最小二乘法进行估计。但是当N很大时,直接使用OLS方法的计算量就变得非常大,甚至有可能超过计算机的存储容量。
一个解决问题的办法就是分成两步来对面板数据模型进行回归分析。由这种方法导出的估计量常被称为内部估计量(within estimator),有时也记为 。
第二步,估计参数α。由于已经得到了β的估计值,所以α的估计就变得比较简单。
其实就是用自变量和解释变量的个体均值和 按下列模型计算出的误差项:
估计量 和 的方差估计:
其中 是对误差项方差的估计量:
第一步,剔除虚拟变量在模型中的影响,然后再对参数β进行估计。剔除虚拟变量D影响的办法就是利用下列矩阵对所有变量进行“过滤”。
设 ,其中D的定义与方程前所述。设 ,用 转变模型 。显然 ,则有
用OLS得到β的估计:
内部估计量与对下列方程的OLS估计量是等同的。
+随机误差项
其中, 和 代表各自变量个体的均值。
上式中,OLS估计量主要利用的是个体变量对其均值偏离的信息,随机误差项也仅反映对其个体均值的偏离波动,这是该估计量被称为内部估计量的原因。
注意:在对误差项方差的估计量中,分母(NT-N-K)反映了整个模型的自由度。有了这些方差的估计量,就可以用传统的t-统计量对估计系数的显著性进行检验。同时,还可以运用下列F-统计量对
的原假设进行检验:
其中 代表无约束回归模型,而 为有约束回归模型的 ,约束条件即为原假设。
相对于内部估计量,另外还有一种估计量称为中间估计量(between estimator)。定义为:
它其实是下列模型的OLS估计量:
因而可以被看作利用不同的个体均值信息所作出的估计。中间估计量一般而言是一致估计量,但不是有效的。因为它只是利用了个体均值的信息。内部估计量在这个意义上与中间估计量是相对的,因为内部估计量利用的正是被中间估计量所“抛弃”的部分信息。
固定效应模型的优点:能够确定地反映个体之间的差距及其简单的估计方法;
固定效应模型的缺点:存在模型自由度比较小(因为有N个截距系数)和存在对个体差异的限制性假设(即个体间差异为固定的)。
随机效应模型及其估计方法
类似固定效应模型,随机效应模型也假定:
但与固定效应模型不同的是,随机效应模型假定 与
同为随机变量。随机效应模型可以表达如下:
其中 和 均为 向量; 是 矩阵; 是一个随机变量,代表个体的随机效应。由于模型的误差项为二种随机误差之和,所以也称该模型为误差构成模型(error component model)。还假定:(1) 和 不相关;(2) ;(3) ; (4) ;(5) ; (6) ;(7) 。
给定这些假设,随机效应面板数据模型也可同样写为Y=Xβ+μ。其中 ,α的向量形式与以前相同。 是Kronecker乘法符号。
例: Kronecker乘法:
前面的矩阵D也可用Kronecker乘法表示:
在这些假设的情况下,简单OLS估计量仍然是无偏和一致的,但不是有效的。因为:
同一个个体、不同时间节点上的随机误差项之间存在一定的相关性,而OLS没有利用方差矩阵中含有的这些信息,因而不再是最有效的估计量。因此有必要采用GLS。
Pool对象估计的模型形式
Pool对象估计的方程模型形式为:
()
其中yit是因变量,xit 和i 分别是对应于 i =1 , 2 , …, N 的截面成员的解释变量 k 维向量和 k 维参数。每个截面成员的观测期为 t =1 , 2 ,…, T。
我们可以把这些数据看作一系列截面说明回归量,因此有N个截面方程: ()
模型()常用的有如下三种情形:
情形1:
情形2:
情形3:
对于情形1,在横截面上无个体影响、无结构变化,则普通最小二乘法估计给出了 和 的一致有效估计。相当于将多个时期的截面数据放在一起作为样本数据。
对于情形2,称为变截距模型,在横截面上个体影响不同,个体影响表现为模型中被忽略的反映个体差异的变量的影响,又分为固定影响和随机影响两种情况。
对于情形3,称为变系数模型,除了存在个体影响外,在横截面上还存在变化的经济结构,因而结构参数在不同横截面上是不同的。
模型设定的检验
Greene(1997)介绍了两种检验方法。一种是
由Breush和Pagan(1980)提出的拉格朗日检验法
(LM test)。另一种是Hausman(1978)提出的
Hausman检验方法(Hausman test),Hausman
检验量其实是一种Wald检验法(Wald test)。这两
种方法均可以用于验证面板数据模型的设定应该是
固定效应还是随机效应。
LM test的基本步骤
第一,建立原假设和备择假设:
第二,检验统计量及其分布
其中 为OLS的误差项。
Hausman test
Hausman检验的前提是如果模型包含随机效应,它应与解释变量相关。因此在原假设H0:随机效应与解释变量不相关的假定下,内部估计量(对虚拟变量模型)和GLS得出的估计量均是一致的,但是内部估计量不是有效的;在备择假设H1:随机效应与解释变量相关的假定下,GLS不再是一致的,而内部估计量仍是一致的。因此在原假设下, 与 之间的绝对值差距应该不大,而且应该随样本的增加而缩小,并渐进趋近于0。而在备择假设下,这一点不成立。Hausman利用这个统计特点建立了以下检验统计量:
注意:这里的 与前面提到的Σ有所不同,这里表示β的两种估计量协方差矩阵之差(Hausman的一个基本结论就是有效估计量和其与非有效估计量之差(即: )的协方差等于0,所以
即:
Hausman统计量即Wald统计量渐进服从自由度为K的分布:
堆积数据模型
当残差同期不相关,并且时期和截面同方差时,
对堆积数据模型使用普通最小二乘法估计系数和协方差。相当于情形1:i = j,i = j ,在横截面上无个体影响、无结构变化,则普通最小二乘法估计给出了 和 的一致有效估计。相当于将多个时期的截面数据放在一起作为样本数据。
变截距模型
1. 固定影响 (Fixed Effects) (情形2:ij,i=j )
固定影响估计量通过为每个截面成员估计不同常数项使i不同。EViews将每个变量减去平均值,并用转换后的数据,通过最小二乘估计来计算固定影响:
其中
设 , , 代表了X 减均值的差额的矩阵,bFE是使用普通最小二乘估计的系数。通过使用均值差模型的普通最小二乘协方差公式估计系数协方差矩阵:
()
其中 , 是固定影响模型的SSR。如果Pool中有缺失值,NT 就用除去缺失值后的总观测数代替。
固定影响本身不是直接估计的,计算公式为
()
固定影响系数中不报告标准差。如果想得到标准差,应该选择截距说明中的Common选项,来重新估计模型。
值得注意的是估计有太多截面成员的截面常数回归模型可能很费时。
变截距模型(2)
随机影响模型假设it项是共同系数和不随时间改变的截面说明随机变量ui 的和,ui和残差 i是不相关的。
EViews按下列步骤估计随机影响模型:
(1) 使用固定影响模型的残差eFE估计it的方差,并使用上述的 。
(2) 估计组间(截面平均)模型并计算:
。其中 。i = 1 , 2 , … , N , 是组间回归的SSR。如果 的估计值是负值,EViews将返回错误信息。有缺失观测值时Ti 在各截面成员间是不同的,在进行方差估计时使用最大Ti 的值。只要缺失观测值的数目可渐进忽略,估计就是一致的。
(3) 对转换后变量使用OLS (X包括常数项和回归量x )
。其中
EViews在输出中给出了由上式得到的的参数估计。使用协方差矩阵的标准估计量计算标准差。
。EViews给出了随机影响的估计值。计算公式为:
()
得到的是ui的最优线性无偏预测值。
最后,EViews给出了加权和不加权的概括统计量。加权统计量来自上式中的GLS估计方程。未加权统计量来自普通模型的残差,普通模型中包括上式中的参数和估计随机影响:
变系数模型
前面所介绍的变截距模型中,横截面成员的个体影响是用变化的截距来反映的,即用变化的截距来反映模型中忽略的反映个体差异的变量的影响。然而现实中变化的经济结构或不同的社会经济背景等因素有时会导致反映经济结构的参数随着横截面个体的变化而变化。因此,当现实数据不支持变截距模型时,便需要考虑这种系数随横截面个体的变化而改变的变系数模型。
变系数模型的基本形式如下:
i =1, 2, …, N ()
其中:yi 为因变量向量,xi 为 Tk 维解释变量矩阵,参数i 表示模型的常数项,i 为对应于解释变量矩阵 xi 的系数向量。随机误差项 ui 相互独立,且满足零均值、等方差的假设。
在式()所表示的变系数模型中,常数项 i 和系数向量 i 都是随着横截面个体的改变而变化的,因此可以将变系数模型改写成如下形式:
,i =1 , 2 , …, N ()
其中: ,i = (i , i ) 。类似于变截距模型,变系数模型也分为固定影响变系数模型和随机影响变系数模型两种类型。
模型()常用的有如下三种情形:
情形1: (不变系数模型)
情形2: (变截距模型)
情形3: (变参数模型)
对于情形1,在横截面上无个体影响、无结构变化,则普通最小二乘法估计给出了 和 的一致有效估计。相当于将多个时期的截面数据放在一起作为样本数据。
对于情形2,称为变截距模型,在横截面上个体影响不同,个体影响表现为模型中被忽略的反映个体差异的变量的影响,又分为固定影响和随机影响两种情况。
对于情形3,称为变系数模型,除了存在个体影响外,在横截面上还存在变化的经济结构,因而结构参数在不同横截面上是不同的。
模型形式设定检验 (2)
在对Panel Data模型进行估计时,使用的样本数据包含了个体、指标、时间3个方向上的信息。如果模型形式设定不正确,估计结果将与所要模拟的经济现实偏离甚远。因此,建立Panel Data模型的第一步便是检验被解释变量 yit 的参数 i 和 i 是否对所有个体样本点或时期都是一样的,即检验样本数据究竟符合上面哪种Panel Data模型形式,从而避免模型设定的偏差,改进参数估计的有效性。
经常使用的检验是协方差分析检验,主要检验如下两个假设:
H1:
H2:
可见如果接受假设 H2 则可以认为样本数据符合情形3,即模型为不变参数模型,无需进行进一步的检验。
如果拒绝假设H2,则需检验假设H1。如果接受H1,则认为样本数据符合情形2,即模型为变截距模型,反之拒绝H1 ,则认为样本数据符合情形1,即模型为变参数模型。
下面介绍假设检验的 F 统计量的计算方法。首先计算情形3(变参数模型)的残差平方和,记为 S1 ;情形2(变截距模型)的残差平方和记为 S2 ;情形1(不变参数模型)的残差平方和记为 S3 。计算 F2 统计量
()
在假设 H2 下检验统计量 F2 服从相应自由度下的F分布。若计算所得到的统计量 F2 的值不小于给定置信度下的相应临界值,则拒绝假设 H2,继续检验假设 H1。反之,接受 H2则认为样本数据符合模型情形1 ,即不变参数模型。
在假设H1下检验统计量F1也服从相应自由度下的F分布,即
()
若计算所得到的统计量F1的值不小于给定置信度下的相应临界值,则拒绝假设H1。
如果接受H1,则认为样本数据符合情形2,即模型为变截距模型,反之拒绝H1 ,则认为样本数据符合情形3,即模型为变参数模型。
Eviews操作
见附录pra15-1、高铁梅教材p357例及pra15-2(固定影响变截距模型)
上机作业:pra15-2(高铁梅教材p309例-)
pra15-和分别为1991-2003我国各城市个人消费与可支配收入数据。