案例分析 1:中国人口时间序列模型(file:b2c1)(怎样建立 AR 模型)
图 中国人口序列(1949-2000) 图 中国人口一阶差分序列(1950-2000)
从人口序列图可以看出我国人口总水平除在 1960 和 1961 两年出现回落外,其余年份基
本上保持线性增长趋势。51 年间平均每年增加人口 万人,年平均增长率为 ‰ 。
由于总人口数逐年增加,实际上的年人口增长率是逐渐下降的。把 51 年分为两个时期,即
改革开放以前时期(1949—1978)和改革开放以后时期(1979—1996),则前一个时期的人
口年平均增长率为 20‰,后一个时期的年平均增长率为 ‰。从人口序列的变化特征看,
这是一个非平稳序列。
见人口差分序列图。建国初期由于进入和平环境,同时随着国民经济的迅速恢复,人口
的年净增数从 1950 年的 1029 万人,猛增到 1957 年的 1825 万人。由于粮食短缺,三年经济
困难时期是建国后我国惟一一次人口净负增长时期(1960,1961),人口净增值不但没有增
加,反而减少。随着经济形势的好转,从 1962 年开始人口年增加值迅速恢复到 1500 万的水
平,随后呈连年递增态势。1970 年是我国历史上人口增加最多的一个年份,为 2321 万人。
随着 70 年代初计划生育政策执行力度的加强,从 1971 年开始。年人口增加值逐年下降,
至 1980 年基本回落到建国初期水平。1981 至 1991 年人口增加值大幅回升,主要原因是受
1962—1966 年高出生率的影响(1963 年为 ‰)。这种回升的下一个周期将在 2005 年前
后出现,但强势会有所减弱。从数据看,1992 年以后,人口增加值再一次呈逐年下降趋势。
由于现在的人口基数大于以往年份,所以尽管年增人口仍在 1 千万人以上,但人口增长率却
是建国以来最低的(1996 年为 ‰)。从Δyt 的变化特征看,1960,1961 年数据可看作是
两个离群值,其它年份数据则表现为平稳特征。但也不是白噪声序列,而是一个含有自相关
和(或)移动平均成分的平稳序列。
下面通过对人口序列 yt 和人口差分序列 Dyt 的相关图,偏相关图分析判别其平稳性以及
识别模型形式。
图 yt 的相关图,偏相关图
4
6
8
10
12
14
50 55 60 65 70 75 80 85 90 95 00
Y
50 55 60 65 70 75 80 85 90 95 00
DY
图 Dyt 的相关图,偏相关图(虚线到中心线的距离是 2 (1/ ) = )
见图 和图 。人口序列 yt 是非平稳序列。人口差分序列 Dyt 是平稳序列。应该用 Dyt
建立模型。因为 Dyt 均值非零,结合图 拟建立带有漂移项的 AR(1)模型。估计结果如下:
Dyt = + (Dyt-1 - ) + vt
() ()
R2 = , Q(10) = , Q (k-p-q) = (10-1-0-1) =
模型参数都通过了显著性 t 检验。
注意:
(1)根据 Wold 分解定理,EViews 的输出格式表示的是,对序列(Dyt - ) 建立 AR(1)
模型,而不是对 Dyt 建立 AR(1)模型。
(2)整理输出结果:
Dyt = () + Dyt-1 + vt = + Dyt-1 + vt
漂移项 = ,特征根是 1 / = 。
输出结果中的 是 Dyt 的均值,不是模型漂移项。以 AR(1)过程 xt=+ xt-1 + ut 为
例,两侧求期望,得均值 和漂移项0 的关系是
E(xt) = = ,或 = (1-)
51
11
对整理后的输出结果两侧求期望,就会反求出 = () =
(3)有没有漂移项对求特征方程和特征根无影响。
模型残差的相关图和偏相关图如下,
图 表 中模型(1)残差序列的相关图,偏相关图
因为
Q(10) = < ①( 10-1-0) =
可以认为模型误差序列为非自相关序列。
EViews 操作方法:从 EViews 主菜单中点击 Quick 键,选择 Estimate Equation 功能。随
即会弹出 Equation specification 对话框。输入漂移项非零的 AR(1)模型估计命令(C 表示漂
移项)如下:
D(Y) C AR(1)
注意:
(1)不能把命令中的 AR(1)写成 D(Y (-1))(写成 D(Y (-1))意味着做 OLS 估计)。
(2)写成 D(Y)的好处是 EViews 可以直接对 Y、D(Y)进行预测。
(3)模型中若含有移动平均项,EViews 命令用 MA(q)表示。
(4)估计的时间序列模型的 R2 不可能很高。因为变量差分后损失了很多信息。
(5)估计的模型是否成立应该从 3 个方面检查,①模型参数估计量必须通过 t 检验;①
全部的特征根的倒数必须在单位圆以内;①模型的残差序列必须通过 Q 检验。
(6)在模型估计结果窗口通过 View/ARMA Structure/Correlogram 命令可以观察样本的
相关图与理论 AR(1)过程相关图的对比图。
下面进行预测:
Dy2001 = + Dy2000 + v2001 = + ① +0=
y2001 = y2000 + Dy2001 = + =
EViews 给出的预测值是 ,结果相同。
预测的 EViews 操作方法:把样本容量调整到 1949-2001。打开估计式窗口,在 Equation
Specification(方程设定)选择框输入命令,D(Y) C AR(1),保持 Method(方法)选择框的
缺省状态(LS 方法),在 Sample(样本)选择框中把样本范围调整至 1949-2000。点击 OK
键,得到估计结果后,点击功能条中的预测(Forecast)键。得对话框及各种选择状态见下
图。
点击 OK 键,YF 和 YFse 序列出现在工作文件中。打开 YF 序列窗口,得 2001 年预测值
,见前图。
已知 2001 年中国人口实际数是 亿人。预测误差为
= =
图 点击 forecast 键只选取 2001 年动态或静态的预测结果
解法 2:
把中国人口序列 yt 看作是含有确定性趋势的平稳序列。前提是中国人口序列 yt 必须是
退势平稳序列。用 yt 对时间 t 回归,得
yt = + t + ut
(110) (102) R2 = , (1949-2001)
用 ut 检验单位根如下。
dut = ut-1 + dut-1
() () R2 = , (1951-2001), =
2001
YF
Forecast: YF
Actual: Y
Forecast sample: 2001 2001
Included observations: 1
Root Mean Squared Error
Mean Absolute Error
Mean Abs. Percent Error
图 16 ut 序列
ut 是一个平稳序列。所以 yt 是一个退势平稳序列。有理由建立一个含有固定趋势项的时
间序列模型。
图 17 ut 的相关图和偏相关图
通过观察 ut 的相关图和偏相关图,判定 ut 是一个二阶自回归过程。为正,2 为负。
特征根应该为复根。建立含有固定趋势项的二阶自回归模型
Y C @trend(1948) AR(1) AR(2)
估计结果如下:
50 55 60 65 70 75 80 85 90 95 00
RESID
写表达式如下:
yt = + t + ut, (1949,t = 1)
() ()
其中
ut = ut-1 - ut-2 + vt , (1949,t = 1)
() ()
或写为
yt = + t + ut-1 - ut-2 + vt , (1949,t = 1)
() () () ()
R2 = , (1951-2000) , Q(10) = , Q (k-p-q) = (10-2-0-2) =
模型残差序列的相关与偏相关图如下,
根据上式预测,2001 年中国人口预测数是
y2001 = +①53 +①() - ① ()
=(亿人), (2001 年, t = 53)
也可以把输出结果写为,
yt = + t + ((t-1)) - ((t-2))+vt
() () () ()
整理后得
yt = + t + yt-1 - -2 + vt
注意:EViews 的输出格式表示的是对序列(yt )估计 AR(2)模型。
根据上式预测,2001 年中国人口预测数是
y2001 = + ①53 +① ()① ()
=(亿人), (2001 年, t = 53)
EViews 预测的结果是 。已知 2001 年中国人口实际数是 亿人。预测误
差为
= =
图 点击 forecast 键只选取 2001 年动态或静态的预测结果
案例 2 日本人口时间序列模型(file:japopu)(怎样建立缺项的 AR 模型)
2001
YF
Forecast: YF
Actual: Y
Forecast sample: 2001 2001
Included observations: 1
Root Mean Squared Error
Mean Absolute Error
Mean Abs. Percent Error
图 1 日本人口序列(yt) 日本人口差分序列(Dyt)
人口数字之所以起于 1872 年,是因为 1872 年日本才有了全国人口统计数字。在 122
年间(1872-1994),日本人口从 万人增至 万人( 倍)。日本人口增加的特
点是两头慢,中间快。同时在 1944-1946 年和 1972 年人口总量出现了激烈波动。1944-1946
年的波动是因为战败,1972 年的波动是由于美国归还冲绳。由图 1 中的相关图可以判定日
本人口序列 yt 是一个非平稳序列。由图 2 可以看出日本人口差分序列 Dyt 是一个平稳序列。
图 3 是日本人口的二次差分序列 DDyt。它也是一个平稳序列。差分序列 Dyt 的极差是
,差分序列 DDyt 的极差是 。可见 DDyt 是一个过度差分序列。应该用 Dyt 建立时
间序列模型。
日本历史上有两次大规模向国外学习的过程。
一次是大化改新。大化改新(公元 645-649)是一场以圣德太子政治理念为基础的贵族
革命。圣德太子(公元 574-622)一心加强皇权,决心向中国学习,启蒙日本。他四度向中
国派遣使团和留学生。在它的影响下,其死后 23 年,即公元 645 年,中大兄皇子发动政变,
成功地建立了类似唐朝的中央集权机构。
一次是明治维新。明治维新始于 1868 年。从而开始了全面向西方学习的历史。口号是
“富国强兵”(福泽谕吉)。主要措施是(1)加强中央集权,1871 年实施“废藩治县”,(2)1872
年采取美国三权分立的政治体制,(3)1872 年统一货币,实行 1 日元=1 美元的兑换率,
(3)1872 年开始修铁路、建立现代统计制度,采用阳历等,(4)1873 年迁都东京。
1880 1900 1920 1940 1960 1980
Y
1880 1900 1920 1940 1960 1980
DY
图 2 yt 的相关图与偏相关图, Dyt 的相关图与偏相关图
图 3 日本人口二次差分序列 D2yt D2yt 相关图、偏相关图
由 Dyt 的相关图、偏相关图(见图 2)初步判定应建立均值非零的 AR(3) 或 AR(4) 模
型。估计结果如下: 先估计 AR(4) 模型,化简至 AR(3) 模型
图 4 EViews 估计结果
1880 1900 1920 1940 1960 1980
DDY
图 5 模型 () 残差的相关图与偏相关图
对应的模型表达式是
Dyt = + (Dyt-1 - ) + (Dyt-3 - ) + vt
() (3. 0) ()
R2 = , Q = , Q (k-p-q) = (15-2-0) =
注意:EViews 的输出格式表示的是对序列(Dyt - )估计 AR(3)模型。
整理:
Dyt = () + Dyt-1 + Dyt-3 + vt
Dyt = + D yt-1 + D yt-3 + vt
通过 t 值、DW 值、F 值和 Q 值,说明 () 式是一个满意的日本人口模型。图 5 显示模
型 () 的残差中已不含有自回归和移动平均成分。模型特征方程的 3 个根是
z1 = 1 / =
z2 = 1 / ( - i ) = -
z3 = 1 / ( + i ) = +
下面利用模型 () 预测 y1995,并计算预测误差。已知 dy1994 = ,dy1992 =
,则预测结果是,
1995 = + Dy1994 + Dy1992
= + ① + ① =
1995 = y1994 + 1995 = + =
已知 1995 年日本人口实际数是 亿人。预测误差为
= =
案例 3 中国粮食产量序列(yt)的 MA 模型(file: 5arma07)(怎样建立 MA 模型)
Dy
ŷ
Dy
粮食产量(yt)定义见《中国统计年鉴 2005》。Yt 是一个非平稳序列。用它的对数差分
序列 dLnyt 建立时间序列模型。dLnyt 的自相关函数见下图。dLnyt 是一个 ARMA 过程或 MA
过程。ARMA()过程
首先估计 ARMA(1,1)模型。结果如下:
dLnyt = (dLnyt-1 - ) + vt + vt-1
() () ()
R2 = , Q(15) = , Q (k-p-q) = (15-1-1) =
注意:如果估计结果中有均值项,只在自回归项中减之,不必在移动平均项中减之。
10000
20000
30000
40000
50000
60000
50 55 60 65 70 75 80 85 90 95 00
Y
50 55 60 65 70 75 80 85 90 95 00
LNY
自回归项没有显著性,去掉 AR(1)项,进一步建立 MA(1)模型。结果如下:
dLnyt = + vt + vt-1
() ()
R2 = , Q(20) = , Q (k-p-q) = (20-0-1-1) =
上述模型的各种检验与诊断都能通过,可以作为备选模型。
如果进一步分析,还可以把模型做得更好。观察残差序列发现在 7 年和 10 年上仍有较
大的自相关。这预示着序列中还存在 7~10 年的变化周期。
下图给出的是 dLnyt 作 3 年移动平均后退去趋势的序列,显然该序列存在着 7~10 年的
变化周期。把 vt-7 和 vt-10 作为变量加入模型。
得结果如下:
dLnyt = + vt + vt-1 vt-7 vt-10
() () () ()
R2 = , Q(15) = , Q (k-p-q) = (15-0-3-1) =
50 55 60 65 70 75 80 85 90 95 00
detrending moving average (3 years) of dlny
回归与 ARMA 组合模型(combined regression-time series model)。
已经学习回归模型和时间序列模型,如果把这两种分析方法结合在一起,有时会得到比
其中任何一种方法都好的预测结果。
例如有如下回归模型
yt = 0 + 1 xt + ut (15)
其中 xt 是解释变量,yt 是被解释变量,ut 是随机误差项。上述模型的估计式是
yt = + xt +
令 = 0,用上式可预测 yt 的值。 是一个平稳的、非自相关的残差序列。当 存在自相关
时,时间序列分析的一个有效应用是对残差序列 建立 ARMA 模型。然后将上式中的残差
项用 ARMA 模型替换。在利用上述模型预测 yt 时,可以利用 ARMA 模型先预测出 的值。
有时,这会使 yt 的预测值更准确。
这种回归与时间序列相结合的模型形式是
yt = + xt + -1(L) (L) vt (16)
其中 = -1(L) (L) vt,或写成 (L) = (L) vt。vt 是服从正态分布的、非自相关的误差
项。vt 的方差一般与 不一样。这种回归与时间序列相组合的模型称作转(变)换函数模型
(transfer function model),多元(变量)自回归移动平均模型(multivariate autoregressive
-moving average model),简称 MARMA 模型,或回归与时间序列组合模型(combined
regression-time series model)。
假设(15)式中的 ut 是一个 ARMA(1, 1)过程,则估计(15)式的 EViews 估计命令是
Y c X AR(1) MA(1)
注意:
(1)如果(15)式中的 ut 是一个 AR(1) 过程,则回归与 ARMA 组合模型表达的就是
误差项为一阶自相关的经典回归模型。
(2)以(16)式为例,按 Wold 分解定理,也可以对转换函数模型作如下理解。yt - 0
- 1 xt = ut 表示在 yt 中剔除了确定性影响0 +1 xt 后所得序列 ut 是一个不含任何确定性成分
0̂ 1̂ tû
tû tû tû
tû
tû
0̂ 1̂
tû tû
tû
的平稳的随机序列。用 ut 建立时间序列模型。
回归与 ARMA 组合模型也可以由被解释变量及其滞后项、一个或多个解释变量及其滞
后项、和描述随机误差序列的时间系列模型 3 部分组成。
只含有一个解释变量的转换函数模型,即一元回归与 ARMA 组合模型的一般形式是
A(L) yt = B(L) xt + -1(L) (L) vt
其中 ut = -1(L) (L) vt。A(L)是 yt 的特征多项式,B(L)是 xt 的特征多项式。(L)是 ut 的特征
多项式,(L)是 vt 的特征多项式。在实际应用中,转换函数模型的结构部分可以利用经济理
论和计量经济分析方法得到,而转换函数模型的时间序列部分(ut)可以通过时间序列模型
的分析方法得到。
案例 4 中国宏观消费案例(file:china)中带有自相关的估计结果如下
= + LnGDPt
() ()
R2 = , DW = , . = , (1952-2002)
残差序列的相关与偏相关图如下。应该是一个 2 阶自回归过程。
对 LnCPt 建立回归与时间序列组合模型,或对上式残差建立时间序列模型,EViews 命
令是:
LnCP C LnGDP AR(1) AR(2)
估计结果如下,
LnCPt = + LnGDPt + AR(1) - AR(2) +
() () () ()
R2 = , DW = , . = , (1954-2002)
即,
LnCPt = + LnGDPt + - +
消费对国内生产总值的真实弹性是 。
案例 5:(file: 5line03,5autoco7,autoco7)(广义 2 阶差分)中国储蓄存款总额(Y,
亿元)与 GDP(亿元)的计量经济模型
tLnCP
tv̂
1ˆ tu 2ˆ tu tv̂
用 Yt 对 GDPt 回归(eq03),
Yt = GDPt
() () R2 = , DW=, T = 42, (1960-2001)
残差图如下,
0
10000
20000
30000
40000
50000
60000
70000
80000
0 10000 30000 50000 70000 90000
GDP
Y
3
4
5
6
7
8
9
10
11
12
LOG(GDP)
LO
G
(Y
)
.0
.1
.2
.3
.4
.5
.6
.7
.8
1960 1965 1970 1975 1980 1985 1990 1995 2000
Y/GDP
图 1 线性模型的拟合与残差图
(2 阶自相关的 LM 检验结果,存在自相关。)
(无交叉项 White 异方差检验结果,存在异方差。)
上面估计模型误差项中既存在严重的自相关又存在异方差。下面建立对数线性模型。
(eq01)
LnYt = LnGDPt
() () R2 = , DW=, T = 42, (1960-2001)
-10000
-5000
0
5000
10000
15000
-20000
0
20000
40000
60000
80000
60 65 70 75 80 85 90 95 00
Residual Actual Fitted
图 2 对数线性模型的拟合与残差图
(2 阶自相关的 LM 检验结果,存在自相关)
模型中自相关仍然很严重。用残差直接拟合 2 阶自回归,回归参数都有显著性。
模型中已不存在异方差。
上面的回归结果可以看出残差中存在 2 阶自相关。
克服自相关方法(1):采取 2 阶广义差分变量继续回归。
GLnYt = LnYt LnYt-1+ Ln Yt-2
GLnGDPt = LnGDPt LnGDPt-1+ LnGDPt-2
2
4
6
8
10
12
60 65 70 75 80 85 90 95 00
Residual Actual Fitted
做异方差和自相关检验。
(1 阶自相关 LM 检验结果)
(2 阶自相关 LM 检验结果)
(无交叉项 White 异方差检验结果)
模型符合要求。储蓄存款总额(Y,亿元)对 GDP 的弹性是 。即 GDP 每增长 1%,
储蓄存款总额增长 %。
克服自相关方法(2):用回归加 ARMA 模型方法。
65 70 75 80 85 90 95 00
Residual Actual Fitted
对数线性模型
LnYt = LnGDPt
() () R2 = , DW=, T = 42, (1960-2001)
的残差的相关图、偏相关图。
(残差的相关图、偏相关图)
在对数线性模型中加入两个 AR 项。
模型中已不存在自相关和异方差。
(自相关检验结果)
(异方差检验结果)
模型符合要求。储蓄存款总额(Y,亿元)对 GDP 的弹性是 。即 GDP 每增长 1%,
储蓄存款总额增长 %。
弹性系数的 OLS 估计结果是 ,GLS 估计结果是 ,回归与 ARMA 组合模型
估计结果是 。
注意:这个方法要求对 ARMA 模型的设定一定要正确,否则对回归系数影响非常大。
应介绍的内容:序列是否平稳,过度差分问题,序列是否含有漂移项,识别模型结构,
怎样写 EViews 估计命令(自回归项用 AR(①)表示,移动平均项用 MA(①)表示),t 检验,Q
检验,正确写出输出结果(模型含有均值项时,要在每个 AR 项中减去均值,但移动平均项
中不减均值),预测方法,均值与漂移项的关系。时间序列估计模型的可决系数 R2 不会很大。