Wold 分解定理:任何协方差平稳过程 xt,都可以被表示为
xt - - dt = ut + 1 ut-1+ 2 ut-2 + … + =
其中 表示 xt 的期望。dt 表示 xt 的线性确定性成分,如周期性成分、时间 t 的多项式和指
数形式等,可以直接用 xt 的滞后值预测。0 = 1, < ∞。ut 为白噪声过程。ut 表示
用 xt 的滞后项预测 xt 时的误差。
ut = xt - E(xt ① xt-1, xt-2 , …)
称为 xt 的线性非确定性成分。当 dt = 0 时,称 xt 为纯线性非确定性过程。
Wold 分解定理由 Wold 在 1938 年提出。Wold 分解定理只要求过程 2 阶平稳即可。从
原理上讲,要得到过程的 Wold 分解,就必须知道无限个j 参数,这对于一个有限样本来说
是不可能的。实际中可以对j 做另一种假定,即可以把 (L)看作是 2 个有限特征多项式的
比,
(L) = = =
注意,无论原序列中含有何种确定性成分,在前面介绍的模型种类中,还是后面介绍的
自相关函数、偏自相关函数中都假设在原序列中已经剔除了所有确定性成分,是一个纯的随
机过程(过程中不含有任何确定性成分)。如果一个序列如上式,
xt = + dt + ut + 1 ut-1+ 2 ut-2 + … +
则所有研究都是在 yt = xt - - dt 的基础上进行。例如前面给出的各类模型中都不含有均值项、
时间趋势项就是这个道理。
自相关函数
以上介绍了随机过程的几种模型。实际中单凭对时间序列的观察很难确定其属于哪一种
模型,而自相关函数和偏自相关函数是分析随机过程和识别模型的有力工具。
1. 自相关函数定义
0
2
j j
0j jtj
u
0j
j
j L )(
)(
L
L
p
p
q
q
LLL
LLL
...1
...1
2
21
2
21
在给出自相关函数定义之前先介绍自协方差函数概念。由第一节知随机过程{xt}中的每
一个元素 xt,t = 1, 2, … 都是随机变量。对于平稳的随机过程,其期望为常数,用 表示,
即
E(x t) = , t = 1, 2, … ()
随机过程的取值将以 为中心上下变动。平稳随机过程的方差也是一个常量
Var(x t) = E [(xt - E(xt))2 ] = E [(xt - )2 ] = x2 , t = 1, 2, … ()
x2 用来度量随机过程取值对其均值 的离散程度。
相隔 k 期的两个随机变量 x t 与 xt - k 的协方差即滞后 k 期的自协方差,定义为
k = Cov (xt , x t - k ) = E[(xt - ) (xt - k - ) ] ()
自协方差序列
k , k = 0, 1, …, K,
称为随机过程 {xt} 的自协方差函数。当 k = 0 时
0 = Var (xt) = x2
自相关系数定义
k = ()
因为对于一个平稳过程有
Var (xt) = Var (xt - k) = x2 ()
所以()可以改写为
k = = = ()
当 k = 0 时,有 0 = 1。
以滞后期 k 为变量的自相关系数列
k, k = 0, 1, …, K ()
称为自相关函数。因为k = - k 即 Cov (xt - k , xt ) = Cov (xt , x t + k ),自相关函数是零对称的,
所以实际研究中只给出自相关函数的正半部分即可。
2.自回归过程的自相关函数
(1) 平稳 AR(1)过程的自相关函数
AR(1) 过程如下
xt = xt-1 + ut , ①① ① 1
用 xt- k 同乘上式两侧
xt xt- k = xt-1 xt- k + ut xt- k
两侧同取期望,
k = 1 k -1
其中 E(xt- k ut) = 0(ut 与其 t - k 期及以前各项都不相关)。两侧同除 0 得,
k = 1 k -1 = 1 1 k -2 = … = 1k 0
因为 o = 1。所以有
)()(
),(
ktt
ktt
xVarxarV
xxCov
2
),(
x
ktt xxCov
2
x
k
0
k
k = 1k , (k ① 0)
对于平稳序列有 ① ① ① 。所以当 1 为正时,自相关函数按指数衰减至零(过阻尼情
形),当 1 为负时,自相关函数正负交错地指数衰减至零。见图 。因为对于经济时间序
列,1 一般为正,所以第一种情形常见。指数衰减至零的表现形式说明随着时间间隔的加
长,变量之间的关系变得越来越弱。
① 0 (经济问题中常见) ① 0 (经济问题中少见)
图 AR(1) 过程的自相关函数
(2)AR(p) 过程的自相关函数
用 xt - k , (k ① 同乘平稳的 p 阶自回归过程
x t = 1 x t - 1 + 2 x t - 2 + … + p x t - p + u t
( 2 . 3 2 )
的两侧,得
x t - k x t = 1 x t - k x t - 1 + 2 x t - k x t - 2 + … + p x t - k x t - p + x t - k u t
( 2 . 3 3 )
对上式两侧分别求期望得
k = 1 k - 1 + 2 k - 2 + … + p k - p , k ① 0
( 2 . 3 4 )
上式中对于 k ① 0,有 E(xt - k ut ) = 0。因为当 k ① 0 时,xt - k 发生在 ut 之前,所以 xt - k 与 ut
不相关。
用 0 分别除()式的两侧得
k = 1 k - 1 + 2 k - 2 + … + p k - p , k ① 0
( 2 . 3 5 )
令 (L) = (1 - 1 L - 2 L2 - … - p Lp)其中 L 为 k 的滞后算子,则上式可表达为
(L) k = 0
因 (L) 可因式分解为,
(L) = ,
则()式的通解(证明见附录)是
k = A1 G1k + A2 G2k + … + Ap Gpk. ()
其中 Ai, i = 1, … p 为待定常数。这里 Gi-1, i = 1, 2, …, p 是特征方程
(L) = (1 - 1 L - 2 L2 - … - p Lp ) = 0
的根。为保证随机过程的平稳性,要求 | Gi | ① 1, i = 1, 2, …, p。这会遇到如下两种情形。
2 4 6 8 10 12 14
2 4 6 8 10 12 14
p
i
iLG
1
)-(1
① 当 Gi 为实数时,() 式中的 Ai Gik 将随着 k 的增加而几何衰减至零,称为指数衰
减(过阻尼情形)。
① 当 Gi 和 Gj 表示一对共轭复根时,设 Gi = a + bi, Gj = a – bi, = R,则 Gi , Gj
的极座标形式是 Gi = R (Cos + i Sin ),Gj = R (Cos - i Sin )。若 AR(p) 过程平稳,则
①Gi① < 1,所以必有 R <1。那么随着 k 的增加,Gik = Rk (Cosk + i Sink ),Gjk = Rk (Cosk
- i Sink ),自相关函数()式中的相应项 Gik , Gjk 将按正弦振荡形式衰减(欠阻尼情
形)。实际中的平稳自回归过程的自相关函数常是由指数衰减和正弦衰减两部分混合而成。
① 从()式可以看出,当特征方程的根取值远离单位圆时,k 不必很大,自相关函
数就会衰减至零。
① 有一个实数根接近 1 时,自相关函数将衰减的很慢,近似于线性衰减。当有两个以
上的根取值接近 1 时,自相关函数同样会衰减的很慢。
a. 两个特征根为实根 b. 两个特征根为共轭复根
图 AR(2) 过程的自相关函数
3. 移动平均过程的自相关函数
(1) MA(1) 过程的自相关函数。
对于 MA(1)过程 xt = ut + 1 ut-1
有
k = E(xt xt- k) = E [(ut + 1 ut -1) (ut - k + 1 ut -k -1)]
当 k = 0 时,
0 = E(xt xt) = E [(ut + 1 ut -1) (ut + 1 ut -1)]
= E (ut2 + 1 ut ut-1 + 1 ut ut-1 + 12 ut-12 ) = (1 + 12 ) 2
当 k = 1 时
1 = E(xt xt- 1) = E [(ut + 1 ut -1) (ut – 1 + 1 ut – 2 )]
= E (ut ut -1 + 1 ut -12 + 1 ut ut -2 + 12 ut -1 ut -2) = 1 E (ut -1) 2 = 1 2
当 k ① 1 时,
k = E [(ut + 1 ut -1) (ut – k + 1 ut – k -1)] = 0
综合以上三种情形,MA(1)过程自相关函数为
2 4 6 8 10 12 14
2 4 6 8 10 12 14
22 ba
k = = , k = 1
0 , k ① 1,
见图 。
1 ① 0 1 ① 0
图 MA(1)过程的自相关函数
可见 MA(1) 过程的自相关函数具有截尾特征。当 k ① 1 时,k = 0。
(2) MA(q) 过程的自相关函数
MA(q) 过程的自相关函数是
k = , k = 1, 2, …, q ,
0 k ① q ,
当 k ① q 时,k = 0,说明 k , k = 0, 1, … 具有截尾特征。
(注意:模型移动平均项的符号以及这里 k 的符号正好与 Box-Jenkins 书中的符号相反,
这样表示的好处是保持与计算机输出结果一致。)
4. ARMA (1, 1) 过程的自相关函数
ARMA (1, 1) 过程的自相关函数k 从 1 开始指数衰减。1 的大小取决于 1 和 1,
1 的符号取决于 (1 - 1 )。若 1 > 0,指数衰减是平滑的,或正或负。若 1 < 0,相关函
数为正负交替式指数衰减。
对于 ARMA (p, q) 过程,p, q ① 2 时,自相关函数是指数衰减或正弦衰减的。
5. 相关图(correlogram)
对于一个有限时间序列(x1, x2, …, xT)用样本平均数
=
估计总体均值 ,用样本方差
s2 =
估计总体方差x2。
当用样本矩估计随机过程的自相关函数,则称其为相关图或估计的自相关函数,记为
rk = , k = 0, 1 , 2, …, K, ( K < T ) . ()
rk 是对k 的估计。其中
2 4 6 8 10 12 14
2 4 6 8 10 12 14
0
k
2
1
1
1
22
2
2
1
2211
...1
...
q
qkqkkk
x
T
1
T
t
tx
1
2
1
)(
1
T
t
t xxT
0C
Ck
Ck = k = 0, 1, 2, …, K , ()
是对k 的估计
C0 = ()
是对0 的估计,T 是时间序列数据的样本容量。实际中 T 不应太小,最好能大于 60。
注意:()式分母为 T,不是 T-k。Ck 为有偏估计量。但在小样本条件下更有效。
注:2 个标准差 = 2 T -1/2 = 2(1/7)= 。图中虚线表示到中心线 2 个标准差宽度。
相关图是对自相关函数的估计。由于 MA 过程和 ARMA 过程中的 MA 分量的自相关函
数具有截尾特性,所以通过相关图可以估计 MA 过程的阶数 q。相关图是识别 MA 过程阶数
和 ARMA 过程中 MA 分量阶数的一个重要方法。实际应用中相关图一般取 k = 15 就足够了。
rk 的方差近似为 T-1。所以在观察相关图时,若 rk 的绝对值超过 2 T-1/2(2 个标准差),
就被认为是显著地不为零。当 T 充分大时,近似有
(rk -0) / T-1/2 = rk T1/2 ~ N (0, 1)
偏自相关函数
偏自相关函数是描述随机过程结构特征的另一种方法。用 kj 表示 k 阶自回归式中第 j
个回归系数,则 k 阶自回归模型表示为
xt = k 1 xt-1 + k 2 xt-2 + … + kk xt-k + ut
其中 kk 是最后一个回归系数。若把 k = 1, 2…的一系列回归式kk 看作是滞后期 k 的函数,
则称
kk, k = 1, 2 … ()
为偏自相关函数。它由下式中的红项组成。
xt = 11 xt-1 + ut
xt = 21 xt-1 + 22 xt-2 + ut
。。。
xt = k 1 xt-1 + k 2 xt-2 + … + kk xt-k + ut
因偏自相关函数中每一个回归系数 kk 恰好表示 xt 与 xt-k 在排除了其中间变量 xt-1, xt-2, …,
xt-k +1 影响之后的相关系数,
T
1
kT
t
ktt xxxx
1
),)((
2
1
)(
1
T
t
t xxT
xt - k 1 xt-1 - k 2 xt-2 - … - kk-1 xt-k +1 = kk xt-k + ut
所以偏自相关函数由此得名。
对于 AR(1)过程,xt = 11 xt-1 + ut,当 k = 1 时, 11 ① 0,当 k > 1 时,kk = 0,所以 AR(1)
过程的偏自相关函数特征是在 k = 1 出现峰值(11 = 1)然后截尾。
11 > 0 11 < 0
AR(1) 过程的偏相关图
对于 AR(2)过程,当 k ① 2 时,kk ① 0,当 k >2 时,kk = 0。偏自相关函数在滞后期 2
以后有截尾特性。
对于 AR(p)过程,当 k ① p 时,kk ① 0,当 k > p 时,kk = 0。偏自相关函数在滞后期 p
以后有截尾特性,因此可用此特征识别 AR(p)过程的阶数。
MA(1) 过程的偏自相关函数呈指数衰减特征。若1 > 0, 偏自相关函数呈交替改变符号
式指数衰减;若1 ① 0,偏自相关函数呈负数的指数衰减。
因为任何一个可逆的 MA(q) 过程都可以转换成一个无限阶的系数按几何递减的 AR 过
程,所以 MA(q) 过程的偏自相关函数呈缓慢衰减特征。
1 > 0 1 < 0
MA(1) 过程的偏自相关函数
例 5:对于 xt = ut + 1 ut-1 过程,有 [1/ (1+ 1 L)] xt = ut , 当1 > 0,
(1- 1 L + 12 L2 - … ) xt = ut ,
xt = 1 x t-1 - 12 x t-2 + 13 x t-3 - … + ut ,
对于 xt = ut - 1 ut-1 过程,有 [1/ (1- 1 L)] xt = ut ,当1 > 0,
(1+ 1 L + 12 L2 + … ) xt = ut ,
xt = - 1 x t-1 - 12 x t-2 - 13 x t-3 - … + ut ,
对于 MA(2) 过程,若 (L) = 0 的根是实数,偏自相关函数由两个指数衰减形式叠加而
成。若 (L) = 0 的根是虚数,偏自相关函数呈正弦衰减形式。
ARMA( p, q) 过程的偏自相关函数也是无限延长的,其表现形式与 MA(q)过程的偏自相
关函数相类似。根据模型中移动平均部分的阶数 q 以及参数i 的不同,偏自相关函数呈指
数衰减和(或)正弦衰减混合形式。
对于时间序列数据,偏自相关函数通常是未知的。可用样本计算 11, 22, … 的估计量
, , …。估计的偏自相关函数
, k = 1, 2, …, K, ()
称为偏相关图。因为 AR 过程和 ARMA 过程中 AR 分量的偏自相关函数具有截尾特性,所
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
11̂ 22̂
kk̂
以可利用偏相关图估计自回归过程的阶数 p。实际中对于偏相关图取 k = 15 就足可以了。
的方差近似为 T-1。当 T 充分大时,近似有
( -0) / T-1/2 = T1/2 ~ N (0, 1)
所以在观察偏相关图时,若 的绝对值超过 2 T-1/2(2 个标准差),就被认为是显著地不为
零。
时间序列模型的建立与预测
ARIMA 过程 yt 用
(L)Δdyt = 0 + (L) ut ()
表示,其中 (L)和 (L)分别是 p, q 阶的以 L 为变数的多项式,它们的根都在单位圆之外。
0 为位移项,Δd yt 表示对 yt 进行 d 次差分之后可以表达为一个平稳的可逆的 ARMA 过程。
这是随机过程的一般表达式。它既包括了 AR,MA 和 ARMA 过程,也包括了单整的 AR,
MA 和 ARMA 过程。
建立时间序列模型通常包括三个步骤。(1)模型的识别,(2)模型参数的估计,(3)诊
断与检验。
模型的识别就是通过对相关图的分析,初步确定适合于给定样本的 ARIMA 模型形式,
即确定 d, p, q 的取值。
模型参数的估计就是待初步确定模型形式后对模型参数进行估计。
诊断与检验就是以样本为基础检验拟合的模型,以求发现某些不妥之处。如果模型的某
些参数估计值不能通过显著性检验,或者残差序列不能近似为一个白噪声过程,应返回第一
步再次对模型进行识别。如果上述两个问题都不存在,就可接受所建立的模型。建摸过程用
图 表示。下面对建摸过程做详细论述。
1.模型的识别
模型的识别主要依赖于对相关图与偏相关图的分析。在对经济时间序列进行分析之前,
首先应对样本数据取对数,目的是消除数据中可能存在的异方差,然后分析其相关图。
识别的第 1 步是判断随机过程是否平稳。由 节知,如果一个随机过程是平稳的,其
特征方程的根都应在单位圆之外。由 节知,如果 (L) = 0 的根接近单位圆,自相关函数
将衰减的很慢。所以在分析相关图时,如果发现其衰减很慢,即可认为该时间序列是非平稳
的。这时应对该时间序列进行差分,同时分析差分序列的相关图以判断差分序列的平稳性,
直至得到一个平稳的序列。对于经济时间序列,差分次数,即模型()中的参数 d 通常
只取 0,1 或 2。
kk̂
kk̂ kk̂
kk̂
一. 识别
用相关图和偏相关图识别模型
形式(确定参数 d, p, q)
二. 估计
对初步选取的模型进行参数估计
三. 诊断与检验
包括参数的显著性检验和
残差的随机性检验
2 4 6 8 10 12 14
2 4 6 8 10 12 14
图 建立时间序列模型程序图
实际中也要防止过度差分。一般来说平稳序列差分得到的仍然是平稳序列,但当差分次
数过多时存在两个缺点,(1)序列的样本容量减小;(2)方差变大;所以建模过程中要防
止差分过度。对于一个序列,差分后若数据的极差变大,说明差分过度。
第 2 步是在平稳时间序列基础上识别 ARMA 模型阶数 p, q。表 给出了不同 ARMA
模型的自相关函数和偏自相关函数。当然一个过程的自相关函数和偏自相关函数通常是未知
的。用样本得到的只是估计的自相关函数和偏自相关函数,即相关图和偏相关图。建立
ARMA 模型,时间序列的相关图与偏相关图可为识别模型参数 p, q 提供信息。相关图和偏
相关图(估计的自相关系数和偏自相关系数)通常比真实的自相关系数和偏自相关系数的方
差要大,并表现为更高的自相关。实际中相关图,偏相关图的特征不会像自相关函数与偏自
相关函数那样“规范”,所以应该善于从相关图,偏相关图中识别出模型的真实参数 p, q。另
外,估计的模型形式不是唯一的,所以在模型识别阶段应多选择几种模型形式,以供进一步
选择。
表 ARIMA 过程与其自相关函数偏自相关函数特征
模 型 自相关函数特征 偏自相关函数特征
ARIMA(1,1,1)
xt = 1 xt-1 + ut + 1ut-1
缓慢地线性衰减
AR(1)
xt = 1 xt-1 + ut
若1 > 0,平滑地指数衰减
若1 < 0,正负交替地指数衰减
若11 > 0,k=1 时有正峰值然后截尾
若11 < 0,k=1 时有负峰值然后截尾
MA(1)
xt = ut + 1 ut-1
若1 > 0,k=1 时有正峰值然后截尾 若1 > 0,交替式指数衰减
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
模型可取吗
止
2 4 6 8 10 12 14
2 4 6 8 10 12 14
可取
不可取
若1 < 0,k=1 时有负峰值然后截尾
若1 < 0,负的平滑式指数衰减
AR(2)
xt = 1 xt-1 + 2 xt-2 + ut
指数或正弦衰减
(两个特征根为实根)
(两个特征根为共轭复根)
k=1, 2 时有两个峰值然后截尾
(1 > 0,2 > 0)
(1 > 0,2 < 0)
MA(2)
xt = ut + 1 ut-1+ 2 ut-2
k=1, 2 有两个峰值然后截尾
(1 > 0,2 < 0)
(1 > 0,2 > 0)
指数或正弦衰减
(1 > 0,2 < 0)
(1 > 0,2 > 0)
ARMA(1,1)
xt = 1 xt-1 + ut + 1 ut-1
k=1 有峰值然后按指数衰减
(1 > 0,1 > 0)
k=1 有峰值然后按指数衰减
(1 > 0,1 > 0)
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
(1 > 0,1 < 0) (1 > 0,1 < 0)
ARMA(2,1)
xt = 1 xt-1+ 2 xt-2+ ut + 1 ut-1
k=1 有峰值然后按指数或正弦衰减
(1 > 0,2 < 0,1 > 0)
k=1, 2 有两个峰值然后按指数衰减
(1 > 0,2 < 0,1 > 0)
ARMA(1,2)
xt = 1 xt-1+ ut + 1 ut-1+ 2 ut-2
k=1, 2 有两个峰值然后按指数衰减
(1 > 0,1 > 0,2 < 0)
(1 > 0,1 > 0,2 >0)
k=1 有峰值然后按指数或正弦衰减
(1 > 0,1 > 0,2 < 0)
(1 > 0,1 > 0,2 > 0)
ARMA(2,2)
xt=1xt-1+2xt-2+ ut +1ut-1+2ut-2
k=1, 2 有两个峰值然后按指数或正弦
衰减
(1 > 0,2 < 0,1 > 0,2 < 0)
(1 > 0,2 < 0,1 > 0,2 > 0)
k=1, 2 有两个峰值然后按指数或正弦
衰减
(1 > 0,2 < 0,1 > 0,2 < 0)
(1 > 0,2 < 0,1 > 0,2 > 0)
下面通过一些相关图和偏相关图识别模型结构。
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2 4 6 8 10 12 14
2. 模型参数的估计
对于时间序列模型,一般采用极大似然法估计参数。对于一组相互独立的随机变量 xt,
(t = 1, 2, …, T),当得到一个样本 (x1, x2, …, xT) 时,似然函数可表示为
L ( | x1, x2, …, xT) = f (x1| ) f (x2| ) … f (xT | ) = | )
()
其中 =(1, 2, …, k)是一组未知参数。对数似然函数是
log L = f (xt | )
通过选择 使上式达到最大,从而求得极大似然估计值 。具体步骤是用上述对数似然
函数对每个未知参数求偏导数并令其为零,即
= 0
…
= 0, (k 个方程联立)
一般来说似然函数是非线性的,必须采用迭代计算的方法求参数的极大似然估计值。极大似
然估计量 (MLE) 具有一致性和渐近有效性。
首先讨论怎样对如下线性回归模型
yt = 0 + 1 xt1 + 2 xt 2 + … + k-1 xt k -1 + ut , t = 1, 2, …, T, ()
进行极大似然估计。假定 ut ① N(0, 2 ), 则 yt 也服从正态分布。
yt ① N(E(yt), 2 ),
其中 E(yt) = 0 + 1 xt1 + 2 xt 2 + … + k -1 xt k -1。若 yt 是相互独立的,则对于样本 ( y1,
y2, …, yT),似然函数是
L(, 2 | y1, ,y2, …, yT) = f( y1) f( y2) … f( yT)
其中 表示未知参数 0, 1, …, k -1 的集合。由()式每个 yt 的概率密度函数为
f ( yt ) = exp[ ].
对于样本 ( y1, y2, …, yT),对数似然函数为
logL = f ( yt ) = - log 2 - log 2 - - E( yt ) ]2 ()
上式右侧前两项是常量。第三项的符号为负,所以对 logL 极大化等同于选择 值从而使平
方和 - E( yt )]2 极小化,即选择 使
- - xt 1 - xt 2 - … - xt k -1) 2 =
极小化。上式中 表示残差。这种估计方法恰好与 OLS 法相同,所以在这个例子中 的
MLE 估计量 与 OLS 估计量 完全相同,即 = 。与 OLS 法不同的是极大似然估计法在
估计 的同时,还得到 ut 方差的估计量。对()式求 2 的偏导数并令其为零。
T
t
txf
1
(
T
t
log
1
̂
1
log
L
k
L
log
2/12 )2(
1
2
2
2
))(E(
tt yy
T
t
log
1 2
T
2
T
T
t
ty
1
2 [2
1
~
T
t t
y
1
[
~
T
t
ty
1
( 0
~
1
~
2
~
1
~
k
T
t
tu
1
2~
tu
~
~
̂
~
̂
~
= - + - E( yt ) ]2 = 0 ()
用 代替上式中 E(yt) 中的 得
= T -1
现在讨论怎样对时间序列模型的参数进行极大似然估计。
对于非平稳过程 yt ,假定经过 d 次差分之后可以表达为一个平稳、可逆的自回归移动
平均过程 xt ,
(L) d yt = (L) xt = (L) ut.
()
对于 yt 假定可以观测到 T + d 个观测值,即 y- d+1, …, y0, y1, …, yT ,则经过 d 次差分之后, xt
的样本容量为 T。 以 {x1, …, xT }为样本估计 ARMA (p, q) 模型参数 (1, …, p, 1, …,
q )。 对随机过程{xt}的参数估计就如对回归模型的参数估计一样,目的是使 xt 与其拟合值
的残差平方和
=
最小。把 () 式改写为
ut = . ()
若用 , 和 分别表示对i, i 和 ut 的估计,则使下式最小。
= S ( , …, , , …, ) ()
假定 ut ① N (0, u2), t = 1, … T,且不存在自相关,则条件对数似然函数为
log L = -T logu - ()
之所以称之为条件对数似然函数是因为 依赖于过去的不可知观测值 x0, x-1, …, x- p+1
和 u0, u-1, …, u- q +1。比如
u1 = x1 - 1 x0 - 2 x-1 - … - p x-p+1 - 1u0 - …- qu- q+1
()
对()式求极大即等同于对 求极小。对 求极小时需要先确定 x0, x–1, …, x-p+1
和 u0, u-1, …, u- q +1 的值。此问题的一般处理方法是取这些变量等于他们的无条件期望值。
u0, u-1, …, u- q +1 的无条件期望值为零。若模型()中不含有漂移项,则 x0, x-1, …, x- p +1
的无条件期望值也为零。当样本容量 T 与滞后长度 p, q 值相比充分大,且1, …, p 的值不
接近 1 时,这种近似非常理想。
若 () 式中不含有移动平均项,对于自回归参数来说 () 式是一个线性函数。可
以用 OLS 法估计参数。如果 () 式中含有移动平均项,那么对于移动平均参数来说,
() 式是一个非线性函数。对 () 式必须采用非线性估计方法。
首先假定模型为纯自回归形式,
2
Llog
22
T
42
1
T
t
ty
1
[
~
2~
T
t
tu
1
2~
tx̂
t
tt xx
2)ˆ(
t
tu
2ˆ
txL
L
)(
)(
î î tû
t
tu
2ˆ 1̂ p̂ 1̂ q̂
2
2
2
ˆ
u
t
tu
2ˆ tu
2ˆ tu 2ˆ tu
(L) xt = ut ()
或
xt = 1 xt-1 + … + p xt-p + ut .
()
这是一个线性回归模型,极大似然估计与 OLS 估计结果近似相同。
当模型中含有移动平均成分时
ut = -1(L) (L) xt ()
对于参数来说,模型是非线性的。对于非线性模型,通常由三种估计方法。
①直接搜索法。通过改变参数的取值,反复计算残差平方和 的值。然后从中选择
最小的那个值所对应的参数值作为对参数的估计值。这种方法只有在参数个数较少时才是可
行的。当参数个数较多时,计算量将非常大。例如当含有四个被估参数,每个参数需选择 20
个计算值时,则需要计算 (20) 4 = 160000 次。
①直接优化法。求误差平方和函数对每一个参数的偏导数并令其为零,从而求得正规方
程
= 0, i =1, …, p + q ()
其中(1, …, p+q)=(1, …, p, 1, …, q)。因为 p + q 个方程中都含有 p + q 个参数,
所以必须联立求解。由于计算上的困难,这种方法很少直接采用。
①线性迭代法。对任何非线性函数通常都可以按泰勒级数展开。
f (x) = f (x0) + f ‘(x0) (x – x0) + … = f (x0) - f ‘(x0) x0 + f ‘(x0) x + …
首先为参数选一组初始值(1, 0 , …, p+q, 0)(下标零表示初始值。怎样确定初始值并不
重要。), 然后将 xt = f (xt-1, …, xt-p) 按泰勒级数在(1, 0 , …, p+q, 0)点展开。
xt = f (xt-1, …, xt-p, 1, 0 , …, p+q, 0 ) +
+ + … ()
其中偏导数的下标写为零表示偏导数在 1 = 1, 0 , …, p+q = p+q, 0 时的值。取上式右侧的
前两项对原非线性函数 xt 进行近似。去掉右侧第三项及以后各项得
xt - f (xt-1, …, xt-p, 1, 0 , …, p+q, 0 ) + = + ut.
()
2ˆ tu
i
t
tu
)ˆ( 2
)( 0,
01
ii
qp
i i
f
))((
2
1
0,0,
01 1
2
jjii
qp
i
qp
j ji
f
01
0,
qp
i i
i
f
01
qp
i i
i
f
上式为线性回归方程形式。左侧为已知量,右侧含有一组未知量i , i = 1, …, p + q。利用 OLS
法对上式进行估计。设所得估计值用(1, 1 , …, p+q, 1)表示。以此作为第二组估计值,对
非线性函数再一次线性化,从而得到一个新的线性方程。
xt - f (xt-1, …, xt-p, 1, 1 , …, p+q, 1 ) + = + ut
()
对上式再次应用 OLS 法估计参数,并把 (①1, 2, …, ①p+q, 2) 作为待估参数的第三组估计值。
重复上述过程,直至满足如下要求为止。
< , i = 1, …, p + q, ()
其中 i 表示参数序号,j 表示迭代次数。 是预先给定的精度标准。
如果最后一次的参数估计值用 (1, k , …, p+q, k ) 表示,并且 (1, k , …, p+q, k ) 接近真
值 (1 , …, p+q ) ,则必有,
①
所以有
xt = f (xt-1, …, xt-p, 1, k , …, p+q, k ) +
(1, k , …, p+q, k ) 是对 (1, …, p+q ) 的最终估计。这种迭代计算一般都是通过计算机完成。
评价线性模型的一些统计量例 F, t 等都不能直接用于评价非线性模型。原因是尽管 ut 是
正态分布的且均值为零,但残差
= xt - = xt - f (xt-1, …, xt-p, 1, k , …, p+q, k )
()
不服从正态分布,则 不服从 2 分布,参数估计量不服从正态分布。所以不能使用
F 和 t 检验。然而对迭代中的最后一步可以进行 F, t 检验。 如果估计量 = i, k , (i =
1, …, p + q),接近真值i,那么 F, t 检验将会对非线性模型有很满意的解释作用。
3. 诊断与检验
完成模型的识别与参数估计后,应对估计结果进行诊断与检验,以求发现所选用的模型
是否合适。若不合适,应该知道下一步作何种修改。
这一阶段主要检验拟合的模型是否合理。一是检验模型参数的估计值是否具有显著性;
二是检验模型的残差序列是否为白噪声。参数估计值的显著性检验是通过 t 检验完成的,而
模型的残差序列是否为白噪声的检验是用 Box-Pierce (1970) 提出的 Q 统计量完成的。Q 检
验的零假设是
H:1 = 2 = … = K = 0
即模型的误差项是一个白噪声过程。Q 统计量定义为
Q = T ()
近似服从 ①2( K - p - q) 分布,其中 T 表示样本容量,rk 表示用残差序列计算的自相关系数值,
K 表示自相关系数的个数,p 表示模型自回归部分的最大滞后值,q 表示移动平均部分的最
11
1,
qp
i i
i
f
11
qp
i i
i
f
ij
ijji
1,
k
qp
i i
ki
f
1
,
k
qp
i i
i
f
1
tû
tû tx̂
2ˆ tu
î
K
k
kr
1
2
大滞后值。
Ljung 和 Box 认为()式定义的 Q 统计量的分布与①2( K - p - q)分布存在差异(相应值偏
小),于是提出修正的 Q 统计量。
Q = T (T+2) ()
其中 rk ,K,p,q 的定义如()式。修正的 Q 统计量() 近似服从 ①2( K - p - q) 分布。且
它的近似性比原 Q 统计量的近似性更好。(EViews 中给出的 Q 统计量就是按()式定义
的。)
用残差序列计算 Q 统计量的值。显然若残差序列不是白噪声,残差序列中必含有其他
成份,自相关系数不等于零。则 Q 值将很大,反之 Q 值将很小。判别规则是:
若 Q < ①2 ( K - p - q) ,则接受 H0。
若 Q > ①2 ( K - p - q) ,则拒绝 H0。
其中 表示检验水平。
4. 时间序列模型预测
下面以 ARMA (1, 1) 模型为例具体介绍预测方法。其他形式时间序列模型的预测方法
与此类似。
设对时间序列样本{xt}, t = 1, 2, …, T,所拟合的模型是
xt = 1 xt-1 + ut + 1 ut-1 ()
则理论上 T + 1 期 xt 的值应按下式计算
xT+1 = 1 xT + uT+1 + 1 uT ()
用估计的参数 , 和 分别代替上式中的 1, 1 和 uT 。 上式中的 uT+1 是未知的,但知
E(uT+1) = 0,所以取 uT+1 = 0。xT 是已知的(样本值)。对 xT+1 的预测按下式进行
= xT + ()
由()式,理论上 xT+2 的预测式是
xT+2 = 1 xT+1 + uT+2 + 1 uT+1
仍取 uT+1 = 0,uT+2 = 0,则 xT+2 的实际预测式是
= ()
其中 是上一步得到的预测值,与此类推 xT+3 的预测式是
= ()
由上可见,随着预测期的加长,预测式 () 中移动平均项逐步淡出预测模型,预测式变
成了纯自回归形式。
若上面所用的 xt 是一个差分变量,设 yt = xt ,则得到的预测值相当于 , (t = T +1,
T +2 , … )。因为
yt = yt-1 + yt
所以原序列 T+1 期预测值应按下式计算
K
k
k
kT
r
1
2
1̂ 1̂ Tû
1ˆ Tx 1̂ 1̂ Tû
2ˆ Tx 1̂ 1ˆ Tx
1ˆ Tx
3ˆ Tx 1̂ 2ˆ Tx
tŷ
= yT + ()
对于 t > T +1,预测式是
= + , t = T +2, T +3, … ()
其中 是相应上一步的预测结果。
用 EViews 计算相关图和偏相关图。
附录:对()式(自相关函数通解表达式)的证明
对于 AR(p) 过程
xt = 1 xt -1 + 2 xt -2 +…+ p xt - p + ut (1)
它的自相关函数满足下式,
k = 1 k -1 + 2 k -2 + … + p k –p, k ① 0
(2)
(见《计量经济分析》第 77 页)即有
(1 - 1 L - 2 L2 - … - p Lp ) k = 0 (3)
则(2)式的自相关函数有如下形式通解,
k = A1 G1k + A2 G2k + … + Ap Gpk. (4)
其中 Ai, i = 1, … p 为待定系数。Gi-1, i = 1, 2, …, p 是(3)式特征方程
(1 - 1 L - 2 L2 - … - p Lp ) = 0
的根。
证明(1):首先以 AR(2) 过程为例
xt = 1 xt -1 + 2 xt -2 + ut (5)
由上式可知
k = 1 k -1 + 2 k -2 , k ① 0 (6)
即有
(1 - G1 L ) (1 – G2 L ) k = 0 (7)
其中,Gi-1, i = 1, 2 是方程(1 - 1 L - 2 L2 ) = 0 的根。令
(1 – G2 L ) k = yk (8)
由(7)式,可得
(1 - G1 L ) yk = 0 (9)
将上式展开并进行迭代,可得
yk = G1 yk-1 = G1 (G1 yk-2) = G12 yk-2 = … = G1k y0
1ˆ Ty 1ˆ Ty
tŷ 1ˆ ty tŷ
1ˆ ty
其中 y0 是由初始值确定的常数。由(8)式可得
k = G2 k-1 + yk = G2 k-1 + y0 G1k (10)
对上式进行迭代,
k = G2 (G2 k-2 + y0 G1k-1) + y0 G1k
= G22 k-2 + y0 G2 G1k-1 + y0 G1k
….
= G2k 0 + y0 (G1k + G2 G1k-1 + … + G2 k-1 G1) (11)
当(3)式有相同的根(G1 = G2)时,
k = G1k + y0 k G1k = G1k (1+ y0 k)
当(3)式的根不相等(G1≠G2)时,因为
G1k - G2k = (G1 - G2) (G1 k -1 + G1 k -2 G21 +…+ G11 G2 k -2 + G2 k -1),
所以(11)式
k = G2k 0 + y0 G1 (G1k-1 + G2 G1k-2 + … + G2 k-1)
= G2k 0 + y0 G1 = G2k 0 + (G1k –G2 k)
= G2k + G1k – G2 k = G1k – (1– ) G2 k
= A1G1k – A2 G2 k (12)
其中
A1 = , A2 = 1-
同理可以证明(2)式的通解是(4)式。(Ai 是一个权数,所以它应该与系数以及系数方程
的特征根有关系的。)
证明(2):下面用归纳法证明。假定对于 AR(p-1) 过程,
xt = 1 xt -1 + 2 xt -2 +…+ p-1 xt – p+1 + ut (13)
则它的自相关函数有如下形式通解
k = A1,p-1 G1k + A2,p-1 G2k + … + Ap-1,p-1 Gp-1k. (14)
其中,Gi-1, i = 1, 2, …, p-1 是方程(1 - 1 L - 2 L2 - … - p-1 Lp -1 ) = 0 的根;Ai,p-1, i = 1, … p-1
为待定系数。
21
21
GG
GG kk
12
0
/1 GG
y
12
0
/1 GG
y
12
0
/1 GG
y
12
0
/1 GG
y
12
0
/1 GG
y
12
0
/1 GG
y
12
0
/1 GG
y
对于 AR(p) 过程,
xt = 1 xt -1 + 2 xt -2 +…+ p xt - p + ut (15)
则它的自相关函数满足下面方程
k = 1 k -1 + 2 k -2 + … + p k –p, k ① 0 (16)
即有
(1 - G1 L ) (1 – G2 L ) … (1 – Gp L )k = 0 (17)
其中,Gi-1, i = 1, 2 是方程(1 - 1 L - 2 L2 - … - p Lp) = 0 的根。令
(1 – G p L ) k = yk (18)
由(17)式,可得
(1 - G1 L ) (1 – G2 L ) … (1 – Gp-1 L )yk = 0 (19)
即 yk 满足 AR(p-1) 过程的自相关函数方程,从而可得
yk = A1 G1k + A2 G2k + … + Ap-1 Gp-1k. (20)
由(18)式可得
k = Gp k-1 + yk = Gp k-1 + (21)
对上式进行迭代,
k = G p (G p k-2 + ) +
= G p 2 k-2 + = ….
= G p k 0 + (22)
证毕
1
1
1
1
)1(
p
i
k
ip
i
p
p
i
p
i GG
G
G
G
A
1
1
p
i
k
iiGA
1
1
1
,
p
i
k
ipi GA
1
1
,
p
i
k
ipi GA
1
1
, )1(
p
i
k
i
i
p
pi GG
G
A