麻省理工 Guido Kuersteiner 经济系 时间序列 第五讲笔记 ARMA模型的估计与规范表达 首先考虑AR(p)模型的估计量。假设x可由下式得到: t 这里e是一个鞅的差分序列,即(或白噪声加混合值加动差限制)EtΜe=0。这里Μ包t−1tt括了{x,s≤t}的所有可度量方程。这一假设比先前作出的WN假设更为有力。叠加s'z=(x−1,...,x)ttt−p,则f的OLS估计量就为 假设WLLN成立,则有 这里 如果z是严格平稳的,E'zz=Γ且一个称为各态历经性的附加技术条件成立,则WLLN成ttt立。 下面我们将转向渐进分布。首先请注意ze也是一个鞅的差分序列。那么,如果ttp2+dsupEze<∞,且1ttt∑'2'2(ze−Ezze)→0,则我们可以运用一个鞅的差分CLTTttttt来表示 1
:如果另外有E22Μe=s,则E'2=2zzesΓ,。因此f的渐进分布就为 −ttttt1:→dTf−Ns2Γ−1()(0,) 估计 极大似然估计量就是对y求 的最大值,这里f(.|y)为{x1,...,xT}的联合分布。如果X'T=(x1,...,xT)是一个Gaussian时间序列,则似然方程就为 这里Γy=EXX'T()TT就是XT的T×T协方差矩阵。该协方差矩阵是下列参数的非线形方程。因此,直接对()求最大值就是一个高度非线形最优化问题。考虑x的条件密度,t该问题可以得到简化。我们可以将联合密度写为条件密度的表达式 如果x是一个高斯序列,则条件密度都是正态的,且有条件均值为x=PtΜlx,x的条件ttt−12方差为s2=x−PttΜlx。在第5讲中,我们可以看到,这些表达式是如何进行递归运算t−1的。因此,假设具有高斯特性,则对于y的每一个参数取值都可以采用递归的方式计算出确切的似然值。特别地,我们还可以避免T×T矩阵ΓT(y)的多次转换。 在特殊情况下,上述情况还可以进一步简化。举例来说,如果我们规定2e:N(0,s) t且 则 有 2
对似然方程求对数得到 如果我们忽略最后一项,并分别对f求logf(x1,...,xT;y)的最大值,可见,ML估计量渐进地等于OLS。这一结论是在e具有高斯特性的假设条件下推导出来的。如果高斯特性不t成立,我们仍然可以利用()作为标准方程。在这个例子中,估计量被称为准极大似然估计量。可见,在一定条件下,包括E22Μe=s,只要误差项确实是正态的,最后的估计−1tt量都有相同的似然分布。 在其他情况下,通过修改公式,可以近似地得到新的方法。特别地,我们发现,观察投影系数的限制性表现,可以有效地处理ARMA(1,1)。对于经过多项式f(L)=(1−fL)和q(L)=(1−qL)参数化的ARMA(1,1),我们可以得到似然方程的以下近似公式 令e0=0,可以得到全部似然值。现在我们有 这里c=1+2qf+q2−f2()(1)。 分别对f和q求f(x1,...,xT;y)的最大值,相当于求以下和的最小值 通常最后一项可以去掉,因为它没有渐进性的影响。对残差e进行递归运算,可以求出对t任意f和q取值的和S(f,q)的值,即 因此,我们可以用数值算法估计在不同的f,q下的ST(f,q)取值。 3
更常见的情况是,经过模型f(L)=(1−f1L−−fp..pL)和q(L=−q1L−−Lq)(1..q)参数化的ARMA(1,1)的ML估计量可以写作 这里m=maxpqX'(,),m=(x1,...,xm),且Γ=EX'mmXm。误差项可以近似写为 更进一步地,可以运用下式进行近似运算 以估计参数值。 估计量的渐进分布 标准方程ST(f,q)最小值的估计量是连续的,且为渐进正态的。更通常的情况是,令QT(b)=logf(x1,...,xT;y)。如果对于每一个C值,都有 则概率方面具有连续性,这里Q(y)是一个非随机方程。另外,对于任何d>0和邻域N(y0,d),需要有 在ARMA模型中,有y=(b,s),这里b=(f1,...,fpq1,...,q)。从中可看出,对于ARMA,当QT(y)为高斯似然时,满足()式的C值就为 C={b∈�p+q|f(z)(z)≠0,如果z≤1,fp≠0,q≠0,f(z)和q(z)没有共通零} 注意如果b∈C,则s是可识别的,。 总之,这一条件意味着,AR和MA多项式应当没有共通零,应当都有位于单位圆外的根,且分别为非平凡的p阶和q阶。特别地,它意味着两个多项式中的最高阶系数都不为零。下面我们给出的例子中,对q的两个不同参数值,MA模型都具有相同的自协方差方程。你可以检查发现只有一个模型包含在C中。 4
例 MA(1)模型 模型MA(1) 和 看上去是相等的,也就意味着它们包含着相同的自协方差方程。 如果满足条件()和(),且 则有概率y�→y0。条件()和()可被认为对含高斯标准方程的ARMA模型是有效的。具体的证明有些复杂,因为C不是一个紧缩值。这里我们将其忽略。 一个连续性结论通常是获得估计量的渐进分布的第一步。第二步包括证明y�T位于大概率的真实参数的1T邻域之内。在真实参数y0的邻域内进行泰勒展开,可获得估计量的渐进分布。如 这里 其中u=f1(L−)e,且v=qL−1()e。限制性协方差矩阵V(b)可以表示为ttttU=u,uV=ttt−1,...,ut−p+1和v,v−1,...,vtttt−q+1。注意限制性协方差矩阵并不依赖于s2。 例(ARMA(1,1)) 因而u=∑∞jtj=0f1et−且v=j∑∞jEv2=s21, tj=0q1et−。从中可以得出jt1−f211Ev2=s21,和Euv=s2。 ttt1−q211−.阶的选择 在能够估计ARMA(p,q)模型以前,我们需要选择AR和MA多项式的阶p和q。在第2 5
讲中,我们看到,自相关和偏自相关方程基本上构成了纯AR(p)和MA(q)模型的特征。 对于一个纯MA(q)序列,j次自相关系数的方差为 可由下式估计得出 这里 为了识别出MA多项式的阶,我们可以检查对哪些h值,待估自相关系数�r(h)位于下式之内 同样的方式,我们可以从偏自相关方程中识别出纯AR(p)模型。对于一个纯AR(p)模型,偏自相关方程f$(n)对n>p都有方差1。因而,我们可以检查得出,对于哪个j值,T待估参数f$(j)位于±之内。 T如果模型是一个混合的ARMA(p,q)模型,则上面的识别程序就会碰到麻烦。仍然看数据的自相关和偏相关方程,可得到两个滞后多项式的最大次数。但是,在信息标准的基础上,有一个更正规的程序,可用于自动地确定最好的模型。 如果序列{x}Ttt=1有一个真实密度f(x,y0),ARMA有密度f(x,q),则Kullback-Leibler距离就为 这里d(y0|q)=0,当且仅当f(x,y0)=f(x,q)。距离d(y0|q)的度量可以近似表示为 6
这里�21=∑e�2s是s2的极大似然估计量。最好的描述模型的方式就是通过计算AICTt(p,q)对于p,q的不同取值并寻找组合**(p,q)使得AIC(p,q)最小化。 增加p,q的取值会减小�2s的值。这是以对包含在式2(p+q)T中的模型进行过分参数化为代价的。可以看出,AIC是非连续的,因为它渐进地使得p,q变得太大。 一个修正的标准,称为BIC,就不存在这个问题。它被定义为 .诊断检查 一旦我们已经确定了p,q的取值,就可以采用上一节的方法对模型进行估计。一个明智的策略是从低阶模型开始,再试着逐渐增加AR或MR多项式的次数。注意不应当同时增加AR和MR多项式。 假设我们已经估计出了一个ARMA(1,1)模型,想检验是否ARMA(2,1)或ARMA(1,2)更为恰当。继续进行的一种方式是先估计两个模型ARMA(2,1)和ARMA(1,2),再检验是否附加系数显著地不为零。特别地,如果 , 我们将选择ARMA(1,1)。 注意在假设真实参数值为零的条件下,参数估计的方差取决于零分布。 另外一个程序是检验是否残差项为白噪声。如果已估模型定义正确,则数据中的时间 依赖性应当由模型导出且残差就是不相关的。如果我们从下式得到残差 并计算 则对于所有的j,r��(j)=g(j)g(0)都接近于零。这一假设通常采用Portmanteau 或eeeBox-Pierce检验。它成立的基础是 在H0=r(j)=0∀j的条件下,Q的极限分布就是Q:c2K−(p+q。渐进分布中p+q的自由)度的减少就由模型估计时参数的个数所决定。在实际应用中,K至少应为15到20。但是,对于过大的K进行低次幂检验,与对过小的K进行非连续性检验,这两者之间就存在一个替代关系。实际上,在进行检验之前,最好看一下r�(j)的提示。Box和 Ljung证明统计量 e 7
在小样本条件下,相对于渐进的c2分布比Q的偏差更小。 8