跳转至

ARMA 模型识别、估计与检验

ARMA 模型识别、估计与检验

样本 ACF 与 PACF 的估计

拿到平稳样本 \(y_1,\ldots,y_T\),用样本矩估计总体矩。样本自协方差 \(\hat\gamma_k=\frac{1}{T}\sum_{t=k+1}^{T}(y_t-\bar y)(y_{t-k}-\bar y)\)样本 ACF \(\hat\rho_k=\hat\gamma_k/\hat\gamma_0\)。大数定律给出一致性 \(\hat\rho_k\xrightarrow{p}\rho_k\),中心极限定理给出渐近正态分布,据此构造假设检验。大样本下分母用 \(T\) 还是 \(T-k\) 差别可忽略。

样本 PACF:对每个 \(k\) 做 OLS 回归 \(y_t=\phi_{k1}y_{t-1}+\cdots+\phi_{kk}y_{t-k}+\varepsilon_t\),最后一个系数的估计量即 \(\hat\phi_{kk}\)

样本 ACF 检验 \(H_0:\rho_k=0\),逐阶从 \(k=1\) 做到 \(M\)\(M\) 参考 \(\ln T\)\(H_0\)\(\hat\rho_k\) 渐近 \(N(0,1/T)\),拒绝标准 \(|\hat\rho_k|>1.96/\sqrt{T}\)。样本 PACF 检验 \(H_0:\phi_{kk}=0\),拒绝标准 \(|\hat\phi_{kk}|>1.96/\sqrt{T}\),临界值不随 \(k\) 变化。检验结果可能跳跃,远离的阶数再次显著属正常现象。

Q 检验(Ljung-Box 检验):联合检验前 \(M\) 阶 ACF 全为 0,统计量 $\(Q=T(T+2)\sum_{k=1}^{M}\frac{\hat\rho_k^2}{T-k}\)$ 原假设下渐近 \(\chi^2(M)\),拒绝标准 \(Q>\chi^2_{0.95}(M)\)。单检验与 Q 检验的关系类似截面数据的 t 检验与联合 F/Wald 检验。

残差模型诊断:模型充分时残差表现得像白噪声,模型不充分时残差有序列相关。估计模型后对残差序列算 Q 统计量,自由度为 \(M-g\)\(g\) 为被估计参数个数。\(H_0\):模型充分(残差白噪声)。

ARMA 建模三步法

样本 ACF 快速截尾选 MA,样本 PACF 快速截尾选 AR,两者都不截尾考虑 ARMA。构造 ARMA(p,q) 的三步法: 1. 看样本 PACF 哪几阶突出,先拟合只含这些阶的 AR 模型; 2. 对残差算样本 ACF/PACF,按截尾位置选 MA 阶数,代回合拼成 ARMA(p,q); 3. 估计合并模型并检验残差,序列相关未抓干净则回到前两步微调。

模拟 AR(2) 数据完整演示识别流程:真实 DGP 为 \(\phi_1=0.7\)\(\phi_2=-0.49\)\(T=200\)),样本 PACF 检验提示 AR(2),样本 ACF 检验前 3 阶拒绝提示 MA(3)。MA(3) 系数显著但残差 Q 检验不通过;AR(2) 系数显著、AIC/BIC 明显更小且 Q 检验通过,选定 AR(2)。样本与总体值对照:真实 PACF 为 \(\alpha_1=0.7\)\(\alpha_2=-0.49\),样本估计 \(\hat\phi_1=0.436\)\(\hat\phi_2=-0.603\),样本越大越接近。

模型选择:AIC 与 BIC

信息准则在拟合优度与模型简洁性之间权衡,由残差平方和函数与惩罚项构成。AIC 每增加一个参数的边际成本为 \(2/T\)BIC\((\log T)/T\)\(T>e^2\)\(\log T>2\),BIC 惩罚更强,倾向选更小模型;BIC 大样本下具有一致性,AIC 小样本下更稳定。两个准则都算,选数值较小者;不一致时,对 BIC 建议的小模型检查残差是否白噪声,对 AIC 建议的大模型检查多余参数是否显著。

嵌套模型问题:小模型是大模型的特例时,大模型的 SSR 必然更小,单看拟合优度永远选大模型,惩罚项因此存在。

极大似然估计

AR 模型可用 OLS 或极大似然;MA 与 ARMA 模型只能用极大似然。

似然函数是全部数据的联合概率密度 \(f(y_1,\ldots,y_T)\)。时间序列有序列相关,不能写成边际密度之积,利用恒等式 \(f(x,y)=f(x|y)f(y)\)链式分解: $\(f(y_1,\ldots,y_T)=f(y_T|\mathcal{F}_{T-1})f(y_{T-1}|\mathcal{F}_{T-2})\cdots f(y_1)\)$ \(\mathcal{F}_t\) 为到 \(t\) 时刻为止的全部可观测数据。该分解只依赖概率恒等式,对 AR、MA、非线性模型都成立。

假设 \(\varepsilon_t\) 为高斯白噪声,AR(2) 下 \(y_t|\mathcal{F}_{t-1}\sim N(\phi_0+\phi_1y_{t-1}+\phi_2y_{t-2},\sigma^2)\)。似然为指数形式,取对数得对数似然,极值点不变。对数似然末尾含初始几期项,大样本下直接丢弃得条件似然,计算量大幅下降。

似然函数只包含两类东西:可观测数据与未知参数。数据代入后,似然函数成为未知参数的函数,用优化算法选参数使其最大,即最大似然估计。

可逆性(invertibility):MA 模型的冲击 \(\varepsilon_t\) 是不可观测的潜在变量,无法放入回归右端,OLS 行不通。把 MA(1) 反写为 \(\varepsilon_t=x_t-\beta_1\varepsilon_{t-1}\),逐步代回得 \(\varepsilon_t\) 为历史观测的收敛线性组合。MA 多项式 \(1+\beta_1z+\cdots+\beta_qz^q=0\) 的根全部落在单位圆外时模型可逆,MA(1) 的条件为 \(|\beta_1|<1\)。可逆性由 MA 部分决定,与平稳性(由 AR 部分决定)对偶。

AR 迭代的双重用途:AR 迭代把 \(y_t\) 写成冲击的线性组合,系数 \(c_j\) 度量当期单位冲击对 \(j\) 期后 \(y\) 的影响,AR(1) 的 \(c_j=\phi_1^j\),即脉冲响应函数。MA 迭代则把冲击反解成可观测数据,从而写出似然函数。

过拟合与公因子问题

过拟合(overfitting):模型拟合样本特有噪音而非总体信号。信号会被同一 DGP 生成的其他样本继承,噪音只存在于当前样本。识别方法为样本拆分:把样本切成子样本分别回归,检查某阶相关是否在子样本中重现;不重现的相关属于样本噪音,不予建模。除非有经济理论依据,不要拟合很远处的序列相关。

模拟 AR(2) 例子中,残差第 17 阶相关超出临界值,给残差加只含第 17 阶的 MA 项得到特殊 ARMA(2,17),AIC/BIC 反而更小、Q 检验也通过。造物者视角下真实 DGP 是 AR(2),第 17 阶相关是本样本的噪音;样本拆分成两个子样本后第 17 阶相关不再重现,确认该相关属噪音,不予建模。

公因子问题(common factor problem):AR 算子与 MA 算子存在可约掉的公共因子时模型退化。对弱序列相关的数据误用 ARMA 模型会得到绝对值大但不可信的系数。对 IBM 收益率拟合 ARMA(1,1) 得到 \(\hat\phi_1\approx 0.423\)\(\hat\theta_1\approx -0.44\),二者近似互为相反数、标准误大、t 统计量不显著,源于 \(y_{t-1}\)\(\varepsilon_{t-1}\) 高度相关造成的近似共线性。序列相关性弱的数据用纯 AR 或纯 MA 模型拟合即可,不同时包含同阶的 AR 与 MA 项。