量化交易中文教材

第 08a 章 向量自回归与多元线性模型

本章对应 Tsay 原书第 8 章前半(8.1–8.4 节及附录 A、B)。前面各章一次只看一条收益序列;从本章起,我们把 \(k\) 个资产的收益放进一个向量里联合研究。核心问题有两个:资产之间的同期关系有多强,跨期的领先–滞后关系是否存在、方向如何。向量自回归(VAR)是回答这两个问题的主力工具。第 08b 章在此基础上讨论协整与配对交易。第 05 册第 17a 章从计量角度讲 VAR 的估计、检验与多期预测,可与本章对照。

学习目标

  1. 理解交叉相关矩阵 \(\boldsymbol\rho_\ell\) 的定义与不对称性,会用 Tiao–Box 简化记号阅读样本交叉相关矩阵,会用多元混成检验 \(Q_k(m)\) 判断向量序列是否存在序列相依。
  2. 掌握 VAR(\(p\)) 模型:简约式与结构式的关系、平稳性条件(伴随矩阵特征值)、矩方程、定阶(\(M(i)\) 检验与 AIC/BIC/HQ)、最小二乘估计、残差诊断和多步预测。
  3. 能从 VAR 系数矩阵的零元结构读出"不耦合 / 单向 / 反馈"三种动态关系,理解 Granger 因果检验的含义。
  4. 会计算并解释正交化脉冲响应函数,知道它依赖变量排序。
  5. 了解 VMA 与 VARMA 模型的特点:VMA 的截尾性、条件与精确似然、VARMA 的可识别性问题,以及分量边际模型的阶数。

读前导读

这一章在解决什么问题。 前面各章的 AR、ARMA 只回答"一个资产的过去能不能预测它自己的未来"。本章把问题扩大到一篮子资产:"市场昨天的涨跌能不能预测个股今天的涨跌?反过来呢?"这就是领先–滞后关系。工具是向量自回归(VAR):把 \(k\) 个资产的收益排成一个列向量,让每个资产今天的收益同时对所有资产的过去做回归。你在 CFA 二级学过多元回归,VAR 本质上就是 \(k\) 个共用同一组解释变量(所有资产的滞后收益)的多元回归,只是换成矩阵写法一次写完。本章大部分篇幅都在回答三件事:怎么判断有没有跨期关系(交叉相关矩阵和 \(Q_k(m)\) 检验)、模型什么时候稳定(平稳条件)、估出来以后怎么用(Granger 因果、预测、脉冲响应)。

和你熟悉的概念对应一下:同期相关矩阵 \(\boldsymbol\rho_0\) 就是组合管理里的相关系数矩阵;VAR 残差协方差 \(\boldsymbol\Sigma\) 是"扣掉可预测部分后"的风险矩阵;脉冲响应函数则像压力测试里的"情景传导"——给某个资产一个单位冲击,看它在之后几期如何传到其他资产。

需要先想起来的数学。

  • 矩阵乘法与矩阵乘向量。 \(\boldsymbol\Phi\boldsymbol r_{t-1}\) 的第 \(i\) 个分量是 \(\boldsymbol\Phi\) 第 \(i\) 行与 \(\boldsymbol r_{t-1}\) 的内积,也就是"第 \(i\) 个方程里各个滞后变量的加权和"。例:\(\begin{bmatrix}0.2&0.3\\-0.6&1.1\end{bmatrix}\begin{bmatrix}1\\2\end{bmatrix}=\begin{bmatrix}0.2+0.6\\-0.6+2.2\end{bmatrix}=\begin{bmatrix}0.8\\1.6\end{bmatrix}\)。转置 \('\) 把行列互换,逆 \(\boldsymbol A^{-1}\) 满足 \(\boldsymbol A\boldsymbol A^{-1}=\boldsymbol I\)。见 第 00 册第 06 章 线性代数速成。
  • 特征值。 满足 \(\boldsymbol\Phi\boldsymbol v=\lambda\boldsymbol v\) 的数 \(\lambda\)。直观含义:沿特征向量方向,矩阵只做"伸缩 \(\lambda\) 倍"。所以 \(\boldsymbol\Phi^j\) 沿该方向伸缩 \(\lambda^j\) 倍,所有 \(|\lambda|<1\) 时 \(\boldsymbol\Phi^j\to\boldsymbol 0\)。2×2 矩阵的特征值解 \(\lambda^2-(\text{迹})\lambda+\text{行列式}=0\)。例 8.3 的 \(\boldsymbol\Phi\) 迹 1.3、行列式 0.4,特征值 0.8 与 0.5,平稳。见第 00 册第 06 章。
  • 行列式与正定矩阵。 协方差矩阵的行列式 \(|\boldsymbol\Sigma|\) 叫"广义方差",可以理解为多维误差"云团"的体积;\(k=1\) 时就是方差。正定矩阵(对任意非零向量 \(\boldsymbol x\) 有 \(\boldsymbol x'\boldsymbol\Sigma\boldsymbol x>0\),即任何组合的方差都为正)可以做 Cholesky 分解 \(\boldsymbol\Sigma=\boldsymbol L\boldsymbol G\boldsymbol L'\)。见第 00 册第 06 章。
  • 几何级数(推广到矩阵)。 标量 \(1+\phi+\phi^2+\cdots=1/(1-\phi)\)(\(|\phi|<1\));矩阵版本 \(\boldsymbol I+\boldsymbol\Phi+\boldsymbol\Phi^2+\cdots=(\boldsymbol I-\boldsymbol\Phi)^{-1}\),条件是特征值模都小于 1。永续年金公式就是它的标量特例。见 第 00 册第 04 章 级数与收敛。
  • 迹、vec 与 Kronecker 积。 迹 \(\mathrm{tr}\) 是对角元之和;\(\mathrm{vec}\) 把矩阵按列摞成一个长向量;\(\boldsymbol A\otimes\boldsymbol B\) 把 \(\boldsymbol A\) 的每个元素换成"该元素乘整块 \(\boldsymbol B\)"。本章只在 \(Q_k(m)\) 公式和进阶练习里用到,第一次可以只记住"它们是把矩阵运算改写成向量运算的记账工具"。

另外,\(B\) 是滞后算子(\(B\boldsymbol r_t=\boldsymbol r_{t-1}\)),\(\boldsymbol\Phi(B)\) 是以 \(B\) 为变量的矩阵多项式,与前面单变量章节的用法相同。

怎么读这一章。 核心必读是 8.2.1(交叉相关矩阵的下标读法)、8.3.1–8.3.3(VAR(1)、结构式、平稳条件)、8.3.5–8.3.7(建模流程、预测、脉冲响应)以及"量化实战"。8.3.4 的伴随矩阵只要理解"把高阶 VAR 叠成一阶"的思想即可。8.4 的精确似然推导、8.5 的 VARMA 可识别性和边际模型第一次可以只看结论。建议顺序:先读 8.2 和 8.3,配合 Python 示例跑一遍输出的解读,再回头读 8.4–8.5。


8.1 为什么要联合建模

经济全球化和电子交易使一个市场的价格变动能在秒级传导到另一个市场,而且市场间的领先–滞后关系可能随情形反转。持有多种资产的投资者关心的不只是每个资产自身的波动,还有它们一起怎样变动。统计上,这属于向量(多元)时间序列分析(vector / multivariate time series analysis)。

记 \(\boldsymbol r_t=(r_{1t},\dots,r_{kt})'\) 为 \(k\) 个资产在 \(t\) 时的对数收益,例如 IBM、微软、埃克森美孚、通用汽车、沃尔玛的 5 维日收益,或 S&P 500、FTSE 100、日经 225 的 3 维指数收益。很多单变量方法可以直接推广到向量情形,但有些推广需要格外小心(例如 VARMA 的可识别性),有些问题则需要全新的模型(例如第 08b 章的协整)。

本章用到的矩阵工具(特征值、正定矩阵、Cholesky 分解、Kronecker 积、vec 算子)见第 01 册;多元正态分布见第 02 册。下面只在用到时简要回顾。


8.2 弱平稳与交叉相关矩阵

8.2.1 定义

\(k\) 维序列 \(\boldsymbol r_t\) 若一阶、二阶矩不随时间变化,则称为弱平稳。其均值向量和协方差矩阵为

\[\boldsymbol\mu=E(\boldsymbol r_t),\qquad\boldsymbol\Gamma_0=E[(\boldsymbol r_t-\boldsymbol\mu)(\boldsymbol r_t-\boldsymbol\mu)'].\tag{8.1}\]

令 \(\boldsymbol D=\mathrm{diag}\{\sqrt{\Gamma_{11}(0)},\dots,\sqrt{\Gamma_{kk}(0)}\}\) 为标准差对角阵,同期相关矩阵为 \(\boldsymbol\rho_0=\boldsymbol D^{-1}\boldsymbol\Gamma_0\boldsymbol D^{-1}\)。它对称、对角元为 1。

更重要的是滞后 \(\ell\) 交叉协方差矩阵(cross-covariance matrix)和交叉相关矩阵(cross-correlation matrix,CCM):

\[\boldsymbol\Gamma_\ell=E[(\boldsymbol r_t-\boldsymbol\mu)(\boldsymbol r_{t-\ell}-\boldsymbol\mu)'],\qquad\boldsymbol\rho_\ell=\boldsymbol D^{-1}\boldsymbol\Gamma_\ell\boldsymbol D^{-1},\tag{8.2–8.3}\]
\[\rho_{ij}(\ell)=\frac{\mathrm{Cov}(r_{it},r_{j,t-\ell})}{\mathrm{std}(r_{it})\,\mathrm{std}(r_{jt})}.\tag{8.4}\]

记住下标的读法:行 \(i\) 是"现在",列 \(j\) 是"过去"。\(\ell>0\) 时 \(\rho_{ij}(\ell)\) 衡量 \(r_{it}\) 对 \(r_{j,t-\ell}\) 的线性依赖;若它不为零,就说 \(r_{jt}\) 在滞后 \(\ell\) 处领先(lead)\(r_{it}\)。对角元 \(\rho_{ii}(\ell)\) 就是第 \(i\) 个分量的自相关函数。

两条性质。 (1) 一般 \(\rho_{ij}(\ell)\ne\rho_{ji}(\ell)\),所以 \(\ell>0\) 时 \(\boldsymbol\rho_\ell\) 不对称——"\(i\) 依赖 \(j\) 的过去"与"\(j\) 依赖 \(i\) 的过去"是两回事。(2) 由 \(\mathrm{Cov}(r_{it},r_{j,t-\ell})=\mathrm{Cov}(r_{jt},r_{i,t+\ell})\) 得

\[\boldsymbol\Gamma_\ell=\boldsymbol\Gamma_{-\ell}',\qquad\boldsymbol\rho_\ell=\boldsymbol\rho_{-\ell}'.\]

因此只需研究 \(\ell\ge0\)。注意与单变量不同,\(\boldsymbol\rho_\ell\ne\boldsymbol\rho_{-\ell}\)。

推导拆解:为什么 \(\boldsymbol\Gamma_\ell=\boldsymbol\Gamma_{-\ell}'\)? 第一步,看 \(\boldsymbol\Gamma_{-\ell}\) 的 \((j,i)\) 元:按定义它是 \(\mathrm{Cov}(r_{jt},r_{i,t+\ell})\)(把 \(\ell\) 换成 \(-\ell\),"过去"变成"未来")。 第二步,用弱平稳把时间整体平移 \(\ell\) 期:\(\mathrm{Cov}(r_{jt},r_{i,t+\ell})=\mathrm{Cov}(r_{j,t-\ell},r_{it})\),平稳意味着协方差只与时间差有关,与起点无关。 第三步,协方差对两个参数对称:\(\mathrm{Cov}(r_{j,t-\ell},r_{it})=\mathrm{Cov}(r_{it},r_{j,t-\ell})\),这正是 \(\boldsymbol\Gamma_\ell\) 的 \((i,j)\) 元。 所以 \(\boldsymbol\Gamma_{-\ell}\) 的 \((j,i)\) 元等于 \(\boldsymbol\Gamma_\ell\) 的 \((i,j)\) 元,即一个是另一个的转置。

金融直觉:\(\rho_{12}(1)\) 问的是"今天的个股收益与昨天的市场收益相关吗",\(\rho_{21}(1)\) 问的是"今天的市场收益与昨天的个股收益相关吗"。前者显著、后者不显著,就是"市场领先个股"。这两个问题答案不同,所以矩阵不对称;而"昨天的市场与今天的个股"和"今天的市场与明天的个股"只是同一件事挪了一天,所以有上面的转置关系。

8.2.2 两条序列之间的五种关系

由 \(\{\boldsymbol\rho_\ell\}\) 可以把两条序列 \(r_{it}\)、\(r_{jt}\) 的关系分为:

  1. 无线性关系:对所有 \(\ell\ge0\),\(\rho_{ij}(\ell)=\rho_{ji}(\ell)=0\)。
  2. 同期相关:\(\rho_{ij}(0)\ne0\)。
  3. 不耦合(uncoupled,无领先–滞后):对所有 \(\ell>0\),\(\rho_{ij}(\ell)=\rho_{ji}(\ell)=0\)。
  4. 单向关系(\(r_{it}\to r_{jt}\)):对所有 \(\ell>0\),\(\rho_{ij}(\ell)=0\),但存在 \(v>0\) 使 \(\rho_{ji}(v)\ne0\)。
  5. 反馈关系(feedback):两个方向都存在非零的滞后交叉相关。

这些只是基于相关的粗略判断。更可靠的做法是建立同时考虑序列相关和交叉相关的多元模型,这正是 VAR 的用武之地。

8.2.3 样本交叉相关矩阵与简化记号

样本估计为

\[\hat{\boldsymbol\Gamma}_\ell=\frac1T\sum_{t=\ell+1}^T(\boldsymbol r_t-\bar{\boldsymbol r})(\boldsymbol r_{t-\ell}-\bar{\boldsymbol r})',\qquad\hat{\boldsymbol\rho}_\ell=\hat{\boldsymbol D}^{-1}\hat{\boldsymbol\Gamma}_\ell\hat{\boldsymbol D}^{-1}.\tag{8.5–8.6}\]

它们相合但有限样本有偏。由于收益有条件异方差和厚尾,\(\hat\rho_{ij}(\ell)\) 的精确分布很复杂,需要时可用 bootstrap;多数场合用白噪声下的近似方差 \(1/T\) 就够了。

当 \(k>3\) 时,一次看几十个矩阵很吃力。Tiao–Box 简化记号把每个元素换成一个符号:\(\hat\rho\ge2/\sqrt T\) 记 \(+\),\(\hat\rho\le-2/\sqrt T\) 记 \(-\),其余记 \(\cdot\)。\(2/\sqrt T\) 是白噪声下样本相关的渐近 5% 临界值(原书此处误印为 \(1/\sqrt T\))。

例 8.1(IBM 与 S&P 500 月对数收益)。 1926 年 1 月至 2008 年 12 月,996 个观测,单位为 %。描述统计:IBM 均值 1.089、标准差 7.033、超额峰度 2.622;S&P 500 均值 0.430、标准差 5.537、超额峰度 7.927。样本同期相关 0.65。滞后 1 的 CCM(行为 [IBM; SP5],列为 [IBM 滞后; SP5 滞后])为

\[\hat{\boldsymbol\rho}_1=\begin{bmatrix}0.04&0.10\\0.04&0.08\end{bmatrix},\qquad\text{简化记号}\begin{bmatrix}\cdot&+\\\cdot&+\end{bmatrix}.\]

滞后 2、3、5 的简化记号分别为 \(\begin{bmatrix}\cdot&-\\\cdot&\cdot\end{bmatrix}\)、\(\begin{bmatrix}\cdot&\cdot\\\cdot&-\end{bmatrix}\)、\(\begin{bmatrix}\cdot&+\\\cdot&+\end{bmatrix}\),滞后 4 全为 \(\cdot\)。解读:(a) 两者同期相关很强;(b) 第二列多处显著——IBM 和 S&P 500 都依赖 S&P 500 的过去,而第一列几乎全是 \(\cdot\),说明 IBM 的过去对两者都没有预测力。动态关系总体较弱。

例 8.2(美国国债指数月收益)。 1942–1999 年,期限 30、20、10、5、1 年,696 个观测。1 年期的标准差(0.53%)远小于 30 年期(2.53%)。同期相关矩阵为

\[\hat{\boldsymbol\rho}_0=\begin{bmatrix}1.00&0.98&0.92&0.85&0.63\\0.98&1.00&0.91&0.86&0.64\\0.92&0.91&1.00&0.90&0.68\\0.85&0.86&0.90&1.00&0.82\\0.63&0.64&0.68&0.82&1.00\end{bmatrix}.\]

期限越接近相关越高,长端之间的相关高于短端之间。滞后 1 的 CCM 元素全部显著为正,1 年期的自相关(0.40)远高于长期限。这一结构正是利率曲线"水平、斜率"因子的来源(第 09 章例 9.3)。

8.2.4 多元混成检验

Ljung–Box 检验推广到向量情形(Hosking 1980;Li & McLeod 1981),检验 \(H_0:\boldsymbol\rho_1=\cdots=\boldsymbol\rho_m=\boldsymbol 0\):

\[Q_k(m)=T^2\sum_{\ell=1}^m\frac1{T-\ell}\,\mathrm{tr}\!\left(\hat{\boldsymbol\Gamma}_\ell'\hat{\boldsymbol\Gamma}_0^{-1}\hat{\boldsymbol\Gamma}_\ell\hat{\boldsymbol\Gamma}_0^{-1}\right)\ \xrightarrow{d}\ \chi^2_{k^2m}.\tag{8.7}\]

直观上,迹里的二次型是把 \(\hat{\boldsymbol\Gamma}_\ell\) 的 \(k^2\) 个元素"标准化后平方再求和"。用 Kronecker 积可写为 \(Q_k(m)=T^2\sum_\ell\frac1{T-\ell}\boldsymbol b_\ell'(\hat{\boldsymbol\rho}_0^{-1}\otimes\hat{\boldsymbol\rho}_0^{-1})\boldsymbol b_\ell\),\(\boldsymbol b_\ell=\mathrm{vec}(\hat{\boldsymbol\rho}_\ell')\)。

例 8.1 中 \(Q_2(1)=9.81\)、\(Q_2(5)=47.06\)、\(Q_2(10)=71.65\),自由度 4、20、40,p 值 0.044、0.001、0.002,说明存在序列相依。例 8.2 中 \(Q_5(5)=1065.63\),对 \(\chi^2_{125}\) 极其显著。拒绝原假设后,下一步就是建立多元模型。

白话解释:\(Q_k(m)\) 是单变量 Ljung–Box 的"矩阵版"。单变量时统计量是 \(T(T+2)\sum\hat\rho_\ell^2/(T-\ell)\),即把各阶自相关平方后加总。\(k=1\) 时,(8.7) 迹里的式子变成 \(\hat\gamma_\ell^2/\hat\gamma_0^2=\hat\rho_\ell^2\),正好退化回单变量公式(\(T^2\) 与 \(T(T+2)\) 只是小样本修正不同)。\(k\) 维时,每个滞后有 \(k^2\) 个交叉相关,乘上 \(\hat{\boldsymbol\Gamma}_0^{-1}\) 是为了先把各资产的波动大小和同期相关"标准化掉",再平方求和,所以自由度是 \(k^2m\)。 读结果时:p 值小说明"至少有一个资产的过去能预测至少一个资产的现在",但不告诉你是哪一对、哪个方向——那要靠后面的 VAR 系数和 Granger 检验。


8.3 向量自回归模型(VAR)

8.3.1 VAR(1) 与系数的含义

\[\boldsymbol r_t=\boldsymbol\phi_0+\boldsymbol\Phi\boldsymbol r_{t-1}+\boldsymbol a_t,\tag{8.8}\]

其中 \(\boldsymbol a_t\) 序列不相关、均值零、协方差 \(\boldsymbol\Sigma\) 正定(\(\boldsymbol\Sigma\) 奇异说明某个分量是其他分量的线性组合,应先降维)。二元情形写开是

\[r_{1t}=\phi_{10}+\Phi_{11}r_{1,t-1}+\Phi_{12}r_{2,t-1}+a_{1t},\qquad r_{2t}=\phi_{20}+\Phi_{21}r_{1,t-1}+\Phi_{22}r_{2,t-1}+a_{2t}.\]

\(\Phi_{12}\) 是在控制 \(r_{1,t-1}\) 后 \(r_{2,t-1}\) 对 \(r_{1t}\) 的条件效应。于是:\(\Phi_{12}=\Phi_{21}=0\) 为不耦合;\(\Phi_{12}=0,\Phi_{21}\ne0\) 为 \(r_1\to r_2\) 单向关系;两者都非零为反馈关系。动态关系看 \(\boldsymbol\Phi\),同期关系看 \(\boldsymbol\Sigma\) 的非对角元。

8.3.2 简约式与结构式

(8.8) 称为简约式(reduced form),它没有显式写出同期依赖。由于 \(\boldsymbol\Sigma\) 正定,存在单位下三角阵 \(\boldsymbol L\) 和对角阵 \(\boldsymbol G\) 使 \(\boldsymbol\Sigma=\boldsymbol L\boldsymbol G\boldsymbol L'\)(LDL/Cholesky 分解)。令 \(\boldsymbol b_t=\boldsymbol L^{-1}\boldsymbol a_t\),则 \(\mathrm{Cov}(\boldsymbol b_t)=\boldsymbol G\),分量互不相关。左乘 \(\boldsymbol L^{-1}\):

\[\boldsymbol L^{-1}\boldsymbol r_t=\boldsymbol\phi_0^*+\boldsymbol\Phi^*\boldsymbol r_{t-1}+\boldsymbol b_t,\qquad\boldsymbol\phi_0^*=\boldsymbol L^{-1}\boldsymbol\phi_0,\ \boldsymbol\Phi^*=\boldsymbol L^{-1}\boldsymbol\Phi.\tag{8.9}\]

\(\boldsymbol L^{-1}\) 的最后一行形如 \((w_{k1},\dots,w_{k,k-1},1)\),所以第 \(k\) 个方程是

\[r_{kt}+\sum_{i=1}^{k-1}w_{ki}r_{it}=\phi^*_{k,0}+\sum_{i=1}^k\Phi^*_{ki}r_{i,t-1}+b_{kt},\tag{8.10}\]

它显式包含 \(r_{kt}\) 对其他分量当期值的依赖,称为结构方程。把任一分量排到最后就得到它的结构方程,所以简约式与计量经济学的结构式等价。时间序列分析偏爱简约式,一是好估计,二是(更重要的)同期相关无法用于预测——你在 \(t-1\) 时看不到 \(r_{1t}\)。

例 8.3。 设

\[\boldsymbol r_t=\begin{bmatrix}0.2\\0.4\end{bmatrix}+\begin{bmatrix}0.2&0.3\\-0.6&1.1\end{bmatrix}\boldsymbol r_{t-1}+\boldsymbol a_t,\qquad\boldsymbol\Sigma=\begin{bmatrix}2&1\\1&1\end{bmatrix}.\]

\(\boldsymbol L=\begin{bmatrix}1&0\\0.5&1\end{bmatrix}\),\(\boldsymbol G=\mathrm{diag}(2,0.5)\),\(\boldsymbol L^{-1}=\begin{bmatrix}1&0\\-0.5&1\end{bmatrix}\)。算得 \(\boldsymbol\phi_0^*=(0.2,0.3)'\),\(\boldsymbol\Phi^*=\begin{bmatrix}0.2&0.3\\-0.7&0.95\end{bmatrix}\),第二个方程即

\[r_{2t}=0.3+0.5r_{1t}-0.7r_{1,t-1}+0.95r_{2,t-1}+b_{2t}.\]

若把顺序换成 \((r_{2t},r_{1t})'\),则 \(\boldsymbol\Sigma=\begin{bmatrix}1&1\\1&2\end{bmatrix}\),\(\boldsymbol L^{-1}=\begin{bmatrix}1&0\\-1&1\end{bmatrix}\),\(\boldsymbol G=\boldsymbol I\),得到 \(r_{1t}\) 的结构方程

\[r_{1t}=-0.2+1.0r_{2t}-0.8r_{2,t-1}+0.8r_{1,t-1}+c_{2t}.\]

结构方程依赖变量排序,这一点在脉冲响应中会再次出现。

推导拆解:例 8.3 的数字是怎么来的。 第一步,求 \(\boldsymbol L\) 和 \(\boldsymbol G\)。设 \(\boldsymbol L=\begin{bmatrix}1&0\\l&1\end{bmatrix}\),\(\boldsymbol G=\mathrm{diag}(g_1,g_2)\),乘开得 \(\boldsymbol L\boldsymbol G\boldsymbol L'=\begin{bmatrix}g_1&lg_1\\lg_1&l^2g_1+g_2\end{bmatrix}\)。对照 \(\boldsymbol\Sigma\):\(g_1=2\),\(lg_1=1\Rightarrow l=0.5\),\(l^2g_1+g_2=1\Rightarrow g_2=0.5\)。 这一步其实就是"用 \(a_{1t}\) 对 \(a_{2t}\) 做回归":\(l=\mathrm{Cov}(a_1,a_2)/\mathrm{Var}(a_1)=1/2\) 是回归系数,\(g_2=1-0.5^2\times2=0.5\) 是回归残差方差。CFA 里的"beta = 协方差 / 方差"在这里原样出现。 第二步,单位下三角阵求逆只需把非对角元变号:\(\boldsymbol L^{-1}=\begin{bmatrix}1&0\\-0.5&1\end{bmatrix}\)。 第三步,\(\boldsymbol\Phi^*\) 的第二行 \(=-0.5\times(0.2,0.3)+(-0.6,1.1)=(-0.7,0.95)\);常数项 \(-0.5\times0.2+0.4=0.3\)。 第四步,第二个方程左边是 \(r_{2t}-0.5r_{1t}\),把 \(-0.5r_{1t}\) 移到右边就得到文中的结构方程。

白话解释:简约式和结构式描述的是同一个数据生成过程,区别只在于"同期相关放在哪里"。简约式把它放在误差协方差 \(\boldsymbol\Sigma\) 里,结构式把它显式写成"\(r_{2t}\) 对 \(r_{1t}\) 的当期系数 0.5"。谁写在右边当解释变量,就等于假定谁"先动",所以排序一换,结论就变。

8.3.3 平稳条件与矩

若 VAR(1) 弱平稳,取期望得 \(\boldsymbol\mu=(\boldsymbol I-\boldsymbol\Phi)^{-1}\boldsymbol\phi_0\)。令 \(\tilde{\boldsymbol r}_t=\boldsymbol r_t-\boldsymbol\mu\),有 \(\tilde{\boldsymbol r}_t=\boldsymbol\Phi\tilde{\boldsymbol r}_{t-1}+\boldsymbol a_t\),反复代入得

\[\tilde{\boldsymbol r}_t=\boldsymbol a_t+\boldsymbol\Phi\boldsymbol a_{t-1}+\boldsymbol\Phi^2\boldsymbol a_{t-2}+\cdots.\]

由此可读出四个结论:

  1. \(\boldsymbol a_t\) 与 \(\boldsymbol r_{t-\ell}\)(\(\ell>0\))不相关,所以 \(\boldsymbol a_t\) 称为 \(t\) 时的冲击或新息(innovation)。
  2. \(\mathrm{Cov}(\boldsymbol r_t,\boldsymbol a_t)=\boldsymbol\Sigma\)。
  3. 需要 \(\boldsymbol\Phi^j\to\boldsymbol 0\),即 \(\boldsymbol\Phi\) 的所有特征值模小于 1,这是弱平稳的充要条件,退化到单变量就是 \(|\phi|<1\)。由 \(|\lambda\boldsymbol I-\boldsymbol\Phi|=\lambda^k|\boldsymbol I-\boldsymbol\Phi\lambda^{-1}|\),等价说法是 \(|\boldsymbol I-\boldsymbol\Phi B|\) 的零点全在单位圆外。
  4. \(\boldsymbol\Gamma_0=\sum_{i=0}^\infty\boldsymbol\Phi^i\boldsymbol\Sigma(\boldsymbol\Phi^i)'\)。

两边右乘 \(\tilde{\boldsymbol r}_{t-\ell}'\) 取期望,得矩方程 \(\boldsymbol\Gamma_\ell=\boldsymbol\Phi\boldsymbol\Gamma_{\ell-1}\),于是 \(\boldsymbol\Gamma_\ell=\boldsymbol\Phi^\ell\boldsymbol\Gamma_0\)——交叉协方差按矩阵几何级数衰减。

推导拆解:本节几处跳步补全如下。 (a) 均值:对 \(\boldsymbol r_t=\boldsymbol\phi_0+\boldsymbol\Phi\boldsymbol r_{t-1}+\boldsymbol a_t\) 取期望,平稳时 \(E(\boldsymbol r_t)=E(\boldsymbol r_{t-1})=\boldsymbol\mu\),得 \(\boldsymbol\mu=\boldsymbol\phi_0+\boldsymbol\Phi\boldsymbol\mu\),移项 \((\boldsymbol I-\boldsymbol\Phi)\boldsymbol\mu=\boldsymbol\phi_0\),两边左乘逆矩阵。这和单变量 AR(1) 的 \(\mu=\phi_0/(1-\phi)\) 一模一样,只是"除以"换成"左乘逆"。 (b) 反复代入:\(\tilde{\boldsymbol r}_t=\boldsymbol a_t+\boldsymbol\Phi\tilde{\boldsymbol r}_{t-1}=\boldsymbol a_t+\boldsymbol\Phi(\boldsymbol a_{t-1}+\boldsymbol\Phi\tilde{\boldsymbol r}_{t-2})=\cdots\),每代入一次,就多出一项 \(\boldsymbol\Phi^j\boldsymbol a_{t-j}\),剩余项 \(\boldsymbol\Phi^{j+1}\tilde{\boldsymbol r}_{t-j-1}\) 只有在 \(\boldsymbol\Phi^j\to\boldsymbol 0\) 时才会消失。 (c) 为什么"特征值模小于 1"等价于 \(\boldsymbol\Phi^j\to\boldsymbol 0\):若 \(\boldsymbol\Phi=\boldsymbol P\boldsymbol\Lambda\boldsymbol P^{-1}\)(可对角化),则 \(\boldsymbol\Phi^j=\boldsymbol P\boldsymbol\Lambda^j\boldsymbol P^{-1}\),\(\boldsymbol\Lambda^j\) 的对角元是 \(\lambda_i^j\),全部趋于 0 当且仅当每个 \(|\lambda_i|<1\)。例 8.3 的特征值 0.8 和 0.5,所以冲击的影响每期至少衰减到原来的 80%。 (d) \(\boldsymbol\Gamma_0\):\(\boldsymbol a_{t-i}\) 之间互不相关,所以 \(\mathrm{Cov}(\sum_i\boldsymbol\Phi^i\boldsymbol a_{t-i})=\sum_i\boldsymbol\Phi^i\boldsymbol\Sigma(\boldsymbol\Phi^i)'\),用的是"\(\mathrm{Cov}(\boldsymbol A\boldsymbol x)=\boldsymbol A\,\mathrm{Cov}(\boldsymbol x)\boldsymbol A'\)"——组合方差 \(\boldsymbol w'\boldsymbol\Sigma\boldsymbol w\) 的矩阵版。 (e) 矩方程:\(E[\tilde{\boldsymbol r}_t\tilde{\boldsymbol r}_{t-\ell}']=\boldsymbol\Phi E[\tilde{\boldsymbol r}_{t-1}\tilde{\boldsymbol r}_{t-\ell}']+E[\boldsymbol a_t\tilde{\boldsymbol r}_{t-\ell}']\),最后一项因结论 1 为零,第一项的期望按定义是 \(\boldsymbol\Gamma_{\ell-1}\)。

8.3.4 VAR(\(p\)) 与伴随矩阵

\[\boldsymbol r_t=\boldsymbol\phi_0+\boldsymbol\Phi_1\boldsymbol r_{t-1}+\cdots+\boldsymbol\Phi_p\boldsymbol r_{t-p}+\boldsymbol a_t,\tag{8.13}\]

即 \(\boldsymbol\Phi(B)\boldsymbol r_t=\boldsymbol\phi_0+\boldsymbol a_t\),\(\boldsymbol\Phi(B)=\boldsymbol I-\boldsymbol\Phi_1B-\cdots-\boldsymbol\Phi_pB^p\)。平稳时 \(\boldsymbol\mu=[\boldsymbol\Phi(1)]^{-1}\boldsymbol\phi_0\),矩方程为多元 Yule–Walker 方程 \(\boldsymbol\Gamma_\ell=\boldsymbol\Phi_1\boldsymbol\Gamma_{\ell-1}+\cdots+\boldsymbol\Phi_p\boldsymbol\Gamma_{\ell-p}\)(\(\ell>0\))。

处理 VAR(\(p\)) 的标准技巧是把它写成 \(kp\) 维 VAR(1)。令 \(\boldsymbol x_t=(\tilde{\boldsymbol r}_{t-p+1}',\dots,\tilde{\boldsymbol r}_t')'\),则 \(\boldsymbol x_t=\boldsymbol\Phi^*\boldsymbol x_{t-1}+\boldsymbol b_t\),其中

\[\boldsymbol\Phi^*=\begin{bmatrix}\boldsymbol 0&\boldsymbol I&\boldsymbol 0&\cdots&\boldsymbol 0\\\boldsymbol 0&\boldsymbol 0&\boldsymbol I&\cdots&\boldsymbol 0\\\vdots&&&\ddots&\vdots\\\boldsymbol 0&\boldsymbol 0&\boldsymbol 0&\cdots&\boldsymbol I\\\boldsymbol\Phi_p&\boldsymbol\Phi_{p-1}&\boldsymbol\Phi_{p-2}&\cdots&\boldsymbol\Phi_1\end{bmatrix}\tag{8.15}\]

称为伴随矩阵(companion matrix)。VAR(\(p\)) 平稳当且仅当 \(\boldsymbol\Phi^*\) 的所有特征值模小于 1,等价于 \(|\boldsymbol\Phi(B)|\) 的零点全在单位圆外。这个技巧在编程中很常用:多步预测、脉冲响应、无条件协方差都可以在 VAR(1) 形式下统一计算。

白话解释:伴随矩阵是一个"记账技巧"。VAR(2) 的明天依赖今天和昨天,单看今天的状态不够。办法是把"今天和昨天"打包成一个更长的状态向量 \(\boldsymbol x_t=(\tilde{\boldsymbol r}_{t-1}',\tilde{\boldsymbol r}_t')'\)。下一期的状态 \(\boldsymbol x_{t+1}=(\tilde{\boldsymbol r}_t',\tilde{\boldsymbol r}_{t+1}')'\) 中,上半部分只是把旧状态的下半部分"往上挪一格"(这就是 \(\boldsymbol\Phi^*\) 上方那些单位阵 \(\boldsymbol I\) 的作用),下半部分才是真正的 VAR 方程(最后一行 \(\boldsymbol\Phi_2,\boldsymbol\Phi_1\))。这样高阶模型就变成了一阶模型,所有一阶的结论(平稳看特征值、矩按 \(\boldsymbol\Phi^{*\ell}\) 衰减)直接搬过来用。 一个最小的例子:单变量 AR(2) \(\tilde r_t=0.5\tilde r_{t-1}+0.3\tilde r_{t-2}+a_t\),伴随矩阵 \(\begin{bmatrix}0&1\\0.3&0.5\end{bmatrix}\),特征方程 \(\lambda^2-0.5\lambda-0.3=0\),根约 0.85 和 \(-0.35\),模都小于 1,平稳。Python 示例第 4 步打印的"伴随矩阵特征值模"做的就是这件事。

系数结构与 Granger 因果。 若对所有 \(\ell\),\(\boldsymbol\Phi_\ell\) 的 \((i,j)\) 元都为零,则 \(r_{it}\) 不依赖 \(r_{jt}\) 的任何过去值,即"\(r_j\) 不 Granger 引起 \(r_i\)"。检验这一组约束就是 Granger 因果检验(Granger causality test),在 VAR 中是一个标准的 Wald/F 检验(详见第 05 册)。

8.3.5 建立 VAR 模型:定阶、估计、检验

定阶。 推广单变量 PACF 的思路,依次用最小二乘拟合 VAR(\(i\)),\(i=0,1,2,\dots\),记残差协方差为

\[\hat{\boldsymbol\Sigma}_i=\frac1{T-2i-1}\sum_{t=i+1}^T\hat{\boldsymbol a}_t^{(i)}(\hat{\boldsymbol a}_t^{(i)})'.\tag{8.17}\]

序贯似然比检验(Tiao & Box 1981)检验 VAR(\(i\)) 对 VAR(\(i-1\)),即 \(H_0:\boldsymbol\Phi_i=\boldsymbol 0\):

\[M(i)=-\left(T-k-i-\tfrac32\right)\ln\frac{|\hat{\boldsymbol\Sigma}_i|}{|\hat{\boldsymbol\Sigma}_{i-1}|}\ \sim\ \chi^2_{k^2}.\tag{8.18}\]

直觉:加入第 \(i\) 阶滞后后残差的"广义方差"(行列式)若没明显下降,\(M(i)\) 就小。信息准则用 ML 残差协方差 \(\tilde{\boldsymbol\Sigma}_i=\frac1T\sum\hat{\boldsymbol a}_t^{(i)}\hat{\boldsymbol a}_t^{(i)\prime}\):

\[\mathrm{AIC}(i)=\ln|\tilde{\boldsymbol\Sigma}_i|+\frac{2k^2i}T,\quad\mathrm{BIC}(i)=\ln|\tilde{\boldsymbol\Sigma}_i|+\frac{k^2i\ln T}T,\quad\mathrm{HQ}(i)=\ln|\tilde{\boldsymbol\Sigma}_i|+\frac{2k^2i\ln\ln T}T.\]

每加一阶增加 \(k^2\) 个参数,所以高维 VAR 的参数膨胀很快,BIC 往往选出比 AIC 小得多的阶数。

白话解释:\(M(i)\) 和信息准则都在比较"残差广义方差 \(|\hat{\boldsymbol\Sigma}|\) 下降了多少"。\(\ln|\hat{\boldsymbol\Sigma}_i|-\ln|\hat{\boldsymbol\Sigma}_{i-1}|\) 是加入第 \(i\) 阶滞后后"误差体积"的对数变化;\(M(i)\) 把它乘上近似样本量,变成似然比统计量,原假设下服从 \(\chi^2_{k^2}\),因为新加的 \(\boldsymbol\Phi_i\) 有 \(k^2\) 个元素。信息准则则是"拟合好坏 + 参数个数罚分":AIC 每个参数罚 \(2/T\),BIC 罚 \(\ln T/T\)。\(T=1000\) 时 \(\ln T\approx6.9\),BIC 的罚分是 AIC 的 3 倍多,所以偏爱更小的模型。这和你在 CFA 里见过的"调整 \(R^2\) 惩罚多余变量"是同一种思想。

估计。 VAR 的每个方程都有相同的解释变量,所以逐个方程做 OLS 就等价于整体 GLS,在正态假设下也等价于条件 MLE(\(\boldsymbol\Sigma\) 的 MLE 除以 \(T\))。估计量渐近正态。

金融直觉:为什么"逐方程 OLS"就够了?各方程的误差同期相关(\(\boldsymbol\Sigma\) 非对角),一般情况下应该用 GLS(似无关回归 SUR)把这份相关性利用起来。但当每个方程的解释变量完全相同时,GLS 的权重调整不会带来任何新信息,结果与逐方程 OLS 完全一样。实务含义:你可以用最熟悉的 OLS 回归逐个资产估计 VAR,t 统计量、F 检验的读法也都和 CFA 二级的多元回归一致。

检验。 对残差做多元混成检验;拟合 VAR(\(p\)) 后 \(Q_k(m)\) 的渐近分布为 \(\chi^2_{k^2m-g}\),\(g\) 为 AR 系数矩阵中被估参数的个数。还应检查条件异方差(第 10 章)和异常值。

例 8.4(IBM 与 S&P 500,续例 8.1)。 定阶结果(\(\chi^2_4\) 的 5%、1% 临界值为 9.5、13.3):

阶 \(i\) 1 2 3 4 5 6
\(M(i)\) 10.76 13.41 10.34 7.78 12.07 1.93
AIC 6.795 6.789 6.786 6.786 6.782 6.788

两者都指向 VAR(5)。由于依赖很弱,作者略去第 4 阶,拟合 \(\boldsymbol r_t=\boldsymbol\phi_0+\boldsymbol\Phi_1\boldsymbol r_{t-1}+\boldsymbol\Phi_2\boldsymbol r_{t-2}+\boldsymbol\Phi_3\boldsymbol r_{t-3}+\boldsymbol\Phi_5\boldsymbol r_{t-5}+\boldsymbol a_t\),再删去不显著参数,得到简化模型

\[\text{IBM}_t=1.0+0.13\,\text{SP5}_{t-1}-0.09\,\text{SP5}_{t-2}+0.09\,\text{SP5}_{t-5}+a_{1t},\]
\[\text{SP5}_t=0.4+0.08\,\text{SP5}_{t-1}-0.06\,\text{SP5}_{t-3}+0.09\,\text{SP5}_{t-5}+a_{2t},\]

\(\hat{\boldsymbol\Sigma}=\begin{bmatrix}48.33&24.36\\24.36&30.03\end{bmatrix}\)。残差 \(Q_2(4)=16.64\)、\(Q_2(8)=31.55\),扣除 6 个 AR 参数后自由度 10、26,p 值 0.083、0.208,模型充分。

解读:(a) 新息的同期相关 \(24/\sqrt{48\times30}\approx0.63\),接近样本相关;(b) 两序列均值显著为正,对数价格有上升趋势;(c) IBM 依赖 S&P 500 的过去,S&P 500 不依赖 IBM 的过去,即存在从市场到 IBM 的单向动态关系,市场是这个二元系统的驱动者。

(同一数据在 S-Plus FinMetrics 中用 BIC 选出 VAR(1),用 AIC 选出 VAR(5)。两软件信息准则的标准化方式不同,数值不同但不影响选择。VAR(1) 下只有 \(\text{SP5}_{t-1}\) 在两个方程中显著,\(R^2\) 仅约 1%。)

8.3.6 预测

把拟合模型当作真模型。在原点 \(h\),1 步预测与误差为

\[\boldsymbol r_h(1)=\boldsymbol\phi_0+\sum_{i=1}^p\boldsymbol\Phi_i\boldsymbol r_{h+1-i},\qquad\boldsymbol e_h(1)=\boldsymbol a_{h+1},\quad\mathrm{Cov}=\boldsymbol\Sigma.\]

2 步预测把 1 步预测代入:\(\boldsymbol r_h(2)=\boldsymbol\phi_0+\boldsymbol\Phi_1\boldsymbol r_h(1)+\sum_{i=2}^p\boldsymbol\Phi_i\boldsymbol r_{h+2-i}\),误差 \(\boldsymbol a_{h+2}+\boldsymbol\Phi_1\boldsymbol a_{h+1}\),协方差 \(\boldsymbol\Sigma+\boldsymbol\Phi_1\boldsymbol\Sigma\boldsymbol\Phi_1'\)。一般地,\(\ell\) 步预测误差协方差为 \(\sum_{j=0}^{\ell-1}\boldsymbol\Psi_j\boldsymbol\Sigma\boldsymbol\Psi_j'\)(\(\boldsymbol\Psi_j\) 见下节)。平稳时预测收敛到 \(\boldsymbol\mu\),误差协方差收敛到 \(\boldsymbol\Gamma_0\)。

例 8.4 在 2008 年 12 月原点的预测:IBM 1–6 步预测为 1.95、0.30、−0.82、0.14、1.16、1.29,标准误从 6.95 升到 7.00;S&P 500 为 1.70、0.17、−1.26、−0.49、0.41、0.65,标准误从 5.48 升到 5.53。标准误几乎立刻收敛到样本标准差(7.03、5.53)——月度收益的可预测部分非常小。

VAR 建模三步小结:(a) 用 \(M(i)\) 或信息准则定阶;(b) 最小二乘估计,必要时删去不显著参数重估;(c) 用残差 \(Q_k(m)\) 检验,并检查条件异方差和异常值。

8.3.7 脉冲响应函数

平稳 VAR(\(p\)) 可写成新息的无穷线性组合(MA 表示):

\[\boldsymbol r_t=\boldsymbol\mu+\boldsymbol a_t+\boldsymbol\Psi_1\boldsymbol a_{t-1}+\boldsymbol\Psi_2\boldsymbol a_{t-2}+\cdots,\tag{8.21}\]

\(\boldsymbol\Psi_i\) 由 \(\boldsymbol\Phi(B)\boldsymbol\Psi(B)=\boldsymbol I\) 比较系数得到,递推式为 \(\boldsymbol\Psi_0=\boldsymbol I\),\(\boldsymbol\Psi_i=\sum_{j=1}^{\min(i,p)}\boldsymbol\Phi_j\boldsymbol\Psi_{i-j}\)。\(\boldsymbol\Psi_i\) 的 \((r,s)\) 元表示 \(a_{s,t}\) 增加一单位对 \(r_{r,t+i}\) 的影响,称为脉冲响应函数(impulse response function, IRF)。

问题在于 \(\boldsymbol a_t\) 的分量相关,"只冲击第 \(s\) 个分量、其他不动"在现实中不会发生。解决办法仍是 Cholesky 分解:\(\boldsymbol\Sigma=\boldsymbol L\boldsymbol G\boldsymbol L'\),\(\boldsymbol b_t=\boldsymbol L^{-1}\boldsymbol a_t\),

\[\boldsymbol r_t=\boldsymbol\mu+\boldsymbol\Psi_0^*\boldsymbol b_t+\boldsymbol\Psi_1^*\boldsymbol b_{t-1}+\cdots,\qquad\boldsymbol\Psi_0^*=\boldsymbol L,\ \boldsymbol\Psi_i^*=\boldsymbol\Psi_i\boldsymbol L.\tag{8.22}\]

\(\boldsymbol\Psi_i^*\) 是关于正交新息的脉冲响应;实践中常把 \(b_{it}\) 标准化为单位方差(即用 \(\boldsymbol L\boldsymbol G^{1/2}\)),这样 IRF 表示"一个标准差冲击"的影响。

推导拆解:\(\boldsymbol\Psi_i\) 的递推从哪来。 第一步,\(\boldsymbol\Phi(B)\boldsymbol r_t=\boldsymbol a_t\)(去均值后)与 \(\boldsymbol r_t=\boldsymbol\Psi(B)\boldsymbol a_t\) 要同时成立,所以 \(\boldsymbol\Phi(B)\boldsymbol\Psi(B)=\boldsymbol I\)。 第二步,把左边按 \(B\) 的幂展开:\((\boldsymbol I-\boldsymbol\Phi_1B-\cdots)(\boldsymbol\Psi_0+\boldsymbol\Psi_1B+\boldsymbol\Psi_2B^2+\cdots)\)。\(B^0\) 项系数为 \(\boldsymbol\Psi_0\),必须等于 \(\boldsymbol I\);\(B^i\)(\(i\ge1\))的系数为 \(\boldsymbol\Psi_i-\sum_j\boldsymbol\Phi_j\boldsymbol\Psi_{i-j}\),必须等于 \(\boldsymbol 0\),移项即得递推式。 第三步,以 VAR(1) 为例,\(\boldsymbol\Psi_i=\boldsymbol\Phi^i\),与 8.3.3 的反复代入结果一致。 第四步,正交化:把 \(\boldsymbol a_t=\boldsymbol L\boldsymbol b_t\) 代入 MA 表示,\(\boldsymbol\Psi_i\boldsymbol a_{t-i}=(\boldsymbol\Psi_i\boldsymbol L)\boldsymbol b_{t-i}\),所以对 \(\boldsymbol b\) 的响应矩阵是 \(\boldsymbol\Psi_i\boldsymbol L\)。

金融直觉:把它想成一次压力测试。"市场突然下跌一个标准差"时,现实中个股会同期跟跌(同期相关约 0.65),不可能"只有市场跌、个股不动"。Cholesky 正交化的做法是:先让排第一的变量受冲击,然后按照它与后面变量的回归 beta,把同期的连带影响分摊下去,剩下与它不相关的部分才算后面变量"自己的"冲击。这和因子模型里"先扣掉市场 beta 暴露、剩下的才是特质风险"是同一个逻辑。

弱点:依赖排序。 Cholesky 分解中排第一的变量 \(b_{1t}=a_{1t}\) 不被变换,它的冲击会同期影响所有后面的变量,而后面变量的冲击不能同期影响前面的变量。不同排序可以得到截然不同的 IRF。原书 FinMetrics 示例(IBM 排第一)中,滞后 0 的正交响应矩阵为 \(\begin{bmatrix}6.997&0\\3.543&4.228\end{bmatrix}\)——右上角的 0 是排序强加的,不是数据告诉我们的。量化应用中,通常把"更外生"的变量(市场指数、期货、宏观冲击)排在前面,并检查结论对排序是否稳健。


8.4 向量移动平均模型(VMA)

\[\boldsymbol r_t=\boldsymbol\theta_0+\boldsymbol a_t-\boldsymbol\Theta_1\boldsymbol a_{t-1}-\cdots-\boldsymbol\Theta_q\boldsymbol a_{t-q}=\boldsymbol\theta_0+\boldsymbol\Theta(B)\boldsymbol a_t.\tag{8.23}\]

只要 \(\boldsymbol\Sigma\) 存在,VMA(\(q\)) 总是弱平稳,\(\boldsymbol\mu=\boldsymbol\theta_0\)。其矩为(令 \(\boldsymbol\Theta_0=-\boldsymbol I\))

\[\boldsymbol\Gamma_0=\boldsymbol\Sigma+\sum_{i=1}^q\boldsymbol\Theta_i\boldsymbol\Sigma\boldsymbol\Theta_i',\qquad\boldsymbol\Gamma_\ell=\sum_{j=\ell}^q\boldsymbol\Theta_j\boldsymbol\Sigma\boldsymbol\Theta_{j-\ell}'\ (1\le\ell\le q),\qquad\boldsymbol\Gamma_\ell=\boldsymbol 0\ (\ell>q).\]

所以 CCM 在滞后 \(q\) 之后截尾,可用样本 CCM 定阶。VMA 是"有限记忆"模型:冲击只影响 \(q\) 期。二元 VMA(1) 中,\(\Theta_{12}\)、\(\Theta_{21}\) 的零与非零同样刻画不耦合、单向和反馈关系。

估计比 VAR 难得多,因为新息需要递推得到,且依赖初值 \(\boldsymbol a_0\):

  • 条件似然:设 \(t\le0\) 时 \(\boldsymbol a_t=\boldsymbol 0\),由 \(\boldsymbol a_t=\boldsymbol r_t-\boldsymbol\theta_0+\boldsymbol\Theta_1\boldsymbol a_{t-1}\) 递推,再代入多元正态似然 \(\prod_t(2\pi)^{-k/2}|\boldsymbol\Sigma|^{-1/2}\exp(-\frac12\boldsymbol a_t'\boldsymbol\Sigma^{-1}\boldsymbol a_t)\)。
  • 精确似然:把 \(\boldsymbol a_0\) 当作参数。反复代入得 \(\boldsymbol a_t=\boldsymbol r_t^*+\boldsymbol\Theta^t\boldsymbol a_0\),其中 \(\boldsymbol r_t^*=\tilde{\boldsymbol r}_t+\boldsymbol\Theta\tilde{\boldsymbol r}_{t-1}+\cdots+\boldsymbol\Theta^{t-1}\tilde{\boldsymbol r}_1\),于是 \(\boldsymbol r_t^*=-\boldsymbol\Theta^t\boldsymbol a_0+\boldsymbol a_t\) 是关于 \(\boldsymbol a_0\) 的线性回归,可估出 \(\hat{\boldsymbol a}_0\) 再递推,进一步积分掉 \(\boldsymbol a_0\) 得精确似然(Hillmer & Tiao 1979)。

精确法更准确,尤其当 \(\boldsymbol\Theta\) 有模接近 1 的特征值时——这恰好是过度差分(例如对协整系统的每个分量分别差分,见第 08b 章)造成的情形。

例 8.5(IBM/S&P 500 的 VMA)。 拟合含滞后 1、2、3、5 的 VMA 模型,条件与精确似然结果几乎相同(样本大、动态弱)。简化模型的非零 MA 系数都落在 S&P 500 新息那一列,残差 \(Q_2(4)=16.00\)、\(Q_2(8)=29.46\)(p 值 0.10、0.29)。结论与 VAR 一致:动态结构由市场驱动。


8.5 向量 ARMA 模型(VARMA)

\[\boldsymbol\Phi(B)\boldsymbol r_t=\boldsymbol\phi_0+\boldsymbol\Theta(B)\boldsymbol a_t,\]

假设两个矩阵多项式没有左公因子。平稳条件与 VAR 相同,只取决于 \(\boldsymbol\Phi(B)\)。

8.5.1 可识别性问题

向量情形出现了单变量没有的新问题:同一个过程可能有多种 VARMA 表示。

  • 无害的例子:VMA(1) \(\boldsymbol r_t=\boldsymbol a_t-\begin{bmatrix}0&2\\0&0\end{bmatrix}\boldsymbol a_{t-1}\) 与 VAR(1) \(\boldsymbol r_t-\begin{bmatrix}0&-2\\0&0\end{bmatrix}\boldsymbol r_{t-1}=\boldsymbol a_t\) 完全相同(两者都给出 \(r_{2t}=a_{2t}\),\(r_{1t}=a_{1t}-2a_{2,t-1}\))。用哪个都行。
  • 麻烦的例子:
\[\boldsymbol r_t-\begin{bmatrix}0.8&-2+\eta\\0&\omega\end{bmatrix}\boldsymbol r_{t-1}=\boldsymbol a_t-\begin{bmatrix}-0.5&\eta\\0&\omega\end{bmatrix}\boldsymbol a_{t-1}\]

对任意 \(\omega,\eta\) 都表示同一个过程(因为 \(r_{2t}=a_{2t}\),\(\omega,\eta\) 在 AR 与 MA 两侧相互抵消)。不加约束时似然函数没有唯一极大值,类似回归中的完全多重共线性。

解决办法是结构设定(Tiao & Tsay 1989;Tsay 1991),原书不展开。实用建议:多数金融应用中 VAR 和 VMA 已够用;必须用 VARMA 时只考虑低阶(如 VARMA(1,1)、VARMA(2,1))。

8.5.2 动态关系的判断

在 VARMA 中,所有 AR、MA 矩阵的 \((i,j)\) 元为零,足以说明 \(r_{it}\) 不依赖 \(r_{jt}\) 的过去,但不是必要条件。二元情形下,左乘 \(\boldsymbol\Phi(B)\) 的伴随矩阵得

\[\Delta(B)\begin{bmatrix}r_{1t}\\r_{2t}\end{bmatrix}=\begin{bmatrix}\Phi_{22}\Theta_{11}-\Phi_{12}\Theta_{21}&\Phi_{22}\Theta_{12}-\Phi_{12}\Theta_{22}\\\Phi_{11}\Theta_{21}-\Phi_{21}\Theta_{11}&\Phi_{11}\Theta_{22}-\Phi_{21}\Theta_{12}\end{bmatrix}\begin{bmatrix}a_{1t}\\a_{2t}\end{bmatrix},\quad\Delta(B)=|\boldsymbol\Phi(B)|,\]

所以从 \(r_{1t}\) 到 \(r_{2t}\) 存在单向关系的充要条件是

\[\Phi_{22}(B)\Theta_{12}(B)-\Phi_{12}(B)\Theta_{22}(B)=0,\quad\text{且}\quad\Phi_{11}(B)\Theta_{21}(B)-\Phi_{21}(B)\Theta_{11}(B)\ne0.\tag{8.30}\]

例 8.6(美国 1 年期与 3 年期国债利率)。 1953 年 4 月至 2001 年 1 月月度数据,574 个观测,取对数。定阶指向 VAR(4),但 VARMA(2,1) 拟合相当且更简约。精确似然估计、删去不显著参数后,得

\[r_{3t}=0.025+0.99r_{3,t-1}+a_{3t}+0.47a_{3,t-1},\]
\[r_{1t}=0.028+1.82r_{1,t-1}-0.84r_{1,t-2}-0.97r_{3,t-1}+0.98r_{3,t-2}+a_{1t}-0.90a_{1,t-1}+1.66a_{3,t-1}.\]

新息同期相关 \(2.5/\sqrt{3.58\times2.19}\approx0.89\)。所有 AR、MA 矩阵的 (2,1) 元为零,所以3 年期利率单向领先 1 年期利率。两序列看起来都有单位根,近似写成

\[(1-B)r_{3t}=0.03+(1+0.47B)a_{3t},\qquad(1-B)(1-0.82B)r_{1t}=0.03-0.97B(1-B)r_{3t}+(1-0.9B)a_{1t}+1.66Ba_{3t}.\]

这为第 08b 章的协整埋下伏笔。

8.5.3 分量的边际模型

\(k\) 维 VARMA(\(p,q\)) 的每个分量单独看是一个单变量 ARMA,阶数上界为 ARMA\([kp,(k-1)p+q]\)。推导思路以二元 VAR(1) 为例:左乘 \(\boldsymbol I-\boldsymbol\Phi B\) 的伴随矩阵 \(\begin{bmatrix}1-\Phi_{22}B&\Phi_{12}B\\\Phi_{21}B&1-\Phi_{11}B\end{bmatrix}\),得

\[[(1-\Phi_{11}B)(1-\Phi_{22}B)-\Phi_{12}\Phi_{21}B^2]\boldsymbol r_t=\begin{bmatrix}1-\Phi_{22}B&\Phi_{12}B\\\Phi_{21}B&1-\Phi_{11}B\end{bmatrix}\boldsymbol a_t,\]

左边是 2 阶标量 AR 多项式,右边是 VMA(1),而 VMA(\(q\)) 的分量是 MA(\(q\)),于是边际模型为 ARMA(2,1)。一般 \(k\) 维 VAR(1) 的边际为 ARMA(\(k,k-1\))。启示:一个看起来需要高阶 ARMA 的单变量序列,可能只是低阶多元系统的一个分量。

推导拆解:这里用的是 2×2 矩阵求逆的老技巧。对 \(\boldsymbol A=\begin{bmatrix}a&b\\c&d\end{bmatrix}\),伴随矩阵(adjugate)\(\mathrm{adj}(\boldsymbol A)=\begin{bmatrix}d&-b\\-c&a\end{bmatrix}\) 满足 \(\mathrm{adj}(\boldsymbol A)\boldsymbol A=|\boldsymbol A|\boldsymbol I\),所以 \(\boldsymbol A^{-1}=\mathrm{adj}(\boldsymbol A)/|\boldsymbol A|\)。(注意这里的"伴随矩阵"与 8.3.4 的 companion matrix 是两个不同概念,中文恰好同名。) 把 \(\boldsymbol A\) 换成 \(\boldsymbol I-\boldsymbol\Phi B=\begin{bmatrix}1-\Phi_{11}B&-\Phi_{12}B\\-\Phi_{21}B&1-\Phi_{22}B\end{bmatrix}\),左乘它的 adjugate 后,左边变成"标量多项式 \(|\boldsymbol I-\boldsymbol\Phi B|\) 乘单位阵",两个方程就解耦了。\(|\boldsymbol I-\boldsymbol\Phi B|\) 是 \(B\) 的二次式,所以 AR 阶为 2;右边每行是 \(a_{1t},a_{2t}\) 及其一阶滞后的组合,所以 MA 阶为 1。8.5.2 的式子用的是同一个技巧,只是右边多乘了 \(\boldsymbol\Theta(B)\)。


量化实战

应用场景

领先–滞后信号研究。 CCM、VAR 系数结构和 Granger 因果检验是寻找跨资产、跨市场领先–滞后关系的标准工具:股指期货领先现货、大盘股领先小盘股、行业龙头领先跟随者、长端利率领先短端(例 8.6)、海外市场收盘领先本地开盘。发现领先关系后,领先资产的滞后收益就是被领先资产的预测因子。但有两点要警惕:(1) 非同步交易(第 05 章)会制造虚假的领先–滞后——流动性差的资产最后成交价滞后,看上去像被流动性好的资产"领先",实际不可交易;(2) 月度 VAR 的 \(R^2\) 只有 1% 左右,统计显著不等于扣除成本后可盈利。

风险建模。 VAR 残差协方差 \(\boldsymbol\Sigma\) 是"剔除可预测部分后"的风险,比原始收益协方差更适合作为组合风险的输入;同期相关矩阵的结构(例 8.2 的国债)直接对应利率曲线因子。

宏观与跨资产传导。 正交化脉冲响应用于分析利率、汇率、商品冲击对股票组合的传导路径和持续期,排序应依据经济逻辑(外生者在前),并报告排序敏感性。

定阶与过拟合。 每多一阶增加 \(k^2\) 个参数。\(k=10\) 的 VAR(5) 有 500 个 AR 参数,基本不可能稳定估计,实务中要么用 BIC、要么用系数约束(只保留领先变量的滞后)、要么先用第 09 章的因子模型降维。

Python 示例:领先–滞后检测的完整流程

模拟一个"市场单向领先个股"的二元 VAR(2),真实参数仿照例 8.4 的量级;然后走一遍 CCM → 多元混成检验 → 定阶 → 估计 → Granger 因果 → 残差诊断 → 脉冲响应 → 预测。

import numpy as np
import pandas as pd
from statsmodels.tsa.api import VAR
from scipy import stats

rng = np.random.default_rng(42)

# ---------- 1. 模拟"市场单向领先个股"的二元 VAR(2) ----------
# r_t = (个股, 市场)';个股依赖市场滞后,市场不依赖个股滞后
phi0 = np.array([0.8, 0.4])
Phi1 = np.array([[0.00, 0.15],
                 [0.00, 0.08]])
Phi2 = np.array([[0.00, -0.08],
                 [0.00, 0.00]])
Sigma = np.array([[48.0, 24.0],
                  [24.0, 30.0]])          # 与原书例 8.4 的残差协方差同量级
T = 1000
C = np.linalg.cholesky(Sigma)
r = np.zeros((T + 200, 2))
for t in range(2, T + 200):
    a = C @ rng.standard_normal(2)
    r[t] = phi0 + Phi1 @ r[t-1] + Phi2 @ r[t-2] + a
r = pd.DataFrame(r[200:], columns=["STK", "MKT"])

# ---------- 2. 样本交叉相关矩阵与 Tiao-Box 简化记号 ----------
def ccm(x, lag):
    x = x - x.mean(0)
    T = len(x)
    G = x[lag:].T @ x[:T-lag] / T          # Gamma_lag:(i,j) = Cov(r_i,t , r_j,t-lag)
    d = np.sqrt(np.diag(x.T @ x / T))
    return G / np.outer(d, d)

X = r.values
crit = 2 / np.sqrt(T)
for lag in range(0, 4):
    R = ccm(X, lag)
    sym = np.where(R > crit, "+", np.where(R < -crit, "-", "."))
    print(f"lag {lag}: rho =", np.round(R, 3).tolist(), " 记号:", sym.tolist())

# ---------- 3. 多元混成检验 Q_k(m),式 (8.7) ----------
def mq(x, m):
    x = x - x.mean(0)
    T, k = x.shape
    G0inv = np.linalg.inv(x.T @ x / T)
    Q = 0.0
    for l in range(1, m + 1):
        Gl = x[l:].T @ x[:T-l] / T
        Q += np.trace(Gl.T @ G0inv @ Gl @ G0inv) / (T - l)
    Q *= T**2
    return Q, 1 - stats.chi2.cdf(Q, k * k * m)

for m in (1, 5, 10):
    Q, p = mq(X, m)
    print(f"Q_2({m}) = {Q:.2f}, p = {p:.4f}")

# ---------- 4. 定阶、估计、诊断 ----------
model = VAR(r)
sel = model.select_order(maxlags=8)
print("AIC/BIC/HQ 选阶:", {k: int(v) for k, v in sel.selected_orders.items()})
res = model.fit(2)
print(res.params.round(3))
print("残差协方差:\n", res.sigma_u.round(2))

# 平稳性:伴随矩阵特征值模长
comp = np.zeros((4, 4))
comp[:2, :2] = res.coefs[0]; comp[:2, 2:] = res.coefs[1]; comp[2:, :2] = np.eye(2)
print("伴随矩阵特征值模:", np.round(np.abs(np.linalg.eigvals(comp)), 3))

# Granger 因果(等价于检验 Phi_l 的 (i,j) 元全为 0)
g1 = res.test_causality("STK", ["MKT"], kind="f")
g2 = res.test_causality("MKT", ["STK"], kind="f")
print(f"MKT -> STK: F={g1.test_statistic:.2f}, p={g1.pvalue:.4f}")
print(f"STK -> MKT: F={g2.test_statistic:.2f}, p={g2.pvalue:.4f}")

# 残差的多元 Ljung-Box:自由度 k^2 m - g
wt = res.test_whiteness(nlags=8, adjusted=True)
print(f"残差 Q(8): stat={wt.test_statistic:.2f}, df={wt.df}, p={wt.pvalue:.3f}")

# ---------- 5. 正交化脉冲响应与排序依赖 ----------
irf = res.irf(5)
print("正交化 IRF,市场冲击(1sd) 对个股的影响 lag0..5:",
      np.round(irf.orth_irfs[:, 0, 1], 3))
r_rev = r[["MKT", "STK"]]
irf_rev = VAR(r_rev).fit(2).irf(5)
print("市场冲击对个股的同期影响: STK 排第一 ->", round(irf.orth_irfs[0, 0, 1], 3),
      "; MKT 排第一 ->", round(irf_rev.orth_irfs[0, 1, 0], 3))

# ---------- 6. 多步预测:收敛到均值与无条件标准差 ----------
fc, lo, hi = res.forecast_interval(X[-2:], steps=6, alpha=0.05)
se = (hi - fc) / 1.96
print("预测:\n", np.round(fc, 3))
print("预测标准误:\n", np.round(se, 3))
mu = np.linalg.solve(np.eye(2) - res.coefs.sum(0), res.intercept)
print("模型隐含均值:", mu.round(3), " 样本标准差:", X.std(0).round(3))

关键输出:

lag 0: rho = [[1.0, 0.657], [0.657, 1.0]]  记号: [['+', '+'], ['+', '+']]
lag 1: rho = [[0.108, 0.154], [0.091, 0.099]]  记号: [['+', '+'], ['+', '+']]
lag 2: rho = [[0.006, -0.028], [0.021, 0.008]]  记号: [['.', '.'], ['.', '.']]
Q_2(1) = 25.16, p = 0.0000
Q_2(5) = 39.80, p = 0.0053
Q_2(10) = 55.18, p = 0.0556
AIC/BIC/HQ 选阶: {'aic': 1, 'bic': 0, 'hqic': 1, 'fpe': 1}
          STK    MKT
const   0.376 -0.001
L1.STK  0.020  0.039
L1.MKT  0.178  0.068
L2.STK  0.037  0.020
L2.MKT -0.085 -0.022
伴随矩阵特征值模: [0.197 0.197 0.152 0.152]
MKT -> STK: F=7.51, p=0.0006
STK -> MKT: F=0.80, p=0.4479
残差 Q(8): stat=21.06, df=24, p=0.635
正交化 IRF,市场冲击(1sd) 对个股的影响 lag0..5: [ 0.     0.768 -0.302 -0.011 -0.009 -0.001]
市场冲击对个股的同期影响: STK 排第一 -> 0.0 ; MKT 排第一 -> 4.57
预测标准误:
 [[7.001 5.713]
 [7.088 5.745]
 [7.095 5.746] ...
模型隐含均值: [0.401 0.024]  样本标准差: [7.074 5.728]

读结果时注意以下几点。

  • CCM 的不对称性:滞后 1 的第一行(个股)对市场滞后的相关 0.154 大于第二行对个股滞后的 0.091。后者"显著"只是因为市场自身有自相关,而个股与市场同期相关 0.66——仅凭 CCM 会误以为存在反馈,必须靠 VAR 的条件效应才能分清方向。
  • 定阶:真实阶数是 2,但 BIC 选 0、AIC 选 1。弱的动态依赖在 1000 个样本下也难以被信息准则完全捕捉,这与例 8.4 中 BIC 选 VAR(1)、AIC 选 VAR(5) 的现象一致。研究领先–滞后时,更应关注针对性的 Granger 检验,而不是只看信息准则。
  • Granger 检验清楚地恢复了真实结构:市场 → 个股 p=0.0006,个股 → 市场 p=0.45。
  • 排序依赖:把个股排在第一位时,市场冲击对个股的同期影响被强制为 0;把市场排第一时是 4.57(约等于 \(\sigma_{12}/\sqrt{\sigma_{22}}=26.1/\sqrt{32.6}\))。经济上应该让市场排第一。
  • 预测:2 步之后预测就收敛到模型均值,标准误收敛到样本标准差——与表 8.5 的规律相同。

本章小结

向量时间序列分析的第一步是看交叉相关矩阵:\(\boldsymbol\rho_0\) 刻画同期联动,\(\ell>0\) 的 \(\boldsymbol\rho_\ell\) 刻画领先–滞后,且一般不对称;多元混成检验 \(Q_k(m)\) 判断是否值得建动态模型。VAR 是主力模型:简约式易于估计和预测,借助 Cholesky 分解可以写成结构式,但结构式和正交脉冲响应都依赖排序;平稳性看伴随矩阵特征值;定阶用 \(M(i)\) 与信息准则,估计用逐方程 OLS,诊断用残差 \(Q_k(m)\)(自由度 \(k^2m-g\))。系数矩阵的零元结构给出不耦合、单向、反馈三种动态关系,对应 Granger 因果检验。VMA 的 CCM 截尾、估计需递推新息,过度差分时要用精确似然;VARMA 存在可识别性问题,实务中尽量用低阶。实证上,个股依赖市场的过去而市场不依赖个股,长端利率领先短端利率。

概念 公式 / 要点
交叉相关矩阵 \(\boldsymbol\rho_\ell=\boldsymbol D^{-1}\boldsymbol\Gamma_\ell\boldsymbol D^{-1}\),\(\boldsymbol\rho_\ell=\boldsymbol\rho_{-\ell}'\)
简化记号 \(\pm\) 以 \(\pm2/\sqrt T\) 为界
多元混成检验 \(Q_k(m)=T^2\sum_\ell\frac{1}{T-\ell}\mathrm{tr}(\hat{\boldsymbol\Gamma}_\ell'\hat{\boldsymbol\Gamma}_0^{-1}\hat{\boldsymbol\Gamma}_\ell\hat{\boldsymbol\Gamma}_0^{-1})\sim\chi^2_{k^2m}\)
VAR(\(p\)) \(\boldsymbol r_t=\boldsymbol\phi_0+\sum_i\boldsymbol\Phi_i\boldsymbol r_{t-i}+\boldsymbol a_t\);\(\boldsymbol\mu=\boldsymbol\Phi(1)^{-1}\boldsymbol\phi_0\)
平稳条件 伴随矩阵 \(\boldsymbol\Phi^*\) 特征值模 \(<1\)
结构式 左乘 \(\boldsymbol L^{-1}\),\(\boldsymbol\Sigma=\boldsymbol L\boldsymbol G\boldsymbol L'\)
定阶 \(M(i)\sim\chi^2_{k^2}\);AIC/BIC/HQ 惩罚 \(k^2i\)
残差检验 \(Q_k(m)\sim\chi^2_{k^2m-g}\)
预测误差协方差 \(\sum_{j=0}^{\ell-1}\boldsymbol\Psi_j\boldsymbol\Sigma\boldsymbol\Psi_j'\)
脉冲响应 \(\boldsymbol\Psi_i=\sum_j\boldsymbol\Phi_j\boldsymbol\Psi_{i-j}\);正交化 \(\boldsymbol\Psi_i^*=\boldsymbol\Psi_i\boldsymbol L\)
VMA(\(q\)) \(\boldsymbol\rho_\ell=0,\ \ell>q\);条件 vs 精确似然
VARMA 边际模型 ARMA\([kp,(k-1)p+q]\)

练习

基础

  1. 证明 \(\boldsymbol\Gamma_\ell=\boldsymbol\Gamma_{-\ell}'\),并说明为什么 \(\ell>0\) 时 \(\boldsymbol\Gamma_\ell\) 一般不对称。 提示:写出 \((i,j)\) 元 \(\mathrm{Cov}(r_{it},r_{j,t-\ell})\),利用平稳性平移时间下标。
  2. 对二元 VAR(1),\(\boldsymbol\Phi=\begin{bmatrix}0.5&0.3\\0&0.8\end{bmatrix}\),判断是否平稳,并说明两序列的动态关系类型。 提示:上三角阵特征值为对角元 0.5、0.8,平稳;\(\Phi_{21}=0\)、\(\Phi_{12}\ne0\),为 \(r_2\to r_1\) 的单向关系。
  3. 在例 8.3 中验证 \(\boldsymbol L\boldsymbol G\boldsymbol L'=\boldsymbol\Sigma\),并独立算出 \(\boldsymbol\Phi^*\) 的第二行。
  4. \(k=5\) 的 VAR(3) 有多少个 AR 参数?AIC 与 BIC 对每增加一阶的惩罚分别是多少(\(T=1000\))? 提示:75 个;AIC 每阶加 \(2\times25/1000=0.05\),BIC 加 \(25\ln1000/1000\approx0.173\)。
  5. 解释为什么正交化脉冲响应依赖变量排序,并说明在"指数期货 + 现货"的二元系统中你会如何排序。 提示:Cholesky 下三角结构;期货流动性更好、价格发现在先,通常排第一。

进阶

  1. 推导 VAR(1) 的无条件协方差满足 \(\boldsymbol\Gamma_0=\boldsymbol\Phi\boldsymbol\Gamma_0\boldsymbol\Phi'+\boldsymbol\Sigma\),并用 \(\mathrm{vec}\) 与 Kronecker 积写出 \(\mathrm{vec}(\boldsymbol\Gamma_0)=(\boldsymbol I-\boldsymbol\Phi\otimes\boldsymbol\Phi)^{-1}\mathrm{vec}(\boldsymbol\Sigma)\)。用本章示例的估计值数值验证。
  2. (原书习题 8.5)季节模型 \(\boldsymbol x_t-\boldsymbol\Phi_4\boldsymbol x_{t-4}=\boldsymbol\phi_0+\boldsymbol a_t\):求均值与协方差,给出弱平稳的充要条件,并证明 \(\boldsymbol\Gamma_\ell=\boldsymbol\Phi_4\boldsymbol\Gamma_{\ell-4}\)。
  3. (原书习题 8.6)对 \(\boldsymbol x_t=\boldsymbol a_t-\boldsymbol\Theta_4\boldsymbol a_{t-4}\) 求 \(\boldsymbol\Gamma_0,\dots,\boldsymbol\Gamma_5\)。 提示:只有 \(\boldsymbol\Gamma_0=\boldsymbol\Sigma+\boldsymbol\Theta_4\boldsymbol\Sigma\boldsymbol\Theta_4'\) 与 \(\boldsymbol\Gamma_4=-\boldsymbol\Theta_4\boldsymbol\Sigma\) 非零。
  4. 修改本章代码:把个股收益改为"每 3 期才成交一次、未成交时价格不变"的非同步序列(第 05 章),重新做 Granger 检验,观察虚假领先–滞后如何出现。
  5. 写出二元 VAR(2) 的边际模型阶数上界,并用模拟数据拟合单变量 ARMA 验证。

原书推荐习题:8.1(b)(c)(多元混成检验与领先–滞后分析)、8.2(二元 AR 转结构式、与二元 MA 比较)、8.5、8.6(季节 VAR/VMA 的矩推导)、8.3(VARMA 建模)。


原书对照

本章小节 原书章节 PDF 页码
8.1 引言 第 8 章引言 p.409–410
8.2 交叉相关矩阵、例 8.1–8.2、多元混成检验 8.1 p.410–419
8.3 VAR 模型、例 8.3–8.4、预测、脉冲响应 8.2 p.419–437
8.4 VMA 模型、例 8.5 8.3 p.437–442
8.5 VARMA、例 8.6、边际模型 8.4 p.442–448
矩阵复习、多元正态分布、SCA 命令 第 8 章附录 A、B、C p.476–482
习题 第 8 章习题 p.482–484

(原书印刷页码约等于 PDF 页码减 20。)