量化交易中文教材

第 19b 章 广义最小二乘、工具变量与广义矩估计

学习目标

读完本章,你应当能够:

  1. 陈述 GLS 假设,推导 \(\tilde{\boldsymbol\beta}^{GLS}=(\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}\mathbf X'\boldsymbol\Omega^{-1}\mathbf Y\) 并说明它为什么是 BLUE;区分不可行 GLS 与可行 GLS,知道 WLS 是 GLS 的特例。
  2. 理解 GLS 需要「严格外生」\(E(\mathbf U\mid\mathbf X)=\mathbf 0\),而 OLS 只需 \(E(u_i\mid\mathbf X_i)=0\);能举出 GLS 不一致而 OLS 一致的时间序列例子。
  3. 用矩阵写出 TSLS 估计量 \((\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf Y\),推导它在异方差下的渐近分布与稳健标准误。
  4. 把 TSLS 放进「以 \(\mathbf Z\) 的线性组合为工具」的 IV 估计量族(即线性 GMM),理解权重矩阵的作用,证明同方差下 TSLS 是有效 GMM。
  5. 构造两步有效 GMM 估计量与 GMM J 统计量,并知道时间序列中何时需要 HAC 估计 \(\mathbf H\)、何时不需要。
  6. 用线性随机贴现因子模型做 GMM 估计与 J 检验,理解 GMM 在资产定价中的地位。

读前导读

这一章在解决什么问题。 本章有两条主线,都是在 19a 章的 OLS 不够用时登场。

第一条是 GLS(广义最小二乘)。OLS 默认每个观测的误差互不相关、方差相同。时间序列里误差常常前后相关,横截面里同行业股票的误差也会一起动。GLS 的办法和你熟悉的「把相关资产变换成不相关的组合」一样:先用误差协方差矩阵的逆「白化」数据,再做 OLS。第 18 章的 WLS 是它的对角特例。本章最重要的警告是:GLS 比 OLS 更挑剔,它要求误差和未来的回归元也不相关。资产价格、利率这类含有预期的变量很容易违反这一点,这时 GLS 会给出「精确但错误」的答案。

第二条是 IV(工具变量)与 GMM(广义矩估计)。回归元和误差相关(内生)时 OLS 有偏,需要找与误差无关、但与回归元相关的「工具」。你在 CFA 里见过「样本矩 = 总体矩」的矩估计思路;GMM 是它的推广:当矩条件个数多于参数时,找一个让所有矩条件「整体最接近成立」的参数。资产定价中的 \(E[m_{t+1}R^e_{t+1}]=0\) 就是一组矩条件,GMM 是检验因子模型的标准工具,2013 年 Hansen 因此获诺贝尔奖。

需要先想起来的数学。

  • 矩阵平方根与「白化」。若 \(\boldsymbol\Omega\) 是协方差矩阵,存在 \(\mathbf F\) 使 \(\mathbf F\boldsymbol\Omega\mathbf F'=\mathbf I\)。用 \(\mathbf F\) 左乘随机向量,就把相关、不等方差的变量变成不相关、单位方差的变量。一维例子:\(\boldsymbol\Omega=\sigma^2\),\(\mathbf F=1/\sigma\),就是标准化。见 第 00 册第 06 章 线性代数速成。
  • 二次型与正定矩阵。\(\mathbf g'\mathbf A\mathbf g\)(\(\mathbf A\) 半正定)衡量向量 \(\mathbf g\) 的「加权长度」。\(\mathbf A=\mathbf I\) 时就是各分量平方和;\(\mathbf A\) 为协方差逆时就是马氏距离。GMM 的目标函数和 J 统计量都是这种二次型。见 第 00 册第 06 章。
  • 投影矩阵 \(\mathbf P_Z\)、\(\mathbf M_Z\)。19a 章 19.4.1 节已讲:\(\mathbf P_Z\mathbf X\) 是 \(\mathbf X\) 对 \(\mathbf Z\) 回归的拟合值。TSLS 的第一阶段就是一次投影。
  • 对向量求导、令梯度为零。GMM 的估计量 (19.59) 来自对二次目标函数求导。规则是 \(\frac{\partial}{\partial\mathbf b}(\mathbf a-\mathbf C\mathbf b)'\mathbf W(\mathbf a-\mathbf C\mathbf b)=-2\mathbf C'\mathbf W(\mathbf a-\mathbf C\mathbf b)\)(\(\mathbf W\) 对称),这是一元 \(\frac{d}{db}w(a-cb)^2=-2cw(a-cb)\) 的直接推广。见 第 00 册第 05 章 多元微积分与优化。
  • 条件期望与鞅差分。\(E(u_t\mid\text{过去信息})=0\) 的序列叫鞅差分序列,它与自己的任何过去值都不相关。有效市场下的超额收益就是典型例子。见 第 00 册第 07 章 概率中的分析工具。

怎么读这一章。 核心必读:19.6.3(GLS 的变换思路)、19.6.5(严格外生警告,配合示例一)、19.7.2(TSLS 的矩阵形式)、19.7.4 中「IV 估计量族」和 19.7.6(GMM 的定义、有效权重、两步法、J 统计量)、19.7.7 的情形二和欧拉方程。可以第一次跳过的:19.7.3 渐近方差 (19.52) 的完整形式(记住「仍然是三明治,肉是 \(\mathbf H\)」即可)、附录 19.6 的全部证明。如果你的工作偏资产定价,可以先读量化实战的示例三,再回头读 19.7.6,会更有方向感。


19.6 广义最小二乘(GLS)

(第 16.5 节在分布滞后回归中已经引入 GLS;本节给出自包含的数学处理。)

19.6.1 为什么需要 GLS

i.i.d. 抽样(如简单随机抽样的个人数据)下,\(u_i\) 与 \(u_j\) 独立,\(E(\mathbf U\mathbf U'\mid\mathbf X)\) 是对角矩阵。但在时间序列中,遗漏的因素往往跨期相关,误差序列相关。这带来两个问题:

  1. OLS 的稳健标准误和仅同方差标准误都无效。解决办法是 HAC 标准误(第 16.4 节)。
  2. \(E(\mathbf U\mathbf U'\mid\mathbf X)\) 不再是对角阵,高斯–马尔可夫条件 (ii) 不成立,OLS 不再是 BLUE。

GLS 针对第二个问题:当误差的条件协方差矩阵不正比于单位阵时,GLS(至少渐近地)是 BLUE。第 18 章的 WLS 是 GLS 的特例:协方差矩阵对角、第 \(i\) 个对角元是 \(X_i\) 的函数。GLS 的思路与 WLS 完全相同:变换模型,使变换后的误差满足高斯–马尔可夫条件,再对变换后的模型做 OLS。

19.6.2 GLS 假设

Key Concept 19.4(GLS 假设) 在 \(\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U\) 中:

  1. \(E(\mathbf U\mid\mathbf X)=\mathbf 0_n\);(19.40)
  2. \(E(\mathbf U\mathbf U'\mid\mathbf X)=\boldsymbol\Omega(\mathbf X)\),是 \(n\times n\) 正定矩阵,可以依赖 \(\mathbf X\);(19.41)
  3. \(\mathbf X_i\) 与 \(u_i\) 满足适当的矩条件(具体条件因 \(\boldsymbol\Omega\) 的形式、是否需要估计、所研究的统计量而异,原书不细列);
  4. \(\mathbf X\) 列满秩。

假设 1 由 OLS 的假设 1、2 蕴含(见 19a 章式 19.6),但 GLS 不想保留 i.i.d. 假设,因为它的目的之一就是处理跨观测的相关。两大应用:

  • 独立抽样 + 异方差:\(\boldsymbol\Omega\) 对角,第 \(i\) 个对角元为 \(\lambda h(\mathbf X_i)\)。此时 GLS 就是 WLS(18.5 节)。
  • 同方差 + 序列相关:必须对序列相关建模。例如误差只与相邻项相关,\(\mathrm{corr}(u_i,u_{i-1})=\rho\ne0\),\(|i-j|\ge2\) 时为零(MA(1) 型)。则 \(\boldsymbol\Omega\) 的对角元为 \(\sigma_u^2\),第一副对角元为 \(\rho\sigma_u^2\),其余为 0,且不依赖 \(\mathbf X\)。AR(1) 等其他结构见第 16.5 节与习题 19.8。

19.6.3 \(\boldsymbol\Omega\) 已知时的 GLS

取 \(\mathbf F\) 为 \(\boldsymbol\Omega^{-1}\) 的矩阵平方根:\(\mathbf F'\mathbf F=\boldsymbol\Omega^{-1}\)(附录 19.1,见 19a 章)。它满足 \(\mathbf F\boldsymbol\Omega\mathbf F'=\mathbf I_n\)(因为 \(\boldsymbol\Omega=\mathbf F^{-1}\mathbf F'^{-1}\))。把模型左乘 \(\mathbf F\):

\[\tilde{\mathbf Y}=\tilde{\mathbf X}\boldsymbol\beta+\tilde{\mathbf U},\qquad\tilde{\mathbf Y}=\mathbf F\mathbf Y,\ \tilde{\mathbf X}=\mathbf F\mathbf X,\ \tilde{\mathbf U}=\mathbf F\mathbf U.\tag{19.42}\]

关键洞见:变换后的模型满足高斯–马尔可夫条件。

  • \(E(\tilde{\mathbf U}\mid\tilde{\mathbf X})=\mathbf FE(\mathbf U\mid\mathbf F\mathbf X)=\mathbf 0_n\)(\(\mathbf F\) 可逆,条件于 \(\mathbf F\mathbf X\) 与条件于 \(\mathbf X\) 相同);
  • \(E(\tilde{\mathbf U}\tilde{\mathbf U}'\mid\tilde{\mathbf X})=\mathbf FE(\mathbf U\mathbf U'\mid\mathbf X)\mathbf F'=\mathbf F\boldsymbol\Omega\mathbf F'=\mathbf I_n\)。

所以对变换模型做 OLS,\(\tilde{\boldsymbol\beta}^{GLS}=(\tilde{\mathbf X}'\tilde{\mathbf X})^{-1}\tilde{\mathbf X}'\tilde{\mathbf Y}\),是关于 \(\tilde{\mathbf Y}\) 线性的最佳条件无偏估计量。又因为 \(\mathbf F\) 已知且可逆(\(\boldsymbol\Omega\) 正定),「关于 \(\tilde{\mathbf Y}\) 线性」的估计量类与「关于 \(\mathbf Y\) 线性」的类完全相同,因此 GLS 是 BLUE。展开 \(\tilde{\mathbf X}'\tilde{\mathbf X}=\mathbf X'\mathbf F'\mathbf F\mathbf X=\mathbf X'\boldsymbol\Omega^{-1}\mathbf X\),得

\[\tilde{\boldsymbol\beta}^{GLS}=(\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}(\mathbf X'\boldsymbol\Omega^{-1}\mathbf Y),\tag{19.43}\]
计算时不必求出 \(\mathbf F\)。同方差情形 \(\boldsymbol\Omega=\sigma_u^2\mathbf I\) 时 (19.43) 退化为 OLS。条件协方差为 \((\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}\)。

推导拆解:从变换模型的 OLS 到 (19.43)。 第一步,对 (19.42) 套 OLS 公式:\((\tilde{\mathbf X}'\tilde{\mathbf X})^{-1}\tilde{\mathbf X}'\tilde{\mathbf Y}\)。 第二步,代入 \(\tilde{\mathbf X}=\mathbf F\mathbf X\),用转置规则 \((\mathbf F\mathbf X)'=\mathbf X'\mathbf F'\):\(\tilde{\mathbf X}'\tilde{\mathbf X}=\mathbf X'\mathbf F'\mathbf F\mathbf X\),\(\tilde{\mathbf X}'\tilde{\mathbf Y}=\mathbf X'\mathbf F'\mathbf F\mathbf Y\)。 第三步,\(\mathbf F'\mathbf F=\boldsymbol\Omega^{-1}\) 替换进去,\(\mathbf F\) 本身消失。所以只要会算 \(\boldsymbol\Omega^{-1}\),不必真的找平方根。 第四步,条件协方差:变换模型误差协方差为 \(\mathbf I\),套 19a 章的同方差公式 \(\sigma^2(\tilde{\mathbf X}'\tilde{\mathbf X})^{-1}\),其中 \(\sigma^2=1\),得 \((\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}\)。 金融直觉:GLS 和最小方差组合是同一个数学结构。最小方差组合权重 \(\propto\boldsymbol\Sigma^{-1}\mathbf 1\):噪声大的资产少配,与其他资产高度相关的资产也少配(信息重复)。GLS 给观测「配权」也是这样:误差方差大的观测、和其他观测误差高度相关的观测,被 \(\boldsymbol\Omega^{-1}\) 压低权重。

实践中 \(\boldsymbol\Omega\) 通常未知,(19.43) 称为不可行 GLS(infeasible GLS)。

AR(1) 误差的准差分(原书习题 19.8)。若 \(u_t=\rho u_{t-1}+\tilde u_t\),\(\tilde u_t\) 为白噪声,则不必显式求 \(\boldsymbol\Omega^{-1}\):对 \(t\ge2\) 做准差分 \(Y_t-\rho Y_{t-1}=(\mathbf X_t-\rho\mathbf X_{t-1})'\boldsymbol\beta+\tilde u_t\),第一个观测乘以 \(\sqrt{1-\rho^2}\)。这正是某个 \(\mathbf F\) 的作用。丢掉第一个观测就是 Cochrane–Orcutt 方法(第 16.5 节)。

推导拆解:为什么准差分有效?把 \(t\) 期方程减去 \(\rho\) 倍的 \(t-1\) 期方程:\(Y_t-\rho Y_{t-1}=(\mathbf X_t-\rho\mathbf X_{t-1})'\boldsymbol\beta+(u_t-\rho u_{t-1})\)。由 AR(1) 定义,\(u_t-\rho u_{t-1}=\tilde u_t\) 是白噪声,正好满足高斯–马尔可夫条件。 第一个观测没有「上一期」可减,只能单独处理。\(u_1\) 的方差是 AR(1) 的平稳方差 \(\sigma_{\tilde u}^2/(1-\rho^2)\),乘以 \(\sqrt{1-\rho^2}\) 后方差恰好变成 \(\sigma_{\tilde u}^2\),和其他变换后误差一致。这一步就是 Prais–Winsten 与 Cochrane–Orcutt 的唯一区别。

19.6.4 \(\boldsymbol\Omega\) 含未知参数时:可行 GLS

若 \(\boldsymbol\Omega\) 是少数可估参数的已知函数,可以先估计 \(\hat{\boldsymbol\Omega}\)。例如上面 MA(1) 型结构有两个参数 \(\sigma_u^2,\rho\),用初步 OLS 残差估计:\(\sigma_u^2\) 用 \(s_{\hat u}^2\),\(\rho\) 用所有相邻残差对的样本相关系数。一般地,

\[\hat{\boldsymbol\beta}^{GLS}=(\mathbf X'\hat{\boldsymbol\Omega}^{-1}\mathbf X)^{-1}(\mathbf X'\hat{\boldsymbol\Omega}^{-1}\mathbf Y),\tag{19.44}\]
称为可行 GLS(feasible GLS)。在适当条件下,它与不可行 GLS 渐近等价。

19.6.5 条件均值零假设与 GLS(重要)

这是本节最重要、也最容易被忽视的一点。

  • OLS 一致需要 \(E(u_i\mid\mathbf X_i)=0\):给定本观测的回归元,误差均值为零。
  • GLS 的第一个假设是 \(E(u_i\mid\mathbf X_1,\dots,\mathbf X_n)=0\):给定所有观测的回归元,误差均值为零。

i.i.d. 抽样(GLS 即 WLS)时,后者由前者蕴含;非 i.i.d. 时,GLS 的假设更强。时间序列中这正是第 16.5 节「过去与当期外生」与「严格外生」的区别:\(E(u_t\mid\mathbf X_1,\dots,\mathbf X_T)=0\) 就是严格外生,要求误差与未来的回归元也不相关。

对比两者的一致性论证(设同方差、\(\boldsymbol\Omega\) 已知、有非零的非对角元)。

GLS:

\[\tilde{\boldsymbol\beta}^{GLS}=\boldsymbol\beta+\left(\frac{\mathbf X'\boldsymbol\Omega^{-1}\mathbf X}{n}\right)^{-1}\frac{\mathbf X'\boldsymbol\Omega^{-1}\mathbf U}{n}.\]
在 GLS 假设 1 下,\(E(\mathbf X'\boldsymbol\Omega^{-1}\mathbf U)=E[\mathbf X'\boldsymbol\Omega^{-1}E(\mathbf U\mid\mathbf X)]=\mathbf 0\);若其方差趋于零且 \(\mathbf X'\boldsymbol\Omega^{-1}\mathbf X/n\xrightarrow{p}\tilde{\mathbf Q}\) 可逆,则一致。关键在于
\[\mathbf X'\boldsymbol\Omega^{-1}\mathbf U=\sum_i\sum_j\mathbf X_i(\boldsymbol\Omega^{-1})_{ij}u_j,\]
它包含不同观测的 \(\mathbf X_i\) 与 \(u_j\) 的乘积。要它均值为零,需要对所有 \((\boldsymbol\Omega^{-1})_{ij}\ne0\) 的 \((i,j)\) 有 \(E(u_j\mid\mathbf X_i)=0\)。AR(1) 误差时 \(\boldsymbol\Omega^{-1}\) 只在 \(|i-j|\le1\) 处非零,只需相邻期的外生性;但一般 \(\boldsymbol\Omega^{-1}\) 的所有元素都可能非零(例如 MA(1) 误差的 \(\boldsymbol\Omega\) 是三对角的,它的逆却是满的),因此一般需要完整的 \(E(\mathbf U\mid\mathbf X)=\mathbf 0\)。

OLS:

\[\hat{\boldsymbol\beta}=\boldsymbol\beta+\left(\frac{\mathbf X'\mathbf X}{n}\right)^{-1}\frac1n\sum_i\mathbf X_iu_i,\]
只含同一观测的 \(\mathbf X_i u_i\),只需 \(E(u_i\mid\mathbf X_i)=0\) 就能使其均值为零。

白话解释:两种估计误差的差别在于「谁和谁相乘」。OLS 的误差项只把第 \(i\) 期的回归元和第 \(i\) 期的误差配对,所以只要求同期不相关。GLS 用 \(\boldsymbol\Omega^{-1}\) 把不同时期混在一起,等于把第 \(i\) 期的回归元和第 \(j\) 期的误差也配了对。准差分就是例子:变换后的回归元 \(\mathbf X_t-\rho\mathbf X_{t-1}\) 和变换后的误差 \(u_t-\rho u_{t-1}\) 相乘,里面有一项 \(\mathbf X_t\,u_{t-1}\),即本期回归元乘上期误差。若上期的冲击会影响本期回归元(反馈),这一项均值就不为零,GLS 就偏了。 一句话:OLS 只怕「同期相关」;GLS 还怕「误差影响未来回归元」,而在金融数据里这种反馈非常普遍。

GLS 的第一假设是否苛刻? 它要求第 \(i\) 个观测的误差与所有其他观测的回归元不相关,这在某些时间序列应用中很可疑。原书的例子是第 16.6 节冷冻橙汁期货价格变化对佛罗里达天气的回归:误差与当期和过去的天气不相关(OLS 假设成立),但很可能与未来的天气相关(GLS 假设不成立),因为今天的期货价格包含了对未来天气的预期。一般现象是:当今天的变量部分基于对未来的预期而定(如资产价格),今天的误差就依赖于对明天回归元的预测,而这个预测与明天回归元的实际值相关。

结论:GLS 的第一假设实际上比 OLS 的第一假设强得多。在某些经济时间序列应用中,GLS 不一致而 OLS 一致。这时宁可用 OLS 加 HAC 标准误,放弃效率换取一致性。本章示例一会用模拟演示这种情况。

原书复习题 19.5 要求构造一个满足 \(E(u_i\mid X_i)=0\) 但 \(E(\mathbf U\mid\mathbf X)\ne\mathbf 0\) 的例子。最简单的是自回归:\(Y_t=\beta Y_{t-1}+u_t\),\(X_t=Y_{t-1}\)。\(u_t\) 与 \(X_t\) 不相关,但 \(u_t\) 进入 \(Y_t=X_{t+1}\),与未来的回归元相关。


19.7 工具变量与广义矩估计(IV 与 GMM)

前提:第 12 章 Key Concept 12.3、12.4 的 IV 回归假设成立,且工具是强工具;本节所有渐近结果都在强工具假设下成立(弱工具问题见第 12 章)。数据是截面 i.i.d.,本节末尾简述时间序列推广。

本节内容:矩阵形式的 IV 模型与 TSLS,及其在异方差下的渐近分布;同方差时,TSLS 在「工具为外生变量线性组合」的 IV 估计量类中渐近有效,J 统计量渐近服从 \(\chi^2\),自由度为过度识别约束的个数;异方差时,有效的 IV 估计量是有效 GMM 估计量(Hansen 1982)。

19.7.1 矩阵形式的 IV 模型

  • \(\mathbf X\):\(n\times(k+r+1)\),关注方程的全部回归元,第 \(i\) 行 \(\mathbf X_i'=(1\ X_{1i}\cdots X_{ki}\ W_{1i}\cdots W_{ri})\)。其中 \(X_1,\dots,X_k\) 是内生变量,\(W_1,\dots,W_r\) 是包含的外生变量(控制变量)。
  • \(\mathbf Z\):\(n\times(m+r+1)\),全部外生变量,即包含的 \(W\) 加上排除的工具 \(Z_1,\dots,Z_m\),第 \(i\) 行 \(\mathbf Z_i'=(1\ Z_{1i}\cdots Z_{mi}\ W_{1i}\cdots W_{ri})\)。
  • 模型:
    \[\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U;\tag{19.45}\]
    工具外生性:
    \[E(\mathbf Z_iu_i)=\mathbf 0.\tag{19.46}\]

识别要求 \(m\ge k\):\(m=k\) 恰好识别,\(m>k\) 过度识别(过度识别约束有 \(m-k\) 个)。

19.7.2 TSLS 估计量

TSLS 用第一阶段的 OLS 拟合值作工具。\(\hat{\mathbf X}\) 的第 \(i\) 行是 \((1\ \hat X_{1i}\cdots\hat X_{ki}\ W_{1i}\cdots W_{ri})\);由于 \(W\) 和常数都在 \(\mathbf Z\) 中,它们对 \(\mathbf Z\) 回归的拟合值就是自身。所以

\[\hat{\mathbf X}=\mathbf P_Z\mathbf X,\qquad\mathbf P_Z=\mathbf Z(\mathbf Z'\mathbf Z)^{-1}\mathbf Z'.\]
第二阶段是 \(\mathbf Y\) 对 \(\hat{\mathbf X}\) 的 OLS:
\[\hat{\boldsymbol\beta}^{TSLS}=(\hat{\mathbf X}'\hat{\mathbf X})^{-1}\hat{\mathbf X}'\mathbf Y=(\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf Y.\tag{19.47–19.48}\]
(第二个等号用了 \(\mathbf P_Z\) 对称幂等:\(\hat{\mathbf X}'\hat{\mathbf X}=\mathbf X'\mathbf P_Z'\mathbf P_Z\mathbf X=\mathbf X'\mathbf P_Z\mathbf X\)。)

白话解释:\(\mathbf P_Z\mathbf X\) 把每个回归元拆成两块:能被工具(外生变量)解释的部分,以及剩下可能和误差纠缠的部分。TSLS 只用第一块去回归,相当于只保留回归元中「干净」的变动。分子 \(\hat{\mathbf X}'\mathbf Y=\mathbf X'\mathbf P_Z\mathbf Y\) 也可以理解成:\(\mathbf Y\) 被投影到工具空间以后再与 \(\mathbf X\) 配对,因为 \(\mathbf P_Z\) 对称幂等,投影放在哪一边结果都一样。 外生控制变量 \(\mathbf W\) 和常数「对 \(\mathbf Z\) 回归的拟合值就是自身」,因为它们本身就是 \(\mathbf Z\) 的列,\(\mathbf P_Z\) 作用在 \(\mathbf Z\) 的列上不改变它们(19a 章的 \(\mathbf P_X\mathbf X=\mathbf X\))。

19.7.3 TSLS 的渐近分布

代入 \(\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U\) 并展开 \(\mathbf P_Z\):

\[\sqrt n(\hat{\boldsymbol\beta}^{TSLS}-\boldsymbol\beta)=\left[\frac{\mathbf X'\mathbf Z}{n}\left(\frac{\mathbf Z'\mathbf Z}{n}\right)^{-1}\frac{\mathbf Z'\mathbf X}{n}\right]^{-1}\left[\frac{\mathbf X'\mathbf Z}{n}\left(\frac{\mathbf Z'\mathbf Z}{n}\right)^{-1}\frac{\mathbf Z'\mathbf U}{\sqrt n}\right].\tag{19.49}\]
IV 假设下,\(\mathbf X'\mathbf Z/n\xrightarrow{p}\mathbf Q_{XZ}=E(\mathbf X_i\mathbf Z_i')\),\(\mathbf Z'\mathbf Z/n\xrightarrow{p}\mathbf Q_{ZZ}=E(\mathbf Z_i\mathbf Z_i')\);\(\mathbf Z_iu_i\) i.i.d.、均值为零、协方差正定,由多元 CLT,
\[\frac{\mathbf Z'\mathbf U}{\sqrt n}\xrightarrow{d}\boldsymbol\Psi_{ZU}\sim N(\mathbf 0,\mathbf H),\qquad\mathbf H=E(\mathbf Z_i\mathbf Z_i'u_i^2).\tag{19.50}\]
于是
\[\sqrt n(\hat{\boldsymbol\beta}^{TSLS}-\boldsymbol\beta)\xrightarrow{d}N(\mathbf 0,\boldsymbol\Sigma^{TSLS}),\tag{19.51}\]
\[\boldsymbol\Sigma^{TSLS}=(\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf H\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX}(\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX})^{-1}.\tag{19.52}\]
结构与 OLS 的三明治 (19.12) 完全平行,「肉」是 \(\mathbf H\)。

推导拆解:(19.49) 的来源。 第一步,与 19a 章 (19.14) 同理,代入 \(\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U\),\((\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf X=\mathbf I\),得 \(\hat{\boldsymbol\beta}^{TSLS}-\boldsymbol\beta=(\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf U\)。 第二步,展开 \(\mathbf P_Z=\mathbf Z(\mathbf Z'\mathbf Z)^{-1}\mathbf Z'\),于是 \(\mathbf X'\mathbf P_Z\mathbf X=(\mathbf X'\mathbf Z)(\mathbf Z'\mathbf Z)^{-1}(\mathbf Z'\mathbf X)\)。 第三步,在每个样本矩上配 \(1/n\),使它们各自收敛:前面的逆矩阵里共有「\(n\cdot n^{-1}\cdot n\)」\(=n\),所以 \(\mathbf X'\mathbf P_Z\mathbf X=n[\frac{\mathbf X'\mathbf Z}n(\frac{\mathbf Z'\mathbf Z}n)^{-1}\frac{\mathbf Z'\mathbf X}n]\);后面同理 \(\mathbf X'\mathbf P_Z\mathbf U=n[\frac{\mathbf X'\mathbf Z}n(\frac{\mathbf Z'\mathbf Z}n)^{-1}\frac{\mathbf Z'\mathbf U}n]\)。两者相除 \(n\) 抵消,再乘 \(\sqrt n\),把最后的 \(\frac{\mathbf Z'\mathbf U}{n}\) 变成 \(\frac{\mathbf Z'\mathbf U}{\sqrt n}\)。 第四步,除了 \(\mathbf Z'\mathbf U/\sqrt n\)(用 CLT),其余都是用 LLN 收敛到常数的样本矩,由 Slutsky 拼起来。和 OLS 相比,只是 OLS 中的 \(\mathbf X\) 被「\(\mathbf X\) 在 \(\mathbf Z\) 上的投影」替代。

TSLS 标准误。用样本矩替换总体矩得 \(\hat{\boldsymbol\Sigma}^{TSLS}\)(式 19.53),其中 \(\hat{\mathbf Q}_{XZ}=\mathbf X'\mathbf Z/n\) 等,

\[\hat{\mathbf H}=\frac1n\sum_{i=1}^n\mathbf Z_i\mathbf Z_i'\hat u_i^2,\qquad\hat{\mathbf U}=\mathbf Y-\mathbf X\hat{\boldsymbol\beta}^{TSLS}.\tag{19.54}\]
注意残差用原始的 \(\mathbf X\) 计算,而不是 \(\hat{\mathbf X}\)。手工做两阶段回归时,第二阶段软件输出的残差是 \(\mathbf Y-\hat{\mathbf X}\hat{\boldsymbol\beta}\),用它算出的标准误是错的。标准误是 \(\hat{\boldsymbol\Sigma}^{TSLS}/n\) 对角元的平方根。

19.7.4 同方差时 TSLS 的性质

同方差时,TSLS 在「以 \(\mathbf Z\) 的行的线性组合为工具」的 IV 估计量类中渐近有效。这是高斯–马尔可夫定理的 IV 版本,是使用 TSLS 的重要理由。

同方差下的分布。\(E(u_i^2\mid\mathbf Z_i)=\sigma_u^2\) ⇒ \(\mathbf H=E[\mathbf Z_i\mathbf Z_i'E(u_i^2\mid\mathbf Z_i)]=\sigma_u^2\mathbf Q_{ZZ}\),三明治塌缩:

\[\boldsymbol\Sigma^{TSLS}=(\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX})^{-1}\sigma_u^2.\tag{19.55}\]
仅同方差的估计为 \(\tilde{\boldsymbol\Sigma}^{TSLS}=(\hat{\mathbf Q}_{XZ}\hat{\mathbf Q}_{ZZ}^{-1}\hat{\mathbf Q}_{ZX})^{-1}\hat\sigma_u^2\),\(\hat\sigma_u^2=\hat{\mathbf U}'\hat{\mathbf U}/(n-k-r-1)\)。(19.56)

IV 估计量族:以 \(\mathbf Z\) 的线性组合为工具。共同起点是矩方程:工具外生意味着在真值处

\[E[(\mathbf Y-\mathbf X\boldsymbol\beta)'\mathbf Z]=\mathbf 0.\tag{19.57}\]
这是 \(m+r+1\) 个方程、\(k+r+1\) 个未知数。恰好识别(\(m=k\))时,样本版本 \((\mathbf Y-\mathbf X\mathbf b)'\mathbf Z=\mathbf 0\) 有唯一解,即 IV 估计量 \((\mathbf Z'\mathbf X)^{-1}\mathbf Z'\mathbf Y\);过度识别(\(m>k\))时,由于抽样波动,方程多于未知数,一般无解。有两种等价的折中方式。

方式一:最小化二次型。给定 \((m+r+1)\) 阶对称半正定权重矩阵 \(\mathbf A\),

\[\min_{\mathbf b}\ (\mathbf Y-\mathbf X\mathbf b)'\mathbf Z\mathbf A\mathbf Z'(\mathbf Y-\mathbf X\mathbf b),\tag{19.58}\]
\[\hat{\boldsymbol\beta}^{IV}_A=(\mathbf X'\mathbf Z\mathbf A\mathbf Z'\mathbf X)^{-1}\mathbf X'\mathbf Z\mathbf A\mathbf Z'\mathbf Y.\tag{19.59}\]
与 (19.48) 比较可见,TSLS 是 \(\mathbf A=(\mathbf Z'\mathbf Z)^{-1}\) 的特例。其渐近分布为
\[\sqrt n(\hat{\boldsymbol\beta}^{IV}_A-\boldsymbol\beta)\xrightarrow{d}N(\mathbf 0,\boldsymbol\Sigma^{IV}_A),\quad\boldsymbol\Sigma^{IV}_A=(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\mathbf A\mathbf H\mathbf A\mathbf Q_{ZX}(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}.\tag{19.60}\]

推导拆解:(19.59) 怎么从 (19.58) 求出来。记 \(\mathbf g(\mathbf b)=\mathbf Z'(\mathbf Y-\mathbf X\mathbf b)\),它是 \(m+r+1\) 个样本矩(的 \(n\) 倍)。目标函数是 \(\mathbf g'\mathbf A\mathbf g\)。 第一步,用导读里的求导规则(这里 \(\mathbf a=\mathbf Z'\mathbf Y\),\(\mathbf C=\mathbf Z'\mathbf X\),\(\mathbf W=\mathbf A\)):梯度为 \(-2\mathbf X'\mathbf Z\mathbf A\mathbf Z'(\mathbf Y-\mathbf X\mathbf b)\)。 第二步,令其为零:\(\mathbf X'\mathbf Z\mathbf A\mathbf Z'\mathbf X\,\mathbf b=\mathbf X'\mathbf Z\mathbf A\mathbf Z'\mathbf Y\),左乘逆即得 (19.59)。 第三步,代入 \(\mathbf A=(\mathbf Z'\mathbf Z)^{-1}\),\(\mathbf Z\mathbf A\mathbf Z'=\mathbf P_Z\),就回到 (19.48)。 白话解释:\(\mathbf A\) 决定「哪个矩条件更重要」。矩条件比参数多时不可能都精确为零,只能折中;\(\mathbf A\) 就是折中时的「权重表」,好比最小二乘用单位权重,WLS 用方差倒数。不同的 \(\mathbf A\) 都给出一致估计,只是精度不同,这就引出「哪个 \(\mathbf A\) 最好」的问题。

方式二:选择工具的线性组合。工具取 \(\mathbf Z\mathbf B\),\(\mathbf B\) 是 \((m+r+1)\times(k+r+1)\) 的列满秩矩阵,恰好识别地解 \((\mathbf Y-\mathbf X\mathbf b)'\mathbf Z\mathbf B=\mathbf 0\),得 \(\hat{\boldsymbol\beta}^{IV}=(\mathbf B'\mathbf Z'\mathbf X)^{-1}\mathbf B'\mathbf Z'\mathbf Y\)。代入 \(\mathbf B=\mathbf A\mathbf Z'\mathbf X\) 就得到 (19.59)。两种方式生成同一族估计量,惯例用方式一。

同方差下 TSLS 的渐近有效性。\(\mathbf H=\mathbf Q_{ZZ}\sigma_u^2\) 时,

\[\boldsymbol\Sigma^{IV}_A=(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZZ}\mathbf A\mathbf Q_{ZX}(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\sigma_u^2.\tag{19.61}\]
需要证明对所有半正定 \(\mathbf A\) 和所有 \(\mathbf c\),
\[\mathbf c'\boldsymbol\Sigma^{IV}_A\mathbf c\ge\mathbf c'\boldsymbol\Sigma^{TSLS}\mathbf c,\tag{19.62}\]
这是与多元高斯–马尔可夫定理相同的效率标准。证明见本章末附录 19.6。

19.7.5 同方差下的 J 统计量

J 统计量(Key Concept 12.6)检验全部过度识别约束是否成立。思想:约束成立时 \(u_i\) 与所有工具不相关,\(\mathbf U\) 对 \(\mathbf Z\) 回归的总体系数全为零。用 TSLS 残差 \(\hat{\mathbf U}\) 代替 \(\mathbf U\),J 是「\(\hat{\mathbf U}\) 对 \(\mathbf Z\) 回归中 \(\mathbf Z\) 的系数全为零」的仅同方差 F 统计量乘以 \((m+r+1)\),转成渐近卡方形式。

由第 7 章的 (7.13):无约束回归的 \(SSR=\hat{\mathbf U}'\mathbf M_Z\hat{\mathbf U}\),约束回归(无回归元)的 \(SSR=\hat{\mathbf U}'\hat{\mathbf U}\),差为 \(\hat{\mathbf U}'\mathbf P_Z\hat{\mathbf U}\),所以

\[J=\frac{\hat{\mathbf U}'\mathbf P_Z\hat{\mathbf U}}{\hat{\mathbf U}'\mathbf M_Z\hat{\mathbf U}/(n-m-r-1)}.\tag{19.63}\]
Key Concept 12.6 的算法只检验排除工具的系数为零,步骤不同但 J 值相同(习题 19.14)。原假设 \(E(u_i\mathbf Z_i)=\mathbf 0\) 下,
\[J\xrightarrow{d}\chi^2_{m-k}.\tag{19.64}\]
自由度是 \(m-k\) 而非 \(m+r+1\):估计 \(k+r+1\) 个系数「用掉」了同样多个矩条件,只剩 \(m-k\) 个可以检验。恰好识别时 \(J\equiv0\),无从检验。

金融直觉:J 检验的逻辑和「用多个资产检验 CAPM」一样。如果只有一个资产、一个参数,总能把参数调到让定价误差为零,模型永远「通过」,毫无检验力。资产(矩条件)比参数多时,参数无法同时迁就所有资产,剩下的定价误差若显著不为零,就是模型的证据不足。有 \(m+r+1\) 个矩条件、\(k+r+1\) 个参数,就有 \(m-k\) 个「多余」的方向可以拿来检验。 但 J 检验有一个盲点:它检验的是「矩条件之间是否一致」。如果所有工具都以同样方式违反外生性,它们之间仍然互相一致,J 检验可能发现不了。因此 J 不拒绝不能证明工具有效。

19.7.6 线性模型中的 GMM

异方差时,TSLS 不再是上述族中最有效的,最有效的是有效 GMM 估计量;而且 (19.63) 的 J 不再服从卡方,要用有效 GMM 构造的 J 才服从 \(\chi^2_{m-k}\)。这与「外生回归元 + 异方差」的情形完全平行:那里 OLS 不是 BLUE,仅同方差 F 即使在大样本也不服从 F,有效估计量是 WLS;IV 情形下,有效估计量是使用不同于 TSLS 的权重矩阵的有效 GMM。

GMM 的定义。广义矩方法(generalized method of moments)是估计线性或非线性模型参数的一般方法:选择参数,使多个「样本矩 = 0」的方程(称为矩条件,moment conditions)拟合得最好。这些方程一般不能同时满足,GMM 通过最小化二次目标函数折中。在线性 IV 模型中,GMM 估计量类就是 (19.58) 所有解的集合,也就是「以 \(\mathbf Z\) 线性组合为工具」的 IV 估计量类。GMM 只是这一族估计量的另一个名字。

渐近有效 GMM:族中渐近协方差矩阵最小者(按 (19.62) 的标准)。所以 (19.62) 可以重述为:同方差时,TSLS 就是线性模型的有效 GMM 估计量。

动机:同方差时 \(\mathbf H=\mathbf Q_{ZZ}\sigma_u^2\),大样本中 \(\mathbf A=(\mathbf Z'\mathbf Z)^{-1}\) 与 \(\mathbf A=(\mathbf Q_{ZZ}\sigma_u^2)^{-1}=\mathbf H^{-1}\) 只差一个标量倍数(标量不影响 (19.59) 的解)。类推到异方差,取 \(\mathbf A=\mathbf H^{-1}\):

\[\min_{\mathbf b}\ (\mathbf Y-\mathbf X\mathbf b)'\mathbf Z\mathbf H^{-1}\mathbf Z'(\mathbf Y-\mathbf X\mathbf b),\tag{19.65}\]
\[\tilde{\boldsymbol\beta}^{Eff.GMM}=(\mathbf X'\mathbf Z\mathbf H^{-1}\mathbf Z'\mathbf X)^{-1}\mathbf X'\mathbf Z\mathbf H^{-1}\mathbf Z'\mathbf Y,\tag{19.66}\]
\[\sqrt n(\tilde{\boldsymbol\beta}^{Eff.GMM}-\boldsymbol\beta)\xrightarrow{d}N(\mathbf 0,\boldsymbol\Sigma^{Eff.GMM}),\qquad\boldsymbol\Sigma^{Eff.GMM}=(\mathbf Q_{XZ}\mathbf H^{-1}\mathbf Q_{ZX})^{-1}.\tag{19.67}\]
把 \(\mathbf A=\mathbf H^{-1}\) 代入 (19.60) 可以看到三明治的「肉」与「面包」相消,只剩 \((\mathbf Q_{XZ}\mathbf H^{-1}\mathbf Q_{ZX})^{-1}\)。有效性:对所有 \(\mathbf c\),\(\mathbf c'\boldsymbol\Sigma^{IV}_A\mathbf c\ge\mathbf c'\boldsymbol\Sigma^{Eff.GMM}\mathbf c\)(附录 19.6)。

直觉:权重 \(\mathbf H^{-1}\) 给噪声大(\(E(Z_{ji}^2u_i^2)\) 大)的矩条件较小的权重,给彼此相关的矩条件去重,与 GLS 用 \(\boldsymbol\Omega^{-1}\) 加权是同一个思想。

推导拆解:「肉与面包相消」具体怎么消。把 \(\mathbf A=\mathbf H^{-1}\) 代入 (19.60),记 \(\mathbf G=\mathbf Q_{XZ}\mathbf H^{-1}\mathbf Q_{ZX}\): 中间部分 \(\mathbf Q_{XZ}\mathbf A\mathbf H\mathbf A\mathbf Q_{ZX}=\mathbf Q_{XZ}\mathbf H^{-1}\mathbf H\mathbf H^{-1}\mathbf Q_{ZX}=\mathbf Q_{XZ}\mathbf H^{-1}\mathbf Q_{ZX}=\mathbf G\); 两边的「面包」都是 \(\mathbf G^{-1}\),所以 \(\boldsymbol\Sigma=\mathbf G^{-1}\mathbf G\mathbf G^{-1}=\mathbf G^{-1}\)。 这与 GLS 相同:用协方差的逆作权重时,三明治总会塌缩成一层,这正是「权重选对了」的标志。 金融直觉:\(\mathbf H\) 是各矩条件(各资产定价误差)的协方差矩阵,\(\mathbf H^{-1}\) 作权重和求切点组合时用 \(\boldsymbol\Sigma^{-1}\) 一样:噪声大的方向少看,噪声小的方向多看。量化实战中提到「有效 GMM 的经济含义不直观」,原因也在这里:它可能把权重压在某个精确但不重要的资产组合上。

可行有效 GMM(两步法)。(19.66) 依赖未知的 \(\mathbf H\),不可行。

  1. 第一步:用任一一致估计量(自然的选择是 TSLS)估计 \(\boldsymbol\beta\),计算关注方程的残差,用 (19.54) 构造 \(\hat{\mathbf H}\);
  2. 第二步:用 \(\hat{\mathbf H}^{-1}\) 作权重矩阵,
    \[\hat{\boldsymbol\beta}^{Eff.GMM}=(\mathbf X'\mathbf Z\hat{\mathbf H}^{-1}\mathbf Z'\mathbf X)^{-1}\mathbf X'\mathbf Z\hat{\mathbf H}^{-1}\mathbf Z'\mathbf Y.\tag{19.68}\]

由于 \(\hat{\mathbf H}\xrightarrow{p}\mathbf H\),\(\sqrt n(\hat{\boldsymbol\beta}^{Eff.GMM}-\tilde{\boldsymbol\beta}^{Eff.GMM})\xrightarrow{p}\mathbf 0\)(习题 19.12),所以

\[\sqrt n(\hat{\boldsymbol\beta}^{Eff.GMM}-\boldsymbol\beta)\xrightarrow{d}N(\mathbf 0,\boldsymbol\Sigma^{Eff.GMM}),\tag{19.69}\]
两步可行估计量是渐近有效的。实践中也可以迭代多步(迭代 GMM),或在优化中同时更新权重(连续更新 GMM),它们渐近等价,有限样本表现有差别。

异方差稳健 J 统计量(GMM J 统计量):

\[J^{GMM}=(\mathbf Z'\hat{\mathbf U}^{GMM})'\hat{\mathbf H}^{-1}(\mathbf Z'\hat{\mathbf U}^{GMM})/n,\tag{19.70}\]
其中 \(\hat{\mathbf U}^{GMM}=\mathbf Y-\mathbf X\hat{\boldsymbol\beta}^{Eff.GMM}\),\(\hat{\mathbf H}^{-1}\) 是计算有效 GMM 时用的权重。原假设 \(E(\mathbf Z_iu_i)=\mathbf 0\) 下,\(J^{GMM}\xrightarrow{d}\chi^2_{m-k}\)。它就是 GMM 目标函数在最优点的值乘以 \(n\):如果所有矩条件都正确,最优点处的样本矩应该足够接近零。

19.7.7 时间序列数据中的 GMM

(形式化处理见 Hayashi 2000 第 6 章;假设变量平稳。)分两类情形:

情形一:误差 \(u_t\) 序列相关。GMM 估计量仍渐近正态,但 (19.50) 中 \(\mathbf H\) 的公式不再正确:正确的 \(\mathbf H\) 是 \(\mathbf Z_tu_t\) 的长期方差,依赖它的自协方差(类比第 16 章式 16.14 中序列相关下 OLS 的方差)。有效 GMM 仍用 \(\mathbf H\) 的一致估计构造,但必须用 HAC 方法(如 Newey–West)估计。

情形二:\(\mathbf Z_tu_t\) 序列不相关。无需 HAC,本节公式全部可以推广。这在现代金融与宏观计量中很常见:误差代表未预期、不可预测的扰动,模型本身通常意味着 \(\mathbf Z_tu_t\) 序列不相关。例如 \(Y_t=\beta_0+\beta_1X_t+u_t\)(一个内生变量、无外生变量),若理论意味着 \(u_t\) 在给定过去信息时不可预测,则有矩条件

\[E(u_t\mid Y_{t-1},X_{t-1},Z_{t-1},Y_{t-2},X_{t-2},Z_{t-2},\dots)=0.\tag{19.71}\]
所有滞后变量都是有效工具的候选(满足外生性)。又因为 \(u_{t-1}=Y_{t-1}-\beta_0-\beta_1X_{t-1}\) 是过去信息的函数,(19.71) 等价于 \(E(u_t\mid u_{t-1},X_{t-1},Z_{t-1},\dots)=0\),于是 \(u_t\) 是鞅差分序列,与自己的过去不相关,无需 HAC。只要 (19.71) 正确,本节的有效 GMM 和 GMM J 统计量可以直接使用。

这正是 Hansen 用 GMM 检验资产定价欧拉方程的框架。消费资本资产定价模型的欧拉方程是

\[E_t\left[\delta\left(\frac{C_{t+1}}{C_t}\right)^{-\gamma}R_{i,t+1}-1\right]=0,\]
括号内的「定价误差」在给定 \(t\) 期信息时均值为零,乘以任何 \(t\) 期已知的变量 \(z_t\) 后取期望也为零:\(E[(\delta(C_{t+1}/C_t)^{-\gamma}R_{i,t+1}-1)z_t]=0\)。这就是 (19.71) 型的矩条件(只是关于参数 \(\delta,\gamma\) 非线性),滞后变量作工具,J 检验检验模型的整体设定。参见 17d 章的诺贝尔奖专栏。

白话解释:记号 \(E_t[\cdot]\) 是「给定 \(t\) 期所有已知信息的条件期望」。欧拉方程里 \(\delta(C_{t+1}/C_t)^{-\gamma}\) 就是随机贴现因子 \(m_{t+1}\):\(\delta\) 是时间偏好(耐心程度),\(\gamma\) 是相对风险厌恶系数。方程 \(E_t[m_{t+1}R_{t+1}]=1\) 说的是「今天花 1 元买资产,明天收益用边际效用折回今天,平均仍值 1 元」,与 CFA 里「价格 = 未来现金流的风险调整贴现」是同一句话。 推导拆解:从条件矩到无条件矩,用的是迭代期望。设 \(e_{t+1}\) 为定价误差,\(E_t(e_{t+1})=0\),\(z_t\) 在 \(t\) 期已知,则 \(E(e_{t+1}z_t)=E[z_tE_t(e_{t+1})]=E[z_t\cdot0]=0\)。任何 \(t\) 期已知的变量(股息率、利差、上期消费增长)都能生成一个矩条件,所以矩条件可以远多于参数,GMM 和 J 检验正好派上用场。


附录 19.6 IV 与 GMM 若干结果的证明

同方差下 TSLS 的有效性 (19.62)。利用 \((\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX}=\mathbf I\),把 \(\boldsymbol\Sigma^{TSLS}\) 写成与 \(\boldsymbol\Sigma^{IV}_A\) 相同的「外壳」:

\[\boldsymbol\Sigma^{IV}_A-\boldsymbol\Sigma^{TSLS}=(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\mathbf A\left[\mathbf Q_{ZZ}-\mathbf Q_{ZX}(\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\right]\mathbf A\mathbf Q_{ZX}(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\sigma_u^2.\tag{19.85}\]
取 \(\mathbf F\) 为 \(\mathbf Q_{ZZ}\) 的矩阵平方根(\(\mathbf Q_{ZZ}=\mathbf F'\mathbf F\),\(\mathbf Q_{ZZ}^{-1}=\mathbf F^{-1}\mathbf F^{-1\prime}\)),方括号可写成 \(\mathbf F'[\mathbf I-\mathbf D(\mathbf D'\mathbf D)^{-1}\mathbf D']\mathbf F\),其中 \(\mathbf D=\mathbf F^{-1\prime}\mathbf Q_{ZX}\)(式 19.86)。于是
\[\mathbf c'(\boldsymbol\Sigma^{IV}_A-\boldsymbol\Sigma^{TSLS})\mathbf c=\mathbf d'[\mathbf I-\mathbf D(\mathbf D'\mathbf D)^{-1}\mathbf D']\mathbf d\,\sigma_u^2,\tag{19.87}\]
\(\mathbf d=\mathbf F\mathbf A\mathbf Q_{ZX}(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\mathbf c\)。\(\mathbf I-\mathbf D(\mathbf D'\mathbf D)^{-1}\mathbf D'\) 是一个「\(\mathbf M\) 型」投影矩阵,对称幂等,特征值为 0 或 1,二次型非负。证毕。

这与附录 19.5 的高斯–马尔可夫证明如出一辙:差值是某个正交投影的二次型。

同方差下 J 统计量的渐近分布。TSLS 残差

\[\hat{\mathbf U}=\mathbf Y-\mathbf X\hat{\boldsymbol\beta}^{TSLS}=[\mathbf I-\mathbf X(\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z]\mathbf U,\tag{19.88}\]
\[\hat{\mathbf U}'\mathbf P_Z\hat{\mathbf U}=\mathbf U'[\mathbf P_Z-\mathbf P_Z\mathbf X(\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z]\mathbf U.\tag{19.89}\]
写 \(\mathbf P_Z=\mathbf B\mathbf B'\),\(\mathbf B=\mathbf Z(\mathbf Z'\mathbf Z)^{-1/2}\),则
\[\hat{\mathbf U}'\mathbf P_Z\hat{\mathbf U}=\mathbf U'\mathbf B\mathbf M_{B'X}\mathbf B'\mathbf U,\qquad\mathbf M_{B'X}=\mathbf I-\mathbf B'\mathbf X(\mathbf X'\mathbf B\mathbf B'\mathbf X)^{-1}\mathbf X'\mathbf B.\tag{19.90}\]
原假设下 \(\mathbf Z'\mathbf U/\sqrt n\xrightarrow{d}N(\mathbf 0,\mathbf Q_{ZZ}\sigma_u^2)\),所以 \(\mathbf B'\mathbf U=(\mathbf Z'\mathbf Z/n)^{-1/2}\mathbf Z'\mathbf U/\sqrt n\xrightarrow{d}\sigma_u\mathbf z\),\(\mathbf z\sim N(\mathbf 0,\mathbf I_{m+r+1})\);同时 \(\mathbf M_{B'X}\xrightarrow{p}\mathbf M_{Q_{ZZ}^{-1/2}Q_{ZX}}\)。于是 \(\hat{\mathbf U}'\mathbf P_Z\hat{\mathbf U}\xrightarrow{d}(\mathbf z'\mathbf M\mathbf z)\sigma_u^2\)(19.91);分母 \(\hat{\mathbf U}'\mathbf M_Z\hat{\mathbf U}/(n-m-r-1)\xrightarrow{p}\sigma_u^2\)(19.92);故 \(J\xrightarrow{d}\mathbf z'\mathbf M\mathbf z\)(19.93)。\(\mathbf M\) 对称幂等,秩 \(=(m+r+1)-(k+r+1)=m-k\),由 (19.78),\(J\xrightarrow{d}\chi^2_{m-k}\)。

有效 GMM 的有效性:证明与 TSLS 平行,只是把 \(\mathbf Q_{ZZ}\sigma_u^2\) 换成 \(\mathbf H\)。GMM J 统计量的分布:与同方差 TSLS 的 J 平行,把 \(\mathbf Q_{ZZ}\sigma_u^2\) 换成 \(\mathbf H\) 即可。


第 19 章总结(原书 Summary,含 19a 章)

  1. 线性多元回归的矩阵形式为 \(\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U\)。
  2. OLS 估计量为 \(\hat{\boldsymbol\beta}=(\mathbf X'\mathbf X)^{-1}\mathbf X'\mathbf Y\);前四条假设下一致、渐近正态;同方差时 \(\mathrm{var}(\hat{\boldsymbol\beta}\mid\mathbf X)=\sigma_u^2(\mathbf X'\mathbf X)^{-1}\)。
  3. 一般线性约束写成 \(\mathbf R\boldsymbol\beta=\mathbf r\),可用于联合检验和置信集。
  4. 误差条件 i.i.d. 正态时,\(\hat{\boldsymbol\beta}\) 精确正态,仅同方差 t、F 统计量精确服从 \(t_{n-k-1}\)、\(F_{q,n-k-1}\)。
  5. 高斯–马尔可夫定理:误差同方差、条件不相关、\(E(u_i\mid\mathbf X)=0\) 时,OLS 是 BLUE。
  6. 误差协方差 \(\boldsymbol\Omega\) 不正比于单位阵且已知或可估时,GLS 渐近比 OLS 有效;但 GLS 一般要求 \(u_i\) 与所有观测的回归元不相关(OLS 只要求与 \(\mathbf X_i\) 不相关),应用中须审慎评估。
  7. TSLS 属于线性模型的 GMM 估计量族,解 \(\min_{\mathbf b}[(\mathbf Y-\mathbf X\mathbf b)'\mathbf Z]\mathbf A[\mathbf Z'(\mathbf Y-\mathbf X\mathbf b)]\);渐近有效 GMM 取 \(\mathbf A=[E(\mathbf Z_i\mathbf Z_i'u_i^2)]^{-1}\);同方差时它就是 TSLS。

量化实战

1. 本章内容在量化中的用途

GLS 与横截面检验。 资产收益横截面回归中,残差协方差非对角(行业、风格相关)。GLS 用残差协方差的逆加权,这与均值–方差组合优化 \(\mathbf w\propto\boldsymbol\Sigma^{-1}\boldsymbol\mu\) 的结构完全相同:GLS 斜率本质上是一个最小方差的「因子模拟组合」的收益。时间序列因子模型的 GRS 检验、横截面 GLS 回归都依赖这一框架。实务中 \(\boldsymbol\Omega\) 维数很高(几千只股票),要用因子结构 \(\mathbf B\boldsymbol\Sigma_F\mathbf B'+\mathbf D\) 来估计(17d 章),否则 \(\hat{\boldsymbol\Omega}^{-1}\) 噪声极大。

GLS 的严格外生警示。 用价格、利率、估值这类「预期驱动」的变量做回归元时,误差往往与未来回归元相关。此时 Cochrane–Orcutt、Prais–Winsten 等 GLS 修正可能不一致。原书的结论在量化中同样适用:宁可 OLS + HAC。

IV 在量化中的位置。 量化研究较少直接做因果 IV,但几个场景常见:解决变量误差(errors-in-variables,如 Fama–MacBeth 第二阶段用估计的 beta,可以用不同窗口估计的 beta 作工具);处理同时性(交易量与波动、订单流与价格冲击);估计市场冲击模型时以外生的指数调整、基金被动流入作工具。

GMM 是资产定价的标准估计方法。 随机贴现因子模型 \(E[m_{t+1}R^e_{i,t+1}]=0\) 是矩条件;线性 SDF \(m=1-\mathbf b'\mathbf f\) 下这些矩条件关于 \(\mathbf b\) 是线性的,可以直接套用本章的线性 GMM 公式。J 检验就是模型整体检验(各资产定价误差联合为零);两步有效 GMM、权重矩阵的选择、误差序列相关时用 HAC 估计 \(\mathbf H\),都直接用于因子模型定价检验和期限结构模型估计。一个实务细节:有效 GMM 的权重 \(\hat{\mathbf H}^{-1}\) 会把精力放在「容易定价的组合线性组合」上,经济含义不直观,所以许多研究同时报告单位权重(一步 GMM)的结果。

2. 示例一:GLS 何时比 OLS 好,何时不一致

误差为 MA(1):\(u_t=e_t+0.8e_{t-1}\),\(\boldsymbol\Omega\) 已知(三对角)。情形一,回归元严格外生;情形二,回归元对过去冲击有反馈:\(x_t\) 含 \(e_{t-1}\),并减去 \(\theta e_t\) 使它与当期 \(u_t\) 不相关(OLS 假设成立),但 \(x_{t+1}\) 含 \(e_t\),所以 \(u_t\) 与未来回归元相关。

import numpy as np
rng = np.random.default_rng(23)
T, nsim, beta, theta = 300, 2000, 1.0, 0.8

# 误差 u_t = e_t + theta*e_{t-1}(MA(1)),其协方差矩阵 Omega 已知:三对角
Omega = np.diag(np.full(T, 1 + theta**2)) + np.diag(np.full(T-1, theta), 1) + np.diag(np.full(T-1, theta), -1)
Oinv = np.linalg.inv(Omega)

def ols(X, y):
    return np.linalg.solve(X.T @ X, X.T @ y)
def gls(X, y):
    return np.linalg.solve(X.T @ Oinv @ X, X.T @ Oinv @ y)   # (X'Ω^{-1}X)^{-1} X'Ω^{-1}Y

for gamma, label in [(0.0, "严格外生 (gamma=0)"), (0.8, "x 对过去冲击有反馈 (gamma=0.8)")]:
    bo, bg = [], []
    for _ in range(nsim):
        e = rng.standard_normal(T + 1)
        u = e[1:] + theta * e[:-1]
        # x_t = z_t + gamma*e_{t-1} - gamma*theta*e_t :与当期 u_t 不相关(OLS 假设成立),
        # 但 x_{t+1} 含 e_t,因而与 u_t 相关(GLS 需要的严格外生不成立)
        x = rng.standard_normal(T) + gamma * e[:-1] - gamma * theta * e[1:]
        X = np.c_[np.ones(T), x]
        y = X @ np.array([0.5, beta]) + u
        bo.append(ols(X, y)[1]); bg.append(gls(X, y)[1])
    print(f"{label:28s} OLS: 均值 {np.mean(bo):.3f}, sd {np.std(bo):.3f} | "
          f"GLS: 均值 {np.mean(bg):.3f}, sd {np.std(bg):.3f}")

输出:

严格外生 (gamma=0)               OLS: 均值 0.997, sd 0.075 | GLS: 均值 1.000, sd 0.036
x 对过去冲击有反馈 (gamma=0.8)       OLS: 均值 1.000, sd 0.038 | GLS: 均值 0.920, sd 0.013

严格外生时,两者都无偏,GLS 的标准差只有 OLS 的一半,效率优势明显。回归元对过去冲击有反馈时,OLS 依然无偏(只需当期外生);GLS 却系统性偏到 0.92,而且标准差很小(0.013),也就是说它会「很自信地给出错误答案」。验证 \(\mathrm{cov}(x_t,u_t)=\gamma\theta-\gamma\theta=0\) 而 \(\mathrm{cov}(x_{t+1},u_t)=\gamma\ne0\),正是 19.6.5 节描述的情形。

3. 示例二:TSLS、两步有效 GMM 与 J 检验

一个内生回归元、三个工具(过度识别 2 个),误差方差依赖第一个工具(异方差)。比较 TSLS 与有效 GMM 的抽样标准差,并检验 J 统计量在工具有效和存在一个无效工具时的拒绝率。

import numpy as np
from scipy import stats
rng = np.random.default_rng(31)

def tsls_gmm(Y, X, Z):
    n = len(Y)
    PZ_X = Z @ np.linalg.solve(Z.T @ Z, Z.T @ X)            # Xhat = P_Z X
    b_tsls = np.linalg.solve(PZ_X.T @ X, PZ_X.T @ Y)        # (X'P_Z X)^{-1} X'P_Z Y
    u = Y - X @ b_tsls                                       # 注意用原始 X 计算残差
    H = (Z * u[:, None] ** 2).T @ Z / n                     # H_hat = (1/n) sum Z_i Z_i' u_i^2
    Hi = np.linalg.inv(H)
    A = X.T @ Z @ Hi @ Z.T
    b_gmm = np.linalg.solve(A @ X, A @ Y)                    # 两步有效 GMM (19.68)
    # 稳健方差:TSLS 用三明治 (19.52),GMM 用 (Q_XZ H^-1 Q_ZX)^-1
    Qxz, Qzz = X.T @ Z / n, Z.T @ Z / n
    B = np.linalg.inv(Qxz @ np.linalg.solve(Qzz, Qxz.T))
    S_tsls = B @ Qxz @ np.linalg.solve(Qzz, H) @ np.linalg.solve(Qzz, Qxz.T) @ B
    S_gmm = np.linalg.inv(Qxz @ Hi @ Qxz.T)
    ug = Y - X @ b_gmm
    g = Z.T @ ug
    J = g @ Hi @ g / n                                       # GMM J (19.70)
    return b_tsls, np.sqrt(np.diag(S_tsls) / n), b_gmm, np.sqrt(np.diag(S_gmm) / n), J

n, nsim = 1000, 1000
bt, bg, Js, Js_bad = [], [], [], []
for s in range(nsim):
    Z3 = rng.standard_normal((n, 3))                       # 3 个排除工具,1 个内生回归元 => m-k = 2
    v = rng.standard_normal(n)
    x = Z3 @ np.array([0.5, 0.3, 0.2]) + v
    u = (0.6 * v + 0.8 * rng.standard_normal(n)) * np.exp(0.7 * Z3[:, 0])   # 内生 + 依赖工具的异方差
    Y = 1.0 + 2.0 * x + u
    X, Z = np.c_[np.ones(n), x], np.c_[np.ones(n), Z3]
    b1, se1, b2, se2, J = tsls_gmm(Y, X, Z)
    bt.append(b1[1]); bg.append(b2[1]); Js.append(J)
    # 一个无效工具:第三个工具直接进入 Y
    Ybad = Y + 0.15 * Z3[:, 2]
    Js_bad.append(tsls_gmm(Ybad, X, Z)[4])
    if s == 0:
        print(f"单次样本: TSLS b={b1[1]:.3f} (se {se1[1]:.3f}) | 有效GMM b={b2[1]:.3f} (se {se2[1]:.3f}) | J={J:.2f}")
print(f"抽样标准差: TSLS {np.std(bt):.4f}, 有效GMM {np.std(bg):.4f}")
crit = stats.chi2.ppf(0.95, 2)
print(f"J 统计量 5% 拒绝率: 工具全部有效 {np.mean(np.array(Js) > crit):.3f}, 含一个无效工具 {np.mean(np.array(Js_bad) > crit):.3f}")

输出:

单次样本: TSLS b=1.993 (se 0.110) | 有效GMM b=2.042 (se 0.100) | J=1.28
抽样标准差: TSLS 0.1320, 有效GMM 0.1105
J 统计量 5% 拒绝率: 工具全部有效 0.051, 含一个无效工具 0.687

异方差下有效 GMM 的抽样标准差比 TSLS 小约 16%。J 统计量在工具全部有效时拒绝率 5.1%,符合 \(\chi^2_2\) 的名义水平;有一个工具违反外生性时,拒绝率升到 69%。另外注意,严重异方差下 TSLS 单次样本的稳健标准误(0.110)低于它的实际抽样标准差(0.132),提示有限样本中稳健标准误也可能偏小。

4. 示例三:用 GMM 估计线性随机贴现因子并做 J 检验

线性 SDF \(m_t=1-bf_t\),\(f_t\) 是市场超额收益。\(N=10\) 个组合的超额收益满足 \(E[R^e_{it}(1-bf_t)]=0\),即样本矩 \(\mathbf g(b)=\bar{\mathbf R}^e-\overline{\mathbf R^ef}\,b\),关于 \(b\) 线性。一步用单位权重,二步用 \(\hat{\mathbf S}^{-1}\)(\(\hat{\mathbf S}\) 是矩贡献的协方差,即本章的 \(\mathbf H\)),\(J=T\mathbf g'\hat{\mathbf S}^{-1}\mathbf g\sim\chi^2_{N-1}\)。

import numpy as np
from scipy import stats
rng = np.random.default_rng(13)

def sdf_gmm(R, f):
    """线性 SDF m_t = 1 - b f_t,矩条件 E[R_t^e (1 - b f_t)] = 0(N 个方程,1 个参数)"""
    T, N = R.shape
    mu, D = R.mean(0), (R * f[:, None]).mean(0)         # g(b) = mu - D b
    def est(W):
        return (D @ W @ mu) / (D @ W @ D)
    b1 = est(np.eye(N))                                  # 第一步:单位权重
    h = R * (1 - b1 * f)[:, None]                        # 各期矩贡献(i.i.d.,无需 HAC)
    S = np.cov(h.T, bias=True)
    Si = np.linalg.inv(S)
    b2 = est(Si)                                         # 第二步:有效权重 S^{-1}
    g = mu - D * b2
    se = np.sqrt(1 / (D @ Si @ D) / T)
    J = T * g @ Si @ g                                   # ~ chi2(N-1)
    return b2, se, J, g

T, N = 600, 10                                           # 50 年月度数据,10 个组合
beta = np.linspace(0.5, 1.5, N)
def simulate(alpha):
    f = 0.6 + 4.5 * rng.standard_normal(T)              # 市场超额收益 (%),均值 0.6
    eps = 2.0 * rng.standard_normal((T, N)) * (1 + 0.3 * np.abs(f[:, None]) / 4.5)
    return alpha + f[:, None] * beta + eps, f

R, f = simulate(np.zeros(N))
b, se, J, g = sdf_gmm(R, f)
print(f"CAPM 成立: b={b:.4f} (se {se:.4f}), J={J:.2f}, p={stats.chi2.sf(J, N-1):.3f}")
print("  理论 b = E f / E f^2 =", round(0.6 / (0.6**2 + 4.5**2), 4))
alpha = np.zeros(N); alpha[:3] = 0.35                    # 三个组合有 0.35%/月 的定价误差
R, f = simulate(alpha)
b, se, J, g = sdf_gmm(R, f)
print(f"存在 alpha: b={b:.4f} (se {se:.4f}), J={J:.2f}, p={stats.chi2.sf(J, N-1):.4f}")
print("  定价误差 g (%/月):", g.round(2))
# J 检验的水平
Js = [sdf_gmm(*simulate(np.zeros(N)))[2] for _ in range(1000)]
print("零假设下 J 的 5% 拒绝率:", np.mean(np.array(Js) > stats.chi2.ppf(0.95, N-1)).round(3))

输出:

CAPM 成立: b=0.0346 (se 0.0083), J=10.46, p=0.315
  理论 b = E f / E f^2 = 0.0291
存在 alpha: b=0.0424 (se 0.0087), J=59.63, p=0.0000
  定价误差 g (%/月): [ 0.4   0.36  0.16 -0.15 -0.21 -0.3  -0.35 -0.28 -0.21 -0.38]
零假设下 J 的 5% 拒绝率: 0.06

解读:模型成立时,\(\hat b=0.035\),与理论值 \(E f/E f^2=0.029\) 相差不到一个标准误,J 检验不拒绝(\(p=0.32\))。三个组合存在每月 0.35% 的 alpha 时,J 高达 59.6,强烈拒绝。注意估计出的定价误差 \(\mathbf g\) 不只集中在那三个组合上:GMM 调整 \(b\) 去「迁就」所有矩条件,把误差分摊到其他组合上(这就是为什么检验要看联合的 J,而不是逐个看 \(g_i\))。1000 次模拟中 J 的拒绝率 6%,接近名义 5%。这里矩贡献 \(h_t\) 是 i.i.d. 的,对应 19.7.7 节的情形二,无需 HAC;如果用重叠收益或误差序列相关,\(\hat{\mathbf S}\) 必须改用 Newey–West。


本章小结

GLS 把模型左乘 \(\boldsymbol\Omega^{-1}\) 的平方根,使变换后的误差满足高斯–马尔可夫条件,得到 BLUE \((\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}\mathbf X'\boldsymbol\Omega^{-1}\mathbf Y\);\(\boldsymbol\Omega\) 未知时用可行 GLS,WLS 是对角情形的特例。但 GLS 需要严格外生 \(E(\mathbf U\mid\mathbf X)=\mathbf 0\),在预期驱动的时间序列中常不成立,这时 GLS 不一致而 OLS 一致。IV 回归中,TSLS \(=(\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf Y\),异方差下渐近协方差是以 \(\mathbf H=E(\mathbf Z_i\mathbf Z_i'u_i^2)\) 为「肉」的三明治,残差须用原始 \(\mathbf X\) 计算。TSLS 是权重 \((\mathbf Z'\mathbf Z)^{-1}\) 的线性 GMM;同方差下它就是有效 GMM,异方差下有效 GMM 的权重是 \(\mathbf H^{-1}\),两步法可行且渐近有效,GMM J 统计量渐近服从 \(\chi^2_{m-k}\)。时间序列中,误差序列相关时 \(\mathbf H\) 要用 HAC 估计;误差是不可预测的冲击时则无需 HAC,这正是资产定价欧拉方程 GMM 检验的框架。

概念 公式 / 要点
GLS \((\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}\mathbf X'\boldsymbol\Omega^{-1}\mathbf Y\),方差 \((\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}\)
GLS 的变换 \(\mathbf F'\mathbf F=\boldsymbol\Omega^{-1}\),\(\mathbf F\boldsymbol\Omega\mathbf F'=\mathbf I\)
外生性 OLS:\(E(u_i\mid\mathbf X_i)=0\);GLS:\(E(\mathbf U\mid\mathbf X)=\mathbf 0\)(严格外生)
TSLS \((\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf Y\)
TSLS 方差 \((\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf H\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX}(\cdot)^{-1}\)
线性 GMM \((\mathbf X'\mathbf Z\mathbf A\mathbf Z'\mathbf X)^{-1}\mathbf X'\mathbf Z\mathbf A\mathbf Z'\mathbf Y\)
有效 GMM \(\mathbf A=\mathbf H^{-1}\);方差 \((\mathbf Q_{XZ}\mathbf H^{-1}\mathbf Q_{ZX})^{-1}\)
两步法 TSLS → \(\hat{\mathbf H}\) → 权重 \(\hat{\mathbf H}^{-1}\)
J 统计量 \((\mathbf Z'\hat{\mathbf U})'\hat{\mathbf H}^{-1}(\mathbf Z'\hat{\mathbf U})/n\xrightarrow{d}\chi^2_{m-k}\)
时间序列 \(\mathbf Z_tu_t\) 序列相关 → HAC 估计 \(\mathbf H\);鞅差分误差 → 不需要

练习

基础

  1. (原书复习题 19.4)什么情况下 GLS 比 OLS 更有效?为什么实践中常常不用 GLS? 答案要点:误差协方差非球形且已知(或可一致估计)、严格外生成立时;\(\boldsymbol\Omega\) 难以正确设定,且严格外生常不成立。
  2. (原书复习题 19.5)构造一个满足 \(E(u_i\mid X_i)=0\) 但 \(E(\mathbf U\mid\mathbf X)\ne\mathbf 0\) 的例子。 提示:\(X_t=Y_{t-1}\) 的自回归。
  3. 证明当 \(\boldsymbol\Omega=\sigma^2\mathbf I\) 时 GLS 等于 OLS;当 \(\boldsymbol\Omega\) 对角、对角元为 \(\lambda h(X_i)\) 时 GLS 等于 WLS。
  4. 恰好识别(\(m=k\))时,证明对任意可逆的 \(\mathbf A\),(19.59) 都等于 \((\mathbf Z'\mathbf X)^{-1}\mathbf Z'\mathbf Y\)。这说明什么? 提示:\(\mathbf X'\mathbf Z\) 是方阵且可逆,\(\mathbf A\) 相消;恰好识别时权重无关紧要,J 恒为零。
  5. 手工做两阶段回归时,为什么第二阶段软件报告的标准误是错的? 提示:残差用了 \(\hat{\mathbf X}\) 而不是 \(\mathbf X\),\(\hat\sigma_u^2\) 估计错误。

进阶

  1. (原书习题 19.8)\(u_i=0.5u_{i-1}+\tilde u_i\),\(\tilde u_i\) i.i.d.。写出 \(\boldsymbol\Omega\),并给出不必显式求逆的 GLS 变换(准差分,第一个观测乘以 \(\sqrt{1-0.25}\))。 提示:\(\Omega_{ij}=\sigma_{\tilde u}^2\,0.5^{|i-j|}/(1-0.25)\)。
  2. 在示例一中,把误差改为 AR(1)(\(\rho=0.7\)),回归元反馈改为 \(x_t\) 含 \(u_{t-1}\) 的新息部分但与 \(u_t\) 不相关。重新设计 \(x_t\) 使 OLS 一致而 GLS(准差分)不一致,并用模拟验证。 提示:准差分后的误差 \(u_t-\rho u_{t-1}\) 与 \(x_t-\rho x_{t-1}\) 的相关涉及 \(\mathrm{cov}(x_t,u_{t-1})\)。
  3. (原书习题 19.12)证明有效 GMM 是 (19.65) 的解;证明两步估计量与不可行有效 GMM 渐近等价;证明 \(J^{GMM}\xrightarrow{d}\chi^2_{m-k}\)。
  4. (原书习题 19.14)证明 (19.63) 与 Key Concept 12.6 的 J 统计量相等。 提示:TSLS 残差与包含的外生变量 \(\mathbf W\) 和常数正交(正规方程),对 \(\mathbf Z\) 回归时它们的系数为零。
  5. 在示例三中,把因子换成两个(市场与一个风格因子),SDF 为 \(m=1-b_1f_1-b_2f_2\)。写出线性 GMM 的矩阵公式,并检验「风格因子不被定价」(\(b_2=0\))。再把收益换成 12 个月重叠收益,说明 \(\hat{\mathbf S}\) 应如何修改。 提示:\(\mathbf g(\mathbf b)=\bar{\mathbf R}^e-\mathbf D\mathbf b\),\(\mathbf D=\frac1T\sum\mathbf R^e_t\mathbf f_t'\);重叠时用 Newey–West,滞后至少 11。

原书推荐习题:19.8(AR(1) 误差的 GLS 与准差分);19.12、19.14(有效 GMM 与 J 统计量);复习题 19.4、19.5。


原书对照

本章内容 原书章节 PDF 页码
GLS:动机、假设、\(\boldsymbol\Omega\) 已知与可行 GLS、条件均值零假设(Key Concept 19.4,式 19.40–19.44) 19.6 p.729–734
IV 与 GMM:TSLS、渐近分布、IV 估计量族、J 统计量、有效 GMM、时间序列中的 GMM(式 19.45–19.71) 19.7 p.734–742
复习题与习题 第 19 章末 p.743–749
附录 19.6 IV 与 GMM 结果的证明(式 19.85–19.93) 附录 19.6 p.757–759
SDF 的 GMM 估计、GLS 不一致的模拟(本教材补充) — —

注:原书页码 = PDF 页码 − 1。