第 19b 章 广义最小二乘、工具变量与广义矩估计
学习目标
读完本章,你应当能够:
- 陈述 GLS 假设,推导 \(\tilde{\boldsymbol\beta}^{GLS}=(\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}\mathbf X'\boldsymbol\Omega^{-1}\mathbf Y\) 并说明它为什么是 BLUE;区分不可行 GLS 与可行 GLS,知道 WLS 是 GLS 的特例。
- 理解 GLS 需要「严格外生」\(E(\mathbf U\mid\mathbf X)=\mathbf 0\),而 OLS 只需 \(E(u_i\mid\mathbf X_i)=0\);能举出 GLS 不一致而 OLS 一致的时间序列例子。
- 用矩阵写出 TSLS 估计量 \((\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf Y\),推导它在异方差下的渐近分布与稳健标准误。
- 把 TSLS 放进「以 \(\mathbf Z\) 的线性组合为工具」的 IV 估计量族(即线性 GMM),理解权重矩阵的作用,证明同方差下 TSLS 是有效 GMM。
- 构造两步有效 GMM 估计量与 GMM J 统计量,并知道时间序列中何时需要 HAC 估计 \(\mathbf H\)、何时不需要。
- 用线性随机贴现因子模型做 GMM 估计与 J 检验,理解 GMM 在资产定价中的地位。
读前导读
这一章在解决什么问题。 本章有两条主线,都是在 19a 章的 OLS 不够用时登场。
第一条是 GLS(广义最小二乘)。OLS 默认每个观测的误差互不相关、方差相同。时间序列里误差常常前后相关,横截面里同行业股票的误差也会一起动。GLS 的办法和你熟悉的「把相关资产变换成不相关的组合」一样:先用误差协方差矩阵的逆「白化」数据,再做 OLS。第 18 章的 WLS 是它的对角特例。本章最重要的警告是:GLS 比 OLS 更挑剔,它要求误差和未来的回归元也不相关。资产价格、利率这类含有预期的变量很容易违反这一点,这时 GLS 会给出「精确但错误」的答案。
第二条是 IV(工具变量)与 GMM(广义矩估计)。回归元和误差相关(内生)时 OLS 有偏,需要找与误差无关、但与回归元相关的「工具」。你在 CFA 里见过「样本矩 = 总体矩」的矩估计思路;GMM 是它的推广:当矩条件个数多于参数时,找一个让所有矩条件「整体最接近成立」的参数。资产定价中的 \(E[m_{t+1}R^e_{t+1}]=0\) 就是一组矩条件,GMM 是检验因子模型的标准工具,2013 年 Hansen 因此获诺贝尔奖。
需要先想起来的数学。
- 矩阵平方根与「白化」。若 \(\boldsymbol\Omega\) 是协方差矩阵,存在 \(\mathbf F\) 使 \(\mathbf F\boldsymbol\Omega\mathbf F'=\mathbf I\)。用 \(\mathbf F\) 左乘随机向量,就把相关、不等方差的变量变成不相关、单位方差的变量。一维例子:\(\boldsymbol\Omega=\sigma^2\),\(\mathbf F=1/\sigma\),就是标准化。见 第 00 册第 06 章 线性代数速成。
- 二次型与正定矩阵。\(\mathbf g'\mathbf A\mathbf g\)(\(\mathbf A\) 半正定)衡量向量 \(\mathbf g\) 的「加权长度」。\(\mathbf A=\mathbf I\) 时就是各分量平方和;\(\mathbf A\) 为协方差逆时就是马氏距离。GMM 的目标函数和 J 统计量都是这种二次型。见 第 00 册第 06 章。
- 投影矩阵 \(\mathbf P_Z\)、\(\mathbf M_Z\)。19a 章 19.4.1 节已讲:\(\mathbf P_Z\mathbf X\) 是 \(\mathbf X\) 对 \(\mathbf Z\) 回归的拟合值。TSLS 的第一阶段就是一次投影。
- 对向量求导、令梯度为零。GMM 的估计量 (19.59) 来自对二次目标函数求导。规则是 \(\frac{\partial}{\partial\mathbf b}(\mathbf a-\mathbf C\mathbf b)'\mathbf W(\mathbf a-\mathbf C\mathbf b)=-2\mathbf C'\mathbf W(\mathbf a-\mathbf C\mathbf b)\)(\(\mathbf W\) 对称),这是一元 \(\frac{d}{db}w(a-cb)^2=-2cw(a-cb)\) 的直接推广。见 第 00 册第 05 章 多元微积分与优化。
- 条件期望与鞅差分。\(E(u_t\mid\text{过去信息})=0\) 的序列叫鞅差分序列,它与自己的任何过去值都不相关。有效市场下的超额收益就是典型例子。见 第 00 册第 07 章 概率中的分析工具。
怎么读这一章。 核心必读:19.6.3(GLS 的变换思路)、19.6.5(严格外生警告,配合示例一)、19.7.2(TSLS 的矩阵形式)、19.7.4 中「IV 估计量族」和 19.7.6(GMM 的定义、有效权重、两步法、J 统计量)、19.7.7 的情形二和欧拉方程。可以第一次跳过的:19.7.3 渐近方差 (19.52) 的完整形式(记住「仍然是三明治,肉是 \(\mathbf H\)」即可)、附录 19.6 的全部证明。如果你的工作偏资产定价,可以先读量化实战的示例三,再回头读 19.7.6,会更有方向感。
19.6 广义最小二乘(GLS)
(第 16.5 节在分布滞后回归中已经引入 GLS;本节给出自包含的数学处理。)
19.6.1 为什么需要 GLS
i.i.d. 抽样(如简单随机抽样的个人数据)下,\(u_i\) 与 \(u_j\) 独立,\(E(\mathbf U\mathbf U'\mid\mathbf X)\) 是对角矩阵。但在时间序列中,遗漏的因素往往跨期相关,误差序列相关。这带来两个问题:
- OLS 的稳健标准误和仅同方差标准误都无效。解决办法是 HAC 标准误(第 16.4 节)。
- \(E(\mathbf U\mathbf U'\mid\mathbf X)\) 不再是对角阵,高斯–马尔可夫条件 (ii) 不成立,OLS 不再是 BLUE。
GLS 针对第二个问题:当误差的条件协方差矩阵不正比于单位阵时,GLS(至少渐近地)是 BLUE。第 18 章的 WLS 是 GLS 的特例:协方差矩阵对角、第 \(i\) 个对角元是 \(X_i\) 的函数。GLS 的思路与 WLS 完全相同:变换模型,使变换后的误差满足高斯–马尔可夫条件,再对变换后的模型做 OLS。
19.6.2 GLS 假设
Key Concept 19.4(GLS 假设) 在 \(\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U\) 中:
- \(E(\mathbf U\mid\mathbf X)=\mathbf 0_n\);(19.40)
- \(E(\mathbf U\mathbf U'\mid\mathbf X)=\boldsymbol\Omega(\mathbf X)\),是 \(n\times n\) 正定矩阵,可以依赖 \(\mathbf X\);(19.41)
- \(\mathbf X_i\) 与 \(u_i\) 满足适当的矩条件(具体条件因 \(\boldsymbol\Omega\) 的形式、是否需要估计、所研究的统计量而异,原书不细列);
- \(\mathbf X\) 列满秩。
假设 1 由 OLS 的假设 1、2 蕴含(见 19a 章式 19.6),但 GLS 不想保留 i.i.d. 假设,因为它的目的之一就是处理跨观测的相关。两大应用:
- 独立抽样 + 异方差:\(\boldsymbol\Omega\) 对角,第 \(i\) 个对角元为 \(\lambda h(\mathbf X_i)\)。此时 GLS 就是 WLS(18.5 节)。
- 同方差 + 序列相关:必须对序列相关建模。例如误差只与相邻项相关,\(\mathrm{corr}(u_i,u_{i-1})=\rho\ne0\),\(|i-j|\ge2\) 时为零(MA(1) 型)。则 \(\boldsymbol\Omega\) 的对角元为 \(\sigma_u^2\),第一副对角元为 \(\rho\sigma_u^2\),其余为 0,且不依赖 \(\mathbf X\)。AR(1) 等其他结构见第 16.5 节与习题 19.8。
19.6.3 \(\boldsymbol\Omega\) 已知时的 GLS
取 \(\mathbf F\) 为 \(\boldsymbol\Omega^{-1}\) 的矩阵平方根:\(\mathbf F'\mathbf F=\boldsymbol\Omega^{-1}\)(附录 19.1,见 19a 章)。它满足 \(\mathbf F\boldsymbol\Omega\mathbf F'=\mathbf I_n\)(因为 \(\boldsymbol\Omega=\mathbf F^{-1}\mathbf F'^{-1}\))。把模型左乘 \(\mathbf F\):
关键洞见:变换后的模型满足高斯–马尔可夫条件。
- \(E(\tilde{\mathbf U}\mid\tilde{\mathbf X})=\mathbf FE(\mathbf U\mid\mathbf F\mathbf X)=\mathbf 0_n\)(\(\mathbf F\) 可逆,条件于 \(\mathbf F\mathbf X\) 与条件于 \(\mathbf X\) 相同);
- \(E(\tilde{\mathbf U}\tilde{\mathbf U}'\mid\tilde{\mathbf X})=\mathbf FE(\mathbf U\mathbf U'\mid\mathbf X)\mathbf F'=\mathbf F\boldsymbol\Omega\mathbf F'=\mathbf I_n\)。
所以对变换模型做 OLS,\(\tilde{\boldsymbol\beta}^{GLS}=(\tilde{\mathbf X}'\tilde{\mathbf X})^{-1}\tilde{\mathbf X}'\tilde{\mathbf Y}\),是关于 \(\tilde{\mathbf Y}\) 线性的最佳条件无偏估计量。又因为 \(\mathbf F\) 已知且可逆(\(\boldsymbol\Omega\) 正定),「关于 \(\tilde{\mathbf Y}\) 线性」的估计量类与「关于 \(\mathbf Y\) 线性」的类完全相同,因此 GLS 是 BLUE。展开 \(\tilde{\mathbf X}'\tilde{\mathbf X}=\mathbf X'\mathbf F'\mathbf F\mathbf X=\mathbf X'\boldsymbol\Omega^{-1}\mathbf X\),得
推导拆解:从变换模型的 OLS 到 (19.43)。 第一步,对 (19.42) 套 OLS 公式:\((\tilde{\mathbf X}'\tilde{\mathbf X})^{-1}\tilde{\mathbf X}'\tilde{\mathbf Y}\)。 第二步,代入 \(\tilde{\mathbf X}=\mathbf F\mathbf X\),用转置规则 \((\mathbf F\mathbf X)'=\mathbf X'\mathbf F'\):\(\tilde{\mathbf X}'\tilde{\mathbf X}=\mathbf X'\mathbf F'\mathbf F\mathbf X\),\(\tilde{\mathbf X}'\tilde{\mathbf Y}=\mathbf X'\mathbf F'\mathbf F\mathbf Y\)。 第三步,\(\mathbf F'\mathbf F=\boldsymbol\Omega^{-1}\) 替换进去,\(\mathbf F\) 本身消失。所以只要会算 \(\boldsymbol\Omega^{-1}\),不必真的找平方根。 第四步,条件协方差:变换模型误差协方差为 \(\mathbf I\),套 19a 章的同方差公式 \(\sigma^2(\tilde{\mathbf X}'\tilde{\mathbf X})^{-1}\),其中 \(\sigma^2=1\),得 \((\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}\)。 金融直觉:GLS 和最小方差组合是同一个数学结构。最小方差组合权重 \(\propto\boldsymbol\Sigma^{-1}\mathbf 1\):噪声大的资产少配,与其他资产高度相关的资产也少配(信息重复)。GLS 给观测「配权」也是这样:误差方差大的观测、和其他观测误差高度相关的观测,被 \(\boldsymbol\Omega^{-1}\) 压低权重。
实践中 \(\boldsymbol\Omega\) 通常未知,(19.43) 称为不可行 GLS(infeasible GLS)。
AR(1) 误差的准差分(原书习题 19.8)。若 \(u_t=\rho u_{t-1}+\tilde u_t\),\(\tilde u_t\) 为白噪声,则不必显式求 \(\boldsymbol\Omega^{-1}\):对 \(t\ge2\) 做准差分 \(Y_t-\rho Y_{t-1}=(\mathbf X_t-\rho\mathbf X_{t-1})'\boldsymbol\beta+\tilde u_t\),第一个观测乘以 \(\sqrt{1-\rho^2}\)。这正是某个 \(\mathbf F\) 的作用。丢掉第一个观测就是 Cochrane–Orcutt 方法(第 16.5 节)。
推导拆解:为什么准差分有效?把 \(t\) 期方程减去 \(\rho\) 倍的 \(t-1\) 期方程:\(Y_t-\rho Y_{t-1}=(\mathbf X_t-\rho\mathbf X_{t-1})'\boldsymbol\beta+(u_t-\rho u_{t-1})\)。由 AR(1) 定义,\(u_t-\rho u_{t-1}=\tilde u_t\) 是白噪声,正好满足高斯–马尔可夫条件。 第一个观测没有「上一期」可减,只能单独处理。\(u_1\) 的方差是 AR(1) 的平稳方差 \(\sigma_{\tilde u}^2/(1-\rho^2)\),乘以 \(\sqrt{1-\rho^2}\) 后方差恰好变成 \(\sigma_{\tilde u}^2\),和其他变换后误差一致。这一步就是 Prais–Winsten 与 Cochrane–Orcutt 的唯一区别。
19.6.4 \(\boldsymbol\Omega\) 含未知参数时:可行 GLS
若 \(\boldsymbol\Omega\) 是少数可估参数的已知函数,可以先估计 \(\hat{\boldsymbol\Omega}\)。例如上面 MA(1) 型结构有两个参数 \(\sigma_u^2,\rho\),用初步 OLS 残差估计:\(\sigma_u^2\) 用 \(s_{\hat u}^2\),\(\rho\) 用所有相邻残差对的样本相关系数。一般地,
19.6.5 条件均值零假设与 GLS(重要)
这是本节最重要、也最容易被忽视的一点。
- OLS 一致需要 \(E(u_i\mid\mathbf X_i)=0\):给定本观测的回归元,误差均值为零。
- GLS 的第一个假设是 \(E(u_i\mid\mathbf X_1,\dots,\mathbf X_n)=0\):给定所有观测的回归元,误差均值为零。
i.i.d. 抽样(GLS 即 WLS)时,后者由前者蕴含;非 i.i.d. 时,GLS 的假设更强。时间序列中这正是第 16.5 节「过去与当期外生」与「严格外生」的区别:\(E(u_t\mid\mathbf X_1,\dots,\mathbf X_T)=0\) 就是严格外生,要求误差与未来的回归元也不相关。
对比两者的一致性论证(设同方差、\(\boldsymbol\Omega\) 已知、有非零的非对角元)。
GLS:
OLS:
白话解释:两种估计误差的差别在于「谁和谁相乘」。OLS 的误差项只把第 \(i\) 期的回归元和第 \(i\) 期的误差配对,所以只要求同期不相关。GLS 用 \(\boldsymbol\Omega^{-1}\) 把不同时期混在一起,等于把第 \(i\) 期的回归元和第 \(j\) 期的误差也配了对。准差分就是例子:变换后的回归元 \(\mathbf X_t-\rho\mathbf X_{t-1}\) 和变换后的误差 \(u_t-\rho u_{t-1}\) 相乘,里面有一项 \(\mathbf X_t\,u_{t-1}\),即本期回归元乘上期误差。若上期的冲击会影响本期回归元(反馈),这一项均值就不为零,GLS 就偏了。 一句话:OLS 只怕「同期相关」;GLS 还怕「误差影响未来回归元」,而在金融数据里这种反馈非常普遍。
GLS 的第一假设是否苛刻? 它要求第 \(i\) 个观测的误差与所有其他观测的回归元不相关,这在某些时间序列应用中很可疑。原书的例子是第 16.6 节冷冻橙汁期货价格变化对佛罗里达天气的回归:误差与当期和过去的天气不相关(OLS 假设成立),但很可能与未来的天气相关(GLS 假设不成立),因为今天的期货价格包含了对未来天气的预期。一般现象是:当今天的变量部分基于对未来的预期而定(如资产价格),今天的误差就依赖于对明天回归元的预测,而这个预测与明天回归元的实际值相关。
结论:GLS 的第一假设实际上比 OLS 的第一假设强得多。在某些经济时间序列应用中,GLS 不一致而 OLS 一致。这时宁可用 OLS 加 HAC 标准误,放弃效率换取一致性。本章示例一会用模拟演示这种情况。
原书复习题 19.5 要求构造一个满足 \(E(u_i\mid X_i)=0\) 但 \(E(\mathbf U\mid\mathbf X)\ne\mathbf 0\) 的例子。最简单的是自回归:\(Y_t=\beta Y_{t-1}+u_t\),\(X_t=Y_{t-1}\)。\(u_t\) 与 \(X_t\) 不相关,但 \(u_t\) 进入 \(Y_t=X_{t+1}\),与未来的回归元相关。
19.7 工具变量与广义矩估计(IV 与 GMM)
前提:第 12 章 Key Concept 12.3、12.4 的 IV 回归假设成立,且工具是强工具;本节所有渐近结果都在强工具假设下成立(弱工具问题见第 12 章)。数据是截面 i.i.d.,本节末尾简述时间序列推广。
本节内容:矩阵形式的 IV 模型与 TSLS,及其在异方差下的渐近分布;同方差时,TSLS 在「工具为外生变量线性组合」的 IV 估计量类中渐近有效,J 统计量渐近服从 \(\chi^2\),自由度为过度识别约束的个数;异方差时,有效的 IV 估计量是有效 GMM 估计量(Hansen 1982)。
19.7.1 矩阵形式的 IV 模型
- \(\mathbf X\):\(n\times(k+r+1)\),关注方程的全部回归元,第 \(i\) 行 \(\mathbf X_i'=(1\ X_{1i}\cdots X_{ki}\ W_{1i}\cdots W_{ri})\)。其中 \(X_1,\dots,X_k\) 是内生变量,\(W_1,\dots,W_r\) 是包含的外生变量(控制变量)。
- \(\mathbf Z\):\(n\times(m+r+1)\),全部外生变量,即包含的 \(W\) 加上排除的工具 \(Z_1,\dots,Z_m\),第 \(i\) 行 \(\mathbf Z_i'=(1\ Z_{1i}\cdots Z_{mi}\ W_{1i}\cdots W_{ri})\)。
- 模型:
\[\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U;\tag{19.45}\]工具外生性:\[E(\mathbf Z_iu_i)=\mathbf 0.\tag{19.46}\]
识别要求 \(m\ge k\):\(m=k\) 恰好识别,\(m>k\) 过度识别(过度识别约束有 \(m-k\) 个)。
19.7.2 TSLS 估计量
TSLS 用第一阶段的 OLS 拟合值作工具。\(\hat{\mathbf X}\) 的第 \(i\) 行是 \((1\ \hat X_{1i}\cdots\hat X_{ki}\ W_{1i}\cdots W_{ri})\);由于 \(W\) 和常数都在 \(\mathbf Z\) 中,它们对 \(\mathbf Z\) 回归的拟合值就是自身。所以
白话解释:\(\mathbf P_Z\mathbf X\) 把每个回归元拆成两块:能被工具(外生变量)解释的部分,以及剩下可能和误差纠缠的部分。TSLS 只用第一块去回归,相当于只保留回归元中「干净」的变动。分子 \(\hat{\mathbf X}'\mathbf Y=\mathbf X'\mathbf P_Z\mathbf Y\) 也可以理解成:\(\mathbf Y\) 被投影到工具空间以后再与 \(\mathbf X\) 配对,因为 \(\mathbf P_Z\) 对称幂等,投影放在哪一边结果都一样。 外生控制变量 \(\mathbf W\) 和常数「对 \(\mathbf Z\) 回归的拟合值就是自身」,因为它们本身就是 \(\mathbf Z\) 的列,\(\mathbf P_Z\) 作用在 \(\mathbf Z\) 的列上不改变它们(19a 章的 \(\mathbf P_X\mathbf X=\mathbf X\))。
19.7.3 TSLS 的渐近分布
代入 \(\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U\) 并展开 \(\mathbf P_Z\):
推导拆解:(19.49) 的来源。 第一步,与 19a 章 (19.14) 同理,代入 \(\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U\),\((\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf X=\mathbf I\),得 \(\hat{\boldsymbol\beta}^{TSLS}-\boldsymbol\beta=(\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf U\)。 第二步,展开 \(\mathbf P_Z=\mathbf Z(\mathbf Z'\mathbf Z)^{-1}\mathbf Z'\),于是 \(\mathbf X'\mathbf P_Z\mathbf X=(\mathbf X'\mathbf Z)(\mathbf Z'\mathbf Z)^{-1}(\mathbf Z'\mathbf X)\)。 第三步,在每个样本矩上配 \(1/n\),使它们各自收敛:前面的逆矩阵里共有「\(n\cdot n^{-1}\cdot n\)」\(=n\),所以 \(\mathbf X'\mathbf P_Z\mathbf X=n[\frac{\mathbf X'\mathbf Z}n(\frac{\mathbf Z'\mathbf Z}n)^{-1}\frac{\mathbf Z'\mathbf X}n]\);后面同理 \(\mathbf X'\mathbf P_Z\mathbf U=n[\frac{\mathbf X'\mathbf Z}n(\frac{\mathbf Z'\mathbf Z}n)^{-1}\frac{\mathbf Z'\mathbf U}n]\)。两者相除 \(n\) 抵消,再乘 \(\sqrt n\),把最后的 \(\frac{\mathbf Z'\mathbf U}{n}\) 变成 \(\frac{\mathbf Z'\mathbf U}{\sqrt n}\)。 第四步,除了 \(\mathbf Z'\mathbf U/\sqrt n\)(用 CLT),其余都是用 LLN 收敛到常数的样本矩,由 Slutsky 拼起来。和 OLS 相比,只是 OLS 中的 \(\mathbf X\) 被「\(\mathbf X\) 在 \(\mathbf Z\) 上的投影」替代。
TSLS 标准误。用样本矩替换总体矩得 \(\hat{\boldsymbol\Sigma}^{TSLS}\)(式 19.53),其中 \(\hat{\mathbf Q}_{XZ}=\mathbf X'\mathbf Z/n\) 等,
19.7.4 同方差时 TSLS 的性质
同方差时,TSLS 在「以 \(\mathbf Z\) 的行的线性组合为工具」的 IV 估计量类中渐近有效。这是高斯–马尔可夫定理的 IV 版本,是使用 TSLS 的重要理由。
同方差下的分布。\(E(u_i^2\mid\mathbf Z_i)=\sigma_u^2\) ⇒ \(\mathbf H=E[\mathbf Z_i\mathbf Z_i'E(u_i^2\mid\mathbf Z_i)]=\sigma_u^2\mathbf Q_{ZZ}\),三明治塌缩:
IV 估计量族:以 \(\mathbf Z\) 的线性组合为工具。共同起点是矩方程:工具外生意味着在真值处
方式一:最小化二次型。给定 \((m+r+1)\) 阶对称半正定权重矩阵 \(\mathbf A\),
推导拆解:(19.59) 怎么从 (19.58) 求出来。记 \(\mathbf g(\mathbf b)=\mathbf Z'(\mathbf Y-\mathbf X\mathbf b)\),它是 \(m+r+1\) 个样本矩(的 \(n\) 倍)。目标函数是 \(\mathbf g'\mathbf A\mathbf g\)。 第一步,用导读里的求导规则(这里 \(\mathbf a=\mathbf Z'\mathbf Y\),\(\mathbf C=\mathbf Z'\mathbf X\),\(\mathbf W=\mathbf A\)):梯度为 \(-2\mathbf X'\mathbf Z\mathbf A\mathbf Z'(\mathbf Y-\mathbf X\mathbf b)\)。 第二步,令其为零:\(\mathbf X'\mathbf Z\mathbf A\mathbf Z'\mathbf X\,\mathbf b=\mathbf X'\mathbf Z\mathbf A\mathbf Z'\mathbf Y\),左乘逆即得 (19.59)。 第三步,代入 \(\mathbf A=(\mathbf Z'\mathbf Z)^{-1}\),\(\mathbf Z\mathbf A\mathbf Z'=\mathbf P_Z\),就回到 (19.48)。 白话解释:\(\mathbf A\) 决定「哪个矩条件更重要」。矩条件比参数多时不可能都精确为零,只能折中;\(\mathbf A\) 就是折中时的「权重表」,好比最小二乘用单位权重,WLS 用方差倒数。不同的 \(\mathbf A\) 都给出一致估计,只是精度不同,这就引出「哪个 \(\mathbf A\) 最好」的问题。
方式二:选择工具的线性组合。工具取 \(\mathbf Z\mathbf B\),\(\mathbf B\) 是 \((m+r+1)\times(k+r+1)\) 的列满秩矩阵,恰好识别地解 \((\mathbf Y-\mathbf X\mathbf b)'\mathbf Z\mathbf B=\mathbf 0\),得 \(\hat{\boldsymbol\beta}^{IV}=(\mathbf B'\mathbf Z'\mathbf X)^{-1}\mathbf B'\mathbf Z'\mathbf Y\)。代入 \(\mathbf B=\mathbf A\mathbf Z'\mathbf X\) 就得到 (19.59)。两种方式生成同一族估计量,惯例用方式一。
同方差下 TSLS 的渐近有效性。\(\mathbf H=\mathbf Q_{ZZ}\sigma_u^2\) 时,
19.7.5 同方差下的 J 统计量
J 统计量(Key Concept 12.6)检验全部过度识别约束是否成立。思想:约束成立时 \(u_i\) 与所有工具不相关,\(\mathbf U\) 对 \(\mathbf Z\) 回归的总体系数全为零。用 TSLS 残差 \(\hat{\mathbf U}\) 代替 \(\mathbf U\),J 是「\(\hat{\mathbf U}\) 对 \(\mathbf Z\) 回归中 \(\mathbf Z\) 的系数全为零」的仅同方差 F 统计量乘以 \((m+r+1)\),转成渐近卡方形式。
由第 7 章的 (7.13):无约束回归的 \(SSR=\hat{\mathbf U}'\mathbf M_Z\hat{\mathbf U}\),约束回归(无回归元)的 \(SSR=\hat{\mathbf U}'\hat{\mathbf U}\),差为 \(\hat{\mathbf U}'\mathbf P_Z\hat{\mathbf U}\),所以
金融直觉:J 检验的逻辑和「用多个资产检验 CAPM」一样。如果只有一个资产、一个参数,总能把参数调到让定价误差为零,模型永远「通过」,毫无检验力。资产(矩条件)比参数多时,参数无法同时迁就所有资产,剩下的定价误差若显著不为零,就是模型的证据不足。有 \(m+r+1\) 个矩条件、\(k+r+1\) 个参数,就有 \(m-k\) 个「多余」的方向可以拿来检验。 但 J 检验有一个盲点:它检验的是「矩条件之间是否一致」。如果所有工具都以同样方式违反外生性,它们之间仍然互相一致,J 检验可能发现不了。因此 J 不拒绝不能证明工具有效。
19.7.6 线性模型中的 GMM
异方差时,TSLS 不再是上述族中最有效的,最有效的是有效 GMM 估计量;而且 (19.63) 的 J 不再服从卡方,要用有效 GMM 构造的 J 才服从 \(\chi^2_{m-k}\)。这与「外生回归元 + 异方差」的情形完全平行:那里 OLS 不是 BLUE,仅同方差 F 即使在大样本也不服从 F,有效估计量是 WLS;IV 情形下,有效估计量是使用不同于 TSLS 的权重矩阵的有效 GMM。
GMM 的定义。广义矩方法(generalized method of moments)是估计线性或非线性模型参数的一般方法:选择参数,使多个「样本矩 = 0」的方程(称为矩条件,moment conditions)拟合得最好。这些方程一般不能同时满足,GMM 通过最小化二次目标函数折中。在线性 IV 模型中,GMM 估计量类就是 (19.58) 所有解的集合,也就是「以 \(\mathbf Z\) 线性组合为工具」的 IV 估计量类。GMM 只是这一族估计量的另一个名字。
渐近有效 GMM:族中渐近协方差矩阵最小者(按 (19.62) 的标准)。所以 (19.62) 可以重述为:同方差时,TSLS 就是线性模型的有效 GMM 估计量。
动机:同方差时 \(\mathbf H=\mathbf Q_{ZZ}\sigma_u^2\),大样本中 \(\mathbf A=(\mathbf Z'\mathbf Z)^{-1}\) 与 \(\mathbf A=(\mathbf Q_{ZZ}\sigma_u^2)^{-1}=\mathbf H^{-1}\) 只差一个标量倍数(标量不影响 (19.59) 的解)。类推到异方差,取 \(\mathbf A=\mathbf H^{-1}\):
直觉:权重 \(\mathbf H^{-1}\) 给噪声大(\(E(Z_{ji}^2u_i^2)\) 大)的矩条件较小的权重,给彼此相关的矩条件去重,与 GLS 用 \(\boldsymbol\Omega^{-1}\) 加权是同一个思想。
推导拆解:「肉与面包相消」具体怎么消。把 \(\mathbf A=\mathbf H^{-1}\) 代入 (19.60),记 \(\mathbf G=\mathbf Q_{XZ}\mathbf H^{-1}\mathbf Q_{ZX}\): 中间部分 \(\mathbf Q_{XZ}\mathbf A\mathbf H\mathbf A\mathbf Q_{ZX}=\mathbf Q_{XZ}\mathbf H^{-1}\mathbf H\mathbf H^{-1}\mathbf Q_{ZX}=\mathbf Q_{XZ}\mathbf H^{-1}\mathbf Q_{ZX}=\mathbf G\); 两边的「面包」都是 \(\mathbf G^{-1}\),所以 \(\boldsymbol\Sigma=\mathbf G^{-1}\mathbf G\mathbf G^{-1}=\mathbf G^{-1}\)。 这与 GLS 相同:用协方差的逆作权重时,三明治总会塌缩成一层,这正是「权重选对了」的标志。 金融直觉:\(\mathbf H\) 是各矩条件(各资产定价误差)的协方差矩阵,\(\mathbf H^{-1}\) 作权重和求切点组合时用 \(\boldsymbol\Sigma^{-1}\) 一样:噪声大的方向少看,噪声小的方向多看。量化实战中提到「有效 GMM 的经济含义不直观」,原因也在这里:它可能把权重压在某个精确但不重要的资产组合上。
可行有效 GMM(两步法)。(19.66) 依赖未知的 \(\mathbf H\),不可行。
- 第一步:用任一一致估计量(自然的选择是 TSLS)估计 \(\boldsymbol\beta\),计算关注方程的残差,用 (19.54) 构造 \(\hat{\mathbf H}\);
- 第二步:用 \(\hat{\mathbf H}^{-1}\) 作权重矩阵,
\[\hat{\boldsymbol\beta}^{Eff.GMM}=(\mathbf X'\mathbf Z\hat{\mathbf H}^{-1}\mathbf Z'\mathbf X)^{-1}\mathbf X'\mathbf Z\hat{\mathbf H}^{-1}\mathbf Z'\mathbf Y.\tag{19.68}\]
由于 \(\hat{\mathbf H}\xrightarrow{p}\mathbf H\),\(\sqrt n(\hat{\boldsymbol\beta}^{Eff.GMM}-\tilde{\boldsymbol\beta}^{Eff.GMM})\xrightarrow{p}\mathbf 0\)(习题 19.12),所以
异方差稳健 J 统计量(GMM J 统计量):
19.7.7 时间序列数据中的 GMM
(形式化处理见 Hayashi 2000 第 6 章;假设变量平稳。)分两类情形:
情形一:误差 \(u_t\) 序列相关。GMM 估计量仍渐近正态,但 (19.50) 中 \(\mathbf H\) 的公式不再正确:正确的 \(\mathbf H\) 是 \(\mathbf Z_tu_t\) 的长期方差,依赖它的自协方差(类比第 16 章式 16.14 中序列相关下 OLS 的方差)。有效 GMM 仍用 \(\mathbf H\) 的一致估计构造,但必须用 HAC 方法(如 Newey–West)估计。
情形二:\(\mathbf Z_tu_t\) 序列不相关。无需 HAC,本节公式全部可以推广。这在现代金融与宏观计量中很常见:误差代表未预期、不可预测的扰动,模型本身通常意味着 \(\mathbf Z_tu_t\) 序列不相关。例如 \(Y_t=\beta_0+\beta_1X_t+u_t\)(一个内生变量、无外生变量),若理论意味着 \(u_t\) 在给定过去信息时不可预测,则有矩条件
这正是 Hansen 用 GMM 检验资产定价欧拉方程的框架。消费资本资产定价模型的欧拉方程是
白话解释:记号 \(E_t[\cdot]\) 是「给定 \(t\) 期所有已知信息的条件期望」。欧拉方程里 \(\delta(C_{t+1}/C_t)^{-\gamma}\) 就是随机贴现因子 \(m_{t+1}\):\(\delta\) 是时间偏好(耐心程度),\(\gamma\) 是相对风险厌恶系数。方程 \(E_t[m_{t+1}R_{t+1}]=1\) 说的是「今天花 1 元买资产,明天收益用边际效用折回今天,平均仍值 1 元」,与 CFA 里「价格 = 未来现金流的风险调整贴现」是同一句话。 推导拆解:从条件矩到无条件矩,用的是迭代期望。设 \(e_{t+1}\) 为定价误差,\(E_t(e_{t+1})=0\),\(z_t\) 在 \(t\) 期已知,则 \(E(e_{t+1}z_t)=E[z_tE_t(e_{t+1})]=E[z_t\cdot0]=0\)。任何 \(t\) 期已知的变量(股息率、利差、上期消费增长)都能生成一个矩条件,所以矩条件可以远多于参数,GMM 和 J 检验正好派上用场。
附录 19.6 IV 与 GMM 若干结果的证明
同方差下 TSLS 的有效性 (19.62)。利用 \((\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX}=\mathbf I\),把 \(\boldsymbol\Sigma^{TSLS}\) 写成与 \(\boldsymbol\Sigma^{IV}_A\) 相同的「外壳」:
这与附录 19.5 的高斯–马尔可夫证明如出一辙:差值是某个正交投影的二次型。
同方差下 J 统计量的渐近分布。TSLS 残差
有效 GMM 的有效性:证明与 TSLS 平行,只是把 \(\mathbf Q_{ZZ}\sigma_u^2\) 换成 \(\mathbf H\)。GMM J 统计量的分布:与同方差 TSLS 的 J 平行,把 \(\mathbf Q_{ZZ}\sigma_u^2\) 换成 \(\mathbf H\) 即可。
第 19 章总结(原书 Summary,含 19a 章)
- 线性多元回归的矩阵形式为 \(\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U\)。
- OLS 估计量为 \(\hat{\boldsymbol\beta}=(\mathbf X'\mathbf X)^{-1}\mathbf X'\mathbf Y\);前四条假设下一致、渐近正态;同方差时 \(\mathrm{var}(\hat{\boldsymbol\beta}\mid\mathbf X)=\sigma_u^2(\mathbf X'\mathbf X)^{-1}\)。
- 一般线性约束写成 \(\mathbf R\boldsymbol\beta=\mathbf r\),可用于联合检验和置信集。
- 误差条件 i.i.d. 正态时,\(\hat{\boldsymbol\beta}\) 精确正态,仅同方差 t、F 统计量精确服从 \(t_{n-k-1}\)、\(F_{q,n-k-1}\)。
- 高斯–马尔可夫定理:误差同方差、条件不相关、\(E(u_i\mid\mathbf X)=0\) 时,OLS 是 BLUE。
- 误差协方差 \(\boldsymbol\Omega\) 不正比于单位阵且已知或可估时,GLS 渐近比 OLS 有效;但 GLS 一般要求 \(u_i\) 与所有观测的回归元不相关(OLS 只要求与 \(\mathbf X_i\) 不相关),应用中须审慎评估。
- TSLS 属于线性模型的 GMM 估计量族,解 \(\min_{\mathbf b}[(\mathbf Y-\mathbf X\mathbf b)'\mathbf Z]\mathbf A[\mathbf Z'(\mathbf Y-\mathbf X\mathbf b)]\);渐近有效 GMM 取 \(\mathbf A=[E(\mathbf Z_i\mathbf Z_i'u_i^2)]^{-1}\);同方差时它就是 TSLS。
量化实战
1. 本章内容在量化中的用途
GLS 与横截面检验。 资产收益横截面回归中,残差协方差非对角(行业、风格相关)。GLS 用残差协方差的逆加权,这与均值–方差组合优化 \(\mathbf w\propto\boldsymbol\Sigma^{-1}\boldsymbol\mu\) 的结构完全相同:GLS 斜率本质上是一个最小方差的「因子模拟组合」的收益。时间序列因子模型的 GRS 检验、横截面 GLS 回归都依赖这一框架。实务中 \(\boldsymbol\Omega\) 维数很高(几千只股票),要用因子结构 \(\mathbf B\boldsymbol\Sigma_F\mathbf B'+\mathbf D\) 来估计(17d 章),否则 \(\hat{\boldsymbol\Omega}^{-1}\) 噪声极大。
GLS 的严格外生警示。 用价格、利率、估值这类「预期驱动」的变量做回归元时,误差往往与未来回归元相关。此时 Cochrane–Orcutt、Prais–Winsten 等 GLS 修正可能不一致。原书的结论在量化中同样适用:宁可 OLS + HAC。
IV 在量化中的位置。 量化研究较少直接做因果 IV,但几个场景常见:解决变量误差(errors-in-variables,如 Fama–MacBeth 第二阶段用估计的 beta,可以用不同窗口估计的 beta 作工具);处理同时性(交易量与波动、订单流与价格冲击);估计市场冲击模型时以外生的指数调整、基金被动流入作工具。
GMM 是资产定价的标准估计方法。 随机贴现因子模型 \(E[m_{t+1}R^e_{i,t+1}]=0\) 是矩条件;线性 SDF \(m=1-\mathbf b'\mathbf f\) 下这些矩条件关于 \(\mathbf b\) 是线性的,可以直接套用本章的线性 GMM 公式。J 检验就是模型整体检验(各资产定价误差联合为零);两步有效 GMM、权重矩阵的选择、误差序列相关时用 HAC 估计 \(\mathbf H\),都直接用于因子模型定价检验和期限结构模型估计。一个实务细节:有效 GMM 的权重 \(\hat{\mathbf H}^{-1}\) 会把精力放在「容易定价的组合线性组合」上,经济含义不直观,所以许多研究同时报告单位权重(一步 GMM)的结果。
2. 示例一:GLS 何时比 OLS 好,何时不一致
误差为 MA(1):\(u_t=e_t+0.8e_{t-1}\),\(\boldsymbol\Omega\) 已知(三对角)。情形一,回归元严格外生;情形二,回归元对过去冲击有反馈:\(x_t\) 含 \(e_{t-1}\),并减去 \(\theta e_t\) 使它与当期 \(u_t\) 不相关(OLS 假设成立),但 \(x_{t+1}\) 含 \(e_t\),所以 \(u_t\) 与未来回归元相关。
import numpy as np
rng = np.random.default_rng(23)
T, nsim, beta, theta = 300, 2000, 1.0, 0.8
# 误差 u_t = e_t + theta*e_{t-1}(MA(1)),其协方差矩阵 Omega 已知:三对角
Omega = np.diag(np.full(T, 1 + theta**2)) + np.diag(np.full(T-1, theta), 1) + np.diag(np.full(T-1, theta), -1)
Oinv = np.linalg.inv(Omega)
def ols(X, y):
return np.linalg.solve(X.T @ X, X.T @ y)
def gls(X, y):
return np.linalg.solve(X.T @ Oinv @ X, X.T @ Oinv @ y) # (X'Ω^{-1}X)^{-1} X'Ω^{-1}Y
for gamma, label in [(0.0, "严格外生 (gamma=0)"), (0.8, "x 对过去冲击有反馈 (gamma=0.8)")]:
bo, bg = [], []
for _ in range(nsim):
e = rng.standard_normal(T + 1)
u = e[1:] + theta * e[:-1]
# x_t = z_t + gamma*e_{t-1} - gamma*theta*e_t :与当期 u_t 不相关(OLS 假设成立),
# 但 x_{t+1} 含 e_t,因而与 u_t 相关(GLS 需要的严格外生不成立)
x = rng.standard_normal(T) + gamma * e[:-1] - gamma * theta * e[1:]
X = np.c_[np.ones(T), x]
y = X @ np.array([0.5, beta]) + u
bo.append(ols(X, y)[1]); bg.append(gls(X, y)[1])
print(f"{label:28s} OLS: 均值 {np.mean(bo):.3f}, sd {np.std(bo):.3f} | "
f"GLS: 均值 {np.mean(bg):.3f}, sd {np.std(bg):.3f}")
输出:
严格外生 (gamma=0) OLS: 均值 0.997, sd 0.075 | GLS: 均值 1.000, sd 0.036
x 对过去冲击有反馈 (gamma=0.8) OLS: 均值 1.000, sd 0.038 | GLS: 均值 0.920, sd 0.013
严格外生时,两者都无偏,GLS 的标准差只有 OLS 的一半,效率优势明显。回归元对过去冲击有反馈时,OLS 依然无偏(只需当期外生);GLS 却系统性偏到 0.92,而且标准差很小(0.013),也就是说它会「很自信地给出错误答案」。验证 \(\mathrm{cov}(x_t,u_t)=\gamma\theta-\gamma\theta=0\) 而 \(\mathrm{cov}(x_{t+1},u_t)=\gamma\ne0\),正是 19.6.5 节描述的情形。
3. 示例二:TSLS、两步有效 GMM 与 J 检验
一个内生回归元、三个工具(过度识别 2 个),误差方差依赖第一个工具(异方差)。比较 TSLS 与有效 GMM 的抽样标准差,并检验 J 统计量在工具有效和存在一个无效工具时的拒绝率。
import numpy as np
from scipy import stats
rng = np.random.default_rng(31)
def tsls_gmm(Y, X, Z):
n = len(Y)
PZ_X = Z @ np.linalg.solve(Z.T @ Z, Z.T @ X) # Xhat = P_Z X
b_tsls = np.linalg.solve(PZ_X.T @ X, PZ_X.T @ Y) # (X'P_Z X)^{-1} X'P_Z Y
u = Y - X @ b_tsls # 注意用原始 X 计算残差
H = (Z * u[:, None] ** 2).T @ Z / n # H_hat = (1/n) sum Z_i Z_i' u_i^2
Hi = np.linalg.inv(H)
A = X.T @ Z @ Hi @ Z.T
b_gmm = np.linalg.solve(A @ X, A @ Y) # 两步有效 GMM (19.68)
# 稳健方差:TSLS 用三明治 (19.52),GMM 用 (Q_XZ H^-1 Q_ZX)^-1
Qxz, Qzz = X.T @ Z / n, Z.T @ Z / n
B = np.linalg.inv(Qxz @ np.linalg.solve(Qzz, Qxz.T))
S_tsls = B @ Qxz @ np.linalg.solve(Qzz, H) @ np.linalg.solve(Qzz, Qxz.T) @ B
S_gmm = np.linalg.inv(Qxz @ Hi @ Qxz.T)
ug = Y - X @ b_gmm
g = Z.T @ ug
J = g @ Hi @ g / n # GMM J (19.70)
return b_tsls, np.sqrt(np.diag(S_tsls) / n), b_gmm, np.sqrt(np.diag(S_gmm) / n), J
n, nsim = 1000, 1000
bt, bg, Js, Js_bad = [], [], [], []
for s in range(nsim):
Z3 = rng.standard_normal((n, 3)) # 3 个排除工具,1 个内生回归元 => m-k = 2
v = rng.standard_normal(n)
x = Z3 @ np.array([0.5, 0.3, 0.2]) + v
u = (0.6 * v + 0.8 * rng.standard_normal(n)) * np.exp(0.7 * Z3[:, 0]) # 内生 + 依赖工具的异方差
Y = 1.0 + 2.0 * x + u
X, Z = np.c_[np.ones(n), x], np.c_[np.ones(n), Z3]
b1, se1, b2, se2, J = tsls_gmm(Y, X, Z)
bt.append(b1[1]); bg.append(b2[1]); Js.append(J)
# 一个无效工具:第三个工具直接进入 Y
Ybad = Y + 0.15 * Z3[:, 2]
Js_bad.append(tsls_gmm(Ybad, X, Z)[4])
if s == 0:
print(f"单次样本: TSLS b={b1[1]:.3f} (se {se1[1]:.3f}) | 有效GMM b={b2[1]:.3f} (se {se2[1]:.3f}) | J={J:.2f}")
print(f"抽样标准差: TSLS {np.std(bt):.4f}, 有效GMM {np.std(bg):.4f}")
crit = stats.chi2.ppf(0.95, 2)
print(f"J 统计量 5% 拒绝率: 工具全部有效 {np.mean(np.array(Js) > crit):.3f}, 含一个无效工具 {np.mean(np.array(Js_bad) > crit):.3f}")
输出:
单次样本: TSLS b=1.993 (se 0.110) | 有效GMM b=2.042 (se 0.100) | J=1.28
抽样标准差: TSLS 0.1320, 有效GMM 0.1105
J 统计量 5% 拒绝率: 工具全部有效 0.051, 含一个无效工具 0.687
异方差下有效 GMM 的抽样标准差比 TSLS 小约 16%。J 统计量在工具全部有效时拒绝率 5.1%,符合 \(\chi^2_2\) 的名义水平;有一个工具违反外生性时,拒绝率升到 69%。另外注意,严重异方差下 TSLS 单次样本的稳健标准误(0.110)低于它的实际抽样标准差(0.132),提示有限样本中稳健标准误也可能偏小。
4. 示例三:用 GMM 估计线性随机贴现因子并做 J 检验
线性 SDF \(m_t=1-bf_t\),\(f_t\) 是市场超额收益。\(N=10\) 个组合的超额收益满足 \(E[R^e_{it}(1-bf_t)]=0\),即样本矩 \(\mathbf g(b)=\bar{\mathbf R}^e-\overline{\mathbf R^ef}\,b\),关于 \(b\) 线性。一步用单位权重,二步用 \(\hat{\mathbf S}^{-1}\)(\(\hat{\mathbf S}\) 是矩贡献的协方差,即本章的 \(\mathbf H\)),\(J=T\mathbf g'\hat{\mathbf S}^{-1}\mathbf g\sim\chi^2_{N-1}\)。
import numpy as np
from scipy import stats
rng = np.random.default_rng(13)
def sdf_gmm(R, f):
"""线性 SDF m_t = 1 - b f_t,矩条件 E[R_t^e (1 - b f_t)] = 0(N 个方程,1 个参数)"""
T, N = R.shape
mu, D = R.mean(0), (R * f[:, None]).mean(0) # g(b) = mu - D b
def est(W):
return (D @ W @ mu) / (D @ W @ D)
b1 = est(np.eye(N)) # 第一步:单位权重
h = R * (1 - b1 * f)[:, None] # 各期矩贡献(i.i.d.,无需 HAC)
S = np.cov(h.T, bias=True)
Si = np.linalg.inv(S)
b2 = est(Si) # 第二步:有效权重 S^{-1}
g = mu - D * b2
se = np.sqrt(1 / (D @ Si @ D) / T)
J = T * g @ Si @ g # ~ chi2(N-1)
return b2, se, J, g
T, N = 600, 10 # 50 年月度数据,10 个组合
beta = np.linspace(0.5, 1.5, N)
def simulate(alpha):
f = 0.6 + 4.5 * rng.standard_normal(T) # 市场超额收益 (%),均值 0.6
eps = 2.0 * rng.standard_normal((T, N)) * (1 + 0.3 * np.abs(f[:, None]) / 4.5)
return alpha + f[:, None] * beta + eps, f
R, f = simulate(np.zeros(N))
b, se, J, g = sdf_gmm(R, f)
print(f"CAPM 成立: b={b:.4f} (se {se:.4f}), J={J:.2f}, p={stats.chi2.sf(J, N-1):.3f}")
print(" 理论 b = E f / E f^2 =", round(0.6 / (0.6**2 + 4.5**2), 4))
alpha = np.zeros(N); alpha[:3] = 0.35 # 三个组合有 0.35%/月 的定价误差
R, f = simulate(alpha)
b, se, J, g = sdf_gmm(R, f)
print(f"存在 alpha: b={b:.4f} (se {se:.4f}), J={J:.2f}, p={stats.chi2.sf(J, N-1):.4f}")
print(" 定价误差 g (%/月):", g.round(2))
# J 检验的水平
Js = [sdf_gmm(*simulate(np.zeros(N)))[2] for _ in range(1000)]
print("零假设下 J 的 5% 拒绝率:", np.mean(np.array(Js) > stats.chi2.ppf(0.95, N-1)).round(3))
输出:
CAPM 成立: b=0.0346 (se 0.0083), J=10.46, p=0.315
理论 b = E f / E f^2 = 0.0291
存在 alpha: b=0.0424 (se 0.0087), J=59.63, p=0.0000
定价误差 g (%/月): [ 0.4 0.36 0.16 -0.15 -0.21 -0.3 -0.35 -0.28 -0.21 -0.38]
零假设下 J 的 5% 拒绝率: 0.06
解读:模型成立时,\(\hat b=0.035\),与理论值 \(E f/E f^2=0.029\) 相差不到一个标准误,J 检验不拒绝(\(p=0.32\))。三个组合存在每月 0.35% 的 alpha 时,J 高达 59.6,强烈拒绝。注意估计出的定价误差 \(\mathbf g\) 不只集中在那三个组合上:GMM 调整 \(b\) 去「迁就」所有矩条件,把误差分摊到其他组合上(这就是为什么检验要看联合的 J,而不是逐个看 \(g_i\))。1000 次模拟中 J 的拒绝率 6%,接近名义 5%。这里矩贡献 \(h_t\) 是 i.i.d. 的,对应 19.7.7 节的情形二,无需 HAC;如果用重叠收益或误差序列相关,\(\hat{\mathbf S}\) 必须改用 Newey–West。
本章小结
GLS 把模型左乘 \(\boldsymbol\Omega^{-1}\) 的平方根,使变换后的误差满足高斯–马尔可夫条件,得到 BLUE \((\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}\mathbf X'\boldsymbol\Omega^{-1}\mathbf Y\);\(\boldsymbol\Omega\) 未知时用可行 GLS,WLS 是对角情形的特例。但 GLS 需要严格外生 \(E(\mathbf U\mid\mathbf X)=\mathbf 0\),在预期驱动的时间序列中常不成立,这时 GLS 不一致而 OLS 一致。IV 回归中,TSLS \(=(\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf Y\),异方差下渐近协方差是以 \(\mathbf H=E(\mathbf Z_i\mathbf Z_i'u_i^2)\) 为「肉」的三明治,残差须用原始 \(\mathbf X\) 计算。TSLS 是权重 \((\mathbf Z'\mathbf Z)^{-1}\) 的线性 GMM;同方差下它就是有效 GMM,异方差下有效 GMM 的权重是 \(\mathbf H^{-1}\),两步法可行且渐近有效,GMM J 统计量渐近服从 \(\chi^2_{m-k}\)。时间序列中,误差序列相关时 \(\mathbf H\) 要用 HAC 估计;误差是不可预测的冲击时则无需 HAC,这正是资产定价欧拉方程 GMM 检验的框架。
| 概念 | 公式 / 要点 |
|---|---|
| GLS | \((\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}\mathbf X'\boldsymbol\Omega^{-1}\mathbf Y\),方差 \((\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}\) |
| GLS 的变换 | \(\mathbf F'\mathbf F=\boldsymbol\Omega^{-1}\),\(\mathbf F\boldsymbol\Omega\mathbf F'=\mathbf I\) |
| 外生性 | OLS:\(E(u_i\mid\mathbf X_i)=0\);GLS:\(E(\mathbf U\mid\mathbf X)=\mathbf 0\)(严格外生) |
| TSLS | \((\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf Y\) |
| TSLS 方差 | \((\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf H\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX}(\cdot)^{-1}\) |
| 线性 GMM | \((\mathbf X'\mathbf Z\mathbf A\mathbf Z'\mathbf X)^{-1}\mathbf X'\mathbf Z\mathbf A\mathbf Z'\mathbf Y\) |
| 有效 GMM | \(\mathbf A=\mathbf H^{-1}\);方差 \((\mathbf Q_{XZ}\mathbf H^{-1}\mathbf Q_{ZX})^{-1}\) |
| 两步法 | TSLS → \(\hat{\mathbf H}\) → 权重 \(\hat{\mathbf H}^{-1}\) |
| J 统计量 | \((\mathbf Z'\hat{\mathbf U})'\hat{\mathbf H}^{-1}(\mathbf Z'\hat{\mathbf U})/n\xrightarrow{d}\chi^2_{m-k}\) |
| 时间序列 | \(\mathbf Z_tu_t\) 序列相关 → HAC 估计 \(\mathbf H\);鞅差分误差 → 不需要 |
练习
基础
- (原书复习题 19.4)什么情况下 GLS 比 OLS 更有效?为什么实践中常常不用 GLS? 答案要点:误差协方差非球形且已知(或可一致估计)、严格外生成立时;\(\boldsymbol\Omega\) 难以正确设定,且严格外生常不成立。
- (原书复习题 19.5)构造一个满足 \(E(u_i\mid X_i)=0\) 但 \(E(\mathbf U\mid\mathbf X)\ne\mathbf 0\) 的例子。 提示:\(X_t=Y_{t-1}\) 的自回归。
- 证明当 \(\boldsymbol\Omega=\sigma^2\mathbf I\) 时 GLS 等于 OLS;当 \(\boldsymbol\Omega\) 对角、对角元为 \(\lambda h(X_i)\) 时 GLS 等于 WLS。
- 恰好识别(\(m=k\))时,证明对任意可逆的 \(\mathbf A\),(19.59) 都等于 \((\mathbf Z'\mathbf X)^{-1}\mathbf Z'\mathbf Y\)。这说明什么? 提示:\(\mathbf X'\mathbf Z\) 是方阵且可逆,\(\mathbf A\) 相消;恰好识别时权重无关紧要,J 恒为零。
- 手工做两阶段回归时,为什么第二阶段软件报告的标准误是错的? 提示:残差用了 \(\hat{\mathbf X}\) 而不是 \(\mathbf X\),\(\hat\sigma_u^2\) 估计错误。
进阶
- (原书习题 19.8)\(u_i=0.5u_{i-1}+\tilde u_i\),\(\tilde u_i\) i.i.d.。写出 \(\boldsymbol\Omega\),并给出不必显式求逆的 GLS 变换(准差分,第一个观测乘以 \(\sqrt{1-0.25}\))。 提示:\(\Omega_{ij}=\sigma_{\tilde u}^2\,0.5^{|i-j|}/(1-0.25)\)。
- 在示例一中,把误差改为 AR(1)(\(\rho=0.7\)),回归元反馈改为 \(x_t\) 含 \(u_{t-1}\) 的新息部分但与 \(u_t\) 不相关。重新设计 \(x_t\) 使 OLS 一致而 GLS(准差分)不一致,并用模拟验证。 提示:准差分后的误差 \(u_t-\rho u_{t-1}\) 与 \(x_t-\rho x_{t-1}\) 的相关涉及 \(\mathrm{cov}(x_t,u_{t-1})\)。
- (原书习题 19.12)证明有效 GMM 是 (19.65) 的解;证明两步估计量与不可行有效 GMM 渐近等价;证明 \(J^{GMM}\xrightarrow{d}\chi^2_{m-k}\)。
- (原书习题 19.14)证明 (19.63) 与 Key Concept 12.6 的 J 统计量相等。 提示:TSLS 残差与包含的外生变量 \(\mathbf W\) 和常数正交(正规方程),对 \(\mathbf Z\) 回归时它们的系数为零。
- 在示例三中,把因子换成两个(市场与一个风格因子),SDF 为 \(m=1-b_1f_1-b_2f_2\)。写出线性 GMM 的矩阵公式,并检验「风格因子不被定价」(\(b_2=0\))。再把收益换成 12 个月重叠收益,说明 \(\hat{\mathbf S}\) 应如何修改。 提示:\(\mathbf g(\mathbf b)=\bar{\mathbf R}^e-\mathbf D\mathbf b\),\(\mathbf D=\frac1T\sum\mathbf R^e_t\mathbf f_t'\);重叠时用 Newey–West,滞后至少 11。
原书推荐习题:19.8(AR(1) 误差的 GLS 与准差分);19.12、19.14(有效 GMM 与 J 统计量);复习题 19.4、19.5。
原书对照
| 本章内容 | 原书章节 | PDF 页码 |
|---|---|---|
| GLS:动机、假设、\(\boldsymbol\Omega\) 已知与可行 GLS、条件均值零假设(Key Concept 19.4,式 19.40–19.44) | 19.6 | p.729–734 |
| IV 与 GMM:TSLS、渐近分布、IV 估计量族、J 统计量、有效 GMM、时间序列中的 GMM(式 19.45–19.71) | 19.7 | p.734–742 |
| 复习题与习题 | 第 19 章末 | p.743–749 |
| 附录 19.6 IV 与 GMM 结果的证明(式 19.85–19.93) | 附录 19.6 | p.757–759 |
| SDF 的 GMM 估计、GLS 不一致的模拟(本教材补充) | — | — |
注:原书页码 = PDF 页码 − 1。