量化交易中文教材

元信息:James H. Stock & Mark W. Watson《Introduction to Econometrics》(Global Edition, 4th ed.);本笔记负责 PDF 第 650–801 页(第 17 章、第 18 章、第 19 章及附录、术语表等书末内容)。 说明:各节标题中的页码均为 PDF 页码;原书印刷页码 = PDF 页码 − 1(正文中引用的"原书第 x 页"、索引页码均为印刷页码)。本块从第 17 章开头开始,到全书结束,无跨块续接。

第 17 章 时间序列回归的其他专题(Additional Topics in Time Series Regression)

本章导言(PDF p.650)

第 15 章只讨论单变量、一步预测。本章扩展五个方向:

  • 17.1 向量自回归(VAR):同时预测多个变量(如 GDP 增长率与通胀),保证预测间相互一致。
  • 17.2 多期预测(multi-period / multi-step forecasts):预测 2、3……期之后。
  • 17.3、17.4 回到 15.6 节的随机趋势:引入更多随机趋势模型(单整阶数),以及协整(cointegration)——两个变量共享同一随机趋势,即各自含随机趋势、但某个加权差不含。
  • 17.5 波动率聚集(volatility clustering)与条件异方差(conditional heteroskedasticity):金融数据中方差随时间变化。应用:随时间宽窄变化的预测区间;预测资产收益的不确定性,用于风险评估和衍生品定价。
  • 17.6 多预测变量下的预测:用主成分分析(principal components analysis)把大量时间序列压缩成少数几个序列,框架为动态因子模型(dynamic factor model, DFM),该模型也可用于预测以外的用途。

17.1 向量自回归(Vector Autoregressions, VAR)(PDF p.650–654)

动机

预测者需要同时预测通胀、失业率、利率等。可以每个变量单独建模(15.4 节方法),也可以用一个模型同时预测所有变量,使预测相互一致。VAR 把单变量自回归推广到一个"向量"的时间序列。

定义(Key Concept 17.1)

VAR 是 \(k\) 个时间序列回归组成的方程组,每个方程的回归元是全部 \(k\) 个序列的滞后值。若每个方程的滞后阶数都为 \(p\),称为 VAR(\(p\))。两变量 \(Y_t, X_t\) 的 VAR(\(p\)):

\[Y_t=\beta_{10}+\beta_{11}Y_{t-1}+\cdots+\beta_{1p}Y_{t-p}+\gamma_{11}X_{t-1}+\cdots+\gamma_{1p}X_{t-p}+u_{1t}\tag{17.1}\]
\[X_t=\beta_{20}+\beta_{21}Y_{t-1}+\cdots+\beta_{2p}Y_{t-p}+\gamma_{21}X_{t-1}+\cdots+\gamma_{2p}X_{t-p}+u_{2t}\tag{17.2}\]

VAR 假设 = Key Concept 15.6 的时间序列回归假设分别施加于每个方程。系数估计:逐个方程做 OLS。

VAR 中的推断

在 VAR 假设下,OLS 估计量一致,大样本下联合正态,因此常规推断照用(如 95% 置信区间 = 估计值 ± 1.96 SE)。新问题:VAR 是方程系统,可以检验跨方程的联合假设。例:检验滞后阶数是 \(p\) 还是 \(p-1\):

\[H_0:\ \beta_{1p}=0,\ \beta_{2p}=0,\ \gamma_{1p}=0,\ \gamma_{2p}=0\tag{17.3}\]

备择为至少一个非零。该原假设涉及两个方程各两个系数。由于系数估计大样本联合正态,可用 F 统计量检验;公式记号复杂,书中省略,现代软件均可自动完成。

VAR 应包含多少变量

每个方程的系数个数与变量数成正比。例:5 变量 4 滞后,每个方程 21 个系数(4×5+截距),5 个方程共 105 个系数。按 14.2 节,用 OLS 估计过多系数会增加进入预测的估计误差,使均方预测误差(MSFE)恶化。因此用 OLS 估计时变量数要少,并精心挑选:变量之间应有合理关联(如 GDP 增长率、期限利差、通胀由经验和理论知其相关)。加入无关变量只增加估计误差而不增加预测力。另一路线是用很多变量但不用 OLS(17.6 节)。

滞后阶数选择

可用 F 检验或信息准则。系统信息准则需要矩阵记号(附录 19.1)。设 \(\Sigma_u\) 为 \(k\times k\) 的 VAR 误差协方差矩阵,其估计 \(\hat\Sigma_u\) 的 \((i,j)\) 元素为 \(\frac1T\sum_{t=1}^T\hat u_{it}\hat u_{jt}\)(\(\hat u_{it}\) 为第 \(i\) 个方程的 OLS 残差)。VAR 的 BIC:

\[\mathrm{BIC}(p)=\ln[\det(\hat\Sigma_u)]+k(kp+1)\frac{\ln T}{T}\tag{17.4}\]

AIC 把 \(\ln T\) 换成 2。单方程时第一项退化为 \(\ln[SSR(p)/T]\)。第二项是惩罚项,\(k(kp+1)\) 是 VAR 中回归系数总数(\(k\) 个方程,每个有截距和 \(k\) 个变量各 \(p\) 阶滞后)。在候选 \(p\) 中选使 BIC 最小者为 \(\hat p\)。

VAR 用于因果分析

VAR 最初由 Christopher Sims (1980) 引入经济学,目的正是因果分析,称为结构 VAR(structural VAR)建模——"结构"指用 VAR 刻画经济的内在结构。它使用本节预测工具加上额外工具。与预测用途最大的概念区别:结构建模需要来自经济理论和制度知识的、非常具体的关于何者外生的假设。完整讨论属于联立方程组估计,超出本书范围;参考 Stock & Watson (2001)(入门)、Kilian & Lütkepohl (2017)(研究生教材)。

例:GDP 增长率与期限利差的 VAR(PDF p.654)

因 15.7 节 QLR 检验发现 1980 年代初存在断点,样本取 1981:Q1–2017:Q3。VAR(2) 估计(括号为标准误):

\[\widehat{GDPGR}_t=\underset{(0.50)}{0.54}+\underset{(0.11)}{0.29}GDPGR_{t-1}+\underset{(0.08)}{0.20}GDPGR_{t-2}-\underset{(0.35)}{0.86}TSpread_{t-1}+\underset{(0.39)}{1.18}TSpread_{t-2},\quad \bar R^2=0.27\tag{17.5}\]
\[\widehat{TSpread}_t=\underset{(0.12)}{0.44}+\underset{(0.02)}{0.01}GDPGR_{t-1}-\underset{(0.03)}{0.05}GDPGR_{t-2}+\underset{(0.10)}{1.06}TSpread_{t-1}-\underset{(0.11)}{0.22}TSpread_{t-2},\quad \bar R^2=0.82\tag{17.6}\]

可预测性检验(即 Granger 因果检验思路):GDP 方程中 \(TSpread\) 两阶滞后系数全为 0 的 F = 5.60,p < 0.001,拒绝——期限利差在控制 GDP 自身滞后后对 GDP 增长有预测力;利差方程中 GDPGR 两阶滞后全为 0 的 F = 3.22,p = 0.04,5% 水平下 GDP 增长也帮助预测利差。

一步预测:\(\widehat{GDPGR}_{2017:Q4|2017:Q3}=2.8\%\),\(\widehat{TSpread}_{2017:Q4|2017:Q3}=1.3\) 个百分点;实际值分别为 2.5% 和 1.2 个百分点。


17.2 多期预测(Multi-period Forecasts)(PDF p.655–659)

两种方法:迭代预测(iterated forecasts)——把一步模型逐期向前迭代;直接预测(direct forecasts)——以多期后的变量为因变量做回归。多数应用中推荐迭代法。

迭代多期预测

思想:用模型做 \(T+1\) 期预测,再把 \(T+1\) 的预测值当作数据,做 \(T+2\) 期预测,如此迭代直至目标步长 \(h\)。一步预测(one-step ahead forecast)是中间步骤。

AR(1) 例:\(\widehat{GDPGR}_t=\underset{(0.32)}{1.95}+\underset{(0.07)}{0.34}GDPGR_{t-1}\) (17.7)。2017:Q3 实际值 3.11:

  • 第一步:\(\widehat{GDPGR}_{2017:Q4|2017:Q3}=1.95+0.34\times3.11=3.0\);
  • 第二步:\(\widehat{GDPGR}_{2018:Q1|2017:Q3}=1.95+0.34\times3.0=3.0\)。

AR(2) 例:\(\widehat{GDPGR}_t=\underset{(0.37)}{1.60}+\underset{(0.08)}{0.28}GDPGR_{t-1}+\underset{(0.08)}{0.18}GDPGR_{t-2}\) (17.8)。一步预测 3.0(15.3 节算过);两步:\(1.60+0.28\times3.0+0.18\times3.1=3.0\)。

迭代 VAR 预测:新特点是 \(T+2\) 期某变量的预测依赖 \(T+1\) 期所有变量的预测。一般地,要做 \(h\) 步迭代 VAR 预测,须预测所有变量在 \(T\) 与 \(T+h\) 之间每一期的值。例:用 (17.5)(17.6),先得一步预测 GDPGR = 2.8、TSpread = 1.3,再代入:

\[\widehat{GDPGR}_{2018:Q1|2017:Q3}=0.54+0.29\times2.8+0.20\times3.1-0.86\times1.3+1.28\times1.2=2.4\tag{17.9}\]

(注:原书 (17.9) 中 \(TSpread_{t-2}\) 的系数印为 1.28,与 (17.5) 的 1.18 不一致,应为排印差异;结论 2.4%。)

Key Concept 17.2 迭代多期预测公式:AR(\(p\)) 的两步、三步预测

\[\hat Y_{T+2|T}=\hat\beta_0+\hat\beta_1\hat Y_{T+1|T}+\hat\beta_2Y_T+\hat\beta_3Y_{T-1}+\cdots+\hat\beta_pY_{T-p+2}\tag{17.10}\]
\[\hat Y_{T+3|T}=\hat\beta_0+\hat\beta_1\hat Y_{T+2|T}+\hat\beta_2\hat Y_{T+1|T}+\hat\beta_3Y_T+\cdots+\hat\beta_pY_{T-p+3}\tag{17.11}\]

两变量 VAR(\(p\)) 的两步预测:

\[\hat Y_{T+2|T}=\hat\beta_{10}+\hat\beta_{11}\hat Y_{T+1|T}+\hat\beta_{12}Y_T+\cdots+\hat\beta_{1p}Y_{T-p+2}+\hat\gamma_{11}\hat X_{T+1|T}+\hat\gamma_{12}X_T+\cdots+\hat\gamma_{1p}X_{T-p+2}\tag{17.12}\]

直接多期预测

用单一回归,因变量为多期后的目标变量,回归元为预测变量,系数可"直接"给出预测,无需迭代。做法:以 ADL 模型为起点,把预测变量多滞后若干期。例如两期预测、两阶滞后:因变量 \(Y_t\),回归元 \(Y_{t-2},Y_{t-3},X_{t-2},X_{t-3}\);预测时代入 \(Y_T,Y_{T-1},X_T,X_{T-1}\) 即得 \(\hat Y_{T+2}\)。一般地,\(h\) 步直接回归中所有预测变量都滞后 \(h\) 期。

例(HAC 标准误):

\[\widehat{GDPGR}_{t|t-2}=\underset{(0.63)}{0.56}+\underset{(0.07)}{0.31}GDPGR_{t-2}+\underset{(0.09)}{0.04}GDPGR_{t-3}+\underset{(0.46)}{0.56}TSpread_{t-2}+\underset{(0.45)}{0.04}TSpread_{t-3}\tag{17.13}\]
代入 2017:Q3、Q2 数据得 2018:Q1 的直接两步预测 = 2.4 (17.14)。三步直接预测则把所有回归元再滞后一期重新估计。

直接回归的标准误:因变量在 2 期以上之后,误差项必然序列相关。直观例子:若下季度突发油价上涨,本季度做的两步预测偏高,上季度做的两步预测(针对同一时点或相邻时点)也偏高——中间事件使相邻预测误差同向。按 16.4 节,误差序列相关时普通 OLS 标准误不可靠,必须用异方差与自相关一致(HAC)标准误。(17.13) 用 Newey–West HAC,截断参数 \(m\) 按 (16.17) 设定(\(T=147\) 时 \(m=4\))。步长越长,重叠越多、序列相关越强:\(h\) 步回归误差的前 \(h-1\) 个自相关系数一般非零,所以长步长时 \(m\) 应大于 (16.17) 的值。

Key Concept 17.3 直接多期预测:基于 \(Y_t\) 和 \(X_t\) 各 \(p\) 阶滞后的 \(h\) 步直接预测,先估计

\[Y_t=\delta_0+\delta_1Y_{t-h}+\cdots+\delta_pY_{t-p-h+1}+\delta_{p+1}X_{t-h}+\cdots+\delta_{2p}X_{t-p-h+1}+u_t\tag{17.15}\]
再用估计系数和截至 \(T\) 的数据直接预测 \(Y_{T+h}\)。

该用哪种方法

多数情况下推荐迭代法,两点理由:

  1. 理论上:若一步模型(AR 或 VAR)设定正确,用一步回归估计系数再迭代比用多步回归估计更有效率。
  2. 实践上:预测者通常要多个步长的预测;迭代预测来自同一模型,跨步长的时间路径较平滑;直接法每个步长用不同模型,系数抽样误差会给预测序列带来随机波动。

直接法更可取的情形:有理由认为一步模型设定错误。例如 VAR 中目标变量方程正确、但其他方程遗漏了非线性项。一步模型设定错误时,迭代多期预测一般有偏,其 MSFE 可能超过直接预测,尽管直接预测方差更大。


17.3 单整阶数与单位根检验统计量的非正态性(PDF p.659–663)

其他趋势模型与单整阶数

回顾带漂移 \(\beta_0\) 的随机游走:\(Y_t=\beta_0+Y_{t-1}+u_t\) (17.16),\(u_t\) 序列不相关,有一个等于 1 的自回归根。有些经济序列的趋势比随机游走更平滑(相邻期变化更小)。一种平滑趋势模型是让趋势的一阶差分服从随机游走:

\[\Delta Y_t=\beta_0+\Delta Y_{t-1}+u_t\tag{17.17}\]

此时 \(\Delta Y_t\) 为随机游走,二阶差分(second difference)\(\Delta^2Y_t=\Delta Y_t-\Delta Y_{t-1}\) 平稳;\(\Delta Y_t\) 有单位自回归根。

术语:含随机游走趋势的序列为一阶单整(integrated of order one),记 I(1);形如 (17.17) 的为二阶单整 I(2);无随机趋势且平稳为 I(0)。单整阶数 = 为使序列平稳所需差分的次数。

Key Concept 17.4(单整阶数、差分与平稳性):

  • \(Y_t\) 为 I(1):\(Y_t\) 有单位自回归根,\(\Delta Y_t\) 平稳;
  • \(Y_t\) 为 I(2):\(\Delta Y_t\) 有单位自回归根,\(\Delta^2Y_t\) 平稳;
  • \(Y_t\) 为 I(\(d\)):须差分 \(d\) 次才能消除随机趋势,即 \(\Delta^dY_t\) 平稳。

如何检验 I(2) vs I(1):若 \(Y_t\) 为 I(2),则 \(\Delta Y_t\) 为 I(1),有单位根;若 \(Y_t\) 为 I(1),则 \(\Delta Y_t\) 平稳。故对 \(\Delta Y_t\) 做单位根检验:拒绝"\(\Delta Y_t\) 有单位根"即拒绝 I(2),支持 I(1)。

例:价格水平与通胀。通胀是价格水平增长率:\(Infl_t=400\times\Delta\ln(P_t)\)(季度数据、年化百分点;100 转百分比,4 转年率)。实证练习 15.1 中用美国 PCE 价格指数得出通胀很可能含随机游走趋势,即通胀为 I(1),\(\Delta Infl_t\) 平稳。通胀 I(1) ⇔ \(\Delta\ln P_t\) 为 I(1) ⇔ \(\ln P_t\) 为 I(2)。图 17.1(1960–2017):(a) PCE 价格指数对数,长期趋势非常平滑(约 2.75 到 4.75);(b) 通胀率(约 −6% 到 12%),趋势波动明显更大。平滑趋势是 I(2) 序列的典型特征。

为什么单位根检验统计量不服从正态分布

15.7 节强调:回归元非平稳时大样本正态近似不适用。单位根原假设下 Dickey–Fuller 回归的回归元 \(Y_{t-1}\) 非平稳,这正是非正态的根源。

最简情形:\(\Delta Y_t\) 对 \(Y_{t-1}\) 回归、无截距。OLS 估计 \(\hat\delta=\sum Y_{t-1}\Delta Y_t/\sum Y_{t-1}^2\),于是

\[T\hat\delta=\frac{\frac1T\sum_{t=1}^TY_{t-1}\Delta Y_t}{\frac1{T^2}\sum_{t=1}^TY_{t-1}^2}\tag{17.19}\]

分子:在 \(Y_0=0\) 的附加假设下(习题 17.5 证明)

\[\frac1T\sum_{t=1}^TY_{t-1}\Delta Y_t=\frac12\left[\left(\frac{Y_T}{\sqrt T}\right)^2-\frac1T\sum_{t=1}^T(\Delta Y_t)^2\right]\tag{17.20}\]

推导思路:\(Y_t^2=(Y_{t-1}+\Delta Y_t)^2\) ⇒ \(Y_{t-1}\Delta Y_t=\frac12[Y_t^2-Y_{t-1}^2-(\Delta Y_t)^2]\),求和后伸缩相消。原假设下 \(\Delta Y_t=u_t\) 序列不相关、方差有限,第二项 \(\xrightarrow{p}\sigma_u^2\);第一项中 \(Y_T/\sqrt T=\sqrt T\cdot\frac1T\sum u_t\),由中心极限定理 \(\xrightarrow{d}N(0,\sigma_u^2)\)。故方括号 \(\xrightarrow{d}\sigma_u^2(Z^2-1)\),\(Z\) 为标准正态;\(Z^2\sim\chi^2_1\),因此

\[\frac1T\sum_{t=1}^TY_{t-1}\Delta Y_t\xrightarrow{d}\frac{\sigma_u^2}{2}(\chi_1^2-1)\tag{17.21}\]

即分子极限分布是"\(\chi^2_1\) 减 1"的倍数,而非正态。分母也异常:随机游走下 \(\frac1T\sum Y_{t-1}^2\) 不收敛到常数,\(\frac1{T^2}\sum Y_{t-1}^2\) 即使在大样本中仍是随机变量,并与分子联合依分布收敛。分子分母的这种非常规联合分布,导致 DF 统计量分布非标准,因此 ADF 统计量需要专门的临界值表。(常见误区:把 DF 的 t 统计量拿去和 ±1.96 比较。)


17.4 协整(Cointegration)(PDF p.664–668)

协整与误差修正

两个或多个含随机趋势的序列可能长期紧密同行,似乎有共同的趋势成分。例:图 15.3 中 90 天与 10 年期美国国债利率——1960 年代都低,1970 年代都上升,1980 年代初见顶,1990 年代都下降;但两者之差(期限利差,图 15.3b)看不出趋势。相减能消去各自的趋势,说明它们有共同随机趋势(common stochastic trend)。

Key Concept 17.5(协整):设 \(X_t,Y_t\) 都是 I(1)。若对某个系数 \(\theta\),\(Y_t-\theta X_t\) 为 I(0),则称 \(X_t\) 与 \(Y_t\) 协整(cointegrated),\(\theta\) 称为协整系数(cointegrating coefficient)。协整意味着两者有相同的(共同的)随机趋势,作差 \(Y_t-\theta X_t\) 消去该共同趋势。该正式定义来自 Clive Granger。

向量误差修正模型(VECM):若 \(X_t,Y_t\) 协整,可对一阶差分建 VAR,并加入 \(Y_{t-1}-\theta X_{t-1}\) 作为额外回归元:

\[\Delta Y_t=\beta_{10}+\beta_{11}\Delta Y_{t-1}+\cdots+\beta_{1p}\Delta Y_{t-p}+\gamma_{11}\Delta X_{t-1}+\cdots+\gamma_{1p}\Delta X_{t-p}+\alpha_1(Y_{t-1}-\theta X_{t-1})+u_{1t}\tag{17.22}\]
\[\Delta X_t=\beta_{20}+\beta_{21}\Delta Y_{t-1}+\cdots+\gamma_{2p}\Delta X_{t-p}+\alpha_2(Y_{t-1}-\theta X_{t-1})+u_{2t}\tag{17.23}\]

\(Y_t-\theta X_t\) 称为误差修正项(error correction term):两变量共享趋势,若相距过远,预期会随时间靠拢,"误差"被"修正"。(17.22)(17.23) 合称向量误差修正模型(vector error correction model, VECM)。VECM 中 \(Y_t-\theta X_t\) 的过去值帮助预测 \(\Delta Y_t\) 和/或 \(\Delta X_t\)。

如何判断两个变量是否协整

三种手段应同时使用:专业知识与经济理论;作图看是否有共同随机趋势;统计检验。

理论例:利率期限结构的预期理论(expectations theory)认为 10 年期国债利率等于未来 10 年 3 个月国库券利率预期值的平均,所以若 3 个月利率有随机游走趋势,10 年利率会继承这一趋势(习题 17.2)。图上两利率似为 I(1)、利差似为 I(0),故协整是合理的。

检验原理:若协整系数为 \(\theta\),则 \(Y_t-\theta X_t\) 平稳;否则为 I(1)。"不协整"的原假设 ⇔ \(Y_t-\theta X_t\) 有单位根;拒绝则可视为协整。细节取决于 \(\theta\) 是否已知。

\(\theta\) 已知:构造 \(z_t=Y_t-\theta X_t\),对其做 ADF 单位根检验。例:1962–2017 年 10 年期与 90 天利率之差(\(\theta=1\)),含截距、AIC 选 6 阶滞后,ADF = −4.13 < −3.43(表 15.4 的 1% 临界值),1% 水平拒绝"无协整"。

\(\theta\) 未知:Engle–Granger ADF(EG-ADF)检验(Engle & Granger 1987)。两步:

  1. OLS 估计协整回归 \(Y_t=\alpha+\theta X_t+z_t\) (17.24);
  2. 对残差 \(\hat z_t\) 做含截距、无时间趋势的 DF t 检验。

由于第一步估计了 \(\theta\),第二步须用不同的临界值(表 17.1,取自 Fuller 1976、Phillips & Ouliaris 1990,按 Hansen 1992 的建议使其对 \(X,Y\) 是否含漂移都适用):

(17.24) 中 X 的个数 10% 5% 1%
1 −3.12 −3.41 −3.96
2 −3.52 −3.80 −4.36
3 −3.84 −4.16 −4.73
4 −4.20 −4.49 −5.07

(第一行用于两个变量;其余行用于多个协整变量。临界值比普通 ADF 更负。)

协整系数的估计

若协整,(17.24) 的 OLS 估计量一致(实际上是超一致),但一般非正态分布,基于其 t 统计量(无论是否用 HAC 标准误)的推断可能误导。因此发展出其他估计量,其中简便的是动态 OLS(dynamic OLS, DOLS,Stock & Watson 1993):在 (17.24) 中加入 \(\Delta X_t\) 的过去、当期和未来值(leads and lags):

\[Y_t=\beta_0+\theta X_t+\sum_{j=-p}^{p}\delta_j\Delta X_{t-j}+u_t\tag{17.25}\]

回归元为 \(X_t,\Delta X_{t+p},\dots,\Delta X_{t-p}\),DOLS 估计量即该回归中 \(\theta\) 的 OLS 估计。若协整,DOLS 大样本有效,且基于 HAC 标准误的 \(\theta\) 与 \(\delta\) 的推断有效——t 统计量大样本服从标准正态。

例:90 天利率对 10 年利率的 DOLS,\(p=4\) 个超前与滞后,\(\hat\theta=1.02\),HAC 标准误(\(m=5\))0.05,10% 水平不能拒绝 \(\theta=1\)。这与利差平稳的发现一起,与期限结构理论一致。

推广到多个协整变量

三个 I(1) 变量 \(Y_t,X_{1t},X_{2t}\),若 \(Y_t-\theta_1X_{1t}-\theta_2X_{2t}\) 平稳则协整。三个及以上变量可存在多个协整关系。例:3 个月(R3m)、1 年(R1y)、10 年(R10y)利率,若均为 I(1),期限结构理论表明它们协整,协整关系为 \(R10y_t-R3m_t\) 与 \(R1y_t-R3m_t\);\(R10y_t-R1y_t\) 也是协整关系,但与前两者完全共线,不提供新信息。

多变量 EG-ADF:第一步回归同时放入 \(X_{1t},X_{2t}\),临界值按表 17.1 中对应 X 个数的行。多变量 DOLS:每个 X 的水平值加上各自一阶差分的超前和滞后。更多见 Hamilton (1994)。

实践提醒:即使理论没给出协整系数,也要检查估计出的协整关系在实际中是否说得通。协整检验可能误导(可能过多地错误拒绝"无协整",也常常该拒绝时未拒绝),因此尤其要依靠经济理论、制度知识和常识。


17.5 波动率聚集与自回归条件异方差(Volatility Clustering and ARCH)(PDF p.668–672)

波动率聚集

许多金融和宏观变量的波动率随时间变化。图 17.2:Wilshire 5000 全市场指数日收益率(1990–2017,约 −10% 到 +11%),2001、2008 年高波动,2004、2017 年低波动。序列有时平静有时剧烈,称为波动率聚集(volatility clustering)。由于聚集,日收益的方差可以预测,尽管日收益本身几乎无法预测。别名:条件异方差(conditional heteroskedasticity)。

预测方差的三点用途:

  1. 资产价格变化的方差衡量持有风险:方差越大,参与者在典型一天可能赚或亏得越多;厌恶风险的投资者在高波动期不愿参与。
  2. 期权等衍生品价值取决于标的资产方差,期权交易者需要最好的未来波动率预测来决定买卖价格。
  3. 改进预测区间:若预测误差方差恒定,可用回归标准误或最终预测误差(15.5 节)构造区间;若方差随时间变化,区间宽度应随之变化——冲击大时宽、平静时窄。若方差变化缓慢可用伪样本外 MSFE 估计 (15.22),但要捕捉图 17.2 那样的快速变化需要其他方法。

波动率聚集可理解为误差方差随时间聚集:本期误差方差小,下期也倾向小,即误差有时变异方差。高频观测时可直接测量波动率(已实现波动率);低频时则建模估计(ARCH/GARCH)。

已实现波动率(Realized Volatility)

用日数据估计某月波动率,可算该月收益的样本方差。但高频资产收益的均值相对其变动非常小,因此波动率不用样本方差,而用均方(mean square)。\(X_t\) 的 \(h\) 期已实现波动率定义为 \(h\) 个连续期上的样本均方根:

\[RV_t^h=\sqrt{\frac1h\sum_{s=t-h+1}^{t}X_s^2}\tag{17.26}\]

图 17.3:2015–2017 年 Wilshire 5000 日收益的 20 日已实现波动率带(±RV),平滑地刻画了波动聚集。实践中常用比日更高频的数据:大公司股票交易频繁,可用 5 分钟价格计算一天甚至一天内数小时的已实现波动率;高频已实现波动率是高频交易的工具之一。

ARCH 模型

考虑 ADL(1,1):\(Y_t=\beta_0+\beta_1Y_{t-1}+\gamma_1X_{t-1}+u_t\) (17.27)。Robert Engle (1982) 的 ARCH 模型设 \(u_t\) 服从均值 0、方差 \(\sigma_t^2\) 的正态分布,\(\sigma_t^2\) 取决于过去的误差平方。ARCH(\(p\)):

\[\sigma_t^2=\alpha_0+\alpha_1u_{t-1}^2+\alpha_2u_{t-2}^2+\cdots+\alpha_pu_{t-p}^2\tag{17.28}\]

若系数为正,近期误差平方大时,模型预测当期误差的方差 \(\sigma_t^2\) 大。ARCH 可用于任何条件均值为 0 的时间序列回归的误差方差(高阶 ADL、AR、多预测变量回归)。

GARCH 模型

Tim Bollerslev (1986) 的广义 ARCH(GARCH)让 \(\sigma_t^2\) 还依赖自身滞后。GARCH(\(p,q\)):

\[\sigma_t^2=\alpha_0+\alpha_1u_{t-1}^2+\cdots+\alpha_pu_{t-p}^2+\phi_1\sigma_{t-1}^2+\cdots+\phi_q\sigma_{t-q}^2\tag{17.29}\]

类比:ARCH 像分布滞后模型,GARCH 像 ADL 模型。正如 ADL 能比分布滞后更简洁地表示动态乘数(第 16 章),GARCH 通过加入 \(\sigma_t^2\) 的滞后,用更少参数刻画缓慢变化的方差。

主要应用:度量和预测金融资产收益(尤其高频,如日收益)的时变波动率。此时收益本身常被视为不可预测,(17.27) 只保留截距。

估计与推断:用最大似然(附录 11.2)估计。ARCH/GARCH 系数估计量大样本正态,t 统计量大样本标准正态,置信区间 = MLE ± 1.96 SE。

应用:股价波动率(PDF p.672–673)

Wilshire 5000 日百分比收益 \(R_t\),1990-01-02 至 2017-12-29 全部交易日,GARCH(1,1):

\[\hat R_t=\underset{(0.010)}{0.063}\tag{17.30}\]
\[\hat\sigma_t^2=\underset{(0.002)}{0.013}+\underset{(0.008)}{0.088}u_{t-1}^2+\underset{(0.009)}{0.908}\sigma_{t-1}^2\tag{17.31}\]

均值方程无滞后预测变量,因为日收益本质上不可预测。两个 GARCH 系数在 5% 水平各自显著。方差变动持续性的一个度量是 \(u_{t-1}^2\) 与 \(\sigma_{t-1}^2\) 的系数和(习题 17.9),此处约 0.99,很大,说明条件方差变动高度持续——高波动期会持续很久,与图 17.2 中长时间的波动聚集一致。

用 (17.30) 的残差和 (17.31) 的系数可递推出 \(\hat\sigma_t^2\)。图 17.3(2015–2017):GARCH(1,1) 的 ±\(\hat\sigma_t\) 带与 20 日已实现波动率带数量上相近。2015 年上半年带较窄(持有 Wilshire 5000 组合风险低),下半年变宽(日波动增大)。

两种方法比较:已实现波动率不需要建模假设;GARCH 能预测波动率,且可用于低频(月、季)数据。两者是互补的波动率聚集度量工具。


17.6 用动态因子模型与主成分进行多预测变量预测(PDF p.672–681)

(本节以 14.5 节主成分内容为前提。)

动机

发达经济体统计机构定期发布成百上千个宏观时间序列:国民收入与生产账户(消费、投资、进出口、政府支出)、各类价格与工资通胀、分行业产出、住房等特定市场、利率与资产价格等。每个都可能改进预测,但按第 14 章,预测变量很多(甚至超过时间序列观测数)时 OLS 样本外表现差。本节用数据集的主成分减少待估系数。框架是动态因子模型(DFM):大量序列的共同运动来自少数不可观测变量(动态因子),因子用主成分估计。DFM 不是唯一办法,另一条路是大 VAR 加收缩估计(含贝叶斯 VAR,见 Kilian & Lütkepohl 2017)。

动态因子模型

发达经济体的核心经验规律:宏观变量之间普遍共同运动——经济某部分强时其他部分往往也强。数年尺度上的共同波动即商业周期;月/季度短尺度和十年级长期增长率上也存在共同运动。宏观理论把这些共同运动归因于少数驱动力:生产率、货币政策、财政政策、需求或偏好变化。

DFM:少数 \(r\) 个共同因子驱动大量 \(N\) 个序列的共同运动;因子视为不可观测(承认不知道全部波动来源,即使知道也难以直接测量,如技术进步)。数学上分两部分:

(1) 观测方程:每个可观测变量 \(X_{it}\) 与 \(r\) 个因子相关

\[X_{it}=\Lambda_{i0}+\Lambda_{i1}F_{1t}+\cdots+\Lambda_{ir}F_{rt}+u_{it},\quad i=1,\dots,N\tag{17.32}\]
\(\Lambda_{i1},\dots,\Lambda_{ir}\) 为未知系数(因子载荷,factor loadings),\(u_{it}\) 为均值 0 误差,代表 \(X_{it}\) 特有(非跨变量共同)的遗漏影响与测量误差。

(2) 因子服从 VAR(为记号方便写成 VAR(1),可加更多滞后):

\[F_{jt}=A_{j1}F_{1t-1}+A_{j2}F_{2t-1}+\cdots+A_{jr}F_{rt-1}+\eta_{jt},\quad j=1,\dots,r\tag{17.33}\]
这是 Key Concept 17.1 的两变量 VAR 推广到 \(r\) 个因子。

假设:\(u_{it}\) 跨序列不相关,且与因子 VAR 误差不相关,即 \(E(u_{it}u_{jt+k})=0\ (i\ne j)\),\(E(u_{it}\eta_{jt+k})=0\) 对所有 \(k\),从而所有共同运动都归于共同因子。(17.33) 无截距,因子均值为 0。

共同成分(common component):\(X_{it}\) 中由因子解释的部分,即 \(\Lambda_{i1}F_{1t}+\cdots+\Lambda_{ir}F_{rt}\)。特质成分(idiosyncratic component):\(u_{it}\),因子不能解释的部分;一般可能序列相关,这会影响预测做法。(脚注:(17.32)(17.33) 是 DFM 的"静态形式",最便于主成分估计;其他形式和估计方法见 Stock & Watson 2016。)

DFM 的估计

DFM 用少数因子替代大量序列,解决预测变量过多问题。若因子可观测,\(\Lambda\) 和 VAR 系数 \(A\) 都可用 OLS 估计;难点是因子不可观测,但可用 \(N\) 个 \(X\) 的主成分估计,再把估计的因子当作数据。

步骤:

  1. 用样本内均值和标准差把每个 \(X\) 标准化(14.5 节);
  2. 对标准化后的 \(X\) 计算主成分,前 \(r\) 个主成分 \(PC_1,\dots,PC_r\) 即因子估计 \(\hat F_{1t},\dots,\hat F_{rt}\)。若因子模型假设正确,当 \(N,T\) 都大时,主成分是因子的一致估计——用主成分和用(假如可观测的)真实因子所做预测相同;
  3. 把 \(\hat F\) 当数据,用 OLS 估计 \(\Lambda\) 与 \(A\)。

常见误区——解释主成分:人们常想把第一主成分解释为总体经济活动、第二主成分解释为通胀等,这一般没有依据。因子只在线性组合意义下识别;无额外假设时因子本身不可识别——可识别的是共同成分,而不是因子本身。对预测而言无关紧要:用因子或其任何线性组合得到的预测相同(类比:OLS 中"截距 + male 虚拟变量"与"截距 + female 虚拟变量"给出相同预测)。

因子个数的确定:第 14 章用留 \(m\) 份交叉验证(leave-m-out CV),但在时间序列中有两个问题:(a) 观测不独立,被留出的子样本与估计样本不独立;(b) 即使留出连续子样本,滞后结构还会额外损失观测。因此 DFM 中常用碎石图(scree plot,与截面情形相同,见 14.5 节)和信息准则。信息准则结构类似 AR 的 (15.23) 和 VAR 的 (17.4):对增加因子带来的残差平方和下降加惩罚。Bai & Ng (2002) 提出、模拟中表现良好的准则:

\[IC(r)=\ln\left\{\frac1{NT}\sum_{i=1}^N\sum_{t=1}^T\left[X_{it}-(\hat\Lambda_{i0}+\hat\Lambda_{i1}\hat F_{1t}+\cdots+\hat\Lambda_{ir}\hat F_{rt})\right]^2\right\}+r\left(\frac{N+T}{NT}\right)\ln[\min(N,T)]\tag{17.34}\]

\(\hat\Lambda\) 是以前 \(r\) 个主成分为回归元的 OLS 估计;末项为惩罚,与 \(r\) 成比例,比例常数取决于 \(N\) 和 \(T\)。\(N=T\) 时惩罚化简为 BIC 惩罚 \(\ln T/T\) 的 2 倍。在候选 \(r\) 中选使 \(IC(r)\) 最小者。

用估计因子做预测

两种做法,平行于 17.2 节的迭代法和直接法。共同起点:把 (17.32) 扩展为 ADL。由于 \(u_{it}\) 一般序列相关,其过去值有助预测 \(u_{it}\) 进而预测 \(X_{it}\);按导出 (16.21) 的论证,\(X_{it}\) 的滞后值也可能是有用预测变量:

\[X_{it}=\Lambda_{i0}+\Lambda_{i1}F_{1t}+\cdots+\Lambda_{ir}F_{rt}+\beta_1X_{it-1}+\cdots+\beta_pX_{it-p}+u_{it}\tag{17.35}\]

右边含当期因子,在 \(t-1\) 期未知,不能直接作预测变量。

迭代法:用估计的因子 VAR 预测当期因子代入:

\[\hat X_{iT+1|T}=\hat\Lambda_{i0}+\hat\Lambda_{i1}\hat F_{1T+1|T}+\cdots+\hat\Lambda_{ir}\hat F_{rT+1|T}+\hat\beta_1X_{iT}+\cdots+\hat\beta_pX_{iT-p+1}\tag{17.36}\]
其中 \(\hat\Lambda,\hat\beta\) 用 \(\hat F\) 和 \(X\) 滞后作回归元估计,\(\hat F_{\cdot T+1|T}\) 来自因子 VAR 的一步预测。\(h>1\) 时用因子和 \(X_i\) 的迭代 VAR 预测。

直接法(基于 Key Concept 17.3):\(h\) 步直接预测回归

\[X_{it}=\delta_0+\delta_1\hat F_{1t-h}+\cdots+\delta_r\hat F_{rt-h}+\delta_{r+1}X_{it-h}+\cdots+\delta_{r+p}X_{it-h-p}+u_{it}\tag{17.37}\]
每个步长 \(h\) 有不同回归、不同系数,OLS 估计后直接预测。

实时预测的细节:通常用截至某日的数据估计系数,然后冻结用于实时预测。用于实时预测的最后几期因子观测可能不在估计样本中。按附录 14.5,由于系数是用样本内主成分估计的,样本外期构造主成分时必须使用与估计样本相同的权重以及相同的标准化均值和方差。(这是防止前视偏差/口径不一致的关键点。)

DFM 的其他用途

  • 构造经济指数:有大量同类序列时,用单因子模型,第一主成分即概括所有变量共同运动的指数;常用于由多个经济活动指标编制同步经济指数(coincident economic index)。
  • 现时预测(nowcasting):经济数据发布有滞后(如本月就业变化下月才公布),"预测"当前值称为 nowcasting。技术难点是数据在月内陆续发布,模型须能随时纳入新到数据;DFM 很适合,但需处理缺失观测(超出本书范围)。纽约联储用 DFM 每周更新 GDP nowcast。

应用:美国宏观数据(PDF p.677–681)

数据:131 个美国季度宏观序列,1960:Q1–2017:Q4(附录 17.1,来自圣路易斯联储 FRED)。涵盖经济活动、工资和价格通胀、利率、住房和石油市场等。先变换消除随机趋势(通常取增长率如 GDP,或一阶差分如利率),再减样本均值、除样本标准差标准化。有多个汇总层级时(GDP = 各组成部分之和,总就业 = 各部门就业之和),汇总序列与组成部分完全共线、不提供额外信息,因此从估计因子的数据集中剔除。

表 17.2 各类别用于因子估计的序列数:国民收入与生产账户 13;工业生产 8;就业与失业 30;订单、存货与销售 6;新屋开工与许可 6;价格 22;生产率与劳动收入 5;利率 10;货币与信贷 6;国际 8;资产价格、财富、家庭资产负债表 10;其他 2;石油市场 5;合计 131。

碎石图(图 17.4):前 30 个主成分。第一主成分解释总方差 20%,第二 9%,前四个共 39%。前两个因子显然重要,第三、第四个之后边际 \(R^2\) 有明显下降,但下降直到第十个因子才趋稳,视觉判断不确定。Bai–Ng 准则在 \(r=4\) 处最小,处于碎石图合理范围内,采用 \(r=4\)。

共同成分(图 17.5):GDP、就业、油价、S&P 500 收益的四季度增长率(\(t\) 到 \(t+4\) 的对数近似百分比增长)及其四因子共同成分。GDP 和就业是汇总量、不在因子估计数据集中;油价和股票收益在 131 个序列中。惊人结论:仅用 131 个宏观变量的前 4 个主成分,共同成分就捕捉了这些序列的大量变动,甚至 S&P 500 四季度收益的很大部分也被解释。注意:这不意味着股票收益可预测,而是说股票收益受同期总体经济活动强烈影响。

预测比较(表 17.3):直接预测 \(h=1,4,8\) 期累计 GDP 增长(年化),因变量 \((400/h)\ln(GDP_t/GDP_{t-h})\)(如 \(h=4\) 时为 \(t,t-1,t-2,t-3\) 四个季度年化增长的平均)。三个模型:直接 AR(2)、含期限利差的 ADL(2,2)、四因子 + GDP 两阶滞后。样本内期 1981:Q1 至 2002:Q4 前 \(h\) 期;伪样本外期 2002:Q4–2017:Q4;指标为 \(RMSFE_{POOS}\) (15.22)。所有回归含截距。

预测变量 h=1 h=4 h=8
\(GDPGR_{t-h},GDPGR_{t-h-1}\) 2.25 1.91 1.74
再加 \(TSpread_{t-h},TSpread_{t-h-1}\) 2.29 1.94 1.77
\(GDPGR\) 两阶 + \(\hat F_{1t-h},\dots,\hat F_{4t-h}\) 2.14 1.40 1.48

三点结论:

  1. RMSFE 随步长增加而下降:季度 GDP 有大量暂时性测量误差,按一两年平均会平滑掉(见图 15.1b 季度 GDP 增长的"噪声")。
  2. 各步长下含期限利差的预测样本外都比 AR(2) 差,看似与样本内拟合矛盾——在 \(h=1\) 估计样本(1981:Q1–2002:Q3)中利差两阶滞后系数为 0 的 F 检验 1% 显著。说明样本内估计的利差系数不能刻画样本外期的关系,即该关系非平稳。现实原因:2008 年起美联储引入管理长短期利率的新货币政策工具,改变了利差与经济活动的关系。(量化启示:样本内显著 ≠ 样本外有用。)
  3. 因子预测在所有步长都优于 AR 和 ADL。细看发现改进主要来自金融危机后(原文写 2009 年秋)衰退和复苏初期:许多宏观变量强烈的负向共同运动指向深度衰退,AR 预测未捕捉到;而在 2005 年和 2013 年之后的平静期,AR(2) 直接预测反而略好于因子预测。

专栏:时间序列计量经济学的诺贝尔奖得主(PDF p.681–682)

  • 2003 年 Robert Engle 与 Clive Granger。Engle 受类似图 17.2 的波动聚集启发,追问这类序列能否平稳、能否建模解释和预测时变波动,提出 ARCH;ARCH 及其扩展特别适合资产收益波动,其波动率预测用于衍生品定价和评估持有金融资产风险的时变,如今是金融计量的核心、波动建模的主力工具。Granger 研究随机趋势:两个无关的含随机趋势序列按 t 统计量和 \(R^2\) 看可能虚假相关("伪回归",如 (14.28)(14.29));他发现变量共享共同趋势("协整")时,用向量误差修正模型能揭示有意义的关系,协整分析现为宏观计量标配。
  • 2011 年 Thomas Sargent 与 Christopher Sims,因宏观因果实证研究。Sargent:强调对未来的预期在区分因果中的作用。Sims:结构 VAR(SVAR)。关键洞见在于 VAR 预测误差 \(u_t\) 来自冲击经济的未预见"冲击",许多有明确来源(OPEC 油价冲击、美联储利率冲击、国会税收冲击);分解 VAR 误差中的各类冲击可估计其对 VAR 变量的动态因果效应。分解总有争议,但 SVAR 已是宏观动态因果效应估计的标准工具。
  • 2013 年 Eugene Fama、Lars Peter Hansen、Robert Shiller,因资产价格实证分析。第 15 章"Can You Beat the Market?"与第 16 章橙汁期货专栏部分受 Fama 有效市场(不可预测性)和 Shiller 非理性繁荣(无法解释的波动)启发。Hansen 发展了广义矩方法(GMM),检验资产收益是否符合期望效用理论:投资者应使投资边际成本(今天放弃消费的效用)等于边际收益(明天由投资回报支持的消费带来的效用提升);由于边际效用难测、收益不确定、且命题应对所有资产成立,直接检验困难,GMM 解决了这个问题,并广泛用于金融之外。19.7 节介绍 GMM。

17.7 结论(PDF p.683)

推荐延伸阅读:经济预测入门 Diebold (2017)、Enders (2009);时间序列计量高级 Hamilton (1994)、Hayashi (2000);VAR 高级 Kilian & Lütkepohl (2017);DFM 见 Stock & Watson (2016)。

本章小结(原书 Summary):

  1. VAR 对 \(k\) 个变量建模,每个依赖自身及其他 \(k-1\) 个序列的滞后;各变量预测基于相同信息,相互一致。
  2. 两期及以上预测可通过迭代一步模型(AR、VAR)或估计多期回归得到。
  3. 共享共同随机趋势的序列协整:\(Y_t,X_t\) 为 I(1) 而 \(Y_t-\theta X_t\) 为 I(0)。误差修正项可帮助预测 \(\Delta Y_t\) 和/或 \(\Delta X_t\);VECM 是加入滞后误差修正项的 \(\Delta Y,\Delta X\) 的 VAR。
  4. 波动率聚集在经济尤其金融序列中常见;已实现波动率是用滚动均方根估计时变波动率。
  5. ARCH 把回归误差条件方差表示为近期误差平方的函数,GARCH 再加入滞后条件方差。两者都能给出宽度依赖近期残差波动的预测区间。
  6. 大量序列的共同运动有时可由前几个主成分概括并用于预测,框架为 DFM。

关键术语:向量自回归 VAR;迭代多期 AR/VAR 预测;直接多期预测;二阶差分;I(0)/I(1)/I(2)、单整阶数、I(d);共同趋势;协整、协整系数;误差修正项;VECM;EG-ADF 检验;DOLS;波动率聚集;已实现波动率;ARCH;GARCH;动态因子模型;共同成分;特质成分;nowcasting。

复习题与习题概述(PDF p.684–688)

复习题:

  • 17.1 宏观学家想用 1970–2017 季度数据预测 GDP、消费、投资、政府购买、进出口、短期与长期利率、通胀共 9 个变量,该不该估一个 VAR?(考点:参数过多、且 GDP 与其组成部分共线;替代:小 VAR、因子模型或收缩方法。)
  • 17.2 平稳 AR(1),\(\beta_0=0,\beta_1=0.5\),\(Y_t=10\),求 \(Y_{t+2|t}\) 和 \(h=20\) 预测(\(10\times0.5^2=2.5\);\(h=20\) 时趋近 0,即均值回归)。
  • 17.3 永久收入理论:对数 GDP 与对数消费协整、协整系数为 1,如何通过作图和统计检验考察(\(\theta\) 已知,对 \(\ln Y-\ln C\) 做 ADF)。
  • 17.4 什么是波动率聚集,描述两个模型。17.5 什么是单位根,如何检验。

习题:

  • 17.1 (a) 平稳 AR(1) 的 \(h\) 步预测 \(Y_{t+h|t}=\mu_Y+\beta_1^h(Y_t-\mu_Y)\),\(\mu_Y=\beta_0/(1-\beta_1)\);(b) 若 \(X_t=\sum_{i=0}^\infty\delta^iY_{t+i|t}\),\(|\delta|<1\),证明 \(X_t=\mu_Y/(1-\delta)+(Y_t-\mu_Y)/(1-\beta_1\delta)\)(现值模型)。
  • 17.2 期限结构预期理论:\(R_{kt}=\frac1k\sum_{i=0}^{k-1}R1_{t+i|t}+e_t\),\(e_t\) 为 I(0) 期限溢价;\(R1\) 为随机游走时证明 \(R_{kt}=R1_t+e_t\),两者协整、协整系数 1;再讨论 \(\Delta R1_t=0.5\Delta R1_{t-1}+u_t\) 与 \(R1_t=0.5R1_{t-1}+u_t\)(后者平稳,不再有协整概念)情形。
  • 17.3 ARCH \(\sigma_t^2=1.0+0.5u_{t-1}^2\):用迭代期望律证无条件方差 = 2;条件正态下 \(u_{t-1}=0.2\) 与 \(2.0\) 时 \(\Pr(-3\le u_t\le3)\)。
  • 17.4 AR(\(p\)) 证明 \(h>p\) 时 \(Y_{t+h|t}=\beta_0+\beta_1Y_{t-1+h|t}+\cdots+\beta_pY_{t-p+h|t}\)。
  • 17.5 验证 (17.20)。
  • 17.6 把 \(Y_t=2.0+1.5X_{t+1}+0.9X_t-0.3X_{t-1}+u_t\) 改写成 DOLS 形式 (17.25),求 \(\theta,\delta_{-1},\delta_0,\delta_1\)(\(\theta=1.5+0.9-0.3=2.1\));并在不同单整假设下判断是否协整。
  • 17.7 \(\Delta Y_t=u_t\) i.i.d. N(0,1),\(Y_t\) 对 \(X_t=\Delta Y_{t+1}\) 回归,证明 \(\hat\beta\xrightarrow{d}\frac12(\chi_1^2-1)\)。
  • 17.8 无截距一阶两变量 VAR 的两步迭代预测可写成 \(Y_{t|t-2}=\delta_1Y_{t-2}+\delta_2X_{t-2}\),求 \(\delta\)(\(\delta_1=\beta_{11}^2+\gamma_{11}\beta_{21}\),\(\delta_2=\beta_{11}\gamma_{11}+\gamma_{11}\gamma_{21}\)),讨论迭代与直接预测是否不同。
  • 17.9 ARCH(1) 平稳时 \(\mathrm{var}(u_t)=\alpha_0/(1-\alpha_1)\);推广到 ARCH(\(p\))(\(\alpha_0/(1-\sum\alpha_i)\)),证明 \(\sum\alpha_i<1\);推广到 GARCH(1,1)(\(\alpha_0/(1-\alpha_1-\phi_1)\)),证明 \(\alpha_1+\phi_1<1\)。
  • 17.10 由 \(Y_t=\theta X_t+v_{1t}\)、\(X_t=X_{t-1}+v_{2t}\) 推导 VECM。

实证练习:E17.1 用 PCE 通胀(1963:Q1–2017:Q4)以 AR(2) 做迭代和直接法的 \(\Delta Infl\) 两步预测;E17.2 GDP 增长 AR(2)+GARCH(1,1) 误差,绘 ±\(\hat\sigma_t\) 带,判断 1983 年左右"大缓和"(Great Moderation)是否可见。

附录 17.1(PDF p.687–688):季度美国宏观数据集来自 FRED;NIPA 中用于估计因子的变量:三类个人消费(耐用品、非耐用品、服务)、四类私人投资(非住宅建筑、非住宅知识产权、非住宅固定设备、住宅建筑)、联邦政府支出、联邦政府收入、州与地方政府消费、出口、进口(均为实际值);多数通过季度增长率或一阶差分去除随机趋势。

本章要点

  • VAR = 每个方程都用全部变量的滞后,逐方程 OLS;变量和滞后要少,否则估计误差吞掉预测力;滞后阶用系统 BIC/AIC \(\ln\det\hat\Sigma_u+k(kp+1)\ln T/T\)。
  • 多期预测:迭代法(设定正确时更有效、跨步长更平滑)为默认;一步模型可能误设时用直接法;直接回归误差有 \(h-1\) 阶重叠自相关,必须用 HAC 且截断参数随 \(h\) 增大。
  • 单整阶数 = 达到平稳需差分次数;对数价格水平常为 I(2),通胀 I(1)。
  • DF 统计量非正态,根源是非平稳回归元:分子收敛到 \(\frac{\sigma^2}{2}(\chi^2_1-1)\),分母不收敛到常数。
  • 协整:I(1) 变量的线性组合为 I(0);VECM 中误差修正项预测差分;检验用 ADF(\(\theta\) 已知)或 EG-ADF(\(\theta\) 未知,专用临界值);估计 \(\theta\) 用 DOLS 以获得正态推断。
  • 波动率聚集:已实现波动率(无模型、需高频)与 ARCH/GARCH(可预测、适合低频,MLE 估计);\(\alpha_1+\phi_1\) 衡量持续性,股市约 0.99。
  • DFM:\(X_{it}\) = 载荷 × 少数因子 + 特质成分,因子服从 VAR;主成分估计因子;Bai–Ng IC 选因子数;因子不可单独识别、不要解释主成分;样本外须沿用样本内标准化参数和权重。

与量化交易的关联

  • VAR / Granger 式可预测性检验:多资产收益或宏观变量与资产收益的联合建模(如利率、期限利差、通胀对股债收益的领先关系),F 检验判断一个变量是否在控制自身滞后后仍有增量预测力,是因子研究里"增量信息检验"的直接方法;参数膨胀问题提醒多资产 VAR 必须精简或收缩。
  • 多期预测与 HAC:用日数据预测未来 5 日/20 日收益(重叠收益回归)就是直接多期回归,残差有 \(h-1\) 阶 MA 结构,必须用 Newey–West 且滞后 ≥ \(h-1\),否则 t 值严重高估——这是因子 IC 和收益可预测性研究中最常见的统计错误之一。
  • 单位根 / 协整:配对交易与统计套利的理论基础——两价格 I(1)、价差 I(0) 即可做均值回复;EG-ADF 两步法(OLS 对冲比 + 残差单位根检验,需用表 17.1 临界值而非普通 ADF 临界值)是筛选配对的标准流程;DOLS 给出对冲比的可靠标准误;VECM 的 \(\alpha\) 衡量价差回复速度(与半衰期相关)。书中提醒协整检验易误判,需要经济逻辑支撑(同行业、同产业链、期现)。期限结构例子对应利率曲线交易。
  • 波动率:已实现波动率(5 分钟数据)用于风险目标(vol targeting)、仓位缩放、日内风控;GARCH(1,1) 用于 VaR/ES 预测、期权定价中的波动率预测、动态止损和风险预算;持续性 \(\alpha+\phi\approx0.99\) 意味着高波动会延续,是波动率择时和风险平价调仓的依据。
  • DFM / 主成分:统计风险模型(PCA 因子模型)、宏观因子构造、宏观 nowcasting 用于资产配置;"因子不可识别、不要硬解释主成分"和"样本外必须用样本内的标准化参数与载荷"直接对应回测中避免前视偏差的工程实践。期限利差样本外失效的例子是"样本内显著、样本外失效(结构断点)"的经典教训。

推荐习题

  • 17.1(AR(1) 多步预测的均值回归形式与现值模型,适用于估值和期限结构)。
  • 17.2(期限结构预期理论推导协整,理解利差交易)。
  • 17.3、17.9(ARCH/GARCH 无条件方差与平稳条件,风险模型必备)。
  • 17.5、17.7(单位根下非标准极限分布的推导,理解为何伪回归和 DF 临界值特殊)。
  • 17.8(迭代与直接预测的关系)。
  • 17.10(从协整模型推导 VECM)。
  • E17.2(AR+GARCH 实操、观察波动率体制变化)。

第 18 章 单回归元线性回归理论(The Theory of Linear Regression with One Regressor)

本章导言(PDF p.688)

为什么应用计量者要学理论:让软件从"黑箱"变成可挑选工具的工具箱;明白工具为何有效、需要何种假设;最重要的是识别工具何时失效、何时该换方法。本章补充(不替代)第 4、5 章,两方面扩展:

  1. 数学地推导 OLS 估计量与 t 统计量的抽样分布:大样本下只用 Key Concept 4.3 的三条因果推断最小二乘假设;有限样本下再加同方差与正态误差两条(共五条"扩展最小二乘假设",18.1 节)。18.2、18.3 节(及附录 18.2)推导大样本正态性;18.4 节推导同方差正态误差下的精确分布。
  2. 处理异方差的另一种方法:加权最小二乘(WLS,18.5 节)。异方差时理论上存在比 OLS 更有效的估计量,但 WLS 需要关于条件方差 \(\mathrm{var}(u|X)\) 精确形式的大量先验知识;多数应用中没有这种知识,此时 OLS + 异方差稳健标准误是首选。

18.1 扩展最小二乘假设与 OLS 估计量(PDF p.689–690)

Key Concept 18.1(单回归元的扩展最小二乘假设):模型 \(Y_i=\beta_0+\beta_1X_i+u_i\) (18.1),\(\beta_1\) 是 \(X\) 对 \(Y\) 的因果效应。

  1. \(E(u_i|X_i)=0\)(条件均值为零);
  2. \((X_i,Y_i)\) i.i.d.;
  3. \(X_i,u_i\) 有非零有限四阶矩;
  4. \(\mathrm{var}(u_i|X_i)=\sigma_u^2\)(同方差);
  5. \(u_i|X_i\) 服从正态(正态误差)。

前三条下 OLS 无偏、一致、大样本正态,第 4 章的 t 检验和 ±1.96SE 置信区间在大样本下成立。但要发展有效估计理论或刻画精确分布,需要更强假设。假设 4 加入后(5.5 节),OLS 在条件于 \(X_1..X_n\) 的线性无偏估计量中最有效(高斯–马尔可夫)。

推论:在假设 1、2、4、5 下,\(u_i\) i.i.d. \(N(0,\sigma_u^2)\) 且与 \(X_i\) 独立。理由:假设 5 给出 \(u_i|X_i\sim N(0,\mathrm{var}(u_i|X_i))\)(均值 0 来自假设 1);假设 4 使方差为常数,于是条件分布 \(N(0,\sigma_u^2)\) 不依赖 \(X_i\),故 \(u_i\) 与 \(X_i\) 独立;由假设 2,\(u_i\) 与 \(u_j\) 独立。

18.4 节将证明五条全成立时 OLS 估计量精确正态、仅同方差 t 统计量精确服从 Student t。后两条假设远比前三条严格、不太现实,但具有理论意义。

OLS 估计量(推导见附录 4.2):

\[\hat\beta_1=\frac{\sum_{i=1}^n(X_i-\bar X)(Y_i-\bar Y)}{\sum_{i=1}^n(X_i-\bar X)^2}\tag{18.2}\]
\[\hat\beta_0=\bar Y-\hat\beta_1\bar X\tag{18.3}\]

18.2 渐近分布理论基础(PDF p.691–695)

渐近分布理论研究样本量越来越大(\(n\to\infty\))时统计量抽样分布的极限行为。之所以核心:(1) 样本大时,渐近极限是有限样本分布的高质量近似;(2) 渐近分布通常比精确有限样本分布简单得多、易用。两块基石是大数定律和中心极限定理(2.6 节);再加两件工具:Slutsky 定理和连续映射定理。

依概率收敛与大数定律

定义:随机变量序列 \(\{S_n\}\) 依概率收敛(converge in probability)到 \(\mu\),记 \(S_n\xrightarrow{p}\mu\),当且仅当对每个 \(\delta>0\),

\[\Pr(|S_n-\mu|\ge\delta)\to0\quad(n\to\infty)\tag{18.4}\]
若 \(S_n\xrightarrow{p}\mu\),称 \(S_n\) 为 \(\mu\) 的一致估计量(consistent estimator)。

大数定律(本书版本,即 Key Concept 2.6):若 \(Y_1..Y_n\) i.i.d.,\(E(Y_i)=\mu_Y\),\(\mathrm{var}(Y_i)<\infty\),则 \(\bar Y\xrightarrow{p}\mu_Y\) (18.5)。

证明:用切比雪夫不等式(附录 18.2 式 (18.42))\(\Pr(|\bar Y-\mu_Y|\ge\delta)\le\mathrm{var}(\bar Y)/\delta^2\) (18.6)。由于 \(\mathrm{var}(\bar Y)=\sigma_Y^2/n\),右边 \(=\sigma_Y^2/(\delta^2n)\to0\),得证。直观:方差随 \(n\) 下降与 \(\bar Y\) 落在 \(\pm\delta\) 外的概率趋零是相连的。

例子(\(Y_i\) i.i.d. \(N(\mu_Y,\sigma_Y^2)\),原文印作 \(N(0,\sigma_Y^2)\),三个 \(\mu_Y\) 的估计量):

  1. \(\hat\mu_a=Y_1\):无偏但不一致。\(\Pr(|Y_1-\mu_Y|\ge\delta)\) 对小 \(\delta\) 恒为正、不随 \(n\) 变化;只用一个观测,分布不可能集中。
  2. \(\hat\mu_b=\left(\frac{1-a^n}{1-a}\right)^{-1}\sum_{i=1}^na^{i-1}Y_i\),\(0<a<1\):无偏(因 \(\sum_{i=1}^na^{i-1}=\frac{1-a^n}{1-a}\))但不一致。方差
    \[\mathrm{var}(\hat\mu_b)=\sigma_Y^2\frac{(1-a^{2n})(1-a)^2}{(1-a^2)(1-a^n)^2}=\sigma_Y^2\frac{(1+a^n)(1-a)}{(1-a^n)(1+a)}\to\sigma_Y^2\frac{1-a}{1+a}>0\]
    虽然用了全部观测,但大多数观测权重极小(第 \(i\) 个权重 ∝ \(a^{i-1}\)),抽样误差相互抵消不足。(令人意外的反例:用了全部数据也可能不一致——类比指数加权均值估计。)
  3. \(\hat\mu_c=\bar Y+1/n\):有偏(偏差 \(1/n\))但一致。由切比雪夫推广式 (18.43) \(\Pr(|W|\ge\delta)\le E(W^2)/\delta^2\),取 \(W=\bar Y+1/n-\mu_Y\),\(E(W^2)=\sigma^2/n+1/n^2\to0\)。一般结论:有限样本有偏但偏差随样本增大消失的估计量仍可一致(习题 18.10:MSE→0 ⇒ 一致)。

中心极限定理与依分布收敛

定义:设 \(F_n\) 是 \(S_n\) 的累积分布函数。\(S_n\) 依分布收敛(converge in distribution)到 \(S\),记 \(S_n\xrightarrow{d}S\),当且仅当 \(\lim_{n\to\infty}F_n(t)=F(t)\) 在极限分布 \(F\) 的所有连续点 \(t\) 成立 (18.7)。\(F\) 称为 \(S_n\) 的渐近分布(asymptotic distribution)。

对比:\(S_n\xrightarrow{p}\mu\) 意味着 \(S_n\) 以高概率接近 \(\mu\);\(S_n\xrightarrow{d}S\) 意味着 \(S_n\) 的分布接近 \(S\) 的分布。

CLT 重述:若 \(Y_i\) i.i.d.、\(0<\sigma_Y^2<\infty\),则 \((\bar Y-\mu_Y)/\sigma_{\bar Y}\) 渐近 \(N(0,1)\);由于 \(\sigma_{\bar Y}=\sigma_Y/\sqrt n\),等价于

\[\sqrt n(\bar Y-\mu_Y)\xrightarrow{d}N(0,\sigma_Y^2)\tag{18.8}\]

推广到时间序列:i.i.d. 假设不适用于时间序列,需要推广版 LLN、CLT。结论相同,只是成立条件不同(16.4 节简述);数学处理超出本书,见 Hayashi (2000, 第 2 章)。

Slutsky 定理与连续映射定理

Slutsky 定理:若 \(a_n\xrightarrow{p}a\)(常数),\(S_n\xrightarrow{d}S\),则

\[a_n+S_n\xrightarrow{d}a+S,\quad a_nS_n\xrightarrow{d}aS,\quad S_n/a_n\xrightarrow{d}S/a\ (a\ne0)\tag{18.9}\]

连续映射定理:\(g\) 连续时,(i) \(S_n\xrightarrow{p}a\Rightarrow g(S_n)\xrightarrow{p}g(a)\);(ii) \(S_n\xrightarrow{d}S\Rightarrow g(S_n)\xrightarrow{d}g(S)\) (18.10)。例:\(s_Y^2\xrightarrow{p}\sigma_Y^2\Rightarrow s_Y\xrightarrow{p}\sigma_Y\);\(S_n\xrightarrow{d}Z\Rightarrow S_n^2\xrightarrow{d}Z^2\sim\chi^2_1\)。

应用:基于样本均值的 t 统计量

设 \(Y_i\) i.i.d.,\(0<E(Y_i^4)<\infty\)。检验 \(E(Y_i)=\mu_0\):

\[t=\frac{\bar Y-\mu_0}{s_Y/\sqrt n}=\frac{\sqrt n(\bar Y-\mu_0)}{\sigma_Y}\Big/\frac{s_Y}{\sigma_Y}\tag{18.11}\]
(分子分母同除 \(\sigma_Y\) 的技巧。)四阶矩有限蕴含二阶矩有限(习题 18.5),故原假设下第一项 \(\xrightarrow{d}N(0,1)\);\(s_Y^2\xrightarrow{p}\sigma_Y^2\)(附录 3.3),故 \(s_Y/\sigma_Y\xrightarrow{p}1\)(习题 18.4)。由 Slutsky 的第三条,\(t\xrightarrow{d}N(0,1)\)。

18.3 OLS 估计量与 t 统计量的渐近分布(PDF p.696–698)

一致性与渐近正态性

在前三条假设下(Key Concept 4.4):

\[\sqrt n(\hat\beta_1-\beta_1)\xrightarrow{d}N\left(0,\frac{\mathrm{var}(v_i)}{[\mathrm{var}(X_i)]^2}\right),\quad v_i=(X_i-\mu_X)u_i\tag{18.12}\]
附录 4.3 的证明省略了细节、有一处近似未正式证明,补全留作习题 18.3。由 (18.12) 可推出 \(\hat\beta_1\) 一致(习题 18.4)。

异方差稳健标准误的一致性

\[\frac{\hat\sigma^2_{\hat\beta_1}}{\sigma^2_{\hat\beta_1}}\xrightarrow{p}1\tag{18.13}\]

其中 \(\sigma^2_{\hat\beta_1}=\mathrm{var}(v_i)/\{n[\mathrm{var}(X_i)]^2\}\),\(\hat\sigma^2_{\hat\beta_1}\) 是异方差稳健标准误的平方(5.4 式):

\[\hat\sigma^2_{\hat\beta_1}=\frac1n\cdot\frac{\frac1{n-2}\sum_{i=1}^n(X_i-\bar X)^2\hat u_i^2}{\left[\frac1n\sum_{i=1}^n(X_i-\bar X)^2\right]^2}\tag{18.14}\]

证明:把比值写成三项乘积

\[\frac{\hat\sigma^2_{\hat\beta_1}}{\sigma^2_{\hat\beta_1}}=\left[\frac n{n-2}\right]\cdot\left[\frac{\frac1n\sum(X_i-\bar X)^2\hat u_i^2}{\mathrm{var}(v_i)}\right]\Big/\left[\frac{\frac1n\sum(X_i-\bar X)^2}{\mathrm{var}(X_i)}\right]^2\tag{18.15}\]
第一项→1;第三项由样本方差一致性→1;只需证中间项 \(\frac1n\sum(X_i-\bar X)^2\hat u_i^2\xrightarrow{p}\mathrm{var}(v_i)\)。分两步(暂设 \(X_i,u_i\) 有八阶矩):

  1. \(\frac1n\sum v_i^2\xrightarrow{p}\mathrm{var}(v_i)\):\(v_i^2\) i.i.d.;需 \(\mathrm{var}(v_i^2)<\infty\),用 Cauchy–Schwarz:\(\mathrm{var}(v_i^2)\le E(v_i^4)=E[(X_i-\mu_X)^4u_i^4]\le\{E[(X_i-\mu_X)^8]E(u_i^8)\}^{1/2}\),八阶矩有限即可,然后用 LLN。
  2. \(\frac1n\sum[(X_i-\bar X)^2\hat u_i^2-(X_i-\mu_X)^2u_i^2]\xrightarrow{p}0\) (18.16):代入 \(\hat u_i=u_i-(\hat\beta_0-\beta_0)-(\hat\beta_1-\beta_1)X_i\) 展开,反复用 Cauchy–Schwarz 和 \(\hat\beta\) 的一致性(习题 18.9)。 八阶矩并非必要,四阶矩下也成立,但证明超出本书(Hayashi 2000, 2.5 节)。

异方差稳健 t 统计量的渐近正态

\[t=\frac{\hat\beta_1-\beta_{1,0}}{\hat\sigma_{\hat\beta_1}}=\frac{\sqrt n(\hat\beta_1-\beta_{1,0})}{\sqrt{n\sigma^2_{\hat\beta_1}}}\Big/\sqrt{\frac{\hat\sigma^2_{\hat\beta_1}}{\sigma^2_{\hat\beta_1}}}\tag{18.17}\]

第一项由 (18.12) \(\xrightarrow{d}N(0,1)\),第二项由 (18.13) \(\xrightarrow{p}1\),Slutsky ⇒ \(t\xrightarrow{d}N(0,1)\)。

18.4 误差正态时的精确抽样分布(PDF p.698–700)

小样本下 OLS 与 t 统计量的分布依赖回归元和误差的分布,通常复杂;但若误差同方差且正态(五条假设全成立),则条件于 \(X\) 时 \(\hat\beta_1\) 正态,t 统计量服从 Student t。

\(\hat\beta_1\) 的分布

若误差 i.i.d. 正态且独立于回归元,条件于 \(X_1..X_n\),\(\hat\beta_1\sim N(\beta_1,\sigma^2_{\hat\beta_1|X})\),

\[\sigma^2_{\hat\beta_1|X}=\frac{\sigma_u^2}{\sum_{i=1}^n(X_i-\bar X)^2}\tag{18.18}\]
三步证明: (i) 正态性:\(\hat\beta_1=\beta_1+\frac{\frac1n\sum(X_i-\bar X)u_i}{\frac1n\sum(X_i-\bar X)^2}\) (18.19),条件于 \(X\) 是 \(u_i\) 的加权平均;\(u_i\) i.i.d. 正态且独立于 \(X\),正态变量的加权平均仍正态。 (ii) 条件无偏:\(E[\hat\beta_1-\beta_1|X]=\sum(X_i-\bar X)E(u_i|X_1..X_n)/\sum(X_i-\bar X)^2=0\),因为 \(E(u_i|X_1..X_n)=E(u_i|X_i)=0\),故 \(E(\hat\beta_1|X)=\beta_1\) (18.20)。 (iii) 条件方差:误差条件独立,\(\mathrm{var}(\hat\beta_1|X)=\frac{\sum(X_i-\bar X)^2\mathrm{var}(u_i|X)}{[\sum(X_i-\bar X)^2]^2}=\frac{\sigma_u^2\sum(X_i-\bar X)^2}{[\sum(X_i-\bar X)^2]^2}\) (18.21),约去即得 (18.18)。

仅同方差 t 统计量的分布

\[\tilde t=\frac{\hat\beta_1-\beta_{1,0}}{\widetilde{SE}(\hat\beta_1)}=\frac{\hat\beta_1-\beta_{1,0}}{\sqrt{s_{\hat u}^2/\sum(X_i-\bar X)^2}}=\frac{(\hat\beta_1-\beta_{1,0})/\sigma_{\hat\beta_1|X}}{\sqrt{W/(n-2)}}\tag{18.22–18.23}\]

其中 \(s_{\hat u}^2=\frac1{n-2}\sum\hat u_i^2\),\(W=\sum\hat u_i^2/\sigma_u^2\)。原假设下分子 \(\sim N(0,1)\);19.4 节将证明 \(W\sim\chi^2_{n-2}\) 且与分子独立。按 Student t 定义(附录 18.1),\(\tilde t\sim t_{n-2}\)。

自由度调整的作用:\(E(W)=n-2\) ⇒ \(E[\frac1{n-2}\sum\hat u_i^2]=\sigma_u^2\),即除以 \(n-2\) 使 \(s_{\hat u}^2\) 无偏;同时使分母恰好符合 t 分布定义 \(\sqrt{W/m}\),从而误差正态时 t 统计量服从 Student t。

18.5 加权最小二乘(Weighted Least Squares, WLS)(PDF p.700–705)

前四条假设下 OLS 在条件线性无偏估计量中最有效(BLUE),即高斯–马尔可夫定理(5.5 节,附录 5.2 证明)。主要局限:要求同方差。异方差时 OLS 不再 BLUE。WLS 在异方差时比 OLS 更有效,但要对 \(\mathrm{var}(u_i|X_i)\) 了解很多。两种情形:(1) 条件方差已知到比例常数,WLS 是 BLUE;(2) 函数形式已知但含未知参数,估计后在附加条件下 WLS 的渐近分布与参数已知时相同,即渐近 BLUE。

已知异方差时的 WLS

设

\[\mathrm{var}(u_i|X_i)=\lambda h(X_i)\tag{18.24}\]
\(\lambda\) 常数,\(h\) 已知函数。两边除以 \(\sqrt{h(X_i)}\):
\[\tilde Y_i=\beta_0\tilde X_{0i}+\beta_1\tilde X_{1i}+\tilde u_i\tag{18.25}\]
\(\tilde Y_i=Y_i/\sqrt{h(X_i)}\),\(\tilde X_{0i}=1/\sqrt{h(X_i)}\),\(\tilde X_{1i}=X_i/\sqrt{h(X_i)}\),\(\tilde u_i=u_i/\sqrt{h(X_i)}\)。WLS 估计量即 \(\tilde Y\) 对 \(\tilde X_0,\tilde X_1\) 的 OLS(\(\tilde X_0\) 的系数取代原截距)。

为何是 BLUE:加权后误差同方差,

\[\mathrm{var}(\tilde u_i|X_i)=\frac{\mathrm{var}(u_i|X_i)}{h(X_i)}=\frac{\lambda h(X_i)}{h(X_i)}=\lambda\tag{18.26}\]
于是前四条假设适用于 (18.25)。严格地,附录 5.2 的高斯–马尔可夫定理针对含截距的 (18.1),不直接适用于截距被 \(\beta_0\tilde X_{0i}\) 取代的 (18.25),但多元回归版本(19.5 节)适用,故 WLS 是 BLUE。实践中 \(h\) 通常未知,此 WLS 不可计算,称为不可行 WLS(infeasible WLS)。

异方差函数形式已知时的 WLS

例 1:方差是 \(X\) 的二次函数

\[\mathrm{var}(u_i|X_i)=\theta_0+\theta_1X_i^2,\quad\theta_0>0,\ \theta_1\ge0\tag{18.27}\]
估计 \(\hat\theta_0,\hat\theta_1\)(一种一致方法:OLS 残差平方 \(\hat u_i^2\) 对 \(X_i^2\) 回归),构造 \(\widehat{\mathrm{var}}(u_i|X_i)=\hat\theta_0+\hat\theta_1X_i^2\),用其平方根倒数加权后做 OLS。若 \(\hat\theta\) 一致,在假设 1–3 及因估计 \(\theta\) 而需的额外矩条件下,WLS 渐近分布与 \(\theta\) 已知时相同,即渐近 BLUE。这种方法称可行 WLS(feasible WLS)或估计 WLS(estimated WLS)。

例 2:方差依赖第三个变量。总体回归 \(E(Y_i|X_i,W_i)=\beta_0+\beta_1X_i\),条件方差 \(\mathrm{var}(u_i|X_i,W_i)=\lambda h(W_i)\)。情境:研究州失业率与州政策变量 \(X_i\) 的关系;观测失业率 \(Y_i\) 是对真实失业率 \(Y_i^*\) 的抽样调查估计,\(Y_i=Y_i^*+v_i\),调查样本量 \(W_i\) 不影响真实失业率:

\[Y_i^*=\beta_0+\beta_1X_i+u_i^*\tag{18.28}\]
\[Y_i=Y_i^*+v_i\tag{18.29}\]
若 \(u_i^*\) 同方差(方差 \(\sigma_{u^*}^2\)),调查误差方差与样本量成反比 \(\mathrm{var}(v_i|X_i,W_i)=a/W_i\),且 \(v_i\) 与 \(u_i^*\) 不相关,则
\[Y_i=\beta_0+\beta_1X_i+u_i,\quad\mathrm{var}(u_i|X_i,W_i)=\theta_0+\theta_1(1/W_i)\tag{18.30–18.31}\]
\(u_i=u_i^*+v_i\),\(\theta_0=\sigma_{u^*}^2\),\(\theta_1=a\),\(E(u_i|X_i,W_i)=0\)。用 OLS 残差平方对 \(1/W_i\) 回归估计 \(\theta\),再做可行 WLS。关键:必须 \(E(u_i|X_i,W_i)=0\),否则加权误差条件均值非零,WLS 不一致;若 \(W_i\) 实际决定 \(Y_i\),应做同时含 \(X_i,W_i\) 的多元回归。

可行 WLS 一般五步:

  1. \(Y\) 对 \(X\) 做 OLS,得残差 \(\hat u_i\);
  2. 估计条件方差函数模型(如 (18.27) 则 \(\hat u_i^2\) 对 \(X_i^2\) 回归);
  3. 用估计函数算条件方差预测值 \(\widehat{\mathrm{var}}(u_i|X_i)\);
  4. 用其平方根的倒数给因变量和回归元(含截距)加权;
  5. 对加权回归做 OLS,得 WLS 估计。 方差依赖 \(X\) 以外变量时相应修改第 2、3 步。软件通常有加权回归命令自动完成第 4、5 步。

异方差稳健标准误还是 WLS?

  • WLS 优点:(至少渐近)比 OLS 更有效。缺点:需要知道条件方差函数并估计其参数;实际中函数形式很少已知;若形式错了,WLS 软件给出的标准误无效(检验水平错误)。
  • 稳健标准误优点:即使不知条件方差形式,推断也渐近有效;现代软件一个选项即可。缺点:OLS 方差比(基于真实方差函数的)WLS 大。
  • 多回归元时更难知道条件方差形式。作者观点:尽管 WLS 理论上吸引人,多数应用中稳健标准误是处理潜在异方差更好的方法。
  • 脚注:本章只讨论单一处理效应 \(\beta_1\)。若处理效应异质,即使 \(X\) 随机分配、单位随机抽取,OLS 一致估计平均因果效应,但 WLS 不一定(习题 18.13)——WLS 估计的是按权重加权的效应。

本章总结(原书 Summary)与关键术语

  1. OLS 渐近正态 + 异方差稳健标准误一致 ⇒ 前三条假设下稳健 t 统计量在原假设下渐近标准正态。
  2. 误差条件于回归元 i.i.d. 正态时,\(\hat\beta_1\) 条件精确正态,仅同方差 t 统计量精确服从 \(t_{n-2}\)。
  3. WLS 是对加权回归做 OLS,权重为条件方差(或其估计)倒数的平方根;渐近更有效,但须知道条件方差函数形式,通常很难做到。

关键术语:依概率收敛、一致估计量、依分布收敛、渐近分布、Slutsky 定理、连续映射定理、WLS、WLS 估计量、不可行 WLS、可行 WLS、正态概率密度函数、二元正态密度。

复习题与习题概述(PDF p.706–710)

复习题:18.1 同方差成立却用稳健 SE 构造置信区间是否渐近有效(是);异方差却用仅同方差 SE(否)。18.2 \(A_n\xrightarrow{p}3\)、\(B_n\xrightarrow{d}N(0,1)\),求 \(A_nB_n\) 渐近分布(\(N(0,9)\))及 \(\Pr(A_nB_n<2)\approx\Phi(2/3)\approx0.75\)。18.3 \(Y=1+2X+u\),\(X\in[0,20]\),\(x\le10\) 时方差 1、\(x>10\) 时方差 16,画散点图;WLS 给 \(x\le10\) 的观测更大权重(方差小、信息多)。18.4 两段分别 OLS 再平均是否比 WLS 有效(否)。

习题:

  • 18.1 无截距约束最小二乘估计量 \(\hat\beta_1^{RLS}=\sum X_iY_i/\sum X_i^2\):推导、渐近分布、线性与条件无偏、高斯–马尔可夫下条件方差 \(\sigma_u^2/\sum X_i^2\),与含截距 OLS 比较效率(约束正确时更有效)、精确分布;比较 \(\tilde\beta_1=\sum Y_i/\sum X_i\) 的方差更大。
  • 18.2 样本协方差一致性(Cauchy–Schwarz)。18.3 补全 \(\hat\beta_1\) 渐近分布推导(分解出 \((\bar X-\mu_X)\cdot\frac1{\sqrt n}\sum u_i\) 项→0)。18.4 渐近正态 ⇒ 一致;\(s^2/\sigma^2\xrightarrow{p}1\Rightarrow s/\sigma\xrightarrow{p}1\)。18.5 四阶矩有限 ⇒ 二阶矩有限。18.6 条件无偏 ⇒ 无偏。18.7 i.i.d. 下条件期望性质(\(E(u_i|X_1..X_n)=E(u_i|X_i)\) 等)。
  • 18.8 方差 \(\theta_0+\theta_1|X_i|\):OLS 是否 BLUE(否)、BLUE 估计量(WLS)、OLS 与 WLS 精确分布。18.9 证明 (18.16)。18.10 MSE→0 ⇒ 依概率收敛。18.11 二元正态的条件分布及条件均值线性。18.12 \(E(e^u)=e^{\sigma_u^2/2}\);条件版本(对数正态均值,对数回归预测还原时用)。18.13 异质系数模型下 OLS 一致估计 \(E(\beta_1)\),WLS 不一定。18.14 样本方差一致性分步证明。18.15 \(W/n\xrightarrow{p}1\),\(Z/\sqrt{W/n}\xrightarrow{d}N(0,1)\)(\(t_\infty=N(0,1)\)),\(\frac{V/m}{W/n}\xrightarrow{d}\chi^2_m/m\)(\(F_{m,\infty}=\chi^2_m/m\))。

附录 18.1 正态及相关分布、连续随机变量的矩(PDF p.710–712)

  • 连续随机变量:密度 \(f_Y(y)\ge0\),\(\Pr(a\le Y\le b)=\int_a^bf_Y(y)dy\) (18.32),\(\int_{-\infty}^\infty f_Y=1\);\(E(Y)=\int yf_Y(y)dy\) (18.33),\(\mathrm{var}(Y)=\int(y-\mu_Y)^2f_Y(y)dy\) (18.34),\(r\) 阶矩 \(E(Y^r)=\int y^rf_Y(y)dy\) (18.35),\(r\) 阶中心矩 \(E(Y-\mu_Y)^r\)。
  • 正态密度 \(f_Y(y)=\frac1{\sigma\sqrt{2\pi}}\exp\left[-\frac12\left(\frac{y-\mu}{\sigma}\right)^2\right]\) (18.36)。对称,三阶及以上奇数阶中心矩为 0,四阶中心矩 \(3\sigma^4\);偶数阶中心矩 \(E(Y-\mu)^k=\frac{k!}{2^{k/2}(k/2)!}\sigma^k\) (18.37)。标准正态密度 \(\phi\),CDF \(\Phi\)。
  • 二元正态密度
    \[g_{X,Y}(x,y)=\frac1{2\pi\sigma_X\sigma_Y\sqrt{1-\rho_{XY}^2}}\exp\left\{\frac{1}{-2(1-\rho_{XY}^2)}\left[\left(\tfrac{x-\mu_X}{\sigma_X}\right)^2-2\rho_{XY}\tfrac{x-\mu_X}{\sigma_X}\tfrac{y-\mu_Y}{\sigma_Y}+\left(\tfrac{y-\mu_Y}{\sigma_Y}\right)^2\right]\right\}\tag{18.38}\]
    \(\rho_{XY}=0\) 时 \(g=f_Xf_Y\):联合正态且不相关 ⇒ 独立(正态分布特有性质,一般分布不成立)。多元正态见附录 19.2。
  • 条件正态:\(Y|X\sim N(\mu_{Y|X},\sigma^2_{Y|X})\),\(\mu_{Y|X}=\mu_Y+(\sigma_{XY}/\sigma_X^2)(X-\mu_X)\),\(\sigma^2_{Y|X}=(1-\rho_{XY}^2)\sigma_Y^2\);条件均值是 \(x\) 的线性函数,条件方差不依赖 \(x\)。
  • 卡方:\(W=\sum_{i=1}^nZ_i^2\sim\chi^2_n\) (18.39),\(E(W)=n\),\(\mathrm{var}(W)=2n\)(因 \(E(Z^2)=1,E(Z^4)=3\))。
  • Student t:\(Z\) 标准正态、\(W\sim\chi^2_m\)、独立,\(t=Z/\sqrt{W/m}\sim t_m\) (18.40);\(t_\infty\) 即标准正态。
  • F:\(W_1\sim\chi^2_{n_1}\),\(W_2\sim\chi^2_{n_2}\) 独立,\(F=\frac{W_1/n_1}{W_2/n_2}\sim F_{n_1,n_2}\) (18.41);分母自由度很大时近似 \(\chi^2_{n_1}/n_1\),\(F_{n_1,\infty}=\chi^2_{n_1}/n_1\)。

附录 18.2 两个不等式(PDF p.712–713)

  • 切比雪夫不等式:\(\Pr(|V-\mu_V|\ge\delta)\le\mathrm{var}(V)/\delta^2\) (18.42)。证明:令 \(W=V-\mu_V\), \(E(W^2)=\int_{-\infty}^{-\delta}+\int_{-\delta}^{\delta}+\int_\delta^\infty w^2f(w)dw\ge\int_{|w|\ge\delta}w^2f(w)dw\ge\delta^2\Pr(|W|\ge\delta)\) (18.43)(丢掉非负中间项;积分区间上 \(w^2\ge\delta^2\))。离散情形把积分换成求和。注意 (18.43) 本身给出更一般的 \(\Pr(|W|\ge\delta)\le E(W^2)/\delta^2\)。
  • Cauchy–Schwarz 不等式:\(|E(XY)|\le\sqrt{E(X^2)E(Y^2)}\) (18.44),是相关系数不等式 \(|\rho_{XY}|\le1\) 允许非零均值的推广。证明:令 \(W=Y+bX\),\(E(W^2)=E(Y^2)+2bE(XY)+b^2E(X^2)\),取 \(b=-E(XY)/E(X^2)\) 得 \(E(W^2)=E(Y^2)-[E(XY)]^2/E(X^2)\ge0\)。

本章要点

  • 五条扩展假设:前三条(条件均值零、i.i.d.、四阶矩)足以支撑大样本推断;加同方差得高斯–马尔可夫效率;再加正态得精确 t 分布。
  • 渐近工具链:切比雪夫 ⇒ LLN;CLT;Slutsky + 连续映射把"分子 CLT、分母 LLN"拼成统计量的极限分布——这是计量中几乎所有渐近证明的模板。
  • 无偏 ≠ 一致(\(Y_1\)、几何加权均值);有偏也可一致(\(\bar Y+1/n\));MSE→0 ⇒ 一致。
  • 稳健标准误一致性的证明思路(\(\frac1n\sum(X_i-\bar X)^2\hat u_i^2\to\mathrm{var}(v_i)\))。
  • 自由度 \(n-2\) 的双重作用:无偏 + 精确 t。
  • WLS/可行 WLS 的构造与五步法;实践中更推荐 OLS + 稳健 SE;异质效应下 WLS 估计的不是平均效应。

与量化交易的关联

  • 渐近理论是判断回测统计量是否可信的基础:因子收益均值的 t 检验就是 (18.11) 的应用,前提是矩有限;金融收益厚尾(四阶矩可能很大甚至不存在)时 CLT 收敛慢,t 值的正态近似要谨慎,这正是"理论帮你识别工具何时失效"的体现。
  • 几何加权均值不一致的例子直接对应 EWMA 估计:指数加权均值/方差在固定衰减系数下不会随样本增长而收敛到真值,它的目标本来就是跟踪时变参数(偏差–方差权衡),这在风险模型的半衰期选择中很重要。
  • WLS:横截面因子回归(Fama–MacBeth、Barra 式风险模型)常按市值平方根加权,正是基于"小盘股特质方差更大"的异方差假设做 WLS;书中提醒:权重函数设错会让 WLS 软件标准误失效,且异质系数下 WLS 估计的是加权平均效应(市值加权 vs 等权的因子收益含义不同)。
  • 对数正态均值 \(E(e^u)=e^{\sigma^2/2}\)(习题 18.12)在对数收益预测还原为简单收益、对数价格模型预测时必须做方差修正。
  • 切比雪夫不等式可给出不依赖分布假设的尾部概率上界,用于保守的风险界估计。

推荐习题

  • 18.3(完整推导 OLS 渐近分布,掌握 Slutsky/CLT 组合拳)。
  • 18.9、18.14(一致性证明技巧,Cauchy–Schwarz 的使用)。
  • 18.10(MSE→0 ⇒ 一致)。
  • 18.12(对数正态均值修正)。
  • 18.13(异质效应下 OLS 与 WLS 的区别,加权方式的含义)。
  • 18.15(\(t_\infty\)、\(F_{m,\infty}\) 与正态、卡方的关系)。
  • 复习题 18.2、18.3。

第 19 章 多元回归理论(The Theory of Multiple Regression)

本章导言(PDF p.714–715)

四个目标:

  1. 用矩阵形式表述多元回归模型,得到 OLS 估计量和检验统计量的紧凑公式(19.1);
  2. 刻画 OLS 估计量的抽样分布:大样本(渐近理论,19.2、19.3)与小样本(同方差正态误差,19.4);同方差正态假设在多数计量应用中不可信,但精确分布有理论意义,且软件输出的 p 值常基于它;
  3. 有效估计理论:高斯–马尔可夫定理推广到多元回归(19.5);广义最小二乘 GLS(19.6),在误差异方差和/或跨观测相关时有效估计;
  4. 线性模型中工具变量(IV)回归的渐近理论(19.7):异方差下 TSLS 的渐近分布与标准误;TSLS 是众多 GMM 估计量之一;同方差时 TSLS 是有效 GMM 估计量。

数学前提:线性代数入门(附录 19.1 复习向量、矩阵运算),19.1 推导 OLS 用到多元微积分。

19.1 矩阵形式的线性多元回归模型与 OLS 估计量(PDF p.715–718)

矩阵记号

总体多元回归(Key Concept 6.2):\(Y_i=\beta_0+\beta_1X_{1i}+\cdots+\beta_kX_{ki}+u_i\) (19.1)。定义

\[\mathbf Y=\begin{pmatrix}Y_1\\\vdots\\Y_n\end{pmatrix},\ \mathbf U=\begin{pmatrix}u_1\\\vdots\\u_n\end{pmatrix},\ \mathbf X=\begin{pmatrix}1&X_{11}&\cdots&X_{k1}\\\vdots&&&\vdots\\1&X_{1n}&\cdots&X_{kn}\end{pmatrix}=\begin{pmatrix}\mathbf X_1'\\\vdots\\\mathbf X_n'\end{pmatrix},\ \boldsymbol\beta=\begin{pmatrix}\beta_0\\\vdots\\\beta_k\end{pmatrix}\tag{19.2}\]
\(\mathbf Y\):\(n\times1\);\(\mathbf X\):\(n\times(k+1)\)(含常数回归元);\(\mathbf X_i'=(1\ X_{1i}\cdots X_{ki})\) 是第 \(i\) 个观测的回归元行;\(\mathbf U\):\(n\times1\);\(\boldsymbol\beta\):\((k+1)\times1\)。单个观测 \(Y_i=\mathbf X_i'\boldsymbol\beta+u_i\) (19.4)(截距是 \(\boldsymbol\beta\) 第一个元素);堆叠得
\[\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U\tag{19.5}\]

Key Concept 19.1 多元回归的扩展最小二乘假设

\(Y_i=\mathbf X_i'\boldsymbol\beta+u_i\) (19.3),\(\boldsymbol\beta\) 为因果效应向量:

  1. \(E(u_i|\mathbf X_i)=0\);
  2. \((\mathbf X_i,Y_i)\) i.i.d.;
  3. \(\mathbf X_i\) 与 \(u_i\) 有非零有限四阶矩;
  4. \(\mathbf X\) 列满秩(无完全多重共线性);
  5. \(\mathrm{var}(u_i|\mathbf X_i)=\sigma_u^2\)(同方差);
  6. \(u_i|\mathbf X_i\) 正态。

前四条即 Key Concept 6.4(第 4 条"列满秩"与"无完全多重共线性"等价:完全共线 = \(\mathbf X\) 某列是其他列的线性组合 = 秩小于 \(k+1\))。同方差用于研究效率,正态用于精确分布。

对 \(\mathbf U\) 均值向量与协方差矩阵的含义:假设 1、2 ⇒ \(E(u_i|\mathbf X)=E(u_i|\mathbf X_i)=0\),且 \(i\ne j\) 时 \(E(u_iu_j|\mathbf X)=E(u_i|\mathbf X_i)E(u_j|\mathbf X_j)=0\)(习题 18.7);加假设 5 ⇒ \(E(u_i^2|\mathbf X)=\sigma_u^2\)。于是

\[E(\mathbf U|\mathbf X)=\mathbf 0_n\ \text{(假设 1,2)}\tag{19.6}\]
\[E(\mathbf U\mathbf U'|\mathbf X)=\sigma_u^2\mathbf I_n\ \text{(假设 1,2,5)}\tag{19.7}\]
\[\mathbf U|\mathbf X\sim N(\mathbf 0_n,\sigma_u^2\mathbf I_n)\ \text{(假设 1,2,5,6)}\tag{19.8}\]

OLS 估计量

最小化 \(\sum_i(Y_i-b_0-b_1X_{1i}-\cdots-b_kX_{ki})^2\)。对 \(b_j\) 求导:

\[\frac{\partial}{\partial b_j}\sum_{i=1}^n(Y_i-b_0-\cdots-b_kX_{ki})^2=-2\sum_{i=1}^nX_{ji}(Y_i-b_0-\cdots-b_kX_{ki})\tag{19.9}\]
(\(X_{0i}=1\))。这是向量 \(-2\mathbf X'(\mathbf Y-\mathbf X\mathbf b)\) 的第 \(j\) 个元素。一阶条件(正规方程):
\[\mathbf X'(\mathbf Y-\mathbf X\hat{\boldsymbol\beta})=\mathbf 0_{k+1}\iff\mathbf X'\mathbf Y=\mathbf X'\mathbf X\hat{\boldsymbol\beta}\tag{19.10}\]
\[\hat{\boldsymbol\beta}=(\mathbf X'\mathbf X)^{-1}\mathbf X'\mathbf Y\tag{19.11}\]
无完全多重共线性的作用:\(\mathbf X\) 列满秩 ⇒ \(\mathbf X'\mathbf X\) 非奇异可逆 ⇒ (19.10) 有唯一解、(19.11) 可计算;否则 \(\mathbf X'\mathbf X\) 奇异,无唯一解。

19.2 OLS 估计量与 t 统计量的渐近分布(PDF p.718–721)

大样本且前四条假设成立时:OLS 渐近联合正态,异方差稳健协方差矩阵估计一致,稳健 t 统计量渐近标准正态。需要多元正态分布(附录 19.2)和多元 CLT。

多元中心极限定理(Key Concept 19.2)

与标量版的区别在方差条件:标量要求方差非零有限,向量要求协方差矩阵正定且有限(等价于对所有非零 \(\mathbf c\),\(0<\mathrm{var}(\mathbf c'\mathbf W)<\infty\),习题 19.3)。陈述:\(\mathbf W_1..\mathbf W_n\) i.i.d. \(m\) 维,均值 \(\boldsymbol\mu_W\),协方差 \(\boldsymbol\Sigma_W\) 正定有限,\(\bar{\mathbf W}=\frac1n\sum\mathbf W_i\),则 \(\sqrt n(\bar{\mathbf W}-\boldsymbol\mu_W)\xrightarrow{d}N(\mathbf 0_m,\boldsymbol\Sigma_W)\)。

\(\hat{\boldsymbol\beta}\) 的渐近正态

\[\sqrt n(\hat{\boldsymbol\beta}-\boldsymbol\beta)\xrightarrow{d}N(\mathbf 0_{k+1},\boldsymbol\Sigma_{\sqrt n(\hat\beta-\beta)}),\quad\boldsymbol\Sigma_{\sqrt n(\hat\beta-\beta)}=\mathbf Q_X^{-1}\boldsymbol\Sigma_V\mathbf Q_X^{-1}\tag{19.12}\]

\(\mathbf Q_X=E(\mathbf X_i\mathbf X_i')\) 是回归元二阶矩矩阵,\(\boldsymbol\Sigma_V=E(\mathbf V_i\mathbf V_i')\),\(\mathbf V_i=\mathbf X_iu_i\)(由假设 2,\(\mathbf V_i\) i.i.d.)。用 \(\hat{\boldsymbol\beta}\) 表述:大样本中 \(\hat{\boldsymbol\beta}\approx N(\boldsymbol\beta,\boldsymbol\Sigma_{\hat\beta})\),\(\boldsymbol\Sigma_{\hat\beta}=\mathbf Q_X^{-1}\boldsymbol\Sigma_V\mathbf Q_X^{-1}/n\) (19.13)。两协方差矩阵差因子 \(n\)。("三明治"形式。)

推导:\(\hat{\boldsymbol\beta}=(\mathbf X'\mathbf X)^{-1}\mathbf X'(\mathbf X\boldsymbol\beta+\mathbf U)\) ⇒

\[\hat{\boldsymbol\beta}=\boldsymbol\beta+(\mathbf X'\mathbf X)^{-1}\mathbf X'\mathbf U\tag{19.14}\]
\[\sqrt n(\hat{\boldsymbol\beta}-\boldsymbol\beta)=\left(\frac{\mathbf X'\mathbf X}{n}\right)^{-1}\left(\frac{\mathbf X'\mathbf U}{\sqrt n}\right)\tag{19.15}\]
"分母"\(\mathbf X'\mathbf X/n\xrightarrow{p}\mathbf Q_X\);"分子"\(\mathbf X'\mathbf U/\sqrt n\) 服从多元 CLT。细节见附录 19.3。

异方差稳健标准误

用样本矩替换总体矩:

\[\hat{\boldsymbol\Sigma}_{\sqrt n(\hat\beta-\beta)}=\left(\frac{\mathbf X'\mathbf X}{n}\right)^{-1}\hat{\boldsymbol\Sigma}_{\hat V}\left(\frac{\mathbf X'\mathbf X}{n}\right)^{-1},\quad\hat{\boldsymbol\Sigma}_{\hat V}=\frac1{n-k-1}\sum_{i=1}^n\mathbf X_i\mathbf X_i'\hat u_i^2\tag{19.16}\]
\(\hat{\boldsymbol\Sigma}_{\hat V}\) 含与 SER 相同的自由度调整,修正估计 \(k+1\) 个系数造成的向下偏差。一致性证明思路同 18.3。\(\hat{\boldsymbol\beta}\) 的稳健协方差估计 \(\hat{\boldsymbol\Sigma}_{\hat\beta}=n^{-1}\hat{\boldsymbol\Sigma}_{\sqrt n(\hat\beta-\beta)}\) (19.17),第 \(j\) 个系数的稳健标准误
\[SE(\hat\beta_j)=\sqrt{(\hat{\boldsymbol\Sigma}_{\hat\beta})_{jj}}\tag{19.18}\]

其他稳健方差估计量:(19.16) 称 HC1,最常用但非唯一。模拟显示小样本中 HC1 可能向下偏、标准误过小。Long & Ervin (2000):用 \(X\) 的函数给残差平方加权的变体(即 HC2/HC3 类)更好。Imbens & Kolesar (2016):除偏差外,小样本中方差估计本身的抽样波动使正态近似变差,建议用 t 近似并配合不同于 HC1 或 Long–Ervin 的方差估计量。Angrist & Pischke (2009):样本量超过 50 时 HC1 的检验水平扭曲可忽略。本书聚焦大样本,HC1 效果好。

预测效应的置信区间

回归元从 \(\mathbf X_{i,0}\) 变到 \(\mathbf X_{i,0}+\mathbf d\)(\(\mathbf d\) 为 \(k+1\) 维,可同时改变多个回归元,如变量及其平方),预期效应 \(\mathbf d'\boldsymbol\beta\),估计 \(\mathbf d'\hat{\boldsymbol\beta}\)。\(\sqrt n(\mathbf d'\hat{\boldsymbol\beta}-\mathbf d'\boldsymbol\beta)\xrightarrow{d}N(0,\mathbf d'\boldsymbol\Sigma_{\sqrt n(\hat\beta-\beta)}\mathbf d)\),标准误 \((\mathbf d'\hat{\boldsymbol\Sigma}_{\hat\beta}\mathbf d)^{1/2}\),95% 置信区间

\[\mathbf d'\hat{\boldsymbol\beta}\pm1.96\sqrt{\mathbf d'\hat{\boldsymbol\Sigma}_{\hat\beta}\mathbf d}\tag{19.19}\]
(8.1 节两种方法的矩阵统一形式。)t 统计量的渐近标准正态性论证同 18.3。

19.3 联合假设检验(PDF p.722–723)

矩阵形式统一了 7.2 节(多个限制、每个只涉及一个系数)和 7.3 节(单个限制涉及多个系数)。

矩阵表示

\(q\) 个线性限制(\(q\le k+1\)):

\[\mathbf R\boldsymbol\beta=\mathbf r\tag{19.20}\]
\(\mathbf R\):\(q\times(k+1)\) 非随机、行满秩;\(\mathbf r\):\(q\times1\) 非随机。例:\(\beta_0=\cdots=\beta_{q-1}=0\) 取 \(\mathbf R=[\mathbf I_q\ \mathbf 0_{q\times(k+1-q)}]\),\(\mathbf r=\mathbf 0_q\);\(k=2\) 时 \(\beta_1+\beta_2=1\) 取 \(\mathbf R=[0\ 1\ 1]\),\(r=1\),\(q=1\)。

F 统计量的渐近分布

异方差稳健 F 统计量:

\[F=(\mathbf R\hat{\boldsymbol\beta}-\mathbf r)'[\mathbf R\hat{\boldsymbol\Sigma}_{\hat\beta}\mathbf R']^{-1}(\mathbf R\hat{\boldsymbol\beta}-\mathbf r)/q\tag{19.21}\]
前四条假设下、原假设成立时 \(F\xrightarrow{d}F_{q,\infty}\) (19.22)。 推导:原假设下 \(\sqrt n(\mathbf R\hat{\boldsymbol\beta}-\mathbf r)=\sqrt n\mathbf R(\hat{\boldsymbol\beta}-\boldsymbol\beta)\xrightarrow{d}N(\mathbf 0,\mathbf R\boldsymbol\Sigma_{\sqrt n(\hat\beta-\beta)}\mathbf R')\);由 (19.77),正态向量的二次型 \([\sqrt n\mathbf R(\hat\beta-\beta)]'[\mathbf R\boldsymbol\Sigma\mathbf R']^{-1}[\cdot]\xrightarrow{d}\chi^2_q\);用一致估计替换 \(\boldsymbol\Sigma\) 后由 Slutsky 仍 \(\xrightarrow{d}\chi^2_q\),即 \(F\xrightarrow{d}\chi^2_q/q=F_{q,\infty}\)。

多个系数的置信集

不被 F 检验拒绝的参数值集合。设 \(\boldsymbol\delta=\mathbf R\boldsymbol\beta\)(\(q\) 维,\(\mathbf R\) 由 0、1 组成),\(\hat{\boldsymbol\delta}=\mathbf R\hat{\boldsymbol\beta}\)。95% 置信集:

\[\{\boldsymbol\delta:(\hat{\boldsymbol\delta}-\boldsymbol\delta)'[\mathbf R\hat{\boldsymbol\Sigma}_{\hat\beta}\mathbf R']^{-1}(\hat{\boldsymbol\delta}-\boldsymbol\delta)/q\le c\}\tag{19.23}\]
\(c\) 为 \(F_{q,\infty}\) 的 95 分位数(5% 临界值)。该集合是等号决定的椭圆(\(q>2\) 时为椭球)内部所有点。

19.4 误差正态时回归统计量的分布(PDF p.723–727)

若误差条件于 \(\mathbf X\) 同方差正态:\(\hat{\boldsymbol\beta}\) 有限样本条件多元正态;\(s_{\hat u}^2\) 正比于 \(\chi^2_{n-k-1}\);仅同方差 t 统计量服从 \(t_{n-k-1}\);仅同方差 F 统计量服从 \(F_{q,n-k-1}\)。

投影矩阵 \(\mathbf P_X\) 与 \(\mathbf M_X\)

\[\mathbf P_X=\mathbf X(\mathbf X'\mathbf X)^{-1}\mathbf X',\qquad\mathbf M_X=\mathbf I_n-\mathbf P_X\tag{19.24–19.25}\]

二者对称、幂等(\(\mathbf C\mathbf C=\mathbf C\))。性质(习题 19.5):

\[\mathbf P_X\mathbf X=\mathbf X,\quad\mathbf M_X\mathbf X=\mathbf 0_{n\times(k+1)},\quad\mathrm{rank}(\mathbf P_X)=k+1,\quad\mathrm{rank}(\mathbf M_X)=n-k-1\tag{19.26}\]
任意 \(n\) 维向量 \(\mathbf Z=\mathbf P_X\mathbf Z+\mathbf M_X\mathbf Z\):前者是在 \(\mathbf X\) 列空间上的投影,后者与 \(\mathbf X\) 各列正交。

  • 拟合值与残差:\(\hat{\mathbf Y}=\mathbf P_X\mathbf Y\) (19.27),\(\hat{\mathbf U}=\mathbf M_X\mathbf Y=\mathbf M_X\mathbf U\) (19.28)。正交性简证:\(\hat{\mathbf Y}'\hat{\mathbf U}=\mathbf Y'\mathbf P_X'\mathbf M_X\mathbf Y=0\)(因 \(\mathbf P_X'\mathbf M_X=\mathbf 0\))。
  • SER:\(s_{\hat u}^2=\frac1{n-k-1}\sum\hat u_i^2=\frac1{n-k-1}\hat{\mathbf U}'\hat{\mathbf U}=\frac1{n-k-1}\mathbf U'\mathbf M_X\mathbf U\) (19.29)(\(\mathbf M_X\) 对称幂等)。

\(\hat{\boldsymbol\beta}\) 的分布

由 (19.14) 与 (19.8),条件于 \(\mathbf X\) 多元正态、均值 \(\boldsymbol\beta\),协方差 \(E[(\hat\beta-\beta)(\hat\beta-\beta)'|\mathbf X]=(\mathbf X'\mathbf X)^{-1}\mathbf X'(\sigma_u^2\mathbf I_n)\mathbf X(\mathbf X'\mathbf X)^{-1}=\sigma_u^2(\mathbf X'\mathbf X)^{-1}\)。六条假设全成立时

\[\hat{\boldsymbol\beta}|\mathbf X\sim N(\boldsymbol\beta,\sigma_u^2(\mathbf X'\mathbf X)^{-1})\tag{19.30}\]

\(s_{\hat u}^2\) 的分布

\[s_{\hat u}^2\sim\frac{\sigma_u^2}{n-k-1}\chi^2_{n-k-1}\tag{19.31}\]

证明:\(\mathbf U\) 条件正态、\(\mathbf M_X\) 对称幂等,二次型 \(\mathbf U'\mathbf M_X\mathbf U/\sigma_u^2\) 服从自由度 = \(\mathrm{rank}(\mathbf M_X)=n-k-1\) 的卡方(附录 19.2 式 (19.78))。自由度调整保证无偏:\(E(\mathbf U'\mathbf M_X\mathbf U)=(n-k-1)\sigma_u^2\)。

仅同方差标准误、t 与 F

\[\tilde{\boldsymbol\Sigma}_{\hat\beta}=s_{\hat u}^2(\mathbf X'\mathbf X)^{-1},\quad\widetilde{SE}(\hat\beta_j)=\sqrt{(\tilde{\boldsymbol\Sigma}_{\hat\beta})_{jj}}\tag{19.32–19.33}\]
\[\tilde t=\frac{\hat\beta_j-\beta_{j,0}}{\sqrt{(\tilde{\boldsymbol\Sigma}_{\hat\beta})_{jj}}}\sim t_{n-k-1}\tag{19.34–19.35}\]
\[\tilde F=\frac{(\mathbf R\hat{\boldsymbol\beta}-\mathbf r)'[\mathbf R(\mathbf X'\mathbf X)^{-1}\mathbf R']^{-1}(\mathbf R\hat{\boldsymbol\beta}-\mathbf r)/q}{s_{\hat u}^2}\sim F_{q,n-k-1}\tag{19.36–19.37}\]

(证明见附录 19.4。)(19.36) 称 F 统计量的 Wald 形式(以 Abraham Wald 命名);它与 (7.13) 基于约束/无约束回归 SSR 的同方差 F 统计量看似不同,实际等价(习题 19.13)。

19.5 同方差误差下 OLS 估计量的效率(PDF p.727–728)

多元回归的高斯–马尔可夫条件

\[\text{(i) }E(\mathbf U|\mathbf X)=\mathbf 0_n,\quad\text{(ii) }E(\mathbf U\mathbf U'|\mathbf X)=\sigma_u^2\mathbf I_n,\quad\text{(iii) }\mathbf X\text{ 列满秩}\tag{19.38}\]

由 Key Concept 19.1 前五条蕴含;单回归元版本 (5.31) 的第二、三条在矩阵记号中合并为 (ii)。

线性条件无偏估计量

线性:\(\tilde{\boldsymbol\beta}=\mathbf A'\mathbf Y\) (19.39),\(\mathbf A\) 为 \(n\times(k+1)\) 权重矩阵,可依赖 \(\mathbf X\) 和非随机常数但不依赖 \(\mathbf Y\)。条件无偏:\(E(\tilde{\boldsymbol\beta}|\mathbf X)=\boldsymbol\beta\)。OLS 是线性的(\(\hat{\mathbf A}=\mathbf X(\mathbf X'\mathbf X)^{-1}\)),且条件无偏:\(E(\hat\beta|\mathbf X)=\beta+(\mathbf X'\mathbf X)^{-1}\mathbf X'E(\mathbf U|\mathbf X)=\beta\)。

高斯–马尔可夫定理(Key Concept 19.3)

难点:估计量是向量,"方差更小"如何定义?做法:比较任意线性组合 \(\mathbf c'\boldsymbol\beta\) 的估计 \(\mathbf c'\tilde{\boldsymbol\beta}\) 与 \(\mathbf c'\hat{\boldsymbol\beta}\)(都是标量)。定理:在 (19.38) 下 OLS 是 BLUE,即对任意线性条件无偏 \(\tilde{\boldsymbol\beta}\) 和任意非零非随机 \(\mathbf c\),\(\mathrm{var}(\mathbf c'\hat{\boldsymbol\beta}|\mathbf X)\le\mathrm{var}(\mathbf c'\tilde{\boldsymbol\beta}|\mathbf X)\),且对所有 \(\mathbf c\) 取等号仅当 \(\tilde{\boldsymbol\beta}=\hat{\boldsymbol\beta}\)。对任何线性组合都成立。证明见附录 19.5。

19.6 广义最小二乘(Generalized Least Squares, GLS)(PDF p.729–734)

(16.5 节在分布滞后回归中已引入 GLS,本节为自包含的数学处理。)

i.i.d. 抽样(如简单随机抽样的个人数据)下 \(u_i,u_j\) 独立、不相关,\(E(\mathbf U\mathbf U'|\mathbf X)\) 为对角矩阵是合适的。但时间序列中遗漏因素跨期相关,误差序列相关。这带来两个问题:(1) OLS 的稳健和仅同方差标准误都无效——用 HAC 标准误解决(16.4 节);(2) \(E(\mathbf U\mathbf U'|\mathbf X)\) 非对角,高斯–马尔可夫条件 (ii) 不成立,OLS 不是 BLUE。GLS 在误差条件协方差不再正比于单位阵时(至少渐近)是 BLUE。WLS 是 GLS 的特例(协方差对角、第 \(i\) 个对角元是 \(X_i\) 的函数)。GLS 与 WLS 一样:变换模型使变换后的误差满足高斯–马尔可夫条件,再对变换模型做 OLS。

GLS 假设(Key Concept 19.4)

在 \(\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U\) 中:

  1. \(E(\mathbf U|\mathbf X)=\mathbf 0_n\) (19.40);
  2. \(E(\mathbf U\mathbf U'|\mathbf X)=\boldsymbol\Omega(\mathbf X)\),\(n\times n\) 正定,可依赖 \(\mathbf X\) (19.41);
  3. \(\mathbf X_i,u_i\) 满足适当矩条件(具体条件因 \(\boldsymbol\Omega\) 形式、是否估计、所研究统计量而异,不细列);
  4. \(\mathbf X\) 列满秩。

假设 1 由 OLS 假设 1、2 蕴含,但 GLS 不想保留 i.i.d.(其目的之一就是处理跨观测相关)。两大应用:

  • 独立抽样 + 异方差:\(\boldsymbol\Omega\) 对角,对角元 \(\lambda h(X_i)\),此时 GLS 即 WLS(18.5 节);
  • 同方差 + 序列相关:须对序列相关建模。例:误差只与相邻项相关,\(\mathrm{corr}(u_i,u_{i-1})=\rho\ne0\),\(|i-j|\ge2\) 时为 0,则 \(\boldsymbol\Omega\) 对角元 \(\sigma_u^2\)、第一副对角元 \(\rho\sigma_u^2\)、其余为 0,且不依赖 \(\mathbf X\)(MA(1) 型)。AR(1) 等其他模型见 16.5 节和习题 19.8。

\(\boldsymbol\Omega\) 已知时的 GLS

取 \(\mathbf F\) 为 \(\boldsymbol\Omega^{-1}\) 的矩阵平方根:\(\mathbf F'\mathbf F=\boldsymbol\Omega^{-1}\)(附录 19.1),性质 \(\mathbf F\boldsymbol\Omega\mathbf F'=\mathbf I_n\)。左乘 \(\mathbf F\):

\[\tilde{\mathbf Y}=\tilde{\mathbf X}\boldsymbol\beta+\tilde{\mathbf U},\quad\tilde{\mathbf Y}=\mathbf F\mathbf Y,\ \tilde{\mathbf X}=\mathbf F\mathbf X,\ \tilde{\mathbf U}=\mathbf F\mathbf U\tag{19.42}\]
关键洞见:变换后满足高斯–马尔可夫条件。\(E(\tilde{\mathbf U}|\tilde{\mathbf X})=\mathbf FE(\mathbf U|\mathbf F\mathbf X)=\mathbf 0_n\);\(E(\tilde{\mathbf U}\tilde{\mathbf U}'|\tilde{\mathbf X})=\mathbf FE(\mathbf U\mathbf U'|\mathbf F\mathbf X)\mathbf F'=\mathbf F\boldsymbol\Omega\mathbf F'=\mathbf I_n\)。GLS 估计量 \(\tilde{\boldsymbol\beta}^{GLS}=(\tilde{\mathbf X}'\tilde{\mathbf X})^{-1}\tilde{\mathbf X}'\tilde{\mathbf Y}\) 是关于 \(\tilde{\mathbf Y}\) 线性的最佳条件无偏估计;由于 \(\mathbf F\) 已知可逆(\(\boldsymbol\Omega\) 正定),关于 \(\tilde{\mathbf Y}\) 线性的估计量类与关于 \(\mathbf Y\) 线性的类相同,故 GLS 是 BLUE。直接写为
\[\tilde{\boldsymbol\beta}^{GLS}=(\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}(\mathbf X'\boldsymbol\Omega^{-1}\mathbf Y)\tag{19.43}\]
无需计算 \(\mathbf F\)。实践中 \(\boldsymbol\Omega\) 通常未知,此估计量称不可行 GLS(infeasible GLS)。

\(\boldsymbol\Omega\) 含未知参数时的 GLS

若 \(\boldsymbol\Omega\) 是可估参数的已知函数,可估计 \(\hat{\boldsymbol\Omega}\)。例:上述 MA(1) 型结构有两个参数 \(\sigma_u^2,\rho\),用初步 OLS 残差估计:\(\sigma_u^2\) 用 \(s_{\hat u}^2\),\(\rho\) 用所有相邻残差对的样本相关。一般地

\[\hat{\boldsymbol\beta}^{GLS}=(\mathbf X'\hat{\boldsymbol\Omega}^{-1}\mathbf X)^{-1}(\mathbf X'\hat{\boldsymbol\Omega}^{-1}\mathbf Y)\tag{19.44}\]
称可行 GLS(feasible GLS)。

条件均值零假设与 GLS(重要)

OLS 一致需要 \(E(u_i|\mathbf X_i)=0\)(给定本观测回归元);GLS 第一假设 \(E(u_i|\mathbf X_1..\mathbf X_n)=0\)(给定所有观测回归元)。i.i.d. 抽样(GLS 即 WLS)时后者由前者蕴含;非 i.i.d. 时 GLS 假设更强。时间序列中这对应 16.5 节"过去与当期外生"vs"严格外生"之分:\(E(u_i|\mathbf X_1..\mathbf X_n)=0\) 即严格外生。

对比一致性论证(设同方差、\(\boldsymbol\Omega\) 已知、有非零非对角元):

  • GLS:\(\tilde\beta^{GLS}=\beta+(\mathbf X'\boldsymbol\Omega^{-1}\mathbf X/n)^{-1}(\mathbf X'\boldsymbol\Omega^{-1}\mathbf U/n)\)。在 GLS 假设 1 下 \(E(\mathbf X'\boldsymbol\Omega^{-1}\mathbf U)=E[\mathbf X'\boldsymbol\Omega^{-1}E(\mathbf U|\mathbf X)]=\mathbf 0\);若方差→0 且 \(\mathbf X'\boldsymbol\Omega^{-1}\mathbf X/n\xrightarrow{p}\tilde{\mathbf Q}\) 可逆,则一致。关键:\(\mathbf X'\boldsymbol\Omega^{-1}\mathbf U=\sum_i\sum_j\mathbf X_i(\boldsymbol\Omega^{-1})_{ij}u_j\) 含不同 \(i,j\) 的 \(\mathbf X_i\) 与 \(u_j\) 乘积,要均值为 0 需对所有 \((\boldsymbol\Omega^{-1})_{ij}\ne0\) 的 \((i,j)\) 有 \(E(u_i|\mathbf X_j)=0\)。AR(1) 误差时只有 \(|i-j|\le1\) 的元素非零;但一般 \(\boldsymbol\Omega^{-1}\) 所有元素都可能非零,因此一般需要完整的 \(E(\mathbf U|\mathbf X)=\mathbf 0\)。
  • OLS:\(\hat\beta=\beta+(\mathbf X'\mathbf X/n)^{-1}\frac1n\sum\mathbf X_iu_i\),只需 \(E(u_i|\mathbf X_i)=0\) 使 \(\frac1n\sum\mathbf X_iu_i\) 均值为 0,方差→0 即依概率收敛到 0。

GLS 第一假设是否苛刻:它要求第 \(i\) 个观测的误差与所有其他观测的回归元不相关,在某些时间序列应用中可疑。例:16.6 节冷冻橙汁期货价格变化对佛罗里达天气的回归——误差与当期和过去天气不相关(OLS 假设成立),但很可能与未来天气相关(GLS 假设不成立)。一般现象:当今天的变量部分基于对未来的预期而定(如资产价格),今天的误差依赖对明天回归元的预测,而该预测与明天的实际值相关。因此 GLS 第一假设实际上比 OLS 第一假设强得多,在某些经济时间序列应用中 GLS 不一致而 OLS 一致。

19.7 工具变量与广义矩估计(IV and GMM Estimation)(PDF p.734–742)

前提:Key Concept 12.3、12.4 的 IV 回归假设成立,且工具是强工具(所有渐近结果都在强工具假设下);截面 i.i.d. 数据,末尾简述时间序列推广。内容:矩阵形式的 IV 模型与 TSLS 及其异方差下的渐近分布;同方差时 TSLS 在"工具为外生变量线性组合"的 IV 估计量类中渐近有效,J 统计量渐近 \(\chi^2\)(自由度 = 过度识别约束数);异方差下的有效 IV 估计量即有效 GMM 估计量(Hansen 1983)。

矩阵形式的 IV 估计量

  • \(\mathbf X\):\(n\times(k+r+1)\),关注方程的全部回归元,第 \(i\) 行 \(\mathbf X_i'=(1\ X_{1i}\cdots X_{ki}\ W_{1i}\cdots W_{ri})\)(\(X\) 为内生,\(W\) 为包含的外生变量)。
  • \(\mathbf Z\):\(n\times(m+r+1)\),全部外生变量(包含的 \(W\) 与排除的工具 \(Z\)),第 \(i\) 行 \(\mathbf Z_i'=(1\ Z_{1i}\cdots Z_{mi}\ W_{1i}\cdots W_{ri})\)。
  • 模型 \(\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U\) (19.45);工具外生性 \(E(\mathbf Z_iu_i)=\mathbf 0\) (19.46)。第一阶段有 \(k\) 个方程。

TSLS:工具为第一阶段 OLS 拟合值。\(\hat{\mathbf X}\) 第 \(i\) 行 \((\hat X_{1i}\cdots\hat X_{ki}\ W_{1i}\cdots W_{ri})\);\(W\) 在 \(\mathbf Z\) 中,对 \(\mathbf Z\) 回归的拟合值就是自身,故 \(\hat{\mathbf X}=\mathbf P_Z\mathbf X\),\(\mathbf P_Z=\mathbf Z(\mathbf Z'\mathbf Z)^{-1}\mathbf Z'\)。

\[\hat{\boldsymbol\beta}^{TSLS}=(\hat{\mathbf X}'\hat{\mathbf X})^{-1}\hat{\mathbf X}'\mathbf Y=(\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf Y\tag{19.47–19.48}\]

TSLS 的渐近分布

\[\sqrt n(\hat{\boldsymbol\beta}^{TSLS}-\boldsymbol\beta)=\left[\frac{\mathbf X'\mathbf Z}{n}\left(\frac{\mathbf Z'\mathbf Z}{n}\right)^{-1}\frac{\mathbf Z'\mathbf X}{n}\right]^{-1}\left[\frac{\mathbf X'\mathbf Z}{n}\left(\frac{\mathbf Z'\mathbf Z}{n}\right)^{-1}\frac{\mathbf Z'\mathbf U}{\sqrt n}\right]\tag{19.49}\]

IV 假设下 \(\mathbf X'\mathbf Z/n\xrightarrow{p}\mathbf Q_{XZ}=E(\mathbf X_i\mathbf Z_i')\),\(\mathbf Z'\mathbf Z/n\xrightarrow{p}\mathbf Q_{ZZ}=E(\mathbf Z_i\mathbf Z_i')\);\(\mathbf Z_iu_i\) i.i.d.、均值 0、协方差正定,由多元 CLT

\[\mathbf Z'\mathbf U/\sqrt n\xrightarrow{d}\boldsymbol\Psi_{ZU}\sim N(\mathbf 0,\mathbf H),\quad\mathbf H=E(\mathbf Z_i\mathbf Z_i'u_i^2)\tag{19.50}\]
于是
\[\sqrt n(\hat{\boldsymbol\beta}^{TSLS}-\boldsymbol\beta)\xrightarrow{d}N(\mathbf 0,\boldsymbol\Sigma^{TSLS})\tag{19.51}\]
\[\boldsymbol\Sigma^{TSLS}=(\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf H\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX}(\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX})^{-1}\tag{19.52}\]

TSLS 标准误:样本矩替换总体矩,\(\hat{\boldsymbol\Sigma}^{TSLS}\) 同式 (19.53),其中 \(\hat{\mathbf Q}_{XZ}=\mathbf X'\mathbf Z/n\) 等,

\[\hat{\mathbf H}=\frac1n\sum_{i=1}^n\mathbf Z_i\mathbf Z_i'\hat u_i^2,\quad\hat{\mathbf U}=\mathbf Y-\mathbf X\hat{\boldsymbol\beta}^{TSLS}\tag{19.54}\]
(注意用 TSLS 残差——用原始 \(\mathbf X\) 而非 \(\hat{\mathbf X}\) 计算。)标准误为 \(\hat{\boldsymbol\Sigma}^{TSLS}/n\) 对角元的平方根。

同方差时 TSLS 的性质

同方差时 TSLS 在"以 \(\mathbf Z\) 的行的线性组合为工具"的 IV 估计量类中渐近有效——这是高斯–马尔可夫定理的 IV 版本,是使用 TSLS 的重要理由。

同方差下的分布:\(E(u_i^2|\mathbf Z_i)=\sigma_u^2\) ⇒ \(\mathbf H=E[\mathbf Z_i\mathbf Z_i'E(u_i^2|\mathbf Z_i)]=\mathbf Q_{ZZ}\sigma_u^2\),

\[\boldsymbol\Sigma^{TSLS}=(\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX})^{-1}\sigma_u^2\tag{19.55}\]
仅同方差估计 \(\tilde{\boldsymbol\Sigma}^{TSLS}=(\hat{\mathbf Q}_{XZ}\hat{\mathbf Q}_{ZZ}^{-1}\hat{\mathbf Q}_{ZX})^{-1}\hat\sigma_u^2\),\(\hat\sigma_u^2=\hat{\mathbf U}'\hat{\mathbf U}/(n-k-r-1)\) (19.56)。

以 \(\mathbf Z\) 线性组合为工具的 IV 估计量类:两种等价生成方式,共同起点是矩方程——工具外生 ⇒ 真值处

\[E[(\mathbf Y-\mathbf X\boldsymbol\beta)'\mathbf Z]=\mathbf 0\tag{19.57}\]
共 \(m+r+1\) 个方程、\(k+r+1\) 个未知数。恰好识别(\(m=k\))时样本版本 \((\mathbf Y-\mathbf X\mathbf b)'\mathbf Z=\mathbf 0\) 可解,得 IV 估计量;过度识别(\(m>k\))时因抽样波动方程多于未知数,一般无解。

  • 方式一:最小化二次型,\(\mathbf A\) 为 \((m+r+1)\) 阶对称半正定权重矩阵
    \[\min_{\mathbf b}(\mathbf Y-\mathbf X\mathbf b)'\mathbf Z\mathbf A\mathbf Z'(\mathbf Y-\mathbf X\mathbf b)\tag{19.58}\]
    \[\hat{\boldsymbol\beta}^{IV}_A=(\mathbf X'\mathbf Z\mathbf A\mathbf Z'\mathbf X)^{-1}\mathbf X'\mathbf Z\mathbf A\mathbf Z'\mathbf Y\tag{19.59}\]
    与 (19.48) 比较:TSLS 是 \(\mathbf A=(\mathbf Z'\mathbf Z)^{-1}\) 的特例。其渐近分布
    \[\sqrt n(\hat{\boldsymbol\beta}^{IV}_A-\boldsymbol\beta)\xrightarrow{d}N(\mathbf 0,\boldsymbol\Sigma^{IV}_A),\quad\boldsymbol\Sigma^{IV}_A=(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\mathbf A\mathbf H\mathbf A\mathbf Q_{ZX}(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\tag{19.60}\]
  • 方式二:工具取 \(\mathbf Z\mathbf B\),\(\mathbf B\) 为 \((m+r+1)\times(k+r+1)\) 列满秩,解 \((\mathbf Y-\mathbf X\mathbf b)'\mathbf Z\mathbf B=\mathbf 0\) 得 \(\hat\beta^{IV}=(\mathbf B'\mathbf Z'\mathbf X)^{-1}\mathbf B'\mathbf Z'\mathbf Y\);代入 \(\mathbf B=\mathbf A\mathbf Z'\mathbf X\) 即得 (19.59)。两方式生成同一族,惯例用方式一。

同方差下 TSLS 的渐近有效性:\(\mathbf H=\mathbf Q_{ZZ}\sigma_u^2\) 时

\[\boldsymbol\Sigma^{IV}_A=(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZZ}\mathbf A\mathbf Q_{ZX}(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\sigma_u^2\tag{19.61}\]
需证对所有半正定 \(\mathbf A\) 和所有 \(\mathbf c\):\(\mathbf c'\boldsymbol\Sigma^{IV}_A\mathbf c\ge\mathbf c'\boldsymbol\Sigma^{TSLS}\mathbf c\) (19.62)(附录 19.6 证明),与多元高斯–马尔可夫相同的效率标准。

同方差下的 J 统计量(Key Concept 12.6):检验全部过度识别约束成立。思想:约束成立时 \(u_i\) 与工具不相关,\(\mathbf U\) 对 \(\mathbf Z\) 回归的总体系数全为 0;用 TSLS 残差 \(\hat{\mathbf U}\) 代替,J = \(\hat{\mathbf U}\) 对 \(\mathbf Z\) 回归中"\(\mathbf Z\) 系数全为 0"的仅同方差 F 统计量 × \((m+r+1)\)(转成渐近卡方形式)。由 (7.13):无约束回归 \(SSR=\hat{\mathbf U}'\mathbf M_Z\hat{\mathbf U}\),约束回归(无回归元)\(SSR=\hat{\mathbf U}'\hat{\mathbf U}\),差为 \(\hat{\mathbf U}'\mathbf P_Z\hat{\mathbf U}\):

\[J=\frac{\hat{\mathbf U}'\mathbf P_Z\hat{\mathbf U}}{\hat{\mathbf U}'\mathbf M_Z\hat{\mathbf U}/(n-m-r-1)}\tag{19.63}\]
Key Concept 12.6 的算法只检验排除工具的系数为 0,步骤不同但 J 值相同(习题 19.14)。原假设 \(E(u_i\mathbf Z_i)=\mathbf 0\) 下 \(J\xrightarrow{d}\chi^2_{m-k}\) (19.64)(附录 19.6)。

线性模型中的 GMM

异方差时 TSLS 不再是该类中最有效的,有效者为有效 GMM 估计量;且 (19.63) 的 J 不再服从卡方,而用有效 GMM 构造的 J 服从 \(\chi^2_{m-k}\)。这与外生回归元 + 异方差的情形平行:OLS 非 BLUE、仅同方差 F 即使大样本也不服从 F;那里有效估计量是 WLS,IV 情形下则是用不同于 TSLS 的权重矩阵的有效 GMM。

GMM 定义:估计线性或非线性模型参数的一般方法,选参数使多个"样本矩 = 0"的方程(矩条件,moment conditions)拟合最好;这些方程一般不能同时满足,GMM 通过最小化二次目标函数折中。在线性 IV 模型中,GMM 估计量类 = (19.58) 所有解的集合 = 以 \(\mathbf Z\) 线性组合为工具的 IV 估计量类;GMM 只是这一类估计量的另一个名字。

渐近有效 GMM:类中渐近方差矩阵最小者(按 (19.62) 的标准)。故 (19.62) 可重述为:同方差时 TSLS 是线性模型的有效 GMM 估计量。动机:同方差时 \(\mathbf H=\mathbf Q_{ZZ}\sigma_u^2\),大样本中 \(\mathbf A=(\mathbf Z'\mathbf Z)^{-1}\) 等价于 \(\mathbf A=(\mathbf Q_{ZZ}\sigma_u^2)^{-1}=\mathbf H^{-1}\)。类推,异方差下取 \(\mathbf A=\mathbf H^{-1}\):

\[\min_{\mathbf b}(\mathbf Y-\mathbf X\mathbf b)'\mathbf Z\mathbf H^{-1}\mathbf Z'(\mathbf Y-\mathbf X\mathbf b)\tag{19.65}\]
\[\tilde{\boldsymbol\beta}^{Eff.GMM}=(\mathbf X'\mathbf Z\mathbf H^{-1}\mathbf Z'\mathbf X)^{-1}\mathbf X'\mathbf Z\mathbf H^{-1}\mathbf Z'\mathbf Y\tag{19.66}\]
\[\sqrt n(\tilde{\boldsymbol\beta}^{Eff.GMM}-\boldsymbol\beta)\xrightarrow{d}N(\mathbf 0,\boldsymbol\Sigma^{Eff.GMM}),\quad\boldsymbol\Sigma^{Eff.GMM}=(\mathbf Q_{XZ}\mathbf H^{-1}\mathbf Q_{ZX})^{-1}\tag{19.67}\]
有效性证明:对所有 \(\mathbf c\),\(\mathbf c'\boldsymbol\Sigma^{IV}_A\mathbf c\ge\mathbf c'\boldsymbol\Sigma^{Eff.GMM}\mathbf c\)(附录 19.6)。

可行有效 GMM(两步法):(19.66) 依赖未知 \(\mathbf H\),不可行。第一步:用任一一致估计量(自然选 TSLS)估计 \(\boldsymbol\beta\),算关注方程残差,构造 \(\hat{\mathbf H}\)(式 19.54)。第二步:用 \(\hat{\mathbf H}^{-1}\) 作最优权重:

\[\hat{\boldsymbol\beta}^{Eff.GMM}=(\mathbf X'\mathbf Z\hat{\mathbf H}^{-1}\mathbf Z'\mathbf X)^{-1}\mathbf X'\mathbf Z\hat{\mathbf H}^{-1}\mathbf Z'\mathbf Y\tag{19.68}\]
因 \(\hat{\mathbf H}\xrightarrow{p}\mathbf H\),\(\sqrt n(\hat\beta^{Eff.GMM}-\tilde\beta^{Eff.GMM})\xrightarrow{p}0\)(习题 19.12),\(\sqrt n(\hat\beta^{Eff.GMM}-\beta)\xrightarrow{d}N(\mathbf 0,\boldsymbol\Sigma^{Eff.GMM})\) (19.69),即两步可行估计量渐近有效。

异方差稳健 J 统计量(GMM J 统计量):

\[J^{GMM}=(\mathbf Z'\hat{\mathbf U}^{GMM})'\hat{\mathbf H}^{-1}(\mathbf Z'\hat{\mathbf U}^{GMM})/n\tag{19.70}\]
\(\hat{\mathbf U}^{GMM}=\mathbf Y-\mathbf X\hat{\boldsymbol\beta}^{Eff.GMM}\),\(\hat{\mathbf H}^{-1}\) 为计算有效 GMM 所用权重。原假设 \(E(\mathbf Z_iu_i)=\mathbf 0\) 下 \(J^{GMM}\xrightarrow{d}\chi^2_{m-k}\)。

时间序列数据中的 GMM

(形式化处理见 Hayashi 2000 第 6 章;假设变量平稳。)分两类:

  • 误差 \(u_t\) 序列相关:GMM 估计量仍渐近正态,但 (19.50) 的 \(\mathbf H\) 公式不再正确,正确的 \(\mathbf H\) 依赖 \(\mathbf Z_tu_t\) 的自协方差(类比 (16.14) 中序列相关下 OLS 的方差);有效 GMM 仍用 \(\mathbf H\) 的一致估计构造,但须用 HAC 方法估计。
  • \(\mathbf Z_tu_t\) 序列不相关:无需 HAC,本节公式全部推广。现代金融与宏观计量中常见:误差代表未预期的、不可预测的扰动,模型通常意味着 \(\mathbf Z_tu_t\) 序列不相关。例:\(Y_t=\beta_0+\beta_1X_t+u_t\)(一个内生变量、无外生变量),若理论意味着 \(u_t\) 在给定过去信息时不可预测,则有矩条件
    \[E(u_t|Y_{t-1},X_{t-1},Z_{t-1},Y_{t-2},X_{t-2},Z_{t-2},\dots)=0\tag{19.71}\]
    所有滞后变量都是有效工具的候选(满足外生性);又因 \(u_{t-1}=Y_{t-1}-\beta_0-\beta_1X_{t-1}\),(19.71) 等价于 \(E(u_t|u_{t-1},X_{t-1},Z_{t-1},\dots)=0\),\(u_t\) 序列不相关,无需 HAC。只要 (19.71) 正确,本节有效 GMM 与 GMM J 统计量直接适用。(这正是 Hansen 用 GMM 检验资产定价欧拉方程的框架。)

本章总结(原书 Summary)

  1. 矩阵形式 \(\mathbf Y=\mathbf X\boldsymbol\beta+\mathbf U\)。
  2. \(\hat{\boldsymbol\beta}=(\mathbf X'\mathbf X)^{-1}\mathbf X'\mathbf Y\);前四条假设下一致、渐近正态;同方差时 \(\mathrm{var}(\hat\beta|\mathbf X)=\sigma_u^2(\mathbf X'\mathbf X)^{-1}\)。
  3. 一般线性约束 \(\mathbf R\boldsymbol\beta=\mathbf r\),可用于联合检验与置信集。
  4. 误差条件 i.i.d. 正态时 \(\hat\beta\) 精确正态,仅同方差 t、F 精确服从 \(t_{n-k-1}\)、\(F_{q,n-k-1}\)。
  5. 高斯–马尔可夫:误差同方差、条件不相关、\(E(u_i|\mathbf X)=0\) 时 OLS 是 BLUE。
  6. 误差协方差 \(\boldsymbol\Omega\) 不正比于单位阵且已知或可估时,GLS 渐近比 OLS 有效;但 GLS 一般要求 \(u_i\) 与所有观测的回归元不相关(OLS 只要求与 \(X_i\)),应用中须审慎评估。
  7. TSLS 属于线性模型 GMM 估计量类:解 \(\min_b[(\mathbf Y-\mathbf X\mathbf b)'\mathbf Z]\mathbf A[\mathbf Z'(\mathbf Y-\mathbf X\mathbf b)]\);渐近有效 GMM 取 \(\mathbf A=[E(\mathbf Z_i\mathbf Z_i'u_i^2)]^{-1}\);同方差时即 TSLS。

关键术语:多元回归的高斯–马尔可夫条件/定理;GLS、不可行 GLS、可行 GLS;GMM、有效 GMM;异方差稳健 J 统计量、GMM J 统计量;均值向量、协方差矩阵。

复习题与习题概述(PDF p.743–749)

复习题:

  • 19.1 收入对性别回归同时放入 female 与 male 两个虚拟变量和截距,写出 \(n=5\) 的矩阵,说明 \(\mathbf X\) 列线性相关(虚拟变量陷阱),如何改设定(去掉一个虚拟变量或去截距)。
  • 19.2 500 观测单回归元:假设 1–4 成立但 5/6 可疑——用稳健 SE + 正态临界值;1–5 成立但 6 可疑——两种方法(稳健或仅同方差 SE,大样本正态临界值);1–6 全成立——仅同方差 SE + \(t_{n-2}\) 临界值。
  • 19.3 假设 1–5 成立而 6 不成立,(19.31) 是否成立(否,卡方分布依赖正态)。
  • 19.4 GLS 何时比 OLS 更有效。19.5 构造满足 \(E(u_i|X_i)=0\) 但 \(E(\mathbf U|\mathbf X)\ne\mathbf 0\) 的例子(如 \(X_t=Y_{t-1}\) 的自回归)。

习题:

  • 19.1 收入二次回归写成矩阵形式,线性 vs 二次的检验写成 \(\mathbf R\boldsymbol\beta=\mathbf r\)。
  • 19.2 由 \(n=20\) 的样本均值(Y 6.39、X1 7.24、X2 4.00)和样本协方差(var Y 0.26,cov(Y,X1) 0.22,cov(Y,X2) 0.32,var X1 0.80,cov(X1,X2) 0.28,var X2 2.40)计算 OLS 系数、\(s_{\hat u}^2\)、\(R^2\),并在六条假设下检验 \(\beta_1=0\)。
  • 19.3 \(\mathrm{var}(\mathbf c'\mathbf W)=\mathbf c'\boldsymbol\Sigma_W\mathbf c\),正定 ⇒ \(0<\mathrm{var}<\infty\)。
  • 19.4 用矩阵公式推出单回归元 OLS 公式和 \(\hat\beta_0\) 的方差。
  • 19.5 \(\mathbf P_X,\mathbf M_X\) 性质与秩(借助 19.10 和 trace(AB)=trace(BA))。
  • 19.6 用 \(\hat\beta=(\mathbf X'\mathbf M_W\mathbf X)^{-1}\mathbf X'\mathbf M_W\mathbf Y\) 证明固定效应的"虚拟变量"估计量与"去均值"估计量相等。
  • 19.7 \(X\) 独立于 \((W,u)\) 而 \(W\) 与 \(u\) 相关时,\(\hat\beta_1\) 仍一致、\(\hat\beta_2\) 不一致;比较含/不含 \(W\) 时 \(\hat\beta_1\) 的渐近方差(控制变量的作用)。
  • 19.8 AR(1) 误差 \(u_i=0.5u_{i-1}+\tilde u_i\) 的 \(\boldsymbol\Omega\),及不显式求逆的 GLS(准差分变换)。
  • 19.9 条件均值独立假设 \(E(u_i|\mathbf X_i,\mathbf W_i)=\mathbf W_i'\boldsymbol\delta\) 下关注系数 \(\boldsymbol\beta\) 仍一致(控制变量系数无因果解释)。
  • 19.10 对称幂等矩阵特征值为 0 或 1,迹 = 秩,半正定。19.11 对称幂等秩 \(r\) 矩阵 \(\mathbf C\),\(\mathbf V\sim N(\mathbf 0,\mathbf I)\) ⇒ \(\mathbf V'\mathbf C\mathbf V\sim\chi^2_r\)。
  • 19.12 有效 GMM 是 (19.65) 的解;两步估计量渐近等价;\(J^{GMM}\xrightarrow{d}\chi^2_{m-k}\)。
  • 19.13 约束最小二乘(拉格朗日):\(\tilde\beta=\hat\beta-(\mathbf X'\mathbf X)^{-1}\mathbf R'[\mathbf R(\mathbf X'\mathbf X)^{-1}\mathbf R']^{-1}(\mathbf R\hat\beta-\mathbf r)\),SSR 之差 = Wald 二次型,从而 Wald F 与 (7.13) 等价。
  • 19.14 两种 J 统计量算法等价。
  • 19.15 面板固定效应聚类标准误的一致性(\(T\) 固定、\(n\to\infty\))。
  • 19.16 缺失数据:完全随机缺失、缺失仅依赖 \(X\) 时 OLS 无偏一致;依赖 \(u\) 时有偏不一致;\(Y\ge0\) 才观测(截断样本选择)时有偏。
  • 19.17 分块逆矩阵证明 Frisch–Waugh 定理。19.18 同方差两回归元时 \(\mathrm{corr}(\hat\beta_1,\hat\beta_2)\to-\rho_{X_1,X_2}\)。

附录 19.1 矩阵代数概要(PDF p.749–752)

复习线性代数概念,不替代线代课程。

  • 向量与矩阵:\(n\) 维列向量 \(\mathbf b\)、行向量 \(\mathbf c\);\(n\times m\) 矩阵 \(\mathbf A\),\(a_{ij}\) 为第 \(i\) 行第 \(j\) 列元素;一维数为标量(scalar)。
  • 类型:方阵;对称阵(\(a_{ij}=a_{ji}\));对角阵(非对角元为 0);单位阵 \(\mathbf I_n\);零矩阵 \(\mathbf 0_{n\times m}\)。
  • 转置:\(\mathbf A'\) 的 \((j,i)\) 元为 \(\mathbf A\) 的 \((i,j)\) 元;列向量转置为行向量。
  • 加法与乘法:同维矩阵逐元素相加;\(\mathbf a'\mathbf b=\sum a_ib_i\),\(\mathbf a'\mathbf a=\sum a_i^2\);\(\mathbf A\)(\(n\times m\))与 \(\mathbf B\)(\(m\times r\))可乘(conformable),\(c_{ij}=\sum_ka_{ik}b_{kj}\);标量乘法逐元素。性质:\(\mathbf A+\mathbf B=\mathbf B+\mathbf A\);结合律;\((\mathbf A+\mathbf B)'=\mathbf A'+\mathbf B'\);\(\mathbf A\mathbf I_m=\mathbf A\),\(\mathbf I_n\mathbf A=\mathbf A\);\(\mathbf A(\mathbf B\mathbf C)=(\mathbf A\mathbf B)\mathbf C\);\((\mathbf A+\mathbf B)\mathbf C=\mathbf A\mathbf C+\mathbf B\mathbf C\);\((\mathbf A\mathbf B)'=\mathbf B'\mathbf A'\)。一般不交换(\(\mathbf A\mathbf B\ne\mathbf B\mathbf A\)),对角阵之间可交换。
  • 逆:\(\mathbf A^{-1}\mathbf A=\mathbf I_n\),存在则称可逆/非奇异;\((\mathbf A\mathbf B)^{-1}=\mathbf B^{-1}\mathbf A^{-1}\)。
  • 正定/半正定:对所有非零 \(\mathbf c\),\(\mathbf c'\mathbf V\mathbf c>0\)(\(\ge0\));正定 ⇒ 可逆。
  • 线性无关:不存在不全为零的 \(c_1..c_k\) 使 \(\sum c_j\mathbf a_j=\mathbf 0\)。
  • 秩:线性无关列的个数;等于列数称列满秩,此时不存在非零 \(\mathbf c\) 使 \(\mathbf A\mathbf c=\mathbf 0\),且 \(\mathbf A'\mathbf A\) 非奇异;\(n\times n\) 且秩 \(n\) ⇒ 非奇异。
  • 迹:对角元之和;\(\mathrm{tr}(\mathbf A)=\mathrm{tr}(\mathbf A')\),\(\mathrm{tr}(\mathbf A+\mathbf B)=\mathrm{tr}\mathbf A+\mathrm{tr}\mathbf B\),\(\mathrm{tr}(\mathbf A\mathbf B)=\mathrm{tr}(\mathbf B\mathbf A)\),\(\mathrm{tr}(\mathbf B\mathbf A\mathbf B^{-1})=\mathrm{tr}(\mathbf A)\),\(\mathbf c'\mathbf B\mathbf c=\mathrm{tr}(\mathbf B\mathbf c\mathbf c')\)。
  • 矩阵平方根:对称正定 \(\mathbf V\),\(\mathbf F'\mathbf F=\mathbf V\);总存在但不唯一;\(\mathbf F\mathbf V^{-1}\mathbf F'=\mathbf I_n\),\(\mathbf F\) 可逆,\(\mathbf F'^{-1}\mathbf V\mathbf F^{-1}=\mathbf I_n\)。
  • 特征值与特征向量:\(\mathbf A\mathbf q=\lambda\mathbf q\),\(\mathbf q'\mathbf q=1\);\(n\) 阶矩阵有 \(n\) 个特征值(可重复)。对称正定 \(\mathbf V\) 特征值为正实数、特征向量为实,\(\mathbf V=\mathbf Q\boldsymbol\Lambda\mathbf Q'\)(谱分解),\(\mathbf Q'\mathbf Q=\mathbf I_n\);\(\mathrm{tr}(\mathbf V)=\sum\lambda_i\)(原文误写为"特征向量之和")。
  • 幂等矩阵:\(\mathbf C\mathbf C=\mathbf C\);对称幂等 ⇒ 半正定,有 \(r=\mathrm{rank}(\mathbf C)\) 个特征值为 1、\(n-r\) 个为 0(习题 19.10)。

附录 19.2 多元分布(PDF p.753–754)

  • 均值向量 \(E(\mathbf V)=\boldsymbol\mu_V\);协方差矩阵
    \[\boldsymbol\Sigma_V=E[(\mathbf V-\boldsymbol\mu_V)(\mathbf V-\boldsymbol\mu_V)']\tag{19.72}\]
    对角为 \(\mathrm{var}(V_i)\),非对角为 \(\mathrm{cov}(V_i,V_j)\)。
  • 多元正态密度:
    \[f(\mathbf V)=\frac1{\sqrt{(2\pi)^m\det(\boldsymbol\Sigma_V)}}\exp\left[-\frac12(\mathbf V-\boldsymbol\mu_V)'\boldsymbol\Sigma_V^{-1}(\mathbf V-\boldsymbol\mu_V)\right]\tag{19.73}\]
    记 \(N(\boldsymbol\mu_V,\boldsymbol\Sigma_V)\)。联合正态且不相关(协方差块对角)⇒ 独立;\(V_i\) i.i.d. \(N(0,\sigma^2)\) 时 \(\boldsymbol\Sigma_V=\sigma^2\mathbf I_m\),密度为一元正态密度之积。
  • 线性组合与二次型:\(\mathbf V\sim N(\boldsymbol\mu_V,\boldsymbol\Sigma_V)\),\(\mathbf A,\mathbf B\) 非随机,\(\mathbf d\) 非随机:
    • \(\mathbf d+\mathbf A\mathbf V\sim N(\mathbf d+\mathbf A\boldsymbol\mu_V,\mathbf A\boldsymbol\Sigma_V\mathbf A')\) (19.74)
    • \(\mathrm{cov}(\mathbf A\mathbf V,\mathbf B\mathbf V)=\mathbf A\boldsymbol\Sigma_V\mathbf B'\) (19.75)
    • 若 \(\mathbf A\boldsymbol\Sigma_V\mathbf B'=\mathbf 0\),则 \(\mathbf A\mathbf V\) 与 \(\mathbf B\mathbf V\) 独立 (19.76)
    • \((\mathbf V-\boldsymbol\mu_V)'\boldsymbol\Sigma_V^{-1}(\mathbf V-\boldsymbol\mu_V)\sim\chi^2_m\) (19.77)
    • \(\mathbf U\sim N(\mathbf 0,\mathbf I_m)\),\(\mathbf C\) 对称幂等 ⇒ \(\mathbf U'\mathbf C\mathbf U\sim\chi^2_r\),\(r=\mathrm{rank}(\mathbf C)\) (19.78)(习题 19.11)

附录 19.3 \(\hat{\boldsymbol\beta}\) 渐近分布的推导(PDF p.754)

  • "分母"\(\mathbf X'\mathbf X/n=\frac1n\sum\mathbf X_i\mathbf X_i'\) 的 \((j,l)\) 元 \(\frac1n\sum X_{ji}X_{li}\):\(\mathbf X_i\) i.i.d.;四阶矩 + Cauchy–Schwarz ⇒ \(X_{ji}X_{li}\) 有二阶矩;LLN ⇒ \(\to E(X_{ji}X_{li})\)。故 \(\mathbf X'\mathbf X/n\xrightarrow{p}\mathbf Q_X\)。
  • "分子"\(\mathbf X'\mathbf U/\sqrt n=\frac1{\sqrt n}\sum\mathbf V_i\),\(\mathbf V_i=\mathbf X_iu_i\):由假设 1 和迭代期望 \(E(\mathbf V_i)=E[\mathbf X_iE(u_i|\mathbf X_i)]=\mathbf 0\);i.i.d.;对任意有限 \(\mathbf c\),\(E[(\mathbf c'\mathbf V_i)^2]=E[(\mathbf c'\mathbf X_i)^2u_i^2]\le\sqrt{E[(\mathbf c'\mathbf X_i)^4]E(u_i^4)}<\infty\),故 \(\boldsymbol\Sigma_V\) 有限(假定正定)。多元 CLT:
    \[\frac1{\sqrt n}\mathbf X'\mathbf U\xrightarrow{d}N(\mathbf 0_{k+1},\boldsymbol\Sigma_V)\tag{19.79}\]
  • 结合 (19.15)、分母一致性、假设 4(逆存在)和 Slutsky 得 (19.12)。

附录 19.4 误差正态时 OLS 检验统计量精确分布的推导(PDF p.755–756)

(19.35) 的证明:t 分布定义需 (i) \(Z\sim N(0,1)\),(ii) \(W\sim\chi^2_m\),(iii) 独立。注意 \(\tilde{\boldsymbol\Sigma}_{\hat\beta}=(s_{\hat u}^2/\sigma_u^2)\boldsymbol\Sigma_{\hat\beta|X}\),改写

\[\tilde t=\frac{(\hat\beta_j-\beta_{j,0})/\sqrt{(\boldsymbol\Sigma_{\hat\beta|X})_{jj}}}{\sqrt{W/(n-k-1)}},\quad W=(n-k-1)s_{\hat u}^2/\sigma_u^2\tag{19.80}\]
(i) 由 (19.30);(ii) 由 (19.31);(iii) \(\hat\beta-\beta=(\mathbf X'\mathbf X)^{-1}\mathbf X'\mathbf U\),\(s_{\hat u}^2=(\mathbf M_X\mathbf U)'(\mathbf M_X\mathbf U)/(n-k-1)\),两者都是正态 \(\mathbf U\) 的线性函数,而 \(\mathbf M_X\mathbf X(\mathbf X'\mathbf X)^{-1}=\mathbf 0\),由 (19.76) 独立:
\[\hat{\boldsymbol\beta}\text{ 与 }s_{\hat u}^2\text{ 独立}\tag{19.81}\]
(19.37) 的证明:\(W_1=(\mathbf R\hat\beta-\mathbf r)'[\mathbf R(\mathbf X'\mathbf X)^{-1}\mathbf R'\sigma_u^2]^{-1}(\mathbf R\hat\beta-\mathbf r)\),\(W_2=(n-k-1)s_{\hat u}^2/\sigma_u^2\),\(\tilde F=(W_1/q)/[W_2/(n-k-1)]\)。(i) 原假设下 \(\mathbf R(\hat\beta-\beta)\sim N(\mathbf 0,\mathbf R(\mathbf X'\mathbf X)^{-1}\mathbf R'\sigma_u^2)\),由 (19.77) \(W_1\sim\chi^2_q\);(ii) (19.31);(iii) 由 (19.81) 独立。

附录 19.5 多元高斯–马尔可夫定理的证明(PDF p.756–757)

设 \(\tilde{\boldsymbol\beta}=\mathbf A'\mathbf Y\) 线性条件无偏。\(\tilde\beta=(\mathbf A'\mathbf X)\beta+\mathbf A'\mathbf U\),由条件 (i) \(E(\tilde\beta|\mathbf X)=(\mathbf A'\mathbf X)\beta\),无偏要求 \(\mathbf A'\mathbf X=\mathbf I_{k+1}\);于是 \(\tilde\beta=\beta+\mathbf A'\mathbf U\),\(\mathrm{var}(\tilde\beta|\mathbf X)=\mathbf A'E(\mathbf U\mathbf U'|\mathbf X)\mathbf A=\sigma_u^2\mathbf A'\mathbf A\):

\[\mathbf A'\mathbf X=\mathbf I_{k+1},\quad\mathrm{var}(\tilde{\boldsymbol\beta}|\mathbf X)=\sigma_u^2\mathbf A'\mathbf A\tag{19.82}\]
OLS 对应 \(\hat{\mathbf A}=\mathbf X(\mathbf X'\mathbf X)^{-1}\)。令 \(\mathbf A=\hat{\mathbf A}+\mathbf D\)。\(\hat{\mathbf A}'\mathbf A=(\mathbf X'\mathbf X)^{-1}\mathbf X'\mathbf A=(\mathbf X'\mathbf X)^{-1}\),\(\hat{\mathbf A}'\hat{\mathbf A}=(\mathbf X'\mathbf X)^{-1}\),故 \(\hat{\mathbf A}'\mathbf D=\mathbf 0\)。于是
\[\mathrm{var}(\tilde\beta|\mathbf X)=\sigma_u^2(\hat{\mathbf A}+\mathbf D)'(\hat{\mathbf A}+\mathbf D)=\sigma_u^2(\mathbf X'\mathbf X)^{-1}+\sigma_u^2\mathbf D'\mathbf D\tag{19.83}\]
\[\mathrm{var}(\mathbf c'\tilde\beta|\mathbf X)-\mathrm{var}(\mathbf c'\hat\beta|\mathbf X)=\sigma_u^2\mathbf c'\mathbf D'\mathbf D\mathbf c\ge0\tag{19.84}\]
对所有非零 \(\mathbf c\) 取等当且仅当 \(\mathbf D=\mathbf 0\),即 \(\tilde\beta=\hat\beta\)。故 OLS 是 BLUE。

附录 19.6 IV 与 GMM 若干结果的证明(PDF p.757–759)

同方差下 TSLS 的有效性 (19.62):

\[\boldsymbol\Sigma^{IV}_A-\boldsymbol\Sigma^{TSLS}=(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\mathbf A[\mathbf Q_{ZZ}-\mathbf Q_{ZX}(\mathbf Q_{XZ}\mathbf Q_{ZZ}^{-1}\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}]\mathbf A\mathbf Q_{ZX}(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\sigma_u^2\tag{19.85}\]
(利用 \((\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX}=\mathbf I\)。)取 \(\mathbf F\) 为 \(\mathbf Q_{ZZ}\) 的矩阵平方根(\(\mathbf Q_{ZZ}=\mathbf F'\mathbf F\),\(\mathbf Q_{ZZ}^{-1}=\mathbf F^{-1}\mathbf F^{-1\prime}\)),改写为 (19.86),得
\[\mathbf c'(\boldsymbol\Sigma^{IV}_A-\boldsymbol\Sigma^{TSLS})\mathbf c=\mathbf d'[\mathbf I-\mathbf D(\mathbf D'\mathbf D)^{-1}\mathbf D']\mathbf d\,\sigma_u^2\tag{19.87}\]
\(\mathbf d=\mathbf F\mathbf A\mathbf Q_{ZX}(\mathbf Q_{XZ}\mathbf A\mathbf Q_{ZX})^{-1}\mathbf c\),\(\mathbf D=\mathbf F^{-1\prime}\mathbf Q_{ZX}\)。\(\mathbf I-\mathbf D(\mathbf D'\mathbf D)^{-1}\mathbf D'\) 对称幂等,特征值 0 或 1,二次型 \(\ge0\)。证毕。

同方差下 J 统计量的渐近分布:

\[\hat{\mathbf U}=\mathbf Y-\mathbf X\hat\beta^{TSLS}=[\mathbf I-\mathbf X(\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z]\mathbf U\tag{19.88}\]
\[\hat{\mathbf U}'\mathbf P_Z\hat{\mathbf U}=\mathbf U'[\mathbf P_Z-\mathbf P_Z\mathbf X(\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z]\mathbf U\tag{19.89}\]
写 \(\mathbf P_Z=\mathbf B\mathbf B'\),\(\mathbf B=\mathbf Z(\mathbf Z'\mathbf Z)^{-1/2}\),则
\[\hat{\mathbf U}'\mathbf P_Z\hat{\mathbf U}=\mathbf U'\mathbf B\mathbf M_{B'X}\mathbf B'\mathbf U,\quad\mathbf M_{B'X}=\mathbf I-\mathbf B'\mathbf X(\mathbf X'\mathbf B\mathbf B'\mathbf X)^{-1}\mathbf X'\mathbf B\tag{19.90}\]
原假设下 \(\mathbf Z'\mathbf U/\sqrt n\xrightarrow{d}N(\mathbf 0,\mathbf Q_{ZZ}\sigma_u^2)\),\(\mathbf B'\mathbf U\xrightarrow{d}\sigma_u\mathbf z\),\(\mathbf z\sim N(\mathbf 0,\mathbf I_{m+r+1})\);\(\mathbf M_{B'X}\xrightarrow{p}\mathbf M_{Q_{ZZ}^{-1/2}Q_{ZX}}\)。于是 \(\hat{\mathbf U}'\mathbf P_Z\hat{\mathbf U}\xrightarrow{d}(\mathbf z'\mathbf M\mathbf z)\sigma_u^2\) (19.91);分母 \(\hat{\mathbf U}'\mathbf M_Z\hat{\mathbf U}/(n-m-r-1)\xrightarrow{p}\sigma_u^2\) (19.92);故 \(J\xrightarrow{d}\mathbf z'\mathbf M\mathbf z\) (19.93)。\(\mathbf M\) 对称幂等,秩 \(=(m+r+1)-(k+r+1)=m-k\),由 (19.78) \(J\xrightarrow{d}\chi^2_{m-k}\)。

有效 GMM 的有效性:与 TSLS 证明平行,只是把 \(\mathbf Q_{ZZ}\sigma_u^2\) 换成 \(\mathbf H\)。GMM J 统计量的分布:与同方差 TSLS J 的证明平行。

附录 19.7 多预测变量回归:MSPE、岭回归与主成分(PDF p.759–763)

为第 14 章依赖矩阵运算的结果提供推导。

OLS 的 MSPE(推导 14.4 式):\(\mathbf X^{oos}\) 为待预测样本外观测的 \(k\times1\) 预测变量。对任意估计量

\[MSPE=\sigma_u^2+E[(\hat\beta-\beta)'\mathbf X^{oos}]^2\tag{19.94}\]
预测的最小二乘假设下样本外观测与估计样本独立同分布:
\[MSPE=\sigma_u^2+\mathrm{tr}\{E[(\hat\beta-\beta)(\hat\beta-\beta)']\mathbf Q_X\}\tag{19.95}\]
(用 \(\mathbf a'\mathbf B\mathbf a=\mathrm{tr}(\mathbf B\mathbf a\mathbf a')\) 和 \(E(\mathbf X^{oos}\mathbf X^{oos\prime})=\mathbf Q_X\)。)同方差下 OLS:\(E[(\hat\beta-\beta)(\hat\beta-\beta)']=E[(\mathbf X'\mathbf X)^{-1}]\sigma_u^2\),故
\[MSPE_{OLS}=\sigma_u^2+\frac1n\mathrm{tr}\left\{E\left[\left(\frac{\mathbf X'\mathbf X}{n}\right)^{-1}\right]\mathbf Q_X\right\}\sigma_u^2\tag{19.96}\]
\(n\) 相对 \(k\) 很大时 \(\mathbf X'\mathbf X/n\approx\mathbf Q_X\),迹 \(\approx\mathrm{tr}(\mathbf I_k)=k\):
\[MSPE_{OLS}\approx\left(1+\frac kn\right)\sigma_u^2\tag{19.97}\]
与最终预测误差 FPE 的联系:(19.97) 用于推导时间序列 FPE (15.21)(\(n\to T\),\(k\to p+1\))。区别:截面中样本内外独立;时间序列中用于样本外预测的末尾观测与样本内观测相关,但样本大时估计系数与样本外预测变量的依赖很小,(19.97) 仍近似成立。(量化含义:每多一个预测变量,样本外 MSPE 约增加 \(\sigma_u^2/n\)——过拟合成本的直接度量。)

岭回归(Ridge):最小化惩罚 SSR

\[S^{Ridge}(\mathbf b;\lambda^{Ridge})=(\mathbf Y-\mathbf X\mathbf b)'(\mathbf Y-\mathbf X\mathbf b)+\lambda^{Ridge}\mathbf b'\mathbf b\tag{19.98}\]
一阶条件 \(-2\mathbf X'(\mathbf Y-\mathbf X\hat\beta^{Ridge})+2\lambda^{Ridge}\hat\beta^{Ridge}=\mathbf 0\):
\[\hat{\boldsymbol\beta}^{Ridge}=(\mathbf X'\mathbf X+\lambda^{Ridge}\mathbf I_k)^{-1}\mathbf X'\mathbf Y\tag{19.99}\]
两个推论:

  1. 回归元在样本中不相关时 \(\mathbf X'\mathbf X\) 对角,\(\hat\beta_j^{Ridge}=(1+\lambda^{Ridge}/\sum_iX_{ji}^2)^{-1}\hat\beta_j\),即 OLS 向 0 收缩(14.8 式);若再用样本标准差标准化,\(\sum X_{ji}^2=n-1\),收缩因子为 \([1+\lambda^{Ridge}/(n-1)]^{-1}\)。
  2. 岭预测随预测变量的线性变换而改变(OLS 不会):用 \(\mathbf X\mathbf A\)(\(\mathbf A\) 非奇异)时 \(\hat\beta^{Ridge}_A=\mathbf A^{-1}[\mathbf X'\mathbf X+\lambda(\mathbf A\mathbf A')^{-1}]^{-1}\mathbf X'\mathbf Y\),样本外预测 \(\hat Y^{OOS}_A=\mathbf X^{OOS\prime}[\mathbf X'\mathbf X+\lambda(\mathbf A\mathbf A')^{-1}]^{-1}\mathbf X'\mathbf Y\),而原始为 \(\mathbf X^{OOS\prime}(\mathbf X'\mathbf X+\lambda\mathbf I_k)^{-1}\mathbf X'\mathbf Y\);仅当 \(\mathbf A\) 正交(\(\mathbf A\mathbf A'=\mathbf I_k\))时相同。\(\lambda=0\)(OLS)时与 \(\mathbf A\) 无关。(含义:岭回归结果依赖变量的尺度和组合方式,必须先标准化。)

主成分分析:Key Concept 14.2 定义第 \(j\) 个主成分为 \(\mathbf X\) 的线性组合,满足 (a) 权重平方和为 1;(b) 与前 \(j-1\) 个主成分不相关;(c) 在 (a)(b) 下方差最大。设 \(PC_j=\mathbf X\mathbf W_j\)(\(\mathbf X\) 已标准化、均值 0,\(PC_j'PC_j/(n-1)\) 为样本方差):

\[\max_{\mathbf W_j}PC_j'PC_j=\mathbf W_j'\mathbf X'\mathbf X\mathbf W_j\quad\text{s.t. }\mathbf W_j'\mathbf W_j=1,\ PC_j'PC_i=0\ (i<j)\tag{19.100}\]

  • \(j=1\):拉格朗日 \(\mathbf W_1'\mathbf X'\mathbf X\mathbf W_1-\lambda_1(\mathbf W_1'\mathbf W_1-1)\),一阶条件 \(\mathbf X'\mathbf X\mathbf W_1=\lambda_1\mathbf W_1\) (19.101),\(\mathbf W_1\) 是特征向量;左乘 \(\mathbf W_1'\) 得 \(PC_1'PC_1=\lambda_1\),故取最大特征值对应的单位特征向量。
  • \(j=2\):拉格朗日加约束项 \(-\gamma_{21}\mathbf W_2'\mathbf X'\mathbf X\mathbf W_1\),一阶条件 \(\mathbf X'\mathbf X\mathbf W_2=\lambda_2\mathbf W_2+\frac12\gamma_{21}\mathbf X'\mathbf X\mathbf W_1\) (19.102)。由 (19.101) 左乘 \(\mathbf W_2'\) 及 \(\mathbf W_2'\mathbf X'\mathbf X\mathbf W_1=0\) 得 \(\mathbf W_2'\mathbf W_1=0\);对 (19.102) 左乘 \(\mathbf W_1'\) 得 \(\gamma_{21}=0\)。于是 \(\mathbf W_2\) 是第二大特征值的特征向量,\(PC_2'PC_2=\lambda_2\)。
  • 依此类推:\(\mathbf W_j\) 是 \(\mathbf X'\mathbf X\) 第 \(j\) 大特征值 \(\lambda_j\) 的单位特征向量,\(PC_j'PC_j=\lambda_j\),\(PC_j'PC_i=0\)。\(k<n\) 时只有前 \(k\) 个特征值非零,主成分总数 \(\min(n,k)\)。
  • 迹等于特征值之和:
    \[\mathrm{tr}(\mathbf X'\mathbf X)=\sum_{j=1}^{\min(n,k)}\lambda_j=\sum_{j=1}^{\min(n,k)}PC_j'PC_j\tag{19.103}\]
    两边除以 \(n-1\) 得 (14.10):主成分方差之和 = 各 \(X\) 方差之和(碎石图"解释方差比例"的依据)。
  • 样本外预测:前 \(r\) 个样本外主成分 \(PC^{OOS}_{1:r}=\mathbf W_{1:r}'\mathbf X^{OOS}\),\(\mathbf W_{1:r}\) 为估计样本中 \(\mathbf X'\mathbf X\) 前 \(r\) 个特征向量;\(\hat{\boldsymbol\gamma}\) 为 \(Y\) 对前 \(r\) 个主成分的 OLS 系数,
    \[\hat Y^{OOS}=\hat{\boldsymbol\gamma}'\mathbf W_{1:r}'\mathbf X^{OOS}\tag{19.104}\]
    (用于表 14.4 的主成分预测。)

第 19 章本章要点

  • 矩阵 OLS:\(\hat\beta=(\mathbf X'\mathbf X)^{-1}\mathbf X'\mathbf Y\),列满秩保证可逆;\(\hat\beta-\beta=(\mathbf X'\mathbf X)^{-1}\mathbf X'\mathbf U\) 是所有推导的出发点。
  • 渐近:\(\sqrt n(\hat\beta-\beta)\xrightarrow{d}N(\mathbf 0,\mathbf Q_X^{-1}\boldsymbol\Sigma_V\mathbf Q_X^{-1})\)(三明治);HC1 稳健协方差;小样本可用 HC2/HC3 或 t 近似;线性组合置信区间 \(\mathbf d'\hat\beta\pm1.96\sqrt{\mathbf d'\hat\Sigma\mathbf d}\)。
  • 联合检验统一为 \(\mathbf R\beta=\mathbf r\);稳健 Wald F 渐近 \(F_{q,\infty}\);置信集为椭球。
  • 正态同方差下:\(\hat\beta\sim N(\beta,\sigma^2(\mathbf X'\mathbf X)^{-1})\),\(s^2\sim\sigma^2\chi^2_{n-k-1}/(n-k-1)\),二者独立 ⇒ 精确 \(t_{n-k-1}\)、\(F_{q,n-k-1}\);关键工具是投影矩阵 \(\mathbf P_X,\mathbf M_X\) 和正态二次型的卡方性质。
  • 高斯–马尔可夫:\(\mathbf A=\hat{\mathbf A}+\mathbf D\) 分解证明 BLUE。
  • GLS:\((\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}\mathbf X'\boldsymbol\Omega^{-1}\mathbf Y\);可行 GLS;但需要严格外生 \(E(\mathbf U|\mathbf X)=\mathbf 0\),预期驱动的时间序列中常不满足,此时 GLS 不一致而 OLS 一致。
  • IV/GMM:TSLS \(=(\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf Y\) 是权重 \((\mathbf Z'\mathbf Z)^{-1}\) 的 GMM;有效 GMM 权重 \(\mathbf H^{-1}\),两步法可行;J 检验 \(\chi^2_{m-k}\);时间序列中误差序列相关时 \(\mathbf H\) 用 HAC,鞅差分误差(不可预测冲击)时无需 HAC。
  • 附录 19.7:MSPE \(\approx(1+k/n)\sigma^2\);岭回归闭式解与尺度依赖;PCA 权重为 \(\mathbf X'\mathbf X\) 特征向量。

与量化交易的关联

  • 矩阵 OLS 与投影是所有多因子回归、风险模型、组合归因的实现基础:\(\hat\beta=(\mathbf X'\mathbf X)^{-1}\mathbf X'\mathbf Y\) 在代码中对应 lstsq/QR 分解;\(\mathbf M_X\) 即"对其他因子中性化"——Frisch–Waugh(习题 19.17)正是因子正交化、行业/市值中性化的数学依据:先对控制变量回归取残差,再做回归,系数相同。
  • 稳健协方差与 Wald 检验:检验多个因子系数同时为零、检验因子组合约束(如 \(\beta_1+\beta_2=1\))、构造联合置信椭球;HC1 在大样本可用,小样本(如月度因子收益仅数十期)应注意偏差,用 HC3 或 t 近似。面板/横截面回归中的聚类标准误(习题 19.15)对应按日期或股票聚类。
  • GLS:资产收益横截面回归中残差协方差非对角(行业相关),GLS 即用残差协方差逆加权——这与均值–方差组合优化 \(\mathbf w\propto\boldsymbol\Sigma^{-1}\boldsymbol\mu\) 的结构相同;Fama–MacBeth 与 GLS 横截面检验(如 GRS 检验)都依赖这一框架。书中强调的"GLS 需要严格外生"警示:用预期驱动的变量(价格、利率)作回归元时 GLS(含 Cochrane–Orcutt 型修正)可能不一致,宁可 OLS + HAC。
  • GMM:资产定价的标准估计方法——随机贴现因子模型的欧拉方程 \(E[m_{t+1}R_{t+1}-1|\mathcal F_t]=0\) 正是 (19.71) 形式的矩条件,滞后变量作工具;J 检验即模型整体检验(过度识别约束检验,如检验定价误差联合为零);两步有效 GMM、权重矩阵选择、误差序列相关时用 HAC 估计 \(\mathbf H\),都直接用于因子模型定价检验和期限结构模型估计。
  • 附录 19.7:MSPE \(\approx(1+k/n)\sigma^2\) 量化了加入因子的过拟合成本;岭回归的闭式解与"必须先标准化"的结论直接用于收缩估计的因子组合与收益预测;PCA 推导(特征向量 = 权重、特征值 = 方差)是统计风险模型、协方差矩阵降维、收益率曲线主成分(水平/斜率/曲率)的数学基础;样本外必须用估计样本的特征向量(19.104),否则引入前视偏差。

推荐习题

  • 19.5、19.10、19.11(投影矩阵、幂等矩阵与卡方二次型,是所有精确分布推导的工具)。
  • 19.6、19.17(Frisch–Waugh 与固定效应等价性,因子中性化的理论基础)。
  • 19.8(AR(1) 误差的 GLS / 准差分变换)。
  • 19.9(条件均值独立下关注系数仍一致——控制变量的正确理解)。
  • 19.12、19.14(有效 GMM 与 J 统计量)。
  • 19.13(约束最小二乘与 Wald F 的等价,带约束的组合回归会用到)。
  • 19.15(聚类标准误一致性)。
  • 19.16(缺失数据/样本选择偏差——对应幸存者偏差、只在有成交时观测价格等问题)。
  • 19.18(回归元相关导致系数估计负相关,解释因子共线时系数"此消彼长")。

书末内容(PDF p.764–801)

统计附表(Appendix Tables,PDF p.764–771)

  • 表 1 标准正态累积分布函数 \(\Phi(z)=\Pr(Z\le z)\)(PDF p.764–765):行为 \(z\) 的整数与第一位小数(−2.9 到 2.9),列为第二位小数。例:\(z=1.17\) 时查 1.1 行、7 列得 0.8790。左尾样例:\(\Phi(-2.0)=0.0228\),\(\Phi(-1.5)=0.0668\)。
  • 表 2 Student t 分布双侧/单侧临界值(PDF p.766):自由度 1–30、60、90、120、∞;列为双侧 20%/10%/5%/2%/1%(对应单侧 10%/5%/2.5%/1%/0.5%)。关键值:df=1 时 3.08/6.31/12.71/31.82/63.66;df=15 双侧 5% 为 2.13(书中示例);df=30 时 1.31/1.70/2.04/2.46/2.75;∞ 时 1.28/1.64/1.96/2.33/2.58。单侧"<"检验临界值取负。
  • 表 3 卡方分布临界值(PDF p.767):自由度 1–30 的 90/95/99 分位数。df=1:2.71/3.84/6.63;df=2:4.61/5.99/9.21;df=5:9.24/11.07/15.09;df=10:15.99/18.31/23.21;df=30:40.26/43.77/50.89。
  • 表 4 \(F_{m,\infty}\) 分布临界值(PDF p.768):\(m=1\)–30 的 10%/5%/1% 临界值(即 \(\chi^2_m/m\) 的分位数)。\(m=1\):2.71/3.84/6.63;\(m=2\):2.30/3.00/4.61;\(m=3\):2.08/2.60/3.78;\(m=4\):1.94/2.37/3.32;\(m=5\):1.85/2.21/3.02;\(m=10\):1.60/1.83/2.32;\(m=30\):1.34/1.46/1.70。
  • 表 5A/5B/5C \(F_{n_1,n_2}\) 分布临界值(PDF p.769–771):分别为 10%、5%、1% 显著性水平;分子自由度 \(n_1=1\)–10,分母自由度 \(n_2\) 从 1 起至 ∞。例(10%):\(F_{1,1}=39.86\),\(F_{2,10}=2.92\),\(F_{1,20}=2.97\)。
  • 原文 PDF 抽取中表格数字基本完整,个别值带空格(如 "7 .81"),含义清楚。

参考文献(References,PDF p.772–775)

按作者字母序列出全书引用文献,涵盖:因果推断与劳动经济(Acemoglu 等 2008、Angrist 1990、Angrist & Pischke 2009《Mostly Harmless Econometrics》、Card 1990/1999、Imbens & Angrist 1994、Heckman 系列);时间序列与金融计量(Andrews 1991/2003、Bai & Ng 2002、Bollerslev 1986、Carhart 1997、Dickey & Fuller 1979、Engle 1982、Engle & Granger 1987、Fuller 1976、Granger 1969、Hamilton 1994、Hansen B. 1992、Hansen L.P. 1982、Hayashi 2000、Kilian & Lütkepohl 2017、Sims 1980、Stock & Watson 1988/1993/2016、Stock & Yogo 2005、Diebold 2017、Enders 2009、Malkiel 2016);稳健标准误(Eicker 1967、Huber 1967、White 1980、Long & Ervin 2000、Imbens & Kolesár 2016、Cameron & Miller 2015);收缩估计(James & Stein 1961);机器学习与大数据应用(Kleinberg 等 2018、Jean 等 2016);教科书(Greene 2018、Wooldridge 2010、Maddala & Kim 1998);IV 起源(Wright 1915/1928);Tobin 1958、Cochrane & Orcutt 1949、Chow 1960 等。

术语表(Glossary,PDF p.776–784)

全书术语的英文定义汇编,按字母序。与本笔记范围(第 17–19 章)及量化最相关的条目中文要义如下(其余为前面各章基础概念,如接受域、备择假设、偏差、BLUE、置信区间、一致估计量、内生/外生、固定效应、IV、OLS、p 值、R² 等):

  • ADF 统计量:检验 AR(\(p\)) 单位根的回归统计量;Dickey–Fuller 统计量:检验 AR(1) 单位根。
  • 自相关/自协方差:序列与其第 \(j\) 阶滞后的相关/协方差。序列不相关:所有自相关为 0。
  • ARCH/GARCH:条件异方差的时间序列模型。波动率聚集:高方差期与低方差期各自成簇。已实现波动率:连续若干期上的样本均方根。
  • 协整:两个或多个时间序列共享同一随机趋势。共同趋势:多个序列共有的趋势。
  • 单整阶数:使序列平稳所需的差分次数,I(\(d\)) 需差分 \(d\) 次。单位根:最大根等于 1 的自回归。随机游走(带漂移):当期值 = 上期值 +(均值非零的)不可预测误差。随机趋势/确定性趋势:持久但随机的长期变动 / 可表示为时间非随机函数的长期变动。平稳/非平稳:序列及其滞后的联合分布不随时间变化/随时间变化。
  • 动态因子模型:\(N\) 个序列各表示为少数 \(r\) 个不可观测共同因子之和加特质扰动(与因子和其他序列的特质扰动不相关)。共同成分/特质成分:被因子解释/不被解释的部分。主成分:标准化变量的线性组合,第 \(j\) 个在与前 \(j-1\) 个不相关的约束下方差最大。碎石图:按主成分序号排列的归一化方差。
  • Nowcast:对当前期(预测所在期)的预测。一步/多步预测。扇形图(fan chart):随步长展示预测分布(不确定性)的时间序列图。预测区间、预测误差、MSFE/RMSFE、伪样本外预测、FPE(最终预测误差):OLS 估计系数时 MSFE 的估计。
  • Granger 因果检验:检验一个序列的当期与滞后值是否帮助预测另一序列的未来值。
  • VAR:\(k\) 个变量 \(k\) 个方程,所有方程的回归元都是所有变量的滞后。
  • HAC/HAR 标准误:不论误差是否异方差和/或自相关都一致的标准误。聚类标准误:适用于面板数据。
  • 严格外生:分布滞后模型中误差在给定回归元过去、当期、未来值时均值为零。
  • GLS / 可行 GLS:误差有已知形式异方差(即 WLS)或已知形式序列相关时 OLS 的推广;可行版用误差方差、协方差的估计。WLS / 可行 WLS。
  • GMM:通过使样本矩拟合(作为未知参数函数的)总体矩来估计参数;IV 估计量是重要特例。J 统计量:IV 回归中检验过度识别约束。恰好识别/过度识别/不足识别:工具数等于/多于/少于内生回归元数。弱工具:与内生回归元相关性低。
  • 高斯–马尔可夫定理:一定条件下 OLS 是条件于回归元的 BLUE。
  • Slutsky 定理/连续映射定理/依分布收敛/依概率收敛/渐近分布/中心极限定理/大数定律/迭代期望律。
  • Lasso:惩罚项与系数绝对值之和成比例;岭回归:惩罚与系数平方和成比例;收缩估计量:把 OLS 向某点(通常 0)收缩、引入偏差以降低方差;稀疏模型:只有少数预测变量系数非零;惩罚 SSR、惩罚项;m 折交叉验证;oracle 预测:用未知条件均值作出的不可行最佳预测;标准化预测回归模型。
  • 峰度(kurtosis):分布尾部质量的度量;尖峰(leptokurtic):峰度大于 3、尾部比正态厚。偏度:分布不对称性。离群值。
  • 样本选择偏差:数据可得性受与因变量相关的选择过程影响而产生的偏差。幸存者偏差见正文。
  • 检验的水平(size)/功效(power)/第一类、第二类错误;Bonferroni 检验:逐个检验分量假设并用调整后的临界值检验联合假设。
  • Chow 检验/QLR 统计量:已知/未知断点日期的断点检验。断点日期。
  • 动态乘数/累积动态乘数/长期累积动态乘数/冲击效应(impact effect)。

索引(Index,PDF p.786–798)

PDF p.785 与 p.801 为空白页。索引中的页码是原书印刷页码(= PDF 页码 − 1)。索引按字母排列全书主题及页码(图以 f、表以 t 标注),例如:ADF 统计量 586–589;ARCH 669–671;Bai–Ng 惩罚 675;BIC 用于 VAR 652;股票 Beta 152;资本资产定价模型(CAPM);渐近分布 690–694;动态因子模型 671–676;幸存者偏差 341 等。无需单独精读。

封底内页:大样本临界值速查(PDF p.799–800)

  • 标准正态下 t 统计量大样本临界值:双侧检验(拒绝若 \(|t|\) 大于)10%/5%/1% 为 1.64/1.96/2.58;单侧右尾(拒绝若 \(t\) 大于)1.28/1.64/2.33;单侧左尾(拒绝若 \(t\) 小于)−1.28/−1.64/−2.33。
  • \(F_{m,\infty}\) 大样本临界值:\(m=1\)–30,同表 4(如 \(m=1\):2.71/3.84/6.63;\(m=2\):2.30/3.00/4.61;\(m=30\):1.34/1.46/1.70)。
  • 与量化的关联:回测中多重检验时(大量因子挖掘),单一 1.96 门槛远远不够,应参考 Bonferroni 调整或更高 t 门槛(如 3.0);\(F_{m,\infty}\) 表用于大样本下多个因子联合显著性检验。