量化交易中文教材

第 07 章 多元回归的假设检验与置信区间

学习目标

读完本章,你应当能够:

  1. 在多元回归中对单个系数做 t 检验、构造置信区间,并理解加入相关回归元如何改变系数和标准误。
  2. 解释为什么不能用「逐个 t 检验」检验联合假设,算出其实际检验水平;用异方差稳健 F 统计量检验 \(q\) 个约束。
  3. 用受约束/无约束回归的 SSR 或 \(R^2\) 计算仅同方差 F 统计量,并知道它为什么在实践中不能代替稳健 F。
  4. 用重参数化(变换回归)把「涉及多个系数的单一约束」转化为单系数 t 检验,并求出系数线性组合的置信区间。
  5. 理解多系数置信集(置信椭圆)及其形状的来源。
  6. 按「基准设定 + 备选设定」的思路选择控制变量,说清 \(R^2\) 能告诉你什么、不能告诉你什么;掌握 Bonferroni 检验及其在多重检验中的意义。

读前导读

这一章在解决什么问题。 多元回归里的推断。单个系数的 t 检验和置信区间与第 5 章完全一样,本章用一节带过。重点是联合假设:同时检验多个系数。CFA 二级里你用过两种 F 检验:整体显著性 F(所有斜率是否同时为 0),以及比较「受约束/无约束」两个嵌套模型的 F(用两者的 SSR 计算)。本章在此基础上多讲了几件 CFA 没有展开的事:

  • 为什么不能逐个看 t:两个约束各用 1.96,实际犯第一类错误的概率接近 10%,约束越多越离谱。这是多重检验问题最简单的形式。
  • CFA 的 SSR 版 F 只在同方差下成立。本章给出异方差稳健的 F(Wald 形式),并用加州数据展示两者可以相差很大(8.01 对 5.43)。这延续了第 5 章「默认用稳健标准误」的主线。
  • 涉及多个系数的单一约束(如 \(\beta_1=\beta_2\))可以通过「变换回归」变成普通的 t 检验,这个技巧以后会反复用到。
  • 置信椭圆解释了「单个都不显著、合起来却显著」这一在因子研究中很常见的现象。
  • 模型设定的方法论:基准设定 + 备选设定,以及 \(R^2\) 不能告诉你的四件事。

需要先想起来的数学。

  • 二次型:形如 \(v^\top Av\) 的式子,\(v\) 是向量、\(A\) 是矩阵,结果是一个数。二维时 \(v=(a,b)^\top\)、\(A=\begin{pmatrix}p&r\\r&s\end{pmatrix}\),\(v^\top Av=pa^2+2rab+sb^2\)。稳健 F 统计量和置信椭圆都是二次型。见 第 00 册第 06 章 线性代数速成 中「正定矩阵」与「协方差矩阵」。
  • 协方差矩阵及其逆:\(\hat\Sigma_{\hat\beta}\) 的对角线是各系数的方差,非对角线是协方差。它的逆矩阵在 F 统计量里起「按不确定性标准化」的作用,就像一维情形除以方差。见 第 00 册第 06 章。
  • 概率的并与交:\(\Pr(A\text{ 或 }B)=\Pr(A)+\Pr(B)-\Pr(A\text{ 且 }B)\);独立时 \(\Pr(A\text{ 且 }B)=\Pr(A)\Pr(B)\)。7.2.2 和 7.7 节全靠这两条。见 第 00 册第 07 章 概率中的分析工具 中「常用不等式」。
  • 卡方与 F 分布:\(\chi^2_q\) 是 \(q\) 个独立标准正态的平方和,\(F_{q,\infty}=\chi^2_q/q\)。第 2 章 2.4 节已复习。

怎么读这一章。 7.1 快读,只需留意 7.1.4(加入生均支出后 STR 系数的变化)以及它对「保持其他不变」的解读。7.2 是核心:7.2.2 的「两次机会」、7.2.3 的稳健 F、7.2.4 中两种 F 的差异都要读懂。7.3 的变换回归技巧必读。7.4 配合讲解框理解椭圆的形状即可。7.5、7.6 是方法论,不涉及推导,但对写研究报告很有用,建议读完。7.7 Bonferroni 很短,与第 3 章 3.2.3 节和量化实战的「因子动物园」连起来读。


7.0 本章要解决的问题

上一章用多元回归缓解遗漏变量偏差。OLS 估计量仍有抽样不确定性,本章用标准误、假设检验和置信区间来量化它。

单个系数的推断与第 05 章没有本质区别。多元回归带来的新情形是联合假设(joint hypotheses):同时涉及两个或更多系数的假设,例如「师生比和生均支出都对成绩没有影响」。这需要新的检验统计量,即 F 统计量(F-statistic)。

本章结构:7.1 节单系数推断;7.2、7.3 节涉及多个系数的假设;7.4 节多系数置信集;7.5 节如何选择回归设定;7.6 节用加州数据改进班级规模效应的估计;7.7 节介绍 Bonferroni 检验。


7.1 单个系数的假设检验与置信区间

7.1.1 标准误

单回归中,标准误由「把方差公式中的期望换成样本均值」得到(式 5.4),大数定律保证 \(\hat\sigma^2_{\hat\beta_1}/\sigma^2_{\hat\beta_1}\xrightarrow{p}1\)。多元回归完全类似:\(\hat\beta_j\) 的标准差由标准误 \(SE(\hat\beta_j)\) 估计,只是公式要用矩阵表示。异方差稳健的协方差矩阵估计为

\[\hat\Sigma_{\hat\beta}=(X^\top X)^{-1}\left(\sum_{i=1}^n\hat u_i^2\,x_ix_i^\top\right)(X^\top X)^{-1}\times\frac{n}{n-k-1},\]

其中 \(x_i\) 是第 \(i\) 个观测的回归元向量(含常数 1),\(SE(\hat\beta_j)\) 是其第 \(j\) 个对角元的平方根。这个「三明治」形式(原书第 19 章,即本册第 19a 章)在 \(k=1\) 时就是式 (5.4)。概念上,单回归与多元回归没有区别:关键都是估计量在大样本下近似正态,并且我们能一致地估计其抽样分布的标准差。

白话解释:这个公式看着吓人,逐块对应到式 (5.4) 就不难了。

  • \(x_ix_i^\top\) 是第 \(i\) 个观测的回归元向量与自己的「外积」,得到一个 \((k+1)\times(k+1)\) 的小矩阵,元素是 \(X_{ji}X_{mi}\)。乘上 \(\hat u_i^2\) 再对 \(i\) 求和,就是 (5.4) 分子 \(\sum(X_i-\bar X)^2\hat u_i^2\) 的多变量版本:每个观测按自己的残差大小报告噪声。
  • 两边的 \((X^\top X)^{-1}\) 是 (5.4) 分母 \([\sum(X_i-\bar X)^2]^2\) 的多变量版本:一边一个,所以叫「三明治」,\((X^\top X)^{-1}\) 是面包,中间是馅。
  • 若误差同方差,馅里的 \(\hat u_i^2\) 可以换成常数 \(s^2_{\hat u}\),馅变成 \(s^2_{\hat u}X^\top X\),与一片面包相消,就得到经典公式 \(s^2_{\hat u}(X^\top X)^{-1}\)。这正是第 5 章 5.4.3 节「同方差时分子能化简」的矩阵版。

金融直觉:风险模型里组合方差写成 \(w^\top\Sigma w\),这里系数的协方差矩阵也是类似的「两边夹」结构。\(\hat\Sigma_{\hat\beta}\) 的非对角元(系数之间的协方差)在本章非常重要:检验 \(\beta_1=\beta_2\)、算置信椭圆、算联合 F,都离不开它;只看回归表里每个系数的 SE 是不够的。

7.1.2 单系数检验与置信区间

\[H_0:\beta_j=\beta_{j,0}\quad\text{vs.}\quad H_1:\beta_j\ne\beta_{j,0}\tag{7.1}\]

零假设的取值来自经济理论或决策情境(例如 \(\beta_{STR}=0\))。依据是 Key Concept 6.5:\(\hat\beta_j\) 近似正态,零假设下均值为 \(\beta_{j,0}\),方差可以一致估计,所以照搬单回归的步骤。

Key Concept 7.1(检验 \(\beta_j=\beta_{j,0}\))

  1. 计算 \(SE(\hat\beta_j)\);
  2. 计算 \(t=\dfrac{\hat\beta_j-\beta_{j,0}}{SE(\hat\beta_j)}\)(7.2);
  3. 计算 p 值 \(p=2\Phi(-|t^{act}|)\)(7.3);p < 0.05 或 \(|t^{act}|>1.96\) 时在 5% 水平拒绝。

Key Concept 7.2(\(\beta_j\) 的置信区间) 大样本下 95% 置信区间为

\[\left[\hat\beta_j-1.96SE(\hat\beta_j),\ \hat\beta_j+1.96SE(\hat\beta_j)\right],\tag{7.4}\]
即以 95% 概率包含真值的区间,或 5% 双侧检验不能拒绝的值的集合;90% 区间把 1.96 换成 1.64。

这些方法依赖大样本正态近似,只在大样本中有保证。

7.1.3 应用:控制英语学习者比例

\[\widehat{TestScore}=\underset{(8.7)}{686.0}-\underset{(0.43)}{1.10}\times STR-\underset{(0.031)}{0.650}\times PctEL\tag{7.5}\]

检验 STR 系数为 0:\(t=-1.10/0.43=-2.54\),\(p=2\Phi(-2.54)=1.1\%\),在 5% 水平拒绝,但在 1% 水平不能拒绝。95% 置信区间为 \(-1.10\pm1.96\times0.43=(-1.95,-0.26)\)。师生比降 2 的效应的置信区间为 \((0.52,3.90)\) 分。

7.1.4 再加入生均支出

督学追问:雇更多教师,钱从哪里来?可以削减其他预算(不买新电脑、减少维护),也可以要求增加预算(纳税人会反对)。那么,保持生均支出不变(同时保持 PctEL 不变)时,降低师生比的效应是多少?

\[\widehat{TestScore}=\underset{(15.5)}{649.6}-\underset{(0.48)}{0.29}\times STR+\underset{(1.59)}{3.87}\times Expn-\underset{(0.032)}{0.656}\times PctEL\tag{7.6}\]

Expn 是生均年度总支出(千美元)。结果出人意料:STR 的系数从 −1.10 降到 −0.29,\(t=-0.29/0.48=-0.60\),即使在 10% 水平也不能拒绝为零(\(|-0.60|<1.64\))。也就是说,没有证据表明在生均支出不变时雇更多教师能提高成绩。

一种解读是:加州学区的预算分配是有效的。假如 STR 的系数在 (7.6) 中又大又负,学区就可以削减教材、技术、体育等开支去雇教师,在总支出不变的情况下缩小班级、提高成绩;系数小且不显著,说明这种资金转移几乎没有效果,学区已经有效地配置了资金。

还要注意 STR 的标准误从 0.43 升到 0.48。STR 与 Expn 的相关系数为 −0.62,回归元相关使估计更不精确,这就是第 06 章的不完全多重共线。

白话解释:(7.5) 与 (7.6) 中 STR 的系数回答的是不同的问题,不是一个对、一个错。(7.5) 问:「英语学习者比例相同时,班级小 1 人的学区成绩高多少?」这时小班学区往往也花钱更多,系数里包含了「多花钱」的效应。(7.6) 问:「英语学习者比例和生均支出都相同时,班级小 1 人的学区成绩高多少?」支出不变,小班只能靠挤占其他开支,系数衡量的是「同一笔钱换成教师」的效果。加入哪个控制变量,取决于你想回答哪个政策问题。

金融直觉:类似于评估交易团队扩编的效果。问「多一名交易员,盈利增加多少」,答案包含了随之而来的系统、数据、风控投入;问「总预算不变、多一名交易员(相应少买一些数据),盈利增加多少」,答案可能接近零,说明预算已经分配得比较合理。两个系数都对,但对应的决策不同。

愤怒的纳税人此时声称:\(\beta_1=0\) 且 \(\beta_2=0\),即师生比和生均支出都无效。检验 \(\beta_2=0\) 的 \(t=3.87/1.59=2.43\),看似可以拒绝。但这个推理有缺陷,因为这是一个联合假设,需要 F 统计量。


7.2 联合假设检验

7.2.1 联合零假设

\[H_0:\beta_1=0\text{ 且 }\beta_2=0\quad\text{vs.}\quad H_1:\beta_1\ne0\text{ 和/或 }\beta_2\ne0\tag{7.7}\]

这个零假设对系数施加了两个约束(restrictions)。一般形式为

\[H_0:\beta_j=\beta_{j,0},\ \beta_m=\beta_{m,0},\ \dots\text{(共 }q\text{ 个约束)}\quad\text{vs.}\quad H_1:\text{至少一个约束不成立}.\tag{7.8}\]

例如 \(k=6\) 时检验 \(\beta_2=\beta_4=\beta_5=0\),\(q=3\)。只要零假设中有一个等式不成立,联合零假设就为假。

7.2.2 为什么不能逐个检验

一个诱人的规则:「\(|t_1|\) 或 \(|t_2|\) 超过 1.96 就拒绝」。我们来算它的检验水平(size,即零假设为真时的拒绝概率)。

大样本下 \(\hat\beta_1,\hat\beta_2\) 联合正态,零假设下 \(t_1,t_2\) 服从二元正态,各自均值 0、方差 1。若 \(t_1,t_2\) 不相关(大样本下即独立),则

\[\Pr(\text{不拒绝})=\Pr(|t_1|\le1.96)\Pr(|t_2|\le1.96)=0.95^2=90.25\%,\]

检验水平为 \(1-0.95^2=9.75\%\),而不是 5%。原因是你有两次机会拒绝。若回归元相关,水平取决于相关程度,情况更复杂。\(q\) 个独立约束时,水平为 \(1-0.95^q\):\(q=10\) 时约 40%,\(q=100\) 时超过 99%。逐个检验的水平是错的,需要新方法。

推导拆解:「拒绝」= 至少一个 \(|t_j|>1.96\);它的反面「不拒绝」= 所有 \(|t_j|\le1.96\)。独立时「同时发生」的概率等于各自概率相乘,每个是 0.95,\(q\) 个就是 \(0.95^q\);拒绝概率是 \(1-0.95^q\)。数值上 \(0.95^{10}\approx0.599\),\(0.95^{100}\approx0.006\)。 相关时为什么水平反而接近 5%?极端情况下 \(t_1=t_2\)(完全正相关),两次机会其实是同一次机会,水平就是 5%。相关越强,「第二次机会」越不独立,额外的拒绝概率越小。所以独立情形是逐个检验最糟的情况,代码第 3 段 \(\rho=0.9\) 时水平降到 7.4% 印证了这一点。

金融直觉:这就是回测中「多试几个参数」的代价。一个策略在 10 个互不相关的参数组合上分别检验,只要有一个 \(|t|>1.96\) 就宣称成功,实际的假阳性概率约 40%。参数组合之间越相似(例如回看窗口 20 天和 21 天),代价越小;越是试探迥异的设定,代价越大。

一种修正是 Bonferroni 方法(7.7 节):调大临界值,使水平不超过目标显著性水平。优点是适用面广,缺点是功效(power)可能较低,备择为真时常常不能拒绝。更好的方法是 F 统计量,尤其当回归元高度相关时,它的功效更高。

7.2.3 F 统计量

两个约束(\(q=2\))。

\[F=\frac12\left(\frac{t_1^2+t_2^2-2\hat\rho_{t_1,t_2}t_1t_2}{1-\hat\rho^2_{t_1,t_2}}\right),\tag{7.9}\]

\(\hat\rho_{t_1,t_2}\) 是两个 t 统计量相关系数的估计。先看特例:若已知 \(t_1,t_2\) 不相关,\(F=\frac12(t_1^2+t_2^2)\),就是两个 t 平方的平均。零假设下它是两个独立标准正态平方之和除以 2,服从 \(F_{2,\infty}\) 分布;备择下至少一个 \(t^2\) 会很大,导致拒绝。一般情形下,(7.9) 对 t 统计量之间的相关性做了调整,使零假设下的大样本分布始终是 \(F_{2,\infty}\)。

\(q\) 个约束。 把约束写成矩阵形式 \(H_0:R\beta=r\)(\(R\) 为 \(q\times(k+1)\) 矩阵),异方差稳健 F 统计量为

\[F=\frac1q\,(R\hat\beta-r)^\top\left[R\hat\Sigma_{\hat\beta}R^\top\right]^{-1}(R\hat\beta-r),\]

其中 \(\hat\Sigma_{\hat\beta}\) 是 7.1.1 节的稳健协方差矩阵。它就是 Wald 统计量除以 \(q\)(原书 19.3 节);\(q=2\) 时化为 (7.9)。零假设下大样本

\[F\sim F_{q,\infty}.\tag{7.10}\]

只要使用稳健协方差矩阵,无论同方差还是异方差,大样本分布都是 \(F_{q,\infty}\)。许多软件默认使用仅同方差版本,需要选择「robust」选项。

推导拆解:从一维推广到多维。

  1. \(q=1\):\(F=t^2=\dfrac{(\hat\beta_j-\beta_{j,0})^2}{SE^2}\),即「偏离量的平方 ÷ 方差」。
  2. \(q\) 维:偏离量变成向量 \(R\hat\beta-r\)(\(q\times1\)),它的协方差矩阵是 \(R\hat\Sigma_{\hat\beta}R^\top\)(线性变换的协方差公式,类似 \(\operatorname{var}(aX)=a^2\operatorname{var}(X)\))。「平方 ÷ 方差」的矩阵版本就是 \((R\hat\beta-r)^\top[R\hat\Sigma_{\hat\beta}R^\top]^{-1}(R\hat\beta-r)\)。
  3. 为什么服从 \(\chi^2_q\):零假设下 \(R\hat\beta-r\) 近似为均值 0 的 \(q\) 维正态。用协方差矩阵的逆做标准化,相当于先把 \(q\) 个相关的偏离量变换成 \(q\) 个独立的标准正态,再求平方和,所以是 \(\chi^2_q\)。除以 \(q\) 就是 \(F_{q,\infty}\)。
  4. \(R\) 和 \(r\) 怎么写:检验 \(\beta_1=0\) 且 \(\beta_2=0\)(模型含 \(\beta_0,\beta_1,\beta_2,\beta_3\))时,\(R=\begin{pmatrix}0&1&0&0\\0&0&1&0\end{pmatrix}\),\(r=(0,0)^\top\)。\(R\) 的每一行「挑出」一个约束涉及的系数组合,代码第 1 段的 R 矩阵正是这样写的。 (7.9) 是 \(q=2\) 时把逆矩阵手算展开的结果:分母 \(1-\hat\rho^2\) 来自 \(2\times2\) 相关矩阵的行列式,交叉项 \(-2\hat\rho t_1t_2\) 扣掉了两个 t 统计量「重复计数」的部分。

金融直觉:这种「用协方差矩阵的逆标准化的距离」叫马氏距离(Mahalanobis distance),在风险管理里很常见:判断一组因子收益今天是否「异常」,不能只看每个因子各自偏离几个标准差,还要考虑它们平常是否同涨同跌。两个通常同向的因子今天一个大涨、一个大跌,各自偏离不算大,马氏距离却可能很大。F 统计量做的是同一件事。

p 值。

\[p=\Pr\left[F_{q,\infty}>F^{act}\right].\tag{7.11}\]

可以查 \(F_{q,\infty}\) 表,也可以查 \(\chi^2_q\) 表,因为 \(\chi^2_q\) 变量等于 \(q\) 倍的 \(F_{q,\infty}\) 变量。常用临界值:

\(q\) 10% 5% 1%
1 2.71 3.84 6.63
2 2.30 3.00 4.61
3 2.08 2.60 3.78
4 1.94 2.37 3.32

整体回归 F 统计量(overall regression F-statistic)检验全部斜率为零:

\[H_0:\beta_1=\beta_2=\cdots=\beta_k=0\quad\text{vs.}\quad H_1:\text{至少一个 }\beta_j\ne0.\tag{7.12}\]

零假设下回归元对 \(Y\) 毫无解释力,但截距(等于 \(Y\) 的均值)可以非零。大样本下它服从 \(F_{k,\infty}\)。

\(q=1\) 时,F 统计量等于 t 统计量的平方,\(F_{1,\infty}\) 的 5% 临界值 \(3.84=1.96^2\)。

应用。 在 (7.6) 中检验 \(\beta_1=\beta_2=0\),稳健 F = 5.43。\(F_{2,\infty}\) 的 5% 临界值为 3.00,1% 临界值为 4.61;5.43 > 4.61,在 1% 水平拒绝(p = 0.005)。因此可以拒绝纳税人「师生比和生均支出都无效」的说法(在控制 PctEL 的前提下)。

7.2.4 仅同方差 F 统计量

F 检验还有一种直观的表述:放松 \(q\) 个约束之后拟合改进了多少?这个改进是否大到不太可能仅来自抽样变异?同方差时这个直觉有精确的公式。

考虑两个回归:受约束回归(restricted regression)强制零假设成立(例如删掉相应的回归元),无约束回归(unrestricted regression)允许备择成立。

\[F=\frac{(SSR_{restricted}-SSR_{unrestricted})/q}{SSR_{unrestricted}/(n-k_{unrestricted}-1)}\tag{7.13}\]
\[F=\frac{(R^2_{unrestricted}-R^2_{restricted})/q}{(1-R^2_{unrestricted})/(n-k_{unrestricted}-1)}\tag{7.14}\]

\(k_{unrestricted}\) 是无约束回归的回归元个数。两式等价,因为两个回归的 TSS 相同,\(R^2=1-SSR/TSS\)(原书习题 7.10)。

同方差时它与稳健 F 的差异随 \(n\) 增大而消失,大样本下服从 \(F_{q,\infty}\)。优点:公式简单直观,只要有两个回归的 \(R^2\) 就能算,适合读论文时手算。缺点:只在同方差下有效,而经济和金融数据中同方差不可依赖,所以实践中不能代替稳健 F。

小样本。 若误差 i.i.d.、同方差且正态,仅同方差 F 精确服从 \(F_{q,\,n-k_{unrestricted}-1}\)(原书 19.4 节)。\(n\) 增大时它收敛到 \(F_{q,\infty}\)。

应用。 无约束回归 (7.6) 的 \(R^2=0.4366\);受约束回归为

\[\widehat{TestScore}=\underset{(1.0)}{664.7}-\underset{(0.032)}{0.671}\times PctEL,\quad R^2=0.4149.\tag{7.15}\]

\(q=2\),\(n=420\),\(k_{unrestricted}=3\):

\[F=\frac{(0.4366-0.4149)/2}{(1-0.4366)/(420-3-1)}=8.01.\]

8.01 超过 1% 临界值 4.61,拒绝零假设。但它与稳健 F 值 5.43 相差很大。这正是仅同方差 F 的主要缺点:可以用计算器算,但可能与更可靠的稳健值相去甚远。

白话解释:(7.13) 的读法:分子是「放开 \(q\) 个约束后,每个约束平均让 SSR 降了多少」;分母是无约束模型里「每个自由度平均剩多少残差平方」,也就是 \(s^2_{\hat u}\)。两者相比,看拟合的改进是否明显大于噪声水平。问题出在分母:它用一个平均噪声水平衡量所有观测,这正是同方差假设。若噪声在某些观测上特别大,而这些观测恰好对被检验的系数影响大,这个比较就失真了。CFA 教材里的嵌套模型 F 检验就是这个公式,所以在金融数据上用它时,要意识到它隐含了同方差假设。


7.3 涉及多个系数的单一约束

经济理论有时给出形如 \(\beta_1=\beta_2\) 的约束:

\[H_0:\beta_1=\beta_2\quad\text{vs.}\quad H_1:\beta_1\ne\beta_2.\tag{7.16}\]

这只是一个约束(\(q=1\)),但涉及两个系数。有两种方法。

方法 1:直接检验。 很多软件有专门的命令(statsmodels 中是 t_test("x1 - x2 = 0")),给出服从 \(F_{1,\infty}\) 的 F 统计量或对应的 t 统计量。其背后是线性组合的方差公式 \(\operatorname{var}(\hat\beta_1-\hat\beta_2)=\operatorname{var}(\hat\beta_1)+\operatorname{var}(\hat\beta_2)-2\operatorname{cov}(\hat\beta_1,\hat\beta_2)\),协方差项不能漏。

方法 2:变换回归。 对

\[Y_i=\beta_0+\beta_1X_{1i}+\beta_2X_{2i}+u_i\tag{7.17}\]

加减 \(\beta_2X_{1i}\):

\[\beta_1X_{1i}+\beta_2X_{2i}=(\beta_1-\beta_2)X_{1i}+\beta_2(X_{1i}+X_{2i})=\gamma_1X_{1i}+\beta_2V_i,\]

其中 \(\gamma_1=\beta_1-\beta_2\),\(V_i=X_{1i}+X_{2i}\)。于是

\[Y_i=\beta_0+\gamma_1X_{1i}+\beta_2V_i+u_i.\tag{7.18}\]

零假设化为 \(\gamma_1=0\),用 7.1 节的 t 检验即可:构造 \(V_i\),把 \(Y\) 对 \(X_{1i}\) 和 \(V_i\) 回归。\(\beta_1-\beta_2\) 的 95% 置信区间为 \(\hat\gamma_1\pm1.96SE(\hat\gamma_1)\)。

两种方法等价:方法 1 的 F 等于方法 2 的 t 的平方。同样的技巧可以推广到其他线性约束(练习 7),第 08 章会用它计算非线性效应的标准误。

白话解释:变换回归的思路是「换一组坐标,让你关心的量直接变成某个系数」。原模型的系数是 \((\beta_1,\beta_2)\),你关心的是 \(\beta_1-\beta_2\);把回归元从 \((X_1,X_2)\) 换成 \((X_1,X_1+X_2)\),新系数恰好是 \((\beta_1-\beta_2,\beta_2)\)。拟合值、残差都没变(只是同一组列的不同线性组合),所以软件对新系数报告的标准误自动包含了协方差项,不用手算 \(\operatorname{cov}(\hat\beta_1,\hat\beta_2)\)。这在只能拿到回归软件标准输出时尤其方便。

金融直觉:检验「价值因子和动量因子的溢价相等」,或「某基金在牛市和熊市的 beta 相等」,都可以这样做。后者在合并样本里写成 \(R=\alpha+\beta_{\text{熊}}R_m+(\beta_{\text{牛}}-\beta_{\text{熊}})\cdot(R_m\times D_{\text{牛}})+u\),交互项的系数直接就是两种 beta 之差,它的 t 值就是检验结果。

推广到 \(q>1\)。 零假设可以包含 \(q\) 个约束,其中部分或全部涉及多个系数,7.2 节的 F 统计量同样适用。


7.4 多个系数的置信集

95% 置信集(confidence set)是在 95% 的随机样本中包含这些系数真值的集合,是单系数置信区间的推广。构造原理与 5.2 节相同:对每一对候选值 \((\beta_{1,0},\beta_{2,0})\) 计算 F 统计量,超过 5% 临界值 3.00 就拒绝;检验水平为 5%,所以真值在 95% 的样本中不被拒绝,未被拒绝的值的集合就是 95% 置信集。由 F 统计量的二次型形式,两个系数时置信集是一个椭圆(confidence ellipse):

\[\left\{(\beta_1,\beta_2):\ \tfrac12(\hat\beta-\beta)^\top\hat\Sigma_{12}^{-1}(\hat\beta-\beta)\le3.00\right\},\]

其中 \(\hat\Sigma_{12}\) 是 \((\hat\beta_1,\hat\beta_2)\) 的 \(2\times2\) 稳健协方差矩阵。

原书图 7.1 画出了基于 (7.6) 的 STR 系数(横轴)与 Expn 系数(纵轴)的 95% 置信椭圆。中心是点估计 \((-0.29,3.87)\),椭圆不包含 \((0,0)\),与 7.2 节 F 检验在 5% 水平拒绝一致。椭圆像一根「胖香肠」,长轴沿左下到右上方向,因为 \(\hat\beta_1\) 与 \(\hat\beta_2\) 正相关;而这又源于回归元 STR 与 Expn 负相关(生均支出高的学校师生比低),与式 (6.21) \(\operatorname{corr}(\hat\beta_1,\hat\beta_2)=-\rho_{X_1,X_2}\) 一致。

椭圆的形状揭示了一个重要现象:两个系数各自的置信区间可能都包含 0,但置信椭圆却不包含 \((0,0)\)。这就是「单个不显著、联合显著」,在回归元高度相关时很常见(见本章量化实战)。

白话解释:为什么是椭圆?若两个系数估计独立且方差相等,\(\{\text{距离}\le c\}\) 是一个圆;方差不等时圆被拉成轴对齐的椭圆;两者相关时椭圆再旋转。估计量正相关(\(\hat\beta_1\) 偏高时 \(\hat\beta_2\) 也常偏高),合理的组合沿着左下—右上分布,椭圆就朝那个方向拉长。 「单个区间都含 0、椭圆不含原点」的情形:设两个回归元高度正相关,系数估计强负相关,椭圆沿左上—右下方向又细又长。原点可能恰好落在长条两侧的空白处:它的横坐标在 \(\beta_1\) 的区间内,纵坐标也在 \(\beta_2\) 的区间内,但这个组合不在长条上。数据很清楚地告诉你 \(\beta_1+\beta_2\) 大约是多少(垂直于长轴的方向很窄),却说不清它怎么分配(沿长轴方向很宽)。


7.5 多元回归的模型设定

7.5.1 选择控制变量

估计因果效应时,决定放入哪些变量(即选择回归设定,regression specification)很有挑战,没有放之四海而皆准的规则,但有指导原则。起点是思考遗漏变量偏差的可能来源,依靠对实证问题的专业知识,目标是得到关注因果效应的无偏估计;不要主要依赖 \(R^2\)、\(\bar R^2\) 这类纯统计的拟合度量。

一般层面的答案由条件均值独立给出:控制变量集合须满足 \(E(u_i\mid X_i,W_i)=E(u_i\mid W_i)\)(Key Concept 6.6;原书正文此处误写为 Key Concept 6.5),即在控制变量取值相同的观测中,关注变量如同随机分配。若不成立,保持 \(W\) 不变后仍然存在与 \(X\) 相关的 \(Y\) 的遗漏决定因素,产生遗漏变量偏差。

实践中需要结合应用来判断。例如:英语学习者比例相同的学区之间,经济条件可能差异很大;学区预算部分取决于富裕程度,富裕学区即使英语学习者比例相同,也更可能是小班;富裕家庭的孩子校外学习机会也更多。所以控制 PctEL 之后,富裕程度仍然满足遗漏变量偏差的两个条件,应该加入衡量经济条件的控制变量。

作者推荐两步法:

  1. 基准设定(base specification):结合专家判断、经济理论和数据收集方式,选出核心回归元集合,包含关注变量以及专家判断和理论建议的控制变量。
  2. 备选设定(alternative specifications):专家判断和理论很少具有决定性,理论建议的变量也常常没有数据,所以要列出若干备选设定。如果关注系数在各设定间数值相近,说明基准估计可靠;如果变化很大,往往说明原设定存在遗漏变量偏差,也提醒我们对备选设定同样保持警惕。原书 9.2 节会进一步阐述。

7.5.2 \(R^2\) 与 \(\bar R^2\) 在实践中的解读

\(R^2\) 接近 1 表示回归元在样本中预测因变量好,接近 0 则不好。它是对预测能力的有用概括,但很容易被过度解读。四个陷阱:

  1. \(R^2\) 或 \(\bar R^2\) 上升,不意味着新增变量统计显著。 \(R^2\) 加任何回归元都会升;\(\bar R^2\) 不一定升,但即使升了,也不代表新系数显著,要用 t 检验判断。
  2. 高 \(R^2\) 不意味着回归元是因变量的真实原因。 用成绩对人均停车场面积回归,停车场面积与师生比、城郊、收入相关,\(R^2\) 可能很高,但它不是原因。你不会告诉督学「多修停车位就能提高成绩」。
  3. 高 \(R^2\) 不意味着没有遗漏变量偏差。 6.1 节讨论遗漏变量偏差时完全没有提到 \(R^2\),因为它在逻辑上不起作用。低、中、高 \(R^2\) 都可能有偏差;低 \(R^2\) 也不意味着一定有偏差。
  4. 高 \(R^2\) 不意味着回归元集合最合适,低 \(R^2\) 也不意味着不合适。 回归元的选择要权衡遗漏变量偏差、数据可得性、数据质量,最重要的是经济理论和实质问题本身。

Key Concept 7.3(\(R^2\) 与 \(\bar R^2\) 能告诉你什么、不能告诉你什么) 能告诉你:回归元在手头样本中预测(解释)因变量的好坏,即 OLS 残差方差相对于因变量方差的大小。 不能告诉你:(1) 某个变量是否统计显著;(2) 回归元是否是因变量的真实原因;(3) 是否存在遗漏变量偏差;(4) 是否选择了最合适的回归元集合。


7.6 考试成绩数据的完整分析

7.6.1 基准设定与备选设定

目标:在控制可能导致遗漏变量偏差的因素后,估计 STR 的效应。校外学习机会等因素无法直接度量,所以纳入与之相关的控制变量。若控制变量充分(条件均值独立成立),STR 的系数就是保持这些因素不变时的效应。

三个学生背景控制变量:英语学习者比例;有资格获得补贴或免费午餐的学生比例;家庭符合加州收入援助项目(income assistance)的学生比例(资格门槛比午餐项目更严)。后两者都衡量经济困难学生的比例(彼此相关系数 0.74),理论无法告诉我们该用哪个,所以基准设定用午餐比例,备选设定用收入援助比例。原书图 7.2 显示成绩与三者都负相关:与 PctEL 的相关为 −0.64,与午餐比例为 −0.87,与收入援助比例为 −0.63。

7.6.2 回归元的尺度

一般原则:让结果易读易解释。PctEL 取值 0–100,系数为 −0.650;若改用 FracEL = PctEL/100(0–1),\(R^2\) 和 SER 完全不变,系数变为 −65.0,含义是比例增加 1(即 100 个百分点)的效应。两者数学等价,但 PctEL 的解释更自然。再如,以美元计的回归元系数是 0.00000356,换成百万美元后系数为 3.56,更容易读。

7.6.3 用表格呈现结果

多个回归、多个回归元时,表格比方程清楚。原书表 7.1 每列是一个回归,因变量相同。关注变量(STR)一行报告估计值、圆括号内的稳健 SE、方括号内的 95% 置信区间(读者可以直接看某个值是否在区间内来做 5% 检验);控制变量和截距只报告估计值和 SE(控制变量的系数一般没有因果解释,独立兴趣有限;控制变量很多时,有时只列出名称);最后几行报告 SER、\(\bar R^2\) 和 \(n\)。

表 7.1(因变量:学区平均成绩;\(n=420\);括号内为异方差稳健 SE)

回归元 (1) (2) (3) (4) (5)
STR −2.28 (0.52) [−3.30, −1.26] −1.10 (0.43) [−1.95, −0.25] −1.00 (0.27) [−1.53, −0.47] −1.31 (0.34) [−1.97, −0.64] −1.01 (0.27) [−1.54, −0.49]
PctEL −0.650 (0.031) −0.122 (0.033) −0.488 (0.030) −0.130 (0.036)
午餐资格 % −0.547 (0.024) −0.529 (0.038)
收入援助 % −0.790 (0.068) 0.048 (0.059)
截距 698.9 (10.4) 686.0 (8.7) 700.2 (5.6) 698.0 (6.9) 700.4 (5.5)
SER 18.58 14.46 9.08 11.65 9.08
\(\bar R^2\) 0.049 0.424 0.773 0.626 0.773

列 (1) 就是单回归,表中不报 t,但可以算出 \(t=-2.28/0.52=-4.38\),在 1% 水平拒绝。列 (2) 即 (7.5);列 (3) 是基准设定(STR + PctEL + 午餐比例);列 (4)(5) 是备选设定,考察经济背景度量方式的影响。

7.6.4 三条结论

  1. 控制学生特征后,STR 效应的估计约减半,且对选哪些控制变量不敏感。 所有设定中都能在 5% 水平拒绝系数为 0。在列 (2)–(5) 中,保持学生特征不变,每位教师少带一名学生,平均成绩约提高 1 分。
  2. 学生特征是成绩的强预测因子。 只有 STR 时 \(\bar R^2=0.049\),基准设定 (3) 跃升到 0.773。控制变量系数的符号与图 7.2 一致:英语学习者多、贫困学生多的学区成绩低。
  3. 收入援助比例似乎是冗余的。 列 (5) 在列 (3) 的基础上加入它,对 STR 的系数及其 SE 的影响可以忽略。

这些结果比第 05 章的单回归对督学有用得多。但到目前为止都假定总体回归函数对回归元是线性的;大班学区和小班学区降低师生比的效应可能不同,这需要第 08 章的非线性工具。


7.7 Bonferroni 检验(原书附录 7.1)

7.2 节的 F 检验是首选。但若只有论文的回归结果表、没有原始数据,就算不出 F 统计量(需要系数间的协方差)。这时可以用 Bonferroni 检验,它是「正确实施的逐个 t 检验」。规则:选一个临界值 \(c>0\),

\[\text{若 }|t_1|\le c\text{ 且 }|t_2|\le c\text{ 则不拒绝,否则拒绝}.\tag{7.22}\]

关键是选 \(c\),使零假设下的拒绝概率不超过目标水平,并且对 \(t_1,t_2\) 之间的任意相关性都成立。

Bonferroni 不等式。 \(\Pr(A\cup B)=\Pr(A)+\Pr(B)-\Pr(A\cap B)\le\Pr(A)+\Pr(B)\)。令 \(A\) 为事件 \(|t_1|>c\),\(B\) 为事件 \(|t_2|>c\):

\[\Pr(|t_1|>c\text{ 或 }|t_2|>c)\le\Pr(|t_1|>c)+\Pr(|t_2|>c).\tag{7.23}\]

大样本零假设下 \(\Pr(|t_j|>c)=\Pr(|Z|>c)\),所以

\[\Pr_{H_0}(\text{逐个检验拒绝})\le2\Pr(|Z|>c).\tag{7.24}\]

\(q\) 个约束时把 2 换成 \(q\)。要使水平不超过 \(\alpha\),取 \(c\) 满足 \(\Pr(|Z|>c)=\alpha/q\),即 \(c=\Phi^{-1}(1-\alpha/(2q))\)。

表 7.2 Bonferroni 临界值 \(c\)

\(q\) 10% 5% 1%
2 1.960 2.241 2.807
3 2.128 2.394 2.935
4 2.241 2.498 3.023

推导拆解:\(c=\Phi^{-1}(1-\alpha/(2q))\) 怎么来?要让每个检验的双侧拒绝概率 \(\Pr(|Z|>c)=\alpha/q\)。双侧概率是两个尾巴之和,每个尾巴分到 \(\alpha/(2q)\),即 \(\Pr(Z>c)=\alpha/(2q)\),也就是 \(\Phi(c)=1-\alpha/(2q)\),两边取 \(\Phi\) 的反函数 \(\Phi^{-1}\)(标准正态的分位数函数)得到 \(c\)。\(q\) 个检验各占 \(\alpha/q\),由 Bonferroni 不等式合计不超过 \(\alpha\)。 这个不等式只扔掉了「同时拒绝」的概率 \(\Pr(A\cap B)\)。各检验独立时这一项很小(\(\alpha^2/q^2\) 量级),Bonferroni 几乎是精确的;两个 t 统计量高度相关(无论正负)时这一项很大,Bonferroni 就过于保守,代码第 3 段 \(\rho=0.9\) 时水平只有 4.0% 就是这个原因。

例:5% 水平、\(q=2\) 时 \(c=2.241\),因为 \(\Pr(|Z|>2.241)=2.5\%\)。临界值大于单约束的 1.96,正是为「第二次机会」做的修正。若 t 基于稳健 SE,则无论是否异方差,Bonferroni 检验都有效;若基于仅同方差 SE,则只在同方差下有效。

应用。 (7.6) 中 \(t_1=-0.60\),\(t_2=2.43\)。\(|t_2|>2.241\),在 5% 水平拒绝联合零假设;但两者都小于 2.807,在 1% 水平不能拒绝。而 F 检验能在 1% 水平拒绝,这体现了 Bonferroni 检验功效较低。


量化实战

本章方法在量化里的位置

联合检验。 「一组行业虚拟变量是否联合显著」「价值类的三个因子是否联合有解释力」「一个策略在多个子样本的 alpha 是否同时为零」都是联合假设,必须用 F(Wald)检验,而不是逐个 t。资产定价中的 GRS 检验(Gibbons–Ross–Shanken,检验 \(N\) 个测试资产的 alpha 是否同时为零)就是多方程版本的 Wald/F 检验,其思路与本章一致。

多重检验与「因子动物园」。 7.2.2 节「两次机会 → 9.75%」是理解多重检验问题最简单的入口。研究员测试 200 个信号,即使全部无效,在 5% 水平上也会有约 10 个「显著」。Bonferroni 修正(临界值随检验次数 \(q\) 增大)是 Harvey、Liu、Zhu(2016)主张新因子 t 值至少超过 3 的出发点之一;由于 Bonferroni 在检验很多时过于保守、功效太低,后续又发展出 Holm 逐步法和控制错误发现率(FDR)的 Benjamini–Hochberg 等方法。第 03 册有多重检验的系统讨论。

单个不显著、联合显著。 两个高度相关的因子(例如价值与盈利,或两个窗口的动量)放进同一回归,各自的 t 都可能不显著,但联合 F 显著。这时不能说「两个因子都没用」,而是数据无法区分谁的贡献更大。

约束检验的重参数化。 检验两个因子溢价相等、牛熊市 beta 相等(在合并样本中用交互项)、组合权重之和为 1 等线性约束,都可以用 7.3 节的变换技巧直接得到 t 值和置信区间。

稳健 F。 软件默认的仅同方差 F 在异方差数据中可能严重高估显著性。回测报告中应写明所用的协方差估计(HC 或 HAC)。

设定稳健性表格。 表 7.1 的「基准 + 备选设定」是因子研究报告的标准范式:在不同控制变量组合(市值、行业、其他风格)下报告关注因子的系数与置信区间,检验结论是否稳健。

\(R^2\) 的局限。 收益预测回归的 \(R^2\) 往往只有 1% 左右,但可能有可观的经济价值;高 \(R^2\) 也不代表因果或无遗漏变量。Key Concept 7.3 的四条在量化中同样成立。

尺度。 因子标准化(z-score)后,系数可以解释为「一个标准差暴露对应的收益」,这是 7.6.2 节「为可读性选择尺度」的直接应用。

示例:联合检验、重参数化、检验水平与多重检验

import numpy as np
import statsmodels.api as sm
from scipy import stats

rng = np.random.default_rng(2024)

# ---- 1. 两个高度相关的因子暴露:单个 t、稳健 F、仅同方差 F ----
n = 600
x1 = rng.standard_normal(n)
x2 = 0.95 * x1 + np.sqrt(1 - 0.95**2) * rng.standard_normal(n)   # corr(x1,x2) ≈ 0.95
x3 = rng.standard_normal(n)                          # 控制变量
u = (0.3 + 0.9 * np.abs(x1)) * rng.standard_normal(n)  # 异方差:|x1| 大时噪声大
y = 0.06 * x1 + 0.06 * x2 + 0.5 * x3 + u
X = sm.add_constant(np.column_stack([x1, x2, x3]))
rob = sm.OLS(y, X).fit(cov_type="HC1")
hom = sm.OLS(y, X).fit()
print("t(x1), t(x2) [稳健] =", np.round(rob.tvalues[1:3], 2))
R = np.array([[0, 1, 0, 0], [0, 0, 1, 0]])          # H0: b1 = b2 = 0
F_rob = rob.f_test(R)
F_hom = hom.f_test(R)
print(f"稳健 F = {F_rob.fvalue:.2f} (p = {F_rob.pvalue:.4f});  仅同方差 F = {F_hom.fvalue:.2f}")
# 仅同方差 F 的 R^2 公式 (7.14)
restr = sm.OLS(y, sm.add_constant(x3)).fit()
q, k = 2, 3
F_r2 = ((hom.rsquared - restr.rsquared) / q) / ((1 - hom.rsquared) / (n - k - 1))
print(f"R^2 公式算出的仅同方差 F = {F_r2:.2f}")
# 大样本临界值 F_{q,inf} = chi2_q / q
print(f"F(2,inf) 5%/1% 临界值 = {stats.chi2.ppf(0.95,2)/2:.2f} / {stats.chi2.ppf(0.99,2)/2:.2f}")

# ---- 2. 单一约束 b1 = b2:直接检验 vs 变换回归 ----
t_direct = rob.t_test("x1 - x2 = 0")
V = x1 + x2
rob2 = sm.OLS(y, sm.add_constant(np.column_stack([x1, V, x3]))).fit(cov_type="HC1")
print(f"直接检验 b1-b2: 估计 {t_direct.effect[0]:.4f}, t = {t_direct.tvalue[0][0]:.3f}")
print(f"变换回归 gamma1: 估计 {rob2.params[1]:.4f}, t = {rob2.tvalues[1]:.3f}, "
      f"F(q=1) = {rob.f_test('x1 - x2 = 0').fvalue:.3f} = t^2 {rob2.tvalues[1]**2:.3f}")

# ---- 3. 蒙特卡洛:联合零假设为真时三种检验的实际水平 ----
def size_sim(rho, reps=3000, n=400):
    rej = np.zeros(3)
    c_bonf = stats.norm.ppf(1 - 0.05 / 4)            # q=2, 5% → 2.241
    for _ in range(reps):
        a = rng.standard_normal(n)
        b = rho * a + np.sqrt(1 - rho**2) * rng.standard_normal(n)
        yy = rng.standard_normal(n)
        f = sm.OLS(yy, sm.add_constant(np.column_stack([a, b]))).fit(cov_type="HC1")
        t1, t2 = f.tvalues[1:3]
        rej[0] += (abs(t1) > 1.96) or (abs(t2) > 1.96)
        rej[1] += (abs(t1) > c_bonf) or (abs(t2) > c_bonf)
        rej[2] += f.f_test(np.eye(3)[1:]).pvalue < 0.05
    return rej / reps
for rho in (0.0, 0.9):
    r = size_sim(rho)
    print(f"rho={rho}: 逐个 t {r[0]:.3f}, Bonferroni {r[1]:.3f}, 稳健 F {r[2]:.3f}")

# ---- 4. 因子挖掘:200 个纯噪声信号 ----
T, M = 240, 200                                       # 20 年月度,200 个候选信号
ret = 0.04 * rng.standard_normal(T)
sig = rng.standard_normal((T, M))
tv = np.array([sm.OLS(ret, sm.add_constant(sig[:, j])).fit(cov_type="HC1").tvalues[1] for j in range(M)])
c200 = stats.norm.ppf(1 - 0.05 / (2 * M))
print(f"|t|>1.96: {np.sum(np.abs(tv)>1.96)} 个;  |t|>3: {np.sum(np.abs(tv)>3)} 个;  "
      f"Bonferroni 临界值(q=200) = {c200:.2f}, 超过者 {np.sum(np.abs(tv)>c200)} 个")

关键输出:

t(x1), t(x2) [稳健] = [ 1.78 -0.51]
稳健 F = 4.06 (p = 0.0178);  仅同方差 F = 9.91
R^2 公式算出的仅同方差 F = 9.91
F(2,inf) 5%/1% 临界值 = 3.00 / 4.61
直接检验 b1-b2: 估计 0.3559, t = 1.174
变换回归 gamma1: 估计 0.3559, t = 1.174, F(q=1) = 1.378 = t^2 1.378
rho=0.0: 逐个 t 0.101, Bonferroni 0.047, 稳健 F 0.047
rho=0.9: 逐个 t 0.074, Bonferroni 0.040, 稳健 F 0.054
|t|>1.96: 17 个;  |t|>3: 1 个;  Bonferroni 临界值(q=200) = 3.66, 超过者 0 个

怎么读这些结果。

  1. 两个暴露相关 0.95,真实系数都是 0.06。单独看,\(t_1=1.78\)、\(t_2=-0.51\),都不显著,第二个连符号都反了;但稳健 F = 4.06,在 5% 水平联合显著。数据告诉我们「这两个暴露合起来有作用」,却无法分清各自的贡献。仅同方差 F 高达 9.91,用 \(R^2\) 公式 (7.14) 手算结果相同,它严重夸大了显著性,与原书 8.01 vs. 5.43 的现象一致。(statsmodels 的 f_test 用 \(F_{q,n-k-1}\) 计算 p 值,大样本下与 \(F_{q,\infty}\) 几乎相同。)
  2. 用 t_test 直接检验 \(\beta_1-\beta_2=0\),与构造 \(V=x_1+x_2\) 后的变换回归给出完全相同的估计和 t 值;单约束的 F 恰好等于 \(t^2\)。
  3. 联合零假设为真时,逐个 t 检验在回归元独立时实际水平约 10%(理论值 9.75%),相关时也明显高于 5%;Bonferroni 检验的水平不超过 5%(相关时更保守,只有 4%);稳健 F 接近 5%。
  4. 200 个纯噪声信号中,17 个在 5% 水平「显著」(期望值 10 个左右),1 个甚至超过 3。按 Bonferroni 修正,\(q=200\) 时临界值为 3.66,没有一个通过。这说明「t > 3」并不是万能门槛,它对应的是数十次左右的检验;如果你在数百上千个候选中挖掘,门槛还应更高,或改用控制 FDR 的方法。

本章小结

多元回归中,单个系数的 t 检验和置信区间与单回归完全相同,前提是大样本与稳健标准误。涉及多个约束的假设是联合假设,不能用逐个 t 检验:两个独立约束各用 1.96,实际水平为 9.75%。正确的方法是异方差稳健 F 统计量,它在零假设下大样本服从 \(F_{q,\infty}\),\(q=1\) 时 \(F=t^2\)。仅同方差 F 可以用受约束与无约束回归的 SSR 或 \(R^2\) 计算,直观但只在同方差下有效。涉及多个系数的单一线性约束,可以通过重参数化变成单系数 t 检验。多系数置信集是 F 检验不拒绝的集合,两个系数时是椭圆,方向由估计量之间的相关决定。模型设定应以控制遗漏变量偏差为目标,先定基准设定,再用备选设定检验稳健性;\(R^2\) 不能告诉你显著性、因果性、是否有遗漏变量偏差,也不能告诉你回归元是否合适。没有原始数据时可以用 Bonferroni 检验,它保证水平但功效较低。加州数据的结论是:控制学生背景后,师生比的效应约为每生每师 −1 分,稳健且显著。

概念 公式 / 要点
单系数 t \(t=(\hat\beta_j-\beta_{j,0})/SE(\hat\beta_j)\);CI \(\hat\beta_j\pm1.96SE\)
稳健协方差(三明治) \((X^\top X)^{-1}(\sum\hat u_i^2x_ix_i^\top)(X^\top X)^{-1}\cdot\frac{n}{n-k-1}\)
逐个检验的水平 \(1-0.95^q\)(独立时),\(q=2\) 为 9.75%
稳健 F(Wald/q) \(F=\frac1q(R\hat\beta-r)^\top[R\hat\Sigma R^\top]^{-1}(R\hat\beta-r)\sim F_{q,\infty}\)
\(q=2\) 的 F \(\frac12\frac{t_1^2+t_2^2-2\hat\rho t_1t_2}{1-\hat\rho^2}\)
仅同方差 F \(\frac{(R^2_u-R^2_r)/q}{(1-R^2_u)/(n-k_u-1)}\)
\(F_{q,\infty}\) 5% 临界值 \(q=1\): 3.84;\(q=2\): 3.00;\(q=3\): 2.60
重参数化 \(Y=\beta_0+(\beta_1-\beta_2)X_1+\beta_2(X_1+X_2)+u\)
置信椭圆 F 不拒绝的集合;长轴方向由 \(\operatorname{corr}(\hat\beta_1,\hat\beta_2)\) 决定
Bonferroni \(c=\Phi^{-1}(1-\alpha/(2q))\);保证水平,功效低
Key Concept 7.3 \(R^2\) 不说明显著、因果、无遗漏偏差、设定最优

练习

基础

  1. (原书习题 7.1–7.2 改编)10,973 名工人的周薪对数回归中,High school 的系数为 0.352(SE 0.021),Male 为 0.458(SE 0.021)。分别检验两个系数是否为零并给出 95% 置信区间。 答案要点:\(t=16.8\) 与 21.8,均在 1% 水平显著;CI 分别为 \([0.311,0.393]\) 与 \([0.417,0.499]\)。(因变量是对数,系数的百分比解释见第 08 章。)
  2. (原书习题 7.3)同一回归中 Age 的系数为 0.011(SE 0.001)。求 40 岁与 30 岁、其他条件相同的工人预期对数收入之差的 95% 置信区间。 答案要点:\(10\times0.011=0.11\),SE \(=10\times0.001=0.01\),CI \([0.090,0.130]\)。
  3. (原书习题 7.4、7.8 改编)加入 North、South、East 三个地区虚拟变量后,\(R^2\) 从 0.0761 升到 0.0814,\(n=10973\),无约束回归有 6 个回归元。(a) 计算检验三个地区系数全为零的仅同方差 F;(b) 已知三个 t 值分别为 4.73、3.12、−2.37,用 Bonferroni 检验在 1% 水平检验同一假设。 答案要点:(a) \(F=\frac{0.0053/3}{0.9186/10966}\approx21.1\),远超 \(F_{3,\infty}\) 的 1% 临界值 3.78(原书报告的稳健 F 为 21.87);(b) \(q=3\)、1% 的 \(c=2.935\),\(|4.73|>2.935\),拒绝。
  4. 同时检验 10 个相互独立的无效信号,每个都用 5% 双侧 t 检验,至少有一个「显著」的概率是多少?若用 Bonferroni 使总水平为 5%,单个检验的临界值是多少? 答案要点:\(1-0.95^{10}=40.1\%\);\(c=\Phi^{-1}(1-0.0025)=2.81\)。
  5. (原书习题 7.7 改编)房价回归中卧室数 BDR 的系数为 0.567(SE 1.23)。它是否显著?这是否与「四卧室的房子比三卧室贵」的常识矛盾? 答案要点:\(t=0.46\),不显著;不矛盾,回归保持房屋面积不变,面积不变时多一个卧室意味着每间更小。

进阶

  1. 证明 (7.13) 与 (7.14) 等价。 提示:两个回归的因变量相同,TSS 相同,用 \(SSR=(1-R^2)TSS\) 代入。
  2. (原书习题 7.9)对 \(Y_i=\beta_0+\beta_1X_{1i}+\beta_2X_{2i}+u_i\),分别给出检验 (a) \(\beta_1+2\beta_2=0\),(b) \(\beta_1+\beta_2=1\) 的变换回归。 答案要点:(a) \(Y\) 对 \(X_1\) 和 \(W=X_2-2X_1\) 回归,\(X_1\) 的系数为 \(\beta_1+2\beta_2\);(b) \(Y-X_2\) 对 \(X_1-X_2\) 和 \(X_2\) 回归,\(X_2\) 的系数为 \(\beta_1+\beta_2-1\),检验它为零。
  3. (原书习题 7.5 改编)2007 年样本中 High school 的系数为 0.373(SE 0.021),1993 年 5000 个观测的样本中为 0.301(SE 0.019)。两样本独立,检验系数是否发生变化。 答案要点:差 0.072,SE \(=\sqrt{0.021^2+0.019^2}=0.0283\),\(t=2.54\),在 5% 水平显著。
  4. 用式 (7.9) 说明:当 \(\hat\rho_{t_1,t_2}=-0.9\)、\(t_1=t_2=1.5\) 时,F 等于多少?这对应回归元之间什么样的相关?再联系本章代码第 1 部分,解释为什么两个 t 都不显著时联合 F 仍可能显著。 提示:\(F=\frac12\cdot\frac{2.25+2.25+4.05}{0.19}=22.5\),远超 1% 临界值;\(\hat\beta\) 负相关对应回归元正相关。此时 \(\hat\beta_1+\hat\beta_2\) 的方差 \(\operatorname{var}(\hat\beta_1)+\operatorname{var}(\hat\beta_2)+2\operatorname{cov}\) 很小,数据对「两者之和」的信息很充分,只是分不清各自的大小。
  5. 修改本章代码第 4 部分,把候选信号数改为 1000,统计 \(|t|>3\) 的个数,并与理论期望 \(1000\times2\Phi(-3)\) 比较。 提示:期望约 2.7 个。

原书推荐习题:7.4、7.5(地区虚拟变量联合 F、系数线性组合的 CI、跨样本比较);7.7(显著性、偏效应、尺度、F 检验的综合练习);7.8(手算仅同方差 F 与 Bonferroni);7.9(重参数化);7.10(两种 F 公式等价);实证题 E7.1(设定稳健性表格、控制变量系数的非因果解释)、E7.2(遗漏认知能力的偏差方向、教育虚拟变量的联合检验)。


原书对照

本章内容 原书章节 PDF 页码
章引言 第 7 章开篇 p.248
单个系数的检验与置信区间(Key Concept 7.1、7.2,加入生均支出) 7.1 p.248–251
联合假设检验、F 统计量、仅同方差 F 7.2 p.251–258
涉及多个系数的单一约束 7.3 p.258–259
多系数置信集(图 7.1) 7.4 p.259–260
模型设定、\(R^2\) 的解读(Key Concept 7.3) 7.5 p.260–262
考试成绩数据分析(表 7.1) 7.6 p.262–268
结论 7.7 p.268
复习题与习题 第 7 章末 p.269–275
Bonferroni 检验(表 7.2) 附录 7.1 p.274–276

注:原书页码 = PDF 页码 − 1。