量化交易中文教材

第 05 章 单回归的假设检验与置信区间

学习目标

读完本章,你应当能够:

  1. 用「(估计量 − 假设值)/ 标准误」构造回归系数的 t 统计量,算出双侧、单侧 p 值,并判断是否拒绝零假设。
  2. 构造回归系数的 95% 置信区间,以及「\(X\) 变化 \(\Delta x\) 时 \(Y\) 的预期变化」的置信区间,并说清置信区间与假设检验的等价关系。
  3. 理解回归元为二元(虚拟)变量时系数的含义:它就是两组均值之差,回归 t 检验就是均值差检验。
  4. 区分同方差与异方差,说明为什么在异方差下仅同方差标准误会给出错误推断,并养成默认使用异方差稳健标准误的习惯。
  5. 陈述高斯—马尔可夫定理及其局限,知道加权最小二乘(WLS)和最小绝对偏差(LAD)在什么情况下可能优于 OLS。
  6. 知道小样本下 Student t 分布什么时候精确成立,以及为什么实践中仍然用正态近似。

读前导读

这一章在解决什么问题。 第 4 章说明了 \(\hat\beta_1\) 近似正态、方差是多少,本章把它变成可以操作的推断:t 检验、p 值、置信区间。这些步骤你在 CFA 二级做过无数次,本章前两节(5.1、5.2)几乎就是第 3 章「总体均值推断」的翻版,读起来会很顺。

真正和 CFA 拉开差距的是 5.4 节和 5.5 节。CFA 处理异方差的流程是:先用 Breusch–Pagan 检验判断有没有「条件异方差」,有的话再改用 White 修正标准误。本书的态度更直接:不检验,默认就用稳健标准误。理由是稳健标准误在同方差时也正确,而经典标准误在异方差时会出错,而且错的方向通常是让 t 值虚高。本章量化实战的模拟里,经典 t 检验在名义 5% 水平下实际拒绝了 26% 的真零假设,这个数字值得记住。

5.5 节是 CFA 只提名字、不讲证明的高斯—马尔可夫定理。本章会完整证明它,并说明它的局限:它要求同方差,而一旦同方差不成立,OLS 就不再是「最优」,只是「仍然无偏、仍然可以正确推断」。这是理解后面 WLS、GLS 的起点。

5.3 节的虚拟变量回归也值得注意:「对 0/1 变量回归」和「两组均值差检验」在数值上完全相同,事件研究、日历效应、多空组合检验都可以统一成这个框架。

需要先想起来的数学。

  • 样本矩替换总体矩(plug-in):总体量 \(E[g(X)]\) 未知时,用样本平均 \(\frac1n\sum g(X_i)\) 代替;由 LLN,样本越大越准。稳健标准误公式 (5.4) 就是对第 4 章方差公式做这样的替换。例如 \(\operatorname{var}(X)\) 用 \(\frac1n\sum(X_i-\bar X)^2\) 代替。见 第 00 册第 07 章 概率中的分析工具。
  • 独立(不相关)变量加权和的方差:\(\operatorname{var}(\sum a_iu_i)=\sum a_i^2\operatorname{var}(u_i)\),前提是 \(u_i\) 两两不相关;若方差都为 \(\sigma^2\),就是 \(\sigma^2\sum a_i^2\)。例如 \(a=(0.5,0.5)\) 时方差为 \(0.5\sigma^2\)。高斯—马尔可夫的证明全靠这一条。见第 2 章 Key Concept 2.3。
  • 带约束的最小化:在若干线性约束下让平方和 \(\sum a_i^2\) 最小。本章用「拆成最优解 + 偏离」的代数技巧完成,不需要拉格朗日乘子;想看一般方法可参考 第 00 册第 05 章 多元微积分与优化 中的拉格朗日乘子。
  • 卡方与 t 分布的构造:\(t_m=Z/\sqrt{W/m}\),\(W\sim\chi^2_m\)。第 2 章 2.4 节已复习,5.6 节会用到。

怎么读这一章。 5.1、5.2 快速读,重点看 Key Concept 5.1 的通用公式和 5.1.4 关于单侧检验的提醒。5.3 必读,弄清「回归系数 = 均值差」。5.4 是本章核心,尤其 5.4.3 解释经典标准误为什么会低估。5.4.5 的公式汇总可以当工具表,用时再查。5.5 标为选读,但对想理解「OLS 为什么好、什么时候不再最好」的读者很值得:证明只有四步代数,配合下文的讲解框可以读懂。5.6 第一次可以只看「实践意义」一段。5.7 和量化实战建议全读。


5.0 本章在全书中的位置

上一章(原书第 4 章)建立了单回归元线性回归模型 \(Y_i=\beta_0+\beta_1X_i+u_i\),证明了在三条最小二乘假设下 OLS 估计量 \(\hat\beta_1\) 无偏、一致,并且在大样本下近似服从正态分布。这三条假设(原书 Key Concept 4.3)是:

  1. \(E(u_i\mid X_i)=0\):给定 \(X_i\) 时误差的条件均值为零;
  2. \((X_i,Y_i)\),\(i=1,\dots,n\) 独立同分布(i.i.d.);
  3. 大离群值罕见:\(X_i\) 与 \(Y_i\) 的四阶矩非零且有限。

\(\hat\beta_1\) 有一个抽样分布(sampling distribution):换一批样本,估计值就会变。本章要做的是利用这个分布,对真实的 \(\beta_1\) 做出「带精度」的陈述:数据能否拒绝 \(\beta_1=0\)?与数据相容的 \(\beta_1\) 取值范围是多少?

整章的出发点是 OLS 估计量的标准误(standard error),它估计的是 \(\hat\beta_1\) 抽样分布的标准差。有了标准误,t 检验和置信区间就与第 03 册(数理统计)里对总体均值的推断如出一辙。

贯穿全章的例子是加州 420 个学区的考试成绩 TestScore 对师生比 STR 的回归。一位「愤怒的纳税人」声称缩小班级对成绩毫无作用,即 \(\beta_{ClassSize}=0\);督学(superintendent)想知道:数据能否拒绝这一说法?

5.1–5.3 节只依赖上述三条假设;5.4 节讨论同方差这一特例;5.5、5.6 节为选读内容,分别讨论高斯—马尔可夫定理和误差正态时的小样本精确分布。


5.1 回归系数的假设检验

5.1.1 回顾:总体均值的 t 检验

先回忆总体均值的检验。零假设(null hypothesis)\(H_0:E(Y)=\mu_{Y,0}\),双侧备择(two-sided alternative)\(H_1:E(Y)\neq\mu_{Y,0}\)。检验分三步:

  1. 计算样本均值的标准误 \(SE(\bar Y)\),即 \(\bar Y\) 抽样分布标准差的估计;
  2. 计算 t 统计量 \(t=(\bar Y-\mu_{Y,0})/SE(\bar Y)\);
  3. 计算 p 值(p-value)。

p 值有两个等价的说法:在零假设成立时,单凭随机抽样就得到「至少与实际观测统计量一样偏离零假设值」的统计量的概率;也是能拒绝零假设的最小显著性水平。大样本下 t 统计量近似服从标准正态分布,所以双侧 p 值为 \(2\Phi(-|t^{act}|)\),其中 \(t^{act}\) 是实际算出的 t 值,\(\Phi\) 是标准正态分布函数。等价地,5% 双侧检验在 \(|t^{act}|>1.96\) 时拒绝。

这个结构可以写成一个通用公式:

Key Concept 5.1(t 统计量的一般形式)

\[t=\frac{\text{估计量}-\text{假设值}}{\text{估计量的标准误}}\tag{5.1}\]

本册此后的每一个 t 检验都是这个形式。

5.1.2 双侧检验 \(\beta_1=\beta_{1,0}\)

为什么可以照搬?因为 \(\hat\beta_1\) 和 \(\bar Y\) 一样,在大样本下近似正态。零假设与备择为

\[H_0:\beta_1=\beta_{1,0}\quad\text{vs.}\quad H_1:\beta_1\neq\beta_{1,0}\tag{5.2}\]

第一步:标准误。 \(SE(\hat\beta_1)=\sqrt{\hat\sigma^2_{\hat\beta_1}}\),其中

\[\hat\sigma^2_{\hat\beta_1}=\frac{1}{n}\times\frac{\dfrac{1}{n-2}\displaystyle\sum_{i=1}^n (X_i-\bar X)^2\hat u_i^2}{\left[\dfrac1n\displaystyle\sum_{i=1}^n(X_i-\bar X)^2\right]^2}\tag{5.4}\]

这个公式看上去复杂,来源却很直接。第 4 章已经得到大样本下 \(\hat\beta_1\) 的方差

\[\sigma^2_{\hat\beta_1}=\frac1n\cdot\frac{\operatorname{var}[(X_i-\mu_X)u_i]}{[\operatorname{var}(X_i)]^2},\]

式 (5.4) 只是把其中的总体矩换成样本矩:分子里的 \(\operatorname{var}[(X_i-\mu_X)u_i]\) 用 \(\frac{1}{n-2}\sum(X_i-\bar X)^2\hat u_i^2\) 估计(除以 \(n-2\) 而不是 \(n\),是对估计两个系数造成的向下偏差做自由度调整),分母用 \(\frac1n\sum(X_i-\bar X)^2\) 估计 \(\operatorname{var}(X_i)\)。后面会看到,这正是异方差稳健的方差估计;它由软件自动计算。

白话解释:(5.4) 的分子 \(\sum(X_i-\bar X)^2\hat u_i^2\) 是「每个观测的 \(X\) 离差平方 × 该观测残差平方」再求和。它让每个观测自己报告「我这里的噪声有多大」,并按它对斜率的影响力(\(X\) 离均值多远)加权。经典公式则先把所有残差平方平均成一个 \(s_{\hat u}^2\),再统一乘上去,等于假设每个观测的噪声一样大。 为什么不能直接估计每个 \(\operatorname{var}(u_i\mid X_i)\)?因为每个观测只有一个残差,单个 \(\hat u_i^2\) 是很差的方差估计。但我们不需要每个都准,只需要它们的加权平均准;求和把单个观测的误差平均掉了,这正是 LLN 起作用的地方。 金融直觉:这类公式的分子分母结构常被称为「三明治」:外面两片面包是 \(X\) 的方差(分母),中间的馅是 \((X-\bar X)^2\hat u^2\) 的平均。量化里常说的 White SE、HC0/HC1/HC3,以及后面时间序列里的 Newey–West SE,差别只在「馅」怎么估。

第二步:t 统计量。

\[t=\frac{\hat\beta_1-\beta_{1,0}}{SE(\hat\beta_1)}\tag{5.5}\]

第三步:p 值。

\[p=\Pr_{H_0}\left[|\hat\beta_1-\beta_{1,0}|>|\hat\beta_1^{act}-\beta_{1,0}|\right]=\Pr_{H_0}(|t|>|t^{act}|)\tag{5.6}\]

大样本下

\[p=\Pr(|Z|>|t^{act}|)=2\Phi(-|t^{act}|)\tag{5.7}\]

p 值小于 5% 就在 5% 显著性水平拒绝零假设,等价于 \(|t^{act}|>1.96\)。

Key Concept 5.2(检验 \(\beta_1=\beta_{1,0}\) vs. \(\beta_1\ne\beta_{1,0}\))

  1. 计算 \(SE(\hat\beta_1)\);
  2. 计算 t 统计量 (5.5);
  3. 计算 p 值 (5.7);当 p 值 < 0.05,或等价地 \(|t^{act}|>1.96\) 时,在 5% 水平拒绝零假设。

回归软件通常自动报告针对 \(\beta_1=0\) 的标准误、t 统计量和 p 值。

5.1.3 回归方程的报告格式

第 4 章的考试成绩回归给出 \(\hat\beta_0=698.9\)、\(\hat\beta_1=-2.28\),标准误分别为 \(SE(\hat\beta_0)=10.4\)、\(SE(\hat\beta_1)=0.52\)。惯例是把标准误写在系数下方的括号里:

\[\widehat{TestScore}=\underset{(10.4)}{698.9}-\underset{(0.52)}{2.28}\times STR,\quad R^2=0.051,\ SER=18.6\tag{5.8}\]

一行之内同时给出了回归线、抽样不确定性(标准误)和两个拟合度量(\(R^2\) 与回归标准误 SER)。全书沿用这一格式,量化研究报告里的回归表也基本如此。

应用:检验「班级规模无效」。 零假设 \(\beta_1=0\):

\[t^{act}=\frac{-2.28-0}{0.52}=-4.38.\]

\(|t^{act}|=4.38>1.96\),在 5% 水平拒绝。p 值是标准正态分布在 \(-4.38\) 左侧与 \(+4.38\) 右侧的尾部面积之和,约为 0.00001,即 0.001%。如果零假设为真,抽到这么偏离零的估计几乎不可能,所以合理的推断是零假设为假。

5.1.4 单侧检验

很多人相信小班更好,即 \(\beta_1<0\)。这时可以做单侧检验(one-sided test):

\[H_0:\beta_1=\beta_{1,0}\quad\text{vs.}\quad H_1:\beta_1<\beta_{1,0}\tag{5.9}\]

零假设和 t 统计量都和双侧检验相同,区别只在解读:只有 t 足够负时才拒绝。5% 水平的拒绝域是 \(t^{act}<-1.64\)(而不是 \(|t^{act}|>1.96\)),左尾 p 值为

\[p=\Pr(Z<t^{act})=\Phi(t^{act}).\tag{5.10}\]

若备择是 \(\beta_1>\beta_{1,0}\),则取右尾 \(p=\Pr(Z>t^{act})=1-\Phi(t^{act})\)。

应用。 \(t^{act}=-4.38<-2.33\)(1% 单侧临界值),在 1% 水平拒绝,p 值小于 0.0006%。

什么时候用单侧检验? 只有当经济理论或先前的经验证据给出明确理由时才用。很多看起来「显然」单侧的问题,细想并不单侧:新药可能因为未知副作用反而有害;小班也未必有益。作者引用了一句玩笑:「大学成功的秘诀是招到有才华的学生,然后让教师尽量少碍事。」正因为有这种模糊性,计量经济学家通常使用双侧检验。

这一点在量化研究里尤其重要。看完回测结果再决定「我只关心收益为正」,等于把 t 门槛从 1.96 偷偷降到 1.64,实际的假阳性率翻倍。

白话解释:「翻倍」怎么算?零假设为真时,\(t\) 近似 \(N(0,1)\)。事先定好单侧右尾,错误拒绝概率是 \(\Pr(Z>1.64)=5\%\)。若看到 \(t\) 为正就选右尾、为负就选左尾,那么任一侧超过 1.64 都会拒绝,概率是 \(\Pr(|Z|>1.64)=10\%\)。单侧检验本身没有错,错的是看了数据再选方向。

5.1.5 截距的检验

截距的检验 \(H_0:\beta_0=\beta_{0,0}\) vs. \(H_1:\beta_0\ne\beta_{0,0}\) 步骤完全相同,只是用 \(\hat\beta_0\) 和 \(SE(\hat\beta_0)\)(公式见 5.4.5 节)。在量化里,截距检验往往比斜率检验更受关注:资产超额收益对因子收益回归的截距就是 alpha,检验 \(\alpha=0\) 就是检验策略是否有超出因子暴露的超额收益。

当没有一个主导的零假设,而想知道与数据相容的系数范围时,需要的是置信区间。


5.2 回归系数的置信区间

5.2.1 两个等价定义

\(\beta_1\) 的 95% 置信区间(confidence interval)有两种等价的定义:

  1. 用 5% 双侧检验不能拒绝的所有 \(\beta_{1,0}\) 构成的集合;
  2. 以 95% 的概率包含真值的区间:在所有可能的样本中,有 95% 的样本构造出的区间包含 \(\beta_1\)。这个 95% 称为置信水平(confidence level)。

为什么等价?5% 水平的检验只在 5% 的样本中错误地拒绝真值,所以真值在 95% 的样本中不被拒绝,也就落在「不被拒绝值的集合」里。

原则上可以对每一个候选值 \(\beta_{1,0}\) 都做一遍检验,但没有必要:t 检验恰好在 \(\beta_{1,0}\) 落在 \(\hat\beta_1\pm1.96SE(\hat\beta_1)\) 之外时拒绝。于是:

Key Concept 5.3(\(\beta_1\) 的置信区间) 大样本下

\[\beta_1\text{ 的 95\% 置信区间}=\left[\hat\beta_1-1.96SE(\hat\beta_1),\ \hat\beta_1+1.96SE(\hat\beta_1)\right]\tag{5.12}\]
\(\beta_0\) 的置信区间同理。90% 区间把 1.96 换成 1.64,99% 区间换成 2.58。

应用。 \(-2.28\pm1.96\times0.52\),即 \(-3.30\le\beta_1\le-1.26\)。0 不在区间内,与 5.1 节「5% 水平拒绝 \(\beta_1=0\)」一致。

5.2.2 预测效应的置信区间

\(X\) 变化 \(\Delta x\) 时 \(Y\) 的期望变化为 \(\beta_1\Delta x\)。因为 \(\Delta x\) 是常数,它的 95% 置信区间就是把 \(\beta_1\) 的区间端点乘以 \(\Delta x\):

\[\left[(\hat\beta_1-1.96SE(\hat\beta_1))\Delta x,\ (\hat\beta_1+1.96SE(\hat\beta_1))\Delta x\right]\tag{5.13}\]

\(\Delta x\) 为负时两端点顺序对调。

例。 师生比降低 2(\(\Delta x=-2\)),成绩的预期提高在 \(-1.26\times(-2)=2.52\) 分到 \(-3.30\times(-2)=6.60\) 分之间(95% 置信水平)。

量化中的对应:若某股票对市场的 beta 估计为 1.2,SE 为 0.1,市场下跌 3% 时该股票的预期跌幅置信区间就是 \([-3\times1.396,\ -3\times1.004]\%=[-4.19\%,-3.01\%]\)。


5.3 回归元为二元变量时

5.3.1 虚拟变量与「\(D_i\) 的系数」

二元变量(binary variable)只取 0 和 1,也叫指示变量(indicator variable)或虚拟变量(dummy variable)。例如性别、城乡、大班/小班,在量化里则有公告日/非公告日、周一/非周一、牛市/熊市。回归的计算机制与连续 \(X\) 完全相同,但系数的解释不同。

定义

\[D_i=\begin{cases}1 & STR_i<20\\ 0 & STR_i\ge20\end{cases}\tag{5.14}\]

模型为

\[Y_i=\beta_0+\beta_1D_i+u_i\tag{5.15}\]

因为 \(D\) 只取两个值,没有一条「线」,所以 \(\beta_1\) 不叫斜率,而叫「\(D_i\) 的系数」(coefficient on \(D_i\))。

逐一考虑两种情况:

  • \(D_i=0\) 时,\(Y_i=\beta_0+u_i\)(5.16),由 \(E(u_i\mid D_i)=0\) 得 \(E(Y_i\mid D_i=0)=\beta_0\);
  • \(D_i=1\) 时,\(Y_i=\beta_0+\beta_1+u_i\)(5.17),\(E(Y_i\mid D_i=1)=\beta_0+\beta_1\)。

所以

\[\beta_1=E(Y_i\mid D_i=1)-E(Y_i\mid D_i=0),\]

即两组总体均值之差。相应地,OLS 估计 \(\hat\beta_0\) 恰好是 \(D=0\) 组的样本均值 \(\bar Y_0\),\(\hat\beta_0+\hat\beta_1\) 恰好是 \(D=1\) 组的样本均值 \(\bar Y_1\),\(\hat\beta_1=\bar Y_1-\bar Y_0\)(原书习题 5.10)。

推导拆解:从第 4 章的两个正规方程出发。

  1. 第二个正规方程 \(\sum\hat u_iD_i=0\):\(D_i=0\) 的项都乘没了,只剩 \(D=1\) 组,即 \(\sum_{D_i=1}(Y_i-\hat\beta_0-\hat\beta_1)=0\)。除以该组人数 \(n_1\),得 \(\bar Y_1=\hat\beta_0+\hat\beta_1\)。
  2. 第一个正规方程 \(\sum\hat u_i=0\) 拆成两组之和,\(D=1\) 组那部分由第 1 步已知为 0,所以 \(D=0\) 组也必须为 0:\(\sum_{D_i=0}(Y_i-\hat\beta_0)=0\),得 \(\hat\beta_0=\bar Y_0\)。
  3. 两式相减即 \(\hat\beta_1=\bar Y_1-\bar Y_0\)。 直观上:只有两个取值时,「最好的直线」就是连接两组均值的那条线,每组都用自己的均值作预测,平方误差最小(第 3 章 3.1.2)。

推论: 检验两组均值相等就是检验 \(\beta_1=0\),t 统计量为 \(\hat\beta_1/SE(\hat\beta_1)\);\(\hat\beta_1\pm1.96SE(\hat\beta_1)\) 是均值差的 95% 置信区间。使用稳健标准误时,回归的 SE 与第 3 章「不等方差」均值差公式 \(\sqrt{s_1^2/n_1+s_0^2/n_0}\) 在数值上完全相同(本章量化实战会验证)。

5.3.2 应用

\[\widehat{TestScore}=\underset{(1.3)}{650.0}+\underset{(1.8)}{7.4}D,\quad R^2=0.037,\ SER=18.7\tag{5.18}\]

大班组(\(D=0\))平均 650.0 分,小班组 657.4 分,差 7.4 分。\(t=7.4/1.8=4.04>1.96\),在 5% 水平拒绝两组均值相等;95% 置信区间为 \(7.4\pm1.96\times1.8=(3.9,10.9)\),不含 0。


5.4 异方差与同方差

5.4.1 定义

Key Concept 5.4 若 \(\operatorname{var}(u_i\mid X_i=x)\) 对所有 \(i\) 为常数,尤其不依赖 \(x\),则称误差同方差(homoskedastic);否则称误差异方差(heteroskedastic)。

原书图 5.2 用考试成绩的条件分布说明:(a) 图中 STR 取 15、20、25 时成绩分布的离散程度相同,是同方差;(b) 图中离散程度随 \(x\) 增大而变大,是异方差。两图中条件均值都落在回归线 \(\beta_0+\beta_1X\) 上,因为第一条最小二乘假设保证误差条件均值为零。同方差/异方差只涉及条件方差,与条件均值无关。

二元回归元的例子。 用父亲的社会经济分类(英国 NS-SEC)定义 \(HIGHER_i=1\) 表示父亲属于较高类别,0 表示常规类别。模型

\[Earnings_i=\beta_0+\beta_1HIGHER_i+u_i\tag{5.19}\]

中 \(\beta_1\) 是两组家庭出身的平均收入之差。拆成两式:常规组 \(Earnings_i=\beta_0+u_i\)(5.20),较高组 \(Earnings_i=\beta_0+\beta_1+u_i\)(5.21)。于是「\(u_i\) 的方差不依赖 \(HIGHER\)」等价于「两组收入分布的方差相同」。(原书此处残留了旧版本「按性别分组」的措辞,按上下文应理解为按社会阶层分组。)

5.4.2 同方差在数学上意味着什么

  1. OLS 仍然无偏、一致、渐近正态,与同方差与否无关。 三条最小二乘假设对条件方差没有任何要求,同方差只是其中一个特例。
  2. 效率。 若再加上同方差,OLS 在「关于 \(Y_1,\dots,Y_n\) 线性、且条件无偏」的估计量中方差最小,这就是 5.5 节的高斯—马尔可夫定理。
  3. 仅同方差方差公式。 同方差时 \(\hat\beta_1\) 的方差有简化公式
\[\tilde\sigma^2_{\hat\beta_1}=\frac{s^2_{\hat u}}{\sum_{i=1}^n(X_i-\bar X)^2}\tag{5.22}\]

其中 \(s^2_{\hat u}=\frac{1}{n-2}\sum\hat u_i^2\) 是 SER 的平方。这就是很多教材和软件默认报告的「经典」标准误。\(X\) 为二元变量时,它化为均值差的合并方差(pooled variance)公式。

5.4.3 关键警告:仅同方差标准误在异方差下失效

如果误差是异方差的,用仅同方差标准误算出的 t 统计量即使在大样本下也不服从标准正态。正确的临界值依赖异方差的具体形式,无法制表;用 \(\pm1.96\) 倍仅同方差 SE 构成的区间,覆盖率一般也不是 95%。

相反,式 (5.4) 给出的估计量在同方差和异方差下都一致,称为异方差稳健标准误(heteroskedasticity-robust standard errors)。它由 Eicker(1967)、Huber(1967)和 White(1980)提出,所以也叫 Eicker–Huber–White 标准误,在软件里常标为 HC0、HC1 等(式 5.4 带 \(n-2\) 自由度调整,对应 HC1)。

为什么同方差公式在异方差下会错?看大样本方差的分子 \(\operatorname{var}[(X_i-\mu_X)u_i]=E[(X_i-\mu_X)^2u_i^2]\)。同方差时,迭代期望给出 \(E[(X_i-\mu_X)^2\operatorname{var}(u_i\mid X_i)]=\sigma_u^2\sigma_X^2\),于是方差化为 \(\sigma_u^2/(n\sigma_X^2)\)。但如果 \(u_i^2\) 在 \(|X_i-\mu_X|\) 大时也大(这在金融数据里极其常见:市场大波动时个股残差也更大),\(E[(X_i-\mu_X)^2u_i^2]\) 就大于 \(\sigma_X^2\sigma_u^2\),仅同方差公式会低估方差,t 值虚高,造成过多的「显著」结论。

推导拆解:用一个数值例子看「大于」从哪来。设 \(X\) 以 1/2 的概率取 0,以各 1/4 的概率取 \(-2\) 和 \(+2\)(\(\mu_X=0\));\(|X|=2\) 时误差方差为 4,\(X=0\) 时误差方差为 0。

  • 平均误差方差 \(\sigma_u^2=\frac12\times4+\frac12\times0=2\);\(\sigma_X^2=E(X^2)=\frac12\times4=2\)。经典公式的分子 \(\sigma_X^2\sigma_u^2=4\)。
  • 真实分子 \(E[X^2u^2]=E[X^2\operatorname{var}(u\mid X)]=\frac12\times4\times4+\frac12\times0\times0=8\)。 真实方差是经典公式的 2 倍,标准误差约 \(\sqrt2\approx1.41\) 倍,经典 t 值被放大约 41%。关键在于协方差:\(X^2\) 与 \(\operatorname{var}(u\mid X)\) 正相关时,二者乘积的期望大于期望的乘积(\(E(AB)=E(A)E(B)+\operatorname{cov}(A,B)\))。 和 CFA 的对照:CFA 把这种情形称为「条件异方差」(conditional heteroskedasticity),并指出「非条件异方差」(方差变化与 \(X\) 无关)不会造成问题。上式给出了原因:若 \(\operatorname{var}(u\mid X)\) 与 \(X^2\) 不相关,协方差项为 0,经典公式碰巧仍对。

5.4.4 实践中怎么办

哪种情形更现实,取决于应用。在社会阶层的例子里,出身贫困者多数留在较低收入阶层,进入高收入家庭的很少,所以低出身组收入分布更集中,(5.20) 的误差方差小于 (5.21),误差异方差。一般而言,经济理论极少提供同方差的理由,审慎的做法是假定可能存在异方差。

实践结论可以这样想:假如两种标准误都算出来,若二者相同,用稳健 SE 毫无损失;若二者不同,应该采用允许异方差、更可靠的那个。所以最简单的做法是:

始终使用异方差稳健标准误。

许多软件出于历史原因默认报告仅同方差 SE,需要手动指定稳健选项(statsmodels 中是 fit(cov_type="HC1"))。本书所有实证例子除非另行说明都使用稳健 SE。有些教材把同方差列为最小二乘假设之一,但只要用稳健 SE,这条假设对 OLS 回归分析的有效性并非必需。

原书方框:一年教育的经济价值。 数据来自 2016 年 3 月的 CPS,2015 年 29–30 岁、受教育 8–18 年的 2731 名全职工人:

\[\widehat{Earnings}=\underset{(1.36)}{-12.12}+\underset{(0.10)}{2.37}\,YearsEducation,\quad R^2=0.185,\ SER=11.24\tag{5.23}\]

每多一年教育,时薪平均高 2.37 美元,95% 置信区间为 2.17–2.57 美元。散点图还有一个显著特征:残差的离散程度随教育年限增加。10 年教育者的残差标准差为 6.31 美元,高中毕业为 8.54 美元,大学毕业为 13.55 美元。也就是说误差是异方差的:高学历者中有人低薪,但低学历者几乎没有人能拿到高薪。

5.4.5 标准误公式汇总(原书附录 5.1)

稳健方差:\(\hat\beta_1\) 用式 (5.4);截距为

\[\hat\sigma^2_{\hat\beta_0}=\frac1n\times\frac{\frac{1}{n-2}\sum_{i=1}^n\hat H_i^2\hat u_i^2}{\left(\frac1n\sum_{i=1}^n\hat H_i^2\right)^2},\qquad \hat H_i=1-\frac{\bar X}{\frac1n\sum X_i^2}X_i\tag{5.26}\]

同方差下的总体方差:\(\operatorname{var}(u_i\mid X_i)=\sigma_u^2\) 时

\[\sigma^2_{\hat\beta_1}=\frac{\sigma_u^2}{n\sigma_X^2}\tag{5.27}\qquad \sigma^2_{\hat\beta_0}=\frac{E(X_i^2)}{n\sigma_X^2}\sigma_u^2\tag{5.28}\]

推导 (5.27):由假设 1,\(E[(X_i-\mu_X)u_i]=0\),故 \(\operatorname{var}[(X_i-\mu_X)u_i]=E\{[(X_i-\mu_X)u_i]^2\}=E[(X_i-\mu_X)^2\operatorname{var}(u_i\mid X_i)]=\sigma_u^2\sigma_X^2\),代入第 4 章的方差公式即得。

仅同方差标准误:用样本矩替换总体矩、用 \(s^2_{\hat u}\) 估计 \(\sigma_u^2\),

\[\tilde\sigma^2_{\hat\beta_1}=\frac{s^2_{\hat u}}{\sum(X_i-\bar X)^2}\tag{5.29}\qquad \tilde\sigma^2_{\hat\beta_0}=\frac{\left(\frac1n\sum X_i^2\right)s^2_{\hat u}}{\sum(X_i-\bar X)^2}\tag{5.30}\]

5.5 OLS 的理论基础:高斯—马尔可夫定理(选读)

已经知道 OLS 无偏、一致、方差与 \(n\) 成反比、大样本正态。还有一个问题:有没有比 OLS 更好的估计量?高斯—马尔可夫定理在一个特定的估计量类别里给出回答。

5.5.1 线性条件无偏估计量

称 \(\tilde\beta_1\) 为线性估计量,如果它可以写成

\[\tilde\beta_1=\sum_{i=1}^n a_iY_i\tag{5.24}\]

其中权重 \(a_i\) 可以依赖 \(X_1,\dots,X_n\),但不能依赖 \(Y_1,\dots,Y_n\)。称它条件无偏,如果

\[E(\tilde\beta_1\mid X_1,\dots,X_n)=\beta_1.\tag{5.25}\]

OLS 本身就属于这一类。因为 \(\sum(X_i-\bar X)=0\),有 \(\sum(X_i-\bar X)(Y_i-\bar Y)=\sum(X_i-\bar X)Y_i\),所以

\[\hat\beta_1=\sum_{i=1}^n\hat a_iY_i,\qquad \hat a_i=\frac{X_i-\bar X}{\sum_{j}(X_j-\bar X)^2}\tag{5.32}\]

权重只依赖 \(X\),因此是线性的;第 4 章已证明它条件无偏。同方差时其条件方差为

\[\operatorname{var}(\hat\beta_1\mid X_1,\dots,X_n)=\frac{\sigma_u^2}{\sum(X_i-\bar X)^2}.\tag{5.33}\]

5.5.2 定理

Key Concept 5.5(高斯—马尔可夫定理) 若三条最小二乘假设成立且误差同方差,则在给定 \(X_1,\dots,X_n\) 的条件下,OLS 估计量 \(\hat\beta_1\) 是所有线性条件无偏估计量中条件方差最小者,即最优线性条件无偏估计量(Best Linear conditionally Unbiased Estimator,BLUE)。

这推广了第 3 章的结论「\(\bar Y\) 是线性无偏估计量中最有效者」:当回归元只有常数项 \(X_{0i}=1\) 时,\(\hat\beta_0=\bar Y\),而没有回归元时同方差自动满足,所以 i.i.d. 下 \(\bar Y\) 就是 BLUE。

定理成立所需的条件称为高斯—马尔可夫条件(对 \(i,j=1,\dots,n\)):

\[\text{(i) }E(u_i\mid X_1,\dots,X_n)=0;\quad\text{(ii) }\operatorname{var}(u_i\mid X_1,\dots,X_n)=\sigma_u^2,\ 0<\sigma_u^2<\infty;\quad\text{(iii) }E(u_iu_j\mid X_1,\dots,X_n)=0,\ i\ne j\tag{5.31}\]

即条件均值为零、常数方差、不同观测的误差不相关。它们由三条最小二乘假设加同方差推出:i.i.d. 使 \(E(u_i\mid X_1,\dots,X_n)=E(u_i\mid X_i)=0\),条件方差同理化为 \(\operatorname{var}(u_i\mid X_i)=\sigma_u^2\),四阶矩有限保证 \(\sigma_u^2\) 有限;i.i.d. 还给出 \(E(u_iu_j\mid X_i,X_j)=E(u_i\mid X_i)E(u_j\mid X_j)=0\)。

5.5.3 证明思路(原书附录 5.2)

证明只用到简单的代数,值得完整走一遍。

第 1 步:无偏性约束。 把模型代入任一线性估计量:

\[\tilde\beta_1=\beta_0\sum a_i+\beta_1\sum a_iX_i+\sum a_iu_i.\tag{5.34}\]

由条件 (i),\(E(\tilde\beta_1\mid X)=\beta_0\sum a_i+\beta_1\sum a_iX_i\)。要对任意 \(\beta_0,\beta_1\) 都等于 \(\beta_1\),必须

\[\sum a_i=0,\qquad \sum a_iX_i=1.\tag{5.35}\]

第 2 步:方差。 于是 \(\tilde\beta_1-\beta_1=\sum a_iu_i\);由条件 (ii)(iii),交叉项期望为零,

\[\operatorname{var}(\tilde\beta_1\mid X)=\sigma_u^2\sum a_i^2.\tag{5.36}\]

OLS 的权重 \(\hat a_i\) 同样满足 (5.35)、(5.36)。

第 3 步:分解权重。 令 \(a_i=\hat a_i+d_i\),则 \(\sum a_i^2=\sum\hat a_i^2+2\sum\hat a_id_i+\sum d_i^2\)。而

\[\sum\hat a_id_i=\frac{\sum d_iX_i-\bar X\sum d_i}{\sum(X_j-\bar X)^2}=\frac{(\sum a_iX_i-\sum\hat a_iX_i)-\bar X(\sum a_i-\sum\hat a_i)}{\sum(X_j-\bar X)^2}=\frac{(1-1)-\bar X(0-0)}{\sum(X_j-\bar X)^2}=0.\]

第 4 步:比较。

\[\operatorname{var}(\tilde\beta_1\mid X)-\operatorname{var}(\hat\beta_1\mid X)=\sigma_u^2\sum d_i^2\ \ge 0.\tag{5.37}\]

只要某个 \(d_i\ne0\) 就严格更大;全部 \(d_i=0\) 时 \(\tilde\beta_1=\hat\beta_1\)。证毕。

若把 i.i.d. 假设换成「\(X_1,\dots,X_n\) 在重复样本中固定、\(u_1,\dots,u_n\) i.i.d.」,证明照搬,只是去掉「条件于 \(X\)」的表述。

推导拆解:四步各用了什么。

  • 第 1 步:把 \(Y_i=\beta_0+\beta_1X_i+u_i\) 代入 \(\sum a_iY_i\) 并按 \(\beta_0\)、\(\beta_1\)、\(u\) 分组。条件期望里 \(a_i\) 和 \(X_i\) 都是已知数,\(E(u_i\mid X)=0\) 让第三组消失。「对任意 \(\beta_0,\beta_1\) 都无偏」意味着 \(\beta_0\) 的系数必须是 0、\(\beta_1\) 的系数必须是 1,否则总能找到某组参数让它偏。
  • 第 2 步:\(\operatorname{var}(\sum a_iu_i\mid X)=\sum_i\sum_j a_ia_jE(u_iu_j\mid X)\)。\(i\ne j\) 的项由条件 (iii) 为 0;\(i=j\) 的项由条件 (ii) 都是 \(\sigma_u^2\)。于是只剩 \(\sigma_u^2\sum a_i^2\)。同方差在这里不可缺少:若各 \(u_i\) 方差不同,结果是 \(\sum a_i^2\sigma_i^2\),后面的比较就不成立。
  • 第 3 步:把 \(\hat a_i=(X_i-\bar X)/\sum_j(X_j-\bar X)^2\) 代入 \(\sum\hat a_id_i\),分子展开为 \(\sum d_iX_i-\bar X\sum d_i\)。由于 \(a_i\) 和 \(\hat a_i\) 都满足 (5.35),\(d_i=a_i-\hat a_i\) 满足 \(\sum d_i=0\)、\(\sum d_iX_i=0\),交叉项为 0。
  • 第 4 步:交叉项为 0,\(\sum a_i^2=\sum\hat a_i^2+\sum d_i^2\),多出来的 \(\sum d_i^2\) 非负。 这和第 2 章「条件均值是最优预测」、第 3 章「\(\bar Y\) 是 BLUE」的证明是同一个结构:把任意候选写成「最优解 + 偏离」,证明交叉项为 0,偏离只会增加平方和。

金融直觉:把 \(a_i\) 看成组合权重,问题就变成「在两条线性约束下找方差最小的组合」:\(\sum a_i=0\) 像多空中性(多空权重相抵),\(\sum a_iX_i=1\) 像要求对某个因子的暴露恰好为 1。误差两两不相关、方差相同,组合方差就是 \(\sigma_u^2\sum a_i^2\)。OLS 权重就是满足这两条约束的最小方差「因子模拟组合」。这也是为什么截面回归的因子收益可以解释为一个纯因子组合的收益(Fama–MacBeth 的组合解释)。若误差方差不同(异方差),最小方差组合应该给低噪声资产更大权重,这正是下文 WLS 的思想。

5.5.4 两点局限

  1. 条件在实践中常不成立,尤其是同方差。 异方差不影响基于稳健 SE 的推断,但此时 OLS 不再是 BLUE。
  2. 即使条件成立,也可能存在非线性或非条件无偏的估计量,在某些条件下比 OLS 更有效。

5.5.5 OLS 以外的两个回归估计量

加权最小二乘(weighted least squares,WLS)。 若已知 \(\operatorname{var}(u_i\mid X_i)\)(至多差一个比例常数),把第 \(i\) 个观测的 \(Y_i\)、常数项和 \(X_i\) 都乘以条件标准差的倒数,加权后误差同方差,对加权数据做 OLS 就是 BLUE。例如 \(\operatorname{var}(u_i\mid X_i)=\sigma^2X_i^2\) 时,把方程两边除以 \(X_i\)。难点是实际中很少知道条件方差如何依赖 \(X_i\),所以 WLS 远不如 OLS 常用,原书第 18 章再细讲。

推导拆解:为什么乘以条件标准差的倒数就同方差了?设 \(\operatorname{var}(u_i\mid X_i)=\sigma^2h_i\),\(h_i\) 已知。方程两边同除以 \(\sqrt{h_i}\):\(\frac{Y_i}{\sqrt{h_i}}=\beta_0\frac1{\sqrt{h_i}}+\beta_1\frac{X_i}{\sqrt{h_i}}+\frac{u_i}{\sqrt{h_i}}\)。新误差的条件方差为 \(\frac{\sigma^2h_i}{h_i}=\sigma^2\),与 \(i\) 无关,高斯—马尔可夫条件重新成立,对变换后的数据做 OLS(注意不再另加常数项,\(1/\sqrt{h_i}\) 就扮演原截距的角色)就是 BLUE。等价地,它在最小化 \(\sum(Y_i-b_0-b_1X_i)^2/h_i\):噪声大的观测平方误差打折扣。 正文的例子 \(h_i=X_i^2\),除以 \(\sqrt{h_i}=X_i\),即练习 9。 注意:若 \(h_i\) 设错了,WLS 仍然无偏,只是不再最有效,并且它报告的经典标准误也会错。所以实务中即使用 WLS,也常常同时报告稳健标准误。

最小绝对偏差(least absolute deviations,LAD)。 最小化 \(\sum_{i=1}^n|Y_i-b_0-b_1X_i|\) 而不是平方和。它对 \(u\) 中的大离群值不那么敏感。若极端离群值并不罕见,LAD 等估计量可能更有效、推断更可靠。多数经济数据中严重离群值罕见,所以原书此后只讨论最小二乘。金融收益则是厚尾的,这一点要特别留意(见本章量化实战)。


5.6 小样本时的 t 统计量(选读)

小样本下 t 统计量的精确分布很复杂,依赖未知的总体分布。但有一个特例:若三条最小二乘假设成立,误差同方差,并且误差服从正态分布,则 OLS 估计量正态分布,仅同方差 t 统计量精确服从 Student t 分布。这五条合称同方差正态回归假设(homoskedastic normal regression assumptions)。

推导思路:\(t_m\) 分布定义为 \(Z/\sqrt{W/m}\),其中 \(Z\sim N(0,1)\),\(W\sim\chi^2_m\),二者独立。仅同方差 t 统计量 \(\tilde t=(\hat\beta_1-\beta_{1,0})/\tilde\sigma_{\hat\beta_1}\)。在上述假设下,给定 \(X\) 时 \(Y_i\) 正态;\(\hat\beta_1\) 是 \(Y_i\) 的加权平均(权重 (5.32) 只依赖 \(X\)),独立正态变量的加权平均仍正态,所以零假设下 \(\hat\beta_1-\beta_{1,0}\) 条件正态、均值为 0。原书第 18、19 章证明标准化后的仅同方差方差估计量服从 \(\chi^2_{n-2}/(n-2)\),且与 \(\hat\beta_1\) 独立。因此

\[\tilde t\sim t_{n-2}.\]

白话解释:为什么是 \(t\) 而不是正态?如果误差标准差 \(\sigma_u\) 已知,\(\hat\beta_1\) 标准化后就精确服从 \(N(0,1)\)。实际中 \(\sigma_u\) 要用 \(s_{\hat u}\) 估计,而 \(s_{\hat u}\) 本身也有随机波动;分母多了一份不确定性,尾部就比正态更厚,这正是 \(t\) 分布的构造 \(Z/\sqrt{W/m}\):\(Z\) 来自分子,\(W/m\) 来自估计出来的方差。自由度 \(n-2\) 是因为残差满足两个正规方程约束,只有 \(n-2\) 个能自由变动。样本一大,\(s_{\hat u}\) 几乎没有误差,分母趋于常数,\(t\) 也就趋于正态。

第 3 章的「两总体正态、方差相同时,合并标准误构造的 t 统计量服从 Student t」是这个结论的特例,因为 \(X\) 为二元变量时仅同方差 SE 正是合并 SE。

实践意义。 若误差确实同方差且正态,并且使用仅同方差 t,临界值应取自 Student t 分布。但 \(n\) 中等或较大时,t 分布与正态分布的差别可以忽略(\(t_{30}\) 的 97.5% 分位数为 2.04,\(t_{120}\) 为 1.98)。计量应用中极少有理由相信误差同方差且正态,而样本通常较大,所以标准做法仍然是:稳健 SE + 标准正态分布计算 p 值、做检验和置信区间。


5.7 回到督学:统计显著不等于因果

420 个学区的数据显示师生比与成绩负相关,系数在实际意义上中等偏大:师生比少 2,平均分高约 4.6 分,大约相当于把成绩分布中位数处的学区移到第 60 百分位。系数在 5% 水平显著,单纯靠抽样变异得到这么大 t 值的概率约 0.001%;95% 置信区间为 \([-3.30,-1.26]\)。

但疑问仍在:这是不是因果效应?第一条最小二乘假设要求班级规模随机分配,或「如同随机分配」(as-if randomly assigned),而加州数据是观测数据。富裕学区更负担得起小班,同时还有更好的设施、更新的教材、薪酬更高的教师,学生家庭也更富裕;加州移民多,移民家庭较穷,子女常不以英语为母语。负相关可能来自大班与这些遗漏变量(omitted variables)同时出现。单独降低师生比并不会改变这些因素,所以需要能够「保持其他因素不变」、把师生比效应分离出来的方法,这就是下一章的多元回归。

量化研究者每天都在面对同样的问题:一个因子的 t 值很高,可能只是因为它和市值、行业或已知风格因子相关。t 检验只回答「这个系数是不是零」,不回答「这个系数是不是我以为的那个东西」。


量化实战

本章方法在量化里的位置

因子与 alpha 的显著性检验。 资产超额收益对市场超额收益做时间序列回归,截距是 alpha,斜率是 beta;截面回归中,收益对因子暴露回归得到因子收益。所有这些系数的显著性都按本章的「估计/SE」框架判断。实务上常用的门槛:单个预先设定的因子,\(|t|>2\);在大量候选里挖出来的因子,按 Harvey、Liu、Zhu(2016)的建议要求 \(|t|>3\),原因在第 07 章的多重检验部分展开。

稳健标准误是默认选项。 金融收益几乎总是异方差的:高波动股票残差更大,市场剧烈波动的日子个股残差也更大。用经典 SE 会让 t 值虚高、制造伪因子。时间序列回归还存在自相关时,需要进一步使用 HAC(Newey–West)标准误,见本册时间序列各章和第 06 册。

虚拟变量回归 = 事件研究与日历效应。 公告日/非公告日、周一/非周一、一月/非一月、多头组/空头组,凡是「两组均值是否不同」的问题都可以写成对虚拟变量的回归,系数即均值差,稳健 t 即 Welch 型均值差检验。好处是很容易再加控制变量(第 06 章)。

两段样本的系数比较。 牛市和熊市分别估计 beta,若两段样本独立,差的标准误为 \(\sqrt{SE_1^2+SE_2^2}\)(原书习题 5.15)。

WLS 与 LAD。 Barra 类风险模型的截面回归通常按市值平方根加权,就是 WLS 思想:大市值股票特质风险小,给更大权重,同时也让因子收益更贴近可投资组合。厚尾数据中,LAD(中位数回归)或其他稳健回归可以降低极端收益对系数的支配。

小样本。 月度策略回测常常只有几十个观测,此时正态与同方差假设都难以成立,Student t 修正只是粗略近似,宜辅以 bootstrap。

示例:beta 的稳健推断、异方差下的检验水平、周一效应

下面的代码做三件事:(1) 模拟一只厚尾、异方差的股票,比较仅同方差 SE 与稳健 SE 对「beta = 1」检验的影响;(2) 用蒙特卡洛估计零假设为真时两种 t 检验的实际拒绝率;(3) 验证虚拟变量回归的系数与稳健 SE 就是均值差及其标准误。

import numpy as np
import statsmodels.api as sm
from scipy import stats

rng = np.random.default_rng(42)

# ---- 1. 单只股票对市场回归:估计 beta,并用稳健标准误做推断 ----
n = 750                                   # 约 3 年日频
rm = rng.standard_t(df=4, size=n) * 0.01  # 市场超额收益(厚尾)
sigma_u = 0.008 + 1.2 * np.abs(rm)        # 市场大波动时个股残差也更大:异方差
ri = 0.0002 + 1.3 * rm + sigma_u * rng.standard_normal(n)

X = sm.add_constant(rm)
ols = sm.OLS(ri, X).fit()                 # 仅同方差 SE
rob = sm.OLS(ri, X).fit(cov_type="HC1")   # 异方差稳健 SE(n-k 自由度调整,对应原书式 5.4)
b, se_h, se_r = ols.params[1], ols.bse[1], rob.bse[1]
print(f"beta_hat = {b:.4f}")
print(f"SE(仅同方差) = {se_h:.4f},  SE(稳健) = {se_r:.4f}")
t_beta1 = (b - 1.0) / se_r                # H0: beta = 1
print(f"检验 beta=1:t = {t_beta1:.2f}, 双侧 p = {2*stats.norm.cdf(-abs(t_beta1)):.4f}")
print(f"beta 的 95% 稳健置信区间: [{b-1.96*se_r:.3f}, {b+1.96*se_r:.3f}]")

# ---- 2. 蒙特卡洛:零假设为真时,两种 SE 的实际拒绝率 ----
def one_draw(n=500):
    x = rng.standard_normal(n)
    u = np.abs(x) * rng.standard_normal(n)      # 误差方差随 x^2 增大
    y = 1.0 + 0.0 * x + u                       # 真实 beta_1 = 0
    Xc = sm.add_constant(x)
    f = sm.OLS(y, Xc).fit()
    t_h = f.params[1] / f.bse[1]
    t_r = f.params[1] / f.get_robustcov_results("HC1").bse[1]
    return abs(t_h) > 1.96, abs(t_r) > 1.96

res = np.array([one_draw() for _ in range(4000)])
print(f"名义水平 5%:仅同方差 t 拒绝率 = {res[:,0].mean():.3f}, 稳健 t 拒绝率 = {res[:,1].mean():.3f}")

# ---- 3. 虚拟变量回归 = 均值差检验:周一效应 ----
T = 2500
monday = (np.arange(T) % 5 == 0).astype(float)
ret = 0.0004 - 0.0008 * monday + 0.012 * rng.standard_normal(T)
fit = sm.OLS(ret, sm.add_constant(monday)).fit(cov_type="HC1")
m1, m0 = ret[monday == 1].mean(), ret[monday == 0].mean()
se_diff = np.sqrt(ret[monday == 1].var(ddof=1) / (monday == 1).sum()
                  + ret[monday == 0].var(ddof=1) / (monday == 0).sum())
print(f"截距 = {fit.params[0]:.6f}  (非周一均值 {m0:.6f})")
print(f"D 的系数 = {fit.params[1]:.6f}  (均值差 {m1-m0:.6f})")
print(f"回归稳健 SE = {fit.bse[1]:.6f},  均值差 SE(式 3.19) = {se_diff:.6f}")

关键输出:

beta_hat = 1.2489
SE(仅同方差) = 0.0578,  SE(稳健) = 0.1288
检验 beta=1:t = 1.93, 双侧 p = 0.0532
beta 的 95% 稳健置信区间: [0.997, 1.501]
名义水平 5%:仅同方差 t 拒绝率 = 0.262, 稳健 t 拒绝率 = 0.060
截距 = 0.000605  (非周一均值 0.000605)
D 的系数 = -0.000936  (均值差 -0.000936)
回归稳健 SE = 0.000618,  均值差 SE(式 3.19) = 0.000618

怎么读这些结果。

第一部分:稳健 SE(0.129)是仅同方差 SE(0.058)的两倍多。若用经典 SE,检验 beta = 1 的 t 值约为 \(0.249/0.058=4.3\),会「高度显著」地断言这只股票的 beta 大于 1;用稳健 SE,t = 1.93,p = 0.053,在 5% 水平恰好不能拒绝,置信区间的下端紧贴 1。两种结论对对冲比例、风险预算的影响完全不同。

第二部分:真实斜率为零时,名义 5% 的经典 t 检验实际拒绝了 26% 的样本,是名义水平的五倍多;稳健 t 检验的拒绝率为 6.0%,接近 5%(\(n=500\) 时仍有小样本偏差,HC3 等变体在小样本下表现更好)。这就是 5.4.3 节「仅同方差 t 在大样本下也不服从标准正态」的直接演示。如果你在 1000 个候选信号上用经典 SE 做筛选,即使所有信号都无效,也会有两百多个「显著」。

第三部分:对周一虚拟变量回归,截距精确等于非周一的平均收益,系数精确等于周一与非周一的均值差,HC1 稳健 SE 与不等方差均值差 SE 完全相同。


本章小结

回归系数的推断与总体均值的推断用的是同一套框架:t 统计量 =(估计量 − 假设值)/ 标准误,大样本下近似标准正态,p 值是零假设下出现至少同样极端统计量的概率,95% 置信区间为估计值 ± 1.96 倍标准误,它等价于 5% 双侧检验不能拒绝的值的集合。回归元为虚拟变量时,系数是两组均值之差,回归 t 检验就是均值差检验。误差一般是异方差的,仅同方差标准误在异方差下给出错误的检验水平和覆盖率,而异方差稳健标准误在两种情形下都有效,应当作为默认选择。若再加上同方差,OLS 是最优线性条件无偏估计量(高斯—马尔可夫定理);若再加上误差正态,仅同方差 t 统计量精确服从 \(t_{n-2}\),但中大样本下与正态的差别可以忽略。最后,统计显著并不意味着因果:观测数据中遗漏变量可能使 \(E(u\mid X)\ne0\),这把我们引向多元回归。

概念 公式 / 要点
t 统计量 \(t=(\hat\beta_1-\beta_{1,0})/SE(\hat\beta_1)\)
双侧 p 值 \(2\Phi(-\lvert t^{act}\rvert)\);5% 临界值 1.96,1% 为 2.58
单侧检验 左尾 \(p=\Phi(t^{act})\);5% 临界值 −1.64,1% 为 −2.33;需事先有理由
95% 置信区间 \(\hat\beta_1\pm1.96SE(\hat\beta_1)\)
预测效应区间 \([\hat\beta_1\pm1.96SE(\hat\beta_1)]\times\Delta x\)
虚拟变量系数 \(\beta_1=E(Y\mid D=1)-E(Y\mid D=0)\);\(\hat\beta_0=\bar Y_0\)
稳健方差 (HC1) \(\hat\sigma^2_{\hat\beta_1}=\dfrac{n}{n-2}\cdot\dfrac{\sum(X_i-\bar X)^2\hat u_i^2}{[\sum(X_i-\bar X)^2]^2}\)
仅同方差方差 \(\tilde\sigma^2_{\hat\beta_1}=s^2_{\hat u}/\sum(X_i-\bar X)^2\)
高斯—马尔可夫 三假设 + 同方差 ⇒ OLS 是 BLUE
小样本 t 再加误差正态 ⇒ 仅同方差 \(t\sim t_{n-2}\)
WLS / LAD 已知方差形式时 WLS 更有效;离群值多时 LAD 更稳健

练习

基础

  1. (改编自原书习题 5.1)50 个班级的回归 \(\widehat{TestScore}=\underset{(23.5)}{640.3}-\underset{(2.02)}{4.93}\,CS\)。(a) 求 \(\beta_1\) 的 95% 置信区间;(b) 检验 \(\beta_1=0\) 的双侧 p 值,5% 与 1% 水平是否拒绝;(c) 检验 \(\beta_1=-5.0\),−5.0 是否在置信区间内;(d) 求 \(\beta_0\) 的 90% 置信区间。 答案要点:(a) \(-4.93\pm3.96=[-8.89,-0.97]\);(b) \(t=-2.44\),\(p\approx0.015\),5% 拒绝、1% 不拒绝;(c) \(t=0.035\),不拒绝,在区间内;(d) \(640.3\pm1.64\times23.5=[601.8,678.8]\)。
  2. (改编自原书习题 5.2)\(\widehat{Wage}=\underset{(0.16)}{10.73}+\underset{(0.29)}{1.78}\,Male\)。男女的样本平均工资各是多少?若改用 \(Female=1-Male\) 作回归元,系数、\(R^2\)、SER 如何变化? 答案要点:女 10.73,男 12.51;新回归截距 12.51、系数 −1.78,\(R^2\) 与 SER 不变(拟合值完全相同)。
  3. 身高对体重的回归系数为 4.16(SE 0.42)。某人长高 2 英寸,体重预期增量的 95% 置信区间是多少? 答案要点:\(2\times(4.16\pm0.823)=[6.67,9.97]\)。
  4. 解释为什么本章蒙特卡洛中经典 t 检验的拒绝率远高于 5%。如果误差方差反而随 \(|x|\) 减小,你预计经典 SE 会高估还是低估真实方差? 提示:比较 \(E[(X-\mu_X)^2u^2]\) 与 \(\sigma_X^2\sigma_u^2\);方差随 \(|x|\) 减小时前者更小,经典 SE 高估方差,检验偏保守。
  5. 某研究员看完回测后宣布「我只关心策略收益是否为正,所以用单侧检验」,t = 1.80。他的结论在 5% 水平「显著」。这种做法有什么问题?实际的假阳性率是多少? 提示:事后选方向,相当于在两个方向上各用 1.64 的门槛,真实水平约 10%。

进阶

  1. 证明 OLS 权重 \(\hat a_i=(X_i-\bar X)/\sum_j(X_j-\bar X)^2\) 满足 \(\sum\hat a_i=0\) 与 \(\sum\hat a_iX_i=1\),并由此直接验证 \(\hat\beta_1\) 条件无偏。 提示:\(\sum(X_i-\bar X)X_i=\sum(X_i-\bar X)^2\)。
  2. (改编自原书习题 5.9)过原点模型 \(Y_i=\beta X_i+u_i\)。证明 \(\tilde\beta=\bar Y/\bar X\) 是线性且条件无偏的;在高斯—马尔可夫条件下,与 OLS 估计量 \(\hat\beta=\sum X_iY_i/\sum X_i^2\) 比较方差。 提示:\(\tilde\beta\) 的权重 \(a_i=1/(n\bar X)\),方差 \(\sigma_u^2/(n\bar X^2)\);OLS 方差 \(\sigma_u^2/\sum X_i^2\),由 \(\sum X_i^2\ge n\bar X^2\) 知 OLS 更小。
  3. 牛市样本估计某股票 beta 为 1.20(SE 0.08),熊市样本为 0.95(SE 0.10),两段样本独立。检验两段 beta 相等。 答案要点:差 0.25,SE \(=\sqrt{0.08^2+0.10^2}=0.128\),\(t=1.95\),5% 水平边缘不拒绝。
  4. 若 \(\operatorname{var}(u_i\mid X_i)=\sigma^2X_i^2\)(\(X_i>0\)),写出 WLS 的变换方程,并说明变换后哪个系数对应原来的 \(\beta_1\)。 提示:两边除以 \(X_i\):\(Y_i/X_i=\beta_0(1/X_i)+\beta_1+u_i/X_i\);变换后方程的「截距」是 \(\beta_1\),\(1/X_i\) 的系数是 \(\beta_0\)。
  5. 修改本章代码,把误差改为同方差(u = rng.standard_normal(n)),重新计算两种 t 检验的拒绝率,并解释结果。 提示:两者都应接近 5%,说明稳健 SE 在同方差下也没有损失。

原书推荐习题:5.1、5.7(检验与置信区间全流程,5.7(d) 考查检验水平与覆盖率的频率含义);5.2、5.10、5.11(虚拟变量与均值差);5.6、5.13(同方差/异方差与 BLUE 的关系);5.14(过原点回归的完整 BLUE 证明);5.15(独立样本系数差的 SE);实证题 E5.3(吸烟与出生体重)。


原书对照

本章内容 原书章节 PDF 页码
章引言、贯穿案例 第 5 章开篇 p.179
回归系数的假设检验(Key Concept 5.1、5.2,单侧检验) 5.1 p.179–185
回归系数的置信区间(Key Concept 5.3,预测效应区间) 5.2 p.185–187
二元回归元 5.3 p.186–188
异方差与同方差(Key Concept 5.4,教育回报方框) 5.4 p.188–194
OLS 的理论基础、高斯—马尔可夫定理、WLS、LAD(选读) 5.5 p.194–196
小样本 t 统计量(选读) 5.6 p.196–197
结论 5.7 p.197–198
小结、关键术语、复习题与习题 第 5 章末 p.199–206
OLS 标准误公式 附录 5.1 p.207–208
高斯—马尔可夫条件与定理证明 附录 5.2 p.208–211

注:原书页码 = PDF 页码 − 1。