量化交易中文教材

第 18 章 单回归元线性回归的理论

学习目标

读完本章,你应当能够:

  1. 陈述单回归元的五条扩展最小二乘假设,说明前三条、加第四条、再加第五条分别支撑什么结论。
  2. 准确定义依概率收敛、一致性、依分布收敛,用切比雪夫不等式证明大数定律,并区分「无偏」与「一致」。
  3. 熟练运用 Slutsky 定理与连续映射定理,把「分子用 CLT、分母用 LLN」组合成统计量的极限分布,并用它证明 t 统计量渐近正态。
  4. 理解异方差稳健标准误一致性的证明思路。
  5. 在同方差正态误差下推导 \(\hat\beta_1\) 的精确正态分布和仅同方差 t 统计量的精确 \(t_{n-2}\) 分布,理解自由度调整的双重作用。
  6. 构造不可行 WLS 与可行 WLS,比较 WLS 与「OLS + 稳健标准误」的利弊,并知道 WLS 在异质处理效应下估计的是什么。

读前导读

这一章在解决什么问题。 CFA 里你学过:做一元回归,看系数的 t 值,大于 2 就显著。本章回答这套做法背后的三个「为什么」。第一,为什么 t 值可以拿去和 1.96 比?答案是样本大时它近似服从标准正态,本章把这个「近似」严格化。第二,为什么软件里有两种标准误(普通的和「稳健」的)、为什么默认该用稳健的?第三,误差方差不相等(异方差)时,除了换标准误,还能不能改估计方法本身?这就是加权最小二乘(WLS),Barra 风险模型按市值平方根加权的横截面回归就是它。

对你来说最有价值的是 18.2 节那套「渐近工具」:大数定律、中心极限定理、Slutsky 定理。它们像一组乐高积木,后面 19a、19b 章所有检验统计量的推导都是同一套拼法。读懂一次,后面就是重复。

需要先想起来的数学。

  • 极限与「\(n\to\infty\)」。\(a_n\to a\) 的意思是:只要 \(n\) 足够大,\(a_n\) 和 \(a\) 的距离可以小于任何你指定的正数。例:\(1/n\to0\);\(\frac n{n-2}\to1\)。本章把这个想法搬到随机变量上,变成「依概率收敛」。见 第 00 册第 01 章 函数极限与连续。
  • 期望和方差的运算规则。\(E(aX+b)=aE(X)+b\);独立变量之和的方差等于方差之和;\(\mathrm{var}(\bar Y)=\sigma^2/n\)。这些是证明大数定律的全部原料。例:\(\sigma=20\%\) 的月收益,取 100 个月平均,标准差降到 \(2\%\)。
  • 几何级数。\(1+a+a^2+\cdots+a^{n-1}=\frac{1-a^n}{1-a}\),\(|a|<1\) 时 \(n\to\infty\) 趋于 \(\frac1{1-a}\)。这就是年金现值公式的骨架,本章用它分析指数加权均值。见 第 00 册第 04 章 级数与收敛。
  • 期望作为积分。连续随机变量 \(E(Y)=\int yf(y)dy\),即「取值 × 概率密度」加总。附录 18.1、18.2 的证明都在积分上操作,把积分想成「连续版的加权求和」即可。见 第 00 册第 03 章 积分。
  • 收敛的几种说法与常用不等式。\(\xrightarrow{p}\)(依概率收敛)、\(\xrightarrow{d}\)(依分布收敛)、切比雪夫不等式、Cauchy–Schwarz 不等式,本章都会正式定义,系统梳理见 第 00 册第 07 章 概率中的分析工具。

怎么读这一章。 核心必读:18.1 的假设表(三个层次分别换来什么)、18.2 全节(尤其 18.2.5 的「模板」)、18.3.1 和 18.3.3、18.5.3 的「稳健标准误还是 WLS」。可以第一次只看结论的:18.3.2 的稳健标准误一致性证明(记住「每项都是趋零误差乘有界矩」这句即可)、附录 18.1 的二元正态密度公式。18.4 精确分布若你对 CFA 里的 t 分布已熟悉,可以快速浏览,记住「自由度 \(n-2\) 的两个作用」。建议先读 18.2.5,看懂模板之后回头读 18.2.1–18.2.4,会更清楚每块积木的用途。


18.0 为什么应用者也要学理论

原书开篇的回答很直接:理论让软件从「黑箱」变成工具箱,你知道每件工具为什么有效、需要什么假设;更重要的是,你能识别工具何时失效、何时该换方法。对量化研究者,这意味着能判断一个回测 t 值什么时候可信、一个风险模型的加权方案什么时候会出问题。

本章补充(而不是替代)第 4、5 章,在两个方向上扩展:

  1. 用数学推导 OLS 估计量和 t 统计量的抽样分布。大样本下只需第 4 章 Key Concept 4.3 的三条最小二乘假设;有限样本下再加同方差和正态误差两条。18.2、18.3 节(及附录 18.2)推导大样本正态性,18.4 节推导同方差正态误差下的精确分布。
  2. 处理异方差的另一种方法:加权最小二乘(18.5 节)。

本章是第 19a 章矩阵形式理论的单变量版本。概率论基础(期望、方差、条件期望)见第 02 册;统计推断的一般理论(收敛概念、渐近正态、Delta 方法)见第 03 册。


18.1 扩展最小二乘假设与 OLS 估计量

Key Concept 18.1(单回归元的扩展最小二乘假设) 模型为

\[Y_i=\beta_0+\beta_1X_i+u_i,\quad i=1,\dots,n,\tag{18.1}\]
\(\beta_1\) 是 \(X\) 对 \(Y\) 的因果效应。

  1. \(E(u_i\mid X_i)=0\)(条件均值为零);
  2. \((X_i,Y_i)\) 独立同分布(i.i.d.);
  3. \(X_i\) 与 \(u_i\) 有非零有限的四阶矩;
  4. \(\mathrm{var}(u_i\mid X_i)=\sigma_u^2\)(同方差);
  5. \(u_i\mid X_i\) 服从正态分布(正态误差)。

三个层次:

成立的假设 结论
1–3 OLS 无偏、一致、大样本正态;稳健 t 检验和 \(\pm1.96SE\) 置信区间大样本有效
1–4 再加:OLS 在条件于 \(X_1,\dots,X_n\) 的线性无偏估计量中方差最小(高斯–马尔可夫定理,第 5.5 节)
1–5 再加:\(\hat\beta_1\) 条件精确正态,仅同方差 t 统计量精确服从 \(t_{n-2}\)

后两条远比前三条严格,在多数应用中不现实,但它们具有理论意义,而且软件默认输出的 p 值常常基于它们。

推论:在假设 1、2、4、5 下,\(u_i\) 是 i.i.d. \(N(0,\sigma_u^2)\),且与 \(X_i\) 独立。理由如下:

  • 假设 5 给出 \(u_i\mid X_i\sim N(0,\mathrm{var}(u_i\mid X_i))\),均值 0 来自假设 1;
  • 假设 4 使条件方差为常数 \(\sigma_u^2\),于是条件分布 \(N(0,\sigma_u^2)\) 根本不依赖 \(X_i\),所以 \(u_i\) 与 \(X_i\) 独立;
  • 由假设 2,不同观测之间独立,\(u_i\) 与 \(u_j\) 独立。

白话解释:「条件均值为零」\(E(u_i\mid X_i)=0\) 比「\(u\) 与 \(X\) 不相关」更强:它要求不管 \(X\) 取什么值,误差平均都是零,即 \(X\) 里没有任何能预测误差的信息。假设 3「四阶矩有限」听起来抽象,实际是在排除极端厚尾:它保证样本方差本身不会被几个异常值搅得无法收敛。四阶矩就是 \(E(X^4)\),和峰度同一个量级;如果收益的峰度是无穷大,后面所有渐近结论都没有保障。 推论里「条件分布不依赖 \(X_i\) ⇒ 独立」这一步值得记住:一般情况下「不相关」推不出「独立」,这里能推出来,是因为正态分布完全由均值和方差决定,两者都不随 \(X\) 变,整个分布也就不随 \(X\) 变。

OLS 估计量(推导见附录 4.2):

\[\hat\beta_1=\frac{\sum_{i=1}^n(X_i-\bar X)(Y_i-\bar Y)}{\sum_{i=1}^n(X_i-\bar X)^2},\tag{18.2}\]
\[\hat\beta_0=\bar Y-\hat\beta_1\bar X.\tag{18.3}\]


18.2 渐近分布理论的基础

渐近分布理论研究样本量趋于无穷(\(n\to\infty\))时统计量抽样分布的极限行为。它在计量中处于核心地位,原因有二:(1) 样本大时,渐近极限是有限样本分布的高质量近似;(2) 渐近分布通常比精确的有限样本分布简单得多。两块基石是大数定律和中心极限定理(第 2.6 节),再加两件工具:Slutsky 定理和连续映射定理。

18.2.1 依概率收敛与大数定律

定义。随机变量序列 \(\{S_n\}\) 依概率收敛(converge in probability)到常数 \(\mu\),记作 \(S_n\xrightarrow{p}\mu\),当且仅当对每个 \(\delta>0\),

\[\Pr(|S_n-\mu|\ge\delta)\to0\quad(n\to\infty).\tag{18.4}\]
若 \(S_n\xrightarrow{p}\mu\),称 \(S_n\) 为 \(\mu\) 的一致估计量(consistent estimator)。

大数定律(本书版本,即 Key Concept 2.6)。若 \(Y_1,\dots,Y_n\) i.i.d.,\(E(Y_i)=\mu_Y\),\(\mathrm{var}(Y_i)=\sigma_Y^2<\infty\),则

\[\bar Y\xrightarrow{p}\mu_Y.\tag{18.5}\]

证明。由切比雪夫不等式(附录 18.2 式 18.42),

\[\Pr(|\bar Y-\mu_Y|\ge\delta)\le\frac{\mathrm{var}(\bar Y)}{\delta^2}=\frac{\sigma_Y^2}{n\delta^2}\to0.\tag{18.6}\]
证毕。直观上:\(\bar Y\) 的方差以 \(1/n\) 的速度下降,它落在 \(\mu_Y\pm\delta\) 之外的概率也随之趋零。

白话解释:定义 (18.4) 的读法是「先挑容忍度,再看概率」。你先任选一个误差容忍度 \(\delta\)(比如 0.1%),然后问:估计值偏离真值超过 \(\delta\) 的概率是多少?只要样本无限增大时这个概率趋于 0,并且对每一个 \(\delta\) 都如此,就叫依概率收敛。 推导拆解:(18.6) 只有两步。第一个「\(\le\)」直接套切比雪夫不等式,把 \(V\) 取成 \(\bar Y\)。第二个「\(=\)」用了 \(\mathrm{var}(\bar Y)=\sigma_Y^2/n\),这需要 i.i.d.:\(n\) 个独立变量之和的方差是 \(n\sigma_Y^2\),再除以 \(n^2\)。最后 \(\delta\) 固定、\(n\to\infty\),分式趋于 0。 数值感受:月收益 \(\sigma_Y=5\%\),想让样本均值偏离真值超过 \(1\%\) 的概率不超过 \(10\%\),切比雪夫要求 \(\frac{0.05^2}{n\cdot0.01^2}\le0.1\),即 \(n\ge250\) 个月。切比雪夫很保守(不用任何分布信息),若用正态近似只需约 68 个月。

18.2.2 三个例子:无偏与一致是两回事

设 \(Y_i\) i.i.d. \(N(\mu_Y,\sigma_Y^2)\)(原书此处印作 \(N(0,\sigma_Y^2)\),按上下文应为 \(N(\mu_Y,\sigma_Y^2)\)),考虑三个 \(\mu_Y\) 的估计量。

例 1:\(\hat\mu_a=Y_1\),无偏但不一致。 \(E(Y_1)=\mu_Y\),但不论 \(n\) 多大都只用一个观测,\(\Pr(|Y_1-\mu_Y|\ge\delta)\) 是一个与 \(n\) 无关的正数,分布不可能集中。

例 2:几何加权平均,无偏但不一致。

\[\hat\mu_b=\left(\frac{1-a^n}{1-a}\right)^{-1}\sum_{i=1}^na^{i-1}Y_i,\quad0<a<1.\]
因为 \(\sum_{i=1}^na^{i-1}=\frac{1-a^n}{1-a}\),权重和为 1,所以无偏。它的方差为
\[\mathrm{var}(\hat\mu_b)=\sigma_Y^2\frac{(1-a^{2n})(1-a)^2}{(1-a^2)(1-a^n)^2}=\sigma_Y^2\frac{(1+a^n)(1-a)}{(1-a^n)(1+a)}\to\sigma_Y^2\frac{1-a}{1+a}>0.\]
(化简用了 \(1-a^{2n}=(1-a^n)(1+a^n)\) 与 \(1-a^2=(1-a)(1+a)\)。)

推导拆解:方差公式的来源。记归一化常数 \(c=\frac{1-a}{1-a^n}\),则 \(\hat\mu_b=c\sum a^{i-1}Y_i\)。 第一步,独立变量加权和的方差 = 权重平方 × 各自方差之和:\(\mathrm{var}(\hat\mu_b)=c^2\sigma_Y^2\sum_{i=1}^na^{2(i-1)}\)。 第二步,\(\sum a^{2(i-1)}\) 是公比为 \(a^2\) 的几何级数,等于 \(\frac{1-a^{2n}}{1-a^2}\)。 第三步,代入 \(c^2=\frac{(1-a)^2}{(1-a^n)^2}\) 即得第一个等号,再用括号里的两个因式分解约分。 第四步,\(n\to\infty\) 时 \(a^n\to0\),剩 \(\frac{1-a}{1+a}\)。 换个角度:等权平均的方差是 \(\sigma^2/n\),把 \(\sigma^2\frac{1-a}{1+a}\) 写成 \(\sigma^2/n_{\text{eff}}\),得「有效样本量」\(n_{\text{eff}}=\frac{1+a}{1-a}\)。\(a=0.9\) 时 \(n_{\text{eff}}=19\),即使有一万个观测,精度也只相当于 19 个等权观测。

虽然用了全部观测,但绝大多数观测的权重极小(第 \(i\) 个权重正比于 \(a^{i-1}\)),有效样本量有限,抽样误差不能充分抵消。

这个例子对量化非常重要:指数加权均值(EWMA)在固定衰减系数下不是一致估计量。这不是缺陷,而是设计目标:EWMA 本来就是为了跟踪时变参数,用不一致换取对最新信息的敏感。

例 3:\(\hat\mu_c=\bar Y+1/n\),有偏但一致。 偏差是 \(1/n\),随样本增大消失。用切比雪夫不等式的推广形式 (18.43):\(\Pr(|W|\ge\delta)\le E(W^2)/\delta^2\)。取 \(W=\bar Y+1/n-\mu_Y\),则 \(E(W^2)=\mathrm{var}(\bar Y)+(1/n)^2=\sigma_Y^2/n+1/n^2\to0\),所以一致。

一般结论(原书习题 18.10):均方误差 \(E[(S_n-\mu)^2]\to0\) 蕴含 \(S_n\xrightarrow{p}\mu\)。有限样本有偏、但偏差和方差都随样本增大消失的估计量仍是一致的。

18.2.3 依分布收敛与中心极限定理

定义。设 \(F_n\) 是 \(S_n\) 的累积分布函数。\(S_n\) 依分布收敛(converge in distribution)到 \(S\),记作 \(S_n\xrightarrow{d}S\),当且仅当

\[\lim_{n\to\infty}F_n(t)=F(t)\tag{18.7}\]
在极限分布 \(F\) 的所有连续点 \(t\) 成立。\(F\) 称为 \(S_n\) 的渐近分布(asymptotic distribution)。

两种收敛的对比:\(S_n\xrightarrow{p}\mu\) 说的是 \(S_n\) 以高概率接近一个常数;\(S_n\xrightarrow{d}S\) 说的是 \(S_n\) 的分布接近 \(S\) 的分布,\(S_n\) 本身仍然是随机的。

白话解释:为什么 CLT 要乘 \(\sqrt n\)?因为 \(\bar Y-\mu_Y\) 本身依概率收敛到 0,它的分布最终「缩成一个点」,没有信息可看。乘以 \(\sqrt n\) 相当于用放大镜按误差缩小的速度同步放大,放大后的分布就稳定成一个钟形。这也是「标准误 \(\propto1/\sqrt n\)」的来源:样本量翻 4 倍,误差减半。 「在所有连续点成立」这个限定是技术性的,读者可忽略;极限是正态分布时,所有点都是连续点。

中心极限定理。若 \(Y_i\) i.i.d.、\(0<\sigma_Y^2<\infty\),则 \((\bar Y-\mu_Y)/\sigma_{\bar Y}\) 渐近服从 \(N(0,1)\)。由于 \(\sigma_{\bar Y}=\sigma_Y/\sqrt n\),等价地

\[\sqrt n(\bar Y-\mu_Y)\xrightarrow{d}N(0,\sigma_Y^2).\tag{18.8}\]

时间序列的推广。i.i.d. 假设不适用于时间序列,需要推广版的 LLN 和 CLT。结论相同,只是成立条件不同(平稳、弱相依,第 16.4 节简述),严格处理见 Hayashi(2000,第 2 章)。在序列相关下,(18.8) 的方差要换成长期方差 \(\sum_{j=-\infty}^{\infty}\gamma_j\),这正是 HAC 标准误要估计的量。

18.2.4 Slutsky 定理与连续映射定理

Slutsky 定理。若 \(a_n\xrightarrow{p}a\)(常数),\(S_n\xrightarrow{d}S\),则

\[a_n+S_n\xrightarrow{d}a+S,\qquad a_nS_n\xrightarrow{d}aS,\qquad S_n/a_n\xrightarrow{d}S/a\ (a\ne0).\tag{18.9}\]

连续映射定理。设 \(g\) 连续,则 (i) \(S_n\xrightarrow{p}a\Rightarrow g(S_n)\xrightarrow{p}g(a)\);(ii) \(S_n\xrightarrow{d}S\Rightarrow g(S_n)\xrightarrow{d}g(S)\)。(18.10)

例:\(s_Y^2\xrightarrow{p}\sigma_Y^2\Rightarrow s_Y\xrightarrow{p}\sigma_Y\)(取 \(g=\sqrt{\cdot}\));\(S_n\xrightarrow{d}Z\sim N(0,1)\Rightarrow S_n^2\xrightarrow{d}Z^2\sim\chi^2_1\)。17b 章推导 DF 统计量分子的极限分布时,用的正是第二个例子。

白话解释:Slutsky 定理说的是,一个「越来越像常数」的东西和一个「分布越来越稳定」的东西做加减乘除,可以把前者直接换成它的极限常数。比如 \(A_n\xrightarrow{p}3\)、\(B_n\xrightarrow{d}N(0,1)\),那么 \(A_nB_n\) 就近似是 \(3\times N(0,1)=N(0,9)\)。 要小心的是:Slutsky 要求其中一方收敛到常数。两个都依分布收敛到随机变量时,一般不能这样拼(它们的联合分布未知)。这也是为什么证明里总要把统计量拆成「一个 CLT 部分」和「若干 LLN 部分」,而不是两个 CLT 部分。

18.2.5 应用:样本均值的 t 统计量

设 \(Y_i\) i.i.d.,\(0<E(Y_i^4)<\infty\),检验 \(H_0:E(Y_i)=\mu_0\)。技巧是分子分母同除以 \(\sigma_Y\):

\[t=\frac{\bar Y-\mu_0}{s_Y/\sqrt n}=\frac{\sqrt n(\bar Y-\mu_0)/\sigma_Y}{s_Y/\sigma_Y}.\tag{18.11}\]

  • 分子:四阶矩有限蕴含二阶矩有限(习题 18.5),所以原假设下由 CLT,\(\sqrt n(\bar Y-\mu_0)/\sigma_Y\xrightarrow{d}N(0,1)\);
  • 分母:\(s_Y^2\xrightarrow{p}\sigma_Y^2\)(附录 3.3,这里要用四阶矩有限),由连续映射定理 \(s_Y/\sigma_Y\xrightarrow{p}1\)(习题 18.4);
  • 由 Slutsky 定理的第三条,\(t\xrightarrow{d}N(0,1)\)。

这是计量中几乎所有渐近证明的模板:把统计量写成「CLT 管的部分」除以「LLN 管的部分」,分别取极限,再用 Slutsky 拼起来。下一节 OLS 的 t 统计量、第 19a 章的 F 统计量、17b 章的 DF 统计量(只是那里分子分母的极限都不寻常),都是同一套路。


18.3 OLS 估计量与 t 统计量的渐近分布

18.3.1 一致性与渐近正态

在前三条假设下(Key Concept 4.4),

\[\sqrt n(\hat\beta_1-\beta_1)\xrightarrow{d}N\left(0,\frac{\mathrm{var}(v_i)}{[\mathrm{var}(X_i)]^2}\right),\quad v_i=(X_i-\mu_X)u_i.\tag{18.12}\]

证明思路(附录 4.3,原书指出那里省略了细节,补全留作习题 18.3):

\[\sqrt n(\hat\beta_1-\beta_1)=\frac{\frac1{\sqrt n}\sum_{i=1}^n(X_i-\bar X)u_i}{\frac1n\sum_{i=1}^n(X_i-\bar X)^2}.\]
分母 \(\xrightarrow{p}\mathrm{var}(X_i)\)。分子中把 \(\bar X\) 换成 \(\mu_X\):
\[\frac1{\sqrt n}\sum(X_i-\bar X)u_i=\frac1{\sqrt n}\sum v_i-(\bar X-\mu_X)\cdot\frac1{\sqrt n}\sum u_i.\]
第一项由 CLT 收敛到 \(N(0,\mathrm{var}(v_i))\);第二项是 \((\bar X-\mu_X)\xrightarrow{p}0\) 乘以一个依分布收敛的量,由 Slutsky 定理 \(\xrightarrow{p}0\)。再用一次 Slutsky 即得 (18.12)。由 (18.12) 可以推出 \(\hat\beta_1\) 一致(习题 18.4:渐近正态 ⇒ 一致)。

推导拆解:第一个等式从哪来? 第一步,由 (18.2),分子 \(\sum(X_i-\bar X)(Y_i-\bar Y)\) 中代入 \(Y_i=\beta_0+\beta_1X_i+u_i\)、\(\bar Y=\beta_0+\beta_1\bar X+\bar u\),得 \(Y_i-\bar Y=\beta_1(X_i-\bar X)+(u_i-\bar u)\)。 第二步,于是分子 \(=\beta_1\sum(X_i-\bar X)^2+\sum(X_i-\bar X)(u_i-\bar u)\);又因 \(\sum(X_i-\bar X)=0\),\(\bar u\) 那项消失,分子 \(=\beta_1\sum(X_i-\bar X)^2+\sum(X_i-\bar X)u_i\)。 第三步,除以分母得 \(\hat\beta_1=\beta_1+\frac{\sum(X_i-\bar X)u_i}{\sum(X_i-\bar X)^2}\),也就是 (18.19)。 第四步,移项后两边乘 \(\sqrt n\),再把分子分母分别乘 \(\frac1n\):分子变成 \(\frac{1}{\sqrt n}\sum(\cdot)\)(CLT 管),分母变成 \(\frac1n\sum(\cdot)\)(LLN 管)。这正是 18.2.5 的模板。 方差 \(\mathrm{var}(v_i)/[\mathrm{var}(X_i)]^2\) 的形状就是「三明治」:中间的「肉」\(\mathrm{var}(v_i)\) 允许 \(u\) 的方差随 \(X\) 变化,两边的「面包」是 \(X\) 的方差。同方差时 \(\mathrm{var}(v_i)=\sigma_u^2\mathrm{var}(X_i)\),化简为熟悉的 \(\sigma_u^2/\mathrm{var}(X_i)\)。

18.3.2 异方差稳健标准误的一致性

要证明

\[\frac{\hat\sigma^2_{\hat\beta_1}}{\sigma^2_{\hat\beta_1}}\xrightarrow{p}1,\tag{18.13}\]
其中 \(\sigma^2_{\hat\beta_1}=\mathrm{var}(v_i)/\{n[\mathrm{var}(X_i)]^2\}\),\(\hat\sigma^2_{\hat\beta_1}\) 是异方差稳健标准误的平方(第 5 章式 5.4):
\[\hat\sigma^2_{\hat\beta_1}=\frac1n\cdot\frac{\frac1{n-2}\sum_{i=1}^n(X_i-\bar X)^2\hat u_i^2}{\left[\frac1n\sum_{i=1}^n(X_i-\bar X)^2\right]^2}.\tag{18.14}\]

把比值写成三项:

\[\frac{\hat\sigma^2_{\hat\beta_1}}{\sigma^2_{\hat\beta_1}}=\left[\frac n{n-2}\right]\cdot\left[\frac{\frac1n\sum(X_i-\bar X)^2\hat u_i^2}{\mathrm{var}(v_i)}\right]\Big/\left[\frac{\frac1n\sum(X_i-\bar X)^2}{\mathrm{var}(X_i)}\right]^2.\tag{18.15}\]
第一项 \(\to1\);第三项由样本方差的一致性 \(\to1\)。只需证明中间项的分子 \(\frac1n\sum(X_i-\bar X)^2\hat u_i^2\xrightarrow{p}\mathrm{var}(v_i)\)。为简化,暂设 \(X_i,u_i\) 有八阶矩,分两步:

  1. \(\frac1n\sum v_i^2\xrightarrow{p}\mathrm{var}(v_i)\)。\(v_i^2\) i.i.d.,均值为 \(E(v_i^2)=\mathrm{var}(v_i)\)(因 \(E v_i=0\))。要用 LLN 需 \(\mathrm{var}(v_i^2)<\infty\)。用 Cauchy–Schwarz:
    \[\mathrm{var}(v_i^2)\le E(v_i^4)=E[(X_i-\mu_X)^4u_i^4]\le\{E[(X_i-\mu_X)^8]E(u_i^8)\}^{1/2}<\infty.\]
  2. 残差替换误差、样本均值替换总体均值不影响极限:
    \[\frac1n\sum\left[(X_i-\bar X)^2\hat u_i^2-(X_i-\mu_X)^2u_i^2\right]\xrightarrow{p}0.\tag{18.16}\]
    代入 \(\hat u_i=u_i-(\hat\beta_0-\beta_0)-(\hat\beta_1-\beta_1)X_i\) 展开,每一项都是「一致趋零的估计误差」乘以「有界的样本矩」,反复使用 Cauchy–Schwarz 和 \(\hat\beta\) 的一致性即可(习题 18.9)。

八阶矩并非必要,四阶矩下结论也成立,只是证明超出本书(Hayashi 2000,2.5 节)。

白话解释:这一节的目标只有一句话:稳健标准误这个「估计出来的方差」和「真正的方差」之比趋于 1。做法是把比值拆成三块,前后两块显然趋于 1,难点全在中间:用残差 \(\hat u_i\) 代替看不见的误差 \(u_i\)、用 \(\bar X\) 代替 \(\mu_X\),会不会造成系统性偏差?答案是不会,因为 \(\hat\beta\) 一致,\(\hat u_i\) 与 \(u_i\) 的差距随样本增大而消失。 Cauchy–Schwarz 在这里的作用是「拆开乘积的期望」:\(E(AB)\) 不好算,但 \(\sqrt{E(A^2)E(B^2)}\) 只需各自的矩有限。要 \(E(X^4u^4)\) 有限,用它就只需 \(X\) 和 \(u\) 各自的八阶矩有限,这就是「暂设八阶矩」的由来。

18.3.3 稳健 t 统计量的渐近正态

\[t=\frac{\hat\beta_1-\beta_{1,0}}{\hat\sigma_{\hat\beta_1}}=\frac{\sqrt n(\hat\beta_1-\beta_{1,0})}{\sqrt{n\sigma^2_{\hat\beta_1}}}\Big/\sqrt{\frac{\hat\sigma^2_{\hat\beta_1}}{\sigma^2_{\hat\beta_1}}}.\tag{18.17}\]

原假设下第一项由 (18.12) \(\xrightarrow{d}N(0,1)\),第二项由 (18.13) \(\xrightarrow{p}1\),Slutsky ⇒ \(t\xrightarrow{d}N(0,1)\)。又是同一个模板。

原书复习题 18.1:若误差实际上同方差,用稳健标准误构造的置信区间仍然渐近有效(稳健标准误在同方差下也一致);反之,若误差异方差却用仅同方差标准误,区间不是渐近有效的。这就是「默认用稳健标准误」的理由。


18.4 误差正态时的精确抽样分布

小样本下 OLS 与 t 统计量的分布依赖回归元和误差的分布,一般很复杂。但若五条假设全部成立,则条件于 \(X\) 时 \(\hat\beta_1\) 精确正态,仅同方差 t 统计量精确服从 Student t。

18.4.1 \(\hat\beta_1\) 的精确分布

若误差 i.i.d. 正态且独立于回归元,条件于 \(X_1,\dots,X_n\),有 \(\hat\beta_1\sim N(\beta_1,\sigma^2_{\hat\beta_1|X})\),其中

\[\sigma^2_{\hat\beta_1|X}=\frac{\sigma_u^2}{\sum_{i=1}^n(X_i-\bar X)^2}.\tag{18.18}\]

三步证明:

(i) 正态性。

\[\hat\beta_1=\beta_1+\frac{\frac1n\sum(X_i-\bar X)u_i}{\frac1n\sum(X_i-\bar X)^2}.\tag{18.19}\]
条件于 \(X\),这是 \(u_i\) 的加权和,权重 \((X_i-\bar X)/\sum(X_j-\bar X)^2\) 是常数;\(u_i\) i.i.d. 正态且独立于 \(X\),正态变量的线性组合仍正态。

(ii) 条件无偏。\(E(u_i\mid X_1,\dots,X_n)=E(u_i\mid X_i)=0\)(第一个等号用 i.i.d.,习题 18.7),所以

\[E(\hat\beta_1-\beta_1\mid X)=\frac{\sum(X_i-\bar X)E(u_i\mid X_1,\dots,X_n)}{\sum(X_i-\bar X)^2}=0.\tag{18.20}\]

(iii) 条件方差。误差条件独立、方差 \(\sigma_u^2\):

\[\mathrm{var}(\hat\beta_1\mid X)=\frac{\sum(X_i-\bar X)^2\,\mathrm{var}(u_i\mid X)}{[\sum(X_i-\bar X)^2]^2}=\frac{\sigma_u^2\sum(X_i-\bar X)^2}{[\sum(X_i-\bar X)^2]^2},\tag{18.21}\]
约去即得 (18.18)。

18.4.2 仅同方差 t 统计量的精确分布

\[\tilde t=\frac{\hat\beta_1-\beta_{1,0}}{\widetilde{SE}(\hat\beta_1)}=\frac{\hat\beta_1-\beta_{1,0}}{\sqrt{s_{\hat u}^2/\sum(X_i-\bar X)^2}}=\frac{(\hat\beta_1-\beta_{1,0})/\sigma_{\hat\beta_1|X}}{\sqrt{W/(n-2)}},\tag{18.22–18.23}\]

其中 \(s_{\hat u}^2=\frac1{n-2}\sum\hat u_i^2\),\(W=\sum\hat u_i^2/\sigma_u^2\)。

  • 原假设下分子 \(\sim N(0,1)\);
  • 19.4 节将证明 \(W\sim\chi^2_{n-2}\),且与分子独立;
  • 按 Student t 的定义(附录 18.1:独立的标准正态除以「卡方除以自由度」的平方根),\(\tilde t\sim t_{n-2}\)。

自由度调整的双重作用。除以 \(n-2\) 而不是 \(n\):

  1. 因为 \(E(W)=n-2\),所以 \(E\left[\frac1{n-2}\sum\hat u_i^2\right]=\sigma_u^2\),\(s_{\hat u}^2\) 无偏;
  2. 分母恰好写成 \(\sqrt{W/m}\) 的标准形式,误差正态时 t 统计量精确服从 Student t。

为什么是 \(n-2\)?估计两个系数,残差满足两个线性约束(\(\sum\hat u_i=0\),\(\sum X_i\hat u_i=0\)),只剩 \(n-2\) 个自由度。第 19a 章会用投影矩阵 \(\mathbf M_X\) 的秩把这一点说得很精确。

金融直觉:自由度的直觉和「样本方差除以 \(n-1\)」完全一样。用样本均值代替总体均值时,残差被迫加总为 0,等于「用掉」了一个观测的信息,所以除以 \(n-1\)。回归里估计了截距和斜率两个参数,残差被两个方程约束住,用掉两个观测,除以 \(n-2\)。 实务上何时有区别?\(n=24\)(两年月度数据)时,双侧 5% 临界值 \(t_{22}=2.07\),正态 1.96,差约 6%;\(n=250\) 时两者几乎一样。小样本回测里用 1.96 会略微高估显著性,示例一中正态数据 \(n=24\) 覆盖率只有 0.937 正是这个原因。


18.5 加权最小二乘

前四条假设下,OLS 是条件线性无偏估计量中最有效的(BLUE)。主要局限在于要求同方差。异方差时 OLS 不再是 BLUE,加权最小二乘(weighted least squares,WLS)可以更有效,但需要对条件方差 \(\mathrm{var}(u_i\mid X_i)\) 了解很多。分两种情形:

  1. 条件方差已知到一个比例常数:WLS 是 BLUE;
  2. 条件方差的函数形式已知但含未知参数:先估计参数,在附加条件下 WLS 的渐近分布与参数已知时相同,即渐近 BLUE。

18.5.1 已知异方差形式的 WLS

设

\[\mathrm{var}(u_i\mid X_i)=\lambda h(X_i),\tag{18.24}\]
\(\lambda\) 是常数,\(h\) 是已知函数。把模型两边除以 \(\sqrt{h(X_i)}\):
\[\tilde Y_i=\beta_0\tilde X_{0i}+\beta_1\tilde X_{1i}+\tilde u_i,\tag{18.25}\]
其中 \(\tilde Y_i=Y_i/\sqrt{h(X_i)}\),\(\tilde X_{0i}=1/\sqrt{h(X_i)}\),\(\tilde X_{1i}=X_i/\sqrt{h(X_i)}\),\(\tilde u_i=u_i/\sqrt{h(X_i)}\)。WLS 估计量就是 \(\tilde Y\) 对 \(\tilde X_0,\tilde X_1\) 的 OLS(无截距;\(\tilde X_0\) 的系数取代了原来的截距)。

为什么是 BLUE:加权后误差同方差,

\[\mathrm{var}(\tilde u_i\mid X_i)=\frac{\mathrm{var}(u_i\mid X_i)}{h(X_i)}=\frac{\lambda h(X_i)}{h(X_i)}=\lambda.\tag{18.26}\]
条件均值仍为零(\(E(\tilde u_i\mid X_i)=E(u_i\mid X_i)/\sqrt{h(X_i)}=0\)),于是前四条假设对 (18.25) 成立。严格说,附录 5.2 的高斯–马尔可夫定理是针对含截距的 (18.1) 证明的,不直接适用于截距被 \(\beta_0\tilde X_{0i}\) 取代的 (18.25);但第 19.5 节的多元版本适用,故 WLS 是 BLUE。

等价地,WLS 最小化加权残差平方和 \(\sum_i\frac{1}{h(X_i)}(Y_i-b_0-b_1X_i)^2\):方差大的观测信息少,权重小。原书复习题 18.3 的例子:\(Y=1+2X+u\),\(X\in[0,20]\),\(X\le10\) 时误差方差为 1,\(X>10\) 时为 16。WLS 给 \(X\le10\) 的观测 16 倍的权重。复习题 18.4 进一步问:两段分别做 OLS 再平均,是否比 WLS 有效?答案是否:WLS 用一个模型、按信息量最优地合并了两段数据。

实践中 \(h\) 通常未知,这种 WLS 不可计算,称为不可行 WLS(infeasible WLS)。

金融直觉:WLS 就是「信息量加权」。把每个观测想成一位分析师的盈利预测:误差方差小的分析师更可靠,合并时应该多听他的,最优权重与方差成反比,这和最小方差组合按 \(1/\sigma^2\) 配权是同一个道理。复习题的例子里,前半段误差方差 1、后半段 16,所以前半段每个观测的权重是后半段的 16 倍(按标准差算是 4 倍,因为 (18.25) 是把数据本身除以 \(\sqrt h\),平方后进入残差平方和就是 \(1/h\))。 区分两种说法以免混淆:「数据除以 \(\sqrt{h}\)」和「残差平方乘以 \(1/h\)」是同一件事;statsmodels 的 weights 参数取的是后者 \(1/h\)。

18.5.2 异方差函数形式已知时的可行 WLS

例 1:方差是 \(X\) 的二次函数。

\[\mathrm{var}(u_i\mid X_i)=\theta_0+\theta_1X_i^2,\quad\theta_0>0,\ \theta_1\ge0.\tag{18.27}\]
先估计 \(\hat\theta_0,\hat\theta_1\)。一种一致的方法是:把 OLS 残差平方 \(\hat u_i^2\) 对 \(X_i^2\) 回归(因为 \(E(u_i^2\mid X_i)=\theta_0+\theta_1X_i^2\))。然后构造 \(\widehat{\mathrm{var}}(u_i\mid X_i)=\hat\theta_0+\hat\theta_1X_i^2\),以其平方根的倒数加权做 OLS。若 \(\hat\theta\) 一致,在假设 1–3 及因估计 \(\theta\) 所需的额外矩条件下,WLS 的渐近分布与 \(\theta\) 已知时相同,即渐近 BLUE。这叫可行 WLS(feasible WLS)或估计 WLS(estimated WLS)。

例 2:方差依赖第三个变量。 总体回归 \(E(Y_i\mid X_i,W_i)=\beta_0+\beta_1X_i\),条件方差 \(\mathrm{var}(u_i\mid X_i,W_i)=\lambda h(W_i)\)。情境:研究州失业率与州政策变量 \(X_i\) 的关系。观测到的失业率 \(Y_i\) 是对真实失业率 \(Y_i^*\) 的抽样调查估计,调查样本量 \(W_i\) 不影响真实失业率:

\[Y_i^*=\beta_0+\beta_1X_i+u_i^*,\tag{18.28}\]
\[Y_i=Y_i^*+v_i.\tag{18.29}\]
若 \(u_i^*\) 同方差(方差 \(\sigma_{u^*}^2\)),调查误差方差与样本量成反比 \(\mathrm{var}(v_i\mid X_i,W_i)=a/W_i\),且 \(v_i\) 与 \(u_i^*\) 不相关,则
\[Y_i=\beta_0+\beta_1X_i+u_i,\qquad\mathrm{var}(u_i\mid X_i,W_i)=\theta_0+\theta_1(1/W_i),\tag{18.30–18.31}\]
其中 \(u_i=u_i^*+v_i\),\(\theta_0=\sigma_{u^*}^2\),\(\theta_1=a\),\(E(u_i\mid X_i,W_i)=0\)。用 OLS 残差平方对 \(1/W_i\) 回归估计 \(\theta\),再做可行 WLS。

关键前提:必须有 \(E(u_i\mid X_i,W_i)=0\)。否则加权后的误差条件均值不为零,WLS 不一致。如果 \(W_i\) 实际上决定 \(Y_i\),就应该做同时含 \(X_i,W_i\) 的多元回归,而不是把 \(W_i\) 只用在权重里。

可行 WLS 的一般五步:

  1. \(Y\) 对 \(X\) 做 OLS,得残差 \(\hat u_i\);
  2. 估计条件方差函数(如 (18.27) 则 \(\hat u_i^2\) 对 \(X_i^2\) 回归);
  3. 用估计的函数计算条件方差的预测值 \(\widehat{\mathrm{var}}(u_i\mid X_i)\);
  4. 用其平方根的倒数给因变量和回归元(含截距)加权;
  5. 对加权回归做 OLS,得 WLS 估计。

方差依赖 \(X\) 以外的变量时相应修改第 2、3 步。软件通常有加权回归命令,自动完成第 4、5 步。实务中第 2 步常用 \(\ln\hat u_i^2\) 对变量回归再取指数,以保证预测的方差为正,本章示例就用了这种变体。

18.5.3 稳健标准误还是 WLS?

WLS OLS + 异方差稳健标准误
优点 (至少渐近)比 OLS 更有效 不需要知道条件方差形式,推断渐近有效;软件一个选项
缺点 需要知道条件方差的函数形式并估计参数;形式很少已知;形式设错时,软件给出的 WLS 标准误无效 方差比(基于真实方差函数的)WLS 大

多回归元时更难知道条件方差的形式。原书作者的观点是:尽管 WLS 在理论上有吸引力,多数应用中稳健标准误是处理潜在异方差更好的方法。

还有一个更深的问题(原书脚注与习题 18.13)。本章一直假设单一的处理效应 \(\beta_1\)。若处理效应异质,即每个个体有自己的 \(\beta_{1i}\),那么即使 \(X\) 随机分配、个体随机抽取,OLS 也一致估计平均因果效应 \(E(\beta_{1i})\),但 WLS 不一定:WLS 估计的是按权重加权的平均效应。权重不同,估计的就是不同的总体量。

白话解释:设想一个因子在大盘股上的溢价是 0.2%,在小盘股上是 0.8%,并不存在「唯一的」因子收益。OLS 大致给出全体股票的简单平均;按市值平方根加权的 WLS 给大盘股更大权重,结果靠近 0.2%。两者都不「错」,只是回答的问题不同:前者问「随便挑一只股票平均能赚多少」,后者更接近「按资金容量能赚多少」。选权重之前,先想清楚你要估的是哪个数。

折中的做法是两者结合:用 WLS 获得效率,同时报告 WLS 的稳健标准误。这样即使权重函数设错,推断依然有效,只是效率增益打折扣。


附录 18.1 正态及相关分布、连续随机变量的矩

连续随机变量。概率密度 \(f_Y(y)\ge0\),\(\Pr(a\le Y\le b)=\int_a^bf_Y(y)dy\)(18.32),\(\int_{-\infty}^\infty f_Y(y)dy=1\)。均值 \(E(Y)=\int yf_Y(y)dy\)(18.33),方差 \(\mathrm{var}(Y)=\int(y-\mu_Y)^2f_Y(y)dy\)(18.34),\(r\) 阶矩 \(E(Y^r)=\int y^rf_Y(y)dy\)(18.35),\(r\) 阶中心矩 \(E(Y-\mu_Y)^r\)。

正态分布。

\[f_Y(y)=\frac1{\sigma\sqrt{2\pi}}\exp\left[-\frac12\left(\frac{y-\mu}{\sigma}\right)^2\right].\tag{18.36}\]
对称,三阶及以上奇数阶中心矩为 0;四阶中心矩 \(3\sigma^4\)(峰度 3)。一般地,偶数阶中心矩
\[E(Y-\mu)^k=\frac{k!}{2^{k/2}(k/2)!}\sigma^k.\tag{18.37}\]
标准正态的密度记作 \(\phi\),分布函数记作 \(\Phi\)。

二元正态。

\[g_{X,Y}(x,y)=\frac1{2\pi\sigma_X\sigma_Y\sqrt{1-\rho_{XY}^2}}\exp\left\{-\frac{1}{2(1-\rho_{XY}^2)}\left[\left(\tfrac{x-\mu_X}{\sigma_X}\right)^2-2\rho_{XY}\tfrac{x-\mu_X}{\sigma_X}\tfrac{y-\mu_Y}{\sigma_Y}+\left(\tfrac{y-\mu_Y}{\sigma_Y}\right)^2\right]\right\}.\tag{18.38}\]
\(\rho_{XY}=0\) 时 \(g=f_Xf_Y\):联合正态且不相关 ⇒ 独立。这是正态分布特有的性质,一般分布不成立(对金融收益尤其要小心:收益与波动可以不相关但显然不独立)。

条件正态。\(Y\mid X\sim N(\mu_{Y|X},\sigma^2_{Y|X})\),

\[\mu_{Y|X}=\mu_Y+\frac{\sigma_{XY}}{\sigma_X^2}(X-\mu_X),\qquad\sigma^2_{Y|X}=(1-\rho_{XY}^2)\sigma_Y^2.\]
条件均值是 \(x\) 的线性函数(所以回归函数恰好是线性的),条件方差不依赖 \(x\)(同方差)。这说明在联合正态下,线性回归模型的假设 1、4、5 都自动成立(习题 18.11)。

卡方分布。\(Z_1,\dots,Z_n\) i.i.d. 标准正态,\(W=\sum_{i=1}^nZ_i^2\sim\chi^2_n\)(18.39),\(E(W)=n\),\(\mathrm{var}(W)=2n\)(因 \(E(Z^2)=1\),\(E(Z^4)=3\))。

Student t 分布。\(Z\) 标准正态,\(W\sim\chi^2_m\),二者独立,则 \(t=Z/\sqrt{W/m}\sim t_m\)(18.40)。\(t_\infty\) 就是标准正态。

F 分布。\(W_1\sim\chi^2_{n_1}\),\(W_2\sim\chi^2_{n_2}\),独立,则 \(F=\frac{W_1/n_1}{W_2/n_2}\sim F_{n_1,n_2}\)(18.41)。分母自由度很大时 \(W_2/n_2\to1\),所以 \(F_{n_1,\infty}=\chi^2_{n_1}/n_1\)(习题 18.15)。这就是大样本 F 检验查 \(F_{q,\infty}\) 表的原因。

附录 18.2 两个不等式

切比雪夫不等式。

\[\Pr(|V-\mu_V|\ge\delta)\le\frac{\mathrm{var}(V)}{\delta^2}.\tag{18.42}\]
证明:令 \(W=V-\mu_V\),\(f\) 为其密度。
\[E(W^2)=\int_{-\infty}^{-\delta}w^2f(w)dw+\int_{-\delta}^{\delta}w^2f(w)dw+\int_{\delta}^{\infty}w^2f(w)dw\ge\int_{|w|\ge\delta}w^2f(w)dw\ge\delta^2\Pr(|W|\ge\delta).\tag{18.43}\]
第一个不等号丢掉了非负的中间项;第二个用了积分区间上 \(w^2\ge\delta^2\)。离散情形把积分换成求和。注意 (18.43) 本身给出更一般的结论 \(\Pr(|W|\ge\delta)\le E(W^2)/\delta^2\),\(W\) 不必均值为零,18.2.2 节的例 3 用的就是它。

Cauchy–Schwarz 不等式。

\[|E(XY)|\le\sqrt{E(X^2)E(Y^2)}.\tag{18.44}\]
它是相关系数不等式 \(|\rho_{XY}|\le1\) 允许非零均值的推广。证明:令 \(W=Y+bX\),则 \(0\le E(W^2)=E(Y^2)+2bE(XY)+b^2E(X^2)\)。取 \(b=-E(XY)/E(X^2)\),得 \(E(Y^2)-[E(XY)]^2/E(X^2)\ge0\)。


量化实战

1. 本章内容在量化中的用途

回测 t 值的可信度。 检验一个策略或因子的平均收益是否为零,就是 (18.11) 的 t 检验。它的渐近正态性要求矩有限,收敛速度取决于分布的形状。本章示例会显示:对称的厚尾(如 t(3))影响不大,但强偏斜的收益(卖期权、尾部对冲、彩票型策略)在几十个月的样本下,t 检验的覆盖率会严重不足。这正是「理论帮你识别工具何时失效」。

EWMA 与一致性。 风险模型中的指数加权协方差、动量信号中的指数加权均值,都是 18.2.2 节例 2 的几何加权估计量。固定半衰期下它们不收敛到真值,其方差下限是 \(\sigma^2(1-a)/(1+a)\)。选择半衰期就是在跟踪速度(偏差)与估计噪声(方差)之间权衡。

横截面回归中的 WLS。 Barra 式风险模型和 Fama–MacBeth 横截面回归常按市值的平方根加权,理由是「小盘股特质方差更大」,这正是 WLS。本章提醒两件事:(1) 权重函数设错,软件默认标准误就失效,应报告稳健标准误;(2) 异质系数下,加权回归估计的是加权平均的因子收益,市值加权与等权的因子收益含义不同,前者偏向大盘股的定价。

对数正态均值修正。 原书习题 18.12:若 \(u\sim N(0,\sigma_u^2)\),则 \(E(e^u)=e^{\sigma_u^2/2}\)。用对数收益模型预测简单收益或价格水平时,必须加上 \(\frac12\sigma^2\) 的修正,否则系统性低估。

切比雪夫界。 不依赖分布假设的尾部概率上界,可用于保守的风险界估计:任意分布下,偏离均值 \(k\) 个标准差以上的概率不超过 \(1/k^2\)。

2. 示例一:一致性与 t 检验的有限样本覆盖率

import numpy as np
rng = np.random.default_rng(3)
mu, sig, nsim = 1.0, 2.0, 5000

# (1) 三个估计量:Y_1(无偏不一致)、几何加权均值(无偏不一致)、Ybar+1/n(有偏一致)
a = 0.9
for n in [10, 100, 1000]:
    Y = mu + sig * rng.standard_normal((nsim, n))
    wts = a ** np.arange(n); wts /= wts.sum()
    est = {"Y1": Y[:, 0], "geo": Y @ wts, "Ybar+1/n": Y.mean(1) + 1 / n}
    print(f"n={n:5d} " + "  ".join(f"{k}: P(|err|>0.2)={np.mean(abs(v-mu)>0.2):.3f}"
                                   for k, v in est.items()))
print("几何加权均值的极限标准差 sigma*sqrt((1-a)/(1+a)) =", round(sig*np.sqrt((1-a)/(1+a)), 3))

# (2) 均值 t 检验的覆盖率:正态 vs 厚尾(t 分布自由度 3)vs 偏斜
def coverage(draw, n, nsim=20000):
    Y = draw((nsim, n))
    t = Y.mean(1) / (Y.std(1, ddof=1) / np.sqrt(n))   # 真均值为 0
    return np.mean(np.abs(t) <= 1.96)
for n in [24, 60, 250]:
    c_n = coverage(lambda s: rng.standard_normal(s), n)
    c_t3 = coverage(lambda s: rng.standard_t(3, s), n)
    # 偏斜厚尾:中心化的对数正态(类似"偶发大赚"的策略收益)
    c_ln = coverage(lambda s: np.exp(1.5 * rng.standard_normal(s)) - np.exp(1.125), n)
    print(f"n={n:4d}  95% 区间覆盖率: 正态 {c_n:.3f} | t(3) {c_t3:.3f} | 偏斜对数正态 {c_ln:.3f}")

输出:

n=   10 Y1: P(|err|>0.2)=0.922  geo: P(|err|>0.2)=0.760  Ybar+1/n: P(|err|>0.2)=0.752
n=  100 Y1: P(|err|>0.2)=0.914  geo: P(|err|>0.2)=0.661  Ybar+1/n: P(|err|>0.2)=0.309
n= 1000 Y1: P(|err|>0.2)=0.926  geo: P(|err|>0.2)=0.662  Ybar+1/n: P(|err|>0.2)=0.001
几何加权均值的极限标准差 sigma*sqrt((1-a)/(1+a)) = 0.459
n=  24  95% 区间覆盖率: 正态 0.937 | t(3) 0.945 | 偏斜对数正态 0.760
n=  60  95% 区间覆盖率: 正态 0.944 | t(3) 0.948 | 偏斜对数正态 0.821
n= 250  95% 区间覆盖率: 正态 0.950 | t(3) 0.954 | 偏斜对数正态 0.885

第一部分:\(Y_1\) 的误差概率始终在 0.92 左右,不随 \(n\) 变化;几何加权均值在 \(n=100\) 后停在 0.66,因为它的标准差停在 0.459 不再下降;\(\bar Y+1/n\) 虽然有偏,误差概率却迅速趋于 0。无偏不一定一致,一致不一定无偏。

第二部分:正态数据在 \(n=24\) 时覆盖率 0.937(用 1.96 而不是 \(t_{23}\) 临界值造成的轻微不足);对称厚尾的 t(3) 几乎没有影响;而强偏斜的对数正态,24 个月的样本覆盖率只有 0.76,250 个月仍只有 0.885。对偏斜策略,t 值的正态近似需要很大的样本才可靠,应辅以自助法或更严格的门槛。

3. 示例二:横截面回归中的 OLS、WLS 与设错的权重

模拟 1000 只股票的横截面:特质方差与 \(1/\sqrt{\text{市值}}\) 成正比(小盘股噪声大)。比较 OLS(HC1 标准误)、权重正确的 WLS、可行 WLS(\(\ln\hat u^2\) 对 \(\ln\) 市值回归估计方差函数)以及方向设反的 WLS(用软件默认标准误)。

import numpy as np
import statsmodels.api as sm

rng = np.random.default_rng(5)
n, nsim, beta1 = 1000, 2000, 0.5
out = {k: [] for k in ["OLS", "WLS_true", "FWLS", "WLS_wrong"]}
cover = {k: 0 for k in out}
for _ in range(nsim):
    # 截面:因子暴露 X,市值 cap(对数正态);特质方差 ∝ 1/sqrt(cap)(小盘股噪声大)
    X = rng.standard_normal(n)
    cap = np.exp(rng.normal(0, 1.5, n))
    h = 1 / np.sqrt(cap)
    u = np.sqrt(h) * rng.standard_normal(n)
    Y = 0.1 + beta1 * X + u
    Xc = sm.add_constant(X)
    fits = {
        "OLS": sm.OLS(Y, Xc).fit(cov_type="HC1"),
        "WLS_true": sm.WLS(Y, Xc, weights=1 / h).fit(),           # 权重 = 1/方差
    }
    # 可行 WLS:用 log(u_hat^2) 对 log(cap) 回归估计方差函数(保证预测方差为正)
    uh = fits["OLS"].resid
    g = sm.OLS(np.log(uh ** 2), sm.add_constant(np.log(cap))).fit()
    hhat = np.exp(g.fittedvalues)
    fits["FWLS"] = sm.WLS(Y, Xc, weights=1 / hhat).fit()
    # 设错的权重:以为方差 ∝ cap(方向反了),并使用软件默认(非稳健)标准误
    fits["WLS_wrong"] = sm.WLS(Y, Xc, weights=1 / cap).fit()
    for k, f in fits.items():
        out[k].append(f.params[1])
        cover[k] += abs(f.params[1] - beta1) <= 1.96 * f.bse[1]
for k in out:
    print(f"{k:10s} 均值={np.mean(out[k]):.4f}  抽样标准差={np.std(out[k]):.4f}  95%区间覆盖率={cover[k]/nsim:.3f}")

输出:

OLS        均值=0.5000  抽样标准差=0.0362  95%区间覆盖率=0.952
WLS_true   均值=0.5009  抽样标准差=0.0273  95%区间覆盖率=0.951
FWLS       均值=0.5008  抽样标准差=0.0274  95%区间覆盖率=0.950
WLS_wrong  均值=0.4924  抽样标准差=0.2562  95%区间覆盖率=0.427

(statsmodels 的 weights 参数是方差的倒数,即 (18.25) 中 \(1/h(X_i)\),等价于对每个观测乘以 \(1/\sqrt{h}\)。)

结论与原书一致:

  • 四个估计量都无偏(这里 \(X\) 与市值独立,\(E(u\mid X,\text{cap})=0\));
  • 正确的 WLS 把抽样标准差从 0.036 降到 0.027,效率提高约 25%;可行 WLS 几乎达到同样效果;
  • OLS + HC1 效率较低,但覆盖率 0.952,推断完全正确;
  • 权重方向设反时,估计的标准差暴涨到 0.256(比 OLS 差 7 倍),而软件默认标准误给出的 95% 区间只覆盖了 43%。这就是「形式设错时 WLS 软件标准误无效」的后果。

本章小结

本章为单回归元 OLS 提供了理论基础。前三条最小二乘假设(条件均值零、i.i.d.、有限四阶矩)就足以保证 OLS 一致、渐近正态,并且异方差稳健标准误一致,因此稳健 t 统计量渐近标准正态;加上同方差得到高斯–马尔可夫效率;再加正态误差,\(\hat\beta_1\) 条件精确正态,仅同方差 t 统计量精确服从 \(t_{n-2}\)。渐近工具链是:切比雪夫不等式推出大数定律,中心极限定理给出分子的极限,Slutsky 定理与连续映射定理把它们拼起来。无偏与一致是不同的性质,几何加权均值无偏却不一致,\(\bar Y+1/n\) 有偏却一致。异方差时 WLS 以条件方差倒数的平方根加权做 OLS,渐近更有效,但需要正确的方差函数;实践中 OLS 加稳健标准误通常更稳妥,异质效应下 WLS 估计的是加权平均效应。

概念 公式 / 要点
依概率收敛 \(\Pr(\lvert S_n-\mu\rvert\ge\delta)\to0\)
依分布收敛 \(F_n(t)\to F(t)\)(连续点)
切比雪夫 \(\Pr(\lvert V-\mu\rvert\ge\delta)\le\mathrm{var}(V)/\delta^2\)
Slutsky \(a_n\xrightarrow{p}a\),\(S_n\xrightarrow{d}S\) ⇒ \(a_nS_n\xrightarrow{d}aS\) 等
OLS 渐近分布 \(\sqrt n(\hat\beta_1-\beta_1)\xrightarrow{d}N(0,\mathrm{var}(v_i)/[\mathrm{var}(X_i)]^2)\),\(v_i=(X_i-\mu_X)u_i\)
精确分布 \(\hat\beta_1\mid X\sim N(\beta_1,\sigma_u^2/\sum(X_i-\bar X)^2)\);\(\tilde t\sim t_{n-2}\)
自由度 \(n-2\):使 \(s_{\hat u}^2\) 无偏,且使 t 精确服从 Student t
WLS 除以 \(\sqrt{h(X_i)}\) 后 OLS;\(\mathrm{var}(\tilde u_i\mid X_i)=\lambda\)
可行 WLS OLS → \(\hat u_i^2\) 建模 → 预测方差 → 加权 → OLS
分布关系 \(t_\infty=N(0,1)\),\(F_{m,\infty}=\chi^2_m/m\)

练习

基础

  1. (原书复习题 18.2)\(A_n\xrightarrow{p}3\),\(B_n\xrightarrow{d}N(0,1)\)。求 \(A_nB_n\) 的渐近分布,并近似计算 \(\Pr(A_nB_n<2)\)。 答案要点:\(N(0,9)\);\(\Phi(2/3)\approx0.75\)。
  2. (原书复习题 18.1)误差同方差时用稳健标准误构造的置信区间是否渐近有效?误差异方差时用仅同方差标准误呢? 答案要点:是;否。
  3. 证明几何加权均值 \(\hat\mu_b\) 的方差公式,并说明为什么 \(a\) 越接近 1,极限方差越小。 提示:\(\sum a^{2(i-1)}=\frac{1-a^{2n}}{1-a^2}\);\(a\to1\) 时权重趋于均匀。
  4. (原书习题 18.12)若 \(u\sim N(0,\sigma_u^2)\),证明 \(E(e^u)=e^{\sigma_u^2/2}\)。若对数收益的预测为 \(\hat\mu\)、预测误差方差为 \(\hat\sigma^2\),简单收益的预测应是什么? 提示:配方;\(e^{\hat\mu+\hat\sigma^2/2}-1\)。
  5. (原书复习题 18.3、18.4)\(Y=1+2X+u\),\(X\in[0,20]\),\(X\le10\) 时 \(\mathrm{var}(u)=1\),\(X>10\) 时为 16。WLS 的权重怎么设?两段分别 OLS 再平均是否比 WLS 有效? 答案要点:\(X\le10\) 的观测权重是另一段的 16 倍(按方差倒数);否。

进阶

  1. (原书习题 18.3)补全 \(\hat\beta_1\) 渐近分布的推导,说明 \((\bar X-\mu_X)\cdot\frac1{\sqrt n}\sum u_i\xrightarrow{p}0\)。 提示:第一个因子 \(\xrightarrow{p}0\),第二个因子 \(\xrightarrow{d}N(0,\sigma_u^2)\),用 Slutsky。
  2. (原书习题 18.1)无截距约束最小二乘 \(\hat\beta_1^{RLS}=\sum X_iY_i/\sum X_i^2\)。推导其条件方差 \(\sigma_u^2/\sum X_i^2\),并证明当真实截距为 0 时它比含截距的 OLS 更有效。 提示:\(\sum X_i^2\ge\sum(X_i-\bar X)^2\)。
  3. (原书习题 18.8)\(\mathrm{var}(u_i\mid X_i)=\theta_0+\theta_1|X_i|\)。OLS 是否 BLUE?写出 BLUE 估计量。 答案要点:否;以 \(1/\sqrt{\theta_0+\theta_1|X_i|}\) 加权的 WLS。
  4. (原书习题 18.13)异质系数模型 \(Y_i=\beta_0+\beta_{1i}X_i+u_i\),\(\beta_{1i}\) 独立于 \(X_i\)。证明 OLS 一致估计 \(E(\beta_{1i})\),而 WLS 一般不是。在量化中,这对应市值加权与等权的横截面回归有何不同? 提示:WLS 估计的是以权重乘 \(X\) 的方差为权的 \(\beta_{1i}\) 加权平均;大盘股的因子收益占主导。
  5. 修改示例一:把偏斜分布换成「卖出虚值期权」型收益(大多数月份小正收益,偶尔大亏),\(n=60\),计算 95% 覆盖率;再用 \(|t|>3\) 作为门槛,看第一类错误率。 提示:偏斜方向与对数正态相反,单侧错误集中在另一边;更高的门槛能部分缓解。

原书推荐习题:18.3(OLS 渐近分布的完整推导)、18.9 与 18.14(一致性证明技巧)、18.10(MSE→0 ⇒ 一致)、18.12(对数正态均值)、18.13(异质效应下 OLS 与 WLS)、18.15(\(t_\infty\)、\(F_{m,\infty}\) 与正态、卡方的关系);复习题 18.2、18.3。


原书对照

本章内容 原书章节 PDF 页码
章首导言 第 18 章开篇 p.688
扩展最小二乘假设、OLS 估计量(Key Concept 18.1,式 18.1–18.3) 18.1 p.689–690
依概率收敛、LLN、三个估计量例子、依分布收敛、CLT、Slutsky 与连续映射、样本均值 t 统计量(式 18.4–18.11) 18.2 p.691–695
OLS 与稳健 t 统计量的渐近分布(式 18.12–18.17) 18.3 p.696–698
误差正态时的精确分布(式 18.18–18.23) 18.4 p.698–700
加权最小二乘(式 18.24–18.31) 18.5 p.700–705
复习题与习题 第 18 章末 p.706–710
附录 18.1 正态及相关分布 附录 18.1 p.710–712
附录 18.2 切比雪夫与 Cauchy–Schwarz 不等式 附录 18.2 p.712–713
偏斜收益的覆盖率模拟、横截面 WLS 模拟(本教材补充) — —

注:原书页码 = PDF 页码 − 1。