第 18 章 单回归元线性回归的理论
学习目标
读完本章,你应当能够:
- 陈述单回归元的五条扩展最小二乘假设,说明前三条、加第四条、再加第五条分别支撑什么结论。
- 准确定义依概率收敛、一致性、依分布收敛,用切比雪夫不等式证明大数定律,并区分「无偏」与「一致」。
- 熟练运用 Slutsky 定理与连续映射定理,把「分子用 CLT、分母用 LLN」组合成统计量的极限分布,并用它证明 t 统计量渐近正态。
- 理解异方差稳健标准误一致性的证明思路。
- 在同方差正态误差下推导 \(\hat\beta_1\) 的精确正态分布和仅同方差 t 统计量的精确 \(t_{n-2}\) 分布,理解自由度调整的双重作用。
- 构造不可行 WLS 与可行 WLS,比较 WLS 与「OLS + 稳健标准误」的利弊,并知道 WLS 在异质处理效应下估计的是什么。
读前导读
这一章在解决什么问题。 CFA 里你学过:做一元回归,看系数的 t 值,大于 2 就显著。本章回答这套做法背后的三个「为什么」。第一,为什么 t 值可以拿去和 1.96 比?答案是样本大时它近似服从标准正态,本章把这个「近似」严格化。第二,为什么软件里有两种标准误(普通的和「稳健」的)、为什么默认该用稳健的?第三,误差方差不相等(异方差)时,除了换标准误,还能不能改估计方法本身?这就是加权最小二乘(WLS),Barra 风险模型按市值平方根加权的横截面回归就是它。
对你来说最有价值的是 18.2 节那套「渐近工具」:大数定律、中心极限定理、Slutsky 定理。它们像一组乐高积木,后面 19a、19b 章所有检验统计量的推导都是同一套拼法。读懂一次,后面就是重复。
需要先想起来的数学。
- 极限与「\(n\to\infty\)」。\(a_n\to a\) 的意思是:只要 \(n\) 足够大,\(a_n\) 和 \(a\) 的距离可以小于任何你指定的正数。例:\(1/n\to0\);\(\frac n{n-2}\to1\)。本章把这个想法搬到随机变量上,变成「依概率收敛」。见 第 00 册第 01 章 函数极限与连续。
- 期望和方差的运算规则。\(E(aX+b)=aE(X)+b\);独立变量之和的方差等于方差之和;\(\mathrm{var}(\bar Y)=\sigma^2/n\)。这些是证明大数定律的全部原料。例:\(\sigma=20\%\) 的月收益,取 100 个月平均,标准差降到 \(2\%\)。
- 几何级数。\(1+a+a^2+\cdots+a^{n-1}=\frac{1-a^n}{1-a}\),\(|a|<1\) 时 \(n\to\infty\) 趋于 \(\frac1{1-a}\)。这就是年金现值公式的骨架,本章用它分析指数加权均值。见 第 00 册第 04 章 级数与收敛。
- 期望作为积分。连续随机变量 \(E(Y)=\int yf(y)dy\),即「取值 × 概率密度」加总。附录 18.1、18.2 的证明都在积分上操作,把积分想成「连续版的加权求和」即可。见 第 00 册第 03 章 积分。
- 收敛的几种说法与常用不等式。\(\xrightarrow{p}\)(依概率收敛)、\(\xrightarrow{d}\)(依分布收敛)、切比雪夫不等式、Cauchy–Schwarz 不等式,本章都会正式定义,系统梳理见 第 00 册第 07 章 概率中的分析工具。
怎么读这一章。 核心必读:18.1 的假设表(三个层次分别换来什么)、18.2 全节(尤其 18.2.5 的「模板」)、18.3.1 和 18.3.3、18.5.3 的「稳健标准误还是 WLS」。可以第一次只看结论的:18.3.2 的稳健标准误一致性证明(记住「每项都是趋零误差乘有界矩」这句即可)、附录 18.1 的二元正态密度公式。18.4 精确分布若你对 CFA 里的 t 分布已熟悉,可以快速浏览,记住「自由度 \(n-2\) 的两个作用」。建议先读 18.2.5,看懂模板之后回头读 18.2.1–18.2.4,会更清楚每块积木的用途。
18.0 为什么应用者也要学理论
原书开篇的回答很直接:理论让软件从「黑箱」变成工具箱,你知道每件工具为什么有效、需要什么假设;更重要的是,你能识别工具何时失效、何时该换方法。对量化研究者,这意味着能判断一个回测 t 值什么时候可信、一个风险模型的加权方案什么时候会出问题。
本章补充(而不是替代)第 4、5 章,在两个方向上扩展:
- 用数学推导 OLS 估计量和 t 统计量的抽样分布。大样本下只需第 4 章 Key Concept 4.3 的三条最小二乘假设;有限样本下再加同方差和正态误差两条。18.2、18.3 节(及附录 18.2)推导大样本正态性,18.4 节推导同方差正态误差下的精确分布。
- 处理异方差的另一种方法:加权最小二乘(18.5 节)。
本章是第 19a 章矩阵形式理论的单变量版本。概率论基础(期望、方差、条件期望)见第 02 册;统计推断的一般理论(收敛概念、渐近正态、Delta 方法)见第 03 册。
18.1 扩展最小二乘假设与 OLS 估计量
Key Concept 18.1(单回归元的扩展最小二乘假设) 模型为
\[Y_i=\beta_0+\beta_1X_i+u_i,\quad i=1,\dots,n,\tag{18.1}\]\(\beta_1\) 是 \(X\) 对 \(Y\) 的因果效应。
- \(E(u_i\mid X_i)=0\)(条件均值为零);
- \((X_i,Y_i)\) 独立同分布(i.i.d.);
- \(X_i\) 与 \(u_i\) 有非零有限的四阶矩;
- \(\mathrm{var}(u_i\mid X_i)=\sigma_u^2\)(同方差);
- \(u_i\mid X_i\) 服从正态分布(正态误差)。
三个层次:
| 成立的假设 | 结论 |
|---|---|
| 1–3 | OLS 无偏、一致、大样本正态;稳健 t 检验和 \(\pm1.96SE\) 置信区间大样本有效 |
| 1–4 | 再加:OLS 在条件于 \(X_1,\dots,X_n\) 的线性无偏估计量中方差最小(高斯–马尔可夫定理,第 5.5 节) |
| 1–5 | 再加:\(\hat\beta_1\) 条件精确正态,仅同方差 t 统计量精确服从 \(t_{n-2}\) |
后两条远比前三条严格,在多数应用中不现实,但它们具有理论意义,而且软件默认输出的 p 值常常基于它们。
推论:在假设 1、2、4、5 下,\(u_i\) 是 i.i.d. \(N(0,\sigma_u^2)\),且与 \(X_i\) 独立。理由如下:
- 假设 5 给出 \(u_i\mid X_i\sim N(0,\mathrm{var}(u_i\mid X_i))\),均值 0 来自假设 1;
- 假设 4 使条件方差为常数 \(\sigma_u^2\),于是条件分布 \(N(0,\sigma_u^2)\) 根本不依赖 \(X_i\),所以 \(u_i\) 与 \(X_i\) 独立;
- 由假设 2,不同观测之间独立,\(u_i\) 与 \(u_j\) 独立。
白话解释:「条件均值为零」\(E(u_i\mid X_i)=0\) 比「\(u\) 与 \(X\) 不相关」更强:它要求不管 \(X\) 取什么值,误差平均都是零,即 \(X\) 里没有任何能预测误差的信息。假设 3「四阶矩有限」听起来抽象,实际是在排除极端厚尾:它保证样本方差本身不会被几个异常值搅得无法收敛。四阶矩就是 \(E(X^4)\),和峰度同一个量级;如果收益的峰度是无穷大,后面所有渐近结论都没有保障。 推论里「条件分布不依赖 \(X_i\) ⇒ 独立」这一步值得记住:一般情况下「不相关」推不出「独立」,这里能推出来,是因为正态分布完全由均值和方差决定,两者都不随 \(X\) 变,整个分布也就不随 \(X\) 变。
OLS 估计量(推导见附录 4.2):
18.2 渐近分布理论的基础
渐近分布理论研究样本量趋于无穷(\(n\to\infty\))时统计量抽样分布的极限行为。它在计量中处于核心地位,原因有二:(1) 样本大时,渐近极限是有限样本分布的高质量近似;(2) 渐近分布通常比精确的有限样本分布简单得多。两块基石是大数定律和中心极限定理(第 2.6 节),再加两件工具:Slutsky 定理和连续映射定理。
18.2.1 依概率收敛与大数定律
定义。随机变量序列 \(\{S_n\}\) 依概率收敛(converge in probability)到常数 \(\mu\),记作 \(S_n\xrightarrow{p}\mu\),当且仅当对每个 \(\delta>0\),
大数定律(本书版本,即 Key Concept 2.6)。若 \(Y_1,\dots,Y_n\) i.i.d.,\(E(Y_i)=\mu_Y\),\(\mathrm{var}(Y_i)=\sigma_Y^2<\infty\),则
证明。由切比雪夫不等式(附录 18.2 式 18.42),
白话解释:定义 (18.4) 的读法是「先挑容忍度,再看概率」。你先任选一个误差容忍度 \(\delta\)(比如 0.1%),然后问:估计值偏离真值超过 \(\delta\) 的概率是多少?只要样本无限增大时这个概率趋于 0,并且对每一个 \(\delta\) 都如此,就叫依概率收敛。 推导拆解:(18.6) 只有两步。第一个「\(\le\)」直接套切比雪夫不等式,把 \(V\) 取成 \(\bar Y\)。第二个「\(=\)」用了 \(\mathrm{var}(\bar Y)=\sigma_Y^2/n\),这需要 i.i.d.:\(n\) 个独立变量之和的方差是 \(n\sigma_Y^2\),再除以 \(n^2\)。最后 \(\delta\) 固定、\(n\to\infty\),分式趋于 0。 数值感受:月收益 \(\sigma_Y=5\%\),想让样本均值偏离真值超过 \(1\%\) 的概率不超过 \(10\%\),切比雪夫要求 \(\frac{0.05^2}{n\cdot0.01^2}\le0.1\),即 \(n\ge250\) 个月。切比雪夫很保守(不用任何分布信息),若用正态近似只需约 68 个月。
18.2.2 三个例子:无偏与一致是两回事
设 \(Y_i\) i.i.d. \(N(\mu_Y,\sigma_Y^2)\)(原书此处印作 \(N(0,\sigma_Y^2)\),按上下文应为 \(N(\mu_Y,\sigma_Y^2)\)),考虑三个 \(\mu_Y\) 的估计量。
例 1:\(\hat\mu_a=Y_1\),无偏但不一致。 \(E(Y_1)=\mu_Y\),但不论 \(n\) 多大都只用一个观测,\(\Pr(|Y_1-\mu_Y|\ge\delta)\) 是一个与 \(n\) 无关的正数,分布不可能集中。
例 2:几何加权平均,无偏但不一致。
推导拆解:方差公式的来源。记归一化常数 \(c=\frac{1-a}{1-a^n}\),则 \(\hat\mu_b=c\sum a^{i-1}Y_i\)。 第一步,独立变量加权和的方差 = 权重平方 × 各自方差之和:\(\mathrm{var}(\hat\mu_b)=c^2\sigma_Y^2\sum_{i=1}^na^{2(i-1)}\)。 第二步,\(\sum a^{2(i-1)}\) 是公比为 \(a^2\) 的几何级数,等于 \(\frac{1-a^{2n}}{1-a^2}\)。 第三步,代入 \(c^2=\frac{(1-a)^2}{(1-a^n)^2}\) 即得第一个等号,再用括号里的两个因式分解约分。 第四步,\(n\to\infty\) 时 \(a^n\to0\),剩 \(\frac{1-a}{1+a}\)。 换个角度:等权平均的方差是 \(\sigma^2/n\),把 \(\sigma^2\frac{1-a}{1+a}\) 写成 \(\sigma^2/n_{\text{eff}}\),得「有效样本量」\(n_{\text{eff}}=\frac{1+a}{1-a}\)。\(a=0.9\) 时 \(n_{\text{eff}}=19\),即使有一万个观测,精度也只相当于 19 个等权观测。
虽然用了全部观测,但绝大多数观测的权重极小(第 \(i\) 个权重正比于 \(a^{i-1}\)),有效样本量有限,抽样误差不能充分抵消。
这个例子对量化非常重要:指数加权均值(EWMA)在固定衰减系数下不是一致估计量。这不是缺陷,而是设计目标:EWMA 本来就是为了跟踪时变参数,用不一致换取对最新信息的敏感。
例 3:\(\hat\mu_c=\bar Y+1/n\),有偏但一致。 偏差是 \(1/n\),随样本增大消失。用切比雪夫不等式的推广形式 (18.43):\(\Pr(|W|\ge\delta)\le E(W^2)/\delta^2\)。取 \(W=\bar Y+1/n-\mu_Y\),则 \(E(W^2)=\mathrm{var}(\bar Y)+(1/n)^2=\sigma_Y^2/n+1/n^2\to0\),所以一致。
一般结论(原书习题 18.10):均方误差 \(E[(S_n-\mu)^2]\to0\) 蕴含 \(S_n\xrightarrow{p}\mu\)。有限样本有偏、但偏差和方差都随样本增大消失的估计量仍是一致的。
18.2.3 依分布收敛与中心极限定理
定义。设 \(F_n\) 是 \(S_n\) 的累积分布函数。\(S_n\) 依分布收敛(converge in distribution)到 \(S\),记作 \(S_n\xrightarrow{d}S\),当且仅当
两种收敛的对比:\(S_n\xrightarrow{p}\mu\) 说的是 \(S_n\) 以高概率接近一个常数;\(S_n\xrightarrow{d}S\) 说的是 \(S_n\) 的分布接近 \(S\) 的分布,\(S_n\) 本身仍然是随机的。
白话解释:为什么 CLT 要乘 \(\sqrt n\)?因为 \(\bar Y-\mu_Y\) 本身依概率收敛到 0,它的分布最终「缩成一个点」,没有信息可看。乘以 \(\sqrt n\) 相当于用放大镜按误差缩小的速度同步放大,放大后的分布就稳定成一个钟形。这也是「标准误 \(\propto1/\sqrt n\)」的来源:样本量翻 4 倍,误差减半。 「在所有连续点成立」这个限定是技术性的,读者可忽略;极限是正态分布时,所有点都是连续点。
中心极限定理。若 \(Y_i\) i.i.d.、\(0<\sigma_Y^2<\infty\),则 \((\bar Y-\mu_Y)/\sigma_{\bar Y}\) 渐近服从 \(N(0,1)\)。由于 \(\sigma_{\bar Y}=\sigma_Y/\sqrt n\),等价地
时间序列的推广。i.i.d. 假设不适用于时间序列,需要推广版的 LLN 和 CLT。结论相同,只是成立条件不同(平稳、弱相依,第 16.4 节简述),严格处理见 Hayashi(2000,第 2 章)。在序列相关下,(18.8) 的方差要换成长期方差 \(\sum_{j=-\infty}^{\infty}\gamma_j\),这正是 HAC 标准误要估计的量。
18.2.4 Slutsky 定理与连续映射定理
Slutsky 定理。若 \(a_n\xrightarrow{p}a\)(常数),\(S_n\xrightarrow{d}S\),则
连续映射定理。设 \(g\) 连续,则 (i) \(S_n\xrightarrow{p}a\Rightarrow g(S_n)\xrightarrow{p}g(a)\);(ii) \(S_n\xrightarrow{d}S\Rightarrow g(S_n)\xrightarrow{d}g(S)\)。(18.10)
例:\(s_Y^2\xrightarrow{p}\sigma_Y^2\Rightarrow s_Y\xrightarrow{p}\sigma_Y\)(取 \(g=\sqrt{\cdot}\));\(S_n\xrightarrow{d}Z\sim N(0,1)\Rightarrow S_n^2\xrightarrow{d}Z^2\sim\chi^2_1\)。17b 章推导 DF 统计量分子的极限分布时,用的正是第二个例子。
白话解释:Slutsky 定理说的是,一个「越来越像常数」的东西和一个「分布越来越稳定」的东西做加减乘除,可以把前者直接换成它的极限常数。比如 \(A_n\xrightarrow{p}3\)、\(B_n\xrightarrow{d}N(0,1)\),那么 \(A_nB_n\) 就近似是 \(3\times N(0,1)=N(0,9)\)。 要小心的是:Slutsky 要求其中一方收敛到常数。两个都依分布收敛到随机变量时,一般不能这样拼(它们的联合分布未知)。这也是为什么证明里总要把统计量拆成「一个 CLT 部分」和「若干 LLN 部分」,而不是两个 CLT 部分。
18.2.5 应用:样本均值的 t 统计量
设 \(Y_i\) i.i.d.,\(0<E(Y_i^4)<\infty\),检验 \(H_0:E(Y_i)=\mu_0\)。技巧是分子分母同除以 \(\sigma_Y\):
- 分子:四阶矩有限蕴含二阶矩有限(习题 18.5),所以原假设下由 CLT,\(\sqrt n(\bar Y-\mu_0)/\sigma_Y\xrightarrow{d}N(0,1)\);
- 分母:\(s_Y^2\xrightarrow{p}\sigma_Y^2\)(附录 3.3,这里要用四阶矩有限),由连续映射定理 \(s_Y/\sigma_Y\xrightarrow{p}1\)(习题 18.4);
- 由 Slutsky 定理的第三条,\(t\xrightarrow{d}N(0,1)\)。
这是计量中几乎所有渐近证明的模板:把统计量写成「CLT 管的部分」除以「LLN 管的部分」,分别取极限,再用 Slutsky 拼起来。下一节 OLS 的 t 统计量、第 19a 章的 F 统计量、17b 章的 DF 统计量(只是那里分子分母的极限都不寻常),都是同一套路。
18.3 OLS 估计量与 t 统计量的渐近分布
18.3.1 一致性与渐近正态
在前三条假设下(Key Concept 4.4),
证明思路(附录 4.3,原书指出那里省略了细节,补全留作习题 18.3):
推导拆解:第一个等式从哪来? 第一步,由 (18.2),分子 \(\sum(X_i-\bar X)(Y_i-\bar Y)\) 中代入 \(Y_i=\beta_0+\beta_1X_i+u_i\)、\(\bar Y=\beta_0+\beta_1\bar X+\bar u\),得 \(Y_i-\bar Y=\beta_1(X_i-\bar X)+(u_i-\bar u)\)。 第二步,于是分子 \(=\beta_1\sum(X_i-\bar X)^2+\sum(X_i-\bar X)(u_i-\bar u)\);又因 \(\sum(X_i-\bar X)=0\),\(\bar u\) 那项消失,分子 \(=\beta_1\sum(X_i-\bar X)^2+\sum(X_i-\bar X)u_i\)。 第三步,除以分母得 \(\hat\beta_1=\beta_1+\frac{\sum(X_i-\bar X)u_i}{\sum(X_i-\bar X)^2}\),也就是 (18.19)。 第四步,移项后两边乘 \(\sqrt n\),再把分子分母分别乘 \(\frac1n\):分子变成 \(\frac{1}{\sqrt n}\sum(\cdot)\)(CLT 管),分母变成 \(\frac1n\sum(\cdot)\)(LLN 管)。这正是 18.2.5 的模板。 方差 \(\mathrm{var}(v_i)/[\mathrm{var}(X_i)]^2\) 的形状就是「三明治」:中间的「肉」\(\mathrm{var}(v_i)\) 允许 \(u\) 的方差随 \(X\) 变化,两边的「面包」是 \(X\) 的方差。同方差时 \(\mathrm{var}(v_i)=\sigma_u^2\mathrm{var}(X_i)\),化简为熟悉的 \(\sigma_u^2/\mathrm{var}(X_i)\)。
18.3.2 异方差稳健标准误的一致性
要证明
把比值写成三项:
- \(\frac1n\sum v_i^2\xrightarrow{p}\mathrm{var}(v_i)\)。\(v_i^2\) i.i.d.,均值为 \(E(v_i^2)=\mathrm{var}(v_i)\)(因 \(E v_i=0\))。要用 LLN 需 \(\mathrm{var}(v_i^2)<\infty\)。用 Cauchy–Schwarz:
\[\mathrm{var}(v_i^2)\le E(v_i^4)=E[(X_i-\mu_X)^4u_i^4]\le\{E[(X_i-\mu_X)^8]E(u_i^8)\}^{1/2}<\infty.\]
- 残差替换误差、样本均值替换总体均值不影响极限:
\[\frac1n\sum\left[(X_i-\bar X)^2\hat u_i^2-(X_i-\mu_X)^2u_i^2\right]\xrightarrow{p}0.\tag{18.16}\]代入 \(\hat u_i=u_i-(\hat\beta_0-\beta_0)-(\hat\beta_1-\beta_1)X_i\) 展开,每一项都是「一致趋零的估计误差」乘以「有界的样本矩」,反复使用 Cauchy–Schwarz 和 \(\hat\beta\) 的一致性即可(习题 18.9)。
八阶矩并非必要,四阶矩下结论也成立,只是证明超出本书(Hayashi 2000,2.5 节)。
白话解释:这一节的目标只有一句话:稳健标准误这个「估计出来的方差」和「真正的方差」之比趋于 1。做法是把比值拆成三块,前后两块显然趋于 1,难点全在中间:用残差 \(\hat u_i\) 代替看不见的误差 \(u_i\)、用 \(\bar X\) 代替 \(\mu_X\),会不会造成系统性偏差?答案是不会,因为 \(\hat\beta\) 一致,\(\hat u_i\) 与 \(u_i\) 的差距随样本增大而消失。 Cauchy–Schwarz 在这里的作用是「拆开乘积的期望」:\(E(AB)\) 不好算,但 \(\sqrt{E(A^2)E(B^2)}\) 只需各自的矩有限。要 \(E(X^4u^4)\) 有限,用它就只需 \(X\) 和 \(u\) 各自的八阶矩有限,这就是「暂设八阶矩」的由来。
18.3.3 稳健 t 统计量的渐近正态
原假设下第一项由 (18.12) \(\xrightarrow{d}N(0,1)\),第二项由 (18.13) \(\xrightarrow{p}1\),Slutsky ⇒ \(t\xrightarrow{d}N(0,1)\)。又是同一个模板。
原书复习题 18.1:若误差实际上同方差,用稳健标准误构造的置信区间仍然渐近有效(稳健标准误在同方差下也一致);反之,若误差异方差却用仅同方差标准误,区间不是渐近有效的。这就是「默认用稳健标准误」的理由。
18.4 误差正态时的精确抽样分布
小样本下 OLS 与 t 统计量的分布依赖回归元和误差的分布,一般很复杂。但若五条假设全部成立,则条件于 \(X\) 时 \(\hat\beta_1\) 精确正态,仅同方差 t 统计量精确服从 Student t。
18.4.1 \(\hat\beta_1\) 的精确分布
若误差 i.i.d. 正态且独立于回归元,条件于 \(X_1,\dots,X_n\),有 \(\hat\beta_1\sim N(\beta_1,\sigma^2_{\hat\beta_1|X})\),其中
三步证明:
(i) 正态性。
(ii) 条件无偏。\(E(u_i\mid X_1,\dots,X_n)=E(u_i\mid X_i)=0\)(第一个等号用 i.i.d.,习题 18.7),所以
(iii) 条件方差。误差条件独立、方差 \(\sigma_u^2\):
18.4.2 仅同方差 t 统计量的精确分布
其中 \(s_{\hat u}^2=\frac1{n-2}\sum\hat u_i^2\),\(W=\sum\hat u_i^2/\sigma_u^2\)。
- 原假设下分子 \(\sim N(0,1)\);
- 19.4 节将证明 \(W\sim\chi^2_{n-2}\),且与分子独立;
- 按 Student t 的定义(附录 18.1:独立的标准正态除以「卡方除以自由度」的平方根),\(\tilde t\sim t_{n-2}\)。
自由度调整的双重作用。除以 \(n-2\) 而不是 \(n\):
- 因为 \(E(W)=n-2\),所以 \(E\left[\frac1{n-2}\sum\hat u_i^2\right]=\sigma_u^2\),\(s_{\hat u}^2\) 无偏;
- 分母恰好写成 \(\sqrt{W/m}\) 的标准形式,误差正态时 t 统计量精确服从 Student t。
为什么是 \(n-2\)?估计两个系数,残差满足两个线性约束(\(\sum\hat u_i=0\),\(\sum X_i\hat u_i=0\)),只剩 \(n-2\) 个自由度。第 19a 章会用投影矩阵 \(\mathbf M_X\) 的秩把这一点说得很精确。
金融直觉:自由度的直觉和「样本方差除以 \(n-1\)」完全一样。用样本均值代替总体均值时,残差被迫加总为 0,等于「用掉」了一个观测的信息,所以除以 \(n-1\)。回归里估计了截距和斜率两个参数,残差被两个方程约束住,用掉两个观测,除以 \(n-2\)。 实务上何时有区别?\(n=24\)(两年月度数据)时,双侧 5% 临界值 \(t_{22}=2.07\),正态 1.96,差约 6%;\(n=250\) 时两者几乎一样。小样本回测里用 1.96 会略微高估显著性,示例一中正态数据 \(n=24\) 覆盖率只有 0.937 正是这个原因。
18.5 加权最小二乘
前四条假设下,OLS 是条件线性无偏估计量中最有效的(BLUE)。主要局限在于要求同方差。异方差时 OLS 不再是 BLUE,加权最小二乘(weighted least squares,WLS)可以更有效,但需要对条件方差 \(\mathrm{var}(u_i\mid X_i)\) 了解很多。分两种情形:
- 条件方差已知到一个比例常数:WLS 是 BLUE;
- 条件方差的函数形式已知但含未知参数:先估计参数,在附加条件下 WLS 的渐近分布与参数已知时相同,即渐近 BLUE。
18.5.1 已知异方差形式的 WLS
设
为什么是 BLUE:加权后误差同方差,
等价地,WLS 最小化加权残差平方和 \(\sum_i\frac{1}{h(X_i)}(Y_i-b_0-b_1X_i)^2\):方差大的观测信息少,权重小。原书复习题 18.3 的例子:\(Y=1+2X+u\),\(X\in[0,20]\),\(X\le10\) 时误差方差为 1,\(X>10\) 时为 16。WLS 给 \(X\le10\) 的观测 16 倍的权重。复习题 18.4 进一步问:两段分别做 OLS 再平均,是否比 WLS 有效?答案是否:WLS 用一个模型、按信息量最优地合并了两段数据。
实践中 \(h\) 通常未知,这种 WLS 不可计算,称为不可行 WLS(infeasible WLS)。
金融直觉:WLS 就是「信息量加权」。把每个观测想成一位分析师的盈利预测:误差方差小的分析师更可靠,合并时应该多听他的,最优权重与方差成反比,这和最小方差组合按 \(1/\sigma^2\) 配权是同一个道理。复习题的例子里,前半段误差方差 1、后半段 16,所以前半段每个观测的权重是后半段的 16 倍(按标准差算是 4 倍,因为 (18.25) 是把数据本身除以 \(\sqrt h\),平方后进入残差平方和就是 \(1/h\))。 区分两种说法以免混淆:「数据除以 \(\sqrt{h}\)」和「残差平方乘以 \(1/h\)」是同一件事;statsmodels 的
weights参数取的是后者 \(1/h\)。
18.5.2 异方差函数形式已知时的可行 WLS
例 1:方差是 \(X\) 的二次函数。
例 2:方差依赖第三个变量。 总体回归 \(E(Y_i\mid X_i,W_i)=\beta_0+\beta_1X_i\),条件方差 \(\mathrm{var}(u_i\mid X_i,W_i)=\lambda h(W_i)\)。情境:研究州失业率与州政策变量 \(X_i\) 的关系。观测到的失业率 \(Y_i\) 是对真实失业率 \(Y_i^*\) 的抽样调查估计,调查样本量 \(W_i\) 不影响真实失业率:
关键前提:必须有 \(E(u_i\mid X_i,W_i)=0\)。否则加权后的误差条件均值不为零,WLS 不一致。如果 \(W_i\) 实际上决定 \(Y_i\),就应该做同时含 \(X_i,W_i\) 的多元回归,而不是把 \(W_i\) 只用在权重里。
可行 WLS 的一般五步:
- \(Y\) 对 \(X\) 做 OLS,得残差 \(\hat u_i\);
- 估计条件方差函数(如 (18.27) 则 \(\hat u_i^2\) 对 \(X_i^2\) 回归);
- 用估计的函数计算条件方差的预测值 \(\widehat{\mathrm{var}}(u_i\mid X_i)\);
- 用其平方根的倒数给因变量和回归元(含截距)加权;
- 对加权回归做 OLS,得 WLS 估计。
方差依赖 \(X\) 以外的变量时相应修改第 2、3 步。软件通常有加权回归命令,自动完成第 4、5 步。实务中第 2 步常用 \(\ln\hat u_i^2\) 对变量回归再取指数,以保证预测的方差为正,本章示例就用了这种变体。
18.5.3 稳健标准误还是 WLS?
| WLS | OLS + 异方差稳健标准误 | |
|---|---|---|
| 优点 | (至少渐近)比 OLS 更有效 | 不需要知道条件方差形式,推断渐近有效;软件一个选项 |
| 缺点 | 需要知道条件方差的函数形式并估计参数;形式很少已知;形式设错时,软件给出的 WLS 标准误无效 | 方差比(基于真实方差函数的)WLS 大 |
多回归元时更难知道条件方差的形式。原书作者的观点是:尽管 WLS 在理论上有吸引力,多数应用中稳健标准误是处理潜在异方差更好的方法。
还有一个更深的问题(原书脚注与习题 18.13)。本章一直假设单一的处理效应 \(\beta_1\)。若处理效应异质,即每个个体有自己的 \(\beta_{1i}\),那么即使 \(X\) 随机分配、个体随机抽取,OLS 也一致估计平均因果效应 \(E(\beta_{1i})\),但 WLS 不一定:WLS 估计的是按权重加权的平均效应。权重不同,估计的就是不同的总体量。
白话解释:设想一个因子在大盘股上的溢价是 0.2%,在小盘股上是 0.8%,并不存在「唯一的」因子收益。OLS 大致给出全体股票的简单平均;按市值平方根加权的 WLS 给大盘股更大权重,结果靠近 0.2%。两者都不「错」,只是回答的问题不同:前者问「随便挑一只股票平均能赚多少」,后者更接近「按资金容量能赚多少」。选权重之前,先想清楚你要估的是哪个数。
折中的做法是两者结合:用 WLS 获得效率,同时报告 WLS 的稳健标准误。这样即使权重函数设错,推断依然有效,只是效率增益打折扣。
附录 18.1 正态及相关分布、连续随机变量的矩
连续随机变量。概率密度 \(f_Y(y)\ge0\),\(\Pr(a\le Y\le b)=\int_a^bf_Y(y)dy\)(18.32),\(\int_{-\infty}^\infty f_Y(y)dy=1\)。均值 \(E(Y)=\int yf_Y(y)dy\)(18.33),方差 \(\mathrm{var}(Y)=\int(y-\mu_Y)^2f_Y(y)dy\)(18.34),\(r\) 阶矩 \(E(Y^r)=\int y^rf_Y(y)dy\)(18.35),\(r\) 阶中心矩 \(E(Y-\mu_Y)^r\)。
正态分布。
二元正态。
条件正态。\(Y\mid X\sim N(\mu_{Y|X},\sigma^2_{Y|X})\),
卡方分布。\(Z_1,\dots,Z_n\) i.i.d. 标准正态,\(W=\sum_{i=1}^nZ_i^2\sim\chi^2_n\)(18.39),\(E(W)=n\),\(\mathrm{var}(W)=2n\)(因 \(E(Z^2)=1\),\(E(Z^4)=3\))。
Student t 分布。\(Z\) 标准正态,\(W\sim\chi^2_m\),二者独立,则 \(t=Z/\sqrt{W/m}\sim t_m\)(18.40)。\(t_\infty\) 就是标准正态。
F 分布。\(W_1\sim\chi^2_{n_1}\),\(W_2\sim\chi^2_{n_2}\),独立,则 \(F=\frac{W_1/n_1}{W_2/n_2}\sim F_{n_1,n_2}\)(18.41)。分母自由度很大时 \(W_2/n_2\to1\),所以 \(F_{n_1,\infty}=\chi^2_{n_1}/n_1\)(习题 18.15)。这就是大样本 F 检验查 \(F_{q,\infty}\) 表的原因。
附录 18.2 两个不等式
切比雪夫不等式。
Cauchy–Schwarz 不等式。
量化实战
1. 本章内容在量化中的用途
回测 t 值的可信度。 检验一个策略或因子的平均收益是否为零,就是 (18.11) 的 t 检验。它的渐近正态性要求矩有限,收敛速度取决于分布的形状。本章示例会显示:对称的厚尾(如 t(3))影响不大,但强偏斜的收益(卖期权、尾部对冲、彩票型策略)在几十个月的样本下,t 检验的覆盖率会严重不足。这正是「理论帮你识别工具何时失效」。
EWMA 与一致性。 风险模型中的指数加权协方差、动量信号中的指数加权均值,都是 18.2.2 节例 2 的几何加权估计量。固定半衰期下它们不收敛到真值,其方差下限是 \(\sigma^2(1-a)/(1+a)\)。选择半衰期就是在跟踪速度(偏差)与估计噪声(方差)之间权衡。
横截面回归中的 WLS。 Barra 式风险模型和 Fama–MacBeth 横截面回归常按市值的平方根加权,理由是「小盘股特质方差更大」,这正是 WLS。本章提醒两件事:(1) 权重函数设错,软件默认标准误就失效,应报告稳健标准误;(2) 异质系数下,加权回归估计的是加权平均的因子收益,市值加权与等权的因子收益含义不同,前者偏向大盘股的定价。
对数正态均值修正。 原书习题 18.12:若 \(u\sim N(0,\sigma_u^2)\),则 \(E(e^u)=e^{\sigma_u^2/2}\)。用对数收益模型预测简单收益或价格水平时,必须加上 \(\frac12\sigma^2\) 的修正,否则系统性低估。
切比雪夫界。 不依赖分布假设的尾部概率上界,可用于保守的风险界估计:任意分布下,偏离均值 \(k\) 个标准差以上的概率不超过 \(1/k^2\)。
2. 示例一:一致性与 t 检验的有限样本覆盖率
import numpy as np
rng = np.random.default_rng(3)
mu, sig, nsim = 1.0, 2.0, 5000
# (1) 三个估计量:Y_1(无偏不一致)、几何加权均值(无偏不一致)、Ybar+1/n(有偏一致)
a = 0.9
for n in [10, 100, 1000]:
Y = mu + sig * rng.standard_normal((nsim, n))
wts = a ** np.arange(n); wts /= wts.sum()
est = {"Y1": Y[:, 0], "geo": Y @ wts, "Ybar+1/n": Y.mean(1) + 1 / n}
print(f"n={n:5d} " + " ".join(f"{k}: P(|err|>0.2)={np.mean(abs(v-mu)>0.2):.3f}"
for k, v in est.items()))
print("几何加权均值的极限标准差 sigma*sqrt((1-a)/(1+a)) =", round(sig*np.sqrt((1-a)/(1+a)), 3))
# (2) 均值 t 检验的覆盖率:正态 vs 厚尾(t 分布自由度 3)vs 偏斜
def coverage(draw, n, nsim=20000):
Y = draw((nsim, n))
t = Y.mean(1) / (Y.std(1, ddof=1) / np.sqrt(n)) # 真均值为 0
return np.mean(np.abs(t) <= 1.96)
for n in [24, 60, 250]:
c_n = coverage(lambda s: rng.standard_normal(s), n)
c_t3 = coverage(lambda s: rng.standard_t(3, s), n)
# 偏斜厚尾:中心化的对数正态(类似"偶发大赚"的策略收益)
c_ln = coverage(lambda s: np.exp(1.5 * rng.standard_normal(s)) - np.exp(1.125), n)
print(f"n={n:4d} 95% 区间覆盖率: 正态 {c_n:.3f} | t(3) {c_t3:.3f} | 偏斜对数正态 {c_ln:.3f}")
输出:
n= 10 Y1: P(|err|>0.2)=0.922 geo: P(|err|>0.2)=0.760 Ybar+1/n: P(|err|>0.2)=0.752
n= 100 Y1: P(|err|>0.2)=0.914 geo: P(|err|>0.2)=0.661 Ybar+1/n: P(|err|>0.2)=0.309
n= 1000 Y1: P(|err|>0.2)=0.926 geo: P(|err|>0.2)=0.662 Ybar+1/n: P(|err|>0.2)=0.001
几何加权均值的极限标准差 sigma*sqrt((1-a)/(1+a)) = 0.459
n= 24 95% 区间覆盖率: 正态 0.937 | t(3) 0.945 | 偏斜对数正态 0.760
n= 60 95% 区间覆盖率: 正态 0.944 | t(3) 0.948 | 偏斜对数正态 0.821
n= 250 95% 区间覆盖率: 正态 0.950 | t(3) 0.954 | 偏斜对数正态 0.885
第一部分:\(Y_1\) 的误差概率始终在 0.92 左右,不随 \(n\) 变化;几何加权均值在 \(n=100\) 后停在 0.66,因为它的标准差停在 0.459 不再下降;\(\bar Y+1/n\) 虽然有偏,误差概率却迅速趋于 0。无偏不一定一致,一致不一定无偏。
第二部分:正态数据在 \(n=24\) 时覆盖率 0.937(用 1.96 而不是 \(t_{23}\) 临界值造成的轻微不足);对称厚尾的 t(3) 几乎没有影响;而强偏斜的对数正态,24 个月的样本覆盖率只有 0.76,250 个月仍只有 0.885。对偏斜策略,t 值的正态近似需要很大的样本才可靠,应辅以自助法或更严格的门槛。
3. 示例二:横截面回归中的 OLS、WLS 与设错的权重
模拟 1000 只股票的横截面:特质方差与 \(1/\sqrt{\text{市值}}\) 成正比(小盘股噪声大)。比较 OLS(HC1 标准误)、权重正确的 WLS、可行 WLS(\(\ln\hat u^2\) 对 \(\ln\) 市值回归估计方差函数)以及方向设反的 WLS(用软件默认标准误)。
import numpy as np
import statsmodels.api as sm
rng = np.random.default_rng(5)
n, nsim, beta1 = 1000, 2000, 0.5
out = {k: [] for k in ["OLS", "WLS_true", "FWLS", "WLS_wrong"]}
cover = {k: 0 for k in out}
for _ in range(nsim):
# 截面:因子暴露 X,市值 cap(对数正态);特质方差 ∝ 1/sqrt(cap)(小盘股噪声大)
X = rng.standard_normal(n)
cap = np.exp(rng.normal(0, 1.5, n))
h = 1 / np.sqrt(cap)
u = np.sqrt(h) * rng.standard_normal(n)
Y = 0.1 + beta1 * X + u
Xc = sm.add_constant(X)
fits = {
"OLS": sm.OLS(Y, Xc).fit(cov_type="HC1"),
"WLS_true": sm.WLS(Y, Xc, weights=1 / h).fit(), # 权重 = 1/方差
}
# 可行 WLS:用 log(u_hat^2) 对 log(cap) 回归估计方差函数(保证预测方差为正)
uh = fits["OLS"].resid
g = sm.OLS(np.log(uh ** 2), sm.add_constant(np.log(cap))).fit()
hhat = np.exp(g.fittedvalues)
fits["FWLS"] = sm.WLS(Y, Xc, weights=1 / hhat).fit()
# 设错的权重:以为方差 ∝ cap(方向反了),并使用软件默认(非稳健)标准误
fits["WLS_wrong"] = sm.WLS(Y, Xc, weights=1 / cap).fit()
for k, f in fits.items():
out[k].append(f.params[1])
cover[k] += abs(f.params[1] - beta1) <= 1.96 * f.bse[1]
for k in out:
print(f"{k:10s} 均值={np.mean(out[k]):.4f} 抽样标准差={np.std(out[k]):.4f} 95%区间覆盖率={cover[k]/nsim:.3f}")
输出:
OLS 均值=0.5000 抽样标准差=0.0362 95%区间覆盖率=0.952
WLS_true 均值=0.5009 抽样标准差=0.0273 95%区间覆盖率=0.951
FWLS 均值=0.5008 抽样标准差=0.0274 95%区间覆盖率=0.950
WLS_wrong 均值=0.4924 抽样标准差=0.2562 95%区间覆盖率=0.427
(statsmodels 的 weights 参数是方差的倒数,即 (18.25) 中 \(1/h(X_i)\),等价于对每个观测乘以 \(1/\sqrt{h}\)。)
结论与原书一致:
- 四个估计量都无偏(这里 \(X\) 与市值独立,\(E(u\mid X,\text{cap})=0\));
- 正确的 WLS 把抽样标准差从 0.036 降到 0.027,效率提高约 25%;可行 WLS 几乎达到同样效果;
- OLS + HC1 效率较低,但覆盖率 0.952,推断完全正确;
- 权重方向设反时,估计的标准差暴涨到 0.256(比 OLS 差 7 倍),而软件默认标准误给出的 95% 区间只覆盖了 43%。这就是「形式设错时 WLS 软件标准误无效」的后果。
本章小结
本章为单回归元 OLS 提供了理论基础。前三条最小二乘假设(条件均值零、i.i.d.、有限四阶矩)就足以保证 OLS 一致、渐近正态,并且异方差稳健标准误一致,因此稳健 t 统计量渐近标准正态;加上同方差得到高斯–马尔可夫效率;再加正态误差,\(\hat\beta_1\) 条件精确正态,仅同方差 t 统计量精确服从 \(t_{n-2}\)。渐近工具链是:切比雪夫不等式推出大数定律,中心极限定理给出分子的极限,Slutsky 定理与连续映射定理把它们拼起来。无偏与一致是不同的性质,几何加权均值无偏却不一致,\(\bar Y+1/n\) 有偏却一致。异方差时 WLS 以条件方差倒数的平方根加权做 OLS,渐近更有效,但需要正确的方差函数;实践中 OLS 加稳健标准误通常更稳妥,异质效应下 WLS 估计的是加权平均效应。
| 概念 | 公式 / 要点 |
|---|---|
| 依概率收敛 | \(\Pr(\lvert S_n-\mu\rvert\ge\delta)\to0\) |
| 依分布收敛 | \(F_n(t)\to F(t)\)(连续点) |
| 切比雪夫 | \(\Pr(\lvert V-\mu\rvert\ge\delta)\le\mathrm{var}(V)/\delta^2\) |
| Slutsky | \(a_n\xrightarrow{p}a\),\(S_n\xrightarrow{d}S\) ⇒ \(a_nS_n\xrightarrow{d}aS\) 等 |
| OLS 渐近分布 | \(\sqrt n(\hat\beta_1-\beta_1)\xrightarrow{d}N(0,\mathrm{var}(v_i)/[\mathrm{var}(X_i)]^2)\),\(v_i=(X_i-\mu_X)u_i\) |
| 精确分布 | \(\hat\beta_1\mid X\sim N(\beta_1,\sigma_u^2/\sum(X_i-\bar X)^2)\);\(\tilde t\sim t_{n-2}\) |
| 自由度 | \(n-2\):使 \(s_{\hat u}^2\) 无偏,且使 t 精确服从 Student t |
| WLS | 除以 \(\sqrt{h(X_i)}\) 后 OLS;\(\mathrm{var}(\tilde u_i\mid X_i)=\lambda\) |
| 可行 WLS | OLS → \(\hat u_i^2\) 建模 → 预测方差 → 加权 → OLS |
| 分布关系 | \(t_\infty=N(0,1)\),\(F_{m,\infty}=\chi^2_m/m\) |
练习
基础
- (原书复习题 18.2)\(A_n\xrightarrow{p}3\),\(B_n\xrightarrow{d}N(0,1)\)。求 \(A_nB_n\) 的渐近分布,并近似计算 \(\Pr(A_nB_n<2)\)。 答案要点:\(N(0,9)\);\(\Phi(2/3)\approx0.75\)。
- (原书复习题 18.1)误差同方差时用稳健标准误构造的置信区间是否渐近有效?误差异方差时用仅同方差标准误呢? 答案要点:是;否。
- 证明几何加权均值 \(\hat\mu_b\) 的方差公式,并说明为什么 \(a\) 越接近 1,极限方差越小。 提示:\(\sum a^{2(i-1)}=\frac{1-a^{2n}}{1-a^2}\);\(a\to1\) 时权重趋于均匀。
- (原书习题 18.12)若 \(u\sim N(0,\sigma_u^2)\),证明 \(E(e^u)=e^{\sigma_u^2/2}\)。若对数收益的预测为 \(\hat\mu\)、预测误差方差为 \(\hat\sigma^2\),简单收益的预测应是什么? 提示:配方;\(e^{\hat\mu+\hat\sigma^2/2}-1\)。
- (原书复习题 18.3、18.4)\(Y=1+2X+u\),\(X\in[0,20]\),\(X\le10\) 时 \(\mathrm{var}(u)=1\),\(X>10\) 时为 16。WLS 的权重怎么设?两段分别 OLS 再平均是否比 WLS 有效? 答案要点:\(X\le10\) 的观测权重是另一段的 16 倍(按方差倒数);否。
进阶
- (原书习题 18.3)补全 \(\hat\beta_1\) 渐近分布的推导,说明 \((\bar X-\mu_X)\cdot\frac1{\sqrt n}\sum u_i\xrightarrow{p}0\)。 提示:第一个因子 \(\xrightarrow{p}0\),第二个因子 \(\xrightarrow{d}N(0,\sigma_u^2)\),用 Slutsky。
- (原书习题 18.1)无截距约束最小二乘 \(\hat\beta_1^{RLS}=\sum X_iY_i/\sum X_i^2\)。推导其条件方差 \(\sigma_u^2/\sum X_i^2\),并证明当真实截距为 0 时它比含截距的 OLS 更有效。 提示:\(\sum X_i^2\ge\sum(X_i-\bar X)^2\)。
- (原书习题 18.8)\(\mathrm{var}(u_i\mid X_i)=\theta_0+\theta_1|X_i|\)。OLS 是否 BLUE?写出 BLUE 估计量。 答案要点:否;以 \(1/\sqrt{\theta_0+\theta_1|X_i|}\) 加权的 WLS。
- (原书习题 18.13)异质系数模型 \(Y_i=\beta_0+\beta_{1i}X_i+u_i\),\(\beta_{1i}\) 独立于 \(X_i\)。证明 OLS 一致估计 \(E(\beta_{1i})\),而 WLS 一般不是。在量化中,这对应市值加权与等权的横截面回归有何不同? 提示:WLS 估计的是以权重乘 \(X\) 的方差为权的 \(\beta_{1i}\) 加权平均;大盘股的因子收益占主导。
- 修改示例一:把偏斜分布换成「卖出虚值期权」型收益(大多数月份小正收益,偶尔大亏),\(n=60\),计算 95% 覆盖率;再用 \(|t|>3\) 作为门槛,看第一类错误率。 提示:偏斜方向与对数正态相反,单侧错误集中在另一边;更高的门槛能部分缓解。
原书推荐习题:18.3(OLS 渐近分布的完整推导)、18.9 与 18.14(一致性证明技巧)、18.10(MSE→0 ⇒ 一致)、18.12(对数正态均值)、18.13(异质效应下 OLS 与 WLS)、18.15(\(t_\infty\)、\(F_{m,\infty}\) 与正态、卡方的关系);复习题 18.2、18.3。
原书对照
| 本章内容 | 原书章节 | PDF 页码 |
|---|---|---|
| 章首导言 | 第 18 章开篇 | p.688 |
| 扩展最小二乘假设、OLS 估计量(Key Concept 18.1,式 18.1–18.3) | 18.1 | p.689–690 |
| 依概率收敛、LLN、三个估计量例子、依分布收敛、CLT、Slutsky 与连续映射、样本均值 t 统计量(式 18.4–18.11) | 18.2 | p.691–695 |
| OLS 与稳健 t 统计量的渐近分布(式 18.12–18.17) | 18.3 | p.696–698 |
| 误差正态时的精确分布(式 18.18–18.23) | 18.4 | p.698–700 |
| 加权最小二乘(式 18.24–18.31) | 18.5 | p.700–705 |
| 复习题与习题 | 第 18 章末 | p.706–710 |
| 附录 18.1 正态及相关分布 | 附录 18.1 | p.710–712 |
| 附录 18.2 切比雪夫与 Cauchy–Schwarz 不等式 | 附录 18.2 | p.712–713 |
| 偏斜收益的覆盖率模拟、横截面 WLS 模拟(本教材补充) | — | — |
注:原书页码 = PDF 页码 − 1。