量化交易中文教材

元信息:James H. Stock & Mark W. Watson《Introduction to Econometrics》(Global Edition)精读笔记,负责 PDF 第 179–330 页(第 5–8 章)。符号约定:\(\hat\beta\) 为 OLS 估计量,\(\tilde\beta\) 为其他估计量;书中页码 = PDF 页码 − 1。

第 5 章 单回归元回归:假设检验与置信区间(Regression with a Single Regressor: Hypothesis Tests and Confidence Intervals)

章引言(PDF p.179)

第 4 章说明 OLS 斜率估计量 \(\hat\beta_1\) 具有抽样分布(sampling distribution)。本章利用这一分布对 \(\beta_1\) 作出能准确刻画抽样不确定性的陈述。起点是 OLS 估计量的标准误(standard error),它衡量 \(\hat\beta_1\) 抽样分布的离散程度。结构:5.1 标准误与假设检验;5.2 置信区间;5.3 二元回归元特例;5.4 同方差(homoskedasticity);5.5 高斯—马尔可夫定理(Gauss–Markov theorem);5.6 误差正态时的小样本分布。5.1–5.3 只依赖 Key Concept 4.3 的三条最小二乘假设:(1) \(E(u_i\mid X_i)=0\);(2) \((X_i,Y_i)\) i.i.d.;(3) 大离群值罕见(四阶矩非零有限)。

贯穿案例:加州 420 个学区的考试成绩 TestScore 对师生比 STR 回归。一位"愤怒的纳税人"声称缩小班级无效,即 \(\beta_{ClassSize}=0\),督学(superintendent)问:数据能否拒绝这一说法?

5.1 回归系数的假设检验(Testing Hypotheses About One of the Regression Coefficients,PDF p.179–185)

回顾:总体均值的检验

零假设 \(H_0: E(Y)=\mu_{Y,0}\),双侧备择 \(H_1: E(Y)\neq\mu_{Y,0}\)。三步:(1) 计算 \(SE(\bar Y)\)(\(\bar Y\) 抽样分布标准差的估计);(2) 计算 \(t=(\bar Y-\mu_{Y,0})/SE(\bar Y)\);(3) 计算 p 值(p-value):在零假设成立时,因随机抽样得到至少与实际观测统计量一样偏离零假设值的统计量的概率,也是能拒绝零假设的最小显著性水平。大样本下 \(t\) 近似标准正态,双侧 p 值 \(=2\Phi(-|t^{act}|)\)。等价地,5% 双侧检验在 \(|t^{act}|>1.96\) 时拒绝。

Key Concept 5.1(t 统计量的一般形式)

\[t=\frac{\text{估计量}-\text{假设值}}{\text{估计量的标准误}}\tag{5.1}\]

双侧检验 \(\beta_1\)

理论依据:\(\hat\beta_1\) 与 \(\bar Y\) 一样在大样本下近似正态,所以检验方法相同。

\[H_0:\beta_1=\beta_{1,0}\quad\text{vs.}\quad H_1:\beta_1\neq\beta_{1,0}\tag{5.2}\]

第一步:标准误 \(SE(\hat\beta_1)=\sqrt{\hat\sigma^2_{\hat\beta_1}}\)(5.3),其中

\[\hat\sigma^2_{\hat\beta_1}=\frac{1}{n}\times\frac{\frac{1}{n-2}\sum_{i=1}^n (X_i-\bar X)^2\hat u_i^2}{\left[\frac1n\sum_{i=1}^n(X_i-\bar X)^2\right]^2}\tag{5.4}\]
这就是后文的异方差稳健方差估计,公式复杂但由软件自动算出(推导见附录 5.1)。

第二步:\(t=\dfrac{\hat\beta_1-\beta_{1,0}}{SE(\hat\beta_1)}\)(5.5)。

第三步:p 值

\[p=\Pr_{H_0}\left[|\hat\beta_1-\beta_{1,0}|>|\hat\beta_1^{act}-\beta_{1,0}|\right]=\Pr_{H_0}(|t|>|t^{act}|)\tag{5.6}\]
大样本下 \(p=\Pr(|Z|>|t^{act}|)=2\Phi(-|t^{act}|)\)(5.7)。p<5% 即在 5% 水平拒绝,等价于 \(|t^{act}|>1.96\)。

Key Concept 5.2(检验 \(\beta_1=\beta_{1,0}\) vs. \(\beta_1\ne\beta_{1,0}\)):1. 算 \(SE(\hat\beta_1)\);2. 算 t;3. 算 p 值,p<0.05 或 \(|t^{act}|>1.96\) 时在 5% 水平拒绝。软件通常自动报告检验 \(\beta_1=0\) 的 SE、t 与 p 值。

回归方程的报告格式与应用

式 (4.9) 的回归 \(\hat\beta_0=698.9\),\(\hat\beta_1=-2.28\),\(SE(\hat\beta_0)=10.4\),\(SE(\hat\beta_1)=0.52\)。惯例把标准误放在系数下方括号里:

\[\widehat{TestScore}=\underset{(10.4)}{698.9}-\underset{(0.52)}{2.28}\times STR,\quad R^2=0.051,\ SER=18.6\tag{5.8}\]
该格式同时给出回归线、抽样不确定性(SE)和两种拟合度量(\(R^2\)、SER),全书沿用。

检验 \(\beta_1=0\):\(t^{act}=(-2.28-0)/0.52=-4.38\),\(|t|>1.96\),5% 水平拒绝。p 值约 0.00001(0.001%)——图 5.1 显示为标准正态分布在 −4.38 左侧与 +4.38 右侧的尾部面积之和。若零假设为真,得到如此偏离的估计几乎不可能,因此合理推断零假设为假。

单侧检验(one-sided test)

许多人认为小班更好,即 \(\beta_1<0\),可检验

\[H_0:\beta_1=\beta_{1,0}\quad\text{vs.}\quad H_1:\beta_1<\beta_{1,0}\tag{5.9}\]
零假设与双侧相同,t 统计量构造相同,差别只在解读:只在 t 很负时拒绝。5% 水平拒绝域为 \(t^{act}<-1.64\)(而非 \(|t|>1.96\))。左尾 p 值 \(=\Pr(Z<t^{act})=\Phi(t^{act})\)(5.10);备择为 \(\beta_1>\beta_{1,0}\) 时取右尾 \(\Pr(Z>t^{act})\)。

何时用单侧:只有经济理论或先前经验证据给出明确理由时才用。即使初看是单侧,细想未必:新药可能因未知副作用反而有害;作者还引用笑话"大学成功的秘诀是招到有才华的学生,然后让教师尽量少碍事、少造成伤害"——即小班也可能无益甚至有害。这种模糊性使计量经济学家常用双侧检验。

应用:\(t^{act}=-4.38<-2.33\)(1% 单侧临界值),1% 水平拒绝;p 值小于 0.0006%。

截距 \(\beta_0\) 的检验

\(H_0:\beta_0=\beta_{0,0}\) vs. \(H_1:\beta_0\ne\beta_{0,0}\)(5.11),步骤同 Key Concept 5.2,\(SE(\hat\beta_0)\) 公式见附录 5.1。

当没有某个主导的零假设、而想知道与数据相容的系数取值范围时,需要置信区间。

5.2 回归系数的置信区间(Confidence Intervals for a Regression Coefficient,PDF p.185–187)

\(\beta_1\) 的 95% 置信区间(confidence interval)有两个等价定义:(1) 用 5% 双侧检验不能拒绝的所有值的集合;(2) 以 95% 概率包含真值的区间,即在所有可能样本中有 95% 的样本构造出的区间包含真值,称其置信水平(confidence level)为 95%。等价性:5% 水平检验只在 5% 的样本中拒绝真值,所以真值在 95% 的样本中不被拒绝,从而落在"未被拒绝值集合"内。

原则上可对所有 \(\beta_{1,0}\) 逐一检验,但太费时;注意到 t 检验恰好在 \(\beta_{1,0}\) 落在 \(\hat\beta_1\pm1.96SE(\hat\beta_1)\) 之外时拒绝,于是:

Key Concept 5.3:大样本下

\[\beta_1\text{ 的 95\% 置信区间}=\left[\hat\beta_1-1.96SE(\hat\beta_1),\ \hat\beta_1+1.96SE(\hat\beta_1)\right]\tag{5.12}\]
\(\beta_0\) 的区间同理,用 \(\hat\beta_0\) 与 \(SE(\hat\beta_0)\) 替换。

应用:\(-2.28\pm1.96\times0.52\),即 \(-3.30\le\beta_1\le-1.26\);0 不在区间内,与 5.1 的拒绝结论一致。

变化 \(X\) 的预测效应的置信区间

\(X\) 变化 \(\Delta x\) 时 \(Y\) 的期望变化为 \(\beta_1\Delta x\),其 95% 置信区间为

\[\left[(\hat\beta_1-1.96SE(\hat\beta_1))\Delta x,\ (\hat\beta_1+1.96SE(\hat\beta_1))\Delta x\right]\tag{5.13}\]
(\(\Delta x\) 为负时端点顺序对调。)例:师生比降低 2,效应在 \(-1.26\times(-2)=2.52\) 到 \(-3.30\times(-2)=6.60\) 分之间(95% 置信水平)。

5.3 X 为二元变量时的回归(Regression When X Is a Binary Variable,PDF p.186–188)

二元变量(binary variable)只取 0 和 1,也叫指示变量(indicator variable)或虚拟变量(dummy variable),例如性别、城乡、大/小班。回归的计算机制与连续 X 相同,但 \(\beta_1\) 的解释不同:二元回归等价于均值差分析(Section 3.4)。

定义

\[D_i=\begin{cases}1 & STR_i<20\\ 0 & STR_i\ge20\end{cases}\tag{5.14}\]
模型 \(Y_i=\beta_0+\beta_1D_i+u_i\)(5.15)。由于 D 只取两值,没有"线",不称 \(\beta_1\) 为斜率,而称"\(D_i\) 的系数"(coefficient on \(D_i\))。

逐一考虑两种情况:\(D_i=0\) 时 \(Y_i=\beta_0+u_i\)(5.16),由 \(E(u_i\mid D_i)=0\) 得 \(E(Y_i\mid D_i=0)=\beta_0\);\(D_i=1\) 时 \(Y_i=\beta_0+\beta_1+u_i\)(5.17),\(E(Y_i\mid D_i=1)=\beta_0+\beta_1\)。故

\[\beta_1=E(Y_i\mid D_i=1)-E(Y_i\mid D_i=0)\]
即两组总体均值之差;相应地 OLS 估计 \(\hat\beta_1\) 恰为两组样本均值之差(习题 5.10 证明 \(\hat\beta_0=\bar Y_0\),\(\hat\beta_0+\hat\beta_1=\bar Y_1\))。

检验两组均值相等即检验 \(\beta_1=0\),用 \(t=\hat\beta_1/SE(\hat\beta_1)\);\(\hat\beta_1\pm1.96SE(\hat\beta_1)\) 给出均值差的 95% 置信区间。

应用:

\[\widehat{TestScore}=\underset{(1.3)}{650.0}+\underset{(1.8)}{7.4}D,\quad R^2=0.037,\ SER=18.7\tag{5.18}\]
大班组(D=0)平均 650.0 分,小班组 657.4 分,差 7.4。\(t=7.4/1.8=4.04>1.96\),5% 水平拒绝两组均值相等;95% CI \(=7.4\pm1.96\times1.8=(3.9,10.9)\),不含 0。

5.4 异方差与同方差(Heteroskedasticity and Homoskedasticity,PDF p.188–194)

定义(Key Concept 5.4)

若 \(\operatorname{var}(u_i\mid X_i=x)\) 对 \(i=1,\dots,n\) 为常数、尤其不依赖 \(x\),则误差同方差(homoskedastic);否则为异方差(heteroskedastic)。图 5.2:(a) 各 STR 取值(15、20、25)下考试成绩条件分布离散程度相同;(b) 离散程度随 x 增大而变大,属异方差。两图中条件均值都在回归线 \(\beta_0+\beta_1X\) 上(第一条假设保证条件均值为 0)。

例:社会阶层与收入

回到第 3 章方框"社会阶层还是教育?":令 \(HIGHER_i=1\) 表示父亲的英国国家统计社会经济分类(NS-SEC)属较高类,0 表示常规类。模型 \(Earnings_i=\beta_0+\beta_1HIGHER_i+u_i\)(5.19),\(\beta_1\) 为两组家庭平均收入之差。拆成两式:较低组 \(Earnings_i=\beta_0+u_i\)(5.20),较高组 \(Earnings_i=\beta_0+\beta_1+u_i\)(5.21)。于是"\(u_i\) 方差不依赖 HIGHER"等价于"两组收入分布方差相同"。(原文此处残留"by gender"等旧版措辞,含义应为按社会阶层分组。)

同方差的数学含义

  • OLS 仍无偏、一致、渐近正态:Key Concept 4.3 对条件方差无要求,同方差只是特例。
  • 效率:若再加同方差,OLS 在"关于 \(Y_1,\dots,Y_n\) 线性且条件无偏"的估计量中方差最小,即高斯—马尔可夫定理(5.5 节)。
  • 仅同方差(homoskedasticity-only)方差公式:
    \[\tilde\sigma^2_{\hat\beta_1}=\frac{s^2_{\hat u}}{\sum_{i=1}^n(X_i-\bar X)^2}\tag{5.22}\]
    其中 \(s^2_{\hat u}=\frac{1}{n-2}\sum\hat u_i^2\)(式 4.17,即 SER 的平方)。X 为二元变量时,它化为均值差的合并方差(pooled variance)公式(3.23)。

关键警告:若误差异方差,用仅同方差标准误算出的 t 统计量即使在大样本下也不服从标准正态,正确临界值依赖异方差的具体形式而无法制表;\(\pm1.96\) 倍仅同方差 SE 构成的区间覆盖率一般也不是 95%。相反,式 (5.4) 与 (5.26) 的估计量在同方差、异方差下都有效,称异方差稳健标准误(heteroskedasticity-robust standard errors),因 Eicker(1967)、Huber(1967)、White(1980)提出,又称 Eicker–Huber–White 标准误。

实践中意味着什么(PDF p.193)

哪种更现实取决于应用。社会阶层例子中:出身贫困者多数留在较低收入阶层,进入高收入家庭的很少,因此低出身组收入分布更集中,(5.20) 的误差方差小于 (5.21),误差异方差。一般而言,经济理论极少提供同方差的理由,审慎做法是假定可能异方差。

实践结论:设想两种 SE 都算出来——若相同,用稳健 SE 无损失;若不同,应采用允许异方差的、更可靠的那个。最简单的做法就是始终使用异方差稳健标准误。许多软件出于历史原因默认报告仅同方差 SE,需要用户手动指定稳健选项。本书所有实证例子除非另行说明均使用稳健 SE。脚注:有些教材把同方差列为最小二乘假设之一,但只要用稳健 SE,此假设并非 OLS 回归分析有效所必需。

方框:一年教育的经济价值——同方差还是异方差?(PDF p.194)

数据:2016 年 3 月 CPS,2015 年 29–30 岁、受教育 8–18 年的 2731 名全职工人。

\[\widehat{Earnings}=\underset{(1.36)}{-12.12}+\underset{(0.10)}{2.37}\,YearsEducation,\quad R^2=0.185,\ SER=11.24\tag{5.23}\]
每多一年教育,时薪平均高 2.37 美元,95% CI 为 2.17–2.57 美元。图 5.3 第二个显著特征:残差离散程度随教育年限增加——10 年教育者残差标准差 6.31 美元,高中毕业 8.54 美元,大学毕业 13.55 美元。即误差异方差:高学历者中有人低薪,但低学历者几乎没人能拿到高薪。

*5.5 OLS 的理论基础(The Theoretical Foundations of Ordinary Least Squares,PDF p.194–196,选读)

已知 OLS 无偏、一致、方差与 \(n\) 成反比、大样本正态。若再加同方差,OLS 在所有关于 \(Y\) 线性的条件无偏估计量中方差最小。

线性条件无偏估计量(linear conditionally unbiased estimators)

线性:

\[\tilde\beta_1=\sum_{i=1}^n a_iY_i\tag{5.24}\]
权重 \(a_i\) 可依赖 \(X_1,\dots,X_n\),不能依赖 \(Y\)。条件无偏:\(E(\tilde\beta_1\mid X_1,\dots,X_n)=\beta_1\)(5.25)。附录 5.2 证明 OLS 属于此类。

高斯—马尔可夫定理(Key Concept 5.5)

若 Key Concept 4.3 三条假设成立且误差同方差,则 \(\hat\beta_1\) 在给定 \(X_1,\dots,X_n\) 条件下,是所有线性条件无偏估计量中条件方差最小者,即最优线性(条件)无偏估计量(Best Linear conditionally Unbiased Estimator, BLUE)。这推广了 Key Concept 3.3"\(\bar Y\) 是线性无偏估计量中最有效者"的结论。定理成立的条件称高斯—马尔可夫条件(附录 5.2)。

两点局限:(1) 条件在实践中常不成立,尤其异方差普遍——异方差不影响基于稳健 SE 的推断,但 OLS 不再是 BLUE;(2) 即使条件成立,也存在非线性或非条件无偏的估计量,在某些条件下比 OLS 更有效。

OLS 以外的回归估计量

  • 加权最小二乘(weighted least squares, WLS):若已知 \(\operatorname{var}(u_i\mid X_i)\)(至多差一个比例常数),对第 \(i\) 个观测乘以条件方差平方根的倒数,加权后误差同方差,对加权数据做 OLS 即 BLUE。难点是实际中很少知道条件方差如何依赖 \(X_i\),故远不如 OLS 常用,详见第 18 章。
  • 最小绝对偏差(least absolute deviations, LAD):最小化 \(\sum_{i=1}^n|Y_i-b_0-b_1X_i|\) 而非平方和,对 \(u\) 中的大离群值不那么敏感。若极端离群值不罕见,LAD 等估计量可能更有效、推断更可靠。但多数经济数据中严重离群值罕见,故本书此后只讨论最小二乘方法。

*5.6 小样本时使用 t 统计量(Using the t-Statistic in Regression When the Sample Size Is Small,PDF p.196–197,选读)

小样本时 t 统计量的精确分布复杂,依赖未知的总体分布。若三条最小二乘假设成立、误差同方差且正态,则 OLS 估计量正态分布,仅同方差 t 统计量服从 Student t 分布。这五条合称同方差正态回归假设(homoskedastic normal regression assumptions)。

推导思路:\(t_m\) 分布定义为 \(Z/\sqrt{W/m}\),\(Z\sim N(0,1)\),\(W\sim\chi^2_m\),二者独立。仅同方差 t 统计量 \(\tilde t=(\hat\beta_1-\beta_{1,0})/\tilde\sigma_{\hat\beta_1}\)。在上述假设下,给定 \(X\) 时 \(Y_i\) 正态;\(\hat\beta_1\) 是 \(Y_i\) 的加权平均(权重依赖 X,见式 5.32),独立正态变量的加权平均仍正态,所以 \(\hat\beta_1-\beta_{1,0}\) 在零假设下条件正态、均值 0。第 18.4、19.4 节证明标准化后的仅同方差方差估计量服从 \(\chi^2_{n-2}/(n-2)\),且与 \(\hat\beta_1\) 独立。因此 \(\tilde t\sim t_{n-2}\)。

与 3.5 节关系:两总体正态、方差相同,用合并标准误(3.23)构造的 t 统计量服从 Student t;X 为二元时仅同方差 SE 正是合并 SE,所以 3.5 节结论是本结论的特例(习题 5.10)。

实践:若误差同方差且正态并使用仅同方差 t,临界值应取自 Student t 分布(附表 2)。但 \(n\) 中等或较大时 t 与正态差别可忽略。计量应用中极少有理由相信误差同方差且正态,而样本通常较大,因此标准做法仍是:稳健 SE + 标准正态分布计算 p 值、检验和置信区间。

5.7 结论(PDF p.197–198)

回到督学:420 个观测显示师生比与成绩负相关,系数在实际意义上中等偏大——师生比少 2,平均分高 4.6 分,约相当于把处于成绩分布第 50 百分位的学区移到第 60 百分位。系数在 5% 水平显著,纯靠抽样变异得到如此大的 t 的概率约 0.001%;95% CI 为 \([-3.30,-1.26]\)。

但疑虑仍在:这是否为因果效应?第一条最小二乘假设要求 X(班级规模)随机分配或"如同随机分配"(as-if randomly assigned),而加州数据是观测数据(observational data)。富裕学区更负担得起小班,同时还有更好的设施、更新的教材、薪酬更高的教师,学生家庭也更富裕;加州移民多,移民较穷且子女常非英语母语。负相关可能来自大班与这些"遗漏变量"(omitted variables)同时出现。单改师生比不会改变这些因素,所以需要能"保持其他因素不变"分离出师生比效应的方法——多元回归(第 6、7 章)。

本章小结、关键术语与习题(PDF p.199–206)

原书 Summary 五点:(1) 回归系数检验与总体均值检验类似,用 t 统计量算 p 值;95% CI = 估计 ± 1.96 SE。(2) X 为二元时,回归可估计并检验 X=0 组与 X=1 组的总体均值差。(3) 误差一般异方差;仅同方差 SE 在异方差下推断无效,稳健 SE 有效。(4) 三假设+同方差 ⇒ OLS 是 BLUE。(5) 再加误差正态 ⇒ 仅同方差 t 统计量在零假设下服从 Student t;中大样本时与正态差别可忽略。

关键术语:零假设、双侧备择、\(\hat\beta_1\) 的标准误、t 统计量、p 值、\(\beta_1\) 的置信区间、置信水平、指示/虚拟变量、\(D_i\) 的系数、同方差与异方差、仅同方差标准误、异方差稳健标准误、高斯—马尔可夫定理、BLUE、WLS、同方差正态回归假设、高斯—马尔可夫条件。

复习题(Review the Concepts)5.1–5.4:比较总体均值与回归斜率双侧检验 p 值的计算流程;何时用单侧检验、何时用置信区间代替检验;误差条件方差的性质及其对 OLS 的影响;虚拟变量与连续回归元在系数解释和推断上的差异。

习题概览:

  • 5.1:50 个班级,\(\widehat{TestScore}=640.3-4.93CS\),SE 为 (23.5)(2.02):构造 \(\beta_1\) 的 95% CI;双侧检验 \(\beta_1=0\) 的 p 值(5%、1% 水平);检验 \(\beta_1=-5.0\) 并判断 −5.0 是否在 CI 内;\(\beta_0\) 的 90% CI。
  • 5.2:200 男 240 女,\(\widehat{Wage}=10.73+1.78Male\),SE (0.16)(0.29):性别工资差距、显著性、CI、男女样本均值,以及改用 Female 虚拟变量回归时的系数、\(R^2\)、SER(考查虚拟变量重编码)。
  • 5.3:体重对身高回归,系数 4.16(SE 0.42),某人长高 2 英寸,求体重增量的 95% CI(考查式 5.13)。
  • 5.4:用式 (5.23) 预测 16 年教育者时薪;高中生读两年社区学院的预期涨幅;"大学毕业比高中多挣 10 美元/时"是否与回归一致,给出一致的取值范围。
  • 5.5–5.6:田纳西 STAR 随机实验(常规班约 24 人,小班约 15 人;总体均值 925、标准差 75),\(\widehat{TestScore}=918.0+13.9SmallClass\),SE (1.6)(2.5):效应大小与显著性、99% CI、随机分配下假设 1 是否成立;误差是否可能同方差,若同方差是否影响 CI 有效性。
  • 5.7:\(n=250\),\(\hat Y=5.4+3.2X\),SE (3.1)(1.5):检验、CI;若 X、Y 独立是否意外;若独立,重复抽样中拒绝比例与 CI 含 0 的比例(考查检验水平与覆盖率含义:约 5% 与 95%)。
  • 5.8:\(n=30\),误差正态且独立于 X,仅同方差 SE:\(\beta_0\) 的 CI,检验 \(\beta_1=55\) 双侧与单侧(考查小样本用 \(t_{28}\) 临界值)。
  • 5.9:过原点模型 \(Y_i=\beta X_i+u_i\),估计量 \(\bar Y/\bar X\) 是线性且条件无偏的。
  • 5.10:二元 X 时 \(\hat\beta_0=\bar Y_0\),\(\hat\beta_1=\bar Y_1-\bar Y_0\)。
  • 5.11:100 男 150 女周薪(均值 €565.89/€502.37,标准差 €75.62/€53.40),对 Women 虚拟变量回归求系数与 SE。
  • 5.12:由式 (4.20) 推导同方差下 \(\operatorname{var}(\hat\beta_0)\) 即 (5.28)。
  • 5.13:误差正态独立时 \(\hat\beta_1\) 是否条件无偏、是否 BLUE;放松为仅同方差、或仅三假设时结论如何变化。
  • 5.14:过原点模型在高斯—马尔可夫条件下推导 OLS、证明线性、条件无偏、求条件方差、证明 BLUE。
  • 5.15:两个独立样本(男、女)斜率之差的标准误 \(SE(\hat\beta_{m,1}-\hat\beta_{w,1})=\sqrt{SE(\hat\beta_{m,1})^2+SE(\hat\beta_{w,1})^2}\)。
  • 实证题:E5.1 收入对身高(全体/女/男,检验男女效应相同,限制在不需力量的职业);E5.2 Growth 对 TradeShare(剔除马耳他),显著性、p 值、90% CI;E5.3 宾州 1989 年出生体重与孕期吸烟:组均值、均值差及 SE、对 Smoker 回归并解释与均值差的关系、讨论 \(E(u\mid Smoker)=0\) 是否可信。

附录 5.1 OLS 标准误公式(Formulas for OLS Standard Errors,PDF p.207–208)

异方差稳健标准误:(5.4) 是把式 (4.19) \(\sigma^2_{\hat\beta_1}=\frac{1}{n}\frac{\operatorname{var}[(X_i-\mu_X)u_i]}{[\operatorname{var}(X_i)]^2}\) 中的总体方差换成样本对应量:分子用 \(\frac{1}{n-2}\sum(X_i-\bar X)^2\hat u_i^2\)(除以 \(n-2\) 是自由度调整,修正向下偏差,类似 SER),分母用 \(\frac1n\sum(X_i-\bar X)^2\)。一致性见 18.3 节。截距:

\[\hat\sigma^2_{\hat\beta_0}=\frac1n\times\frac{\frac{1}{n-2}\sum_{i=1}^n\hat H_i^2\hat u_i^2}{\left(\frac1n\sum_{i=1}^n\hat H_i^2\right)^2},\quad \hat H_i=1-\frac{\bar X}{\frac1n\sum X_i^2}X_i\tag{5.26}\]

仅同方差方差:\(\operatorname{var}(u_i\mid X_i)=\sigma_u^2\) 时

\[\sigma^2_{\hat\beta_1}=\frac{\sigma_u^2}{n\sigma_X^2}\tag{5.27}\qquad \sigma^2_{\hat\beta_0}=\frac{E(X_i^2)}{n\sigma_X^2}\sigma_u^2\tag{5.28}\]
推导 (5.27):\(\operatorname{var}[(X_i-\mu_X)u_i]=E\{[(X_i-\mu_X)u_i]^2\}\)(因为由假设 1,\(E[(X_i-\mu_X)u_i]=0\))\(=E[(X_i-\mu_X)^2\operatorname{var}(u_i\mid X_i)]\)(迭代期望律)\(=\sigma_u^2\sigma_X^2\),代入 (4.19) 即得。

仅同方差标准误:以样本矩替换总体矩、以 \(s^2_{\hat u}\)(SER²)估计 \(\sigma_u^2\):

\[\tilde\sigma^2_{\hat\beta_1}=\frac{s^2_{\hat u}}{\sum(X_i-\bar X)^2}\tag{5.29}\qquad \tilde\sigma^2_{\hat\beta_0}=\frac{\left(\frac1n\sum X_i^2\right)s^2_{\hat u}}{\sum(X_i-\bar X)^2}\tag{5.30}\]

附录 5.2 高斯—马尔可夫条件与定理证明(PDF p.208–211)

高斯—马尔可夫条件(对 \(i,j=1,\dots,n\)):

\[\text{(i) }E(u_i\mid X_1,\dots,X_n)=0;\quad\text{(ii) }\operatorname{var}(u_i\mid X_1,\dots,X_n)=\sigma_u^2,\ 0<\sigma_u^2<\infty;\quad\text{(iii) }E(u_iu_j\mid X_1,\dots,X_n)=0,\ i\ne j\tag{5.31}\]
即条件均值 0、常数方差、不同观测误差不相关。由三条最小二乘假设+同方差推出:i.i.d. 使 \(E(u_i\mid X_1..X_n)=E(u_i\mid X_i)=0\);同理条件方差 \(=\operatorname{var}(u_i\mid X_i)=\sigma_u^2\),四阶矩有限保证 \(0<\sigma_u^2<\infty\);i.i.d. 使 \(E(u_iu_j\mid X_i,X_j)=E(u_i\mid X_i)E(u_j\mid X_j)=0\)。

OLS 是线性条件无偏的:因 \(\sum(X_i-\bar X)=0\),\(\sum(X_i-\bar X)(Y_i-\bar Y)=\sum(X_i-\bar X)Y_i\),故

\[\hat\beta_1=\sum_{i=1}^n\hat a_iY_i,\quad \hat a_i=\frac{X_i-\bar X}{\sum_{j}(X_j-\bar X)^2}\tag{5.32}\]
权重只依赖 X,所以线性。条件无偏已在附录 4.3 证明;条件方差
\[\operatorname{var}(\hat\beta_1\mid X_1,\dots,X_n)=\frac{\sigma_u^2}{\sum(X_i-\bar X)^2}\tag{5.33}\]

定理证明:

  1. 对任一线性估计量代入模型:\(\tilde\beta_1=\beta_0\sum a_i+\beta_1\sum a_iX_i+\sum a_iu_i\)(5.34)。由条件 (i) 取条件期望得 \(E(\tilde\beta_1\mid X)=\beta_0\sum a_i+\beta_1\sum a_iX_i\);要对任意 \(\beta_0,\beta_1\) 都等于 \(\beta_1\),必须
    \[\sum a_i=0,\quad \sum a_iX_i=1\tag{5.35}\]
  2. 于是 \(\tilde\beta_1-\beta_1=\sum a_iu_i\),由条件 (ii)(iii) 交叉项为零:
    \[\operatorname{var}(\tilde\beta_1\mid X)=\sigma_u^2\sum a_i^2\tag{5.36}\]
    (5.35)(5.36) 对 OLS(\(a_i=\hat a_i\))同样成立。
  3. 令 \(a_i=\hat a_i+d_i\),则 \(\sum a_i^2=\sum\hat a_i^2+2\sum\hat a_id_i+\sum d_i^2\)。而 \(\sum\hat a_id_i=\frac{\sum d_iX_i-\bar X\sum d_i}{\sum(X_j-\bar X)^2}=\frac{(\sum a_iX_i-\sum\hat a_iX_i)-\bar X(\sum a_i-\sum\hat a_i)}{\sum(X_j-\bar X)^2}=0\)(两组权重都满足 5.35)。
  4. 故
    \[\operatorname{var}(\tilde\beta_1\mid X)-\operatorname{var}(\hat\beta_1\mid X)=\sigma_u^2\sum d_i^2\tag{5.37}\]
    只要某个 \(d_i\ne0\) 就严格更大;全部 \(d_i=0\) 时 \(\tilde\beta_1=\hat\beta_1\)。证毕,OLS 为 BLUE。

X 非随机时:若把假设 2 换成"\(X_1..X_n\) 在重复样本中固定、\(u_1..u_n\) i.i.d.",证明照搬,只是去掉"条件于 X"的表述。

样本均值是 \(E(Y)\) 的有效线性估计量:只有常数回归元 \(X_{0i}=1\) 时 \(\hat\beta_0=\bar Y\);没有回归元时同方差自动满足,所以 \(Y_i\) i.i.d. 时 \(\bar Y\) 是 BLUE,即 Key Concept 3.3。

本章要点

  1. 回归系数推断沿用"(估计量 − 假设值)/ 标准误"的 t 统计量框架;大样本下 t 近似标准正态,双侧 5% 临界值 1.96,单侧 1.64(1% 单侧 2.33)。p 值 = 零假设下得到至少同样极端统计量的概率。
  2. 95% 置信区间 \(\hat\beta\pm1.96SE\),等价于"5% 双侧检验不能拒绝的值的集合";\(X\) 变动 \(\Delta x\) 的效应区间是端点乘以 \(\Delta x\)。
  3. 二元回归元的系数是两组条件均值之差,截距是基组均值;回归 t 检验即均值差检验。
  4. 同方差只是特例;异方差下仅同方差 SE 导致错误推断,而异方差稳健(Eicker–Huber–White)SE 在两种情形下都有效——默认用稳健 SE。
  5. 高斯—马尔可夫定理:三假设+同方差 ⇒ OLS 是 BLUE;异方差下 OLS 仍无偏一致但不再最优,WLS(需已知方差形式)或 LAD(离群值多时)可能更有效。
  6. 再加误差正态,仅同方差 t 精确服从 \(t_{n-2}\);大样本下区别可忽略。
  7. 统计显著不等于因果:观测数据中遗漏变量可能使 \(E(u\mid X)\ne0\),引出多元回归。

与量化交易的关联

  • 因子检验:单因子时间序列回归(如资产超额收益对市场超额收益回归得到 alpha、beta)或截面回归中,因子系数的 t 值、p 值、置信区间就是本章框架。金融收益普遍存在异方差(波动率聚集、高波动股票残差更大),必须使用稳健 SE,否则 t 值虚高、产生伪因子;时间序列中还需进一步用 HAC(Newey–West)标准误处理自相关(第 15/16 章内容),Fama–MacBeth 截面回归的 t 值也基于同样逻辑。
  • 单侧检验与多重检验的谨慎:本章强调单侧检验须有先验理由;在因子挖掘中事后选单侧等于把门槛降到 1.64,相当于放大假阳性,应与"因子动物园"、t>3 门槛的讨论结合讲。
  • 虚拟变量回归:事件研究(公告日/非公告日)、日历效应(一月效应、周一效应)、多空组合收益差均可写成对虚拟变量的回归,系数即均值差,t 检验即均值差检验。
  • WLS 与 LAD:截面回归中按市值平方根或残差方差倒数加权(Barra 风险模型的 WLS 截面回归)正是 WLS 思想;收益分布厚尾时 LAD/分位数回归或稳健回归可降低离群值影响。
  • 小样本 t 分布:月度策略回测往往只有几十个观测,正态+同方差假设很少成立,t 分布修正只是粗略近似,宜辅以 bootstrap。
  • 因果谨慎:5.7 节的遗漏变量担忧直接对应因子研究中的"控制规模/行业/风格后是否仍显著"。

推荐习题

  • 5.1、5.7:t 检验、p 值、置信区间的完整流程,以及 5.7(d) 对检验水平和覆盖率的频率解释。
  • 5.2、5.10、5.11:虚拟变量回归与均值差的等价性,以及重编码虚拟变量后系数如何变化。
  • 5.6、5.13:同方差/异方差对 SE 有效性和 BLUE 性质的影响,辨析各假设的作用。
  • 5.14:过原点回归的完整 BLUE 证明,是高斯—马尔可夫定理的最佳练手题。
  • 5.15:独立样本系数差的标准误,可直接用于比较两个子样本(如牛熊市)的 beta。
  • E5.3:用真实数据体会均值差、回归系数与因果解释的关系。

第 6 章 多元回归元线性回归(Linear Regression with Multiple Regressors)

章引言(PDF p.212)

第 5 章结尾的担忧:小班学区学生可能有其他优势,导致班级规模因果效应估计误导。遗漏因素(如学生特征)会使 OLS 估计量有偏,即遗漏变量偏差(omitted variable bias)。本章引入多元回归(multiple regression):若有遗漏变量的数据,把它们作为额外回归元,就能在保持其他变量不变的情况下估计某一回归元(师生比)的因果效应。若目的不是因果推断而是预测,多元回归允许用多个预测变量(predictors)改进单变量预测。多元回归的许多方面与第 4、5 章平行:系数可用 OLS 估计,OLS 估计量是随机变量,大样本下抽样分布近似正态。

6.1 遗漏变量偏差(Omitted Variable Bias,PDF p.212–218)

忽略学区中英语学习者(English learners,尚未掌握英语的非母语学生)比例,可能使 STR 系数有偏:英语学习者成绩更差,而若大班学区英语学习者更多,单回归会把这一影响错误归于班级规模。加州数据中 STR 与英语学习者比例的相关系数为 0.19(小但为正)。

定义与两个条件(Key Concept 6.1)

遗漏变量偏差是 X 与某遗漏变量相关时 OLS 对 X 因果效应估计的偏差。发生需同时满足:

  1. X 与遗漏变量相关;
  2. 遗漏变量是因变量 Y 的决定因素。

三个例子:

  • 英语学习者比例:与 STR 相关(条件 1 成立),且很可能影响成绩(条件 2 成立)→ 可能产生偏差。
  • 考试时间(time of day):若各学区考试时间与班级规模无关,条件 1 不成立;时间确实可能影响成绩(条件 2 成立)。因不相关,STR 不会错误吸收"时间效应"→ 无偏差。
  • 人均停车场面积:教师多的学校停车位可能多,条件 1 成立;但学习发生在教室而非停车场,条件 2 不成立→ 无偏差。

与第一条最小二乘假设的关系

误差项 \(u_i\) 包含 \(X_i\) 以外所有决定 \(Y_i\) 的因素。遗漏变量若决定 Y 则在 u 中,若又与 X 相关,则 u 与 X 相关,\(E(u_i\mid X_i)\ne0\),违反假设 1。后果严重:OLS 有偏,且偏差在大样本中不消失,估计量不一致(inconsistent)。

遗漏变量偏差公式

设 \(\operatorname{corr}(X_i,u_i)=\rho_{Xu}\ne0\),其余两条假设成立,则(附录 6.1 推导)

\[\hat\beta_1\xrightarrow{p}\beta_1+\rho_{Xu}\frac{\sigma_u}{\sigma_X}\tag{6.1}\]
推导:由 (4.28) \(\hat\beta_1=\beta_1+\frac{\frac1n\sum(X_i-\bar X)u_i}{\frac1n\sum(X_i-\bar X)^2}\)(6.19),分母依概率收敛到 \(\sigma_X^2\),分子收敛到 \(\operatorname{cov}(u_i,X_i)=\rho_{Xu}\sigma_u\sigma_X\),代入即得。

公式含义:

  1. 无论样本大小都是问题:\(\hat\beta_1\) 不依概率收敛于 \(\beta_1\),有偏且不一致;\(\rho_{Xu}\sigma_u/\sigma_X\) 就是大样本中仍存在的偏差。
  2. 偏差大小取决于 \(|\rho_{Xu}|\),越大偏差越大。
  3. 偏差方向取决于 X 与 u 正相关还是负相关。例:英语学习者比例对成绩有负效应,以负号进入 u;它与 STR 正相关,所以 STR 与 u 负相关,\(\rho_{Xu}<0\),\(\hat\beta_1\) 偏向更负。即英语学习者少的学区既成绩高又班级小,OLS 显示"小班提高成绩"的部分原因可能是小班学区英语学习者少。

方框:咖啡对健康有益吗?(PDF p.215–216)

《内科学年鉴》2017 年研究(10 个欧洲国家 521,330 人,平均跟踪 16 年,记录 41,693 例死亡)发现喝咖啡与较低疾病/死亡风险相关;《美国医学会杂志》2018 年研究称每天 6–7 杯咖啡与死亡风险低 16% 相关,英国媒体标题"每天六杯咖啡能救命"。但可能存在遗漏变量偏差:已知自己有病的人可能不喝咖啡;咖啡可能是收入、教育、贫困等影响健康因素的替代指标。随机对照试验(randomized controlled trials, RCTs)消除人们自选是否喝、喝多少,从而消除这些偏差。还有些相关既非真实关系也非遗漏变量所致,纯属巧合,如"Spurious Correlations"网站展示的人均马苏里拉奶酪消费量与土木工程博士授予数的高度相关——解读回归要谨慎。

按组划分数据处理遗漏变量偏差(PDF p.216–218)

思路:选英语学习者比例相同但班级规模不同的学区子集,在其中班级规模无法代理英语学习者效应。表 6.1 先按英语学习者比例四分位分为四组,再在每组内按 STR<20 与 ≥20 分为小班/大班:

英语学习者比例 小班均分 (n) 大班均分 (n) 差 t
全部学区 657.4 (238) 650.0 (182) 7.4 4.04
<1.9% 664.5 (76) 665.4 (27) −0.9 −0.30
1.9–8.8% 665.2 (64) 661.8 (44) 3.3 1.13
8.8–23.0% 654.9 (54) 649.7 (50) 5.2 1.72
>23.0% 636.7 (44) 634.8 (61) 1.9 0.68

全样本差 7.4(t=4.04,1% 水平显著);组内差距只有约一半或更少,最低四分位甚至小班低 0.9 分。为何总效应是任一组内效应的两倍?英语学习者最多的学区既成绩最低又师生比最高:最低与最高四分位平均分相差约 30 分;最低四分位中 74%(76/103)为小班,最高四分位只有 42%(44/105)。这一分析印证了遗漏变量偏差担忧,并优于简单均值差,但仍未给出"保持英语学习者比例不变时改变班级规模"的可用估计——需要多元回归。(此即辛普森悖论式的现象。)

6.2 多元回归模型(The Multiple Regression Model,PDF p.217–219)

多元回归模型把第 4、5 章扩展到多个回归元。用于因果推断时可估计改变 \(X_{1i}\) 而保持 \(X_{2i},X_{3i},\dots\) 不变时对 \(Y_i\) 的效应;用于预测时以多个变量改进预测。本章先在预测语境下介绍术语,6.5 节再回到因果推断。

总体回归线

两个自变量时

\[E(Y_i\mid X_{1i}=x_1,X_{2i}=x_2)=\beta_0+\beta_1x_1+\beta_2x_2\tag{6.2}\]
称总体回归线(population regression line)或总体回归函数。\(\beta_0\) 为截距,\(\beta_1\) 为 \(X_{1i}\) 的斜率系数或"\(X_{1i}\) 的系数",\(\beta_2\) 同理。

\(\beta_1\) 的解释与单回归不同:它是在保持 \(X_2\) 不变(holding \(X_2\) constant)或控制 \(X_2\)(controlling for \(X_2\))时,\(X_1\) 相差一单位的两个观测之间 Y 预测值之差。推导:第一个观测 \(Y=\beta_0+\beta_1X_1+\beta_2X_2\),第二个 \(Y+\Delta Y=\beta_0+\beta_1(X_1+\Delta X_1)+\beta_2X_2\)(6.3),相减得 \(\Delta Y=\beta_1\Delta X_1\),

\[\beta_1=\frac{\Delta Y}{\Delta X_1},\quad X_2\text{ 保持不变}\tag{6.4}\]
也称 \(X_1\) 对 Y 的偏效应(partial effect)。截距 \(\beta_0\) 是 \(X_1=X_2=0\) 时 Y 的期望值,决定回归线在 Y 轴上的起点。

总体多元回归模型

加入误差项 \(u_i\) 吸收其他因素(学校特征、其他学生特征、运气):

\[Y_i=\beta_0+\beta_1X_{1i}+\beta_2X_{2i}+u_i\tag{6.5}\]
可把 \(\beta_0\) 看作常数回归元(constant regressor)\(X_{0i}=1\) 的系数:\(Y_i=\beta_0X_{0i}+\beta_1X_{1i}+\beta_2X_{2i}+u_i\)(6.6),\(\beta_0\) 也称常数项(constant term)。

Key Concept 6.2(多元回归模型):

\[Y_i=\beta_0+\beta_1X_{1i}+\beta_2X_{2i}+\cdots+\beta_kX_{ki}+u_i,\quad i=1,\dots,n\tag{6.7}\]
总体回归线 \(E(Y\mid X_{1i}=x_1,\dots,X_{ki}=x_k)=\beta_0+\beta_1x_1+\cdots+\beta_kx_k\);\(\beta_1\) 是保持其他回归元不变时 \(X_1\) 一单位差异对应的 Y 期望差;\(\beta_0\) 是所有 X 为 0 时 Y 的期望。

同方差推广:若 \(\operatorname{var}(u_i\mid X_{1i},\dots,X_{ki})\) 为常数则同方差,否则异方差。

6.3 多元回归中的 OLS 估计量(The OLS Estimator in Multiple Regression,PDF p.220–222)

令 \(b_0,\dots,b_k\) 为候选估计值,预测误差平方和

\[\sum_{i=1}^n(Y_i-b_0-b_1X_{1i}-\cdots-b_kX_{ki})^2\tag{6.8}\]
使之最小的 \(\hat\beta_0,\dots,\hat\beta_k\) 即 OLS 估计量。OLS 回归线 \(\hat\beta_0+\hat\beta_1X_{1i}+\cdots+\hat\beta_kX_{ki}\);预测值 \(\hat Y_i\);残差 \(\hat u_i=Y_i-\hat Y_i\)。可试错求解,但用微积分推导的显式公式更容易;多元情形最好用矩阵表示,推迟到 19.1 节。

Key Concept 6.3:OLS 估计量最小化 \(\sum(Y_i-b_0-\cdots-b_kX_{ki})^2\);预测值 \(\hat Y_i=\hat\beta_0+\hat\beta_1X_{1i}+\cdots+\hat\beta_kX_{ki}\)(6.9),残差 \(\hat u_i=Y_i-\hat Y_i\)(6.10);它们是未知总体系数和误差项的估计。

应用

单回归 \(\widehat{TestScore}=698.9-2.28\times STR\)(6.11),\(R^2\) 仅 0.051。加入英语学习者百分比 PctEL:

\[\widehat{TestScore}=686.0-1.10\times STR-0.65\times PctEL\tag{6.12}\]
STR 系数约减半(−1.10 vs. −2.28),因为多元回归控制了 PctEL,单回归没有。这与表 6.1 的发现一致,强烈提示 (6.11) 的因果估计存在遗漏变量偏差。预测质量是否提高需要拟合度量。

6.4 多元回归的拟合度量(Measures of Fit in Multiple Regression,PDF p.222–225)

回归标准误(SER)

估计 \(u_i\) 的标准差,衡量 Y 围绕回归线的离散:

\[SER=s_{\hat u}=\sqrt{s_{\hat u}^2},\quad s^2_{\hat u}=\frac{1}{n-k-1}\sum_{i=1}^n\hat u_i^2=\frac{SSR}{n-k-1}\tag{6.13}\]
SSR 为残差平方和。除以 \(n-k-1\) 是自由度调整(degrees-of-freedom adjustment),修正估计 \(k+1\) 个系数带来的向下偏差;\(k=1\) 时即 4.3 节的 \(n-2\)。\(n\) 大时影响可忽略。

\(R^2\)

\[R^2=\frac{ESS}{TSS}=1-\frac{SSR}{TSS}\tag{6.14}\]

\(ESS=\sum(\hat Y_i-\bar Y)^2\),\(TSS=\sum(Y_i-\bar Y)^2\)。除非新回归元系数估计恰为 0,增加回归元总会使 \(R^2\) 上升(永不下降):OLS 最小化 SSR,若新系数取 0 则 SSR 不变,取任何非零值必然是因为它降低了 SSR。

调整 \(R^2\)(adjusted \(R^2\), \(\bar R^2\))

\(R^2\) 上升不代表模型真正改进,它夸大了拟合。修正:

\[\bar R^2=1-\frac{n-1}{n-k-1}\frac{SSR}{TSS}=1-\frac{s^2_{\hat u}}{s^2_Y}\tag{6.15}\]
即 1 减去(经自由度调整的)残差样本方差与 Y 样本方差之比。三点性质:(1) \((n-1)/(n-k-1)>1\),所以 \(\bar R^2<R^2\);(2) 加回归元有两个相反效应——SSR 下降使 \(\bar R^2\) 升,因子 \((n-1)/(n-k-1)\) 增大使其降,净效应看哪个更强;(3) \(\bar R^2\) 可以为负,当回归元整体减少 SSR 太少、不足以抵消因子时。

应用

(6.12):\(R^2=0.426\),\(\bar R^2=0.424\),SER=14.5。与仅 STR 回归(\(R^2=0.051\),SER=18.6)相比,加入 PctEL 后解释了 42.6% 的成绩变异,SER 下降意味着预测更精确(SER 单位为考试分数)。\(n\) 大且只有两个回归元,故 \(R^2\) 与 \(\bar R^2\) 差别很小。

如何使用 \(R^2\) 与 \(\bar R^2\)

\(R^2\) 量化回归元解释因变量变异的程度,但过度依赖是陷阱:

  • 目标为样本外预测时,回归元过多可能样本内拟合好但样本外表现变差;\(\bar R^2\) 有所改进,但单纯最大化 \(\bar R^2\) 仍可能产生差的样本外预测(第 14 章再谈)。
  • 目标为因果推断时,是否纳入变量应看它能否帮助更好估计关注的因果效应,而非是否提高 \(R^2\)。

6.5 多元回归因果推断的最小二乘假设(The Least Squares Assumptions for Causal Inference in Multiple Regression,PDF p.225–227)

此处假定所有 \(\beta_1,\dots,\beta_k\) 都是关注的因果效应(6.8 节讨论只有部分系数为因果效应、其余为控制变量的情形;附录 6.4 给出预测用的假设)。

  • 假设 1:\(E(u_i\mid X_{1i},\dots,X_{ki})=0\)。若 X 随机分配或如同随机分配则成立;是 OLS 无偏的关键。
  • 假设 2:\((X_{1i},\dots,X_{ki},Y_i)\) i.i.d.;简单随机抽样自动满足。
  • 假设 3:大离群值不太可能,即 \(0<E(X_{1i}^4)<\infty,\dots,0<E(X_{ki}^4)<\infty\),\(0<E(Y_i^4)<\infty\),也就是峰度有限;用于推导大样本性质,提醒 OLS 对离群值敏感。
  • 假设 4(新增):无完全多重共线性(no perfect multicollinearity)。若某回归元是其他回归元的完全线性函数,称回归元完全多重共线(perfectly multicollinear),此时无法计算 OLS。

为何无法计算:例如误把 STR 输入两次(TestScore 对 STR 和 STR 回归)。软件要么删掉一个 STR,要么报错;数学上 OLS 公式出现除以 0。直观上是在问一个不合逻辑的问题——"保持 STR 不变时 STR 变化的效应"。解决办法是修正打字错误、换成原本想要的变量。完全多重共线通常反映回归元选择上的逻辑错误或数据集中未被注意的特征,一般通过修改回归元消除。

Key Concept 6.4 汇总上述四条假设(模型中 \(\beta_1,\dots,\beta_k\) 为因果效应)。

6.6 多元回归中 OLS 估计量的分布(The Distribution of the OLS Estimators in Multiple Regression,PDF p.227–228)

样本不同则 OLS 估计值不同,这种变异由抽样分布概括。单回归的结论推广:在 Key Concept 6.4 假设下,\(\hat\beta_0,\dots,\hat\beta_k\) 无偏、一致;大样本下联合抽样分布近似多元正态(multivariate normal,二元正态的推广,见 2.4 节)。原因相同:OLS 估计量是随机样本数据的平均,中心极限定理适用。表达式需矩阵代数,推迟到第 19 章。

Key Concept 6.5:若假设成立,大样本下 \(\hat\beta_0,\dots,\hat\beta_k\) 联合正态,各 \(\hat\beta_j\sim N(\beta_j,\sigma^2_{\hat\beta_j})\)。一般而言 OLS 估计量之间相关,相关性来自回归元间的相关(附录 6.2 讨论两回归元同方差情形,一般情形见 19.2 节)。

6.7 多重共线性(Multicollinearity,PDF p.228–231)

完全多重共线:某回归元是其他回归元的完全线性组合。不完全多重共线(imperfect multicollinearity):某回归元与其他回归元高度但非完全相关;不妨碍估计,也不意味着回归元选择有逻辑问题,但可能使某些系数估计不精确。

完全多重共线的例子(在 (6.12) 基础上加第三个回归元)

  1. 英语学习者分数 FracEL(0–1):\(PctEL_i=100\times FracEL_i\),完全线性相关,无法估计。直观上问的是"保持分数不变时百分比变化一单位的效应",毫无意义。
  2. "非很小"班级 NVS:\(NVS_i=1\) 若 \(STR_i\ge12\)。数据中最小 STR 为 14,故 NVS 对所有观测为 1,等于常数回归元 \(X_{0i}\)。两点启示:有截距时,常数回归元也可能卷入完全共线;完全共线是关于手头数据集的陈述——可以想象 STR<12 的学区,但数据里没有,就无法分析。
  3. 英语使用者百分比 PctES:\(PctES_i=100-PctEL_i=100X_{0i}-PctEL_i\)。启示:完全共线是整组回归元的特征,去掉截距或 PctEL 任一个就不再共线。

虚拟变量陷阱(dummy variable trap)

学区分为农村、郊区、城市三类,每个学区属于且仅属于一类。若同时纳入 Rural、Suburban、Urban 三个虚拟变量和常数项,则 \(Rural_i+Suburban_i+Urban_i=1=X_{0i}\),完全共线,必须去掉四者之一。惯例保留常数项、去掉一个虚拟变量。例如去掉 Rural,则 Suburban 的系数是保持其他变量不变时郊区与农村学区的平均分差。一般地:G 个互斥且穷尽的类别虚拟变量 + 截距 + 全部 G 个虚拟变量 ⇒ 完全共线。通常做法是只放 G−1 个,系数表示相对于被省略的基准类(base case)的增量效应;或者去掉截距、放入全部 G 个。

完全共线的解决

通常源于设定错误,有时易发现(例 1),有时不易(例 2)。软件无法计算 OLS 时会提示;应理解来源并修改回归。有些软件在完全共线时不可靠,至少你会把回归元选择权让给计算机。

不完全多重共线

两个或多个回归元高度相关,即存在回归元的某个线性函数与另一回归元高度相关。它对 OLS 理论没有任何问题;相反,OLS 的用途之一就是在回归元相关时分离各自的独立影响。但至少一个回归元的系数会估计得不精确。例:加入第一代移民比例,它与 PctEL 高度相关(移民多的学区英语学习者多),数据中很少有"英语学习者少但移民多"或反之的学区,因此难以估计保持移民比例不变时 PctEL 的系数,方差变大。

数学上(附录 6.2 式 6.20):两回归元、同方差时 \(\operatorname{var}(\hat\beta_1)\propto1/(1-\rho^2_{X_1,X_2})\),相关越强方差越大。完全共线通常意味着逻辑错误;不完全共线不一定是错误,而是 OLS、数据和问题本身的特征——若这些变量正是为处理遗漏变量偏差而有意纳入的,不完全共线只是意味着用手头数据难以精确估计某些偏效应。

6.8 控制变量与条件均值独立(Control Variables and Conditional Mean Independence,PDF p.231–234)

区分关注变量(variable of interest,要估计其因果效应)与控制变量(control variable):控制变量本身不是研究对象,纳入它是为了保持某些因素不变,避免关注变量的因果效应估计受遗漏变量偏差影响。由此修改假设 1:若新假设成立,关注变量的 OLS 估计无偏,但控制变量的系数一般有偏、没有因果解释。

例:免费午餐比例

"校外学习机会"难以度量,但与可度量的学生经济背景相关。加入获得免费或减价午餐的学生百分比 LchPct(家庭收入低于约 1.5 倍贫困线才有资格,衡量经济困难学生比例):

\[\widehat{TestScore}=700.2-1.00\times STR-0.122\times PctEL-0.547\times LchPct\tag{6.16}\]
STR 系数从 −1.10 仅略变为 −1.00,结论基本不变。LchPct 系数很大:LchPct 从 0% 到 50%,成绩差 \(0.547\times50=27.4\) 分,约相当于表 4.1 中第 75 与第 25 百分位之差。若督学据此取消午餐项目使 LchPct 降为 0,成绩会提高吗?常识说不会,让学生挨饿可能适得其反。那么把 STR 系数视为因果、却不把 LchPct 系数视为因果,是否合理?

带控制变量的模型与条件均值独立

k 个关注变量 X、r 个控制变量 W:

\[Y_i=\beta_0+\beta_1X_{1i}+\cdots+\beta_kX_{ki}+\beta_{k+1}W_{1i}+\cdots+\beta_{k+r}W_{ri}+u_i\tag{6.18}\]
\(\beta_1,\dots,\beta_k\) 为因果效应。纳入控制变量的目的是:一旦控制住 W,关注变量就不再与误差相关。用条件均值独立(conditional mean independence)替换假设 1:给定关注变量和控制变量时,\(u_i\) 的条件期望不依赖关注变量(但可依赖控制变量)。

Key Concept 6.6(带控制变量的因果推断最小二乘假设):

  1. \(E(u_i\mid X_{1i},\dots,X_{ki},W_{1i},\dots,W_{ri})=E(u_i\mid W_{1i},\dots,W_{ri})\)(条件均值独立,6.17);
  2. \((X,W,Y)\) i.i.d.;
  3. 所有 X、W、Y 四阶矩非零有限;
  4. 无完全多重共线。

含义:控制 W 后,X 可视为如同随机分配,u 的条件均值不再依赖 X,OLS 可估计 X 的因果效应。控制变量本身仍与误差相关,其系数受遗漏变量偏差影响、没有因果解释(附录 6.5 证明)。这不成问题,因为我们关心的是 X 的系数。

在班级规模例子中:LchPct 可能与校外学习机会等进入误差的因素相关——这正是它作为控制变量有用的原因,也正因此其系数无因果解释。条件均值独立要求的是:在 PctEL 和 LchPct 相同的学校之间,班级规模如同随机分配。若如此,STR 系数有因果解释,而 LchPct 系数没有。该假设为选择控制变量、判断其是否充分提供了指导。

6.9 结论(PDF p.234–235)

单回归易受遗漏变量偏差影响:遗漏变量若决定 Y 且与回归元相关,OLS 估计会混合两者效应。多元回归通过纳入遗漏变量来缓解或消除偏差;系数是保持其他回归元不变时的偏效应。纳入 PctEL 使 STR 效应估计减半。多元回归的假设是单回归三条假设的推广加上无完全多重共线。OLS 估计量有联合抽样分布,其不确定性的量化是下一章主题。

原书 Summary:(1) 遗漏变量偏差需遗漏变量与回归元相关且决定 Y;(2) 多元回归系数是保持其他回归元不变时的期望差;(3) Key Concept 6.4 四条假设成立时,因果效应的 OLS 估计无偏、一致、大样本正态;(4) 控制变量的作用是保持遗漏因素不变,使关注变量与误差不相关;(5) 完全多重共线通常源于回归元选择错误,需改变回归元集合;(6) SER、\(R^2\)、\(\bar R^2\) 是拟合度量。

关键术语:遗漏变量偏差、多元回归模型、总体回归线/函数、截距、斜率系数、保持不变/控制、偏效应、常数回归元、常数项、同方差/异方差、OLS 估计量、OLS 回归线、预测值、残差、\(R^2\)、调整 \(R^2\)、完全多重共线、虚拟变量陷阱、不完全多重共线、控制变量、带控制变量的多元回归模型、条件均值独立。

复习题与习题(PDF p.236–243)

复习题 6.1–6.5:研究私立学校学习效果却缺班级规模数据,遗漏后私立学校指示变量系数如何、增大样本是否消除;给定两回归元模型,计算 X1 增 8、X2 减 3、X1 增 4 且 X2 减 7 时 Y 的期望变化;常用拟合度量及 \(\bar R^2\) 为何可为负;虚拟变量陷阱及解决;完全与不完全共线的区别和对策。

习题 6.1–6.4 基于 2015 年 CPS 数据(7178 名 25–34 岁全职全年工人,学历为高中或学士)对 AHE(平均时薪)回归的表:

回归元 (1) (2) (3)
College 10.47 10.44 10.42
Female −4.69 −4.56 −4.57
Age — 0.61 0.61
Northeast — — 0.74
Midwest — — −1.54
South — — −0.44
截距 18.15 0.11 0.33
SER 12.15 12.03 12.01
\(R^2\) 0.165 0.182 0.185

题目:计算各回归的 \(\bar R^2\);大学学历与性别溢价;年龄是否重要,预测 29 岁与 34 岁女大学毕业生收入;区域差异、为何省略 West(虚拟变量陷阱)、南部与中西部同龄女大学毕业生的预期收入差(−0.44 − (−1.54) = 1.10)。

  • 6.5:200 套房屋销售,\(\widehat{Price}=109.7+0.567BDR+26.9Bath+0.239Hsize+0.005Lsize+0.1Age-56.9Poor\),\(R^2=0.85\),SER=45.8:把家庭室改为浴室(面积不变)的增值;新增 80 平方英尺浴室的增值(26.9+0.239×80);房屋变"差"的损失;计算 \(\bar R^2\)。考查偏效应的"保持其他不变"。
  • 6.6:亚洲国家丑闻数对法制强弱指示变量回归,判断遗漏变量偏差及方向(用式 6.1)。
  • 6.7:评析研究设计——名校招生种族歧视的均值差检验(未控制申请者资质);母亲教育对子女教育的影响。
  • 6.8:开罗 1000 人调查,常吃巧克力者体重更轻但摄入热量更多,能否建议吃巧克力减肥(相关≠因果)。
  • 6.9:X1 与 X2 不相关时遗漏 X2 是否产生偏差(否)。
  • 6.10:\(\operatorname{var}(u\mid X)=4\),\(\operatorname{var}(X_1)=6\),\(n=400\),分别在 \(\rho=0\)、0.5 下用 (6.20) 算 \(\operatorname{var}(\hat\beta_1)\)(\(4/(400\times6)\) 与再除以 0.75);评析"相关时最好把 X2 排除"的说法(错误,会导致遗漏变量偏差)。
  • 6.11(微积分):无截距两回归元模型的 OLS 一阶条件;\(\sum X_{1i}X_{2i}=0\) 时 \(\hat\beta_1=\sum X_{1i}Y_i/\sum X_{1i}^2\);一般表达式;有截距时 \(\hat\beta_0=\bar Y-\hat\beta_1\bar X_1-\hat\beta_2\bar X_2\);X1 与 X2 样本去均值后正交时多元系数等于单回归系数。
  • 6.12:二年级小班实验,老生 50% 分到小班,新生仅 20%:\(E(u\mid X)=0\) 是否成立;加入新生指示变量 W 后 \(\beta_1\) 是否无偏(是,条件均值独立),\(\beta_2\) 是否是"转学"的因果效应(否)。
  • E6.1:出生体重对吸烟、饮酒、产检次数回归,判断遗漏变量偏差,预测,\(R^2\) 与 \(\bar R^2\),Nprevist 系数的非因果解释;用附录 6.3 的 Frisch–Waugh 三步法复核吸烟系数;用 Tripre0–Tripre3 虚拟变量代替产检次数(为何排除 Tripre1)。
  • E6.2:Growth 数据(剔除马耳他)描述统计表,Growth 对 TradeShare、YearsSchool、Rev_Coups、Assassinations、RGDP60 回归,解释政变系数,预测均值国家增长率及 TradeShare 高一个标准差时的变化,为何省略 Oil(提示:剔除马耳他后样本中 Oil 没有变化,纳入会造成完全多重共线)。

附录 6.1 式 (6.1) 的推导(PDF p.243)

见 6.1 节公式部分。

附录 6.2 两回归元、同方差时 OLS 的分布(PDF p.244)

同方差 \(\operatorname{var}(u_i\mid X_{1i},X_{2i})=\sigma_u^2\),大样本下 \(\hat\beta_1\sim N(\beta_1,\sigma^2_{\hat\beta_1})\),

\[\sigma^2_{\hat\beta_1}=\frac1n\left(\frac{1}{1-\rho^2_{X_1,X_2}}\right)\frac{\sigma_u^2}{\sigma^2_{X_1}}\tag{6.20}\]
\(\rho_{X_1,X_2}\) 为两回归元总体相关系数。高度正或负相关时 \(1-\rho^2\) 接近 0,方差变大(即方差膨胀因子 VIF \(=1/(1-\rho^2)\) 的来源)。此外 \(\hat\beta_1,\hat\beta_2\) 一般相关,同方差时
\[\operatorname{corr}(\hat\beta_1,\hat\beta_2)=-\rho_{X_1,X_2}\tag{6.21}\]
(习题 19.18)。

附录 6.3 Frisch–Waugh 定理(PDF p.244–245)

多元回归中 \(\beta_1\) 的 OLS 估计可分三步:

  1. \(X_1\) 对 \(X_2,\dots,X_k\)(含常数)回归,残差记 \(\tilde X_1\);
  2. \(Y\) 对 \(X_2,\dots,X_k\) 回归,残差记 \(\tilde Y\);
  3. \(\tilde Y\) 对 \(\tilde X_1\) 回归。 第 3 步系数等于多元回归中 \(X_1\) 的系数(证明见习题 19.17)。含义:前两步从 Y 和 \(X_1\) 中剔除与其他 X 相关的变异,第三步用剩余变异估计 \(X_1\) 效应——这就是"控制其他变量"的数学意义。

由此可从 (5.27) 推出 (6.20):\(\hat\beta_1\) 是 \(\tilde Y\) 对 \(\tilde X_1\) 的回归系数,故仅同方差方差为 \(\sigma_u^2/(n\sigma^2_{\tilde X_1})\);而 \(\tilde X_1\) 是 \(X_1\) 对 \(X_2\) 回归的残差,由 (6.15) \(s^2_{\tilde X_1}=(1-\bar R^2_{X_1,X_2})s^2_{X_1}\),再由 \(\bar R^2_{X_1,X_2}\xrightarrow{p}\rho^2_{X_1,X_2}\) 等极限即得。

附录 6.4 多元回归预测的最小二乘假设(PDF p.245)

样本外观测 \((X_1^{oos},\dots,X_k^{oos},Y^{oos})\),目标是给定 X 预测 \(Y^{oos}\)。设 \(E(Y\mid X_1..X_k)=\beta_0+\beta_1X_1+\cdots+\beta_kX_k\),\(u=Y-E(Y\mid X)\)。假设:(1) 样本外观测与样本内来自同一总体分布;(2) 样本内 i.i.d.;(3) 四阶矩有限;(4) 无完全共线。此时 \(\beta\) 定义为总体条件期望的系数,可能有也可能没有因果解释。由定义 \(E(u_i\mid X)=0\) 自动成立,OLS 对这些系数无偏,并在假设 2–4 下一致、大样本正态。样本外预测无偏:

\[E(\hat Y^{oos}\mid X^{oos}=x^{oos})=E(\hat\beta_0)+E(\hat\beta_1)x_1^{oos}+\cdots=\beta_0+\beta_1x_1^{oos}+\cdots+\beta_kx_k^{oos}=E(Y^{oos}\mid X^{oos}=x^{oos})\tag{6.22}\]
第三个等号用到样本外与样本内独立以及 OLS 无偏,最后一个用到同分布。

附录 6.5 带控制变量时 OLS 的分布(PDF p.245–246)

设条件期望线性:\(E(u_i\mid X,W)=E(u_i\mid W)=\gamma_0+\gamma_1W_{1i}+\cdots+\gamma_rW_{ri}\)(6.23)。则

\[E(Y_i\mid X,W)=(\beta_0+\gamma_0)+\beta_1X_{1i}+\cdots+\beta_kX_{ki}+(\beta_{k+1}+\gamma_1)W_{1i}+\cdots+(\beta_{k+r}+\gamma_r)W_{ri}\tag{6.24}\]
记 \(\delta_0=\beta_0+\gamma_0\),\(\delta_j=\beta_{k+j}+\gamma_j\),模型改写为 \(Y_i=\delta_0+\beta_1X_{1i}+\cdots+\beta_kX_{ki}+\delta_1W_{1i}+\cdots+\delta_rW_{ri}+v_i\)(6.25),\(E(v_i\mid X,W)=0\),满足 Key Concept 6.4。三个结论:(1) OLS 对 \(\beta\) 与 \(\delta\) 无偏,并在假设 2–4 下一致、大样本正态;(2) 条件均值独立下 X 的系数是因果效应 \(\beta_1..\beta_k\) 的无偏估计;(3) 控制变量系数 \(\delta_j\) = 直接因果效应 + 因 u 与 W 相关产生的 \(\gamma_j\),一般存在遗漏变量偏差,无因果解释。

本章要点

  1. 遗漏变量偏差需两个条件同时成立:遗漏变量与回归元相关、且决定 Y;它违反 \(E(u\mid X)=0\),使 OLS 有偏且不一致,渐近偏差 \(\rho_{Xu}\sigma_u/\sigma_X\),方向由 \(\rho_{Xu}\) 符号决定。
  2. 多元回归系数是"保持其他回归元不变"的偏效应;纳入遗漏变量可缓解偏差(加州例中 STR 系数从 −2.28 降为 −1.10)。
  3. OLS 最小化残差平方和;SER 用 \(n-k-1\) 自由度调整;\(R^2\) 随回归元增加只升不降,\(\bar R^2\) 加惩罚且可为负;二者都不应作为选变量的主要依据。
  4. 因果推断四条假设:条件均值零、i.i.d.、四阶矩有限、无完全多重共线;满足时 OLS 无偏一致、大样本联合正态。
  5. 完全共线(含虚拟变量陷阱)是设定错误,必须修改回归元;不完全共线只是让系数方差变大(\(\propto1/(1-\rho^2)\)),本身不是错误。
  6. 控制变量的意义在于条件均值独立:控制 W 后 X 如同随机分配;控制变量的系数本身没有因果解释。
  7. Frisch–Waugh 定理给出"控制"的几何意义:先用其他回归元把 Y 和 X1 正交化,再做单回归。

与量化交易的关联

  • 因子中性化与 Frisch–Waugh:截面选股中常把因子对行业虚拟变量和市值做回归取残差(行业市值中性化),这正是 Frisch–Waugh 第一步;随后用中性化因子与收益回归,等价于在多元回归中控制行业和市值。理解该定理能避免"先中性化因子却不中性化收益"之类的不一致处理(两种做法在 OLS 下系数相同,但残差和 SE 不同)。
  • 遗漏变量偏差 = 风格暴露的混淆:某新因子的收益可能只是因为它与市值、价值、动量等已知因子相关(条件 1)而这些因子决定收益(条件 2)。检验新因子必须控制已知因子(如在 Fama–French 多因子回归中看 alpha),式 (6.1) 可用于判断偏差方向。
  • 虚拟变量陷阱:Barra 类风险模型截面回归同时放入国家因子(截距)和全部行业虚拟变量时就是虚拟变量陷阱,实践中通过加约束(行业因子收益市值加权和为 0)或去掉一个行业解决,与本章"去一个虚拟变量或去截距"的思路一致。
  • 多重共线:价值类因子(BP、EP、SP)或动量不同窗口之间高度相关,放在同一回归中系数不稳定、符号可能翻转、SE 大,但组合预测力不受影响;需要区分"想解释单个因子贡献"(共线有害)和"只想预测"(共线影响小)。式 (6.20) 的 VIF 可用于诊断。
  • \(R^2\) 与过拟合:收益预测回归的 \(R^2\) 通常很低,且加变量必然提高样本内 \(R^2\);\(\bar R^2\) 也不能防止样本外失效,回测中必须用样本外检验(第 14 章)。
  • 控制变量系数不可解读为因果:在多因子回归中,控制变量(如市值)的系数不能当成独立的"定价效应"解读。

推荐习题

  • 6.1–6.4(CPS 表):系数解读、\(\bar R^2\) 计算、虚拟变量陷阱、预测。
  • 6.6、6.9:遗漏变量偏差的条件与方向判断。
  • 6.10:共线性对方差的定量影响,以及"因共线而删变量"的谬误。
  • 6.11:两回归元 OLS 的推导、正交回归元时多元系数与单回归系数一致——为理解 Frisch–Waugh 打基础。
  • 6.12:控制变量与条件均值独立的最佳练习,区分关注变量与控制变量系数的因果性。
  • E6.1(c):亲手验证 Frisch–Waugh 定理,直接对应因子中性化操作。

第 7 章 多元回归中的假设检验与置信区间(Hypothesis Tests and Confidence Intervals in Multiple Regression)

章引言(PDF p.248)

多元回归通过加入回归元控制其影响来缓解遗漏变量偏差。OLS 估计量有抽样不确定性,本章用标准误、假设检验和置信区间加以量化。多元回归中新出现的情形是同时涉及两个或更多系数的"联合"假设(joint hypotheses),需要新的检验统计量——F 统计量(F-statistic)。结构:7.1 单系数推断;7.2–7.3 涉及多个系数的假设;7.4 多系数置信集;7.5 回归设定(选哪些变量);7.6 用加州数据改进班级规模因果效应估计。

7.1 单个系数的假设检验与置信区间(Hypothesis Tests and Confidence Intervals for a Single Coefficient,PDF p.248–251)

标准误

单回归中用样本均值替换期望得到 \(\hat\sigma^2_{\hat\beta_1}\)(式 5.4),大数定律保证 \(\hat\sigma^2_{\hat\beta_1}/\sigma^2_{\hat\beta_1}\xrightarrow{p}1\)。多元回归完全类似:\(\hat\beta_j\) 的标准差由标准误 \(SE(\hat\beta_j)\) 估计,公式需矩阵表示(19.2 节)。概念上单/多回归元没有区别:关键都是估计量大样本正态,以及能一致估计其抽样分布的标准差。

单系数检验

\[H_0:\beta_j=\beta_{j,0}\quad\text{vs.}\quad H_1:\beta_j\ne\beta_{j,0}\tag{7.1}\]

零假设值来自经济理论或决策情境(如 \(\beta_{STR}=0\))。依据:Key Concept 6.5 保证 \(\hat\beta_j\) 近似正态、零假设下均值为 \(\beta_{j,0}\)、方差可一致估计,因此照搬单回归步骤。

Key Concept 7.1:1. 算 \(SE(\hat\beta_j)\);2. \(t=\dfrac{\hat\beta_j-\beta_{j,0}}{SE(\hat\beta_j)}\)(7.2);3. \(p=2\Phi(-|t^{act}|)\)(7.3),p<0.05 或 \(|t^{act}|>1.96\) 时 5% 水平拒绝。此后书中把 \(t^{act}\) 简写为 t。

Key Concept 7.2:大样本下 \(\beta_j\) 的 95% 置信区间 \(=[\hat\beta_j-1.96SE(\hat\beta_j),\ \hat\beta_j+1.96SE(\hat\beta_j)]\)(7.4),即以 95% 概率包含真值的区间、或 5% 双侧检验不能拒绝的值的集合;90% 区间把 1.96 换成 1.64。这些方法依赖大样本正态近似,只在大样本中有保证。

应用

\[\widehat{TestScore}=\underset{(8.7)}{686.0}-\underset{(0.43)}{1.10}\times STR-\underset{(0.031)}{0.650}\times PctEL\tag{7.5}\]

检验 STR 系数为 0:\(t=-1.10/0.43=-2.54\),\(p=2\Phi(-2.54)=1.1\%\),5% 水平拒绝,但 1% 水平不能拒绝。95% CI:\(-1.10\pm1.96\times0.43=(-1.95,-0.26)\)。师生比降 2 的效应 CI:\((0.52,3.90)\) 分。

加入生均支出

督学追问:雇更多教师可以靠削减其他预算(不买新电脑、减少维护等)或要求增加预算(纳税人反对)。保持生均支出(及 PctEL)不变时,降低师生比效应如何?

\[\widehat{TestScore}=\underset{(15.5)}{649.6}-\underset{(0.48)}{0.29}\times STR+\underset{(1.59)}{3.87}\times Expn-\underset{(0.032)}{0.656}\times PctEL\tag{7.6}\]
Expn 为生均年度总支出(千美元)。结果惊人:STR 系数从 −1.10 降为 −0.29,\(t=-0.29/0.48=-0.60\),即使在 10% 水平也不能拒绝为 0(\(|-0.60|<1.64\))。即没有证据表明在生均支出不变时雇更多教师能提高成绩。

一种解读:加州学区管理者预算分配是有效的。若反事实地 STR 系数在 (7.6) 中大且为负,学区就可以削减教材、技术、体育等支出来雇教师、在总支出不变下缩小班级而提高成绩;系数小且不显著说明这种转移几乎无效,即学区已有效配置资金。

另注意 STR 的 SE 从 0.43 升到 0.48:STR 与 Expn 相关系数为 −0.62,回归元相关使估计更不精确(呼应 6.7 节不完全共线)。

愤怒的纳税人此时声称 \(\beta_1=0\) 且 \(\beta_2=0\)。虽然检验 \(\beta_2=0\) 的 \(t=3.87/1.59=2.43\),看似可拒绝,但这一推理有缺陷——这是联合假设,需要 F 统计量。

7.2 联合假设检验(Tests of Joint Hypotheses,PDF p.251–258)

联合零假设

\[H_0:\beta_1=0\text{ 且 }\beta_2=0\quad\text{vs.}\quad H_1:\beta_1\ne0\text{ 和/或 }\beta_2\ne0\tag{7.7}\]

施加两个约束(restrictions)。一般形式:

\[H_0:\beta_j=\beta_{j,0},\ \beta_m=\beta_{m,0},\dots\text{(共 q 个约束)}\quad\text{vs.}\quad H_1:\text{至少一个约束不成立}\tag{7.8}\]
例:k=6 时检验 \(\beta_2=\beta_4=\beta_5=0\),q=3。只要零假设中有一个等式不成立,联合零假设即为假。

为什么不能逐个检验(one-at-a-time)

规则"\(|t_1|\) 或 \(|t_2|\) 超过 1.96 就拒绝"。大样本下 \(\hat\beta_1,\hat\beta_2\) 联合正态,零假设下 \(t_1,t_2\) 二元正态、各自均值 0 方差 1。若 \(t_1,t_2\) 不相关(大样本下独立),不拒绝的概率 \(=\Pr(|t_1|\le1.96)\Pr(|t_2|\le1.96)=0.95^2=90.25\%\),所以检验水平(size,零假设下的拒绝概率)为 \(1-0.95^2=9.75\%\),超过 5%。原因是给了你两次拒绝的机会。若回归元相关,水平取决于相关程度,更复杂。逐个检验水平错误,需要新方法。

一种修正是 Bonferroni 方法(附录 7.1):调整临界值使水平不超过显著性水平;优点是适用面广,缺点是功效(power)可能低,常在备择为真时不能拒绝。更好的方法是 F 统计量,尤其在回归元高度相关时功效更高。

F 统计量

q=2:

\[F=\frac12\left(\frac{t_1^2+t_2^2-2\hat\rho_{t_1,t_2}t_1t_2}{1-\hat\rho^2_{t_1,t_2}}\right)\tag{7.9}\]
\(\hat\rho_{t_1,t_2}\) 为两个 t 统计量相关系数的估计。若已知不相关,\(F=\frac12(t_1^2+t_2^2)\),即 t 平方的平均,零假设下服从 \(F_{2,\infty}\)(两独立标准正态平方和除以 2);备择下至少一个 \(t^2\) 大,导致拒绝。一般情形 (7.9) 对相关性做了调整,使零假设下大样本始终服从 \(F_{2,\infty}\)。

q 个约束:异方差稳健 F 公式见 19.3 节(基于稳健协方差矩阵,即 Wald 统计量除以 q),软件内置。零假设下大样本

\[F\sim F_{q,\infty}\tag{7.10}\]
临界值查附表 4。只要用稳健公式,无论同方差还是异方差,大样本分布都是 \(F_{q,\infty}\);许多软件默认仅同方差,需选"robust"选项(更一般地说是异方差稳健的"协方差矩阵"估计)。

p 值:\(p=\Pr[F_{q,\infty}>F^{act}]\)(7.11)。可查 \(F_{q,\infty}\) 表,或 \(\chi^2_q\) 表(\(\chi^2_q\) 变量 = q 倍 \(F_{q,\infty}\) 变量),或用软件。

整体回归 F 统计量(overall regression F-statistic):检验全部斜率为 0:

\[H_0:\beta_1=\beta_2=\cdots=\beta_k=0\quad\text{vs.}\quad H_1:\text{至少一个 }\beta_j\ne0\tag{7.12}\]
零假设下回归元不解释 Y 的任何变异,截距(=Y 的均值)可非零。大样本下服从 \(F_{k,\infty}\)。

q=1:F 统计量等于 t 统计量的平方。

应用

(7.6) 中检验 \(\beta_1=\beta_2=0\) 的稳健 F=5.43;\(F_{2,\infty}\) 的 5% 临界值 3.00,1% 临界值 4.61;5.43>4.61,1% 水平拒绝(p=0.005)。可拒绝纳税人"师生比和生均支出都无效"的说法(控制 PctEL 时)。

仅同方差 F 统计量(homoskedasticity-only F-statistic,PDF p.256–258)

F 检验可重新表述为:放松 q 个约束后拟合的改进,是否大到不太可能仅来自随机抽样变异。同方差下这一直觉有精确表达。两个回归:受约束回归(restricted regression,强制零假设成立,如删去相应回归元)与无约束回归(unrestricted regression,允许备择成立)。

\[F=\frac{(SSR_{restricted}-SSR_{unrestricted})/q}{SSR_{unrestricted}/(n-k_{unrestricted}-1)}\tag{7.13}\]
\[F=\frac{(R^2_{unrestricted}-R^2_{restricted})/q}{(1-R^2_{unrestricted})/(n-k_{unrestricted}-1)}\tag{7.14}\]
\(k_{unrestricted}\) 为无约束回归的回归元个数。同方差时它与稳健 F 的差随 n 增大而消失,大样本下服从 \(F_{q,\infty}\)。优点:公式简单、直观,可用只报告 \(R^2\) 的回归表算出。缺点:只在同方差下有效,而经济/社会科学数据中同方差不可依赖,因此实践中不能代替稳健 F。

小样本:若误差 i.i.d.、同方差且正态,仅同方差 F 精确服从 \(F_{q,n-k_{unrestricted}-1}\)(19.4 节),临界值见附表 5;n 增大时收敛到 \(F_{q,\infty}\),小样本时两组临界值有差别。

应用:无约束回归 (7.6) \(R^2=0.4366\);受约束回归

\[\widehat{TestScore}=\underset{(1.0)}{664.7}-\underset{(0.032)}{0.671}\times PctEL,\quad R^2=0.4149\tag{7.15}\]
q=2,n=420,k=3:
\[F=\frac{(0.4366-0.4149)/2}{(1-0.4366)/(420-3-1)}=8.01\]
超过 1% 临界值 4.61,拒绝。但它与稳健 F 值 5.43 差别很大——这正是仅同方差 F 的主要缺点:可用计算器算,但可能与更可靠的稳健值相差甚远。

7.3 涉及多个系数的单一约束检验(Testing Single Restrictions Involving Multiple Coefficients,PDF p.258–259)

理论可能给出如 \(\beta_1=\beta_2\) 的约束:

\[H_0:\beta_1=\beta_2\quad\text{vs.}\quad H_1:\beta_1\ne\beta_2\tag{7.16}\]
q=1,但涉及两个系数。两种方法:

方法 1:直接检验。有的软件有专门命令,给出服从 \(F_{1,\infty}\) 的 F 统计量(\(F_{1,\infty}\) 的 95% 分位数 \(=1.96^2=3.84\))。

方法 2:变换回归。对 \(Y_i=\beta_0+\beta_1X_{1i}+\beta_2X_{2i}+u_i\)(7.17)加减 \(\beta_2X_{1i}\):

\[\beta_1X_{1i}+\beta_2X_{2i}=(\beta_1-\beta_2)X_{1i}+\beta_2(X_{1i}+X_{2i})=\gamma_1X_{1i}+\beta_2V_i\]
其中 \(\gamma_1=\beta_1-\beta_2\),\(V_i=X_{1i}+X_{2i}\),得
\[Y_i=\beta_0+\gamma_1X_{1i}+\beta_2V_i+u_i\tag{7.18}\]
零假设化为 \(\gamma_1=0\),用 7.1 节的 t 检验即可:构造 \(V_i\),把 Y 对 \(X_{1i}\) 和 \(V_i\) 回归。\(\beta_1-\beta_2\) 的 95% CI 为 \(\hat\gamma_1\pm1.96SE(\hat\gamma_1)\)。同样技巧可推广到其他约束(习题 7.9)。两种方法等价:方法 1 的 F 等于方法 2 的 t 的平方。

推广到 q>1:零假设可有 q 个约束,部分或全部涉及多个系数,7.2 节的 F 统计量同样适用,可用上述任一方法计算,具体取决于软件。

7.4 多个系数的置信集(Confidence Sets for Multiple Coefficients,PDF p.259–260)

95% 置信集(confidence set)是在 95% 的随机样本中包含这些系数真值的集合,是单系数置信区间的推广。构造原理:对每一对候选值 \((\beta_{1,0},\beta_{2,0})\) 计算 F 统计量,超过 5% 临界值 3.00 就拒绝;由于检验水平 5%,真值在 95% 的样本中不被拒绝,所以未被拒绝的值集合就是 95% 置信集。实践中用 19.3 节的 F 公式得到显式表达;两个系数时置信集为椭圆(confidence ellipse)。

图 7.1:基于 (7.6),STR 系数(横轴)与 Expn 系数(纵轴)的 95% 置信椭圆,中心为点估计 \((-0.29,3.87)\),不包含 \((0,0)\),与 7.2 节 F 检验在 5% 水平拒绝一致。椭圆像一根"胖香肠",长轴沿左下—右上方向:因为 \(\hat\beta_1,\hat\beta_2\) 估计相关为正,而这又源于回归元 STR 与 Expn 负相关(生均支出高的学校师生比低)——与式 (6.21) \(\operatorname{corr}(\hat\beta_1,\hat\beta_2)=-\rho_{X_1,X_2}\) 一致。

7.5 多元回归的模型设定(Model Specification for Multiple Regression,PDF p.260–262)

估计因果效应时,决定纳入哪些变量(选择回归设定,regression specification)很有挑战,没有放之四海而皆准的规则,但有指导原则。起点是思考遗漏变量偏差的可能来源,依靠对实证问题的专业知识,聚焦于得到关注因果效应的无偏估计;不要主要依赖 \(R^2\)、\(\bar R^2\) 这类纯统计拟合度量。

模型设定与控制变量的选择

一般层面由条件均值独立回答:控制变量集合须满足 \(E(u_i\mid X_i,W_i)=E(u_i\mid W_i)\)(原文写作 Key Concept 6.5,实为 6.6),即在控制变量取值相同的观测中,关注变量如同随机分配。若不成立,保持 W 不变后仍存在与 X 相关的 Y 的遗漏决定因素,产生遗漏变量偏差。

实践需要结合应用判断。例:英语学习者比例相同的学区之间经济条件可能差异很大;学区预算部分取决于富裕程度,富裕学区即使英语学习者比例相同也更可能小班;富裕家庭也有更多校外学习机会。于是富裕程度在控制 PctEL 后仍满足遗漏变量偏差的两个条件,应加入衡量经济条件的控制变量。

作者的两步法:

  1. 结合专家判断、经济理论和数据收集方式选择核心回归元集合,即基准设定(base specification),包含主要关注变量和专家判断、理论建议的控制变量。
  2. 由于专家判断和理论很少具有决定性,且理论建议的变量常常没有数据,应列出若干备选设定(alternative specifications)。若关注系数在备选设定间数值相近,说明基准估计可靠;若变化很大,往往说明原设定存在遗漏变量偏差,也增加对备选设定的担忧。9.2 节将进一步阐述。

实践中如何解读 \(R^2\) 与 \(\bar R^2\)

接近 1 表示回归元在样本中预测因变量好,接近 0 则不好,是有用的预测能力概括,但容易过度解读。四个陷阱:

  1. \(R^2\)/\(\bar R^2\) 上升不意味着新增变量统计显著:\(R^2\) 加任何回归元都会升;\(\bar R^2\) 不一定升,但升了也不代表新系数显著,要用 t 检验。
  2. 高 \(R^2\) 不意味着回归元是因变量的真实原因:成绩对人均停车场面积回归,停车场面积与师生比、城郊、收入相关,可能有高 \(R^2\) 但并非因果("告诉督学增加停车位就能提高成绩")。
  3. 高 \(R^2\) 不意味着没有遗漏变量偏差:6.1 节讨论遗漏变量偏差时完全没有提到 \(R^2\),因为它在逻辑上不起作用;低、中、高 \(R^2\) 都可能有偏差;反之低 \(R^2\) 也不意味着一定有偏差。
  4. 高 \(R^2\) 不意味着回归元集合最合适,低 \(R^2\) 也不意味着不合适:回归元选择要权衡遗漏变量偏差、数据可得性、数据质量,最重要的是经济理论与实质问题本身。

Key Concept 7.3(\(R^2\) 与 \(\bar R^2\) 能告诉你什么、不能告诉你什么):能告诉你回归元在手头样本中预测因变量的好坏(OLS 残差方差相对于因变量方差的大小);不能告诉你:(1) 某变量是否统计显著;(2) 回归元是否是真实原因;(3) 是否有遗漏变量偏差;(4) 是否选了最合适的回归元集合。

7.6 考试成绩数据集分析(Analysis of the Test Score Data Set,PDF p.262–268)

基准与备选设定

目标:估计控制可能导致遗漏变量偏差的因素后 STR 的效应。校外学习机会等因素无法直接度量,因此纳入与之相关的控制变量;若控制变量充分(条件均值独立成立),STR 系数就是保持这些因素不变时的效应,即控制后 STR 如同随机分配。

三个学生背景控制变量:英语学习者比例;有资格获得补贴或免费午餐的学生百分比;新变量——家庭符合加州收入援助项目(income assistance)的学生百分比(资格门槛比午餐项目更严)。后两者都度量经济困难学生比例(相关系数 0.74),理论无法告诉我们用哪个,基准设定用午餐比例,备选设定用收入援助比例。图 7.2:成绩与三者均负相关——与 PctEL 相关 −0.64,与午餐比例 −0.87,与收入援助比例 −0.63。

回归元的尺度(scale)

一般原则:让结果易读易解释。PctEL(0–100)系数 −0.650;若改用 FracEL = PctEL/100(0–1),\(R^2\) 与 SER 完全相同,系数变为 −65.0,含义是比例增加 1 即 100 个百分点的效应。两者数学等价,但 PctEL 解释更自然。再如以美元计的回归元系数为 0.00000356,换成百万美元后系数 3.56 更易读。

表格化呈现

多个回归、多个回归元时,用表格比写方程清晰。表 7.1 每列一个回归,因变量相同。关注变量(STR)一行报告估计、括号内稳健 SE、方括号内 95% CI(读者可直接看某值是否在 CI 内来做 5% 检验);控制变量与截距只报告估计和 SE(控制变量系数一般无因果解释,独立兴趣有限,不报 CI;控制变量很多时有时只列出名称);最后几行报告 SER、\(\bar R^2\)、n。

表 7.1(因变量:学区平均成绩;n=420;括号内为异方差稳健 SE)

回归元 (1) (2) (3) (4) (5)
STR −2.28 (0.52) [−3.30,−1.26] −1.10 (0.43) [−1.95,−0.25] −1.00 (0.27) [−1.53,−0.47] −1.31 (0.34) [−1.97,−0.64] −1.01 (0.27) [−1.54,−0.49]
PctEL −0.650 (0.031) −0.122 (0.033) −0.488 (0.030) −0.130 (0.036)
午餐资格 % −0.547 (0.024) −0.529 (0.038)
收入援助 % −0.790 (0.068) 0.048 (0.059)
截距 698.9 (10.4) 686.0 (8.7) 700.2 (5.6) 698.0 (6.9) 700.4 (5.5)
SER 18.58 14.46 9.08 11.65 9.08
\(\bar R^2\) 0.049 0.424 0.773 0.626 0.773

列 (1) 即 \(\widehat{TestScore}=698.9-2.28STR\),\(\bar R^2=0.049\),SER=18.58(7.21);表虽不报 t,但可算出 \(t=-2.28/0.52=-4.38\),1% 水平拒绝。列 (2) 即 (7.5);列 (3) 为基准设定(STR + PctEL + 午餐比例);列 (4)(5) 为备选设定,考察经济背景度量方式的影响。截距行有时标为"Constant"。

三条结论

  1. 控制学生特征后 STR 效应估计约减半,且对具体选哪些控制变量不敏感;所有设定中都能在 5% 水平拒绝系数为 0;列 (2)–(5) 中,保持学生特征不变,每位教师少一名学生约提高平均成绩 1 分。
  2. 学生特征变量是成绩的强预测因子:仅 STR 时 \(\bar R^2=0.049\),基准设定 (3) 跃升到 0.773;控制变量系数符号与图 7.2 一致——英语学习者多、贫困儿童多的学区成绩低。
  3. 收入援助比例似乎是冗余的:列 (5) 把它加入列 (3),对 STR 系数及其 SE 的影响可忽略。

7.7 结论(PDF p.268)

为缓解遗漏学生特征导致的偏差,加入英语学习者比例和两个经济背景指标作为控制变量,使 STR 单位变化的估计效应减半,但在控制这些变量后仍可在 5% 水平拒绝效应为 0。这些多元回归结果比第 4、5 章的单回归对督学有用得多。但到目前都假定总体回归函数对回归元线性,没有理由必然如此——大班学区与小班学区降低师生比的效应可能不同,需要第 8 章的非线性工具。

原书 Summary:(1) 单系数检验与 CI 与第 5 章基本相同,如 \(\hat\beta_1\pm1.96SE(\hat\beta_1)\);(2) 涉及多个约束的假设是联合假设,用 F 统计量检验;(3) 回归设定先确定针对遗漏变量偏差的基准设定,再加入其他控制变量修改;简单选 \(\bar R^2\) 最高的设定可能得不到关注的因果效应。

关键术语:约束、联合假设、F 统计量、受约束回归、无约束回归、仅同方差 F 统计量、95% 置信集、基准设定、备选设定、Bonferroni 检验。

复习题与习题(PDF p.269–275)

复习题 7.1–7.3:联合假设与 F 统计量的构造,整体回归 F 检验的假设(用受约束/无约束回归解释),为何需要了解误差分布(同方差 vs. 异方差选择 F 公式);推荐的模型设定方法,\(R^2\) 的作用,是否应选 \(R^2\) 最高的模型、是否应纳入能提高 \(R^2\) 的回归元;控制变量与关注变量的区别、表 7.1 中控制变量控制了什么、其系数是否因果。

习题 7.1–7.6 基于某发展中国家 2007 年 10,973 名 25–40 岁全职工人的周薪对数(AWE)回归表:

回归元 (1) (2) (3)
High school 0.352 (0.021) 0.373 (0.021) 0.371 (0.021)
Male 0.458 (0.021) 0.457 (0.020) 0.451 (0.020)
Age 0.011 (0.001) 0.011 (0.001)
North 0.175 (0.037)
South 0.103 (0.033)
East −0.102 (0.043)
截距 12.84 (0.018) 12.471 (0.049) 12.390 (0.057)
地区效应 F 21.87
SER 1.026 1.023 1.020
\(R^2\) 0.0710 0.0761 0.0814
  • 7.1:为各系数标注 5%(*)、1%(**)显著性。
  • 7.2:高中学历与性别差异的显著性及 95% CI。
  • 7.3:年龄是否重要;30 岁与 40 岁男大学毕业生预期收入差的 95% CI(\(10\hat\beta_{Age}\) 的 CI)。
  • 7.4:用 F=21.87 检验地区差异;北部高中男与西部大学男的预期收入差 CI;北部高中男与东部大学男的差如何构造 CI(提示:把基准组换成 East 重新回归,或用 7.3 节变换技巧,因为涉及两个系数的线性组合需要协方差)。
  • 7.5:用 1993 年 5000 个观测的回归(High school 系数 0.301,SE 0.019)与 (2) 比较,检验系数是否显著变化(两独立样本系数差的 SE,同习题 5.15)。
  • 7.6:高中系数显著为正是否构成教育回报高的有力证据(遗漏能力等变量)。
  • 7.7:房价回归加入 SE:BDR 系数是否显著(0.567/1.23,不显著);为何与"四卧室比三卧室贵"不矛盾(控制了房屋面积);购买 2500 平方英尺地块的增值 CI;Lsize 的尺度是否合适;删除 BDR 与 Age 的 F=2.38 在 10% 水平是否显著(\(F_{2,\infty}\) 10% 临界值 2.30)。
  • 7.8:计算 \(\bar R^2\);构造检验地区系数全为 0 的仅同方差 F 并判断 1% 显著性;用 Bonferroni 检验同一假设;列 (3) 中 \(\beta_1\) 的 99% CI。
  • 7.9:用方法 2 变换回归检验 \(\beta_1=\beta_2\)、\(\beta_1+2\beta_2=0\)、\(\beta_1+\beta_2=1\)(需重新定义因变量 \(Y-X_2\))。
  • 7.10:证明 (7.13) 与 (7.14) 等价(利用 \(R^2=1-SSR/TSS\),两回归 TSS 相同)。
  • E7.1:出生体重对吸烟回归逐步加入 Alcohol、Nprevist、Unmarried;比较吸烟效应及 CI、判断遗漏变量偏差;Unmarried 系数的 CI、显著性、大小,以及"鼓励婚姻政策能带来更健康婴儿"的说法为何不成立(控制变量系数无因果解释);用类似表 7.1 的表检验吸烟效应 CI 的稳健性。
  • E7.2:收入对身高回归中的遗漏认知能力(Case & Paxson 2008:胎儿期与幼年营养不良同时损害认知与身体发育),判断偏差方向(向上);用教育年限构造 LT_HS、HS、Some_Col、College 虚拟变量作为认知能力的代理控制变量,分男女比较身高系数变化,解释为何省略 College、联合检验教育变量、解读各教育系数(相对大学学历的差距,依次递减)。

附录 7.1 联合假设的 Bonferroni 检验(PDF p.274–276)

7.2 节方法是首选;但若只有论文的回归结果表、没有原始数据,无法算 F 统计量,可用 Bonferroni 检验——它是"正确实施的逐个 t 检验"。规则:选临界值 \(c>0\),

\[\text{若 }|t_1|\le c\text{ 且 }|t_2|\le c\text{ 则接受,否则拒绝}\tag{7.22}\]
关键是选 c 使零假设下拒绝概率不超过目标水平,同时兼顾两个约束和 \(t_1,t_2\) 的任意相关性。

Bonferroni 不等式:\(\Pr(A\cup B)=\Pr(A)+\Pr(B)-\Pr(A\cap B)\le\Pr(A)+\Pr(B)\)。令 A 为 \(|t_1|>c\),B 为 \(|t_2|>c\):

\[\Pr(|t_1|>c\text{ 或 }|t_2|>c)\le\Pr(|t_1|>c)+\Pr(|t_2|>c)\tag{7.23}\]
大样本零假设下 \(\Pr(|t_1|>c)=\Pr(|Z|>c)\),故
\[\Pr_{H_0}(\text{逐个检验拒绝})\le2\Pr(|Z|>c)\tag{7.24}\]
q 个约束时把 2 换成 q。脚注:由此还可推出 \(\Pr(A^c\cap B^c)\ge1-[\Pr(A)+\Pr(B)]\)(Bonferroni 不等式的另一形式)。

表 7.2 Bonferroni 临界值 c:

q 10% 5% 1%
2 1.960 2.241 2.807
3 2.128 2.394 2.935
4 2.241 2.498 3.023

例:5% 水平、q=2 时 c=2.241,即 \(\Pr(|Z|>2.241)=2.5\%\)(标准正态 1.25% 分位数),保证水平不超过 5%。临界值大于单约束的 1.96,正是为"第二次机会"做修正。若 t 基于稳健 SE,则无论是否异方差 Bonferroni 检验都有效;若基于仅同方差 SE,则只在同方差下有效。

应用:(7.6) 中 \(t_1=-0.60\),\(t_2=2.43\);\(|t_2|>2.241\),5% 水平拒绝联合零假设;但两者都小于 2.807,1% 水平不能拒绝。而 F 检验能在 1% 水平拒绝——体现 Bonferroni 功效较低。

本章要点

  1. 多元回归中单系数的 t 检验与置信区间和单回归完全相同,前提是大样本与稳健 SE。
  2. 联合假设不能用逐个 t 检验:两个独立 t 各用 1.96 时实际水平为 9.75%;应使用异方差稳健 F 统计量,大样本零假设下服从 \(F_{q,\infty}\),q=1 时 \(F=t^2\)。
  3. 仅同方差 F 可用 SSR 或 \(R^2\) 的受约束/无约束对比计算,直观但只在同方差下有效(例中 8.01 vs. 稳健 5.43);误差正态同方差时精确服从 \(F_{q,n-k-1}\)。
  4. 涉及多个系数的单一线性约束可通过重参数化(构造 \(V=X_1+X_2\))转成单系数 t 检验。
  5. 多系数置信集是 F 检验不拒绝的集合,两系数时为椭圆,方向由估计量相关性决定。
  6. 模型设定:以控制遗漏变量偏差为目标,基准设定 + 备选设定检验稳健性;\(R^2\) 不能告诉你显著性、因果性、是否有遗漏变量偏差或回归元是否合适。
  7. 回归结果应以表格呈现:关注变量报告估计、SE、CI,控制变量简报。
  8. 加州例:控制学生背景后 STR 效应约为 −1(每生/师),稳健且显著;控制生均支出后效应变得不显著,提示资源配置已接近有效。

与量化交易的关联

  • 联合检验与多重检验:检验多个因子 alpha 是否同时为零(如 GRS 检验)、某组风格因子是否联合显著、行业虚拟变量是否联合显著,都需要 F/Wald 检验而非逐个 t。逐个 t 检验水平膨胀的 9.75% 计算是理解"因子挖掘中的多重检验问题"的最简入门;Bonferroni 修正(\(c\) 随 q 增大)正是因子动物园文献中提高 t 门槛(如 Harvey–Liu–Zhu 建议 t>3)的出发点,其低功效也解释了为何后续发展出 Holm、BHY(控制 FDR)等方法。
  • 约束检验的重参数化:检验两个因子溢价相等、两段样本 beta 相等、或某组合权重和为 1 等线性约束,可用 7.3 节变换技巧直接得到 t 值和 CI。
  • 置信椭圆:两个高度相关因子(如价值与盈利)的系数单独看可能都不显著,但联合显著;椭圆方向直观展示估计量相关性,对理解因子暴露的联合不确定性和组合风险有帮助。
  • 稳健 SE 与 F:金融数据普遍异方差,软件默认的仅同方差 F 可能严重高估显著性(本章例子 8.01 vs. 5.43),回测报告中应明确使用稳健(或 HAC)协方差。
  • 设定稳健性表格:表 7.1 的"基准 + 备选设定"展示方式是因子研究报告的标准范式——在不同控制变量组合(市值、行业、其他风格)下报告关注因子的系数与 CI,检验结论是否稳健。
  • \(R^2\) 的局限:收益预测回归 \(R^2\) 往往只有 1% 左右但可能有经济意义;高 \(R^2\) 也不代表因果或无遗漏变量,Key Concept 7.3 四条在量化中同样适用。
  • 尺度选择:因子标准化(z-score)后系数可解释为"一个标准差暴露对应的收益",与本章"为可读性选择尺度"一致。

推荐习题

  • 7.4、7.5:地区虚拟变量的联合 F 检验、系数线性组合的 CI、跨样本系数比较。
  • 7.7:综合练习——显著性、偏效应解释(控制面积后卧室数不显著)、尺度、F 检验。
  • 7.8:仅同方差 F 与 Bonferroni 的手算,对比两种联合检验。
  • 7.9:重参数化技巧(含需重新定义因变量的情形)。
  • 7.10:证明 SSR 形式与 \(R^2\) 形式的 F 等价。
  • E7.1、E7.2:设定稳健性表格、控制变量系数的非因果解释、遗漏变量偏差方向判断。

第 8 章 非线性回归函数(Nonlinear Regression Functions)

章引言(PDF p.278–279)

第 4–7 章假定总体回归函数线性,即斜率恒定;在因果语境下意味着 X 变动一单位对 Y 的效应对所有回归元取值都相同。若 X 对 Y 的效应依赖于某些回归元的取值,总体回归函数就是非线性的。

两组方法:

  • 第一组(8.2 节):Y 与 \(X_1\) 的关系依赖 \(X_1\) 自身取值。例:班级已经较小时每位教师少一名学生的效应,可能比班级大到老师只能维持秩序时更大,即成绩是 STR 的非线性函数、在 STR 小时更陡(图 8.1(b))。
  • 第二组(8.3 节):\(X_1\) 对 Y 的效应依赖另一个自变量 \(X_2\)。例:英语学习者可能特别受益于一对一关注,所以英语学习者多的学区降低师生比的效应更大(图 8.1(c):\(X_2=0\) 与 \(X_2=1\) 时回归函数斜率不同)。

这两组模型对 X 非线性,但对未知参数线性,因此仍是第 6、7 章多元回归的变体,可用 OLS 估计、用第 6–7 章方法检验。若回归函数对参数也非线性,则不能用 OLS,而需非线性最小二乘(附录 8.1)。8.1–8.3 节为简化在实证例子中省略额外回归元,但若目标是因果效应,仍需纳入控制变量;8.4 节把非线性函数与控制变量结合。8.1–8.3 节假定 Key Concept 6.4 的因果推断假设(针对非线性函数修改)成立,此时非线性回归函数的斜率可解释为因果效应;方法也适用于含控制变量(Key Concept 6.6)和预测(附录 6.4)的情形。

8.1 非线性回归函数建模的一般策略(A General Strategy for Modeling Nonlinear Regression Functions,PDF p.279–286)

考试成绩与学区收入

第 7 章发现学生经济背景很重要。更宽泛的度量是学区人均年收入(district income,千美元,1998 年价格):420 个学区中位数 13.7(即人均 13,700 美元),范围 5.3–55.3。图 8.2:成绩与收入强正相关(相关系数 0.71),但线性 OLS 线拟合不佳——收入很低(<1 万)或很高(>4 万)时多数点在线下方,1.5 万–3 万之间多数点在线上方,存在线性回归未捕捉的曲率。

非线性函数:斜率不恒定的函数;若 f(X) 斜率对所有 X 相同则线性,若斜率依赖 X 则非线性。拟合的曲线应在低收入时陡峭、高收入时变平,可用二次函数近似:

\[TestScore_i=\beta_0+\beta_1Income_i+\beta_2Income_i^2+u_i\tag{8.1}\]
称二次回归模型(quadratic regression model)。它其实就是有两个回归元(Income 与 Income²)的多元回归——在表格中新增一列收入平方即可,因此可用 OLS 估计和检验:
\[\widehat{TestScore}=\underset{(2.9)}{607.3}+\underset{(0.27)}{3.85}Income-\underset{(0.0048)}{0.0423}Income^2,\quad\bar R^2=0.554\tag{8.2}\]
图 8.3:二次函数在低收入时陡、高收入时平,拟合优于线性。

正式检验线性:若关系线性,则 (8.1) 中 \(\beta_2=0\)。检验 \(H_0:\beta_2=0\) vs. \(H_1:\beta_2\ne0\):\(t=-0.0423/0.0048=-8.81\),p<0.01%,在所有常规水平拒绝,二次模型优于线性模型。

非线性设定中 X 变化对 Y 的效应

一般非线性总体回归函数:

\[Y_i=f(X_{1i},X_{2i},\dots,X_{ki})+u_i\tag{8.3}\]
f 为总体非线性回归函数,即 \(E(Y_i\mid X_{1i},\dots,X_{ki})=f(\cdot)\),可以是非线性函数;f 线性时退化为 Key Concept 6.2。(脚注:非线性回归有两类概念不同的模型——对 X 非线性但对参数线性,本章正文均属此类;对参数非线性,见附录 8.1。)

效应定义:若对 \(X_2..X_k\) 相同的个体随机分配处理水平 \(X_1=x_1\) 或 \(x_1+\Delta x_1\),期望结果差就是保持 \(X_2..X_k\) 不变时的因果效应 \(\Delta Y=f(X_1+\Delta X_1,X_2,\dots)-f(X_1,X_2,\dots)\);在预测语境下则是两个 \(X_2..X_k\) 相同、\(X_1\) 不同的观测的预测值之差。

Key Concept 8.1:保持 \(X_2..X_k\) 不变时,与 \(\Delta X_1\) 相关的 Y 的期望变化

\[\Delta Y=f(X_1+\Delta X_1,X_2,\dots,X_k)-f(X_1,X_2,\dots,X_k)\tag{8.4}\]
其估计为预测值之差
\[\Delta\hat Y=\hat f(X_1+\Delta X_1,X_2,\dots,X_k)-\hat f(X_1,X_2,\dots,X_k)\tag{8.5}\]
该计算方法总是适用,无论 \(\Delta X_1\) 大小、回归元连续或离散;附录 8.2 给出单连续回归元、\(\Delta X_1\) 很小时用微积分求斜率的方法。

应用:收入从 10 增到 11(千美元):

\[\Delta\hat Y=(\hat\beta_0+\hat\beta_1\times11+\hat\beta_2\times11^2)-(\hat\beta_0+\hat\beta_1\times10+\hat\beta_2\times10^2)\tag{8.6}\]
Income=10 时预测 \(607.3+38.5-4.23=641.57\);Income=11 时 644.53;差 2.96 分。从 40 增到 41:694.04−693.62=0.42 分。即同样增加 1000 美元,初始收入 1 万时的效应(2.96)远大于 4 万时(0.42)。

估计效应的标准误

\(\hat f\) 随样本变化,\(\Delta\hat Y\) 含抽样误差,需 SE 以构造 CI。线性时 \(SE(\Delta\hat Y)=SE(\hat\beta_1)\Delta X_1\),CI 为 \(\hat\beta_1\Delta X_1\pm1.96SE(\hat\beta_1)\Delta X_1\)。非线性时可借用 7.3 节"涉及多个系数的单一约束"工具。收入 10→11:\(\Delta\hat Y=\hat\beta_1(11-10)+\hat\beta_2(11^2-10^2)=\hat\beta_1+21\hat\beta_2\),

\[SE(\Delta\hat Y)=SE(\hat\beta_1+21\hat\beta_2)\tag{8.7}\]
有的软件可直接算;否则两种方法:

  • 方法 1(对应 7.3 节方法 1):计算检验 \(\beta_1+21\beta_2=0\) 的 F 统计量,则
    \[SE(\Delta\hat Y)=\frac{|\Delta\hat Y|}{\sqrt F}\tag{8.8}\]
    推导:q=1 时 \(F=t^2=[(\hat\beta_1+21\hat\beta_2)/SE(\hat\beta_1+21\hat\beta_2)]^2=[\Delta\hat Y/SE(\Delta\hat Y)]^2\),解出 SE。应用:F=299.94,\(SE=2.96/\sqrt{299.94}=0.17\),95% CI \(=2.96\pm1.96\times0.17=(2.63,3.29)\)。
  • 方法 2(对应 7.3 节方法 2):变换回归元,使变换后某个系数正好是 \(\beta_1+21\beta_2\)(习题 8.9)。

非线性设定中系数的解释

线性多元回归中 \(\beta_1\) 有自然解释(保持其他回归元不变时 \(X_1\) 变化的效应);非线性模型中一般不成立——把 (8.1) 的 \(\beta_1\) 理解为"保持收入平方不变时收入变化的效应"毫无帮助。非线性模型最好通过作图和计算一个或多个自变量变化的预测效应来解释。

用多元回归建模非线性的一般方法(五个要素)

  1. 识别可能的非线性关系:最好用经济理论和对应用的理解,在看数据前就问斜率是否可能依赖 X 或其他变量、为什么、暗示何种形状。例:考虑 11 岁孩子的课堂动态,班级从 18 人减到 17 人的效应可能大于从 30 减到 29。
  2. 设定非线性函数并用 OLS 估计参数(8.2、8.3 节的各种函数)。
  3. 判断非线性模型是否优于线性模型:认为非线性不等于真的非线性,需用 t、F 统计量检验线性零假设。
  4. 画出估计的非线性回归函数,看是否很好描述数据。
  5. 估计 X 变化对 Y 的效应(Key Concept 8.1)。

8.2 单个自变量的非线性函数(Nonlinear Functions of a Single Independent Variable,PDF p.286–297)

两种方法:多项式回归(polynomial regression)与对数(logarithms),可组合使用;8.5 节扩展到多个自变量;附录 8.2 给出微积分处理。

多项式

r 次多项式回归模型:

\[Y_i=\beta_0+\beta_1X_i+\beta_2X_i^2+\cdots+\beta_rX_i^r+u_i\tag{8.9}\]
r=2 为二次,r=3 为三次回归模型(cubic regression model)。与第 6 章区别只在于回归元是同一变量的各次幂,因此 OLS 估计与推断方法全部适用。

检验线性:

\[H_0:\beta_2=0,\beta_3=0,\dots,\beta_r=0\quad\text{vs.}\quad H_1:\text{至少一个 }\beta_j\ne0,\ j=2,\dots,r\tag{8.10}\]
这是 q=r−1 个约束的联合假设,用 F 统计量(7.2 节)。

选几次多项式:灵活性与统计精度的权衡。r 越大越灵活,r 次多项式图形最多可有 r−1 个弯曲(拐点);但回归元多会降低系数估计精度。"包含足以充分刻画非线性的项、但不要更多"——实践中帮助不大。实用方法是序贯假设检验(sequential hypothesis testing):

  1. 选最大 r,估计 r 次多项式;
  2. 用 t 检验 \(\beta_r=0\);若拒绝,\(X^r\) 应保留,用 r 次;
  3. 若不拒绝,去掉 \(X^r\),估计 r−1 次,检验 \(X^{r-1}\) 系数;拒绝则用 r−1 次;
  4. 如此继续,直到最高次项显著。 初始 r 的选择:经济数据的非线性函数通常平滑、无尖峰跳跃,宜从较小最大次数开始,如 r=2、3 或 4。

应用:

\[\widehat{TestScore}=\underset{(5.1)}{600.1}+\underset{(0.71)}{5.02}Income-\underset{(0.029)}{0.096}Income^2+\underset{(0.00035)}{0.00069}Income^3,\quad\bar R^2=0.555\tag{8.11}\]
\(Income^3\) 的 t=1.97,在 5% 水平拒绝"二次"而支持"三次";检验 \(Income^2\) 与 \(Income^3\) 系数都为 0 的 F=37.7,p<0.01%,拒绝线性。

系数解释:多项式回归系数没有简单解释,最好作图并计算若干 X 值处 X 变化的估计效应。

对数

对数把变量变化转化为百分比变化,很多关系天然以百分比表达:

  • 第 3 章"社会阶层还是教育?"方框用英镑衡量收入差距,但用百分比更便于跨职业、跨时间比较;
  • 8.1 节收入与成绩非线性,若用收入变化 1% 而非 1000 美元,效应是否在不同收入水平近似恒定?
  • 消费者需求分析常假设价格上升 1% 导致需求量下降某个百分比,即价格弹性(price elasticity)。

指数与自然对数:\(e^x=\exp(x)\),\(e=2.71828\ldots\);自然对数是其反函数,\(x=\ln(e^x)\)。本书"对数"一律指自然对数。\(\ln(x)\) 只对 \(x>0\) 有定义,先陡后平但持续增长,斜率为 \(1/x\)(图 8.4)。性质:

\[\ln(1/x)=-\ln x\ (8.12);\quad \ln(ax)=\ln a+\ln x\ (8.13);\quad \ln(x/a)=\ln x-\ln a\ (8.14);\quad \ln(x^a)=a\ln x\ (8.15)\]

对数与百分比:\(\Delta x\) 相对 x 较小时

\[\ln(x+\Delta x)-\ln(x)\cong\frac{\Delta x}{x}\tag{8.16}\]
即百分比变化除以 100。例:x=100、Δx=1,\(\Delta x/x=0.01\),而 \(\ln101-\ln100=0.00995\);Δx=5 时 0.05 vs. 0.04879(变化越大近似越差)。

情形 I:X 取对数,Y 不取——线性-对数模型(linear-log model)

\[Y_i=\beta_0+\beta_1\ln(X_i)+u_i\tag{8.17}\]
X 变化 1% 对应 Y 变化 \(0.01\beta_1\)。推导:\([\beta_0+\beta_1\ln(X+\Delta X)]-[\beta_0+\beta_1\ln X]\cong\beta_1(\Delta X/X)\),\(\Delta X/X=0.01\) 时为 \(0.01\beta_1\)。估计时先生成 ln(X),再 OLS,t 检验与 CI 照常。
\[\widehat{TestScore}=\underset{(3.8)}{557.8}+\underset{(1.40)}{36.42}\ln(Income),\quad\bar R^2=0.561\tag{8.18}\]
收入增 1% 对应成绩升 \(0.01\times36.42=0.36\) 分。以原单位计:收入 10→11 千美元,\(\Delta\hat Y=36.42\times(\ln11-\ln10)=3.47\);40→41,\(36.42\times(\ln41-\ln40)=0.90\)。与二次设定一样,贫困学区 1000 美元的效应更大。图 8.5:线性-对数函数先陡后平。

情形 II:Y 取对数,X 不取——对数-线性模型(log-linear model)

\[\ln(Y_i)=\beta_0+\beta_1X_i+u_i\tag{8.19}\]
X 变化一单位对应 Y 变化 \(100\beta_1\%\)。推导:\(\ln(Y+\Delta Y)-\ln Y=\beta_1\Delta X\);\(\beta_1\Delta X\) 小时左边 \(\cong\Delta Y/Y\),故 \(\Delta Y/Y\cong\beta_1\Delta X\)。 例(第 3.7 节年龄与收入):一些雇佣合同规定每多服务一年工资涨某个百分比,提示用对数-线性设定。2016 年 3 月 CPS 13,872 名大学毕业生:
\[\widehat{\ln(Earnings)}=\underset{(0.019)}{2.876}+\underset{(0.0004)}{0.0095}Age,\quad\bar R^2=0.033\tag{8.20}\]
年龄每增一岁,收入预计增 0.95%。

情形 III:两者都取对数——对数-对数模型(log-log model)

\[\ln(Y_i)=\beta_0+\beta_1\ln(X_i)+u_i\tag{8.21}\]
X 变化 1% 对应 Y 变化 \(\beta_1\%\),\(\beta_1\) 是 Y 对 X 的弹性(elasticity):
\[\beta_1=\frac{\Delta Y/Y}{\Delta X/X}=\frac{100\times(\Delta Y/Y)}{100\times(\Delta X/X)}=\frac{Y\text{ 的百分比变化}}{X\text{ 的百分比变化}}\tag{8.22}\]
应用:
\[\widehat{\ln(TestScore)}=\underset{(0.006)}{6.336}+\underset{(0.0021)}{0.0554}\ln(Income),\quad\bar R^2=0.557\tag{8.23}\]
收入增 1%,成绩增 0.0554%。对比对数-线性设定:
\[\widehat{\ln(TestScore)}=\underset{(0.003)}{6.439}+\underset{(0.00018)}{0.00284}Income,\quad\bar R^2=0.497\tag{8.24}\]
图 8.6(纵轴为 ln 成绩):对数-线性为直线;对数-对数拟合更好(\(\bar R^2\) 0.557 vs. 0.497),但也不算很好——低收入处多数点在曲线下,中等收入处多数在上。

Key Concept 8.2(回归中的对数:三种情形)(被取对数的变量必须为正;取对数后用 OLS 估计):

情形 设定 \(\beta_1\) 的解释
I \(Y_i=\beta_0+\beta_1\ln X_i+u_i\) X 变化 1% ↔ Y 变化 \(0.01\beta_1\)
II \(\ln Y_i=\beta_0+\beta_1X_i+u_i\) X 变化 1 单位 ↔ Y 变化 \(100\beta_1\%\)
III \(\ln Y_i=\beta_0+\beta_1\ln X_i+u_i\) X 变化 1% ↔ Y 变化 \(\beta_1\%\),\(\beta_1\) 为弹性

比较对数设定的困难:因变量相同时可用 \(\bar R^2\) 比较——对数-线性 vs. 对数-对数(后者更好);线性-对数(0.561)vs. 线性(0.508),前者更好。但线性-对数与对数-对数的因变量不同(Y vs. ln Y),\(\bar R^2\) 衡量的是各自因变量方差被解释的比例,不能比较。最好依据经济理论和专业知识决定 Y 是否应取对数:劳动经济学家常对收入取对数,因为工资比较、合同涨薪等天然以百分比讨论;考试成绩则更自然地以分数讨论,所以作者聚焦因变量为成绩本身的模型。

Y 取对数时计算 Y 的预测值(进阶,可跳过):对 (8.19) 两边取指数:

\[Y_i=\exp(\beta_0+\beta_1X_i+u_i)=e^{\beta_0+\beta_1X_i}e^{u_i}\tag{8.25}\]
\(E(Y_i\mid X_i)=e^{\beta_0+\beta_1X_i}E(e^{u_i}\mid X_i)\)。问题:即使 \(E(u_i\mid X_i)=0\),\(E(e^{u_i}\mid X_i)\ne1\)(Jensen 不等式:通常大于 1),所以直接 \(\hat Y_i=e^{\hat\beta_0+\hat\beta_1X_i}\) 是有偏的。解决方法之一是估计 \(E(e^{u_i}\mid X_i)\)(习题 17.12,异方差时复杂);本书做法是只计算 ln(Y) 的预测值、不转换回原单位——Y 取对数时通常本就自然地全程使用对数设定及其百分比解释。

成绩与收入的多项式和对数模型比较(PDF p.296–297)

真实函数形式未知,需决定哪种方法或组合最好。

  • 多项式:三次 (8.11) 中 \(Income^3\) 在 5% 水平显著,优于二次,选三次。
  • 对数:线性-对数 (8.18) 拟合似乎不错但未正式检验;办法是加入 ln(Income) 的高次幂:
    \[\widehat{TestScore}=\underset{(79.4)}{486.1}+\underset{(87.9)}{113.4}\ln(Income)-\underset{(31.7)}{26.9}[\ln(Income)]^2+\underset{(3.74)}{3.06}[\ln(Income)]^3,\quad\bar R^2=0.560\tag{8.26}\]
    三次项 t=0.818,10% 水平不拒绝;二次与三次项联合为 0 的 F=0.44,p=0.64,不拒绝。所以对数三次模型相对 (8.18) 无显著改进。
  • 三次 vs. 线性-对数:图 8.7 中两条估计曲线几乎相同;\(\bar R^2\) 0.561 vs. 0.555,且对数设定不需要对数的高次项,故采用线性-对数设定 (8.18)。(两者因变量相同,可比 \(\bar R^2\)。)

8.3 自变量之间的交互作用(Interactions Between Independent Variables,PDF p.297–309)

动机:英语学习者若特别受益于一对一或小组教学,则降低师生比的效应依赖英语学习者比例,即两个自变量存在交互。三种情形:两个二元变量、一个二元一个连续、两个连续。

两个二元变量的交互

对数收入 \(Y_i=\ln(Earnings_i)\) 对是否大学毕业 \(D_{1i}\) 与是否女性 \(D_{2i}\) 回归:

\[Y_i=\beta_0+\beta_1D_{1i}+\beta_2D_{2i}+u_i\tag{8.27}\]
\(\beta_1\) 是保持性别不变时大学学位的效应,\(\beta_2\) 是保持学历不变时男女平均差异。局限:大学学位效应对男女相同,没有理由必须如此。加入交互项(interaction term / interacted regressor)\(D_{1i}\times D_{2i}\):
\[Y_i=\beta_0+\beta_1D_{1i}+\beta_2D_{2i}+\beta_3(D_{1i}\times D_{2i})+u_i\tag{8.28}\]
称二元变量交互回归模型(binary variable interaction regression model)。用 Key Concept 8.1:\(E(Y\mid D_1=0,D_2=d_2)=\beta_0+\beta_2d_2\);\(E(Y\mid D_1=1,D_2=d_2)=\beta_0+\beta_1+\beta_2d_2+\beta_3d_2\);
\[E(Y_i\mid D_{1i}=1,D_{2i}=d_2)-E(Y_i\mid D_{1i}=0,D_{2i}=d_2)=\beta_1+\beta_3d_2\tag{8.29}\]
男性(\(d_2=0\))学位效应为 \(\beta_1\),女性为 \(\beta_1+\beta_3\);\(\beta_3\) 是女性与男性学位效应之差。

Key Concept 8.3(含二元变量回归的系数解释方法):先计算二元变量所有可能组合下 Y 的期望值,再比较这些期望值;每个系数都可表示为某个期望值或若干期望值之差。

应用:\(HiSTR_i=1\) 若 STR≥20;\(HiEL_i=1\) 若英语学习者比例≥10%。

\[\widehat{TestScore}=\underset{(1.4)}{664.1}-\underset{(1.9)}{1.9}HiSTR-\underset{(2.3)}{18.2}HiEL-\underset{(3.1)}{3.5}(HiSTR\times HiEL),\quad\bar R^2=0.290\tag{8.30}\]
从低师生比到高师生比的效应为 \(-1.9-3.5HiEL\):英语学习者少时降 1.9 分,多时降 5.4 分。四组样本均值:(HiSTR,HiEL)=(0,0) 为 664.1;(1,0) 为 662.2;(0,1) 为 645.9;(1,1) 为 640.5(=664.1−1.9−18.2−3.5)。

连续变量与二元变量的交互

对数收入 Y 对工作经验年数 \(X_i\)(连续)和是否大学毕业 \(D_i\) 回归。图 8.8 展示三种方式:

(a) 截距不同、斜率相同:

\[Y_i=\beta_0+\beta_1X_i+\beta_2D_i+u_i\tag{8.31}\]
D=0 时 \(\beta_0+\beta_1X\),D=1 时 \((\beta_0+\beta_2)+\beta_1X\);\(\beta_2\) 是截距差。经验效应对两组相同。

(b) 截距与斜率都不同:

\[Y_i=\beta_0+\beta_1X_i+\beta_2D_i+\beta_3(X_i\times D_i)+u_i\tag{8.32}\]
D=0 时 \(\beta_0+\beta_1X\),D=1 时 \((\beta_0+\beta_2)+(\beta_1+\beta_3)X\);截距差 \(\beta_2\),斜率差 \(\beta_3\)——大学毕业生与非毕业生每多一年经验效应之差。

(c) 截距相同、斜率不同:

\[Y_i=\beta_0+\beta_1X_i+\beta_2(X_i\times D_i)+u_i\tag{8.33}\]
要求两组无经验时期望对数收入相同,即入门工资相同,在此应用中不太合理,实践中比 (8.32) 少用。

三者都是多元回归,生成 \(X_i\times D_i\) 后即可 OLS。Key Concept 8.4 汇总这三种设定。

应用:

\[\widehat{TestScore}=\underset{(11.9)}{682.2}-\underset{(0.59)}{0.97}STR+\underset{(19.5)}{5.6}HiEL-\underset{(0.97)}{1.28}(STR\times HiEL),\quad\bar R^2=0.305\tag{8.34}\]
HiEL=0:\(682.2-0.97STR\);HiEL=1:\(687.8-2.25STR\)。师生比降 1,英语学习者少的学区提高 0.97 分,多的学区提高 2.25 分,差 1.28 即交互项系数。

可评估更精细的政策:只在 HiEL=1 的学区把师生比降 2,效应 \(-2(\hat\beta_1+\hat\beta_3)=4.50\),SE \(=SE(-2\hat\beta_1-2\hat\beta_3)=1.53\)(用式 8.8 与 7.3 节方法)。

四个检验:

  1. 两条线相同(HiEL 与交互项系数均为 0):F=89.9,1% 水平显著。
  2. 斜率相同(交互项系数为 0):\(t=-1.28/0.97=-1.32\),10% 水平不能拒绝。
  3. 截距相同(HiEL 系数为 0):\(t=5.6/19.5=0.29\),5% 水平不能拒绝。
  4. STR 不进入设定(STR 与交互项系数均为 0):F=5.64,p=0.004,1% 水平联合显著。

看似矛盾:联合 F 拒绝"斜率和截距都相同",单个 t 却都不拒绝。原因是 HiEL 与 \(STR\times HiEL\) 高度相关,单个系数 SE 很大;虽无法判断哪个系数非零,但有强证据表明二者不全为零。(这是交互项设计中常见的共线问题。)

方框:老龄化对医疗支出的影响——转移视线的"红鲱鱼"?(PDF p.304–305)

西欧"婴儿潮"一代步入退休,老龄人口比例上升。OECD 初步估计很悲观:老年人平均医疗支出(healthcare expenditures, HCE)更高,老龄化将给公共财政带来上行压力。但若人们更健康地老去呢?学术界形成共识:决定 HCE 的不是年龄本身,而是离死亡的距离(time-to-death, TTD)——80 岁、85 岁去世的人与 70 岁、75 岁去世的人更相似,而不像另一个 100 岁才去世的 80 岁老人。年龄因此被称为"红鲱鱼"(red herring,只是真实决定因素的代理),TTD 是以往回归的遗漏变量。

研究(Howdon & Rice 2018,英格兰约 40,000 人的两个样本,2005–06 至 2011–12)以 ln(HCE) 为因变量。表 8.1(男性):

回归元 (1) (2) (3)
Age −0.01459** (0.00654) −0.01274* (0.00652) −0.00518 (0.00526)
Age² 0.00010** (0.00004) 0.00009** (0.00004) 0.00003 (0.00003)
ln(TTD) −0.42375*** (0.01467) −0.14454*** (0.01206)
患病情况(morbidities) 纳入(联合 ***)

由列 (1),80→81 岁 HCE 的平均百分比变化 \(=1\times(-0.01459)+(81^2-80^2)\times0.00010=0.00151\),即 0.151%。加入 ln(TTD) 后年龄系数绝对值和显著性下降,ln(TTD) 高度显著——离死亡远 1%,HCE 平均下降约 0.42%(对数-对数弹性)。但 TTD 本身也可能是"红鲱鱼",只是代理个人患病情况(morbidity);列 (3) 纳入患病控制后 TTD 和年龄系数的大小与显著性都下降。若人们不仅更健康地变老、而且更健康地走向死亡,这对预测未来 HCE 很重要。启示:纳入哪些变量取决于你要回答的确切问题。

两个连续变量的交互

例:\(Y_i\) 为对数收入,\(X_{1i}\) 为工作经验,\(X_{2i}\) 为受教育年数。线性模型中经验效应不依赖教育;加入乘积交互项:

\[Y_i=\beta_0+\beta_1X_{1i}+\beta_2X_{2i}+\beta_3(X_{1i}\times X_{2i})+u_i\tag{8.35}\]
由 Key Concept 8.1,\(\Delta Y=(\beta_1+\beta_3X_2)\Delta X_1\)(习题 8.10a),
\[\frac{\Delta Y}{\Delta X_1}=\beta_1+\beta_3X_2\tag{8.36}\]
若 \(\beta_3>0\),则工人每多受一年教育,额外一年经验对对数收入的效应就大 \(\beta_3\)。同理 \(\Delta Y/\Delta X_2=\beta_2+\beta_3X_1\)。两者同时变化:
\[\Delta Y=(\beta_1+\beta_3X_2)\Delta X_1+(\beta_2+\beta_3X_1)\Delta X_2+\beta_3\Delta X_1\Delta X_2\]
第一项是保持 \(X_2\) 不变时 \(X_1\) 变化的效应,第二项反之,最后一项 \(\beta_3\Delta X_1\Delta X_2\) 是同时变化带来的额外效应。

Key Concept 8.5(多元回归中的交互):\(X_1\) 与 \(X_2\) 的交互项是乘积 \(X_1\times X_2\);纳入它使 \(X_1\) 对 Y 的效应依赖 \(X_2\),反之亦然。其系数是 \(X_1\)、\(X_2\) 各增加一单位时,超出两者单独效应之和的部分;无论变量连续还是二元都成立。交互与对数变换结合,可估计依赖商品特征的价格弹性。

方框:经济学期刊的需求(PDF p.307–309)

问题:美国图书馆对经济学期刊的需求弹性多大?数据:2000 年 180 种经济学期刊的美国图书馆订阅数(\(Y_i\))与图书馆订阅价格。期刊的产品是思想,价格应以"每个思想的美元"衡量,用被引次数间接度量思想,即"每次引用价格"(price per citation)。范围极大:从约 0.5 美分(American Economic Review)到 20 美分以上。2017 年 Journal of Econometrics 图书馆纸本订阅 5363 美元,而美国经济学会全部八种期刊(含 AER)捆绑订阅仅 940 美元。

图 8.9:(a) 订阅量与每引用价格呈非线性反向关系;(b) 取对数后近似线性;(c) 年轻期刊(Age=5)需求比老期刊(Age=80)更有弹性。因要估计弹性,用对数-对数设定;又因一些最老最有声望的期刊每引用价格最便宜,对数量对对数价格回归可能有遗漏变量偏差,故控制 ln(Age) 和 ln(每年字符数/百万)。

表 8.2(因变量 ln 订阅数;n=180;均含截距):

回归元 (1) (2) (3) (4)
ln(每引用价格) −0.533 (0.034) −0.408 (0.044) −0.961 (0.160) −0.899 (0.145)
[ln 价格]² 0.017 (0.025)
[ln 价格]³ 0.0037 (0.0055)
ln(Age) 0.424 (0.119) 0.373 (0.118) 0.374 (0.118)
ln(Age)×ln(价格) 0.156 (0.052) 0.141 (0.040)
ln(字符数/10⁶) 0.206 (0.098) 0.235 (0.098) 0.229 (0.096)
二次、三次项 F (p) 0.25 (0.779)
SER 0.750 0.705 0.691 0.688
\(\bar R^2\) 0.555 0.607 0.622 0.626

结论:(1) 老期刊需求弹性更小(交互项为正且显著);(2) 证据支持 ln 价格的线性而非三次函数(F=0.25,p=0.779);(3) 保持价格和年龄不变,字符数越多需求越大。弹性随期刊年龄变化:由列 (4),弹性 \(=-0.899+0.141\ln(Age)\),80 岁期刊约 −0.28(SE 0.06),5 岁期刊约 −0.67(SE 0.08)。需求非常缺乏弹性,对图书馆而言最新研究是必需品而非奢侈品;作为对比,香烟需求弹性约 −0.3 到 −0.5——经济学期刊和香烟一样"上瘾",但对健康好得多。(数据由 UCSB 的 Theodore Bergstrom 提供,见 Bergstrom 2001。)

应用:STR 与连续 PctEL 的交互

\[\widehat{TestScore}=\underset{(11.8)}{686.3}-\underset{(0.59)}{1.12}STR-\underset{(0.37)}{0.67}PctEL+\underset{(0.019)}{0.0012}(STR\times PctEL),\quad\bar R^2=0.422\tag{8.37}\]

PctEL 取中位数 8.85 时 STR 斜率 \(-1.12+0.0012\times8.85=-1.11\);取第 75 百分位 23.0 时 \(-1.09\),略平。但交互项 \(t=0.0012/0.019=0.06\),10% 水平不显著。8.1–8.3 节未纳入经济背景等控制变量,结果可能有遗漏变量偏差,需要加入控制变量——即 8.4 节。

8.4 师生比对考试成绩的非线性效应(Nonlinear Effects on Test Scores of the Student–Teacher Ratio,PDF p.310–315)

三个问题:(1) 控制学区经济特征后,降低师生比的效应是否依赖英语学习者比例?(2) 是否依赖师生比本身的取值?(3) 最重要:考虑经济因素和非线性后,师生比降 2 的效应估计是多少?

控制变量:午餐补贴资格比例与学区平均收入的对数(8.2 节表明对数形式能刻画收入与成绩的非线性)。同 7.6 节,不纳入生均支出——即考虑的是允许生均支出随之增加时降低师生比的效应。

表 8.3(因变量学区平均成绩,n=420;均含截距;Y/N 表示是否纳入经济控制变量)

回归元 (1) (2) (3) (4) (5) (6) (7)
STR −1.00 (0.27) −0.73 (0.26) −0.97 (0.59) −0.53 (0.34) 64.33 (24.86) 83.70 (28.50) 65.29 (25.26)
STR² −3.42 (1.25) −4.38 (1.44) −3.47 (1.27)
STR³ 0.059 (0.021) 0.075 (0.024) 0.060 (0.021)
PctEL −0.122 (0.033) −0.176 (0.034) −0.166 (0.034)
HiEL 5.64 (19.51) 5.50 (9.80) −5.47 (1.03) 816.1 (327.7)
HiEL×STR −1.28 (0.97) −0.58 (0.50) −123.3 (50.2)
HiEL×STR² 6.12 (2.54)
HiEL×STR³ −0.101 (0.043)
午餐资格 % Y Y N Y Y Y Y
ln(学区收入) N Y N Y Y Y Y
SER 9.08 8.64 15.88 8.63 8.56 8.55 8.57
\(\bar R^2\) 0.773 0.794 0.305 0.795 0.798 0.799 0.798

师生比降 2 效应的 95% CI:

  • 无交互线性 (1)(2):[0.93, 3.06],[0.46, 2.48];
  • 三次 (5)(7):22→20 为 [0.61, 3.25]、[0.54, 3.26];20→18 为 [1.64, 4.36]、[1.55, 4.30];
  • 线性交互 (3)(4):HiEL=0 为 [−0.38, 4.25]、[−0.28, 2.41];HiEL=1 为 [1.48, 7.50]、[0.80, 3.63];
  • 三次交互 (6):HiEL=0 时 22→20 [0.40, 3.98]、20→18 [1.22, 4.99];HiEL=1 时 22→20 [−0.98, 2.91]、20→18 [−0.72, 4.01]。

联合检验 F(p 值):所有 STR 变量及交互为 0——(3) 5.64 (0.004)、(4) 5.92 (0.003)、(5) 6.31 (<0.001)、(6) 4.96 (<0.001)、(7) 5.91 (0.001);STR²、STR³ 为 0——(5) 6.17 (<0.001)、(6) 5.81 (0.003)、(7) 5.96 (0.003);HiEL×STR、HiEL×STR²、HiEL×STR³ 为 0——(6) 2.69 (0.046)。

回归结果讨论

  • (1) 即表 7.1 的 (3)。(2) 加入对数收入:其在 1% 水平显著,STR 系数从 −1.00 变为 −0.73(仍 1% 显著),变化足够大,故后续回归都控制对数收入以防遗漏变量偏差。
  • (3) 即 (8.34),无经济控制;(4) 加入经济控制后高/低英语学习者学区的班级规模效应都减小,但 CI 都很宽;STR 效应在两组相同的假设在 5% 水平不能拒绝(\(t=-0.58/0.50=-1.16\))。
  • (5) 加入 STR 三次项(因 (4) 中 HiEL×STR 在 10% 水平不显著而不纳入):支持非线性——STR²、STR³ 均为 0 的 F=6.17,p<0.001,1% 水平拒绝线性;20→18 的效应大于 22→20。
  • (6) 加入 HiEL 与 STR、STR²、STR³ 的交互,检验高/低英语学习者组的三次函数是否不同:F=2.69,p=0.046,5% 显著但 1% 不显著,提供初步证据;但与 (4) 对比可见差异来自二次、三次项,且 (6) 的 CI 都很宽。
  • (7) 用连续 PctEL 代替 HiEL:其他系数变化不大,说明 (5) 的结果对英语学习者比例的度量方式不敏感。
  • 所有设定中,"STR 不进入回归"的假设都在 1% 水平被拒绝。

图形解读

非线性设定最易用图解释。图 8.10 画出线性 (2) 与三次 (5)(7) 的估计回归函数(脚注:除 STR 外其他自变量都固定在样本均值,计算不同 STR 下的调整预测值):三条曲线很接近,三次回归在 STR 很大时变平;(5) 与 (7) 几乎相同,显示少量非线性。

图 8.11 画出回归 (6) 中 HiEL=0 与 HiEL=1 的两条三次函数:在 STR 17–23 之间(含 88% 的观测)两条曲线相差约 10 分但形状和斜率相似——英语学习者少的学区成绩更高,但师生比变化的效应两组基本相同。STR<16.5 时两函数不同,但这类学区只占 6%,差异只反映极少数观测,不应过度解读。结论:在数据最多的范围内,师生比效应不依赖英语学习者比例。

结论汇总

  1. 控制经济背景后,班级规模效应依赖英语学习者多寡的证据至多很弱:高英语学习者学区估计效应更大,但差异估计不精确,且在数据集中的范围内两条回归函数斜率相似。
  2. 控制经济背景后,有证据表明 STR 对成绩有非线性效应:中等规模班级降低师生比效应最大,很小或很大的班级效应较小;1% 水平拒绝线性。
  3. 回到第 4 章督学的问题(师生比降 2):线性设定 (2) 中效应与 STR 取值无关,为 \(-0.73\times(-2)=1.46\) 分;非线性设定中依赖当前 STR——依据 (5),若当前为 20、降到 18,效应 3.00 分,95% CI (1.64, 4.36);若当前为 22、降到 20,效应 1.93 分,95% CI (0.61, 3.25);(7) 结果类似。非线性设定可根据学区特征给出更细致的回答。

8.5 结论(PDF p.315–316)

本章介绍了多种非线性回归函数建模方法;它们都是多元回归的变体,可用 OLS 估计、用 t 和 F 检验。这类模型中,保持其他自变量不变时 \(X_1\) 变化对 Y 的期望效应一般依赖 \(X_1,\dots,X_k\) 的取值。没有一个万能配方,最重要的一步是"动脑子"(use your head):看数据之前,基于经济理论或专家判断,思考回归函数斜率为何可能依赖该变量或另一个变量、预期何种依赖、哪些非线性对研究的实质问题有重大影响。成绩例子中正是这样的推理促使检验"英语学习者多的学区雇更多教师效应是否更大";问题明确后得到明确答案:控制经济背景后,降低班级规模的效应实际上不依赖英语学习者多少。

原书 Summary:(1) 非线性回归中总体回归函数斜率依赖一个或多个自变量的取值;(2) X 变化对 Y 的效应可通过在两个 X 值处求回归函数之差计算(Key Concept 8.1);(3) 多项式回归以 X 的幂为回归元,二次含 X、X²,三次含 X、X²、X³;(4) 对数的小变化可解释为比例或百分比变化,含对数的回归用于估计比例变化和弹性;(5) 两变量乘积称交互项,纳入后一个变量的回归斜率可依赖另一个变量。

关键术语:二次回归模型、非线性回归函数、多项式回归模型、三次回归模型、弹性、指数函数、自然对数、线性-对数模型、对数-线性模型、对数-对数模型、交互项、交互回归元、交互回归模型、非线性最小二乘、非线性最小二乘估计量。

复习题与习题(PDF p.317–325)

复习题 8.1–8.6:工资与受教育年限非线性的含义、如何检验、如何估计变化率;用回归估计 Cobb–Douglas 生产函数 \(Q=\lambda K^{\beta_1}L^{\beta_2}M^{\beta_3}e^u\) 的参数(两边取对数后变为对数-对数线性回归);三种对数模型的斜率解释;用 LoSTR=1−HiSTR、LoEL=1−HiEL 重估 (8.30) 时各系数值(利用四组均值重新推出);若 \(\beta_2\) 随 K 增大,如何用交互项刻画;哪些类型变量可以交互、如何解释两连续或两二元回归元交互项系数。

习题概览:

  • 8.1:销售额从 2018 年 2.43 亿美元增至 2019 年 2.50 亿,比较精确百分比增长与对数差近似;改为 2.55、2.60、2.65 亿重算,体会变化越大近似越差。
  • 8.2:房价回归表(因变量 ln(Price)):
回归元 (1) (2) (3) (4) (5)
Size 0.00042 (0.000038)
ln(Size) 0.69 (0.054) 0.68 (0.087) 0.57 (2.03) 0.69 (0.055)
[ln(Size)]² 0.0078 (0.14)
Bedrooms 0.0036 (0.037)
Pool 0.082 (0.032) 0.071 (0.034) 0.071 (0.034) 0.071 (0.036) 0.071 (0.035)
View 0.037 (0.029) 0.027 (0.028) 0.026 (0.026) 0.027 (0.029) 0.027 (0.030)
Pool×View 0.0022 (0.10)
Condition 0.13 (0.045) 0.12 (0.035) 0.12 (0.035) 0.12 (0.036) 0.12 (0.035)
截距 10.97 (0.069) 6.60 (0.39) 6.63 (0.53) 7.02 (7.50) 6.60 (0.40)

(原表 SER/\(R^2\) 行数值明显是从第 7 章表格错抄的,可忽略。)题目:列 (1) 加建 1500 平方英尺的价格变化及 99% CI(对数-线性:\(100\times0.00042\times1500=63\%\));列 (2) ln(Size) 系数是弹性,面积翻倍的效应;景观效应的 99% CI 与显著性;列 (3) 加两个卧室的效应、面积与卧室数哪个更重要;列 (4) Condition 是否显著;列 (5) Pool×View 交互是否显著,有/无泳池时加景观的效应。

  • 8.3:教育者描述的门槛效应(threshold effect):班级 <20 表现好且不变、20–25 之间恒定、>25 很差且不变。用 STRsmall、STRmoderate、STRlarge 虚拟变量建模:画出 \(TestScore=\beta_0+\beta_1STRsmall+\beta_2STRlarge\) 的阶梯函数;同时放三个虚拟变量和截距时软件报错——虚拟变量陷阱。
  • 8.4:用表 8.1 列 (1) 计算 60 岁与 70 岁男性多一岁时 ln(HCE) 的变化(\(-0.01459+(61^2-60^2)\times0.0001\) 等),解释为何不同、差异是否在 5% 水平显著(取决于 Age² 系数,t=2.5),若怀疑年龄效应男女不同如何修改回归(加入 Female 及其与 Age、Age² 的交互)。
  • 8.5:解释期刊需求方框三个结论的依据;由回归 (4) 得到 80 岁期刊弹性 −0.28 的计算方法(\(-0.899+0.141\ln80\))以及 SE 0.06 的计算(式 8.8 或变换回归);若 Characters 除以 1000 而非 1,000,000,列 (4) 如何变化(只有截距改变,因为 ln 尺度变化只是加常数)。
  • 8.6:基于表 8.3:午餐资格比例的非线性效应(如加平方项或分段/对数)如何设定与检验;收入效应在大班/小班学区不同如何设定(ln(Income)×HiSTR 交互)与检验。
  • 8.7:Bertrand & Hallock(2001)高管薪酬性别差距:\(\widehat{\ln(Earnings)}=6.48-0.44Female\),SER=2.65(−0.44 的含义约 −36%(\(e^{-0.44}-1\))或近似 −44%;SER 含义;是否表明女性高管收入低;是否证明歧视);加入 ln(MarketValue)(系数 0.37 为弹性)与 Return 后 Female 系数变为 −0.28,解释变化(女性高管更多在小公司——遗漏变量偏差方向);判断大公司是否更少女性高管。
  • 8.8:画出若干线性-对数、含二元变量及其与 ln(X) 交互、二次函数的回归曲线(X 取 5–100)。
  • 8.9:用 7.3 节方法 2 计算 (8.8) 下面讨论的 CI(需重新定义回归元和因变量,如令 \(W=Income^2-21Income\) 使某系数成为 \(\beta_1+21\beta_2\))。
  • 8.10:证明两连续交互模型中 \(\Delta Y/\Delta X_1=\beta_1+\beta_3X_2\)、\(\Delta Y/\Delta X_2=\beta_2+\beta_3X_1\) 以及同时变化的公式。
  • 8.11:推导附录 8.2 中线性与对数-对数模型的弹性表达式。
  • 8.12:在习题 7.11(即第 6 章习题 6.12 的二年级小班实验)情境下,证明交互系数解释在条件均值独立下也成立:分别对老生、新生回归得班级规模效应 \(\gamma_1\)、\(\delta_1\);合并样本交互回归中 \(\beta_1=\gamma_1\),\(\beta_1+\beta_3=\delta_1\),\(\beta_3=\delta_1-\gamma_1\);\(\hat\beta_1,\hat\beta_3\) 无偏而 \(\hat\beta_2\) 一般有偏。
  • E8.1:1900 年美国 172 个城市含铅水管与婴儿死亡率(Clay, Troesken & Haines 2014):比较有/无铅管城市均值;Inf 对 Lead、pH、Lead×pH 回归,解释四个系数、画两条回归线、Lead 效应是否显著及是否依赖 pH(水越酸 pH 越低浸出铅越多),在 pH 均值及 ±1 标准差处的 Lead 效应,pH=6.5 时 Lead 效应的 95% CI;用其他变量检查遗漏变量偏差。
  • E8.2:CPS2015(25–34 岁全职全年、高中或学士学历)年龄与收入:分别用 AHE 线性、ln(AHE) 对 Age、ln(AHE) 对 ln(Age)、ln(AHE) 对 Age 与 Age² 回归,计算 25→26 与 33→34 岁的收入变化;比较各设定的优劣;画图比较;加入 Female×Bachelor 交互并预测 Alexis、Jane、Bob、Jim 四人的 ln(AHE);检验年龄效应是否因性别、学历不同;总结年轻工人的年龄收入效应。

附录 8.1 对参数非线性的回归函数(Regression Functions That Are Nonlinear in the Parameters,PDF p.325–328)

8.2、8.3 节的函数对 X 非线性但对参数线性,定义新回归元后即可 OLS,这一族既丰富又方便。但有时经济推理导出对参数非线性的函数,不能用 OLS,需用其推广——非线性最小二乘(nonlinear least squares, NLLS)。

Logistic 曲线:研究某技术(如机器学习软件)在各行业的市场渗透,因变量为采纳企业比例(0–1),线性模型预测值可能越界,宜用取值在 0–1 之间的函数:

\[Y_i=\frac{1}{1+e^{-(\beta_0+\beta_1X_i)}}+u_i\tag{8.38}\]
图 8.12a:拉长的 S 形——X 小时接近 0 且平坦,中间陡,X 大时趋近 1 且再次平坦。

负指数增长(negative exponential growth):8.2 节模型的缺陷——多项式在某些收入处可能出现负斜率,不合理;对数设定斜率始终为正,但收入很大时预测值无界增长,可能超过考试最高分。负指数增长模型斜率始终为正、低收入时最陡且随收入递减、有上界(渐近线):

\[Y_i=\beta_0\left[1-e^{-\beta_1(X_i-\beta_2)}\right]+u_i\tag{8.39}\]
\(\beta_0,\beta_1>0\) 时,低 X 处陡,X 增大时趋近渐近线 \(\beta_0\)(图 8.12b)。

一般形式:

\[Y_i=f(X_{1i},\dots,X_{ki};\beta_0,\dots,\beta_m)+u_i\tag{8.40}\]
k 个自变量、m+1 个参数,参数非线性进入。参数已知时可用 8.1 节方法计算预测效应;未知时需从数据估计。

非线性最小二乘估计:回忆 OLS 原则上可通过尝试许多参数值、选使预测误差平方和最小者来求得。同理,对试验参数 \(b_0,\dots,b_m\) 构造

\[\sum_{i=1}^n\left[Y_i-f(X_{1i},\dots,X_{ki};b_0,\dots,b_m)\right]^2\tag{8.41}\]
使之最小者即 NLLS 估计量。与线性回归不同,NLLS 没有一般的显式公式,必须用计算机数值求解;回归软件内置求解算法。在关于 f 和 X 的一般条件下,NLLS 与 OLS 共享两个关键性质:一致、大样本正态。软件通常报告参数的标准误,因此推断照常进行:t 统计量按 Key Concept 5.1 构造,95% CI 为估计 ±1.96 SE。与线性回归一样,误差可能异方差,应使用异方差稳健 SE。

应用:负指数增长模型拟合收入与成绩:

\[\widehat{TestScore}=\underset{(4.44)}{703.2}\left[1-e^{-\underset{(0.0068)}{0.0552}(Income+\underset{(4.48)}{34.0})}\right]\tag{8.42}\]
即 \(\hat\beta_0=703.2\),\(\hat\beta_1=0.0552\),\(\hat\beta_2=-34.0\)(稳健 SE)。图 8.13:与线性-对数函数非常接近,差别是负指数增长曲线在最高收入处变平,符合存在渐近线。

附录 8.2 非线性回归函数的斜率与弹性(Slopes and Elasticities for Nonlinear Regression Functions,PDF p.328–330)

用微积分计算连续回归元的斜率与弹性,聚焦单个 X(多个 X 时用偏导数)。模型 \(Y_i=f(X_i)+u_i\),\(E(u_i\mid X_i)=0\),在 \(X=x\) 处的斜率为 \(df(X)/dX|_{X=x}\)。

多项式:\(f(X)=\beta_0+\beta_1X+\cdots+\beta_rX^r\),斜率 \(\beta_1+2\beta_2x+\cdots+r\beta_rx^{r-1}\);估计斜率把 β 换成 \(\hat\beta\);给定 x 时其 SE 是回归系数加权和的 SE,可用 7.3 节方法与式 (8.8) 计算。

弹性:X 百分比变化趋于 0 时的极限,

\[\text{Y 对 X 的弹性}=\frac{dY}{dX}\times\frac{X}{Y}=\frac{d\ln Y}{d\ln X}\]
回归模型中 Y 依赖 X 和 u,惯例计算预测部分 \(E(Y\mid X)\) 的弹性:\(\dfrac{dE(Y\mid X)}{dX}\times\dfrac{X}{E(Y\mid X)}=\dfrac{d\ln E(Y\mid X)}{d\ln X}\)。

情形 总体回归模型 \(E(Y\mid X)\) 对 X 的弹性
线性 \(Y=\beta_0+\beta_1X+u\) \(\dfrac{\beta_1X}{\beta_0+\beta_1X}\)
线性-对数 \(Y=\beta_0+\beta_1\ln X+u\) \(\dfrac{\beta_1}{\beta_0+\beta_1\ln X}\)
对数-线性 \(\ln Y=\beta_0+\beta_1X+u\) \(\beta_1X\)
对数-对数 \(\ln Y=\beta_0+\beta_1\ln X+u\) \(\beta_1\)

只有对数-对数设定弹性恒定,其他三种依赖 X。推导:线性-对数中 \(dE(Y\mid X)/dX=\beta_1/X\),乘以 \(X/[\beta_0+\beta_1\ln X]\) 即得。对数-线性中惯例再假设 u 与 X 独立,则 \(E(Y\mid X)=ce^{\beta_0+\beta_1X}\),\(c=E(e^u)\) 为与 X 无关的常数,\(dE(Y\mid X)/dX=ce^{\beta_0+\beta_1X}\beta_1\),弹性 \(=\beta_1X\)。线性与对数-对数的推导留作习题 8.11。(本块到 PDF p.330 为止,附录 8.2 内容在此完整;第 9 章从下一块开始。)

本章要点

  1. 非线性回归函数的斜率依赖自变量取值;本章的多项式、对数和交互模型对 X 非线性但对参数线性,仍可用 OLS 估计、用 t/F 推断。
  2. 非线性模型中 X 变化的效应用 Key Concept 8.1 计算:在两个 X 值处求预测值之差;其 SE 是系数线性组合的 SE,可用 \(SE=|\Delta\hat Y|/\sqrt F\) 或重参数化求得。单个系数一般没有独立解释,应作图并计算效应。
  3. 多项式:用序贯 t 检验从较小的最高次数(2–4)往下确定次数,用 F 检验线性。
  4. 对数:\(\ln(x+\Delta x)-\ln x\approx\Delta x/x\)。线性-对数:1% X ↔ \(0.01\beta_1\) 单位 Y;对数-线性:1 单位 X ↔ \(100\beta_1\%\) Y;对数-对数:\(\beta_1\) 为弹性。因变量不同的模型不能用 \(\bar R^2\) 比较;ln Y 的预测值取指数会低估 \(E(Y\mid X)\)(需乘 \(E(e^u)\))。
  5. 交互项:二元×二元(效应因组而异,用组合均值解释);连续×二元(三种截距/斜率组合);连续×连续(\(\partial Y/\partial X_1=\beta_1+\beta_3X_2\))。交互项与主效应常高度相关,单个 t 不显著而联合 F 显著的情形很常见。
  6. 建模五步:理论识别 → 设定并 OLS 估计 → 检验是否优于线性 → 作图 → 计算效应。最重要的是事先"动脑子"。
  7. 加州例:控制经济背景后,STR 效应存在显著非线性(中等班级效应最大),但不随英语学习者比例显著变化;降 2 的效应在 20→18 约 3.0 分、22→20 约 1.9 分。
  8. 对参数非线性的模型(logistic、负指数增长)用非线性最小二乘数值求解,大样本性质与 OLS 类似,应使用稳健 SE。

与量化交易的关联

  • 对数收益与百分比近似:\(\ln(1+r)\approx r\) 的近似及其误差随 r 增大而变大(习题 8.1)是理解对数收益、复利与算术收益差异的基础;回测中多期收益累加用对数收益、截面比较常用简单收益。
  • 对数变换与弹性:市值、成交额、价格冲击等变量高度右偏,因子中常用 ln(市值);交易成本模型中冲击成本对交易量占比(参与率)的弹性(如平方根律 \(\text{impact}\propto(\text{Q/ADV})^{0.5}\))正是对数-对数回归估计的弹性。预测 ln 变量后还原原单位时需注意 \(E(e^u)\) 偏差修正(如预测波动率、成交量时)。
  • 多项式与非线性因子效应:因子收益常呈非线性(如极端分位才有效、市值效应在小盘端集中),可用二次/三次项或分组虚拟变量(门槛效应,习题 8.3)建模,用 F 检验线性;但高次多项式外推危险,尾部数据稀少时(如图 8.11 中 STR<16.5 仅 6% 观测)不应过度解读。
  • 交互项 = 条件因子效应:因子在不同市场状态(牛/熊、高/低波动)、不同股票特征(小盘/大盘、高/低流动性)下效应不同,可用"因子 × 状态虚拟变量"或"因子 × 连续特征"交互项建模,系数解释用 Key Concept 8.3–8.5。期刊需求例中"弹性随年龄变化"的思路可直接迁移为"因子载荷随市值/换手率变化"。注意交互项与主效应共线导致单个 t 不显著、需看联合 F。
  • 效应的 SE:非线性/交互模型中某一点的边际效应(如特定波动率水平下的因子溢价)是系数线性组合,其 SE 必须考虑协方差(式 8.7–8.8),不能只看单个系数的 SE。
  • Logistic 与 NLLS:Logistic 曲线用于建模取值在 0–1 的量(如成交概率、违约概率、订单成交率);非线性最小二乘用于拟合期限结构(Nelson–Siegel 曲线对参数非线性)、期权隐含波动率曲面参数化、市场冲击衰减曲线等,需数值优化并用稳健 SE。
  • 控制变量与非线性结合:8.4 节"先确认控制变量、再探索非线性"的顺序对应因子研究中"先做风格中性化、再检验非线性或条件效应"。

推荐习题

  • 8.1:对数近似精度,直接对应对数收益与简单收益的差异。
  • 8.2:对数模型系数解释、弹性、交互项显著性的综合练习。
  • 8.3:门槛效应建模与虚拟变量陷阱。
  • 8.5:交互项下弹性及其标准误的计算(系数线性组合的 SE)。
  • 8.7:对数因变量下虚拟变量系数的百分比解释、遗漏变量偏差方向。
  • 8.9:用重参数化求非线性效应的 CI。
  • 8.10、8.12:交互项的数学推导及其在条件均值独立下的因果解释。
  • E8.2:比较多种函数形式(线性、对数、二次、交互),练习设定选择与解释。