量化交易中文教材

元信息:James H. Stock & Mark W. Watson《Introduction to Econometrics》(Global Edition, 4th ed.);本笔记负责 PDF 第 331–474 页(第 9–12 章:多元回归研究的评估、面板数据回归、二元因变量回归、工具变量回归)。

第 9 章 基于多元回归的研究评估(Assessing Studies Based on Multiple Regression)

章首导言(PDF p.331)

前五章(第 4–8 章)讲授了如何用多元回归分析变量关系。本章退一步问:什么让一项使用多元回归的研究可靠或不可靠?重点是以估计**因果效应(causal effect)**为目标的研究,例如班级规模(学生–教师比,student–teacher ratio, STR)对考试成绩的影响:什么时候多元回归能给出有用的因果估计,什么时候会失败?

为此本章给出一个评估统计研究的一般框架(不限于回归),核心概念是内部有效性(internal validity)与外部有效性(external validity):

  • 研究内部有效:其关于因果效应的统计推断对所研究的总体与情境成立;
  • 研究外部有效:其推断可推广到其他总体与情境。

章节安排:9.1、9.2 讨论内外部有效性及其威胁(针对用观测数据估计因果效应);9.3 回到**预测(prediction)**问题,讨论用回归做预测时的有效性威胁;9.4 用该框架评估第 4–8 章的加州班级规模研究,并与马萨诸塞州数据比较。

9.1 内部有效性与外部有效性(PDF p.331–333)

被研究总体与目标总体。 内外部有效性的区分建立在“被研究的总体与情境”和“结果要推广到的总体与情境”之间:

  • 被研究总体(population studied):样本抽取自的实体总体(人、公司、学区等)。
  • 目标总体(population of interest):研究的因果推断要应用到的实体总体。例:一位高中(9–12 年级)校长想把加州小学学区的班级规模结论(被研究总体)推广到高中(目标总体)。
  • 情境(setting):制度、法律、社会、物理和经济环境。例:实验室里种植有机番茄的方法能否推广到田间。

Key Concept 9.1(内部与外部有效性):若关于因果效应的统计推断对被研究总体成立,称分析具有内部有效性;若其推断与结论可从被研究的总体和情境推广到其他总体和情境,称具有外部有效性。

内部有效性的两个组成部分:

  1. 因果效应的估计量应无偏且一致。例:若 \(\hat\beta_{STR}\) 是某回归中 STR 单位变化对成绩效应的 OLS 估计量,它应是总体因果效应 \(\beta_{STR}\) 的无偏一致估计量。
  2. 假设检验应有预期的显著性水平(原假设下实际拒绝率等于名义水平),置信区间应有预期的置信水平。例:\(\hat\beta_{STR}\pm1.96\,SE(\hat\beta_{STR})\) 在重复抽样下应以 95% 概率覆盖真值 \(\beta_{STR}\)。

在基于 OLS 的研究中,内部有效性要求:OLS 估计量无偏一致,且标准误的计算方式使置信区间有正确覆盖率。各种原因可能使这些要求不满足,这些原因称为内部有效性威胁,它们都会导致 Key Concept 6.4 中某条最小二乘假设失效。例如遗漏变量偏误使回归元与误差项相关,违反第一条最小二乘假设(\(E(u_i|X_i)=0\));若有该遗漏变量或足够的控制变量的数据,可将其纳入回归消除威胁。

外部有效性的威胁来自被研究总体/情境与目标总体/情境之间的差异:

  • 总体差异(differences in populations):如化学品毒性实验以小鼠为被研究总体,却用于制定人类健康法规;“鼠与人”差异是否足以威胁外部有效性存在争议。更一般地,真实因果效应在两个总体可能不同,原因可能是:总体的选取方式使其与目标总体不同、总体特征不同、地域差异、研究过时。
  • 情境差异(differences in settings):即使总体相同,情境不同也可能无法推广。例:某大学反酗酒广告对狂饮(binge drinking)的效果,可能无法推广到法律处罚不同的另一所大学(法律情境不同)。情境差异包括制度环境(公立大学 vs 宗教大学)、法律(处罚轻重)、物理环境(南加州的车尾派对狂饮 vs 阿拉斯加费尔班克斯)。

应用于加州班级规模研究:第 7、8 章发现降低 STR 可在统计上显著但实质上很小地提高成绩。假设这些结果内部有效,能推广到哪里?研究的总体与情境越接近目标,外部有效性论据越强。大学生与大学教学和小学差别很大,推广到大学不可信;而美国各地小学的学生、课程与组织大体相似,推广到美国其他小学学区的标准化考试则较可信。

如何评估外部有效性:必须运用对被研究与目标总体和情境的具体知识判断;重要差异会令人怀疑外部有效性。若存在针对不同但相关总体的两项或多项研究,可通过比较结果相互检验外部有效性(9.4 节即比较马萨诸塞与加州)。结论相似则支持外部有效性;无法解释的差异则令人怀疑。脚注:对同一主题众多研究的比较称为元分析(meta-analysis)(第 6 章“莫扎特效应”专栏即基于元分析),其自身有挑战:如何区分好坏研究、因变量不同时如何比较、是否给大样本研究更大权重;参见 Hedges & Olkin (1985)、Cooper & Hedges (1994),以及解读已发表研究 p 值的 Simonsohn, Nelson & Simmons (2014)(p-curve)。

如何设计外部有效的研究:外部有效性威胁源于总体与情境缺乏可比性,最好在数据收集前的研究设计阶段就加以最小化;研究设计超出本书范围,参见 Shadish, Cook & Campbell (2002)。

9.2 多元回归分析内部有效性的威胁(PDF p.333–344)

基于回归的研究若估计系数对目标因果效应无偏一致、且标准误能给出正确置信水平,即为内部有效。本节列举 OLS 即使在大样本中也可能有偏的五个原因:遗漏变量、回归函数形式误设、自变量测量不准(变量误差)、样本选择、联立因果。五者的共同根源是:回归元在总体回归中与误差项相关,违反第一条最小二乘假设。本节最后讨论导致标准误不一致的情形。

(1)遗漏变量偏误(Omitted Variable Bias)(p.334–336)

回顾:当一个既决定 \(Y\) 又与某个已纳入回归元相关的变量被遗漏时,产生遗漏变量偏误;它在大样本中也不消失,故 OLS 不一致。如何最小化取决于是否有能充分控制遗漏变量的变量。

当遗漏变量可观测或有充分的控制变量时:直接把遗漏变量纳入多元回归;或者若有控制变量,且这些控制变量“充分”——即能实现条件均值独立(conditional mean independence)(式 6.18:\(E(u_i|X_i,W_i)=E(u_i|W_i)\))——则纳入控制变量即可消除目标系数的偏误。

增加变量的成本与收益(偏误–方差权衡):遗漏变量可能导致偏误;但纳入一个不该纳入的变量(总体系数为 0)会降低其他系数估计的精度。因此是否纳入变量是目标系数偏误与方差之间的权衡。实践中有四步:

  1. 明确关键的目标系数(班级规模例中即 STR 的系数)。
  2. 自问:最可能的重要遗漏变量偏误来源是什么?这要运用经济理论和专业知识,在跑回归之前完成,称为先验(a priori)推理。结果是一个**基准设定(base specification)**以及一张额外的“可疑(questionable)”控制变量清单。
  3. 在基准设定上加入可疑控制变量。若其系数统计显著,和/或目标系数估计值明显变化,则应保留并修改基准设定;否则可以剔除。
  4. 以表格形式如实汇总结果,向持怀疑态度的读者“完全披露(full disclosure)”,让其自行判断。表 7.1、8.3 即范例:表 8.3 本可只报告第 (7) 列,但同时列出其他回归让读者自行判断。

Key Concept 9.2(遗漏变量偏误:我应在回归中加入更多变量吗?):加入变量可消除遗漏它造成的偏误,但目标系数估计量的方差可能增大。指南:(1) 明确目标系数;(2) 用先验推理确定最重要的潜在遗漏变量偏误来源,得到基准设定和若干可疑变量;(3) 检验可疑控制变量的系数是否非零,并评估纳入后目标系数是否有实质变化;(4) 提供“完全披露”的代表性结果表,让他人看到纳入可疑变量对目标系数的影响。

当没有充分的控制变量时:仍有三种办法,各依赖不同类型的数据:

  1. 面板数据(panel data):同一观测单位在不同时间被观测(如同一学区 1995 和 2000 年的数据)。第 10 章说明,只要遗漏变量不随时间变化,面板数据可控制不可观测的遗漏变量。
  2. 工具变量回归(instrumental variables regression):依赖一个新变量——工具变量,见第 12 章。
  3. 随机对照实验(randomized controlled experiment):见第 13 章。

(2)回归函数形式误设(Misspecification of the Functional Form)(p.336)

若总体回归函数是非线性的而估计的是线性回归,则这种函数形式误设使 OLS 有偏。它本质上是一种遗漏变量偏误——被遗漏的是反映非线性的项。例如总体回归函数是二次多项式,回归中漏掉自变量平方项就会产生遗漏变量偏误。

Key Concept 9.3(函数形式误设):当估计的回归函数形式与总体回归函数形式不同时发生;此时某变量变化的偏效应估计量一般有偏。常可通过对数据和估计回归函数作图发现,并用不同的函数形式纠正。

解决办法:因变量连续(如成绩)时用第 8 章的非线性方法;若因变量离散或二元(如 \(Y_i=1\) 表示上了大学),情况更复杂,见第 11 章。

(3)测量误差与变量误差偏误(Measurement Error and Errors-in-Variables Bias)(p.336–339)

例子:若不小心把五年级学生的成绩对十年级的 STR 作回归,两者虽相关但不同,会导致估计系数有偏。这就是变量误差偏误(errors-in-variables bias),源于自变量的测量误差;即使样本很大也存在,故 OLS 不一致。测量误差来源很多:调查受访者答错(如 Current Population Survey 中去年收入,受访者可能不知道确切数字或有意误报),或行政记录录入错误。

推导:设单一回归元 \(X_i\)(如真实收入)被不精确地测为 \(\tilde X_i\)(申报收入)。实际估计的是基于 \(\tilde X_i\) 的回归。总体回归 \(Y_i=\beta_0+\beta_1X_i+u_i\) 用 \(\tilde X_i\) 改写:

\[Y_i=\beta_0+\beta_1\tilde X_i+[\beta_1(X_i-\tilde X_i)+u_i]=\beta_0+\beta_1\tilde X_i+v_i,\tag{9.1}\]

其中 \(v_i=\beta_1(X_i-\tilde X_i)+u_i\)。误差项包含测量误差;若 \(\tilde X_i-X_i\) 与 \(\tilde X_i\) 相关,则回归元与误差项相关,\(\hat\beta_1\) 有偏且不一致。偏误的大小和方向取决于 \(\tilde X_i\) 与测量误差的相关性,后者又取决于测量误差的具体性质。

经典测量误差模型(classical measurement error model):\(\tilde X_i=X_i+w_i\),\(w_i\) 均值 0、方差 \(\sigma_w^2\),且 \(\mathrm{corr}(w_i,X_i)=0\)、\(\mathrm{corr}(w_i,u_i)=0\)。则

\[\hat\beta_1\xrightarrow{p}\frac{\sigma_X^2}{\sigma_X^2+\sigma_w^2}\beta_1.\tag{9.2}\]

推导(脚注 2):此时 \(v_i=-\beta_1w_i+u_i\);\(\mathrm{cov}(\tilde X_i,w_i)=\mathrm{cov}(X_i+w_i,w_i)=\sigma_w^2\);故 \(\mathrm{cov}(\tilde X_i,v_i)=-\beta_1\mathrm{cov}(\tilde X_i,w_i)+\mathrm{cov}(\tilde X_i,u_i)=-\beta_1\sigma_w^2\)。由式 (6.1)(遗漏变量偏误公式 \(\hat\beta_1\xrightarrow{p}\beta_1+\mathrm{cov}(\tilde X,v)/\sigma^2_{\tilde X}\)),\(\hat\beta_1\xrightarrow{p}\beta_1-\beta_1\sigma_w^2/\sigma_{\tilde X}^2\);而 \(\sigma_{\tilde X}^2=\sigma_X^2+\sigma_w^2\),所以 \(\hat\beta_1\xrightarrow{p}[\sigma_X^2/(\sigma_X^2+\sigma_w^2)]\beta_1\)。

解读:比值 \(\sigma_X^2/(\sigma_X^2+\sigma_w^2)<1\),所以 \(\hat\beta_1\) 即使在大样本中也偏向 0(称为衰减偏误 attenuation bias,原书在此未用该名)。极端情形:测量误差大到几乎不含 \(X_i\) 的信息,比值趋于 0,\(\hat\beta_1\xrightarrow{p}0\);无测量误差 \(\sigma_w^2=0\) 时 \(\hat\beta_1\xrightarrow{p}\beta_1\)。

“最佳猜测”模型(best guess model):受访者给出对真值的最佳估计,即 \(\tilde X_i\) 是给定其信息下 \(X_i\) 的条件期望。此时测量误差与回答不相关:\(E[(\tilde X_i-X_i)\tilde X_i]=0\)(若相关,这一相关本身就是预测 \(X_i\) 的有用信息,那 \(\tilde X_i\) 就不是最佳猜测)。若受访者的信息与 \(u_i\) 不相关,则 \(\tilde X_i\) 与 \(v_i\) 不相关,\(\hat\beta_1\) 一致;但因 \(\mathrm{var}(v_i)>\mathrm{var}(u_i)\),\(\hat\beta_1\) 方差变大(习题 9.12 进一步考察)。

故意误报:若所有受访者只报告 90% 的收入,\(\tilde X_i=0.90X_i\),则 \(\hat\beta_1\) 向上偏 10%(\(Y\) 对 \(\tilde X\) 的斜率为 \(\beta_1/0.9\))。

式 (9.2) 只适用于经典测量误差,但它说明了一个更一般的命题:自变量测量不准时,OLS 即使在大样本中也可能有偏。

Key Concept 9.4(变量误差偏误):当自变量测量不精确时 OLS 产生变量误差偏误;偏误取决于测量误差的性质,即使样本大也存在。若测量值等于真值加一个均值为 0、独立分布的测量误差,则单回归元回归中 OLS 偏向 0,其概率极限见式 (9.2)。

\(Y\) 的测量误差:效果与 \(X\) 的测量误差不同。若 \(\tilde Y_i=Y_i+w_i\),\(w_i\) 为经典随机误差,估计模型为 \(\tilde Y_i=\beta_0+\beta_1X_i+v_i\),\(v_i=w_i+u_i\)。若 \(w_i\) 与 \(X_i\) 独立,则 \(E(w_i|X_i)=0\),于是 \(E(v_i|X_i)=0\),\(\hat\beta_1\) 无偏;但 \(\mathrm{var}(v_i)>\mathrm{var}(u_i)\),\(\hat\beta_1\) 方差增大。成绩例中,若阅卷存在独立于回归元的纯随机误差,\(\hat\beta_1\) 仍无偏。一般地,给定回归元条件均值为 0 的 \(Y\) 测量误差不会导致 OLS 系数偏误。

解决办法:最好是获得 \(X\) 的准确测量。否则:(a) 工具变量回归——需要一个与真实 \(X_i\) 相关但与测量误差不相关的工具变量(第 12 章);(b) 建立测量误差的数学模型并据此调整估计,例如若经典模型成立且已知或可估计 \(\sigma_w^2/\sigma_X^2\),就可用式 (9.2) 修正向下偏误。后者需要关于测量误差性质的专门知识,细节因数据而异,本书不展开。

(4)缺失数据与样本选择(Missing Data and Sample Selection)(p.339–341)

缺失数据是否威胁内部有效性取决于数据为何缺失,分三种情况:

  1. 完全随机缺失(missing completely at random):缺失与 \(X\)、\(Y\) 的值无关。只减少样本量,不引入偏误。例:对 100 名同学作简单随机抽样后随机丢失一半记录,等同于一个 50 人的简单随机样本。
  2. 基于 \(X\) 的缺失:同样只减少样本量,不引入偏误。例:只用 STR > 20 的学区,虽然无法对 STR ≤ 20 的情况下结论,但不会使 STR > 20 学区的班级规模效应分析有偏。
  3. 与 \(Y\) 相关(在 \(X\) 之外)的选择过程导致缺失:该选择过程可能使误差项与回归元相关,由此产生的 OLS 偏误称为样本选择偏误(sample selection bias)。例:3.1 节“Landon Wins!”——1936 年随机抽取有电话的汽车车主进行民调,而当年有车有电话者更可能支持共和党,抽样方式与因变量(支持谁)相关。样本选择问题既可视为非随机抽样,也可视为缺失数据问题(设想对选民随机抽样,但无车无电话者数据缺失),缺失机制与因变量相关。脚注 3:习题 19.16 对三种缺失情形有数学处理。

Key Concept 9.5(样本选择偏误):当选择过程影响数据的可得性,且该过程与因变量相关(在依赖回归元之外)时产生样本选择偏误;它使一个或多个回归元与误差项相关,导致 OLS 有偏且不一致。

解决办法:最好在研究设计阶段避免。想估计本科生平均身高,应对全体本科生随机抽样,而不是在篮球场入口抽样。一旦数据存在样本选择偏误,用到目前为止的方法无法消除;估计样本选择模型的方法超出本书范围,部分建立在第 11 章技术上(如 Heckman 两步法,原书在第 11 章给出参考)。

专栏:股票共同基金能跑赢市场吗?(Do Stock Mutual Funds Outperform the Market?)(p.341):股票共同基金让小投资者以低成本持有分散组合。有的基金跟踪市场(如持有 S&P 500 成分股),有的由专业人士主动管理,目标是跑赢市场与同行。检验办法之一是比较过去一年高收益基金与其他基金及市场的未来收益。但样本选取必须谨慎:有些数据库只收录当前仍可购买基金的历史数据,表现最差的“dogs”因清盘或被合并而被剔除。这样的研究存在样本选择偏误——样本按因变量(收益)的取值被选择,因为收益最低的基金被剔除了。十年期间所有基金(含已消亡基金)的平均收益会低于期末仍存续基金的平均收益,因此只研究存续基金会高估业绩。金融经济学家称之为幸存者偏差(survivorship bias)。纠正幸存者偏差(纳入已消亡基金数据)后,计量证据显示:主动管理的股票基金平均不能跑赢市场,且过去的好业绩不能预测未来的好业绩。延伸阅读:Malkiel (2016) 第 7 章、Carhart (1997);对冲基金业绩评估中的幸存者偏差见 Aggarwal & Jorion (2010)。

(5)联立因果(Simultaneous Causality)(p.341–343)

此前假设因果从回归元指向因变量(\(X\to Y\))。若同时存在 \(Y\to X\),即联立因果(simultaneous causality),OLS 会同时捕获两个方向的效应,从而有偏且不一致。

例:若政府计划补贴成绩差的学区雇用教师,则因果双向:小班提高成绩(教育效应);而因政府计划,低成绩导致低 STR。机制:某个遗漏因素导致成绩差(负误差),又因政府计划导致 STR 降低,所以 STR 与误差项正相关,产生联立因果偏误。

数学刻画:只考虑 \(X\)、\(Y\) 两个变量:

\[Y_i=\beta_0+\beta_1X_i+u_i,\tag{9.3}\]
\[X_i=\gamma_0+\gamma_1Y_i+v_i.\tag{9.4}\]

式 (9.3) 中 \(\beta_1\) 是 \(X\) 对 \(Y\) 的效应(教育效应),式 (9.4) 表示 \(Y\) 对 \(X\) 的反向效应(政府计划引起)。直观:\(u_i>0\) 提高 \(Y_i\),若 \(\gamma_1>0\),高 \(Y_i\) 又通过 (9.4) 提高 \(X_i\);只要 \(\gamma_1\ne0\),\(X_i\) 与 \(u_i\) 就相关。脚注 4 的推导:\(\mathrm{cov}(X_i,u_i)=\gamma_1\mathrm{cov}(Y_i,u_i)+\mathrm{cov}(v_i,u_i)\);设 \(\mathrm{cov}(v_i,u_i)=0\),代入 (9.3) 得 \(\mathrm{cov}(X_i,u_i)=\gamma_1\beta_1\mathrm{cov}(X_i,u_i)+\gamma_1\sigma_u^2\),解得

\[\mathrm{cov}(X_i,u_i)=\frac{\gamma_1\sigma_u^2}{1-\gamma_1\beta_1}.\]

因能用两个联立方程表示,此偏误也称联立方程偏误(simultaneous equations bias)。

Key Concept 9.6(联立因果偏误):在 \(Y\) 对 \(X\) 的回归中,若除目标因果链 \(X\to Y\) 外还存在 \(Y\to X\) 的因果链,则产生联立因果偏误(又称联立方程偏误),反向因果使 \(X\) 与目标总体回归的误差项相关。

解决办法:工具变量回归(第 12 章);或设计实施能消除反向因果通道的随机对照实验(第 13 章)。

(6)OLS 标准误不一致的来源(Sources of Inconsistency of OLS Standard Errors)(p.343–344)

即使 OLS 估计量一致、样本很大,不一致的标准误也会使检验的实际水平偏离名义显著性水平,“95%”置信区间在重复抽样中覆盖真值的比例不是 95%。两大原因:

  • 处理不当的异方差(heteroskedasticity):如 5.4 节所述,出于历史原因有些软件默认报告仅同方差(homoskedasticity-only)标准误;若误差异方差,这些标准误不可靠。解决:使用异方差稳健标准误,并用异方差稳健方差估计量构造 F 统计量。
  • 观测间误差相关:若数据是从总体随机抽样得到,抽样随机性保证误差在观测间独立。但有时抽样只是部分随机。最常见的是对同一实体的跨时重复观测(如同一学区多年),若构成误差的遗漏变量具有持续性(如学区人口特征),会产生误差的序列相关(serial correlation)——见于面板数据(多学区多年)和时间序列数据(单一学区多年)。另一种情形是按地理单位抽样:反映地理影响的遗漏变量会使相邻观测误差相关。

观测间误差相关不会使 OLS 有偏或不一致,但违反第二条最小二乘假设(i.i.d. 抽样),结果是 OLS 标准误(无论仅同方差还是异方差稳健)都不正确。很多情况下可用替代的标准误公式修正:第 10 章(面板数据,聚类标准误)和第 16 章(时间序列,HAC 标准误)给出对异方差和序列相关都稳健的标准误。

Key Concept 9.7(多元回归研究内部有效性的威胁):五个主要威胁:1. 遗漏变量;2. 函数形式误设;3. 变量误差(回归元的测量误差);4. 样本选择;5. 联立因果。任一存在都会使 Key Concept 6.4(若有控制变量则 6.6)的第一条最小二乘假设失效,从而 OLS 有偏且不一致。标准误计算错误也威胁内部有效性:存在异方差时仅同方差标准误无效;若变量在观测间不独立(面板和时间序列数据中可能出现),需要进一步调整标准误公式。将此清单逐条应用于一项多元回归研究,是评估其内部有效性的系统方法。

9.3 回归用于预测时的内部与外部有效性(PDF p.344–345)

当回归模型用于预测时,外部有效性非常重要,而因果效应的无偏估计则不重要。

回顾第 4 章开头的两个问题:学监想知道缩小班级能提高多少成绩(因果效应);一位父亲打算搬到一个成绩未公开的学区,只想要该学区成绩的可靠预测——他不需要知道任何变量的因果效应,只需要用加州学区数据估计的预测方程能准确可靠地预测目标学区的成绩。

用多元回归做可靠预测的三个要求:

  1. 估计数据与待预测观测来自同一分布。这就是附录 6.4 中多预测变量情形的“预测用第一条最小二乘假设”。若估计和预测观测来自同一总体,则估计出的条件期望 \(E(Y|X)\) 可推广到样本外观测。这是预测语境下外部有效性的数学表述。例:若回归线对加州其他学区有用,对其他州的小学学区也可能有用,但对大学不太可能有用。
  2. 预测变量的选择。估计因果效应时,选控制变量是为了减少遗漏变量偏误;预测时目标是准确的样本外预测,预测变量应能显著解释 \(Y\) 的变动,无论是否有因果解释。时间序列数据中还可利用跨时相关(序列相关)来预测未来值,即预报(forecast),见第 15、17 章。
  3. 估计量本身。若预测变量非常多(甚至超过样本量),有些估计量的样本外预测比 OLS 更准,这些专门估计量见第 14 章(多预测变量的预测,如岭回归、Lasso 等)。

9.4 示例:考试成绩与班级规模(Example: Test Scores and Class Size)(PDF p.345–354)

用内外部有效性框架审视从加州成绩数据中学到了什么、没学到什么。

外部有效性:考虑结论能否推广到美国其他小学公立学区的其他标准化考试。9.1 节指出多项研究可相互检验。这里使用另一数据集:1998 年马萨诸塞州 220 个公立学区四年级学生的标准化考试结果。两州考试都是对学生知识与学术技能的广泛测量(细节不同);小学课堂组织大体相似(美国多数小学学区都如此),但经费和课程有所不同。因此若两州发现 STR 对成绩的相似效应,即为加州结论外部有效的证据;若结果不同,则至少有一项研究的内部或外部有效性存疑。

两州数据都在学区层面,变量定义相同或几乎相同(附录 9.1 详述马萨诸塞数据)。表 9.1 给出摘要统计(见下)。

表 9.1 加州与马萨诸塞州成绩数据摘要统计(p.346)

变量 加州均值 加州标准差 马州均值 马州标准差
考试成绩 654.1 19.1 709.8 15.1
学生–教师比 19.6 1.9 17.3 2.3
英语学习者比例 15.8% 18.3% 1.1% 2.9%
享受补贴午餐比例 44.7% 27.1% 15.3% 15.1%
学区平均收入 $15,317 $7,226 $18,747 $5,808
观测数 420 220
年份 1999 1998

马州平均成绩更高,但考试不同,不能直接比较分数。加州平均 STR 更高(19.6 vs 17.3);马州学区平均收入高 20%,但加州收入标准差更大(学区间收入分化更大);加州英语学习者比例和补贴午餐比例都远高于马州。

成绩与学区收入(图 9.1,p.347):马州散点图形状与加州(图 8.2)相似——收入低时关系陡、收入高时平缓,线性回归漏掉了这一非线性。图中画出线性、线性–对数(linear-log)和三次(cubic)回归:三次回归 \(R^2\) 略高于对数设定(0.486 vs 0.455);在 $13,000–$30,000(大部分观测所在区间)两者相近。非线性的大体模式在两州一致,但最佳函数形式不同:马州三次最好,加州线性–对数最好。

多元回归结果(表 9.2,因变量:四年级英语、数学、科学综合平均成绩,220 个学区,括号内为异方差稳健标准误)

回归元 (1) (2) (3) (4) (5) (6)
STR −1.72 (0.50) [−2.70, −0.73] −0.69 (0.27) [−1.22, −0.16] −0.64 (0.27) [−1.17, −0.11] 12.4 (14.0) −1.02 (0.37) −0.67 (0.27) [−1.21, −0.14]
STR² −0.680 (0.737)
STR³ 0.011 (0.013)
英语学习者% −0.411 (0.306) −0.437 (0.303) −0.434 (0.300)
HiEL(英语学习者%>中位数) −12.6 (9.8)
HiEL×STR 0.80 (0.56)
免费午餐资格% −0.521 (0.077) −0.582 (0.097) −0.587 (0.104) −0.709 (0.091) −0.653 (0.072)
ln(学区收入) 16.53 (3.15)
学区收入 −3.07 (2.35) −3.38 (2.49) −3.87 (2.49) −3.22 (2.31)
收入² 0.164 (0.085) 0.174 (0.089) 0.184 (0.090) 0.165 (0.085)
收入³ −0.0022 (0.0010) −0.0023 (0.0010) −0.0023 (0.0010) −0.0022 (0.0010)
F:所有 STR 项及交互=0 2.86 (0.038) 4.01 (0.020)
F:STR², STR³=0 0.45 (0.641)
F:收入², 收入³=0 7.74 (<0.001) 7.75 (<0.001) 5.85 (0.003) 6.55 (0.002)
F:HiEL, HiEL×STR=0 1.58 (0.208)
SER 14.64 8.69 8.61 8.63 8.62 8.64
\(\bar R^2\) 0.063 0.670 0.676 0.675 0.675 0.674

(第 (6) 列免费午餐系数的标准误原文抽取为 “0.72”,结合上下文应为 0.072。)

解读(p.348):

  • 回归 (1) 只含 STR:斜率 −1.72,\(t=-1.72/0.50=-3.44\),1% 水平拒绝系数为 0。
  • 控制英语学习者比例、补贴午餐比例和学区平均收入后,STR 系数减少约 60%:从 −1.72 降为 (2) 的 −0.69、(3) 的 −0.64。
  • 比较 (2)(3) 的 \(\bar R^2\):即使控制 STR,三次收入设定 (3) 也优于对数设定 (2)。
  • 无显著证据表明成绩与 STR 呈非线性:(4) 中检验 STR²、STR³ 系数为 0 的 F 统计量 p 值为 0.641。
  • (5) 显示英语学习者多时减班效果更小——与加州结论方向相反——但与加州一样,交互项估计不精确,10% 水平不显著(\(t=0.80/0.56=1.43\))。
  • (6) 去掉在 (3) 中不显著的英语学习者比例,STR 系数基本不变。
  • 结论:(3) 对 (4)–(6) 的函数形式和设定变化不敏感,因此采用 (3) 作为马州 STR 效应的基准估计。

马州与加州结果比较(p.348–352)。加州的发现:(1) 加入学生背景控制变量后,STR 系数从 −2.28(表 7.1 回归 1)降至 −0.73(表 8.3 回归 2),降幅 68%;(2) 即使加入控制变量,1% 水平仍拒绝 STR 系数为 0;(3) 减班效应不显著依赖于英语学习者比例;(4) 有证据表明成绩与 STR 关系是非线性的。

马州:(1)(2)(3) 成立——控制变量使系数从 −1.72 降至 −0.69(降 60%),加入控制后仍显著,但只在 5% 水平显著(加州为 1%),这不奇怪,因为加州观测数几乎是马州的两倍、估计更精确;与英语学习者 HiEL 的交互同样不显著。但 (4) 不成立:在 5% 水平上,对三次设定检验时无法拒绝 STR 与成绩为线性关系。

标准化以便跨州比较:两州考试不同,马州 1 分不等于加州 1 分,系数不能直接比。做法是将成绩标准化(减样本均值、除以标准差,使均值 0、方差 1);标准化成绩回归中的斜率等于原斜率除以成绩标准差。因此可比较“STR 系数 / 成绩标准差”。

表 9.3 比较两州的估计(STR 减少 2 的效应;括号为标准误,方括号为 95% 置信区间)

设定 \(\hat\beta_{STR}\) 成绩的跨学区标准差 效应(分) 效应(标准差单位)
加州 线性 表 8.3(2) −0.73 (0.26) 19.1 1.46 (0.52) [0.46, 2.48] 0.076 (0.027) [0.024, 0.130]
加州 三次 表 8.3(7),STR 20→18 – 19.1 2.93 (0.70) [1.56, 4.30] 0.153 (0.037) [0.081, 0.226]
加州 三次 表 8.3(7),STR 22→20 – 19.1 1.90 (0.69) [0.54, 3.26] 0.099 (0.036) [0.028, 0.171]
马州 线性 表 9.2(3) −0.64 (0.27) 15.1 1.28 (0.54) [0.22, 2.34] 0.085 (0.036) [0.015, 0.154]

计算示例:加州线性系数 −0.73,STR 减 2,成绩增加 \(-0.73\times(-2)=1.46\) 分;成绩标准差 19.1,对应 \(1.46/19.1=0.076\) 个标准差;标准误 \(0.26\times2/19.1=0.027\)。非线性模型效应及其标准误按 8.1 节方法计算。加州非线性模型显示效应稍大,且取决于初始 STR。马州估计为 0.085 个标准差(标准误 0.036)。

两者实质相同:马州 95% 置信区间包含加州线性设定的 95% 置信区间。减班预计提高成绩,但幅度小:加州中位数学区与第 75 百分位学区成绩差 12.2 分(表 4.1),即 \(12.2/19.1=0.64\) 个标准差;线性模型估计效应仅为其十分之一多一点——STR 减 2 只能让一个学区从中位数向第 75 百分位移动约十分之一。STR 减 2 对学区是很大的变化,但估计收益虽非零却很小。马州分析表明加州结果是外部有效的(至少推广到美国其他小学学区时)。

内部有效性(p.352–353):两州结果相似并不保证内部有效。逐条检查五大威胁:

  • 遗漏变量:回归控制了学生特征(英语学习者比例)、家庭经济特征(补贴午餐比例)和更广的学区富裕度(平均收入)。若这些控制变量充分,则在控制变量取值相同的学区之间,STR 就“如同随机分配”,条件均值独立成立。但仍可能有这三者不能充分控制的遗漏因素:如即使在移民比例和社会经济特征相同的学区之间,STR 也可能与教师质量相关(好教师被小班学校吸引),而教师质量影响成绩;又如社会经济特征相同时,STR 低的学区家庭可能更重视在家辅导。理论上消除遗漏变量偏误的方法是实验:随机分配学生到不同规模班级并比较成绩——田纳西州确实做过(STAR 项目,第 13 章)。
  • 函数形式:本章和第 8 章探索了多种函数形式,部分非线性不显著,显著的也未实质改变减班效应估计;结论对不同非线性设定不敏感。
  • 变量误差:学区平均 STR 是对班级规模的粗略且可能不准的度量(学生流动使 STR 不能准确反映参加考试学生实际所在班级规模),可能使班级规模效应偏向 0。另一个可能有测量误差的是学区平均收入:取自 1990 年人口普查,而其他数据是 1998(马州)或 1999(加州)年,若 90 年代学区经济构成变化很大,收入度量就不准。
  • 样本选择:两州数据覆盖满足最低规模限制的全部公立小学学区,没有理由认为存在样本选择问题。
  • 联立因果:若存在增加差校经费、进而多雇教师的官僚或政治机制,就会产生联立因果。马州考试期间无此类经费均等化机制;加州一系列诉讼带来了一定经费均等化,但再分配并不基于学生成绩。故两州似乎都不存在联立因果问题。
  • 异方差与观测间误差相关:所有结果都用异方差稳健标准误,异方差不构成威胁。但观测间误差相关可能威胁标准误的一致性,因为并非简单随机抽样(样本是全州所有学区,可能存在地理相关);适用的替代标准误公式复杂且专门,留给高级教材。

讨论与启示(p.353–354):两州结果相似说明研究在“可推广到美国其他小学学区标准化考试”意义上外部有效。控制学生背景、家庭经济背景、学区富裕度并检查非线性,已处理了一些最重要的内部有效性威胁,但仍存在潜在威胁,首要的是遗漏变量偏误(控制变量可能没有捕捉学区其他特征或课外学习机会)。

据此回答第 4.1 节学监的问题:控制家庭经济背景、学生特征、学区富裕度并建模非线性后,STR 每位教师减少 2 名学生,预计成绩提高约 0.08 个跨学区成绩标准差——统计显著但相当小,与许多研究班级规模效应的文献一致(脚注 5:Ehrenberg et al. 2001a, 2001b 综述)。学监需要权衡成本(教师工资、额外教室)与收益(标准化考试表现提升,以及未研究的辍学率降低、未来收入增加等),该估计是成本收益计算的重要输入。

9.5 结论(PDF p.354–355)

内外部有效性为评估因果效应计量研究提供了框架。多元回归研究内部有效的条件是:系数估计无偏一致、标准误一致。威胁包括遗漏变量、函数形式误设(非线性)、自变量测量不准(变量误差)、样本选择、联立因果——每一个都使回归元与误差项相关,从而 OLS 有偏且不一致。若误差在观测间相关(如时间序列),或存在异方差但用仅同方差公式计算标准误,标准误将不一致,也损害内部有效性;后两者可通过正确计算标准误解决。

回归研究和任何统计研究一样,若结论可推广到被研究总体和情境之外即为外部有效;比较同一主题的多项研究有帮助,但无论如何都需对被研究与目标总体/情境的相似性作判断。

后续安排:第 III 部分扩展多元回归模型以缓解全部五种偏误来源,讨论随机对照实验这一获得内部有效性的不同途径,并回到多预测变量的预测问题;第 IV 部分发展时间序列方法,并用时间序列数据估计随时间变化的动态因果效应(dynamic causal effects)。

第 9 章小结(Summary)与关键术语(PDF p.355)

原书小结五条:(1) 统计研究通过内部和外部有效性评估;(2) 用回归估计因果效应时,内部有效性威胁有两类:回归元与误差相关导致 OLS 有偏不一致;标准误错误导致置信区间与检验无效;(3) 回归元与误差相关的原因:遗漏变量、函数形式错误、回归元测量误差、样本非随机选取、回归元与因变量联立因果;(4) 误差异方差而软件用仅同方差标准误,或误差在观测间相关时,标准误不正确;(5) 回归仅用于预测时,系数无需是因果效应的无偏估计,但模型必须对当前预测应用外部有效。

关键术语:population studied、population of interest、internal validity、external validity、functional form misspecification、errors-in-variables bias、classical measurement error model、sample selection bias、simultaneous causality、simultaneous equations bias。

习题概览(PDF p.356–360)

复习概念(Review the Concepts):9.1 内外部有效性区别,能否内部有效但外部无效;9.2 Key Concept 9.2 中的偏误–方差权衡,加入控制变量为何降低偏误、为何增大方差;9.3 \(Y\) 的测量误差与 \(X\) 的测量误差的效果差异;9.4 样本选择偏误——只用大学毕业生数据研究多读一年书对收入的影响有何选择偏误;9.5 联立因果——腐败程度对国民收入影响研究中的联立因果;9.6 两个软件分别给出仅同方差与异方差稳健标准误且差异很大,该用哪个。

练习(Exercises):

  • 9.1 西非某地区 2000 年多种维生素补充改善儿童成绩的研究,能否推广到 2000 年的印度、英国,以及 2015 年的西非(外部有效性的总体/情境/时间维度)。
  • 9.2 \(Y\) 有经典测量误差 \(\tilde Y_i=Y_i+w_i\):证明 \(v_i=u_i+w_i\),新回归满足最小二乘假设、OLS 一致、置信区间可照常构造,评价“X 的测量误差严重而 Y 的不严重”。
  • 9.3 女性收入研究中“孩子越多工资越高”的谜题:用样本选择解释(不外出工作的女性缺失)——这一谜题推动了 Heckman 关于样本选择的研究并获 2000 年诺奖(Heckman 1974)。
  • 9.4 仿表 9.3 比较两州“免费午餐比例上升 10 个百分点”对成绩的效应。
  • 9.5 供需联立:需求 \(Q=\beta_0+\beta_1P+u\),供给 \(Q=\gamma_0+\gamma_1P+v\),\(u,v\) 不相关;求 \(Q,P\) 的约简式、均值、方差、协方差;大样本下 \(Q\) 对 \(P\) 回归的斜率,并判断用它估计需求斜率是偏大还是偏小(联立方程偏误的经典推导)。
  • 9.6 每个观测被重复录入两次(\(n\) 从 50 变 100)时回归系数、标准误、SER、\(R^2\) 如何变化,违反了哪些内部有效性条件(系数不变,标准误约缩小 \(\sqrt2\) 倍,违反独立抽样)。
  • 9.7 判断正误:“若 Y 与误差项相关,OLS 不内部有效”;“误差异方差时估计总是有偏”。
  • 9.8 式 (4.9) 能否预测马州学区成绩;9.9 图 8.2 线性回归与式 (8.18) 非线性回归能否可靠估计收入对成绩的因果效应、能否可靠预测;9.10、9.11 评价第 8.3 节“老龄化对医疗支出”和“经济学期刊需求”两个专栏的内外部有效性。
  • 9.12 “最佳猜测”测量误差:\(\tilde X_i=E(X_i|Z_i)\),证明其为最小均方误差估计、\(E(w_i|\tilde X_i)=0\),在 \(E(u_i|Z_i)=0\) 下 \(\hat\beta_1\) 一致,\(\hat\beta_0\) 是否一致。
  • 9.13 20% 观测的 \(X\) 被打乱:证明 \(E(\hat\beta_1)=0.8\beta_1\),构造无偏估计(除以 0.8),并与只用 240 个正确观测的估计比较。

实证练习:E9.1 用 CPS2015 讨论第 8 章收入回归的内部有效性(六类威胁),并用 CPS96_15 检验时间上的外部有效性(需通胀调整);E9.2 用 Birthweight_Smoking 构造吸烟对出生体重效应的合理 95% 置信区间(考虑非线性回归),讨论内部有效性,以及对 1989 年加州、2019 年伊利诺伊、2019 年韩国的外部有效性。

附录 9.1 马萨诸塞州小学测试数据(p.360):1998 年公立小学学区层面平均值;成绩取自 Massachusetts Comprehensive Assessment System(MCAS),州教育厅主办、所有公立学校四年级春季强制参加,使用英语、数学、科学三部分总分。STR、补贴午餐比例、英语学习者比例为 1997–1998 学年各学区平均值,来自州教育厅;学区平均收入来自 1990 年美国人口普查。

第 9 章 本章要点

  1. 评估研究的两把尺子:内部有效性(对被研究总体的因果推断是否正确:估计无偏一致 + 标准误正确)与外部有效性(能否推广到目标总体和情境)。
  2. OLS 因果估计的五大偏误来源——遗漏变量、函数形式误设、变量误差、样本选择、联立因果——本质都是回归元与误差项相关;它们在大样本中不消失。
  3. 经典测量误差下 \(\hat\beta_1\to\frac{\sigma_X^2}{\sigma_X^2+\sigma_w^2}\beta_1\),向 0 衰减;\(Y\) 的随机测量误差只增大方差不致偏;“最佳猜测”误差不致偏。
  4. 缺失数据:完全随机缺失或基于 \(X\) 的缺失不致偏;与 \(Y\) 相关的选择过程导致样本选择偏误,幸存者偏差是金融中的典型。
  5. 联立因果下 \(\mathrm{cov}(X,u)=\gamma_1\sigma_u^2/(1-\gamma_1\beta_1)\ne0\);补救为工具变量或随机实验。
  6. 标准误问题:异方差用稳健标准误;观测间相关(面板、时间序列、地理)需聚类或 HAC 标准误。
  7. 预测与因果目标不同:预测看重外部有效性(估计与预测样本同分布)、预测变量的解释力和估计方法(多变量时可优于 OLS),不要求系数有因果解释。
  8. 案例结论:两州 STR 减 2 均提高成绩约 0.08 个标准差,统计显著但很小,加州结论外部有效;内部有效性的主要剩余威胁是遗漏变量(如教师质量)。

第 9 章 与量化交易的关联

  • 回测与数据偏差:幸存者偏差专栏是量化回测的核心警示——只用当前存续的股票/基金构建历史样本会高估策略收益和基金经理能力。股票池必须是逐日“时点(point-in-time)”成分,包括已退市、被并购、ST 的股票;基金研究需纳入清盘基金。同理,财务数据的回填(restatement)和前视偏差都属于“样本/数据生成过程与因变量相关”的问题。
  • 因子研究中的变量误差:因子回归(如 Fama–MacBeth 第二步把收益对估计出的 beta 回归)中,beta 是带估计误差的回归元,正是经典测量误差模型,会使风险溢价估计向 0 衰减;这也是业界用组合(portfolio)而非个股 beta 做第二步回归、或做误差修正(Shanken 修正)的原因。因子暴露的噪声越大,因子收益估计越被低估。
  • 联立因果:成交量与波动率、订单流与价格、资金流入与基金业绩之间存在双向因果;直接 OLS 估计价格冲击(如 \(\Delta P\) 对订单流回归)会受联立偏误影响,市场微观结构研究常用工具变量或高频时序识别。
  • 预测 vs 因果:多数 alpha 研究是预测问题,9.3 节的三条要求直接对应量化实践:样本内外同分布(体制切换/结构突变会破坏外部有效性,需样本外与滚动验证)、预测变量看解释力而非因果、变量多时用正则化方法(第 14 章)。但若要解释“为何有效”或做组合/风控情景分析(例如某宏观变量变化对组合的影响),就需要因果思维。
  • 标准误:收益面板存在截面相关(同日冲击)和时间相关(重叠收益),用仅同方差或普通稳健标准误会严重高估 t 值,导致伪发现;应使用聚类或 Newey–West 标准误。
  • 外部有效性:在一个市场(如美股)或一个时期发现的因子,迁移到 A 股或未来时期时,需判断“总体与情境”差异(交易制度、投资者结构、涨跌停、T+1 等),多市场/多时期一致的结果才更可信——类似本章两州比较。

第 9 章 推荐习题

  • 9.5(必做):供需联立方程推导 OLS 斜率的概率极限,深刻理解联立方程偏误,也是第 12 章工具变量的动机。
  • 9.2、9.12、9.13:分别考查 \(Y\) 测量误差不致偏、“最佳猜测”误差的一致性、混入错配数据造成的衰减(\(0.8\beta_1\))及修正——直接对应量化中数据质量问题。
  • 9.3:Heckman 样本选择谜题,理解选择偏误的方向。
  • 9.6:重复数据对标准误的影响,体会“独立抽样”假设对推断的作用(与重叠收益、重复样本问题相通)。
  • 复习 9.4、9.6 及 E9.1:系统套用内部有效性清单。

第 10 章 面板数据回归(Regression with Panel Data)

章首导言(PDF p.362)

多元回归能控制有数据的变量;若某些变量没有数据,就无法纳入,OLS 可能有遗漏变量偏误。本章介绍一种无需观测即可控制某些类型遗漏变量的方法,它需要面板数据(panel data):每个观测单位(实体,entity)在两个或更多时期被观测。通过研究因变量随时间的变化,可以消除那些在实体间不同但不随时间变化的遗漏变量的影响。

实证应用:酒驾——酒税和酒驾法律对交通死亡的影响?数据为美国本土 48 州 1982–1988 年共 7 年的交通死亡、酒税、酒驾法律及相关变量。面板数据可以控制州间不同但不随时间变化的不可观测变量(如对酒后驾车的文化态度),也能控制随时间变化但各州相同的变量(如新车安全性的改进)。

章节安排:10.1 面板数据结构与酒驾数据集;10.2–10.3 固定效应回归(fixed effects regression)(先两期,后多期);10.4 时间固定效应(time fixed effects);10.5 面板回归假设与标准误;10.6 用这些方法研究酒税与酒驾法律对交通死亡的影响。

10.1 面板数据(PDF p.362–365)

回顾 1.3 节:面板数据(又称纵向数据,longitudinal data)指 \(n\) 个不同实体在 \(T\) 个不同时期的观测。本章交通死亡数据 \(n=48\)(州),\(T=7\)(1982,…,1988),共 \(7\times48=336\) 个观测。

记号:用双下标,\(i\) 表示实体,\(t\) 表示时期,\(Y_{it}\) 为第 \(i\) 个实体在第 \(t\) 期的 \(Y\)。

Key Concept 10.1(面板数据记号):面板数据由同样 \(n\) 个实体在两个或更多时期 \(T\) 的观测组成(如表 1.3),记为

\[(X_{it},Y_{it}),\quad i=1,\dots,n,\ t=1,\dots,T.\tag{10.1}\]

平衡面板(balanced panel):每个实体每个时期的所有变量都有观测;至少一个实体至少一期有缺失则为非平衡面板(unbalanced panel)。交通死亡数据 48 州 7 年齐全,是平衡面板。本章方法按平衡面板讲述,但都可用于非平衡面板(实操取决于软件)。

例:交通死亡与酒税。美国每年约 40,000 人死于公路交通事故,约四分之一的致死事故涉及饮酒司机,饮酒高峰期比例更高。Levitt & Porter (2001) 估计凌晨 1–3 点路上多达 25% 的司机饮过酒,法定醉酒司机造成致死事故的概率至少是未饮酒司机的 13 倍。

变量:死亡率(fatality rate)= 每 10,000 人口的年交通死亡人数;酒税度量为一箱啤酒的“实际”税(按 CPI 调整为 1988 年美元;脚注:1982 年的 1 美元税相当于 1988 年的 1.23 美元)。数据详见附录 10.1。

截面回归的困惑:用 1982 年数据(图 10.1a):

\[\widehat{FatalityRate}=\underset{(0.15)}{2.01}+\underset{(0.13)}{0.15}\,BeerTax\quad(1982\text{ 数据}),\tag{10.2}\]

啤酒税系数为正,但 10% 水平不显著。用 1988 年数据(图 10.1b):

\[\widehat{FatalityRate}=\underset{(0.11)}{1.86}+\underset{(0.13)}{0.44}\,BeerTax\quad(1988\text{ 数据}),\tag{10.3}\]

系数 1% 水平显著(\(t=3.43\))。按字面理解,啤酒税越高交通死亡越多!应否据此得出加税导致更多死亡的结论?不一定——这些回归可能有严重的遗漏变量偏误:许多因素影响死亡率,如本州汽车质量、公路维护状况、农村还是城市驾驶为主、车流密度、酒后驾车的社会接受度等,其中任何一个都可能与酒税相关。把它们全部收集并加入年度截面回归是一种思路,但有些变量(如对酒驾的文化接受度)很难甚至无法度量。如果这些因素在一州内不随时间变化,借助面板数据就能在无法度量的情况下控制它们——这就是带固定效应的 OLS 回归。

10.2 两期面板数据:“前后”比较(Panel Data with Two Time Periods: "Before and After" Comparisons)(PDF p.365–367)

当每州有 \(T=2\) 期数据时,可比较第二期与第一期因变量的值。通过关注因变量的变化,这种“前后”或“差分(differences)”比较实际上控制了在州间不同、但州内不随时间变化的不可观测因素。

设 \(Z_i\) 决定第 \(i\) 州死亡率但不随时间变化(如当地对酒驾的文化态度,变化缓慢,可视为 1982–1988 不变)。总体线性回归为

\[FatalityRate_{it}=\beta_0+\beta_1BeerTax_{it}+\beta_2Z_i+u_{it}.\tag{10.4}\]

\(Z_i\) 不随时间变化,故不会导致死亡率在两年间变化。分别写出两年:

\[FatalityRate_{i1982}=\beta_0+\beta_1BeerTax_{i1982}+\beta_2Z_i+u_{i1982},\tag{10.5}\]
\[FatalityRate_{i1988}=\beta_0+\beta_1BeerTax_{i1988}+\beta_2Z_i+u_{i1988}.\tag{10.6}\]

相减消去 \(Z_i\):

\[FatalityRate_{i1988}-FatalityRate_{i1982}=\beta_1(BeerTax_{i1988}-BeerTax_{i1982})+u_{i1988}-u_{i1982}.\tag{10.7}\]

直观解释:文化态度影响酒驾水平从而影响死亡率水平,但若它在两年间不变,就不会造成死亡率的变化;死亡率的变化只能来自啤酒税变化和误差项变化(其他决定因素的变化)。对 \(Y\)、\(X\) 的变化作分析,相当于控制了不随时间变化的变量,从而消除这一来源的遗漏变量偏误。

估计结果(图 10.2,48 州的变化量散点):

\[\widehat{\Delta FatalityRate}=\underset{(0.065)}{-0.072}-\underset{(0.36)}{1.04}\,\Delta BeerTax.\tag{10.8}\]

包含截距允许在啤酒税不变时死亡率的平均变化不为 0;负截距 −0.072 可能反映 1982–1988 年汽车安全改进降低了平均死亡率。

与截面回归相反,啤酒税效应为负,符合经济理论;5% 水平拒绝斜率为 0。按此估计,实际啤酒税每箱提高 $1,每万人死亡减少 1.04 人。这个效应非常大:样本平均死亡率约为 2,意味着仅把啤酒税提高 $1 就能使交通死亡减半。

局限:差分回归控制了文化态度等固定因素,但若有随时间变化且与啤酒税相关的因素,遗漏它们仍会造成偏误;10.6 节会控制更多因素,目前不宜下实质结论。另外,“前后”分析只适用两期;数据有 7 年,丢弃其余年份很可惜,而“前后”法不能直接用于 \(T>2\),因此需要固定效应回归。

10.3 固定效应回归(Fixed Effects Regression)(PDF p.367–371)

固定效应回归是在面板数据中控制“随实体变化但不随时间变化”的遗漏变量的方法;与“前后”比较不同,它可用于每个实体有两个或更多时期的情形。模型有 \(n\) 个不同截距,每个实体一个,可用一组二元(指示)变量表示;这些二元变量吸收了所有在实体间不同但不随时间变化的遗漏变量的影响。

模型:记 \(Y_{it}\) 为死亡率、\(X_{it}\) 为啤酒税:

\[Y_{it}=\beta_0+\beta_1X_{it}+\beta_2Z_i+u_{it},\tag{10.9}\]

\(Z_i\) 不可观测、随州变化但不随时间变化。令 \(\alpha_i=\beta_0+\beta_2Z_i\),得

\[Y_{it}=\beta_1X_{it}+\alpha_i+u_{it}.\tag{10.10}\]

这就是固定效应回归模型,\(\alpha_1,\dots,\alpha_n\) 是待估的未知截距,每州一个。第 \(i\) 州的总体回归线为 \(\alpha_i+\beta_1X_{it}\):斜率 \(\beta_1\) 对所有州相同,截距因州而异。\(\alpha_i\) 可视为“身处实体 \(i\)”的效应,称为实体固定效应(entity fixed effects),其变异来自类似 \(Z_i\) 的、随实体变化但不随时间变化的遗漏变量。

二元变量表示:8.3 节讨论过两组同斜率不同截距的情形(图 8.8a,Key Concept 8.4 情形 1)用一个二元变量表示;州多于两个时需要更多二元变量。令 \(D1_i=1\) 若 \(i=1\),否则为 0;\(D2_i\) 类推。不能同时纳入全部 \(n\) 个二元变量和公共截距,否则完全多重共线性(6.7 节虚拟变量陷阱,dummy variable trap),故任意省去第一个实体的 \(D1_i\):

\[Y_{it}=\beta_0+\beta_1X_{it}+\gamma_2D2_i+\gamma_3D3_i+\cdots+\gamma_nDn_i+u_{it}.\tag{10.11}\]

比较两式各州的总体回归线:(10.11) 中第一州为 \(\beta_0+\beta_1X_{it}\),故 \(\alpha_1=\beta_0\);第 \(i\ge2\) 州为 \(\beta_0+\beta_1X_{it}+\gamma_i\),故 \(\alpha_i=\beta_0+\gamma_i\)。两种写法等价:(10.10) 用 \(n\) 个州特定截距;(10.11) 用公共截距加 \(n-1\) 个二元回归元;两者斜率相同,州特定截距与二元回归元的来源都是不可观测的 \(Z_i\)。

推广到多个 \(X\):若还有其他可观测、与 \(X\) 相关且随时间变化的 \(Y\) 的决定因素,也应纳入以避免遗漏变量偏误。

Key Concept 10.2(固定效应回归模型):

\[Y_{it}=\beta_1X_{1,it}+\cdots+\beta_kX_{k,it}+\alpha_i+u_{it},\tag{10.12}\]

\(i=1,\dots,n\);\(t=1,\dots,T\);\(X_{1,it}\) 是实体 \(i\) 在 \(t\) 期第一个回归元的值,依此类推;\(\alpha_1,\dots,\alpha_n\) 为实体特定截距。等价地,用公共截距、各 \(X\) 以及代表除一个实体外所有实体的 \(n-1\) 个二元变量:

\[Y_{it}=\beta_0+\beta_1X_{1,it}+\cdots+\beta_kX_{k,it}+\gamma_2D2_i+\gamma_3D3_i+\cdots+\gamma_nDn_i+u_{it}.\tag{10.13}\]

估计与推断

原则上 (10.13) 可直接用 OLS 估计,但它有 \(k+n\) 个回归元(\(k\) 个 \(X\)、\(n-1\) 个二元变量、截距),实体多时繁琐,有些软件甚至无法实现。计量软件有专门的固定效应 OLS 例程:与全二元变量回归的 OLS 等价,但利用代数简化而更快。

“实体去均值”OLS 算法(entity-demeaned OLS algorithm):两步——先从每个变量中减去实体特定均值,再用去均值后的变量回归。以单回归元为例,对 (10.10) 两边按时间取平均:\(\bar Y_i=\beta_1\bar X_i+\alpha_i+\bar u_i\),其中 \(\bar Y_i=\frac1T\sum_{t=1}^TY_{it}\),\(\bar X_i\)、\(\bar u_i\) 类似。相减得 \(Y_{it}-\bar Y_i=\beta_1(X_{it}-\bar X_i)+(u_{it}-\bar u_i)\)。令 \(\tilde Y_{it}=Y_{it}-\bar Y_i\),\(\tilde X_{it}=X_{it}-\bar X_i\),\(\tilde u_{it}=u_{it}-\bar u_i\):

\[\tilde Y_{it}=\beta_1\tilde X_{it}+\tilde u_{it}.\tag{10.14}\]

于是 \(\beta_1\) 可用 \(\tilde Y_{it}\) 对 \(\tilde X_{it}\) 的 OLS 估计,这一估计量与用 \(n-1\) 个二元变量估计 (10.11) 得到的 \(\hat\beta_1\) 完全相同(习题 19.6;本质是 Frisch–Waugh 定理)。实体去均值消去了 \(\alpha_i\)——这也称为组内变换(within transformation)。

“前后”差分回归 vs 二元变量设定:当 \(T=2\) 时,若“前后”设定不含截距,则二元变量设定和“前后”设定的 \(\hat\beta_1\) 相同。因此 \(T=2\) 时有三种等价的 OLS 估计 \(\beta_1\) 的方法:不含截距的“前后”设定 (10.7)、二元变量设定 (10.11)、实体去均值设定 (10.14),三者给出完全相同的估计(习题 10.11)。

抽样分布、标准误与统计推断:截面数据中,若 Key Concept 6.4 的四条最小二乘假设成立,OLS 估计量大样本下正态,方差可由数据估计,其平方根即标准误,用于 t 检验和置信区间。类似地,面板数据中若一组称为固定效应回归假设的条件成立,固定效应 OLS 估计量在大样本下正态,可得标准误、t 统计量和置信区间;之后的推断(包括用 F 统计量检验联合假设)与截面多元回归完全相同。假设与标准误详见 10.5 节。

应用于交通死亡:用全部 7 年(336 个观测):

\[\widehat{FatalityRate}=-\underset{(0.29)}{0.66}\,BeerTax+\text{州固定效应},\tag{10.15}\]

按惯例不列出估计的州固定截距(篇幅且非关注重点)。与“前后”设定 (10.8) 一样,系数为负,符合理论,与最初截面回归 (10.2)(10.3) 相反。两者不完全相同:(10.8) 只用 1982 和 1988 两年(之差),(10.15) 用全部 7 年;由于观测更多,(10.15) 标准误更小。

州固定效应避免了对酒驾文化态度这类在州间不同、州内不随时间变化因素造成的遗漏变量偏误。但怀疑者可能认为还有其他因素:如这一时期汽车更安全、乘员越来越多系安全带;若 80 年代中期实际啤酒税平均上升,\(BeerTax\) 可能捕捉了整体汽车安全改进的效应。若安全改进随时间演变但各州相同,就能用时间固定效应消除其影响。

10.4 时间固定效应回归(Regression with Time Fixed Effects)(PDF p.371–374)

正如实体固定效应能控制不随时间变化但随实体变化的变量,时间固定效应能控制在实体间相同但随时间演变的变量。

新车安全改进在全国推行,降低所有州的死亡率;可将汽车安全视为随时间变化但各州取值相同的遗漏变量 \(S_t\):

\[Y_{it}=\beta_0+\beta_1X_{it}+\beta_2Z_i+\beta_3S_t+u_{it},\tag{10.16}\]

\(S_t\) 不可观测,单下标 \(t\) 强调它随时间变化而在各州相同。若 \(S_t\) 与 \(X_{it}\) 相关,遗漏它会导致遗漏变量偏误。

仅时间效应:暂设 \(Z_i\) 不存在。虽然 \(S_t\) 不可观测,但它随时间而不随州变化,其影响可被消除——就像 \(Z_i\) 导致每个州有自己的截距一样,\(S_t\) 导致每个时期有自己的截距。单回归元的时间固定效应模型:

\[Y_{it}=\beta_1X_{it}+\lambda_t+u_{it}.\tag{10.17}\]

\(\lambda_t\) 可视为第 \(t\) 年对 \(Y\) 的“效应”,\(\lambda_1,\dots,\lambda_T\) 称为时间固定效应,其变异来自随时间变化但不随实体变化的遗漏变量。用 \(T-1\) 个二元指示变量表示:

\[Y_{it}=\beta_0+\beta_1X_{it}+\delta_2B2_t+\cdots+\delta_TBT_t+u_{it},\tag{10.18}\]

其中 \(B2_t=1\) 若 \(t=2\),否则为 0,依此类推;含截距并省去 \(B1_t\) 以避免完全多重共线性。若有其他可观测 \(X\),也一并出现在 (10.17)(10.18) 中。在交通死亡回归中,时间固定效应能消除全国统一推行、随时间变化但同一年各州相同的安全标准等遗漏变量造成的偏误。

实体与时间双固定效应:若一些遗漏变量不随时间变化但随州变化(文化规范),另一些在各州相同但随时间变化(全国安全标准),则应同时纳入实体(州)效应和时间效应:

\[Y_{it}=\beta_1X_{it}+\alpha_i+\lambda_t+u_{it},\tag{10.19}\]

等价地,用 \(n-1\) 个实体指示变量、\(T-1\) 个时间指示变量和截距:

\[Y_{it}=\beta_0+\beta_1X_{it}+\gamma_2D2_i+\cdots+\gamma_nDn_i+\delta_2B2_t+\cdots+\delta_TBT_t+u_{it}.\tag{10.20}\]

该模型同时消除了“不随时间变化的不可观测变量”和“在各州间不变的不可观测变量”造成的遗漏变量偏误。

估计:时间固定效应模型及双固定效应模型都是多元回归的变体,可加入时间和实体二元变量用 OLS 估计。另一种方法(平衡面板中):先将 \(Y\) 和各 \(X\) 同时减去其实体均值和时期均值(即双向去均值:\(\ddot Y_{it}=Y_{it}-\bar Y_i-\bar Y_t+\bar Y\)),再作去均值 \(Y\) 对去均值 \(X\) 的多元回归;这一算法在软件中常用,避免了构造 (10.20) 全部指示变量。等价方法:将 \(Y\)、各 \(X\) 以及时间指示变量减去其实体(不是时期)均值,然后用去均值的 \(Y\) 对去均值的 \(X\) 和时间指示变量回归,估计 \(k+T\) 个系数。最后,若 \(T=2\),双固定效应回归可用 10.2 节“前后”方法包含截距来估计:所以 (10.8) 中含截距的 1982→1988 变化回归,与只用 1982、1988 两年数据、含实体和时间固定效应的 OLS 给出相同的斜率估计(截距就对应时间效应的差)。

应用于交通死亡:

\[\widehat{FatalityRate}=-\underset{(0.36)}{0.64}\,BeerTax+\text{州固定效应}+\text{时间固定效应}.\tag{10.21}\]

该设定包含啤酒税、47 个州二元变量、6 个年份二元变量和截距,右侧共 \(1+47+6+1=55\) 个变量!加入时间效应对啤酒税系数影响很小(对比 10.15 与 10.21);系数估计变得不那么精确,但仍在 10%(而非 5%)水平显著(\(t=-0.64/0.36=-1.78\))。

该关系不受“随时间不变”或“随州不变”变量造成的遗漏变量偏误影响;但很多重要的交通死亡决定因素不属于这两类,所以仍可能有遗漏变量偏误。10.6 节做更完整的分析。

10.5 固定效应回归的假设与标准误(The Fixed Effects Regression Assumptions and Standard Errors for Fixed Effects Regression)(PDF p.374–376)

面板数据中,回归误差可能在实体内部跨时相关。与异方差一样,这种相关不会使固定效应估计量有偏,但影响其方差,从而影响标准误的计算。本章报告的固定效应回归标准误是聚类标准误(clustered standard errors),对异方差和实体内跨时相关都稳健;实体数 \(n\) 很大时,可用通常的大样本正态和 F 临界值。本节为简化记号,聚焦无时间效应的实体固定效应模型。

Key Concept 10.3(固定效应回归假设):\(Y_{it}=\beta_1X_{it}+\alpha_i+u_{it}\),\(i=1,\dots,n\),\(t=1,\dots,T\),\(\beta_1\) 为 \(X\) 对 \(Y\) 的因果效应,且

  1. \(u_{it}\) 条件均值为 0:\(E(u_{it}\mid X_{i1},X_{i2},\dots,X_{iT},\alpha_i)=0\);
  2. \((X_{i1},\dots,X_{iT},u_{i1},\dots,u_{iT})\),\(i=1,\dots,n\),是来自其联合分布的 i.i.d. 抽取;
  3. 不太可能出现大的离群值:\((X_{it},u_{it})\) 有非零有限四阶矩;
  4. 无完全多重共线性。

多回归元时 \(X_{it}\) 换为全部 \(X_{1,it},\dots,X_{k,it}\)。

假设 1 的微妙之处:它与截面第一条最小二乘假设作用相同,意味着没有遗漏变量偏误;但它要求 \(u_{it}\) 的条件均值不依赖于该实体过去、现在和未来任何一期的 \(X\)——这比截面假设更强(称为严格外生性,strict exogeneity)。若当前 \(u_{it}\) 与 \(X\) 的过去、现在或未来值相关,该假设即被违反(例如存在反馈:今天的冲击影响未来的 \(X\))。

假设 2:一个实体的变量与另一实体的变量同分布且独立,即变量在实体间 i.i.d.;若实体由简单随机抽样从总体选出则成立。与截面假设 2(每个观测独立)的重要区别是:面板假设 2 只要求实体间独立,不限制实体内的关系——允许 \(X_{it}\) 在实体内跨时相关。

假设 3、4 与截面的第三、四条最小二乘假设类似。在 Key Concept 10.3 的假设下,\(n\) 大时固定效应估计量一致且服从正态分布(附录 10.2)。

自相关(autocorrelation)/ 序列相关(serial correlation):若对某实体 \(X_{it}\) 与 \(X_{is}\)(\(s\ne t\))相关,称 \(X_{it}\) 自相关(与不同日期的自身相关)或序列相关。这是时间序列数据的普遍特征:一年发生的事往往与下一年相关。交通例中啤酒税 \(X_{it}\) 自相关:立法机构多数年份不改税,若某年高于该州均值,次年也往往偏高。\(u_{it}\) 也可能自相关:\(u_{it}\) 由未纳入回归的随时间变化的 \(Y\) 决定因素组成,其中某些可能自相关。如地方经济衰退导致裁员、减少通勤交通,可能连续两年以上降低死亡率;大型道路改善工程不仅在完工当年、也在随后年份减少事故。这类持续多年的遗漏因素产生自相关的回归误差。并非所有遗漏因素都产生自相关:如冬季恶劣驾驶条件影响死亡率,但若某州冬季天气逐年独立分布,误差的这部分就序列不相关。一般而言,只要部分遗漏因素自相关,\(u_{it}\) 就自相关。

固定效应回归的标准误(p.376)

若回归误差自相关,通常截面回归的异方差稳健标准误公式(式 5.3、5.4)无效。类比异方差:截面中误差异方差时,仅同方差标准误因基于错误的同方差假设而无效;同理,误差自相关时,通常标准误因基于“无序列相关”的错误假设而无效。

在 \(u_{it}\) 可能异方差且可能在实体内跨时相关时仍有效的标准误称为异方差与自相关稳健(heteroskedasticity- and autocorrelation-robust, HAR)标准误。本章所用的聚类标准误是 HAR 标准误的一种。“聚类”指允许回归误差在一个聚类(分组)内部任意相关,但假设聚类之间不相关。在面板数据中,每个聚类就是一个实体。因此聚类标准误允许异方差和实体内任意自相关,但视实体间误差不相关——与 Key Concept 10.3 的假设 2 一致。

与截面异方差稳健标准误一样,聚类标准误无论是否存在异方差、自相关或两者都有效。若实体数 \(n\) 大,用聚类标准误推断可使用通常的大样本正态临界值(t 统计量)和 \(F_{q,\infty}\) 临界值(检验 \(q\) 个约束的 F 统计量)。

实践中差别可能很大:式 (10.21) 中 BeerTax 系数的通常(截面)异方差稳健标准误为 0.25,明显小于聚类标准误 0.36;对应检验 \(\beta_1=0\) 的 t 统计量分别为 −2.51 和 −1.78。报告聚类标准误是因为它允许实体内 \(u_{it}\) 序列相关。聚类标准误公式见附录 10.2。

10.6 酒驾法律与交通死亡(Drunk Driving Laws and Traffic Deaths)(PDF p.377–380)

酒税只是抑制酒驾的手段之一。各州对酒驾的处罚不同,严打酒驾的州可能既加税又收紧法律;若遗漏这些法律,即使在含州和时间固定效应的回归中,啤酒税效应的 OLS 估计也可能有遗漏变量偏误。此外,车辆使用量部分取决于司机是否有工作,税收变化也可能反映经济状况(州预算赤字可能导致加税),遗漏州经济状况同样可能导致偏误。因此本节加入其他驾驶法律和经济条件变量。

表 10.1 酒驾法律对交通死亡影响的回归分析(因变量:每万人交通死亡率;48 州面板;(1)–(6) 用 1982–1988 全部年份,(7) 只用 1982 和 1988 两年;括号为标准误,方括号为 95% 置信区间,F 统计量下括号为 p 值)

回归元 (1) (2) (3) (4) (5) (6) (7)
啤酒税 0.36 (0.05) [0.26, 0.46] −0.66 (0.29) [−1.23, −0.09] −0.64 (0.36) [−1.35, 0.07] −0.45 (0.30) [−1.04, 0.14] −0.69 (0.35) [−1.38, 0.00] −0.46 (0.31) [−1.07, 0.15] −0.93 (0.34) [−1.60, −0.26]
饮酒年龄 18 0.03 (0.07) [−0.11, 0.17] −0.01 (0.08) 0.04 (0.10)
饮酒年龄 19 −0.02 (0.05) −0.08 (0.07) −0.07 (0.10)
饮酒年龄 20 0.03 (0.05) −0.10 (0.06) −0.11 (0.13)
饮酒年龄(连续) 0.00 (0.02)
强制监禁或社区服务? 0.04 (0.10) 0.09 (0.11) 0.04 (0.10) 0.09 (0.16)
每司机平均车辆里程 0.008 (0.007) 0.017 (0.011) 0.009 (0.007) 0.124 (0.049)
失业率 −0.063 (0.013) −0.063 (0.013) −0.091 (0.021)
ln(人均实际收入) 1.82 (0.64) 1.79 (0.64) 1.00 (0.68)
年份 82–88 82–88 82–88 82–88 82–88 82–88 仅 1982 与 1988
州效应 否 是 是 是 是 是 是
时间效应 否 否 是 是 是 是 是
聚类标准误 否 是 是 是 是 是 是
F:时间效应=0 4.22 (0.002) 10.12 (<0.001) 3.48 (0.006) 10.28 (<0.001) 37.49 (<0.001)
F:饮酒年龄系数=0 0.35 (0.786) 1.41 (0.253) 0.42 (0.738)
F:失业率、人均收入=0 29.62 (<0.001) 31.96 (<0.001) 25.20 (<0.001)
\(\bar R^2\) 0.091 0.889 0.891 0.926 0.893 0.926 0.899

(每列的各个具体系数与置信区间由抽取文本按列顺序还原;个别列的置信区间原文只给出部分。)

第 (1)–(3) 列:(1) 无固定效应的混合 OLS,啤酒税系数为正(0.36),即加税会增加死亡!(2)(即 10.15)加入州固定效应后系数变为 −0.66,说明 (1) 的正系数源于遗漏变量偏误;\(\bar R^2\) 从 0.091 跃升至 0.889,州固定效应解释了数据中大量变异。(3)(即 10.21)加入时间效应变化不大,只是系数估计更不精确。(1)–(3) 一致表明被遗漏的固定因素——历史文化因素、总体道路条件、人口密度、对酒驾的态度等——是各州死亡率差异的重要决定因素。

基准设定 (4):在州和时间效应外加入酒驾法律变量以及控制驾驶量和州经济状况的变量。法律变量:最低法定饮酒年龄,用三个二元变量表示 18、19、20 岁(省略组为 21 岁或以上);首次酒驾定罪的处罚——强制监禁或强制社区服务(省略组为较轻处罚)。驾驶与经济条件:每司机平均车辆里程、失业率、人均实际个人收入的对数(1988 美元;取对数使系数可按收入百分比变化解释,见 8.2 节)。(7) 采用 10.2 节“前后”方法,只用 1982 与 1988 数据,即把 (10.8) 扩展到包含额外回归元。

(4) 的四个有趣结果:

  1. 加入额外变量使啤酒税效应从 (3) 的 −0.64 降至 −0.45。评估其大小:设一个平均实际啤酒税的州把税翻倍;样本平均实际啤酒税约每箱 $0.50(1988 美元),即提高 $0.50。预计死亡率下降 \(0.45\times0.50=0.23\) 人/万人。平均死亡率为 2,故相当于交通死亡减少近八分之一——效应很大。但估计很不精确:标准误 0.30,95% 置信区间为 \(-0.45\times0.50\pm1.96\times0.30\times0.50=(-0.52,0.08)\),包含 0,5% 水平无法拒绝啤酒税无效应。
  2. 最低法定饮酒年龄被精确地估计为效应很小:饮酒年龄 18 相对 21 的死亡率增加的 95% 置信区间为 \((-0.11,0.17)\);三个饮酒年龄系数联合为 0 的 F 统计量为 0.35,p = 0.786,10% 水平都不能拒绝。
  3. 首次违法处罚变量系数也很小,10% 水平不显著。
  4. 经济变量对交通死亡有相当的解释力。失业率上升 1 个百分点,死亡率下降 0.063 人/万人;人均实际收入系数 1.82,即收入增加 1% 对应死亡率增加 0.0182 人/万人(Key Concept 8.2 情形 I:线性–对数模型的解释)。经济好时死亡率高,可能因为失业率低时交通密度大,或收入高时饮酒多。两个经济变量在 0.1% 水平联合显著(F = 29.62)。

敏感性分析 (5)–(7):(5) 去掉经济条件变量后,啤酒税效应增大并在 5% 水平显著,其他系数无明显变化;啤酒税系数对经济变量的敏感性,加上经济变量在 (4) 中显著,说明经济变量应保留在基准设定中。(6) 把三个饮酒年龄指示变量换成连续的饮酒年龄,(4) 的结果对函数形式变化不敏感。(7) 用 1982→1988 的变化估计,(4) 的发现大体不变,只是啤酒税系数更大并在 1% 水平显著。

有效性讨论:分析的优势在于州和时间固定效应缓解了来自不随时间变化(如对酒驾的文化态度)或不随州变化(如安全创新)的不可观测变量造成的遗漏变量偏误。但仍需考虑威胁:一是实际啤酒税可能与其他酒税同向变动,因此结果应更广泛地理解为酒税效应而非仅啤酒;更微妙的是,提高啤酒税可能伴随公共教育运动,那么啤酒税变化可能捕捉了更广泛的反酒驾运动的效应。

综合结论:严厉处罚和提高最低饮酒年龄对死亡率都没有重要影响;而有证据表明提高酒税(以实际啤酒税衡量)确实减少交通死亡,大概是通过减少饮酒。但啤酒税系数估计不精确,应谨慎得出政策结论,需要进一步研究。脚注 2:进一步分析见 Ruhm (1996);Wagenaar, Salois & Komro (2009) 对 112 项研究的元分析发现酒价/酒税对消费的弹性为啤酒 −0.46、葡萄酒 −0.69、烈酒 −0.80,结论是相对其他项目酒税对减少消费效果大;Carpenter & Dobkin (2011) 与本文结论相反,发现提高最低饮酒年龄显著降低相应年龄段司机(尤其夜间)的死亡(但未控制表 10.1 中其他变量);另见 Cook & Moore (2000)、Chaloupka, Grossman & Saffer (2002)、Young & Bielinska-Kwapisz (2006)、Dang (2008)。

10.7 结论(PDF p.381)

本章展示了如何利用同一实体的多期观测来控制在实体间不同但不随时间变化的不可观测遗漏变量。关键洞见:若不可观测变量不随时间变化,则因变量的任何变化必然源于这些固定特征之外的影响。若一州对酒驾的文化态度在 7 年内没有明显变化,那么这 7 年死亡率变化的解释必在别处。

利用这一洞见需要面板数据。有了面板数据,第 II 部分的多元回归可扩展为包含全套实体二元变量——即可用 OLS 估计的固定效应回归模型。其变体是加入时间固定效应,控制随时间变化但在实体间相同的不可观测变量;两者可同时纳入。

局限:实体与时间固定效应回归无法控制同时随实体和时间变化的遗漏变量;面板方法需要面板数据,而面板数据常不可得。因此仍需要一种在面板方法无能为力时消除不可观测遗漏变量影响的方法——强大而一般的工具变量回归(第 12 章)。

第 10 章小结与关键术语(PDF p.381–382)

小结七条:(1) 面板数据由多个(\(n\))实体(州、公司、个人等)在两个或更多时期(\(T\))的观测组成;(2) 实体固定效应回归控制随实体不同但不随时间变化的不可观测变量;(3) 两期时,固定效应回归可用 \(Y\) 的变化对 \(X\) 的变化的“前后”回归估计;(4) 实体固定效应回归可通过纳入 \(n-1\) 个实体二元变量加可观测自变量和截距估计;(5) 时间固定效应控制在实体间相同但随时间变化的不可观测变量;(6) 双固定效应回归可通过纳入 \(n-1\) 个实体二元变量、\(T-1\) 个时期二元变量、各 \(X\) 和截距估计;(7) 面板数据中变量通常自相关(实体内跨时相关),标准误需同时允许自相关与异方差,方法之一是聚类标准误。

关键术语:panel data、balanced panel、unbalanced panel、fixed effects regression model、entity fixed effects、time fixed effects regression model、time fixed effects、entity and time fixed effects regression model、autocorrelated、serially correlated、heteroskedasticity- and autocorrelation-robust (HAR) standard errors、clustered standard errors。

习题概览(PDF p.382–387)

复习概念:10.1 面板数据的含义及优势;10.2 1000 名工人 10 年(2008–2017)面板研究教育对收入的影响:举出同时与教育和收入相关的个人特定不可观测变量、时间特定变量,以及如何用面板回归控制;10.3 该回归能否估计性别对收入的效应、全国失业率对个人收入的效应(不能——不随时间变化的个人变量被个人固定效应吸收,只随时间变化的全国变量被时间效应吸收);10.4 该回归误差为何序列相关。

练习:

  • 10.1 基于表 10.1:新泽西州(885 万人)啤酒税提高 $2,用 (5) 预测次年挽救的生命数及 99% 置信区间;饮酒年龄从 21 降至 19 的影响及 95% 区间;人均收入增 3% 的影响(用 (6));(2)–(7) 应按什么聚类(按州);饮酒年龄应以连续变量还是指示变量进入。
  • 10.2 同时包含 \(D1_i,\dots,Dn_i\) 和常数项时的完全多重共线性证明(虚拟变量陷阱),OLS 会怎样。
  • 10.3 把 9.2 节五大威胁清单应用于 10.6 节分析。
  • 10.4 由式 (10.11) 求实体 1、3 在时期 1、3 的斜率和截距;10.5 双固定效应二元变量形式的系数 \((\beta_0,\delta_t,\gamma_i)\) 与 \((\alpha_i,\lambda_t)\) 的关系。
  • 10.6 固定效应假设是否意味着 \(\mathrm{cov}(\tilde v_{it},\tilde v_{is})=0\)(附录式 10.28;答:否,允许实体内相关)。
  • 10.7 地震对建筑业就业的影响:是否该加省份固定效应。
  • 10.8 含实体特定时间趋势的模型 \(Y_{it}=X_{it}\beta_1+\alpha_i+\lambda_it+u_{it}\) 如何估计(先差分去掉 \(\alpha_i\),再对差分后的模型加实体固定效应,或纳入实体×时间趋势交互)。
  • 10.9 \(n\to\infty\)、\(T\) 固定时,\(\alpha_i\) 能否一致估计(不能,每个 \(\alpha_i\) 只有 \(T\) 个观测);\(n\) 大 \(T\) 小时 \(\hat\alpha_i\) 是否近似正态(不一定)。
  • 10.10 用个人固定效应估计年龄、性别、学历、工会、职业、行业对收入的影响会遇到什么问题(不随时间变化的变量如性别无法识别,年龄与时间效应共线,变化少的变量估计不精确等)。
  • 10.11 证明 \(T=2\) 时实体去均值估计量 \(\hat\beta_1^{DM}\) 等于无截距的前后差分估计量 \(\hat\beta_1^{BA}\)(提示:\(\tilde X_{i1}=-\frac12(X_{i2}-X_{i1})\),\(\tilde X_{i2}=\frac12(X_{i2}-X_{i1})\))。

实证练习:E10.1 “持枪许可法(shall-issue laws)”对暴力犯罪的影响(Guns 数据,50 州 + DC,1977–1999 平衡面板;Ayres & Donohue 2003):比较有无控制变量、加州固定效应、加时间固定效应的结果,换用抢劫与谋杀率,讨论剩余威胁。E10.2 收入与民主(Income_Democracy,195 国,1960–2000 每 5 年;Acemoglu et al. 2008):是否平衡面板、民主指数描述统计、按国家聚类的回归、收入增长 20% 对民主指数的预测与区间、为何要聚类、加入国家固定效应和时间固定效应后结论变化(著名结论:加入国家固定效应后收入对民主的效应基本消失)。

附录 10.1 州交通死亡数据集(PDF p.387)

美国本土 48 州(不含阿拉斯加、夏威夷),1982–1988 年度数据。死亡率为当年州内交通死亡人数/每万居民,来自美国交通部 Fatal Accident Reporting System;啤酒税(每箱)来自 Beer Institute 的 Brewers Almanac;饮酒年龄变量为是否 18、19、20 岁的二元变量;处罚二元变量表示州对首次酒驾定罪的最低量刑要求(要求监禁或社区服务为 1,否则 0);州年度车辆行驶总里程来自交通部;个人收入来自经济分析局(BEA),失业率来自劳工统计局(BLS)。数据由北卡罗来纳大学 Christopher J. Ruhm 教授提供。

附录 10.2 固定效应回归的标准误(PDF p.388–391)

给出单回归元固定效应回归的聚类标准误公式(多回归元推广见习题 19.15)。

固定效应估计量:实体去均值回归 (10.14) 的 OLS,\(\tilde Y_{it}=Y_{it}-\bar Y_i\),\(\tilde X_{it}=X_{it}-\bar X_i\),\(\bar Y_i=T^{-1}\sum_tY_{it}\)。将式 (4.5) 中的 \(X_i-\bar X\) 换为 \(\tilde X_{it}\)、单重求和换为对实体和时期的双重求和:

\[\hat\beta_1=\frac{\sum_{i=1}^n\sum_{t=1}^T\tilde X_{it}\tilde Y_{it}}{\sum_{i=1}^n\sum_{t=1}^T\tilde X_{it}^2}.\tag{10.22}\]

代入 \(\tilde Y_{it}=\beta_1\tilde X_{it}+\tilde u_{it}\),得面板版的式 (4.28):

\[\hat\beta_1=\beta_1+\frac{\frac1{nT}\sum_i\sum_t\tilde X_{it}\tilde u_{it}}{\frac1{nT}\sum_i\sum_t\tilde X_{it}^2}.\tag{10.23}\]

整理并两边乘以 \(\sqrt{nT}\):

\[\sqrt{nT}(\hat\beta_1-\beta_1)=\frac{\sqrt{\frac1n}\sum_{i=1}^n\eta_i}{\hat Q_{\tilde X}},\quad \eta_i=\sqrt{\frac1T}\sum_{t=1}^T\tilde X_{it}\tilde u_{it},\quad \hat Q_{\tilde X}=\frac1{nT}\sum_i\sum_t\tilde X_{it}^2.\tag{10.24}\]

缩放因子 \(nT\) 为总观测数。(脚注 5 解释双重求和:\(\sum_i\sum_tX_{it}=\sum_i(X_{i1}+\cdots+X_{iT})\)。)

\(n\) 大时的分布与标准误:多数面板应用中 \(n\gg T\),因此令 \(n\to\infty\)、\(T\) 固定作近似。在 Key Concept 10.3 假设下,\(\hat Q_{\tilde X}\xrightarrow{p}Q_{\tilde X}=E(T^{-1}\sum_t\tilde X_{it}^2)\);\(\eta_i\) 在 \(i\) 上 i.i.d.(假设 2),均值 0(假设 1),方差 \(\sigma_\eta^2\) 有限(假设 3),由中心极限定理 \(\sqrt{1/n}\sum_i\eta_i\xrightarrow{d}N(0,\sigma_\eta^2)\)。因此

\[\sqrt{nT}(\hat\beta_1-\beta_1)\xrightarrow{d}N\!\left(0,\frac{\sigma_\eta^2}{Q_{\tilde X}^2}\right),\tag{10.25}\]
\[\mathrm{var}(\hat\beta_1)=\frac1{nT}\frac{\sigma_\eta^2}{Q_{\tilde X}^2}.\tag{10.26}\]

聚类标准误用样本矩替代总体矩:

\[SE(\hat\beta_1)=\sqrt{\frac1{nT}\frac{s_{\hat\eta}^2}{\hat Q_{\tilde X}^2}},\quad s_{\hat\eta}^2=\frac1{n-1}\sum_{i=1}^n(\hat\eta_i-\bar{\hat\eta})^2=\frac1{n-1}\sum_{i=1}^n\hat\eta_i^2,\tag{10.27}\]

其中 \(\hat\eta_i=\sqrt{1/T}\sum_t\tilde X_{it}\hat u_{it}\)(用固定效应回归残差 \(\hat u_{it}\) 替换 \(\tilde u_{it}\));最后一个等号成立因为 \(\bar{\hat\eta}=0\)(残差与回归元不相关,式 4.32)。\(s_{\hat\eta}^2\) 就是 \(\hat\eta_i\) 的样本方差。即使存在异方差或自相关,\(s_{\hat\eta}^2\) 在 \(n\to\infty\) 时也一致(习题 18.15),所以聚类标准误是 HAR 的;检验 \(\beta_1=\beta_{1,0}\) 的 t 统计量在原假设下渐近标准正态。多回归元同样适用;\(n\) 大时用聚类方差计算的检验 \(q\) 个约束的 F 统计量渐近服从 \(F_{q,\infty}\)。

为何第 5 章的异方差稳健估计量对面板数据无效? 两个原因。最重要的是它不允许聚类内的序列相关。由 \(\mathrm{var}(U+V)=\mathrm{var}(U)+\mathrm{var}(V)+2\mathrm{cov}(U,V)\),令 \(\tilde v_{it}=\tilde X_{it}\tilde u_{it}\):

\[\mathrm{var}(\eta_i)=\mathrm{var}\Big(\sqrt{\tfrac1T}\sum_t\tilde v_{it}\Big)=\frac1T\big[\mathrm{var}(\tilde v_{i1})+\cdots+\mathrm{var}(\tilde v_{iT})+2\mathrm{cov}(\tilde v_{i1},\tilde v_{i2})+\cdots+2\mathrm{cov}(\tilde v_{i,T-1},\tilde v_{iT})\big].\tag{10.28}\]

第 5 章的异方差稳健公式漏掉了所有协方差项,存在序列相关时不一致。第二个原因:若 \(T\) 小,估计固定效应会给异方差稳健方差估计量带来偏误(截面回归无此问题)。唯一可用通常异方差稳健标准误的面板情形是 \(T=2\) 的固定效应回归:此时等价于 10.2 节的差分回归,异方差稳健与聚类标准误等价。实证上聚类标准误重要性的例子见 Bertrand, Duflo & Mullainathan (2004)(双重差分研究中忽略序列相关导致严重过度拒绝)。

扩展:聚类标准误的其他应用:(a) \(u_{it}\) 可能跨实体相关:如收入研究中按简单随机抽样选家庭,再追踪家庭内所有兄弟姐妹;兄弟姐妹的遗漏因素有共同成分,误差不独立(家庭之间独立)。家庭就是自然的聚类。式 (10.27) 的推导可修改为允许跨实体(如家庭)或跨实体与时间的聚类,只要聚类数目多。(b) 非简单随机抽样的截面数据:先随机抽取教室再收集教室内所有学生的成绩数据,不同教室学生的误差不相关,同一教室内可能相关,应在教室层面聚类。进一步讨论见 Cameron & Miller (2015)。

\(n\) 小时的分布与标准误:若 \(n\) 小而 \(T\) 大,仍可用聚类标准误,但 t 统计量须与 \(t_{n-1}\) 临界值比较;检验 \(q\) 个约束的 F 统计量须与 \(F_{q,n-q}\) 临界值乘以 \((n-1)/(n-q)\) 比较。这在 Key Concept 10.3 假设之外,还需对实体内 \(X_{it}\)、\(u_{it}\) 跨时联合分布的附加假设下成立。与截面回归中 t 分布需要误差正态且同方差(5.6 节)不同,\(T\) 大时面板聚类 t 统计量用 t 分布不需要这两个条件。

理由:\(T\) 大时在附加假设(实质且技术性,留待第 15 章时间序列讨论)下 \(\eta_i\) 服从中心极限定理,\(\eta_i\xrightarrow{d}N(0,\sigma_\eta^2)\);于是 \(\sqrt{nT}(\hat\beta_1-\beta_1)\) 是 \(n\) 个正态随机变量 \(\eta_i\) 的缩放平均。而 (10.27) 中 \(s_\eta^2\) 是通常的样本方差公式,若能用 \(\eta_i\) 计算,则 \((n-1)s_\eta^2/\sigma_\eta^2\sim\chi^2_{n-1}\),t 统计量服从 \(t_{n-1}\)(3.6 节);用残差计算不改变结论。多回归元时,用聚类方差估计量计算的检验 \(q\) 个约束的 F 统计量服从 \(\frac{n-1}{n-q}F_{q,n-q}\)。例:\(n=10\)、\(q=4\) 时 5% 临界值为 \(\frac{10-1}{10-4}\times4.53=6.80\)(4.53 为 \(F_{4,6}\) 的 5% 临界值,附表 5B)。随 \(n\) 增大,\(t_{n-1}\) 和 \(\frac{n-1}{n-q}F_{q,n-q}\) 趋于标准正态和 \(F_{q,\infty}\)。脚注 6:并非所有软件在 \(n\) 小时都使用这些分布,应检查软件的实现。若 \(n\) 和 \(T\) 都小,\(\hat\beta_1\) 一般不正态,聚类标准误不能提供可靠推断。

第 10 章 本章要点

  1. 面板数据 \((X_{it},Y_{it})\) 的核心价值:可以控制不可观测但不随时间变化(或不随实体变化)的遗漏变量。
  2. 两期时“前后差分”消去 \(Z_i\);多期时用实体固定效应模型 \(Y_{it}=\beta_1X_{it}+\alpha_i+u_{it}\),三种等价估计:\(n-1\) 个虚拟变量的 OLS(LSDV)、实体去均值(组内)OLS、\(T=2\) 时的无截距差分回归。
  3. 时间固定效应 \(\lambda_t\) 控制共同时间冲击;双固定效应 \(\alpha_i+\lambda_t\) 可通过双向去均值(平衡面板)估计;\(T=2\) 时等价于含截距的差分回归。
  4. 固定效应识别只利用实体内的时间变异:不随时间变化的回归元无法估计;回归元在实体内变异小时估计不精确。
  5. 关键假设是严格外生性 \(E(u_{it}|X_{i1},\dots,X_{iT},\alpha_i)=0\) 与实体间独立;允许实体内自相关。
  6. 面板误差一般自相关,必须用聚类(按实体)标准误;本例中稳健与聚类标准误分别为 0.25 与 0.36,t 值从 −2.51 降为 −1.78。\(n\) 小 \(T\) 大时用 \(t_{n-1}\) 与修正 F 临界值。
  7. 案例:截面回归中啤酒税与死亡率正相关是遗漏变量偏误;固定效应下效应为负;酒税有一定证据,饮酒年龄和处罚效应很小。
  8. 局限:无法处理同时随实体和时间变化的遗漏变量——需要工具变量。

第 10 章 与量化交易的关联

  • 因子研究就是面板回归:股票收益、因子暴露天然是“股票×日期”面板。截面回归(Fama–MacBeth)与面板回归的选择、是否加入时间固定效应(等价于每期截面去均值,剔除市场共同冲击)、是否加入个股固定效应(剔除股票长期平均收益差异,只看时间序列变化),直接决定因子检验回答的是什么问题:加时间效应后系数度量的是“同一天内暴露高的股票是否跑赢暴露低的股票”,即截面选股能力。
  • 聚类标准误是必需品:收益面板同时存在同一日期的截面相关(市场/行业冲击)和同一股票的时间相关(尤其使用重叠多期收益时)。本章的“按实体聚类”只处理后者;实践中应按日期聚类或双向聚类(Petersen 2009,Cameron–Gelbach–Miller),否则 t 值会严重虚高,导致伪因子。附录关于“聚类数少时用 \(t_{n-1}\)”的结论也提醒:若只按少数行业或少数年份聚类,推断要用小样本修正。
  • 公司金融/基本面量化:用财务面板研究杠杆、投资、分红等的决定因素时,公司固定效应控制不可观测的管理质量、商业模式;年份固定效应控制宏观周期。
  • 基金/经理评价:基金收益面板中加入基金固定效应与时间效应,可区分持续的“技能”与共同市场环境。
  • 注意事项:固定效应只利用实体内变异,对于变化缓慢的特征(如行业属性、市值分组)识别力弱;严格外生性在金融中常被违反(如今天的收益冲击影响明天的估值因子,带滞后因变量的动态面板会产生 Nickell 偏误),这些超出本章但需警惕。

第 10 章 推荐习题

  • 10.11:证明 \(T=2\) 时去均值估计与差分估计相同——理解固定效应的几何本质。
  • 10.2、10.5:虚拟变量陷阱与双固定效应参数化的对应关系。
  • 10.9:\(T\) 固定时固定效应 \(\alpha_i\) 不能一致估计(incidental parameters 问题的直观)。
  • 10.8:实体特定时间趋势的处理——对应量化中个股特有漂移。
  • 10.6 与附录 10.2:理解为何普通稳健标准误在面板中失效。
  • E10.2(收入与民主):体验加入固定效应前后结论的巨大差异,以及聚类标准误的影响。

第 11 章 二元因变量回归(Regression with a Binary Dependent Variable)

章首导言(PDF p.392–393)

两个除种族外完全相同的人到银行申请抵押贷款(mortgage)买同样的房子,银行会一视同仁吗?法律要求如此,但事实如何是银行监管者高度关注的问题。贷款被拒有许多正当理由(如月供占收入大部分),信贷员也会犯无心之错,单个少数族裔被拒不能证明歧视。因此很多歧视研究寻找统计证据:大数据集中白人与少数族裔是否被区别对待。

起点是比较拒贷率:本章数据(1990 年波士顿地区抵押贷款申请)中,黑人申请者被拒 28%,白人仅 9%。但两组并非“除种族外相同”,需要在保持其他申请者特征不变的情况下比较拒贷率——这是多元回归的任务,但有个转折:因变量(是否被拒)是二元的。第 II 部分常把二元变量作回归元,没问题;但因变量二元时,“对只取 0 和 1 的因变量拟合一条直线”是什么意思?

答案是把回归函数解释为条件概率。11.1 节讲线性概率模型(linear probability model);11.2 节讲专门的非线性模型 probit 和 logit 回归;11.3 节(选读)讲其估计方法最大似然估计(maximum likelihood estimation);11.4 节用波士顿抵押贷款数据检验种族偏见。二元因变量是**受限因变量(limited dependent variable)**的一种;其他受限因变量(如取多个离散值)的模型见附录 11.3。

11.1 二元因变量与线性概率模型(Binary Dependent Variables and the Linear Probability Model)(PDF p.393–397)

许多重要问题涉及二元结果:学费补贴对上大学决定的影响?什么决定青少年开始吸烟?什么决定一国是否获得外援?什么决定求职是否成功?

二元因变量:本章应用是种族是否是拒贷因素,因变量为申请是否被拒。数据是波士顿联储研究人员依据《住房抵押贷款披露法》(Home Mortgage Disclosure Act, HMDA)编制的大数据集的子集,涉及 1990 年波士顿地区的申请(附录 11.1)。当时批贷通常由银行信贷员决定,信贷员须评估申请人能否还款;重要信息之一是所需还款相对收入的大小(还款占收入 10% 比 50% 容易得多)。因此先看二元因变量 \(deny\)(被拒为 1,批准为 0)与连续变量 \(P/I\ ratio\)(预期每月总还款/月收入)的关系。

图 11.1 是 2380 个观测中 127 个的 \(deny\) 对 \(P/I\ ratio\) 散点图:P/I 低于 0.3 的申请者很少被拒,超过 0.4 的多数被拒。用这 127 个观测估计的 OLS 回归线概括了正相关关系;例如 \(P/I=0.3\) 时 \(deny\) 的预测值为 0.20。二元变量的预测值为 0.20 是什么意思?

关键:把回归解释为对因变量等于 1 的概率建模。 预测值 0.20 意味着 \(P/I=0.3\) 时被拒概率估计为 20%;若有很多 \(P/I=0.3\) 的申请,20% 会被拒。依据两个事实:(1) 总体回归函数是给定回归元时 \(Y\) 的期望 \(E(Y|X_1,\dots,X_k)\);(2) 若 \(Y\) 是 0–1 变量,\(E(Y)=0\times\Pr(Y=0)+1\times\Pr(Y=1)=\Pr(Y=1)\)。回归中期望是条件的,所以

\[E(Y|X_1,\dots,X_k)=\Pr(Y=1|X_1,\dots,X_k).\]

即二元因变量的总体回归预测值是给定 \(X\) 时 \(Y=1\) 的概率。将线性多元回归用于二元因变量称为线性概率模型:“线性”因为是直线,“概率模型”因为它对因变量等于 1 的概率建模。

线性概率模型的性质:总体系数 \(\beta_1\) 是 \(X\) 变化一单位引起的 \(Y=1\) 概率的变化;OLS 预测值 \(\hat Y_i\) 是 \(Y=1\) 的预测概率;\(\hat\beta_1\) 估计 \(X\) 变化一单位时 \(Y=1\) 概率的变化。第 II 部分几乎所有工具都适用:OLS 估计、±1.96 个标准误的 95% 置信区间、第 7 章的 F 统计量检验多系数假设、8.3 节方法建模交互作用。由于线性概率模型的误差总是异方差的(习题 11.8:\(\mathrm{var}(u|X)=p(X)[1-p(X)]\)),推断时必须使用异方差稳健标准误。

不适用的工具是 \(R^2\):因变量连续时可设想所有数据恰好在回归线上使 \(R^2=1\);但因变量二元时,除非回归元也是二元的,这不可能,所以 \(R^2\) 在此不是特别有用的统计量(拟合优度度量见下一节)。

Key Concept 11.1(线性概率模型):将线性多元回归模型

\[Y_i=\beta_0+\beta_1X_{1i}+\beta_2X_{2i}+\cdots+\beta_kX_{ki}+u_i\tag{11.2}\]

用于二元因变量 \(Y_i\)。由于 \(Y\) 二元,\(E(Y|X_1,\dots,X_k)=\Pr(Y=1|X_1,\dots,X_k)\),故 \(\Pr(Y=1|X_1,\dots,X_k)=\beta_0+\beta_1X_1+\cdots+\beta_kX_k\)。\(\beta_1\) 是保持其他回归元不变时 \(X_1\) 相差一单位对应的 \(Y=1\) 概率之差,其余类推。系数可用 OLS 估计,用通常的(异方差稳健)OLS 标准误构造置信区间和检验。

应用于波士顿 HMDA 数据:用全部 2380 个观测:

\[\widehat{deny}=\underset{(0.032)}{-0.080}+\underset{(0.098)}{0.604}\,P/I\ ratio.\tag{11.1}\]

系数为正,1% 水平显著(\(t=6.13\))。P/I 上升 0.1,被拒概率增加 \(0.604\times0.1\approx0.060\),即 6.0 个百分点。\(P/I=0.3\) 时预测值为 \(-0.080+0.604\times0.3=0.101\),即被拒概率 10.1%(与图 11.1 的 20% 不同,因为那条线只用了 127 个观测)。

加入种族:聚焦黑人与白人申请者,加入 \(black\)(黑人为 1,白人为 0):

\[\widehat{deny}=\underset{(0.029)}{-0.091}+\underset{(0.089)}{0.559}\,P/I\ ratio+\underset{(0.025)}{0.177}\,black.\tag{11.3}\]

\(black\) 系数 0.177 表示:保持 P/I 不变,非裔美国人申请者被拒概率比白人高 17.7 个百分点,1% 水平显著(\(t=7.11\))。字面上暗示可能存在种族偏见,但结论尚早:信贷员决策还考虑收入潜力、信用记录等许多因素,若其中任何一个在给定 P/I 时与 \(black\) 相关,遗漏它就会造成遗漏变量偏误。需等 11.4 节更全面的分析(原文此处写“Section 11.3”,实际分析在 11.4 节)。

线性概率模型的缺陷:使其易用的线性也是其主要缺陷。概率不能超过 1,所以 \(X\) 的给定变化对 \(Y=1\) 概率的影响必然是非线性的:P/I 从 0.3 到 0.4 可能大幅影响拒贷概率,但一旦 P/I 大到几乎必被拒,再增加也影响甚微。而线性概率模型中给定变化的效应恒定,导致图 11.1 中 P/I 很低时预测概率小于 0、很高时大于 1——这毫无意义,是线性回归不可避免的后果。为此引入专为二元因变量设计的非线性模型 probit 和 logit。

11.2 Probit 与 Logit 回归(PDF p.397–403)

Probit 和 logit 回归是专为二元因变量设计的非线性回归模型。既然二元因变量回归对 \(Y=1\) 的概率建模,就应采用迫使预测值落在 0 与 1 之间的非线性形式。累积分布函数(c.d.f.)产生 0–1 之间的概率(2.1 节),因此被采用:probit 用标准正态 c.d.f.,logit(又称 logistic 回归)用 logistic c.d.f.。

Probit 回归

单回归元 probit 模型:

\[\Pr(Y=1|X)=\Phi(\beta_0+\beta_1X),\tag{11.4}\]

\(\Phi\) 为标准正态累积分布函数(附表 1)。

例:\(Y=deny\),\(X=P/I\),设 \(\beta_0=-2\),\(\beta_1=3\)。\(P/I=0.4\) 时,\(\Pr=\Phi(-2+3\times0.4)=\Phi(-0.8)=\Pr(Z\le-0.8)=21.2\%\)。即先算“\(z\) 值” \(z=\beta_0+\beta_1X=-0.8\),再查正态分布 \(z\) 左侧尾概率。

系数解释:probit 系数 \(\beta_1\) 是 \(X\) 相差一单位对应的 \(z\) 值之差。\(\beta_1>0\) 则 \(X\) 增大提高 \(Y=1\) 的概率;\(\beta_1<0\) 则降低。\(X\) 对 \(z\) 的影响是线性的,但对概率的影响是非线性的。实践中解释 probit 系数最简单的方法是计算一个或多个回归元取值下的预测概率或预测概率的变化;单回归元时可作预测概率对 \(X\) 的图。

图 11.2 为 127 个观测的 probit 回归函数:呈拉长的“S”形——P/I 小时接近 0 且平坦,中间值时转而上升,大时再次平坦并接近 1。基于该图:\(P/I=0.2\) 时被拒概率 2.1%;0.3 时 16.1%;0.4 时陡增至 51.9%;0.6 时 98.3%。高 P/I 申请者几乎必被拒。

多回归元 probit:probit 也会受遗漏变量偏误影响,解决办法同样是加入额外回归元。两回归元的总体 probit 模型:

\[\Pr(Y=1|X_1,X_2)=\Phi(\beta_0+\beta_1X_1+\beta_2X_2).\tag{11.5}\]

例:\(\beta_0=-1.6\),\(\beta_1=2\),\(\beta_2=0.5\),\(X_1=0.4\),\(X_2=1\),则 \(z=-1.6+2\times0.4+0.5\times1=-0.3\),\(\Pr(Y=1|X_1=0.4,X_2=1)=\Phi(-0.3)=38\%\)。

\(X\) 变化的效应:\(Y\) 二元时,\(X\) 变化导致的 \(Y\) 期望变化就是 \(Y=1\) 概率的变化。按 8.1 节(Key Concept 8.1)三步法:先用估计回归函数在原 \(X\) 处算预测值;再在 \(X+\Delta X\) 处算预测值;取差。该方法对任何复杂非线性模型都适用。

Key Concept 11.2(Probit 模型、预测概率与估计效应):多回归元总体 probit 模型

\[\Pr(Y=1|X_1,\dots,X_k)=\Phi(\beta_0+\beta_1X_1+\cdots+\beta_kX_k),\tag{11.6}\]

\(Y\) 二元,\(\Phi\) 为标准正态 c.d.f.。最好通过计算预测概率和回归元变化的效应来解释。预测概率:计算 \(z=\beta_0+\beta_1X_1+\cdots+\beta_kX_k\),查正态表。\(\beta_1\) 是保持 \(X_2,\dots,X_k\) 不变时 \(X_1\) 相差一单位导致的 \(z\) 值之差。回归元变化对预测概率的效应:(1) 计算回归元初值时的预测概率;(2) 计算新值时的预测概率;(3) 取差。

应用于抵押贷款数据:2380 个观测:

\[\widehat{\Pr}(deny=1|P/I)=\Phi(\underset{(0.16)}{-2.19}+\underset{(0.47)}{2.97}\,P/I\ ratio).\tag{11.7}\]

系数 −2.19 和 2.97 难以直接解释(通过 \(z\) 值影响概率),能直接得出的只有:P/I 与拒贷概率正相关,且统计显著(\(t=2.97/0.47=6.32\))。P/I 从 0.3 增至 0.4 时:\(\Phi(-2.19+2.97\times0.3)=\Phi(-1.30)=0.097\);\(\Phi(-2.19+2.97\times0.4)=\Phi(-1.00)=0.159\);变化 \(0.159-0.097=0.062\),即增加 6.2 个百分点(从 9.7% 到 15.9%)。

由于非线性,效应依赖于 \(X\) 的起点:\(P/I=0.5\) 时概率 \(\Phi(-2.19+2.97\times0.5)=\Phi(-0.71)=0.239\),从 0.4 到 0.5 增加 \(0.239-0.159=8.0\) 个百分点,大于从 0.3 到 0.4 的 6.2 个百分点。

加入种族:

\[\widehat{\Pr}(deny=1|P/I,black)=\Phi(\underset{(0.16)}{-2.26}+\underset{(0.44)}{2.74}\,P/I\ ratio+\underset{(0.083)}{0.71}\,black).\tag{11.8}\]

系数大小难解释,但符号和显著性不难:\(black\) 系数为正,保持 P/I 不变时非裔申请者被拒概率更高,1% 水平显著(\(t=8.55\))。\(P/I=0.3\) 的白人申请者预测被拒概率 7.5%,黑人为 23.3%,相差 15.8 个百分点。

Probit 系数的估计:用最大似然法估计,它在包括二元因变量回归在内的广泛应用中给出有效(最小方差)估计量。最大似然估计量一致且大样本下正态,故 t 统计量和置信区间照常构造(估计值 ±1.96 个标准误),用最大似然估计量计算的 F 统计量可检验联合假设。软件估计 probit 一般用最大似然,实践中很简单。详见 11.3 节和附录 11.2。

Logit 回归

Logit 模型与 probit 类似,只是把 (11.6) 中的标准正态 c.d.f. \(\Phi\) 换成标准 logistic 累积分布函数 \(F\),其函数形式由指数函数定义。

Key Concept 11.3(Logit 回归):多回归元的二元因变量 \(Y\) 的总体 logit 模型为

\[\Pr(Y=1|X_1,\dots,X_k)=F(\beta_0+\beta_1X_1+\cdots+\beta_kX_k)=\frac{1}{1+e^{-(\beta_0+\beta_1X_1+\beta_2X_2+\cdots+\beta_kX_k)}}.\tag{11.9}\]

Logit 与 probit 的区别仅在于累积分布函数不同。

与 probit 一样,logit 系数最好通过预测概率及其差来解释;系数可用最大似然估计,大样本下一致且正态,t 统计量和置信区间照常构造。图 11.3 用同样 127 个观测画出 probit 与 logit 回归函数,两者差异很小。历史上采用 logit 的主要动机是 logistic c.d.f. 计算比正态 c.d.f. 快;随着计算机能力增强,这一差别已不重要。(补充:logit 的系数可解释为对数几率 \(\ln[p/(1-p)]\) 的变化,原书本章未展开。)

应用于波士顿 HMDA 数据:

\[\widehat{\Pr}(deny=1|P/I,black)=F(\underset{(0.35)}{-4.13}+\underset{(0.96)}{5.37}\,P/I\ ratio+\underset{(0.15)}{1.27}\,black).\tag{11.10}\]

\(black\) 系数为正,1% 水平显著(\(t=8.47\))。\(P/I=0.3\) 的白人:\(1/[1+e^{-(-4.13+5.37\times0.3+1.27\times0)}]=1/(1+e^{2.52})=0.074\),即 7.4%;黑人:\(1/(1+e^{1.25})=0.222\),即 22.2%;相差 14.8 个百分点。

线性概率、probit 与 logit 模型的比较(p.403)

三者都只是未知总体回归函数 \(E(Y|X)=\Pr(Y=1|X)\) 的近似。线性概率模型最易使用和解释,但无法捕捉真实总体回归函数的非线性;probit 和 logit 能刻画概率的非线性,但系数较难解释。实践中用哪个?没有唯一正确答案,不同研究者用不同模型。Probit 与 logit 常给出相似结果:如 \(P/I=0.3\) 时黑白申请者被拒概率差,probit (11.8) 为 15.8 个百分点,logit (11.10) 为 14.9 个百分点(原文此处写 14.9,与前文 14.8 略有出入,属四舍五入差异),实际用途上非常接近。选择方法之一是挑自己统计软件里更方便的。

线性概率模型对非线性总体回归函数的近似最不合理;但在回归元极端值较少的数据集中,它仍可能是足够的近似。如 (11.3) 中线性概率模型估计的黑白差距为 17.7 个百分点,比 probit 和 logit 大,但定性相似。唯一确认的办法是同时估计线性与非线性模型并比较其预测概率。

11.3 Logit 与 Probit 模型的估计与推断(Estimation and Inference in the Logit and Probit Models)(选读,PDF p.404–407)

8.2、8.3 节的非线性模型是自变量的非线性函数,但对未知系数是线性的,故可用 OLS 估计。而 probit 和 logit 回归函数是系数的非线性函数:probit 系数 \(\beta_0,\dots,\beta_k\) 在 \(\Phi\) 内部,logit 系数在 \(F\) 内部,不能用 OLS 估计。标准方法是最大似然;由于其理论比最小二乘复杂,先讨论另一种方法——非线性最小二乘。

非线性最小二乘(nonlinear least squares, NLLS):当参数非线性地进入总体回归函数时估计参数的一般方法(附录 8.1 已介绍),把 OLS 推广到参数非线性的回归函数;同样选择参数以最小化模型预测误差平方和。对 probit:\(E(Y|X_1,\dots,X_k)=\Pr(Y=1|X)=\Phi(\beta_0+\beta_1X_1+\cdots+\beta_kX_k)\),NLLS 估计量是使下式最小的 \(\beta_0,\dots,\beta_k\):

\[\sum_{i=1}^n\big[Y_i-\Phi(\beta_0+\beta_1X_{1i}+\cdots+\beta_kX_{ki})\big]^2.\tag{11.11}\]

NLLS 与 OLS 共享两个关键性质:一致(样本增大时接近真值的概率趋于 1)、大样本正态。但存在方差更小的估计量,即 NLLS 无效(inefficient),因此实践中很少用 NLLS 估计 probit,而用最大似然。

最大似然估计(maximum likelihood estimation):**似然函数(likelihood function)**是数据的联合概率分布,被视为未知系数的函数。**最大似然估计量(MLE)**是使似然函数最大的系数值。MLE 实际上选择使“抽到实际观测数据的概率”最大的参数值,在此意义上是“最可能”产生数据的参数值。

例:两个 i.i.d. 伯努利观测。无回归元的二元变量 \(Y_1,Y_2\),\(Y\) 为伯努利随机变量,唯一未知参数是 \(p=\Pr(Y=1)\)(也是 \(Y\) 的均值)。独立性使联合分布为各自分布之积(式 2.24):\(\Pr(Y_1=y_1,Y_2=y_2)=\Pr(Y_1=y_1)\Pr(Y_2=y_2)\)。伯努利分布可写成 \(\Pr(Y=y)=p^y(1-p)^{1-y}\)(\(y=1\) 时为 \(p\),\(y=0\) 时为 \(1-p\))。故联合分布为 \([p^{y_1}(1-p)^{1-y_1}]\times[p^{y_2}(1-p)^{1-y_2}]=p^{(y_1+y_2)}(1-p)^{2-(y_1+y_2)}\)。似然函数为

\[f(p;Y_1,Y_2)=p^{(Y_1+Y_2)}(1-p)^{2-(Y_1+Y_2)}.\tag{11.12}\]

\(p\) 的 MLE 是使 (11.12) 最大的 \(p\)。可以试错,但用微积分得到简单公式:\(\hat p=\frac12(Y_1+Y_2)\)——MLE 就是样本均值!一般 \(n\) 时伯努利概率 \(p\) 的 MLE 也是 \(\hat p=\bar Y\)(附录 11.2),即样本中 \(Y_i=1\) 的比例。

与 probit/logit 的联系:在这些模型中,成功概率 \(p\) 不是常数而依赖于 \(X\)——由 (11.6)(probit)或 (11.9)(logit)给出的条件成功概率。因此 probit/logit 的似然函数与 (11.12) 类似,只是成功概率随观测而变(依赖 \(X_i\)),表达式见附录 11.2。

与 NLLS 一样,MLE 一致且大样本正态;回归软件通常计算 probit 系数的 MLE,实践中易用。本章报告的所有 probit 和 logit 系数都是 MLE。

基于 MLE 的统计推断:由于 MLE 大样本正态,推断与基于 OLS 的线性回归完全相同:t 统计量检验假设,±1.96 个标准误构成 95% 置信区间,多系数联合假设用 F 统计量(类似第 7 章)。实用要点:有的软件用 F 统计量报告联合检验,有的用卡方统计量;卡方统计量 \(=q\times F\)(\(q\) 为约束个数)。原假设下 F 统计量大样本分布为 \(\chi^2_q/q\),故 \(qF\) 大样本服从 \(\chi^2_q\)。两种方法仅差在是否除以 \(q\),推断结论相同,但必须知道软件用的是哪种以便使用正确的临界值。

拟合优度度量(Measures of Fit):\(R^2\) 对线性概率模型是差的拟合度量,对 probit/logit 也是。二元因变量模型的两种拟合度量:

  • 正确预测比例(fraction correctly predicted):规则——若 \(Y_i=1\) 且预测概率超过 50%,或 \(Y_i=0\) 且预测概率低于 50%,则称 \(Y_i\) 被正确预测,否则错误;正确预测比例即 \(n\) 个观测中被正确预测的比例。优点:易懂。缺点:不反映预测质量——\(Y_i=1\) 时预测概率 51% 和 90% 都算正确。
  • 伪 \(R^2\)(pseudo-\(R^2\)):用似然函数度量拟合。由于 MLE 最大化似然函数,向 probit/logit 模型加入回归元会提高最大化似然值,正如 OLS 中加回归元必然降低残差平方和。因此可比较含全部回归元与不含任何回归元时的最大化似然值来度量拟合——这正是伪 \(R^2\) 的做法(公式见附录 11.2)。

11.4 应用于波士顿 HMDA 数据(Application to the Boston HMDA Data)(PDF p.407–413)

前两节回归显示保持 P/I 不变时黑人被拒率更高。但信贷员合法地权衡许多因素,若其中任何因素因种族系统性不同,此前的估计量就有遗漏变量偏误。本节目标:在保持信贷员可合法考虑的申请者特征不变的条件下,估计种族对被拒概率的效应。

表 11.1 抵押贷款决策回归模型中的变量(最后一列为样本均值):

变量 定义 样本均值
财务变量
P/I ratio 每月总债务还款/每月总收入 0.331
housing expense-to-income ratio 每月住房支出/每月总收入 0.255
loan-to-value ratio 贷款额/房产评估价值 0.738
consumer credit score 1 无拖欠;2 一两次拖欠;3 两次以上拖欠;4 信用记录不足无法判断;5 有逾期 60 天的不良记录;6 有逾期 90 天的不良记录 2.1
mortgage credit score 1 无房贷迟付;2 无房贷还款历史;3 一两次迟付;4 两次以上迟付 1.7
public bad credit record 有任何信用问题公开记录(破产、坏账核销、催收诉讼)为 1,否则 0 0.074
其他申请者特征
denied mortgage insurance 申请抵押贷款保险被拒为 1 0.020
self-employed 自雇为 1 0.116
single 单身为 1 0.393
high school diploma 高中毕业为 1 0.984
unemployment rate 申请者所在行业 1989 年马萨诸塞州失业率 3.8
condominium 房产为共管公寓(condominium)为 1 0.288
black 黑人为 1,白人为 0 0.142
deny 申请被拒为 1 0.120

变量含义:前两个变量直接衡量拟议贷款相对收入的财务负担;贷款价值比接近 1 时,若申请者违约、银行止赎,银行可能难以收回全额贷款;最后三个财务变量概括信用历史——过去还债不可靠,信贷员有理由担心其未来还款能力或意愿;三者分别衡量消费信贷(如信用卡)、过去房贷还款历史和严重到进入公开法律记录(如破产)的信用问题,信贷员可能给予不同权重。有时申请者须申请私人抵押贷款保险(脚注 3:借款人违约时保险公司替其向银行支付月供;研究期间贷款价值比超过 80% 通常须购买),信贷员知道该申请是否被拒,被拒会对其不利。接下来四个变量(就业状态、婚姻状况、学历、所在行业失业率)与未来还款能力有关;止赎时房产特征也相关(是否共管公寓)。数据中 14.2% 申请者为黑人,12.0% 的申请被拒。

基准设定(列 1–3):包含表 11.1 的财务变量,加上是否被拒私人抵押贷款保险和是否自雇。90 年代信贷员常对贷款价值比使用阈值,故用二元变量表示高(≥ 0.95)、中(0.8–0.95)、低(< 0.8,为省略组以避免完全多重共线性)。前三列回归元与波士顿联储研究者原始分析的基准设定相似(脚注 4:与 Munnell et al. (1996) 表 2(1) 的区别是后者还包含房屋位置和贷款机构身份指示变量(非公开数据)、多户住宅指示(此处只关注单户住宅,不相关),以及净财富(因有少数极大正负值,可能使结果对少数离群值敏感而省略))。三列仅在建模方式上不同:线性概率模型、logit、probit。

由于 logit/probit 系数不能直接解释,表中只报告标准误而不报告置信区间;并且由于这些回归旨在近似信贷员的决策规则,关心的是各变量(尤其是种族)是否进入该规则,所以用星号表示系数为 0 的检验在 5%(*)或 1%(**)水平被拒绝。

表 11.2 用波士顿 HMDA 数据的拒贷回归(因变量 deny;2380 个观测;LPM 用 OLS 估计,probit 与 logit 用 MLE;括号为标准误)

回归元 (1) LPM (2) Logit (3) Probit (4) Probit (5) Probit (6) Probit
black 0.084** (0.023) 0.688** (0.182) 0.389** (0.098) 0.371** (0.099) 0.363** (0.100) 0.246 (0.448)
P/I ratio 0.449** (0.114) 4.76** (1.33) 2.44** (0.61) 2.46** (0.60) 2.62** (0.61) 2.57** (0.66)
住房支出/收入 −0.048 (0.110) −0.11 (1.29) −0.18 (0.68) −0.30 (0.68) −0.50 (0.70) −0.54 (0.74)
中等贷款价值比(0.80–0.95) 0.031* (0.013) 0.46** (0.16) 0.21** (0.08) 0.22** (0.08) 0.22** (0.08) 0.22** (0.08)
高贷款价值比(>0.95) 0.189** (0.050) 1.49** (0.32) 0.79** (0.18) 0.79** (0.18) 0.84** (0.18) 0.79** (0.18)
消费信用评分 0.031** (0.005) 0.29** (0.04) 0.15** (0.02) 0.16** (0.02) 0.34** (0.11) 0.16** (0.02)
房贷信用评分 0.021 (0.011) 0.28* (0.14) 0.15* (0.07) 0.11 (0.08) 0.16 (0.10) 0.11 (0.08)
公开不良信用记录 0.197** (0.035) 1.23** (0.20) 0.70** (0.12) 0.70** (0.12) 0.72** (0.12) 0.70** (0.12)
抵押贷款保险被拒 0.702** (0.045) 4.55** (0.57) 2.56** (0.30) 2.59** (0.29) 2.59** (0.30) 2.59** (0.29)
自雇 0.060** (0.021) 0.67** (0.21) 0.36** (0.11) 0.35** (0.11) 0.34** (0.11) 0.35** (0.11)
单身 0.23** (0.08) 0.23** (0.08) 0.23** (0.08)
高中文凭 −0.61** (0.23) −0.60* (0.24) −0.62** (0.23)
行业失业率 0.03 (0.02) 0.03 (0.02) 0.03 (0.02)
共管公寓 −0.05 (0.09)
black × P/I −0.58 (1.47)
black × 住房支出/收入 1.23 (1.69)
额外信用评级指示变量 否 否 否 否 是 否
常数 −0.183** (0.028) −5.71** (0.48) −3.04** (0.23) −2.57** (0.34) −2.90** (0.39) −2.54** (0.35)
F:单身、高中文凭、行业失业率 5.85 (<0.001) 5.22 (0.001) 5.79 (<0.001)
F:额外信用评级指示变量 1.22 (0.291)
F:种族交互项与 black 4.96 (0.002)
F:仅种族交互项 0.27 (0.766)
白人与黑人预测拒贷概率差(百分点) 8.4% 6.0% 7.1% 6.6% 6.3% 6.5%

最后一行的预测概率差是对除种族外各回归元取样本均值的假想申请者计算的。

列 (1) 线性概率模型解读:系数即自变量变化一单位导致的预测概率变化。P/I 上升 0.1,被拒概率增加约 \(0.449\times0.1\approx4.5\) 个百分点;贷款价值比超过 95% 相对低于 80% 的省略组,被拒概率增加 18.9 个百分点;信用差更难获贷,有趣的是消费信用系数显著而房贷信用系数不显著;有公开不良信用记录(如破产)使被拒概率增加 19.7 个百分点;被拒抵押贷款保险几乎是决定性的——系数 0.702 意味着被拒概率增加 70.2 个百分点。回归中除种族外的 9 个变量有 7 个在 5% 水平显著,符合信贷员考虑多种因素的事实。\(black\) 系数 0.084:保持其他变量不变,黑白申请者被拒概率差 8.4 个百分点,1% 水平显著(\(t=3.65\))。

列 (2)(3) logit 与 probit:结论相似。除种族外 9 个变量中 8 个在 5% 水平单独显著,\(black\) 系数在 1% 水平显著。由于非线性,计算黑白预测概率差必须选定所有回归元的取值,惯例是取除种族外各回归元样本均值的“平均”申请者。估计的种族差异彼此相近:LPM 8.4、logit 6.0、probit 7.1 个百分点。这些种族效应及 \(black\) 系数都小于前几节只含 P/I 和 black 的回归,说明早先估计有遗漏变量偏误。

列 (4)–(6) 敏感性分析:(4) 在 (3) 基础上加入更多申请者特征,它们有助于预测是否被拒(如有高中文凭降低被拒概率,1% 水平显著),但不重要地改变 \(black\) 系数或概率差(6.6%)。(5) 把 6 个消费信用类别和 4 个房贷信用类别拆成指示变量,以检验两者是否线性进入 \(z\) 值,并加入共管公寓指示:5% 水平既不拒绝信用变量线性进入的原假设,共管公寓也不显著;最重要的是种族差(6.3%)与 (3)(4) 基本相同。(6) 检验交互:对黑人与白人评估 P/I 和住房支出比时是否用不同标准?似乎没有——交互项在 5% 水平联合不显著(F = 0.27,p = 0.766);但种族依然有显著影响——种族指示变量与交互项在 1% 水平联合显著(F = 4.96,p = 0.002)。种族差(6.5%)仍与其他 probit 回归相同。

结论:六个设定中,保持其他特征不变,种族对被拒概率的效应都在 1% 水平显著,黑白申请者被拒概率差为 6.0–8.4 个百分点。评估其大小:两位申请者,一白一黑,其他变量都取回归 (3) 中样本均值,白人被拒概率 7.4%,黑人 14.5%;差 7.1 个百分点意味着黑人被拒的可能性几乎是白人的两倍。

表 11.2(以及波士顿联储原研究)给出了法律上本不应存在的抵押贷款拒贷种族模式的统计证据,这些证据推动了银行监管政策变化(脚注 5:联邦银行监管者公平贷款检查方式的改变、司法部问询的变化、对银行和住房贷款发起机构的教育项目加强)。但这些结果也引发了激烈争论。按第 9 章框架审视:

  • 内部有效性的批评:数据可能有错误、替代的非线性函数形式、额外交互项等。原始数据经过仔细审计,发现了一些错误,此处(及最终发表的波士顿联储研究)结果基于“清洗后”数据;估计其他设定(不同函数形式和/或额外回归元)得到与表 11.2 可比的种族差异。更难的内部有效性问题:面谈中获得的、未记录在申请表上的、与种族相关的非种族财务信息——若存在,表 11.2 的回归仍可能有遗漏变量偏误。
  • 外部有效性的质疑:即使 1990 年波士顿存在种族歧视,牵连今天其他地方的贷款机构是错的;且现代在线申请无需面对面即可批或拒,歧视可能更少。解决外部有效性问题的唯一办法是考察其他地点和年份的数据。脚注 6:延伸阅读 Journal of Economic Perspectives 1998 年春季种族歧视与经济学专题,其中 Ladd (1998) 综述抵押贷款歧视的证据与争论;Goering & Wienk (1996) 更详细;此后美国抵押贷款市场剧变——放松贷款标准、房价泡沫、2008–2009 金融危机、再度收紧——见 Green & Wachter (2008)。

11.5 结论(PDF p.413–414)

因变量 \(Y\) 二元时,总体回归函数是给定回归元时 \(Y=1\) 的概率。估计它需要找到符合概率解释的函数形式、估计其未知参数并解释结果;预测值是预测概率,回归元 \(X\) 变化的估计效应是由此引起的 \(Y=1\) 概率的估计变化。对给定回归元的 \(Y=1\) 概率建模的自然方式是使用累积分布函数,其自变量依赖于回归元:probit 用正态 c.d.f.,logit 用 logistic c.d.f.。由于它们是未知参数的非线性函数,估计比线性回归复杂,标准方法是最大似然;实践中基于 MLE 的推断与线性多元回归相同(如 95% 置信区间 = 估计值 ±1.96 个标准误)。

尽管本质上非线性,总体回归函数有时可由线性概率模型充分近似。在波士顿 HMDA 数据上,线性概率、probit 和 logit 给出相似的最终答案:在其他条件相似时,黑人与白人申请者的拒贷率存在实质差异。二元因变量是受限因变量最常见的例子;20 世纪最后二十五年对其他受限因变量的计量方法取得重要进展,部分见附录 11.3。

专栏:诺贝尔奖得主 James Heckman 与 Daniel McFadden(p.414):2000 年诺贝尔经济学奖授予芝加哥大学 James J. Heckman 和加州大学伯克利分校 Daniel L. McFadden,表彰他们对个人和企业数据分析的基础性贡献,其工作多涉及受限因变量的难题。Heckman 因发展处理样本选择的工具获奖:如 9.2 节所述,当数据可得性受与因变量取值相关的选择过程影响时产生样本选择偏误。例如用就业者(报告正收入者)子样本估计收入与某回归元的关系,OLS 可能有选择偏误。Heckman 的解法是设定一个初步方程,其二元因变量表示工人是否在劳动力中(是否在子样本中),把该方程与收入方程视为联立方程组;该策略已推广到劳动经济学、产业组织到金融等众多领域的选择问题。McFadden 因发展**离散选择(discrete choice)**数据分析模型获奖(高中毕业生参军、上大学还是工作?):从个人最大化每个可能选择的期望效用出发(效用可依赖于工资、工作特征、家庭背景等可观测变量),推导出含未知系数的个人选择概率模型,再用最大似然估计;这些模型及其扩展广泛用于劳动经济学、健康经济学、交通经济学等。

第 11 章小结与关键术语(PDF p.415)

小结六条:(1) \(Y\) 为二元变量时,总体回归函数给出给定 \(X_1,\dots,X_k\) 时 \(Y=1\) 的概率;(2) \(Y\) 二元时线性多元回归模型称为线性概率模型,因 \(Y=1\) 的概率是回归元的线性函数;(3) probit 和 logit 是用于二元 \(Y\) 的非线性回归模型,与线性概率模型不同,它们保证对所有 \(X\) 预测概率都在 0 与 1 之间;(4) probit 用标准正态 c.d.f.,logit 用 logistic c.d.f.,系数用最大似然估计;(5) probit/logit 系数值不易解释,\(X\) 变化对应的 \(Y=1\) 概率变化可用 Key Concept 8.1 的非线性模型一般程序计算;(6) 线性概率、logit、probit 模型的系数假设检验用通常的 t 和 F 统计量。

关键术语:limited dependent variable、linear probability model、probit、logit、logistic regression、likelihood function、maximum likelihood estimator (MLE)、fraction correctly predicted、pseudo-\(R^2\)。

习题概览(PDF p.415–421)

复习概念:11.1 线性概率模型预测值 1.3 为何荒谬;11.2 表 11.2 中 \(black\) 系数在 (1)(2)(3) 分别为 0.084、0.688、0.389,差异巨大,为何对种族边际效应的估计却相近(系数尺度不同:logit 系数约为 probit 的 1.6–1.8 倍,概率效应需经 c.d.f. 转换);11.3 什么是最大似然估计,probit/logit 相对线性概率模型的优点,如何在两者之间选择;11.4 二元因变量模型常用的拟合度量。

练习 11.1–11.5 情境:某区随机抽取 700 名有收入者,问是否为政府雇员(\(Gov_i\)),并收集性别(\(Male_i\))和受教育年数(\(Schooling_i\),指 25 岁以上者的受教育年数)。估计结果:

(1) Probit (2) Logit (3) LPM (4) Probit (5) Logit (6) LPM (7) Probit
Schooling 0.272 (0.029) 0.551 (0.062) 0.035 (0.003) 0.548 (0.091)
Male −0.242 (0.125) −0.455 (0.234) −0.050 (0.025) 4.352 (1.291)
Male×Schooling −0.344 (0.096)
常数 −4.107 (0.358) −8.146 (0.800) −0.172 (0.027) −1.027 (0.098) −1.717 (0.179) 0.152 (0.021) −7.702 (1.238)
  • 11.1 用 (1):政府雇用概率是否依赖受教育年数;16 年、12 年教育者的概率;样本受教育年数在 0–18 年且仅 5 人超过 15 年,读了 24 年的博士的预测是否可靠(样本外外推问题)。
  • 11.2 用 logit (2) 重做,并画出 0–18 年的 probit 与 logit 预测概率比较;11.3 用 LPM (3) 重做,判断线性概率模型是否合适。
  • 11.4 用 (4)–(6) 计算男女的政府雇用概率,三个模型是否不同(只有一个二元回归元时三个模型的预测概率完全相同——饱和模型)。
  • 11.5 用含交互项的 (7):10 年教育男性、12 年教育女性的概率;教育效应是否依赖性别。
  • 11.6 用 probit (11.8):P/I 为 0.35 的黑人申请者被拒概率;降至 0.30 的效应;白人重复;P/I 的边际效应是否依赖种族(是,因非线性)。11.7 用 logit (11.10) 重做并比较。
  • 11.8 线性概率模型:证明 \(\Pr(Y_i=1|X_i)=\beta_0+\beta_1X_i\),\(\mathrm{var}(u_i|X_i)=(\beta_0+\beta_1X_i)[1-(\beta_0+\beta_1X_i)]\),故 \(u_i\) 异方差;推导似然函数。
  • 11.9 用表 11.2 (1):自雇与受薪者被拒概率差及其 95% 置信区间;可能导致偏误的遗漏变量。
  • 11.10 三点分布 \(\Pr(Y=1)=p\),\(\Pr(Y=2)=q\),\(\Pr(Y=3)=1-p-q\) 的似然函数与 MLE(\(\hat p\)、\(\hat q\) 为样本频率)。
  • 11.11(需附录 11.3)选择模型:工厂每周工作小时数(截尾/tobit)、工作满意度 0–5(有序 probit)、交通方式选择(多项 logit/probit)、一周下雨天数(计数模型,泊松/负二项或二项)。

实证练习:E11.1 大衰退中谁更易失业(Employment_08_09,5440 名 2008 年 4 月全职就业者一年后的就业状态):就业概率的置信区间、对年龄及年龄平方的 LPM/probit/logit、预测 20/40/60 岁就业概率、加入教育/性别/种族/婚姻/地区/周收入控制以检查遗漏变量偏误、改用 Unemployed 为因变量、与 2006–2007 正常时期(Employment_06_07)比较。E11.2 工作场所禁烟对吸烟的影响(Smoking,1991–1993 年 10,000 名美国室内工作者;Evans, Farrelly & Montgomery 1999):比较受/不受禁烟令影响者的吸烟概率,加入人口学控制变量后效应变化及解释,检验教育的影响,用 probit/logit 重做并计算典型个体(20 岁白人高中辍学男性 A、40 岁黑人大学毕业女性 B)受禁烟令前后的吸烟概率,比较三种模型。

附录 11.1 波士顿 HMDA 数据集(PDF p.421)

由波士顿联储研究人员收集,结合抵押贷款申请信息和对受理这些申请的银行及其他贷款机构的后续调查;涉及 1990 年大波士顿都市区的申请。完整数据集 2925 个观测,包括所有黑人和西班牙裔申请以及白人申请的随机样本。本章只用单户住宅(排除多户住宅)且只含黑人和白人申请者(排除其他少数族裔)的子集,共 2380 个观测;变量定义见表 11.1。数据由波士顿联储研究部 Geoffrey Tootell 提供;更多信息及波士顿联储研究者的结论见 Munnell et al. (1996)。

附录 11.2 最大似然估计(PDF p.421–423)

\(n\) 个 i.i.d. 伯努利随机变量的 MLE:联合分布(11.3 节 \(n=2\) 情形的推广)

\[\Pr(Y_1=y_1,\dots,Y_n=y_n)=[p^{y_1}(1-p)^{1-y_1}]\times\cdots\times[p^{y_n}(1-p)^{1-y_n}]=p^{(y_1+\cdots+y_n)}(1-p)^{n-(y_1+\cdots+y_n)}.\tag{11.13}\]

令 \(S=\sum_iY_i\),似然函数为

\[f_{Bernoulli}(p;Y_1,\dots,Y_n)=p^S(1-p)^{n-S}.\tag{11.14}\]

最大化对数似然更方便(对数严格递增,最大化似然或对数似然给出相同估计量):对数似然 \(S\ln p+(n-S)\ln(1-p)\),求导

\[\frac{d}{dp}\ln[f_{Bernoulli}(p;Y_1,\dots,Y_n)]=\frac Sp-\frac{n-S}{1-p}.\tag{11.15}\]

令其为 0 解得 \(\hat p=S/n=\bar Y\)。

Probit 模型的 MLE:给定 \(X_{1i},\dots,X_{ki}\) 时 \(Y_i=1\) 的概率为 \(p_i=\Phi(\beta_0+\beta_1X_{1i}+\cdots+\beta_kX_{ki})\),第 \(i\) 个观测的条件分布为 \(\Pr[Y_i=y_i|X_{1i},\dots,X_{ki}]=p_i^{y_i}(1-p_i)^{1-y_i}\)。假设 \((X_{1i},\dots,X_{ki},Y_i)\) i.i.d.,给定 \(X\) 的联合分布为

\[\Pr(Y_1=y_1,\dots,Y_n=y_n|X)=\prod_{i=1}^n\Pr(Y_i=y_i|X_{1i},\dots,X_{ki})=p_1^{y_1}(1-p_1)^{1-y_1}\times\cdots\times p_n^{y_n}(1-p_n)^{1-y_n}.\tag{11.16}\]

对数似然函数:

\[\ln[f_{probit}(\beta_0,\dots,\beta_k;Y_1,\dots,Y_n|X)]=\sum_{i=1}^nY_i\ln[\Phi(\beta_0+\beta_1X_{1i}+\cdots+\beta_kX_{ki})]+\sum_{i=1}^n(1-Y_i)\ln[1-\Phi(\beta_0+\beta_1X_{1i}+\cdots+\beta_kX_{ki})].\tag{11.17}\]

probit 的 MLE 最大化 (11.17);没有简单的闭式解,必须在计算机上用数值算法最大化(如 Newton–Raphson;probit/logit 对数似然是凹的,数值优化可靠——补充说明)。在一般条件下,MLE 一致且大样本下抽样分布为正态。

Logit 模型的 MLE:推导同 probit,只是条件成功概率 \(p_i\) 由 (11.9) 给出:将 (11.17) 中的 \(\Phi(\cdot)\) 换为 \([1+e^{-(\beta_0+\beta_1X_{1i}+\cdots+\beta_kX_{ki})}]^{-1}\)。同样无闭式解,须数值最大化。

伪 \(R^2\):比较估计模型的似然值与不含任何 \(X\) 时的似然值。probit 的伪 \(R^2\) 为

\[\text{pseudo-}R^2=1-\frac{\ln(f^{max}_{probit})}{\ln(f^{max}_{Bernoulli})},\tag{11.18}\]

\(f^{max}_{probit}\) 为含 \(X\) 的最大化 probit 似然值,\(f^{max}_{Bernoulli}\) 为最大化伯努利似然值(不含任何 \(X\) 的 probit)。(即 McFadden 伪 \(R^2\);因似然值在 0–1 之间,对数为负,比值在 0–1 之间。)

预测概率的标准误:单回归元 probit 在固定值 \(x\) 处的预测概率 \(\hat p(x)=\Phi(\hat\beta_0^{MLE}+\hat\beta_1^{MLE}x)\) 依赖于有抽样分布的估计量,所以本身也有抽样分布。用线性函数近似(一阶泰勒展开,即 delta 方法):

\[\hat p(x)=\Phi(\hat\beta_0^{MLE}+\hat\beta_1^{MLE}x)\cong c+a_0(\hat\beta_0^{MLE}-\beta_0)+a_1(\hat\beta_1^{MLE}-\beta_1),\tag{11.19}\]

其中 \(c=\Phi(\beta_0+\beta_1x)\),\(a_0=\partial\Phi(\beta_0+\beta_1x)/\partial\beta_0\)、\(a_1=\partial\Phi(\beta_0+\beta_1x)/\partial\beta_1\) 在 \(\hat\beta^{MLE}\) 处取值(即 \(a_0=\phi(\cdot)\),\(a_1=\phi(\cdot)x\),\(\phi\) 为标准正态密度)。由两随机变量和的方差公式 (2.32):

\[\mathrm{var}[\hat p(x)]\cong a_0^2\mathrm{var}(\hat\beta_0^{MLE})+a_1^2\mathrm{var}(\hat\beta_1^{MLE})+2a_0a_1\mathrm{cov}(\hat\beta_0^{MLE},\hat\beta_1^{MLE}).\tag{11.20}\]

用 MLE 方差、协方差的估计值即可计算 \(\hat p(x)\) 的标准误。

附录 11.3 其他受限因变量模型(PDF p.424–426)

多数情况下受限因变量模型参数的 OLS 估计量不一致,通常用最大似然估计。进阶参考:Greene (2018)、Ruud (2000)、Wooldridge (2010)。

  • 截尾与断尾回归模型(censored and truncated regression):个人购车支出截面数据中,购车者支出为正(可视为连续),未购车者支出为 $0,分布是 0 处离散加连续的混合。诺奖得主 James Tobin (1958) 提出:第 \(i\) 个人有一个与回归元(如家庭规模)线性相关的意愿支出 \(Y_i^*\):
    \[Y_i^*=\beta_0+\beta_1X_i+u_i,\quad i=1,\dots,n.\tag{11.21}\]
    若 \(Y_i^*\) 超过某个临界值(如汽车最低价格),消费者买车,观测到 \(Y_i=Y_i^*\);否则观测到 \(Y_i=0\) 而非 \(Y_i^*\)。用观测支出 \(Y_i\) 代替 \(Y_i^*\) 估计 (11.21),OLS 不一致。Tobin 在 \(u_i\) 正态的额外假设下推导出似然函数,其 MLE 被广泛使用。为纪念 Tobin,(11.21) 加正态误差假设称为 tobit 回归模型,它是截尾(censored)回归模型的一例——因变量在某临界值之上或之下被“截尾”。
  • 样本选择模型(sample selection models):截尾模型中买者和非买者都有数据(如对成年人简单随机抽样);若数据来自销售税记录,就只有买者,非买者完全无数据。在因变量高于或低于某阈值时观测不可得的数据称为断尾数据(truncated data),相应模型为断尾回归模型。它是样本选择模型的一例:选择机制(因买车而进入样本)与因变量(购车支出)相关。如 11.5 节专栏所述,一种估计方法是建立两个方程——一个是 \(Y_i^*\) 的方程,一个是 \(Y_i^*\) 是否被观测的方程——然后用最大似然估计,或分步先估计选择方程再估计 \(Y_i^*\) 方程(Heckman 两步法)。参见 Ruud (2000, 第 28 章)、Greene (2018, 第 19 章)、Wooldridge (2010, 第 17 章)。
  • 计数数据(count data):因变量为计数(如消费者一周在餐馆吃饭次数)。数字大时可近似视为连续;数字小时连续近似很差。OLS 线性回归可用于计数数据(即使计数小),预测值解释为给定回归元时因变量的期望(预测值 1.7 意味着平均每周 1.7 次)。但与二元回归类似,OLS 没有利用计数数据的特殊结构,可能给出荒谬预测(如每周 −0.2 次)。就像 probit/logit 消除二元因变量的荒谬预测,专门模型可处理计数数据,最常用的是泊松回归(Poisson regression)和负二项回归(negative binomial regression)。
  • 有序响应(ordered responses):互斥的定性类别有自然顺序(如获得高中文凭、上过大学但未毕业、大学毕业)。与计数数据一样有自然顺序,但没有自然的数值,因此 OLS 不合适。常用 probit 的推广——有序 probit 模型(ordered probit):给定自变量(如父母收入),每种结果(如大学学历)的概率用累积正态分布建模。
  • 离散选择数据(discrete choice data):离散选择或多项选择变量可取多个无序的定性值。例:通勤者的交通方式——地铁、公交、开车、自身动力(步行、骑车),四种结果无自然顺序。计量任务是给定个人特征(家离地铁站多远)和各选项特征(地铁票价)对选择各选项的概率建模。如 11.5 节专栏所述,离散选择模型可从效用最大化原理推导,个人选择概率可写成 probit 或 logit 形式,称为**多项 probit(multinomial probit)和多项 logit(multinomial logit)**回归模型。

第 11 章 本章要点

  1. 二元因变量的回归函数 \(E(Y|X)=\Pr(Y=1|X)\),预测值是概率,效应是概率变化。
  2. 线性概率模型:OLS 估计、系数即概率变化、易解释;误差必然异方差,须用稳健标准误;缺陷是预测概率可能越出 [0,1],且边际效应恒定。
  3. Probit \(\Pr=\Phi(X\beta)\)、Logit \(\Pr=1/(1+e^{-X\beta})\):保证概率在 0–1 之间,边际效应依赖 \(X\) 的取值;系数本身只看符号和显著性,经济含义须通过“在特定 \(X\) 处计算预测概率差”得到(常用样本均值处的“平均申请者”)。
  4. 系数对参数非线性,用 MLE 估计(NLLS 一致但无效);MLE 一致、渐近正态、有效,推断照常;注意软件的联合检验报告的是 \(F\) 还是 \(\chi^2=qF\)。
  5. 拟合度量:正确预测比例(50% 阈值)、伪 \(R^2\)(似然比);\(R^2\) 不适用。
  6. 三种模型在 HMDA 数据上结论一致:控制信贷员可合法考虑的因素后,黑人被拒概率高 6–8.4 个百分点(约为白人的两倍);遗漏变量(面谈中的非记录信息)和外部有效性仍有争议。
  7. 其他受限因变量:tobit(截尾)、断尾/样本选择(Heckman)、计数(泊松/负二项)、有序 probit、多项 logit/probit。

第 11 章 与量化交易的关联

  • 方向预测与分类信号:预测“明日涨/跌”“是否跑赢基准”“是否发生事件”本质是二元因变量问题。Logistic 回归是量化中最基础的分类器:输出概率可直接作为信号强度或仓位权重,比线性概率模型更合理(概率不越界)。本章“边际效应依赖于起点”的结论提醒:因子对上涨概率的影响在概率中段最大、在两端饱和。
  • 信用风险与违约预测:本章 HMDA 案例就是信用审批模型。违约概率(PD)模型(如 Altman Z-score 的 logit 版本 Ohlson O-score、信用评分卡)几乎都是 logit/probit;债券/可转债策略中的违约风险因子、ST/退市风险预测都直接使用这一框架。“正确预测比例”在不平衡样本(违约率很低)中会误导,量化实务更常用 AUC、对数损失(即负对数似然)——与伪 \(R^2\) 同源。
  • 事件驱动:并购目标预测、指数成分调整预测、分析师评级上调预测、盈利超预期预测等都是 probit/logit 应用;有序 probit 可用于评级(AAA…D)变动建模,多项 logit 可用于“买入/持有/卖出”三分类。
  • 执行与微观结构:限价单是否成交、订单是否被撤销的概率建模(成交概率模型)常用 logit;计数模型(泊松)可描述单位时间内的成交笔数或订单到达数。
  • 样本选择:Heckman 模型对应量化中的选择偏差问题——只观测到成交的订单、只观测到发行成功的 IPO、只观测到存续的基金等。
  • 实现层面:MLE 无闭式解需数值优化(牛顿法/IRLS),预测概率的标准误用 delta 方法——这些在构建自研统计库时会直接用到。

第 11 章 推荐习题

  • 11.8:线性概率模型误差的异方差推导及似然函数——理解为何必须用稳健标准误。
  • 11.6、11.7:用 probit 与 logit 计算预测概率及边际效应,并体会边际效应依赖于起点和种族。
  • 11.1–11.5:同一数据在 probit/logit/LPM 下的比较,特别是 11.1(d) 样本外外推、11.4 单一二元回归元时三模型预测相同、11.5 交互项。
  • 11.10:多项分布的 MLE 推导,巩固最大似然。
  • 复习 11.2:理解 logit 与 probit 系数尺度差异而边际效应一致。
  • E11.1:完整的二元因变量实证流程(LPM/probit/logit 比较 + 遗漏变量检查)。

第 12 章 工具变量回归(Instrumental Variables Regression)

章首导言(PDF p.427)

第 9 章讨论了使误差项与回归元相关的若干问题:遗漏变量、变量误差、联立因果。遗漏变量偏误可通过把遗漏变量纳入多元回归直接解决,但前提是有其数据;而有时(如 \(X\to Y\) 与 \(Y\to X\) 同时存在的联立因果)多元回归根本无法消除偏误。直接解法不可行时,需要新方法。

工具变量(instrumental variables, IV)回归是在回归元 \(X\) 与误差项 \(u\) 相关时获得未知因果系数一致估计量的一般方法。理解方式:把 \(X\) 的变动分成两部分——一部分(不论什么原因)与 \(u\) 相关(这是问题所在),另一部分与 \(u\) 不相关。若能分离出后者,就可只利用与 \(u\) 不相关的 \(X\) 变动而舍弃使 OLS 有偏的变动。IV 回归正是这样做的:关于 \(X\) 中与 \(u\) 不相关变动的信息来自一个或多个额外变量,称为工具变量或工具(instruments),它们作为“工具”分离出 \(X\) 中与 \(u\) 不相关的变动,从而一致估计回归系数。

章节安排:12.1–12.2 IV 回归的机制与假设:为何有效、什么是有效工具、如何实施和解释最常用的 IV 方法——两阶段最小二乘(two stage least squares, TSLS);12.3 如何评估工具是否有效(成功的关键);12.4 用 IV 估计香烟需求弹性;12.5 有效工具从哪里来。

12.1 单回归元单工具的 IV 估计量(The IV Estimator with a Single Regressor and a Single Instrument)(PDF p.428–437)

若 \(X\) 与 \(u\) 相关,OLS 不一致(式 6.1),即使样本很大也可能远离真实因果系数。如 9.2 节,这种相关可能源于遗漏变量、变量误差(回归元测量误差)、联立因果。不论来源如何,若有有效工具变量 \(Z\),就可用 IV 估计量估计 \(X\) 变化一单位对 \(Y\) 的效应。

IV 模型与假设

设 \(\beta_1\) 为 \(X\) 对 \(Y\) 的因果效应,无控制变量时模型为

\[Y_i=\beta_0+\beta_1X_i+u_i,\quad i=1,\dots,n,\tag{12.1}\]

\(u_i\) 代表决定 \(Y_i\) 的遗漏因素。\(X_i\) 与 \(u_i\) 相关时 OLS 不一致;IV 估计用额外的工具变量 \(Z\) 分离出 \(X\) 中与 \(u\) 不相关的部分。

内生与外生(endogeneity and exogeneity):与误差项相关的变量称为内生变量(endogenous variables),不相关的称为外生变量(exogenous variables)。术语源于多方程模型:“内生”变量在模型内部决定,“外生”变量在模型外部决定。如 9.2 节:若政治干预与增加拨款使低成绩导致 STR 降低,则因果双向,用联立方程 (9.3)(9.4) 表示;成绩和 STR 都在模型内决定,都与总体误差 \(u\) 相关,即都是内生的;而在模型外决定的外生变量与 \(u\) 不相关。

有效工具的两个条件:

  1. 工具相关性(instrument relevance):\(\mathrm{corr}(Z_i,X_i)\ne0\);
  2. 工具外生性(instrument exogeneity):\(\mathrm{corr}(Z_i,u_i)=0\)。

若工具相关,则工具的变动与 \(X_i\) 的变动相关;若同时外生,则工具捕获的那部分 \(X_i\) 变动是外生的。因此相关且外生的工具能捕获 \(X_i\) 的外生变动,这些外生变动可用于估计总体系数 \(\beta_1\)。这两个条件对 IV 回归至关重要,本章反复回到它们(及其对多回归元多工具的推广)。

两阶段最小二乘估计量(The Two Stage Least Squares Estimator)

若 \(Z\) 满足相关性与外生性,可用 TSLS 估计 \(\beta_1\)。顾名思义分两阶段:第一阶段把 \(X\) 分解为两部分——可能与回归误差相关的“问题”成分和与误差不相关的“无问题”成分;第二阶段用无问题成分估计 \(\beta_1\)。

第一阶段从联系 \(X\) 与 \(Z\) 的总体回归开始:

\[X_i=\pi_0+\pi_1Z_i+v_i,\tag{12.2}\]

\(\pi_0\) 为截距,\(\pi_1\) 为斜率,\(v_i\) 为误差。这给出了所需分解:一部分是 \(\pi_0+\pi_1Z_i\),即 \(X_i\) 中可被 \(Z_i\) 预测的部分,由于 \(Z_i\) 外生,这部分与 (12.1) 的误差 \(u_i\) 不相关;另一部分是 \(v_i\),即与 \(u_i\) 相关的问题成分。

TSLS 的思路是使用无问题成分 \(\pi_0+\pi_1Z_i\)、舍弃 \(v_i\)。唯一的麻烦是 \(\pi_0,\pi_1\) 未知,因此第一阶段对 (12.2) 作 OLS,用预测值 \(\hat X_i=\hat\pi_0+\hat\pi_1Z_i\)。第二阶段:用 OLS 将 \(Y_i\) 对 \(\hat X_i\) 回归,得到的估计量即 TSLS 估计量 \(\hat\beta_0^{TSLS}\)、\(\hat\beta_1^{TSLS}\)。

为什么 IV 回归有效?

专栏:IV 回归是何时发明的?(p.430):IV 回归最早作为计量经济学中联立因果问题的解法,出现在 Philip G. Wright 1928 年著作 The Tariff on Animal and Vegetable Oils 的附录中。该书前 285 页讲 20 世纪初动植物油的生产、运输和销售;计量经济学家更感兴趣的是附录 B:给出“引入外部因素的方法”(即今天的 IV 估计量)的两种推导,并用 IV 回归估计黄油和亚麻籽油的供给与需求弹性。Philip 是位默默无闻的经济学家,除该附录外几乎没有学术遗产;他的儿子 Sewall Wright 成为杰出的群体遗传学家和统计学家;IV 回归的发明被发现是父子共同的智力合作(Stock & Trebbi 2003)。类似 IV 的原理可追溯到 19 世纪中叶伦敦 John Snow 对霍乱暴发源头的识别:Snow 想研究霍乱是否经水传播,但知道接触不洁水与霍乱流行之间的关联不能确证因果,因为接触不洁水的家庭往往也接触许多其他环境因素(遗漏变量)。他发现伦敦两家主要供水公司从泰晤士河不同河段取水:Lambeth 公司在污水排放口上游取水,Southwark and Vauxhall 公司在下游取水(水更脏)。Snow 认为两家公司服务的家庭除水质外相似,这相当于以接触不洁水为内生变量、以供水公司为工具变量的 IV 方法:供水公司因取水点相对排污口的位置而与接触不洁水相关(相关性);它对霍乱没有可信的直接影响,且与其他可能致病的家庭因素不相关(外生性)。Snow 因此被视为流行病学之父之一。详见 Deaton (1997)、Grootendorst (2007)、Greene (2003) 及 Snow (1855)。

例 1:Philip Wright 的问题(p.431–432)。Wright 关心的是当时的重要经济问题:如何对动植物油脂(如黄油、豆油)设定进口关税——20 年代进口关税是美国主要税收来源。理解关税经济效应的关键是对商品需求和供给曲线的定量估计,即供给弹性(价格上升 1% 时供给量变化的百分比)与需求弹性(价格上升 1% 时需求量变化的百分比)。

以黄油需求弹性为例:由 Key Concept 8.2,\(\ln(Y_i)\) 对 \(\ln(X_i)\) 的线性方程系数即弹性,故需求方程为

\[\ln(Q_i^{butter})=\beta_0+\beta_1\ln(P_i^{butter})+u_i,\tag{12.3}\]

\(Q_i^{butter}\) 为黄油消费量,\(P_i^{butter}\) 为价格,\(u_i\) 代表收入、偏好等影响需求的其他因素;\(\beta_1\) 为需求弹性。Wright 有美国 1912–1922 年黄油年度总消费量和年均价格数据;直接对 (12.3) 用 OLS 很容易,但他有一个关键洞见:由于供需相互作用,回归元 \(\ln(P_i^{butter})\) 很可能与误差项相关。

图 12.1 解释:(a) 三个时期的市场需求与供给曲线,每期均衡价格和数量由当期供需曲线交点决定——第 2 年需求从 \(D_1\) 增至 \(D_2\)(如收入增加),供给从 \(S_1\) 减至 \(S_2\)(生产成本上升);第 3 年需求再增至 \(D_3\)、供给增至 \(S_3\)。(b) 11 个时期的均衡价格–数量对,供需曲线都受价格以外因素的冲击而移动——这就像 Wright 作图时看到的散点;用 OLS 拟合这些点既估计不出需求曲线,也估计不出供给曲线,因为这些点是由供需共同变化决定的。(c) Wright 意识到的解法:找到移动供给但不移动需求的第三个变量。若此变量只移动供给曲线(\(S_1\to S_2\to S_3\))而需求保持在 \(D_1\),所有均衡点就落在稳定的需求曲线上,“描出”需求曲线,其斜率很容易估计。在 IV 表述中,这个第三变量与价格相关(移动供给曲线导致价格变化)但与 \(u\) 不相关(需求曲线稳定)。Wright 考虑了若干候选工具,其一是天气:奶业产区降雨低于平均会损害放牧,在给定价格下减少黄油产量(供给曲线左移、均衡价格上升),满足相关性;而奶业区降雨不应直接影响黄油需求,与 \(u_i\) 的相关为 0,满足外生性。

例 2:估计班级规模对成绩的效应(p.432–434)。即使控制学生和学区特征,第 II 部分的班级规模效应估计仍可能因校外学习机会、教师质量等未度量变量而有遗漏变量偏误;若无这些变量或合适控制变量的数据,无法通过纳入它们解决。IV 提供另一种途径。假想例子:夏季地震迫使部分加州学校关闭维修,离震中越近的学区受影响越严重;有学校关闭的学区需要“合并”学生,暂时扩大班级规模。于是到震中的距离与班级规模相关,满足相关性;若它与影响学生表现的其他因素(如是否仍在学英语、地震对学生表现的干扰)无关,则与误差项不相关,满足外生性。因此“到震中的距离”可用于绕开遗漏变量偏误估计班级规模效应。

TSLS 估计量的抽样分布(p.434–435)

小样本中 TSLS 的精确分布很复杂;但与 OLS 一样,其大样本分布简单:一致且正态。

TSLS 估计量公式:单一 \(X\)、单一工具 \(Z\) 时有简单公式。设 \(s_{ZY}\) 为 \(Z\) 与 \(Y\) 的样本协方差,\(s_{ZX}\) 为 \(Z\) 与 \(X\) 的样本协方差,则(附录 12.2)

\[\hat\beta_1^{TSLS}=\frac{s_{ZY}}{s_{ZX}}.\tag{12.4}\]

一致性:由 (12.1) 及协方差性质 (2.34):

\[\mathrm{cov}(Z_i,Y_i)=\mathrm{cov}(Z_i,\beta_0+\beta_1X_i+u_i)=\beta_1\mathrm{cov}(Z_i,X_i)+\mathrm{cov}(Z_i,u_i).\tag{12.5}\]

外生性使 \(\mathrm{cov}(Z_i,u_i)=0\),相关性使 \(\mathrm{cov}(Z_i,X_i)\ne0\),故若工具有效,

\[\beta_1=\frac{\mathrm{cov}(Z_i,Y_i)}{\mathrm{cov}(Z_i,X_i)}.\tag{12.6}\]

即总体系数等于 \(Z\)–\(Y\) 总体协方差与 \(Z\)–\(X\) 总体协方差之比。样本协方差是总体协方差的一致估计量(3.7 节),\(s_{ZY}\xrightarrow{p}\mathrm{cov}(Z_i,Y_i)\),\(s_{ZX}\xrightarrow{p}\mathrm{cov}(Z_i,X_i)\),所以

\[\hat\beta_1^{TSLS}=\frac{s_{ZY}}{s_{ZX}}\xrightarrow{p}\frac{\mathrm{cov}(Z_i,Y_i)}{\mathrm{cov}(Z_i,X_i)}=\beta_1.\tag{12.7}\]

大样本正态性:与其他最小二乘估计量理由相同——TSLS 是随机变量的平均,大样本时中心极限定理保证正态。分子 \(s_{ZY}=\frac1{n-1}\sum(Z_i-\bar Z)(Y_i-\bar Y)\) 是 \((Z_i-\bar Z)(Y_i-\bar Y)\) 的平均。附录 12.3 的代数表明,大样本下 \(\hat\beta_1^{TSLS}\) 近似服从 \(N(\beta_1,\sigma^2_{\hat\beta_1^{TSLS}})\):

\[\sigma^2_{\hat\beta_1^{TSLS}}=\frac1n\frac{\mathrm{var}[(Z_i-\mu_Z)u_i]}{[\mathrm{cov}(Z_i,X_i)]^2}.\tag{12.8}\]

(直观:分母是 \(Z\) 与 \(X\) 协方差的平方——工具越相关,方差越小。)

用大样本分布推断:估计 (12.8) 中的方差与协方差项,平方根即 IV 估计量的标准误(计量软件的 TSLS 命令自动完成)。由于大样本正态,可用 t 统计量检验关于 \(\beta_1\) 的假设,95% 大样本置信区间为 \(\hat\beta_1^{TSLS}\pm1.96\,SE(\hat\beta_1^{TSLS})\)。

应用:香烟需求(p.435–437)

Wright 关心黄油需求弹性,但其思路可用于其他重要量,如“死亡率的支出弹性”(医疗支出增加 1% 时可避免死亡率变化的百分比,研究者也用 IV 克服联立方程偏误为卫生政策辩论提供依据),以及香烟等在今天公共政策中更突出的商品。(抽取文本在此处缺失了提出问题的一句,结合上下文与原书:问题是若要通过加税使香烟消费减少 20%,价格需要上涨多少。)答案取决于香烟需求弹性:若弹性为 −1,价格上涨 20% 可实现消费减少 20%;若弹性为 −0.5,价格须上涨 40%。弹性未知,须从价格和销量数据估计;但与黄油一样,由于供需相互作用,对数数量对对数价格的 OLS 回归无法一致估计需求弹性。

数据:美国本土 48 州 1985–1995 年年度数据(附录 12.1);本节只用 1995 年截面,早期年份(面板)结果见 12.4 节。工具变量 \(SalesTax_i\):香烟税中来自一般销售税的部分,每包美元(实际值,用 CPI 平减);\(Q_i^{cigarettes}\) 为州人均销售包数;\(P_i^{cigarettes}\) 为含全部税的每包平均实际价格。

工具有效性的初步判断(12.3 节有统计工具,但判断很重要):

  • 相关性:高销售税提高税后售价,销售税每包金额合理地满足相关性。
  • 外生性:销售税须与需求方程误差不相关,即只通过价格间接影响香烟需求。这看似合理:各州一般销售税率不同,主要因为各州为公共事业融资选择的销售税、所得税、财产税等组合不同,这些选择由政治考虑驱动,与香烟需求因素无关。(12.4 节进一步讨论,目前作为工作假设。)

第一阶段(现代软件自动估计,但值得查看):

\[\widehat{\ln(P_i^{cigarettes})}=\underset{(0.03)}{4.62}+\underset{(0.005)}{0.031}\,SalesTax_i.\tag{12.9}\]

如预期,销售税越高税后价格越高;\(R^2=47\%\),即销售税变动解释了各州香烟价格方差的 47%。

第二阶段:\(\ln(Q_i^{cigarettes})\) 对第一阶段预测值 \(\widehat{\ln(P_i^{cigarettes})}\) 作 OLS:

\[\widehat{\ln(Q_i^{cigarettes})}=9.72-1.08\,\widehat{\ln(P_i^{cigarettes})}.\tag{12.10}\]

按惯例,报告时直接写成以 \(\ln(P_i^{cigarettes})\) 为回归元的形式,并给出 TSLS 估计值与异方差稳健标准误:

\[\widehat{\ln(Q_i^{cigarettes})}=\underset{(1.53)}{9.72}-\underset{(0.32)}{1.08}\ln(P_i^{cigarettes}).\tag{12.11}\]

TSLS 估计显示,考虑到香烟的成瘾性,其需求出人意料地有弹性:价格上涨 1% 使消费减少 1.08%。但回顾外生性讨论,此估计暂不宜太当真:即使用了工具变量,仍可能有与每包销售税相关的遗漏变量。首要候选是收入:高收入州可能较少依赖销售税而更多依赖所得税为州政府融资;而香烟需求大概取决于收入。因此希望把收入作为控制变量重新估计——为此须把 IV 模型扩展到包含额外回归元。

12.2 一般 IV 回归模型(The General IV Regression Model)(PDF p.437–444)

一般 IV 回归模型有四类变量:因变量 \(Y\);与误差相关的有问题的内生回归元(如香烟价格),记为 \(X\);额外回归元 \(W\),或为控制变量,或为被包含的外生变量(included exogenous variables);工具变量 \(Z\)。一般可有多个内生回归元、多个额外回归元、多个工具变量。

识别:IV 回归要求工具变量个数至少等于内生回归元个数(12.1 节若无工具则无第一阶段,无法计算 IV 估计量)。设工具个数为 \(m\),内生回归元个数为 \(k\):\(m=k\) 称恰好识别(exactly identified);\(m>k\) 称过度识别(overidentified);\(m<k\) 称识别不足(underidentified)。要用 IV 回归估计,系数必须恰好识别或过度识别。

Key Concept 12.1(一般工具变量回归模型及术语):

\[Y_i=\beta_0+\beta_1X_{1i}+\cdots+\beta_kX_{ki}+\beta_{k+1}W_{1i}+\cdots+\beta_{k+r}W_{ri}+u_i,\quad i=1,\dots,n,\tag{12.12}\]

其中 \(Y_i\) 为因变量;\(\beta_0,\dots,\beta_{k+r}\) 为未知系数;\(X_{1i},\dots,X_{ki}\) 为 \(k\) 个内生回归元,可能与 \(u_i\) 相关;\(W_{1i},\dots,W_{ri}\) 为 \(r\) 个被包含的外生回归元,与 \(u_i\) 不相关或为控制变量;\(u_i\) 为误差项,代表测量误差和/或遗漏因素;\(Z_{1i},\dots,Z_{mi}\) 为 \(m\) 个工具变量。\(m>k\) 过度识别,\(m<k\) 识别不足,\(m=k\) 恰好识别;估计 IV 模型需要恰好识别或过度识别。

IV 回归中被包含的外生变量与控制变量:\(W\) 可以是外生变量(\(E(u_i|W_i)=0\)),也可以是不必有因果解释、只为确保工具与误差不相关而纳入的控制变量。如 12.1 节:销售税可能与收入相关,而收入是香烟需求的决定因素;若如此,销售税与需求方程 \(\ln(Q_i)=\beta_0+\beta_1\ln(P_i)+u_i\) 的误差相关,就不是外生工具。把收入或控制收入的变量纳入 IV 回归,可消除工具与误差之间的这一相关来源。一般地,若 \(W\) 是 IV 回归中有效的控制变量,纳入 \(W\) 使工具与 \(u\) 不相关,\(X\) 系数的 TSLS 估计一致;但若 \(W\) 与 \(u\) 相关,则 \(W\) 的 TSLS 系数有遗漏变量偏误、无因果解释。IV 中控制变量的逻辑与 7.5 节 OLS 中控制变量的逻辑平行。数学条件:纳入 \(W\) 须保证 \(u\) 的条件均值不依赖于 \(Z\),即条件均值独立 \(E(u_i|Z_i,W_i)=E(u_i|W_i)\)。本章正文为清晰起见聚焦 \(W\) 外生(\(E(u_i|W_i)=0\))的情形;附录 12.6 说明 \(W\) 为控制变量时如何推广(用条件均值独立替代条件均值为零)。

一般 IV 模型中的 TSLS

单内生回归元:目标方程

\[Y_i=\beta_0+\beta_1X_i+\beta_2W_{1i}+\cdots+\beta_{1+r}W_{ri}+u_i,\tag{12.13}\]

\(X_i\) 可能与误差相关,\(W\) 不相关。TSLS 的总体第一阶段回归把 \(X\) 对所有外生变量——\(W\) 和工具 \(Z\)——回归:

\[X_i=\pi_0+\pi_1Z_{1i}+\cdots+\pi_mZ_{mi}+\pi_{m+1}W_{1i}+\cdots+\pi_{m+r}W_{ri}+v_i.\tag{12.14}\]

(12.14) 有时称为 \(X\) 的约简式方程(reduced form equation),它把内生变量 \(X\) 与所有可用外生变量(目标方程中包含的 \(W\) 与工具 \(Z\))联系起来。第一阶段用 OLS 估计 (12.14) 得预测值 \(\hat X_1,\dots,\hat X_n\);第二阶段将 \(Y_i\) 对 \(\hat X_i,W_{1i},\dots,W_{ri}\) 作 OLS,所得 \(\beta_0,\dots,\beta_{1+r}\) 的估计量即 TSLS 估计量。注意第一阶段必须包含全部 \(W\)(否则第二阶段会产生不一致——补充说明)。

多内生回归元:每个内生回归元需要自己的第一阶段回归,每个都形如 (12.14):因变量是某个 \(X\),回归元是全部工具和全部被包含外生变量;第二阶段将 (12.12) 中的各 \(X\) 替换为各自预测值 \(\hat X\) 后作 OLS。实践中两阶段由计量软件的 TSLS 命令自动完成。

Key Concept 12.2(两阶段最小二乘):一般 IV 模型 (12.12) 中多工具时的 TSLS 估计量分两阶段计算:

  1. 第一阶段回归:将 \(X_{1i}\) 对工具变量 \((Z_{1i},\dots,Z_{mi})\) 和被包含的外生变量和/或控制变量 \((W_{1i},\dots,W_{ri})\) 作含截距的 OLS,计算预测值 \(\hat X_{1i}\);对所有内生回归元 \(X_{2i},\dots,X_{ki}\) 重复,得到 \(\hat X_{1i},\dots,\hat X_{ki}\)。
  2. 第二阶段回归:将 \(Y_i\) 对内生变量预测值 \((\hat X_{1i},\dots,\hat X_{ki})\) 和被包含外生/控制变量 \((W_{1i},\dots,W_{ri})\) 作含截距的 OLS,得到 TSLS 估计量 \(\hat\beta_0^{TSLS},\dots,\hat\beta_{k+r}^{TSLS}\)。 实践中两阶段在软件中自动完成。

一般 IV 模型中的工具相关性与外生性

单个内生变量多个工具时,相关性条件是:给定 \(W\) 时至少一个 \(Z\) 对预测 \(X\) 有用。多个内生变量时条件更复杂,因为必须排除第二阶段总体回归中的完全多重共线性;直观上,工具必须提供足够多关于这些内生变量外生变动的信息,才能区分它们各自对 \(Y\) 的效应。外生性的一般表述:每个工具都必须与误差项 \(u_i\) 不相关。

Key Concept 12.3(有效工具的两个条件):\(m\) 个工具 \(Z_{1i},\dots,Z_{mi}\) 有效须满足:

  1. 工具相关性:一般地,令 \(\hat X^*_{1i}\) 为 \(X_{1i}\) 对工具(\(Z\))和被包含外生回归元(\(W\))的总体回归预测值,“1”为常数回归元,则 \((\hat X^*_{1i},\dots,\hat X^*_{ki},W_{1i},\dots,W_{ri},1)\) 不完全多重共线。若只有一个 \(X\),上述条件要求在 \(X\) 对 \(Z\) 和 \(W\) 的总体回归中至少一个 \(Z\) 的系数非零。
  2. 工具外生性:工具与误差项不相关:\(\mathrm{corr}(Z_{1i},u_i)=0,\dots,\mathrm{corr}(Z_{mi},u_i)=0\)。

IV 回归假设与 TSLS 估计量的抽样分布

在 IV 回归假设下,TSLS 一致,大样本下抽样分布近似正态。IV 回归假设是对 Key Concept 6.4 因果推断最小二乘假设的修改:第一条把条件均值假设改为只对被包含的外生变量成立;第二条为 i.i.d. 抽取(简单随机抽样即满足);第三条为不太可能有大的离群值;第四条为 Key Concept 12.3 两个工具有效性条件成立——其中相关性条件通过假设第二阶段回归元不完全多重共线,涵盖了 Key Concept 6.4、6.6 中第四条最小二乘假设(无完全多重共线性)。

Key Concept 12.4(IV 回归假设):Key Concept 12.1 中 IV 模型的变量与误差满足:

  1. \(E(u_i|W_{1i},\dots,W_{ri})=0\);
  2. \((X_{1i},\dots,X_{ki},W_{1i},\dots,W_{ri},Z_{1i},\dots,Z_{mi},Y_i)\) 是来自其联合分布的 i.i.d. 抽取;
  3. 不太可能有大的离群值:\(X\)、\(W\)、\(Z\) 和 \(Y\) 有非零有限四阶矩;
  4. Key Concept 12.3 的两个有效工具条件成立。

TSLS 的抽样分布:在 IV 假设下 TSLS 一致且大样本正态。12.1 节及附录 12.3 对单内生回归元、单工具、无外生变量的特例给出了证明;概念上推理可推广到多工具多内生变量的一般情形,但表达式复杂,留待第 19 章。

用 TSLS 估计量推断

TSLS 大样本正态,回归模型的一般推断程序可推广:95% 置信区间 = TSLS 估计 ±1.96 个标准误;系数总体值的联合假设可用 7.2 节的 F 统计量检验。

TSLS 标准误计算的两点注意:

  1. 第二阶段 OLS 报告的标准误是错误的,因为它没有认识到这是两阶段过程的第二阶段——具体地,没有针对“第二阶段使用的是内生变量的预测值”进行调整(残差应使用 \(Y-\hat\beta X\) 而不是 \(Y-\hat\beta\hat X\)——补充说明)。做出必要调整的公式已内置于计量软件的 TSLS 命令中,所以使用专门的 TSLS 命令时这不是问题(不要手工两步 OLS 后直接用第二步的标准误)。
  2. 误差 \(u\) 可能异方差,因此与多元回归 OLS 一样,必须使用异方差稳健的标准误。

应用:香烟需求(续)(p.443–444)

12.1 节用 1995 年 48 州数据、单回归元(每包实际价格对数)和单工具(每包实际销售税)估计了需求弹性。但收入也影响需求,因而是总体回归误差项的一部分;若州销售税与州收入相关,它就与需求方程误差中的某个变量相关,违反外生性,12.1 节的 IV 估计量不一致——IV 回归也会遭遇某种遗漏变量偏误。解决办法是把收入纳入回归。

按 Key Concept 12.1 的术语:\(Y=\ln(Q_i^{cigarettes})\);内生回归元 \(X=\ln(P_i^{cigarettes})\)(实际税后价格对数);被包含外生变量 \(W=\ln(Inc_i)\)(州人均实际收入对数);工具 \(Z=SalesTax_i\)。TSLS 估计(异方差稳健标准误):

\[\widehat{\ln(Q_i^{cigarettes})}=\underset{(1.26)}{9.43}-\underset{(0.37)}{1.14}\ln(P_i^{cigarettes})+\underset{(0.31)}{0.21}\ln(Inc_i).\tag{12.15}\]

第二个工具:除一般销售税外,各州还对香烟及其他烟草产品征收专门税 \(CigTax_i\),它提高消费者支付的香烟价格,合理地满足相关性;若它与州需求方程误差不相关,就是外生工具。于是有两个工具(每包实际销售税、每包实际州香烟专门税),一个内生回归元:\(m=2>k=1\),需求弹性过度识别。用 TSLS 估计,第一阶段回归元为 \(\ln(Inc_i)\) 和两个工具:

\[\widehat{\ln(Q_i^{cigarettes})}=\underset{(0.96)}{9.89}-\underset{(0.25)}{1.28}\ln(P_i^{cigarettes})+\underset{(0.25)}{0.28}\ln(Inc_i).\tag{12.16}\]

比较:(12.16) 中价格弹性的标准误小了三分之一(0.25 vs 0.37),因为它利用了更多信息——两个工具比一个工具解释了更多的香烟价格变动,反映为更小的标准误。

这些估计可信吗?最终取决于这组工具(两种税)是否合理地满足有效工具的两个条件,因此必须评估工具的有效性——这是下一节的主题。

12.3 检验工具的有效性(Checking Instrument Validity)(PDF p.444–449)

IV 回归在具体应用中是否有用,取决于工具是否有效:无效工具产生无意义的结果。因此必须评估一组工具在特定应用中是否有效。

假设 1:工具相关性

相关性条件的作用很微妙。一种理解:它的作用类似于样本量——工具越相关(\(X\) 的变动被工具解释得越多),IV 回归可用的信息越多,估计量越精确,正如样本越大估计越精确。此外,TSLS 推断以 TSLS 估计量服从正态分布为前提,而按中心极限定理,正态近似在大样本中好、在小样本中不一定好;既然更相关的工具像更大的样本,那么(正确地)工具越相关,TSLS 估计量及其 t 统计量的正态近似越好。

弱工具(weak instruments):几乎不解释 \(X\) 变动的工具。香烟例中,州到卷烟厂的距离可能是弱工具:距离越远运费越高(供给曲线内移、均衡价格上升),但香烟很轻,运费只占价格的很小部分,所以运费(从而距离)解释的价格变动可能很小。以下讨论为何弱工具是问题、如何检查、如何应对;全程假设工具是外生的。

为何弱工具是问题:若工具弱,即使样本很大,正态分布也不能很好近似 TSLS 的抽样分布,因此即便在大样本中,通常的推断方法也没有理论依据。事实上,工具弱时 TSLS 估计量可能严重偏向 OLS 估计量;而且以 TSLS ±1.96 个标准误构造的 95% 置信区间包含真值的频率可能远低于 95%。简言之,工具弱时 TSLS 不再可靠。

说明:考虑单内生变量、单工具、无外生回归元的特例。若工具有效,因 \(s_{ZY}\)、\(s_{ZX}\) 一致,\(\hat\beta_1^{TSLS}=s_{ZY}/s_{ZX}\xrightarrow{p}\mathrm{cov}(Z,Y)/\mathrm{cov}(Z,X)=\beta_1\)(式 12.7)。但假设工具不仅弱而且完全不相关,\(\mathrm{cov}(Z_i,X_i)=0\),则 \(s_{ZX}\xrightarrow{p}0\),按字面极限的分母为 0!相关性条件失败时一致性论证崩溃。附录 12.4 表明,这导致即使样本很大 TSLS 也服从非正态分布:工具不相关时,\(\hat\beta_1^{TSLS}\) 的大样本分布不是正态随机变量的分布,而是两个正态随机变量之比的分布,且该比值分布的中心在 OLS 估计量的大样本值处。

完全不相关的工具在实践中也许遇不到,但这引出问题:工具要多相关,正态近似才在实践中足够好?一般 IV 模型中答案复杂;幸运的是对最常见的单内生回归元情形有简单的经验法则。

单内生回归元时检查弱工具:计算 TSLS 第一阶段回归中“工具系数全为 0”的 F 统计量。这个**第一阶段 F 统计量(first-stage F-statistic)**度量工具包含的信息量:信息越多,F 统计量期望值越大。简单经验法则:第一阶段 F 统计量超过 10 就不必担心弱工具(为何是 10 见附录 12.5)。

Key Concept 12.5(检查弱工具的经验法则):第一阶段 F 统计量是检验 TSLS 第一阶段中工具 \(Z_{1i},\dots,Z_{mi}\) 系数为 0 的 F 统计量。单内生回归元时,第一阶段 F 小于 10 表明工具弱,此时 TSLS 估计量有偏(即使在大样本中),TSLS 的 t 统计量和置信区间不可靠。

若有弱工具怎么办? 若有很多工具,其中一些可能比其他的弱;若有少数强工具和许多弱工具,最好丢掉最弱的,用最相关的子集做 TSLS。丢掉弱工具后 TSLS 标准误可能变大,但请记住原来的标准误本来就无意义!若系数恰好识别,就不能丢弃弱工具;即使过度识别,强工具也可能不足以识别,丢弃弱工具无济于事。此时两个选择:(1) 寻找额外的更强工具——说易行难,需要对问题的深入了解,可能要重新设计数据集和实证研究;(2) 继续使用弱工具,但用 TSLS 以外的方法——有些 IV 方法对弱工具不如 TSLS 敏感,部分见附录 12.5。

专栏:第一个 IV 回归(The First IV Regression)(p.447):Philip 与儿子 Sewall 推导出 IV 估计量后,Philip 着手检验其实际效果。在 1926 年 3 月 15 日致 Sewall 的信中,他列出美国 1903–1925 年亚麻籽生产相关变量的年度数据表(书中部分复制)。亚麻籽用于榨油(亚麻油,linseed oil),用于建筑物的油性漆。Philip 想估计供给弹性;为得到百分比–百分比关系,先把数据转为相对长期趋势的百分比偏离。关键决策是用什么工具:他选了东海岸建筑许可数——新建筑越多,对油性漆从而亚麻籽的需求越大,故相关;东海岸建筑许可的波动主要由更广泛的经济状况驱动,与当年亚麻籽供给的扰动无关,故外生。换言之,它是需求而非供给的决定因素。经过艰苦的手工计算,Philip 得到供给弹性的 IV 估计为 −0.88——符号错误(意味着供给曲线向下倾斜),他在信中称之“显然荒谬”。问题出在哪?Philip 不知道,他的 IV 回归第一阶段 F 统计量只有 1.75,远低于经验阈值 10。如正文和附录 12.4 所述,工具不相关时 IV 估计量分布的中心在 OLS 估计值处,在 Wright 数据中 OLS 估计为 −0.66——第一次 IV 回归的工具很弱,结果偏向 OLS。但 Philip 没有放弃:估计需求弹性时,他用亚麻籽产地上中西部的降雨作工具——雨多收成好,故相关;中西部降雨不影响油漆需求,故外生。降雨的第一阶段 F 为 12.8,得到需求弹性 IV 估计 −0.48:需求曲线向下倾斜(理应如此),且需求缺乏弹性,与当时油漆用亚麻油没有好的替代品相符。表注:前两列数据为亚麻籽实际价格和数量(产量);“B”类变量——种植面积、单产、上中西部降雨、当年亚麻籽单产与上年春小麦单产之比——移动供给不移动需求,是需求弹性的潜在工具;“A”类变量——东海岸建筑许可——移动需求不移动供给,是供给弹性的潜在工具。

假设 2:工具外生性

若工具不外生,TSLS 不一致:TSLS 估计量依概率收敛到某个不是因果系数的值。毕竟 IV 回归的思想是工具包含 \(X_i\) 中与 \(u_i\) 无关的变动信息;若工具不外生,就无法精确定位 \(X_i\) 的外生变动,IV 回归自然不能给出一致估计(数学见附录 12.4)。

能否统计检验工具外生性? 既能也不能。系数恰好识别时,不可能检验工具外生性的假设;若系数过度识别,则可以检验过度识别约束(overidentifying restrictions)——即在“有足够有效工具识别目标系数”的维持假设下,检验“多余”工具是否外生。

恰好识别(工具数等于内生回归元数)时,不可能构造检验工具是否外生的统计检验,经验证据无法用于判断这些工具是否满足外生性。此时评估外生性的唯一途径是借助专家意见和对实证问题的个人知识;例如 Wright 对农业供需的了解使他提出低于平均的降雨会移动油脂供给曲线而不直接移动需求曲线。评估外生性必然需要基于应用知识的专家判断;但若工具多于内生回归元,就有一个有帮助的统计工具:过度识别约束检验。

过度识别约束检验:设一个内生回归元、两个工具,可分别用每个工具计算两个 TSLS 估计量。由于抽样变异两者不会相同,但若两个工具都外生,它们应彼此接近;若两者差异很大,可合理地推断其中一个或两个工具有问题,即不外生。过度识别检验隐式地进行这一比较(不实际计算所有可能的 IV 估计):外生性意味着工具与 \(u_i\) 不相关,因此工具应与 TSLS 残差 \(\hat u_i^{TSLS}=Y_i-(\hat\beta_0^{TSLS}+\hat\beta_1^{TSLS}X_{1i}+\cdots+\hat\beta_{k+r}^{TSLS}W_{ri})\)(用全部工具估计)近似不相关(由于抽样变异只是近似)。注意这些残差用真实的 \(X\) 而不是第一阶段预测值构造。因此若工具确实外生,在 \(\hat u_i^{TSLS}\) 对工具和被包含外生变量的回归中,工具系数应全为 0,这一假设可以检验。

该统计量用仅同方差 F 统计量计算,常称 J 统计量,\(J=mF\)。大样本中,若工具不弱且误差同方差,在“工具外生”的原假设下,\(J\) 服从自由度为 \(m-k\) 的卡方分布 \(\chi^2_{m-k}\)。重要的是:虽然检验的约束有 \(m\) 个,但 J 的渐近分布自由度是 \(m-k\),因为只能检验过度识别约束,共 \(m-k\) 个。异方差误差下 J 统计量的修正见 19.7 节。

恰好识别(\(m=k\))时无法检验外生性的最简单理解:单内生变量(\(k=1\))、两个工具时可算两个 TSLS 估计量比较;只有一个工具时只能算一个,没有比较对象。事实上若 \(m=k\),过度识别检验统计量 \(J\) 恰好为 0。

Key Concept 12.6(过度识别约束检验 / J 统计量):令 \(\hat u_i^{TSLS}\) 为式 (12.12) 的 TSLS 残差,用 OLS 估计

\[\hat u_i^{TSLS}=\delta_0+\delta_1Z_{1i}+\cdots+\delta_mZ_{mi}+\delta_{m+1}W_{1i}+\cdots+\delta_{m+r}W_{ri}+e_i,\tag{12.17}\]

\(e_i\) 为回归误差。令 \(F\) 为检验 \(\delta_1=\cdots=\delta_m=0\) 的仅同方差 F 统计量,过度识别约束检验统计量 \(J=mF\)。在所有工具外生的原假设下,若 \(e_i\) 同方差,大样本中 \(J\sim\chi^2_{m-k}\),\(m-k\) 为过度识别程度(工具数减内生回归元数)。

12.4 应用:香烟需求(Application to the Demand for Cigarettes)(PDF p.450–454)

(本节假设读者熟悉 10.1、10.2 节 \(T=2\) 的面板数据。)

上次停在式 (12.16):收入为被包含的外生变量,两个工具为一般销售税和香烟专门税。现在更彻底地评估这些工具。如 12.1 节,两工具相关是合理的(税是香烟税后价格的重要部分,稍后作实证检验);先聚焦难题——两个税变量是否合理地外生。

评估外生性的第一步是思考其为何可能或不可能外生:哪些因素构成香烟需求方程的误差项,它们是否可能与工具相关?为何有的州人均香烟消费更高?一个原因是收入差异,但收入已在 (12.16) 中,不在误差项里。另一原因是影响需求的历史因素:例如种植烟草的州吸烟率高于多数其他州。这与税相关吗?很可能:若烟草种植和卷烟生产是某州重要产业,这些产业可能施加影响使香烟专门税保持低位。这表明香烟需求中的一个遗漏因素——该州是否种植烟草、生产卷烟——可能与香烟专门税相关。

一种解决办法是纳入该州烟草与卷烟产业规模的信息(如纳入收入那样)。但既然有香烟消费的面板数据,可以用不需要这些信息的方法:如第 10 章,面板数据能消除随实体(州)变化但不随时间变化的变量的影响,如导致某州烟草与卷烟产业庞大的历史环境。第 10 章给出两种方法:构造两期间变量的变化量,以及固定效应回归。为简单起见采用前者,即 10.2 节式的基于两年间变化量的回归。

时间跨度与弹性解释:两年之间的时间跨度影响弹性的解释。香烟成瘾,价格变化需要时间改变行为:起初价格上涨对需求影响可能很小;但随时间推移,涨价可能促使部分吸烟者想戒烟,并且重要的是可能阻止非吸烟者染上烟瘾。因此需求对涨价的反应可能短期小、长期大;即对成瘾品,需求可能短期缺乏弹性(短期弹性接近 0)、长期更有弹性。

本分析聚焦长期价格弹性,考察 10 年期的数量与价格变化:将 10 年对数数量变化 \(\ln(Q_{i,1995})-\ln(Q_{i,1985})\) 对 10 年对数价格变化 \(\ln(P_{i,1995})-\ln(P_{i,1985})\) 和 10 年对数收入变化 \(\ln(Inc_{i,1995})-\ln(Inc_{i,1985})\) 回归;两个工具为 10 年销售税变化 \(SalesTax_{i,1995}-SalesTax_{i,1985}\) 和 10 年香烟专门税变化 \(CigTax_{i,1995}-CigTax_{i,1985}\)。

专栏:吸烟的外部性(The Externalities of Smoking)(p.451):常说吸烟产生负外部性或成本,如医疗和清洁成本,由吸烟行为强加给第三方。西欧近年提出或实施在工作场所或公共场所全面禁烟(2007 年法国、英格兰,2008 年荷兰)。但经济学家常反对禁令,主张用税收纠正外部性,通常建议税收水平应使外部成本通过转嫁给吸烟者而降为零;可以用计量方法估计外部成本进而估计所需税收。但估计并不简单:英国政府估计 2015 年吸烟相关的国民医疗服务体系(NHS)成本为 26 亿英镑,但没有扣除本来就会发生的成本(若不吸烟,治疗其他疾病要花多少?是否遗漏其他收益和成本?吸烟者早逝,如何评估失去的生命年?吸烟带来的就业价值呢?)。脚注:数据来自 Public Health England 2017 年 7 月的临时统计出版物 “Cost of smoking to the NHS in England: 2015”。Ekpu & Brown (2015) 对现有证据的综述指出各种潜在成本收益,最终结论是吸烟的外部成本“远超任何收益”,这意味着若要用税收改变吸烟行为,烟草税应提高。但这些成本收益的确切值取决于我们认定什么是成本收益,只能估计;计量经济学家可以为此类政策问题提供建议,但它们仍是政治争议问题。

表 12.1 用 48 州面板数据估计香烟需求的 TSLS(因变量 \(\ln(Q_{i,1995})-\ln(Q_{i,1985})\);48 个 10 年差分观测;异方差稳健标准误在括号内,95% 置信区间在方括号内)

回归元 (1) (2) (3)
\(\ln(P_{i,1995})-\ln(P_{i,1985})\) −0.94 (0.21) [−1.36, −0.52] −1.34 (0.23) [−1.80, −0.88] −1.20 (0.20) [−1.60, −0.81]
\(\ln(Inc_{i,1995})-\ln(Inc_{i,1985})\) 0.53 (0.34) [−0.16, 1.21] 0.43 (0.30) [−0.16, 1.02] 0.46 (0.31) [−0.16, 1.09]
截距 −0.12 (0.07) −0.02 (0.07) −0.05 (0.06)
工具变量 销售税 香烟专门税 销售税与香烟专门税
第一阶段 F 统计量 33.7 107.2 88.6
过度识别 J 检验(p 值) — — 4.93 (0.026)

所有回归的回归元相同、都用 TSLS 估计,唯一区别是工具集。IV 回归中系数估计的可靠性取决于工具有效性,所以首先看诊断统计量。

工具相关吗? 列 (1) 的第一阶段回归:

\[\widehat{\Delta\ln P_i}=\underset{(0.03)}{0.53}-\underset{(0.22)}{0.22}\,\Delta\ln(Inc_i)+\underset{(0.0044)}{0.0255}\,\Delta SalesTax_i.\tag{12.18}\]

只有一个工具,第一阶段 F 即检验工具系数为 0 的 t 统计量的平方:\(F=t^2=(0.0255/0.0044)^2=33.7\)。列 (2)(3) 的第一阶段 F 为 107.2 和 88.6。三者都超过 10,结论:工具不弱,可以依赖用 TSLS 系数和标准误进行的标准推断。

工具外生吗? 列 (1)(2) 各有单工具单内生回归元,恰好识别,无法用 J 检验。列 (3) 有两个工具、一个内生回归元,过度识别,有 \(m-k=2-1=1\) 个过度识别约束。\(J=4.93\),服从 \(\chi^2_1\),5% 临界值为 3.84(附表 3),因此 5% 水平拒绝两个工具都外生的原假设(也可从表中 p = 0.026 直接得出)。

J 拒绝的原因是两个工具给出的估计相当不同:只用销售税 (1) 时价格弹性 −0.94,只用香烟专门税 (2) 时为 −1.34。回顾 J 的基本思想:若两个工具都外生,分别用它们的两个 TSLS 估计量都一致,只因随机抽样变异而不同;若一个外生一个不外生,基于内生工具的估计量不一致,J 统计量会察觉。本例中两个弹性估计之差足够大,不太可能纯属抽样变异。

J 拒绝意味着列 (3) 基于无效工具(外生性失败)。这对列 (1)(2) 意味着什么?J 拒绝说明至少一个工具内生,有三种逻辑可能:销售税外生而专门税不外生,则 (1) 可靠;专门税外生而销售税不外生,则 (2) 可靠;两者都不外生,则都不可靠。统计证据无法区分,必须依靠判断。

作者认为一般销售税的外生性理由强于香烟专门税,因为政治过程可能把香烟专门税的变化与香烟市场和控烟政策的变化联系起来。例如某州吸烟因不再时髦而减少,吸烟者变少,反对提高香烟专门税的游说力量削弱,进而可能导致更高的香烟专门税。于是偏好变化(属于 \(u\))可能与香烟专门税变化(工具)相关。这提示应打折看待用专门税作工具的 IV 估计,采用以一般销售税为工具估计的价格弹性 −0.94。

解读:−0.94 表明香烟消费有一定弹性:价格上涨 1% 导致消费减少 0.94%。对成瘾品而言这似乎令人意外,但这是用 10 年变化计算的长期弹性;估计表明提高税收至少在长期能显著减少香烟消费。若改用 5 年变化(以一般销售税为工具),1985–1990 年弹性为 −0.79,1990–1995 年为 −0.68,表明 5 年视野的需求弹性小于 10 年视野。视野越长弹性越大,与大量香烟需求研究一致:该文献的需求弹性估计通常在 −0.3 到 −0.5 之间,但主要是短期弹性;有研究认为长期弹性可能是短期的两倍左右。脚注 2:Adda & Cornaglia (2006) 一项令人清醒的研究表明,吸烟者会用更用力地吸烟(每支吸取更多尼古丁)来补偿更高的税;关于吸烟经济学参见 Chaloupka & Warner (2000)、Gruber (2001)、Carpenter & Cook (2008)。

12.5 有效工具从何而来?(Where Do Valid Instruments Come From?)(PDF p.454–459)

实践中 IV 估计最难的是找到既相关又外生的工具。有两种主要方法,反映两种计量与统计建模视角。

方法一:用经济理论提出工具。如 Wright 对农产品市场经济学的理解使他寻找移动供给而非需求的工具,进而考虑农业产区的天气。这一方法在金融经济学中特别成功:一些投资者行为的经济模型对投资者如何预测有明确表述,由此意味着一组与误差项不相关的变量(如理性预期下,预测误差与预测时已知的所有信息不相关)。这些模型有时对数据和参数都是非线性的,本章 IV 估计量不能用,转而使用 IV 方法到非线性模型的推广——广义矩估计(generalized method of moments, GMM)。但经济理论是抽象,常不考虑分析特定数据集所需的细节,因此这一方法不总是奏效。

方法二:寻找 \(X\) 的某个外生变动来源——实际上是某种诱发内生回归元变动的随机现象。如 12.1 节的假想例子:地震破坏增加了部分学区的平均班级规模,这种班级规模变动与影响学生成绩的潜在遗漏变量无关。这一方法通常需要了解所研究的问题并仔细关注数据细节,最好通过例子解释。

三个例子

(1)经济制度影响经济发展吗?(p.455–456) 自亚当·斯密以来最困扰经济学家的问题是:为何有的国家富有而有的贫穷?厘清导致增长的各种机制并评估各自贡献需要理论与实证结合,但实证并不简单。例如制度(如便利财产所有权的法律制度)的作用:保护产权的强制度激励更有效地使用稀缺资源,可能带来更高增长。但正因制度与增长高度交织,将经济发展度量(人均 GDP)对制度度量(如防止征用的保护程度,即产权强度)作简单回归,即使控制了其他影响发展的因素(如是否内陆国),也会得到制度因果效应的有偏估计。原因是严重的联立因果偏误:强制度促进发展,反之经济增长也使建立这类制度和制度安排成为可能——“先有鸡还是先有蛋”。如图 12.1 的黄油例,OLS 估计的是两种效应的某种复杂组合,找更好的控制变量也无法解决。

找一个合适的工具并用 TSLS 可消除这一偏误:工具须与制度度量相关,且与发展方程的误差项不相关——即影响制度、但与决定经济发展的任何不可观测因素无关。影响建立强经济制度能力的因素很可能与国家经济表现相关,那去哪找只影响制度而不直接影响发展的东西?由于制度需要很长时间建立,一个想法是考察经济制度最初如何发展的历史:数百年前在制度初创时相关、但除通过制度外与当今发展水平无关的因素。Acemoglu, Johnson & Robinson (2001) 考察经济制度的殖民起源:他们认为潜在定居者死亡率影响了欧洲国家是建立保护私有产权的欧式制度的“新欧洲(Neo-Europes)”,还是建立“攫取型国家(extractive states)”,且这些制度差异延续至今。

潜在定居者死亡率是有效工具吗?他们未报告第一阶段 F,但仅定居者死亡率就解释了当今制度水平的 27%,表明工具相关(脚注 3:Acemoglu, Johnson & Robinson, "The Colonial Origins of Comparative Development: An Empirical Investigation," AER 91(5), 2001)。外生性要求定居者死亡率只通过制度影响经济发展。作为稳健性检验,为考察定居者死亡率是否由至今仍存在、可能妨碍当今经济表现的疾病导致,他们在回归中加入疟疾流行率,发现对系数影响很小。此外,由于他们把定居者死亡率影响当今制度的因果路径分解为三部分,有三个工具,因而可检验过度识别约束;未能拒绝这些检验的原假设支持了工具有效。用这些工具和 TSLS,他们估计制度对经济发展的效应很大,是 OLS 估计的两倍,表明 OLS 有很大的联立因果偏误。而且在 TSLS 模型中,非洲虚拟变量和到赤道的距离都不显著,表明“非洲比世界其他地方穷,不是因为纯粹的地理或文化因素,而是因为更差的制度”。(脚注 4:另见 Albouy (2012) 的评论及 Acemoglu et al. (2012) 的回应。)

(2)缩小班级规模能提高成绩吗?(p.456–457) 第 II 部分实证分析显示,小班学校往往更富裕,学生在课内外都有更多学习机会;我们用多元回归控制了学生富裕程度、英语能力等以应对遗漏变量偏误。但怀疑者会问是否做够了。若相关数据不可得(有些如校外学习机会难以度量),可用 IV:工具须与班级规模相关,且与构成误差项的成绩遗漏决定因素(父母对学习的重视、校外学习机会、教师和设施质量等)不相关。

去哪找诱发班级规模随机外生变动、又与其他成绩决定因素无关的工具?Hoxby (2000) 建议生物学:由于出生时间的随机波动,每年入学幼儿园班级规模不同。实际入学人数可能内生(关于学校的近期新闻可能影响父母是否送孩子上私立学校),但潜在入学人数——学区内 4 岁儿童数——主要由出生日期的随机波动决定。

潜在入学人数是有效工具吗?外生性取决于它是否与成绩的不可观测决定因素相关。生物性波动当然外生,但潜在入学人数也会因有小孩的父母选择迁入正在改善的学区、迁出陷入困境的学区而波动;若如此,潜在入学人数增加可能与学校管理质量等不可观测因素相关,使工具无效。Hoxby 的处理:因此原因导致的潜在生源增减会在数年内平滑发生,而出生日期随机波动产生潜在入学人数的短期“尖峰”;所以她用的工具不是潜在入学人数,而是潜在入学人数相对其长期趋势的偏离。这些偏离满足相关性(第一阶段 F 都超过 100);她有力论证了其外生性,但和所有 IV 分析一样,该假设的可信度最终是判断问题。她用 80、90 年代康涅狄格州小学的详细面板数据实施该策略,面板数据还允许纳入学校固定效应,在 IV 策略之外从学校层面应对遗漏变量偏误。TSLS 估计显示班级规模对成绩的效应很小,大多数估计与 0 无统计显著差异。

(3)积极治疗心脏病能延长寿命吗?(p.458–459) 对心脏病发作(急性心肌梗死,acute myocardial infarctions, AMI)患者的积极治疗有挽救生命的潜力。新医疗程序(此例为心导管术 cardiac catheterization,脚注 5:把导管插入血管一直引导到心脏,以获取心脏和冠状动脉的信息)在普遍使用前要经过临床试验(一系列随机对照实验)测量效果和副作用;但临床试验表现好是一回事,现实世界表现是另一回事。

估计现实效果的自然起点是比较接受与未接受治疗的患者:将患者存活时长对二元治疗变量(是否接受心导管术)和影响死亡率的控制变量(年龄、体重、其他测得的健康状况等)回归,指示变量的总体系数即治疗带来的预期寿命增量。但 OLS 有偏:心导管术不是随机“碰巧”发生的,而是医生和患者认为可能有效才做;若决策部分基于数据集中未包含的、与健康结果相关的不可观测因素,治疗决策就与回归误差相关。若最健康的患者接受治疗,OLS 有偏(治疗与遗漏变量相关),治疗看起来比实际更有效。

用有效工具的 IV 回归可消除这一偏误:工具须与治疗相关,且与影响存活的遗漏健康因素不相关。去哪找只通过影响治疗而影响健康结果的东西?McClellan, McNeil & Newhouse (1994) 建议地理:他们数据中多数医院不提供心导管术,许多患者离不提供该治疗的“普通”医院更近。他们用的工具是AMI 患者家到最近的心导管术医院的距离与到最近任何医院距离之差——若最近的医院就是心导管术医院则为 0,否则为正。若该相对距离影响接受治疗的概率,则相关;若它在 AMI 患者中随机分布,则外生。

相对距离是有效工具吗?他们未报告第一阶段 F,但提供了其他证据表明它不弱。外生性方面有两个论证:一是借助医学专长和医疗体系知识,论证到医院的距离与决定 AMI 结果的任何不可观测变量可能都不相关;二是他们有部分影响 AMI 结果的其他变量(如患者体重)的数据,样本中距离与这些可观测的存活决定因素不相关,由此更可信地认为距离与误差项中的不可观测决定因素也不相关。用 205,021 名 1987 年发生 AMI 的 64 岁以上美国人的观测,他们得出惊人结论:TSLS 估计表明心导管术对健康结果的效应很小、可能为 0,即并不显著延长寿命;而 OLS 估计显示很大的正效应。他们把这一差异解释为 OLS 有偏的证据。

IV 的有趣解释:OLS 用实际治疗作回归元,但实际治疗本身是医患决策的结果,与误差项相关;TSLS 用的是预测治疗,其变动来自工具的变动——离心导管术医院近的患者更可能接受治疗。这一解释有两个含义:其一,IV 回归估计的实际上不是对“典型”随机患者的治疗效应,而是对距离在治疗决策中起重要作用的患者的效应(这正是后来所称的局部平均处理效应 LATE 的思想——补充说明);这些患者的效应可能不同于典型患者,这为临床试验中的治疗效果比 IV 研究中更大提供了一种解释。其二,它提示在此类情境中寻找工具的一般策略:找一个影响接受治疗概率、但除通过影响治疗可能性外与结果无关的工具。两者都适用于第 13 章的实验与“准实验”研究。

12.6 结论(PDF p.459–460)

从估计“黄油涨价后人们少买多少”的朴素起点,IV 方法已发展为当一个或多个变量与误差项相关时估计回归的一般方法。IV 回归用工具分离出内生回归元中与目标回归误差不相关的变动(TSLS 第一阶段),进而在第二阶段估计目标效应。

成功的 IV 回归需要有效工具——既相关(不弱)又外生。若工具弱,TSLS 即使在大样本中也可能有偏,基于 TSLS t 统计量和置信区间的推断可能误导;幸运的是单内生回归元时只需检查第一阶段 F 统计量。若工具不外生(一个或多个与误差相关),TSLS 不一致;若工具多于内生回归元,可用 J 统计量检验过度识别约束。但核心假设——外生工具至少和内生回归元一样多——不可检验,实证分析者和批判性读者都有责任用自己对应用的理解评估其合理性。

把 IV 回归理解为“利用内生回归元中已知的外生变动”,可以指导在具体应用中寻找潜在工具。这一解释是**项目评估(program evaluation)**领域大量实证分析的基础:用实验或准实验估计项目、政策或其他干预对某结果的效应。这些应用中还有很多额外问题——例如在心导管术例子中,不同“患者”对同一“治疗”可能有不同反应时如何解释 IV 结果——留待第 13 章。

第 12 章小结与关键术语(PDF p.460–461)

小结七条:(1) IV 回归是一个或多个回归元与误差相关时估计因果系数的方法;(2) 内生变量与目标方程误差相关,外生变量不相关;(3) 有效工具须 (i) 与被包含的内生变量相关、(ii) 外生;(4) IV 回归需要工具数至少等于被包含内生变量数;(5) TSLS 有两阶段:先将被包含内生变量对被包含外生变量和工具回归,再将因变量对被包含外生变量和第一阶段内生变量预测值回归;(6) 弱工具(与内生变量几乎不相关)使 TSLS 有偏,置信区间与假设检验不可靠;(7) 工具不外生则 TSLS 不一致。

关键术语:instrumental variables (IV) regression、instrumental variable (instrument)、endogenous variable、exogenous variable、instrument relevance condition、instrument exogeneity condition、two stage least squares、included exogenous variables、exactly identified、overidentified、underidentified、reduced form、first-stage regression、second-stage regression、weak instruments、first-stage F-statistic、test of overidentifying restrictions。

习题概览(PDF p.461–467)

复习概念:12.1 黄油需求方程 (12.3) 中 \(\ln P\) 与误差正相关还是负相关,OLS 估计偏大还是偏小(需求冲击 \(u>0\) 抬高价格,正相关,OLS 斜率偏大即需求弹性绝对值被低估);12.2 有效工具的关键特征及如何判断;12.3 若 Acemoglu 等用疟疾流行率作工具,是否相关、外生、有效(可能相关但不外生,疟疾直接影响当今经济表现);12.4 如何判断心导管术研究中相对距离工具的相关性与外生性。

练习:

  • 12.1 基于表 12.1:联邦新税使每包价格上涨 $0.25(现价 $6.75),用 (1) 预测需求变化及 95% 区间;衰退使收入降 5% 的影响;用 8 年、12 年视野估计系数会怎样变化(长期弹性更大);若第一阶段 F 是 63.7 而非 33.7 结论是否更可靠。
  • 12.2 最小二乘假设成立时,\(Z_i=X_i\) 是有效工具,满足 IV 假设,且 IV 估计量与 OLS 相同。
  • 12.3 误差方差估计:用第二阶段残差 \(Y_i-\hat\beta_0-\hat\beta_1\hat X_i\) 计算的 \(\hat\sigma_a^2\) 不一致;用 \(Y_i-\hat\beta_0-\hat\beta_1X_i\) 计算的 \(\hat\sigma_b^2\) 一致(这正是第二阶段 OLS 标准误错误的根源)。
  • 12.4 二元工具时 TSLS 等于 Wald 估计量:\(\hat\beta^{Wald}=(\bar Y_{Z=1}-\bar Y_{Z=0})/(\bar X_{Z=1}-\bar X_{Z=0})\)。
  • 12.5 哪条 IV 假设不满足:\(Z\) 独立于 \((Y,X,W)\)(不相关);\(Z=W\)(完全共线,第二阶段多重共线);\(W\equiv1\)(与常数共线);\(Z=X\)(不外生)。
  • 12.6 \(n=113\) 时 \(X\) 与 \(Z\) 相关系数在什么范围内工具才算强(利用 F 与 \(R^2\) 的关系式 7.14:\(F=\frac{R^2/1}{(1-R^2)/(n-2)}>10\),解得 \(R^2>10/121\),即 \(|r|>0.287\) 左右)。
  • 12.7 一个来自随机抽签但弱的工具 \(Z_1\) 加一个强但外生性可疑的工具 \(Z_2\),\(J=7.5\):是否说明 \(E(u|Z_1,Z_2)\ne0\)、是否说明 \(E(u|Z_2)\ne0\)(J 拒绝说明至少一个无效,结合先验可推断 \(Z_2\) 可疑)。
  • 12.8 供给 \(Q^s=\beta_0+\beta_1P+u^s\)、需求 \(Q^d=\gamma_0+u^d\)(完全无弹性)、均衡:证明 \(P\) 与 \(u^s\) 相关、OLS 不一致,并讨论如何估计(需求冲击可移动价格但需工具)。
  • 12.9 60 个前殖民地国家产权保护与人均 GDP:OLS 偏误方向(反向因果使偏向上),如何用定居者死亡率作工具。
  • 12.10 IV 模型遗漏 \(W\):若 \(Z\) 与 \(W\) 相关,省略 \(W\) 的 IV 估计不一致吗?若 \(\beta_2=0\) 则一致吗?

实证练习:E12.1 生育对劳动供给的影响(1980 年人口普查,21–35 岁有两个及以上孩子的已婚女性;Angrist & Evans 1998):OLS 回归 weeksworked 对 morekids、为何 OLS 不适当、前两胎同性别(samesex)是否提高生第三胎概率、为何 samesex 是有效工具、是否弱、IV 估计、加入年龄与种族变量后的变化。E12.2 暴力电影是否导致暴力行为(Dahl & DellaVigna 2009,1995–2004 年 516 个周末的袭击次数与观影人数):季节性检验、OLS、用基于历史观影模式的预测观影数(pr_attend_v/m/n)作工具的 IV、用前后周观影数作工具、9 个工具 3 个内生变量的过度识别检验、结论。E12.3(需附录 12.5)WeakInstrument 数据(200 个观测):计算 TSLS 估计、标准误和通常 95% 区间,第一阶段 F 检验弱工具,用 Anderson–Rubin 方法(设 \(-5\le\beta_1\le5\))构造 95% 置信集并比较可靠性。

附录 12.1 香烟消费面板数据集(PDF p.467)

美国本土 48 州 1985–1995 年年度数据。消费量为由州税收数据推算的财年人均香烟销售包数;价格为财年内含税每包平均零售实际价格;收入为人均实际收入;一般销售税为对所有消费品征收的广泛州销售税导致的每包平均税额(美分);香烟专门税为仅对香烟征收的税。所有价格、收入和税都用 CPI 平减为不变(实际)美元。数据由 MIT 的 Jonathan Gruber 教授提供。

附录 12.2 式 (12.4) TSLS 估计量公式的推导(PDF p.467)

第一阶段把 \(X_i\) 对 \(Z_i\) 作 OLS 得 \(\hat X_i\),第二阶段把 \(Y_i\) 对 \(\hat X_i\) 作 OLS。故用 \(\hat X_i\) 表示的 TSLS 公式就是 Key Concept 4.2 的 OLS 公式以 \(\hat X_i\) 代替 \(X_i\):\(\hat\beta_1^{TSLS}=s_{\hat XY}/s^2_{\hat X}\)。由于 \(\hat X_i=\hat\pi_0+\hat\pi_1Z_i\),样本方差与协方差的定义意味着 \(s_{\hat XY}=\hat\pi_1s_{ZY}\),\(s^2_{\hat X}=\hat\pi_1^2s_Z^2\)。于是 \(\hat\beta_1^{TSLS}=s_{ZY}/(\hat\pi_1s_Z^2)\)。而 \(\hat\pi_1\) 是第一阶段 OLS 斜率,\(\hat\pi_1=s_{ZX}/s_Z^2\),代入即得 \(\hat\beta_1^{TSLS}=s_{ZY}/s_{ZX}\),即式 (12.4)。

附录 12.3 TSLS 估计量的大样本分布(PDF p.468–469)

(单工具、单内生变量、无外生变量。)由 (12.1),\(Y_i-\bar Y=\beta_1(X_i-\bar X)+(u_i-\bar u)\),于是

\[s_{ZY}=\frac1{n-1}\sum(Z_i-\bar Z)(Y_i-\bar Y)=\beta_1s_{ZX}+\frac1{n-1}\sum(Z_i-\bar Z)(u_i-\bar u)=\beta_1s_{ZX}+\frac1{n-1}\sum(Z_i-\bar Z)u_i,\tag{12.19}\]

最后一个等号因 \(\sum(Z_i-\bar Z)=0\)。代入 \(\hat\beta_1^{TSLS}\) 定义,分子分母同乘 \((n-1)/n\):

\[\hat\beta_1^{TSLS}=\beta_1+\frac{\frac1n\sum_{i=1}^n(Z_i-\bar Z)u_i}{\frac1n\sum_{i=1}^n(Z_i-\bar Z)(X_i-\bar X)}.\tag{12.20}\]

IV 假设成立时的大样本分布:(12.20) 与 OLS 的 (4.28) 相似,只是分子中出现 \(Z\) 而非 \(X\),分母是 \(Z\) 与 \(X\) 的协方差而非 \(X\) 的方差;由于这些相似性及 \(Z\) 外生,附录 4.3 的 OLS 大样本正态论证可推广。大样本时 \(\bar Z\cong\mu_Z\),分子近似为 \(\bar q=\frac1n\sum q_i\),\(q_i=(Z_i-\mu_Z)u_i\)。工具外生故 \(E(q_i)=0\);由 IV 假设 \(q_i\) i.i.d.,方差 \(\sigma_q^2=\mathrm{var}[(Z_i-\mu_Z)u_i]\),所以 \(\mathrm{var}(\bar q)=\sigma^2_{\bar q}=\sigma_q^2/n\),由中心极限定理 \(\bar q/\sigma_{\bar q}\) 大样本下服从 \(N(0,1)\)。样本协方差一致,\(s_{ZX}\xrightarrow{p}\mathrm{cov}(Z_i,X_i)\),由相关性非零。因此 \(\hat\beta_1^{TSLS}\cong\beta_1+\bar q/\mathrm{cov}(Z_i,X_i)\),大样本近似服从 \(N(\beta_1,\sigma^2_{\hat\beta_1^{TSLS}})\),\(\sigma^2_{\hat\beta_1^{TSLS}}=\sigma^2_{\bar q}/[\mathrm{cov}(Z_i,X_i)]^2=\frac1n\mathrm{var}[(Z_i-\mu_Z)u_i]/[\mathrm{cov}(Z_i,X_i)]^2\),即式 (12.8)。

附录 12.4 工具无效时 TSLS 估计量的大样本分布(PDF p.469–470)

(一个 \(X\)、一个 \(Z\)。)相关性失败时 TSLS 大样本分布非正态,实为两个正态随机变量之比的分布;外生性失败时 TSLS 不一致。

工具弱(不相关)时:若 \(\mathrm{cov}(Z_i,X_i)=0\),附录 12.3 的论证涉及除以 0,需细看 (12.20) 分母在总体协方差为 0 时的行为。大样本时 \(\bar Z\approx\mu_Z\),\(\bar X\approx\mu_X\),分母近似为 \(\bar r=\frac1n\sum r_i\),\(r_i=(Z_i-\mu_Z)(X_i-\mu_X)\)。令 \(\sigma_r^2=\mathrm{var}[(Z_i-\mu_Z)(X_i-\mu_X)]\),\(\sigma^2_{\bar r}=\sigma_r^2/n\),\(\bar q,\sigma_q^2,\sigma^2_{\bar q}\) 同附录 12.3。则大样本中

\[\hat\beta_1^{TSLS}\cong\beta_1+\frac{\bar q}{\bar r}=\beta_1+\left(\frac{\sigma_{\bar q}}{\sigma_{\bar r}}\right)\left(\frac{\bar q/\sigma_{\bar q}}{\bar r/\sigma_{\bar r}}\right)=\beta_1+\left(\frac{\sigma_q}{\sigma_r}\right)\left(\frac{\bar q/\sigma_{\bar q}}{\bar r/\sigma_{\bar r}}\right).\tag{12.21}\]

工具不相关时 \(E(r_i)=\mathrm{cov}(Z_i,X_i)=0\),所以 \(\bar r\) 是 i.i.d.、方差有限、均值为 0 的随机变量的样本均值,中心极限定理适用:\(\bar r/\sigma_{\bar r}\) 近似 \(N(0,1)\)。因此大样本中 \(\hat\beta_1^{TSLS}-\beta_1\) 的分布是 \(aS\) 的分布,\(a=\sigma_q/\sigma_r\),\(S\) 是两个(相关的)标准正态随机变量之比。即工具不相关时,中心极限定理同时作用于 TSLS 的分子和分母,大样本分布为两个正态随机变量之比;由于 \(X_i\) 与 \(u_i\) 相关,这两个正态变量相关,分布很复杂。事实上,工具不相关时 TSLS 的大样本分布以 OLS 估计量的概率极限为中心——TSLS 没有消除 OLS 的偏误,而且即使在大样本中也是非正态的。弱工具是不相关工具与附录 12.3 正态情形之间的中间情况:工具弱但非完全不相关时,TSLS 分布仍非正态,所以极端情形的教训适用于弱工具。

工具内生时:(12.20) 最后表达式的分子依概率收敛到 \(\mathrm{cov}(Z_i,u_i)\)。若工具外生则为 0,TSLS 一致(假设工具不弱);若不外生且不弱,则

\[\hat\beta_1^{TSLS}\xrightarrow{p}\beta_1+\frac{\mathrm{cov}(Z_i,u_i)}{\mathrm{cov}(Z_i,X_i)}\ne\beta_1,\]

即 TSLS 不一致。(注意:工具越弱,分母越小,同样程度的工具内生性造成的偏误被放大——补充说明。)

附录 12.5 弱工具下的工具变量分析(PDF p.470–472)

(聚焦单个被包含内生回归元,式 12.13、12.14。)

弱工具检验:Key Concept 12.5 的经验法则(第一阶段 F < 10 表明工具弱)的一个动机来自 TSLS 偏误的近似表达式。记 \(\beta_1^{OLS}\) 为 OLS 估计量的概率极限,\(\beta_1^{OLS}-\beta_1\) 为 OLS 的渐近偏误(回归元内生时 \(\hat\beta_1\xrightarrow{p}\beta_1^{OLS}\ne\beta_1\))。可以证明工具很多时,TSLS 偏误近似为

\[E(\hat\beta_1^{TSLS})-\beta_1\approx\frac{\beta_1^{OLS}-\beta_1}{E(F)-1},\]

\(E(F)\) 为第一阶段 F 统计量的期望。若 \(E(F)=10\),TSLS 偏误相对 OLS 偏误约为 1/9,略高于 10%,在许多应用中小到可以接受;把 \(E(F)>10\) 换成 \(F>10\) 就得到经验法则。

该动机依赖“工具很多”的近似,而多数应用中工具数 \(m\) 很小。Stock & Yogo (2005) 提供了避免这一近似的正式弱工具检验:原假设为工具弱,备择假设为工具强,强工具定义为 TSLS 偏误至多为 OLS 偏误 10% 的工具。检验将第一阶段 F(出于技术原因用仅同方差版本)与依赖工具个数的临界值比较;5% 水平下该临界值在 9.08 到 11.52 之间,所以“F 与 10 比较”是 Stock–Yogo 检验的良好近似。

\(\beta\) 的假设检验与置信集:工具弱时 TSLS 有偏且非正态,检验 \(\beta_1=\beta_{1,0}\) 的 TSLS t 检验和 TSLS 置信区间都不可靠。但有其他检验(及据此构造的置信区间)无论工具强、弱甚至不相关都有效。单内生回归元时首选 Moreira (2003) 条件似然比(conditional likelihood ratio, CLR)检验;较老、适用于任意个内生回归元的是基于 Anderson–Rubin (1949) 统计量的检验。

Anderson–Rubin 检验(\(H_0:\beta_1=\beta_{1,0}\))两步:(1) 计算新变量 \(Y_i^*=Y_i-\beta_{1,0}X_i\);(2) 将 \(Y_i^*\) 对被包含外生回归元(\(W\))和工具(\(Z\))回归,AR 统计量是检验 \(Z\) 系数全为 0 的 F 统计量。在 \(\beta_1=\beta_{1,0}\) 的原假设下,若工具满足外生性(Key Concept 12.3 条件 2),它们与该回归的误差不相关,原假设只在 5% 的样本中被拒绝。如 3.3、7.4 节,置信集可构造为假设检验不拒绝的参数值集合:5% AR 检验不拒绝的 \(\beta_1\) 值集合构成 \(\beta_1\) 的 95% 置信集。用仅同方差公式计算 AR F 统计量时,AR 置信集可通过解二次方程构造(实证练习 12.3)。AR 统计量的逻辑从不假设工具相关性,无论工具强、弱还是不相关,AR 置信集大样本覆盖率都是 95%。(AR 置信集可能是有界区间、两段无界区间的并或整条实线——补充说明。)

CLR 检验:似然比统计量比较原假设与备择假设下的似然值(附录 11.2),备择下似然足够大时拒绝。本书熟悉的检验统计量(如多元回归中的仅同方差 F 统计量)可在同方差正态误差假设下作为似然比统计量导出。但与本书其他检验不同,CLR 检验的临界值依赖数据——具体依赖一个度量工具强度的统计量;用正确的临界值,CLR 检验无论工具强、弱、不相关都有效。CLR 置信区间为不被 CLR 检验拒绝的 \(\beta_1\) 值集合。工具强时 CLR 检验等价于 TSLS t 检验,工具弱时有很好的势;有合适软件时易用。缺点是不易推广到多个内生回归元——此时推荐 AR 检验(及置信集);但当工具强(TSLS 有效)且系数过度识别时,AR 检验是无效的(势低于 TSLS t 检验)。

\(\beta\) 的估计:若工具不相关,没有进一步约束时即使在大样本中也不可能得到 \(\beta_1\) 的无偏估计量。工具弱时,系数的 CLR 或 AR 置信区间优于点估计。弱工具下 IV 回归的估计、检验与置信区间仍是活跃的研究领域。

附录 12.6 带控制变量的 TSLS(PDF p.472–473)

Key Concept 12.4 假设 \(W\) 外生;本附录考虑 \(W\) 不外生、而是为使 \(Z\) 外生而纳入的控制变量。TSLS 中控制变量的逻辑与 OLS 平行:若控制变量有效控制了遗漏因素,则工具与误差项不相关;因控制变量与误差项相关,其系数没有因果解释。数学上也与 OLS 平行(参见附录 6.5),把“给定 \(Z\) 和 \(W\) 时误差条件均值为 0”放宽为“误差的条件均值不依赖于 \(Z\)”。

考虑单个 \(X\)、单个 \(W\) 的模型:

\[Y_i=\beta_0+\beta_1X_i+\beta_2W_i+u_i.\tag{12.22}\]

将 IV 假设 1(\(E(u_i|W_i)=0\))替换为:给定 \(W_i\),\(u_i\) 的均值不依赖于 \(Z_i\):

\[E(u_i|W_i,Z_i)=E(u_i|W_i).\tag{12.23}\]

仿照附录 6.5 式 (6.23)–(6.25),假设 \(E(u_i|W_i)\) 对 \(W_i\) 线性:\(E(u_i|W_i)=\gamma_0+\gamma_1W_i\)。则

\[Y_i=\beta_0+\beta_1X_i+\beta_2W_i+u_i-E(u_i|W_i,Z_i)+E(u_i|W_i,Z_i)=\beta_0+\beta_1X_i+\beta_2W_i+\varepsilon_i+\gamma_0+\gamma_1W_i,\tag{12.24}\]

第一行在右边加减 \(E(u_i|W_i,Z_i)\),第二行定义 \(\varepsilon_i=u_i-E(u_i|W_i,Z_i)\) 并利用条件均值独立加线性写出 \(E(u_i|W_i,Z_i)=E(u_i|W_i)=\gamma_0+\gamma_1W_i\)。于是

\[Y_i=\delta_0+\beta_1X_i+\delta_1W_i+\varepsilon_i,\tag{12.25}\]

\(\delta_0=\beta_0+\gamma_0\),\(\delta_1=\beta_2+\gamma_1\)。而 \(E(\varepsilon_i|W_i,Z_i)=E[u_i-E(u_i|W_i,Z_i)|W_i,Z_i]=0\),进而 \(\mathrm{corr}(Z_i,\varepsilon_i)=0\)。因此 IV 假设 1 和工具外生性在以 \(\varepsilon_i\) 为误差的 (12.25) 中都成立;若把 IV 假设 1 换成条件均值独立 (12.23),Key Concept 12.4 的原 IV 假设就适用于修改后的回归 (12.25),本章所有推断方法(无论工具强弱)都适用;工具强时 TSLS 一致估计 (12.25) 的系数,TSLS 检验与置信区间有效。

与 OLS 中的控制变量一样,一般而言控制变量 \(W\) 的 TSLS 系数没有因果解释:TSLS 一致估计的 \(\delta_1\) 是 \(W\) 的直接因果效应 \(\beta_2\) 与反映 \(W\) 和其所控制的 \(u_i\) 中遗漏因素之间相关的 \(\gamma_1\) 之和。

香烟例:表 12.1 中很容易把 10 年对数收入变化的系数解释为需求的收入弹性。但若收入增长与教育提高相关、且教育减少吸烟,收入增长就有其自身因果效应(\(\beta_2\),收入弹性)加上通过与教育相关产生的效应(\(\gamma_1\));若后者为负(\(\gamma_1<0\)),表 12.1 的收入系数(估计的是 \(\delta_1=\beta_2+\gamma_1\))会低估收入弹性。不过只要条件均值独立假设 (12.23) 成立,价格弹性的 TSLS 估计量仍是一致的,即使收入弹性的估计不一致。

第 12 章 本章要点

  1. IV 回归解决回归元内生(遗漏变量、测量误差、联立因果)问题:用工具 \(Z\) 分离出 \(X\) 中与 \(u\) 不相关的外生变动。
  2. 有效工具两条件:相关性 \(\mathrm{corr}(Z,X)\ne0\);外生性 \(\mathrm{corr}(Z,u)=0\)(即 \(Z\) 只通过 \(X\) 影响 \(Y\),“排除约束”)。
  3. 单工具时 \(\hat\beta_1^{TSLS}=s_{ZY}/s_{ZX}\),一致、渐近正态,方差 \(\frac1n\mathrm{var}[(Z-\mu_Z)u]/[\mathrm{cov}(Z,X)]^2\);二元工具时为 Wald 估计量。
  4. TSLS 一般形式:第一阶段每个内生 \(X\) 对全部 \(Z\) 和全部 \(W\) 回归(约简式),第二阶段 \(Y\) 对 \(\hat X\) 和 \(W\) 回归;需 \(m\ge k\)(恰好/过度识别);标准误须用专门命令(不能用第二阶段 OLS 标准误)并用异方差稳健版本。
  5. 弱工具:TSLS 偏向 OLS、分布非正态、置信区间覆盖不足;单内生回归元时以第一阶段 F > 10 为经验法则(Stock–Yogo 临界值 9.08–11.52);弱工具时用 Anderson–Rubin 或 CLR 置信集。
  6. 外生性:恰好识别时不可检验;过度识别时用 J 统计量 \(J=mF\sim\chi^2_{m-k}\),但它只检验“多余”工具,且拒绝后无法指出是哪个工具无效。
  7. 案例:香烟长期需求弹性以销售税为工具约 −0.94(专门税 −1.34,J 检验拒绝两者同时外生,作者判断销售税更可信);5 年视野弹性更小(−0.79、−0.68)。
  8. 工具来源:经济理论(Wright 的天气、金融中的理性预期正交条件→GMM)或“自然实验”式的随机变动(殖民地定居者死亡率、出生人数尖峰、到医院的相对距离);IV 估计的是受工具影响人群的效应。
  9. 控制变量在 IV 中的作用与 OLS 相同:满足条件均值独立即可使工具有效,但控制变量系数无因果解释。

第 12 章 与量化交易的关联

  • 价格冲击与市场冲击成本估计:在执行与交易成本建模中,交易量/订单流与价格变动同时决定(联立因果),直接 OLS 回归会混合需求与供给效应——正是 Wright 的黄油问题。微观结构文献用外生的资金流(如共同基金被动的申赎流量、指数纳入/剔除带来的强制交易)作为工具估计价格弹性/需求曲线斜率(如 Lou 2012 的资金流驱动交易、Koijen–Yogo 需求系统资产定价、Gabaix–Koijen “无弹性市场假说”中用工具估计宏观需求弹性)。
  • 资产定价中的 GMM:12.5 节提到的“投资者预测行为隐含的正交条件”就是金融中的 GMM(Hansen 1982):消费 CAPM 欧拉方程 \(E[m_{t+1}R_{t+1}-1|I_t]=0\) 用 \(I_t\) 中变量作工具;J 检验(Hansen J)是检验资产定价模型的标准工具。线性因子模型的 GMM 估计、随机贴现因子模型检验、Fama–MacBeth 的 GMM 版本都源于此章思想。
  • 测量误差修正:因子 beta 有估计误差(第 9 章的变量误差),可用 IV 修正:如用不同样本期(奇偶月)估计的 beta 互为工具(Jegadeesh et al. 2019 的 IV 方法修正 EIV 偏误)。
  • 因果性 alpha 研究与事件研究:分析师覆盖、机构持股、ESG 评级、媒体关注等对收益或流动性的“因果效应”,常利用券商合并(分析师覆盖外生减少)、指数成分断点(Russell 1000/2000 分界附近的机构持股变化)、交易所规则变更作为工具或准实验。
  • 弱工具教训:用宏观变量或少量事件作工具时第一阶段往往很弱,TSLS 结果会偏向 OLS 且 t 值不可信——Wright 的供给弹性 −0.88 是生动反例;量化研究中应报告第一阶段 F,必要时用 AR 置信集。
  • 实现:自研回归库实现 IV 时需注意:标准误用 \(Y-X\hat\beta\) 的残差、第一阶段包含所有外生回归元、J 检验自由度为 \(m-k\)。
  • 对于纯预测型 alpha 模型,IV 一般不直接使用(预测不需要因果识别),但在解释因子机制、评估政策/事件冲击、估计交易成本函数等需要因果结论的环节非常关键。

第 12 章 推荐习题

  • 12.4(Wald 估计量)与 附录 12.2:二元工具下 IV 的直观形式,是事件型自然实验的基础。
  • 12.3:TSLS 残差应使用真实 \(X\)——理解为何第二阶段 OLS 标准误错误。
  • 12.2、12.5:通过反例理解 IV 假设各条的作用(\(Z=X\) 退化为 OLS、\(Z=W\) 共线、\(Z\) 独立则不相关)。
  • 12.8 与复习 12.1:供需联立中 OLS 偏误方向与 IV 的识别逻辑。
  • 12.6:第一阶段 F > 10 对应的相关系数下限(把弱工具阈值与样本量联系起来)。
  • 12.7:J 检验能说明什么、不能说明什么。
  • E12.3(弱工具与 Anderson–Rubin 置信集)、E12.1(samesex 自然实验):实证上体会弱工具问题与经典自然实验工具。