第 13 章 实验与准实验
学习目标
读完本章,你应当能够:
- 用潜在结果(potential outcome)语言定义平均处理效应,说明随机分配为什么能让「处理组均值减对照组均值」识别它。
- 用差分估计量(可带处理前控制变量)分析随机实验数据,做随机化检验,并知道基于协变量随机化时为什么必须控制协变量。
- 列出实验与准实验的内部、外部有效性威胁(未随机化、部分依从、样本流失、实验效应、小样本;样本与项目不具代表性、一般均衡效应),并给出相应对策。
- 掌握准实验的三件工具:双重差分(含重复截面版本)、工具变量、精确与模糊回归断点。
- 理解处理效应异质时 OLS 与 IV 估计的分别是什么:随机分配下 OLS 估计 ATE,IV 估计 LATE。
- 把这些方法用到量化研究中:执行算法 A/B 测试、监管与指数调整的事件评估、指数成分边界的断点设计。
读前导读
这一章在解决什么问题
前面几章都在「事后补救」:数据已经有偏,就加控制变量、用固定效应、找工具变量。这一章退回到起点问:什么样的数据天生就能回答因果问题? 答案是随机实验,以及那些「碰巧像随机实验」的自然事件(准实验)。
先要把「因果效应」说清楚。本章引入潜在结果的语言:同一笔订单,用新算法执行的成本是 \(Y(1)\),用旧算法是 \(Y(0)\),两者之差才是新算法的真实效果。问题在于,一笔订单只能用一种算法执行,另一个结果永远看不到。这就像评价一位基金经理:你只能看到他实际做出的业绩,看不到「如果当初没换他」会怎样。随机分配让两组订单在平均意义上可比,于是组间均值差就等于平均效应。
准实验的三件工具都是你在事件研究里会碰到的:双重差分(受新规影响的股票 vs 未受影响的股票,比较变化而非水平),工具变量(第 12 章),回归断点(指数成分按市值排名划线,刚好在线上和线下的股票几乎一样,只有是否被纳入不同)。最后 13.6 节讲一个重要但容易被忽视的问题:当效应因人而异时,IV 估计的只是「受工具影响的那部分人」的效应。
需要先想起来的数学
1. 条件期望 \(E(Y\mid X=1)\)。 只在 \(X=1\) 的那部分个体中求平均。例:\(E(\text{收益}\mid\text{小盘股})\) 就是小盘股的平均收益。若 \(X\) 与 \(Y\) 独立,知道 \(X\) 对 \(Y\) 的平均值毫无帮助,于是 \(E(Y\mid X=1)=E(Y)\),条件可以去掉。随机分配的全部威力就在这一步。见 第 00 册第 07 章 概率中的分析工具。
2. 期望的线性与独立变量乘积的期望。 \(E(aX+bY)=aE(X)+bE(Y)\) 总成立;\(E(XY)=E(X)E(Y)\) 只在 \(X\)、\(Y\) 不相关时成立,一般情况是 \(E(XY)=\mathrm{cov}(X,Y)+E(X)E(Y)\)。13.6 节 LATE 与 ATE 的比较完全靠这个式子。见 第 00 册第 07 章。
3. 均值差的标准误。 两个独立样本均值之差的标准误是 \(\sqrt{s_1^2/n_1+s_0^2/n_0}\),这在 CFA 的两样本 t 检验里见过。例:两组各 100 笔订单,执行落差标准差都是 6 bp,均值差的 SE 为 \(\sqrt{0.36+0.36}\approx0.85\) bp。
4. 指示函数 \(1\{\cdot\}\)。 \(1\{W_i<w_0\}\) 在括号内条件成立时取 1,否则取 0。例:\(1\{\text{市值排名}<300\}\) 表示是否排进前 300 名。断点设计中用它定义工具。见 第 00 册第 08 章 读懂数学证明与符号。
怎么读这一章
13.1 节是核心,必须弄懂潜在结果的记号和 (13.18) 为什么成立,这是后面所有内容的基础。13.1.2 的四种分析方法与 13.2 的威胁清单,对设计 A/B 测试极其实用,建议对照量化实战里的执行算法例子一起读。13.3 的 STAR 案例可以只看表 13.2 下面的三条要点和 13.3.3 的实验/观测对比。13.4 节的三件工具(DiD、IV、RD)是做事件研究的必备方法,重点读。13.5 节快速浏览。13.6 节的 LATE 第一次可以只记住结论和培训例子,推导跟着讲解框走一遍即可。
13.0 本章要解决的问题
前面各章一直用观测数据(observational data)估计因果效应:控制变量、面板固定效应、工具变量,都是在「没有人替我们随机分配处理」的条件下设法逼近因果。本章回到因果效应的定义本身——理想随机对照实验(randomized controlled experiment),并讨论两类更接近它的数据:
- 真实实验:研究者亲手随机分配处理。医学里新药必须经过随机对照试验,一部分病人服药,其余服安慰剂(placebo)。
- 准实验(quasi-experiment),又称自然实验(natural experiment):法律、制度、地理、出生日期等偶然因素使处理「仿佛随机」(as if random)地分配。
学这部分有三个理由。第一,理想实验是评判一切观测数据因果估计的概念基准。第二,真实实验影响力大,必须知道它在什么情况下会出错。第三,实验分析的方法稍加修改就能用于准实验。本章用到的工具仍然是多元回归、面板回归和 IV 回归,新东西在于数据从哪里来、估计量怎么解释。
应用领域称为项目评估(program evaluation):估计一个项目、政策或干预(统称「处理」,treatment)的效应。例如职业培训对收入的效应、最低工资上调对低技能工人就业的效应、低息助学贷款对大学入学的效应。在量化交易中,对应的是执行算法、监管规则、指数调整这类「处理」的效应评估。
13.1 潜在结果、因果效应与理想实验
13.1.1 潜在结果与平均处理效应
个体 \(i\) 在接受处理时的结果记为 \(Y_i(1)\),不接受处理时的结果记为 \(Y_i(0)\),二者称为潜在结果。个体因果效应是 \(Y_i(1)-Y_i(0)\)。
根本难题:同一个体要么接受处理、要么不接受,两个潜在结果只能观察到一个,所以单个个体的因果效应永远测不到。
很多应用只需要总体平均。个体因果效应在总体中的均值称为平均因果效应(average causal effect),或平均处理效应(average treatment effect, ATE):
记 \(X_i=1\) 表示接受处理。观测到的结果是
在任何分配机制下都有
这一般不等于 ATE:如果自己选择接受培训的人本来就更能干,\(E[Y_i(0)\mid X_i=1]\) 就高于 \(E[Y_i(0)\mid X_i=0]\),组间差混入了选择偏差。
随机分配解决了这个问题。 识别逻辑有两步:(1) 从总体中简单随机抽样,样本因果效应的期望等于总体平均因果效应;(2) 随机分配处理,\(X_i\) 与 \([Y_i(1),Y_i(0)]\) 独立。于是条件期望可以去掉条件:
理想随机对照实验中,处理组与对照组结果期望之差就是 ATE。
推导拆解:把非随机情形下的组间差拆开,就能看清随机分配到底消掉了什么。在 \(E[Y_i(1)\mid X_i=1]-E[Y_i(0)\mid X_i=0]\) 中间加一项再减一项 \(E[Y_i(0)\mid X_i=1]\):
\[\underbrace{E[Y_i(1)-Y_i(0)\mid X_i=1]}_{\text{处理组的平均效应}}+\underbrace{E[Y_i(0)\mid X_i=1]-E[Y_i(0)\mid X_i=0]}_{\text{选择偏差}}.\]第二项是「两组人即使都不接受处理,结果本来就差多少」。随机分配让 \(X_i\) 与 \(Y_i(0)\) 独立,于是 \(E[Y_i(0)\mid X_i=1]=E[Y_i(0)\mid X_i=0]=E[Y_i(0)]\),选择偏差为 0;同理第一项变成 \(E[Y_i(1)-Y_i(0)]\),即 ATE。 金融直觉:比较「用了某个风控系统的基金」和「没用的基金」的回撤。用了的基金回撤更小,但愿意花钱上风控系统的机构可能本来就更谨慎(\(Y(0)\) 本来就好),这就是选择偏差。只有随机决定哪些基金用这个系统,组间差才是系统本身的效果。
写成回归。 令 \(\beta_0=E[Y_i(0)]\),\(u_i=Y_i(0)-E[Y_i(0)]\),\(\beta_{1i}=Y_i(1)-Y_i(0)\),则
这是一个随机系数模型:每个人有自己的效应 \(\beta_{1i}\)。效应对所有人相同时它化为普通回归 (13.1)。13.6 节会回到 \(\beta_{1i}\) 因人而异的情形。
13.1.2 分析实验数据的计量方法
1. 差分估计量(differences estimator)。处理组与对照组样本均值之差,等价于对二元处理变量做回归
\(X\) 随机分配时 \(E(u_i\mid X_i)=0\),OLS 估计 \(\hat\beta_1\) 无偏且一致。
2. 带附加回归元的差分估计量(differences estimator with additional regressors):
-
加入 \(W\) 的好处是效率:\(W\) 能解释 \(Y\) 的一部分变异,回归标准误变小,\(\hat\beta_1\) 的标准误通常也变小。
-
无偏所需的条件是条件均值独立:\(E(u_i\mid X_i,W_i)=E(u_i\mid W_i)\)。若 \(W\) 是处理前(pretreatment)个体特征(性别、年龄、实验前的结果水平)且 \(X\) 随机分配,该条件成立。
-
两个误区:\(W\) 不能包含受处理影响的变量(给定这样的 \(W\) 后,\(X\) 不再随机);控制变量的系数没有因果解释。
金融直觉:为什么受处理影响的变量不能控制?设新算法 B 更激进,成交率更高,执行落差也更低。如果把「成交率」作为控制变量放进回归,你比较的是「成交率相同的 A 订单和 B 订单」。但 B 在成交率上本来就高,与 B 成交率相同的 A 订单,多半是行情特别顺利的那些。这样比较等于拿 B 的普通订单去和 A 的「幸运」订单比,B 的效果被低估,甚至可能被吸收殆尽。成交率是 B 发挥作用的通道,控制它就把效果本身控制掉了。这类变量文献中称为「坏控制」(bad control)。
3. 依赖可观测变量的效应。与第 8 章一样加入交互项。例如 \(W_{1i}\) 为性别哑变量,加入 \(W_{1i}\times X_i\) 可以分别估计男性和女性的处理效应。
4. 基于协变量的随机化(randomization based on covariates)。分配到处理组的概率依赖可观测的 \(W\)。例子:在计量课上做「强制作业 vs 可选作业」实验,经济学专业学生(\(W_i=1\))以更高概率被分到强制作业组。若专业学生本来成绩就更好,(13.1) 的简单差分就有遗漏变量偏误。解决办法是在 (13.2) 中控制 \(W_i\):给定 \(W_i\) 时 \(X_i\) 随机分配,条件均值独立成立。若处理效应在专业与非专业间不同,还要加入 \(X_i\times W_i\)。
用潜在结果的语言说,给定 \(W_i\) 时 \(X_i\) 与 \([Y_i(1),Y_i(0)]\) 独立,称为非混杂性(unconfoundedness)。若效应恒定且 \(Y_i(0)=\beta_0+\gamma W_i+u_i\),代入 (13.17) 得 \(Y_i=\beta_0+\beta_1X_i+\gamma W_i+u_i\),且
因此 \(\hat\beta_1\) 无偏;但 \(E(u_i\mid W_i)\) 一般不为零,\(\hat\gamma\) 有偏。这正是「控制变量系数无因果解释」的数学原因(原书附录 13.3)。
13.2 实验有效性的威胁
回顾第 9 章:内部有效性(internal validity)指对所研究总体的因果推断有效;外部有效性(external validity)指结论能推广到其他总体与环境。
13.2.1 内部有效性的五项威胁
1. 未能随机化(failure to randomize)。如果分配依赖受试者特征或偏好,结果就混入了非随机分配的效应。例:按姓氏首字母前后半段分组。族裔与姓氏相关,族裔又与工作经验、教育等遗漏因素相关,于是 \(X_i\) 与 \(u_i\) 相关,估计有偏。
随机化检验:若真正随机分配,\(X_i\) 应与处理前特征不相关。把 \(X_i\) 对 \(W_{1i},\dots,W_{ri}\) 回归,用 F 统计量检验所有系数为零。若设计本身是基于协变量的随机化,就把这些协变量放进回归,F 只检验其余 \(W\)。由于 \(X_i\) 是二元变量,这是线性概率模型,必须用异方差稳健标准误(也可以用 probit/logit)。
2. 未遵守处理协议(failure to follow the treatment protocol)。处理组有人没参加培训,对照组有人设法参加,称为部分依从(partial compliance)。实际接受的处理 \(X_i\) 含有选择成分,即使初始分配随机,\(X_i\) 也可能与 \(u_i\) 相关。
对策:如果同时观测到实际处理 \(X_i\) 和初始随机分配 \(Z_i\),就用 \(Z_i\) 作为 \(X_i\) 的工具变量。相关性成立,因为协议至少部分被遵守;外生性成立,因为初始分配是随机的。初始随机分配是天然的有效工具。
白话解释:这里有两个不同的量。一是意向处理效应(intention-to-treat, ITT):直接按初始分配 \(Z\) 比较两组结果,即 \(\bar Y_{Z=1}-\bar Y_{Z=0}\)。它总是无偏的(因为 \(Z\) 随机),回答的是「推行这项政策的效果」,包括有人不遵守的情况。二是实际接受处理的效果,用第 12 章的 Wald 估计量:ITT 除以「分配对实际接受率的影响」\(\bar X_{Z=1}-\bar X_{Z=0}\)。 数值例子:被分到新算法的订单中,交易员实际只让 80% 用了新算法;被分到旧算法的订单中,有 10% 被交易员私下改用新算法。ITT 测得执行落差降低 1.4 bp。实际接受率之差为 \(0.8-0.1=0.7\),于是新算法对实际使用者的效果约为 \(1.4/0.7=2.0\) bp。决定是否全面上线时看 ITT,评估算法本身的性能时看后者。
3. 样本流失(attrition)。随机分配后受试者退出。若退出原因与处理无关(例如回老家照顾病人),无碍;若与处理有关,就有偏。例:最能干的受训者靠新技能在外地找到工作而退出,处理组只剩能力较低者,留存样本中 \(X_i\) 与能力相关。这是一种样本选择偏误(selection bias)。
4. 实验效应(experimental effects)。仅仅因为身处实验就改变行为,称为霍桑效应(Hawthorne effect)。缓解办法是双盲(double-blind):受试者与实验者都不知道谁在处理组,比如药物与安慰剂外观一致。经济学实验通常做不到双盲:教师如果认为自己的工作取决于实验成败,可能格外努力。
原书专栏讲了霍桑效应的来历:1920–30 年代通用电气 Hawthorne 工厂调整照明、休息和工时,早期报告称无论条件变好变坏,生产率都上升,归因于工人感到被关注。但后来对原始数据的仔细检查(Gillespie 1991;Jones 1992)并未发现这种效应。尽管如此,受试者与结果有利害关系时,实验效应仍是真实的威胁。
5. 小样本。不造成偏误,但估计不精确,基于正态临界值和稳健标准误的大样本推断可能失效。
13.2.2 外部有效性的三项威胁
- 样本不具代表性:对刑满释放人员的培训实验,结论未必能推广到无犯罪记录的工人。
- 项目或政策不具代表性:小规模、严格监控的实验项目与大规模推广后的项目在质量、资金、持续时间上都可能不同。
- 一般均衡效应(general equilibrium effects):小型临时项目变成大规模永久项目后,经济环境本身会变。例:小型培训项目只是补充雇主培训,大规模推广后可能挤出雇主提供的培训。小实验测的是「市场与政策环境不变」时的效应,大规模实施时这些条件并不保持不变。
最后一条对量化交易很重要:一个小资金量下有效的执行算法或信号,规模放大后会改变市场本身(冲击成本上升、对手方学习你的行为),回测中的效应不能线性外推。
13.3 案例:田纳西 Project STAR 班级规模实验
13.3.1 实验设计
Project STAR(Student–Teacher Achievement Ratio)是 1980 年代后期田纳西州为期 4 年、耗资约 1200 万美元的实验,比较幼儿园(K)到三年级的三种班型:常规班(22–25 人,无助教)、小班(13–17 人,无助教)、常规班加助教。1985–1986 学年入学的幼儿园学生随机分到三组,教师也随机分配到班型。第一年约 6400 名学生(108 个小班、101 个常规班、99 个带助教常规班),4 年共约 11,600 名学生、80 所学校。
实验有偏离:因家长投诉,一年级开始时常规班学生在「有/无助教」之间重新随机分配;约 10% 学生在后续年份换班。若换班是因为最关心教育的家长施压,小班效应会被高估。
原书同时介绍了墨西哥农村的有条件现金转移实验(1997 年):在 495 个贫困社区中随机选 314 个,向合格家庭发钱,条件是孩子入学,其余 181 个作对照。分析表明随机化成功产生了平衡的两组,且干预提高了入学率。
13.3.2 数据分析
两个处理组需要两个哑变量:
观测不是 i.i.d.:一所学校被选中则全校参与,同校学生有相似的不可观测特征,误差在校内相关。这不导致偏误,但标准误必须按学校聚类(clustered standard errors,见第 10 章)。
表 13.1(差分估计,因变量为数学 + 阅读总分,学校聚类标准误)
| 年级 | K | 1 | 2 | 3 |
|---|---|---|---|---|
| 小班 | 13.90 (4.23) | 29.78 (4.79) | 19.39 (5.12) | 15.59 (4.21) |
| 常规班 + 助教 | 0.31 (3.77) | 11.96 (4.87) | 3.48 (4.91) | −0.29 (4.04) |
| 截距 | 918.04 | 1039.39 | 1157.81 | 1228.51 |
| \(N\) | 5786 | 6379 | 6049 | 5967 |
各年级都在 0.5% 水平拒绝「小班无改进」;除一年级外,即使在 10% 水平也不能拒绝「助教无改进」。
表 13.2(幼儿园,逐步加入回归元)
| 回归元 | (1) | (2) | (3) | (4) |
|---|---|---|---|---|
| 小班 | 13.90 (4.23) | 14.00 (4.25) | 15.93 (4.08) | 15.89 (3.95) |
| 常规班 + 助教 | 0.31 (3.77) | −0.60 (3.84) | 1.22 (3.64) | 1.79 (3.60) |
| 教师教龄 | 1.47 (0.44) | 0.74 (0.35) | 0.66 (0.36) | |
| 男孩 | −12.09 (1.54) | |||
| 免费午餐资格 | −34.70 (2.47) | |||
| 黑人 | −25.43 (4.52) | |||
| 学校哑变量 | 否 | 否 | 是 | 是 |
| \(R^2\) | 0.01 | 0.02 | 0.22 | 0.28 |
这张表值得细读,它展示了 13.1 节的几条原理:
- 加入处理前回归元后,处理效应估计几乎不变——这让人更相信随机分配也不依赖不可观测变量;\(R^2\) 上升,小班效应的标准误从 4.23 降到 3.95,体现了加控制变量提高效率。
- 教师教龄是一个「基于协变量随机化」的例子:教师只在学校内随机分配到班型。不加学校固定效应时,教龄与误差相关(富裕学区教师更资深),系数 1.47;加入学校哑变量后减半到 0.74,这才是无偏估计。10 年教龄预测提高 7.4 分,95% CI 约 (0.4, 14.5)。
- 男孩、免费午餐等控制变量的系数没有因果解释。
效应大小。 换算成成绩标准差单位:幼儿园成绩标准差 73.75,小班效应 \(13.9/73.75=0.19\),标准误 \(4.23/73.75=0.06\)。各年级小班效应约为 0.19、0.33、0.23、0.21 个标准差,助教约为 0。另一种比较:小班效应 13.9 分略大于男女差距(约 12 分),约等于「20 年老教师 vs 新教师」(\(0.66\times20\approx13\))。效应集中在最早年级,之后保持而不扩大。Krueger (1999) 以初始班型分配作工具变量做 TSLS 处理换班问题,结果与 OLS 相近。
13.3.3 实验估计与观测估计的对比
STAR 小班平均比常规班少约 7.5 人。第 9 章加州线性回归斜率 −0.73,预测减少 7.5 人提高 \(0.73\times7.5\approx5.5\) 分;加州学生间成绩标准差约 38,效应约 0.14 个标准差。
表 13.4
| 研究 | \(\hat\beta_1\) | 成绩标准差 | 效应(标准差单位) | 95% CI |
|---|---|---|---|---|
| STAR(K) | −13.90 (4.23) | 73.8 | 0.19 (0.06) | [0.08, 0.30] |
| 加州 | −0.73 (0.26) | 38.0 | 0.14 (0.05) | [0.04, 0.24] |
| 麻省 | −0.64 (0.27) | 39.0 | 0.12 (0.05) | [0.02, 0.22] |
观测估计略小,但置信区间大幅重叠,三项研究惊人地一致。差异可能来自观测研究残余的测量误差(学区平均师生比不等于实际班级人数,变量误差偏误使系数偏向零),也可能来自年代、地区、年级不同带来的外部有效性差异。这个对比说明:精心控制的观测研究可以接近实验结论,实验是检验观测研究的标尺。
13.4 准实验
13.4.1 定义与例子
准实验中,个体境遇的某种变化使处理「仿佛」被随机分配。来源可以是法律制度的偶然性、地点、政策实施时点、出生日期、降雨等。分两类:
- 处理本身仿佛随机:直接以 \(X_i\) 为回归元做 OLS。
- 仿佛随机的变化只部分决定处理:用该变化作工具变量做 IV。
原书三个例子:
- 移民对劳动市场的影响(处理仿佛随机)。移民倾向去劳动需求旺盛的城市,直接回归有偏。Card (1990) 利用 1980 年马里埃尔偷渡潮(Mariel boatlift):古巴临时放开移民,约一半移民定居迈阿密。比较迈阿密与可比城市低技能工人工资的变化,结论是影响可以忽略。
- 班级规模(断点设计)。Urquiola (2006) 在玻利维亚农村利用「一个年级超过 30 人可多配一名教师」的规则。部分超过 30 人的学校并没有拿到教师,是模糊断点。结果:班级规模有显著负效应,降低约 8 人(1 个标准差)使成绩最多提高 0.3 个标准差。
- 心导管术(部分决定处理)。McClellan、McNeil 与 Newhouse (1994) 用病人住址到能做导管术医院的相对距离作为是否接受导管术的工具变量。
13.4.2 双重差分估计量
即便处理仿佛随机,研究者毕竟不控制分配,处理组和对照组在处理前就可能不同。比较结果的变化而不是水平,可以消除处理前的组间差异。
数值例(原书图 13.1):处理组处理前均值 40、处理后 80;对照组处理前 20、处理后 30。处理后的简单差 \(80-30=50\) 高估了效应,因为处理前两组已差 \(40-20=20\)。DiD \(=(80-40)-(30-20)=30\),也就是期末差距减期初差距 \(50-20=30\)。
DiD 的关键假设是平行趋势:没有处理时,两组的变化相同。它比「两组水平相同」弱得多,但仍是假设,需要用处理前数据检查。
白话解释:DiD 用对照组的变化来「预测」处理组在没有处理时会怎样变化。数值例中对照组涨了 10,所以推断处理组若无处理也会涨 10,即从 40 到 50;实际到了 80,多出的 30 归因于处理。整个推断的基石就是「本来也会涨 10」这一句。 平行趋势用潜在结果写出来是 \(E[Y(0)_{\text{after}}-Y(0)_{\text{before}}\mid\text{处理组}]=E[Y(0)_{\text{after}}-Y(0)_{\text{before}}\mid\text{对照组}]\)。它允许两组的水平任意不同,只要求「没有处理时的变化」相同。 金融直觉:评估融资融券标的扩容对股票流动性的影响。被纳入的股票通常市值更大、流动性本来就好,直接比较水平没有意义;DiD 比较「纳入前后换手率的变化」。但如果同期大盘股整体受资金青睐、换手率普遍上升得更快,平行趋势就不成立,DiD 会把这部分风格轮动也算成扩容效应。所以对照组最好选市值、行业相近但未被纳入的股票,并画出事件前各期的组间差异,看它是否平稳。
回归形式。 令 \(\Delta Y_i\) 为个体 \(i\) 实验后减实验前的值:
\(W\) 可以是处理前特征;若 \(X_i\) 条件于 \(W\) 仿佛随机,\(\hat\beta_1\) 无偏。多期面板数据可用第 10 章的固定效应方法推广。
重复截面数据上的 DiD。 重复截面(repeated cross-sectional data)是各期不同个体的截面集合,例如民调。只要各期个体来自同一总体,早期截面的个体可以充当后期处理组/对照组的「替身」。两期回归为
其中 \(G_i\) 表示是否属于处理组,\(D_t\) 在第二期为 1,\(X_{it}=G_i\times D_t\)。\(G_i\) 吸收处理组的水平差异,\(D_t\) 吸收共同的时间变化,交互项系数就是 DiD(原书习题 13.8 证明无控制变量时 \(\hat\beta_1\) 与 (13.4) 完全相等)。多于两期时用 \(T-1\) 个时期哑变量代替 \(D_t\)。
DiD 与简单差分哪个更有效? 原书习题 13.6 考虑两期面板 \(Y_{it}=\alpha_i+\beta_1X_{it}+u_{it}\),结论是
个体效应方差 \(\sigma_\alpha^2\) 大于 \(\sigma_u^2\) 时 DiD 更有效。股票之间的流动性、波动率水平差异巨大(\(\sigma_\alpha^2\) 很大),所以事件研究几乎总是比较变化。
推导拆解:两个公式的来源只差在「误差项里装了什么」。 只用第 2 期截面:\(Y_{i2}=\beta_1X_{i2}+(\alpha_i+u_{i2})\)。\(\alpha_i\) 留在误差里,误差方差为 \(\sigma_\alpha^2+\sigma_u^2\)(假设两者不相关)。 差分:第 1 期无人受处理,\(X_{i1}=0\),所以 \(\Delta Y_i=\beta_1X_{i2}+(u_{i2}-u_{i1})\)。\(\alpha_i\) 被消掉,但两期误差相减,方差变为 \(2\sigma_u^2\)(假设 \(u_{i1}\)、\(u_{i2}\) 独立)。 两者回归元相同(都是 \(X_{i2}\)),所以只需比较误差方差:\(\sigma_\alpha^2+\sigma_u^2\) 对 \(2\sigma_u^2\),即比较 \(\sigma_\alpha^2\) 与 \(\sigma_u^2\)。 这是一个权衡:差分扔掉了个体差异这个大噪声,代价是引入了一份额外的期间噪声。若 \(u\) 本身有正的序列相关,\(\mathrm{var}(u_{i2}-u_{i1})\) 小于 \(2\sigma_u^2\),差分更划算。
13.4.3 工具变量估计量
若准实验产生了影响处理接受的 \(Z_i\),同时观测到 \(Z_i\) 与实际处理 \(X_i\),且 \(Z_i\)(可能在控制 \(W_i\) 后)仿佛随机,就用 TSLS 估计 (13.2)。注意 (13.2) 中的控制变量也要出现在第一阶段。
13.4.4 回归断点估计量
情形:处理全部或部分取决于可观测变量 \(W\) 是否越过阈值 \(w_0\)。例:学年 GPA 低于阈值须上暑期学校。比较 GPA 刚好低于和刚好高于阈值的学生的后续结果。只要阈值本身除了决定暑期学校外没有特殊意义,阈值处结果的跳跃就归因于处理。
精确断点(sharp regression discontinuity):处理完全由阈值决定,\(X_i=1\) 若 \(W_i<w_0\),否则 \(X_i=0\)。阈值处 \(Y\) 的跳跃等于 \(W=w_0\) 子总体的平均处理效应。若除断点外回归函数对 \(W\) 线性,
非线性时用 \(W\) 的多项式或只用阈值附近的样本(局部线性)。
白话解释:(13.8) 中 \(X_i\) 完全由 \(W_i\) 决定,看起来 \(X\) 和 \(W\) 共线,为什么还能估计?因为 \(X\) 是 \(W\) 的跳跃函数,而 \(\beta_2W\) 是平滑的直线。回归在阈值两侧各拟合一条直线,两条线在 \(w_0\) 处的落差就是 \(\beta_1\)。识别全靠「平滑的部分不会在阈值处突然跳一下」这一假设。 断点设计的说服力来自一个朴素的事实:排名 299 和排名 301 的股票,在市值、行业、基本面上几乎没有系统差异,差别只在一个被纳入指数、一个没有。阈值附近就像一场小型的随机实验。代价是结论只适用于阈值附近的股票(与 LATE 同理),不能直接推广到排名第 50 的大盘股。 一个必须检查的威胁是操纵:如果个体能精确控制自己落在阈值哪一侧(例如公司知道标准后刻意调整),阈值两侧就不再可比。常见做法是检查阈值两侧样本密度是否连续。
模糊断点(fuzzy regression discontinuity):越过阈值影响但不完全决定处理。此时 \(X_i\) 一般与 \(u_i\) 相关(谁被豁免、谁自愿参加含有选择)。若越过阈值只通过提高处理概率影响结果,令 \(Z_i=1\)(\(W_i<w_0\)),\(Z_i\) 就是 \(X_i\) 的有效工具。直观上,模糊 RD 估计 = 结果在阈值处的跳跃 ÷ 处理概率在阈值处的跳跃。
推导拆解:这就是第 12 章 Wald 估计量的「局部版本」。以量化实战第 3 部分为例: 第一步,看结果在阈值处跳了多少(简约式):被动持股变化跳了 1.491。 第二步,看纳入概率在阈值处跳了多少(第一阶段):从约 10% 跳到约 85%,跳了 0.734。 第三步,结果的跳跃全部来自纳入概率的跳跃,所以「纳入一只股票」的效应是 \(1.491/0.734=2.03\)。 为什么不能直接用 1.491?因为越线只让 73% 的股票「多被纳入」,1.491 是被稀释后的效应(类似 ITT),除以 0.734 才还原为单只纳入股票的效应。
13.5 准实验的潜在问题
13.2 节的威胁同样适用,但含义有所变化:
- 随机化失败:仿佛随机并不真随机。可以把 \(X\)(或 \(Z\))对可观测特征 \(W\) 回归检验,但与不可观测因素的相关无法检验,只能依靠专业知识判断。
- 未遵守处理协议:对应「仿佛随机只影响而不决定处理」,此时 OLS 不一致,IV 可以一致。
- 样本流失:因个人选择流失会产生样本选择偏误。
- 实验效应:准实验中个体通常不知道自己在「实验」中,霍桑效应一般不存在,这是准实验的优点。
- 工具的有效性:相关性可用第 12 章的第一阶段 F 统计量检验;外生性更依赖判断。常见误区:随机分配的工具不一定外生。 Angrist (1990) 用越战征兵抽签号码作为服役的工具:号码确实随机,但如果低号码引发规避征兵的行为(例如延长学业),而这些行为本身影响后来的收入,\(Z_i\) 就与 \(u_i\) 相关。导管术研究中,住得离医院近的病人可能医疗可及性更好、本来就更健康。
外部有效性:制造仿佛随机性的特殊事件往往带来其他特殊性。Card 的结论难以推广到其他来源国移民或其他城市;越战时期服役的结论大概不能推广到和平时期。
13.6 异质总体中的实验与准实验估计
现在允许因果效应因人而异,且依赖不可观测因素,称为异质总体(heterogeneous population)。模型为
平均因果效应为 \(E(\beta_{1i})\)。本节结论:\(X_i\) 随机分配时 OLS 一致估计 ATE;IV 一般不是,它估计以「工具对个体影响程度」为权重的加权平均。
13.6.1 OLS
\(\hat\beta_1=s_{XY}/s_X^2\xrightarrow{p}\sigma_{XY}/\sigma_X^2\)。随机分配使 \(X_i\) 独立于包括 \(\beta_{1i}\) 在内的一切个体特征:
最后一步:\(\text{cov}(\beta_{1i}X_i,X_i)=E(\beta_{1i}X_i^2)-E(\beta_{1i}X_i)E(X_i)=E(\beta_{1i})[E(X_i^2)-(EX_i)^2]=E(\beta_{1i})\sigma_X^2\),用到了 \(\beta_{1i}\) 与 \(X_i\) 独立。
13.6.2 IV 与局部平均处理效应
第一阶段同样允许异质:
设 \(Z_i\) 随机分配,独立于 \((u_i,v_i,\pi_{1i},\beta_{1i})\),且 \(E(\pi_{1i})\neq0\)。原书附录 13.2 推导出 \(\sigma_{ZX}=\sigma_Z^2E(\pi_{1i})\)、\(\sigma_{ZY}=\sigma_Z^2E(\beta_{1i}\pi_{1i})\),因此
推导拆解:两个协方差的来源(原书附录 13.2 的思路)。 第一步,求 \(\sigma_{ZX}\)。由 (13.11),\(\mathrm{cov}(Z_i,X_i)=\mathrm{cov}(Z_i,\pi_{1i}Z_i)+\mathrm{cov}(Z_i,v_i)\)。\(Z\) 独立于 \(v\),第二项为 0。第一项与 (13.10) 的推导完全相同:\(Z\) 独立于 \(\pi_{1i}\),所以 \(\mathrm{cov}(Z_i,\pi_{1i}Z_i)=E(\pi_{1i})\sigma_Z^2\)。 第二步,求 \(\sigma_{ZY}\)。把 (13.11) 代入 (13.9):\(Y_i=\beta_0+\beta_{1i}\pi_0+\beta_{1i}\pi_{1i}Z_i+\beta_{1i}v_i+u_i\)。对 \(Z_i\) 取协方差时,除 \(\beta_{1i}\pi_{1i}Z_i\) 外,其他项都与 \(Z_i\) 独立,协方差为 0;剩下一项同理得 \(E(\beta_{1i}\pi_{1i})\sigma_Z^2\)。 第三步,相除,\(\sigma_Z^2\) 约掉,得 (13.12)。 读法:分子 \(E(\beta_{1i}\pi_{1i})\) 是「效应 × 被工具推动的程度」的平均。被工具推动得多的人(\(\pi_{1i}\) 大)在平均中权重大;完全不受工具影响的人(\(\pi_{1i}=0\)),不管效应多大都不进入估计。
这是个体效应的加权平均,权重 \(\pi_{1i}/E(\pi_{1i})\) 衡量工具对个体是否接受处理的影响。它称为局部平均处理效应(local average treatment effect, LATE,Imbens & Angrist 1994);「局部」指权重集中在处理状态最受工具影响的那部分人身上。
LATE = ATE 的三种特例:(1) 效应对所有人相同,\(\beta_{1i}=\beta_1\);(2) 工具对每个人影响相同,\(\pi_{1i}=\pi_1\);(3) 两种异质性不相关,\(\text{cov}(\beta_{1i},\pi_{1i})=0\),因为 \(E(\beta_{1i}\pi_{1i})=\text{cov}(\beta_{1i},\pi_{1i})+E(\beta_{1i})E(\pi_{1i})\)。
一般情形的例子:工人可自愿参加培训,随机发放优先号 \(Z\)。一半工人知道自己能受益:\(\beta_{1i}=\beta_1^+>0\),\(\pi_{1i}=\pi_1^+>0\);另一半知道无效,录取了也不去:\(\beta_{1i}=\beta_1^-\),\(\pi_{1i}=0\)。则 ATE \(=\frac12(\beta_1^++\beta_1^-)\),而 \(E(\pi_{1i})=\frac12\pi_1^+\),\(E(\beta_{1i}\pi_{1i})=\frac12\beta_1^+\pi_1^+\),所以 LATE \(=\beta_1^+\)。IV 估计的是「会因工具而改变行为者」的效应,对永不参加者权重为零。
令人不安的推论:两个研究者用两个都有效的不同工具,即使样本无穷大也会得到不同的「因果效应」,因为它们是不同的加权平均;过度识别 J 检验也可能因此拒绝,尽管两个工具都有效。导管术研究的 IV 估计接近零,一种解释是:IV 估计的是距离对其是否手术起关键作用的边际病人的效应,而这些病人可能恰恰是手术获益较小的较健康者。
13.7 结论
可行的随机对照实验能提供有力证据,但有内部、外部有效性威胁,经济学中还受伦理和成本限制。实验的思想可以用于准实验:DiD、IV、回归断点。准实验的优点是仿佛随机性的来源通常透明,可以具体评估;主要威胁是仿佛随机并不真正随机。准实验是观测数据与真实验之间的桥梁,它帮助我们思考去哪里找数据、去哪里找工具、怎样审查外生性假设。
量化实战
本章方法在量化里的位置
执行算法与交易系统的 A/B 测试。 这是二级市场里少数可以做真实随机实验的场景:把母单随机分配给新旧两个执行算法(或两种下单路由、两种报价逻辑),比较实施落差(implementation shortfall)。本章的全部要点都直接适用:
- 用 (13.1) 的差分估计量估计效应,加入订单规模、下单前波动率、价差等处理前变量提高精度;不要加入成交率、实际成交时长这类受算法影响的结果变量。
- 做随机化检验:把分配变量对订单特征回归,稳健 F 不显著才说明分组平衡。
- 若按订单规模分层随机(大单更多分给新算法),必须控制分层变量。
- 同一交易日的订单受相同市场环境影响,误差在日内相关,应按交易日(或标的)聚类标准误。
- 样本流失:未完成、被撤销的订单若与算法有关(例如新算法更容易因限价未成交而撤单),只比较完成订单会产生选择偏误;应按「意向处理」(按初始分配)比较全部订单,必要时把初始分配当工具。
- 一般均衡效应:小规模试运行有效,全面切换后对手方可能识别并针对你的下单模式。
政策与事件评估的 DiD。 涨跌停规则、印花税调整、融资融券或沪深港通标的扩容、指数调入调出、做市商制度引入,都可以构造「受影响股票 vs 相似的未受影响股票」的 DiD。量化研究中常用双向固定效应回归 \(Y_{it}=\alpha_i+\gamma_t+\beta(G_i\times D_t)+u_{it}\),标准误按股票聚类。平行趋势用处理前数据做安慰剂检验,或画出逐期的处理组–对照组差异(事件研究图)。
指数成分边界的回归断点。 指数按市值排名编制(例如罗素 1000/2000 的分界、宽基指数的成分边界),排名刚好在阈值两侧的股票基本面相近,但被动资金持仓截然不同。这是研究指数纳入效应、被动资金对价格与流动性影响的经典设计。由于缓冲区规则、流动性筛选等,排名越线并不必然纳入,属于模糊断点,要以「越线」为工具。
相关不是因果。 因子回归里的「暴露 → 收益」系数通常不是因果效应。做预测不需要因果(见第 14、15 章),但若问题是「如果我们改变 X 会怎样」(例如改变交易方式、监管改变某项规则),就需要本章的识别思路。LATE 的启示也直接适用:不同事件冲击(不同「工具」)估计出的效应不同,往往是因为作用于不同的边际群体,不应强行认定哪一个才是「真实」效应。
示例:A/B 测试、事件 DiD 与指数边界模糊断点
import numpy as np
import pandas as pd
import statsmodels.api as sm
import statsmodels.formula.api as smf
rng = np.random.default_rng(13)
# ---- 1. 执行算法 A/B 测试:差分估计量、处理前协变量、随机化检验 ----
n = 4000
size = rng.lognormal(0, 1, n) # 订单规模(占日均成交量的 %)
vol = rng.uniform(1, 4, n) # 下单前 20 日波动率(%)
algo_b = rng.integers(0, 2, n) # 随机分配:1 = 新算法 B
# 执行落差(bps):规模、波动率是主要驱动;B 算法真实效应 = -1.5 bps
shortfall = 2 + 3.0*np.log1p(size) + 2.5*vol - 1.5*algo_b + rng.normal(0, 6, n)
ab = pd.DataFrame(dict(y=shortfall, B=algo_b, lsize=np.log1p(size), vol=vol))
m1 = smf.ols("y ~ B", ab).fit(cov_type="HC1")
m2 = smf.ols("y ~ B + lsize + vol", ab).fit(cov_type="HC1")
print(f"差分估计量 B = {m1.params['B']:.3f} (SE {m1.bse['B']:.3f})")
print(f"加处理前协变量 B = {m2.params['B']:.3f} (SE {m2.bse['B']:.3f})")
chk = smf.ols("B ~ lsize + vol", ab).fit(cov_type="HC1") # 线性概率模型 + 稳健 SE
print(f"随机化检验:B 对协变量回归的稳健 F = {chk.fvalue:.2f}, p = {chk.f_pvalue:.3f}")
# ---- 2. 指数纳入事件的双重差分(面板 DiD,按股票聚类)----
N, T, T0 = 400, 24, 12 # 400 只股票、24 个月,第 12 月起生效
treat = (np.arange(N) < 120).astype(int) # 前 120 只被调入指数
alpha_i = rng.normal(0, 0.5, N) + 0.4*treat # 处理组本来就更活跃(水平差异)
gamma_t = 0.02*np.arange(T) + rng.normal(0, 0.05, T) # 共同时间冲击
rows = []
for i in range(N):
e = np.zeros(T); e[0] = rng.normal(0, 0.3)
for t in range(1, T): # 个股误差 AR(1),同一股票跨期相关
e[t] = 0.8*e[t-1] + rng.normal(0, 0.3)
for t in range(T):
post = int(t >= T0)
y = alpha_i[i] + gamma_t[t] + 0.15*treat[i]*post + e[t] # 真实效应 0.15
rows.append((i, t, treat[i], post, y))
pn = pd.DataFrame(rows, columns=["stock", "month", "G", "D", "lturn"])
g = pn.groupby(["G", "D"])["lturn"].mean()
print(f"\n事后简单差 = {g[1,1]-g[0,1]:.3f}")
print(f"DiD (13.4) = {(g[1,1]-g[1,0])-(g[0,1]-g[0,0]):.3f}")
did = smf.ols("lturn ~ G + D + G:D", pn).fit(cov_type="cluster",
cov_kwds={"groups": pn["stock"]})
print(f"回归 (13.7) G×D = {did.params['G:D']:.3f} 聚类SE {did.bse['G:D']:.3f}")
tw_model = smf.ols("lturn ~ G:D + C(stock) + C(month)", pn)
tw = tw_model.fit(cov_type="cluster", cov_kwds={"groups": pn["stock"]})
tw_iid = tw_model.fit()
print(f"双向固定效应 G×D = {tw.params['G:D']:.3f} 聚类SE {tw.bse['G:D']:.3f}"
f" (误用 i.i.d. SE {tw_iid.bse['G:D']:.3f})")
# 安慰剂:只用事件前数据,假装第 6 月生效
pre = pn[pn.month < T0].copy(); pre["Dp"] = (pre.month >= 6).astype(int)
pl = smf.ols("lturn ~ G + Dp + G:Dp", pre).fit(cov_type="cluster",
cov_kwds={"groups": pre["stock"]})
print(f"安慰剂 DiD = {pl.params['G:Dp']:.3f} (p = {pl.pvalues['G:Dp']:.2f})")
# ---- 3. 指数成分边界的模糊断点:以“排名越线”为工具 ----
M = 20000
rank = rng.uniform(150, 450, M) # 市值排名,阈值 300(W < 300 应纳入)
Z = (rank < 300).astype(int)
quality = rng.normal(0, 1, M) # 不可观测:基本面质量
# 排名越线使纳入概率从 ~10% 跳到 ~85%;质量也影响是否纳入(选择)
p_in = np.clip(0.10 + 0.75*Z + 0.05*quality, 0, 1)
X = (rng.uniform(size=M) < p_in).astype(int)
# 结果:被动资金持股比例变化;纳入效应 = 2.0;排名本身有平滑影响;质量影响结果
Y = 5 - 0.01*(rank-300) + 2.0*X + 1.0*quality + rng.normal(0, 1, M)
rd = pd.DataFrame(dict(Y=Y, X=X, Z=Z, W=rank-300))
h = 60 # 带宽:只用阈值附近 ±60 名
loc = rd[rd.W.abs() <= h]
ols = smf.ols("Y ~ X + W", loc).fit(cov_type="HC1")
fs = smf.ols("X ~ Z + W + Z:W", loc).fit(cov_type="HC1") # 第一阶段:X 在阈值的跳跃
rf = smf.ols("Y ~ Z + W + Z:W", loc).fit(cov_type="HC1") # 简约式:Y 在阈值的跳跃
print(f"\n局部 OLS(把 X 当外生)= {ols.params['X']:.3f}")
print(f"第一阶段跳跃 = {fs.params['Z']:.3f} (F = {fs.tvalues['Z']**2:.0f})")
wald = rf.params['Z']/fs.params['Z']
# 用 TSLS 得到同一估计及其标准误:X 由 Z 工具,W 与 Z:W 为外生控制
from statsmodels.sandbox.regression.gmm import IV2SLS
exog = sm.add_constant(np.column_stack([loc.X, loc.W, loc.Z*loc.W]))
inst = sm.add_constant(np.column_stack([loc.Z, loc.W, loc.Z*loc.W]))
iv = IV2SLS(loc.Y.values, exog, inst).fit()
print(f"模糊 RD = 简约式跳跃/第一阶段跳跃 = {rf.params['Z']:.3f}/{fs.params['Z']:.3f}"
f" = {wald:.3f}; TSLS = {iv.params[1]:.3f} (SE {iv.bse[1]:.3f})")
关键输出:
差分估计量 B = -1.465 (SE 0.209)
加处理前协变量 B = -1.452 (SE 0.193)
随机化检验:B 对协变量回归的稳健 F = 0.29, p = 0.747
事后简单差 = 0.652
DiD (13.4) = 0.196
回归 (13.7) G×D = 0.196 聚类SE 0.044
双向固定效应 G×D = 0.196 聚类SE 0.045 (误用 i.i.d. SE 0.018)
安慰剂 DiD = 0.009 (p = 0.84)
局部 OLS(把 X 当外生)= 2.346
第一阶段跳跃 = 0.734 (F = 2350)
模糊 RD = 简约式跳跃/第一阶段跳跃 = 1.491/0.734 = 2.031; TSLS = 2.031 (SE 0.087)
读结果:
- A/B 测试:两种估计都接近真值 −1.5 bps;加入处理前协变量后点估计几乎不变,标准误从 0.209 降到 0.193。随机化检验不拒绝,说明分组平衡。
- DiD:处理组本来就更活跃,事后简单差 0.652 把水平差异也算成了效应;DiD 去掉了它,0.196 与真值 0.15 相差约一个标准误。四种写法(均值公式、(13.7) 回归、双向固定效应)给出同一个点估计。个股误差高度自相关时,误用 i.i.d. 标准误(0.018)只有聚类标准误(0.045)的四成,t 值会被夸大一倍多。安慰剂检验不显著,支持平行趋势。
- 模糊 RD:纳入与否受不可观测的「质量」影响,把纳入当外生的局部 OLS(2.346)高估了效应;以排名越线为工具的模糊 RD(2.031)接近真值 2.0。简约式跳跃除以第一阶段跳跃,与 TSLS 完全相同。示例中
IV2SLS给出的是同方差标准误,正式研究应改用稳健标准误。
本章小结
因果效应用潜在结果定义;个体效应不可观测,但随机分配使处理组与对照组的均值差一致估计平均处理效应。分析实验数据用差分估计量,加入处理前变量提高效率,基于协变量随机化时必须控制协变量。实验的内部有效性威胁包括未随机化(用随机化 F 检验发现)、部分依从(用初始分配作工具)、与处理相关的流失、实验效应和小样本;外部有效性威胁包括样本与项目不具代表性和一般均衡效应。Project STAR 显示小班效应约 0.2 个标准差、助教几乎无效,并与加州、麻省的观测估计高度一致。准实验利用仿佛随机的变化:处理仿佛随机时用 OLS 或 DiD,只部分决定处理时用 IV;回归断点利用阈值,模糊断点以「是否越线」为工具。随机产生的工具不必然外生。效应异质时,随机分配下 OLS 一致估计 ATE,IV 估计以工具影响程度加权的 LATE,不同有效工具可以得到不同的 LATE。
| 概念 | 公式 / 要点 |
|---|---|
| ATE | \(E[Y_i(1)-Y_i(0)]\);随机分配下 \(=E(Y\mid X=1)-E(Y\mid X=0)\) |
| 差分估计量 | \(Y_i=\beta_0+\beta_1X_i+u_i\);加处理前 \(W\) 提高效率 |
| 条件均值独立 | \(E(u_i\mid X_i,W_i)=E(u_i\mid W_i)\):\(\hat\beta_1\) 无偏,\(\hat\gamma\) 无因果解释 |
| 随机化检验 | \(X\) 对处理前 \(W\) 回归,稳健 F 检验系数全为零 |
| 部分依从 | 以初始随机分配 \(Z\) 为工具做 TSLS |
| DiD | \(\Delta\bar Y^{\text{treat}}-\Delta\bar Y^{\text{control}}\);回归中为 \(G_i\times D_t\) 的系数 |
| 精确 RD | \(Y_i=\beta_0+\beta_1X_i+\beta_2W_i+u_i\),\(X_i=1\{W_i<w_0\}\) |
| 模糊 RD | 以 \(Z_i=1\{W_i<w_0\}\) 为 \(X_i\) 的工具;= 结果跳跃 / 处理概率跳跃 |
| 异质效应下 OLS | \(\hat\beta_1\xrightarrow{p}E(\beta_{1i})\)(随机分配) |
| LATE | \(\hat\beta_1^{TSLS}\xrightarrow{p}E(\beta_{1i}\pi_{1i})/E(\pi_{1i})\) |
练习
基础
- (原书习题 13.3)SAT 辅导课实验:处理组平均分 1348(标准差 87.3,男 60 人、女 40 人),对照组 1395(标准差 82.1,男 40 人、女 60 人)。估计 ATE 及其标准误;分组像是随机的吗? 答案要点:ATE \(=1348-1395=-47\),SE \(=\sqrt{87.3^2/100+82.1^2/100}\approx12.0\)。处理组男生 60%、对照组 40%,比例差 0.2,SE \(\approx\sqrt{0.24/100+0.24/100}=0.069\),\(t\approx2.9\),拒绝「性别比例相同」,分配可能不随机,应控制性别后再估计。
- 用原书图 13.1 的数字(处理组前 40、后 80;对照组前 20、后 30)计算事后差、事前差和 DiD,并说明 DiD 依赖的假设。 答案要点:50、20、30;平行趋势——没有处理时两组变化相同。
- (原书复习题 13.1)肥料实验把前 25 块地分给处理 1、接下来 25 块分给处理 2,依此类推。问题在哪里? 答案要点:地块位置可能与土壤肥力、排水等相关,处理与遗漏因素相关;应随机分配地块。
- (原书习题 13.5 改编)宿舍网络与成绩实验:(a) 处理组的男运动员大量退出;(b) 对照组学生自己装了网络;(c) 处理组艺术生不会用网络;(d) 经济学学生向对照组转卖网络。分别属于哪类威胁? 答案要点:(a) 样本流失;(b)(d) 未遵守协议(对照组获得处理);(c) 未遵守协议(处理组实际未接受处理)。(b)(c)(d) 可用初始分配作工具。
- 一个执行算法 A/B 测试中,研究员只比较「已全部成交」的订单。为什么这可能有偏?怎么修正? 提示:样本流失与处理相关(选择偏误);按初始分配比较全部订单(意向处理效应),或以初始分配为工具估计实际使用算法的效应。
进阶
- (原书习题 13.8)证明:在 \(Y_{it}=\beta_0+\beta_1X_{it}+\beta_2G_i+\beta_3D_t+u_{it}\)(\(X_{it}=G_iD_t\))中,OLS 的 \(\hat\beta_1\) 等于 (13.4) 的 DiD。 提示:四个回归元(含截距)对应四个格子均值,回归是饱和的,拟合值等于各格均值;解出 \(\hat\beta_1\)。
- (原书习题 13.6)在两期面板 \(Y_{it}=\alpha_i+\beta_1X_{it}+u_{it}\) 中(第 1 期无人受处理),比较只用第 2 期截面的差分估计量与 DiD 的大样本方差。 答案要点:前者 \((\sigma_u^2+\sigma_\alpha^2)/\text{var}(X_{i2})\),后者 \(2\sigma_u^2/\text{var}(X_{i2})\);\(\sigma_\alpha^2>\sigma_u^2\) 时 DiD 更有效。
- (原书习题 13.9)证明 (13.10) 的最后一个等号。 提示:利用 \(\beta_{1i}\) 与 \(X_i\) 独立,\(E(\beta_{1i}X_i^2)=E(\beta_{1i})E(X_i^2)\)。
- 在 13.6.2 节的培训例子中,设 \(\beta_1^+=10\)、\(\beta_1^-=-2\)、\(\pi_1^+=0.8\)。计算 ATE 与 LATE,并解释为什么一位用不同工具(例如强制参加的法令,使所有人 \(\pi_{1i}=1\))的研究者会得到不同结果。 答案要点:ATE \(=4\),LATE \(=10\);强制法令下工具对每人影响相同,LATE = ATE = 4。
- 修改本章代码第 3 部分,把带宽 \(h\) 分别取 20、60、150,观察模糊 RD 估计和标准误的变化;再把结果方程中排名的影响改成二次项,看大带宽下的局部线性估计是否出现偏差。 提示:带宽小方差大;真实函数非线性时,带宽大会引入偏差——这是断点设计中的偏差–方差权衡。
原书推荐习题:13.3(ATE 与随机化检验);13.4、13.6、13.8(DiD 的两种抽样设计、效率比较、回归表示,对事件研究最有用);13.9、13.10(异质系数下 OLS 何时一致);13.12(潜在结果框架下哪些量可识别:效应的方差和中位数不可识别,因为不知道两潜在结果的联合分布);复习题 13.5 与习题 13.11(LATE 与 ATE);实证题 E13.1(Bertrand & Mullainathan 2004 简历实验,完整的实验数据分析流程)。
原书对照
| 本章内容 | 原书章节 | PDF 页码 |
|---|---|---|
| 章引言 | 第 13 章开篇 | p.475–476 |
| 潜在结果、ATE、差分估计量、基于协变量随机化 | 13.1 | p.476–478 |
| 实验有效性威胁、霍桑效应专栏 | 13.2 | p.479–482 |
| Project STAR(表 13.1–13.4)、墨西哥现金转移专栏 | 13.3 | p.483–491 |
| 准实验:例子、DiD、重复截面、IV、回归断点 | 13.4 | p.491–497 |
| 准实验的潜在问题 | 13.5 | p.497–498 |
| 异质总体:OLS 与 LATE | 13.6 | p.498–503 |
| 结论 | 13.7 | p.504 |
| 复习题、习题与实证题 | 第 13 章末 | p.506–511 |
| STAR 数据、异质效应下 IV 的推导、潜在结果框架 | 附录 13.1–13.3 | p.511–514 |
注:原书页码 = PDF 页码 − 1。