精读笔记:James H. Stock & Mark W. Watson《Introduction to Econometrics》(Global Edition),负责 PDF 第 475–649 页(第 13–16 章)
说明:原书正文页码 = PDF 页码 − 1(如 PDF p.475 对应书页 474)。公式按上下文还原,\(\hat\beta\) 等符号为抽取时丢失后的重建。
第 13 章 实验与准实验(Experiments and Quasi-Experiments)
章首导言(PDF p.475–476)
- 医学、心理学中因果效应常用实验估计:新药需经过随机对照试验(randomized controlled experiment),部分病人随机服药,其余服安慰剂(placebo)。
- 计量课程学习随机对照实验的三个理由:
- 理想随机对照实验是评判观测数据(observational data)因果估计的概念基准;
- 真实实验影响力大,需理解其局限与有效性威胁;
- 外部环境有时产生“仿佛随机”(as if random)的处理分配,形成准实验(quasi-experiment)或自然实验(natural experiment),实验分析方法可(稍加修改)用于准实验。
- 本章工具仍是多元回归、面板回归和工具变量(IV)回归;区别在于数据类型与分析机会。
- 应用领域为项目评估(program evaluation):估计一个项目、政策或干预(“处理”,treatment)的效应。例:职业培训对收入的效应、最低工资上调对低技能工人就业的效应、低息助学贷款对大学入学的效应。
- 章节安排:13.1 潜在结果与理想实验;13.2 实验有效性威胁;13.3 田纳西 STAR 班级规模实验;13.4 准实验;13.5 准实验有效性威胁;13.6 异质总体中的因果效应解释。
13.1 潜在结果、因果效应与理想实验(PDF p.476–478)
潜在结果与平均因果效应。
- 潜在结果(potential outcome):个体在某一潜在处理下的结果。个体因果效应 = 接受处理时的潜在结果 − 未接受处理时的潜在结果。
- 根本难题:个体要么接受处理要么不接受,两个潜在结果只能观察到一个,因此无法测量单个个体的因果效应。
- 但很多应用只需总体平均:个体因果效应在总体中的均值称为平均因果效应(average causal effect)或平均处理效应(average treatment effect, ATE)。
- 识别逻辑:(1) 从总体中简单随机抽取受试者 ⇒ 样本中因果效应的期望 = 总体平均因果效应;(2) 将受试者随机分配到处理组/对照组 ⇒ 处理状态与潜在结果独立。两者结合:
\[\text{ATE} = E(Y_i\mid X_i=1) - E(Y_i\mid X_i=0)\]即理想随机对照实验中处理组与对照组结果期望之差(附录 13.3 给出数学推导)。
- 个体因果效应可能依赖可观测变量(如第 8 章班级规模效应依赖是否英语学习者)和不可观测变量。13.5 节之前只考虑依赖可观测变量的异质性,13.6 节处理依赖不可观测变量的情形。
分析实验数据的计量方法。
- 差分估计量(differences estimator):处理组与对照组样本均值之差,等价于对二元处理指示变量回归
\[Y_i = \beta_0 + \beta_1 X_i + u_i,\quad i=1,\dots,n \tag{13.1}\]若 \(X\) 随机分配,则 \(E(u_i\mid X_i)=0\),OLS 的 \(\hat\beta_1\) 无偏且一致。
- 带附加回归元的差分估计量(differences estimator with additional regressors):
\[Y_i = \beta_0 + \beta_1 X_i + \beta_2 W_{1i} + \cdots + \beta_{1+r} W_{ri} + u_i \tag{13.2}\]
- 若 \(W\) 能解释 \(Y\) 的变异,加入 \(W\) 会降低回归标准误,通常也降低 \(\hat\beta_1\) 的标准误(提高效率)。
- 无偏条件:条件均值独立 \(E(u_i\mid X_i,W_i)=E(u_i\mid W_i)\)。若 \(W\) 是处理前(pretreatment)个体特征(如性别)且 \(X\) 随机分配,该条件成立。
- 误区:\(W\) 不能包含实验结果变量(给定实验结果后 \(X\) 不再随机);控制变量系数没有因果解释。
- 估计依赖可观测变量的因果效应:如第 8 章,加入 \(X_i\) 的非线性函数或交互项,例如 \(W_{1i}\) 为性别哑变量,加入 \(W_{1i}\times X_i\) 可分别估计男女的效应。
- 基于协变量的随机化(randomization based on covariates):分配到处理组的概率依赖可观测 \(W\)。此时 (13.1) 的简单差分估计量一般有遗漏变量偏误。例:计量课“强制作业 vs 可选作业”实验中,经济学专业学生(\(W_i=1\))以更高概率被分到强制作业组(\(X_i=1\)),若专业学生本来就成绩更好,则处理与遗漏变量“是否专业”相关。解决:在 (13.2) 中控制 \(W_i\)。由于给定 \(W_i\) 时 \(X_i\) 随机分配,\(E(u_i\mid X_i,W_i)=E(u_i\mid W_i)\);若处理效应对专业/非专业相同,Key Concept 6.6 中带控制变量的因果推断第一条最小二乘假设成立,\(\hat\beta_1\) 无偏;若效应不同,需加交互项 \(X_i\times W_i\)。
13.2 实验有效性的威胁(Threats to Validity of Experiments)(PDF p.479–482)
回顾 Key Concept 9.1:内部有效性(internal validity)指对所研究总体的因果推断有效;外部有效性(external validity)指结论可推广到其他总体与环境。
内部有效性威胁(五项):
- 未能随机化(failure to randomize):分配依赖受试者特征或偏好,结果混入非随机分配的效应。例:按姓氏首字母前后半段分组,由于族裔与姓氏相关,族裔及其相关的工作经验、教育等遗漏因素在组间系统不同 ⇒ \(X_i\) 与 \(u_i\) 相关 ⇒ 偏误。
- 随机化检验:若随机分配,\(X_i\) 与处理前特征 \(W\) 不相关。将 \(X_i\) 对 \(W_{1i},\dots,W_{ri}\) 回归,用 F 统计量检验所有 \(W\) 系数为 0。若设计本身是基于协变量的随机化,则把这些协变量放入回归,F 检验只针对其余 \(W\)。脚注:\(X_i\) 为二元,这是线性概率模型,必须用异方差稳健标准误;也可用 probit/logit 检验。
- 未遵守处理协议(failure to follow the treatment protocol):处理组有人没参加培训,对照组有人设法参加,称为部分依从(partial compliance)。实际接受的处理 \(X_i\) 含选择成分,即便初始随机分配,\(X_i\) 也可能与 \(u_i\) 相关 ⇒ OLS 偏误。
- 解决:若同时有实际处理 \(X_i\) 和初始随机分配 \(Z_i\),用 \(Z_i\) 作为 \(X_i\) 的工具变量估计 (13.1) 或 (13.2)。相关性:协议部分被遵守 ⇒ 实际处理部分由分配决定;外生性:初始分配随机 ⇒ \(Z_i\) 独立于 \(u_i\)(若基于协变量随机化,则条件于 \(W_i\))。因此初始随机分配是有效工具变量。
- 样本流失(attrition):随机分配后受试者退出。若流失原因与处理无关(如回乡照顾病人)无碍;若与处理有关则有偏。例:最有能力的受训者靠新技能在外地找到工作而退出,处理组只剩能力较低者,留存样本中 \(X_i\) 与 \(u_i\)(含能力)相关 ⇒ 差分估计量有偏。与处理相关的流失造成样本选择偏误(selection bias,Key Concept 9.4)。
- 实验效应(experimental effects):仅因身处实验就改变行为,称霍桑效应(Hawthorne effect)。
- 双盲(double-blind)可缓解:受试者和实验者都不知道谁在处理组,如药物与安慰剂外观一致,两组经历相同的实验效应,结果差异可归于药物。
- 经济学实验通常无法双盲(受训者和讲师都知道是否在培训)。例:教师若认为自己的工作取决于实验成败,可能格外努力。判断需看实验细节。
- 专栏“霍桑效应”:1920–30 年代通用电气 Hawthorne 工厂调整照明、休息、工作时长等,早期报告称无论条件变好变坏生产率都上升,归因于工人感到被关注。但对原始数据的仔细检查(Gillespie 1991;Jones 1992)并未发现霍桑效应。尽管如此,受试者与结果利益相关时,实验效应仍可能威胁内部有效性。
- 小样本(small sample sizes):不造成偏误,但估计不精确,且基于正态临界值和稳健标准误的大样本推断可能失效。有时假设误差正态(3.6、5.6 节),但该假设对实验数据和观测数据一样可疑。
外部有效性威胁:
- 样本不具代表性(nonrepresentative sample):例如对刑满释放人员的培训实验结果,可能不能推广到无犯罪记录的工人(雇主对犯罪记录很敏感)。
- 项目或政策不具代表性(nonrepresentative program or policy):小规模、严格监控的实验项目与实际推广项目可能不同(质量控制、资金水平下降);实验持续时间也可能短于实际项目。
- 一般均衡效应(general equilibrium effects):小型临时项目变为大规模永久项目后,经济环境改变。例:小型培训项目补充雇主培训,但大规模推广后可能挤出雇主提供的培训,净收益下降。小实验在“市场或政策环境不变”下正确测量因果效应,但大范围实施时这些因素并不保持不变。
13.3 班级规模缩减效应的实验估计(Project STAR)(PDF p.483–491)
实验设计。
- 田纳西州 1980 年代后期的 Project STAR(Student–Teacher Achievement Ratio),为期 4 年,耗资约 1200 万美元,比较幼儿园(K)到三年级的三种班型:常规班(22–25 人,一名教师、无助教);小班(13–17 人,无助教);常规班加助教。
- 每个参与学校每种班型至少一个;1985–1986 学年入学的幼儿园学生随机分配到三组之一,教师也随机分配到班型。
- 协议原定学生 4 年留在原班型。因家长投诉,一年级开始时把常规班(含有/无助教)学生在“有助教/无助教常规班”之间重新随机分配,小班学生留在小班;一年级新入学的学生(幼儿园非强制)随机分到三组。每年进行斯坦福成就测验(Stanford Achievement Test)阅读和数学考试。
- 第一年约 6400 名学生,108 个小班、101 个常规班、99 个带助教常规班;4 年共约 11,600 名学生、80 所学校。
- 偏离设计:约 10% 学生在后续年份换班(不合群、行为问题等)。若纯为避免性格冲突,可能不引入偏误;若是最关心教育的家长施压把孩子调入小班,则会高估小班效果。此外班级人数随学生转班、迁入迁出而变化。
专栏:墨西哥农村有条件现金转移(Conditional Cash Transfers)。 1997 年项目向贫困母亲发钱,条件是孩子入学。先选 495 个贫困农村社区,普查所有家庭并划定合格家庭;然后在 495 个中随机选 314 个社区向全部合格家庭发放,其余 181 个社区作对照组。计量分析表明随机化成功产生了平衡的处理组和对照组,且干预提高了学龄儿童入学率。
STAR 数据分析。 两个处理组需两个哑变量:
- 观测不是 i.i.d.:一所学校被选中则全校学生参与,同校学生有相似的不可观测特征(如父母教育),误差在校内相关。这不导致偏误,但标准误需按学校聚类(clustered standard errors,见 10.5 节、附录 10.2)。
表 13.1(差分估计,因变量为数学+阅读总分,学校聚类标准误):
| 年级 | K | 1 | 2 | 3 |
|---|---|---|---|---|
| 小班 | 13.90 (4.23) [5.48, 22.32] | 29.78 (4.79) [20.24, 39.32] | 19.39 (5.12) [9.18, 29.61] | 15.59 (4.21) [7.21, 23.97] |
| 常规班+助教 | 0.31 (3.77) [−7.19, 7.82] | 11.96 (4.87) [2.27, 21.65] | 3.48 (4.91) [−6.31, 13.27] | −0.29 (4.04) [−8.35, 7.77] |
| 截距 | 918.04 | 1039.39 | 1157.81 | 1228.51 |
| N | 5786 | 6379 | 6049 | 5967 |
结论:各年级都在 0.5%(双侧)水平拒绝“小班无改进”;除一年级外,即便 10% 水平也不能拒绝“助教无改进”。小班效应在 K、2、3 年级大体相近,一年级更大。
表 13.2(幼儿园,加入附加回归元):四列依次为 (1) 仅处理哑变量;(2) 加教师教龄;(3) 再加学校固定效应;(4) 再加学生特征。
| 回归元 | (1) | (2) | (3) | (4) |
|---|---|---|---|---|
| 小班 | 13.90 (4.23) | 14.00 (4.25) | 15.93 (4.08) | 15.89 (3.95) |
| 常规班+助教 | 0.31 (3.77) | −0.60 (3.84) | 1.22 (3.64) | 1.79 (3.60) |
| 教师教龄 | 1.47 (0.44) | 0.74 (0.35) [0.04, 1.45] | 0.66 (0.36) | |
| 男孩 | −12.09 (1.54) | |||
| 免费午餐资格 | −34.70 (2.47) | |||
| 黑人 | −25.43 (4.52) | |||
| 非黑非白种族 | −8.50 (12.64) | |||
| 学校哑变量 | 否 | 否 | 是 | 是 |
| \(R^2\) | 0.01 | 0.02 | 0.22 | 0.28 |
| N | 5786 | 5766 | 5766 | 5748 |
- 主要结论:加入可观测回归元后,两种处理的估计与差分估计相近 ⇒ 更可信“随机分配也不依赖不可观测变量”。\(R^2\) 上升,小班效应标准误从 4.23 降至 3.95。
- 教师教龄效应:教师在学校内随机分配到班型,即随机化条件于全套学校哑变量 \(W\)(学校固定效应)。不加学校固定效应时教龄与误差相关(富裕学区教师更资深),系数 1.47;加入后减半为 0.74,是无偏估计。10 年教龄预测提高 7.4 分,95% CI 为 (0.4, 14.5)。其他控制变量系数没有因果解释。
效应大小的解释。
- 方法一:换算为考试成绩标准差单位(与 9.4 节比较加州/麻省时相同的做法)。幼儿园成绩标准差 73.75,小班效应 \(13.9/73.75=0.19\),标准误 \(4.23/73.75=0.06\)。
- 表 13.3(标准差单位):小班 K 0.19(0.06)、1 年级 0.33(0.05)、2 年级 0.23(0.06)、3 年级 0.21(0.06);助教 0.00(0.05)、0.13(0.05)、0.04(0.06)、0.00(0.06);各年级标准差 73.75、91.25、84.08、73.27。小班效应约为五分之一个标准差;一年级小班与助教班之差仍为 0.20,与其他年级一样,可能是那年对照组偶然考得差(抽样变异)。
- 方法二:与其他系数比较。小班效应 13.9 分略大于男女差距(约 12 分);教龄系数 0.66 ⇒ 20 年教龄约提高 13 分,即小班效应约等于“20 年老教师 vs 新教师”。效应在实际意义上相当大。
- 附加结果:小班效应集中在最早年级——初始分配带来的增益在高年级保持但不再扩大(K 0.19、2 年级 0.23、3 年级 0.21);助教几乎无益。针对部分学生换班(未遵守协议),Krueger (1999) 以初始班型分配为工具变量做 TSLS,结果与 OLS 相近,结论是偏离协议未引入实质偏误。外部有效性方面,考试成绩是狭窄的低龄指标;Chetty et al. (2011) 用税务数据发现幼儿园被随机分入小班的学生大学入学率更高。
观测估计与实验估计的比较。
- STAR 小班平均比常规班少约 7.5 人。加州线性 OLS 斜率 −0.73(表 9.3),预测减 7.5 人提高 \(0.73\times7.5\approx5.5\) 分;加州学生间成绩标准差约 38(脚注:学生间标准差大于学区间标准差 19.1),换算为 \(5.5/38\approx0.14\) 个标准差,标准误 \(0.26\times7.5/38\approx0.05\)。
- 表 13.4:STAR(K)\(\hat\beta_1=-13.90\)(4.23),标准差 73.8,效应 0.19(0.06),95% CI [0.08, 0.30];加州 −0.73(0.26),标准差 38.0,0.14(0.05),[0.04, 0.24];麻省 −0.64(0.27),标准差 39.0,0.12(0.05),[0.02, 0.22]。CI = 估计 ± 1.96 标准误。
- 观测估计略小,但加州、麻省的置信区间覆盖了 STAR 置信区间的大部分,三项研究惊人地一致。
- 可能差异来源:观测研究残余的内部有效性威胁(学生流动导致学区师生比测量误差 ⇒ 变量误差偏误使系数偏向 0;学区平均师生比 ≠ 实际班级人数);外部有效性(1980 年代南方州 vs 1990 年代末加州/麻省;年级不同:STAR 为 K–3,麻省四年级,加州五年级)。结果相似说明观测研究残余的内部有效性威胁较小。
13.4 准实验(Quasi-Experiments)(PDF p.491–497)
定义。 准实验(又称自然实验)中,个体境遇的变化使处理“仿佛”被随机分配。来源包括法律制度的偶然性、地点、政策实施时点、出生日期、降雨等与所研究因果效应无关的因素。两类:
- 处理本身仿佛随机决定 ⇒ 以处理 \(X_i\) 为回归元做 OLS;
- 仿佛随机的变化只部分决定处理 ⇒ IV 回归,用该随机变化作工具变量。
例子。
- 例 1:移民对劳动力市场的影响(处理仿佛随机)。理论上移民增加劳动供给、压低工资,但移民倾向去劳动需求高的城市,OLS 有偏;理想实验(随机分配移民数量到各劳动市场)在实践、财务、伦理上不可行。Card (1990) 利用 1980 年古巴临时放开移民导致的马里埃尔偷渡潮(Mariel boatlift):一半移民定居迈阿密(因已有大型古巴社区)。比较迈阿密低技能工人工资变化与可比美国城市同类工人工资变化,结论:移民涌入对低技能工人工资影响可忽略。
- 例 2:班级规模对学业的影响(断点设计)。STAR 类实验罕见,结论能否推广到其他国家存疑。Urquiola (2006) 在玻利维亚农村用回归断点设计(类似 Angrist & Lavy 1999 以色列研究)。动机:入学人数可能同时与班级规模和社会经济地位正相关,导致偏向找到“大班好”的结论。断点来源:规定一个年级超过 30 名学生可多配一名教师;但部分超过 30 人的学校并没有拿到教师,因而是“模糊”断点(fuzzy discontinuity)。结果:班级规模有显著负效应,略大于其他情境估计——“班级规模降低 1 个标准差(约 8 人)使成绩最多提高 0.3 个标准差”。
- 例 3:心导管术的效应(部分决定处理)。McClellan, McNeil & Newhouse (1994) 用病人住址到有导管术医院相对距离作为实际接受导管术的工具变量。治疗由病人特征和医患决策决定,但也受附近医院是否能做该手术影响。若住址仿佛随机且只通过影响导管术概率影响健康,则相对距离是有效工具。
双重差分估计量(differences-in-differences estimator, DiD)。
- 动机:即便处理条件于 \(W\) 仿佛随机,研究者不控制随机化,组间仍可能残留差异。比较结果的“处理前后变化”而非水平,可调整处理前 \(Y\) 的组间差异。Card (1990) 即用 DiD 比较迈阿密与其他城市的工资变化。
- 定义:
\[\hat\beta_1^{\text{diffs-in-diffs}} = (\bar Y^{\text{treatment,after}} - \bar Y^{\text{treatment,before}}) - (\bar Y^{\text{control,after}} - \bar Y^{\text{control,before}}) = \Delta\bar Y^{\text{treatment}} - \Delta\bar Y^{\text{control}} \tag{13.4}\]处理随机分配时无偏且一致。
- 回归形式:令 \(\Delta Y_i\) 为个体 \(i\) 实验后减实验前的值,
\[\Delta Y_i = \beta_0 + \beta_1 X_i + u_i \tag{13.5}\]
- 图 13.1 数值例:处理组处理前均值 40、处理后 80;对照组处理前 20、处理后 30。处理后差 \(80-30=50\) 高估了效应,因处理前已差 \(40-20=20\)。DiD \(= (80-40)-(30-20)=30\),即期末差距减期初差距 \(50-20=30\)。
- 带附加回归元的 DiD:
\[\Delta Y_i = \beta_0 + \beta_1 X_i + \beta_2 W_{1i} + \cdots + \beta_{1+r} W_{ri} + u_i \tag{13.6}\]\(W\) 可以是实验前个体特征或控制变量;若 \(X_i\) 条件于 \(W\) 仿佛随机,则条件均值独立成立,\(\hat\beta_1\) 无偏。多期面板数据时可用第 10 章面板回归方法推广。
- 重复截面数据(repeated cross-sectional data)上的 DiD:重复截面是各期不同个体的截面集合(如 2004 年 400 人、2005 年另 500 人;民调数据是典型)。前提:若个体从同一总体随机抽取,早期截面个体可作为后期处理组/对照组个体的替身(surrogate)。两期回归:
\[Y_{it} = \beta_0 + \beta_1 X_{it} + \beta_2 G_i + \beta_3 D_t + \beta_4 W_{1it} + \cdots + \beta_{3+r}W_{rit} + u_{it} \tag{13.7}\]\(G_i\):是否属于处理组(处理前时期则为替身处理组);\(D_t\):第二期为 1;\(X_{it}=G_i\times D_t\)(交互项)。若 \(X_{it}\) 条件于 \(W\) 仿佛随机,\(\hat\beta_1\) 估计因果效应。多于两期时以 \(T-1\) 个时期哑变量替代 \(D_t\)(10.4 节)。
工具变量估计量。 若准实验产生影响处理接受的 \(Z_i\),同时观测 \(Z_i\) 与实际处理 \(X_i\),且 \(Z_i\)(可能在控制 \(W_i\) 后)仿佛随机,则 \(Z_i\) 是有效工具,用 TSLS 估计 (13.2);(13.2) 中的控制变量也要出现在第一阶段。
回归断点估计量(regression discontinuity, RD)。
- 情形:处理全部或部分取决于可观测变量 \(W\) 是否越过阈值 \(w_0\)。例:学年 GPA 低于阈值须上暑期学校(脚注:简化自 Matsudaira 2008)。比较 GPA 刚好低于阈值与刚好高于阈值的学生的结果 \(Y\)(次年 GPA、辍学、未来收入)。只要阈值除了规定暑期学校外没有特殊意义,阈值处结果的跳跃就归因于暑期学校。
- 图 13.2:假想散点图,\(w_0=2.0\),\(W<2\) 须接受处理;总体回归线在 \(W=2\) 处的跳跃即处理效应。
- 精确断点(sharp RD):处理完全由是否越过阈值决定,\(X_i=1\) 若 \(W<w_0\),否则 \(X_i=0\)。阈值处 \(Y\) 的跳跃等于 \(W=w_0\) 子总体的平均处理效应(可作为更大总体 ATE 的近似)。若除断点外回归函数对 \(W\) 线性:
\[Y_i = \beta_0 + \beta_1 X_i + \beta_2 W_i + u_i \tag{13.8}\]非线性时用 \(W\) 的适当非线性函数(8.2 节)。
- 模糊断点(fuzzy RD):越过阈值影响但不完全决定处理(部分低于阈值的学生被豁免、部分高于阈值的学生仍参加)。此时 \(X_i\) 一般与 \(u_i\) 相关。若越过阈值的特殊作用仅通过提高处理概率实现(越过阈值的直接效应已被 \(W\) 的线性项吸收),则令 \(Z_i=1\) 若 \(W_i<w_0\),否则 0,\(Z_i\) 是 \(X_i\) 的有效工具,用 IV 估计 (13.8)。
13.5 准实验的潜在问题(PDF p.497–498)
内部有效性威胁(13.2 节的威胁同样适用,但需修改):
- 随机化失败:若仿佛随机未产生随机的 \(X\)(或 \(Z\)),OLS 有偏(IV 不一致)。检验:将 \(X\)(或 \(Z\))对个体特征 \(W\) 回归,检验系数为 0;若存在不能由准实验性质解释的差异,说明没有真正随机。但即使与 \(W\) 无关,仍可能与不可观测因素相关——这无法检验,只能依靠专业知识和判断。
- 未遵守处理协议:在准实验中对应“仿佛随机只影响而不决定处理水平”。此时 OLS 不一致,但基于准实验影响 \(Z\) 的 IV 可以一致。
- 样本流失:若因个人选择或特征而流失,处理与误差相关,产生样本选择偏误,OLS 有偏且不一致。
- 实验效应:准实验不是真实验,个体通常不认为自己是受试者,霍桑效应一般无关——这是准实验的优点。
- 准实验中工具的有效性:相关性可用 Key Concept 12.5 的统计方法检验;重点是更依赖判断的外生性。常见误区:随机分配的工具不一定外生。
- Angrist (1990) 用越战征兵抽签号码作为服役的工具变量研究对平民收入的效应:号码确实随机,但若低号码引发规避征兵的行为、该行为又影响后来的平民收入,则 \(Z_i\) 与 \(u_i\) 相关。
- McClellan 等的导管术研究:若住得离导管术医院近的病人一般更健康(医疗可及性更好),相对距离与健康方程误差中的遗漏变量相关。
- 结论:随机或仿佛随机决定的工具不必然满足 \(\text{corr}(Z_i,u_i)=0\),外生性仍需仔细审查。
外部有效性威胁:与 9.1 节观测研究类似。特别地,制造仿佛随机性的特殊事件可能带来其他特殊性:Card 研究中古巴移民、迈阿密及其古巴社区的特殊性使结论难以推广到其他来源国移民或其他目的地;Angrist 关于越战时期服役的结论大概不能推广到和平时期服役。需逐案评估。
13.6 异质总体中的实验与准实验估计(PDF p.498–503)
设定。 因果效应的不可观测变异称为异质总体(heterogeneous population)。为简化省略控制变量 \(W\)(结论可推广)。个体 \(i\) 有自身因果效应 \(\beta_{1i}\)(例:已会写简历者参加简历写作培训的效应为 0):
异质因果效应下的 OLS。 \(\hat\beta_1 = s_{XY}/s_X^2\)(式 4.5)。i.i.d. 下 \(\hat\beta_1 \xrightarrow{p} \sigma_{XY}/\sigma_X^2\)。随机分配 ⇒ \(X_i\) 独立于所有个体特征,包括 \(\beta_{1i}\):
异质因果效应下的 IV 回归。
- 第一阶段也允许异质:
\[X_i = \pi_0 + \pi_{1i}Z_i + v_i \tag{13.11}\]
- TSLS:\(\hat\beta_1^{TSLS}=s_{ZY}/s_{ZX}\)(式 12.4)。设 \(Z_i\) 随机或仿佛随机分配,独立于 \((u_i,v_i,\pi_{1i},\beta_{1i})\),且 \(E(\pi_{1i})\ne0\)(工具相关性),则(附录 13.2)
\[\hat\beta_1^{TSLS} \xrightarrow{p} \frac{\sigma_{ZY}}{\sigma_{ZX}} = \frac{E(\beta_{1i}\pi_{1i})}{E(\pi_{1i})} \tag{13.12}\]
- 这是个体因果效应的加权平均,权重 \(\pi_{1i}/E(\pi_{1i})\) 衡量工具对个体是否接受处理的相对影响。TSLS 估计的加权平均因果效应称为局部平均处理效应(local average treatment effect, LATE);“局部”强调权重集中在处理概率最受工具影响的个体上。
- LATE = ATE 的三种特例:
- 处理效应对所有人相同:\(\beta_{1i}=\beta_1\) ⇒ \(\beta_1E(\pi_{1i})/E(\pi_{1i})=\beta_1\);
- 工具对每个人影响相同:\(\pi_{1i}=\pi_1\) ⇒ \(E(\beta_{1i})\pi_1/\pi_1=E(\beta_{1i})\);
- 两种异质性不相关:\(\text{cov}(\beta_{1i},\pi_{1i})=0\),由 \(E(\beta_{1i}\pi_{1i})=\text{cov}(\beta_{1i},\pi_{1i})+E(\beta_{1i})E(\pi_{1i})\)(式 2.35)⇒ LATE \(=E(\beta_{1i})\)。
- 一般情况 LATE ≠ ATE 的例子:工人可参加培训,随机分配优先号 \(Z\)。一半工人知道自己能受益,可能报名:\(\beta_{1i}=\beta_1^+>0\),\(\pi_{1i}=\pi_1^+>0\);另一半知道无效,录取也不报:\(\beta_{1i}=\beta_1^-\),\(\pi_{1i}=0\)。ATE \(=\frac12(\beta_1^++\beta_1^-)\);\(E(\pi_{1i})=\frac12\pi_1^+\),\(E(\beta_{1i}\pi_{1i})=\frac12(\beta_1^-\times0+\beta_1^+\pi_1^+)=\frac12\beta_1^+\pi_1^+\),故 LATE \(=\beta_1^+\)。LATE 是可能报名者的效应,对永不报名者权重为 0;由于个体基于自身收益决定是否报名,此例 LATE > ATE。
- 含义:若个体是否接受处理取决于处理对其有效程度,TSLS 一般不是 ATE 的一致估计。令人不安的推论:两个研究者使用两个都有效(相关且外生)的不同工具,即使大样本也会得到不同的“因果效应”,因为各自估计不同的加权平均;过度识别 J 检验也可能因两个工具估计不同的 LATE 而拒绝,即便两工具都有效。一般而言两者都不是 ATE 的一致估计(脚注 6 推荐:Heckman, LaLonde & Smith 1999;Heckman 2001 诺奖演讲;Angrist, Graddy & Imbens 2000;LATE 概念由 Imbens & Angrist 1994 提出;Imbens & Wooldridge 2009 综述)。
- 例:心导管术研究。McClellan 等的 TSLS 发现导管术对健康几乎无效,令人意外(该手术经严格临床试验,且替代了十年前需大手术的干预)。可能解释:处理效应异质,对部分病人有效,对较健康者效果较弱甚至(考虑手术风险)无效。总体 ATE 很可能为正,但 IV 估计的是边际效应——相对距离对其是否接受治疗起重要作用的病人的效应,而这些可能恰是边际上导管术相对无效的较健康病人。
13.7 结论(PDF p.504)
- 第 1 章用理想随机对照实验的期望结果定义因果效应。可行的随机对照实验能提供有力证据,但也有内部/外部有效性威胁;经济学中实验受伦理和成本限制。
- 实验方法的洞见可用于准实验:用 DiD(可加附加回归元)估计;若仿佛随机只部分影响处理,用 IV。准实验的重要优点:仿佛随机性的来源通常透明,可具体评估。主要威胁:仿佛随机并不真正随机,处理或工具与遗漏变量相关。
- 准实验是观测数据与真实验之间的桥梁;所用方法(OLS、面板、IV)都是熟悉的,区别在于解释方式和适用数据;准实验帮助思考如何获取新数据、如何寻找工具变量、如何评估外生性假设(脚注 7 推荐 Shadish, Cook & Campbell 2002;发展经济学实验评估 Kremer, Miguel & Thornton 2009、MIT 贫困行动实验室;Deaton 2010 的批评)。
本章小结(原书 Summary 6 条):(1) ATE 是理想实验中处理组与对照组平均结果的期望差,真实实验因不依从等偏离理想;(2) 实际处理随机 ⇒ 结果对处理回归;分配随机但实际处理部分由个人选择 ⇒ 以分配为工具做 IV;随机性条件于 \(W\) 时须控制 \(W\);(3) 准实验把法律、环境变化或自然偶然视为随机分配,实际处理仿佛随机用回归,分配仿佛随机用 IV;(4) 回归断点基于可观测变量越过阈值;(5) 关键内部威胁是仿佛随机是否真带来外生性——行为反应可能使误差随处理而变;(6) 效应异质时,随机分配下 OLS 一致估计 ATE,而 IV 是以工具影响程度为权重的加权平均。
关键术语:program evaluation、potential outcome、average causal/treatment effect、differences estimator(with additional regressors)、randomization based on covariates、test for random receipt of treatment、partial compliance、attrition、Hawthorne effect、quasi-experiment/natural experiment、differences-in-differences estimator、repeated cross-sectional data、regression discontinuity、local average treatment effect。
第 13 章习题概览(PDF p.506–511)
- 复习题:13.1 肥料实验把前 25 块地给处理 1、依此类推,应改为随机分配(避免地块位置与土壤肥力相关);13.2 降胆固醇药临床试验如何估计效应,体重/年龄/性别、实验前胆固醇水平能否提高估计精度(加处理前控制变量或用 DiD);13.3 STAR 中校长迫于家长压力转学生入小班如何破坏内部有效性,如何用原始随机分配恢复(IV);13.4 实验效应及降低偏误的方法;13.5 征兵抽签例中 \(\beta_{1i}\) 与 \(\pi_{1i}\) 为何异质,TSLS 估计的行为参数(LATE)。
- 习题:13.1 从表 13.1 计算小班效应,能否区分小班与助教效应;13.2 用表 13.2 第 (3) 列构造小班 vs 常规班 90% CI、教龄 6 vs 12 年 95% CI、二者组合的 CI(提示教师随机分配 ⇒ 协方差处理),以及第 (4) 列为何无截距(全套学校哑变量);13.3 SAT 辅导课实验(处理组均值 1348、标准差 87.3、男 60 女 40;对照组 1395、82.1、男 40 女 60)估计 ATE 并判断是否非随机分配(性别比例失衡);13.4 最低工资上调的城市 A/B 餐馆就业:同一批餐馆(面板 DiD)vs 两年独立抽样(重复截面 DiD)及哪种更精确;13.5 宿舍网络与成绩:男运动员流失、对照组自建网络、处理组艺术生不会用、经济学生向对照组卖网络,分别属于哪类威胁;13.6 两期面板 \(Y_{it}=\alpha_i+\beta_1X_{it}+u_{it}\),证明 \(n\,\text{var}(\hat\beta_1^{\text{differences}})\to(\sigma_u^2+\sigma_\alpha^2)/\text{var}(X_{i2})\),\(n\,\text{var}(\hat\beta_1^{\text{diffs-in-diffs}})\to2\sigma_u^2/\text{var}(X_{i2})\),比较效率(\(\sigma_\alpha^2>\sigma_u^2\) 时 DiD 更有效);13.7 由含个体固定效应、时间效应和 \(D_t\times W_i\) 的面板模型推导 (13.6);13.8 证明 \(Y_{it}=\beta_0+\beta_1X_{it}+\beta_2G_i+\beta_3D_t+u_{it}\) 中 \(\hat\beta_1\) 等于 DiD;13.9 推导 (13.10) 最后一个等号;13.10 随机系数模型改写为 \(u_i=(\beta_{1i}-\beta_1)X_i+v_i\),随机分配下满足 KC 4.3,若 \(\beta_{1i}\) 与 \(X_i\) 正相关则 OLS 有偏;13.11 导管术研究的 LATE 与 ATE 是否不同;13.12 潜在结果框架下能否一致估计 \(E[Y_i(1)]\)、\(E[Y_i(0)]\)、\(E(TE_i)\)、各自方差、\(\text{var}(TE_i)\)、中位数处理效应(后两者不能,因不知两潜在结果的联合分布)。
- 实证习题 E13.1:Bertrand & Mullainathan (2004) 简历实验,随机赋予“白人名字”(Emily Walsh、Greg Baker)或“非裔名字”(Lakisha Washington、Jamal Jones),计算回电率差的 95% CI、男女差异、简历质量高低差异及其种族差异、检验随机分配。
附录 13.1 Project STAR 数据集(PDF p.511)
1985–1986 至 1988–1989 四个学年的成绩、处理组、学生与教师特征。成绩为斯坦福成就测验数学+阅读之和;Boy、Black、Race other than black or white、Free lunch eligible 为二元变量;教师教龄为该年级任课教师总教龄;数据含学校标识,可构造学校哑变量。
附录 13.2 因果效应因人而异时的 IV 估计(PDF p.512–513)
推导 (13.12)。假设 KC 12.4 的 IV 回归假设除效应异质外成立,\(Z_i\) 独立于 \((u_i,v_i,\pi_{1i},\beta_{1i})\),\(E(\pi_{1i})\ne0\);i.i.d. 且四阶矩有限 ⇒ \(\hat\beta_1^{TSLS}\xrightarrow{p}\sigma_{ZY}/\sigma_{ZX}\) (13.13)。
- \(\sigma_{ZX}=E[(Z_i-\mu_Z)X_i]=\pi_0E(Z_i-\mu_Z)+E[\pi_{1i}Z_i(Z_i-\mu_Z)]+\text{cov}(Z_i,v_i)=\sigma_Z^2E(\pi_{1i})\) (13.14),用到 \(E(Z_i-\mu_Z)=0\)、\(Z\) 与 \(v\) 独立、\(\pi_{1i}\) 与 \(Z_i\) 独立。
- 代入得 \(Y_i=\beta_0+\beta_{1i}(\pi_0+\pi_{1i}Z_i+v_i)+u_i\),展开 \(\sigma_{ZY}=E[(Z_i-\mu_Z)Y_i]\) 的五项,利用独立性逐项化简,只剩 \(E(\beta_{1i}\pi_{1i})\sigma_Z^2\):\(\sigma_{ZY}=\sigma_Z^2E(\beta_{1i}\pi_{1i})\) (13.16)。相除得 (13.12)。
附录 13.3 分析实验数据的潜在结果框架(PDF p.513–514)
- \(Y_i(1)\)、\(Y_i(0)\) 为处理/未处理潜在结果,个体效应 \(Y_i(1)-Y_i(0)\),ATE \(=E[Y_i(1)-Y_i(0)]\)。观测结果:
\[Y_i = Y_i(1)X_i + Y_i(0)(1-X_i) \tag{13.17}\]
- 任何分配机制下:\(E(Y_i\mid X_i=1)-E(Y_i\mid X_i=0)=E[Y_i(1)\mid X_i=1]-E[Y_i(0)\mid X_i=0]\)。随机分配 ⇒ \(X_i\) 独立于 \([Y_i(1),Y_i(0)]\):
\[E(Y_i\mid X_i=1)-E(Y_i\mid X_i=0)=E[Y_i(1)]-E[Y_i(0)]=E[Y_i(1)-Y_i(0)] \tag{13.18}\]
- 转为回归记号:令 \(\beta_0=E[Y_i(0)]\),\(u_i=Y_i(0)-E[Y_i(0)]\),\(\beta_{1i}=Y_i(1)-Y_i(0)\),
\[Y_i = Y_i(0)+[Y_i(1)-Y_i(0)]X_i = \beta_0+\beta_{1i}X_i+u_i \tag{13.19}\]即随机系数模型 (13.9);效应恒定时化为 (13.1);结果有测量误差时并入 \(u_i\)。
- 基于 \(W_i\) 的随机分配:若 \(W_i\) 与潜在结果不独立,(13.18) 一般不成立;但给定 \(W_i\) 时 \(X_i\) 与 \([Y_i(1),Y_i(0)]\) 独立,称为非混杂性(unconfoundedness)。若效应恒定且 \(E(Y\mid X_i,W_i)\) 线性,非混杂性 ⇒ (13.2) 的条件均值独立:设 \(Y_i(0)=\beta_0+\gamma W_i+u_i\),\(Y_i(1)-Y_i(0)=\beta_1\),得 \(Y_i=\beta_0+\beta_1X_i+\gamma W_i+u_i\),且 \(E(u_i\mid X_i,W_i)=E[Y_i(0)-\beta_0-\gamma W_i\mid W_i]=E(u_i\mid W_i)\)。因此 \(\hat\beta_1\) 无偏,但 \(\hat\gamma\) 一般有偏(\(E(u_i\mid W_i)\ne0\))。
第 13 章本章要点
- 因果效应用潜在结果定义;个体效应不可观测,但随机分配下组间均值差一致估计 ATE。
- 实验数据分析:差分估计量;加处理前控制变量提高效率;基于协变量随机化时必须控制协变量。
- 实验内部威胁:未随机化(可用 \(X\) 对 \(W\) 回归的 F 检验)、部分依从(以初始分配为 IV)、与处理相关的流失(选择偏误)、实验效应(双盲)、小样本;外部威胁:样本/项目不代表性、一般均衡效应。
- STAR:小班效应约 0.2 个标准差、助教几乎无效;与加州/麻省观测估计的置信区间高度重叠。聚类标准误用于学校层面相关。
- 准实验工具箱:DiD(含重复截面版本,\(X_{it}=G_i\times D_t\))、IV、精确/模糊回归断点(模糊 RD 以“是否越过阈值”作工具)。
- 随机产生的工具不必然外生(征兵抽签、导管术距离)。
- 异质效应:随机分配下 OLS → ATE;IV → LATE \(=E(\beta_{1i}\pi_{1i})/E(\pi_{1i})\),三种特例下等于 ATE;不同有效工具可得不同 LATE,J 检验可能因此拒绝。
第 13 章与量化交易的关联
- 事件研究与政策冲击评估:DiD 是评估监管变化(如涨跌停规则调整、印花税变化、融券试点名单扩容、指数纳入/剔除、沪深港通标的调入)对流动性、波动率、定价效率影响的标准工具:调入标的为处理组、未调入相似股票为对照组,比较前后变化,平行趋势假设对应“仿佛随机”。重复截面 DiD 回归 (13.7) 的 \(G_i\times D_t\) 交互项写法可直接用于面板回归实现。
- 回归断点:指数编制规则在市值排名阈值处形成天然断点(如罗素 1000/2000 分界、沪深 300 成分边界),是研究指数纳入效应、被动资金冲击、机构持股对收益/波动影响的经典识别方式;模糊断点(排名越线不必然纳入)需用 IV。
- A/B 测试与执行算法评估:对执行算法、下单路由、报价策略做随机化实验时,本章的随机化检验(处理分配对订单特征的 F 检验)、按协变量(如订单规模分层)随机化后须控制协变量、聚类标准误(按交易日或标的聚类)、样本流失(订单撤单/未成交导致选择偏误)都直接适用。
- 因子研究中的因果与相关之分:本章提醒——控制变量系数没有因果解释;观测数据中的“因子暴露→收益”关系通常不是因果效应。LATE 的思想说明:用不同“工具”(不同事件冲击)得到的效应不同,是因为作用于不同的边际群体,不应强行认为某一个才是“真实”效应。
- 随机对照实验本身在二级市场中较少能做,多数应用是准实验与事件研究。
第 13 章推荐习题
- 13.3(SAT 实验):ATE 计算与随机化检验(性别分布失衡)。
- 13.4、13.6、13.8:DiD 的两种抽样设计、DiD 与简单差分的效率比较(个体效应方差大时 DiD 更优)、DiD 的回归表示——对事件研究设计最有用。
- 13.10、13.9:异质系数下 OLS 何时一致。
- 13.12:潜在结果框架下哪些量可识别(理解不能识别效应分布的方差/分位数)。
- 复习题 13.5、习题 13.11:LATE vs ATE 的解释。
- E13.1:随机实验数据的完整分析流程。
第 14 章 多回归元预测与大数据(Prediction with Many Regressors and Big Data)
章首导言(PDF p.515–516)
- 回到第 4 章两个问题:学区督学想知道降低师生比能否提高成绩(因果效应,第 4–13 章主题);父亲想预测哪所学校学生成绩最好(预测问题)。
- 统计预测:用数据估计预测模型,再用于新的样本外(out-of-sample)观测,目标是样本外预测准确。预测问题中没有“感兴趣的回归元”和控制变量之分,只有预测变量(predictors)和被预测变量。
- 少量预测变量时,只要满足附录 6.4 的预测用最小二乘假设,OLS 表现好;现代数据往往有大量预测变量。本章应用:用学校与社区特征预测加州 3932 所小学的学校层面成绩,一半用于估计,一半留作测试;大部分内容用 817 个预测变量,14.6 节扩展到 2065 个。类似应用:企业销售预测、患者层面医疗结果预测、地方政府服务需求预测,预测变量数可能接近甚至超过观测数。(脚注:第 4–9 章用学区数据,这里是学校层面数据。)
- 预测变量很多时 OLS 过拟合(overfits),样本外预测差;可用统称为收缩估计量(shrinkage estimators)的方法改进:有偏、系数一般无因果解释,但引入偏差可大幅降低方差,从而提高样本外预测精度。
- 本章讨论截面数据对总体中非估计样本成员的预测;对未来事件的预测称为预测/预报(forecasts),用时间序列,放在第四部分。大数据领域也称机器学习(machine learning)、数据科学(data science),本书用“大数据”(big data)。
14.1 什么是“大数据”(PDF p.516–517)
- 数据“大”可以指观测多、预测变量相对观测数多,或两者兼有;也可以是非标准数据(文本、图像)。
- 大数据带来五类应用:
- 预测变量数 \(k\) 相对 \(n\) 很大的预测(本章重点):可能来自许多原始预测变量,也可能来自原始变量的非线性函数——几十个原始变量加平方、立方、交互项就迅速膨胀到成百上千。
- 分类(categorization):如第 11 章贷款被拒概率的 logit/probit,可重新表述为把申请分成“可能被拒/可能被批”两类;机器“学习”(估计)贷款官员的决策过程,再自动决策。网上房贷行业大量依赖此类机器学习。
- 多重假设检验(testing multiple hypotheses):许多处理系数中找出哪些有效;F 统计量检验联合假设,不适合“找出哪个非零”,需专门方法。
- 非标准数据(文本、图像):关键是转为数值数据,再用高维方法;14.7 节讨论文本。
- 模式识别(人脸识别、机器翻译):深度学习(deep learning),本质是用大量观测“训练”的高度非线性模型。
- 共同挑战:存储、读取与快速算法等计算问题,本章不讨论(留给计算机科学)。
- 应用实例:辅助诊断、精准广告、人脸识别;经济学中用卫星数据估计地方收入、用客户数据预测销售、社交网络数据、在高频资产价格数据库中寻找模式用于计算机交易算法、用实时数据预测宏观增长;文本分析日益重要。
- 本章方法本质上是线性回归针对大数据的扩展。
14.2 多预测变量问题与 OLS(PDF p.517–524)
数据与任务。 2013 年加州 3932 所小学;用一半(\(n=1966\))估计,另一半留作测试集,直到 14.6 节才使用。被预测变量为学校五年级平均成绩。主数据集 817 个变量(附录 14.1)。
表 14.1:817 个预测变量的构成
- 38 个主变量:免费或减价午餐学生比例、免费午餐比例、英语学习者比例、教师平均教龄、生均教学支出、当地收入中位数、师生比、注册学生数、英语熟练学生比例、族裔多样性指数、8 个族裔比例(印第安、亚裔、黑人、菲律宾裔、西班牙裔、夏威夷裔、两种以上、未报告)、教师人数、第一年教师比例、第二年教师比例、兼职比率(教师人数/全职当量)、学区层面按类别生均支出(7)、按类型生均支出(5)、按来源生均收入(4)。
-
- 主变量平方 38 + 立方 38 + 全部两两交互 \(38\times37/2=703\)。
- 总数 \(k=38+38+38+703=817\)。动机:8.4 节发现成绩与师生比非线性,且关系依赖英语学习者比例。
- 14.6 节还有 2065 个预测变量的版本,超过估计样本的 1966 个观测。
为什么不违背高斯–马尔可夫定理。 预测变量多时 OLS 预测很差;高斯–马尔可夫定理说 OLS 在线性无偏估计中方差最小,而替代估计量是有偏的,方差小得足以带来更好的预测。
均方预测误差(mean squared prediction error, MSPE)。
- \((X^{oos},Y^{oos})\) 为样本外观测,不用于估计;\(\hat Y(x)\) 为预测函数。平方损失使大误差权重大,适合“小误差无关紧要、大误差损害可信度”的场景。
- 使 MSPE 最小的最佳预测是条件均值 \(E(Y^{oos}\mid X^{oos})\),称为神谕预测(oracle prediction);不可行,但是评价一切可行预测的基准。回归模型中对应用真实系数做预测。
- MSPE 的两个误差来源:即便已知条件均值也有误差 \(Y^{oos}-E(Y^{oos}\mid X^{oos})\);估计参数带来额外误差。
预测用第一条最小二乘假设(附录 6.4):\((X^{oos},Y^{oos})\) 与估计样本 \((X_i,Y_i)\) 来自同一总体分布。于是 \(E(Y\mid X)\) 对样本内外都是神谕预测。直观:加州学校模型可推广到加州其他学校,对欧洲学校信心较低,对印度学校更低。这是关于外部有效性的陈述,也适用于非最小二乘方法,本章其余部分均假设成立。
标准化回归元的预测回归模型。
- 原始数据 \((X^*_{1i},\dots,X^*_{ki},Y^*_i)\);标准化 \(X_{ji}=(X^*_{ji}-\mu_{X^*_j})/\sigma_{X^*_j}\),去均值 \(Y_i=Y^*_i-\mu_{Y^*}\)。
\[Y_i = \beta_1X_{1i}+\beta_2X_{2i}+\cdots+\beta_kX_{ki}+u_i \tag{14.2}\]无截距(所有变量均值为 0)。系数单位相同:\(\beta_j\) 为 \(X^*_j\) 相差一个标准差、其他 \(X\) 不变时预测值之差。采用预测解释:\(E(Y\mid X)=\sum_j\beta_jX_j\),\(E(u\mid X)=0\)。对系数线性,但可通过平方、交互项对预测变量非线性。
- 样本外预测 \(\hat Y(X^{oos})=\sum_j\hat\beta_jX^{oos}_j\),预测误差 \(=u^{oos}-\sum_j(\hat\beta_j-\beta_j)X^{oos}_j\)。由于 \(u^{oos}\) 独立于估计数据且与 \(X^{oos}\) 不相关:
\[\text{MSPE} = \sigma_u^2 + E\Big[\big((\hat\beta_1-\beta_1)X^{oos}_1+\cdots+(\hat\beta_k-\beta_k)X^{oos}_k\big)^2\Big] \tag{14.3}\]第一项是神谕预测误差方差;第二项是“必须估计系数”的代价,等于估计带来的预测方差 + 预测偏差平方(均方 = 方差 + 偏差²,式 2.33)。选择估计量就是让第二项尽量小,预测变量多时这意味着在系数偏差与方差间权衡。
- 实践中用样本内均值和标准差标准化;预测样本外观测时,须用样本内均值/标准差标准化样本外预测变量,并把样本内 \(Y\) 均值加回(附录 14.5)。
OLS 的 MSPE 与收缩原理。
- 同方差误差下:
\[\text{MSPE}_{OLS} \cong \Big(1+\frac{k}{n}\Big)\sigma_u^2 \tag{14.4}\]某些特例精确成立(习题 14.12),一般在 \(n\) 大、\(k/n\) 小时近似成立;单回归元推导见附录 14.2,一般 \(k\) 的矩阵推导见附录 19.7。
- 解释:用 OLS 估计 \(k\) 个系数使 MSPE 相对神谕放大 \((1+k/n)\) 倍。例:38 个主变量时 \(k/n=38/1966\approx0.02\),仅损失 2%;817 个变量时 \(k/n\approx0.40\),恶化 40%,值得找更好的估计量。
- OLS 在预测解释下无偏,膨胀因子完全来自方差。1960 年代早期的重要概念突破:允许有偏估计量,方差可降得足够多,使 MSPE 低于 OLS。
- 收缩原理(principle of shrinkage):收缩估计量把 OLS 估计向某个特定数(通常为 0)“收缩”,引入偏差、降低方差;若方差下降超过偏差平方的增加,均方误差低于 OLS。
- James–Stein 估计量(James & Stein 1961):回归元不相关时 \(\tilde\beta^{JS}=c\hat\beta\),\(c<1\) 且依赖数据,向 0 收缩。真实 \(\beta\) 小时 MSE 更低不足为奇;惊人之处在于:误差正态时,只要 \(k\ge3\),无论真实 \(\beta\) 取何值,其 MSE 都低于 OLS。这是大数据多预测变量方法的基础,衍生出岭回归、Lasso 等收缩估计量家族。
MSPE 的估计。
- 分样本估计(split-sample):数据分为估计子样本和测试(test)子样本;用估计子样本得 \(\tilde\beta\)(OLS 或其他),对测试子样本的 \(n_{test}\) 个观测预测:
\[\widehat{\text{MSPE}}_{split\text{-}sample} = \frac{1}{n_{test}}\sum_{\text{test subsample}}(Y_i-\hat Y_i)^2 \tag{14.5}\]
- m 折交叉验证(m-fold cross validation):分样本不对称使用数据;交换两个子样本角色可得两个估计,推广到 \(m\) 个随机子样本。
Key Concept 14.1 m 折交叉验证六步:
- 将样本随机分为 \(m\) 个大小近似相等的子集;
- 用子样本 \(2,\dots,m\) 合并估计 \(\tilde\beta\);
- 用 \(\tilde\beta\)(及式 14.12 的还原公式)计算子样本 1 的预测值与预测误差;
- 以子样本 1 为测试样本,按 (14.5) 得 \(\text{MSPE}_1\);
- 依次留出子样本 \(2,3,\dots\) 重复 2–4,得 \(\text{MSPE}_i\),\(i=1,\dots,m\);
- 加权平均:
\[\widehat{\text{MSPE}}_{m\text{-fold CV}} = \frac1m\sum_{i=1}^m\Big(\frac{n_i}{n/m}\Big)\widehat{\text{MSPE}}_i \tag{14.6}\]\(n_i\) 为子样本 \(i\) 的观测数,括号内因子处理子样本大小不等。
- \(m\) 的选择:\(m\) 越大,每次估计用的观测越多、\(\beta\) 估计越有效,理想是留一法(leave-one-out cross validation,原书写 \(m=n-1\),通常记为 \(m=n\));但需估计 \(m\) 次,\(k\) 上百时计算太慢。本章取 \(m=10\)(每次用 90% 样本)作为折中。
- 交叉验证适用范围极广,不依赖估计方式,甚至适用于只能表述为算法、没有参数的模型,因此在大数据实证中广泛使用。
14.3 岭回归(Ridge Regression)(PDF p.525–528)
惩罚收缩。 岭回归最小化惩罚残差平方和(penalized sum of squared residuals):
- \(\lambda_{Ridge}\ge0\) 为岭收缩参数(ridge shrinkage parameter);第二项为惩罚项(penalty term),惩罚大的系数。
- 图 14.1(单回归元):SSR 在 OLS 估计 \(\hat\beta\) 处最小,加上随 \(b^2\) 增加的惩罚后,最小点移向 0,\(\hat\beta^{Ridge}\) 比 OLS 更接近 0。
- \(\lambda=0\) 时等于 OLS;\(\lambda\) 越大收缩越强。因为用了标准化回归元,系数单位相同,可对所有系数用同一个 \(\lambda\)。
- 闭式解:单回归元推导见附录 14.3,一般情形用矩阵(附录 19.7)。回归元互不相关时:
\[\hat\beta_j^{Ridge} = \Bigg(\frac{1}{1+\lambda_{Ridge}/\sum_{i=1}^nX_{ji}^2}\Bigg)\hat\beta_j \tag{14.8}\]即对 OLS 按比例向 0 收缩,类似 James–Stein。回归元相关时,个别岭估计可能大于 OLS,但总体上向 0 收缩。
- 完全多重共线(如 \(k>n\))时 OLS 无法计算,岭估计仍可计算。
用交叉验证估计收缩参数。
- 误区:直接对 \(\lambda\) 最小化 \(S^{Ridge}\) 会得到 \(\lambda=0\)(即 OLS),因为那是样本内拟合最好;而预测的目标是样本外拟合(低 MSPE)。
- 做法:对一组候选 \(\lambda\)(如 0.1、0.2……),分别用 m 折交叉验证估计 MSPE,取最小者。最优值可能为 0(则 OLS 最好),但通常不为 0。
学校成绩应用(817 个预测变量,1966 观测,10 折 CV):
- 图 14.2:root MSPE 随 \(\lambda_{Ridge}\)(对数刻度)呈 U 形,最小点 \(\hat\lambda_{Ridge}=2233\),root MSPE = 39.5;同样数据 OLS 的 root MSPE = 78.2(远在图外)。实证印证:预测变量多时收缩引入的偏差带来更大的方差下降,预测精确得多。
- 注意:\(\hat\lambda\) 是为最小化 CV MSPE 而选的,因此在 \(\hat\lambda\) 处的 CV MSPE 不再是 MSPE 的无偏估计;14.6 节用未使用的另 1966 个观测得到无偏估计。系数比较也留到 14.6 节。
14.4 Lasso(PDF p.528–532)
稀疏模型。 OLS 和岭回归的系数都不会恰好为 0,所有回归元都用于预测。若真实条件期望只对 38 个主变量线性,则 \(817-38=779\) 个变量系数为 0。只有少部分预测变量系数非零的模型称为稀疏模型(sparse model),此时把许多系数估计为恰好 0 可改进预测。
- Lasso(least absolute shrinkage and selection operator):与岭回归一样向 0 收缩;不同的是把许多系数设为恰好 0(剔除回归元),且对保留的回归元收缩比岭回归少。即先选子集,再以适度收缩估计。同样可用于 \(k>n\),收缩参数同样用 CV 估计。
定义:
- \(\lambda=0\) 时为 OLS。“least absolute shrinkage”指惩罚随绝对值增加;“selection operator”指把很多系数估计为 0,从而选择预测变量子集。
- 脚注:两种惩罚都可写成 \(\lambda\sum_j|b_j|^p\),岭 \(p=2\)、Lasso \(p=1\);\((\sum_j|b_j|^p)^{1/p}\) 为 \(L_p\) 长度(\(p=2\) 即欧氏距离),故岭回归又称 \(L_2\) 惩罚,Lasso 称 \(L_1\) 惩罚。
为什么恰好为 0(图 14.3,\(k=1\)):(a) OLS 估计远离 0(\(\hat\beta=1.0\))时,Lasso 收缩到较小值(\(\hat\beta^{Lasso}=0.5\));(b) SSR 曲线左移、OLS 估计较小(\(\hat\beta=0.4\))时,SSR 在 0 附近很平,线性惩罚占主导,把估计推到恰好 0。附录 14.4 给出 \(k=1\) 的公式:OLS 估计足够小时 Lasso 为 0(软阈值)。
- 与岭的对比:\(b\) 大时岭惩罚(平方)超过 Lasso 惩罚(绝对值),所以 OLS 估计大时 Lasso 收缩比岭少;OLS 估计小时 Lasso 收缩比岭多,甚至到 0。多预测变量时 Lasso 一般向 0 收缩,但个别系数可能大于 OLS。
- 计算:\(k>1\) 时无闭式解,须数值优化;机器学习发展了专门算法,许多计量软件已内置。收缩参数用与岭相同的 CV 算法估计。
警告:岭与 Lasso 依赖回归元的线性组合方式。
- OLS 中,只要避免完全共线,用原始 \(k\) 个回归元还是其 \(k\) 个线性组合,拟合和预测都相同。例:(截距 + 男性哑变量)、(截距 + 女性哑变量)、(男、女哑变量,无截距)三种设定 OLS 拟合与预测完全一样,其他系数也不受影响。
- 岭与 Lasso 的拟合、系数和预测一般依赖具体线性组合。Lasso 最易理解:总体系数随线性组合改变而改变,如(截距, 男)中男性系数不同于(女, 男)中的,Lasso 可能在前者中剔除男性而在后者中保留,因而预测不同。岭的原因更微妙:不同线性组合之间相关性不同(附录 19.7)。
- 含义:用岭和 Lasso 时必须认真选择回归元形式;这对 OLS、主成分法(14.5)、logit、probit、IV 则无关紧要。
学校成绩应用:图 14.4 root MSPE 随 \(\lambda_{Lasso}\) 变化,最小于 \(\hat\lambda_{Lasso}=4527\),root MSPE = 39.7,远低于 OLS 的 78.2,略高于岭的 39.5。Lasso 只在 817 个中的 56 个预测变量上估出非零系数,剔除 761 个(93%);保留者中除 4 个外都是 38 个主变量间的交互项。
14.5 主成分(Principal Components)(PDF p.532–537)
思想。 完全共线时可丢弃一个回归元而不损失信息(它能由其余回归元完全重构);那么丢弃与其他回归元高度但非完全相关的变量也许信息损失很小。主成分分析(principal components analysis, PCA)利用回归元间的相关性减少回归元数量、尽量保留原始信息,降维后可直接用 OLS 估计与预测。
两个变量的主成分。
- 标准化变量 \(X\) 的主成分是 \(X\) 的线性组合,彼此不相关,且依次包含尽可能多的原始信息:第一主成分权重使其方差最大;第二主成分与第一不相关、在控制第一主成分后方差最大;依此类推。若 \(k\le n\) 且无完全共线,共 \(k\) 个主成分;若 \(k>n\),共 \(n\) 个。
- 图 14.5:200 个观测,\(X_1,X_2\) 标准正态、相关系数 0.7。\(PC_1=w_1X_1+w_2X_2\);选择权重即选择变量散布最大的方向——45° 线方向。
- 必须约束权重,否则同时放大 \(w_1,w_2\) 可无限增大方差:要求 \(w_1^2+w_2^2=1\)。故 \(w_1=w_2=1/\sqrt2\),\(PC_1=(X_1+X_2)/\sqrt2\)(习题 14.11 推导)。
- \(PC_2\) 与 \(PC_1\) 不相关、平方权重和为 1 ⇒ \(PC_2=(X_1-X_2)/\sqrt2\),对应向下倾斜的 45° 线方向,散布最小。两变量时 \(PC_1\) 使方差最大、\(PC_2\) 使方差最小。
- \(\text{var}(PC_1)=1+|\rho|\),\(\text{var}(PC_2)=1-|\rho|\),\(\rho=\text{corr}(X_1,X_2)\)。且 \(\text{var}(PC_1)+\text{var}(PC_2)=2=\text{var}(X_1)+\text{var}(X_2)\)(脚注 3)。
- \(R^2\) 解释:\(PC_1\) 解释总方差比例 \(\text{var}(PC_1)/[\text{var}(X_1)+\text{var}(X_2)]\)。\(\rho=0.7\) 时 \(PC_1\) 解释 \((1+0.7)/2=85\%\),\(PC_2\) 解释 15%。两变量时降维意义不大,主成分的价值在于变量多且相关时,少数主成分即可捕获大部分变异。
k 个变量的主成分(Key Concept 14.2):主成分是满足以下性质的线性组合:(i) 权重平方和为 1;(ii) 第一主成分方差最大;(iii) 第二主成分在与第一不相关约束下方差最大;(iv) 第 \(j\) 个在与前 \(j-1\) 个不相关约束下方差最大。
- 无完全共线时主成分个数为 \(\min(n,k)\)。
- 主成分样本方差之和 = \(X\) 样本方差之和:
\[\sum_{j=1}^{\min(n,k)}\text{var}(PC_j)=\sum_{j=1}^k\text{var}(X_j) \tag{14.10}\]
- \(\text{var}(PC_j)/\sum_j\text{var}(X_j)\) 是第 \(j\) 个主成分解释的 \(X\) 总方差比例,类似 \(R^2\)。
- \(k>2\) 时权重表达式复杂,但有快速矩阵算法(附录 19.7;实质是协方差/相关矩阵的特征分解),标准软件均提供。
碎石图(scree plot):横轴为主成分编号 \(j\),纵轴为第 \(j\) 个主成分样本方差占 \(X\) 总样本方差之比。主成分互不相关,所以前 \(p\) 个比例的累计和就是前 \(p\) 个主成分解释的总方差比例。
- 图 14.6(817 变量数据前 50 个主成分):第一主成分解释 18%,第二 11%,两者合计 29%;前 10 个解释 63%;前 40 个解释 92%。前几个之后曲线变平是高度相关数据的典型特征,形似悬崖下滚落到谷底的碎石(scree),故名。
用主成分预测(主成分回归):用前 \(p\) 个主成分替代 817 个预测变量做 OLS。\(p\) 与岭/Lasso 的收缩参数一样,用 m 折 CV 最小化 MSPE 来选。样本外预测时,除用样本内均值/标准差标准化外,还须用样本内估计的权重 \(w\) 计算样本外主成分(附录 14.5)。
学校成绩应用(图 14.7):root MSPE 随 \(p\) 先急降;\(p=5\) 后改进放缓;\(p=23\) 后基本平坦;在 \(p=46\) 处最小,\(\hat p=46\),root MSPE = 39.7,与 Lasso 相同、略高于岭。
14.6 用多预测变量预测学校成绩(PDF p.537–543)
评价设计。 由于 m 折 MSPE 已用来估计收缩参数和 \(p\),它不再是真正的样本外比较,故预留另一半观测作为预留测试样本(reserved test sample)。流程(以岭为例):在 1966 个估计样本上 10 折 CV 选 \(\hat\lambda\);用该 \(\hat\lambda\) 在全部 1966 个估计样本上重新估计系数;预测预留测试样本中全部观测的 \(Y^{*oos}\)。Lasso、主成分同理。
表 14.2:三组预测变量
- 小(\(k=4\)):学校层面师生比、当地收入中位数、教师平均教龄、生均教学支出。
- 大(\(k=817\)):表 14.1。
- 超大(\(k=2065\)):在 38 个主变量上增加 27 个,共 65 个主变量(其中 5 个二元):人口、移民状况(4)、当地年龄分布(8)、男性比例、婚姻状况(3)、教育水平(4)、自有住房比例;二元:特许学校、全年制、统一学区(大城市)、洛杉矶、圣地亚哥。再加 60 个非二元变量的平方和立方(60+60)、非二元变量两两交互 \(60\times59/2=1770\)、二元变量与非二元人口统计变量交互 \(5\times22=110\)。总计 \(65+60+60+1770+110=2065\),超过估计样本 1966。
表 14.3:样本外表现(root MSPE)
| 预测变量集 | 指标 | OLS | 岭 | Lasso | 主成分 |
|---|---|---|---|---|---|
| 小 \(k=4\) | 样本内(10 折 CV) | 53.6 | — | — | — |
| 样本外 | 52.9 | — | — | — | |
| 大 \(k=817\) | 估计的 \(\lambda\) 或 \(p\) | — | 2233 | 4527 | 46 |
| 样本内 | 78.2 | 39.5 | 39.7 | 39.7 | |
| 样本外 | 64.4 | 38.9 | 39.1 | 39.5 | |
| 超大 \(k=2065\) | 估计的 \(\lambda\) 或 \(p\) | — | 3362 | 4221 | 69 |
| 样本内 | — | 39.2 | 39.2 | 39.6 | |
| 样本外 | — | 39.0 | 39.1 | 39.6 |
四个突出发现:
- OLS 在小数据集上的 MSPE 远小于大数据集(超大数据集 \(k>n\) 无法计算 OLS):回归元很多时,OLS 不能利用额外信息改进样本外预测。
- 多预测变量方法从 4 个增加到 817 个预测变量收益显著,root MSPE 下降约四分之一;再到 2065 个没有进一步收益。
- 样本内 10 折 CV 估计与样本外估计相近,样本外甚至略小。原因:10 折每次只用 90% 数据(\(0.9\times1966=1769\))估系数,而样本外估计用全部 1966 个,系数更精确;加上两者都有抽样变异。一般结论:样本内 m 折 MSPE 是样本外 MSPE 的良好指引。
- 预留测试样本中各多预测变量方法 MSPE 相近——这并非普遍规律,只是本应用恰好如此;岭略优,大数据集上岭的样本外 MSPE 最低。
表 14.4:部分标准化回归元系数(单位:每个原始预测变量标准差对应的分数;均无因果解释)
| 预测变量 | k=4 OLS | k=817 OLS | 岭 | Lasso | 主成分 |
|---|---|---|---|---|---|
| 师生比 | 4.51 | 118.03 | 0.31 | 0 | 0.25 |
| 当地收入中位数 | 34.46 | −21.73 | 0.38 | 0 | 0.30 |
| 教师平均教龄 | 1.00 | −79.59 | −0.11 | 0 | −0.17 |
| 生均教学支出 | 0.54 | −1020.77 | 0.11 | 0 | 0.19 |
| 师生比 × 生均教学支出 | −89.79 | 0.72 | 2.31 | 0.84 | |
| 师生比 × 英语学习者比例 | −81.66 | −0.87 | −5.09 | −0.55 | |
| 免费/减价午餐 × 兼职教师指数 | 29.42 | −0.92 | −8.17 | −0.95 |
- 小模型系数与第 9 章学区数据一致:收入中位数高一个标准差,预测成绩高 34 分(学校间成绩标准差 64 分)。
- 大数据集 OLS 系数极大且杂乱:回归元多时 OLS 靠给特定变量很大系数去拟合个别观测——即过拟合,这正是 OLS 从小到大数据集预测变差的原因。
- 多预测变量方法的系数小得多、无离谱值。岭与主成分系数数值相近;Lasso 差异大:92% 的系数为 0(包括小数据集的 4 个变量),非零的 3 个与岭/主成分同号但大得多——实证体现了“Lasso 对小系数收缩更多、对大系数收缩更少”。
- 主成分列的系数由主成分回归系数 \(\gamma\) 与主成分权重组合而得(脚注 4,公式见附录 19.7):主成分是 \(X\) 的线性组合,回归又是主成分的线性组合,故预测可写成 \(X\) 的线性组合。
图 14.8(817 变量,预留测试集散点图):(a) 实际值 vs OLS 预测;(b) 实际值 vs 岭预测——越紧贴 45° 线越好,岭比 OLS 紧凑得多(部分 OLS 预测超出纵轴范围,图低估了改进);(c) Lasso vs 岭、(d) 主成分 vs 岭——点沿 45° 线聚集,三者预测大体相似,但不少学校的预测相差至少 15 分,即 MSPE 相近不代表对个别学校预测相同。
最重要的结论:大数据集上多预测变量方法在 OLS 失败处取得成功,因为它们以有偏换取足够大的方差下降;m 折 MSPE 与预留测试样本的 MSPE 接近。不可推广的发现:三种方法在本数据中恰好表现相当。
14.7 结论(PDF p.543–545)
- 预测回归模型系数没有因果解释,但对预测无妨,目标是 MSPE 意义下尽可能准确的样本外预测。
- 三种方法都对 \(\beta\) 引入偏差、换取更大的方差下降,但方式不同:
- Lasso:把许多系数设为 0、丢弃相应预测变量,适合神谕模型稀疏或近似稀疏时;
- 主成分回归:适合预测变量(或变量组)高度相关时,少数前几个主成分即可捕获大部分变异,再用 OLS;
- 岭回归:向 0 收缩 OLS,但不依赖稀疏性或高相关性,适合回归元不高度相关且无先验理由假设稀疏时。
- 学校数据中三者表现相近是巧合,一般不成立。
- 机器学习的其他机会:文本(专栏)、主成分及其扩展可把图像转为数值数据。尽管算法和工具新而复杂,核心仍是第 I–III 部分的回归、估计与检验思想。延伸阅读:Jean et al. (2016) 用卫星图像预测贫困;Davis & Heller (2017) 夏季就业项目的处理效应异质性;Kleinberg et al. (2018) 机器学习用于刑事判决;入门教材 James et al.《An Introduction to Statistical Learning》(2013)。
专栏:文本作为数据(Text as Data)。 文本包含大量信息;关键步骤是把文本转为数值。方法:列出词或短语清单,统计其在每段文本(新闻文章、博客帖子)中出现次数;观测单位是文本片段,观测数是片段数。该方法由 Mosteller & Wallace (1963) 提出,是文体计量学(stylometrics)的基础。术语:文本中的词表称为词袋(bag of words);感兴趣的词和短语清单称为词典(dictionary),可只含与预测问题相关的词,也可包含词袋中除冠词、代词、连词外的所有词。词频作为预测变量 \(X\) 预测 \(Y\),把文本问题转为回归问题。词典通常很大,预测变量数相对文本数 \(n\) 很大,OLS 预测差,本章方法可直接使用;PCA 尤其有用,因为词常成组出现(棒球比赛报道 vs 宏观经济报道)。
本章小结(原书 6 条):(1) 预测目标是对未用于估计的样本外观测作准确预测;(2) 预测模型系数无因果解释;(3) 大数据可用多预测变量,但回归元数相对样本量大时 OLS 预测差;(4) 以引入偏差为代价降低方差的方法能显著改善 MSPE;(5) 岭和 Lasso 是最小化惩罚残差平方和的收缩估计量,收缩参数用 m 折 CV MSPE 最小化估计;(6) 主成分以少量线性组合捕获相关变量的大部分变异,可用于预测回归,主成分个数用 m 折 CV 估计。
关键术语:mean squared prediction error、oracle prediction、first least squares assumption for prediction、standardized predictive regression model、shrinkage estimator、m-fold cross validation、ridge regression、penalty term、penalized sum of squared residuals、sparse model、Lasso、principal components、scree plot。
第 14 章习题概览(PDF p.546–551)
- 复习题:14.1 成绩对减价餐比例回归显著且 \(R^2\) 高,能否得到因果效应(不能,遗漏变量)、能否用于预测(能);14.2 交叉验证如何用样本内观测估计样本外 MSPE;14.3 有偏估计为何预测更准;14.4 岭与 Lasso 异同;14.5 10 个变量碎石图平坦说明变量几乎不相关,前几个主成分用处不大。
- 习题:14.1 亚利桑那 200 所学校,TestScore 均值 750.1、标准差 65.9;RPM 0.60、0.28;TExp 13.2、3.8;标准化回归 \(\widehat{TestScore}=-48.7\times RPM+8.7\times TExp\),SER=44.0。对 RPM=0.52、TExp=11.1 的样本外学校先标准化再预测,实际 775.3 求误差,并还原原始尺度截距和斜率、验证预测相同(标准化/还原的机械练习)。14.2 用该预测回归评估“让所有学生享受减价餐”的政策效应是否可行(不可,无因果解释)。14.3 回归标准误与样本外 root MSPE 的关系(SER 低估,约差 \(\sqrt{1+k/n}\) 倍)。14.4 线上零售商用购买数据预测下一件商品。14.5 \(\mu=2\)、\(\sigma^2=25\):神谕预测 \(\mu\),MSPE=25;用 \(n=10\) 样本均值预测,分解误差 \(Y-\bar Y=(Y-\mu)-(\bar Y-\mu)\),MSPE \(=25(1+1/10)=27.5\)。14.6 用 \(\bar Y/2\) 预测(收缩):计算偏差、方差、MSPE,\(\mu=2\) 时优于 \(\bar Y\),\(\mu=10\) 时劣于——体现收缩的偏差-方差权衡。14.7 用 \(\bar Y-1\) 预测(只加偏差不减方差,必然更差)。14.8 证明条件均值 \(\mu(x)\) 是最小 MSPE 预测,MSPE \(=E[\sigma^2(X)]\)。14.9、14.10 \(n=1\)、\(y_1=2\)、\(x_1=1\) 的单点例:画 SSR、惩罚项、惩罚目标函数,求 \(\lambda_{Ridge}=1,0.5,3\) 时岭估计(\(2/(1+\lambda)\))和 \(\lambda_{Lasso}=1,0.5,5\) 时 Lasso 估计(\(\max(2-\lambda/2,0)\),\(\lambda=5\) 时为 0),理解收缩随 \(\lambda\) 增强。14.11 证明两变量时 \(PC_1=(X_1+X_2)/\sqrt2\)、\(\text{cov}(PC_1,PC_2)=0\)、方差 \(1\pm\rho\)。14.12 固定效应面板 \(Y_{jt}=\alpha_j+u_{jt}\):\(\hat\alpha_j=\bar Y_j\) 无偏、方差 \(\sigma_u^2/T\),预测某实体或随机实体下一期的 MSPE \(=\sigma_u^2(1+1/T)=\sigma_u^2(1+k/n)\),给出式 (14.4) 精确成立的例子。
- 实证习题 E14.1:500 所样本内学校、20 个原始预测变量,构造平方与交互共 230 个(剔除二元变量 charter_s 的平方,因与其本身完全共线,余 229 个);标准化、去均值;OLS(是否含截距)、岭(\(\lambda=300\))、Lasso(\(\lambda=1000\),数非零系数)、碎石图(前 1、2、15 个主成分解释比例)、15 个主成分回归;对另 500 所样本外学校计算各方法 root MSPE 并画类似图 14.8 的散点图;再用 10 折 CV 选参数并比较。
附录 14.1 加州学校成绩数据(PDF p.552)
2013 年春五年级加州标准测试(STAR 项目的一部分)学校平均分,来自加州教育部;其他学校与学区数据来自 ED-Data,均为 2012–13 学年;人口统计数据由学校邮编所含人口普查区的美国社区调查(ACS)2013 年数据构造。
附录 14.2 \(k=1\) 时式 (14.4) 的推导(PDF p.552)
单回归元时 \(\hat Y(x)=\hat\beta x\)。(14.3) 第二项 \(E[(\hat\beta-\beta)X^{oos}]^2=E(\hat\beta-\beta)^2E(X^{oos})^2=E(\hat\beta-\beta)^2\)(\(\hat\beta\) 与 \(X^{oos}\) 独立;标准化使 \(E(X^{oos})^2=1\))。OLS 无偏,\(E(\hat\beta-\beta)^2=\text{var}(\hat\beta)=\sigma_u^2/(n\sigma_X^2)=\sigma_u^2/n\)(同方差大样本方差公式 5.27,\(\sigma_X^2=1\))。故 MSPE \(\approx(1+1/n)\sigma_u^2\)。
附录 14.3 \(k=1\) 时的岭估计量(PDF p.552)
最小化 \(\sum_i(Y_i-bX_i)^2+\lambda b^2\),一阶条件 \(-\sum_iX_i(Y_i-\hat\beta^{Ridge}X_i)+\lambda\hat\beta^{Ridge}=0\)(原书省略常数 2 的写法,对应惩罚的等价缩放)⇒
附录 14.4 \(k=1\) 时的 Lasso 估计量(PDF p.553)
由图 14.3,\(\hat\beta\) 与 \(\hat\beta^{Lasso}\) 同号。设 \(\hat\beta\ge0\),在 \(b\ge0\) 范围内最小化 \(\sum_i(Y_i-bX_i)^2+\lambda b\),导数 \(-2\sum_iX_i(Y_i-bX_i)+\lambda\);内点解令其为 0,否则为 0:
附录 14.5 标准化回归模型中的样本外预测(PDF p.553–554)
所有变换必须使用与样本内相同的均值、方差和权重。
- 岭与 Lasso:\(X^{oos}_j=(X^{*oos}_j-\bar X^*_j)/s_{X^*_j}\)(样本内均值与标准差),
\[\hat Y^{*oos}=\bar Y^*+\sum_{j=1}^k\tilde\beta_j\Big(\frac{X^{*oos}_j-\bar X^*_j}{s_{X^*_j}}\Big) \tag{14.12}\]
- 主成分回归:\(Y_i=\gamma_1PC_{1i}+\cdots+\gamma_pPC_{pi}+v_i\) (14.13)。步骤:(1a) 对样本内 \(Y^*\) 去均值、\(X^*\) 标准化;(1b) 计算样本内主成分 \(PC_1,\dots,PC_{\min(n,k)}\);(2) 给定 \(p\) 估计 \(\hat\gamma_1^{PC},\dots,\hat\gamma_p^{PC}\);(3a) 用样本内均值/标准差标准化样本外 \(X^{*oos}\);(3b) 用样本内权重计算样本外 \(PC^{oos}_1,\dots,PC^{oos}_p\);(4) \(\hat Y^{*oos}=\bar Y^*+\sum_{j=1}^p\hat\gamma_j^{PC}PC^{oos}_j\)。
第 14 章本章要点
- 预测与因果推断目标不同:预测看样本外 MSPE,系数无因果解释;需“预测用第一条最小二乘假设”(样本外与样本内同分布)。
- MSPE = 神谕误差方差 \(\sigma_u^2\) + 估计误差(方差 + 偏差²);OLS 的 MSPE ≈ \((1+k/n)\sigma_u^2\),\(k/n\) 大时损失大。
- James–Stein:\(k\ge3\) 且误差正态时,向 0 收缩对任何真实 \(\beta\) 都降低 MSE——收缩估计量的理论基础。
- MSPE 的估计:分样本、m 折交叉验证(Key Concept 14.1);调参后的 CV MSPE 有乐观偏差,需预留测试集。
- 岭(\(L_2\),按比例收缩,可处理 \(k>n\))、Lasso(\(L_1\),软阈值,产生稀疏解,适合稀疏模型)、主成分回归(利用高相关性降维,碎石图);岭与 Lasso 对回归元的线性组合形式敏感,OLS 与 PCA 不敏感。
- 实证:817 个预测变量时 OLS root MSPE 78.2(样本外 64.4),三种方法约 39;Lasso 仅保留 56 个变量。
第 14 章与量化交易的关联
- 因子研究/收益预测:大量候选因子(数百上千个技术、基本面、另类数据特征及其交互)预测横截面收益是典型的“\(k/n\) 大”问题,OLS 会严重过拟合;岭回归、Lasso(含弹性网)是多因子合成与因子筛选的基础方法。Lasso 的稀疏解对应“因子选择”,岭对应“所有因子小权重收缩”,后者在因子高度共线时更稳健。
- PCA 与风险建模:PCA 是统计风险模型(statistical factor model)的核心——从股票收益协方差矩阵提取前若干主成分作为风险因子;碎石图用于判断因子个数;收益率曲线的水平/斜率/曲率三因子也是 PCA 结果。用主成分回归可做降维的收益预测。
- 组合优化中的收缩思想:James–Stein 收缩直接对应预期收益估计的收缩(向截面均值收缩)和协方差矩阵收缩(Ledoit–Wolf),是降低估计误差、改善样本外组合表现的关键。
- 回测与交叉验证:本章强调的“调参后 CV 误差有乐观偏差,需要从未触碰的预留测试集评估”就是回测中防止数据窥探(data snooping)的原则。注意:本章是 i.i.d. 截面数据的随机 m 折 CV;金融时间序列需改用滚动/扩展窗口或带间隔(purged、embargo)的时序交叉验证,不能随机打乱。
- 实现细节:标准化必须用训练集的均值/标准差(附录 14.5),否则会把未来信息泄露进预测——对应因子截面标准化与防前视偏差(look-ahead bias)。岭/Lasso 对回归元形式敏感,因子需先标准化、慎重决定是否做中性化与正交化。
- 文本数据:词袋 + 词典 + 高维回归/PCA 是新闻、公告、研报情绪因子的基础流程;多重假设检验(14.1 提及)对应因子挖掘中的多重检验问题。
第 14 章推荐习题
- 14.5、14.6、14.7:用最简单的均值预测体会 MSPE 分解与收缩的偏差-方差权衡(何时收缩有利取决于未知真值)。
- 14.9、14.10:单点数据手算岭与 Lasso,直观理解 \(L_2\) 按比例收缩与 \(L_1\) 软阈值的差别。
- 14.11:两变量 PCA 的推导。
- 14.12:给出 \((1+k/n)\) 公式精确成立的例子。
- 14.1:标准化与还原的机械练习(防止实现错误)。
- E14.1:完整走一遍 OLS/岭/Lasso/PCA + CV + 样本外评估流程,可直接改造成因子预测练习。
第 15 章 时间序列回归与预测导论(Introduction to Time Series Regression and Forecasting)
章首导言(PDF p.555–556)
- 时间序列数据:同一实体在多个时点上收集的数据,可回答截面数据无法回答的问题:(1) 动态因果效应(dynamic causal effect)——\(X\) 变化对 \(Y\) 随时间的因果效应,如强制系安全带法律对交通死亡的初始及后续效应;(2) 预测——下月失业率、利率、股价的最佳预测是多少。
- 第 15 章介绍时间序列回归基本概念与工具并应用于经济预测;第 16 章用于估计动态因果效应;第 17 章为进阶(多变量预测、多预测变量预测、波动率变化建模)。
- 经济预测(economic forecasting):预测经济变量未来值。企业计划产量、政府编制预算、央行(如美联储)预测通胀和 GDP 增长以制定货币政策、华尔街投资者预测利润。预测是统计预测问题的一种应用,指对时间序列未来值的预测;与一般预测一样,预测模型不必、通常也没有因果解释。
- 章节安排:15.1 时间序列数据与序列相关;15.2 预测问题、MSFE 与平稳性;15.3 自回归;15.4 加入其他预测变量(期限利差改进 GDP 增长预测);15.5 MSFE 估计与预测区间;15.6 滞后阶数选择;15.7、15.8 两类常见非平稳——趋势与结构突变。
15.1 时间序列数据与序列相关导论(PDF p.556–561)
美国实际 GDP。 图 15.1a:1960–2017 年美国实际 GDP(2009 年美元,对数刻度,因 GDP 近似指数增长)从约 3 万亿美元增至 17 万亿美元以上,增长五倍多,对应对数增加 1.7。增长率不恒定,1960–61、1970、1974–75、1980、1981–82、1990–91、2001、2007–09 年衰退期间 GDP 下降(阴影)。
滞后、一阶差分、对数与增长率。
- 记号:日期 \(t\) 的观测 \(Y_t\),观测总数 \(T\);观测间隔可为周、月、季、年;\(\{Y_t\},t=1,\dots,T\)。本章 GDP 为季度数据,1960:Q1–2017:Q4,\(T=232\)。
- 一阶差分(first difference)\(\Delta Y_t=Y_t-Y_{t-1}\);一阶滞后(first lag)\(Y_{t-1}\);\(j\) 阶滞后 \(Y_{t-j}\);\(Y_{t+1}\) 为下一期值。
- 取对数的两个理由:许多经济序列近似指数增长(对数近似线性增长);许多序列的标准差近似与水平成比例(对数的标准差近似恒定)。对数变化 ≈ 比例变化(脚注 1:\(\ln(X+a)-\ln X\approx a/X\),故 \(\Delta\ln(Y_t)\approx\Delta Y_t/Y_{t-1}\),百分比变化 ≈ \(100\Delta\ln Y_t\))。
- Key Concept 15.1:一阶滞后 \(Y_{t-1}\)、\(j\) 阶滞后 \(Y_{t-j}\);一阶差分 \(\Delta Y_t=Y_t-Y_{t-1}\);对数一阶差分 \(\Delta\ln(Y_t)=\ln Y_t-\ln Y_{t-1}\);百分比变化 ≈ \(100\Delta\ln(Y_t)\),变化小时最准确。
- 例(表 15.1):2016:Q4 GDP 16,851(十亿美元),2017:Q1 16,903,季度增长 \(100\times(16903-16851)/16851=0.31\%\);季度宏观数据惯例按年率报告,\(0.31\times4=1.24\%\)。用对数差:\(\ln16903-\ln16851=0.00308\),\(0.308\times4=1.23\%\),几乎相同。
\[\text{GDPGR}_t\cong400[\ln(GDP_t)-\ln(GDP_{t-1})]=400\Delta\ln(GDP_t) \tag{15.1}\]400 = 100(化为百分比)× 4(季度化年率)。
- 表 15.1 数据:季度、GDP、ln GDP、GDPGR、一阶滞后:2016:Q4 16,851、9.732、1.74、2.74;2017:Q1 16,903、9.735、1.23、1.74;2017:Q2 17,031、9.743、3.01、1.23;2017:Q3 17,164、9.751、3.11、3.01;2017:Q4 17,272、9.757、2.50、3.11。
- 图 15.1b:GDPGR 波动很大,1978:Q2 年率增长超过 15%,2008:Q4 年率下降超过 8%;全期平均 3.0%(GDP 从 1960 年 3.1 万亿增至 2017 年 17.3 万亿),样本标准差 3.3%。
自相关(autocorrelation)。
- 序列与自身滞后值的相关称为自相关或序列相关(serial correlation)。
- Key Concept 15.2:
\[j\text{ 阶自协方差}=\text{cov}(Y_t,Y_{t-j}) \tag{15.2}\]\[j\text{ 阶自相关}=\rho_j=\text{corr}(Y_t,Y_{t-j})=\frac{\text{cov}(Y_t,Y_{t-j})}{\sqrt{\text{var}(Y_t)\text{var}(Y_{t-j})}} \tag{15.3}\]
- 样本估计:
\[\widehat{\text{cov}}(Y_t,Y_{t-j})=\frac1T\sum_{t=j+1}^T(Y_t-\bar Y_{j+1:T})(Y_{t-j}-\bar Y_{1:T-j}) \tag{15.4}\]\[\hat\rho_j=\frac{\widehat{\text{cov}}(Y_t,Y_{t-j})}{\widehat{\text{var}}(Y_t)} \tag{15.5}\]\(\bar Y_{j+1:T}\) 为 \(t=j+1,\dots,T\) 的样本均值。脚注 2:除以 \(T\) 而非自由度调整后的观测数,是计算自协方差的惯例;(15.5) 用 \(\text{var}(Y_t)=\text{var}(Y_{t-j})\),这是平稳性的推论。
- GDPGR 前四阶样本自相关:\(\hat\rho_1=0.33\)、\(\hat\rho_2=0.26\)、\(\hat\rho_3=0.10\)、\(\hat\rho_4=0.11\),温和正自相关:本期增长快于平均,下期也倾向快于平均。
其他经济时间序列例子(图 15.2)。
- (a) 美国失业率(当前人口调查 CPS 测量):衰退时大幅上升,扩张时下降。
- (b) 美元/英镑汇率:1972 年前布雷顿森林固定汇率体系,汇率近乎恒定,仅 1968 年英镑贬值至 2.40 美元;1972 年通胀压力导致体系崩溃,主要货币浮动,此后大幅波动。
- (c) 日本工业生产指数(对数):1960 年代至 1970 年代初快速增长,1970 年代后期和 1980 年代放缓,1990 年代初以来几乎不增长。
- (d) Wilshire 5000 全市场指数日百分比变化(1990-01-02 至 2017-12-29,共 7305 个观测):序列相关很小——若有,就可以用过去日变化预测并获利(市场预期上涨时买、下跌时卖)。虽然基本不可预测,但波动率有模式:1998–2003、2007–2012 年日变化标准差较大,1994、2004、2017 年较小。这种**波动率聚集(volatility clustering)**在很多金融时间序列中存在,属于特殊的异方差,17.5 节建模。
15.2 平稳性与均方预测误差(PDF p.561–565)
平稳性(stationarity)。 用过去预测未来,前提是未来与过去相似——数据的相关性乃至分布与过去相同。若未来根本不同,历史关系就不可靠。
- Key Concept 15.3:时间序列 \(Y_t\) 平稳,若其概率分布不随时间变化,即对任意 \(T\),\((Y_{s+1},Y_{s+2},\dots,Y_{s+T})\) 的联合分布不依赖 \(s\);否则非平稳(nonstationary)。\(X_t\)、\(Y_t\) 联合平稳(jointly stationary),若 \((X_{s+1},Y_{s+1},\dots,X_{s+T},Y_{s+T})\) 的联合分布不依赖 \(s\)。平稳性要求未来至少在概率意义上与过去相似。
- 非平稳的原因:无条件均值有趋势(如对数 GDP 的持续上升趋势);总体回归系数在某时点变化(突变)。15.7、15.8 节讨论检测和处理;在此之前假设平稳。
预测与预测误差。
- 一步向前预测(one-step ahead forecast):用截至 \(T\) 的数据预测 \(Y_{T+1}\);多步向前预测(multi-step ahead forecast)见第 17 章。
- 记号 \(\hat Y_{T+1|T}\):用截至 \(T\) 的数据对 \(T+1\) 期的预测,帽子表示基于估计模型。例:用 1960:Q1–2017:Q3 数据预测 2017:Q4,记为 \(\hat Y_{2017:Q4|2017:Q3}\)。
\[\text{预测误差}=Y_{T+1}-\hat Y_{T+1|T} \tag{15.6}\]
- 预测是对不在估计数据中的未来日期的样本外预测;预测误差在时间过去、实际值观测到之后才实现。
均方预测误差(mean squared forecast error, MSFE)。
- 是第 14 章截面 MSPE 的时间序列对应物。平方使大误差受重罚:一连串小误差问题不大,一个极大误差可能使整个预测工作受质疑。
- 均方根预测误差(RMSFE)= \(\sqrt{\text{MSFE}}\),与 \(Y\) 同单位;若预测无偏,RMSFE 是样本外预测误差的标准差。
- 两个随机性来源:未来值 \(Y_{T+1}\) 的随机性;估计模型的随机性。例:用历史均值 \(\mu_Y\) 预测(预测股票收益的合理起点),需估计为 \(\hat\mu_Y\);若 \(Y_{T+1}\) 与 \(\hat\mu_Y\) 不相关,
\[\text{MSFE}=E[(Y_{T+1}-\mu_Y)^2]+E[(\hat\mu_Y-\mu_Y)^2]\]第一项为已知总体均值时的误差(未来围绕均值的随机波动),第二项为必须估计均值带来的额外误差。
- 最佳预测是给定样本内观测的条件均值 \(E(Y_{T+1}\mid Y_1,\dots,Y_T)\),称为神谕预测(oracle forecast),不可行但是评价基准。MSFE 估计在 15.5 节讨论。
专栏:你能战胜市场吗?(Can You Beat the Market?)(PDF p.565–566)
- 若能预测股价涨跌,主动交易优于“买入并持有”。基于过去收益的预测称为动量预测(momentum forecasts):本月上涨或许下月仍涨,则收益自相关,自回归模型有用。
- 表 15.2:CRSP 价值加权指数月度超额收益(买入持有一个月的收益,包括资本利得和股息,减去国库券收益;单位:百分点/月),1960:M1–2002:M12,\(T=516\)。
| AR(1) | AR(2) | AR(4) | |
|---|---|---|---|
| excess return\(_{t-1}\) | 0.050 (0.051) | 0.053 (0.051) | 0.054 (0.051) |
| excess return\(_{t-2}\) | −0.053 (0.048) | −0.054 (0.048) | |
| excess return\(_{t-3}\) | 0.009 (0.050) | ||
| excess return\(_{t-4}\) | −0.016 (0.047) | ||
| 截距 | 0.312 (0.197) | 0.328 (0.199) | 0.331 (0.202) |
| 滞后项系数 F 统计量 (p 值) | 0.968 (0.325) | 1.342 (0.261) | 0.707 (0.587) |
| \(\bar R^2\) | 0.0006 | 0.0014 | −0.0022 |
- 结论为否定:AR(1) 滞后系数不显著;AR(2)、AR(4) 不能拒绝滞后系数全为 0;一个模型 \(\bar R^2\) 为负,其余仅略为正,均无预测价值。
- 与有效资本市场理论(theory of efficient capital markets)一致:股价已包含所有当前可得信息;若参与者认为某股票下月有正超额收益,会现在买入,推高价格直到预期超额收益恰为 0。因此不能用过去公开信息预测未来超额收益——至少用表 15.2 的回归不能。
15.3 自回归(Autoregressions)(PDF p.566–569)
一阶自回归 AR(1)。 自回归把 \(Y_t\) 的条件均值表示为自身滞后值的线性函数;AR(1) 中 \(E(Y_t\mid Y_{t-1},Y_{t-2},\dots)=\beta_0+\beta_1Y_{t-1}\):
- OLS 估计:看似 \(Y\) 在两边,但右边是 \(Y\) 的一阶滞后,是不同的变量;构造滞后变量作为回归元即可。
- GDP 增长例(1962:Q1–2017:Q3 估计,保留 2017:Q4 用于演示预测误差):
\[\widehat{\text{GDPGR}}_t=\underset{(0.322)}{1.950}+\underset{(0.073)}{0.341}\,\text{GDPGR}_{t-1} \tag{15.9}\]
- 预测:若系数已知,一步预测为 \(\beta_0+\beta_1Y_T\);用 OLS 估计代替:
\[\hat Y_{T+1|T}=\hat\beta_0+\hat\beta_1Y_T \tag{15.10}\]
- 应用:2017:Q3 增长 3.11%,预测 2017:Q4 为 \(1.950+0.341\times3.11\approx3.0\%\);实际 2.5%,预测高 0.5 个百分点,预测误差 −0.5(脚注 3:两个百分比之差的单位是百分点)。AR(1) 的 \(R^2\) 仅 0.11,值得考虑加入更多变量。
p 阶自回归 AR(p)。 用 \(Y_{t-1},\dots,Y_{t-p}\) 加截距作回归元;\(p\) 称为阶数或滞后长度(lag length)。
- Key Concept 15.4:
\[Y_t=\beta_0+\beta_1Y_{t-1}+\beta_2Y_{t-2}+\cdots+\beta_pY_{t-p}+u_t,\quad E(u_t\mid Y_{t-1},Y_{t-2},\dots)=0 \tag{15.12}\]
- GDP 的 AR(2)(1962:Q1–2017:Q3):
\[\widehat{\text{GDPGR}}_t=\underset{(0.37)}{1.60}+\underset{(0.08)}{0.28}\,\text{GDPGR}_{t-1}+\underset{(0.08)}{0.18}\,\text{GDPGR}_{t-2} \tag{15.11}\]第二阶滞后 t = 2.30(p = 0.02),5% 水平显著;\(\bar R^2\) 从 0.11 升到 0.14。
- AR(p) 中 \(E(u_t\mid Y_{t-1},\dots)=0\) 的两个含义:
- 基于全部历史的最佳预测只依赖最近 \(p\) 个值。\(Y_{T+1|T}=E(Y_{T+1}\mid Y_T,Y_{T-1},\dots)\) 是神谕预测,MSFE 最小(习题 15.5):
\[Y_{T+1|T}=\beta_0+\beta_1Y_T+\beta_2Y_{T-1}+\cdots+\beta_pY_{T-p+1} \tag{15.13}\]实践中以估计系数代替。
- 误差 \(u_t\) 无序列相关(由式 2.28 推出,习题 15.5)。
- 基于全部历史的最佳预测只依赖最近 \(p\) 个值。\(Y_{T+1|T}=E(Y_{T+1}\mid Y_T,Y_{T-1},\dots)\) 是神谕预测,MSFE 最小(习题 15.5):
- AR(2) 预测 2017:Q4:\(1.60+0.28\times3.11+0.18\times3.01\approx3.0\),误差 \(2.5-3.0=-0.5\),与 AR(1) 基本相同。
15.4 加入其他预测变量的时间序列回归与自回归分布滞后模型(PDF p.568–573)
用期限利差预测 GDP 增长。
- 图 15.3a:1960–2017 年 10 年期国债利率与 3 个月国库券利率同向运动但非一对一:1960 年代都低,1970 年代上升,1980 年代初见顶,此后下降。短期利率通常低于长期利率,但两者差距在衰退开始前不久收窄甚至消失。
- 长短期利率之差称为期限利差(term spread),图 15.3b:通常为正,衰退前跌向 0 或以下。
- 在 AR(2) 中加入期限利差一阶滞后:
\[\widehat{\text{GDPGR}}_t=\underset{(0.47)}{0.94}+\underset{(0.08)}{0.27}\text{GDPGR}_{t-1}+\underset{(0.08)}{0.19}\text{GDPGR}_{t-2}+\underset{(0.18)}{0.42}\text{TSpread}_{t-1} \tag{15.14}\]TSpread\(_{t-1}\) 的 t 统计量绝对值 2.34(原文印作 −2.34,应为 +2.34),称 1% 水平显著(按 2.34 对应 p≈0.02,严格说是 5% 显著,原文表述如此);\(\bar R^2\) 0.16,高于 AR(2) 的 0.14。2017:Q3 利差 1.21,预测 2017:Q4 为 2.9%,误差 −0.4%。
- 再加第二阶滞后:
\[\widehat{\text{GDPGR}}_t=\underset{(0.46)}{0.94}+\underset{(0.08)}{0.25}\text{GDPGR}_{t-1}+\underset{(0.08)}{0.18}\text{GDPGR}_{t-2}-\underset{(0.42)}{0.13}\text{TSpread}_{t-1}+\underset{(0.43)}{0.62}\text{TSpread}_{t-2} \tag{15.15}\]第二阶利差滞后 t = 1.46(p = 0.14),10% 水平下刚好不显著;\(\bar R^2\) 0.16 基本不变。2017:Q2 利差 1.37、2017:Q3 1.21,预测:\[0.94+0.25\times3.11+0.18\times3.01-0.13\times1.21+0.62\times1.37\approx2.9 \tag{15.16}\]预测误差 −0.4 个百分点。
自回归分布滞后模型(autoregressive distributed lag, ADL)。 “自回归”指含因变量滞后值,“分布滞后”指含另一预测变量的多个滞后。含 \(p\) 个 \(Y\) 滞后和 \(q\) 个 \(X\) 滞后的记为 ADL(\(p,q\)):(15.14) 是 ADL(2,1),(15.15) 是 ADL(2,2)。
- Key Concept 15.5:
\[Y_t=\beta_0+\beta_1Y_{t-1}+\cdots+\beta_pY_{t-p}+\delta_1X_{t-1}+\cdots+\delta_qX_{t-q}+u_t \tag{15.17}\]\(E(u_t\mid Y_{t-1},Y_{t-2},\dots,X_{t-1},X_{t-2},\dots)=0\)。附录 15.3 给出滞后算子记法。
- 该条件均值假设意味着 \(Y\)、\(X\) 的更多滞后都不属于模型,\(p\)、\(q\) 是真实滞后长度。
多预测变量预测的最小二乘假设(Key Concept 15.6):一般模型含 \(k\) 个附加预测变量,第 \(j\) 个含 \(q_j\) 个滞后:
- \(E(u_t\mid Y_{t-1},Y_{t-2},\dots,X_{1t-1},X_{1t-2},\dots,X_{kt-1},X_{kt-2},\dots)=0\);
- (a) \((Y_t,X_{1t},\dots,X_{kt})\) 分布平稳;(b) \((Y_t,X_{1t},\dots,X_{kt})\) 与 \((Y_{t-j},X_{1t-j},\dots,X_{kt-j})\) 随 \(j\) 增大趋于独立;
- 不太可能出现大异常值:各变量有非零有限四阶矩;
- 无完全多重共线。
- 解释:这是截面预测四条最小二乘假设(附录 6.4)的时间序列对应。
- 假设 1 推广 AR/ADL 假设,意味着 (15.18) 给出用所有过去 \(Y\) 与 \(X\) 的神谕预测。
- 假设 2 替代 i.i.d.:(a) 平稳性是“同分布”的时间序列版本——变量(含滞后)的联合分布不随时间变化;非平稳会导致有偏预测等问题。平稳性也意味着估计数据的条件均值也是样本外观测的条件均值,因此它也是外部有效性假设,扮演附录 6.4 预测用第一条假设的角色。(b) 替代“观测间独立”,要求相隔很久的变量独立,称为弱相依(weak dependence),保证大样本下大数定律和中心极限定理成立(精确表述见 Hayashi 2000 第 2 章)。
- 假设 3、4 与截面相同。在这些假设下,OLS 系数推断与截面数据一样进行。
15.5 MSFE 的估计与预测区间(PDF p.573–578)
MSFE 估计的三种方法(复杂度递增,都依赖样本内数据):第一种只考虑未来不确定性、忽略系数估计误差;第二种在平稳假设下纳入两者;第三种还允许条件期望在样本期间变化。平稳下对 AR(p):
- 用回归标准误估计:OLS 方差与 \(1/T\) 成比例,\(T\) 相对 \(p\) 大时第二项可忽略,\(\text{MSFE}\approx\sigma_u^2\):
\[\widehat{\text{MSFE}}_{SER}=s_{\hat u}^2,\quad s_{\hat u}^2=\frac{SSR}{T-p-1} \tag{15.20}\]
- 最终预测误差(final prediction error, FPE):\(T\) 相对 \(p\) 不大时不可忽略第二项。同方差下 \(\text{var}(\hat\beta_0+\cdots)\approx\sigma_u^2(p+1)/T\)(附录 19.7),故 \(\text{MSFE}=\sigma_u^2(1+\frac{p+1}{T})\):
\[\widehat{\text{MSFE}}_{FPE}=\Big(\frac{T+p+1}{T}\Big)s_{\hat u}^2=\Big(\frac{T+p+1}{T-p-1}\Big)\frac{SSR}{T} \tag{15.21}\]
- 伪样本外预测(pseudo out-of-sample forecasting, POOS):将数据分为初始估计样本(前 \(T-P\) 个)和保留样本(后 \(P\) 个);用估计样本估计模型、预测保留样本第一个观测;把该观测加入估计样本、重新估计、预测第二个;如此直到保留样本最后一个,得 \(P\) 个预测误差。“样本外”因为被预测观测未用于估计;“伪”因为保留数据不是真正的未来。(脚注 4:与第 14 章交叉验证相关。)
- Key Concept 15.7 伪样本外预测步骤:(1) 选择 \(P\)(如样本量的 10% 或 20%),令 \(s=T-P\);(2) 用 \(t=1,\dots,s\) 估计预测回归;(3) 计算 \(s+1\) 期预测 \(\tilde Y_{s+1|s}\);(4) 预测误差 \(\tilde u_{s+1}=Y_{s+1}-\tilde Y_{s+1|s}\);(5) 对 \(s=T-P+1,\dots,T-1\) 重复 2–4(每期重新估计)。
\[\widehat{\text{MSFE}}_{POOS}=\frac1P\sum_{s=T-P+1}^T\tilde u_s^2 \tag{15.22}\]
- 优点:不依赖平稳性,条件均值在估计样本与保留样本间可以不同,系数可变化,伪样本外误差可以不是零均值,因此系数变化导致的预测偏差会被 POOS 捕获,而前两种(基于平稳下导出的 15.19)不会。
- 缺点:计算更难;若 \(Y\) 确实平稳,只用 \(P\) 个误差,抽样变异更大;需选 \(P\)。\(P\) 的权衡:系数估计精度 vs 估计 MSFE 可用的观测数,实践中取 10%–20%。
- Key Concept 15.7 伪样本外预测步骤:(1) 选择 \(P\)(如样本量的 10% 或 20%),令 \(s=T-P\);(2) 用 \(t=1,\dots,s\) 估计预测回归;(3) 计算 \(s+1\) 期预测 \(\tilde Y_{s+1|s}\);(4) 预测误差 \(\tilde u_{s+1}=Y_{s+1}-\tilde Y_{s+1|s}\);(5) 对 \(s=T-P+1,\dots,T-1\) 重复 2–4(每期重新估计)。
- GDP 应用:AR(1):RMSFE\(_{SER}\)=3.05、RMSFE\(_{FPE}\)=3.07、RMSFE\(_{POOS}\)=2.60(最后 44 个季度,样本的 20%);AR(2):3.01、3.03、2.52。FPE 大于 SER(多了系数估计方差);POOS 小于样本内估计,部分反映 1980 年代初以后 GDP 增长波动下降——“大缓和”(Great Moderation)。
预测不确定性与预测区间。
- 应报告预测不确定性,一个度量是 RMSFE。在 \(u_t\) 正态的附加假设下,可构造预测区间(forecast interval):以一定概率包含变量未来值的区间;95% 预测区间在重复应用中 95% 包含未来值。
- 与置信区间的重要区别:95% 置信区间(估计 ±1.96 标准误)由中心极限定理支撑,适用于广泛误差分布;而预测误差包含未来误差 \(u_{T+1}\),构造预测区间必须估计误差分布或对其作假设。
- 实践中假设 \(u_{T+1}\) 正态。平稳下预测误差 = \(u_{T+1}\) + 系数估计误差项;后者大样本下近似正态(CLT)且与 \(u_{T+1}\) 不相关。故若 \(u_{T+1}\) 正态,预测误差近似正态,方差等于 MSFE(习题 15.12)。
- 后两种 MSFE 估计纳入了估计误差,可用于构造区间:95% 预测区间 = \(\hat Y_{T+1|T}\pm1.96\,\text{RMSFE}\),RMSFE 取 FPE 或 POOS 版本。
- 若 \(u_t\) 异方差,需对异方差建模以便根据最近的 \(Y\)、\(X\) 估计 (15.19) 中的 \(\sigma_u^2\)(条件异方差建模见第 17 章)。
- 扇形图(fan charts):专业预测者有时报告多个预测区间,合起来概括未来值的完整分布,比只报告均值信息多得多。扇形图用叠加的阴影预测区间描绘未来某日的分布,并沿扩展的预测期连接起来。
- 专栏“血河”(The River of Blood):英格兰银行定期发布通胀预测,结合计量模型输出与高级员工及货币政策委员会的专家判断,以多层红色区间(中心带最深)表示可能路径,官方称“扇形图”,媒体称“血河”。图 15.4(2017 年 2 月):预计通胀从 2017 年初低于 2.0% 目标升至 2018Q1 的 2.7%,理由是需求增强和英镑贬值;实际 2018 年初升至 3.0%,超出预测。英格兰银行是央行透明化的先驱,其他央行也开始发布通胀预测。延伸阅读 Clements (2004)。
15.6 用信息准则估计滞后长度(PDF p.578–582)
确定自回归阶数。 权衡:阶数太低遗漏较远滞后的有用信息;太高则估计多余系数,增加预测估计误差。
- F 统计量(逐步检验)法:从多滞后(如 AR(6))开始,检验最后一阶 5% 水平是否显著,不显著则删掉、估计 AR(5)、检验第五阶……缺点:倾向得到过大的模型——若真实阶数为 5,第 6 阶系数为 0 的 5% 检验仍有 5% 概率错误拒绝,故 5% 的时候会估计成 6。
- 贝叶斯信息准则(Bayes information criterion, BIC),又称施瓦茨信息准则(SIC):
\[\text{BIC}(p)=\ln\Big[\frac{SSR(p)}{T}\Big]+(p+1)\frac{\ln T}{T} \tag{15.23}\]\(\hat p\) 为在 \(p=0,1,\dots,p_{max}\) 中使 BIC 最小的值(\(p=0\) 为只含截距)。解释:第一项随加滞后必然下降(或不增);第二项是估计系数个数(\(p\) 加截距)乘 \(\ln T/T\),随加滞后上升,构成惩罚。BIC 平衡两者,使最小化 BIC 的滞后数是真实滞后长度的一致估计(附录 15.5)。
- 表 15.3(GDP 增长 AR,1962:Q1–2017:Q3,\(T=223\),\(p_{max}=6\)):
| \(p\) | SSR(p)/T | ln[SSR(p)/T] | (p+1)ln(T)/T | BIC(p) | \(R^2\) |
|---|---|---|---|---|---|
| 0 | 10.477 | 2.349 | 0.024 | 2.373 | 0.000 |
| 1 | 9.247 | 2.224 | 0.048 | 2.273 | 0.117 |
| 2 | 8.954 | 2.192 | 0.073 | 2.265 | 0.145 |
| 3 | 8.954 | 2.192 | 0.097 | 2.289 | 0.145 |
| 4 | 8.920 | 2.188 | 0.121 | 2.310 | 0.149 |
| 5 | 8.788 | 2.173 | 0.145 | 2.319 | 0.161 |
| 6 | 8.779 | 2.172 | 0.170 | 2.342 | 0.162 |
例:AR(1) \(\ln(9.247)=2.224\),\(\ln(223)/223=0.024\),\(2\times0.024=0.048\),BIC(1)=2.273。BIC 在 \(p=2\) 最小,\(\hat p=2\)。\(R^2\) 随滞后数单调增加:0→1 增幅大,1→2 较小,之后更小;BIC 精确地决定 \(R^2\) 增幅需多大才值得加滞后。
- 赤池信息准则(Akaike information criterion, AIC):
\[\text{AIC}(p)=\ln\Big[\frac{SSR(p)}{T}\Big]+(p+1)\frac{2}{T} \tag{15.24}\]把 \(\ln T\) 换成 2,惩罚更小(\(T=223\) 时 \(\ln T=5.41\),BIC 惩罚是 AIC 的两倍多),因此加滞后所需的 SSR 下降更小。
- 动机:大样本下 AIC 等价于最小化 FPE 估计的 MSFE(脚注 5:\(\text{MSFE}_{FPE}=\frac{1+(p+1)/T}{1-(p+1)/T}\frac{SSR}{T}\),取对数并用 \(\ln(1+x)\approx x\) 得 \(\ln\text{MSFE}_{FPE}\approx2\frac{p+1}{T}+\ln\frac{SSR}{T}\),即 AIC,在 \((p+1)/T\) 小时成立)。
- 但理论上 AIC 惩罚不足以保证大样本选对阶数,AIC 估计不一致,大样本下以正概率高估 \(p\)(附录 15.5)。
- 两者都广泛使用;若担心 BIC 滞后太少,AIC 是合理替代。
- 脚注 6:BIC/AIC 与第 14 章岭、Lasso 处理同一问题(限制估计参数个数)。区别:截面预测中潜在回归元没有天然顺序;滞后选择中第一阶滞后最有用、其次第二阶,存在天然顺序,AIC/BIC 正利用了这一点。
- 计算注意:比较不同滞后数的回归必须用相同观测。表 15.3 所有回归都用 1962:Q1–2017:Q3 的 223 个观测,更早的 GDP 增长值作为初始滞后值,故 \(T=223\)。
多预测变量时间序列回归的滞后长度选择。
- 权衡相同:滞后太少丢信息,太多增加估计误差。
- F 统计量法:如 (15.15) 中检验利差第二阶滞后为 0,10% 水平不拒绝,可删去。比较的模型少时易用,但一般可能产生过大模型。
- 信息准则:模型含 \(K\) 个系数(含截距)时
\[\text{BIC}(K)=\ln\Big[\frac{SSR(K)}{T}\Big]+K\frac{\ln T}{T} \tag{15.25}\]AIC 用 2 代替 \(\ln T\)。选使 BIC(或 AIC)最小的模型。
- 两个实践要点:(1) 所有候选模型须在同一样本上估计(\(T\) 相同);(2) 多预测变量时组合众多、计算量大,常用捷径是令所有回归元滞后数相同 \(p=q_1=\cdots=q_k\),只需比较 \(p_{max}+1\) 个模型。对 GDP 增长与期限利差的 ADL 用此法得到 (15.15) 的 ADL(2,2)。
15.7 非平稳性 I:趋势(Nonstationarity I: Trends)(PDF p.582–589)
若因变量和/或回归元非平稳,常规检验、置信区间和预测可能不可靠;具体问题与对策取决于非平稳的性质。15.7、15.8 节分别讨论趋势与突变,各自先描述性质,再说明忽略它的后果、检验方法和对策。
什么是趋势。 趋势(trend)是变量随时间持久的长期运动,序列围绕趋势波动。对数 GDP 有明显上升趋势;失业率趋势在 1960 年代末至 1980 年代初上升、之后降到 2000 年代初、再上升;美元/英镑在 1972 年后长期下降;日本工业生产对数趋势复杂(先快、后中等、最后零增长)。
确定性趋势与随机趋势。
- 确定性趋势(deterministic trend):时间的非随机函数,如对数 GDP 每季增长 0.75 个百分点则趋势为 \(0.75t\)。
- 随机趋势(stochastic trend):随机且随时间变化,如长时间上升后长时间下降(失业率);也可能更微妙:GDP 趋势增长率不恒定(1960 年代快于 1970 年代,1990 年代快于 2000 年代)。
- 作者观点:经济序列更适合用随机趋势建模——确定性趋势隐含的可预测性与人们年复一年面对的意外不符。失业率 1970 年代的上升既非注定永远上升也非注定回落,而是人口结构变化(年轻工人涌入)、坏运气(油价冲击、生产率放缓)和货币政策失误共同造成;汇率 1972–1985 年下降、之后上漂也是复杂力量的结果,有很大的不可预测成分。下文“趋势”默认指随机趋势。
随机游走模型。 最简单的随机趋势模型:
- 严格定义中 \(u_t\) i.i.d.;本书更宽泛地只要求 \(E(u_t\mid Y_{t-1},Y_{t-2},\dots)=0\)。满足 \(E(\Delta Y_t\mid Y_{t-1},Y_{t-2},\dots)=0\) 的序列又称鞅(martingale)。
- 含义:明天的值 = 今天的值 + 不可预测的变化;\(E(Y_t\mid Y_{t-1},\dots)=Y_{t-1}\),最佳预测就是今天的值。
- 随机游走的方差随时间增大,非平稳(习题 15.13)。
- 带漂移的随机游走(random walk with drift):
\[Y_t=\beta_0+Y_{t-1}+u_t \tag{15.27}\]\(\beta_0\) 为漂移,\(\beta_0>0\) 时平均上升;最佳预测 = 今天的值 + \(\beta_0\)。随机游走(必要时带漂移)是本书趋势的主要模型。
随机趋势、自回归与单位根。
- 随机游走是 AR(1) 中 \(\beta_1=1\) 的特例:\(\beta_1=1\) ⇒ 含随机趋势、非平稳;若 \(|\beta_1|<1\) 且 \(u_t\) 平稳,则 \(Y_t\) 及其滞后的联合分布不依赖 \(t\),平稳(附录 15.2)。
- AR(p) 平稳条件:多项式 \(1-\beta_1z-\beta_2z^2-\cdots-\beta_pz^p\) 的根(使其为 0 的 \(z\))绝对值都大于 1。AR(1) 的根 \(z=1/\beta_1\),故条件等价于 \(|\beta_1|<1\)。
- 若 AR(p) 有等于 1 的根,称有单位自回归根(unit autoregressive root)或单位根(unit root)。有单位根 ⇔ 含随机趋势,二词可互换使用。
随机趋势带来的问题。
- OLS 估计量下偏、t 统计量非正态:回归元有随机趋势时,原假设下常规 OLS t 统计量即便大样本也可能非正态,自回归系数估计偏向 0,常规置信区间与检验失效。对预测的影响:真实系数为 1 时 OLS 估计倾向小于 1,抽样分布均值小于 1 ⇒ 预测有系统偏差;而 t 统计量非正态,常规推断也发现不了。
- 伪回归(spurious regression):两个独立但都有随机趋势的序列,以很高概率“看起来”相关。例:美国失业率与日本工业生产(对数)在 1960 年代中至 1980 年代初都稳步上升。1962–1985 年:
\[\widehat{\text{U.S. Unemployment Rate}}_t=\underset{(1.19)}{-2.37}+\underset{(0.32)}{2.22}\ln(\text{Japanese IP}_t),\quad\bar R^2=0.34 \tag{15.28}\]斜率 t=7,看似强正相关。1986–2017 年:\[\widehat{\text{U.S. Unemployment Rate}}_t=\underset{(7.74)}{42.37}-\underset{(1.69)}{7.92}\ln(\text{Japanese IP}_t),\quad\bar R^2=0.14 \tag{15.29}\]结论完全相反。根源:两个序列都有随机趋势,1962–1985 年恰好同向,1986–2017 年反向;没有任何经济或政治理由认为两者趋势相关,即伪回归(习题 15.6 用蒙特卡洛模拟演示)。
- 特例:两个序列趋势成分相同(含共同随机趋势)时称为协整(cointegrated),某些回归方法可靠,见第 17 章。
检测随机趋势:单位根检验。 先看时序图;若像有趋势,用 Dickey–Fuller 检验。
- AR(1) 中的 DF 检验:
\[H_0:\beta_1=1\ \text{vs}\ H_1:\beta_1<1,\quad Y_t=\beta_0+\beta_1Y_{t-1}+u_t \tag{15.30}\]两边减 \(Y_{t-1}\),令 \(\delta=\beta_1-1\):\[H_0:\delta=0\ \text{vs}\ H_1:\delta<0,\quad\Delta Y_t=\beta_0+\delta Y_{t-1}+u_t \tag{15.31}\]检验 \(\delta=0\) 的 OLS t 统计量称为 Dickey–Fuller 统计量(Dickey & Fuller 1979),用非稳健(仅同方差)标准误计算(脚注 7:单位根原假设下,常规非稳健标准误得到的 t 统计量其实对异方差稳健,这是一个令人惊讶的特殊结果)。
- 临界值:单位根原假设下 DF 统计量大样本也非正态,需专用临界值。备择为平稳 ⇒ \(\delta<0\),单侧检验。表 15.4(ADF 统计量大样本临界值):
| 确定性回归元 | 10% | 5% | 1% |
|---|---|---|---|
| 仅截距 | −2.57 | −2.86 | −3.43 |
| 截距与时间趋势 | −3.12 | −3.41 | −3.96 |
如仅截距时,ADF < −2.86 则 5% 水平拒绝单位根。这些临界值比标准正态单侧临界值(10% −1.28,5% −1.64)负得多,是“含随机趋势回归元的 t 统计量非正态”的例子。
- AR(p) 中的增广 DF(ADF)检验:加入 \(p-1\) 个 \(\Delta Y_t\) 滞后:
\[\Delta Y_t=\beta_0+\delta Y_{t-1}+\gamma_1\Delta Y_{t-1}+\gamma_2\Delta Y_{t-2}+\cdots+\gamma_{p-1}\Delta Y_{t-p+1}+u_t \tag{15.32}\]\(H_0:\delta=0\)(随机趋势),\(H_1:\delta<0\)(平稳);其 t 统计量为增广 Dickey–Fuller(ADF)统计量。\(p\) 未知,可对不同 \(p\) 的 (15.32) 用信息准则估计;研究表明 ADF 滞后宁多勿少,建议用 AIC 而非 BIC 选 \(p\)(脚注 8:Stock 1994;Haldrup & Jansson 2006)。
- 以线性确定性趋势附近平稳为备择:对失业率这类长期不增长的序列,备择“围绕常数均值平稳”合适;对 GDP 这类序列应以“围绕确定性趋势平稳”为备择,具体为趋势是 \(t\) 的线性函数。此时把 \(t\)(观测序号)加为回归元:
\[\Delta Y_t=\beta_0+\alpha t+\delta Y_{t-1}+\gamma_1\Delta Y_{t-1}+\cdots+\gamma_{p-1}\Delta Y_{t-p+1}+u_t \tag{15.33}\]ADF 为检验 \(\delta=0\) 的 t 统计量,临界值用表 15.4 第二行(非线性时间趋势的扩展见 Maddala & Kim 1998)。
- 美国 GDP 有随机趋势吗? 含两阶 \(\Delta\ln(GDP_t)\) 滞后的 ADF 回归:
\[\widehat{\Delta\ln(GDP_t)}=\underset{(0.080)}{0.162}+\underset{(0.0001)}{0.0001}t-\underset{(0.010)}{0.019}\ln(GDP_{t-1})+\underset{(0.066)}{0.261}\Delta\ln(GDP_{t-1})+\underset{(0.066)}{0.165}\Delta\ln(GDP_{t-2}) \tag{15.34}\]ADF t = −1.95,10% 临界值 −3.12,−1.95 不比 −3.12 更负 ⇒ 10% 水平不能拒绝“对数 GDP 有单位根”(相对于“围绕线性趋势平稳”的备择)。
避免随机趋势带来的问题。 最可靠的方法是变换序列使其不含趋势:有随机趋势的序列,其差分没有。若 \(Y_t=\beta_0+Y_{t-1}+u_t\),则 \(\Delta Y_t=\beta_0+u_t\) 平稳。实践中很少能确定是否有随机趋势;不能拒绝单位根不代表真有单位根,只是证据不足。但即便如此,把真实自回归根近似为 1、改用差分而非水平值仍常常合理(脚注 10:Stock & Watson 1988)。
15.8 非平稳性 II:结构突变(Nonstationarity II: Breaks)(PDF p.589–596)
总体回归函数在样本期内变化是第二类非平稳,原因包括经济政策变化、经济结构变化、发明带来的行业变化。忽略这些变化(突变,breaks)的回归会误导推断与预测,因此要检查预测模型的突变并作调整。
什么是突变。 可以是某日期总体系数的离散变化,也可以是较长时期内系数的渐进演变。
- 离散突变例:1972 年布雷顿森林体系瓦解使美元/英镑汇率的时间序列行为突变(之前近乎恒定、仅 1968 年一次贬值,之后大幅波动)。
- 渐进演变:经济政策和经济结构的缓慢变化。本节方法对两类都能检测。
- 问题:若样本期内发生突变,全样本 OLS 估计的是两个时期“平均”的关系;视突变位置与大小,这一平均回归函数可能与样本末端真实回归函数差别很大,导致预测差。
已知日期的突变检验(Chow 检验)。 例:研究 1970 年代国际贸易关系时,可假设 1972 年(转向浮动汇率)有突变。用二元变量交互回归(Key Concept 8.4)。以 ADL(1,1) 为例,假设突变日期 \(\tau\),\(D_t(\tau)=0\)(\(t\le\tau\))、\(=1\)(\(t>\tau\)):
- 无突变原假设:\(\gamma_0=\gamma_1=\gamma_2=0\);备择:至少一个非零。用 F 统计量检验,称为已知突变日期的 Chow 检验(Gregory Chow 1960)。
- 多预测变量或更多滞后时,为所有回归元构造交互项并检验所有含 \(D_t(\tau)\) 的系数为 0;只关心部分系数时只加入该子集的交互项。
未知日期的突变检验(QLR 检验)。 突变日期常未知或只知范围 \([\tau_0,\tau_1]\)。对区间内每个可能日期 \(\tau\) 计算 Chow F 统计量,取最大者,称为 Quandt 似然比(Quandt likelihood ratio, QLR)统计量(Quandt 1960),又称 sup-Wald 统计量。
- 由于是多个 F 的最大值,分布不同于单个 F,需特殊临界值;依赖约束个数 \(q\)(允许突变的系数个数,含截距)以及端点占比 \(\tau_0/T\)、\(\tau_1/T\)。
- 端点不能太接近样本首尾,否则大样本近似不好,故在“修剪”(trimmed)的子样本上计算;常用 15% 修剪:\(\tau_0=0.15T\)、\(\tau_1=0.85T\)(取整),即在样本中间 70% 计算 F。
- 表 15.5(15% 修剪的 QLR 临界值),按 \(q\) 列 10%/5%/1%:
- \(q=1\):7.12 / 8.68 / 12.16;\(q=2\):5.00 / 5.86 / 7.78;\(q=3\):4.09 / 4.71 / 6.02;\(q=4\):3.59 / 4.09 / 5.12;\(q=5\):3.26 / 3.66 / 4.53;\(q=6\):3.02 / 3.37 / 4.12;\(q=7\):2.84 / 3.15 / 3.82;\(q=8\):2.69 / 2.98 / 3.57;\(q=9\):2.58 / 2.84 / 3.38;\(q=10\):2.48 / 2.71 / 3.23;\(q=11\):2.40 / 2.62 / 3.09;\(q=12\):2.33 / 2.54 / 2.97;\(q=13\):2.27 / 2.46 / 2.87;\(q=14\):2.21 / 2.40 / 2.78;\(q=15\):2.16 / 2.34 / 2.71;\(q=16\):2.12 / 2.29 / 2.64;\(q=17\):2.08 / 2.25 / 2.58;\(q=18\):2.05 / 2.20 / 2.53;\(q=19\):2.01 / 2.17 / 2.48;\(q=20\):1.99 / 2.13 / 2.43。其他修剪比例见 Andrews (2003)。
- QLR 临界值大于 \(F_{q,\infty}\) 临界值,因为考察了许多可能日期、拒绝机会多。
- 可只对部分系数做 QLR(只用这些变量的交互),临界值仍查表 15.5,\(q\) 为检验的约束数。
- 若在检验范围内有离散突变,使分量 F 统计量最大的日期 \(\hat\tau\) 是突变日期的估计。
- 大样本下,存在多个离散突变或回归函数缓慢演变时,QLR 也会以高概率拒绝。因此拒绝可能意味着单个突变、多个突变或缓慢演变。
- Key Concept 15.8 系数稳定性的 QLR 检验:
\[\text{QLR}=\max[F(\tau_0),F(\tau_0+1),\dots,F(\tau_1)] \tag{15.36}\](1) 可检验全部或部分系数的突变;(2) 大样本原假设分布依赖 \(q\) 和 \(\tau_0/T\)、\(\tau_1/T\),15% 修剪临界值见表 15.5;(3) 可检测单个离散突变、多个离散突变和/或回归函数缓慢演变;(4) 若有明确突变,最大 Chow 统计量所在日期是突变日期的估计量。
- 警告:即使你认为知道突变日期,你可能也并不知道。 若专家“知道”的日期来自对所分析序列的了解,实际上是用数据非正式地估计出来的;预先估计日期使常规 F 临界值不能用于 Chow 检验,此时仍应用 QLR。
应用:期限利差的预测力是否稳定? 检验 (15.15) ADL(2,2) 中截距及 TSpread\(_{t-1}\)、TSpread\(_{t-2}\) 系数是否稳定,\(q=3\),样本中间 70%。图 15.5 绘出各日期 Chow F 统计量,如 1975:Q1 为 2.07。最大值 6.47 出现在 1980:Q4,即 QLR 统计量;超过 \(q=3\) 的 1% 临界值 6.02 ⇒ 1% 水平拒绝稳定性,至少一个系数在样本期内改变。
用伪样本外预测检测突变。
- 预测模型的终极检验是样本外(实时)表现;伪样本外预测模拟实时表现,可检测样本末端附近的突变。
- 最直接有用的方法:把样本内拟合值、伪样本外预测和实际值画在同一时序图上,伪样本外期预测明显恶化是模型失效的危险信号。
- 另一检查:比较 \(\text{MSFE}_{POOS}\) 与在同一估计样本(前 \(T-P\) 个观测)上计算的 \(\text{MSFE}_{FPE}\);平稳时两者应接近,POOS 远大于 FPE 提示平稳性被违反,可能是预测方程失效。
- 应用:期限利差的预测力在 2000 年代是否改变? QLR 显示 1980 年代初有突变;那么 1980:Q4 突变之后 ADL(2,2) 是否稳定?用 1981:Q1–2002:Q4 为初始估计样本,按 KC 15.7 生成 2003:Q1–2017:Q3 的伪样本外预测(图 15.6)。例:2006:Q4 实际增长 3.1 个百分点(年率),伪样本外预测 1.6,误差 1.5。
- 若模型稳定,伪样本外误差均值应为 0;但 2003:Q1–2017:Q4 平均误差 −0.57,检验均值为 0 的 t = −2.00,5% 水平拒绝。
- 但 RMSFE\(_{FPE}\)=2.45(1981:Q1–2002:Q4),RMSFE\(_{POOS}\)=2.29(2003:Q1–2017:Q4),样本外略有改善。图 15.6 显示伪样本外预测除 2008 年末至 2009 年初(金融危机 GDP 最剧烈下降期)外大体跟踪实际值;剔除 2008:Q4 一个季度,RMSFE\(_{POOS}\) 从 2.29 降到 1.85。
- 结论:除 2008 年末的骤降外,ADL(2,2) 在 2003–2017 的表现好于 1981–2002 样本内。
- 脚注 11:费城联储 2008 年三季度调查 47 位专业预测者对四季度 GDP 增长的预测,中位数 0.7%,低于 ADL(2,2) 的 2.0%;实际为 −8.5%。
避免突变带来的问题。 取决于突变来源。若在某日期有明确突变,QLR 会以高概率检测到并估计日期;然后用指示两个子样本的二元变量(及适当的与其他回归元的交互)重新估计;若所有系数都突变,就简化为只用突变后数据重新估计。若确实是明确突变,后续系数推断照常(如 t 统计量用正态临界值),预测用突变后模型。若是参数缓慢持续变化,对策更难,超出本书范围(脚注 12:Hansen 2001 讨论离散突变下的估计与检验;Hamilton 1994 第 13 章讨论缓慢演变系数下的估计与预测)。
15.9 结论(PDF p.596)
- 时间序列变量通常与前后观测相关,因此可用线性回归基于当前与过去值预测未来。起点是自回归,可加入其他预测变量的滞后。本章介绍了预测回归的设定、估计、模型选择、趋势处理和稳定性评估。
- 本章回归用于预测,系数一般无因果解释;但在适当条件下,本章或相关方法可估计动态因果效应——下一章主题。
本章小结(原书 9 条):(1) 预测用回归模型不必有因果解释;(2) 时间序列变量一般与自身滞后相关(序列相关);(3) 预测精度用 MSFE 衡量;(4) AR(p) 是以前 \(p\) 个滞后为回归元的线性回归,可用 OLS 估计并预测,阶数用 BIC 或 AIC 估计;(5) 加入其他变量及其滞后可改进预测;在 KC 15.6 假设下 OLS 大样本正态,推断与截面相同;(6) 预测区间量化不确定性;误差正态时“预测 ± RMSFE 估计”是近似 68% 预测区间;(7) 含随机趋势的序列非平稳,可用 ADF 检测随机游走型随机趋势,用一阶差分消除;(8) 总体回归函数随时间变化时,忽略不稳定性的 OLS 预测不可靠;用 QLR 检验突变,若发现离散突变则允许突变重新估计;(9) 伪样本外预测可用于估计 RMSFE、比较模型、评估样本末端的稳定性。
关键术语:GDP、first difference、first lag、jth lag、autocorrelation/serial correlation、autocorrelation coefficient、jth autocovariance、stationarity/nonstationarity、one-step/multi-step ahead forecast、forecast error、MSFE、RMSFE、oracle forecast、autoregression、AR(p)、term spread、ADL(p,q)、weak dependence、FPE、pseudo out-of-sample forecasting、forecast interval、fan chart、BIC、AIC、trend(deterministic/stochastic)、random walk(with drift)、unit root、spurious regression、Dickey–Fuller statistic、ADF statistic、break、break date、QLR statistic、lag operator、lag polynomial、ARMA model。
第 15 章习题概览(PDF p.599–605)
- 复习题:15.1 判断图 15.2 四个序列哪些非平稳、哪些像随机游走(失业率、汇率、日本 IP 对数非平稳;日收益平稳);15.2 许多金融经济学家认为对数股价是随机游走、百分比变化不可预测,某分析师声称新模型更好,如何检验(伪样本外预测比较 RMSFE);15.3 AR(1) \(\hat\beta_1=0.88\)、SE 0.03,95% CI 是否含 1(常规 CI 在单位根附近不可靠);15.4 怀疑 (15.15) 截距在 1992:Q1 变化,如何建模、检验,日期未知时如何检验(Chow/QLR)。
- 习题:
- 15.1 平稳 AR(1):证明 \(E(Y_t)=E(Y_{t-1})\),\(E(Y_t)=\beta_0/(1-\beta_1)\)。
- 15.2 美国工业生产指数月度数据(1986:M1–2017:M12),\(Y_t=1200\ln(IP_t/IP_{t-1})\):(a) 是否为年化月度百分比变化;(b) AR(4) \(\hat Y_t=0.749+0.071Y_{t-1}+0.170Y_{t-2}+0.216Y_{t-3}+0.167Y_{t-4}\),用 2017:M7–M12 的 IP(105.01、104.56、104.82、106.58、106.86、107.30)预测 2018:M1;(c) 加入 \(Y_{t-12}\) 系数 −0.061(SE 0.043)是否显著;(d) 15% 修剪 QLR=1.80 是否有突变;(e) AR(0)–AR(6) 的 SSR 分别为 21,045、20,043、18,870、17,838、17,344、17,337、17,306,用 BIC/AIC 选阶。
- 15.3 ln(IP) 的 ADF 回归(含时间趋势,4 阶差分滞后),\(\ln(IP_{t-1})\) 系数 −0.0070(SE 0.0037),t≈−1.89,对比 −3.12 临界值,不能拒绝单位根,支持对增长率建模。
- 15.4 IP 增长 AR(4) 加入 3 个月国库券利率变化 \(\Delta R_t\) 的 4 阶滞后,F=3.91(利率有助预测 IP,即格兰杰因果意义);反向 F=1.48。
- 15.5 证明 \(E[(W-c)^2]=\sigma_W^2+(\mu_W-c)^2\);条件均值最小化条件 MSFE;AR(p) 误差无序列相关。
- 15.6 伪回归蒙特卡洛:生成两个独立的 \(T=100\) 随机游走,\(Y\) 对 \(X\) 回归,记录 \(R^2\) 和 t 统计量,重复 1000 次看分位数和 |t|>1.96 的比例;改变 \(T=50,200\),拒绝比例不趋于 5% 而是随 \(T\) 增大趋向 1。
- 15.7 平稳 AR(1) \(Y_t=2.5+0.7Y_{t-1}+u_t\),\(\text{var}(u)=9\):均值 \(2.5/0.3\approx8.33\),方差 \(9/(1-0.49)\approx17.6\),自协方差、自相关(0.7、0.49),\(Y_T=102.3\) 时一步预测。
- 15.8 季节哑变量回归估计各月均值(\(\beta_0+\beta_2=\mu_{Mar}\) 等)。
- 15.9 MA(q) 模型 \(Y_t=\beta_0+e_t+b_1e_{t-1}+\cdots+b_qe_{t-q}\):均值 \(\beta_0\)、方差 \(\sigma_e^2(1+b_1^2+\cdots+b_q^2)\)、\(j>q\) 时 \(\rho_j=0\)、MA(1) 自协方差。
- 15.10 30% 修剪、\(q=5\) 的 QLR 临界值介于 15% 修剪 QLR 临界值与 \(F_{5,\infty}\) 之间,判断 3.9、1.1、3.6 是否拒绝。
- 15.11 \(\Delta Y_t\) 是 AR(1) ⇒ \(Y_t\) 是 AR(2),系数为 \(1+b_1\)、\(-b_1\)。
- 15.12 AR(1) 预测误差分解 \(Y_{T+1}-\hat Y_{T+1|T}=u_{T+1}-[(\hat\beta_0-\beta_0)+(\hat\beta_1-\beta_1)Y_T]\),证明 (15.19)。
- 15.13 随机游走 \(Y_0=0\):\(E(Y_t)=0\),\(\text{var}(Y_t)=t\sigma_u^2\),\(\text{cov}(Y_t,Y_{t-k})=(t-k)\sigma_u^2\),故非平稳。
- 实证习题:E15.1 用 PCE 价格指数构造通胀 \(Infl=400\Delta\ln(PCEP)\)(年化百分比),判断随机趋势;\(\Delta Infl\) 自相关(一阶为负,图形锯齿状);AR(1)/AR(2)/AR(p) 与 BIC/AIC;预测 2018:Q1;ADF 检验(含/不含趋势的选择)及“不能拒绝 ≠ 原假设为真”;QLR 稳定性检验;2003–2017 伪样本外预测、偏差、RMSFE,解释 2008:Q4 通胀骤降(油价暴跌)。E15.2 用 1932:M1–2002:M12 扩展数据重做表 15.2,并构造 1983:M1–2002:M12 超额收益的伪样本外预测,检验“能否战胜市场”的结论是否改变。
附录 15.1 第 15 章所用时间序列数据(PDF p.605–606)
GDP 来自商务部经济分析局国民收入与产品账户;失业率来自劳工统计局 CPS,月度取季度平均;10 年期国债、3 个月国库券利率与美元/英镑汇率为美联储日数据的季度平均;日本工业生产指数来自 OECD;Wilshire 5000 日百分比变化 \(=100\Delta\ln(W5000_t)\),时间单位为交易日;均取自圣路易斯联储 FRED。表 15.2 的股票数据为 CRSP 价值加权指数(NYSE 与 AMEX),月度百分比超额收益 \(=100\times\{\ln[(P_t+Div_t)/P_{t-1}]-\ln(TBill_t)\}\),\(TBill_t\) 为 30 天国库券总收益(1 + 利率),数据由 Motohiro Yogo 提供。
附录 15.2 AR(1) 模型的平稳性(PDF p.606–607)
证明 \(|\beta_1|<1\) 且 \(u_t\) 平稳 ⇒ \(Y_t\) 平稳。简化:\(T=2\)、\(\beta_0=0\)、\(u_t\) i.i.d. \(N(0,\sigma_u^2)\)。
- 反复代入:\(Y_t=\beta_1Y_{t-1}+u_t=\beta_1^2Y_{t-2}+\beta_1u_{t-1}+u_t=\cdots\),
\[Y_t=u_t+\beta_1u_{t-1}+\beta_1^2u_{t-2}+\cdots=\sum_{i=0}^\infty\beta_1^iu_{t-i} \tag{15.37}\](MA(∞) 表示)。正态变量加权和为正态,\((Y_{s+1},Y_{s+2})\) 二元正态,由均值、方差、协方差完全决定。
- 均值 0;\(\text{var}(Y_t)=\sigma_u^2\sum_i\beta_1^{2i}=\sigma_u^2/(1-\beta_1^2)\)(用 \(|a|<1\) 时 \(\sum a^i=1/(1-a)\));\(\text{cov}(Y_{s+1},Y_{s+2})=E[Y_{s+1}(\beta_1Y_{s+1}+u_{s+2})]=\beta_1\sigma_u^2/(1-\beta_1^2)\)。都不依赖 \(s\) ⇒ 平稳。若 \(|\beta_1|\ge1\),无穷和不收敛、方差无穷,非平稳。
- 推广:\(\beta_0\ne0\) 时均值为 \(\beta_0/(1-\beta_1)\);正态 i.i.d. 可放宽为“\(u_t\) 平稳且方差有限”,只要 (15.37) 收敛(需 \(|\beta_1|<1\))。
附录 15.3 滞后算子记法(PDF p.607)
- 滞后算子 \(L\):\(LY_t=Y_{t-1}\),\(L^2Y_t=Y_{t-2}\),\(L^jY_t=Y_{t-j}\) (15.38)。
- 滞后多项式(lag polynomial)\(a(L)=a_0+a_1L+\cdots+a_pL^p=\sum_{j=0}^pa_jL^j\)(\(L^0=1\)),次数为 \(p\) (15.39);\(a(L)Y_t=a_0Y_t+a_1Y_{t-1}+\cdots+a_pY_{t-p}\) (15.40)。
- AR(p):\(a(L)Y_t=\beta_0+u_t\),\(a_0=1\)、\(a_j=-\beta_j\) (15.41);ADL(p,q):\(a(L)Y_t=\beta_0+c(L)X_{t-1}+u_t\),\(c(L)\) 次数为 \(q-1\) (15.42)。
附录 15.4 ARMA 模型(PDF p.608)
- ARMA 把 \(u_t\) 建模为另一不可观测无序列相关误差 \(e_t\) 的分布滞后(移动平均):\(u_t=b(L)e_t\),\(b(L)\) 次数 \(q\)、\(b_0=1\)。ARMA(p,q):
\[a(L)Y_t=\beta_0+b(L)e_t \tag{15.43}\]
- AR 与 ARMA 都可看作逼近 \(Y_t\) 自协方差的方法:任何方差有限的平稳序列都可写成 AR 或 MA(可能为无穷阶),后者即 Wold 分解定理(Wold decomposition theorem),是平稳时间序列理论的基础结果之一。
- 只要阶数足够高,AR、MA、ARMA 族同样丰富;有时小阶数 ARMA 比少滞后的纯 AR 更好地逼近自协方差,但 ARMA 较难扩展加入其他回归元。
附录 15.5 BIC 滞后长度估计量的一致性(PDF p.608–609)
目标:BIC 下 \(\Pr(\hat p=p)\to1\);AIC 不成立。以真实 \(p=1\)、在 0/1/2 中选择为例,证明 (i) \(\Pr(\hat p=0)\to0\),(ii) \(\Pr(\hat p=2)\to0\)。
- (i) \(\text{BIC}(0)-\text{BIC}(1)=\ln[SSR(0)/T]-\ln[SSR(1)/T]-\ln T/T\)。\(SSR(0)/T\xrightarrow{p}\sigma_Y^2\),\(SSR(1)/T\xrightarrow{p}\sigma_u^2\),\(\ln T/T\to0\) ⇒ 差值 \(\xrightarrow{p}\ln\sigma_Y^2-\ln\sigma_u^2>0\)(\(\sigma_Y^2>\sigma_u^2\)),所以选 0 的概率 → 0。(欠拟合的 SSR 损失是 \(O(1)\),惩罚差 → 0。)
- (ii) \(T[\text{BIC}(2)-\text{BIC}(1)]=T\ln[SSR(2)/SSR(1)]+\ln T=-T\ln[1+F/(T-2)]+\ln T\),\(F\) 是检验 AR(2) 中 \(\beta_2=0\) 的仅同方差 F 统计量(同方差下渐近 \(\chi^2_1\))。\(T\ln[1+F/(T-2)]-F\xrightarrow{p}0\),故 \(\Pr[\text{BIC}(2)<\text{BIC}(1)]\to\Pr(F>\ln T)\to0\)(\(\ln T\to\infty\))。
- AIC:(i) 同样成立(\(\ln T\) 换为 2);但 (ii) 变为 \(\Pr(F>2)>0\);同方差下 \(\Pr(\chi^2_1>2)=0.16\),故 \(\Pr(\hat p=2)\to0.16\)。一般地 AIC 下 \(\Pr(\hat p<p)\to0\) 但 \(\Pr(\hat p>p)\) 趋于正数,不一致(倾向高估阶数)。
第 15 章本章要点
- 时间序列基本工具:滞后、差分、对数差分≈增长率(季度年化乘 400)、自相关/自协方差及其样本估计。
- 平稳性(分布不随时间变化)是用历史预测未来的前提,也是时间序列的“外部有效性”假设;弱相依替代独立性。
- MSFE/RMSFE 衡量预测精度;神谕预测是条件均值。
- AR(p)、ADL(p,q) 用 OLS 估计;KC 15.6 四条假设下推断与截面相同。期限利差对 GDP 增长有预测力。
- MSFE 三种估计:SER、FPE(乘 \((T+p+1)/T\))、伪样本外(不依赖平稳);正态误差下预测区间 = 预测 ± 1.96 RMSFE;扇形图。
- 滞后选择:逐步 F 检验倾向过大;BIC 一致;AIC 不一致、倾向高估但等价于最小化 FPE;比较时必须使用相同样本。
- 随机趋势(单位根/随机游走):OLS 系数下偏、t 非正态、伪回归;ADF 检验(专用临界值,含趋势与否两套);对策是差分。
- 结构突变:Chow(已知日期)与 QLR(未知日期,15% 修剪、专用临界值);伪样本外预测诊断样本末端稳定性;明确突变后用突变后数据重估。
第 15 章与量化交易的关联
- 收益可预测性与有效市场:“你能战胜市场吗”专栏用 AR 模型检验 CRSP 指数月度超额收益的自相关,\(\bar R^2\) 接近 0,是检验时间序列动量/反转信号的标准起点。实务中要注意:\(\bar R^2\) 很小的预测在收益预测中也可能有经济价值,需结合交易成本、换手和 Sharpe 比率评估,而不能只看统计显著性。
- 回测方法论:伪样本外预测(扩展窗口、每期重新估计)就是走步回测(walk-forward backtest)的原型;用 POOS 而非样本内拟合评估信号,MSFE\(_{POOS}\) 远大于 MSFE\(_{FPE}\) 是信号失效/结构变化的警报。\(P\) 取 10–20% 的权衡同样适用。
- 平稳性与价格/收益建模:对数价格近似随机游走(单位根),应对收益率(对数差分)建模而非价格水平;ADF 检验用于判断价差、基差、利差等序列是否均值回复——这是配对交易与统计套利的前置步骤(协整见第 17 章)。伪回归警示:两个价格序列水平值回归得到的高 \(R^2\)、高 t 值可能毫无意义。
- 波动率聚集:Wilshire 5000 日收益图展示了收益不可预测但波动率可预测,是 GARCH 类风险模型(第 17 章)、波动率目标仓位管理的出发点。
- 宏观择时因子:期限利差预测 GDP 增长、利差倒挂预示衰退,是大类资产配置和宏观择时中常用的预测变量;ADL 模型是此类“预测变量 + 自身滞后”回归的标准形式。
- 模型选择与结构突变:BIC/AIC 用于确定 AR/ADL 阶数;QLR/Chow 检验用于检测因子收益或预测关系的体制变化(regime change),2008 年金融危机这样的极端季度会严重拉高 RMSFE,提示需做稳健性分析(如剔除极端期、使用滚动窗口)。
- 预测区间与风险:正态误差下的预测区间依赖分布假设,金融收益厚尾时 ±1.96 RMSFE 会低估尾部风险;扇形图是展示情景分布的好方式。
第 15 章推荐习题
- 15.6(伪回归蒙特卡洛):亲手验证独立随机游走回归的虚假显著性,建议每位量化研究者都做一遍。
- 15.2、15.3:完整的 AR 预测、季节性滞后检验、QLR、BIC/AIC 和 ADF 实操。
- 15.7、15.13、附录 15.2:平稳 AR(1) 与随机游走矩的推导,理解平稳与非平稳的本质区别。
- 15.12:AR 预测误差分解与 MSFE 公式 (15.19)。
- 15.5:条件均值是最优预测、AR 误差无序列相关。
- 15.9:MA(q) 的自相关截尾性质(与 ACF 识别模型阶数相关)。
- E15.2:重做“能否战胜市场”,并用伪样本外预测评估——可直接扩展为 A 股指数收益可预测性检验。
第 16 章 动态因果效应的估计(Estimation of Dynamic Causal Effects)
章首导言(PDF p.610–611)
- 电影《颠倒乾坤》(Trading Places, 1983)中,丹·艾克罗伊德和艾迪·墨菲饰演的角色利用佛罗里达柑橘越冬状况的内幕消息在冷冻浓缩橙汁期货市场赚了数百万。现实中橙汁期货交易者确实密切关注佛罗里达天气:霜冻冻死橙子(美国几乎所有冷冻浓缩橙汁的来源),供给下降、价格上涨。但天气变坏时价格到底涨多少?一次性上涨还是有延迟,延迟多久?这是交易者需要回答的问题。
- 本章研究 \(X\) 变化对 \(Y\) 当前与未来的效应——动态因果效应。起点是分布滞后回归模型(distributed lag regression model):\(Y_t\) 表示为 \(X_t\) 当前及过去值的函数。
- 结构:16.1 用橙汁与天气数据初探分布滞后模型;16.2 动态因果效应的确切含义;16.3 若回归误差给定 \(X\) 当前与过去值的条件均值为 0(外生性),OLS 估计分布滞后系数是一致的;由于 \(Y_t\) 的遗漏决定因素随时间相关,误差可能序列相关,需要异方差与自相关一致(HAC)标准误(16.4);16.5 第二种方法:把误差序列相关建模为自回归,推导出 ADL 模型,或用广义最小二乘(GLS)估计原分布滞后模型——两者都需要更强的严格外生性(误差给定过去、现在和未来 \(X\) 的条件均值为 0);16.6 橙汁价格与天气的完整分析(天气外生,但经济理论表明不一定严格外生);16.7 考察宏观与金融应用中的外生性假设。
- 本章基于 15.1–15.4,除 16.6 中一个可跳过的小节外不需要 15.5–15.7。
16.1 橙汁数据初探(PDF p.611–613)
- 奥兰多是佛罗里达柑橘产区的历史中心,通常阳光温暖,偶有寒潮;气温低于冰点太久,橙子掉落;寒潮严重时树木冻死。霜冻后浓缩橙汁供给下降、价格上涨,但时点复杂:浓缩橙汁是可储存(耐用)商品,价格不仅取决于当前供给,也取决于对未来供给的预期。今天的霜冻意味着未来供给低,但现有库存既可满足当前也可满足未来需求,所以现有浓缩汁的价格今天就上涨。
- 数据(图 16.1,1950 年 1 月–2000 年 12 月月度):(a) 冷冻浓缩橙汁批发商平均实际价格,用成品生产者价格指数平减;(b) 月度价格百分比变化;(c) 奥兰多机场冰冻度日数(freezing degree days, FDD):当月各日最低温低于冰点的华氏度数之和。例:1950 年 11 月 25 日 31°F、29 日 29°F,FDD \(=(32-31)+(32-29)=4\)。价格大幅波动,许多与寒冷天气同时出现。
- 只含当期的回归(\(\%ChgP_t=100\Delta\ln(P^{OJ}_t)\),\(T=612\)):
\[\widehat{\%ChgP_t}=\underset{(0.22)}{-0.40}+\underset{(0.13)}{0.47}FDD_t \tag{16.1}\]报告的是 HAC 标准误(16.4 节)。一个额外冰冻度日使当月价格上涨 0.47%;4 个冰冻度日的月份(如 1950 年 11 月)价格比无冰冻月份高 \(4\times0.47\%=1.88\%\)。
- 为捕捉寒潮的后续影响,加入 FDD 过去 6 个月的滞后:
\[\widehat{\%ChgP_t}=\underset{(0.23)}{-0.65}+\underset{(0.14)}{0.47}FDD_t+\underset{(0.08)}{0.14}FDD_{t-1}+\underset{(0.06)}{0.06}FDD_{t-2}+\underset{(0.05)}{0.07}FDD_{t-3}+\underset{(0.03)}{0.03}FDD_{t-4}+\underset{(0.03)}{0.05}FDD_{t-5}+\underset{(0.04)}{0.05}FDD_{t-6} \tag{16.2}\]这是分布滞后回归。\(FDD_t\) 系数为霜冻当月的价格涨幅;\(FDD_{t-1}\) 系数是上月一个冰冻度日的影响,等价于霜冻后一个月的效应,以此类推。系数序列即 FDD 对 %ChgP 的动态效应估计。例:1950 年 11 月的 4 个冰冻度日估计使当月价格涨 1.88%,12 月再涨 0.56%(\(4\times0.14\)),1951 年 1 月再涨 0.24%(\(4\times0.06\))……
16.2 动态因果效应(PDF p.612–617)
因果效应与时间序列数据。
- 1.2 节用理想随机对照实验定义因果效应(番茄地随机施肥,施肥与未施肥地块产量期望之差),这依赖多个受试者(截面或面板数据),从而有处理组与对照组。
- 时间序列中需要修改定义。例:央行意外改变短期利率对一国当前与未来 GDP 的效应。字面实验是把不同经济体随机分为处理组与对照组;若只关心美国,就需要美国的“克隆体”——“平行宇宙”实验不可行。
- 替代理解:同一受试者(如美国经济)在不同时点(1970 年代、1980 年代……)接受不同处理(随机选择的利率变动)。单一受试者在不同时间同时扮演处理组与对照组:有时美联储改利率,有时不改。因为数据跨时间,可以估计动态因果效应——处理对结果影响的时间路径。例:意外加息 2 个百分点并维持一个季度,起初对产出影响可忽略,两个季度后 GDP 增长放缓,六个季度后放缓最大,此后两年恢复正常。
- 第二例(橙汁):可设想不同实验得到不同因果效应:(1) 只改变佛罗里达天气、保持其他产区(如德州葡萄柚)天气不变,测量偏效应;(2) 改变所有地区天气,处理是整体天气模式。若竞争作物产区天气相关,两者不同。本章考虑后者——佛罗里达天气变化的动态效应,不固定其他农业地区的天气。
动态效应与分布滞后模型。
- 番茄–肥料多年实验例:三年实验,地块随机分四组:仅第一年施肥、仅第二年、仅第三年、从不施肥(对照),称量第三年收成。\(X_{t-2}\)、\(X_{t-1}\)、\(X_t\) 分别表示两年前、一年前、当年施肥。当年施肥效应 \(\beta_1\)、一年前 \(\beta_2\)、两年前 \(\beta_3\);若肥效在当年最大,\(\beta_1>\beta_2,\beta_3\)。
- 一般地:\(\beta_1\) 是 \(X_t\) 单位变化对 \(Y_t\) 的同期(即时)效应;\(\beta_2\) 是 \(X_{t-1}\) 单位变化对 \(Y_t\) 的效应,等价于 \(X_t\) 对 \(Y_{t+1}\) 的效应;\(X_{t-h}\) 的系数是 \(X\) 单位变化 \(h\) 期后对 \(Y\) 的效应。动态因果效应即对 \(Y_t,Y_{t+1},Y_{t+2},\dots\) 的效应序列,在 (16.3) 中为 \(\beta_1,\beta_2,\dots,\beta_{r+1}\)。
- 对实证分析的两个含义:(1) 动态因果效应在样本期内不应变化——由数据联合平稳(KC 15.3)保证,可用 QLR 检验稳定性,或分子样本估计;(2) \(X\) 必须与误差项不相关。
两类外生性。
- 12.1 节:外生变量与误差不相关,内生变量相关(源于多方程模型中模型内决定 vs 模型外决定)。用 (16.3) 估计动态因果效应,\(X\) 必须外生;时间序列中需细化为两个概念。
- (过去与现在)外生性:\(E(u_t\mid X_t,X_{t-1},X_{t-2},\dots)=0\)。修改了截面的条件均值假设(KC 6.4 假设 1 只要求对所含回归元 \(X_t,\dots,X_{t-r}\) 条件均值为 0):包含所有滞后意味着滞后 \(r\) 以外的因果效应都为 0,(16.3) 的 \(r+1\) 个系数构成全部非零动态因果效应。简称外生性。
- 严格外生性(strict exogeneity),即过去、现在和未来外生:\(E(u_t\mid\dots,X_{t+2},X_{t+1},X_t,X_{t-1},X_{t-2},\dots)=0\)。引入原因:\(X\) 严格外生时,有比分布滞后 OLS 更有效的估计量。
- 关系:严格外生 ⇒ 外生,反之不成立。从相关性看:外生 ⇒ \(u_t\) 与 \(X\) 当期和过去值不相关;严格外生还要求与未来值不相关。例如若 \(Y_t\) 的变化导致未来 \(X\) 变化(反馈),\(X\) 不是严格外生,尽管可能是外生的。
- 例 1 番茄肥料:随机施肥 ⇒ 外生;今天的产量不取决于未来施肥量 ⇒ 严格外生。
- 例 2 橙汁:天气不受人控制,可视为随机分配;若 FDD 效应线性且 \(r\) 个月后无效应,则天气外生。但是否严格外生?需仔细考虑 \(u_t\) 包含什么:若市场参与者在决定买卖量时使用 FDD 的预测,价格从而误差 \(u_t\) 可能包含未来 FDD 的信息,使 \(u_t\) 成为 FDD 的有用预测变量 ⇒ \(u_t\) 与未来 FDD 相关 ⇒ FDD 外生但不严格外生。与番茄例的区别:番茄不受未来施肥影响,而橙汁市场参与者受未来天气预测影响。16.6 节再讨论。
- Key Concept 16.1:分布滞后模型 \(Y_t=\beta_0+\beta_1X_t+\cdots+\beta_{r+1}X_{t-r}+u_t\) (16.4) 有两种外生性:过去与现在外生 \(E(u_t\mid X_t,X_{t-1},\dots)=0\) (16.5);严格外生 \(E(u_t\mid\dots,X_{t+1},X_t,X_{t-1},\dots)=0\) (16.6)。严格外生蕴含外生,反之不然。
16.3 外生回归元下动态因果效应的估计(PDF p.617–620)
\(X\) 外生时,可用 OLS 估计 (16.4) 得到动态因果效应。
分布滞后模型假设(Key Concept 16.2):\(\beta_1,\dots,\beta_{r+1}\) 为动态因果效应,且
- \(X\) 外生:\(E(u_t\mid X_t,X_{t-1},X_{t-2},\dots)=0\);
- (a) \(Y_t\)、\(X_t\) 分布平稳;(b) \((Y_t,X_t)\) 与 \((Y_{t-j},X_{t-j})\) 随 \(j\) 增大趋于独立;
- 不太可能有大异常值:\(Y_t\)、\(X_t\) 有超过八阶的非零有限矩;
- 无完全多重共线。
- 解释:假设 1 把截面零条件均值扩展到 \(X\) 的所有滞后,意味着总体回归函数概括了 \(X\) 对 \(Y\) 的全部动态效应。假设 2 与 ADL 模型(KC 15.6 假设 2)相同。假设 3 比本书他处的“四阶矩”更强,是 HAC 方差估计量数学推导所需。假设 4 与截面相同。
- 扩展到多个 \(X\):把其他 \(X\) 及其滞后加入回归、相应修改假设即可;概念简单但记号繁琐,本章不显式处理。
自相关误差、标准误与推断。
- 分布滞后模型中 \(u_t\) 可能自相关,因为 \(u_t\) 中的遗漏因素本身序列相关。例:橙汁需求取决于潜在消费者总收入,收入是遗漏变量;收入衰退时下降、扩张时上升,序列相关 ⇒ \(u_t\) 序列相关。这很典型。
- 自相关不影响 OLS 的一致性,也不引入偏差;但通常的 OLS 标准误不一致,需用不同公式。类比异方差:误差异方差时仅同方差标准误是“错的”;误差序列相关时基于 i.i.d. 误差的标准误是“错的”,导致误导性推断。解决办法:HAC 标准误(16.4)。
动态乘数与累积动态乘数。
- 动态因果效应又称动态乘数(dynamic multiplier)。\(X\) 单位变化 \(h\) 期后对 \(Y\) 的效应即 (16.4) 中的 \(\beta_{h+1}\),称为 h 期动态乘数:\(\beta_2\) 为一期动态乘数,\(\beta_3\) 为两期……零期(同期)动态乘数或冲击效应(impact effect)为 \(\beta_1\)。其标准误即 OLS 系数的 HAC 标准误。
- h 期累积动态乘数(cumulative dynamic multiplier):\(X\) 单位变化在接下来 \(h\) 期对 \(Y\) 的累积效应,即动态乘数的累积和:零期 \(\beta_1\),一期 \(\beta_1+\beta_2\),\(h\) 期 \(\beta_1+\cdots+\beta_{h+1}\)。全部之和 \(\beta_1+\cdots+\beta_{r+1}\) 为 长期累积动态乘数(long-run cumulative dynamic multiplier)。
- 例(16.2):冲击效应 0.47%;一个月累积 \(0.47+0.14=0.61\%\);两个月累积 \(0.47+0.14+0.06=0.67\%\)。
- 直接估计累积乘数的变形回归:
\[Y_t=\delta_0+\delta_1\Delta X_t+\delta_2\Delta X_{t-1}+\delta_3\Delta X_{t-2}+\cdots+\delta_r\Delta X_{t-r+1}+\delta_{r+1}X_{t-r}+u_t \tag{16.7}\]可证(习题 16.5)(16.7) 与 (16.4) 等价:\(\delta_0=\beta_0\),\(\delta_1=\beta_1\),\(\delta_2=\beta_1+\beta_2\),\(\delta_3=\beta_1+\beta_2+\beta_3\)……,\(X_{t-r}\) 的系数 \(\delta_{r+1}=\beta_1+\cdots+\beta_{r+1}\) 为长期累积乘数。OLS 估计也对应相等(如 \(\hat\delta_2=\hat\beta_1+\hat\beta_2\))。主要好处:(16.7) 系数的 HAC 标准误直接就是累积动态乘数的 HAC 标准误。
16.4 异方差与自相关一致(HAC)标准误(PDF p.620–624)
误差 \(u_t\) 自相关时,OLS 系数一致,但截面数据的常规 OLS 标准误一般不一致,基于它的检验和置信区间(如估计 ±1.96 常规标准误)即使大样本也不能在 95% 重复样本中覆盖真值。第 10 章面板数据的聚类标准误是 HAC 的一种,但数据结构不同、公式不同;本节自成体系。
自相关误差下 OLS 估计量的分布。 考虑无滞后的单回归元模型
- 若 \(v_t\) i.i.d.,\(\text{var}(\bar v)=\text{var}(v_t)/T\),KC 4.4 公式适用;若 \(u_t\)、\(X_t\) 跨时不独立,\(v_t\) 一般序列相关:
\[\text{var}(\bar v)=\frac{1}{T^2}\big[T\text{var}(v_t)+2(T-1)\text{cov}(v_t,v_{t-1})+2(T-2)\text{cov}(v_t,v_{t-2})+\cdots+2\text{cov}(v_t,v_{t-T+1})\big]=\frac{\sigma_v^2}{T}f_T \tag{16.12}\]\[f_T=1+2\sum_{j=1}^{T-1}\Big(\frac{T-j}{T}\Big)\rho_j,\quad\rho_j=\text{corr}(v_t,v_{t-j}) \tag{16.13}\]大样本 \(f_T\to f_\infty=1+2\sum_{j=1}^\infty\rho_j\)。
- 合并:
\[\text{var}(\hat\beta_1)=\Big[\frac1T\frac{\sigma_v^2}{(\sigma_X^2)^2}\Big]f_T \tag{16.14}\]方括号是无序列相关时的 KC 4.4 方差公式,\(f_T\) 是序列相关修正因子。因此 \(v_t=(X_t-\mu_X)u_t\) 序列相关时,按式 (5.4) 计算的常规(异方差稳健)标准误差了因子 \(f_T\)。(直观:\(X\) 与 \(u\) 都正自相关时 \(\rho_j>0\),\(f_T>1\),常规标准误低估不确定性。)
HAC 标准误。
- \(f_T\) 依赖未知自相关,需估计;含此修正的方差估计量无论是否异方差、是否自相关都一致,称为 HAC 方差估计量,其平方根为 HAC 标准误:
\[\tilde\sigma^2_{\hat\beta_1}=\hat\sigma^2_{\hat\beta_1}\hat f_T \tag{16.15}\]\(\hat\sigma^2_{\hat\beta_1}\) 为无序列相关时的方差估计(式 5.4)。
- 构造 \(\hat f_T\) 的两难:一个极端用全部 \(T-1\) 个样本自相关代入 (16.13),估计量含太多估计误差,不一致;另一个极端只用很少(如只用一阶),忽略高阶自相关,也不一致。实践的折中:使用自相关个数随 \(T\) 增大而增加,但远少于 \(T\):
\[\hat f_T=1+2\sum_{j=1}^{m-1}\Big(\frac{m-j}{m}\Big)\tilde\rho_j,\quad\tilde\rho_j=\frac{\sum_{t=j+1}^T\hat v_t\hat v_{t-j}}{\sum_{t=1}^T\hat v_t^2},\quad\hat v_t=(X_t-\bar X)\hat u_t \tag{16.16}\]\(m\) 称为截断参数(truncation parameter),因为求和只保留 \(m-1\) 个自相关。
- \(m\) 的选择:须大样本下变大但远小于 \(T\)。经验规则:
\[m=0.75T^{1/3} \tag{16.17}\]取整;基于 \(v_t\) 至多中等自相关的假设(脚注 1:当 \(u_t\)、\(X_t\) 都是一阶自相关 0.5 的 AR(1) 时,它使 \(E(\tilde\sigma^2-\sigma^2)^2\) 最小;源自 Andrews 1991 式 5.3)。可根据序列知识调整:\(v_t\) 序列相关很强时增大 \(m\),很弱时减小。由于 \(m\) 的选择有模糊性,好的做法是对至少一个设定试一两个其他 \(m\) 值,确认结果不敏感。
- (16.15)+(16.16) 称为 Newey–West 方差估计量(Newey & West 1987),在一般假设下配合 (16.17) 类规则是一致的。其证明(及 Andrews 1991)假设 \(v_t\) 有超过四阶矩,这由 \(X_t\)、\(u_t\) 有超过八阶矩保证——这就是 KC 16.2 假设 3 要求八阶矩的原因。
- 其他 HAC 估计量:可用不同于 \((m-j)/m\)(Bartlett 核)的权重,此时 (16.17) 不再适用,需相应规则(见 Hayashi 2000 第 6.6 节)。
- 推广到多元回归:误差序列相关时常规 OLS 标准误不可靠,应用 HAC;Newey–West 时无论单回归元还是多回归元都可按 (16.17) 选 \(m\);矩阵公式已内置于时间序列回归软件(Hayashi 2000 第 6.6 节)。
- Key Concept 16.3 HAC 标准误:问题——分布滞后模型误差可序列相关,OLS 系数一致但常规标准误一般不一致,导致误导性检验和置信区间。解决——用 HAC 方差估计量计算标准误,涉及 \(m-1\) 个自相关和方差的估计(单回归元公式 16.15、16.16)。实践中以 (16.17) 为基准选择 \(m\),再根据回归元和误差序列相关的强弱增减。
16.5 严格外生回归元下动态因果效应的估计(PDF p.624–630)
\(X_t\) 严格外生时有两种替代估计量:(1) 估计 ADL 模型再由其系数计算动态乘数,可能需估计的系数更少、估计误差更小;(2) 用广义最小二乘(GLS)估计分布滞后模型,系数个数与 OLS 相同但方差更小。为简化,以一阶滞后、AR(1) 误差的分布滞后模型讲解;附录 16.2 推广到高阶。
带 AR(1) 误差的分布滞后模型。 设效应只持续两期(冲击效应 \(\beta_1\)、下一期 \(\beta_2\)):
- 准差分表示:定义准差分(quasi-difference)\(\tilde Y_t=Y_t-\phi_1Y_{t-1}\)、\(\tilde X_t=X_t-\phi_1X_{t-1}\)(“准”是因为不是 \(Y_t-Y_{t-1}\)):
\[\tilde Y_t=\alpha_0+\beta_1\tilde X_t+\beta_2\tilde X_{t-1}+\tilde u_t \tag{16.23}\]
- 两种表示等价,误差 \(\tilde u_t\) 都无序列相关,但提示不同估计策略。
ADL 与准差分模型的零条件均值假设。 以 (16.23) 为例,它是准差分变量、误差无序列相关的分布滞后模型,关键假设是 \(\tilde X_t\) 外生:
- 由 \(X_t=\tilde X_t+\phi_1X_{t-1}\),以 \(\tilde X_t\) 及其所有滞后为条件等价于以 \(X_t\) 及其所有滞后为条件,故 (16.24) ⇔ \(E(\tilde u_t\mid X_t,X_{t-1},\dots)=0\)。又 \(\tilde u_t=u_t-\phi_1u_{t-1}\):
\[0=E(u_t\mid X_t,X_{t-1},\dots)-\phi_1E(u_{t-1}\mid X_t,X_{t-1},\dots) \tag{16.25}\]
- 要对一般 \(\phi_1\) 成立,须两项都为 0;第二项时间下标前移一期即
\[E(u_t\mid X_{t+1},X_t,X_{t-1},\dots)=0 \tag{16.26}\](由迭代期望律它蕴含 \(E(u_t\mid X_t,X_{t-1},\dots)=0\)。)
- 结论:(16.26) 由严格外生蕴含,但不由(过去与现在)外生蕴含。因此估计 (16.23) 或 ADL 表示需要严格外生(至少需要对一期未来 \(X\) 的外生),仅外生不够。
OLS 估计 ADL 模型。
- 用 OLS 估计 (16.21):加入 \(Y\) 的滞后和多一期 \(X\) 滞后后误差无序列相关(在误差为 AR(1) 的假设下),可用常规 OLS 标准误,不需 HAC。
- ADL 系数本身不是动态乘数,但可由其计算:把估计回归函数表示成 \(X\) 当前与过去值的函数,反复代入消去 \(Y\) 的滞后。估计函数(省略截距,因其不影响乘数):
\[\hat Y_t=\hat\phi_1Y_{t-1}+\hat\delta_0X_t+\hat\delta_1X_{t-1}+\hat\delta_2X_{t-2} \tag{16.27}\]代入 \(\hat Y_{t-1}\):\[\hat Y_t=\hat\delta_0X_t+(\hat\delta_1+\hat\phi_1\hat\delta_0)X_{t-1}+(\hat\delta_2+\hat\phi_1\hat\delta_1)X_{t-2}+\hat\phi_1\hat\delta_2X_{t-3}+\hat\phi_1^2Y_{t-2} \tag{16.28}\]继续代入:\[\hat Y_t=\hat\delta_0X_t+(\hat\delta_1+\hat\phi_1\hat\delta_0)X_{t-1}+(\hat\delta_2+\hat\phi_1\hat\delta_1+\hat\phi_1^2\hat\delta_0)X_{t-2}+\hat\phi_1(\hat\delta_2+\hat\phi_1\hat\delta_1+\hat\phi_1^2\hat\delta_0)X_{t-3}+\hat\phi_1^2(\cdots)X_{t-4}+\cdots \tag{16.29}\]这些系数即动态乘数的估计。若 (16.22) 的约束对估计值精确成立,第二个以后的乘数(\(X_{t-2},X_{t-3},\dots\) 的系数)都为 0(脚注 2:代入可得 \(\delta_2+\phi_1\delta_1+\phi_1^2\delta_0=0\));但无约束 OLS 估计下约束不会精确成立,所以一般非零。
GLS 估计。
- 不可行 GLS(infeasible GLS):若 \(\phi_1\) 已知,可直接计算准差分 \(\tilde X_t\)、\(\tilde Y_t\);严格外生下 \(E(\tilde u_t\mid\tilde X_t,\tilde X_{t-1},\dots)=0\),用 OLS 对 \(\tilde Y_t\) 回归 \(\tilde X_t\)、\(\tilde X_{t-1}\)(含截距)估计 \(\alpha_0,\beta_1,\beta_2\)。现实中 \(\phi_1\) 未知,故不可行。
- 可行 GLS(feasible GLS):用初步估计 \(\hat\phi_1\) 计算 \(\tilde X_t=X_t-\hat\phi_1X_{t-1}\)、\(\tilde Y_t=Y_t-\hat\phi_1Y_{t-1}\),再做上述 OLS。\(\hat\phi_1\) 的求法:先用 OLS 估计 (16.18),再用 OLS 残差 \(\hat u_t\) 代替 \(u_t\) 估计 (16.19)。此即 Cochrane–Orcutt (1949) 估计量。
- 迭代 Cochrane–Orcutt:用 GLS 的 \(\beta_1,\beta_2\) 估计更新残差 → 重估 \(\phi_1\) → 重算准差分 → 重估 \(\beta_1,\beta_2\) → 直至收敛。
- GLS 的有效性:若 \(X\) 严格外生且变换后误差 \(\tilde u_t\) 同方差,GLS 至少在大样本下在线性估计量中有效。不可行 GLS:\(\phi_1\) 已知(\(\tilde X_t,\tilde Y_t\) 视为可观测)、\(\tilde u_t\) 同方差、\(X_t\) 严格外生 ⇒ 由高斯–马尔可夫定理,(16.23) 的 OLS 在基于 \(\tilde X_t,\tilde Y_t\)(\(t=2,\dots,T\),准差分损失第一个观测)的线性条件无偏估计量中最有效,即 BLUE(5.5 节)。可行 GLS 中 \(\hat\phi_1\) 一致且方差与 \(1/T\) 成比例,大样本下与不可行 GLS 方差相同,损失第一个观测的信息在 \(T\) 大时可忽略 ⇒ 严格外生时可行 GLS 大样本下是 BLUE,比 16.3 节分布滞后 OLS 更有效。
- 一般 GLS:变换回归模型使误差同方差且无序列相关,再对变换后模型做 OLS。\(X\) 严格外生时 GLS 一致且大样本 BLUE;\(X\) 只(过去与现在)外生时 GLS 不一致。矩阵推导见 19.6 节。
16.6 橙汁价格与寒冷天气(PDF p.630–636)
两个问题:霜冻对价格的影响持续多久?这一动态效应在 51 年中是否稳定?
分布滞后 OLS 估计。 用 16.3 节方法:%ChgP\(_t\) 对 FDD\(_t\) 及其滞后做分布滞后回归。需要 FDD(过去与现在)外生——人类无法影响天气,作为工作假设视其为随机分配是合适的。误差可能序列相关,使用 Newey–West HAC 标准误:\(T=612\),\(m=0.75\times612^{1/3}=6.37\),向上取整为 \(m=7\)。
表 16.1:FDD 对橙汁价格的动态效应(因变量为月度实际价格百分比变化,1950:1–2000:12,\(T=612\);回归 (1) 为 FDD\(_t\) 及 18 阶滞后;括号内为 Newey–West HAC 标准误)
| 滞后 | (1) 动态乘数 | (2) 累积乘数 | (3) 累积乘数 | (4) 累积乘数 |
|---|---|---|---|---|
| 0 | 0.50 (0.14) | 0.50 (0.14) | 0.50 (0.14) | 0.51 (0.15) |
| 1 | 0.17 (0.09) | 0.67 (0.14) | 0.67 (0.13) | 0.70 (0.15) |
| 2 | 0.07 (0.06) | 0.74 (0.17) | 0.74 (0.16) | 0.76 (0.18) |
| 3 | 0.07 (0.04) | 0.81 (0.18) | 0.81 (0.18) | 0.84 (0.19) |
| 4 | 0.02 (0.03) | 0.84 (0.19) | 0.84 (0.19) | 0.87 (0.20) |
| 5 | 0.03 (0.03) | 0.87 (0.19) | 0.87 (0.19) | 0.89 (0.20) |
| 6 | 0.03 (0.05) | 0.90 (0.20) | 0.90 (0.21) | 0.91 (0.21) |
| 12 | −0.14 (0.08) | 0.54 (0.27) | 0.54 (0.28) | 0.54 (0.28) |
| 18 | 0.00 (0.02) | 0.37 (0.30) | 0.37 (0.31) | 0.37 (0.30) |
| 月度哑变量 | 否 | 否 | 否 | 是,F=1.01 (p=0.43) |
| HAC 截断参数 \(m\) | 7 | 7 | 14 | 7 |
- 一个冰冻度日使当月价格上涨 0.50%,下月再涨 0.17%,再下月 0.07%。\(R^2=0.12\):月度价格变化大部分不能由 FDD 当前与过去值解释。
- 图 16.2:(a) 动态乘数及 95% CI(估计 ±1.96 HAC 标准误):初始急涨后后续涨幅小,前六个月每月都略涨;除第一个月外,各月动态乘数在 5% 水平都不显著,但到第 7 个月都估计为正。(b) 累积乘数:1 个月后 0.67%,2 个月 0.74%,6 个月 0.90%;前 7 个月单期乘数为正,累积乘数上升,第 7 个月见顶;第 8 个月乘数为负,价格从峰值缓慢回落;18 个月后累积仅 0.37%,即长期累积乘数 0.37%,10% 水平不显著(\(t=0.37/0.30=1.23\))。结论:霜冻对橙汁价格水平有持久影响,约 7 个月后价格见顶。
敏感性分析(三方面):
- HAC 截断参数:第 (3) 列用 \(m=14\)(第 (2) 列的两倍),设定不变,系数和乘数相同,只有标准误不同且相差不大 ⇒ 对 \(m\) 不敏感。
- 潜在遗漏变量偏误:霜冻只发生在冬季,不是全年随机分配;若橙汁需求有季节性(冬季需求是否更高),季节需求模式可能与 FDD 相关。橙汁销量是内生的(供需同时决定价量),加入数量会导致联立偏误(9.2 节),但可加入季节变量捕捉需求的季节成分:第 (4) 列加入 11 个月度哑变量(省略一个避免与截距完全共线),10% 水平联合不显著(p=0.43),累积乘数基本不变 ⇒ 季节性需求波动不是重要的遗漏变量偏误来源。
- 动态乘数是否随时间稳定?(脚注 3:本小节用到 15.7 节内容,可跳过。原文此处写 Key Concept 15.9,实际对应 15.8 的 QLR。)没有特定突变日期,用 QLR(15% 修剪、HAC 方差)检验第 (1) 列所有系数的稳定性:QLR=21.19,\(q=20\)(FDD\(_t\)、18 个滞后和截距);表 15.5 中 1% 临界值 2.43 ⇒ 1% 水平拒绝。该 QLR 回归有 40 个回归元,数量很大;只用 6 个滞后重算(16 个回归元、\(q=8\))也在 1% 水平拒绝。因此拒绝动态乘数稳定。
- 图 16.3:分三段(1950–1966、1967–1983、1984–2000)分别回归的累积动态乘数:1950 年代与 1960 年代初,冰冻度日对价格影响大而持久;1970 年代影响幅度减小但仍高度持久;1980 年代后期和 1990 年代,短期影响与 1970 年代相同,但持久性大大降低,约一年后基本消失。即 20 世纪下半叶佛罗里达霜冻对橙汁价格的动态因果效应变小且更不持久。
专栏:橙树在行军(Orange Trees on the March)。 动态乘数为何随时间变化?可能是市场变化,也可能是橙树“南迁”。据佛罗里达柑橘局,1980 年代的严重霜冻(图 16.1c 可见)促使种植者寻求更温暖的气候。图 16.4:易受霜冻的北部和西部县橙园面积从 1981 年 232,000 英亩降至 1985 年 53,000 英亩;南部和中部县从 1985 年 413,000 英亩增至 1993 年 588,000 英亩。橙园南移后北部霜冻损害的作物比例变小,价格对北部城市奥兰多气温的敏感度下降——赋予“非平稳性”一词新含义(麦克白的森林行军典故)。脚注 4:2000 年后行业变化更多:需求下降、巴西进口增加、柑橘黄龙病(citrus greening)细菌病害阻止果实成熟并杀死果树,2000–2015 年佛罗里达橙子总产量下降约 60%。
ADL 与 GLS 估计? 若误差序列相关且 FDD 严格外生,可用 ADL 或 GLS 更有效地估计。但 FDD 是否严格外生?人类不能影响每日天气,但这不意味着天气严格外生。表 16.1 第 (1) 列总体回归的误差是价格与基于过去 18 个月天气的总体预测之间的差异,来源之一是交易者使用奥兰多天气预报:若预测冬季特别冷,交易者会把它计入价格,价格高于总体回归预测值(误差为正);若预测准确,未来确实会冷,未来 FDD 为正(\(X_{t+1}>0\))而当前价格异常高(\(u_t>0\))⇒ \(\text{corr}(X_{t+1},u_t)>0\)。简言之,橙汁交易者不能影响天气,但能够(而且确实)预测天气,因此价格–天气回归误差与未来天气相关:FDD 外生但(若此推理正确)不严格外生,GLS 与 ADL 估计量不是动态乘数的一致估计,本应用不使用。
专栏:新闻快讯——商品交易员让迪士尼世界打寒战(NEWS FLASH: Commodity Traders Send Shivers Through Disney World)。
- 冬夜去迪士尼世界该不该带厚外套?内行人看当天纽约橙汁期货收盘价!
- Richard Roll (1984) 用 1975–1981 年纽约棉花交易所橙汁期货日价格和奥兰多日间与夜间气温研究两者关系,不仅研究寒冷对价格的效应,也研究期货价格变化对天气的“效应”:交易日内期货价格上涨预测了当晚奥兰多的寒冷(尤其是霜冻);市场预测能力强到日内价格上涨甚至能预测美国政府官方当晚天气预报的误差。
- Roll 也发现:详细天气数据只解释了日度期货价格变动的一部分,大部分日度变动无法解释,他据此提出橙汁期货市场存在“过度波动”(excess volatility)——波动超过基本面变动所能解释的程度;金融市场是否及为何存在过度波动是金融经济学的重要研究领域。
- 该发现也说明预测与估计动态因果效应的区别:期货价格变动是寒冷天气的有用预测指标,但这不意味着交易员能让气温下降。迪士尼游客在期货价格上涨后可能发抖,但不是因为价格上涨——除非他们做空了橙汁期货。
16.7 外生性可信吗?若干例子(PDF p.637–638)
与截面回归一样,把分布滞后系数解释为动态因果效应取决于 \(X\) 外生。若 \(X_t\) 或其滞后与 \(u_t\) 相关,\(X\) 不外生。经济时间序列中特别重要的担忧是联立因果(9.2、12.1 节),导致内生回归元。四个例子:
- 美国收入与澳大利亚出口:美国是澳大利亚出口的重要需求来源,可用澳大利亚对美出口对美国收入回归。严格说存在联立因果(澳出口下降 → 澳收入下降 → 对美进口需求下降 → 美收入下降),但澳经济远小于美国,此效应很小,美国收入可视为外生。相反,欧盟对美出口对美国收入的回归中,欧盟对美国出口的需求占美国出口总需求的很大部分,贸易联系使两者联立决定,美国收入可能不外生。一般结论:变量是否外生取决于情境。
- 油价与通胀:1970 年代油价上涨以来,宏观经济学家关注国际原油价格上涨对美国通胀的动态效应。油价主要由外国产油国在世界市场决定,乍看外生;但油价不像天气:OPEC 成员策略性地设定产量,考虑世界经济状况等因素;若油价(或产量)基于对当前和未来世界经济状况(包括美国通胀)的评估设定,则油价内生。
- 货币政策与通胀:央行需要知道短期利率(短端利率)变化对通胀的动态因果效应。短端利率由央行决定,但不是随机设定(理想随机实验那样),而是基于对当前与未来经济(尤其当前与未来通胀)的评估内生决定:通胀取决于利率(高利率降低总需求),利率又取决于通胀的当前、过去和(预期)未来值。因此短端利率内生,用通胀对当前和过去利率的 OLS 回归不能一致估计其动态因果效应。
- GDP 增长与期限利差:第 15 章用期限利差滞后预测 GDP 增长。因为滞后值发生在过去,似乎不存在当前 GDP 增长对过去利差的反馈,可视为外生;但过去利差并非随机分配,而是与过去 GDP 增长同时决定;GDP 和构成利差的利率联立决定,\(u_t\) 中决定 GDP 增长的其他因素与过去利差相关 ⇒ 利差不外生,从而也不严格外生,用 ADL 模型(原文印作式 15.20,实指 15.4 节的 ADL 如式 15.15)计算的动态乘数不是利差变化对 GDP 增长动态因果效应的一致估计(但这不妨碍其用于预测)。
16.8 结论(PDF p.639–640)
- 时间序列数据使估计 \(X\) 变化对 \(Y\) 影响的时间路径(动态因果效应)成为可能。用分布滞后回归估计,\(X\) 必须外生(如同理想随机实验中随机设定);若严格外生,可用 ADL 或 GLS。
- 橙汁例中 FDD 外生的理由令人信服,可用分布滞后 OLS;但经济理论表明天气不严格外生,ADL 与 GLS 不合适。许多计量经济学家关心的关系存在联立因果,回归元无论严格与否都不外生。判断外生性(或严格外生性)最终需要结合经济理论、制度知识与审慎判断。
本章小结(原书 5 条):(1) 时间序列动态因果效应在“同一受试者在不同时间接受不同随机处理”的随机实验框架下定义;当 \(X\) 的时间路径随机决定且独立于影响 \(Y\) 的其他因素时,\(Y\) 对 \(X\) 及其滞后的分布滞后回归系数可解释为动态因果效应;(2) \(X\)(过去与现在)外生:误差条件均值不依赖 \(X\) 的当前与过去值;若也不依赖未来值则严格外生;(3) \(X\) 外生时分布滞后 OLS 一致估计动态因果效应;误差一般序列相关,常规标准误误导,须用 HAC;(4) \(X\) 严格外生时可用 ADL 的 OLS 或 GLS 估计动态乘数;(5) 外生性是强假设,经济时间序列中常因联立因果而不成立,严格外生更强。
关键术语:dynamic causal effect、distributed lag model、exogeneity、strict exogeneity、dynamic multiplier、impact effect、cumulative dynamic multiplier、long-run cumulative dynamic multiplier、HAC standard error、truncation parameter、Newey–West variance estimator、quasi-difference、generalized least squares (GLS)、infeasible/feasible GLS estimator。
第 16 章习题概览(PDF p.641–647)
- 复习题:16.1 1970 年代常用名义 GDP 变化对货币供应变化的分布滞后回归,何种假设下能估计货币的因果效应,现代美国经济中是否成立(货币政策内生,不成立);16.2 \(X\) 严格外生,ADL(1,1) 残差高度序列相关,应加滞后还是用 HAC(应加滞后使误差无序列相关);16.3 因变量为 \(\Delta Y_t\) 时如何得到对 \(Y_t\) 的动态乘数(累加);16.4 在 (16.2) 中加入 FDD\(_{t+1}\):严格外生时系数应为 0,只外生时可能非零(可作为严格外生性检验)。
- 习题:
- 16.1 Hamilton 的“油价净上涨”变量 \(O_t\) = max(0, 油价相对过去三年最高值的百分点差),季度 GDP 增长 \(Y_t=100\ln(GDP_t/GDP_{t-1})\) 的分布滞后回归(1960:Q1–2017:Q4):\(\hat Y_t=1.0-0.006O_t-0.014O_{t-1}-0.020O_{t-2}-0.024O_{t-3}-0.036O_{t-4}-0.013O_{t-5}+0.005O_{t-6}-0.007O_{t-7}+0.005O_{t-8}\)(SE 依次 0.1、0.013、0.011、0.010、0.009、0.012、0.007、0.010、0.008、0.008)。油价跳升 25% 时未来两年各季增长效应、95% CI、八季度累积效应、HAC F=5.45 是否显著。
- 16.2 3 个月国库券利率变化 \(\Delta R_t\) 对 \(O_t\) 的分布滞后(系数 0.013、0.013、−0.004、−0.024、−0.000、0.006、−0.005、−0.018、−0.004),求各季利率变化、CI、\(t+8\) 期利率水平效应(即累积乘数),HAC F=1.92 是否显著。
- 16.3 实验 A(油价随机、央行按常规规则反应)vs 实验 B(油价随机、央行保持利率不变):16.1 估计的动态因果效应对应 A(包含政策反应的总效应)。
- 16.4 若油价严格外生,如何改进 16.1 的估计(ADL/GLS)。
- 16.5 由 (16.4) 推导 (16.7),提示 \(X_t=\Delta X_t+\Delta X_{t-1}+\cdots+\Delta X_{t-p+1}+X_{t-p}\)。
- 16.6 \(u_t\)、\(X_t\) 均为平稳 AR(1)(参数 \(\phi_1\)、\(\gamma_1\))且相互独立:求方差、自协方差 \(\phi_1^j\text{var}(u_t)\)、自相关;证明 \(\sigma_v^2=\sigma_X^2\sigma_u^2\),推导 \(f_\infty=1+2\sum_j(\phi_1\gamma_1)^j=(1+\phi_1\gamma_1)/(1-\phi_1\gamma_1)\)。
- 16.7 \(X_t\) 独立于所有 \(\tilde u_j\):外生且严格外生;\(X_t=\tilde u_{t+1}\):外生但不严格外生。
- 16.8 接上 \(X_t=\tilde u_{t+1}\):OLS 一致,GLS 不一致,不可行 GLS \(\xrightarrow{p}\beta_1-\phi_1/(1+\phi_1^2)\)(对准差分回归用遗漏变量偏误公式)。
- 16.9 只含常数的回归、AR(1) 误差:OLS 为样本均值,不可行 GLS \(\hat\beta_0^{GLS}=(1-\phi_1)^{-1}(T-1)^{-1}\sum_{t=2}^T(Y_t-\phi_1Y_{t-1})\),可改写为中间项均值加端点修正,两者差在 \(T\) 大时很小。
- 16.10 严格外生 ADL \(Y_t=5.3+0.2Y_{t-1}+1.5X_t-0.1X_{t-1}+\tilde u_t\):冲击效应 1.5;动态乘数 1.5、0.2、0.04、0.008……(\(\beta_{h+1}=0.2^{h-1}\times0.2\) 递推:\(1.5\),\(0.2\times1.5-0.1=0.2\),\(0.04\),\(0.008\),\(0.0016\));累积乘数;长期累积乘数 \((1.5-0.1)/(1-0.2)=1.75\)。
- 16.11 \(a(L)=1-\phi L\) 的逆为 \(1+\phi L+\phi^2L^2+\cdots\),需 \(|\phi|<1\) 才收敛。
- 16.12 \(Y_t=\beta_0+u_t\)、AR(1) 误差:样本均值的长期方差 \(\text{var}[\sqrt T(\bar Y-\mu_Y)]\to\sigma_{\tilde u}^2/(1-\phi_1)^2\);\(T=200\)、\(\sigma^2=7.9\)、\(\phi_1=0.3\)、\(\bar Y=2.8\) 时构造 \(\mu_Y\) 的 95% CI;未来 \(h\) 期平均的预测区间 \(\bar Y_{1:T}\pm1.96\sqrt{(1/T+1/h)\sigma^2/(1-\phi_1)^2}\)(\(h=100\))。
- 实证习题:E16.1 月度工业生产增长对 \(O_t\) 及 18 阶滞后的分布滞后回归,选择 HAC 截断参数,联合显著性,绘制类似图 16.2 的动态与累积乘数,讨论若美国需求推高油价则 \(O_t\) 不外生、乘数不可靠。E16.2 CPI 与 PCE 通胀之差 \(Y_t\) 的均值(CPI 替代偏误):常数项回归、HAC 标准误下 95% CI、\(m\) 的选择、单侧检验、QLR 检验 \(\beta_0\) 稳定性。E16.3 实际 GDP 增长均值的 95% CI 与 2018:Q1–2067:Q4 平均增长的 95% 预测区间:分别基于 AR(1) 长期方差公式与 Newey–West(4 阶)常数项回归,比较两者。
附录 16.1 橙汁数据集(PDF p.647)
橙汁价格为劳工统计局 PPI 中加工食品与饲料组的冷冻橙汁分项(BLS 序列 wpu02420301),除以成品总 PPI 以剔除一般通胀。FDD 由美国国家海洋和大气管理局(NOAA)奥兰多地区机场日最低温构造。为与价格数据时点对齐(价格在每月中旬调查生产者),FDD 定义为上月 11 日至本月 10 日的冰冻度日数(\(\max(0,32-\text{日最低温})\) 求和)。因此 2 月的 %ChgP 是 1 月中至 2 月中的实际价格变化,2 月的 FDD 是 1 月 11 日至 2 月 10 日的冰冻度日数。
附录 16.2 滞后算子记法下的 ADL 模型与 GLS(PDF p.648–649)
- 分布滞后模型:\(Y_t=\beta_0+\beta(L)X_t+u_t\),\(\beta(L)=\sum_{j=0}^r\beta_{j+1}L^j\) (16.30)。误差 AR(p):\(\phi(L)u_t=\tilde u_t\),\(\phi(L)=\sum_{j=0}^p\phi_jL^j\),\(\phi_0=1\) (16.31)(注意 \(p=1\) 时此处 \(\phi_1\) 与 (16.19) 的 \(\phi_1\) 符号相反)。
- 两边左乘 \(\phi(L)\) 得 ADL:\(\phi(L)Y_t=\alpha_0+\delta(L)X_t+\tilde u_t\) (16.32),其中 \(\alpha_0=\phi(1)\beta_0\)、\(\delta(L)=\phi(L)\beta(L)\)、\(\phi(1)=\sum_j\phi_j\) (16.33);这是含当期 \(X\) 的 ADL(p,q)。
- 准差分模型:\(\tilde Y_t=\alpha_0+\beta(L)\tilde X_t+\tilde u_t\),\(\tilde X_t=\phi(L)X_t\)、\(\tilde Y_t=\phi(L)Y_t\) (16.34)。
- 滞后多项式的逆:多项式 \(a(x)=\sum_{j=0}^pa_jx^j\) 的逆 \(b(x)\) 满足 \(b(x)a(x)=1\);若 \(a(x)\) 的根绝对值都大于 1,\(b(x)=\sum_{j=0}^\infty b_jx^j\),记为 \(a(x)^{-1}\) 或 \(1/a(x)\)。滞后多项式同理,如 \(|\phi|<1\) 时 \((1-\phi L)^{-1}=\sum_{j=0}^\infty\phi^jL^j\)(习题 16.11)。
- OLS 与 GLS 估计量:OLS 估计 (16.32) 得 \(\hat\delta(L)\)、\(\hat\phi(L)\),动态乘数估计 \(\hat\beta^{ADL}(L)=\hat\phi(L)^{-1}\hat\delta(L)\) (16.35),(16.29) 是 \(p=1\)、\(q=2\) 的特例。可行 GLS:初步估计 \(\phi(L)\) → 计算估计准差分 → 估计 (16.34) 的 \(\beta(L)\) → 可迭代至收敛;迭代可行 GLS 等价于在 (16.33) 非线性约束下对 ADL (16.32) 的非线性最小二乘估计。
- 估计条件:(16.34) 的零条件均值 \(E(\tilde u_t\mid\tilde X_t,\tilde X_{t-1},\dots)=0\) (16.36) 等价于
\[E(u_t\mid X_t,X_{t-1},\dots)+\phi_1E(u_{t-1}\mid X_t,X_{t-1},\dots)+\cdots+\phi_pE(u_{t-p}\mid X_t,X_{t-1},\dots)=0 \tag{16.37}\]对一般 \(\phi\) 成立须各项为 0,即\[E(u_t\mid X_{t+p},X_{t+p-1},X_{t+p-2},\dots)=0 \tag{16.38}\]不由(过去与现在)外生蕴含,但由严格外生蕴含;\(p\to\infty\)(误差服从无穷阶自回归)时 (16.38) 就成为 KC 16.1 的严格外生条件。
第 16 章本章要点
- 动态因果效应 = 同一受试者在不同时点接受随机处理的效应时间路径;分布滞后模型系数序列即动态乘数,累积和为累积乘数,总和为长期累积乘数;(16.7) 的变形回归可直接得到累积乘数及其标准误。
- 两类外生性:(过去与现在)外生 \(E(u_t\mid X_t,X_{t-1},\dots)=0\);严格外生还要求对未来 \(X\) 条件均值为 0。若 \(Y\) 反馈影响未来 \(X\),或误差中包含对未来 \(X\) 的预期(如交易者预测天气),则不严格外生。
- 外生时:分布滞后 OLS 一致,但误差一般序列相关,必须用 HAC(Newey–West)标准误;方差修正因子 \(f_T=1+2\sum(1-j/T)\rho_j\);截断参数基准 \(m=0.75T^{1/3}\),并做敏感性检查。
- 严格外生时:ADL(OLS,误差无序列相关,常规标准误)或 GLS(Cochrane–Orcutt 及其迭代,大样本 BLUE)更有效;仅外生时二者不一致。
- 橙汁例:一个冰冻度日当月价格涨 0.5%,约 7 个月累积见顶约 0.9%,18 个月后累积 0.37% 且不显著;对 HAC 截断参数和季节哑变量稳健;QLR 拒绝稳定,效应随橙园南迁变小、变短。
- 宏观中的油价、利率、期限利差多为内生,分布滞后回归系数不能解释为因果;外生性判断依赖情境(美国收入对澳大利亚出口外生,对欧盟出口则不然)。
第 16 章与量化交易的关联
- 事件冲击的动态响应:分布滞后模型与累积动态乘数是衡量冲击(天气、库存报告、宏观数据意外、盈利意外、指数调整、资金流)对资产价格逐期与累积影响的标准工具,等价于事件研究中的“平均/累积异常收益”路径。橙汁–天气例本身就是商品期货交易的经典案例:冲击当月反应最大、之后缓慢累积,提示价格对信息的吸收并非一步到位,可据此研究反应不足/漂移。
- HAC(Newey–West)标准误:在量化研究中几乎必备——用重叠收益(如月频数据预测未来 12 个月收益)、因子收益时间序列均值检验、Fama–MacBeth 第二步、预测回归的系数推断时,残差序列相关会使常规 t 值严重高估显著性。\(f_T\) 公式清楚地说明了重叠窗口下的方差放大;截断参数选择与敏感性检验应写入研究规范。习题 16.12/E16.3 的“均值的长期方差”正对应策略平均收益或 Sharpe 比率的置信区间计算。
- 外生性与前视偏差:严格外生的讨论(价格包含交易者对未来天气的预测)对应金融中“价格领先基本面”的现象——Roll (1984) 发现期货价格能预测天气乃至官方预报的误差。启示:(1) 用价格解释基本面时要警惕反向因果;(2) GLS/ADL 等依赖严格外生的方法在金融数据上常不适用,HAC + OLS 更稳健;(3) 预测关系(价格预测天气)不等于因果关系。
- 过度波动:Roll 发现大部分日度期货价格变动无法由天气基本面解释,与 Shiller 的过度波动研究相呼应,是行为金融与噪声交易研究的起点。
- 结构变化:橙园南迁导致动态乘数随时间改变,提示历史估计的冲击响应在市场结构变化后可能失效;QLR 检验与分段估计是检测因子/信号衰减的实用方法。
- 宏观冲击与内生性:利率、油价对资产价格的效应估计面临政策内生性(央行根据经济状况调整利率),直接回归得到的不是因果效应;需要识别外生冲击(如利率期货隐含的意外部分、高频识别)——这为宏观因子研究提供了方法论警示。
第 16 章推荐习题
- 16.5:证明累积乘数变形回归 (16.7),实践中直接得到累积效应及其 HAC 标准误。
- 16.6:AR(1) 回归元与误差下 \(f_\infty=(1+\phi_1\gamma_1)/(1-\phi_1\gamma_1)\)——直观理解 HAC 修正幅度(两者都高度持续时修正很大,如持续性预测变量回归)。
- 16.7、16.8:外生 vs 严格外生的构造性例子,以及仅外生时 GLS 不一致的具体偏差。
- 16.10、16.11:由 ADL 系数计算动态乘数与长期乘数、滞后多项式求逆。
- 16.12 与 E16.3:序列相关数据下均值的置信区间与长期平均的预测区间——可直接用于策略收益均值/长期收益预测区间。
- 16.1–16.3:油价冲击对 GDP 与利率的动态乘数、实验 A/B 的因果含义(总效应包含政策反应)。
- 复习题 16.4:用未来 FDD 系数检验严格外生性的思路。