精读笔记:James H. Stock & Mark W. Watson《Introduction to Econometrics》(4th ed., Global Edition) —— 负责 PDF 第 1–178 页(前言及第 1–4 章)
页码换算:正文中原书页码 = PDF 页码 − 1(例如原书第 43 页第 1 章开篇 = PDF p.44;第 4 章原书 p.143 = PDF p.144;第 5 章原书 p.178 = PDF p.179,不在本块范围内)。下文所有 “PDF p.” 均指 PDF 页码。
前置部分(PDF p.1–43)
封面、宣传页、丛书目录、版权页(PDF p.1–5)
- p.1 封面:第 4 版 Global Edition。p.2 为 MyLab Economics 在线学习平台广告(动态学习模块、eText、成绩册)。p.3 为 Pearson 经济学丛书书目。p.4 扉页(Stock 在 Harvard,Watson 在 Princeton)。p.5 版权页:© Pearson Education Limited 2020,ISBN 978-1-292-26445-5,改编自美国版 ISBN 978-0-13-446199-1。
简要目录与详细目录(PDF p.6–21)
全书分五部分 19 章:
- Part One 导论与复习:第 1 章 经济问题与数据;第 2 章 概率复习;第 3 章 统计复习。
- Part Two 回归分析基础:第 4 章 单一回归变量的线性回归;第 5 章 单变量回归的假设检验与置信区间;第 6 章 多元线性回归;第 7 章 多元回归中的假设检验与置信区间;第 8 章 非线性回归函数;第 9 章 基于多元回归的研究评估(内部/外部有效性)。
- Part Three 回归分析进阶专题:第 10 章 面板数据回归;第 11 章 二元因变量回归(LPM、probit、logit);第 12 章 工具变量回归;第 13 章 实验与准实验;第 14 章 多回归变量预测与大数据(ridge、lasso、主成分)。
- Part Four 经济时间序列回归:第 15 章 时间序列回归与预测导论(AR、ADL、信息准则、单位根、结构突变);第 16 章 动态因果效应估计(分布滞后、HAC 标准误、GLS);第 17 章 时间序列进阶(VAR、多步预测、协整、ARCH/GARCH 与已实现波动率、动态因子模型)。
- Part Five 计量经济理论:第 18 章 单回归变量线性回归理论(渐近理论、WLS);第 19 章 多元回归理论(矩阵形式、GLS、IV 与 GMM)。
本块覆盖第 1–4 章,各节在目录中的结构:
- 第 2 章:2.1 随机变量与概率分布;2.2 期望、均值与方差;2.3 两个随机变量;2.4 正态、卡方、t、F 分布;2.5 随机抽样与样本均值的分布;2.6 抽样分布的大样本近似(LLN、CLT);附录 2.1 Key Concept 2.3 的推导;附录 2.2 条件均值是最小均方误差预测。
- 第 3 章:3.1 总体均值的估计;3.2 关于总体均值的假设检验;3.3 总体均值置信区间;3.4 不同总体均值比较;3.5 用实验数据的均值差估计因果效应;3.6 小样本时使用 t 统计量;3.7 散点图、样本协方差与样本相关;附录 3.1 CPS 数据;附录 3.2 \(\bar Y\) 是最小二乘估计量的两个证明;附录 3.3 样本方差一致性的证明。
- 第 4 章:4.1 线性回归模型;4.2 系数估计(OLS);4.3 拟合度与预测精度;4.4 因果推断的最小二乘假设;4.5 OLS 估计量的抽样分布;4.6 结论;附录 4.1 加州考试成绩数据;附录 4.2 OLS 推导;附录 4.3 OLS 抽样分布;附录 4.4 用于预测的最小二乘假设。
Key Concepts 一览与专栏一览(PDF p.22–26)
列出全书 Key Concept 方框(如 2.1 期望、2.3 和的均值方差、2.6 依概率收敛与 LLN、2.7 CLT、3.2 偏误/一致性/有效性、3.3 \(\bar Y\) 是 BLUE、4.3 因果推断的最小二乘假设、4.4 OLS 的大样本分布等)。专栏(General Interest Boxes)中与本块相关的有:英国成年收入按童年社会经济背景的分布(p.72)、瑞士法郎脱钩(p.77)、金融分散化与投资组合(p.84)、Off the Mark!(p.108,1936 年民调抽样失败)、社会阶层还是教育?(p.122)、提高投票率的方法(p.124)、股票的 “Beta”(p.152)。与量化相关的其他专栏:股票共同基金能否跑赢市场(p.341)、你能战胜市场吗(p.564)、商品交易商让迪士尼乐园发抖(p.636)。
前言(PDF p.28–42)
- 定位:本科计量入门教材。核心主张是“应用驱动理论、理论匹配应用”:先用具体实证问题引出工具,再给出与应用相符的少量假设,而非先学一堆不现实假设再“修补问题”。前言开头举的问题之一就是“在价格相对盈利处于历史低位时买入能否赚钱,还是应按股价随机游走理论按兵不动”。
- 第 4 版新增:新的第 14 章“大数据与机器学习”(多预测变量问题、预测变量数接近甚至超过样本量时 OLS 预测差,LASSO 等收缩法样本外误差更低,交叉验证选调参,可分析文本数据;案例为加州学校层面考试成绩预测);第 17 章扩展到高维时间序列,用主成分实现动态因子模型(131 个美国季度宏观变量);在第 4 章引入回归时即并列讲“因果推断”和“预测”两种用途——随机对照实验下 OLS 估计因果效应;观测数据下要因果就需控制变量和/或工具变量制造“as-if 随机化”;预测不需要因果解释,但“训练”数据必须与待预测对象来自同一总体。其他:引入已实现波动率(realized volatility)作为 GARCH 的补充;IV 历史专栏(Philip Wright 1926 年给儿子 Sewall 的信、首个 IV 回归——亚麻籽供给弹性)。
- 三大特点:(1) 真实问题与数据贯穿:班级规模与考试成绩(单/多元回归、函数形式)、酒驾法律与交通死亡(面板)、房贷种族歧视(logit/probit)、香烟需求弹性(IV);鼓励学生重做数据分析、检验结论稳健性。(2) 当代主题:IV(外生性与相关性并重、过度识别检验、弱工具诊断)、项目评估(实验/准实验)、大数据预测、预测(AR、信息准则、结构突变、伪样本外预测)、时间序列因果推断(GLS 何时有效、HAC 标准误)。(3) 理论匹配应用:现代数据样本大、回归变量随机抽样而非固定、数据非正态、误差没有先验理由同方差。因此全书采用:大样本方法(一开始就用大样本正态近似做检验和置信区间,而不是精确 t/F 分布);随机抽样(因变量和自变量都视为随机抽样结果);异方差(默认使用异方差稳健标准误,把同方差当作为 OLS 提供理论动机的特例)。
- 培养“成熟的消费者”:第 9 章专讲内部/外部有效性威胁(遗漏变量、函数形式误设、测量误差、样本选择、联立性);对书中所有持续案例做替代设定检验;强调亲自动手做实证。
- 数学水平:Part I–IV 只需大学前数学;附录给出较复杂推导;Part V 面向数学基础更好的学生,可用于高年级本科或硕士课程。
- 内容概览与先修关系(Table I):Part III–V 各章尽量独立。第 10–17 章只用大样本近似,因此可跳过 3.6 节与 5.6 节(小样本 t 分布);第 15–17 章可不学第 8 章,只要讲清对数变换近似百分比变化。
- 建议课程方案:标准入门(第 1–9 章 → 10、11、12 → 13 → 有时间讲 14);含时间序列与预测的入门(Part I–II → 可选 10.1–10.2、12 → 14 → 15、16 → 可选 17.5、17.6);应用时间序列与预测短课(复习 Part II → 15、16、17 → 14 与 17.6);计量理论导论(Part I–II → 18、19.1–19.5 → 11 与附录 11.2 MLE → 可选 12 与 19.7 GMM、15、16 与 19.6 GLS、14 与附录 19.7)。
- 教辅资源:解答手册、题库(Manfred Keil)、TestGen、PPT、配套网站(数据集、复现文件、EViews 教程)。
- 致谢(p.40–42):列出各版审稿人与数据提供者(加州教育部、马萨诸塞州教育部、Christopher Ruhm 酒驾数据、波士顿联储 HMDA 房贷数据、Jonathan Gruber 香烟数据、Alan Krueger 田纳西 STAR 数据等)。p.43 空白页。
第 1 章 经济问题与数据(Economic Questions and Data)(PDF p.44–55)
开篇:什么是计量经济学(PDF p.44)
对计量经济学(econometrics)有多种说法:检验经济理论的科学;预测经济变量(企业销售、经济增长、股价)的工具集;把数学经济模型拟合到真实数据的过程;用历史数据给政府和企业提出数量化政策建议的科学与艺术。这些都对。广义定义:计量经济学是运用经济理论和统计技术分析经济数据的科学与艺术。应用于金融、劳动、宏观、微观、营销、经济政策以及政治学、社会学等。本章提出四个问题,讨论计量方法如何回答,并概述数据类型。
1.1 本书考察的经济问题(PDF p.44–48)
很多决策依赖对变量之间关系的理解,需要“定量问题的定量答案”。
问题 1:缩小班级规模能否改善小学教育? 缩小班级需要多雇教师、可能还要建教室,决策者需要权衡成本与收益,因此要知道收益的精确数量(大、小、还是零)。常识只能给方向,给不出数量,必须依靠实证证据(empirical evidence)。本书使用 1999 年加州 420 个学区的数据:小班学区的学生标准化考试成绩更好,但这可能反映了其他优势——小班学区居民更富裕,校外学习机会更多。Part II 用多元回归把班级规模的效应与学生经济背景等因素分离。
问题 2:房贷市场是否存在种族歧视? 美国法律禁止贷款机构考虑种族。波士顿联储用 1990 年代初数据发现,黑人申请者被拒比例 28%,白人仅 9%。但两组申请者在种族之外还有许多差异,这一原始差距本身不构成歧视证据;需要比较“其他条件相同”的申请者的被拒概率差异及其大小。第 11 章引入在控制还款能力等特征后量化种族效应的方法。
问题 3:医疗支出能否改善健康结果? 各国医疗支出(总量与人均)差异巨大,健康结果(如出生时预期寿命)差异也大。核心参数是支出对死亡率的弹性(spending elasticity for mortality):医疗支出增加 1% 时可避免死亡率变化的百分比,类比需求价格弹性。若目标是把可避免死亡率降低 20%,需要知道该弹性才能算出所需支出增幅。例:联合国开发计划署可持续发展目标要求 5 岁以下死亡率降到每千例活产不高于 25。经济理论(健康生产函数)不能给出参数数值,需要跨国或国内跨期数据。两大挑战:可观测异质性(observable heterogeneity,如人均收入既影响死亡率又与医疗支出相关,可用多元回归控制);不可观测异质性(unobservable heterogeneity),会导致双向因果——医疗降低死亡率,但医疗支出也可能是对推高死亡率的未观测因素(如小型自然灾害)的反应。处理这种“联立因果”(simultaneous causality)的方法见第 12 章(以香烟需求价格弹性为例)。
问题 4:美国 GDP 明年增长多少? 人们总想预知未来:企业明年销售、股市下月涨跌、城市税收能否覆盖支出等。宏观经济学家关心实际 GDP 增长:咨询公司据此建议客户扩产;美联储若预测增长乏力可能降息。预测者用经济理论和统计技术量化历史数据中的关系来预测未来。本书预测 GDP 增长使用过去 GDP 值和期限利差(term spread,长期利率减短期利率):它反映投资者对未来短期利率的预期,通常为正,但在衰退前往往急剧下降。第 15 章构建并评估基于期限利差的预测。
定量问题,定量答案:四个问题都需要数值答案。理论给方向(如香烟价格上升消费应下降),数值必须从数据中得到。由于换一组数据会得到不同数值,答案总有不确定性,因此分析框架既要给出数值答案,也要给出精度度量。本书框架是多元回归模型(multiple regression model):在“保持其他因素不变”(holding constant / controlling for)的条件下量化一个变量变化对另一变量的影响,并量化不确定性。
1.2 因果效应与理想化实验(PDF p.48–50)
日常语义中,若结果是某行动的直接后果,则称该行动“导致”结果(摸热炉子被烫、给番茄施肥增产)。因果性指特定行动导致特定、可测量的后果。
因果效应的估计:测量每平方米施 100 克肥料对番茄产量(公斤)的因果效应,可以做实验:种很多块地,除是否施肥外完全相同照料;是否施肥由计算机随机决定,保证其他差异与施肥无关;季末比较处理组与未处理组单位面积平均产量之差。这就是随机对照实验(randomized controlled experiment):“对照”指既有不接受处理的对照组(control group),又有接受处理的处理组(treatment group);“随机”指处理随机分配,消除了诸如日照与施肥之间的系统关系,使两组之间唯一的系统差异是处理本身。
本书对因果效应的定义:给定行动或处理对结果的效应,以理想随机对照实验中测得的效应为准;在这种实验中,处理组与对照组结果差异的唯一系统原因是处理本身。前三个问题都可以设想理想实验(如随机分配不同班级规模)。现实中实验常常不可行(不道德、无法令人满意地执行、太耗时或太贵),但理想实验的概念仍然重要,因为它给出了因果效应的定义。
预测、预报与因果:第四个问题(预测 GDP 增长)不涉及因果。预测(prediction)指用一些变量的信息对另一个变量的值作出陈述;预报(forecast)是对未来值的预测,是预测的特例。好的预测不需要因果关系:看行人是否打伞可以很好地“预测”是否在下雨,但打伞不会导致下雨。预测变量少且数据不随时间演化时,Part II 的多元回归可给出可靠预测;候选预测变量很多时可改进(第 14 章)。预报使用随时间演化的数据,带来新挑战:第 15 章用多元回归量化历史关系、检验关系是否随时间稳定、做定量预测并评估预测精度。
1.3 数据:来源与类型(PDF p.50–54)
实验数据与观测数据:实验数据(experimental data)来自为评估处理/政策或研究因果效应而设计的实验,如 1980 年代田纳西州资助的大规模班级规模随机实验(第 13 章):数千名学生被随机分配到不同规模班级数年,每年参加标准化考试。该实验花费数百万美元并需长期多方配合;涉及人的现实实验难以管理控制,相对理想实验有缺陷;有时不道德(随机给青少年便宜香烟看他们买多少?)。因此经济学实验相对少见。观测数据(observational data)来自对实验之外实际行为的观察,通过调查(如电话消费者调查)和行政记录(如贷款机构的房贷申请记录)收集。观测数据中“处理”水平不是随机分配的,难以把处理效应与其他因素分开;计量经济学和本书的大部分内容就是应对这一挑战。
数据有三种主要类型:
横截面数据(cross-sectional data):多个实体(工人、消费者、企业、政府单位)在单一时期的数据。实体数记为 \(n\)。例:1999 年加州 420 个学区(\(n=420\))。Table 1.1 摘录:学区 1 平均成绩 690.8(全体五年级学生在斯坦福成就测验中数学与科学的平均分),师生比 17.89(学生数除以课堂教师数),生均支出 6385 美元,英语学习者占比 0%;学区 2:661.2、21.52、5099、4.6%;学区 420:655.8、19.04、5993、5.0%。行的顺序任意,学区编号称为观测编号(observation number)。横截面数据通过研究同一时期不同实体之间的差异来了解变量关系。
时间序列数据(time series data):单一实体在多个时期的数据。例:美国 GDP 增长率与期限利差季度数据,1960:Q1–2017:Q4,观测数(时期数)记为 \(T\),\(T=232\)。Table 1.2 摘录:1960:Q1 GDP 年化增长 8.8%(若按该季度速度持续增长四个季度,GDP 将增长 8.8%),期限利差 0.6 个百分点(长期利率 4.5% − 短期利率 3.9%);1960:Q2 −1.5%、1.3;1960:Q4 −4.9%、1.6;2017:Q4 2.5%、1.2。时间序列数据用于研究变量随时间的演化并预测未来值。
面板数据(panel data,亦称纵向数据 longitudinal data):多个实体、每个实体在两个或更多时期被观测。实体数 \(n\),时期数 \(T\)。例:美国本土 48 州 1985–1995 年香烟消费(\(n=48\),\(T=11\),共 \(n\times T=528\) 个观测)。Table 1.3 摘录:1985 年阿拉巴马人均销量 116.5 包、含税均价 1.022 美元、总税 0.333 美元;阿肯色 128.5 包、1.015 美元、其中 37 美分为联邦/州/地方税;怀俄明 1995 年 112.2 包、1.585 美元、0.360 美元。数据按年分块、块内按州字母排序。面板数据既可利用众多实体的经验,又可利用每个实体变量随时间的演化。
Key Concept 1.1:横截面数据 = 多个实体、单一时期;时间序列数据 = 单一实体、多个时期;面板数据 = 多个实体、每个实体两个以上时期。
第 1 章小结、关键术语与习题(PDF p.54–55)
小结:(1) 很多商业与经济决策需要一个变量变化对另一变量影响的定量估计;(2) 概念上估计因果效应的方法是理想随机对照实验,但在经济应用中常不道德、不现实或太贵;(3) 计量提供用观测数据或不完美实验数据估计因果效应的工具;(4) 计量也提供用相关变量信息预测目标变量的工具;(5) 三种数据类型定义。 关键术语:随机对照实验、对照组、处理组、因果效应、预测、预报、实验数据、观测数据、横截面数据、观测编号、时间序列数据、面板数据、纵向数据。 复习题(Review the Concepts):1.1 设计理想随机实验研究“六小时阅读”对高中生词汇量提升的效应,并指出实施障碍;1.2 设计理想实验研究饮酒对长期记忆丧失的效应及实施障碍(伦理问题);1.3 研究员工培训时长(每工人每周小时)对生产率(每工人每小时产出)的因果效应,分别描述理想随机实验、观测横截面数据、观测时间序列数据、观测面板数据。
本章要点
- 计量经济学的两大用途:因果推断(多元回归“保持其他条件不变”)与预测/预报(不需要因果解释)。
- 因果效应以“理想随机对照实验”定义;随机分配使处理与其他因素无系统关系。
- 观测数据中处理非随机分配,存在可观测与不可观测异质性、双向因果等问题,是计量方法要解决的核心难题。
- 数据三类型:横截面(\(n\))、时间序列(\(T\))、面板(\(n\times T\))。
- 答案必须同时附带精度(不确定性)度量。
与量化交易的关联
- “因果 vs 预测”的区分直接对应量化研究中的两类问题:alpha 因子研究本质上是预测问题,不要求因子“导致”收益,但要求训练样本与将来应用的样本来自同一总体(即关系稳定、无结构突变)——这正是回测失效、风格漂移的根源;事件研究、政策冲击、市场微观结构中的冲击成本估计(如交易对价格的影响)则更接近因果问题。
- 打伞预测下雨的例子提醒:相关性可以用来预测,但若试图“干预”(例如基于因子构建会影响市场本身的大规模交易),非因果的相关关系可能失效。
- 数据类型:单只股票价格序列是时间序列;某一天所有股票的截面因子暴露是横截面;多股票多期的因子/收益数据是面板数据(Fama-MacBeth 截面回归、面板回归的基础)。
- 期限利差预测衰退是经典宏观择时信号,可用于资产配置层面的宏观因子。
推荐习题
- 1.3(四问):练习将同一因果问题映射到实验、横截面、时间序列、面板四种数据设计,可类比为“某因子对收益的影响”如何用不同数据结构研究。
- 1.1/1.2:理解随机实验的实施障碍(伦理、成本、依从性),对应金融中几乎无法做随机实验、只能依赖观测数据与自然实验。
第 2 章 概率复习(Review of Probability)(PDF p.56–103)
开篇(PDF p.56)
本章复习理解回归分析所需的概率论核心思想。2.1 单个随机变量的概率分布;2.2 期望、均值与方差;2.3 两个随机变量;2.4 正态、卡方、(Student t)、F 分布;2.5–2.6 聚焦计量中极其重要的随机性来源——从总体中随机抽样。例:随机调查 10 名应届毕业生并计算平均收入;因为样本随机,换一批人会得到不同平均值,所以样本均值本身是随机变量,其概率分布称为抽样分布(sampling distribution)。一般而言抽样分布复杂,但样本量足够大时近似正态,即中心极限定理(2.6 节)。
2.1 随机变量与概率分布(PDF p.57–60)
结果与概率:随机过程中互斥的潜在结果称为结果(outcomes),不必等可能。结果的概率是长期中该结果出现的比例(频率解释)。例:写学期论文时无线网络不掉线的概率为 80%,则写很多篇论文时有 80% 不掉线。
样本空间与事件:所有可能结果的集合是样本空间(sample space);事件(event)是样本空间的子集。“最多掉线一次”是由“0 次”“1 次”两个结果组成的事件。
随机变量(random variable):随机结果的数值概括。离散随机变量只取离散值(0, 1, 2, …),连续随机变量取连续区间内的值。
离散随机变量的概率分布:列出所有可能取值及其概率,概率之和为 1。例:\(M\) = 写论文期间无线掉线次数(Table 2.1):
| 结果 \(m\) | 0 | 1 | 2 | 3 | 4 |
|---|---|---|---|---|---|
| \(\Pr(M=m)\) | 0.80 | 0.10 | 0.06 | 0.03 | 0.01 |
| 累积 \(\Pr(M\le m)\) | 0.80 | 0.90 | 0.96 | 0.99 | 1.00 |
事件概率等于其组成结果概率之和:\(\Pr(M=1\text{ 或 }M=2)=0.10+0.06=0.16\)。
累积概率分布(cumulative probability distribution,c.d.f.,累积分布函数):随机变量小于等于某值的概率,如 \(\Pr(M\le 1)=0.90\)。
伯努利分布(Bernoulli distribution):二元(0/1)随机变量称伯努利随机变量(纪念 17 世纪瑞士数学家 Jacob Bernoulli)。例:\(G\) = 你遇到的下一个陌生人的性别,\(G=1\) 表示女性:
连续随机变量的分布:c.d.f. 定义同离散情形。例:学生开车上学的通勤时间(受天气、交通影响)。Figure 2.2a:\(\Pr(\text{通勤}\le 15\text{ 分钟})=0.20\),\(\Pr(\le 20)=0.78\)。由于连续变量可取无穷多值,不能逐点列概率,改用概率密度函数(probability density function,p.d.f.,密度):两点之间 p.d.f. 曲线下面积等于随机变量落在两点间的概率。Figure 2.2b:\(\Pr(15<\text{通勤}\le 20)=0.78-0.20=0.58\),\(\Pr(>20)=0.22\)。p.d.f. 与 c.d.f. 以不同形式表达同一信息。
2.2 期望、均值与方差(PDF p.61–65)
期望值(expected value)\(E(Y)\):随机变量在大量重复试验中的长期平均值;离散情形是以概率为权的加权平均,也称 \(Y\) 的期望或均值,记 \(\mu_Y\)。
例 1(借款):借给朋友 100 美元、利率 10%,归还则得 110 美元,有 1% 的概率违约得 0。期望还款 \(=110\times0.99+0\times0.01=108.90\) 美元。 例 2:\(E(M)=0\times0.80+1\times0.10+2\times0.06+3\times0.03+4\times0.01=0.35\) (2.2)。实际掉线次数必为整数,0.35 是多篇论文的平均次数。
Key Concept 2.1:\(Y\) 取 \(k\) 个值 \(y_1,\dots,y_k\),概率 \(p_1,\dots,p_k\),
伯努利变量的期望:\(E(G)=0\times(1-p)+1\times p=p\) (2.4)。连续随机变量的期望也是概率加权平均,其严格定义需微积分(附录 18.1:\(E(Y)=\int y f_Y(y)\,dy\))。
方差与标准差:方差度量分布的离散程度(spread),\(\operatorname{var}(Y)=E[(Y-\mu_Y)^2]\)。方差单位是 \(Y\) 单位的平方,不便解释,因此常用标准差(standard deviation)\(\sigma_Y=\sqrt{\operatorname{var}(Y)}\),单位与 \(Y\) 相同。
Key Concept 2.2:
伯努利方差:\(\operatorname{var}(G)=(0-p)^2(1-p)+(1-p)^2p=p(1-p)\) (2.7),\(\sigma_G=\sqrt{p(1-p)}\)。
线性函数的均值与方差:例:所得税税率 20%,再给 2000 美元免税补贴,税后收入 \(Y=2000+0.8X\) (2.8)。则 \(\mu_Y=2000+0.8\mu_X\) (2.9);因为 \(Y-\mu_Y=0.8(X-\mu_X)\),所以 \(E[(Y-\mu_Y)^2]=0.64E[(X-\mu_X)^2]\),\(\operatorname{var}(Y)=0.64\operatorname{var}(X)\),\(\sigma_Y=0.8\sigma_X\) (2.10)。一般地,若 \(Y=a+bX\) (2.11),则
分布形状的其他度量(PDF p.64–66):均值刻画中心、标准差刻画离散度;偏度(skewness)刻画不对称性,峰度(kurtosis)刻画尾部厚度。它们都基于分布的矩(moments)。Figure 2.3 给出四个均值 0、方差 1 的分布:(a) 偏度 0、峰度 3(正态);(b) 偏度 0、峰度 20;(c) 偏度 −0.1、峰度 5;(d) 偏度 0.6、峰度 5。
- 偏度:
\[\text{Skewness}=\frac{E[(Y-\mu_Y)^3]}{\sigma_Y^3}.\tag{2.14}\]对称分布中高于均值某距离与低于均值同距离的可能性相同,正负的 \((Y-\mu_Y)^3\) 在期望上抵消,偏度为 0;不对称则一般非 0。右尾长 → 偏度为正;左尾长 → 偏度为负。除以 \(\sigma_Y^3\) 消去单位,偏度无量纲,改变 \(Y\) 的单位不改变偏度。
- 峰度:
\[\text{Kurtosis}=\frac{E[(Y-\mu_Y)^4]}{\sigma_Y^4}.\tag{2.15}\]衡量尾部质量多少,即 \(Y\) 的方差中有多少来自极端值。极端值称为离群值(outlier);峰度越大,离群值越可能出现。峰度非负。正态分布峰度为 3;峰度大于 3 的分布称尖峰(leptokurtic)或厚尾(heavy-tailed)。峰度同样无量纲。
- 矩:\(E(Y)\) 是一阶矩,\(E(Y^2)\) 是二阶矩,\(E(Y^r)\) 是 \(r\) 阶矩。偏度是一至三阶矩的函数,峰度是一至四阶矩的函数。
标准化随机变量(PDF p.66):减去均值再除以标准差,\((Y-\mu_Y)/\sigma_Y\),称标准化(standardization)。其均值 \(E(Y-\mu_Y)/\sigma_Y=0\),方差 \(\operatorname{var}(Y)/\sigma_Y^2=1\),且无单位。
2.3 两个随机变量(PDF p.66–76)
经济学中有意思的问题大多涉及两个以上变量(大学毕业生是否更可能就业?女性收入分布与男性相比如何?),需要联合、边际、条件分布的概念。
联合分布(joint probability distribution):两个离散随机变量同时取某些值的概率 \(\Pr(X=x,Y=y)\),所有组合概率和为 1。例(Table 2.2):\(Y=1\) 表示通勤短(< 20 分钟),\(Y=0\) 表示长;\(X=0\) 表示下雨,\(X=1\) 表示不下雨。
| 下雨 \(X=0\) | 不下雨 \(X=1\) | 合计 | |
|---|---|---|---|
| 长通勤 \(Y=0\) | 0.15 | 0.07 | 0.22 |
| 短通勤 \(Y=1\) | 0.15 | 0.63 | 0.78 |
| 合计 | 0.30 | 0.70 | 1.00 |
边际分布(marginal probability distribution):就是 \(Y\) 自身的分布,用于与联合分布区分。由联合分布对 \(X\) 的所有取值求和得到:
条件分布(conditional distribution):给定 \(X=x\) 时 \(Y\) 的分布,
例 2(Table 2.3):一半时间在图书馆(新网络,\(A=1\))写论文,一半时间在宿舍(旧网络,\(A=0\))。联合分布:
| M=0 | M=1 | M=2 | M=3 | M=4 | 合计 | |
|---|---|---|---|---|---|---|
| 旧网络 \(A=0\) | 0.35 | 0.065 | 0.05 | 0.025 | 0.01 | 0.50 |
| 新网络 \(A=1\) | 0.45 | 0.035 | 0.01 | 0.005 | 0.00 | 0.50 |
| 合计 | 0.80 | 0.10 | 0.06 | 0.03 | 0.01 | 1.00 |
条件分布:\(\Pr(M\mid A=0)=(0.70, 0.13, 0.10, 0.05, 0.02)\);\(\Pr(M\mid A=1)=(0.90, 0.07, 0.02, 0.01, 0.00)\)。如 \(\Pr(M=0\mid A=0)=0.35/0.50=0.70\);新网络掉线 3 次的概率 1%,旧网络 5%。
条件期望(conditional expectation / conditional mean):用条件分布计算的期望,
迭代期望定律(law of iterated expectations):\(Y\) 的均值是条件期望按 \(X\) 分布加权的平均(如成人平均身高 = 男女平均身高按男女比例加权):
条件方差(conditional variance):
贝叶斯法则(Bayes' rule):
条件均值是最小均方误差预测:设预测误差成本随误差平方增长(小误差无所谓,大误差代价高),预测问题是找函数 \(g(X)\) 最小化均方预测误差 \(E\{[Y-g(X)]^2\}\)。答案是条件均值 \(E(Y\mid X)\):在所有利用信息 \(X\) 的方式中,它的均方预测误差最小(证明见附录 2.2)。
独立性(independence):若知道一个变量的值不提供另一变量的任何信息,则二者独立,即对所有 \(x,y\),
协方差(covariance):衡量两个变量共同变动的程度,
相关系数(correlation):协方差单位是 \(X\) 单位乘 \(Y\) 单位,难以解释。相关系数解决单位问题:
相关与条件均值:若 \(Y\) 的条件均值不依赖于 \(X\),则二者不相关:
随机变量之和的均值与方差:
Key Concept 2.3 随机变量和的均值、方差、协方差(\(a,b,c\) 为常数,推导见附录 2.1):
专栏:英国成年收入按童年社会经济背景的分布(PDF p.73–74):政客常说收入不平等源于个人能力与努力差异,童年环境是否影响成年收入?按英国国家统计社会经济分类(NS-SEC)把父亲职业分为高级、中级、常规三类,Figure 2.4 画出 2009–2010 年(Understanding Society 第一波数据)三组个人家庭月收入的条件分布:父亲职业等级越低,成年家庭收入越集中在低端。Table 2.4:
| 父亲职业 | 均值 | 标准差 | 25% | 中位数 | 75% | 90% |
|---|---|---|---|---|---|---|
| 高级 | £3,149.27 | £2,434.33 | £1,663.33 | £2,626.92 | £3,973.74 | £5,629.00 |
| 中级 | 2,692.01 | 2,187.53 | 1,362.44 | 2,237.56 | 3,382.00 | 4,881.99 |
| 常规 | 2,440.94 | 1,878.58 | 1,291.00 | 2,049.74 | 3,067.76 | 4,339.84 |
即 \(E(\text{收入}\mid\text{常规})\) 比 \(E(\text{收入}\mid\text{高级})\) 低 700 多英镑;差距在分布高端更大(75 分位差 900 多,90 分位差近 1300);标准差也随等级上升。说明童年环境可能有影响,但能否确定是因果?后续章节再议。
2.4 正态、卡方、Student t 与 F 分布(PDF p.76–82)
正态分布(normal distribution):钟形密度(公式见附录 18.1),关于均值 \(\mu\) 对称,95% 的概率落在 \(\mu\pm1.96\sigma\) 之间(Figure 2.5)。记为 \(N(\mu,\sigma^2)\);标准正态为 \(N(0,1)\),常记为 \(Z\),其 c.d.f. 记为 \(\Phi\):\(\Pr(Z\le c)=\Phi(c)\),数值见书末附表 1。
计算一般正态概率需先标准化。例:\(Y\sim N(1,4)\),求 \(\Pr(Y\le2)\)。标准化 \((Y-1)/\sqrt4=\tfrac12(Y-1)\sim N(0,1)\),
Key Concept 2.4 正态概率的计算:\(Y\sim N(\mu,\sigma^2)\),\(Z=(Y-\mu)/\sigma\),\(c_1<c_2\),\(d_1=(c_1-\mu)/\sigma\),\(d_2=(c_2-\mu)/\sigma\),则
专栏:瑞士法郎脱钩(PDF p.78–80):2015 年 1 月 15 日(周四),欧元兑瑞郎从 1.201 跌到 0.991,跌幅 17.472%(Figure 2.7 呈巨大向下尖刺),而此前一年单日变动从未超过 0.544%。若假设日变动正态,用截至 2015 年 1 月 14 日一年的 Datastream 数据估计日百分比变动标准差为 0.112%,则跌幅相当于 \(17.472/0.112=156\) 个标准差,按 (2.39) 算出的概率约 \(8.175\times10^{-5288}\),小到不可思议。错误在于没有深入了解数据和决定汇率的实际过程:瑞士央行设置了汇率“钉住”(peg),过去 12 个月汇率被限制在每欧元 1.2008–1.236 瑞郎之间;正是钉住导致波动极低。三年多前引入钉住时,欧元对瑞郎也曾升值超过 20 个标准差(同样按此前日变动的正态分布计算)。钉住一取消,汇率自由浮动,投资者大幅压低欧元。又如 2016 年英国脱欧公投结果使 2016 年 6 月 24 日欧元兑英镑升值 6.17%,按前一年数据相当于 9.80 个标准差,表观概率 \(5.629\times10^{-23}\),即按每年 260 个交易日算,不到每 \(10^{18}\) 年一次——显然不是真实概率的准确刻画。结论:假设数据正态、或以近期观测预测未来取值范围都很危险;这也是英国金融产品广告必须注明“过去业绩不代表未来表现”的部分原因。
多元正态分布(multivariate normal distribution;两个变量时称二元正态 bivariate normal;p.d.f. 见附录 18.1、19.2)四条重要性质:
- 若 \(X,Y\) 二元正态,协方差 \(\sigma_{XY}\),则
\[aX+bY\sim N(a\mu_X+b\mu_Y,\ a^2\sigma_X^2+b^2\sigma_Y^2+2ab\sigma_{XY}).\tag{2.43}\]更一般地,\(n\) 个多元正态变量的任何线性组合(如求和)都是正态的。
- 多元正态的每个边际分布都是正态(在 (2.43) 中取 \(a=1,b=0\))。
- 多元正态变量协方差为 0 则相互独立。一般情况下只有“独立 ⇒ 协方差 0”,“协方差 0 ⇒ 独立”是多元正态特有的性质。
- 二元正态时 \(E(Y\mid X=x)=a+bx\) 是线性的(习题 18.11)。联合正态 ⇒ 条件期望线性,但反之不成立。
卡方分布(chi-squared distribution):\(m\) 个独立标准正态变量平方和的分布,\(m\) 为自由度(degrees of freedom),记 \(\chi^2_m\)。例:\(Z_1^2+Z_2^2+Z_3^2\sim\chi^2_3\);附表 3 给出百分位数,\(\chi^2_3\) 的 95 分位数为 7.81,即 \(\Pr(Z_1^2+Z_2^2+Z_3^2\le7.81)=0.95\)。用于某些假设检验。
Student t 分布:\(Z\sim N(0,1)\)、\(W\sim\chi^2_m\) 且二者独立,则
F 分布:\(W\sim\chi^2_m\)、\(V\sim\chi^2_n\) 独立,则
2.5 随机抽样与样本均值的分布(PDF p.82–86)
本书几乎所有统计与计量程序都涉及样本的平均或加权平均,因此刻画样本均值的分布是理解计量程序表现的关键一步。随机抽样使样本均值成为随机变量,其分布称为抽样分布。
简单随机抽样(simple random sampling):通勤学生想当统计学家,从学年中随机选若干天记录通勤时间。因为日子是随机选的,某天的通勤时间不提供关于另一天的信息,各天通勤时间相互独立。简单随机抽样指从总体中随机选 \(n\) 个对象,总体中每个成员被选中的可能性相同。样本记为 \(Y_1,\dots,Y_n\)。抽样前它们可以取很多可能值(是随机变量),抽样后每个观测记录一个具体值。
独立同分布(i.i.d.):由于从同一总体随机抽取,每个 \(Y_i\) 的边际分布相同,即总体中 \(Y\) 的分布(同分布 identically distributed);简单随机抽样下知道 \(Y_1\) 不提供关于 \(Y_2\) 的信息,\(Y_1\) 与 \(Y_2,\dots,Y_n\) 独立。合称独立同分布(independently and identically distributed, i.i.d.)。Key Concept 2.5 总结:简单随机抽样中 \(Y_1,\dots,Y_n\) 是 i.i.d. 的。
样本均值(sample average / sample mean):
\(\bar Y\) 的均值与方差:\(Y_i\) i.i.d.,均值 \(\mu_Y\)、方差 \(\sigma_Y^2\)。
\(Y\) 正态时:若 \(Y_i\) i.i.d. 来自 \(N(\mu_Y,\sigma_Y^2)\),由于正态变量之和仍正态,\(\bar Y\sim N(\mu_Y,\sigma_Y^2/n)\)(精确成立)。
专栏:金融分散化与投资组合(PDF p.85):分散化原则:分散持有多个资产可以降低风险(不要把鸡蛋放在一个篮子里)。数学来自 (2.46):把 1 美元平均分给 \(n\) 个资产,\(Y_i\) 为投资第 \(i\) 个资产 1 美元一年后的回报,组合回报为 \(\bar Y=(Y_1+\cdots+Y_n)/n\)。设各资产期望回报均为 \(\mu_Y\)、方差均为 \(\sigma^2\)、两两相关系数均为 \(\rho>0\)(\(\operatorname{cov}(Y_i,Y_j)=\rho\sigma^2\)),则 \(E(\bar Y)=\mu_Y\),且大 \(n\) 时 \(\operatorname{var}(\bar Y)\to\rho\sigma^2\)(习题 2.26;精确式为 \(\operatorname{var}(\bar Y)=\sigma^2/n+\frac{n-1}{n}\rho\sigma^2\))。全部押一个资产和平均分散的期望回报相同,但分散化把方差从 \(\sigma^2\) 降到 \(\rho\sigma^2\)。这催生了股票共同基金等产品。但分散化有极限:资产回报通常正相关,\(n\) 再大方差仍为正——股票组合仍承受整体市场不可预测的波动(系统性风险)。
2.6 抽样分布的大样本近似(PDF p.86–91)
刻画抽样分布有两种途径:精确方法——推导对任意 \(n\) 都精确成立的分布,称精确分布或有限样本分布(exact / finite-sample distribution),如 \(Y\) 正态时 \(\bar Y\) 精确为 \(N(\mu_Y,\sigma_Y^2/n)\);但 \(Y\) 非正态时精确分布一般非常复杂且依赖 \(Y\) 的分布。近似方法——依赖大样本的近似,称渐近分布(asymptotic distribution),在 \(n\to\infty\) 极限下变为精确。即使 \(n=30\) 也可能非常准确;计量实践中样本量通常是数百到数千,渐近分布是对精确分布的很好近似。两个关键工具:大数定律(\(n\) 大时 \(\bar Y\) 以极高概率接近 \(\mu_Y\))和中心极限定理(\(n\) 大时标准化样本均值 \((\bar Y-\mu_Y)/\sigma_{\bar Y}\) 近似正态)。渐近正态分布不依赖 \(Y\) 的分布,极大简化了分析,是全书回归理论的基础。
大数定律与一致性:大数定律(law of large numbers,俗称“平均律”):一般条件下,\(n\) 大时 \(\bar Y\) 以很高概率接近 \(\mu_Y\);大量同均值随机变量平均时大值与小值相互抵消。
例:通勤学生只记录通勤是否短(\(Y_i=1\) 为短)。简单随机抽样下 \(Y_i\) 是 i.i.d. 伯努利变量,\(\Pr(Y_i=1)=0.78\)(Table 2.2),\(\mu_Y=0.78\),\(\bar Y\) 是样本中短通勤天数的比例。Figure 2.8 给出 \(n=2,5,25,100\) 时 \(\bar Y\) 的抽样分布:\(n=2\) 时 \(\bar Y\) 只能取 0、½、1,都不接近 0.78;随 \(n\) 增大,\(\bar Y\) 可取值增多,分布紧紧围绕 \(\mu_Y=0.78\)。
Key Concept 2.6 依概率收敛、一致性与大数定律:若对任意常数 \(c>0\),\(\bar Y\) 落在 \((\mu_Y-c,\mu_Y+c)\) 内的概率随 \(n\) 增大任意接近 1,则称 \(\bar Y\) 依概率收敛(converges in probability)于 \(\mu_Y\),或 \(\bar Y\) 是 \(\mu_Y\) 的一致(consistent)估计,记 \(\bar Y\xrightarrow{p}\mu_Y\)。大数定律:若 \(Y_1,\dots,Y_n\) i.i.d.,\(E(Y_i)=\mu_Y\),且大离群值不太可能出现(技术条件 \(\operatorname{var}(Y_i)=\sigma_Y^2<\infty\)),则 \(\bar Y\xrightarrow{p}\mu_Y\)。
本书用的 LLN 条件:i.i.d.(简单随机抽样保证)+ 方差有限(证明见 18.2 节)。方差有限意味着极大值(离群值)很少出现,否则少数极端值会主导 \(\bar Y\),使样本均值不可靠。该假设对本书应用是合理的,例如通勤时间有上限(交通太堵可以停车步行)。
中心极限定理(central limit theorem, CLT):一般条件下,\(n\) 大时 \(\bar Y\) 的分布可由正态分布很好近似,即近似 \(N(\mu_Y,\sigma_{\bar Y}^2)\),\(\sigma_{\bar Y}^2=\sigma_Y^2/n\)。总体正态时这是精确的;CLT 说即使 \(Y_i\) 本身不正态,大 \(n\) 时也近似成立。Figure 2.8 中分布在大 \(n\) 时太窄难以看出形状,因此标准化为 \((\bar Y-\mu_Y)/\sigma_{\bar Y}\)(相当于把横轴放大 \(\sqrt n\) 倍),Figure 2.9 显示 \(n\) 足够大时标准化分布很接近 \(N(0,1)\)。
“多大才算大?”——取决于 \(Y_i\) 的分布。\(Y_i\) 本身正态则任意 \(n\) 都精确正态;\(Y_i\) 远离正态时可能需要 \(n=30\) 甚至更多。Figure 2.10 用一个右偏(长右尾)总体分布演示:\(n=5\) 时抽样分布仍明显偏斜;\(n=25\) 时接近钟形但仍有明显缺陷;\(n=100\) 时正态近似已很好。事实上 \(n\ge100\) 时,对很多种总体分布,\(\bar Y\) 的正态近似通常都很好。小样本时 Figure 2.9 与 2.10 的分布复杂且彼此不同,大样本时却都简单且形状相似——\(\bar Y\) 具有渐近正态分布(asymptotic normal distribution)。正态近似的便利性加上 CLT 的广泛适用性,是应用计量的关键基础。
Key Concept 2.7 中心极限定理:设 \(Y_1,\dots,Y_n\) i.i.d.,\(E(Y_i)=\mu_Y\),\(\operatorname{var}(Y_i)=\sigma_Y^2\),\(0<\sigma_Y^2<\infty\)。当 \(n\to\infty\) 时,\((\bar Y-\mu_Y)/\sigma_{\bar Y}\)(\(\sigma_{\bar Y}^2=\sigma_Y^2/n\))的分布可被标准正态分布任意好地近似。
常见误区:LLN 讲的是 \(\bar Y\) 本身收敛到常数;CLT 讲的是放大 \(\sqrt n\) 倍后的偏差 \(\sqrt n(\bar Y-\mu_Y)\) 的分布形状趋于正态。两者都需要方差有限;厚尾(无穷方差)数据下样本均值可能极不稳定。
第 2 章小结、关键术语与习题概览(PDF p.92–101)
小结:(1) 随机变量取值的概率由 c.d.f.、概率分布(离散)和 p.d.f.(连续)概括;(2) 期望(均值 \(\mu_Y\))是概率加权平均,方差 \(\sigma_Y^2=E[(Y-\mu_Y)^2]\),标准差为其平方根;(3) 联合分布概括两个变量的联合概率,条件分布是给定 \(X=x\) 时 \(Y\) 的分布;(4) 正态变量概率先标准化再查标准正态表;(5) 简单随机抽样产生 i.i.d. 观测;(6) \(\bar Y\) 是随机变量:i.i.d. 下其抽样分布均值 \(\mu_Y\)、方差 \(\sigma_Y^2/n\);LLN 说 \(\bar Y\xrightarrow{p}\mu_Y\);CLT 说 \(n\) 大时 \((\bar Y-\mu_Y)/\sigma_{\bar Y}\sim N(0,1)\) 近似。
关键术语(略列):结果、概率、样本空间、事件、离散/连续随机变量、c.d.f.、伯努利分布、p.d.f.、期望、方差、标准差、矩、偏度、峰度、离群值、尖峰、\(r\) 阶矩、标准化随机变量、联合/边际/条件分布、条件期望、迭代期望定律、条件方差、贝叶斯法则、独立、协方差、相关、不相关、正态/标准正态/多元正态/二元正态、卡方、t、F 分布、简单随机抽样、总体、同分布、i.i.d.、样本均值、抽样分布、精确(有限样本)分布、渐近分布、大数定律、依概率收敛、一致性、中心极限定理、渐近正态分布。
复习题(Review the Concepts 2.1–2.7):解释性别、掉线次数、通勤时间、是否下雨为何是随机的;独立时为何知道 \(X\) 不提供 \(Y\) 的信息;家乡月降雨量与洛杉矶同月出生人数是否独立;100 名学生平均体重 65 kg,随机抽 5 人的平均是否等于 65 kg(说明 \(\bar Y\) 是随机变量);\(N(2,6)\) 下画 \(n=2,15,200\) 时 \(\bar Y\) 的密度并联系 LLN;Figure 2.10a 的偏态分布下 \(n=8,30,150\) 时能否用正态近似算 \(\Pr(\bar Y\le0.2)\);均值 0、方差 1、偏度 0、峰度 90 的分布草图及为何会出现大离群值。
习题(Exercises 2.1–2.28)题型:
- 离散分布计算:2.1 两枚正面概率 0.4 的硬币,正面数的分布、均值、方差;2.2/2.3 用 Table 2.2 计算均值、方差、协方差、相关及线性变换 \(W=4+8X\)、\(V=11-2Y\) 后的对应量;2.4 伯努利变量 \(E(X^k)=p\),\(p=0.53\) 时的均值、方差、偏度、峰度;2.5 卢加诺 7 月日最高温均值 65°F、标准差 5°F 换算为摄氏度;2.6 南非劳动力中就业状态与大学学历的联合分布(非大学:失业 0.078、就业 0.673;大学:失业 0.042、就业 0.207)——求失业率 \(=1-E(Y)\)、分学历条件失业率、贝叶斯反推、是否独立;2.7 双职工夫妻收入(男均值 5 万、标准差 1.5 万;女均值 4.8 万、标准差 1.3 万;相关 0.90)求合计收入的均值、协方差、标准差并换算货币;2.8 线性变换 \(Z=3(Y-4)\);2.9 \(3\times5\) 联合分布求边际、条件分布、协方差与相关。
- 查表:2.10 正态概率;2.11 卡方与 \(F_{m,\infty}\) 概率(并解释 \(\chi^2_8\) 与 \(F_{8,\infty}\) 答案相同的原因);2.12 t 与 F 概率、正态与 t 临界值何时一致。
- 混合分布:2.13 \(S=XY+(1-X)W\)(\(X\) 伯努利 0.9,\(Y\sim N(0,4)\),\(W\sim N(0,16)\)),用迭代期望推导 \(S\) 的各阶矩、偏度和峰度——这是正态混合产生厚尾的经典构造。
- CLT 应用:2.14、2.15(\(N(20,4)\),\(n=25/100/800\) 下 \(\Pr(19.6\le\bar Y\le20.4)\),论证依概率收敛)、2.16(无正态表时用计算机模拟 i.i.d. 抽样近似 \(\Pr(Y\le5.8)\),即蒙特卡洛思想)、2.17(伯努利 0.6,求所需样本量)、2.18(房屋风暴损失:95% 年份 0、5% 年份 3 万美元;120 户保险池平均损失超过 3000 美元的概率——保险/风险分散)。
- 证明题:2.19(边际概率公式、迭代期望、独立 ⇒ 协方差 0);2.20(三变量迭代期望);2.21(中心矩用原点矩表示:\(E(X-\mu)^3=E(X^3)-3E(X^2)E(X)+2E(X)^3\);\(E(X-\mu)^4=E(X^4)-4E(X)E(X^3)+6E(X)^2E(X^2)-3E(X)^4\));2.23(\(Y=X^2+Z\),\(E(Y\mid X)=X^2\) 但 \(\operatorname{corr}(X,Y)=0\));2.24(正态平方和为卡方、构造 \(t_{n-1}\));2.25(求和符号运算);2.26(等相关变量均值方差 \(\sigma_Y^2/n+[(n-1)/n]\rho\sigma_Y^2\to\rho\sigma_Y^2\));2.27(不用微积分证明条件均值是最小 MSE 预测:令 \(\hat Y=E(Y\mid X)\)、\(u=Y-\hat Y\),证 \(E(u)=0\)、\(E(uX)=0\),再对任意 \(\tilde Y=g(X)\) 证明 \(E[(Y-\tilde Y)^2]>E[(Y-\hat Y)^2]\));2.28(贝叶斯:\(\Pr(M=3)\)、\(\Pr(A=0\mid M=3)\),并改为 \(\Pr(A=0)=0.25\) 重算)。
- 组合题 2.22:1 美元中比例 \(w\) 投股票基金(\(R_s\) 均值 0.06、标准差 0.09),其余投另一基金(\(R_b\) 均值 0.04、标准差 0.05),相关 0.3,\(R=wR_s+(1-w)R_b\);求 \(w=0.2,0.8\) 时的均值与标准差、使均值最大的 \(w\)、使标准差最小的 \(w\)(最小方差组合:\(w^*=\frac{\sigma_b^2-\sigma_{sb}}{\sigma_s^2+\sigma_b^2-2\sigma_{sb}}\))。
- 实证题 E2.1:2015 年 25–34 岁、学历高于高中的全职工人年龄与平均时薪(AHE)的联合分布表,求 Age 边际分布、各年龄条件均值 \(E(AHE\mid Age)\) 并作图、用迭代期望求 \(E(AHE)\)、方差、协方差、相关。
附录 2.1 Key Concept 2.3 的推导(PDF p.101–102)
- (2.30) 由期望定义直接得到。
- (2.31):\(\operatorname{var}(a+bY)=E\{[a+bY-E(a+bY)]^2\}=E\{[b(Y-\mu_Y)]^2\}=b^2\sigma_Y^2\)。
- (2.32):\(\operatorname{var}(aX+bY)=E\{[a(X-\mu_X)+b(Y-\mu_Y)]^2\}=a^2\sigma_X^2+2ab\sigma_{XY}+b^2\sigma_Y^2\) (2.50),展开平方后用方差、协方差定义。
- (2.33):\(E(Y^2)=E\{[(Y-\mu_Y)+\mu_Y]^2\}=\sigma_Y^2+2\mu_YE(Y-\mu_Y)+\mu_Y^2=\sigma_Y^2+\mu_Y^2\)。
- (2.34):\(\operatorname{cov}(a+bX+cV,Y)=E\{[b(X-\mu_X)+c(V-\mu_V)](Y-\mu_Y)\}=b\sigma_{XY}+c\sigma_{VY}\) (2.51)。
- (2.35):\(E(XY)=E\{[(X-\mu_X)+\mu_X][(Y-\mu_Y)+\mu_Y]\}=\sigma_{XY}+\mu_X\mu_Y\)。
- 相关不等式证明:取 \(a=-\sigma_{XY}/\sigma_X^2\)、\(b=1\),由 (2.32)
\[\operatorname{var}(aX+Y)=a^2\sigma_X^2+\sigma_Y^2+2a\sigma_{XY}=\sigma_Y^2-\sigma_{XY}^2/\sigma_X^2\ge0,\tag{2.52}\]故 \(\sigma_{XY}^2\le\sigma_X^2\sigma_Y^2\)(协方差不等式 2.53),即 \(|\operatorname{corr}(X,Y)|\le1\)。思路:\(a\) 恰好是把 \(Y\) 对 \(X\) 做投影后的残差系数,残差方差非负。
附录 2.2 条件均值是最小均方误差预测(PDF p.102–103)
统计预测问题:如何最好地利用 \(X\) 的信息预测 \(Y\)?需定义预测损失(prediction loss)。例:预测销量给生产主管排产,小误差无碍;大误差则产量过低会让客户久等而流失,产量过高会造成昂贵的过剩库存——大误差的代价不成比例地高。因此令损失与误差平方成正比(误差加倍、成本四倍),二次损失:
- 先找常数 \(m\) 最小化 \(E[(Y-m)^2]=\sum_i(Y_i-m)^2p_i\)。求导置零:
\[\frac{d}{dm}\sum_{i=1}^k(Y_i-m)^2p_i=-2\sum_{i=1}^k(Y_i-m)p_i=-2\left(\sum_{i=1}^kY_ip_i-m\right)=0,\tag{2.55}\]得 \(m=\sum Y_ip_i=E(Y)\)。
- 由迭代期望 \(\text{Loss}=E\left(E\{[Y-g(X)]^2\mid X\}\right)\);若 \(g\) 对每个 \(x\) 都最小化 \(E\{[Y-g(X)]^2\mid X=x\}\),就最小化总损失。固定 \(X=x\) 时 \(g(x)\) 是一个数,问题化为第 1 步,最优解是 \(E(Y\mid X=x)\)。对每个 \(x\) 成立,故 \(g(X)=E(Y\mid X)\)。
第 2 章本章要点
- 离散分布、c.d.f.、p.d.f.;期望与方差的定义与计算;线性变换 \(a+bY\) 的均值方差。
- 偏度(三阶标准化矩)、峰度(四阶标准化矩,正态为 3,>3 为厚尾)。
- 联合/边际/条件分布;条件期望、迭代期望定律 \(E(Y)=E[E(Y\mid X)]\);条件方差;贝叶斯法则。
- 条件均值是平方损失下的最优预测——后文回归函数 \(E(Y\mid X)\) 的核心动机。
- 独立 ⇒ 不相关;\(E(Y\mid X)=\mu_Y\) ⇒ 不相关;反之均不成立(多元正态除外:零协方差 ⇒ 独立)。
- 和的方差公式 \(\operatorname{var}(aX+bY)=a^2\sigma_X^2+2ab\sigma_{XY}+b^2\sigma_Y^2\)。
- 正态、卡方、t、F 分布的构造关系;\(t_\infty=N(0,1)\),\(F_{m,\infty}=\chi^2_m/m\)。
- i.i.d. 抽样下 \(\bar Y\) 的均值 \(\mu_Y\)、方差 \(\sigma_Y^2/n\);LLN(一致性)与 CLT(渐近正态),\(n\ge100\) 时正态近似通常很好,需要方差有限。
与量化交易的关联
- 收益分布刻画:偏度、峰度是描述资产收益分布的标准统计量;日收益普遍厚尾(峰度远大于 3)、常见负偏。瑞士法郎脱钩与英国脱欧的专栏是“用正态分布估计尾部风险会严重低估”的教科书案例,直接对应 VaR/ES 建模中正态假设的失败、模型风险以及“低波动不等于低风险”(钉住汇率、卖出期权、做空波动率策略在平静期波动很低,但隐含跳跃风险)。也提醒回测时历史标准差会受制度/政策状态影响(结构突变)。
- 组合与风险模型:\(\operatorname{var}(aX+bY)\) 公式即两资产组合方差公式,是均值-方差优化的基础;分散化专栏给出等权组合方差 \(\sigma^2/n+\frac{n-1}{n}\rho\sigma^2\to\rho\sigma^2\)——系统性风险不可分散,这是因子风险模型把协方差分解为因子部分与特质部分的直觉起点。习题 2.22 的最小方差组合权重是组合优化入门。
- 预测:条件均值是平方损失下的最优预测,说明收益预测模型(因子模型、机器学习)在 MSE 目标下都在估计 \(E(r_{t+1}\mid\mathcal F_t)\);迭代期望定律是推导鞅性质、资产定价中“价格=折现条件期望”的基本工具。
- 不相关 ≠ 独立:收益序列自相关近零但平方收益(波动率)高度相关(波动聚集),正是“不相关但不独立”的典型;习题 2.23 的 \(Y=X^2+Z\) 类比收益与波动的关系。
- 大数定律与 CLT:回测中的平均收益、夏普比率的统计推断依赖 LLN/CLT;但金融数据并非 i.i.d.,且厚尾使收敛变慢,所需样本量远大于教材中的 \(n=30\) 或 \(100\) 经验法则。习题 2.16 的模拟思想即蒙特卡洛定价与风险模拟的基础。
- 贝叶斯法则:用于信号后验概率更新、状态识别(regime)等。
- 多元正态“零协方差 ⇒ 独立”只在联合正态下成立;实际资产收益在危机中尾部相关上升,用相关矩阵描述依赖结构有局限(联系 copula 建模)。
推荐习题
- 2.22(两资产组合均值、标准差与最小方差权重):组合优化基础。
- 2.26(等相关资产等权组合方差极限 \(\rho\sigma^2\)):系统性风险不可分散。
- 2.13(正态混合的偏度与峰度):理解厚尾如何由波动率状态混合产生。
- 2.23(条件均值依赖 \(X\) 但不相关):理解线性相关的局限。
- 2.27 与附录 2.2(条件均值是最小 MSE 预测):预测模型的理论基础。
- 2.18(保险池)与 2.14/2.17(CLT 计算):大数定律与风险分散的数量感。
- 2.28(贝叶斯法则)。
第 3 章 统计复习(Review of Statistics)(PDF p.104–143)
开篇(PDF p.104–105)
统计学是用数据了解世界的科学,帮助回答总体分布未知特征的问题(如应届大学毕业生收入分布的均值?男女均值是否不同、差多少?)。全面调查(普查 census)极其昂贵,通常周期性进行(印度、美国、英国每十年一次)。历史插叙:公元前 4000 年巴比伦已有普查记录;古罗马要求人们每年回出生地登记;1086 年征服者威廉编纂《末日审判书》(Domesday Book);英国现代普查始于 1801 年,受马尔萨斯 1798 年论文启发;2011 年英国普查耗资约 4.82 亿英镑;印度普查约公元前 300 年已有记载,现代形式始于 1872 年、1881 年起每十年一次,2011 年印度普查约 2200 crore 卢比(约 3.2 亿美元)。即使如此仍有人漏登,需要更实际的方法。
统计学的关键洞见:从总体中随机抽样即可了解总体分布。例如不必调查 14 亿中国人(2018),随机抽 1000 人即可作出关于总体的初步结论——统计推断(statistical inference)。计量经济学使用三类统计方法:估计(estimation,用样本对未知总体特征给出“最佳猜测”数值)、假设检验(hypothesis testing,提出关于总体的具体假设并用样本证据判断真伪)、置信区间(confidence intervals,用数据估计未知总体特征的区间)。3.1–3.3 在总体均值背景下复习三者;3.4 扩展到比较两个总体均值;3.5 用均值比较估计实验中的因果效应;3.2–3.5 都基于大样本正态近似;3.6 讨论可用 Student t 的特殊情形;3.7 讲样本相关与散点图。
3.1 总体均值的估计(PDF p.105–110)
设要估计总体均值 \(\mu_Y\)(如近期女性大学毕业生的平均收入),自然方法是用 \(n\) 个 i.i.d. 观测(简单随机抽样所得)的样本均值 \(\bar Y\)。
估计量与估计值(Key Concept 3.1):估计量(estimator)是将从总体中随机抽取的样本数据的函数;估计值(estimate)是用特定样本实际算出的数值。估计量因抽样随机而是随机变量,估计值是非随机数。\(\bar Y\) 与 \(Y_1\)(只用第一个观测)都是 \(\mu_Y\) 的估计量,都有抽样分布。
好估计量的标准:希望抽样分布尽可能紧密地集中在未知真值附近,由此得到三个性质:
Key Concept 3.2 偏误、一致性与有效性(记号 \(\hat\mu_Y\) 表示 \(\mu_Y\) 的估计量,“帽子”记号全书通用):
- \(\hat\mu_Y\) 的偏误(bias)为 \(E(\hat\mu_Y)-\mu_Y\);
- 若 \(E(\hat\mu_Y)=\mu_Y\),则 \(\hat\mu_Y\) 是无偏(unbiased)估计量,否则有偏;
- 若 \(\hat\mu_Y\xrightarrow{p}\mu_Y\),则 \(\hat\mu_Y\) 是一致(consistent)估计量——样本量大时由抽样随机性带来的不确定性很小;
- 若 \(\hat\mu_Y\) 与 \(\tilde\mu_Y\) 都无偏且 \(\operatorname{var}(\hat\mu_Y)<\operatorname{var}(\tilde\mu_Y)\),则 \(\hat\mu_Y\) 比 \(\tilde\mu_Y\) 更有效(more efficient)——更有效地利用了数据中的信息。
\(\bar Y\) 的性质:
- 无偏:\(E(\bar Y)=\mu_Y\)(2.5 节);一致:由大数定律 \(\bar Y\xrightarrow{p}\mu_Y\)。
- 有效性需与具体估计量比较。与 \(Y_1\) 比:\(Y_1\) 无偏,\(\operatorname{var}(Y_1)=\sigma_Y^2\);\(\operatorname{var}(\bar Y)=\sigma_Y^2/n\),\(n\ge2\) 时 \(\bar Y\) 更有效(为何收集 \(n\) 个观测只用第一个?有效性概念形式化了这一直觉)。与一个不那么明显差的估计量比:交替以 ½ 和 3/2 加权
\[\tilde Y=\frac1n\left(\tfrac12Y_1+\tfrac32Y_2+\tfrac12Y_3+\tfrac32Y_4+\cdots+\tfrac12Y_{n-1}+\tfrac32Y_n\right)\tag{3.1}\](\(n\) 为偶数),\(E(\tilde Y)=\mu_Y\),\(\operatorname{var}(\tilde Y)=1.25\sigma_Y^2/n\)(习题 3.11;推导:\(\frac{1}{n^2}\cdot\frac n2(\frac14+\frac94)\sigma_Y^2=1.25\sigma_Y^2/n\))。\(\tilde Y\) 无偏且一致,但方差大于 \(\bar Y\)。
- Key Concept 3.3 \(\bar Y\) 是 BLUE:设 \(\hat\mu_Y=\frac1n\sum_{i=1}^na_iY_i\)(\(a_i\) 为非随机常数)为 \(Y_1,\dots,Y_n\) 的加权平均;若 \(\hat\mu_Y\) 无偏,则除非 \(\hat\mu_Y=\bar Y\),否则 \(\operatorname{var}(\bar Y)<\operatorname{var}(\hat\mu_Y)\)。即 \(\bar Y\) 是最佳线性无偏估计量(Best Linear Unbiased Estimator, BLUE)——在所有线性无偏估计量中最有效(第 5 章证明)。
\(\bar Y\) 是最小二乘估计量:考虑找 \(m\) 最小化
随机抽样的重要性:非随机抽样会使 \(\bar Y\) 有偏。虚构例子:统计机构每月第二个周三上午 10 点在城市公园采访劳动年龄成人来估计失业率——在职者此时大多在上班,失业者被过度抽样(oversample),估计有偏。附录 3.1 介绍美国劳工统计局如何实施当前人口调查(CPS)。
专栏 Off the Mark!(PDF p.109):2009 年印度大选(2014 年前世界最大的民主选举)前,民调预测团结进步联盟(UPA)与全国民主联盟(NDA)势均力敌:UPA 201–235 席、NDA 165–186 席(第 14 届人民院);实际 UPA 262 席、NDA 仅 157 席。原因:印度人口异质,种姓、宗教、地域影响选举;弱势群体可能不愿透露真实偏好。民调此后更精细地调整抽样偏差,但若不能在不同地区和人群中随机抽样仍会失准。
3.2 关于总体均值的假设检验(PDF p.110–118)
很多问题可表述为是/否问题:美国近期大学毕业生平均时薪是否等于 20 美元?男女毕业生平均收入是否相同?
原假设与备择假设:原假设(null hypothesis)\(H_0\):总体均值等于特定值 \(\mu_{Y,0}\),
p 值(p-value,亦称显著性概率 significance probability):样本中 \(\bar Y\) 很少恰好等于 \(\mu_{Y,0}\),差异可能来自原假设为假,也可能来自原假设为真但存在抽样随机性,无法确定区分。p 值是在原假设为真的前提下,抽到与原假设至少同样不利的统计量的概率。例:样本平均工资 22.64 美元;p 值是在原假设真时纯由抽样波动得到与 20 美元至少同样远的 \(\bar Y\) 的概率。p 值很小(如 0.1%)→ 原假设为真时很不可能抽到这样的样本 → 合理地认为原假设不成立;p 值很大(如 40%)→ 22.64 很可能只是抽样波动 → 不拒绝。数学表述:
\(\sigma_Y\) 已知时的 p 值(Figure 3.1):原假设下 \((\bar Y-\mu_{Y,0})/\sigma_{\bar Y}\sim N(0,1)\),
样本方差、样本标准差与标准误:
- 样本方差(sample variance):
\[s_Y^2=\frac1{n-1}\sum_{i=1}^n(Y_i-\bar Y)^2.\tag{3.7}\]样本标准差 \(s_Y\) 是其平方根。与总体方差 \(E(Y-\mu_Y)^2\) 相比有两处修改:用 \(\bar Y\) 替代未知的 \(\mu_Y\);除以 \(n-1\) 而非 \(n\)。原因:用 \(\bar Y\) 估计 \(\mu_Y\) 会使 \((Y_i-\bar Y)^2\) 有小幅向下偏误,\(E[(Y_i-\bar Y)^2]=[(n-1)/n]\sigma_Y^2\)(习题 3.18),因此 \(E\sum(Y_i-\bar Y)^2=(n-1)\sigma_Y^2\),除以 \(n-1\) 使 \(s_Y^2\) 无偏。这称自由度修正(degrees of freedom correction):估计均值用掉了 1 个自由度,只剩 \(n-1\) 个。
- 样本方差的一致性:
\[s_Y^2\xrightarrow{p}\sigma_Y^2.\tag{3.8}\]附录 3.3 在 i.i.d. 且四阶矩有限(\(E(Y_i^4)<\infty\))的条件下证明。直觉:\(s_Y^2\) 是样本平均,服从大数定律;LLN 要求 \((Y_i-\mu_Y)^2\) 方差有限,即四阶矩有限。
- \(\bar Y\) 的标准误(standard error,Key Concept 3.4):由于 \(\sigma_{\bar Y}=\sigma_Y/\sqrt n\),用 \(s_Y/\sqrt n\) 估计之:
\[SE(\bar Y)=\hat\sigma_{\bar Y}=s_Y/\sqrt n.\tag{3.9}\]伯努利情形:\(\operatorname{var}(\bar Y)=p(1-p)/n\),\(SE(\bar Y)=\sqrt{\bar Y(1-\bar Y)/n}\)。
\(\sigma_Y\) 未知时的 p 值:用 \(SE(\bar Y)\) 替代 \(\sigma_{\bar Y}\):
t 统计量(t-statistic / t-ratio):
数值例:\(n=200\) 名近期毕业生,检验 \(E(Y)=20\)。\(\bar Y^{act}=22.64\),\(s_Y=18.14\),\(SE(\bar Y)=18.14/\sqrt{200}=1.28\),\(t^{act}=(22.64-20)/1.28=2.06\),p 值 \(=2\Phi(-2.06)=0.039\),即 3.9%。
预设显著性水平的检验:两类错误——原假设为真却拒绝;原假设为假却未拒绝。若预先指定能容忍的第一类错误概率(如 5%),则当且仅当 p 值 < 0.05 时拒绝。这种做法偏向原假设,但很多实际场景中合适。由于标准正态 ±1.96 之外的尾部面积为 5%:
Key Concept 3.5 假设检验术语:第一类错误(type I error):原假设为真却被拒绝;第二类错误(type II error):原假设为假却未被拒绝。显著性水平(significance level):预先指定的原假设为真时的拒绝概率(即预设的第一类错误概率)。临界值(critical value):在给定显著性水平下刚好拒绝原假设时检验统计量的值。拒绝域(rejection region)/ 接受域(acceptance region):拒绝/不拒绝原假设的统计量取值集合。检验的规模(size):原假设为真时检验实际错误拒绝的概率;检验的功效(power):备择为真时检验正确拒绝的概率。p 值:原假设为真时由抽样波动得到至少同样不利统计量的概率;等价地,是可以拒绝原假设的最小显著性水平。
上例:5% 水平双侧检验的临界值为 1.96,拒绝域为 \(|t|>1.96\)。若拒绝,则称 \(\mu_Y\) 在 5% 水平上与 \(\mu_{Y,0}\) 统计显著不同(statistically significantly different)。\(t=2.06>1.96\),在 5% 水平拒绝。只报告是否在预设水平拒绝,信息少于报告 p 值。
实践中用什么显著性水平?(PDF p.116–117)这是活跃的争论。传统用 5%:在 5% 水平检验许多假设,平均每 20 次会有 1 次错误拒绝。若被检验的原假设中只有很小一部分真的为假,那么在所有拒绝中,原假设真的为假的比例可能很小(习题 3.22)。所有拒绝中错误拒绝所占比例称假阳性率(false positive rate),实际意义重大:如新报告的“统计显著有效”的疗法中实际无效的比例。担心 5% 水平下假阳性率过高,有统计学家建议报告新结果时用 0.5% 水平(Benjamin et al., 2017),对应双侧临界值 2.81;p 值在 0.05 与 0.005 之间可视为“提示性但非结论性”的证据,值得进一步研究。法律场景中类似(希望错判有罪的比例低)。显著性水平的选择需要判断:某些经济应用中假阳性的代价低于医学(患者接受无效治疗),5% 可能合适。另外,p 值与 t 统计量只有在原假设本身有意义时才有用:检验“平均收入为零”毫无经济意义(虽然很多实习生无薪),检验“男女平均收入相同”则有社会意义(3.4 节)。
Key Concept 3.6 检验 \(E(Y)=\mu_{Y,0}\) 对双侧备择 \(E(Y)\ne\mu_{Y,0}\):(1) 计算 \(SE(\bar Y)\);(2) 计算 t 统计量 (3.13);(3) 计算 p 值 (3.14),若 p 值 < 0.05(等价于 \(|t^{act}|>1.96\))则在 5% 水平拒绝。
单侧备择(one-sided alternative):例如希望教育有助于劳动力市场表现,备择应是“毕业生挣得更多”而非“不同”:
3.3 总体均值的置信区间(PDF p.118–120)
由于抽样误差,无法仅凭样本得知总体均值的精确值,但可以构造一个以预设概率包含真值 \(\mu_Y\) 的集合,称置信集(confidence set),该预设概率称置信水平(confidence level)。对 \(\mu_Y\) 而言置信集是上下限之间的区间,即置信区间(confidence interval)。
构造思想(检验反演):任取一个 \(\mu_{Y,0}\) 做 5% 双侧检验,若 \(|t|<1.96\) 不拒绝就记入清单;对所有可能值重复。得到的清单是 5% 水平下不能被拒绝的所有总体均值值,可用来回答任何人提出的具体假设。巧妙的论证:设真值为 21.5(未知),则 \(\bar Y\) 以 21.5 为中心正态分布,检验 \(\mu_Y=21.5\) 的 t 统计量服从 \(N(0,1)\),大样本下 5% 水平拒绝它的概率为 5%。由于你检验了所有可能值,必然包括真值,在 95% 的样本中你会正确接受 21.5,即 95% 的样本中清单包含真值——清单构成 95% 置信集。
简便方法:由 (3.13),若试验值距 \(\bar Y\) 超过 1.96 个标准误则被拒绝,因此不被拒绝的值是 \(\bar Y\pm1.96SE(\bar Y)\) 之内的值:\(\bar Y-1.96SE(\bar Y)\le\mu_Y\le\bar Y+1.96SE(\bar Y)\)。
Key Concept 3.7 总体均值的置信区间:95% 双侧置信区间是按“在所有可能随机样本的 95% 中包含真值 \(\mu_Y\)”构造的区间。\(n\) 大时:
数值例:\(n=200\),\(\bar Y=22.64\),\(SE(\bar Y)=1.28\),95% 置信区间 \(=22.64\pm1.96\times1.28=22.64\pm2.51=(20.13,\ 25.15)\) 美元。
单侧置信区间(单侧检验不能拒绝的值)在某些统计领域有应用,但应用计量中少见。覆盖概率(coverage probability):在所有可能随机样本上计算的、置信区间包含真实总体均值的概率。常见误区:95% 置信区间不是“真值有 95% 概率落在这个已算出的区间内”,而是“构造区间的程序在 95% 的样本中覆盖真值”。
3.4 比较不同总体的均值(PDF p.120–122)
近期男女大学毕业生平均收入是否相同?需比较两个总体分布的均值。
两均值之差的假设检验:\(\mu_w\)、\(\mu_m\) 分别为近期女性、男性毕业生的平均时薪。原假设两者相差 \(d_0\):
两均值之差的置信区间:\(d=\mu_m-\mu_w\) 的 95% 置信区间:
3.5 用实验数据的均值差估计因果效应(PDF p.122–125)
随机对照实验从目标总体中随机选取对象,再随机分配到处理组或对照组;两组样本均值之差是处理因果效应的估计量。
因果效应即条件期望之差:处理的因果效应是在理想随机对照实验中测得的处理对结果的期望效应,可表示为
用均值差估计:二元处理时用两组样本均值之差估计;“处理无效”等价于两均值相等,用 (3.20) 检验;两组均值差的 95% 置信区间 (3.21) 就是因果效应的 95% 置信区间。设计良好、执行良好的实验能提供令人信服的因果估计,因此医学中常用;经济学实验昂贵、难管理、有时有伦理问题,故较少。计量经济学家有时研究自然实验(natural experiments,亦称准实验 quasi-experiments):某个与处理和对象特征无关的事件,使不同对象接受不同处理,仿佛参与了随机实验。
专栏:社会阶层还是教育?童年环境与成年收入再探(PDF p.123–124):第 2 章专栏显示父亲职业为“常规”者成年后家庭收入较低。是否还有中间因素,如教育?Table 3.1 按最高学历分组,比较父亲 NS-SEC 为“高级”(h)与“常规”(r)两组的平均家庭月收入:
| 学历 | \(\bar Y_h\) | \(s_h\) | \(n_h\) | \(\bar Y_r\) | \(s_r\) | \(n_r\) | \(\bar Y_h-\bar Y_r\) | SE | 95% CI |
|---|---|---|---|---|---|---|---|---|---|
| 无学历 | £2,223.13 | 2,115.12 | 1129 | £1,842.98 | 1,487.29 | 6383 | £380.15 | 65.64 | (251.38, 508.93) |
| GCSE/O-Level | 2,837.18 | 1,819.73 | 1962 | 2,596.93 | 1,738.47 | 4042 | 240.25 | 49.35 | (143.49, 337.00) |
| A-Level | 3,045.99 | 2,451.81 | 1216 | 2,745.70 | 1,912.50 | 1169 | 300.30 | 89.85 | (124.11, 476.49) |
| 本科及以上 | 3,690.51 | 2,743.55 | 4359 | 3,370.96 | 2,443.58 | 2505 | 319.55 | 64.11 | (193.86, 445.23) |
| 全部 | 3,215.71 | 2,497.73 | 8666 | 2,405.45 | 1,886.86 | 14099 | 810.25 | 31.18 | (749.13, 871.38) |
计算示例:无学历组 \(SE=\sqrt{2115.12^2/1129+1487.29^2/6383}=65.64\)。两组内部都是学历越高家庭收入越高(本科及以上与无学历的差距:父亲高级组 £1467.38,常规组 £1527.98)。合并所有学历时差异 £810.25,但分学历后每一档的差异都远小于 £810.25(240–380 英镑),说明两组学历构成不同,教育解释了部分差异;但所有分组差异仍显著异于 0。遗留问题:高学历者是否更可能在双收入家庭?差异来自本人还是伴侣收入?学历随年龄变化的趋势是否影响结论?这些需在多元回归中处理——这是“控制变量/分组比较”思想与遗漏变量偏误的预告。
专栏:提高投票率的方法(PDF p.125):英国等民主国家公民对投票冷漠。2005 年大选前在曼彻斯特某选区实验:该选区 2001 年投票率 48.6%,全国平均 59.4%。从能获取座机号码的登记选民中随机选出三组:一组接受电话游说,一组接受上门游说,对照组不接触。游说者询问是否认为投票重要、是否打算投票、是否邮寄投票,非正式交谈、强调投票重要性并回应疑虑。结果:上门游说组投票率 55.1%,电话组 55%,均与对照组有差异;进一步估计游说与电话的效应分别为 6.7% 和 7.3%(原文如此),均统计显著。说明通过个人接触提高意识可以“助推”(nudge)选民参与。印度 2014 年大选投票率创纪录,选举委员会称提高意识与登记的努力起了作用。
3.6 小样本时使用 t 统计量(PDF p.124–128)
3.2–3.5 节用标准正态临界值,依据是大样本 CLT。小样本时标准正态可能是 t 统计量分布的糟糕近似。但若总体本身正态,检验单个总体均值的 t 统计量的精确分布是自由度 \(n-1\) 的 Student t 分布。
检验均值的 t 统计量:
两均值之差的 t 统计量:(3.20) 即使总体正态也不服从 Student t 分布(因为 (3.19) 的方差估计量不能使分母成为卡方变量)。修改版——合并标准误(pooled standard error)——在 \(Y\) 正态时有精确 t 分布,但只适用于两组方差相同或两组样本量相同的特殊情形(习题 3.21)。合并方差估计量:
实践中的 Student t:检验 \(Y\) 的均值时,t 分布只在总体正态时适用;而经济变量正态是例外(见第 2 章英国收入与瑞士法郎专栏)。即使数据不正态,大样本下 t 统计量的正态近似仍然有效,因此关于均值的推断应基于大样本正态近似。比较两均值时,导致两组均值不同的经济原因通常也意味着方差不同,合并标准误不适用,应使用允许组间方差不同的 (3.19);即使总体正态,用 (3.19) 的 t 统计量也不服从 t 分布,所以应结合大样本标准正态近似。有些软件用 t 分布计算 p 值和置信区间,但大样本下差别可忽略:\(n>15\) 时两者算出的 p 值之差不超过 0.01;\(n>80\) 时不超过 0.002。本书所有应用样本量都在数百或数千。
3.7 散点图、样本协方差与样本相关(PDF p.128–131)
年龄与收入有何关系?本节复习三种概括两变量关系的方法。
散点图(scatterplot):\(n\) 个观测的 \((X_i,Y_i)\) 点图。Figure 3.2:2016 年 3 月 CPS 中 200 名计算机与信息系统经理的年龄与平均时薪;高亮点为 45 岁、时薪 49.15 美元的工人。图中显示正相关(年长者倾向挣得多),但关系不精确,仅凭年龄无法完美预测收入。
样本协方差与样本相关:总体协方差和相关未知,可用随机样本 \((X_i,Y_i)\) 估计,方法是用样本均值替代总体期望。
一致性:样本协方差一致,
例:Figure 3.2 中 200 名工人,年龄样本标准差 \(s_A=9.57\) 年,收入样本标准差 \(s_E=19.93\) 美元/小时,样本协方差 \(s_{AE}=91.51\)(单位为年×美元/小时,难以解释),\(r_{AE}=91.51/(9.57\times19.93)=0.48\)——正相关但远非完美。改用美分计量:\(s_E=1993\) 美分,协方差 9151,相关仍为 \(9151/(9.57\times1993)=0.48\),验证相关不依赖计量单位。
Figure 3.3 四个假想数据集:(a) 强正线性关系,\(r=0.9\);(b) 强负关系,\(r=-0.8\);(c) 无明显关系(独立),\(r=0\);(d) 明显的二次关系——\(X\) 增大时 \(Y\) 先升后降——但 \(r=0\),因为小的 \(Y\) 同时对应大和小的 \(X\)。要点:相关系数只度量线性关联。
第 3 章小结、关键术语与习题概览(PDF p.132–141)
小结:(1) \(\bar Y\) 是 \(\mu_Y\) 的估计量;i.i.d. 时其抽样分布均值 \(\mu_Y\)、方差 \(\sigma_Y^2/n\),无偏、一致(LLN)、大样本近似正态(CLT);(2) t 统计量用于检验总体均值等于某特定值,\(n\) 大时原假设下服从标准正态;(3) 由 t 统计量算 p 值,小 p 值是原假设为假的证据;(4) 95% 置信区间在所有可能样本的 95% 中包含真值;(5) 两总体均值差的检验与区间在概念上与单总体类似;(6) 样本相关系数估计总体相关,度量线性关系(散点图被直线近似的程度)。 关键术语:估计量、估计值、偏误、一致性、有效性、BLUE、最小二乘估计量、假设检验、原假设、备择假设、双侧备择、p 值(显著性概率)、样本方差、样本标准差、自由度、\(\bar Y\) 的标准误、t 统计量、t 比率、检验统计量、第一类错误、第二类错误、显著性水平、临界值、拒绝域、接受域、检验规模、检验功效、单侧备择、置信集、置信水平、置信区间、覆盖概率、两均值差检验、因果效应、处理效应、散点图、样本协方差、样本相关系数。
复习题(3.1–3.8):无偏与一致的区别;有效性含义与 BLUE;均值 15、方差 10 的总体在 \(n=5,500,5000\) 时 \(\bar Y\) 的均值方差(联系 LLN);标准误与标准差的区别及 \(SE(\bar Y)\) 计算;原假设/备择、规模/显著性水平/功效、单侧/双侧的区别;为何置信区间比单次检验结果信息多;散点图能表示哪些统计特征;画出总体相关为 1.0、−1.0、0.9、−0.5、0.0 的 10 点散点图。
习题(3.1–3.22)题型:
- CLT 概率计算:3.1(\(\mu=75\),\(\sigma^2=45\),不同 \(n\) 的 \(\bar Y\) 概率)。
- 比例估计与民调:3.2(伯努利 \(\hat p=\bar Y\) 无偏、\(\operatorname{var}(\hat p)=p(1-p)/n\));3.3(500 名选民中 270 支持民主党:估计 \(p\)、标准误 \(\sqrt{\hat p(1-\hat p)/n}\)、对 \(p=0.5\) 的双侧与单侧 p 值及差异原因);3.4(95%、99% 置信区间及为何后者更宽、用区间直接做检验);3.5(1000 人调查:规则“\(|\hat p-0.4|>0.01\) 则拒绝”的规模与 \(p=0.45\) 时的功效;\(\hat p=0.44\) 时 10% 水平双侧/单侧检验、90%/99%/60% 置信区间;独立重复 30 次调查的 90% 区间全部覆盖真值的概率 \(0.9^{30}\) 及期望覆盖个数 27;误差幅度(margin of error \(=1.96SE\))不超过 0.5% 所需样本量)。
- 区间与检验的对偶:3.6(p 值 0.07 时 90% 区间是否包含 10、能否判断 8 是否在 95% 区间内)。
- 抽样偏差:3.7(总体女性 50%,座机随机样本 1000 中女性 55%,是否有偏)。
- 均值区间与两均值比较:3.8(SAT 新版 1500 人均值 1230、标准差 145);3.10(阿姆斯特丹 150 名三年级学生均值 42、标准差 6;鹿特丹 300 名均值 48、标准差 10;99% 区间、差值 95% 区间、p 值);3.12(英国某公司同类岗位男 120 人月薪均值 £8200、标准差 £450,女 150 人 £7900、£520;检验工资差异是否显著、是否构成性别歧视证据——统计显著不等于因果歧视);3.13(布鲁塞尔 400 学区考试成绩均值 712.1、标准差 23.2;小班 150 个均值 721.8、标准差 24.4;大班 250 个均值 710.9、标准差 20.6;小班成绩是否显著更高);3.16(乌克兰 600 名学生均值 508、标准差 75,欧洲均值 500;另 500 人上 3 小时备考课后均值 514、标准差 65;原 600 人上课后重考平均提高 7 分、标准差 40——比较独立样本与配对差异的推断,并设计实验区分备考课效应与考试经验效应);3.17(基于 Table 3.1 构造学历差距置信区间及其差的区间)。
- 规模与功效:3.9(集成电路平均寿命 1000 小时、标准差 100,经理抽 50 个、样本均值 > 1100 才相信改进:求检验规模、真实均值 1150 时的功效、规模 1% 时的临界值)。
- 证明:3.11(\(\tilde Y\) 无偏且方差 \(1.25\sigma_Y^2/n\));3.14(身高体重统计量单位换算,相关不变);3.15(两伯努利样本比例差的方差与置信区间 \((\hat p_a-\hat p_b)\pm1.96\sqrt{\hat p_a(1-\hat p_a)/n_a+\hat p_b(1-\hat p_b)/n_b}\));3.18(证 \(s_Y^2\) 无偏:\(E(Y_i-\bar Y)^2=\operatorname{var}(Y_i)-2\operatorname{cov}(Y_i,\bar Y)+\operatorname{var}(\bar Y)\),\(\operatorname{cov}(\bar Y,Y_i)=\sigma_Y^2/n\));3.19(\(\bar Y^2\) 是 \(\mu_Y^2\) 的无偏估计吗?——否,\(E(\bar Y^2)=\mu_Y^2+\sigma_Y^2/n\);一致吗?——是,连续映射);3.20(样本协方差一致);3.21(\(n_m=n_w\) 时合并标准误等于 (3.19))。
- 假阳性率:3.22(\(\sigma_Y=10\)、\(n=100\)、\(SE=1\),单侧 5% 检验 \(t>1.64\);\(\mu_Y=0\) 时拒绝概率 5%,\(\mu_Y=2\) 时拒绝概率(功效)\(=\Pr(Z>1.64-2)=\Phi(0.36)\approx0.64\);若 90% 情形原假设真、10% 备择真,拒绝概率 \(=0.9\times0.05+0.1\times0.64\approx0.109\),拒绝时原假设为真的概率 \(\approx0.045/0.109\approx41\%\);新药情形:90% 新药无效,用 5% 水平时假阳性率约 41%,改用 0.5% 水平(临界值 2.58)后假阳性率大幅下降(约 \(0.9\times0.005/(0.9\times0.005+0.1\times\Phi(-0.58))\approx0.14\)))。
- 实证题:E3.1(CPS96_15 数据:1996 与 2015 年 25–34 岁全职工人的平均时薪 AHE,计算均值、标准差、95% 区间、变化的区间;用 CPI(2015 年 237.0,1996 年 156.9)换算为 2015 年实际美元;比较高中与大学学历工资及其差距是否扩大;仿 Table 3.1 制作高中学历的性别差距表);E3.2(John List 体育纪念品交易会随机实验检验禀赋效应(endowment effect):随机给交易者价值相近的物品 A(Cal Ripken Jr. 连续出场纪录比赛票根)或 B(Nolan Ryan 第 300 胜比赛纪念品),问是否愿意交换;无禀赋效应时无论偏好分布如何,预期交换比例都是 50%(随机分配下的巧妙推导);检验实际交换比例是否显著异于 50%,并比较经验丰富的经销商与非经销商,检验“禀赋效应随市场经验消失”的假说,数据来自 List (2003, QJE))。
附录 3.1 美国当前人口调查(CPS)(PDF p.142)
美国人口普查局与劳工统计局每月进行 CPS,提供就业、失业、收入等劳动力特征数据。每月约调查 54,000 户;样本从最近一次十年普查地址库(补充普查后新建住房)中随机抽取地址;抽样方案为多阶段(先随机选小地理区域,再在区域内随机选住房单位),细节见《劳工统计手册》与 BLS 网站。每年 3 月的调查更详细,询问上一年收入;Table 2.4 与 3.1 的统计量(原书美国版对应表)用 3 月调查计算。全职工人定义为上一年至少 48 周、每周工作超过 35 小时。
附录 3.2 \(\bar Y\) 是 \(\mu_Y\) 最小二乘估计量的两个证明(PDF p.142–143)
微积分证明:
附录 3.3 样本方差一致性的证明(PDF p.143–144)
条件:i.i.d. 且 \(E(Y_i^4)<\infty\)。先看除以 \(n\) 的版本:
第 3 章本章要点
- 估计量是随机变量;评价标准:无偏、一致、有效。\(\bar Y\) 无偏、一致、是 BLUE,且是最小二乘估计量。
- 随机抽样至关重要;非随机抽样(过度抽样某些群体)导致偏误。
- 样本方差除以 \(n-1\)(自由度修正)得无偏;需四阶矩有限才一致。标准误 \(SE(\bar Y)=s_Y/\sqrt n\) 估计抽样分布标准差。
- t 统计量 \(t=(\bar Y-\mu_{Y,0})/SE(\bar Y)\),大样本原假设下近似 \(N(0,1)\);双侧 p 值 \(2\Phi(-|t|)\),单侧 \(1-\Phi(t)\);5% 临界值双侧 1.96、单侧 1.64。
- 术语:第一/二类错误、显著性水平、规模、功效、p 值是能拒绝的最小显著性水平。假阳性率依赖于被检验假设中真正为假的比例,5% 水平下可能很高;有人建议用 0.5%(临界值 2.81)。
- 置信区间 = 检验的反演;95% 区间 \(\bar Y\pm1.96SE\);覆盖概率的频率解释。
- 两均值差:\(SE=\sqrt{s_1^2/n_1+s_2^2/n_2}\)(允许方差不等),不要用合并方差,除非确信方差相同。
- 随机实验中两组均值差估计因果(处理)效应。
- Student t 只在总体正态时精确,经济数据少见正态;大样本下 t 与正态差别可忽略(\(n>80\) 时 p 值差 < 0.002)。
- 样本相关度量线性关系;非线性关系可能相关为零。
与量化交易的关联
- 策略/因子显著性检验:检验某策略平均收益是否为零就是本章 \(H_0:\mu=0\) 的 t 检验,\(t=\bar r/(s/\sqrt T)\),与夏普比率直接相关:\(t\approx\text{SR}_{\text{每期}}\times\sqrt T\)。但收益序列自相关与异方差时需用 HAC 标准误(第 16 章),而非 i.i.d. 公式。
- 多重检验与假阳性:3.2 节对假阳性率的讨论和习题 3.22 正是量化研究“因子动物园”(factor zoo)、数据挖掘和回测过拟合问题的核心:若尝试成百上千个候选因子而真正有效的比例很小,在 5% 水平“显著”的因子中大部分是假阳性。Harvey–Liu–Zhu (2016) 主张因子 t 统计量门槛提高到约 3.0,与本书提到的 0.5% 水平(2.81)思路一致;实践中还用 Bonferroni、Benjamini–Hochberg(FDR)或 deflated Sharpe ratio 修正。
- 两组均值比较:多空组合(高因子分位组 vs 低分位组收益差)的显著性检验即两均值差检验;应使用允许方差不同的标准误(3.19)。事件研究、A/B 测试式执行算法比较(两种下单算法的平均滑点差异)也可直接套用。随机实验思想可用于执行算法的随机化 A/B 测试,以得到因果结论。
- 样本方差与四阶矩:方差估计一致需要四阶矩有限;收益厚尾时样本方差(以及波动率、协方差估计)收敛慢、不稳定——风险模型中需用稳健估计或收缩估计。
- 相关只度量线性关系:因子与未来收益可能存在非线性(如 U 形)关系,IC(信息系数,即截面相关)为零不代表无预测力;应结合分组收益、秩相关或非线性模型检查。
- 置信区间:报告策略预期收益/夏普比率时应给出区间而非点估计;“边际误差”思想可用于决定回测所需的样本长度(类似习题 3.5d 的样本量计算)。
- 抽样偏差:Off the Mark! 专栏的非随机抽样问题在量化中对应幸存者偏差(只用现存股票)、前视偏差、只研究流动性好的样本等。
推荐习题
- 3.22(假阳性率与显著性水平选择):最重要,直接对应因子挖掘的多重检验问题。
- 3.5(检验规模、功效、多次置信区间的覆盖、样本量设计):理解检验的频率解释。
- 3.9(规模与功效计算)。
- 3.12、3.13(两均值差检验及“统计显著 ≠ 因果”):对应多空组合收益差检验。
- 3.18、3.19(样本方差无偏性;\(\bar Y^2\) 有偏但一致):理解偏误与一致性的区别,类比夏普比率估计的小样本偏误。
- 3.16(独立样本 vs 配对差异):对应策略比较时用配对差(同期收益差)能大幅降低方差。
- E3.2(禀赋效应随机实验):行为金融中的禀赋效应、处置效应的实验证据。
第 4 章 单一回归变量的线性回归(Linear Regression with One Regressor)(PDF p.144–178)
开篇:因果推断与预测两类问题(PDF p.144–145)
两个情景:(1) 某小学学区督学要决定是否增聘教师,这会使师生比降低 2,但增加支出;她问:班级规模减 2,对标准化考试成绩的效应是多少?(2) 一位父亲想搬到学校好的城镇,某学区成绩不公开但知道其师生比;他问:告诉你班级规模,能预测该学区成绩吗?两个问题都关乎班级规模与成绩的关系,但性质不同:督学需要一个变量(师生比 \(X\))的变化对另一变量(成绩 \(Y\))的因果效应估计——因果推断(causal inference),即用数据估计改变某变量值的干预对结果的效应;父亲需要知道各学区间 \(X\) 与 \(Y\) 平均而言如何相关,以便给定 \(X\) 预测 \(Y\)——预测(prediction),即用某变量的观测值预测另一变量。
本章引入单变量线性回归模型:假设 \(X\) 与 \(Y\) 之间是线性关系。正如 \(Y\) 的均值是总体分布的未知特征,连接 \(X\)、\(Y\) 的直线的截距和斜率是 \((X,Y)\) 总体联合分布的未知特征;计量问题是用样本估计它们。与均值差一样,线性回归既可用于因果推断也可用于预测,但对数据的要求不同:3.5 节中,处理随机分配时均值差估计因果效应;\(X\) 连续时取值很多,均值差不再适用,但若额外假设关系为线性,则 \(X\) 随机分配时可用线性回归估计改变 \(X\) 的干预对 \(Y\) 的因果效应。即使 \(X\) 非随机分配,线性回归仍可通过把 \(E(Y\mid X)\) 建模为 \(X\) 的线性函数来预测;只要待预测观测与估计数据来自同一总体即可。4.1–4.3 讲模型与最小二乘估计;4.4 讲估计因果效应对数据的要求——核心是 \(X\) 在实验中随机设定或“仿佛随机”(as-if random)设定。因果推断贯穿至第 13 章,第 14 章回到预测。
4.1 线性回归模型(PDF p.145–148)
回到父亲的问题。第 2 章用 \(E(Y\mid X=x)\) 表示条件期望。\(X\) 可取多个值时,建模的最简单起点是假设它是线性的:
(4.1) 只给出某班级规模学区的平均成绩,不给出任何单个学区的具体成绩;同班级规模的学区在许多方面不同,成绩也不同,因此预测有误差:
一般记号:\(n\) 个学区,\(Y_i\) 为第 \(i\) 学区平均成绩,\(X_i\) 为平均班级规模,\(E(Y_i\mid X_i)=\beta_0+\beta_1X_i\),\(u_i\) 为用条件均值预测 \(Y_i\) 的误差:
\(\beta_0\)、\(\beta_1\) 是总体回归线的系数(coefficients)或参数(parameters)。斜率 \(\beta_1\) 是 \(X\) 相差一单位时 \(Y\) 的差异;截距是 \(X=0\) 时总体回归线的值(与 Y 轴交点)。有些应用中截距有经济含义;另一些则没有——如 \(X\) 为班级规模时,截距严格说是“班里没有学生时的期望成绩”!此时最好把截距只看作决定回归线高度的系数。\(u_i\) 是误差项(error term);在预测问题中,\(u_i\) 是 \(Y_i\) 与其按总体回归线预测值之差。
Key Concept 4.1 单变量线性回归模型术语:\(Y_i=\beta_0+\beta_1X_i+u_i\),下标 \(i\) 遍历观测 \(1,\dots,n\);\(Y_i\) 为因变量、被回归变量(regressand)或左侧变量;\(X_i\) 为自变量、回归变量或右侧变量;\(\beta_0+\beta_1X\) 为总体回归线/函数;\(\beta_0\) 为截距;\(\beta_1\) 为斜率;\(u_i\) 为误差项。
Figure 4.1:7 个假想学区的成绩(Y)与师生比(X)散点,总体回归线向下倾斜(\(\beta_1<0\)),即师生比低(班级小)的学区成绩倾向更高。第 \(i\) 点到总体回归线的垂直距离 \(Y_i-(\beta_0+\beta_1X_i)\) 即总体误差 \(u_i\):学区 1 的 \(Y_1\) 在线上方,成绩好于预测,\(u_1>0\);学区 2 在线下方,\(u_2<0\)。
4.2 线性回归模型系数的估计(PDF p.148–154)
实际中 \(\beta_0\)、\(\beta_1\) 未知,需用数据估计。这类似第 3 章用样本均值估计总体均值。
数据:1999 年加州 420 个 K–8(幼儿园至八年级)学区;成绩为学区内五年级学生阅读与数学平均分;班级规模用最宽泛的度量之一——学区学生数除以教师数,即学区师生比(student–teacher ratio, STR)。详见附录 4.1。
Table 4.1 分布概要:
| 均值 | 标准差 | 10% | 25% | 40% | 50% | 60% | 75% | 90% | |
|---|---|---|---|---|---|---|---|---|---|
| 师生比 | 19.6 | 1.9 | 17.3 | 18.6 | 19.3 | 19.7 | 20.1 | 20.9 | 21.9 |
| 成绩 | 654.2 | 19.1 | 630.4 | 640.0 | 649.1 | 654.5 | 659.4 | 666.7 | 679.1 |
Figure 4.2 散点图:样本相关 −0.23,弱负相关;班级大则成绩倾向低,但其他决定因素使观测点远离直线。若能穿过数据画一条直线,其斜率就是 \(\beta_{ClassSize}\) 的估计。用铅笔和尺子“目测”画线不科学,不同人画法不同。最常用的方法是选择使数据“最小二乘”拟合的直线,即普通最小二乘(ordinary least squares, OLS)估计量。
OLS 估计量:选择回归系数使估计的回归线尽可能接近观测数据,接近程度用给定 \(X\) 预测 \(Y\) 时错误的平方和衡量。3.1 节中 \(\bar Y\) 最小化 \(\sum(Y_i-m)^2\);OLS 把这一思想推广到回归:设 \(b_0\)、\(b_1\) 为 \(\beta_0\)、\(\beta_1\) 的某个估计,预测值 \(b_0+b_1X_i\),第 \(i\) 个预测错误 \(Y_i-b_0-b_1X_i\),错误平方和
Key Concept 4.2 OLS 估计量、预测值与残差:
加州数据的 OLS 估计:420 个观测,估计斜率 −2.28,截距 698.9:
斜率大还是小? 师生比差 2 在加州数据中很大:约等于中位数(19.7)与 10 分位数(17.3)之差;但对应的预测成绩差 4.56 分相对成绩分布的离散度很小:略小于中位数(654.5)与 60 分位数(659.4)之差。即:在这些学校中很大的班级规模差异只对应较小的预测成绩差异。
为何使用 OLS? 实践原因:OLS 是主导方法,已成为经济学、金融(见“股票的 Beta”专栏)和社会科学回归分析的共同语言;用 OLS(或其变体)报告结果意味着与其他经济学家、统计学家“说同一种语言”;公式内置于几乎所有软件。理论原因:类似 \(\bar Y\) 的优良性质,在 4.4 节的假设下 OLS 无偏且一致;在某些附加特殊条件下 OLS 在一类无偏估计量中有效(5.5 节,高斯-马尔可夫定理)。
专栏:股票的“Beta”(PDF p.153):现代金融的基本思想是投资者需要财务激励才愿承担风险,即风险投资的期望收益 \(R\) 必须超过无风险投资收益 \(R_f\),期望超额收益 \(R-R_f\) 应为正。乍看股票风险应以方差衡量,但大部分风险可以通过持有组合分散掉,因此正确的风险度量不是方差而是与市场的协方差。资本资产定价模型(CAPM)形式化了这一思想:资产的期望超额收益与市场组合(所有可得资产的组合)的期望超额收益成正比:
4.3 拟合度与预测精度(PDF p.154–157)
回归线对数据描述得如何?回归变量解释了因变量多少变动?观测是紧密聚集在回归线周围还是分散?\(R^2\) 与回归标准误衡量 OLS 回归线对数据的拟合程度:\(R^2\) 介于 0 与 1 之间,度量 \(Y_i\) 方差中被 \(X_i\) 解释的比例;回归标准误度量 \(Y_i\) 通常离其预测值多远。
\(R^2\)(regression \(R^2\)):\(Y\) 的样本方差中被 \(X\) 解释(预测)的比例。由定义
回归标准误(standard error of the regression, SER):误差 \(u_i\) 标准差的估计量;\(u_i\) 与 \(Y_i\) 单位相同,SER 以因变量单位衡量观测在回归线周围的离散程度(如因变量为美元,SER 就是典型回归误差的美元大小)。误差不可观测,故用 OLS 残差计算:
用 OLS 预测:第 \(i\) 个观测的预测值 \(\hat Y_i\) 是用其 \(X_i\) 代入 OLS 回归线所得;由于该观测也用于估计系数,称为样本内预测(in-sample prediction)。实际中预测是在已知 \(X\)、未知 \(Y\) 时进行,这类观测不在估计样本中,称样本外预测(out-of-sample prediction)。预测的目标是准确的样本外预测(如父亲想预测未公布成绩的学区)。单变量模型中,取值 \(X\) 的样本外观测的预测值为 \(\hat Y=\hat\beta_0+\hat\beta_1X\)。没有完美预测,因此预测应附带精度估计;自然的度量是样本外预测误差 \(Y-\hat Y\) 的标准差。由于 \(Y\) 未知无法直接估计;但若被预测观测与估计数据来自同一总体,可用样本内预测误差的样本标准差——即 SER——来估计。常见报告方式:预测值 ± SER,即 \(\hat Y\pm s_{\hat u}\)。第 14 章引入更精细的预测精度度量。
应用于考试成绩数据:(4.9) 的 \(R^2=0.051\)(5.1%),\(SER=18.6\)。即 STR 解释了成绩方差的 5.1%;散点图显示师生比解释了一部分成绩变动,但大部分未解释。SER 18.6(单位为考试分数)说明散点在回归线周围离散很大,只用师生比预测学区成绩经常会有大误差。
低 \(R^2\)、高 SER 意味着什么? 本身并不说明回归“好”或“坏”。低 \(R^2\) 只说明还有其他重要因素影响成绩:学区间学生构成差异、与师生比无关的学校质量差异、考试运气等。低 \(R^2\) 和高 SER 不告诉我们这些因素是什么,但表明单靠师生比只解释了成绩变动的一小部分。常见误区:\(R^2\) 低不代表斜率估计不可靠或没有因果效应;\(R^2\) 高也不代表估计的是因果效应。
4.4 因果推断的最小二乘假设(PDF p.157–162)
用加州数据估计的样本回归线回答了父亲的预测问题。督学则不想预测成绩,而想提高成绩,需要知道降低师生比对成绩的因果效应,即她心中的 \(\beta_1\) 是“改变师生比的干预对成绩的因果效应”。当 \(\beta_1\) 定义为因果效应时,OLS 能否很好地估计它取决于数据的性质。3.5 节中,二元处理随机分配时均值差是因果效应 \(E(Y\mid X=1)-E(Y\mid X=0)\) 的无偏估计;这一逻辑可推广到线性回归与最小二乘估计量。
本节把 \(\beta_1\) 定义为 \(X\) 变化一单位的因果效应;由于 \(X\) 可取多值,\(X\) 的变化 \(\Delta x\) 的因果效应为 \(\beta_1\Delta x\)。这一定义(感兴趣变量如 STR 的系数即其因果效应)一直保持到第 13 章。本节给出 OLS 估计因果效应的三个数学假设:第一个把“\(X\) 随机分配或仿佛随机分配”翻译为回归语言;另两个是技术性的,保证大样本下 OLS 抽样分布可用正态近似,是样本均值 LLN 与 CLT 两个条件(i.i.d.、离群值不太可能)的推广。
假设 1:给定 \(X_i\) 时 \(u_i\) 的条件分布均值为零。先明确误差项是什么:班级规模只是小学教育众多方面之一;有的学区教师更好、教材更好;即使班级规模、教师、教材相当,学生构成也可能不同(移民多、母语为英语者少,或家庭更富裕);即使这些都一样,也会因考试当天学生发挥或记分错误等本质上随机的原因而成绩不同。班级规模回归中的误差项代表所有这些被省略因素对成绩的贡献。假设 1:\(E(u_i\mid X_i)=0\)——对 \(u_i\) 中其他因素的正式数学陈述:给定 \(X_i\) 的取值,这些其他因素分布的均值为零,即它们在此意义上与 \(X_i\) 无关。
- 随机对照实验中:二元处理时对象被随机分配到处理组(\(X=1\))或对照组(\(X=0\))。若随机分配由不使用任何对象信息的计算机程序完成,则 \(X\) 与对象的个人特征(包括决定 \(Y\) 的特征)独立分布,因此 \(u\) 给定 \(X\) 的条件均值为 0。由于回归建模的是条件均值,\(X\) 不必与 \(u\) 中所有其他因素独立,但 \(u\) 的均值不能与 \(X\) 相关,即 \(E(u_i\mid X_i)=0\)。
- 观测数据中:\(X\) 不是实验中随机分配的,最多只能希望 \(X\) “仿佛随机分配”,精确含义即 \(E(u_i\mid X_i)=0\)。在具体观测数据应用中该假设是否成立需要仔细思考与判断,后文反复讨论。
- 相关与条件均值:由 (2.28),\(E(u_i\mid X_i)=0\) 蕴含 \(\operatorname{corr}(X_i,u_i)=0\)。反向不成立:即使不相关,条件均值也可能非零(见 Figure 3.3d)。但若 \(X_i\) 与 \(u_i\) 相关,则 \(E(u_i\mid X_i)\) 必非零。因此常用“\(X_i\) 与 \(u_i\) 是否可能相关”来讨论条件均值假设:若相关,则假设被违背。
假设 2:\((X_i,Y_i)\),\(i=1,\dots,n\) 独立同分布。这是关于样本如何抽取的陈述。若观测是从单一大总体中简单随机抽样所得,则 \((X_i,Y_i)\) i.i.d.。例:\(X\) 为工人年龄、\(Y\) 为收入,从工人总体中随机抽人,每人有某个年龄和收入;抽 \(n\) 人,则 \((X_i,Y_i)\) 必然同分布;若随机抽取,则观测之间独立。对很多数据收集方案(如总体随机子集的调查数据)i.i.d. 是合理的。
非 i.i.d. 的例子:(a) \(X\) 由研究者设定:园艺学家研究不同有机除草方法(\(X\))对番茄产量(\(Y\))的影响,若她为第 \(i\) 块地选定方法并在所有重复实验中对该地块使用同一方法,则 \(X_i\) 在样本之间不变——\(X\) 在重复实验(重复抽样)中固定,\(X_i\) 非随机(尽管 \(Y_i\) 随机),抽样方案不是 i.i.d.。本章针对 i.i.d. 回归变量得到的结果对非随机回归变量同样成立,但非随机回归变量是相当特殊的情形;现代实验规程会让园艺学家用计算机随机数生成器分配 \(X\),以规避可能的偏误(她可能在日照最好的地块用自己最喜欢的方法),此时 \(X\) 随机,\((X_i,Y_i)\) i.i.d.。(b) 时间序列:同一单位随时间的观测,如某企业的库存水平(\(Y\))与其借款利率(\(X\)),每季度记录、共 30 年。时间序列的关键特征是时间上相近的观测不独立而是相关(现在利率低,下季度很可能也低),违背 i.i.d. 的“独立”部分。时间序列的复杂性留到第 15 章处理。
假设 3:大离群值不太可能。大离群值指 \(X_i\)、\(Y_i\) 或两者远超出数据通常范围的观测,会使 OLS 结果误导。Figure 4.4(假想数据):含一个离群值时 OLS 回归线显示 \(X\) 与 \(Y\) 强正相关,去掉它后回归线显示没有关系。本书将该假设精确化为 \(X\) 与 \(Y\) 有非零有限四阶矩:\(0<E(X_i^4)<\infty\),\(0<E(Y_i^4)<\infty\);等价地,\(X\) 与 \(Y\) 峰度有限。有限峰度用于证明 OLS 检验统计量分布的大样本近似;第 3 章样本方差一致性证明(附录 3.3)中对 \(\frac1n\sum Y_i^2\) 应用 LLN 就需要四阶矩有限。
- 离群值的来源之一是数据录入错误(打字错误、不同观测用了不同单位,如学生身高以米记录却误把一人记为厘米)。发现离群值的方法之一是画图。若确定是录入错误,则更正;无法更正则删除该观测。
- 除录入错误外,有限峰度在许多经济数据应用中是合理的:班级规模受教室容量限制;标准化考试最好全对、最差全错;二者取值范围有限,峰度必然有限。常用分布如正态有四阶矩;但数学上有些分布四阶矩无穷,该假设排除了它们。若四阶矩有限,则 OLS 推断不太可能被少数观测主导。
Key Concept 4.3 因果推断的最小二乘假设:\(Y_i=\beta_0+\beta_1X_i+u_i\),\(i=1,\dots,n\),其中 \(\beta_1\) 是 \(X\) 对 \(Y\) 的因果效应,且:
- 误差项给定 \(X_i\) 的条件均值为 0:\(E(u_i\mid X_i)=0\);
- \((X_i,Y_i)\),\(i=1,\dots,n\) 是来自其联合分布的独立同分布抽样;
- 大离群值不太可能:\(X_i\) 与 \(Y_i\) 有非零有限四阶矩。
最小二乘假设的双重作用:(1) 数学作用:若假设成立,大样本下 OLS 估计量一致且抽样分布正态(4.5 节),这是用 OLS 做假设检验和构造置信区间的基础。(2) 组织作用:梳理使 OLS 估计因果效应 \(\beta_1\) 遇到困难的情形。实践中第一个假设最重要;第 6 章讨论其不成立的一个原因(遗漏变量),9.2 节讨论更多原因。第二个假设在很多横截面数据中合理,但对面板和时间序列数据不适用,需修改方法(第 10 章与第 15–17 章)。第三个假设提醒 OLS 与样本均值一样对大离群值敏感;数据含离群值时应仔细检查其是否正确记录、是否属于该数据集。Key Concept 4.3 适用于以估计因果效应为目标的情形;附录 4.4 给出平行的预测用最小二乘假设。
4.5 OLS 估计量的抽样分布(PDF p.162–165)
\(\hat\beta_0\)、\(\hat\beta_1\) 由随机样本计算,本身是随机变量,其概率分布(抽样分布)描述在不同可能随机样本上可能取的值。小样本时复杂,大样本时由 CLT 近似正态。
回顾 \(\bar Y\):\(\bar Y\) 随样本变化;小样本时抽样分布复杂,但对所有 \(n\) 都有 \(E(\bar Y)=\mu_Y\)(无偏);\(n\) 大时由 CLT 近似正态。
\(\hat\beta_0\) 与 \(\hat\beta_1\) 的抽样分布:同理,在 Key Concept 4.3 的假设下,对所有 \(n\),
Key Concept 4.4 \(\hat\beta_0\) 与 \(\hat\beta_1\) 的大样本分布:若 Key Concept 4.3 的最小二乘假设成立,则大样本下 \(\hat\beta_0\)、\(\hat\beta_1\) 联合正态。\(\hat\beta_1\sim N(\beta_1,\sigma^2_{\hat\beta_1})\),
需要多大的 \(n\)? 2.6 节建议 \(n=100\) 时 \(\bar Y\) 的正态近似已足够好,有时更小也行;这一标准延续到回归中更复杂的平均值。几乎所有现代计量应用 \(n>100\),因此除非有充分理由,否则视 OLS 估计量的正态近似为可靠。
推论 1:一致性。\(\sigma^2_{\hat\beta_0}\)、\(\sigma^2_{\hat\beta_1}\) 分母中有 \(n\),随 \(n\) 增大趋于 0,大样本下 OLS 分布紧密集中于 \(\beta_0\)、\(\beta_1\),即 OLS 估计量一致。
推论 2:\(X\) 的方差越大,\(\hat\beta_1\) 越精确。(4.19) 中 \(\hat\beta_1\) 的方差与 \(X_i\) 方差的平方成反比。Figure 4.5:150 个人工数据点,彩色点是最接近 \(\bar X\) 的 75 个观测(\(X\) 在 97–103 之间,方差小),黑点是其余(方差大);要尽可能准确地穿过彩色点或黑点画直线,穿过黑点更容易——回归变量分布越分散,斜率估计越精确。
推论 3:误差方差越小,\(\hat\beta_1\) 越精确。\(u_i\) 只出现在 (4.19) 的分子;若所有 \(u_i\) 缩小一半而 \(X\) 不变,则 \(\sigma_{\hat\beta_1}\) 缩小一半、\(\sigma^2_{\hat\beta_1}\) 缩小到 1/4(习题 4.13)。直观:误差小则数据更紧密地围绕总体回归线,斜率估计更精确。
OLS 抽样分布的正态近似是强大工具:仅用一个样本就能对回归系数的真实总体值作推断。
4.6 结论(PDF p.165)
本章用 OLS 由 \(n\) 个观测估计总体回归线的截距和斜率;样本回归线可用于给定 \(X\) 预测 \(Y\)。当 \(\beta_1\) 定义为 \(X\) 变化一单位对 \(Y\) 的因果效应且因果推断的最小二乘假设成立时,OLS 斜率和截距估计量无偏、一致,抽样分布方差与 \(n\) 成反比,\(n\) 大时抽样分布正态。第一个假设:误差项给定 \(X\) 的条件均值为 0,若 \(X\) 在实验中随机分配或在观测数据中仿佛随机分配则成立,此时 OLS 是因果效应的无偏估计。第二个假设:\((X_i,Y_i)\) i.i.d.(简单随机抽样即满足),由此得到 Key Concept 4.4 的方差公式。第三个假设:大离群值不太可能(四阶矩/峰度有限),因为存在大离群值时 OLS 不可靠。三者合起来保证 OLS 大样本正态。但这些结果本身还不足以检验 \(\beta_1\) 的假设或构造置信区间,还需要抽样分布标准差的估计量——OLS 估计量的标准误,这是第 5 章的内容。
第 4 章小结、关键术语与习题概览(PDF p.166–172)
小结:(1) 总体回归线 \(\beta_0+\beta_1X\) 是 \(Y\) 的均值作为 \(X\) 的函数;斜率是 \(X\) 相差一单位的两个观测 \(Y\) 的期望差;截距决定回归线高度。(2) 可用 OLS 由样本估计总体回归线,估计量记为 \(\hat\beta_0\)、\(\hat\beta_1\),预测值 \(\hat\beta_0+\hat\beta_1X\)。(3) \(R^2\) 与 SER 度量 \(Y_i\) 离估计回归线多近;\(R^2\in[0,1]\),越大越接近;SER 估计回归误差的标准差。(4) 用线性回归估计因果效应的三个关键假设:误差给定回归变量的条件均值为 0;样本观测 i.i.d.;大离群值不太可能。若成立,OLS 估计量 \(\hat\beta_1\) 是因果效应 \(\beta_1\) 的无偏、一致估计,大样本下正态。 关键术语:因果推断、预测、单一回归变量线性回归模型、因变量、自变量、回归变量、总体回归线/函数、截距、斜率、系数、参数、误差项、OLS 估计量、OLS 回归线、样本回归线/函数、预测值、残差、回归 \(R^2\)、ESS、TSS、SSR、SER、样本内预测、样本外预测、最小二乘假设。
复习题(4.1–4.4):什么是线性回归模型、系数度量什么、OLS 是什么;误差项含义及估计 OLS 时对误差项的假设;\((X_i,Y_i)\) i.i.d. 的含义、为何重要、何时可能被违背;区分 \(R^2\) 与 SER。
习题(4.1–4.15)题型:
- 读回归结果做预测与反推:4.1(50 个三年级班级,\(\widehat{TestScore}=640.3-4.93\times CS\),\(R^2=0.11\),\(SER=8.7\):班级 25 人的预测;从 21 人变 24 人的预测变化;已知平均班级规模 22.8 反推平均成绩(回归线过均值点);由 \(R^2\) 与 SER 反推成绩样本标准差——\(SER^2\approx(1-R^2)s_Y^2\));4.2(100 名 20 岁男性体重对身高:\(\widehat{Weight}=-79.24+4.16\times Height\),\(R^2=0.72\),\(SER=12.6\),单位磅/英寸;预测 64/68/72 英寸体重;长高 2 英寸的体重变化;换成厘米与千克后的所有回归统计量);4.3(月支出对月收入:\(\widehat{AME}=710.7+8.8\times AMI\),\(R^2=0.030\),\(SER=540.30\);系数含义、SER 与 \(R^2\) 的单位、样本范围外(收入 200 万欧元)预测是否可靠——外推风险、收入右偏误差是否可能正态)。
- 单位变换:4.4(温度从摄氏改为华氏 \(X_F=32+\frac95X_C\),截距、斜率、\(R^2\) 如何变——斜率除以 9/5,截距调整,\(R^2\) 不变)。
- 随机实验与回归:4.5(200 名参与者通过抛硬币随机分配 60 或 75 分钟午睡,回归记忆测试成绩 \(Y\) 对睡眠时长 \(X\);\(u_i\) 含义、\(E(u_i\mid X_i)\) 与无偏性、依从性(compliance)问题;估计 \(\hat Y=55+0.17X\),预测 60/75/90 分钟的平均成绩(90 分钟为外推)及多睡 5 分钟的增益 0.85 分)。
- 证明与推导:4.6(\(E(u_i\mid X_i)=0\Rightarrow E(Y_i\mid X_i)=\beta_0+\beta_1X_i\));4.7(\(\hat\beta_0\) 无偏);4.8(若 \(E(u_i\mid X_i)=2\),\(\hat\beta_1\) 的分布不变而 \(\hat\beta_0\) 有偏 2——常数条件均值只影响截距);4.9(\(\hat\beta_1=0\Rightarrow R^2=0\),反之亦然);4.10(\(X\) 伯努利 0.3,\(X=1\) 时 \(u\sim N(0,3)\)、\(X=0\) 时 \(u\sim N(0,2)\) 的异方差模型满足最小二乘假设,并推导 \(\hat\beta_1\) 大样本方差);4.11(已知 \(\beta_0=0\) 或 \(\beta_0=4\) 时的最小二乘斜率公式,即过原点回归 \(\hat\beta_1=\sum X_iY_i/\sum X_i^2\) 及其平移版);4.12(\(R^2=r_{XY}^2\);\(Y\) 对 \(X\) 与 \(X\) 对 \(Y\) 回归的 \(R^2\) 相同;\(\hat\beta_1=r_{XY}(s_Y/s_X)\));4.13(误差放大 \(k\) 倍则方差乘 \(k^2\));4.14(样本回归线过 \((\bar X,\bar Y)\));4.15(需附录 4.4:样本外观测来自同一总体时 OLS 预测无偏且 \(\operatorname{var}(\hat u^{oos})=\operatorname{var}(u^{oos})+\operatorname{var}(\hat\beta_0+\hat\beta_1X^{oos})\);来自不同总体时预测一般有偏)。
- 实证题:E4.1(Growth 数据:65 国 1960–1995 年平均增长率与平均贸易份额 TradeShare,数据来自 Beck、Levine、Loayza (2000, JFE);散点图、马耳他是否离群值、含与不含马耳他的回归与预测(贸易份额 0.5、1.0),解释为何含马耳他的回归线更陡,讨论是否应剔除);E4.2(Earnings_and_Height 数据,来自 Case & Paxson (2008, JPE):身高中位数;身高 ≤67 英寸与 >67 英寸工人平均收入差及 95% 区间;散点图中收入只有 23 个不同值的原因(收入按区间编码);收入对身高回归及 65/67/70 英寸预测;身高改为厘米后的斜率、截距、\(R^2\)、SER;分男女回归;身高是否与其他影响收入的因素相关(\(E(u\mid Height)=0\) 是否成立))。
附录 4.1 加州考试成绩数据集(PDF p.173)
加州标准化测试与报告(STAR)数据集,含考试表现、学校特征和学生人口背景。使用 1999 年有数据的全部 420 个 K–6 与 K–8 学区。成绩为五年级学生斯坦福 9 成就测验阅读与数学平均分。学校特征(学区平均)包括入学人数、教师数(全职当量)、每教室电脑数、生均支出。师生比 = 学区学生数 / 全职当量教师数。学生人口变量(学区平均)包括参加公共援助项目 CalWorks(原 AFDC)的学生比例、有资格获得减价午餐的学生比例、英语学习者比例。数据来自加州教育部。
附录 4.2 OLS 估计量的推导(PDF p.173–174)
最小化 (4.4),对 \(b_0\)、\(b_1\) 求偏导:
附录 4.3 OLS 估计量的抽样分布(PDF p.174–177)
用回归变量与误差表示 \(\hat\beta_1\):由 \(Y_i=\beta_0+\beta_1X_i+u_i\) 得 \(Y_i-\bar Y=\beta_1(X_i-\bar X)+(u_i-\bar u)\),于是
无偏性证明(用迭代期望):对 (4.28) 取给定 \(X_1,\dots,X_n\) 的条件期望:
大样本正态性:考察 (4.28) 最后一项。分子:\(\bar X\) 一致,大样本时 \(\bar X\approx\mu_X\),分子近似为 \(\bar v=\frac1n\sum v_i\),\(v_i=(X_i-\mu_X)u_i\)。由假设 1,\(E(v_i)=0\);由假设 2,\(v_i\) i.i.d.;由假设 3,\(\sigma_v^2=\operatorname{var}[(X_i-\mu_X)u_i]\) 非零有限。满足 CLT,故 \(\bar v/\sigma_{\bar v}\to N(0,1)\),\(\sigma^2_{\bar v}=\sigma_v^2/n\),即 \(\bar v\approx N(0,\sigma_v^2/n)\)。分母:\(X\) 的样本方差(除以 \(n\) 而非 \(n-1\),大样本无关紧要),由 (3.8) 一致收敛于 \(\operatorname{var}(X_i)\)。合并:大样本下 \(\hat\beta_1-\beta_1\approx\bar v/\operatorname{var}(X_i)\),故 \(\hat\beta_1\sim N(\beta_1,\sigma^2_{\hat\beta_1})\),\(\sigma^2_{\hat\beta_1}=\operatorname{var}(\bar v)/[\operatorname{var}(X_i)]^2=\operatorname{var}[(X_i-\mu_X)u_i]/\{n[\operatorname{var}(X_i)]^2\}\),即 (4.19)。
OLS 的其他代数性质:
附录 4.4 用于预测的最小二乘假设(PDF p.177–178)
与因果效应估计的假设平行。差别源于两类问题的不同:估计因果效应要求 \(X\) 随机或仿佛随机分配(Key Concept 4.3 假设 1);预测的目标是准确的样本外预测,要求估计的回归线与被预测观测相关——即估计数据与被预测观测来自同一总体分布。回到督学与父亲:督学关心 STR 变化对成绩的因果效应,理想情况下需要学生被随机分到不同规模班级的实验数据;没有实验时她能否满意于用加州数据做的回归,取决于在 \(\beta_1\) 定义为因果效应时假设 1 是否成立。父亲则想预测加州某个未报告成绩的学区,他关心的是加州 TestScore 与 STR 之间的总体回归线,其斜率可能是也可能不是因果效应。
记 \((X^{oos},Y^{oos})\) 为待预测的样本外(out-of-sample, oos)观测,\((X_i,Y_i)\) 为估计数据。预测的最小二乘假设:\(E(Y\mid X)=\beta_0+\beta_1X\),\(u=Y-E(Y\mid X)\),且
- \((X^{oos},Y^{oos})\) 与 \((X_i,Y_i)\) 从同一总体分布中随机抽取;
- \((X_i,Y_i)\),\(i=1,\dots,n\) i.i.d.;
- 大离群值不太可能:\(X_i\)、\(Y_i\) 有非零有限四阶矩。
与 Key Concept 4.3 的两点差别:(i) \(\beta_1\) 的定义:最佳预测(按均方预测误差,附录 2.2)是 \(E(Y\mid X)\),在线性假设下预测用的 \(\beta_1\) 定义为该条件期望的斜率,可能是也可能不是因果效应;(ii) 由于回归线用样本内观测估计、却用来预测样本外观测,第一个假设要求二者来自同一总体。第二、三个假设与因果情形相同,保证 OLS 对总体预测线系数一致、大样本正态。
OLS 预测无偏:
SER 估计样本外预测误差:样本外预测误差分解为系数已知时的误差与估计系数带来的误差:
第 4 章本章要点
- 回归的两种用途:因果推断(督学问题)与预测(父亲问题),对数据的要求不同。
- 模型 \(Y_i=\beta_0+\beta_1X_i+u_i\);总体回归线 = 条件均值 \(E(Y\mid X)\);截距常无实际含义。
- OLS 最小化残差平方和:\(\hat\beta_1=s_{XY}/s_X^2\),\(\hat\beta_0=\bar Y-\hat\beta_1\bar X\);回归线过 \((\bar X,\bar Y)\)。
- 加州数据:\(\widehat{TestScore}=698.9-2.28\times STR\),\(R^2=0.051\),\(SER=18.6\);样本相关 −0.23。
- \(R^2=ESS/TSS=1-SSR/TSS=r_{XY}^2\);\(SER=\sqrt{SSR/(n-2)}\);低 \(R^2\) 不说明回归好坏。
- 样本内 vs 样本外预测;预测报告为 \(\hat Y\pm SER\)。
- 因果推断三假设:\(E(u_i\mid X_i)=0\)(最关键,对应随机/仿佛随机分配)、i.i.d.、四阶矩有限(离群值不太可能)。
- OLS 无偏、一致、大样本正态,\(\sigma^2_{\hat\beta_1}=\frac1n\frac{\operatorname{var}[(X_i-\mu_X)u_i]}{[\operatorname{var}(X_i)]^2}\);\(X\) 越分散、误差越小、\(n\) 越大,斜率越精确。
- 预测假设只要求样本内外同分布,\(E(u\mid X)=0\) 按定义成立。
- OLS 代数性质:残差和为 0、残差与回归变量正交、TSS = ESS + SSR。
与量化交易的关联
- Beta 估计与 CAPM:“股票的 Beta”专栏直接对应量化中最基本的回归——用 OLS 将个股超额收益对市场超额收益回归得 beta(时间序列回归,截距即 Jensen's alpha)。推广到多因子(Fama-French 三因子、五因子、Barra 风险模型)就是第 6 章的多元回归。实务注意:时间序列收益不满足 i.i.d.(波动聚集),beta 随时间变化(需滚动窗口或卡尔曼滤波),且厚尾与离群值(假设 3)会显著影响 OLS beta,常用 Vasicek/Blume 收缩或稳健回归。
- 预测 vs 因果:附录 4.4 是量化预测建模的理论基础:收益预测模型不需要因果解释,但要求训练样本与应用样本同分布——市场体制变化、结构突变、非平稳会破坏这一前提,这是回测到实盘衰减的根源。因果推断视角则用于评估交易成本、市场冲击、政策事件等需要“干预效应”的问题。
- \(R^2\) 的解读:收益预测回归的 \(R^2\) 通常极低(日频 <1%),但低 \(R^2\) 不代表无经济价值;SER 衡量预测误差的典型大小。样本内 \(R^2\) 高不代表样本外表现好(第 14 章与过拟合)。
- 斜率精度:\(\operatorname{var}(\hat\beta_1)\propto\sigma_u^2/(n\operatorname{var}(X))\) 解释了为何:估计 beta 需要足够长的样本;因子暴露分散度大的截面回归(Fama-MacBeth)中因子收益估计更精确;噪声大的日内收益需要更多观测。
- 离群值敏感性(Figure 4.4、E4.1 马耳他):金融数据中的极端日(如瑞郎脱钩日)、错误报价、拆股未复权等数据错误会严重扭曲 OLS 估计;量化数据清洗中的去极值(winsorize)、MAD 截尾、稳健回归正源于此。
- 异方差稳健方差:(4.19) 的形式就是 White 异方差稳健标准误的理论来源,因子回归与 beta 估计中应默认使用(第 5 章)。
- 正规方程与 OLS 代数:残差与回归变量正交是因子中性化(对行业/市值回归取残差得到中性化因子)的数学基础——中性化后的因子与被中性化的暴露样本相关为零。
- 单位变换不变性(习题 4.2、4.4、E4.2):系数随单位缩放,\(R^2\) 与 t 值不变;对应因子标准化(z-score)后系数可比较。
推荐习题
- 4.1(由 \(R^2\)、SER 和均值反推样本统计量):熟练掌握 OLS 公式与拟合度关系。
- 4.12(\(R^2=r^2\)、\(\hat\beta_1=r\,s_Y/s_X\)):联系相关系数与回归斜率,对应 beta \(=\rho\,\sigma_i/\sigma_m\)。
- 4.8(条件均值为非零常数只影响截距):理解截距吸收常数偏差,对应 alpha 与误差均值。
- 4.10(异方差模型下的大样本方差推导):为第 5 章异方差稳健标准误做准备。
- 4.11(过原点回归):对应无截距的因子模型与 CAPM 检验。
- 4.15(样本外预测误差分解):理解预测误差 = 内在噪声 + 估计误差,以及分布漂移导致预测偏差。
- E4.1(离群值马耳他对斜率的影响):数据清洗与稳健性检验的实操。
- 4.5(随机实验中的回归):随机分配下 OLS 估计因果效应的直观例子。