第 04 章 单变量线性回归
学习目标
读完本章,你应当能够:
- 写出单变量线性回归模型 \(Y_i=\beta_0+\beta_1X_i+u_i\),解释总体回归线、斜率、截距与误差项的含义,并说明总体回归线就是条件均值 \(E(Y\mid X)\) 的线性形式。
- 从「最小化残差平方和」推导 OLS 估计量 \(\hat\beta_1=s_{XY}/s_X^2\)、\(\hat\beta_0=\bar Y-\hat\beta_1\bar X\),并掌握 OLS 的代数性质(残差均值为零、残差与回归变量正交、\(TSS=ESS+SSR\))。
- 计算和解读 \(R^2\) 与回归标准误 SER,知道低 \(R^2\) 说明什么、不说明什么。
- 陈述因果推断的三条最小二乘假设,理解第一条 \(E(u_i\mid X_i)=0\) 为什么是「随机分配」的回归语言,以及为什么它最关键。
- 推导 OLS 估计量的无偏性和大样本正态分布,写出 \(\operatorname{var}(\hat\beta_1)\) 的公式,并说出决定斜率估计精度的三个因素。
- 区分「用回归估计因果效应」和「用回归做预测」对数据的不同要求,并把这些要求对应到 beta 估计、因子研究和收益预测上。
读前导读
这一章在解决什么问题。 单变量回归你在 CFA 二级已经很熟:\(Y=b_0+b_1X+\varepsilon\),斜率 \(b_1=\operatorname{cov}(X,Y)/\operatorname{var}(X)\),会读 \(R^2\)、SEE(本书叫 SER),也背过「线性、误差独立、同方差、正态」等假设。CFA 教的是「拿到输出怎么读」,本章讲的是「输出为什么是这样」。具体多出三块:
- 推导:OLS 公式从「残差平方和最小」一步步解出来(4.2.2);\(TSS=ESS+SSR\) 为什么成立(4.3.1);以及最关键的,把估计量写成「真值 + 噪声」(4.5.1),由此推出无偏性和大样本正态性。
- 假设的取舍和失效后果:CFA 的假设清单里有「误差正态」「同方差」,本书去掉了这两条,换成三条:\(E(u\mid X)=0\)、i.i.d.、四阶矩有限。你会看到第一条才是决定估计「对不对」的关键,失效时 OLS 有偏且样本再大也纠正不了;同方差、正态只影响「标准误怎么算」,不影响估计本身。
- 稳健的方差公式:Key Concept 4.4 给出的 \(\hat\beta_1\) 方差公式不假设同方差。CFA 里的标准误公式只是它在同方差下的特例。第 5 章的异方差稳健标准误就是把这个公式里的总体量换成样本量。
此外,本章把同一条回归分成「因果用途」和「预测用途」,两种用途需要的假设不同。估计 beta、做因子预测属于后者,评估自己交易的冲击属于前者。
需要先想起来的数学。
- 偏导数:多变量函数对其中一个变量求导,其他变量当常数。例如 \(f(b_0,b_1)=(5-b_0-2b_1)^2\),对 \(b_0\) 求偏导得 \(-2(5-b_0-2b_1)\),对 \(b_1\) 求偏导得 \(-4(5-b_0-2b_1)\)(链式法则:内层对 \(b_1\) 的导数是 \(-2\))。最小值处所有偏导数都为 0。见 第 00 册第 05 章 多元微积分与优化。
- 链式法则:\(\frac{d}{db}g(h(b))=g'(h(b))\,h'(b)\)。对 \((Y_i-b_0-b_1X_i)^2\) 求导,外层平方给出 \(2(\cdot)\),内层给出 \(-1\) 或 \(-X_i\)。见 第 00 册第 02 章 导数与泰勒展开。
- 离差和的恒等式:\(\sum(X_i-\bar X)=0\),以及 \(\sum(X_i-\bar X)(Y_i-\bar Y)=\sum(X_i-\bar X)Y_i=\sum X_iY_i-n\bar X\bar Y\)。例如 \(X=(1,2,3)\),\(Y=(2,2,5)\):\(\sum(X_i-\bar X)Y_i=(-1)(2)+0+(1)(5)=3\),\(\sum X_iY_i-n\bar X\bar Y=21-3\times2\times3=3\)。本章几乎所有代数推导都靠这几条。见 第 00 册第 07 章 概率中的分析工具。
- 条件期望与迭代期望:\(E(\cdot\mid X_1,\dots,X_n)\) 表示「把所有 \(X\) 当已知数」时的期望,再用 \(E[E(\cdot\mid X)]\) 还原成无条件期望。第 2 章 2.3.2 节已复习。
- LLN、CLT 与「依概率收敛的商」:若分子近似正态、分母收敛到常数,则整个分式近似正态(Slutsky 定理的直观版)。见 第 00 册第 07 章 中「收敛的几种说法」。
怎么读这一章。 核心必读是 4.2.2(OLS 推导)、4.4(三条假设,尤其假设 1)和 4.5.1–4.5.4(抽样分布)。其中 4.5.1 那个方框公式是全册最重要的式子之一,后面讲遗漏变量偏误、工具变量时都会回到它。4.0、4.1、4.2.3–4.2.5 是你熟悉的内容,可以快读。4.3 中的四步代数证明第一次可以只看结论,记住「残差与常数项、与 \(X\) 都正交」即可。4.6 篇幅不长,但它说明了因子研究真正依赖的假设,建议读完 4.5 再读。量化实战第 2、3 点(估计窗口与精度、因子中性化)和代码第 3 段(离群值的杠杆)非常贴近日常工作。
4.0 同一组数据,两个不同的问题
原书用两个人物开场。
- 一位学区督学要决定是否增聘教师。这会让师生比降低 2,但要花钱。她问:班级规模减少 2 人,会让考试成绩提高多少? 这是因果推断(causal inference):估计一个干预对结果的效应。
- 一位父亲想搬到学校好的城镇。某学区的成绩没有公布,但他知道师生比。他问:知道班级规模,能预测这个学区的成绩吗? 这是预测(prediction):用一个变量的观测值推断另一个变量。
两个问题都关于师生比 \(X\) 与成绩 \(Y\) 的关系,用的工具都是线性回归,但它们对数据的要求不同。督学需要 \(X\) 是随机分配或「仿佛随机分配」的;父亲只需要待预测的学区与估计用的学区来自同一总体。本章先建立模型和估计方法(4.1–4.3),再分别讨论两类用途需要的假设(4.4、4.6),中间推导 OLS 估计量的抽样分布(4.5)。
这个区分对量化读者特别重要。估计一只股票的 beta、研究一个因子的预测力,本质上属于「父亲的问题」;评估自己的交易对价格的冲击,属于「督学的问题」。混淆二者是很多错误结论的来源。
4.1 线性回归模型
4.1.1 从条件均值出发
第 2 章说过,平方损失下最好的预测是条件均值 \(E(Y\mid X)\)。\(X\) 能取很多值时,最简单的建模起点是假设它是线性的:
若 \(\beta_0=720\)、\(\beta_{ClassSize}=-0.6\),则班级规模 20 的学区预测成绩为 \(720-0.6\times20=708\)。
这条线只给出某个班级规模下的平均成绩。同样班级规模的学区在教师质量、学生构成、考试运气上各不相同,所以单个学区的成绩会偏离这条线:
4.1.2 模型与术语
用一般记号,第 \(i\) 个观测满足
Key Concept 4.1 单变量线性回归模型的术语
- \(Y_i\):因变量(dependent variable),也叫被回归变量(regressand)、左侧变量;
- \(X_i\):自变量(independent variable),也叫回归变量(regressor)、右侧变量;
- \(\beta_0+\beta_1X\):总体回归线(population regression line)或总体回归函数;
- \(\beta_0\):截距(intercept);\(\beta_1\):斜率(slope);二者统称系数(coefficients)或参数(parameters);
- \(u_i\):误差项(error term)。
斜率 \(\beta_1\) 是 \(X\) 相差一个单位的两个观测之间 \(Y\) 的期望差。截距 \(\beta_0\) 是 \(X=0\) 时总体回归线的值。有时截距有经济含义(例如 CAPM 回归中的 alpha);有时没有——在班级规模回归里,截距严格说是「一个班没有学生时的期望成绩」,这时只把它看作决定回归线高度的参数即可。
误差项 \(u_i\) 包含除 \(X_i\) 以外所有影响 \(Y_i\) 的因素:教师质量、教材、学生家庭背景、考试当天的发挥、记分错误等。在预测问题里,\(u_i\) 就是 \(Y_i\) 与总体回归线预测值之差。
图示(原书 Figure 4.1):7 个假想学区的散点与一条向下倾斜的总体回归线(\(\beta_1<0\))。点到线的垂直距离就是 \(u_i\):点在线上方,成绩好于预测,\(u_i>0\);在下方则 \(u_i<0\)。
4.2 估计系数:普通最小二乘
4.2.1 数据
原书数据是 1999 年加州 420 个 K–8 学区:成绩为五年级学生阅读与数学的平均分,班级规模用师生比(student–teacher ratio, STR)衡量,即学生数除以全职当量教师数。
| 均值 | 标准差 | 10% | 25% | 50% | 75% | 90% | |
|---|---|---|---|---|---|---|---|
| 师生比 | 19.6 | 1.9 | 17.3 | 18.6 | 19.7 | 20.9 | 21.9 |
| 成绩 | 654.2 | 19.1 | 630.4 | 640.0 | 654.5 | 666.7 | 679.1 |
散点图显示两者的样本相关为 \(-0.23\):班级大的学区成绩倾向更低,但点很分散。要穿过这些点画一条直线,目测不科学,每个人画得都不一样。最常用的方法是普通最小二乘(ordinary least squares, OLS)。
4.2.2 OLS 估计量
第 3 章里,\(\bar Y\) 是使 \(\sum(Y_i-m)^2\) 最小的 \(m\)。OLS 把这个想法推广到直线:对候选系数 \(b_0,b_1\),第 \(i\) 个预测错误是 \(Y_i-b_0-b_1X_i\),选 \(b_0,b_1\) 使错误平方和最小:
没有 \(X\) 时,这就退化为第 3 章的问题。
推导(原书附录 4.2)。对 \(b_0\)、\(b_1\) 求偏导并令其为零:
除以 \(n\) 得到正规方程(normal equations):
由第一式 \(\hat\beta_0=\bar Y-\hat\beta_1\bar X\),代入第二式:
推导拆解:
- 求偏导:\(\sum(Y_i-b_0-b_1X_i)^2\) 是 \(n\) 个平方之和,逐项求导再相加。对 \(b_0\):每项外层给 \(2(Y_i-b_0-b_1X_i)\),内层对 \(b_0\) 的导数是 \(-1\),所以合计 \(-2\sum(Y_i-b_0-b_1X_i)\)。对 \(b_1\):内层对 \(b_1\) 的导数是 \(-X_i\),所以多乘一个 \(X_i\)。
- 得到正规方程:令两式为 0,两边除以 \(-2n\)。第一式中 \(\frac1n\sum b_0=b_0\),\(\frac1n\sum Y_i=\bar Y\),于是 \(\bar Y-\hat\beta_0-\hat\beta_1\bar X=0\)。第二式同理,把每一项都除以 \(n\)。
- 消去 \(\hat\beta_0\):把 \(\hat\beta_0=\bar Y-\hat\beta_1\bar X\) 代入第二式,得 \(\frac1n\sum X_iY_i-(\bar Y-\hat\beta_1\bar X)\bar X-\hat\beta_1\frac1n\sum X_i^2=0\)。把含 \(\hat\beta_1\) 的项移到一边:\(\hat\beta_1\big(\frac1n\sum X_i^2-\bar X^2\big)=\frac1n\sum X_iY_i-\bar X\bar Y\),除过去就是第一个等号。
- 换成离差形式:\(\frac1n\sum X_iY_i-\bar X\bar Y=\frac1n\sum(X_i-\bar X)(Y_i-\bar Y)\),这是「协方差 = 乘积的均值 − 均值的乘积」;分母同理是 \(X\) 的方差。分子分母的 \(\frac1n\) 约掉,得到第二个等号。
- 为什么是最小值:目标函数是 \(b_0,b_1\) 的二次函数,形状像一只朝上的碗(只要 \(X_i\) 不全相等),驻点就是唯一的最小值。 这正是 CFA 中 \(b_1=\operatorname{cov}(X,Y)/\operatorname{var}(X)\) 的来历:它不是定义出来的,而是「平方误差最小」这个目标解出来的。
Key Concept 4.2 OLS 估计量、预测值与残差
\[\hat\beta_1=\frac{\sum_{i=1}^n(X_i-\bar X)(Y_i-\bar Y)}{\sum_{i=1}^n(X_i-\bar X)^2}=\frac{s_{XY}}{s_X^2},\qquad \hat\beta_0=\bar Y-\hat\beta_1\bar X,\]\[\hat Y_i=\hat\beta_0+\hat\beta_1X_i\ \ (\textbf{预测值 predicted value}),\qquad \hat u_i=Y_i-\hat Y_i\ \ (\textbf{残差 residual}).\]
两条直观:斜率 = 样本协方差 / 回归变量样本方差;回归线必经过均值点 \((\bar X,\bar Y)\)。\(\hat\beta_0+\hat\beta_1X\) 称为 OLS 回归线或样本回归线。要分清三组「总体 vs 样本」对应:\(\beta_0,\beta_1\) 与 \(\hat\beta_0,\hat\beta_1\);总体回归线与 OLS 回归线;误差 \(u_i\) 与残差 \(\hat u_i\)。误差永远观测不到,残差是可以算出来的。
由 \(s_{XY}=r_{XY}s_Xs_Y\),还可写成
这就是金融里熟悉的 \(\beta=\rho\,\sigma_i/\sigma_m\)。
4.2.3 加州数据的结果
用 420 个观测估计得
解读:比较师生比相差 1 的两个学区,班级大的那个平均成绩低 2.28 分;相差 2 则低 4.56 分。预测:师生比 20 的学区,预测成绩 \(698.9-2.28\times20=653.3\)。
这个斜率大还是小? 师生比差 2 在这份数据里很大,约等于中位数(19.7)到 10 分位数(17.3)的距离;但对应的 4.56 分成绩差相对成绩分布很小,略小于中位数(654.5)到 60 分位数(659.4)的距离。换句话说,大幅缩小班级只对应较小的预测成绩变化。(这还只是相关关系,能否解释为因果要看 4.4 节。)
4.2.4 为什么用 OLS
- 实践原因:OLS 是经济学、金融和社会科学回归分析的共同语言,几乎所有软件都内置;用它报告结果,别人才能读懂和比较。
- 理论原因:在 4.4 节的假设下 OLS 无偏、一致;在附加条件下(同方差),它在一类线性无偏估计量中最有效——即高斯-马尔可夫定理(本册第 5 章)。
4.2.5 专栏:股票的 Beta
现代金融的基本思想是:投资者需要回报才愿承担风险,所以风险资产的期望超额收益 \(R-R_f\) 应为正。但单只股票的方差大部分可以靠分散化消除(第 2 章),所以真正需要补偿的风险不是方差,而是与市场的协方差。资本资产定价模型(capital asset pricing model, CAPM)把这一思想写成
其中 \(R_m\) 是市场组合的期望收益,\(\beta\) 是 \(R-R_f\) 对 \(R_m-R_f\) 的总体回归系数。\(\beta<1\) 的股票风险低于市场、期望超额收益较低;\(\beta>1\) 则反之。实践中用股票实际超额收益对宽基指数实际超额收益做 OLS 回归来估计 beta,无风险利率常取短期国债利率。原书给出的估计值(来源 finance.yahoo.com):
| 公司(行业) | Beta |
|---|---|
| Wal-Mart(折扣零售) | 0.1 |
| Coca-Cola(软饮料) | 0.6 |
| Verizon(电信) | 0.7 |
| Google(信息技术) | 1.0 |
| General Electric(工业) | 1.1 |
| Boeing(飞机) | 1.3 |
| Bank of America(银行) | 1.7 |
必需消费品 beta 低,银行等周期性行业 beta 高。收益的定义:价格变化加分红,除以初始价格。例如 100 美元买入,年内分红 2.50 美元,年末 105 美元卖出,\(R=(5+2.5)/100=7.5\%\)。
4.3 拟合度与预测精度
估计出回归线后,自然要问:它对数据描述得多好?两个指标回答这个问题。
4.3.1 \(R^2\)
每个观测可以拆成预测值加残差:\(Y_i=\hat Y_i+\hat u_i\)。定义三个平方和:
分别是总平方和(total sum of squares)、解释平方和(explained sum of squares)和残差平方和(sum of squared residuals)。回归 \(R^2\) 是 \(Y\) 的样本变动中被 \(X\) 解释的比例:
第二个等号依赖分解 \(TSS=ESS+SSR\),它来自 OLS 的代数性质(原书附录 4.3):
证明要点:
- 残差可写成 \(\hat u_i=(Y_i-\bar Y)-\hat\beta_1(X_i-\bar X)\),离差之和为零,所以 \(\sum\hat u_i=0\)。
- 对 \(Y_i=\hat Y_i+\hat u_i\) 求平均,得 \(\overline{\hat Y}=\bar Y\)。
- \(\sum\hat u_iX_i=\sum\hat u_i(X_i-\bar X)=\sum(Y_i-\bar Y)(X_i-\bar X)-\hat\beta_1\sum(X_i-\bar X)^2=0\),最后一步正是 \(\hat\beta_1\) 的定义。这其实就是第二个正规方程。
- \(TSS=\sum(\hat u_i+\hat Y_i-\bar Y)^2=SSR+ESS+2\sum\hat u_i\hat Y_i\),而 \(\sum\hat u_i\hat Y_i=\hat\beta_0\sum\hat u_i+\hat\beta_1\sum\hat u_iX_i=0\)。
几何上看:残差与常数项、与回归变量都正交,因而与拟合值正交,平方和才能像勾股定理那样分解。这条正交性在量化里有一个直接用途——因子中性化,见本章「量化实战」。
\(R^2\) 介于 0 和 1 之间。\(\hat\beta_1=0\) 时 \(\hat Y_i=\bar Y\),\(R^2=0\);所有点都在线上时 \(R^2=1\)。在单变量回归中还有
推导拆解:\(\hat Y_i-\bar Y=\hat\beta_1(X_i-\bar X)\)(因为回归线过均值点),所以 \(ESS=\hat\beta_1^2\sum(X_i-\bar X)^2\)。代入 \(\hat\beta_1=s_{XY}/s_X^2\),并注意 \(\sum(X_i-\bar X)^2=(n-1)s_X^2\)、\(TSS=(n-1)s_Y^2\):\(R^2=\dfrac{s_{XY}^2}{s_X^4}\cdot\dfrac{(n-1)s_X^2}{(n-1)s_Y^2}=\dfrac{s_{XY}^2}{s_X^2s_Y^2}=r_{XY}^2\)。 金融直觉:在 CAPM 回归里,\(R^2\) 就是「系统性风险占总风险的比例」。个股对市场回归 \(R^2=0.3\),意味着 30% 的收益方差来自市场,70% 是特质风险。上式说明这个比例就是个股与市场相关系数的平方。
4.3.2 回归标准误 SER
回归标准误(standard error of the regression, SER)估计误差 \(u_i\) 的标准差,单位与 \(Y\) 相同:
与样本标准差相比有两处变化:\(Y_i-\bar Y\) 换成 \(\hat u_i\)(残差均值为 0),除数从 \(n-1\) 变成 \(n-2\)——估计了两个系数,用掉两个自由度。大样本时除以 \(n\)、\(n-1\) 还是 \(n-2\) 差别可以忽略。
4.3.3 样本内与样本外预测
用估计样本中的观测算出的 \(\hat Y_i\) 是样本内预测(in-sample prediction)。真正有用的是样本外预测(out-of-sample prediction):对一个已知 \(X\)、未知 \(Y\) 的新观测,预测 \(\hat Y=\hat\beta_0+\hat\beta_1X\)。没有完美的预测,所以预测要附带精度。若新观测与估计样本来自同一总体,样本外预测误差的标准差可以用 SER 估计,常见报告形式是 \(\hat Y\pm SER\)(理由见 4.6 节)。
4.3.4 应用与解读
加州回归的 \(R^2=0.051\),\(SER=18.6\):师生比只解释了成绩变动的 5.1%,单靠师生比预测某学区成绩,典型误差约 18.6 分。
低 \(R^2\)、高 SER 本身不说明回归「好」或「坏」,只说明还有其他重要因素影响成绩。两个常见误区:
- \(R^2\) 低不代表斜率估计不可靠,也不代表没有因果效应;
- \(R^2\) 高不代表估计的是因果效应。
\(R^2\) 衡量的是预测能力,与「\(\beta_1\) 是否为因果效应」是两个独立的问题。
4.4 因果推断的最小二乘假设
现在回到督学。她关心的 \(\beta_1\) 是「改变师生比这一干预对成绩的因果效应」。OLS 能否很好地估计它,取决于数据的性质。下面三条假设中,第一条把「随机分配」翻译成回归语言,后两条是技术条件,是第 2 章大数定律和中心极限定理所需条件(i.i.d.、方差有限)的推广。从本章到第 13 章,\(\beta_1\) 都定义为因果效应:\(X\) 变化 \(\Delta x\) 的因果效应是 \(\beta_1\Delta x\)。
假设 1:\(E(u_i\mid X_i)=0\)
误差项 \(u_i\) 汇集了所有被省略的因素。假设 1 是说:给定 \(X_i\) 的任何取值,这些其他因素的平均值都为零,即它们在均值意义上与 \(X_i\) 无关。
- 在随机对照实验中:如果 \(X\) 由不使用任何对象信息的计算机程序随机分配,那么 \(X\) 与对象的所有特征(包括决定 \(Y\) 的那些)独立,\(E(u_i\mid X_i)=0\) 自动成立。注意回归只需要条件均值为零,不要求 \(X\) 与 \(u\) 中的所有因素完全独立。
- 在观测数据中:\(X\) 没有被随机分配,我们最多只能希望它「仿佛随机分配」(as-if random),精确含义就是 \(E(u_i\mid X_i)=0\)。它是否成立需要逐个应用仔细判断,这是后面许多章节的主题。
与相关的关系(第 2 章):\(E(u_i\mid X_i)=0\Rightarrow\operatorname{corr}(X_i,u_i)=0\),反之不成立。所以实践中常用反向逻辑检查假设:只要 \(X_i\) 与 \(u_i\) 可能相关,假设 1 就被违背。例如富裕学区班级更小、学生校外资源也更多,家庭收入藏在 \(u_i\) 里且与 STR 负相关,此时 OLS 斜率混入了收入的效应。这就是第 6 章的遗漏变量偏误。
一个容易被忽视的细节(原书习题 4.8):若 \(E(u_i\mid X_i)=c\) 是非零常数,只有截距被吸收了 \(c\),斜率估计仍然无偏。真正破坏斜率的是条件均值随 \(X\) 变化。
白话解释:把 CFA 的假设清单和本书对照一下。CFA 常列「自变量与误差项不相关」「误差项均值为 0」两条,本书把它们合并成更强的一条 \(E(u_i\mid X_i)=0\):不仅整体平均为 0,而且在 \(X\) 的每一个取值上平均都为 0。为什么要更强?因为「不相关」只排除了线性关系;若 \(u\) 中藏着一个与 \(X\) 呈 U 形关系的因素,二者可以不相关,但在 \(X\) 很大或很小时 \(u\) 系统性偏高,斜率解释就会被污染。 假设失效的后果:这是本书比 CFA 多讲的重点。假设 1 失效时,OLS 斜率有偏且不一致,样本再大也收敛到错误的值(第 6 章会给出偏差公式)。相比之下,同方差失效只会让常规标准误算错,估计本身依然无偏、一致。所以三条假设中,第一条决定「估得对不对」,后两条只决定「能不能做大样本推断」。
金融直觉:以「分析师覆盖人数」对「次月超额收益」做回归为例。覆盖多的公司通常市值大、流动性好、信息透明,这些都藏在 \(u\) 里且随覆盖人数系统变化,所以 \(E(u\mid X)\ne0\),斜率不能解释为「多一个分析师覆盖带来多少收益」。但如果只是想用覆盖人数来预测收益,这个斜率仍然可用,这正是 4.6 节要讲的区别。
假设 2:\((X_i,Y_i)\) 独立同分布
这是关于样本如何抽取的假设。从单一大总体中简单随机抽样,观测自然 i.i.d.。两类例外:
- \(X\) 由研究者固定:园艺学家在每块地上固定使用同一种除草方法,重复实验中 \(X_i\) 不变,不是随机变量。本章结论对这种「非随机回归变量」同样成立,但这是特殊情形;现代实验会用随机数分配 \(X\),避免研究者不自觉地把最喜欢的方法用在日照最好的地块。
- 时间序列:同一企业每季度的库存与借款利率,相邻观测相关(这季度利率低,下季度很可能也低),违背「独立」。时间序列的处理留到本册第 15–17 章。
假设 3:大离群值不太可能
正式表述是 \(X\) 与 \(Y\) 的四阶矩非零且有限:\(0<E(X_i^4)<\infty\),\(0<E(Y_i^4)<\infty\),等价于峰度有限。原书 Figure 4.4 展示了它的重要性:一个离群点让 OLS 线显示强正相关,去掉它后两者毫无关系。
离群值的常见来源是数据录入错误:打字错误、单位不一致(身高大多用米,有一人误记成厘米)。画图是发现它们的好办法;能更正就更正,不能更正就删除。除录入错误外,许多经济变量取值范围有限(班级规模受教室容量限制,考试有满分和零分),峰度自然有限。
Key Concept 4.3 因果推断的最小二乘假设 \(Y_i=\beta_0+\beta_1X_i+u_i\),\(\beta_1\) 是 \(X\) 对 \(Y\) 的因果效应,且
- \(E(u_i\mid X_i)=0\);
- \((X_i,Y_i)\),\(i=1,\dots,n\) 是来自其联合分布的 i.i.d. 抽样;
- 大离群值不太可能:\(X_i\) 与 \(Y_i\) 有非零有限四阶矩。
这些假设有两种作用。数学上,它们保证 OLS 在大样本下一致且近似正态,是做检验和置信区间的基础。组织上,它们是一份清单,帮我们梳理 OLS 可能失败的地方。实践中第一条最重要;第二条对横截面数据通常合理,对面板和时间序列需要修改方法;第三条提醒 OLS 和样本均值一样对离群值敏感。
4.5 OLS 估计量的抽样分布
\(\hat\beta_0,\hat\beta_1\) 由随机样本算出,本身是随机变量。和第 3 章的 \(\bar Y\) 一样,我们关心它们的抽样分布:中心在哪里、有多分散、是什么形状。
4.5.1 把 \(\hat\beta_1\) 写成「真值 + 噪声」
把 \(Y_i=\beta_0+\beta_1X_i+u_i\) 代入,得 \(Y_i-\bar Y=\beta_1(X_i-\bar X)+(u_i-\bar u)\),于是
(用到 \(\sum(X_i-\bar X)\bar u=0\))。代入 \(\hat\beta_1\) 的公式:
这个表达式是后面所有推导的起点:估计误差由 \(X\) 与 \(u\) 的样本协方差决定,再除以 \(X\) 的样本方差。
推导拆解:
- 对模型 \(Y_i=\beta_0+\beta_1X_i+u_i\) 两边求样本平均,得 \(\bar Y=\beta_0+\beta_1\bar X+\bar u\)。两式相减,\(\beta_0\) 消失:\(Y_i-\bar Y=\beta_1(X_i-\bar X)+(u_i-\bar u)\)。
- 两边乘以 \((X_i-\bar X)\) 再对 \(i\) 求和:\(\sum(X_i-\bar X)(Y_i-\bar Y)=\beta_1\sum(X_i-\bar X)^2+\sum(X_i-\bar X)(u_i-\bar u)\)。
- 最后一项中 \(\bar u\) 是常数,\(\sum(X_i-\bar X)\bar u=\bar u\sum(X_i-\bar X)=0\),只剩 \(\sum(X_i-\bar X)u_i\)。
- 两边除以 \(\sum(X_i-\bar X)^2\),左边正是 \(\hat\beta_1\);分子分母同乘 \(\frac1n\) 不改变数值,只是为了让它们分别看起来像「样本协方差」和「样本方差」,方便后面用 LLN 和 CLT。 怎么用这个式子:它把「估计量是否靠谱」完全转化为「\(X\) 与看不见的 \(u\) 在样本里是否相关」。如果 \(X\) 与 \(u\) 在总体中相关(假设 1 失效),第二项不会随样本增大而消失,偏差就一直在。这就是第 6 章遗漏变量偏误公式的源头。
4.5.2 无偏性
对上式取给定 \(X_1,\dots,X_n\) 的条件期望:
由假设 2,\(u_i\) 与其他观测的 \(X_j\) 独立,所以 \(E(u_i\mid X_1,\dots,X_n)=E(u_i\mid X_i)\);由假设 1,它等于 0。于是条件期望等于 \(\beta_1\),再用迭代期望定律,
\(\hat\beta_0\) 的无偏性类似(原书习题 4.7)。注意证明中假设 1 是必不可少的:若 \(X\) 与 \(u\) 相关,分子的期望不为零,OLS 就有偏。
白话解释:为什么要先「给定 \(X_1,\dots,X_n\)」再求期望?因为 \(\hat\beta_1\) 的分母 \(\sum(X_i-\bar X)^2\) 也是随机的,一个比值的期望一般不等于期望之比,直接求很麻烦。先把所有 \(X\) 当成已知数,分母就是常数,可以提出去;分子是 \(u_i\) 的加权和,权重 \((X_i-\bar X)\) 也已知,期望可以逐项穿进去。算完再用迭代期望去掉条件。这是计量推导的标准套路,后面多元回归、工具变量反复使用。 \(E(u_i\mid X_1,\dots,X_n)=E(u_i\mid X_i)\) 这一步用了 i.i.d.:第 \(j\) 个观测的 \(X_j\) 与第 \(i\) 个观测的 \(u_i\) 独立,知道 \(X_j\) 不提供关于 \(u_i\) 的信息。时间序列里这一步可能失效,比如今天的 \(X_t\) 是昨天收益 \(Y_{t-1}\) 时,\(X_{t+1}=Y_t\) 包含 \(u_t\) 的信息,于是 OLS 在小样本中有偏(自回归系数在小样本中偏向 0 就是这个原因),只剩大样本下的一致性可用。
4.5.3 大样本正态性
看 4.5.1 中的分子。由于 \(\bar X\xrightarrow{p}\mu_X\),大样本下分子近似为
- 由假设 1,\(E(v_i)=E[(X_i-\mu_X)E(u_i\mid X_i)]=0\);
- 由假设 2,\(v_i\) i.i.d.;
- 由假设 3,\(\sigma_v^2=\operatorname{var}[(X_i-\mu_X)u_i]\) 有限且非零。
满足中心极限定理的条件,所以 \(\bar v\approx N(0,\sigma_v^2/n)\)。分母是 \(X\) 的样本方差,依概率收敛到 \(\operatorname{var}(X_i)\)。两者合起来:
Key Concept 4.4 OLS 估计量的大样本分布 若三条最小二乘假设成立,则大样本下 \(\hat\beta_0\)、\(\hat\beta_1\) 联合正态,
\[\hat\beta_1\sim N(\beta_1,\sigma^2_{\hat\beta_1}),\qquad \sigma^2_{\hat\beta_1}=\frac1n\,\frac{\operatorname{var}[(X_i-\mu_X)u_i]}{[\operatorname{var}(X_i)]^2},\]\[\hat\beta_0\sim N(\beta_0,\sigma^2_{\hat\beta_0}),\qquad \sigma^2_{\hat\beta_0}=\frac1n\,\frac{\operatorname{var}(H_iu_i)}{[E(H_i^2)]^2},\quad H_i=1-\frac{\mu_X}{E(X_i^2)}X_i.\]
\(\sigma^2_{\hat\beta_1}\) 的分子 \(\operatorname{var}[(X_i-\mu_X)u_i]\) 允许误差方差随 \(X\) 变化,所以这个公式天然是异方差稳健的。第 5 章的异方差稳健标准误就是把其中的总体矩换成样本矩。若误差同方差,分子化简为 \(\sigma_u^2\operatorname{var}(X_i)\),得到熟悉的 \(\sigma_u^2/[n\operatorname{var}(X_i)]\)。
推导拆解:
- 从近似式到方差:\(\hat\beta_1-\beta_1\approx\bar v/\operatorname{var}(X_i)\),分母是常数,所以 \(\operatorname{var}(\hat\beta_1)\approx\operatorname{var}(\bar v)/[\operatorname{var}(X_i)]^2\)。\(\bar v\) 是 i.i.d. 的 \(v_i\) 的均值,\(\operatorname{var}(\bar v)=\sigma_v^2/n\)(第 2 章 2.5 节)。合起来就是 Key Concept 4.4 的公式。
- 为什么可以把分母当常数:分子 \(\sqrt n\,\bar v\) 依分布趋于正态,分母依概率收敛到常数 \(\operatorname{var}(X_i)\)。「近似正态 ÷ 近似常数 = 近似正态」,这条规则叫 Slutsky 定理。用 \(\bar X\) 代替 \(\mu_X\) 带来的差别也在大样本下消失,同样是这个道理。
- 同方差下的化简:\(\operatorname{var}[(X_i-\mu_X)u_i]=E[(X_i-\mu_X)^2u_i^2]\)(均值为 0)。用迭代期望先对 \(X_i\) 取条件:\(E[(X_i-\mu_X)^2E(u_i^2\mid X_i)]\)。同方差意味着 \(E(u_i^2\mid X_i)=\sigma_u^2\) 不随 \(X_i\) 变,可以提出来,剩下 \(\sigma_u^2E[(X_i-\mu_X)^2]=\sigma_u^2\operatorname{var}(X_i)\)。异方差时 \(E(u_i^2\mid X_i)\) 随 \(X_i\) 变,提不出来,这一步就不成立。 白话解释:CFA 用的标准误公式只是第 3 步化简后的版本。当误差在 \(X\) 极端时更大(比如个股在市场大涨大跌时特质波动也更大),\((X_i-\mu_X)^2\) 大的观测恰好 \(u_i^2\) 也大,真实方差比同方差公式算出的更大。用同方差公式会低估标准误,t 值虚高。量化实战代码第 2 段的模拟正是这种设定。
需要多大的 \(n\)? 第 2 章的经验是 \(n=100\) 时样本均值的正态近似已经不错。回归系数是更复杂的平均,但这一标准大体适用。现代计量应用几乎都有 \(n>100\),除非有特别理由,可以信赖正态近似。
4.5.4 三个推论:什么决定斜率的精度
- 一致性:方差中有 \(1/n\),\(n\to\infty\) 时趋于零,所以 \(\hat\beta_1\xrightarrow{p}\beta_1\)。
- \(X\) 越分散,斜率越精确:方差与 \([\operatorname{var}(X_i)]^2\) 成反比(同方差时与 \(\operatorname{var}(X_i)\) 成反比)。原书 Figure 4.5:150 个点中,只用 \(X\) 集中在均值附近的 75 个点很难确定直线的倾斜程度,用散得开的那 75 个点就容易得多。
- 误差越小,斜率越精确:\(u_i\) 只出现在分子;所有误差缩小一半,\(\sigma_{\hat\beta_1}\) 也缩小一半(方差变为 1/4)。
这三点合起来就是:样本越多、回归变量变化越大、噪声越小,斜率估计越准。它们在量化中都有直接对应,见下文。
4.6 用于预测的最小二乘假设
现在回到父亲。他关心的是加州所有学区中 TestScore 与 STR 的总体回归线,斜率是否为因果效应与他无关。设 \((X^{oos},Y^{oos})\) 为待预测的样本外观测(out-of-sample, oos),\((X_i,Y_i)\) 为估计数据。
预测的最小二乘假设(原书附录 4.4) 设 \(E(Y\mid X)=\beta_0+\beta_1X\),定义 \(u=Y-E(Y\mid X)\),且
- \((X^{oos},Y^{oos})\) 与 \((X_i,Y_i)\) 来自同一总体分布;
- \((X_i,Y_i)\),\(i=1,\dots,n\) i.i.d.;
- 大离群值不太可能。
与因果推断的假设对比,有两处不同:
- \(\beta_1\) 的含义不同:这里 \(\beta_1\) 只是条件期望的斜率,可以是、也可以不是因果效应。
- 第一条假设不同:\(E(u\mid X)=0\) 在这里不是需要论证的假设,而是 \(u\) 的定义带来的自动结果;取而代之的实质性要求是「样本内外同分布」。
这就是预测与因果推断的关键区别。因果推断要论证「其他因素与 \(X\) 无关」,这往往很难;预测只需论证「将来的数据和过去的数据来自同一个总体」。
OLS 预测无偏:样本外观测独立于估计样本,所以
预测误差分解:
估计误差项随 \(n\) 增大而消失,大样本时第一项占主导;又因为同分布,\(\operatorname{var}(u^{oos})=\sigma_u^2\),所以 SER 是样本外预测误差标准差的合理估计。如果样本外观测来自不同的总体,预测一般就有偏,这时 SER 也会低估真实误差。
推导拆解:方差分解里为什么没有交叉项?\(u^{oos}\) 是新观测的误差,\(\hat\beta_0,\hat\beta_1\) 只用估计样本算出,二者来自互相独立的抽样,所以协方差为 0,和的方差就是方差之和(给定 \(X^{oos}\))。估计误差项 \(\operatorname{var}(\hat\beta_0+\hat\beta_1X^{oos})\) 与 \(1/n\) 成正比,并且 \(X^{oos}\) 离样本均值越远越大:在 \(X\) 的「样本外区域」外推,误差更大。 金融直觉:用历史 beta 做对冲时,对冲残差的波动 = 特质波动(无法消除)+ beta 估计误差带来的波动。第二项靠拉长窗口可以缩小,但前提是 beta 没变。若 beta 已经变了,就多出第三项:系统性偏差 \((\beta^{新}-\hat\beta)X^{oos}\),它不随 \(n\) 增大而消失,SER 完全反映不出来。练习 9 正是让你量化这一项。
4.7 本章结论与下一步
OLS 用 \(n\) 个观测估计总体回归线。若三条最小二乘假设成立,\(\hat\beta_0,\hat\beta_1\) 无偏、一致,方差与 \(n\) 成反比,大样本下正态。第一条假设在 \(X\) 随机分配或仿佛随机分配时成立,这时 OLS 估计的是因果效应;第二条在简单随机抽样下成立;第三条要求没有大离群值。但这些还不足以检验 \(\beta_1\) 的假设或构造置信区间——还需要 \(\sigma_{\hat\beta_1}\) 的估计量,即 OLS 的标准误。这是第 5 章的内容。
量化实战
1. Beta 估计就是本章的单变量回归
把个股超额收益对市场超额收益做时间序列 OLS,斜率是 beta,截距是 Jensen's alpha。推广到多个因子(Fama-French 三因子、五因子,Barra 风格因子)就是第 6 章的多元回归。实务中有三点要注意,正好对应三条最小二乘假设:
- 假设 2 不成立:日收益有波动聚集,不是 i.i.d.;beta 本身也随时间变化,常用滚动窗口或卡尔曼滤波(第 06 册第 11b 章)。
- 假设 3 很脆弱:厚尾、错误报价、拆股未复权都会扭曲 OLS beta。数据清洗中的缩尾(winsorize)、MAD 截尾、稳健回归都源于此。
- beta 的「因果」含义有限:beta 回答的是「市场涨 1% 时这只股票平均涨多少」,是预测/对冲问题,不需要因果解释;但对冲比例要求未来与过去同分布,体制切换时会失效。
2. 估计窗口与精度
\(\operatorname{var}(\hat\beta_1)\approx\sigma_u^2/[n\operatorname{var}(X)]\) 解释了几条实务经验:估计 beta 需要足够长的窗口(\(n\)),但窗口太长又会被 beta 时变所污染,这是偏差与方差的取舍;市场波动大的时期(\(\operatorname{var}(X)\) 大)beta 估计更准;特质波动大的小盘股(\(\sigma_u\) 大)beta 估计更不稳定。在截面回归(例如 Fama-MacBeth 第二步)中,因子暴露在股票间越分散,因子收益估计越精确。
3. 因子中性化 = 取 OLS 残差
把原始因子对市值(或行业哑变量)做截面回归,取残差作为中性化后的因子。由 OLS 代数性质 \(\sum\hat u_iX_i=0\) 和 \(\sum\hat u_i=0\),残差与市值的样本相关恰好为零——这不是近似,而是代数恒等式。
4. 收益预测的 \(R^2\)
日频收益预测回归的 \(R^2\) 通常不到 1%,但这不代表没有经济价值:在成千上万次独立下注中,很小的预测力也能积累成可观收益。反过来,样本内 \(R^2\) 高也不保证样本外表现好(本册第 14 章的过拟合问题)。
5. 预测与因果
alpha 研究是「父亲的问题」:需要的是样本内外同分布,而不是因果解释。市场结构变化、风格轮动、因子拥挤都会破坏同分布,这是回测到实盘衰减的根源。估计自己交易的市场冲击是「督学的问题」:大单往往在信息冲击时出现,订单量与价格变动的相关性混杂了信息效应,要得到因果结论需要随机化或可信的准实验设计。
下面的代码依次演示:手算 OLS 并与 statsmodels 对照、OLS 代数性质、用蒙特卡洛验证 (4.19)(原书公式编号,即 Key Concept 4.4 中 \(\sigma^2_{\hat\beta_1}\) 的公式)的方差公式、一个错误数据点对 beta 的破坏、样本外误差与 SER、因子中性化。
import numpy as np
import statsmodels.api as sm
rng = np.random.default_rng(2024)
# ================= 1. 用 OLS 公式估计 CAPM beta =================
T = 500 # 约 2 年日数据
mkt = 0.0003 + 0.010 * rng.standard_normal(T) # 市场超额收益
alpha_true, beta_true = 0.0001, 1.3
eps = 0.015 * rng.standard_t(5, T) / np.sqrt(5 / 3) # 厚尾特质收益
stk = alpha_true + beta_true * mkt + eps # 个股超额收益
xbar, ybar = mkt.mean(), stk.mean()
b1 = np.sum((mkt - xbar) * (stk - ybar)) / np.sum((mkt - xbar) ** 2) # (4.5)
b0 = ybar - b1 * xbar # (4.6)
yhat = b0 + b1 * mkt
uhat = stk - yhat
TSS, ESS, SSR = np.sum((stk - ybar) ** 2), np.sum((yhat - ybar) ** 2), np.sum(uhat ** 2)
R2, SER = ESS / TSS, np.sqrt(SSR / (T - 2))
r = np.corrcoef(mkt, stk)[0, 1]
print(f"手算: beta = {b1:.4f}, alpha = {b0*1e4:.2f}bp/日, R² = {R2:.4f}, SER = {SER:.4f}")
print(f"检查: r² = {r**2:.4f}, beta = r·s_Y/s_X = {r*stk.std()/mkt.std():.4f}")
res = sm.OLS(stk, sm.add_constant(mkt)).fit()
print(f"statsmodels: alpha = {res.params[0]*1e4:.2f}bp, beta = {res.params[1]:.4f}, R² = {res.rsquared:.4f}")
# OLS 代数性质 (4.30)-(4.33):残差均值 0、与回归变量正交、TSS = ESS + SSR
print(f"残差均值 {uhat.mean():.1e}, Σ û·X = {np.sum(uhat*mkt):.1e}, TSS-ESS-SSR = {TSS-ESS-SSR:.1e}")
# ================= 2. β̂1 的抽样分布:验证 (4.19) =================
# 异方差:特质波动随 |市场收益| 放大
def draw(n):
x = 0.01 * rng.standard_normal(n)
u = 0.015 * (0.5 + 50 * np.abs(x)) * rng.standard_normal(n)
return x, 1.3 * x + u
def ols_slope(x, y):
xc = x - x.mean()
return np.sum(xc * (y - y.mean())) / np.sum(xc ** 2)
# 用大样本数值积分出 (4.19) 中的总体矩
xb, yb = draw(2_000_000)
ub = yb - 1.3 * xb
var_v = np.var((xb - xb.mean()) * ub)
for n in [50, 250, 1000]:
sims = np.array([ols_slope(*draw(n)) for _ in range(5000)])
theory_sd = np.sqrt(var_v / (n * np.var(xb) ** 2))
print(f"n={n:5d}: E[β̂1]≈{sims.mean():.3f}, 模拟 sd {sims.std():.4f}, (4.19) 公式 sd {theory_sd:.4f}")
# ================= 3. 一个离群值:未复权的拆股日 =================
for day, label in [(250, "普通交易日"), (int(np.argmax(mkt)), "市场大涨日")]:
stk_bad = stk.copy()
stk_bad[day] = -0.50 # 1 拆 2 未复权,记成 -50% 的「收益」
b_bad = ols_slope(mkt, stk_bad)
lo, hi = np.quantile(stk_bad, [0.005, 0.995])
b_win = ols_slope(mkt, np.clip(stk_bad, lo, hi))
print(f"错误落在{label}(市场 {mkt[day]*100:+.1f}%): beta {b1:.3f} -> {b_bad:.3f}, 缩尾后 {b_win:.3f}")
# ================= 4. 样本外预测误差 ≈ SER(附录 4.4) =================
mkt_oos = 0.0003 + 0.010 * rng.standard_normal(5000)
stk_oos = alpha_true + beta_true * mkt_oos + 0.015 * rng.standard_t(5, 5000) / np.sqrt(5 / 3)
pred_err = stk_oos - (b0 + b1 * mkt_oos)
print(f"样本内 SER {SER:.4f} vs 样本外预测误差标准差 {pred_err.std():.4f}")
# ================= 5. 因子市值中性化 = 取 OLS 残差 =================
n = 3000 # 某日全市场横截面
log_mcap = rng.normal(23, 1.2, n)
raw_factor = -0.6 * (log_mcap - 23) + rng.standard_normal(n) # 与市值强相关的原始因子
xc = log_mcap - log_mcap.mean()
g1 = np.sum(xc * (raw_factor - raw_factor.mean())) / np.sum(xc ** 2)
neutral = raw_factor - (raw_factor.mean() - g1 * log_mcap.mean()) - g1 * log_mcap
print(f"原始因子与市值相关 {np.corrcoef(raw_factor, log_mcap)[0,1]:.3f}"
f" -> 中性化后 {np.corrcoef(neutral, log_mcap)[0,1]:.1e}")
关键输出:
手算: beta = 1.2769, alpha = 0.08bp/日, R² = 0.4155, SER = 0.0152
检查: r² = 0.4155, beta = r·s_Y/s_X = 1.2769
statsmodels: alpha = 0.08bp, beta = 1.2769, R² = 0.4155
残差均值 -2.2e-19, Σ û·X = 4.3e-18, TSS-ESS-SSR = -1.4e-17
n= 50: E[β̂1]≈1.302, 模拟 sd 0.2909, (4.19) 公式 sd 0.2845
n= 250: E[β̂1]≈1.300, 模拟 sd 0.1281, (4.19) 公式 sd 0.1273
n= 1000: E[β̂1]≈1.300, 模拟 sd 0.0635, (4.19) 公式 sd 0.0636
错误落在普通交易日(市场 -0.6%): beta 1.277 -> 1.338, 缩尾后 1.284
错误落在市场大涨日(市场 +3.2%): beta 1.277 -> 0.941, 缩尾后 1.211
样本内 SER 0.0152 vs 样本外预测误差标准差 0.0150
原始因子与市值相关 -0.572 -> 中性化后 1.3e-17
解读:
- 手算公式、\(r\,s_Y/s_X\) 和 statsmodels 三者完全一致;\(R^2=r^2\)。真实 beta 1.3,两年日数据估出 1.277,在抽样误差范围内。
- OLS 代数性质在机器精度下精确成立。
- 在误差方差随 \(|X|\) 变化的异方差设定下,模拟出的 \(\hat\beta_1\) 标准差与 (4.19) 的理论值吻合,且 \(n\) 每扩大 4 倍、标准差减半;\(n=50\) 时略有偏离,说明大样本近似在小样本下只是近似。\(\hat\beta_1\) 的均值都在 1.30 附近,验证了无偏性。
- 同一个错误数据点(−50%)造成的破坏取决于它落在哪一天:落在普通日,beta 从 1.277 变成 1.338;落在市场大涨 3.2% 的那天,beta 被拉到 0.941,偏了四分之一。原因是 OLS 的估计误差是 \(\sum(X_i-\bar X)u_i\) 的加权和,\(X_i\) 离均值越远,该点的「杠杆」越大。缩尾能缓解但不能完全修复,最根本的办法是在数据层面更正复权。
- 样本外预测误差标准差(0.0150)与样本内 SER(0.0152)接近,因为样本外数据与估计数据来自同一总体——这正是附录 4.4 的前提。
- 中性化后因子与市值的相关性是 \(10^{-17}\) 量级,即代数意义上的零。
本章小结
单变量线性回归把条件均值 \(E(Y\mid X)\) 建模为直线 \(\beta_0+\beta_1X\),误差项 \(u\) 汇集了其他所有因素。OLS 选择使残差平方和最小的系数,斜率等于样本协方差除以 \(X\) 的样本方差,回归线过均值点;残差均值为零且与回归变量正交,由此 \(TSS=ESS+SSR\)。\(R^2\) 衡量 \(X\) 解释了 \(Y\) 多少变动,SER 衡量典型预测误差,二者都不说明系数是否为因果效应。用 OLS 估计因果效应需要三条假设:\(E(u_i\mid X_i)=0\)(随机或仿佛随机分配,最关键)、i.i.d. 抽样、四阶矩有限;成立时 OLS 无偏、一致、大样本正态,方差为 \(\frac1n\operatorname{var}[(X_i-\mu_X)u_i]/[\operatorname{var}(X_i)]^2\),样本越多、\(X\) 越分散、噪声越小,估计越精确。用 OLS 做预测则只需样本内外同分布,\(E(u\mid X)=0\) 由定义自动成立。
| 概念 | 公式 / 要点 |
|---|---|
| 模型 | \(Y_i=\beta_0+\beta_1X_i+u_i\);总体回归线 \(=E(Y\mid X)\) |
| OLS 斜率 | \(\hat\beta_1=\dfrac{\sum(X_i-\bar X)(Y_i-\bar Y)}{\sum(X_i-\bar X)^2}=\dfrac{s_{XY}}{s_X^2}=r_{XY}\dfrac{s_Y}{s_X}\) |
| OLS 截距 | \(\hat\beta_0=\bar Y-\hat\beta_1\bar X\) |
| 代数性质 | \(\sum\hat u_i=0\),\(\sum\hat u_iX_i=0\),\(\overline{\hat Y}=\bar Y\),\(TSS=ESS+SSR\) |
| \(R^2\) | \(ESS/TSS=1-SSR/TSS=r_{XY}^2\) |
| SER | \(\sqrt{SSR/(n-2)}\) |
| 加州回归 | \(\widehat{TestScore}=698.9-2.28\,STR\),\(R^2=0.051\),\(SER=18.6\) |
| 因果三假设 | \(E(u_i\mid X_i)=0\);i.i.d.;四阶矩有限 |
| 估计误差表示 | \(\hat\beta_1=\beta_1+\dfrac{\frac1n\sum(X_i-\bar X)u_i}{\frac1n\sum(X_i-\bar X)^2}\) |
| 大样本方差 | \(\sigma^2_{\hat\beta_1}=\dfrac1n\dfrac{\operatorname{var}[(X_i-\mu_X)u_i]}{[\operatorname{var}(X_i)]^2}\) |
| 预测假设 | 样本内外同分布;\(E(u\mid X)=0\) 由定义成立 |
| 样本外误差 | \(\operatorname{var}(\hat u^{oos})=\sigma_u^2+\operatorname{var}(\hat\beta_0+\hat\beta_1X^{oos})\) |
| CAPM | \(R-R_f=\beta(R_m-R_f)\),beta 用 OLS 估计 |
练习
基础
- 50 个三年级班级的回归:\(\widehat{TestScore}=640.3-4.93\times CS\),\(R^2=0.11\),\(SER=8.7\)。(a) 班级 25 人的预测成绩;(b) 班级从 21 人增加到 24 人,预测成绩变化多少;(c) 样本平均班级规模 22.8,平均成绩是多少;(d) 成绩的样本标准差是多少?(原书习题 4.1) 答案要点:(a) 517.05;(b) −14.79;(c) 回归线过均值点,\(640.3-4.93\times22.8\approx527.9\);(d) \(SSR=48\times8.7^2\),\(TSS=SSR/(1-0.11)\),\(s_Y=\sqrt{TSS/49}\approx9.13\)。
- 100 名 20 岁男性体重(磅)对身高(英寸):\(\widehat{Weight}=-79.24+4.16\times Height\),\(R^2=0.72\),\(SER=12.6\)。改用千克和厘米(1 英寸 = 2.54 厘米,1 磅 = 0.4536 千克)后,截距、斜率、\(R^2\)、SER 各是多少?(原书习题 4.2) 答案:斜率 \(4.16\times0.4536/2.54\approx0.743\) 千克/厘米;截距 \(-79.24\times0.4536\approx-35.9\) 千克;\(R^2\) 不变 0.72;SER \(\approx5.72\) 千克。
- 证明样本回归线经过 \((\bar X,\bar Y)\),并证明 \(R^2=r_{XY}^2\)。(原书习题 4.12、4.14)
- 若 \(E(u_i\mid X_i)=2\),\(\hat\beta_1\) 和 \(\hat\beta_0\) 是否无偏?用 CAPM 回归解释这对 alpha 估计意味着什么。(原书习题 4.8) 提示:把模型改写成 \(Y_i=(\beta_0+2)+\beta_1X_i+(u_i-2)\)。斜率不受影响,截距吸收了 2。CAPM 回归中误差的系统性非零均值会全部表现为 alpha。
进阶
- 已知 \(\beta_0=0\)(过原点回归),推导最小二乘斜率 \(\hat\beta_1=\sum X_iY_i/\sum X_i^2\)。如果真实截距不为零却强行过原点回归,斜率估计会怎样?在 CAPM 检验中这意味着什么?(原书习题 4.11) 提示:强制无截距时,非零的 alpha 会被斜率部分吸收,beta 有偏;除非 \(\bar X=0\)。
- \(X\sim\) Bernoulli(0.3);\(X=1\) 时 \(u\sim N(0,3)\),\(X=0\) 时 \(u\sim N(0,2)\)。验证三条最小二乘假设成立,并求 \(\hat\beta_1\) 的大样本方差。(原书习题 4.10) 答案要点:\(\operatorname{var}[(X-0.3)u]=0.3\times0.49\times3+0.7\times0.09\times2=0.567\),\([\operatorname{var}(X)]^2=0.21^2=0.0441\),\(\sigma^2_{\hat\beta_1}\approx12.86/n\)。
- 证明:所有误差 \(u_i\) 放大 \(k\) 倍而 \(X\) 不变时,\(\hat\beta_1\) 的大样本方差放大 \(k^2\) 倍。用这个结论解释为什么小盘股的 beta 估计比大盘股更不稳定。(原书习题 4.13)
- 证明样本外预测误差 \(\operatorname{var}(\hat u^{oos})=\operatorname{var}(u^{oos})+\operatorname{var}(\hat\beta_0+\hat\beta_1X^{oos})\)(给定 \(X^{oos}\))。若样本外观测来自不同总体(例如 beta 发生了变化),预测会怎样?(原书习题 4.15)
- 用本章代码,把真实 beta 改成在第 250 天从 1.3 跳到 0.8。用全样本、前一半、后一半分别估计 beta,并计算后一半样本外预测误差标准差与全样本 SER 的差距。这对应 4.6 节的哪一条假设被违背? 提示:全样本估计约为两者的平均;违背的是「样本内外同分布」。
- 一个因子对市值和 30 个行业哑变量做截面回归后取残差。为什么残差与每个行业哑变量的样本协方差都为零?这和本章的哪条代数性质有关?(多元情形见第 6 章)
原书推荐习题:4.1、4.5、4.8、4.10、4.11、4.12、4.15;实证题 E4.1(离群值马耳他对斜率的影响)、E4.2(身高与收入,讨论 \(E(u\mid Height)=0\) 是否成立)。
原书对照
| 本章内容 | 原书章节 | PDF 页码 |
|---|---|---|
| 因果推断与预测两类问题 | 第 4 章开篇 | p.144–145 |
| 线性回归模型、Key Concept 4.1 | 4.1 | p.145–148 |
| OLS 估计量、加州数据、为何用 OLS | 4.2 | p.148–154 |
| 股票的 Beta 专栏 | 4.2 | p.153 |
| \(R^2\)、SER、样本内外预测 | 4.3 | p.154–157 |
| 因果推断的最小二乘假设(Key Concept 4.3) | 4.4 | p.157–162 |
| OLS 抽样分布(Key Concept 4.4) | 4.5 | p.162–165 |
| 结论 | 4.6 | p.165 |
| 小结、习题、实证题 | 第 4 章末 | p.166–172 |
| 附录 4.1 加州数据;4.2 OLS 推导 | 附录 | p.173–174 |
| 附录 4.3 OLS 抽样分布与代数性质 | 附录 | p.174–177 |
| 附录 4.4 用于预测的最小二乘假设 | 附录 | p.177–178 |
注:原书页码 = PDF 页码 − 1。