第05册 计量经济学 · 本册导读
1. 本册定位
1.1 底本
本册以 James H. Stock 与 Mark W. Watson 的《Introduction to Econometrics》Global Edition(第 4 版)为底本。PDF 共 801 页,正文 19 章,另有统计附表、参考文献、术语表和索引。各章「原书对照」的页码一律是 PDF 页码,印刷页码 ≈ PDF 页码 − 1。
原书有三个默认设定:推断以大样本近似为主;数据默认随机抽样(时间序列章节换成平稳、弱相依);误差默认异方差,稳健标准误是默认选项。这也正是处理收益数据时应有的默认态度。
本册共 25 个章节文件,原书第 15、17、19 章分别拆成 15a–15b、17a–17d、19a–19c。各章结构一致:学习目标 → 正文 → 量化实战(自包含代码与结果解读)→ 本章小结 → 练习 → 原书对照。
1.2 在量化交易中的作用
计量经济学回答「怎样从带噪声的数据得出可信的数量结论,并给出精度」。量化研究的日常问题大多落在这个框架内:
- 估计与推断:股票 beta、策略 alpha 的显著性、因子溢价是不是运气(第 04–07 章)。
- 选对标准误:截面相关用聚类,时间序列相关用 HAC,因子检验用 Fama–MacBeth 或双向聚类,重叠收益回归加大截断参数(第 05、10、16、17a 章)。标准误选错是「t 值虚高」的头号原因。
- 因子研究方法论:「控制」就是 Frisch–Waugh 正交化(因子中性化),遗漏变量偏差制造伪因子,多重检验解释「因子动物园」(第 03、06、07、09 章)。
- 因果与事件评估:执行算法 A/B 测试、指数调整的双重差分与断点回归、用工具变量估计价格冲击(第 12、13 章)。
- 预测与防过拟合:样本外 MSPE、交叉验证、岭 / Lasso / 主成分、伪样本外回测(第 14、15a、19c 章)。
- 时间序列:可预测性检验、单位根与伪回归、协整与配对交易、结构突变、GARCH、VAR、动态因子(第 15a–17d 章)。
1.3 与其他各册的关系
| 相关册 | 关系 | 本册中的对接点 |
|---|---|---|
| 第 01 册 线性代数与矩阵分析 | 矩阵工具 | 第 19a 章用到正定矩阵、投影、谱分解;第 14、19c 章的主成分是特征值问题(第 01 册第 04a 章 Courant–Fischer);数值求解 OLS 应用 QR / SVD(第 01 册第 02a、02b 章) |
| 第 02 册 概率论 | 前置 | 本册第 02 章是第 02 册第 4–8 章的「计量速览」 |
| 第 03 册 数理统计与统计推断 | 前置与并行 | 本册第 03 章对应其第 06、09、10a 章;多重检验见其第 10b 章;Bootstrap(第 08 章)、因果推断(第 16 章)可对照 |
| 第 04 册 数值最优化 | 算法支撑 | 其第 10 章非线性最小二乘支撑本册第 08 章 NLLS;MLE(第 11、17c 章)的数值求解 |
| 第 06 册 金融时间序列(Tsay) | 后续与重叠 | 见下表;本册偏计量推断,第 06 册偏金融建模 |
| 第 07 册 市场微观结构与交易 | 应用 | 交易成本的计量估计(第 21b 章)、技能与运气检验(第 22b 章)直接用本册工具 |
| 第 08 册 期权期货与衍生品 | 应用 | 波动率与相关系数的估计(第 08 册第 23 章)、VaR(第 22 章)与本册第 17c 章互补 |
| 第 11 册 量化交易综合实战 | 下游 | 把因子回归、稳健推断、样本外评估串成完整流程(该册尚未成稿) |
与第 06 册的分工(时间序列重叠最多,可对照阅读):
| 本册 | 第 06 册 | 分工 |
|---|---|---|
| 15a 自回归、ADL、样本外评估 | 02a 平稳性与 ARMA | 本册重预测评估;第 06 册重 ARMA 识别 |
| 15b 单位根、伪回归、结构突变 | 02b 单位根、季节性与时间序列回归 | 两处都讲 ADF;本册多了 Chow / QLR 结构突变 |
| 16 动态因果效应与 HAC | 02b(2.12 节 HC 与 HAC) | 本册讲 HAC 的来龙去脉与外生性 |
| 17a VAR 与多期预测 | 08a 向量自回归 | 脉冲响应与方差分解见第 06 册 |
| 17b 单整与协整 | 08b 协整与配对交易 | 本册讲 EG-ADF 与 DOLS;Johansen 方法见第 06 册 |
| 17c ARCH/GARCH | 03a、03b、07a | 本册只讲基本模型;非对称 GARCH、SV 与 VaR 见第 06 册 |
| 17d 动态因子模型 | 09 主成分与因子模型、11a Kalman 滤波 | 本册重预测;第 06 册重收益的协方差结构 |
2. 前置知识与自测
2.1 开始前应会什么
- 概率:期望、方差、协方差运算,条件期望,正态 / 卡方 / t / F 分布,大数定律与中心极限定理(第 02 册第 4–8 章)。
- 统计:偏误与一致性、标准误、假设检验、p 值、置信区间(第 03 册第 06、09、10a 章)。
- 微积分:偏导与一阶条件、二阶泰勒展开、\(\ln(1+x)\approx x\)。
- 线性代数:矩阵乘法、逆、秩、正定矩阵、二次型求导。第 04–17 章几乎不用矩阵,第 18–19 章需要(第 01 册第 00 章足够)。
- Python:numpy、pandas 基本操作,statsmodels 的
sm.OLS(y, X).fit()。
2.2 五道自测题
题 1(组合方差)。两只股票年化波动率分别为 20% 与 30%,相关系数 0.5,各投 50%。组合年化波动率是多少?若有 \(n\) 只两两相关系数都是 \(\rho\)、波动率都是 \(\sigma\) 的股票等权持有,\(n\to\infty\) 时组合方差趋于什么?
答案要点:方差 \(=0.25\times0.04+0.25\times0.09+2\times0.25\times0.5\times0.2\times0.3=0.0475\),波动率约 21.8%。等权组合方差 \(\sigma^2/n+\frac{n-1}{n}\rho\sigma^2\to\rho\sigma^2\),系统性风险分散不掉。(第 02 章)
题 2(不相关 vs 条件均值独立)。\(X\sim N(0,1)\),\(Z\sim N(0,1)\) 与 \(X\) 独立,\(Y=X^2+Z\)。\(X\) 与 \(Y\) 相关吗?\(E(Y\mid X)\) 依赖 \(X\) 吗?这说明「\(E(u\mid X)=0\)」和「\(\operatorname{cov}(X,u)=0\)」哪个更强?
答案要点:\(\operatorname{cov}(X,Y)=E(X^3)=0\),不相关;但 \(E(Y\mid X)=X^2\) 依赖 \(X\)。条件均值独立推出不相关,反之不成立,故 \(E(u\mid X)=0\) 更强。(第 02 章)
题 3(策略 t 检验)。某策略 10 年月度收益 120 个观测,均值 0.8%,标准差 4%。检验「期望收益为 0」,算出 t 统计量和年化夏普比率,并说明两者的近似关系。
答案要点:\(SE=4\%/\sqrt{120}\approx0.365\%\),\(t\approx2.19\),5% 水平拒绝、1% 水平不拒绝。年化夏普 \(=0.8/4\times\sqrt{12}\approx0.69\),\(t\approx\text{SR}_{\text{年化}}\sqrt{\text{年数}}=0.69\times\sqrt{10}\approx2.19\)。若是从几百个候选里挑出来的,2.19 远远不够(第 03、07 章)。
题 4(正规方程)。设 \(\mathbf X\) 为 \(n\times(k+1)\) 列满秩矩阵。推导使 \(\lVert\mathbf Y-\mathbf X\mathbf b\rVert^2\) 最小的 \(\mathbf b\),并说明为什么 \(\mathbf X'\mathbf X\) 可逆。
答案要点:目标函数对 \(\mathbf b\) 求导得 \(-2\mathbf X'(\mathbf Y-\mathbf X\mathbf b)=\mathbf 0\),即 \(\mathbf X'\mathbf X\mathbf b=\mathbf X'\mathbf Y\),解为 \((\mathbf X'\mathbf X)^{-1}\mathbf X'\mathbf Y\)。对任意 \(\mathbf c\neq\mathbf 0\),\(\mathbf c'\mathbf X'\mathbf X\mathbf c=\lVert\mathbf X\mathbf c\rVert^2>0\)(列满秩保证 \(\mathbf X\mathbf c\neq\mathbf 0\)),故 \(\mathbf X'\mathbf X\) 正定可逆。列不满秩就是「完全多重共线」(第 06、19a 章)。
题 5(大数定律与中心极限定理)。\(Y_1,\dots,Y_n\) i.i.d.,均值 \(\mu\)、方差 \(\sigma^2\) 有限。写出 \(\bar Y\) 的均值、方差和 \(\sqrt n(\bar Y-\mu)/\sigma\) 的极限分布。若 \(Y\) 服从自由度为 2 的 t 分布,中心极限定理还成立吗?
答案要点:\(E\bar Y=\mu\),\(\operatorname{var}\bar Y=\sigma^2/n\),\(\sqrt n(\bar Y-\mu)/\sigma\xrightarrow{d}N(0,1)\)。\(t_2\) 方差无穷,经典 CLT 不适用;厚尾也会让正态近似收敛很慢,这是本册强调「四阶矩有限」的原因(第 02、18 章)。
做出四题以上可直接从第 04 章开始;题 1、2、5 不会先读第 02 章,题 3 不会先读第 03 章,题 4 只影响第 18–19 章。
3. 章节地图
必学=量化研究直接要用;选学=视方向取舍或理论深化;速读=与他册重叠或以背景为主。学时按「读正文 + 跑代码 + 做一半练习」估计。
| 文件 | 原书章节 | 一句话内容 | 学时 | 标记 |
|---|---|---|---|---|
| 01 经济问题与数据 | 第 1 章、前言 | 因果与预测两类问题,理想随机实验定义因果效应,横截面 / 时间序列 / 面板三种数据 | 1.5 | 速读 |
| 02 概率复习:计量视角 | 第 2 章 | 条件期望是最优预测,独立与不相关的强弱,LLN / CLT,厚尾 | 3 | 速读 |
| 03 统计复习:计量视角 | 第 3 章 | 总体均值的估计、t 检验与置信区间、两均值差、假阳性率与「因子动物园」 | 3 | 必学 |
| 04 单变量线性回归 | 第 4 章 | OLS 推导、\(R^2\) 与 SER、三条最小二乘假设、抽样分布,CAPM beta | 5 | 必学 |
| 05 单回归的假设检验与置信区间 | 第 5 章 | 回归系数的 t 检验与置信区间、虚拟变量回归、异方差稳健标准误、高斯–马尔可夫定理 | 4 | 必学 |
| 06 多元线性回归 | 第 6 章 | 遗漏变量偏差、多元 OLS、多重共线性、控制变量、Frisch–Waugh 与因子中性化 | 5 | 必学 |
| 07 多元回归的假设检验与置信区间 | 第 7 章 | 联合假设与稳健 F 检验、单一约束的重参数化、置信椭圆、模型设定、Bonferroni 与多重检验 | 4 | 必学 |
| 08 非线性回归函数 | 第 8 章 | 多项式、对数模型与弹性、交互项、非线性效应的标准误、非线性最小二乘 | 5 | 必学 |
| 09 基于多元回归的研究评估 | 第 9 章 | 内部 / 外部有效性,五大偏差来源(含变量误差、幸存者偏差),标准误失效的情形 | 4 | 必学 |
| 10 面板数据回归 | 第 10 章 | 实体与时间固定效应、聚类标准误,补充 Fama–MacBeth 与双向聚类 | 5 | 必学 |
| 11 二元因变量回归 | 第 11 章 | 线性概率模型、probit / logit、最大似然、边际效应、AUC 与对数损失 | 3 | 选学 |
| 12 工具变量回归 | 第 12 章 | TSLS、弱工具与第一阶段 F、过度识别 J 检验,价格冲击与 beta 变量误差的 IV 修正 | 5 | 必学 |
| 13 实验与准实验 | 第 13 章 | 潜在结果、实验的威胁、双重差分、断点回归、LATE,算法 A/B 测试 | 4 | 选学 |
| 14 多回归元预测与大数据 | 第 14 章 | MSPE 与 \((1+k/n)\) 定律、交叉验证、岭回归、Lasso、主成分回归,截面收益预测 | 5 | 必学 |
| 15a 时间序列回归与预测 | 第 15 章 15.1–15.6 | 自相关与平稳性、AR 与 ADL、Granger 检验、MSFE 三种估计与伪样本外预测、BIC / AIC | 5 | 必学 |
| 15b 非平稳性:趋势与结构突变 | 第 15 章 15.7–15.9 | 随机趋势与伪回归、ADF 单位根检验、Chow 与 QLR 结构突变检验、突变后的预测 | 4 | 必学 |
| 16 动态因果效应 | 第 16 章 | 分布滞后与动态乘数、外生与严格外生、HAC(Newey–West)标准误、ADL 与 GLS,重叠收益 | 5 | 必学 |
| 17a 向量自回归与多期预测 | 第 17 章 17.1–17.2 | VAR 估计与滞后选择、跨方程 Granger 检验、迭代与直接多期预测、重叠回归的 HAC | 3 | 必学 |
| 17b 单整、单位根与协整 | 第 17 章 17.3–17.4 | I(d) 与 DF 统计量非正态的来源、协整与 VECM、EG-ADF、DOLS,配对交易 | 4 | 必学 |
| 17c 波动率聚集与 ARCH/GARCH | 第 17 章 17.5 | 已实现波动率、ARCH / GARCH 的持续性与多步预测,波动率目标仓位 | 2.5 | 速读 |
| 17d 动态因子模型与主成分预测 | 第 17 章 17.6–17.7 | 动态因子模型、主成分估计因子、Bai–Ng 准则、因子预测与不可识别性 | 3 | 选学 |
| 18 单回归元线性回归理论 | 第 18 章 | 收敛概念与 Slutsky 定理、OLS 与稳健 t 的渐近分布、精确分布、WLS | 4 | 选学 |
| 19a 矩阵形式的多元回归理论 | 第 19 章 19.1–19.5、附录 19.1–19.5 | 矩阵 OLS、三明治协方差与 HC1/HC3、Wald 检验、投影矩阵、高斯–马尔可夫定理 | 6 | 选学 |
| 19b 广义最小二乘、工具变量与 GMM | 第 19 章 19.6–19.7、附录 19.6 | GLS 与严格外生性、矩阵 TSLS、有效 GMM 与 J 统计量,随机贴现因子的 GMM 估计 | 5 | 选学 |
| 19c 多预测变量回归的矩阵推导与书末附表 | 附录 19.7、书末附表 | MSPE 的矩阵推导、岭回归闭式解、主成分的拉格朗日推导,统计附表速查 | 2 | 速读 |
合计约 100 学时:必学 15 个文件约 66 学时,选学 6 个约 25 学时,速读 4 个约 9 学时。
4. 学习路径
4.1 量化研究速成路径(约 60 学时)
目标是尽快能独立完成一项因子 / 信号研究,并写出经得起审查的检验报告。按以下顺序:
- 第 03 章 3.2 节与量化实战(1.5 学时):t 检验、假阳性率、因子动物园模拟。
- 第 04 章(5):OLS 与 beta 估计,离群值的破坏,中性化就是取残差。
- 第 05 章(4):稳健标准误为默认;虚拟变量回归即均值差检验。
- 第 06 章(5):遗漏变量偏差制造伪因子,Frisch–Waugh 与因子中性化。
- 第 07 章(4):稳健 F 检验,200 个噪声信号的多重检验实验。
- 第 08 章 8.2–8.3 节(2):对数模型与交互项(冲击成本平方根律、条件因子效应)。
- 第 09 章(4):用这张清单审查回测:幸存者偏差、beta 的变量误差、样本外有效性。
- 第 10 章(5):固定效应、聚类标准误,10.8 节 Fama–MacBeth 与双向聚类。
- 第 14 章(5):交叉验证与岭 / Lasso / 主成分,600 个相关因子的截面预测。
- 第 15a 章(5):AR / ADL、Granger 检验、伪样本外评估。
- 第 15b 章(4):伪回归、ADF、结构突变与信号失效诊断。
- 第 16 章(5):HAC 标准误与重叠收益的 t 值膨胀。
- 第 17a 章(3):直接多期回归与 Newey–West 的有限样本问题。
- 第 17b 章(4):协整、EG-ADF、半衰期,即配对交易的统计基础。
- 第 17c 章(2.5):GARCH 持续性与波动率目标,深入内容转第 06 册第 03a、03b 章。
做执行或事件驱动方向的读者,应把第 12 章(价格冲击的 IV 估计)和第 13 章(双重差分、断点回归)提到必学。
4.2 完整系统路径(约 100 学时)
按原书顺序通读,分六段:
- 第一段 · 基础(01–03,7.5 学时):数据与问题类型、概率统计复习;学过第 02、03 册可只看「量化实战」与「本章小结」。
- 第二段 · 回归核心(04–09,27 学时):单回归 → 推断 → 多元回归 → 联合推断 → 非线性 → 研究评估,是全书骨架。
- 第三段 · 因果识别(10–13,17 学时):面板固定效应、二元因变量、工具变量、实验与准实验,四种应对「回归元与误差相关」的办法。
- 第四段 · 大数据预测(14,5 学时):从因果转向预测,引入收缩估计与样本外评估。
- 第五段 · 时间序列(15a–17d,26.5 学时):平稳预测 → 非平稳 → 动态因果与 HAC → VAR、协整、GARCH、动态因子;读完 17b、17c 后对照第 06 册第 08b、03a 章。
- 第六段 · 计量理论(18–19c,17 学时):渐近理论、矩阵形式、GLS / IV / GMM。
4.3 理论穿插路径(适合数学背景较好的读者)
原书把理论集中在最后两章。想边学方法边看证明,可以穿插:第 05 章后读第 18 章;第 07 章后读第 19a 章;第 12 章后读第 19b 章 19.7 节;第 14 章后读第 19c 章;第 16 章后读第 19b 章 19.6 节(GLS 与严格外生)。
5. 核心公式与概念速查
| # | 概念 | 公式 / 要点 | 章 |
|---|---|---|---|
| 1 | 强弱关系 | 独立 ⇒ \(E(Y\mid X)=\mu_Y\) ⇒ 不相关 | 02 |
| 2 | 均值的 t 检验 | \(t=(\bar Y-\mu_0)/(s_Y/\sqrt n)\);双侧 5% 临界值 1.96 | 03 |
| 3 | 假阳性率 | \(\dfrac{\pi_0\alpha}{\pi_0\alpha+(1-\pi_0)\cdot\text{power}}\),\(\pi_0\) 为真零假设比例 | 03 |
| 4 | OLS 斜率 | \(\hat\beta_1=s_{XY}/s_X^2\),\(\hat\beta_0=\bar Y-\hat\beta_1\bar X\) | 04 |
| 5 | 拟合度 | \(R^2=ESS/TSS=1-SSR/TSS\);\(SER=\sqrt{SSR/(n-k-1)}\);\(\bar R^2=1-\frac{n-1}{n-k-1}\frac{SSR}{TSS}\) | 04、06 |
| 6 | OLS 大样本方差 | \(\sigma^2_{\hat\beta_1}=\frac1n\operatorname{var}[(X_i-\mu_X)u_i]/[\operatorname{var}(X_i)]^2\) | 04 |
| 7 | 稳健标准误(HC1) | \(\frac{n}{n-k-1}(\mathbf X'\mathbf X)^{-1}(\sum\hat u_i^2\mathbf x_i\mathbf x_i')(\mathbf X'\mathbf X)^{-1}\) | 05、19a |
| 8 | 置信区间 | \(\hat\beta_j\pm1.96\,SE(\hat\beta_j)\);\(\Delta x\) 的效应区间乘以 \(\Delta x\) | 05 |
| 9 | 遗漏变量偏差 | \(\hat\beta_1\xrightarrow{p}\beta_1+\rho_{Xu}\sigma_u/\sigma_X\) | 06 |
| 10 | Frisch–Waugh | \(\hat\beta_1\) = 把 \(Y\) 与 \(X_1\) 都对其他回归元取残差后的单回归斜率 | 06、19a |
| 11 | 稳健 F(Wald) | \(F=\frac1q(\mathbf R\hat\beta-\mathbf r)'[\mathbf R\hat\Sigma\mathbf R']^{-1}(\mathbf R\hat\beta-\mathbf r)\sim F_{q,\infty}\) | 07、19a |
| 12 | 逐个检验的水平 | 独立时 \(1-0.95^q\);Bonferroni 临界值 \(\Phi^{-1}(1-\alpha/2q)\) | 07 |
| 13 | 对数模型 | 对数-线性:1 单位 \(X\) ↔ \(100\beta_1\%\) 的 \(Y\);对数-对数:\(\beta_1\) 为弹性 | 08 |
| 14 | 交互项 | \(\partial Y/\partial X_1=\beta_1+\beta_3X_2\) | 08 |
| 15 | 测量误差衰减 | \(\hat\beta_1\xrightarrow{p}\frac{\sigma_X^2}{\sigma_X^2+\sigma_w^2}\beta_1\) | 09 |
| 16 | 固定效应 | 组内变换 \(\tilde Y_{it}=Y_{it}-\bar Y_i\);需严格外生;必须用聚类标准误 | 10 |
| 17 | Fama–MacBeth | \(\hat b=\frac1T\sum_t\hat b_t\),\(SE=s_{\hat b}/\sqrt T\);对持续个股效应不稳健 | 10 |
| 18 | Probit / Logit | \(\Pr(Y=1\mid X)=\Phi(X'\beta)\) / \(1/(1+e^{-X'\beta})\);效应用预测概率之差 | 11 |
| 19 | TSLS | 单工具 \(s_{ZY}/s_{ZX}\);矩阵 \((\mathbf X'\mathbf P_Z\mathbf X)^{-1}\mathbf X'\mathbf P_Z\mathbf Y\) | 12、19b |
| 20 | 弱工具与过度识别 | 第一阶段 \(F>10\);\(J=mF\sim\chi^2_{m-k}\) | 12 |
| 21 | 双重差分与 LATE | \(\Delta\bar Y^{\text{处理}}-\Delta\bar Y^{\text{对照}}\);\(\hat\beta^{TSLS}\to E(\beta_{1i}\pi_{1i})/E(\pi_{1i})\) | 13 |
| 22 | OLS 的样本外误差 | \(MSPE_{OLS}\approx(1+k/n)\sigma_u^2\) | 14、19c |
| 23 | 岭与 Lasso | 岭 \((\mathbf X'\mathbf X+\lambda\mathbf I)^{-1}\mathbf X'\mathbf Y\);Lasso 软阈值;都须先标准化 | 14、19c |
| 24 | 主成分 | 权重是 \(\mathbf X'\mathbf X\)(标准化后为相关矩阵)的特征向量,方差为特征值 | 14、19c |
| 25 | 信息准则 | \(BIC(p)=\ln\frac{SSR(p)}T+(p+1)\frac{\ln T}T\);AIC 把 \(\ln T\) 换成 2 | 15a |
| 26 | MSFE 的 FPE 估计 | \(\frac{T+p+1}{T-p-1}\cdot\frac{SSR}{T}\);伪样本外 \(\frac1P\sum\tilde u_s^2\) | 15a |
| 27 | ADF 检验 | \(\Delta Y_t=\beta_0+\delta Y_{t-1}+\sum\gamma_j\Delta Y_{t-j}+u_t\);5% 临界值仅截距 −2.86,含趋势 −3.41 | 15b |
| 28 | QLR | \(\max_{\tau\in[0.15T,0.85T]}F(\tau)\),查表 15.5 | 15b |
| 29 | HAC(Newey–West) | \(\hat f_T=1+2\sum_{j=1}^{m-1}\frac{m-j}{m}\tilde\rho_j\),\(m=0.75T^{1/3}\);\(h\) 步重叠回归 \(m\ge h-1\) | 16、17a |
| 30 | 迭代与直接预测 | 迭代:逐步代入一步模型;直接:\(Y_{t+h}\) 对 \(t\) 期变量回归,误差有 \(h-1\) 阶重叠相关 | 17a |
| 31 | 协整与 VECM | \(Y-\theta X\sim I(0)\);\(\Delta Y_t=\cdots+\alpha(Y_{t-1}-\theta X_{t-1})+u_t\);EG-ADF 两变量 5% 临界值 −3.41 | 17b |
| 32 | GARCH(1,1) | \(\sigma_t^2=\alpha_0+\alpha_1u_{t-1}^2+\phi_1\sigma_{t-1}^2\);无条件方差 \(\alpha_0/(1-\alpha_1-\phi_1)\) | 17c |
| 33 | 动态因子模型 | \(X_{it}=\Lambda_i'\mathbf F_t+u_{it}\);Bai–Ng:\(\ln\hat\sigma^2(r)+r\frac{N+T}{NT}\ln\min(N,T)\) | 17d |
| 34 | GLS 与有效 GMM | \((\mathbf X'\boldsymbol\Omega^{-1}\mathbf X)^{-1}\mathbf X'\boldsymbol\Omega^{-1}\mathbf Y\)(需严格外生);GMM 权重 \(\mathbf H^{-1}\),\(J\sim\chi^2_{m-k}\) | 19b |
6. 勘误汇总
下表汇总各章标注的原书错误、据精读笔记所作的更正和建议回查 PDF 之处。已更正=正文给出正确写法并加注;已处理=正文直接采用正确写法、未加注;待回查=依据精读笔记或推算,未与 PDF 逐字核对。
| 文件 | 说明 | 状态 |
|---|---|---|
| 02 | 2.2 节线性变换:原书写 \(\sigma_Y=b\sigma_X\),只在 \(b>0\) 时成立,正文改为 \(\lvert b\rvert\sigma_X\) | 已更正 |
| 03 | 3.5 节「提高投票率」专栏:精读笔记记录原书给出上门与电话游说的效应分别为 6.7% 和 7.3%(原文如此),与两组投票率 55.1%、55% 的高低顺序不一致;正文只引用投票率,未引用这组效应数字 | 待回查 |
| 05 | 5.4 节「社会阶层还是教育」方框:原书残留旧版「按性别分组」措辞,按上下文应为按社会阶层分组 | 已更正 |
| 07 | 7.5 节:原书正文把条件均值独立的出处写成 Key Concept 6.5,实为 Key Concept 6.6 | 已更正 |
| 09 | 9.4 节马萨诸塞州回归表第 (6) 列免费午餐系数的标准误:精读笔记抽取为 0.72,按上下文应为 0.072,正文表格采用 0.072 | 已处理,待回查 |
| 11 | 11.1 节:原书写「完整分析见 Section 11.3」,实际分析在 11.4 节,正文已写 11.4 节 | 已处理 |
| 11 | 11.2 节 logit 黑白申请者被拒概率差:按公式算得 14.8 个百分点,原书比较段落写 14.9,属四舍五入差异 | 已更正 |
| 15a | 15.4 节式 (15.14):精读笔记记录原书把期限利差的 t 统计量印成 −2.34 并称「1% 显著」;按系数与标准误应为 +2.34,\(p\approx0.02\),只在 5% 水平显著 | 已更正,已对照原书 PDF p.571 核实 |
| 16 | 16.6 节稳定性检验的脚注:原书写 Key Concept 15.9,实际对应 15.8 节的 QLR 检验;正文直接写「第 15b 章的 QLR」 | 已处理 |
| 16 | 16.7 节 GDP 与期限利差的例子:原书写「式 15.20」,实指 15.4 节的 ADL(如式 15.15) | 已处理 |
| 17a | 17.2 节式 (17.9):\(TSpread_{t-2}\) 的系数印为 1.28,与 VAR 估计式 (17.5) 的 1.18 不一致;按 1.28 得 2.4%,按 1.18 得约 2.3% | 已加注,已对照原书 PDF 核实(原书确实两处不一致) |
| 18 | 18.2 节三个估计量的例子:原书印作 \(Y_i\sim N(0,\sigma_Y^2)\),按上下文应为 \(N(\mu_Y,\sigma_Y^2)\) | 已更正 |
| 19a | 附录 19.1:原书写「迹等于特征向量之和」,应为特征值之和 | 已更正 |
| 19a | 附录 19.1 矩阵平方根:正文写 \(\mathbf F'^{-1}\mathbf V\mathbf F^{-1}=\mathbf I_n\),并注明与 \(\mathbf F\mathbf V^{-1}\mathbf F'=\mathbf I_n\) 等价 | 已处理 |
另外,各章「原书对照」表中页码为「—」的行是本教材补充内容(如第 10 章的 Fama–MacBeth、第 19b 章的随机贴现因子 GMM),引用时注意与原书区分。
7. 配套代码说明
7.1 运行环境
- Python 3.10 及以上。
- 必需:
numpy、pandas、scipy、statsmodels(建议 0.14 及以上)。 - 第 11、14、19c 章另需
scikit-learn(roc_auc_score、log_loss、RidgeCV、LassoCV、PCA、Ridge等)。 - 第 17c 章另需
arch(arch_model估计 GARCH)。 - 安装:
pip install numpy pandas scipy statsmodels scikit-learn arch。
全部代码只用固定种子的模拟数据,不读外部文件、不联网、不画图,正文的「运行结果」即按这些种子得到;库版本不同时末位小数可能略有差别。
7.2 各章代码的组织
每章「量化实战」有 1–3 个代码块,全册共 33 个,每个代码块都自带 import 和数据生成,可以单独复制运行。本册没有跨章的代码依赖:没有任何一章需要先运行或保存另一章的代码为模块;同一章内的多个代码块之间也不共享变量或函数。以下几点值得注意:
- 第 13 章用
statsmodels.sandbox.regression.gmm.IV2SLS做模糊断点的 TSLS。sandbox 接口可能变动,且只给同方差标准误;正式研究建议改用linearmodels.iv.IV2SLS取稳健或聚类标准误。第 12 章的 TSLS 是手写实现,可对照。 - 第 15b、17b 章用
adfuller与coint,第 17b 章用VECM,第 17a 章用statsmodels.tsa.api.VAR。 - 第 05、07、10、12、15b、17a、17b、18、19a、19b 章含蒙特卡洛实验(数百到数万次重复),单个代码块在普通笔记本上需要数秒到一两分钟;嫌慢可把重复次数(多数代码里是
nsim)调小,结论的定性部分不变。 - 第 06 与 19a 章、第 14 与 19c 章分别用标量和矩阵写法演示了同一结论(Frisch–Waugh、\((1+k/n)\) 定律与主成分),可以对照阅读。