量化交易中文教材

第 03 册 数理统计与统计推断 · 本册导读

本册把 Wasserman《All of Statistics》改写成一册面向量化交易的统计推断教材。读完它,你应当能回答量化研究中最常被问、也最常答错的一类问题:这个回测数字有多大的误差?这个信号是真的还是挑出来的?这个参数估计在模型错了时还能信多少?


一、本册定位

1.1 底本

项目 内容
书名 All of Statistics: A Concise Course in Statistical Inference
作者 Larry Wasserman(卡内基梅隆大学统计系)
版本 Springer Texts in Statistics,2004 年初版(精读笔记依据 2005 年修订二印)
PDF 页数 446 页;正文 24 章,分三部分:第 I 部分概率(第 1–5 章)、第 II 部分统计推断(第 6–12 章)、第 III 部分统计模型与方法(第 13–24 章)
页码换算 原书页码 ≈ PDF 页码 − 17(原书 p.3 = PDF p.20)。各章「原书对照」表一律给 PDF 页码

Wasserman 的写法是"少而全":一本书覆盖从概率、经典推断、bootstrap、贝叶斯、决策理论,到回归、因果、图模型、非参数平滑、分类、MCMC 的全部主干。它的证明常常只给骨架,但定理选得准,对"什么条件下这个方法会坏"格外坦白。这两点正适合量化研究者:我们要的不是每个定理的完整证明,而是知道每个工具的适用边界。

1.2 本册的改写方式

本册 24 个文件,文件编号跟原书章号走,所以编号不连续,这是有意的:

  • 第 01 章把原书第 1–5 章(概率、随机变量、期望、不等式、收敛)压缩成一章。概率论的系统讲解在第 02 册(Ross),本册只用 Wasserman 的记号快速过一遍,并把原书比 Ross 更有特色的三块讲透:集中不等式(Hoeffding)、收敛模式与 Slutsky 定理、Delta 方法。因此没有 02–05 号文件。
  • 第 10 章拆成 10a(单个检验)与 10b(多重检验)。原书 10.7 节只有 4 页,但对量化而言是全书最值钱的内容,10b 用一整章展开到数据挖掘偏差、PSR/DSR、Reality Check。
  • 第 13、22、24 章内容多,各拆成 a、b 两篇。
  • 第 17 章合并了原书第 17 章(有向图)与第 18 章(无向图),因此没有 18 号文件。
  • 附录 A1 整理原书的符号表、分布表,并补充 scipy.stats 参数化对照与第 19–24 章中英文术语表。

每章的结构相同:学习目标 → 正文(定义、定理、原书例题)→ 量化实战(可运行的 Python 代码与输出)→ 本章小结(含公式表)→ 练习(基础、进阶、原书推荐习题)→ 原书对照。凡原书没有、由本教材补充的内容,正文或原书对照表里都有注明。

1.3 在量化交易中的作用

量化研究的每一个数字——年化收益、Sharpe 比率、因子 IC、胜率、VaR、回归贝塔——都是估计量,都带着抽样误差。本册提供的就是处理这种误差的全部基本工具:

  • 误差有多大:标准误、置信区间、Delta 方法(第 01、06、09 章);分布未知时用 bootstrap,时间序列用块 bootstrap(第 07、08 章)。
  • 是真是假:Wald、似然比、置换检验,p 值的正确读法(第 10a 章);同时试了几百个策略之后怎么办(第 10b 章、第 22b 章)。
  • 怎么估计:最大似然是 GARCH、ARMA、状态空间、跳跃、Hawkes 等几乎所有金融计量模型的估计方法(第 09 章);模型错设时的三明治标准误(第 09、13a 章)。
  • 怎么估得更好:收缩估计(贝叶斯、James–Stein、Ledoit–Wolf、Black–Litterman)在期望收益和协方差估计上一致优于样本估计(第 11、12 章)。
  • 选哪个模型:训练误差为什么一定低估样本外误差,\(C_p\)/AIC/BIC/交叉验证怎么修正(第 13b 章),时间序列上怎么做交叉验证(第 22b 章)。
  • 关联还是因果:事件研究、因子效应能否当作可交易规律(第 16、17 章)。
  • 非线性与分类:收益分布形状、因子与收益的非线性关系(第 20、21 章),涨跌分类器(第 22a 章)。
  • 模拟:期权定价、尾部风险的蒙特卡洛与重要性抽样,贝叶斯模型的 MCMC(第 24a、24b 章)。

1.4 与其他各册的关系

册 关系
第 01 册 线性代数 第 13a、14、17 章用到投影、正定矩阵、Cholesky、精度矩阵;第 21 章的正交基是线性代数在函数空间的推广
第 02 册 概率论(Ross) 本册第 01 章是它的速览版;第 23 章的马尔可夫链、泊松过程与第 02 册第 09 章互补;第 24a 章与第 02 册第 10 章(随机模拟)互补。注意第 02 册用速率参数、本册用尺度参数(见附录 A1.8)
第 04 册 数值最优化 MLE、logistic 回归(IRLS 即 Newton 法)、SVM 对偶问题的数值求解
第 05 册 计量经济学 同样讲回归,但第 05 册侧重因果识别(工具变量、面板、双重差分)和异方差/自相关稳健推断;本册侧重推断骨架与预测(模型选择)。建议先读本册第 13a–13b、16 章再读第 05 册
第 06 册 金融时间序列 本册的 MLE、似然比检验、EM、bootstrap、MCMC 是第 06 册 GARCH、马尔可夫转换、随机波动率、极值理论的方法基础;第 06 册第 12a 章是本册第 24b 章的直接延续
第 07 册 市场微观结构 第 07 册第 22b 章(技能与运气的统计检验)与本册第 10b 章从两个角度讲同一件事
第 08 册 衍生品 第 24a 章的蒙特卡洛定价与第 08 册第 21b 章(蒙特卡洛与方差缩减)衔接
第 10 册 神经网络 第 22a 章的分类框架(Bayes 规则、偏差–方差、核方法)是理解神经网络分类器的统计背景
第 11 册 综合实战 第 08、10b、13b、22b 章的回测纪律(块 bootstrap、多重检验校正、前推验证)在第 11 册落地

1.5 贯穿全册的五条主线

本册由四位编写者分段完成(第 01–08 章、第 09–12 章、第 13a–17 章、第 19–24b 章及附录),各章独立成篇,但下面五条主线把它们串成一个整体。读到某一章时,留意它在哪条线上、前后接的是什么。

主线一:误差从哪里来。 第 01 章用 CLT 与 Delta 方法给出样本均值及其光滑函数的标准误;第 06 章把"估计量是随机变量"说成一般框架;第 07 章把它推广到任意统计泛函;第 08 章在没有公式时用 bootstrap 数值地算;第 09 章在参数模型中用 Fisher 信息算;第 13a 章落到回归系数上。同一个 Sharpe 比率,第 01 章用 Delta 方法、第 08 章用 bootstrap、第 09 章用 MLE 各算了一遍,三者可以互相验证。

主线二:偏差与方差的权衡。 第 06 章的 \(\text{MSE}=\text{bias}^2+\text{方差}\) 在全书反复出现:第 12 章的收缩估计用一点偏差换大量方差;第 13b 章的模型选择是在变量个数上做权衡;第 20、21 章是在平滑参数上做权衡;第 22b 章说明分类中的权衡与回归不同。量化中的回看窗口、平滑系数、因子个数,都是这条线上的同一个问题。

主线三:挑选会制造假象。 第 10b 章从多重检验讲起,第 13b 章证明训练误差系统性低估预测风险,第 22b 章用一致收敛界量化"从 \(m\) 个策略中挑最好的"的乐观偏差,第 12 章的"赢家诅咒"和第 24b 章的分层收缩给出贝叶斯的修正。这条线是本册对量化研究最直接的贡献。

主线四:收缩。 第 11 章的共轭后验均值是 MLE 与先验均值的加权平均,第 12 章证明参数多于两个时样本均值不可容许、James–Stein 一致更优,第 24b 章用分层模型让数据自己决定收缩强度。期望收益、协方差矩阵、基金经理 alpha 的估计都应当收缩。

主线五:关联不是因果。 第 13a 章提醒回归系数只是关联,第 15 章用列联表检验独立性,第 16 章用潜在结果定义因果,第 17 章用有向图给出同一套思想的另一种语言并解释幸存者偏差,第 19 章把条件独立推广到多维离散数据。

各章符号以原书为准,几处跨章约定差异(分位数定义、Gamma 参数化、AIC 符号)已在第六节列出,并在相关章节注明。


二、前置知识与自测

2.1 开始前应会什么

  • 概率论:第 02 册第 01–08 章的内容,特别是条件期望与全方差公式、常见分布的均值方差、多元正态、大数定律与中心极限定理的陈述。本册第 01 章会快速复习,但不再从头讲。
  • 微积分:多元函数求导、泰勒展开到二阶、换元积分。MLE、Delta 方法、Fisher 信息都只是这些操作的组合。
  • 线性代数:矩阵乘法与转置、逆、正定矩阵、二次型 \(w^T\Sigma w\)。读第 13a、14、17 章时需要第 01 册第 00 章的水平。
  • Python:会用 numpy 生成随机数、做向量化运算,会调用 scipy.stats 的分布函数。本册代码不依赖任何自定义模块。

2.2 自测题

下面 5 道题能在 1 小时内做完、且答案与要点一致,就可以直接开始;有 2 道以上卡住,先回第 02 册对应章节补课。

自测 1(期望与方差)。 \(X_1,\dots,X_n\) IID,均值 \(\mu\),方差 \(\sigma^2\)。求样本均值 \(\bar X_n\) 的期望与方差;再求样本方差 \(S^2=\frac1{n-1}\sum(X_i-\bar X_n)^2\) 的期望。

答案要点:\(\mathbb E\bar X_n=\mu\),\(\mathbb V\bar X_n=\sigma^2/n\);利用 \(\sum(X_i-\bar X)^2=\sum(X_i-\mu)^2-n(\bar X-\mu)^2\) 得 \(\mathbb ES^2=\sigma^2\)。若除以 \(n\) 则有偏,偏差 \(-\sigma^2/n\)。这是本册第 06 章"偏差、标准误"的起点。

自测 2(全方差公式)。 某策略每天以 0.3 的概率处于"危机"状态,日收益(%)服从 \(N(-5,4)\),否则服从 \(N(1,1)\)。求日收益的均值与方差。

答案要点:\(\mathbb EY=0.3\times(-5)+0.7\times1=-0.8\)。\(\mathbb V Y=\mathbb E[\mathbb V(Y\mid X)]+\mathbb V[\mathbb E(Y\mid X)]=(0.3\times4+0.7\times1)+(0.3\times4.2^2+0.7\times1.8^2)=1.9+7.56=9.46\)。状态之间的均值差贡献了大部分方差。第 09 章的 EM 算法估计的正是这类混合模型。

自测 3(二次型与组合方差)。 两资产年化波动 20% 与 30%,协方差矩阵 \(\Sigma=\begin{pmatrix}0.04&0.012\\0.012&0.09\end{pmatrix}\)。求等权组合的年化波动和两资产的相关系数。

答案要点:\(w^T\Sigma w=0.25\times0.04+0.25\times0.09+2\times0.25\times0.012=0.0385\),波动约 19.6%;相关系数 \(0.012/(0.2\times0.3)=0.2\)。第 14 章把它推广为 \(\mathbb V(AX)=A\Sigma A^T\)。

自测 4(中心极限定理)。 日收益 IID,均值 0.04%,标准差 1%。用 CLT 求一年(250 天)累计收益为负的概率。

答案要点:累计收益均值 10%,标准差 \(\sqrt{250}\times1\%\approx15.8\%\),概率 \(\approx\Phi(-0.632)\approx0.26\)。即使是年化 Sharpe 约 0.63 的策略,也有四分之一的年份亏钱。第 01 章会讨论厚尾、负偏收益下这个近似何时失灵。

自测 5(求极值与编程)。 (a) 对 \(\ell(p)=s\log p+(n-s)\log(1-p)\) 求最大值点。(b) 用 numpy 模拟 10000 组、每组 50 个标准正态观测,验证样本均值的标准差约为 \(1/\sqrt{50}\)。

答案要点:(a) 令 \(\ell'(p)=s/p-(n-s)/(1-p)=0\),得 \(\hat p=s/n\),二阶导为负,是最大值——这就是 Bernoulli 的 MLE。(b) rng = np.random.default_rng(0); m = rng.standard_normal((10000, 50)).mean(axis=1); print(m.std(), 1/np.sqrt(50)),两者都约为 0.141。第 08 章的 bootstrap 就是把这里的"从已知分布抽样"换成"从数据本身抽样"。


三、章节地图

标记含义:必学=量化研究的基本功,建议精读并做练习;选学=有明确量化用途,按需要读;速读=了解概念与结论即可,需要时回查。学时为精读正文、运行代码、完成基础练习的估计。

文件 原书章节 一句话内容 学时 标记
第 01 章 概率论速览 第 1–5 章 Hoeffding 不等式、收敛模式、Slutsky、CLT 与 Delta 方法,推出 Sharpe 比率标准误 6 必学(1.2–1.3 节速读)
第 06 章 统计推断的基本框架 第 6 章 模型、统计泛函、偏差/标准误/MSE、置信区间的正确含义 3 必学
第 07 章 经验分布函数与统计泛函 第 7 章 经验 CDF、DKW 置信带、插入原则;历史模拟 VaR/ES 就是插入估计 3 必学
第 08 章 Bootstrap 第 8 章 bootstrap 方差与三种置信区间、刀切法、失效情形,补充块 bootstrap 5 必学
第 09 章 参数推断 第 9 章 MLE 的性质、Fisher 信息、Delta 方法、参数 bootstrap、充分统计量、指数族、Newton–Raphson 与 EM 8 必学
第 10a 章 假设检验与 p 值 第 10 章(10.7 节除外) Wald 检验与功效、p 值、\(\chi^2\)、置换、似然比、拟合优度检验 5 必学
第 10b 章 多重检验与策略过拟合 10.7 节 Bonferroni、Holm、BH;数据挖掘偏差、PSR/DSR、Reality Check 5 必学
第 11 章 贝叶斯推断 第 11 章 共轭先验与收缩、后验模拟、Jeffreys 先验、贝叶斯检验与 Lindley 悖论、Black–Litterman 6 必学
第 12 章 统计决策理论 第 12 章 损失与风险、贝叶斯规则、minimax、可容许性、Stein 悖论与 James–Stein、Ledoit–Wolf 5 必学
第 13a 章 线性回归与最小二乘推断 13.1–13.5 节 OLS 与 MLE、系数标准误与检验、预测区间、多元回归、稳健标准误 4 必学
第 13b 章 模型选择与 Logistic 回归 13.6–13.9 节 训练误差的偏差、\(C_p\)/AIC/BIC/交叉验证、逐步回归、logistic 回归与 IRLS 5 必学
第 14 章 多元模型 第 14 章 随机向量、多元正态与马氏距离、相关系数的 Fisher \(z\) 区间、多项分布 3 必学
第 15 章 独立性推断 第 15 章 列联表检验、优势比、两样本 KS;重叠标签让检验失真 3 选学
第 16 章 因果推断 第 16 章 潜在结果、随机化、混杂与调整公式、辛普森悖论 3 选学
第 17 章 图模型:有向图与无向图 第 17–18 章 条件独立、d-分离、碰撞点偏差、干预、精度矩阵与偏相关网络 4 选学
第 19 章 对数线性模型 第 19 章 多维列联表的对数线性展开、层次模型、Poisson GLM 拟合 2 速读
第 20 章 非参数曲线估计 第 20 章 偏差–方差权衡、直方图、核密度、Nadaraya–Watson 回归、交叉验证选带宽 6 必学
第 21 章 正交函数与小波平滑 第 21 章 正交级数估计、Haar 小波、阈值去噪、MAD 噪声估计 3 选学
第 22a 章 分类器:从 Bayes 规则到核方法 第 22 章(22.1–22.7、22.9–22.11 节) Bayes 规则、LDA/QDA、logistic、朴素 Bayes、树、SVM、核化、集成 5 选学
第 22b 章 分类误差评估:交叉验证与 VC 界 22.8 节及习题 交叉验证、有限族与 VC 一致界、时间序列交叉验证 4 必学
第 23 章 随机过程:马尔可夫链与泊松过程 第 23 章 转移矩阵、状态分类、平稳分布与主定理、转移概率 MLE、泊松过程 4 选学
第 24a 章 蒙特卡洛积分与重要性抽样 24.1–24.3 节 蒙特卡洛标准误、后验抽样、重要性抽样、接受–拒绝;期权与尾部风险 4 必学
第 24b 章 马尔可夫链蒙特卡洛 24.4–24.5 节 Metropolis–Hastings、Gibbs、分层模型收缩、MCMC 诊断 4 选学
附录 A1 常用分布与符号表 符号表、分布表 符号、分布表、scipy.stats 参数化对照、术语表 1 速读(随时查)

全册合计约 105 学时。按每周 10 学时,完整学完约 10–11 周。


四、学习路径

4.1 量化研究速成路径(约 55 学时,5–6 周)

目标:能正确给回测指标配误差、做检验、防过拟合、估计常用模型。按顺序:

  1. 第 01 章 1.4–1.6 节:Hoeffding、收敛、Delta 方法、Sharpe 标准误。1.2–1.3 节扫一眼记号即可。
  2. 第 06 章:重点 6.3 节(MSE 分解)与 6.4.2 节(置信区间的正确理解)。
  3. 第 07 章:插入原则与历史模拟 VaR 的局限。
  4. 第 08 章:重点 8.4 节三种区间与 8.5.3 节块 bootstrap;8.6 节代码务必运行。
  5. 第 09 章:9.3–9.10 节与 9.15–9.16 节(数值 MLE、EM、t 分布拟合);9.13–9.14 节(充分统计量、指数族)可跳过。
  6. 第 10a 章:10.1–10.3 节与 10.9 节量化实战(功效与所需年数、Newey–West)。
  7. 第 10b 章:全章精读,这是本路径的核心。
  8. 第 11 章:11.2 节(共轭与收缩)、11.8 节(贝叶斯检验与 Lindley 悖论)、11.10 节(A/B 测试、Black–Litterman)。
  9. 第 12 章:12.1–12.3 节与 12.7–12.8 节(James–Stein、Ledoit–Wolf)。
  10. 第 13a 章全章,第 13b 章 13b.1–13b.7 节与 13b.10 节。
  11. 第 22b 章:22b.1–22b.3 节与 22b.7–22b.8 节(时间序列交叉验证)。
  12. 第 24a 章:24a.2–24a.4 节。

读完这条路径,可以接着读第 05 册第 03–07 章或第 06 册第 01–03b 章。

4.2 完整系统路径(约 105 学时,10–11 周)

按文件编号顺序通读,所有练习的"基础"部分都做,"进阶"部分每章至少做 3 题。建议分五段:

阶段 章节 周数 阶段目标
一、工具与框架 01、06、07、08 2 会算标准误、会用 bootstrap
二、经典推断 09、10a、10b 2 会写似然、做检验、校正多重检验
三、贝叶斯与决策 11、12 1.5 理解收缩,知道何时 MLE 不再最优
四、模型 13a、13b、14、15、16、17、19 2.5 回归、模型选择、多元与离散数据、因果与条件独立
五、非参数、学习与模拟 20、21、22a、22b、23、24a、24b 2.5 平滑、分类、误差评估、蒙特卡洛与 MCMC

附录 A1 在整个过程中随时查阅,尤其是遇到 Gamma、指数分布的参数时。

4.3 补充:统计学习方向(约 40 学时)

为第 10 册神经网络和机器学习选股做准备:第 06 章 → 第 08 章 → 第 13a 章 → 第 13b 章 → 第 20 章 → 第 22a 章 → 第 22b 章 → 第 12 章 12.7 节(Stein 悖论:参数多时收缩优于 MLE)→ 第 24b 章(贝叶斯 logistic 回归练习)。


五、核心公式与概念速查表

# 概念 公式 / 结论 出处
1 Hoeffding 区间 \(\bar X_n\pm\sqrt{\log(2/\alpha)/(2n)}\),对任何 \(n\) 严格成立(\(X_i\in[0,1]\)) 01、06
2 收敛关系 均方 ⇒ 依概率 ⇒ 依分布;依分布到常数 ⇔ 依概率到常数 01
3 Slutsky \(X_n\rightsquigarrow X\),\(Y_n\rightsquigarrow c\) ⇒ \(X_n+Y_n\rightsquigarrow X+c\),\(X_nY_n\rightsquigarrow cX\) 01
4 Delta 方法 \(\text{se}(g(\hat\theta))\approx\vert g'(\theta)\vert \,\text{se}(\hat\theta)\);多元 \(\sqrt{\nabla g^T\Sigma\nabla g/n}\) 01、09
5 Sharpe 标准误 \(\sqrt{(1-\gamma_3SR+\frac{\gamma_4-1}4SR^2)/n}\),正态时 \(\sqrt{(1+SR^2/2)/n}\) 01
6 MSE 分解 \(\text{MSE}=\text{bias}^2+\mathbb V(\hat\theta)\) 06、12
7 置信区间 \(\mathbb P_\theta(\theta\in C_n)\ge1-\alpha\) 对所有 \(\theta\);随机的是区间 06
8 DKW 不等式 \(\mathbb P(\sup_x\vert \hat F_n-F\vert >\epsilon)\le2e^{-2n\epsilon^2}\) 07
9 插入原则 \(\hat\theta=T(\hat F_n)\);线性泛函的插入估计是样本平均 07
10 Bootstrap 方差 \(v_{boot}=\frac1B\sum_b(T^*_b-\bar T^*)^2\),近似 \(\mathbb V_{\hat F_n}(T_n)\) 08
11 枢轴 / 百分位区间 \((2\hat\theta-\theta^*_{1-\alpha/2},\,2\hat\theta-\theta^*_{\alpha/2})\) / \((\theta^*_{\alpha/2},\,\theta^*_{1-\alpha/2})\) 08
12 块 bootstrap 自相关数据按块重抽样,块长 \(L\propto n^{1/3}\) 量级;IID bootstrap 会低估标准误 08
13 Fisher 信息 \(I(\theta)=\mathbb E s^2=-\mathbb E\,\partial^2_\theta\log f\),\(I_n=nI\) 09
14 MLE 渐近正态 \(\hat\theta\approx N(\theta,1/I_n(\theta))\);多参数 \(J_n=I_n^{-1}\) 09
15 三明治协方差 模型错设时 \(\mathbb V(\hat\theta)\approx A^{-1}BA^{-1}/n\),回归中即 White 稳健标准误 09、13a
16 EM 算法 E 步求完全数据对数似然的条件期望,M 步最大化;似然单调不降 09
17 Wald 检验与功效 \(W=(\hat\theta-\theta_0)/\widehat{\text{se}}\);检验策略所需年数 \(\approx(2.8/SR_{\text{年}})^2\) 10a
18 p 值 \(H_0\) 下服从 Uniform(0,1);不是 \(H_0\) 为真的概率 10a
19 似然比检验 \(\lambda=2\log\frac{\mathcal L(\hat\theta)}{\mathcal L(\hat\theta_0)}\rightsquigarrow\chi^2_{r-q}\);参数在边界时失效 10a
20 Bonferroni / Holm \(P_i<\alpha/m\);Holm 逐步 \(P_{(k)}\le\alpha/(m-k+1)\),控制 FWER 10b
21 Benjamini–Hochberg 拒绝 \(P_{(i)}<i\alpha/m\) 的最大 \(i\) 及以下;FDR \(\le m_0\alpha/m\) 10b
22 压缩 Sharpe(DSR) 以 \(SR_0=\sigma_{SR}\,\mathbb E\max Z\) 为基准算 PSR;\(N\) 越大门槛越高 10b
23 共轭与收缩 后验均值 \(=w\hat\theta_{MLE}+(1-w)\cdot\)先验均值,\(w=\frac{1/\text{se}^2}{1/\text{se}^2+1/b^2}\) 11
24 Jeffreys 先验 \(f(\theta)\propto\sqrt{I(\theta)}\),参数变换下不变 11
25 贝叶斯规则 平方 / 绝对 / 0-1 / 分位数损失 → 后验均值 / 中位数 / 众数 / 分位数 12
26 James–Stein \(k\ge3\) 时 \(\big(1-\frac{k-2}{\sum X_j^2}\big)^+X_i\) 一致优于 \(X\);样本均值不可容许 12
27 OLS \(\hat\beta=(X^TX)^{-1}X^TY\),\(\mathbb V(\hat\beta\mid X)=\sigma^2(X^TX)^{-1}\),\(\hat\sigma^2=\text{RSS}/(n-k)\) 13a
28 预测区间 \(\hat Y_*\pm z_{\alpha/2}\sqrt{\widehat{\mathbb V}(\hat Y_*)+\hat\sigma^2}\),\(n\to\infty\) 也不收缩到零 13a
29 训练误差的偏差 \(\mathbb E\hat R_{tr}-R=-2\sum\text{Cov}(\hat Y_i,Y_i)\),线性回归中 \(=-2\vert S\vert \sigma^2\) 13b
30 AIC / BIC \(\ell_S-\vert S\vert \) / \(\ell_S-\frac{\vert S\vert }2\log n\),取最大(原书符号约定);AIC 求预测,BIC 求真模型 13b、19
31 留一 CV 捷径 \(\sum_i\big(\frac{Y_i-\hat Y_i}{1-U_{ii}}\big)^2\),\(U\) 为帽子(平滑)矩阵 13b、20
32 对数优势比 \(\hat\gamma=\log\frac{X_{00}X_{11}}{X_{01}X_{10}}\),\(\text{se}=\sqrt{\sum1/X_{ij}}\);logistic 系数即对数优势比 13b、15
33 Fisher \(z\) \(\text{artanh}(\hat\rho)\pm z_{\alpha/2}/\sqrt{n-3}\),再取 \(\tanh\);厚尾下覆盖不足 14、17
34 调整公式 \(\theta(x)=\int\mathbb E(Y\mid X=x,Z=z)\,dF_Z(z)\),对 \(Z\) 的边际分布积分 16、17
35 高斯图模型 \(X_i\amalg X_j\mid\text{rest}\iff\Omega_{ij}=0\),偏相关 \(-\Omega_{ij}/\sqrt{\Omega_{ii}\Omega_{jj}}\) 17
36 核密度估计 偏差 \(\propto h^2f''\),方差 \(\propto1/(nh)\);\(h^*\asymp n^{-1/5}\),风险 \(\asymp n^{-4/5}\);\(d\) 维 \(n^{-4/(4+d)}\) 20
37 有限族一致界 \(\mathbb P(\max_h\vert \hat L_n(h)-L(h)\vert >\epsilon)\le2me^{-2n\epsilon^2}\);VC 维代替 \(m\) 22b
38 马尔可夫链 \(\pi=\pi P\);转移概率 MLE \(n_{ij}/n_i\);平均持续时间 \(1/(1-p_{ii})\) 23
39 蒙特卡洛与重要性抽样 \(\text{se}=s/\sqrt N\);\(\hat I=\frac1N\sum hf/g\),\(g\) 尾部要比 \(f\) 厚,最优 \(g\propto\vert h\vert f\) 24a
40 Metropolis–Hastings 接受概率 \(\min\big\{\frac{f(y)q(x\mid y)}{f(x)q(y\mid x)},1\big\}\);ESS \(=N/(1+2\sum\rho_k)\) 24b

六、勘误汇总

6.1 原书错误(各章已在正文中更正)

文件 说明
06 定理 6.10 的证明中,原书引用"定理 5.4(b)",按内容应为 5.4(a)(均方收敛蕴含依概率收敛)。
09 定理 9.24(原书式 (9.15))分子多写了 \(\sqrt n\),标准化应直接除以 \(\widehat{\text{se}}\)。
09 例 9.29(变异系数)标准误的第一项,原书印作 \(1/\hat\mu^4\),按推导应为 \(\hat\sigma^4/\hat\mu^4\)。
09 例 9.45(二项分布写成指数族)中 \(B(\theta)\) 原书误印为 \(-n\log\theta\),应为 \(-n\log(1-\theta)\)。
09 例 9.49(正态混合的 EM)完全数据对数似然中原书漏了平方号。
13b IRLS 算法第 3 步原书文字写作"regress \(Z\) on \(Y\)",应为 \(Z\) 对 \(X\) 的加权回归,公式无误。
21 习题 11 的混合分布,原书把离群成分的比例写成 0.95,应为 0.05(已对照原书 PDF p.352 核实为印刷错误)。
24a 例 24.4 原书把计数称为"存活数",与模型设定矛盾,应为死亡数。
24a 例 24.6 原书标为方差的 0.0039 与 0.0002,按数值是标准差。

6.2 精读笔记的更正与补全

文件 说明
08 例 8.6 法学院数据最后一所学校的 GPA,精读笔记记为 3.96,应为 2.96(Efron 原始数据,此时相关系数恰为 0.776)。
21 例 21.7 爪形密度的权重在精读笔记中字符损坏,本章按 Marron–Wand 的标准定义补全。

6.3 记号约定差异(不是错误,但容易抄错)

文件 说明
01、07 原书分位数函数写作 \(\inf\{x:F(x)>q\}\),第 01 章保留原书写法;第 07 章起统一用 \(\ge\),二者只在 CDF 有平台时不同。
11、A1 第 11 章 Gamma–Poisson 共轭里的 Gamma 用率参数;原书分布表、第 09、23 章与附录 A1 用尺度参数。用 scipy.stats.gamma 时一律传 scale。
10a 本章小节编号沿用原书的 10.x,其他拆分章用 10b.x、13a.x 等,章内交叉引用均按各自编号。
13b、19 AIC、BIC 按原书约定取"对数似然减惩罚、越大越好",与 statsmodels 输出的 \(-2\ell+2k\)(越小越好)相差因子 \(-2\)。

6.4 需回查原书的地方

文件 说明
24a 例 24.4(LD50):已对照 PDF p.410 确认数据与剂量,复现得后验均值约 5.6,原书报告 4.04、区间 (3,5) 无法复现。原书的计算口径仍待确认。

七、配套代码说明

7.1 运行环境

  • Python 3.10 及以上;依赖 numpy、scipy、pandas、statsmodels、scikit-learn。本册没有用到 arch(GARCH 估计在第 06 册),也不需要 matplotlib 才能运行(代码只打印数值结果)。
  • 安装:pip install numpy scipy pandas statsmodels scikit-learn,或者用 uv 临时环境:uv run --with numpy --with scipy --with pandas --with statsmodels --with scikit-learn python 文件名.py。
  • 主编复核(2026 年 10 月):把全部 23 个章节文件和附录中的 40 段 Python 代码逐段单独提取运行,环境为 Python 3.13、numpy 2.5、scipy 1.18、statsmodels 0.15、scikit-learn 1.9,全部正常结束,单段最长约 30 秒(第 13b 章全子集模型选择)。第 19 章拟合饱和模型时 statsmodels 会给出一条 PerfectSeparationWarning,不影响结果。
  • 凡用到随机数的代码都固定了种子,输出应与正文所列数值一致;不同版本的随机数生成或优化器可能带来末位差异。

7.2 代码组织与跨章依赖

每段代码都是自包含的:各自 import、各自生成模拟数据,不依赖其他章节定义的模块或变量,可以按任意顺序单独运行。同一章内的多段代码之间也没有变量依赖。

以下练习题需要借用其他章的代码或数据:

练习 依赖
第 24b 章练习 7(贝叶斯 logistic 回归) 建议用第 22a 章 22a.10 节的模拟涨跌数据:先运行那段代码,用其中的 make(n) 生成 Xtr、ytr
第 24b 章练习 9(马尔可夫切换的 Gibbs 抽样) 状态路径的模拟与转移矩阵 MLE 可改写第 23 章 23.4 节实验 (1) 的代码(那里是三状态链,练习改为两状态);FFBS 可参考第 06 册
第 10b 章练习 9(Reality Check) 需要块 bootstrap:直接复制第 08 章 8.6.3 节代码中的 stationary_boot 或 moving_block_boot 函数
第 07 章练习 9、第 14 章练习 7 用第 08 章的 bootstrap 数值验证相关系数的渐近方差
第 01 章练习 9 修改第 01 章 1.6.2 节 Sharpe 标准误代码中的暴跌概率

7.3 代码中反复出现的量化设定

为方便对照,各章模拟数据的常见设定如下:日收益以小数或百分比表示(看代码注释),一年按 250 或 252 个交易日;厚尾收益多用标准化 \(t_4\) 或 \(t_5\);"负偏策略"用"小概率暴跌、平时小赚"的两点混合(第 01、06、08 章共用这一设定);市场状态用两状态混合(第 09 章 EM)或马尔可夫链(第 10a、23 章)。这些都是模拟数据,不需要下载任何行情。原书部分习题使用作者网站的数据集(如第 07 章的斐济地震、老忠实泉),属于可选内容。