第 02 册 概率论 · 本册导读
本册以 Ross《A First Course in Probability》第 9 版为底本,用 14 个章节文件和 1 个附录覆盖原书全部 10 章。它是整套教材的概率基础:后面的统计推断、计量、时间序列、衍生品定价和策略评估,都默认读者已经掌握这里的语言和工具。
一、本册定位
1. 底本
| 项目 | 内容 |
|---|---|
| 书名 | A First Course in Probability(第 9 版) |
| 作者 | Sheldon M. Ross |
| 出版 | Pearson,2014 |
| PDF 页数 | 484 页 |
| 页码换算 | 书内页码 = PDF 页码 − 13(正文第 1 页在 PDF p.14) |
| 原书结构 | 正文 10 章;附录 A 为部分习题答案,附录 B 为自测题完整解答(PDF p.465–476 前后);封底为常用分布表(PDF p.481–484) |
各章末尾「原书对照」表都给出 PDF 页码(第 01–06b 章另列书内页码),查原书统一按 PDF 页码翻。
原书是美国本科一学期的概率论入门教材,特点是例题极多、证明以直观为主、不用测度论。本册保留了原书的主线、例题编号和习题编号,便于对照原书做题;同时在每章增加「量化实战」一节,用 Python 把概率结论落到交易、风控和回测问题上。
2. 本册结构
原书第 4、6 章内容多,各拆成两篇;第 7 章是全书最长、对量化最有用的一章,拆成三篇。拆分后的文件名用 a/b/c 区分,章内小节编号按教学顺序重排,例题编号、命题编号和公式编号仍沿用原书(例如第 04a 章的「例 9d」「式 (9.1)」来自原书 4.9 节)。读者对照原书时以例题编号为准。
| 原书章 | 本册文件 | 拆分方式 |
|---|---|---|
| 第 4 章 随机变量 | 04a、04b | 04a 讲随机变量、期望、方差、和的期望与 CDF(原书 4.1–4.5、4.9、4.10);04b 讲常见离散分布(原书 4.6–4.8) |
| 第 6 章 联合分布 | 06a、06b | 06a 讲联合分布、独立性、和的分布(6.1–6.3);06b 讲条件分布、次序统计量、变换、可交换性(6.4–6.8) |
| 第 7 章 期望的性质 | 07a、07b、07c | 07a 讲和的期望与协方差(7.1–7.4、7.9);07b 讲条件期望与预测(7.5–7.6);07c 讲矩母函数与多元正态(7.7–7.8) |
另有附录 A1 常用分布速查,汇总 16 个分布的密度、矩、MGF、生成方法、量化用途以及 scipy.stats 参数化差异。
3. 在量化交易中的作用
量化交易处理的几乎每个对象都是随机变量:一笔交易的盈亏、一天的收益、一分钟内的成交笔数、一家公司的违约时间。本册的用途可归纳为六类:
- 描述单个不确定量:期望、方差、VaR,以及「胜率高不等于期望为正」(04a、05)。
- 描述多个量的关系:协方差、相关系数、多元正态,是组合风险 \(w^\top\Sigma w\)、对冲比率和因子模型的基础(06b、07a、07c)。
- 用信息更新判断:Bayes 公式、条件期望、收缩估计,对应「显著因子里有多少是真的」「回测最好的策略真实水平多高」(03、06b、07b)。
- 判断结果是不是运气:二项尾概率、最长连串、次序统计量、Boole 不等式、CLT,回答「胜率 55% 显著吗」「连亏 9 笔正常吗」「最佳夏普有多少水分」「回测要多长」(02、04b、06b、08)。
- 事件与状态的动态建模:泊松过程刻画订单到达与跳跃,风险率刻画违约,Markov 链刻画市场状态与评级迁移(04b、05、09)。
- 数值计算:逆变换、拒绝法、方差缩减支撑蒙特卡洛定价和风险模拟,置换检验依赖可交换性与随机排列(06b、10)。
4. 与其他各册的关系
本册是第 03–08 册和第 11 册的直接前置。下表列出主要的衔接点。
| 相关分册 | 用到本册的哪些内容 | 本册对应章节 |
|---|---|---|
| 第 01 册 线性代数与矩阵分析 | 本册反过来用到它:协方差矩阵的正定性、Cholesky 分解、平稳分布是特征向量 | 07a、07c、09 |
| 第 03 册 数理统计与统计推断 | 估计、检验、多重检验、贝叶斯推断、bootstrap、蒙特卡洛积分;该册第 01 章是本册的速览 | 全册,尤其 02、03、06b、07c、08、10 |
| 第 04 册 数值最优化 | 均值–方差组合的目标函数 \(w^\top\Sigma w\) | 07a |
| 第 05 册 计量经济学 | 条件期望与最优线性预测是回归的出发点;HAC(Newey–West)标准误的直觉来自自相关和的方差 | 07a、07b、08 |
| 第 06 册 金融时间序列 | 收益分布与厚尾、对数收益可加、VaR、Markov 转换模型、Kalman 滤波(正态条件分布的递推) | 05、06a、06b、07b、07c、09 |
| 第 07 册 市场微观结构与交易 | 订单到达的泊松模型、泊松分拆、买卖单独立性 | 04b、06a、07c、09 |
| 第 08 册 期权期货与衍生品 | 二叉树(二项分布)、对数正态与 \(E[e^Y]\)、风险中性漂移、Black–Scholes 积分、蒙特卡洛与方差缩减、信用风险的风险率 | 01、04b、05、07c、10 |
| 第 09 册 算法与数据结构 | 快速排序期望比较次数(示性变量法)、随机排列 | 07a、10 |
| 第 10 册 神经网络 | 平方损失下的最优预测是条件期望;用网络输出做概率估计(该册第 23 章);熵的概念 | 07b、09 |
| 第 11 册 量化交易综合实战 | 策略评估、多重检验校正、Kelly 准则、deflated Sharpe 的概率基础 | 03、06b、07b、08 |
二、前置知识与自测
1. 开始前应会什么
微积分是主要门槛。需要熟练掌握一元积分(换元、分部积分)、二重积分及交换积分次序、极坐标换元、几何级数与指数级数、\((1+x/n)^n\to e^x\) 这类极限。第 05 章起几乎每页都有积分,第 06a 章起有二重积分,第 06b 章有雅可比行列式。
线性代数只需要矩阵乘法、转置、对称矩阵和正定的概念。第 07a 章的组合方差和第 07c 章的多元正态会用到 \(A\mathbf Z\)、\(AA^\top\) 和 Cholesky 分解,第 09 章的 Markov 链会用到矩阵幂和左特征向量。不熟悉的读者可先看第 01 册第 00 章。
Python 需要会用 numpy 数组、向量化运算和随机数生成器 np.random.default_rng,能读懂 scipy.stats 的分布对象。
不需要测度论,也不需要先学过统计学。
2. 五道自测题
做完再看答案要点。五题都能在 10 分钟内独立做对,可以直接开始;错两题以上,建议先补微积分(尤其是积分与级数)。
题 1(级数) 设 \(0<q<1\)。求 \(\sum_{n\ge1}q^{n-1}\)、\(\sum_{n\ge1}nq^{n-1}\) 和 \(\sum_{k\ge0}\lambda^k/k!\)。
答案要点:\(\frac1{1-q}\);对几何级数逐项求导得 \(\frac1{(1-q)^2}\);\(e^\lambda\)。第一、二个结果在第 04b 章求几何分布的均值时直接用到,第三个是泊松分布归一化的依据。
题 2(分部积分) 设 \(\lambda>0\)。求 \(\int_0^\infty x\lambda e^{-\lambda x}dx\) 与 \(\int_0^\infty x^2\lambda e^{-\lambda x}dx\),并证明 \(\Gamma(n)=\int_0^\infty x^{n-1}e^{-x}dx=(n-1)!\)。
答案要点:\(1/\lambda\) 与 \(2/\lambda^2\)(于是指数分布方差为 \(1/\lambda^2\));分部积分得 \(\Gamma(n)=(n-1)\Gamma(n-1)\),再由 \(\Gamma(1)=1\) 归纳。
题 3(二重积分) 计算 \(\iint_{0<x<y<1}8xy\,dx\,dy\);再用极坐标证明 \(\int_{-\infty}^{\infty}e^{-x^2/2}dx=\sqrt{2\pi}\)。
答案要点:先对 \(x\) 从 0 到 \(y\) 积分得 \(4y^3\),再积得 1;把积分平方写成二重积分,极坐标下 \(\int_0^{2\pi}\int_0^\infty e^{-r^2/2}r\,dr\,d\theta=2\pi\)。前者是第 06a 章判断独立性的例子,后者是正态密度归一化和 Box–Muller 方法的来源。
题 4(矩阵) \(\Sigma=\begin{pmatrix}4&1\\1&9\end{pmatrix}\),\(w=(0.5,0.5)^\top\)。求 \(w^\top\Sigma w\),并说明为什么协方差矩阵必须半正定。
答案要点:\(0.25\times4+0.25\times9+2\times0.25\times1=3.75\);因为 \(w^\top\Sigma w\) 是组合收益的方差,对任何权重都不能为负。
题 5(编程) 用 numpy 模拟掷两颗骰子 \(10^6\) 次,估计点数和为 7 的频率,并说出理论值和模拟误差的量级。
答案要点:
rng=np.random.default_rng(0); s=rng.integers(1,7,(10**6,2)).sum(1); (s==7).mean();理论值 \(1/6\approx0.1667\),标准误约 \(\sqrt{(1/6)(5/6)/10^6}\approx3.7\times10^{-4}\)。误差按 \(1/\sqrt n\) 缩小的原因在第 08 章和第 10 章讲。
三、章节地图
「必学」指量化研究离不开的内容;「选学」指有用但可以按需回看;「速读」指概念要知道、细节可以跳过。学时按认真读正文、做一半练习、运行代码估算,合计约 90 小时。
| 文件 | 原书章节 | 一句话内容 | 建议学时 | 标记 |
|---|---|---|---|---|
| 第 01 章 组合分析 | 第 1 章(1.1–1.6) | 计数原理、排列组合、二项式与多项式系数、隔板法,用于估计因子组合数和二叉树路径数 | 4 | 速读 |
| 第 02 章 概率公理 | 第 2 章(2.1–2.7) | 三条公理、容斥与 Boole 不等式、等可能模型、生日与配对问题、游程分布,引出多重检验 | 6 | 必学 |
| 第 03 章 条件概率与独立性 | 第 3 章(3.1–3.5) | 条件概率、全概率与 Bayes 公式(赔率形式)、独立性、赌徒破产(止损止盈)、条件独立与序贯更新 | 8 | 必学 |
| 第 04a 章 随机变量、期望与方差 | 第 4 章 4.1–4.5、4.9、4.10 | PMF 与 CDF、期望与 LOTUS、方差、期望线性性与示性变量法、报童问题、检验悖论 | 6 | 必学 |
| 第 04b 章 常见离散分布与泊松过程 | 第 4 章 4.6–4.8 | 二项、泊松、几何、负二项、超几何;泊松范式、最长连串、泊松过程初步;胜率检验与过度离散 | 6 | 必学 |
| 第 05 章 连续型随机变量 | 第 5 章(5.1–5.7) | 密度、正态与 VaR、正态近似与样本量、指数分布与风险率、伽马/贝塔等分布、变换与对数正态 | 8 | 必学 |
| 第 06a 章 联合分布、独立性与和的分布 | 第 6 章 6.1–6.3 | 联合与边缘分布、多项分布、独立性判据、泊松分拆、卷积与各分布的可加性、卡方 | 6 | 必学 |
| 第 06b 章 条件分布、次序统计量与变量变换 | 第 6 章 6.4–6.8 | 条件分布、二元正态与对冲比率、贝塔—二项共轭、次序统计量与最佳回测偏差、雅可比变换、可交换性 | 7 | 必学 |
| 第 07a 章 期望的性质:线性性、示性变量与协方差 | 第 7 章 7.1–7.4、7.9 | 期望线性性、示性变量分解、最大–最小恒等式、协方差与和的方差、组合方差、自相关下的标准误 | 6 | 必学 |
| 第 07b 章 条件期望与预测 | 第 7 章 7.5–7.6 | 全期望与全方差公式、随机和、条件化求概率、最优预测与最优线性预测、贝叶斯收缩 | 7 | 必学 |
| 第 07c 章 矩母函数与多元正态分布 | 第 7 章 7.7–7.8 | MGF 与可加性、复合 Poisson、多元正态、\(\bar X\) 与 \(S^2\) 独立、对数正态均值与风险中性漂移 | 6 | 必学 |
| 第 08 章 极限定理 | 第 8 章(8.1–8.6) | Markov/Chebyshev/Chernoff 界、大数定律、CLT 及其失效、Jensen 与波动拖累、回测样本量 | 7 | 必学 |
| 第 09 章 Poisson 过程、Markov 链与熵 | 第 9 章(9.1–9.4) | Poisson 过程的性质、Markov 链与平稳分布、regime 与评级迁移、熵与互信息、编码定理 | 5 | 选学 |
| 第 10 章 随机模拟与方差缩减 | 第 10 章(10.1–10.4) | 伪随机数、逆变换与拒绝法、正态生成、离散分布模拟、对偶/条件化/控制变量/重要性抽样、期权定价与置换检验 | 7 | 必学 |
| 附录 A1 常用分布速查 | 封底分布表、表 7.1–7.2 | 16 个分布的公式、性质、生成方法、量化用途,scipy.stats 参数化对照 |
1 | 速读 |
章内标为「选读」的小节有:1.6 方程的整数解个数、2.5 概率的连续性、6.8 可交换随机变量(但它是置换检验的前提,建议至少读结论)、7.2.5 概率方法与最大–最小恒等式、7.9 期望的一般定义、8.6 Poisson 近似的误差界、9.4 编码理论与熵。
四、学习路径
路径 A:量化研究速成路径(约 50 小时)
适合已经在做量化研究、需要尽快补齐工具的读者,按「单变量 → 多变量 → 条件化 → 极限 → 模拟」推进,每章都要跑量化实战代码。
- 第 02 章(2 h):只读容斥、Boole 不等式、生日问题、游程分布与多重检验。
- 第 03 章(5 h):全概率与 Bayes 赔率形式、基础率谬误、赌徒破产、序贯更新。
- 第 04a 章(4 h):期望、方差、示性变量法、报童问题、检验悖论。
- 第 04b 章(4 h):二项检验、泊松与过度离散、最长连串;其余分布只记公式。
- 第 05 章(5 h):正态与 VaR、样本量(例 4j)、指数分布与风险率、对数正态。
- 第 06a 章(3 h):独立性判据、泊松分拆、卷积、对数收益可加。
- 第 06b 章(5 h):二元正态与对冲比率、贝塔—二项共轭、次序统计量、可交换性结论、Box–Muller。
- 第 07a 章(4 h):协方差、和的方差、\(w^\top\Sigma w\)、自相关下的标准误。
- 第 07b 章(5 h):全期望与全方差、随机和、最优线性预测、正态收缩——预测模型的理论核心。
- 第 07c 章(3 h):MGF、复合 Poisson、多元正态、\(E[e^Y]\)、\(\bar X\) 与 \(S^2\) 独立。
- 第 08 章(4 h):Chebyshev、CLT 及其失效、Jensen 与波动拖累、回测样本量。
- 第 10 章(4 h):逆变换、拒绝法、方差缩减、期权定价、置换检验。
- 第 09 章 9.1–9.2 节(2 h):Poisson 过程性质、Markov 链平稳分布与持续期。
可以跳过:第 01 章(遇到计数问题再回查)、2.5–2.6 节、6.7 节除 Box–Muller 外的变换、7.9 节、8.4 节证明、8.6 节、9.3–9.4 节理论部分。
路径 B:完整系统路径(约 90 小时,12 周)
适合准备系统打基础、之后要读第 03 册统计推断和第 08 册衍生品的读者。按文件顺序通读,每章做完「基础」练习和至少一半「进阶」练习,并从「原书推荐习题」中挑 3–5 道做。
| 周次 | 内容 | 周次 | 内容 |
|---|---|---|---|
| 第 1 周 | 第 01 章、第 02 章 | 第 7 周 | 第 07a 章 |
| 第 2 周 | 第 03 章 | 第 8 周 | 第 07b 章 |
| 第 3 周 | 第 04a 章 | 第 9 周 | 第 07c 章,附录 A1 通读一遍 |
| 第 4 周 | 第 04b 章 | 第 10 周 | 第 08 章 |
| 第 5 周 | 第 05 章 | 第 11 周 | 第 09 章 |
| 第 6 周 | 第 06a 章、第 06b 章 | 第 12 周 | 第 10 章,总复习 |
第 6 周的负担最重,可以把第 06b 章顺延到第 7 周、第 07a 章并入第 8 周。每读完一章,用本导读第五节的速查表自查一遍对应条目。
五、本册核心公式与概念速查表
| # | 概念 | 公式 / 要点 | 出处 |
|---|---|---|---|
| 1 | 组合数与二项式定理 | \(\binom nr=\frac{n!}{r!(n-r)!}\);\((x+y)^n=\sum_k\binom nkx^ky^{n-k}\) | 01 |
| 2 | 非负整数解个数 | \(x_1+\cdots+x_r=n\),\(x_i\ge0\):\(\binom{n+r-1}{r-1}\) | 01 |
| 3 | 容斥恒等式 | \(P(\bigcup E_i)=\sum_r(-1)^{r+1}\sum_{i_1<\cdots<i_r}P(E_{i_1}\cdots E_{i_r})\) | 02 |
| 4 | Boole 不等式(union bound) | \(P(\bigcup E_i)\le\sum P(E_i)\);Bonferroni 校正的依据 | 02、07a |
| 5 | 条件概率与乘法法则 | \(P(E\mid F)=P(EF)/P(F)\);\(P(E_1\cdots E_n)=\prod P(E_k\mid E_1\cdots E_{k-1})\) | 03 |
| 6 | 全概率与 Bayes 公式 | \(P(E)=\sum P(E\mid F_i)P(F_i)\);\(P(F_j\mid E)=\frac{P(E\mid F_j)P(F_j)}{\sum_iP(E\mid F_i)P(F_i)}\) | 03 |
| 7 | Bayes 赔率形式 | 后验赔率 = 先验赔率 × 似然比 \(\frac{P(E\mid H)}{P(E\mid H^c)}\) | 03 |
| 8 | 赌徒破产 | 从 \(i\) 出发先到 \(N\) 的概率 \(\frac{1-(q/p)^i}{1-(q/p)^N}\)(\(p\ne\frac12\)) | 03 |
| 9 | 期望与 LOTUS | \(E[g(X)]=\sum g(x)p(x)\) 或 \(\int g(x)f(x)dx\);一般 \(E[g(X)]\ne g(E[X])\) | 04a、05 |
| 10 | 方差 | \(\mathrm{Var}(X)=E[X^2]-(E X)^2\);\(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\) | 04a |
| 11 | 期望线性性与示性变量 | \(E[\sum X_i]=\sum E[X_i]\) 不需独立;\(E[I_A]=P(A)\) | 04a、07a |
| 12 | 尾和 / 尾积分公式 | \(E[N]=\sum_{i\ge1}P\{N\ge i\}\);\(E[Y]=\int_0^\infty P\{Y>y\}dy\)(\(Y\ge0\)) | 04a、05、07a |
| 13 | 报童问题(分位数决策) | 最优量是需求的 \(\frac{b}{b+\ell}\) 分位数 | 04a、05 |
| 14 | 二项分布 | \(\binom nkp^k(1-p)^{n-k}\);均值 \(np\),方差 \(np(1-p)\) | 04b |
| 15 | 泊松分布与泊松近似 | \(e^{-\lambda}\lambda^k/k!\);均值 = 方差 = \(\lambda\);\(\mathrm{Bin}(n,p)\approx\mathrm{Poisson}(np)\),误差 \(\le np^2\) | 04b、08 |
| 16 | 最长连串 | \(P\{L_n<k\}\approx\exp\{-(n-k)p^k(1-p)-p^k\}\);公平硬币 \(L_n\approx\log_2n\) | 04b |
| 17 | 正态标准化与 VaR | \(P\{X\le a\}=\Phi(\frac{a-\mu}\sigma)\);99% VaR \(=2.33\sigma-\mu\) | 05 |
| 18 | DeMoivre–Laplace 与样本量 | \(\frac{S_n-np}{\sqrt{np(1-p)}}\approx N(0,1)\);检验优势 \(\delta\) 需 \(n\approx(z\sigma/\delta)^2\) | 05、08 |
| 19 | 指数分布与风险率 | \(P\{X>t\}=e^{-\lambda t}\),无记忆;\(\bar F(t)=\exp\{-\int_0^t\lambda(s)ds\}\) | 05 |
| 20 | 单调变换公式 | \(f_Y(y)=f_X(g^{-1}(y))\lvert\frac{d}{dy}g^{-1}(y)\rvert\);概率积分变换 \(F(X)\sim U(0,1)\) | 05、10 |
| 21 | 卷积 | \(f_{X+Y}(a)=\int f_X(a-y)f_Y(y)dy\)(\(X,Y\) 独立) | 06a |
| 22 | 泊松分拆(稀疏化) | Poisson\((\lambda)\) 按概率 \(p\) 分类 → 独立的 Poisson\((\lambda p)\) 与 Poisson\((\lambda(1-p))\) | 06a、07c、09 |
| 23 | 卡方与 Gamma | \(\chi^2_n=\sum_{i=1}^nZ_i^2=\mathrm{Gamma}(n/2,1/2)\) | 06a、07c |
| 24 | 二元正态条件分布 | \(X\mid Y=y\sim N\big(\mu_x+\rho\frac{\sigma_x}{\sigma_y}(y-\mu_y),\ \sigma_x^2(1-\rho^2)\big)\) | 06b |
| 25 | 贝塔—二项共轭 | Beta\((a,b)\) 先验 + \(n\) 成功 \(m\) 失败 → Beta\((a+n,b+m)\) | 06b |
| 26 | 次序统计量 | 最大值 CDF \(F^n\);\(U(0,1)\) 样本第 \(j\) 小值 ~ Beta\((j,n-j+1)\) | 06b |
| 27 | 雅可比公式与 Box–Muller | \(f_Y=f_X\lvert J\rvert^{-1}\);\(\sqrt{-2\log U_1}(\cos2\pi U_2,\sin2\pi U_2)\) 为独立标准正态 | 06b、10 |
| 28 | 协方差与和的方差 | \(\mathrm{Var}(\sum X_i)=\sum\mathrm{Var}(X_i)+2\sum_{i<j}\mathrm{Cov}(X_i,X_j)\);组合方差 \(w^\top\Sigma w\) | 07a |
| 29 | 相关系数 | \(-1\le\rho\le1\),\(\lvert\rho\rvert=1\) 当且仅当线性关系;不相关不等于独立 | 07a |
| 30 | 全期望公式 | \(E[X]=E\big[E[X\mid Y]\big]\) | 07b |
| 31 | 全方差公式 | \(\mathrm{Var}(X)=E[\mathrm{Var}(X\mid Y)]+\mathrm{Var}(E[X\mid Y])\) | 07b |
| 32 | 随机和 | \(E[\sum^NX_i]=E[N]E[X]\);\(\mathrm{Var}=E[N]\mathrm{Var}(X)+(EX)^2\mathrm{Var}(N)\) | 07b |
| 33 | 最优预测与最优线性预测 | \(E[Y\mid X]\) 最小化均方误差;线性版 \(\mu_y+\rho\frac{\sigma_y}{\sigma_x}(X-\mu_x)\),误差 \(\sigma_y^2(1-\rho^2)\) | 07b |
| 34 | 矩母函数 | \(M^{(n)}(0)=E[X^n]\);独立和 \(M_{X+Y}=M_XM_Y\);MGF 唯一决定分布 | 07c |
| 35 | 对数正态均值 | \(Y\sim N(\mu,\sigma^2)\) 时 \(E[e^Y]=e^{\mu+\sigma^2/2}\) | 05、07c |
| 36 | 正态样本 | \(\bar X\) 与 \(S^2\) 独立;\((n-1)S^2/\sigma^2\sim\chi^2_{n-1}\) | 07c |
| 37 | Markov / Chebyshev / Chernoff | \(P\{X\ge a\}\le E X/a\);\(P\{\lvert X-\mu\rvert\ge k\sigma\}\le1/k^2\);\(P\{X\ge a\}\le\min_te^{-ta}M(t)\) | 08 |
| 38 | 大数定律与 CLT | \(\bar X_n\to\mu\);\(\frac{S_n-n\mu}{\sigma\sqrt n}\Rightarrow N(0,1)\);Cauchy 两者都不适用 | 08 |
| 39 | Jensen 与几何平均 | \(f\) 凸 ⇒ \(Ef(X)\ge f(EX)\);\((\prod X_i)^{1/n}\to e^{E\log X}\)(波动拖累) | 08 |
| 40 | Markov 链平稳分布 | \(\boldsymbol\pi=\boldsymbol\pi\mathbf P\),\(\sum\pi_j=1\);状态 \(i\) 平均持续期 \(1/(1-P_{ii})\) | 09 |
六、勘误与需回查原书的地方
1. 原书错误与更正
| 文件 | 说明 |
|---|---|
| A1_常用分布速查.md | 原书封底分布表把 Cauchy 分布的均值写成 0;严格地说 Cauchy 的期望不存在,0 只是对称中心与中位数。附录已更正,并用 scipy 返回 nan 佐证。 |
| 10_随机模拟与方差缩减.md | 原书自测题 10.5 的解答中,控制变量 \(XY+X^2Y^2/2\) 应减去其期望 3,原书印作 1/2,估计量因此有偏。 |
| 10_随机模拟与方差缩减.md | 同一题的题设(\(X,Y\) 独立 Exp(1))下 \(E[e^{XY}]\) 实际为无穷大,模拟均值不收敛;本章给出改用 \(U(0,1)\) 的修正版本(期望 \(11/36\)),练习 10 即据此改编。 |
2. 原书表述的补充或澄清
| 文件 | 说明 |
|---|---|
| 09_Poisson过程_Markov链与熵.md | 原书 9.3 节给出 \(H(X)-H_Y(X)\) 但没有命名,本章补充「互信息」这一标准名称。 |
| 02_概率公理.md | 2.6 节末的「荷兰赌与无套利」是补充内容,非原书原文。 |
| A1_常用分布速查.md | 对数正态(原书理论题 7.49)和 Weibull(原书习题 10.5)不在原书分布表中,为本册补充。 |
| 06a_联合分布独立性与和的分布.md | 量化实战中「独立同分布和的超额峰度为单项的 \(1/n\)」是补充结论,原书未给出。 |
3. 需回查原书的地方
| 文件 | 说明 |
|---|---|
| 03_条件概率与独立性.md | 原书对照表中 3.4 节内部(例 4a–4l 与例 4m–4n)的分界页码是根据精读笔记推定的近似值,需对照 PDF 核实。 |
| 04a_随机变量期望与方差.md、04b_常见离散分布与泊松过程.md | 本册小节号(04a 的 4.6、4.7,04b 的 4.8–4.10)与原书节号不同,例题与公式编号沿用原书;按例题编号查原书最可靠。 |
| 07a_期望的性质与协方差.md | 本章小节 7.2.1–7.2.5 为教学重排,原书的 7.2.1、7.2.2 分别对应本章 7.2.5 的「概率方法」和「最大–最小恒等式」。 |
| 07b_条件期望与预测.md、08_极限定理.md、06b_条件分布次序统计量与变换.md、07a_期望的性质与协方差.md | 这几处引用了第 11 册(Kelly 准则、deflated Sharpe、风险模型),该册尚未成稿,成稿后需核对具体章号。 |
4. 本次统稿修正的交叉引用
统稿时改正了指错的章号:01 的二项分布改指 04b;02 的示性变量法改指 04a;04a 的「独立和方差相加」改指 07a;06b 的「\(\rho\) 是相关系数」改指 07b 例 5f;07a、07b、08、09、10 中「本册第 4/5/6 章」一类笼统写法改为具体的 a/b 篇与小节;02、07a 中指向第 03 册的测度论引用改为外部参考书(第 03 册不讲测度论)。另在 07a、07c、08、09、10 补了与前半部分的承接句,在 A1 的「分布之间的关系」表中补上前半部分出处。
5. 术语与记号约定
第 01–06b 章与第 07a 章起由两位编写者完成,术语写法略有不同:前半部分多用「泊松、伽马、贝塔、柯西、伯努利、马尔可夫」,后半部分多用「Poisson、Gamma、Beta、Cauchy、Bernoulli、Markov」,所指完全相同;前半部分称「泊松分拆」,后半部分称「Poisson 稀疏化(thinning)」,也是同一结论。
全册记号一致:指数分布 Exp\((\lambda)\) 和 Gamma\((\alpha,\lambda)\) 中的 \(\lambda\) 都是速率(均值 \(1/\lambda\)),所以「Exp(1/2)」表示均值为 2 的指数分布;正态写作 \(N(\mu,\sigma^2)\),第二个参数是方差;几何分布从 1 开始计数(首次成功所需试验次数);负二项分布计试验总数。scipy.stats 的参数化与此不完全相同,用前先查附录 A1 第四节。
七、配套代码说明
1. 运行环境
本册代码统一使用 Python 3(建议 3.10 及以上)。实际用到的第三方库只有 numpy、scipy 和 pandas(仅第 09 章),另用到标准库 math 和 itertools。全套教材的统一环境是 numpy / pandas / scipy / statsmodels / scikit-learn / arch,后三者本册没有用到,装上也不影响。
pip install numpy scipy pandas statsmodels scikit-learn arch
# 或者用 uv 临时运行单个脚本
uv run --with numpy --with scipy --with pandas python 某章代码.py
本次统稿把全部 17 段代码逐段提取出来运行,环境为 Python 3.13、numpy 2.5、scipy 1.18、pandas 3.0。所有代码均能运行,打印结果与正文「关键输出」逐行一致。各段都用 np.random.default_rng(种子) 固定随机数,所以不同机器上的输出应当相同;若 numpy 大版本不同导致个别模拟值在末位有差异,属正常现象。
2. 跨章依赖
本册所有代码段都是自包含的:每段自己导入库、自己设定随机种子、自己定义需要的函数,没有任何一段需要先运行或保存另一章的代码。第 10 章的三段代码彼此也独立,可以分别运行。
概念上的依赖则不少,读代码时对照下面几处会更容易理解:
- 第 10 章期权定价代码用到第 07c 章的对数正态均值 \(E[S_T]=S_0e^{rT}\)(风险中性漂移 \(r-\sigma^2/2\)),控制变量系数与第 07b 章最优线性预测的斜率同构。
- 第 08 章量化实战「回测需要多长」默认日收益独立;收益有自相关时应按第 07a 章式 (4.1) 修正样本均值的方差,第 08 章练习 7 就是这个修正。
- 第 06b 章「最佳回测」代码中的 \(\Phi^{-1}(0.5^{1/N})\) 来自次序统计量公式,第 03 册第 10b 章会在此基础上讲多重检验校正。
- 第 02 章游程检验的置换模拟,其合法性来自第 06b 章 6.8 节的可交换性;第 10 章的 Fisher–Yates 算法给出生成随机排列的正确方法。
- 第 04b、06a、09 章的订单流代码是同一条线索:泊松计数与过度离散 → 泊松分拆 → Poisson 过程的到达间隔与稀疏化;第 07c 章例 7m 用 MGF 给出分拆独立性的另一证明。