量化交易中文教材

附录 A1 常用分布与符号表

本附录整理 Wasserman 原书书末的符号表(List of Symbols)与分布表(Table of Distributions),并补充本册各章常用而原书表中未列出的几个分布、参数化约定与 scipy.stats 的对应关系,以及一份中英文术语对照。查阅时注意:不同教材对 Gamma、指数、几何分布的参数化不同,这是公式抄错的最常见来源。

读前导读

这份附录做什么用。 它不是用来通读的章节,而是一本"查表手册",作用类似 CFA 考试随附的公式表或财报附注里的会计政策说明:读正文遇到不认识的符号、记不清某个分布的均值方差、或写代码时不确定 scipy 参数该填什么,就来这里查。

最值得先看的三处。 第一,A1.8 的参数化约定:指数分布和 Gamma 分布有"尺度 \(\beta\)"和"速率 \(\lambda=1/\beta\)"两种写法,抄错一个就差一个倒数,scipy 里还要留意正态传的是标准差而不是方差。这和利率报价分年化、半年复利、连续复利一样,数值不同但描述同一件事,混用就出错。第二,A1.9 的分布关系:多数分布都能从正态、Gamma、均匀分布组合出来,记住这几条关系比背密度公式有用。第三,A1.3 的收敛与阶符号:\(o(a_n)\) 读作"比 \(a_n\) 小得多"(比值趋于 0),\(O(a_n)\) 读作"和 \(a_n\) 同级或更小"(比值有界),下标 \(P\) 表示"以概率意义成立",正文推导中经常出现。

需要先想起来的数学。 上确界 \(\sup\)、下确界 \(\inf\) 可以先当作最大值、最小值理解,区别只在于它们不一定能被取到(如 \(\sup_{x<1}x=1\),但 1 不在范围内),见 第 00 册第 01 章 函数极限与连续。矩母函数(MGF)\(M(t)=\mathbb E e^{tX}\) 在 \(t=0\) 处的各阶导数给出各阶矩,表中 MGF"不存在"表示 \(\mathbb Ee^{tX}\) 对任何 \(t\ne0\) 都发散,\(t\) 分布(含 Cauchy)即属此类,这正是厚尾的标志。级数与 \(e^x\) 的展开见 第 04 章 级数与收敛,记号读法见 第 08 章 读懂数学证明与符号。

怎么用。 第一次只需浏览 A1.1–A1.4 的符号和 A1.8 的对照表,知道有哪些内容;分布表与术语对照在需要时再查。


A1.1 一般数学符号

符号 含义
\(\mathbb R\) 实数集
\(\inf_{x\in A}f(x)\) 下确界(可理解为最小值)
\(\sup_{x\in A}f(x)\) 上确界(可理解为最大值)
\(n!\) \(n\times(n-1)\times\cdots\times1\)
\(\binom nk\) \(\frac{n!}{k!(n-k)!}\)
\(\Gamma(\alpha)\) \(\int_0^\infty y^{\alpha-1}e^{-y}dy\)
\(\Omega\) 样本空间
\(\omega\) 样本点(结果)
\(A\) 事件(\(\Omega\) 的子集)
\(I_A(\omega)\) 示性函数:\(\omega\in A\) 时为 1,否则为 0
\(\vert A\vert \) 集合 \(A\) 的元素个数

A1.2 概率符号

符号 含义
\(\mathbb P(A)\) 事件 \(A\) 的概率
\(A\amalg B\) \(A\) 与 \(B\) 独立
\(A\not\amalg B\) \(A\) 与 \(B\) 不独立
\(F_X\) 累积分布函数 \(F_X(x)=\mathbb P(X\le x)\)
\(f_X\) 概率密度函数或概率质量函数
\(X\sim F\) \(X\) 的分布函数为 \(F\)
\(X\sim f\) \(X\) 的密度为 \(f\)
\(X\overset d=Y\) \(X\) 与 \(Y\) 同分布
IID 独立同分布
\(X_1,\dots,X_n\sim F\) 来自 \(F\) 的容量为 \(n\) 的 IID 样本
\(\phi\)、\(\Phi\) 标准正态的密度与分布函数
\(z_\alpha\) 标准正态的上 \(\alpha\) 分位数:\(z_\alpha=\Phi^{-1}(1-\alpha)\)
\(\mathbb E(X)=\int x\,dF(x)\) 期望
\(\mathbb E(r(X))=\int r(x)\,dF(x)\) 函数的期望
\(\mathbb V(X)\) 方差
\(\text{Cov}(X,Y)\) 协方差

注意 \(z_\alpha\) 是上分位数,所以 95% 双侧区间写作 \(\pm z_{\alpha/2}=\pm z_{0.025}=\pm1.96\)。

A1.3 收敛与阶的符号

符号 含义
\(X_n\xrightarrow{P}X\) 依概率收敛
\(X_n\rightsquigarrow X\) 依分布收敛
\(X_n\xrightarrow{qm}X\) 均方收敛
\(X_n\approx N(\mu,\sigma_n^2)\) \((X_n-\mu)/\sigma_n\rightsquigarrow N(0,1)\)
\(x_n=o(a_n)\) \(x_n/a_n\to0\)
\(x_n=O(a_n)\) \(\vert x_n/a_n\vert \) 对大的 \(n\) 有界
\(X_n=o_P(a_n)\) \(X_n/a_n\xrightarrow P0\)
\(X_n=O_P(a_n)\) \(X_n/a_n\) 依概率有界:对任意 \(\epsilon>0\),存在 \(M\) 与 \(n_0\) 使 \(n>n_0\) 时 \(\mathbb P(\vert X_n/a_n\vert >M)<\epsilon\)

A1.4 统计模型符号

符号 含义
\(\mathfrak F\) 统计模型(一族分布)
\(\theta\) 参数
\(\hat\theta\) 参数的估计
\(T(F)\) 统计泛函(如均值、中位数)
\(\mathcal L(\theta)\) 似然函数
\(\ell(\theta)\) 对数似然
\(\hat F_n\) 经验分布函数
\(\widehat{\text{se}}\) 估计的标准误

A1.5 常用数学事实

  • \(e^x=\sum_{k=0}^\infty\frac{x^k}{k!}\)
  • \(\sum_{j=k}^\infty r^j=\frac{r^k}{1-r}\)(\(0<r<1\))
  • \(\lim_{n\to\infty}\big(1+\frac an\big)^n=e^a\)
  • Stirling 公式:\(n!\approx n^ne^{-n}\sqrt{2\pi n}\)
  • Gamma 函数:\(\Gamma(\alpha)=(\alpha-1)\Gamma(\alpha-1)\);正整数 \(n\) 时 \(\Gamma(n)=(n-1)!\);\(\Gamma(1)=1\);\(\Gamma(1/2)=\sqrt\pi\)

A1.6 分布表(原书)

分布 概率函数 / 密度 均值 方差 矩母函数 MGF
点质量于 \(a\) \(I(x=a)\) \(a\) \(0\) \(e^{at}\)
Bernoulli\((p)\) \(p^x(1-p)^{1-x}\),\(x\in\{0,1\}\) \(p\) \(p(1-p)\) \(pe^t+(1-p)\)
Binomial\((n,p)\) \(\binom nxp^x(1-p)^{n-x}\) \(np\) \(np(1-p)\) \((pe^t+1-p)^n\)
Geometric\((p)\) \(p(1-p)^{x-1}I(x\ge1)\) \(1/p\) \((1-p)/p^2\) \(\frac{pe^t}{1-(1-p)e^t}\),\(t<-\log(1-p)\)
Poisson\((\lambda)\) \(\frac{\lambda^xe^{-\lambda}}{x!}\) \(\lambda\) \(\lambda\) \(e^{\lambda(e^t-1)}\)
Uniform\((a,b)\) \(\frac{I(a<x<b)}{b-a}\) \(\frac{a+b}2\) \(\frac{(b-a)^2}{12}\) \(\frac{e^{bt}-e^{at}}{(b-a)t}\)
Normal\((\mu,\sigma^2)\) \(\frac1{\sigma\sqrt{2\pi}}e^{-(x-\mu)^2/(2\sigma^2)}\) \(\mu\) \(\sigma^2\) \(\exp\{\mu t+\sigma^2t^2/2\}\)
Exponential\((\beta)\) \(\frac{e^{-x/\beta}}\beta\),\(x>0\) \(\beta\) \(\beta^2\) \(\frac1{1-\beta t}\),\(t<1/\beta\)
Gamma\((\alpha,\beta)\) \(\frac{x^{\alpha-1}e^{-x/\beta}}{\Gamma(\alpha)\beta^\alpha}\),\(x>0\) \(\alpha\beta\) \(\alpha\beta^2\) \(\big(\frac1{1-\beta t}\big)^\alpha\),\(t<1/\beta\)
Beta\((\alpha,\beta)\) \(\frac{\Gamma(\alpha+\beta)}{\Gamma(\alpha)\Gamma(\beta)}x^{\alpha-1}(1-x)^{\beta-1}\),\(0<x<1\) \(\frac\alpha{\alpha+\beta}\) \(\frac{\alpha\beta}{(\alpha+\beta)^2(\alpha+\beta+1)}\) \(1+\sum_{k\ge1}\Big(\prod_{r=0}^{k-1}\frac{\alpha+r}{\alpha+\beta+r}\Big)\frac{t^k}{k!}\)
\(t_\nu\) \(\frac{\Gamma(\frac{\nu+1}2)}{\sqrt{\nu\pi}\,\Gamma(\frac\nu2)}\big(1+\frac{x^2}\nu\big)^{-(\nu+1)/2}\) \(0\)(\(\nu>1\)) \(\frac\nu{\nu-2}\)(\(\nu>2\)) 不存在
\(\chi^2_p\) \(\frac1{\Gamma(p/2)2^{p/2}}x^{p/2-1}e^{-x/2}\),\(x>0\) \(p\) \(2p\) \(\big(\frac1{1-2t}\big)^{p/2}\),\(t<1/2\)

A1.7 补充分布(本教材补充,原书分布表未列)

分布 密度 / 定义 均值 方差 本册出现处
对数正态 LogNormal\((\mu,\sigma^2)\) \(\log X\sim N(\mu,\sigma^2)\) \(e^{\mu+\sigma^2/2}\) \((e^{\sigma^2}-1)e^{2\mu+\sigma^2}\) 第 24a 章(几何布朗运动下的 \(S_T\))
Cauchy \(\frac1{\pi(1+x^2)}\),即 \(t_1\) 不存在 不存在 第 24a、24b 章
\(F_{d_1,d_2}\) \(\frac{\chi^2_{d_1}/d_1}{\chi^2_{d_2}/d_2}\)(两者独立) \(\frac{d_2}{d_2-2}\)(\(d_2>2\)) \(\frac{2d_2^2(d_1+d_2-2)}{d_1(d_2-2)^2(d_2-4)}\)(\(d_2>4\)) 第 13a 章(回归的整体检验)
Multinomial\((n,p)\) \(\frac{n!}{x_1!\cdots x_k!}p_1^{x_1}\cdots p_k^{x_k}\) \(np_j\) \(\text{Var}=np_j(1-p_j)\),\(\text{Cov}=-np_ip_j\) 第 19 章(列联表)、第 23 章(转移计数)
多元正态 \(N(\mu,\Sigma)\) \(\frac{1}{(2\pi)^{d/2}\vert \Sigma\vert ^{1/2}}e^{-\frac12(x-\mu)^T\Sigma^{-1}(x-\mu)}\) \(\mu\) \(\Sigma\) 第 22a 章(LDA/QDA)
逆 Gamma IG\((a,b)\) \(\frac{b^a}{\Gamma(a)}x^{-a-1}e^{-b/x}\),即 \(1/X\) 服从 Gamma\((a,1/b)\) \(\frac b{a-1}\)(\(a>1\)) \(\frac{b^2}{(a-1)^2(a-2)}\)(\(a>2\)) 第 24b 章(方差参数的全条件分布)
标准化 \(t_\nu\) \(\sqrt{(\nu-2)/\nu}\,T\),\(T\sim t_\nu\) \(0\) \(1\) 第 20 章(厚尾日收益模拟)

A1.8 参数化约定与 scipy.stats 对照

Wasserman 对指数和 Gamma 分布用尺度(scale)参数 \(\beta\)(均值为 \(\beta\)),而第 02 册 Ross 的教材和很多文献用速率(rate)参数 \(\lambda=1/\beta\)。几何分布在原书中取值于 \(\{1,2,\dots\}\)(第一次成功所需的试验次数),有些书取值于 \(\{0,1,\dots\}\)(成功前的失败次数)。scipy.stats 的约定与 Wasserman 一致。

原书记号 scipy.stats 写法 备注
Bernoulli\((p)\) bernoulli(p)
Binomial\((n,p)\) binom(n, p)
Geometric\((p)\) geom(p) 取值 \(1,2,\dots\),与原书一致
Poisson\((\lambda)\) poisson(lam)
Uniform\((a,b)\) uniform(loc=a, scale=b-a) 第二个参数是区间长度而非右端点
Normal\((\mu,\sigma^2)\) norm(loc=mu, scale=sigma) 传入标准差而非方差
Exponential\((\beta)\) expon(scale=beta) 速率 \(\lambda\) 时 scale=1/lam
Gamma\((\alpha,\beta)\) gamma(a=alpha, scale=beta) 第 23 章 \(W_n\sim\text{Gamma}(n,1/\lambda)\) 即 gamma(a=n, scale=1/lam)
Beta\((\alpha,\beta)\) beta(alpha, beta)
\(t_\nu\) t(nu)
\(\chi^2_p\) chi2(p)
LogNormal\((\mu,\sigma^2)\) lognorm(s=sigma, scale=np.exp(mu)) 参数化较特殊
IG\((a,b)\) invgamma(a, scale=b)

代码:核对分布表的均值、方差与 scipy 参数化。

import numpy as np
from scipy import stats
# 原书分布表的参数化 → scipy.stats 对象,核对均值与方差
a, b, n, p, lam, mu, s, al, be, nu, k = 1.0, 3.0, 10, 0.3, 2.5, 0.5, 2.0, 3.0, 2.0, 5, 4
table = [
    ("Bernoulli(p)",      stats.bernoulli(p),               p,              p*(1-p)),
    ("Binomial(n,p)",     stats.binom(n, p),                n*p,            n*p*(1-p)),
    ("Geometric(p)",      stats.geom(p),                    1/p,            (1-p)/p**2),
    ("Poisson(λ)",        stats.poisson(lam),               lam,            lam),
    ("Uniform(a,b)",      stats.uniform(loc=a, scale=b-a),  (a+b)/2,        (b-a)**2/12),
    ("Normal(μ,σ²)",      stats.norm(loc=mu, scale=s),      mu,             s**2),
    ("Exponential(β)",    stats.expon(scale=be),            be,             be**2),
    ("Gamma(α,β)",        stats.gamma(a=al, scale=be),      al*be,          al*be**2),
    ("Beta(α,β)",         stats.beta(al, be),               al/(al+be),     al*be/((al+be)**2*(al+be+1))),
    ("t_ν",               stats.t(nu),                      0.0,            nu/(nu-2)),
    ("χ²_p",              stats.chi2(k),                    k,              2*k),
]
ok = True
for name, d, m_, v_ in table:
    m, v = d.stats(moments="mv")
    good = np.isclose(m, m_) and np.isclose(v, v_); ok &= good
    print("%-15s 均值 %.4f / 表 %.4f   方差 %.4f / 表 %.4f  %s" % (name, m, m_, v, v_, "✓" if good else "✗"))
print("全部一致" if ok else "存在不一致")

关键输出:

Bernoulli(p)    均值 0.3000 / 表 0.3000   方差 0.2100 / 表 0.2100  ✓
Binomial(n,p)   均值 3.0000 / 表 3.0000   方差 2.1000 / 表 2.1000  ✓
Geometric(p)    均值 3.3333 / 表 3.3333   方差 7.7778 / 表 7.7778  ✓
Poisson(λ)      均值 2.5000 / 表 2.5000   方差 2.5000 / 表 2.5000  ✓
Uniform(a,b)    均值 2.0000 / 表 2.0000   方差 0.3333 / 表 0.3333  ✓
Normal(μ,σ²)    均值 0.5000 / 表 0.5000   方差 4.0000 / 表 4.0000  ✓
Exponential(β)  均值 2.0000 / 表 2.0000   方差 4.0000 / 表 4.0000  ✓
Gamma(α,β)      均值 6.0000 / 表 6.0000   方差 12.0000 / 表 12.0000  ✓
Beta(α,β)       均值 0.6000 / 表 0.6000   方差 0.0400 / 表 0.0400  ✓
t_ν             均值 0.0000 / 表 0.0000   方差 1.6667 / 表 1.6667  ✓
χ²_p            均值 4.0000 / 表 4.0000   方差 8.0000 / 表 8.0000  ✓
全部一致

A1.9 分布之间的常用关系

  • Bernoulli\((p)\) 的 \(n\) 个 IID 之和为 Binomial\((n,p)\);Binomial\((n,\lambda/n)\to\) Poisson\((\lambda)\)。
  • Exponential\((\beta)=\) Gamma\((1,\beta)\);\(n\) 个 IID Exponential\((\beta)\) 之和为 Gamma\((n,\beta)\)(第 23 章泊松过程的等待时间)。
  • \(\chi^2_p=\) Gamma\((p/2,2)\);\(Z_1^2+\cdots+Z_p^2\sim\chi^2_p\)(\(Z_i\) IID 标准正态)。
  • \(t_\nu=Z/\sqrt{V/\nu}\),\(Z\sim N(0,1)\) 与 \(V\sim\chi^2_\nu\) 独立;\(t_1\) 即 Cauchy;\(\nu\to\infty\) 时 \(t_\nu\to N(0,1)\)。
  • Beta\((1,1)=\) Uniform\((0,1)\);Binomial 似然配平坦先验得 Beta 后验 Beta\((x+1,n-x+1)\)(第 24a 章例 24.3)。
  • 若 \(U\sim\) Uniform\((0,1)\),则 \(F^{-1}(U)\sim F\)(逆变换抽样,蒙特卡洛的基础)。

A1.10 中英文术语对照(第 19–24 章)

中文 英文 首次出现
对数线性模型 log-linear model 第 19 章
列联表 contingency table 第 19 章
图模型 / 层次模型 / 饱和模型 graphical / hierarchical / saturated model 第 19 章
生成元 generator 第 19 章
偏差(似然比统计量) deviance 第 19 章
曲线估计 / 平滑 curve estimation / smoothing 第 20 章
平滑参数 smoothing parameter 第 20 章
积分平方误差 / 平均积分平方误差 ISE / MISE 第 20 章
偏差–方差权衡 bias–variance tradeoff 第 20 章
直方图 / 箱 histogram / bin 第 20 章
核密度估计 / 带宽 kernel density estimation / bandwidth 第 20 章
交叉验证 cross-validation 第 20 章
置信带 confidence band 第 20 章
维数灾难 curse of dimensionality 第 20 章
Nadaraya–Watson 核估计 Nadaraya–Watson kernel estimator 第 20 章
设计偏差 design bias 第 20 章
可加模型 / 回拟合 additive model / backfitting 第 20 章
标准正交基 / 完备 orthonormal basis / complete 第 21 章
Parseval 关系 Parseval's relation 第 21 章
空间非齐性 spatially inhomogeneous 第 21 章
父小波 / 母小波 father wavelet (scaling function) / mother wavelet 第 21 章
多分辨率分析 multiresolution analysis 第 21 章
阈值化 / 通用阈值 thresholding / universal threshold 第 21 章
离散小波变换 discrete wavelet transform (DWT) 第 21 章
中位数绝对偏差 median absolute deviation (MAD) 第 21 章
分类 / 监督学习 classification / supervised learning 第 22a 章
Bayes 分类规则 / 决策边界 Bayes classification rule / decision boundary 第 22a 章
线性 / 二次判别分析 LDA / QDA 第 22a 章
马氏距离 Mahalanobis distance 第 22a 章
朴素 Bayes naive Bayes 第 22a 章
不纯度 / Gini 指数 impurity / Gini index 第 22a 章
支持向量机 / 间隔 / 松弛变量 SVM / margin / slack variable 第 22a 章
核化 / 核技巧 kernelization / kernel trick 第 22a 章
袋装 / 提升 bagging / boosting 第 22a 章
经验风险最小化 empirical risk minimization (ERM) 第 22b 章
粉碎 / 粉碎系数 / VC 维 shatter / shatter coefficient / VC dimension 第 22b 章
随机过程 / 状态空间 / 指标集 stochastic process / state space / index set 第 23 章
马尔可夫链 / 转移矩阵 Markov chain / transition matrix 第 23 章
互通 / 不可约 / 吸收态 communicate / irreducible / absorbing state 第 23 章
常返 / 暂留 / 周期 / 遍历 recurrent / transient / periodic / ergodic 第 23 章
平稳分布 / 极限分布 stationary / limiting distribution 第 23 章
细致平衡 detailed balance 第 23 章
泊松过程 / 强度函数 Poisson process / intensity function 第 23 章
到达间隔 / 等待时间 interarrival (sojourn) time / waiting time 第 23 章
蒙特卡洛积分 Monte Carlo integration 第 24a 章
重要性抽样 importance sampling 第 24a 章
接受–拒绝抽样 accept–reject sampling 第 24a 章
马尔可夫链蒙特卡洛 Markov chain Monte Carlo (MCMC) 第 24b 章
提议分布 proposal distribution 第 24b 章
混合良好 mixing well 第 24b 章
Gibbs 抽样 Gibbs sampling 第 24b 章
分层模型 / 收缩 hierarchical model / shrinkage 第 24b 章

原书对照

本附录内容 原书位置 PDF 页码
符号表 List of Symbols p.433–434
分布表 Table of Distributions p.435
术语(英文索引) Index p.436–444
参考文献 Bibliography p.425–432
补充分布、scipy 对照、分布关系 本教材补充 —