第 01 章 概率论速览
本章对应 Wasserman 原书第 I 部分(第 1–5 章)。这五章与第 02 册《概率论》(Ross)大面积重叠,所以这里只做两件事:一是用本书的记号把后面统计推断要用到的概率工具快速过一遍,二是把本书讲得比 Ross 更有特色、对统计推断最关键的三块内容讲透:集中不等式(Hoeffding 等)、随机变量的收敛模式(含 Slutsky 定理)和 Delta 方法。凡是"速览"部分觉得生疏的,请回到第 02 册对应章节补课。
学习目标
- 熟悉本书的记号:\(\int r(x)\,dF(x)\)、\(X\sim F\)、\(\mathbb E_\theta\) 等,并能在离散与连续情形之间自由切换。
- 掌握马尔可夫、切比雪夫、Hoeffding、Mill、Jensen 不等式,能用 Hoeffding 不等式构造与分布无关的有限样本置信区间,并算出所需样本量。
- 分清依概率收敛、依分布收敛、均方收敛、几乎必然收敛,记住它们之间的蕴含关系和关键反例。
- 会用 Slutsky 定理与连续映射定理推导统计量的渐近分布。
- 会用一元和多元 Delta 方法求光滑函数的渐近方差,例如 Sharpe 比率的标准误。
- 理解中心极限定理成立的条件、收敛速度(Berry–Esseen),以及它在厚尾、稀有事件下失灵的方式。
读前导读
这一章在解决什么问题。 CFA 里你已经会算样本均值、标准误、t 统计量,也知道"样本够大就近似正态"。这一章回答的是这些操作背后的三个"为什么":第一,没有正态假设、样本又不大的时候,能不能给出一个保证成立的误差上限?这是集中不等式(Hoeffding)。第二,"样本越大越接近真值"里的"接近"到底是什么意思?这是收敛模式。第三,我们关心的往往不是均值本身,而是均值的函数,比如 Sharpe 比率 = 均值 / 标准差,它的标准误怎么算?这是 Delta 方法。
最后一点和你熟悉的久期是同一个思路:久期用价格对收益率的一阶导数,把"收益率的小变动"翻译成"价格的小变动";Delta 方法用统计量对参数的一阶导数,把"均值的抽样误差"翻译成"Sharpe 比率的抽样误差"。读完本章,你应该能自己推出 Sharpe 比率的标准误公式,并知道它在什么样的策略上会失灵。
需要先想起来的数学。
- 导数与一阶泰勒展开。 \(g(y)\approx g(\mu)+g'(\mu)(y-\mu)\):在 \(\mu\) 附近用一条切线代替曲线。例:\(g(y)=y^2\),\(\mu=3\),则 \(g(3.1)\approx9+6\times0.1=9.6\),真值 9.61。这正是久期近似的数学本体,Delta 方法和 Hoeffding 证明的第 3 步都靠它。见 第 00 册第 02 章 导数与泰勒展开。
- 积分作为"加权求和"。 \(\int x f(x)\,dx\) 就是连续情形下的 \(\sum x\,p(x)\):把每个取值乘以它的权重再加起来。本章的 \(\int r(x)\,dF(x)\) 是把求和与积分合写的记号,读的时候直接理解为"按分布 \(F\) 对 \(r(X)\) 取平均"即可。见 第 00 册第 03 章 积分。
- 数列极限、\(e^x\) 的极限式、上确界。 \((1+a/n)^n\to e^a\) 是连续复利公式,也是 CLT 证明最后一步。\(\sup\)(上确界)可以先理解为"最大值",只是最大值可能取不到;\(\inf\)(下确界)对应"最小值"。\(\limsup\) 是"尾部的上确界的极限",第一次读可理解为"\(n\) 很大时最坏情况的上限"。见 第 00 册第 01 章 与 第 04 章 级数与收敛。
- 偏导数与梯度。 多元函数 \(g(a,b)\) 对 \(a\) 求偏导就是把 \(b\) 当常数求导;梯度 \(\nabla g\) 是把各偏导排成的列向量。例:\(g(a,b)=a/\sqrt b\),\(\partial g/\partial a=1/\sqrt b\),\(\partial g/\partial b=-\tfrac12 a b^{-3/2}\)。多元 Delta 方法要用。见 第 00 册第 05 章 多元微积分与优化。
- 二次型 \(a^T\Sigma a\)。 你在组合方差 \(w^T\Sigma w\) 里早就用过:向量 \(a\) 是权重,\(\Sigma\) 是协方差矩阵。多元 Delta 方法的方差 \(\nabla^T\Sigma\nabla\) 就是"把梯度当作组合权重算出的组合方差"。见 第 00 册第 06 章 线性代数速成。
另外几个符号先交代清楚:\(\mathbb E\)、\(\mathbb V\) 分别是期望和方差;\(X\sim F\) 读作"\(X\) 服从分布 \(F\)";\(I_A(x)\) 是示性函数,\(x\in A\) 时取 1,否则取 0;\(O(n^{-1/2})\) 表示"量级不超过常数乘 \(n^{-1/2}\)"的项(详见 第 00 册第 07 章)。
怎么读这一章。 1.2、1.3 节是速览,在 CFA 和第 02 册学过的内容可以快速扫过,只要习惯 \(\int r(x)\,dF(x)\) 这个记号。核心必读是三块:1.4.2–1.4.3(Hoeffding 及其置信区间)、1.5.3–1.5.4(收敛的蕴含关系与 Slutsky)、1.5.7(Delta 方法与 Sharpe 标准误)。Hoeffding 的证明(1.4.2 的四步)和收敛蕴含的证明要点,第一次可以只看结论,回头再读。建议读完 1.5.7 后直接跳到 1.6.2 看模拟结果,那里把三块内容串了起来,最能说明它们在量化中的用处。
1.1 为什么统计书要从概率讲起
Wasserman 在前言里用一张图说明概率和统计的关系:概率论从"数据生成过程(data generating process)"出发,问"会产生什么样的数据";统计推断方向相反,从观测数据出发,问"是什么过程生成了这些数据"。预测、分类、聚类、估计,都是统计推断的特例。所以概率是推断的语言,推断是概率的逆问题。
本书还有一张"统计学—数据挖掘词典",在阅读机器学习文献时很有用:
| 统计学 | 计算机科学 | 含义 |
|---|---|---|
| 估计 estimation | 学习 learning | 用数据估计未知量 |
| 分类 classification | 监督学习 supervised learning | 由 \(X\) 预测离散的 \(Y\) |
| 聚类 clustering | 无监督学习 unsupervised learning | 把数据分组 |
| 数据 data | 训练样本 training sample | \((X_1,Y_1),\dots,(X_n,Y_n)\) |
| 协变量 covariates | 特征 features | 各个 \(X_i\) |
| 分类器 classifier | 假设 hypothesis | 从协变量到结果的映射 |
| 置信区间 confidence interval | — | 以给定频率包含未知量的区间 |
| 有向无环图 DAG | 贝叶斯网 Bayes net | 具有给定条件独立关系的多元分布 |
| 大偏差界 large deviation bounds | PAC 学习 | 误差概率的一致上界 |
最后一行值得留意:本章的 Hoeffding 不等式就是"大偏差界"的入门形式,也是机器学习泛化理论(PAC learning)的基石。
1.2 概率与随机变量:速览(原书第 1–2 章)
这一节只列要点,详细推导见第 02 册第 2–6 章。
样本空间与公理。 样本空间 \(\Omega\) 是试验所有可能结果的集合,事件是 \(\Omega\) 的子集。概率 \(\mathbb P\) 满足三条公理:非负、\(\mathbb P(\Omega)=1\)、可列可加。由公理可推出 \(\mathbb P(A\cup B)=\mathbb P(A)+\mathbb P(B)-\mathbb P(AB)\) 以及概率的连续性:若事件序列单调地 \(A_n\to A\),则 \(\mathbb P(A_n)\to\mathbb P(A)\)。严格地说,概率只能定义在一个 σ-域(σ-field)上,这是测度论的细节,本书放在附录里。
独立与条件概率。 \(A,B\) 独立指 \(\mathbb P(AB)=\mathbb P(A)\mathbb P(B)\)。两个容易混淆的点:概率为正的互斥事件一定不独立;一般 \(\mathbb P(A\mid B)\neq\mathbb P(B\mid A)\)(混淆二者叫"检察官谬误")。
贝叶斯定理与基率。 原书例 1.13 的医学检测值得记住:灵敏度 \(\mathbb P(+\mid D)=0.9\)、特异度 \(\mathbb P(-\mid D^c)\approx0.9\),患病率只有 1%,结果检测阳性者真正患病的概率只有
随机变量与 CDF。 随机变量是映射 \(X:\Omega\to\mathbb R\)。累积分布函数(CDF)\(F_X(x)=\mathbb P(X\le x)\) 完全决定分布,它非降、右连续、两端极限为 0 和 1。连续型变量的密度 \(f\) 可以大于 1,\(\mathbb P(X=x)=0\),概率要靠积分得到。分位数函数(quantile function)\(F^{-1}(q)=\inf\{x:F(x)>q\}\)(多数教材写成 \(\ge q\),二者只在 \(F\) 有平台时有差别)——VaR 就是损益分布的分位数。
常用分布(均值、方差见 1.3 节表格):点质量 \(\delta_a\)、伯努利、二项、几何、泊松;均匀、正态、指数(本书用尺度参数 \(\beta\),均值为 \(\beta\))、Gamma、Beta、\(t_\nu\)(\(\nu=1\) 即柯西分布,均值不存在)、\(\chi^2_p\)(\(p\) 个独立标准正态的平方和)。
多元正态。 这是全书后面回归、因子模型反复用到的工具。若 \(Z\sim N(0,I)\),则 \(X=\mu+\Sigma^{1/2}Z\sim N(\mu,\Sigma)\)(实践中常用 Cholesky 因子代替对称平方根)。把 \(X\) 分块为 \((X_a,X_b)\),则(原书定理 2.44):
- 边缘:\(X_a\sim N(\mu_a,\Sigma_{aa})\);
- 条件:\(X_b\mid X_a=x_a\sim N\!\left(\mu_b+\Sigma_{ba}\Sigma_{aa}^{-1}(x_a-\mu_a),\ \Sigma_{bb}-\Sigma_{ba}\Sigma_{aa}^{-1}\Sigma_{ab}\right)\);
- 线性组合:\(a^TX\sim N(a^T\mu,\ a^T\Sigma a)\);
- 马氏距离:\((X-\mu)^T\Sigma^{-1}(X-\mu)\sim\chi^2_k\)。
第 3 条就是组合收益的均值-方差公式,第 2 条是"给定市场因子时个股收益的条件分布",第 4 条是金融"湍流指数"(turbulence index)和异常检测的理论依据。
金融直觉:第 2 条看着吓人,其实你在 CFA 里见过它的一元版本。取 \(X_a\) 为市场收益 \(R_m\)、\(X_b\) 为个股收益 \(R_i\),则 \(\Sigma_{ba}\Sigma_{aa}^{-1}=\operatorname{Cov}(R_i,R_m)/\mathbb V(R_m)=\beta\),条件均值就是 \(\mu_i+\beta(r_m-\mu_m)\)——单因子模型的预测;条件方差 \(\Sigma_{bb}-\Sigma_{ba}\Sigma_{aa}^{-1}\Sigma_{ab}=\sigma_i^2-\beta^2\sigma_m^2\),正是总风险减去系统风险后的特异风险。多元版本只是把"除以方差"换成"乘以协方差矩阵的逆" \(\Sigma_{aa}^{-1}\)(矩阵的逆相当于矩阵版的倒数,见 第 00 册第 06 章)。第 4 条的马氏距离可以理解为"按协方差矩阵标准化之后的距离平方":一元时就是 \(z^2=((x-\mu)/\sigma)^2\),所以服从 \(\chi^2_1\)。
IID 样本。 若 \(X_1,\dots,X_n\) 独立且有相同的 CDF \(F\),称为独立同分布(IID),记作 \(X_1,\dots,X_n\sim F\)。本书几乎所有推断理论都从 IID 出发。金融收益通常不是 IID(波动聚集、自相关),这一点在后面各章的量化实战里会反复提醒。
变换。 求 \(Y=r(X)\) 的分布用"三步法":找 \(A_y=\{x:r(x)\le y\}\),算 \(F_Y(y)=\int_{A_y}f_X\),再求导。\(r\) 严格单调时有雅可比公式 \(f_Y(y)=f_X(s(y))\,|s'(y)|\),\(s=r^{-1}\)。逆变换抽样 \(X=F^{-1}(U)\)、\(U\sim U(0,1)\) 是所有蒙特卡洛模拟的起点。
1.3 期望:速览(原书第 3 章)
记号 \(\int x\,dF(x)\)。 本书统一写
懒惰统计学家法则(Rule of the Lazy Statistician):\(\mathbb E\,r(X)=\int r(x)\,dF_X(x)\),不必先求 \(r(X)\) 的分布。特例 \(r=I_A\) 给出 \(\mathbb E\,I_A(X)=\mathbb P(X\in A)\)——概率是期望的特例。
线性与方差。 期望的线性不需要独立;乘积期望可拆、方差可加则需要独立(或不相关):
样本均值与样本方差。 IID 时
条件期望与全方差公式(详见第 02 册第 07b 章)。 \(\mathbb E(X\mid Y)\) 是随机变量(\(Y\) 的函数)。两个工具:
矩母函数(MGF)\(\psi_X(t)=\mathbb E e^{tX}\):\(\psi^{(k)}(0)=\mathbb E X^k\);独立和的 MGF 等于各 MGF 之积;MGF 在 0 附近相等则分布相同。它在本章用于证明 Hoeffding 不等式和中心极限定理。
| 分布 | 均值 | 方差 | 分布 | 均值 | 方差 |
|---|---|---|---|---|---|
| Bernoulli\((p)\) | \(p\) | \(p(1-p)\) | Uniform\((a,b)\) | \(\frac{a+b}2\) | \(\frac{(b-a)^2}{12}\) |
| Binomial\((n,p)\) | \(np\) | \(np(1-p)\) | Normal\((\mu,\sigma^2)\) | \(\mu\) | \(\sigma^2\) |
| Geometric\((p)\) | \(1/p\) | \((1-p)/p^2\) | Exp\((\beta)\) | \(\beta\) | \(\beta^2\) |
| Poisson\((\lambda)\) | \(\lambda\) | \(\lambda\) | Gamma\((\alpha,\beta)\) | \(\alpha\beta\) | \(\alpha\beta^2\) |
| \(t_\nu\) | 0 (\(\nu>1\)) | \(\frac{\nu}{\nu-2}\) (\(\nu>2\)) | \(\chi^2_p\) | \(p\) | \(2p\) |
原书第 3 章有两道与市场直接相关的习题:习题 1(每局本金等概率翻倍或减半,\(n\) 局后期望财富 \(c(5/4)^n\) 增长,但中位数不变)和习题 11(\(\pm1\) 随机游走模拟"股价",提醒人们在纯随机序列中很容易"看出"趋势)。前者是 1.4 节 Jensen 不等式和 Kelly 准则的引子。
1.4 不等式:集中不等式与 Jensen(原书第 4 章)
这是本章第一个重点。为什么统计学需要不等式?因为我们关心的概率,比如"样本胜率与真实胜率相差超过 5% 的概率",通常算不出精确值,但可以界住它。界的好坏决定了我们需要多少数据。
1.4.1 从马尔可夫到切比雪夫
定理(马尔可夫不等式,Markov's inequality)。 \(X\ge0\) 且 \(\mathbb E X\) 存在,则对任意 \(t>0\)
证明只有一行:\(\mathbb E X=\int_0^t xf+\int_t^\infty xf\ge\int_t^\infty xf\ge t\int_t^\infty f=t\,\mathbb P(X>t)\)。
推导拆解:这一行有三步。第一步把期望 \(\int_0^\infty xf(x)\,dx\) 按 \(x\le t\) 和 \(x>t\) 切成两段(\(X\ge0\),所以积分从 0 开始)。第二步扔掉第一段:被积函数 \(xf(x)\ge0\),扔掉只会让总和变小,所以写"\(\ge\)"。第三步在剩下的区域里 \(x>t\),把 \(x\) 换成更小的 \(t\),又只会变小;而 \(\int_t^\infty f(x)\,dx\) 正是 \(\mathbb P(X>t)\)。 数值感受:某基金经理年度回撤(取正值)平均 5%,那么回撤超过 50% 的概率不超过 \(5\%/50\%=10\%\)。这个界很粗,但只用到均值、不用任何分布假设。
定理(切比雪夫不等式,Chebyshev's inequality)。 \(\mu=\mathbb E X\),\(\sigma^2=\mathbb V X\),则
证明:对非负变量 \((X-\mu)^2\) 用马尔可夫不等式。这个技巧——对 \(X\) 的某个单调非负函数用马尔可夫——是本节的主线:用平方得到切比雪夫,用指数得到 Hoeffding。
切比雪夫不等式对任何方差有限的分布都成立。代价是它很松:它说 \(|Z|>3\) 的概率不超过 \(1/9\approx11\%\),而正态分布下这个概率只有 0.27%。
例(原书例 4.3:预测错误率)。 在 \(n\) 个新样本上检验一个预测方法,\(X_i=1\) 表示预测错误,\(X_i\sim\text{Bernoulli}(p)\),\(p\) 是未知的真实错误率。用切比雪夫不等式和 \(p(1-p)\le1/4\):
1.4.2 Hoeffding 不等式
定理(Hoeffding 不等式)。 \(Y_1,\dots,Y_n\) 独立,\(\mathbb E Y_i=0\),\(a_i\le Y_i\le b_i\)。则对任意 \(\epsilon>0\) 和 \(t>0\),
推论(伯努利情形,原书定理 4.5)。 \(X_1,\dots,X_n\sim\text{Bernoulli}(p)\),则对任意 \(\epsilon>0\)
同一个例子 \(n=100\)、\(\epsilon=0.2\):切比雪夫给 \(0.0625\),Hoeffding 给 \(2e^{-2\cdot100\cdot0.04}=0.00067\),小了近百倍。差别的根源在于衰减速度:切比雪夫随 \(n\) 多项式衰减(\(1/n\)),Hoeffding 指数衰减(\(e^{-2n\epsilon^2}\))。
证明思路(Chernoff 方法)。 值得完整走一遍,因为同样的套路会在大偏差理论、机器学习泛化界中反复出现。
第 1 步,对指数函数用马尔可夫不等式,并利用独立性:
第 2 步,界住每个 \(\mathbb E e^{tY_i}\)。\(Y_i\in[a_i,b_i]\) 可写成端点的凸组合 \(Y_i=\alpha b_i+(1-\alpha)a_i\),\(\alpha=(Y_i-a_i)/(b_i-a_i)\)。由 \(e^{ty}\) 的凸性,
第 3 步,泰勒展开。\(g(0)=g'(0)=0\),且 \(g''(u)\le1/4\),所以 \(g(u)=\frac{u^2}2g''(\xi)\le\frac{u^2}8=\frac{t^2(b_i-a_i)^2}8\)。代回即得定理。
第 4 步,伯努利推论。令 \(Y_i=(X_i-p)/n\),则 \((b_i-a_i)^2=1/n^2\),得 \(\mathbb P(\bar X_n-p>\epsilon)\le e^{-t\epsilon+t^2/(8n)}\)。对 \(t\) 最小化指数,取 \(t=4n\epsilon\) 得 \(e^{-2n\epsilon^2}\);另一侧同理,相加得 \(2e^{-2n\epsilon^2}\)。
推导拆解:四步里每一步用的工具如下。 第 1 步:\(e^{tx}\) 是单调递增函数,所以"\(\sum Y_i\ge\epsilon\)"和"\(e^{t\sum Y_i}\ge e^{t\epsilon}\)"是同一个事件;对非负的 \(e^{t\sum Y_i}\) 用马尔可夫不等式;再用 \(e^{t\sum Y_i}=\prod e^{tY_i}\) 和"独立变量乘积的期望 = 期望的乘积"。\(t>0\) 是一个可以任选的参数,最后再选最好的。 第 2 步:凸函数在两点之间的弦上方是函数图像,弦在上——所以 \(e^{ty}\) 在 \([a,b]\) 上不超过连接 \((a,e^{ta})\) 与 \((b,e^{tb})\) 的直线。直线是 \(Y_i\) 的线性函数,取期望时只需要 \(\mathbb E Y_i=0\)。把结果写成 \(e^{g(u)}\) 纯粹是为了下一步方便求导。 第 3 步:对 \(g\) 在 0 处做带余项的二阶泰勒展开 \(g(u)=g(0)+g'(0)u+\tfrac12g''(\xi)u^2\)(\(\xi\) 是 0 与 \(u\) 之间某个点)。前两项为 0,只剩二阶项;\(g''(u)\le1/4\) 是因为 \(g''\) 可以写成 \(q(1-q)\) 的形式(\(q\in(0,1)\)),而 \(q(1-q)\le1/4\)——和 \(p(1-p)\le1/4\) 是同一个事实。 第 4 步:\(-t\epsilon+t^2/(8n)\) 是 \(t\) 的二次函数(开口向上),对 \(t\) 求导令其为 0:\(-\epsilon+t/(4n)=0\),得 \(t=4n\epsilon\),代回得 \(-4n\epsilon^2+2n\epsilon^2=-2n\epsilon^2\)。"另一侧同理"是把 \(Y_i\) 换成 \(-Y_i\) 再做一遍。
1.4.3 用 Hoeffding 构造置信区间
固定 \(\alpha\),令
反解 \(\epsilon_n\) 可得所需样本量:
推导拆解:\(\epsilon_n\) 的公式是从"让界恰好等于 \(\alpha\)"倒推出来的:令 \(2e^{-2n\epsilon^2}=\alpha\),两边取自然对数得 \(-2n\epsilon^2=\log(\alpha/2)\),即 \(\epsilon^2=\log(2/\alpha)/(2n)\)。本书的 \(\log\) 一律指自然对数 \(\ln\)。 数值例:\(\alpha=0.05\),\(\log(40)\approx3.69\)。\(n=100\) 时 \(\epsilon_n=\sqrt{3.69/200}\approx0.136\),即胜率 55% 的估计区间是 \((41.4\%,68.6\%)\)——100 笔交易连"胜率是否超过 50%"都无法确定。
白话解释:Hoeffding 区间和你在 CFA 学的 \(\hat p\pm1.96\sqrt{\hat p(1-\hat p)/n}\) 区别在于"保证"的性质。后者依赖 CLT,是 \(n\to\infty\) 时的近似,小样本时覆盖率可能不足 95%;Hoeffding 区间对任何 \(n\) 都至少 95%,代价是更宽。宽度都按 \(1/\sqrt n\) 缩小,所以样本量翻 4 倍、区间缩一半,这一点两种方法一致。
1.4.4 Mill 不等式、Cauchy–Schwarz 与 Jensen
Mill 不等式。 \(Z\sim N(0,1)\) 时
Cauchy–Schwarz 不等式。 \(\mathbb E|XY|\le\sqrt{\mathbb E X^2\,\mathbb E Y^2}\)。相关系数 \(|\rho|\le1\) 就是它的直接推论。
Jensen 不等式。 \(g\) 凸则 \(\mathbb E\,g(X)\ge g(\mathbb E X)\);\(g\) 凹则不等号反向。证明:在 \(\mathbb E X\) 处作 \(g\) 的切线 \(L(x)=a+bx\),凸函数在切线上方,\(\mathbb E g(X)\ge\mathbb E L(X)=L(\mathbb E X)=g(\mathbb E X)\)。推论:\(\mathbb E X^2\ge(\mathbb E X)^2\);\(X>0\) 时 \(\mathbb E(1/X)\ge1/\mathbb E X\),\(\mathbb E\log X\le\log\mathbb E X\)。
Jensen 不等式在量化中有两个经典应用。一是波动拖累(volatility drag):\(\mathbb E\log(1+R)\le\log(1+\mathbb E R)\),几何平均收益低于算术平均收益,二者之差约为 \(\sigma^2/2\)。回到"翻倍或减半"游戏:每局 \(\mathbb E(\text{财富倍数})=\frac12\cdot2+\frac12\cdot\frac12=1.25>1\),但 \(\mathbb E\log(\text{倍数})=\frac12\log2+\frac12\log\frac12=0\),长期复利的中位数路径原地踏步。这是 Kelly 准则用对数财富而不是期望财富做目标的原因。二是凸性价值:期权收益是标的价格的凸函数,所以 \(\mathbb E[\text{payoff}(S)]\ge\text{payoff}(\mathbb E S)\),波动本身有价值(Gamma 的来源,见第 08 册)。
1.5 随机变量的收敛(原书第 5 章)
这是本章第二个重点,也是整个统计推断的理论地基。大数定律与中心极限定理的基本形式在第 02 册第 08 章已经讲过,这里侧重收敛模式之间的关系和推导渐近分布的工具。统计关心"数据越来越多时会怎样",这部分理论称为大样本理论、极限理论或渐近理论(asymptotic theory)。
1.5.1 为什么需要新的收敛概念
微积分里 \(x_n\to x\) 的含义很清楚。随机变量就微妙了。两个例子:
- \(X_1,X_2,\dots\) 独立且都服从 \(N(0,1)\)。我们想说 \(X_n\)"收敛到" \(N(0,1)\),可是对任何 \(X\sim N(0,1)\) 都有 \(\mathbb P(X_n=X)=0\)。
- \(X_n\sim N(0,1/n)\)。直觉上 \(X_n\) 越来越集中到 0,可是 \(\mathbb P(X_n=0)=0\) 对每个 \(n\) 都成立。
所以必须分清"在什么意义下收敛"。
1.5.2 收敛的类型
设 \(X_n\) 的 CDF 为 \(F_n\),\(X\) 的 CDF 为 \(F\)。
- 依概率收敛(convergence in probability)\(X_n\xrightarrow{P}X\):对每个 \(\epsilon>0\),\(\mathbb P(|X_n-X|>\epsilon)\to0\)。
- 依分布收敛(convergence in distribution)\(X_n\rightsquigarrow X\):在 \(F\) 的所有连续点 \(t\) 上,\(F_n(t)\to F(t)\)。
- 均方收敛(convergence in quadratic mean,\(L_2\) 收敛)\(X_n\xrightarrow{qm}X\):\(\mathbb E(X_n-X)^2\to0\)。
- 几乎必然收敛(almost sure)\(X_n\xrightarrow{as}X\):\(\mathbb P(\{\omega:X_n(\omega)\to X(\omega)\})=1\)。
- \(L_1\) 收敛:\(\mathbb E|X_n-X|\to0\)。
极限是常数 \(c\) 时写 \(X_n\xrightarrow{P}c\) 或 \(X_n\rightsquigarrow c\)。
白话解释:四种收敛可以用"回测估计的 Sharpe 比率 \(\widehat{SR}_n\) 随数据增加的表现"来理解。 依概率收敛:任意指定一个容忍度 \(\epsilon\)(比如 0.1),只要 \(n\) 足够大,"估计偏离真值超过 0.1"的概率就小到可以忽略。它说的是某个固定时点的偏离概率。 几乎必然收敛:把一条完整的数据路径(\(\omega\) 代表"一种可能的历史")看作整体,几乎每条路径上的估计序列最终都会停在真值附近,不再跑远。它比依概率收敛强:后者允许偶尔、越来越稀少地跑出去。"几乎必然"的"几乎"指例外路径的总概率为 0。 均方收敛:均方误差 \(\mathbb E(X_n-X)^2\)(偏差平方 + 方差)趋于 0。它对偶发的巨大偏离很敏感,所以比依概率收敛强。 依分布收敛:只说 \(X_n\) 的直方图形状越来越像 \(X\) 的,完全不管 \(X_n\) 与 \(X\) 的取值是否接近。CLT 就是这种收敛:标准化后的样本均值的分布越来越像正态,而不是"等于"某个正态变量。
例(原书例 5.3)。 \(X_n\sim N(0,1/n)\)。因为 \(\sqrt nX_n\sim N(0,1)\),\(t<0\) 时 \(F_n(t)=\Phi(\sqrt nt)\to0\),\(t>0\) 时 \(\to1\),所以 \(X_n\rightsquigarrow0\)。注意 \(F_n(0)=1/2\) 不趋于 \(F(0)=1\),但 0 不是点质量 CDF 的连续点,不要求收敛——这正是定义里"只看连续点"的用意。依概率收敛也成立:\(\mathbb P(|X_n|>\epsilon)\le\mathbb E X_n^2/\epsilon^2=1/(n\epsilon^2)\to0\)。
1.5.3 蕴含关系
定理(原书定理 5.4、5.17)。
- 均方收敛 ⇒ \(L_1\) 收敛 ⇒ 依概率收敛;
- 几乎必然收敛 ⇒ 依概率收敛;
- 依概率收敛 ⇒ 依分布收敛。
可以把它画成一条主链:\(qm\Rightarrow L_1\Rightarrow P\Rightarrow\ \rightsquigarrow\),再加一条支线 \(as\Rightarrow P\)。
此外有一个反向特例:若 \(X_n\rightsquigarrow c\)(极限是点质量),则 \(X_n\xrightarrow{P}c\)。除此之外反向蕴含一般都不成立。
证明要点:
-
均方 ⇒ 依概率:马尔可夫不等式,\(\mathbb P(|X_n-X|>\epsilon)\le\mathbb E|X_n-X|^2/\epsilon^2\)。
-
依概率 ⇒ 依分布:对 \(F\) 的连续点 \(x\),夹逼
\[F(x-\epsilon)-\mathbb P(|X_n-X|>\epsilon)\le F_n(x)\le F(x+\epsilon)+\mathbb P(|X_n-X|>\epsilon),\]先令 \(n\to\infty\),再令 \(\epsilon\to0\),由 \(F\) 在 \(x\) 连续得 \(F_n(x)\to F(x)\)。推导拆解:右边不等式的来源是事件包含关系:如果 \(X_n\le x\),那么要么 \(X\le x+\epsilon\),要么 \(X\) 与 \(X_n\) 相差超过 \(\epsilon\)。所以 \(\mathbb P(X_n\le x)\le\mathbb P(X\le x+\epsilon)+\mathbb P(|X_n-X|>\epsilon)\)("或"的概率不超过两者之和)。左边对称地得到。\(n\to\infty\) 时 \(\mathbb P(|X_n-X|>\epsilon)\to0\),于是 \(F_n(x)\) 被夹在 \(F(x-\epsilon)\) 与 \(F(x+\epsilon)\) 之间;再让 \(\epsilon\to0\),连续性保证两边都趋于 \(F(x)\)。这是"夹逼"的标准用法。
-
依分布到常数 ⇒ 依概率:\(\mathbb P(|X_n-c|>\epsilon)\le F_n(c-\epsilon)+1-F_n(c+\epsilon)\to0+1-1=0\)。
两个必记反例。
- 依概率不蕴含均方:\(U\sim U(0,1)\),\(X_n=\sqrt n\,I_{(0,1/n)}(U)\)。\(\mathbb P(|X_n|>\epsilon)=1/n\to0\),但 \(\mathbb E X_n^2=n\cdot\frac1n=1\)。
- 依分布不蕴含依概率:\(X\sim N(0,1)\),\(X_n=-X\)。\(X_n\) 与 \(X\) 同分布,所以 \(X_n\rightsquigarrow X\);但 \(\mathbb P(|X_n-X|>\epsilon)=\mathbb P(|X|>\epsilon/2)\) 不趋于 0。依分布收敛只关心各自的分布,不关心 \(X_n\) 和 \(X\) 在同一个 \(\omega\) 上是否接近。
警告:依概率收敛不保证期望收敛。 设 \(\mathbb P(X_n=n^2)=1/n\),\(\mathbb P(X_n=0)=1-1/n\)。则 \(X_n\xrightarrow{P}0\),但 \(\mathbb E X_n=n\to\infty\)。要让期望也收敛,需要附加条件"渐近一致可积"(asymptotically uniformly integrable):\(\lim_{M\to\infty}\limsup_n\mathbb E(|X_n|I(|X_n|>M))=0\)。
这个反例是"压路机前捡硬币"策略的数学写照:卖出深度虚值期权的策略几乎总是赚钱(依概率意义下收益稳定),但小概率的巨额亏损可以让期望收益为负。看胜率、看中位数都看不出这种风险。
1.5.4 变换下的保持:Slutsky 与连续映射
定理(原书定理 5.5)。 设 \(g\) 连续。
- (a) \(X_n\xrightarrow PX\),\(Y_n\xrightarrow PY\) ⇒ \(X_n+Y_n\xrightarrow PX+Y\),\(X_nY_n\xrightarrow PXY\);均方收敛的和同理。
- (b) Slutsky 定理:\(X_n\rightsquigarrow X\),\(Y_n\rightsquigarrow c\)(常数)⇒ \(X_n+Y_n\rightsquigarrow X+c\),\(X_nY_n\rightsquigarrow cX\)。
- (c) 连续映射定理:\(X_n\xrightarrow PX\) ⇒ \(g(X_n)\xrightarrow Pg(X)\);\(X_n\rightsquigarrow X\) ⇒ \(g(X_n)\rightsquigarrow g(X)\)。
注意 (b) 要求其中一个极限是常数。一般地,\(X_n\rightsquigarrow X\)、\(Y_n\rightsquigarrow Y\) 不能推出 \(X_n+Y_n\rightsquigarrow X+Y\):依分布收敛只管边缘分布,不管联合分布。例如 \(X_n=Z\),\(Y_n=-Z\)(都 \(\rightsquigarrow N(0,1)\)),但 \(X_n+Y_n\equiv0\),而独立的两个 \(N(0,1)\) 之和是 \(N(0,2)\)。
Slutsky 定理是统计学家每天都在用的工具:只要能证明某个量依概率收敛到常数(比如 \(S_n\xrightarrow P\sigma\)),就可以把它当常数代入渐近分布。
金融直觉:你在 CFA 里算 t 统计量时,分母用的是样本标准差 \(S_n\) 而不是未知的 \(\sigma\)。为什么大样本下仍可以查正态表?Slutsky 定理给了答案:\(\frac{\sqrt n(\bar X_n-\mu)}{S_n}=\frac{\sqrt n(\bar X_n-\mu)}{\sigma}\cdot\frac{\sigma}{S_n}\),第一个因子依分布收敛到 \(N(0,1)\)(CLT),第二个因子依概率收敛到常数 1(大数定律 + 连续映射),乘积就收敛到 \(1\cdot N(0,1)\)。"估计出来的参数在大样本下可以当真值用"这一习惯做法,本质上都是 Slutsky 定理。
1.5.5 大数定律
设 \(X_1,X_2,\dots\) IID,\(\mu=\mathbb E X_1\)。
弱大数定律(WLLN): \(\bar X_n\xrightarrow{P}\mu\)。
在 \(\sigma<\infty\) 时证明只需切比雪夫:\(\mathbb P(|\bar X_n-\mu|>\epsilon)\le\sigma^2/(n\epsilon^2)\to0\)。
强大数定律(SLLN): 若 \(\mathbb E|X_1|<\infty\),则 \(\bar X_n\xrightarrow{as}\mu\)。
例(原书例 5.7)。 公平硬币,要使 \(\mathbb P(0.4\le\bar X_n\le0.6)\ge0.7\)。切比雪夫给 \(\mathbb P(|\bar X_n-0.5|\le0.1)\ge1-\frac{1}{4n(0.1)^2}=1-\frac{25}n\),\(n=84\) 时超过 0.7。
大数定律说的是"\(\bar X_n\) 的分布越来越集中在 \(\mu\) 附近",不是"\(\bar X_n\) 等于 \(\mu\)",也不是"之前偏高了之后就会偏低来补偿"(后者是赌徒谬误)。
1.5.6 中心极限定理
大数定律只告诉我们 \(\bar X_n\) 会靠近 \(\mu\),要回答"偏离多少的概率是多少",需要中心极限定理。
定理(CLT)。 \(X_1,\dots,X_n\) IID,均值 \(\mu\),方差 \(\sigma^2<\infty\),则
除了均值和方差存在,对 \(X_i\) 的分布没有任何假设——这是它了不起的地方。常见的等价写法是 \(\bar X_n\approx N(\mu,\sigma^2/n)\),但要记住:近似的是概率陈述,不是随机变量本身。
例(原书例 5.9)。 每个程序的错误数服从均值 5 的泊松分布,共 125 个程序。\(\mu=\sigma^2=5\),
用 \(S_n\) 代替 \(\sigma\)。 实践中 \(\sigma\) 未知。由 Slutsky 定理和 \(S_n\xrightarrow P\sigma\),
收敛速度:Berry–Esseen 不等式。 若 \(\mathbb E|X_1|^3<\infty\),
多元 CLT。 IID 随机向量的样本均值满足 \(\sqrt n(\bar X-\mu)\rightsquigarrow N(0,\Sigma)\)。样本协方差矩阵、多个回测指标的联合渐近正态性都由此推出。
CLT 的证明思路(假设 MGF 存在)。令 \(Y_i=(X_i-\mu)/\sigma\),\(\psi\) 为其 MGF,则 \(Z_n\) 的 MGF 为 \([\psi(t/\sqrt n)]^n\)。因 \(\psi(0)=1\)、\(\psi'(0)=0\)、\(\psi''(0)=1\),
推导拆解:(1) \(Z_n=\frac1{\sqrt n}\sum Y_i\),所以 \(\mathbb E e^{tZ_n}=\mathbb E\prod e^{(t/\sqrt n)Y_i}=[\psi(t/\sqrt n)]^n\),用了独立同分布。(2) 对 \(\psi\) 在 0 处做二阶泰勒展开:\(\psi(s)=\psi(0)+\psi'(0)s+\tfrac12\psi''(0)s^2+\dots=1+0+\tfrac12s^2+\dots\),这里 \(\psi'(0)=\mathbb EY=0\),\(\psi''(0)=\mathbb EY^2=1\)。代入 \(s=t/\sqrt n\) 得 \(1+\frac{t^2}{2n}+(\text{更高阶的小项})\)。(3) 最后用连续复利的极限 \((1+a/n)^n\to e^a\),\(a=t^2/2\)。整个证明就是"泰勒展开 + 复利极限"两步。
白话解释:Berry–Esseen 的价值不在常数 \(33/4\),而在告诉你误差和什么成比例。\(\mathbb E|X_1-\mu|^3/\sigma^3\) 是标准化的"三阶绝对矩",衡量分布有多偏、尾部有多厚。正态时约 1.6;一个"99% 概率小赚、1% 概率大亏"的分布可以达到 10 以上,这意味着要达到同样的近似精度,样本量要多出 \(10^2\) 倍的量级(误差按 \(1/\sqrt n\) 下降,乘以 10 要用 \(n\) 乘以 100 来抵消)。
1.5.7 Delta 方法
这是本章第三个重点。CLT 告诉我们 \(\bar X_n\) 渐近正态,但我们关心的统计量常常是均值的函数:对数收益、波动率、Sharpe 比率、比值。Delta 方法把渐近正态性"传递"给光滑函数。
定理(一元 Delta 方法)。 若 \(\frac{\sqrt n(Y_n-\mu)}{\sigma}\rightsquigarrow N(0,1)\),\(g\) 可微且 \(g'(\mu)\neq0\),则
思路就是一阶泰勒展开:\(g(Y_n)\approx g(\mu)+g'(\mu)(Y_n-\mu)\),右边是 \(Y_n\) 的线性函数,方差乘以 \(g'(\mu)^2\)。严格证明还需要 Slutsky 定理处理余项。
例(原书例 5.14)。 \(W_n=e^{\bar X_n}\),\(g(s)=e^s\),\(g'(s)=e^s\),所以 \(W_n\approx N(e^\mu,\ e^{2\mu}\sigma^2/n)\)。
金融直觉:Delta 方法和久期是同一件事。债券价格 \(P(y)\) 对收益率的一阶近似 \(\Delta P\approx P'(y)\Delta y=-D_{mod}P\,\Delta y\),于是 \(\operatorname{sd}(\Delta P)\approx|P'(y)|\operatorname{sd}(\Delta y)\)——"价格波动 = |斜率| × 收益率波动"。Delta 方法把 \(\Delta y\) 换成抽样误差 \(Y_n-\mu\),把 \(P\) 换成 \(g\):\(\operatorname{se}(g(Y_n))\approx|g'(\mu)|\operatorname{se}(Y_n)\)。条件 \(g'(\mu)\ne0\) 对应"斜率为零时一阶近似失效、要看凸性(二阶项)",和久期为零的免疫组合只剩凸性风险是同一个道理。 例:日对数收益均值估计为 \(\bar X=0.0004\),标准误 0.0006;年化后 \(g(x)=e^{252x}-1\) 的简单收益约 10.6%,其标准误约 \(252e^{252\times0.0004}\times0.0006\approx0.167\)——年化收益的置信区间宽得惊人。
定理(多元 Delta 方法)。 若 \(\sqrt n(Y_n-\mu)\rightsquigarrow N(0,\Sigma)\),\(g:\mathbb R^k\to\mathbb R\) 可微,梯度在 \(\mu\) 处的值 \(\nabla_\mu\) 非零,则
例(原书例 5.16)。 二维 IID 向量,\(Y_n=\bar X_1\bar X_2\),\(g(s_1,s_2)=s_1s_2\),\(\nabla g=(s_2,s_1)^T\),
应用:Sharpe 比率的标准误。 设日收益 IID,均值 \(\mu\)、方差 \(\sigma^2\)、偏度 \(\gamma_3\)、峰度 \(\gamma_4\)(正态时 \(\gamma_4=3\))。样本 Sharpe 比率 \(\widehat{SR}=\bar X_n/\hat\sigma\) 是 \((\bar X_n,\hat\sigma^2)\) 的函数 \(g(a,b)=a/\sqrt b\)。由多元 CLT,
推导拆解:这一行是"梯度当权重算组合方差" \(\nabla^T\Sigma\nabla=\nabla_1^2\Sigma_{11}+2\nabla_1\nabla_2\Sigma_{12}+\nabla_2^2\Sigma_{22}\)。 梯度:\(g(a,b)=ab^{-1/2}\),\(\partial g/\partial a=b^{-1/2}=1/\sigma\);\(\partial g/\partial b=-\tfrac12ab^{-3/2}=-\mu/(2\sigma^3)\)(把 \(a=\mu,b=\sigma^2\) 代入)。 三项分别是:\(\frac1{\sigma^2}\cdot\sigma^2=1\);\(2\cdot\frac1\sigma\cdot(-\frac{\mu}{2\sigma^3})\cdot\mu_3=-\frac{\mu}{\sigma}\cdot\frac{\mu_3}{\sigma^3}=-SR\cdot\gamma_3\);\(\frac{\mu^2}{4\sigma^6}(\mu_4-\sigma^4)=\frac{\mu^2}{4\sigma^2}\big(\frac{\mu_4}{\sigma^4}-1\big)=\frac{SR^2}4(\gamma_4-1)\)。 这里用了偏度、峰度的定义 \(\gamma_3=\mu_3/\sigma^3\)、\(\gamma_4=\mu_4/\sigma^4\)。协方差矩阵中 \(\mathbb V(\hat\sigma^2)\approx(\mu_4-\sigma^4)/n\) 与 \(\operatorname{Cov}(\bar X,\hat\sigma^2)\approx\mu_3/n\) 两个结果原文没有推导,直接接受即可。 读结果:第一项 1 来自均值的不确定性,后两项来自波动率估计的不确定性。负偏(\(\gamma_3<0\))使 \(-\gamma_3SR>0\),方差变大。
正态时 \(\gamma_3=0,\gamma_4=3\),化简为常用的
1.6 量化实战
1.6.1 检验一个信号的胜率需要多少笔交易
设某信号每笔交易"赚钱"记为 1,否则为 0,真实胜率为 \(p\)。我们想以 95% 的把握让估计误差不超过 \(\pm5\%\)。三种工具给出的样本量差别很大:切比雪夫 \(n\ge\frac{1}{4\alpha\epsilon^2}\),Hoeffding \(n\ge\frac{\log(2/\alpha)}{2\epsilon^2}\),CLT 近似 \(n\ge\frac{z_{\alpha/2}^2}{4\epsilon^2}\)。下面同时用模拟比较 Hoeffding 区间与正态(Wald)区间的覆盖率。
import numpy as np
from scipy import stats
# 1) 估计信号胜率 p 所需交易笔数:Chebyshev / Hoeffding / CLT(Wald)
alpha, eps = 0.05, 0.05
n_cheb = int(np.ceil(1 / (4 * alpha * eps**2))) # p(1-p)<=1/4
n_hoef = int(np.ceil(np.log(2 / alpha) / (2 * eps**2)))
z = stats.norm.ppf(1 - alpha / 2)
n_clt = int(np.ceil(z**2 / (4 * eps**2)))
print(f"误差±{eps}, 置信{1-alpha:.0%} 所需笔数: Chebyshev={n_cheb}, Hoeffding={n_hoef}, CLT={n_clt}")
# 2) 覆盖率模拟:真实胜率 p=0.55,n 笔独立交易
rng = np.random.default_rng(0)
p, R = 0.55, 20000
for n in [20, 100, 500]:
phat = rng.binomial(n, p, size=R) / n
eh = np.sqrt(np.log(2 / alpha) / (2 * n))
ew = z * np.sqrt(phat * (1 - phat) / n)
cov_h = np.mean(np.abs(phat - p) <= eh)
cov_w = np.mean(np.abs(phat - p) <= ew)
print(f"n={n:4d} Hoeffding 半宽={eh:.3f} 覆盖={cov_h:.3f} | Wald 平均半宽={ew.mean():.3f} 覆盖={cov_w:.3f}")
输出:
误差±0.05, 置信95% 所需笔数: Chebyshev=2000, Hoeffding=738, CLT=385
n= 20 Hoeffding 半宽=0.304 覆盖=0.998 | Wald 平均半宽=0.212 覆盖=0.923
n= 100 Hoeffding 半宽=0.136 覆盖=0.994 | Wald 平均半宽=0.097 覆盖=0.943
n= 500 Hoeffding 半宽=0.061 覆盖=0.994 | Wald 平均半宽=0.044 覆盖=0.947
几点解读。第一,要把胜率估准到 ±5%,即使用最乐观的 CLT 也要近 400 笔独立交易,Hoeffding 的保守估计是 738 笔;几十笔交易的"胜率 60%"几乎不包含信息。第二,Hoeffding 区间在任何 \(n\) 下覆盖率都不低于 95%(实际约 99%,偏保守);Wald 区间更窄,但小样本时覆盖率低于名义值(\(n=20\) 时只有 92%)。第三,两者都要求交易之间独立。如果同一天的多笔交易受同一市场冲击影响,有效样本量远小于交易笔数,需要按天聚合或改用第 08 章的块 bootstrap。
1.6.2 Sharpe 比率的标准误:Delta 方法何时可靠
下面比较 Delta 方法公式与蒙特卡洛真实抽样标准差,分别用正态收益、\(t(4)\) 厚尾收益和"卖虚值期权"式的强负偏收益。
import numpy as np
from scipy import stats
rng = np.random.default_rng(1)
n, R = 252, 20000 # 一年日收益,重复 R 次"回测"
mu_d, sd_d = 0.0006, 0.01 # 日均值 6bp、日波动 1% -> 日 Sharpe 0.06
SR = mu_d / sd_d
def sharpe(x):
return x.mean(axis=-1) / x.std(axis=-1, ddof=1)
def delta_se(sr, skew, kurt, n):
# 多元 Delta 方法:Var = (1 - skew*SR + (kurt-1)/4 * SR^2)/n,kurt 为原始峰度(正态=3)
return np.sqrt((1 - skew * sr + (kurt - 1) / 4 * sr**2) / n)
# (a) 正态收益
x = rng.normal(mu_d, sd_d, size=(R, n))
print(f"正态: Monte Carlo se={sharpe(x).std():.4f} Delta se={delta_se(SR, 0, 3, n):.4f}")
# (b) t(4) 厚尾收益(标准化到同样均值、方差)
nu = 4
t = rng.standard_t(nu, size=(R, n)) / np.sqrt(nu / (nu - 2))
x = mu_d + sd_d * t
print(f"t(4): Monte Carlo se={sharpe(x).std():.4f} (正态公式 {delta_se(SR, 0, 3, n):.4f})")
# (c) 负偏收益:"卖出虚值期权"式——平时小赚,偶尔大亏
p_crash, gain, loss = 0.01, 0.0016, -0.0984 # 均值 = 0.99*0.0016 + 0.01*(-0.0984) = 0.0006
def short_vol(size):
return np.where(rng.random(size) < p_crash, loss, gain) + rng.normal(0, 0.002, size)
pop = short_vol(2_000_000)
sr_c = pop.mean() / pop.std()
sk, ku = stats.skew(pop), stats.kurtosis(pop, fisher=False)
print(f"负偏总体: SR={sr_c:.3f} skew={sk:.2f} kurt={ku:.1f}")
for m, reps in [(252, 20000), (252 * 20, 2000)]:
s_hat = sharpe(short_vol((reps, m)))
print(f" n={m:5d}: Monte Carlo se={s_hat.std():.4f} Delta(含偏峰) se={delta_se(sr_c, sk, ku, m):.4f} "
f"正态公式 se={delta_se(sr_c, 0, 3, m):.4f} P(样本中无暴跌)={(1-p_crash)**m:.3f}")
print(f"年化 Sharpe≈{SR*np.sqrt(252):.2f},一年数据下日 Sharpe 的 t 值≈{SR/delta_se(SR,0,3,n):.2f}")
输出:
正态: Monte Carlo se=0.0635 Delta se=0.0631
t(4): Monte Carlo se=0.0635 (正态公式 0.0631)
负偏总体: SR=0.060 skew=-9.31 kurt=91.4
n= 252: Monte Carlo se=0.2116 Delta(含偏峰) se=0.0808 正态公式 se=0.0631 P(样本中无暴跌)=0.079
n= 5040: Monte Carlo se=0.0180 Delta(含偏峰) se=0.0181 正态公式 se=0.0141 P(样本中无暴跌)=0.000
年化 Sharpe≈0.95,一年数据下日 Sharpe 的 t 值≈0.95
这段结果把本章三块内容串了起来:
- 正态与 \(t(4)\):Delta 公式与蒙特卡洛几乎一致。日 Sharpe 很小时,\(\mathbb V(\widehat{SR})\approx1/n\) 的主导项来自均值的抽样误差,峰度项 \(\frac{\gamma_4-1}4SR^2\) 微不足道。(严格说 \(t(4)\) 的四阶矩无穷,公式中的峰度项不适用,但数值上不影响结论。)
- 年化 Sharpe 0.95 的策略,一年数据的 t 值只有 0.95,远不显著。要让 t 值到 2,需要约 \((2/0.06)^2\approx1100\) 个交易日,即四年多。
- 强负偏策略:\(n=252\) 时真实标准误(0.21)是 Delta 公式(0.08)的 2.6 倍。原因是一年里有 7.9% 的概率一次暴跌都没碰上,此时样本 Sharpe 会高得离谱——抽样分布远非正态,渐近理论还没生效。这就是 Berry–Esseen 不等式的警告:三阶矩越大,正态近似需要的样本越多。把样本加到 20 年(5040 天)后,含偏峰修正的 Delta 公式与模拟吻合(0.0181 vs 0.0180),而忽略偏度峰度的正态公式(0.0141)仍然低估了约 22%。
实务结论:报告 Sharpe 比率时附上标准误;对负偏、低频暴跌型策略,不要轻信短样本 Sharpe,也不要用正态公式算其置信区间。第 08 章会用 bootstrap 给出不依赖公式的替代方案。
1.6.3 其他应用速记
- 收敛到期望 ≠ 安全:依概率收敛不保证期望收敛的反例,就是"高胜率、小概率爆仓"策略的模型。评估这类策略要看尾部(ES、最大损失),不能只看胜率和中位数。
- CLT 与时间聚合:CLT 解释了为什么月度收益比日收益更接近正态;但它需要独立(或弱相依)和有限方差,波动聚集和厚尾会削弱聚合的正态化效果(第 06 册)。
- 多元 Delta 方法的其他用途:Beta(协方差/方差)、信息比率、对数收益与简单收益的换算、两策略 Sharpe 之差,都可以用同样的梯度公式求标准误。
本章小结
第 I 部分的概率论为统计推断提供了三类工具。第一类是集中不等式:马尔可夫 → 切比雪夫 → Hoeffding,对同一个马尔可夫不等式套上越来越"陡"的函数(平方、指数),界从多项式衰减变为指数衰减;Hoeffding 给出不依赖分布、对有限样本严格成立的置信区间。第二类是收敛理论:均方 ⇒ 依概率 ⇒ 依分布,依分布到常数 ⇔ 依概率到常数;依概率收敛不保证期望收敛;Slutsky 定理和连续映射定理让我们把渐近结果组合起来。第三类是大数定律、中心极限定理与 Delta 方法:样本均值收敛到总体均值,误差近似正态、量级 \(\sigma/\sqrt n\),再经 Delta 方法传递给任意光滑函数。所有这些结论都以 IID 和矩存在为前提,金融数据常常违反它们,使用时要检查。
| 概念 | 公式 / 结论 |
|---|---|
| 马尔可夫 | \(\mathbb P(X>t)\le\mathbb E X/t\),\(X\ge0\) |
| 切比雪夫 | \(\mathbb P(\lvert X-\mu\rvert\ge t)\le\sigma^2/t^2\) |
| Hoeffding(伯努利) | \(\mathbb P(\lvert\bar X_n-p\rvert>\epsilon)\le2e^{-2n\epsilon^2}\) |
| Hoeffding 区间 | \(\bar X_n\pm\sqrt{\log(2/\alpha)/(2n)}\) |
| Mill | \(\mathbb P(\lvert Z\rvert>t)\le\sqrt{2/\pi}\,e^{-t^2/2}/t\) |
| Jensen | \(g\) 凸 ⇒ \(\mathbb E g(X)\ge g(\mathbb E X)\) |
| 收敛关系 | \(qm\Rightarrow P\Rightarrow\rightsquigarrow\);\(as\Rightarrow P\);\(\rightsquigarrow c\Rightarrow P\) |
| Slutsky | \(X_n\rightsquigarrow X\),\(Y_n\rightsquigarrow c\) ⇒ \(X_n+Y_n\rightsquigarrow X+c\),\(X_nY_n\rightsquigarrow cX\) |
| WLLN / SLLN | \(\bar X_n\xrightarrow P\mu\) / \(\bar X_n\xrightarrow{as}\mu\) |
| CLT | \(\sqrt n(\bar X_n-\mu)/\sigma\rightsquigarrow N(0,1)\),\(\sigma\) 可换成 \(S_n\) |
| Berry–Esseen | 误差 \(\le\frac{33}{4}\frac{\mathbb E\lvert X-\mu\rvert^3}{\sqrt n\sigma^3}\) |
| Delta 方法 | \(g(Y_n)\approx N(g(\mu),\ g'(\mu)^2\sigma^2/n)\);多元 \(\nabla^T\Sigma\nabla/n\) |
| Sharpe 标准误 | \(\sqrt{(1-\gamma_3SR+\frac{\gamma_4-1}4SR^2)/n}\),正态时 \(\sqrt{(1+SR^2/2)/n}\) |
练习
基础
- 设 \(X\sim\text{Exp}(\beta)\)。计算 \(\mathbb P(|X-\mu|\ge k\sigma)\) 的精确值(\(k>1\)),并与切比雪夫界 \(1/k^2\) 比较。(提示:\(\mu=\sigma=\beta\),\(k>1\) 时左尾为空,精确值为 \(e^{-(k+1)}\)。)
- 用 Hoeffding 不等式求:要以 99% 的把握使胜率估计误差不超过 ±3%,至少需要多少笔独立交易?(答案:\(n\ge\log(200)/(2\cdot0.0009)\approx2944\)。)
- 证明:若 \(X_n\xrightarrow{qm}b\)(常数),则 \(\mathbb E X_n\to b\) 且 \(\mathbb V X_n\to0\);反之亦然。(提示:\(\mathbb E(X_n-b)^2=\mathbb V X_n+(\mathbb E X_n-b)^2\)。)
- 设 \(\mathbb P(X_n=1/n)=1-1/n^2\),\(\mathbb P(X_n=n)=1/n^2\)。\(X_n\) 是否依概率收敛到 0?是否均方收敛到 0?(答案:依概率收敛;\(\mathbb E X_n^2\to1\),不均方收敛到 0。)
- 一个日收益 IID 的策略,日均值 0.05%、日标准差 1.2%。用 CLT 估计:一年(252 天)累计收益为负的概率约为多少?(提示:\(\mathbb P(\bar X<0)\approx\Phi(-\sqrt{252}\cdot0.05/1.2)=\Phi(-0.66)\approx0.25\)。)
进阶
- 设 \(X_1,\dots,X_n\sim U(0,1)\),\(Y_n=\bar X_n^2\),用 Delta 方法求 \(Y_n\) 的渐近分布。(答案:\(g'(1/2)=1\),\(Y_n\approx N(1/4,\ 1/(12n))\)。)
- 设 \((X_{1i},X_{2i})\) IID,用多元 Delta 方法求 \(\bar X_1/\bar X_2\) 的渐近方差(\(\mu_2\neq0\))。(答案:\(\nabla=(1/\mu_2,-\mu_1/\mu_2^2)\),方差为 \(\frac1n\big(\frac{\sigma_{11}}{\mu_2^2}-\frac{2\mu_1\sigma_{12}}{\mu_2^3}+\frac{\mu_1^2\sigma_{22}}{\mu_2^4}\big)\)。这就是信息比率、Beta 一类比值指标的标准误公式骨架。)
- 构造 \(X_n\rightsquigarrow X\)、\(Y_n\rightsquigarrow Y\) 但 \(X_n+Y_n\) 不依分布收敛到 \(X+Y\)(\(X,Y\) 独立)的例子,并说明为什么 Slutsky 定理要求一个极限是常数。
- 推导 Sharpe 比率标准误公式 \(\sqrt{(1-\gamma_3SR+\frac{\gamma_4-1}4SR^2)/n}\) 的每一步,并用 1.6.2 节代码验证:把负偏策略的暴跌概率从 1% 改为 5%(相应调整 gain 使均值不变),观察 \(n=252\) 时 Delta 公式是否变得更准。为什么?(提示:暴跌更频繁时"一次都没碰上"的概率大幅下降,抽样分布更接近正态。)
- 复现"翻倍或减半"游戏:模拟 10000 条 100 局的财富路径,比较样本均值、中位数与理论值 \(c(5/4)^{100}\)、\(c\),并用 Jensen 不等式解释。
原书推荐习题:第 1 章 3、7、10、19、21–23;第 2 章 13、15、21;第 3 章 1、9、11、17、19;第 4 章 3、4(必做)、6;第 5 章 1、8、14、15、16。
原书对照
| 本章内容 | 原书章节 | PDF 页码 |
|---|---|---|
| 前言、术语对照表 | Preface | p.7–11 |
| 概率、条件概率、贝叶斯 | 第 1 章 | p.20–34 |
| 随机变量、常用分布、多元正态、变换 | 第 2 章 | p.35–62 |
| 期望、方差、条件期望、MGF | 第 3 章 | p.63–77 |
| 马尔可夫、切比雪夫、Hoeffding、Mill、Jensen | 第 4.1–4.2 节 | p.78–81 |
| Hoeffding 证明 | 第 4.4 节附录 | p.82 |
| 收敛类型与蕴含关系、Slutsky | 第 5.2 节 | p.86–89 |
| 大数定律、CLT、Berry–Esseen、多元 CLT | 第 5.3–5.4 节 | p.90–93 |
| Delta 方法 | 第 5.5 节 | p.93–94 |
| 几乎必然收敛、一致可积、CLT 证明 | 第 5.7 节附录 | p.95–96 |
(PDF 页码 = 原书正文页码 + 17。)