量化交易中文教材

第 08 章 极限定理

本章对应 Ross 原书第 8 章。极限定理回答两个问题:平均值什么时候、以什么方式收敛到期望(大数定律);大量独立随机变量之和为什么近似正态(中心极限定理)。量化里「回测多长才可信」「多日收益能否当正态」「长期复利增长率是多少」都要靠这一章回答。

学习目标

  1. 掌握 Markov、Chebyshev、单边 Chebyshev、Chernoff 四个不等式,理解「信息越多,界越紧」,会在只知道均值、方差的情况下给出尾部概率的保守界。
  2. 理解弱大数定律与强大数定律的区别,会用 Chebyshev 一行证明弱大数定律。
  3. 掌握中心极限定理(CLT)的内容、MGF 证明思路和使用方法(含连续性修正),知道它在偏态、厚尾时收敛慢,以及期望不存在时完全失效。
  4. 会用 Jensen 不等式分析凸/凹函数的期望,理解风险厌恶与波动拖累。
  5. 能把这些结论用于回测样本量估计、尾部风险的分布无关界、几何平均增长率等量化问题。

读前导读

这一章在解决什么问题。 你在 CFA 里做过很多次「样本均值 ± 1.96 个标准误」的置信区间,也习惯了把多日收益当正态来算 VaR。这两件事背后各有一条定理:大数定律保证样本均值最终会逼近真实均值;中心极限定理保证样本均值(或多个独立收益之和)近似正态,误差约为 \(\sigma/\sqrt n\)。本章证明它们,并讲清楚它们什么时候不灵:分布偏态或厚尾时收敛很慢,期望不存在时(Cauchy)根本不收敛。

本章还给了一组「只知道一点点信息也能用」的尾部概率界(Markov、Chebyshev、Chernoff)。和 VaR 不同,它们不假设正态,比如:只知道均值和波动,3σ 以上的亏损概率最多是多少?答案比正态下大一个数量级,这在压力测试里很有用。

最后是 Jensen 不等式。你熟悉的「几何平均收益 ≈ 算术平均 − 方差/2」「凸性让期权有时间价值」「风险厌恶对应凹效用函数」,都是它的推论。

需要先想起来的数学。

  • 极限与「收敛」的几种说法。 \(a_n\to a\) 指 \(n\) 足够大以后,\(a_n\) 和 \(a\) 的距离可以任意小。随机变量的「收敛」更微妙:「依概率收敛」(弱大数定律)是说偏离超过 \(\varepsilon\) 的概率趋于 0;「以概率 1 收敛 / 几乎必然收敛」(强大数定律)是说几乎每一条样本路径本身都收敛。见 第 00 册第 01 章 函数极限与连续 和 第 07 章 概率中的分析工具。
  • 泰勒展开(二阶)。 \(f(x)\approx f(\mu)+f'(\mu)(x-\mu)+\frac12f''(\mu)(x-\mu)^2\)。久期是一阶项,凸性是二阶项。CLT 的证明和 Jensen 不等式都靠它。见 第 00 册第 02 章 导数与泰勒展开。
  • L'Hôpital 法则。 若 \(f(n)\to0\)、\(g(n)\to0\),则 \(\lim\frac{f}{g}=\lim\frac{f'}{g'}\)(右边存在时)。例:\(\lim_{x\to0}\frac{\log(1+x)}{x}=\lim\frac{1/(1+x)}{1}=1\)。CLT 证明里用了两次。见 第 00 册第 02 章 导数与泰勒展开。
  • 级数收敛。 \(\sum1/n^2\) 收敛(和为 \(\pi^2/6\)),\(\sum1/n\) 发散。强大数定律的证明需要知道 \(\sum_n1/n^2<\infty\)。见 第 00 册第 04 章 级数与收敛。
  • 凸函数。 \(f''\ge0\) 的函数,图像像碗口朝上,弦总在曲线上方。见 第 00 册第 05 章 多元微积分与优化。

怎么读这一章。 核心必读:8.2 全节、8.3.1 的定理陈述与 8.3.2 的例 3a、3b,8.4 的定理陈述、「弱与强的区别」「淹没而不补偿」「均值必须存在」三段,8.5.3 Jensen 不等式,以及量化实战。8.3.1 的 MGF 证明和 8.4 的强大数定律证明第一次可以只看讲解框里的思路。8.5.1–8.5.2 看结论和例 5c、5e。8.6 选读,可跳过。


8.1 引言

概率论最重要的理论结果是极限定理,分两类:

  • 大数定律(laws of large numbers):在什么条件下,随机变量序列的平均值(在某种意义下)收敛到期望的平均值;
  • 中心极限定理(central limit theorems):在什么条件下,大量随机变量之和近似服从正态分布。

8.2 Chebyshev 不等式与弱大数定律

8.2.1 Markov 与 Chebyshev 不等式

命题 2.1(Markov 不等式) \(X\ge0\),则对任意 \(a>0\),

\[P\{X\ge a\}\le\frac{E[X]}{a}.\]
证明:示性变量 \(I=I(X\ge a)\) 满足 \(I\le X/a\)(因为 \(X\ge0\)),两边取期望。

命题 2.2(Chebyshev 不等式) \(X\) 有有限均值 \(\mu\) 与方差 \(\sigma^2\),则对 \(k>0\),

\[P\{|X-\mu|\ge k\}\le\frac{\sigma^2}{k^2}.\]
证明:对非负变量 \((X-\mu)^2\) 用 Markov 不等式,取 \(a=k^2\)。写成标准差倍数的形式:\(P\{|X-\mu|\ge k\sigma\}\le1/k^2\)。

推导拆解:Markov 的证明为什么成立?\(I(X\ge a)\le X/a\) 分两种情况验证:若 \(X\ge a\),左边是 1,右边 \(X/a\ge1\);若 \(X<a\),左边是 0,右边 \(X/a\ge0\)(这里要求 \(X\ge0\))。两边取期望,左边是 \(P\{X\ge a\}\),右边是 \(E[X]/a\)。 Chebyshev:事件 \(\{|X-\mu|\ge k\}\) 和 \(\{(X-\mu)^2\ge k^2\}\) 是同一个事件,对后者用 Markov,分子 \(E[(X-\mu)^2]=\sigma^2\)。 金融直觉:Markov 说的是:一笔平均损失 100 万的业务,损失超过 1000 万的概率最多 10%,因为损失非负,大损失太频繁会把均值拉高。Chebyshev 用了更多信息(方差),所以更紧:任何分布下,偏离均值 3 个标准差以上的概率不超过 \(1/9\approx11\%\)。

例 2a 工厂周产量均值 50。(a) Markov:\(P\{X>75\}\le50/75=2/3\)。(b) 若方差为 25,Chebyshev:\(P\{|X-50|\ge10\}\le25/100=1/4\),所以 \(P\{40<X<60\}\ge3/4\)。

例 2b(界通常很松) \(X\sim U(0,10)\),\(E=5\),\(\mathrm{Var}=25/3\)。Chebyshev 给出 \(P\{|X-5|>4\}\le\frac{25/3}{16}\approx0.52\),真实值为 0.20。对正态,Chebyshev 给出 \(P\{|X-\mu|>2\sigma\}\le1/4\),真实值 \(2[1-\Phi(2)]\approx0.0456\)。

Chebyshev 对一切有方差的分布都成立,代价就是对具体分布不紧。它的主要用途是理论证明,以及在对分布形状毫无把握时给出保守估计。

命题 2.3 \(\mathrm{Var}(X)=0\) 则 \(P\{X=E[X]\}=1\)。证明:对每个 \(n\),\(P\{|X-\mu|>1/n\}=0\),由概率的连续性令 \(n\to\infty\) 得 \(P\{X\ne\mu\}=0\)。(第 07a 章证明 \(|\rho|=1\) 意味着线性关系时用到了它。)

8.2.2 弱大数定律

定理 2.1(弱大数定律,weak law of large numbers) \(X_1,X_2,\dots\) i.i.d.,有限均值 \(\mu\),则对任意 \(\varepsilon>0\),

\[P\Big\{\Big|\frac{X_1+\cdots+X_n}{n}-\mu\Big|\ge\varepsilon\Big\}\to0\quad(n\to\infty).\]

证明(额外假设方差 \(\sigma^2\) 有限):\(E[\bar X_n]=\mu\),\(\mathrm{Var}(\bar X_n)=\sigma^2/n\),由 Chebyshev

\[P\{|\bar X_n-\mu|\ge\varepsilon\}\le\frac{\sigma^2}{n\varepsilon^2}\to0.\]

白话解释:定理里的 \(\varepsilon\)(epsilon)代表「你能容忍的误差」,可以任意小,比如 0.01%。定理说:不管你定多严的误差标准,只要样本足够多,「样本均值偏离真实均值超过这个标准」的概率都能压到接近 0。证明那一行还给出了速度:概率上界 \(\frac{\sigma^2}{n\varepsilon^2}\) 与 \(n\) 成反比。比如日收益 \(\sigma=1\%\)、容忍误差 \(\varepsilon=0.1\%\),要把这个上界压到 5% 以下,需要 \(n\ge\frac{(1\%)^2}{0.05\times(0.1\%)^2}=2000\) 天。

历史:James Bernoulli 对 Bernoulli 变量证明了这一结果(《Ars Conjectandi》,1713 年由其侄 Nicholas 出版);一般形式(只需均值有限)由 Khintchine 证明。

8.3 中心极限定理

8.3.1 定理与证明

定理 3.1(中心极限定理,central limit theorem) \(X_1,X_2,\dots\) i.i.d.,均值 \(\mu\)、方差 \(\sigma^2\)(有限),则对一切实数 \(a\),

\[P\Big\{\frac{X_1+\cdots+X_n-n\mu}{\sigma\sqrt n}\le a\Big\}\to\Phi(a)=\frac{1}{\sqrt{2\pi}}\int_{-\infty}^ae^{-x^2/2}dx.\]
等价地说,和 \(S_n\) 近似服从 \(N(n\mu,n\sigma^2)\),均值 \(\bar X_n\) 近似服从 \(N(\mu,\sigma^2/n)\)。收敛关于 \(a\) 一致。

CLT 有两层意义:它给出了计算独立和的近似概率的方法;也解释了为什么很多「由大量微小因素叠加而成」的量(测量误差、身高)呈钟形分布。

引理 3.1(连续性定理,未证) 若 \(M_{Z_n}(t)\to M_Z(t)\) 对一切 \(t\) 成立,则在 \(F_Z\) 的连续点上 \(F_{Z_n}(t)\to F_Z(t)\)。

证明思路(假设 MGF 存在) 先设 \(\mu=0,\sigma^2=1\)。\(\sum X_i/\sqrt n\) 的 MGF 为 \([M(t/\sqrt n)]^n\)。令 \(L(t)=\log M(t)\)(累积量生成函数),则

\[L(0)=0,\quad L'(0)=\frac{M'(0)}{M(0)}=\mu=0,\quad L''(0)=\frac{M(0)M''(0)-M'(0)^2}{M(0)^2}=E[X^2]=1.\]
只需证明 \(nL(t/\sqrt n)\to t^2/2\)。把 \(n\) 看成连续变量,用两次 L'Hôpital 法则:
\[\lim_{n\to\infty}\frac{L(t/\sqrt n)}{n^{-1}}=\lim\frac{L'(t/\sqrt n)\,t}{2n^{-1/2}}=\lim L''(t/\sqrt n)\frac{t^2}{2}=\frac{t^2}{2}.\]
于是 MGF 收敛到 \(e^{t^2/2}\),由连续性定理得证。一般情形对 \(X_i^*=(X_i-\mu)/\sigma\) 应用即可。

推导拆解:整体思路是「算出标准化和的 MGF,证明它趋于标准正态的 MGF \(e^{t^2/2}\)」。 (1)独立和的 MGF 是乘积:\(E[e^{t\sum X_i/\sqrt n}]=\prod E[e^{(t/\sqrt n)X_i}]=[M(t/\sqrt n)]^n\)。 (2)取对数把 \(n\) 次方变成乘以 \(n\):\(\log[M(t/\sqrt n)]^n=nL(t/\sqrt n)\)。目标变成证明它趋于 \(t^2/2\)。 (3)\(L''(0)\) 的计算:对 \(L=\log M\) 求导得 \(L'=M'/M\);再用商的求导法则得 \(L''=\frac{MM''-(M')^2}{M^2}\)。在 0 处 \(M(0)=1\)、\(M'(0)=E[X]=0\)、\(M''(0)=E[X^2]=1\)。 (4)\(n\to\infty\) 时 \(L(t/\sqrt n)\to L(0)=0\),\(1/n\to0\),是「0/0」型,可以用 L'Hôpital。第一次对 \(n\) 求导,分子用链式法则:\(\frac{d}{dn}L(tn^{-1/2})=L'(tn^{-1/2})\cdot t\cdot(-\frac12n^{-3/2})\),分母 \(\frac{d}{dn}n^{-1}=-n^{-2}\),相除得中间那一项。它仍是 0/0 型(\(L'(0)=0\)),再用一次即得 \(L''\cdot t^2/2\to t^2/2\)。 更直观的看法是泰勒展开:\(L(s)\approx L(0)+L'(0)s+\frac12L''(0)s^2=\frac{s^2}{2}\),代入 \(s=t/\sqrt n\) 再乘 \(n\),正好是 \(t^2/2\);被忽略的三阶项是 \(n\cdot O(n^{-3/2})=O(n^{-1/2})\)(\(O(\cdot)\) 读作「与……同阶」),这就是下一段「偏度按 \(n^{-1/2}\) 衰减」的来源。

证明揭示了 CLT 的本质:标准化以后,累积量生成函数只剩二阶项存活,三阶及以上的累积量(偏度、峰度)的贡献按 \(n^{-1/2},n^{-1},\dots\) 衰减。所以偏度越大、峰度越高,收敛越慢。

历史:DeMoivre 约 1733 年对 \(p=1/2\) 的 Bernoulli 得到这一结果;Laplace 推广到任意 \(p\) 并提出一般形式(证明不严格);Liapounoff 在 1901–1902 年首次给出严格证明。这也为第 05 章(5.4 节)二项分布的正态近似提供了依据。

原书图 8.1 某 5 点分布(\(P_0=.25,P_1=.15,P_2=.1,P_3=.2,P_4=.3\))的 \(n=5,10,25,100\) 个独立和的分布律,随 \(n\) 增大越来越像钟形。

8.3.2 例题

例 3a(天文测量需要多少次) 测量值 i.i.d.、均值为真实距离 \(d\)、方差 4,要求以 95% 的把握误差在 ±0.5 之内。

\[P\{|\bar X_n-d|\le0.5\}\approx2\Phi\Big(\frac{0.5\sqrt n}{2}\Big)-1=0.95\ \Rightarrow\ \frac{\sqrt n}4=1.96\ \Rightarrow\ n\approx61.47,\]
取 62 次。

推导拆解:\(\bar X_n\) 的标准差是 \(\sigma/\sqrt n=2/\sqrt n\)。把 \(|\bar X_n-d|\le0.5\) 标准化:除以 \(2/\sqrt n\),得 \(|Z|\le\frac{0.5\sqrt n}{2}\)。对称区间的正态概率 \(P\{|Z|\le c\}=2\Phi(c)-1\),令它等于 0.95,得 \(c=1.96\),于是 \(\sqrt n=4\times1.96=7.84\),\(n=61.47\)。这和 CFA 里「给定误差边界求样本量」\(n=(z\sigma/E)^2\) 是同一个公式:\((1.96\times2/0.5)^2=61.47\)。

若不放心正态近似,用 Chebyshev:\(P\{|\bar X-d|>0.5\}\le\frac{4}{0.25n}=\frac{16}{n}\le0.05\),需 \(n=320\) 次——更保守,但对任何分布都成立。

例 3b(Poisson 的正态近似与连续性修正) 选课人数 \(X\sim\) Poisson(100),求 \(P\{X\ge120\}\)。Poisson(100) 是 100 个独立 Poisson(1) 之和,可用 CLT。离散变量用连续性修正(continuity correction):

\[P\{X\ge120\}=P\{X\ge119.5\}\approx1-\Phi\Big(\frac{119.5-100}{10}\Big)=1-\Phi(1.95)\approx0.0256.\]

例 3c 10 颗骰子点数之和在 30 到 40 之间(含两端):\(E[X_i]=7/2\),\(\mathrm{Var}(X_i)=35/12\), \(P\{29.5\le X\le40.5\}\approx2\Phi(1.0184)-1\approx0.692\)。

例 3d 10 个 \(U(0,1)\) 之和超过 6:均值 5、方差 10/12,\(P\approx1-\Phi(\sqrt{1.2})\approx0.1367\)。

例 3e 50 份试卷,每份批改时间均值 20 分钟、标准差 4 分钟。前 450 分钟至少批完 25 份 ⇔ 前 25 份总时间 \(\le450\);总时间均值 500、方差 400,\(P\approx\Phi(-2.5)\approx0.006\)。

8.3.3 非同分布的 CLT

定理 3.2 \(X_i\) 独立,均值 \(\mu_i\)、方差 \(\sigma_i^2\)。若 (a) 一致有界:\(P\{|X_i|<M\}=1\);(b) \(\sum\sigma_i^2=\infty\),则

\[P\Big\{\frac{\sum_{i=1}^n(X_i-\mu_i)}{\sqrt{\sum_{i=1}^n\sigma_i^2}}\le a\Big\}\to\Phi(a).\]
这说明「同分布」不是必需的,只要没有哪一项主导整个和。在组合层面,如果某一个持仓的风险占了绝大部分,组合收益就不会因为持仓多而变得「更正态」。

原书在此附有 Laplace 把 CLT 称作「误差频率定律」的历史注记,以及 Galton 对它的赞叹。

8.4 强大数定律

定理 4.1(强大数定律,strong law of large numbers) \(X_i\) i.i.d.,有限均值 \(\mu\),则以概率 1,

\[\frac{X_1+\cdots+X_n}{n}\to\mu,\quad\text{即}\quad P\Big\{\lim_{n\to\infty}\frac{X_1+\cdots+X_n}{n}=\mu\Big\}=1.\]

应用:令 \(X_i=I(E\text{ 在第 }i\text{ 次试验中发生})\),则事件 \(E\) 发生的长期频率以概率 1 等于 \(P(E)\)——这为概率的频率解释提供了理论依据,也是蒙特卡洛模拟(第 10 章)可行的根据。

证明(假设四阶矩有限,\(E[X_i^4]=K\)) 设 \(\mu=0\),\(S_n=\sum X_i\)。展开 \(E[S_n^4]\):含 \(X_i^3X_j\)、\(X_i^2X_jX_k\)、\(X_iX_jX_kX_l\)(下标不同)的项期望都是 0;剩下 \(n\) 个 \(X_i^4\) 项和每对 \(i<j\) 的 \(\binom42=6\) 个 \(X_i^2X_j^2\) 项:

\[E[S_n^4]=nK+6\binom n2\big(E[X^2]\big)^2\le nK+3n(n-1)K,\]
(用 \((E[X^2])^2\le E[X^4]\))。于是 \(E[S_n^4/n^4]\le K/n^3+3K/n^2\),求和有限:\(E\big[\sum_nS_n^4/n^4\big]<\infty\)。一个期望有限的非负随机变量以概率 1 有限,所以级数 \(\sum S_n^4/n^4\) 以概率 1 收敛,通项 \((S_n/n)^4\to0\),即 \(S_n/n\to0\)。

推导拆解: (1)为什么那些交叉项期望为 0?例如 \(E[X_i^3X_j]=E[X_i^3]E[X_j]\)(独立),而 \(E[X_j]=0\)。只要某个下标只出现一次,就能拆出一个 \(E[X_j]=0\) 的因子。 (2)为什么是 6?从 4 个因子 \(S_n\cdot S_n\cdot S_n\cdot S_n\) 中选 2 个取 \(X_i\)、另 2 个取 \(X_j\),选法有 \(\binom42=6\) 种。 (3)\((E[X^2])^2\le E[X^4]\) 来自 \(\mathrm{Var}(X^2)\ge0\)。 (4)\(\sum1/n^2\)、\(\sum1/n^3\) 都收敛,所以期望的和有限;非负项可以交换期望和无穷和(第 07a 章 7.2.4 节)。 (5)最后一步的逻辑:一个级数收敛,它的通项必须趋于 0。 白话:证明的关键是 \(E[S_n^4]\) 只按 \(n^2\) 增长,所以 \((S_n/n)^4\) 的期望按 \(1/n^2\) 衰减,快到可以「加起来还是有限的」。用二阶矩只能得到 \(1/n\) 的衰减,加起来发散,所以这里才要求四阶矩。

弱与强的区别(常见误区) 弱大数定律只说:对任意给定的大 \(n\),\(\bar X_n\) 很可能接近 \(\mu\);它不排除 \(|\bar X_n-\mu|>\varepsilon\) 这种大偏离在 \(n\) 增大过程中无穷多次(虽然越来越稀疏地)出现。强大数定律排除了这种情况:以概率 1,对任意 \(\varepsilon>0\),大偏离只发生有限次,此后均值永远待在 \(\mu\) 的 \(\varepsilon\) 邻域内。历史上 Borel 证明了 Bernoulli 情形,Kolmogorov 证明了一般形式。

「淹没而不补偿」(原书理论题 8.9):前 100 次抛硬币全是正面,之后 900 次中正面的期望比例仍是 1/2。大数定律让早期的偏差被后来的大量观测「淹没」(swamps),而不是靠后面「补偿」(compensates)。对交易的含义:连续亏损之后,策略并不会因为大数定律而「该赚回来了」——这是赌徒谬误。

均值必须存在。 大数定律要求 \(E|X|<\infty\)。Cauchy 分布(密度 \(\frac{1}{\pi(1+x^2)}\))的期望不存在(\(\int|x|f(x)dx=\infty\)),\(n\) 个独立 Cauchy 的样本均值仍是标准 Cauchy,不管 \(n\) 多大都不会收敛。下面的实战代码会展示这一点。注意原书封底分布表把 Cauchy 的期望写成 0,严格说是错误的:0 只是它的对称中心(中位数),期望不存在(见本册附录 A1)。

8.5 其他不等式

8.5.1 单边 Chebyshev 不等式

命题 5.1(单边 Chebyshev / Cantelli 不等式) \(E[X]=0\),方差 \(\sigma^2\),对 \(a>0\),

\[P\{X\ge a\}\le\frac{\sigma^2}{\sigma^2+a^2}.\]
证明:对任意 \(b>0\),\(P\{X\ge a\}=P\{X+b\ge a+b\}\le P\{(X+b)^2\ge(a+b)^2\}\le\frac{\sigma^2+b^2}{(a+b)^2}\)(Markov),再取最优 \(b=\sigma^2/a\)。

推导拆解:第一个「\(\le\)」:\(X+b\ge a+b>0\) 时平方后仍有 \((X+b)^2\ge(a+b)^2\),所以前一个事件包含在后一个事件里。分子 \(E[(X+b)^2]=E[X^2]+2bE[X]+b^2=\sigma^2+b^2\)(\(E[X]=0\))。最优 \(b\):对 \(h(b)=\frac{\sigma^2+b^2}{(a+b)^2}\) 求导令其为 0,化简得 \(b(a+b)-(\sigma^2+b^2)=0\),即 \(ab=\sigma^2\)。代回:\(h=\frac{\sigma^2+\sigma^4/a^2}{(a+\sigma^2/a)^2}=\frac{\sigma^2(a^2+\sigma^2)/a^2}{(a^2+\sigma^2)^2/a^2}=\frac{\sigma^2}{\sigma^2+a^2}\)。 金融直觉:风险管理关心的是单边(亏损侧)尾部。双边 Chebyshev 把两侧尾部概率合在一起算,用在单侧就浪费了;单边版本把这部分信息用上了。\(k=2\) 时,双边 Chebyshev 给出 25%,单边版本给出 20%。

推论 5.1 \(E[X]=\mu\),\(\mathrm{Var}(X)=\sigma^2\),\(a>0\):

\[P\{X\ge\mu+a\}\le\frac{\sigma^2}{\sigma^2+a^2},\qquad P\{X\le\mu-a\}\le\frac{\sigma^2}{\sigma^2+a^2}.\]
用标准差倍数表示:\(P\{X\le\mu-k\sigma\}\le\frac{1}{1+k^2}\)。

例 5a 周产量均值 100、方差 400,\(P\{X\ge120\}\le\frac{400}{400+400}=\frac12\);Markov 只能给出 \(100/120=5/6\)。

例 5b 100 男 100 女随机配成 100 对,男女对数 \(X\) 的 \(E[X]\approx50.25\)、\(\mathrm{Var}(X)\approx25.126\)。Chebyshev:\(P\{X\le30\}\le25.126/20.25^2\approx0.061\);单边版本 \(\le\frac{25.126}{25.126+20.25^2}\approx0.058\)。

8.5.2 Chernoff 界

命题 5.2(Chernoff 界) 对 \(e^{tX}\) 用 Markov 不等式:

\[P\{X\ge a\}\le e^{-ta}M(t)\quad(t>0),\qquad P\{X\le a\}\le e^{-ta}M(t)\quad(t<0).\]
对 \(t\) 取最小值得到最好的界。Chernoff 界随 \(a\) 指数衰减,比 Chebyshev 的多项式衰减紧得多,但需要知道 MGF。

推导拆解:\(t>0\) 时 \(e^{tx}\) 单调递增,所以 \(\{X\ge a\}=\{e^{tX}\ge e^{ta}\}\);\(e^{tX}\) 非负,用 Markov 得 \(P\le E[e^{tX}]/e^{ta}=e^{-ta}M(t)\)。这对每个 \(t>0\) 都成立,所以可以挑最小的那个。\(t<0\) 时 \(e^{tx}\) 递减,不等号方向反过来,得到左尾的界。 例 5c 的最小化:\(e^{t^2/2-ta}\) 最小等价于指数 \(t^2/2-ta\) 最小,求导 \(t-a=0\),得 \(t=a\),代回指数为 \(-a^2/2\)。 白话:Markov 只用均值,Chebyshev 用到二阶矩,Chernoff 通过 MGF 一次用上所有阶的矩,信息最多,所以在远端尾部最紧。

例 5c(标准正态) \(e^{t^2/2-ta}\) 在 \(t=a\) 处最小:\(P\{Z\ge a\}\le e^{-a^2/2}\)(\(a>0\))。

例 5d(Poisson) 最小化 \(\lambda(e^t-1)-ti\) 得 \(e^t=i/\lambda\)(要求 \(i>\lambda\)):

\[P\{X\ge i\}\le\frac{e^{-\lambda}(e\lambda)^i}{i^i}.\]

例 5e(对称随机游走,Hoeffding 型界) \(X_i=\pm1\) 等概率,\(E[e^{tX}]=\frac{e^t+e^{-t}}2=\sum_n\frac{t^{2n}}{(2n)!}\le\sum_n\frac{(t^2/2)^n}{n!}=e^{t^2/2}\)(因为 \((2n)!\ge n!2^n\))。于是 \(E[e^{tS_n}]\le e^{nt^2/2}\),取 \(t=a/n\):

\[P\{S_n\ge a\}\le e^{-a^2/2n}.\]
例:\(P\{S_{10}\ge6\}\le e^{-1.8}\approx0.165\),精确值为「10 局至少赢 8 局」的概率 \(56/1024\approx0.055\)。

这个界的一般形式(Hoeffding 不等式:有界独立变量之和的尾部按 \(e^{-ca^2/n}\) 衰减)是机器学习泛化误差分析的基础工具,也可以用来给「胜率 55% 的策略在 \(n\) 笔交易后仍亏损」的概率一个不依赖正态假设的上界。

8.5.3 Jensen 不等式

定义 二阶可导函数 \(f\),若 \(f''\ge0\) 称为凸(convex),\(f''\le0\) 称为凹(concave)。例:\(x^2\)、\(e^{ax}\) 凸;\(\log x\)、\(\sqrt x\) 凹。

命题 5.3(Jensen 不等式) \(f\) 凸,则

\[E[f(X)]\ge f(E[X]).\]
证明:在 \(\mu=E[X]\) 处 Taylor 展开,\(f(x)=f(\mu)+f'(\mu)(x-\mu)+\frac{f''(\xi)}2(x-\mu)^2\ge f(\mu)+f'(\mu)(x-\mu)\),两边取期望。凹函数不等号反向。

推导拆解:\(\xi\)(读作 xi)是 \(x\) 与 \(\mu\) 之间的某个点,这是带余项的泰勒公式(拉格朗日余项):展开到一阶后,剩下的误差恰好等于二阶导数在某个中间点的值乘 \(\frac12(x-\mu)^2\)。由于 \(f''\ge0\),这一项非负,可以扔掉得到不等式。两边取期望时,\(E[f'(\mu)(X-\mu)]=f'(\mu)(E[X]-\mu)=0\),于是 \(E[f(X)]\ge f(\mu)\)。 金融直觉:这就是债券凸性的逻辑。价格–收益率曲线是凸的,收益率围绕某个水平上下波动时,债券的平均价格高于「平均收益率对应的价格」,多出的部分约为 \(\frac12f''\sigma^2\),这正是久期–凸性展开里的凸性项。期权同理:收益函数凸,标的波动越大,期权的期望收益越高。

例 5f(风险偏好) 投资者在随机回报 \(X\)(均值 \(m\))与确定回报 \(m\) 之间选择,目标是最大化期望效用 \(E[u(R)]\)。若效用函数 \(u\) 凹(风险厌恶),\(E[u(X)]\le u(m)\),选确定回报;若 \(u\) 凸(风险偏好),选随机回报。

Jensen 不等式在量化里随处可见:

  • \(E[\log(1+R)]\le\log(1+E[R])\):长期复利增长率低于算术平均收益,差额即波动拖累(volatility drag),近似为 \(\sigma^2/2\)。(\(\sigma^2/2\) 的来历:\(\log(1+R)\approx R-\frac{R^2}2\),取期望得 \(E[R]-\frac12(\sigma^2+E[R]^2)\),收益不大时约为 \(E[R]-\frac{\sigma^2}2\)。例:\(+50\%\) 和 \(-50\%\) 各一年,算术平均 0,财富却变成 \(1.5\times0.5=0.75\)。)
  • 期权收益 \((S-K)^+\) 是凸函数,所以 \(E[(S-K)^+]\ge(E[S]-K)^+\):波动越大,期权越值钱。
  • \(\sqrt{\cdot}\) 凹:用日方差均值开根号估计的波动率 \(\sqrt{E[\hat\sigma^2]}\) 与平均波动 \(E[\hat\sigma]\) 不同,后者偏小。

8.6 用 Poisson 近似独立 Bernoulli 和的误差界(选读)

第 04b 章(4.9 节)的泊松近似和「泊松范式」只说近似成立,本节给出误差的定量上界。

目标 \(X_i\sim\) Bernoulli\((p_i)\) 独立,\(X=\sum X_i\),\(Y\sim\) Poisson\((\lambda)\),\(\lambda=\sum p_i\)。证明对任意集合 \(A\),

\[\big|P\{X\in A\}-P\{Y\in A\}\big|\le\sum_{i=1}^np_i^2.\]

耦合构造(coupling) 取独立的 \(Y_i\sim\) Poisson\((p_i)\),再取独立的 \(U_i\):\(U_i=0\) 的概率为 \((1-p_i)e^{p_i}\)(由 \(e^{-p}\ge1-p\) 知它 \(\le1\)),否则为 1。令 \(X_i=0\) 当且仅当 \(Y_i=U_i=0\)。则 \(P\{X_i=0\}=e^{-p_i}(1-p_i)e^{p_i}=1-p_i\),\(X_i\) 正是 Bernoulli\((p_i)\),且

\[P\{X_i\ne Y_i\}=P\{Y_i=0,U_i=1\}+P\{Y_i>1\}=p_i-p_ie^{-p_i}\le p_i^2.\]
\(Y=\sum Y_i\sim\) Poisson\((\lambda)\)。\(X\ne Y\) 意味着某个 \(X_i\ne Y_i\),由 Boole 不等式 \(P\{X\ne Y\}\le\sum p_i^2\);而 \(|I\{X\in A\}-I\{Y\in A\}|\le I\{X\ne Y\}\),取期望即得。

所有 \(p_i=p\) 时,二项分布的 Poisson 近似误差不超过 \(np^2\)——\(p\) 越小近似越好。量化里,大量独立的小概率事件(如组合里众多债券各自以很小概率违约)的发生次数可以近似为 Poisson;这个界说明误差有多大。但违约通常并不独立,相关性会让实际分布的尾部远比 Poisson 厚。


量化实战

1. 回测需要多长? 例 3a 的逻辑直接搬到回测:要以 95% 把握把日均超额收益的估计误差控制在 \(\pm\delta\) 以内,需要 \(n\approx(1.96\sigma/\delta)^2\) 天。若日超额收益波动 1%、想分辨 2bp 的日 alpha(年化约 5%),需要约 9600 天(38 年)。若担心厚尾不敢用 CLT,Chebyshev 版本 \(n=\sigma^2/(0.05\delta^2)\) 需要 5 万天。结论:日频 alpha 很难仅凭单一资产的时间序列确认,必须靠横截面广度或更高频的数据。

2. 分布无关的尾部风险界。 只知道组合收益的均值和波动时,单边 Chebyshev 给出 \(P\{\text{损失}\ge k\sigma\}\le\frac1{1+k^2}\),对任何分布都成立,可作为压力测试的保守参照:3σ 以上亏损的概率至多 10%(正态下只有 0.13%)。这个差距提醒我们,正态假设下的小概率在厚尾世界里可能大一个数量级。

3. CLT 何时可靠。 多日收益是日收益之和,所以「月收益比日收益更接近正态」。但对偏态分布,尾部的收敛很慢;如果期望或方差不存在(Cauchy 一类极端厚尾),CLT 和大数定律都会失效。

4. 几何平均与波动拖累。 自测题 8.13:对正随机变量 \(X_i\) i.i.d.,取对数后用强大数定律,

\[\Big(\prod_{i=1}^nX_i\Big)^{1/n}=\exp\Big\{\frac1n\sum\log X_i\Big\}\to e^{E[\log X]}\quad\text{以概率 1}.\]
资金曲线是毛收益 \(1+R_i\) 的连乘,所以长期复利增长率由 \(E[\log(1+R)]\) 决定,而不是算术均值 \(E[R]\)。由 Jensen,\(E[\log(1+R)]\le\log(1+E[R])\),近似差 \(\sigma^2/2\)。Kelly 准则正是最大化 \(E[\log(1+fR)]\)(第 07b 章练习 9、第 11 册)。

import numpy as np
from scipy import stats
rng = np.random.default_rng(8)

# ---------- 1. 原书习题 8.23:Poisson(20) 的 P{X>=26},各种界与精确值 ----------
lam, i = 20, 26
markov = lam / i
cantelli = lam / (lam + (i - lam) ** 2)
chernoff = np.exp(-lam) * (np.e * lam) ** i / i ** i
clt = 1 - stats.norm.cdf((i - 0.5 - lam) / np.sqrt(lam))
exact = stats.poisson.sf(i - 1, lam)
for name, v in [("Markov", markov), ("单边Chebyshev", cantelli), ("Chernoff", chernoff),
                ("CLT(连续性修正)", clt), ("精确值", exact)]:
    print(f"{name:<16s}{v:.6f}")

# ---------- 2. 回测需要多长:CLT vs Chebyshev ----------
sigma, delta = 0.01, 0.0002            # 日波动 1%,想把日均 alpha 误差控制在 ±2bp
z = stats.norm.ppf(0.975)
n_clt = (z * sigma / delta) ** 2
n_cheb = sigma**2 / (0.05 * delta**2)
print(f"\n95% 把握误差 ±2bp: CLT 需 {n_clt:,.0f} 天 (约 {n_clt/252:.0f} 年); "
      f"Chebyshev 需 {n_cheb:,.0f} 天 (约 {n_cheb/252:.0f} 年)")

# ---------- 3. CLT 收敛速度:偏态/厚尾时尾部近似差 ----------
def tail_ratio(sampler, mu, sd, n, reps=400_000, a=-2.326):
    s = sampler((reps, n)).sum(1)
    zn = (s - n * mu) / (sd * np.sqrt(n))
    return (zn <= a).mean() / stats.norm.cdf(a)      # 实际左尾 / 正态左尾
neg_exp = lambda size: -rng.standard_exponential(size)  # 左偏(像损失)
print("\n标准化和的 1% 左尾:实际概率 / 正态预测")
for n in [1, 5, 20, 100]:
    print(f"  n={n:<4d} 左偏指数: {tail_ratio(neg_exp, -1, 1, n):.2f}")

# ---------- 4. 大数定律:Cauchy 的样本均值不收敛 ----------
N = 1_000_000
for name, x in [("正态", rng.standard_normal(N)), ("Cauchy", rng.standard_cauchy(N))]:
    run = np.cumsum(x) / np.arange(1, N + 1)
    print(f"\n{name} 样本均值 n=1e3,1e4,1e5,1e6: " +
          ", ".join(f"{run[k-1]:+.4f}" for k in [10**3, 10**4, 10**5, 10**6]))

# ---------- 5. 几何平均 → e^{E log X}:波动拖累 ----------
mu_a = 0.10                                    # 年算术均值 10%
for vol in [0.20, 0.40]:
    gross = 1 + rng.normal(mu_a, vol, (20_000, 30)).clip(-0.99)   # 30 年
    geo = np.exp(np.log(gross).mean(1)) - 1                      # 每条路径的几何年化
    g_inf = np.exp(np.log(1 + rng.normal(mu_a, vol, 2_000_000).clip(-0.99)).mean()) - 1
    print(f"\n波动 {vol:.0%}: 长期几何年化 e^(E log)-1 = {g_inf:.2%}, "
          f"粗略近似 μ-σ²/2 = {mu_a - vol**2/2:.2%}")
    print(f"  30 年路径几何年化中位数 {np.median(geo):.2%}, 30 年后仍亏损的比例 {(geo < 0).mean():.1%}")

关键输出:

Markov          0.769231
单边Chebyshev     0.357143
Chernoff        0.439784
CLT(连续性修正)      0.109379
精确值             0.112185

95% 把握误差 ±2bp: CLT 需 9,604 天 (约 38 年); Chebyshev 需 50,000 天 (约 198 年)

标准化和的 1% 左尾:实际概率 / 正态预测
  n=1    左偏指数: 3.55
  n=5    左偏指数: 2.59
  n=20   左偏指数: 1.86
  n=100  左偏指数: 1.38

正态 样本均值 n=1e3,1e4,1e5,1e6: +0.0472, +0.0043, +0.0046, +0.0008

Cauchy 样本均值 n=1e3,1e4,1e5,1e6: +0.1003, -0.9601, +0.1235, +0.2742

波动 20%: 长期几何年化 e^(E log)-1 = 8.10%, 粗略近似 μ-σ²/2 = 8.00%
  30 年路径几何年化中位数 8.17%, 30 年后仍亏损的比例 1.3%

波动 40%: 长期几何年化 e^(E log)-1 = 0.11%, 粗略近似 μ-σ²/2 = 2.00%
  30 年路径几何年化中位数 0.99%, 30 年后仍亏损的比例 45.7%

解读:

  • 第一组数字重现了原书习题 8.23 的「界逐级变紧」:Markov 0.77、单边 Chebyshev 0.36、Chernoff 0.44、CLT 0.109,精确值 0.112。这里 Chernoff 不如单边 Chebyshev,是因为 26 离均值 20 只有 1.3 个标准差,指数界的优势在更远的尾部才显现。(原书附录 A 给出的 Chernoff 值为 0.4267;按例 5d 的公式直接计算得 0.4398,后者是该方法能给出的最优界,结论不受影响。)
  • 左偏变量之和的 1% 左尾,在 \(n=20\) 时实际概率仍是正态预测的 1.9 倍,\(n=100\) 时还有 1.4 倍:用正态近似做 VaR 会系统性低估左偏资产的尾部风险。
  • Cauchy 的样本均值在一百万个样本后依然乱跳,大数定律不适用。
  • 同样 10% 的算术平均收益,波动 20% 时长期复利约 8.1%;波动 40% 时长期复利几乎为 0,30 年后仍有近一半路径亏损(路径中位数 0.99% 高于长期值 0.11%,是因为 30 年对数收益均值的分布左偏)。在 40% 波动下 \(\mu-\sigma^2/2\) 的二阶近似已不准确,必须直接算 \(E[\log(1+R)]\)。

本章小结

Markov、Chebyshev、单边 Chebyshev、Chernoff 是一条信息递增、界递紧的链:只知均值、知道方差、知道 MGF。弱大数定律说样本均值依概率收敛到期望,Chebyshev 一行即可证明;强大数定律说以概率 1 收敛,大偏离只出现有限次,这是频率解释和蒙特卡洛的根据。中心极限定理说标准化和收敛到标准正态,证明的核心是累积量生成函数只剩二阶项,所以偏度、峰度大的分布收敛慢;期望不存在的 Cauchy 分布连大数定律都不满足。Jensen 不等式把凸性与期望联系起来,解释了风险厌恶、期权的凸性价值和波动拖累;几何平均收敛到 \(e^{E\log X}\),长期增长由对数收益决定。

概念 / 公式 内容
Markov \(P\{X\ge a\}\le E[X]/a\)(\(X\ge0\))
Chebyshev \(P\{\lvert X-\mu\rvert\ge k\sigma\}\le1/k^2\)
单边 Chebyshev \(P\{X\ge\mu+a\}\le\frac{\sigma^2}{\sigma^2+a^2}\)
Chernoff \(P\{X\ge a\}\le\min_{t>0}e^{-ta}M(t)\);正态 \(e^{-a^2/2}\);\(\pm1\) 游走 \(e^{-a^2/2n}\)
弱大数定律 \(P\{\lvert\bar X_n-\mu\rvert\ge\varepsilon\}\to0\)
强大数定律 \(P\{\bar X_n\to\mu\}=1\)(需 \(E\lvert X\rvert<\infty\))
CLT \(\frac{S_n-n\mu}{\sigma\sqrt n}\Rightarrow N(0,1)\)
样本量 \(n\approx(z\sigma/\delta)^2\)(CLT);\(n=\sigma^2/(\alpha\delta^2)\)(Chebyshev)
Jensen \(f\) 凸 ⇒ \(E f(X)\ge f(EX)\)
几何平均 \((\prod X_i)^{1/n}\to e^{E\log X}\)
Poisson 近似误差 \(\le\sum p_i^2\)

练习

基础

  1. 某策略日收益均值 0.05%、标准差 1.2%。不假设分布,单日亏损超过 5% 的概率至多多少?若假设正态呢? 答案:单边 Chebyshev,\(a=5.05\%\),\(\frac{1.44}{1.44+25.5}\approx5.3\%\);正态下 \(\Phi(-4.21)\approx1.3\times10^{-5}\)。
  2. 一个赌徒每注以 0.7 概率输 1、0.2 概率输 2、0.1 概率赢 10。求 100 注后仍亏损的近似概率。 答案:每注均值 \(-0.1\)、方差 11.49;\(P\{S\le-0.5\}\approx\Phi\big(\frac{-0.5+10}{\sqrt{1149}}\big)=\Phi(0.28)\approx0.61\)(自测题 8.8)。负期望下仍有约 39% 的概率赚钱,短期结果不能证明策略好坏。
  3. 用 Chebyshev 证明弱大数定律时用到了哪些假设?哪一个是证明需要、但定理本身不需要的?
  4. 用 Jensen 不等式比较 \(E[X^3]\) 与 \((E X)^3\)、\(E[\sqrt X]\) 与 \(\sqrt{E X}\)(\(X\ge0\))。
  5. 掷骰子多少次,可以以约 95% 的把握保证点数和超过 300?(提示:原书习题 8.6 的思路,用 CLT 列方程。)

进阶

  1. 证明「淹没而不补偿」:前 100 次抛硬币都是正面,则前 1000 次正面比例的条件期望为 \(\frac{100+450}{1000}=0.55\),而第 101–1000 次中正面比例的条件期望仍为 1/2。
  2. 一只股票日收益 i.i.d.,均值 0、方差 \(\sigma^2\)。用 CLT 说明 \(n\) 天累计收益的标准差为 \(\sigma\sqrt n\);若日收益一阶自相关为 \(\rho\),结论如何修正? 提示:用第 07a 章的式 (4.1),\(n\) 大时方差约为 \(n\sigma^2\frac{1+\rho}{1-\rho}\)(AR(1) 情形)。
  3. 推导二项分布的 Chernoff 界 \(P\{X\ge i\}\le\frac{n^n}{i^i(n-i)^{n-i}}p^i(1-p)^{n-i}\)(理论题 8.11),并用它估计胜率 45% 的策略 100 笔交易中至少 55 笔盈利的概率上界。
  4. 证明:若 \(E[X]<0\) 且存在 \(\theta\ne0\) 使 \(E[e^{\theta X}]=1\),则 \(\theta>0\)(理论题 8.13)。说明这个 \(\theta\) 在破产概率估计中的作用。
  5. 设 \(X_i\) i.i.d. Poisson\((\lambda_n)\),\(\lambda_n\) 很小。说明为何 \(\sum_{i=1}^nX_i\) 在 \(n\lambda_n\) 不大时远不像正态(理论题 8.14),并联系「稀有跳跃」的建模。

原书推荐习题:Problems 8.2–8.3(Chebyshev 与 CLT 的样本量对比)、8.11(随机游走价格)、8.15(保险总赔付)、8.20(Jensen)、8.22(投资比例与风险偏好)、8.23(各种界与精确值,强烈推荐);Theoretical Exercises 8.5(Bernstein 多项式与 Weierstrass 逼近定理的概率证明)、8.9(淹没而不补偿)、8.11、8.13、8.14;Self-Test 8.5(更新率)、8.8、8.11–8.12(混合分布不可直接套正态)、8.13(几何平均)。

原书对照

本章内容 原书章节 PDF 页码(书内页码 = PDF − 13)
引言 8.1 p.380
Markov、Chebyshev、弱大数定律 8.2 p.380–383
中心极限定理 8.3 p.383–391
强大数定律 8.4 p.391–395
单边 Chebyshev、Chernoff、Jensen 8.5 p.395–400
Poisson 近似的误差界 8.6 p.401–403
小结与习题 — p.403–407;自测解答 p.472–475