第 04b 章 常见离散分布与泊松过程
本章对应 Ross 第 4 章 4.6–4.8 节。五个常见离散分布——二项、泊松、几何、负二项、超几何——各有清楚的"来历":它们都是在独立(或无放回)试验中数某种东西。对量化而言,二项分布是检验胜率的工具,泊松分布与泊松过程是订单到达、跳跃、违约事件建模的起点,最长连串的结论则直接回答"回测里连亏 9 笔正不正常"。
学习目标
- 掌握伯努利、二项、泊松、几何、负二项、超几何分布的来源、PMF、均值、方差,以及它们之间的近似与包含关系。
- 会用递推公式数值计算二项、泊松概率,理解二项分布的单峰性。
- 理解泊松近似与"泊松范式":大量小概率、弱相依事件的发生数近似泊松;会用它估计生日问题、最长连串等。
- 能从三条假设推出泊松过程,知道泊松过程的等待时间是指数分布。
- 理解超几何分布的有限总体修正,并会用捕获—再捕获例子理解最大似然的思想。
- 能用二项尾概率检验胜率、用方差/均值比检验计数数据是否泊松、用最长连串分布判断回测中的连亏是否异常。
读前导读
这一章在解决什么问题。 第 04a 章给了随机变量的通用语言,这一章介绍几个"有名有姓"的离散分布。二项分布你在 CFA 里见过(\(n\) 次独立试验的成功次数),也会用它算二叉树终点概率。本章新增的重点是泊松分布和泊松过程,以及几何、负二项、超几何分布。
和 CFA 相比,本章深在"分布从哪里来"。CFA 给出公式让你代数;这里每个分布都从一个具体的计数问题推出来,并且讲清它们之间的极限关系:二项分布在"\(n\) 很大、\(p\) 很小、\(np\) 适中"时变成泊松分布;把时间切成无穷多个小段、每段至多发生一次事件,就得到泊松过程。这个"切小段再取极限"的论证要用到极限 \((1-\lambda/n)^n\to e^{-\lambda}\) 和记号 \(o(h)\),它们是后面连续时间模型(指数分布、布朗运动、跳跃扩散)的入门。
和量化的联系很具体:二项尾概率检验胜率是否显著;泊松过程是订单到达、违约事件、价格跳跃的基准模型,CFA 信用风险里"违约强度(hazard rate)"就是泊松过程的速率 \(\lambda\);"方差是否等于均值"是检验计数数据是否泊松的最简单方法;最长连串的分布告诉你回测里连亏 9 笔是否正常。
需要先想起来的数学。
- \(e\) 的极限定义。 \(\lim_{n\to\infty}(1+x/n)^n=e^x\)。连续复利就是它:年利率 \(r\)、每年复利 \(n\) 次,一年后本息 \((1+r/n)^n\to e^r\)。取 \(x=-\lambda\) 得 \((1-\lambda/n)^n\to e^{-\lambda}\)。例:\((1-1/100)^{100}\approx0.366\),\(e^{-1}\approx0.368\)。见 第 00 册第 04 章 级数与收敛。
- 指数级数。 \(e^\lambda=\sum_{i\ge0}\lambda^i/i!\),用于验证泊松 PMF 加起来等于 1、计算泊松均值。
- 小 o 记号 \(o(h)\)。 \(f(h)=o(h)\) 表示 \(h\to0\) 时 \(f(h)/h\to0\),即 \(f(h)\) 比 \(h\) 更快地趋于 0,比如 \(h^2\)、\(h^{1.5}\)。直观:时间段越短,"发生两次以上"的概率不仅变小,而且相对于"发生一次"的概率小得可以忽略。例:\(h=0.01\) 时 \(h^2=0.0001\),只有 \(h\) 的 1%。见 第 00 册第 07 章 概率中的分析工具。
- 几何级数与它的导数。 \(\sum_{i\ge1}q^{i-1}=\frac1{1-q}\)。几何分布的期望也可以从对这个式子求导得到:\(\sum_{i\ge1}iq^{i-1}=\frac1{(1-q)^2}\)。本章用"首步分析"绕开了求导。
- 取整与对数。 \(\lfloor x\rfloor\) 表示不超过 \(x\) 的最大整数,如 \(\lfloor6.3\rfloor=6\);\(\log_2n\) 是"2 的多少次方等于 \(n\)",如 \(\log_2 256=8\)。
怎么读这一章。 必读:4.8 节二项分布的定义与均值方差;4.9 节泊松分布的定义、泊松近似二项的推导、均值等于方差、泊松范式、泊松过程的三条假设与结论;4.10 节几何分布与无记忆性、超几何分布的均值方差。最长连串一节先读结论(最长连串约为 \(\log_2n\))和"量化实战"第 3 部分,容斥公式和递推的细节可以跳过。例 6e、6g、例 8e(Banach 火柴)、Zeta 分布第一次可以略读。
4.8 伯努利与二项随机变量
定义
一次试验的结果只分成功与失败,令 \(X=1\) 表示成功,则
称 \(X\) 为参数 \(p\) 的伯努利随机变量(Bernoulli random variable)。
做 \(n\) 次独立试验,每次成功概率为 \(p\),成功次数 \(X\) 称为参数 \((n,p)\) 的二项随机变量(binomial random variable):
推导:任何一个含 \(i\) 次成功的特定序列,由独立性其概率为 \(p^i(1-p)^{n-i}\);这样的序列有 \(\binom ni\) 个(选哪 \(i\) 次成功)。由二项式定理 \(\sum_ip(i)=[p+(1-p)]^n=1\)。伯努利分布就是 \((1,p)\) 二项分布。
例题
- 例 6a 5 枚公平硬币的正面数:\(P\{X=k\}=\binom5k/32\),即 1/32, 5/32, 10/32, 10/32, 5/32, 1/32。
- 例 6b(螺丝退货) 次品率 .01,10 个一包,承诺至多 1 个次品,否则退换。需退换的比例为 \(1-.99^{10}-10(.01)(.99)^9\approx.004\)。
- 例 6c(幸运轮,chuck-a-luck) 押 1–6 中一个数,掷 3 颗骰子,该数出现 \(i\) 次赢 \(i\) 单位,不出现输 1 单位。出现次数服从 \(\mathrm{Bin}(3,1/6)\),收益 \(X\) 满足 \(P\{X=-1\}=125/216\),\(P\{X=1\}=75/216\),\(P\{X=2\}=15/216\),\(P\{X=3\}=1/216\),所以
\[E[X]=\frac{-125+75+30+3}{216}=-\frac{17}{216}.\]看似公平(三颗骰子每颗 1/6,"总共有一半机会")的游戏,长期每 216 局输 17 单位。
- 例 6d(孟德尔遗传) 两个杂合父母,子代表现为显性性状的概率为 3/4。4 个孩子中恰好 3 个显性:\(\binom43(3/4)^3(1/4)=27/64\)。
- 例 6e(陪审团) 12 人中至少 8 人判有罪才定罪,每人独立以概率 \(\theta\) 作出正确判断。必须对被告是否有罪取条件:若无罪,正确裁决需正确票 \(\ge5\);若有罪,需正确票 \(\ge8\)。设有罪先验为 \(\alpha\),正确裁决概率为 \(\alpha\sum_{i=8}^{12}\binom{12}{i}\theta^i(1-\theta)^{12-i}+(1-\alpha)\sum_{i=5}^{12}\binom{12}{i}\theta^i(1-\theta)^{12-i}\)。
- 例 6f(冗余系统,多数表决) \(n\) 个部件各以概率 \(p\) 独立工作,过半工作则系统有效。5 部件优于 3 部件当且仅当 \(10p^3(1-p)^2+5p^4(1-p)+p^5>3p^2(1-p)+p^3\),化简为 \(3(p-1)^2(2p-1)>0\),即 \(p>1/2\)。一般地,\(2k+1\) 部件优于 \(2k-1\) 部件当且仅当 \(p>1/2\)。直观:只有单个部件靠谱时,增加冗余才有益。
量化联系:例 6f 是"多个弱信号投票"的模型。若每个信号独立、正确率略高于 1/2,投票的信号越多越好;正确率低于 1/2 时,投票只会让结果更差。现实中信号并不独立,投票的收益会打折扣(第 06a 章)。
二项分布的性质
矩。 利用 \(i\binom ni=n\binom{n-1}{i-1}\) 可得递推
\(k=1\) 得 \(E[X]=np\);\(k=2\) 得 \(E[X^2]=np[(n-1)p+1]\),于是
(第 04a 章用示性变量法得到了同样的结果,更简洁。)
命题 6.1(单峰性) \(0<p<1\) 时,\(P\{X=k\}\) 随 \(k\) 从 0 到 \(n\) 先单调增、后单调减,在 \(k=\lfloor(n+1)p\rfloor\) 处最大。证明:
例 6g(选举人团中选民的权力) 州人口 \(n=2k+1\),选举人票约为 \(nc\)。势均力敌时其他 \(2k\) 人各以 1/2 独立投票,一个选民起决定作用的概率为 \(\binom{2k}{k}2^{-2k}\)。用 Stirling 公式 \(k!\sim k^{k+1/2}e^{-k}\sqrt{2\pi}\),该概率 \(\sim1/\sqrt{k\pi}\),于是一个选民的平均权力 \(\sim nc/\sqrt{n\pi/2}=c\sqrt{2n/\pi}\),与 \(\sqrt n\) 成正比。副产品:对称随机游走 \(2k\) 步后回到原点的概率约为 \(1/\sqrt{\pi k}\)。
二项概率的计算
由单峰性证明中的比值可得递推
例 6h \(n=6,p=.4\):\(P\{X=0\}=.6^6\approx.0467\),依次递推得 .1866, .3110, .2765, .1382, .0369, .0041。例 6i \(n=100,p=.75\):\(P\{X=70\}=.04575\),\(P\{X\le70\}=.14954\)。
历史 Jacob Bernoulli(1654–1705)在遗著《Ars Conjectandi》(1713)中证明:试验次数大时,成功比例以接近 1 的概率接近 \(p\)——弱大数律的雏形。
4.9 泊松随机变量
定义与泊松近似
取值 \(0,1,2,\dots\)、参数 \(\lambda>0\) 的泊松随机变量(Poisson random variable):
由 \(\sum\lambda^i/i!=e^\lambda\) 知它是合法的 PMF。
泊松近似二项。 设 \(X\sim\mathrm{Bin}(n,p)\),\(\lambda=np\),则
推导拆解:
- 从二项公式出发:\(\binom nip^i(1-p)^{n-i}=\frac{n(n-1)\cdots(n-i+1)}{i!}\,p^i(1-p)^{n-i}\)。
- 代入 \(p=\lambda/n\):\(p^i=\lambda^i/n^i\),把 \(n^i\) 放到 \(n(n-1)\cdots(n-i+1)\) 下面;\((1-p)^{n-i}\) 拆成 \((1-\lambda/n)^n\) 除以 \((1-\lambda/n)^i\)。这就是原文的三因子形式。
- 逐个取极限(\(i\) 和 \(\lambda\) 固定,\(n\to\infty\)):第一个因子是 \(1\cdot(1-\frac1n)\cdots(1-\frac{i-1}n)\to1\);\((1-\lambda/n)^n\to e^{-\lambda}\)(\(e\) 的极限定义);\((1-\lambda/n)^i\to1\),因为固定次幂下底数趋于 1。
- 只剩 \(e^{-\lambda}\lambda^i/i!\)。 数值感受:\(n=250,p=0.03\)(练习 5),\(\lambda=7.5\),泊松与精确二项的差别在千分之几的量级。
也就是说,大量独立试验、每次成功概率很小、\(np\) 适中时,成功次数近似泊松。典型例子:书页上的印刷错误数、社区里活到 100 岁的人数、每天拨错号的次数、单位时间内放射物质放出的 α 粒子数。
- 例 7a 每页错误数 \(\sim\) Poisson(1/2),至少一个错误的概率 \(1-e^{-1/2}\approx.393\)。
- 例 7b 次品率 .1,10 件中至多 1 件次品:精确值 \(.9^{10}+10(.1)(.9)^9=.7361\),泊松近似 \(2e^{-1}\approx.7358\)。
- 例 7c α 粒子平均每秒 3.2 个,\(P\{X\le2\}=e^{-3.2}(1+3.2+3.2^2/2)\approx.3799\)。
期望与方差。 直觉:二项均值 \(np=\lambda\),方差 \(np(1-p)\approx\lambda\)。验证:
推导拆解:
- \(E[X]\):\(i=0\) 项为 0,从 \(i=1\) 开始;\(i/i!=1/(i-1)!\),提出一个 \(\lambda\),令 \(j=i-1\),剩下的 \(\sum_j\lambda^j/j!=e^\lambda\) 与 \(e^{-\lambda}\) 抵消。
- \(E[X^2]\):同样约掉一个 \(i\),\(\sum_{i\ge1}i^2e^{-\lambda}\frac{\lambda^i}{i!}=\lambda\sum_{i\ge1}i\,e^{-\lambda}\frac{\lambda^{i-1}}{(i-1)!}=\lambda\sum_{j\ge0}(j+1)e^{-\lambda}\frac{\lambda^j}{j!}\)。最后一个和式是 \(E[X+1]\) 按 LOTUS 写出来的样子,等于 \(\lambda+1\)。
- \(\mathrm{Var}=\lambda(\lambda+1)-\lambda^2=\lambda\)。
均值等于方差是泊松分布的标志。实际计数数据的方差常常大于均值,称为过度离散(overdispersion),说明强度本身在波动,需要负二项分布或自激励的 Hawkes 过程等更复杂的模型。
计算 递推 \(\frac{P\{X=i+1\}}{P\{X=i\}}=\frac{\lambda}{i+1}\)(7.6),从 \(P\{X=0\}=e^{-\lambda}\) 起逐项计算。例 7f:\(X\sim\) Poisson(100) 时 \(P\{X\le90\}=.17138\);\(Y\sim\) Poisson(1000) 时 \(P\{Y\le1075\}=.99095\)。
弱相依下的泊松近似:泊松范式
即使试验之间不独立,只要相依很弱,泊松近似依然好用。
- 配对问题:\(P(E_i)=1/n\),\(P(E_i\mid E_j)=1/(n-1)\),相依很弱,所以拿对帽子的人数近似 Poisson(1),这与第 02、03 章的精确结果 \(P(\text{恰 }k\text{ 人})\approx e^{-1}/k!\) 一致。
- 生日问题:对每对 \((i,j)\) 设一个"试验",成功(同生日)概率 \(1/365\)。这些事件两两独立但不相互独立。成功数近似 Poisson(\(\binom n2/365\)),所以
\[P\{\text{无两人同生日}\}\approx\exp\Big(-\frac{n(n-1)}{730}\Big).\]令其 \(\le1/2\) 得 \(n(n-1)\ge730\ln2\approx506\),即 \(n=23\),与精确结果一致。
- 三人同生日:\(P\{\text{无三人同生日}\}\approx\exp(-\binom n3/365^2)\),要使其小于 1/2 需 \(n\ge84\)。
泊松范式(Poisson paradigm):\(n\) 个事件,事件 \(i\) 的概率为 \(p_i\)。若所有 \(p_i\) 都"小",且事件独立或至多"弱相依",则发生的事件数近似服从均值为 \(\sum_ip_i\) 的泊松分布。各 \(p_i\) 不必相等。
金融直觉:一个由 500 笔小额消费贷组成的资产池,每笔年违约概率 0.5%–2% 不等,彼此几乎无关,那么年违约笔数近似 Poisson(\(\sum p_i\)),算尾部只需一个参数。但"弱相依"这个前提要当真:如果这些借款人集中在同一地区、同一行业,经济下行会让违约同时上升,事件之间就不再是弱相依,违约数的方差会远大于均值,泊松近似会严重低估尾部。这正是第 03 章"条件独立 ≠ 独立"在计数上的体现,也是本章"量化实战"第 2 部分过度离散检验的意义。
最长连串
例 7d(最长连续正面) 抛 \(n\) 次(正面概率 \(p\)),最长正面连串 \(L_n\) 的分布是什么?
陷阱:直接令 \(H_i\)="从第 \(i\) 次起连续 \(k\) 次正面"不行,因为 \(P(H_2\mid H_1)=p\) 远大于 \(P(H_2)=p^k\),连串会"成簇"出现,相依太强。
技巧:只数"以反面结尾的 \(k\) 连正"。令 \(E_i\)="第 \(i,\dots,i+k-1\) 次正面、第 \(i+k\) 次反面"(\(i\le n-k\)),\(P(E_i)=p^k(1-p)\);再加上 \(E_{n-k+1}\)="最后 \(k\) 次全正",概率 \(p^k\)。这些事件不重叠时独立,重叠时互斥,相依很弱,个数 \(N\) 近似泊松,均值 \(E[N]=(n-k)p^k(1-p)+p^k\)。所以
公平硬币时 \(P\{L_n<k\}\approx\exp\{-n/2^{k+1}\}\)。令 \(j=\log_2n\),则 \(P\{L_n<j+i\}\approx\exp\{-(1/2)^{i+1}\}\),数值如下:
| \(L_n\) | \(<j-3\) | \(j-3\) | \(j-2\) | \(j-1\) | \(j\) | \(j+1\) | \(j+2\) | \(j+3\) | \(\ge j+4\) |
|---|---|---|---|---|---|---|---|---|---|
| 概率 | .0183 | .1170 | .2325 | .2387 | .1723 | .1037 | .0569 | .0298 | .0308 |
结论:无论 \(n\) 多大,最长正面连串以约 0.86 的概率落在 \(\log_2n-1\) 的 \(\pm2\) 之内。
白话解释:
- 为什么只数"以反面结尾的连串":一段 10 连正里包含很多个"从第 \(i\) 次起 \(k\) 连正",直接数会把同一段连串数很多次,而且这些事件高度相关。要求"后面紧跟一个反面",相当于只在每段连串的末尾数一次,于是不同的计数事件要么不重叠(独立),要么重叠(不可能同时发生,互斥),满足泊松范式。
- 为什么是 \(\log_2n\):\(k\) 连正大约每 \(2^{k+1}\) 次出现一次(以反面结尾的 \(k\) 连正概率 \(2^{-(k+1)}\)),\(n\) 次里期望出现 \(n/2^{k+1}\) 次。这个数从远大于 1 变成远小于 1 的地方,就是最长连串的典型长度,即 \(2^{k+1}\approx n\),\(k\approx\log_2n-1\)。
- 推论:样本量翻倍,最长连串只增加约 1。从 250 笔交易变成 500 笔,典型最长连亏从 7 变成 8 左右,而不是翻倍。
原书还给出两种精确算法。一是容斥公式:
泊松过程
事件在随机时刻发生(地震、订单到达、违约),设存在常数 \(\lambda>0\),满足:
- 长度为 \(h\) 的区间内恰好发生 1 个事件的概率为 \(\lambda h+o(h)\);
- 发生 2 个或更多事件的概率为 \(o(h)\);
- 不重叠区间内的事件数相互独立(独立增量)。
这里 \(o(h)\) 指满足 \(\lim_{h\to0}f(h)/h=0\) 的函数,如 \(h^2\)。
结论:长度为 \(t\) 的区间内事件数 \(N(t)\) 服从 Poisson(\(\lambda t\)):
证明思路:把 \([0,t]\) 等分成 \(n\) 段,每段长 \(t/n\)。\(\{N(t)=k\}=A\cup B\),\(A\)="恰有 \(k\) 段各有 1 个事件、其余段 0 个",\(B\)="\(N(t)=k\) 且某段有至少 2 个事件"。由 Boole 不等式 \(P(B)\le n\cdot o(t/n)=t\cdot\frac{o(t/n)}{t/n}\to0\)。由独立性,\(P(A)=\binom nk\big(\frac{\lambda t}{n}+o(\frac tn)\big)^k\big(1-\frac{\lambda t}{n}-o(\frac tn)\big)^{n-k}\),这正是二项概率,且 \(n(\frac{\lambda t}n+o(\frac tn))\to\lambda t\),按二项到泊松的论证得 \(P(A)\to e^{-\lambda t}(\lambda t)^k/k!\)。
推导拆解:证明里有两个容易卡住的地方。
- \(P(B)\to0\):\(B\) 发生意味着至少有一段里发生了 2 个以上事件。每段发生这种事的概率是 \(o(t/n)\),共 \(n\) 段,由 Boole 不等式总概率至多 \(n\cdot o(t/n)\)。把它写成 \(t\cdot\frac{o(t/n)}{t/n}\),令 \(h=t/n\to0\),由 \(o(h)\) 的定义 \(\frac{o(h)}h\to0\),所以整体趋于 0。这里正是假设 2 要求"\(o(h)\)"而不只是"小"的原因:段数按 \(1/h\) 增长,单段概率必须比 \(h\) 更快地变小,乘起来才能趋于 0。
- \(P(A)\) 是二项概率:每段看作一次试验,"成功"=段内恰有 1 个事件,概率 \(p_n=\frac{\lambda t}n+o(\frac tn)\);由假设 3,各段独立。于是 \(A\) 的概率就是 \(\mathrm{Bin}(n,p_n)\) 取 \(k\) 的概率,而 \(np_n\to\lambda t\),套用前面泊松近似二项的论证即可。
称事件按**速率(rate)为 \(\lambda\) 的泊松过程(Poisson process)**发生,\(\lambda\) 是单位时间内的平均事件数。
金融直觉:信用风险里的"违约强度"(hazard rate)就是这里的 \(\lambda\):在很短的时间 \(h\) 内违约概率约为 \(\lambda h\)。由 (7.5) 取 \(k=0\),到 \(t\) 年仍未违约的概率是 \(e^{-\lambda t}\),这和连续复利贴现因子 \(e^{-rt}\) 形式完全一样。所以 CDS 定价里"风险中性生存概率"可以写成 \(e^{-\lambda t}\),而"信用利差 ≈ 违约强度 × 违约损失率"也是从这里来的。
例 7e(地震) 美国西部的地震按速率每周 2 次的泊松过程发生。(a) 未来 2 周至少 3 次:\(1-e^{-4}(1+4+8)=1-13e^{-4}\)。(b) 到下一次地震的时间 \(X\):\(P\{X>t\}=P\{N(t)=0\}=e^{-\lambda t}\),即 \(F(t)=1-e^{-2t}\)。泊松过程的等待时间服从指数分布,第 05 章展开。
4.10 其他离散分布
几何分布
独立试验(成功概率 \(p\))直到首次成功,所需试验次数 \(X\) 服从几何分布(geometric distribution):
尾概率 \(P\{X\ge k\}=(1-p)^{k-1}\)。
例 8b(期望,首步分析) 记 \(q=1-p\),把 \(i\) 写成 \((i-1)+1\):
推导拆解:
- 按定义 \(E[X]=\sum_{i\ge1}i\,q^{i-1}p\)。把 \(i\) 拆成 \((i-1)+1\),分成两个和。
- 第二个和 \(\sum_{i\ge1}q^{i-1}p\) 是全部概率之和,等于 1。
- 第一个和:\(i=1\) 项为 0,从 \(i=2\) 起,令 \(j=i-1\),得 \(\sum_{j\ge1}j\,q^{j}p=q\sum_{j\ge1}j\,q^{j-1}p=qE[X]\)。
- 于是 \(E[X]=qE[X]+1\),解得 \(E[X]=1/(1-q)=1/p\)。 这就是第 03 章"对第一步取条件"的期望版本:第一次试验必然要花 1 次;以概率 \(q\) 失败,之后还要再花与开始时同分布的次数。方程 \(E[X]=1+qE[X]\) 读起来正是这句话。同法(例 8c)得 \(E[X^2]=(q+1)/p^2\),
几何分布有无记忆性:\(P\{X=n+k\mid X>n\}=P\{X=k\}\)(原书理论练习 4.27)。已经连续失败了 \(n\) 次,剩余需要的次数分布不变——这就是"赌徒谬误"为什么是谬误。
金融直觉:无记忆性是一个很强的模型假设,用前先问它是否合理。"策略已经连亏 8 笔,下一笔该赢了"在独立同分布下是错觉,这是无记忆性的正确用法。但反过来,若数据显示连亏后胜率显著下降(例如市场状态切换导致策略失效),那就说明各笔交易不独立,几何分布与无记忆性都不适用,应改用第 02 章的游程检验或第 03 章的条件模型去刻画这种状态依赖。
负二项分布
直到累计 \(r\) 次成功所需的试验次数 \(X\):
(前 \(n-1\) 次中有 \(r-1\) 次成功,第 \(n\) 次成功。)称为参数 \((r,p)\) 的负二项分布(negative binomial),几何分布是 \(r=1\) 的特例。\(X=Y_1+\cdots+Y_r\),\(Y_i\) 是相邻两次成功之间的试验数,彼此独立且都服从几何分布。
例 8g 掷骰子直到 1 出现 4 次:\(E[X]=24\),\(\mathrm{Var}(X)=4(5/6)/(1/6)^2=120\)。
例 8d(点数问题另解) \(r\) 次成功先于 \(m\) 次失败,等价于第 \(r\) 次成功不晚于第 \(r+m-1\) 次试验,概率为 \(\sum_{n=r}^{r+m-1}\binom{n-1}{r-1}p^r(1-p)^{n-r}\)。
例 8e(Banach 火柴问题,选读) 数学家左右口袋各一盒 \(N\) 根火柴,每次等可能从任一盒取。首次发现某盒已空时,另一盒恰剩 \(k\) 根的概率为 \(\binom{2N-k}{N}(1/2)^{2N-k}\)。
负二项与二项之间有对偶关系(原书理论练习 4.28):若 \(X\) 是负二项 \((r,p)\),\(Y\) 是二项 \((n,p)\),则 \(P\{X>n\}=P\{Y<r\}\)——"凑够 \(r\) 次成功需要超过 \(n\) 次"等价于"前 \(n\) 次成功不足 \(r\) 次"。
超几何分布
从 \(N\) 个球(\(m\) 白、\(N-m\) 黑)中无放回随机取 \(n\) 个,白球数 \(X\) 服从超几何分布(hypergeometric):
由于约定 \(k<0\) 或 \(k>r\) 时 \(\binom rk=0\),公式对所有 \(i\) 成立。
例 8h(捕获—再捕获,最大似然估计) 先捕 \(m\) 只动物做标记放回,再捕 \(n\) 只,其中有标记的数目 \(X\) 服从超几何分布,\(P_i(N)=\binom mi\binom{N-m}{n-i}/\binom Nn\)。观察到 \(X=i\) 后,取使 \(P_i(N)\) 最大的 \(N\) 作为估计。由
例 8i(抽检验收) 每批 10 件,抽检 3 件全合格才接收;30% 的批次有 4 件次品,70% 有 1 件。\(P(\text{接收})=\frac{\binom63}{\binom{10}3}(.3)+\frac{\binom93}{\binom{10}3}(.7)=\frac{54}{100}\),拒收 46%。
近似:当 \(m,N\) 相对 \(n\) 很大时,无放回与有放回差别可以忽略,超几何近似 \(\mathrm{Bin}(n,p)\),\(p=m/N\)。
均值与方差(例 8j)
均值与有放回抽样相同;\(\frac{N-n}{N-1}\) 叫有限总体修正因子(finite population correction),无放回抽样使方差变小。
Zeta(Zipf)分布
得名于 Riemann zeta 函数。Pareto 用它描述收入分布,Zipf 将其推广到词频等许多领域。它是离散的幂律分布,尾部比指数衰减慢得多。量化里市值、成交额、个股关注度的分布都近似幂律。
常见离散分布一览
| 分布 | PMF | 均值 | 方差 | 来历 |
|---|---|---|---|---|
| 二项 \((n,p)\) | \(\binom nip^i(1-p)^{n-i}\) | \(np\) | \(np(1-p)\) | \(n\) 次独立试验的成功数 |
| 泊松 \(\lambda\) | \(e^{-\lambda}\lambda^i/i!\) | \(\lambda\) | \(\lambda\) | 大量小概率事件的发生数 |
| 几何 \(p\) | \(p(1-p)^{i-1},\ i\ge1\) | \(1/p\) | \((1-p)/p^2\) | 首次成功所需次数 |
| 负二项 \((r,p)\) | \(\binom{i-1}{r-1}p^r(1-p)^{i-r},\ i\ge r\) | \(r/p\) | \(r(1-p)/p^2\) | 第 \(r\) 次成功所需次数 |
| 超几何 \((n,N,m)\) | \(\binom mi\binom{N-m}{n-i}/\binom Nn\) | \(np\) | \(\frac{N-n}{N-1}np(1-p)\) | 无放回抽样中的白球数 |
量化实战
1. 胜率显著性:二项尾概率
60 笔交易赢 37 笔(61.7%),是否说明胜率显著高于 50%?在原假设 \(p=0.5\) 下,\(P\{X\ge37\}\) 就是单侧 p 值。原书习题 4.41(ESP 检验)是同一个问题。注意这只检验胜率,不检验期望收益(第 04a 章已说明二者不同)。
2. 成交笔数是否泊松:方差/均值比
泊松分布的方差等于均值。把每分钟成交笔数的方差除以均值,得到离散指数(index of dispersion);在泊松假设下 \((T-1)\cdot\text{方差}/\text{均值}\) 近似服从自由度 \(T-1\) 的卡方分布(卡方分布见第 06a 章,检验原理见第 03 册)。若强度本身随时间波动(例如开盘、收盘时段活跃),计数就是"Gamma 混合泊松",即负二项分布,方差显著大于均值。
3. 最长连亏是否异常
250 笔交易、每笔亏损概率 0.5 时,最长连亏的中位数约为 \(\log_2 250-1\approx7\)。下面比较 Ross 的精确递推、泊松近似和模拟。
import numpy as np
from scipy import stats
rng = np.random.default_rng(2024)
# ---------- 1) 胜率是否显著高于 50%:二项尾概率 ----------
n, k = 60, 37
p_value = stats.binom.sf(k - 1, n, 0.5) # P{X >= 37 | p = 0.5}
print(f"{n} 笔中赢 {k} 笔: 单侧 p 值 = {p_value:.4f}")
# 用 (6.3) 递推手算核对: P{X=i+1} = p/(1-p) * (n-i)/(i+1) * P{X=i}
pmf = [0.5**n]
for i in range(n):
pmf.append(pmf[-1] * (n - i) / (i + 1))
print(f"递推结果 = {sum(pmf[k:]):.4f}")
# ---------- 2) 成交笔数:泊松还是过度离散? ----------
lam, T = 12.0, 2000 # 每分钟平均 12 笔,观察 2000 分钟
pois = rng.poisson(lam, T)
# 过度离散:强度本身随时间波动(Gamma 混合泊松 = 负二项)
intensity = rng.gamma(shape=3.0, scale=lam / 3.0, size=T)
mixed = rng.poisson(intensity)
for name, x in (("纯泊松", pois), ("Gamma 混合泊松", mixed)):
disp = x.var(ddof=1) / x.mean()
# 离散指数检验:(T-1)*Var/Mean 在泊松假设下近似 chi2(T-1)
stat = (T - 1) * disp
pv = stats.chi2.sf(stat, T - 1)
print(f"{name}: 均值={x.mean():.2f} 方差={x.var(ddof=1):.2f} 方差/均值={disp:.2f} p值={pv:.3g}")
# ---------- 3) 250 笔交易中最长连亏:精确递推 vs 泊松近似 vs 模拟 ----------
def prob_run_at_least(n, k, p):
"""n 次独立试验(成功概率 p)中出现至少 k 连成功的概率,Ross 4.7 节递推"""
P = np.zeros(n + 1)
P[k] = p**k
for m in range(k + 1, n + 1):
P[m] = sum(P[m - j] * p**(j - 1) * (1 - p) for j in range(1, k + 1)) + p**k
return P[n]
def poisson_approx(n, k, p):
return 1 - np.exp(-(n - k) * p**k * (1 - p) - p**k)
n_tr, q_loss = 250, 0.5
losses = rng.random((20000, n_tr)) < q_loss
def longest(row):
best = cur = 0
for v in row:
cur = cur + 1 if v else 0
best = max(best, cur)
return best
L = np.array([longest(r) for r in losses])
print(f"\n{n_tr} 笔、单笔亏损概率 {q_loss}: log2(n) = {np.log2(n_tr):.2f}, 模拟最长连亏中位数 = {np.median(L):.0f}")
print(" k 精确P(L>=k) 泊松近似 模拟")
for k in (5, 6, 7, 8, 10, 12):
print(f"{k:2d} {prob_run_at_least(n_tr, k, q_loss):10.4f} {poisson_approx(n_tr, k, q_loss):8.4f} {(L >= k).mean():.4f}")
关键输出:
60 笔中赢 37 笔: 单侧 p 值 = 0.0462
递推结果 = 0.0462
纯泊松: 均值=12.03 方差=12.30 方差/均值=1.02 p值=0.231
Gamma 混合泊松: 均值=12.27 方差=62.68 方差/均值=5.11 p值=0
250 笔、单笔亏损概率 0.5: log2(n) = 7.97, 模拟最长连亏中位数 = 7
k 精确P(L>=k) 泊松近似 模拟
5 0.9856 0.9789 0.9840
6 0.8682 0.8537 0.8665
7 0.6269 0.6160 0.6276
8 0.3840 0.3791 0.3841
10 0.1120 0.1114 0.1088
12 0.0289 0.0289 0.0297
读法:
- 37/60 的单侧 p 值约 0.046,勉强在 5% 水平下显著;scipy 与 (6.3) 递推结果一致。若这是从 20 个策略中挑出来的最好一个,还要回到第 02 章做多重检验校正。
- 纯泊松计数的方差/均值约为 1;Gamma 混合泊松约为 5(理论值 \(1+\lambda/\text{shape}=1+12/3=5\)),p 值小到打印为 0,泊松假设被强烈拒绝。真实的逐笔成交数据通常更接近后者。
- 一个胜率 50% 的策略在 250 笔交易中出现至少 8 连亏的概率约 38%,至少 10 连亏也有 11%。**看到 8–9 连亏就断定策略"失效",多半是对随机性的误判。**泊松近似在 \(k\) 稍大时已经非常准确。
本章小结
二项分布数 \(n\) 次独立试验的成功数,均值 \(np\)、方差 \(np(1-p)\),单峰,众数在 \(\lfloor(n+1)p\rfloor\);泊松分布是"大量小概率事件"的极限,均值等于方差等于 \(\lambda\),在弱相依下依然近似成立(泊松范式),可用于生日问题、配对问题和最长连串;泊松过程由"稀有、无多重、独立增量"三条假设推出,计数为 Poisson(\(\lambda t\)),等待时间为指数分布。几何分布与负二项分布数"等到第 \(r\) 次成功需要多少次",几何分布无记忆;超几何分布描述无放回抽样,均值与有放回相同、方差乘以有限总体修正因子。递推公式让这些概率在计算机上都能高效、稳定地算出来。
| 概念 | 公式 |
|---|---|
| 二项递推 | \(P\{X=k+1\}=\frac{p}{1-p}\frac{n-k}{k+1}P\{X=k\}\) |
| 二项众数 | \(\lfloor(n+1)p\rfloor\) |
| 泊松近似 | \(\mathrm{Bin}(n,p)\approx\mathrm{Poisson}(np)\)(\(n\) 大,\(p\) 小) |
| 泊松递推 | \(P\{X=i+1\}=\frac{\lambda}{i+1}P\{X=i\}\) |
| 泊松范式 | 发生数 \(\approx\mathrm{Poisson}(\sum p_i)\) |
| 最长连串 | \(P\{L_n<k\}\approx\exp\{-(n-k)p^k(1-p)-p^k\}\);公平硬币 \(L_n\approx\log_2n\) |
| 泊松过程 | \(N(t)\sim\mathrm{Poisson}(\lambda t)\),等待时间 \(P\{X>t\}=e^{-\lambda t}\) |
| 几何 | \(E=1/p\),\(\mathrm{Var}=(1-p)/p^2\),无记忆 |
| 负二项 | \(E=r/p\),\(\mathrm{Var}=r(1-p)/p^2\) |
| 超几何 | \(E=np\),\(\mathrm{Var}=\frac{N-n}{N-1}np(1-p)\) |
| 捕获—再捕获 MLE | \(\hat N=\lfloor mn/i\rfloor\) |
练习
基础
- 某选股模型每期从 300 只股票中选 30 只。若模型毫无能力,相当于随机抽取;股票池中有 60 只"未来跑赢"的股票。选中跑赢股数目的分布、均值与方差是什么? 答案:超几何 \((n=30,N=300,m=60)\),\(E=6\),\(\mathrm{Var}=\frac{270}{299}\cdot30\cdot0.2\cdot0.8\approx4.33\)。
- 某交易所某合约平均每分钟成交 3 笔,假设为泊松过程。(a) 某分钟没有成交的概率;(b) 5 分钟内至少 20 笔的概率(用递推或 scipy 计算)。 答案:(a) \(e^{-3}\approx0.0498\);(b) \(N(5)\sim\) Poisson(15),\(P\{N\ge20\}\approx0.125\)。
- 求 \(\mathrm{Bin}(20,0.3)\) 的众数。 答案:\(\lfloor21\times0.3\rfloor=6\)。
- 掷骰子直到出现 6,已知前 5 次都没出现 6,求还需要超过 3 次的概率。 答案:无记忆性,\((5/6)^3\approx0.579\)。
- 某策略每天独立地以 0.03 的概率触发风控。用泊松近似估计一年(250 个交易日)内触发次数不超过 3 次的概率,并与精确二项结果比较。 答案:\(\lambda=7.5\),泊松 \(\approx0.0591\);二项精确约 0.0565。
进阶
- 用示性变量法推导超几何分布的方差公式。 提示:\(P\{X_i=1,X_j=1\}=\frac mN\frac{m-1}{N-1}\),代入第 04a 章式 (9.1)。
- 证明独立的 Poisson(\(\lambda_1\)) 与 Poisson(\(\lambda_2\)) 之和服从 Poisson(\(\lambda_1+\lambda_2\))。(第 06a 章例 3e) 提示:卷积求和后用二项式定理。
- 一个胜率 55% 的策略做 500 笔交易,用泊松近似估计最长连亏不少于 10 笔的概率。 答案:此时"成功"指亏损,\(p=0.45\),\(E[N]\approx(500-10)(0.45)^{10}(0.55)+0.45^{10}\approx0.0921\),概率 \(\approx1-e^{-0.0921}\approx0.088\)。
- 两种计数模型:(a) 每分钟订单数 Poisson(10);(b) 每分钟订单数是 Poisson(\(\Lambda\)),\(\Lambda\) 以 0.5 的概率为 5、0.5 的概率为 15。分别求均值和方差。 答案:(a) 10 与 10;(b) 均值 10,\(E[X^2]=0.5(5+25)+0.5(15+225)=135\),方差 35。混合导致过度离散。
- 证明 \(P\{L_n<k\}\) 的泊松近似在公平硬币时可写成 \(\exp\{-(n-k+2)/2^{k+1}\}\),并说明为什么 \(n\) 翻倍时最长连串大约只增加 1。 提示:代入 \(p=1/2\);\(n\to2n\) 时,\(k\to k+1\) 使指数保持不变。
原书推荐习题:Problems 4.41(ESP 检验)、4.60(混合泊松 + 贝叶斯)、4.62(无重复的泊松近似)、4.63(泊松过程)、4.69(最长连串三种算法对比)、4.72–4.73(系列赛)、4.80(Keno 期望回报);Theoretical Exercises 4.13、4.16、4.18(众数与 MLE)、4.25(泊松稀疏化)、4.27(几何无记忆性)、4.28(负二项—二项对偶);Self-Test 4.13(配对问题期望与方差)、4.28(负超几何)。
原书对照
| 本章小节 | 原书章节 | PDF 页码 | 书内页码 |
|---|---|---|---|
| 4.8 伯努利与二项 | 4.6 The Bernoulli and Binomial Random Variables(含 4.6.1、4.6.2) | p.140–148 | p.127–135 |
| 4.9 泊松(含最长连串、泊松过程) | 4.7 The Poisson Random Variable(含 4.7.1) | p.148–160 | p.135–147 |
| 4.10 其他离散分布 | 4.8 Other Discrete Probability Distributions(4.8.1–4.8.4) | p.160–168 | p.147–155 |
| 小结与习题 | Summary, Problems, Theoretical Exercises, Self-Test | p.175–188 | p.162–175 |
(书内页码 = PDF 页码 − 13。)