量化交易中文教材

第 04b 章 常见离散分布与泊松过程

本章对应 Ross 第 4 章 4.6–4.8 节。五个常见离散分布——二项、泊松、几何、负二项、超几何——各有清楚的"来历":它们都是在独立(或无放回)试验中数某种东西。对量化而言,二项分布是检验胜率的工具,泊松分布与泊松过程是订单到达、跳跃、违约事件建模的起点,最长连串的结论则直接回答"回测里连亏 9 笔正不正常"。

学习目标

  1. 掌握伯努利、二项、泊松、几何、负二项、超几何分布的来源、PMF、均值、方差,以及它们之间的近似与包含关系。
  2. 会用递推公式数值计算二项、泊松概率,理解二项分布的单峰性。
  3. 理解泊松近似与"泊松范式":大量小概率、弱相依事件的发生数近似泊松;会用它估计生日问题、最长连串等。
  4. 能从三条假设推出泊松过程,知道泊松过程的等待时间是指数分布。
  5. 理解超几何分布的有限总体修正,并会用捕获—再捕获例子理解最大似然的思想。
  6. 能用二项尾概率检验胜率、用方差/均值比检验计数数据是否泊松、用最长连串分布判断回测中的连亏是否异常。

读前导读

这一章在解决什么问题。 第 04a 章给了随机变量的通用语言,这一章介绍几个"有名有姓"的离散分布。二项分布你在 CFA 里见过(\(n\) 次独立试验的成功次数),也会用它算二叉树终点概率。本章新增的重点是泊松分布和泊松过程,以及几何、负二项、超几何分布。

和 CFA 相比,本章深在"分布从哪里来"。CFA 给出公式让你代数;这里每个分布都从一个具体的计数问题推出来,并且讲清它们之间的极限关系:二项分布在"\(n\) 很大、\(p\) 很小、\(np\) 适中"时变成泊松分布;把时间切成无穷多个小段、每段至多发生一次事件,就得到泊松过程。这个"切小段再取极限"的论证要用到极限 \((1-\lambda/n)^n\to e^{-\lambda}\) 和记号 \(o(h)\),它们是后面连续时间模型(指数分布、布朗运动、跳跃扩散)的入门。

和量化的联系很具体:二项尾概率检验胜率是否显著;泊松过程是订单到达、违约事件、价格跳跃的基准模型,CFA 信用风险里"违约强度(hazard rate)"就是泊松过程的速率 \(\lambda\);"方差是否等于均值"是检验计数数据是否泊松的最简单方法;最长连串的分布告诉你回测里连亏 9 笔是否正常。

需要先想起来的数学。

  • \(e\) 的极限定义。 \(\lim_{n\to\infty}(1+x/n)^n=e^x\)。连续复利就是它:年利率 \(r\)、每年复利 \(n\) 次,一年后本息 \((1+r/n)^n\to e^r\)。取 \(x=-\lambda\) 得 \((1-\lambda/n)^n\to e^{-\lambda}\)。例:\((1-1/100)^{100}\approx0.366\),\(e^{-1}\approx0.368\)。见 第 00 册第 04 章 级数与收敛。
  • 指数级数。 \(e^\lambda=\sum_{i\ge0}\lambda^i/i!\),用于验证泊松 PMF 加起来等于 1、计算泊松均值。
  • 小 o 记号 \(o(h)\)。 \(f(h)=o(h)\) 表示 \(h\to0\) 时 \(f(h)/h\to0\),即 \(f(h)\) 比 \(h\) 更快地趋于 0,比如 \(h^2\)、\(h^{1.5}\)。直观:时间段越短,"发生两次以上"的概率不仅变小,而且相对于"发生一次"的概率小得可以忽略。例:\(h=0.01\) 时 \(h^2=0.0001\),只有 \(h\) 的 1%。见 第 00 册第 07 章 概率中的分析工具。
  • 几何级数与它的导数。 \(\sum_{i\ge1}q^{i-1}=\frac1{1-q}\)。几何分布的期望也可以从对这个式子求导得到:\(\sum_{i\ge1}iq^{i-1}=\frac1{(1-q)^2}\)。本章用"首步分析"绕开了求导。
  • 取整与对数。 \(\lfloor x\rfloor\) 表示不超过 \(x\) 的最大整数,如 \(\lfloor6.3\rfloor=6\);\(\log_2n\) 是"2 的多少次方等于 \(n\)",如 \(\log_2 256=8\)。

怎么读这一章。 必读:4.8 节二项分布的定义与均值方差;4.9 节泊松分布的定义、泊松近似二项的推导、均值等于方差、泊松范式、泊松过程的三条假设与结论;4.10 节几何分布与无记忆性、超几何分布的均值方差。最长连串一节先读结论(最长连串约为 \(\log_2n\))和"量化实战"第 3 部分,容斥公式和递推的细节可以跳过。例 6e、6g、例 8e(Banach 火柴)、Zeta 分布第一次可以略读。


4.8 伯努利与二项随机变量

定义

一次试验的结果只分成功与失败,令 \(X=1\) 表示成功,则

\[p(0)=1-p,\qquad p(1)=p,\tag{6.1}\]

称 \(X\) 为参数 \(p\) 的伯努利随机变量(Bernoulli random variable)。

做 \(n\) 次独立试验,每次成功概率为 \(p\),成功次数 \(X\) 称为参数 \((n,p)\) 的二项随机变量(binomial random variable):

\[p(i)=\binom nip^i(1-p)^{n-i},\qquad i=0,1,\dots,n.\tag{6.2}\]

推导:任何一个含 \(i\) 次成功的特定序列,由独立性其概率为 \(p^i(1-p)^{n-i}\);这样的序列有 \(\binom ni\) 个(选哪 \(i\) 次成功)。由二项式定理 \(\sum_ip(i)=[p+(1-p)]^n=1\)。伯努利分布就是 \((1,p)\) 二项分布。

例题

  • 例 6a 5 枚公平硬币的正面数:\(P\{X=k\}=\binom5k/32\),即 1/32, 5/32, 10/32, 10/32, 5/32, 1/32。
  • 例 6b(螺丝退货) 次品率 .01,10 个一包,承诺至多 1 个次品,否则退换。需退换的比例为 \(1-.99^{10}-10(.01)(.99)^9\approx.004\)。
  • 例 6c(幸运轮,chuck-a-luck) 押 1–6 中一个数,掷 3 颗骰子,该数出现 \(i\) 次赢 \(i\) 单位,不出现输 1 单位。出现次数服从 \(\mathrm{Bin}(3,1/6)\),收益 \(X\) 满足 \(P\{X=-1\}=125/216\),\(P\{X=1\}=75/216\),\(P\{X=2\}=15/216\),\(P\{X=3\}=1/216\),所以
    \[E[X]=\frac{-125+75+30+3}{216}=-\frac{17}{216}.\]
    看似公平(三颗骰子每颗 1/6,"总共有一半机会")的游戏,长期每 216 局输 17 单位。
  • 例 6d(孟德尔遗传) 两个杂合父母,子代表现为显性性状的概率为 3/4。4 个孩子中恰好 3 个显性:\(\binom43(3/4)^3(1/4)=27/64\)。
  • 例 6e(陪审团) 12 人中至少 8 人判有罪才定罪,每人独立以概率 \(\theta\) 作出正确判断。必须对被告是否有罪取条件:若无罪,正确裁决需正确票 \(\ge5\);若有罪,需正确票 \(\ge8\)。设有罪先验为 \(\alpha\),正确裁决概率为 \(\alpha\sum_{i=8}^{12}\binom{12}{i}\theta^i(1-\theta)^{12-i}+(1-\alpha)\sum_{i=5}^{12}\binom{12}{i}\theta^i(1-\theta)^{12-i}\)。
  • 例 6f(冗余系统,多数表决) \(n\) 个部件各以概率 \(p\) 独立工作,过半工作则系统有效。5 部件优于 3 部件当且仅当 \(10p^3(1-p)^2+5p^4(1-p)+p^5>3p^2(1-p)+p^3\),化简为 \(3(p-1)^2(2p-1)>0\),即 \(p>1/2\)。一般地,\(2k+1\) 部件优于 \(2k-1\) 部件当且仅当 \(p>1/2\)。直观:只有单个部件靠谱时,增加冗余才有益。

量化联系:例 6f 是"多个弱信号投票"的模型。若每个信号独立、正确率略高于 1/2,投票的信号越多越好;正确率低于 1/2 时,投票只会让结果更差。现实中信号并不独立,投票的收益会打折扣(第 06a 章)。

二项分布的性质

矩。 利用 \(i\binom ni=n\binom{n-1}{i-1}\) 可得递推

\[E[X^k]=np\,E[(Y+1)^{k-1}],\qquad Y\sim\mathrm{Bin}(n-1,p).\]

\(k=1\) 得 \(E[X]=np\);\(k=2\) 得 \(E[X^2]=np[(n-1)p+1]\),于是

\[E[X]=np,\qquad\mathrm{Var}(X)=np(1-p).\]

(第 04a 章用示性变量法得到了同样的结果,更简洁。)

命题 6.1(单峰性) \(0<p<1\) 时,\(P\{X=k\}\) 随 \(k\) 从 0 到 \(n\) 先单调增、后单调减,在 \(k=\lfloor(n+1)p\rfloor\) 处最大。证明:

\[\frac{P\{X=k\}}{P\{X=k-1\}}=\frac{(n-k+1)p}{k(1-p)}\ge1\iff k\le(n+1)p.\]
例如 \(\mathrm{Bin}(10,1/2)\) 时 \(1024p(k)\) 依次为 1, 10, 45, 120, 210, 252, …,在 5 处最大。

例 6g(选举人团中选民的权力) 州人口 \(n=2k+1\),选举人票约为 \(nc\)。势均力敌时其他 \(2k\) 人各以 1/2 独立投票,一个选民起决定作用的概率为 \(\binom{2k}{k}2^{-2k}\)。用 Stirling 公式 \(k!\sim k^{k+1/2}e^{-k}\sqrt{2\pi}\),该概率 \(\sim1/\sqrt{k\pi}\),于是一个选民的平均权力 \(\sim nc/\sqrt{n\pi/2}=c\sqrt{2n/\pi}\),与 \(\sqrt n\) 成正比。副产品:对称随机游走 \(2k\) 步后回到原点的概率约为 \(1/\sqrt{\pi k}\)。

二项概率的计算

由单峰性证明中的比值可得递推

\[P\{X=k+1\}=\frac{p}{1-p}\cdot\frac{n-k}{k+1}\,P\{X=k\}.\tag{6.3}\]

例 6h \(n=6,p=.4\):\(P\{X=0\}=.6^6\approx.0467\),依次递推得 .1866, .3110, .2765, .1382, .0369, .0041。例 6i \(n=100,p=.75\):\(P\{X=70\}=.04575\),\(P\{X\le70\}=.14954\)。

历史 Jacob Bernoulli(1654–1705)在遗著《Ars Conjectandi》(1713)中证明:试验次数大时,成功比例以接近 1 的概率接近 \(p\)——弱大数律的雏形。

4.9 泊松随机变量

定义与泊松近似

取值 \(0,1,2,\dots\)、参数 \(\lambda>0\) 的泊松随机变量(Poisson random variable):

\[p(i)=e^{-\lambda}\frac{\lambda^i}{i!},\qquad i=0,1,2,\dots\tag{7.1}\]

由 \(\sum\lambda^i/i!=e^\lambda\) 知它是合法的 PMF。

泊松近似二项。 设 \(X\sim\mathrm{Bin}(n,p)\),\(\lambda=np\),则

\[P\{X=i\}=\frac{n(n-1)\cdots(n-i+1)}{n^i}\cdot\frac{\lambda^i}{i!}\cdot\frac{(1-\lambda/n)^n}{(1-\lambda/n)^i}.\]
\(n\) 大、\(\lambda\) 适中时,\((1-\lambda/n)^n\approx e^{-\lambda}\),另外两个因子都约等于 1,所以
\[P\{X=i\}\approx e^{-\lambda}\frac{\lambda^i}{i!}.\]

推导拆解:

  1. 从二项公式出发:\(\binom nip^i(1-p)^{n-i}=\frac{n(n-1)\cdots(n-i+1)}{i!}\,p^i(1-p)^{n-i}\)。
  2. 代入 \(p=\lambda/n\):\(p^i=\lambda^i/n^i\),把 \(n^i\) 放到 \(n(n-1)\cdots(n-i+1)\) 下面;\((1-p)^{n-i}\) 拆成 \((1-\lambda/n)^n\) 除以 \((1-\lambda/n)^i\)。这就是原文的三因子形式。
  3. 逐个取极限(\(i\) 和 \(\lambda\) 固定,\(n\to\infty\)):第一个因子是 \(1\cdot(1-\frac1n)\cdots(1-\frac{i-1}n)\to1\);\((1-\lambda/n)^n\to e^{-\lambda}\)(\(e\) 的极限定义);\((1-\lambda/n)^i\to1\),因为固定次幂下底数趋于 1。
  4. 只剩 \(e^{-\lambda}\lambda^i/i!\)。 数值感受:\(n=250,p=0.03\)(练习 5),\(\lambda=7.5\),泊松与精确二项的差别在千分之几的量级。

也就是说,大量独立试验、每次成功概率很小、\(np\) 适中时,成功次数近似泊松。典型例子:书页上的印刷错误数、社区里活到 100 岁的人数、每天拨错号的次数、单位时间内放射物质放出的 α 粒子数。

  • 例 7a 每页错误数 \(\sim\) Poisson(1/2),至少一个错误的概率 \(1-e^{-1/2}\approx.393\)。
  • 例 7b 次品率 .1,10 件中至多 1 件次品:精确值 \(.9^{10}+10(.1)(.9)^9=.7361\),泊松近似 \(2e^{-1}\approx.7358\)。
  • 例 7c α 粒子平均每秒 3.2 个,\(P\{X\le2\}=e^{-3.2}(1+3.2+3.2^2/2)\approx.3799\)。

期望与方差。 直觉:二项均值 \(np=\lambda\),方差 \(np(1-p)\approx\lambda\)。验证:

\[E[X]=\sum_{i\ge1}i\,e^{-\lambda}\frac{\lambda^i}{i!}=\lambda e^{-\lambda}\sum_{j\ge0}\frac{\lambda^j}{j!}=\lambda,\qquad E[X^2]=\lambda E[X+1]=\lambda(\lambda+1),\]
所以
\[E[X]=\mathrm{Var}(X)=\lambda.\]

推导拆解:

  1. \(E[X]\):\(i=0\) 项为 0,从 \(i=1\) 开始;\(i/i!=1/(i-1)!\),提出一个 \(\lambda\),令 \(j=i-1\),剩下的 \(\sum_j\lambda^j/j!=e^\lambda\) 与 \(e^{-\lambda}\) 抵消。
  2. \(E[X^2]\):同样约掉一个 \(i\),\(\sum_{i\ge1}i^2e^{-\lambda}\frac{\lambda^i}{i!}=\lambda\sum_{i\ge1}i\,e^{-\lambda}\frac{\lambda^{i-1}}{(i-1)!}=\lambda\sum_{j\ge0}(j+1)e^{-\lambda}\frac{\lambda^j}{j!}\)。最后一个和式是 \(E[X+1]\) 按 LOTUS 写出来的样子,等于 \(\lambda+1\)。
  3. \(\mathrm{Var}=\lambda(\lambda+1)-\lambda^2=\lambda\)。

均值等于方差是泊松分布的标志。实际计数数据的方差常常大于均值,称为过度离散(overdispersion),说明强度本身在波动,需要负二项分布或自激励的 Hawkes 过程等更复杂的模型。

计算 递推 \(\frac{P\{X=i+1\}}{P\{X=i\}}=\frac{\lambda}{i+1}\)(7.6),从 \(P\{X=0\}=e^{-\lambda}\) 起逐项计算。例 7f:\(X\sim\) Poisson(100) 时 \(P\{X\le90\}=.17138\);\(Y\sim\) Poisson(1000) 时 \(P\{Y\le1075\}=.99095\)。

弱相依下的泊松近似:泊松范式

即使试验之间不独立,只要相依很弱,泊松近似依然好用。

  • 配对问题:\(P(E_i)=1/n\),\(P(E_i\mid E_j)=1/(n-1)\),相依很弱,所以拿对帽子的人数近似 Poisson(1),这与第 02、03 章的精确结果 \(P(\text{恰 }k\text{ 人})\approx e^{-1}/k!\) 一致。
  • 生日问题:对每对 \((i,j)\) 设一个"试验",成功(同生日)概率 \(1/365\)。这些事件两两独立但不相互独立。成功数近似 Poisson(\(\binom n2/365\)),所以
    \[P\{\text{无两人同生日}\}\approx\exp\Big(-\frac{n(n-1)}{730}\Big).\]
    令其 \(\le1/2\) 得 \(n(n-1)\ge730\ln2\approx506\),即 \(n=23\),与精确结果一致。
  • 三人同生日:\(P\{\text{无三人同生日}\}\approx\exp(-\binom n3/365^2)\),要使其小于 1/2 需 \(n\ge84\)。

泊松范式(Poisson paradigm):\(n\) 个事件,事件 \(i\) 的概率为 \(p_i\)。若所有 \(p_i\) 都"小",且事件独立或至多"弱相依",则发生的事件数近似服从均值为 \(\sum_ip_i\) 的泊松分布。各 \(p_i\) 不必相等。

金融直觉:一个由 500 笔小额消费贷组成的资产池,每笔年违约概率 0.5%–2% 不等,彼此几乎无关,那么年违约笔数近似 Poisson(\(\sum p_i\)),算尾部只需一个参数。但"弱相依"这个前提要当真:如果这些借款人集中在同一地区、同一行业,经济下行会让违约同时上升,事件之间就不再是弱相依,违约数的方差会远大于均值,泊松近似会严重低估尾部。这正是第 03 章"条件独立 ≠ 独立"在计数上的体现,也是本章"量化实战"第 2 部分过度离散检验的意义。

最长连串

例 7d(最长连续正面) 抛 \(n\) 次(正面概率 \(p\)),最长正面连串 \(L_n\) 的分布是什么?

陷阱:直接令 \(H_i\)="从第 \(i\) 次起连续 \(k\) 次正面"不行,因为 \(P(H_2\mid H_1)=p\) 远大于 \(P(H_2)=p^k\),连串会"成簇"出现,相依太强。

技巧:只数"以反面结尾的 \(k\) 连正"。令 \(E_i\)="第 \(i,\dots,i+k-1\) 次正面、第 \(i+k\) 次反面"(\(i\le n-k\)),\(P(E_i)=p^k(1-p)\);再加上 \(E_{n-k+1}\)="最后 \(k\) 次全正",概率 \(p^k\)。这些事件不重叠时独立,重叠时互斥,相依很弱,个数 \(N\) 近似泊松,均值 \(E[N]=(n-k)p^k(1-p)+p^k\)。所以

\[P\{L_n<k\}=P\{N=0\}\approx\exp\{-(n-k)p^k(1-p)-p^k\}.\]

公平硬币时 \(P\{L_n<k\}\approx\exp\{-n/2^{k+1}\}\)。令 \(j=\log_2n\),则 \(P\{L_n<j+i\}\approx\exp\{-(1/2)^{i+1}\}\),数值如下:

\(L_n\) \(<j-3\) \(j-3\) \(j-2\) \(j-1\) \(j\) \(j+1\) \(j+2\) \(j+3\) \(\ge j+4\)
概率 .0183 .1170 .2325 .2387 .1723 .1037 .0569 .0298 .0308

结论:无论 \(n\) 多大,最长正面连串以约 0.86 的概率落在 \(\log_2n-1\) 的 \(\pm2\) 之内。

白话解释:

  1. 为什么只数"以反面结尾的连串":一段 10 连正里包含很多个"从第 \(i\) 次起 \(k\) 连正",直接数会把同一段连串数很多次,而且这些事件高度相关。要求"后面紧跟一个反面",相当于只在每段连串的末尾数一次,于是不同的计数事件要么不重叠(独立),要么重叠(不可能同时发生,互斥),满足泊松范式。
  2. 为什么是 \(\log_2n\):\(k\) 连正大约每 \(2^{k+1}\) 次出现一次(以反面结尾的 \(k\) 连正概率 \(2^{-(k+1)}\)),\(n\) 次里期望出现 \(n/2^{k+1}\) 次。这个数从远大于 1 变成远小于 1 的地方,就是最长连串的典型长度,即 \(2^{k+1}\approx n\),\(k\approx\log_2n-1\)。
  3. 推论:样本量翻倍,最长连串只增加约 1。从 250 笔交易变成 500 笔,典型最长连亏从 7 变成 8 左右,而不是翻倍。

原书还给出两种精确算法。一是容斥公式:

\[P(L_n\ge k)=\sum_{r=1}^{n-k+1}(-1)^{r+1}\Big[\binom{n-rk}{r}+\frac1p\binom{n-rk}{r-1}\Big]p^{kr}(1-p)^r.\]
二是计算上更高效的递推:记 \(P_n\) 为 \(n\) 次中出现 \(k\) 连正的概率,对第一次反面出现的位置 \(j\)(\(j=1,\dots,k\))或"前 \(k\) 次全正"取条件,
\[P_n=\sum_{j=1}^kP_{n-j}\,p^{j-1}(1-p)+p^k,\]
初值 \(P_j=0\ (j<k)\),\(P_k=p^k\)。例如公平硬币 \(k=2\):\(P_2=1/4\),\(P_3=3/8\),\(P_4=1/2\)。复杂度 \(O(nk)\)。

泊松过程

事件在随机时刻发生(地震、订单到达、违约),设存在常数 \(\lambda>0\),满足:

  1. 长度为 \(h\) 的区间内恰好发生 1 个事件的概率为 \(\lambda h+o(h)\);
  2. 发生 2 个或更多事件的概率为 \(o(h)\);
  3. 不重叠区间内的事件数相互独立(独立增量)。

这里 \(o(h)\) 指满足 \(\lim_{h\to0}f(h)/h=0\) 的函数,如 \(h^2\)。

结论:长度为 \(t\) 的区间内事件数 \(N(t)\) 服从 Poisson(\(\lambda t\)):

\[P\{N(t)=k\}=e^{-\lambda t}\frac{(\lambda t)^k}{k!},\qquad k=0,1,\dots\tag{7.5}\]

证明思路:把 \([0,t]\) 等分成 \(n\) 段,每段长 \(t/n\)。\(\{N(t)=k\}=A\cup B\),\(A\)="恰有 \(k\) 段各有 1 个事件、其余段 0 个",\(B\)="\(N(t)=k\) 且某段有至少 2 个事件"。由 Boole 不等式 \(P(B)\le n\cdot o(t/n)=t\cdot\frac{o(t/n)}{t/n}\to0\)。由独立性,\(P(A)=\binom nk\big(\frac{\lambda t}{n}+o(\frac tn)\big)^k\big(1-\frac{\lambda t}{n}-o(\frac tn)\big)^{n-k}\),这正是二项概率,且 \(n(\frac{\lambda t}n+o(\frac tn))\to\lambda t\),按二项到泊松的论证得 \(P(A)\to e^{-\lambda t}(\lambda t)^k/k!\)。

推导拆解:证明里有两个容易卡住的地方。

  1. \(P(B)\to0\):\(B\) 发生意味着至少有一段里发生了 2 个以上事件。每段发生这种事的概率是 \(o(t/n)\),共 \(n\) 段,由 Boole 不等式总概率至多 \(n\cdot o(t/n)\)。把它写成 \(t\cdot\frac{o(t/n)}{t/n}\),令 \(h=t/n\to0\),由 \(o(h)\) 的定义 \(\frac{o(h)}h\to0\),所以整体趋于 0。这里正是假设 2 要求"\(o(h)\)"而不只是"小"的原因:段数按 \(1/h\) 增长,单段概率必须比 \(h\) 更快地变小,乘起来才能趋于 0。
  2. \(P(A)\) 是二项概率:每段看作一次试验,"成功"=段内恰有 1 个事件,概率 \(p_n=\frac{\lambda t}n+o(\frac tn)\);由假设 3,各段独立。于是 \(A\) 的概率就是 \(\mathrm{Bin}(n,p_n)\) 取 \(k\) 的概率,而 \(np_n\to\lambda t\),套用前面泊松近似二项的论证即可。

称事件按**速率(rate)为 \(\lambda\) 的泊松过程(Poisson process)**发生,\(\lambda\) 是单位时间内的平均事件数。

金融直觉:信用风险里的"违约强度"(hazard rate)就是这里的 \(\lambda\):在很短的时间 \(h\) 内违约概率约为 \(\lambda h\)。由 (7.5) 取 \(k=0\),到 \(t\) 年仍未违约的概率是 \(e^{-\lambda t}\),这和连续复利贴现因子 \(e^{-rt}\) 形式完全一样。所以 CDS 定价里"风险中性生存概率"可以写成 \(e^{-\lambda t}\),而"信用利差 ≈ 违约强度 × 违约损失率"也是从这里来的。

例 7e(地震) 美国西部的地震按速率每周 2 次的泊松过程发生。(a) 未来 2 周至少 3 次:\(1-e^{-4}(1+4+8)=1-13e^{-4}\)。(b) 到下一次地震的时间 \(X\):\(P\{X>t\}=P\{N(t)=0\}=e^{-\lambda t}\),即 \(F(t)=1-e^{-2t}\)。泊松过程的等待时间服从指数分布,第 05 章展开。

4.10 其他离散分布

几何分布

独立试验(成功概率 \(p\))直到首次成功,所需试验次数 \(X\) 服从几何分布(geometric distribution):

\[P\{X=n\}=(1-p)^{n-1}p,\qquad n=1,2,\dots\tag{8.1}\]

尾概率 \(P\{X\ge k\}=(1-p)^{k-1}\)。

例 8b(期望,首步分析) 记 \(q=1-p\),把 \(i\) 写成 \((i-1)+1\):

\[E[X]=\sum_i(i-1)q^{i-1}p+\sum_iq^{i-1}p=qE[X]+1\ \Rightarrow\ E[X]=\frac1p.\]
直观:第一次失败后,问题"重新开始"。例:掷骰子得到 1 平均需要 6 次。

推导拆解:

  1. 按定义 \(E[X]=\sum_{i\ge1}i\,q^{i-1}p\)。把 \(i\) 拆成 \((i-1)+1\),分成两个和。
  2. 第二个和 \(\sum_{i\ge1}q^{i-1}p\) 是全部概率之和,等于 1。
  3. 第一个和:\(i=1\) 项为 0,从 \(i=2\) 起,令 \(j=i-1\),得 \(\sum_{j\ge1}j\,q^{j}p=q\sum_{j\ge1}j\,q^{j-1}p=qE[X]\)。
  4. 于是 \(E[X]=qE[X]+1\),解得 \(E[X]=1/(1-q)=1/p\)。 这就是第 03 章"对第一步取条件"的期望版本:第一次试验必然要花 1 次;以概率 \(q\) 失败,之后还要再花与开始时同分布的次数。方程 \(E[X]=1+qE[X]\) 读起来正是这句话。同法(例 8c)得 \(E[X^2]=(q+1)/p^2\),
\[\mathrm{Var}(X)=\frac{1-p}{p^2}.\]

几何分布有无记忆性:\(P\{X=n+k\mid X>n\}=P\{X=k\}\)(原书理论练习 4.27)。已经连续失败了 \(n\) 次,剩余需要的次数分布不变——这就是"赌徒谬误"为什么是谬误。

金融直觉:无记忆性是一个很强的模型假设,用前先问它是否合理。"策略已经连亏 8 笔,下一笔该赢了"在独立同分布下是错觉,这是无记忆性的正确用法。但反过来,若数据显示连亏后胜率显著下降(例如市场状态切换导致策略失效),那就说明各笔交易不独立,几何分布与无记忆性都不适用,应改用第 02 章的游程检验或第 03 章的条件模型去刻画这种状态依赖。

负二项分布

直到累计 \(r\) 次成功所需的试验次数 \(X\):

\[P\{X=n\}=\binom{n-1}{r-1}p^r(1-p)^{n-r},\qquad n=r,r+1,\dots\tag{8.2}\]

(前 \(n-1\) 次中有 \(r-1\) 次成功,第 \(n\) 次成功。)称为参数 \((r,p)\) 的负二项分布(negative binomial),几何分布是 \(r=1\) 的特例。\(X=Y_1+\cdots+Y_r\),\(Y_i\) 是相邻两次成功之间的试验数,彼此独立且都服从几何分布。

\[E[X]=\frac rp,\qquad\mathrm{Var}(X)=\frac{r(1-p)}{p^2}.\]

例 8g 掷骰子直到 1 出现 4 次:\(E[X]=24\),\(\mathrm{Var}(X)=4(5/6)/(1/6)^2=120\)。

例 8d(点数问题另解) \(r\) 次成功先于 \(m\) 次失败,等价于第 \(r\) 次成功不晚于第 \(r+m-1\) 次试验,概率为 \(\sum_{n=r}^{r+m-1}\binom{n-1}{r-1}p^r(1-p)^{n-r}\)。

例 8e(Banach 火柴问题,选读) 数学家左右口袋各一盒 \(N\) 根火柴,每次等可能从任一盒取。首次发现某盒已空时,另一盒恰剩 \(k\) 根的概率为 \(\binom{2N-k}{N}(1/2)^{2N-k}\)。

负二项与二项之间有对偶关系(原书理论练习 4.28):若 \(X\) 是负二项 \((r,p)\),\(Y\) 是二项 \((n,p)\),则 \(P\{X>n\}=P\{Y<r\}\)——"凑够 \(r\) 次成功需要超过 \(n\) 次"等价于"前 \(n\) 次成功不足 \(r\) 次"。

超几何分布

从 \(N\) 个球(\(m\) 白、\(N-m\) 黑)中无放回随机取 \(n\) 个,白球数 \(X\) 服从超几何分布(hypergeometric):

\[P\{X=i\}=\frac{\binom mi\binom{N-m}{n-i}}{\binom Nn},\qquad i=0,1,\dots,n.\tag{8.4}\]

由于约定 \(k<0\) 或 \(k>r\) 时 \(\binom rk=0\),公式对所有 \(i\) 成立。

例 8h(捕获—再捕获,最大似然估计) 先捕 \(m\) 只动物做标记放回,再捕 \(n\) 只,其中有标记的数目 \(X\) 服从超几何分布,\(P_i(N)=\binom mi\binom{N-m}{n-i}/\binom Nn\)。观察到 \(X=i\) 后,取使 \(P_i(N)\) 最大的 \(N\) 作为估计。由

\[\frac{P_i(N)}{P_i(N-1)}=\frac{(N-m)(N-n)}{N(N-m-n+i)}\ge1\iff N\le\frac{mn}{i},\]
\(P_i(N)\) 先增后减,**最大似然估计(maximum likelihood estimate)**为不超过 \(mn/i\) 的最大整数。\(m=50,n=40,i=4\) 时估计约 500 只。直觉:样本中标记的比例 \(i/n\) 应约等于总体中的比例 \(m/N\)。这是第 03 册最大似然方法最直观的例子。

例 8i(抽检验收) 每批 10 件,抽检 3 件全合格才接收;30% 的批次有 4 件次品,70% 有 1 件。\(P(\text{接收})=\frac{\binom63}{\binom{10}3}(.3)+\frac{\binom93}{\binom{10}3}(.7)=\frac{54}{100}\),拒收 46%。

近似:当 \(m,N\) 相对 \(n\) 很大时,无放回与有放回差别可以忽略,超几何近似 \(\mathrm{Bin}(n,p)\),\(p=m/N\)。

均值与方差(例 8j)

\[E[X]=np,\qquad\mathrm{Var}(X)=np(1-p)\Big(1-\frac{n-1}{N-1}\Big)=\frac{N-n}{N-1}np(1-p).\]

均值与有放回抽样相同;\(\frac{N-n}{N-1}\) 叫有限总体修正因子(finite population correction),无放回抽样使方差变小。

Zeta(Zipf)分布

\[P\{X=k\}=\frac{C}{k^{\alpha+1}},\quad k=1,2,\dots,\quad C=\Big[\sum_{k\ge1}k^{-(\alpha+1)}\Big]^{-1}.\]

得名于 Riemann zeta 函数。Pareto 用它描述收入分布,Zipf 将其推广到词频等许多领域。它是离散的幂律分布,尾部比指数衰减慢得多。量化里市值、成交额、个股关注度的分布都近似幂律。

常见离散分布一览

分布 PMF 均值 方差 来历
二项 \((n,p)\) \(\binom nip^i(1-p)^{n-i}\) \(np\) \(np(1-p)\) \(n\) 次独立试验的成功数
泊松 \(\lambda\) \(e^{-\lambda}\lambda^i/i!\) \(\lambda\) \(\lambda\) 大量小概率事件的发生数
几何 \(p\) \(p(1-p)^{i-1},\ i\ge1\) \(1/p\) \((1-p)/p^2\) 首次成功所需次数
负二项 \((r,p)\) \(\binom{i-1}{r-1}p^r(1-p)^{i-r},\ i\ge r\) \(r/p\) \(r(1-p)/p^2\) 第 \(r\) 次成功所需次数
超几何 \((n,N,m)\) \(\binom mi\binom{N-m}{n-i}/\binom Nn\) \(np\) \(\frac{N-n}{N-1}np(1-p)\) 无放回抽样中的白球数

量化实战

1. 胜率显著性:二项尾概率

60 笔交易赢 37 笔(61.7%),是否说明胜率显著高于 50%?在原假设 \(p=0.5\) 下,\(P\{X\ge37\}\) 就是单侧 p 值。原书习题 4.41(ESP 检验)是同一个问题。注意这只检验胜率,不检验期望收益(第 04a 章已说明二者不同)。

2. 成交笔数是否泊松:方差/均值比

泊松分布的方差等于均值。把每分钟成交笔数的方差除以均值,得到离散指数(index of dispersion);在泊松假设下 \((T-1)\cdot\text{方差}/\text{均值}\) 近似服从自由度 \(T-1\) 的卡方分布(卡方分布见第 06a 章,检验原理见第 03 册)。若强度本身随时间波动(例如开盘、收盘时段活跃),计数就是"Gamma 混合泊松",即负二项分布,方差显著大于均值。

3. 最长连亏是否异常

250 笔交易、每笔亏损概率 0.5 时,最长连亏的中位数约为 \(\log_2 250-1\approx7\)。下面比较 Ross 的精确递推、泊松近似和模拟。

import numpy as np
from scipy import stats
rng = np.random.default_rng(2024)

# ---------- 1) 胜率是否显著高于 50%:二项尾概率 ----------
n, k = 60, 37
p_value = stats.binom.sf(k - 1, n, 0.5)          # P{X >= 37 | p = 0.5}
print(f"{n} 笔中赢 {k} 笔: 单侧 p 值 = {p_value:.4f}")
# 用 (6.3) 递推手算核对: P{X=i+1} = p/(1-p) * (n-i)/(i+1) * P{X=i}
pmf = [0.5**n]
for i in range(n):
    pmf.append(pmf[-1] * (n - i) / (i + 1))
print(f"递推结果 = {sum(pmf[k:]):.4f}")

# ---------- 2) 成交笔数:泊松还是过度离散? ----------
lam, T = 12.0, 2000                              # 每分钟平均 12 笔,观察 2000 分钟
pois = rng.poisson(lam, T)
# 过度离散:强度本身随时间波动(Gamma 混合泊松 = 负二项)
intensity = rng.gamma(shape=3.0, scale=lam / 3.0, size=T)
mixed = rng.poisson(intensity)
for name, x in (("纯泊松", pois), ("Gamma 混合泊松", mixed)):
    disp = x.var(ddof=1) / x.mean()
    # 离散指数检验:(T-1)*Var/Mean 在泊松假设下近似 chi2(T-1)
    stat = (T - 1) * disp
    pv = stats.chi2.sf(stat, T - 1)
    print(f"{name}: 均值={x.mean():.2f} 方差={x.var(ddof=1):.2f} 方差/均值={disp:.2f} p值={pv:.3g}")

# ---------- 3) 250 笔交易中最长连亏:精确递推 vs 泊松近似 vs 模拟 ----------
def prob_run_at_least(n, k, p):
    """n 次独立试验(成功概率 p)中出现至少 k 连成功的概率,Ross 4.7 节递推"""
    P = np.zeros(n + 1)
    P[k] = p**k
    for m in range(k + 1, n + 1):
        P[m] = sum(P[m - j] * p**(j - 1) * (1 - p) for j in range(1, k + 1)) + p**k
    return P[n]

def poisson_approx(n, k, p):
    return 1 - np.exp(-(n - k) * p**k * (1 - p) - p**k)

n_tr, q_loss = 250, 0.5
losses = rng.random((20000, n_tr)) < q_loss
def longest(row):
    best = cur = 0
    for v in row:
        cur = cur + 1 if v else 0
        best = max(best, cur)
    return best
L = np.array([longest(r) for r in losses])
print(f"\n{n_tr} 笔、单笔亏损概率 {q_loss}: log2(n) = {np.log2(n_tr):.2f}, 模拟最长连亏中位数 = {np.median(L):.0f}")
print(" k   精确P(L>=k)   泊松近似   模拟")
for k in (5, 6, 7, 8, 10, 12):
    print(f"{k:2d}   {prob_run_at_least(n_tr, k, q_loss):10.4f}   {poisson_approx(n_tr, k, q_loss):8.4f}   {(L >= k).mean():.4f}")

关键输出:

60 笔中赢 37 笔: 单侧 p 值 = 0.0462
递推结果 = 0.0462
纯泊松: 均值=12.03 方差=12.30 方差/均值=1.02 p值=0.231
Gamma 混合泊松: 均值=12.27 方差=62.68 方差/均值=5.11 p值=0

250 笔、单笔亏损概率 0.5: log2(n) = 7.97, 模拟最长连亏中位数 = 7
 k   精确P(L>=k)   泊松近似   模拟
 5       0.9856     0.9789   0.9840
 6       0.8682     0.8537   0.8665
 7       0.6269     0.6160   0.6276
 8       0.3840     0.3791   0.3841
10       0.1120     0.1114   0.1088
12       0.0289     0.0289   0.0297

读法:

  • 37/60 的单侧 p 值约 0.046,勉强在 5% 水平下显著;scipy 与 (6.3) 递推结果一致。若这是从 20 个策略中挑出来的最好一个,还要回到第 02 章做多重检验校正。
  • 纯泊松计数的方差/均值约为 1;Gamma 混合泊松约为 5(理论值 \(1+\lambda/\text{shape}=1+12/3=5\)),p 值小到打印为 0,泊松假设被强烈拒绝。真实的逐笔成交数据通常更接近后者。
  • 一个胜率 50% 的策略在 250 笔交易中出现至少 8 连亏的概率约 38%,至少 10 连亏也有 11%。**看到 8–9 连亏就断定策略"失效",多半是对随机性的误判。**泊松近似在 \(k\) 稍大时已经非常准确。

本章小结

二项分布数 \(n\) 次独立试验的成功数,均值 \(np\)、方差 \(np(1-p)\),单峰,众数在 \(\lfloor(n+1)p\rfloor\);泊松分布是"大量小概率事件"的极限,均值等于方差等于 \(\lambda\),在弱相依下依然近似成立(泊松范式),可用于生日问题、配对问题和最长连串;泊松过程由"稀有、无多重、独立增量"三条假设推出,计数为 Poisson(\(\lambda t\)),等待时间为指数分布。几何分布与负二项分布数"等到第 \(r\) 次成功需要多少次",几何分布无记忆;超几何分布描述无放回抽样,均值与有放回相同、方差乘以有限总体修正因子。递推公式让这些概率在计算机上都能高效、稳定地算出来。

概念 公式
二项递推 \(P\{X=k+1\}=\frac{p}{1-p}\frac{n-k}{k+1}P\{X=k\}\)
二项众数 \(\lfloor(n+1)p\rfloor\)
泊松近似 \(\mathrm{Bin}(n,p)\approx\mathrm{Poisson}(np)\)(\(n\) 大,\(p\) 小)
泊松递推 \(P\{X=i+1\}=\frac{\lambda}{i+1}P\{X=i\}\)
泊松范式 发生数 \(\approx\mathrm{Poisson}(\sum p_i)\)
最长连串 \(P\{L_n<k\}\approx\exp\{-(n-k)p^k(1-p)-p^k\}\);公平硬币 \(L_n\approx\log_2n\)
泊松过程 \(N(t)\sim\mathrm{Poisson}(\lambda t)\),等待时间 \(P\{X>t\}=e^{-\lambda t}\)
几何 \(E=1/p\),\(\mathrm{Var}=(1-p)/p^2\),无记忆
负二项 \(E=r/p\),\(\mathrm{Var}=r(1-p)/p^2\)
超几何 \(E=np\),\(\mathrm{Var}=\frac{N-n}{N-1}np(1-p)\)
捕获—再捕获 MLE \(\hat N=\lfloor mn/i\rfloor\)

练习

基础

  1. 某选股模型每期从 300 只股票中选 30 只。若模型毫无能力,相当于随机抽取;股票池中有 60 只"未来跑赢"的股票。选中跑赢股数目的分布、均值与方差是什么? 答案:超几何 \((n=30,N=300,m=60)\),\(E=6\),\(\mathrm{Var}=\frac{270}{299}\cdot30\cdot0.2\cdot0.8\approx4.33\)。
  2. 某交易所某合约平均每分钟成交 3 笔,假设为泊松过程。(a) 某分钟没有成交的概率;(b) 5 分钟内至少 20 笔的概率(用递推或 scipy 计算)。 答案:(a) \(e^{-3}\approx0.0498\);(b) \(N(5)\sim\) Poisson(15),\(P\{N\ge20\}\approx0.125\)。
  3. 求 \(\mathrm{Bin}(20,0.3)\) 的众数。 答案:\(\lfloor21\times0.3\rfloor=6\)。
  4. 掷骰子直到出现 6,已知前 5 次都没出现 6,求还需要超过 3 次的概率。 答案:无记忆性,\((5/6)^3\approx0.579\)。
  5. 某策略每天独立地以 0.03 的概率触发风控。用泊松近似估计一年(250 个交易日)内触发次数不超过 3 次的概率,并与精确二项结果比较。 答案:\(\lambda=7.5\),泊松 \(\approx0.0591\);二项精确约 0.0565。

进阶

  1. 用示性变量法推导超几何分布的方差公式。 提示:\(P\{X_i=1,X_j=1\}=\frac mN\frac{m-1}{N-1}\),代入第 04a 章式 (9.1)。
  2. 证明独立的 Poisson(\(\lambda_1\)) 与 Poisson(\(\lambda_2\)) 之和服从 Poisson(\(\lambda_1+\lambda_2\))。(第 06a 章例 3e) 提示:卷积求和后用二项式定理。
  3. 一个胜率 55% 的策略做 500 笔交易,用泊松近似估计最长连亏不少于 10 笔的概率。 答案:此时"成功"指亏损,\(p=0.45\),\(E[N]\approx(500-10)(0.45)^{10}(0.55)+0.45^{10}\approx0.0921\),概率 \(\approx1-e^{-0.0921}\approx0.088\)。
  4. 两种计数模型:(a) 每分钟订单数 Poisson(10);(b) 每分钟订单数是 Poisson(\(\Lambda\)),\(\Lambda\) 以 0.5 的概率为 5、0.5 的概率为 15。分别求均值和方差。 答案:(a) 10 与 10;(b) 均值 10,\(E[X^2]=0.5(5+25)+0.5(15+225)=135\),方差 35。混合导致过度离散。
  5. 证明 \(P\{L_n<k\}\) 的泊松近似在公平硬币时可写成 \(\exp\{-(n-k+2)/2^{k+1}\}\),并说明为什么 \(n\) 翻倍时最长连串大约只增加 1。 提示:代入 \(p=1/2\);\(n\to2n\) 时,\(k\to k+1\) 使指数保持不变。

原书推荐习题:Problems 4.41(ESP 检验)、4.60(混合泊松 + 贝叶斯)、4.62(无重复的泊松近似)、4.63(泊松过程)、4.69(最长连串三种算法对比)、4.72–4.73(系列赛)、4.80(Keno 期望回报);Theoretical Exercises 4.13、4.16、4.18(众数与 MLE)、4.25(泊松稀疏化)、4.27(几何无记忆性)、4.28(负二项—二项对偶);Self-Test 4.13(配对问题期望与方差)、4.28(负超几何)。


原书对照

本章小节 原书章节 PDF 页码 书内页码
4.8 伯努利与二项 4.6 The Bernoulli and Binomial Random Variables(含 4.6.1、4.6.2) p.140–148 p.127–135
4.9 泊松(含最长连串、泊松过程) 4.7 The Poisson Random Variable(含 4.7.1) p.148–160 p.135–147
4.10 其他离散分布 4.8 Other Discrete Probability Distributions(4.8.1–4.8.4) p.160–168 p.147–155
小结与习题 Summary, Problems, Theoretical Exercises, Self-Test p.175–188 p.162–175

(书内页码 = PDF 页码 − 13。)