量化交易中文教材

元信息:Sheldon Ross《A First Course in Probability》(第 10 版,Pearson)|作者 Sheldon Ross|本笔记负责 PDF 第 125–292 页(第 4 章 随机变量、第 5 章 连续型随机变量、第 6 章 联合分布随机变量)

第 4 章 随机变量(Random Variables)(PDF p.125–188)

章节目录:4.1 随机变量;4.2 离散型随机变量;4.3 期望;4.4 随机变量函数的期望;4.5 方差;4.6 伯努利与二项随机变量;4.7 泊松随机变量;4.8 其他离散分布;4.9 随机变量和的期望;4.10 累积分布函数的性质。

4.1 随机变量(PDF p.125–129)

定义。 做实验时我们往往只关心结果的某个函数(如两颗骰子之和、抛硬币的正面总数),而不关心具体结果。定义在样本空间上的实值函数称为随机变量(random variable)。由于其取值由实验结果决定,可给其可能取值赋概率。

例 1a(三枚硬币)。 \(Y\)=正面数,\(P\{Y=0\}=1/8\),\(P\{Y=1\}=3/8\),\(P\{Y=2\}=3/8\),\(P\{Y=3\}=1/8\);因 \(Y\) 必取 0–3 之一,\(1=P(\bigcup_{i=0}^3\{Y=i\})=\sum_i P\{Y=i\}\)。

例 1b(寿险赔付)。 两位老年客户各有 10 万美元保单;年轻者一年内死亡事件 \(Y\) 概率 0.05,年长者 \(O\) 概率 0.10,相互独立。\(X\)=赔付总额(单位 10 万):\(P\{X=0\}=0.95\times0.9=0.855\),\(P\{X=1\}=0.05\times0.9+0.95\times0.1=0.140\),\(P\{X=2\}=0.005\)。

例 1c(最大编号球)。 从编号 1–20 的球中不放回取 4 个,\(X\)=最大编号,取值 4,…,20:

\[P\{X=i\}=\binom{i-1}{3}\Big/\binom{20}{4},\quad i=4,\dots,20\]
(选中 \(i\) 号且另 3 个来自 \(1..i-1\))。求 \(P\{X>10\}\) 更直接的做法是用补事件:\(P\{X>10\}=1-\binom{10}{4}/\binom{20}{4}\)(\(X\le10\) 等价于 4 球都在 1–10 中)。技巧:对“最大值”类变量,\(P\{X\le x\}\) 往往比点概率好算。

例 1d(截断几何)。 正面概率 \(p\) 的硬币反复抛,直到出现正面或已抛满 \(n\) 次。\(X\)=抛掷次数:\(P\{X=i\}=(1-p)^{i-1}p\)(\(i=1,\dots,n-1\)),\(P\{X=n\}=(1-p)^{n-1}\)(前 \(n-1\) 次都反面,第 \(n\) 次正反均停)。验证:\(\sum_{i=1}^{n-1}p(1-p)^{i-1}+(1-p)^{n-1}=1-(1-p)^{n-1}+(1-p)^{n-1}=1\)。

例 1e(集券问题 coupon collecting)。 \(N\) 种券,每次独立等可能得到任一种。\(T\)=集齐全部种类所需张数。思路:先求尾概率。令 \(A_j\)=前 \(n\) 张中没有第 \(j\) 种,则 \(\{T>n\}=\bigcup_j A_j\),用容斥原理(inclusion–exclusion),且 \(P(A_{j_1}\cdots A_{j_k})=((N-k)/N)^n\),得

\[P\{T>n\}=\sum_{i=1}^{N-1}\binom{N}{i}\Big(\frac{N-i}{N}\Big)^n(-1)^{i+1}\tag{1.1}\]
再由 \(P\{T=n\}=P\{T>n-1\}-P\{T>n\}\) 得点概率。 另一个随机变量 \(D_n\)=前 \(n\) 张中出现的不同种类数。固定一组 \(k\) 种:事件 A=每张都属这 \(k\) 种,概率 \((k/N)^n\);事件 B=这 \(k\) 种都出现,给定 A 时每张在 \(k\) 种中等可能,故 \(P(B|A)\)=“\(k\) 种券在 \(n\) 张内集齐”的概率 \(=1-\sum_{i=1}^{k-1}\binom{k}{i}(\frac{k-i}{k})^n(-1)^{i+1}\)。于是
\[P\{D_n=k\}=\binom{N}{k}\Big(\frac{k}{N}\Big)^n\Big[1-\sum_{i=1}^{k-1}\binom{k}{i}\Big(\frac{k-i}{k}\Big)^n(-1)^{i+1}\Big]\]
附注(组合恒等式): \(n<N\) 时 \(P\{T>n\}=1\),由 (1.1) 推出对 \(1\le n<N\):\(\sum_{j=1}^N\binom{N}{j}j^n(-1)^{j-1}=0\)。

累积分布函数(cumulative distribution function, CDF / distribution function): \(F(x)=P\{X\le x\}\),\(-\infty<x<\infty\)。若 \(a\le b\),\(\{X\le a\}\subset\{X\le b\}\),故 \(F\) 单调不减(更多性质见 4.10)。

4.2 离散型随机变量(Discrete Random Variables)(PDF p.129–132)

最多取可数个值的随机变量称为离散型。概率质量函数(probability mass function, PMF) \(p(a)=P\{X=a\}\)。若 \(X\) 取值 \(x_1,x_2,\dots\),则 \(p(x_i)\ge0\),其他点 \(p(x)=0\),且 \(\sum_i p(x_i)=1\)。可将 PMF 画成棒状图(图 4.1:\(p(0)=1/4,p(1)=1/2,p(2)=1/4\);图 4.2:两骰之和,\(p(k)\) 从 1/36 线性升到 \(p(7)=6/36\) 再对称下降)。

例 2a(泊松型 PMF 归一化)。 \(p(i)=c\lambda^i/i!\),\(i\ge0\)。由 \(\sum_i\lambda^i/i!=e^\lambda\) 得 \(c=e^{-\lambda}\)。(a) \(P\{X=0\}=e^{-\lambda}\);(b) \(P\{X>2\}=1-e^{-\lambda}-\lambda e^{-\lambda}-\lambda^2e^{-\lambda}/2\)。

CDF 与 PMF 关系: \(F(a)=\sum_{x\le a}p(x)\)。离散变量取值 \(x_1<x_2<\cdots\) 时 \(F\) 是阶梯函数:在 \((x_{i-1},x_i)\) 内为常数,在 \(x_i\) 处跳跃 \(p(x_i)\)。例:\(p(1)=1/4,p(2)=1/2,p(3)=p(4)=1/8\),则 \(F(a)=0\ (a<1);\ 1/4\ (1\le a<2);\ 3/4\ (2\le a<3);\ 7/8\ (3\le a<4);\ 1\ (a\ge4)\)(图 4.3)。跳跃高度=该点概率;\(F\) 右连续。

4.3 期望(Expected Value)(PDF p.132–134)

定义。 离散 \(X\) 的期望/期望值(expectation, expected value):

\[E[X]=\sum_{x:p(x)>0}x\,p(x)\]
即以概率为权的加权平均。例:\(p(0)=p(1)=1/2\) 时 \(E[X]=1/2\);\(p(0)=1/3,p(1)=2/3\) 时 \(E[X]=2/3\)。

频率解释: 独立重复无穷次,事件 \(E\) 出现的比例为 \(P(E)\)(第 8 章强大数律部分证明)。把 \(X\) 看成一局赌博收益,长期平均每局收益 \(=\sum x_ip(x_i)=E[X]\)。

例 3a。 公平骰子 \(E[X]=7/2\)。

例 3b(示性变量 indicator variable)。 \(I=1\) 若 \(A\) 发生,否则 0。\(E[I]=P(A)\)。——这是后面“示性变量求和法”的基石。

例 3c(答题顺序)。 两题,先答第 \(i\) 题,答对才能答另一题;答对第 \(i\) 题得 \(V_i\),知道答案概率 \(P_i\),独立。先答 1 的期望收益 \(V_1P_1(1-P_2)+(V_1+V_2)P_1P_2\),先答 2 为 \(V_2P_2(1-P_1)+(V_1+V_2)P_1P_2\)。先答 1 更优当且仅当

\[\frac{V_1P_1}{1-P_1}\ge\frac{V_2P_2}{1-P_2}\]
数值:题 1 值 200、把握 0.6;题 2 值 100、把握 0.8,则 \(100\times0.8/0.2=400>200\times0.6/0.4=300\),应先答题 2。(“收益×成功率/失败率”的排序指标。)

例 3d(检验悖论 / 规模偏倚 size-biased sampling)。 120 名学生乘 3 辆车(36、40、44 人),随机抽一名学生,\(X\)=其所在车人数。\(P\{X=36\}=36/120\) 等,\(E[X]=36(3/10)+40(1/3)+44(11/30)=1208/30\approx40.2667\),大于每车平均人数 40。原因:人多的车更可能被抽中,权重更大。(见自测题 4.4。)

附注(重心类比)。 期望类似质量分布的重心:在无重量杆上 \(x_i\) 处放质量 \(p(x_i)\),平衡点就在 \(E[X]\),因为 \(\sum_i(x_i-E[X])p(x_i)=0\)。图 4.4:\(p(-1)=0.10,p(0)=0.25,p(1)=0.30,p(2)=0.35\),重心 0.9。

4.4 随机变量函数的期望(Expectation of a Function of a Random Variable)(PDF p.134–138)

方法一: 先求 \(g(X)\) 的 PMF,再按定义求期望。例 4a: \(X\) 取 \(-1,0,1\) 概率 0.2、0.5、0.3,\(Y=X^2\):\(P\{Y=1\}=0.5,P\{Y=0\}=0.5\),\(E[X^2]=0.5\)。注意 \(E[X^2]=0.5\ne(E[X])^2=0.01\)(常见误区)。

命题 4.1(无意识统计学家定律,LOTUS)。 若 \(X\) 取 \(x_i\) 概率 \(p(x_i)\),则对任意实函数 \(g\):

\[E[g(X)]=\sum_i g(x_i)p(x_i)\]
证明:设 \(g(x_i)\) 的不同取值为 \(y_j\),把 \(g(x_i)\) 相同的项归并:\(\sum_ig(x_i)p(x_i)=\sum_j y_j\sum_{i:g(x_i)=y_j}p(x_i)=\sum_jy_jP\{g(X)=y_j\}=E[g(X)]\)。

例 4b(报童/季节性库存问题 newsvendor)。 每卖出一件净利 \(b\),季末每剩一件亏 \(\ell\)。需求 \(X\) 的 PMF 为 \(p(i)\)。备货 \(s\) 时利润 \(P(s)=bX-(s-X)\ell\)(\(X\le s\)),\(=sb\)(\(X>s\))。

\[E[P(s)]=sb+(b+\ell)\sum_{i=0}^s(i-s)p(i)\]
边际分析:\(E[P(s+1)]-E[P(s)]=b-(b+\ell)\sum_{i=0}^sp(i)\)。因此当
\[\sum_{i=0}^s p(i)<\frac{b}{b+\ell}\tag{4.1}\]
时多备一件更好。左边随 \(s\) 增、右边常数,设 \(s^*\) 为满足 (4.1) 的最大 \(s\),则 \(E[P(0)]<\cdots<E[P(s^*+1)]>E[P(s^*+2)]>\cdots\),最优备货量为 \(s^*+1\)。即最优库存是需求分布的 \(b/(b+\ell)\) 分位数(临界分位数 critical fractile)。

例 4c(效用 utility)。 两种行动,各导致后果 \(C_1..C_n\),概率分别为 \(p_i\)、\(q_i\)。构造效用:最差后果 \(c\) 赋 0,最好后果 \(C\) 赋 1;对其他 \(C_i\),找概率 \(u\) 使你在“确定得到 \(C_i\)”与“以概率 \(u\) 得 \(C\)、\(1-u\) 得 \(c\) 的抽奖”之间无差异,该 \(u\) 记为效用 \(u(C_i)\)。于是行动 1 等价于以概率 \(\sum_ip_iu(C_i)\) 得 \(C\) 的抽奖。结论:行动 1 优于 2 当且仅当 \(\sum_ip_iu(C_i)>\sum_iq_iu(C_i)\),即以期望效用(expected utility)衡量行动价值。

推论 4.1(线性)。 \(E[aX+b]=aE[X]+b\)。 矩: \(E[X]\) 称**均值(mean)**或一阶矩(first moment);\(E[X^n]\) 称 \(n\) 阶矩(\(n\)th moment),\(E[X^n]=\sum_x x^np(x)\)。

4.5 方差(Variance)(PDF p.138–140)

期望不反映离散程度:\(W\equiv0\);\(Y=\pm1\) 各 1/2;\(Z=\pm100\) 各 1/2,均值都是 0,但离散程度递增。可用 \(E|X-\mu|\) 度量,但数学上不便,故用平方偏差。

定义: \(\mathrm{Var}(X)=E[(X-\mu)^2]\),\(\mu=E[X]\)。展开得常用计算式

\[\mathrm{Var}(X)=E[X^2]-(E[X])^2\]
例 5a: 骰子 \(E[X^2]=91/6\),\(\mathrm{Var}(X)=91/6-(7/2)^2=35/12\)。

性质: \(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\)(证明:\(E[(aX+b-a\mu-b)^2]=a^2E[(X-\mu)^2]\))。平移不改变方差。 附注: (a) 力学类比——均值是重心,方差是转动惯量(moment of inertia);(b) 标准差(standard deviation) \(\mathrm{SD}(X)=\sqrt{\mathrm{Var}(X)}\),与 \(X\) 同量纲。

4.6 伯努利与二项随机变量(The Bernoulli and Binomial Random Variables)(PDF p.140–148)

伯努利随机变量(Bernoulli): 一次试验结果只分成功/失败,\(X=1\) 表成功:

\[p(0)=1-p,\quad p(1)=p\tag{6.1}\]
二项随机变量(binomial),参数 \((n,p)\): \(n\) 次独立试验中成功次数,
\[p(i)=\binom{n}{i}p^i(1-p)^{n-i},\quad i=0,1,\dots,n\tag{6.2}\]
推导:任一含 \(i\) 次成功的特定序列概率为 \(p^i(1-p)^{n-i}\)(独立性),这样的序列有 \(\binom ni\) 个(选哪 \(i\) 次成功)。如 \(n=4,i=2\) 有 6 个序列(ssff, sfsf, …)。由二项式定理 \(\sum_i p(i)=[p+(1-p)]^n=1\)。伯努利即 \((1,p)\) 二项。

例 6a: 5 枚公平硬币正面数:\(P\{X=k\}=\binom5k/32\),即 1/32, 5/32, 10/32, 10/32, 5/32, 1/32。 例 6b(螺丝退货): 次品率 0.01,10 个一包,保证至多 1 个次品。需更换比例 \(1-0.99^{10}-10(0.01)(0.99)^9\approx0.004\),即 0.4%。 例 6c(幸运轮 chuck-a-luck): 押 1–6 中一个数,掷 3 骰,该数出现 \(i\) 次赢 \(i\) 单位,不出现输 1。出现次数 ~ \(\mathrm{Bin}(3,1/6)\):\(P\{X=-1\}=125/216\),\(P\{X=1\}=75/216\),\(P\{X=2\}=15/216\),\(P\{X=3\}=1/216\)。\(E[X]=(-125+75+30+3)/216=-17/216\),长期每 216 局输 17 单位——看似公平的游戏其实有负期望。 例 6d(孟德尔遗传): 两个杂合(rd)父母,子代 dd、rr、rd 概率 1/4、1/4、1/2;显性外观(dd 或 rd)概率 3/4。4 个孩子中恰 3 个显性外观:\(\binom43(3/4)^3(1/4)=27/64\)。(图 4.5 为黄绿豌豆杂交示意。) 例 6e(陪审团): 12 人中至少 8 人判有罪才定罪,每人独立以概率 \(\theta\) 作出正确判断。仅凭此信息无法求解,须对被告是否有罪条件化:若无罪,正确裁决需有罪票 ≤7,即正确票 ≥5:\(\sum_{i=5}^{12}\binom{12}{i}\theta^i(1-\theta)^{12-i}\);若有罪,需 \(\sum_{i=8}^{12}\binom{12}{i}\theta^i(1-\theta)^{12-i}\)。设有罪先验 \(\alpha\),正确裁决概率 \(=\alpha\sum_{i=8}^{12}(\cdot)+(1-\alpha)\sum_{i=5}^{12}(\cdot)\)。 例 6f(冗余系统,多数表决): \(n\) 个部件各以概率 \(p\) 独立工作,至少一半工作则系统有效。(a) 5 部件优于 3 部件 ⇔ \(10p^3(1-p)^2+5p^4(1-p)+p^5>3p^2(1-p)+p^3\) ⇔ \(3(p-1)^2(2p-1)>0\) ⇔ \(p>1/2\)。(b) 一般地 \(2k+1\) 部件优于 \(2k-1\) 部件 ⇔ \(p>1/2\)。证明:令 \(X\)=前 \(2k-1\) 个中工作数,\(P_{2k+1}=P\{X\ge k+1\}+P\{X=k\}(1-(1-p)^2)+P\{X=k-1\}p^2\),\(P_{2k-1}=P\{X\ge k\}\),相减得 \(P\{X=k-1\}p^2-(1-p)^2P\{X=k\}=\binom{2k-1}{k}p^k(1-p)^k[p-(1-p)]\)(用 \(\binom{2k-1}{k-1}=\binom{2k-1}{k}\)),其正负由 \(2p-1\) 决定。直观:只有单个部件靠谱(\(p>1/2\))时,增加冗余才有益。

4.6.1 二项随机变量的性质(PDF p.144–147)

矩的递推: 利用 \(i\binom ni=n\binom{n-1}{i-1}\),

\[E[X^k]=np\,E[(Y+1)^{k-1}],\quad Y\sim\mathrm{Bin}(n-1,p)\]
\(k=1\) 得 \(E[X]=np\);\(k=2\) 得 \(E[X^2]=np[(n-1)p+1]\),故
\[E[X]=np,\qquad \mathrm{Var}(X)=np(1-p)\]
命题 6.1(单峰性): \(0<p<1\) 时,随 \(k\) 从 0 到 \(n\),\(P\{X=k\}\) 先单调增后单调减,在 \(k=\lfloor (n+1)p\rfloor\) 处取最大。证明:\(\dfrac{P\{X=k\}}{P\{X=k-1\}}=\dfrac{(n-k+1)p}{k(1-p)}\ge1\iff k\le(n+1)p\)。图 4.6:\(\mathrm{Bin}(10,1/2)\),\(1024p(k)\) 依次为 1,10,45,120,210,252,…,在 5 处最大。 例 6g(选举人团中选民的平均权力): 州人口 \(n=2k+1\),选举人票约 \(nc\)。势均力敌时其他 \(2k\) 人各以 1/2 独立投票,一个选民起决定作用的概率 \(=\binom{2k}{k}2^{-2k}=\frac{(2k)!}{k!k!2^{2k}}\)。用 Stirling 公式 \(k!\sim k^{k+1/2}e^{-k}\sqrt{2\pi}\)(\(a_k\sim b_k\) 指比值趋于 1)得该概率 \(\sim1/\sqrt{k\pi}\)。平均权力 \(=nc\cdot P\sim nc/\sqrt{n\pi/2}=c\sqrt{2n/\pi}\),与 \(\sqrt n\) 成正比,大州选民权力更大。(关键结论:对称随机游走 \(2k\) 步回到原点的概率 \(\approx1/\sqrt{\pi k}\)。)

4.6.2 二项分布函数的计算(PDF p.147–148)

递推式(命题 6.1 证明中得到):

\[P\{X=k+1\}=\frac{p}{1-p}\cdot\frac{n-k}{k+1}P\{X=k\}\tag{6.3}\]
例 6h: \(n=6,p=0.4\):\(P\{X=0\}=0.6^6\approx0.0467\),依次得 0.1866, 0.3110, 0.2765, 0.1382, 0.0369, 0.0041。编程计算 \(P\{X\le i\}\) 时,先算 \(P\{X=i\}\),再向下递推(数值上更稳)。 历史注记: Jacques(Jakob/James)Bernoulli(1654–1705)在遗著《Ars Conjectandi》(1713)中证明:试验次数大时成功比例以接近 1 的概率接近 \(p\)(弱大数律雏形)。伯努利家族三代出了 8–12 位数学家。 例 6i: \(n=100,p=0.75\):\(P\{X=70\}=0.04575\),\(P\{X\le70\}=0.14954\)(用二项计算器,图 4.7)。

4.7 泊松随机变量(The Poisson Random Variable)(PDF p.148–160)

定义: 取值 \(0,1,2,\dots\),参数 \(\lambda>0\),

\[p(i)=e^{-\lambda}\frac{\lambda^i}{i!}\tag{7.1}\]
归一化:\(e^{-\lambda}\sum\lambda^i/i!=1\)。由 Poisson 1837 年关于刑事民事判决概率的著作引入。

泊松近似二项(Poisson approximation to the binomial): \(X\sim\mathrm{Bin}(n,p)\),\(\lambda=np\),

\[P\{X=i\}=\frac{n(n-1)\cdots(n-i+1)}{n^i}\frac{\lambda^i}{i!}\frac{(1-\lambda/n)^n}{(1-\lambda/n)^i}\]
\(n\) 大、\(\lambda\) 适中时 \((1-\lambda/n)^n\approx e^{-\lambda}\),其余两因子 \(\approx1\),故 \(P\{X=i\}\approx e^{-\lambda}\lambda^i/i!\)。即大量独立试验、每次成功概率小、\(np\) 适中时,成功数近似泊松,\(\lambda\) 通常凭经验估计。典型例子:书页印刷错误数、社区活到 100 岁的人数、每天拨错号次数、商店每日狗饼干销量、邮局每日到客数、联邦司法系统年空缺数、放射物质单位时间放出 α 粒子数。

例 7a: 每页错误数 ~ Poisson(1/2),至少一个错的概率 \(1-e^{-1/2}\approx0.393\)。 例 7b: 次品率 0.1,10 件中至多 1 件次品:精确值 \(0.9^{10}+10(0.1)(0.9)^9=0.7361\);泊松近似 \(2e^{-1}\approx0.7358\)。 例 7c: α 粒子平均 3.2 个/秒,\(P\{X\le2\}=e^{-3.2}(1+3.2+3.2^2/2)\approx0.3799\)。

期望与方差: 直觉:二项均值 \(np=\lambda\),方差 \(np(1-p)\approx\lambda\)。验证:\(E[X]=\lambda e^{-\lambda}\sum_j\lambda^j/j!=\lambda\);\(E[X^2]=\lambda E[X+1]=\lambda(\lambda+1)\),所以

\[E[X]=\mathrm{Var}(X)=\lambda\]
(均值=方差是泊松的标志;实际计数数据方差>均值称为“过度离散”。)

弱相依下的泊松近似: 试验之间弱相依时近似依然好。

  • 配对问题(matching problem):\(n\) 人随机取帽,\(E_i\)=第 \(i\) 人拿到自己的帽子,\(P(E_i)=1/n\),\(P(E_i|E_j)=1/(n-1)\),相依很弱,故拿对帽子人数近似 Poisson(1)(第 2 章例 5m 已验证)。
  • 生日问题:对每对 \((i,j)\) 设试验,\(P(E_{ij})=1/365\),这些事件两两独立但不相互独立(理论习题 21)。成功数近似 Poisson 均值 \(\binom n2/365=n(n-1)/730\),故 \(P\{\text{无两人同生日}\}\approx\exp(-n(n-1)/730)\)。令其 \(\le1/2\):\(n(n-1)\ge730\ln2\approx505.997\),得 \(n=23\),与精确组合结果一致。
  • 三人同生日:三元组成功概率 \(1/365^2\),均值 \(\binom n3/365^2=n(n-1)(n-2)/(6\cdot365^2)\),\(P\{\text{无三人同生日}\}\approx\exp(-n(n-1)(n-2)/799350)\);\(<1/2\) 需 \(n(n-1)(n-2)\ge799350\ln2\approx554067.1\),即 \(n\ge84\)。

泊松范式(Poisson paradigm): \(n\) 个事件,事件 \(i\) 概率 \(p_i\);若所有 \(p_i\) 都“小”且事件独立或至多“弱相依”,则发生的事件数近似服从均值 \(\sum_ip_i\) 的泊松分布。各 \(p_i\) 不必相等。

例 7d(最长连续正面 longest run): 抛 \(n\) 次(正面概率 \(p\)),问是否出现 \(k\) 连正。

  • 陷阱:直接用 \(H_i\)=“从第 \(i\) 次起连续 \(k\) 次正面”不行,因为 \(P(H_2|H_1)=p\) 远大于 \(P(H_2)=p^k\),相依太强(连串会“成簇”出现)。
  • 技巧:只数“以反面结尾的 \(k\) 连正”:\(E_i\)=第 \(i..i+k-1\) 次正、第 \(i+k\) 次反(\(i\le n-k\)),\(P(E_i)=p^k(1-p)\);\(E_{n-k+1}\)=最后 \(k\) 次全正,概率 \(p^k\)。不重叠时独立,重叠时互斥(条件概率为 0),都接近无条件概率,故个数 \(N\) 近似泊松,均值 \(E[N]=(n-k)p^k(1-p)+p^k\)。设 \(L_n\)=最长正面连串长度:
    \[P\{L_n<k\}=P\{N=0\}\approx\exp\{-(n-k)p^k(1-p)-p^k\}\]
  • 公平硬币:\(P\{L_n<k\}\approx\exp\{-(n-k+2)/2^{k+1}\}\approx\exp\{-n/2^{k+1}\}\)。令 \(j=\log_2n\)(设为整数),\(k=j+i\) 时 \(P\{L_n<j+i\}\approx\exp\{-(1/2)^{i+1}\}\),\(P\{L_n=j+i\}\approx e^{-(1/2)^{i+2}}-e^{-(1/2)^{i+1}}\)。数值:\(P\{L_n<j-3\}\approx0.0183\);\(P\{L_n=j-3\}\approx0.1170\);\(j-2\): 0.2325;\(j-1\): 0.2387;\(j\): 0.1723;\(j+1\): 0.1037;\(j+2\): 0.0569;\(j+3\): 0.0298;\(P\{L_n\ge j+4\}\approx0.0308\)。结论:无论 \(n\) 多大,最长正面连串以约 0.86 的概率落在 \(\log_2 n-1\) 的 ±2 之内。
  • 精确公式(容斥): \(S_i\)=\(E_i\) 涉及的抛掷编号集(\(k+1\) 个)。不含 \(E_{n-k+1}\) 的 \(r\) 重交:有重叠则概率 0,否则独立,概率 \(p^{rk}(1-p)^r\);不重叠的选法数等于 \(r\) 个 a 与 \(n-r(k+1)\) 个 b 的排列数 \(\binom{n-rk}{r}\)。含 \(E_{n-k+1}\) 的 \(r\) 重交:概率 \(p^{kr}(1-p)^{r-1}\),选法 \(\binom{n-rk}{r-1}\)。合并:
    \[P(L_n\ge k)=\sum_{r=1}^{n-k+1}(-1)^{r+1}\Big[\binom{n-rk}{r}+\frac1p\binom{n-rk}{r-1}\Big]p^{kr}(1-p)^r\]
    (约定 \(m<j\) 时 \(\binom mj=0\)。)
  • 递推(计算上更高效): \(P_n\)=\(n\) 次中出现 \(k\) 连正的概率。按第一次反面出现的位置 \(j\)(\(j=1..k\))或前 \(k\) 次全正条件化:\(P(A_n|F_j)=P_{n-j}\),\(P(A_n|H)=1\),
    \[P_n=\sum_{j=1}^kP_{n-j}\,p^{j-1}(1-p)+p^k\]
    初值 \(P_j=0\ (j<k)\),\(P_k=p^k\)。例:公平硬币 \(k=2\):\(P_2=1/4\),\(P_3=3/8\),\(P_4=1/2\)(可枚举 8 个结果 hhhh, hhht, hhth, hthh, thhh, hhtt, thht, tthh 验证)。复杂度 \(O(nk)\)。

泊松过程(Poisson process)的推导(PDF p.157–159)。 事件在随机时间点发生,设常数 \(\lambda>0\) 满足:

  1. 长度 \(h\) 的区间内恰好发生 1 个事件的概率为 \(\lambda h+o(h)\)(\(o(h)\) 指 \(\lim_{h\to0}f(h)/h=0\),如 \(h^2\) 是 \(o(h)\),\(h\) 不是);
  2. 发生 ≥2 个事件的概率为 \(o(h)\);
  3. 不重叠区间内的事件数相互独立(独立增量)。

结论:长度 \(t\) 区间内事件数 \(N(t)\sim\) Poisson(\(\lambda t\))。证明:把 \([0,t]\) 分成 \(n\) 段,每段长 \(t/n\)(图 4.8)。\(\{N(t)=k\}=A\cup B\),\(A\)=恰 \(k\) 段各有 1 个事件、其余 0 个;\(B\)=\(N(t)=k\) 且某段有 ≥2 个。由 Boole 不等式 \(P(B)\le n\,o(t/n)=t\cdot\frac{o(t/n)}{t/n}\to0\) (7.3)。段内 0 事件概率 \(1-\lambda h-o(h)\)(两个 \(o(h)\) 之和仍为 \(o(h)\)),由独立性 \(P(A)=\binom nk(\frac{\lambda t}{n}+o(\frac tn))^k(1-\frac{\lambda t}n-o(\frac tn))^{n-k}\);因 \(n(\frac{\lambda t}n+o(\frac tn))\to\lambda t\),同二项→泊松的论证得 \(P(A)\to e^{-\lambda t}(\lambda t)^k/k!\) (7.4)。于是

\[P\{N(t)=k\}=e^{-\lambda t}\frac{(\lambda t)^k}{k!},\quad k=0,1,\dots\tag{7.5}\]
称事件按速率(rate)\(\lambda\) 的泊松过程发生,\(\lambda\) 为单位时间平均事件数,需经验确定。应用:地震次数、每年战争数、热阴极发射电子数、寿险保单持有人死亡数。

例 7e(地震): 美国西部地震按速率 2 次/周的泊松过程发生。(a) 未来 2 周至少 3 次:\(1-e^{-4}(1+4+8)=1-13e^{-4}\)。(b) 到下次地震的时间 \(X\):\(P\{X>t\}=P\{N(t)=0\}=e^{-\lambda t}\),\(F(t)=1-e^{-2t}\)——即泊松过程的等待时间服从指数分布(第 5 章展开)。

4.7.1 泊松分布函数的计算(PDF p.159–160)

递推:\(\dfrac{P\{X=i+1\}}{P\{X=i\}}=\dfrac{\lambda}{i+1}\) (7.6),从 \(P\{X=0\}=e^{-\lambda}\) 起逐项计算。 例 7f: \(X\sim\) Poisson(100),\(P\{X\le90\}=0.17138\);\(Y\sim\) Poisson(1000),\(P\{Y\le1075\}=0.99095\)(StatCrunch 计算)。

4.8 其他离散分布(Other Discrete Probability Distributions)(PDF p.160–168)

4.8.1 几何随机变量(The Geometric Random Variable)(PDF p.160–162)

独立试验(成功概率 \(p\))直到首次成功,\(X\)=所需试验次数:

\[P\{X=n\}=(1-p)^{n-1}p,\quad n=1,2,\dots\tag{8.1}\]
\(\sum_n P\{X=n\}=p/(1-(1-p))=1\),故成功以概率 1 终会发生。尾概率 \(P\{X\ge k\}=(1-p)^{k-1}\)(前 \(k-1\) 次都失败)。 例 8a: 罐中 \(N\) 白 \(M\) 黑,有放回抽到黑球为止:\(p=M/(M+N)\),\(P\{X=n\}=MN^{n-1}/(M+N)^n\),\(P\{X\ge k\}=(N/(M+N))^{k-1}\)。 例 8b(期望): 令 \(q=1-p\),把 \(i\) 写成 \((i-1)+1\):\(E[X]=\sum(i-1)q^{i-1}p+\sum q^{i-1}p=qE[X]+1\),故 \(E[X]=1/p\)。例:掷骰得到 1 平均需 6 次。(这是“首步分析”思想:失败一次后问题重新开始。) 例 8c(方差): 同法 \(E[X^2]=qE[X^2]+2qE[X]+1\),得 \(E[X^2]=(q+1)/p^2\),
\[\mathrm{Var}(X)=\frac{1-p}{p^2}\]

4.8.2 负二项随机变量(The Negative Binomial Random Variable)(PDF p.162–164)

直到累计 \(r\) 次成功所需试验次数 \(X\):

\[P\{X=n\}=\binom{n-1}{r-1}p^r(1-p)^{n-r},\quad n=r,r+1,\dots\tag{8.2}\]
(前 \(n-1\) 次中有 \(r-1\) 次成功,第 \(n\) 次成功。)归一性 (8.3) 的概率论证明:\(X=Y_1+\cdots+Y_r\),\(Y_i\) 为相继两次成功之间的试验数,均为独立几何变量,各自有限,故和有限。参数 \((r,p)\);几何分布即 \((1,p)\) 负二项。 例 8d(点数问题 problem of the points 的另解): \(r\) 次成功先于 \(m\) 次失败 ⇔ 第 \(r\) 次成功不晚于第 \(r+m-1\) 次试验,概率 \(\sum_{n=r}^{r+m-1}\binom{n-1}{r-1}p^r(1-p)^{n-r}\)。 例 8e(Banach 火柴问题): 数学家左右口袋各一盒火柴,各 \(N\) 根,每次等可能从任一盒取。首次发现某盒空时,另一盒恰剩 \(k\) 根(\(k=0..N\))的概率。设 \(E\)=先发现右盒空且左盒剩 \(k\):等价于第 \(N+1\) 次选右盒发生在第 \(2N-k+1\) 次试验,按 (8.2)(\(p=1/2\),\(r=N+1\),\(n=2N-k+1\))\(P(E)=\binom{2N-k}{N}(1/2)^{2N-k+1}\)。左右对称,所求为 \(2P(E)=\binom{2N-k}{N}(1/2)^{2N-k}\)。(注意“发现空”指第 \(N+1\) 次去取空盒。) 例 8f(矩): 用 \(n\binom{n-1}{r-1}=r\binom nr\),得 \(E[X^k]=\frac rpE[(Y-1)^{k-1}]\),\(Y\sim\mathrm{NB}(r+1,p)\)。于是
\[E[X]=\frac rp,\qquad \mathrm{Var}(X)=\frac{r(1-p)}{p^2}\]
(\(r=1\) 时与几何分布结果一致。) 例 8g: 掷骰直到 1 出现 4 次:\(E[X]=24\),\(\mathrm{Var}(X)=4(5/6)/(1/6)^2=120\)。

4.8.3 超几何随机变量(The Hypergeometric Random Variable)(PDF p.164–167)

从 \(N\) 球(\(m\) 白、\(N-m\) 黑)中不放回随机取 \(n\) 个,白球数 \(X\):

\[P\{X=i\}=\frac{\binom mi\binom{N-m}{n-i}}{\binom Nn},\quad i=0,1,\dots,n\tag{8.4}\]
附注: 实际上仅当 \(n-(N-m)\le i\le\min(n,m)\) 时非零;因约定 \(k<0\) 或 \(r<k\) 时 \(\binom rk=0\),公式总成立。

例 8h(捕获—再捕获估计种群规模,最大似然估计 maximum likelihood estimate): 先捕 \(m\) 只做标记放回,再捕 \(n\) 只,其中标记数 \(X\) 为超几何,\(P_i(N)=\binom mi\binom{N-m}{n-i}/\binom Nn\)。观察到 \(X=i\),取使 \(P_i(N)\) 最大的 \(N\) 作为估计。比值

\[\frac{P_i(N)}{P_i(N-1)}=\frac{(N-m)(N-n)}{N(N-m-n+i)}\ge1\iff N\le\frac{mn}{i}\]
故 \(P_i(N)\) 先增后减,MLE 为不超过 \(mn/i\) 的最大整数。数值:\(m=50,n=40,i=4\) → 估计约 500 只。等价直觉:\(m/N\approx i/n\)。 例 8i(抽检验收): 每批 10 件,抽检 3 件全合格才接收;30% 的批次有 4 件次品,70% 有 1 件。\(P(A)=\frac{\binom40\binom63}{\binom{10}3}\cdot0.3+\frac{\binom10\binom93}{\binom{10}{3}}\cdot0.7=54/100\),拒收 46%。 超几何→二项近似: 当 \(m,N\) 相对 \(n\) 很大、\(p=m/N\) 时,
\[P\{X=i\}=\binom ni\frac mN\frac{m-1}{N-1}\cdots\frac{N-m}{N-i}\cdots\approx\binom nip^i(1-p)^{n-i}\]
(有放回与不放回差别可忽略。) 例 8j(期望与方差): 用 \(i\binom mi=m\binom{m-1}{i-1}\)、\(n\binom Nn=N\binom{N-1}{n-1}\),得 \(E[X^k]=\frac{nm}NE[(Y+1)^{k-1}]\),\(Y\) 为参数 \((n-1,N-1,m-1)\) 的超几何。故 \(E[X]=nm/N\),\(E[X^2]=\frac{nm}N\big(\frac{(n-1)(m-1)}{N-1}+1\big)\)。令 \(p=m/N\),利用 \(\frac{m-1}{N-1}=p-\frac{1-p}{N-1}\):
\[E[X]=np,\qquad\mathrm{Var}(X)=np(1-p)\Big(1-\frac{n-1}{N-1}\Big)=\frac{N-n}{N-1}np(1-p)\]
附注: 均值与有放回相同;\(\frac{N-n}{N-1}\) 是有限总体修正因子(finite population correction),\(N\gg n\) 时方差≈二项方差。不放回抽样使方差变小。

4.8.4 Zeta(Zipf)分布(PDF p.168)

\[P\{X=k\}=\frac{C}{k^{\alpha+1}},\quad k=1,2,\dots,\ \alpha>0,\qquad C=\Big[\sum_{k\ge1}k^{-(\alpha+1)}\Big]^{-1}\]

得名于 Riemann zeta 函数 \(\zeta(s)=\sum_k k^{-s}\)。意大利经济学家 V. Pareto 用它描述家庭收入分布,G. K. Zipf 将其推广到许多领域。(这是离散的幂律/厚尾分布。)

4.9 随机变量和的期望(Expected Value of Sums of Random Variables)(PDF p.168–172)

为简化,假设样本空间 \(S\) 有限或可数。\(X(s)\) 表示结果 \(s\) 下 \(X\) 的值;\(Z=X+Y\) 也是随机变量,\(Z(s)=X(s)+Y(s)\)。例 9a: 抛 5 次,\(X\)=前 3 次正面数,\(Y\)=后 2 次正面数,\(s=(h,t,h,t,h)\) 时 \(X(s)=2,Y(s)=1,Z(s)=3\)。 记 \(p(s)=P(\{s\})\),则 \(P(A)=\sum_{s\in A}p(s)\)。

命题 9.1: \(E[X]=\sum_{s\in S}X(s)p(s)\)。证明:令 \(S_i=\{s:X(s)=x_i\}\),\(E[X]=\sum_ix_iP(S_i)=\sum_i\sum_{s\in S_i}X(s)p(s)=\sum_sX(s)p(s)\)(\(S_i\) 互斥且并为 \(S\))。 例 9b: 两次独立抛硬币,正面数期望按两种方式都得 \(2p\)。

推论 9.2(期望的线性性): \(E[\sum_{i=1}^nX_i]=\sum_iE[X_i]\)——无需任何独立性假设。证明:\(E[Z]=\sum_s(X_1(s)+\cdots+X_n(s))p(s)\) 拆开即可。(一般样本空间的证明见理论习题。)

例 9c: \(n\) 颗骰子之和的期望 \(=3.5n\)。 例 9d(示性变量法 method of indicators): 第 \(i\) 次试验成功概率 \(p_i\),令 \(X_i\) 为示性变量,\(X=\sum X_i\),\(E[X]=\sum p_i\),不要求试验独立。特例:二项 \(np\);超几何——第 \(i\) 个取出的球等可能是 \(N\) 个中任一个,白的概率 \(m/N\),故 \(E[X]=nm/N\)(虽然各次相依)。

例 9e(示性变量求方差):

\[E[X^2]=\sum_iE[X_i^2]+\sum_i\sum_{j\ne i}E[X_iX_j]=\sum_ip_i+\sum_i\sum_{j\ne i}P\{X_i=1,X_j=1\}\tag{9.1}\]
(用 \(X_i^2=X_i\),\(X_iX_j\) 是“\(i,j\) 都成功”的示性变量。)

  • 二项:\(E[X_iX_j]=p^2\),\(E[X^2]=np+n(n-1)p^2\),\(\mathrm{Var}=np(1-p)\)。
  • 超几何:\(P\{X_i=1,X_j=1\}=\frac mN\cdot\frac{m-1}{N-1}\),\(E[X^2]=\frac{nm}N+n(n-1)\frac mN\frac{m-1}{N-1}\),化简得 \(\mathrm{Var}(X)=np(1-p)(1-\frac{n-1}{N-1})\),与例 8j 一致。

4.10 累积分布函数的性质(Properties of the Cumulative Distribution Function)(PDF p.172–174)

CDF \(F\) 的四条性质:

  1. 单调不减:\(a<b\Rightarrow F(a)\le F(b)\);
  2. \(\lim_{b\to\infty}F(b)=1\);
  3. \(\lim_{b\to-\infty}F(b)=0\);
  4. 右连续:对任意递减趋于 \(b\) 的序列 \(b_n\),\(\lim F(b_n)=F(b)\)。

性质 1 由事件包含;2、3、4 由概率的连续性(第 2.6 节):如 \(b_n\uparrow\infty\) 时 \(\{X\le b_n\}\) 递增,并为 \(\{X<\infty\}\),概率→1;\(b_n\downarrow b\) 时 \(\{X\le b_n\}\) 递减,交为 \(\{X\le b\}\)。 所有关于 \(X\) 的概率问题都可用 \(F\) 回答:

\[P\{a<X\le b\}=F(b)-F(a)\tag{10.1}\]
\[P\{X<b\}=\lim_{n\to\infty}F(b-1/n)=F(b^-)\]
注意 \(P\{X<b\}\) 不一定等于 \(F(b)\)(后者含 \(X=b\) 的概率),\(P\{X=b\}=F(b)-F(b^-)\)。 例 10a(混合型分布): \(F(x)=0\ (x<0);\ x/2\ (0\le x<1);\ 2/3\ (1\le x<2);\ 11/12\ (2\le x<3);\ 1\ (x\ge3)\)(图 4.9,既有连续段又有跳跃)。(a) \(P\{X<3\}=F(3^-)=11/12\);(b) \(P\{X=1\}=F(1)-F(1^-)=2/3-1/2=1/6\);(c) \(P\{X>1/2\}=1-F(1/2)=3/4\);(d) \(P\{2<X\le4\}=F(4)-F(2)=1/12\)。

第 4 章小结(Summary)(PDF p.175–176)

原书小结复述:随机变量、分布函数、PMF、期望、LOTUS、方差及 \(E[X^2]-(E[X])^2\)、标准差,并列出常见离散分布表:

分布 PMF 均值 方差
二项 \((n,p)\) \(\binom ni p^i(1-p)^{n-i}\) \(np\) \(np(1-p)\)
泊松 \(\lambda\) \(e^{-\lambda}\lambda^i/i!\) \(\lambda\) \(\lambda\)
几何 \(p\) \(p(1-p)^{i-1},\ i\ge1\) \(1/p\) \((1-p)/p^2\)
负二项 \((r,p)\) \(\binom{i-1}{r-1}p^r(1-p)^{i-r},\ i\ge r\) \(r/p\) \(r(1-p)/p^2\)
超几何 \((n,N,m)\) \(\binom mi\binom{N-m}{n-i}/\binom Nn\) \(np\) \(\frac{N-n}{N-1}np(1-p)\)

以及和的期望等于期望之和。

第 4 章习题概述(PDF p.176–188)

Problems 4.1–4.85(PDF p.176–182)题型:

  • 由抽球/骰子/排名构造随机变量并求 PMF(4.1–4.9,4.14–4.19 含从给定阶梯 CDF 反求 PMF);条件分布(4.10);Möbius 函数与 \(6/\pi^2\)(4.11,\(P\{\mu(N)\neq0\}\to6/\pi^2\));NBA 选秀抽签(4.15–4.16)。
  • 期望与决策:轮盘“必胜策略”(4.20,说明正赢概率高但期望为负);检验悖论的车辆版(4.21:学生视角 vs 司机视角);系列赛期望场数在 \(p=1/2\) 时最大(4.22、4.36);商品价格 1 或 4 美元时最大化期望现金 vs 期望商品数量(4.23,Jensen 型“两种计价单位”悖论);零和博弈与 von Neumann 极小极大定理(4.24);圣彼得堡悖论(4.30,\(E[X]=\infty\));合适评分规则(4.31,Brier 型得分下诚实报告 \(p=p^*\) 最优);混样检测(4.32,10 人一组的期望检测次数);报童问题(4.33)、含商誉成本的库存问题(4.34);保险定价(4.27);故障排查顺序(4.29)。
  • 二项:多数表决、陪审团、军事法庭剔除法官的策略(4.40–4.47);混合二项(4.49,随机选硬币)、给定总数下序列的条件概率(4.50)。
  • 泊松近似:印刷错误、空难、生日(4.51–4.56,4.53:8 万对夫妻同生日);混合泊松与贝叶斯(4.55,4.60 新药是否有效);泊松近似与精确二项对比(4.58);“无结果重复”\(\approx\exp(-n(n-1)\sum p_i^2/2)\)(4.62);泊松过程(4.63 赌场到客、4.70 随机翻硬币);泊松范式应用(4.66–4.68 圆桌夫妻相邻、反导拦截);最长连串的公式/递推/泊松近似三法对比(4.69)。
  • 几何/负二项:轮盘首胜(4.71)、七局四胜系列赛(4.72–4.73)、访谈名单(4.74)、Banach 火柴推广(4.76–4.77)。
  • 超几何:抽检(4.79、4.81–4.82)、Keno 期望回报(4.80)。
  • 示性变量求期望:空盒数、集券种类数(4.84–4.85)。

理论习题 4.1–4.36(PDF p.182–186): 非等概率集券的 \(P\{T=n\}\);\(e^X\)、\(\alpha X+\beta\) 的 CDF;Yule–Simons 分布 \(4/(n(n+1)(n+2))\)(\(E[X]=2\)、\(E[X^2]=\infty\));尾和公式 \(E[N]=\sum_{i\ge1}P\{N\ge i\}\)、\(E[N(N+1)]=2\sum iP\{N\ge i\}\)(4.5);标准化 \(Y=(X-\mu)/\sigma\) 均值 0 方差 1(4.7);两点分布方差;由二项推二项式定理;\(E[1/(X+1)]\);给定成功数时排列等可能;二项与泊松 PMF 的众数及 MLE(4.13、4.16、4.18);偶数次正面概率 \(\frac12[1+(q-p)^n]\)、泊松为偶数概率 \(\frac12(1+e^{-2\lambda})\);泊松矩递推 \(E[X^n]=\lambda E[(X+1)^{n-1}]\);辨析三种近似推理(4.20);生日事件两两独立但不相互独立(4.21);泊松稀疏化(thinning):每个事件以概率 \(p\) 被计数,计数数为 Poisson(\(\lambda p\))(4.25);泊松 CDF 与伽马积分恒等式(4.26);几何分布无记忆性 \(P\{X=n+k|X>n\}=P\{X=k\}\)(4.27);负二项与二项的对偶 \(P\{X>n\}=P\{Y<r\}\)(4.28);Pólya 罐模型首次抽到蓝球(4.35);用联合 PMF 证明 \(E[X+Y]=E[X]+E[Y]\)(4.36)。

自测题 4.1–4.28(PDF p.186–188): 由约束求期望;规模偏倚 \(E[Y]\ge E[X]\)(4.4);信息价值:购买“选中哪枚硬币”内幕信息值多少(4.6);双信封类问题(4.7:红/蓝纸 \(x\) 与 \(2x\) 或 \(x/2\),阈值策略 \(R_y(x)\));\(P\{B(n,p)\le i\}=1-P\{B(n,1-p)\le n-i-1\}\);由均值方差反求二项参数;赛制条件概率;截断泊松(零截断)期望;男女互选配对的泊松近似与容斥(4.16);夫妻随机配对;赌场下注直到赢 4 次(负二项);几何分布 \(E[1/X]=-p\log p/(1-p)\);配对问题期望与方差(都为 1);NBA 1-3 落后翻盘概率;负超几何分布(4.28)。

第 4 章 本章要点

  1. 随机变量是样本空间上的实函数;CDF \(F\) 单调不减、右连续、两端极限 0 和 1,所有概率都可由 \(F\) 表达(注意 \(P\{X<b\}=F(b^-)\))。
  2. 离散变量用 PMF 描述;期望是概率加权平均,LOTUS \(E[g(X)]=\sum g(x)p(x)\),一般 \(E[g(X)]\ne g(E[X])\)。
  3. 方差 \(\mathrm{Var}(X)=E[X^2]-(E[X])^2\),\(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\)。
  4. 五大离散分布(二项、泊松、几何、负二项、超几何)的来源、PMF、均值、方差、相互关系(泊松近似二项;超几何近似二项;几何为负二项特例),及递推计算法。
  5. 泊松范式:大量小概率、弱相依事件的发生数近似泊松;泊松过程由“稀有+无多重+独立增量”三假设推出,等待时间为指数分布。
  6. 期望的线性性不需要独立性;示性变量法是求复杂计数期望/方差的通用工具。
  7. 典型决策模型:报童问题的临界分位数解、期望效用、答题顺序指标。

第 4 章 与量化交易的关联

  • 风险建模与跳跃: 泊松过程是跳跃扩散模型(Merton jump-diffusion)中跳跃到达、信用风险中违约到达(强度模型)的基础;“均值=方差”可用于检验成交笔数、订单到达是否为泊松(实际常过度离散,需负二项或 Hawkes 过程)。
  • 市场微观结构与执行: 限价单到达、成交事件计数常用泊松/计数过程建模;最优挂单、库存控制模型(如 Avellaneda–Stoikov)以泊松到达为输入。报童问题的临界分位数思想与“备货量=需求分位数”的做市库存/备付资金决策同构。
  • 回测与策略评估: 二项分布用于胜率显著性检验(如 10 次中 7 次正确的“预测能力”是否显著,对应习题 4.41);最长连串结果(最长连胜/连败长度约为 \(\log_2 n\))可用来判断回测中的连续亏损是否异常,避免把正常随机连败误判为策略失效。
  • 多重检验与过拟合: 泊松范式可估计“大量试验中至少一个偶然显著”的概率(生日问题思路),对应策略挖掘中的数据窥探。
  • 期望 vs 风险: chuck-a-luck、轮盘“必胜策略”和圣彼得堡悖论说明高胜率≠正期望、期望无穷≠值得付任意价格,与仓位管理、效用函数/Kelly 思想相关;例 4c 的期望效用是组合选择理论的公理基础。
  • 评分规则: 习题 4.31 的合适评分规则可用于评估概率预测模型(如涨跌概率预测的 Brier score)。
  • 抽样: 超几何的有限总体修正在从有限股票池中无放回抽样(如随机组合检验)时会用到;捕获—再捕获 MLE 是最大似然思想的最直观例子。
  • 几何分布无记忆性、Banach 火柴、孟德尔遗传等内容与量化无直接关联,仅作概率训练。

第 4 章 推荐习题

  • 4.20(轮盘策略:正赢概率 vs 负期望)、4.30(圣彼得堡悖论)、4.31(合适评分规则)——理解期望与决策。
  • 4.24(极小极大定理)——随机化策略与博弈。
  • 4.32、4.65(混样检测)——条件期望与泊松近似。
  • 4.33、4.34(报童及含商誉成本的库存)——临界分位数最优化。
  • 4.41(ESP 检验)——二项尾概率与显著性。
  • 4.60(混合泊松+贝叶斯)——参数不确定下的后验。
  • 4.69(最长连串三种算法对比)——与回测连亏分析直接相关。
  • 4.84、4.85(示性变量法)——计数期望的标准技巧。
  • 理论 4.5(尾和公式)、4.25(泊松稀疏化)、4.27(无记忆性)、4.28(负二项—二项对偶)。
  • 自测 4.4(规模偏倚)、4.6(信息价值)、4.7(双信封阈值策略)。

第 5 章 连续型随机变量(Continuous Random Variables)(PDF p.189–232)

章节目录:5.1 引言;5.2 连续型随机变量的期望与方差;5.3 均匀随机变量;5.4 正态随机变量;5.5 指数随机变量;5.6 其他连续分布;5.7 随机变量函数的分布。

5.1 引言(PDF p.189–192)

有些随机变量取值不可数,如火车到站时间、晶体管寿命。定义: 若存在定义在全实轴上的非负函数 \(f\),使对任意(可测)实数集 \(B\)

\[P\{X\in B\}=\int_Bf(x)\,dx\tag{1.1}\]
则称 \(X\) 为连续型随机变量(continuous random variable)(有时称绝对连续),\(f\) 为概率密度函数(probability density function, PDF)。(脚注:技术上只对可测集成立,实际所需集合都可测。)

  • 归一:\(\int_{-\infty}^\infty f(x)dx=1\);区间概率 \(P\{a\le X\le b\}=\int_a^bf(x)dx\)(1.2),即密度曲线下面积(图 5.1)。
  • 令 \(a=b\) 得 \(P\{X=a\}=0\):连续变量取任一固定值的概率为 0,因此 \(P\{X<a\}=P\{X\le a\}=F(a)=\int_{-\infty}^af(x)dx\)。

例 1a: \(f(x)=C(4x-2x^2)\),\(0<x<2\)。由 \(C[2x^2-2x^3/3]_0^2=1\) 得 \(C=3/8\);\(P\{X>1\}=\frac38\int_1^2(4x-2x^2)dx=1/2\)。 例 1b(计算机寿命): \(f(x)=\lambda e^{-x/100}\),\(x\ge0\),由归一化 \(\lambda=1/100\)。\(P\{50<X<150\}=e^{-1/2}-e^{-3/2}\approx0.383\);\(P\{X<100\}=1-e^{-1}\approx0.632\)。 例 1c(电子管): \(f(x)=100/x^2\),\(x>100\)。150 小时内需更换的概率 \(100\int_{100}^{150}x^{-2}dx=1/3\);5 个管中恰 2 个需更换:\(\binom52(1/3)^2(2/3)^3=80/243\)。

CDF 与 PDF: \(F(a)=\int_{-\infty}^af(x)dx\),\(\frac{d}{da}F(a)=f(a)\)——密度是 CDF 的导数。直观解释:\(f\) 在 \(a\) 处连续时

\[P\{a-\varepsilon/2\le X\le a+\varepsilon/2\}\approx\varepsilon f(a)\]
即 \(f(a)\) 衡量 \(X\) 落在 \(a\) 附近的可能性(\(f(a)\) 本身不是概率,可大于 1)。 例 1d(\(Y=2X\) 的密度,两种方法): 法一(CDF 法):\(F_Y(a)=P\{2X\le a\}=F_X(a/2)\),求导 \(f_Y(a)=\frac12f_X(a/2)\)。法二(微元法):\(\epsilon f_Y(a)\approx P\{a/2-\epsilon/4\le X\le a/2+\epsilon/4\}\approx\frac\epsilon2f_X(a/2)\)。

5.2 连续型随机变量的期望与方差(PDF p.192–196)

由 \(f(x)dx\approx P\{x\le X\le x+dx\}\),定义

\[E[X]=\int_{-\infty}^\infty xf(x)\,dx\]
例 2a: \(f(x)=2x\)(\(0\le x\le1\)),\(E[X]=2/3\)。 例 2b: \(X\sim U(0,1)\),求 \(E[e^X]\):先求 \(Y=e^X\) 的 CDF,\(1\le x\le e\) 时 \(F_Y(x)=P\{X\le\ln x\}=\ln x\),\(f_Y(x)=1/x\),\(E[Y]=\int_1^e dx=e-1\)。

命题 2.1(连续版 LOTUS): \(E[g(X)]=\int_{-\infty}^\infty g(x)f(x)dx\)。如例 2b:\(\int_0^1e^xdx=e-1\)。 引理 2.1(尾积分公式): 非负随机变量 \(Y\) 有

\[E[Y]=\int_0^\infty P\{Y>y\}\,dy\]
证明(连续情形):\(\int_0^\infty\int_y^\infty f_Y(x)dxdy\),交换积分次序得 \(\int_0^\infty(\int_0^xdy)f_Y(x)dx=\int_0^\infty xf_Y(x)dx\)。 命题 2.1 证明(\(g\ge0\)): \(E[g(X)]=\int_0^\infty P\{g(X)>y\}dy=\int_0^\infty\int_{x:g(x)>y}f(x)dxdy=\int_{x:g(x)>0}\int_0^{g(x)}dy\,f(x)dx=\int g(x)f(x)dx\)。一般情形见理论习题 5.2、5.3。

例 2c(断棍): 长 1 的棍在 \(U\sim U(0,1)\) 处折断,求含点 \(p\) 那段的期望长度。\(L_p(U)=1-U\)(\(U<p\)),\(=U\)(\(U>p\))(图 5.2)。

\[E[L_p(U)]=\int_0^p(1-u)du+\int_p^1u\,du=\frac12+p(1-p)\]
\(p=1/2\) 时最大——又一个规模偏倚现象(含某点的那段倾向更长)。 例 2d(出发时间): 早到 \(s\) 分钟成本 \(cs\),迟到 \(s\) 分钟成本 \(ks\),路程时间 \(X\) 有密度 \(f\)。提前 \(t\) 分钟出发,\(C_t(X)=c(t-X)\)(\(X\le t\)),\(k(X-t)\)(\(X\ge t\))。求导:\(\frac{d}{dt}E[C_t(X)]=(k+c)F(t)-k\),最优 \(t^*\) 满足
\[F(t^*)=\frac{k}{k+c}\]
(与报童问题同构:非对称线性损失下最优决策是分位数,即分位数回归的 pinball loss 原理。)

推论 2.1: \(E[aX+b]=aE[X]+b\)。方差定义对任何类型随机变量相同:\(\mathrm{Var}(X)=E[(X-\mu)^2]=E[X^2]-(E[X])^2\),\(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\)。 例 2e: 例 2a 中 \(E[X^2]=\int_0^12x^3dx=1/2\),\(\mathrm{Var}(X)=1/2-4/9=1/18\)。

5.3 均匀随机变量(The Uniform Random Variable)(PDF p.197–200)

\((0,1)\) 上均匀:\(f(x)=1\)(\(0<x<1\))(3.1);对 \(0<a<b<1\),\(P\{a\le X\le b\}=b-a\),即概率等于子区间长度。 一般 \((\alpha,\beta)\) 上均匀:

\[f(x)=\frac1{\beta-\alpha}\ (\alpha<x<\beta),\qquad F(a)=\begin{cases}0&a\le\alpha\\ \frac{a-\alpha}{\beta-\alpha}&\alpha<a<\beta\\1&a\ge\beta\end{cases}\tag{3.2}\]
(图 5.3:密度为矩形,CDF 为斜线段。) 例 3a: \(E[X]=\frac{\alpha+\beta}2\)(区间中点);\(E[X^2]=\frac{\beta^2+\alpha\beta+\alpha^2}3\),\(\mathrm{Var}(X)=\frac{(\beta-\alpha)^2}{12}\)。 例 3b: \(X\sim U(0,10)\):\(P\{X<3\}=3/10\),\(P\{X>6\}=4/10\),\(P\{3<X<8\}=1/2\)。 例 3c(等车): 7:00 起每 15 分钟一班,乘客到达时间 \(U(0,30)\) 分钟。等待 <5 分钟:到达在 (10,15) 或 (25,30),概率 1/3;等待 >10 分钟:到达在 (0,5) 或 (15,20),概率 1/3。 例 3d(Bertrand 悖论,几何概率 geometrical probability 的引入): 圆的“随机弦”长度大于内接正三角形边长的概率。问题本身不良定义,取决于“随机”的含义:

  • 若弦到圆心距离 \(D\sim U(0,r)\):条件为 \(D<r/2\),概率 1/2;
  • 若弦与过一端点切线的夹角 \(\theta\sim U(0°,180°)\):条件为 \(60°<\theta<120°\),概率 1/3(图 5.4)。 两者都可由实际实验实现:把半径 \(r\) 的圆盘扔到间距 \(2r\) 的平行线上得 1/2;绕圆周上点 A 自由旋转一根针得 1/3。教训:“随机”必须指明概率模型。

5.4 正态随机变量(Normal Random Variables)(PDF p.200–212)

定义: 参数 \(\mu,\sigma^2\) 的正态(normal)随机变量密度

\[f(x)=\frac{1}{\sqrt{2\pi}\sigma}e^{-(x-\mu)^2/2\sigma^2},\quad -\infty<x<\infty\]
钟形、关于 \(\mu\) 对称(图 5.5:标准正态峰值 \(0.399\),拐点在 \(\mu\pm\sigma\))。历史:De Moivre 1733 年为近似大 \(n\) 二项概率引入,Laplace 等推广,即第 8 章的中心极限定理(central limit theorem)——与强大数律并列为概率论两大结果,为身高、气体分子速度分量、测量误差等近似正态提供理论依据。

归一化证明(极坐标技巧): 令 \(y=(x-\mu)/\sigma\),只需证 \(I=\int e^{-y^2/2}dy=\sqrt{2\pi}\)。\(I^2=\iint e^{-(x^2+y^2)/2}dxdy\),换极坐标 \(x=r\cos\theta,y=r\sin\theta\),\(dxdy=rd\theta dr\):\(I^2=2\pi\int_0^\infty re^{-r^2/2}dr=2\pi\)。

线性变换保持正态: \(X\sim N(\mu,\sigma^2)\),则 \(Y=aX+b\sim N(a\mu+b,a^2\sigma^2)\)。证(\(a>0\)):\(F_Y(x)=F_X((x-b)/a)\),求导得 \(f_Y(x)=\frac1{\sqrt{2\pi}a\sigma}\exp\{-(x-b-a\mu)^2/2(a\sigma)^2\}\)。推论:\(Z=(X-\mu)/\sigma\) 为标准(单位)正态(standard/unit normal),\(N(0,1)\)。 例 4a(均值方差): \(E[Z]=\frac1{\sqrt{2\pi}}\int xe^{-x^2/2}dx=0\);分部积分(\(u=x\),\(dv=xe^{-x^2/2}dx\))得 \(\mathrm{Var}(Z)=E[Z^2]=1\)。由 \(X=\mu+\sigma Z\):\(E[X]=\mu\),\(\mathrm{Var}(X)=\sigma^2\)。

标准正态 CDF: \(\Phi(x)=\frac1{\sqrt{2\pi}}\int_{-\infty}^xe^{-y^2/2}dy\)。表 5.1 给出 \(x=0.00\)–\(3.49\) 的 \(\Phi(x)\)(如 \(\Phi(1)=0.8413\),\(\Phi(1.5)=0.9332\),\(\Phi(1.645)\approx0.95\),\(\Phi(1.96)=0.9750\),\(\Phi(2)=0.9772\),\(\Phi(2.33)\approx0.99\),\(\Phi(2.5)=0.9938\),\(\Phi(3)=0.9987\))。对称性:

\[\Phi(-x)=1-\Phi(x)\tag{4.1}\]
即 \(P\{Z\le-x\}=P\{Z>x\}\)。一般正态:\(F_X(a)=\Phi\big(\frac{a-\mu}\sigma\big)\)。

例 4b: \(\mu=3,\sigma^2=9\):(a) \(P\{2<X<5\}=\Phi(2/3)-\Phi(-1/3)=\Phi(2/3)-[1-\Phi(1/3)]\approx0.3779\);(b) \(P\{X>0\}=P\{Z>-1\}=\Phi(1)\approx0.8413\);(c) \(P\{|X-3|>6\}=P\{|Z|>2\}=2[1-\Phi(2)]\approx0.0456\)。 例 4c(按曲线打分): A:\(>\mu+\sigma\),概率 \(1-\Phi(1)\approx0.1587\);B:\((\mu,\mu+\sigma)\),0.3413;C:\((\mu-\sigma,\mu)\),0.3413;D:\((\mu-2\sigma,\mu-\sigma)\),\(\Phi(2)-\Phi(1)\approx0.1359\);F:\(<\mu-2\sigma\),0.0228。即约 16%、34%、34%、14%、2%。(\(\pm1\sigma\) 内约 68%,\(\pm2\sigma\) 内约 95%。) 例 4d(亲子鉴定): 孕期 \(\sim N(270,100)\);被告在出生前 290 至 240 天间不在国内。若其为父亲,孕期须 >290 或 <240:\(P=1-\Phi(2)+1-\Phi(3)\approx0.0241\)。 例 4e(二进制信道): 发 1 送 \(+2\),发 0 送 \(-2\),接收 \(R=x+N\),\(N\sim N(0,1)\);规则 \(R\ge0.5\) 判 1。\(P\{\text{错}|1\}=P\{N<-1.5\}=1-\Phi(1.5)\approx0.0668\);\(P\{\text{错}|0\}=P\{N\ge2.5\}=1-\Phi(2.5)\approx0.0062\)。(阈值不对称导致两类错误率不同。) 例 4f(风险价值 Value at Risk, VaR): 投资的 VaR 定义为使“损失超过 \(v\) 的概率仅 1%”的 \(v\)。若收益 \(X\sim N(\mu,\sigma^2)\),损失 \(-X\sim N(-\mu,\sigma^2)\):

\[0.01=P\{-X>v\}=1-\Phi\Big(\frac{v+\mu}{\sigma}\Big)\Rightarrow\frac{v+\mu}\sigma=2.33\Rightarrow\mathrm{VaR}=2.33\sigma-\mu\]
因此在收益正态的投资中,VaR 最小者是 \(\mu-2.33\sigma\) 最大者。

5.4.1 二项分布的正态近似(The Normal Approximation to the Binomial Distribution)(PDF p.206–210)

DeMoivre–Laplace 极限定理: \(S_n\) 为 \(n\) 次独立试验(成功概率 \(p\))的成功数,则对任意 \(a<b\),

\[P\Big\{a\le\frac{S_n-np}{\sqrt{np(1-p)}}\le b\Big\}\to\Phi(b)-\Phi(a),\quad n\to\infty\]
De Moivre 1733 年证 \(p=1/2\) 情形,Laplace 1812 年推广到一般 \(p\);它是中心极限定理特例,此处不证。 两种近似的分工: 泊松近似适合 \(n\) 大 \(p\) 小;正态近似在 \(np(1-p)\) 大时好,经验上 \(np(1-p)\ge10\) 即可(图 5.6:\(\mathrm{Bin}(10,0.7)\)、\((20,0.7)\)、\((30,0.7)\)、\((50,0.7)\) 的 PMF 随 \(n\) 增大越来越像正态)。 连续性修正(continuity correction): 二项取整数值,近似时把 \(P\{X=i\}\) 写成 \(P\{i-1/2<X<i+1/2\}\)。 例 4g: 公平硬币抛 40 次,\(P\{X=20\}\):正态近似 \(P\{19.5<X<20.5\}=\Phi(0.16)-\Phi(-0.16)\approx0.1272\);精确值 \(\binom{40}{20}2^{-40}\approx0.1254\)。 例 4h(超额录取): 理想 150 人,录取 450 人,每人到校概率 0.3。\(P\{X\ge150.5\}\approx1-\Phi\big(\frac{150.5-135}{\sqrt{450\cdot0.3\cdot0.7}}\big)=1-\Phi(1.59)\approx0.0559\)(假设学生决定相互独立)。 例 4i(饮食实验,即假设检验的第一类错误): 100 人试新饮食,至少 65% 胆固醇降低就背书。若饮食无效,每人降低概率 1/2:\(P\{X\ge64.5\}=P\{Z\ge\frac{64.5-50}{5}=2.9\}\approx1-\Phi(2.9)\approx0.0019\)。 例 4j(抽样民调): 纽约市 52% 居民赞成校园禁烟,随机抽 \(n\) 人,样本中赞成者过半的概率。严格说 \(S_n\) 是超几何(不放回),但总体远大于样本,近似为 \(\mathrm{Bin}(n,0.52)\),再用正态:
\[P\{S_n>0.5n\}\approx\Phi(0.04\sqrt n)\]
\(n=11\):\(\Phi(0.1328)=0.5528\);\(n=101\):\(\Phi(0.4020)=0.6562\);\(n=1001\):\(\Phi(1.2665)=0.8973\)。要使概率 ≥0.95,需 \(0.04\sqrt n>1.645\),即 \(n\ge1692\)。(样本量与 \(1/\text{优势}^2\) 成正比。)

历史注记: De Moivre 称之为“指数钟形曲线”;1809 年 Gauss 在天体位置预测中使用后被称为高斯分布;19 世纪中后期人们相信大多数数据都应服从它,Karl Pearson 起称“正态曲线”。De Moivre 是在伦敦 Slaughter 咖啡馆替赌徒计算赔率的法国新教难民,皇家学会会员、牛顿好友。Gauss(1777–1855)被 E. T. Bell 与阿基米德、牛顿并列。

5.5 指数随机变量(Exponential Random Variables)(PDF p.210–216)

定义: 参数 \(\lambda>0\),

\[f(x)=\lambda e^{-\lambda x}\ (x\ge0),\qquad F(a)=1-e^{-\lambda a}\ (a\ge0)\]
例 5a(矩): 分部积分得递推 \(E[X^n]=\frac n\lambda E[X^{n-1}]\),故 \(E[X]=1/\lambda\),\(E[X^2]=2/\lambda^2\),
\[\mathrm{Var}(X)=1/\lambda^2\]
均值是参数的倒数,方差是均值的平方。实际中常描述“到某事件发生的等待时间”(地震、战争爆发、接到拨错号的电话),理论依据见 4.7 节泊松过程。 例 5b: 通话时长 ~ Exp(1/10) 分钟,前面有人刚开始打:等待 >10 分钟概率 \(e^{-1}\approx0.368\);10–20 分钟概率 \(e^{-1}-e^{-2}\approx0.233\)。

无记忆性(memoryless): 非负 \(X\) 满足

\[P\{X>s+t\mid X>t\}=P\{X>s\},\quad\forall s,t\ge0\tag{5.1}\]
等价于 \(P\{X>s+t\}=P\{X>s\}P\{X>t\}\) (5.2)。指数分布满足(\(e^{-\lambda(s+t)}=e^{-\lambda s}e^{-\lambda t}\))。含义:已用 \(t\) 小时的仪器,剩余寿命分布与新仪器相同。 例 5c(邮局): 两名职员分别服务 Jones 和 Brown,Smith 在任一人离开后开始服务;服务时间 ~ Exp(\(\lambda\))。Smith 最后离开的概率:Smith 开始服务时,另一人剩余服务时间由无记忆性仍是 Exp(\(\lambda\)),与 Smith 对称,故答案 1/2。 唯一性: 指数分布是唯一的(连续)无记忆分布。令 \(\bar F(x)=P\{X>x\}\),则 \(\bar F(s+t)=\bar F(s)\bar F(t)\),该函数方程唯一的右连续解是 \(g(x)=e^{-\lambda x}\) (5.3)。脚注证明:\(g(m/n)=g(1/n)^m\),\(g(1)=g(1/n)^n\),故 \(g(m/n)=g(1)^{m/n}\),由右连续性 \(g(x)=g(1)^x\);又 \(g(1)=g(1/2)^2\ge0\),令 \(\lambda=-\log g(1)\)。 例 5d(电池): 电池寿命 ~ 指数,均值 1 万英里,5000 英里旅程不换电池的概率 \(e^{-1/2}\approx0.607\)(无需知道已用多久)。若非指数分布,需要 \(\frac{1-F(t+5)}{1-F(t)}\),必须知道已用里程 \(t\)。

拉普拉斯分布(Laplace / 双指数 double exponential): 正负等可能、绝对值 ~ Exp(\(\lambda\)):

\[f(x)=\tfrac12\lambda e^{-\lambda|x|},\qquad F(x)=\begin{cases}\tfrac12e^{\lambda x}&x<0\\1-\tfrac12e^{-\lambda x}&x>0\end{cases}\]
例 5e: 例 4e 的信道噪声改为 Laplace(1):\(P\{\text{错}|1\}=P\{N<-1.5\}=\frac12e^{-1.5}\approx0.1116\);\(P\{\text{错}|0\}=P\{N\ge2.5\}=\frac12e^{-2.5}\approx0.041\)——都比正态噪声大(厚尾)。

5.5.1 风险率函数(Hazard Rate Functions)(PDF p.214–216)

正值连续寿命 \(X\),风险率/失效率(hazard rate / failure rate):

\[\lambda(t)=\frac{f(t)}{\bar F(t)},\quad\bar F=1-F\]
解释:\(P\{X\in(t,t+dt)\mid X>t\}=\frac{P\{X\in(t,t+dt)\}}{P\{X>t\}}\approx\frac{f(t)}{\bar F(t)}dt\),即已活到 \(t\) 的物品瞬时失效的条件概率强度。

  • 指数分布 \(\lambda(t)=\lambda e^{-\lambda t}/e^{-\lambda t}=\lambda\) 为常数(与无记忆性一致),故 \(\lambda\) 称为分布的速率(rate)。
  • 风险率唯一确定分布: \(\int_0^t\lambda(s)ds=-\log(1-F(t))\),故
    \[F(t)=1-\exp\Big\{-\int_0^t\lambda(s)ds\Big\}\tag{5.4}\]
  • 线性风险率 \(\lambda(t)=a+bt\):\(F(t)=1-e^{-at-bt^2/2}\),\(f(t)=(a+bt)e^{-(at+bt^2/2)}\);\(a=0\) 时为 Rayleigh 密度。

例 5f(吸烟者死亡率“是不吸烟者两倍”): 意为 \(\lambda_s(t)=2\lambda_n(t)\)。\(A\) 岁不吸烟者活到 \(B\) 岁的概率 \(\exp\{-\int_A^B\lambda_n(t)dt\}\),吸烟者为 \(\exp\{-2\int_A^B\lambda_n\}=[\cdot]^2\)——是平方而不是一半。例:\(\lambda_n(t)=1/30\)(\(50\le t\le60\)),50 岁不吸烟者活到 60 的概率 \(e^{-1/3}\approx0.7165\),吸烟者 \(e^{-2/3}\approx0.5134\)。

5.6 其他连续分布(Other Continuous Distributions)(PDF p.216–221)

5.6.1 伽马分布(The Gamma Distribution)

参数 \((\alpha,\lambda)\),\(\alpha,\lambda>0\):

\[f(x)=\frac{\lambda e^{-\lambda x}(\lambda x)^{\alpha-1}}{\Gamma(\alpha)},\ x\ge0;\qquad\Gamma(\alpha)=\int_0^\infty e^{-y}y^{\alpha-1}dy\]
伽马函数性质: 分部积分 \(\Gamma(\alpha)=(\alpha-1)\Gamma(\alpha-1)\) (6.1);\(\Gamma(1)=1\),故整数 \(n\) 时 \(\Gamma(n)=(n-1)!\)。 与泊松过程的联系: 速率 \(\lambda\) 的泊松过程中第 \(n\) 个事件发生时刻 \(T_n\):\(\{T_n\le t\}=\{N(t)\ge n\}\),
\[P\{T_n\le t\}=\sum_{j\ge n}e^{-\lambda t}\frac{(\lambda t)^j}{j!}\]
求导时相邻项相消(望远镜求和),得 \(f(t)=\lambda e^{-\lambda t}\frac{(\lambda t)^{n-1}}{(n-1)!}\),即 Gamma(\(n,\lambda\)),文献中称 \(n\)-Erlang 分布;\(n=1\) 为指数分布。 卡方分布: \(\lambda=1/2\)、\(\alpha=n/2\) 的伽马称为自由度 \(n\) 的 \(\chi^2_n\)(chi-squared)分布,描述 \(n\) 维空间中各坐标误差独立正态时命中误差(平方距离)的分布,第 6 章详述与正态关系。 例 6a: \(E[X]=\frac{\Gamma(\alpha+1)}{\lambda\Gamma(\alpha)}=\alpha/\lambda\);\(\mathrm{Var}(X)=\alpha/\lambda^2\)(留作习题)。

5.6.2 Weibull 分布

工程中广泛使用,最初用于疲劳数据;适合“最弱环节(weakest link)”模型——由许多部件组成、任一部件失效即整体失效的物体寿命。CDF(参数 \(\nu,\alpha,\beta\)):

\[F(x)=1-\exp\Big\{-\Big(\frac{x-\nu}{\alpha}\Big)^\beta\Big\},\ x>\nu;\qquad f(x)=\frac\beta\alpha\Big(\frac{x-\nu}\alpha\Big)^{\beta-1}\exp\Big\{-\Big(\frac{x-\nu}\alpha\Big)^\beta\Big\}\tag{6.2}\]
(\(\beta=1\) 退化为平移指数;风险率随 \(\beta>1\) 递增、\(\beta<1\) 递减。)

5.6.3 柯西分布(The Cauchy Distribution)

参数 \(\theta\):\(f(x)=\frac1\pi\frac1{1+(x-\theta)^2}\)。 例 6b(旋转手电筒): 手电筒中心距 x 轴 1 个单位,旋转停下后光束与 x 轴交点 \(X=\tan\theta\),\(\theta\sim U(-\pi/2,\pi/2)\)(图 5.7)。\(F(x)=P\{\theta\le\tan^{-1}x\}=\frac12+\frac1\pi\tan^{-1}x\),\(f(x)=\frac1{\pi(1+x^2)}\),即标准柯西。(脚注推导 \(\frac{d}{dx}\tan^{-1}x=\frac1{1+x^2}\)。)柯西分布均值不存在,是厚尾的极端例子。

5.6.4 贝塔分布(The Beta Distribution)

\[f(x)=\frac{1}{B(a,b)}x^{a-1}(1-x)^{b-1},\ 0<x<1;\qquad B(a,b)=\int_0^1x^{a-1}(1-x)^{b-1}dx\]

用于建模取值在有限区间 \([c,d]\) 的随机现象(平移缩放到 [0,1])。\(a=b\) 时关于 1/2 对称,\(a\) 越大越集中于 1/2;\(a=b=1\) 为 \(U(0,1)\)(图 5.8:\(a=1/4,1,3,10\));\(b>a\) 时偏向小值,\(a>b\) 时偏向大值(图 5.9:\(a/(a+b)=1/20\))。

\[B(a,b)=\frac{\Gamma(a)\Gamma(b)}{\Gamma(a+b)}\tag{6.3}\]
(证明见第 6 章例 7c。)由此
\[E[X]=\frac a{a+b},\qquad\mathrm{Var}(X)=\frac{ab}{(a+b)^2(a+b+1)}\]

5.7 随机变量函数的分布(The Distribution of a Function of a Random Variable)(PDF p.221–223)

基本方法:把 \(\{g(X)\le y\}\) 写成 \(X\) 属于某集合的事件,求 CDF 再求导。 例 7a: \(X\sim U(0,1)\),\(Y=X^n\):\(F_Y(y)=P\{X\le y^{1/n}\}=y^{1/n}\),\(f_Y(y)=\frac1ny^{1/n-1}\)(\(0\le y\le1\))。 例 7b: \(Y=X^2\):\(F_Y(y)=F_X(\sqrt y)-F_X(-\sqrt y)\),\(f_Y(y)=\frac1{2\sqrt y}[f_X(\sqrt y)+f_X(-\sqrt y)]\)(\(y\ge0\))。 例 7c: \(Y=|X|\):\(f_Y(y)=f_X(y)+f_X(-y)\)(\(y\ge0\))。

定理 7.1(单调变换的密度公式): \(X\) 有密度 \(f_X\),\(g\) 严格单调且可微,则 \(Y=g(X)\) 的密度

\[f_Y(y)=\begin{cases}f_X[g^{-1}(y)]\left|\dfrac{d}{dy}g^{-1}(y)\right|&y=g(x)\text{ 对某个 }x\\0&\text{否则}\end{cases}\]
证明(\(g\) 递增):\(F_Y(y)=P\{X\le g^{-1}(y)\}=F_X(g^{-1}(y))\),求导;\(y\) 不在值域时 \(F_Y\) 为 0 或 1,导数 0。递减时多一个负号,故取绝对值。 例 7d: 非负 \(X\),\(Y=X^n\):\(f_Y(y)=\frac1ny^{1/n-1}f(y^{1/n})\);\(n=2\) 与例 7b 一致。 例 7e(对数正态分布 lognormal): \(X\sim N(\mu,\sigma^2)\),\(Y=e^X\) 称参数 \((\mu,\sigma^2)\) 的对数正态,即 \(\log Y\) 正态。常用于证券相邻两日价格比 \(S_n/S_{n-1}\):假设其为对数正态,等价于对数收益 \(X=\log(S_n/S_{n-1})\) 正态,\(S_n=S_{n-1}e^X\)。由 \(g^{-1}(y)=\log y\),\(\frac{d}{dy}g^{-1}=1/y\):
\[f_Y(y)=\frac{1}{\sqrt{2\pi}\sigma y}\exp\{-(\log y-\mu)^2/2\sigma^2\},\quad y>0\]

第 5 章小结(Summary)(PDF p.223–225)

复述:连续变量与密度、\(F'=f\)、期望与 LOTUS、方差;均匀 \((a,b)\):均值 \((a+b)/2\)、方差 \((b-a)^2/12\);正态参数即均值方差、标准化 \(Z=(X-\mu)/\sigma\);大 \(n\) 二项可用 \(N(np,np(1-p))\) 近似;指数:均值 \(1/\lambda\)、方差 \(1/\lambda^2\)、唯一无记忆、风险率为常数 \(\lambda\);风险率 \(\lambda(t)=f(t)/(1-F(t))\);伽马:均值 \(\alpha/\lambda\)、方差 \(\alpha/\lambda^2\);贝塔:均值 \(a/(a+b)\)、方差 \(ab/[(a+b)^2(a+b+1)]\)。

第 5 章习题概述(PDF p.225–232)

Problems 5.1–5.42: 由密度求常数与 CDF、判断函数能否为密度(5.1–5.8);连续型报童问题:最优备货 \(s^*\) 满足 \(F(s^*)=b/(b+\ell)\)(5.9);均匀分布应用:火车去向比例、线段分割比、维修站选址(5.10–5.13);正态计算:由两个分位数反求参数、给定尾概率求方差/分位点(5.15–5.21);正态近似二项/负二项(5.20–5.28,5.22 用“前 100 次发球成功少于 50”转换负二项事件;5.26 判断硬币是否有偏的两类错误;5.27 一万次抛出 5800 正面是否公平);二叉树股价模型(5.29:每期以 \(p=0.52\) 乘 \(u=1.012\)、否则乘 \(d=0.990\),1000 期后至少上涨 30% 的概率——用正态近似上涨次数);贝叶斯分类阈值(5.30);最小化 \(E|X-a|\) 的解为中位数(5.31);指数无记忆(5.32–5.34,5.34 对比均匀寿命);由风险率求生存概率(5.35–5.36,肺癌风险率 \(0.027+0.00025(t-40)^2\));变量变换:\(\log X\)、\(e^X\)、\(A\sin\theta\)(弹道)、对数正态的 \(cY\) 与 \(c+Y\)(5.37–5.42)。

理论习题 5.1–5.33: Maxwell 分子速度密度归一化;一般随机变量 \(E[Y]=\int_0^\infty P\{Y>y\}dy-\int_0^\infty P\{Y<-y\}dy\) 及一般 LOTUS 证明;\(E[X^n]=\int_0^\infty nx^{n-1}P\{X>x\}dx\)(5.5);不可数个概率 1 事件的交可为概率 0(5.6);\(\mathrm{SD}(aX+b)=|a|\sigma\);取值于 \([0,c]\) 的变量方差 \(\le c^2/4\)(5.8);正态对称性、拐点 \(\mu\pm\sigma\);Stein 恒等式 \(E[g'(Z)]=E[Zg(Z)]\) 及 \(E[Z^{n+1}]=nE[Z^{n-1}]\)、\(E[Z^4]=3\)(5.11);中位数、众数;指数缩放 \(cX\sim\) Exp(\(\lambda/c\));均匀/伽马/Weibull 的风险率单调性(伽马 \(\alpha\ge1\) 递增,Weibull \(\beta\ge1\) 递增);\(E[X^k]=k!/\lambda^k\);\(\Gamma(1/2)=\sqrt\pi\);Weibull 概率图:\(\log\log(1/(1-F))\) 对 \(\log x\) 为斜率 \(\beta\) 的直线、约 63.2% 观测小于 \(\alpha\);Weibull 与指数互变换;贝塔众数 \((a-1)/(a+b-2)\);概率积分变换(probability integral transform):\(Y=F(X)\sim U(0,1)\)(5.29);对数正态密度;两随机整数互素概率 \(6/\pi^2\)(Legendre 定理,5.32)。

自测题 5.1–5.22: 三角形密度的分段面积;密封投标最优报价(5.6,竞争者最低价 \(U(70,140)\));IQ、通勤迟到、轮胎寿命正态计算;收入分组的正态近似;指数服务时间;\(F(x)=1-e^{-x^2}\) 的风险率与矩;分段风险率的洗衣机寿命;\(1/X\) 仍为标准柯西(5.16);轮盘押单号长期盈利概率(5.17);指数混合的剩余寿命(5.18,混合后不再无记忆,存活越久越可能是低失效率类型);指数证据下的判决阈值;\(E[(Z-c)^+]=\frac{1}{\sqrt{2\pi}}e^{-c^2/2}-c(1-\Phi(c))\) 及一般正态版本(5.20,即看涨期权型损失函数);\(\Phi(-x)=1-\Phi(x)\) 辨析;均匀变换、\(\min(U,1-U)\sim U(0,1/2)\)。

第 5 章 本章要点

  1. 连续变量由密度描述,单点概率为 0,\(F'=f\),\(f(a)\varepsilon\approx P\{X\in a\pm\varepsilon/2\}\)。
  2. 期望 \(\int xf\),LOTUS \(\int g(x)f(x)dx\),非负变量尾积分公式 \(E[Y]=\int_0^\infty P\{Y>y\}dy\)。
  3. 非对称线性损失下最优决策为分位数(出发时间 \(F(t^*)=k/(k+c)\)、连续报童 \(F(s^*)=b/(b+\ell)\))。
  4. 均匀、正态、指数、伽马、Weibull、柯西、贝塔的密度、均值、方差与产生背景。
  5. 正态:线性变换封闭、标准化、\(\Phi\) 查表与对称性、68–95–99.7 规则;DeMoivre–Laplace 定理与连续性修正,\(np(1-p)\ge10\) 时近似良好。
  6. 指数:唯一无记忆、常数风险率,是泊松过程的等待时间;\(n\) 个等待时间之和为 Gamma(\(n,\lambda\))(Erlang)。
  7. 风险率 \(\lambda(t)=f/\bar F\) 唯一确定分布:\(\bar F(t)=\exp\{-\int_0^t\lambda\}\);风险率加倍意味着生存概率平方。
  8. 单调变换密度公式 \(f_Y(y)=f_X(g^{-1}(y))|dg^{-1}/dy|\);对数正态是股价比的标准模型。

第 5 章 与量化交易的关联

  • 风险度量: 例 4f 直接给出正态假设下 VaR \(=2.33\sigma-\mu\)(99%),是参数法 VaR 的原型;例 5e 与 Laplace 分布、柯西分布提醒厚尾会显著放大尾部概率,正态 VaR 会低估风险。
  • 资产价格模型: 例 7e 的对数正态价格比(\(S_n=S_{n-1}e^X\))是几何布朗运动与 Black–Scholes 的基础;习题 5.29 的二叉树模型(\(u,d,p\))在期数大时用正态近似,对应 CRR 二叉树向连续模型的收敛;自测 5.20 的 \(E[(X-c)^+]\) 就是正态标的看涨期权(Bachelier 模型)的期望收益,是期权定价公式的核心积分。
  • 信用风险与生存分析: 风险率函数即违约强度(hazard rate);\(\bar F(t)=\exp\{-\int\lambda\}\) 是约化型信用模型中生存概率的公式;指数/Weibull/伽马用于违约时间、订单存活时间(限价单被成交或撤单前的存续时间)建模。
  • 执行与微观结构: 指数分布刻画泊松到达的订单间隔;Erlang 分布刻画累计 \(n\) 笔成交所需时间。
  • 统计检验与回测: 正态近似二项可用于检验胜率是否显著高于 50%(例 4i 的第一类错误思路)、计算所需样本量(例 4j:优势 2% 需约 1700 个样本才有 95% 把握),这对评估微弱 alpha 的统计显著性非常关键。
  • 概率积分变换(理论习题 5.29) 是逆变换法生成随机数、Copula 建模与 PIT 检验(检验预测分布校准)的基础,蒙特卡洛模拟中常用。
  • 贝塔分布 可作为胜率、回收率(recovery rate)等 [0,1] 变量的先验/模型。
  • 中位数最小化绝对偏差(习题 5.31)对应稳健估计与分位数回归。

第 5 章 推荐习题

  • 5.9(连续报童临界分位数)、5.31(\(E|X-a|\) 最小于中位数)——最优化与分位数。
  • 5.17–5.19(由分位数反推正态参数)——实际校准正态模型。
  • 5.26、5.27(硬币是否有偏)——假设检验两类错误,可类比策略胜率检验。
  • 5.29(二叉树股价正态近似)——直接的金融应用。
  • 5.35、5.36(由风险率求生存概率)——信用强度模型雏形。
  • 理论 5.5(\(E[X^n]\) 的尾积分)、5.8(有界变量方差上界)、5.11(Stein 恒等式)、5.29(概率积分变换)。
  • 自测 5.18(指数混合的剩余寿命)、5.20(\(E[(Z-c)^+]\),期权收益积分)。

第 6 章 联合分布随机变量(Jointly Distributed Random Variables)(PDF p.233–292,本块至 p.292,续见下一块)

章节目录:6.1 联合分布函数;6.2 独立随机变量;6.3 独立随机变量之和;6.4 条件分布:离散情形;6.5 条件分布:连续情形;6.6 次序统计量;6.7 随机变量函数的联合分布;6.8 可交换随机变量。

6.1 联合分布函数(Joint Distribution Functions)(PDF p.233–241)

联合累积分布函数(joint CDF): \(F(a,b)=P\{X\le a,Y\le b\}\)。边缘分布(marginal distributions):由概率连续性 \(F_X(a)=\lim_{b\to\infty}F(a,b)=F(a,\infty)\),\(F_Y(b)=F(\infty,b)\)。 所有联合概率原则上可由 \(F\) 求出,如

\[P\{X>a,Y>b\}=1-F_X(a)-F_Y(b)+F(a,b)\tag{1.1}\]
(取补集+容斥),更一般地矩形概率
\[P\{a_1<X\le a_2,b_1<Y\le b_2\}=F(a_2,b_2)+F(a_1,b_1)-F(a_1,b_2)-F(a_2,b_1)\tag{1.2}\]
离散:联合 PMF \(p(x,y)=P\{X=x,Y=y\}\),边缘 \(p_X(x)=\sum_yp(x,y)\),\(p_Y(y)=\sum_xp(x,y)\)。 例 1a: 从 3 红 4 白 5 蓝中取 3 球,\(X\)=红球数、\(Y\)=白球数,\(p(i,j)=\binom3i\binom4j\binom5{3-i-j}/\binom{12}3\)。表 6.1(分母 220):

  • \(i=0\): 10, 40, 30, 4(行和 84);\(i=1\): 30, 60, 18, 0(108);\(i=2\): 15, 12, 0, 0(27);\(i=3\): 1, 0, 0, 0(1);
  • 列和 \(P\{Y=j\}\): 56, 112, 48, 4。 行和给出 \(X\) 的 PMF、列和给出 \(Y\) 的 PMF,写在表的边缘,因而称边缘 PMF。 例 1b: 家庭有 0/1/2/3 个孩子的概率 0.15/0.20/0.35/0.30,男女各 1/2 独立。男孩数 \(B\)、女孩数 \(G\) 的联合 PMF(表 6.2),如 \(P\{B=0,G=0\}=0.15\),\(P\{B=0,G=1\}=0.20\times\frac12=0.10\),\(P\{B=0,G=2\}=0.35\times\frac14=0.0875\),\(P\{B=1,G=1\}=0.175\) 等;边缘 \(P\{B=i\}\): 0.375, 0.3875, 0.2, 0.0375(与 \(G\) 相同)。

联合连续: 存在 \(f(x,y)\) 使对平面中任意集合 \(C\),\(P\{(X,Y)\in C\}=\iint_Cf(x,y)dxdy\) (1.3),\(f\) 为联合概率密度(joint PDF)。\(P\{X\in A,Y\in B\}=\int_B\int_Af\,dxdy\) (1.4);\(f(a,b)=\frac{\partial^2}{\partial a\partial b}F(a,b)\);\(P\{a<X<a+da,b<Y<b+db\}\approx f(a,b)dadb\)。边缘密度 \(f_X(x)=\int f(x,y)dy\),\(f_Y(y)=\int f(x,y)dx\)。

例 1c: \(f(x,y)=2e^{-x}e^{-2y}\)(\(x,y>0\)):(a) \(P\{X>1,Y<1\}=e^{-1}(1-e^{-2})\);(b) \(P\{X<Y\}=\int_0^\infty2e^{-2y}(1-e^{-y})dy=1-2/3=1/3\);(c) \(P\{X<a\}=1-e^{-a}\)。 例 1d(圆内均匀点): 半径 \(R\) 圆内均匀,\(f=c\),\(c=1/(\pi R^2)\);边缘 \(f_X(x)=\frac{2}{\pi R^2}\sqrt{R^2-x^2}\)(\(|x|\le R\)),\(Y\) 同;到原点距离 \(D\):\(F_D(a)=a^2/R^2\),\(f_D(a)=2a/R^2\),\(E[D]=2R/3\)。(注:\(X,Y\) 边缘不是均匀的。) 例 1e(比值的分布): \(f(x,y)=e^{-(x+y)}\),\(F_{X/Y}(a)=\int_0^\infty(1-e^{-ay})e^{-y}dy=1-\frac1{a+1}\),\(f_{X/Y}(a)=1/(a+1)^2\)(\(a>0\))。 \(n\) 维推广: \(F(a_1,\dots,a_n)=P\{X_1\le a_1,\dots,X_n\le a_n\}\);联合密度对 \(n\) 维集合积分。

例 1f(多项分布 multinomial distribution): \(n\) 次独立同分布试验,每次结果为 \(r\) 类之一,概率 \(p_1,\dots,p_r\),\(X_i\)=第 \(i\) 类出现次数:

\[P\{X_1=n_1,\dots,X_r=n_r\}=\frac{n!}{n_1!\cdots n_r!}p_1^{n_1}\cdots p_r^{n_r},\quad\sum n_i=n\tag{1.5}\]
(每个特定序列概率 \(\prod p_i^{n_i}\),序列数为多项式系数。)\(r=2\) 即二项。任意一组类别 \(N\) 的计数和 \(\sum_{i\in N}X_i\sim\mathrm{Bin}(n,\sum_{i\in N}p_i)\)。例:公平骰子掷 9 次,1 出现 3 次、2 和 3 各 2 次、4 和 5 各 1 次、6 不出现:\(\frac{9!}{3!2!2!}(1/6)^9\)。

6.2 独立随机变量(Independent Random Variables)(PDF p.241–252)

定义: 对任意实数集 \(A,B\),\(P\{X\in A,Y\in B\}=P\{X\in A\}P\{Y\in B\}\) (2.1)。等价于 \(F(a,b)=F_X(a)F_Y(b)\) 对一切 \(a,b\);离散时等价于 \(p(x,y)=p_X(x)p_Y(y)\) (2.2)(证明:一点集推出 (2.2);反之对 \(A\times B\) 求和可分解);连续时等价于 \(f(x,y)=f_X(x)f_Y(y)\)。不独立称为相依(dependent)。直观:知道一个的值不改变另一个的分布。

例 2a: \(n+m\) 次独立试验,前 \(n\) 次成功数 \(X\) 与后 \(m\) 次成功数 \(Y\) 独立;但 \(X\) 与总成功数 \(Z\) 相依。 例 2b(泊松分拆 / 稀疏化): 到达邮局人数 ~ Poisson(\(\lambda\)),每人独立以 \(p\) 为男性。对 \(X+Y\) 条件化:

\[P\{X=i,Y=j\}=\binom{i+j}{i}p^i(1-p)^je^{-\lambda}\frac{\lambda^{i+j}}{(i+j)!}=e^{-\lambda p}\frac{(\lambda p)^i}{i!}\cdot e^{-\lambda(1-p)}\frac{[\lambda(1-p)]^j}{j!}\]
故男女人数是相互独立的 Poisson(\(\lambda p\)) 与 Poisson(\(\lambda(1-p)\))。(反直觉:总数随机时两类计数反而独立;若总数固定则必然负相关。) 例 2c(约会): 两人独立 \(U(0,60)\) 分钟到达,先到者等待超过 10 分钟的概率 \(2P\{X+10<Y\}=\frac{2}{60^2}\int_{10}^{60}(y-10)dy=25/36\)。 例 2d(Buffon 投针问题,最古老的几何概率问题): 平行线间距 \(D\),针长 \(L\le D\)。\(X\)=针中点到最近线距离 \(\sim U(0,D/2)\),\(\theta\)=针与垂线夹角 \(\sim U(0,\pi/2)\),独立。相交 ⇔ \(X<\frac L2\cos\theta\):
\[P=\frac{4}{\pi D}\int_0^{\pi/2}\frac L2\cos y\,dy=\frac{2L}{\pi D}\]
(可用来蒙特卡洛估计 \(\pi\)。) 例 2e(正态分布的刻画):* 射击脱靶的水平、垂直偏差 \(X,Y\) 满足:(1) 独立且密度可微;(2) 联合密度只依赖 \(x^2+y^2\)(旋转不变)。则 \(f_X(x)f_Y(y)=g(x^2+y^2)\) (2.9),对 \(x\) 求导除以原式得 \(\frac{f_X'(x)}{2xf_X(x)}=\frac{g'(x^2+y^2)}{g(x^2+y^2)}\) (2.11),左边只依赖 \(x\)、右边只依赖 \(x^2+y^2\),故为常数 \(c\):\(\frac{d}{dx}\log f_X=cx\),\(f_X=ke^{cx^2/2}\);可积性要求 \(c<0\),记 \(c=-1/\sigma^2\)。所以 \(X,Y\) 为同方差的独立零均值正态。(独立+旋转不变 ⇒ 正态,Herschel–Maxwell 刻画。)

命题 2.1(因子分解判据): 连续(离散)\(X,Y\) 独立 ⇔ 联合密度(PMF)可写成 \(f(x,y)=h(x)g(y)\)(对所有 \(x,y\))。证明:\(1=C_1C_2\),\(C_1=\int h\),\(C_2=\int g\);\(f_X=C_2h\),\(f_Y=C_1g\),故 \(f=f_Xf_Y\)。 例 2f: \(f=6e^{-2x}e^{-3y}\)(\(x,y>0\))可分解,独立(分别为速率 2、3 的指数)。\(f=24xy\)(\(0<x,y<1\),\(x+y<1\))不独立:支撑集不是乘积形,\(f=24xyI(x,y)\) 无法分解。误区: 只看函数形式而忽略支撑集。

\(n\) 个变量独立: 对所有 \(A_i\),\(P\{X_i\in A_i,\forall i\}=\prod P\{X_i\in A_i\}\),等价于 CDF 乘积形式;无穷族独立指任意有限子族独立。 例 2g(计算机如何随机选子集,算法): 要从 \(\{1..n\}\) 等可能选 \(k\) 元子集。生成独立 \(U_1,\dots,U_n\sim U(0,1)\),令

\[I_1=1\iff U_1<\frac kn;\qquad I_{i+1}=1\iff U_{i+1}<\frac{k-(I_1+\cdots+I_i)}{n-i}\]
即每步以“剩余名额/剩余候选数”的概率选入。对 \(k+n\) 归纳证明每个 \(k\) 子集概率为 \(1/\binom nk\):若 \(i_1=1\),概率 \(\frac kn\cdot1/\binom{n-1}{k-1}=1/\binom nk\);若 \(i_1\ne1\),概率 \((1-\frac kn)\cdot1/\binom{n-1}{k}=1/\binom nk\)。附注: 此法内存需求极低(顺序抽样/选择抽样);10.1 节给出更快但更费内存的算法(取随机排列的后 \(k\) 个)。复杂度 \(O(n)\)。 例 2h: \(X,Y,Z\) 独立 \(U(0,1)\),\(P\{X\ge YZ\}=\int_0^1\int_0^1(1-yz)dydz=\int_0^1(1-z/2)dz=3/4\)。 例 2i(半衰期的概率解释): 确定性定律 \(N(t)=2^{-t/h}N(0)\);衰变比例与起始数量和时间位置无关,暗示各核独立且寿命无记忆 → 寿命为指数分布,中位数为 \(h\):\(P\{L<t\}=1-2^{-t/h}=1-\exp(-t\log2/h)\)。于是 \(N(t)\sim\mathrm{Bin}(N(0),2^{-t/h})\)。质子衰变: 理论半衰期 \(h=10^{30}\) 年,跟踪 \(N(0)=10^{30}\) 个质子 \(c\) 年,确定性模型预测衰变数 \(h(1-2^{-c/h})\approx c\log2\approx0.6931c\)(洛必达法则),2 年约 1.3863 个。概率模型:衰变数近似 Poisson(\(c\log2\)),\(P\{0\text{ 次衰变}\}=e^{-c\log2}=2^{-c}\),2 年内无衰变的概率 1/4,\(P\{n\}=2^{-c}(c\log2)^n/n!\)。因此观测到 0 次衰变并不能否定假设——均值预测与分布预测的差别。 附注(独立性对称): 判断 \(X\) 是否独立于 \(Y\) 不直观时,可反过来问 \(Y\) 是否独立于 \(X\)。 例 2j: (1) 掷骰子(craps)首掷为 4 后,反复掷直到 4 或 7:所需次数 \(N\) 与终值 \(X\) 独立——反问“知道用了 \(n\) 次是否影响终值是 4 的概率”,显然不影响。(2) 记录值(record value):i.i.d. 连续序列中 \(X_n\) 大于之前所有值称记录,\(A_n\)=第 \(n\) 个是记录。\(A_n\) 与 \(A_{n+1}\) 独立:知道 \(X_{n+1}\) 比前 \(n\) 个都大,不影响 \(X_n\) 在前 \(n\) 个中的相对排名,\(P(A_n|A_{n+1})=P(A_n)=1/n\)。 附注(逐步建立独立性): 由链式法则,只需依次证明 \(X_2\) 独立于 \(X_1\),\(X_3\) 独立于 \((X_1,X_2)\),…,\(X_n\) 独立于 \((X_1,\dots,X_{n-1})\)。

6.3 独立随机变量之和(Sums of Independent Random Variables)(PDF p.252–260)

\(X,Y\) 独立连续:

\[F_{X+Y}(a)=\int_{-\infty}^\infty F_X(a-y)f_Y(y)dy\tag{3.1}\]
称为 \(F_X\) 与 \(F_Y\) 的卷积(convolution);求导得密度卷积
\[f_{X+Y}(a)=\int_{-\infty}^\infty f_X(a-y)f_Y(y)dy\tag{3.2}\]

6.3.1 同分布均匀变量之和

例 3a: \(X,Y\sim U(0,1)\) 独立:\(f_{X+Y}(a)=a\)(\(0\le a\le1\)),\(2-a\)(\(1<a<2\)),称三角分布(triangular distribution)(图 6.3)。 \(n\) 个均匀之和: \(F_n(x)=P\{X_1+\cdots+X_n\le x\}=x^n/n!\)(\(0\le x\le1\)),归纳:\(F_n(x)=\int_0^xF_{n-1}(x-y)dy=\frac{1}{(n-1)!}\int_0^x(x-y)^{n-1}dy\)。 应用: \(N=\min\{n:X_1+\cdots+X_n>1\}\),\(P\{N>n\}=F_n(1)=1/n!\),\(P\{N=n\}=\frac1{(n-1)!}-\frac1{n!}=\frac{n-1}{n!}\),

\[E[N]=\sum_{n\ge2}\frac{1}{(n-2)!}=e\]
即平均需要 \(e\) 个均匀随机数之和才超过 1(可用于模拟估计 \(e\))。

6.3.2 伽马随机变量

命题 3.1: \(X\sim\) Gamma(\(s,\lambda\)),\(Y\sim\) Gamma(\(t,\lambda\)) 独立,则 \(X+Y\sim\) Gamma(\(s+t,\lambda\))(同 \(\lambda\) 下卷积封闭)。证明:卷积积分代换 \(x=y/a\),得 \(f_{X+Y}(a)=Ce^{-\lambda a}a^{s+t-1}\),常数由归一化确定。归纳:\(\sum X_i\sim\) Gamma(\(\sum t_i,\lambda\))。 例 3b: \(n\) 个独立 Exp(\(\lambda\)) 之和 ~ Gamma(\(n,\lambda\))(Exp = Gamma(1,λ))。 卡方分布: \(Z_i\) 独立标准正态,\(Y=\sum_{i=1}^nZ_i^2\) 称自由度 \(n\) 的**卡方(chi-squared)**分布。\(n=1\) 时由第 5 章例 7b:\(f_{Z^2}(y)=\frac{1}{2\sqrt y}\frac{2}{\sqrt{2\pi}}e^{-y/2}=\frac{\frac12e^{-y/2}(y/2)^{-1/2}}{\sqrt\pi}\),即 Gamma(1/2, 1/2),副产品 \(\Gamma(1/2)=\sqrt\pi\)。由命题 3.1,\(\chi^2_n=\) Gamma(\(n/2,1/2\)):

\[f_Y(y)=\frac{e^{-y/2}y^{n/2-1}}{2^{n/2}\Gamma(n/2)},\quad y>0\]
\(n\) 偶数时 \(\Gamma(n/2)=(n/2-1)!\);奇数时用递推与 \(\Gamma(1/2)=\sqrt\pi\),如 \(\Gamma(5/2)=\frac34\sqrt\pi\)。应用:\(n\) 维射击误差平方;统计分析中极其重要。

6.3.3 正态随机变量

命题 3.2: \(X_i\sim N(\mu_i,\sigma_i^2)\) 独立,则 \(\sum X_i\sim N(\sum\mu_i,\sum\sigma_i^2)\)。 证明:先设 \(X\sim N(0,\sigma^2)\)、\(Y\sim N(0,1)\),令 \(c=\frac{1+\sigma^2}{2\sigma^2}\),对卷积被积函数配方:\(f_X(a-y)f_Y(y)=\frac{1}{2\pi\sigma}e^{-a^2/2\sigma^2}\exp\{-c(y^2-2y\frac{a}{1+\sigma^2})\}\),积分后 \(f_{X+Y}(a)=C\exp\{-a^2/2(1+\sigma^2)\}\),即 \(N(0,1+\sigma^2)\)。一般两变量:\(X_1+X_2=\sigma_2[\frac{X_1-\mu_1}{\sigma_2}+\frac{X_2-\mu_2}{\sigma_2}]+\mu_1+\mu_2\),化为前述情形得方差 \(\sigma_2^2(1+\sigma_1^2/\sigma_2^2)=\sigma_1^2+\sigma_2^2\)。再对 \(n\) 归纳。 例 3c(篮球赛季): 44 场,26 场对 A 类(胜率 0.4)、18 场对 B 类(胜率 0.7),独立。\(E[X_A]=10.4\),\(\mathrm{Var}=6.24\);\(E[X_B]=12.6\),\(\mathrm{Var}=3.78\)。正态近似+命题 3.2:\(X_A+X_B\approx N(23,10.02)\),\(P\{\ge25\}=P\{\ge24.5\}\approx1-\Phi(0.4739)\approx0.3178\);\(X_A-X_B\approx N(-2.2,10.02)\),\(P\{X_A-X_B\ge1\}=P\{\ge0.5\}\approx1-\Phi(0.8530)\approx0.1968\)。(差的方差也是方差之和。) 对数正态: \(\log Y\sim N(\mu,\sigma^2)\)。 例 3d(周价格模型): 周价格比 \(S(n)/S(n-1)\) i.i.d. 对数正态,\(\mu=0.0165\),\(\sigma=0.0730\)。(a) 一周上涨概率 \(P\{Z>-0.0165/0.0730\}=P\{Z<0.2260\}=0.5894\),连续两周都涨 \(0.5894^2=0.3474\)。(b) 两周后高于今天:两周对数收益之和 \(\sim N(0.0330,2(0.0730)^2)\),\(P\{Z<0.0330/(0.0730\sqrt2)=0.31965\}=0.6254\)。(对数收益可加是对数正态模型的关键便利。)

6.3.4 泊松与二项随机变量

例 3e: 独立 Poisson(\(\lambda_1\))、Poisson(\(\lambda_2\)) 之和:\(P\{X+Y=n\}=\sum_k e^{-\lambda_1}\frac{\lambda_1^k}{k!}e^{-\lambda_2}\frac{\lambda_2^{n-k}}{(n-k)!}=e^{-(\lambda_1+\lambda_2)}\frac{(\lambda_1+\lambda_2)^n}{n!}\)(二项式定理),即 Poisson(\(\lambda_1+\lambda_2\))。 例 3f: 独立 \(\mathrm{Bin}(n,p)\)、\(\mathrm{Bin}(m,p)\) 之和为 \(\mathrm{Bin}(n+m,p)\)——由试验解释直接得到;解析验证用范德蒙恒等式 \(\binom{n+m}{k}=\sum_i\binom ni\binom m{k-i}\)。(注意 \(p\) 必须相同。)

6.4 条件分布:离散情形(Conditional Distributions: Discrete Case)(PDF p.261–263)

条件 PMF: \(p_Y(y)>0\) 时

\[p_{X|Y}(x|y)=P\{X=x|Y=y\}=\frac{p(x,y)}{p_Y(y)}\]
条件 CDF \(F_{X|Y}(x|y)=\sum_{a\le x}p_{X|Y}(a|y)\)。定义与无条件情形相同,只是一切都以 \(Y=y\) 为条件。若 \(X\) 与 \(Y\) 独立,条件分布等于无条件分布。 例 4a: \(p(0,0)=0.4,p(0,1)=0.2,p(1,0)=0.1,p(1,1)=0.3\)。\(p_Y(1)=0.5\),\(p_{X|Y}(0|1)=2/5\),\(p_{X|Y}(1|1)=3/5\)。 例 4b: 独立 Poisson(\(\lambda_1\))、Poisson(\(\lambda_2\)),给定 \(X+Y=n\) 时
\[P\{X=k|X+Y=n\}=\binom nk\Big(\frac{\lambda_1}{\lambda_1+\lambda_2}\Big)^k\Big(\frac{\lambda_2}{\lambda_1+\lambda_2}\Big)^{n-k}\]
即 \(\mathrm{Bin}(n,\lambda_1/(\lambda_1+\lambda_2))\)(与例 2b 的分拆互为逆命题)。 例 4c(多项分布的条件分布): 多项分布 \((n;p_1,\dots,p_k)\),已知结果 \(r+1,\dots,k\) 分别出现 \(n_{r+1},\dots,n_k\) 次(合计 \(m\)),则 \((X_1,\dots,X_r)\) 的条件分布是 \(n-m\) 次试验、概率 \(p_i/F_r\)(\(F_r=\sum_{i\le r}p_i\))的多项分布:
\[P\{X_1=n_1,\dots,X_r=n_r\mid X_{r+1}=n_{r+1},\dots\}=\frac{(n-m)!}{n_1!\cdots n_r!}\prod_{i=1}^r\Big(\frac{p_i}{F_r}\Big)^{n_i}\]
(分母把结果 \(1..r\) 合并为概率 \(F_r\) 的单一结果。) 例 4d: \(n\) 次独立试验共 \(k\) 次成功时,每种成功/失败排列的条件概率都是 \(p^k(1-p)^{n-k}/[\binom nkp^k(1-p)^{n-k}]=1/\binom nk\),与 \(p\) 无关(成功数是充分统计量的直观)。

6.5 条件分布:连续情形(Conditional Distributions: Continuous Case)(PDF p.263–269)

条件密度: \(f_Y(y)>0\) 时 \(f_{X|Y}(x|y)=\dfrac{f(x,y)}{f_Y(y)}\)。动机:\(f_{X|Y}(x|y)dx=\frac{f(x,y)dxdy}{f_Y(y)dy}\approx P\{x\le X\le x+dx\mid y\le Y\le y+dy\}\)。于是 \(P\{X\in A|Y=y\}=\int_Af_{X|Y}(x|y)dx\),条件 CDF \(F_{X|Y}(a|y)=\int_{-\infty}^af_{X|Y}(x|y)dx\)——即使条件事件 \(\{Y=y\}\) 概率为 0 也能给出可操作的条件概率。独立时 \(f_{X|Y}=f_X\)。

例 5a: \(f(x,y)=\frac{12}5x(2-x-y)\)(单位正方形),\(f_{X|Y}(x|y)=\frac{x(2-x-y)}{\int_0^1x(2-x-y)dx}=\frac{x(2-x-y)}{2/3-y/2}=\frac{6x(2-x-y)}{4-3y}\)。 例 5b: \(f(x,y)=e^{-x/y}e^{-y}/y\)(\(x,y>0\)),\(f_{X|Y}(x|y)=\frac1ye^{-x/y}\)(给定 \(Y=y\) 时 \(X\) 为均值 \(y\) 的指数),\(P\{X>1|Y=y\}=e^{-1/y}\)。 例 5c(t 分布 t-distribution): \(Z\sim N(0,1)\) 与 \(Y\sim\chi^2_n\) 独立,\(T=Z/\sqrt{Y/n}\) 称自由度 \(n\) 的 t 分布(7.8 节用于统计推断)。求密度:给定 \(Y=y\),\(T=\sqrt{n/y}Z\sim N(0,n/y)\),\(f_{T|Y}(t|y)=\frac{1}{\sqrt{2\pi n/y}}e^{-t^2y/2n}\);乘以卡方密度得联合密度,令 \(c=\frac{t^2+n}{2n}\),对 \(y\) 积分(代换 \(x=cy\) 化为伽马积分):

\[f_T(t)=\frac{\Gamma(\frac{n+1}2)}{\sqrt{\pi n}\,\Gamma(\frac n2)}\Big(1+\frac{t^2}n\Big)^{-(n+1)/2},\quad-\infty<t<\infty\]
(多项式尾,厚于正态;\(n\to\infty\) 趋于正态,\(n=1\) 为柯西。) 例 5d(二元正态分布 bivariate normal): 参数 \(\mu_x,\mu_y,\sigma_x,\sigma_y>0,-1<\rho<1\):
\[f(x,y)=\frac{1}{2\pi\sigma_x\sigma_y\sqrt{1-\rho^2}}\exp\Big\{-\frac{1}{2(1-\rho^2)}\Big[\Big(\frac{x-\mu_x}{\sigma_x}\Big)^2+\Big(\frac{y-\mu_y}{\sigma_y}\Big)^2-2\rho\frac{(x-\mu_x)(y-\mu_y)}{\sigma_x\sigma_y}\Big]\Big\}\]

  • 条件分布:把与 \(x\) 无关的因子并入常数 \(C_i\),对 \(x\) 配方,得
    \[X\mid Y=y\ \sim\ N\Big(\mu_x+\rho\frac{\sigma_x}{\sigma_y}(y-\mu_y),\ \sigma_x^2(1-\rho^2)\Big)\]
    对称地 \(Y|X=x\sim N(\mu_y+\rho\frac{\sigma_y}{\sigma_x}(x-\mu_x),\sigma_y^2(1-\rho^2))\)。条件均值关于条件值线性(回归线),条件方差不依赖条件值且缩小为 \((1-\rho^2)\) 倍。
  • 二元正态 \(X,Y\) 独立 ⇔ \(\rho=0\)(只有此时密度可分解)。
  • 边缘:令 \(w=(y-\mu_y)/\sigma_y\),对 \(w\) 配方积分,得 \(X\sim N(\mu_x,\sigma_x^2)\),\(Y\sim N(\mu_y,\sigma_y^2)\)。(\(\rho\) 的含义为相关系数,第 7 章证明。)

混合型条件分布: \(X\) 连续(密度 \(f\))、\(N\) 离散时

\[f_{X|N}(x|n)=\frac{P\{N=n|X=x\}}{P\{N=n\}}f(x)\]
(连续版贝叶斯公式。) 例 5e(贝塔—二项共轭,贝叶斯更新): 成功概率 \(X\sim U(0,1)\) 未知,给定 \(X=x\) 时 \(n+m\) 次试验成功数 \(N\sim\mathrm{Bin}(n+m,x)\)。观测到 \(n\) 次成功后 \(f_{X|N}(x|n)=cx^n(1-x)^m\),即 Beta(\(n+1,m+1\))。先验 Beta(1,1)(均匀)→ 后验 Beta(\(1+n,1+m\))。这加深了对贝塔分布含义的理解(“伪计数”)。

6.6* 次序统计量(Order Statistics)(PDF p.269–272)

\(X_1,\dots,X_n\) i.i.d. 连续(密度 \(f\)、CDF \(F\)),排序后 \(X_{(1)}\le\cdots\le X_{(n)}\) 称次序统计量(\(X_{(1)}\) 最小,\(X_{(n)}\) 最大)。 联合密度: \((X_{(1)},\dots,X_{(n)})=(x_1,\dots,x_n)\) 当且仅当 \((X_1,\dots,X_n)\) 等于其 \(n!\) 个排列之一,每个排列密度为 \(\prod f(x_i)\):

\[f_{X_{(1)},\dots,X_{(n)}}(x_1,\dots,x_n)=n!\,f(x_1)\cdots f(x_n),\quad x_1<\cdots<x_n\tag{6.1}\]
例 6a: 1 英里路上随机分布 3 人(独立均匀),任意两人相距都 ≥ \(d\)(\(d\le1/2\))的概率:
\[3!\int_0^{1-2d}\int_{x_1+d}^{1-d}\int_{x_2+d}^1dx_3dx_2dx_1=(1-2d)^3\]
一般 \(n\) 人:\([1-(n-1)d]^n\)(\(d\le1/(n-1)\),留作习题)。 第 \(j\) 个次序统计量的密度: \(j-1\) 个小于 \(x\)、\(n-j\) 个大于 \(x\)、1 个等于 \(x\),分组方式有 \(\frac{n!}{(n-j)!(j-1)!}\) 种:
\[f_{X_{(j)}}(x)=\frac{n!}{(n-j)!(j-1)!}[F(x)]^{j-1}[1-F(x)]^{n-j}f(x)\tag{6.2}\]
例 6b(样本中位数 sample median): \(2n+1\) 个样本的第 \(n+1\) 小值。3 个 \(U(0,1)\) 样本中位数密度 \(6x(1-x)\),\(P\{1/4<X_{(2)}<3/4\}=6[x^2/2-x^3/3]_{1/4}^{3/4}=11/16\)。 CDF 两种求法: 对 (6.2) 积分 (6.3);或直接:\(X_{(j)}\le y\) ⇔ 至少 \(j\) 个 \(X_i\le y\),个数 \(\sim\mathrm{Bin}(n,F(y))\):
\[F_{X_{(j)}}(y)=\sum_{k=j}^n\binom nk[F(y)]^k[1-F(y)]^{n-k}\tag{6.4}\]
取 \(F\) 为均匀,得恒等式 \(\sum_{k=j}^n\binom nky^k(1-y)^{n-k}=\frac{n!}{(n-j)!(j-1)!}\int_0^yx^{j-1}(1-x)^{n-j}dx\) (6.5)(二项尾=不完全贝塔函数)。均匀样本的 \(X_{(j)}\sim\) Beta(\(j,n-j+1\))。 两个次序统计量的联合密度(\(i<j\),\(x_i<x_j\)):
\[f_{X_{(i)},X_{(j)}}(x_i,x_j)=\frac{n!}{(i-1)!(j-i-1)!(n-j)!}[F(x_i)]^{i-1}[F(x_j)-F(x_i)]^{j-i-1}[1-F(x_j)]^{n-j}f(x_i)f(x_j)\tag{6.6}\]
例 6c(样本极差 range): \(R=X_{(n)}-X_{(1)}\)。由 (6.6) 并代换 \(y=F(x_n)-F(x_1)\):
\[P\{R\le a\}=n\int_{-\infty}^\infty[F(x_1+a)-F(x_1)]^{n-1}f(x_1)dx_1\tag{6.7}\]
仅少数情形可显式计算。均匀 (0,1):\(P\{R<a\}=n(1-a)a^{n-1}+a^n\),\(f_R(a)=n(n-1)a^{n-2}(1-a)\),即 Beta(\(n-1,2\))。

6.7 随机变量函数的联合分布(Joint Probability Distribution of Functions of Random Variables)(PDF p.273–279)

\(Y_1=g_1(X_1,X_2)\),\(Y_2=g_2(X_1,X_2)\),条件:(1) 方程组可唯一反解 \(x_1=h_1(y_1,y_2),x_2=h_2(y_1,y_2)\);(2) \(g_1,g_2\) 有连续偏导,且雅可比行列式(Jacobian)

\[J(x_1,x_2)=\begin{vmatrix}\partial g_1/\partial x_1&\partial g_1/\partial x_2\\\partial g_2/\partial x_1&\partial g_2/\partial x_2\end{vmatrix}\ne0\]
则
\[f_{Y_1Y_2}(y_1,y_2)=f_{X_1,X_2}(x_1,x_2)\,|J(x_1,x_2)|^{-1},\quad x_i=h_i(y_1,y_2)\tag{7.1}\]
证明思路:对 \(P\{Y_1\le y_1,Y_2\le y_2\}=\iint_{g_1\le y_1,g_2\le y_2}f\) (7.2) 求偏导(高等微积分,书中不证)。

例 7a(和与差): \(Y_1=X_1+X_2\),\(Y_2=X_1-X_2\),\(J=-2\),\(f_{Y_1,Y_2}=\frac12f_{X_1,X_2}(\frac{y_1+y_2}2,\frac{y_1-y_2}2)\)。

  • 独立均匀:在 \(0\le y_1+y_2\le2,0\le y_1-y_2\le2\) 上密度 1/2;
  • 独立指数 \(\lambda_1,\lambda_2\):\(\frac{\lambda_1\lambda_2}2\exp\{-\lambda_1\frac{y_1+y_2}2-\lambda_2\frac{y_1-y_2}2\}\);
  • 独立标准正态:\(f=\frac1{4\pi}e^{-(y_1^2+y_2^2)/4}=\frac{1}{\sqrt{4\pi}}e^{-y_1^2/4}\cdot\frac{1}{\sqrt{4\pi}}e^{-y_2^2/4}\),故 \(X_1+X_2\) 与 \(X_1-X_2\) 都是 \(N(0,2)\) 且相互独立。(可证:i.i.d. 时 \(X_1+X_2\) 与 \(X_1-X_2\) 独立当且仅当分布为正态——Bernstein 定理。) 例 7b(极坐标与 Box–Muller 方法): \(X,Y\) 独立标准正态,\(R=\sqrt{X^2+Y^2}\),\(\Theta=\tan^{-1}(Y/X)\)。在第一象限 \(J=1/r\),条件密度 \(\frac2\pi re^{-r^2/2}\);四个象限平均得
    \[f(r,\theta)=\frac{1}{2\pi}re^{-r^2/2},\quad0<\theta<2\pi,\ r>0\]
    故 \(R\) 与 \(\Theta\) 独立,\(\Theta\sim U(0,2\pi)\),\(R\) 服从 Rayleigh 分布 \(f(r)=re^{-r^2/2}\)(平面射击误差的绝对值)。令 \(D=R^2\),\(J=2\),\(f(d,\theta)=\frac12e^{-d/2}\cdot\frac1{2\pi}\):\(R^2\sim\) Exp(1/2),验证了 \(\chi^2_2\) = Exp(1/2)。 Box–Muller 生成正态随机数(算法): \(U_1,U_2\) 独立 \(U(0,1)\);\(-2\log U_1\sim\) Exp(1/2)(因 \(P\{-2\log U_1<x\}=1-e^{-x/2}\)),\(2\pi U_2\sim U(0,2\pi)\);令
    \[X_1=\sqrt{-2\log U_1}\cos(2\pi U_2),\qquad X_2=\sqrt{-2\log U_1}\sin(2\pi U_2)\]
    则 \(X_1,X_2\) 为独立标准正态。 例 7c(伽马—贝塔关系): \(X\sim\) Gamma(\(\alpha,\lambda\))、\(Y\sim\) Gamma(\(\beta,\lambda\)) 独立,\(U=X+Y\),\(V=X/(X+Y)\)。\(J=-1/(x+y)\),反解 \(x=uv,y=u(1-v)\):
    \[f_{U,V}(u,v)=\frac{\lambda e^{-\lambda u}(\lambda u)^{\alpha+\beta-1}}{\Gamma(\alpha+\beta)}\cdot\frac{v^{\alpha-1}(1-v)^{\beta-1}\Gamma(\alpha+\beta)}{\Gamma(\alpha)\Gamma(\beta)}\]
    故 \(U\sim\) Gamma(\(\alpha+\beta,\lambda\)) 与 \(V\sim\) Beta(\(\alpha,\beta\)) 独立,并顺带证明 \(B(\alpha,\beta)=\Gamma(\alpha)\Gamma(\beta)/\Gamma(\alpha+\beta)\)。解释:\(n+m\) 件各需 Exp(\(\lambda\)) 时间的工作,工人 I 做 \(n\) 件、II 做 \(m\) 件,I 完成的工作量比例 ~ Beta(\(n,m\)),且与总耗时独立。 \(n\) 维推广: \(Y_i=g_i(X_1,\dots,X_n)\),雅可比行列式非零、可唯一反解时
    \[f_{Y_1,\dots,Y_n}(y_1,\dots,y_n)=f_{X_1,\dots,X_n}(x_1,\dots,x_n)|J(x_1,\dots,x_n)|^{-1}\tag{7.3}\]
    例 7d: \(X_1,X_2,X_3\) 独立标准正态,\(Y_1=X_1+X_2+X_3\),\(Y_2=X_1-X_2\),\(Y_3=X_1-X_3\),\(J=3\),反解 \(X_1=\frac{Y_1+Y_2+Y_3}3\),\(X_2=\frac{Y_1-2Y_2+Y_3}3\),\(X_3=\frac{Y_1+Y_2-2Y_3}3\),
    \[f_{Y}(y_1,y_2,y_3)=\frac{1}{3(2\pi)^{3/2}}e^{-Q/2},\quad Q=\frac{y_1^2}3+\frac23y_2^2+\frac23y_3^2-\frac23y_2y_3\]
    (\(Q\) 中无 \(y_1\) 与 \(y_2,y_3\) 的交叉项:样本和与样本偏差独立,是样本均值与样本方差独立的雏形。) 例 7e(指数部分和): \(X_i\) i.i.d. Exp(\(\lambda\)),\(Y_i=X_1+\cdots+X_i\)。雅可比为下三角全 1 矩阵,\(J=1\),
    \[f_{Y_1,\dots,Y_n}(y_1,\dots,y_n)=\lambda^ne^{-\lambda y_n},\quad0<y_1<\cdots<y_n\]
    (即泊松过程前 \(n\) 个到达时刻的联合密度。)逐个积掉 \(y_1,y_2,\dots\) 得 \(f_{Y_n}(y)=\lambda^n\frac{y^{n-1}}{(n-1)!}e^{-\lambda y}\),与例 3b 一致(Gamma(\(n,\lambda\)))。

6.8* 可交换随机变量(Exchangeable Random Variables)(PDF p.280–282)

定义: 对 \(1..n\) 的任意排列 \(i_1,\dots,i_n\),\(P\{X_{i_1}\le x_1,\dots,X_{i_n}\le x_n\}=P\{X_1\le x_1,\dots,X_n\le x_n\}\),即无论以何种顺序观察,联合分布相同。离散情形等价于联合 PMF \(p(x_1,\dots,x_n)\) 是对称函数。(i.i.d. 必可交换,反之不然。) 例 8a(不放回抽球): \(n\) 球中 \(k\) 个特殊,逐个不放回等可能抽取,\(X_i=1\) 若第 \(i\) 个是特殊球。以 \((1,1,0,1,0,\dots,0,1)\) 为例,\(p=\frac kn\cdot\frac{k-1}{n-1}\cdot\frac{n-k}{n-2}\cdot\frac{k-2}{n-3}\cdots\);一般地分母从 \(n\) 递减到 1,第 \(i\) 次出现 1 处分子为 \(k-(i-1)\),第 \(i\) 次出现 0 处分子为 \(n-k-(i-1)\),故

\[p(x_1,\dots,x_n)=\frac{k!(n-k)!}{n!},\quad x_i\in\{0,1\},\ \sum x_i=k\]
是对称函数,所以 \(X_1,\dots,X_n\) 可交换(虽然不独立)。 附注(另一推导): 把 \(n\) 个球都视为可区分,\(n!\) 种等可能顺序中,特殊球与普通球位置固定的顺序有 \(k!(n-k)!\) 种,得同一 PMF。 可交换 ⇒ 同分布: 如 \(P\{X=x\}=\sum_yP\{X=x,Y=y\}=\sum_yP\{X=y,Y=x\}=P\{Y=x\}\)。例 8a 中第 \(i\) 个抽出的是特殊球的概率为 \(k/n\)。 例 8b(间隔可交换): 例 8a 中 \(Y_1\)=第一个特殊球的抽取序号,\(Y_i\)=第 \(i-1\) 个特殊球后到第 \(i\) 个所需的额外抽取数(如 \(n=4,k=2\),\(X=(1,0,0,1)\) 时 \(Y_1=1,Y_2=3\))。\(P\{Y_1=i_1,\dots,Y_k=i_k\}=k!(n-k)!/n!\)(\(\sum i_j\le n\)),对称,故 \(Y_1,\dots,Y_k\) 可交换。推论:洗好的牌中翻到第一张 A 所需张数,与此后再翻到下一张 A 所需张数同分布。 例 8c(Pólya 罐模型 Polya's urn): 初始 \(n\) 红 \(m\) 蓝,每次抽一球、记颜色、连同一个同色球放回。\(X_i=1\) 若第 \(i\) 次为红。例:\(P\{1,1,0,1,0\}=\frac{n}{n+m}\frac{n+1}{n+m+1}\frac{m}{n+m+2}\frac{n+2}{n+m+3}\frac{m+1}{n+m+4}\),与 \(P\{0,1,0,1,1\}\) 相等。一般地含 \(r\) 个 1、\(k-r\) 个 0 的序列
\[P\{X_1=x_1,\dots,X_k=x_k\}=\frac{n(n+1)\cdots(n+r-1)\,m(m+1)\cdots(m+k-r-1)}{(n+m)(n+m+1)\cdots(n+m+k-1)}\]
只依赖 \(r\),故任意 \(k\) 下 \(X_1,\dots,X_k\) 可交换(但不独立,正相关)。推论:第 \(i\) 次抽到红球的概率恒为 \(n/(n+m)\)。直观:把 \(n+m\) 个球都标为不同“类型”、每次放回同类型球,由对称性第 \(i\) 次等可能为任一类型。 例 8d(均匀间距可交换): \(X_1..X_n\) i.i.d. \(U(0,1)\),\(Y_1=X_{(1)}\),\(Y_i=X_{(i)}-X_{(i-1)}\)。变换雅可比为 1,由 (6.1):
\[f_{Y_1,\dots,Y_n}(y_1,\dots,y_n)=n!,\quad y_i>0,\ \sum y_i<1\]
对称,故间距(spacings)\(Y_1,\dots,Y_n\) 可交换。

第 6 章小结(Summary)(PDF p.283)

复述:联合 CDF 及边缘 \(F_X(x)=\lim_{y\to\infty}F(x,y)\);联合 PMF/PDF 及边缘;\(f(x,y)dxdy\approx\) 小矩形概率;独立定义与因子分解判据;卷积公式 \(F_{X+Y}(a)=\int F_X(a-y)f_Y(y)dy\);独立正态之和为正态(均值、方差相加),独立泊松之和为泊松(参数相加);离散与连续条件分布;次序统计量联合密度 \(n!\prod f(x_i)\);可交换性定义。

第 6 章习题概述(PDF p.284–292,自测题可能延续至下一块)

Problems 6.1–6.61(PDF p.284–288): 由骰子/抽球构造联合 PMF(6.1–6.7,含有放回与不放回对比、几何间隔);给定联合密度求常数、边缘、期望、\(P\{X>Y\}\) 等(6.8–6.10、6.19–6.23);多项分布(6.11 电视店顾客);泊松分拆的条件概率(6.12);会面问题(6.13)、救护车距离(6.14);区域均匀分布、正方形内落入单位圆概率 \(\pi/4\)(6.15);\(n\) 点落在某半圆内的概率(6.16,答案 \(n/2^{n-1}\));直线上三点、中点两侧两点的距离(6.17–6.18);独立性判断(6.20、6.22–6.23、6.24 的 \(N\) 与 \(X\) 独立);\(10^6\) 人均匀到达的泊松近似(6.25);随机系数二次方程有实根概率(6.26);指数比值分布与 \(P\{X_1<X_2\}=\lambda_1/(\lambda_1+\lambda_2)\)(6.27);排队服务(6.28);正态和/差的应用:周销售、保龄球、早餐调查、月销售(6.29–6.32);泊松可加性(6.33–6.34);条件 PMF(6.35–6.40);条件密度与乘积分布(6.41–6.42);泊松—伽马共轭与保险事故率的贝叶斯更新(6.43,后验 Gamma,下年期望事故数);三个均匀中最大者大于其余之和(6.44);5 取 3 系统寿命——次序统计量(6.45);卡车间距 \((1-2d/L)^3\)(6.46);5 个均匀样本中位数(6.47);指数最小值与最大值(6.48);构造二元正态(6.50);极坐标、Box–Muller 直接验证(6.52–6.54);各种雅可比变换(6.55–6.59);可交换性证明(6.60–6.61)。

理论习题 6.1–6.35(PDF p.288–290): 验证矩形公式 (1.2);多类泊松分拆:各类计数为独立 Poisson(\(\lambda p_i\))(6.2);用 Buffon 投针估计 \(\pi\) 及长针情形(6.3–6.4);比值与乘积的密度(6.5);相依变量和的密度 \(\int f(x,t-x)dx\)(6.6);伽马缩放、\(\frac1{2\lambda}\chi^2_{2n}\sim\) Gamma(\(n,\lambda\))(6.7);独立变量最小值的风险率等于风险率之和(6.8),\(n\) 个指数最小值为 Exp(\(n\lambda\))(6.9);手电筒电池(6.10);\(P\{X_1<\cdots<X_5\}=1/5!\) 与分布无关(6.11);\(n\) 维因子分解判据(6.12);后验与成功的具体位置无关(6.13);独立几何给定和的条件分布为离散均匀(6.14);二项给定和的条件分布为超几何(6.16);二元泊松分布(6.17);由两个条件分布恢复联合分布(6.18);i.i.d. 比较的条件概率(6.19);泊松—伽马、指数—伽马共轭(6.21–6.22);随机矩阵存在鞍点的概率(6.23,博弈论);指数整数部分与小数部分独立(6.24);\(F^n\) 与 \(1-(1-F)^n\) 为 CDF(最大值、最小值,6.25);\(n\) 人间距问题(6.26);均匀样本中位数 ~ Beta(\(n+1,n+1\))(6.28);极差、间距 \(P\{X_{(k)}-X_{(k-1)}>t\}=(1-t)^n\)(6.30–6.31);新观测超过样本最大值的概率 \(1/(n+1)\) 等(6.32);中程数(midrange)分布(6.33–6.34);正态比值为柯西(6.35)。

自测题 6.1–6.21(PDF p.290–292): 不均匀骰子的多项分布(6.1);离散联合 PMF 的期望;三角区域密度;多项分布的分组合并仍为多项(6.4);共同冲击模型与二元指数分布(6.8,Marshall–Olkin:\(P\{X_1>s,X_2>t\}=e^{-\lambda_1s-\lambda_2t-\lambda_3\max(s,t)}\));接受—拒绝抽样选取等可能广告(6.9–6.10,按 \(n(X)/n\) 接受页面,迭代次数为几何分布);首个超过 \(c\) 的均匀变量的序号与其值独立(6.11);飞镖靶几何概率(6.12);NBA 分差正态模型(6.13:每节主队净胜分 \(N(1.5,6)\) 独立,求获胜概率及半场落后 5 分时的条件胜率);几何—伽马混合的后验(6.14);最高价拍卖的最优出价(6.16);随机向量为排列的概率(6.17);两个随机 0-1 排列的汉明距离(6.18);正态随机游走的条件分布:给定 \(S_n=x\) 时 \(S_k\sim N(xk/n,k(n-k)/n)\)(6.19,布朗桥离散版);记录值条件概率(6.20);\(P\{X\le s,Y\le t\}\) 恒等式(6.21)。(续见下一块:第 6 章若有剩余自测题,以及第 7 章。)

第 6 章 本章要点(本块范围内)

  1. 联合 CDF/PMF/PDF 与边缘分布;矩形概率公式 (1.2);多项分布及其合并、条件性质。
  2. 独立 ⇔ 联合分布(PMF/PDF)因子分解,注意支撑集必须是乘积形;独立性可逐步建立、可反向判断。
  3. 卷积公式;同 \(\lambda\) 伽马、正态、泊松、同 \(p\) 二项的可加性;\(\chi^2_n=\) Gamma(\(n/2,1/2\));\(n\) 个均匀和 ≤1 的概率 \(x^n/n!\),平均 \(e\) 个均匀数之和超 1。
  4. 泊松分拆:泊松总数按概率分类后各类独立泊松;反之给定总和的条件分布为二项。
  5. 条件分布:离散 \(p(x,y)/p_Y(y)\),连续 \(f(x,y)/f_Y(y)\);二元正态条件分布为正态,条件均值线性、条件方差 \(\sigma_x^2(1-\rho^2)\);\(\rho=0\) ⇔ 独立;t 分布的推导;贝塔—二项共轭。
  6. 次序统计量:联合密度 \(n!\prod f\);\(X_{(j)}\) 密度与 CDF(二项尾);两次序统计量联合密度;极差分布。
  7. 雅可比变换法 \(f_Y=f_X|J|^{-1}\);极坐标得 Rayleigh 与 Box–Muller;伽马和与比例独立(Gamma/Beta)。
  8. 可交换性:不放回抽样、Pólya 罐、均匀间距均可交换而不独立;可交换 ⇒ 边缘同分布。

第 6 章 与量化交易的关联

  • 组合与风险建模: 二元正态(例 5d)是资产收益联合建模的起点;条件分布 \(X|Y\sim N(\mu_x+\rho\frac{\sigma_x}{\sigma_y}(y-\mu_y),\sigma_x^2(1-\rho^2))\) 就是 beta 回归/对冲比率 \(\rho\sigma_x/\sigma_y\) 与残差风险 \((1-\rho^2)\sigma_x^2\) 的概率基础,用于最小方差对冲、配对交易和条件 VaR/压力情景(给定市场下跌 \(y\) 时个股的条件分布)。
  • 收益聚合: 独立正态之和为正态(命题 3.2)与例 3d 的对数正态周收益,支撑“对数收益按时间相加、波动率按 \(\sqrt T\) 缩放”的多期风险换算;例 3d 本身就是计算多周上涨概率的范例。
  • 蒙特卡洛模拟: Box–Muller(例 7b)用于生成正态随机数;例 2g 的顺序抽样算法可用于从股票池中无偏抽取随机子集(随机组合基准、bootstrap);接受—拒绝抽样(自测 6.9)是一般抽样方法的雏形。
  • 统计推断: t 分布(例 5c)与卡方分布是检验因子收益均值、IC 显著性(t 统计量)、方差检验的基础;例 7d 体现样本均值与偏差独立,对应 t 统计量构造的合理性。
  • 贝叶斯更新: 贝塔—二项(例 5e)可用于胜率的后验估计与收缩;泊松—伽马共轭(习题 6.43、理论 6.21)用于事件到达率(违约、成交、跳跃次数)的贝叶斯估计。
  • 订单流与事件建模: 泊松分拆(例 2b、理论 6.2)用于把总订单流拆成买/卖单或不同类型订单,各自仍为独立泊松;指数最小值与风险率相加(理论 6.8–6.9)用于竞争风险(多个违约原因、多个对手方中首个违约);共同冲击二元指数(自测 6.8)是相关违约建模(Marshall–Olkin copula)的原型。
  • 次序统计量: 用于极值与回撤分析(样本最大/最小收益)、分位数估计(经验 VaR 是次序统计量)、多重检验中“最好策略”的分布(选取最大夏普的偏差);极差分布可用于基于高低价的波动率估计思想。
  • 可交换性: 置换检验(permutation test)的前提;Pólya 罐描述“强者恒强”的路径依赖(可类比动量/羊群效应模型),但需谨慎类比。
  • Buffon 投针、多数几何概率与量化无直接关联,主要用于训练积分技巧。

第 6 章 推荐习题(本块范围内)

  • 6.16(\(n\) 点同在半圆)——巧妙的事件分解与互斥性。
  • 6.27(指数比值、\(P\{X_1<X_2\}\))——竞争到达的基本结论。
  • 6.29–6.32(正态和差应用)——多期收益聚合的直接练习。
  • 6.43(泊松—伽马贝叶斯)——强度参数的后验更新。
  • 6.45、6.47–6.48(次序统计量)——系统寿命、中位数、极值。
  • 6.54、6.56(雅可比与 Box–Muller)——变量变换与模拟。
  • 理论 6.2(多类泊松分拆)、6.8(最小值风险率可加)、6.16(二项条件为超几何)、6.21–6.22(共轭)、6.31–6.32(间距与新观测排名)。
  • 自测 6.8(Marshall–Olkin 二元指数)、6.9(接受—拒绝抽样)、6.13(分差正态模型的条件胜率)、6.19(正态随机游走的条件分布/布朗桥)。