元信息:Sheldon Ross《A First Course in Probability》(第 10 版,Pearson)|作者 Sheldon Ross|本笔记负责 PDF 第 125–292 页(第 4 章 随机变量、第 5 章 连续型随机变量、第 6 章 联合分布随机变量)
第 4 章 随机变量(Random Variables)(PDF p.125–188)
章节目录:4.1 随机变量;4.2 离散型随机变量;4.3 期望;4.4 随机变量函数的期望;4.5 方差;4.6 伯努利与二项随机变量;4.7 泊松随机变量;4.8 其他离散分布;4.9 随机变量和的期望;4.10 累积分布函数的性质。
4.1 随机变量(PDF p.125–129)
定义。 做实验时我们往往只关心结果的某个函数(如两颗骰子之和、抛硬币的正面总数),而不关心具体结果。定义在样本空间上的实值函数称为随机变量(random variable)。由于其取值由实验结果决定,可给其可能取值赋概率。
例 1a(三枚硬币)。 \(Y\)=正面数,\(P\{Y=0\}=1/8\),\(P\{Y=1\}=3/8\),\(P\{Y=2\}=3/8\),\(P\{Y=3\}=1/8\);因 \(Y\) 必取 0–3 之一,\(1=P(\bigcup_{i=0}^3\{Y=i\})=\sum_i P\{Y=i\}\)。
例 1b(寿险赔付)。 两位老年客户各有 10 万美元保单;年轻者一年内死亡事件 \(Y\) 概率 0.05,年长者 \(O\) 概率 0.10,相互独立。\(X\)=赔付总额(单位 10 万):\(P\{X=0\}=0.95\times0.9=0.855\),\(P\{X=1\}=0.05\times0.9+0.95\times0.1=0.140\),\(P\{X=2\}=0.005\)。
例 1c(最大编号球)。 从编号 1–20 的球中不放回取 4 个,\(X\)=最大编号,取值 4,…,20:
例 1d(截断几何)。 正面概率 \(p\) 的硬币反复抛,直到出现正面或已抛满 \(n\) 次。\(X\)=抛掷次数:\(P\{X=i\}=(1-p)^{i-1}p\)(\(i=1,\dots,n-1\)),\(P\{X=n\}=(1-p)^{n-1}\)(前 \(n-1\) 次都反面,第 \(n\) 次正反均停)。验证:\(\sum_{i=1}^{n-1}p(1-p)^{i-1}+(1-p)^{n-1}=1-(1-p)^{n-1}+(1-p)^{n-1}=1\)。
例 1e(集券问题 coupon collecting)。 \(N\) 种券,每次独立等可能得到任一种。\(T\)=集齐全部种类所需张数。思路:先求尾概率。令 \(A_j\)=前 \(n\) 张中没有第 \(j\) 种,则 \(\{T>n\}=\bigcup_j A_j\),用容斥原理(inclusion–exclusion),且 \(P(A_{j_1}\cdots A_{j_k})=((N-k)/N)^n\),得
累积分布函数(cumulative distribution function, CDF / distribution function): \(F(x)=P\{X\le x\}\),\(-\infty<x<\infty\)。若 \(a\le b\),\(\{X\le a\}\subset\{X\le b\}\),故 \(F\) 单调不减(更多性质见 4.10)。
4.2 离散型随机变量(Discrete Random Variables)(PDF p.129–132)
最多取可数个值的随机变量称为离散型。概率质量函数(probability mass function, PMF) \(p(a)=P\{X=a\}\)。若 \(X\) 取值 \(x_1,x_2,\dots\),则 \(p(x_i)\ge0\),其他点 \(p(x)=0\),且 \(\sum_i p(x_i)=1\)。可将 PMF 画成棒状图(图 4.1:\(p(0)=1/4,p(1)=1/2,p(2)=1/4\);图 4.2:两骰之和,\(p(k)\) 从 1/36 线性升到 \(p(7)=6/36\) 再对称下降)。
例 2a(泊松型 PMF 归一化)。 \(p(i)=c\lambda^i/i!\),\(i\ge0\)。由 \(\sum_i\lambda^i/i!=e^\lambda\) 得 \(c=e^{-\lambda}\)。(a) \(P\{X=0\}=e^{-\lambda}\);(b) \(P\{X>2\}=1-e^{-\lambda}-\lambda e^{-\lambda}-\lambda^2e^{-\lambda}/2\)。
CDF 与 PMF 关系: \(F(a)=\sum_{x\le a}p(x)\)。离散变量取值 \(x_1<x_2<\cdots\) 时 \(F\) 是阶梯函数:在 \((x_{i-1},x_i)\) 内为常数,在 \(x_i\) 处跳跃 \(p(x_i)\)。例:\(p(1)=1/4,p(2)=1/2,p(3)=p(4)=1/8\),则 \(F(a)=0\ (a<1);\ 1/4\ (1\le a<2);\ 3/4\ (2\le a<3);\ 7/8\ (3\le a<4);\ 1\ (a\ge4)\)(图 4.3)。跳跃高度=该点概率;\(F\) 右连续。
4.3 期望(Expected Value)(PDF p.132–134)
定义。 离散 \(X\) 的期望/期望值(expectation, expected value):
频率解释: 独立重复无穷次,事件 \(E\) 出现的比例为 \(P(E)\)(第 8 章强大数律部分证明)。把 \(X\) 看成一局赌博收益,长期平均每局收益 \(=\sum x_ip(x_i)=E[X]\)。
例 3a。 公平骰子 \(E[X]=7/2\)。
例 3b(示性变量 indicator variable)。 \(I=1\) 若 \(A\) 发生,否则 0。\(E[I]=P(A)\)。——这是后面“示性变量求和法”的基石。
例 3c(答题顺序)。 两题,先答第 \(i\) 题,答对才能答另一题;答对第 \(i\) 题得 \(V_i\),知道答案概率 \(P_i\),独立。先答 1 的期望收益 \(V_1P_1(1-P_2)+(V_1+V_2)P_1P_2\),先答 2 为 \(V_2P_2(1-P_1)+(V_1+V_2)P_1P_2\)。先答 1 更优当且仅当
例 3d(检验悖论 / 规模偏倚 size-biased sampling)。 120 名学生乘 3 辆车(36、40、44 人),随机抽一名学生,\(X\)=其所在车人数。\(P\{X=36\}=36/120\) 等,\(E[X]=36(3/10)+40(1/3)+44(11/30)=1208/30\approx40.2667\),大于每车平均人数 40。原因:人多的车更可能被抽中,权重更大。(见自测题 4.4。)
附注(重心类比)。 期望类似质量分布的重心:在无重量杆上 \(x_i\) 处放质量 \(p(x_i)\),平衡点就在 \(E[X]\),因为 \(\sum_i(x_i-E[X])p(x_i)=0\)。图 4.4:\(p(-1)=0.10,p(0)=0.25,p(1)=0.30,p(2)=0.35\),重心 0.9。
4.4 随机变量函数的期望(Expectation of a Function of a Random Variable)(PDF p.134–138)
方法一: 先求 \(g(X)\) 的 PMF,再按定义求期望。例 4a: \(X\) 取 \(-1,0,1\) 概率 0.2、0.5、0.3,\(Y=X^2\):\(P\{Y=1\}=0.5,P\{Y=0\}=0.5\),\(E[X^2]=0.5\)。注意 \(E[X^2]=0.5\ne(E[X])^2=0.01\)(常见误区)。
命题 4.1(无意识统计学家定律,LOTUS)。 若 \(X\) 取 \(x_i\) 概率 \(p(x_i)\),则对任意实函数 \(g\):
例 4b(报童/季节性库存问题 newsvendor)。 每卖出一件净利 \(b\),季末每剩一件亏 \(\ell\)。需求 \(X\) 的 PMF 为 \(p(i)\)。备货 \(s\) 时利润 \(P(s)=bX-(s-X)\ell\)(\(X\le s\)),\(=sb\)(\(X>s\))。
例 4c(效用 utility)。 两种行动,各导致后果 \(C_1..C_n\),概率分别为 \(p_i\)、\(q_i\)。构造效用:最差后果 \(c\) 赋 0,最好后果 \(C\) 赋 1;对其他 \(C_i\),找概率 \(u\) 使你在“确定得到 \(C_i\)”与“以概率 \(u\) 得 \(C\)、\(1-u\) 得 \(c\) 的抽奖”之间无差异,该 \(u\) 记为效用 \(u(C_i)\)。于是行动 1 等价于以概率 \(\sum_ip_iu(C_i)\) 得 \(C\) 的抽奖。结论:行动 1 优于 2 当且仅当 \(\sum_ip_iu(C_i)>\sum_iq_iu(C_i)\),即以期望效用(expected utility)衡量行动价值。
推论 4.1(线性)。 \(E[aX+b]=aE[X]+b\)。 矩: \(E[X]\) 称**均值(mean)**或一阶矩(first moment);\(E[X^n]\) 称 \(n\) 阶矩(\(n\)th moment),\(E[X^n]=\sum_x x^np(x)\)。
4.5 方差(Variance)(PDF p.138–140)
期望不反映离散程度:\(W\equiv0\);\(Y=\pm1\) 各 1/2;\(Z=\pm100\) 各 1/2,均值都是 0,但离散程度递增。可用 \(E|X-\mu|\) 度量,但数学上不便,故用平方偏差。
定义: \(\mathrm{Var}(X)=E[(X-\mu)^2]\),\(\mu=E[X]\)。展开得常用计算式
性质: \(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\)(证明:\(E[(aX+b-a\mu-b)^2]=a^2E[(X-\mu)^2]\))。平移不改变方差。 附注: (a) 力学类比——均值是重心,方差是转动惯量(moment of inertia);(b) 标准差(standard deviation) \(\mathrm{SD}(X)=\sqrt{\mathrm{Var}(X)}\),与 \(X\) 同量纲。
4.6 伯努利与二项随机变量(The Bernoulli and Binomial Random Variables)(PDF p.140–148)
伯努利随机变量(Bernoulli): 一次试验结果只分成功/失败,\(X=1\) 表成功:
例 6a: 5 枚公平硬币正面数:\(P\{X=k\}=\binom5k/32\),即 1/32, 5/32, 10/32, 10/32, 5/32, 1/32。 例 6b(螺丝退货): 次品率 0.01,10 个一包,保证至多 1 个次品。需更换比例 \(1-0.99^{10}-10(0.01)(0.99)^9\approx0.004\),即 0.4%。 例 6c(幸运轮 chuck-a-luck): 押 1–6 中一个数,掷 3 骰,该数出现 \(i\) 次赢 \(i\) 单位,不出现输 1。出现次数 ~ \(\mathrm{Bin}(3,1/6)\):\(P\{X=-1\}=125/216\),\(P\{X=1\}=75/216\),\(P\{X=2\}=15/216\),\(P\{X=3\}=1/216\)。\(E[X]=(-125+75+30+3)/216=-17/216\),长期每 216 局输 17 单位——看似公平的游戏其实有负期望。 例 6d(孟德尔遗传): 两个杂合(rd)父母,子代 dd、rr、rd 概率 1/4、1/4、1/2;显性外观(dd 或 rd)概率 3/4。4 个孩子中恰 3 个显性外观:\(\binom43(3/4)^3(1/4)=27/64\)。(图 4.5 为黄绿豌豆杂交示意。) 例 6e(陪审团): 12 人中至少 8 人判有罪才定罪,每人独立以概率 \(\theta\) 作出正确判断。仅凭此信息无法求解,须对被告是否有罪条件化:若无罪,正确裁决需有罪票 ≤7,即正确票 ≥5:\(\sum_{i=5}^{12}\binom{12}{i}\theta^i(1-\theta)^{12-i}\);若有罪,需 \(\sum_{i=8}^{12}\binom{12}{i}\theta^i(1-\theta)^{12-i}\)。设有罪先验 \(\alpha\),正确裁决概率 \(=\alpha\sum_{i=8}^{12}(\cdot)+(1-\alpha)\sum_{i=5}^{12}(\cdot)\)。 例 6f(冗余系统,多数表决): \(n\) 个部件各以概率 \(p\) 独立工作,至少一半工作则系统有效。(a) 5 部件优于 3 部件 ⇔ \(10p^3(1-p)^2+5p^4(1-p)+p^5>3p^2(1-p)+p^3\) ⇔ \(3(p-1)^2(2p-1)>0\) ⇔ \(p>1/2\)。(b) 一般地 \(2k+1\) 部件优于 \(2k-1\) 部件 ⇔ \(p>1/2\)。证明:令 \(X\)=前 \(2k-1\) 个中工作数,\(P_{2k+1}=P\{X\ge k+1\}+P\{X=k\}(1-(1-p)^2)+P\{X=k-1\}p^2\),\(P_{2k-1}=P\{X\ge k\}\),相减得 \(P\{X=k-1\}p^2-(1-p)^2P\{X=k\}=\binom{2k-1}{k}p^k(1-p)^k[p-(1-p)]\)(用 \(\binom{2k-1}{k-1}=\binom{2k-1}{k}\)),其正负由 \(2p-1\) 决定。直观:只有单个部件靠谱(\(p>1/2\))时,增加冗余才有益。
4.6.1 二项随机变量的性质(PDF p.144–147)
矩的递推: 利用 \(i\binom ni=n\binom{n-1}{i-1}\),
4.6.2 二项分布函数的计算(PDF p.147–148)
递推式(命题 6.1 证明中得到):
4.7 泊松随机变量(The Poisson Random Variable)(PDF p.148–160)
定义: 取值 \(0,1,2,\dots\),参数 \(\lambda>0\),
泊松近似二项(Poisson approximation to the binomial): \(X\sim\mathrm{Bin}(n,p)\),\(\lambda=np\),
例 7a: 每页错误数 ~ Poisson(1/2),至少一个错的概率 \(1-e^{-1/2}\approx0.393\)。 例 7b: 次品率 0.1,10 件中至多 1 件次品:精确值 \(0.9^{10}+10(0.1)(0.9)^9=0.7361\);泊松近似 \(2e^{-1}\approx0.7358\)。 例 7c: α 粒子平均 3.2 个/秒,\(P\{X\le2\}=e^{-3.2}(1+3.2+3.2^2/2)\approx0.3799\)。
期望与方差: 直觉:二项均值 \(np=\lambda\),方差 \(np(1-p)\approx\lambda\)。验证:\(E[X]=\lambda e^{-\lambda}\sum_j\lambda^j/j!=\lambda\);\(E[X^2]=\lambda E[X+1]=\lambda(\lambda+1)\),所以
弱相依下的泊松近似: 试验之间弱相依时近似依然好。
- 配对问题(matching problem):\(n\) 人随机取帽,\(E_i\)=第 \(i\) 人拿到自己的帽子,\(P(E_i)=1/n\),\(P(E_i|E_j)=1/(n-1)\),相依很弱,故拿对帽子人数近似 Poisson(1)(第 2 章例 5m 已验证)。
- 生日问题:对每对 \((i,j)\) 设试验,\(P(E_{ij})=1/365\),这些事件两两独立但不相互独立(理论习题 21)。成功数近似 Poisson 均值 \(\binom n2/365=n(n-1)/730\),故 \(P\{\text{无两人同生日}\}\approx\exp(-n(n-1)/730)\)。令其 \(\le1/2\):\(n(n-1)\ge730\ln2\approx505.997\),得 \(n=23\),与精确组合结果一致。
- 三人同生日:三元组成功概率 \(1/365^2\),均值 \(\binom n3/365^2=n(n-1)(n-2)/(6\cdot365^2)\),\(P\{\text{无三人同生日}\}\approx\exp(-n(n-1)(n-2)/799350)\);\(<1/2\) 需 \(n(n-1)(n-2)\ge799350\ln2\approx554067.1\),即 \(n\ge84\)。
泊松范式(Poisson paradigm): \(n\) 个事件,事件 \(i\) 概率 \(p_i\);若所有 \(p_i\) 都“小”且事件独立或至多“弱相依”,则发生的事件数近似服从均值 \(\sum_ip_i\) 的泊松分布。各 \(p_i\) 不必相等。
例 7d(最长连续正面 longest run): 抛 \(n\) 次(正面概率 \(p\)),问是否出现 \(k\) 连正。
- 陷阱:直接用 \(H_i\)=“从第 \(i\) 次起连续 \(k\) 次正面”不行,因为 \(P(H_2|H_1)=p\) 远大于 \(P(H_2)=p^k\),相依太强(连串会“成簇”出现)。
- 技巧:只数“以反面结尾的 \(k\) 连正”:\(E_i\)=第 \(i..i+k-1\) 次正、第 \(i+k\) 次反(\(i\le n-k\)),\(P(E_i)=p^k(1-p)\);\(E_{n-k+1}\)=最后 \(k\) 次全正,概率 \(p^k\)。不重叠时独立,重叠时互斥(条件概率为 0),都接近无条件概率,故个数 \(N\) 近似泊松,均值 \(E[N]=(n-k)p^k(1-p)+p^k\)。设 \(L_n\)=最长正面连串长度:
\[P\{L_n<k\}=P\{N=0\}\approx\exp\{-(n-k)p^k(1-p)-p^k\}\]
- 公平硬币:\(P\{L_n<k\}\approx\exp\{-(n-k+2)/2^{k+1}\}\approx\exp\{-n/2^{k+1}\}\)。令 \(j=\log_2n\)(设为整数),\(k=j+i\) 时 \(P\{L_n<j+i\}\approx\exp\{-(1/2)^{i+1}\}\),\(P\{L_n=j+i\}\approx e^{-(1/2)^{i+2}}-e^{-(1/2)^{i+1}}\)。数值:\(P\{L_n<j-3\}\approx0.0183\);\(P\{L_n=j-3\}\approx0.1170\);\(j-2\): 0.2325;\(j-1\): 0.2387;\(j\): 0.1723;\(j+1\): 0.1037;\(j+2\): 0.0569;\(j+3\): 0.0298;\(P\{L_n\ge j+4\}\approx0.0308\)。结论:无论 \(n\) 多大,最长正面连串以约 0.86 的概率落在 \(\log_2 n-1\) 的 ±2 之内。
- 精确公式(容斥): \(S_i\)=\(E_i\) 涉及的抛掷编号集(\(k+1\) 个)。不含 \(E_{n-k+1}\) 的 \(r\) 重交:有重叠则概率 0,否则独立,概率 \(p^{rk}(1-p)^r\);不重叠的选法数等于 \(r\) 个 a 与 \(n-r(k+1)\) 个 b 的排列数 \(\binom{n-rk}{r}\)。含 \(E_{n-k+1}\) 的 \(r\) 重交:概率 \(p^{kr}(1-p)^{r-1}\),选法 \(\binom{n-rk}{r-1}\)。合并:
\[P(L_n\ge k)=\sum_{r=1}^{n-k+1}(-1)^{r+1}\Big[\binom{n-rk}{r}+\frac1p\binom{n-rk}{r-1}\Big]p^{kr}(1-p)^r\](约定 \(m<j\) 时 \(\binom mj=0\)。)
- 递推(计算上更高效): \(P_n\)=\(n\) 次中出现 \(k\) 连正的概率。按第一次反面出现的位置 \(j\)(\(j=1..k\))或前 \(k\) 次全正条件化:\(P(A_n|F_j)=P_{n-j}\),\(P(A_n|H)=1\),
\[P_n=\sum_{j=1}^kP_{n-j}\,p^{j-1}(1-p)+p^k\]初值 \(P_j=0\ (j<k)\),\(P_k=p^k\)。例:公平硬币 \(k=2\):\(P_2=1/4\),\(P_3=3/8\),\(P_4=1/2\)(可枚举 8 个结果 hhhh, hhht, hhth, hthh, thhh, hhtt, thht, tthh 验证)。复杂度 \(O(nk)\)。
泊松过程(Poisson process)的推导(PDF p.157–159)。 事件在随机时间点发生,设常数 \(\lambda>0\) 满足:
- 长度 \(h\) 的区间内恰好发生 1 个事件的概率为 \(\lambda h+o(h)\)(\(o(h)\) 指 \(\lim_{h\to0}f(h)/h=0\),如 \(h^2\) 是 \(o(h)\),\(h\) 不是);
- 发生 ≥2 个事件的概率为 \(o(h)\);
- 不重叠区间内的事件数相互独立(独立增量)。
结论:长度 \(t\) 区间内事件数 \(N(t)\sim\) Poisson(\(\lambda t\))。证明:把 \([0,t]\) 分成 \(n\) 段,每段长 \(t/n\)(图 4.8)。\(\{N(t)=k\}=A\cup B\),\(A\)=恰 \(k\) 段各有 1 个事件、其余 0 个;\(B\)=\(N(t)=k\) 且某段有 ≥2 个。由 Boole 不等式 \(P(B)\le n\,o(t/n)=t\cdot\frac{o(t/n)}{t/n}\to0\) (7.3)。段内 0 事件概率 \(1-\lambda h-o(h)\)(两个 \(o(h)\) 之和仍为 \(o(h)\)),由独立性 \(P(A)=\binom nk(\frac{\lambda t}{n}+o(\frac tn))^k(1-\frac{\lambda t}n-o(\frac tn))^{n-k}\);因 \(n(\frac{\lambda t}n+o(\frac tn))\to\lambda t\),同二项→泊松的论证得 \(P(A)\to e^{-\lambda t}(\lambda t)^k/k!\) (7.4)。于是
例 7e(地震): 美国西部地震按速率 2 次/周的泊松过程发生。(a) 未来 2 周至少 3 次:\(1-e^{-4}(1+4+8)=1-13e^{-4}\)。(b) 到下次地震的时间 \(X\):\(P\{X>t\}=P\{N(t)=0\}=e^{-\lambda t}\),\(F(t)=1-e^{-2t}\)——即泊松过程的等待时间服从指数分布(第 5 章展开)。
4.7.1 泊松分布函数的计算(PDF p.159–160)
递推:\(\dfrac{P\{X=i+1\}}{P\{X=i\}}=\dfrac{\lambda}{i+1}\) (7.6),从 \(P\{X=0\}=e^{-\lambda}\) 起逐项计算。 例 7f: \(X\sim\) Poisson(100),\(P\{X\le90\}=0.17138\);\(Y\sim\) Poisson(1000),\(P\{Y\le1075\}=0.99095\)(StatCrunch 计算)。
4.8 其他离散分布(Other Discrete Probability Distributions)(PDF p.160–168)
4.8.1 几何随机变量(The Geometric Random Variable)(PDF p.160–162)
独立试验(成功概率 \(p\))直到首次成功,\(X\)=所需试验次数:
4.8.2 负二项随机变量(The Negative Binomial Random Variable)(PDF p.162–164)
直到累计 \(r\) 次成功所需试验次数 \(X\):
4.8.3 超几何随机变量(The Hypergeometric Random Variable)(PDF p.164–167)
从 \(N\) 球(\(m\) 白、\(N-m\) 黑)中不放回随机取 \(n\) 个,白球数 \(X\):
例 8h(捕获—再捕获估计种群规模,最大似然估计 maximum likelihood estimate): 先捕 \(m\) 只做标记放回,再捕 \(n\) 只,其中标记数 \(X\) 为超几何,\(P_i(N)=\binom mi\binom{N-m}{n-i}/\binom Nn\)。观察到 \(X=i\),取使 \(P_i(N)\) 最大的 \(N\) 作为估计。比值
4.8.4 Zeta(Zipf)分布(PDF p.168)
得名于 Riemann zeta 函数 \(\zeta(s)=\sum_k k^{-s}\)。意大利经济学家 V. Pareto 用它描述家庭收入分布,G. K. Zipf 将其推广到许多领域。(这是离散的幂律/厚尾分布。)
4.9 随机变量和的期望(Expected Value of Sums of Random Variables)(PDF p.168–172)
为简化,假设样本空间 \(S\) 有限或可数。\(X(s)\) 表示结果 \(s\) 下 \(X\) 的值;\(Z=X+Y\) 也是随机变量,\(Z(s)=X(s)+Y(s)\)。例 9a: 抛 5 次,\(X\)=前 3 次正面数,\(Y\)=后 2 次正面数,\(s=(h,t,h,t,h)\) 时 \(X(s)=2,Y(s)=1,Z(s)=3\)。 记 \(p(s)=P(\{s\})\),则 \(P(A)=\sum_{s\in A}p(s)\)。
命题 9.1: \(E[X]=\sum_{s\in S}X(s)p(s)\)。证明:令 \(S_i=\{s:X(s)=x_i\}\),\(E[X]=\sum_ix_iP(S_i)=\sum_i\sum_{s\in S_i}X(s)p(s)=\sum_sX(s)p(s)\)(\(S_i\) 互斥且并为 \(S\))。 例 9b: 两次独立抛硬币,正面数期望按两种方式都得 \(2p\)。
推论 9.2(期望的线性性): \(E[\sum_{i=1}^nX_i]=\sum_iE[X_i]\)——无需任何独立性假设。证明:\(E[Z]=\sum_s(X_1(s)+\cdots+X_n(s))p(s)\) 拆开即可。(一般样本空间的证明见理论习题。)
例 9c: \(n\) 颗骰子之和的期望 \(=3.5n\)。 例 9d(示性变量法 method of indicators): 第 \(i\) 次试验成功概率 \(p_i\),令 \(X_i\) 为示性变量,\(X=\sum X_i\),\(E[X]=\sum p_i\),不要求试验独立。特例:二项 \(np\);超几何——第 \(i\) 个取出的球等可能是 \(N\) 个中任一个,白的概率 \(m/N\),故 \(E[X]=nm/N\)(虽然各次相依)。
例 9e(示性变量求方差):
- 二项:\(E[X_iX_j]=p^2\),\(E[X^2]=np+n(n-1)p^2\),\(\mathrm{Var}=np(1-p)\)。
- 超几何:\(P\{X_i=1,X_j=1\}=\frac mN\cdot\frac{m-1}{N-1}\),\(E[X^2]=\frac{nm}N+n(n-1)\frac mN\frac{m-1}{N-1}\),化简得 \(\mathrm{Var}(X)=np(1-p)(1-\frac{n-1}{N-1})\),与例 8j 一致。
4.10 累积分布函数的性质(Properties of the Cumulative Distribution Function)(PDF p.172–174)
CDF \(F\) 的四条性质:
- 单调不减:\(a<b\Rightarrow F(a)\le F(b)\);
- \(\lim_{b\to\infty}F(b)=1\);
- \(\lim_{b\to-\infty}F(b)=0\);
- 右连续:对任意递减趋于 \(b\) 的序列 \(b_n\),\(\lim F(b_n)=F(b)\)。
性质 1 由事件包含;2、3、4 由概率的连续性(第 2.6 节):如 \(b_n\uparrow\infty\) 时 \(\{X\le b_n\}\) 递增,并为 \(\{X<\infty\}\),概率→1;\(b_n\downarrow b\) 时 \(\{X\le b_n\}\) 递减,交为 \(\{X\le b\}\)。 所有关于 \(X\) 的概率问题都可用 \(F\) 回答:
第 4 章小结(Summary)(PDF p.175–176)
原书小结复述:随机变量、分布函数、PMF、期望、LOTUS、方差及 \(E[X^2]-(E[X])^2\)、标准差,并列出常见离散分布表:
| 分布 | PMF | 均值 | 方差 |
|---|---|---|---|
| 二项 \((n,p)\) | \(\binom ni p^i(1-p)^{n-i}\) | \(np\) | \(np(1-p)\) |
| 泊松 \(\lambda\) | \(e^{-\lambda}\lambda^i/i!\) | \(\lambda\) | \(\lambda\) |
| 几何 \(p\) | \(p(1-p)^{i-1},\ i\ge1\) | \(1/p\) | \((1-p)/p^2\) |
| 负二项 \((r,p)\) | \(\binom{i-1}{r-1}p^r(1-p)^{i-r},\ i\ge r\) | \(r/p\) | \(r(1-p)/p^2\) |
| 超几何 \((n,N,m)\) | \(\binom mi\binom{N-m}{n-i}/\binom Nn\) | \(np\) | \(\frac{N-n}{N-1}np(1-p)\) |
以及和的期望等于期望之和。
第 4 章习题概述(PDF p.176–188)
Problems 4.1–4.85(PDF p.176–182)题型:
- 由抽球/骰子/排名构造随机变量并求 PMF(4.1–4.9,4.14–4.19 含从给定阶梯 CDF 反求 PMF);条件分布(4.10);Möbius 函数与 \(6/\pi^2\)(4.11,\(P\{\mu(N)\neq0\}\to6/\pi^2\));NBA 选秀抽签(4.15–4.16)。
- 期望与决策:轮盘“必胜策略”(4.20,说明正赢概率高但期望为负);检验悖论的车辆版(4.21:学生视角 vs 司机视角);系列赛期望场数在 \(p=1/2\) 时最大(4.22、4.36);商品价格 1 或 4 美元时最大化期望现金 vs 期望商品数量(4.23,Jensen 型“两种计价单位”悖论);零和博弈与 von Neumann 极小极大定理(4.24);圣彼得堡悖论(4.30,\(E[X]=\infty\));合适评分规则(4.31,Brier 型得分下诚实报告 \(p=p^*\) 最优);混样检测(4.32,10 人一组的期望检测次数);报童问题(4.33)、含商誉成本的库存问题(4.34);保险定价(4.27);故障排查顺序(4.29)。
- 二项:多数表决、陪审团、军事法庭剔除法官的策略(4.40–4.47);混合二项(4.49,随机选硬币)、给定总数下序列的条件概率(4.50)。
- 泊松近似:印刷错误、空难、生日(4.51–4.56,4.53:8 万对夫妻同生日);混合泊松与贝叶斯(4.55,4.60 新药是否有效);泊松近似与精确二项对比(4.58);“无结果重复”\(\approx\exp(-n(n-1)\sum p_i^2/2)\)(4.62);泊松过程(4.63 赌场到客、4.70 随机翻硬币);泊松范式应用(4.66–4.68 圆桌夫妻相邻、反导拦截);最长连串的公式/递推/泊松近似三法对比(4.69)。
- 几何/负二项:轮盘首胜(4.71)、七局四胜系列赛(4.72–4.73)、访谈名单(4.74)、Banach 火柴推广(4.76–4.77)。
- 超几何:抽检(4.79、4.81–4.82)、Keno 期望回报(4.80)。
- 示性变量求期望:空盒数、集券种类数(4.84–4.85)。
理论习题 4.1–4.36(PDF p.182–186): 非等概率集券的 \(P\{T=n\}\);\(e^X\)、\(\alpha X+\beta\) 的 CDF;Yule–Simons 分布 \(4/(n(n+1)(n+2))\)(\(E[X]=2\)、\(E[X^2]=\infty\));尾和公式 \(E[N]=\sum_{i\ge1}P\{N\ge i\}\)、\(E[N(N+1)]=2\sum iP\{N\ge i\}\)(4.5);标准化 \(Y=(X-\mu)/\sigma\) 均值 0 方差 1(4.7);两点分布方差;由二项推二项式定理;\(E[1/(X+1)]\);给定成功数时排列等可能;二项与泊松 PMF 的众数及 MLE(4.13、4.16、4.18);偶数次正面概率 \(\frac12[1+(q-p)^n]\)、泊松为偶数概率 \(\frac12(1+e^{-2\lambda})\);泊松矩递推 \(E[X^n]=\lambda E[(X+1)^{n-1}]\);辨析三种近似推理(4.20);生日事件两两独立但不相互独立(4.21);泊松稀疏化(thinning):每个事件以概率 \(p\) 被计数,计数数为 Poisson(\(\lambda p\))(4.25);泊松 CDF 与伽马积分恒等式(4.26);几何分布无记忆性 \(P\{X=n+k|X>n\}=P\{X=k\}\)(4.27);负二项与二项的对偶 \(P\{X>n\}=P\{Y<r\}\)(4.28);Pólya 罐模型首次抽到蓝球(4.35);用联合 PMF 证明 \(E[X+Y]=E[X]+E[Y]\)(4.36)。
自测题 4.1–4.28(PDF p.186–188): 由约束求期望;规模偏倚 \(E[Y]\ge E[X]\)(4.4);信息价值:购买“选中哪枚硬币”内幕信息值多少(4.6);双信封类问题(4.7:红/蓝纸 \(x\) 与 \(2x\) 或 \(x/2\),阈值策略 \(R_y(x)\));\(P\{B(n,p)\le i\}=1-P\{B(n,1-p)\le n-i-1\}\);由均值方差反求二项参数;赛制条件概率;截断泊松(零截断)期望;男女互选配对的泊松近似与容斥(4.16);夫妻随机配对;赌场下注直到赢 4 次(负二项);几何分布 \(E[1/X]=-p\log p/(1-p)\);配对问题期望与方差(都为 1);NBA 1-3 落后翻盘概率;负超几何分布(4.28)。
第 4 章 本章要点
- 随机变量是样本空间上的实函数;CDF \(F\) 单调不减、右连续、两端极限 0 和 1,所有概率都可由 \(F\) 表达(注意 \(P\{X<b\}=F(b^-)\))。
- 离散变量用 PMF 描述;期望是概率加权平均,LOTUS \(E[g(X)]=\sum g(x)p(x)\),一般 \(E[g(X)]\ne g(E[X])\)。
- 方差 \(\mathrm{Var}(X)=E[X^2]-(E[X])^2\),\(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\)。
- 五大离散分布(二项、泊松、几何、负二项、超几何)的来源、PMF、均值、方差、相互关系(泊松近似二项;超几何近似二项;几何为负二项特例),及递推计算法。
- 泊松范式:大量小概率、弱相依事件的发生数近似泊松;泊松过程由“稀有+无多重+独立增量”三假设推出,等待时间为指数分布。
- 期望的线性性不需要独立性;示性变量法是求复杂计数期望/方差的通用工具。
- 典型决策模型:报童问题的临界分位数解、期望效用、答题顺序指标。
第 4 章 与量化交易的关联
- 风险建模与跳跃: 泊松过程是跳跃扩散模型(Merton jump-diffusion)中跳跃到达、信用风险中违约到达(强度模型)的基础;“均值=方差”可用于检验成交笔数、订单到达是否为泊松(实际常过度离散,需负二项或 Hawkes 过程)。
- 市场微观结构与执行: 限价单到达、成交事件计数常用泊松/计数过程建模;最优挂单、库存控制模型(如 Avellaneda–Stoikov)以泊松到达为输入。报童问题的临界分位数思想与“备货量=需求分位数”的做市库存/备付资金决策同构。
- 回测与策略评估: 二项分布用于胜率显著性检验(如 10 次中 7 次正确的“预测能力”是否显著,对应习题 4.41);最长连串结果(最长连胜/连败长度约为 \(\log_2 n\))可用来判断回测中的连续亏损是否异常,避免把正常随机连败误判为策略失效。
- 多重检验与过拟合: 泊松范式可估计“大量试验中至少一个偶然显著”的概率(生日问题思路),对应策略挖掘中的数据窥探。
- 期望 vs 风险: chuck-a-luck、轮盘“必胜策略”和圣彼得堡悖论说明高胜率≠正期望、期望无穷≠值得付任意价格,与仓位管理、效用函数/Kelly 思想相关;例 4c 的期望效用是组合选择理论的公理基础。
- 评分规则: 习题 4.31 的合适评分规则可用于评估概率预测模型(如涨跌概率预测的 Brier score)。
- 抽样: 超几何的有限总体修正在从有限股票池中无放回抽样(如随机组合检验)时会用到;捕获—再捕获 MLE 是最大似然思想的最直观例子。
- 几何分布无记忆性、Banach 火柴、孟德尔遗传等内容与量化无直接关联,仅作概率训练。
第 4 章 推荐习题
- 4.20(轮盘策略:正赢概率 vs 负期望)、4.30(圣彼得堡悖论)、4.31(合适评分规则)——理解期望与决策。
- 4.24(极小极大定理)——随机化策略与博弈。
- 4.32、4.65(混样检测)——条件期望与泊松近似。
- 4.33、4.34(报童及含商誉成本的库存)——临界分位数最优化。
- 4.41(ESP 检验)——二项尾概率与显著性。
- 4.60(混合泊松+贝叶斯)——参数不确定下的后验。
- 4.69(最长连串三种算法对比)——与回测连亏分析直接相关。
- 4.84、4.85(示性变量法)——计数期望的标准技巧。
- 理论 4.5(尾和公式)、4.25(泊松稀疏化)、4.27(无记忆性)、4.28(负二项—二项对偶)。
- 自测 4.4(规模偏倚)、4.6(信息价值)、4.7(双信封阈值策略)。
第 5 章 连续型随机变量(Continuous Random Variables)(PDF p.189–232)
章节目录:5.1 引言;5.2 连续型随机变量的期望与方差;5.3 均匀随机变量;5.4 正态随机变量;5.5 指数随机变量;5.6 其他连续分布;5.7 随机变量函数的分布。
5.1 引言(PDF p.189–192)
有些随机变量取值不可数,如火车到站时间、晶体管寿命。定义: 若存在定义在全实轴上的非负函数 \(f\),使对任意(可测)实数集 \(B\)
- 归一:\(\int_{-\infty}^\infty f(x)dx=1\);区间概率 \(P\{a\le X\le b\}=\int_a^bf(x)dx\)(1.2),即密度曲线下面积(图 5.1)。
- 令 \(a=b\) 得 \(P\{X=a\}=0\):连续变量取任一固定值的概率为 0,因此 \(P\{X<a\}=P\{X\le a\}=F(a)=\int_{-\infty}^af(x)dx\)。
例 1a: \(f(x)=C(4x-2x^2)\),\(0<x<2\)。由 \(C[2x^2-2x^3/3]_0^2=1\) 得 \(C=3/8\);\(P\{X>1\}=\frac38\int_1^2(4x-2x^2)dx=1/2\)。 例 1b(计算机寿命): \(f(x)=\lambda e^{-x/100}\),\(x\ge0\),由归一化 \(\lambda=1/100\)。\(P\{50<X<150\}=e^{-1/2}-e^{-3/2}\approx0.383\);\(P\{X<100\}=1-e^{-1}\approx0.632\)。 例 1c(电子管): \(f(x)=100/x^2\),\(x>100\)。150 小时内需更换的概率 \(100\int_{100}^{150}x^{-2}dx=1/3\);5 个管中恰 2 个需更换:\(\binom52(1/3)^2(2/3)^3=80/243\)。
CDF 与 PDF: \(F(a)=\int_{-\infty}^af(x)dx\),\(\frac{d}{da}F(a)=f(a)\)——密度是 CDF 的导数。直观解释:\(f\) 在 \(a\) 处连续时
5.2 连续型随机变量的期望与方差(PDF p.192–196)
由 \(f(x)dx\approx P\{x\le X\le x+dx\}\),定义
命题 2.1(连续版 LOTUS): \(E[g(X)]=\int_{-\infty}^\infty g(x)f(x)dx\)。如例 2b:\(\int_0^1e^xdx=e-1\)。 引理 2.1(尾积分公式): 非负随机变量 \(Y\) 有
例 2c(断棍): 长 1 的棍在 \(U\sim U(0,1)\) 处折断,求含点 \(p\) 那段的期望长度。\(L_p(U)=1-U\)(\(U<p\)),\(=U\)(\(U>p\))(图 5.2)。
推论 2.1: \(E[aX+b]=aE[X]+b\)。方差定义对任何类型随机变量相同:\(\mathrm{Var}(X)=E[(X-\mu)^2]=E[X^2]-(E[X])^2\),\(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\)。 例 2e: 例 2a 中 \(E[X^2]=\int_0^12x^3dx=1/2\),\(\mathrm{Var}(X)=1/2-4/9=1/18\)。
5.3 均匀随机变量(The Uniform Random Variable)(PDF p.197–200)
\((0,1)\) 上均匀:\(f(x)=1\)(\(0<x<1\))(3.1);对 \(0<a<b<1\),\(P\{a\le X\le b\}=b-a\),即概率等于子区间长度。 一般 \((\alpha,\beta)\) 上均匀:
- 若弦到圆心距离 \(D\sim U(0,r)\):条件为 \(D<r/2\),概率 1/2;
- 若弦与过一端点切线的夹角 \(\theta\sim U(0°,180°)\):条件为 \(60°<\theta<120°\),概率 1/3(图 5.4)。 两者都可由实际实验实现:把半径 \(r\) 的圆盘扔到间距 \(2r\) 的平行线上得 1/2;绕圆周上点 A 自由旋转一根针得 1/3。教训:“随机”必须指明概率模型。
5.4 正态随机变量(Normal Random Variables)(PDF p.200–212)
定义: 参数 \(\mu,\sigma^2\) 的正态(normal)随机变量密度
归一化证明(极坐标技巧): 令 \(y=(x-\mu)/\sigma\),只需证 \(I=\int e^{-y^2/2}dy=\sqrt{2\pi}\)。\(I^2=\iint e^{-(x^2+y^2)/2}dxdy\),换极坐标 \(x=r\cos\theta,y=r\sin\theta\),\(dxdy=rd\theta dr\):\(I^2=2\pi\int_0^\infty re^{-r^2/2}dr=2\pi\)。
线性变换保持正态: \(X\sim N(\mu,\sigma^2)\),则 \(Y=aX+b\sim N(a\mu+b,a^2\sigma^2)\)。证(\(a>0\)):\(F_Y(x)=F_X((x-b)/a)\),求导得 \(f_Y(x)=\frac1{\sqrt{2\pi}a\sigma}\exp\{-(x-b-a\mu)^2/2(a\sigma)^2\}\)。推论:\(Z=(X-\mu)/\sigma\) 为标准(单位)正态(standard/unit normal),\(N(0,1)\)。 例 4a(均值方差): \(E[Z]=\frac1{\sqrt{2\pi}}\int xe^{-x^2/2}dx=0\);分部积分(\(u=x\),\(dv=xe^{-x^2/2}dx\))得 \(\mathrm{Var}(Z)=E[Z^2]=1\)。由 \(X=\mu+\sigma Z\):\(E[X]=\mu\),\(\mathrm{Var}(X)=\sigma^2\)。
标准正态 CDF: \(\Phi(x)=\frac1{\sqrt{2\pi}}\int_{-\infty}^xe^{-y^2/2}dy\)。表 5.1 给出 \(x=0.00\)–\(3.49\) 的 \(\Phi(x)\)(如 \(\Phi(1)=0.8413\),\(\Phi(1.5)=0.9332\),\(\Phi(1.645)\approx0.95\),\(\Phi(1.96)=0.9750\),\(\Phi(2)=0.9772\),\(\Phi(2.33)\approx0.99\),\(\Phi(2.5)=0.9938\),\(\Phi(3)=0.9987\))。对称性:
例 4b: \(\mu=3,\sigma^2=9\):(a) \(P\{2<X<5\}=\Phi(2/3)-\Phi(-1/3)=\Phi(2/3)-[1-\Phi(1/3)]\approx0.3779\);(b) \(P\{X>0\}=P\{Z>-1\}=\Phi(1)\approx0.8413\);(c) \(P\{|X-3|>6\}=P\{|Z|>2\}=2[1-\Phi(2)]\approx0.0456\)。 例 4c(按曲线打分): A:\(>\mu+\sigma\),概率 \(1-\Phi(1)\approx0.1587\);B:\((\mu,\mu+\sigma)\),0.3413;C:\((\mu-\sigma,\mu)\),0.3413;D:\((\mu-2\sigma,\mu-\sigma)\),\(\Phi(2)-\Phi(1)\approx0.1359\);F:\(<\mu-2\sigma\),0.0228。即约 16%、34%、34%、14%、2%。(\(\pm1\sigma\) 内约 68%,\(\pm2\sigma\) 内约 95%。) 例 4d(亲子鉴定): 孕期 \(\sim N(270,100)\);被告在出生前 290 至 240 天间不在国内。若其为父亲,孕期须 >290 或 <240:\(P=1-\Phi(2)+1-\Phi(3)\approx0.0241\)。 例 4e(二进制信道): 发 1 送 \(+2\),发 0 送 \(-2\),接收 \(R=x+N\),\(N\sim N(0,1)\);规则 \(R\ge0.5\) 判 1。\(P\{\text{错}|1\}=P\{N<-1.5\}=1-\Phi(1.5)\approx0.0668\);\(P\{\text{错}|0\}=P\{N\ge2.5\}=1-\Phi(2.5)\approx0.0062\)。(阈值不对称导致两类错误率不同。) 例 4f(风险价值 Value at Risk, VaR): 投资的 VaR 定义为使“损失超过 \(v\) 的概率仅 1%”的 \(v\)。若收益 \(X\sim N(\mu,\sigma^2)\),损失 \(-X\sim N(-\mu,\sigma^2)\):
5.4.1 二项分布的正态近似(The Normal Approximation to the Binomial Distribution)(PDF p.206–210)
DeMoivre–Laplace 极限定理: \(S_n\) 为 \(n\) 次独立试验(成功概率 \(p\))的成功数,则对任意 \(a<b\),
历史注记: De Moivre 称之为“指数钟形曲线”;1809 年 Gauss 在天体位置预测中使用后被称为高斯分布;19 世纪中后期人们相信大多数数据都应服从它,Karl Pearson 起称“正态曲线”。De Moivre 是在伦敦 Slaughter 咖啡馆替赌徒计算赔率的法国新教难民,皇家学会会员、牛顿好友。Gauss(1777–1855)被 E. T. Bell 与阿基米德、牛顿并列。
5.5 指数随机变量(Exponential Random Variables)(PDF p.210–216)
定义: 参数 \(\lambda>0\),
无记忆性(memoryless): 非负 \(X\) 满足
拉普拉斯分布(Laplace / 双指数 double exponential): 正负等可能、绝对值 ~ Exp(\(\lambda\)):
5.5.1 风险率函数(Hazard Rate Functions)(PDF p.214–216)
正值连续寿命 \(X\),风险率/失效率(hazard rate / failure rate):
- 指数分布 \(\lambda(t)=\lambda e^{-\lambda t}/e^{-\lambda t}=\lambda\) 为常数(与无记忆性一致),故 \(\lambda\) 称为分布的速率(rate)。
- 风险率唯一确定分布: \(\int_0^t\lambda(s)ds=-\log(1-F(t))\),故
\[F(t)=1-\exp\Big\{-\int_0^t\lambda(s)ds\Big\}\tag{5.4}\]
- 线性风险率 \(\lambda(t)=a+bt\):\(F(t)=1-e^{-at-bt^2/2}\),\(f(t)=(a+bt)e^{-(at+bt^2/2)}\);\(a=0\) 时为 Rayleigh 密度。
例 5f(吸烟者死亡率“是不吸烟者两倍”): 意为 \(\lambda_s(t)=2\lambda_n(t)\)。\(A\) 岁不吸烟者活到 \(B\) 岁的概率 \(\exp\{-\int_A^B\lambda_n(t)dt\}\),吸烟者为 \(\exp\{-2\int_A^B\lambda_n\}=[\cdot]^2\)——是平方而不是一半。例:\(\lambda_n(t)=1/30\)(\(50\le t\le60\)),50 岁不吸烟者活到 60 的概率 \(e^{-1/3}\approx0.7165\),吸烟者 \(e^{-2/3}\approx0.5134\)。
5.6 其他连续分布(Other Continuous Distributions)(PDF p.216–221)
5.6.1 伽马分布(The Gamma Distribution)
参数 \((\alpha,\lambda)\),\(\alpha,\lambda>0\):
5.6.2 Weibull 分布
工程中广泛使用,最初用于疲劳数据;适合“最弱环节(weakest link)”模型——由许多部件组成、任一部件失效即整体失效的物体寿命。CDF(参数 \(\nu,\alpha,\beta\)):
5.6.3 柯西分布(The Cauchy Distribution)
参数 \(\theta\):\(f(x)=\frac1\pi\frac1{1+(x-\theta)^2}\)。 例 6b(旋转手电筒): 手电筒中心距 x 轴 1 个单位,旋转停下后光束与 x 轴交点 \(X=\tan\theta\),\(\theta\sim U(-\pi/2,\pi/2)\)(图 5.7)。\(F(x)=P\{\theta\le\tan^{-1}x\}=\frac12+\frac1\pi\tan^{-1}x\),\(f(x)=\frac1{\pi(1+x^2)}\),即标准柯西。(脚注推导 \(\frac{d}{dx}\tan^{-1}x=\frac1{1+x^2}\)。)柯西分布均值不存在,是厚尾的极端例子。
5.6.4 贝塔分布(The Beta Distribution)
用于建模取值在有限区间 \([c,d]\) 的随机现象(平移缩放到 [0,1])。\(a=b\) 时关于 1/2 对称,\(a\) 越大越集中于 1/2;\(a=b=1\) 为 \(U(0,1)\)(图 5.8:\(a=1/4,1,3,10\));\(b>a\) 时偏向小值,\(a>b\) 时偏向大值(图 5.9:\(a/(a+b)=1/20\))。
5.7 随机变量函数的分布(The Distribution of a Function of a Random Variable)(PDF p.221–223)
基本方法:把 \(\{g(X)\le y\}\) 写成 \(X\) 属于某集合的事件,求 CDF 再求导。 例 7a: \(X\sim U(0,1)\),\(Y=X^n\):\(F_Y(y)=P\{X\le y^{1/n}\}=y^{1/n}\),\(f_Y(y)=\frac1ny^{1/n-1}\)(\(0\le y\le1\))。 例 7b: \(Y=X^2\):\(F_Y(y)=F_X(\sqrt y)-F_X(-\sqrt y)\),\(f_Y(y)=\frac1{2\sqrt y}[f_X(\sqrt y)+f_X(-\sqrt y)]\)(\(y\ge0\))。 例 7c: \(Y=|X|\):\(f_Y(y)=f_X(y)+f_X(-y)\)(\(y\ge0\))。
定理 7.1(单调变换的密度公式): \(X\) 有密度 \(f_X\),\(g\) 严格单调且可微,则 \(Y=g(X)\) 的密度
第 5 章小结(Summary)(PDF p.223–225)
复述:连续变量与密度、\(F'=f\)、期望与 LOTUS、方差;均匀 \((a,b)\):均值 \((a+b)/2\)、方差 \((b-a)^2/12\);正态参数即均值方差、标准化 \(Z=(X-\mu)/\sigma\);大 \(n\) 二项可用 \(N(np,np(1-p))\) 近似;指数:均值 \(1/\lambda\)、方差 \(1/\lambda^2\)、唯一无记忆、风险率为常数 \(\lambda\);风险率 \(\lambda(t)=f(t)/(1-F(t))\);伽马:均值 \(\alpha/\lambda\)、方差 \(\alpha/\lambda^2\);贝塔:均值 \(a/(a+b)\)、方差 \(ab/[(a+b)^2(a+b+1)]\)。
第 5 章习题概述(PDF p.225–232)
Problems 5.1–5.42: 由密度求常数与 CDF、判断函数能否为密度(5.1–5.8);连续型报童问题:最优备货 \(s^*\) 满足 \(F(s^*)=b/(b+\ell)\)(5.9);均匀分布应用:火车去向比例、线段分割比、维修站选址(5.10–5.13);正态计算:由两个分位数反求参数、给定尾概率求方差/分位点(5.15–5.21);正态近似二项/负二项(5.20–5.28,5.22 用“前 100 次发球成功少于 50”转换负二项事件;5.26 判断硬币是否有偏的两类错误;5.27 一万次抛出 5800 正面是否公平);二叉树股价模型(5.29:每期以 \(p=0.52\) 乘 \(u=1.012\)、否则乘 \(d=0.990\),1000 期后至少上涨 30% 的概率——用正态近似上涨次数);贝叶斯分类阈值(5.30);最小化 \(E|X-a|\) 的解为中位数(5.31);指数无记忆(5.32–5.34,5.34 对比均匀寿命);由风险率求生存概率(5.35–5.36,肺癌风险率 \(0.027+0.00025(t-40)^2\));变量变换:\(\log X\)、\(e^X\)、\(A\sin\theta\)(弹道)、对数正态的 \(cY\) 与 \(c+Y\)(5.37–5.42)。
理论习题 5.1–5.33: Maxwell 分子速度密度归一化;一般随机变量 \(E[Y]=\int_0^\infty P\{Y>y\}dy-\int_0^\infty P\{Y<-y\}dy\) 及一般 LOTUS 证明;\(E[X^n]=\int_0^\infty nx^{n-1}P\{X>x\}dx\)(5.5);不可数个概率 1 事件的交可为概率 0(5.6);\(\mathrm{SD}(aX+b)=|a|\sigma\);取值于 \([0,c]\) 的变量方差 \(\le c^2/4\)(5.8);正态对称性、拐点 \(\mu\pm\sigma\);Stein 恒等式 \(E[g'(Z)]=E[Zg(Z)]\) 及 \(E[Z^{n+1}]=nE[Z^{n-1}]\)、\(E[Z^4]=3\)(5.11);中位数、众数;指数缩放 \(cX\sim\) Exp(\(\lambda/c\));均匀/伽马/Weibull 的风险率单调性(伽马 \(\alpha\ge1\) 递增,Weibull \(\beta\ge1\) 递增);\(E[X^k]=k!/\lambda^k\);\(\Gamma(1/2)=\sqrt\pi\);Weibull 概率图:\(\log\log(1/(1-F))\) 对 \(\log x\) 为斜率 \(\beta\) 的直线、约 63.2% 观测小于 \(\alpha\);Weibull 与指数互变换;贝塔众数 \((a-1)/(a+b-2)\);概率积分变换(probability integral transform):\(Y=F(X)\sim U(0,1)\)(5.29);对数正态密度;两随机整数互素概率 \(6/\pi^2\)(Legendre 定理,5.32)。
自测题 5.1–5.22: 三角形密度的分段面积;密封投标最优报价(5.6,竞争者最低价 \(U(70,140)\));IQ、通勤迟到、轮胎寿命正态计算;收入分组的正态近似;指数服务时间;\(F(x)=1-e^{-x^2}\) 的风险率与矩;分段风险率的洗衣机寿命;\(1/X\) 仍为标准柯西(5.16);轮盘押单号长期盈利概率(5.17);指数混合的剩余寿命(5.18,混合后不再无记忆,存活越久越可能是低失效率类型);指数证据下的判决阈值;\(E[(Z-c)^+]=\frac{1}{\sqrt{2\pi}}e^{-c^2/2}-c(1-\Phi(c))\) 及一般正态版本(5.20,即看涨期权型损失函数);\(\Phi(-x)=1-\Phi(x)\) 辨析;均匀变换、\(\min(U,1-U)\sim U(0,1/2)\)。
第 5 章 本章要点
- 连续变量由密度描述,单点概率为 0,\(F'=f\),\(f(a)\varepsilon\approx P\{X\in a\pm\varepsilon/2\}\)。
- 期望 \(\int xf\),LOTUS \(\int g(x)f(x)dx\),非负变量尾积分公式 \(E[Y]=\int_0^\infty P\{Y>y\}dy\)。
- 非对称线性损失下最优决策为分位数(出发时间 \(F(t^*)=k/(k+c)\)、连续报童 \(F(s^*)=b/(b+\ell)\))。
- 均匀、正态、指数、伽马、Weibull、柯西、贝塔的密度、均值、方差与产生背景。
- 正态:线性变换封闭、标准化、\(\Phi\) 查表与对称性、68–95–99.7 规则;DeMoivre–Laplace 定理与连续性修正,\(np(1-p)\ge10\) 时近似良好。
- 指数:唯一无记忆、常数风险率,是泊松过程的等待时间;\(n\) 个等待时间之和为 Gamma(\(n,\lambda\))(Erlang)。
- 风险率 \(\lambda(t)=f/\bar F\) 唯一确定分布:\(\bar F(t)=\exp\{-\int_0^t\lambda\}\);风险率加倍意味着生存概率平方。
- 单调变换密度公式 \(f_Y(y)=f_X(g^{-1}(y))|dg^{-1}/dy|\);对数正态是股价比的标准模型。
第 5 章 与量化交易的关联
- 风险度量: 例 4f 直接给出正态假设下 VaR \(=2.33\sigma-\mu\)(99%),是参数法 VaR 的原型;例 5e 与 Laplace 分布、柯西分布提醒厚尾会显著放大尾部概率,正态 VaR 会低估风险。
- 资产价格模型: 例 7e 的对数正态价格比(\(S_n=S_{n-1}e^X\))是几何布朗运动与 Black–Scholes 的基础;习题 5.29 的二叉树模型(\(u,d,p\))在期数大时用正态近似,对应 CRR 二叉树向连续模型的收敛;自测 5.20 的 \(E[(X-c)^+]\) 就是正态标的看涨期权(Bachelier 模型)的期望收益,是期权定价公式的核心积分。
- 信用风险与生存分析: 风险率函数即违约强度(hazard rate);\(\bar F(t)=\exp\{-\int\lambda\}\) 是约化型信用模型中生存概率的公式;指数/Weibull/伽马用于违约时间、订单存活时间(限价单被成交或撤单前的存续时间)建模。
- 执行与微观结构: 指数分布刻画泊松到达的订单间隔;Erlang 分布刻画累计 \(n\) 笔成交所需时间。
- 统计检验与回测: 正态近似二项可用于检验胜率是否显著高于 50%(例 4i 的第一类错误思路)、计算所需样本量(例 4j:优势 2% 需约 1700 个样本才有 95% 把握),这对评估微弱 alpha 的统计显著性非常关键。
- 概率积分变换(理论习题 5.29) 是逆变换法生成随机数、Copula 建模与 PIT 检验(检验预测分布校准)的基础,蒙特卡洛模拟中常用。
- 贝塔分布 可作为胜率、回收率(recovery rate)等 [0,1] 变量的先验/模型。
- 中位数最小化绝对偏差(习题 5.31)对应稳健估计与分位数回归。
第 5 章 推荐习题
- 5.9(连续报童临界分位数)、5.31(\(E|X-a|\) 最小于中位数)——最优化与分位数。
- 5.17–5.19(由分位数反推正态参数)——实际校准正态模型。
- 5.26、5.27(硬币是否有偏)——假设检验两类错误,可类比策略胜率检验。
- 5.29(二叉树股价正态近似)——直接的金融应用。
- 5.35、5.36(由风险率求生存概率)——信用强度模型雏形。
- 理论 5.5(\(E[X^n]\) 的尾积分)、5.8(有界变量方差上界)、5.11(Stein 恒等式)、5.29(概率积分变换)。
- 自测 5.18(指数混合的剩余寿命)、5.20(\(E[(Z-c)^+]\),期权收益积分)。
第 6 章 联合分布随机变量(Jointly Distributed Random Variables)(PDF p.233–292,本块至 p.292,续见下一块)
章节目录:6.1 联合分布函数;6.2 独立随机变量;6.3 独立随机变量之和;6.4 条件分布:离散情形;6.5 条件分布:连续情形;6.6 次序统计量;6.7 随机变量函数的联合分布;6.8 可交换随机变量。
6.1 联合分布函数(Joint Distribution Functions)(PDF p.233–241)
联合累积分布函数(joint CDF): \(F(a,b)=P\{X\le a,Y\le b\}\)。边缘分布(marginal distributions):由概率连续性 \(F_X(a)=\lim_{b\to\infty}F(a,b)=F(a,\infty)\),\(F_Y(b)=F(\infty,b)\)。 所有联合概率原则上可由 \(F\) 求出,如
- \(i=0\): 10, 40, 30, 4(行和 84);\(i=1\): 30, 60, 18, 0(108);\(i=2\): 15, 12, 0, 0(27);\(i=3\): 1, 0, 0, 0(1);
- 列和 \(P\{Y=j\}\): 56, 112, 48, 4。 行和给出 \(X\) 的 PMF、列和给出 \(Y\) 的 PMF,写在表的边缘,因而称边缘 PMF。 例 1b: 家庭有 0/1/2/3 个孩子的概率 0.15/0.20/0.35/0.30,男女各 1/2 独立。男孩数 \(B\)、女孩数 \(G\) 的联合 PMF(表 6.2),如 \(P\{B=0,G=0\}=0.15\),\(P\{B=0,G=1\}=0.20\times\frac12=0.10\),\(P\{B=0,G=2\}=0.35\times\frac14=0.0875\),\(P\{B=1,G=1\}=0.175\) 等;边缘 \(P\{B=i\}\): 0.375, 0.3875, 0.2, 0.0375(与 \(G\) 相同)。
联合连续: 存在 \(f(x,y)\) 使对平面中任意集合 \(C\),\(P\{(X,Y)\in C\}=\iint_Cf(x,y)dxdy\) (1.3),\(f\) 为联合概率密度(joint PDF)。\(P\{X\in A,Y\in B\}=\int_B\int_Af\,dxdy\) (1.4);\(f(a,b)=\frac{\partial^2}{\partial a\partial b}F(a,b)\);\(P\{a<X<a+da,b<Y<b+db\}\approx f(a,b)dadb\)。边缘密度 \(f_X(x)=\int f(x,y)dy\),\(f_Y(y)=\int f(x,y)dx\)。
例 1c: \(f(x,y)=2e^{-x}e^{-2y}\)(\(x,y>0\)):(a) \(P\{X>1,Y<1\}=e^{-1}(1-e^{-2})\);(b) \(P\{X<Y\}=\int_0^\infty2e^{-2y}(1-e^{-y})dy=1-2/3=1/3\);(c) \(P\{X<a\}=1-e^{-a}\)。 例 1d(圆内均匀点): 半径 \(R\) 圆内均匀,\(f=c\),\(c=1/(\pi R^2)\);边缘 \(f_X(x)=\frac{2}{\pi R^2}\sqrt{R^2-x^2}\)(\(|x|\le R\)),\(Y\) 同;到原点距离 \(D\):\(F_D(a)=a^2/R^2\),\(f_D(a)=2a/R^2\),\(E[D]=2R/3\)。(注:\(X,Y\) 边缘不是均匀的。) 例 1e(比值的分布): \(f(x,y)=e^{-(x+y)}\),\(F_{X/Y}(a)=\int_0^\infty(1-e^{-ay})e^{-y}dy=1-\frac1{a+1}\),\(f_{X/Y}(a)=1/(a+1)^2\)(\(a>0\))。 \(n\) 维推广: \(F(a_1,\dots,a_n)=P\{X_1\le a_1,\dots,X_n\le a_n\}\);联合密度对 \(n\) 维集合积分。
例 1f(多项分布 multinomial distribution): \(n\) 次独立同分布试验,每次结果为 \(r\) 类之一,概率 \(p_1,\dots,p_r\),\(X_i\)=第 \(i\) 类出现次数:
6.2 独立随机变量(Independent Random Variables)(PDF p.241–252)
定义: 对任意实数集 \(A,B\),\(P\{X\in A,Y\in B\}=P\{X\in A\}P\{Y\in B\}\) (2.1)。等价于 \(F(a,b)=F_X(a)F_Y(b)\) 对一切 \(a,b\);离散时等价于 \(p(x,y)=p_X(x)p_Y(y)\) (2.2)(证明:一点集推出 (2.2);反之对 \(A\times B\) 求和可分解);连续时等价于 \(f(x,y)=f_X(x)f_Y(y)\)。不独立称为相依(dependent)。直观:知道一个的值不改变另一个的分布。
例 2a: \(n+m\) 次独立试验,前 \(n\) 次成功数 \(X\) 与后 \(m\) 次成功数 \(Y\) 独立;但 \(X\) 与总成功数 \(Z\) 相依。 例 2b(泊松分拆 / 稀疏化): 到达邮局人数 ~ Poisson(\(\lambda\)),每人独立以 \(p\) 为男性。对 \(X+Y\) 条件化:
命题 2.1(因子分解判据): 连续(离散)\(X,Y\) 独立 ⇔ 联合密度(PMF)可写成 \(f(x,y)=h(x)g(y)\)(对所有 \(x,y\))。证明:\(1=C_1C_2\),\(C_1=\int h\),\(C_2=\int g\);\(f_X=C_2h\),\(f_Y=C_1g\),故 \(f=f_Xf_Y\)。 例 2f: \(f=6e^{-2x}e^{-3y}\)(\(x,y>0\))可分解,独立(分别为速率 2、3 的指数)。\(f=24xy\)(\(0<x,y<1\),\(x+y<1\))不独立:支撑集不是乘积形,\(f=24xyI(x,y)\) 无法分解。误区: 只看函数形式而忽略支撑集。
\(n\) 个变量独立: 对所有 \(A_i\),\(P\{X_i\in A_i,\forall i\}=\prod P\{X_i\in A_i\}\),等价于 CDF 乘积形式;无穷族独立指任意有限子族独立。 例 2g(计算机如何随机选子集,算法): 要从 \(\{1..n\}\) 等可能选 \(k\) 元子集。生成独立 \(U_1,\dots,U_n\sim U(0,1)\),令
6.3 独立随机变量之和(Sums of Independent Random Variables)(PDF p.252–260)
\(X,Y\) 独立连续:
6.3.1 同分布均匀变量之和
例 3a: \(X,Y\sim U(0,1)\) 独立:\(f_{X+Y}(a)=a\)(\(0\le a\le1\)),\(2-a\)(\(1<a<2\)),称三角分布(triangular distribution)(图 6.3)。 \(n\) 个均匀之和: \(F_n(x)=P\{X_1+\cdots+X_n\le x\}=x^n/n!\)(\(0\le x\le1\)),归纳:\(F_n(x)=\int_0^xF_{n-1}(x-y)dy=\frac{1}{(n-1)!}\int_0^x(x-y)^{n-1}dy\)。 应用: \(N=\min\{n:X_1+\cdots+X_n>1\}\),\(P\{N>n\}=F_n(1)=1/n!\),\(P\{N=n\}=\frac1{(n-1)!}-\frac1{n!}=\frac{n-1}{n!}\),
6.3.2 伽马随机变量
命题 3.1: \(X\sim\) Gamma(\(s,\lambda\)),\(Y\sim\) Gamma(\(t,\lambda\)) 独立,则 \(X+Y\sim\) Gamma(\(s+t,\lambda\))(同 \(\lambda\) 下卷积封闭)。证明:卷积积分代换 \(x=y/a\),得 \(f_{X+Y}(a)=Ce^{-\lambda a}a^{s+t-1}\),常数由归一化确定。归纳:\(\sum X_i\sim\) Gamma(\(\sum t_i,\lambda\))。 例 3b: \(n\) 个独立 Exp(\(\lambda\)) 之和 ~ Gamma(\(n,\lambda\))(Exp = Gamma(1,λ))。 卡方分布: \(Z_i\) 独立标准正态,\(Y=\sum_{i=1}^nZ_i^2\) 称自由度 \(n\) 的**卡方(chi-squared)**分布。\(n=1\) 时由第 5 章例 7b:\(f_{Z^2}(y)=\frac{1}{2\sqrt y}\frac{2}{\sqrt{2\pi}}e^{-y/2}=\frac{\frac12e^{-y/2}(y/2)^{-1/2}}{\sqrt\pi}\),即 Gamma(1/2, 1/2),副产品 \(\Gamma(1/2)=\sqrt\pi\)。由命题 3.1,\(\chi^2_n=\) Gamma(\(n/2,1/2\)):
6.3.3 正态随机变量
命题 3.2: \(X_i\sim N(\mu_i,\sigma_i^2)\) 独立,则 \(\sum X_i\sim N(\sum\mu_i,\sum\sigma_i^2)\)。 证明:先设 \(X\sim N(0,\sigma^2)\)、\(Y\sim N(0,1)\),令 \(c=\frac{1+\sigma^2}{2\sigma^2}\),对卷积被积函数配方:\(f_X(a-y)f_Y(y)=\frac{1}{2\pi\sigma}e^{-a^2/2\sigma^2}\exp\{-c(y^2-2y\frac{a}{1+\sigma^2})\}\),积分后 \(f_{X+Y}(a)=C\exp\{-a^2/2(1+\sigma^2)\}\),即 \(N(0,1+\sigma^2)\)。一般两变量:\(X_1+X_2=\sigma_2[\frac{X_1-\mu_1}{\sigma_2}+\frac{X_2-\mu_2}{\sigma_2}]+\mu_1+\mu_2\),化为前述情形得方差 \(\sigma_2^2(1+\sigma_1^2/\sigma_2^2)=\sigma_1^2+\sigma_2^2\)。再对 \(n\) 归纳。 例 3c(篮球赛季): 44 场,26 场对 A 类(胜率 0.4)、18 场对 B 类(胜率 0.7),独立。\(E[X_A]=10.4\),\(\mathrm{Var}=6.24\);\(E[X_B]=12.6\),\(\mathrm{Var}=3.78\)。正态近似+命题 3.2:\(X_A+X_B\approx N(23,10.02)\),\(P\{\ge25\}=P\{\ge24.5\}\approx1-\Phi(0.4739)\approx0.3178\);\(X_A-X_B\approx N(-2.2,10.02)\),\(P\{X_A-X_B\ge1\}=P\{\ge0.5\}\approx1-\Phi(0.8530)\approx0.1968\)。(差的方差也是方差之和。) 对数正态: \(\log Y\sim N(\mu,\sigma^2)\)。 例 3d(周价格模型): 周价格比 \(S(n)/S(n-1)\) i.i.d. 对数正态,\(\mu=0.0165\),\(\sigma=0.0730\)。(a) 一周上涨概率 \(P\{Z>-0.0165/0.0730\}=P\{Z<0.2260\}=0.5894\),连续两周都涨 \(0.5894^2=0.3474\)。(b) 两周后高于今天:两周对数收益之和 \(\sim N(0.0330,2(0.0730)^2)\),\(P\{Z<0.0330/(0.0730\sqrt2)=0.31965\}=0.6254\)。(对数收益可加是对数正态模型的关键便利。)
6.3.4 泊松与二项随机变量
例 3e: 独立 Poisson(\(\lambda_1\))、Poisson(\(\lambda_2\)) 之和:\(P\{X+Y=n\}=\sum_k e^{-\lambda_1}\frac{\lambda_1^k}{k!}e^{-\lambda_2}\frac{\lambda_2^{n-k}}{(n-k)!}=e^{-(\lambda_1+\lambda_2)}\frac{(\lambda_1+\lambda_2)^n}{n!}\)(二项式定理),即 Poisson(\(\lambda_1+\lambda_2\))。 例 3f: 独立 \(\mathrm{Bin}(n,p)\)、\(\mathrm{Bin}(m,p)\) 之和为 \(\mathrm{Bin}(n+m,p)\)——由试验解释直接得到;解析验证用范德蒙恒等式 \(\binom{n+m}{k}=\sum_i\binom ni\binom m{k-i}\)。(注意 \(p\) 必须相同。)
6.4 条件分布:离散情形(Conditional Distributions: Discrete Case)(PDF p.261–263)
条件 PMF: \(p_Y(y)>0\) 时
6.5 条件分布:连续情形(Conditional Distributions: Continuous Case)(PDF p.263–269)
条件密度: \(f_Y(y)>0\) 时 \(f_{X|Y}(x|y)=\dfrac{f(x,y)}{f_Y(y)}\)。动机:\(f_{X|Y}(x|y)dx=\frac{f(x,y)dxdy}{f_Y(y)dy}\approx P\{x\le X\le x+dx\mid y\le Y\le y+dy\}\)。于是 \(P\{X\in A|Y=y\}=\int_Af_{X|Y}(x|y)dx\),条件 CDF \(F_{X|Y}(a|y)=\int_{-\infty}^af_{X|Y}(x|y)dx\)——即使条件事件 \(\{Y=y\}\) 概率为 0 也能给出可操作的条件概率。独立时 \(f_{X|Y}=f_X\)。
例 5a: \(f(x,y)=\frac{12}5x(2-x-y)\)(单位正方形),\(f_{X|Y}(x|y)=\frac{x(2-x-y)}{\int_0^1x(2-x-y)dx}=\frac{x(2-x-y)}{2/3-y/2}=\frac{6x(2-x-y)}{4-3y}\)。 例 5b: \(f(x,y)=e^{-x/y}e^{-y}/y\)(\(x,y>0\)),\(f_{X|Y}(x|y)=\frac1ye^{-x/y}\)(给定 \(Y=y\) 时 \(X\) 为均值 \(y\) 的指数),\(P\{X>1|Y=y\}=e^{-1/y}\)。 例 5c(t 分布 t-distribution): \(Z\sim N(0,1)\) 与 \(Y\sim\chi^2_n\) 独立,\(T=Z/\sqrt{Y/n}\) 称自由度 \(n\) 的 t 分布(7.8 节用于统计推断)。求密度:给定 \(Y=y\),\(T=\sqrt{n/y}Z\sim N(0,n/y)\),\(f_{T|Y}(t|y)=\frac{1}{\sqrt{2\pi n/y}}e^{-t^2y/2n}\);乘以卡方密度得联合密度,令 \(c=\frac{t^2+n}{2n}\),对 \(y\) 积分(代换 \(x=cy\) 化为伽马积分):
- 条件分布:把与 \(x\) 无关的因子并入常数 \(C_i\),对 \(x\) 配方,得
\[X\mid Y=y\ \sim\ N\Big(\mu_x+\rho\frac{\sigma_x}{\sigma_y}(y-\mu_y),\ \sigma_x^2(1-\rho^2)\Big)\]对称地 \(Y|X=x\sim N(\mu_y+\rho\frac{\sigma_y}{\sigma_x}(x-\mu_x),\sigma_y^2(1-\rho^2))\)。条件均值关于条件值线性(回归线),条件方差不依赖条件值且缩小为 \((1-\rho^2)\) 倍。
- 二元正态 \(X,Y\) 独立 ⇔ \(\rho=0\)(只有此时密度可分解)。
- 边缘:令 \(w=(y-\mu_y)/\sigma_y\),对 \(w\) 配方积分,得 \(X\sim N(\mu_x,\sigma_x^2)\),\(Y\sim N(\mu_y,\sigma_y^2)\)。(\(\rho\) 的含义为相关系数,第 7 章证明。)
混合型条件分布: \(X\) 连续(密度 \(f\))、\(N\) 离散时
6.6* 次序统计量(Order Statistics)(PDF p.269–272)
\(X_1,\dots,X_n\) i.i.d. 连续(密度 \(f\)、CDF \(F\)),排序后 \(X_{(1)}\le\cdots\le X_{(n)}\) 称次序统计量(\(X_{(1)}\) 最小,\(X_{(n)}\) 最大)。 联合密度: \((X_{(1)},\dots,X_{(n)})=(x_1,\dots,x_n)\) 当且仅当 \((X_1,\dots,X_n)\) 等于其 \(n!\) 个排列之一,每个排列密度为 \(\prod f(x_i)\):
6.7 随机变量函数的联合分布(Joint Probability Distribution of Functions of Random Variables)(PDF p.273–279)
\(Y_1=g_1(X_1,X_2)\),\(Y_2=g_2(X_1,X_2)\),条件:(1) 方程组可唯一反解 \(x_1=h_1(y_1,y_2),x_2=h_2(y_1,y_2)\);(2) \(g_1,g_2\) 有连续偏导,且雅可比行列式(Jacobian)
例 7a(和与差): \(Y_1=X_1+X_2\),\(Y_2=X_1-X_2\),\(J=-2\),\(f_{Y_1,Y_2}=\frac12f_{X_1,X_2}(\frac{y_1+y_2}2,\frac{y_1-y_2}2)\)。
- 独立均匀:在 \(0\le y_1+y_2\le2,0\le y_1-y_2\le2\) 上密度 1/2;
- 独立指数 \(\lambda_1,\lambda_2\):\(\frac{\lambda_1\lambda_2}2\exp\{-\lambda_1\frac{y_1+y_2}2-\lambda_2\frac{y_1-y_2}2\}\);
- 独立标准正态:\(f=\frac1{4\pi}e^{-(y_1^2+y_2^2)/4}=\frac{1}{\sqrt{4\pi}}e^{-y_1^2/4}\cdot\frac{1}{\sqrt{4\pi}}e^{-y_2^2/4}\),故 \(X_1+X_2\) 与 \(X_1-X_2\) 都是 \(N(0,2)\) 且相互独立。(可证:i.i.d. 时 \(X_1+X_2\) 与 \(X_1-X_2\) 独立当且仅当分布为正态——Bernstein 定理。)
例 7b(极坐标与 Box–Muller 方法): \(X,Y\) 独立标准正态,\(R=\sqrt{X^2+Y^2}\),\(\Theta=\tan^{-1}(Y/X)\)。在第一象限 \(J=1/r\),条件密度 \(\frac2\pi re^{-r^2/2}\);四个象限平均得
\[f(r,\theta)=\frac{1}{2\pi}re^{-r^2/2},\quad0<\theta<2\pi,\ r>0\]故 \(R\) 与 \(\Theta\) 独立,\(\Theta\sim U(0,2\pi)\),\(R\) 服从 Rayleigh 分布 \(f(r)=re^{-r^2/2}\)(平面射击误差的绝对值)。令 \(D=R^2\),\(J=2\),\(f(d,\theta)=\frac12e^{-d/2}\cdot\frac1{2\pi}\):\(R^2\sim\) Exp(1/2),验证了 \(\chi^2_2\) = Exp(1/2)。 Box–Muller 生成正态随机数(算法): \(U_1,U_2\) 独立 \(U(0,1)\);\(-2\log U_1\sim\) Exp(1/2)(因 \(P\{-2\log U_1<x\}=1-e^{-x/2}\)),\(2\pi U_2\sim U(0,2\pi)\);令\[X_1=\sqrt{-2\log U_1}\cos(2\pi U_2),\qquad X_2=\sqrt{-2\log U_1}\sin(2\pi U_2)\]则 \(X_1,X_2\) 为独立标准正态。 例 7c(伽马—贝塔关系): \(X\sim\) Gamma(\(\alpha,\lambda\))、\(Y\sim\) Gamma(\(\beta,\lambda\)) 独立,\(U=X+Y\),\(V=X/(X+Y)\)。\(J=-1/(x+y)\),反解 \(x=uv,y=u(1-v)\):\[f_{U,V}(u,v)=\frac{\lambda e^{-\lambda u}(\lambda u)^{\alpha+\beta-1}}{\Gamma(\alpha+\beta)}\cdot\frac{v^{\alpha-1}(1-v)^{\beta-1}\Gamma(\alpha+\beta)}{\Gamma(\alpha)\Gamma(\beta)}\]故 \(U\sim\) Gamma(\(\alpha+\beta,\lambda\)) 与 \(V\sim\) Beta(\(\alpha,\beta\)) 独立,并顺带证明 \(B(\alpha,\beta)=\Gamma(\alpha)\Gamma(\beta)/\Gamma(\alpha+\beta)\)。解释:\(n+m\) 件各需 Exp(\(\lambda\)) 时间的工作,工人 I 做 \(n\) 件、II 做 \(m\) 件,I 完成的工作量比例 ~ Beta(\(n,m\)),且与总耗时独立。 \(n\) 维推广: \(Y_i=g_i(X_1,\dots,X_n)\),雅可比行列式非零、可唯一反解时\[f_{Y_1,\dots,Y_n}(y_1,\dots,y_n)=f_{X_1,\dots,X_n}(x_1,\dots,x_n)|J(x_1,\dots,x_n)|^{-1}\tag{7.3}\]例 7d: \(X_1,X_2,X_3\) 独立标准正态,\(Y_1=X_1+X_2+X_3\),\(Y_2=X_1-X_2\),\(Y_3=X_1-X_3\),\(J=3\),反解 \(X_1=\frac{Y_1+Y_2+Y_3}3\),\(X_2=\frac{Y_1-2Y_2+Y_3}3\),\(X_3=\frac{Y_1+Y_2-2Y_3}3\),\[f_{Y}(y_1,y_2,y_3)=\frac{1}{3(2\pi)^{3/2}}e^{-Q/2},\quad Q=\frac{y_1^2}3+\frac23y_2^2+\frac23y_3^2-\frac23y_2y_3\](\(Q\) 中无 \(y_1\) 与 \(y_2,y_3\) 的交叉项:样本和与样本偏差独立,是样本均值与样本方差独立的雏形。) 例 7e(指数部分和): \(X_i\) i.i.d. Exp(\(\lambda\)),\(Y_i=X_1+\cdots+X_i\)。雅可比为下三角全 1 矩阵,\(J=1\),\[f_{Y_1,\dots,Y_n}(y_1,\dots,y_n)=\lambda^ne^{-\lambda y_n},\quad0<y_1<\cdots<y_n\](即泊松过程前 \(n\) 个到达时刻的联合密度。)逐个积掉 \(y_1,y_2,\dots\) 得 \(f_{Y_n}(y)=\lambda^n\frac{y^{n-1}}{(n-1)!}e^{-\lambda y}\),与例 3b 一致(Gamma(\(n,\lambda\)))。
6.8* 可交换随机变量(Exchangeable Random Variables)(PDF p.280–282)
定义: 对 \(1..n\) 的任意排列 \(i_1,\dots,i_n\),\(P\{X_{i_1}\le x_1,\dots,X_{i_n}\le x_n\}=P\{X_1\le x_1,\dots,X_n\le x_n\}\),即无论以何种顺序观察,联合分布相同。离散情形等价于联合 PMF \(p(x_1,\dots,x_n)\) 是对称函数。(i.i.d. 必可交换,反之不然。) 例 8a(不放回抽球): \(n\) 球中 \(k\) 个特殊,逐个不放回等可能抽取,\(X_i=1\) 若第 \(i\) 个是特殊球。以 \((1,1,0,1,0,\dots,0,1)\) 为例,\(p=\frac kn\cdot\frac{k-1}{n-1}\cdot\frac{n-k}{n-2}\cdot\frac{k-2}{n-3}\cdots\);一般地分母从 \(n\) 递减到 1,第 \(i\) 次出现 1 处分子为 \(k-(i-1)\),第 \(i\) 次出现 0 处分子为 \(n-k-(i-1)\),故
第 6 章小结(Summary)(PDF p.283)
复述:联合 CDF 及边缘 \(F_X(x)=\lim_{y\to\infty}F(x,y)\);联合 PMF/PDF 及边缘;\(f(x,y)dxdy\approx\) 小矩形概率;独立定义与因子分解判据;卷积公式 \(F_{X+Y}(a)=\int F_X(a-y)f_Y(y)dy\);独立正态之和为正态(均值、方差相加),独立泊松之和为泊松(参数相加);离散与连续条件分布;次序统计量联合密度 \(n!\prod f(x_i)\);可交换性定义。
第 6 章习题概述(PDF p.284–292,自测题可能延续至下一块)
Problems 6.1–6.61(PDF p.284–288): 由骰子/抽球构造联合 PMF(6.1–6.7,含有放回与不放回对比、几何间隔);给定联合密度求常数、边缘、期望、\(P\{X>Y\}\) 等(6.8–6.10、6.19–6.23);多项分布(6.11 电视店顾客);泊松分拆的条件概率(6.12);会面问题(6.13)、救护车距离(6.14);区域均匀分布、正方形内落入单位圆概率 \(\pi/4\)(6.15);\(n\) 点落在某半圆内的概率(6.16,答案 \(n/2^{n-1}\));直线上三点、中点两侧两点的距离(6.17–6.18);独立性判断(6.20、6.22–6.23、6.24 的 \(N\) 与 \(X\) 独立);\(10^6\) 人均匀到达的泊松近似(6.25);随机系数二次方程有实根概率(6.26);指数比值分布与 \(P\{X_1<X_2\}=\lambda_1/(\lambda_1+\lambda_2)\)(6.27);排队服务(6.28);正态和/差的应用:周销售、保龄球、早餐调查、月销售(6.29–6.32);泊松可加性(6.33–6.34);条件 PMF(6.35–6.40);条件密度与乘积分布(6.41–6.42);泊松—伽马共轭与保险事故率的贝叶斯更新(6.43,后验 Gamma,下年期望事故数);三个均匀中最大者大于其余之和(6.44);5 取 3 系统寿命——次序统计量(6.45);卡车间距 \((1-2d/L)^3\)(6.46);5 个均匀样本中位数(6.47);指数最小值与最大值(6.48);构造二元正态(6.50);极坐标、Box–Muller 直接验证(6.52–6.54);各种雅可比变换(6.55–6.59);可交换性证明(6.60–6.61)。
理论习题 6.1–6.35(PDF p.288–290): 验证矩形公式 (1.2);多类泊松分拆:各类计数为独立 Poisson(\(\lambda p_i\))(6.2);用 Buffon 投针估计 \(\pi\) 及长针情形(6.3–6.4);比值与乘积的密度(6.5);相依变量和的密度 \(\int f(x,t-x)dx\)(6.6);伽马缩放、\(\frac1{2\lambda}\chi^2_{2n}\sim\) Gamma(\(n,\lambda\))(6.7);独立变量最小值的风险率等于风险率之和(6.8),\(n\) 个指数最小值为 Exp(\(n\lambda\))(6.9);手电筒电池(6.10);\(P\{X_1<\cdots<X_5\}=1/5!\) 与分布无关(6.11);\(n\) 维因子分解判据(6.12);后验与成功的具体位置无关(6.13);独立几何给定和的条件分布为离散均匀(6.14);二项给定和的条件分布为超几何(6.16);二元泊松分布(6.17);由两个条件分布恢复联合分布(6.18);i.i.d. 比较的条件概率(6.19);泊松—伽马、指数—伽马共轭(6.21–6.22);随机矩阵存在鞍点的概率(6.23,博弈论);指数整数部分与小数部分独立(6.24);\(F^n\) 与 \(1-(1-F)^n\) 为 CDF(最大值、最小值,6.25);\(n\) 人间距问题(6.26);均匀样本中位数 ~ Beta(\(n+1,n+1\))(6.28);极差、间距 \(P\{X_{(k)}-X_{(k-1)}>t\}=(1-t)^n\)(6.30–6.31);新观测超过样本最大值的概率 \(1/(n+1)\) 等(6.32);中程数(midrange)分布(6.33–6.34);正态比值为柯西(6.35)。
自测题 6.1–6.21(PDF p.290–292): 不均匀骰子的多项分布(6.1);离散联合 PMF 的期望;三角区域密度;多项分布的分组合并仍为多项(6.4);共同冲击模型与二元指数分布(6.8,Marshall–Olkin:\(P\{X_1>s,X_2>t\}=e^{-\lambda_1s-\lambda_2t-\lambda_3\max(s,t)}\));接受—拒绝抽样选取等可能广告(6.9–6.10,按 \(n(X)/n\) 接受页面,迭代次数为几何分布);首个超过 \(c\) 的均匀变量的序号与其值独立(6.11);飞镖靶几何概率(6.12);NBA 分差正态模型(6.13:每节主队净胜分 \(N(1.5,6)\) 独立,求获胜概率及半场落后 5 分时的条件胜率);几何—伽马混合的后验(6.14);最高价拍卖的最优出价(6.16);随机向量为排列的概率(6.17);两个随机 0-1 排列的汉明距离(6.18);正态随机游走的条件分布:给定 \(S_n=x\) 时 \(S_k\sim N(xk/n,k(n-k)/n)\)(6.19,布朗桥离散版);记录值条件概率(6.20);\(P\{X\le s,Y\le t\}\) 恒等式(6.21)。(续见下一块:第 6 章若有剩余自测题,以及第 7 章。)
第 6 章 本章要点(本块范围内)
- 联合 CDF/PMF/PDF 与边缘分布;矩形概率公式 (1.2);多项分布及其合并、条件性质。
- 独立 ⇔ 联合分布(PMF/PDF)因子分解,注意支撑集必须是乘积形;独立性可逐步建立、可反向判断。
- 卷积公式;同 \(\lambda\) 伽马、正态、泊松、同 \(p\) 二项的可加性;\(\chi^2_n=\) Gamma(\(n/2,1/2\));\(n\) 个均匀和 ≤1 的概率 \(x^n/n!\),平均 \(e\) 个均匀数之和超 1。
- 泊松分拆:泊松总数按概率分类后各类独立泊松;反之给定总和的条件分布为二项。
- 条件分布:离散 \(p(x,y)/p_Y(y)\),连续 \(f(x,y)/f_Y(y)\);二元正态条件分布为正态,条件均值线性、条件方差 \(\sigma_x^2(1-\rho^2)\);\(\rho=0\) ⇔ 独立;t 分布的推导;贝塔—二项共轭。
- 次序统计量:联合密度 \(n!\prod f\);\(X_{(j)}\) 密度与 CDF(二项尾);两次序统计量联合密度;极差分布。
- 雅可比变换法 \(f_Y=f_X|J|^{-1}\);极坐标得 Rayleigh 与 Box–Muller;伽马和与比例独立(Gamma/Beta)。
- 可交换性:不放回抽样、Pólya 罐、均匀间距均可交换而不独立;可交换 ⇒ 边缘同分布。
第 6 章 与量化交易的关联
- 组合与风险建模: 二元正态(例 5d)是资产收益联合建模的起点;条件分布 \(X|Y\sim N(\mu_x+\rho\frac{\sigma_x}{\sigma_y}(y-\mu_y),\sigma_x^2(1-\rho^2))\) 就是 beta 回归/对冲比率 \(\rho\sigma_x/\sigma_y\) 与残差风险 \((1-\rho^2)\sigma_x^2\) 的概率基础,用于最小方差对冲、配对交易和条件 VaR/压力情景(给定市场下跌 \(y\) 时个股的条件分布)。
- 收益聚合: 独立正态之和为正态(命题 3.2)与例 3d 的对数正态周收益,支撑“对数收益按时间相加、波动率按 \(\sqrt T\) 缩放”的多期风险换算;例 3d 本身就是计算多周上涨概率的范例。
- 蒙特卡洛模拟: Box–Muller(例 7b)用于生成正态随机数;例 2g 的顺序抽样算法可用于从股票池中无偏抽取随机子集(随机组合基准、bootstrap);接受—拒绝抽样(自测 6.9)是一般抽样方法的雏形。
- 统计推断: t 分布(例 5c)与卡方分布是检验因子收益均值、IC 显著性(t 统计量)、方差检验的基础;例 7d 体现样本均值与偏差独立,对应 t 统计量构造的合理性。
- 贝叶斯更新: 贝塔—二项(例 5e)可用于胜率的后验估计与收缩;泊松—伽马共轭(习题 6.43、理论 6.21)用于事件到达率(违约、成交、跳跃次数)的贝叶斯估计。
- 订单流与事件建模: 泊松分拆(例 2b、理论 6.2)用于把总订单流拆成买/卖单或不同类型订单,各自仍为独立泊松;指数最小值与风险率相加(理论 6.8–6.9)用于竞争风险(多个违约原因、多个对手方中首个违约);共同冲击二元指数(自测 6.8)是相关违约建模(Marshall–Olkin copula)的原型。
- 次序统计量: 用于极值与回撤分析(样本最大/最小收益)、分位数估计(经验 VaR 是次序统计量)、多重检验中“最好策略”的分布(选取最大夏普的偏差);极差分布可用于基于高低价的波动率估计思想。
- 可交换性: 置换检验(permutation test)的前提;Pólya 罐描述“强者恒强”的路径依赖(可类比动量/羊群效应模型),但需谨慎类比。
- Buffon 投针、多数几何概率与量化无直接关联,主要用于训练积分技巧。
第 6 章 推荐习题(本块范围内)
- 6.16(\(n\) 点同在半圆)——巧妙的事件分解与互斥性。
- 6.27(指数比值、\(P\{X_1<X_2\}\))——竞争到达的基本结论。
- 6.29–6.32(正态和差应用)——多期收益聚合的直接练习。
- 6.43(泊松—伽马贝叶斯)——强度参数的后验更新。
- 6.45、6.47–6.48(次序统计量)——系统寿命、中位数、极值。
- 6.54、6.56(雅可比与 Box–Muller)——变量变换与模拟。
- 理论 6.2(多类泊松分拆)、6.8(最小值风险率可加)、6.16(二项条件为超几何)、6.21–6.22(共轭)、6.31–6.32(间距与新观测排名)。
- 自测 6.8(Marshall–Olkin 二元指数)、6.9(接受—拒绝抽样)、6.13(分差正态模型的条件胜率)、6.19(正态随机游走的条件分布/布朗桥)。