量化交易中文教材

元信息:Sheldon Ross《A First Course in Probability》|精读范围:PDF 第 293–484 页(第 7 章 期望的性质、第 8 章 极限定理、第 9 章 概率论的其他专题、第 10 章 模拟、附录 A 习题答案、附录 B 自测题解答)|书内页码 = PDF 页码 − 13

第 7 章 期望的性质(Properties of Expectation)

本章目录:7.1 引言;7.2 和的期望;7.3 发生事件个数的矩;7.4 协方差、和的方差与相关系数;7.5 条件期望;7.6 条件期望与预测;7.7 矩母函数;7.8 正态随机变量的更多性质;7.9 期望的一般定义。

7.1 引言(PDF p.293–294)

回顾期望(expected value)的定义:离散型 \(E[X]=\sum_x x\,p(x)\),连续型 \(E[X]=\int_{-\infty}^{\infty}x f(x)\,dx\)。期望是 \(X\) 取值的加权平均,因此若 \(P\{a\le X\le b\}=1\),则 \(a\le E[X]\le b\)。证明(离散):\(p(x)=0\) 在 \([a,b]\) 外,故 \(E[X]=\sum_{x:p(x)>0}x p(x)\ge \sum a\,p(x)=a\);上界同理;连续情形类似。

7.2 随机变量之和的期望(PDF p.294–310)

命题 2.1(二元函数期望公式):若 \((X,Y)\) 有联合概率质量函数 \(p(x,y)\),则 \(E[g(X,Y)]=\sum_y\sum_x g(x,y)p(x,y)\);若有联合密度 \(f(x,y)\),则 \(E[g(X,Y)]=\iint g(x,y)f(x,y)\,dx\,dy\)。

证明思路(连续、\(g\ge0\)):利用第 5 章引理 2.1 \(E[Z]=\int_0^\infty P\{Z>t\}dt\),写 \(P\{g(X,Y)>t\}=\iint_{g(x,y)>t}f\,dy\,dx\),交换积分次序得 \(\int_x\int_y\int_0^{g(x,y)}dt\,f\,dy\,dx=\iint g f\)。一般情形分解正负部(同一维情形)。

例 2a(救护车距离):事故点 \(X\)、救护车位置 \(Y\) 独立且均匀分布于 \((0,L)\),求 \(E|X-Y|\)。\(\int_0^L|x-y|dy=\frac{L^2}{2}+x^2-xL\),再对 \(x\) 积分除以 \(L^2\),得 \(E|X-Y|=L/3\)。

期望的线性性:取 \(g=x+y\),连续情形下 \(E[X+Y]=\iint(x+y)f=\int x f_X+\int y f_Y=E[X]+E[Y]\)。一般地只要 \(E[X],E[Y]\) 有限:

\[E[X+Y]=E[X]+E[Y]\quad(2.1)\]
注意:不要求独立。 归纳得 \(E[X_1+\cdots+X_n]=\sum E[X_i]\)(2.2)。

例 2b:若 \(X\ge Y\)(逐样本点成立),则 \(X-Y\ge0\),故 \(E[X]\ge E[Y]\)(期望的单调性)。

例 2c(样本均值 sample mean):\(X_1,\dots,X_n\) i.i.d.,分布 \(F\)、均值 \(\mu\),称为来自 \(F\) 的样本。\(\bar X=\sum X_i/n\),\(E[\bar X]=\mu\)。即样本均值是 \(\mu\) 的无偏估计,常用来估计未知总体均值。

例 2d(Boole 不等式):令 \(X_i=I(A_i)\),\(X=\sum X_i\) 为发生事件数,\(Y=I(X\ge1)\)。\(X\ge Y\Rightarrow E[X]\ge E[Y]\),即

\[P\Big(\bigcup_{i=1}^n A_i\Big)\le\sum_{i=1}^n P(A_i).\]

例 2e(二项分布均值):\(X=\sum_{i=1}^n X_i\),\(X_i\) 为第 \(i\) 次试验成功的示性变量(Bernoulli),\(E[X]=np\)。

例 2f(负二项分布均值):凑齐 \(r\) 次成功所需试验数 \(X=X_1+\cdots+X_r\),\(X_i\) 为第 \(i-1\) 次成功后到第 \(i\) 次成功所需附加试验数,各为参数 \(p\) 的几何分布,\(E[X_i]=1/p\),故 \(E[X]=r/p\)。

例 2g(超几何分布均值):\(N\) 球中 \(m\) 白,随机取 \(n\)。法一:\(X=\sum_{i=1}^m X_i\),\(X_i\) 表示第 \(i\) 个白球被选中,\(P=\binom{1}{1}\binom{N-1}{n-1}/\binom{N}{n}=n/N\),\(E[X]=mn/N\)。法二:\(X=\sum_{i=1}^n Y_i\),\(Y_i\) 表示第 \(i\) 个取出的球是白球,\(E[Y_i]=m/N\),同样得 \(nm/N\)。体现「示性变量分解有多种方式」。

例 2h(配对问题 matching):\(N\) 人随机取帽,\(X_i\) = 第 \(i\) 人取到自己帽子,\(E[X_i]=1/N\),\(E[X]=1\)——与 \(N\) 无关,平均恰有 1 人拿到自己的帽子。

例 2i(集券问题 coupon collecting):\(N\) 种券等概率,求集齐所需券数 \(X\) 的期望。\(X=X_0+X_1+\cdots+X_{N-1}\),\(X_i\) 为已集 \(i\) 种后得到新种类所需附加券数,是参数 \((N-i)/N\) 的几何变量,\(E[X_i]=N/(N-i)\),

\[E[X]=N\Big(1+\frac12+\cdots+\frac1N\Big)\approx N\ln N.\]

例 2j(猎鸭):10 名猎人各自独立随机选一只鸭(共 10 只)射击,命中率 \(p\)。第 \(i\) 只鸭被每个猎人击中的概率为 \(p/10\),故 \(P\{\text{第 }i\text{ 只逃脱}\}=(1-p/10)^{10}\),期望逃脱数 \(10(1-p/10)^{10}\)。

例 2k(游程数 runs):\(n\) 个 1 与 \(m\) 个 0 随机排列,\(I_i\) = 第 \(i\) 位开始一个 1 的游程。\(E[I_1]=n/(n+m)\);\(1<i\le n+m\) 时 \(E[I_i]=P\{\text{第 }i-1\text{ 位为 0,第 }i\text{ 位为 1}\}=\frac{m}{n+m}\cdot\frac{n}{n+m-1}\)。故

\[E[R(1)]=\frac{n}{n+m}+\frac{nm}{n+m},\quad E[R(0)]=\frac{m}{n+m}+\frac{nm}{n+m},\quad E[R(0)+R(1)]=1+\frac{2nm}{n+m}.\]
(例:\(n=6,m=4\) 的序列 1110110010 有 3 个 1 游程。)

例 2l(平面随机游走):每步长度为 1、方向角 \(\theta_i\sim U(0,2\pi)\) 独立。\(X_i=\cos\theta_i,Y_i=\sin\theta_i\),\(D^2=(\sum X_i)^2+(\sum Y_i)^2=n+\sum_{i\ne j}(\cos\theta_i\cos\theta_j+\sin\theta_i\sin\theta_j)\)。因 \(E\cos\theta=E\sin\theta=0\) 且独立,交叉项期望为 0,\(E[D^2]=n\)。即 \(n\) 步后距离的均方为 \(n\),典型距离 \(\sim\sqrt n\)(扩散的 \(\sqrt n\) 标度)。

例 2m(快速排序 quick-sort 的平均比较次数):算法:\(n>2\) 时随机选一枢轴(pivot),其余元素与之比较,小的放左括号、大的放右括号,递归处理。示例:对 5,9,3,10,11,14,8,4,17,6 选 10 → {5,9,3,8,4,6},10,{11,14,17};再选 6 → {5,3,4},6,{9,8},10,{11,14,17};再选 4 → {3},4,{5},6,…。

分析:把值按大小重新命名为 \(1,\dots,n\),令 \(I(i,j)=1\) 若 \(i,j\) 曾被直接比较。\(X=\sum_{i<j}I(i,j)\)。关键观察:\(\{i,i+1,\dots,j\}\) 一直在同一括号内,直到其中某个值首次被选为枢轴;若该枢轴是 \(i\) 或 \(j\),二者被直接比较,否则被分开永不比较。该枢轴在这 \(j-i+1\) 个值中等可能,故

\[P\{i,j\text{ 被比较}\}=\frac{2}{j-i+1},\qquad E[X]=\sum_{i=1}^{n-1}\sum_{j=i+1}^n\frac{2}{j-i+1}.\]
用积分近似:内层 \(\approx2\log(n-i+1)\),外层 \(\approx2\int_2^n\log y\,dy\approx 2n\log n\)。结论:大 \(n\) 时平均约 \(2n\ln n\) 次比较。

例 2n(并的概率 = 容斥公式的期望证明):\(1-\prod_{i=1}^n(1-X_i)=I(\cup A_i)\)。展开取期望,因 \(E[X_{i_1}\cdots X_{i_k}]=P(A_{i_1}\cdots A_{i_k})\),即得容斥公式(inclusion–exclusion)

\[P(\cup A_i)=\sum_i P(A_i)-\sum_{i<j}P(A_iA_j)+\sum_{i<j<k}P(A_iA_jA_k)-\cdots+(-1)^{n+1}P(A_1\cdots A_n).\]

无穷和的期望:\(E[\sum_{i=1}^\infty X_i]=\sum E[X_i]\)(2.4)不一定成立,它等价于交换期望与极限。两种重要的成立情形:(1) 所有 \(X_i\ge0\)(单调收敛);(2) \(\sum_i E|X_i|<\infty\)(控制收敛)。

例 2o(尾和公式):\(X\) 非负整数值,\(X_i=I(X\ge i)\),则 \(\sum_{i\ge1}X_i=X\),由非负性

\[E[X]=\sum_{i=1}^\infty P\{X\ge i\}.\quad(2.6)\]

例 2p(有序表的最优排列):\(n\) 个元素存成有序列表,每次请求元素 \(i\) 的概率为 \(P(i)\)。设 \(P(1)\ge\cdots\ge P(n)\)。对任一排列 \(O=i_1,\dots,i_n\),\(P_O\{X\ge k\}=\sum_{j=k}^nP(i_j)\ge\sum_{j=k}^nP(j)\),用 (2.6) 对 \(k\) 求和得 \(E_O[X]\ge E_{1,\dots,n}[X]\):按请求概率降序排列使期望位置最小。

*7.2.1 用期望得到界:概率方法(probabilistic method)(PDF p.306–308)

思想:在有限集 \(A\) 上引入概率,研究随机元素。若 \(m=\max_{s\in A}f(s)\),取随机元素 \(S\),则 \(m\ge f(S)\) 推出 \(m\ge E[f(S)]\);若 \(f(S)\) 非常数则严格不等。即「期望 ≤ 最大值」,存在性论证。

例 2q(锦标赛中哈密顿路径数的最大值):\(n>2\) 人循环赛(round-robin),每对比赛一次。排列 \(i_1,\dots,i_n\) 称为哈密顿路径(Hamiltonian path)若 \(i_1\) 胜 \(i_2\)、\(i_2\) 胜 \(i_3\)……。\(n=3\):若某人两胜则只有 1 条;若三人各一胜(循环)则有 3 条,故最大为 3。一般:令每场比赛独立、各方胜率 1/2,任一排列成为哈密顿路径的概率 \((1/2)^{n-1}\),\(E[f(S)]=n!/2^{n-1}\)。由于 \(f(S)\) 非常数,存在结果使哈密顿路径数 \(>n!/2^{n-1}\)。

例 2r(花栗鼠):52 棵树排成圆圈,住 15 只花栗鼠。证明存在连续 7 棵树至少住 3 只。随机选一棵树,其「邻域」为它和顺时针后 6 棵;每只花栗鼠落入邻域的概率 \(7/52\),\(E[X]=105/52>2\),故存在邻域有 \(\ge3\) 只。

*7.2.2 最大–最小恒等式(Maximum–Minimums Identity)(PDF p.308–310)

命题 2.2:对任意实数 \(x_1,\dots,x_n\),

\[\max_i x_i=\sum_i x_i-\sum_{i<j}\min(x_i,x_j)+\sum_{i<j<k}\min(x_i,x_j,x_k)-\cdots+(-1)^{n+1}\min(x_1,\dots,x_n).\]
概率证明:先设 \(x_i\in[0,1]\),取 \(U\sim U(0,1)\),\(A_i=\{U<x_i\}\)。则 \(\cup A_i=\{U<\max x_i\}\),\(P=\max x_i\);\(P(A_i)=x_i\);\(A_{i_1}\cdots A_{i_r}=\{U<\min_j x_{i_j}\}\),概率为该最小值。代入容斥公式即得。非负但不在 \([0,1]\):除以上界 \(c\) 再乘回。可为负:加常数 \(b\) 使全为正,利用 \(n-\binom n2+\cdots+(-1)^{n+1}\binom nn=1\)(由 \((1-1)^n=0\))抵消 \(b\)。

推论:对随机变量取期望,

\[E[\max_i X_i]=\sum_iE[X_i]-\sum_{i<j}E[\min(X_i,X_j)]+\cdots+(-1)^{n+1}E[\min(X_1,\dots,X_n)].\quad(2.7)\]

例 2s(不等概率集券):类型 \(i\) 概率 \(p_i\)。\(X_i\) = 得到类型 \(i\) 所需券数 ~ 几何\((p_i)\);\(X=\max X_i\);\(\min(X_i,X_j)\) ~ 几何\((p_i+p_j)\),依此类推。故

\[E[X]=\sum_i\frac1{p_i}-\sum_{i<j}\frac1{p_i+p_j}+\cdots+(-1)^{n+1}\frac1{p_1+\cdots+p_n}.\]
利用 \(\int_0^\infty e^{-px}dx=1/p\) 及 \(1-\prod(1-e^{-p_ix})\) 的展开,得到更便于计算的形式
\[E[X]=\int_0^\infty\Big(1-\prod_{i=1}^n(1-e^{-p_ix})\Big)dx.\]

7.3 发生事件个数的矩(Moments of the Number of Events that Occur)(PDF p.311–317)

设 \(X\) 为事件 \(A_1,\dots,A_n\) 中发生的个数,\(I_i\) 为示性变量,\(X=\sum I_i\),\(E[X]=\sum P(A_i)\)(3.1)。

成对计数:发生的事件对数 \(=\binom X2=\sum_{i<j}I_iI_j\),取期望

\[E\Big[\binom X2\Big]=\sum_{i<j}P(A_iA_j)\quad(3.2),\qquad E[X^2]-E[X]=2\sum_{i<j}P(A_iA_j)\quad(3.3)\]
由此得到 \(E[X^2]\) 与 \(\mathrm{Var}(X)\)。更一般地 \(\binom Xk=\sum_{i_1<\dots<i_k}I_{i_1}\cdots I_{i_k}\),
\[E\Big[\binom Xk\Big]=\sum_{i_1<\cdots<i_k}P(A_{i_1}\cdots A_{i_k}).\quad(3.4)\]
即阶乘矩(factorial moment)\(E[X(X-1)\cdots(X-k+1)]=k!\sum P(A_{i_1}\cdots A_{i_k})\)。方法要点:方差只需要知道两两交事件的概率。

例 3a(二项分布的矩):\(P(A_iA_j)=p^2\),\(E[X(X-1)]=n(n-1)p^2\),\(\mathrm{Var}(X)=n(n-1)p^2+np-(np)^2=np(1-p)\)。一般 \(E[X(X-1)\cdots(X-k+1)]=n(n-1)\cdots(n-k+1)p^k\),可递推出高阶矩,如 \(E[X^3]=3E[X^2]-2E[X]+n(n-1)(n-2)p^3=3n(n-1)p^2+np+n(n-1)(n-2)p^3\)。

例 3b(超几何分布的矩):\(A_i\)=第 \(i\) 次取到白球,\(P(A_i)=m/N\),\(P(A_iA_j)=\frac mN\frac{m-1}{N-1}\)。\(E[X(X-1)]=n(n-1)\frac{m(m-1)}{N(N-1)}\),

\[\mathrm{Var}(X)=\frac{mn}{N}\Big[\frac{(n-1)(m-1)}{N-1}+1-\frac{mn}{N}\Big].\]
高阶阶乘矩:\(E[X(X-1)\cdots(X-k+1)]=\frac{n(n-1)\cdots(n-k+1)\,m(m-1)\cdots(m-k+1)}{N(N-1)\cdots(N-k+1)}\)。

例 3c(配对问题的矩):\(P(A_iA_j)=\frac1N\frac1{N-1}\),\(E[X(X-1)]=1\),\(E[X]=1\),故 \(\mathrm{Var}(X)=1\);且对 \(k\le N\) 有 \(E[X(X-1)\cdots(X-k+1)]=1\)(与 Poisson(1) 的阶乘矩一致,呼应配对数近似 Poisson(1))。

例 3d(前 \(n\) 张券中出现的种类数):类型 \(j\) 概率 \(p_j\)。令 \(Y\)=已出现种类数,\(X=N-Y\)=未出现种类数,\(A_i\)=类型 \(i\) 未出现,\(P(A_i)=(1-p_i)^n\),\(P(A_iA_j)=(1-p_i-p_j)^n\)。

\[E[Y]=N-\sum_i(1-p_i)^n,\quad \mathrm{Var}(Y)=2\sum_{i<j}(1-p_i-p_j)^n+\sum_i(1-p_i)^n-\Big(\sum_i(1-p_i)^n\Big)^2.\]
等概率 \(p_i=1/N\) 时:\(E[Y]=N[1-(1-1/N)^n]\),\(\mathrm{Var}(Y)=N(N-1)(1-2/N)^n+N(1-1/N)^n-N^2(1-1/N)^{2n}\)。

例 3e(负超几何分布 negative hypergeometric):瓮中 \(n\) 个特殊球、\(m\) 个普通球,逐个无放回随机取出;\(Y\)=取到 \(r\) 个特殊球所需次数。它与超几何的关系同负二项与二项的关系(固定成功数,看试验数)。概率质量函数:

\[P\{Y=k\}=\frac{\binom n{r-1}\binom m{k-r}}{\binom{n+m}{k-1}}\cdot\frac{n-r+1}{n+m-k+1}.\]
不用 pmf 求矩:对普通球 \(o_i\),令 \(A_i\)=\(o_i\) 在第 \(r\) 个特殊球之前被取出,\(X\)=这类普通球个数,\(Y=r+X\)。考虑 \(o_i\) 与 \(n\) 个特殊球共 \(n+1\) 个球,\(o_i\) 处于各位置等可能,落在前 \(r\) 位的概率 \(r/(n+1)\)。故
\[E[Y]=r+\frac{mr}{n+1}=\frac{r(n+m+1)}{n+1}.\]
例:洗好的牌翻到第一张黑桃期望 \(1+39/14=3.786\) 张;翻到第一张 A 期望 \(1+48/5=10.6\) 张。方差:考虑 \(o_i,o_j\) 与 \(n\) 个特殊球共 \(n+2\) 个,二者都在前 \(r+1\) 位的概率 \(P(A_iA_j)=\frac{r(r+1)}{(n+1)(n+2)}\),从而
\[\mathrm{Var}(Y)=\frac{mr(n+1-r)(n+m+1)}{(n+1)^2(n+2)}.\]

例 3f(集券问题中的「单张」类型数):\(n\) 种等概率券,收集到集齐为止,\(X\)=恰只收到一张的类型数。令 \(T_i\) 为第 \(i\) 个被收集到的类型,\(A_i\)=类型 \(T_i\) 只有一张。第一次得到 \(T_i\) 时还剩 \(n-i\) 种未收集,这 \(n-i+1\) 种(含 \(T_i\))中每一种等可能成为「最后被(再次)收集」的,\(T_i\) 成为单张当且仅当它最后,故 \(P(A_i)=\frac1{n-i+1}\),

\[E[X]=\sum_{i=1}^n\frac1i.\]
方差:令 \(S_{i,j}\)(\(i<j\))= 第一张 \(T_j\) 出现时 \(T_i\) 仍只有一张,\(P(S_{i,j})=\frac{n+1-j}{n+1-i}\);条件下 \(T_i,T_j\) 都在剩余 \(n-j+2\) 种中排最后两位,概率 \(\frac{2}{(n-j+2)(n-j+1)}\)。得 \(P(A_iA_j)=\frac{2}{(n+1-i)(n+2-j)}\),
\[\mathrm{Var}(X)=4\sum_{i<j}\frac1{(n+1-i)(n+2-j)}+\sum_{i=1}^n\frac1i-\Big(\sum_{i=1}^n\frac1i\Big)^2.\]

7.4 协方差、和的方差与相关系数(PDF p.317–326)

命题 4.1:\(X,Y\) 独立,则对任意函数 \(g,h\):\(E[g(X)h(Y)]=E[g(X)]E[h(Y)]\)。证明:联合密度分解为 \(f_X f_Y\),双重积分分离。

定义(协方差 covariance):\(\mathrm{Cov}(X,Y)=E[(X-E X)(Y-E Y)]=E[XY]-E[X]E[Y]\)。

独立 ⇒ 协方差为 0,反之不成立。反例:\(X\) 等概率取 \(0,1,-1\),\(Y=I(X=0)\)。\(XY\equiv0\),\(E X=0\),故 \(\mathrm{Cov}=0\),但 \(X,Y\) 显然不独立。

命题 4.2(协方差性质):(i) 对称 \(\mathrm{Cov}(X,Y)=\mathrm{Cov}(Y,X)\);(ii) \(\mathrm{Cov}(X,X)=\mathrm{Var}(X)\);(iii) \(\mathrm{Cov}(aX,Y)=a\,\mathrm{Cov}(X,Y)\);(iv) 双线性

\[\mathrm{Cov}\Big(\sum_{i=1}^nX_i,\sum_{j=1}^mY_j\Big)=\sum_{i=1}^n\sum_{j=1}^m\mathrm{Cov}(X_i,Y_j).\]
(iv) 的证明:中心化后展开乘积,再用期望的线性性。

和的方差:

\[\mathrm{Var}\Big(\sum_{i=1}^nX_i\Big)=\sum_{i=1}^n\mathrm{Var}(X_i)+2\sum_{i<j}\mathrm{Cov}(X_i,X_j).\quad(4.1)\]
若两两独立(pairwise independent),化为 \(\sum\mathrm{Var}(X_i)\)。

例 4a(样本均值方差与样本方差的无偏性):i.i.d.,均值 \(\mu\)、方差 \(\sigma^2\)。偏差(deviation)\(X_i-\bar X\);样本方差(sample variance)\(S^2=\sum(X_i-\bar X)^2/(n-1)\)。(a) \(\mathrm{Var}(\bar X)=\sigma^2/n\)。(b) 恒等式 \((n-1)S^2=\sum(X_i-\mu)^2-n(\bar X-\mu)^2\),取期望得 \((n-1)E[S^2]=n\sigma^2-n\cdot\sigma^2/n=(n-1)\sigma^2\),故 \(E[S^2]=\sigma^2\)(这就是除以 \(n-1\) 的原因)。

例 4b(二项方差):\(X=\sum X_i\) 独立 Bernoulli,\(\mathrm{Var}(X_i)=E[X_i]-E[X_i]^2=p-p^2\)(因 \(X_i^2=X_i\)),\(\mathrm{Var}(X)=np(1-p)\)。

例 4c(有限总体抽样 sampling from a finite population):\(N\) 人各有数值 \(v_i\),等可能抽取大小为 \(n\) 的子集,\(S\)=样本值之和。\(I_i\) 表示第 \(i\) 人入样,\(S=\sum v_iI_i\)。\(E[I_i]=n/N\),\(E[I_iI_j]=\frac nN\frac{n-1}{N-1}\),\(\mathrm{Var}(I_i)=\frac nN(1-\frac nN)\),\(\mathrm{Cov}(I_i,I_j)=-\frac{n(N-n)}{N^2(N-1)}\)。记 \(\bar v=\sum v_i/N\):

\[E[S]=n\bar v,\qquad \mathrm{Var}(S)=\frac{n(N-n)}{N-1}\Big(\frac{\sum v_i^2}{N}-\bar v^2\Big).\]
特例:\(Np\) 个 \(v=1\),其余 0(选举民调),\(S\) 为超几何,\(E[S/n]=p\),\(\mathrm{Var}(S/n)=\frac{N-n}{n(N-1)}p(1-p)\)。\(\frac{N-n}{N-1}\) 即有限总体修正因子(finite population correction)。

相关系数(correlation):\(\rho(X,Y)=\dfrac{\mathrm{Cov}(X,Y)}{\sqrt{\mathrm{Var}(X)\mathrm{Var}(Y)}}\),满足 \(-1\le\rho\le1\)(4.2)。证明:\(0\le\mathrm{Var}(X/\sigma_x+Y/\sigma_y)=2(1+\rho)\),\(0\le\mathrm{Var}(X/\sigma_x-Y/\sigma_y)=2(1-\rho)\)。由于方差为 0 意味着几乎必然为常数(第 8 章证明),\(\rho=1\) ⇔ \(Y=a+bX\),\(b=\sigma_y/\sigma_x>0\);\(\rho=-1\) ⇔ \(b<0\)。\(\rho\) 衡量线性关系的强弱;\(\rho=0\) 称不相关(uncorrelated)。

例 4d(示性变量的协方差):\(\mathrm{Cov}(I_A,I_B)=P(AB)-P(A)P(B)=P(B)[P(A|B)-P(A)]\);正相关/不相关/负相关分别对应 \(P(A|B)\) 大于/等于/小于 \(P(A)\)。

例 4e:i.i.d. 方差 \(\sigma^2\),\(\mathrm{Cov}(X_i-\bar X,\bar X)=\frac1n\sigma^2-\frac{\sigma^2}n=0\):样本均值与偏差不相关。一般不独立;但正态情形下 \(\bar X\) 与整个偏差向量独立,进而 \(\bar X\) 与 \(S^2\) 独立,且 \((n-1)S^2/\sigma^2\sim\chi^2_{n-1}\)(7.8 节证明)。

例 4f(多项分布的协方差):\(m\) 次独立试验,\(r\) 种结果,概率 \(p_1,\dots,p_r\);\(N_i\) 为结果 \(i\) 的次数,服从多项分布(multinomial)\(P\{N_1=n_1,\dots,N_r=n_r\}=\frac{m!}{n_1!\cdots n_r!}p_1^{n_1}\cdots p_r^{n_r}\)。\(N_i=\sum_k I_i(k)\)。不同试验独立,协方差为 0;同一试验 \(I_i(\ell)I_j(\ell)=0\),协方差 \(-p_ip_j\)。故

\[\mathrm{Cov}(N_i,N_j)=-mp_ip_j\quad(i\ne j),\]
符合「一个多则另一个少」的直觉。

7.5 条件期望(Conditional Expectation)(PDF p.326–343)

7.5.1 定义(PDF p.326–328)

离散:\(p_{X|Y}(x|y)=p(x,y)/p_Y(y)\),\(E[X|Y=y]=\sum_x x\,p_{X|Y}(x|y)\)(\(p_Y(y)>0\))。连续:\(f_{X|Y}(x|y)=f(x,y)/f_Y(y)\),\(E[X|Y=y]=\int x f_{X|Y}(x|y)dx\)。

例 5a:\(X,Y\) 独立同为 \(\text{Bin}(n,p)\),给定 \(X+Y=m\),\(P\{X=k|X+Y=m\}=\binom nk\binom n{m-k}/\binom{2n}m\)(超几何,与 \(p\) 无关),故 \(E[X|X+Y=m]=m/2\)。

例 5b:\(f(x,y)=\frac{e^{-x/y}e^{-y}}{y}\)(\(x,y>0\))。\(f_{X|Y}(x|y)=\frac1ye^{-x/y}\),即给定 \(Y=y\) 时 \(X\) 为均值 \(y\) 的指数分布,\(E[X|Y=y]=y\)。

注:条件期望满足普通期望的全部性质,如 \(E[g(X)|Y=y]=\sum g(x)p_{X|Y}\) 或 \(\int g f_{X|Y}\),\(E[\sum X_i|Y=y]=\sum E[X_i|Y=y]\)。可把它看作在缩减样本空间 \(\{Y=y\}\) 上的普通期望。

7.5.2 通过条件化计算期望(Computing Expectations by Conditioning)(PDF p.328–338)

记 \(E[X|Y]\) 为 \(Y\) 的函数(本身是随机变量),在 \(Y=y\) 处取值 \(E[X|Y=y]\)。

命题 5.1(全期望公式 / 迭代期望 law of total expectation):

\[E[X]=E\big[E[X|Y]\big]\quad(5.1)\]
离散 \(Y\):\(E[X]=\sum_yE[X|Y=y]P\{Y=y\}\)(5.1a);连续:\(E[X]=\int E[X|Y=y]f_Y(y)dy\)(5.1b)。离散证明:\(\sum_y\sum_x xP\{X=x|Y=y\}P\{Y=y\}=\sum_x x\sum_yP\{X=x,Y=y\}=E[X]\)。解释:\(E[X]\) 是各条件期望按条件事件概率的加权平均(类比全概率公式)。

例 5c(困在矿井的矿工):三扇门:门 1 经 3 小时到安全处;门 2 经 5 小时回原地;门 3 经 7 小时回原地;每次等可能选门。\(E[X|Y=1]=3\),\(E[X|Y=2]=5+E[X]\),\(E[X|Y=3]=7+E[X]\)(回到原地后问题「重新开始」,即首步分析 first-step analysis)。\(E[X]=\frac13(3+5+E X+7+E X)\) ⇒ \(E[X]=15\)。

例 5d(随机个随机变量之和的期望 / Wald 型等式):每天进店人数 \(N\)(均值 50),每人消费 \(X_i\) i.i.d. 均值 8 美元,且与 \(N\) 独立。\(E[\sum_{i=1}^NX_i|N=n]=nE[X]\),故

\[E\Big[\sum_{i=1}^NX_i\Big]=E[N]E[X]=400\text{ 美元}.\]

例 5e(掷骰赌博 craps 的投掷次数):首掷和为 2,3,12 输;7,11 赢;否则为点数 \(i\),继续掷直到出 \(i\)(赢)或 7(输)。\(P_i=P_{14-i}=(i-1)/36\)(\(i=2..7\))。\(R\)=投掷次数。\(E[R|S=i]=1\)(\(i=2,3,7,11,12\)),否则 \(1+\frac1{P_i+P_7}\)(几何分布)。

  • (a) \(E[R]=1+2\big(\frac39+\frac4{10}+\frac5{11}\big)=3.376\);
  • 赢的概率 \(p=P_7+P_{11}+\sum_{i\in\{4,5,6,8,9,10\}}\frac{P_i^2}{P_i+P_7}=0.493\)(先得 \(i\) 再得 7 的概率为 \(P_i/(P_i+P_7)\));
  • (b) 条件分布 \(Q_i=P\{S=i|\text{win}\}\):\(Q_7=P_7/p\),\(Q_{11}=P_{11}/p\),\(Q_i=\frac{P_i^2}{p(P_i+P_7)}\)。给定 \(S=i\),附加次数与输赢独立,故 \(E[R|\text{win}]=1+\sum_i\frac{Q_i}{P_i+P_7}=2.938\);
  • (c) 由 \(E[R]=E[R|\text{win}]p+E[R|\text{lose}](1-p)\) 得 \(E[R|\text{lose}]=3.801\)。

例 5f(二元正态的 \(\rho\) 即相关系数):二元正态密度

\[f(x,y)=\frac{1}{2\pi\sigma_x\sigma_y\sqrt{1-\rho^2}}\exp\Big\{-\frac{1}{2(1-\rho^2)}\Big[\Big(\tfrac{x-\mu_x}{\sigma_x}\Big)^2+\Big(\tfrac{y-\mu_y}{\sigma_y}\Big)^2-2\rho\tfrac{(x-\mu_x)(y-\mu_y)}{\sigma_x\sigma_y}\Big]\Big\}.\]
已知 \(X|Y=y\sim N\big(\mu_x+\rho\frac{\sigma_x}{\sigma_y}(y-\mu_y),\cdot\big)\)。用 \(E[XY]=E[E[XY|Y]]=E[Y\mu_x+\rho\frac{\sigma_x}{\sigma_y}(Y^2-\mu_yY)]=\mu_x\mu_y+\rho\sigma_x\sigma_y\),得 \(\mathrm{Corr}(X,Y)=\rho\)。

例 5g(反向使用:已知 \(E[X]\) 求条件期望):\(n\) 次独立试验,\(k\) 种结果概率 \(p_i\),\(N_i\) 为结果 \(i\) 的次数。给定 \(N_i=r\),\(N_j\sim\text{Bin}(n-r,\frac{p_j}{1-p_i})\)。 (a) 由 \(E[N_j]=E[N_j|N_i=0]P\{N_i=0\}+E[N_j|N_i>0]P\{N_i>0\}\),即 \(np_j=\frac{np_j}{1-p_i}(1-p_i)^n+E[N_j|N_i>0](1-(1-p_i)^n)\),得

\[E[N_j|N_i>0]=np_j\frac{1-(1-p_i)^{n-1}}{1-(1-p_i)^n}.\]
(b) 类似按 \(N_i=0,1,>1\) 三分:
\[E[N_j|N_i>1]=\frac{np_j[1-(1-p_i)^{n-1}-(n-1)p_i(1-p_i)^{n-2}]}{1-(1-p_i)^n-np_i(1-p_i)^{n-1}}.\]

例 5h(用条件化求几何分布方差):\(N\) 为首次成功时刻,\(Y\)=首次试验是否成功。\(E[N^2|Y=1]=1\),\(E[N^2|Y=0]=E[(1+N)^2]\)。\(E[N^2]=p+(1-p)E[(1+N)^2]=1+(1-p)E[2N+N^2]\),结合 \(E[N]=1/p\) 得 \(E[N^2]=(2-p)/p^2\),\(\mathrm{Var}(N)=(1-p)/p^2\)。

例 5i(多人赌博直至一人赢光的平均局数):\(r\) 人初始 \(n_i\) 单位,每局随机两人对赌 1 单位、各半胜率,破产者出局,直到一人拥有全部 \(n=\sum n_i\)。先解两人情形:\(m_j\) 为玩家 1 持 \(j\) 时的期望局数,\(m_j=1+\frac12m_{j+1}+\frac12m_{j-1}\),\(m_0=m_n=0\),即 \(m_{j+1}=2m_j-m_{j-1}-2\)(5.4)。归纳得 \(m_i=i(m_1-i+1)\)(5.5),由 \(m_n=0\) 得 \(m_1=n-1\),故

\[m_i=i(n-i)\quad(\text{两人初始资金之积}).\]
多人:从玩家 \(i\) 视角,他每局独立等概率输赢 1 单位直至 0 或 \(n\),等同于面对一个持 \(n-n_i\) 的对手,故其参与局数 \(X_i\) 满足 \(E[X_i]=n_i(n-n_i)\)。每局涉及两人,\(X=\frac12\sum X_i\),
\[E[X]=\frac12\Big(n^2-\sum_{i=1}^rn_i^2\Big).\]
注意:均值与每局如何选人无关,但分布有关(例 \(r=3,n_1=n_2=1,n_3=2\):先让 1、2 对赌至少需 3 局,若玩家 3 先上可能 2 局结束)。

例 5j(均匀变量之和超过 1 所需个数的期望为 \(e\)):\(N(x)=\min\{n:\sum_{i\le n}U_i>x\}\),\(m(x)=E[N(x)]\),\(x\in[0,1]\)。条件于 \(U_1=y\):\(y>x\) 时为 1,\(y\le x\) 时为 \(1+m(x-y)\)。故 \(m(x)=1+\int_0^xm(u)du\),求导 \(m'=m\),\(m(0)=1\) ⇒ \(m(x)=e^x\),\(E[N]=m(1)=e\)。

7.5.3 通过条件化计算概率(PDF p.338–341)

令 \(X=I_E\),则 \(E[X]=P(E)\),\(E[X|Y=y]=P(E|Y=y)\),得

\[P(E)=\sum_yP(E|Y=y)P(Y=y)\ \ \text{或}\ \ \int P(E|Y=y)f_Y(y)dy.\quad(5.8)\]
离散有限情形即全概率公式。

例 5k(最佳奖品问题 / 秘书问题 secretary problem):\(n\) 个奖品依次出现,只知相对名次,拒绝后不可回头,目标是最大化选中最好者的概率。策略:拒绝前 \(k\) 个,之后接受第一个比前 \(k\) 个都好的。条件于最佳奖品位置 \(X\)(均匀):\(i\le k\) 时概率 0;\(i>k\) 时需前 \(i-1\) 个中的最好者落在前 \(k\) 个中,概率 \(k/(i-1)\)。

\[P_k(\text{best})=\frac kn\sum_{i=k+1}^n\frac1{i-1}\approx\frac kn\log\frac{n-1}{k}\approx\frac kn\log\frac nk.\]
令 \(g(x)=\frac xn\log\frac nx\),\(g'(x)=\frac1n\log\frac nx-\frac1n=0\) ⇒ \(x=n/e\)。最优:放过前 \(n/e\) 个,成功率约 \(1/e\approx0.36788\)。 直观补充:放过前一半再选第一个超过它们的,选到某物概率 1/2,且选到者是已出现的超过 \(n/2\) 个中的最好者,为全局最好的概率至少 1/2,故成功率 \(>1/4\)。

例 5l(均匀先验的二项分布):\(U\sim U(0,1)\),\(X|U=p\sim\text{Bin}(n,p)\)。\(P\{X=i\}=\binom ni\int_0^1p^i(1-p)^{n-i}dp=\binom ni\frac{i!(n-i)!}{(n+1)!}=\frac1{n+1}\),\(i=0,\dots,n\):头像次数在 \(0..n\) 上均匀。直观证明:取 \(n+1\) 个独立均匀 \(U,U_1,\dots,U_n\),\(X\)=小于 \(U\) 的 \(U_i\) 个数;由对称性 \(U\) 的名次均匀,故 \(X\) 在 \(0..n\) 均匀;而给定 \(U=p\),\(X\sim\text{Bin}(n,p)\)。

例 5m:\(X,Y\) 独立连续,\(P\{X<Y\}=\int F_X(y)f_Y(y)dy\)。 例 5n:\(X,Y\) 独立连续,\(P\{X+Y<a\}=\int F_X(a-y)f_Y(y)dy\)(卷积公式)。

7.5.4 条件方差(Conditional Variance)(PDF p.341–343)

定义 \(\mathrm{Var}(X|Y)=E[(X-E[X|Y])^2|Y]=E[X^2|Y]-(E[X|Y])^2\)。则 \(E[\mathrm{Var}(X|Y)]=E[X^2]-E[(E[X|Y])^2]\)(5.9),\(\mathrm{Var}(E[X|Y])=E[(E[X|Y])^2]-(EX)^2\)(5.10),相加:

命题 5.2(条件方差公式 / 全方差公式 law of total variance):

\[\mathrm{Var}(X)=E[\mathrm{Var}(X|Y)]+\mathrm{Var}(E[X|Y]).\]
直观:总方差 = 组内方差的均值 + 组间均值的方差。

例 5o(火车站乘客):到 \(t\) 时到达人数 \(N(t)\sim\text{Poisson}(\lambda t)\),火车到达时刻 \(Y\sim U(0,T)\) 独立。\(E[N(Y)|Y]=\lambda Y\),\(\mathrm{Var}(N(Y)|Y)=\lambda Y\)。

\[E[N(Y)]=\lambda T/2,\qquad \mathrm{Var}(N(Y))=E[\lambda Y]+\mathrm{Var}(\lambda Y)=\frac{\lambda T}{2}+\frac{\lambda^2T^2}{12}.\]
(方差大于均值——随机强度造成过度离散 overdispersion。)

例 5p(随机和的方差):\(X_i\) i.i.d.,\(N\) 非负整数且与 \(X_i\) 独立。\(E[\sum^NX_i|N]=NE[X]\),\(\mathrm{Var}(\sum^NX_i|N)=N\mathrm{Var}(X)\),

\[\mathrm{Var}\Big(\sum_{i=1}^NX_i\Big)=E[N]\mathrm{Var}(X)+(E[X])^2\mathrm{Var}(N).\]
(复合分布 compound distribution 的方差公式,保险总赔付、订单流总量等的标准模型。)

7.6 条件期望与预测(Conditional Expectation and Prediction)(PDF p.343–347)

观测 \(X\) 后用 \(g(X)\) 预测 \(Y\),以均方误差 \(E[(Y-g(X))^2]\) 为准则。

命题 6.1:\(E[(Y-g(X))^2]\ge E[(Y-E[Y|X])^2]\),即条件期望是均方意义下的最优预测。证明:条件于 \(X\) 展开 \((Y-E[Y|X]+E[Y|X]-g(X))^2\),交叉项中 \(E[Y|X]-g(X)\) 给定 \(X\) 时为常数,而 \(E[Y-E[Y|X]\,|X]=0\),交叉项消失;余下非负项,再取期望。直观论证:无数据时 \(E[(Y-c)^2]\) 在 \(c=E[Y]\) 处最小;观测到 \(X=x\) 后同样的问题在条件概率下进行,最优为 \(E[Y|X=x]\)。

例 6a(父子身高):\(Y=X+1+e\),\(e\sim N(0,4)\) 独立。父亲 72 英寸(6 英尺),最优预测 \(E[Y|X=72]=73\)。

例 6b(带噪信号估计):发送 \(S\sim N(\mu,\sigma^2)\),接收 \(R|S=s\sim N(s,1)\)。\(f_{S|R}(s|r)\propto e^{-(s-\mu)^2/2\sigma^2}e^{-(r-s)^2/2}\),配方得 \(S|R=r\sim N\Big(\frac{\mu+r\sigma^2}{1+\sigma^2},\frac{\sigma^2}{1+\sigma^2}\Big)\)。最优估计

\[E[S|R=r]=\frac1{1+\sigma^2}\mu+\frac{\sigma^2}{1+\sigma^2}r,\]
是先验均值 \(\mu\) 与观测 \(r\) 的加权平均,权重之比 = 噪声方差 1 : 信号方差 \(\sigma^2\)(贝叶斯收缩 shrinkage,Kalman 滤波一步更新的原型)。

例 6c(最优量化器 quantizer):给定分点 \(a_i\)(两端趋于 \(\pm\infty\)),\(X\in(a_i,a_{i+1}]\) 时输出 \(y_i\),\(P\{Y=y_i\}=F_X(a_{i+1})-F_X(a_i)\)。求最小化 \(E[(X-Y)^2]\) 的 \(y_i\)。 (a) 条件于区间指标 \(I\),由命题 6.1,\(y_i=E[X|a_i<X\le a_{i+1}]=\dfrac{\int_{a_i}^{a_{i+1}}xf_X(x)dx}{F_X(a_{i+1})-F_X(a_i)}\); (b) 最优 \(Y=E[X|I]\),故 \(E[Y]=E[X]\)(保持均值); (c) 由条件方差公式 \(\mathrm{Var}(X)=E[\mathrm{Var}(X|I)]+\mathrm{Var}(E[X|I])=E[(X-Y)^2]+\mathrm{Var}(Y)\),即 \(\mathrm{Var}(Y)=\mathrm{Var}(X)-E[(X-Y)^2]\)。

最优线性预测(best linear predictor):只知均值、方差、相关系数时,最小化 \(E[(Y-a-bX)^2]\)。对 \(a,b\) 求偏导置零(6.3),解得

\[b=\frac{\mathrm{Cov}(X,Y)}{\sigma_x^2}=\rho\frac{\sigma_y}{\sigma_x},\qquad a=E[Y]-bE[X]\quad(6.4)\]
最优线性预测为 \(\mu_y+\rho\frac{\sigma_y}{\sigma_x}(X-\mu_x)\),其均方误差
\[E\Big[\big(Y-\mu_y-\rho\tfrac{\sigma_y}{\sigma_x}(X-\mu_x)\big)^2\Big]=\sigma_y^2(1-\rho^2).\quad(6.5)\]
\(|\rho|\to1\) 时误差趋于 0。(这就是总体版本的一元线性回归;\(\rho^2\) 即可解释方差比例 \(R^2\)。)

例 6d:二元正态时 \(E[Y|X=x]=\mu_y+\rho\frac{\sigma_y}{\sigma_x}(x-\mu_x)\) 本身是线性的,故最优线性预测即最优预测。

7.7 矩母函数(Moment Generating Functions)(PDF p.347–358)

定义:\(M(t)=E[e^{tX}]\),离散为 \(\sum e^{tx}p(x)\),连续为 \(\int e^{tx}f(x)dx\)。在可交换求导与期望(本书所有分布均成立)的前提下:

\[M'(t)=E[Xe^{tX}],\quad M^{(n)}(t)=E[X^ne^{tX}],\quad M^{(n)}(0)=E[X^n].\]

常见分布的矩母函数(例 7a–7d):

  • 二项 \((n,p)\):\(M(t)=(pe^t+1-p)^n\)(二项式定理);\(M'(0)=np\),\(M''(0)=n(n-1)p^2+np\),\(\mathrm{Var}=np(1-p)\)。
  • Poisson\((\lambda)\):\(M(t)=\exp\{\lambda(e^t-1)\}\);\(E=\lambda\),\(E[X^2]=\lambda^2+\lambda\),\(\mathrm{Var}=\lambda\)。
  • 指数\((\lambda)\):\(M(t)=\frac{\lambda}{\lambda-t}\),仅对 \(t<\lambda\) 有定义;\(E=1/\lambda\),\(E[X^2]=2/\lambda^2\),\(\mathrm{Var}=1/\lambda^2\)。
  • 正态:标准正态 \(M_Z(t)=e^{t^2/2}\)(配方 \(-(x-t)^2/2+t^2/2\));\(X=\mu+\sigma Z\) 时 \(M_X(t)=e^{\mu t}M_Z(\sigma t)=\exp\{\mu t+\sigma^2t^2/2\}\);求导得 \(E=\mu\),\(E[X^2]=\mu^2+\sigma^2\)。

**表 7.1(离散)/ 表 7.2(连续)**汇总(pmf/pdf,MGF,均值,方差):

分布 MGF 均值 方差
二项 \((n,p)\) \((pe^t+1-p)^n\) \(np\) \(np(1-p)\)
Poisson \(\lambda\) \(\exp\{\lambda(e^t-1)\}\) \(\lambda\) \(\lambda\)
几何 \(p\),\(p(1-p)^{x-1}\) \(\frac{pe^t}{1-(1-p)e^t}\) \(1/p\) \((1-p)/p^2\)
负二项 \((r,p)\),\(\binom{n-1}{r-1}p^r(1-p)^{n-r}\) \(\big(\frac{pe^t}{1-(1-p)e^t}\big)^r\) \(r/p\) \(r(1-p)/p^2\)
均匀 \((a,b)\) \(\frac{e^{tb}-e^{ta}}{t(b-a)}\) \(\frac{a+b}2\) \(\frac{(b-a)^2}{12}\)
指数 \(\lambda\) \(\frac{\lambda}{\lambda-t}\) \(1/\lambda\) \(1/\lambda^2\)
Gamma \((s,\lambda)\),\(\frac{\lambda e^{-\lambda x}(\lambda x)^{s-1}}{\Gamma(s)}\) \(\big(\frac{\lambda}{\lambda-t}\big)^s\) \(s/\lambda\) \(s/\lambda^2\)
正态 \((\mu,\sigma^2)\) \(\exp\{\mu t+\sigma^2t^2/2\}\) \(\mu\) \(\sigma^2\)

两大性质:

  1. 独立和的 MGF 等于各自 MGF 之积:\(M_{X+Y}(t)=E[e^{tX}e^{tY}]=M_X(t)M_Y(t)\)(命题 4.1)。
  2. 唯一性:若 \(M_X(t)\) 在 \(t=0\) 的某邻域内存在且有限,则唯一决定 \(X\) 的分布。例:\(M(t)=(\frac12)^{10}(e^t+1)^{10}\) ⇒ \(X\sim\text{Bin}(10,1/2)\)。

例 7e:\(M(t)=e^{3(e^t-1)}\) ⇒ Poisson(3),\(P\{X=0\}=e^{-3}\)。 例 7f:独立 \(\text{Bin}(n,p)+\text{Bin}(m,p)=\text{Bin}(n+m,p)\)。 例 7g:独立 Poisson\((\lambda_1)\)+Poisson\((\lambda_2)\) = Poisson\((\lambda_1+\lambda_2)\)。 例 7h:独立正态之和为正态,均值、方差分别相加。 例 7i(卡方分布 chi-squared):\(\chi^2_n=Z_1^2+\cdots+Z_n^2\)。\(E[e^{tZ^2}]=\frac1{\sqrt{2\pi}}\int e^{-x^2/2\sigma^2}dx=\sigma=(1-2t)^{-1/2}\),其中 \(\sigma^2=(1-2t)^{-1}\)。故 \(M(t)=(1-2t)^{-n/2}\)(即 Gamma\((n/2,1/2)\))。

例 7j(随机和的 MGF):\(Y=\sum_{i=1}^NX_i\),\(N\) 与 \(X_i\) 独立。\(E[e^{tY}|N]=(M_X(t))^N\),故

\[M_Y(t)=E[(M_X(t))^N].\]
\(M_Y'(t)=E[N(M_X)^{N-1}M_X']\) ⇒ \(E[Y]=E[N]E[X]\)(7.2);\(M_Y''(0)=E[N(N-1)](EX)^2+E[N]E[X^2]\) ⇒ \(E[Y^2]=E[N]\mathrm{Var}(X)+(EX)^2E[N^2]\)(7.3),再得 \(\mathrm{Var}(Y)=E[N]\mathrm{Var}(X)+(EX)^2\mathrm{Var}(N)\),与例 5p 一致。

例 7k:\(Y\sim U(0,1)\),\(X|Y=p\sim\text{Bin}(n,p)\)。\(E[e^{tX}]=\int_0^1(pe^t+1-p)^ndp=\frac1{e^t-1}\int_1^{e^t}y^ndy=\frac{1}{n+1}\frac{e^{t(n+1)}-1}{e^t-1}=\frac1{n+1}(1+e^t+\cdots+e^{nt})\),即 \(\{0,\dots,n\}\) 上离散均匀的 MGF(MGF 法重证例 5l)。

7.7.1 联合矩母函数(Joint Moment Generating Functions)(PDF p.356–358)

\(M(t_1,\dots,t_n)=E[e^{t_1X_1+\cdots+t_nX_n}]\)。边缘 MGF:\(M_{X_i}(t)=M(0,\dots,t,\dots,0)\)。联合 MGF 唯一决定联合分布(证明超出本书)。由此:

\[X_1,\dots,X_n\ \text{独立}\iff M(t_1,\dots,t_n)=M_{X_1}(t_1)\cdots M_{X_n}(t_n).\quad(7.4)\]
(⇒ 由独立直接分解;⇐ 右边是独立变量的联合 MGF,由唯一性即独立。)

例 7l:\(X,Y\) 独立同 \(N(\mu,\sigma^2)\)。\(E[e^{t(X+Y)+s(X-Y)}]=E[e^{(t+s)X}]E[e^{(t-s)Y}]=e^{2\mu t+\sigma^2t^2}e^{\sigma^2s^2}\),分解为 \(N(2\mu,2\sigma^2)\) 与独立的 \(N(0,2\sigma^2)\) 的联合 MGF,故 \(X+Y\) 与 \(X-Y\) 独立。

例 7m(Poisson 稀疏化 thinning):事件数 \(X\sim\) Poisson\((\lambda)\),每个事件独立以概率 \(p\) 被计数,\(X_c\) 为计数数。给定 \(X=n\),\(X_c\sim\text{Bin}(n,p)\):\(E[e^{sX_c+t(X-X_c)}|X=n]=(pe^s+(1-p)e^t)^n\)。由 Poisson 的 \(E[a^X]=e^{\lambda(a-1)}\),

\[E[e^{sX_c+t(X-X_c)}]=e^{\lambda p(e^s-1)}e^{\lambda(1-p)(e^t-1)},\]
故计数与未计数事件数为独立 Poisson,均值 \(\lambda p\) 与 \(\lambda(1-p)\)。

7.8 正态随机变量的更多性质(PDF p.358–362)

7.8.1 多元正态分布(Multivariate Normal Distribution)

定义:\(Z_1,\dots,Z_n\) 独立标准正态,若 \(X_i=\sum_{j=1}^na_{ij}Z_j+\mu_i\)(\(i=1..m\)),则称 \(X_1,\dots,X_m\) 服从多元正态分布。每个 \(X_i\) 为正态,\(E[X_i]=\mu_i\),\(\mathrm{Var}(X_i)=\sum_ja_{ij}^2\)。

联合 MGF:\(\sum t_iX_i\) 也是 \(Z\) 的线性组合,故为正态,均值 \(\sum t_i\mu_i\),方差 \(\sum_i\sum_jt_it_j\mathrm{Cov}(X_i,X_j)\)。由 \(Y\sim N(\mu,\sigma^2)\) 时 \(E[e^Y]=e^{\mu+\sigma^2/2}\)(对数正态均值公式),

\[M(t_1,\dots,t_m)=\exp\Big\{\sum_it_i\mu_i+\frac12\sum_i\sum_jt_it_j\mathrm{Cov}(X_i,X_j)\Big\}.\]
结论:多元正态的联合分布完全由均值向量和协方差矩阵决定。\(m=2\) 时退化为二元正态。

例 8a:二元正态求 \(P(X<Y)\)。\(X-Y\sim N(\mu_x-\mu_y,\ \sigma_x^2+\sigma_y^2-2\rho\sigma_x\sigma_y)\),

\[P\{X<Y\}=\Phi\Big(\frac{\mu_y-\mu_x}{\sqrt{\sigma_x^2+\sigma_y^2-2\rho\sigma_x\sigma_y}}\Big).\]

例 8b(正态–正态共轭):\(X|\Theta=\theta\sim N(\theta,1)\),\(\Theta\sim N(\mu,\sigma^2)\),求 \(\Theta|X=x\)。技巧:令 \(Z\) 独立标准正态,则 \((Z+\Theta,\Theta)\) 与 \((X,\Theta)\) 同分布,且为二元正态。\(E[X]=\mu\),\(\mathrm{Var}(X)=1+\sigma^2\),\(\rho=\sigma/\sqrt{1+\sigma^2}\)。由二元正态条件分布公式:

\[E[\Theta|X=x]=\mu+\frac{\sigma^2}{1+\sigma^2}(x-\mu),\qquad \mathrm{Var}(\Theta|X=x)=\sigma^2(1-\rho^2)=\frac{\sigma^2}{1+\sigma^2}.\]
(与例 6b 结论一致。)

7.8.2 样本均值与样本方差的联合分布(PDF p.361–362)

\(X_1,\dots,X_n\) i.i.d. \(N(\mu,\sigma^2)\)。\(\bar X\sim N(\mu,\sigma^2/n)\)。由例 4e,\(\mathrm{Cov}(\bar X,X_i-\bar X)=0\)(8.1)。\(\bar X,X_1-\bar X,\dots,X_n-\bar X\) 都是独立标准正态 \((X_i-\mu)/\sigma\) 的线性组合,故联合多元正态。取与一切独立的 \(Y\sim N(\mu,\sigma^2/n)\),则 \((Y,X_i-\bar X)\) 与 \((\bar X,X_i-\bar X)\) 均值和协方差完全相同 ⇒ 同分布 ⇒ \(\bar X\) 与偏差序列独立 ⇒ 与 \(S^2\) 独立。

分布:由恒等式除以 \(\sigma^2\):

\[\frac{(n-1)S^2}{\sigma^2}+\Big(\frac{\bar X-\mu}{\sigma/\sqrt n}\Big)^2=\sum_{i=1}^n\Big(\frac{X_i-\mu}{\sigma}\Big)^2.\quad(8.2)\]
右边为 \(\chi^2_n\),MGF \((1-2t)^{-n/2}\);左第二项为 \(\chi^2_1\),MGF \((1-2t)^{-1/2}\);左两项独立,故 \(E[e^{t(n-1)S^2/\sigma^2}]=(1-2t)^{-(n-1)/2}\)。

命题 8.1:i.i.d. 正态样本的 \(\bar X\) 与 \(S^2\) 独立;\(\bar X\sim N(\mu,\sigma^2/n)\);\((n-1)S^2/\sigma^2\sim\chi^2_{n-1}\)。(这是 \(t\) 检验与均值置信区间的基础。)

7.9 期望的一般定义(General Definition of Expectation)(PDF p.362–363)

存在既非离散也非连续的随机变量:\(X\sim\) Bernoulli(1/2),\(Y\sim U[0,1]\) 独立,\(W=X\)(若 \(X=1\))否则 \(W=Y\)。\(W\) 取值不可数,但 \(P\{W=1\}=1/2\),故既非离散也非连续(混合型)。

Stieltjes 积分:普通积分 \(\int_a^bg\,dx=\lim\sum g(x_i)(x_i-x_{i-1})\);对分布函数 \(F\) 和非负 \(g\),定义

\[\int_a^bg(x)\,dF(x)=\lim\sum_{i=1}^ng(x_i)[F(x_i)-F(x_{i-1})],\]
极限取遍分割且最大子区间长度 →0;整条实轴上取 \(a\to-\infty,b\to\infty\);一般 \(g=g^+-g^-\),只要两部分不同时为 \(+\infty\) 即存在。定义
\[E[X]=\int_{-\infty}^{\infty}x\,dF(x).\quad(9.1)\]
离散时化为 \(\sum xp(x)\),连续时化为 \(\int xf(x)dx\)。直观:\(F(x_i)-F(x_{i-1})\) 是 \(X\) 落在 \((x_{i-1},x_i]\) 的概率,近似和即「取值 × 概率」之和。主要是理论价值:统一离散/连续情形的陈述与证明。

第 7 章 小结、习题(PDF p.364–376)

Summary(p.364–365) 复述:二元函数期望公式、期望线性、协方差及双线性、和的方差、相关系数、条件期望定义、\(E[X]=E[E[X|Y]]\) 及用 \(P(A)=E[I_A]\) 求概率、条件方差公式、\(E[Y|X]\) 为最小均方误差预测、MGF 求矩与两条性质(唯一性、独立和的 MGF 为乘积,从而正态/Poisson/Gamma 独立和仍为同族)、多元正态由均值与协方差决定、正态样本 \(\bar X\) 与 \(S^2\) 独立及其分布。

Problems(7.1–7.79,p.365–371)题型概括:

  • 示性变量求期望(7.6–7.15, 7.17–7.24):两人各选 3/10 物体的交集期望、宴会占用桌数(7.8)、球入瓮空瓮数(7.9)、换手次数 changeover(7.11)、男女相邻(7.12)、黑球替换模型(7.14,含 AIDS T 细胞背景)、配对对数(7.15)、猜牌三种信息条件(7.17:无信息 \(E[N]=1\);看到牌后 \(\approx\log n\);被告知对错后 \(\approx e-1\))、生日问题(7.21)、掷骰集齐六面(7.22)、大小药丸(7.24,用例 2m 思路)。
  • \(E[N]=e\) 的序列停止问题(7.25)、均匀极值期望(7.26)、概率方法(*7.27 盒中物品、*7.28 环形可靠系统 3-of-12-out-of-47)、分组集券(*7.29)。
  • 方差/协方差(7.30–7.47):\(E[(X-Y)^2]=2\sigma^2\)、10 对夫妻圆桌相邻数的均值方差(7.34)、负超几何应用(7.35)、多项计数协方差(7.36)、滑动和 \(Y_n=X_n+X_{n+1}+X_{n+2}\) 的自协方差(7.39,即 MA(2) 型结构)、鱼塘抽样超几何(7.41)、Wilcoxon 秩和检验统计量的均值方差(7.43)、游程检验(7.44)、骰子赌场正相关(7.46)、随机图度数相关(7.47)。
  • 条件期望(7.48–7.66):囚犯三门(7.53)、掷骰停止策略最优临界值(7.54)、Poisson 个数的猎鸭/电梯停靠数(7.55–7.56)、复合和事故伤亡(7.57)、分奖金与 \(E[(1+B)^{-1}]=\frac{1-(1-p)^{n+1}}{(n+1)p}\)(7.59)、硬币预测联盟必有正期望收益(7.60)、几何个数的最大值分布(7.61)、\(P\{N(x)\ge n+1\}=x^n/n!\)(7.62)、混合灯泡寿命均值方差(7.64)、好坏年份风暴数(7.65)。
  • 7.67 Kelly 策略:赢概率 \(p>1/2\) 时每次押当前财富的 \(2p-1\),求 \(n\) 次后期望财富(与量化资金管理直接相关)。
  • 混合 Poisson(7.68–7.69,事故倾向 accident proneness,含连续混合 \(\lambda\sim\) 指数)、均匀 \(p\) 硬币(7.70–7.72)、信号模型(7.73)、量化器(7.74)、MGF 识别分布(7.75–7.77)、两信封问题(7.78:以概率 \(F(x)\) 接受可严格优于 \((A+B)/2\))、二元正态周销售额(7.79:两周销售和超 90 的概率,相关系数对尾部概率的影响)。

Theoretical Exercises(7.1–7.55,p.372–376)要点:

  • 7.1 \(E[(X-a)^2]\) 在 \(a=E X\) 最小;7.2 \(E|X-a|\) 在中位数处最小。
  • 7.4 Delta 方法:\(E[g(X)]\approx g(\mu)+\frac{g''(\mu)}{2}\sigma^2\)。
  • 7.5 \(\sum P(C_k)=\sum P(A_k)\);7.6 \(E[X]=\int_0^\infty P\{X>t\}dt\);7.7–7.8 随机占优(stochastically larger)\(X\ge_{st}Y\) ⇔ 对一切增函数 \(E f(X)\ge Ef(Y)\)。
  • 7.10 \(E[\sum_{i\le k}X_i/\sum_{i\le n}X_i]=k/n\);7.12 Cantor 分布均值方差;7.13 记录值个数的均值 \(\sum1/j\)、方差 \(\sum(j-1)/j^2\);7.14 集券数方差 \(\sum_{i=1}^{N-1}\frac{iN}{(N-i)^2}\sim N^2\pi^2/6\)。
  • 7.15 固定均值下 \(P_i\) 相等时方差最大;7.17 反方差加权:\(\lambda X_1+(1-\lambda)X_2\) 估计 \(\mu\) 的最小方差权重(\(\lambda=\sigma_2^2/(\sigma_1^2+\sigma_2^2)\))。
  • 7.20 条件协方差公式 \(\mathrm{Cov}(X,Y)=E[\mathrm{Cov}(X,Y|Z)]+\mathrm{Cov}(E[X|Z],E[Y|Z])\)。
  • 7.21 均匀次序统计量方差;7.22–7.23 线性关系与相关;7.24 Cauchy–Schwarz 不等式 \((E[XY])^2\le E[X^2]E[Y^2]\)(判别式法)。
  • 7.25–7.29 条件期望性质:独立则 \(E[X|Y]=E[X]\);\(E[g(X)Y|X]=g(X)E[Y|X]\);均值独立 ⇒ 不相关(反之不然);\(\mathrm{Cov}(X,E[Y|X])=\mathrm{Cov}(X,Y)\);i.i.d. 时 \(E[X_1|\sum X_i=x]=x/n\)。
  • 7.33–7.34 连续 \(r\) 次正面所需次数(首个反面条件化 / \(T_r\) 递推)。7.35 概率生成函数 \(\phi(s)=E[s^X]=P\{X<Y\}\)。
  • 7.38–7.39 二元线性、二次最优预测;7.41 \(Y=\pm X\) 例:不相关、各自正态但非联合正态且不独立。7.43 \(E[(X-Y)^2]=E[X^2]-E[Y^2]\),\(Y=E[X|Z]\)。
  • 7.44 分支过程(branching process):\(E[X_n]=\mu^n\),\(\mathrm{Var}(X_n)=\sigma^2\mu^{n-1}\frac{\mu^n-1}{\mu-1}\)(\(\mu\ne1\))或 \(n\sigma^2\);灭绝概率满足 \(\pi=\sum_jP_j\pi^j\)。
  • 7.46 标准正态矩 \(E[Z^{2j}]=\frac{(2j)!}{2^jj!}\),奇数阶为 0;7.47 一般正态矩;7.49 **对数正态(lognormal)**均值方差(\(E X=e^{\mu+\sigma^2/2}\),\(\mathrm{Var}=e^{2\mu+\sigma^2}(e^{\sigma^2}-1)\));7.50 累积量生成函数 \(\Psi=\log M\),\(\Psi''(0)=\mathrm{Var}(X)\);7.51 i.i.d. 指数和为 Gamma;7.53 多元正态下不相关 ⇔ 独立;7.54 \(\mathrm{Cov}(Z,Z^2)=0\);7.55 正态层次模型。

Self-Test Problems(7.1–7.32,p.376–379)题型:用均匀随机数估计列表中不同名字数 \(E[m/n(X)]=d\)(7.1、7.16,蒙特卡洛估计思想)、白后接黑次数、夫妻同桌、Bonferroni 不等式 \(P(A_1\cdots A_n)\ge\sum P(A_i)-(n-1)\)(7.6)、负超几何求最小值、行李提取(7.8)、圆上 19 点(*7.9)、\(\mathrm{Var}(\sqrt X)\approx1/4\)(Poisson 方差稳定变换,7.10)、招聘树(7.12)、桥牌 A 数与黑桃数不相关但不独立(7.14)、碰撞次数(7.17)、二元 Poisson(7.22)、i.i.d. 向量和的相关系数(7.23,结果仍为 \(\rho\))、期望 p 值 \(E[\Phi(X)]=\Phi(\mu/\sqrt2)\)(7.25)、\(n\) 正或 \(m\) 反先到的期望次数(7.26)、移到最前洗牌(7.27)、截断几何(7.28)、Bernoulli 变量不相关 ⇔ 独立(7.29)、广义配对(7.30)、\(\sqrt{\mathrm{Var}(X+Y)}\le\sqrt{\mathrm{Var}X}+\sqrt{\mathrm{Var}Y}\)(7.31)、MGF 的级数展开(7.32)。

本章要点

  1. 期望线性性无需独立,配合示性变量分解(indicator decomposition)是计算计数类随机变量期望的万能钥匙;方差则需两两交事件概率(\(E[\binom X2]=\sum_{i<j}P(A_iA_j)\))。
  2. 协方差双线性,\(\mathrm{Var}(\sum X_i)=\sum\mathrm{Var}+2\sum_{i<j}\mathrm{Cov}\);不相关不等于独立(多元正态例外);\(|\rho|\le1\),\(\rho\) 只刻画线性关系。
  3. 条件期望 \(E[X|Y]\) 是随机变量;全期望公式 \(E X=E[E[X|Y]]\) 与全方差公式 \(\mathrm{Var}X=E[\mathrm{Var}(X|Y)]+\mathrm{Var}(E[X|Y])\) 是首步分析、随机和、混合模型的核心工具。
  4. \(E[Y|X]\) 是最小均方误差预测;最优线性预测为 \(\mu_y+\rho\frac{\sigma_y}{\sigma_x}(X-\mu_x)\),残差方差 \(\sigma_y^2(1-\rho^2)\);二元正态时二者一致。
  5. MGF:求矩、唯一决定分布、独立和对应乘积;联合 MGF 可判定独立。多元正态由均值与协方差完全刻画;正态样本 \(\bar X\perp S^2\),\((n-1)S^2/\sigma^2\sim\chi^2_{n-1}\)。
  6. 随机和 \(\sum^NX_i\):均值 \(E N\,E X\),方差 \(E N\,\mathrm{Var}X+(EX)^2\mathrm{Var}N\),MGF \(E[M_X(t)^N]\)。

与量化交易的关联

  • 风险建模与组合优化:组合收益方差 \(\mathrm{Var}(\sum w_iR_i)=\sum_i\sum_jw_iw_j\mathrm{Cov}(R_i,R_j)\) 正是命题 4.2(iv) 与式 (4.1);协方差双线性是均值–方差优化、因子风险模型(\(\Sigma=B F B^\top+D\))的代数基础。多项分布负协方差的直觉对应「权重和为 1 约束下的负相关」。
  • 因子研究与预测:最优线性预测 \(b=\mathrm{Cov}/\mathrm{Var}\) 即总体 OLS 回归系数/因子 beta;\(\sigma_y^2(1-\rho^2)\) 说明 IC(信息系数,即相关系数)与可解释方差的关系——IC=0.05 只解释 0.25% 的方差。\(E[Y|X]\) 为 MSE 最优,是所有收益预测模型(线性、树模型)的目标函数来源。
  • 贝叶斯收缩:例 6b/8b 的「先验均值与观测按方差反比加权」是 Black–Litterman、收益率估计收缩、Kalman 滤波更新的原型;理论题 7.17 的反方差加权用于多信号合成。
  • 全方差公式:分解收益波动为「状态内波动 + 状态间均值差」(regime 模型);混合 Poisson(例 5o、习题 7.68)对应订单到达强度随机时的过度离散。
  • 随机和:一日成交额 = 随机笔数 × 每笔金额(例 5d/5p/7j),用于成交量、冲击成本、保险式尾部损失建模;复合 Poisson 跳跃模型的矩亦由此得出。
  • 定价:\(E[e^Y]=e^{\mu+\sigma^2/2}\)(对数正态均值)是 Black–Scholes 中股价期望与风险中性漂移修正的关键;多元正态 MGF 用于篮子期权和组合 VaR 的正态近似。
  • 回测与统计检验:\(E[S^2]=\sigma^2\)(除以 \(n-1\))、\(\mathrm{Var}(\bar X)=\sigma^2/n\)、\(\bar X\perp S^2\) 及 \(\chi^2_{n-1}\) 分布是夏普比率显著性 \(t\) 检验的基础;但收益序列自相关时 \(\mathrm{Var}(\bar X)\neq\sigma^2/n\)(需加协方差项,见式 4.1 与习题 7.39),这是 Newey–West 调整的直觉来源。
  • 执行与系统实现:快速排序 \(2n\ln n\) 的平均复杂度分析、按访问频率降序排列列表(例 2p)属于系统性能层面的应用;秘书问题(\(1/e\) 规则)可作为最优停止的入门,但与真实择时关系有限,不宜夸大。
  • Kelly 策略(习题 7.67)直接关联仓位管理。

推荐习题

  • 习题 7.11(换手次数,示性变量)、7.17(猜牌三种信息结构,体会信息价值)、7.34(夫妻相邻均值方差)、7.39(滑动和自协方差,时间序列直觉)、7.43(Wilcoxon 秩和统计量的均值方差,非参数检验)、7.59–7.60(联合下注的期望收益)、7.64–7.65(混合分布均值方差,全方差公式)、7.67(Kelly 策略期望财富)、7.78(两信封问题)、7.79(相关性对和的尾部概率影响)。
  • 理论题 7.4(Delta 方法)、7.17(反方差加权)、7.20(条件协方差公式)、7.24(Cauchy–Schwarz)、7.38(二元线性预测=多元回归)、7.44(分支过程)、7.49(对数正态矩)、7.50(累积量)、7.53(多元正态不相关⇔独立)。
  • 自测题 7.10(方差稳定变换)、7.23(i.i.d. 和的相关系数)、7.25(期望 p 值)、7.31(标准差次可加)。

第 8 章 极限定理(Limit Theorems)

本章目录:8.1 引言;8.2 Chebyshev 不等式与弱大数定律;8.3 中心极限定理;8.4 强大数定律;8.5 其他不等式;8.6 用 Poisson 近似独立 Bernoulli 之和的误差界。

8.1 引言(PDF p.380)

概率论最重要的理论结果是极限定理,主要两类:大数定律(laws of large numbers)——给出随机变量序列的平均值(在某种意义下)收敛到期望平均值的条件;中心极限定理(central limit theorems)——给出大量随机变量之和近似服从正态分布的条件。

8.2 Chebyshev 不等式与弱大数定律(PDF p.380–383)

命题 2.1(Markov 不等式):\(X\ge0\),则对任意 \(a>0\),

\[P\{X\ge a\}\le\frac{E[X]}{a}.\]
证明:\(I=I(X\ge a)\le X/a\)(因 \(X\ge0\)),取期望。

命题 2.2(Chebyshev 不等式):\(X\) 有有限均值 \(\mu\)、方差 \(\sigma^2\),则对 \(k>0\),

\[P\{|X-\mu|\ge k\}\le\frac{\sigma^2}{k^2}.\]
证明:对 \((X-\mu)^2\) 用 Markov(\(a=k^2\))。意义:只知均值(或均值和方差)时给出概率界。

例 2a:周产量均值 50。(a) Markov:\(P\{X>75\}\le50/75=2/3\)。(b) 若方差 25:\(P\{|X-50|\ge10\}\le1/4\),故 \(P\{40<X<60\}\ge3/4\)。

例 2b(界很松):\(X\sim U(0,10)\),\(E=5\),\(\mathrm{Var}=25/3\),Chebyshev 给 \(P\{|X-5|>4\}\le25/48\approx0.52\),真实值 0.20。正态时 Chebyshev 给 \(P\{|X-\mu|>2\sigma\}\le1/4\),真实值 \(2[1-\Phi(2)]\approx0.0456\)。Chebyshev 对所有分布成立,故通常不紧,主要作理论工具。

命题 2.3:\(\mathrm{Var}(X)=0\) ⇒ \(P\{X=E X\}=1\)。证明:对每个 \(n\),\(P\{|X-\mu|>1/n\}=0\),由概率的连续性令 \(n\to\infty\) 得 \(P\{X\ne\mu\}=0\)。

定理 2.1(弱大数定律 weak law of large numbers):\(X_i\) i.i.d.,有限均值 \(\mu\),则对任意 \(\varepsilon>0\),

\[P\Big\{\Big|\frac{X_1+\cdots+X_n}{n}-\mu\Big|\ge\varepsilon\Big\}\to0\quad(n\to\infty).\]
证明(额外假设方差 \(\sigma^2\) 有限):\(E[\bar X_n]=\mu\),\(\mathrm{Var}(\bar X_n)=\sigma^2/n\),Chebyshev 给出 \(\le\sigma^2/(n\varepsilon^2)\to0\)。 历史:James Bernoulli 对 Bernoulli 变量证明(《Ars Conjectandi》,1713 年由侄子 Nicholas 出版);一般形式由 Khintchine 证明。

8.3 中心极限定理(Central Limit Theorem)(PDF p.383–391)

定理 3.1(CLT):\(X_i\) i.i.d.,均值 \(\mu\)、方差 \(\sigma^2\),则

\[P\Big\{\frac{X_1+\cdots+X_n-n\mu}{\sigma\sqrt n}\le a\Big\}\to\Phi(a)=\frac{1}{\sqrt{2\pi}}\int_{-\infty}^ae^{-x^2/2}dx,\quad -\infty<a<\infty.\]
它既给出独立和的近似概率计算方法,也解释了为何自然界大量经验频率呈钟形。

引理 3.1(连续性定理,未证):若 \(M_{Z_n}(t)\to M_Z(t)\) 对一切 \(t\) 成立,则在 \(F_Z\) 的连续点处 \(F_{Z_n}(t)\to F_Z(t)\)。取 \(M_Z=e^{t^2/2}\) 即得收敛到标准正态的判据。

证明(假设 MGF 存在):先设 \(\mu=0,\sigma^2=1\)。\(\sum X_i/\sqrt n\) 的 MGF 为 \([M(t/\sqrt n)]^n\)。令 \(L(t)=\log M(t)\),\(L(0)=0\),\(L'(0)=M'(0)/M(0)=\mu=0\),\(L''(0)=\frac{M(0)M''(0)-M'(0)^2}{M(0)^2}=E[X^2]=1\)。需证 \(nL(t/\sqrt n)\to t^2/2\):

\[\lim\frac{L(t/\sqrt n)}{n^{-1}}\overset{\text{L'H}}{=}\lim\frac{L'(t/\sqrt n)t}{2n^{-1/2}}\overset{\text{L'H}}{=}\lim L''(t/\sqrt n)\frac{t^2}{2}=\frac{t^2}{2}.\]
一般情形对标准化 \(X_i^*=(X_i-\mu)/\sigma\) 应用。注:收敛关于 \(a\) 一致。

历史:DeMoivre(约 1733,\(p=1/2\) 的 Bernoulli),Laplace 推广到任意 \(p\) 并发现一般形式(证明不严格),Liapounoff(1901–1902)首次严格证明。这也为第 5 章二项分布的正态近似提供依据。

图 8.1:某 5 点分布(\(P_0=.25,P_1=.15,P_2=.1,P_3=.2,P_4=.3\))的 \(n=5,10,25,100\) 个独立和的 pmf(均值 10.75/21.5/53.75/215,方差 12.64/25.28/63.19/252.75),随 \(n\) 增大趋于钟形。

例 3a(天文测量需要多少次):测量 i.i.d.,均值 \(d\),方差 4,要求以 95% 把握误差在 ±0.5 内。\(Z_n=\frac{\sum X_i-nd}{2\sqrt n}\) 近似标准正态,\(P\{|\bar X-d|\le0.5\}\approx2\Phi(\sqrt n/4)-1=0.95\) ⇒ \(\sqrt{n}/4=1.96\),\(n^*=7.84^2\approx61.47\),取 62 次。若担心正态近似不准,用 Chebyshev:\(P\{|\bar X-d|>0.5\}\le16/n\),需 \(n=16/0.05=320\) 次——更保守。

例 3b(Poisson 近似为正态,连续性修正 continuity correction):选课人数 ~ Poisson(100),求 \(\ge120\) 的概率。Poisson(100) 为 100 个独立 Poisson(1) 之和,\(P\{X\ge120\}=P\{X\ge119.5\}\approx1-\Phi(1.95)\approx0.0256\)。

例 3c:10 颗骰子和在 30–40(含)之间:\(E X_i=7/2\),\(\mathrm{Var}X_i=35/12\),\(P\{29.5\le X\le40.5\}\approx2\Phi(1.0184)-1\approx0.692\)。

例 3d:10 个 \(U(0,1)\) 和超过 6:\(P\approx1-\Phi(\sqrt{1.2})\approx0.1367\)。

例 3e:50 份试卷,每份批改时间均值 20 分钟、标准差 4 分钟;前 450 分钟至少批完 25 份 ⇔ 前 25 份总时间 \(\le450\);\(E=500\),\(\mathrm{Var}=400\),\(P\approx\Phi(-2.5)\approx0.006\)。

定理 3.2(独立非同分布 CLT):\(X_i\) 独立,均值 \(\mu_i\)、方差 \(\sigma_i^2\)。若 (a) 一致有界 \(P\{|X_i|<M\}=1\),(b) \(\sum\sigma_i^2=\infty\),则

\[P\Big\{\frac{\sum_{i=1}^n(X_i-\mu_i)}{\sqrt{\sum_{i=1}^n\sigma_i^2}}\le a\Big\}\to\Phi(a).\]

历史注记:Laplace 从测量误差(大量微小作用之和)趋于正态出发得到 CLT,被称为「误差频率定律」;引 Laplace「概率论归根结底不过是化为计算的常识」与 Galton 对误差定律的赞叹。

8.4 强大数定律(Strong Law of Large Numbers)(PDF p.391–395)

定理 4.1(强大数定律):\(X_i\) i.i.d.,有限均值 \(\mu\),则以概率 1,

\[\frac{X_1+\cdots+X_n}{n}\to\mu,\quad\text{即 }P\Big\{\lim_{n\to\infty}\frac{X_1+\cdots+X_n}{n}=\mu\Big\}=1.\]
应用:\(X_i=I(E\text{ 在第 }i\text{ 次发生})\),则事件 \(E\) 发生的长期频率以概率 1 等于 \(P(E)\)(4.1)——为概率的频率解释提供依据。

证明(假设四阶矩有限 \(E[X_i^4]=K<\infty\)):设 \(\mu=0\),\(S_n=\sum X_i\)。展开 \(E[S_n^4]\),含 \(X_i^3X_j\)、\(X_i^2X_jX_k\)、\(X_iX_jX_kX_l\) 的项期望为 0;每对 \(i,j\) 有 \(\binom42=6\) 项 \(X_i^2X_j^2\)。故

\[E[S_n^4]=nK+6\binom n2E[X_i^2]E[X_j^2]=nK+3n(n-1)(E X^2)^2\le nK+3n(n-1)K,\]
(用 \((E[X^2])^2\le E[X^4]\))。于是 \(E[S_n^4/n^4]\le K/n^3+3K/n^2\),\(E[\sum_nS_n^4/n^4]<\infty\) ⇒ 以概率 1 级数收敛 ⇒ 通项 \((S_n/n)^4\to0\) ⇒ \(S_n/n\to0\)。\(\mu\ne0\) 时对 \(X_i-\mu\) 应用。

图 8.2:模拟 \(n=100,1000,10000\) 时样本均值的轨迹。

弱 vs 强(常见误区):弱大数定律只说对任一给定大 \(n^*\),\(\bar X_{n^*}\) 很可能接近 \(\mu\),但不排除 \(|\bar X_n-\mu|\) 的大偏离无穷多次(虽稀疏)发生;强大数定律排除这种情况:以概率 1,对任意 \(\varepsilon>0\),\(|\bar X_n-\mu|>\varepsilon\) 只发生有限次。历史:Borel 证 Bernoulli 情形,Kolmogorov 证一般形式。

8.5 其他不等式(Other Inequalities)(PDF p.395–400)

命题 5.1(单边 Chebyshev 不等式 one-sided Chebyshev / Cantelli):\(E X=0\),方差 \(\sigma^2\),对 \(a>0\):

\[P\{X\ge a\}\le\frac{\sigma^2}{\sigma^2+a^2}.\]
证明:对 \(b>0\),\(P\{X\ge a\}=P\{X+b\ge a+b\}\le P\{(X+b)^2\ge(a+b)^2\}\le\frac{\sigma^2+b^2}{(a+b)^2}\)(Markov),取最优 \(b=\sigma^2/a\)。

例 5a:周产量均值 100、方差 400,\(P\{X\ge120\}\le\frac{400}{400+400}=1/2\);Markov 只能给出 \(100/120=5/6\)。

推论 5.1:\(E X=\mu\),\(\mathrm{Var}X=\sigma^2\),\(a>0\):\(P\{X\ge\mu+a\}\le\frac{\sigma^2}{\sigma^2+a^2}\),\(P\{X\le\mu-a\}\le\frac{\sigma^2}{\sigma^2+a^2}\)。

例 5b:100 男 100 女随机配成 100 对,男女对数 \(X\)。\(E X_i=100/199\),\(E[X_iX_j]=\frac{100}{199}\frac{99}{197}\),\(E X\approx50.25\),\(\mathrm{Var}X\approx25.126\)。Chebyshev:\(P\{X\le30\}\le25.126/20.25^2\approx0.061\);单边:\(\le\frac{25.126}{25.126+20.25^2}\approx0.058\)。

命题 5.2(Chernoff 界 Chernoff bounds):由 Markov 应用于 \(e^{tX}\):

\[P\{X\ge a\}\le e^{-ta}M(t)\ (t>0),\qquad P\{X\le a\}\le e^{-ta}M(t)\ (t<0).\]
对 \(t\) 取最小化 \(e^{-ta}M(t)\) 得最好的界。

例 5c(标准正态):\(e^{t^2/2-ta}\) 在 \(t=a\) 处最小,\(P\{Z\ge a\}\le e^{-a^2/2}\)(\(a>0\));对称地 \(P\{Z\le a\}\le e^{-a^2/2}\)(\(a<0\))。

例 5d(Poisson):最小化 \(\lambda(e^t-1)-it\) 得 \(e^t=i/\lambda\)(需 \(i>\lambda\)),

\[P\{X\ge i\}\le e^{\lambda(i/\lambda-1)}(\lambda/i)^i=\frac{e^{-\lambda}(e\lambda)^i}{i^i}.\]

例 5e(对称随机游走的 Chernoff 界 / Hoeffding 型):\(X_i=\pm1\) 等概率,\(E[e^{tX}]=\frac{e^t+e^{-t}}2=\sum\frac{t^{2n}}{(2n)!}\le\sum\frac{(t^2/2)^n}{n!}=e^{t^2/2}\)(因 \((2n)!\ge n!2^n\))。\(E[e^{tS_n}]\le e^{nt^2/2}\),取 \(t=a/n\):

\[P\{S_n\ge a\}\le e^{-a^2/2n},\quad a>0.\]
例:\(P\{S_{10}\ge6\}\le e^{-1.8}\approx0.1653\),精确值 \(P\{\text{10 局中至少赢 8 局}\}=\frac{\binom{10}8+\binom{10}9+\binom{10}{10}}{2^{10}}=56/1024\approx0.0547\)。

定义:二阶可导 \(f\) 若 \(f''\ge0\) 称凸(convex),\(f''\le0\) 称凹(concave)。例:\(x^2\)、\(e^{ax}\)、\(-x^{1/n}\)(\(x\ge0\))为凸。

命题 5.3(Jensen 不等式):\(f\) 凸,则 \(E[f(X)]\ge f(E[X])\)(期望存在有限)。证明:在 \(\mu\) 处 Taylor 展开 \(f(x)=f(\mu)+f'(\mu)(x-\mu)+f''(\xi)(x-\mu)^2/2\ge f(\mu)+f'(\mu)(x-\mu)\),取期望。

例 5f(风险偏好):投资者在随机回报 \(X\)(均值 \(m\))与确定回报 \(m\) 间选择,最大化期望效用 \(E[u(R)]\)。若效用 \(u\) 凹(风险厌恶),\(E[u(X)]\le u(m)\),选无风险;若 \(u\) 凸(风险偏好),选风险投资。

8.6 用 Poisson 近似独立 Bernoulli 和的误差界(PDF p.401–403)

目标:\(X_i\sim\) Bernoulli\((p_i)\) 独立,\(X=\sum X_i\),\(Y\sim\) Poisson\((\lambda)\),\(\lambda=\sum p_i\),证明对任意实数集 \(A\),\(|P\{X\in A\}-P\{Y\in A\}|\le\sum p_i^2\)。

耦合构造(coupling):取独立 \(Y_i\sim\) Poisson\((p_i)\),再取独立 \(U_i\):\(U_i=0\) 的概率为 \((1-p_i)e^{p_i}\)(由 \(e^{-p}\ge1-p\) 知 \(\le1\)),否则为 1。定义 \(X_i=0\) 若 \(Y_i=U_i=0\),否则 \(X_i=1\)。则 \(P\{X_i=0\}=e^{-p_i}(1-p_i)e^{p_i}=1-p_i\),\(X_i\) 正是 Bernoulli\((p_i)\)。由于 \(X_i=0\) ⇒ \(Y_i=0\):

\[P\{X_i\ne Y_i\}=P\{Y_i=0,U_i=1\}+P\{Y_i>1\}=e^{-p_i}[1-(1-p_i)e^{p_i}]+1-e^{-p_i}-p_ie^{-p_i}=p_i-p_ie^{-p_i}\le p_i^2\]
(用 \(1-e^{-p}\le p\))。\(X\ne Y\) 蕴含某 \(X_i\ne Y_i\),Boole 不等式给 \(P\{X\ne Y\}\le\sum p_i^2\)。又 \(I\{X\in A\}-I\{Y\in A\}\le I\{X\ne Y\}\),取期望并交换 \(X,Y\) 得
\[\Big|P\Big\{\sum_{i=1}^nX_i\in A\Big\}-\sum_{i\in A}\frac{e^{-\lambda}\lambda^i}{i!}\Big|\le\sum_{i=1}^np_i^2.\]

注(二项情形):所有 \(p_i=p\) 时 \(X\sim\text{Bin}(n,p)\),对任意非负整数集 \(A\),\(\big|\sum_{i\in A}\binom ni p^i(1-p)^{n-i}-\sum_{i\in A}\frac{e^{-np}(np)^i}{i!}\big|\le np^2\)。即 Poisson 近似误差至多 \(np^2\)——\(p\) 小时近似优良。

第 8 章 小结与习题(PDF p.403–407)

Summary:Markov 与 Chebyshev 不等式(\(P\{|X-\mu|\ge k\sigma\}\le1/k^2\));CLT(有限均值方差,和近似 \(N(n\mu,n\sigma^2)\));强大数定律(只需有限均值;以概率 1 收敛;为「长期相对频率」解释提供理论依据)。

Problems(8.1–8.24)题型:用 Markov/Chebyshev 给界(8.1、8.2,「不用 CLT」需要多少学生使班均分在 75±5 内的概率 ≥0.9);CLT 近似:舍入误差和(8.5,\(U(-.5,.5)\))、掷骰和超过 300 所需次数(8.6)、灯泡寿命接力(8.7–8.8)、Gamma\((n,1)\) 的相对偏差(8.9)、桥梁承重与车辆数(8.10)、股价随机游走 \(Y_n=Y_{n-1}+X_n\),10 天后超过 105 的概率(8.11,只能用单边 Chebyshev 给界)、非同分布部件寿命(8.12)、两班平均分比较(8.13)、备件数量(8.14)、保险公司 10000 保单总赔付超 270 万的概率(8.15)、两人完成任务先后(8.16);单边 Chebyshev 的集券问题(8.19);Jensen 关于 \(E[X^3],E\sqrt X,E\log X,E e^{-X}\)(8.20);矩的单调性 \(E X\le(E X^2)^{1/2}\le(EX^3)^{1/3}\)(8.21);分配投资比例时的风险偏好(8.22);Poisson(20) 尾部的 Markov/单边 Chebyshev/Chernoff/CLT/精确值对比(8.23)。

Theoretical Exercises(8.1–8.14):信噪比 \(r=|\mu|/\sigma\) 与相对偏差界 \(P\{D\le\alpha\}\ge1-\frac1{r^2\alpha^2}\)(8.2–8.3);依概率收敛 + 有界连续 \(g\) ⇒ \(E g(Z_n)\to g(c)\)(8.4);Bernstein 多项式与 Weierstrass 逼近定理的概率证明(8.5);单调 pmf/密度的界 \(P\{X=k\}\le2E X/k^2\)(8.6);骰子乘积的近似(8.7,取对数后用 CLT);Gamma 近似正态(8.8);「强大数定律淹没而不补偿」(swamps but does not compensate):前 100 次全正面后,后 900 次期望正面比例仍为 1/2(8.9,反「赌徒谬误」);Poisson 左尾 Chernoff(8.10)、二项 Chernoff 界 \(P\{X\ge i\}\le\frac{n^n}{i^i(n-i)^{n-i}}p^i(1-p)^{n-i}\)(8.11);正态尾部界可改进为 \(\frac12e^{-a^2/2}\)(8.12);\(E X<0\) 且 \(E[e^{\theta X}]=1\) 则 \(\theta>0\)(8.13,破产概率/Lundberg 指数);CLT 收敛慢的反例(8.14,提示:参数很小的 Poisson)。

Self-Test(8.1–8.14):汽车周销量界(8.1–8.2);\(\mathrm{Cov}=-3\) 时 \(|X-Y|>15\) 的界(8.3);两工厂产量比较(8.4);更新率 \(r=\lim n/S_n=1/E[X]\)(8.5,强大数定律应用);维修工时(8.7、8.9);赌徒每注 −1(.7)/−2(.2)/+10(.1),100 注后亏损概率(8.8);尼古丁含量检验(8.10,类似 z 检验);电池混合(8.11);随机医生数的诊所(8.12,条件方差);几何平均的极限 \((\prod X_i)^{1/n}\to e^{E[\log X]}\)(8.13);图书处理(8.14)。

本章要点

  1. Markov(只需均值、非负)→ Chebyshev(均值+方差)→ 单边 Chebyshev(更紧)→ Chernoff(需 MGF,指数级衰减界)——信息越多,界越紧。Chebyshev 对正态 2σ 只给 1/4,实际 4.56%。
  2. 弱大数定律:\(\bar X_n\) 依概率收敛到 \(\mu\)(Chebyshev 一行证明);强大数定律:几乎必然收敛,偏离 \(\varepsilon\) 只发生有限次。
  3. CLT:标准化和的分布收敛到 \(N(0,1)\),MGF/累积量的 L'Hôpital 证明;需要多大 \(n\) 取决于分布(偏度、厚尾);离散变量用连续性修正。非同分布版本需一致有界和方差和发散。
  4. Jensen:凸函数 \(E f(X)\ge f(EX)\);凹效用 ⇒ 风险厌恶。
  5. Poisson 近似独立 Bernoulli 和的误差 \(\le\sum p_i^2\)(耦合法)。

与量化交易的关联

  • 回测统计显著性与样本量:例 3a 的「需要多少观测才能把均值误差控制在 ±δ」直接对应「需要多长回测才能以 95% 置信度确认 alpha」:\(n\approx(z\sigma/\delta)^2\)。日超额收益均值 2bp、波动 1% 时需约 \((1.96\times100/2)^2\approx9600\) 天,说明日频 alpha 难以统计确认。Chebyshev 版本(\(n=\sigma^2/(\alpha\delta^2)\))给出不依赖分布、但更保守的样本量,适用于厚尾收益。
  • 风险建模:CLT 是「多日收益之和近似正态」「组合收益近似正态」与参数 VaR 的依据;但金融收益厚尾、相关,CLT 收敛慢(理论题 8.14)。Chebyshev/单边 Chebyshev 给出与分布无关的尾部概率上界(例如只知均值方差时 \(P\{\text{损失}\ge k\sigma\}\le1/(1+k^2)\)),可用于压力测试的保守估计。Chernoff/Hoeffding 型界用于有界收益或机器学习泛化误差分析。
  • 随机游走价格模型:习题 8.11 \(Y_n=Y_{n-1}+X_n\) 即离散随机游走价格;CLT 给出 \(n\) 日后价格近似正态、标准差 \(\sigma\sqrt n\)(波动率的平方根时间缩放)。
  • 几何平均与凯利/长期增长:自测题 8.13 用强大数定律得 \((\prod X_i)^{1/n}\to e^{E\log X}\),即复利增长率由对数收益期望决定而非算术均值;结合 Jensen,\(E\log X\le\log E X\),「波动拖累」(volatility drag) 由此而来,这是 Kelly 准则与长期资本增长理论的核心。
  • 效用与风险偏好:例 5f/习题 8.22 的凹效用 ⇒ 风险厌恶,是组合选择、风险溢价的基础。
  • 执行/保险式聚合:习题 8.15 保险总赔付、例 3e 任务完成时间的 CLT 近似,可类比大量小订单的总成交成本或总滑点分布。
  • 「强大数定律淹没而不补偿」(理论题 8.9):对抗赌徒谬误,回撤后不会「必然回补」。
  • Poisson 近似:稀有事件计数(如大量独立小概率违约、跳跃)可用 Poisson 近似,误差 \(\le\sum p_i^2\),用于信用组合违约数的粗略建模(独立假设下)。

推荐习题:习题 8.2–8.3(Chebyshev vs CLT 的样本量对比)、8.11(随机游走价格)、8.15(保险总赔付)、8.20(Jensen 多个函数)、8.23(各种界与精确值的系统对比,强烈推荐);理论题 8.5(Bernstein 多项式)、8.9(淹没而不补偿)、8.11(二项 Chernoff)、8.13(\(E e^{\theta X}=1\) 的根,破产理论)、8.14(CLT 失效反例);自测题 8.5(更新率)、8.8(负期望赌博的亏损概率)、8.13(几何平均极限)。


第 9 章 概率论的其他专题(Additional Topics in Probability)

本章目录:9.1 Poisson 过程;9.2 Markov 链;9.3 惊奇、不确定性与熵;9.4 编码理论与熵。

9.1 Poisson 过程(The Poisson Process)(PDF p.408–410)

记号:\(f\) 为 \(o(h)\) 若 \(\lim_{h\to0}f(h)/h=0\)。\(N(t)\) 为 \([0,t]\) 内事件数。\(\{N(t),t\ge0\}\) 称为速率(rate)\(\lambda>0\) 的 Poisson 过程,若: (i) \(N(0)=0\);(ii) 独立增量(independent increments):不相交区间的事件数独立;(iii) 平稳增量(stationary increments):区间内事件数分布只依赖区间长度;(iv) \(P\{N(h)=1\}=\lambda h+o(h)\);(v) \(P\{N(h)\ge2\}=o(h)\)。

第 4 章用二项极限论证过 \(N(t)\sim\) Poisson\((\lambda t)\),这里用另一方法。

引理 1.1:\(P\{N(t)=0\}=e^{-\lambda t}\)。证明:\(P_0(t+h)=P_0(t)P\{N(t+h)-N(t)=0\}=P_0(t)[1-\lambda h+o(h)]\),得 \(P_0'=-\lambda P_0\),\(P_0(0)=1\) ⇒ \(P_0(t)=e^{-\lambda t}\)。

到达间隔(interarrival times):\(T_1\) 为首事件时刻,\(T_n\) 为第 \(n-1\) 与第 \(n\) 个事件之间的间隔。\(P\{T_1>t\}=P\{N(t)=0\}=e^{-\lambda t}\);\(P\{T_2>t|T_1=s\}=P\{(s,s+t]\text{ 内 0 事件}\}=e^{-\lambda t}\)(独立平稳增量)。

命题 1.1:\(T_1,T_2,\dots\) 是独立的指数随机变量,均值 \(1/\lambda\)。

等待时间(waiting time):\(S_n=\sum_{i=1}^nT_i\) 服从 Gamma\((n,\lambda)\):\(f_{S_n}(x)=\lambda e^{-\lambda x}\frac{(\lambda x)^{n-1}}{(n-1)!}\)。

定理 1.1:\(P\{N(t)=n\}=e^{-\lambda t}(\lambda t)^n/n!\)。证明:\(N(t)\ge n\iff S_n\le t\),\(P\{N(t)=n\}=P\{S_n\le t\}-P\{S_{n+1}\le t\}\),对第一个积分分部积分(\(u=e^{-\lambda x}\),\(dv=\lambda(\lambda x)^{n-1}/(n-1)!dx\))得 \(e^{-\lambda t}(\lambda t)^n/n!+\int_0^t\lambda e^{-\lambda x}(\lambda x)^n/n!\,dx\),相减即得。

9.2 Markov 链(Markov Chains)(PDF p.410–415)

定义:状态空间 \(\{0,1,\dots,M\}\),若

\[P\{X_{n+1}=j|X_n=i,X_{n-1}=i_{n-1},\dots,X_0=i_0\}=P_{ij}\]
(只依赖当前状态,即 Markov 性),称 \(\{X_n\}\) 为 Markov 链;\(P_{ij}\) 为转移概率(transition probabilities),满足 \(P_{ij}\ge0\),\(\sum_jP_{ij}=1\),排成转移概率矩阵 \(\mathbf P=(P_{ij})\)。已知 \(\mathbf P\) 与 \(X_0\) 的分布即可算出一切概率:
\[P\{X_n=i_n,\dots,X_0=i_0\}=P_{i_{n-1}i_n}P_{i_{n-2}i_{n-1}}\cdots P_{i_0i_1}P\{X_0=i_0\}.\]

例 2a(天气):今天下雨则明天下雨概率 \(\alpha\),不下雨则 \(\beta\)。状态 0=雨、1=不雨,\(\mathbf P=\begin{pmatrix}\alpha&1-\alpha\\\beta&1-\beta\end{pmatrix}\)。 例 2b(赌徒):\(P_{i,i+1}=p=1-P_{i,i-1}\)(\(i=1..M-1\)),\(P_{00}=P_{MM}=1\)(吸收态)。 例 2c(Ehrenfest 扩散模型):\(M\) 个分子分布在两瓮,每次随机取一个分子换瓮。\(X_n\) 为瓮 1 分子数,\(P_{i,i+1}=\frac{M-i}{M}\),\(P_{i,i-1}=\frac iM\)。

\(n\) 步转移概率:\(P^{(n)}_{ij}=P\{X_{n+m}=j|X_m=i\}\)。\(P^{(2)}_{ij}=\sum_kP_{ik}P_{kj}\)。

命题 2.1(Chapman–Kolmogorov 方程):

\[P^{(n)}_{ij}=\sum_{k=0}^MP^{(r)}_{ik}P^{(n-r)}_{kj},\quad 0<r<n.\]
即 \(\mathbf P^{(n)}=\mathbf P^n\)(矩阵幂)。证明:对 \(X_r\) 条件化并用 Markov 性。

例 2d(一维随机游走):可数状态 \(\{0,\pm1,\dots\}\),\(P_{i,i+1}=p=1-P_{i,i-1}\)。\(n\) 步从 \(i\) 到 \(j\) 需 \((n-i+j)/2\) 步向右:

\[P^{n}_{ij}=\binom{n}{(n-i+j)/2}p^{(n-i+j)/2}(1-p)^{(n+i-j)/2},\]
即 \(P^{2n}_{i,i+2k}=\binom{2n}{n+k}p^{n+k}(1-p)^{n-k}\),\(P^{2n+1}_{i,i+2k+1}=\binom{2n+1}{n+k+1}p^{n+k+1}(1-p)^{n-k}\)。

无条件分布:\(P\{X_n=j\}=\sum_iP^{(n)}_{ij}P\{X_0=i\}\)。

遍历性与平稳分布:若存在 \(n>0\) 使所有 \(P^{(n)}_{ij}>0\)(2.1),称链遍历(ergodic)。此时 \(P^{(n)}_{ij}\to\pi_j\)(与初始状态无关)。由 \(P^{(n+1)}_{ij}=\sum_kP^{(n)}_{ik}P_{kj}\) 取极限:

定理 2.1:遍历 Markov 链的 \(\pi_j=\lim_nP^{(n)}_{ij}\) 存在,且是

\[\pi_j=\sum_{k=0}^M\pi_kP_{kj},\qquad\sum_j\pi_j=1\]
的唯一非负解(平稳分布 stationary distribution,\(\boldsymbol\pi=\boldsymbol\pi\mathbf P\))。

例 2e:天气链 \(\pi_0=\frac{\beta}{1+\beta-\alpha}\),\(\pi_1=\frac{1-\alpha}{1+\beta-\alpha}\)。\(\alpha=0.6,\beta=0.3\) 时长期下雨概率 \(\pi_0=3/7\)。

长期时间比例解释:\(\pi_j\) 也等于链处于状态 \(j\) 的长期时间比例。直观:设长期比例为 \(P_j\)(由强大数定律可证存在),从 \(k\) 进入 \(j\) 的比例为 \(P_kP_{kj}\),求和 \(P_j=\sum_kP_kP_{kj}\),\(\sum P_j=1\),由唯一性 \(P_j=\pi_j\)。此解释对非遍历(如周期)链一般也成立。

例 2f(Ehrenfest 平稳分布):平衡方程 \(\pi_0=\pi_1/M\),\(\pi_j=\pi_{j-1}\frac{M-j+1}{M}+\pi_{j+1}\frac{j+1}{M}\),\(\pi_M=\pi_{M-1}/M\)。解为二项分布 \(\pi_j=\binom Mj(1/2)^M\)(直观:每个分子长期各以 1/2 概率在瓮 1 中,见习题 9.11)。

9.3 惊奇、不确定性与熵(Surprise, Uncertainty, and Entropy)(PDF p.415–418)

目标:量化「得知事件 \(E\) 发生」的惊奇程度 \(S(p)\),只依赖 \(p=P(E)\),\(0<p\le1\)。四条公理:

  1. \(S(1)=0\)(必然事件无惊奇);
  2. \(S(p)\) 严格递减(越不可能越惊奇);
  3. \(S(p)\) 连续;
  4. \(S(pq)=S(p)+S(q)\)(独立事件的惊奇可加:先知 \(E\) 再知独立的 \(F\),附加惊奇应为 \(S(q)\))。

定理 3.1:满足公理 1–4 则 \(S(p)=-C\log_2p\),\(C>0\)。证明:由公理 4,\(S(p^m)=mS(p)\)(3.1),\(S(p^{1/n})=S(p)/n\)(3.2),故对正有理数 \(x\),\(S(p^x)=xS(p)\)(3.3),由连续性推广到一切 \(x\ge0\)。令 \(x=-\log_2p\),\(p=(1/2)^x\),\(S(p)=xS(1/2)=-C\log_2p\),\(C=S(1/2)>S(1)=0\)。取 \(C=1\),单位为比特(bits)。(本章此后 \(\log\) 表示 \(\log_2\),\(\ln\) 表示自然对数。)

熵(entropy):\(X\) 取 \(x_i\) 概率 \(p_i\),期望惊奇

\[H(X)=-\sum_{i=1}^np_i\log p_i\quad(0\log0:=0).\]
等概率时 \(H\) 最大(留作练习)。三种等价解读:平均惊奇、关于 \(X\) 的不确定性、观察 \(X\) 获得的平均信息量。

联合熵与条件熵:\(H(X,Y)=-\sum_i\sum_jp(x_i,y_j)\log p(x_i,y_j)\);\(H_{Y=y_j}(X)=-\sum_ip(x_i|y_j)\log p(x_i|y_j)\);\(H_Y(X)=\sum_jH_{Y=y_j}(X)p_Y(y_j)\)(观测 \(Y\) 后 \(X\) 的平均剩余不确定性)。

命题 3.1(链式法则):\(H(X,Y)=H(Y)+H_Y(X)\)。证明:代入 \(p(x_i,y_j)=p_Y(y_j)p(x_i|y_j)\) 展开对数。

引理 3.1:\(\ln x\le x-1\)(\(x>0\)),仅在 \(x=1\) 取等。

定理 3.2:\(H_Y(X)\le H(X)\),当且仅当 \(X,Y\) 独立时取等(观测 \(Y\) 平均而言减少关于 \(X\) 的不确定性)。证明:\(H_Y(X)-H(X)=\sum_i\sum_jp(x_i,y_j)\log\frac{p(x_i)}{p(x_i|y_j)}\le\log e\sum\sum p(x_i,y_j)\big[\frac{p(x_i)}{p(x_i|y_j)}-1\big]=\log e\,[\sum\sum p(x_i)p(y_j)-1]=0\)。(\(H(X)-H_Y(X)\) 即互信息 mutual information,书中未命名。)

9.4 编码理论与熵(Coding Theory and Entropy)(PDF p.418–424)

把离散 \(X\) 的取值编码为 0/1 序列传输,要求前缀条件:任何码字不能是另一码字的延伸(prefix-free),以免歧义。

例:4 个值,编码 (4.1) \(00,01,10,11\);编码 (4.2) \(0,10,110,111\);而 \(0,1,00,01\) 不允许(\(00,01\) 是 \(0\) 的延伸)。若概率为 \(1/2,1/4,1/8,1/8\),编码 (4.2) 期望长度 \(\frac12\cdot1+\frac14\cdot2+\frac18\cdot3+\frac18\cdot3=1.75\) 比特,优于 (4.1) 的 2 比特(恰等于熵 1.75)。

引理 4.1(Kraft 不等式):存在码长为 \(n_1,\dots,n_N\) 的前缀码 ⇔ \(\sum_{i=1}^N(1/2)^{n_i}\le1\)。证明:设 \(w_j\) 为码长等于 \(j\) 的个数,必要条件 \(w_1\le2\),\(w_2\le2^2-2w_1\),一般 \(w_n\le2^n-w_12^{n-1}-\cdots-w_{n-1}2\)(4.3)(且充分),即 \(\sum_{j\le n}w_j2^{-j}\le1\) 对一切 \(n\)(4.4),由单调性等价于 \(\sum_jw_j2^{-j}=\sum_i2^{-n_i}\le1\)。

定理 4.1(无噪声编码定理 noiseless coding theorem):任一前缀编码的期望码长 \(\sum n_ip(x_i)\ge H(X)\)。 证明:令 \(P_i=p(x_i)\),\(q_i=2^{-n_i}/\sum_j2^{-n_j}\)(\(\sum q_i=1\))。由引理 3.1,\(-\sum P_i\log(P_i/q_i)=\log e\sum P_i\ln(q_i/P_i)\le\log e\sum P_i(q_i/P_i-1)=0\)(即 Gibbs 不等式 / KL 散度非负)。故

\[-\sum P_i\log P_i\le-\sum P_i\log q_i=\sum n_iP_i+\log\Big(\sum_j2^{-n_j}\Big)\le\sum n_iP_i,\]
最后一步用 Kraft 不等式(\(\log\) 项 \(\le0\))。

例 4a:\(p=(1/2,1/4,1/8,1/8)\),\(H(X)=\frac12+\frac24+\frac34=1.75\),故编码 \(0,10,110,111\) 已最优。

上界:一般达不到 \(H\),但总能在 1 比特之内:取整数 \(n_i\) 满足 \(-\log p(x_i)\le n_i<-\log p(x_i)+1\),则 \(\sum2^{-n_i}\le\sum p(x_i)=1\),由 Kraft 存在该前缀码,平均长度 \(L\) 满足

\[H(X)\le L<H(X)+1.\]

例 4b(10 次抛硬币的编码):\(X=(X_1,\dots,X_{10})\) 独立,\(H(X)=\sum H(X_i)=-10[p\log p+(1-p)\log(1-p)]\)(由命题 3.1 与定理 3.2 的独立取等)。\(p=1/2\) 时 \(H=10\),无法优于直接发送原值。\(p=1/4\) 时 \(H\approx8.11\),存在平均长度 \(\le9.11\) 的编码。简单方案:两两分组,\(00\to0\),\(01\to10\),\(10\to110\),\(11\to111\)(以 0=反面为大概率),例如 TTTHHTTTTH → 010110010;平均长度 \(5[(3/4)^2+2(1/4)(3/4)+3(1/4)(3/4)+3(1/4)^2]=135/16\approx8.44\) 比特。

有噪信道:二元对称信道(binary symmetric channel)——每比特独立以概率 \(p\) 正确接收。\(p=0.8\) 时直接发送误码率 0.2。重复 3 次 + 多数表决:误码率 \((.2)^3+3(.2)^2(.8)=0.104\);重复 17 次误码率 \(<0.01\)。表 9.1:误码率 0.20/0.10/0.01 对应速率 1、1/3(文中 0.104 约记 .10)、1/17≈0.06——降低误码以降低速率为代价。

定理 4.2(有噪编码定理 noisy coding theorem,Shannon):存在常数 \(C\),对任意 \(R<C\) 和 \(\varepsilon>0\),存在编码–解码方案以平均速率 \(R\) 比特/信号传输且每比特误码率 \(<\varepsilon\)。最大的此类 \(C\) 记为 \(C^*\),称信道容量(channel capacity);二元对称信道

\[C^*=1+p\log p+(1-p)\log(1-p).\]
(即误码率可任意小而速率不必趋于 0。)

第 9 章 小结、习题与参考文献(PDF p.424–427)

Summary:Poisson 过程四特征(独立增量、平稳增量、事件逐个发生、速率 \(\lambda\)),\(N(t)\sim\) Poisson\((\lambda t)\),间隔独立指数;Markov 链定义、极限概率满足 \(\pi_j=\sum_i\pi_iP_{ij}\)、\(\sum\pi_j=1\),且等于长期时间比例;熵的定义与解释。

Problems and Theoretical Exercises(9.1–9.18):Poisson 过程条件分布(9.1:已知 1 小时内到 2 人,二者都在前 20 分钟的概率——给定 \(N(t)=n\) 时到达时刻为均匀次序统计量);横穿公路(9.2–9.3,无车 / 至多 1 辆车的概率);两瓮换球 Markov 链的转移矩阵与极限概率(9.4、9.6);天气链 3 步转移(9.5);双随机矩阵(doubly stochastic)的遍历链平稳分布为均匀 \(1/(M+1)\)(9.7);情绪三态链(9.8);依赖前两天的天气——通过扩充状态为 (昨天, 今天) 转化为一阶 Markov 链(9.9);跑鞋问题(9.10);Ehrenfest 平稳分布解释(9.11);两骰和的熵(9.12);等概率熵最大 \(H=\log n\)(9.13);条件熵计算(9.14);6 次有偏硬币的熵(9.15);是/否问答次数的下界为 \(H(X)\)(9.16,二十问游戏);\(H(f(X))\le H(X)\)(9.17);信道容量在输入等概率时达到(9.18)。

Self-Test(9.1–9.5):Poisson 过程时段计数与第 5 个事件的期望时刻;卡车–汽车跟随比例(Markov 链平稳分布);三态天气长期比例;比较两个分布的熵。

References:Kemeny–Snell–Knapp《Denumerable Markov Chains》;Parzen《Stochastic Processes》;Ross《Introduction to Probability Models》《Stochastic Processes》;信息论:Abramson、McEliece、Peterson–Weldon。

本章要点

  1. Poisson 过程由独立平稳增量 + 稀有性条件刻画;\(N(t)\sim\) Poisson\((\lambda t)\);到达间隔 i.i.d. 指数\((\lambda)\);第 \(n\) 个事件时刻 ~ Gamma\((n,\lambda)\);\(\{N(t)\ge n\}=\{S_n\le t\}\) 是连接计数与时刻的关键。
  2. Markov 链:转移矩阵 + 初始分布决定一切;C–K 方程即矩阵乘法 \(\mathbf P^{(n)}=\mathbf P^n\);遍历链的极限分布与初值无关,是 \(\boldsymbol\pi=\boldsymbol\pi\mathbf P\) 的唯一概率解,并等于长期时间占比。
  3. 熵 \(H=-\sum p\log p\) 由四条公理唯一确定(至常数倍);链式法则 \(H(X,Y)=H(Y)+H_Y(X)\);条件化不增加熵,独立时取等。
  4. 编码:Kraft 不等式;无噪编码定理 \(H\le L<H+1\);有噪编码定理与信道容量 \(1-h(p)\)。

与量化交易的关联

  • 订单流与事件建模(执行、微观结构):Poisson 过程是限价单到达、成交事件、跳跃(Merton 跳扩散)的基础模型;间隔指数分布与无记忆性用于成交间隔(duration)建模与执行算法中的成交概率估计。复合 Poisson(结合第 7 章随机和)描述一段时间内的总成交量或跳跃总幅度。现实中到达强度随时间变化且自激(Hawkes 过程),本章只给出齐次基准。
  • Markov 链与状态切换:市场状态(牛/熊/震荡)、信用评级迁移矩阵(credit migration matrix)、波动率 regime 都用有限状态 Markov 链建模;\(n\) 期迁移概率即 \(\mathbf P^n\),长期违约/评级分布即平稳分布。习题 9.9 的「扩充状态」技巧用于把依赖多期历史的信号转为一阶 Markov 结构。隐 Markov 模型(HMM)的 regime 识别以此为基础。
  • 信息论与因子研究:熵与条件熵(互信息 \(H(X)-H_Y(X)\))可度量信号对未来收益方向的非线性预测信息,作为相关系数(IC)的补充;用于特征筛选、离散化信号评估。Kelly 准则与信息论直接关联:在公平赔率下最优增长率等于互信息(本书未展开)。编码定理与量化交易无直接关系,仅作为背景理解。

推荐习题:9.1(Poisson 过程条件均匀性)、9.5(\(n\) 步转移计算)、9.7(双随机矩阵)、9.8(三态链平稳分布)、9.9(扩充状态,强烈推荐)、9.13(熵最大化)、9.16(问答次数下界)、9.18(信道容量);自测题 9.3–9.4。


第 10 章 模拟(Simulation)

本章目录:10.1 引言;10.2 模拟连续随机变量的一般方法;10.3 离散分布的模拟;10.4 方差缩减技术。

10.1 引言(PDF p.428–430)

动机:纸牌接龙(solitaire)在固定策略下获胜的概率——\(52!\) 种排列无法枚举,只能「实验」。玩 \(n\) 局,\(X_i\)=第 \(i\) 局胜的示性变量,由强大数定律 \(\sum X_i/n\to P\{\text{胜}\}\)(以概率 1)。用实验经验确定概率的方法称为模拟(simulation)。

随机数(random numbers):模拟的基础是生成 \(U(0,1)\) 变量。计算机用伪随机数(pseudorandom numbers)生成器,常见为线性同余法:给定种子(seed)\(X_0\) 和正整数 \(a,c,m\),

\[X_{n+1}=(aX_n+c)\bmod m,\quad n\ge0\quad(1.1)\]
\(X_n\in\{0,\dots,m-1\}\),取 \(X_n/m\) 近似 \(U(0,1)\)。参数选得好时序列看起来像独立均匀样本。此后「随机数」均指独立 \(U(0,1)\)。

例 1a(生成随机排列,即 Fisher–Yates / Knuth 洗牌):

  1. 取任意排列 \(X(1),\dots,X(n)\)(如 \(X(i)=i\));
  2. 令 \(I=n\);
  3. 生成随机数 \(U\),令 \(N=[IU]+1\)(在 \(1..I\) 上均匀,因 \(P\{i-1<IU<i\}=1/I\));
  4. 交换 \(X(N)\) 与 \(X(I)\);
  5. \(I\leftarrow I-1\),若 \(I>1\) 回到第 3 步;
  6. 输出 \(X(1..n)\)。 示例:\(n=4\),\(N_4=3\) → (1,2,4,3);\(N_3=1\) → (4,2,1,3);\(N_2=1\) → (2,4,1,3)。复杂度 \(O(n)\),所有 \(n!\) 排列等可能。 应用:随机化实验设计——把 \(n\) 个受试者分成大小 \(n_1,\dots,n_m\) 的处理组,生成随机排列后依次分组,消除分组偏差(比第 6 章例 2g 的方法更快但更占空间)。

10.2 模拟连续随机变量的一般方法(PDF p.430–437)

10.2.1 逆变换法(Inverse Transformation Method)

命题 2.1:\(U\sim U(0,1)\),\(F\) 为连续分布函数,\(Y=F^{-1}(U)\),则 \(Y\) 的分布函数为 \(F\)。证明:\(F\) 单调,\(F^{-1}(U)\le a\iff U\le F(a)\),故 \(P\{Y\le a\}=F(a)\)。

例 2a(指数分布):\(F(x)=1-e^{-x}\),\(F^{-1}(u)=-\log(1-u)\);因 \(1-U\) 也均匀,\(-\log U\sim\) Exp(均值 1);\(-c\log U\) 为均值 \(c\) 的指数。

例 2b(Gamma\((n,\lambda)\),\(n\) 为整数):\(n\) 个独立速率 \(\lambda\) 指数之和:

\[X=-\frac1\lambda\sum_{i=1}^n\log U_i=-\frac1\lambda\log\Big(\prod_{i=1}^nU_i\Big).\]
(只需一次对数。)

10.2.2 拒绝法(Rejection Method / acceptance–rejection)

已能从密度 \(g\) 抽样,要从 \(f\) 抽样。取常数 \(c\) 使 \(f(y)/g(y)\le c\) 对所有 \(y\)。

  • 步骤 1:从 \(g\) 抽 \(Y\),并生成随机数 \(U\);
  • 步骤 2:若 \(U\le\frac{f(Y)}{cg(Y)}\),令 \(X=Y\);否则回到步骤 1。 (图 10.1 为流程图。)

命题 2.2:所得 \(X\) 的密度为 \(f\)。证明:\(P\{X\le x\}=P\{Y\le x\,|\,U\le f(Y)/cg(Y)\}=\frac1K\int_{-\infty}^x\int_0^{f(y)/cg(y)}du\,g(y)dy=\frac1{cK}\int_{-\infty}^xf(y)dy\),其中 \(K=P\{U\le f(Y)/cg(Y)\}\);令 \(x\to\infty\) 得 \(cK=1\)。 注:(a) 「以概率 \(f/cg\) 接受」通过比较随机数实现;(b) 每次独立以概率 \(K=1/c\) 接受,迭代次数为几何分布,均值 \(c\)——\(c\) 越接近 1 效率越高。

例 2c(用指数拒绝法生成正态):\(|Z|\) 的密度 \(f(x)=\frac{2}{\sqrt{2\pi}}e^{-x^2/2}\)(\(x>0\)),取 \(g(x)=e^{-x}\)。

\[\frac{f(x)}{g(x)}=\sqrt{\frac2\pi}e^{-(x^2-2x)/2}=\sqrt{\frac{2e}{\pi}}e^{-(x-1)^2/2}\le\sqrt{\frac{2e}\pi}=c\approx1.32,\qquad\frac{f(x)}{cg(x)}=e^{-(x-1)^2/2}.\]
算法:生成独立 \(Y\sim\) Exp(1)、\(U\);若 \(U\le e^{-(Y-1)^2/2}\) 则 \(X=Y\),否则重来;再以各 1/2 概率取 \(Z=\pm X\)。 改进:\(U\le e^{-(Y-1)^2/2}\iff-\log U\ge(Y-1)^2/2\),而 \(-\log U\) 本身是 Exp(1),故等价于:生成 Exp(1) 的 \(Y_1,Y_2\),若 \(Y_2\ge(Y_1-1)^2/2\) 接受 \(X=Y_1\)。由无记忆性,接受时超出量 \(Y_2-(Y_1-1)^2/2\) 又是独立的 Exp(1),可循环使用。完整算法:

  1. 生成 \(Y_1\sim\) Exp(1);2. 生成 \(Y_2\sim\) Exp(1);3. 若 \(Y_2-(Y_1-1)^2/2>0\),令 \(Y=Y_2-(Y_1-1)^2/2\),转 4;否则转 1;4. 生成 \(U\),\(Z=Y_1\)(\(U\le1/2\))或 \(-Y_1\)(\(U>1/2\))。 输出独立的 \(Z\sim N(0,1)\) 与 \(Y\sim\) Exp(1);\(N(\mu,\sigma^2)\) 取 \(\mu+\sigma Z\)。 注:平均迭代 1.32 次;连续生成多个正态时把剩余的 \(Y\) 用作下一轮的 \(Y_1\),平均每个正态只需 \(1.64=2\times1.32-1\) 个指数和 1.32 次平方运算。

例 2d(极坐标法 / Box–Muller):独立标准正态 \(X,Y\) 的极坐标 \(R^2\sim\) Exp(均值 2),\(\Theta\sim U(0,2\pi)\),独立(第 6 章例 7b)。故 \(R=(-2\log U_1)^{1/2}\),\(\Theta=2\pi U_2\),

\[X=(-2\log U_1)^{1/2}\cos(2\pi U_2),\quad Y=(-2\log U_1)^{1/2}\sin(2\pi U_2)\quad(2.5)\]
为独立标准正态(Box–Muller 法)。缺点是计算三角函数较慢。

极坐标法(polar method / Marsaglia)避免三角函数:\(V_i=2U_i-1\) 在 \([-1,1]^2\) 正方形上均匀;不断生成直到 \(V_1^2+V_2^2\le1\),则 \((V_1,V_2)\) 在单位圆盘上均匀,其极坐标满足 \(R^2\sim U(0,1)\)、\(\Theta\sim U(0,2\pi)\) 独立(习题 10.13)(图 10.2)。\(\sin\Theta=V_2/R\),\(\cos\Theta=V_1/R\),且可直接用 \(S=R^2\) 代替新随机数:

  1. 生成 \(U_1,U_2\);2. \(V_1=2U_1-1\),\(V_2=2U_2-1\),\(S=V_1^2+V_2^2\);3. 若 \(S>1\) 回到 1;4. 返回
    \[X=\sqrt{\frac{-2\log S}{S}}V_1,\qquad Y=\sqrt{\frac{-2\log S}{S}}V_2.\]
    接受概率 \(\pi/4\),平均 \(4/\pi\approx1.273\) 次迭代;生成 2 个正态平均需 2.546 个随机数、1 次对数、1 次开方、1 次除法、4.546 次乘法。

例 2e(卡方):\(Z_1^2+Z_2^2\sim\) Exp(速率 1/2),故 \(\chi^2_{2k}\sim\) Gamma\((k,1/2)\),\(=-2\log(\prod_{i=1}^kU_i)\);奇数自由度:

\[\chi^2_{2k+1}=Z^2-2\log\Big(\prod_{i=1}^kU_i\Big).\]

10.3 离散分布的模拟(PDF p.437–439)

离散逆变换:\(P\{X=x_j\}=P_j\),生成 \(U\),若 \(\sum_{i<j}P_i<U\le\sum_{i\le j}P_i\) 则 \(X=x_j\);概率恰为 \(P_j\)。(效率:按概率从大到小排列可减少平均比较次数,见自测题 10.3。)

例 3a(几何分布):\(P\{X=i\}=(1-p)^{i-1}p\),\(\sum_{i<j}P\{X=i\}=1-(1-p)^{j-1}\)。取 \(j\) 使 \((1-p)^j\le1-U<(1-p)^{j-1}\),用 \(U\) 代替 \(1-U\):

\[X=\min\{j:(1-p)^j\le U\}=\min\Big\{j:j\ge\frac{\log U}{\log(1-p)}\Big\}=1+\Big[\frac{\log U}{\log(1-p)}\Big]\]
(注意 \(\log(1-p)<0\) 不等号反向)。

例 3b(二项分布):\(X_i=I(U_i<p)\),\(X=\sum_{i=1}^nX_i\sim\text{Bin}(n,p)\)。

例 3c(Poisson 分布):不断生成 \(U_1,U_2,\dots\),\(N=\min\{n:\prod_{i=1}^nU_i<e^{-\lambda}\}\),则 \(X=N-1\sim\) Poisson\((\lambda)\)。理由:\(X=\max\{n:\prod_{i\le n}U_i\ge e^{-\lambda}\}=\max\{n:\sum_{i\le n}(-\log U_i)\le\lambda\}\),\(-\log U_i\) 为 Exp(1),故 \(X\) 是速率 1 的 Poisson 过程在时刻 \(\lambda\) 前的事件数。

10.4 方差缩减技术(Variance Reduction Techniques)(PDF p.439–442)

蒙特卡洛估计框架:估计 \(\theta=E[g(X_1,\dots,X_n)]\)。独立生成 \(k\) 组 \(\mathbf X^{(j)}\),\(Y_j=g(\mathbf X^{(j)})\),\(\bar Y=\sum Y_j/k\)。\(E[\bar Y]=\theta\),均方误差 \(E[(\bar Y-\theta)^2]=\mathrm{Var}(\bar Y)=\mathrm{Var}(Y_j)/k\)(通常未知,需用模拟值估计)。目标:在不改变均值的前提下减小方差。

10.4.1 对偶变量(Antithetic Variables)

\(\mathrm{Var}\big(\frac{Y_1+Y_2}2\big)=\frac{\mathrm{Var}(Y_1)}2+\frac{\mathrm{Cov}(Y_1,Y_2)}2\)——若 \(Y_1,Y_2\) 负相关,方差小于独立情形。若 \(X_i\) 由逆变换 \(F_i^{-1}(U_i)\) 生成,令

\[Y_1=g(F_1^{-1}(U_1),\dots,F_n^{-1}(U_n)),\quad Y_2=g(F_1^{-1}(1-U_1),\dots,F_n^{-1}(1-U_n)).\]
\(Y_2\) 与 \(Y_1\) 同分布;\(1-U\) 与 \(U\) 负相关;且省去生成新随机数的开销。当 \(g\) 单调时可证 \(Y_1,Y_2\) 负相关。

10.4.2 条件化方差缩减(Variance Reduction by Conditioning)

由条件方差公式 \(\mathrm{Var}(Y)=E[\mathrm{Var}(Y|Z)]+\mathrm{Var}(E[Y|Z])\),若能算出 \(E[Y|Z]\),则 \(\mathrm{Var}(E[Y|Z])\le\mathrm{Var}(Y)\) 且 \(E[E[Y|Z]]=E[Y]\),故 \(E[Y|Z]\) 是更好的估计量(Rao–Blackwell 化)。

例 4a(估计 \(\pi\)):\((V_1,V_2)\) 在正方形上均匀,\(I\)=落在单位圆内,\(E[I]=\pi/4\),\(4\times\) 比例 → \(\pi\)(强大数定律)。 改进 1(条件化):\(E[I|V_1]=P\{V_2^2\le1-V_1^2\}=\sqrt{1-V_1^2}\);又 \(E[\sqrt{1-V_1^2}]=\int_{-1}^1\frac12\sqrt{1-v^2}dv=\int_0^1\sqrt{1-u^2}du=E[\sqrt{1-U^2}]\),故用 \(n\) 个随机数的 \(\sqrt{1-U^2}\) 均值估计 \(\pi/4\)(习题 10.14:其方差与 \(\sqrt{1-V^2}\) 版本相同)。 改进 2(再加对偶):\(\sqrt{1-u^2}\) 在 \([0,1]\) 单调递减,用 \(n/2\) 个随机数,取 \(\frac12[\sqrt{1-U^2}+\sqrt{1-(1-U)^2}]\) 的均值。 模拟结果(\(n=10000\)):

方法 \(\pi\) 估计
点落圆内比例 3.1612
\(\sqrt{1-U^2}\) 均值 3.128448
\(\sqrt{1-U^2}+\sqrt{1-(1-U)^2}\) 均值 3.139578

最后一种方法取 \(n=64000\) 得 3.143288。

10.4.3 控制变量(Control Variates)(PDF p.442)

若已知 \(E[f(\mathbf X)]=\mu\),对任意常数 \(a\),\(W=g(\mathbf X)+a[f(\mathbf X)-\mu]\) 也是 \(E[g(\mathbf X)]\) 的无偏估计:

\[\mathrm{Var}(W)=\mathrm{Var}[g]+a^2\mathrm{Var}[f]+2a\,\mathrm{Cov}[g,f]\quad(4.1)\]
最优 \(a^*=-\dfrac{\mathrm{Cov}[f(\mathbf X),g(\mathbf X)]}{\mathrm{Var}[f(\mathbf X)]}\)(4.2),此时
\[\mathrm{Var}(W)=\mathrm{Var}[g(\mathbf X)]-\frac{\mathrm{Cov}[f(\mathbf X),g(\mathbf X)]^2}{\mathrm{Var}[f(\mathbf X)]}\quad(4.3)\]
(即方差缩减比例为 \(\rho^2(f,g)\))。实践中 \(\mathrm{Var}[f]\) 与 \(\mathrm{Cov}\) 未知,用模拟数据估计,通常能获得几乎全部理论缩减。(\(a^*\) 即 \(g\) 对 \(f\) 回归的负斜率,与 7.6 节最优线性预测同构。)

第 10 章 小结与习题(PDF p.443–445)

Summary:逆变换法 \(F^{-1}(U)\);拒绝法(\(c\ge\max f/g\),迭代次数几何分布均值 \(c\));正态可用指数拒绝法或极坐标法;三种方差缩减:对偶变量、条件期望、控制变量。

Problems(10.1–10.16):另一种随机排列算法(10.1,逐步插入,\(P(k)=P([kU]+1)\),\(P([kU]+1)=k\),归纳证明均匀);用逆变换模拟 Laplace 型双指数密度(10.2)、三角形分段密度(10.3)、分段分布函数(10.4)、Weibull 分布 \(F(t)=1-e^{-at^\beta}\)(10.5);给定失效率函数 \(\lambda(t)=c,ct,ct^2,ct^3\) 的模拟(10.6,\(F(t)=1-e^{-\int_0^t\lambda}\));\(F(x)=x^n\) 的两种方法(10.7:\(U^{1/n}\) 或 \(n\) 个均匀的最大值);乘积型与「1−乘积」型分布函数(10.8,分别对应独立变量的最大值与最小值);混合分布 \(pF_1+(1-p)F_2\)(10.9,先抛硬币选成分,组合法 composition);证明指数拒绝法中 \(\lambda=1\) 最优(10.10);用均匀拒绝法模拟 Beta 型 \(60x^3(1-x)^2\)(10.11);蒙特卡洛积分 \(\int_0^1k(x)dx=E[k(U)]\)(10.12);圆盘均匀点极坐标独立性(10.13);\(\sqrt{1-V^2}\) 与 \(\sqrt{1-U^2}\) 同方差(10.14);控制变量最优系数推导(10.15);重要性抽样(importance sampling):用密度 \(f\) 抽 \(X\),以 \(g(X)/f(X)\) 估计 \(\int_0^1g\),\(f\) 形状接近 \(g\) 时方差小(10.16)。

Self-Test(10.1–10.5):\(f=Ce^x\) 在 \((0,1)\) 的归一化与逆变换(10.1);\(30(x^2-2x^3+x^4)\) 的拒绝法(10.2);离散分布的高效逆变换(按概率降序比较,10.3);构造与 \(X\sim N(\mu,\sigma^2)\) 同分布且负相关的 \(Y=2\mu-X\)(10.4);估计 \(E[e^{XY}]\) 及用控制变量改进(10.5,例如 \(f=XY\),\(E[XY]=1\))。

Reference:Ross《Simulation》第 5 版(2012)。

本章要点

  1. 一切模拟从 \(U(0,1)\) 伪随机数开始(线性同余生成器);强大数定律保证模拟均值收敛,CLT 给出误差 \(\sim\sigma/\sqrt k\)。
  2. 逆变换法:\(X=F^{-1}(U)\),适用于 \(F^{-1}\) 有显式式(指数、Weibull、几何等);离散版本按累积概率分段。
  3. 拒绝法:从易抽样的 \(g\) 出发,以 \(f/(cg)\) 接受,效率 \(1/c\)。
  4. 正态生成:指数拒绝法(\(c\approx1.32\))、Box–Muller、Marsaglia 极坐标法(接受率 \(\pi/4\));Gamma 用指数和、Poisson 用均匀乘积 / Poisson 过程、二项用 Bernoulli 和。
  5. 方差缩减:对偶变量(单调函数时有效)、条件化(Rao–Blackwell)、控制变量(最优系数 \(-\mathrm{Cov}/\mathrm{Var}\),缩减比例 \(\rho^2\))、重要性抽样(习题)。

与量化交易的关联

  • 定价:蒙特卡洛是路径依赖期权、篮子期权、美式期权(LSM)等定价的通用方法;本章正态生成(Box–Muller/极坐标)用于生成几何布朗运动路径;对偶变量(\(Z\) 与 \(-Z\))是期权蒙特卡洛的标配,因收益函数对标的通常单调;控制变量的经典用法是以几何平均亚式期权(有解析价)作为算术平均亚式期权的控制变量,或以标的资产折现价格(鞅,已知期望)作控制;条件化对应「条件蒙特卡洛」(如对随机波动率条件化后用 BS 公式);重要性抽样用于深度虚值期权和尾部风险。
  • 风险建模:蒙特卡洛 VaR/ES 需大量情景,尾部概率估计方差大,重要性抽样与控制变量直接决定计算成本;Poisson 跳跃、违约时间(指数/Weibull 由失效率模拟,习题 10.6)用逆变换生成。
  • 回测与统计检验:随机排列算法(例 1a)用于置换检验(permutation test)、打乱标签检验因子是否显著、bootstrap 重抽样;随机化分组思想对应 A/B 式的执行算法对照实验。
  • 系统实现:随机数生成器的质量(周期、相关性)与种子管理影响回测可复现性;线性同余生成器在现代量化系统中已被 Mersenne Twister、PCG、Philox 等替代,但原理相同。Fisher–Yates 洗牌 \(O(n)\) 是标准实现。
  • 控制变量 ⇔ 回归/对冲:最优 \(a^*=-\mathrm{Cov}/\mathrm{Var}\) 与最小方差对冲比率(hedge ratio)完全同构,方差缩减 \(\rho^2\) 即对冲有效性。

推荐习题:10.1(随机排列另一算法的正确性证明)、10.5–10.6(Weibull 与失效率模拟,信用/违约建模)、10.9(混合分布的组合法)、10.10(拒绝法参数优化)、10.12(蒙特卡洛积分)、10.15(控制变量最优系数)、10.16(重要性抽样,强烈推荐);自测题 10.4(对偶变量)、10.5(控制变量)。


附录 A 部分习题答案(Answers to Selected Problems)(PDF p.446–447)

按章列出第 1–9 章部分 Problems 的数值答案(只有结果,无过程)。与本块相关的第 7–9 章答案摘录(便于编写者核对):

  • 第 7 章:7.1 \(52.5/12\);7.2 324, 198.8;7.3 1/2, 1/4, 0;7.4 1/6, 1/4, 1/2;7.5 3/2;7.6 35;7.7 0.9, 4.9, 4.2;7.8 \((1-(1-p)^N)/p\);7.10 0.6, 0;7.11 \(2(n-1)p(1-p)\);7.12 \((3n^2-n)/(4n-2)\), \(3n^2/(4n-2)\);7.14 \(m/(1-p)\);7.15 1/2;7.18 4;7.21 0.9301, 87.5755;7.22 14.7;7.23 147/110;7.26 \(n/(n+1)\), \(1/(n+1)\);7.29 437/35, 12, 4, 123/35;7.31 175/6;7.33 14, 45;7.34 20/19, 360/361;7.35 21.2, 18.929, 49.214;7.36 \(-n/36\);7.37 0;7.38 1/8;7.41 6, 112/33;7.42 100/19, 16200/6137, 10/19, 3240/6137;7.45 1/2, 0;7.47 \(1/(n-1)\);7.48 6, 7, 5.8192;7.49 6.07;7.50 \(2y^2\);7.51 \(y^3/4\);7.53 12;7.54 8;7.56 \(N(1-e^{-10/N})\);7.57 12.5;7.63 \(-96/145\);7.65 4.2, 5.16;7.66 218;7.67 \(x[1+(2p-1)^2]^n\)(Kelly 策略下 \(n\) 次后期望财富);7.69 1/2, 1/16, 2/81;7.70 1/2, 1/3;7.72 \(1/i\), \([i(i+1)]^{-1}\), \(\infty\);7.73 \(\mu\), \(1+\sigma^2\), 是, \(\sigma^2\);7.79 0.176, 0.141。
  • 第 8 章:8.1 \(\ge19/20\);8.2 15/17, \(\ge3/4\), \(\ge10\);8.3 \(\ge3\);8.4 \(\le4/3\), 0.8428;8.5 0.1416;8.6 0.9431;8.7 0.3085;8.8 0.6932;8.9 \((327)^2\);8.10 117;8.11 \(\ge0.057\);8.13 0.0162, 0.0003, 0.2514, 0.2514;8.14 \(n\ge23\);8.16 0.013, 0.018, 0.691;8.18 \(\le0.2\);8.23 0.769, 0.357, 0.4267, 0.1093, 0.112184(Markov/单边 Chebyshev/Chernoff/CLT/精确值,界逐级变紧);8.24 (a)。
  • 第 9 章:9.1 1/9, 5/9;9.3 0.9735, 0.9098, 0.7358, 0.5578;9.10(b) 1/6;9.14 2.585, 0.5417, 3.1267;9.15 5.5098。
  • 第 1–6 章答案(组合计数、概率公理、条件概率、离散/连续分布、联合分布)属上一块内容,此处只列出不展开。

附录 B 自测题完整解答(Solutions to Self-Test Problems and Exercises)(PDF p.448–476)

按章给出全部 Self-Test 题的详细解答。第 1–6 章解答属前面章节内容,这里概括其方法;第 7–10 章解答与本块对应,逐题记录关键思路和结果。

第 1 章(p.448–449):排列组合技巧——「粘连法」处理相邻约束(A、B 相邻:\(2\cdot5!=240\))、对称性(A 在 B 前占一半)、补集计数、分步乘法原理、多项系数 \(\binom{7}{3,2,2}=210\)、牌照计数、夫妻代表选取 \(\binom{10}6 2^6\)、不定方程非负整数解个数 \(\binom{n+r-1}{r-1}\)、组合恒等式的组合证明(\(\binom n2=\binom k2+k(n-k)+\binom{n-k}2\))、多项式定理的计数证明。

第 2 章(p.449–451):容斥原理(买西装/衬衫/领带,\(P(A\cup B\cup C)=0.51\),恰买一件 0.28);对称性(第 14 张为 A 的概率 4/52;第一张 A 出现在第 14 张 0.0312);扑克牌型概率;四种花色都出现的概率(容斥或「新/旧花色」序列法,0.2637);室友配对 0.5714;Boole 不等式的可数版本证明(构造不交的 \(B_i\));第二类 Stirling 数递推 \(T_k(n)=kT_k(n-1)+T_{k-1}(n-1)\);三色球都出现概率 0.7067;红球先于蓝球全部取完 ⇔ 最后一个是蓝球(10/30)。

第 3 章(p.451–455):条件概率与 Bayes 公式的典型应用——条件于「至少一个 A」vs「指定的 A」的区别(3/51 vs 1/33);Bayes 后验(植物浇水 16/43、电池类型 0.4、遗传学黑鼠 16/17);继电器网络可靠性(条件于某继电器);轮盘赌连续 10 次黑后下一次概率不变(独立性,反赌徒谬误);奇数人出局问题的条件递推;对称性求 \(P(B)=(1-\sum p_i^2)/2\);两人抛硬币 A 比 B 多正面的概率 1/2;Pólya 瓮的归纳证明(红球数均匀分布);集券问题导出恒等式 \(n!=\sum_k(-1)^k\binom nk(n-k)^n\);\(P(E|E\cup F)\ge P(E|F)\)。

第 4 章(p.455–459):离散随机变量的期望与方差;「随机选孩子」vs「随机选家庭」的家庭规模偏差 \(E[Y]\ge E[X]\)(规模偏差 size-biased sampling,等价于 \(\sum i^2n_i\sum n_i\ge(\sum in_i)^2\));信息价值:知道硬币是 0.6 还是 0.3 后,\(p>1/2\) 押最大注、\(p\le1/2\) 不押,信息价值为 1(期望收益线性于押注额,故最优策略是边角解);两张纸(2 倍 / 一半)换不换问题的阈值策略期望收益;二项/超几何/几何/负二项/Poisson 的识别与计算;陪审团多数表决;配对问题的方差为 1;几何变量为偶数的概率 \(q/(1+q)\);Poisson 近似婚配/配对问题 \(P_0\approx e^{-1}\) 或 \(e^{-1/2}\);负超几何分布 pmf;轮盘押 1 赔 35,\(n=34\)、1000、100000 次后领先的概率(CLT 近似 0.6638/0.4075/0.0020 vs 精确 0.5961/0.3961/0.0021,说明负期望博弈长期必亏)(此题属第 5 章 5.17)。

第 5 章(p.459–461 起):连续分布——密度归一化求常数、均匀分布条件概率、竞标问题:出价 \(x\) 时期望利润 \(\frac1{70}(x-100)(140-x)\),最优出价 120(千美元),期望利润 40/7;正态分布计算(考试分数、通勤时间分位数 \(x=40+1.645\times7\));二项的正态近似带连续性修正(收入调查);指数无记忆性;失效率函数 \(\lambda(t)=2t\)(Rayleigh)及其均值 \(\sqrt\pi/2\)、方差 \(1-\pi/4\);Cauchy 的倒数仍为 Cauchy;混合指数电池剩余寿命 \(\frac{p_1e^{-\lambda_1(s+t)}+p_2e^{-\lambda_2(s+t)}}{p_1e^{-\lambda_1t}+p_2e^{-\lambda_2t}}\)(混合后不再无记忆);指数检验临界值 \(c=\log20\)。

  • 5.20:\(E[(Z-c)^+]=\frac1{\sqrt{2\pi}}e^{-c^2/2}-c(1-\Phi(c))\);对 \(X\sim N(\mu,\sigma^2)\),\(E[(X-c)^+]=\sigma\big[\frac{1}{\sqrt{2\pi}}e^{-a^2/2}-a(1-\Phi(a))\big]\),\(a=(c-\mu)/\sigma\)——这就是正态模型(Bachelier)下看涨期权的期望收益公式。5.22:\(bU\)、\(a+U\)、\(a+(b-a)U\) 的分布;\(\min(U,1-U)\sim U(0,1/2)\),\(\max(U,1-U)\sim U(1/2,1)\)。

第 6 章(p.462–465):联合分布——求归一化常数与边缘密度(\(C=1/4\),\(E[X]=-1\),\(E[Y]=3\));多项分布的合并类别仍为多项;联合密度是否可分解判断独立;Marshall–Olkin 二元指数(共同冲击模型)\(P\{X_1>s,X_2>t\}=\exp\{-\lambda_1s-\lambda_2t-\lambda_3\max(s,t)\}\)(信用相关违约建模的经典模型);广告随机抽取的拒绝采样(6.9–6.10);飞镖得分;正态随机游走的条件概率;\(X\) 为 Gamma 混合时 \(N-1|X=x\sim\) Poisson\((\lambda(1-p)x)\)(6.14);Jacobian 变换求 \(U+V\) 的三角分布;一级价格拍卖:对手出价 \(U(7,11)\),期望收益 \(\frac1{64}(x-7)^3(10-x)\),最优出价 37/4(6.16);布朗桥性质:\(S_k|S_n=x\sim N(\frac knx,\frac{k(n-k)}n)\)(6.19,随机游走/布朗运动的桥接分布);i.i.d. 序列中第 6 个超过前 5 个最大值的概率 1/6 与独立于哪一个最大(6.20)。

第 7 章自测题解答(p.465–475):

  • 7.1:\(d=\sum_i1/n(i)\);\(X=[mU]+1\) 均匀;\(E[m/n(X)]=d\)(用单个随机位置无偏估计不同名字数)。
  • 7.2:白球后紧跟黑球次数期望 \(\frac{nm}{n+m}\)。
  • 7.3:(a) 随机就座,妻子 \(j\) 的另 3 位同桌中有其丈夫的概率 \(\binom{18}2/\binom{19}3=3/19\),期望 \(30/19\);(b) 每桌 2 男 2 女,概率 2/10,期望 2。
  • 7.4:掷骰集齐六面期望 14.7 次,由对称性每面出现次数期望 \(14.7/6=2.45\)。
  • 7.5:第 \(j\) 张红牌翻出时红多于黑的概率由对称性为 1/2,期望赢 \(n/2\)。
  • 7.6:\(N\le n-1+I\) 取期望得 Bonferroni 不等式。
  • 7.7:\(k\) 个数中最小值视为负超几何,\(E[X]=\frac{n+1}{k+1}\);\(P\{X\ge j\}=\binom{n-j+1}k/\binom nk\)。
  • 7.8:Sanchez 家(\(j\) 件行李)之后离开的家庭数期望 \(\sum_k\frac{kn_k}{k+j}-\frac12\)(同为 \(j\) 件的家庭各以 1/2 概率在后)。
  • 7.9:圆周长 \(2\pi\),长 1 的弧覆盖某点概率 \(1/2\pi\),\(E[X]=19/2\pi>3\),故存在含 ≥4 点的弧(概率方法)。
  • 7.10:Delta 方法:\(\sqrt X\approx\sqrt\lambda+\frac12\lambda^{-1/2}(X-\lambda)-\frac18\lambda^{-3/2}(X-\lambda)^2\),\(E\sqrt X\approx\sqrt\lambda-\frac18\lambda^{-1/2}\),\(\mathrm{Var}(\sqrt X)\approx\frac14-\frac1{64\lambda}\approx\frac14\)(Poisson 方差稳定化)。
  • 7.11:3 张 4 人桌 + 4 张 2 人桌,夫妻同桌概率分别为 \(3/95\) 与 \(1/190\),求和。
  • 7.12:招聘问题,个体 \(i\) 未招到人的概率 \(\frac{i-1}{n-1}\),期望 \(n/2\);\(\mathrm{Cov}(X_i,X_j)=\frac{(i-1)(j-n)}{(n-2)(n-1)^2}\),给出方差表达式。
  • 7.13:9 名篮球队员分 3 组,每组恰含三类各一人的概率 2/7,期望 6/7,方差 312/490。
  • 7.14:桥牌手中 A 数与黑桃数不相关(Cov=0,由对称性逐对独立),但不独立(\(P\{Y=13|X=4\}=0\))。
  • 7.15:\(p\sim U(0,1)\) 的硬币,无信息期望收益 0;知 \(p\) 后猜多数面,期望收益 \(\int_0^{1/2}(1-2p)dp+\int_{1/2}^1(2p-1)dp=1/2\)(信息价值)。
  • 7.16:\(E[I|n(X)]=1/n(X)\),故 \(E[mI]=d\)。
  • 7.17:碰撞数期望 \(m-n+\sum_j(1-p_j)^m\)(= \(m\) − 非空格子期望数)。
  • 7.18:初始游程长度期望 \(\frac n{m+1}+\frac m{n+1}\)(条件于首值 + 负超几何)。
  • 7.19:条件于前 \(n+m\) 次中正面数 \(Y\),用负二项均值。
  • 7.20:\(E[X^n]=n\int_0^\infty x^{n-1}\bar F(x)dx\)。
  • 7.21:随机排列下 \(E[a_{I_j}a_{I_{j+1}}]=-\frac{\sum a_k^2}{n(n-1)}<0\),故存在相邻积和为负的排列。
  • 7.22:二元 Poisson:\(X=X_1+X_2\),\(Y=X_2+X_3\),\(\mathrm{Cov}(X,Y)=\lambda_2\),联合 pmf 对 \(X_2\) 条件化求和(共同成分构造相关计数,类似共同冲击模型)。
  • 7.23:i.i.d. 向量对,\(\mathrm{Corr}(\sum X_i,\sum Y_j)=\frac{n\rho\sigma_x\sigma_y}{n\sigma_x\sigma_y}=\rho\)。
  • 7.24:(续)3 张牌中 A 数,\(E[X]=3/13\),条件于是否抽到黑桃 A…… (续)条件于黑桃 A 被抽中:\(E[X|A]=19/17\approx1.1176\);条件于至少一张 A:\(E[X|L]=\frac{3/13}{1-\frac{48\cdot47\cdot46}{52\cdot51\cdot50}}\approx1.0616\);另一解法给 A 编号用示性变量。
  • 7.25:期望 p 值:\(I=I(Z<X)\),\(E[I|X]=\Phi(X)\),\(E[\Phi(X)]=P\{Z<X\}=\Phi(\mu/\sqrt2)\)(\(X-Z\sim N(\mu,2)\))。统计含义:检验 \(H_0:\mu\ge0\) 时,真值为 \(\mu\) 的期望 p 值为 \(\Phi(\mu/\sqrt2)\)。
  • 7.26:\(n\) 正或 \(m\) 反先到所需次数:\(E[\min(X,Y)]=\frac np+\frac m{1-p}-E[\max(X,Y)]\),\(E[\max]\) 条件于前 \(n+m-1\) 次正面数(负二项均值)。
  • 7.27:移到最前洗牌所需阶段数 = 集齐 \(n-1\) 种券的期望 \(1+\frac n{n-1}+\cdots+\frac n2\)。
  • 7.28:截断几何均值 \(E[X]=\sum_{i=1}^nq^{i-1}=\frac{1-q^n}p\)(尾和公式)。
  • 7.29:Bernoulli 变量:\(\mathrm{Cov}=0\iff P(X=1,Y=1)=P(X=1)P(Y=1)\),且对补变量同样成立 ⇒ 独立。
  • 7.30:广义配对期望 \(\frac1n\sum_ih_in_i\)。
  • 7.31:标准差次可加 ⇔ \(\mathrm{Corr}\le1\)。7.32:MGF 级数逐项取期望再求导。

第 8 章自测题解答(p.472–475):

  • 8.1 Markov:\(P\{X\ge19\}\le16/19\),\(P\{X\ge26\}\le16/26\)(利用整数值把 \(>18\) 化为 \(\ge19\) 收紧界)。
  • 8.2 Chebyshev:\(P\{10\le X\le22\}\ge1-9/36=3/4\);单边:\(P\{X\ge19\}\le\frac9{9+9}=1/2\)。
  • 8.3 \(\mathrm{Var}(X-Y)=10+12+6=28\):\(P\{|X-Y|>15\}\le28/225\);单边 \(P\{X-Y>15\}\le28/253\)。
  • 8.4 \(E[Y-X]=-2\),\(\mathrm{Var}=45\),\(P\{Y-X\ge1\}\le45/54\)(单边)。
  • 8.5 更新率:\(E X_i=2/3\),强大数定律 \(n/S_n\to1/E X=3/2\)。
  • 8.6 \(\mathrm{Var}X_i=1/18\),需 \(n\) 使 \(P\{S_n\ge34.5\}\approx0.9\):\((34.5-2n/3)\approx-1.284\sqrt{n/18}\),\(n=55\)。
  • 8.7 维修时间 \(E=0.5\)、\(\mathrm{Var}=0.13\),20 台 8 小时内完成 \(\approx\Phi(-1.24)\approx0.1074\);8.9 95% 分位 \(t\approx10+1.645\sqrt{2.6}\approx12.65\)。
  • 8.8 赌徒每注期望 −0.1,方差 11.49;100 注后亏损概率 \(P\{S\le-0.5\}\approx\Phi(0.2803)\approx0.6104\)(负期望下短期仍可能盈利,约 39%)。
  • 8.10 尼古丁:均值标准误 0.03,3.1 相差 30 个标准误,概率 ≈0(拒绝厂商声明)。
  • 8.11 电池混合:(a) 类型随机时单个寿命均值 40、方差 \(1830.5-1600=230.5\)(由 \(E[X^2]\) 条件化),\(P\{S>1700\}\approx0.149\);(b) 已知 20A+20B 时方差降为 5220,概率 0.083——随机混合比固定构成方差更大(全方差公式的组间项)。
  • 8.12 随机医生数:\(E X=90\),\(\mathrm{Var}X=30E N+900\mathrm{Var}N=690\);但 \(X\) 是 Poisson 混合,不能直接按 \(N(90,690)\) 近似(得 0.8244),应条件于 \(N\) 分别用 CLT:\(P\{X>65\}\approx\frac13(0.2389+0.9951+1)=0.7447\)(精确 0.7440)。——混合分布不能盲目套正态。
  • 8.13 几何平均 \((\prod X_i)^{1/n}\to e^{E[\log X]}\)(取对数 + 强大数定律)。
  • 8.14 图书处理 \(P\{S_{40}>420\}\approx0.146\);\(P\{S_{25}\le240\}\approx0.2525\)(假设处理时间独立)。

第 9 章自测题解答(p.475):9.1 Poisson 过程 8–10 点无事件 \(e^{-6}\),期望 6;2 点后第 5 个事件期望时刻 \(2+5/3\) 即 3:40 PM。9.2 已知 1 小时内 2 人:都在前 1/3 小时概率 \(1/9\),至少一人在前半小时 \(3/4\)(条件均匀性)。9.3 车流链 \(P_{00}=5/6\)、\(P_{01}=1/6\)、\(P_{10}=4/5\)、\(P_{11}=1/5\),\(\pi_0=24/29\)(约 83% 是汽车)。9.4 天气三态链平稳分布:雨 1/4、晴 3/8、阴 3/8。9.5 \(H(X)/H(Y)\approx1.06\),因 \(X\) 剩余三个值等概率。

第 10 章自测题解答(p.475–476):10.1 \(C=1/(e-1)\),\(F(x)=\frac{e^x-1}{e-1}\),\(X=\log(U(e-1)+1)\)。10.2 拒绝法 \(g=1\),\(f/g\) 在 \(x=1/2\) 处最大 \(C=15/8\),接受条件 \(U_2\le16(U_1^2-2U_1^3+U_1^4)\)。10.3 离散逆变换按概率降序比较:\(U\le.35\)→3,\(\le.65\)→4,\(\le.85\)→2,否则 1(减少平均比较次数)。10.4 对偶正态 \(Y=2\mu-X\)。10.5 估计 \(E[e^{XY}]\):直接用 \(\sum e^{X_iY_i}/n\);控制变量用 \(XY\)(\(X,Y\) 独立 Exp(1),\(E[XY]=1\)),估计量 \(\sum(e^{X_iY_i}+cX_iY_i)/n\)(需再减去 \(c\) 才严格无偏);或用 Taylor 前三项 \(XY+X^2Y^2/2\) 作控制变量(\(e^{xy}=1+xy+x^2y^2/2+\cdots\))。注意:书中写作 \(c[X_iY_i+X_i^2Y_i^2/2-1/2]\),但 \(E[XY+X^2Y^2/2]=1+\frac12\cdot2\cdot2=3\),应减去 3,书中常数疑为印刷错误,编写时需核对。

索引与封底分布表(PDF p.477–484)

Index(p.477–479):按字母排列的主题索引(A–Z),页码为书内页码(= PDF 页码 − 13)。条目涵盖全书,例如 antithetic variables 427、Bernstein polynomials 392、Box-Muller 422、Chapman-Kolmogorov 399、Chernoff bound 385、conditional variance formula 351、control variate 429、entropy 404、Jensen 387、maximums-minimums identity 295–296、moment generating function 334–343、multivariate normal 345–346、quick sort 289–291、Stieltjes integral 349–350、value at risk 193 等。p.480 为空白页。

封底常用分布速查(p.481–484):

  • 离散:Bernoulli\((p)\)(\(p\),\(p(1-p)\));Binomial\((n,p)\)(\(np\),\(np(1-p)\));Geometric\((p)\)(\(1/p\),\((1-p)/p^2\));Negative Binomial\((r,p)\)(\(r/p\),\(r(1-p)/p^2\);\(r\) 个独立几何之和);Poisson\((\lambda)\)(\(\lambda\),\(\lambda\);二项近似与 Poisson 过程说明);Hypergeometric(\(np\),\(\frac{N-n}{N-1}np(1-p)\),\(p=m/N\));Negative Hypergeometric(\(E=r\frac{n+m+1}{n+1}\),\(\mathrm{Var}=\frac{mr(n+1-r)(n+m+1)}{(n+1)^2(n+2)}\))。
  • 连续:Uniform\((a,b)\);Normal\((\mu,\sigma^2)\)(标准化、独立和仍正态、CLT);Exponential\((\lambda)\)(无记忆);Gamma\((\alpha,\lambda)\)(\(\alpha/\lambda\),\(\alpha/\lambda^2\);Gamma(1,λ)=指数;同 \(\lambda\) 可加;\(n\) 个指数之和);Beta\((a,b)\)(\(\frac a{a+b}\),\(\frac{ab}{(a+b)^2(a+b+1)}\);\(n\) 个均匀的第 \(j\) 小为 Beta\((j,n-j+1)\));Chi-Squared\((n)\)(= Gamma\((n/2,1/2)\);正态样本方差 \(\times\frac{n-1}{\sigma^2}\) 为 \(\chi^2_{n-1}\) 且与样本均值独立);Cauchy(\(f=\frac1{\pi(1+x^2)}\),正切于均匀角;表中写 \(E[X]=0\)、\(\mathrm{Var}=\infty\)——注意:严格说 Cauchy 的期望不存在,表中 \(E[X]=0\) 只是对称中心,教材编写时应更正)。

附录部分的量化关联提示:自测解答中最值得在中文教材里保留的几处:5.20 正态看涨期望收益公式(Bachelier 期权定价雏形)、6.8 Marshall–Olkin 共同冲击模型(相关违约)、6.19 随机游走桥分布、7.10 Delta 方法与方差稳定化、7.22 二元 Poisson(共同成分构造相关计数)、7.25 期望 p 值、8.11–8.12 混合分布不可盲目套正态(全方差公式的组间项)、8.13 几何平均与对数收益期望。