量化交易中文教材

第 04a 章 随机变量、期望与方差

本章对应 Ross 第 4 章的 4.1–4.5 节以及 4.9、4.10 节;4.6–4.8 节的常见离散分布放在第 04b 章。随机变量把"试验结果"变成"数",期望和方差则是我们描述一个数字型不确定性最基本的两把尺子。量化里每一笔交易的盈亏、每天的收益、每分钟的成交笔数都是随机变量,"这个策略赚不赚钱、风险多大"就是在问期望与方差。

学习目标

  1. 理解随机变量是样本空间上的实值函数,会写出离散随机变量的概率质量函数(PMF)与累积分布函数(CDF)。
  2. 掌握期望的定义与频率解释,会用无意识统计学家定律(LOTUS)计算 \(E[g(X)]\),并牢记一般 \(E[g(X)]\ne g(E[X])\)。
  3. 掌握方差的定义、计算式 \(E[X^2]-(E[X])^2\) 与线性变换规则。
  4. 掌握"期望的线性性不需要独立性",熟练使用示性变量法求复杂计数的期望与方差。
  5. 掌握 CDF 的四条性质,会用 CDF 回答一切关于 \(X\) 的概率问题,包括混合型分布。
  6. 会用"边际分析 + 临界分位数"解决报童型决策问题,理解规模偏倚(检验悖论)。

读前导读

这一章在解决什么问题。 期望和方差你在 CFA 里天天用:组合期望收益是加权平均,方差是偏离均值的平方的期望,标准差就是波动率。本章把这两个量放在更严格的地基上,并给出几样 CFA 没有的工具。

本册比 CFA 深的地方,从这一章开始显现。CFA 里"随机变量"只是"一个可能取多个值的量";这里它被定义为样本空间上的函数——每个世界状态对应一个数。这个看法让很多结论变得一目了然,例如"期望的线性性不需要独立性":组合的期望收益等于各资产期望收益的加权和,不管资产之间相关性如何;但方差要加协方差项。本章还会给出 LOTUS(求 \(E[g(X)]\) 不必先求 \(g(X)\) 的分布),示性变量法(把复杂计数拆成 0-1 变量之和),以及能同时描述离散、连续和混合型分布的 CDF。本章只处理离散型,期望是求和;到第 05 章连续型随机变量,期望会改用积分定义,\(E[X]=\int x f(x)\,dx\),那时本章的每个结论都有一个"把 \(\sum\) 换成 \(\int\)"的对应版本。

和金融的联系:期权价值本质上是 \(E[g(S_T)]\),而 \(g(x)=\max(x-K,0)\) 是凸函数,所以 \(E[g(S)]\ne g(E[S])\),这是期权有时间价值的根源。报童问题的"临界分位数"在资金备付、库存、做市库存里都会出现;规模偏倚则关系到绩效统计口径(按笔还是按时间、按产品数还是按资金加权)。

需要先想起来的数学。

  • 求和的拆分与交换。 \(\sum_i(a_i+b_i)=\sum_ia_i+\sum_ib_i\),\(\sum_ica_i=c\sum_ia_i\)。双重求和 \(\sum_i\sum_j a_{ij}\) 可以先按行加再按列加,也可以按任意方式分组(项非负或绝对收敛时)。LOTUS、期望线性性的证明全靠"把同一堆项换一种方式分组相加"。见 第 00 册第 07 章 概率中的分析工具。
  • 平方展开。 \((a+b)^2=a^2+2ab+b^2\);\((\sum_ia_i)^2=\sum_ia_i^2+\sum_{i\ne j}a_ia_j\)。后者有 \(n\) 个平方项和 \(n(n-1)\) 个交叉项。例:\((a_1+a_2)^2=a_1^2+a_2^2+a_1a_2+a_2a_1\)。示性变量求方差要用。
  • 指数级数。 \(\sum_{i=0}^\infty\lambda^i/i!=e^\lambda\)。例 2a 用它定常数。见 第 00 册第 04 章 级数与收敛。
  • 单侧极限。 \(F(b^-)=\lim_{x\uparrow b}F(x)\) 表示 \(x\) 从左边逼近 \(b\) 时 \(F\) 的极限。阶梯函数在跳跃点的左极限和函数值不同,差就是跳跃高度。例:4.2 节那个阶梯 CDF 在 \(a=2\) 处 \(F(2^-)=1/4\),\(F(2)=3/4\),所以 \(P\{X=2\}=1/2\)。见 第 00 册第 01 章 函数极限与连续。

怎么读这一章。 4.3–4.6 是核心:期望定义、LOTUS、方差计算式、期望线性性和示性变量法。报童问题(例 4b)推导短而有用,建议读懂。4.7 的 CDF 性质要记住"\(P\{X<b\}=F(b^-)\)"和混合型分布的例子。可以跳过或只看结论:例 1e 的容斥公式(集券问题)、例 3c、例 4c(效用的构造)。


4.1 随机变量

做试验时,我们往往只关心结果的某个函数,比如两颗骰子之和、抛硬币的正面总数,而不关心具体的结果。定义在样本空间上的实值函数叫做随机变量(random variable)。它的取值由试验结果决定,所以可以给它的各个取值赋予概率。

白话解释:把样本空间想成一张"情景表",每行是一种世界状态 \(s\),每行有一个概率 \(p(s)\)。随机变量就是在表上加一列数 \(X(s)\),例如每种情景下组合的盈亏。同一张表可以加很多列:组合盈亏 \(X\)、指数收益 \(Y\)、是否触发止损 \(I\)。它们共享同一组情景和概率,这就是为什么后面可以讨论 \(X+Y\)、\(XY\) 的分布。压力测试表就是这种结构:每个情景一行,各头寸损益各一列。"随机"的只是哪一行会发生,每一列本身是确定的函数。

例 1a 抛三枚公平硬币,\(Y\) 为正面数:\(P\{Y=0\}=1/8\),\(P\{Y=1\}=3/8\),\(P\{Y=2\}=3/8\),\(P\{Y=3\}=1/8\)。\(Y\) 必取 0–3 之一,所以 \(\sum_iP\{Y=i\}=1\)。

例 1b(寿险赔付) 两位老年客户各有 10 万美元保单,年轻者一年内死亡的概率为 .05,年长者为 .10,相互独立。\(X\) 为赔付总额(单位 10 万):

\[P\{X=0\}=.95\times.9=.855,\quad P\{X=1\}=.05\times.9+.95\times.1=.140,\quad P\{X=2\}=.05\times.1=.005.\]

例 1c(最大编号球) 从编号 1–20 的球中无放回取 4 个,\(X\) 为最大编号,取值 \(4,\dots,20\):

\[P\{X=i\}=\binom{i-1}{3}\Big/\binom{20}{4}.\]
求 \(P\{X>10\}\) 更快的做法是用补事件:\(X\le10\) 等价于 4 个球都在 1–10 中,所以 \(P\{X>10\}=1-\binom{10}4/\binom{20}4\)。**技巧:对"最大值"型随机变量,\(P\{X\le x\}\) 往往比点概率好算。**这个技巧在第 06b 章次序统计量中会反复用到。

例 1d(截断几何) 正面概率为 \(p\) 的硬币反复抛,直到出现正面或已抛满 \(n\) 次。\(X\) 为抛掷次数:\(P\{X=i\}=(1-p)^{i-1}p\)(\(i=1,\dots,n-1\)),\(P\{X=n\}=(1-p)^{n-1}\)。验证:\(\sum_{i=1}^{n-1}p(1-p)^{i-1}+(1-p)^{n-1}=1\)。

例 1e(集券问题,coupon collecting) 共 \(N\) 种券,每次独立等可能得到任一种。\(T\) 为集齐全部种类所需张数。先求尾概率:令 \(A_j\)="前 \(n\) 张中没有第 \(j\) 种",则 \(\{T>n\}=\bigcup_jA_j\),且 \(P(A_{j_1}\cdots A_{j_k})=((N-k)/N)^n\),由容斥原理

\[P\{T>n\}=\sum_{i=1}^{N-1}\binom Ni\Big(\frac{N-i}{N}\Big)^n(-1)^{i+1},\tag{1.1}\]

再由 \(P\{T=n\}=P\{T>n-1\}-P\{T>n\}\) 得点概率。原书还求了前 \(n\) 张中出现的不同种类数 \(D_n\) 的分布。

累积分布函数(cumulative distribution function, CDF) \(F(x)=P\{X\le x\}\),\(-\infty<x<\infty\)。若 \(a\le b\),\(\{X\le a\}\subset\{X\le b\}\),所以 \(F\) 单调不减。

4.2 离散型随机变量

最多取可数个值的随机变量叫离散型随机变量。它的**概率质量函数(probability mass function, PMF)**为 \(p(a)=P\{X=a\}\)。若 \(X\) 取值 \(x_1,x_2,\dots\),则 \(p(x_i)\ge0\),其他点 \(p(x)=0\),且 \(\sum_ip(x_i)=1\)。PMF 常画成棒状图,例如两骰之和的 \(p(k)\) 从 \(1/36\) 线性升到 \(p(7)=6/36\) 再对称下降。

例 2a \(p(i)=c\lambda^i/i!\),\(i\ge0\)。由 \(\sum_i\lambda^i/i!=e^\lambda\) 得 \(c=e^{-\lambda}\)。于是 \(P\{X=0\}=e^{-\lambda}\),\(P\{X>2\}=1-e^{-\lambda}-\lambda e^{-\lambda}-\lambda^2e^{-\lambda}/2\)。(这就是第 04b 章的泊松分布。)

CDF 与 PMF 的关系:\(F(a)=\sum_{x\le a}p(x)\)。离散变量的 CDF 是阶梯函数,在每个可能取值处跳跃,跳跃高度就是该点的概率。例如 \(p(1)=1/4,p(2)=1/2,p(3)=p(4)=1/8\) 时,

\[F(a)=\begin{cases}0,&a<1\\1/4,&1\le a<2\\3/4,&2\le a<3\\7/8,&3\le a<4\\1,&a\ge4\end{cases}\]

4.3 期望

定义

离散随机变量 \(X\) 的**期望(expectation, expected value)**为

\[E[X]=\sum_{x:p(x)>0}x\,p(x),\]

即以概率为权的加权平均。例:\(p(0)=p(1)=1/2\) 时 \(E[X]=1/2\);\(p(0)=1/3,p(1)=2/3\) 时 \(E[X]=2/3\)。

频率解释:独立重复无穷多次,事件出现的比例等于其概率(第 08 章的强大数律)。把 \(X\) 看成一局赌博的收益,长期平均每局收益就是 \(\sum x_ip(x_i)=E[X]\)。这正是"策略的期望收益"的含义:它是大量重复下的平均,不是单次的保证。

力学类比:在无重量的杆上 \(x_i\) 处放质量 \(p(x_i)\),平衡点就在 \(E[X]\),因为 \(\sum_i(x_i-E[X])p(x_i)=0\)。例如 \(p(-1)=.10,p(0)=.25,p(1)=.30,p(2)=.35\) 时重心在 \(0.9\)。

例 3a 公平骰子 \(E[X]=(1+2+\cdots+6)/6=7/2\)。

例 3b(示性变量,indicator variable) \(I=1\) 若事件 \(A\) 发生,否则为 0。\(E[I]=P(A)\)。这个看似平凡的等式是后面"示性变量求和法"的基石。

例 3c(答题顺序) 两道题,先答第 \(i\) 题,答对才能答另一题;答对第 \(i\) 题得 \(V_i\),知道答案的概率为 \(P_i\),相互独立。先答题 1 的期望收益为 \(V_1P_1(1-P_2)+(V_1+V_2)P_1P_2\),先答题 2 为 \(V_2P_2(1-P_1)+(V_1+V_2)P_1P_2\)。先答题 1 更优当且仅当

\[\frac{V_1P_1}{1-P_1}\ge\frac{V_2P_2}{1-P_2}.\]
数值:题 1 值 200、把握 .6;题 2 值 100、把握 .8。\(100\times.8/.2=400>200\times.6/.4=300\),应先答题 2。这里的"收益 × 成功率 / 失败率"是一个排序指标,结构上类似于多个机会按"期望收益/风险"排队。

例 3d(检验悖论,size-biased sampling) 120 名学生乘 3 辆车出游,车上分别有 36、40、44 人。随机抽一名学生,\(X\) 为他所在车的人数。\(P\{X=36\}=36/120\) 等,

\[E[X]=36\cdot\tfrac{3}{10}+40\cdot\tfrac13+44\cdot\tfrac{11}{30}=\tfrac{1208}{30}\approx40.27,\]
大于每车平均人数 40。原因:人多的车更容易被抽中。"按个体抽样"和"按组抽样"得到的平均不同,这在量化里非常常见(见本章量化实战)。

4.4 随机变量函数的期望

要求 \(E[g(X)]\),一种方法是先求 \(g(X)\) 的分布再按定义计算。例 4a:\(X\) 取 \(-1,0,1\) 的概率为 .2、.5、.3,\(Y=X^2\) 取 1 和 0 的概率各为 .5,所以 \(E[X^2]=.5\)。注意 \(E[X^2]=.5\ne(E[X])^2=.01\)。

更方便的是:

命题 4.1(无意识统计学家定律,LOTUS) 若 \(X\) 取值 \(x_i\) 的概率为 \(p(x_i)\),则对任意实函数 \(g\),

\[E[g(X)]=\sum_ig(x_i)p(x_i).\]

证明:把 \(g(x_i)\) 相同的项归并。设 \(g(x_i)\) 的不同取值为 \(y_j\),则

\[\sum_ig(x_i)p(x_i)=\sum_jy_j\sum_{i:g(x_i)=y_j}p(x_i)=\sum_jy_jP\{g(X)=y_j\}=E[g(X)].\]

推导拆解:用例 4a 走一遍。\(x\) 取 \(-1,0,1\),\(g(x)=x^2\) 的值是 \(1,0,1\),不同取值 \(y_j\) 只有 \(0\) 和 \(1\)。

  1. 左边逐项相加:\(1\cdot.2+0\cdot.5+1\cdot.3\)。
  2. 第一个等号:把 \(g\) 值相同的项归成一组:\(y=1\) 的一组是 \(x=-1\) 和 \(x=1\),提出公因子 \(1\cdot(.2+.3)\);\(y=0\) 的一组是 \(0\cdot.5\)。只是换了加法顺序。
  3. 第二个等号:组内概率之和 \(.2+.3\) 恰好是 \(P\{g(X)=1\}\),因为 \(g(X)=1\) 当且仅当 \(X\) 落在该组。
  4. 第三个等号:\(\sum_jy_jP\{g(X)=y_j\}\) 正是 \(g(X)\) 这个随机变量按定义算的期望。 结论:直接拿 \(X\) 的分布对 \(g(x)\) 加权即可,不必先求 \(g(X)\) 的分布。 金融直觉:期权定价就是 LOTUS:\(E[\max(S_T-K,0)]=\sum_s\max(s-K,0)\,P\{S_T=s\}\),直接用标的价格的分布对收益函数加权,不需要先求"期权收益"的分布。也因为 \(\max(\cdot-K,0)\) 不是直线,\(E[\max(S_T-K,0)]\ge\max(E[S_T]-K,0)\),若 \(E[S_T]=K\),期权的期望收益为正,而用期望价格代入只得 0。这就是例 4a 里 \(E[X^2]\ne(E[X])^2\) 在金融中的样子。

推论 4.1(线性) \(E[aX+b]=aE[X]+b\)。

\(E[X]\) 也叫 \(X\) 的**均值(mean)**或一阶矩;\(E[X^n]=\sum_xx^np(x)\) 叫 \(n\) 阶矩(\(n\)th moment)。

报童问题:临界分位数

例 4b(报童/季节性库存问题,newsvendor) 每卖出一件净赚 \(b\),季末每剩一件亏 \(\ell\)。需求 \(X\) 的 PMF 为 \(p(i)\)。备货 \(s\) 件时利润为

\[P(s)=\begin{cases}bX-(s-X)\ell,&X\le s\\sb,&X>s\end{cases}\]
由 LOTUS 可得
\[E[P(s)]=sb+(b+\ell)\sum_{i=0}^s(i-s)p(i).\]

求最优 \(s\) 时不必逐个比较,用边际分析:多备一件带来的期望利润变化为

\[E[P(s+1)]-E[P(s)]=b-(b+\ell)\sum_{i=0}^sp(i).\]
所以当
\[\sum_{i=0}^sp(i)<\frac{b}{b+\ell}\tag{4.1}\]
时多备一件更好。左边随 \(s\) 增大、右边是常数,设 \(s^*\) 为满足 (4.1) 的最大 \(s\),则 \(E[P(s)]\) 先增后减,最优备货量为 \(s^*+1\)——也就是需求分布的 \(b/(b+\ell)\) 分位数,称为临界分位数(critical fractile)。

推导拆解:

  1. 期望利润:把两种情形合成一个式子。\(X\le s\) 时利润 \(bX-(s-X)\ell=sb+(b+\ell)(X-s)\)(加减 \(sb\) 整理即得);\(X>s\) 时利润 \(sb\)。所以 \(P(s)=sb+(b+\ell)(X-s)\cdot\mathbf 1\{X\le s\}\)。对它用 LOTUS 取期望,就是原文的式子。
  2. 边际:\(E[P(s+1)]-E[P(s)]\) 中,\(sb\) 部分贡献 \(b\);求和部分里,每个 \(i\le s\) 的项从 \((i-s)\) 变成 \((i-s-1)\),各减少 \(p(i)\);新增的 \(i=s+1\) 项是 \((s+1-s-1)p(s+1)=0\)。合计 \(b-(b+\ell)\sum_{i\le s}p(i)\)。
  3. 直观读法:多备第 \(s+1\) 件,若需求超过 \(s\)(概率 \(1-F(s)\)),多赚 \(b\);若需求不超过 \(s\)(概率 \(F(s)\)),这件卖不掉,亏 \(\ell\)。边际期望 \(=b[1-F(s)]-\ell F(s)\),与上式相同。令它从正变负,就得到 \(F(s)\) 跨过 \(b/(b+\ell)\) 的位置。 这一步"比较多做一单位的边际收益与边际成本"是离散版的"导数等于零"。

这个结论非常一般:当"多了"和"少了"的单位损失分别是常数时,最优决策是某个分位数。第 05 章会遇到它的连续版本,统计学里它对应分位数回归的 pinball loss。

期望效用

例 4c(效用,utility) 两种行动分别以概率 \(p_i\)、\(q_i\) 导致后果 \(C_1,\dots,C_n\)。构造效用:最差后果赋 0,最好后果赋 1;对其他 \(C_i\),找概率 \(u\) 使你在"确定得到 \(C_i\)"与"以概率 \(u\) 得最好后果、\(1-u\) 得最差后果的抽奖"之间无差异,记 \(u(C_i)=u\)。于是行动 1 等价于以概率 \(\sum_ip_iu(C_i)\) 得最好后果的抽奖。结论:行动 1 优于行动 2 当且仅当

\[\sum_ip_iu(C_i)>\sum_iq_iu(C_i),\]
即用期望效用(expected utility)衡量行动价值。这是投资组合选择理论的公理基础:理性投资者最大化的不是期望财富,而是期望效用。

4.5 方差

期望不反映离散程度。\(W\equiv0\);\(Y=\pm1\) 各 1/2;\(Z=\pm100\) 各 1/2,三者均值都是 0,离散程度却天差地别。可以用 \(E|X-\mu|\) 度量,但数学上不方便,所以用平方偏差。

定义 若 \(\mu=E[X]\),\(X\) 的**方差(variance)**为

\[\mathrm{Var}(X)=E[(X-\mu)^2].\]
展开 \(E[X^2-2\mu X+\mu^2]=E[X^2]-2\mu^2+\mu^2\),得到常用的计算式
\[\mathrm{Var}(X)=E[X^2]-(E[X])^2.\]

推导拆解:展开那一步用了三件事。(1) 平方展开 \((X-\mu)^2=X^2-2\mu X+\mu^2\),这里 \(\mu\) 是一个固定的数,不是随机变量。(2) 期望的线性性:\(E[X^2-2\mu X+\mu^2]=E[X^2]-2\mu E[X]+\mu^2\)(常数可以提出期望,常数的期望是它自己)。(3) \(E[X]=\mu\),于是 \(-2\mu\cdot\mu+\mu^2=-\mu^2\)。 实务提醒:用 \(E[X^2]-\mu^2\) 计算日收益方差时,如果收益很小、均值又接近 0,两项都很小且接近,数值误差会被放大;统计软件计算样本方差时通常先减均值再平方,就是这个原因。

例 5a 公平骰子 \(E[X^2]=91/6\),\(\mathrm{Var}(X)=91/6-(7/2)^2=35/12\)。

性质 \(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\)。证明:\(E[(aX+b-a\mu-b)^2]=a^2E[(X-\mu)^2]\)。平移不改变方差,缩放使方差按平方缩放。

标准差(standard deviation) \(\mathrm{SD}(X)=\sqrt{\mathrm{Var}(X)}\),与 \(X\) 同量纲。量化里的"波动率"就是收益率的标准差。力学类比中,均值是重心,方差是转动惯量。

4.6 随机变量和的期望

为简单起见,设样本空间 \(S\) 有限或可数,\(X(s)\) 表示结果 \(s\) 下 \(X\) 的值,\(p(s)=P(\{s\})\)。

命题 9.1 \(E[X]=\sum_{s\in S}X(s)p(s)\)。

证明:令 \(S_i=\{s:X(s)=x_i\}\),它们互斥且并为 \(S\),\(E[X]=\sum_ix_iP(S_i)=\sum_i\sum_{s\in S_i}X(s)p(s)=\sum_sX(s)p(s)\)。

推论 9.2(期望的线性性)

\[E\Big[\sum_{i=1}^nX_i\Big]=\sum_{i=1}^nE[X_i].\]
证明只需把 \(\sum_s(X_1(s)+\cdots+X_n(s))p(s)\) 拆开。这里不需要任何独立性假设。

金融直觉:回到"情景表"的图景:\(X_1,\dots,X_n\) 是同一张表上的 \(n\) 列,\(\sum X_i\) 是它们逐行相加得到的新列。对新列按行概率加权求平均,等于先对每列各自加权平均再相加——这只是加法交换律,和各列之间是否相关毫无关系。所以组合期望收益 \(E[\sum w_iR_i]=\sum w_iE[R_i]\) 永远成立,CFA 里你用它时从未问过相关性,原因就在此。方差则不同:\((\sum X_i)^2\) 展开后有交叉项 \(X_iX_j\),它们的期望依赖于各列如何一起变动,这就是组合方差里协方差项的来源(第 07a 章)。

例 9c \(n\) 颗骰子之和的期望为 \(3.5n\)。

例 9d(示性变量法,method of indicators) 第 \(i\) 次试验成功的概率为 \(p_i\),令 \(X_i\) 为其示性变量,\(X=\sum X_i\) 为成功次数,则 \(E[X]=\sum p_i\),不要求试验独立。特例:二项分布 \(E[X]=np\);超几何分布——无放回抽样中第 \(i\) 个取出的球等可能是 \(N\) 个中任一个,是白球的概率为 \(m/N\),所以 \(E[X]=nm/N\),尽管各次抽取相依。

例 9e(示性变量求方差) 由 \(X_i^2=X_i\),以及 \(X_iX_j\) 是"\(i,j\) 都成功"的示性变量,

\[E[X^2]=\sum_iE[X_i^2]+\sum_i\sum_{j\ne i}E[X_iX_j]=\sum_ip_i+\sum_i\sum_{j\ne i}P\{X_i=1,X_j=1\}.\tag{9.1}\]
  • 二项:\(E[X_iX_j]=p^2\),\(E[X^2]=np+n(n-1)p^2\),\(\mathrm{Var}(X)=np(1-p)\)。
  • 超几何:\(P\{X_i=1,X_j=1\}=\frac mN\cdot\frac{m-1}{N-1}\),化简得 \(\mathrm{Var}(X)=np(1-p)\big(1-\frac{n-1}{N-1}\big)\),\(p=m/N\)。

推导拆解:

  1. (9.1) 来自平方展开 \(X^2=(\sum_iX_i)^2=\sum_iX_i^2+\sum_i\sum_{j\ne i}X_iX_j\),再对每项取期望(线性性)。
  2. \(X_i^2=X_i\):0-1 变量平方不变(\(0^2=0,1^2=1\))。\(X_iX_j=1\) 当且仅当两个都为 1,所以它是"\(i,j\) 都成功"的示性变量,期望等于该事件的概率。
  3. 二项:\(\sum_ip_i=np\);交叉项共 \(n(n-1)\) 个,独立时每个是 \(p\cdot p\)。于是 \(\mathrm{Var}=np+n(n-1)p^2-(np)^2=np-np^2=np(1-p)\)。
  4. 超几何:交叉项每个是 \(\frac mN\cdot\frac{m-1}{N-1}\)(乘法法则:第 \(i\) 个是白球,再在剩下 \(N-1\) 个中第 \(j\) 个是白球)。代入 \(\mathrm{Var}=E[X^2]-(np)^2\) 整理即得。因子 \(1-\frac{n-1}{N-1}\) 叫有限总体修正:无放回抽样时,抽到一个白球会让后面抽到白球的机会略降,正负相抵,方差比有放回时小。\(n=N\)(全部抽完)时方差为 0,因为白球数是确定的 \(m\)。

示性变量法的威力在于:把一个分布很复杂的计数拆成许多 0-1 变量之和,期望只需各自的概率,方差只需两两联合概率。第 02 章游程个数的期望、配对问题中配对人数的期望(等于 1)都可以这样秒算。

4.7 累积分布函数的性质

CDF \(F\) 有四条性质:

  1. 单调不减:\(a<b\Rightarrow F(a)\le F(b)\);
  2. \(\lim_{b\to\infty}F(b)=1\);
  3. \(\lim_{b\to-\infty}F(b)=0\);
  4. 右连续:对任意递减趋于 \(b\) 的序列 \(b_n\),\(\lim F(b_n)=F(b)\)。

性质 1 来自事件包含;2、3、4 来自第 02 章的概率连续性。例如 \(b_n\downarrow b\) 时 \(\{X\le b_n\}\) 是递减事件列,其交为 \(\{X\le b\}\)。

所有关于 \(X\) 的概率问题都可以用 \(F\) 回答:

\[P\{a<X\le b\}=F(b)-F(a),\qquad P\{X<b\}=\lim_{n\to\infty}F(b-1/n)=F(b^-),\qquad P\{X=b\}=F(b)-F(b^-).\]

注意 \(P\{X<b\}\) 不一定等于 \(F(b)\),后者包含 \(X=b\) 的概率。

白话解释:为什么 CDF 是"右连续"而不是"左连续"?因为定义里用的是 \(\le\)。在跳跃点 \(b\),\(F(b)=P\{X\le b\}\) 已经把 \(X=b\) 那一块概率算进去了,所以 \(F\) 在 \(b\) 处取的是跳跃后的"上沿";从右边靠近 \(b\),函数值一直贴着这个上沿,所以右极限等于函数值。从左边靠近时还没算进那块概率,于是左极限 \(F(b^-)\) 是"下沿",上下沿之差就是 \(P\{X=b\}\)。 金融直觉:VaR 的定义要用到这一点。损失分布有跳跃时(例如一笔债券要么全额兑付、要么违约损失 60%),某个置信水平可能正好落在跳跃里,"使 \(F(x)\ge0.99\) 的最小 \(x\)"与"使 \(F(x)>0.99\) 的 \(x\)"可能不同。正因为 CDF 右连续,"最小 \(x\) 使 \(F(x)\ge\alpha\)"总能取到,这就是分位数(广义逆)的标准定义,代码里 stats.poisson.ppf 用的也是它。

例 10a(混合型分布)

\[F(x)=\begin{cases}0,&x<0\\x/2,&0\le x<1\\2/3,&1\le x<2\\11/12,&2\le x<3\\1,&x\ge3\end{cases}\]
这个分布既有连续上升段,又有跳跃。(a) \(P\{X<3\}=F(3^-)=11/12\);(b) \(P\{X=1\}=F(1)-F(1^-)=2/3-1/2=1/6\);(c) \(P\{X>1/2\}=1-F(1/2)=3/4\);(d) \(P\{2<X\le4\}=F(4)-F(2)=1/12\)。

混合型分布在量化中并不罕见:例如有涨跌停限制的日收益,在涨跌停价位上有一个概率质量,其余部分连续。


量化实战

1. 胜率不是期望

很多看起来"稳赚"的策略胜率很高,期望却为负;反过来,胜率只有 30% 的趋势跟踪可能长期赚钱。下面比较两种单笔盈亏分布,并模拟 250 笔交易后亏损的比例。这正是原书习题 4.20(轮盘"必胜策略")和例 6c(幸运轮)的量化版本。

2. 报童问题与备付资金

把报童问题改写成资金管理:基金每日赎回需求 \(X\)(百万)服从均值 40 的泊松分布(第 04b 章)。备付现金 \(s\):若不足,缺口部分需要紧急变现,每单位成本 \(b=3\);若多余,闲置资金有机会成本,每单位 \(\ell=1\)。最小化期望成本等价于报童问题中最大化期望利润,最优备付量是需求分布的 \(b/(b+\ell)=0.75\) 分位数。

3. 检验悖论:按笔平均与按时间平均

例 3d 在交易数据里的对应物:每笔交易的持仓天数为 \(X\)。若"随机抽查账户里某一天正在持有的那笔交易",看到的持仓期平均是 \(E[X^2]/E[X]\),而不是 \(E[X]\)。用持仓日加权(时间加权)和用笔数加权(交易加权)计算的平均持仓期、平均收益、胜率都会不同,报告绩效时必须说明是哪一种。

推导拆解:为什么是 \(E[X^2]/E[X]\)?设共有 \(n\) 笔交易,持仓天数为 \(x_1,\dots,x_n\),总持仓日数 \(\sum_kx_k\)。随机抽一个持仓日,它属于第 \(k\) 笔的概率与该笔的天数成正比,等于 \(x_k/\sum_jx_j\)。抽到的那笔的持仓期期望为

\[\sum_kx_k\cdot\frac{x_k}{\sum_jx_j}=\frac{\frac1n\sum_kx_k^2}{\frac1n\sum_jx_j}\approx\frac{E[X^2]}{E[X]}.\]
由 \(E[X^2]=\mathrm{Var}(X)+(E[X])^2\),它等于 \(E[X]+\mathrm{Var}(X)/E[X]\),只要持仓期有差异(方差大于 0),就严格大于 \(E[X]\)。例 3d 的车辆问题是同一结构:\(\frac{36^2+40^2+44^2}{120}\)。

import numpy as np
from scipy import stats
rng = np.random.default_rng(1)

# ---------- 1) 高胜率 ≠ 正期望:两种策略的单笔盈亏分布 ----------
strategies = {
    "卖深度虚值期权型": (np.array([1.0, -12.0]), np.array([0.92, 0.08])),
    "趋势跟踪型":       (np.array([-1.0, 3.0]),  np.array([0.70, 0.30])),
}
for name, (x, p) in strategies.items():
    mu = (x * p).sum()                       # E[X] = sum x p(x)
    var = (x**2 * p).sum() - mu**2           # Var = E[X^2] - (E[X])^2
    sims = rng.choice(x, p=p, size=(10000, 250)).sum(axis=1)   # 250 笔交易累计盈亏
    print(f"{name}: 胜率={p[x>0].sum():.0%}  E[X]={mu:+.3f}  SD={np.sqrt(var):.3f}  "
          f"250笔后亏损的比例={np.mean(sims<0):.1%}")

# ---------- 2) 报童问题 = 备付资金的临界分位数 ----------
# 每日赎回需求 X ~ Poisson(40)(单位:百万)。备付 s:
# 不足部分要紧急变现,每单位成本 b=3;多余部分有机会成本,每单位 l=1。
b, l, lam = 3.0, 1.0, 40
xs = np.arange(0, 120)
px = stats.poisson.pmf(xs, lam)
def expected_cost(s):
    return np.sum(px * (b * np.maximum(xs - s, 0) + l * np.maximum(s - xs, 0)))
costs = np.array([expected_cost(s) for s in xs])
s_brute = xs[costs.argmin()]
s_quant = stats.poisson.ppf(b / (b + l), lam)    # 最小的 s 使 F(s) >= b/(b+l)
print(f"\n临界分位数 b/(b+l)={b/(b+l):.2f}: 枚举最优 s={s_brute}, 分位数公式 s={s_quant:.0f}, "
      f"期望成本={costs.min():.3f}")

# ---------- 3) 检验悖论:按笔平均持仓期 vs 随机抽查某一天看到的持仓期 ----------
hold = rng.choice([1, 5, 20], p=[0.6, 0.3, 0.1], size=100000)   # 每笔交易的持仓天数
per_trade = hold.mean()
per_day = (hold**2).sum() / hold.sum()     # 随机抽一个"持仓日",其所属交易的持仓期
print(f"\n按笔平均持仓期 E[X]={per_trade:.2f} 天;随机抽查某持仓日看到的平均持仓期 "
      f"E[X^2]/E[X]={per_day:.2f} 天")

关键输出:

卖深度虚值期权型: 胜率=92%  E[X]=-0.040  SD=3.527  250笔后亏损的比例=53.2%
趋势跟踪型: 胜率=30%  E[X]=+0.200  SD=1.833  250笔后亏损的比例=4.0%

临界分位数 b/(b+l)=0.75: 枚举最优 s=44, 分位数公式 s=44, 期望成本=8.165

按笔平均持仓期 E[X]=4.09 天;随机抽查某持仓日看到的平均持仓期 E[X^2]/E[X]=11.73 天

读法:92% 胜率的策略期望为负,250 笔后过半的路径亏损;30% 胜率的策略期望为正,只有 4% 的路径亏损。报童问题中暴力枚举与分位数公式给出同一个最优备付量 44。持仓期的两种平均相差近 3 倍,理论值 \(E[X]=4.1\)、\(E[X^2]/E[X]=48.1/4.1\approx11.73\) 与模拟一致。


本章小结

随机变量是样本空间上的实值函数;离散型用 PMF 描述,CDF 单调不减、右连续、两端极限为 0 和 1,所有概率都能由 CDF 表达(注意 \(P\{X<b\}=F(b^-)\))。期望是概率加权平均,具有频率解释;LOTUS 让我们不必先求 \(g(X)\) 的分布,但一般 \(E[g(X)]\ne g(E[X])\)。方差衡量离散程度,\(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\)。期望的线性性不需要独立性,示性变量法据此把复杂计数拆成 0-1 变量之和。报童问题说明非对称线性损失下的最优决策是分位数;期望效用是理性决策的公理基础;规模偏倚提醒我们抽样方式决定了看到的平均。

概念 公式
PMF / CDF \(p(a)=P\{X=a\}\);\(F(a)=\sum_{x\le a}p(x)\)
期望 \(E[X]=\sum_xx\,p(x)\)
LOTUS \(E[g(X)]=\sum_xg(x)p(x)\)
线性 \(E[aX+b]=aE[X]+b\);\(E[\sum X_i]=\sum E[X_i]\)(无需独立)
示性变量 \(E[I_A]=P(A)\)
方差 \(\mathrm{Var}(X)=E[(X-\mu)^2]=E[X^2]-(E[X])^2\)
线性变换 \(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\),\(\mathrm{SD}=\sqrt{\mathrm{Var}}\)
示性变量求二阶矩 \(E[X^2]=\sum_ip_i+\sum_{i\ne j}P\{X_i=1,X_j=1\}\)
报童问题 最优备货 = 需求的 \(b/(b+\ell)\) 分位数
规模偏倚 按个体抽样所见的组规模均值 \(=E[X^2]/E[X]\ge E[X]\)
CDF 求概率 \(P\{a<X\le b\}=F(b)-F(a)\);\(P\{X=b\}=F(b)-F(b^-)\)

练习

基础

  1. \(X\) 取 \(-2,0,3\) 的概率分别为 .3、.5、.2。求 \(E[X]\)、\(E[X^2]\)、\(\mathrm{Var}(X)\)、\(\mathrm{Var}(3X-5)\)。 答案:\(E[X]=0\),\(E[X^2]=1.2+1.8=3\),\(\mathrm{Var}=3\),\(\mathrm{Var}(3X-5)=27\)。
  2. 某策略每笔以 0.4 的概率盈利 2.5,以 0.6 的概率亏损 1。求单笔期望、标准差,以及 100 笔独立交易累计盈亏的期望与标准差。 答案:\(E=0.4\),\(E[X^2]=2.5+0.6=3.1\),\(\mathrm{SD}=\sqrt{3.1-0.16}\approx1.715\);100 笔期望 40、标准差 17.15(独立和的方差相加,第 07a 章 7.4 节证明)。
  3. 证明对非负整数值随机变量 \(N\),\(E[N]=\sum_{i\ge1}P\{N\ge i\}\)。(原书理论练习 4.5) 提示:\(N=\sum_{i\ge1}I\{N\ge i\}\),再用示性变量法。
  4. 10 对夫妻随机围坐圆桌,用示性变量法求相邻而坐的夫妻对数的期望。 答案:每对相邻的概率为 \(2/19\),期望 \(20/19\)。
  5. 对例 10a 的混合分布,求 \(P\{1\le X<2\}\) 与 \(P\{X\ge2\}\)。 答案:\(F(2^-)-F(1^-)=2/3-1/2=1/6\);\(1-F(2^-)=1/3\)。

进阶

  1. 证明 \(E[(X-c)^2]\) 在 \(c=E[X]\) 处取最小,最小值为 \(\mathrm{Var}(X)\)。这对用均值作预测有什么含义? 提示:\(E[(X-c)^2]=\mathrm{Var}(X)+(E[X]-c)^2\)。在平方损失下最好的常数预测是均值。
  2. 一个做市商每天开盘前决定持有某 ETF 的库存 \(s\) 份(整数),当日客户买入需求 \(X\) 的分布为 \(P\{X=k\}=0.1,\ k=0,\dots,9\)。每卖出一份赚 0.5,未卖出的每份因隔夜风险损失 0.2。最优库存是多少? 答案:临界分位数 \(0.5/0.7\approx0.714\)。\(F(6)=0.7<0.714\le F(7)=0.8\),最优 \(s=7\)。
  3. 某量化私募有 3 只产品,规模分别为 1 亿、4 亿、15 亿。若"随机抽一位持有人",他所持产品的平均规模是多少?与"产品的平均规模"相比如何? 答案:按资金加权 \(\frac{1+16+225}{20}=12.1\) 亿,远大于简单平均 6.67 亿(假设持有人与资金成比例)。
  4. 证明若 \(P\{0\le X\le c\}=1\),则 \(\mathrm{Var}(X)\le c^2/4\)。(原书第 5 章理论练习 5.8 的离散版) 提示:\(\mathrm{Var}(X)\le E[(X-c/2)^2]\le c^2/4\),用第 6 题的结论。
  5. 集券问题中 \(N=5\),求 \(P\{T>10\}\),并用模拟核对。 答案:由 (1.1),\(5(0.8)^{10}-10(0.6)^{10}+10(0.4)^{10}-5(0.2)^{10}\approx0.5369-0.0605+0.0010-0.0000\approx0.477\)。

原书推荐习题:Problems 4.20(轮盘策略:正赢概率与负期望)、4.21(检验悖论车辆版)、4.30(圣彼得堡悖论)、4.31(合适评分规则)、4.24(极小极大定理)、4.32(混样检测)、4.33、4.34(报童及含商誉成本的库存)、4.84、4.85(示性变量法);Theoretical Exercises 4.5(尾和公式)、4.7(标准化);Self-Test 4.4(规模偏倚)、4.6(信息价值)、4.7(双信封阈值策略)。


原书对照

本章小节 原书章节 PDF 页码 书内页码
4.1 随机变量 4.1 Random Variables p.125–129 p.112–116
4.2 离散型随机变量 4.2 Discrete Random Variables p.129–132 p.116–119
4.3 期望 4.3 Expected Value p.132–134 p.119–121
4.4 随机变量函数的期望 4.4 Expectation of a Function of a Random Variable p.134–138 p.121–125
4.5 方差 4.5 Variance p.138–140 p.125–127
4.6 随机变量和的期望 4.9 Expected Value of Sums of Random Variables p.168–172 p.155–159
4.7 CDF 的性质 4.10 Properties of the Cumulative Distribution Function p.172–174 p.159–161
小结与习题 Summary, Problems, Theoretical Exercises, Self-Test p.175–188 p.162–175

(书内页码 = PDF 页码 − 13。)