第 04a 章 随机变量、期望与方差
本章对应 Ross 第 4 章的 4.1–4.5 节以及 4.9、4.10 节;4.6–4.8 节的常见离散分布放在第 04b 章。随机变量把"试验结果"变成"数",期望和方差则是我们描述一个数字型不确定性最基本的两把尺子。量化里每一笔交易的盈亏、每天的收益、每分钟的成交笔数都是随机变量,"这个策略赚不赚钱、风险多大"就是在问期望与方差。
学习目标
- 理解随机变量是样本空间上的实值函数,会写出离散随机变量的概率质量函数(PMF)与累积分布函数(CDF)。
- 掌握期望的定义与频率解释,会用无意识统计学家定律(LOTUS)计算 \(E[g(X)]\),并牢记一般 \(E[g(X)]\ne g(E[X])\)。
- 掌握方差的定义、计算式 \(E[X^2]-(E[X])^2\) 与线性变换规则。
- 掌握"期望的线性性不需要独立性",熟练使用示性变量法求复杂计数的期望与方差。
- 掌握 CDF 的四条性质,会用 CDF 回答一切关于 \(X\) 的概率问题,包括混合型分布。
- 会用"边际分析 + 临界分位数"解决报童型决策问题,理解规模偏倚(检验悖论)。
读前导读
这一章在解决什么问题。 期望和方差你在 CFA 里天天用:组合期望收益是加权平均,方差是偏离均值的平方的期望,标准差就是波动率。本章把这两个量放在更严格的地基上,并给出几样 CFA 没有的工具。
本册比 CFA 深的地方,从这一章开始显现。CFA 里"随机变量"只是"一个可能取多个值的量";这里它被定义为样本空间上的函数——每个世界状态对应一个数。这个看法让很多结论变得一目了然,例如"期望的线性性不需要独立性":组合的期望收益等于各资产期望收益的加权和,不管资产之间相关性如何;但方差要加协方差项。本章还会给出 LOTUS(求 \(E[g(X)]\) 不必先求 \(g(X)\) 的分布),示性变量法(把复杂计数拆成 0-1 变量之和),以及能同时描述离散、连续和混合型分布的 CDF。本章只处理离散型,期望是求和;到第 05 章连续型随机变量,期望会改用积分定义,\(E[X]=\int x f(x)\,dx\),那时本章的每个结论都有一个"把 \(\sum\) 换成 \(\int\)"的对应版本。
和金融的联系:期权价值本质上是 \(E[g(S_T)]\),而 \(g(x)=\max(x-K,0)\) 是凸函数,所以 \(E[g(S)]\ne g(E[S])\),这是期权有时间价值的根源。报童问题的"临界分位数"在资金备付、库存、做市库存里都会出现;规模偏倚则关系到绩效统计口径(按笔还是按时间、按产品数还是按资金加权)。
需要先想起来的数学。
- 求和的拆分与交换。 \(\sum_i(a_i+b_i)=\sum_ia_i+\sum_ib_i\),\(\sum_ica_i=c\sum_ia_i\)。双重求和 \(\sum_i\sum_j a_{ij}\) 可以先按行加再按列加,也可以按任意方式分组(项非负或绝对收敛时)。LOTUS、期望线性性的证明全靠"把同一堆项换一种方式分组相加"。见 第 00 册第 07 章 概率中的分析工具。
- 平方展开。 \((a+b)^2=a^2+2ab+b^2\);\((\sum_ia_i)^2=\sum_ia_i^2+\sum_{i\ne j}a_ia_j\)。后者有 \(n\) 个平方项和 \(n(n-1)\) 个交叉项。例:\((a_1+a_2)^2=a_1^2+a_2^2+a_1a_2+a_2a_1\)。示性变量求方差要用。
- 指数级数。 \(\sum_{i=0}^\infty\lambda^i/i!=e^\lambda\)。例 2a 用它定常数。见 第 00 册第 04 章 级数与收敛。
- 单侧极限。 \(F(b^-)=\lim_{x\uparrow b}F(x)\) 表示 \(x\) 从左边逼近 \(b\) 时 \(F\) 的极限。阶梯函数在跳跃点的左极限和函数值不同,差就是跳跃高度。例:4.2 节那个阶梯 CDF 在 \(a=2\) 处 \(F(2^-)=1/4\),\(F(2)=3/4\),所以 \(P\{X=2\}=1/2\)。见 第 00 册第 01 章 函数极限与连续。
怎么读这一章。 4.3–4.6 是核心:期望定义、LOTUS、方差计算式、期望线性性和示性变量法。报童问题(例 4b)推导短而有用,建议读懂。4.7 的 CDF 性质要记住"\(P\{X<b\}=F(b^-)\)"和混合型分布的例子。可以跳过或只看结论:例 1e 的容斥公式(集券问题)、例 3c、例 4c(效用的构造)。
4.1 随机变量
做试验时,我们往往只关心结果的某个函数,比如两颗骰子之和、抛硬币的正面总数,而不关心具体的结果。定义在样本空间上的实值函数叫做随机变量(random variable)。它的取值由试验结果决定,所以可以给它的各个取值赋予概率。
白话解释:把样本空间想成一张"情景表",每行是一种世界状态 \(s\),每行有一个概率 \(p(s)\)。随机变量就是在表上加一列数 \(X(s)\),例如每种情景下组合的盈亏。同一张表可以加很多列:组合盈亏 \(X\)、指数收益 \(Y\)、是否触发止损 \(I\)。它们共享同一组情景和概率,这就是为什么后面可以讨论 \(X+Y\)、\(XY\) 的分布。压力测试表就是这种结构:每个情景一行,各头寸损益各一列。"随机"的只是哪一行会发生,每一列本身是确定的函数。
例 1a 抛三枚公平硬币,\(Y\) 为正面数:\(P\{Y=0\}=1/8\),\(P\{Y=1\}=3/8\),\(P\{Y=2\}=3/8\),\(P\{Y=3\}=1/8\)。\(Y\) 必取 0–3 之一,所以 \(\sum_iP\{Y=i\}=1\)。
例 1b(寿险赔付) 两位老年客户各有 10 万美元保单,年轻者一年内死亡的概率为 .05,年长者为 .10,相互独立。\(X\) 为赔付总额(单位 10 万):
例 1c(最大编号球) 从编号 1–20 的球中无放回取 4 个,\(X\) 为最大编号,取值 \(4,\dots,20\):
例 1d(截断几何) 正面概率为 \(p\) 的硬币反复抛,直到出现正面或已抛满 \(n\) 次。\(X\) 为抛掷次数:\(P\{X=i\}=(1-p)^{i-1}p\)(\(i=1,\dots,n-1\)),\(P\{X=n\}=(1-p)^{n-1}\)。验证:\(\sum_{i=1}^{n-1}p(1-p)^{i-1}+(1-p)^{n-1}=1\)。
例 1e(集券问题,coupon collecting) 共 \(N\) 种券,每次独立等可能得到任一种。\(T\) 为集齐全部种类所需张数。先求尾概率:令 \(A_j\)="前 \(n\) 张中没有第 \(j\) 种",则 \(\{T>n\}=\bigcup_jA_j\),且 \(P(A_{j_1}\cdots A_{j_k})=((N-k)/N)^n\),由容斥原理
再由 \(P\{T=n\}=P\{T>n-1\}-P\{T>n\}\) 得点概率。原书还求了前 \(n\) 张中出现的不同种类数 \(D_n\) 的分布。
累积分布函数(cumulative distribution function, CDF) \(F(x)=P\{X\le x\}\),\(-\infty<x<\infty\)。若 \(a\le b\),\(\{X\le a\}\subset\{X\le b\}\),所以 \(F\) 单调不减。
4.2 离散型随机变量
最多取可数个值的随机变量叫离散型随机变量。它的**概率质量函数(probability mass function, PMF)**为 \(p(a)=P\{X=a\}\)。若 \(X\) 取值 \(x_1,x_2,\dots\),则 \(p(x_i)\ge0\),其他点 \(p(x)=0\),且 \(\sum_ip(x_i)=1\)。PMF 常画成棒状图,例如两骰之和的 \(p(k)\) 从 \(1/36\) 线性升到 \(p(7)=6/36\) 再对称下降。
例 2a \(p(i)=c\lambda^i/i!\),\(i\ge0\)。由 \(\sum_i\lambda^i/i!=e^\lambda\) 得 \(c=e^{-\lambda}\)。于是 \(P\{X=0\}=e^{-\lambda}\),\(P\{X>2\}=1-e^{-\lambda}-\lambda e^{-\lambda}-\lambda^2e^{-\lambda}/2\)。(这就是第 04b 章的泊松分布。)
CDF 与 PMF 的关系:\(F(a)=\sum_{x\le a}p(x)\)。离散变量的 CDF 是阶梯函数,在每个可能取值处跳跃,跳跃高度就是该点的概率。例如 \(p(1)=1/4,p(2)=1/2,p(3)=p(4)=1/8\) 时,
4.3 期望
定义
离散随机变量 \(X\) 的**期望(expectation, expected value)**为
即以概率为权的加权平均。例:\(p(0)=p(1)=1/2\) 时 \(E[X]=1/2\);\(p(0)=1/3,p(1)=2/3\) 时 \(E[X]=2/3\)。
频率解释:独立重复无穷多次,事件出现的比例等于其概率(第 08 章的强大数律)。把 \(X\) 看成一局赌博的收益,长期平均每局收益就是 \(\sum x_ip(x_i)=E[X]\)。这正是"策略的期望收益"的含义:它是大量重复下的平均,不是单次的保证。
力学类比:在无重量的杆上 \(x_i\) 处放质量 \(p(x_i)\),平衡点就在 \(E[X]\),因为 \(\sum_i(x_i-E[X])p(x_i)=0\)。例如 \(p(-1)=.10,p(0)=.25,p(1)=.30,p(2)=.35\) 时重心在 \(0.9\)。
例 3a 公平骰子 \(E[X]=(1+2+\cdots+6)/6=7/2\)。
例 3b(示性变量,indicator variable) \(I=1\) 若事件 \(A\) 发生,否则为 0。\(E[I]=P(A)\)。这个看似平凡的等式是后面"示性变量求和法"的基石。
例 3c(答题顺序) 两道题,先答第 \(i\) 题,答对才能答另一题;答对第 \(i\) 题得 \(V_i\),知道答案的概率为 \(P_i\),相互独立。先答题 1 的期望收益为 \(V_1P_1(1-P_2)+(V_1+V_2)P_1P_2\),先答题 2 为 \(V_2P_2(1-P_1)+(V_1+V_2)P_1P_2\)。先答题 1 更优当且仅当
例 3d(检验悖论,size-biased sampling) 120 名学生乘 3 辆车出游,车上分别有 36、40、44 人。随机抽一名学生,\(X\) 为他所在车的人数。\(P\{X=36\}=36/120\) 等,
4.4 随机变量函数的期望
要求 \(E[g(X)]\),一种方法是先求 \(g(X)\) 的分布再按定义计算。例 4a:\(X\) 取 \(-1,0,1\) 的概率为 .2、.5、.3,\(Y=X^2\) 取 1 和 0 的概率各为 .5,所以 \(E[X^2]=.5\)。注意 \(E[X^2]=.5\ne(E[X])^2=.01\)。
更方便的是:
命题 4.1(无意识统计学家定律,LOTUS) 若 \(X\) 取值 \(x_i\) 的概率为 \(p(x_i)\),则对任意实函数 \(g\),
证明:把 \(g(x_i)\) 相同的项归并。设 \(g(x_i)\) 的不同取值为 \(y_j\),则
推导拆解:用例 4a 走一遍。\(x\) 取 \(-1,0,1\),\(g(x)=x^2\) 的值是 \(1,0,1\),不同取值 \(y_j\) 只有 \(0\) 和 \(1\)。
- 左边逐项相加:\(1\cdot.2+0\cdot.5+1\cdot.3\)。
- 第一个等号:把 \(g\) 值相同的项归成一组:\(y=1\) 的一组是 \(x=-1\) 和 \(x=1\),提出公因子 \(1\cdot(.2+.3)\);\(y=0\) 的一组是 \(0\cdot.5\)。只是换了加法顺序。
- 第二个等号:组内概率之和 \(.2+.3\) 恰好是 \(P\{g(X)=1\}\),因为 \(g(X)=1\) 当且仅当 \(X\) 落在该组。
- 第三个等号:\(\sum_jy_jP\{g(X)=y_j\}\) 正是 \(g(X)\) 这个随机变量按定义算的期望。 结论:直接拿 \(X\) 的分布对 \(g(x)\) 加权即可,不必先求 \(g(X)\) 的分布。 金融直觉:期权定价就是 LOTUS:\(E[\max(S_T-K,0)]=\sum_s\max(s-K,0)\,P\{S_T=s\}\),直接用标的价格的分布对收益函数加权,不需要先求"期权收益"的分布。也因为 \(\max(\cdot-K,0)\) 不是直线,\(E[\max(S_T-K,0)]\ge\max(E[S_T]-K,0)\),若 \(E[S_T]=K\),期权的期望收益为正,而用期望价格代入只得 0。这就是例 4a 里 \(E[X^2]\ne(E[X])^2\) 在金融中的样子。
推论 4.1(线性) \(E[aX+b]=aE[X]+b\)。
\(E[X]\) 也叫 \(X\) 的**均值(mean)**或一阶矩;\(E[X^n]=\sum_xx^np(x)\) 叫 \(n\) 阶矩(\(n\)th moment)。
报童问题:临界分位数
例 4b(报童/季节性库存问题,newsvendor) 每卖出一件净赚 \(b\),季末每剩一件亏 \(\ell\)。需求 \(X\) 的 PMF 为 \(p(i)\)。备货 \(s\) 件时利润为
求最优 \(s\) 时不必逐个比较,用边际分析:多备一件带来的期望利润变化为
推导拆解:
- 期望利润:把两种情形合成一个式子。\(X\le s\) 时利润 \(bX-(s-X)\ell=sb+(b+\ell)(X-s)\)(加减 \(sb\) 整理即得);\(X>s\) 时利润 \(sb\)。所以 \(P(s)=sb+(b+\ell)(X-s)\cdot\mathbf 1\{X\le s\}\)。对它用 LOTUS 取期望,就是原文的式子。
- 边际:\(E[P(s+1)]-E[P(s)]\) 中,\(sb\) 部分贡献 \(b\);求和部分里,每个 \(i\le s\) 的项从 \((i-s)\) 变成 \((i-s-1)\),各减少 \(p(i)\);新增的 \(i=s+1\) 项是 \((s+1-s-1)p(s+1)=0\)。合计 \(b-(b+\ell)\sum_{i\le s}p(i)\)。
- 直观读法:多备第 \(s+1\) 件,若需求超过 \(s\)(概率 \(1-F(s)\)),多赚 \(b\);若需求不超过 \(s\)(概率 \(F(s)\)),这件卖不掉,亏 \(\ell\)。边际期望 \(=b[1-F(s)]-\ell F(s)\),与上式相同。令它从正变负,就得到 \(F(s)\) 跨过 \(b/(b+\ell)\) 的位置。 这一步"比较多做一单位的边际收益与边际成本"是离散版的"导数等于零"。
这个结论非常一般:当"多了"和"少了"的单位损失分别是常数时,最优决策是某个分位数。第 05 章会遇到它的连续版本,统计学里它对应分位数回归的 pinball loss。
期望效用
例 4c(效用,utility) 两种行动分别以概率 \(p_i\)、\(q_i\) 导致后果 \(C_1,\dots,C_n\)。构造效用:最差后果赋 0,最好后果赋 1;对其他 \(C_i\),找概率 \(u\) 使你在"确定得到 \(C_i\)"与"以概率 \(u\) 得最好后果、\(1-u\) 得最差后果的抽奖"之间无差异,记 \(u(C_i)=u\)。于是行动 1 等价于以概率 \(\sum_ip_iu(C_i)\) 得最好后果的抽奖。结论:行动 1 优于行动 2 当且仅当
4.5 方差
期望不反映离散程度。\(W\equiv0\);\(Y=\pm1\) 各 1/2;\(Z=\pm100\) 各 1/2,三者均值都是 0,离散程度却天差地别。可以用 \(E|X-\mu|\) 度量,但数学上不方便,所以用平方偏差。
定义 若 \(\mu=E[X]\),\(X\) 的**方差(variance)**为
推导拆解:展开那一步用了三件事。(1) 平方展开 \((X-\mu)^2=X^2-2\mu X+\mu^2\),这里 \(\mu\) 是一个固定的数,不是随机变量。(2) 期望的线性性:\(E[X^2-2\mu X+\mu^2]=E[X^2]-2\mu E[X]+\mu^2\)(常数可以提出期望,常数的期望是它自己)。(3) \(E[X]=\mu\),于是 \(-2\mu\cdot\mu+\mu^2=-\mu^2\)。 实务提醒:用 \(E[X^2]-\mu^2\) 计算日收益方差时,如果收益很小、均值又接近 0,两项都很小且接近,数值误差会被放大;统计软件计算样本方差时通常先减均值再平方,就是这个原因。
例 5a 公平骰子 \(E[X^2]=91/6\),\(\mathrm{Var}(X)=91/6-(7/2)^2=35/12\)。
性质 \(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\)。证明:\(E[(aX+b-a\mu-b)^2]=a^2E[(X-\mu)^2]\)。平移不改变方差,缩放使方差按平方缩放。
标准差(standard deviation) \(\mathrm{SD}(X)=\sqrt{\mathrm{Var}(X)}\),与 \(X\) 同量纲。量化里的"波动率"就是收益率的标准差。力学类比中,均值是重心,方差是转动惯量。
4.6 随机变量和的期望
为简单起见,设样本空间 \(S\) 有限或可数,\(X(s)\) 表示结果 \(s\) 下 \(X\) 的值,\(p(s)=P(\{s\})\)。
命题 9.1 \(E[X]=\sum_{s\in S}X(s)p(s)\)。
证明:令 \(S_i=\{s:X(s)=x_i\}\),它们互斥且并为 \(S\),\(E[X]=\sum_ix_iP(S_i)=\sum_i\sum_{s\in S_i}X(s)p(s)=\sum_sX(s)p(s)\)。
推论 9.2(期望的线性性)
金融直觉:回到"情景表"的图景:\(X_1,\dots,X_n\) 是同一张表上的 \(n\) 列,\(\sum X_i\) 是它们逐行相加得到的新列。对新列按行概率加权求平均,等于先对每列各自加权平均再相加——这只是加法交换律,和各列之间是否相关毫无关系。所以组合期望收益 \(E[\sum w_iR_i]=\sum w_iE[R_i]\) 永远成立,CFA 里你用它时从未问过相关性,原因就在此。方差则不同:\((\sum X_i)^2\) 展开后有交叉项 \(X_iX_j\),它们的期望依赖于各列如何一起变动,这就是组合方差里协方差项的来源(第 07a 章)。
例 9c \(n\) 颗骰子之和的期望为 \(3.5n\)。
例 9d(示性变量法,method of indicators) 第 \(i\) 次试验成功的概率为 \(p_i\),令 \(X_i\) 为其示性变量,\(X=\sum X_i\) 为成功次数,则 \(E[X]=\sum p_i\),不要求试验独立。特例:二项分布 \(E[X]=np\);超几何分布——无放回抽样中第 \(i\) 个取出的球等可能是 \(N\) 个中任一个,是白球的概率为 \(m/N\),所以 \(E[X]=nm/N\),尽管各次抽取相依。
例 9e(示性变量求方差) 由 \(X_i^2=X_i\),以及 \(X_iX_j\) 是"\(i,j\) 都成功"的示性变量,
- 二项:\(E[X_iX_j]=p^2\),\(E[X^2]=np+n(n-1)p^2\),\(\mathrm{Var}(X)=np(1-p)\)。
- 超几何:\(P\{X_i=1,X_j=1\}=\frac mN\cdot\frac{m-1}{N-1}\),化简得 \(\mathrm{Var}(X)=np(1-p)\big(1-\frac{n-1}{N-1}\big)\),\(p=m/N\)。
推导拆解:
- (9.1) 来自平方展开 \(X^2=(\sum_iX_i)^2=\sum_iX_i^2+\sum_i\sum_{j\ne i}X_iX_j\),再对每项取期望(线性性)。
- \(X_i^2=X_i\):0-1 变量平方不变(\(0^2=0,1^2=1\))。\(X_iX_j=1\) 当且仅当两个都为 1,所以它是"\(i,j\) 都成功"的示性变量,期望等于该事件的概率。
- 二项:\(\sum_ip_i=np\);交叉项共 \(n(n-1)\) 个,独立时每个是 \(p\cdot p\)。于是 \(\mathrm{Var}=np+n(n-1)p^2-(np)^2=np-np^2=np(1-p)\)。
- 超几何:交叉项每个是 \(\frac mN\cdot\frac{m-1}{N-1}\)(乘法法则:第 \(i\) 个是白球,再在剩下 \(N-1\) 个中第 \(j\) 个是白球)。代入 \(\mathrm{Var}=E[X^2]-(np)^2\) 整理即得。因子 \(1-\frac{n-1}{N-1}\) 叫有限总体修正:无放回抽样时,抽到一个白球会让后面抽到白球的机会略降,正负相抵,方差比有放回时小。\(n=N\)(全部抽完)时方差为 0,因为白球数是确定的 \(m\)。
示性变量法的威力在于:把一个分布很复杂的计数拆成许多 0-1 变量之和,期望只需各自的概率,方差只需两两联合概率。第 02 章游程个数的期望、配对问题中配对人数的期望(等于 1)都可以这样秒算。
4.7 累积分布函数的性质
CDF \(F\) 有四条性质:
- 单调不减:\(a<b\Rightarrow F(a)\le F(b)\);
- \(\lim_{b\to\infty}F(b)=1\);
- \(\lim_{b\to-\infty}F(b)=0\);
- 右连续:对任意递减趋于 \(b\) 的序列 \(b_n\),\(\lim F(b_n)=F(b)\)。
性质 1 来自事件包含;2、3、4 来自第 02 章的概率连续性。例如 \(b_n\downarrow b\) 时 \(\{X\le b_n\}\) 是递减事件列,其交为 \(\{X\le b\}\)。
所有关于 \(X\) 的概率问题都可以用 \(F\) 回答:
注意 \(P\{X<b\}\) 不一定等于 \(F(b)\),后者包含 \(X=b\) 的概率。
白话解释:为什么 CDF 是"右连续"而不是"左连续"?因为定义里用的是 \(\le\)。在跳跃点 \(b\),\(F(b)=P\{X\le b\}\) 已经把 \(X=b\) 那一块概率算进去了,所以 \(F\) 在 \(b\) 处取的是跳跃后的"上沿";从右边靠近 \(b\),函数值一直贴着这个上沿,所以右极限等于函数值。从左边靠近时还没算进那块概率,于是左极限 \(F(b^-)\) 是"下沿",上下沿之差就是 \(P\{X=b\}\)。 金融直觉:VaR 的定义要用到这一点。损失分布有跳跃时(例如一笔债券要么全额兑付、要么违约损失 60%),某个置信水平可能正好落在跳跃里,"使 \(F(x)\ge0.99\) 的最小 \(x\)"与"使 \(F(x)>0.99\) 的 \(x\)"可能不同。正因为 CDF 右连续,"最小 \(x\) 使 \(F(x)\ge\alpha\)"总能取到,这就是分位数(广义逆)的标准定义,代码里
stats.poisson.ppf用的也是它。
例 10a(混合型分布)
混合型分布在量化中并不罕见:例如有涨跌停限制的日收益,在涨跌停价位上有一个概率质量,其余部分连续。
量化实战
1. 胜率不是期望
很多看起来"稳赚"的策略胜率很高,期望却为负;反过来,胜率只有 30% 的趋势跟踪可能长期赚钱。下面比较两种单笔盈亏分布,并模拟 250 笔交易后亏损的比例。这正是原书习题 4.20(轮盘"必胜策略")和例 6c(幸运轮)的量化版本。
2. 报童问题与备付资金
把报童问题改写成资金管理:基金每日赎回需求 \(X\)(百万)服从均值 40 的泊松分布(第 04b 章)。备付现金 \(s\):若不足,缺口部分需要紧急变现,每单位成本 \(b=3\);若多余,闲置资金有机会成本,每单位 \(\ell=1\)。最小化期望成本等价于报童问题中最大化期望利润,最优备付量是需求分布的 \(b/(b+\ell)=0.75\) 分位数。
3. 检验悖论:按笔平均与按时间平均
例 3d 在交易数据里的对应物:每笔交易的持仓天数为 \(X\)。若"随机抽查账户里某一天正在持有的那笔交易",看到的持仓期平均是 \(E[X^2]/E[X]\),而不是 \(E[X]\)。用持仓日加权(时间加权)和用笔数加权(交易加权)计算的平均持仓期、平均收益、胜率都会不同,报告绩效时必须说明是哪一种。
推导拆解:为什么是 \(E[X^2]/E[X]\)?设共有 \(n\) 笔交易,持仓天数为 \(x_1,\dots,x_n\),总持仓日数 \(\sum_kx_k\)。随机抽一个持仓日,它属于第 \(k\) 笔的概率与该笔的天数成正比,等于 \(x_k/\sum_jx_j\)。抽到的那笔的持仓期期望为
\[\sum_kx_k\cdot\frac{x_k}{\sum_jx_j}=\frac{\frac1n\sum_kx_k^2}{\frac1n\sum_jx_j}\approx\frac{E[X^2]}{E[X]}.\]由 \(E[X^2]=\mathrm{Var}(X)+(E[X])^2\),它等于 \(E[X]+\mathrm{Var}(X)/E[X]\),只要持仓期有差异(方差大于 0),就严格大于 \(E[X]\)。例 3d 的车辆问题是同一结构:\(\frac{36^2+40^2+44^2}{120}\)。
import numpy as np
from scipy import stats
rng = np.random.default_rng(1)
# ---------- 1) 高胜率 ≠ 正期望:两种策略的单笔盈亏分布 ----------
strategies = {
"卖深度虚值期权型": (np.array([1.0, -12.0]), np.array([0.92, 0.08])),
"趋势跟踪型": (np.array([-1.0, 3.0]), np.array([0.70, 0.30])),
}
for name, (x, p) in strategies.items():
mu = (x * p).sum() # E[X] = sum x p(x)
var = (x**2 * p).sum() - mu**2 # Var = E[X^2] - (E[X])^2
sims = rng.choice(x, p=p, size=(10000, 250)).sum(axis=1) # 250 笔交易累计盈亏
print(f"{name}: 胜率={p[x>0].sum():.0%} E[X]={mu:+.3f} SD={np.sqrt(var):.3f} "
f"250笔后亏损的比例={np.mean(sims<0):.1%}")
# ---------- 2) 报童问题 = 备付资金的临界分位数 ----------
# 每日赎回需求 X ~ Poisson(40)(单位:百万)。备付 s:
# 不足部分要紧急变现,每单位成本 b=3;多余部分有机会成本,每单位 l=1。
b, l, lam = 3.0, 1.0, 40
xs = np.arange(0, 120)
px = stats.poisson.pmf(xs, lam)
def expected_cost(s):
return np.sum(px * (b * np.maximum(xs - s, 0) + l * np.maximum(s - xs, 0)))
costs = np.array([expected_cost(s) for s in xs])
s_brute = xs[costs.argmin()]
s_quant = stats.poisson.ppf(b / (b + l), lam) # 最小的 s 使 F(s) >= b/(b+l)
print(f"\n临界分位数 b/(b+l)={b/(b+l):.2f}: 枚举最优 s={s_brute}, 分位数公式 s={s_quant:.0f}, "
f"期望成本={costs.min():.3f}")
# ---------- 3) 检验悖论:按笔平均持仓期 vs 随机抽查某一天看到的持仓期 ----------
hold = rng.choice([1, 5, 20], p=[0.6, 0.3, 0.1], size=100000) # 每笔交易的持仓天数
per_trade = hold.mean()
per_day = (hold**2).sum() / hold.sum() # 随机抽一个"持仓日",其所属交易的持仓期
print(f"\n按笔平均持仓期 E[X]={per_trade:.2f} 天;随机抽查某持仓日看到的平均持仓期 "
f"E[X^2]/E[X]={per_day:.2f} 天")
关键输出:
卖深度虚值期权型: 胜率=92% E[X]=-0.040 SD=3.527 250笔后亏损的比例=53.2%
趋势跟踪型: 胜率=30% E[X]=+0.200 SD=1.833 250笔后亏损的比例=4.0%
临界分位数 b/(b+l)=0.75: 枚举最优 s=44, 分位数公式 s=44, 期望成本=8.165
按笔平均持仓期 E[X]=4.09 天;随机抽查某持仓日看到的平均持仓期 E[X^2]/E[X]=11.73 天
读法:92% 胜率的策略期望为负,250 笔后过半的路径亏损;30% 胜率的策略期望为正,只有 4% 的路径亏损。报童问题中暴力枚举与分位数公式给出同一个最优备付量 44。持仓期的两种平均相差近 3 倍,理论值 \(E[X]=4.1\)、\(E[X^2]/E[X]=48.1/4.1\approx11.73\) 与模拟一致。
本章小结
随机变量是样本空间上的实值函数;离散型用 PMF 描述,CDF 单调不减、右连续、两端极限为 0 和 1,所有概率都能由 CDF 表达(注意 \(P\{X<b\}=F(b^-)\))。期望是概率加权平均,具有频率解释;LOTUS 让我们不必先求 \(g(X)\) 的分布,但一般 \(E[g(X)]\ne g(E[X])\)。方差衡量离散程度,\(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\)。期望的线性性不需要独立性,示性变量法据此把复杂计数拆成 0-1 变量之和。报童问题说明非对称线性损失下的最优决策是分位数;期望效用是理性决策的公理基础;规模偏倚提醒我们抽样方式决定了看到的平均。
| 概念 | 公式 |
|---|---|
| PMF / CDF | \(p(a)=P\{X=a\}\);\(F(a)=\sum_{x\le a}p(x)\) |
| 期望 | \(E[X]=\sum_xx\,p(x)\) |
| LOTUS | \(E[g(X)]=\sum_xg(x)p(x)\) |
| 线性 | \(E[aX+b]=aE[X]+b\);\(E[\sum X_i]=\sum E[X_i]\)(无需独立) |
| 示性变量 | \(E[I_A]=P(A)\) |
| 方差 | \(\mathrm{Var}(X)=E[(X-\mu)^2]=E[X^2]-(E[X])^2\) |
| 线性变换 | \(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\),\(\mathrm{SD}=\sqrt{\mathrm{Var}}\) |
| 示性变量求二阶矩 | \(E[X^2]=\sum_ip_i+\sum_{i\ne j}P\{X_i=1,X_j=1\}\) |
| 报童问题 | 最优备货 = 需求的 \(b/(b+\ell)\) 分位数 |
| 规模偏倚 | 按个体抽样所见的组规模均值 \(=E[X^2]/E[X]\ge E[X]\) |
| CDF 求概率 | \(P\{a<X\le b\}=F(b)-F(a)\);\(P\{X=b\}=F(b)-F(b^-)\) |
练习
基础
- \(X\) 取 \(-2,0,3\) 的概率分别为 .3、.5、.2。求 \(E[X]\)、\(E[X^2]\)、\(\mathrm{Var}(X)\)、\(\mathrm{Var}(3X-5)\)。 答案:\(E[X]=0\),\(E[X^2]=1.2+1.8=3\),\(\mathrm{Var}=3\),\(\mathrm{Var}(3X-5)=27\)。
- 某策略每笔以 0.4 的概率盈利 2.5,以 0.6 的概率亏损 1。求单笔期望、标准差,以及 100 笔独立交易累计盈亏的期望与标准差。 答案:\(E=0.4\),\(E[X^2]=2.5+0.6=3.1\),\(\mathrm{SD}=\sqrt{3.1-0.16}\approx1.715\);100 笔期望 40、标准差 17.15(独立和的方差相加,第 07a 章 7.4 节证明)。
- 证明对非负整数值随机变量 \(N\),\(E[N]=\sum_{i\ge1}P\{N\ge i\}\)。(原书理论练习 4.5) 提示:\(N=\sum_{i\ge1}I\{N\ge i\}\),再用示性变量法。
- 10 对夫妻随机围坐圆桌,用示性变量法求相邻而坐的夫妻对数的期望。 答案:每对相邻的概率为 \(2/19\),期望 \(20/19\)。
- 对例 10a 的混合分布,求 \(P\{1\le X<2\}\) 与 \(P\{X\ge2\}\)。 答案:\(F(2^-)-F(1^-)=2/3-1/2=1/6\);\(1-F(2^-)=1/3\)。
进阶
- 证明 \(E[(X-c)^2]\) 在 \(c=E[X]\) 处取最小,最小值为 \(\mathrm{Var}(X)\)。这对用均值作预测有什么含义? 提示:\(E[(X-c)^2]=\mathrm{Var}(X)+(E[X]-c)^2\)。在平方损失下最好的常数预测是均值。
- 一个做市商每天开盘前决定持有某 ETF 的库存 \(s\) 份(整数),当日客户买入需求 \(X\) 的分布为 \(P\{X=k\}=0.1,\ k=0,\dots,9\)。每卖出一份赚 0.5,未卖出的每份因隔夜风险损失 0.2。最优库存是多少? 答案:临界分位数 \(0.5/0.7\approx0.714\)。\(F(6)=0.7<0.714\le F(7)=0.8\),最优 \(s=7\)。
- 某量化私募有 3 只产品,规模分别为 1 亿、4 亿、15 亿。若"随机抽一位持有人",他所持产品的平均规模是多少?与"产品的平均规模"相比如何? 答案:按资金加权 \(\frac{1+16+225}{20}=12.1\) 亿,远大于简单平均 6.67 亿(假设持有人与资金成比例)。
- 证明若 \(P\{0\le X\le c\}=1\),则 \(\mathrm{Var}(X)\le c^2/4\)。(原书第 5 章理论练习 5.8 的离散版) 提示:\(\mathrm{Var}(X)\le E[(X-c/2)^2]\le c^2/4\),用第 6 题的结论。
- 集券问题中 \(N=5\),求 \(P\{T>10\}\),并用模拟核对。 答案:由 (1.1),\(5(0.8)^{10}-10(0.6)^{10}+10(0.4)^{10}-5(0.2)^{10}\approx0.5369-0.0605+0.0010-0.0000\approx0.477\)。
原书推荐习题:Problems 4.20(轮盘策略:正赢概率与负期望)、4.21(检验悖论车辆版)、4.30(圣彼得堡悖论)、4.31(合适评分规则)、4.24(极小极大定理)、4.32(混样检测)、4.33、4.34(报童及含商誉成本的库存)、4.84、4.85(示性变量法);Theoretical Exercises 4.5(尾和公式)、4.7(标准化);Self-Test 4.4(规模偏倚)、4.6(信息价值)、4.7(双信封阈值策略)。
原书对照
| 本章小节 | 原书章节 | PDF 页码 | 书内页码 |
|---|---|---|---|
| 4.1 随机变量 | 4.1 Random Variables | p.125–129 | p.112–116 |
| 4.2 离散型随机变量 | 4.2 Discrete Random Variables | p.129–132 | p.116–119 |
| 4.3 期望 | 4.3 Expected Value | p.132–134 | p.119–121 |
| 4.4 随机变量函数的期望 | 4.4 Expectation of a Function of a Random Variable | p.134–138 | p.121–125 |
| 4.5 方差 | 4.5 Variance | p.138–140 | p.125–127 |
| 4.6 随机变量和的期望 | 4.9 Expected Value of Sums of Random Variables | p.168–172 | p.155–159 |
| 4.7 CDF 的性质 | 4.10 Properties of the Cumulative Distribution Function | p.172–174 | p.159–161 |
| 小结与习题 | Summary, Problems, Theoretical Exercises, Self-Test | p.175–188 | p.162–175 |
(书内页码 = PDF 页码 − 13。)