量化交易中文教材

第 06b 章 条件分布、次序统计量与变量变换

本章对应 Ross 第 6 章的 6.4–6.8 节。条件分布回答"知道一个变量的值后,另一个变量的分布变成什么"——二元正态的条件分布直接给出了对冲比率和压力情景下的条件风险;连续版 Bayes 公式与贝塔—二项共轭给出胜率的后验。次序统计量描述样本中最大、最小、中位数的分布,它解释了"从一堆回测里挑出的最好策略为什么总是看起来很好"。雅可比变换法则给出 Box–Muller 正态随机数生成法,以及伽马与贝塔分布之间的深刻联系。

学习目标

  1. 掌握离散与连续情形的条件分布,会在条件事件概率为 0 时使用条件密度。
  2. 掌握二元正态分布及其条件分布:条件均值关于条件值线性、条件方差缩小为 \((1-\rho^2)\) 倍;并把它与回归、对冲比率联系起来。
  3. 会用连续版 Bayes 公式做参数后验更新,理解贝塔—二项共轭;了解 t 分布的来历。
  4. 掌握次序统计量的联合密度、第 \(j\) 个次序统计量的密度与 CDF,会求样本最大值、中位数、极差的分布。
  5. 掌握多元变量变换的雅可比公式,理解 Box–Muller 方法与"伽马之和与比例独立"。
  6. 理解可交换性:它弱于独立同分布,但足以推出边缘同分布,是置换检验的前提。

读前导读

这一章在解决什么问题。 本章有四个相对独立的主题:条件分布、次序统计量、多元变量变换、可交换性。它们回答的问题都很实际:已知指数跌了 3%,个股收益的分布变成什么?从 100 个回测里挑出最好的一个,它的夏普比率会"虚高"多少?给定两个独立正态,怎样生成新的随机变量、它们的密度是什么?

和 CFA 的联系首先在二元正态。CFA 里 beta 是 \(\mathrm{Cov}(R_i,R_m)/\mathrm{Var}(R_m)\),回归斜率是 \(\rho\sigma_x/\sigma_y\),\(R^2=\rho^2\)。本章会看到:在二元正态下,"给定 \(Y=y\) 时 \(X\) 的条件分布"恰好是均值落在回归线上、方差为 \(\sigma_x^2(1-\rho^2)\) 的正态分布。回归、对冲比率、对冲后的残差风险、压力情景下的条件 VaR,都是这一个公式的不同读法。

本章比 CFA 深的地方有三处。第一,条件于概率为 0 的事件:连续变量 \(Y=y\) 的概率是 0,第 03 章的定义 \(P(EF)/P(F)\) 无法使用,要改用条件密度 \(f(x,y)/f_Y(y)\)。第二,多元变量变换需要雅可比行列式。第 05 章的一维公式里乘的是 \(|dx/dy|\);二维时,一个小矩形被变换成一个小平行四边形,面积伸缩的倍数是雅可比矩阵的行列式。正态随机数生成(Box–Muller)、"正态样本的均值与偏差独立"都靠这个公式推出。第三,次序统计量:样本最大值、中位数的分布。CFA 讲过数据挖掘偏差和幸存者偏差,但没有定量;次序统计量给出"挑最好的那个"到底会偏多少。

需要先想起来的数学。

  • 行列式。 \(2\times2\):\(\begin{vmatrix}a&b\\c&d\end{vmatrix}=ad-bc\)。几何意义:矩阵把单位正方形变成一个平行四边形,行列式的绝对值就是这个平行四边形的面积。例:\(\begin{vmatrix}1&1\\1&-1\end{vmatrix}=-1-1=-2\),面积放大 2 倍(符号表示方向翻转)。\(3\times3\) 行列式可以按第一行展开。见 第 00 册第 06 章 线性代数速成。
  • 偏导数与雅可比矩阵。 若 \(y_1=g_1(x_1,x_2)\),\(y_2=g_2(x_1,x_2)\),雅可比矩阵的第 \(i\) 行第 \(j\) 列是 \(\partial g_i/\partial x_j\)(把其他变量当常数,对 \(x_j\) 求导)。例:\(y_1=x_1+x_2\),\(y_2=x_1x_2\),则矩阵为 \(\begin{pmatrix}1&1\\x_2&x_1\end{pmatrix}\),行列式 \(x_1-x_2\)。多元换元公式 \(dx_1dx_2=|J|^{-1}dy_1dy_2\) 见 第 00 册第 05 章 多元微积分与优化。
  • 配方。 二元正态的条件分布、边缘分布都是把指数里的二次式对某个变量配方,凑成"正态密度 × 与该变量无关的因子"。
  • Gamma 与 Beta 积分。 \(\int_0^\infty e^{-y}y^{\alpha-1}dy=\Gamma(\alpha)\);\(\int_0^1x^{a-1}(1-x)^{b-1}dx=B(a,b)\)。用于 t 分布密度、贝塔后验的归一化常数。见第 05 章 5.6 节和 第 00 册第 03 章 积分。

怎么读这一章。 必读:6.5 节条件密度的定义、二元正态的条件分布及其量化解读、贝塔—二项共轭;6.6 节最大值与最小值的 CDF(\(F^n\) 与 \(1-(1-F)^n\))以及 (6.2)、(6.4);6.7 节雅可比公式与例 7a、7b(Box–Muller)。"量化实战"第 2 部分(最佳回测的夏普)务必读。第一次可以只看结论:t 分布密度的推导、(6.6) 与极差、例 7d、7e、6.8 节的例 8b–8d。


6.4 条件分布:离散情形

若 \(p_Y(y)>0\),给定 \(Y=y\) 时 \(X\) 的条件 PMF为

\[p_{X\mid Y}(x\mid y)=P\{X=x\mid Y=y\}=\frac{p(x,y)}{p_Y(y)},\]

条件 CDF 为 \(F_{X\mid Y}(x\mid y)=\sum_{a\le x}p_{X\mid Y}(a\mid y)\)。定义和无条件情形完全一样,只是一切都以 \(Y=y\) 为条件。若 \(X,Y\) 独立,条件分布就等于无条件分布。

例 4a \(p(0,0)=.4,\ p(0,1)=.2,\ p(1,0)=.1,\ p(1,1)=.3\)。\(p_Y(1)=.5\),所以 \(p_{X\mid Y}(0\mid1)=2/5\),\(p_{X\mid Y}(1\mid1)=3/5\)。

例 4b(泊松给定和的条件分布) \(X,Y\) 独立,分别为 Poisson(\(\lambda_1\))、Poisson(\(\lambda_2\))。给定 \(X+Y=n\),

\[P\{X=k\mid X+Y=n\}=\binom nk\Big(\frac{\lambda_1}{\lambda_1+\lambda_2}\Big)^k\Big(\frac{\lambda_2}{\lambda_1+\lambda_2}\Big)^{n-k},\]

即 \(\mathrm{Bin}\big(n,\frac{\lambda_1}{\lambda_1+\lambda_2}\big)\)。这是第 06a 章泊松分拆的逆命题:两条独立泊松订单流合并后,已知总数为 \(n\),其中来自第一条流的笔数是二项分布。

例 4c(多项分布的条件分布) 多项分布 \((n;p_1,\dots,p_k)\) 中,已知结果 \(r+1,\dots,k\) 分别出现了 \(n_{r+1},\dots,n_k\) 次(合计 \(m\) 次),则 \((X_1,\dots,X_r)\) 的条件分布是 \(n-m\) 次试验、各类概率为 \(p_i/F_r\)(\(F_r=\sum_{i\le r}p_i\))的多项分布。直观:剩下的 \(n-m\) 次试验只能落在前 \(r\) 类中,概率按比例重新归一化。

例 4d \(n\) 次独立试验共有 \(k\) 次成功时,每一种成功/失败排列的条件概率都是

\[\frac{p^k(1-p)^{n-k}}{\binom nkp^k(1-p)^{n-k}}=\frac{1}{\binom nk},\]
与 \(p\) 无关。成功的总次数已经包含了数据中关于 \(p\) 的全部信息——这是第 03 册"充分统计量"的直观。

6.5 条件分布:连续情形

条件密度

若 \(f_Y(y)>0\),给定 \(Y=y\) 时 \(X\) 的条件密度为

\[f_{X\mid Y}(x\mid y)=\frac{f(x,y)}{f_Y(y)}.\]

动机:\(f_{X\mid Y}(x\mid y)dx=\frac{f(x,y)dxdy}{f_Y(y)dy}\approx P\{x\le X\le x+dx\mid y\le Y\le y+dy\}\)。于是

\[P\{X\in A\mid Y=y\}=\int_Af_{X\mid Y}(x\mid y)dx.\]
条件事件 \(\{Y=y\}\) 的概率为 0,但条件密度依然给出了可操作的条件概率。独立时 \(f_{X\mid Y}=f_X\)。

白话解释:第 03 章的 \(P(E\mid F)=P(EF)/P(F)\) 在 \(P(F)=0\) 时是 \(0/0\),没法用。解决办法是先把条件放宽成"\(Y\) 落在 \(y\) 附近一个宽 \(dy\) 的小区间",这个事件概率为正,可以用旧定义;再让 \(dy\to0\),分子分母里的 \(dy\) 约掉,剩下 \(f(x,y)/f_Y(y)\)。 几何上:在联合密度这座"山"上沿 \(Y=y\) 切一刀,得到一条截面曲线 \(x\mapsto f(x,y)\)。它的形状就是条件分布的形状,但面积是 \(f_Y(y)\) 而不是 1,除以 \(f_Y(y)\) 就是把它归一化。压力测试里"假设指数跌 3%,个股会怎样",问的就是这条截面。

例 5a \(f(x,y)=\frac{12}5x(2-x-y)\)(\(0<x,y<1\)),

\[f_{X\mid Y}(x\mid y)=\frac{x(2-x-y)}{\int_0^1x(2-x-y)dx}=\frac{x(2-x-y)}{2/3-y/2}=\frac{6x(2-x-y)}{4-3y}.\]

例 5b \(f(x,y)=\frac{e^{-x/y}e^{-y}}{y}\)(\(x,y>0\)),\(f_{X\mid Y}(x\mid y)=\frac1ye^{-x/y}\):给定 \(Y=y\) 时 \(X\) 是均值为 \(y\) 的指数分布,\(P\{X>1\mid Y=y\}=e^{-1/y}\)。这种"参数本身随机"的结构叫分层模型或混合模型。

t 分布

例 5c(t 分布,t-distribution) \(Z\sim N(0,1)\) 与 \(Y\sim\chi^2_n\) 独立,

\[T=\frac{Z}{\sqrt{Y/n}}\]

称为自由度为 \(n\) 的 t 分布。求密度:给定 \(Y=y\),\(T=\sqrt{n/y}\,Z\sim N(0,n/y)\),条件密度为 \(\frac{1}{\sqrt{2\pi n/y}}e^{-t^2y/2n}\);乘以卡方密度得联合密度,令 \(c=\frac{t^2+n}{2n}\),对 \(y\) 积分(代换 \(x=cy\) 化为伽马积分),得

\[f_T(t)=\frac{\Gamma(\frac{n+1}2)}{\sqrt{\pi n}\,\Gamma(\frac n2)}\Big(1+\frac{t^2}{n}\Big)^{-(n+1)/2},\qquad-\infty<t<\infty.\]

它的尾部按多项式衰减,比正态厚;\(n\to\infty\) 时趋于正态,\(n=1\) 时就是柯西分布。t 分布是检验因子收益均值、IC 是否显著的 t 统计量的分布(第 03 册),也是第 05 章量化实战中用来刻画厚尾收益的模型。

二元正态分布

例 5d(二元正态分布,bivariate normal) 参数 \(\mu_x,\mu_y,\sigma_x,\sigma_y>0\),\(-1<\rho<1\):

\[f(x,y)=\frac{1}{2\pi\sigma_x\sigma_y\sqrt{1-\rho^2}}\exp\Big\{-\frac{1}{2(1-\rho^2)}\Big[\Big(\frac{x-\mu_x}{\sigma_x}\Big)^2+\Big(\frac{y-\mu_y}{\sigma_y}\Big)^2-2\rho\frac{(x-\mu_x)(y-\mu_y)}{\sigma_x\sigma_y}\Big]\Big\}.\]

条件分布:把与 \(x\) 无关的因子并入常数,对 \(x\) 配方,得

\[X\mid Y=y\ \sim\ N\Big(\mu_x+\rho\frac{\sigma_x}{\sigma_y}(y-\mu_y),\ \ \sigma_x^2(1-\rho^2)\Big).\]

推导拆解:先标准化以简化记号:\(u=\frac{x-\mu_x}{\sigma_x}\),\(w=\frac{y-\mu_y}{\sigma_y}\),方括号里是 \(u^2-2\rho uw+w^2\)。

  1. 条件密度 \(=f(x,y)/f_Y(y)\)。\(y\) 固定时,\(f_Y(y)\) 和所有只含 \(w\) 的因子都是常数,只需看指数里含 \(u\) 的部分。
  2. 对 \(u\) 配方:\(u^2-2\rho uw+w^2=(u-\rho w)^2+(1-\rho^2)w^2\)。后一项不含 \(u\),并入常数。
  3. 于是条件密度 \(\propto\exp\Big\{-\frac{(u-\rho w)^2}{2(1-\rho^2)}\Big\}\):作为 \(u\) 的函数,这是均值 \(\rho w\)、方差 \(1-\rho^2\) 的正态密度的形状。
  4. 换回原单位:\(u=\rho w\) 即 \(x=\mu_x+\rho\frac{\sigma_x}{\sigma_y}(y-\mu_y)\);\(u\) 的方差乘 \(\sigma_x^2\) 得 \(\sigma_x^2(1-\rho^2)\)。 关键技巧是第 3 步:只要认出"指数是某变量的二次函数、平方项系数为负",就知道它是正态,均值和方差可以直接读出,归一化常数不用算。

对称地,\(Y\mid X=x\sim N\big(\mu_y+\rho\frac{\sigma_y}{\sigma_x}(x-\mu_x),\ \sigma_y^2(1-\rho^2)\big)\)。三个要点:

  1. 条件均值是条件值的线性函数,斜率为 \(\rho\sigma_x/\sigma_y\)——这就是回归线;
  2. 条件方差不依赖条件值,并缩小为原来的 \((1-\rho^2)\) 倍;
  3. 边缘分布:令 \(w=(y-\mu_y)/\sigma_y\) 对 \(w\) 配方积分,得 \(X\sim N(\mu_x,\sigma_x^2)\)、\(Y\sim N(\mu_y,\sigma_y^2)\)。\(\rho\) 的含义是相关系数(第 07b 章例 5f 证明)。

此外,二元正态的 \(X,Y\) 独立当且仅当 \(\rho=0\),因为只有此时密度可以分解。这是正态分布的特殊性质:一般分布中"不相关"推不出"独立"。

量化联系:把 \(X\) 看成个股收益、\(Y\) 看成指数收益。条件均值的斜率 \(\beta=\rho\sigma_x/\sigma_y\) 就是个股的 beta,也是最小方差对冲比率;对冲后剩下的风险是条件标准差 \(\sigma_x\sqrt{1-\rho^2}\)。给定"指数下跌 3%"这样的压力情景,个股的条件分布直接给出条件 VaR。

混合型条件分布与贝塔—二项共轭

\(X\) 连续(密度 \(f\))、\(N\) 离散时,有连续版 Bayes 公式:

\[f_{X\mid N}(x\mid n)=\frac{P\{N=n\mid X=x\}}{P\{N=n\}}f(x).\]

例 5e(贝塔—二项共轭) 一枚硬币的正面概率 \(X\) 未知,先验为 \(U(0,1)\)。给定 \(X=x\),抛 \(n+m\) 次的正面数 \(N\sim\mathrm{Bin}(n+m,x)\)。观测到 \(n\) 次正面后,

\[f_{X\mid N}(x\mid n)=\frac{\binom{n+m}{n}x^n(1-x)^m}{P\{N=n\}}=c\,x^n(1-x)^m,\]

即后验为 Beta(\(n+1,m+1\))。更一般地,先验 Beta(\(a,b\)) 在观测到 \(n\) 次成功、\(m\) 次失败后变为 Beta(\(a+n,b+m\))。贝塔分布的两个参数可以理解为"伪成功次数"和"伪失败次数"。后验均值 \(\frac{n+1}{n+m+2}\) 正是第 03 章 Laplace 继承法则的结果。

推导拆解:一般先验 \(f(x)\propto x^{a-1}(1-x)^{b-1}\)。由连续版 Bayes 公式,后验 \(\propto\) 似然 × 先验 \(=x^n(1-x)^m\cdot x^{a-1}(1-x)^{b-1}=x^{a+n-1}(1-x)^{b+m-1}\)。分母 \(P\{N=n\}\) 与二项系数都不含 \(x\),只影响归一化常数,所以只看 \(x\) 的部分就能认出后验是 Beta(\(a+n,b+m\))。"共轭"指先验和后验属于同一个分布族,更新只是把计数加上去。 金融直觉:后验均值 \(\frac{a+n}{a+b+n+m}\) 是先验均值 \(\frac a{a+b}\) 与样本胜率 \(\frac n{n+m}\) 的加权平均,权重分别正比于 \(a+b\) 和 \(n+m\)。这就是"收缩估计":样本少时,估计值被拉向先验;样本多时,数据说了算。分析师对一家新基金的业绩打折看待,或者用行业平均胜率作先验评价一个只有 20 笔交易的新策略,都是这个结构。

6.6 次序统计量(原书选读,量化中很重要)

设 \(X_1,\dots,X_n\) 独立同分布,连续,密度为 \(f\)、CDF 为 \(F\)。把它们从小到大排列为 \(X_{(1)}\le X_{(2)}\le\cdots\le X_{(n)}\),称为次序统计量(order statistics):\(X_{(1)}\) 是最小值,\(X_{(n)}\) 是最大值。

联合密度

\((X_{(1)},\dots,X_{(n)})=(x_1,\dots,x_n)\) 当且仅当 \((X_1,\dots,X_n)\) 等于 \((x_1,\dots,x_n)\) 的 \(n!\) 个排列之一,每个排列的密度都是 \(\prod f(x_i)\),所以

\[f_{X_{(1)},\dots,X_{(n)}}(x_1,\dots,x_n)=n!\,f(x_1)\cdots f(x_n),\qquad x_1<x_2<\cdots<x_n.\tag{6.1}\]

例 6a 1 英里长的路上随机分布 3 个人(独立均匀),任意两人相距都至少 \(d\)(\(d\le1/2\))的概率为

\[3!\int_0^{1-2d}\int_{x_1+d}^{1-d}\int_{x_2+d}^1dx_3\,dx_2\,dx_1=(1-2d)^3.\]
一般 \(n\) 人时为 \([1-(n-1)d]^n\)(\(d\le1/(n-1)\))。

第 \(j\) 个次序统计量

\(X_{(j)}=x\) 意味着:\(j-1\) 个值小于 \(x\),\(n-j\) 个值大于 \(x\),1 个等于 \(x\)。这样分组的方式有 \(\frac{n!}{(n-j)!(j-1)!}\) 种,所以

\[f_{X_{(j)}}(x)=\frac{n!}{(n-j)!\,(j-1)!}[F(x)]^{j-1}[1-F(x)]^{n-j}f(x).\tag{6.2}\]

CDF 的直接求法:\(X_{(j)}\le y\) 当且仅当至少 \(j\) 个 \(X_i\le y\),而 \(X_i\le y\) 的个数服从 \(\mathrm{Bin}(n,F(y))\),

\[F_{X_{(j)}}(y)=\sum_{k=j}^n\binom nk[F(y)]^k[1-F(y)]^{n-k}.\tag{6.4}\]

特例:最大值 \(F_{X_{(n)}}(y)=F(y)^n\),最小值 \(F_{X_{(1)}}(y)=1-[1-F(y)]^n\)。

推导拆解:

  1. (6.2) 的计数:把 \(n\) 个样本分成三组,"小于 \(x\)"\(j-1\) 个、"恰在 \(x\) 附近"1 个、"大于 \(x\)"\(n-j\) 个,分法数是第 01 章的多项式系数 \(\frac{n!}{(j-1)!\,1!\,(n-j)!}\)。每种分法的概率(密度)是 \(F(x)^{j-1}\cdot f(x)\,dx\cdot[1-F(x)]^{n-j}\),由独立性相乘。
  2. 最大值:\(X_{(n)}\le y\) 当且仅当每一个 \(X_i\le y\),独立所以概率相乘,得 \(F(y)^n\)。最小值:\(X_{(1)}>y\) 当且仅当每一个 \(X_i>y\),概率 \([1-F(y)]^n\),再取补。
  3. 对 \(F^n\) 求导得最大值密度 \(nF^{n-1}f\),与 (6.2) 取 \(j=n\) 一致。 直觉:\(F(y)^n\) 随 \(n\) 增大迅速变小,最大值的分布整体右移。"量化实战"第 2 部分就是解 \(F(x)^N=1/2\) 求最大夏普的中位数。

取 \(F\) 为均匀分布,比较 (6.2) 积分与 (6.4) 得恒等式:二项分布的尾概率等于不完全贝塔积分;均匀样本的第 \(j\) 个次序统计量服从 Beta(\(j,n-j+1\))。

例 6b(样本中位数) \(2n+1\) 个样本中第 \(n+1\) 小的值叫样本中位数(sample median)。3 个 \(U(0,1)\) 样本的中位数密度为 \(6x(1-x)\),

\[P\{1/4<X_{(2)}<3/4\}=6\Big[\frac{x^2}2-\frac{x^3}3\Big]_{1/4}^{3/4}=\frac{11}{16}.\]

两个次序统计量的联合密度与极差

\(i<j\)、\(x_i<x_j\) 时,

\[f_{X_{(i)},X_{(j)}}(x_i,x_j)=\frac{n!}{(i-1)!(j-i-1)!(n-j)!}[F(x_i)]^{i-1}[F(x_j)-F(x_i)]^{j-i-1}[1-F(x_j)]^{n-j}f(x_i)f(x_j).\tag{6.6}\]

例 6c(样本极差) \(R=X_{(n)}-X_{(1)}\)。由 (6.6) 可得

\[P\{R\le a\}=n\int_{-\infty}^\infty[F(x_1+a)-F(x_1)]^{n-1}f(x_1)dx_1.\tag{6.7}\]
只有少数情形能显式算出。\(U(0,1)\) 时 \(P\{R<a\}=n(1-a)a^{n-1}+a^n\),\(f_R(a)=n(n-1)a^{n-2}(1-a)\),即 Beta(\(n-1,2\))。

量化联系:经验 VaR 就是收益样本的某个次序统计量,(6.4) 给出了它的抽样分布;用日内最高价与最低价之差(极差)估计波动率的思想也源于极差分布。最重要的应用是下面量化实战中的"最佳回测"偏差。

6.7 随机变量函数的联合分布

雅可比公式

设 \(Y_1=g_1(X_1,X_2)\),\(Y_2=g_2(X_1,X_2)\),满足:(1) 方程组可唯一反解为 \(x_1=h_1(y_1,y_2)\)、\(x_2=h_2(y_1,y_2)\);(2) \(g_1,g_2\) 有连续偏导,且雅可比行列式(Jacobian)

\[J(x_1,x_2)=\begin{vmatrix}\partial g_1/\partial x_1&\partial g_1/\partial x_2\\\partial g_2/\partial x_1&\partial g_2/\partial x_2\end{vmatrix}\ne0.\]

则

\[f_{Y_1,Y_2}(y_1,y_2)=f_{X_1,X_2}(x_1,x_2)\,|J(x_1,x_2)|^{-1},\qquad x_i=h_i(y_1,y_2).\tag{7.1}\]

这是第 05 章单调变换公式的多维版本,证明需要多元微积分的换元公式,原书不证。\(n\) 维情形完全类似(7.3)。

白话解释:思路与一维完全相同——概率守恒。\((X_1,X_2)\) 落在点 \((x_1,x_2)\) 附近的小矩形 \(dx_1\times dx_2\) 中,与 \((Y_1,Y_2)\) 落在对应的像区域中是同一个事件。变换 \(g\) 在局部近似为一个线性映射(矩阵就是雅可比矩阵),线性映射把小矩形变成小平行四边形,面积乘以 \(|J|\)。所以

\[f_Y(y_1,y_2)\cdot|J|\,dx_1dx_2=f_X(x_1,x_2)\,dx_1dx_2,\]
两边消去 \(dx_1dx_2\) 就是 (7.1)。\(|J|\) 大表示变换把区域拉大,概率被摊薄,所以密度要除以 \(|J|\)。 一维对照:\(y=g(x)\) 时 \(J=g'(x)\),(7.1) 变成 \(f_Y=f_X/|g'(x)|\),而 \(1/g'(x)=\frac{d}{dy}g^{-1}(y)\),正是第 05 章定理 7.1。 实用提醒:(7.1) 里的 \(J\) 是"\(y\) 对 \(x\) 求偏导"(正向变换),所以取倒数;有时反解出 \(x=h(y)\) 后对 \(y\) 求偏导更方便,那时直接乘它的行列式绝对值,不取倒数。两种做法结果相同。

例 7a(和与差) \(Y_1=X_1+X_2\),\(Y_2=X_1-X_2\),\(J=-2\),

\[f_{Y_1,Y_2}(y_1,y_2)=\frac12f_{X_1,X_2}\Big(\frac{y_1+y_2}{2},\frac{y_1-y_2}{2}\Big).\]
若 \(X_1,X_2\) 是独立标准正态,
\[f_{Y_1,Y_2}=\frac1{4\pi}e^{-(y_1^2+y_2^2)/4}=\frac1{\sqrt{4\pi}}e^{-y_1^2/4}\cdot\frac1{\sqrt{4\pi}}e^{-y_2^2/4},\]
所以 \(X_1+X_2\) 与 \(X_1-X_2\) 都是 \(N(0,2)\),而且相互独立。(可以证明:i.i.d. 时 \(X_1+X_2\) 与 \(X_1-X_2\) 独立当且仅当分布为正态。)

推导拆解:

  1. 雅可比:\(g_1=x_1+x_2\),\(g_2=x_1-x_2\),偏导矩阵 \(\begin{pmatrix}1&1\\1&-1\end{pmatrix}\),行列式 \(1\cdot(-1)-1\cdot1=-2\),\(|J|^{-1}=\frac12\)。
  2. 反解:两式相加得 \(x_1=\frac{y_1+y_2}2\),相减得 \(x_2=\frac{y_1-y_2}2\)。
  3. 代入标准正态联合密度 \(\frac1{2\pi}e^{-(x_1^2+x_2^2)/2}\):\(x_1^2+x_2^2=\frac{(y_1+y_2)^2+(y_1-y_2)^2}4=\frac{y_1^2+y_2^2}2\),交叉项 \(\pm2y_1y_2\) 正好抵消。于是指数变成 \(-(y_1^2+y_2^2)/4\),乘 \(\frac12\) 得 \(\frac1{4\pi}\)。
  4. 交叉项消失是独立的关键:指数里没有 \(y_1y_2\),密度就能拆成只含 \(y_1\) 和只含 \(y_2\) 的两个因子(第 06a 章因子分解判据)。 金融读法:两个独立同波动率的策略,"等权组合"与"多空价差"互不相关;对正态它们还独立。

极坐标与 Box–Muller 方法

例 7b \(X,Y\) 独立标准正态,令 \(R=\sqrt{X^2+Y^2}\),\(\Theta=\tan^{-1}(Y/X)\)。计算雅可比(第一象限 \(J=1/r\)),四个象限合并后得

\[f(r,\theta)=\frac{1}{2\pi}\,re^{-r^2/2},\qquad0<\theta<2\pi,\ r>0.\]

密度可以分解,所以 \(R\) 与 \(\Theta\) 独立,\(\Theta\sim U(0,2\pi)\),\(R\) 服从 Rayleigh 分布 \(f(r)=re^{-r^2/2}\)。再令 \(D=R^2\),得 \(R^2\sim\) Exp(1/2),即 \(\chi^2_2=\) Exp(1/2)。

Box–Muller 方法 设 \(U_1,U_2\) 独立 \(U(0,1)\)。\(-2\log U_1\sim\) Exp(1/2)(因 \(P\{-2\log U_1<x\}=1-e^{-x/2}\)),\(2\pi U_2\sim U(0,2\pi)\),令

\[X_1=\sqrt{-2\log U_1}\cos(2\pi U_2),\qquad X_2=\sqrt{-2\log U_1}\sin(2\pi U_2),\]

则 \(X_1,X_2\) 是独立的标准正态。这是蒙特卡洛模拟中生成正态随机数的经典算法。

伽马与贝塔

例 7c \(X\sim\) Gamma(\(\alpha,\lambda\))、\(Y\sim\) Gamma(\(\beta,\lambda\)) 独立,令 \(U=X+Y\),\(V=X/(X+Y)\)。反解 \(x=uv\),\(y=u(1-v)\),\(J=-1/(x+y)\),

\[f_{U,V}(u,v)=\frac{\lambda e^{-\lambda u}(\lambda u)^{\alpha+\beta-1}}{\Gamma(\alpha+\beta)}\cdot\frac{\Gamma(\alpha+\beta)}{\Gamma(\alpha)\Gamma(\beta)}v^{\alpha-1}(1-v)^{\beta-1}.\]

所以 \(U\sim\) Gamma(\(\alpha+\beta,\lambda\))、\(V\sim\) Beta(\(\alpha,\beta\)),二者独立,并顺带证明了第 05 章的 \(B(\alpha,\beta)=\Gamma(\alpha)\Gamma(\beta)/\Gamma(\alpha+\beta)\)。

推导拆解:

  1. 雅可比:\(g_1=x+y\),\(g_2=\frac{x}{x+y}\)。\(\partial g_2/\partial x=\frac{(x+y)-x}{(x+y)^2}=\frac{y}{(x+y)^2}\),\(\partial g_2/\partial y=\frac{-x}{(x+y)^2}\)(商的求导法则)。行列式 \(1\cdot\frac{-x}{(x+y)^2}-1\cdot\frac{y}{(x+y)^2}=-\frac1{x+y}\),\(|J|^{-1}=x+y=u\)。
  2. 代入独立伽马的联合密度 \(\frac{\lambda e^{-\lambda x}(\lambda x)^{\alpha-1}}{\Gamma(\alpha)}\cdot\frac{\lambda e^{-\lambda y}(\lambda y)^{\beta-1}}{\Gamma(\beta)}\),令 \(x=uv\),\(y=u(1-v)\):\(e^{-\lambda x}e^{-\lambda y}=e^{-\lambda u}\);\(x^{\alpha-1}y^{\beta-1}=u^{\alpha+\beta-2}v^{\alpha-1}(1-v)^{\beta-1}\);再乘 \(|J|^{-1}=u\),\(u\) 的幂次变成 \(\alpha+\beta-1\)。
  3. 整理后含 \(u\) 的部分恰好是 Gamma(\(\alpha+\beta,\lambda\)) 密度的形状,含 \(v\) 的部分是 Beta(\(\alpha,\beta\)) 的形状。为了让 \(u\) 部分是完整的密度,原文乘、除了 \(\Gamma(\alpha+\beta)\);剩下 \(v\) 部分的常数因密度必须积分为 1,只能等于 \(1/B(\alpha,\beta)\),于是得到 \(B=\Gamma(\alpha)\Gamma(\beta)/\Gamma(\alpha+\beta)\)。解释:\(n+m\) 件工作各需 Exp(\(\lambda\)) 时间,工人甲做 \(n\) 件、乙做 \(m\) 件,甲完成的工作量占比服从 Beta(\(n,m\)),而且与总耗时独立。

例 7d(样本和与偏差独立的雏形) \(X_1,X_2,X_3\) 独立标准正态,\(Y_1=X_1+X_2+X_3\),\(Y_2=X_1-X_2\),\(Y_3=X_1-X_3\)。\(J=3\),反解 \(X_1=\frac{Y_1+Y_2+Y_3}3\),\(X_2=\frac{Y_1-2Y_2+Y_3}3\),\(X_3=\frac{Y_1+Y_2-2Y_3}3\),代入得

\[f_Y(y_1,y_2,y_3)=\frac{1}{3(2\pi)^{3/2}}e^{-Q/2},\qquad Q=\frac{y_1^2}{3}+\frac23y_2^2+\frac23y_3^2-\frac23y_2y_3.\]
\(Q\) 中没有 \(y_1\) 与 \(y_2,y_3\) 的交叉项,所以样本和与样本偏差独立——这是"正态样本的样本均值与样本方差独立"的雏形,也是 t 统计量构造的理论基础(第 03 册)。

例 7e(指数部分和) \(X_i\) i.i.d. Exp(\(\lambda\)),\(Y_i=X_1+\cdots+X_i\)。雅可比矩阵为下三角全 1 矩阵,\(J=1\),

\[f_{Y_1,\dots,Y_n}(y_1,\dots,y_n)=\lambda^ne^{-\lambda y_n},\qquad0<y_1<\cdots<y_n.\]

这就是泊松过程前 \(n\) 个到达时刻的联合密度。逐个积掉 \(y_1,y_2,\dots\) 得 \(f_{Y_n}(y)=\lambda^n\frac{y^{n-1}}{(n-1)!}e^{-\lambda y}\),即 Gamma(\(n,\lambda\))。

6.8 可交换随机变量(原书选读)

定义 若对 \(1,\dots,n\) 的任意排列 \(i_1,\dots,i_n\),

\[P\{X_{i_1}\le x_1,\dots,X_{i_n}\le x_n\}=P\{X_1\le x_1,\dots,X_n\le x_n\},\]

则称 \(X_1,\dots,X_n\) 可交换(exchangeable):无论以什么顺序观察,联合分布都相同。离散情形等价于联合 PMF 是对称函数。i.i.d. 必然可交换,反之不然。

例 8a(无放回抽样) \(n\) 个球中 \(k\) 个特殊,逐个无放回等可能抽取,\(X_i=1\) 表示第 \(i\) 个是特殊球。对任何含 \(k\) 个 1 的 0-1 序列,

\[p(x_1,\dots,x_n)=\frac{k!\,(n-k)!}{n!}.\]

这是对称函数,所以 \(X_1,\dots,X_n\) 可交换,尽管它们不独立。

可交换 ⇒ 边缘同分布:\(P\{X=x\}=\sum_yP\{X=x,Y=y\}=\sum_yP\{X=y,Y=x\}=P\{Y=x\}\)。所以例 8a 中第 \(i\) 个抽出的是特殊球的概率都是 \(k/n\),与 \(i\) 无关——这正是第 02 章例 5d 对称性论证的严格版本。

例 8b(间隔可交换) 例 8a 中,令 \(Y_1\) 为第一个特殊球的序号,\(Y_i\) 为第 \(i-1\) 个到第 \(i\) 个特殊球之间额外抽取的次数,则 \(Y_1,\dots,Y_k\) 可交换。推论:洗好的牌中翻到第一张 A 所需的张数,与之后再翻到下一张 A 所需的张数同分布。

例 8c(Pólya 罐模型) 初始 \(n\) 红 \(m\) 蓝,每次抽一球、记下颜色,连同一个同色球一起放回。\(X_i=1\) 表示第 \(i\) 次抽到红球。任何含 \(r\) 个 1、\(k-r\) 个 0 的序列的概率都是

\[\frac{n(n+1)\cdots(n+r-1)\cdot m(m+1)\cdots(m+k-r-1)}{(n+m)(n+m+1)\cdots(n+m+k-1)},\]
只依赖于 \(r\),所以 \(X_1,\dots,X_k\) 可交换(但正相关,不独立)。推论:第 \(i\) 次抽到红球的概率恒为 \(n/(n+m)\)。Pólya 罐描述了"强者恒强"的路径依赖,类比于羊群效应或动量,但这种类比要谨慎。

例 8d(均匀间距可交换) \(X_1,\dots,X_n\) i.i.d. \(U(0,1)\),\(Y_1=X_{(1)}\),\(Y_i=X_{(i)}-X_{(i-1)}\)。变换的雅可比为 1,由 (6.1),

\[f_{Y_1,\dots,Y_n}(y_1,\dots,y_n)=n!,\qquad y_i>0,\ \sum y_i<1,\]
是对称函数,所以间距(spacings)可交换。

量化联系:**置换检验(permutation test)**的前提就是原假设下数据可交换。例如检验"信号日与非信号日的收益是否不同",若原假设成立,打乱标签不改变联合分布。第 02 章游程检验的置换核对就是一个例子。

金融直觉:可交换的意思是"顺序不携带信息"。用它之前要检查时间序列是否真的满足:日收益的波动率聚集(大波动后跟着大波动)意味着把日期打乱会改变联合分布,即使收益本身几乎不自相关。此时对单个序列做普通置换检验会给出过于乐观的 p 值,常见的补救是按块置换(block permutation)或块自助法(block bootstrap),保留局部的时间结构。Pólya 罐(例 8c)则提醒另一面:可交换的序列也可以彼此正相关,可交换 ≠ 独立。


量化实战

1. 二元正态:对冲比率与压力情景

设个股日收益 \(X\) 与指数日收益 \(Y\) 服从二元正态,\(\sigma_x=2.2\%\),\(\sigma_y=1.2\%\),\(\rho=0.7\)。由例 5d:beta \(=\rho\sigma_x/\sigma_y\approx1.28\),用 beta 份指数对冲后的残差风险为 \(\sigma_x\sqrt{1-\rho^2}\approx1.57\%\);给定"指数单日下跌 3%",个股的条件分布是 \(N(-3.84\%,1.57\%^2)\),条件 99% VaR 约 7.5%。

2. 次序统计量:"最佳回测"有多好看

设 \(N\) 个策略都毫无预测力,每个用 3 年日数据估计年化夏普比率。真实夏普为 0 时,年化夏普估计量近似服从 \(N(0,252/T)\)。\(N\) 个独立策略中最大的那个,CDF 为 \(F(x)^N\)((6.4) 取 \(j=N\)),所以其中位数满足 \(F(x)^N=1/2\)。

3. 贝塔—二项:胜率的后验

60 笔交易赢 37 笔。均匀先验下胜率的后验为 Beta(38, 24),可以直接回答"胜率大于 50% 的后验概率是多少",比单纯的 p 值更直观。

4. Box–Muller

import numpy as np
from scipy import stats
rng = np.random.default_rng(66)

# ---------- 1) 二元正态的条件分布:对冲比率与条件 VaR ----------
mx, my, sx, sy, rho = 0.0005, 0.0003, 0.022, 0.012, 0.7     # X=个股, Y=指数(日收益)
cov = [[sx**2, rho*sx*sy], [rho*sx*sy, sy**2]]
X, Y = rng.multivariate_normal([mx, my], cov, 4_000_000).T
beta = rho * sx / sy                                          # 条件均值斜率 = 最小方差对冲比率
print(f"理论 beta = {beta:.4f}, 回归估计 = {np.polyfit(Y, X, 1)[0]:.4f}")
print(f"对冲后残差 SD: 理论 sx*sqrt(1-rho^2) = {sx*np.sqrt(1-rho**2):.4f}, "
      f"模拟 = {np.std(X - beta*Y):.4f} (未对冲 {sx:.4f})")
y0 = -0.03                                                    # 压力情景:指数单日跌 3%
cm, cs = mx + beta * (y0 - my), sx * np.sqrt(1 - rho**2)
near = np.abs(Y - y0) < 0.0005
print(f"给定指数跌 3%: 个股条件均值 {cm:+.4f} (模拟 {X[near].mean():+.4f}), "
      f"条件 SD {cs:.4f} (模拟 {X[near].std():.4f}), 条件 99% VaR {-(cm - 2.326*cs):.4f}")

# ---------- 2) 次序统计量:N 个无效策略中"最好"的那个 ----------
T = 750                                      # 3 年日数据
sr_sd = np.sqrt(252 / T)                     # 真实夏普为 0 时,年化夏普估计量的近似标准差
def best_sharpe(N, reps=400):                # 直接模拟日收益(真实均值为 0),取 N 个策略中最大的年化夏普
    out = np.empty(reps)
    for r in range(reps):
        R = rng.standard_normal((N, T)) * 0.01
        out[r] = (R.mean(1) / R.std(1, ddof=1)).max() * np.sqrt(252)
    return out
for N in (1, 10, 100, 1000):
    # 最大值的 CDF = F(x)^N((6.4) 取 j=N);中位数解 F(x)^N = 1/2
    med_max = sr_sd * stats.norm.ppf(0.5 ** (1 / N))
    q95_max = sr_sd * stats.norm.ppf(0.95 ** (1 / N))
    sims = best_sharpe(N)
    print(f"N={N:5d}: 最佳年化夏普 中位数 理论 {med_max:.2f} 模拟 {np.median(sims):.2f}; "
          f"95%分位 理论 {q95_max:.2f} 模拟 {np.quantile(sims, 0.95):.2f}")

# ---------- 3) Beta-二项共轭:胜率的后验 ----------
wins, n = 37, 60
post = stats.beta(1 + wins, 1 + n - wins)    # 均匀先验 Beta(1,1) -> Beta(1+k, 1+n-k)
print(f"\n{wins}/{n} 胜: 后验均值 {post.mean():.4f} = (k+1)/(n+2) = {(wins+1)/(n+2):.4f}, "
      f"P(p>0.5 | 数据) = {post.sf(0.5):.4f}, 95% 区间 [{post.ppf(.025):.3f}, {post.ppf(.975):.3f}]")

# ---------- 4) Box-Muller 生成正态随机数 ----------
U1, U2 = rng.random(500_000), rng.random(500_000)
R = np.sqrt(-2 * np.log(U1))
Z1, Z2 = R * np.cos(2 * np.pi * U2), R * np.sin(2 * np.pi * U2)
print(f"Box-Muller: 均值 {Z1.mean():+.4f}, 方差 {Z1.var():.4f}, corr(Z1,Z2) {np.corrcoef(Z1, Z2)[0,1]:+.4f}, "
      f"KS 检验 p 值 {stats.kstest(Z1, 'norm').pvalue:.3f}")

关键输出:

理论 beta = 1.2833, 回归估计 = 1.2844
对冲后残差 SD: 理论 sx*sqrt(1-rho^2) = 0.0157, 模拟 = 0.0157 (未对冲 0.0220)
给定指数跌 3%: 个股条件均值 -0.0384 (模拟 -0.0382), 条件 SD 0.0157 (模拟 0.0158), 条件 99% VaR 0.0749
N=    1: 最佳年化夏普 中位数 理论 0.00 模拟 -0.03; 95%分位 理论 0.95 模拟 0.96
N=   10: 最佳年化夏普 中位数 理论 0.87 模拟 0.84; 95%分位 理论 1.49 模拟 1.42
N=  100: 最佳年化夏普 中位数 理论 1.43 模拟 1.41; 95%分位 理论 1.90 模拟 1.89
N= 1000: 最佳年化夏普 中位数 理论 1.85 模拟 1.85; 95%分位 理论 2.25 模拟 2.27

37/60 胜: 后验均值 0.6129 = (k+1)/(n+2) = 0.6129, P(p>0.5 | 数据) = 0.9639, 95% 区间 [0.490, 0.729]
Box-Muller: 均值 +0.0002, 方差 0.9980, corr(Z1,Z2) +0.0003, KS 检验 p 值 0.929

读法:

  • 回归斜率与理论 beta 一致;对冲把日波动从 2.2% 降到 1.57%,降幅取决于 \(\sqrt{1-\rho^2}\)——\(\rho=0.7\) 时只降了约 29%,这就是"相关性不够高时对冲效果有限"的定量表述。压力情景下的条件均值、条件标准差与模拟一致。
  • **从 100 个毫无能力的策略中挑出的最好一个,3 年回测的年化夏普中位数约 1.4,有 5% 的机会超过 1.9;从 1000 个中挑,中位数约 1.85。**次序统计量公式与直接模拟日收益的结果吻合。这是"回测过拟合"最简洁的数学解释,也是 deflated Sharpe ratio 等校正方法的出发点(第 11 册)。
  • 胜率后验均值 0.613 恰为 Laplace 继承法则 \((k+1)/(n+2)\);"胜率 > 50%" 的后验概率约 96%,但 95% 可信区间 [0.49, 0.73] 仍包含 0.5 附近,提醒我们 60 笔样本的信息量有限。
  • Box–Muller 生成的两列随机数均值约 0、方差约 1、互不相关,KS 检验不拒绝正态。

本章小结

条件分布的定义是"联合分布除以边缘分布",离散和连续情形完全平行;即使条件事件概率为 0,条件密度仍然给出可操作的条件概率。二元正态的条件分布仍是正态:条件均值关于条件值线性(斜率 \(\rho\sigma_x/\sigma_y\),即回归系数和对冲比率),条件方差为 \(\sigma_x^2(1-\rho^2)\) 且与条件值无关;二元正态下不相关等价于独立。连续版 Bayes 公式配合贝塔先验给出胜率的共轭后验。t 分布是正态除以独立卡方的平方根,尾部比正态厚。次序统计量的联合密度为 \(n!\prod f\),第 \(j\) 个次序统计量的 CDF 是一个二项尾概率,最大值的 CDF 为 \(F^n\)——它解释了从大量回测中挑选最优结果的乐观偏差。雅可比公式把单变量变换推广到多元,由此得到 Box–Muller 方法、"伽马之和与比例独立"以及正态样本和与偏差的独立性。可交换性弱于独立同分布,但足以保证边缘同分布,是置换检验的基础。

概念 公式
条件 PMF / 密度 \(p_{X\mid Y}=\frac{p(x,y)}{p_Y(y)}\);\(f_{X\mid Y}=\frac{f(x,y)}{f_Y(y)}\)
泊松给定和 \(X\mid X+Y=n\sim\mathrm{Bin}(n,\frac{\lambda_1}{\lambda_1+\lambda_2})\)
t 分布 \(T=Z/\sqrt{Y/n}\),\(f_T\propto(1+t^2/n)^{-(n+1)/2}\)
二元正态条件分布 \(X\mid Y=y\sim N(\mu_x+\rho\frac{\sigma_x}{\sigma_y}(y-\mu_y),\ \sigma_x^2(1-\rho^2))\)
连续 Bayes \(f_{X\mid N}(x\mid n)=\frac{P\{N=n\mid X=x\}}{P\{N=n\}}f(x)\)
贝塔—二项共轭 Beta(\(a,b\)) + \(n\) 成功 \(m\) 失败 → Beta(\(a+n,b+m\))
次序统计量联合密度 \(n!\,f(x_1)\cdots f(x_n)\),\(x_1<\cdots<x_n\)
第 \(j\) 个次序统计量 \(f=\frac{n!}{(n-j)!(j-1)!}F^{j-1}(1-F)^{n-j}f\);\(F_{X_{(j)}}=\sum_{k\ge j}\binom nkF^k(1-F)^{n-k}\)
最大值 / 最小值 \(F^n\);\(1-(1-F)^n\)
雅可比公式 \(f_{Y}(y)=f_X(x)\lvert J(x)\rvert^{-1}\)
Box–Muller \(\sqrt{-2\log U_1}(\cos2\pi U_2,\sin2\pi U_2)\)
伽马—贝塔 \(X+Y\sim\mathrm{Gamma}(\alpha+\beta,\lambda)\) 与 \(\frac{X}{X+Y}\sim\mathrm{Beta}(\alpha,\beta)\) 独立
可交换 任意重排后联合分布不变 ⇒ 边缘同分布

练习

基础

  1. 两条独立的订单流分别是 Poisson(30) 与 Poisson(10)(每分钟)。某分钟共到达 50 笔,其中来自第一条流的笔数的分布是什么?期望多少? 答案:\(\mathrm{Bin}(50,0.75)\),期望 37.5。
  2. 个股与指数日收益服从二元正态,\(\sigma_x=3\%\),\(\sigma_y=1\%\),\(\rho=0.5\),均值都为 0。求个股的 beta、对冲后的残差标准差,以及给定指数上涨 2% 时个股上涨超过 5% 的条件概率。 答案:beta \(=1.5\);残差 SD \(=3\%\sqrt{0.75}\approx2.6\%\);条件分布 \(N(3\%,2.6\%^2)\),\(P=1-\Phi(0.77)\approx0.22\)。
  3. 10 个独立 \(U(0,1)\) 随机数的最大值的期望是多少? 答案:\(X_{(10)}\sim\) Beta(10,1),期望 \(10/11\)。
  4. 先验 Beta(2,2) 的胜率,观测到 20 笔中 14 笔盈利,后验分布与后验均值是什么? 答案:Beta(16, 8),均值 \(2/3\)。
  5. 证明 \(n\) 个独立 Exp(\(\lambda\)) 的最小值服从 Exp(\(n\lambda\))。(原书理论练习 6.9) 答案:\(P\{\min>t\}=(e^{-\lambda t})^n=e^{-n\lambda t}\)。量化含义:\(n\) 个独立对手方中"第一个违约"的时间强度是各自强度之和。

进阶

  1. 设 \(N=200\) 个毫无预测力的策略各有 2 年日数据(\(T=500\))。用次序统计量公式求最佳策略年化夏普的中位数,并解释为什么要求"样本外"验证。 答案:\(\sqrt{252/500}\,\Phi^{-1}(0.5^{1/200})\approx0.71\times2.70\approx1.92\)。在样本内挑最大值必然有向上偏差,只有独立的样本外数据才能给出无偏的评价。
  2. 设 \(X_1,\dots,X_{250}\) 是 i.i.d. 的日收益,用 (6.4) 写出"样本中第 3 小的收益 \(\le-4\%\)"的概率表达式(设 \(F(-4\%)=0.01\)),并计算数值。这与经验 1% VaR 的稳定性有什么关系? 答案:\(P=\sum_{k\ge3}\binom{250}{k}0.01^k0.99^{250-k}=1-P\{\mathrm{Bin}(250,0.01)\le2\}\approx0.457\)。说明在 250 个样本中,经验 1% 分位数落在真实分位数哪一侧几乎是一半一半,抽样波动很大。
  3. 利用例 7a 的结论说明:若两个策略的日收益是独立同方差的正态变量,那么"两策略等权组合"与"两策略收益差(多空价差)"是独立的。这个结论在非正态情况下还成立吗? 提示:只对正态成立(Bernstein 定理),厚尾时组合与价差可能相依。
  4. 设 \(X,Y\) 独立 Gamma(\(\alpha,\lambda\))、Gamma(\(\beta,\lambda\))。某做市商一天中买单成交量 \(X\)、卖单成交量 \(Y\) 服从这种模型,说明"买单占比 \(X/(X+Y)\)"与"总成交量"独立的含义,并指出它可能在什么市场环境下失效。 提示:由例 7c,占比服从 Beta(\(\alpha,\beta\)) 且与总量独立。现实中大成交量常伴随单边行情,占比与总量往往相关,此时模型失效。
  5. 证明 Pólya 罐中第 2 次抽到红球的概率等于 \(n/(n+m)\),并解释为什么"第一次抽到红球"会使"第二次抽到红球"的条件概率上升。 答案:\(\frac{n}{n+m}\cdot\frac{n+1}{n+m+1}+\frac{m}{n+m}\cdot\frac{n}{n+m+1}=\frac{n}{n+m}\)。\(P(R_2\mid R_1)=\frac{n+1}{n+m+1}>\frac{n}{n+m}\):可交换但正相关。

原书推荐习题:Problems 6.43(泊松—伽马贝叶斯更新)、6.45、6.47–6.48(次序统计量)、6.52–6.56(雅可比与 Box–Muller)、6.60–6.61(可交换性);Theoretical Exercises 6.8(最小值风险率可加)、6.9(指数最小值)、6.16(二项给定和为超几何)、6.21–6.22(泊松—伽马、指数—伽马共轭)、6.28(均匀样本中位数为 Beta)、6.31–6.32(间距与新观测排名)、6.35(正态比值为柯西);Self-Test 6.8(Marshall–Olkin 二元指数,相关违约建模原型)、6.9(接受—拒绝抽样)、6.13(分差正态模型的条件胜率)、6.19(正态随机游走的条件分布,布朗桥的离散版)。


原书对照

本章小节 原书章节 PDF 页码 书内页码
6.4 条件分布:离散情形 6.4 Conditional Distributions: Discrete Case p.261–263 p.248–250
6.5 条件分布:连续情形 6.5 Conditional Distributions: Continuous Case p.263–269 p.250–256
6.6 次序统计量 *6.6 Order Statistics p.269–272 p.256–259
6.7 随机变量函数的联合分布 6.7 Joint Probability Distribution of Functions of Random Variables p.273–279 p.260–266
6.8 可交换随机变量 *6.8 Exchangeable Random Variables p.280–282 p.267–269
小结与习题 Summary, Problems, Theoretical Exercises, Self-Test p.283–292 p.270–279

(书内页码 = PDF 页码 − 13。原书第 6 章自测题的完整解答在附录 B。)