量化交易中文教材

第 07a 章 期望的性质:线性性、示性变量与协方差

本章对应 Ross 原书第 7 章前半部分(7.1–7.4 节,另含 7.9 节的简介)。第 7 章是全书篇幅最大、对量化最有用的一章,本册把它拆成三章:本章讲「和的期望与和的方差」,第 07b 章讲条件期望与预测,第 07c 章讲矩母函数与多元正态。

术语说明:从本章起,常见分布和人名多用英文写法——Poisson(泊松)、Gamma(伽马)、Beta(贝塔)、Cauchy(柯西)、Bernoulli(伯努利)、Markov(马尔可夫),所指与第 01–06b 章完全相同。

学习目标

  1. 熟练使用二元函数的期望公式和期望的线性性,并理解线性性不需要独立这一点为什么强大。
  2. 掌握「示性变量分解」(indicator decomposition):把一个计数类随机变量写成若干 0/1 变量之和来求均值和方差。
  3. 会用 \(E\big[\binom X2\big]=\sum_{i<j}P(A_iA_j)\) 求「发生事件个数」的方差。
  4. 掌握协方差的双线性、和的方差公式、相关系数的取值范围与含义,分清「不相关」与「独立」。
  5. 能把这些工具直接用到组合方差 \(w^\top\Sigma w\)、样本均值标准误、自相关收益的均值方差等量化问题上。

读前导读

这一章在解决什么问题。 你在 CFA 里背过两条公式:组合期望收益 \(E[R_p]=\sum w_iE[R_i]\),组合方差 \(\sigma_p^2=\sum\sum w_iw_j\sigma_{ij}\)。本章讲的就是这两条公式为什么成立、在什么条件下成立。结论很干脆:第一条(期望的线性性)任何情况下都成立,不需要资产独立;第二条(和的方差)必须把所有两两协方差都算进去,一旦漏掉,风险就会被系统性低估。

本章另一条主线是「示性变量」:把「有多少只股票跌停」「有多少个因子假阳性」这类计数,拆成一串 0/1 变量相加。均值就是概率相加,方差只需要两两同时发生的概率。这套技巧在风险管理里很实用,比如估算一个信用组合里违约笔数的均值和方差(违约之间有相关性也照样能算)。

最后一部分讲协方差和相关系数。CFA 里你知道 \(-1\le\rho\le1\),本章给出两行证明,并强调「不相关」不等于「独立」。这一点对因子研究很重要:IC 为 0 的因子仍可能有非线性预测力。

需要先想起来的数学。

  • 求和记号与双重求和。 \(\sum_{i<j}a_{ij}\) 表示对所有满足 \(i<j\) 的下标对求和,\(n\) 个对象共有 \(\binom n2=n(n-1)/2\) 项。\(\sum_i\sum_j a_{ij}\) 是对全部 \(n^2\) 个格子求和,就像把协方差矩阵的每个元素加起来。例:\(n=3\) 时 \(\sum_{i<j}\) 有 (1,2)、(1,3)、(2,3) 三项。见 第 00 册第 07 章 概率中的分析工具。
  • 二重积分与交换积分次序。 \(\iint g(x,y)f(x,y)\,dx\,dy\) 是先对 \(x\) 积分、再对 \(y\) 积分(或反过来),被积函数非负时两种顺序结果一样。可以理解为二维表格「先按行加总再加总各行」和「先按列加总再加总各列」结果相同。见 第 00 册第 05 章 多元微积分与优化。
  • 调和级数与对数。 \(1+\frac12+\cdots+\frac1N\approx\ln N+0.577\)。例:\(N=6\) 时左边约为 2.45。集券问题和快速排序的 \(N\ln N\) 就来自这里。见 第 00 册第 04 章 级数与收敛。
  • 矩阵二次型 \(w^\top\Sigma w\)。 \(w\) 是权重列向量,\(\Sigma\) 是协方差矩阵,\(w^\top\Sigma w=\sum_i\sum_jw_iw_j\Sigma_{ij}\),算出来是一个数,也就是组合方差。见 第 00 册第 06 章 线性代数速成。

怎么读这一章。 核心必读是 7.2.2(线性性)、7.2.3 的前几个例子(2e–2h)、7.3 开头的「事件对数」技巧,以及整个 7.4 节和「量化实战」。7.2.3 后半段的游程、随机游走、快速排序可以挑一两个看。7.2.4 的尾和公式值得记住结论。7.2.5(概率方法、最大–最小恒等式)、例 3d–3f 和 7.9 节第一次可以跳过。建议顺序:7.2.2 → 7.2.3 → 7.4 → 量化实战 → 回头看 7.3。


7.1 引言:期望是加权平均

回顾(第 04a、05 章):离散型 \(E[X]=\sum_x x\,p(x)\),连续型 \(E[X]=\int_{-\infty}^{\infty}x f(x)\,dx\)。期望是 \(X\) 各取值按概率的加权平均,因此有一个朴素但常用的事实:

若 \(P\{a\le X\le b\}=1\),则 \(a\le E[X]\le b\)。

证明(离散情形):\(p(x)\) 在 \([a,b]\) 之外为 0,于是 \(E[X]=\sum_{x:p(x)>0}x\,p(x)\ge\sum a\,p(x)=a\),上界同理。

7.2 随机变量之和的期望

7.2.1 二元函数的期望公式

命题 2.1 若 \((X,Y)\) 有联合概率质量函数 \(p(x,y)\),则

\[E[g(X,Y)]=\sum_y\sum_x g(x,y)\,p(x,y);\]
若有联合密度 \(f(x,y)\),则
\[E[g(X,Y)]=\iint g(x,y)\,f(x,y)\,dx\,dy.\]

证明思路(连续、\(g\ge0\)):利用尾部积分公式 \(E[Z]=\int_0^\infty P\{Z>t\}\,dt\)(第 05 章 5.2 节),写 \(P\{g(X,Y)>t\}=\iint_{g(x,y)>t}f\,dy\,dx\),交换积分次序得 \(\iint\int_0^{g(x,y)}dt\,f\,dy\,dx=\iint g f\)。一般 \(g\) 拆成正部减负部。

白话解释:命题 2.1 的意思是,要算 \(g(X,Y)\) 的期望,不必先求出 \(Z=g(X,Y)\) 自己的分布,直接拿联合分布当权重,把 \(g\) 在每个点的值加权平均即可。金融里你天天这么做:算一个组合的期望收益时,你不会先求组合收益的分布,而是在各种情景下算出组合收益,再按情景概率加权。 证明里那一步的关键是:\(\int_0^{g(x,y)}dt=g(x,y)\)(对 1 从 0 积到 \(g\) 就是区间长度)。所以先对 \(t\) 积分就把尾部积分公式还原成了 \(g\) 本身。「正部减负部」是说任何 \(g\) 都能写成 \(g^+-g^-\),两部分各自非负,分别套用再相减。

例 2a(救护车距离) 事故点 \(X\) 与救护车位置 \(Y\) 独立、都在 \((0,L)\) 上均匀,求 \(E|X-Y|\)。先算 \(\int_0^L|x-y|\,dy=\frac{L^2}{2}+x^2-xL\),再对 \(x\) 积分并除以 \(L^2\):

\[E|X-Y|=\frac{L}{3}.\]

7.2.2 期望的线性性

取 \(g(x,y)=x+y\),得到

\[E[X+Y]=E[X]+E[Y],\qquad E\Big[\sum_{i=1}^n X_i\Big]=\sum_{i=1}^n E[X_i].\]

关键:这里完全不要求独立。(第 04a 章 4.6 节已在可数样本空间下证明过这一点,并介绍了示性变量法,见那里的例 9d、9e;这里借助二元函数的期望公式把它推广到一般的联合分布,下面的示性变量例子可与那里对照阅读。) 只要各期望有限即可。这一点让很多看似复杂的计算变得简单:把一个难以直接求分布的随机变量拆成若干容易求期望的部分之和,分别求期望再相加,各部分之间怎样相关都无所谓。

金融直觉:组合期望收益 \(E[R_p]=\sum w_iE[R_i]\) 不管资产之间相关性多高都成立;你把两只高度相关的银行股放在一起,期望收益照样是加权平均。相关性只影响方差(7.4 节),不影响期望。这就是为什么均值–方差框架里「均值」那一侧总是线性的、简单的,而「方差」那一侧需要整个协方差矩阵。

几个直接推论:

  • 单调性(例 2b):若每个样本点上都有 \(X\ge Y\),则 \(E[X]\ge E[Y]\)(对 \(X-Y\ge0\) 用上面的事实)。
  • 样本均值无偏(例 2c):\(X_1,\dots,X_n\) 独立同分布(i.i.d.),均值 \(\mu\),样本均值(sample mean)\(\bar X=\frac1n\sum X_i\) 满足 \(E[\bar X]=\mu\)。
  • Boole 不等式(例 2d):令 \(X_i=I(A_i)\),\(X=\sum X_i\) 是发生的事件数,\(Y=I(X\ge1)\)。因 \(X\ge Y\),得
    \[P\Big(\bigcup_{i=1}^nA_i\Big)\le\sum_{i=1}^nP(A_i).\]
    这正是多重检验里 Bonferroni 校正的出处:同时检验 \(n\) 个因子、每个用显著性水平 \(\alpha/n\),则「至少一个假阳性」的概率不超过 \(\alpha\)。

7.2.3 示性变量分解:计数问题的万能钥匙

示性变量(indicator)\(I_A\) 在 \(A\) 发生时取 1、否则取 0,\(E[I_A]=P(A)\)。把计数写成示性变量之和,期望就是概率之和。

例 2e(二项均值) \(X=\sum_{i=1}^nX_i\),\(X_i\) 是第 \(i\) 次试验成功的示性变量,\(E[X]=np\)。

例 2f(负二项均值) 凑齐 \(r\) 次成功所需的试验数 \(X=X_1+\cdots+X_r\),\(X_i\) 是第 \(i-1\) 次成功之后到第 \(i\) 次成功所需的附加试验数,各为参数 \(p\) 的几何变量,\(E[X_i]=1/p\),所以 \(E[X]=r/p\)。

例 2g(超几何均值,两种分解) \(N\) 个球中 \(m\) 个白球,随机取 \(n\) 个,\(X\) 为白球数。

  • 按白球分解:\(X=\sum_{i=1}^mX_i\),\(X_i\) 表示第 \(i\) 个白球被选中,\(P=\binom{N-1}{n-1}/\binom Nn=n/N\),\(E[X]=mn/N\)。
  • 按抽取次序分解:\(X=\sum_{i=1}^nY_i\),\(Y_i\) 表示第 \(i\) 次取到白球,\(E[Y_i]=m/N\),同样得 \(nm/N\)。

同一个随机变量可以有多种分解方式,挑最好算的那一种。

例 2h(配对问题) \(N\) 人随机拿帽子,\(X_i\) 表示第 \(i\) 人拿到自己的帽子,\(E[X_i]=1/N\),故 \(E[X]=1\)——与 \(N\) 无关。

例 2i(集券问题,coupon collecting) \(N\) 种券等可能出现,集齐所需张数 \(X\)。令 \(X_i\) 为已集到 \(i\) 种之后得到一种新券所需的附加张数,它是参数 \((N-i)/N\) 的几何变量:

\[E[X]=\sum_{i=0}^{N-1}\frac{N}{N-i}=N\Big(1+\frac12+\cdots+\frac1N\Big)\approx N\ln N.\]

例 2j(猎鸭) 10 名猎人各自独立随机挑 10 只鸭中的一只射击,命中率 \(p\)。某只鸭被某猎人击中的概率是 \(p/10\),所以它逃脱的概率为 \((1-p/10)^{10}\),期望逃脱数为 \(10(1-p/10)^{10}\)。

例 2k(游程数,runs) \(n\) 个 1 与 \(m\) 个 0 随机排列,\(R(1)\) 为 1 的游程数。令 \(I_i\) 表示从第 \(i\) 位开始一个 1 的游程。\(E[I_1]=\frac{n}{n+m}\);对 \(i\ge2\),需要第 \(i-1\) 位为 0、第 \(i\) 位为 1,概率 \(\frac{m}{n+m}\cdot\frac{n}{n+m-1}\)。共 \(n+m-1\) 个这样的位置,所以

\[E[R(1)]=\frac{n}{n+m}+\frac{nm}{n+m},\qquad E[R(0)+R(1)]=1+\frac{2nm}{n+m}.\]
(例:\(n=6,m=4\) 的序列 1110110010 有 3 个 1 游程。)游程检验(runs test)正是用总游程数偏离这个期望的程度来检验序列的随机性,可以用于检验收益涨跌序列是否有聚集。

例 2l(平面随机游走与 \(\sqrt n\) 标度) 每步长度 1,方向角 \(\theta_i\sim U(0,2\pi)\) 独立。令 \(X_i=\cos\theta_i\)、\(Y_i=\sin\theta_i\),终点到原点距离平方

\[D^2=\Big(\sum X_i\Big)^2+\Big(\sum Y_i\Big)^2=n+\sum_{i\ne j}(\cos\theta_i\cos\theta_j+\sin\theta_i\sin\theta_j).\]
由于 \(E\cos\theta=E\sin\theta=0\) 且各步独立,交叉项期望为 0,\(E[D^2]=n\)。\(n\) 步后的典型距离是 \(\sqrt n\)——这就是价格随机游走里「波动随时间平方根增长」的原型。

例 2m(快速排序的平均比较次数) 快速排序(quick-sort)随机选一个枢轴(pivot),其余元素与之比较后分成左右两组递归处理。把值按大小重新命名为 \(1,\dots,n\),令 \(I(i,j)=1\) 表示 \(i\) 与 \(j\) 被直接比较过。关键观察:\(\{i,i+1,\dots,j\}\) 一直在同一组里,直到其中某个值首次被选为枢轴;若这个枢轴是 \(i\) 或 \(j\),二者被比较,否则被分到两边、永不比较。该枢轴在这 \(j-i+1\) 个值中等可能,所以

\[P\{i,j\text{ 被比较}\}=\frac{2}{j-i+1},\qquad E[X]=\sum_{i=1}^{n-1}\sum_{j=i+1}^n\frac{2}{j-i+1}\approx 2n\ln n.\]
(算法细节见第 09 册。)

例 2n(用期望证明容斥公式) \(1-\prod_{i=1}^n(1-I_{A_i})=I(\cup A_i)\),展开后取期望,利用 \(E[I_{A_{i_1}}\cdots I_{A_{i_k}}]=P(A_{i_1}\cdots A_{i_k})\),即得容斥公式(inclusion–exclusion)

\[P\Big(\bigcup A_i\Big)=\sum_iP(A_i)-\sum_{i<j}P(A_iA_j)+\cdots+(-1)^{n+1}P(A_1\cdots A_n).\]

7.2.4 无穷和与尾和公式

\(E[\sum_{i=1}^\infty X_i]=\sum_i E[X_i]\) 并不总成立(它等价于交换期望与极限)。两种常用的成立条件:所有 \(X_i\ge0\);或 \(\sum_iE|X_i|<\infty\)。

例 2o(尾和公式) \(X\) 取非负整数,\(X_i=I(X\ge i)\),则 \(X=\sum_{i\ge1}X_i\),由非负性

\[E[X]=\sum_{i=1}^\infty P\{X\ge i\}.\]

推导拆解:为什么 \(X=\sum_{i\ge1}I(X\ge i)\)?举例:若 \(X=3\),则 \(I(X\ge1)=I(X\ge2)=I(X\ge3)=1\),\(i\ge4\) 的项都是 0,加起来正好是 3。也就是说,「\(X\) 等于几」就等于「它跨过了几道门槛」。每项都非负,所以可以对无穷和逐项取期望(这就是上面说的第一个成立条件),而 \(E[I(X\ge i)]=P\{X\ge i\}\)。 金融上,违约前存活的整期数 \(X\) 的期望,等于各期「仍存活」概率之和,这和信用分析里用生存概率加总求期望存续期是同一个结构。

例 2p(有序表的最优排列) \(n\) 个元素存放在有序列表中,每次请求元素 \(i\) 的概率为 \(P(i)\),\(P(1)\ge\cdots\ge P(n)\)。对任一排列 \(i_1,\dots,i_n\),所需查找位置 \(X\) 满足 \(P\{X\ge k\}=\sum_{j=k}^nP(i_j)\ge\sum_{j=k}^nP(j)\),用尾和公式求和即知:按请求概率降序排列使平均查找位置最小。(行情系统里按访问频率排列缓存、按成交活跃度排列合约表,用的就是这个原理。)

7.2.5 概率方法与最大–最小恒等式(选读)

概率方法(probabilistic method):要证明有限集 \(A\) 上存在使 \(f(s)\) 很大的元素,只需在 \(A\) 上随机取一个元素 \(S\) 并算出 \(E[f(S)]\):最大值不小于期望,若 \(f(S)\) 不是常数则最大值严格大于期望。

  • 例 2q(锦标赛中的哈密顿路径) \(n\) 人循环赛,排列 \(i_1,\dots,i_n\) 若 \(i_1\) 胜 \(i_2\)、\(i_2\) 胜 \(i_3\)……则称为哈密顿路径。让每场比赛独立、各方胜率 1/2,任一排列成为哈密顿路径的概率为 \((1/2)^{n-1}\),期望条数 \(n!/2^{n-1}\),所以存在一种赛果使哈密顿路径数超过 \(n!/2^{n-1}\)。
  • 例 2r(花栗鼠) 52 棵树围成一圈,住着 15 只花栗鼠。随机选一棵树及其顺时针后 6 棵为「邻域」,每只花栗鼠落入邻域的概率 \(7/52\),期望 \(105/52>2\),所以存在连续 7 棵树至少住 3 只。

最大–最小恒等式(命题 2.2) 对任意实数 \(x_1,\dots,x_n\),

\[\max_i x_i=\sum_ix_i-\sum_{i<j}\min(x_i,x_j)+\sum_{i<j<k}\min(x_i,x_j,x_k)-\cdots+(-1)^{n+1}\min(x_1,\dots,x_n).\]
概率证明:设 \(x_i\in[0,1]\),取 \(U\sim U(0,1)\)、\(A_i=\{U<x_i\}\),则 \(P(\cup A_i)=\max x_i\),交事件的概率是相应最小值,代入容斥公式即得;一般情况通过平移和缩放化归。取期望得
\[E[\max_iX_i]=\sum_iE[X_i]-\sum_{i<j}E[\min(X_i,X_j)]+\cdots.\]

例 2s(不等概率集券) 类型 \(i\) 的概率为 \(p_i\),\(X_i\) 为首次得到类型 \(i\) 所需张数(几何\((p_i)\)),集齐所需 \(X=\max_iX_i\),而 \(\min(X_i,X_j)\) 是几何\((p_i+p_j)\)。于是

\[E[X]=\sum_i\frac1{p_i}-\sum_{i<j}\frac1{p_i+p_j}+\cdots+(-1)^{n+1}\frac1{p_1+\cdots+p_n}=\int_0^\infty\Big(1-\prod_{i=1}^n(1-e^{-p_ix})\Big)dx.\]

7.3 发生事件个数的矩

设 \(X\) 为事件 \(A_1,\dots,A_n\) 中发生的个数,\(X=\sum I_i\),\(E[X]=\sum P(A_i)\)。求方差需要 \(E[X^2]\),技巧是数「发生的事件对数」:

\[\binom X2=\sum_{i<j}I_iI_j\quad\Longrightarrow\quad E\Big[\binom X2\Big]=\sum_{i<j}P(A_iA_j),\]
即 \(E[X^2]-E[X]=2\sum_{i<j}P(A_iA_j)\)。更一般地,阶乘矩(factorial moment)
\[E[X(X-1)\cdots(X-k+1)]=k!\sum_{i_1<\cdots<i_k}P(A_{i_1}\cdots A_{i_k}).\]

要点:求方差只需要知道两两交事件的概率。

推导拆解:为什么 \(\binom X2=\sum_{i<j}I_iI_j\)?右边每一项 \(I_iI_j\) 只有在 \(A_i\)、\(A_j\) 都发生时才等于 1,所以右边数的是「同时发生的事件对」有多少个。若一共有 \(X\) 个事件发生,从中挑两个的方法数就是 \(\binom X2=X(X-1)/2\)。两边数的是同一件事。 接下来三步:(1)两边取期望,右边用线性性,\(E[I_iI_j]=P(A_iA_j)\);(2)\(\binom X2=\frac{X^2-X}2\),所以 \(E[X^2]=2\sum_{i<j}P(A_iA_j)+E[X]\);(3)\(\mathrm{Var}(X)=E[X^2]-(E[X])^2\)。 金融例子:信用组合里 \(n\) 笔贷款,\(A_i\) 为第 \(i\) 笔违约。要算违约笔数的方差,你不需要知道全部违约的联合分布,只需要每笔的违约概率 \(P(A_i)\) 和每两笔的联合违约概率 \(P(A_iA_j)\)。联合违约概率越高(违约相关性越强),方差越大,尾部越厚。

例 3a(二项) \(P(A_iA_j)=p^2\),\(E[X(X-1)]=n(n-1)p^2\),\(\mathrm{Var}(X)=n(n-1)p^2+np-(np)^2=np(1-p)\)。

例 3b(超几何) \(P(A_i)=\frac mN\),\(P(A_iA_j)=\frac mN\frac{m-1}{N-1}\),

\[\mathrm{Var}(X)=\frac{mn}{N}\Big[\frac{(n-1)(m-1)}{N-1}+1-\frac{mn}{N}\Big],\]
化简后即 \(n\frac mN\big(1-\frac mN\big)\frac{N-n}{N-1}\)。

例 3c(配对问题) \(P(A_iA_j)=\frac1{N(N-1)}\),\(E[X(X-1)]=1\),\(\mathrm{Var}(X)=1\);事实上对 \(k\le N\) 所有阶乘矩都等于 1,与 Poisson(1) 一致——配对数近似服从 Poisson(1)。

例 3d(前 \(n\) 张券中出现的种类数) 类型 \(j\) 概率 \(p_j\),\(Y\) 为已出现的种类数。令 \(A_i\) 为类型 \(i\) 未出现,\(P(A_i)=(1-p_i)^n\),\(P(A_iA_j)=(1-p_i-p_j)^n\),得

\[E[Y]=N-\sum_i(1-p_i)^n,\quad \mathrm{Var}(Y)=2\sum_{i<j}(1-p_i-p_j)^n+\sum_i(1-p_i)^n-\Big(\sum_i(1-p_i)^n\Big)^2.\]

例 3e(负超几何分布,negative hypergeometric) 瓮中 \(n\) 个特殊球、\(m\) 个普通球,逐个无放回取出,\(Y\) 为取到第 \(r\) 个特殊球所需次数。不用分布律:对每个普通球 \(o_i\),令 \(A_i\) 为它在第 \(r\) 个特殊球之前被取出。只看 \(o_i\) 与 \(n\) 个特殊球这 \(n+1\) 个球,\(o_i\) 在其中的位置均匀,落在前 \(r\) 位的概率为 \(r/(n+1)\),所以

\[E[Y]=r+\frac{mr}{n+1}=\frac{r(n+m+1)}{n+1}.\]
例:洗好的牌翻到第一张黑桃,期望翻 \(1+39/14\approx3.786\) 张;翻到第一张 A,期望 \(1+48/5=10.6\) 张。同理可得
\[\mathrm{Var}(Y)=\frac{mr(n+1-r)(n+m+1)}{(n+1)^2(n+2)}.\]

例 3f(集券问题中的「单张」类型数) 等概率 \(n\) 种券、收集到集齐为止,恰好只收到一张的类型数 \(X\) 满足 \(E[X]=\sum_{i=1}^n\frac1i\)(第 \(i\) 个被收集到的类型成为单张,当且仅当它在那时剩下的 \(n-i+1\) 种里「最后被再次收集」)。方差推导见原书。

7.4 协方差、和的方差与相关系数

7.4.1 协方差

命题 4.1 \(X,Y\) 独立,则对任意函数 \(g,h\),\(E[g(X)h(Y)]=E[g(X)]\,E[h(Y)]\)(联合密度分解为乘积,双重积分分离)。

定义 协方差(covariance)

\[\mathrm{Cov}(X,Y)=E\big[(X-E X)(Y-E Y)\big]=E[XY]-E[X]E[Y].\]

独立推出协方差为 0,反之不成立。反例:\(X\) 等概率取 \(0,1,-1\),\(Y=I(X=0)\)。\(XY\equiv0\) 且 \(E X=0\),故 \(\mathrm{Cov}=0\),但 \(Y\) 完全由 \(X\) 决定。

命题 4.2(协方差的性质)

  1. \(\mathrm{Cov}(X,Y)=\mathrm{Cov}(Y,X)\);
  2. \(\mathrm{Cov}(X,X)=\mathrm{Var}(X)\);
  3. \(\mathrm{Cov}(aX,Y)=a\,\mathrm{Cov}(X,Y)\);
  4. 双线性:\(\displaystyle\mathrm{Cov}\Big(\sum_{i=1}^nX_i,\sum_{j=1}^mY_j\Big)=\sum_{i=1}^n\sum_{j=1}^m\mathrm{Cov}(X_i,Y_j)\)。

(4)的证明:中心化后两个和相乘,展开成 \(nm\) 项,再用期望的线性性。

推导拆解:先验证 \(E[(X-EX)(Y-EY)]=E[XY]-E[X]E[Y]\)。展开括号得 \(XY-X\,EY-Y\,EX+EX\,EY\),逐项取期望(\(EX\)、\(EY\) 是常数,可以提出来):\(E[XY]-EX\,EY-EY\,EX+EX\,EY=E[XY]-EX\,EY\)。 双线性的证明:记 \(\mu_i=E X_i\)、\(\nu_j=E Y_j\),则 \(\sum X_i-E\sum X_i=\sum(X_i-\mu_i)\),同理处理 \(Y\)。两个和相乘

\[\Big(\sum_i(X_i-\mu_i)\Big)\Big(\sum_j(Y_j-\nu_j)\Big)=\sum_i\sum_j(X_i-\mu_i)(Y_j-\nu_j),\]
这和 \((a+b)(c+d)=ac+ad+bc+bd\) 是同一回事。最后对每一项取期望,就是 \(\mathrm{Cov}(X_i,Y_j)\)。 白话:协方差对每个参数都像乘法一样「可以拆开、常数可以提出来」。这就是为什么组合与组合之间的协方差可以写成 \(w^\top\Sigma v\)。

7.4.2 和的方差

在双线性中令 \(Y_j=X_j\):

\[\boxed{\ \mathrm{Var}\Big(\sum_{i=1}^nX_i\Big)=\sum_{i=1}^n\mathrm{Var}(X_i)+2\sum_{i<j}\mathrm{Cov}(X_i,X_j)\ }\tag{4.1}\]
两两独立(pairwise independent)时化为 \(\sum\mathrm{Var}(X_i)\)。带权重的版本 \(\mathrm{Var}(\sum w_iX_i)=\sum_i\sum_jw_iw_j\mathrm{Cov}(X_i,X_j)=w^\top\Sigma w\),就是组合方差公式。

例 4a(样本均值的方差与样本方差的无偏性) i.i.d.,均值 \(\mu\)、方差 \(\sigma^2\)。

(a) \(\mathrm{Var}(\bar X)=\frac{1}{n^2}\sum\mathrm{Var}(X_i)=\sigma^2/n\)。

(b) 样本方差(sample variance)\(S^2=\frac{1}{n-1}\sum(X_i-\bar X)^2\)。利用恒等式

\[(n-1)S^2=\sum_{i=1}^n(X_i-\mu)^2-n(\bar X-\mu)^2,\]
取期望得 \((n-1)E[S^2]=n\sigma^2-n\cdot\frac{\sigma^2}{n}=(n-1)\sigma^2\),所以 \(E[S^2]=\sigma^2\)——这就是分母取 \(n-1\) 的原因:用 \(\bar X\) 代替 \(\mu\) 损失了一个自由度。

推导拆解:那个恒等式是怎么来的?把 \(X_i-\bar X\) 写成 \((X_i-\mu)-(\bar X-\mu)\),平方后求和:

\[\sum(X_i-\bar X)^2=\sum(X_i-\mu)^2-2(\bar X-\mu)\sum(X_i-\mu)+n(\bar X-\mu)^2.\]
中间项里 \(\sum(X_i-\mu)=n(\bar X-\mu)\),所以中间项等于 \(-2n(\bar X-\mu)^2\),与最后一项合并得 \(-n(\bar X-\mu)^2\)。 取期望时用到两件事:\(E(X_i-\mu)^2=\sigma^2\)(共 \(n\) 项),\(E(\bar X-\mu)^2=\mathrm{Var}(\bar X)=\sigma^2/n\)(就是 (a))。 白话:样本点离自己的均值 \(\bar X\) 总比离真实均值 \(\mu\) 更近(\(\bar X\) 正是让平方和最小的那个点),所以用 \(n\) 做分母会系统性低估方差,除以 \(n-1\) 恰好补回来。你在 CFA 里背过「样本方差除以 \(n-1\)」,这里就是原因。

例 4b(二项方差) \(X=\sum X_i\),独立 Bernoulli,\(X_i^2=X_i\),\(\mathrm{Var}(X_i)=p-p^2\),\(\mathrm{Var}(X)=np(1-p)\)。

例 4c(有限总体抽样) \(N\) 人各有数值 \(v_i\),等可能抽取 \(n\) 人,\(S\) 为样本值之和。令 \(I_i\) 表示第 \(i\) 人入样,\(S=\sum v_iI_i\)。 \(E[I_i]=\frac nN\),\(\mathrm{Cov}(I_i,I_j)=\frac nN\frac{n-1}{N-1}-\frac{n^2}{N^2}=-\frac{n(N-n)}{N^2(N-1)}\)。记 \(\bar v=\frac1N\sum v_i\),

\[E[S]=n\bar v,\qquad\mathrm{Var}(S)=\frac{n(N-n)}{N-1}\Big(\frac{\sum v_i^2}{N}-\bar v^2\Big).\]
特例:\(Np\) 人取值 1、其余取值 0(民调),\(\mathrm{Var}(S/n)=\frac{N-n}{n(N-1)}p(1-p)\)。因子 \(\frac{N-n}{N-1}\) 称为有限总体修正(finite population correction):抽样比例越大,估计越准;全部抽完方差为 0。在量化中,从一个固定股票池(如 300 只成分股)中随机抽样构造组合时,组合平均收益的波动就要乘这个修正。

例 4d(示性变量的协方差) \(\mathrm{Cov}(I_A,I_B)=P(AB)-P(A)P(B)=P(B)\big[P(A|B)-P(A)\big]\)。正相关意味着「\(B\) 发生使 \(A\) 更可能」。

例 4e i.i.d. 时 \(\mathrm{Cov}(X_i-\bar X,\bar X)=\frac{\sigma^2}{n}-\frac{\sigma^2}{n}=0\):样本均值与每个偏差都不相关。一般分布下它们并不独立;但正态样本下 \(\bar X\) 与整个偏差向量独立,从而与 \(S^2\) 独立(第 07c 章证明)。

例 4f(多项分布的协方差) \(m\) 次独立试验、\(r\) 种结果,\(N_i\) 为结果 \(i\) 出现的次数,\(N_i=\sum_kI_i(k)\)。不同试验之间独立,协方差为 0;同一次试验里 \(I_i(\ell)I_j(\ell)=0\),协方差为 \(-p_ip_j\)。故

\[\mathrm{Cov}(N_i,N_j)=-mp_ip_j\quad(i\ne j).\]
总数固定时「一个多,另一个就少」。权重之和为 1 的组合、行业占比之和为 1 的成分数据,都有这种结构性负相关。

7.4.3 相关系数

\[\rho(X,Y)=\frac{\mathrm{Cov}(X,Y)}{\sqrt{\mathrm{Var}(X)\mathrm{Var}(Y)}},\qquad -1\le\rho\le1.\]

证明:\(0\le\mathrm{Var}\big(\frac{X}{\sigma_x}+\frac{Y}{\sigma_y}\big)=2(1+\rho)\),\(0\le\mathrm{Var}\big(\frac{X}{\sigma_x}-\frac{Y}{\sigma_y}\big)=2(1-\rho)\)。方差为 0 意味着几乎必然为常数(第 08 章命题 2.3),所以 \(\rho=1\) 当且仅当 \(Y=a+bX\)、\(b>0\);\(\rho=-1\) 对应 \(b<0\)。

推导拆解:用和的方差公式 (4.1) 计算 \(\mathrm{Var}\big(\frac{X}{\sigma_x}+\frac{Y}{\sigma_y}\big)=\frac{\sigma_x^2}{\sigma_x^2}+\frac{\sigma_y^2}{\sigma_y^2}+2\frac{\mathrm{Cov}(X,Y)}{\sigma_x\sigma_y}=1+1+2\rho\)。方差不可能为负,所以 \(1+\rho\ge0\),即 \(\rho\ge-1\);减号版本给出 \(\rho\le1\)。 「几乎必然」(almost surely)的意思是「以概率 1 成立」,允许在概率为 0 的情形下例外,读者可以先当作「总是」理解。 金融直觉:\(\rho=-1\) 时,\(\frac{X}{\sigma_x}+\frac{Y}{\sigma_y}\) 方差为 0,也就是按波动率倒数配比的两资产组合完全无风险。这就是「完美对冲」:CFA 里两资产 \(\rho=-1\) 时能构造零方差组合,用的正是这一步。

\(\rho\) 只刻画线性关系的强弱。\(\rho=0\) 称为不相关(uncorrelated)。上面 \(Y=I(X=0)\) 的例子说明,变量之间可以有完全确定的非线性关系而相关系数为 0。量化里常用的 IC(信息系数)就是因子值与下期收益的相关系数(或其秩版本),它同样只抓线性(或单调)关系;非线性预测能力需要用第 09 章的互信息等工具补充。

7.9 期望的一般定义(简介)

存在既非离散也非连续的随机变量:\(X\sim\) Bernoulli(1/2),\(Y\sim U[0,1]\) 独立,\(W=1\)(若 \(X=1\))否则 \(W=Y\)。\(W\) 在 1 处有 1/2 的概率质量,其余部分连续分布。

为统一处理,原书引入 Stieltjes 积分:

\[\int_a^b g(x)\,dF(x)=\lim\sum_{i}g(x_i)\big[F(x_i)-F(x_{i-1})\big],\qquad E[X]=\int_{-\infty}^\infty x\,dF(x).\]
离散时化为 \(\sum xp(x)\),连续时化为 \(\int xf(x)dx\)。这主要有理论价值;量化里遇到的「混合型」分布(比如涨跌停导致收益在边界有点质量、期权到期收益在 0 处有点质量)都可以这样统一写期望。更严格的测度论处理超出本套教材范围,可参考 Billingsley《Probability and Measure》等测度论教材。


量化实战

1. 组合方差与风险模型。 组合收益 \(R_p=\sum_iw_iR_i\),由式 (4.1)

\[\mathrm{Var}(R_p)=\sum_i\sum_jw_iw_j\mathrm{Cov}(R_i,R_j)=w^\top\Sigma w.\]
这是均值–方差优化(第 04 册)和因子风险模型 \(\Sigma=BFB^\top+D\)(第 06 册、第 11 册)的代数基础。分散化的收益来自协方差项:当资产两两相关系数为 \(\rho\) 时,等权组合方差 \(\to\rho\sigma^2\)(\(n\to\infty\)),相关性决定了分散化的下限。

2. 夏普比率与 alpha 的标准误。 回测时用 \(\bar X\) 估计日均超额收益,其标准误是 \(\sigma/\sqrt n\)——前提是各日收益不相关。若收益有自相关(如流动性差的资产、平滑后的净值、重叠持有期收益),按式 (4.1)

\[\mathrm{Var}(\bar X)=\frac{\sigma^2}{n}\Big[1+2\sum_{k=1}^{n-1}\Big(1-\frac kn\Big)\rho_k\Big],\]
正自相关会让 \(\sigma/\sqrt n\) 低估真实误差,t 统计量虚高。这正是 Newey–West 标准误(第 05 册)的直觉来源。

推导拆解:从 (4.1) 出发,\(\mathrm{Var}(\bar X)=\frac1{n^2}\big[\sum_i\mathrm{Var}(X_i)+2\sum_{i<j}\mathrm{Cov}(X_i,X_j)\big]\)。平稳序列里 \(\mathrm{Cov}(X_i,X_j)=\rho_{j-i}\sigma^2\) 只取决于间隔 \(k=j-i\)。间隔为 \(k\) 的 \((i,j)\) 对一共有 \(n-k\) 个(\(i=1,\dots,n-k\))。于是

\[\mathrm{Var}(\bar X)=\frac{1}{n^2}\Big[n\sigma^2+2\sum_{k=1}^{n-1}(n-k)\rho_k\sigma^2\Big],\]
提出 \(\frac{\sigma^2}{n}\) 即得原式。方括号里 \(1+2\sum(\cdots)\) 就是「方差膨胀因子」;\(\rho_k\) 全为 0 时它等于 1,回到 \(\sigma^2/n\)。 金融上,私募或不动产基金的净值经过平滑,月收益正自相关很强,用天真公式算出的 Sharpe 比率显著性会被严重高估。

3. 示性变量与多重检验。 Boole 不等式 → Bonferroni 校正;例 2h 一类「期望命中数」的计算可用来估计「在 \(n\) 个随机因子中,凭运气就能显著的期望个数」\(=n\alpha\)。

下面的代码验证两件事:组合方差公式中协方差项的分量,以及自相关收益下天真标准误的低估程度。

import numpy as np

rng = np.random.default_rng(42)

# ---------- 1. 组合方差 = w' Σ w(协方差双线性)----------
n_assets, T = 4, 200_000
vol = np.array([0.20, 0.25, 0.15, 0.30]) / np.sqrt(252)      # 日波动
corr = np.array([[1.0, 0.6, 0.3, 0.2],
                 [0.6, 1.0, 0.4, 0.3],
                 [0.3, 0.4, 1.0, 0.1],
                 [0.2, 0.3, 0.1, 1.0]])
Sigma = np.outer(vol, vol) * corr
w = np.array([0.4, 0.3, 0.2, 0.1])
R = rng.multivariate_normal(np.zeros(n_assets), Sigma, size=T)
port = R @ w
var_formula = w @ Sigma @ w
var_naive = np.sum(w**2 * vol**2)                            # 忽略协方差项
print(f"组合日方差  公式 w'Σw = {var_formula:.3e}")
print(f"组合日方差  模拟样本 = {port.var(ddof=1):.3e}")
print(f"只加各自方差(错误)   = {var_naive:.3e}")
print(f"协方差项占比         = {1 - var_naive/var_formula:.1%}")

# ---------- 2. 收益自相关时 Var(均值) ≠ σ²/n ----------
phi, sigma, n, reps = 0.3, 0.01, 250, 20_000
eps = rng.normal(0, sigma * np.sqrt(1 - phi**2), size=(reps, n + 200))
x = np.zeros_like(eps)
for t in range(1, eps.shape[1]):
    x[:, t] = phi * x[:, t-1] + eps[:, t]
x = x[:, 200:]                                               # 丢掉预热期,平稳方差=σ²
means = x.mean(axis=1)
k = np.arange(1, n)
var_exact = sigma**2 / n * (1 + 2 * np.sum((1 - k/n) * phi**k))   # 式(4.1)
print(f"\nAR(1) φ={phi}: 模拟 Var(均值) = {means.var():.3e}")
print(f"含协方差项的公式       = {var_exact:.3e}")
print(f"天真公式 σ²/n          = {sigma**2/n:.3e}")
print(f"标准误被低估的倍数     = {np.sqrt(var_exact/(sigma**2/n)):.2f}")

关键输出:

组合日方差  公式 w'Σw = 1.062e-04
组合日方差  模拟样本 = 1.061e-04
只加各自方差(错误)   = 5.486e-05
协方差项占比         = 48.3%

AR(1) φ=0.3: 模拟 Var(均值) = 7.329e-07
含协方差项的公式       = 7.409e-07
天真公式 σ²/n          = 4.000e-07
标准误被低估的倍数     = 1.36

解读:这个四资产组合的方差有将近一半来自协方差项,忽略相关性会把风险低估一半;一阶自相关只有 0.3 的日收益,年均值的真实标准误就比 \(\sigma/\sqrt n\) 大 36%,对应的 t 统计量要打七折以上。


本章小结

期望的线性性不需要独立,这让「把复杂计数拆成示性变量之和」成为求均值的通用方法;求方差则需要两两交事件的概率,或者更一般地需要协方差。协方差是双线性的,和的方差等于各方差之和加上两倍的两两协方差之和,这条公式在量化里化身为组合方差 \(w^\top\Sigma w\) 和自相关序列均值的方差。相关系数介于 \(-1\) 与 \(1\) 之间,只度量线性关系;不相关不等于独立。

概念 / 公式 内容
二元函数期望 \(E[g(X,Y)]=\iint g\,f\,dx\,dy\)
线性性 \(E[\sum X_i]=\sum E[X_i]\),无需独立
示性变量 \(E[I_A]=P(A)\);计数 \(X=\sum I_i\)
尾和公式 \(E[X]=\sum_{i\ge1}P\{X\ge i\}\)(非负整数值)
事件对数 \(E[\binom X2]=\sum_{i<j}P(A_iA_j)\)
协方差 \(\mathrm{Cov}(X,Y)=E[XY]-E[X]E[Y]\),双线性
和的方差 \(\mathrm{Var}(\sum X_i)=\sum\mathrm{Var}(X_i)+2\sum_{i<j}\mathrm{Cov}(X_i,X_j)\)
组合方差 \(\mathrm{Var}(w^\top R)=w^\top\Sigma w\)
样本均值 / 样本方差 \(\mathrm{Var}(\bar X)=\sigma^2/n\);\(E[S^2]=\sigma^2\)(分母 \(n-1\))
有限总体修正 \(\frac{N-n}{N-1}\)
多项协方差 \(\mathrm{Cov}(N_i,N_j)=-mp_ip_j\)
相关系数 \(-1\le\rho\le1\),\(\lvert\rho\rvert=1\iff\) 线性关系

练习

基础

  1. 两只股票日收益波动分别为 2% 与 3%,相关系数 0.5。求 60/40 组合的日波动。 提示:\(\sqrt{0.6^2\cdot0.02^2+0.4^2\cdot0.03^2+2\cdot0.6\cdot0.4\cdot0.5\cdot0.02\cdot0.03}=\sqrt{4.32\times10^{-4}}\approx2.08\%\)。
  2. 掷一颗骰子直到六个面都出现,求期望次数。 答案:\(6(1+\frac12+\cdots+\frac16)=14.7\)(原书自测题 7.4)。
  3. 构造 \(X,Y\) 使 \(\mathrm{Cov}(X,Y)=0\) 但不独立,并解释为何因子 IC 为 0 不代表因子无用。 提示:\(Y=X^2\),\(X\) 关于 0 对称。
  4. 把 \(n\) 个白球和 \(m\) 个黑球随机排成一行,求「白球后紧跟黑球」的次数的期望。 答案:\(\frac{nm}{n+m}\)(自测题 7.2)。
  5. 对 100 个毫无预测力的因子各做显著性水平 5% 的检验,期望有几个「显著」?若要求至少一个假阳性的概率不超过 5%,每个检验的水平应取多少(Bonferroni)? 答案:5 个;0.05%。

进阶

  1. 设 \(X_1,X_2,\dots\) 独立、方差 \(\sigma^2\),\(Y_n=X_n+X_{n+1}+X_{n+2}\)。求 \(\mathrm{Cov}(Y_n,Y_{n+j})\),\(j\ge0\)。 提示:数共同项的个数,\(j=0,1,2,\ge3\) 时分别为 \(3\sigma^2,2\sigma^2,\sigma^2,0\)(原书习题 7.39;这正是重叠持有期收益的自协方差结构,即 MA(2))。
  2. 在等相关模型中,\(n\) 个资产方差均为 \(\sigma^2\)、两两相关为 \(\rho\)。求等权组合方差,并求 \(n\to\infty\) 的极限;说明为什么 \(\rho\ge-1/(n-1)\)。 答案:\(\sigma^2[\rho+(1-\rho)/n]\to\rho\sigma^2\);方差非负给出下界。
  3. 用有限总体修正解释:从 300 只股票中随机抽 150 只等权,组合平均因子暴露的方差比独立抽样小多少? 答案:乘以 \(\frac{150}{299}\approx0.50\)。
  4. 证明 \(\sqrt{\mathrm{Var}(X+Y)}\le\sqrt{\mathrm{Var}X}+\sqrt{\mathrm{Var}Y}\),并说明其风险含义(波动率次可加)。 提示:等价于 \(\rho\le1\)(自测题 7.31)。
  5. 用最大–最小恒等式计算:三只独立资产在指数分布时间 \(T_i\)(速率 \(\lambda_1,\lambda_2,\lambda_3\))后发生违约,求「全部违约」的期望时间。 答案:\(\sum\frac1{\lambda_i}-\sum_{i<j}\frac1{\lambda_i+\lambda_j}+\frac1{\lambda_1+\lambda_2+\lambda_3}\)(\(\min\) 的指数速率相加)。

原书推荐习题:第 7 章 Problems 7.11(换手次数)、7.17(猜牌的三种信息结构)、7.34(夫妻相邻的均值与方差)、7.39(滑动和自协方差)、7.43(Wilcoxon 秩和统计量)、7.44(游程检验);Theoretical Exercises 7.14(集券数方差)、7.15、7.17(反方差加权)、7.24(Cauchy–Schwarz);Self-Test 7.2、7.4、7.14(不相关但不独立)、7.23、7.31。

原书对照

本章内容 原书章节 PDF 页码(书内页码 = PDF − 13)
引言 7.1 p.293–294
和的期望、示性变量、快速排序 7.2 p.294–306
概率方法、最大–最小恒等式 7.2.1–7.2.2 p.306–310
发生事件个数的矩 7.3 p.311–317
协方差、和的方差、相关系数 7.4 p.317–326
期望的一般定义 7.9 p.362–363
第 7 章习题 / 自测题 — p.365–379;自测解答 p.465–475