第 07a 章 期望的性质:线性性、示性变量与协方差
本章对应 Ross 原书第 7 章前半部分(7.1–7.4 节,另含 7.9 节的简介)。第 7 章是全书篇幅最大、对量化最有用的一章,本册把它拆成三章:本章讲「和的期望与和的方差」,第 07b 章讲条件期望与预测,第 07c 章讲矩母函数与多元正态。
术语说明:从本章起,常见分布和人名多用英文写法——Poisson(泊松)、Gamma(伽马)、Beta(贝塔)、Cauchy(柯西)、Bernoulli(伯努利)、Markov(马尔可夫),所指与第 01–06b 章完全相同。
学习目标
- 熟练使用二元函数的期望公式和期望的线性性,并理解线性性不需要独立这一点为什么强大。
- 掌握「示性变量分解」(indicator decomposition):把一个计数类随机变量写成若干 0/1 变量之和来求均值和方差。
- 会用 \(E\big[\binom X2\big]=\sum_{i<j}P(A_iA_j)\) 求「发生事件个数」的方差。
- 掌握协方差的双线性、和的方差公式、相关系数的取值范围与含义,分清「不相关」与「独立」。
- 能把这些工具直接用到组合方差 \(w^\top\Sigma w\)、样本均值标准误、自相关收益的均值方差等量化问题上。
读前导读
这一章在解决什么问题。 你在 CFA 里背过两条公式:组合期望收益 \(E[R_p]=\sum w_iE[R_i]\),组合方差 \(\sigma_p^2=\sum\sum w_iw_j\sigma_{ij}\)。本章讲的就是这两条公式为什么成立、在什么条件下成立。结论很干脆:第一条(期望的线性性)任何情况下都成立,不需要资产独立;第二条(和的方差)必须把所有两两协方差都算进去,一旦漏掉,风险就会被系统性低估。
本章另一条主线是「示性变量」:把「有多少只股票跌停」「有多少个因子假阳性」这类计数,拆成一串 0/1 变量相加。均值就是概率相加,方差只需要两两同时发生的概率。这套技巧在风险管理里很实用,比如估算一个信用组合里违约笔数的均值和方差(违约之间有相关性也照样能算)。
最后一部分讲协方差和相关系数。CFA 里你知道 \(-1\le\rho\le1\),本章给出两行证明,并强调「不相关」不等于「独立」。这一点对因子研究很重要:IC 为 0 的因子仍可能有非线性预测力。
需要先想起来的数学。
- 求和记号与双重求和。 \(\sum_{i<j}a_{ij}\) 表示对所有满足 \(i<j\) 的下标对求和,\(n\) 个对象共有 \(\binom n2=n(n-1)/2\) 项。\(\sum_i\sum_j a_{ij}\) 是对全部 \(n^2\) 个格子求和,就像把协方差矩阵的每个元素加起来。例:\(n=3\) 时 \(\sum_{i<j}\) 有 (1,2)、(1,3)、(2,3) 三项。见 第 00 册第 07 章 概率中的分析工具。
- 二重积分与交换积分次序。 \(\iint g(x,y)f(x,y)\,dx\,dy\) 是先对 \(x\) 积分、再对 \(y\) 积分(或反过来),被积函数非负时两种顺序结果一样。可以理解为二维表格「先按行加总再加总各行」和「先按列加总再加总各列」结果相同。见 第 00 册第 05 章 多元微积分与优化。
- 调和级数与对数。 \(1+\frac12+\cdots+\frac1N\approx\ln N+0.577\)。例:\(N=6\) 时左边约为 2.45。集券问题和快速排序的 \(N\ln N\) 就来自这里。见 第 00 册第 04 章 级数与收敛。
- 矩阵二次型 \(w^\top\Sigma w\)。 \(w\) 是权重列向量,\(\Sigma\) 是协方差矩阵,\(w^\top\Sigma w=\sum_i\sum_jw_iw_j\Sigma_{ij}\),算出来是一个数,也就是组合方差。见 第 00 册第 06 章 线性代数速成。
怎么读这一章。 核心必读是 7.2.2(线性性)、7.2.3 的前几个例子(2e–2h)、7.3 开头的「事件对数」技巧,以及整个 7.4 节和「量化实战」。7.2.3 后半段的游程、随机游走、快速排序可以挑一两个看。7.2.4 的尾和公式值得记住结论。7.2.5(概率方法、最大–最小恒等式)、例 3d–3f 和 7.9 节第一次可以跳过。建议顺序:7.2.2 → 7.2.3 → 7.4 → 量化实战 → 回头看 7.3。
7.1 引言:期望是加权平均
回顾(第 04a、05 章):离散型 \(E[X]=\sum_x x\,p(x)\),连续型 \(E[X]=\int_{-\infty}^{\infty}x f(x)\,dx\)。期望是 \(X\) 各取值按概率的加权平均,因此有一个朴素但常用的事实:
若 \(P\{a\le X\le b\}=1\),则 \(a\le E[X]\le b\)。
证明(离散情形):\(p(x)\) 在 \([a,b]\) 之外为 0,于是 \(E[X]=\sum_{x:p(x)>0}x\,p(x)\ge\sum a\,p(x)=a\),上界同理。
7.2 随机变量之和的期望
7.2.1 二元函数的期望公式
命题 2.1 若 \((X,Y)\) 有联合概率质量函数 \(p(x,y)\),则
证明思路(连续、\(g\ge0\)):利用尾部积分公式 \(E[Z]=\int_0^\infty P\{Z>t\}\,dt\)(第 05 章 5.2 节),写 \(P\{g(X,Y)>t\}=\iint_{g(x,y)>t}f\,dy\,dx\),交换积分次序得 \(\iint\int_0^{g(x,y)}dt\,f\,dy\,dx=\iint g f\)。一般 \(g\) 拆成正部减负部。
白话解释:命题 2.1 的意思是,要算 \(g(X,Y)\) 的期望,不必先求出 \(Z=g(X,Y)\) 自己的分布,直接拿联合分布当权重,把 \(g\) 在每个点的值加权平均即可。金融里你天天这么做:算一个组合的期望收益时,你不会先求组合收益的分布,而是在各种情景下算出组合收益,再按情景概率加权。 证明里那一步的关键是:\(\int_0^{g(x,y)}dt=g(x,y)\)(对 1 从 0 积到 \(g\) 就是区间长度)。所以先对 \(t\) 积分就把尾部积分公式还原成了 \(g\) 本身。「正部减负部」是说任何 \(g\) 都能写成 \(g^+-g^-\),两部分各自非负,分别套用再相减。
例 2a(救护车距离) 事故点 \(X\) 与救护车位置 \(Y\) 独立、都在 \((0,L)\) 上均匀,求 \(E|X-Y|\)。先算 \(\int_0^L|x-y|\,dy=\frac{L^2}{2}+x^2-xL\),再对 \(x\) 积分并除以 \(L^2\):
7.2.2 期望的线性性
取 \(g(x,y)=x+y\),得到
关键:这里完全不要求独立。(第 04a 章 4.6 节已在可数样本空间下证明过这一点,并介绍了示性变量法,见那里的例 9d、9e;这里借助二元函数的期望公式把它推广到一般的联合分布,下面的示性变量例子可与那里对照阅读。) 只要各期望有限即可。这一点让很多看似复杂的计算变得简单:把一个难以直接求分布的随机变量拆成若干容易求期望的部分之和,分别求期望再相加,各部分之间怎样相关都无所谓。
金融直觉:组合期望收益 \(E[R_p]=\sum w_iE[R_i]\) 不管资产之间相关性多高都成立;你把两只高度相关的银行股放在一起,期望收益照样是加权平均。相关性只影响方差(7.4 节),不影响期望。这就是为什么均值–方差框架里「均值」那一侧总是线性的、简单的,而「方差」那一侧需要整个协方差矩阵。
几个直接推论:
- 单调性(例 2b):若每个样本点上都有 \(X\ge Y\),则 \(E[X]\ge E[Y]\)(对 \(X-Y\ge0\) 用上面的事实)。
- 样本均值无偏(例 2c):\(X_1,\dots,X_n\) 独立同分布(i.i.d.),均值 \(\mu\),样本均值(sample mean)\(\bar X=\frac1n\sum X_i\) 满足 \(E[\bar X]=\mu\)。
- Boole 不等式(例 2d):令 \(X_i=I(A_i)\),\(X=\sum X_i\) 是发生的事件数,\(Y=I(X\ge1)\)。因 \(X\ge Y\),得
\[P\Big(\bigcup_{i=1}^nA_i\Big)\le\sum_{i=1}^nP(A_i).\]这正是多重检验里 Bonferroni 校正的出处:同时检验 \(n\) 个因子、每个用显著性水平 \(\alpha/n\),则「至少一个假阳性」的概率不超过 \(\alpha\)。
7.2.3 示性变量分解:计数问题的万能钥匙
示性变量(indicator)\(I_A\) 在 \(A\) 发生时取 1、否则取 0,\(E[I_A]=P(A)\)。把计数写成示性变量之和,期望就是概率之和。
例 2e(二项均值) \(X=\sum_{i=1}^nX_i\),\(X_i\) 是第 \(i\) 次试验成功的示性变量,\(E[X]=np\)。
例 2f(负二项均值) 凑齐 \(r\) 次成功所需的试验数 \(X=X_1+\cdots+X_r\),\(X_i\) 是第 \(i-1\) 次成功之后到第 \(i\) 次成功所需的附加试验数,各为参数 \(p\) 的几何变量,\(E[X_i]=1/p\),所以 \(E[X]=r/p\)。
例 2g(超几何均值,两种分解) \(N\) 个球中 \(m\) 个白球,随机取 \(n\) 个,\(X\) 为白球数。
- 按白球分解:\(X=\sum_{i=1}^mX_i\),\(X_i\) 表示第 \(i\) 个白球被选中,\(P=\binom{N-1}{n-1}/\binom Nn=n/N\),\(E[X]=mn/N\)。
- 按抽取次序分解:\(X=\sum_{i=1}^nY_i\),\(Y_i\) 表示第 \(i\) 次取到白球,\(E[Y_i]=m/N\),同样得 \(nm/N\)。
同一个随机变量可以有多种分解方式,挑最好算的那一种。
例 2h(配对问题) \(N\) 人随机拿帽子,\(X_i\) 表示第 \(i\) 人拿到自己的帽子,\(E[X_i]=1/N\),故 \(E[X]=1\)——与 \(N\) 无关。
例 2i(集券问题,coupon collecting) \(N\) 种券等可能出现,集齐所需张数 \(X\)。令 \(X_i\) 为已集到 \(i\) 种之后得到一种新券所需的附加张数,它是参数 \((N-i)/N\) 的几何变量:
例 2j(猎鸭) 10 名猎人各自独立随机挑 10 只鸭中的一只射击,命中率 \(p\)。某只鸭被某猎人击中的概率是 \(p/10\),所以它逃脱的概率为 \((1-p/10)^{10}\),期望逃脱数为 \(10(1-p/10)^{10}\)。
例 2k(游程数,runs) \(n\) 个 1 与 \(m\) 个 0 随机排列,\(R(1)\) 为 1 的游程数。令 \(I_i\) 表示从第 \(i\) 位开始一个 1 的游程。\(E[I_1]=\frac{n}{n+m}\);对 \(i\ge2\),需要第 \(i-1\) 位为 0、第 \(i\) 位为 1,概率 \(\frac{m}{n+m}\cdot\frac{n}{n+m-1}\)。共 \(n+m-1\) 个这样的位置,所以
例 2l(平面随机游走与 \(\sqrt n\) 标度) 每步长度 1,方向角 \(\theta_i\sim U(0,2\pi)\) 独立。令 \(X_i=\cos\theta_i\)、\(Y_i=\sin\theta_i\),终点到原点距离平方
例 2m(快速排序的平均比较次数) 快速排序(quick-sort)随机选一个枢轴(pivot),其余元素与之比较后分成左右两组递归处理。把值按大小重新命名为 \(1,\dots,n\),令 \(I(i,j)=1\) 表示 \(i\) 与 \(j\) 被直接比较过。关键观察:\(\{i,i+1,\dots,j\}\) 一直在同一组里,直到其中某个值首次被选为枢轴;若这个枢轴是 \(i\) 或 \(j\),二者被比较,否则被分到两边、永不比较。该枢轴在这 \(j-i+1\) 个值中等可能,所以
例 2n(用期望证明容斥公式) \(1-\prod_{i=1}^n(1-I_{A_i})=I(\cup A_i)\),展开后取期望,利用 \(E[I_{A_{i_1}}\cdots I_{A_{i_k}}]=P(A_{i_1}\cdots A_{i_k})\),即得容斥公式(inclusion–exclusion)
7.2.4 无穷和与尾和公式
\(E[\sum_{i=1}^\infty X_i]=\sum_i E[X_i]\) 并不总成立(它等价于交换期望与极限)。两种常用的成立条件:所有 \(X_i\ge0\);或 \(\sum_iE|X_i|<\infty\)。
例 2o(尾和公式) \(X\) 取非负整数,\(X_i=I(X\ge i)\),则 \(X=\sum_{i\ge1}X_i\),由非负性
推导拆解:为什么 \(X=\sum_{i\ge1}I(X\ge i)\)?举例:若 \(X=3\),则 \(I(X\ge1)=I(X\ge2)=I(X\ge3)=1\),\(i\ge4\) 的项都是 0,加起来正好是 3。也就是说,「\(X\) 等于几」就等于「它跨过了几道门槛」。每项都非负,所以可以对无穷和逐项取期望(这就是上面说的第一个成立条件),而 \(E[I(X\ge i)]=P\{X\ge i\}\)。 金融上,违约前存活的整期数 \(X\) 的期望,等于各期「仍存活」概率之和,这和信用分析里用生存概率加总求期望存续期是同一个结构。
例 2p(有序表的最优排列) \(n\) 个元素存放在有序列表中,每次请求元素 \(i\) 的概率为 \(P(i)\),\(P(1)\ge\cdots\ge P(n)\)。对任一排列 \(i_1,\dots,i_n\),所需查找位置 \(X\) 满足 \(P\{X\ge k\}=\sum_{j=k}^nP(i_j)\ge\sum_{j=k}^nP(j)\),用尾和公式求和即知:按请求概率降序排列使平均查找位置最小。(行情系统里按访问频率排列缓存、按成交活跃度排列合约表,用的就是这个原理。)
7.2.5 概率方法与最大–最小恒等式(选读)
概率方法(probabilistic method):要证明有限集 \(A\) 上存在使 \(f(s)\) 很大的元素,只需在 \(A\) 上随机取一个元素 \(S\) 并算出 \(E[f(S)]\):最大值不小于期望,若 \(f(S)\) 不是常数则最大值严格大于期望。
- 例 2q(锦标赛中的哈密顿路径) \(n\) 人循环赛,排列 \(i_1,\dots,i_n\) 若 \(i_1\) 胜 \(i_2\)、\(i_2\) 胜 \(i_3\)……则称为哈密顿路径。让每场比赛独立、各方胜率 1/2,任一排列成为哈密顿路径的概率为 \((1/2)^{n-1}\),期望条数 \(n!/2^{n-1}\),所以存在一种赛果使哈密顿路径数超过 \(n!/2^{n-1}\)。
- 例 2r(花栗鼠) 52 棵树围成一圈,住着 15 只花栗鼠。随机选一棵树及其顺时针后 6 棵为「邻域」,每只花栗鼠落入邻域的概率 \(7/52\),期望 \(105/52>2\),所以存在连续 7 棵树至少住 3 只。
最大–最小恒等式(命题 2.2) 对任意实数 \(x_1,\dots,x_n\),
例 2s(不等概率集券) 类型 \(i\) 的概率为 \(p_i\),\(X_i\) 为首次得到类型 \(i\) 所需张数(几何\((p_i)\)),集齐所需 \(X=\max_iX_i\),而 \(\min(X_i,X_j)\) 是几何\((p_i+p_j)\)。于是
7.3 发生事件个数的矩
设 \(X\) 为事件 \(A_1,\dots,A_n\) 中发生的个数,\(X=\sum I_i\),\(E[X]=\sum P(A_i)\)。求方差需要 \(E[X^2]\),技巧是数「发生的事件对数」:
要点:求方差只需要知道两两交事件的概率。
推导拆解:为什么 \(\binom X2=\sum_{i<j}I_iI_j\)?右边每一项 \(I_iI_j\) 只有在 \(A_i\)、\(A_j\) 都发生时才等于 1,所以右边数的是「同时发生的事件对」有多少个。若一共有 \(X\) 个事件发生,从中挑两个的方法数就是 \(\binom X2=X(X-1)/2\)。两边数的是同一件事。 接下来三步:(1)两边取期望,右边用线性性,\(E[I_iI_j]=P(A_iA_j)\);(2)\(\binom X2=\frac{X^2-X}2\),所以 \(E[X^2]=2\sum_{i<j}P(A_iA_j)+E[X]\);(3)\(\mathrm{Var}(X)=E[X^2]-(E[X])^2\)。 金融例子:信用组合里 \(n\) 笔贷款,\(A_i\) 为第 \(i\) 笔违约。要算违约笔数的方差,你不需要知道全部违约的联合分布,只需要每笔的违约概率 \(P(A_i)\) 和每两笔的联合违约概率 \(P(A_iA_j)\)。联合违约概率越高(违约相关性越强),方差越大,尾部越厚。
例 3a(二项) \(P(A_iA_j)=p^2\),\(E[X(X-1)]=n(n-1)p^2\),\(\mathrm{Var}(X)=n(n-1)p^2+np-(np)^2=np(1-p)\)。
例 3b(超几何) \(P(A_i)=\frac mN\),\(P(A_iA_j)=\frac mN\frac{m-1}{N-1}\),
例 3c(配对问题) \(P(A_iA_j)=\frac1{N(N-1)}\),\(E[X(X-1)]=1\),\(\mathrm{Var}(X)=1\);事实上对 \(k\le N\) 所有阶乘矩都等于 1,与 Poisson(1) 一致——配对数近似服从 Poisson(1)。
例 3d(前 \(n\) 张券中出现的种类数) 类型 \(j\) 概率 \(p_j\),\(Y\) 为已出现的种类数。令 \(A_i\) 为类型 \(i\) 未出现,\(P(A_i)=(1-p_i)^n\),\(P(A_iA_j)=(1-p_i-p_j)^n\),得
例 3e(负超几何分布,negative hypergeometric) 瓮中 \(n\) 个特殊球、\(m\) 个普通球,逐个无放回取出,\(Y\) 为取到第 \(r\) 个特殊球所需次数。不用分布律:对每个普通球 \(o_i\),令 \(A_i\) 为它在第 \(r\) 个特殊球之前被取出。只看 \(o_i\) 与 \(n\) 个特殊球这 \(n+1\) 个球,\(o_i\) 在其中的位置均匀,落在前 \(r\) 位的概率为 \(r/(n+1)\),所以
例 3f(集券问题中的「单张」类型数) 等概率 \(n\) 种券、收集到集齐为止,恰好只收到一张的类型数 \(X\) 满足 \(E[X]=\sum_{i=1}^n\frac1i\)(第 \(i\) 个被收集到的类型成为单张,当且仅当它在那时剩下的 \(n-i+1\) 种里「最后被再次收集」)。方差推导见原书。
7.4 协方差、和的方差与相关系数
7.4.1 协方差
命题 4.1 \(X,Y\) 独立,则对任意函数 \(g,h\),\(E[g(X)h(Y)]=E[g(X)]\,E[h(Y)]\)(联合密度分解为乘积,双重积分分离)。
定义 协方差(covariance)
独立推出协方差为 0,反之不成立。反例:\(X\) 等概率取 \(0,1,-1\),\(Y=I(X=0)\)。\(XY\equiv0\) 且 \(E X=0\),故 \(\mathrm{Cov}=0\),但 \(Y\) 完全由 \(X\) 决定。
命题 4.2(协方差的性质)
- \(\mathrm{Cov}(X,Y)=\mathrm{Cov}(Y,X)\);
- \(\mathrm{Cov}(X,X)=\mathrm{Var}(X)\);
- \(\mathrm{Cov}(aX,Y)=a\,\mathrm{Cov}(X,Y)\);
- 双线性:\(\displaystyle\mathrm{Cov}\Big(\sum_{i=1}^nX_i,\sum_{j=1}^mY_j\Big)=\sum_{i=1}^n\sum_{j=1}^m\mathrm{Cov}(X_i,Y_j)\)。
(4)的证明:中心化后两个和相乘,展开成 \(nm\) 项,再用期望的线性性。
推导拆解:先验证 \(E[(X-EX)(Y-EY)]=E[XY]-E[X]E[Y]\)。展开括号得 \(XY-X\,EY-Y\,EX+EX\,EY\),逐项取期望(\(EX\)、\(EY\) 是常数,可以提出来):\(E[XY]-EX\,EY-EY\,EX+EX\,EY=E[XY]-EX\,EY\)。 双线性的证明:记 \(\mu_i=E X_i\)、\(\nu_j=E Y_j\),则 \(\sum X_i-E\sum X_i=\sum(X_i-\mu_i)\),同理处理 \(Y\)。两个和相乘
\[\Big(\sum_i(X_i-\mu_i)\Big)\Big(\sum_j(Y_j-\nu_j)\Big)=\sum_i\sum_j(X_i-\mu_i)(Y_j-\nu_j),\]这和 \((a+b)(c+d)=ac+ad+bc+bd\) 是同一回事。最后对每一项取期望,就是 \(\mathrm{Cov}(X_i,Y_j)\)。 白话:协方差对每个参数都像乘法一样「可以拆开、常数可以提出来」。这就是为什么组合与组合之间的协方差可以写成 \(w^\top\Sigma v\)。
7.4.2 和的方差
在双线性中令 \(Y_j=X_j\):
例 4a(样本均值的方差与样本方差的无偏性) i.i.d.,均值 \(\mu\)、方差 \(\sigma^2\)。
(a) \(\mathrm{Var}(\bar X)=\frac{1}{n^2}\sum\mathrm{Var}(X_i)=\sigma^2/n\)。
(b) 样本方差(sample variance)\(S^2=\frac{1}{n-1}\sum(X_i-\bar X)^2\)。利用恒等式
推导拆解:那个恒等式是怎么来的?把 \(X_i-\bar X\) 写成 \((X_i-\mu)-(\bar X-\mu)\),平方后求和:
\[\sum(X_i-\bar X)^2=\sum(X_i-\mu)^2-2(\bar X-\mu)\sum(X_i-\mu)+n(\bar X-\mu)^2.\]中间项里 \(\sum(X_i-\mu)=n(\bar X-\mu)\),所以中间项等于 \(-2n(\bar X-\mu)^2\),与最后一项合并得 \(-n(\bar X-\mu)^2\)。 取期望时用到两件事:\(E(X_i-\mu)^2=\sigma^2\)(共 \(n\) 项),\(E(\bar X-\mu)^2=\mathrm{Var}(\bar X)=\sigma^2/n\)(就是 (a))。 白话:样本点离自己的均值 \(\bar X\) 总比离真实均值 \(\mu\) 更近(\(\bar X\) 正是让平方和最小的那个点),所以用 \(n\) 做分母会系统性低估方差,除以 \(n-1\) 恰好补回来。你在 CFA 里背过「样本方差除以 \(n-1\)」,这里就是原因。
例 4b(二项方差) \(X=\sum X_i\),独立 Bernoulli,\(X_i^2=X_i\),\(\mathrm{Var}(X_i)=p-p^2\),\(\mathrm{Var}(X)=np(1-p)\)。
例 4c(有限总体抽样) \(N\) 人各有数值 \(v_i\),等可能抽取 \(n\) 人,\(S\) 为样本值之和。令 \(I_i\) 表示第 \(i\) 人入样,\(S=\sum v_iI_i\)。 \(E[I_i]=\frac nN\),\(\mathrm{Cov}(I_i,I_j)=\frac nN\frac{n-1}{N-1}-\frac{n^2}{N^2}=-\frac{n(N-n)}{N^2(N-1)}\)。记 \(\bar v=\frac1N\sum v_i\),
例 4d(示性变量的协方差) \(\mathrm{Cov}(I_A,I_B)=P(AB)-P(A)P(B)=P(B)\big[P(A|B)-P(A)\big]\)。正相关意味着「\(B\) 发生使 \(A\) 更可能」。
例 4e i.i.d. 时 \(\mathrm{Cov}(X_i-\bar X,\bar X)=\frac{\sigma^2}{n}-\frac{\sigma^2}{n}=0\):样本均值与每个偏差都不相关。一般分布下它们并不独立;但正态样本下 \(\bar X\) 与整个偏差向量独立,从而与 \(S^2\) 独立(第 07c 章证明)。
例 4f(多项分布的协方差) \(m\) 次独立试验、\(r\) 种结果,\(N_i\) 为结果 \(i\) 出现的次数,\(N_i=\sum_kI_i(k)\)。不同试验之间独立,协方差为 0;同一次试验里 \(I_i(\ell)I_j(\ell)=0\),协方差为 \(-p_ip_j\)。故
7.4.3 相关系数
证明:\(0\le\mathrm{Var}\big(\frac{X}{\sigma_x}+\frac{Y}{\sigma_y}\big)=2(1+\rho)\),\(0\le\mathrm{Var}\big(\frac{X}{\sigma_x}-\frac{Y}{\sigma_y}\big)=2(1-\rho)\)。方差为 0 意味着几乎必然为常数(第 08 章命题 2.3),所以 \(\rho=1\) 当且仅当 \(Y=a+bX\)、\(b>0\);\(\rho=-1\) 对应 \(b<0\)。
推导拆解:用和的方差公式 (4.1) 计算 \(\mathrm{Var}\big(\frac{X}{\sigma_x}+\frac{Y}{\sigma_y}\big)=\frac{\sigma_x^2}{\sigma_x^2}+\frac{\sigma_y^2}{\sigma_y^2}+2\frac{\mathrm{Cov}(X,Y)}{\sigma_x\sigma_y}=1+1+2\rho\)。方差不可能为负,所以 \(1+\rho\ge0\),即 \(\rho\ge-1\);减号版本给出 \(\rho\le1\)。 「几乎必然」(almost surely)的意思是「以概率 1 成立」,允许在概率为 0 的情形下例外,读者可以先当作「总是」理解。 金融直觉:\(\rho=-1\) 时,\(\frac{X}{\sigma_x}+\frac{Y}{\sigma_y}\) 方差为 0,也就是按波动率倒数配比的两资产组合完全无风险。这就是「完美对冲」:CFA 里两资产 \(\rho=-1\) 时能构造零方差组合,用的正是这一步。
\(\rho\) 只刻画线性关系的强弱。\(\rho=0\) 称为不相关(uncorrelated)。上面 \(Y=I(X=0)\) 的例子说明,变量之间可以有完全确定的非线性关系而相关系数为 0。量化里常用的 IC(信息系数)就是因子值与下期收益的相关系数(或其秩版本),它同样只抓线性(或单调)关系;非线性预测能力需要用第 09 章的互信息等工具补充。
7.9 期望的一般定义(简介)
存在既非离散也非连续的随机变量:\(X\sim\) Bernoulli(1/2),\(Y\sim U[0,1]\) 独立,\(W=1\)(若 \(X=1\))否则 \(W=Y\)。\(W\) 在 1 处有 1/2 的概率质量,其余部分连续分布。
为统一处理,原书引入 Stieltjes 积分:
量化实战
1. 组合方差与风险模型。 组合收益 \(R_p=\sum_iw_iR_i\),由式 (4.1)
2. 夏普比率与 alpha 的标准误。 回测时用 \(\bar X\) 估计日均超额收益,其标准误是 \(\sigma/\sqrt n\)——前提是各日收益不相关。若收益有自相关(如流动性差的资产、平滑后的净值、重叠持有期收益),按式 (4.1)
推导拆解:从 (4.1) 出发,\(\mathrm{Var}(\bar X)=\frac1{n^2}\big[\sum_i\mathrm{Var}(X_i)+2\sum_{i<j}\mathrm{Cov}(X_i,X_j)\big]\)。平稳序列里 \(\mathrm{Cov}(X_i,X_j)=\rho_{j-i}\sigma^2\) 只取决于间隔 \(k=j-i\)。间隔为 \(k\) 的 \((i,j)\) 对一共有 \(n-k\) 个(\(i=1,\dots,n-k\))。于是
\[\mathrm{Var}(\bar X)=\frac{1}{n^2}\Big[n\sigma^2+2\sum_{k=1}^{n-1}(n-k)\rho_k\sigma^2\Big],\]提出 \(\frac{\sigma^2}{n}\) 即得原式。方括号里 \(1+2\sum(\cdots)\) 就是「方差膨胀因子」;\(\rho_k\) 全为 0 时它等于 1,回到 \(\sigma^2/n\)。 金融上,私募或不动产基金的净值经过平滑,月收益正自相关很强,用天真公式算出的 Sharpe 比率显著性会被严重高估。
3. 示性变量与多重检验。 Boole 不等式 → Bonferroni 校正;例 2h 一类「期望命中数」的计算可用来估计「在 \(n\) 个随机因子中,凭运气就能显著的期望个数」\(=n\alpha\)。
下面的代码验证两件事:组合方差公式中协方差项的分量,以及自相关收益下天真标准误的低估程度。
import numpy as np
rng = np.random.default_rng(42)
# ---------- 1. 组合方差 = w' Σ w(协方差双线性)----------
n_assets, T = 4, 200_000
vol = np.array([0.20, 0.25, 0.15, 0.30]) / np.sqrt(252) # 日波动
corr = np.array([[1.0, 0.6, 0.3, 0.2],
[0.6, 1.0, 0.4, 0.3],
[0.3, 0.4, 1.0, 0.1],
[0.2, 0.3, 0.1, 1.0]])
Sigma = np.outer(vol, vol) * corr
w = np.array([0.4, 0.3, 0.2, 0.1])
R = rng.multivariate_normal(np.zeros(n_assets), Sigma, size=T)
port = R @ w
var_formula = w @ Sigma @ w
var_naive = np.sum(w**2 * vol**2) # 忽略协方差项
print(f"组合日方差 公式 w'Σw = {var_formula:.3e}")
print(f"组合日方差 模拟样本 = {port.var(ddof=1):.3e}")
print(f"只加各自方差(错误) = {var_naive:.3e}")
print(f"协方差项占比 = {1 - var_naive/var_formula:.1%}")
# ---------- 2. 收益自相关时 Var(均值) ≠ σ²/n ----------
phi, sigma, n, reps = 0.3, 0.01, 250, 20_000
eps = rng.normal(0, sigma * np.sqrt(1 - phi**2), size=(reps, n + 200))
x = np.zeros_like(eps)
for t in range(1, eps.shape[1]):
x[:, t] = phi * x[:, t-1] + eps[:, t]
x = x[:, 200:] # 丢掉预热期,平稳方差=σ²
means = x.mean(axis=1)
k = np.arange(1, n)
var_exact = sigma**2 / n * (1 + 2 * np.sum((1 - k/n) * phi**k)) # 式(4.1)
print(f"\nAR(1) φ={phi}: 模拟 Var(均值) = {means.var():.3e}")
print(f"含协方差项的公式 = {var_exact:.3e}")
print(f"天真公式 σ²/n = {sigma**2/n:.3e}")
print(f"标准误被低估的倍数 = {np.sqrt(var_exact/(sigma**2/n)):.2f}")
关键输出:
组合日方差 公式 w'Σw = 1.062e-04
组合日方差 模拟样本 = 1.061e-04
只加各自方差(错误) = 5.486e-05
协方差项占比 = 48.3%
AR(1) φ=0.3: 模拟 Var(均值) = 7.329e-07
含协方差项的公式 = 7.409e-07
天真公式 σ²/n = 4.000e-07
标准误被低估的倍数 = 1.36
解读:这个四资产组合的方差有将近一半来自协方差项,忽略相关性会把风险低估一半;一阶自相关只有 0.3 的日收益,年均值的真实标准误就比 \(\sigma/\sqrt n\) 大 36%,对应的 t 统计量要打七折以上。
本章小结
期望的线性性不需要独立,这让「把复杂计数拆成示性变量之和」成为求均值的通用方法;求方差则需要两两交事件的概率,或者更一般地需要协方差。协方差是双线性的,和的方差等于各方差之和加上两倍的两两协方差之和,这条公式在量化里化身为组合方差 \(w^\top\Sigma w\) 和自相关序列均值的方差。相关系数介于 \(-1\) 与 \(1\) 之间,只度量线性关系;不相关不等于独立。
| 概念 / 公式 | 内容 |
|---|---|
| 二元函数期望 | \(E[g(X,Y)]=\iint g\,f\,dx\,dy\) |
| 线性性 | \(E[\sum X_i]=\sum E[X_i]\),无需独立 |
| 示性变量 | \(E[I_A]=P(A)\);计数 \(X=\sum I_i\) |
| 尾和公式 | \(E[X]=\sum_{i\ge1}P\{X\ge i\}\)(非负整数值) |
| 事件对数 | \(E[\binom X2]=\sum_{i<j}P(A_iA_j)\) |
| 协方差 | \(\mathrm{Cov}(X,Y)=E[XY]-E[X]E[Y]\),双线性 |
| 和的方差 | \(\mathrm{Var}(\sum X_i)=\sum\mathrm{Var}(X_i)+2\sum_{i<j}\mathrm{Cov}(X_i,X_j)\) |
| 组合方差 | \(\mathrm{Var}(w^\top R)=w^\top\Sigma w\) |
| 样本均值 / 样本方差 | \(\mathrm{Var}(\bar X)=\sigma^2/n\);\(E[S^2]=\sigma^2\)(分母 \(n-1\)) |
| 有限总体修正 | \(\frac{N-n}{N-1}\) |
| 多项协方差 | \(\mathrm{Cov}(N_i,N_j)=-mp_ip_j\) |
| 相关系数 | \(-1\le\rho\le1\),\(\lvert\rho\rvert=1\iff\) 线性关系 |
练习
基础
- 两只股票日收益波动分别为 2% 与 3%,相关系数 0.5。求 60/40 组合的日波动。 提示:\(\sqrt{0.6^2\cdot0.02^2+0.4^2\cdot0.03^2+2\cdot0.6\cdot0.4\cdot0.5\cdot0.02\cdot0.03}=\sqrt{4.32\times10^{-4}}\approx2.08\%\)。
- 掷一颗骰子直到六个面都出现,求期望次数。 答案:\(6(1+\frac12+\cdots+\frac16)=14.7\)(原书自测题 7.4)。
- 构造 \(X,Y\) 使 \(\mathrm{Cov}(X,Y)=0\) 但不独立,并解释为何因子 IC 为 0 不代表因子无用。 提示:\(Y=X^2\),\(X\) 关于 0 对称。
- 把 \(n\) 个白球和 \(m\) 个黑球随机排成一行,求「白球后紧跟黑球」的次数的期望。 答案:\(\frac{nm}{n+m}\)(自测题 7.2)。
- 对 100 个毫无预测力的因子各做显著性水平 5% 的检验,期望有几个「显著」?若要求至少一个假阳性的概率不超过 5%,每个检验的水平应取多少(Bonferroni)? 答案:5 个;0.05%。
进阶
- 设 \(X_1,X_2,\dots\) 独立、方差 \(\sigma^2\),\(Y_n=X_n+X_{n+1}+X_{n+2}\)。求 \(\mathrm{Cov}(Y_n,Y_{n+j})\),\(j\ge0\)。 提示:数共同项的个数,\(j=0,1,2,\ge3\) 时分别为 \(3\sigma^2,2\sigma^2,\sigma^2,0\)(原书习题 7.39;这正是重叠持有期收益的自协方差结构,即 MA(2))。
- 在等相关模型中,\(n\) 个资产方差均为 \(\sigma^2\)、两两相关为 \(\rho\)。求等权组合方差,并求 \(n\to\infty\) 的极限;说明为什么 \(\rho\ge-1/(n-1)\)。 答案:\(\sigma^2[\rho+(1-\rho)/n]\to\rho\sigma^2\);方差非负给出下界。
- 用有限总体修正解释:从 300 只股票中随机抽 150 只等权,组合平均因子暴露的方差比独立抽样小多少? 答案:乘以 \(\frac{150}{299}\approx0.50\)。
- 证明 \(\sqrt{\mathrm{Var}(X+Y)}\le\sqrt{\mathrm{Var}X}+\sqrt{\mathrm{Var}Y}\),并说明其风险含义(波动率次可加)。 提示:等价于 \(\rho\le1\)(自测题 7.31)。
- 用最大–最小恒等式计算:三只独立资产在指数分布时间 \(T_i\)(速率 \(\lambda_1,\lambda_2,\lambda_3\))后发生违约,求「全部违约」的期望时间。 答案:\(\sum\frac1{\lambda_i}-\sum_{i<j}\frac1{\lambda_i+\lambda_j}+\frac1{\lambda_1+\lambda_2+\lambda_3}\)(\(\min\) 的指数速率相加)。
原书推荐习题:第 7 章 Problems 7.11(换手次数)、7.17(猜牌的三种信息结构)、7.34(夫妻相邻的均值与方差)、7.39(滑动和自协方差)、7.43(Wilcoxon 秩和统计量)、7.44(游程检验);Theoretical Exercises 7.14(集券数方差)、7.15、7.17(反方差加权)、7.24(Cauchy–Schwarz);Self-Test 7.2、7.4、7.14(不相关但不独立)、7.23、7.31。
原书对照
| 本章内容 | 原书章节 | PDF 页码(书内页码 = PDF − 13) |
|---|---|---|
| 引言 | 7.1 | p.293–294 |
| 和的期望、示性变量、快速排序 | 7.2 | p.294–306 |
| 概率方法、最大–最小恒等式 | 7.2.1–7.2.2 | p.306–310 |
| 发生事件个数的矩 | 7.3 | p.311–317 |
| 协方差、和的方差、相关系数 | 7.4 | p.317–326 |
| 期望的一般定义 | 7.9 | p.362–363 |
| 第 7 章习题 / 自测题 | — | p.365–379;自测解答 p.465–475 |