量化交易中文教材

第 02 章 概率复习:计量视角

本章内容与第 02 册(概率论)高度重叠。系统的概率论推导请看第 02 册第 4–8 章(随机变量、连续型随机变量、联合分布、期望的性质、极限定理)以及第 03 册第 01 章(概率论速览,含期望与随机变量的收敛)。这里只保留回归分析直接要用的部分,并突出三条计量主线:条件期望是最优预测、\(E(Y\mid X)\) 与相关性的关系、样本均值是随机变量。

学习目标

读完本章,你应当能够:

  1. 熟练计算离散分布的期望、方差、条件期望、条件方差,并用迭代期望定律把条件期望「拼回」无条件期望。
  2. 证明条件均值 \(E(Y\mid X)\) 在平方损失下是最优预测,并说明这是回归函数的理论动机。
  3. 区分「独立」「条件均值不依赖于 \(X\)」「不相关」三个条件的强弱关系。
  4. 用 \(\operatorname{var}(aX+bY)\) 公式计算组合方差,解释分散化的极限 \(\rho\sigma^2\)。
  5. 说明随机抽样为什么让样本均值 \(\bar Y\) 成为随机变量,写出其均值、方差,并说清大数定律与中心极限定理各自保证了什么、需要什么条件。
  6. 理解偏度、峰度,以及「用正态分布估计尾部风险」为什么会出大错。

读前导读

这一章在解决什么问题。 表面上这是 CFA 一级「Quantitative Methods」的复习:期望、方差、协方差、正态分布、中心极限定理你都学过。但本章挑出来的是回归理论要用的那几块,并且换了一个角度。CFA 讲回归时直接给出「误差项均值为 0、与自变量不相关」之类的假设,很少解释这些假设从哪来、彼此是什么关系。本章提前把地基打好:

  • 回归到底在估计什么?答案是条件期望 \(E(Y\mid X)\),也就是「已知 \(X\) 时 \(Y\) 的平均值」。2.3.3 节证明它是平方损失下的最优预测,所以回归首先是一个预测工具。
  • OLS 的核心假设为什么写成 \(E(u\mid X)=0\) 而不是 CFA 常说的「\(X\) 与 \(u\) 不相关」?2.3.4 节说明前者更强,并给出强弱链条。
  • 为什么回归系数近似正态,即使收益明显厚尾?因为 OLS 系数本质上是一种加权平均,2.5–2.6 节的样本均值理论(LLN、CLT)可以直接搬过去。

本册比 CFA 多讲的「推导」和「稳健标准误」,所需的概率工具几乎都在这一章。

需要先想起来的数学。

  • 求和记号与期望的线性性:\(\sum_{i=1}^n a_i\) 表示 \(a_1+\dots+a_n\)。期望是线性的:\(E(aX+bY)=aE(X)+bE(Y)\),不需要 \(X,Y\) 独立。例如 \(E(2X+3)=2E(X)+3\)。方差不是线性的,\(\operatorname{var}(2X)=4\operatorname{var}(X)\)。见 第 00 册第 07 章 概率中的分析工具。
  • 积分作为「连续版的求和」:连续变量的期望 \(\int y f_Y(y)\,dy\) 与离散的 \(\sum y_ip_i\) 含义相同,只是把概率 \(p_i\) 换成「密度 × 小区间宽度」\(f(y)\,dy\)。本章所有结论都可以用离散情形理解。见 第 00 册第 03 章 积分。
  • 对一个变量求导找最小值:2.3.3 节对 \(m\) 求导令其为 0 求最小值。例如 \((3-m)^2+(5-m)^2\) 对 \(m\) 求导得 \(-2(3-m)-2(5-m)=0\),解出 \(m=4\),即均值。见 第 00 册第 02 章 导数与泰勒展开。
  • 极限与「收敛」:\(n\to\infty\) 读作「\(n\) 趋于无穷大」。随机变量的收敛有多种说法,本章只用两种:依概率收敛(LLN)和依分布收敛(CLT)。见 第 00 册第 07 章 中「收敛的几种说法」。

怎么读这一章。 核心必读是 2.3.2(迭代期望定律)、2.3.3(条件均值是最优预测)、2.3.4(三个条件的强弱关系)、2.5(样本均值是随机变量)和 2.6(LLN 与 CLT)。2.1、2.2、2.3.5、2.4 你在 CFA 中基本都见过,可以快速扫过,只需留意 2.2 末尾「四阶矩有限」的提示和 2.4 中 \(F_{m,\infty}=\chi^2_m/m\) 这一条。瑞郎专栏和分散化专栏值得读,它们是金融读者最有体感的部分。第一次读可以跳过 2.3.3 中「不用微积分的证明」,后面讲解框里有拆解,回头再看。


2.1 随机变量与概率分布

随机过程中互斥的潜在结果称为结果(outcomes),所有结果的集合是样本空间(sample space),样本空间的子集是事件(event)。一个结果的概率是它在长期中出现的比例。随机变量(random variable)是随机结果的数值概括,分为离散与连续两类。

原书贯穿本章的例子:\(M\) 表示写学期论文期间无线网络掉线的次数(Table 2.1)。

\(m\) 0 1 2 3 4
\(\Pr(M=m)\) 0.80 0.10 0.06 0.03 0.01
\(\Pr(M\le m)\) 0.80 0.90 0.96 0.99 1.00

第三行是累积分布函数(cumulative distribution function, c.d.f.)。事件概率等于组成它的结果的概率之和,例如 \(\Pr(M=1\text{ 或 }2)=0.16\)。

取值 0/1 的变量服从伯努利分布(Bernoulli distribution):\(\Pr(G=1)=p\),\(\Pr(G=0)=1-p\)。连续随机变量不能逐点列概率,改用概率密度函数(probability density function, p.d.f.):两点之间密度曲线下的面积等于随机变量落在其间的概率。例如通勤时间 \(\Pr(\le15\text{ 分钟})=0.20\),\(\Pr(\le20)=0.78\),于是 \(\Pr(15<\text{通勤}\le20)=0.58\)。

2.2 期望、方差与矩

期望(expected value)是概率加权平均,也就是大量重复下的长期平均:

\[E(Y)=\mu_Y=\sum_{i=1}^k y_ip_i\qquad\text{(连续情形 }E(Y)=\int y f_Y(y)\,dy\text{)}.\]

例:借给朋友 100 美元,利率 10%,1% 的概率违约。期望还款 \(=110\times0.99+0\times0.01=108.90\) 美元。掉线次数 \(E(M)=0.35\)——实际次数必为整数,0.35 是很多篇论文的平均值。伯努利变量 \(E(G)=p\)。

方差(variance)与标准差(standard deviation)度量离散程度:

\[\sigma_Y^2=\operatorname{var}(Y)=E[(Y-\mu_Y)^2],\qquad \sigma_Y=\sqrt{\operatorname{var}(Y)}.\]

例:\(\operatorname{var}(M)=0.6475\),\(\sigma_M\approx0.80\);伯努利 \(\operatorname{var}(G)=p(1-p)\)。

线性变换:若 \(Y=a+bX\),则

\[\mu_Y=a+b\mu_X,\qquad \sigma_Y^2=b^2\sigma_X^2,\qquad \sigma_Y=|b|\sigma_X.\]

(原书写作 \(\sigma_Y=b\sigma_X\),只在 \(b>0\) 时成立,这里改为 \(|b|\)。)加常数只平移,乘常数按比例缩放离散度。例:税率 20% 加 2000 美元免税补贴,税后收入 \(Y=2000+0.8X\),\(\sigma_Y=0.8\sigma_X\)。

偏度与峰度描述分布形状:

\[\text{Skewness}=\frac{E[(Y-\mu_Y)^3]}{\sigma_Y^3},\qquad \text{Kurtosis}=\frac{E[(Y-\mu_Y)^4]}{\sigma_Y^4}.\]
  • 对称分布偏度为 0;右尾长偏度为正,左尾长偏度为负。
  • 峰度衡量方差中有多少来自极端值(离群值 outlier)。正态分布峰度为 3;峰度大于 3 的分布称为尖峰(leptokurtic)或厚尾(heavy-tailed)。
  • 两者都除以 \(\sigma_Y\) 的幂,无量纲,改变单位不影响它们。

\(E(Y^r)\) 称为 \(r\) 阶矩(moment)。偏度依赖前三阶矩,峰度依赖前四阶矩。标准化(standardization)\((Y-\mu_Y)/\sigma_Y\) 得到均值 0、方差 1、无单位的变量。

为什么计量要关心四阶矩? 后面你会反复看到「四阶矩有限」这个条件:样本方差的一致性(第 3 章)、OLS 的大样本正态性(第 4 章)都需要它。它的直观意思是「极端离群值不太可能出现」。

2.3 两个随机变量

2.3.1 联合、边际与条件分布

原书 Table 2.2:\(X=0\) 表示下雨、\(X=1\) 表示不下雨;\(Y=0\) 表示长通勤、\(Y=1\) 表示短通勤。

下雨 \(X=0\) 不下雨 \(X=1\) 合计
长通勤 \(Y=0\) 0.15 0.07 0.22
短通勤 \(Y=1\) 0.15 0.63 0.78
合计 0.30 0.70 1.00
  • 联合分布(joint distribution):\(\Pr(X=x,Y=y)\),表内四格。
  • 边际分布(marginal distribution):对另一个变量求和,\(\Pr(Y=y)=\sum_i\Pr(X=x_i,Y=y)\),即表的行、列合计。
  • 条件分布(conditional distribution):
\[\Pr(Y=y\mid X=x)=\frac{\Pr(X=x,Y=y)}{\Pr(X=x)}.\]

例:\(\Pr(Y=0\mid X=0)=0.15/0.30=0.50\),下雨天长短通勤各占一半。

2.3.2 条件期望与迭代期望定律

条件期望(conditional expectation)是用条件分布算出的期望:

\[E(Y\mid X=x)=\sum_i y_i\Pr(Y=y_i\mid X=x).\]

原书 Table 2.3:一半时间在图书馆(新网络,\(A=1\))、一半在宿舍(旧网络,\(A=0\))写论文,掉线次数的条件分布为

\[\Pr(M\mid A=0)=(0.70,0.13,0.10,0.05,0.02),\qquad \Pr(M\mid A=1)=(0.90,0.07,0.02,0.01,0.00).\]

于是 \(E(M\mid A=0)=0.56\),\(E(M\mid A=1)=0.14\)。

迭代期望定律(law of iterated expectations):\(Y\) 的均值等于条件均值按 \(X\) 的分布加权平均,

\[E(Y)=\sum_i E(Y\mid X=x_i)\Pr(X=x_i)=E\big[E(Y\mid X)\big].\]

验证:\(E(M)=0.56\times0.5+0.14\times0.5=0.35\),与直接计算一致。它对多个条件变量同样成立:\(E(Y)=E[E(Y\mid X,Z)]\)。

重要推论:若 \(E(Y\mid X)=0\),则 \(E(Y)=0\)。第 4 章的最小二乘假设 \(E(u_i\mid X_i)=0\) 就会用到这一推论。

白话解释:\(E(Y\mid X)\) 有两种读法,容易混。\(E(Y\mid X=x)\) 是一个数:只看 \(X=x\) 那部分情形时 \(Y\) 的平均。\(E(Y\mid X)\)(不写 \(=x\))是一个随机变量:它是 \(X\) 的函数,\(X\) 取哪个值,它就取对应的条件均值。在本例中 \(E(M\mid A)\) 以 0.5 的概率取 0.56、以 0.5 的概率取 0.14。迭代期望定律 \(E[E(Y\mid X)]\) 就是对这个随机变量再求一次普通期望。 金融直觉:这就是分部门汇总。公司整体毛利率 = 各事业部毛利率按收入占比加权平均。各部门的毛利率是「条件均值」,收入占比是「\(X\) 的分布」,加权结果就是「无条件均值」。推论「\(E(Y\mid X)=0\Rightarrow E(Y)=0\)」等于说:若每个部门的平均都是 0,全公司的平均当然是 0。反过来不成立,全公司平均为 0 可以是有的部门正、有的部门负。

条件方差(conditional variance)\(\operatorname{var}(Y\mid X=x)=\sum_i[y_i-E(Y\mid X=x)]^2\Pr(Y=y_i\mid X=x)\)。例:\(\operatorname{var}(M\mid A=0)\approx0.99\)(标准差 0.99),\(\operatorname{var}(M\mid A=1)\approx0.22\)(标准差 0.47)。新网络不仅平均掉线少,波动也小。条件方差随条件变量变化,就是后面「异方差」的含义。

贝叶斯法则(Bayes' rule):

\[\Pr(Y=y\mid X=x)=\frac{\Pr(X=x\mid Y=y)\Pr(Y=y)}{\Pr(X=x)}.\]

例:已知你昨晚掉线 3 次,你在宿舍的概率为 \(0.025/(0.025+0.005)\approx83\%\)(原书习题 2.28)。

2.3.3 条件均值是最优预测

这是本章对回归分析最重要的一个结论。

问题:只知道 \(X\),怎样给出 \(Y\) 的最佳预测 \(g(X)\)?要先定义损失。若大误差的代价不成比例地高(误差加倍、成本四倍),自然采用二次损失,即最小化均方预测误差:

\[\text{Loss}=E\{[Y-g(X)]^2\}.\]

结论:\(g(X)=E(Y\mid X)\) 使均方预测误差最小。

证明思路(附录 2.2):

  1. 先解一个更简单的问题:用常数 \(m\) 预测 \(Y\)。对 \(E[(Y-m)^2]=\sum_i(y_i-m)^2p_i\) 求导:\(-2\sum_i(y_i-m)p_i=0\),得 \(m=E(Y)\)。
  2. 由迭代期望,\(\text{Loss}=E\big(E\{[Y-g(X)]^2\mid X\}\big)\)。只要对每个 \(x\) 都最小化内层条件期望,就能最小化总损失。固定 \(X=x\) 时 \(g(x)\) 只是一个数,问题退化为第 1 步,最优解是 \(E(Y\mid X=x)\)。

不用微积分的证明(习题 2.27):令 \(\hat Y=E(Y\mid X)\),\(u=Y-\hat Y\),可证 \(E(u)=0\)、\(E[u\,h(X)]=0\) 对任意函数 \(h\) 成立,于是对任意 \(\tilde Y=g(X)\),

\[E[(Y-\tilde Y)^2]=E[(Y-\hat Y)^2]+E[(\hat Y-\tilde Y)^2]\ge E[(Y-\hat Y)^2].\]

推导拆解:把两种证明各展开一步。 微积分证明第 1 步:\(\frac{d}{dm}\sum_i(y_i-m)^2p_i=\sum_i 2(y_i-m)(-1)p_i\)。这里对每一项用了链式法则:外层是平方,导数 \(2(\cdot)\);内层 \(y_i-m\) 对 \(m\) 的导数是 \(-1\)。令其为 0 得 \(\sum_i y_ip_i=m\sum_ip_i=m\),即 \(m=E(Y)\)。二阶导数是 \(2>0\),所以是最小值而不是最大值。 不用微积分的证明:

  1. 先写 \(Y-\tilde Y=(Y-\hat Y)+(\hat Y-\tilde Y)=u+(\hat Y-\tilde Y)\),只是加一项减一项。
  2. 平方后取期望:\(E[(Y-\tilde Y)^2]=E(u^2)+2E[u(\hat Y-\tilde Y)]+E[(\hat Y-\tilde Y)^2]\)。
  3. 关键是中间的交叉项为 0。\(\hat Y-\tilde Y=E(Y\mid X)-g(X)\) 只依赖 \(X\),记作 \(h(X)\)。用迭代期望:\(E[u\,h(X)]=E\{h(X)\,E(u\mid X)\}\),给定 \(X\) 时 \(h(X)\) 是已知数,可以提到条件期望外面。又 \(E(u\mid X)=E(Y\mid X)-\hat Y=0\),所以交叉项为 0。
  4. 剩下的 \(E[(\hat Y-\tilde Y)^2]\ge0\),平方的期望不会是负数,于是不等式成立;等号只在 \(\tilde Y=\hat Y\) 时取到。 这和 CFA 里「总平方和 = 回归平方和 + 残差平方和」的分解是同一个结构:残差与任何 \(X\) 的函数正交,平方和就能拆开。

金融直觉:这个结论告诉你,凡是以 MSE 为目标训练的收益预测模型,不论线性回归还是神经网络,追逐的都是同一个目标 \(E(r_{t+1}\mid\text{当前信息})\)。模型之间的差别只在于对这个条件均值的近似有多好。

计量意义:第 4 章的「总体回归函数」就是 \(E(Y\mid X)\)。线性回归把它近似成 \(\beta_0+\beta_1X\),所以回归首先是一个「最优预测」工具。

2.3.4 独立、协方差与相关

独立(independence):知道 \(X\) 不提供关于 \(Y\) 的任何信息,即 \(\Pr(Y=y\mid X=x)=\Pr(Y=y)\),等价于 \(\Pr(X=x,Y=y)=\Pr(X=x)\Pr(Y=y)\)。

协方差与相关系数:

\[\sigma_{XY}=\operatorname{cov}(X,Y)=E[(X-\mu_X)(Y-\mu_Y)],\qquad \operatorname{corr}(X,Y)=\frac{\sigma_{XY}}{\sigma_X\sigma_Y}\in[-1,1].\]

相关系数无量纲;为 0 时称不相关(uncorrelated)。

相关与条件均值:

\[\text{若 }E(Y\mid X)=\mu_Y,\ \text{则 }\operatorname{cov}(Y,X)=0.\]

证明(先设均值为 0):\(\operatorname{cov}(Y,X)=E(YX)=E[E(YX\mid X)]=E[X\,E(Y\mid X)]=0\)。

推导拆解:四个等号各用了什么。

  1. \(\operatorname{cov}(Y,X)=E(YX)\):协方差公式 \(E(XY)-\mu_X\mu_Y\),均值为 0 时后一项消失。
  2. \(E(YX)=E[E(YX\mid X)]\):迭代期望定律,把 \(YX\) 当作新的「\(Y\)」。
  3. \(E(YX\mid X)=X\,E(Y\mid X)\):给定 \(X\) 时 \(X\) 是已知常数,可以提出条件期望,这一步常被称为「把已知的拿出来」。
  4. \(=0\):假设 \(E(Y\mid X)=\mu_Y=0\),所以 \(X\cdot0=0\)。 若均值不为 0,对 \(X-\mu_X\) 和 \(Y-\mu_Y\) 重复同样的步骤即可。

三个条件的强弱关系是:

\[\text{独立}\ \Longrightarrow\ E(Y\mid X)=\mu_Y\ \Longrightarrow\ \text{不相关},\]

两个箭头都不可逆。反例:\(X\) 对称分布、\(Y=X^2+Z\)(\(Z\) 与 \(X\) 独立且均值为 0),则 \(E(Y\mid X)=X^2\) 明显依赖 \(X\),但 \(\operatorname{corr}(X,Y)=0\)(习题 2.23)。

这条强弱关系是第 4 章的伏笔:OLS 的关键假设 \(E(u_i\mid X_i)=0\) 强于「\(X_i\) 与 \(u_i\) 不相关」。实际中常反过来用:若 \(X\) 与 \(u\) 可能相关,假设就被违背了。

2.3.5 随机变量之和

Key Concept 2.3(\(a,b,c\) 为常数)

\[E(a+bX+cY)=a+b\mu_X+c\mu_Y\]
\[\operatorname{var}(aX+bY)=a^2\sigma_X^2+2ab\sigma_{XY}+b^2\sigma_Y^2\]
\[E(Y^2)=\sigma_Y^2+\mu_Y^2,\qquad E(XY)=\sigma_{XY}+\mu_X\mu_Y\]
\[\operatorname{cov}(a+bX+cV,Y)=b\sigma_{XY}+c\sigma_{VY}\]
\[|\operatorname{corr}(X,Y)|\le1\]

方差公式都是展开平方后套用定义。相关不等式的证明值得记住:取 \(a=-\sigma_{XY}/\sigma_X^2\),则

\[0\le\operatorname{var}(aX+Y)=\sigma_Y^2-\frac{\sigma_{XY}^2}{\sigma_X^2}\ \Longrightarrow\ \sigma_{XY}^2\le\sigma_X^2\sigma_Y^2.\]

这里的 \(a\) 正是 \(Y\) 对 \(X\) 做投影的系数,\(aX+Y\) 是投影残差——第 4 章的 OLS 斜率在总体中就是 \(\sigma_{XY}/\sigma_X^2\)。

推导拆解:代入 \(a=-\sigma_{XY}/\sigma_X^2\) 到 Key Concept 2.3 的方差公式(\(b=1\)): \(\operatorname{var}(aX+Y)=a^2\sigma_X^2+2a\sigma_{XY}+\sigma_Y^2=\dfrac{\sigma_{XY}^2}{\sigma_X^4}\sigma_X^2-2\dfrac{\sigma_{XY}}{\sigma_X^2}\sigma_{XY}+\sigma_Y^2=\dfrac{\sigma_{XY}^2}{\sigma_X^2}-\dfrac{2\sigma_{XY}^2}{\sigma_X^2}+\sigma_Y^2=\sigma_Y^2-\dfrac{\sigma_{XY}^2}{\sigma_X^2}\)。 方差非负,所以 \(\sigma_{XY}^2\le\sigma_X^2\sigma_Y^2\),两边开方除以 \(\sigma_X\sigma_Y\) 即得 \(|\operatorname{corr}|\le1\)。 为什么偏偏选这个 \(a\)?因为它让 \(\operatorname{var}(aX+Y)\) 最小(对 \(a\) 求导:\(2a\sigma_X^2+2\sigma_{XY}=0\))。

金融直觉:\(-a=\sigma_{XY}/\sigma_X^2\) 就是 beta。\(Y+aX=Y-\beta X\) 是对冲掉市场暴露后的残余收益。上式说:对冲后的方差 = 原方差 − \(\beta^2\sigma_X^2\),即总风险 = 系统性风险 + 特质风险,和 CAPM 的方差分解完全一致。最优对冲比率(期货 minimum variance hedge ratio)也是这个公式。

专栏(英国成年收入与童年背景):按父亲职业等级(高级、中级、常规)分组,2009–2010 年的成年家庭月收入条件均值分别为 £3,149、£2,692、£2,441,标准差分别为 £2,434、£2,188、£1,879;高分位上的差距更大(90 分位:£5,629 对 £4,340)。这是「条件分布随条件变量变化」的直观例子,但它能否说明因果?要等到回归章节回答。

2.4 正态、卡方、t 与 F 分布

正态分布 \(N(\mu,\sigma^2)\) 关于均值对称,95% 的概率落在 \(\mu\pm1.96\sigma\) 之间,偏度 0、峰度 3。标准正态 \(Z\sim N(0,1)\) 的 c.d.f. 记为 \(\Phi\)。计算一般正态概率先标准化:

\[Y\sim N(1,4):\quad \Pr(Y\le2)=\Pr\!\left(Z\le\tfrac{2-1}{2}\right)=\Phi(0.5)=0.691.\]

多元正态(multivariate normal)的四条性质在回归理论中反复使用:

  1. 线性组合仍正态:\(aX+bY\sim N(a\mu_X+b\mu_Y,\ a^2\sigma_X^2+b^2\sigma_Y^2+2ab\sigma_{XY})\);
  2. 每个边际分布都是正态;
  3. 协方差为 0 则独立(这是多元正态特有的性质);
  4. 二元正态时 \(E(Y\mid X=x)=a+bx\) 是线性的(反之不成立)。

由正态派生的三个分布:

分布 构造 要点
\(\chi^2_m\) \(m\) 个独立标准正态的平方和 \(\chi^2_3\) 的 95 分位数为 7.81
\(t_m\) \(Z/\sqrt{W/m}\),\(W\sim\chi^2_m\) 与 \(Z\) 独立 比正态尾部厚;\(m\ge30\) 时接近正态;\(t_\infty=N(0,1)\)
\(F_{m,n}\) \((W/m)/(V/n)\),\(W\sim\chi^2_m\)、\(V\sim\chi^2_n\) 独立 \(F_{m,\infty}=\chi^2_m/m\),例如 \(F_{3,\infty}\) 的 95 分位数 \(=7.81/3=2.60\)

\(F_{m,\infty}=\chi^2_m/m\) 的原因:\(V/n\) 是 \(n\) 个标准正态平方的均值,\(n\to\infty\) 时趋于 1。原书附表:\(F_{3,30}\) 的 95 分位数为 2.92,\(F_{3,90}\) 为 2.71,随 \(n\) 增大趋于 2.60。这在第 7 章的 F 检验中会用到。

专栏:瑞士法郎脱钩。2015 年 1 月 15 日,欧元兑瑞郎从 1.201 跌到 0.991,跌幅 17.472%;此前一年单日变动从未超过 0.544%,日变动标准差估计为 0.112%。按正态分布,这是 \(17.472/0.112=156\) 个标准差的事件,概率约 \(8\times10^{-5288}\)。错误不在计算,而在没有理解数据的生成过程:瑞士央行把汇率钉在每欧元 1.2008–1.236 瑞郎之间,钉住制造了低波动;钉住一取消,汇率自由浮动。类似地,2016 年 6 月 24 日英国脱欧公投后欧元兑英镑升值 6.17%,按前一年数据相当于 9.80 个标准差,表观概率 \(5.6\times10^{-23}\)。教训:假设数据正态、或用近期观测推断未来的取值范围,都很危险。

2.5 随机抽样与样本均值的分布

计量中几乎所有估计量都是样本的平均或加权平均,所以样本均值的分布是理解一切的起点。

简单随机抽样(simple random sampling):从总体中随机选 \(n\) 个对象,每个成员被选中的可能性相同。由此得到的 \(Y_1,\dots,Y_n\):

  • 每个 \(Y_i\) 的边际分布都是总体分布——同分布;
  • 知道 \(Y_1\) 不提供关于 \(Y_2\) 的信息——独立。

合称独立同分布(independently and identically distributed, i.i.d.)。

关键概念:抽样前,\(Y_1,\dots,Y_n\) 是随机变量,所以样本均值

\[\bar Y=\frac1n\sum_{i=1}^nY_i\]

也是随机变量;换一批样本就会算出不同的 \(\bar Y\)。\(\bar Y\) 的概率分布称为抽样分布(sampling distribution)。

若 \(Y_i\) i.i.d.,均值 \(\mu_Y\),方差 \(\sigma_Y^2\),则(无论 \(Y\) 服从什么分布)

\[E(\bar Y)=\mu_Y,\qquad \operatorname{var}(\bar Y)=\frac{\sigma_Y^2}{n},\qquad \operatorname{sd}(\bar Y)=\frac{\sigma_Y}{\sqrt n}.\]

方差公式的推导:\(\operatorname{var}(\bar Y)=\frac1{n^2}\sum_i\operatorname{var}(Y_i)+\frac1{n^2}\sum_i\sum_{j\ne i}\operatorname{cov}(Y_i,Y_j)\),独立时交叉项为 0。注意区分 \(\sigma_Y^2\)(单个观测的方差)与 \(\sigma_{\bar Y}^2\)(样本均值抽样分布的方差)。若总体本身正态,则 \(\bar Y\sim N(\mu_Y,\sigma_Y^2/n)\) 精确成立。

专栏:分散化。把 1 美元平均分给 \(n\) 个资产,组合收益 \(\bar Y=\frac1n\sum Y_i\)。设每个资产期望收益 \(\mu_Y\)、方差 \(\sigma^2\)、两两相关系数 \(\rho>0\)。此时交叉项不再为 0:

\[\operatorname{var}(\bar Y)=\frac{\sigma^2}{n}+\frac{n-1}{n}\rho\sigma^2\ \xrightarrow{n\to\infty}\ \rho\sigma^2.\]

期望收益不变,方差从 \(\sigma^2\) 降到 \(\rho\sigma^2\)。但分散化有极限:资产收益通常正相关,\(n\) 再大也剩下 \(\rho\sigma^2\)——这就是系统性风险。

推导拆解:从 \(\operatorname{var}(\bar Y)=\frac1{n^2}\big[\sum_i\operatorname{var}(Y_i)+\sum_i\sum_{j\ne i}\operatorname{cov}(Y_i,Y_j)\big]\) 出发。

  1. 这个式子来自「和的方差 = 所有方差之和 + 所有两两协方差之和」,是 Key Concept 2.3 推广到 \(n\) 项;前面的 \(1/n^2\) 是把常数 \(1/n\) 平方后提出来。
  2. 对角项:\(n\) 个 \(\sigma^2\),贡献 \(n\sigma^2/n^2=\sigma^2/n\)。
  3. 交叉项:\(i\ne j\) 的有序对共 \(n(n-1)\) 个,每个协方差都是 \(\rho\sigma^2\),贡献 \(n(n-1)\rho\sigma^2/n^2=\frac{n-1}{n}\rho\sigma^2\)。
  4. \(n\to\infty\) 时 \(\sigma^2/n\to0\),\(\frac{n-1}{n}\to1\),极限为 \(\rho\sigma^2\)。 i.i.d. 情形就是 \(\rho=0\),只剩第 2 步,得 \(\sigma^2/n\)。这一对比提示了后面的重要问题:观测之间若相关(例如时间序列自相关、同一行业股票的截面相关),\(\operatorname{var}(\bar Y)\) 会比 \(\sigma^2/n\) 大,用 i.i.d. 公式算出的标准误就会偏小。第 15a 章的 HAC 标准误、面板中的聚类标准误都是在修正这一点。

2.6 大样本近似:大数定律与中心极限定理

刻画抽样分布有两种途径:精确分布(exact / finite-sample distribution)对任意 \(n\) 成立,但 \(Y\) 非正态时一般极其复杂;渐近分布(asymptotic distribution)在 \(n\to\infty\) 时成立,通常在 \(n\) 为几百时已是很好的近似。计量实践中样本量通常是数百到数千,所以全书采用渐近方法。两个基本工具如下。

Key Concept 2.6 依概率收敛与大数定律 若对任意 \(c>0\),\(\Pr(|\bar Y-\mu_Y|<c)\to1\),则称 \(\bar Y\) 依概率收敛(converges in probability)于 \(\mu_Y\),或称 \(\bar Y\) 是 \(\mu_Y\) 的一致(consistent)估计,记 \(\bar Y\xrightarrow{p}\mu_Y\)。 大数定律(law of large numbers, LLN):若 \(Y_i\) i.i.d.,\(E(Y_i)=\mu_Y\),\(\operatorname{var}(Y_i)<\infty\),则 \(\bar Y\xrightarrow{p}\mu_Y\)。

方差有限的意思是极端离群值很少,否则少数极端值会主导样本均值。原书例子:短通勤 \(Y_i=1\) 的概率为 0.78,\(n=2\) 时 \(\bar Y\) 只能取 0、½、1,都不接近 0.78;\(n=100\) 时 \(\bar Y\) 的分布已紧紧围绕 0.78。

Key Concept 2.7 中心极限定理(central limit theorem, CLT) 设 \(Y_i\) i.i.d.,\(E(Y_i)=\mu_Y\),\(0<\sigma_Y^2<\infty\)。当 \(n\to\infty\) 时,

\[\frac{\bar Y-\mu_Y}{\sigma_{\bar Y}}=\frac{\sqrt n(\bar Y-\mu_Y)}{\sigma_Y}\ \text{的分布趋于}\ N(0,1).\]

两者的分工要分清:LLN 说 \(\bar Y\) 本身收敛到一个常数(分布塌缩成一点);CLT 说把偏差放大 \(\sqrt n\) 倍后,形状趋于正态。CLT 让我们不必知道总体分布就能做推断,这是全书回归理论的基础。

白话解释:「依概率收敛」的定义读法:任意给一个容忍度 \(c\)(比如 0.001),只要样本足够大,\(\bar Y\) 落在 \(\mu_Y\pm c\) 之外的概率就可以小到任意程度。它不保证每一次抽样都准,只保证「偏离超过 \(c\)」越来越罕见。 为什么 CLT 要乘 \(\sqrt n\)?因为 \(\bar Y-\mu_Y\) 的标准差是 \(\sigma_Y/\sqrt n\),会缩到 0。不放大的话只能看到一个点,看不出形状;乘以 \(\sqrt n\) 正好把标准差稳定在 \(\sigma_Y\),形状才可见。这就像看收益率:日波动 1%,年化要乘 \(\sqrt{250}\),因为方差随期数线性累加,标准差按平方根累加。 为何对回归重要:第 4 章会看到,OLS 斜率可以写成「真值 + 某种样本均值」。于是 LLN 给出一致性(样本大了斜率估计接近真值),CLT 给出近似正态(可以用 \(\pm1.96\) 倍标准误做置信区间)。这就是本书不需要假设误差正态的原因:正态性来自 CLT,而不是来自对数据的假设。

多大才算大? 取决于总体分布。总体正态时任何 \(n\) 都精确;原书用一个右偏分布演示:\(n=5\) 时抽样分布仍明显偏斜,\(n=25\) 时接近钟形但仍有缺陷,\(n=100\) 时正态近似已很好。对许多总体分布,\(n\ge100\) 时正态近似通常都很好。


量化实战

本章的工具在量化中有四个直接用途。

1. 收益分布刻画与尾部风险。 偏度和峰度是描述资产收益的标准统计量;日收益普遍厚尾(峰度远大于 3),股票指数常见负偏。瑞郎脱钩是「用正态估计尾部风险会严重低估」的教科书案例,直接对应 VaR/ES 建模中正态假设的失败。还要注意「低波动不等于低风险」:钉住汇率、卖出期权、做空波动率策略在平静期波动都很低,但藏着跳跃风险。用历史标准差做风险预算时,要问一句「这段历史的低波动是被什么制度制造出来的」。

2. 组合方差与分散化。 \(\operatorname{var}(aX+bY)\) 就是两资产组合方差公式,是均值-方差优化的起点;等权组合方差趋于 \(\rho\sigma^2\) 说明系统性风险不可分散,这是因子风险模型把协方差拆成「因子部分 + 特质部分」的直觉来源(第 06 册、第 11 册)。

3. 预测目标。 条件均值是平方损失下的最优预测。所以无论是线性因子模型还是梯度提升树,只要以 MSE 为目标,估计的都是 \(E(r_{t+1}\mid\mathcal F_t)\)(\(\mathcal F_t\) 读作「F 下标 t」,表示截至 \(t\) 时刻已知的全部信息)。迭代期望定律也是资产定价中「价格 = 折现的条件期望」、鞅性质推导的基本工具。

4. 不相关 ≠ 独立。 日收益的自相关接近 0,但平方收益(波动率)高度自相关——这是「不相关但不独立」的典型,对应 \(Y=X^2+Z\) 的例子。它意味着收益不是 i.i.d. 的,第 06 册的 GARCH 模型正是为此而生。

下面的代码依次演示:瑞郎事件的正态概率、厚尾收益的极端事件频率、分散化公式、两资产最小方差组合(原书习题 2.22 的数字)、以及 CLT 在厚尾数据上的收敛速度。

import numpy as np
from scipy import stats

rng = np.random.default_rng(42)

# ---- 1. 「156 个标准差」:正态尾部概率有多荒谬 ----
z = 17.472 / 0.112
log10_p = stats.norm.logsf(z) / np.log(10)
print(f"瑞郎脱钩: z = {z:.0f}, 正态下 Pr(Z<-z) = 10^{log10_p:.1f}")

# ---- 2. 厚尾收益:t(5) 分布,标准化为日波动 1% ----
nu, T = 5, 250 * 20                       # 20 年日数据
r = stats.t.rvs(nu, size=T, random_state=rng) / np.sqrt(nu / (nu - 2)) * 0.01
print(f"样本偏度 {stats.skew(r):.2f}, 样本峰度 {stats.kurtosis(r, fisher=False):.2f}(正态为 3)")
k = 5
emp = np.mean(np.abs(r) > k * r.std())
print(f"|r| > {k} 个标准差: 实际频率 {emp:.2e}, 正态预测 {2*stats.norm.sf(k):.2e}")

# ---- 3. 分散化:等权组合方差 = σ²/n + (n-1)/n·ρσ² → ρσ² ----
sigma, rho, n_sims = 0.30, 0.25, 20000
for n in [1, 5, 20, 100]:
    C = sigma**2 * (rho * np.ones((n, n)) + (1 - rho) * np.eye(n))
    Y = rng.multivariate_normal(np.zeros(n), C, size=n_sims)
    port = Y.mean(axis=1)
    theory = sigma**2 / n + (n - 1) / n * rho * sigma**2
    print(f"n={n:3d}: 模拟方差 {port.var():.4f}, 公式 {theory:.4f}")
print(f"极限 ρσ² = {rho*sigma**2:.4f}")

# ---- 4. 两资产最小方差组合(原书习题 2.22 的数字) ----
ms, mb, ss, sb, c = 0.06, 0.04, 0.09, 0.05, 0.3
ssb = c * ss * sb
w_star = (sb**2 - ssb) / (ss**2 + sb**2 - 2 * ssb)
for w in [0.2, 0.8, w_star]:
    mu = w * ms + (1 - w) * mb
    sd = np.sqrt(w**2 * ss**2 + (1 - w)**2 * sb**2 + 2 * w * (1 - w) * ssb)
    print(f"w={w:.3f}: 均值 {mu:.4f}, 标准差 {sd:.4f}")

# ---- 5. CLT 与厚尾:样本均值的峰度随 n 下降 ----
for n in [1, 5, 20, 100]:
    means = (stats.t.rvs(nu, size=(50000, n), random_state=rng)).mean(axis=1)
    print(f"n={n:3d}: 样本均值的峰度 {stats.kurtosis(means, fisher=False):.2f}, 理论 3+6/n = {3+6/n:.2f}")

关键输出:

瑞郎脱钩: z = 156, 正态下 Pr(Z<-z) = 10^-5287.1
样本偏度 0.03, 样本峰度 7.33(正态为 3)
|r| > 5 个标准差: 实际频率 1.20e-03, 正态预测 5.73e-07
n=  1: 模拟方差 0.0905, 公式 0.0900
n=  5: 模拟方差 0.0361, 公式 0.0360
n= 20: 模拟方差 0.0260, 公式 0.0259
n=100: 模拟方差 0.0232, 公式 0.0232
极限 ρσ² = 0.0225
w=0.200: 均值 0.0440, 标准差 0.0485
w=0.800: 均值 0.0560, 标准差 0.0756
w=0.146: 均值 0.0429, 标准差 0.0483
n=  1: 样本均值的峰度 7.34, 理论 3+6/n = 9.00
n=  5: 样本均值的峰度 4.57, 理论 3+6/n = 4.20
n= 20: 样本均值的峰度 3.24, 理论 3+6/n = 3.30
n=100: 样本均值的峰度 3.07, 理论 3+6/n = 3.06

几点解读:

  • \(10^{-5287.1}\approx8\times10^{-5288}\),复现了原书数字。
  • 对 \(t(5)\) 收益,5 倍标准差事件的实际频率约为正态预测的 2000 倍。20 年日数据里大约出现 6 次,正态模型却说几千年一次。
  • \(t(5)\) 的理论峰度是 9,但单个 20 年样本只估出 7.33,模拟中 \(n=1\) 的峰度也只有 7.34。原因是峰度估计本身依赖八阶矩,厚尾时极不稳定。实务上不要迷信某个样本峰度的具体数值。
  • i.i.d. 样本均值的超额峰度按 \(1/n\) 衰减(\(3+6/n\)),所以 CLT 依然生效。但金融收益不是 i.i.d.(波动聚集),实际收敛比这慢;回测中「月度收益 30 个月就近似正态」这种经验法则要谨慎。
  • 最小方差权重 \(w^*=\dfrac{\sigma_b^2-\sigma_{sb}}{\sigma_s^2+\sigma_b^2-2\sigma_{sb}}\approx0.146\),组合标准差 4.83%,比全仓低风险基金(5%)还低——这就是分散化带来的「免费午餐」。

本章小结

概率论为计量提供了语言:期望、方差、条件分布描述单个和成对的随机变量;条件期望 \(E(Y\mid X)\) 是平方损失下的最优预测,它就是后文的总体回归函数;迭代期望定律把条件期望和无条件期望联系起来,并给出「\(E(Y\mid X)=0\Rightarrow E(Y)=0\)」。独立、条件均值不依赖 \(X\)、不相关三者依次变弱,OLS 的核心假设 \(E(u\mid X)=0\) 位于中间。正态、卡方、t、F 分布由标准正态构造而来,大样本下 \(t\to N(0,1)\)、\(F_{m,n}\to\chi^2_m/m\)。随机抽样让样本均值成为随机变量,i.i.d. 时其均值为 \(\mu_Y\)、方差为 \(\sigma_Y^2/n\);大数定律保证一致性,中心极限定理保证渐近正态,二者都需要方差有限。经济与金融数据常常厚尾,用正态外推尾部概率会严重出错。

概念 公式 / 要点
期望、方差 \(E(Y)=\sum y_ip_i\);\(\operatorname{var}(Y)=E[(Y-\mu_Y)^2]\)
线性变换 \(\operatorname{var}(a+bY)=b^2\sigma_Y^2\)
偏度、峰度 \(E[(Y-\mu)^3]/\sigma^3\);\(E[(Y-\mu)^4]/\sigma^4\),正态为 3
迭代期望 \(E(Y)=E[E(Y\mid X)]\)
最优预测 \(\arg\min_g E[(Y-g(X))^2]=E(Y\mid X)\)
强弱关系 独立 ⇒ \(E(Y\mid X)=\mu_Y\) ⇒ 不相关
和的方差 \(\operatorname{var}(aX+bY)=a^2\sigma_X^2+2ab\sigma_{XY}+b^2\sigma_Y^2\)
分散化极限 \(\sigma^2/n+\frac{n-1}{n}\rho\sigma^2\to\rho\sigma^2\)
派生分布 \(\chi^2_m\)、\(t_m=Z/\sqrt{W/m}\)、\(F_{m,n}\);\(F_{m,\infty}=\chi^2_m/m\)
样本均值 \(E(\bar Y)=\mu_Y\),\(\operatorname{var}(\bar Y)=\sigma_Y^2/n\)
LLN i.i.d. + 方差有限 ⇒ \(\bar Y\xrightarrow{p}\mu_Y\)
CLT \(\sqrt n(\bar Y-\mu_Y)/\sigma_Y\to N(0,1)\)

练习

基础

  1. 用 Table 2.2 计算 \(E(Y)\)、\(\operatorname{var}(Y)\)、\(\operatorname{cov}(X,Y)\) 与 \(\operatorname{corr}(X,Y)\)。(原书习题 2.2、2.3) 答案要点:\(E(Y)=0.78\),\(\operatorname{var}(Y)=0.78\times0.22=0.1716\);\(E(X)=0.70\),\(E(XY)=0.63\),\(\operatorname{cov}=0.63-0.546=0.084\);\(\operatorname{var}(X)=0.21\),\(\operatorname{corr}=0.084/\sqrt{0.21\times0.1716}\approx0.44\)。
  2. 验证 \(\operatorname{var}(M\mid A=1)\approx0.22\),并用迭代期望验证 \(E(M)=0.35\)。
  3. 卢加诺 7 月日最高温均值 65°F、标准差 5°F,换算成摄氏度(\(C=\frac59(F-32)\))后的均值、标准差各是多少?(原书习题 2.5) 答案:均值约 18.3°C,标准差约 2.8°C。
  4. \(Y\sim N(20,4)\),\(n=100\),求 \(\Pr(19.6\le\bar Y\le20.4)\)。(原书习题 2.15 改编) 答案:\(\operatorname{sd}(\bar Y)=0.2\),概率 \(=\Phi(2)-\Phi(-2)\approx0.954\)。

进阶

  1. 证明:若 \(X\) 关于 0 对称分布、\(Z\) 与 \(X\) 独立且 \(E(Z)=0\),令 \(Y=X^2+Z\),则 \(\operatorname{cov}(X,Y)=0\),但 \(E(Y\mid X)\) 依赖于 \(X\)。用金融语言解释这个例子。 提示:\(\operatorname{cov}(X,X^2)=E(X^3)=0\)。把 \(X\) 看作收益、\(Y\) 看作波动率代理变量。
  2. 两资产 \(R_s\)(均值 0.06、标准差 0.09)、\(R_b\)(均值 0.04、标准差 0.05),相关 0.3。推导使组合标准差最小的权重 \(w^*\) 的一般公式并代入数字。(原书习题 2.22) 答案:\(w^*=(\sigma_b^2-\sigma_{sb})/(\sigma_s^2+\sigma_b^2-2\sigma_{sb})\approx0.146\)。
  3. 推导等相关资产等权组合方差 \(\sigma^2/n+\frac{n-1}{n}\rho\sigma^2\)。若 \(\sigma=30\%\)、\(\rho=0.25\),要把组合波动降到 16% 以下至少需要几只股票?(原书习题 2.26 改编) 提示:解 \(0.09/n+0.0225(n-1)/n\le0.0256\),即 \(0.0675/n\le0.0031\),得 \(n\ge21.8\),至少 22 只。
  4. 设 \(X\sim\) Bernoulli(0.9),\(Y\sim N(0,4)\),\(W\sim N(0,16)\) 相互独立,\(S=XY+(1-X)W\)。用迭代期望求 \(S\) 的方差与峰度。(原书习题 2.13) 答案要点:\(E(S^2)=0.9\times4+0.1\times16=5.2\);\(E(S^4)=0.9\times3\times16+0.1\times3\times256=120\);峰度 \(=120/5.2^2\approx4.44>3\)。两个正态以不同波动混合就产生厚尾,这是「波动率状态切换」产生厚尾的原理。
  5. 证明不用微积分的结论:若 \(\hat Y=E(Y\mid X)\),则对任意 \(g\),\(E[(Y-g(X))^2]\ge E[(Y-\hat Y)^2]\)。(原书习题 2.27)
  6. 保险池:每户房屋每年 95% 的概率损失 0、5% 的概率损失 3 万美元。120 户组成的池子平均损失超过 3000 美元的概率约是多少?(原书习题 2.18) 提示:单户均值 1500、标准差 \(30000\sqrt{0.05\times0.95}\approx6538\);\(\operatorname{sd}(\bar Y)\approx597\);\(\Pr(Z>2.51)\approx0.006\)。

原书推荐习题:2.13、2.18、2.22、2.23、2.26、2.27、2.28;查表练习 2.10–2.12。


原书对照

本章内容 原书章节 PDF 页码
随机变量、概率分布、c.d.f.、p.d.f. 2.1 p.57–60
期望、方差、偏度、峰度、标准化 2.2 p.61–66
联合/边际/条件分布、迭代期望、贝叶斯、独立、协方差、相关、和的方差 2.3 p.66–76
英国收入专栏 2.3 p.73–74
正态、多元正态、卡方、t、F 2.4 p.76–82
瑞士法郎专栏 2.4 p.78–80
随机抽样、\(\bar Y\) 的分布、分散化专栏 2.5 p.82–86
LLN、CLT 2.6 p.86–91
小结、习题 第 2 章末 p.92–101
附录 2.1(Key Concept 2.3 推导)、附录 2.2(条件均值是最优预测) 附录 p.101–103

注:原书页码 = PDF 页码 − 1。