精读笔记:Larry Wasserman《All of Statistics: A Concise Course in Statistical Inference》(Springer, 2004;2005 修订二印)|负责范围:PDF 第 1–220 页
页码换算:PDF 页码 = 原书正文页码 + 17(例如原书 p.3 = PDF p.20)。本块覆盖前置部分、第 I 部分(第 1–5 章)、第 II 部分(第 6–12 章全部)以及第 III 部分第 13 章开头(13.1 节至例 13.6 中途,续见下一块)。
前置部分(PDF p.1–19)
- p.1–6:空白页、Springer Texts in Statistics 丛书目录、书名页("With 95 Figures")、版权页(ISBN 978-1-4419-2322-6,© 2004 Springer)、献词 "To Isa"。
- p.7–10 前言(Preface):
- 定位:给想"快速学会概率与统计"的人,适合计算机、数学、统计的研究生或高年级本科生;前提是微积分和一点线性代数,不需要概率统计基础。
- 作者观点:统计、数据挖掘、机器学习本质上都在"收集并分析数据";两边曾互相轻视,如今彼此承认对方的贡献。"不懂基础统计就用神经网络、boosting、SVM,好比还不会贴创可贴就去做脑外科手术。"
- 本书特点:①覆盖通常放在后续课程的现代主题(非参数回归、bootstrap、密度估计、图模型);②几乎不讲计数方法;③尽量回避繁琐计算,强调概念;④先讲非参数推断,再讲参数推断;⑤打破"第一学期概率、第二学期统计"的惯例(随机过程例外,放在后面);⑥节奏快、内容多;⑦"严谨不等于清晰",许多结果只陈述不证明,章末文献注指向出处;⑧作者网站提供 R 代码,但书不绑定任何语言。
- 结构:第 I 部分概率论——"给定数据生成过程(data generating process),结果有何性质?";第 II 部分统计推断——其逆问题"给定结果,关于生成数据的过程能说什么?";预测、分类、聚类、估计都是统计推断的特例。图 1 用双向箭头表示:概率从"数据生成过程"指向"观测数据",推断与数据挖掘方向相反。第 III 部分把第 II 部分用于回归、图模型、因果、密度估计、平滑、分类、模拟,并另含一章随机过程(含马尔可夫链)。
- 致谢:大量例题、习题改编自 DeGroot & Schervish (2002) 与 Grimmett & Stirzaker (1982)。
- p.11 统计/数据挖掘术语对照表(Statistics/Data Mining Dictionary),编写教材时可直接作为术语表:
| 统计学 | 计算机科学 | 含义 |
|---|---|---|
| estimation 估计 | learning 学习 | 用数据估计未知量 |
| classification 分类 | supervised learning 监督学习 | 由 X 预测离散的 Y |
| clustering 聚类 | unsupervised learning 无监督学习 | 把数据分组 |
| data 数据 | training sample 训练样本 | \((X_1,Y_1),\dots,(X_n,Y_n)\) |
| covariates 协变量 | features 特征 | 各 \(X_i\) |
| classifier 分类器 | hypothesis 假设 | 协变量到结果的映射 |
| hypothesis 假设 | — | 参数空间 \(\Theta\) 的子集 |
| confidence interval 置信区间 | — | 以给定频率包含未知量的区间 |
| directed acyclic graph 有向无环图 | Bayes net 贝叶斯网 | 具有给定条件独立关系的多元分布 |
| Bayesian inference 贝叶斯推断 | Bayesian inference | 用数据更新信念的统计方法 |
| frequentist inference 频率学派推断 | — | 具有频率保证的统计方法 |
| large deviation bounds 大偏差界 | PAC learning PAC 学习 | 误差概率的一致界 |
- p.12–18 目录:全书 24 章,三部分。第 I 部分:1 概率、2 随机变量、3 期望、4 不等式、5 随机变量的收敛。第 II 部分:6 模型、统计推断与学习,7 估计 CDF 与统计泛函,8 Bootstrap,9 参数推断,10 假设检验与 p 值,11 贝叶斯推断,12 统计决策理论。第 III 部分:13 线性与 logistic 回归,14 多元模型,15 独立性推断,16 因果推断,17 有向图与条件独立,18 无向图,19 对数线性模型,20 非参数曲线估计,21 用正交函数平滑,22 分类,23 随机过程,24 模拟方法;最后为索引。
- p.19:第 I 部分 "Probability" 扉页。
第 I 部分 概率(Probability)
第 1 章 概率(Probability)(PDF p.20–34)
1.1 引言(PDF p.20)
概率是量化不确定性的数学语言。本章从样本空间(所有可能结果的集合)讲起。
1.2 样本空间与事件(Sample Spaces and Events)(PDF p.20–22)
定义:样本空间(sample space)\(\Omega\) 是某个试验所有可能结果的集合;\(\Omega\) 中的点 \(\omega\) 称为样本结果(sample outcome)、实现(realization)或元素;\(\Omega\) 的子集称为事件(event)。
例 1.1:掷硬币两次,\(\Omega=\{HH,HT,TH,TT\}\),"第一次为正面"的事件 \(A=\{HH,HT\}\)。 例 1.2:测量温度,取 \(\Omega=\mathbb R=(-\infty,\infty)\)。虽然温度有下界,但把样本空间取得比必要更大通常无害。事件"测量值大于 10 且不超过 23"为 \(A=(10,23]\)。 例 1.3:无限次掷硬币,\(\Omega=\{\omega=(\omega_1,\omega_2,\dots):\omega_i\in\{H,T\}\}\);"第一次正面出现在第三次"的事件 \(E=\{\omega:\omega_1=T,\omega_2=T,\omega_3=H,\ \omega_i\in\{H,T\},i>3\}\)。
集合运算:
- 补集(complement)\(A^c=\{\omega\in\Omega:\omega\notin A\}\),读作"非 A";\(\Omega^c=\emptyset\)。
- 并 \(A\cup B\)("A 或 B");可列并 \(\bigcup_{i=1}^\infty A_i=\{\omega:\omega\in A_i \text{ 对至少一个 } i\}\)。
- 交 \(A\cap B\)("A 且 B"),也写 \(AB\) 或 \((A,B)\);可列交 \(\bigcap_{i=1}^\infty A_i=\{\omega:\omega\in A_i\ \forall i\}\)。
- 差 \(A-B=\{\omega:\omega\in A,\omega\notin B\}\);包含 \(A\subset B\);\(|A|\) 表示有限集 \(A\) 的元素个数。
- 术语表:\(\emptyset\) 为不可能事件(null event,总为假),\(\Omega\) 为必然事件(true event,总为真)。
互斥与划分:若 \(i\ne j\) 时 \(A_i\cap A_j=\emptyset\),称 \(A_1,A_2,\dots\) 不相交(disjoint)或互斥(mutually exclusive),例如 \([0,1),[1,2),[2,3),\dots\)。若互斥且 \(\bigcup A_i=\Omega\),则称为 \(\Omega\) 的一个划分(partition)。
示性函数(indicator function):\(I_A(\omega)=1\)(若 \(\omega\in A\)),否则为 0。
单调序列:若 \(A_1\subset A_2\subset\cdots\) 称单调递增,定义 \(\lim A_n=\bigcup_{i}A_i\);若 \(A_1\supset A_2\supset\cdots\) 称单调递减,定义 \(\lim A_n=\bigcap_i A_i\)。两种情形都记 \(A_n\to A\)。
例 1.4:\(\Omega=\mathbb R\),\(A_i=[0,1/i)\),则 \(\bigcup A_i=[0,1)\),\(\bigcap A_i=\{0\}\);若改为 \(A_i=(0,1/i)\),则 \(\bigcup A_i=(0,1)\),\(\bigcap A_i=\emptyset\)。(提示教材:开闭端点决定极限集合是否为空。)
1.3 概率(Probability)(PDF p.22–24)
定义 1.5(概率公理):函数 \(\mathbb P\) 对每个事件 \(A\) 赋予实数 \(\mathbb P(A)\),若满足以下三条公理,则称为概率分布(probability distribution)或概率测度(probability measure):
- \(\mathbb P(A)\ge 0\);
- \(\mathbb P(\Omega)=1\);
- 可列可加性:若 \(A_1,A_2,\dots\) 互斥,则 \(\mathbb P\left(\bigcup_{i=1}^\infty A_i\right)=\sum_{i=1}^\infty \mathbb P(A_i)\)。
脚注:样本空间很大(如整条实轴)时,不可能对每个子集都赋概率,只能对一类称为 σ-域(σ-field)的集合赋值,见附录。
两种解释:频率解释——\(\mathbb P(A)\) 是重复试验中 \(A\) 发生的长期比例("无限长、不可预测、极限比例趋于常数"的序列是一种理想化,如几何中的直线);信念度解释——观察者对 \(A\) 为真的信念强度。两种解释都要求满足公理;差别要到统计推断时才显现,引出频率学派与贝叶斯学派(第 11 章讨论)。
由公理推出的性质 (1.1):\(\mathbb P(\emptyset)=0\);\(A\subset B\Rightarrow \mathbb P(A)\le\mathbb P(B)\);\(0\le\mathbb P(A)\le1\);\(\mathbb P(A^c)=1-\mathbb P(A)\);\(A\cap B=\emptyset\Rightarrow\mathbb P(A\cup B)=\mathbb P(A)+\mathbb P(B)\)。
引理 1.6(加法公式):\(\mathbb P(A\cup B)=\mathbb P(A)+\mathbb P(B)-\mathbb P(AB)\)。 证明思路:把 \(A\cup B\) 写成三个互斥事件之并 \((AB^c)\cup(AB)\cup(A^cB)\),用可加性得 \(\mathbb P(AB^c)+\mathbb P(AB)+\mathbb P(A^cB)\),再加减一次 \(\mathbb P(AB)\),凑成 \(\mathbb P(A)+\mathbb P(B)-\mathbb P(AB)\)。
例 1.7:两次掷硬币,\(H_1,H_2\) 分别为第 1、2 次正面。若四个结果等可能,\(\mathbb P(H_1\cup H_2)=\mathbb P(H_1)+\mathbb P(H_2)-\mathbb P(H_1H_2)=\tfrac12+\tfrac12-\tfrac14=\tfrac34\)。
定理 1.8(概率的连续性,Continuity of Probabilities):若 \(A_n\to A\),则 \(\mathbb P(A_n)\to\mathbb P(A)\)(\(n\to\infty\))。 证明(递增情形):令 \(B_1=A_1\),\(B_2=A_2\setminus A_1\),\(B_3=A_3\setminus(A_1\cup A_2)\),…;可证 \(B_i\) 互斥,\(A_n=\bigcup_{i\le n}A_i=\bigcup_{i\le n}B_i\),且 \(\bigcup_i B_i=\bigcup_i A_i\)(习题 1)。由公理 3,\(\mathbb P(A_n)=\sum_{i=1}^n\mathbb P(B_i)\),于是 \(\lim_n\mathbb P(A_n)=\sum_{i=1}^\infty\mathbb P(B_i)=\mathbb P(\bigcup B_i)=\mathbb P(A)\)。递减情形取补集即可(习题 1)。
1.4 有限样本空间上的概率(Probability on Finite Sample Spaces)(PDF p.24–25)
\(\Omega=\{\omega_1,\dots,\omega_n\}\) 有限且每个结果等可能时,\(\mathbb P(A)=|A|/|\Omega|\),称为均匀概率分布(uniform probability distribution)。例:掷骰子两次,\(|\Omega|=36\),"点数和为 11"包含 (5,6),(6,5),概率 \(2/36\)。
计算需要计数(combinatorial methods),本书只用少量事实:\(n\) 个对象的排列数 \(n!=n(n-1)\cdots1\),约定 \(0!=1\);二项式系数
1.5 独立事件(Independent Events)(PDF p.25–27)
定义 1.9:若 \(\mathbb P(AB)=\mathbb P(A)\mathbb P(B)\) (1.3),称 \(A,B\) 独立,记 \(A\perp\!\!\!\perp B\)。一族事件 \(\{A_i:i\in I\}\) 独立,指对 \(I\) 的每个有限子集 \(J\) 都有 \(\mathbb P(\bigcap_{i\in J}A_i)=\prod_{i\in J}\mathbb P(A_i)\)。不独立记作 \(A\not\!\perp\!\!\!\perp B\)。
独立性的两种来源:一是假设(掷硬币两次时假设硬币"没有记忆");二是验证推出。例:掷公平骰子,\(A=\{2,4,6\}\),\(B=\{1,2,3,4\}\),\(AB=\{2,4\}\),\(\mathbb P(AB)=2/6=(1/2)(2/3)\),故独立——这不是假设出来的,而是"恰好"成立。
常见误区:互斥且各自概率为正的事件不可能独立,因为 \(\mathbb P(A)\mathbb P(B)>0\) 而 \(\mathbb P(AB)=0\)。除此特殊情形外,无法从维恩图看出是否独立。
例 1.10:公平硬币掷 10 次,\(A\)="至少一次正面",\(\mathbb P(A)=1-\mathbb P(\text{全为反面})=1-\prod_{j=1}^{10}\mathbb P(T_j)=1-(1/2)^{10}\approx .999\)。
例 1.11(轮流投篮):甲命中率 1/3,乙 1/4,甲先投,轮流进行。令 \(A_j\) 为"首次命中者是甲且发生在第 \(j\) 轮",互斥。\(\mathbb P(A_1)=1/3\),\(\mathbb P(A_2)=(2/3)(3/4)(1/3)=(1/2)(1/3)\),一般 \(\mathbb P(A_j)=(1/2)^{j-1}(1/3)\)。于是
独立性小结:①\(A,B\) 独立当且仅当 \(\mathbb P(AB)=\mathbb P(A)\mathbb P(B)\);②独立性有时是假设、有时是推出;③概率为正的互斥事件不独立。
1.6 条件概率(Conditional Probability)(PDF p.27–29)
定义 1.12:若 \(\mathbb P(B)>0\),给定 \(B\) 时 \(A\) 的条件概率为
常见误区:一般 \(\mathbb P(A\mid B)\ne\mathbb P(B\mid A)\)。例:出麻疹则出疹子的概率为 1,但出疹子则得麻疹的概率不是 1。法律案件中常犯此错,称为"检察官谬误"(prosecutor's fallacy)。
例 1.13(医学检测):联合概率表:\(\mathbb P(D,+)=.009\),\(\mathbb P(D,-)=.001\),\(\mathbb P(D^c,+)=.099\),\(\mathbb P(D^c,-)=.891\)。
- 灵敏度 \(\mathbb P(+\mid D)=.009/(.009+.001)=.9\);特异度 \(\mathbb P(-\mid D^c)=.891/(.891+.099)\approx .9\),检测看似相当准确。
- 但检测阳性者患病概率 \(\mathbb P(D\mid +)=.009/(.009+.099)\approx .08\),多数人会错答 .90。教训:"必须用数字算,别相信直觉。"(根源是患病率仅 1%,基率很低。)
引理 1.14:若 \(A,B\) 独立,则 \(\mathbb P(A\mid B)=\mathbb P(A)\);对任意 \(A,B\),\(\mathbb P(AB)=\mathbb P(A\mid B)\mathbb P(B)=\mathbb P(B\mid A)\mathbb P(A)\)(乘法公式)。由此,独立的另一种理解是"知道 \(B\) 不改变 \(A\) 的概率"。
例 1.15:不放回抽两张牌,\(A\)=第一张是梅花 A,\(B\)=第二张是方块 Q,\(\mathbb P(AB)=\mathbb P(A)\mathbb P(B\mid A)=(1/52)(1/51)\)。
条件概率小结:①定义;②固定 \(B\) 时 \(\mathbb P(\cdot\mid B)\) 满足公理,但固定 \(A\) 时 \(\mathbb P(A\mid\cdot)\) 一般不满足;③一般 \(\mathbb P(A\mid B)\ne\mathbb P(B\mid A)\);④\(A,B\) 独立当且仅当 \(\mathbb P(A\mid B)=\mathbb P(A)\)。
1.7 贝叶斯定理(Bayes' Theorem)(PDF p.29–30)
贝叶斯定理是"专家系统"和"贝叶斯网"(第 17 章)的基础。
定理 1.16(全概率公式,Law of Total Probability):\(A_1,\dots,A_k\) 是 \(\Omega\) 的划分,则对任意事件 \(B\),
定理 1.17(贝叶斯定理):\(A_1,\dots,A_k\) 为划分且 \(\mathbb P(A_i)>0\),若 \(\mathbb P(B)>0\),则
例 1.19(垃圾邮件过滤):邮件分三类:\(A_1\) 垃圾 (.7)、\(A_2\) 低优先级 (.2)、\(A_3\) 高优先级 (.1)。\(B\)=含单词 "free",\(\mathbb P(B\mid A_1)=.9\),\(\mathbb P(B\mid A_2)=.01\),\(\mathbb P(B\mid A_3)=.01\)(注意 .9+.01+.01≠1,似然不必和为 1)。
1.8 文献注(PDF p.30)
入门:DeGroot & Schervish (2002);中级:Grimmett & Stirzaker (1982)、Karr (1993);高级:Billingsley (1979)、Breiman (1992)。
1.9 附录:σ-域(PDF p.30)
一般无法对 \(\Omega\) 的所有子集赋概率,只考虑 σ-代数(σ-algebra / σ-field)\(\mathcal A\):(i) \(\emptyset\in\mathcal A\);(ii) \(A_1,A_2,\dots\in\mathcal A\Rightarrow\bigcup A_i\in\mathcal A\);(iii) \(A\in\mathcal A\Rightarrow A^c\in\mathcal A\)。\(\mathcal A\) 中的集合称为可测的(measurable),\((\Omega,\mathcal A)\) 为可测空间,加上定义在 \(\mathcal A\) 上的概率测度得概率空间(probability space)\((\Omega,\mathcal A,\mathbb P)\)。\(\Omega=\mathbb R\) 时取包含所有开集的最小 σ-域,称 Borel σ-域。
1.10 习题(PDF p.30–34)概览
共 23 题:
- 证明类(1–4、7–9、11、14、16–18):补全定理 1.8 证明及递减情形;证明 (1.1);上极限/下极限集合(题 3:\(B_n=\bigcup_{i\ge n}A_i\) 递减、\(C_n=\bigcap_{i\ge n}A_i\) 递增,\(\omega\in\bigcap B_n\) 当且仅当 \(\omega\) 属于无穷多个 \(A_i\),\(\omega\in\bigcup C_n\) 当且仅当 \(\omega\) 至多不属于有限个 \(A_i\));德摩根律对任意指标集成立(题 4);次可加性 \(\mathbb P(\bigcup A_n)\le\sum\mathbb P(A_n)\)(题 7,提示令 \(B_n=A_n-\bigcup_{i<n}A_i\));\(\mathbb P(A_i)=1\ \forall i\Rightarrow\mathbb P(\bigcap A_i)=1\)(题 8);\(A,B\) 独立则 \(A^c,B^c\) 独立(题 11);概率为 0 或 1 的事件与任何事件独立、与自身独立则概率为 0 或 1(题 14);链式法则 \(\mathbb P(ABC)=\mathbb P(A\mid BC)\mathbb P(B\mid C)\mathbb P(C)\)(题 17);划分中若 \(\mathbb P(A_1\mid B)<\mathbb P(A_1)\) 则必有某个 \(A_i\) 后验上升(题 18)。
- 计算类:掷硬币直至两次正面所需次数(题 5);可数集 \(\{0,1,\dots\}\) 上不存在均匀分布(题 6);蒙提霍尔问题(题 10,应换门,换门胜率 2/3,取 \(\Omega=\{(\omega_1,\omega_2)\}\));三张卡片问题(题 12,答案 2/3);直到正反面都出现(题 13);三个孩子蓝眼睛的条件概率(题 15);电脑病毒的贝叶斯计算(题 19:Mac 30%/Windows 50%/Linux 20%,感染率 65%/82%/50%);五枚硬币的后验与预测(题 20,含"直到首次正面出现于第 4 次"的后验)。
- 计算机实验(21–23):模拟正面比例随 \(n\) 收敛(p=.3、.03);二项变量均值与 \(np\) 比较;模拟验证独立与不独立事件。
本章要点
- 概率建立在样本空间、事件(σ-域中的集合)与三条公理之上;所有常用性质(补集、单调性、加法公式、连续性)都由公理推出。
- 独立性是乘积条件 \(\mathbb P(AB)=\mathbb P(A)\mathbb P(B)\);互斥与独立是两回事,概率为正的互斥事件必不独立。
- 条件概率把"已知信息"转化为新的概率测度;\(\mathbb P(A\mid B)\) 与 \(\mathbb P(B\mid A)\) 混淆是最常见错误(检察官谬误、基率忽视)。
- 全概率公式与贝叶斯定理给出由先验到后验的更新规则,例 1.13 和 1.19 是标准教学案例。
与量化交易的关联
- 贝叶斯更新与基率:例 1.13 的逻辑直接对应"信号的条件胜率"。一个历史上 90% 准确的崩盘预警指标,若崩盘本身很罕见,触发后真正崩盘的概率可能很低;评估择时信号、异常检测告警、风控触发器时必须同时看基率。
- 市场状态(regime)识别:全概率公式把收益分布分解为各市场状态下条件分布的加权和;贝叶斯定理用于根据新观测更新"当前处于牛/熊/震荡"的后验概率(是 HMM 滤波的单步形式)。
- 独立性假设:多策略组合、多笔订单成交、违约事件常被假设独立,例 1.10 那种 \(1-(1-p)^n\) 计算在独立假设下成立,但金融事件在压力期高度相关,独立假设会严重低估联合尾部风险。
- 多重尝试:例 1.10 的思路也说明为何大量回测试验中"至少一个策略看起来显著"几乎必然发生,是第 10 章多重检验的伏笔。
推荐习题
- 题 3(上/下极限集合,为第 5 章几乎必然收敛打基础);题 7(次可加性,即 Bonferroni 不等式的来源);题 10(蒙提霍尔,训练严格写样本空间);题 12、15、19、20(条件概率与贝叶斯计算,题 20(b)(c) 涉及后验预测);题 21–23(模拟验证大数律和独立性,适合配合 Python 编写)。
第 2 章 随机变量(Random Variables)(PDF p.35–62)
2.1 引言(PDF p.35–36)
统计与数据挖掘处理的是数据;把样本空间、事件与数据联系起来的是随机变量。
定义 2.1:随机变量(random variable)是映射 \(X:\Omega\to\mathbb R\),对每个结果 \(\omega\) 赋予实数 \(X(\omega)\)(严格说须可测,见附录)。多数课程到某个阶段便不再提样本空间,直接操作随机变量,但要记住样本空间"一直潜伏在背后"。
例 2.2:掷硬币 10 次,\(X(\omega)\)=正面次数,若 \(\omega=HHTHHTHHTT\),则 \(X(\omega)=6\)。 例 2.3:\(\Omega\)=单位圆盘 \(\{(x,y):x^2+y^2\le1\}\),随机取点 \(\omega=(x,y)\),则 \(X(\omega)=x\)、\(Y(\omega)=y\)、\(Z=x+y\)、\(W=\sqrt{x^2+y^2}\) 都是随机变量。
记号:对实轴子集 \(A\),\(X^{-1}(A)=\{\omega:X(\omega)\in A\}\),\(\mathbb P(X\in A)=\mathbb P(X^{-1}(A))\),\(\mathbb P(X=x)=\mathbb P(\{\omega:X(\omega)=x\})\)。大写 \(X\) 表示随机变量,小写 \(x\) 表示其取值。
例 2.4:掷硬币两次,\(X\)=正面数。\(\mathbb P(X=0)=\mathbb P(\{TT\})=1/4\),\(\mathbb P(X=1)=\mathbb P(\{HT,TH\})=1/2\),\(\mathbb P(X=2)=1/4\)。表格列出四个结果各概率 1/4 及对应 \(X\) 值 0,1,1,2。
2.2 分布函数与概率函数(Distribution Functions and Probability Functions)(PDF p.36–41)
定义 2.5:累积分布函数(cumulative distribution function, CDF)\(F_X:\mathbb R\to[0,1]\),
例 2.6:上例的 CDF 为分段阶梯函数:\(x<0\) 时 0;\(0\le x<1\) 时 1/4;\(1\le x<2\) 时 3/4;\(x\ge2\) 时 1(图 2.1)。作者强调要仔细研究:CDF 右连续、非降,且对所有实数 \(x\) 都有定义(尽管 \(X\) 只取 0,1,2),例如 \(F_X(1.4)=.75\)。
定理 2.7:若 \(X\) 的 CDF \(F\) 与 \(Y\) 的 CDF \(G\) 处处相等,则对所有(可测)\(A\),\(\mathbb P(X\in A)=\mathbb P(Y\in A)\)——CDF 完全决定分布。
定理 2.8(CDF 的刻画):函数 \(F:\mathbb R\to[0,1]\) 是某个概率的 CDF 当且仅当:(i) 非降;(ii) 规范化:\(\lim_{x\to-\infty}F(x)=0\),\(\lim_{x\to\infty}F(x)=1\);(iii) 右连续:\(F(x)=F(x^+)=\lim_{y\downarrow x}F(y)\)。 证明 (iii):取 \(y_1>y_2>\cdots\downarrow x\),\(A_i=(-\infty,y_i]\) 单调递减,\(\bigcap A_i=(-\infty,x]\),由概率连续性(定理 1.8)\(F(x)=\mathbb P(\bigcap A_i)=\lim\mathbb P(A_i)=\lim F(y_i)=F(x^+)\)。(i)(ii) 类似;反方向(满足三条件必为某随机变量 CDF)需要较深的分析工具。
定义 2.9(离散型):\(X\) 取可数(countable,有限或可与整数一一对应;偶数、奇数、有理数可数,\((0,1)\) 中实数不可数)个值 \(\{x_1,x_2,\dots\}\),称为离散型。概率函数或概率质量函数(probability mass function, PMF)\(f_X(x)=\mathbb P(X=x)\),满足 \(f_X(x)\ge0\),\(\sum_i f_X(x_i)=1\),且 \(F_X(x)=\sum_{x_i\le x}f_X(x_i)\)。 例 2.10:上例 PMF:\(f(0)=1/4,f(1)=1/2,f(2)=1/4\)(图 2.2)。
定义 2.11(连续型):若存在 \(f_X\ge0\),\(\int_{-\infty}^\infty f_X=1\),且对任意 \(a\le b\),
例 2.12:\(f_X(x)=1\)(\(0<x<1\)),即 Uniform(0,1),刻画"在 0 与 1 之间随机取点";CDF 为 \(0\)(\(x<0\))、\(x\)(\(0\le x\le1\))、\(1\)(\(x>1\))(图 2.3)。 例 2.13:\(f(x)=1/(1+x)^2\)(\(x\ge0\)),积分为 1,是合法 PDF。 例 2.14:\(f(x)=1/(1+x)\)(\(x\ge0\))不是 PDF,因为 \(\int_0^\infty dx/(1+x)=\int_1^\infty du/u=\infty\)。
警告(常见误区):连续型 \(X\) 对每个 \(x\) 有 \(\mathbb P(X=x)=0\),不要把 \(f(x)\) 当成 \(\mathbb P(X=x)\)(只有离散型才如此);概率要靠积分得到。PDF 可以大于 1:\(f(x)=5\)(\(x\in[0,1/5]\))是合法 PDF;甚至可以无界:\(f(x)=(2/3)x^{-1/3}\)(\(0<x<1\))积分为 1。
引理 2.15:设 \(F\) 为 \(X\) 的 CDF,则
- \(\mathbb P(X=x)=F(x)-F(x^-)\),\(F(x^-)=\lim_{y\uparrow x}F(y)\);
- \(\mathbb P(x<X\le y)=F(y)-F(x)\);
- \(\mathbb P(X>x)=1-F(x)\);
- 若 \(X\) 连续,则 \(F(b)-F(a)=\mathbb P(a<X<b)=\mathbb P(a\le X<b)=\mathbb P(a<X\le b)=\mathbb P(a\le X\le b)\)。
定义 2.16(分位数函数):逆 CDF(inverse CDF)或分位数函数(quantile function)
同分布(equal in distribution):若 \(F_X(x)=F_Y(x)\) 对所有 \(x\) 成立,记 \(X\overset d=Y\)。这不意味着 \(X=Y\),只是关于两者的所有概率陈述相同。例:\(\mathbb P(X=1)=\mathbb P(X=-1)=1/2\),\(Y=-X\),则 \(X\overset d=Y\),但 \(\mathbb P(X=Y)=0\)。
2.3 若干重要离散随机变量(Some Important Discrete Random Variables)(PDF p.41–43)
记号警告:传统上写 \(X\sim F\) 表示"\(X\) 服从分布 \(F\)",不要读成"\(X\) 近似为 \(F\)"。
- 点质量分布(point mass)\(X\sim\delta_a\):\(\mathbb P(X=a)=1\),\(F(x)=0\)(\(x<a\))、\(1\)(\(x\ge a\))。
- 离散均匀分布:整数 \(k>1\),\(f(x)=1/k\),\(x=1,\dots,k\)。
- 伯努利分布 \(X\sim\text{Bernoulli}(p)\):\(\mathbb P(X=1)=p\),\(\mathbb P(X=0)=1-p\),\(f(x)=p^x(1-p)^{1-x}\),\(x\in\{0,1\}\)。
- 二项分布 \(X\sim\text{Binomial}(n,p)\):独立掷 \(n\) 次正面概率为 \(p\) 的硬币,正面次数 \(X\),
\[f(x)=\binom nx p^x(1-p)^{n-x},\quad x=0,\dots,n.\]可加性:\(X_1\sim\text{Bin}(n_1,p)\)、\(X_2\sim\text{Bin}(n_2,p)\)(独立)则 \(X_1+X_2\sim\text{Bin}(n_1+n_2,p)\)。
- 警告(随机变量 vs 参数):\(X\) 是随机变量,\(x\) 是其取值,\(n,p\) 是参数(固定实数)。参数 \(p\) 通常未知,需要从数据估计——"这正是统计推断要做的事"。
- 几何分布 \(X\sim\text{Geom}(p)\),\(p\in(0,1)\):\(\mathbb P(X=k)=p(1-p)^{k-1}\),\(k\ge1\);\(\sum_{k\ge1}\mathbb P(X=k)=p\sum_{k\ge1}(1-p)^{k-1}=p/(1-(1-p))=1\)。理解为掷到第一次正面所需次数。
- 泊松分布 \(X\sim\text{Poisson}(\lambda)\):\(f(x)=e^{-\lambda}\lambda^x/x!\),\(x\ge0\);\(\sum_x f(x)=e^{-\lambda}e^{\lambda}=1\)。常用于建模稀有事件计数(放射性衰变、交通事故)。可加性:独立 \(\text{Poisson}(\lambda_1)+\text{Poisson}(\lambda_2)\sim\text{Poisson}(\lambda_1+\lambda_2)\)。
警告(样本空间去哪了):上述分布都未提样本空间,但它仍在背后。显式构造伯努利变量:\(\Omega=[0,1]\),\(\mathbb P([a,b])=b-a\);固定 \(p\),令 \(X(\omega)=1\)(\(\omega\le p\))、\(0\)(\(\omega>p\)),则 \(\mathbb P(X=1)=\mathbb P([0,p])=p\)。实际中把随机变量看作"随机数",形式上它是定义在样本空间上的映射。(此构造正是计算机用均匀随机数生成伯努利样本的方法。)
2.4 若干重要连续随机变量(Some Important Continuous Random Variables)(PDF p.43–46)
- 均匀分布 \(X\sim\text{Uniform}(a,b)\)(\(a<b\)):\(f(x)=1/(b-a)\),\(x\in[a,b]\);\(F(x)=0\)(\(x<a\))、\((x-a)/(b-a)\)(\(x\in[a,b]\))、\(1\)(\(x>b\))。
- 正态(高斯)分布 \(X\sim N(\mu,\sigma^2)\):
\[f(x)=\frac1{\sigma\sqrt{2\pi}}\exp\left\{-\frac{(x-\mu)^2}{2\sigma^2}\right\},\quad x\in\mathbb R,\tag{2.3}\]\(\mu\in\mathbb R\) 为"中心"(均值),\(\sigma>0\) 为"散布"(标准差)。许多自然现象近似正态;中心极限定理说随机变量之和的分布可用正态近似。标准正态 \(\mu=0,\sigma=1\),传统上记为 \(Z\),PDF/CDF 记 \(\phi(z)\)、\(\Phi(z)\);\(\Phi\) 无闭式表达。有用的事实: (i) \(X\sim N(\mu,\sigma^2)\Rightarrow Z=(X-\mu)/\sigma\sim N(0,1)\); (ii) \(Z\sim N(0,1)\Rightarrow X=\mu+\sigma Z\sim N(\mu,\sigma^2)\); (iii) 独立 \(X_i\sim N(\mu_i,\sigma_i^2)\),则 \(\sum X_i\sim N(\sum\mu_i,\sum\sigma_i^2)\)。 由 (i),\(\mathbb P(a<X<b)=\Phi\!\left(\frac{b-\mu}\sigma\right)-\Phi\!\left(\frac{a-\mu}\sigma\right)\),只要能算 \(\Phi\) 就能算任何概率。
- 例 2.17:\(X\sim N(3,5)\)(方差 5)。\(\mathbb P(X>1)=1-\Phi\!\left(\frac{1-3}{\sqrt5}\right)=1-\Phi(-0.8944)=0.81\)。求 \(q\) 使 \(\mathbb P(X<q)=0.2\):查表 \(\Phi(-0.8416)=0.2\),故 \((q-3)/\sqrt5=-0.8416\),\(q=3-0.8416\sqrt5=1.1181\)。
- 指数分布 \(X\sim\text{Exp}(\beta)\):\(f(x)=\frac1\beta e^{-x/\beta}\),\(x>0\),\(\beta>0\)(注意本书用尺度参数 \(\beta\),均值为 \(\beta\))。用于电子元件寿命、稀有事件间的等待时间。
- Gamma 分布:Gamma 函数 \(\Gamma(\alpha)=\int_0^\infty y^{\alpha-1}e^{-y}dy\)。\(X\sim\text{Gamma}(\alpha,\beta)\):
\[f(x)=\frac{1}{\beta^\alpha\Gamma(\alpha)}x^{\alpha-1}e^{-x/\beta},\quad x>0.\]指数分布即 Gamma\((1,\beta)\)。独立 \(X_i\sim\text{Gamma}(\alpha_i,\beta)\) 则 \(\sum X_i\sim\text{Gamma}(\sum\alpha_i,\beta)\)。
- Beta 分布 \(X\sim\text{Beta}(\alpha,\beta)\):\(f(x)=\frac{\Gamma(\alpha+\beta)}{\Gamma(\alpha)\Gamma(\beta)}x^{\alpha-1}(1-x)^{\beta-1}\),\(0<x<1\)。
- t 分布与柯西分布:\(X\sim t_\nu\)(自由度 \(\nu\)):
\[f(x)=\frac{\Gamma\left(\frac{\nu+1}2\right)}{\sqrt{\nu\pi}\,\Gamma\left(\frac\nu2\right)}\frac{1}{\left(1+\frac{x^2}\nu\right)^{(\nu+1)/2}}.\]与正态相似但尾部更厚(thicker tails);\(\nu=\infty\) 对应正态。柯西分布(Cauchy)是 \(\nu=1\) 的特例:\(f(x)=\frac1{\pi(1+x^2)}\)。验证:\(\int f=\frac1\pi[\tan^{-1}(\infty)-\tan^{-1}(-\infty)]=\frac1\pi[\frac\pi2+\frac\pi2]=1\)。
- 卡方分布 \(X\sim\chi^2_p\):\(f(x)=\frac{1}{\Gamma(p/2)2^{p/2}}x^{p/2-1}e^{-x/2}\),\(x>0\)。若 \(Z_1,\dots,Z_p\) 独立标准正态,则 \(\sum Z_i^2\sim\chi^2_p\)。
2.5 二元分布(Bivariate Distributions)(PDF p.47–49)
离散情形:联合质量函数 \(f(x,y)=\mathbb P(X=x,Y=y)\),必要时写 \(f_{X,Y}\)。 例 2.18:\(X,Y\in\{0,1\}\),\(f(0,0)=1/9\),\(f(0,1)=2/9\),\(f(1,0)=2/9\),\(f(1,1)=4/9\);行和 1/3、2/3,列和 1/3、2/3。
定义 2.19:连续情形,函数 \(f(x,y)\) 是 \((X,Y)\) 的 PDF,若 (i) \(f\ge0\);(ii) \(\iint f=1\);(iii) 对任意 \(A\subset\mathbb R^2\),\(\mathbb P((X,Y)\in A)=\iint_A f(x,y)dxdy\)。联合 CDF:\(F_{X,Y}(x,y)=\mathbb P(X\le x,Y\le y)\)。
例 2.20:单位正方形上均匀,\(\mathbb P(X<1/2,Y<1/2)\)=对应区域面积=1/4。 例 2.21:\(f(x,y)=x+y\)(单位正方形),\(\int_0^1\int_0^1(x+y)dxdy=\frac12+\frac12=1\),是合法 PDF。 例 2.22(非矩形区域,取自 DeGroot & Schervish):\(f(x,y)=cx^2y\),\(x^2\le y\le1\)(于是 \(-1\le x\le1\))。技巧:先让 \(x\) 取遍其范围,对每个固定 \(x\) 让 \(y\) 在 \([x^2,1]\) 内变化(图 2.5)。\(1=c\int_{-1}^1x^2\int_{x^2}^1y\,dy\,dx=c\int_{-1}^1x^2\frac{1-x^4}2dx=\frac{4c}{21}\),故 \(c=21/4\)。\(\mathbb P(X\ge Y)\) 对应 \(A=\{0\le x\le1,x^2\le y\le x\}\):\(\frac{21}4\int_0^1x^2\int_{x^2}^xy\,dy\,dx=\frac{21}4\int_0^1x^2\frac{x^2-x^4}2dx=\frac3{20}\)。
2.6 边缘分布(Marginal Distributions)(PDF p.49–50)
定义 2.23:离散情形边缘质量函数 \(f_X(x)=\sum_yf(x,y)\) (2.4),\(f_Y(y)=\sum_xf(x,y)\) (2.5)。 例 2.24:表 \(f(0,0)=1/10,f(0,1)=2/10,f(1,0)=3/10,f(1,1)=4/10\),\(X\) 的边缘为行和:\(f_X(0)=3/10\),\(f_X(1)=7/10\);\(Y\) 的边缘为列和 4/10、6/10。
定义 2.25:连续情形边缘密度 \(f_X(x)=\int f(x,y)dy\),\(f_Y(y)=\int f(x,y)dx\) (2.6);对应边缘 CDF 记 \(F_X,F_Y\)。 例 2.26:\(f_{X,Y}=e^{-(x+y)}\)(\(x,y\ge0\)),\(f_X(x)=e^{-x}\int_0^\infty e^{-y}dy=e^{-x}\)。 例 2.27:\(f=x+y\)(单位正方形),\(f_Y(y)=\int_0^1x\,dx+\int_0^1y\,dx=\frac12+y\)。 例 2.28:\(f=\frac{21}4x^2y\)(\(x^2\le y\le1\)),\(f_X(x)=\frac{21}4x^2\int_{x^2}^1y\,dy=\frac{21}8x^2(1-x^4)\),\(-1\le x\le1\)。
2.7 独立随机变量(Independent Random Variables)(PDF p.50–52)
定义 2.29:若对任意 \(A,B\),\(\mathbb P(X\in A,Y\in B)=\mathbb P(X\in A)\mathbb P(Y\in B)\) (2.7),称 \(X,Y\) 独立,记 \(X\perp\!\!\!\perp Y\);否则相依(dependent)。
定理 2.30:\(X\perp\!\!\!\perp Y\) 当且仅当 \(f_{X,Y}(x,y)=f_X(x)f_Y(y)\) 对所有 \(x,y\) 成立(对离散也成立;严格说密度只在测度为零的集合外唯一)。
例 2.31:四格均为 1/4 的表,边缘都是 (1/2,1/2),四格都满足乘积条件,独立。另一表 \(f(0,0)=f(1,1)=1/2\)、\(f(0,1)=f(1,0)=0\),边缘仍为 (1/2,1/2),但 \(f_X(0)f_Y(1)=1/4\ne f(0,1)=0\),不独立。(编者注:说明边缘分布相同不代表联合分布相同。)
例 2.32:\(X,Y\) 独立同密度 \(f(x)=2x\)(\(0<x<1\)),联合密度 \(4xy\)。\(\mathbb P(X+Y\le1)=4\int_0^1x\left[\int_0^{1-x}y\,dy\right]dx=4\int_0^1x\frac{(1-x)^2}2dx=\frac16\)。
定理 2.33(因子分解判别):若 \((X,Y)\) 的取值范围是(可能无穷的)矩形,且 \(f(x,y)=g(x)h(y)\)(\(g,h\) 不必是密度),则 \(X,Y\) 独立。 例 2.34:\(f(x,y)=2e^{-(x+2y)}\)(\(x,y>0\)),范围是矩形 \((0,\infty)^2\),\(g(x)=2e^{-x}\),\(h(y)=e^{-2y}\),故独立。(常见误区:例 2.22 那种非矩形支撑上,即使密度形如 \(x^2y\) 也不独立。)
2.8 条件分布(Conditional Distributions)(PDF p.52–54)
定义 2.35:离散情形条件质量函数
由定义 \(f_{X,Y}(x,y)=f_{X\mid Y}(x\mid y)f_Y(y)=f_{Y\mid X}(y\mid x)f_X(x)\),在分层生成模型中很有用。
例 2.37:单位正方形上联合均匀,\(f_{X\mid Y}(x\mid y)=1\),即 \(X\mid Y=y\sim\text{Uniform}(0,1)\)。 例 2.38:\(f=x+y\),\(f_Y(y)=y+1/2\),\(f_{X\mid Y}(x\mid y)=\frac{x+y}{y+1/2}\)。\(\mathbb P(X<1/4\mid Y=1/3)=\int_0^{1/4}\frac{x+1/3}{1/3+1/2}dx=\frac{1/32+1/12}{5/6}=\frac{11}{80}\)。 例 2.39(分层模型):\(X\sim\text{Uniform}(0,1)\),再生成 \(Y\mid X=x\sim\text{Uniform}(x,1)\)。\(f_{Y\mid X}(y\mid x)=\frac1{1-x}\)(\(0<x<y<1\)),联合 \(f_{X,Y}=\frac1{1-x}\)(\(0<x<y<1\))。\(Y\) 的边缘:
2.9 多元分布与 IID 样本(Multivariate Distributions and IID Samples)(PDF p.54–55)
\(X=(X_1,\dots,X_n)\) 称为随机向量(random vector),PDF \(f(x_1,\dots,x_n)\),边缘、条件分布类似二元情形定义。若对任意 \(A_1,\dots,A_n\),\(\mathbb P(X_1\in A_1,\dots,X_n\in A_n)=\prod_i\mathbb P(X_i\in A_i)\) (2.8),称 \(X_1,\dots,X_n\) 独立;只需验证 \(f(x_1,\dots,x_n)=\prod f_{X_i}(x_i)\)。
定义 2.41:若 \(X_1,\dots,X_n\) 独立且有相同边缘 CDF \(F\),称为 IID(independent and identically distributed,独立同分布),记 \(X_1,\dots,X_n\sim F\)(有密度时记 \(\sim f\)),也称为来自 \(F\) 的容量为 \(n\) 的随机样本(random sample)。统计理论与实践大多从 IID 观测出发。
2.10 两个重要的多元分布(Two Important Multivariate Distributions)(PDF p.55–56)
多项分布(Multinomial):二项分布的多元版本。罐中有 \(k\) 种颜色的球,抽到颜色 \(j\) 的概率为 \(p_j\)(\(p_j\ge0\),\(\sum p_j=1\));有放回独立抽 \(n\) 次,\(X_j\) 为颜色 \(j\) 出现次数,\(\sum X_j=n\)。记 \(X\sim\text{Multinomial}(n,p)\):
多元正态(Multivariate Normal):先令 \(Z=(Z_1,\dots,Z_k)^T\),\(Z_i\) 独立 \(N(0,1)\),密度
\(\Sigma\) 对称正定时存在平方根矩阵 \(\Sigma^{1/2}\):(i) 对称;(ii) \(\Sigma=\Sigma^{1/2}\Sigma^{1/2}\);(iii) \(\Sigma^{1/2}\Sigma^{-1/2}=\Sigma^{-1/2}\Sigma^{1/2}=I\),\(\Sigma^{-1/2}=(\Sigma^{1/2})^{-1}\)。
定理 2.43:若 \(Z\sim N(0,I)\),\(X=\mu+\Sigma^{1/2}Z\),则 \(X\sim N(\mu,\Sigma)\);反之若 \(X\sim N(\mu,\Sigma)\),则 \(\Sigma^{-1/2}(X-\mu)\sim N(0,I)\)。
定理 2.44:把 \(X\) 分块为 \((X_a,X_b)\),相应 \(\mu=(\mu_a,\mu_b)\),\(\Sigma=\begin{pmatrix}\Sigma_{aa}&\Sigma_{ab}\\\Sigma_{ba}&\Sigma_{bb}\end{pmatrix}\)。则
- 边缘:\(X_a\sim N(\mu_a,\Sigma_{aa})\);
- 条件:\(X_b\mid X_a=x_a\sim N\!\left(\mu_b+\Sigma_{ba}\Sigma_{aa}^{-1}(x_a-\mu_a),\ \Sigma_{bb}-\Sigma_{ba}\Sigma_{aa}^{-1}\Sigma_{ab}\right)\);
- 线性组合:\(a^TX\sim N(a^T\mu,a^T\Sigma a)\);
- \(V=(X-\mu)^T\Sigma^{-1}(X-\mu)\sim\chi^2_k\)。
2.11 随机变量的变换(Transformations of Random Variables)(PDF p.57–58)
\(Y=r(X)\) 称为 \(X\) 的变换。离散情形:\(f_Y(y)=\mathbb P(r(X)=y)=\mathbb P(X\in r^{-1}(y))\)。 例 2.45:\(\mathbb P(X=-1)=\mathbb P(X=1)=1/4\),\(\mathbb P(X=0)=1/2\),\(Y=X^2\):\(\mathbb P(Y=0)=1/2\),\(\mathbb P(Y=1)=1/2\)。\(r\) 不是一一映射,\(Y\) 取值更少。
连续情形三步法:
- 对每个 \(y\) 求集合 \(A_y=\{x:r(x)\le y\}\);
- 求 CDF:\(F_Y(y)=\mathbb P(r(X)\le y)=\int_{A_y}f_X(x)dx\) (2.11);
- \(f_Y(y)=F_Y'(y)\)。
例 2.46:\(f_X(x)=e^{-x}\)(\(x>0\)),\(F_X=1-e^{-x}\),\(Y=\log X\):\(A_y=\{x\le e^y\}\),\(F_Y(y)=1-e^{-e^y}\),\(f_Y(y)=e^ye^{-e^y}\),\(y\in\mathbb R\)(极值分布/Gumbel 型)。 例 2.47:\(X\sim\text{Uniform}(-1,3)\),\(Y=X^2\in(0,9)\)。情形 (i) \(0<y<1\):\(A_y=[-\sqrt y,\sqrt y]\),\(F_Y=\frac12\sqrt y\);情形 (ii) \(1\le y<9\):\(A_y=[-1,\sqrt y]\),\(F_Y=\frac14(\sqrt y+1)\)。求导得 \(f_Y=\frac1{4\sqrt y}\)(\(0<y<1\)),\(\frac1{8\sqrt y}\)(\(1<y<9\))。 单调变换公式:若 \(r\) 严格单调,逆为 \(s=r^{-1}\),则
2.12 多个随机变量的变换(PDF p.58–59)
关心 \(X/Y\)、\(X+Y\)、\(\max\)、\(\min\) 等,\(Z=r(X,Y)\),同样三步:\(A_z=\{(x,y):r(x,y)\le z\}\),\(F_Z(z)=\iint_{A_z}f_{X,Y}dxdy\),\(f_Z=F_Z'\)。 例 2.48:\(X_1,X_2\) 独立 Uniform(0,1),\(Y=X_1+X_2\)。难点是找 \(A_y\)(直线 \(x_2=y-x_1\) 下方的部分,图 2.6):\(0<y\le1\) 时为顶点 \((0,0),(y,0),(0,y)\) 的三角形,面积 \(y^2/2\);\(1<y<2\) 时为正方形去掉顶点 \((1,y-1),(1,1),(y-1,1)\) 的三角形,面积 \(1-(2-y)^2/2\)。得三角形密度 \(f_Y(y)=y\)(\(0\le y\le1\)),\(2-y\)(\(1\le y\le2\))。
2.13 附录(PDF p.59)
随机变量是可测映射 \(X:\Omega\to\mathbb R\),可测指对每个 \(x\),\(\{\omega:X(\omega)\le x\}\in\mathcal A\)。
2.14 习题(PDF p.59–62)概览
共 21 题:证明 \(\mathbb P(X=x)=F(x^+)-F(x^-)\)(题 1);由 CDF 求区间概率、注意开闭端点(题 2:\(\mathbb P(X=2)=\mathbb P(X=3)=.1\)、\(\mathbb P(X=5)=.8\));证明引理 2.15(题 3);分段密度的 CDF 及 \(Y=1/X\) 的密度(题 4);离散独立判别(题 5);示性变量 \(I_A(X)\) 的分布(题 6);\(\min\{X,Y\}\) 的密度(题 7,先求 \(\mathbb P(Z>z)\));\(X^+=\max\{0,X\}\) 的 CDF(题 8);指数分布的 \(F\) 与 \(F^{-1}\)(题 9);独立变量的函数仍独立(题 10);泊松稀释:掷硬币 \(N\sim\text{Poisson}(\lambda)\) 次,正反面次数独立(题 11);证明定理 2.33(题 12);对数正态密度并用 10000 个模拟值作直方图对比(题 13);单位圆盘上 \(R=\sqrt{X^2+Y^2}\) 的分布(题 14);概率积分变换与逆变换抽样(题 15:\(Y=F(X)\sim U(0,1)\),\(X=F^{-1}(U)\sim F\),编程由均匀数生成指数分布);独立泊松给定和的条件分布为二项分布 \(\text{Bin}(n,\lambda/(\lambda+\mu))\)(题 16);\(c(x+y^2)\) 的条件概率(题 17);\(N(3,16)\) 的查表与软件计算(题 18);证明 (2.12)(题 19);\(X-Y\)、\(X/Y\) 的密度(题 20);IID 指数的最大值分布(题 21)。
本章要点
- 随机变量是样本空间到实数的映射;CDF 完全刻画分布,并由"非降、规范、右连续"三条件刻画。
- 离散用 PMF、连续用 PDF;PDF 不是概率,可以大于 1 甚至无界;分位数函数 \(F^{-1}\) 是 VaR、中位数等概念的数学基础。
- 常用分布族:点质量、离散均匀、伯努利、二项、几何、泊松;均匀、正态、指数、Gamma、Beta、t/柯西、卡方;多元的多项分布和多元正态。要掌握各自参数含义、可加性与相互关系(指数⊂Gamma,柯西=t₁,正态平方和=卡方)。
- 联合、边缘、条件分布与独立性;因子分解判独立要求支撑为矩形。
- 多元正态的线性变换、边缘、条件分布公式(定理 2.43–2.44)是后续回归、因子模型、卡尔曼滤波的核心工具。
- 变换求分布的"三步法"与单调变换的雅可比公式。
与量化交易的关联
- 收益分布建模:正态是基准;t 分布(厚尾)更贴近日收益,柯西示范了均值不存在的极端情况;对数正态(习题 13)是 Black–Scholes 的价格分布假设;例 2.46 的 \(Y=\log X\) 推导方式与"收益率取对数"同构。
- 分位数与风险度量:VaR 就是损益分布的分位数 \(F^{-1}(\alpha)\);例 2.17 的查表反解即正态 VaR 的计算方法(\(q=\mu+\sigma\Phi^{-1}(\alpha)\))。
- 多元正态与组合风险:定理 2.44(3) \(a^TX\sim N(a^T\mu,a^T\Sigma a)\) 正是组合收益的均值-方差公式,是马科维茨组合优化与参数法 VaR 的基础;定理 2.44(2) 的条件分布公式用于条件预期(给定市场因子时个股收益的分布)、缺失数据填补、卡尔曼滤波;定理 2.43 的 \(\mu+\Sigma^{1/2}Z\) 是蒙特卡洛生成相关资产收益的标准方法(实践中常用 Cholesky 分解替代对称平方根);(4) 的二次型 \(\sim\chi^2_k\) 即马氏距离,用于异常检测和湍流指数(turbulence index)。
- 计数与到达过程:泊松分布刻画单位时间内订单、成交笔数;指数分布刻画到达间隔,是执行算法与市场微观结构建模的基本假设;习题 11 的泊松稀释说明买卖单拆分后数量独立。
- 模拟:习题 15 的逆变换抽样是所有蒙特卡洛定价、风险模拟的起点;2.3 节用均匀随机数构造伯努利变量即同一思想。
- 独立性误区:边缘相同不代表联合相同(例 2.31),资产两两边缘分布正常不意味着联合尾部安全,这是 copula 建模的动机。
推荐习题
- 题 15(概率积分变换/逆变换抽样,必做并编程);题 13(对数正态 + 模拟直方图);题 11、16(泊松性质);题 7、21(最小值、最大值的分布,用于极值与次序统计量);题 18(正态查表与软件计算,VaR 基本功);题 20、例 2.48(卷积与比值分布)。
第 3 章 期望(Expectation)(PDF p.63–77)
3.1 随机变量的期望(Expectation of a Random Variable)(PDF p.63–66)
定义 3.1:\(X\) 的期望值(expected value)、均值(mean)或一阶矩(first moment)
- 期望是分布的单数字概括;可以把它看成大量 IID 抽样平均 \(\sum X_i/n\)——这不只是直觉,而是第 5 章的大数定律。
- \(\int x\,dF(x)\) 只是统一离散/连续的记号,严格含义(Lebesgue–Stieltjes 积分)见附录。
- 存在性:若 \(\int|x|dF_X(x)<\infty\),称 \(\mathbb E(X)\) 存在,否则不存在。
例 3.2:Bernoulli\((p)\),\(\mathbb E X=0\cdot(1-p)+1\cdot p=p\)。 例 3.3:掷硬币两次正面数,\(\mathbb E X=0\cdot\frac14+1\cdot\frac12+2\cdot\frac14=1\)。 例 3.4:\(X\sim\) Uniform\((-1,3)\),\(\mathbb E X=\frac14\int_{-1}^3x\,dx=1\)。 例 3.5(柯西分布均值不存在):\(f=\{\pi(1+x^2)\}^{-1}\),分部积分(\(u=x\),\(v=\tan^{-1}x\)):\(\int|x|dF=\frac2\pi\int_0^\infty\frac{x\,dx}{1+x^2}=[x\tan^{-1}x]_0^\infty-\int_0^\infty\tan^{-1}x\,dx=\infty\)。模拟柯西样本并取平均,平均值永远不会稳定下来,因为厚尾导致极端值很常见。此后讨论期望时默认其存在。
定理 3.6(懒惰统计学家法则,Rule of the Lazy Statistician):\(Y=r(X)\),则
例 3.7:\(X\sim\) Unif(0,1),\(Y=e^X\),\(\mathbb E Y=\int_0^1e^xdx=e-1\);也可先求 \(f_Y(y)=1/y\)(\(1<y<e\))再算,结果相同。 例 3.8(折木棍):单位长度木棍随机折断,\(Y\) 为较长一段。\(X\sim\) Unif(0,1),\(Y=\max\{X,1-X\}\),\(\mathbb E Y=\int_0^{1/2}(1-x)dx+\int_{1/2}^1x\,dx=\frac34\)。 多元:\(Z=r(X,Y)\) 时 \(\mathbb E Z=\iint r(x,y)dF(x,y)\) (3.4)。 例 3.9:\((X,Y)\) 在单位正方形上均匀,\(Z=X^2+Y^2\),\(\mathbb E Z=\int_0^1x^2dx+\int_0^1y^2dy=\frac23\)。
矩:\(k\) 阶矩(\(k\)th moment)\(\mathbb E(X^k)\),要求 \(\mathbb E|X|^k<\infty\)。 定理 3.10:若 \(k\) 阶矩存在且 \(j<k\),则 \(j\) 阶矩存在。证明:\(\int|x|^jf=\int_{|x|\le1}|x|^jf+\int_{|x|>1}|x|^jf\le\int_{|x|\le1}f+\int_{|x|>1}|x|^kf\le1+\mathbb E|X|^k<\infty\)。 \(k\) 阶中心矩(central moment)\(\mathbb E((X-\mu)^k)\)。
3.2 期望的性质(Properties of Expectations)(PDF p.66)
定理 3.11(线性):\(\mathbb E\left(\sum_ia_iX_i\right)=\sum_ia_i\mathbb E(X_i)\) (3.5)。 例 3.12:\(X\sim\) Binomial\((n,p)\),直接算 \(\sum_x x\binom nx p^x(1-p)^{n-x}\) 不容易;改写 \(X=\sum_{i=1}^nX_i\)(\(X_i\) 为第 \(i\) 次是否正面的示性变量),\(\mathbb E X_i=p\),故 \(\mathbb E X=np\)。("示性变量分解"是重要技巧。) 定理 3.13:若 \(X_1,\dots,X_n\) 独立,则 \(\mathbb E\left(\prod X_i\right)=\prod\mathbb E(X_i)\) (3.6)。注意:求和法则不需要独立,乘积法则需要独立。
3.3 方差与协方差(Variance and Covariance)(PDF p.66–68)
方差度量分布的"散布"。(脚注:不能用 \(\mathbb E(X-\mu)\),它恒为 0;可以用 \(\mathbb E|X-\mu|\),但更常用方差。)
定义 3.14:均值为 \(\mu\) 的 \(X\) 的方差 \(\sigma^2=\sigma_X^2=\mathbb V(X)=\mathbb E(X-\mu)^2=\int(x-\mu)^2dF(x)\) (3.7);标准差 \(\text{sd}(X)=\sqrt{\mathbb V(X)}\),也记 \(\sigma,\sigma_X\)。
定理 3.15:
- \(\mathbb V(X)=\mathbb E(X^2)-\mu^2\);
- \(\mathbb V(aX+b)=a^2\mathbb V(X)\);
- 若 \(X_i\) 独立,\(\mathbb V\left(\sum a_iX_i\right)=\sum a_i^2\mathbb V(X_i)\) (3.8)。
例 3.16:二项分布方差。\(\mathbb E(X_i^2)=p\cdot1^2+(1-p)\cdot0^2=p\),\(\mathbb V(X_i)=p-p^2=p(1-p)\),独立求和得 \(\mathbb V(X)=np(1-p)\)。\(p=0\) 或 \(1\) 时方差为 0,直观上合理(结果确定)。
样本均值与样本方差:
定义 3.18:协方差(covariance)\(\text{Cov}(X,Y)=\mathbb E((X-\mu_X)(Y-\mu_Y))\);相关系数(correlation)\(\rho=\rho_{X,Y}=\rho(X,Y)=\frac{\text{Cov}(X,Y)}{\sigma_X\sigma_Y}\)。二者度量 \(X,Y\) 之间线性关系的强弱。
定理 3.19:\(\text{Cov}(X,Y)=\mathbb E(XY)-\mathbb E(X)\mathbb E(Y)\) (3.11);\(-1\le\rho(X,Y)\le1\) (3.12)。若 \(Y=aX+b\),则 \(a>0\) 时 \(\rho=1\),\(a<0\) 时 \(\rho=-1\)。若 \(X,Y\) 独立,则 \(\text{Cov}=\rho=0\);反之一般不成立(不相关 ≠ 独立)。
定理 3.20:\(\mathbb V(X+Y)=\mathbb V(X)+\mathbb V(Y)+2\text{Cov}(X,Y)\),\(\mathbb V(X-Y)=\mathbb V(X)+\mathbb V(Y)-2\text{Cov}(X,Y)\);一般地
3.4 重要随机变量的期望与方差(PDF p.68–70)
| 分布 | 均值 | 方差 |
|---|---|---|
| 点质量 \(\delta_a\) | \(a\) | 0 |
| Bernoulli\((p)\) | \(p\) | \(p(1-p)\) |
| Binomial\((n,p)\) | \(np\) | \(np(1-p)\) |
| Geometric\((p)\) | \(1/p\) | \((1-p)/p^2\) |
| Poisson\((\lambda)\) | \(\lambda\) | \(\lambda\) |
| Uniform\((a,b)\) | \((a+b)/2\) | \((b-a)^2/12\) |
| Normal\((\mu,\sigma^2)\) | \(\mu\) | \(\sigma^2\) |
| Exponential\((\beta)\) | \(\beta\) | \(\beta^2\) |
| Gamma\((\alpha,\beta)\) | \(\alpha\beta\) | \(\alpha\beta^2\) |
| Beta\((\alpha,\beta)\) | \(\alpha/(\alpha+\beta)\) | \(\alpha\beta/((\alpha+\beta)^2(\alpha+\beta+1))\) |
| \(t_\nu\) | 0(\(\nu>1\)) | \(\nu/(\nu-2)\)(\(\nu>2\)) |
| \(\chi^2_p\) | \(p\) | \(2p\) |
| Multinomial\((n,p)\) | \(np\) | 见下 |
| 多元正态 \(N(\mu,\Sigma)\) | \(\mu\) | \(\Sigma\) |
随机向量 \(X=(X_1,\dots,X_k)^T\) 的均值 \(\mu=(\mathbb E X_1,\dots,\mathbb E X_k)^T\);方差-协方差矩阵(variance-covariance matrix)\(\Sigma=\mathbb V(X)\),对角元为 \(\mathbb V(X_i)\),非对角元为 \(\text{Cov}(X_i,X_j)\)。
多项分布协方差推导:\(X_i\sim\) Bin\((n,p_i)\),\(X_i+X_j\sim\) Bin\((n,p_i+p_j)\),故 \(\mathbb V(X_i+X_j)=n(p_i+p_j)(1-p_i-p_j)\);又 \(=np_i(1-p_i)+np_j(1-p_j)+2\text{Cov}(X_i,X_j)\),解得 \(\text{Cov}(X_i,X_j)=-np_ip_j\)。因此 \(\mathbb V(X)\) 对角元 \(np_i(1-p_i)\),非对角元 \(-np_ip_j\)(计数和固定为 \(n\),故各分量负相关)。
引理 3.21:若随机向量 \(X\) 均值 \(\mu\)、方差 \(\Sigma\),向量 \(a\)、矩阵 \(A\),则 \(\mathbb E(a^TX)=a^T\mu\),\(\mathbb V(a^TX)=a^T\Sigma a\);\(\mathbb E(AX)=A\mu\),\(\mathbb V(AX)=A\Sigma A^T\)。
3.5 条件期望(Conditional Expectation)(PDF p.70–72)
定义 3.22:给定 \(Y=y\) 时 \(X\) 的条件期望:用 \(f_{X\mid Y}(x\mid y)\) 代替 \(f_X(x)\),
警告(微妙之处):\(\mathbb E(X)\) 是一个数,\(\mathbb E(X\mid Y=y)\) 是 \(y\) 的函数。观测 \(Y\) 之前不知道其值,因此 \(\mathbb E(X\mid Y)\) 是一个随机变量——当 \(Y=y\) 时取值 \(\mathbb E(X\mid Y=y)\)。
例 3.23:\(X\sim\) Unif(0,1),\(Y\mid X=x\sim\) Unif\((x,1)\)。\(\mathbb E(Y\mid X=x)=\frac1{1-x}\int_x^1y\,dy=\frac{1+x}2\),故 \(\mathbb E(Y\mid X)=(1+X)/2\) 是随机变量。
定理 3.24(迭代期望法则,Rule of Iterated Expectations):
例 3.25:续例 3.23,\(\mathbb E(Y)=\mathbb E\left(\frac{1+X}2\right)=\frac{1+1/2}2=\frac34\),比先求联合密度简单。
定义 3.26:条件方差 \(\mathbb V(Y\mid X=x)=\int(y-\mu(x))^2f(y\mid x)dy\),\(\mu(x)=\mathbb E(Y\mid X=x)\)。 定理 3.27(全方差公式):
例 3.28(分层模型,hierarchical model):随机选美国一个县,再从该县随机选 \(n\) 人,\(X\) 为患病人数。县患病率 \(Q\) 是随机变量,\(Q\sim\) Uniform(0,1),\(X\mid Q=q\sim\) Binomial\((n,q)\)。则 \(\mathbb E(X)=\mathbb E(nQ)=n/2\);\(\mathbb E\,\mathbb V(X\mid Q)=n\mathbb E[Q(1-Q)]=n\int_0^1q(1-q)dq=n/6\);\(\mathbb V\,\mathbb E(X\mid Q)=n^2\mathbb V(Q)=n^2/12\);故 \(\mathbb V(X)=\frac n6+\frac{n^2}{12}\)。(对比:若 \(Q\) 固定为 1/2,方差仅 \(n/4\);参数不确定性带来 \(n^2\) 量级的额外方差——过度离散 overdispersion。)
3.6 矩母函数(Moment Generating Functions)(PDF p.72–74)
定义 3.29:矩母函数(moment generating function, MGF)或拉普拉斯变换(Laplace transform)
例 3.30:\(X\sim\) Exp(1),\(t<1\) 时 \(\psi_X(t)=\int_0^\infty e^{tx}e^{-x}dx=\frac1{1-t}\)(\(t\ge1\) 发散)。\(\psi'(0)=1\),\(\psi''(0)=2\),故 \(\mathbb E X=1\),\(\mathbb V X=2-1=1\)。
引理 3.31:(1) \(Y=aX+b\Rightarrow\psi_Y(t)=e^{bt}\psi_X(at)\);(2) \(X_i\) 独立,\(Y=\sum X_i\Rightarrow\psi_Y(t)=\prod\psi_i(t)\)。 例 3.32:Bernoulli 的 MGF \(pe^t+q\)(\(q=1-p\)),故 Binomial\((n,p)\) 的 MGF 为 \((pe^t+q)^n\)。 定理 3.33(唯一性):若 \(\psi_X(t)=\psi_Y(t)\) 在 0 的某开区间内成立,则 \(X\overset d=Y\)。 例 3.34:独立 Bin\((n_1,p)\)+Bin\((n_2,p)\) 的 MGF 为 \((pe^t+q)^{n_1+n_2}\),故和为 Bin\((n_1+n_2,p)\)。 例 3.35:独立 Poisson 之和:\(e^{\lambda_1(e^t-1)}e^{\lambda_2(e^t-1)}=e^{(\lambda_1+\lambda_2)(e^t-1)}\),为 Poisson\((\lambda_1+\lambda_2)\)。
常见分布 MGF 表:Bernoulli\((p)\):\(pe^t+(1-p)\);Binomial:\((pe^t+(1-p))^n\);Poisson\((\lambda)\):\(e^{\lambda(e^t-1)}\);Normal\((\mu,\sigma^2)\):\(\exp\{\mu t+\sigma^2t^2/2\}\);Gamma\((\alpha,\beta)\):\(\left(\frac1{1-\beta t}\right)^\alpha\),\(t<1/\beta\)。
3.7 附录:期望作为积分(PDF p.74)
可测函数积分的定义:简单函数 \(r\)(在划分 \(A_1,\dots,A_k\) 上取有限个值 \(a_i\))定义 \(\int r\,dF=\sum a_i\mathbb P(r(X)\in A_i)\);非负可测函数用逼近它的递增简单函数列的积分极限定义(与序列选取无关);一般函数 \(r=r^+-r^-\),\(\int r\,dF=\int r^+dF-\int r^-dF\)(两者都有限时)。
3.8 习题(PDF p.74–77)概览
共 24 题:
- 题 1:本金 \(c\),每局等概率翻倍或减半,\(n\) 局后期望财富(答案 \(c(5/4)^n\),期望增长但中位数不变——编写者可用来引出"期望 vs 几何增长"的讨论)。
- 题 2:\(\mathbb V(X)=0\) 当且仅当 \(X\) 几乎必然为常数;题 3:\(n\) 个均匀变量最大值的期望(\(n/(n+1)\));题 4:随机游走 \(X_n\) 的均值和方差;题 5:几何分布期望;题 6:离散情形证明懒惰统计学家法则;题 7:非负随机变量 \(\mathbb E X=\int_0^\infty\mathbb P(X>x)dx\)(尾概率积分公式);题 8:证明定理 3.17。
- 题 9(计算机实验):正态与柯西的样本均值随 \(n\) 的轨迹对比——柯西不收敛。
- 题 10:对数正态 \(Y=e^X\) 的均值方差(\(e^{1/2}\),\(e^2-e\))。
- 题 11(模拟股市):\(Y_i=\pm1\) 等概率,\(X_n=\sum Y_i\) 为第 \(n\) 天股价;求 \(\mathbb E X_n=0\)、\(\mathbb V X_n=n\);模拟多次并作图,观察:随机序列中很容易"看出"规律;同样生成的几条路径差别很大——用方差随 \(n\) 线性增长解释。
- 题 12:证明 3.4 节表中各分布均值方差(给出技巧:Poisson 先算 \(\mathbb E[X(X-1)]\);Gamma、Beta 乘除归一化常数);题 13:混合分布的均值和标准差;题 14:协方差双线性 \(\text{Cov}(\sum a_iX_i,\sum b_jY_j)=\sum\sum a_ib_j\text{Cov}(X_i,Y_j)\);题 15:\(\mathbb V(2X-3Y+8)\);题 16:\(\mathbb E(r(X)s(Y)\mid X)=r(X)\mathbb E(s(Y)\mid X)\)("提出已知量");题 17:证明全方差公式(给出展开平方的提示);题 18:\(\mathbb E(X\mid Y)\) 为常数则不相关;题 19:抽样分布(sampling distribution)概念——统计量 \(\bar X_n\) 是随机变量,有自己的分布;勿混淆数据分布与统计量分布;用均匀分布模拟 \(n=1,5,25,100\);题 20:证明引理 3.21;题 21:\(\mathbb E(Y\mid X)=X\Rightarrow\text{Cov}(X,Y)=\mathbb V(X)\);题 22:示性变量的独立性与条件期望;题 23:求 Poisson、Normal、Gamma 的 MGF;题 24:IID 指数之和为 Gamma(用 MGF)。
本章要点
- 期望是分布的一阶概括,需检查存在性(柯西无均值);懒惰统计学家法则让我们无需求 \(Y=r(X)\) 的分布即可求期望;概率是示性函数的期望。
- 期望线性(无需独立);乘积期望可分解、方差可加需要独立(或不相关)。
- 方差、协方差、相关系数及线性组合方差公式;矩阵形式 \(\mathbb V(AX)=A\Sigma A^T\)。
- 条件期望 \(\mathbb E(Y\mid X)\) 是随机变量;迭代期望与全方差公式是分层模型计算的利器。
- MGF 用于求矩、确定和的分布,并在第 5 章用于证明 CLT。
与量化交易的关联
- 组合风险:定理 3.20 与引理 3.21 中 \(\mathbb V(w^TR)=w^T\Sigma w\) 就是组合方差公式,是均值-方差优化、风险预算、风险归因(边际风险贡献 \(\Sigma w\))的基础;多项分布协方差为负的推导方式可迁移到"权重和为 1 约束下的负相关"。
- 相关 ≠ 独立:定理 3.19 提醒相关系数只衡量线性依赖;资产收益在尾部可能高度相依而线性相关很低,需要尾部相关/copula 等工具。
- 全方差公式与分层模型:例 3.28 结构等价于"参数不确定性 + 抽样噪声"。在因子模型中,收益方差 = 因子解释部分 \(\mathbb V\,\mathbb E(R\mid F)\) + 特异部分 \(\mathbb E\,\mathbb V(R\mid F)\);在贝叶斯收缩、参数不确定下的预测方差中也直接使用。
- 期望 vs 几何增长:习题 1(翻倍或减半)与 Jensen 不等式(第 4 章)一起说明算术期望收益为正的策略长期复利可能不增长,是 Kelly 准则与对数效用的引子。
- 随机游走与"看图找规律":习题 11 是作者专门设计的股市模拟,说明纯随机价格路径中也会"看出"趋势和形态,提醒技术分析式模式识别容易过度解读;\(\mathbb V X_n=n\) 即波动率按 \(\sqrt n\) 缩放的根源。
- 柯西与厚尾:例 3.5 与习题 9 说明期望不存在时样本均值不收敛,对极端厚尾收益的均值估计要格外谨慎。
- MGF/累积量:正态 MGF 用于推导对数正态均值 \(e^{\mu+\sigma^2/2}\)(习题 10),即对数收益与简单收益之间的凸性修正。
推荐习题
- 题 11(模拟股市随机游走,必做);题 1(期望 vs 中位数增长);题 9(柯西样本均值);题 17、21、例 3.28(迭代期望与全方差);题 19(抽样分布概念,为第 II 部分铺垫);题 7(尾概率积分公式);题 24(MGF 证明和的分布)。
第 4 章 不等式(Inequalities)(PDF p.78–84)
4.1 概率不等式(Probability Inequalities)(PDF p.78–80)
不等式用于界定难以直接计算的量,也是第 5 章收敛理论的工具。
定理 4.1(马尔可夫不等式,Markov's inequality):\(X\) 非负且 \(\mathbb E X\) 存在,则对任意 \(t>0\),
定理 4.2(切比雪夫不等式,Chebyshev's inequality):\(\mu=\mathbb E X\),\(\sigma^2=\mathbb V X\),则
例 4.3(预测误差率):在 \(n\) 个新测试样本上检验一个预测方法(如神经网络),\(X_i=1\) 表示预测错误,\(\bar X_n\) 为观测错误率,\(X_i\sim\) Bernoulli\((p)\),\(p\) 为未知真实错误率。
定理 4.4(Hoeffding 不等式):\(Y_1,\dots,Y_n\) 独立,\(\mathbb E(Y_i)=0\),\(a_i\le Y_i\le b_i\)。对 \(\epsilon>0\) 与任意 \(t>0\),
定理 4.5:\(X_1,\dots,X_n\sim\) Bernoulli\((p)\),对任意 \(\epsilon>0\),
由 Hoeffding 构造置信区间:固定 \(\alpha>0\),令 \(\epsilon_n=\sqrt{\frac1{2n}\log\frac2\alpha}\),则 \(\mathbb P(|\bar X_n-p|>\epsilon_n)\le2e^{-2n\epsilon_n^2}=\alpha\)。令 \(C=(\bar X_n-\epsilon_n,\bar X_n+\epsilon_n)\),则 \(\mathbb P(p\notin C)\le\alpha\),即 \(\mathbb P(p\in C)\ge1-\alpha\):随机区间 \(C\) 以概率 \(1-\alpha\) 套住真参数,称为 \(1-\alpha\) 置信区间(第 6 章详述)。这是有限样本、无分布假设的区间。
定理 4.7(Mill 不等式):\(Z\sim N(0,1)\),
4.2 关于期望的不等式(Inequalities For Expectations)(PDF p.81)
定理 4.8(Cauchy–Schwarz 不等式):\(X,Y\) 方差有限,则 \(\mathbb E|XY|\le\sqrt{\mathbb E(X^2)\mathbb E(Y^2)}\) (4.5)。
凸函数:对任意 \(x,y\) 及 \(\alpha\in[0,1]\),\(g(\alpha x+(1-\alpha)y)\le\alpha g(x)+(1-\alpha)g(y)\)。若 \(g''\ge0\) 则凸;凸函数位于任意切线之上;\(-g\) 凸则 \(g\) 凹。凸例:\(x^2\)、\(e^x\);凹例:\(-x^2\)、\(\log x\)。
定理 4.9(Jensen 不等式):\(g\) 凸则 \(\mathbb E g(X)\ge g(\mathbb E X)\) (4.6);\(g\) 凹则 \(\mathbb E g(X)\le g(\mathbb E X)\) (4.7)。 证明:取在 \(\mathbb E(X)\) 处与 \(g\) 相切的直线 \(L(x)=a+bx\),\(g\ge L\),故 \(\mathbb E g(X)\ge\mathbb E L(X)=a+b\mathbb E X=L(\mathbb E X)=g(\mathbb E X)\)。 推论:\(\mathbb E(X^2)\ge(\mathbb E X)^2\);\(X>0\) 时 \(\mathbb E(1/X)\ge1/\mathbb E(X)\);\(\mathbb E(\log X)\le\log\mathbb E(X)\)。
4.3 文献注(PDF p.81)
Devroye et al. (1996) 是概率不等式及其在统计与模式识别中应用的好参考;下面的 Hoeffding 证明取自该书。
4.4 附录:Hoeffding 不等式证明(PDF p.82)
用泰勒定理的精确形式:存在 \(\xi\in(0,u)\) 使 \(g(u)=g(0)+ug'(0)+\frac{u^2}2g''(\xi)\)。 定理 4.4 证明:
- 对任意 \(t>0\),由马尔可夫:\(\mathbb P(\sum Y_i\ge\epsilon)=\mathbb P(e^{t\sum Y_i}\ge e^{t\epsilon})\le e^{-t\epsilon}\mathbb E(e^{t\sum Y_i})=e^{-t\epsilon}\prod_i\mathbb E(e^{tY_i})\) (4.8)(独立性)。(这就是 Chernoff 方法。)
- \(Y_i\) 是 \(a_i,b_i\) 的凸组合 \(Y_i=\alpha b_i+(1-\alpha)a_i\),\(\alpha=(Y_i-a_i)/(b_i-a_i)\);由 \(e^{ty}\) 凸:\(e^{tY_i}\le\frac{Y_i-a_i}{b_i-a_i}e^{tb_i}+\frac{b_i-Y_i}{b_i-a_i}e^{ta_i}\)。
- 取期望并用 \(\mathbb E Y_i=0\):\(\mathbb E e^{tY_i}\le\frac{-a_i}{b_i-a_i}e^{tb_i}+\frac{b_i}{b_i-a_i}e^{ta_i}=e^{g(u)}\) (4.9),其中 \(u=t(b_i-a_i)\),\(g(u)=-\gamma u+\log(1-\gamma+\gamma e^u)\),\(\gamma=-a_i/(b_i-a_i)\)。
- \(g(0)=g'(0)=0\),且对所有 \(u>0\) 有 \(g''(u)\le1/4\);由泰勒,\(g(u)=\frac{u^2}2g''(\xi)\le\frac{u^2}8=\frac{t^2(b_i-a_i)^2}8\)。代回 (4.8) 得证。 定理 4.5 证明:令 \(Y_i=(X_i-p)/n\),\(\mathbb E Y_i=0\),\(a=-p/n\le Y_i\le b=(1-p)/n\),\((b-a)^2=1/n^2\)。由定理 4.4:\(\mathbb P(\bar X_n-p>\epsilon)\le e^{-t\epsilon}e^{t^2/(8n)}\),对所有 \(t>0\) 成立,取 \(t=4n\epsilon\)(最小化指数)得 \(e^{-2n\epsilon^2}\);另一侧同理,合并得 \(2e^{-2n\epsilon^2}\)。
4.5 习题(PDF p.83–84)概览
共 7 题:题 1 指数分布的精确尾概率 \(\mathbb P(|X-\mu|\ge k\sigma)\) 与切比雪夫界比较;题 2 用切比雪夫证 Poisson 的 \(\mathbb P(X\ge2\lambda)\le1/\lambda\);题 3 比较切比雪夫与 Hoeffding 界(大 \(n\) 时 Hoeffding 更紧);题 4 用 Hoeffding 构造二项比例置信区间,并做模拟:\(\alpha=.05\)、\(p=.4\),覆盖率随 \(n\)(1 至 10000)的变化、区间长度随 \(n\) 的变化,以及要求长度 ≤ .05 时所需 \(n\);题 5 证明 Mill 不等式(提示:\(\mathbb P(|Z|>t)=2\mathbb P(Z>t)\),在 \(x>t\) 时 \(x/t>1\));题 6 画出 \(\mathbb P(|Z|>t)\) 真值与马尔可夫矩界 \(\mathbb E|Z|^k/t^k\)(\(k=1..5\))、Mill 界的比较;题 7 用 Mill 不等式界 \(\mathbb P(|\bar X_n|>t)\) 并与切比雪夫比较。
本章要点
- 马尔可夫 → 切比雪夫(对平方用马尔可夫)→ Chernoff/Hoeffding(对指数用马尔可夫),界依次变紧:多项式衰减 vs 指数衰减。
- Hoeffding 给出有界独立变量均值的非渐近集中不等式 \(2e^{-2n\epsilon^2}\),可直接构造不依赖分布形式的置信区间。
- Mill 不等式刻画正态尾的 \(e^{-t^2/2}/t\) 衰减。
- Jensen 不等式:凸函数的期望 ≥ 期望的函数。
与量化交易的关联
- 切比雪夫的"分布无关"风险界:不知道收益分布时,\(k\) 倍标准差之外的概率至多 \(1/k^2\);可用于对 VaR 作保守上界,并说明正态假设下的"3σ 事件 0.27%"与无分布假设下的"至多 11%"差距巨大。
- Hoeffding 与回测/胜率统计:例 4.3 的"错误率"可换成"策略胜率"或"信号命中率";Hoeffding 告诉我们需要多少笔交易才能把胜率估计误差控制在 \(\epsilon\) 以内(\(n\ge\log(2/\alpha)/(2\epsilon^2)\)),例如 \(\epsilon=0.05\)、\(\alpha=0.05\) 约需 738 笔。注意它要求独立,交易间相关时需要调整。
- Jensen 不等式:\(\mathbb E\log(1+R)\le\log(1+\mathbb E R)\),说明几何平均收益低于算术平均收益("波动拖累" volatility drag,约 \(\sigma^2/2\));期权定价中凸收益的期望大于期望的收益,是凸性/Gamma 价值的根源。
- Mill 不等式:正态尾衰减极快,实证收益的尾部远厚于此——用于说明正态模型低估极端风险。
- 集中不等式与机器学习:第 22 章分类和 PAC 学习(前言词典中"大偏差界=PAC learning")都建立在 Hoeffding 上,可用于量化选股模型的泛化误差估计。
推荐习题
- 题 4(Hoeffding 置信区间的模拟研究,必做);题 3、6(比较各种界的松紧);题 1(精确值 vs 切比雪夫)。
第 5 章 随机变量的收敛(Convergence of Random Variables)(PDF p.85–98)
5.1 引言(PDF p.85–86)
概率论最重要的部分是随机变量序列的行为,称为大样本理论(large sample theory)、极限理论(limit theory)或渐近理论(asymptotic theory)。统计关心"数据越来越多时会怎样"。
微积分中数列 \(x_n\to x\) 指对任意 \(\epsilon>0\),\(n\) 充分大时 \(|x_n-x|<\epsilon\)。概率中更微妙:
- 若 \(X_1,X_2,\dots\) 独立且都是 \(N(0,1)\),想说 \(X_n\)"收敛到" \(X\sim N(0,1)\),但 \(\mathbb P(X_n=X)=0\)(两个连续变量相等的概率为 0)。
- 若 \(X_n\sim N(0,1/n)\),直观上集中到 0,但 \(\mathbb P(X_n=0)=0\)。 因此需要严格的收敛概念。
本章两大思想:
- 大数定律:样本均值 \(\bar X_n\) 依概率收敛到 \(\mu=\mathbb E(X_i)\),即 \(\bar X_n\) 以高概率接近 \(\mu\)。
- 中心极限定理:\(\sqrt n(\bar X_n-\mu)\) 依分布收敛到正态,即大样本时样本均值近似正态。
5.2 收敛的类型(Types of Convergence)(PDF p.86–89)
定义 5.1:\(X_n\) 的 CDF 为 \(F_n\),\(X\) 的 CDF 为 \(F\)。
- 依概率收敛(convergence in probability)\(X_n\xrightarrow{P}X\):对每个 \(\epsilon>0\),\(\mathbb P(|X_n-X|>\epsilon)\to0\) (5.1)。
- 依分布收敛(convergence in distribution)\(X_n\rightsquigarrow X\):在 \(F\) 的所有连续点 \(t\),\(\lim F_n(t)=F(t)\) (5.2)。 极限为点质量 \(\mathbb P(X=c)=1\) 时写作 \(X_n\xrightarrow P c\)、\(X_n\rightsquigarrow c\)。
定义 5.2:均方收敛(convergence in quadratic mean,或 \(L_2\) 收敛)\(X_n\xrightarrow{qm}X\):\(\mathbb E(X_n-X)^2\to0\) (5.3)。主要用作证明依概率收敛的工具。
例 5.3:\(X_n\sim N(0,1/n)\),\(F\) 为 0 处点质量的 CDF。\(\sqrt nX_n\sim N(0,1)\)。\(t<0\) 时 \(F_n(t)=\mathbb P(Z<\sqrt nt)\to0\);\(t>0\) 时 \(\to1\)。故除 \(t=0\) 外 \(F_n(t)\to F(t)\),\(X_n\rightsquigarrow0\)。注意 \(F_n(0)=1/2\ne F(0)=1\),但 0 不是 \(F\) 的连续点,无须收敛(图 5.1)——这正是定义只要求连续点的原因。依概率:\(\mathbb P(|X_n|>\epsilon)=\mathbb P(|X_n|^2>\epsilon^2)\le\mathbb E(X_n^2)/\epsilon^2=\frac{1/n}{\epsilon^2}\to0\),故 \(X_n\xrightarrow P0\)。
定理 5.4(各收敛间关系,图 5.2): (a) \(X_n\xrightarrow{qm}X\Rightarrow X_n\xrightarrow PX\); (b) \(X_n\xrightarrow PX\Rightarrow X_n\rightsquigarrow X\); (c) 若 \(X_n\rightsquigarrow X\) 且 \(\mathbb P(X=c)=1\),则 \(X_n\xrightarrow PX\)。 除 (c) 这一特例外,反向蕴含一般不成立。图 5.2:均方 → 依概率 → 依分布,另有虚线"点质量时依分布 → 依概率"。
证明:(a) 由马尔可夫:\(\mathbb P(|X_n-X|>\epsilon)=\mathbb P(|X_n-X|^2>\epsilon^2)\le\mathbb E|X_n-X|^2/\epsilon^2\to0\)。 (b) 固定 \(\epsilon\),\(x\) 为 \(F\) 连续点。\(F_n(x)=\mathbb P(X_n\le x,X\le x+\epsilon)+\mathbb P(X_n\le x,X>x+\epsilon)\le F(x+\epsilon)+\mathbb P(|X_n-X|>\epsilon)\);同理 \(F(x-\epsilon)\le F_n(x)+\mathbb P(|X_n-X|>\epsilon)\)。于是 \(F(x-\epsilon)-\mathbb P(|X_n-X|>\epsilon)\le F_n(x)\le F(x+\epsilon)+\mathbb P(|X_n-X|>\epsilon)\),令 \(n\to\infty\):\(F(x-\epsilon)\le\liminf F_n(x)\le\limsup F_n(x)\le F(x+\epsilon)\),再令 \(\epsilon\to0\),由连续性得 \(\lim F_n(x)=F(x)\)。 (c) \(\mathbb P(|X_n-c|>\epsilon)\le\mathbb P(X_n\le c-\epsilon)+\mathbb P(X_n>c+\epsilon)=F_n(c-\epsilon)+1-F_n(c+\epsilon)\to F(c-\epsilon)+1-F(c+\epsilon)=0+1-1=0\)。
反例:
- 依概率不蕴含均方:\(U\sim\) Unif(0,1),\(X_n=\sqrt n\,I_{(0,1/n)}(U)\)。\(\mathbb P(|X_n|>\epsilon)=\mathbb P(0\le U<1/n)=1/n\to0\),故 \(X_n\xrightarrow P0\);但 \(\mathbb E(X_n^2)=n\int_0^{1/n}du=1\),不均方收敛。
- 依分布不蕴含依概率:\(X\sim N(0,1)\),\(X_n=-X\),则 \(X_n\sim N(0,1)\),\(F_n=F\),\(X_n\rightsquigarrow X\);但 \(\mathbb P(|X_n-X|>\epsilon)=\mathbb P(|2X|>\epsilon)=\mathbb P(|X|>\epsilon/2)\ne0\)。
警告:\(X_n\xrightarrow Pb\) 并不意味着 \(\mathbb E(X_n)\to b\)。例:\(\mathbb P(X_n=n^2)=1/n\),\(\mathbb P(X_n=0)=1-1/n\),则 \(X_n\xrightarrow P0\),但 \(\mathbb E(X_n)=n^2\cdot\frac1n=n\to\infty\)。(若 \(X_n\) 一致可积则可以,见附录。)"总结:盯着图 5.2 看。"
定理 5.5(收敛在变换下的保持):\(g\) 连续。 (a) \(X_n\xrightarrow PX\),\(Y_n\xrightarrow PY\Rightarrow X_n+Y_n\xrightarrow PX+Y\); (b) 均方收敛同理:\(X_n+Y_n\xrightarrow{qm}X+Y\); (c) \(X_n\rightsquigarrow X\),\(Y_n\rightsquigarrow c\Rightarrow X_n+Y_n\rightsquigarrow X+c\); (d) \(X_n\xrightarrow PX\),\(Y_n\xrightarrow PY\Rightarrow X_nY_n\xrightarrow PXY\); (e) \(X_n\rightsquigarrow X\),\(Y_n\rightsquigarrow c\Rightarrow X_nY_n\rightsquigarrow cX\); (f) \(X_n\xrightarrow PX\Rightarrow g(X_n)\xrightarrow Pg(X)\); (g) \(X_n\rightsquigarrow X\Rightarrow g(X_n)\rightsquigarrow g(X)\)(连续映射定理)。 (c)(e) 称为 Slutsky 定理。注意:\(X_n\rightsquigarrow X\)、\(Y_n\rightsquigarrow Y\) 一般不能推出 \(X_n+Y_n\rightsquigarrow X+Y\)(依分布收敛只关心边缘,不管联合)。
5.3 大数定律(The Law of Large Numbers)(PDF p.90)
"概率论的皇冠成就":大样本的均值接近分布的均值。设 \(X_1,X_2,\dots\) IID,\(\mu=\mathbb E(X_1)\),\(\sigma^2=\mathbb V(X_1)\),\(\mathbb E\bar X_n=\mu\),\(\mathbb V\bar X_n=\sigma^2/n\)。
定理 5.6(弱大数定律,WLLN):若 \(X_1,\dots,X_n\) IID,则 \(\bar X_n\xrightarrow P\mu\)。 解释:\(\bar X_n\) 的分布随 \(n\) 增大越来越集中在 \(\mu\) 附近。 证明(假设 \(\sigma<\infty\),非必要但简化):切比雪夫 \(\mathbb P(|\bar X_n-\mu|>\epsilon)\le\frac{\mathbb V(\bar X_n)}{\epsilon^2}=\frac{\sigma^2}{n\epsilon^2}\to0\)。
例 5.7:掷硬币,正面比例 \(\bar X_n\xrightarrow Pp\)。这不意味着 \(\bar X_n\) 数值上等于 \(p\),而是大 \(n\) 时其分布紧密集中在 \(p\) 附近。\(p=1/2\) 时,要使 \(\mathbb P(.4\le\bar X_n\le.6)\ge.7\):\(\mathbb V\bar X_n=1/(4n)\),切比雪夫给 \(\mathbb P(|\bar X_n-\mu|\le.1)\ge1-\frac1{4n(.1)^2}=1-\frac{25}n\),\(n=84\) 时大于 .7。
5.4 中心极限定理(The Central Limit Theorem)(PDF p.91–93)
大数定律说 \(\bar X_n\) 堆积在 \(\mu\) 附近,但不足以近似关于 \(\bar X_n\) 的概率陈述,这需要 CLT。CLT 说 \(\bar X_n\) 近似 \(N(\mu,\sigma^2/n)\)——除均值和方差存在外,对 \(X_i\) 的分布没有任何假设,这是非常了不起的。
定理 5.8(中心极限定理,CLT):\(X_1,\dots,X_n\) IID,均值 \(\mu\)、方差 \(\sigma^2\),则
例 5.9:每个程序错误数服从均值 5 的 Poisson,共 125 个程序,求 \(\mathbb P(\bar X_n<5.5)\)。\(\mu=\sigma^2=5\):\(\mathbb P(\bar X_n<5.5)=\mathbb P\left(\frac{\sqrt n(\bar X_n-\mu)}\sigma<\frac{\sqrt{125}(5.5-5)}{\sqrt5}\right)\approx\mathbb P(Z<2.5)=.9938\)。
实际很少知道 \(\sigma\),可用样本方差 \(S_n^2=\frac1{n-1}\sum(X_i-\bar X_n)^2\) 估计。 定理 5.10:在 CLT 条件下,\(\frac{\sqrt n(\bar X_n-\mu)}{S_n}\rightsquigarrow N(0,1)\)。(由 Slutsky 定理与 \(S_n\xrightarrow P\sigma\) 推得。)
定理 5.11(Berry–Esseen 不等式):若 \(\mathbb E|X_1|^3<\infty\),则
定理 5.12(多元 CLT):\(X_1,\dots,X_n\) 为 IID 随机向量 \(X_i=(X_{1i},\dots,X_{ki})^T\),均值 \(\mu=(\mu_1,\dots,\mu_k)^T\),方差矩阵 \(\Sigma\);令 \(\bar X=(\bar X_1,\dots,\bar X_k)^T\),\(\bar X_j=\frac1n\sum_iX_{ji}\)。则 \(\sqrt n(\bar X-\mu)\rightsquigarrow N(0,\Sigma)\)。
5.5 Delta 方法(The Delta Method)(PDF p.93–94)
若 \(Y_n\) 有极限正态分布,Delta 方法给出光滑函数 \(g(Y_n)\) 的极限分布。
定理 5.13(Delta 方法):若 \(\frac{\sqrt n(Y_n-\mu)}\sigma\rightsquigarrow N(0,1)\),\(g\) 可微且 \(g'(\mu)\ne0\),则
例 5.14:\(X_i\) IID,\(W_n=e^{\bar X_n}\),\(g(s)=e^s\),\(g'(s)=e^s\),故 \(W_n\approx N(e^\mu,e^{2\mu}\sigma^2/n)\)。
定理 5.15(多元 Delta 方法):\(Y_n=(Y_{n1},\dots,Y_{nk})\) 满足 \(\sqrt n(Y_n-\mu)\rightsquigarrow N(0,\Sigma)\);\(g:\mathbb R^k\to\mathbb R\),梯度 \(\nabla g(y)=(\partial g/\partial y_1,\dots,\partial g/\partial y_k)^T\),\(\nabla_\mu\) 为其在 \(\mu\) 处的值且各元素非零。则
例 5.16:IID 二维向量 \((X_{1i},X_{2i})^T\),均值 \((\mu_1,\mu_2)^T\)、方差 \(\Sigma=(\sigma_{jk})\)。\(Y_n=\bar X_1\bar X_2=g(\bar X_1,\bar X_2)\),\(g(s_1,s_2)=s_1s_2\),\(\nabla g=(s_2,s_1)^T\)。
5.6 文献注(PDF p.94)
收敛在现代概率论中居中心地位:Grimmett & Stirzaker (1982)、Karr (1993)、Billingsley (1979);高级收敛理论见 van der Vaart & Wellner (1996)、van der Vaart (1998)。
5.7 附录(PDF p.95–96)
5.7.1 几乎必然收敛与 \(L_1\) 收敛:
- 几乎必然收敛(almost surely)\(X_n\xrightarrow{as}X\):\(\mathbb P(\{s:X_n(s)\to X(s)\})=1\)。
- \(L_1\) 收敛 \(X_n\xrightarrow{L_1}X\):\(\mathbb E|X_n-X|\to0\)。 定理 5.17:(a) 几乎必然 ⇒ 依概率;(b) 均方 ⇒ \(L_1\);(c) \(L_1\) ⇒ 依概率。 定理 5.18(强大数定律,SLLN):\(X_1,X_2,\dots\) IID,若 \(\mathbb E|X_1|<\infty\),则 \(\bar X_n\xrightarrow{as}\mu\)。(弱定律说依概率,强定律说几乎必然。) 渐近一致可积(asymptotically uniformly integrable):\(\lim_{M\to\infty}\limsup_{n\to\infty}\mathbb E(|X_n|I(|X_n|>M))=0\)。 定理 5.19:若 \(X_n\xrightarrow Pb\) 且渐近一致可积,则 \(\mathbb E(X_n)\to b\)。
5.7.2 CLT 证明(假设 MGF 在 0 的邻域有限): 引理 5.20:若 \(Z_n\) 的 MGF \(\psi_n(t)\to\psi(t)\)(\(Z\) 的 MGF)在 0 附近某开区间成立,则 \(Z_n\rightsquigarrow Z\)。 证明:令 \(Y_i=(X_i-\mu)/\sigma\),\(Z_n=n^{-1/2}\sum Y_i\)。设 \(\psi\) 为 \(Y_i\) 的 MGF,则 \(\sum Y_i\) 的 MGF 为 \(\psi(t)^n\),\(Z_n\) 的 MGF 为 \(\xi_n(t)=[\psi(t/\sqrt n)]^n\)。\(\psi'(0)=\mathbb E Y_1=0\),\(\psi''(0)=\mathbb E Y_1^2=1\),故 \(\psi(t)=1+\frac{t^2}2+\frac{t^3}{3!}\psi'''(0)+\cdots\)。于是
5.8 习题(PDF p.96–98)概览
共 16 题:题 1 证明 \(\mathbb E(S_n^2)=\sigma^2\) 且 \(S_n^2\xrightarrow P\sigma^2\)(提示:\(S_n^2=c_nn^{-1}\sum X_i^2-d_n\bar X_n^2\),\(c_n,d_n\to1\),再用大数律与定理 5.5(e));题 2 \(X_n\xrightarrow{qm}b\) 当且仅当 \(\mathbb E X_n\to b\) 且 \(\mathbb V X_n\to0\);题 3 方差有限时 \(\bar X_n\xrightarrow{qm}\mu\);题 4 \(\mathbb P(X_n=1/n)=1-1/n^2\)、\(\mathbb P(X_n=n)=1/n^2\) 是否依概率/均方收敛;题 5 伯努利的 \(\frac1n\sum X_i^2\) 依概率与均方收敛到 \(p\);题 6 身高均值 68、标准差 2.6,抽 100 人平均身高 ≥68 的近似概率;题 7 \(X_n\sim\) Poisson\((1/n)\),证 \(X_n\xrightarrow P0\) 与 \(nX_n\xrightarrow P0\);题 8 100 页代码每页错误数 Poisson(1),用 CLT 近似 \(\mathbb P(Y<90)\);题 9 \(X_n\) 以概率 \(1/n\) 取 \(e^n\) 否则等于 \(X\),判断各种收敛;题 10 正态尾的矩界 \(\mathbb P(|Z|>t)\le\mathbb E|Z|^k/t^k\) 并与 Mill 比较;题 11 \(X_n\sim N(0,1/n)\) 是否依概率/依分布收敛到点质量;题 12 整数值变量依分布收敛当且仅当各点概率收敛;题 13 \(X_n=n\min\{Z_1,\dots,Z_n\}\) 依分布收敛到均值 \(1/\lambda\) 的指数分布(\(\lambda=\lim_{x\downarrow0}f(x)\));题 14 \(Y_n=\bar X_n^2\)(均匀样本)的极限分布(Delta 方法);题 15 \(Y_n=\bar X_1/\bar X_2\) 的极限分布(多元 Delta 方法);题 16 构造 \(X_n\rightsquigarrow X\)、\(Y_n\rightsquigarrow Y\) 但 \(X_n+Y_n\) 不依分布收敛到 \(X+Y\) 的例子。
本章要点
- 三种主要收敛:均方 ⇒ 依概率 ⇒ 依分布;依分布到常数 ⇔ 依概率到常数;附录补充几乎必然与 \(L_1\)。反例要记住。
- 依概率收敛不保证期望收敛(需一致可积)。
- 连续映射定理与 Slutsky 定理是推导渐近分布的基本工具。
- 弱/强大数定律:样本均值收敛到总体均值。
- CLT:\(\sqrt n(\bar X_n-\mu)/\sigma\rightsquigarrow N(0,1)\);用 \(S_n\) 替代 \(\sigma\) 仍成立;Berry–Esseen 给出 \(O(1/\sqrt n)\) 误差,与三阶矩有关;有多元版本。
- Delta 方法(一元、多元)把渐近正态性传递到光滑函数,方差为 \(g'(\mu)^2\sigma^2/n\) 或 \(\nabla^T\Sigma\nabla/n\)。
与量化交易的关联
- 回测统计的理论基础:大数定律保证样本平均收益收敛到真实期望收益;CLT 给出均值估计的标准误 \(\sigma/\sqrt n\),即"t 统计量 = 均值/(标准差/√n)"的来源。日收益 Sharpe 的 t 值 ≈ SR·√T。
- Delta 方法计算 Sharpe 比率的标准误:Sharpe = \(\mu/\sigma\) 是均值和二阶矩的函数,用多元 Delta 方法(例 5.16 的思路)可得 IID 正态下 \(\text{SE}(\widehat{SR})\approx\sqrt{(1+SR^2/2)/n}\)(Lo 2002);同理可求波动率、Beta、信息比率、对数收益变换等统计量的渐近方差。
- Berry–Esseen 与厚尾:收益偏度和峰度大时,正态近似收敛慢,小样本下的 t 检验、正态 VaR 可能失准;三阶矩越大,所需样本越多。
- 依概率收敛 ≠ 期望收敛:5.2 节的反例(以小概率取极大值)正是"卖出深虚值期权/拾硬币于压路机前"策略的写照——几乎总是赚钱,期望却可能为负或无穷。
- 聚合与时间尺度:CLT 解释为何低频(月、季)收益比高频收益更接近正态;但 CLT 需要独立(或弱相依)和有限方差,波动聚集和厚尾会削弱这一结论。
- 多元 CLT:样本均值向量、样本协方差矩阵的渐近正态性是组合优化输入误差分析的基础。
推荐习题
- 题 1(样本方差的无偏性与相合性);题 14、15(Delta 方法,可改编为 Sharpe 比率标准误);题 8、6(CLT 数值近似);题 4、9、11、16(理解各种收敛的区别与反例);题 13(极值的极限分布)。
第 II 部分 统计推断(Statistical Inference)(扉页 PDF p.99)
第 6 章 模型、统计推断与学习(Models, Statistical Inference and Learning)(PDF p.100–109)
6.1 引言(PDF p.100)
统计推断(statistical inference),在计算机科学中称为"学习"(learning),是用数据推断生成数据之分布的过程。典型问题:给定样本 \(X_1,\dots,X_n\sim F\),如何推断 \(F\)?有时只需推断 \(F\) 的某个特征(如均值)。
6.2 参数模型与非参数模型(Parametric and Nonparametric Models)(PDF p.100–102)
统计模型(statistical model)\(\mathfrak F\) 是一组分布(或密度、回归函数)。参数模型(parametric model)可由有限个参数刻画,例如正态模型
例 6.1(一维参数估计):\(X_i\) 独立 Bernoulli\((p)\),估计 \(p\)。 例 6.2(二维参数估计):\(X_i\sim F\),假设 PDF 属于 (6.1),估计 \(\mu,\sigma\);若只关心 \(\mu\),则 \(\mu\) 为感兴趣参数(parameter of interest),\(\sigma\) 为冗余参数。 例 6.3(CDF 的非参数估计):只假设 \(F\in\mathfrak F_{ALL}\),估计 \(F\)。 例 6.4(非参数密度估计):估计 \(f=F'\)。仅假设 \(F\in\mathfrak F_{ALL}\) 时无法估计 \(f\),需加光滑性假设,例如 \(f\in\mathfrak F=\mathfrak F_{DENS}\cap\mathfrak F_{SOB}\),\(\mathfrak F_{DENS}\) 为全体密度,\(\mathfrak F_{SOB}=\{f:\int(f''(x))^2dx<\infty\}\) 为 Sobolev 空间——"不太扭曲(not too wiggly)"的函数集合。 例 6.5(泛函的非参数估计):只假设均值存在,估计 \(\mu=\mathbb E X_1=\int x\,dF(x)\)。均值可看作 \(F\) 的函数 \(\mu=T(F)\)。一般地,\(F\) 的任意函数称为统计泛函(statistical functional);例:方差 \(T(F)=\int x^2dF-(\int x\,dF)^2\),中位数 \(T(F)=F^{-1}(1/2)\)。 例 6.6(回归、预测与分类):观测成对数据 \((X_1,Y_1),\dots,(X_n,Y_n)\)(如血压与寿命)。\(X\) 称预测变量(predictor)、回归变量(regressor)、特征(feature)、自变量(independent variable);\(Y\) 称结果(outcome)、响应变量(response variable)、因变量(dependent variable)。\(r(x)=\mathbb E(Y\mid X=x)\) 称回归函数(regression function)。\(r\) 属于有限维集合(如所有直线)时为参数回归模型,否则为非参数回归模型。基于新个体的 \(X\) 预测 \(Y\) 称为预测(prediction);\(Y\) 离散时称分类(classification);估计函数 \(r\) 本身称回归或曲线估计(curve estimation)。回归模型常写成
接下来:多数入门课先讲参数推断,本书先讲非参数推断,因为某些方面它更易理解、更有用。 频率学派与贝叶斯学派:两大主流推断方法,本书都讲,先讲频率学派,优劣比较留待后文。 记号:参数模型中 \(\mathbb P_\theta(X\in A)=\int_Af(x;\theta)dx\),\(\mathbb E_\theta(r(X))=\int r(x)f(x;\theta)dx\),\(\mathbb V_\theta\) 类似。下标 \(\theta\) 表示"关于 \(f(x;\theta)\) 求概率/期望",不是对 \(\theta\) 求平均。
6.3 推断的基本概念(Fundamental Concepts in Inference)(PDF p.103–108)
多数推断问题属于三类:估计、置信集、假设检验。
6.3.1 点估计(Point Estimation)(PDF p.103–105)
点估计指对某个感兴趣量给出单一"最佳猜测",对象可以是参数、CDF \(F\)、密度 \(f\)、回归函数 \(r\),或某随机变量未来值 \(Y\) 的预测。约定点估计记为 \(\hat\theta\) 或 \(\hat\theta_n\)。\(\theta\) 是固定的未知量;\(\hat\theta\) 依赖数据,是随机变量。
形式上,\(X_1,\dots,X_n\) IID 来自 \(F\),参数 \(\theta\) 的点估计量(point estimator)是数据的函数 \(\hat\theta_n=g(X_1,\dots,X_n)\)。
- 偏差(bias):\(\text{bias}(\hat\theta_n)=\mathbb E_\theta(\hat\theta_n)-\theta\) (6.4);\(\mathbb E(\hat\theta_n)=\theta\) 时称无偏(unbiased)。作者指出无偏性过去很受重视,如今被认为不那么重要,本书许多估计量是有偏的。
- 定义 6.7(相合性,consistency):若 \(\hat\theta_n\xrightarrow P\theta\),称 \(\hat\theta_n\) 相合。(合理的要求:数据越多越接近真值。)
- \(\hat\theta_n\) 的分布称为抽样分布(sampling distribution);其标准差称为标准误(standard error):\(\text{se}=\text{se}(\hat\theta_n)=\sqrt{\mathbb V(\hat\theta_n)}\) (6.5)。se 通常依赖未知的 \(F\),因而本身未知,但一般可以估计,估计值记 \(\widehat{\text{se}}\)。
例 6.8:Bernoulli,\(\hat p_n=n^{-1}\sum X_i\),\(\mathbb E\hat p_n=p\) 无偏;\(\text{se}=\sqrt{p(1-p)/n}\),\(\widehat{\text{se}}=\sqrt{\hat p(1-\hat p)/n}\)。
均方误差(mean squared error, MSE):\(\text{MSE}=\mathbb E_\theta(\hat\theta_n-\theta)^2\) (6.6)。\(\mathbb E_\theta\) 是关于生成数据的分布 \(f(x_1,\dots,x_n;\theta)=\prod f(x_i;\theta)\) 求期望,不是对 \(\theta\) 求平均。
定理 6.9(偏差-方差分解):
定理 6.10:若 \(n\to\infty\) 时 bias → 0 且 se → 0,则 \(\hat\theta_n\) 相合。证明:MSE → 0 即均方收敛,由定理 5.4(a) 得依概率收敛。(原文引用写作 5.4(b),实为 (a)。) 例 6.11:\(\hat p_n\) 无偏且 \(\text{se}\to0\),故相合。
定义 6.12(渐近正态):\(\frac{\hat\theta_n-\theta}{\text{se}}\rightsquigarrow N(0,1)\) (6.8)。许多估计量近似正态。
6.3.2 置信集(Confidence Sets)(PDF p.105–107)
参数 \(\theta\) 的 \(1-\alpha\) 置信区间(confidence interval)\(C_n=(a,b)\),\(a=a(X_1,\dots,X_n)\)、\(b=b(X_1,\dots,X_n)\) 是数据的函数,满足
警告(解释):置信区间不是关于 \(\theta\) 的概率陈述,因为 \(\theta\) 不是随机变量。有些教材解释为"重复同一实验,区间 95% 的时间包含参数",这对但无用,因为很少重复同一实验。更好的解释:第 1 天收集数据为参数 \(\theta_1\) 构造 95% 区间,第 2 天为不相关的 \(\theta_2\) 构造,依此类推……你构造的所有区间中有 95% 套住了各自的真参数——无须引入"重复同一实验"。
例 6.13(民调):"83% 的人支持给飞行员配枪,误差 ±4 个百分点,95% 的时间准确"即 83±4 是 95% 置信区间。如果你余生每天都这样构造区间,95% 会包含真参数,即使每天估计的是不同问题。
例 6.14(Berger & Wolpert 1984 的反例):\(\theta\) 为固定实数,\(X_1,X_2\) 独立且 \(\mathbb P(X_i=\pm1)=1/2\),只观测 \(Y_i=\theta+X_i\)。定义只含一个点的"置信区间":若 \(Y_1=Y_2\),\(C=\{Y_1-1\}\);若 \(Y_1\ne Y_2\),\(C=\{(Y_1+Y_2)/2\}\)。无论 \(\theta\) 为何,\(\mathbb P_\theta(\theta\in C)=3/4\),是 75% 置信区间。若观测到 \(Y_1=15\)、\(Y_2=17\),区间为 \(\{16\}\),而此时我们确定 \(\theta=16\);若要做关于 \(\theta\) 的概率陈述,会说 \(\mathbb P(\theta\in C\mid Y_1,Y_2)=1\)。说 \(\{16\}\) 是 75% 置信区间没错,但它不是关于 \(\theta\) 的概率陈述。第 11 章贝叶斯方法把 \(\theta\) 当随机变量,给出"给定数据时 \(\theta\) 在 \(C_n\) 内的概率为 95%"之类陈述,但那是信念度概率,一般并不保证 95% 的时间套住参数。
例 6.15:硬币问题中 \(C_n=(\hat p_n-\epsilon_n,\hat p_n+\epsilon_n)\),\(\epsilon_n^2=\log(2/\alpha)/(2n)\),由 Hoeffding 不等式 (4.4),\(\mathbb P(p\in C_n)\ge1-\alpha\) 对所有 \(p\) 成立。
定理 6.16(基于正态的置信区间):设 \(\hat\theta_n\approx N(\theta,\widehat{\text{se}}^2)\),\(z_{\alpha/2}=\Phi^{-1}(1-\alpha/2)\),即 \(\mathbb P(Z>z_{\alpha/2})=\alpha/2\),\(\mathbb P(-z_{\alpha/2}<Z<z_{\alpha/2})=1-\alpha\)。令
例 6.17:Bernoulli,\(\mathbb V(\hat p_n)=p(1-p)/n\),由 CLT 得近似区间 \(\hat p_n\pm z_{\alpha/2}\sqrt{\hat p_n(1-\hat p_n)/n}\)(Wald 区间)。与例 6.15 相比:正态区间更短,但只有近似(大样本)正确的覆盖率;Hoeffding 区间有限样本严格成立但更宽。
6.3.3 假设检验(Hypothesis Testing)(PDF p.107–108)
从一个默认理论——原假设(null hypothesis)出发,问数据是否提供足够证据拒绝它;若否,则保留原假设("retaining the null"一词来自 Chris Genovese;其他说法:"接受原假设""未能拒绝原假设")。 例 6.18(检验硬币是否公平):\(H_0:p=1/2\) vs \(H_1:p\ne1/2\)(\(H_1\) 为备择假设 alternative hypothesis)。合理做法是当 \(T=|\hat p_n-1/2|\) 大时拒绝 \(H_0\);多大才拒绝留待第 10 章。
6.4 文献注(PDF p.108)
入门:DeGroot & Schervish (2002)、Larsen & Marx (1986);中级:Casella & Berger (2002)、Bickel & Doksum (2000)、Rice (1995);高级:Cox & Hinkley (2000)、Lehmann & Casella (1998)、Lehmann (1986)、van der Vaart (1998)。
6.5 附录(PDF p.108)
本书定义要求对所有 \(\theta\) 有 \(\mathbb P_\theta(\theta\in C_n)\ge1-\alpha\)(有限样本)。逐点渐近置信区间(pointwise asymptotic):对所有 \(\theta\),\(\liminf_n\mathbb P_\theta(\theta\in C_n)\ge1-\alpha\);一致渐近置信区间(uniform asymptotic):\(\liminf_n\inf_\theta\mathbb P_\theta(\theta\in C_n)\ge1-\alpha\)。基于正态的近似区间是逐点渐近置信区间。
6.6 习题(PDF p.108–109)
共 3 题:Poisson 样本均值 \(\hat\lambda\) 的 bias、se、MSE;Uniform\((0,\theta)\) 下 \(\hat\theta=\max X_i\) 的 bias、se、MSE;Uniform\((0,\theta)\) 下 \(\hat\theta=2\bar X_n\) 的 bias、se、MSE(两者比较体现有偏估计可能 MSE 更小)。
本章要点
- 统计模型分参数与非参数;感兴趣参数与冗余参数;统计泛函 \(T(F)\) 统一了均值、方差、中位数等目标。
- 回归函数 \(r(x)=\mathbb E(Y\mid X=x)\),任何回归都可写成 \(Y=r(X)+\epsilon\),\(\mathbb E\epsilon=0\)。
- 点估计的评价:偏差、标准误、MSE = 偏差² + 方差;相合性;渐近正态。
- 置信区间是关于随机区间的覆盖率陈述,不是关于参数的概率陈述;正态区间 \(\hat\theta\pm z_{\alpha/2}\widehat{\text{se}}\) 是渐近的,Hoeffding 区间是有限样本的。
- 假设检验的基本框架:原假设、备择假设、检验统计量。
与量化交易的关联
- 偏差-方差权衡是因子研究与模型选择的核心:收缩估计(如 Ledoit–Wolf 协方差收缩、岭回归因子模型)有意引入偏差以大幅降低方差,从而降低 MSE;习题 2、3 的对比是很好的入门例子。
- 标准误思维:任何回测指标(平均收益、Sharpe、IC、胜率)都是样本统计量,有抽样分布和标准误;报告点估计必须同时报告 se 或置信区间。
- 置信区间的正确解释:例 6.13 的"每天构造不相关区间,95% 正确"的解释适合向投研团队讲解:一个研究员长期报告的 95% 区间,大约 5% 会出错。
- 回归函数 \(\mathbb E(Y\mid X)\) 即"给定因子暴露时的条件期望收益",预测任务就是估计它;分类对应涨跌方向预测。
- 冗余参数:例如估计 alpha 时市场 beta 和残差波动率是冗余参数。
- 假设检验为第 10 章"策略是否有效"的统计检验做铺垫。
推荐习题
- 题 2、3(比较 \(\max X_i\) 与 \(2\bar X_n\):有偏但 MSE 更小的估计量);题 1(基本计算)。
第 7 章 估计 CDF 与统计泛函(Estimating the CDF and Statistical Functionals)(PDF p.110–118)
第一个推断问题:非参数地估计 CDF \(F\),再估计统计泛函(均值、方差、相关系数等 CDF 的函数)。非参数估计泛函的方法称为插入法(plug-in method)。
7.1 经验分布函数(The Empirical Distribution Function)(PDF p.110–112)
定义 7.1:\(X_1,\dots,X_n\sim F\) IID。经验分布函数(empirical distribution function)\(\hat F_n\) 是在每个数据点放 \(1/n\) 质量的 CDF:
例 7.2(神经数据):Cox & Lewis (1966) 记录了神经纤维上相邻脉冲之间的 799 个等待时间。图 7.1 画出经验 CDF(底部竖线为数据点,上下两条线为 95% 置信带)。估计等待时间介于 .4 与 .6 秒之间的比例:\(\hat F_n(.6)-\hat F_n(.4)=.93-.84=.09\)。
定理 7.3:对任意固定 \(x\),
定理 7.4(Glivenko–Cantelli 定理):\(\sup_x|\hat F_n(x)-F(x)|\xrightarrow P0\)(更精确地,几乎必然收敛)。即经验 CDF 一致收敛于真 CDF。
定理 7.5(Dvoretzky–Kiefer–Wolfowitz (DKW) 不等式):对任意 \(\epsilon>0\),
\(F\) 的非参数 \(1-\alpha\) 置信带:
7.2 统计泛函(Statistical Functionals)(PDF p.112–116)
统计泛函 \(T(F)\) 是 \(F\) 的任意函数,例如均值 \(\mu=\int x\,dF\)、方差 \(\sigma^2=\int(x-\mu)^2dF\)、中位数 \(m=F^{-1}(1/2)\)。
定义 7.7:\(\theta=T(F)\) 的插入估计量(plug-in estimator)为 \(\hat\theta_n=T(\hat F_n)\),即把未知的 \(F\) 换成 \(\hat F_n\)。 定义 7.8:若 \(T(F)=\int r(x)dF(x)\),称 \(T\) 为线性泛函(linear functional),因为 \(T(aF+bG)=aT(F)+bT(G)\)。 定理 7.9:线性泛函的插入估计量为
有时可通过计算得 \(\widehat{\text{se}}\),但许多情况并不明显,第 8 章给出通用方法(bootstrap)。在许多情况下
例 7.10(均值):\(\hat\mu=\int x\,d\hat F_n=\bar X_n\),\(\text{se}=\sigma/\sqrt n\),\(\widehat{\text{se}}=\hat\sigma/\sqrt n\),正态区间 \(\bar X_n\pm z_{\alpha/2}\widehat{\text{se}}\)。 例 7.11(方差):\(\sigma^2=\int x^2dF-(\int x\,dF)^2\),插入估计
除均值外,上述例子的标准误如何求?参数方法将给出公式(第 9 章),非参数情形用第 8 章的 bootstrap。
例 7.15(血浆胆固醇):Scott et al. (1978),371 名胸痛患者的血浆胆固醇(mg/dl),图 7.2 为两组直方图:51 人无心脏病证据,320 人动脉狭窄。视为来自 \(F_1,F_2\) 的样本。插入估计 \(\hat\mu_1=\bar X_{n,1}=195.27\),\(\hat\mu_2=216.19\)。\(\widehat{\text{se}}(\hat\mu)=\hat\sigma/\sqrt n\),\(\hat\sigma=\sqrt{\frac1n\sum(X_i-\hat\mu)^2}\),得 \(\widehat{\text{se}}(\hat\mu_1)=5.0\),\(\widehat{\text{se}}(\hat\mu_2)=2.4\);95% 区间 \((185,205)\)、\((211,221)\)。差 \(\theta=T(F_2)-T(F_1)\) 的插入估计 \(\hat\theta=20.92\),\(\text{se}=\sqrt{\mathbb V(\hat\mu_2-\hat\mu_1)}=\sqrt{\text{se}^2(\hat\mu_1)+\text{se}^2(\hat\mu_2)}\)(独立样本),估计 \(\widehat{\text{se}}=\sqrt{5^2+2.4^2}=5.55\);95% 区间 \(\hat\theta\pm2\widehat{\text{se}}=(9.8,32.0)\),提示动脉狭窄者胆固醇更高。但不能据此断言胆固醇导致心脏病——从统计证据到因果非常微妙(第 16 章)。
7.3 文献注(PDF p.117)
Glivenko–Cantelli 定理只是冰山一角,分布函数理论是经验过程(empirical processes)的特例,后者是现代统计理论的基础。参考 Shorack & Wellner (1986)、van der Vaart & Wellner (1996)。
7.4 习题(PDF p.117–118)概览
共 10 题:证明定理 7.3(题 1);两独立伯努利样本的 \(p\) 与 \(p-q\) 的插入估计、se、90% 区间(题 2);计算机实验:\(N(0,1)\) 与柯西各 100 个观测的 95% DKW 置信带,重复 1000 次检验覆盖率(题 3,DKW 带不依赖分布形式);用 CLT 求 \(\hat F_n(x)\) 的极限分布(题 4);\(\text{Cov}(\hat F_n(x),\hat F_n(y))\)(题 5);\(\theta=F(b)-F(a)\) 的估计、se 与区间(题 6);斐济附近地震震级数据:估计 CDF、95% 置信包络、\(F(4.9)-F(4.3)\) 的区间(题 7);老忠实泉喷发等待时间的均值、se、90% 区间与中位数(题 8);两种抗生素治愈率 90/100 与 85/100,\(\theta=p_1-p_2\) 的估计、se、80% 与 95% 区间(题 9);1975 年人工降雨实验(26 朵播撒碘化银 vs 26 朵对照,随机分配)均值差的估计与区间(题 10)。
本章要点
- 经验 CDF 是 \(F\) 的无偏、相合估计;Glivenko–Cantelli 给出一致收敛;DKW 不等式给出有限样本、分布无关的同时置信带。
- 插入原则:\(\hat\theta=T(\hat F_n)\);线性泛函的插入估计即样本平均 \(\frac1n\sum r(X_i)\)。
- 样本均值、方差、偏度、相关系数、分位数都是插入估计量。
- 正态区间 \(T(\hat F_n)\pm z_{\alpha/2}\widehat{\text{se}}\);独立两组差的 se 为各自 se 的平方和开方。
- 统计关联 ≠ 因果。
与量化交易的关联
- 历史模拟法 VaR/ES 就是经验 CDF 的插入估计:VaR = 历史损益的样本分位数 \(\hat F_n^{-1}(\alpha)\),ES = 尾部样本平均(插入估计)。DKW 不等式可以给出整条经验收益分布的置信带,用于判断尾部估计的不确定性(需注意收益非 IID)。
- 插入原则无处不在:样本均值、波动率、偏度、峰度、相关矩阵、Beta 都是插入估计;"把经验分布当真分布"是回测本身的隐含假设。
- 两组比较(例 7.15、题 9)可直接迁移到"策略在两个样本期/两类股票上的平均收益差"及其标准误。
- 偏度:收益偏度是风险溢价研究的重要特征(负偏资产要求更高溢价),其标准误需要 bootstrap(例 8.2)。
- 因果提醒:因子与收益的相关不代表因果,回测中的伪相关需要警惕。
推荐习题
- 题 3(DKW 置信带覆盖率模拟,正态与柯西对比);题 6、9(差值的 se 与置信区间);题 4、5(经验 CDF 的分布与协方差)。
第 8 章 Bootstrap(The Bootstrap)(PDF p.119–130)
Bootstrap 是估计标准误和计算置信区间的方法。\(T_n=g(X_1,\dots,X_n)\) 为统计量(数据的任意函数),想知道 \(\mathbb V_F(T_n)\);下标 \(F\) 强调方差通常依赖未知的 \(F\)。例如 \(T_n=\bar X_n\) 时 \(\mathbb V_F(T_n)=\sigma^2/n\),\(\sigma^2=\int(x-\mu)^2dF\),是 \(F\) 的函数。
Bootstrap 思想两步:
- 第 1 步:用 \(\mathbb V_{\hat F_n}(T_n)\) 估计 \(\mathbb V_F(T_n)\);
- 第 2 步:用模拟近似 \(\mathbb V_{\hat F_n}(T_n)\)。 对 \(T_n=\bar X_n\),第 1 步即可:\(\mathbb V_{\hat F_n}(T_n)=\hat\sigma^2/n\),\(\hat\sigma^2=n^{-1}\sum(X_i-\bar X_n)^2\)。复杂情形写不出 \(\mathbb V_{\hat F_n}(T_n)\) 的简单公式,才需要第 2 步。
8.1 模拟(Simulation)(PDF p.120)
从分布 \(G\) 抽 IID 样本 \(Y_1,\dots,Y_B\),由大数定律 \(\bar Y_n=\frac1B\sum Y_j\xrightarrow P\int y\,dG(y)=\mathbb E(Y)\)(\(B\to\infty\))。模拟中 \(B\) 可任意大,因此 \(\bar Y\) 与 \(\mathbb E Y\) 之差可以忽略。一般地,\(\frac1B\sum h(Y_j)\xrightarrow P\mathbb E h(Y)\);特别地
8.2 Bootstrap 方差估计(Bootstrap Variance Estimation)(PDF p.120–122)
\(\mathbb V_{\hat F_n}(T_n)\) 指"若数据分布为 \(\hat F_n\),\(T_n\) 的方差"。模拟方法:从 \(\hat F_n\) 抽 \(X_1^*,\dots,X_n^*\),计算 \(T_n^*=g(X_1^*,\dots,X_n^*)\),即为 \(T_n\) 分布的一次抽样。图示:
- 真实世界:\(F\Rightarrow X_1,\dots,X_n\Rightarrow T_n=g(X_1,\dots,X_n)\)
- Bootstrap 世界:\(\hat F_n\Rightarrow X_1^*,\dots,X_n^*\Rightarrow T_n^*=g(X_1^*,\dots,X_n^*)\)
由于 \(\hat F_n\) 在每个数据点放 \(1/n\) 质量,从 \(\hat F_n\) 抽一个观测等价于从原数据中随机抽一个点,所以只需从原数据有放回地抽 \(n\) 个。
Bootstrap 方差估计算法:
- 抽 \(X_1^*,\dots,X_n^*\sim\hat F_n\);
- 计算 \(T_n^*=g(X_1^*,\dots,X_n^*)\);
- 重复 1–2 共 \(B\) 次,得 \(T_{n,1}^*,\dots,T_{n,B}^*\);
-
\[v_{boot}=\frac1B\sum_{b=1}^B\left(T_{n,b}^*-\frac1B\sum_{r=1}^BT_{n,r}^*\right)^2;\tag{8.1}\]
\(\widehat{\text{se}}_{boot}=\sqrt{v_{boot}}\)。
例 8.1(中位数标准误的伪代码):
T <- median(X)
Tboot <- vector of length B
for (i in 1:B) {
Xstar <- sample of size n from X (with replacement)
Tboot[i] <- median(Xstar)
}
se <- sqrt(variance(Tboot))
(计算复杂度 \(O(B\cdot\text{cost}(g))\)。)
两层近似:\(\mathbb V_F(T_n)\overset{\text{不太小}}{\approx}\mathbb V_{\hat F_n}(T_n)\overset{\text{小}}{\approx}v_{boot}\)。第一层误差来自用 \(\hat F_n\) 代替 \(F\)(由样本量决定),第二层是模拟误差(\(B\) 足够大即可忽略)。
例 8.2:神经数据的偏度 \(\theta=\int(x-\mu)^3dF/\sigma^3\)(正态分布偏度为 0),插入估计 \(\hat\theta=\frac1n\sum(X_i-\bar X_n)^3/\hat\sigma^3\)。对每个 bootstrap 样本计算偏度,\(B=1000\) 得偏度估计的标准误 .16。
8.3 Bootstrap 置信区间(Bootstrap Confidence Intervals)(PDF p.122–127)
介绍三种方法。
方法 1:正态区间:\(T_n\pm z_{\alpha/2}\widehat{\text{se}}_{boot}\) (8.2)。除非 \(T_n\) 的分布接近正态,否则不准确。
方法 2:枢轴区间(Pivotal Intervals):\(\theta=T(F)\),\(\hat\theta_n=T(\hat F_n)\),定义枢轴量(pivot)\(R_n=\hat\theta_n-\theta\),其 CDF \(H(r)=\mathbb P_F(R_n\le r)\) (8.3)。令 \(C_n^*=(a,b)\),
方法 3:百分位区间(Percentile Intervals):\(C_n=(\theta^*_{\alpha/2},\theta^*_{1-\alpha/2})\),即直接取 bootstrap 复制值的分位数。理由见附录。
例 8.4(神经数据偏度的 95% 区间):正态 (1.44, 2.09);枢轴 (1.48, 2.11);百分位 (1.42, 2.03)。三者都是近似的,精度相同;还有更精确但更复杂的 bootstrap 区间(如 BCa),本书不讨论。
例 8.5(胆固醇数据,中位数之差):伪代码——对两组分别有放回重抽样(各自保持原样本量 \(n_1,n_2\)),计算 median(xx2) − median(xx1),重复 \(B=1000\) 次;
Normal <- (th.hat - 2*se, th.hat + 2*se)
percentile <- (quantile(Tboot,.025), quantile(Tboot,.975))
pivotal <- (2*th.hat - quantile(Tboot,.975), 2*th.hat - quantile(Tboot,.025))
点估计 18.5,bootstrap se 7.42;95% 区间:正态 (3.7, 33.3),枢轴 (5.0, 34.0),百分位 (5.0, 33.3)。都不含 0,第二组胆固醇似乎更高,但区间宽,"高多少"不确定性很大。
作者提醒:下面两例样本量很小,小样本统计方法可能不可靠,仅供教学,结果需怀疑地看待。
例 8.6(Efron 最早的 bootstrap 示例:法学院数据):15 所法学院的 LSAT 与 GPA:LSAT = 576, 635, 558, 578, 666, 580, 555, 661, 651, 605, 653, 575, 545, 572, 594;GPA = 3.39, 3.30, 2.81, 3.03, 3.44, 3.07, 3.00, 3.43, 3.36, 3.13, 3.12, 2.74, 2.76, 2.88, 3.96。关心相关系数 \(\theta\),插入估计为样本相关 \(\hat\theta=.776\);\(B=1000\) 得 \(\widehat{\text{se}}=.137\)。图 8.1 上为散点图,下为 bootstrap 复制值直方图(近似 \(\hat\theta\) 的抽样分布,左偏)。正态 95% 区间 \(.78\pm2\widehat{\text{se}}=(.51,1.00)\),百分位区间 \((.46,.96)\);大样本下两者会更接近。
例 8.7(生物等效性,取自 Efron & Tibshirani 1993):药企推出新药时有时需证明生物等效(bioequivalence),即新药与现有疗法无实质差异。8 名受试者分别使用安慰剂、旧贴片、新贴片注入激素,数据(placebo/old/new/old−placebo/new−old): 1: 9243/17649/16449/8406/−1200;2: 9671/12013/14614/2342/2601;3: 11792/19979/17274/8187/−2705;4: 13357/21816/23798/8459/1982;5: 9055/13850/12560/4795/−1290;6: 6290/9806/10157/3516/351;7: 12412/17208/16570/4796/−638;8: 18806/29044/26325/10238/−2719。 令 \(Z\)=old−placebo,\(Y\)=new−old。FDA 要求 \(|\theta|\le.20\),\(\theta=\mathbb E_F(Y)/\mathbb E_F(Z)\)。插入估计 \(\hat\theta=\bar Y/\bar Z=-452.3/6342=-0.0713\);bootstrap se = 0.105;\(B=1000\) 得 95% 区间 \((-0.24,0.15)\),不完全落在 \((-0.20,0.20)\) 内,因此在 95% 水平上未能证明生物等效(图 8.2 为 bootstrap 直方图)。
8.4 文献注(PDF p.127)
Bootstrap 由 Efron (1979) 发明。参考书:Efron & Tibshirani (1993)、Davison & Hinkley (1997)、Hall (1992)、Shao & Tu (1995);另见 van der Vaart & Wellner (1996) 3.6 节。
8.5 附录(PDF p.127–128)
8.5.1 刀切法(The Jackknife):Quenouille (1949) 提出,计算量比 bootstrap 小但适用范围较窄。\(T_{(-i)}\) 为去掉第 \(i\) 个观测后的统计量,\(\bar T_n=n^{-1}\sum T_{(-i)}\),刀切方差估计
8.5.2 百分位区间的理由:设存在单调变换 \(U=m(T)\) 使 \(U\sim N(\phi,c^2)\),\(\phi=m(\theta)\)(不必知道 \(m\),只需存在)。令 \(U_b^*=m(\hat\theta_{n,b}^*)\),\(u_\beta^*\) 为其样本分位数。单调变换保持分位数:\(u_{\alpha/2}^*=m(\theta_{\alpha/2}^*)\)。又 \(U\sim N(\phi,c^2)\),\(U\) 的 \(\alpha/2\) 分位数为 \(\phi-z_{\alpha/2}c\),故 \(u_{\alpha/2}^*\approx U-z_{\alpha/2}c\),\(u_{1-\alpha/2}^*\approx U+z_{\alpha/2}c\)。于是 \(\mathbb P(\theta_{\alpha/2}^*\le\theta\le\theta_{1-\alpha/2}^*)=\mathbb P(m(\theta_{\alpha/2}^*)\le m(\theta)\le m(\theta_{1-\alpha/2}^*))=\mathbb P(U-cz_{\alpha/2}\le\phi\le U+cz_{\alpha/2})=\mathbb P(-z_{\alpha/2}\le\frac{U-\phi}c\le z_{\alpha/2})=1-\alpha\)。精确的正态化变换很少存在,但可能存在近似的。
8.6 习题(PDF p.128–130)概览
共 8 题:题 1 用法学院数据求相关系数的插入估计、bootstrap se 和三种 95% 区间;题 2(计算机实验) 比较三种区间的真实覆盖率:\(n=50\),\(Y_i\sim N(0,1)\),\(X_i=e^{Y_i}\)(对数正态),目标为偏度;题 3 对 \(t_3\) 样本(\(n=25\)),目标 \(\theta=(q_{.75}-q_{.25})/1.34\)(基于四分位距的稳健尺度),比较正态/百分位/枢轴区间的覆盖率与长度;题 4 无结时不同 bootstrap 样本数为 \(\binom{2n-1}n\)(提示:\(n\) 个球放 \(n\) 个桶);题 5 求 \(\mathbb E(\bar X_n^*\mid X_1..X_n)\)、\(\mathbb V(\bar X_n^*\mid\cdot)\)、\(\mathbb E(\bar X_n^*)\)、\(\mathbb V(\bar X_n^*)\);题 6 \(X_i\sim N(\mu,1)\),\(\theta=e^\mu\),\(\hat\theta=e^{\bar X}\),\(\mu=5\)、\(n=100\),bootstrap se、区间及与真实抽样分布对比;题 7(bootstrap 失效的例子):Uniform\((0,\theta)\),\(\hat\theta=X_{max}\),\(n=50\)、\(\theta=1\);证明 \(\mathbb P(\hat\theta=\theta)=0\) 而 \(\mathbb P(\hat\theta^*=\hat\theta)=1-(1-1/n)^n\to1-e^{-1}\approx.632\)——在参数空间边界的极值统计量上 bootstrap 表现很差;题 8 \(T_n=\bar X_n^2\) 的 bootstrap 方差与中心矩的关系。
本章要点
- Bootstrap = 插入原则(用 \(\hat F_n\) 代替 \(F\))+ 蒙特卡洛模拟(有放回重抽样)。
- 方差估计算法:重抽样 \(B\) 次、计算统计量、取样本方差。
- 三种区间:正态 \(T_n\pm z\widehat{\text{se}}_{boot}\);枢轴 \((2\hat\theta-\theta^*_{1-\alpha/2},2\hat\theta-\theta^*_{\alpha/2})\);百分位 \((\theta^*_{\alpha/2},\theta^*_{1-\alpha/2})\)。注意枢轴与百分位区间分位数的"反转"。
- 刀切法是低成本替代,但对分位数失效;bootstrap 在极值/边界问题上可能失效。
- 两组比较时各组分别重抽样。
与量化交易的关联
- 回测指标的不确定性:Sharpe 比率、最大回撤、Calmar、IC、胜率、中位数收益等统计量的标准误没有简单公式,bootstrap 是最常用工具;例 8.5 的伪代码可直接改写为"两策略 Sharpe 之差的 bootstrap 置信区间"。
- 非 IID 的修正:本章 bootstrap 假设 IID。金融收益有自相关和波动聚集,实务中应使用块 bootstrap(block / stationary bootstrap),按时间块重抽样以保留依赖结构;编写教材时应补充这一点。
- 组合/模型稳健性:对收益样本 bootstrap 后重复做组合优化(resampled efficiency,Michaud)或重复估计因子模型,评估权重和因子载荷的稳定性。
- 比率型统计量:例 8.7 的 \(\bar Y/\bar Z\) 与信息比率、Beta(协方差/方差)、换手调整收益等比率指标结构相同;也可与第 5 章 Delta 方法结果相互验证。
- bootstrap 失效场景:习题 7 提醒对最大值类统计量(最大回撤、极端损失、最佳策略的最大 Sharpe)直接 bootstrap 可能严重失真,需要谨慎或改用其他方法(如子抽样 subsampling、极值理论)。
- 多策略选择偏差:White 的 Reality Check、Hansen 的 SPA 检验都是基于 bootstrap 的"数据窥探"检验,是本章方法在策略筛选中的直接延伸。
推荐习题
- 题 2、3(比较三种 bootstrap 区间的覆盖率,必做模拟);题 7(bootstrap 失效);题 1(法学院相关系数);题 4、5(理解 bootstrap 分布的性质);题 6(与 Delta 方法对照)。
第 9 章 参数推断(Parametric Inference)(PDF p.131–160)
参数模型 \(\mathfrak F=\{f(x;\theta):\theta\in\Theta\}\) (9.1),\(\Theta\subset\mathbb R^k\),\(\theta=(\theta_1,\dots,\theta_k)\)。推断问题化为估计 \(\theta\)。
学生常问:怎么知道数据来自某个参数模型?作者答:这是好问题,我们很少能知道,所以非参数方法更可取。但学参数方法仍有两个理由:一是背景知识有时表明参数模型是合理近似(如交通事故计数近似 Poisson);二是参数模型中的推断概念是理解某些非参数方法的基础。本章介绍矩估计与最大似然估计。
9.1 感兴趣参数(Parameter of Interest)(PDF p.132)
常常只关心某个函数 \(T(\theta)\)。例如 \(X\sim N(\mu,\sigma^2)\)、目标是 \(\mu\),则 \(\mu=T(\theta)\) 为感兴趣参数,\(\sigma\) 为冗余参数。 例 9.1:血液检测结果 \(X_i\sim N(\mu,\sigma^2)\),关心检测值大于 1 的人口比例 \(\tau\):
9.2 矩估计法(The Method of Moments)(PDF p.132–134)
矩估计不是最优的,但通常容易计算,也常作为迭代数值方法的初值。 \(\theta\) 有 \(k\) 个分量,对 \(1\le j\le k\) 定义第 \(j\) 阶(总体)矩 \(\alpha_j\equiv\alpha_j(\theta)=\mathbb E_\theta(X^j)=\int x^jdF_\theta(x)\) (9.2),第 \(j\) 阶样本矩 \(\hat\alpha_j=\frac1n\sum X_i^j\) (9.3)。 定义 9.3:矩估计量(method of moments estimator)\(\hat\theta_n\) 是使 \(\alpha_j(\hat\theta_n)=\hat\alpha_j\)(\(j=1,\dots,k\))成立的 \(\theta\) (9.4)——\(k\) 个方程 \(k\) 个未知数。 例 9.4:Bernoulli,\(\alpha_1=p\),\(\hat\alpha_1=\bar X\),得 \(\hat p_n=\frac1n\sum X_i\)。 例 9.5:正态,\(\alpha_1=\mu\),\(\alpha_2=\mathbb E X^2=\sigma^2+\mu^2\)。解 \(\hat\mu=\frac1n\sum X_i\),\(\hat\sigma^2+\hat\mu^2=\frac1n\sum X_i^2\),得 \(\hat\mu=\bar X_n\),\(\hat\sigma^2=\frac1n\sum(X_i-\bar X_n)^2\)。
定理 9.6:在模型的适当条件下,矩估计量 (1) 以趋于 1 的概率存在;(2) 相合:\(\hat\theta_n\xrightarrow P\theta\);(3) 渐近正态:\(\sqrt n(\hat\theta_n-\theta)\rightsquigarrow N(0,\Sigma)\),其中 \(\Sigma=g\,\mathbb E_\theta(YY^T)g^T\),\(Y=(X,X^2,\dots,X^k)^T\),\(g=(g_1,\dots,g_k)\),\(g_j=\partial\alpha_j^{-1}(\theta)/\partial\theta\)。 第 (3) 条可用来求标准误与置信区间,但更简单的是 bootstrap(本章末讨论)。
9.3 最大似然(Maximum Likelihood)(PDF p.134–136)
参数模型中最常用的估计方法。\(X_1,\dots,X_n\) IID,PDF \(f(x;\theta)\)。 定义 9.7:似然函数(likelihood function)\(\mathcal L_n(\theta)=\prod_{i=1}^nf(X_i;\theta)\) (9.5);对数似然(log-likelihood)\(\ell_n(\theta)=\log\mathcal L_n(\theta)\)。 似然就是数据的联合密度,只不过把它看作参数的函数,\(\mathcal L_n:\Theta\to[0,\infty)\)。似然不是关于 \(\theta\) 的密度函数,一般对 \(\theta\) 积分不为 1。 定义 9.8:最大似然估计量(maximum likelihood estimator, MLE)\(\hat\theta_n\) 是使 \(\mathcal L_n(\theta)\) 最大的 \(\theta\)。 \(\ell_n\) 与 \(\mathcal L_n\) 最大值位置相同,通常对数似然更好处理。 注 9.9:\(\mathcal L_n\) 乘以与 \(\theta\) 无关的正常数不改变 MLE,因此常省略常数。
例 9.10:Bernoulli,\(f(x;p)=p^x(1-p)^{1-x}\),\(\mathcal L_n(p)=\prod p^{X_i}(1-p)^{1-X_i}=p^S(1-p)^{n-S}\),\(S=\sum X_i\);\(\ell_n(p)=S\log p+(n-S)\log(1-p)\),求导令为 0 得 \(\hat p_n=S/n\)。图 9.1:\(n=20\)、\(\sum X_i=12\) 时似然在 \(\hat p=0.6\) 处最大。 例 9.11:\(N(\mu,\sigma^2)\),\(\theta=(\mu,\sigma)\),忽略常数
9.4 MLE 的性质(Properties of Maximum Likelihood Estimators)(PDF p.136–138)
在模型的某些条件下 MLE 具有许多吸引人的性质:
- 相合:\(\hat\theta_n\xrightarrow P\theta_\star\)(\(\theta_\star\) 为真值);
- 同变(equivariant):若 \(\hat\theta_n\) 是 \(\theta\) 的 MLE,则 \(g(\hat\theta_n)\) 是 \(g(\theta)\) 的 MLE;
- 渐近正态:\((\hat\theta-\theta_\star)/\widehat{\text{se}}\rightsquigarrow N(0,1)\),且 \(\widehat{\text{se}}\) 常可解析计算;
- 渐近最优/有效(efficient):粗略说,在所有表现良好的估计量中,MLE(至少大样本时)方差最小;
- 近似为贝叶斯估计量(后文解释)。 在足够复杂的问题中,这些性质不再成立,MLE 也不再是好估计。这些性质只在模型满足正则条件(regularity conditions,本质上是 \(f(x;\theta)\) 的光滑性条件)时成立,除非另说明,默认成立。
9.5 MLE 的相合性(Consistency of Maximum Likelihood Estimators)(PDF p.138–139)
Kullback–Leibler 距离:PDF \(f,g\) 之间
直观:最大化 \(\ell_n(\theta)\) 等价于最大化 \(M_n(\theta)=\frac1n\sum_i\log\frac{f(X_i;\theta)}{f(X_i;\theta_\star)}\)(因 \(M_n(\theta)=n^{-1}(\ell_n(\theta)-\ell_n(\theta_\star))\),后一项与 \(\theta\) 无关)。由大数定律,\(M_n(\theta)\to\mathbb E_{\theta_\star}\log\frac{f(X;\theta)}{f(X;\theta_\star)}=-\int\log\frac{f(x;\theta_\star)}{f(x;\theta)}f(x;\theta_\star)dx=-D(\theta_\star,\theta)\),它在 \(\theta_\star\) 处取最大值 0,其余处为负。所以最大值点应趋于 \(\theta_\star\)。严格证明需要一致收敛和 \(D\) 的良好性质:
定理 9.13:令 \(M_n(\theta)\) 如上,\(M(\theta)=-D(\theta_\star,\theta)\)。若
9.6 MLE 的同变性(Equivariance of the MLE)(PDF p.139–140)
定理 9.14:\(\tau=g(\theta)\),\(\hat\theta_n\) 为 \(\theta\) 的 MLE,则 \(\hat\tau_n=g(\hat\theta_n)\) 是 \(\tau\) 的 MLE。 证明(\(g\) 可逆):令 \(h=g^{-1}\),\(\hat\theta_n=h(\hat\tau_n)\)。对任意 \(\tau\),\(\mathcal L(\tau)=\prod f(x_i;h(\tau))=\prod f(x_i;\theta)=\mathcal L(\theta)\),\(\theta=h(\tau)\)。于是 \(\mathcal L_n(\tau)=\mathcal L(\theta)\le\mathcal L(\hat\theta)=\mathcal L_n(\hat\tau)\)。 例 9.15:\(X_i\sim N(\theta,1)\),\(\hat\theta_n=\bar X_n\);\(\tau=e^\theta\) 的 MLE 为 \(\hat\tau=e^{\bar X}\)。
9.7 渐近正态性(Asymptotic Normality)(PDF p.140–142)
定义 9.16:得分函数(score function)\(s(X;\theta)=\frac{\partial\log f(X;\theta)}{\partial\theta}\) (9.9);Fisher 信息(Fisher information)
定理 9.17:\(I_n(\theta)=nI(\theta)\),且
定理 9.18(MLE 的渐近正态性):令 \(\text{se}=\sqrt{\mathbb V(\hat\theta_n)}\)。在适当正则条件下:
- \(\text{se}\approx\sqrt{1/I_n(\theta)}\) 且 \(\frac{\hat\theta_n-\theta}{\text{se}}\rightsquigarrow N(0,1)\) (9.12);
- 令 \(\widehat{\text{se}}=\sqrt{1/I_n(\hat\theta_n)}\),则 \(\frac{\hat\theta_n-\theta}{\widehat{\text{se}}}\rightsquigarrow N(0,1)\) (9.13)。 第一条说 \(\hat\theta_n\approx N(\theta,\text{se}^2)\),近似标准误为 \(\sqrt{1/I_n(\theta)}\);第二条说用估计的标准误代替仍成立。由此构造渐近置信区间:
定理 9.19:\(C_n=(\hat\theta_n-z_{\alpha/2}\widehat{\text{se}},\hat\theta_n+z_{\alpha/2}\widehat{\text{se}})\),则 \(\mathbb P_\theta(\theta\in C_n)\to1-\alpha\)。证明:\(\mathbb P_\theta(-z_{\alpha/2}\le\frac{\hat\theta_n-\theta}{\widehat{\text{se}}}\le z_{\alpha/2})\to\mathbb P(-z_{\alpha/2}<Z<z_{\alpha/2})=1-\alpha\)。 \(\alpha=.05\) 时 \(\hat\theta_n\pm2\widehat{\text{se}}\) 是近似 95% 区间 (9.14)。报纸上"民调误差 1 个百分点,95% 准确"就是这种区间。
例 9.20(Bernoulli):\(\log f=x\log p+(1-x)\log(1-p)\),\(s(X;p)=\frac Xp-\frac{1-X}{1-p}\),\(-s'(X;p)=\frac X{p^2}+\frac{1-X}{(1-p)^2}\),\(I(p)=\frac p{p^2}+\frac{1-p}{(1-p)^2}=\frac1{p(1-p)}\)。故 \(\widehat{\text{se}}=\frac1{\sqrt{I_n(\hat p_n)}}=\left\{\frac{\hat p(1-\hat p)}n\right\}^{1/2}\),近似 95% 区间 \(\hat p_n\pm2\left\{\frac{\hat p_n(1-\hat p_n)}n\right\}^{1/2}\)。 例 9.21:\(N(\theta,\sigma^2)\),\(\sigma^2\) 已知。\(s=(X-\theta)/\sigma^2\),\(s'=-1/\sigma^2\),\(I_1=1/\sigma^2\),MLE \(\bar X_n\approx N(\theta,\sigma^2/n)\)——此时正态近似是精确的。 例 9.22:Poisson\((\lambda)\),\(\hat\lambda=\bar X_n\),\(I_1(\lambda)=1/\lambda\),\(\widehat{\text{se}}=\frac1{\sqrt{nI(\hat\lambda)}}=\sqrt{\hat\lambda/n}\),近似区间 \(\hat\lambda\pm z_{\alpha/2}\sqrt{\hat\lambda/n}\)。
9.8 最优性(Optimality)(PDF p.142–143)
\(X_i\sim N(\theta,\sigma^2)\),MLE \(\hat\theta_n=\bar X_n\) 满足 \(\sqrt n(\hat\theta_n-\theta)\rightsquigarrow N(0,\sigma^2)\);另一个合理估计量样本中位数 \(\tilde\theta_n\) 满足 \(\sqrt n(\tilde\theta_n-\theta)\rightsquigarrow N(0,\sigma^2\frac\pi2)\)——同样收敛到真值,但方差更大。 一般地,若 \(\sqrt n(T_n-\theta)\rightsquigarrow N(0,t^2)\),\(\sqrt n(U_n-\theta)\rightsquigarrow N(0,u^2)\),定义 \(U\) 相对 \(T\) 的渐近相对效率(asymptotic relative efficiency)\(\text{ARE}(U,T)=t^2/u^2\)。正态例中 \(\text{ARE}(\tilde\theta_n,\hat\theta_n)=2/\pi=.63\),解释:用中位数相当于只用了约 63% 的数据。 定理 9.23:若 \(\hat\theta_n\) 是 MLE,\(\tilde\theta_n\) 是任一其他估计量,则 \(\text{ARE}(\tilde\theta_n,\hat\theta_n)\le1\)(脚注:真实结果更微妙,细节过于复杂)。即 MLE 渐近方差最小,称为有效或渐近最优。 前提是模型正确;模型错设时 MLE 未必最优。更一般的最优性在第 12 章决策理论讨论。
9.9 Delta 方法(The Delta Method)(PDF p.143–145)
\(\tau=g(\theta)\),\(g\) 光滑,MLE \(\hat\tau=g(\hat\theta)\),求其分布。 定理 9.24(Delta 方法):若 \(g\) 可微且 \(g'(\theta)\ne0\),则
例 9.25(对数几率):Bernoulli,\(\psi=g(p)=\log(p/(1-p))\)。\(I(p)=1/(p(1-p))\),\(\widehat{\text{se}}(\hat p)=\sqrt{\hat p(1-\hat p)/n}\);\(\hat\psi=\log\frac{\hat p}{1-\hat p}\);\(g'(p)=\frac1{p(1-p)}\),故 \(\widehat{\text{se}}(\hat\psi)=|g'(\hat p)|\widehat{\text{se}}(\hat p)=\frac1{\sqrt{n\hat p(1-\hat p)}}\),95% 区间 \(\hat\psi\pm\frac2{\sqrt{n\hat p(1-\hat p)}}\)。 例 9.26:\(N(\mu,\sigma^2)\),\(\mu\) 已知、\(\sigma\) 未知,估计 \(\psi=\log\sigma\)。\(\ell(\sigma)=-n\log\sigma-\frac1{2\sigma^2}\sum(X_i-\mu)^2\),MLE \(\hat\sigma=\sqrt{\frac1n\sum(X_i-\mu)^2}\)。\(\log f(X;\sigma)=-\log\sigma-\frac{(X-\mu)^2}{2\sigma^2}\),二阶导 \(\frac1{\sigma^2}-\frac{3(X-\mu)^2}{\sigma^4}\),故 \(I(\sigma)=-\frac1{\sigma^2}+\frac{3\sigma^2}{\sigma^4}=\frac2{\sigma^2}\),\(\widehat{\text{se}}(\hat\sigma)=\hat\sigma/\sqrt{2n}\)。\(\hat\psi=\log\hat\sigma\),\(g'=1/\sigma\),\(\widehat{\text{se}}(\hat\psi)=\frac1{\hat\sigma}\frac{\hat\sigma}{\sqrt{2n}}=\frac1{\sqrt{2n}}\),95% 区间 \(\hat\psi\pm2/\sqrt{2n}\)(与 \(\sigma\) 无关——对数变换是方差稳定化变换)。
9.10 多参数模型(Multiparameter Models)(PDF p.145–146)
\(\theta=(\theta_1,\dots,\theta_k)\),MLE \(\hat\theta\),\(\ell_n=\sum\log f(X_i;\theta)\),\(H_{jj}=\frac{\partial^2\ell_n}{\partial\theta_j^2}\),\(H_{jk}=\frac{\partial^2\ell_n}{\partial\theta_j\partial\theta_k}\)。Fisher 信息矩阵
定理 9.28(多参数 Delta 方法):\(\tau=g(\theta_1,\dots,\theta_k)\),梯度 \(\nabla g=(\partial g/\partial\theta_1,\dots,\partial g/\partial\theta_k)^T\) 在 \(\hat\theta\) 处非零,\(\hat\tau=g(\hat\theta)\),则 \(\frac{\hat\tau-\tau}{\widehat{\text{se}}(\hat\tau)}\rightsquigarrow N(0,1)\),
例 9.29(变异系数):\(X_i\sim N(\mu,\sigma^2)\),\(\tau=g(\mu,\sigma)=\sigma/\mu\)。(习题 8)\(I_n(\mu,\sigma)=\begin{pmatrix}n/\sigma^2&0\\0&2n/\sigma^2\end{pmatrix}\),\(J_n=\frac1n\begin{pmatrix}\sigma^2&0\\0&\sigma^2/2\end{pmatrix}\)。\(\nabla g=(-\sigma/\mu^2,\ 1/\mu)^T\),于是
9.11 参数 Bootstrap(The Parametric Bootstrap)(PDF p.146–147)
参数模型中也可用 bootstrap 求标准误和置信区间,唯一变化:非参数 bootstrap 从 \(\hat F_n\) 抽样,参数 bootstrap 从 \(f(x;\hat\theta_n)\) 抽样,\(\hat\theta_n\) 可以是 MLE 或矩估计。 例 9.30:续例 9.29,模拟 \(X_1^*,\dots,X_n^*\sim N(\hat\mu,\hat\sigma^2)\),计算 \(\hat\mu^*=n^{-1}\sum X_i^*\)、\(\hat\sigma^{2*}=n^{-1}\sum(X_i^*-\hat\mu^*)^2\)、\(\hat\tau^*=\hat\sigma^*/\hat\mu^*\);重复 \(B\) 次,\(\widehat{\text{se}}_{boot}=\sqrt{\frac1B\sum_b(\hat\tau_b^*-\bar\tau^*)^2}\)。 Bootstrap 比 Delta 方法容易得多;Delta 方法的优势是给出闭式标准误。
9.12 检验假设(Checking Assumptions)(PDF p.147)
假设数据来自参数模型时,最好检验该假设。非正式方法:看图(如直方图明显双峰,则正态假设可疑);正式方法:拟合优度检验(goodness-of-fit test,10.8 节)。
9.13 附录(PDF p.147–158)
9.13.1 证明
定理 9.13 证明:\(\hat\theta_n\) 最大化 \(M_n\),故 \(M_n(\hat\theta_n)\ge M_n(\theta_\star)\)。于是 \(M(\theta_\star)-M(\hat\theta_n)=M_n(\theta_\star)-M(\hat\theta_n)+M(\theta_\star)-M_n(\theta_\star)\le M_n(\hat\theta_n)-M(\hat\theta_n)+M(\theta_\star)-M_n(\theta_\star)\le\sup_\theta|M_n(\theta)-M(\theta)|+M(\theta_\star)-M_n(\theta_\star)\xrightarrow P0\)(由 (9.7))。故对任意 \(\delta>0\),\(\mathbb P(M(\hat\theta_n)<M(\theta_\star)-\delta)\to0\)。任取 \(\epsilon>0\),由 (9.8) 存在 \(\delta>0\) 使 \(|\theta-\theta_\star|\ge\epsilon\Rightarrow M(\theta)<M(\theta_\star)-\delta\),因此 \(\mathbb P(|\hat\theta_n-\theta_\star|>\epsilon)\le\mathbb P(M(\hat\theta_n)<M(\theta_\star)-\delta)\to0\)。
引理 9.31:\(\mathbb E_\theta[s(X;\theta)]=0\)。证明:对 \(1=\int f(x;\theta)dx\) 两边关于 \(\theta\) 求导:\(0=\int\frac{\partial f}{\partial\theta}dx=\int\frac{\partial f/\partial\theta}{f}f\,dx=\int\frac{\partial\log f}{\partial\theta}f\,dx=\mathbb E_\theta s(X;\theta)\)。
定理 9.18 证明:令 \(\ell(\theta)=\log\mathcal L(\theta)\)。在 \(\theta\) 处展开:\(0=\ell'(\hat\theta)\approx\ell'(\theta)+(\hat\theta-\theta)\ell''(\theta)\),故 \(\hat\theta-\theta=-\ell'(\theta)/\ell''(\theta)\),即
定理 9.24 证明梗概:\(\hat\tau=g(\hat\theta)\approx g(\theta)+(\hat\theta-\theta)g'(\theta)=\tau+(\hat\theta-\theta)g'(\theta)\),故 \(\sqrt{nI(\theta)}(\hat\tau-\tau)\approx g'(\theta)\sqrt{nI(\theta)}(\hat\theta-\theta)\),从而 \(\frac{\sqrt{nI(\theta)}(\hat\tau_n-\tau)}{g'(\theta)}\approx\sqrt{nI(\theta)}(\hat\theta-\theta)\rightsquigarrow N(0,1)\),即 \(\frac{\hat\tau_n-\tau}{\text{se}(\hat\tau_n)}\rightsquigarrow N(0,1)\),\(\text{se}^2(\hat\tau_n)=\frac{(g'(\theta))^2}{nI(\theta)}\)。用 \(\hat\theta_n\) 代替 \(\theta\) 仍成立(Slutsky)。
9.13.2 充分性(Sufficiency)
统计量是数据的函数 \(T(x^n)\);充分统计量(sufficient statistic)包含数据中的全部信息。 定义 9.32:若 \(f(x^n;\theta)=c\,f(y^n;\theta)\)(常数 \(c\) 可依赖 \(x^n,y^n\) 但不依赖 \(\theta\)),记 \(x^n\leftrightarrow y^n\)。若 \(T(x^n)=T(y^n)\) 蕴含 \(x^n\leftrightarrow y^n\),则 \(T\) 是充分的。 \(x^n\leftrightarrow y^n\) 意味着两组数据的似然函数形状相同;粗略说,只知道 \(T(x^n)\) 就能算出似然函数,则 \(T\) 充分。 例 9.33:Bernoulli,\(\mathcal L(p)=p^S(1-p)^{n-S}\),\(S=\sum X_i\) 充分。 例 9.34:\(N(\mu,\sigma^2)\),\(T=(\bar X,S)\):\(f(x^n;\mu,\sigma)=\left(\frac1{\sigma\sqrt{2\pi}}\right)^n\exp\left\{-\frac{nS^2}{2\sigma^2}\right\}\exp\left\{-\frac{n(\bar X-\mu)^2}{2\sigma^2}\right\}\) 只通过 \(T\) 依赖数据,故充分。\(U=(17\bar X,S)\) 也充分。充分统计量远非唯一:\(T_1=(X_1,\dots,X_n)\)(全部数据,充分);\(T_2=(\bar X,S)\)(充分);\(T_3=\bar X\)(不充分,只知 \(\bar X\) 无法算 \(\mathcal L(\mu,\sigma)\));\(T_4=(\bar X,S,X_3)\)(充分但有冗余)。\(T_2\) 是 \(T_1\) 和 \(T_4\) 的函数,在某种意义上"更简洁"。 定义 9.35:\(T\) 是最小充分统计量(minimal sufficient),若 (i) 充分;(ii) 是任何其他充分统计量的函数。 定理 9.36:若"\(T(x^n)=T(y^n)\) 当且仅当 \(x^n\leftrightarrow y^n\)",则 \(T\) 最小充分。 统计量在结果集合上诱导一个划分,可用划分理解充分性。 例 9.37:\(X_1,X_2\sim\) Bernoulli\((\theta)\),\(V=X_1\),\(T=\sum X_i\),\(U=(T,X_1)\)。结果 (0,0),(0,1),(1,0),(1,1) 对应 \(V\)=0,0,1,1;\(T\)=0,1,1,2;\(U\)=(0,0),(1,0),(1,1),(2,1)。诱导划分:\(V\to\{(0,0),(0,1)\},\{(1,0),(1,1)\}\);\(T\to\{(0,0)\},\{(0,1),(1,0)\},\{(1,1)\}\);\(U\to\) 四个单点集。\(V\) 不充分;\(T,U\) 充分;\(T\) 最小充分;\(U\) 不是最小的,因为 \(x^n=(1,0)\) 与 \(y^n=(0,1)\) 满足 \(x^n\leftrightarrow y^n\),但 \(U(x^n)\ne U(y^n)\)。\(W=17T\) 与 \(T\) 诱导相同划分,也最小充分。 例 9.38:\(N(\mu,\sigma^2)\) 中 \((\bar X,S)\) 最小充分;Bernoulli 与 Poisson 中 \(\sum X_i\) 最小充分;\((\sum X_i,X_1)\) 充分但非最小;\(X_1\) 不充分。
通常的定义:若给定 \(T(X^n)=t\) 时 \(X^n\) 的条件分布不依赖 \(\theta\),即 \(f(x_1,\dots,x_n\mid t;\theta)=h(x_1,\dots,x_n,t)\),则 \(T\) 充分。 例 9.39:两次掷硬币,\(T=X_1+X_2\)。三种条件分布:\(T=0\) 时 \((0,0)\) 概率 1;\(T=1\) 时 \((0,1)\)、\((1,0)\) 各 1/2;\(T=2\) 时 \((1,1)\) 概率 1。都不依赖 \(p\),故 \(T\) 充分。
定理 9.40(因子分解定理,Factorization Theorem):\(T\) 充分当且仅当存在函数 \(g(t,\theta)\) 与 \(h(x)\) 使 \(f(x^n;\theta)=g(t(x^n),\theta)h(x^n)\)。 例 9.41:两次掷硬币,\(f(x_1;\theta)f(x_2;\theta)=\theta^{x_1+x_2}(1-\theta)^{2-x_1-x_2}=g(t,\theta)h(x_1,x_2)\),\(g=\theta^t(1-\theta)^{2-t}\),\(h=1\),故 \(T\) 充分。
充分性在点估计中的含义——Rao–Blackwell 定理:估计量应只依赖充分统计量,否则可以改进。记 \(R(\theta,\hat\theta)=\mathbb E_\theta(\theta-\hat\theta)^2\) 为 MSE。 定理 9.42(Rao–Blackwell):\(\hat\theta\) 为估计量,\(T\) 充分,定义 \(\tilde\theta=\mathbb E(\hat\theta\mid T)\),则对所有 \(\theta\),\(R(\theta,\tilde\theta)\le R(\theta,\hat\theta)\)。 例 9.43:两次掷硬币,\(\hat\theta=X_1\) 是良定义且无偏的估计量,但不是充分统计量 \(T=X_1+X_2\) 的函数。\(\tilde\theta=\mathbb E(X_1\mid T)=(X_1+X_2)/2\),MSE 不大于 \(X_1\)。\(n\) 次时 \(\tilde\theta=\mathbb E(X_1\mid T)=n^{-1}\sum X_i\)。
9.13.3 指数族(Exponential Families)
目前学过的大多数参数模型都是指数族的特例。单参数指数族:存在函数 \(\eta(\theta),B(\theta),T(x),h(x)\) 使
9.13.4 计算最大似然估计(Computing Maximum Likelihood Estimates)
有时可解析求 MLE,更常需要数值方法。介绍两种迭代法:Newton–Raphson 与 EM 算法,都产生序列 \(\theta^0,\theta^1,\dots\),理想条件下收敛到 MLE;好的初值很有帮助,矩估计常是好初值。
Newton–Raphson:在 \(\theta^j\) 处展开对数似然的导数:\(0=\ell'(\hat\theta)\approx\ell'(\theta^j)+(\hat\theta-\theta^j)\ell''(\theta^j)\),解得 \(\hat\theta\approx\theta^j-\frac{\ell'(\theta^j)}{\ell''(\theta^j)}\)。迭代:
EM 算法(Expectation–Maximization):思想是在"求期望"与"最大化"之间交替。数据 \(Y\) 的密度 \(f(y;\theta)\) 导致难以最大化的对数似然,但能找到另一随机变量 \(Z\),使 \(f(y;\theta)=\int f(y,z;\theta)dz\) 且基于 \(f(y,z;\theta)\) 的似然容易最大化——即感兴趣模型是一个似然更简单的模型的边缘。\(Y\) 称观测数据,\(Z\) 称隐藏(hidden)/潜在(latent)/缺失(missing)数据。概念上,EM 反复"填补缺失数据、最大化对数似然"。
例 9.49(正态混合):如身高是男、女身高的混合。\(\phi(y;\mu,\sigma)\) 为正态密度,两正态混合密度
EM 算法步骤: (0) 选初值 \(\theta^0\);对 \(j=1,2,\dots\) 重复: (1) E 步:计算 \(J(\theta\mid\theta^j)=\mathbb E_{\theta^j}\left(\log\frac{f(Y^n,Z^n;\theta)}{f(Y^n,Z^n;\theta^j)}\,\Big|\,Y^n=y^n\right)\),期望对缺失数据 \(Z^n\) 求,视 \(\theta^j\) 和观测数据 \(y^n\) 为固定。 (2) M 步:求 \(\theta^{j+1}\) 最大化 \(J(\theta\mid\theta^j)\)。
EM 单调性证明:\(\mathcal L(\theta^{j+1})\ge\mathcal L(\theta^j)\)。由 \(f(y^n,z^n;\theta)=f(z^n\mid y^n;\theta)f(y^n;\theta)\),
例 9.50(续例 9.49,简化版):设 \(p=1/2\),\(\sigma_0=\sigma_1=1\),\(f(y;\mu_0,\mu_1)=\frac12\phi(y;\mu_0,1)+\frac12\phi(y;\mu_1,1)\)。引入 \(Z_i\):\(\mathbb P(Z_i=1)=\mathbb P(Z_i=0)=1/2\),\(f(y_i\mid Z_i=0)=\phi(y;\mu_0,1)\),\(f(y_i\mid Z_i=1)=\phi(y;\mu_1,1)\)。\(f(z,y)=f(z)f(y\mid z)=\frac12\phi(y;\mu_0,1)^{1-z}\phi(y;\mu_1,1)^z\)。完整对数似然(略常数)
9.14 习题(PDF p.158–160)概览
共 10 题:
- 题 1:Gamma\((\alpha,\beta)\) 的矩估计。
- 题 2:Uniform\((a,b)\):(a) 矩估计;(b) MLE(\(\hat a=X_{(1)}\),\(\hat b=X_{(n)}\));(c) \(\tau=\int x\,dF\) 的 MLE;(d) \(a=1,b=3,n=10\) 时,比较 MLE \(\hat\tau=(\hat a+\hat b)/2\) 与非参数插入估计 \(\bar X\) 的 MSE(模拟 + 解析)。
- 题 3:\(N(\mu,\sigma^2)\) 的 95 百分位数 \(\tau=\mu+1.645\sigma\) 的 MLE、近似置信区间;给定 25 个数据(3.23, −2.50, 1.88, −0.68, 4.43, 0.17, 1.03, −0.07, −0.01, 0.76, 1.76, 3.18, 0.33, −0.31, 0.30, −0.61, 1.52, 5.43, 1.54, 2.28, 0.42, 2.33, −1.03, 4.00, 0.39),用 Delta 方法与参数 bootstrap 求 se。
- 题 4:Uniform\((0,\theta)\) 的 MLE 相合(提示 \(\mathbb P(Y<c)=\prod\mathbb P(X_i<c)\))。
- 题 5:Poisson 的矩估计、MLE、Fisher 信息。
- 题 6:\(X_i\sim N(\theta,1)\),\(Y_i=I(X_i>0)\),\(\psi=\mathbb P(Y_1=1)=\Phi(\theta)\):MLE \(\hat\psi=\Phi(\bar X)\)、95% 区间;\(\tilde\psi=\bar Y\) 相合;两者的 ARE(Delta 方法);若数据并非正态,\(\hat\psi\) 不相合(模型错设下 MLE 的风险,而非参数 \(\tilde\psi\) 仍相合)。
- 题 7(两种疗法比较):\(X_1\sim\) Bin\((n_1,p_1)\),\(X_2\sim\) Bin\((n_2,p_2)\),\(\psi=p_1-p_2\) 的 MLE、Fisher 信息矩阵、多参数 Delta 方法 se;\(n_1=n_2=200\)、\(X_1=160\)、\(X_2=148\) 时的 90% 区间(Delta 方法 vs 参数 bootstrap)。
- 题 8:例 9.29 的 Fisher 信息矩阵。
- 题 9:\(N(\mu,1)\),\(\theta=e^\mu\),\(\mu=5\)、\(n=100\);比较 Delta 方法、参数 bootstrap、非参数 bootstrap 的 se 与区间,以及它们对真实抽样分布的近似程度。
- 题 10:Uniform\((0,\theta)\),\(\hat\theta=X_{(n)}\),\(n=50\);解析分布与参数/非参数 bootstrap 直方图比较;非参数 bootstrap 中 \(\mathbb P(\hat\theta^*=\hat\theta)\approx.632\),参数 bootstrap 中为 0。
本章要点
- 矩估计:令样本矩等于总体矩,简单、相合、渐近正态,但非最优,常作初值。
- 似然与 MLE:似然是参数的函数,不是参数的密度;常需对数似然;边界/支撑依赖参数时(均匀分布)不能求导。
- MLE 性质:相合(通过 KL 距离理解)、同变、渐近正态 \(\hat\theta\approx N(\theta,1/I_n(\theta))\)、渐近有效、近似贝叶斯。
- Fisher 信息 = 得分方差 = 负的二阶导期望;标准误 \(\widehat{\text{se}}=1/\sqrt{I_n(\hat\theta)}\);多参数时用 Fisher 信息矩阵的逆。
- Delta 方法(一元、多元)与参数 bootstrap 求函数的标准误。
- 充分统计量、因子分解定理、Rao–Blackwell;指数族及其矩性质 \(\mathbb E T=A'(\eta)\)、\(\mathbb V T=A''(\eta)\)。
- 数值求解:Newton–Raphson(用 Hessian)与 EM(隐变量模型,似然单调不降)。
与量化交易的关联
- MLE 是金融计量的主力:GARCH 族波动率模型、ARMA、状态空间模型、跳跃扩散、信用违约强度、Hawkes 订单流模型等都用 MLE 估计;Fisher 信息矩阵的逆给出参数标准误,是判断参数是否显著的依据。
- 数值优化:GARCH 等模型没有闭式解,用 Newton–Raphson/拟牛顿法(BFGS)最大化对数似然;矩估计常作初值。
- EM 与隐状态:例 9.49–9.50 的正态混合直接对应市场状态(regime)混合模型——收益来自"平静"与"危机"两个正态分布的混合,EM 估计各状态参数,\(\tau_i\) 即每天处于危机状态的后验概率;隐马尔可夫模型(HMM)的 Baum–Welch 算法是 EM 的推广。
- Delta 方法:例 9.29 的变异系数 \(\sigma/\mu\) 恰好是 Sharpe 比率的倒数,可直接改写为 Sharpe 比率标准误的推导;例 9.25 的 logit 变换用于胜率/违约概率的区间估计。
- 模型错设:习题 6(e) 说明若真实分布不是正态,依赖正态模型的 MLE 可能不相合;而非参数估计仍相合。收益的厚尾使正态 MLE 有风险,可改用 t 分布似然或准极大似然(QMLE)并配合稳健标准误。
- ARE:中位数在正态下效率 63%,但在厚尾分布下可能优于均值——稳健统计量(中位数、截尾均值)在估计期望收益时常更可靠。
- 指数族与 GLM:指数族是第 13 章 logistic 回归、广义线性模型的基础,用于违约预测、涨跌方向分类。
- 充分统计量:在线/流式计算中,只需维护 \((\sum X_i,\sum X_i^2)\) 即可更新正态模型的均值和方差(滚动波动率计算)。
推荐习题
- 题 3(分位数的 MLE 与 Delta 方法——即正态 VaR 的置信区间,强烈推荐);题 7(两比例之差,多参数 Delta 方法 vs 参数 bootstrap);题 6(模型错设与 ARE);题 9、10(Delta 方法、参数与非参数 bootstrap 的比较及失效情形);题 2(MLE vs 插入估计的 MSE);建议另加 EM 编程练习(例 9.50)。
第 10 章 假设检验与 p 值(Hypothesis Testing and p-values)(PDF p.161–185)
引言(PDF p.161–164)
动机例:石棉暴露是否与肺病有关?把大鼠随机分两组,一组暴露于石棉,一组不暴露,比较患病率。原假设:两组患病率相同;备择假设:不同。若暴露组患病率高得多,则拒绝原假设,认为证据支持备择假设。
形式化:把参数空间 \(\Theta\) 划分为不相交的 \(\Theta_0,\Theta_1\),检验
警告:人们倾向于在不合适的场合也使用假设检验;估计和置信区间往往是更好的工具,只有在要检验一个定义明确的假设时才用假设检验。
类比法庭审判:除非证据强烈表明有罪,否则推定无罪;类似地,除非有强证据,否则保留 \(H_0\)。两类错误(表 10.1):\(H_0\) 真却拒绝——第一类错误(type I error);\(H_1\) 真却保留 \(H_0\)——第二类错误(type II error)。
定义 10.1:拒绝域为 \(R\) 的检验的功效函数(power function)\(\beta(\theta)=\mathbb P_\theta(X\in R)\) (10.3);检验的大小(size)\(\alpha=\sup_{\theta\in\Theta_0}\beta(\theta)\) (10.4);若大小 ≤ \(\alpha\),称检验水平为 \(\alpha\)(level \(\alpha\))。
术语:\(\theta=\theta_0\) 为简单假设(simple hypothesis);\(\theta>\theta_0\) 或 \(\theta<\theta_0\) 为复合假设(composite hypothesis)。\(H_0:\theta=\theta_0\) vs \(H_1:\theta\ne\theta_0\) 为双侧检验(two-sided);\(H_0:\theta\le\theta_0\) vs \(H_1:\theta>\theta_0\)(或反向)为单侧检验(one-sided)。最常用的是双侧检验。
例 10.2:\(X_i\sim N(\mu,\sigma^2)\),\(\sigma\) 已知,检验 \(H_0:\mu\le0\) vs \(H_1:\mu>0\),\(\Theta_0=(-\infty,0]\)。检验:\(T=\bar X>c\) 时拒绝。功效函数
在所有大小为 \(\alpha\) 的检验中,\(H_1\) 下功效最高者称为最有力检验(most powerful)。寻找它很难,很多情况下不存在。本章只介绍四种常用检验:Wald 检验(脚注:以 Abraham Wald (1902–1950) 命名,1950 年在印度空难中去世)、\(\chi^2\) 检验、置换检验、似然比检验。
10.1 Wald 检验(The Wald Test)(PDF p.164–168)
\(\theta\) 为标量参数,\(\hat\theta\) 为估计,\(\widehat{\text{se}}\) 为其估计标准误。 定义 10.3:检验 \(H_0:\theta=\theta_0\) vs \(H_1:\theta\ne\theta_0\),假设 \(\hat\theta\) 渐近正态 \(\frac{\hat\theta-\theta_0}{\widehat{\text{se}}}\rightsquigarrow N(0,1)\)。大小 \(\alpha\) 的 Wald 检验:当 \(|W|>z_{\alpha/2}\) 时拒绝 \(H_0\),
定理 10.6(Wald 检验的功效):真值 \(\theta_\star\ne\theta_0\) 时,功效(正确拒绝的概率)近似为
例 10.7(比较两个预测算法):算法 1 在大小 \(m\) 的测试集上错 \(X\) 个,算法 2 在大小 \(n\) 的另一测试集上错 \(Y\) 个,\(X\sim\) Bin\((m,p_1)\),\(Y\sim\) Bin\((n,p_2)\)。检验 \(H_0:\delta=0\),\(\delta=p_1-p_2\)。MLE \(\hat\delta=\hat p_1-\hat p_2\),\(\widehat{\text{se}}=\sqrt{\frac{\hat p_1(1-\hat p_1)}m+\frac{\hat p_2(1-\hat p_2)}n}\),\(W=\frac{\hat p_1-\hat p_2}{\widehat{\text{se}}}\),\(|W|>z_{\alpha/2}\) 时拒绝。\(p_1,p_2\) 差别大、样本量大时功效最大。 配对比较(paired comparison):若两算法用同一测试集,两样本不再独立。令 \(X_i=1\) 表示算法 1 在第 \(i\) 个案例上正确,\(Y_i\) 同理,\(D_i=X_i-Y_i\)(示例数据:1/0/1, 1/1/0, 1/1/0, 0/1/−1, 0/0/0, …, 0/1/−1)。\(\delta=\mathbb E(D_i)=\mathbb P(X_i=1)-\mathbb P(Y_i=1)\)。非参数插入估计 \(\hat\delta=\bar D=n^{-1}\sum D_i\),\(\widehat{\text{se}}(\hat\delta)=S/\sqrt n\),\(S^2=n^{-1}\sum(D_i-\bar D)^2\)。\(W=\hat\delta/\widehat{\text{se}}\),\(|W|>z_{\alpha/2}\) 时拒绝。
例 10.8(比较两均值):独立样本 \(X_1..X_m\)、\(Y_1..Y_n\),均值 \(\mu_1,\mu_2\),\(H_0:\delta=0\),\(\delta=\mu_1-\mu_2\)。插入估计 \(\hat\delta=\bar X-\bar Y\),\(\widehat{\text{se}}=\sqrt{\frac{s_1^2}m+\frac{s_2^2}n}\)(\(s_1^2,s_2^2\) 为样本方差),\(W=\frac{\bar X-\bar Y}{\sqrt{s_1^2/m+s_2^2/n}}\),\(|W|>z_{\alpha/2}\) 时拒绝。 例 10.9(比较两中位数):\(\delta=\nu_1-\nu_2\),插入估计为样本中位数之差,\(\widehat{\text{se}}\) 由 bootstrap 得到,\(W=\hat\delta/\widehat{\text{se}}\)。
定理 10.10(检验与置信区间的对偶):大小 \(\alpha\) 的 Wald 检验拒绝 \(H_0:\theta=\theta_0\) 当且仅当 \(\theta_0\notin C=(\hat\theta-\widehat{\text{se}}z_{\alpha/2},\hat\theta+\widehat{\text{se}}z_{\alpha/2})\)。检验假设等价于检查原假设值是否在置信区间内。
警告(统计显著 vs 科学显著):拒绝 \(H_0\) 时常说结果"统计显著"(statistically significant)。结果可能统计显著但效应很小,在科学或实际上不显著。由定理 10.10 理解:任何不含 \(\theta_0\) 的置信区间都对应拒绝 \(H_0\),但区间内的值可能离 \(\theta_0\) 很近(无实际意义)或很远(有实际意义)(图 10.2)。这说明:统计显著不等于科学重要;置信区间往往比检验更有信息量。
10.2 p 值(p-values)(PDF p.168–171)
只报告"拒绝/保留 \(H_0\)"信息量不大。可以对每个 \(\alpha\) 问检验是否在该水平拒绝。一般在水平 \(\alpha\) 拒绝则在 \(\alpha'>\alpha\) 也拒绝,因此存在一个使检验拒绝的最小 \(\alpha\),即 p 值(图 10.3)。 定义 10.11:对每个 \(\alpha\in(0,1)\) 有大小为 \(\alpha\)、拒绝域为 \(R_\alpha\) 的检验,则 \(\text{p-value}=\inf\{\alpha:T(X^n)\in R_\alpha\}\),即能拒绝 \(H_0\) 的最小水平。 非正式地,p 值度量反对 \(H_0\) 的证据:越小证据越强。常用证据尺度:
| p 值 | 证据 |
|---|---|
| < .01 | 很强的反对 \(H_0\) 的证据 |
| .01 – .05 | 强证据 |
| .05 – .10 | 弱证据 |
| > .1 | 几乎没有证据 |
警告:大的 p 值不是支持 \(H_0\) 的强证据,原因可能是 (i) \(H_0\) 为真,或 (ii) \(H_0\) 为假但检验功效低。 警告:不要把 p 值与 \(\mathbb P(H_0\mid\text{Data})\) 混淆,p 值不是原假设为真的概率(后者在贝叶斯章节讨论)。
定理 10.12:若大小为 \(\alpha\) 的检验形如"\(T(X^n)\ge c_\alpha\) 时拒绝",则
定理 10.13:令 \(w=(\hat\theta-\theta_0)/\widehat{\text{se}}\) 为 Wald 统计量观测值,则
定理 10.14:若检验统计量分布连续,则在 \(H_0:\theta=\theta_0\) 下 p 值服从 Uniform(0,1)。因此若在 p 值 < \(\alpha\) 时拒绝,第一类错误概率为 \(\alpha\)。即 \(H_0\) 为真时,p 值像一次 Unif(0,1) 抽样;\(H_1\) 为真时,p 值分布倾向于集中在 0 附近。
例 10.15(胆固醇数据续):均值差 \(W=\frac{216.2-195.3}{\sqrt{5^2+2.4^2}}=3.78\),p 值 \(=\mathbb P(|Z|>3.78)=2\mathbb P(Z<-3.78)=.0002\),很强的反对证据。中位数差:\(W=\frac{212.5-194}{7.7}=2.4\)(se 由 bootstrap 得),p 值 \(=2\mathbb P(Z<-2.4)=.02\),强证据。
10.3 \(\chi^2\) 分布(PDF p.171)
\(Z_1,\dots,Z_k\) 独立标准正态,\(V=\sum Z_i^2\sim\chi^2_k\),密度 \(f(v)=\frac{v^{k/2-1}e^{-v/2}}{2^{k/2}\Gamma(k/2)}\)(\(v>0\)),\(\mathbb E V=k\),\(\mathbb V V=2k\)。上 \(\alpha\) 分位数 \(\chi^2_{k,\alpha}=F^{-1}(1-\alpha)\),即 \(\mathbb P(\chi^2_k>\chi^2_{k,\alpha})=\alpha\)。
10.4 多项数据的 Pearson \(\chi^2\) 检验(Pearson's \(\chi^2\) Test For Multinomial Data)(PDF p.172–173)
\(X=(X_1,\dots,X_k)\sim\) Multinomial\((n,p)\),MLE \(\hat p=(X_1/n,\dots,X_k/n)\)。给定 \(p_0\),检验 \(H_0:p=p_0\) vs \(H_1:p\ne p_0\)。 定义 10.16:Pearson \(\chi^2\) 统计量
例 10.18(孟德尔豌豆):孟德尔用圆黄与皱绿种子杂交,后代四类:圆黄、皱黄、圆绿、皱绿,其遗传理论预言 \(p_0=(9/16,3/16,3/16,1/16)\)。\(n=556\),观测 \(X=(315,101,108,32)\),期望 \(312.75,104.25,104.25,34.75\)。
10.5 置换检验(The Permutation Test)(PDF p.173–176)
非参数方法,检验两个分布是否相同;它是精确的,不依赖大样本近似。独立样本 \(X_1..X_m\sim F_X\)、\(Y_1..Y_n\sim F_Y\),检验 \(H_0:F_X=F_Y\) vs \(H_1:F_X\ne F_Y\)(如处理 vs 安慰剂)。取检验统计量如 \(T(X_1,\dots,X_m,Y_1,\dots,Y_n)=|\bar X_m-\bar Y_n|\)。令 \(N=m+n\),考虑数据的全部 \(N!\) 个排列,对每个排列计算 \(T\),得 \(T_1,\dots,T_{N!}\)。在 \(H_0\) 下这些值等可能(脚注:更精确地,给定有序数据值,\(X_1..X_m,Y_1..Y_n\) 在 \(N!\) 个排列上均匀分布)。在每个 \(T_j\) 上放 \(1/N!\) 质量的分布 \(\mathbb P_0\) 称为 \(T\) 的置换分布(permutation distribution)。观测值 \(t_{obs}\),若 \(T\) 大时拒绝,
通常无法枚举 \(N!\) 个排列,可随机抽取排列近似: 置换检验算法:
- 计算观测统计量 \(t_{obs}=T(X_1,\dots,X_m,Y_1,\dots,Y_n)\);
- 随机打乱数据,重算统计量;
- 重复第 2 步 \(B\) 次,得 \(T_1,\dots,T_B\);
- 近似 p 值 \(=\frac1B\sum_{j=1}^BI(T_j>t_{obs})\)。
例 10.20(DNA 微阵列):微阵列可测量数千个基因的表达水平(mRNA 水平,数值越大基因越活跃)。Efron et al. (2001) 数据:10 名两类肝癌患者(Type I:患者 1–5,Type II:患者 6–10),共 2638 个基因,数据为两种染料强度的对数比。基因 1:230, −1350, −1580, −400, −760 | 970, 110, −50, −190, −200;基因 2:470, −850, −.8, −280, 120 | 390, −1730, −1360, −1, −330。检验基因 1 在两组的中位数是否不同:\(T=|\hat\nu_1-\hat\nu_2|=710\),模拟置换分布得 p 值 .045,在 \(\alpha=.05\) 下有证据拒绝无差异的原假设。 大样本时置换检验与大样本理论检验结果通常相似,因此它对小样本最有用。
10.6 似然比检验(The Likelihood Ratio Test)(PDF p.176–177)
Wald 检验适合标量参数;似然比检验更一般,可检验向量参数。 定义 10.21:检验 \(H_0:\theta\in\Theta_0\) vs \(H_1:\theta\notin\Theta_0\),似然比统计量
例 10.23(孟德尔豌豆再访):
10.7 多重检验(Multiple Testing)(PDF p.177–180)
例 10.20 实际有 2638 个基因,对每个基因都检验就是 2638 个独立的检验。每个在水平 \(\alpha\) 下进行时,单个检验错误拒绝的概率为 \(\alpha\),但至少一次错误拒绝的概率高得多——这就是多重检验问题,在数据挖掘中可能要检验成千上万甚至上百万个假设。介绍两种方法。考虑 \(m\) 个检验 \(H_{0i}\) vs \(H_{1i}\),p 值 \(P_1,\dots,P_m\)。
Bonferroni 方法:若 \(P_i<\alpha/m\),拒绝 \(H_{0i}\)。 定理 10.24:用 Bonferroni 方法,错误拒绝任一原假设的概率 ≤ \(\alpha\)(控制族错误率 FWER)。证明:\(R\)=至少一个原假设被错误拒绝,\(R_i\)=第 \(i\) 个被错误拒绝。由次可加性 \(\mathbb P(\bigcup A_i)\le\sum\mathbb P(A_i)\),\(\mathbb P(R)\le\sum_i\mathbb P(R_i)=\sum_i\frac\alpha m=\alpha\)(用到定理 10.14)。 例 10.25:基因例中 \(\alpha=.05\),阈值 \(.05/2638=.00001895375\),p 值低于此的基因才宣布显著。
Bonferroni 非常保守,因为它试图让"哪怕一次错误拒绝"都不太可能。更合理的做法有时是控制错误发现率(false discovery rate, FDR)——错误拒绝数除以拒绝数的均值。 设拒绝 p 值低于某阈值的所有原假设。\(m_0\) 为真原假设个数,\(m_1=m-m_0\)。表 10.2:
| 未拒绝 \(H_0\) | 拒绝 \(H_0\) | 合计 | |
|---|---|---|---|
| \(H_0\) 真 | \(U\) | \(V\) | \(m_0\) |
| \(H_0\) 假 | \(T\) | \(S\) | \(m_1\) |
| 合计 | \(m-R\) | \(R\) | \(m\) |
错误发现比例(false discovery proportion):\(\text{FDP}=V/R\)(\(R>0\)),\(=0\)(\(R=0\))——拒绝中错误的比例。\(\text{FDR}=\mathbb E(\text{FDP})\)。
Benjamini–Hochberg (BH) 方法:
- 排序 p 值 \(P_{(1)}<\cdots<P_{(m)}\);
- 定义 \(\ell_i=\frac{i\alpha}{C_mm}\),\(R=\max\{i:P_{(i)}<\ell_i\}\) (10.8),其中 p 值独立时 \(C_m=1\),否则 \(C_m=\sum_{i=1}^m(1/i)\);
- 令 \(T=P_{(R)}\),称为 BH 拒绝阈值;
- 拒绝所有 \(P_i\le T\) 的 \(H_{0i}\)。 定理 10.26(Benjamini & Hochberg):无论多少原假设为真、无论备择下 p 值分布如何,\(\text{FDR}=\mathbb E(\text{FDP})\le\frac{m_0}m\alpha\le\alpha\)。
例 10.27:图 10.6 中 6 个排序 p 值。不校正:拒绝所有 \(P_i<\alpha\) 的,此例拒绝 4 个;Bonferroni:拒绝 \(P_i<\alpha/m\) 的,此例 0 个;BH 阈值对应最后一个落在斜率为 \(\alpha/m\) 的直线下方的 p 值(最右侧下穿点),此例拒绝 2 个。 例 10.28:10 个独立检验的排序 p 值:0.00017, 0.00448, 0.00671, 0.00907, 0.01220, 0.33626, 0.39341, 0.53882, 0.58125, 0.98617。\(\alpha=0.05\):Bonferroni 阈值 0.005,只拒绝前两个;BH 找最大 \(i\) 使 \(P_{(i)}<i\alpha/m\):\(i=5\) 时 \(0.01220<0.025\) 成立,\(i=6\) 时 \(0.336>0.03\) 不成立,故拒绝前五个。
10.8 拟合优度检验(Goodness-of-fit Tests)(PDF p.180–181)
检验数据是否来自假设的参数模型 \(\mathfrak F=\{f(x;\theta):\theta\in\Theta\}\)。把实轴分成 \(k\) 个不相交区间 \(I_1,\dots,I_k\),\(p_j(\theta)=\int_{I_j}f(x;\theta)dx\) 为模型下观测落入 \(I_j\) 的概率,\(\theta=(\theta_1,\dots,\theta_s)\)。\(N_j\) 为落入 \(I_j\) 的观测数。基于计数的多项似然 \(Q(\theta)=\prod_jp_j(\theta)^{N_j}\),最大化得 \(\tilde\theta=(\tilde\theta_1,\dots,\tilde\theta_s)\)。检验统计量
10.9 文献注(PDF p.181)
最全面的检验专著:Lehmann (1986);另见 Casella & Berger (2002) 第 8 章、Rice (1995) 第 9 章。FDR 方法来自 Benjamini & Hochberg (1995)。部分习题取自 Rice (1995)。
10.10 附录(PDF p.182)
10.10.1 Neyman–Pearson 引理:简单原假设 \(H_0:\theta=\theta_0\) vs 简单备择 \(H_1:\theta=\theta_1\) 时可精确给出最有力检验。 定理 10.30(Neyman–Pearson):令 \(T=\frac{\mathcal L(\theta_1)}{\mathcal L(\theta_0)}=\frac{\prod f(x_i;\theta_1)}{\prod f(x_i;\theta_0)}\),当 \(T>k\) 时拒绝,选 \(k\) 使 \(\mathbb P_{\theta_0}(T>k)=\alpha\),则此检验在所有大小为 \(\alpha\) 的检验中功效 \(\beta(\theta_1)\) 最大。 10.10.2 t 检验:检验均值 \(H_0:\mu=\mu_0\) 可用 Wald 检验;若数据假设正态且样本小,常用 t 检验。\(t_k\) 密度 \(f(t)=\frac{\Gamma((k+1)/2)}{\sqrt{k\pi}\Gamma(k/2)}\frac1{(1+t^2/k)^{(k+1)/2}}\),\(k\to\infty\) 趋于正态,\(k=1\) 为柯西。\(X_i\sim N(\mu,\sigma^2)\),\(\theta=(\mu,\sigma^2)\) 均未知,\(T=\frac{\sqrt n(\bar X_n-\mu_0)}{S_n}\)(\(S_n^2\) 为样本方差)。大样本下 \(H_0\) 时 \(T\approx N(0,1)\);精确分布为 \(t_{n-1}\)。故 \(|T|>t_{n-1,\alpha/2}\) 时拒绝得大小 \(\alpha\) 的检验。\(n\) 中等大时 t 检验与 Wald 检验基本相同。
10.11 习题(PDF p.182–185)概览
共 16 题:
- 证明类:定理 10.6(功效公式)、10.14(p 值均匀分布)、10.10(检验与区间对偶)、10.12(p 值公式)(题 1–4)。
- 题 5:Uniform\((0,\theta)\),\(Y=\max X_i\),检验 \(H_0:\theta=1/2\) vs \(H_1:\theta>1/2\)(Wald 不适用,因 \(Y\) 不渐近正态);求功效函数、使大小为 .05 的 \(c\);\(n=20\) 时 \(Y=0.48\)、\(Y=0.52\) 的 p 值与结论(后者 p 值为 0,必然拒绝)。
- 题 6:逾越节前后死亡数(1919 例中 922 在节前一周、997 在节后一周),检验"人能推迟死亡"理论,\(\theta=1/2\) 的二项检验 p 值与置信区间。
- 题 7:马克·吐温与 "Quintus Curtius Snodgrass" 文章三字母词比例(Twain 8 篇:.225 .262 .217 .240 .230 .229 .235 .217;Snodgrass 10 篇:.209 .205 .196 .210 .202 .207 .224 .223 .220 .201):(a) Wald 检验均值相等、p 值、95% 区间;(b) 置换检验。
- 题 8:\(N(\theta,1)\) 检验 \(\theta=0\) vs \(\theta=1\),求临界值、功效 \(\beta(1)\),证明 \(\beta(1)\to1\)。
- 题 9:Wald 检验在固定备择下功效趋于 1(检验的相合性)。
- 题 10:中秋节前后华人与犹太老年女性死亡数(第 −2,−1,1,2 周:华人 55,33,70,49;犹太 141,145,139,161),比较死亡模式。
- 题 11:术后恶心药物随机双盲试验(安慰剂 80 人 45 例恶心;氯丙嗪 75/26;茶苯海明 85/52;戊巴比妥 100mg 67/35;150mg 85/37):各药对比安慰剂(5% 水平)并报告比值比(odds ratio);用 Bonferroni 与 FDR 校正多重检验。
- 题 12:Poisson 的 Wald 检验;计算机实验 \(\lambda_0=1\)、\(n=20\)、\(\alpha=.05\) 模拟实际第一类错误率是否接近 .05。
- 题 13–15:正态均值、正态标准差、二项比例的似然比检验,并与 Wald 检验比较。
- 题 16:证明标量参数下 Wald 与似然比检验渐近等价:\(W^2/\lambda\xrightarrow P1\)(提示:对 \(\ell(\theta_0)\) 在 \(\hat\theta\) 处泰勒展开 \(\ell(\theta_0)\approx\ell(\hat\theta)+(\theta_0-\hat\theta)\ell'(\hat\theta)+\frac12(\theta_0-\hat\theta)^2\ell''(\hat\theta)\),且 \(\ell'(\hat\theta)=0\))。
本章要点
- 检验框架:\(H_0/H_1\)、拒绝域、检验统计量、临界值;第一/二类错误;功效函数、大小、水平。
- Wald 检验 \(W=(\hat\theta-\theta_0)/\widehat{\text{se}}\);与置信区间对偶;功效随效应大小和样本量增加。两样本比较分独立样本与配对样本。
- p 值是 \(H_0\) 下出现同样或更极端结果的概率,\(H_0\) 下服从均匀分布;它不是 \(H_0\) 为真的概率,大 p 值也不是支持 \(H_0\) 的证据。
- 统计显著 ≠ 实际显著;置信区间通常比检验更有信息。
- Pearson \(\chi^2\) 检验(多项分布)、置换检验(精确、非参数)、似然比检验(\(\chi^2_{r-q}\) 极限)、拟合优度检验(自由度 \(k-1-s\))。
- 多重检验:Bonferroni 控制 FWER(保守),BH 控制 FDR(更有功效)。
- Neyman–Pearson 引理给出简单 vs 简单假设下的最有力检验;小样本正态均值用 t 检验。
与量化交易的关联
- 策略/因子显著性检验:检验平均收益或 alpha 是否为 0 就是 Wald/t 检验;\(t=\bar r/(s/\sqrt n)\)。实务中收益有自相关与异方差,应使用 Newey–West 等稳健标准误。
- 多重检验是量化研究的核心问题:挖掘成百上千个因子或参数组合,"总有一个显著"。Harvey, Liu & Zhu (2016) 主张因子 t 值门槛提高到 3 左右;Bonferroni 与 BH-FDR 可直接用于因子筛选,例 10.28 的计算流程可原样迁移到"10 个候选因子的 p 值"。Bailey & López de Prado 的"压缩 Sharpe 比率"(deflated Sharpe ratio)也源于同一思想。
- 配对比较:例 10.7 的配对思路用于比较两个策略在同一时间段的表现(对每日收益差做检验),比把两条收益序列当独立样本更有功效。
- 置换检验:适合检验择时信号是否有效——随机打乱信号与收益的对应关系(或随机化入场日期)得到置换分布,判断实际表现是否超出随机水平;它不依赖正态假设,适合小样本和厚尾数据(但打乱会破坏时间依赖结构,需谨慎)。
- 似然比检验:用于嵌套模型比较,例如 GARCH(1,1) vs ARCH(1)、双状态 vs 单状态模型(注意状态数检验时正则条件不成立)、因子模型中额外因子是否显著。
- 拟合优度:检验收益是否正态(\(\chi^2\) 分箱检验、以及 Jarque–Bera、KS 等),几乎总会拒绝正态,提醒使用厚尾模型。
- 统计 vs 经济显著:一个 t 值很高但年化超额只有 0.3%、扣除交易成本后为负的因子没有实际价值——图 10.2 的道理。
- p 值误读:p=0.01 不代表"策略有效的概率为 99%";要得到后者需贝叶斯方法和先验(第 11 章)。
推荐习题
- 题 11(多药对比 + Bonferroni/FDR,可改编为多因子筛选);题 7(Wald vs 置换检验);题 12(模拟验证第一类错误率);题 16(Wald 与 LRT 渐近等价);题 5(非正态统计量的检验);题 13–15(构造似然比检验)。
第 11 章 贝叶斯推断(Bayesian Inference)(PDF p.186–203)
11.1 贝叶斯哲学(The Bayesian Philosophy)(PDF p.186–187)
前面各章的方法称为频率学派(frequentist)或经典方法,基于以下公设:
- F1 概率指极限相对频率,是现实世界的客观性质。
- F2 参数是固定的未知常数;它们不波动,因此不能对参数作有用的概率陈述。
- F3 统计程序应具有定义明确的长期频率性质,例如 95% 置信区间应以至少 95% 的极限频率套住真参数。
贝叶斯推断(Bayesian inference)基于以下公设:
- B1 概率描述信念度,而非极限频率。因此可以对很多事物作概率陈述,而不仅仅是受随机变化影响的数据。例:"爱因斯坦在 1948 年 8 月 1 日喝过一杯茶的概率为 .35",这不对应任何极限频率,只反映我对该命题的信念强度。
- B2 即使参数是固定常数,也可以对参数作概率陈述。
- B3 对参数 \(\theta\) 的推断通过给出 \(\theta\) 的概率分布来实现,点估计、区间估计等都从这个分布中提取。
贝叶斯推断有争议,因为它天然接受主观概率;一般而言贝叶斯方法不保证长期表现。统计学界更重视频率方法,但贝叶斯方法确有一席之地;某些数据挖掘和机器学习社区非常热衷贝叶斯方法。先放下哲学争论,看看怎么做,章末再讨论优缺点。
11.2 贝叶斯方法(The Bayesian Method)(PDF p.187–190)
步骤:
- 选择先验分布(prior distribution)\(f(\theta)\),表达在看到数据前对参数的信念;
- 选择统计模型 \(f(x\mid\theta)\),反映给定 \(\theta\) 时对 \(x\) 的信念(现在写 \(f(x\mid\theta)\) 而不是 \(f(x;\theta)\));
- 观测数据 \(X_1,\dots,X_n\) 后更新信念,计算后验分布(posterior distribution)\(f(\theta\mid X_1,\dots,X_n)\)。
第 3 步怎么做:把参数当随机变量,记为大写 \(\Theta\)。离散情形单个观测:
后验的用途:点估计取后验中心,常用后验均值或众数。后验均值
例 11.1(Bernoulli + 均匀先验):\(X_i\sim\) Bernoulli\((p)\),先验 \(f(p)=1\)。后验 \(f(p\mid x^n)\propto f(p)\mathcal L_n(p)=p^s(1-p)^{n-s}=p^{s+1-1}(1-p)^{n-s+1-1}\),\(s=\sum x_i\) 为成功次数。回顾 Beta\((\alpha,\beta)\) 密度 \(f(p;\alpha,\beta)=\frac{\Gamma(\alpha+\beta)}{\Gamma(\alpha)\Gamma(\beta)}p^{\alpha-1}(1-p)^{\beta-1}\),可见后验为 Beta\((s+1,n-s+1)\):
例 11.2(正态-正态共轭):\(X_i\sim N(\theta,\sigma^2)\),\(\sigma\) 已知,先验 \(\theta\sim N(a,b^2)\)。(习题 1 证明)后验 \(\theta\mid X^n\sim N(\bar\theta,\tau^2)\),
11.3 参数的函数(Functions of Parameters)(PDF p.191)
推断 \(\tau=g(\theta)\):与第 2 章求 \(Y=g(X)\) 的密度同理。后验 CDF \(H(\tau\mid x^n)=\mathbb P(g(\theta)\le\tau\mid x^n)=\int_Af(\theta\mid x^n)d\theta\),\(A=\{\theta:g(\theta)\le\tau\}\);后验密度 \(h(\tau\mid x^n)=H'(\tau\mid x^n)\)。 例 11.3:Bernoulli + 均匀先验,\(p\mid X^n\sim\) Beta\((s+1,n-s+1)\),\(\psi=\log(p/(1-p))\)。
11.4 模拟(Simulation)(PDF p.191–192)
后验常可用模拟近似。抽 \(\theta_1,\dots,\theta_B\sim p(\theta\mid x^n)\),直方图近似后验密度;后验均值近似 \(B^{-1}\sum\theta_j\);\(1-\alpha\) 后验区间近似 \((\theta_{\alpha/2},\theta_{1-\alpha/2})\)(样本分位数)。有了后验样本,令 \(\tau_i=g(\theta_i)\),则 \(\tau_1,\dots,\tau_B\) 是 \(f(\tau\mid x^n)\) 的样本,无需任何解析计算。(第 24 章详述。) 例 11.4:续例 11.3,不做微积分:1. 抽 \(P_1,\dots,P_B\sim\) Beta\((s+1,n-s+1)\);2. \(\psi_i=\log(P_i/(1-P_i))\)。\(\psi_i\) 即为 \(h(\psi\mid x^n)\) 的 IID 样本,直方图即估计。
11.5 贝叶斯程序的大样本性质(Large Sample Properties of Bayes' Procedures)(PDF p.192)
定理 11.5:\(\hat\theta_n\) 为 MLE,\(\widehat{\text{se}}=1/\sqrt{nI(\hat\theta_n)}\)。在适当正则条件下,后验近似正态,均值 \(\hat\theta_n\)、标准差 \(\widehat{\text{se}}\),故 \(\bar\theta_n\approx\hat\theta_n\)。又若 \(C_n=(\hat\theta_n-z_{\alpha/2}\widehat{\text{se}},\hat\theta_n+z_{\alpha/2}\widehat{\text{se}})\) 为渐近频率学派 \(1-\alpha\) 置信区间,则它也是近似 \(1-\alpha\) 贝叶斯后验区间:\(\mathbb P(\theta\in C_n\mid X^n)\to1-\alpha\)。(Bernstein–von Mises 型结果。) 贝叶斯 Delta 方法:\(\tau=g(\theta)\),则 \(\tau\mid X^n\approx N(\hat\tau,\widetilde{\text{se}}^2)\),\(\hat\tau=g(\hat\theta)\),\(\widetilde{\text{se}}=\widehat{\text{se}}\,|g'(\hat\theta)|\)。
11.6 平坦先验、非正常先验与"无信息"先验(Flat Priors, Improper Priors, and "Noninformative" Priors)(PDF p.192–194)
关键问题:先验从哪来?主观主义(subjectivism)认为先验应反映收集数据前对 \(\theta\) 的主观看法;某些情况下可行,但在复杂、多参数问题中不现实,而且把主观意见注入分析违背科学推断尽量客观的目标。另一选择是定义某种"无信息先验"(noninformative prior),显然的候选是平坦先验 \(f(\theta)\propto\) 常数。Bernoulli 例中 \(f(p)=1\) 得到 Beta\((s+1,n-s+1)\) 后验,看起来很合理,但滥用平坦先验会引起问题:
非正常先验(improper priors):\(X\sim N(\theta,\sigma^2)\),\(\sigma\) 已知,平坦先验 \(f(\theta)\propto c>0\),\(\int f(\theta)d\theta=\infty\),不是通常意义的概率密度,称为非正常先验。仍可形式地应用贝叶斯定理:\(f(\theta\mid x^n)\propto\mathcal L_n(\theta)f(\theta)\propto\mathcal L_n(\theta)\),得 \(\theta\mid X^n\sim N(\bar X,\sigma^2/n)\),点估计与区间估计和频率学派完全一致。一般而言,只要后验是良定义的概率分布,非正常先验就没问题。
平坦先验不具不变性(flat priors are not invariant):Bernoulli 用 \(f(p)=1\) 表示对 \(p\) 一无所知。令 \(\psi=\log(p/(1-p))\),变换后 \(\psi\) 的分布为 \(f_\Psi(\psi)=\frac{e^\psi}{(1+e^\psi)^2}\),不是平坦的。但若对 \(p\) 无知,对 \(\psi\) 也应无知,应对 \(\psi\) 用平坦先验——矛盾。平坦先验的概念没有良好定义,因为对参数平坦不意味着对其变换平坦。
Jeffreys 先验:取 \(f(\theta)\propto I(\theta)^{1/2}\),\(I(\theta)\) 为 Fisher 信息。该规则具有变换不变性。(作者不展开其合理性的其他理由。) 例 11.6:Bernoulli,\(I(p)=\frac1{p(1-p)}\),Jeffreys 先验 \(f(p)\propto\sqrt{I(p)}=p^{-1/2}(1-p)^{-1/2}\),即 Beta(1/2,1/2),与均匀分布很接近。 多参数时 Jeffreys 先验 \(f(\theta)\propto\sqrt{|I(\theta)|}\),\(|A|\) 为行列式,\(I(\theta)\) 为 Fisher 信息矩阵。
11.7 多参数问题(Multiparameter Problems)(PDF p.194–195)
\(\theta=(\theta_1,\dots,\theta_p)\),后验仍为 \(f(\theta\mid x^n)\propto\mathcal L_n(\theta)f(\theta)\) (11.8)。推断单个参数的关键是求边缘后验:
例 11.7(比较两个二项比例):对照组 \(n_1\) 人中 \(X_1\) 人存活,处理组 \(n_2\) 人中 \(X_2\) 人存活,估计 \(\tau=g(p_1,p_2)=p_2-p_1\)。\(\mathcal L(p_1,p_2)\propto p_1^{x_1}(1-p_1)^{n_1-x_1}p_2^{x_2}(1-p_2)^{n_2-x_2}\)。若 \(f(p_1,p_2)=1\),后验 \(f(p_1,p_2\mid x_1,x_2)\propto\) 上式。\((p_1,p_2)\) 在正方形上且后验可分解为 \(f(p_1\mid x_1)f(p_2\mid x_2)\),故后验下 \(p_1,p_2\) 独立,\(p_1\mid x_1\sim\) Beta\((x_1+1,n_1-x_1+1)\),\(p_2\mid x_2\sim\) Beta\((x_2+1,n_2-x_2+1)\)。分别模拟 \(P_{1,b}\)、\(P_{2,b}\),\(\tau_b=P_{2,b}-P_{1,b}\) 即为 \(f(\tau\mid x_1,x_2)\) 的样本。
11.8 贝叶斯检验(Bayesian Testing)(PDF p.195–196)
从贝叶斯视角看检验是复杂话题,只简述主要思想:对 \(H_0\) 和参数 \(\theta\) 都放先验,然后计算 \(\mathbb P(H_0\mid X^n)\)。考虑标量 \(\theta\),检验 \(H_0:\theta=\theta_0\) vs \(H_1:\theta\ne\theta_0\)。通常取 \(\mathbb P(H_0)=\mathbb P(H_1)=1/2\)(非必需)。\(H_1\) 下给 \(\theta\) 先验密度 \(f(\theta)\)。由贝叶斯定理
11.9 贝叶斯推断的优缺点(Strengths and Weaknesses of Bayesian Inference)(PDF p.196–200)
优点:有先验信息时,贝叶斯定理是把先验信息与数据结合的自然方式。有人觉得它心理上更有吸引力,因为允许对参数作概率陈述;频率学派给出 95% 时间套住参数的置信集 \(C_n\),却不能说 \(\mathbb P(\theta\in C_n\mid X^n)=.95\)——只能对 \(C_n\) 而不是 \(\theta\) 作概率陈述。但心理吸引力不是选择推断方式的有力科学论据。 参数模型、大样本时两种方法推断近似相同;一般情况下两者不必一致。三个例子:第一个体现贝叶斯的心理吸引力,后两个说明贝叶斯方法可能失败。
例 11.8(例 6.14 再访):\(Y_i=\theta+X_i\),\(X_i=\pm1\) 等概率,观测到 \(Y_1=15\)、\(Y_2=17\),75% 置信集为 \(\{16\}\),而此时可确定 \(\theta=16\)。称之为 75% 置信集让很多人不安,但它确实是有效的 75% 置信集(长期 75% 套中)。贝叶斯解法更令人满意:设 \(\theta\) 为整数,先验质量函数 \(f(\theta)>0\) 对所有整数成立。\(Y=(15,17)\) 时似然 \(\mathcal L(\theta)=1/4\)(\(\theta=16\)),否则为 0。由贝叶斯定理 \(\mathbb P(\Theta=\theta\mid Y=(15,17))=1\)(\(\theta=16\)),否则为 0,故 \(\mathbb P(\theta\in C\mid Y=(15,17))=1\)。
例 11.9(Robins & Ritov 1997 的简化版):数据为 \(n\) 个 IID 三元组 \((X_1,R_1,Y_1),\dots,(X_n,R_n,Y_n)\)。\(B\) 是有限但极大的数(如 \(B=100^{100}\)),任何现实样本量都远小于 \(B\)。未知参数向量 \(\theta=(\theta_1,\dots,\theta_B)\),\(0\le\theta_j\le1\);已知数向量 \(\xi=(\xi_1,\dots,\xi_B)\),\(0<\delta\le\xi_j\le1-\delta<1\),\(\delta\) 为小正数。生成方式:
- \(X_i\) 从 \(\{1,\dots,B\}\) 均匀抽取;
- \(R_i\sim\) Bernoulli\((\xi_{X_i})\);
- 若 \(R_i=1\),抽 \(Y_i\sim\) Bernoulli\((\theta_{X_i})\);若 \(R_i=0\),不抽 \(Y_i\)。
模型看似人为,实为某些真实缺失数据问题的漫画(\(R_i=0\) 表示"缺失")。目标:估计 \(\psi=\mathbb P(Y_i=1)=\sum_j\mathbb P(Y_i=1\mid X=j)\mathbb P(X=j)=\frac1B\sum_j\theta_j\),是 \(\theta\) 的函数。
贝叶斯分析:单观测似然 \(f(X_i,R_i,Y_i)=f(X_i)f(R_i\mid X_i)f(Y_i\mid X_i)^{R_i}\)(\(R_i=0\) 时 \(Y_i\) 未观测,该项消失)。\(f(X_i)=1/B\),于是 \(\mathcal L(\theta)=\prod\frac1B\xi_{X_i}^{R_i}(1-\xi_{X_i})^{1-R_i}\theta_{X_i}^{Y_iR_i}(1-\theta_{X_i})^{(1-Y_i)R_i}\propto\prod\theta_{X_i}^{Y_iR_i}(1-\theta_{X_i})^{(1-Y_i)R_i}\)(\(B\) 和 \(\xi_j\) 是已知常数,丢掉)。对数似然 \(\ell(\theta)=\sum_jn_j\log\theta_j+\sum_jm_j\log(1-\theta_j)\),\(n_j=\#\{i:Y_i=1,R_i=1,X_i=j\}\),\(m_j=\#\{i:Y_i=0,R_i=1,X_i=j\}\)。由于 \(B\gg n\),绝大多数 \(j\) 有 \(n_j=m_j=0\)。含义:大多数 \(\theta_j\) 的 MLE 无定义;大多数 \(\theta_j\) 的后验等于先验(不出现在似然中);故 \(f(\theta\mid\text{Data})\approx f(\theta)\),\(f(\psi\mid\text{Data})\approx f(\psi)\)——数据在贝叶斯分析中几乎不提供关于 \(\psi\) 的信息。
频率学派解法:
\[\hat\psi=\frac1n\sum_{i=1}^n\frac{R_iY_i}{\xi_{X_i}}.\tag{11.10}\]可证(习题 7)\(\mathbb E(\hat\psi)=\psi\),\(\mathbb V(\hat\psi)\le\frac1{n\delta^2}\) (11.11)。所以 MSE 为 \(O(1/n)\),无论 \(B\) 多大都随数据增加较快趋于 0。这就是 Horvitz–Thompson 估计量(原书拼作 Horwitz)。它不能从贝叶斯或似然观点导出,因为它含 \(\xi_{X_i}\),而这些项在对数似然中消失了,不会出现在任何基于似然的方法(包括贝叶斯估计)中。 寓意:贝叶斯方法受制于似然函数;在高维(和非参数)问题中,似然可能给不出准确推断。
例 11.10(Edward George 提供):\(f\) 为密度,\(f(x)=cg(x)\),\(g(x)>0\) 已知,\(c\) 未知。原则上 \(c=1/\int g(x)dx\),但 \(g\) 复杂、\(x\) 高维时积分常算不出。尽管 \(c\) 未知,常常仍能从 \(f\) 抽样 \(X_1,\dots,X_n\)(第 24 章)。能否用样本估计归一化常数 \(c\)? 频率解:令 \(\hat f_n(x)\) 为 \(f\) 的相合估计(第 20 章),任取点 \(x\),\(c=f(x)/g(x)\),故 \(\hat c=\hat f_n(x)/g(x)\) 是 \(c\) 的相合估计。 贝叶斯解:取先验 \(\pi(c)>0\)(\(c>0\))。似然 \(\mathcal L_n(c)=\prod f(X_i)=\prod cg(X_i)=c^n\prod g(X_i)\propto c^n\)。后验 \(\propto c^n\pi(c)\),不依赖 \(X_1,\dots,X_n\)——惊人的结论:从贝叶斯观点看,数据中没有关于 \(c\) 的信息。而且后验均值 \(\frac{\int_0^\infty c^{n+1}\pi(c)dc}{\int_0^\infty c^n\pi(c)dc}\) 随 \(n\) 增大趋于无穷。
结论:"贝叶斯学派是似然函数的奴隶。似然出问题时,贝叶斯推断也会出问题。"重要的是理解两种方法回答的是不同问题:想以有原则的方式结合先验信念与数据,用贝叶斯推断;想构造有长期表现保证的程序(如置信区间),用频率方法。一般而言参数空间高维时贝叶斯方法会遇到问题;特别是 95% 后验区间不一定(在频率意义上)95% 的时间包含真值。
11.10 文献注(PDF p.200–201)
贝叶斯推断参考:Carlin & Louis (1996)、Gelman et al. (1995)、Lee (1997)、Robert (1994)、Schervish (1995)。非参数贝叶斯技术问题:Cox (1993)、Diaconis & Freedman (1986)、Freedman (1999)、Barron et al. (1999)、Ghosal et al. (2000)、Shen & Wasserman (2001)、Zhao (2000)。Robins–Ritov 例详见 Robins & Ritov (1997)(更恰当地表述为非参数问题)。例 11.10 来自 Edward George。贝叶斯检验:Berger & Delampady (1987)、Kass & Raftery (1995);无信息先验:Kass & Wasserman (1996)。
11.11 附录:定理 11.5 证明(PDF p.201)
随 \(n\) 增大先验影响减弱,\(f(\theta\mid x^n)\propto\mathcal L_n(\theta)f(\theta)\approx\mathcal L_n(\theta)\),故 \(\log f(\theta\mid x^n)\approx\ell(\theta)\)。\(\ell(\theta)\approx\ell(\hat\theta)+(\theta-\hat\theta)\ell'(\hat\theta)+\frac{(\theta-\hat\theta)^2}2\ell''(\hat\theta)=\ell(\hat\theta)+\frac{(\theta-\hat\theta)^2}2\ell''(\hat\theta)\)(\(\ell'(\hat\theta)=0\))。取指数,近似 \(f(\theta\mid x^n)\propto\exp\left\{-\frac12\frac{(\theta-\hat\theta)^2}{\sigma_n^2}\right\}\),\(\sigma_n^2=-1/\ell''(\hat\theta_n)\)。所以后验近似正态,均值 \(\hat\theta\)、方差 \(\sigma_n^2\)。令 \(\ell_i=\log f(X_i\mid\theta)\),\(\frac1{\sigma_n^2}=-\ell''(\hat\theta_n)=\sum_i-\ell_i''(\hat\theta_n)=n\left(\frac1n\right)\sum_i-\ell_i''(\hat\theta_n)\approx n\mathbb E_\theta[-\ell_i''(\hat\theta_n)]=nI(\hat\theta_n)\),故 \(\sigma_n\approx\text{se}(\hat\theta)\)。
11.12 习题(PDF p.201–203)概览
共 8 题:题 1 验证 (11.7)(正态-正态共轭);题 2 \(N(\mu,1)\)、\(\mu=5\)、\(n=100\) 模拟:平坦先验后验、1000 次后验抽样直方图、\(\theta=e^\mu\) 的后验(解析与模拟)、\(\mu\) 的 95% 后验区间、\(\theta\) 的 95% 置信区间;题 3 Uniform\((0,\theta)\) + \(f(\theta)\propto1/\theta\) 的后验;题 4 安慰剂 50 人 30 人改善、治疗 50 人 40 人改善,\(\tau=p_2-p_1\):(a) MLE、Delta 方法 se 与 90% 区间;(b) 参数 bootstrap;(c) 平坦先验下模拟求后验均值与 90% 后验区间;(d) 对数比值比 \(\psi=\log\left(\frac{p_1}{1-p_1}\div\frac{p_2}{1-p_2}\right)\) 的 MLE 与 Delta 区间;(e) \(\psi\) 的后验模拟(频率、bootstrap、贝叶斯三种方法对比);题 5 Bernoulli 数据 0101000000 在 Beta(1/2,1/2)、Beta(1,1)、Beta(10,10)、Beta(100,100) 先验下的后验图(先验强度的影响);题 6 Poisson + Gamma 共轭先验的后验与后验均值;Jeffreys 先验及其后验;题 7 验证 (11.11);题 8(Jeffreys–Lindley 悖论):\(X\sim N(\mu,1)\),\(H_0:\mu=0\),\(\mathbb P(H_0)=\mathbb P(H_1)=1/2\),\(H_1\) 下 \(\mu\sim N(0,b^2)\),求 \(\mathbb P(H_0\mid X=x)\) 并与 Wald 检验 p 值对比;推广到样本量 \(n\),会发现即使 p 值很小,\(H_0\) 后验概率也可能很大,\(n\) 大时尤甚。
本章要点
- 频率学派(F1–F3)与贝叶斯学派(B1–B3)的公设差别:概率的含义、参数是否可有概率分布。
- 后验 ∝ 似然 × 先验;后验均值、众数、后验区间;共轭先验(Beta–Bernoulli、Normal–Normal、Gamma–Poisson)使计算闭式化,后验均值是 MLE 与先验均值的加权平均(收缩)。
- 参数函数的后验可由变换或模拟得到;多参数问题用边缘后验,模拟时直接取分量。
- 大样本下后验近似 \(N(\hat\theta,\widehat{\text{se}}^2)\),贝叶斯与频率区间近似一致(定理 11.5)。
- 先验选择:主观先验、平坦先验(非不变)、非正常先验(后验正常即可)、Jeffreys 先验 \(\propto\sqrt{I(\theta)}\)(不变)。
- 贝叶斯检验对先验敏感,不能用非正常先验;Jeffreys–Lindley 悖论。
- 高维问题中贝叶斯可能失败(Robins–Ritov、归一化常数例):"贝叶斯是似然的奴隶";两种方法回答不同问题。
与量化交易的关联
- 收缩估计:Beta–Bernoulli 与 Normal–Normal 的后验均值是"样本估计与先验的加权平均",正是量化中最有用的思想之一:对个股期望收益、Beta、胜率做向截面均值的收缩(Vasicek Beta 调整、Bayes–Stein 期望收益估计);Black–Litterman 模型本质上就是例 11.2 的多元版本——以市场均衡收益为先验、以投资者观点为数据,按精度加权得到后验期望收益。
- 小样本策略评估:新策略只有少量实盘数据时,用 Beta 先验更新胜率、用正态先验更新 alpha,可避免极端估计;习题 5 展示先验强度的影响。
- 两比例比较:例 11.7 与习题 4 的模拟方法可用于 A/B 比较两种执行算法的成交率或滑点超标率,直接给出"算法 B 优于 A 的后验概率"。
- 贝叶斯检验与 Lindley 悖论:大样本下 p 值很小但效应很小时,贝叶斯后验可能仍支持原假设——提醒在高频大样本数据中 p 值很容易"显著",应同时看效应大小。
- 高维警示:例 11.9 说明参数远多于数据时,全贝叶斯可能失效;量化中的高维协方差估计、大规模因子模型都需要结构化先验或频率学派的收缩方法。Horvitz–Thompson 的逆概率加权思想用于处理幸存者偏差、样本选择偏差(如只观测到成交订单时估计全部订单的特征)。
- 模拟后验:例 11.4 的"后验抽样再变换"是贝叶斯组合优化中考虑参数不确定性的标准做法(对每个后验抽样做一次优化或计算风险)。
推荐习题
- 题 4(频率 vs bootstrap vs 贝叶斯三法对比,必做);题 8(Jeffreys–Lindley 悖论);题 5(先验强度影响);题 1、6(共轭先验推导);题 2(后验模拟与参数变换)。
第 12 章 统计决策理论(Statistical Decision Theory)(PDF p.204–216)
12.1 预备知识(Preliminaries)(PDF p.204–205)
我们已有 MLE、矩估计、后验均值等多种点估计方法,如何选择?答案在决策理论(decision theory)——比较统计程序的形式理论。 参数 \(\theta\in\Theta\),估计量 \(\hat\theta\)。决策理论术语中,估计量称为决策规则(decision rule),其可能取值称为行动(actions)。用损失函数(loss function)\(L(\theta,\hat\theta):\Theta\times\Theta\to\mathbb R\) 度量 \(\theta\) 与 \(\hat\theta\) 的差异。例:
- 平方误差损失 \(L=(\theta-\hat\theta)^2\);
- 绝对误差损失 \(L=|\theta-\hat\theta|\);
- \(L_p\) 损失 \(L=|\theta-\hat\theta|^p\);
- 0-1 损失:\(\theta=\hat\theta\) 时 0,否则 1;
- Kullback–Leibler 损失 \(L=\int\log\left(\frac{f(x;\theta)}{f(x;\hat\theta)}\right)f(x;\theta)dx\)。 估计量是数据的函数,有时写作 \(\hat\theta(X)\)。评价估计量用平均损失即风险: 定义 12.1:估计量的风险(risk)\(R(\theta,\hat\theta)=\mathbb E_\theta(L(\theta,\hat\theta))=\int L(\theta,\hat\theta(x))f(x;\theta)dx\)。 平方误差损失下风险就是 MSE:\(R(\theta,\hat\theta)=\mathbb E_\theta(\hat\theta-\theta)^2=\text{MSE}=\mathbb V_\theta(\hat\theta)+\text{bias}^2_\theta(\hat\theta)\)。本章未注明时默认平方误差损失。
12.2 比较风险函数(Comparing Risk Functions)(PDF p.205–208)
比较两个估计量可比较其风险函数,但通常得不到明确结论: 例 12.2:\(X\sim N(\theta,1)\),\(\hat\theta_1=X\),\(\hat\theta_2=3\)。\(R(\theta,\hat\theta_1)=1\),\(R(\theta,\hat\theta_2)=(3-\theta)^2\)。\(2<\theta<4\) 时 \(\hat\theta_2\) 风险更小,否则 \(\hat\theta_1\) 更小;两者都不一致占优(图 12.1)。 例 12.3:Bernoulli,\(\hat p_1=\bar X\),无偏,\(R(p,\hat p_1)=\mathbb V(\bar X)=\frac{p(1-p)}n\)。另一估计 \(\hat p_2=\frac{Y+\alpha}{\alpha+\beta+n}\)(\(Y=\sum X_i\)),是 Beta\((\alpha,\beta)\) 先验下的后验均值。
需要风险函数的单数字概括。定义 12.4:最大风险(maximum risk)\(\bar R(\hat\theta)=\sup_\theta R(\theta,\hat\theta)\) (12.1);贝叶斯风险(Bayes risk)\(r(f,\hat\theta)=\int R(\theta,\hat\theta)f(\theta)d\theta\) (12.2),\(f\) 为先验。 例 12.5:续例 12.3。\(\bar R(\hat p_1)=\max_p\frac{p(1-p)}n=\frac1{4n}\),\(\bar R(\hat p_2)=\max_p\frac n{4(n+\sqrt n)^2}=\frac n{4(n+\sqrt n)^2}\)。按最大风险 \(\hat p_2\) 更好。但 \(n\) 大时,除 \(p=1/2\) 附近一小块外 \(\hat p_1\) 风险更小,因此许多人更喜欢 \(\hat p_1\)——单数字概括不完美。贝叶斯风险(取 \(f(p)=1\)):\(r(f,\hat p_1)=\int\frac{p(1-p)}ndp=\frac1{6n}\),\(r(f,\hat p_2)=\frac n{4(n+\sqrt n)^2}\)。\(n\ge20\) 时 \(r(f,\hat p_2)>r(f,\hat p_1)\),提示 \(\hat p_1\) 更好;直觉上合理,但依赖先验选择。最大风险虽有问题,但优势是不需要选择先验。 两种概括导出两种构造估计量的方法:最小化最大风险 → minimax 估计量;最小化贝叶斯风险 → 贝叶斯估计量。 定义 12.6:关于先验 \(f\) 的贝叶斯规则(Bayes rule)\(\hat\theta\) 满足 \(r(f,\hat\theta)=\inf_{\tilde\theta}r(f,\tilde\theta)\) (12.3);minimax 规则满足 \(\sup_\theta R(\theta,\hat\theta)=\inf_{\tilde\theta}\sup_\theta R(\theta,\tilde\theta)\) (12.4),下确界取遍所有估计量。
12.3 贝叶斯估计量(Bayes Estimators)(PDF p.208–209)
先验 \(f\),后验 \(f(\theta\mid x)=\frac{f(x\mid\theta)f(\theta)}{m(x)}=\frac{f(x\mid\theta)f(\theta)}{\int f(x\mid\theta)f(\theta)d\theta}\) (12.5),\(m(x)=\int f(x,\theta)d\theta=\int f(x\mid\theta)f(\theta)d\theta\) 为 \(X\) 的边缘分布。定义估计量 \(\hat\theta(x)\) 的后验风险(posterior risk)\(r(\hat\theta\mid x)=\int L(\theta,\hat\theta(x))f(\theta\mid x)d\theta\)。 定理 12.7:贝叶斯风险满足 \(r(f,\hat\theta)=\int r(\hat\theta\mid x)m(x)dx\) (12.6)。令 \(\hat\theta(x)\) 为使 \(r(\hat\theta\mid x)\) 最小的值,则 \(\hat\theta\) 是贝叶斯估计量。 证明:\(r(f,\hat\theta)=\int R(\theta,\hat\theta)f(\theta)d\theta=\int\left(\int L(\theta,\hat\theta(x))f(x\mid\theta)dx\right)f(\theta)d\theta=\iint L\,f(x,\theta)dxd\theta=\iint L\,f(\theta\mid x)m(x)dxd\theta=\int\left(\int L\,f(\theta\mid x)d\theta\right)m(x)dx=\int r(\hat\theta\mid x)m(x)dx\)。对每个 \(x\) 最小化被积函数即最小化积分。(实用含义:贝叶斯规则只需对观测到的 \(x\) 最小化后验期望损失。) 定理 12.8:平方误差损失下贝叶斯估计为后验均值 \(\hat\theta(x)=\int\theta f(\theta\mid x)d\theta=\mathbb E(\theta\mid X=x)\) (12.7);绝对误差损失下为后验中位数;0-1 损失下为后验众数。 证明(平方损失):\(r(\hat\theta\mid x)=\int(\theta-\hat\theta(x))^2f(\theta\mid x)d\theta\),对 \(\hat\theta(x)\) 求导令为 0:\(2\int(\theta-\hat\theta(x))f(\theta\mid x)d\theta=0\),解得 (12.7)。 例 12.9:\(X_i\sim N(\mu,\sigma^2)\),\(\sigma^2\) 已知,先验 \(\mu\sim N(a,b^2)\),平方损失下贝叶斯估计为后验均值
12.4 Minimax 规则(Minimax Rules)(PDF p.209–211)
寻找 minimax 规则较复杂,本书只提几个关键结果。主要信息:具有常数风险函数的贝叶斯估计量是 minimax 的。 定理 12.10:令 \(\hat\theta^f\) 为某先验 \(f\) 的贝叶斯规则,\(r(f,\hat\theta^f)=\inf_{\hat\theta}r(f,\hat\theta)\) (12.8)。若 \(R(\theta,\hat\theta^f)\le r(f,\hat\theta^f)\) 对所有 \(\theta\) 成立 (12.9),则 \(\hat\theta^f\) 是 minimax 的,\(f\) 称为最不利先验(least favorable prior)。 证明:若 \(\hat\theta^f\) 非 minimax,存在 \(\hat\theta_0\) 使 \(\sup_\theta R(\theta,\hat\theta_0)<\sup_\theta R(\theta,\hat\theta^f)\)。函数的平均不超过其最大值,故 \(r(f,\hat\theta_0)\le\sup_\theta R(\theta,\hat\theta_0)<\sup_\theta R(\theta,\hat\theta^f)\le r(f,\hat\theta^f)\),与 (12.8) 矛盾。 定理 12.11:若 \(\hat\theta\) 是关于某先验 \(f\) 的贝叶斯规则且风险为常数 \(R(\theta,\hat\theta)=c\),则 \(\hat\theta\) 是 minimax 的。证明:\(r(f,\hat\theta)=\int cf=c\),故 \(R(\theta,\hat\theta)\le r(f,\hat\theta)\),用上一定理。 例 12.12:Bernoulli 平方损失下,例 12.3 的 \(\hat p=\frac{Y+\sqrt{n/4}}{n+\sqrt n}\) 风险为常数,且是 Beta\((\sqrt{n/4},\sqrt{n/4})\) 先验下的后验均值(贝叶斯规则),故 minimax。 例 12.13:Bernoulli,损失 \(L(p,\hat p)=\frac{(p-\hat p)^2}{p(1-p)}\),令 \(\hat p(X^n)=\bar X\)。风险 \(R(p,\hat p)=\mathbb E\left(\frac{(p-\hat p)^2}{p(1-p)}\right)=\frac1{p(1-p)}\frac{p(1-p)}n=\frac1n\),为常数。可证在此损失下 \(\hat p\) 是先验 \(f(p)=1\) 的贝叶斯估计,故 minimax。(说明 minimax 与否依赖损失函数。)
定理 12.14:\(X_1,\dots,X_n\sim N(\theta,1)\),\(\hat\theta=\bar X\) 对任何"良好"的损失函数都是 minimax 的(脚注:"良好"指水平集是凸的且关于原点对称;结果在测度零集意义下成立),而且是唯一具有此性质的估计量。 参数空间受限时上述定理不适用: 例 12.15:\(X\sim N(\theta,1)\),已知 \(\theta\in[-m,m]\),\(0<m<1\)。平方损失下唯一 minimax 估计为 \(\hat\theta(X)=m\tanh(mX)\),\(\tanh(z)=\frac{e^z-e^{-z}}{e^z+e^{-z}}\)。它是在 \(\pm m\) 各放 1/2 质量的先验下的贝叶斯规则;风险非常数,但满足 \(R(\theta,\hat\theta)\le r(f,\hat\theta)\) 对所有 \(\theta\) 成立(图 12.3,\(m=.5\)),由定理 12.10 为 minimax。
12.5 最大似然、Minimax 与贝叶斯(Maximum Likelihood, Minimax, and Bayes)(PDF p.212–213)
满足弱正则条件的参数模型中,MLE 近似 minimax。平方损失 = 偏差² + 方差;大样本参数模型中方差项主导偏差(脚注:通常偏差² 为 \(O(n^{-2})\),方差为 \(O(n^{-1})\)),故 \(R(\theta,\hat\theta)=\mathbb V_\theta(\hat\theta)+\text{bias}^2\approx\mathbb V_\theta(\hat\theta)\)。由第 9 章,\(\mathbb V(\hat\theta)\approx\frac1{nI(\theta)}\),因此
12.6 可容许性(Admissibility)(PDF p.213–215)
Minimax 与贝叶斯估计量风险小,是"好估计量";刻画"坏估计量"也有用。 定义 12.17:若存在另一规则 \(\hat\theta'\) 使 \(R(\theta,\hat\theta')\le R(\theta,\hat\theta)\) 对所有 \(\theta\) 成立,且至少对一个 \(\theta\) 严格小于,则 \(\hat\theta\) 不可容许(inadmissible);否则可容许(admissible)。 例 12.18:\(X\sim N(\theta,1)\),平方损失,\(\hat\theta(X)=3\)。证明它可容许:若不然,存在风险更小的 \(\hat\theta'\),特别地 \(R(3,\hat\theta')\le R(3,\hat\theta)=0\),故 \(0=R(3,\hat\theta')=\int(\hat\theta'(x)-3)^2f(x;3)dx\),于是 \(\hat\theta'(x)=3\),没有规则能胜过它。它虽可容许,但显然是个糟糕的规则——可容许性只是很弱的要求。
定理 12.19(贝叶斯规则可容许):设 \(\Theta\subset\mathbb R\),且对每个 \(\hat\theta\),\(R(\theta,\hat\theta)\) 是 \(\theta\) 的连续函数。\(f\) 为全支撑先验(对每个 \(\theta\) 与 \(\epsilon>0\),\(\int_{\theta-\epsilon}^{\theta+\epsilon}f>0\))。令 \(\hat\theta^f\) 为贝叶斯规则,若贝叶斯风险有限,则 \(\hat\theta^f\) 可容许。 证明:设 \(\hat\theta^f\) 不可容许,存在更好的 \(\hat\theta\):对所有 \(\theta\),\(R(\theta,\hat\theta)\le R(\theta,\hat\theta^f)\),且某 \(\theta_0\) 处严格。令 \(\nu=R(\theta_0,\hat\theta^f)-R(\theta_0,\hat\theta)>0\)。由连续性存在 \(\epsilon>0\) 使在 \((\theta_0-\epsilon,\theta_0+\epsilon)\) 内 \(R(\theta,\hat\theta^f)-R(\theta,\hat\theta)>\nu/2\)。于是 \(r(f,\hat\theta^f)-r(f,\hat\theta)=\int[R(\theta,\hat\theta^f)-R(\theta,\hat\theta)]f(\theta)d\theta\ge\int_{\theta_0-\epsilon}^{\theta_0+\epsilon}[\cdots]f\,d\theta\ge\frac\nu2\int_{\theta_0-\epsilon}^{\theta_0+\epsilon}f(\theta)d\theta>0\),与 \(\hat\theta^f\) 最小化贝叶斯风险矛盾。
定理 12.20:\(X_i\sim N(\mu,\sigma^2)\),平方损失下 \(\bar X\) 可容许。证明技术性强,略;思路:任何严格正先验的后验均值可容许;取先验 \(N(a,b^2)\),\(b^2\) 很大时后验均值近似 \(\bar X\)。 可容许性与 minimax 一般无蕴含关系(规则可能是其一、两者、或都不是),但有以下联系: 定理 12.21:若 \(\hat\theta\) 风险为常数且可容许,则它是 minimax 的。证明:风险 \(=c\),若非 minimax,存在 \(\hat\theta'\) 使 \(R(\theta,\hat\theta')\le\sup_\theta R(\theta,\hat\theta')<\sup_\theta R(\theta,\hat\theta)=c\),则 \(\hat\theta\) 不可容许,矛盾。 定理 12.22:\(X_i\sim N(\theta,1)\),平方损失下 \(\hat\theta=\bar X\) 是 minimax 的(定理 12.14 的受限版本)。证明:由定理 12.20 可容许,风险 \(1/n\) 为常数,用定理 12.21。 minimax 规则不保证可容许,但"接近可容许":若存在规则 \(\hat\theta'\) 与 \(\epsilon>0\) 使 \(R(\theta,\hat\theta')<R(\theta,\hat\theta)-\epsilon\) 对所有 \(\theta\) 成立,称 \(\hat\theta\) 强不可容许(strongly inadmissible)。 定理 12.23:minimax 规则不是强不可容许的。
12.7 Stein 悖论(Stein's Paradox)(PDF p.215)
\(X\sim N(\theta,1)\),平方损失下 \(\hat\theta(X)=X\) 可容许。估计两个不相关的量 \(\theta=(\theta_1,\theta_2)\),\(X_1\sim N(\theta_1,1)\)、\(X_2\sim N(\theta_2,1)\) 独立,损失 \(\sum_{j=1}^2(\hat\theta_j-\theta_j)^2\),\(\hat\theta(X)=X\) 仍可容许。推广到 \(k\) 个正态均值:\(X_i\sim N(\theta_i,1)\) 独立,损失 \(\sum_{j=1}^k(\theta_j-\hat\theta_j)^2\)。Stein 证明了令人震惊的结果:若 \(k\ge3\),\(\hat\theta(X)=X\) 不可容许。James–Stein 估计量 \(\hat\theta^S=(\hat\theta_1^S,\dots,\hat\theta_k^S)\) 风险更小:
12.8 文献注(PDF p.215)
Casella & Berger (2002)、Berger (1985)、Ferguson (1967)、Lehmann & Casella (1998)。
12.9 习题(PDF p.215–216)概览
共 6 题:题 1 平方损失下的贝叶斯风险与贝叶斯估计:(a) Binomial + Beta;(b) Poisson + Gamma;(c) 正态(方差已知)+ 正态。题 2 损失 \((\theta-\hat\theta)^2/\sigma^2\) 下 \(\bar X\) 可容许且 minimax。题 3 有限参数空间下 0-1 损失的贝叶斯估计为后验众数。题 4(Casella & Berger)对形如 \(bS^2\) 的方差估计,在 Stein 损失 \(L(\sigma^2,\hat\sigma^2)=\frac{\hat\sigma^2}{\sigma^2}-1-\log\frac{\hat\sigma^2}{\sigma^2}\) 下求对所有 \(\sigma^2\) 风险最小的 \(b\)。题 5(Berliner 1983)\(X\sim\) Bin\((n,p)\),损失 \(L(p,\hat p)=(1-\hat p/p)^2\),证明 \(\hat p(X)=0\)(落在参数空间之外)是唯一 minimax 规则。题 6(计算机实验)模拟比较 MLE 与 James–Stein 估计量 (12.12) 的风险,尝试不同 \(n\) 与 \(\theta\) 向量。
本章要点
- 决策理论框架:损失函数、风险 \(R(\theta,\hat\theta)=\mathbb E_\theta L\);平方损失下风险即 MSE。
- 风险函数通常交叉,需单数字概括:最大风险(→ minimax)与贝叶斯风险(→ 贝叶斯规则)。
- 贝叶斯规则 = 对每个 \(x\) 最小化后验风险:平方损失取后验均值,绝对损失取后验中位数,0-1 损失取后验众数。
- 常数风险的贝叶斯规则是 minimax(Bernoulli 的 \(\frac{Y+\sqrt{n/4}}{n+\sqrt n}\));正态均值下 \(\bar X\) minimax 且可容许;受限参数空间的 minimax 估计可能是非线性的 \(m\tanh(mX)\)。
- 大样本参数模型中 MLE 近似 minimax 和贝叶斯;高维时失效(多个正态均值)。
- 可容许性是弱要求;全支撑先验的贝叶斯规则可容许;常数风险 + 可容许 ⇒ minimax。
- Stein 悖论:\(k\ge3\) 时同时估计多个正态均值,样本均值不可容许,James–Stein 收缩估计一致更优。
与量化交易的关联
- 损失函数的选择决定最优估计:预测收益时若关心平方误差,用条件均值;若关心绝对误差或对极端值稳健,用条件中位数(分位数回归);VaR 估计对应分位数损失(pinball loss)。交易中不对称损失很常见(低估风险比高估代价大),应按真实损失设计估计量。
- James–Stein 收缩是组合管理中最重要的实用结论之一:同时估计数百只股票的期望收益时,把个股样本均值向截面均值(或 0)收缩可以一致降低总均方误差——Jorion (1986) 的 Bayes–Stein 估计、Ledoit–Wolf 协方差收缩都基于这一思想。习题 6 的模拟非常适合作为教材实验。
- 高维 MLE 失效(例 12.16):\(N\) 只股票、\(T\) 期数据,样本协方差矩阵(MLE)在 \(N\) 接近 \(T\) 时极不稳定,均值-方差优化会放大误差("误差最大化器"),需要收缩、因子结构或正则化。
- Minimax 与稳健优化:minimax 思想对应稳健组合优化——在参数不确定集内最坏情形下优化(robust portfolio optimization),不需要先验;贝叶斯风险对应在先验下平均最优(贝叶斯组合优化)。例 12.5 显示二者可能给出不同偏好。
- 可容许性的提醒:例 12.18 的"永远估计为 3"可容许但无用——策略评价中某些指标上的"不可被严格超越"并不意味着策略好。
推荐习题
- 题 6(James–Stein vs MLE 模拟,必做);题 1(共轭模型的贝叶斯估计);题 4(Stein 损失下方差估计的最优缩放);题 5(minimax 规则的反直觉例子)。
第 III 部分 统计模型与方法(Statistical Models and Methods)(扉页 PDF p.217)
第 13 章 线性与 Logistic 回归(Linear and Logistic Regression)(PDF p.218–220,续见下一块)
引言(PDF p.218)
回归研究响应变量(response variable)\(Y\) 与协变量(covariate)\(X\) 的关系;协变量也称预测变量(predictor variable)或特征(feature)。(脚注:"回归"一词来自 Francis Galton (1822–1911),他注意到高个子和矮个子男性的儿子身高更接近平均值,称为"向均值回归"。)用回归函数概括 \(X\) 与 \(Y\) 的关系:
13.1 简单线性回归(Simple Linear Regression)(PDF p.218–220,本节续见下一块)
最简单情形:\(X_i\) 一维,\(r(x)=\beta_0+\beta_1x\),称简单线性回归模型。进一步简化假设 \(\mathbb V(\epsilon_i\mid X=x)=\sigma^2\) 不依赖 \(x\)(同方差)。 定义 13.1(简单线性回归模型):
(第 13 章其余内容:13.2 最小二乘与最大似然、13.3 最小二乘估计的性质、13.4 预测、13.5 多元回归、13.6 模型选择、13.7 logistic 回归等,以及本章要点、与量化交易的关联、推荐习题,续见下一块。)