量化交易中文教材

精读笔记:Larry Wasserman《All of Statistics: A Concise Course in Statistical Inference》(Springer, 2004;2005 修订二印)|负责范围:PDF 第 1–220 页

页码换算:PDF 页码 = 原书正文页码 + 17(例如原书 p.3 = PDF p.20)。本块覆盖前置部分、第 I 部分(第 1–5 章)、第 II 部分(第 6–12 章全部)以及第 III 部分第 13 章开头(13.1 节至例 13.6 中途,续见下一块)。

前置部分(PDF p.1–19)

  • p.1–6:空白页、Springer Texts in Statistics 丛书目录、书名页("With 95 Figures")、版权页(ISBN 978-1-4419-2322-6,© 2004 Springer)、献词 "To Isa"。
  • p.7–10 前言(Preface):
    • 定位:给想"快速学会概率与统计"的人,适合计算机、数学、统计的研究生或高年级本科生;前提是微积分和一点线性代数,不需要概率统计基础。
    • 作者观点:统计、数据挖掘、机器学习本质上都在"收集并分析数据";两边曾互相轻视,如今彼此承认对方的贡献。"不懂基础统计就用神经网络、boosting、SVM,好比还不会贴创可贴就去做脑外科手术。"
    • 本书特点:①覆盖通常放在后续课程的现代主题(非参数回归、bootstrap、密度估计、图模型);②几乎不讲计数方法;③尽量回避繁琐计算,强调概念;④先讲非参数推断,再讲参数推断;⑤打破"第一学期概率、第二学期统计"的惯例(随机过程例外,放在后面);⑥节奏快、内容多;⑦"严谨不等于清晰",许多结果只陈述不证明,章末文献注指向出处;⑧作者网站提供 R 代码,但书不绑定任何语言。
    • 结构:第 I 部分概率论——"给定数据生成过程(data generating process),结果有何性质?";第 II 部分统计推断——其逆问题"给定结果,关于生成数据的过程能说什么?";预测、分类、聚类、估计都是统计推断的特例。图 1 用双向箭头表示:概率从"数据生成过程"指向"观测数据",推断与数据挖掘方向相反。第 III 部分把第 II 部分用于回归、图模型、因果、密度估计、平滑、分类、模拟,并另含一章随机过程(含马尔可夫链)。
    • 致谢:大量例题、习题改编自 DeGroot & Schervish (2002) 与 Grimmett & Stirzaker (1982)。
  • p.11 统计/数据挖掘术语对照表(Statistics/Data Mining Dictionary),编写教材时可直接作为术语表:
统计学 计算机科学 含义
estimation 估计 learning 学习 用数据估计未知量
classification 分类 supervised learning 监督学习 由 X 预测离散的 Y
clustering 聚类 unsupervised learning 无监督学习 把数据分组
data 数据 training sample 训练样本 \((X_1,Y_1),\dots,(X_n,Y_n)\)
covariates 协变量 features 特征 各 \(X_i\)
classifier 分类器 hypothesis 假设 协变量到结果的映射
hypothesis 假设 — 参数空间 \(\Theta\) 的子集
confidence interval 置信区间 — 以给定频率包含未知量的区间
directed acyclic graph 有向无环图 Bayes net 贝叶斯网 具有给定条件独立关系的多元分布
Bayesian inference 贝叶斯推断 Bayesian inference 用数据更新信念的统计方法
frequentist inference 频率学派推断 — 具有频率保证的统计方法
large deviation bounds 大偏差界 PAC learning PAC 学习 误差概率的一致界
  • p.12–18 目录:全书 24 章,三部分。第 I 部分:1 概率、2 随机变量、3 期望、4 不等式、5 随机变量的收敛。第 II 部分:6 模型、统计推断与学习,7 估计 CDF 与统计泛函,8 Bootstrap,9 参数推断,10 假设检验与 p 值,11 贝叶斯推断,12 统计决策理论。第 III 部分:13 线性与 logistic 回归,14 多元模型,15 独立性推断,16 因果推断,17 有向图与条件独立,18 无向图,19 对数线性模型,20 非参数曲线估计,21 用正交函数平滑,22 分类,23 随机过程,24 模拟方法;最后为索引。
  • p.19:第 I 部分 "Probability" 扉页。

第 I 部分 概率(Probability)

第 1 章 概率(Probability)(PDF p.20–34)

1.1 引言(PDF p.20)

概率是量化不确定性的数学语言。本章从样本空间(所有可能结果的集合)讲起。

1.2 样本空间与事件(Sample Spaces and Events)(PDF p.20–22)

定义:样本空间(sample space)\(\Omega\) 是某个试验所有可能结果的集合;\(\Omega\) 中的点 \(\omega\) 称为样本结果(sample outcome)、实现(realization)或元素;\(\Omega\) 的子集称为事件(event)。

例 1.1:掷硬币两次,\(\Omega=\{HH,HT,TH,TT\}\),"第一次为正面"的事件 \(A=\{HH,HT\}\)。 例 1.2:测量温度,取 \(\Omega=\mathbb R=(-\infty,\infty)\)。虽然温度有下界,但把样本空间取得比必要更大通常无害。事件"测量值大于 10 且不超过 23"为 \(A=(10,23]\)。 例 1.3:无限次掷硬币,\(\Omega=\{\omega=(\omega_1,\omega_2,\dots):\omega_i\in\{H,T\}\}\);"第一次正面出现在第三次"的事件 \(E=\{\omega:\omega_1=T,\omega_2=T,\omega_3=H,\ \omega_i\in\{H,T\},i>3\}\)。

集合运算:

  • 补集(complement)\(A^c=\{\omega\in\Omega:\omega\notin A\}\),读作"非 A";\(\Omega^c=\emptyset\)。
  • 并 \(A\cup B\)("A 或 B");可列并 \(\bigcup_{i=1}^\infty A_i=\{\omega:\omega\in A_i \text{ 对至少一个 } i\}\)。
  • 交 \(A\cap B\)("A 且 B"),也写 \(AB\) 或 \((A,B)\);可列交 \(\bigcap_{i=1}^\infty A_i=\{\omega:\omega\in A_i\ \forall i\}\)。
  • 差 \(A-B=\{\omega:\omega\in A,\omega\notin B\}\);包含 \(A\subset B\);\(|A|\) 表示有限集 \(A\) 的元素个数。
  • 术语表:\(\emptyset\) 为不可能事件(null event,总为假),\(\Omega\) 为必然事件(true event,总为真)。

互斥与划分:若 \(i\ne j\) 时 \(A_i\cap A_j=\emptyset\),称 \(A_1,A_2,\dots\) 不相交(disjoint)或互斥(mutually exclusive),例如 \([0,1),[1,2),[2,3),\dots\)。若互斥且 \(\bigcup A_i=\Omega\),则称为 \(\Omega\) 的一个划分(partition)。

示性函数(indicator function):\(I_A(\omega)=1\)(若 \(\omega\in A\)),否则为 0。

单调序列:若 \(A_1\subset A_2\subset\cdots\) 称单调递增,定义 \(\lim A_n=\bigcup_{i}A_i\);若 \(A_1\supset A_2\supset\cdots\) 称单调递减,定义 \(\lim A_n=\bigcap_i A_i\)。两种情形都记 \(A_n\to A\)。

例 1.4:\(\Omega=\mathbb R\),\(A_i=[0,1/i)\),则 \(\bigcup A_i=[0,1)\),\(\bigcap A_i=\{0\}\);若改为 \(A_i=(0,1/i)\),则 \(\bigcup A_i=(0,1)\),\(\bigcap A_i=\emptyset\)。(提示教材:开闭端点决定极限集合是否为空。)

1.3 概率(Probability)(PDF p.22–24)

定义 1.5(概率公理):函数 \(\mathbb P\) 对每个事件 \(A\) 赋予实数 \(\mathbb P(A)\),若满足以下三条公理,则称为概率分布(probability distribution)或概率测度(probability measure):

  1. \(\mathbb P(A)\ge 0\);
  2. \(\mathbb P(\Omega)=1\);
  3. 可列可加性:若 \(A_1,A_2,\dots\) 互斥,则 \(\mathbb P\left(\bigcup_{i=1}^\infty A_i\right)=\sum_{i=1}^\infty \mathbb P(A_i)\)。

脚注:样本空间很大(如整条实轴)时,不可能对每个子集都赋概率,只能对一类称为 σ-域(σ-field)的集合赋值,见附录。

两种解释:频率解释——\(\mathbb P(A)\) 是重复试验中 \(A\) 发生的长期比例("无限长、不可预测、极限比例趋于常数"的序列是一种理想化,如几何中的直线);信念度解释——观察者对 \(A\) 为真的信念强度。两种解释都要求满足公理;差别要到统计推断时才显现,引出频率学派与贝叶斯学派(第 11 章讨论)。

由公理推出的性质 (1.1):\(\mathbb P(\emptyset)=0\);\(A\subset B\Rightarrow \mathbb P(A)\le\mathbb P(B)\);\(0\le\mathbb P(A)\le1\);\(\mathbb P(A^c)=1-\mathbb P(A)\);\(A\cap B=\emptyset\Rightarrow\mathbb P(A\cup B)=\mathbb P(A)+\mathbb P(B)\)。

引理 1.6(加法公式):\(\mathbb P(A\cup B)=\mathbb P(A)+\mathbb P(B)-\mathbb P(AB)\)。 证明思路:把 \(A\cup B\) 写成三个互斥事件之并 \((AB^c)\cup(AB)\cup(A^cB)\),用可加性得 \(\mathbb P(AB^c)+\mathbb P(AB)+\mathbb P(A^cB)\),再加减一次 \(\mathbb P(AB)\),凑成 \(\mathbb P(A)+\mathbb P(B)-\mathbb P(AB)\)。

例 1.7:两次掷硬币,\(H_1,H_2\) 分别为第 1、2 次正面。若四个结果等可能,\(\mathbb P(H_1\cup H_2)=\mathbb P(H_1)+\mathbb P(H_2)-\mathbb P(H_1H_2)=\tfrac12+\tfrac12-\tfrac14=\tfrac34\)。

定理 1.8(概率的连续性,Continuity of Probabilities):若 \(A_n\to A\),则 \(\mathbb P(A_n)\to\mathbb P(A)\)(\(n\to\infty\))。 证明(递增情形):令 \(B_1=A_1\),\(B_2=A_2\setminus A_1\),\(B_3=A_3\setminus(A_1\cup A_2)\),…;可证 \(B_i\) 互斥,\(A_n=\bigcup_{i\le n}A_i=\bigcup_{i\le n}B_i\),且 \(\bigcup_i B_i=\bigcup_i A_i\)(习题 1)。由公理 3,\(\mathbb P(A_n)=\sum_{i=1}^n\mathbb P(B_i)\),于是 \(\lim_n\mathbb P(A_n)=\sum_{i=1}^\infty\mathbb P(B_i)=\mathbb P(\bigcup B_i)=\mathbb P(A)\)。递减情形取补集即可(习题 1)。

1.4 有限样本空间上的概率(Probability on Finite Sample Spaces)(PDF p.24–25)

\(\Omega=\{\omega_1,\dots,\omega_n\}\) 有限且每个结果等可能时,\(\mathbb P(A)=|A|/|\Omega|\),称为均匀概率分布(uniform probability distribution)。例:掷骰子两次,\(|\Omega|=36\),"点数和为 11"包含 (5,6),(6,5),概率 \(2/36\)。

计算需要计数(combinatorial methods),本书只用少量事实:\(n\) 个对象的排列数 \(n!=n(n-1)\cdots1\),约定 \(0!=1\);二项式系数

\[\binom nk=\frac{n!}{k!(n-k)!}\tag{1.2}\]
表示从 \(n\) 个对象中选 \(k\) 个的不同方式数。例:20 人中选 3 人委员会,\(\binom{20}{3}=\frac{20\times19\times18}{3\times2\times1}=1140\)。性质:\(\binom n0=\binom nn=1\),\(\binom nk=\binom n{n-k}\)。

1.5 独立事件(Independent Events)(PDF p.25–27)

定义 1.9:若 \(\mathbb P(AB)=\mathbb P(A)\mathbb P(B)\) (1.3),称 \(A,B\) 独立,记 \(A\perp\!\!\!\perp B\)。一族事件 \(\{A_i:i\in I\}\) 独立,指对 \(I\) 的每个有限子集 \(J\) 都有 \(\mathbb P(\bigcap_{i\in J}A_i)=\prod_{i\in J}\mathbb P(A_i)\)。不独立记作 \(A\not\!\perp\!\!\!\perp B\)。

独立性的两种来源:一是假设(掷硬币两次时假设硬币"没有记忆");二是验证推出。例:掷公平骰子,\(A=\{2,4,6\}\),\(B=\{1,2,3,4\}\),\(AB=\{2,4\}\),\(\mathbb P(AB)=2/6=(1/2)(2/3)\),故独立——这不是假设出来的,而是"恰好"成立。

常见误区:互斥且各自概率为正的事件不可能独立,因为 \(\mathbb P(A)\mathbb P(B)>0\) 而 \(\mathbb P(AB)=0\)。除此特殊情形外,无法从维恩图看出是否独立。

例 1.10:公平硬币掷 10 次,\(A\)="至少一次正面",\(\mathbb P(A)=1-\mathbb P(\text{全为反面})=1-\prod_{j=1}^{10}\mathbb P(T_j)=1-(1/2)^{10}\approx .999\)。

例 1.11(轮流投篮):甲命中率 1/3,乙 1/4,甲先投,轮流进行。令 \(A_j\) 为"首次命中者是甲且发生在第 \(j\) 轮",互斥。\(\mathbb P(A_1)=1/3\),\(\mathbb P(A_2)=(2/3)(3/4)(1/3)=(1/2)(1/3)\),一般 \(\mathbb P(A_j)=(1/2)^{j-1}(1/3)\)。于是

\[\mathbb P(E)=\frac13\sum_{j=1}^\infty\left(\frac12\right)^{j-1}=\frac23.\]
用到几何级数 \(\sum_{j=k}^\infty r^j=r^k/(1-r)\)(\(0<r<1\))。

独立性小结:①\(A,B\) 独立当且仅当 \(\mathbb P(AB)=\mathbb P(A)\mathbb P(B)\);②独立性有时是假设、有时是推出;③概率为正的互斥事件不独立。

1.6 条件概率(Conditional Probability)(PDF p.27–29)

定义 1.12:若 \(\mathbb P(B)>0\),给定 \(B\) 时 \(A\) 的条件概率为

\[\mathbb P(A\mid B)=\frac{\mathbb P(AB)}{\mathbb P(B)}.\tag{1.4}\]
直观:在 \(B\) 发生的那些情形中 \(A\) 发生的比例。对固定的 \(B\),\(\mathbb P(\cdot\mid B)\) 满足三条公理(是概率);但一般 \(\mathbb P(A\mid B\cup C)\ne\mathbb P(A\mid B)+\mathbb P(A\mid C)\)——概率规则只适用于竖线左边的事件。

常见误区:一般 \(\mathbb P(A\mid B)\ne\mathbb P(B\mid A)\)。例:出麻疹则出疹子的概率为 1,但出疹子则得麻疹的概率不是 1。法律案件中常犯此错,称为"检察官谬误"(prosecutor's fallacy)。

例 1.13(医学检测):联合概率表:\(\mathbb P(D,+)=.009\),\(\mathbb P(D,-)=.001\),\(\mathbb P(D^c,+)=.099\),\(\mathbb P(D^c,-)=.891\)。

  • 灵敏度 \(\mathbb P(+\mid D)=.009/(.009+.001)=.9\);特异度 \(\mathbb P(-\mid D^c)=.891/(.891+.099)\approx .9\),检测看似相当准确。
  • 但检测阳性者患病概率 \(\mathbb P(D\mid +)=.009/(.009+.099)\approx .08\),多数人会错答 .90。教训:"必须用数字算,别相信直觉。"(根源是患病率仅 1%,基率很低。)

引理 1.14:若 \(A,B\) 独立,则 \(\mathbb P(A\mid B)=\mathbb P(A)\);对任意 \(A,B\),\(\mathbb P(AB)=\mathbb P(A\mid B)\mathbb P(B)=\mathbb P(B\mid A)\mathbb P(A)\)(乘法公式)。由此,独立的另一种理解是"知道 \(B\) 不改变 \(A\) 的概率"。

例 1.15:不放回抽两张牌,\(A\)=第一张是梅花 A,\(B\)=第二张是方块 Q,\(\mathbb P(AB)=\mathbb P(A)\mathbb P(B\mid A)=(1/52)(1/51)\)。

条件概率小结:①定义;②固定 \(B\) 时 \(\mathbb P(\cdot\mid B)\) 满足公理,但固定 \(A\) 时 \(\mathbb P(A\mid\cdot)\) 一般不满足;③一般 \(\mathbb P(A\mid B)\ne\mathbb P(B\mid A)\);④\(A,B\) 独立当且仅当 \(\mathbb P(A\mid B)=\mathbb P(A)\)。

1.7 贝叶斯定理(Bayes' Theorem)(PDF p.29–30)

贝叶斯定理是"专家系统"和"贝叶斯网"(第 17 章)的基础。

定理 1.16(全概率公式,Law of Total Probability):\(A_1,\dots,A_k\) 是 \(\Omega\) 的划分,则对任意事件 \(B\),

\[\mathbb P(B)=\sum_{i=1}^k\mathbb P(B\mid A_i)\mathbb P(A_i).\]
证明:令 \(C_j=BA_j\),它们互斥且 \(B=\bigcup_j C_j\),故 \(\mathbb P(B)=\sum_j\mathbb P(BA_j)=\sum_j\mathbb P(B\mid A_j)\mathbb P(A_j)\)。

定理 1.17(贝叶斯定理):\(A_1,\dots,A_k\) 为划分且 \(\mathbb P(A_i)>0\),若 \(\mathbb P(B)>0\),则

\[\mathbb P(A_i\mid B)=\frac{\mathbb P(B\mid A_i)\mathbb P(A_i)}{\sum_j\mathbb P(B\mid A_j)\mathbb P(A_j)}.\tag{1.5}\]
注 1.18:\(\mathbb P(A_i)\) 称为先验概率(prior probability),\(\mathbb P(A_i\mid B)\) 称为后验概率(posterior probability)。证明:两次使用条件概率定义,再用全概率公式展开分母:\(\mathbb P(A_i\mid B)=\mathbb P(A_iB)/\mathbb P(B)=\mathbb P(B\mid A_i)\mathbb P(A_i)/\sum_j\mathbb P(B\mid A_j)\mathbb P(A_j)\)。

例 1.19(垃圾邮件过滤):邮件分三类:\(A_1\) 垃圾 (.7)、\(A_2\) 低优先级 (.2)、\(A_3\) 高优先级 (.1)。\(B\)=含单词 "free",\(\mathbb P(B\mid A_1)=.9\),\(\mathbb P(B\mid A_2)=.01\),\(\mathbb P(B\mid A_3)=.01\)(注意 .9+.01+.01≠1,似然不必和为 1)。

\[\mathbb P(A_1\mid B)=\frac{.9\times.7}{.9\times.7+.01\times.2+.01\times.1}=.995.\]

1.8 文献注(PDF p.30)

入门:DeGroot & Schervish (2002);中级:Grimmett & Stirzaker (1982)、Karr (1993);高级:Billingsley (1979)、Breiman (1992)。

1.9 附录:σ-域(PDF p.30)

一般无法对 \(\Omega\) 的所有子集赋概率,只考虑 σ-代数(σ-algebra / σ-field)\(\mathcal A\):(i) \(\emptyset\in\mathcal A\);(ii) \(A_1,A_2,\dots\in\mathcal A\Rightarrow\bigcup A_i\in\mathcal A\);(iii) \(A\in\mathcal A\Rightarrow A^c\in\mathcal A\)。\(\mathcal A\) 中的集合称为可测的(measurable),\((\Omega,\mathcal A)\) 为可测空间,加上定义在 \(\mathcal A\) 上的概率测度得概率空间(probability space)\((\Omega,\mathcal A,\mathbb P)\)。\(\Omega=\mathbb R\) 时取包含所有开集的最小 σ-域,称 Borel σ-域。

1.10 习题(PDF p.30–34)概览

共 23 题:

  • 证明类(1–4、7–9、11、14、16–18):补全定理 1.8 证明及递减情形;证明 (1.1);上极限/下极限集合(题 3:\(B_n=\bigcup_{i\ge n}A_i\) 递减、\(C_n=\bigcap_{i\ge n}A_i\) 递增,\(\omega\in\bigcap B_n\) 当且仅当 \(\omega\) 属于无穷多个 \(A_i\),\(\omega\in\bigcup C_n\) 当且仅当 \(\omega\) 至多不属于有限个 \(A_i\));德摩根律对任意指标集成立(题 4);次可加性 \(\mathbb P(\bigcup A_n)\le\sum\mathbb P(A_n)\)(题 7,提示令 \(B_n=A_n-\bigcup_{i<n}A_i\));\(\mathbb P(A_i)=1\ \forall i\Rightarrow\mathbb P(\bigcap A_i)=1\)(题 8);\(A,B\) 独立则 \(A^c,B^c\) 独立(题 11);概率为 0 或 1 的事件与任何事件独立、与自身独立则概率为 0 或 1(题 14);链式法则 \(\mathbb P(ABC)=\mathbb P(A\mid BC)\mathbb P(B\mid C)\mathbb P(C)\)(题 17);划分中若 \(\mathbb P(A_1\mid B)<\mathbb P(A_1)\) 则必有某个 \(A_i\) 后验上升(题 18)。
  • 计算类:掷硬币直至两次正面所需次数(题 5);可数集 \(\{0,1,\dots\}\) 上不存在均匀分布(题 6);蒙提霍尔问题(题 10,应换门,换门胜率 2/3,取 \(\Omega=\{(\omega_1,\omega_2)\}\));三张卡片问题(题 12,答案 2/3);直到正反面都出现(题 13);三个孩子蓝眼睛的条件概率(题 15);电脑病毒的贝叶斯计算(题 19:Mac 30%/Windows 50%/Linux 20%,感染率 65%/82%/50%);五枚硬币的后验与预测(题 20,含"直到首次正面出现于第 4 次"的后验)。
  • 计算机实验(21–23):模拟正面比例随 \(n\) 收敛(p=.3、.03);二项变量均值与 \(np\) 比较;模拟验证独立与不独立事件。

本章要点

  1. 概率建立在样本空间、事件(σ-域中的集合)与三条公理之上;所有常用性质(补集、单调性、加法公式、连续性)都由公理推出。
  2. 独立性是乘积条件 \(\mathbb P(AB)=\mathbb P(A)\mathbb P(B)\);互斥与独立是两回事,概率为正的互斥事件必不独立。
  3. 条件概率把"已知信息"转化为新的概率测度;\(\mathbb P(A\mid B)\) 与 \(\mathbb P(B\mid A)\) 混淆是最常见错误(检察官谬误、基率忽视)。
  4. 全概率公式与贝叶斯定理给出由先验到后验的更新规则,例 1.13 和 1.19 是标准教学案例。

与量化交易的关联

  • 贝叶斯更新与基率:例 1.13 的逻辑直接对应"信号的条件胜率"。一个历史上 90% 准确的崩盘预警指标,若崩盘本身很罕见,触发后真正崩盘的概率可能很低;评估择时信号、异常检测告警、风控触发器时必须同时看基率。
  • 市场状态(regime)识别:全概率公式把收益分布分解为各市场状态下条件分布的加权和;贝叶斯定理用于根据新观测更新"当前处于牛/熊/震荡"的后验概率(是 HMM 滤波的单步形式)。
  • 独立性假设:多策略组合、多笔订单成交、违约事件常被假设独立,例 1.10 那种 \(1-(1-p)^n\) 计算在独立假设下成立,但金融事件在压力期高度相关,独立假设会严重低估联合尾部风险。
  • 多重尝试:例 1.10 的思路也说明为何大量回测试验中"至少一个策略看起来显著"几乎必然发生,是第 10 章多重检验的伏笔。

推荐习题

  • 题 3(上/下极限集合,为第 5 章几乎必然收敛打基础);题 7(次可加性,即 Bonferroni 不等式的来源);题 10(蒙提霍尔,训练严格写样本空间);题 12、15、19、20(条件概率与贝叶斯计算,题 20(b)(c) 涉及后验预测);题 21–23(模拟验证大数律和独立性,适合配合 Python 编写)。

第 2 章 随机变量(Random Variables)(PDF p.35–62)

2.1 引言(PDF p.35–36)

统计与数据挖掘处理的是数据;把样本空间、事件与数据联系起来的是随机变量。

定义 2.1:随机变量(random variable)是映射 \(X:\Omega\to\mathbb R\),对每个结果 \(\omega\) 赋予实数 \(X(\omega)\)(严格说须可测,见附录)。多数课程到某个阶段便不再提样本空间,直接操作随机变量,但要记住样本空间"一直潜伏在背后"。

例 2.2:掷硬币 10 次,\(X(\omega)\)=正面次数,若 \(\omega=HHTHHTHHTT\),则 \(X(\omega)=6\)。 例 2.3:\(\Omega\)=单位圆盘 \(\{(x,y):x^2+y^2\le1\}\),随机取点 \(\omega=(x,y)\),则 \(X(\omega)=x\)、\(Y(\omega)=y\)、\(Z=x+y\)、\(W=\sqrt{x^2+y^2}\) 都是随机变量。

记号:对实轴子集 \(A\),\(X^{-1}(A)=\{\omega:X(\omega)\in A\}\),\(\mathbb P(X\in A)=\mathbb P(X^{-1}(A))\),\(\mathbb P(X=x)=\mathbb P(\{\omega:X(\omega)=x\})\)。大写 \(X\) 表示随机变量,小写 \(x\) 表示其取值。

例 2.4:掷硬币两次,\(X\)=正面数。\(\mathbb P(X=0)=\mathbb P(\{TT\})=1/4\),\(\mathbb P(X=1)=\mathbb P(\{HT,TH\})=1/2\),\(\mathbb P(X=2)=1/4\)。表格列出四个结果各概率 1/4 及对应 \(X\) 值 0,1,1,2。

2.2 分布函数与概率函数(Distribution Functions and Probability Functions)(PDF p.36–41)

定义 2.5:累积分布函数(cumulative distribution function, CDF)\(F_X:\mathbb R\to[0,1]\),

\[F_X(x)=\mathbb P(X\le x).\tag{2.1}\]

例 2.6:上例的 CDF 为分段阶梯函数:\(x<0\) 时 0;\(0\le x<1\) 时 1/4;\(1\le x<2\) 时 3/4;\(x\ge2\) 时 1(图 2.1)。作者强调要仔细研究:CDF 右连续、非降,且对所有实数 \(x\) 都有定义(尽管 \(X\) 只取 0,1,2),例如 \(F_X(1.4)=.75\)。

定理 2.7:若 \(X\) 的 CDF \(F\) 与 \(Y\) 的 CDF \(G\) 处处相等,则对所有(可测)\(A\),\(\mathbb P(X\in A)=\mathbb P(Y\in A)\)——CDF 完全决定分布。

定理 2.8(CDF 的刻画):函数 \(F:\mathbb R\to[0,1]\) 是某个概率的 CDF 当且仅当:(i) 非降;(ii) 规范化:\(\lim_{x\to-\infty}F(x)=0\),\(\lim_{x\to\infty}F(x)=1\);(iii) 右连续:\(F(x)=F(x^+)=\lim_{y\downarrow x}F(y)\)。 证明 (iii):取 \(y_1>y_2>\cdots\downarrow x\),\(A_i=(-\infty,y_i]\) 单调递减,\(\bigcap A_i=(-\infty,x]\),由概率连续性(定理 1.8)\(F(x)=\mathbb P(\bigcap A_i)=\lim\mathbb P(A_i)=\lim F(y_i)=F(x^+)\)。(i)(ii) 类似;反方向(满足三条件必为某随机变量 CDF)需要较深的分析工具。

定义 2.9(离散型):\(X\) 取可数(countable,有限或可与整数一一对应;偶数、奇数、有理数可数,\((0,1)\) 中实数不可数)个值 \(\{x_1,x_2,\dots\}\),称为离散型。概率函数或概率质量函数(probability mass function, PMF)\(f_X(x)=\mathbb P(X=x)\),满足 \(f_X(x)\ge0\),\(\sum_i f_X(x_i)=1\),且 \(F_X(x)=\sum_{x_i\le x}f_X(x_i)\)。 例 2.10:上例 PMF:\(f(0)=1/4,f(1)=1/2,f(2)=1/4\)(图 2.2)。

定义 2.11(连续型):若存在 \(f_X\ge0\),\(\int_{-\infty}^\infty f_X=1\),且对任意 \(a\le b\),

\[\mathbb P(a<X<b)=\int_a^b f_X(x)\,dx,\tag{2.2}\]
则 \(X\) 是连续型,\(f_X\) 称为概率密度函数(probability density function, PDF)。\(F_X(x)=\int_{-\infty}^x f_X(t)dt\),且在 \(F_X\) 可微处 \(f_X=F_X'\)。

例 2.12:\(f_X(x)=1\)(\(0<x<1\)),即 Uniform(0,1),刻画"在 0 与 1 之间随机取点";CDF 为 \(0\)(\(x<0\))、\(x\)(\(0\le x\le1\))、\(1\)(\(x>1\))(图 2.3)。 例 2.13:\(f(x)=1/(1+x)^2\)(\(x\ge0\)),积分为 1,是合法 PDF。 例 2.14:\(f(x)=1/(1+x)\)(\(x\ge0\))不是 PDF,因为 \(\int_0^\infty dx/(1+x)=\int_1^\infty du/u=\infty\)。

警告(常见误区):连续型 \(X\) 对每个 \(x\) 有 \(\mathbb P(X=x)=0\),不要把 \(f(x)\) 当成 \(\mathbb P(X=x)\)(只有离散型才如此);概率要靠积分得到。PDF 可以大于 1:\(f(x)=5\)(\(x\in[0,1/5]\))是合法 PDF;甚至可以无界:\(f(x)=(2/3)x^{-1/3}\)(\(0<x<1\))积分为 1。

引理 2.15:设 \(F\) 为 \(X\) 的 CDF,则

  1. \(\mathbb P(X=x)=F(x)-F(x^-)\),\(F(x^-)=\lim_{y\uparrow x}F(y)\);
  2. \(\mathbb P(x<X\le y)=F(y)-F(x)\);
  3. \(\mathbb P(X>x)=1-F(x)\);
  4. 若 \(X\) 连续,则 \(F(b)-F(a)=\mathbb P(a<X<b)=\mathbb P(a\le X<b)=\mathbb P(a<X\le b)=\mathbb P(a\le X\le b)\)。

定义 2.16(分位数函数):逆 CDF(inverse CDF)或分位数函数(quantile function)

\[F^{-1}(q)=\inf\{x:F(x)>q\},\quad q\in[0,1].\]
(不熟悉 inf 可以理解为最小值。)若 \(F\) 严格递增且连续,\(F^{-1}(q)\) 就是满足 \(F(x)=q\) 的唯一实数。\(F^{-1}(1/4)\) 为第一四分位数(first quartile),\(F^{-1}(1/2)\) 为中位数(median),\(F^{-1}(3/4)\) 为第三四分位数。 (编者注:一些教材用 \(\inf\{x:F(x)\ge q\}\),本书原文写的是 \(>q\),教材中可统一采用 \(\ge\) 的常见版本并加注。)

同分布(equal in distribution):若 \(F_X(x)=F_Y(x)\) 对所有 \(x\) 成立,记 \(X\overset d=Y\)。这不意味着 \(X=Y\),只是关于两者的所有概率陈述相同。例:\(\mathbb P(X=1)=\mathbb P(X=-1)=1/2\),\(Y=-X\),则 \(X\overset d=Y\),但 \(\mathbb P(X=Y)=0\)。

2.3 若干重要离散随机变量(Some Important Discrete Random Variables)(PDF p.41–43)

记号警告:传统上写 \(X\sim F\) 表示"\(X\) 服从分布 \(F\)",不要读成"\(X\) 近似为 \(F\)"。

  • 点质量分布(point mass)\(X\sim\delta_a\):\(\mathbb P(X=a)=1\),\(F(x)=0\)(\(x<a\))、\(1\)(\(x\ge a\))。
  • 离散均匀分布:整数 \(k>1\),\(f(x)=1/k\),\(x=1,\dots,k\)。
  • 伯努利分布 \(X\sim\text{Bernoulli}(p)\):\(\mathbb P(X=1)=p\),\(\mathbb P(X=0)=1-p\),\(f(x)=p^x(1-p)^{1-x}\),\(x\in\{0,1\}\)。
  • 二项分布 \(X\sim\text{Binomial}(n,p)\):独立掷 \(n\) 次正面概率为 \(p\) 的硬币,正面次数 \(X\),
    \[f(x)=\binom nx p^x(1-p)^{n-x},\quad x=0,\dots,n.\]
    可加性:\(X_1\sim\text{Bin}(n_1,p)\)、\(X_2\sim\text{Bin}(n_2,p)\)(独立)则 \(X_1+X_2\sim\text{Bin}(n_1+n_2,p)\)。
  • 警告(随机变量 vs 参数):\(X\) 是随机变量,\(x\) 是其取值,\(n,p\) 是参数(固定实数)。参数 \(p\) 通常未知,需要从数据估计——"这正是统计推断要做的事"。
  • 几何分布 \(X\sim\text{Geom}(p)\),\(p\in(0,1)\):\(\mathbb P(X=k)=p(1-p)^{k-1}\),\(k\ge1\);\(\sum_{k\ge1}\mathbb P(X=k)=p\sum_{k\ge1}(1-p)^{k-1}=p/(1-(1-p))=1\)。理解为掷到第一次正面所需次数。
  • 泊松分布 \(X\sim\text{Poisson}(\lambda)\):\(f(x)=e^{-\lambda}\lambda^x/x!\),\(x\ge0\);\(\sum_x f(x)=e^{-\lambda}e^{\lambda}=1\)。常用于建模稀有事件计数(放射性衰变、交通事故)。可加性:独立 \(\text{Poisson}(\lambda_1)+\text{Poisson}(\lambda_2)\sim\text{Poisson}(\lambda_1+\lambda_2)\)。

警告(样本空间去哪了):上述分布都未提样本空间,但它仍在背后。显式构造伯努利变量:\(\Omega=[0,1]\),\(\mathbb P([a,b])=b-a\);固定 \(p\),令 \(X(\omega)=1\)(\(\omega\le p\))、\(0\)(\(\omega>p\)),则 \(\mathbb P(X=1)=\mathbb P([0,p])=p\)。实际中把随机变量看作"随机数",形式上它是定义在样本空间上的映射。(此构造正是计算机用均匀随机数生成伯努利样本的方法。)

2.4 若干重要连续随机变量(Some Important Continuous Random Variables)(PDF p.43–46)

  • 均匀分布 \(X\sim\text{Uniform}(a,b)\)(\(a<b\)):\(f(x)=1/(b-a)\),\(x\in[a,b]\);\(F(x)=0\)(\(x<a\))、\((x-a)/(b-a)\)(\(x\in[a,b]\))、\(1\)(\(x>b\))。
  • 正态(高斯)分布 \(X\sim N(\mu,\sigma^2)\):
    \[f(x)=\frac1{\sigma\sqrt{2\pi}}\exp\left\{-\frac{(x-\mu)^2}{2\sigma^2}\right\},\quad x\in\mathbb R,\tag{2.3}\]
    \(\mu\in\mathbb R\) 为"中心"(均值),\(\sigma>0\) 为"散布"(标准差)。许多自然现象近似正态;中心极限定理说随机变量之和的分布可用正态近似。标准正态 \(\mu=0,\sigma=1\),传统上记为 \(Z\),PDF/CDF 记 \(\phi(z)\)、\(\Phi(z)\);\(\Phi\) 无闭式表达。有用的事实: (i) \(X\sim N(\mu,\sigma^2)\Rightarrow Z=(X-\mu)/\sigma\sim N(0,1)\); (ii) \(Z\sim N(0,1)\Rightarrow X=\mu+\sigma Z\sim N(\mu,\sigma^2)\); (iii) 独立 \(X_i\sim N(\mu_i,\sigma_i^2)\),则 \(\sum X_i\sim N(\sum\mu_i,\sum\sigma_i^2)\)。 由 (i),\(\mathbb P(a<X<b)=\Phi\!\left(\frac{b-\mu}\sigma\right)-\Phi\!\left(\frac{a-\mu}\sigma\right)\),只要能算 \(\Phi\) 就能算任何概率。
  • 例 2.17:\(X\sim N(3,5)\)(方差 5)。\(\mathbb P(X>1)=1-\Phi\!\left(\frac{1-3}{\sqrt5}\right)=1-\Phi(-0.8944)=0.81\)。求 \(q\) 使 \(\mathbb P(X<q)=0.2\):查表 \(\Phi(-0.8416)=0.2\),故 \((q-3)/\sqrt5=-0.8416\),\(q=3-0.8416\sqrt5=1.1181\)。
  • 指数分布 \(X\sim\text{Exp}(\beta)\):\(f(x)=\frac1\beta e^{-x/\beta}\),\(x>0\),\(\beta>0\)(注意本书用尺度参数 \(\beta\),均值为 \(\beta\))。用于电子元件寿命、稀有事件间的等待时间。
  • Gamma 分布:Gamma 函数 \(\Gamma(\alpha)=\int_0^\infty y^{\alpha-1}e^{-y}dy\)。\(X\sim\text{Gamma}(\alpha,\beta)\):
    \[f(x)=\frac{1}{\beta^\alpha\Gamma(\alpha)}x^{\alpha-1}e^{-x/\beta},\quad x>0.\]
    指数分布即 Gamma\((1,\beta)\)。独立 \(X_i\sim\text{Gamma}(\alpha_i,\beta)\) 则 \(\sum X_i\sim\text{Gamma}(\sum\alpha_i,\beta)\)。
  • Beta 分布 \(X\sim\text{Beta}(\alpha,\beta)\):\(f(x)=\frac{\Gamma(\alpha+\beta)}{\Gamma(\alpha)\Gamma(\beta)}x^{\alpha-1}(1-x)^{\beta-1}\),\(0<x<1\)。
  • t 分布与柯西分布:\(X\sim t_\nu\)(自由度 \(\nu\)):
    \[f(x)=\frac{\Gamma\left(\frac{\nu+1}2\right)}{\sqrt{\nu\pi}\,\Gamma\left(\frac\nu2\right)}\frac{1}{\left(1+\frac{x^2}\nu\right)^{(\nu+1)/2}}.\]
    与正态相似但尾部更厚(thicker tails);\(\nu=\infty\) 对应正态。柯西分布(Cauchy)是 \(\nu=1\) 的特例:\(f(x)=\frac1{\pi(1+x^2)}\)。验证:\(\int f=\frac1\pi[\tan^{-1}(\infty)-\tan^{-1}(-\infty)]=\frac1\pi[\frac\pi2+\frac\pi2]=1\)。
  • 卡方分布 \(X\sim\chi^2_p\):\(f(x)=\frac{1}{\Gamma(p/2)2^{p/2}}x^{p/2-1}e^{-x/2}\),\(x>0\)。若 \(Z_1,\dots,Z_p\) 独立标准正态,则 \(\sum Z_i^2\sim\chi^2_p\)。

2.5 二元分布(Bivariate Distributions)(PDF p.47–49)

离散情形:联合质量函数 \(f(x,y)=\mathbb P(X=x,Y=y)\),必要时写 \(f_{X,Y}\)。 例 2.18:\(X,Y\in\{0,1\}\),\(f(0,0)=1/9\),\(f(0,1)=2/9\),\(f(1,0)=2/9\),\(f(1,1)=4/9\);行和 1/3、2/3,列和 1/3、2/3。

定义 2.19:连续情形,函数 \(f(x,y)\) 是 \((X,Y)\) 的 PDF,若 (i) \(f\ge0\);(ii) \(\iint f=1\);(iii) 对任意 \(A\subset\mathbb R^2\),\(\mathbb P((X,Y)\in A)=\iint_A f(x,y)dxdy\)。联合 CDF:\(F_{X,Y}(x,y)=\mathbb P(X\le x,Y\le y)\)。

例 2.20:单位正方形上均匀,\(\mathbb P(X<1/2,Y<1/2)\)=对应区域面积=1/4。 例 2.21:\(f(x,y)=x+y\)(单位正方形),\(\int_0^1\int_0^1(x+y)dxdy=\frac12+\frac12=1\),是合法 PDF。 例 2.22(非矩形区域,取自 DeGroot & Schervish):\(f(x,y)=cx^2y\),\(x^2\le y\le1\)(于是 \(-1\le x\le1\))。技巧:先让 \(x\) 取遍其范围,对每个固定 \(x\) 让 \(y\) 在 \([x^2,1]\) 内变化(图 2.5)。\(1=c\int_{-1}^1x^2\int_{x^2}^1y\,dy\,dx=c\int_{-1}^1x^2\frac{1-x^4}2dx=\frac{4c}{21}\),故 \(c=21/4\)。\(\mathbb P(X\ge Y)\) 对应 \(A=\{0\le x\le1,x^2\le y\le x\}\):\(\frac{21}4\int_0^1x^2\int_{x^2}^xy\,dy\,dx=\frac{21}4\int_0^1x^2\frac{x^2-x^4}2dx=\frac3{20}\)。

2.6 边缘分布(Marginal Distributions)(PDF p.49–50)

定义 2.23:离散情形边缘质量函数 \(f_X(x)=\sum_yf(x,y)\) (2.4),\(f_Y(y)=\sum_xf(x,y)\) (2.5)。 例 2.24:表 \(f(0,0)=1/10,f(0,1)=2/10,f(1,0)=3/10,f(1,1)=4/10\),\(X\) 的边缘为行和:\(f_X(0)=3/10\),\(f_X(1)=7/10\);\(Y\) 的边缘为列和 4/10、6/10。

定义 2.25:连续情形边缘密度 \(f_X(x)=\int f(x,y)dy\),\(f_Y(y)=\int f(x,y)dx\) (2.6);对应边缘 CDF 记 \(F_X,F_Y\)。 例 2.26:\(f_{X,Y}=e^{-(x+y)}\)(\(x,y\ge0\)),\(f_X(x)=e^{-x}\int_0^\infty e^{-y}dy=e^{-x}\)。 例 2.27:\(f=x+y\)(单位正方形),\(f_Y(y)=\int_0^1x\,dx+\int_0^1y\,dx=\frac12+y\)。 例 2.28:\(f=\frac{21}4x^2y\)(\(x^2\le y\le1\)),\(f_X(x)=\frac{21}4x^2\int_{x^2}^1y\,dy=\frac{21}8x^2(1-x^4)\),\(-1\le x\le1\)。

2.7 独立随机变量(Independent Random Variables)(PDF p.50–52)

定义 2.29:若对任意 \(A,B\),\(\mathbb P(X\in A,Y\in B)=\mathbb P(X\in A)\mathbb P(Y\in B)\) (2.7),称 \(X,Y\) 独立,记 \(X\perp\!\!\!\perp Y\);否则相依(dependent)。

定理 2.30:\(X\perp\!\!\!\perp Y\) 当且仅当 \(f_{X,Y}(x,y)=f_X(x)f_Y(y)\) 对所有 \(x,y\) 成立(对离散也成立;严格说密度只在测度为零的集合外唯一)。

例 2.31:四格均为 1/4 的表,边缘都是 (1/2,1/2),四格都满足乘积条件,独立。另一表 \(f(0,0)=f(1,1)=1/2\)、\(f(0,1)=f(1,0)=0\),边缘仍为 (1/2,1/2),但 \(f_X(0)f_Y(1)=1/4\ne f(0,1)=0\),不独立。(编者注:说明边缘分布相同不代表联合分布相同。)

例 2.32:\(X,Y\) 独立同密度 \(f(x)=2x\)(\(0<x<1\)),联合密度 \(4xy\)。\(\mathbb P(X+Y\le1)=4\int_0^1x\left[\int_0^{1-x}y\,dy\right]dx=4\int_0^1x\frac{(1-x)^2}2dx=\frac16\)。

定理 2.33(因子分解判别):若 \((X,Y)\) 的取值范围是(可能无穷的)矩形,且 \(f(x,y)=g(x)h(y)\)(\(g,h\) 不必是密度),则 \(X,Y\) 独立。 例 2.34:\(f(x,y)=2e^{-(x+2y)}\)(\(x,y>0\)),范围是矩形 \((0,\infty)^2\),\(g(x)=2e^{-x}\),\(h(y)=e^{-2y}\),故独立。(常见误区:例 2.22 那种非矩形支撑上,即使密度形如 \(x^2y\) 也不独立。)

2.8 条件分布(Conditional Distributions)(PDF p.52–54)

定义 2.35:离散情形条件质量函数

\[f_{X\mid Y}(x\mid y)=\mathbb P(X=x\mid Y=y)=\frac{f_{X,Y}(x,y)}{f_Y(y)},\quad f_Y(y)>0.\]
定义 2.36:连续情形条件密度用同样公式 \(f_{X\mid Y}(x\mid y)=f_{X,Y}(x,y)/f_Y(y)\),此时 \(\mathbb P(X\in A\mid Y=y)=\int_Af_{X\mid Y}(x\mid y)dx\)。解释不同:连续情形要积分才得概率。脚注:这里实际是在概率为 0 的事件 \(\{Y=y\}\) 上取条件,"踏入深水区";通过用 PDF 定义来回避,理论严格性在高级课程中证明。

由定义 \(f_{X,Y}(x,y)=f_{X\mid Y}(x\mid y)f_Y(y)=f_{Y\mid X}(y\mid x)f_X(x)\),在分层生成模型中很有用。

例 2.37:单位正方形上联合均匀,\(f_{X\mid Y}(x\mid y)=1\),即 \(X\mid Y=y\sim\text{Uniform}(0,1)\)。 例 2.38:\(f=x+y\),\(f_Y(y)=y+1/2\),\(f_{X\mid Y}(x\mid y)=\frac{x+y}{y+1/2}\)。\(\mathbb P(X<1/4\mid Y=1/3)=\int_0^{1/4}\frac{x+1/3}{1/3+1/2}dx=\frac{1/32+1/12}{5/6}=\frac{11}{80}\)。 例 2.39(分层模型):\(X\sim\text{Uniform}(0,1)\),再生成 \(Y\mid X=x\sim\text{Uniform}(x,1)\)。\(f_{Y\mid X}(y\mid x)=\frac1{1-x}\)(\(0<x<y<1\)),联合 \(f_{X,Y}=\frac1{1-x}\)(\(0<x<y<1\))。\(Y\) 的边缘:

\[f_Y(y)=\int_0^y\frac{dx}{1-x}=-\int_1^{1-y}\frac{du}u=-\log(1-y),\quad0<y<1.\]
例 2.40:沿用例 2.28,\(f_{Y\mid X}(y\mid x)=\frac{\frac{21}4x^2y}{\frac{21}8x^2(1-x^4)}=\frac{2y}{1-x^4}\),\(x^2\le y\le1\)。于是 \(f(y\mid1/2)=\frac{32y}{15}\),\(\mathbb P(Y\ge3/4\mid X=1/2)=\int_{3/4}^1\frac{32y}{15}dy=\frac7{15}\)。

2.9 多元分布与 IID 样本(Multivariate Distributions and IID Samples)(PDF p.54–55)

\(X=(X_1,\dots,X_n)\) 称为随机向量(random vector),PDF \(f(x_1,\dots,x_n)\),边缘、条件分布类似二元情形定义。若对任意 \(A_1,\dots,A_n\),\(\mathbb P(X_1\in A_1,\dots,X_n\in A_n)=\prod_i\mathbb P(X_i\in A_i)\) (2.8),称 \(X_1,\dots,X_n\) 独立;只需验证 \(f(x_1,\dots,x_n)=\prod f_{X_i}(x_i)\)。

定义 2.41:若 \(X_1,\dots,X_n\) 独立且有相同边缘 CDF \(F\),称为 IID(independent and identically distributed,独立同分布),记 \(X_1,\dots,X_n\sim F\)(有密度时记 \(\sim f\)),也称为来自 \(F\) 的容量为 \(n\) 的随机样本(random sample)。统计理论与实践大多从 IID 观测出发。

2.10 两个重要的多元分布(Two Important Multivariate Distributions)(PDF p.55–56)

多项分布(Multinomial):二项分布的多元版本。罐中有 \(k\) 种颜色的球,抽到颜色 \(j\) 的概率为 \(p_j\)(\(p_j\ge0\),\(\sum p_j=1\));有放回独立抽 \(n\) 次,\(X_j\) 为颜色 \(j\) 出现次数,\(\sum X_j=n\)。记 \(X\sim\text{Multinomial}(n,p)\):

\[f(x)=\binom{n}{x_1\cdots x_k}p_1^{x_1}\cdots p_k^{x_k},\qquad\binom{n}{x_1\cdots x_k}=\frac{n!}{x_1!\cdots x_k!}.\tag{2.9}\]
引理 2.42:\(X_j\) 的边缘分布为 Binomial\((n,p_j)\)。

多元正态(Multivariate Normal):先令 \(Z=(Z_1,\dots,Z_k)^T\),\(Z_i\) 独立 \(N(0,1)\),密度

\[f(z)=\prod_{i=1}^kf(z_i)=\frac1{(2\pi)^{k/2}}\exp\left\{-\frac12\sum z_j^2\right\}=\frac1{(2\pi)^{k/2}}\exp\left\{-\frac12z^Tz\right\},\]
称为标准多元正态 \(Z\sim N(0,I)\)。一般地 \(X\sim N(\mu,\Sigma)\) 的密度
\[f(x;\mu,\Sigma)=\frac1{(2\pi)^{k/2}|\Sigma|^{1/2}}\exp\left\{-\frac12(x-\mu)^T\Sigma^{-1}(x-\mu)\right\},\tag{2.10}\]
\(\mu\) 为 \(k\) 维向量,\(\Sigma\) 为 \(k\times k\) 对称正定矩阵(正定:对所有非零 \(x\),\(x^T\Sigma x>0\)),\(|\Sigma|\) 为行列式。

\(\Sigma\) 对称正定时存在平方根矩阵 \(\Sigma^{1/2}\):(i) 对称;(ii) \(\Sigma=\Sigma^{1/2}\Sigma^{1/2}\);(iii) \(\Sigma^{1/2}\Sigma^{-1/2}=\Sigma^{-1/2}\Sigma^{1/2}=I\),\(\Sigma^{-1/2}=(\Sigma^{1/2})^{-1}\)。

定理 2.43:若 \(Z\sim N(0,I)\),\(X=\mu+\Sigma^{1/2}Z\),则 \(X\sim N(\mu,\Sigma)\);反之若 \(X\sim N(\mu,\Sigma)\),则 \(\Sigma^{-1/2}(X-\mu)\sim N(0,I)\)。

定理 2.44:把 \(X\) 分块为 \((X_a,X_b)\),相应 \(\mu=(\mu_a,\mu_b)\),\(\Sigma=\begin{pmatrix}\Sigma_{aa}&\Sigma_{ab}\\\Sigma_{ba}&\Sigma_{bb}\end{pmatrix}\)。则

  1. 边缘:\(X_a\sim N(\mu_a,\Sigma_{aa})\);
  2. 条件:\(X_b\mid X_a=x_a\sim N\!\left(\mu_b+\Sigma_{ba}\Sigma_{aa}^{-1}(x_a-\mu_a),\ \Sigma_{bb}-\Sigma_{ba}\Sigma_{aa}^{-1}\Sigma_{ab}\right)\);
  3. 线性组合:\(a^TX\sim N(a^T\mu,a^T\Sigma a)\);
  4. \(V=(X-\mu)^T\Sigma^{-1}(X-\mu)\sim\chi^2_k\)。

2.11 随机变量的变换(Transformations of Random Variables)(PDF p.57–58)

\(Y=r(X)\) 称为 \(X\) 的变换。离散情形:\(f_Y(y)=\mathbb P(r(X)=y)=\mathbb P(X\in r^{-1}(y))\)。 例 2.45:\(\mathbb P(X=-1)=\mathbb P(X=1)=1/4\),\(\mathbb P(X=0)=1/2\),\(Y=X^2\):\(\mathbb P(Y=0)=1/2\),\(\mathbb P(Y=1)=1/2\)。\(r\) 不是一一映射,\(Y\) 取值更少。

连续情形三步法:

  1. 对每个 \(y\) 求集合 \(A_y=\{x:r(x)\le y\}\);
  2. 求 CDF:\(F_Y(y)=\mathbb P(r(X)\le y)=\int_{A_y}f_X(x)dx\) (2.11);
  3. \(f_Y(y)=F_Y'(y)\)。

例 2.46:\(f_X(x)=e^{-x}\)(\(x>0\)),\(F_X=1-e^{-x}\),\(Y=\log X\):\(A_y=\{x\le e^y\}\),\(F_Y(y)=1-e^{-e^y}\),\(f_Y(y)=e^ye^{-e^y}\),\(y\in\mathbb R\)(极值分布/Gumbel 型)。 例 2.47:\(X\sim\text{Uniform}(-1,3)\),\(Y=X^2\in(0,9)\)。情形 (i) \(0<y<1\):\(A_y=[-\sqrt y,\sqrt y]\),\(F_Y=\frac12\sqrt y\);情形 (ii) \(1\le y<9\):\(A_y=[-1,\sqrt y]\),\(F_Y=\frac14(\sqrt y+1)\)。求导得 \(f_Y=\frac1{4\sqrt y}\)(\(0<y<1\)),\(\frac1{8\sqrt y}\)(\(1<y<9\))。 单调变换公式:若 \(r\) 严格单调,逆为 \(s=r^{-1}\),则

\[f_Y(y)=f_X(s(y))\left|\frac{ds(y)}{dy}\right|.\tag{2.12}\]

2.12 多个随机变量的变换(PDF p.58–59)

关心 \(X/Y\)、\(X+Y\)、\(\max\)、\(\min\) 等,\(Z=r(X,Y)\),同样三步:\(A_z=\{(x,y):r(x,y)\le z\}\),\(F_Z(z)=\iint_{A_z}f_{X,Y}dxdy\),\(f_Z=F_Z'\)。 例 2.48:\(X_1,X_2\) 独立 Uniform(0,1),\(Y=X_1+X_2\)。难点是找 \(A_y\)(直线 \(x_2=y-x_1\) 下方的部分,图 2.6):\(0<y\le1\) 时为顶点 \((0,0),(y,0),(0,y)\) 的三角形,面积 \(y^2/2\);\(1<y<2\) 时为正方形去掉顶点 \((1,y-1),(1,1),(y-1,1)\) 的三角形,面积 \(1-(2-y)^2/2\)。得三角形密度 \(f_Y(y)=y\)(\(0\le y\le1\)),\(2-y\)(\(1\le y\le2\))。

2.13 附录(PDF p.59)

随机变量是可测映射 \(X:\Omega\to\mathbb R\),可测指对每个 \(x\),\(\{\omega:X(\omega)\le x\}\in\mathcal A\)。

2.14 习题(PDF p.59–62)概览

共 21 题:证明 \(\mathbb P(X=x)=F(x^+)-F(x^-)\)(题 1);由 CDF 求区间概率、注意开闭端点(题 2:\(\mathbb P(X=2)=\mathbb P(X=3)=.1\)、\(\mathbb P(X=5)=.8\));证明引理 2.15(题 3);分段密度的 CDF 及 \(Y=1/X\) 的密度(题 4);离散独立判别(题 5);示性变量 \(I_A(X)\) 的分布(题 6);\(\min\{X,Y\}\) 的密度(题 7,先求 \(\mathbb P(Z>z)\));\(X^+=\max\{0,X\}\) 的 CDF(题 8);指数分布的 \(F\) 与 \(F^{-1}\)(题 9);独立变量的函数仍独立(题 10);泊松稀释:掷硬币 \(N\sim\text{Poisson}(\lambda)\) 次,正反面次数独立(题 11);证明定理 2.33(题 12);对数正态密度并用 10000 个模拟值作直方图对比(题 13);单位圆盘上 \(R=\sqrt{X^2+Y^2}\) 的分布(题 14);概率积分变换与逆变换抽样(题 15:\(Y=F(X)\sim U(0,1)\),\(X=F^{-1}(U)\sim F\),编程由均匀数生成指数分布);独立泊松给定和的条件分布为二项分布 \(\text{Bin}(n,\lambda/(\lambda+\mu))\)(题 16);\(c(x+y^2)\) 的条件概率(题 17);\(N(3,16)\) 的查表与软件计算(题 18);证明 (2.12)(题 19);\(X-Y\)、\(X/Y\) 的密度(题 20);IID 指数的最大值分布(题 21)。

本章要点

  1. 随机变量是样本空间到实数的映射;CDF 完全刻画分布,并由"非降、规范、右连续"三条件刻画。
  2. 离散用 PMF、连续用 PDF;PDF 不是概率,可以大于 1 甚至无界;分位数函数 \(F^{-1}\) 是 VaR、中位数等概念的数学基础。
  3. 常用分布族:点质量、离散均匀、伯努利、二项、几何、泊松;均匀、正态、指数、Gamma、Beta、t/柯西、卡方;多元的多项分布和多元正态。要掌握各自参数含义、可加性与相互关系(指数⊂Gamma,柯西=t₁,正态平方和=卡方)。
  4. 联合、边缘、条件分布与独立性;因子分解判独立要求支撑为矩形。
  5. 多元正态的线性变换、边缘、条件分布公式(定理 2.43–2.44)是后续回归、因子模型、卡尔曼滤波的核心工具。
  6. 变换求分布的"三步法"与单调变换的雅可比公式。

与量化交易的关联

  • 收益分布建模:正态是基准;t 分布(厚尾)更贴近日收益,柯西示范了均值不存在的极端情况;对数正态(习题 13)是 Black–Scholes 的价格分布假设;例 2.46 的 \(Y=\log X\) 推导方式与"收益率取对数"同构。
  • 分位数与风险度量:VaR 就是损益分布的分位数 \(F^{-1}(\alpha)\);例 2.17 的查表反解即正态 VaR 的计算方法(\(q=\mu+\sigma\Phi^{-1}(\alpha)\))。
  • 多元正态与组合风险:定理 2.44(3) \(a^TX\sim N(a^T\mu,a^T\Sigma a)\) 正是组合收益的均值-方差公式,是马科维茨组合优化与参数法 VaR 的基础;定理 2.44(2) 的条件分布公式用于条件预期(给定市场因子时个股收益的分布)、缺失数据填补、卡尔曼滤波;定理 2.43 的 \(\mu+\Sigma^{1/2}Z\) 是蒙特卡洛生成相关资产收益的标准方法(实践中常用 Cholesky 分解替代对称平方根);(4) 的二次型 \(\sim\chi^2_k\) 即马氏距离,用于异常检测和湍流指数(turbulence index)。
  • 计数与到达过程:泊松分布刻画单位时间内订单、成交笔数;指数分布刻画到达间隔,是执行算法与市场微观结构建模的基本假设;习题 11 的泊松稀释说明买卖单拆分后数量独立。
  • 模拟:习题 15 的逆变换抽样是所有蒙特卡洛定价、风险模拟的起点;2.3 节用均匀随机数构造伯努利变量即同一思想。
  • 独立性误区:边缘相同不代表联合相同(例 2.31),资产两两边缘分布正常不意味着联合尾部安全,这是 copula 建模的动机。

推荐习题

  • 题 15(概率积分变换/逆变换抽样,必做并编程);题 13(对数正态 + 模拟直方图);题 11、16(泊松性质);题 7、21(最小值、最大值的分布,用于极值与次序统计量);题 18(正态查表与软件计算,VaR 基本功);题 20、例 2.48(卷积与比值分布)。

第 3 章 期望(Expectation)(PDF p.63–77)

3.1 随机变量的期望(Expectation of a Random Variable)(PDF p.63–66)

定义 3.1:\(X\) 的期望值(expected value)、均值(mean)或一阶矩(first moment)

\[\mathbb E(X)=\int x\,dF(x)=\begin{cases}\sum_x xf(x)&\text{离散}\\ \int xf(x)dx&\text{连续}\end{cases}\tag{3.1}\]
前提是和或积分有定义。记号 \(\mathbb E(X)=\mathbb EX=\int x\,dF(x)=\mu=\mu_X\) (3.2)。

  • 期望是分布的单数字概括;可以把它看成大量 IID 抽样平均 \(\sum X_i/n\)——这不只是直觉,而是第 5 章的大数定律。
  • \(\int x\,dF(x)\) 只是统一离散/连续的记号,严格含义(Lebesgue–Stieltjes 积分)见附录。
  • 存在性:若 \(\int|x|dF_X(x)<\infty\),称 \(\mathbb E(X)\) 存在,否则不存在。

例 3.2:Bernoulli\((p)\),\(\mathbb E X=0\cdot(1-p)+1\cdot p=p\)。 例 3.3:掷硬币两次正面数,\(\mathbb E X=0\cdot\frac14+1\cdot\frac12+2\cdot\frac14=1\)。 例 3.4:\(X\sim\) Uniform\((-1,3)\),\(\mathbb E X=\frac14\int_{-1}^3x\,dx=1\)。 例 3.5(柯西分布均值不存在):\(f=\{\pi(1+x^2)\}^{-1}\),分部积分(\(u=x\),\(v=\tan^{-1}x\)):\(\int|x|dF=\frac2\pi\int_0^\infty\frac{x\,dx}{1+x^2}=[x\tan^{-1}x]_0^\infty-\int_0^\infty\tan^{-1}x\,dx=\infty\)。模拟柯西样本并取平均,平均值永远不会稳定下来,因为厚尾导致极端值很常见。此后讨论期望时默认其存在。

定理 3.6(懒惰统计学家法则,Rule of the Lazy Statistician):\(Y=r(X)\),则

\[\mathbb E(Y)=\mathbb E(r(X))=\int r(x)\,dF_X(x).\tag{3.3}\]
无需先求 \(f_Y\)。直观:抽 \(X\) 后付给你 \(r(X)\),平均收入就是 \(r(x)\) 乘以 \(X=x\) 的概率再求和/积分。 特例:\(r=I_A\) 时 \(\mathbb E(I_A(X))=\int_Af_X(x)dx=\mathbb P(X\in A)\)——概率是期望的特例。

例 3.7:\(X\sim\) Unif(0,1),\(Y=e^X\),\(\mathbb E Y=\int_0^1e^xdx=e-1\);也可先求 \(f_Y(y)=1/y\)(\(1<y<e\))再算,结果相同。 例 3.8(折木棍):单位长度木棍随机折断,\(Y\) 为较长一段。\(X\sim\) Unif(0,1),\(Y=\max\{X,1-X\}\),\(\mathbb E Y=\int_0^{1/2}(1-x)dx+\int_{1/2}^1x\,dx=\frac34\)。 多元:\(Z=r(X,Y)\) 时 \(\mathbb E Z=\iint r(x,y)dF(x,y)\) (3.4)。 例 3.9:\((X,Y)\) 在单位正方形上均匀,\(Z=X^2+Y^2\),\(\mathbb E Z=\int_0^1x^2dx+\int_0^1y^2dy=\frac23\)。

矩:\(k\) 阶矩(\(k\)th moment)\(\mathbb E(X^k)\),要求 \(\mathbb E|X|^k<\infty\)。 定理 3.10:若 \(k\) 阶矩存在且 \(j<k\),则 \(j\) 阶矩存在。证明:\(\int|x|^jf=\int_{|x|\le1}|x|^jf+\int_{|x|>1}|x|^jf\le\int_{|x|\le1}f+\int_{|x|>1}|x|^kf\le1+\mathbb E|X|^k<\infty\)。 \(k\) 阶中心矩(central moment)\(\mathbb E((X-\mu)^k)\)。

3.2 期望的性质(Properties of Expectations)(PDF p.66)

定理 3.11(线性):\(\mathbb E\left(\sum_ia_iX_i\right)=\sum_ia_i\mathbb E(X_i)\) (3.5)。 例 3.12:\(X\sim\) Binomial\((n,p)\),直接算 \(\sum_x x\binom nx p^x(1-p)^{n-x}\) 不容易;改写 \(X=\sum_{i=1}^nX_i\)(\(X_i\) 为第 \(i\) 次是否正面的示性变量),\(\mathbb E X_i=p\),故 \(\mathbb E X=np\)。("示性变量分解"是重要技巧。) 定理 3.13:若 \(X_1,\dots,X_n\) 独立,则 \(\mathbb E\left(\prod X_i\right)=\prod\mathbb E(X_i)\) (3.6)。注意:求和法则不需要独立,乘积法则需要独立。

3.3 方差与协方差(Variance and Covariance)(PDF p.66–68)

方差度量分布的"散布"。(脚注:不能用 \(\mathbb E(X-\mu)\),它恒为 0;可以用 \(\mathbb E|X-\mu|\),但更常用方差。)

定义 3.14:均值为 \(\mu\) 的 \(X\) 的方差 \(\sigma^2=\sigma_X^2=\mathbb V(X)=\mathbb E(X-\mu)^2=\int(x-\mu)^2dF(x)\) (3.7);标准差 \(\text{sd}(X)=\sqrt{\mathbb V(X)}\),也记 \(\sigma,\sigma_X\)。

定理 3.15:

  1. \(\mathbb V(X)=\mathbb E(X^2)-\mu^2\);
  2. \(\mathbb V(aX+b)=a^2\mathbb V(X)\);
  3. 若 \(X_i\) 独立,\(\mathbb V\left(\sum a_iX_i\right)=\sum a_i^2\mathbb V(X_i)\) (3.8)。

例 3.16:二项分布方差。\(\mathbb E(X_i^2)=p\cdot1^2+(1-p)\cdot0^2=p\),\(\mathbb V(X_i)=p-p^2=p(1-p)\),独立求和得 \(\mathbb V(X)=np(1-p)\)。\(p=0\) 或 \(1\) 时方差为 0,直观上合理(结果确定)。

样本均值与样本方差:

\[\bar X_n=\frac1n\sum_{i=1}^nX_i,\tag{3.9}\qquad S_n^2=\frac1{n-1}\sum_{i=1}^n(X_i-\bar X_n)^2.\tag{3.10}\]
定理 3.17:\(X_1,\dots,X_n\) IID,\(\mu=\mathbb E X_i\),\(\sigma^2=\mathbb V X_i\),则
\[\mathbb E(\bar X_n)=\mu,\quad\mathbb V(\bar X_n)=\frac{\sigma^2}n,\quad\mathbb E(S_n^2)=\sigma^2.\]
(\(S_n^2\) 除以 \(n-1\) 正是为了无偏。)

定义 3.18:协方差(covariance)\(\text{Cov}(X,Y)=\mathbb E((X-\mu_X)(Y-\mu_Y))\);相关系数(correlation)\(\rho=\rho_{X,Y}=\rho(X,Y)=\frac{\text{Cov}(X,Y)}{\sigma_X\sigma_Y}\)。二者度量 \(X,Y\) 之间线性关系的强弱。

定理 3.19:\(\text{Cov}(X,Y)=\mathbb E(XY)-\mathbb E(X)\mathbb E(Y)\) (3.11);\(-1\le\rho(X,Y)\le1\) (3.12)。若 \(Y=aX+b\),则 \(a>0\) 时 \(\rho=1\),\(a<0\) 时 \(\rho=-1\)。若 \(X,Y\) 独立,则 \(\text{Cov}=\rho=0\);反之一般不成立(不相关 ≠ 独立)。

定理 3.20:\(\mathbb V(X+Y)=\mathbb V(X)+\mathbb V(Y)+2\text{Cov}(X,Y)\),\(\mathbb V(X-Y)=\mathbb V(X)+\mathbb V(Y)-2\text{Cov}(X,Y)\);一般地

\[\mathbb V\left(\sum_ia_iX_i\right)=\sum_ia_i^2\mathbb V(X_i)+2\sum\sum_{i<j}a_ia_j\text{Cov}(X_i,X_j).\]

3.4 重要随机变量的期望与方差(PDF p.68–70)

分布 均值 方差
点质量 \(\delta_a\) \(a\) 0
Bernoulli\((p)\) \(p\) \(p(1-p)\)
Binomial\((n,p)\) \(np\) \(np(1-p)\)
Geometric\((p)\) \(1/p\) \((1-p)/p^2\)
Poisson\((\lambda)\) \(\lambda\) \(\lambda\)
Uniform\((a,b)\) \((a+b)/2\) \((b-a)^2/12\)
Normal\((\mu,\sigma^2)\) \(\mu\) \(\sigma^2\)
Exponential\((\beta)\) \(\beta\) \(\beta^2\)
Gamma\((\alpha,\beta)\) \(\alpha\beta\) \(\alpha\beta^2\)
Beta\((\alpha,\beta)\) \(\alpha/(\alpha+\beta)\) \(\alpha\beta/((\alpha+\beta)^2(\alpha+\beta+1))\)
\(t_\nu\) 0(\(\nu>1\)) \(\nu/(\nu-2)\)(\(\nu>2\))
\(\chi^2_p\) \(p\) \(2p\)
Multinomial\((n,p)\) \(np\) 见下
多元正态 \(N(\mu,\Sigma)\) \(\mu\) \(\Sigma\)

随机向量 \(X=(X_1,\dots,X_k)^T\) 的均值 \(\mu=(\mathbb E X_1,\dots,\mathbb E X_k)^T\);方差-协方差矩阵(variance-covariance matrix)\(\Sigma=\mathbb V(X)\),对角元为 \(\mathbb V(X_i)\),非对角元为 \(\text{Cov}(X_i,X_j)\)。

多项分布协方差推导:\(X_i\sim\) Bin\((n,p_i)\),\(X_i+X_j\sim\) Bin\((n,p_i+p_j)\),故 \(\mathbb V(X_i+X_j)=n(p_i+p_j)(1-p_i-p_j)\);又 \(=np_i(1-p_i)+np_j(1-p_j)+2\text{Cov}(X_i,X_j)\),解得 \(\text{Cov}(X_i,X_j)=-np_ip_j\)。因此 \(\mathbb V(X)\) 对角元 \(np_i(1-p_i)\),非对角元 \(-np_ip_j\)(计数和固定为 \(n\),故各分量负相关)。

引理 3.21:若随机向量 \(X\) 均值 \(\mu\)、方差 \(\Sigma\),向量 \(a\)、矩阵 \(A\),则 \(\mathbb E(a^TX)=a^T\mu\),\(\mathbb V(a^TX)=a^T\Sigma a\);\(\mathbb E(AX)=A\mu\),\(\mathbb V(AX)=A\Sigma A^T\)。

3.5 条件期望(Conditional Expectation)(PDF p.70–72)

定义 3.22:给定 \(Y=y\) 时 \(X\) 的条件期望:用 \(f_{X\mid Y}(x\mid y)\) 代替 \(f_X(x)\),

\[\mathbb E(X\mid Y=y)=\begin{cases}\sum_xxf_{X\mid Y}(x\mid y)\\\int xf_{X\mid Y}(x\mid y)dx\end{cases}\tag{3.13}\]
\(\mathbb E(r(X,Y)\mid Y=y)=\int r(x,y)f_{X\mid Y}(x\mid y)dx\) (3.14)。

警告(微妙之处):\(\mathbb E(X)\) 是一个数,\(\mathbb E(X\mid Y=y)\) 是 \(y\) 的函数。观测 \(Y\) 之前不知道其值,因此 \(\mathbb E(X\mid Y)\) 是一个随机变量——当 \(Y=y\) 时取值 \(\mathbb E(X\mid Y=y)\)。

例 3.23:\(X\sim\) Unif(0,1),\(Y\mid X=x\sim\) Unif\((x,1)\)。\(\mathbb E(Y\mid X=x)=\frac1{1-x}\int_x^1y\,dy=\frac{1+x}2\),故 \(\mathbb E(Y\mid X)=(1+X)/2\) 是随机变量。

定理 3.24(迭代期望法则,Rule of Iterated Expectations):

\[\mathbb E[\mathbb E(Y\mid X)]=\mathbb E(Y),\quad\mathbb E[\mathbb E(X\mid Y)]=\mathbb E(X);\tag{3.15}\]
更一般地 \(\mathbb E[\mathbb E(r(X,Y)\mid X)]=\mathbb E(r(X,Y))\) (3.16)。 证明:\(\mathbb E[\mathbb E(Y\mid X)]=\int\mathbb E(Y\mid X=x)f_X(x)dx=\iint yf(y\mid x)f(x)dydx=\iint yf(x,y)dxdy=\mathbb E(Y)\)。

例 3.25:续例 3.23,\(\mathbb E(Y)=\mathbb E\left(\frac{1+X}2\right)=\frac{1+1/2}2=\frac34\),比先求联合密度简单。

定义 3.26:条件方差 \(\mathbb V(Y\mid X=x)=\int(y-\mu(x))^2f(y\mid x)dy\),\(\mu(x)=\mathbb E(Y\mid X=x)\)。 定理 3.27(全方差公式):

\[\mathbb V(Y)=\mathbb E\,\mathbb V(Y\mid X)+\mathbb V\,\mathbb E(Y\mid X).\tag{3.17}\]
(组内方差的均值 + 组间均值的方差。)

例 3.28(分层模型,hierarchical model):随机选美国一个县,再从该县随机选 \(n\) 人,\(X\) 为患病人数。县患病率 \(Q\) 是随机变量,\(Q\sim\) Uniform(0,1),\(X\mid Q=q\sim\) Binomial\((n,q)\)。则 \(\mathbb E(X)=\mathbb E(nQ)=n/2\);\(\mathbb E\,\mathbb V(X\mid Q)=n\mathbb E[Q(1-Q)]=n\int_0^1q(1-q)dq=n/6\);\(\mathbb V\,\mathbb E(X\mid Q)=n^2\mathbb V(Q)=n^2/12\);故 \(\mathbb V(X)=\frac n6+\frac{n^2}{12}\)。(对比:若 \(Q\) 固定为 1/2,方差仅 \(n/4\);参数不确定性带来 \(n^2\) 量级的额外方差——过度离散 overdispersion。)

3.6 矩母函数(Moment Generating Functions)(PDF p.72–74)

定义 3.29:矩母函数(moment generating function, MGF)或拉普拉斯变换(Laplace transform)

\[\psi_X(t)=\mathbb E(e^{tX})=\int e^{tx}dF(x),\quad t\in\mathbb R.\]
假定 MGF 在 \(t=0\) 的某开区间内有定义。(脚注:特征函数 characteristic function \(\mathbb E(e^{itX})\) 对所有 \(t\) 总有定义。)MGF 良定义时可交换求导与期望:\(\psi'(0)=\mathbb E[Xe^{tX}]_{t=0}=\mathbb E(X)\);一般 \(\psi^{(k)}(0)=\mathbb E(X^k)\)。

例 3.30:\(X\sim\) Exp(1),\(t<1\) 时 \(\psi_X(t)=\int_0^\infty e^{tx}e^{-x}dx=\frac1{1-t}\)(\(t\ge1\) 发散)。\(\psi'(0)=1\),\(\psi''(0)=2\),故 \(\mathbb E X=1\),\(\mathbb V X=2-1=1\)。

引理 3.31:(1) \(Y=aX+b\Rightarrow\psi_Y(t)=e^{bt}\psi_X(at)\);(2) \(X_i\) 独立,\(Y=\sum X_i\Rightarrow\psi_Y(t)=\prod\psi_i(t)\)。 例 3.32:Bernoulli 的 MGF \(pe^t+q\)(\(q=1-p\)),故 Binomial\((n,p)\) 的 MGF 为 \((pe^t+q)^n\)。 定理 3.33(唯一性):若 \(\psi_X(t)=\psi_Y(t)\) 在 0 的某开区间内成立,则 \(X\overset d=Y\)。 例 3.34:独立 Bin\((n_1,p)\)+Bin\((n_2,p)\) 的 MGF 为 \((pe^t+q)^{n_1+n_2}\),故和为 Bin\((n_1+n_2,p)\)。 例 3.35:独立 Poisson 之和:\(e^{\lambda_1(e^t-1)}e^{\lambda_2(e^t-1)}=e^{(\lambda_1+\lambda_2)(e^t-1)}\),为 Poisson\((\lambda_1+\lambda_2)\)。

常见分布 MGF 表:Bernoulli\((p)\):\(pe^t+(1-p)\);Binomial:\((pe^t+(1-p))^n\);Poisson\((\lambda)\):\(e^{\lambda(e^t-1)}\);Normal\((\mu,\sigma^2)\):\(\exp\{\mu t+\sigma^2t^2/2\}\);Gamma\((\alpha,\beta)\):\(\left(\frac1{1-\beta t}\right)^\alpha\),\(t<1/\beta\)。

3.7 附录:期望作为积分(PDF p.74)

可测函数积分的定义:简单函数 \(r\)(在划分 \(A_1,\dots,A_k\) 上取有限个值 \(a_i\))定义 \(\int r\,dF=\sum a_i\mathbb P(r(X)\in A_i)\);非负可测函数用逼近它的递增简单函数列的积分极限定义(与序列选取无关);一般函数 \(r=r^+-r^-\),\(\int r\,dF=\int r^+dF-\int r^-dF\)(两者都有限时)。

3.8 习题(PDF p.74–77)概览

共 24 题:

  • 题 1:本金 \(c\),每局等概率翻倍或减半,\(n\) 局后期望财富(答案 \(c(5/4)^n\),期望增长但中位数不变——编写者可用来引出"期望 vs 几何增长"的讨论)。
  • 题 2:\(\mathbb V(X)=0\) 当且仅当 \(X\) 几乎必然为常数;题 3:\(n\) 个均匀变量最大值的期望(\(n/(n+1)\));题 4:随机游走 \(X_n\) 的均值和方差;题 5:几何分布期望;题 6:离散情形证明懒惰统计学家法则;题 7:非负随机变量 \(\mathbb E X=\int_0^\infty\mathbb P(X>x)dx\)(尾概率积分公式);题 8:证明定理 3.17。
  • 题 9(计算机实验):正态与柯西的样本均值随 \(n\) 的轨迹对比——柯西不收敛。
  • 题 10:对数正态 \(Y=e^X\) 的均值方差(\(e^{1/2}\),\(e^2-e\))。
  • 题 11(模拟股市):\(Y_i=\pm1\) 等概率,\(X_n=\sum Y_i\) 为第 \(n\) 天股价;求 \(\mathbb E X_n=0\)、\(\mathbb V X_n=n\);模拟多次并作图,观察:随机序列中很容易"看出"规律;同样生成的几条路径差别很大——用方差随 \(n\) 线性增长解释。
  • 题 12:证明 3.4 节表中各分布均值方差(给出技巧:Poisson 先算 \(\mathbb E[X(X-1)]\);Gamma、Beta 乘除归一化常数);题 13:混合分布的均值和标准差;题 14:协方差双线性 \(\text{Cov}(\sum a_iX_i,\sum b_jY_j)=\sum\sum a_ib_j\text{Cov}(X_i,Y_j)\);题 15:\(\mathbb V(2X-3Y+8)\);题 16:\(\mathbb E(r(X)s(Y)\mid X)=r(X)\mathbb E(s(Y)\mid X)\)("提出已知量");题 17:证明全方差公式(给出展开平方的提示);题 18:\(\mathbb E(X\mid Y)\) 为常数则不相关;题 19:抽样分布(sampling distribution)概念——统计量 \(\bar X_n\) 是随机变量,有自己的分布;勿混淆数据分布与统计量分布;用均匀分布模拟 \(n=1,5,25,100\);题 20:证明引理 3.21;题 21:\(\mathbb E(Y\mid X)=X\Rightarrow\text{Cov}(X,Y)=\mathbb V(X)\);题 22:示性变量的独立性与条件期望;题 23:求 Poisson、Normal、Gamma 的 MGF;题 24:IID 指数之和为 Gamma(用 MGF)。

本章要点

  1. 期望是分布的一阶概括,需检查存在性(柯西无均值);懒惰统计学家法则让我们无需求 \(Y=r(X)\) 的分布即可求期望;概率是示性函数的期望。
  2. 期望线性(无需独立);乘积期望可分解、方差可加需要独立(或不相关)。
  3. 方差、协方差、相关系数及线性组合方差公式;矩阵形式 \(\mathbb V(AX)=A\Sigma A^T\)。
  4. 条件期望 \(\mathbb E(Y\mid X)\) 是随机变量;迭代期望与全方差公式是分层模型计算的利器。
  5. MGF 用于求矩、确定和的分布,并在第 5 章用于证明 CLT。

与量化交易的关联

  • 组合风险:定理 3.20 与引理 3.21 中 \(\mathbb V(w^TR)=w^T\Sigma w\) 就是组合方差公式,是均值-方差优化、风险预算、风险归因(边际风险贡献 \(\Sigma w\))的基础;多项分布协方差为负的推导方式可迁移到"权重和为 1 约束下的负相关"。
  • 相关 ≠ 独立:定理 3.19 提醒相关系数只衡量线性依赖;资产收益在尾部可能高度相依而线性相关很低,需要尾部相关/copula 等工具。
  • 全方差公式与分层模型:例 3.28 结构等价于"参数不确定性 + 抽样噪声"。在因子模型中,收益方差 = 因子解释部分 \(\mathbb V\,\mathbb E(R\mid F)\) + 特异部分 \(\mathbb E\,\mathbb V(R\mid F)\);在贝叶斯收缩、参数不确定下的预测方差中也直接使用。
  • 期望 vs 几何增长:习题 1(翻倍或减半)与 Jensen 不等式(第 4 章)一起说明算术期望收益为正的策略长期复利可能不增长,是 Kelly 准则与对数效用的引子。
  • 随机游走与"看图找规律":习题 11 是作者专门设计的股市模拟,说明纯随机价格路径中也会"看出"趋势和形态,提醒技术分析式模式识别容易过度解读;\(\mathbb V X_n=n\) 即波动率按 \(\sqrt n\) 缩放的根源。
  • 柯西与厚尾:例 3.5 与习题 9 说明期望不存在时样本均值不收敛,对极端厚尾收益的均值估计要格外谨慎。
  • MGF/累积量:正态 MGF 用于推导对数正态均值 \(e^{\mu+\sigma^2/2}\)(习题 10),即对数收益与简单收益之间的凸性修正。

推荐习题

  • 题 11(模拟股市随机游走,必做);题 1(期望 vs 中位数增长);题 9(柯西样本均值);题 17、21、例 3.28(迭代期望与全方差);题 19(抽样分布概念,为第 II 部分铺垫);题 7(尾概率积分公式);题 24(MGF 证明和的分布)。

第 4 章 不等式(Inequalities)(PDF p.78–84)

4.1 概率不等式(Probability Inequalities)(PDF p.78–80)

不等式用于界定难以直接计算的量,也是第 5 章收敛理论的工具。

定理 4.1(马尔可夫不等式,Markov's inequality):\(X\) 非负且 \(\mathbb E X\) 存在,则对任意 \(t>0\),

\[\mathbb P(X>t)\le\frac{\mathbb E(X)}t.\tag{4.1}\]
证明:\(\mathbb E X=\int_0^tx f+\int_t^\infty xf\ge\int_t^\infty xf\ge t\int_t^\infty f=t\,\mathbb P(X>t)\)。

定理 4.2(切比雪夫不等式,Chebyshev's inequality):\(\mu=\mathbb E X\),\(\sigma^2=\mathbb V X\),则

\[\mathbb P(|X-\mu|\ge t)\le\frac{\sigma^2}{t^2},\qquad\mathbb P(|Z|\ge k)\le\frac1{k^2},\ Z=\frac{X-\mu}\sigma.\tag{4.2}\]
特别地 \(\mathbb P(|Z|>2)\le1/4\),\(\mathbb P(|Z|>3)\le1/9\)。证明:对 \((X-\mu)^2\) 用马尔可夫:\(\mathbb P(|X-\mu|\ge t)=\mathbb P(|X-\mu|^2\ge t^2)\le\mathbb E(X-\mu)^2/t^2\);第二式取 \(t=k\sigma\)。

例 4.3(预测误差率):在 \(n\) 个新测试样本上检验一个预测方法(如神经网络),\(X_i=1\) 表示预测错误,\(\bar X_n\) 为观测错误率,\(X_i\sim\) Bernoulli\((p)\),\(p\) 为未知真实错误率。

\[\mathbb P(|\bar X_n-p|>\epsilon)\le\frac{\mathbb V(\bar X_n)}{\epsilon^2}=\frac{p(1-p)}{n\epsilon^2}\le\frac1{4n\epsilon^2},\]
因为 \(p(1-p)\le1/4\)。\(\epsilon=.2\)、\(n=100\) 时界为 .0625。

定理 4.4(Hoeffding 不等式):\(Y_1,\dots,Y_n\) 独立,\(\mathbb E(Y_i)=0\),\(a_i\le Y_i\le b_i\)。对 \(\epsilon>0\) 与任意 \(t>0\),

\[\mathbb P\left(\sum_{i=1}^nY_i\ge\epsilon\right)\le e^{-t\epsilon}\prod_{i=1}^ne^{t^2(b_i-a_i)^2/8}.\tag{4.3}\]
与马尔可夫同一精神,但更紧(指数衰减)。

定理 4.5:\(X_1,\dots,X_n\sim\) Bernoulli\((p)\),对任意 \(\epsilon>0\),

\[\mathbb P(|\bar X_n-p|>\epsilon)\le2e^{-2n\epsilon^2}.\tag{4.4}\]
例 4.6:\(n=100\),\(\epsilon=.2\):切比雪夫给 .0625,Hoeffding 给 \(2e^{-2(100)(.2)^2}=.00067\),小得多。

由 Hoeffding 构造置信区间:固定 \(\alpha>0\),令 \(\epsilon_n=\sqrt{\frac1{2n}\log\frac2\alpha}\),则 \(\mathbb P(|\bar X_n-p|>\epsilon_n)\le2e^{-2n\epsilon_n^2}=\alpha\)。令 \(C=(\bar X_n-\epsilon_n,\bar X_n+\epsilon_n)\),则 \(\mathbb P(p\notin C)\le\alpha\),即 \(\mathbb P(p\in C)\ge1-\alpha\):随机区间 \(C\) 以概率 \(1-\alpha\) 套住真参数,称为 \(1-\alpha\) 置信区间(第 6 章详述)。这是有限样本、无分布假设的区间。

定理 4.7(Mill 不等式):\(Z\sim N(0,1)\),

\[\mathbb P(|Z|>t)\le\sqrt{\frac2\pi}\frac{e^{-t^2/2}}t.\]

4.2 关于期望的不等式(Inequalities For Expectations)(PDF p.81)

定理 4.8(Cauchy–Schwarz 不等式):\(X,Y\) 方差有限,则 \(\mathbb E|XY|\le\sqrt{\mathbb E(X^2)\mathbb E(Y^2)}\) (4.5)。

凸函数:对任意 \(x,y\) 及 \(\alpha\in[0,1]\),\(g(\alpha x+(1-\alpha)y)\le\alpha g(x)+(1-\alpha)g(y)\)。若 \(g''\ge0\) 则凸;凸函数位于任意切线之上;\(-g\) 凸则 \(g\) 凹。凸例:\(x^2\)、\(e^x\);凹例:\(-x^2\)、\(\log x\)。

定理 4.9(Jensen 不等式):\(g\) 凸则 \(\mathbb E g(X)\ge g(\mathbb E X)\) (4.6);\(g\) 凹则 \(\mathbb E g(X)\le g(\mathbb E X)\) (4.7)。 证明:取在 \(\mathbb E(X)\) 处与 \(g\) 相切的直线 \(L(x)=a+bx\),\(g\ge L\),故 \(\mathbb E g(X)\ge\mathbb E L(X)=a+b\mathbb E X=L(\mathbb E X)=g(\mathbb E X)\)。 推论:\(\mathbb E(X^2)\ge(\mathbb E X)^2\);\(X>0\) 时 \(\mathbb E(1/X)\ge1/\mathbb E(X)\);\(\mathbb E(\log X)\le\log\mathbb E(X)\)。

4.3 文献注(PDF p.81)

Devroye et al. (1996) 是概率不等式及其在统计与模式识别中应用的好参考;下面的 Hoeffding 证明取自该书。

4.4 附录:Hoeffding 不等式证明(PDF p.82)

用泰勒定理的精确形式:存在 \(\xi\in(0,u)\) 使 \(g(u)=g(0)+ug'(0)+\frac{u^2}2g''(\xi)\)。 定理 4.4 证明:

  1. 对任意 \(t>0\),由马尔可夫:\(\mathbb P(\sum Y_i\ge\epsilon)=\mathbb P(e^{t\sum Y_i}\ge e^{t\epsilon})\le e^{-t\epsilon}\mathbb E(e^{t\sum Y_i})=e^{-t\epsilon}\prod_i\mathbb E(e^{tY_i})\) (4.8)(独立性)。(这就是 Chernoff 方法。)
  2. \(Y_i\) 是 \(a_i,b_i\) 的凸组合 \(Y_i=\alpha b_i+(1-\alpha)a_i\),\(\alpha=(Y_i-a_i)/(b_i-a_i)\);由 \(e^{ty}\) 凸:\(e^{tY_i}\le\frac{Y_i-a_i}{b_i-a_i}e^{tb_i}+\frac{b_i-Y_i}{b_i-a_i}e^{ta_i}\)。
  3. 取期望并用 \(\mathbb E Y_i=0\):\(\mathbb E e^{tY_i}\le\frac{-a_i}{b_i-a_i}e^{tb_i}+\frac{b_i}{b_i-a_i}e^{ta_i}=e^{g(u)}\) (4.9),其中 \(u=t(b_i-a_i)\),\(g(u)=-\gamma u+\log(1-\gamma+\gamma e^u)\),\(\gamma=-a_i/(b_i-a_i)\)。
  4. \(g(0)=g'(0)=0\),且对所有 \(u>0\) 有 \(g''(u)\le1/4\);由泰勒,\(g(u)=\frac{u^2}2g''(\xi)\le\frac{u^2}8=\frac{t^2(b_i-a_i)^2}8\)。代回 (4.8) 得证。 定理 4.5 证明:令 \(Y_i=(X_i-p)/n\),\(\mathbb E Y_i=0\),\(a=-p/n\le Y_i\le b=(1-p)/n\),\((b-a)^2=1/n^2\)。由定理 4.4:\(\mathbb P(\bar X_n-p>\epsilon)\le e^{-t\epsilon}e^{t^2/(8n)}\),对所有 \(t>0\) 成立,取 \(t=4n\epsilon\)(最小化指数)得 \(e^{-2n\epsilon^2}\);另一侧同理,合并得 \(2e^{-2n\epsilon^2}\)。

4.5 习题(PDF p.83–84)概览

共 7 题:题 1 指数分布的精确尾概率 \(\mathbb P(|X-\mu|\ge k\sigma)\) 与切比雪夫界比较;题 2 用切比雪夫证 Poisson 的 \(\mathbb P(X\ge2\lambda)\le1/\lambda\);题 3 比较切比雪夫与 Hoeffding 界(大 \(n\) 时 Hoeffding 更紧);题 4 用 Hoeffding 构造二项比例置信区间,并做模拟:\(\alpha=.05\)、\(p=.4\),覆盖率随 \(n\)(1 至 10000)的变化、区间长度随 \(n\) 的变化,以及要求长度 ≤ .05 时所需 \(n\);题 5 证明 Mill 不等式(提示:\(\mathbb P(|Z|>t)=2\mathbb P(Z>t)\),在 \(x>t\) 时 \(x/t>1\));题 6 画出 \(\mathbb P(|Z|>t)\) 真值与马尔可夫矩界 \(\mathbb E|Z|^k/t^k\)(\(k=1..5\))、Mill 界的比较;题 7 用 Mill 不等式界 \(\mathbb P(|\bar X_n|>t)\) 并与切比雪夫比较。

本章要点

  1. 马尔可夫 → 切比雪夫(对平方用马尔可夫)→ Chernoff/Hoeffding(对指数用马尔可夫),界依次变紧:多项式衰减 vs 指数衰减。
  2. Hoeffding 给出有界独立变量均值的非渐近集中不等式 \(2e^{-2n\epsilon^2}\),可直接构造不依赖分布形式的置信区间。
  3. Mill 不等式刻画正态尾的 \(e^{-t^2/2}/t\) 衰减。
  4. Jensen 不等式:凸函数的期望 ≥ 期望的函数。

与量化交易的关联

  • 切比雪夫的"分布无关"风险界:不知道收益分布时,\(k\) 倍标准差之外的概率至多 \(1/k^2\);可用于对 VaR 作保守上界,并说明正态假设下的"3σ 事件 0.27%"与无分布假设下的"至多 11%"差距巨大。
  • Hoeffding 与回测/胜率统计:例 4.3 的"错误率"可换成"策略胜率"或"信号命中率";Hoeffding 告诉我们需要多少笔交易才能把胜率估计误差控制在 \(\epsilon\) 以内(\(n\ge\log(2/\alpha)/(2\epsilon^2)\)),例如 \(\epsilon=0.05\)、\(\alpha=0.05\) 约需 738 笔。注意它要求独立,交易间相关时需要调整。
  • Jensen 不等式:\(\mathbb E\log(1+R)\le\log(1+\mathbb E R)\),说明几何平均收益低于算术平均收益("波动拖累" volatility drag,约 \(\sigma^2/2\));期权定价中凸收益的期望大于期望的收益,是凸性/Gamma 价值的根源。
  • Mill 不等式:正态尾衰减极快,实证收益的尾部远厚于此——用于说明正态模型低估极端风险。
  • 集中不等式与机器学习:第 22 章分类和 PAC 学习(前言词典中"大偏差界=PAC learning")都建立在 Hoeffding 上,可用于量化选股模型的泛化误差估计。

推荐习题

  • 题 4(Hoeffding 置信区间的模拟研究,必做);题 3、6(比较各种界的松紧);题 1(精确值 vs 切比雪夫)。

第 5 章 随机变量的收敛(Convergence of Random Variables)(PDF p.85–98)

5.1 引言(PDF p.85–86)

概率论最重要的部分是随机变量序列的行为,称为大样本理论(large sample theory)、极限理论(limit theory)或渐近理论(asymptotic theory)。统计关心"数据越来越多时会怎样"。

微积分中数列 \(x_n\to x\) 指对任意 \(\epsilon>0\),\(n\) 充分大时 \(|x_n-x|<\epsilon\)。概率中更微妙:

  • 若 \(X_1,X_2,\dots\) 独立且都是 \(N(0,1)\),想说 \(X_n\)"收敛到" \(X\sim N(0,1)\),但 \(\mathbb P(X_n=X)=0\)(两个连续变量相等的概率为 0)。
  • 若 \(X_n\sim N(0,1/n)\),直观上集中到 0,但 \(\mathbb P(X_n=0)=0\)。 因此需要严格的收敛概念。

本章两大思想:

  1. 大数定律:样本均值 \(\bar X_n\) 依概率收敛到 \(\mu=\mathbb E(X_i)\),即 \(\bar X_n\) 以高概率接近 \(\mu\)。
  2. 中心极限定理:\(\sqrt n(\bar X_n-\mu)\) 依分布收敛到正态,即大样本时样本均值近似正态。

5.2 收敛的类型(Types of Convergence)(PDF p.86–89)

定义 5.1:\(X_n\) 的 CDF 为 \(F_n\),\(X\) 的 CDF 为 \(F\)。

  1. 依概率收敛(convergence in probability)\(X_n\xrightarrow{P}X\):对每个 \(\epsilon>0\),\(\mathbb P(|X_n-X|>\epsilon)\to0\) (5.1)。
  2. 依分布收敛(convergence in distribution)\(X_n\rightsquigarrow X\):在 \(F\) 的所有连续点 \(t\),\(\lim F_n(t)=F(t)\) (5.2)。 极限为点质量 \(\mathbb P(X=c)=1\) 时写作 \(X_n\xrightarrow P c\)、\(X_n\rightsquigarrow c\)。

定义 5.2:均方收敛(convergence in quadratic mean,或 \(L_2\) 收敛)\(X_n\xrightarrow{qm}X\):\(\mathbb E(X_n-X)^2\to0\) (5.3)。主要用作证明依概率收敛的工具。

例 5.3:\(X_n\sim N(0,1/n)\),\(F\) 为 0 处点质量的 CDF。\(\sqrt nX_n\sim N(0,1)\)。\(t<0\) 时 \(F_n(t)=\mathbb P(Z<\sqrt nt)\to0\);\(t>0\) 时 \(\to1\)。故除 \(t=0\) 外 \(F_n(t)\to F(t)\),\(X_n\rightsquigarrow0\)。注意 \(F_n(0)=1/2\ne F(0)=1\),但 0 不是 \(F\) 的连续点,无须收敛(图 5.1)——这正是定义只要求连续点的原因。依概率:\(\mathbb P(|X_n|>\epsilon)=\mathbb P(|X_n|^2>\epsilon^2)\le\mathbb E(X_n^2)/\epsilon^2=\frac{1/n}{\epsilon^2}\to0\),故 \(X_n\xrightarrow P0\)。

定理 5.4(各收敛间关系,图 5.2): (a) \(X_n\xrightarrow{qm}X\Rightarrow X_n\xrightarrow PX\); (b) \(X_n\xrightarrow PX\Rightarrow X_n\rightsquigarrow X\); (c) 若 \(X_n\rightsquigarrow X\) 且 \(\mathbb P(X=c)=1\),则 \(X_n\xrightarrow PX\)。 除 (c) 这一特例外,反向蕴含一般不成立。图 5.2:均方 → 依概率 → 依分布,另有虚线"点质量时依分布 → 依概率"。

证明:(a) 由马尔可夫:\(\mathbb P(|X_n-X|>\epsilon)=\mathbb P(|X_n-X|^2>\epsilon^2)\le\mathbb E|X_n-X|^2/\epsilon^2\to0\)。 (b) 固定 \(\epsilon\),\(x\) 为 \(F\) 连续点。\(F_n(x)=\mathbb P(X_n\le x,X\le x+\epsilon)+\mathbb P(X_n\le x,X>x+\epsilon)\le F(x+\epsilon)+\mathbb P(|X_n-X|>\epsilon)\);同理 \(F(x-\epsilon)\le F_n(x)+\mathbb P(|X_n-X|>\epsilon)\)。于是 \(F(x-\epsilon)-\mathbb P(|X_n-X|>\epsilon)\le F_n(x)\le F(x+\epsilon)+\mathbb P(|X_n-X|>\epsilon)\),令 \(n\to\infty\):\(F(x-\epsilon)\le\liminf F_n(x)\le\limsup F_n(x)\le F(x+\epsilon)\),再令 \(\epsilon\to0\),由连续性得 \(\lim F_n(x)=F(x)\)。 (c) \(\mathbb P(|X_n-c|>\epsilon)\le\mathbb P(X_n\le c-\epsilon)+\mathbb P(X_n>c+\epsilon)=F_n(c-\epsilon)+1-F_n(c+\epsilon)\to F(c-\epsilon)+1-F(c+\epsilon)=0+1-1=0\)。

反例:

  • 依概率不蕴含均方:\(U\sim\) Unif(0,1),\(X_n=\sqrt n\,I_{(0,1/n)}(U)\)。\(\mathbb P(|X_n|>\epsilon)=\mathbb P(0\le U<1/n)=1/n\to0\),故 \(X_n\xrightarrow P0\);但 \(\mathbb E(X_n^2)=n\int_0^{1/n}du=1\),不均方收敛。
  • 依分布不蕴含依概率:\(X\sim N(0,1)\),\(X_n=-X\),则 \(X_n\sim N(0,1)\),\(F_n=F\),\(X_n\rightsquigarrow X\);但 \(\mathbb P(|X_n-X|>\epsilon)=\mathbb P(|2X|>\epsilon)=\mathbb P(|X|>\epsilon/2)\ne0\)。

警告:\(X_n\xrightarrow Pb\) 并不意味着 \(\mathbb E(X_n)\to b\)。例:\(\mathbb P(X_n=n^2)=1/n\),\(\mathbb P(X_n=0)=1-1/n\),则 \(X_n\xrightarrow P0\),但 \(\mathbb E(X_n)=n^2\cdot\frac1n=n\to\infty\)。(若 \(X_n\) 一致可积则可以,见附录。)"总结:盯着图 5.2 看。"

定理 5.5(收敛在变换下的保持):\(g\) 连续。 (a) \(X_n\xrightarrow PX\),\(Y_n\xrightarrow PY\Rightarrow X_n+Y_n\xrightarrow PX+Y\); (b) 均方收敛同理:\(X_n+Y_n\xrightarrow{qm}X+Y\); (c) \(X_n\rightsquigarrow X\),\(Y_n\rightsquigarrow c\Rightarrow X_n+Y_n\rightsquigarrow X+c\); (d) \(X_n\xrightarrow PX\),\(Y_n\xrightarrow PY\Rightarrow X_nY_n\xrightarrow PXY\); (e) \(X_n\rightsquigarrow X\),\(Y_n\rightsquigarrow c\Rightarrow X_nY_n\rightsquigarrow cX\); (f) \(X_n\xrightarrow PX\Rightarrow g(X_n)\xrightarrow Pg(X)\); (g) \(X_n\rightsquigarrow X\Rightarrow g(X_n)\rightsquigarrow g(X)\)(连续映射定理)。 (c)(e) 称为 Slutsky 定理。注意:\(X_n\rightsquigarrow X\)、\(Y_n\rightsquigarrow Y\) 一般不能推出 \(X_n+Y_n\rightsquigarrow X+Y\)(依分布收敛只关心边缘,不管联合)。

5.3 大数定律(The Law of Large Numbers)(PDF p.90)

"概率论的皇冠成就":大样本的均值接近分布的均值。设 \(X_1,X_2,\dots\) IID,\(\mu=\mathbb E(X_1)\),\(\sigma^2=\mathbb V(X_1)\),\(\mathbb E\bar X_n=\mu\),\(\mathbb V\bar X_n=\sigma^2/n\)。

定理 5.6(弱大数定律,WLLN):若 \(X_1,\dots,X_n\) IID,则 \(\bar X_n\xrightarrow P\mu\)。 解释:\(\bar X_n\) 的分布随 \(n\) 增大越来越集中在 \(\mu\) 附近。 证明(假设 \(\sigma<\infty\),非必要但简化):切比雪夫 \(\mathbb P(|\bar X_n-\mu|>\epsilon)\le\frac{\mathbb V(\bar X_n)}{\epsilon^2}=\frac{\sigma^2}{n\epsilon^2}\to0\)。

例 5.7:掷硬币,正面比例 \(\bar X_n\xrightarrow Pp\)。这不意味着 \(\bar X_n\) 数值上等于 \(p\),而是大 \(n\) 时其分布紧密集中在 \(p\) 附近。\(p=1/2\) 时,要使 \(\mathbb P(.4\le\bar X_n\le.6)\ge.7\):\(\mathbb V\bar X_n=1/(4n)\),切比雪夫给 \(\mathbb P(|\bar X_n-\mu|\le.1)\ge1-\frac1{4n(.1)^2}=1-\frac{25}n\),\(n=84\) 时大于 .7。

5.4 中心极限定理(The Central Limit Theorem)(PDF p.91–93)

大数定律说 \(\bar X_n\) 堆积在 \(\mu\) 附近,但不足以近似关于 \(\bar X_n\) 的概率陈述,这需要 CLT。CLT 说 \(\bar X_n\) 近似 \(N(\mu,\sigma^2/n)\)——除均值和方差存在外,对 \(X_i\) 的分布没有任何假设,这是非常了不起的。

定理 5.8(中心极限定理,CLT):\(X_1,\dots,X_n\) IID,均值 \(\mu\)、方差 \(\sigma^2\),则

\[Z_n\equiv\frac{\bar X_n-\mu}{\sqrt{\mathbb V(\bar X_n)}}=\frac{\sqrt n(\bar X_n-\mu)}\sigma\rightsquigarrow Z,\quad Z\sim N(0,1),\]
即 \(\lim_n\mathbb P(Z_n\le z)=\Phi(z)=\int_{-\infty}^z\frac1{\sqrt{2\pi}}e^{-x^2/2}dx\)。 解释:关于 \(\bar X_n\) 的概率陈述可以用正态近似;近似的是概率陈述,而不是随机变量本身。 等价写法:\(Z_n\approx N(0,1)\);\(\bar X_n\approx N(\mu,\sigma^2/n)\);\(\bar X_n-\mu\approx N(0,\sigma^2/n)\);\(\sqrt n(\bar X_n-\mu)\approx N(0,\sigma^2)\);\(\sqrt n(\bar X_n-\mu)/\sigma\approx N(0,1)\)。

例 5.9:每个程序错误数服从均值 5 的 Poisson,共 125 个程序,求 \(\mathbb P(\bar X_n<5.5)\)。\(\mu=\sigma^2=5\):\(\mathbb P(\bar X_n<5.5)=\mathbb P\left(\frac{\sqrt n(\bar X_n-\mu)}\sigma<\frac{\sqrt{125}(5.5-5)}{\sqrt5}\right)\approx\mathbb P(Z<2.5)=.9938\)。

实际很少知道 \(\sigma\),可用样本方差 \(S_n^2=\frac1{n-1}\sum(X_i-\bar X_n)^2\) 估计。 定理 5.10:在 CLT 条件下,\(\frac{\sqrt n(\bar X_n-\mu)}{S_n}\rightsquigarrow N(0,1)\)。(由 Slutsky 定理与 \(S_n\xrightarrow P\sigma\) 推得。)

定理 5.11(Berry–Esseen 不等式):若 \(\mathbb E|X_1|^3<\infty\),则

\[\sup_z|\mathbb P(Z_n\le z)-\Phi(z)|\le\frac{33}4\frac{\mathbb E|X_1-\mu|^3}{\sqrt n\,\sigma^3}.\tag{5.4}\]
正态近似误差以 \(1/\sqrt n\) 速度下降,并与三阶绝对矩(偏度/尾部)成正比。

定理 5.12(多元 CLT):\(X_1,\dots,X_n\) 为 IID 随机向量 \(X_i=(X_{1i},\dots,X_{ki})^T\),均值 \(\mu=(\mu_1,\dots,\mu_k)^T\),方差矩阵 \(\Sigma\);令 \(\bar X=(\bar X_1,\dots,\bar X_k)^T\),\(\bar X_j=\frac1n\sum_iX_{ji}\)。则 \(\sqrt n(\bar X-\mu)\rightsquigarrow N(0,\Sigma)\)。

5.5 Delta 方法(The Delta Method)(PDF p.93–94)

若 \(Y_n\) 有极限正态分布,Delta 方法给出光滑函数 \(g(Y_n)\) 的极限分布。

定理 5.13(Delta 方法):若 \(\frac{\sqrt n(Y_n-\mu)}\sigma\rightsquigarrow N(0,1)\),\(g\) 可微且 \(g'(\mu)\ne0\),则

\[\frac{\sqrt n(g(Y_n)-g(\mu))}{|g'(\mu)|\sigma}\rightsquigarrow N(0,1),\quad\text{即}\quad Y_n\approx N\!\left(\mu,\frac{\sigma^2}n\right)\Rightarrow g(Y_n)\approx N\!\left(g(\mu),(g'(\mu))^2\frac{\sigma^2}n\right).\]
(思路:一阶泰勒展开 \(g(Y_n)\approx g(\mu)+g'(\mu)(Y_n-\mu)\)。)

例 5.14:\(X_i\) IID,\(W_n=e^{\bar X_n}\),\(g(s)=e^s\),\(g'(s)=e^s\),故 \(W_n\approx N(e^\mu,e^{2\mu}\sigma^2/n)\)。

定理 5.15(多元 Delta 方法):\(Y_n=(Y_{n1},\dots,Y_{nk})\) 满足 \(\sqrt n(Y_n-\mu)\rightsquigarrow N(0,\Sigma)\);\(g:\mathbb R^k\to\mathbb R\),梯度 \(\nabla g(y)=(\partial g/\partial y_1,\dots,\partial g/\partial y_k)^T\),\(\nabla_\mu\) 为其在 \(\mu\) 处的值且各元素非零。则

\[\sqrt n(g(Y_n)-g(\mu))\rightsquigarrow N(0,\nabla_\mu^T\Sigma\nabla_\mu).\]

例 5.16:IID 二维向量 \((X_{1i},X_{2i})^T\),均值 \((\mu_1,\mu_2)^T\)、方差 \(\Sigma=(\sigma_{jk})\)。\(Y_n=\bar X_1\bar X_2=g(\bar X_1,\bar X_2)\),\(g(s_1,s_2)=s_1s_2\),\(\nabla g=(s_2,s_1)^T\)。

\[\nabla_\mu^T\Sigma\nabla_\mu=\mu_2^2\sigma_{11}+2\mu_1\mu_2\sigma_{12}+\mu_1^2\sigma_{22},\]
故 \(\sqrt n(\bar X_1\bar X_2-\mu_1\mu_2)\rightsquigarrow N(0,\mu_2^2\sigma_{11}+2\mu_1\mu_2\sigma_{12}+\mu_1^2\sigma_{22})\)。

5.6 文献注(PDF p.94)

收敛在现代概率论中居中心地位:Grimmett & Stirzaker (1982)、Karr (1993)、Billingsley (1979);高级收敛理论见 van der Vaart & Wellner (1996)、van der Vaart (1998)。

5.7 附录(PDF p.95–96)

5.7.1 几乎必然收敛与 \(L_1\) 收敛:

  • 几乎必然收敛(almost surely)\(X_n\xrightarrow{as}X\):\(\mathbb P(\{s:X_n(s)\to X(s)\})=1\)。
  • \(L_1\) 收敛 \(X_n\xrightarrow{L_1}X\):\(\mathbb E|X_n-X|\to0\)。 定理 5.17:(a) 几乎必然 ⇒ 依概率;(b) 均方 ⇒ \(L_1\);(c) \(L_1\) ⇒ 依概率。 定理 5.18(强大数定律,SLLN):\(X_1,X_2,\dots\) IID,若 \(\mathbb E|X_1|<\infty\),则 \(\bar X_n\xrightarrow{as}\mu\)。(弱定律说依概率,强定律说几乎必然。) 渐近一致可积(asymptotically uniformly integrable):\(\lim_{M\to\infty}\limsup_{n\to\infty}\mathbb E(|X_n|I(|X_n|>M))=0\)。 定理 5.19:若 \(X_n\xrightarrow Pb\) 且渐近一致可积,则 \(\mathbb E(X_n)\to b\)。

5.7.2 CLT 证明(假设 MGF 在 0 的邻域有限): 引理 5.20:若 \(Z_n\) 的 MGF \(\psi_n(t)\to\psi(t)\)(\(Z\) 的 MGF)在 0 附近某开区间成立,则 \(Z_n\rightsquigarrow Z\)。 证明:令 \(Y_i=(X_i-\mu)/\sigma\),\(Z_n=n^{-1/2}\sum Y_i\)。设 \(\psi\) 为 \(Y_i\) 的 MGF,则 \(\sum Y_i\) 的 MGF 为 \(\psi(t)^n\),\(Z_n\) 的 MGF 为 \(\xi_n(t)=[\psi(t/\sqrt n)]^n\)。\(\psi'(0)=\mathbb E Y_1=0\),\(\psi''(0)=\mathbb E Y_1^2=1\),故 \(\psi(t)=1+\frac{t^2}2+\frac{t^3}{3!}\psi'''(0)+\cdots\)。于是

\[\xi_n(t)=\left[1+\frac{t^2}{2n}+\frac{t^3}{3!n^{3/2}}\psi'''(0)+\cdots\right]^n=\left[1+\frac{\frac{t^2}2+\frac{t^3}{3!n^{1/2}}\psi'''(0)+\cdots}n\right]^n\to e^{t^2/2},\]
即 \(N(0,1)\) 的 MGF。最后一步用到:若 \(a_n\to a\),则 \((1+a_n/n)^n\to e^a\)。

5.8 习题(PDF p.96–98)概览

共 16 题:题 1 证明 \(\mathbb E(S_n^2)=\sigma^2\) 且 \(S_n^2\xrightarrow P\sigma^2\)(提示:\(S_n^2=c_nn^{-1}\sum X_i^2-d_n\bar X_n^2\),\(c_n,d_n\to1\),再用大数律与定理 5.5(e));题 2 \(X_n\xrightarrow{qm}b\) 当且仅当 \(\mathbb E X_n\to b\) 且 \(\mathbb V X_n\to0\);题 3 方差有限时 \(\bar X_n\xrightarrow{qm}\mu\);题 4 \(\mathbb P(X_n=1/n)=1-1/n^2\)、\(\mathbb P(X_n=n)=1/n^2\) 是否依概率/均方收敛;题 5 伯努利的 \(\frac1n\sum X_i^2\) 依概率与均方收敛到 \(p\);题 6 身高均值 68、标准差 2.6,抽 100 人平均身高 ≥68 的近似概率;题 7 \(X_n\sim\) Poisson\((1/n)\),证 \(X_n\xrightarrow P0\) 与 \(nX_n\xrightarrow P0\);题 8 100 页代码每页错误数 Poisson(1),用 CLT 近似 \(\mathbb P(Y<90)\);题 9 \(X_n\) 以概率 \(1/n\) 取 \(e^n\) 否则等于 \(X\),判断各种收敛;题 10 正态尾的矩界 \(\mathbb P(|Z|>t)\le\mathbb E|Z|^k/t^k\) 并与 Mill 比较;题 11 \(X_n\sim N(0,1/n)\) 是否依概率/依分布收敛到点质量;题 12 整数值变量依分布收敛当且仅当各点概率收敛;题 13 \(X_n=n\min\{Z_1,\dots,Z_n\}\) 依分布收敛到均值 \(1/\lambda\) 的指数分布(\(\lambda=\lim_{x\downarrow0}f(x)\));题 14 \(Y_n=\bar X_n^2\)(均匀样本)的极限分布(Delta 方法);题 15 \(Y_n=\bar X_1/\bar X_2\) 的极限分布(多元 Delta 方法);题 16 构造 \(X_n\rightsquigarrow X\)、\(Y_n\rightsquigarrow Y\) 但 \(X_n+Y_n\) 不依分布收敛到 \(X+Y\) 的例子。

本章要点

  1. 三种主要收敛:均方 ⇒ 依概率 ⇒ 依分布;依分布到常数 ⇔ 依概率到常数;附录补充几乎必然与 \(L_1\)。反例要记住。
  2. 依概率收敛不保证期望收敛(需一致可积)。
  3. 连续映射定理与 Slutsky 定理是推导渐近分布的基本工具。
  4. 弱/强大数定律:样本均值收敛到总体均值。
  5. CLT:\(\sqrt n(\bar X_n-\mu)/\sigma\rightsquigarrow N(0,1)\);用 \(S_n\) 替代 \(\sigma\) 仍成立;Berry–Esseen 给出 \(O(1/\sqrt n)\) 误差,与三阶矩有关;有多元版本。
  6. Delta 方法(一元、多元)把渐近正态性传递到光滑函数,方差为 \(g'(\mu)^2\sigma^2/n\) 或 \(\nabla^T\Sigma\nabla/n\)。

与量化交易的关联

  • 回测统计的理论基础:大数定律保证样本平均收益收敛到真实期望收益;CLT 给出均值估计的标准误 \(\sigma/\sqrt n\),即"t 统计量 = 均值/(标准差/√n)"的来源。日收益 Sharpe 的 t 值 ≈ SR·√T。
  • Delta 方法计算 Sharpe 比率的标准误:Sharpe = \(\mu/\sigma\) 是均值和二阶矩的函数,用多元 Delta 方法(例 5.16 的思路)可得 IID 正态下 \(\text{SE}(\widehat{SR})\approx\sqrt{(1+SR^2/2)/n}\)(Lo 2002);同理可求波动率、Beta、信息比率、对数收益变换等统计量的渐近方差。
  • Berry–Esseen 与厚尾:收益偏度和峰度大时,正态近似收敛慢,小样本下的 t 检验、正态 VaR 可能失准;三阶矩越大,所需样本越多。
  • 依概率收敛 ≠ 期望收敛:5.2 节的反例(以小概率取极大值)正是"卖出深虚值期权/拾硬币于压路机前"策略的写照——几乎总是赚钱,期望却可能为负或无穷。
  • 聚合与时间尺度:CLT 解释为何低频(月、季)收益比高频收益更接近正态;但 CLT 需要独立(或弱相依)和有限方差,波动聚集和厚尾会削弱这一结论。
  • 多元 CLT:样本均值向量、样本协方差矩阵的渐近正态性是组合优化输入误差分析的基础。

推荐习题

  • 题 1(样本方差的无偏性与相合性);题 14、15(Delta 方法,可改编为 Sharpe 比率标准误);题 8、6(CLT 数值近似);题 4、9、11、16(理解各种收敛的区别与反例);题 13(极值的极限分布)。

第 II 部分 统计推断(Statistical Inference)(扉页 PDF p.99)

第 6 章 模型、统计推断与学习(Models, Statistical Inference and Learning)(PDF p.100–109)

6.1 引言(PDF p.100)

统计推断(statistical inference),在计算机科学中称为"学习"(learning),是用数据推断生成数据之分布的过程。典型问题:给定样本 \(X_1,\dots,X_n\sim F\),如何推断 \(F\)?有时只需推断 \(F\) 的某个特征(如均值)。

6.2 参数模型与非参数模型(Parametric and Nonparametric Models)(PDF p.100–102)

统计模型(statistical model)\(\mathfrak F\) 是一组分布(或密度、回归函数)。参数模型(parametric model)可由有限个参数刻画,例如正态模型

\[\mathfrak F=\left\{f(x;\mu,\sigma)=\frac1{\sigma\sqrt{2\pi}}\exp\left\{-\frac1{2\sigma^2}(x-\mu)^2\right\},\ \mu\in\mathbb R,\sigma>0\right\}\tag{6.1}\]
是两参数模型;写作 \(f(x;\mu,\sigma)\) 表示 \(x\) 是变量取值,\(\mu,\sigma\) 是参数。一般形式 \(\mathfrak F=\{f(x;\theta):\theta\in\Theta\}\) (6.2),\(\theta\) 为未知参数(或参数向量),\(\Theta\) 为参数空间(parameter space)。若只关心 \(\theta\) 的某个分量,其余称为冗余参数(nuisance parameters)。非参数模型(nonparametric model)不能由有限个参数刻画,例如 \(\mathfrak F_{ALL}=\{\text{所有 CDF}\}\)。(脚注:两者区分实际更微妙,本书不需要严格定义。)

例 6.1(一维参数估计):\(X_i\) 独立 Bernoulli\((p)\),估计 \(p\)。 例 6.2(二维参数估计):\(X_i\sim F\),假设 PDF 属于 (6.1),估计 \(\mu,\sigma\);若只关心 \(\mu\),则 \(\mu\) 为感兴趣参数(parameter of interest),\(\sigma\) 为冗余参数。 例 6.3(CDF 的非参数估计):只假设 \(F\in\mathfrak F_{ALL}\),估计 \(F\)。 例 6.4(非参数密度估计):估计 \(f=F'\)。仅假设 \(F\in\mathfrak F_{ALL}\) 时无法估计 \(f\),需加光滑性假设,例如 \(f\in\mathfrak F=\mathfrak F_{DENS}\cap\mathfrak F_{SOB}\),\(\mathfrak F_{DENS}\) 为全体密度,\(\mathfrak F_{SOB}=\{f:\int(f''(x))^2dx<\infty\}\) 为 Sobolev 空间——"不太扭曲(not too wiggly)"的函数集合。 例 6.5(泛函的非参数估计):只假设均值存在,估计 \(\mu=\mathbb E X_1=\int x\,dF(x)\)。均值可看作 \(F\) 的函数 \(\mu=T(F)\)。一般地,\(F\) 的任意函数称为统计泛函(statistical functional);例:方差 \(T(F)=\int x^2dF-(\int x\,dF)^2\),中位数 \(T(F)=F^{-1}(1/2)\)。 例 6.6(回归、预测与分类):观测成对数据 \((X_1,Y_1),\dots,(X_n,Y_n)\)(如血压与寿命)。\(X\) 称预测变量(predictor)、回归变量(regressor)、特征(feature)、自变量(independent variable);\(Y\) 称结果(outcome)、响应变量(response variable)、因变量(dependent variable)。\(r(x)=\mathbb E(Y\mid X=x)\) 称回归函数(regression function)。\(r\) 属于有限维集合(如所有直线)时为参数回归模型,否则为非参数回归模型。基于新个体的 \(X\) 预测 \(Y\) 称为预测(prediction);\(Y\) 离散时称分类(classification);估计函数 \(r\) 本身称回归或曲线估计(curve estimation)。回归模型常写成

\[Y=r(X)+\epsilon,\quad\mathbb E(\epsilon)=0.\tag{6.3}\]
任何回归都可以这样写:令 \(\epsilon=Y-r(X)\),则 \(\mathbb E\epsilon=\mathbb E\,\mathbb E(\epsilon\mid X)=\mathbb E(\mathbb E(Y\mid X)-r(X))=0\)。

接下来:多数入门课先讲参数推断,本书先讲非参数推断,因为某些方面它更易理解、更有用。 频率学派与贝叶斯学派:两大主流推断方法,本书都讲,先讲频率学派,优劣比较留待后文。 记号:参数模型中 \(\mathbb P_\theta(X\in A)=\int_Af(x;\theta)dx\),\(\mathbb E_\theta(r(X))=\int r(x)f(x;\theta)dx\),\(\mathbb V_\theta\) 类似。下标 \(\theta\) 表示"关于 \(f(x;\theta)\) 求概率/期望",不是对 \(\theta\) 求平均。

6.3 推断的基本概念(Fundamental Concepts in Inference)(PDF p.103–108)

多数推断问题属于三类:估计、置信集、假设检验。

6.3.1 点估计(Point Estimation)(PDF p.103–105)

点估计指对某个感兴趣量给出单一"最佳猜测",对象可以是参数、CDF \(F\)、密度 \(f\)、回归函数 \(r\),或某随机变量未来值 \(Y\) 的预测。约定点估计记为 \(\hat\theta\) 或 \(\hat\theta_n\)。\(\theta\) 是固定的未知量;\(\hat\theta\) 依赖数据,是随机变量。

形式上,\(X_1,\dots,X_n\) IID 来自 \(F\),参数 \(\theta\) 的点估计量(point estimator)是数据的函数 \(\hat\theta_n=g(X_1,\dots,X_n)\)。

  • 偏差(bias):\(\text{bias}(\hat\theta_n)=\mathbb E_\theta(\hat\theta_n)-\theta\) (6.4);\(\mathbb E(\hat\theta_n)=\theta\) 时称无偏(unbiased)。作者指出无偏性过去很受重视,如今被认为不那么重要,本书许多估计量是有偏的。
  • 定义 6.7(相合性,consistency):若 \(\hat\theta_n\xrightarrow P\theta\),称 \(\hat\theta_n\) 相合。(合理的要求:数据越多越接近真值。)
  • \(\hat\theta_n\) 的分布称为抽样分布(sampling distribution);其标准差称为标准误(standard error):\(\text{se}=\text{se}(\hat\theta_n)=\sqrt{\mathbb V(\hat\theta_n)}\) (6.5)。se 通常依赖未知的 \(F\),因而本身未知,但一般可以估计,估计值记 \(\widehat{\text{se}}\)。

例 6.8:Bernoulli,\(\hat p_n=n^{-1}\sum X_i\),\(\mathbb E\hat p_n=p\) 无偏;\(\text{se}=\sqrt{p(1-p)/n}\),\(\widehat{\text{se}}=\sqrt{\hat p(1-\hat p)/n}\)。

均方误差(mean squared error, MSE):\(\text{MSE}=\mathbb E_\theta(\hat\theta_n-\theta)^2\) (6.6)。\(\mathbb E_\theta\) 是关于生成数据的分布 \(f(x_1,\dots,x_n;\theta)=\prod f(x_i;\theta)\) 求期望,不是对 \(\theta\) 求平均。

定理 6.9(偏差-方差分解):

\[\text{MSE}=\text{bias}^2(\hat\theta_n)+\mathbb V_\theta(\hat\theta_n).\tag{6.7}\]
证明:令 \(\bar\theta_n=\mathbb E_\theta\hat\theta_n\),\(\mathbb E(\hat\theta_n-\theta)^2=\mathbb E(\hat\theta_n-\bar\theta_n+\bar\theta_n-\theta)^2=\mathbb E(\hat\theta_n-\bar\theta_n)^2+2(\bar\theta_n-\theta)\mathbb E(\hat\theta_n-\bar\theta_n)+(\bar\theta_n-\theta)^2\),中间项为 0。

定理 6.10:若 \(n\to\infty\) 时 bias → 0 且 se → 0,则 \(\hat\theta_n\) 相合。证明:MSE → 0 即均方收敛,由定理 5.4(a) 得依概率收敛。(原文引用写作 5.4(b),实为 (a)。) 例 6.11:\(\hat p_n\) 无偏且 \(\text{se}\to0\),故相合。

定义 6.12(渐近正态):\(\frac{\hat\theta_n-\theta}{\text{se}}\rightsquigarrow N(0,1)\) (6.8)。许多估计量近似正态。

6.3.2 置信集(Confidence Sets)(PDF p.105–107)

参数 \(\theta\) 的 \(1-\alpha\) 置信区间(confidence interval)\(C_n=(a,b)\),\(a=a(X_1,\dots,X_n)\)、\(b=b(X_1,\dots,X_n)\) 是数据的函数,满足

\[\mathbb P_\theta(\theta\in C_n)\ge1-\alpha,\quad\text{对所有 }\theta\in\Theta.\tag{6.9}\]
即 \((a,b)\) 以概率 \(1-\alpha\) 套住 \(\theta\);\(1-\alpha\) 称为覆盖率(coverage)。警告:\(C_n\) 是随机的,\(\theta\) 是固定的。 常用 95%(\(\alpha=0.05\));\(\theta\) 为向量时用置信集(球、椭球等)。

警告(解释):置信区间不是关于 \(\theta\) 的概率陈述,因为 \(\theta\) 不是随机变量。有些教材解释为"重复同一实验,区间 95% 的时间包含参数",这对但无用,因为很少重复同一实验。更好的解释:第 1 天收集数据为参数 \(\theta_1\) 构造 95% 区间,第 2 天为不相关的 \(\theta_2\) 构造,依此类推……你构造的所有区间中有 95% 套住了各自的真参数——无须引入"重复同一实验"。

例 6.13(民调):"83% 的人支持给飞行员配枪,误差 ±4 个百分点,95% 的时间准确"即 83±4 是 95% 置信区间。如果你余生每天都这样构造区间,95% 会包含真参数,即使每天估计的是不同问题。

例 6.14(Berger & Wolpert 1984 的反例):\(\theta\) 为固定实数,\(X_1,X_2\) 独立且 \(\mathbb P(X_i=\pm1)=1/2\),只观测 \(Y_i=\theta+X_i\)。定义只含一个点的"置信区间":若 \(Y_1=Y_2\),\(C=\{Y_1-1\}\);若 \(Y_1\ne Y_2\),\(C=\{(Y_1+Y_2)/2\}\)。无论 \(\theta\) 为何,\(\mathbb P_\theta(\theta\in C)=3/4\),是 75% 置信区间。若观测到 \(Y_1=15\)、\(Y_2=17\),区间为 \(\{16\}\),而此时我们确定 \(\theta=16\);若要做关于 \(\theta\) 的概率陈述,会说 \(\mathbb P(\theta\in C\mid Y_1,Y_2)=1\)。说 \(\{16\}\) 是 75% 置信区间没错,但它不是关于 \(\theta\) 的概率陈述。第 11 章贝叶斯方法把 \(\theta\) 当随机变量,给出"给定数据时 \(\theta\) 在 \(C_n\) 内的概率为 95%"之类陈述,但那是信念度概率,一般并不保证 95% 的时间套住参数。

例 6.15:硬币问题中 \(C_n=(\hat p_n-\epsilon_n,\hat p_n+\epsilon_n)\),\(\epsilon_n^2=\log(2/\alpha)/(2n)\),由 Hoeffding 不等式 (4.4),\(\mathbb P(p\in C_n)\ge1-\alpha\) 对所有 \(p\) 成立。

定理 6.16(基于正态的置信区间):设 \(\hat\theta_n\approx N(\theta,\widehat{\text{se}}^2)\),\(z_{\alpha/2}=\Phi^{-1}(1-\alpha/2)\),即 \(\mathbb P(Z>z_{\alpha/2})=\alpha/2\),\(\mathbb P(-z_{\alpha/2}<Z<z_{\alpha/2})=1-\alpha\)。令

\[C_n=(\hat\theta_n-z_{\alpha/2}\widehat{\text{se}},\ \hat\theta_n+z_{\alpha/2}\widehat{\text{se}}),\tag{6.10}\]
则 \(\mathbb P_\theta(\theta\in C_n)\to1-\alpha\) (6.11)。证明:\(Z_n=(\hat\theta_n-\theta)/\widehat{\text{se}}\rightsquigarrow Z\),\(\mathbb P(\hat\theta_n-z\widehat{\text{se}}<\theta<\hat\theta_n+z\widehat{\text{se}})=\mathbb P(-z<Z_n<z)\to1-\alpha\)。95% 时 \(z_{.025}=1.96\approx2\),得近似区间 \(\hat\theta_n\pm2\widehat{\text{se}}\)。

例 6.17:Bernoulli,\(\mathbb V(\hat p_n)=p(1-p)/n\),由 CLT 得近似区间 \(\hat p_n\pm z_{\alpha/2}\sqrt{\hat p_n(1-\hat p_n)/n}\)(Wald 区间)。与例 6.15 相比:正态区间更短,但只有近似(大样本)正确的覆盖率;Hoeffding 区间有限样本严格成立但更宽。

6.3.3 假设检验(Hypothesis Testing)(PDF p.107–108)

从一个默认理论——原假设(null hypothesis)出发,问数据是否提供足够证据拒绝它;若否,则保留原假设("retaining the null"一词来自 Chris Genovese;其他说法:"接受原假设""未能拒绝原假设")。 例 6.18(检验硬币是否公平):\(H_0:p=1/2\) vs \(H_1:p\ne1/2\)(\(H_1\) 为备择假设 alternative hypothesis)。合理做法是当 \(T=|\hat p_n-1/2|\) 大时拒绝 \(H_0\);多大才拒绝留待第 10 章。

6.4 文献注(PDF p.108)

入门:DeGroot & Schervish (2002)、Larsen & Marx (1986);中级:Casella & Berger (2002)、Bickel & Doksum (2000)、Rice (1995);高级:Cox & Hinkley (2000)、Lehmann & Casella (1998)、Lehmann (1986)、van der Vaart (1998)。

6.5 附录(PDF p.108)

本书定义要求对所有 \(\theta\) 有 \(\mathbb P_\theta(\theta\in C_n)\ge1-\alpha\)(有限样本)。逐点渐近置信区间(pointwise asymptotic):对所有 \(\theta\),\(\liminf_n\mathbb P_\theta(\theta\in C_n)\ge1-\alpha\);一致渐近置信区间(uniform asymptotic):\(\liminf_n\inf_\theta\mathbb P_\theta(\theta\in C_n)\ge1-\alpha\)。基于正态的近似区间是逐点渐近置信区间。

6.6 习题(PDF p.108–109)

共 3 题:Poisson 样本均值 \(\hat\lambda\) 的 bias、se、MSE;Uniform\((0,\theta)\) 下 \(\hat\theta=\max X_i\) 的 bias、se、MSE;Uniform\((0,\theta)\) 下 \(\hat\theta=2\bar X_n\) 的 bias、se、MSE(两者比较体现有偏估计可能 MSE 更小)。

本章要点

  1. 统计模型分参数与非参数;感兴趣参数与冗余参数;统计泛函 \(T(F)\) 统一了均值、方差、中位数等目标。
  2. 回归函数 \(r(x)=\mathbb E(Y\mid X=x)\),任何回归都可写成 \(Y=r(X)+\epsilon\),\(\mathbb E\epsilon=0\)。
  3. 点估计的评价:偏差、标准误、MSE = 偏差² + 方差;相合性;渐近正态。
  4. 置信区间是关于随机区间的覆盖率陈述,不是关于参数的概率陈述;正态区间 \(\hat\theta\pm z_{\alpha/2}\widehat{\text{se}}\) 是渐近的,Hoeffding 区间是有限样本的。
  5. 假设检验的基本框架:原假设、备择假设、检验统计量。

与量化交易的关联

  • 偏差-方差权衡是因子研究与模型选择的核心:收缩估计(如 Ledoit–Wolf 协方差收缩、岭回归因子模型)有意引入偏差以大幅降低方差,从而降低 MSE;习题 2、3 的对比是很好的入门例子。
  • 标准误思维:任何回测指标(平均收益、Sharpe、IC、胜率)都是样本统计量,有抽样分布和标准误;报告点估计必须同时报告 se 或置信区间。
  • 置信区间的正确解释:例 6.13 的"每天构造不相关区间,95% 正确"的解释适合向投研团队讲解:一个研究员长期报告的 95% 区间,大约 5% 会出错。
  • 回归函数 \(\mathbb E(Y\mid X)\) 即"给定因子暴露时的条件期望收益",预测任务就是估计它;分类对应涨跌方向预测。
  • 冗余参数:例如估计 alpha 时市场 beta 和残差波动率是冗余参数。
  • 假设检验为第 10 章"策略是否有效"的统计检验做铺垫。

推荐习题

  • 题 2、3(比较 \(\max X_i\) 与 \(2\bar X_n\):有偏但 MSE 更小的估计量);题 1(基本计算)。

第 7 章 估计 CDF 与统计泛函(Estimating the CDF and Statistical Functionals)(PDF p.110–118)

第一个推断问题:非参数地估计 CDF \(F\),再估计统计泛函(均值、方差、相关系数等 CDF 的函数)。非参数估计泛函的方法称为插入法(plug-in method)。

7.1 经验分布函数(The Empirical Distribution Function)(PDF p.110–112)

定义 7.1:\(X_1,\dots,X_n\sim F\) IID。经验分布函数(empirical distribution function)\(\hat F_n\) 是在每个数据点放 \(1/n\) 质量的 CDF:

\[\hat F_n(x)=\frac{\sum_{i=1}^nI(X_i\le x)}n,\qquad I(X_i\le x)=\begin{cases}1&X_i\le x\\0&X_i>x\end{cases}\tag{7.1}\]

例 7.2(神经数据):Cox & Lewis (1966) 记录了神经纤维上相邻脉冲之间的 799 个等待时间。图 7.1 画出经验 CDF(底部竖线为数据点,上下两条线为 95% 置信带)。估计等待时间介于 .4 与 .6 秒之间的比例:\(\hat F_n(.6)-\hat F_n(.4)=.93-.84=.09\)。

定理 7.3:对任意固定 \(x\),

\[\mathbb E(\hat F_n(x))=F(x),\quad\mathbb V(\hat F_n(x))=\frac{F(x)(1-F(x))}n,\quad\text{MSE}=\frac{F(x)(1-F(x))}n\to0,\quad\hat F_n(x)\xrightarrow PF(x).\]
(因 \(n\hat F_n(x)\sim\) Binomial\((n,F(x))\)。)

定理 7.4(Glivenko–Cantelli 定理):\(\sup_x|\hat F_n(x)-F(x)|\xrightarrow P0\)(更精确地,几乎必然收敛)。即经验 CDF 一致收敛于真 CDF。

定理 7.5(Dvoretzky–Kiefer–Wolfowitz (DKW) 不等式):对任意 \(\epsilon>0\),

\[\mathbb P\left(\sup_x|F(x)-\hat F_n(x)|>\epsilon\right)\le2e^{-2n\epsilon^2}.\tag{7.2}\]

\(F\) 的非参数 \(1-\alpha\) 置信带:

\[L(x)=\max\{\hat F_n(x)-\epsilon_n,0\},\quad U(x)=\min\{\hat F_n(x)+\epsilon_n,1\},\quad\epsilon_n=\sqrt{\frac1{2n}\log\frac2\alpha}.\]
由 (7.2),对任何 \(F\),\(\mathbb P(L(x)\le F(x)\le U(x)\ \forall x)\ge1-\alpha\) (7.3)。这是同时对所有 \(x\) 成立的置信带(confidence band)。 例 7.6:图 7.1 虚线为 95% 置信带,\(\epsilon_n=\sqrt{\frac1{2\cdot799}\log\frac2{.05}}=.048\)。

7.2 统计泛函(Statistical Functionals)(PDF p.112–116)

统计泛函 \(T(F)\) 是 \(F\) 的任意函数,例如均值 \(\mu=\int x\,dF\)、方差 \(\sigma^2=\int(x-\mu)^2dF\)、中位数 \(m=F^{-1}(1/2)\)。

定义 7.7:\(\theta=T(F)\) 的插入估计量(plug-in estimator)为 \(\hat\theta_n=T(\hat F_n)\),即把未知的 \(F\) 换成 \(\hat F_n\)。 定义 7.8:若 \(T(F)=\int r(x)dF(x)\),称 \(T\) 为线性泛函(linear functional),因为 \(T(aF+bG)=aT(F)+bT(G)\)。 定理 7.9:线性泛函的插入估计量为

\[T(\hat F_n)=\int r(x)d\hat F_n(x)=\frac1n\sum_{i=1}^nr(X_i).\tag{7.4}\]
(因 \(\hat F_n\) 在每个数据点放 \(1/n\) 质量。)

有时可通过计算得 \(\widehat{\text{se}}\),但许多情况并不明显,第 8 章给出通用方法(bootstrap)。在许多情况下

\[T(\hat F_n)\approx N(T(F),\widehat{\text{se}}^2),\tag{7.5}\]
由 (6.11),近似 \(1-\alpha\) 置信区间为 \(T(\hat F_n)\pm z_{\alpha/2}\widehat{\text{se}}\) (7.6),称为正态区间(Normal-based interval);95% 时为 \(T(\hat F_n)\pm2\widehat{\text{se}}\)。

例 7.10(均值):\(\hat\mu=\int x\,d\hat F_n=\bar X_n\),\(\text{se}=\sigma/\sqrt n\),\(\widehat{\text{se}}=\hat\sigma/\sqrt n\),正态区间 \(\bar X_n\pm z_{\alpha/2}\widehat{\text{se}}\)。 例 7.11(方差):\(\sigma^2=\int x^2dF-(\int x\,dF)^2\),插入估计

\[\hat\sigma^2=\frac1n\sum X_i^2-\left(\frac1n\sum X_i\right)^2=\frac1n\sum(X_i-\bar X_n)^2.\]
另一合理估计是样本方差 \(S_n^2=\frac1{n-1}\sum(X_i-\bar X_n)^2\);实践中差别很小,用哪个都行。 例 7.12(偏度):\(\kappa=\frac{\mathbb E(X-\mu)^3}{\sigma^3}=\frac{\int(x-\mu)^3dF}{\{\int(x-\mu)^2dF\}^{3/2}}\),度量分布的不对称性。插入估计 \(\hat\kappa=\frac{\frac1n\sum(X_i-\hat\mu)^3}{\hat\sigma^3}\)。 例 7.13(相关系数):\(Z=(X,Y)\),\(\rho=T(F)=a(T_1(F),\dots,T_5(F))\),其中 \(T_1=\int x\,dF\),\(T_2=\int y\,dF\),\(T_3=\int xy\,dF\),\(T_4=\int x^2dF\),\(T_5=\int y^2dF\),\(a(t_1,\dots,t_5)=\frac{t_3-t_1t_2}{\sqrt{(t_4-t_1^2)(t_5-t_2^2)}}\)。把每个 \(T_j\) 换成 \(T_j(\hat F_n)\),得样本相关系数
\[\hat\rho=\frac{\sum(X_i-\bar X_n)(Y_i-\bar Y_n)}{\sqrt{\sum(X_i-\bar X_n)^2}\sqrt{\sum(Y_i-\bar Y_n)^2}}.\]
例 7.14(分位数):\(F\) 严格递增有密度,\(0<p<1\),第 \(p\) 分位数 \(T(F)=F^{-1}(p)\)。\(\hat F_n\) 不可逆,为避免歧义定义 \(\hat F_n^{-1}(p)=\inf\{x:\hat F_n(x)\ge p\}\),称为第 \(p\) 样本分位数(sample quantile)。

除均值外,上述例子的标准误如何求?参数方法将给出公式(第 9 章),非参数情形用第 8 章的 bootstrap。

例 7.15(血浆胆固醇):Scott et al. (1978),371 名胸痛患者的血浆胆固醇(mg/dl),图 7.2 为两组直方图:51 人无心脏病证据,320 人动脉狭窄。视为来自 \(F_1,F_2\) 的样本。插入估计 \(\hat\mu_1=\bar X_{n,1}=195.27\),\(\hat\mu_2=216.19\)。\(\widehat{\text{se}}(\hat\mu)=\hat\sigma/\sqrt n\),\(\hat\sigma=\sqrt{\frac1n\sum(X_i-\hat\mu)^2}\),得 \(\widehat{\text{se}}(\hat\mu_1)=5.0\),\(\widehat{\text{se}}(\hat\mu_2)=2.4\);95% 区间 \((185,205)\)、\((211,221)\)。差 \(\theta=T(F_2)-T(F_1)\) 的插入估计 \(\hat\theta=20.92\),\(\text{se}=\sqrt{\mathbb V(\hat\mu_2-\hat\mu_1)}=\sqrt{\text{se}^2(\hat\mu_1)+\text{se}^2(\hat\mu_2)}\)(独立样本),估计 \(\widehat{\text{se}}=\sqrt{5^2+2.4^2}=5.55\);95% 区间 \(\hat\theta\pm2\widehat{\text{se}}=(9.8,32.0)\),提示动脉狭窄者胆固醇更高。但不能据此断言胆固醇导致心脏病——从统计证据到因果非常微妙(第 16 章)。

7.3 文献注(PDF p.117)

Glivenko–Cantelli 定理只是冰山一角,分布函数理论是经验过程(empirical processes)的特例,后者是现代统计理论的基础。参考 Shorack & Wellner (1986)、van der Vaart & Wellner (1996)。

7.4 习题(PDF p.117–118)概览

共 10 题:证明定理 7.3(题 1);两独立伯努利样本的 \(p\) 与 \(p-q\) 的插入估计、se、90% 区间(题 2);计算机实验:\(N(0,1)\) 与柯西各 100 个观测的 95% DKW 置信带,重复 1000 次检验覆盖率(题 3,DKW 带不依赖分布形式);用 CLT 求 \(\hat F_n(x)\) 的极限分布(题 4);\(\text{Cov}(\hat F_n(x),\hat F_n(y))\)(题 5);\(\theta=F(b)-F(a)\) 的估计、se 与区间(题 6);斐济附近地震震级数据:估计 CDF、95% 置信包络、\(F(4.9)-F(4.3)\) 的区间(题 7);老忠实泉喷发等待时间的均值、se、90% 区间与中位数(题 8);两种抗生素治愈率 90/100 与 85/100,\(\theta=p_1-p_2\) 的估计、se、80% 与 95% 区间(题 9);1975 年人工降雨实验(26 朵播撒碘化银 vs 26 朵对照,随机分配)均值差的估计与区间(题 10)。

本章要点

  1. 经验 CDF 是 \(F\) 的无偏、相合估计;Glivenko–Cantelli 给出一致收敛;DKW 不等式给出有限样本、分布无关的同时置信带。
  2. 插入原则:\(\hat\theta=T(\hat F_n)\);线性泛函的插入估计即样本平均 \(\frac1n\sum r(X_i)\)。
  3. 样本均值、方差、偏度、相关系数、分位数都是插入估计量。
  4. 正态区间 \(T(\hat F_n)\pm z_{\alpha/2}\widehat{\text{se}}\);独立两组差的 se 为各自 se 的平方和开方。
  5. 统计关联 ≠ 因果。

与量化交易的关联

  • 历史模拟法 VaR/ES 就是经验 CDF 的插入估计:VaR = 历史损益的样本分位数 \(\hat F_n^{-1}(\alpha)\),ES = 尾部样本平均(插入估计)。DKW 不等式可以给出整条经验收益分布的置信带,用于判断尾部估计的不确定性(需注意收益非 IID)。
  • 插入原则无处不在:样本均值、波动率、偏度、峰度、相关矩阵、Beta 都是插入估计;"把经验分布当真分布"是回测本身的隐含假设。
  • 两组比较(例 7.15、题 9)可直接迁移到"策略在两个样本期/两类股票上的平均收益差"及其标准误。
  • 偏度:收益偏度是风险溢价研究的重要特征(负偏资产要求更高溢价),其标准误需要 bootstrap(例 8.2)。
  • 因果提醒:因子与收益的相关不代表因果,回测中的伪相关需要警惕。

推荐习题

  • 题 3(DKW 置信带覆盖率模拟,正态与柯西对比);题 6、9(差值的 se 与置信区间);题 4、5(经验 CDF 的分布与协方差)。

第 8 章 Bootstrap(The Bootstrap)(PDF p.119–130)

Bootstrap 是估计标准误和计算置信区间的方法。\(T_n=g(X_1,\dots,X_n)\) 为统计量(数据的任意函数),想知道 \(\mathbb V_F(T_n)\);下标 \(F\) 强调方差通常依赖未知的 \(F\)。例如 \(T_n=\bar X_n\) 时 \(\mathbb V_F(T_n)=\sigma^2/n\),\(\sigma^2=\int(x-\mu)^2dF\),是 \(F\) 的函数。

Bootstrap 思想两步:

  • 第 1 步:用 \(\mathbb V_{\hat F_n}(T_n)\) 估计 \(\mathbb V_F(T_n)\);
  • 第 2 步:用模拟近似 \(\mathbb V_{\hat F_n}(T_n)\)。 对 \(T_n=\bar X_n\),第 1 步即可:\(\mathbb V_{\hat F_n}(T_n)=\hat\sigma^2/n\),\(\hat\sigma^2=n^{-1}\sum(X_i-\bar X_n)^2\)。复杂情形写不出 \(\mathbb V_{\hat F_n}(T_n)\) 的简单公式,才需要第 2 步。

8.1 模拟(Simulation)(PDF p.120)

从分布 \(G\) 抽 IID 样本 \(Y_1,\dots,Y_B\),由大数定律 \(\bar Y_n=\frac1B\sum Y_j\xrightarrow P\int y\,dG(y)=\mathbb E(Y)\)(\(B\to\infty\))。模拟中 \(B\) 可任意大,因此 \(\bar Y\) 与 \(\mathbb E Y\) 之差可以忽略。一般地,\(\frac1B\sum h(Y_j)\xrightarrow P\mathbb E h(Y)\);特别地

\[\frac1B\sum_{j=1}^B(Y_j-\bar Y)^2=\frac1B\sum Y_j^2-\left(\frac1B\sum Y_j\right)^2\xrightarrow P\mathbb E(Y^2)-(\mathbb E Y)^2=\mathbb V(Y),\]
所以可用模拟值的样本方差近似 \(\mathbb V(Y)\)。

8.2 Bootstrap 方差估计(Bootstrap Variance Estimation)(PDF p.120–122)

\(\mathbb V_{\hat F_n}(T_n)\) 指"若数据分布为 \(\hat F_n\),\(T_n\) 的方差"。模拟方法:从 \(\hat F_n\) 抽 \(X_1^*,\dots,X_n^*\),计算 \(T_n^*=g(X_1^*,\dots,X_n^*)\),即为 \(T_n\) 分布的一次抽样。图示:

  • 真实世界:\(F\Rightarrow X_1,\dots,X_n\Rightarrow T_n=g(X_1,\dots,X_n)\)
  • Bootstrap 世界:\(\hat F_n\Rightarrow X_1^*,\dots,X_n^*\Rightarrow T_n^*=g(X_1^*,\dots,X_n^*)\)

由于 \(\hat F_n\) 在每个数据点放 \(1/n\) 质量,从 \(\hat F_n\) 抽一个观测等价于从原数据中随机抽一个点,所以只需从原数据有放回地抽 \(n\) 个。

Bootstrap 方差估计算法:

  1. 抽 \(X_1^*,\dots,X_n^*\sim\hat F_n\);
  2. 计算 \(T_n^*=g(X_1^*,\dots,X_n^*)\);
  3. 重复 1–2 共 \(B\) 次,得 \(T_{n,1}^*,\dots,T_{n,B}^*\);
  4. \[v_{boot}=\frac1B\sum_{b=1}^B\left(T_{n,b}^*-\frac1B\sum_{r=1}^BT_{n,r}^*\right)^2;\tag{8.1}\]

\(\widehat{\text{se}}_{boot}=\sqrt{v_{boot}}\)。

例 8.1(中位数标准误的伪代码):

T <- median(X)
Tboot <- vector of length B
for (i in 1:B) {
  Xstar <- sample of size n from X (with replacement)
  Tboot[i] <- median(Xstar)
}
se <- sqrt(variance(Tboot))

(计算复杂度 \(O(B\cdot\text{cost}(g))\)。)

两层近似:\(\mathbb V_F(T_n)\overset{\text{不太小}}{\approx}\mathbb V_{\hat F_n}(T_n)\overset{\text{小}}{\approx}v_{boot}\)。第一层误差来自用 \(\hat F_n\) 代替 \(F\)(由样本量决定),第二层是模拟误差(\(B\) 足够大即可忽略)。

例 8.2:神经数据的偏度 \(\theta=\int(x-\mu)^3dF/\sigma^3\)(正态分布偏度为 0),插入估计 \(\hat\theta=\frac1n\sum(X_i-\bar X_n)^3/\hat\sigma^3\)。对每个 bootstrap 样本计算偏度,\(B=1000\) 得偏度估计的标准误 .16。

8.3 Bootstrap 置信区间(Bootstrap Confidence Intervals)(PDF p.122–127)

介绍三种方法。

方法 1:正态区间:\(T_n\pm z_{\alpha/2}\widehat{\text{se}}_{boot}\) (8.2)。除非 \(T_n\) 的分布接近正态,否则不准确。

方法 2:枢轴区间(Pivotal Intervals):\(\theta=T(F)\),\(\hat\theta_n=T(\hat F_n)\),定义枢轴量(pivot)\(R_n=\hat\theta_n-\theta\),其 CDF \(H(r)=\mathbb P_F(R_n\le r)\) (8.3)。令 \(C_n^*=(a,b)\),

\[a=\hat\theta_n-H^{-1}\!\left(1-\frac\alpha2\right),\quad b=\hat\theta_n-H^{-1}\!\left(\frac\alpha2\right).\tag{8.4}\]
则 \(\mathbb P(a\le\theta\le b)=\mathbb P(\hat\theta_n-b\le R_n\le\hat\theta_n-a)=H(\hat\theta_n-a)-H(\hat\theta_n-b)=H(H^{-1}(1-\alpha/2))-H(H^{-1}(\alpha/2))=1-\alpha\),是精确区间。但 \(a,b\) 依赖未知 \(H\),用 bootstrap 估计
\[\hat H(r)=\frac1B\sum_{b=1}^BI(R_{n,b}^*\le r),\quad R_{n,b}^*=\hat\theta_{n,b}^*-\hat\theta_n.\tag{8.5}\]
记 \(r_\beta^*\) 为 \(R^*\) 的 \(\beta\) 样本分位数,\(\theta_\beta^*\) 为 \(\hat\theta^*\) 的 \(\beta\) 样本分位数,\(r_\beta^*=\theta_\beta^*-\hat\theta_n\)。于是 \(\hat a=\hat\theta_n-r_{1-\alpha/2}^*=2\hat\theta_n-\theta_{1-\alpha/2}^*\),\(\hat b=\hat\theta_n-r_{\alpha/2}^*=2\hat\theta_n-\theta_{\alpha/2}^*\)。 \(1-\alpha\) bootstrap 枢轴置信区间:
\[C_n=\left(2\hat\theta_n-\hat\theta^*_{1-\alpha/2},\ 2\hat\theta_n-\hat\theta^*_{\alpha/2}\right).\tag{8.6}\]
定理 8.3:在 \(T(F)\) 的弱条件下,\(\mathbb P_F(T(F)\in C_n)\to1-\alpha\)(\(n\to\infty\))。

方法 3:百分位区间(Percentile Intervals):\(C_n=(\theta^*_{\alpha/2},\theta^*_{1-\alpha/2})\),即直接取 bootstrap 复制值的分位数。理由见附录。

例 8.4(神经数据偏度的 95% 区间):正态 (1.44, 2.09);枢轴 (1.48, 2.11);百分位 (1.42, 2.03)。三者都是近似的,精度相同;还有更精确但更复杂的 bootstrap 区间(如 BCa),本书不讨论。

例 8.5(胆固醇数据,中位数之差):伪代码——对两组分别有放回重抽样(各自保持原样本量 \(n_1,n_2\)),计算 median(xx2) − median(xx1),重复 \(B=1000\) 次;

Normal     <- (th.hat - 2*se, th.hat + 2*se)
percentile <- (quantile(Tboot,.025), quantile(Tboot,.975))
pivotal    <- (2*th.hat - quantile(Tboot,.975), 2*th.hat - quantile(Tboot,.025))

点估计 18.5,bootstrap se 7.42;95% 区间:正态 (3.7, 33.3),枢轴 (5.0, 34.0),百分位 (5.0, 33.3)。都不含 0,第二组胆固醇似乎更高,但区间宽,"高多少"不确定性很大。

作者提醒:下面两例样本量很小,小样本统计方法可能不可靠,仅供教学,结果需怀疑地看待。

例 8.6(Efron 最早的 bootstrap 示例:法学院数据):15 所法学院的 LSAT 与 GPA:LSAT = 576, 635, 558, 578, 666, 580, 555, 661, 651, 605, 653, 575, 545, 572, 594;GPA = 3.39, 3.30, 2.81, 3.03, 3.44, 3.07, 3.00, 3.43, 3.36, 3.13, 3.12, 2.74, 2.76, 2.88, 3.96。关心相关系数 \(\theta\),插入估计为样本相关 \(\hat\theta=.776\);\(B=1000\) 得 \(\widehat{\text{se}}=.137\)。图 8.1 上为散点图,下为 bootstrap 复制值直方图(近似 \(\hat\theta\) 的抽样分布,左偏)。正态 95% 区间 \(.78\pm2\widehat{\text{se}}=(.51,1.00)\),百分位区间 \((.46,.96)\);大样本下两者会更接近。

例 8.7(生物等效性,取自 Efron & Tibshirani 1993):药企推出新药时有时需证明生物等效(bioequivalence),即新药与现有疗法无实质差异。8 名受试者分别使用安慰剂、旧贴片、新贴片注入激素,数据(placebo/old/new/old−placebo/new−old): 1: 9243/17649/16449/8406/−1200;2: 9671/12013/14614/2342/2601;3: 11792/19979/17274/8187/−2705;4: 13357/21816/23798/8459/1982;5: 9055/13850/12560/4795/−1290;6: 6290/9806/10157/3516/351;7: 12412/17208/16570/4796/−638;8: 18806/29044/26325/10238/−2719。 令 \(Z\)=old−placebo,\(Y\)=new−old。FDA 要求 \(|\theta|\le.20\),\(\theta=\mathbb E_F(Y)/\mathbb E_F(Z)\)。插入估计 \(\hat\theta=\bar Y/\bar Z=-452.3/6342=-0.0713\);bootstrap se = 0.105;\(B=1000\) 得 95% 区间 \((-0.24,0.15)\),不完全落在 \((-0.20,0.20)\) 内,因此在 95% 水平上未能证明生物等效(图 8.2 为 bootstrap 直方图)。

8.4 文献注(PDF p.127)

Bootstrap 由 Efron (1979) 发明。参考书:Efron & Tibshirani (1993)、Davison & Hinkley (1997)、Hall (1992)、Shao & Tu (1995);另见 van der Vaart & Wellner (1996) 3.6 节。

8.5 附录(PDF p.127–128)

8.5.1 刀切法(The Jackknife):Quenouille (1949) 提出,计算量比 bootstrap 小但适用范围较窄。\(T_{(-i)}\) 为去掉第 \(i\) 个观测后的统计量,\(\bar T_n=n^{-1}\sum T_{(-i)}\),刀切方差估计

\[v_{jack}=\frac{n-1}n\sum_{i=1}^n(T_{(-i)}-\bar T_n)^2,\quad\widehat{\text{se}}_{jack}=\sqrt{v_{jack}}.\]
在 \(T\) 满足适当条件时 \(v_{jack}/\mathbb V(T_n)\xrightarrow{as}1\)(相合),但与 bootstrap 不同,刀切法不能相合地估计样本分位数(如中位数)的标准误。

8.5.2 百分位区间的理由:设存在单调变换 \(U=m(T)\) 使 \(U\sim N(\phi,c^2)\),\(\phi=m(\theta)\)(不必知道 \(m\),只需存在)。令 \(U_b^*=m(\hat\theta_{n,b}^*)\),\(u_\beta^*\) 为其样本分位数。单调变换保持分位数:\(u_{\alpha/2}^*=m(\theta_{\alpha/2}^*)\)。又 \(U\sim N(\phi,c^2)\),\(U\) 的 \(\alpha/2\) 分位数为 \(\phi-z_{\alpha/2}c\),故 \(u_{\alpha/2}^*\approx U-z_{\alpha/2}c\),\(u_{1-\alpha/2}^*\approx U+z_{\alpha/2}c\)。于是 \(\mathbb P(\theta_{\alpha/2}^*\le\theta\le\theta_{1-\alpha/2}^*)=\mathbb P(m(\theta_{\alpha/2}^*)\le m(\theta)\le m(\theta_{1-\alpha/2}^*))=\mathbb P(U-cz_{\alpha/2}\le\phi\le U+cz_{\alpha/2})=\mathbb P(-z_{\alpha/2}\le\frac{U-\phi}c\le z_{\alpha/2})=1-\alpha\)。精确的正态化变换很少存在,但可能存在近似的。

8.6 习题(PDF p.128–130)概览

共 8 题:题 1 用法学院数据求相关系数的插入估计、bootstrap se 和三种 95% 区间;题 2(计算机实验) 比较三种区间的真实覆盖率:\(n=50\),\(Y_i\sim N(0,1)\),\(X_i=e^{Y_i}\)(对数正态),目标为偏度;题 3 对 \(t_3\) 样本(\(n=25\)),目标 \(\theta=(q_{.75}-q_{.25})/1.34\)(基于四分位距的稳健尺度),比较正态/百分位/枢轴区间的覆盖率与长度;题 4 无结时不同 bootstrap 样本数为 \(\binom{2n-1}n\)(提示:\(n\) 个球放 \(n\) 个桶);题 5 求 \(\mathbb E(\bar X_n^*\mid X_1..X_n)\)、\(\mathbb V(\bar X_n^*\mid\cdot)\)、\(\mathbb E(\bar X_n^*)\)、\(\mathbb V(\bar X_n^*)\);题 6 \(X_i\sim N(\mu,1)\),\(\theta=e^\mu\),\(\hat\theta=e^{\bar X}\),\(\mu=5\)、\(n=100\),bootstrap se、区间及与真实抽样分布对比;题 7(bootstrap 失效的例子):Uniform\((0,\theta)\),\(\hat\theta=X_{max}\),\(n=50\)、\(\theta=1\);证明 \(\mathbb P(\hat\theta=\theta)=0\) 而 \(\mathbb P(\hat\theta^*=\hat\theta)=1-(1-1/n)^n\to1-e^{-1}\approx.632\)——在参数空间边界的极值统计量上 bootstrap 表现很差;题 8 \(T_n=\bar X_n^2\) 的 bootstrap 方差与中心矩的关系。

本章要点

  1. Bootstrap = 插入原则(用 \(\hat F_n\) 代替 \(F\))+ 蒙特卡洛模拟(有放回重抽样)。
  2. 方差估计算法:重抽样 \(B\) 次、计算统计量、取样本方差。
  3. 三种区间:正态 \(T_n\pm z\widehat{\text{se}}_{boot}\);枢轴 \((2\hat\theta-\theta^*_{1-\alpha/2},2\hat\theta-\theta^*_{\alpha/2})\);百分位 \((\theta^*_{\alpha/2},\theta^*_{1-\alpha/2})\)。注意枢轴与百分位区间分位数的"反转"。
  4. 刀切法是低成本替代,但对分位数失效;bootstrap 在极值/边界问题上可能失效。
  5. 两组比较时各组分别重抽样。

与量化交易的关联

  • 回测指标的不确定性:Sharpe 比率、最大回撤、Calmar、IC、胜率、中位数收益等统计量的标准误没有简单公式,bootstrap 是最常用工具;例 8.5 的伪代码可直接改写为"两策略 Sharpe 之差的 bootstrap 置信区间"。
  • 非 IID 的修正:本章 bootstrap 假设 IID。金融收益有自相关和波动聚集,实务中应使用块 bootstrap(block / stationary bootstrap),按时间块重抽样以保留依赖结构;编写教材时应补充这一点。
  • 组合/模型稳健性:对收益样本 bootstrap 后重复做组合优化(resampled efficiency,Michaud)或重复估计因子模型,评估权重和因子载荷的稳定性。
  • 比率型统计量:例 8.7 的 \(\bar Y/\bar Z\) 与信息比率、Beta(协方差/方差)、换手调整收益等比率指标结构相同;也可与第 5 章 Delta 方法结果相互验证。
  • bootstrap 失效场景:习题 7 提醒对最大值类统计量(最大回撤、极端损失、最佳策略的最大 Sharpe)直接 bootstrap 可能严重失真,需要谨慎或改用其他方法(如子抽样 subsampling、极值理论)。
  • 多策略选择偏差:White 的 Reality Check、Hansen 的 SPA 检验都是基于 bootstrap 的"数据窥探"检验,是本章方法在策略筛选中的直接延伸。

推荐习题

  • 题 2、3(比较三种 bootstrap 区间的覆盖率,必做模拟);题 7(bootstrap 失效);题 1(法学院相关系数);题 4、5(理解 bootstrap 分布的性质);题 6(与 Delta 方法对照)。

第 9 章 参数推断(Parametric Inference)(PDF p.131–160)

参数模型 \(\mathfrak F=\{f(x;\theta):\theta\in\Theta\}\) (9.1),\(\Theta\subset\mathbb R^k\),\(\theta=(\theta_1,\dots,\theta_k)\)。推断问题化为估计 \(\theta\)。

学生常问:怎么知道数据来自某个参数模型?作者答:这是好问题,我们很少能知道,所以非参数方法更可取。但学参数方法仍有两个理由:一是背景知识有时表明参数模型是合理近似(如交通事故计数近似 Poisson);二是参数模型中的推断概念是理解某些非参数方法的基础。本章介绍矩估计与最大似然估计。

9.1 感兴趣参数(Parameter of Interest)(PDF p.132)

常常只关心某个函数 \(T(\theta)\)。例如 \(X\sim N(\mu,\sigma^2)\)、目标是 \(\mu\),则 \(\mu=T(\theta)\) 为感兴趣参数,\(\sigma\) 为冗余参数。 例 9.1:血液检测结果 \(X_i\sim N(\mu,\sigma^2)\),关心检测值大于 1 的人口比例 \(\tau\):

\[\tau=\mathbb P(X>1)=1-\mathbb P\left(\frac{X-\mu}\sigma<\frac{1-\mu}\sigma\right)=1-\Phi\left(\frac{1-\mu}\sigma\right).\]
例 9.2:Gamma\((\alpha,\beta)\),\(f(x;\alpha,\beta)=\frac1{\beta^\alpha\Gamma(\alpha)}x^{\alpha-1}e^{-x/\beta}\),常用于建模人、动物、电子设备寿命;估计平均寿命 \(T(\alpha,\beta)=\mathbb E_\theta(X_1)=\alpha\beta\)。

9.2 矩估计法(The Method of Moments)(PDF p.132–134)

矩估计不是最优的,但通常容易计算,也常作为迭代数值方法的初值。 \(\theta\) 有 \(k\) 个分量,对 \(1\le j\le k\) 定义第 \(j\) 阶(总体)矩 \(\alpha_j\equiv\alpha_j(\theta)=\mathbb E_\theta(X^j)=\int x^jdF_\theta(x)\) (9.2),第 \(j\) 阶样本矩 \(\hat\alpha_j=\frac1n\sum X_i^j\) (9.3)。 定义 9.3:矩估计量(method of moments estimator)\(\hat\theta_n\) 是使 \(\alpha_j(\hat\theta_n)=\hat\alpha_j\)(\(j=1,\dots,k\))成立的 \(\theta\) (9.4)——\(k\) 个方程 \(k\) 个未知数。 例 9.4:Bernoulli,\(\alpha_1=p\),\(\hat\alpha_1=\bar X\),得 \(\hat p_n=\frac1n\sum X_i\)。 例 9.5:正态,\(\alpha_1=\mu\),\(\alpha_2=\mathbb E X^2=\sigma^2+\mu^2\)。解 \(\hat\mu=\frac1n\sum X_i\),\(\hat\sigma^2+\hat\mu^2=\frac1n\sum X_i^2\),得 \(\hat\mu=\bar X_n\),\(\hat\sigma^2=\frac1n\sum(X_i-\bar X_n)^2\)。

定理 9.6:在模型的适当条件下,矩估计量 (1) 以趋于 1 的概率存在;(2) 相合:\(\hat\theta_n\xrightarrow P\theta\);(3) 渐近正态:\(\sqrt n(\hat\theta_n-\theta)\rightsquigarrow N(0,\Sigma)\),其中 \(\Sigma=g\,\mathbb E_\theta(YY^T)g^T\),\(Y=(X,X^2,\dots,X^k)^T\),\(g=(g_1,\dots,g_k)\),\(g_j=\partial\alpha_j^{-1}(\theta)/\partial\theta\)。 第 (3) 条可用来求标准误与置信区间,但更简单的是 bootstrap(本章末讨论)。

9.3 最大似然(Maximum Likelihood)(PDF p.134–136)

参数模型中最常用的估计方法。\(X_1,\dots,X_n\) IID,PDF \(f(x;\theta)\)。 定义 9.7:似然函数(likelihood function)\(\mathcal L_n(\theta)=\prod_{i=1}^nf(X_i;\theta)\) (9.5);对数似然(log-likelihood)\(\ell_n(\theta)=\log\mathcal L_n(\theta)\)。 似然就是数据的联合密度,只不过把它看作参数的函数,\(\mathcal L_n:\Theta\to[0,\infty)\)。似然不是关于 \(\theta\) 的密度函数,一般对 \(\theta\) 积分不为 1。 定义 9.8:最大似然估计量(maximum likelihood estimator, MLE)\(\hat\theta_n\) 是使 \(\mathcal L_n(\theta)\) 最大的 \(\theta\)。 \(\ell_n\) 与 \(\mathcal L_n\) 最大值位置相同,通常对数似然更好处理。 注 9.9:\(\mathcal L_n\) 乘以与 \(\theta\) 无关的正常数不改变 MLE,因此常省略常数。

例 9.10:Bernoulli,\(f(x;p)=p^x(1-p)^{1-x}\),\(\mathcal L_n(p)=\prod p^{X_i}(1-p)^{1-X_i}=p^S(1-p)^{n-S}\),\(S=\sum X_i\);\(\ell_n(p)=S\log p+(n-S)\log(1-p)\),求导令为 0 得 \(\hat p_n=S/n\)。图 9.1:\(n=20\)、\(\sum X_i=12\) 时似然在 \(\hat p=0.6\) 处最大。 例 9.11:\(N(\mu,\sigma^2)\),\(\theta=(\mu,\sigma)\),忽略常数

\[\mathcal L_n(\mu,\sigma)=\prod\frac1\sigma\exp\left\{-\frac{(X_i-\mu)^2}{2\sigma^2}\right\}=\sigma^{-n}\exp\left\{-\frac{nS^2}{2\sigma^2}\right\}\exp\left\{-\frac{n(\bar X-\mu)^2}{2\sigma^2}\right\},\]
其中 \(\bar X=n^{-1}\sum X_i\),\(S^2=n^{-1}\sum(X_i-\bar X)^2\);用到 \(\sum(X_i-\mu)^2=nS^2+n(\bar X-\mu)^2\)(把 \(X_i-\mu\) 写成 \((X_i-\bar X)+(\bar X-\mu)\) 展开)。对数似然 \(\ell(\mu,\sigma)=-n\log\sigma-\frac{nS^2}{2\sigma^2}-\frac{n(\bar X-\mu)^2}{2\sigma^2}\)。解 \(\partial\ell/\partial\mu=0\)、\(\partial\ell/\partial\sigma=0\) 得 \(\hat\mu=\bar X\),\(\hat\sigma=S\)(注意除以 \(n\)),可验证是全局最大。 例 9.12(一个让很多人困惑的例子):\(X_i\sim\) Unif\((0,\theta)\),\(f(x;\theta)=1/\theta\)(\(0\le x\le\theta\))。若某个 \(X_i>\theta\),则 \(f(X_i;\theta)=0\),\(\mathcal L_n=0\);因此 \(\theta<X_{(n)}=\max X_i\) 时 \(\mathcal L_n=0\);\(\theta\ge X_{(n)}\) 时 \(\mathcal L_n=\theta^{-n}\)。即
\[\mathcal L_n(\theta)=\begin{cases}(1/\theta)^n&\theta\ge X_{(n)}\\0&\theta<X_{(n)}\end{cases}\]
在 \([X_{(n)},\infty)\) 上严格递减,故 \(\hat\theta_n=X_{(n)}\)(图 9.2:\(\theta=.75,1,1.25\) 三种情形下 \(f(x;\theta)\) 与数据的关系,以及似然函数形状,在 \(X_{(n)}\) 处不连续)。不能用求导法求。 多元正态与多项分布的 MLE 见定理 14.5、14.3。

9.4 MLE 的性质(Properties of Maximum Likelihood Estimators)(PDF p.136–138)

在模型的某些条件下 MLE 具有许多吸引人的性质:

  1. 相合:\(\hat\theta_n\xrightarrow P\theta_\star\)(\(\theta_\star\) 为真值);
  2. 同变(equivariant):若 \(\hat\theta_n\) 是 \(\theta\) 的 MLE,则 \(g(\hat\theta_n)\) 是 \(g(\theta)\) 的 MLE;
  3. 渐近正态:\((\hat\theta-\theta_\star)/\widehat{\text{se}}\rightsquigarrow N(0,1)\),且 \(\widehat{\text{se}}\) 常可解析计算;
  4. 渐近最优/有效(efficient):粗略说,在所有表现良好的估计量中,MLE(至少大样本时)方差最小;
  5. 近似为贝叶斯估计量(后文解释)。 在足够复杂的问题中,这些性质不再成立,MLE 也不再是好估计。这些性质只在模型满足正则条件(regularity conditions,本质上是 \(f(x;\theta)\) 的光滑性条件)时成立,除非另说明,默认成立。

9.5 MLE 的相合性(Consistency of Maximum Likelihood Estimators)(PDF p.138–139)

Kullback–Leibler 距离:PDF \(f,g\) 之间

\[D(f,g)=\int f(x)\log\left(\frac{f(x)}{g(x)}\right)dx.\tag{9.6}\]
可证 \(D(f,g)\ge0\) 且 \(D(f,f)=0\)(脚注:它不对称,不是严格意义的距离)。记 \(D(\theta,\psi)=D(f(x;\theta),f(x;\psi))\)。 可识别(identifiable):\(\theta\ne\psi\Rightarrow D(\theta,\psi)>0\),即不同参数对应不同分布。此后假设模型可识别。

直观:最大化 \(\ell_n(\theta)\) 等价于最大化 \(M_n(\theta)=\frac1n\sum_i\log\frac{f(X_i;\theta)}{f(X_i;\theta_\star)}\)(因 \(M_n(\theta)=n^{-1}(\ell_n(\theta)-\ell_n(\theta_\star))\),后一项与 \(\theta\) 无关)。由大数定律,\(M_n(\theta)\to\mathbb E_{\theta_\star}\log\frac{f(X;\theta)}{f(X;\theta_\star)}=-\int\log\frac{f(x;\theta_\star)}{f(x;\theta)}f(x;\theta_\star)dx=-D(\theta_\star,\theta)\),它在 \(\theta_\star\) 处取最大值 0,其余处为负。所以最大值点应趋于 \(\theta_\star\)。严格证明需要一致收敛和 \(D\) 的良好性质:

定理 9.13:令 \(M_n(\theta)\) 如上,\(M(\theta)=-D(\theta_\star,\theta)\)。若

\[\sup_{\theta\in\Theta}|M_n(\theta)-M(\theta)|\xrightarrow P0\tag{9.7}\]
且对每个 \(\epsilon>0\),
\[\sup_{\theta:|\theta-\theta_\star|\ge\epsilon}M(\theta)<M(\theta_\star),\tag{9.8}\]
则 MLE \(\hat\theta_n\xrightarrow P\theta_\star\)。((9.8) 要求真值是"分离良好"的最大值点。证明见附录。)

9.6 MLE 的同变性(Equivariance of the MLE)(PDF p.139–140)

定理 9.14:\(\tau=g(\theta)\),\(\hat\theta_n\) 为 \(\theta\) 的 MLE,则 \(\hat\tau_n=g(\hat\theta_n)\) 是 \(\tau\) 的 MLE。 证明(\(g\) 可逆):令 \(h=g^{-1}\),\(\hat\theta_n=h(\hat\tau_n)\)。对任意 \(\tau\),\(\mathcal L(\tau)=\prod f(x_i;h(\tau))=\prod f(x_i;\theta)=\mathcal L(\theta)\),\(\theta=h(\tau)\)。于是 \(\mathcal L_n(\tau)=\mathcal L(\theta)\le\mathcal L(\hat\theta)=\mathcal L_n(\hat\tau)\)。 例 9.15:\(X_i\sim N(\theta,1)\),\(\hat\theta_n=\bar X_n\);\(\tau=e^\theta\) 的 MLE 为 \(\hat\tau=e^{\bar X}\)。

9.7 渐近正态性(Asymptotic Normality)(PDF p.140–142)

定义 9.16:得分函数(score function)\(s(X;\theta)=\frac{\partial\log f(X;\theta)}{\partial\theta}\) (9.9);Fisher 信息(Fisher information)

\[I_n(\theta)=\mathbb V_\theta\left(\sum_{i=1}^ns(X_i;\theta)\right)=\sum_{i=1}^n\mathbb V_\theta(s(X_i;\theta)).\tag{9.10}\]
\(n=1\) 时记 \(I(\theta)\)。可证 \(\mathbb E_\theta(s(X;\theta))=0\),故 \(\mathbb V_\theta(s)=\mathbb E_\theta(s^2)\)。

定理 9.17:\(I_n(\theta)=nI(\theta)\),且

\[I(\theta)=-\mathbb E_\theta\left(\frac{\partial^2\log f(X;\theta)}{\partial\theta^2}\right)=-\int\left(\frac{\partial^2\log f(x;\theta)}{\partial\theta^2}\right)f(x;\theta)dx.\tag{9.11}\]

定理 9.18(MLE 的渐近正态性):令 \(\text{se}=\sqrt{\mathbb V(\hat\theta_n)}\)。在适当正则条件下:

  1. \(\text{se}\approx\sqrt{1/I_n(\theta)}\) 且 \(\frac{\hat\theta_n-\theta}{\text{se}}\rightsquigarrow N(0,1)\) (9.12);
  2. 令 \(\widehat{\text{se}}=\sqrt{1/I_n(\hat\theta_n)}\),则 \(\frac{\hat\theta_n-\theta}{\widehat{\text{se}}}\rightsquigarrow N(0,1)\) (9.13)。 第一条说 \(\hat\theta_n\approx N(\theta,\text{se}^2)\),近似标准误为 \(\sqrt{1/I_n(\theta)}\);第二条说用估计的标准误代替仍成立。由此构造渐近置信区间:

定理 9.19:\(C_n=(\hat\theta_n-z_{\alpha/2}\widehat{\text{se}},\hat\theta_n+z_{\alpha/2}\widehat{\text{se}})\),则 \(\mathbb P_\theta(\theta\in C_n)\to1-\alpha\)。证明:\(\mathbb P_\theta(-z_{\alpha/2}\le\frac{\hat\theta_n-\theta}{\widehat{\text{se}}}\le z_{\alpha/2})\to\mathbb P(-z_{\alpha/2}<Z<z_{\alpha/2})=1-\alpha\)。 \(\alpha=.05\) 时 \(\hat\theta_n\pm2\widehat{\text{se}}\) 是近似 95% 区间 (9.14)。报纸上"民调误差 1 个百分点,95% 准确"就是这种区间。

例 9.20(Bernoulli):\(\log f=x\log p+(1-x)\log(1-p)\),\(s(X;p)=\frac Xp-\frac{1-X}{1-p}\),\(-s'(X;p)=\frac X{p^2}+\frac{1-X}{(1-p)^2}\),\(I(p)=\frac p{p^2}+\frac{1-p}{(1-p)^2}=\frac1{p(1-p)}\)。故 \(\widehat{\text{se}}=\frac1{\sqrt{I_n(\hat p_n)}}=\left\{\frac{\hat p(1-\hat p)}n\right\}^{1/2}\),近似 95% 区间 \(\hat p_n\pm2\left\{\frac{\hat p_n(1-\hat p_n)}n\right\}^{1/2}\)。 例 9.21:\(N(\theta,\sigma^2)\),\(\sigma^2\) 已知。\(s=(X-\theta)/\sigma^2\),\(s'=-1/\sigma^2\),\(I_1=1/\sigma^2\),MLE \(\bar X_n\approx N(\theta,\sigma^2/n)\)——此时正态近似是精确的。 例 9.22:Poisson\((\lambda)\),\(\hat\lambda=\bar X_n\),\(I_1(\lambda)=1/\lambda\),\(\widehat{\text{se}}=\frac1{\sqrt{nI(\hat\lambda)}}=\sqrt{\hat\lambda/n}\),近似区间 \(\hat\lambda\pm z_{\alpha/2}\sqrt{\hat\lambda/n}\)。

9.8 最优性(Optimality)(PDF p.142–143)

\(X_i\sim N(\theta,\sigma^2)\),MLE \(\hat\theta_n=\bar X_n\) 满足 \(\sqrt n(\hat\theta_n-\theta)\rightsquigarrow N(0,\sigma^2)\);另一个合理估计量样本中位数 \(\tilde\theta_n\) 满足 \(\sqrt n(\tilde\theta_n-\theta)\rightsquigarrow N(0,\sigma^2\frac\pi2)\)——同样收敛到真值,但方差更大。 一般地,若 \(\sqrt n(T_n-\theta)\rightsquigarrow N(0,t^2)\),\(\sqrt n(U_n-\theta)\rightsquigarrow N(0,u^2)\),定义 \(U\) 相对 \(T\) 的渐近相对效率(asymptotic relative efficiency)\(\text{ARE}(U,T)=t^2/u^2\)。正态例中 \(\text{ARE}(\tilde\theta_n,\hat\theta_n)=2/\pi=.63\),解释:用中位数相当于只用了约 63% 的数据。 定理 9.23:若 \(\hat\theta_n\) 是 MLE,\(\tilde\theta_n\) 是任一其他估计量,则 \(\text{ARE}(\tilde\theta_n,\hat\theta_n)\le1\)(脚注:真实结果更微妙,细节过于复杂)。即 MLE 渐近方差最小,称为有效或渐近最优。 前提是模型正确;模型错设时 MLE 未必最优。更一般的最优性在第 12 章决策理论讨论。

9.9 Delta 方法(The Delta Method)(PDF p.143–145)

\(\tau=g(\theta)\),\(g\) 光滑,MLE \(\hat\tau=g(\hat\theta)\),求其分布。 定理 9.24(Delta 方法):若 \(g\) 可微且 \(g'(\theta)\ne0\),则

\[\frac{\sqrt n(\hat\tau_n-\tau)}{\widehat{\text{se}}(\hat\tau)}\rightsquigarrow N(0,1),\qquad\widehat{\text{se}}(\hat\tau_n)=|g'(\hat\theta)|\,\widehat{\text{se}}(\hat\theta_n).\tag{9.15}\]
(原书此处 \(\sqrt n\) 写法不严格,实际应为 \((\hat\tau_n-\tau)/\widehat{\text{se}}(\hat\tau)\rightsquigarrow N(0,1)\),因为 se 已含 \(1/\sqrt n\)。)(9.16) 因此若 \(C_n=(\hat\tau_n-z_{\alpha/2}\widehat{\text{se}}(\hat\tau_n),\hat\tau_n+z_{\alpha/2}\widehat{\text{se}}(\hat\tau_n))\) (9.17),则 \(\mathbb P_\theta(\tau\in C_n)\to1-\alpha\)。

例 9.25(对数几率):Bernoulli,\(\psi=g(p)=\log(p/(1-p))\)。\(I(p)=1/(p(1-p))\),\(\widehat{\text{se}}(\hat p)=\sqrt{\hat p(1-\hat p)/n}\);\(\hat\psi=\log\frac{\hat p}{1-\hat p}\);\(g'(p)=\frac1{p(1-p)}\),故 \(\widehat{\text{se}}(\hat\psi)=|g'(\hat p)|\widehat{\text{se}}(\hat p)=\frac1{\sqrt{n\hat p(1-\hat p)}}\),95% 区间 \(\hat\psi\pm\frac2{\sqrt{n\hat p(1-\hat p)}}\)。 例 9.26:\(N(\mu,\sigma^2)\),\(\mu\) 已知、\(\sigma\) 未知,估计 \(\psi=\log\sigma\)。\(\ell(\sigma)=-n\log\sigma-\frac1{2\sigma^2}\sum(X_i-\mu)^2\),MLE \(\hat\sigma=\sqrt{\frac1n\sum(X_i-\mu)^2}\)。\(\log f(X;\sigma)=-\log\sigma-\frac{(X-\mu)^2}{2\sigma^2}\),二阶导 \(\frac1{\sigma^2}-\frac{3(X-\mu)^2}{\sigma^4}\),故 \(I(\sigma)=-\frac1{\sigma^2}+\frac{3\sigma^2}{\sigma^4}=\frac2{\sigma^2}\),\(\widehat{\text{se}}(\hat\sigma)=\hat\sigma/\sqrt{2n}\)。\(\hat\psi=\log\hat\sigma\),\(g'=1/\sigma\),\(\widehat{\text{se}}(\hat\psi)=\frac1{\hat\sigma}\frac{\hat\sigma}{\sqrt{2n}}=\frac1{\sqrt{2n}}\),95% 区间 \(\hat\psi\pm2/\sqrt{2n}\)(与 \(\sigma\) 无关——对数变换是方差稳定化变换)。

9.10 多参数模型(Multiparameter Models)(PDF p.145–146)

\(\theta=(\theta_1,\dots,\theta_k)\),MLE \(\hat\theta\),\(\ell_n=\sum\log f(X_i;\theta)\),\(H_{jj}=\frac{\partial^2\ell_n}{\partial\theta_j^2}\),\(H_{jk}=\frac{\partial^2\ell_n}{\partial\theta_j\partial\theta_k}\)。Fisher 信息矩阵

\[I_n(\theta)=-\begin{pmatrix}\mathbb E_\theta(H_{11})&\cdots&\mathbb E_\theta(H_{1k})\\\vdots&\ddots&\vdots\\\mathbb E_\theta(H_{k1})&\cdots&\mathbb E_\theta(H_{kk})\end{pmatrix},\qquad J_n(\theta)=I_n^{-1}(\theta).\]
定理 9.27:正则条件下 \((\hat\theta-\theta)\approx N(0,J_n)\) (9.18);对第 \(j\) 个分量,\(\frac{\hat\theta_j-\theta_j}{\widehat{\text{se}}_j}\rightsquigarrow N(0,1)\) (9.19),\(\widehat{\text{se}}_j^2=J_n(j,j)\) 为 \(J_n\) 第 \(j\) 个对角元;\(\text{Cov}(\hat\theta_j,\hat\theta_k)\approx J_n(j,k)\)。

定理 9.28(多参数 Delta 方法):\(\tau=g(\theta_1,\dots,\theta_k)\),梯度 \(\nabla g=(\partial g/\partial\theta_1,\dots,\partial g/\partial\theta_k)^T\) 在 \(\hat\theta\) 处非零,\(\hat\tau=g(\hat\theta)\),则 \(\frac{\hat\tau-\tau}{\widehat{\text{se}}(\hat\tau)}\rightsquigarrow N(0,1)\),

\[\widehat{\text{se}}(\hat\tau)=\sqrt{(\hat\nabla g)^T\hat J_n(\hat\nabla g)},\tag{9.20}\]
\(\hat J_n=J_n(\hat\theta_n)\),\(\hat\nabla g\) 为 \(\nabla g\) 在 \(\theta=\hat\theta\) 处的值。

例 9.29(变异系数):\(X_i\sim N(\mu,\sigma^2)\),\(\tau=g(\mu,\sigma)=\sigma/\mu\)。(习题 8)\(I_n(\mu,\sigma)=\begin{pmatrix}n/\sigma^2&0\\0&2n/\sigma^2\end{pmatrix}\),\(J_n=\frac1n\begin{pmatrix}\sigma^2&0\\0&\sigma^2/2\end{pmatrix}\)。\(\nabla g=(-\sigma/\mu^2,\ 1/\mu)^T\),于是

\[\widehat{\text{se}}(\hat\tau)=\sqrt{(\hat\nabla g)^T\hat J_n(\hat\nabla g)}=\frac1{\sqrt n}\left(\frac{\hat\sigma^4}{\hat\mu^4}+\frac{\hat\sigma^2}{2\hat\mu^2}\right)^{1/2}.\]
(编者注:原书印刷版第一项写作 \(1/\hat\mu^4\),按上式推导应为 \(\hat\sigma^4/\hat\mu^4\)。)

9.11 参数 Bootstrap(The Parametric Bootstrap)(PDF p.146–147)

参数模型中也可用 bootstrap 求标准误和置信区间,唯一变化:非参数 bootstrap 从 \(\hat F_n\) 抽样,参数 bootstrap 从 \(f(x;\hat\theta_n)\) 抽样,\(\hat\theta_n\) 可以是 MLE 或矩估计。 例 9.30:续例 9.29,模拟 \(X_1^*,\dots,X_n^*\sim N(\hat\mu,\hat\sigma^2)\),计算 \(\hat\mu^*=n^{-1}\sum X_i^*\)、\(\hat\sigma^{2*}=n^{-1}\sum(X_i^*-\hat\mu^*)^2\)、\(\hat\tau^*=\hat\sigma^*/\hat\mu^*\);重复 \(B\) 次,\(\widehat{\text{se}}_{boot}=\sqrt{\frac1B\sum_b(\hat\tau_b^*-\bar\tau^*)^2}\)。 Bootstrap 比 Delta 方法容易得多;Delta 方法的优势是给出闭式标准误。

9.12 检验假设(Checking Assumptions)(PDF p.147)

假设数据来自参数模型时,最好检验该假设。非正式方法:看图(如直方图明显双峰,则正态假设可疑);正式方法:拟合优度检验(goodness-of-fit test,10.8 节)。

9.13 附录(PDF p.147–158)

9.13.1 证明

定理 9.13 证明:\(\hat\theta_n\) 最大化 \(M_n\),故 \(M_n(\hat\theta_n)\ge M_n(\theta_\star)\)。于是 \(M(\theta_\star)-M(\hat\theta_n)=M_n(\theta_\star)-M(\hat\theta_n)+M(\theta_\star)-M_n(\theta_\star)\le M_n(\hat\theta_n)-M(\hat\theta_n)+M(\theta_\star)-M_n(\theta_\star)\le\sup_\theta|M_n(\theta)-M(\theta)|+M(\theta_\star)-M_n(\theta_\star)\xrightarrow P0\)(由 (9.7))。故对任意 \(\delta>0\),\(\mathbb P(M(\hat\theta_n)<M(\theta_\star)-\delta)\to0\)。任取 \(\epsilon>0\),由 (9.8) 存在 \(\delta>0\) 使 \(|\theta-\theta_\star|\ge\epsilon\Rightarrow M(\theta)<M(\theta_\star)-\delta\),因此 \(\mathbb P(|\hat\theta_n-\theta_\star|>\epsilon)\le\mathbb P(M(\hat\theta_n)<M(\theta_\star)-\delta)\to0\)。

引理 9.31:\(\mathbb E_\theta[s(X;\theta)]=0\)。证明:对 \(1=\int f(x;\theta)dx\) 两边关于 \(\theta\) 求导:\(0=\int\frac{\partial f}{\partial\theta}dx=\int\frac{\partial f/\partial\theta}{f}f\,dx=\int\frac{\partial\log f}{\partial\theta}f\,dx=\mathbb E_\theta s(X;\theta)\)。

定理 9.18 证明:令 \(\ell(\theta)=\log\mathcal L(\theta)\)。在 \(\theta\) 处展开:\(0=\ell'(\hat\theta)\approx\ell'(\theta)+(\hat\theta-\theta)\ell''(\theta)\),故 \(\hat\theta-\theta=-\ell'(\theta)/\ell''(\theta)\),即

\[\sqrt n(\hat\theta-\theta)=\frac{\frac1{\sqrt n}\ell'(\theta)}{-\frac1n\ell''(\theta)}=\frac{\text{TOP}}{\text{BOTTOM}}.\]
令 \(Y_i=\partial\log f(X_i;\theta)/\partial\theta\),\(\mathbb E Y_i=0\),\(\mathbb V Y_i=I(\theta)\),故 \(\text{TOP}=n^{1/2}\bar Y=\sqrt n(\bar Y-0)\rightsquigarrow W\sim N(0,I(\theta))\)(CLT)。令 \(A_i=-\partial^2\log f(X_i;\theta)/\partial\theta^2\),\(\mathbb E A_i=I(\theta)\),\(\text{BOTTOM}=\bar A\xrightarrow PI(\theta)\)(LLN)。由定理 5.5(e)(Slutsky),\(\sqrt n(\hat\theta-\theta)\rightsquigarrow\frac W{I(\theta)}\overset d=N\left(0,\frac1{I(\theta)}\right)\)。设 \(I(\theta)\) 连续,则 \(I(\hat\theta_n)\xrightarrow PI(\theta)\)。写 \(\frac{\hat\theta_n-\theta}{\widehat{\text{se}}}=\sqrt nI^{1/2}(\theta)(\hat\theta_n-\theta)\sqrt{\frac{I(\hat\theta_n)}{I(\theta)}}\),第一项依分布趋于 \(N(0,1)\),第二项依概率趋于 1,再用 Slutsky 得证。

定理 9.24 证明梗概:\(\hat\tau=g(\hat\theta)\approx g(\theta)+(\hat\theta-\theta)g'(\theta)=\tau+(\hat\theta-\theta)g'(\theta)\),故 \(\sqrt{nI(\theta)}(\hat\tau-\tau)\approx g'(\theta)\sqrt{nI(\theta)}(\hat\theta-\theta)\),从而 \(\frac{\sqrt{nI(\theta)}(\hat\tau_n-\tau)}{g'(\theta)}\approx\sqrt{nI(\theta)}(\hat\theta-\theta)\rightsquigarrow N(0,1)\),即 \(\frac{\hat\tau_n-\tau}{\text{se}(\hat\tau_n)}\rightsquigarrow N(0,1)\),\(\text{se}^2(\hat\tau_n)=\frac{(g'(\theta))^2}{nI(\theta)}\)。用 \(\hat\theta_n\) 代替 \(\theta\) 仍成立(Slutsky)。

9.13.2 充分性(Sufficiency)

统计量是数据的函数 \(T(x^n)\);充分统计量(sufficient statistic)包含数据中的全部信息。 定义 9.32:若 \(f(x^n;\theta)=c\,f(y^n;\theta)\)(常数 \(c\) 可依赖 \(x^n,y^n\) 但不依赖 \(\theta\)),记 \(x^n\leftrightarrow y^n\)。若 \(T(x^n)=T(y^n)\) 蕴含 \(x^n\leftrightarrow y^n\),则 \(T\) 是充分的。 \(x^n\leftrightarrow y^n\) 意味着两组数据的似然函数形状相同;粗略说,只知道 \(T(x^n)\) 就能算出似然函数,则 \(T\) 充分。 例 9.33:Bernoulli,\(\mathcal L(p)=p^S(1-p)^{n-S}\),\(S=\sum X_i\) 充分。 例 9.34:\(N(\mu,\sigma^2)\),\(T=(\bar X,S)\):\(f(x^n;\mu,\sigma)=\left(\frac1{\sigma\sqrt{2\pi}}\right)^n\exp\left\{-\frac{nS^2}{2\sigma^2}\right\}\exp\left\{-\frac{n(\bar X-\mu)^2}{2\sigma^2}\right\}\) 只通过 \(T\) 依赖数据,故充分。\(U=(17\bar X,S)\) 也充分。充分统计量远非唯一:\(T_1=(X_1,\dots,X_n)\)(全部数据,充分);\(T_2=(\bar X,S)\)(充分);\(T_3=\bar X\)(不充分,只知 \(\bar X\) 无法算 \(\mathcal L(\mu,\sigma)\));\(T_4=(\bar X,S,X_3)\)(充分但有冗余)。\(T_2\) 是 \(T_1\) 和 \(T_4\) 的函数,在某种意义上"更简洁"。 定义 9.35:\(T\) 是最小充分统计量(minimal sufficient),若 (i) 充分;(ii) 是任何其他充分统计量的函数。 定理 9.36:若"\(T(x^n)=T(y^n)\) 当且仅当 \(x^n\leftrightarrow y^n\)",则 \(T\) 最小充分。 统计量在结果集合上诱导一个划分,可用划分理解充分性。 例 9.37:\(X_1,X_2\sim\) Bernoulli\((\theta)\),\(V=X_1\),\(T=\sum X_i\),\(U=(T,X_1)\)。结果 (0,0),(0,1),(1,0),(1,1) 对应 \(V\)=0,0,1,1;\(T\)=0,1,1,2;\(U\)=(0,0),(1,0),(1,1),(2,1)。诱导划分:\(V\to\{(0,0),(0,1)\},\{(1,0),(1,1)\}\);\(T\to\{(0,0)\},\{(0,1),(1,0)\},\{(1,1)\}\);\(U\to\) 四个单点集。\(V\) 不充分;\(T,U\) 充分;\(T\) 最小充分;\(U\) 不是最小的,因为 \(x^n=(1,0)\) 与 \(y^n=(0,1)\) 满足 \(x^n\leftrightarrow y^n\),但 \(U(x^n)\ne U(y^n)\)。\(W=17T\) 与 \(T\) 诱导相同划分,也最小充分。 例 9.38:\(N(\mu,\sigma^2)\) 中 \((\bar X,S)\) 最小充分;Bernoulli 与 Poisson 中 \(\sum X_i\) 最小充分;\((\sum X_i,X_1)\) 充分但非最小;\(X_1\) 不充分。

通常的定义:若给定 \(T(X^n)=t\) 时 \(X^n\) 的条件分布不依赖 \(\theta\),即 \(f(x_1,\dots,x_n\mid t;\theta)=h(x_1,\dots,x_n,t)\),则 \(T\) 充分。 例 9.39:两次掷硬币,\(T=X_1+X_2\)。三种条件分布:\(T=0\) 时 \((0,0)\) 概率 1;\(T=1\) 时 \((0,1)\)、\((1,0)\) 各 1/2;\(T=2\) 时 \((1,1)\) 概率 1。都不依赖 \(p\),故 \(T\) 充分。

定理 9.40(因子分解定理,Factorization Theorem):\(T\) 充分当且仅当存在函数 \(g(t,\theta)\) 与 \(h(x)\) 使 \(f(x^n;\theta)=g(t(x^n),\theta)h(x^n)\)。 例 9.41:两次掷硬币,\(f(x_1;\theta)f(x_2;\theta)=\theta^{x_1+x_2}(1-\theta)^{2-x_1-x_2}=g(t,\theta)h(x_1,x_2)\),\(g=\theta^t(1-\theta)^{2-t}\),\(h=1\),故 \(T\) 充分。

充分性在点估计中的含义——Rao–Blackwell 定理:估计量应只依赖充分统计量,否则可以改进。记 \(R(\theta,\hat\theta)=\mathbb E_\theta(\theta-\hat\theta)^2\) 为 MSE。 定理 9.42(Rao–Blackwell):\(\hat\theta\) 为估计量,\(T\) 充分,定义 \(\tilde\theta=\mathbb E(\hat\theta\mid T)\),则对所有 \(\theta\),\(R(\theta,\tilde\theta)\le R(\theta,\hat\theta)\)。 例 9.43:两次掷硬币,\(\hat\theta=X_1\) 是良定义且无偏的估计量,但不是充分统计量 \(T=X_1+X_2\) 的函数。\(\tilde\theta=\mathbb E(X_1\mid T)=(X_1+X_2)/2\),MSE 不大于 \(X_1\)。\(n\) 次时 \(\tilde\theta=\mathbb E(X_1\mid T)=n^{-1}\sum X_i\)。

9.13.3 指数族(Exponential Families)

目前学过的大多数参数模型都是指数族的特例。单参数指数族:存在函数 \(\eta(\theta),B(\theta),T(x),h(x)\) 使

\[f(x;\theta)=h(x)e^{\eta(\theta)T(x)-B(\theta)}.\]
易见 \(T(X)\) 充分,称为自然充分统计量(natural sufficient statistic)。 例 9.44:Poisson,\(f(x;\theta)=\frac{\theta^xe^{-\theta}}{x!}=\frac1{x!}e^{x\log\theta-\theta}\),\(\eta=\log\theta\),\(B=\theta\),\(T(x)=x\),\(h=1/x!\)。 例 9.45:Binomial\((n,\theta)\),\(f=\binom nx\exp\{x\log\frac\theta{1-\theta}+n\log(1-\theta)\}\),\(\eta=\log\frac\theta{1-\theta}\),\(B(\theta)=-n\log(1-\theta)\),\(T(x)=x\),\(h=\binom nx\)。(原书误印为 \(-n\log\theta\)。) 自然参数形式:\(f(x;\eta)=h(x)e^{\eta T(x)-A(\eta)}\),\(\eta=\eta(\theta)\) 称为自然参数(natural parameter),\(A(\eta)=\log\int h(x)e^{\eta T(x)}dx\)(对数配分函数)。例:Poisson 写成 \(f(x;\eta)=e^{\eta x-e^\eta}/x!\),\(\eta=\log\theta\)。 IID 样本的联合密度仍为指数族:\(f(x^n;\theta)=h_n(x^n)e^{\eta(\theta)T_n(x^n)-B_n(\theta)}\),\(h_n=\prod h(x_i)\),\(T_n=\sum T(x_i)\),\(B_n=nB(\theta)\),故 \(\sum T(X_i)\) 充分。 例 9.46:Uniform\((0,\theta)\):\(f(x^n;\theta)=\theta^{-n}I(x_{(n)}\le\theta)\),\(T=\max X_i\) 充分;但它不能写成 \(\sum T(X_i)\),故不是指数族(支撑依赖参数)。 定理 9.47:\(X\) 的密度属于指数族,则 \(\mathbb E(T(X))=A'(\eta)\),\(\mathbb V(T(X))=A''(\eta)\)。 多参数指数族:\(f(x;\theta)=h(x)\exp\{\sum_{j=1}^k\eta_j(\theta)T_j(x)-B(\theta)\}\),\(T=(T_1,\dots,T_k)\) 充分;IID 样本的充分统计量为 \((\sum T_1(X_i),\dots,\sum T_k(X_i))\)。 例 9.48:正态 \(\theta=(\mu,\sigma)\):\(f(x;\theta)=\frac1{\sqrt{2\pi}}\exp\left\{\frac\mu{\sigma^2}x-\frac{x^2}{2\sigma^2}-\frac{\mu^2}{2\sigma^2}-\log\sigma\right\}\),\(\eta_1=\mu/\sigma^2\),\(T_1=x\),\(\eta_2=-1/(2\sigma^2)\),\(T_2=x^2\),\(B=\frac{\mu^2}{2\sigma^2}+\log\sigma\),\(h=1/\sqrt{2\pi}\)。故 \((\sum X_i,\sum X_i^2)\) 充分。 向量形式 \(f(x;\eta)=h(x)e^{T^T(x)\eta-A(\eta)}\),\(A(\eta)=\log\int h(x)e^{T^T(x)\eta}dx\),\(\mathbb E(T(X))=\dot A(\eta)\)(偏导向量),\(\mathbb V(T(X))=\ddot A(\eta)\)(二阶导矩阵)。

9.13.4 计算最大似然估计(Computing Maximum Likelihood Estimates)

有时可解析求 MLE,更常需要数值方法。介绍两种迭代法:Newton–Raphson 与 EM 算法,都产生序列 \(\theta^0,\theta^1,\dots\),理想条件下收敛到 MLE;好的初值很有帮助,矩估计常是好初值。

Newton–Raphson:在 \(\theta^j\) 处展开对数似然的导数:\(0=\ell'(\hat\theta)\approx\ell'(\theta^j)+(\hat\theta-\theta^j)\ell''(\theta^j)\),解得 \(\hat\theta\approx\theta^j-\frac{\ell'(\theta^j)}{\ell''(\theta^j)}\)。迭代:

\[\theta^{j+1}=\theta^j-\frac{\ell'(\theta^j)}{\ell''(\theta^j)}.\]
多参数:\(\theta^{j+1}=\theta^j-H^{-1}\ell'(\theta^j)\),\(\ell'\) 为一阶导向量,\(H\) 为对数似然的二阶导矩阵(Hessian)。

EM 算法(Expectation–Maximization):思想是在"求期望"与"最大化"之间交替。数据 \(Y\) 的密度 \(f(y;\theta)\) 导致难以最大化的对数似然,但能找到另一随机变量 \(Z\),使 \(f(y;\theta)=\int f(y,z;\theta)dz\) 且基于 \(f(y,z;\theta)\) 的似然容易最大化——即感兴趣模型是一个似然更简单的模型的边缘。\(Y\) 称观测数据,\(Z\) 称隐藏(hidden)/潜在(latent)/缺失(missing)数据。概念上,EM 反复"填补缺失数据、最大化对数似然"。

例 9.49(正态混合):如身高是男、女身高的混合。\(\phi(y;\mu,\sigma)\) 为正态密度,两正态混合密度

\[f(y;\theta)=(1-p)\phi(y;\mu_0,\sigma_0)+p\phi(y;\mu_1,\sigma_1),\]
观测以概率 \(p\) 来自第二个正态(原文表述为"以概率 \(p\) 来自第一个",与公式不一致,以公式为准),但不知道来自哪一个。参数 \(\theta=(\mu_0,\sigma_0,\mu_1,\sigma_1,p)\),似然 \(\mathcal L(\theta)=\prod_i[(1-p)\phi(y_i;\mu_0,\sigma_0)+p\phi(y_i;\mu_1,\sigma_1)]\),对五个参数直接最大化很难。若额外知道每个观测来自哪个正态,完整数据 \((Y_i,Z_i)\)(\(Z_i=0\) 为第一个,\(Z_i=1\) 为第二个,\(\mathbb P(Z_i=1)=p\))的似然简单得多。

EM 算法步骤: (0) 选初值 \(\theta^0\);对 \(j=1,2,\dots\) 重复: (1) E 步:计算 \(J(\theta\mid\theta^j)=\mathbb E_{\theta^j}\left(\log\frac{f(Y^n,Z^n;\theta)}{f(Y^n,Z^n;\theta^j)}\,\Big|\,Y^n=y^n\right)\),期望对缺失数据 \(Z^n\) 求,视 \(\theta^j\) 和观测数据 \(y^n\) 为固定。 (2) M 步:求 \(\theta^{j+1}\) 最大化 \(J(\theta\mid\theta^j)\)。

EM 单调性证明:\(\mathcal L(\theta^{j+1})\ge\mathcal L(\theta^j)\)。由 \(f(y^n,z^n;\theta)=f(z^n\mid y^n;\theta)f(y^n;\theta)\),

\[\log\frac{\mathcal L(\theta^{j+1})}{\mathcal L(\theta^j)}=\log\frac{f(y^n;\theta^{j+1})}{f(y^n;\theta^j)}=J(\theta^{j+1}\mid\theta^j)-\mathbb E_{\theta^j}\left(\log\frac{f(Z^n\mid y^n;\theta^{j+1})}{f(Z^n\mid y^n;\theta^j)}\Big|Y^n=y^n\right)=J(\theta^{j+1}\mid\theta^j)+K(f_j,f_{j+1}),\]
其中 \(f_j=f(z^n\mid y^n;\theta^j)\),\(K(f,g)=\int f\log(f/g)\) 为 KL 距离。\(\theta^{j+1}\) 最大化 \(J(\cdot\mid\theta^j)\),故 \(J(\theta^{j+1}\mid\theta^j)\ge J(\theta^j\mid\theta^j)=0\);又 \(K\ge0\),所以似然不降。

例 9.50(续例 9.49,简化版):设 \(p=1/2\),\(\sigma_0=\sigma_1=1\),\(f(y;\mu_0,\mu_1)=\frac12\phi(y;\mu_0,1)+\frac12\phi(y;\mu_1,1)\)。引入 \(Z_i\):\(\mathbb P(Z_i=1)=\mathbb P(Z_i=0)=1/2\),\(f(y_i\mid Z_i=0)=\phi(y;\mu_0,1)\),\(f(y_i\mid Z_i=1)=\phi(y;\mu_1,1)\)。\(f(z,y)=f(z)f(y\mid z)=\frac12\phi(y;\mu_0,1)^{1-z}\phi(y;\mu_1,1)^z\)。完整对数似然(略常数)

\[\tilde\ell=-\frac12\sum_i(1-z_i)(y_i-\mu_0)^2-\frac12\sum_iz_i(y_i-\mu_1)^2,\]
故 \(J(\theta\mid\theta^j)=-\frac12\sum(1-\mathbb E(Z_i\mid y^n,\theta^j))(y_i-\mu_0)^2-\frac12\sum\mathbb E(Z_i\mid y^n,\theta^j)(y_i-\mu_1)^2\)。(原书印刷漏了平方号。)\(Z_i\) 二值,由贝叶斯定理
\[\mathbb E(Z_i\mid y^n,\theta^j)=\mathbb P(Z_i=1\mid y^n,\theta^j)=\frac{\phi(y_i;\mu_1^j,1)\frac12}{\phi(y_i;\mu_1^j,1)\frac12+\phi(y_i;\mu_0^j,1)\frac12}=\frac{\phi(y_i;\mu_1^j,1)}{\phi(y_i;\mu_1^j,1)+\phi(y_i;\mu_0^j,1)}\equiv\tau(i).\]
对 \(\mu_0,\mu_1\) 求导令为 0:
\[\mu_1^{j+1}=\frac{\sum\tau_iy_i}{\sum\tau_i},\qquad\mu_0^{j+1}=\frac{\sum(1-\tau_i)y_i}{\sum(1-\tau_i)}.\]
然后用新参数重算 \(\tau_i\),迭代。(E 步 = 计算各观测属于各成分的"责任" \(\tau_i\);M 步 = 加权平均。)

9.14 习题(PDF p.158–160)概览

共 10 题:

  • 题 1:Gamma\((\alpha,\beta)\) 的矩估计。
  • 题 2:Uniform\((a,b)\):(a) 矩估计;(b) MLE(\(\hat a=X_{(1)}\),\(\hat b=X_{(n)}\));(c) \(\tau=\int x\,dF\) 的 MLE;(d) \(a=1,b=3,n=10\) 时,比较 MLE \(\hat\tau=(\hat a+\hat b)/2\) 与非参数插入估计 \(\bar X\) 的 MSE(模拟 + 解析)。
  • 题 3:\(N(\mu,\sigma^2)\) 的 95 百分位数 \(\tau=\mu+1.645\sigma\) 的 MLE、近似置信区间;给定 25 个数据(3.23, −2.50, 1.88, −0.68, 4.43, 0.17, 1.03, −0.07, −0.01, 0.76, 1.76, 3.18, 0.33, −0.31, 0.30, −0.61, 1.52, 5.43, 1.54, 2.28, 0.42, 2.33, −1.03, 4.00, 0.39),用 Delta 方法与参数 bootstrap 求 se。
  • 题 4:Uniform\((0,\theta)\) 的 MLE 相合(提示 \(\mathbb P(Y<c)=\prod\mathbb P(X_i<c)\))。
  • 题 5:Poisson 的矩估计、MLE、Fisher 信息。
  • 题 6:\(X_i\sim N(\theta,1)\),\(Y_i=I(X_i>0)\),\(\psi=\mathbb P(Y_1=1)=\Phi(\theta)\):MLE \(\hat\psi=\Phi(\bar X)\)、95% 区间;\(\tilde\psi=\bar Y\) 相合;两者的 ARE(Delta 方法);若数据并非正态,\(\hat\psi\) 不相合(模型错设下 MLE 的风险,而非参数 \(\tilde\psi\) 仍相合)。
  • 题 7(两种疗法比较):\(X_1\sim\) Bin\((n_1,p_1)\),\(X_2\sim\) Bin\((n_2,p_2)\),\(\psi=p_1-p_2\) 的 MLE、Fisher 信息矩阵、多参数 Delta 方法 se;\(n_1=n_2=200\)、\(X_1=160\)、\(X_2=148\) 时的 90% 区间(Delta 方法 vs 参数 bootstrap)。
  • 题 8:例 9.29 的 Fisher 信息矩阵。
  • 题 9:\(N(\mu,1)\),\(\theta=e^\mu\),\(\mu=5\)、\(n=100\);比较 Delta 方法、参数 bootstrap、非参数 bootstrap 的 se 与区间,以及它们对真实抽样分布的近似程度。
  • 题 10:Uniform\((0,\theta)\),\(\hat\theta=X_{(n)}\),\(n=50\);解析分布与参数/非参数 bootstrap 直方图比较;非参数 bootstrap 中 \(\mathbb P(\hat\theta^*=\hat\theta)\approx.632\),参数 bootstrap 中为 0。

本章要点

  1. 矩估计:令样本矩等于总体矩,简单、相合、渐近正态,但非最优,常作初值。
  2. 似然与 MLE:似然是参数的函数,不是参数的密度;常需对数似然;边界/支撑依赖参数时(均匀分布)不能求导。
  3. MLE 性质:相合(通过 KL 距离理解)、同变、渐近正态 \(\hat\theta\approx N(\theta,1/I_n(\theta))\)、渐近有效、近似贝叶斯。
  4. Fisher 信息 = 得分方差 = 负的二阶导期望;标准误 \(\widehat{\text{se}}=1/\sqrt{I_n(\hat\theta)}\);多参数时用 Fisher 信息矩阵的逆。
  5. Delta 方法(一元、多元)与参数 bootstrap 求函数的标准误。
  6. 充分统计量、因子分解定理、Rao–Blackwell;指数族及其矩性质 \(\mathbb E T=A'(\eta)\)、\(\mathbb V T=A''(\eta)\)。
  7. 数值求解:Newton–Raphson(用 Hessian)与 EM(隐变量模型,似然单调不降)。

与量化交易的关联

  • MLE 是金融计量的主力:GARCH 族波动率模型、ARMA、状态空间模型、跳跃扩散、信用违约强度、Hawkes 订单流模型等都用 MLE 估计;Fisher 信息矩阵的逆给出参数标准误,是判断参数是否显著的依据。
  • 数值优化:GARCH 等模型没有闭式解,用 Newton–Raphson/拟牛顿法(BFGS)最大化对数似然;矩估计常作初值。
  • EM 与隐状态:例 9.49–9.50 的正态混合直接对应市场状态(regime)混合模型——收益来自"平静"与"危机"两个正态分布的混合,EM 估计各状态参数,\(\tau_i\) 即每天处于危机状态的后验概率;隐马尔可夫模型(HMM)的 Baum–Welch 算法是 EM 的推广。
  • Delta 方法:例 9.29 的变异系数 \(\sigma/\mu\) 恰好是 Sharpe 比率的倒数,可直接改写为 Sharpe 比率标准误的推导;例 9.25 的 logit 变换用于胜率/违约概率的区间估计。
  • 模型错设:习题 6(e) 说明若真实分布不是正态,依赖正态模型的 MLE 可能不相合;而非参数估计仍相合。收益的厚尾使正态 MLE 有风险,可改用 t 分布似然或准极大似然(QMLE)并配合稳健标准误。
  • ARE:中位数在正态下效率 63%,但在厚尾分布下可能优于均值——稳健统计量(中位数、截尾均值)在估计期望收益时常更可靠。
  • 指数族与 GLM:指数族是第 13 章 logistic 回归、广义线性模型的基础,用于违约预测、涨跌方向分类。
  • 充分统计量:在线/流式计算中,只需维护 \((\sum X_i,\sum X_i^2)\) 即可更新正态模型的均值和方差(滚动波动率计算)。

推荐习题

  • 题 3(分位数的 MLE 与 Delta 方法——即正态 VaR 的置信区间,强烈推荐);题 7(两比例之差,多参数 Delta 方法 vs 参数 bootstrap);题 6(模型错设与 ARE);题 9、10(Delta 方法、参数与非参数 bootstrap 的比较及失效情形);题 2(MLE vs 插入估计的 MSE);建议另加 EM 编程练习(例 9.50)。

第 10 章 假设检验与 p 值(Hypothesis Testing and p-values)(PDF p.161–185)

引言(PDF p.161–164)

动机例:石棉暴露是否与肺病有关?把大鼠随机分两组,一组暴露于石棉,一组不暴露,比较患病率。原假设:两组患病率相同;备择假设:不同。若暴露组患病率高得多,则拒绝原假设,认为证据支持备择假设。

形式化:把参数空间 \(\Theta\) 划分为不相交的 \(\Theta_0,\Theta_1\),检验

\[H_0:\theta\in\Theta_0\quad\text{vs}\quad H_1:\theta\in\Theta_1.\tag{10.1}\]
\(X\) 为随机变量,\(\mathcal X\) 为其取值范围。找一个合适的子集 \(R\subset\mathcal X\),称拒绝域(rejection region):\(X\in R\Rightarrow\) 拒绝 \(H_0\);\(X\notin R\Rightarrow\) 保留 \(H_0\)。通常 \(R=\{x:T(x)>c\}\) (10.2),\(T\) 为检验统计量(test statistic),\(c\) 为临界值(critical value)。检验问题就是找合适的 \(T\) 和 \(c\)。

警告:人们倾向于在不合适的场合也使用假设检验;估计和置信区间往往是更好的工具,只有在要检验一个定义明确的假设时才用假设检验。

类比法庭审判:除非证据强烈表明有罪,否则推定无罪;类似地,除非有强证据,否则保留 \(H_0\)。两类错误(表 10.1):\(H_0\) 真却拒绝——第一类错误(type I error);\(H_1\) 真却保留 \(H_0\)——第二类错误(type II error)。

定义 10.1:拒绝域为 \(R\) 的检验的功效函数(power function)\(\beta(\theta)=\mathbb P_\theta(X\in R)\) (10.3);检验的大小(size)\(\alpha=\sup_{\theta\in\Theta_0}\beta(\theta)\) (10.4);若大小 ≤ \(\alpha\),称检验水平为 \(\alpha\)(level \(\alpha\))。

术语:\(\theta=\theta_0\) 为简单假设(simple hypothesis);\(\theta>\theta_0\) 或 \(\theta<\theta_0\) 为复合假设(composite hypothesis)。\(H_0:\theta=\theta_0\) vs \(H_1:\theta\ne\theta_0\) 为双侧检验(two-sided);\(H_0:\theta\le\theta_0\) vs \(H_1:\theta>\theta_0\)(或反向)为单侧检验(one-sided)。最常用的是双侧检验。

例 10.2:\(X_i\sim N(\mu,\sigma^2)\),\(\sigma\) 已知,检验 \(H_0:\mu\le0\) vs \(H_1:\mu>0\),\(\Theta_0=(-\infty,0]\)。检验:\(T=\bar X>c\) 时拒绝。功效函数

\[\beta(\mu)=\mathbb P_\mu(\bar X>c)=\mathbb P\left(Z>\frac{\sqrt n(c-\mu)}\sigma\right)=1-\Phi\left(\frac{\sqrt n(c-\mu)}\sigma\right),\]
关于 \(\mu\) 递增(图 10.1),故 size \(=\sup_{\mu\le0}\beta(\mu)=\beta(0)=1-\Phi(\sqrt nc/\sigma)\)。令其等于 \(\alpha\),解得 \(c=\sigma\Phi^{-1}(1-\alpha)/\sqrt n\)。即当 \(\sqrt n(\bar X-0)/\sigma>z_\alpha\) 时拒绝,\(z_\alpha=\Phi^{-1}(1-\alpha)\)。

在所有大小为 \(\alpha\) 的检验中,\(H_1\) 下功效最高者称为最有力检验(most powerful)。寻找它很难,很多情况下不存在。本章只介绍四种常用检验:Wald 检验(脚注:以 Abraham Wald (1902–1950) 命名,1950 年在印度空难中去世)、\(\chi^2\) 检验、置换检验、似然比检验。

10.1 Wald 检验(The Wald Test)(PDF p.164–168)

\(\theta\) 为标量参数,\(\hat\theta\) 为估计,\(\widehat{\text{se}}\) 为其估计标准误。 定义 10.3:检验 \(H_0:\theta=\theta_0\) vs \(H_1:\theta\ne\theta_0\),假设 \(\hat\theta\) 渐近正态 \(\frac{\hat\theta-\theta_0}{\widehat{\text{se}}}\rightsquigarrow N(0,1)\)。大小 \(\alpha\) 的 Wald 检验:当 \(|W|>z_{\alpha/2}\) 时拒绝 \(H_0\),

\[W=\frac{\hat\theta-\theta_0}{\widehat{\text{se}}}.\tag{10.5}\]
定理 10.4:渐近地,Wald 检验大小为 \(\alpha\):\(\mathbb P_{\theta_0}(|W|>z_{\alpha/2})\to\alpha\)。证明:\(\theta=\theta_0\) 时 \((\hat\theta-\theta_0)/\widehat{\text{se}}\rightsquigarrow N(0,1)\),拒绝概率 \(\to\mathbb P(|Z|>z_{\alpha/2})=\alpha\)。 注 10.5:另一版本用 \(\theta=\theta_0\) 处计算的标准误 \(\text{se}_0\):\(W=(\hat\theta-\theta_0)/\text{se}_0\),两种都有效。

定理 10.6(Wald 检验的功效):真值 \(\theta_\star\ne\theta_0\) 时,功效(正确拒绝的概率)近似为

\[1-\Phi\left(\frac{\theta_0-\theta_\star}{\widehat{\text{se}}}+z_{\alpha/2}\right)+\Phi\left(\frac{\theta_0-\theta_\star}{\widehat{\text{se}}}-z_{\alpha/2}\right).\tag{10.6}\]
由于 se 随样本量增大趋于 0:(i) \(\theta_\star\) 离 \(\theta_0\) 越远功效越大;(ii) 样本量越大功效越大。

例 10.7(比较两个预测算法):算法 1 在大小 \(m\) 的测试集上错 \(X\) 个,算法 2 在大小 \(n\) 的另一测试集上错 \(Y\) 个,\(X\sim\) Bin\((m,p_1)\),\(Y\sim\) Bin\((n,p_2)\)。检验 \(H_0:\delta=0\),\(\delta=p_1-p_2\)。MLE \(\hat\delta=\hat p_1-\hat p_2\),\(\widehat{\text{se}}=\sqrt{\frac{\hat p_1(1-\hat p_1)}m+\frac{\hat p_2(1-\hat p_2)}n}\),\(W=\frac{\hat p_1-\hat p_2}{\widehat{\text{se}}}\),\(|W|>z_{\alpha/2}\) 时拒绝。\(p_1,p_2\) 差别大、样本量大时功效最大。 配对比较(paired comparison):若两算法用同一测试集,两样本不再独立。令 \(X_i=1\) 表示算法 1 在第 \(i\) 个案例上正确,\(Y_i\) 同理,\(D_i=X_i-Y_i\)(示例数据:1/0/1, 1/1/0, 1/1/0, 0/1/−1, 0/0/0, …, 0/1/−1)。\(\delta=\mathbb E(D_i)=\mathbb P(X_i=1)-\mathbb P(Y_i=1)\)。非参数插入估计 \(\hat\delta=\bar D=n^{-1}\sum D_i\),\(\widehat{\text{se}}(\hat\delta)=S/\sqrt n\),\(S^2=n^{-1}\sum(D_i-\bar D)^2\)。\(W=\hat\delta/\widehat{\text{se}}\),\(|W|>z_{\alpha/2}\) 时拒绝。

例 10.8(比较两均值):独立样本 \(X_1..X_m\)、\(Y_1..Y_n\),均值 \(\mu_1,\mu_2\),\(H_0:\delta=0\),\(\delta=\mu_1-\mu_2\)。插入估计 \(\hat\delta=\bar X-\bar Y\),\(\widehat{\text{se}}=\sqrt{\frac{s_1^2}m+\frac{s_2^2}n}\)(\(s_1^2,s_2^2\) 为样本方差),\(W=\frac{\bar X-\bar Y}{\sqrt{s_1^2/m+s_2^2/n}}\),\(|W|>z_{\alpha/2}\) 时拒绝。 例 10.9(比较两中位数):\(\delta=\nu_1-\nu_2\),插入估计为样本中位数之差,\(\widehat{\text{se}}\) 由 bootstrap 得到,\(W=\hat\delta/\widehat{\text{se}}\)。

定理 10.10(检验与置信区间的对偶):大小 \(\alpha\) 的 Wald 检验拒绝 \(H_0:\theta=\theta_0\) 当且仅当 \(\theta_0\notin C=(\hat\theta-\widehat{\text{se}}z_{\alpha/2},\hat\theta+\widehat{\text{se}}z_{\alpha/2})\)。检验假设等价于检查原假设值是否在置信区间内。

警告(统计显著 vs 科学显著):拒绝 \(H_0\) 时常说结果"统计显著"(statistically significant)。结果可能统计显著但效应很小,在科学或实际上不显著。由定理 10.10 理解:任何不含 \(\theta_0\) 的置信区间都对应拒绝 \(H_0\),但区间内的值可能离 \(\theta_0\) 很近(无实际意义)或很远(有实际意义)(图 10.2)。这说明:统计显著不等于科学重要;置信区间往往比检验更有信息量。

10.2 p 值(p-values)(PDF p.168–171)

只报告"拒绝/保留 \(H_0\)"信息量不大。可以对每个 \(\alpha\) 问检验是否在该水平拒绝。一般在水平 \(\alpha\) 拒绝则在 \(\alpha'>\alpha\) 也拒绝,因此存在一个使检验拒绝的最小 \(\alpha\),即 p 值(图 10.3)。 定义 10.11:对每个 \(\alpha\in(0,1)\) 有大小为 \(\alpha\)、拒绝域为 \(R_\alpha\) 的检验,则 \(\text{p-value}=\inf\{\alpha:T(X^n)\in R_\alpha\}\),即能拒绝 \(H_0\) 的最小水平。 非正式地,p 值度量反对 \(H_0\) 的证据:越小证据越强。常用证据尺度:

p 值 证据
< .01 很强的反对 \(H_0\) 的证据
.01 – .05 强证据
.05 – .10 弱证据
> .1 几乎没有证据

警告:大的 p 值不是支持 \(H_0\) 的强证据,原因可能是 (i) \(H_0\) 为真,或 (ii) \(H_0\) 为假但检验功效低。 警告:不要把 p 值与 \(\mathbb P(H_0\mid\text{Data})\) 混淆,p 值不是原假设为真的概率(后者在贝叶斯章节讨论)。

定理 10.12:若大小为 \(\alpha\) 的检验形如"\(T(X^n)\ge c_\alpha\) 时拒绝",则

\[\text{p-value}=\sup_{\theta\in\Theta_0}\mathbb P_\theta(T(X^n)\ge T(x^n)),\]
\(x^n\) 为观测值;若 \(\Theta_0=\{\theta_0\}\),则 \(\text{p-value}=\mathbb P_{\theta_0}(T(X^n)\ge T(x^n))\)。 即:p 值是在 \(H_0\) 下观察到与实际观测同样或更极端的检验统计量值的概率。

定理 10.13:令 \(w=(\hat\theta-\theta_0)/\widehat{\text{se}}\) 为 Wald 统计量观测值,则

\[\text{p-value}=\mathbb P_{\theta_0}(|W|>|w|)\approx\mathbb P(|Z|>|w|)=2\Phi(-|w|).\tag{10.7}\]
(图 10.4:p 值为 \(|w|\) 外两侧尾面积。)

定理 10.14:若检验统计量分布连续,则在 \(H_0:\theta=\theta_0\) 下 p 值服从 Uniform(0,1)。因此若在 p 值 < \(\alpha\) 时拒绝,第一类错误概率为 \(\alpha\)。即 \(H_0\) 为真时,p 值像一次 Unif(0,1) 抽样;\(H_1\) 为真时,p 值分布倾向于集中在 0 附近。

例 10.15(胆固醇数据续):均值差 \(W=\frac{216.2-195.3}{\sqrt{5^2+2.4^2}}=3.78\),p 值 \(=\mathbb P(|Z|>3.78)=2\mathbb P(Z<-3.78)=.0002\),很强的反对证据。中位数差:\(W=\frac{212.5-194}{7.7}=2.4\)(se 由 bootstrap 得),p 值 \(=2\mathbb P(Z<-2.4)=.02\),强证据。

10.3 \(\chi^2\) 分布(PDF p.171)

\(Z_1,\dots,Z_k\) 独立标准正态,\(V=\sum Z_i^2\sim\chi^2_k\),密度 \(f(v)=\frac{v^{k/2-1}e^{-v/2}}{2^{k/2}\Gamma(k/2)}\)(\(v>0\)),\(\mathbb E V=k\),\(\mathbb V V=2k\)。上 \(\alpha\) 分位数 \(\chi^2_{k,\alpha}=F^{-1}(1-\alpha)\),即 \(\mathbb P(\chi^2_k>\chi^2_{k,\alpha})=\alpha\)。

10.4 多项数据的 Pearson \(\chi^2\) 检验(Pearson's \(\chi^2\) Test For Multinomial Data)(PDF p.172–173)

\(X=(X_1,\dots,X_k)\sim\) Multinomial\((n,p)\),MLE \(\hat p=(X_1/n,\dots,X_k/n)\)。给定 \(p_0\),检验 \(H_0:p=p_0\) vs \(H_1:p\ne p_0\)。 定义 10.16:Pearson \(\chi^2\) 统计量

\[T=\sum_{j=1}^k\frac{(X_j-np_{0j})^2}{np_{0j}}=\sum_{j=1}^k\frac{(X_j-E_j)^2}{E_j},\]
\(E_j=\mathbb E(X_j)=np_{0j}\) 为 \(H_0\) 下的期望频数。 定理 10.17:\(H_0\) 下 \(T\rightsquigarrow\chi^2_{k-1}\)。故"\(T>\chi^2_{k-1,\alpha}\) 时拒绝"渐近水平为 \(\alpha\);p 值为 \(\mathbb P(\chi^2_{k-1}>t)\)(图 10.5)。

例 10.18(孟德尔豌豆):孟德尔用圆黄与皱绿种子杂交,后代四类:圆黄、皱黄、圆绿、皱绿,其遗传理论预言 \(p_0=(9/16,3/16,3/16,1/16)\)。\(n=556\),观测 \(X=(315,101,108,32)\),期望 \(312.75,104.25,104.25,34.75\)。

\[T=\frac{(315-312.75)^2}{312.75}+\frac{(101-104.25)^2}{104.25}+\frac{(108-104.25)^2}{104.25}+\frac{(32-34.75)^2}{34.75}=0.47.\]
\(\chi^2_3\) 的 \(\alpha=.05\) 临界值为 7.815,0.47 不超过它,不拒绝;p 值 \(=\mathbb P(\chi^2_3>.47)=.93\),没有反对 \(H_0\) 的证据,数据与孟德尔理论不矛盾(脚注:有争议认为孟德尔的结果"好得过头")。 作者评论:此例中假设检验也许不是合适工具。检验适合在 \(H_0\) 代表现状时寻找拒绝证据,不适合证明 \(H_0\) 为真;未能拒绝可能只是功效低。给出 \(p\) 与 \(p_0\) 距离的置信集可能更有用。

10.5 置换检验(The Permutation Test)(PDF p.173–176)

非参数方法,检验两个分布是否相同;它是精确的,不依赖大样本近似。独立样本 \(X_1..X_m\sim F_X\)、\(Y_1..Y_n\sim F_Y\),检验 \(H_0:F_X=F_Y\) vs \(H_1:F_X\ne F_Y\)(如处理 vs 安慰剂)。取检验统计量如 \(T(X_1,\dots,X_m,Y_1,\dots,Y_n)=|\bar X_m-\bar Y_n|\)。令 \(N=m+n\),考虑数据的全部 \(N!\) 个排列,对每个排列计算 \(T\),得 \(T_1,\dots,T_{N!}\)。在 \(H_0\) 下这些值等可能(脚注:更精确地,给定有序数据值,\(X_1..X_m,Y_1..Y_n\) 在 \(N!\) 个排列上均匀分布)。在每个 \(T_j\) 上放 \(1/N!\) 质量的分布 \(\mathbb P_0\) 称为 \(T\) 的置换分布(permutation distribution)。观测值 \(t_{obs}\),若 \(T\) 大时拒绝,

\[\text{p-value}=\mathbb P_0(T>t_{obs})=\frac1{N!}\sum_{j=1}^{N!}I(T_j>t_{obs}).\]
例 10.19(玩具例):\((X_1,X_2,Y_1)=(1,9,3)\),\(T=|\bar X-\bar Y|=2\)。6 个排列:(1,9,3)→2,(9,1,3)→2,(1,3,9)→7,(3,1,9)→7,(3,9,1)→5,(9,3,1)→5,各概率 1/6。p 值 \(=\mathbb P(T>2)=4/6\)。

通常无法枚举 \(N!\) 个排列,可随机抽取排列近似: 置换检验算法:

  1. 计算观测统计量 \(t_{obs}=T(X_1,\dots,X_m,Y_1,\dots,Y_n)\);
  2. 随机打乱数据,重算统计量;
  3. 重复第 2 步 \(B\) 次,得 \(T_1,\dots,T_B\);
  4. 近似 p 值 \(=\frac1B\sum_{j=1}^BI(T_j>t_{obs})\)。

例 10.20(DNA 微阵列):微阵列可测量数千个基因的表达水平(mRNA 水平,数值越大基因越活跃)。Efron et al. (2001) 数据:10 名两类肝癌患者(Type I:患者 1–5,Type II:患者 6–10),共 2638 个基因,数据为两种染料强度的对数比。基因 1:230, −1350, −1580, −400, −760 | 970, 110, −50, −190, −200;基因 2:470, −850, −.8, −280, 120 | 390, −1730, −1360, −1, −330。检验基因 1 在两组的中位数是否不同:\(T=|\hat\nu_1-\hat\nu_2|=710\),模拟置换分布得 p 值 .045,在 \(\alpha=.05\) 下有证据拒绝无差异的原假设。 大样本时置换检验与大样本理论检验结果通常相似,因此它对小样本最有用。

10.6 似然比检验(The Likelihood Ratio Test)(PDF p.176–177)

Wald 检验适合标量参数;似然比检验更一般,可检验向量参数。 定义 10.21:检验 \(H_0:\theta\in\Theta_0\) vs \(H_1:\theta\notin\Theta_0\),似然比统计量

\[\lambda=2\log\left(\frac{\sup_{\theta\in\Theta}\mathcal L(\theta)}{\sup_{\theta\in\Theta_0}\mathcal L(\theta)}\right)=2\log\left(\frac{\mathcal L(\hat\theta)}{\mathcal L(\hat\theta_0)}\right),\]
\(\hat\theta\) 为 MLE,\(\hat\theta_0\) 为限制在 \(\Theta_0\) 内的 MLE。分子用 \(\Theta\) 而非 \(\Theta_0^c\):实际影响很小,理论性质简单得多。 似然比检验最适合 \(\Theta_0\) 由"某些坐标固定为特定值"构成的情形。 定理 10.22:\(\theta=(\theta_1,\dots,\theta_q,\theta_{q+1},\dots,\theta_r)\),\(\Theta_0=\{\theta:(\theta_{q+1},\dots,\theta_r)=(\theta_{0,q+1},\dots,\theta_{0,r})\}\)。\(H_0\) 下 \(\lambda(x^n)\rightsquigarrow\chi^2_{r-q}\),\(r-q\) 为 \(\Theta\) 的维数减 \(\Theta_0\) 的维数。p 值为 \(\mathbb P(\chi^2_{r-q}>\lambda)\)。例:\(\theta=(\theta_1..\theta_5)\),检验 \(\theta_4=\theta_5=0\),极限分布自由度 \(5-3=2\)。(此即 Wilks 定理。)

例 10.23(孟德尔豌豆再访):

\[\lambda=2\log\frac{\mathcal L(\hat p)}{\mathcal L(p_0)}=2\sum_{j=1}^4X_j\log\frac{\hat p_j}{p_{0j}}=2\left(315\log\frac{315/556}{9/16}+101\log\frac{101/556}{3/16}+108\log\frac{108/556}{3/16}+32\log\frac{32/556}{1/16}\right)=0.48.\]
\(H_1\) 下 4 个参数但和为 1,维数 3;\(H_0\) 下无自由参数,维数 0;差为 3,\(\lambda\rightsquigarrow\chi^2_3\),p 值 \(=\mathbb P(\chi^2_3>.48)=.92\),结论与 \(\chi^2\) 检验相同。两种检验都适用时,大样本下结果通常相近。

10.7 多重检验(Multiple Testing)(PDF p.177–180)

例 10.20 实际有 2638 个基因,对每个基因都检验就是 2638 个独立的检验。每个在水平 \(\alpha\) 下进行时,单个检验错误拒绝的概率为 \(\alpha\),但至少一次错误拒绝的概率高得多——这就是多重检验问题,在数据挖掘中可能要检验成千上万甚至上百万个假设。介绍两种方法。考虑 \(m\) 个检验 \(H_{0i}\) vs \(H_{1i}\),p 值 \(P_1,\dots,P_m\)。

Bonferroni 方法:若 \(P_i<\alpha/m\),拒绝 \(H_{0i}\)。 定理 10.24:用 Bonferroni 方法,错误拒绝任一原假设的概率 ≤ \(\alpha\)(控制族错误率 FWER)。证明:\(R\)=至少一个原假设被错误拒绝,\(R_i\)=第 \(i\) 个被错误拒绝。由次可加性 \(\mathbb P(\bigcup A_i)\le\sum\mathbb P(A_i)\),\(\mathbb P(R)\le\sum_i\mathbb P(R_i)=\sum_i\frac\alpha m=\alpha\)(用到定理 10.14)。 例 10.25:基因例中 \(\alpha=.05\),阈值 \(.05/2638=.00001895375\),p 值低于此的基因才宣布显著。

Bonferroni 非常保守,因为它试图让"哪怕一次错误拒绝"都不太可能。更合理的做法有时是控制错误发现率(false discovery rate, FDR)——错误拒绝数除以拒绝数的均值。 设拒绝 p 值低于某阈值的所有原假设。\(m_0\) 为真原假设个数,\(m_1=m-m_0\)。表 10.2:

未拒绝 \(H_0\) 拒绝 \(H_0\) 合计
\(H_0\) 真 \(U\) \(V\) \(m_0\)
\(H_0\) 假 \(T\) \(S\) \(m_1\)
合计 \(m-R\) \(R\) \(m\)

错误发现比例(false discovery proportion):\(\text{FDP}=V/R\)(\(R>0\)),\(=0\)(\(R=0\))——拒绝中错误的比例。\(\text{FDR}=\mathbb E(\text{FDP})\)。

Benjamini–Hochberg (BH) 方法:

  1. 排序 p 值 \(P_{(1)}<\cdots<P_{(m)}\);
  2. 定义 \(\ell_i=\frac{i\alpha}{C_mm}\),\(R=\max\{i:P_{(i)}<\ell_i\}\) (10.8),其中 p 值独立时 \(C_m=1\),否则 \(C_m=\sum_{i=1}^m(1/i)\);
  3. 令 \(T=P_{(R)}\),称为 BH 拒绝阈值;
  4. 拒绝所有 \(P_i\le T\) 的 \(H_{0i}\)。 定理 10.26(Benjamini & Hochberg):无论多少原假设为真、无论备择下 p 值分布如何,\(\text{FDR}=\mathbb E(\text{FDP})\le\frac{m_0}m\alpha\le\alpha\)。

例 10.27:图 10.6 中 6 个排序 p 值。不校正:拒绝所有 \(P_i<\alpha\) 的,此例拒绝 4 个;Bonferroni:拒绝 \(P_i<\alpha/m\) 的,此例 0 个;BH 阈值对应最后一个落在斜率为 \(\alpha/m\) 的直线下方的 p 值(最右侧下穿点),此例拒绝 2 个。 例 10.28:10 个独立检验的排序 p 值:0.00017, 0.00448, 0.00671, 0.00907, 0.01220, 0.33626, 0.39341, 0.53882, 0.58125, 0.98617。\(\alpha=0.05\):Bonferroni 阈值 0.005,只拒绝前两个;BH 找最大 \(i\) 使 \(P_{(i)}<i\alpha/m\):\(i=5\) 时 \(0.01220<0.025\) 成立,\(i=6\) 时 \(0.336>0.03\) 不成立,故拒绝前五个。

10.8 拟合优度检验(Goodness-of-fit Tests)(PDF p.180–181)

检验数据是否来自假设的参数模型 \(\mathfrak F=\{f(x;\theta):\theta\in\Theta\}\)。把实轴分成 \(k\) 个不相交区间 \(I_1,\dots,I_k\),\(p_j(\theta)=\int_{I_j}f(x;\theta)dx\) 为模型下观测落入 \(I_j\) 的概率,\(\theta=(\theta_1,\dots,\theta_s)\)。\(N_j\) 为落入 \(I_j\) 的观测数。基于计数的多项似然 \(Q(\theta)=\prod_jp_j(\theta)^{N_j}\),最大化得 \(\tilde\theta=(\tilde\theta_1,\dots,\tilde\theta_s)\)。检验统计量

\[Q=\sum_{j=1}^k\frac{(N_j-np_j(\tilde\theta))^2}{np_j(\tilde\theta)}.\tag{10.9}\]
定理 10.29:\(H_0\)(数据为模型的 IID 抽样)下,\(Q\rightsquigarrow\chi^2_{k-1-s}\),近似 p 值为 \(\mathbb P(\chi^2_{k-1-s}>q)\)。 常见误区:诱人的做法是用原始数据的 MLE \(\hat\theta\) 代替 \(\tilde\theta\),但这样统计量的极限分布不是 \(\chi^2_{k-1-s}\);不过由 Chernoff & Lehmann (1954) 的定理,p 值大致夹在用 \(\chi^2_{k-1-s}\) 与 \(\chi^2_{k-1}\) 算出的 p 值之间。 局限:拒绝 \(H_0\) 则说明不应使用该模型;但不拒绝不能推出模型正确,可能只是功效不足。这也是尽量使用非参数方法、少依赖参数假设的理由。

10.9 文献注(PDF p.181)

最全面的检验专著:Lehmann (1986);另见 Casella & Berger (2002) 第 8 章、Rice (1995) 第 9 章。FDR 方法来自 Benjamini & Hochberg (1995)。部分习题取自 Rice (1995)。

10.10 附录(PDF p.182)

10.10.1 Neyman–Pearson 引理:简单原假设 \(H_0:\theta=\theta_0\) vs 简单备择 \(H_1:\theta=\theta_1\) 时可精确给出最有力检验。 定理 10.30(Neyman–Pearson):令 \(T=\frac{\mathcal L(\theta_1)}{\mathcal L(\theta_0)}=\frac{\prod f(x_i;\theta_1)}{\prod f(x_i;\theta_0)}\),当 \(T>k\) 时拒绝,选 \(k\) 使 \(\mathbb P_{\theta_0}(T>k)=\alpha\),则此检验在所有大小为 \(\alpha\) 的检验中功效 \(\beta(\theta_1)\) 最大。 10.10.2 t 检验:检验均值 \(H_0:\mu=\mu_0\) 可用 Wald 检验;若数据假设正态且样本小,常用 t 检验。\(t_k\) 密度 \(f(t)=\frac{\Gamma((k+1)/2)}{\sqrt{k\pi}\Gamma(k/2)}\frac1{(1+t^2/k)^{(k+1)/2}}\),\(k\to\infty\) 趋于正态,\(k=1\) 为柯西。\(X_i\sim N(\mu,\sigma^2)\),\(\theta=(\mu,\sigma^2)\) 均未知,\(T=\frac{\sqrt n(\bar X_n-\mu_0)}{S_n}\)(\(S_n^2\) 为样本方差)。大样本下 \(H_0\) 时 \(T\approx N(0,1)\);精确分布为 \(t_{n-1}\)。故 \(|T|>t_{n-1,\alpha/2}\) 时拒绝得大小 \(\alpha\) 的检验。\(n\) 中等大时 t 检验与 Wald 检验基本相同。

10.11 习题(PDF p.182–185)概览

共 16 题:

  • 证明类:定理 10.6(功效公式)、10.14(p 值均匀分布)、10.10(检验与区间对偶)、10.12(p 值公式)(题 1–4)。
  • 题 5:Uniform\((0,\theta)\),\(Y=\max X_i\),检验 \(H_0:\theta=1/2\) vs \(H_1:\theta>1/2\)(Wald 不适用,因 \(Y\) 不渐近正态);求功效函数、使大小为 .05 的 \(c\);\(n=20\) 时 \(Y=0.48\)、\(Y=0.52\) 的 p 值与结论(后者 p 值为 0,必然拒绝)。
  • 题 6:逾越节前后死亡数(1919 例中 922 在节前一周、997 在节后一周),检验"人能推迟死亡"理论,\(\theta=1/2\) 的二项检验 p 值与置信区间。
  • 题 7:马克·吐温与 "Quintus Curtius Snodgrass" 文章三字母词比例(Twain 8 篇:.225 .262 .217 .240 .230 .229 .235 .217;Snodgrass 10 篇:.209 .205 .196 .210 .202 .207 .224 .223 .220 .201):(a) Wald 检验均值相等、p 值、95% 区间;(b) 置换检验。
  • 题 8:\(N(\theta,1)\) 检验 \(\theta=0\) vs \(\theta=1\),求临界值、功效 \(\beta(1)\),证明 \(\beta(1)\to1\)。
  • 题 9:Wald 检验在固定备择下功效趋于 1(检验的相合性)。
  • 题 10:中秋节前后华人与犹太老年女性死亡数(第 −2,−1,1,2 周:华人 55,33,70,49;犹太 141,145,139,161),比较死亡模式。
  • 题 11:术后恶心药物随机双盲试验(安慰剂 80 人 45 例恶心;氯丙嗪 75/26;茶苯海明 85/52;戊巴比妥 100mg 67/35;150mg 85/37):各药对比安慰剂(5% 水平)并报告比值比(odds ratio);用 Bonferroni 与 FDR 校正多重检验。
  • 题 12:Poisson 的 Wald 检验;计算机实验 \(\lambda_0=1\)、\(n=20\)、\(\alpha=.05\) 模拟实际第一类错误率是否接近 .05。
  • 题 13–15:正态均值、正态标准差、二项比例的似然比检验,并与 Wald 检验比较。
  • 题 16:证明标量参数下 Wald 与似然比检验渐近等价:\(W^2/\lambda\xrightarrow P1\)(提示:对 \(\ell(\theta_0)\) 在 \(\hat\theta\) 处泰勒展开 \(\ell(\theta_0)\approx\ell(\hat\theta)+(\theta_0-\hat\theta)\ell'(\hat\theta)+\frac12(\theta_0-\hat\theta)^2\ell''(\hat\theta)\),且 \(\ell'(\hat\theta)=0\))。

本章要点

  1. 检验框架:\(H_0/H_1\)、拒绝域、检验统计量、临界值;第一/二类错误;功效函数、大小、水平。
  2. Wald 检验 \(W=(\hat\theta-\theta_0)/\widehat{\text{se}}\);与置信区间对偶;功效随效应大小和样本量增加。两样本比较分独立样本与配对样本。
  3. p 值是 \(H_0\) 下出现同样或更极端结果的概率,\(H_0\) 下服从均匀分布;它不是 \(H_0\) 为真的概率,大 p 值也不是支持 \(H_0\) 的证据。
  4. 统计显著 ≠ 实际显著;置信区间通常比检验更有信息。
  5. Pearson \(\chi^2\) 检验(多项分布)、置换检验(精确、非参数)、似然比检验(\(\chi^2_{r-q}\) 极限)、拟合优度检验(自由度 \(k-1-s\))。
  6. 多重检验:Bonferroni 控制 FWER(保守),BH 控制 FDR(更有功效)。
  7. Neyman–Pearson 引理给出简单 vs 简单假设下的最有力检验;小样本正态均值用 t 检验。

与量化交易的关联

  • 策略/因子显著性检验:检验平均收益或 alpha 是否为 0 就是 Wald/t 检验;\(t=\bar r/(s/\sqrt n)\)。实务中收益有自相关与异方差,应使用 Newey–West 等稳健标准误。
  • 多重检验是量化研究的核心问题:挖掘成百上千个因子或参数组合,"总有一个显著"。Harvey, Liu & Zhu (2016) 主张因子 t 值门槛提高到 3 左右;Bonferroni 与 BH-FDR 可直接用于因子筛选,例 10.28 的计算流程可原样迁移到"10 个候选因子的 p 值"。Bailey & López de Prado 的"压缩 Sharpe 比率"(deflated Sharpe ratio)也源于同一思想。
  • 配对比较:例 10.7 的配对思路用于比较两个策略在同一时间段的表现(对每日收益差做检验),比把两条收益序列当独立样本更有功效。
  • 置换检验:适合检验择时信号是否有效——随机打乱信号与收益的对应关系(或随机化入场日期)得到置换分布,判断实际表现是否超出随机水平;它不依赖正态假设,适合小样本和厚尾数据(但打乱会破坏时间依赖结构,需谨慎)。
  • 似然比检验:用于嵌套模型比较,例如 GARCH(1,1) vs ARCH(1)、双状态 vs 单状态模型(注意状态数检验时正则条件不成立)、因子模型中额外因子是否显著。
  • 拟合优度:检验收益是否正态(\(\chi^2\) 分箱检验、以及 Jarque–Bera、KS 等),几乎总会拒绝正态,提醒使用厚尾模型。
  • 统计 vs 经济显著:一个 t 值很高但年化超额只有 0.3%、扣除交易成本后为负的因子没有实际价值——图 10.2 的道理。
  • p 值误读:p=0.01 不代表"策略有效的概率为 99%";要得到后者需贝叶斯方法和先验(第 11 章)。

推荐习题

  • 题 11(多药对比 + Bonferroni/FDR,可改编为多因子筛选);题 7(Wald vs 置换检验);题 12(模拟验证第一类错误率);题 16(Wald 与 LRT 渐近等价);题 5(非正态统计量的检验);题 13–15(构造似然比检验)。

第 11 章 贝叶斯推断(Bayesian Inference)(PDF p.186–203)

11.1 贝叶斯哲学(The Bayesian Philosophy)(PDF p.186–187)

前面各章的方法称为频率学派(frequentist)或经典方法,基于以下公设:

  • F1 概率指极限相对频率,是现实世界的客观性质。
  • F2 参数是固定的未知常数;它们不波动,因此不能对参数作有用的概率陈述。
  • F3 统计程序应具有定义明确的长期频率性质,例如 95% 置信区间应以至少 95% 的极限频率套住真参数。

贝叶斯推断(Bayesian inference)基于以下公设:

  • B1 概率描述信念度,而非极限频率。因此可以对很多事物作概率陈述,而不仅仅是受随机变化影响的数据。例:"爱因斯坦在 1948 年 8 月 1 日喝过一杯茶的概率为 .35",这不对应任何极限频率,只反映我对该命题的信念强度。
  • B2 即使参数是固定常数,也可以对参数作概率陈述。
  • B3 对参数 \(\theta\) 的推断通过给出 \(\theta\) 的概率分布来实现,点估计、区间估计等都从这个分布中提取。

贝叶斯推断有争议,因为它天然接受主观概率;一般而言贝叶斯方法不保证长期表现。统计学界更重视频率方法,但贝叶斯方法确有一席之地;某些数据挖掘和机器学习社区非常热衷贝叶斯方法。先放下哲学争论,看看怎么做,章末再讨论优缺点。

11.2 贝叶斯方法(The Bayesian Method)(PDF p.187–190)

步骤:

  1. 选择先验分布(prior distribution)\(f(\theta)\),表达在看到数据前对参数的信念;
  2. 选择统计模型 \(f(x\mid\theta)\),反映给定 \(\theta\) 时对 \(x\) 的信念(现在写 \(f(x\mid\theta)\) 而不是 \(f(x;\theta)\));
  3. 观测数据 \(X_1,\dots,X_n\) 后更新信念,计算后验分布(posterior distribution)\(f(\theta\mid X_1,\dots,X_n)\)。

第 3 步怎么做:把参数当随机变量,记为大写 \(\Theta\)。离散情形单个观测:

\[\mathbb P(\Theta=\theta\mid X=x)=\frac{\mathbb P(X=x,\Theta=\theta)}{\mathbb P(X=x)}=\frac{\mathbb P(X=x\mid\Theta=\theta)\mathbb P(\Theta=\theta)}{\sum_\theta\mathbb P(X=x\mid\Theta=\theta)\mathbb P(\Theta=\theta)}\]
即第 1 章的贝叶斯定理。连续版本:
\[f(\theta\mid x)=\frac{f(x\mid\theta)f(\theta)}{\int f(x\mid\theta)f(\theta)d\theta}.\tag{11.1}\]
\(n\) 个 IID 观测时把 \(f(x\mid\theta)\) 换成 \(f(x_1,\dots,x_n\mid\theta)=\prod f(x_i\mid\theta)=\mathcal L_n(\theta)\)。记号:\(X^n=(X_1,\dots,X_n)\),\(x^n=(x_1,\dots,x_n)\)。
\[f(\theta\mid x^n)=\frac{f(x^n\mid\theta)f(\theta)}{\int f(x^n\mid\theta)f(\theta)d\theta}=\frac{\mathcal L_n(\theta)f(\theta)}{c_n}\propto\mathcal L_n(\theta)f(\theta),\tag{11.2}\]
\[c_n=\int\mathcal L_n(\theta)f(\theta)d\theta\tag{11.3}\]
称为归一化常数(normalizing constant),不依赖 \(\theta\)。概括:后验正比于似然乘先验(Posterior ∝ Likelihood × Prior),\(f(\theta\mid x^n)\propto\mathcal L_n(\theta)f(\theta)\)。丢掉常数 \(c_n\) 没关系,需要时总能找回。

后验的用途:点估计取后验中心,常用后验均值或众数。后验均值

\[\bar\theta_n=\int\theta f(\theta\mid x^n)d\theta=\frac{\int\theta\mathcal L_n(\theta)f(\theta)d\theta}{\int\mathcal L_n(\theta)f(\theta)d\theta}.\tag{11.4}\]
贝叶斯区间估计:找 \(a,b\) 使 \(\int_{-\infty}^af(\theta\mid x^n)d\theta=\int_b^\infty f(\theta\mid x^n)d\theta=\alpha/2\),令 \(C=(a,b)\),则 \(\mathbb P(\theta\in C\mid x^n)=\int_a^bf(\theta\mid x^n)d\theta=1-\alpha\),\(C\) 称为 \(1-\alpha\) 后验区间(posterior interval)。

例 11.1(Bernoulli + 均匀先验):\(X_i\sim\) Bernoulli\((p)\),先验 \(f(p)=1\)。后验 \(f(p\mid x^n)\propto f(p)\mathcal L_n(p)=p^s(1-p)^{n-s}=p^{s+1-1}(1-p)^{n-s+1-1}\),\(s=\sum x_i\) 为成功次数。回顾 Beta\((\alpha,\beta)\) 密度 \(f(p;\alpha,\beta)=\frac{\Gamma(\alpha+\beta)}{\Gamma(\alpha)\Gamma(\beta)}p^{\alpha-1}(1-p)^{\beta-1}\),可见后验为 Beta\((s+1,n-s+1)\):

\[f(p\mid x^n)=\frac{\Gamma(n+2)}{\Gamma(s+1)\Gamma(n-s+1)}p^{(s+1)-1}(1-p)^{(n-s+1)-1},\quad p\mid x^n\sim\text{Beta}(s+1,n-s+1).\]
注意我们没有真正去积分 \(\int\mathcal L_n(p)f(p)dp\) 就确定了归一化常数(识别出分布族即可)。Beta 均值 \(\alpha/(\alpha+\beta)\),故贝叶斯估计 \(\bar p=\frac{s+1}{n+2}\) (11.5)。改写为
\[\bar p=\lambda_n\hat p+(1-\lambda_n)\tilde p,\tag{11.6}\]
\(\hat p=s/n\) 为 MLE,\(\tilde p=1/2\) 为先验均值,\(\lambda_n=n/(n+2)\approx1\)——后验均值是 MLE 与先验均值的加权平均。95% 后验区间可数值求 \(a,b\) 使 \(\int_a^bf(p\mid x^n)dp=.95\)。 若改用先验 \(p\sim\) Beta\((\alpha,\beta)\),同理 \(p\mid x^n\sim\) Beta\((\alpha+s,\beta+n-s)\);平坦先验是 \(\alpha=\beta=1\) 的特例。后验均值
\[\bar p=\frac{\alpha+s}{\alpha+\beta+n}=\left(\frac n{\alpha+\beta+n}\right)\hat p+\left(\frac{\alpha+\beta}{\alpha+\beta+n}\right)p_0,\quad p_0=\frac\alpha{\alpha+\beta}.\]
(先验相当于 \(\alpha+\beta\) 个"伪观测"。) 共轭先验(conjugate prior):先验与后验属于同一分布族时,称先验关于该模型共轭。

例 11.2(正态-正态共轭):\(X_i\sim N(\theta,\sigma^2)\),\(\sigma\) 已知,先验 \(\theta\sim N(a,b^2)\)。(习题 1 证明)后验 \(\theta\mid X^n\sim N(\bar\theta,\tau^2)\),

\[\bar\theta=w\bar X+(1-w)a,\quad w=\frac{\frac1{\text{se}^2}}{\frac1{\text{se}^2}+\frac1{b^2}},\quad\frac1{\tau^2}=\frac1{\text{se}^2}+\frac1{b^2},\tag{11.7}\]
\(\text{se}=\sigma/\sqrt n\) 为 MLE \(\bar X\) 的标准误。(精度相加,均值按精度加权。)\(n\to\infty\) 时 \(w\to1\),\(\tau/\text{se}\to1\),后验近似 \(N(\hat\theta,\text{se}^2)\);\(n\) 固定而 \(b\to\infty\)(先验变得很平)时同样如此。 求 95% 后验区间 \(C=(c,d)\):令 \(\mathbb P(\theta<c\mid X^n)=\mathbb P\left(Z<\frac{c-\bar\theta}\tau\right)=.025\),得 \(c=\bar\theta-1.96\tau\);同理 \(d=\bar\theta+1.96\tau\)。因 \(\bar\theta\approx\hat\theta\)、\(\tau\approx\text{se}\),95% 贝叶斯区间近似为 \(\hat\theta\pm1.96\,\text{se}\),即频率学派的置信区间。

11.3 参数的函数(Functions of Parameters)(PDF p.191)

推断 \(\tau=g(\theta)\):与第 2 章求 \(Y=g(X)\) 的密度同理。后验 CDF \(H(\tau\mid x^n)=\mathbb P(g(\theta)\le\tau\mid x^n)=\int_Af(\theta\mid x^n)d\theta\),\(A=\{\theta:g(\theta)\le\tau\}\);后验密度 \(h(\tau\mid x^n)=H'(\tau\mid x^n)\)。 例 11.3:Bernoulli + 均匀先验,\(p\mid X^n\sim\) Beta\((s+1,n-s+1)\),\(\psi=\log(p/(1-p))\)。

\[H(\psi\mid x^n)=\mathbb P\left(p\le\frac{e^\psi}{1+e^\psi}\Big|x^n\right)=\frac{\Gamma(n+2)}{\Gamma(s+1)\Gamma(n-s+1)}\int_0^{e^\psi/(1+e^\psi)}p^s(1-p)^{n-s}dp,\]
求导得 \(h(\psi\mid x^n)=\frac{\Gamma(n+2)}{\Gamma(s+1)\Gamma(n-s+1)}\left(\frac{e^\psi}{1+e^\psi}\right)^s\left(\frac1{1+e^\psi}\right)^{n-s}\frac{e^\psi}{(1+e^\psi)^2}\),\(\psi\in\mathbb R\)。

11.4 模拟(Simulation)(PDF p.191–192)

后验常可用模拟近似。抽 \(\theta_1,\dots,\theta_B\sim p(\theta\mid x^n)\),直方图近似后验密度;后验均值近似 \(B^{-1}\sum\theta_j\);\(1-\alpha\) 后验区间近似 \((\theta_{\alpha/2},\theta_{1-\alpha/2})\)(样本分位数)。有了后验样本,令 \(\tau_i=g(\theta_i)\),则 \(\tau_1,\dots,\tau_B\) 是 \(f(\tau\mid x^n)\) 的样本,无需任何解析计算。(第 24 章详述。) 例 11.4:续例 11.3,不做微积分:1. 抽 \(P_1,\dots,P_B\sim\) Beta\((s+1,n-s+1)\);2. \(\psi_i=\log(P_i/(1-P_i))\)。\(\psi_i\) 即为 \(h(\psi\mid x^n)\) 的 IID 样本,直方图即估计。

11.5 贝叶斯程序的大样本性质(Large Sample Properties of Bayes' Procedures)(PDF p.192)

定理 11.5:\(\hat\theta_n\) 为 MLE,\(\widehat{\text{se}}=1/\sqrt{nI(\hat\theta_n)}\)。在适当正则条件下,后验近似正态,均值 \(\hat\theta_n\)、标准差 \(\widehat{\text{se}}\),故 \(\bar\theta_n\approx\hat\theta_n\)。又若 \(C_n=(\hat\theta_n-z_{\alpha/2}\widehat{\text{se}},\hat\theta_n+z_{\alpha/2}\widehat{\text{se}})\) 为渐近频率学派 \(1-\alpha\) 置信区间,则它也是近似 \(1-\alpha\) 贝叶斯后验区间:\(\mathbb P(\theta\in C_n\mid X^n)\to1-\alpha\)。(Bernstein–von Mises 型结果。) 贝叶斯 Delta 方法:\(\tau=g(\theta)\),则 \(\tau\mid X^n\approx N(\hat\tau,\widetilde{\text{se}}^2)\),\(\hat\tau=g(\hat\theta)\),\(\widetilde{\text{se}}=\widehat{\text{se}}\,|g'(\hat\theta)|\)。

11.6 平坦先验、非正常先验与"无信息"先验(Flat Priors, Improper Priors, and "Noninformative" Priors)(PDF p.192–194)

关键问题:先验从哪来?主观主义(subjectivism)认为先验应反映收集数据前对 \(\theta\) 的主观看法;某些情况下可行,但在复杂、多参数问题中不现实,而且把主观意见注入分析违背科学推断尽量客观的目标。另一选择是定义某种"无信息先验"(noninformative prior),显然的候选是平坦先验 \(f(\theta)\propto\) 常数。Bernoulli 例中 \(f(p)=1\) 得到 Beta\((s+1,n-s+1)\) 后验,看起来很合理,但滥用平坦先验会引起问题:

非正常先验(improper priors):\(X\sim N(\theta,\sigma^2)\),\(\sigma\) 已知,平坦先验 \(f(\theta)\propto c>0\),\(\int f(\theta)d\theta=\infty\),不是通常意义的概率密度,称为非正常先验。仍可形式地应用贝叶斯定理:\(f(\theta\mid x^n)\propto\mathcal L_n(\theta)f(\theta)\propto\mathcal L_n(\theta)\),得 \(\theta\mid X^n\sim N(\bar X,\sigma^2/n)\),点估计与区间估计和频率学派完全一致。一般而言,只要后验是良定义的概率分布,非正常先验就没问题。

平坦先验不具不变性(flat priors are not invariant):Bernoulli 用 \(f(p)=1\) 表示对 \(p\) 一无所知。令 \(\psi=\log(p/(1-p))\),变换后 \(\psi\) 的分布为 \(f_\Psi(\psi)=\frac{e^\psi}{(1+e^\psi)^2}\),不是平坦的。但若对 \(p\) 无知,对 \(\psi\) 也应无知,应对 \(\psi\) 用平坦先验——矛盾。平坦先验的概念没有良好定义,因为对参数平坦不意味着对其变换平坦。

Jeffreys 先验:取 \(f(\theta)\propto I(\theta)^{1/2}\),\(I(\theta)\) 为 Fisher 信息。该规则具有变换不变性。(作者不展开其合理性的其他理由。) 例 11.6:Bernoulli,\(I(p)=\frac1{p(1-p)}\),Jeffreys 先验 \(f(p)\propto\sqrt{I(p)}=p^{-1/2}(1-p)^{-1/2}\),即 Beta(1/2,1/2),与均匀分布很接近。 多参数时 Jeffreys 先验 \(f(\theta)\propto\sqrt{|I(\theta)|}\),\(|A|\) 为行列式,\(I(\theta)\) 为 Fisher 信息矩阵。

11.7 多参数问题(Multiparameter Problems)(PDF p.194–195)

\(\theta=(\theta_1,\dots,\theta_p)\),后验仍为 \(f(\theta\mid x^n)\propto\mathcal L_n(\theta)f(\theta)\) (11.8)。推断单个参数的关键是求边缘后验:

\[f(\theta_1\mid x^n)=\int\cdots\int f(\theta_1,\dots,\theta_p\mid x^n)d\theta_2\cdots d\theta_p.\tag{11.9}\]
积分常不可行,可用模拟:从后验抽 \(\theta^1,\dots,\theta^B\)(每个是向量 \(\theta^j=(\theta_1^j,\dots,\theta_p^j)\)),收集各次抽样的第一个分量 \(\theta_1^1,\dots,\theta_1^B\),即为 \(f(\theta_1\mid x^n)\) 的样本,避免了积分。

例 11.7(比较两个二项比例):对照组 \(n_1\) 人中 \(X_1\) 人存活,处理组 \(n_2\) 人中 \(X_2\) 人存活,估计 \(\tau=g(p_1,p_2)=p_2-p_1\)。\(\mathcal L(p_1,p_2)\propto p_1^{x_1}(1-p_1)^{n_1-x_1}p_2^{x_2}(1-p_2)^{n_2-x_2}\)。若 \(f(p_1,p_2)=1\),后验 \(f(p_1,p_2\mid x_1,x_2)\propto\) 上式。\((p_1,p_2)\) 在正方形上且后验可分解为 \(f(p_1\mid x_1)f(p_2\mid x_2)\),故后验下 \(p_1,p_2\) 独立,\(p_1\mid x_1\sim\) Beta\((x_1+1,n_1-x_1+1)\),\(p_2\mid x_2\sim\) Beta\((x_2+1,n_2-x_2+1)\)。分别模拟 \(P_{1,b}\)、\(P_{2,b}\),\(\tau_b=P_{2,b}-P_{1,b}\) 即为 \(f(\tau\mid x_1,x_2)\) 的样本。

11.8 贝叶斯检验(Bayesian Testing)(PDF p.195–196)

从贝叶斯视角看检验是复杂话题,只简述主要思想:对 \(H_0\) 和参数 \(\theta\) 都放先验,然后计算 \(\mathbb P(H_0\mid X^n)\)。考虑标量 \(\theta\),检验 \(H_0:\theta=\theta_0\) vs \(H_1:\theta\ne\theta_0\)。通常取 \(\mathbb P(H_0)=\mathbb P(H_1)=1/2\)(非必需)。\(H_1\) 下给 \(\theta\) 先验密度 \(f(\theta)\)。由贝叶斯定理

\[\mathbb P(H_0\mid X^n=x^n)=\frac{f(x^n\mid H_0)\mathbb P(H_0)}{f(x^n\mid H_0)\mathbb P(H_0)+f(x^n\mid H_1)\mathbb P(H_1)}=\frac{f(x^n\mid\theta_0)}{f(x^n\mid\theta_0)+\int f(x^n\mid\theta)f(\theta)d\theta}=\frac{\mathcal L(\theta_0)}{\mathcal L(\theta_0)+\int\mathcal L(\theta)f(\theta)d\theta}.\]
估计问题中先验影响不大,频率与贝叶斯答案相近;检验问题中并非如此。而且检验中不能用非正常先验(分母会出现未定常数)。因此用贝叶斯检验必须非常谨慎地选择先验 \(f(\theta)\)。 不依赖先验的界:因 \(0\le\int\mathcal L(\theta)f(\theta)d\theta\le\mathcal L(\hat\theta)\),
\[\frac{\mathcal L(\theta_0)}{\mathcal L(\theta_0)+\mathcal L(\hat\theta)}\le\mathbb P(H_0\mid X^n=x^n)\le1.\]
上界无趣,下界非平凡。

11.9 贝叶斯推断的优缺点(Strengths and Weaknesses of Bayesian Inference)(PDF p.196–200)

优点:有先验信息时,贝叶斯定理是把先验信息与数据结合的自然方式。有人觉得它心理上更有吸引力,因为允许对参数作概率陈述;频率学派给出 95% 时间套住参数的置信集 \(C_n\),却不能说 \(\mathbb P(\theta\in C_n\mid X^n)=.95\)——只能对 \(C_n\) 而不是 \(\theta\) 作概率陈述。但心理吸引力不是选择推断方式的有力科学论据。 参数模型、大样本时两种方法推断近似相同;一般情况下两者不必一致。三个例子:第一个体现贝叶斯的心理吸引力,后两个说明贝叶斯方法可能失败。

例 11.8(例 6.14 再访):\(Y_i=\theta+X_i\),\(X_i=\pm1\) 等概率,观测到 \(Y_1=15\)、\(Y_2=17\),75% 置信集为 \(\{16\}\),而此时可确定 \(\theta=16\)。称之为 75% 置信集让很多人不安,但它确实是有效的 75% 置信集(长期 75% 套中)。贝叶斯解法更令人满意:设 \(\theta\) 为整数,先验质量函数 \(f(\theta)>0\) 对所有整数成立。\(Y=(15,17)\) 时似然 \(\mathcal L(\theta)=1/4\)(\(\theta=16\)),否则为 0。由贝叶斯定理 \(\mathbb P(\Theta=\theta\mid Y=(15,17))=1\)(\(\theta=16\)),否则为 0,故 \(\mathbb P(\theta\in C\mid Y=(15,17))=1\)。

例 11.9(Robins & Ritov 1997 的简化版):数据为 \(n\) 个 IID 三元组 \((X_1,R_1,Y_1),\dots,(X_n,R_n,Y_n)\)。\(B\) 是有限但极大的数(如 \(B=100^{100}\)),任何现实样本量都远小于 \(B\)。未知参数向量 \(\theta=(\theta_1,\dots,\theta_B)\),\(0\le\theta_j\le1\);已知数向量 \(\xi=(\xi_1,\dots,\xi_B)\),\(0<\delta\le\xi_j\le1-\delta<1\),\(\delta\) 为小正数。生成方式:

  1. \(X_i\) 从 \(\{1,\dots,B\}\) 均匀抽取;
  2. \(R_i\sim\) Bernoulli\((\xi_{X_i})\);
  3. 若 \(R_i=1\),抽 \(Y_i\sim\) Bernoulli\((\theta_{X_i})\);若 \(R_i=0\),不抽 \(Y_i\)。 模型看似人为,实为某些真实缺失数据问题的漫画(\(R_i=0\) 表示"缺失")。目标:估计 \(\psi=\mathbb P(Y_i=1)=\sum_j\mathbb P(Y_i=1\mid X=j)\mathbb P(X=j)=\frac1B\sum_j\theta_j\),是 \(\theta\) 的函数。 贝叶斯分析:单观测似然 \(f(X_i,R_i,Y_i)=f(X_i)f(R_i\mid X_i)f(Y_i\mid X_i)^{R_i}\)(\(R_i=0\) 时 \(Y_i\) 未观测,该项消失)。\(f(X_i)=1/B\),于是 \(\mathcal L(\theta)=\prod\frac1B\xi_{X_i}^{R_i}(1-\xi_{X_i})^{1-R_i}\theta_{X_i}^{Y_iR_i}(1-\theta_{X_i})^{(1-Y_i)R_i}\propto\prod\theta_{X_i}^{Y_iR_i}(1-\theta_{X_i})^{(1-Y_i)R_i}\)(\(B\) 和 \(\xi_j\) 是已知常数,丢掉)。对数似然 \(\ell(\theta)=\sum_jn_j\log\theta_j+\sum_jm_j\log(1-\theta_j)\),\(n_j=\#\{i:Y_i=1,R_i=1,X_i=j\}\),\(m_j=\#\{i:Y_i=0,R_i=1,X_i=j\}\)。由于 \(B\gg n\),绝大多数 \(j\) 有 \(n_j=m_j=0\)。含义:大多数 \(\theta_j\) 的 MLE 无定义;大多数 \(\theta_j\) 的后验等于先验(不出现在似然中);故 \(f(\theta\mid\text{Data})\approx f(\theta)\),\(f(\psi\mid\text{Data})\approx f(\psi)\)——数据在贝叶斯分析中几乎不提供关于 \(\psi\) 的信息。 频率学派解法:
    \[\hat\psi=\frac1n\sum_{i=1}^n\frac{R_iY_i}{\xi_{X_i}}.\tag{11.10}\]
    可证(习题 7)\(\mathbb E(\hat\psi)=\psi\),\(\mathbb V(\hat\psi)\le\frac1{n\delta^2}\) (11.11)。所以 MSE 为 \(O(1/n)\),无论 \(B\) 多大都随数据增加较快趋于 0。这就是 Horvitz–Thompson 估计量(原书拼作 Horwitz)。它不能从贝叶斯或似然观点导出,因为它含 \(\xi_{X_i}\),而这些项在对数似然中消失了,不会出现在任何基于似然的方法(包括贝叶斯估计)中。 寓意:贝叶斯方法受制于似然函数;在高维(和非参数)问题中,似然可能给不出准确推断。

例 11.10(Edward George 提供):\(f\) 为密度,\(f(x)=cg(x)\),\(g(x)>0\) 已知,\(c\) 未知。原则上 \(c=1/\int g(x)dx\),但 \(g\) 复杂、\(x\) 高维时积分常算不出。尽管 \(c\) 未知,常常仍能从 \(f\) 抽样 \(X_1,\dots,X_n\)(第 24 章)。能否用样本估计归一化常数 \(c\)? 频率解:令 \(\hat f_n(x)\) 为 \(f\) 的相合估计(第 20 章),任取点 \(x\),\(c=f(x)/g(x)\),故 \(\hat c=\hat f_n(x)/g(x)\) 是 \(c\) 的相合估计。 贝叶斯解:取先验 \(\pi(c)>0\)(\(c>0\))。似然 \(\mathcal L_n(c)=\prod f(X_i)=\prod cg(X_i)=c^n\prod g(X_i)\propto c^n\)。后验 \(\propto c^n\pi(c)\),不依赖 \(X_1,\dots,X_n\)——惊人的结论:从贝叶斯观点看,数据中没有关于 \(c\) 的信息。而且后验均值 \(\frac{\int_0^\infty c^{n+1}\pi(c)dc}{\int_0^\infty c^n\pi(c)dc}\) 随 \(n\) 增大趋于无穷。

结论:"贝叶斯学派是似然函数的奴隶。似然出问题时,贝叶斯推断也会出问题。"重要的是理解两种方法回答的是不同问题:想以有原则的方式结合先验信念与数据,用贝叶斯推断;想构造有长期表现保证的程序(如置信区间),用频率方法。一般而言参数空间高维时贝叶斯方法会遇到问题;特别是 95% 后验区间不一定(在频率意义上)95% 的时间包含真值。

11.10 文献注(PDF p.200–201)

贝叶斯推断参考:Carlin & Louis (1996)、Gelman et al. (1995)、Lee (1997)、Robert (1994)、Schervish (1995)。非参数贝叶斯技术问题:Cox (1993)、Diaconis & Freedman (1986)、Freedman (1999)、Barron et al. (1999)、Ghosal et al. (2000)、Shen & Wasserman (2001)、Zhao (2000)。Robins–Ritov 例详见 Robins & Ritov (1997)(更恰当地表述为非参数问题)。例 11.10 来自 Edward George。贝叶斯检验:Berger & Delampady (1987)、Kass & Raftery (1995);无信息先验:Kass & Wasserman (1996)。

11.11 附录:定理 11.5 证明(PDF p.201)

随 \(n\) 增大先验影响减弱,\(f(\theta\mid x^n)\propto\mathcal L_n(\theta)f(\theta)\approx\mathcal L_n(\theta)\),故 \(\log f(\theta\mid x^n)\approx\ell(\theta)\)。\(\ell(\theta)\approx\ell(\hat\theta)+(\theta-\hat\theta)\ell'(\hat\theta)+\frac{(\theta-\hat\theta)^2}2\ell''(\hat\theta)=\ell(\hat\theta)+\frac{(\theta-\hat\theta)^2}2\ell''(\hat\theta)\)(\(\ell'(\hat\theta)=0\))。取指数,近似 \(f(\theta\mid x^n)\propto\exp\left\{-\frac12\frac{(\theta-\hat\theta)^2}{\sigma_n^2}\right\}\),\(\sigma_n^2=-1/\ell''(\hat\theta_n)\)。所以后验近似正态,均值 \(\hat\theta\)、方差 \(\sigma_n^2\)。令 \(\ell_i=\log f(X_i\mid\theta)\),\(\frac1{\sigma_n^2}=-\ell''(\hat\theta_n)=\sum_i-\ell_i''(\hat\theta_n)=n\left(\frac1n\right)\sum_i-\ell_i''(\hat\theta_n)\approx n\mathbb E_\theta[-\ell_i''(\hat\theta_n)]=nI(\hat\theta_n)\),故 \(\sigma_n\approx\text{se}(\hat\theta)\)。

11.12 习题(PDF p.201–203)概览

共 8 题:题 1 验证 (11.7)(正态-正态共轭);题 2 \(N(\mu,1)\)、\(\mu=5\)、\(n=100\) 模拟:平坦先验后验、1000 次后验抽样直方图、\(\theta=e^\mu\) 的后验(解析与模拟)、\(\mu\) 的 95% 后验区间、\(\theta\) 的 95% 置信区间;题 3 Uniform\((0,\theta)\) + \(f(\theta)\propto1/\theta\) 的后验;题 4 安慰剂 50 人 30 人改善、治疗 50 人 40 人改善,\(\tau=p_2-p_1\):(a) MLE、Delta 方法 se 与 90% 区间;(b) 参数 bootstrap;(c) 平坦先验下模拟求后验均值与 90% 后验区间;(d) 对数比值比 \(\psi=\log\left(\frac{p_1}{1-p_1}\div\frac{p_2}{1-p_2}\right)\) 的 MLE 与 Delta 区间;(e) \(\psi\) 的后验模拟(频率、bootstrap、贝叶斯三种方法对比);题 5 Bernoulli 数据 0101000000 在 Beta(1/2,1/2)、Beta(1,1)、Beta(10,10)、Beta(100,100) 先验下的后验图(先验强度的影响);题 6 Poisson + Gamma 共轭先验的后验与后验均值;Jeffreys 先验及其后验;题 7 验证 (11.11);题 8(Jeffreys–Lindley 悖论):\(X\sim N(\mu,1)\),\(H_0:\mu=0\),\(\mathbb P(H_0)=\mathbb P(H_1)=1/2\),\(H_1\) 下 \(\mu\sim N(0,b^2)\),求 \(\mathbb P(H_0\mid X=x)\) 并与 Wald 检验 p 值对比;推广到样本量 \(n\),会发现即使 p 值很小,\(H_0\) 后验概率也可能很大,\(n\) 大时尤甚。

本章要点

  1. 频率学派(F1–F3)与贝叶斯学派(B1–B3)的公设差别:概率的含义、参数是否可有概率分布。
  2. 后验 ∝ 似然 × 先验;后验均值、众数、后验区间;共轭先验(Beta–Bernoulli、Normal–Normal、Gamma–Poisson)使计算闭式化,后验均值是 MLE 与先验均值的加权平均(收缩)。
  3. 参数函数的后验可由变换或模拟得到;多参数问题用边缘后验,模拟时直接取分量。
  4. 大样本下后验近似 \(N(\hat\theta,\widehat{\text{se}}^2)\),贝叶斯与频率区间近似一致(定理 11.5)。
  5. 先验选择:主观先验、平坦先验(非不变)、非正常先验(后验正常即可)、Jeffreys 先验 \(\propto\sqrt{I(\theta)}\)(不变)。
  6. 贝叶斯检验对先验敏感,不能用非正常先验;Jeffreys–Lindley 悖论。
  7. 高维问题中贝叶斯可能失败(Robins–Ritov、归一化常数例):"贝叶斯是似然的奴隶";两种方法回答不同问题。

与量化交易的关联

  • 收缩估计:Beta–Bernoulli 与 Normal–Normal 的后验均值是"样本估计与先验的加权平均",正是量化中最有用的思想之一:对个股期望收益、Beta、胜率做向截面均值的收缩(Vasicek Beta 调整、Bayes–Stein 期望收益估计);Black–Litterman 模型本质上就是例 11.2 的多元版本——以市场均衡收益为先验、以投资者观点为数据,按精度加权得到后验期望收益。
  • 小样本策略评估:新策略只有少量实盘数据时,用 Beta 先验更新胜率、用正态先验更新 alpha,可避免极端估计;习题 5 展示先验强度的影响。
  • 两比例比较:例 11.7 与习题 4 的模拟方法可用于 A/B 比较两种执行算法的成交率或滑点超标率,直接给出"算法 B 优于 A 的后验概率"。
  • 贝叶斯检验与 Lindley 悖论:大样本下 p 值很小但效应很小时,贝叶斯后验可能仍支持原假设——提醒在高频大样本数据中 p 值很容易"显著",应同时看效应大小。
  • 高维警示:例 11.9 说明参数远多于数据时,全贝叶斯可能失效;量化中的高维协方差估计、大规模因子模型都需要结构化先验或频率学派的收缩方法。Horvitz–Thompson 的逆概率加权思想用于处理幸存者偏差、样本选择偏差(如只观测到成交订单时估计全部订单的特征)。
  • 模拟后验:例 11.4 的"后验抽样再变换"是贝叶斯组合优化中考虑参数不确定性的标准做法(对每个后验抽样做一次优化或计算风险)。

推荐习题

  • 题 4(频率 vs bootstrap vs 贝叶斯三法对比,必做);题 8(Jeffreys–Lindley 悖论);题 5(先验强度影响);题 1、6(共轭先验推导);题 2(后验模拟与参数变换)。

第 12 章 统计决策理论(Statistical Decision Theory)(PDF p.204–216)

12.1 预备知识(Preliminaries)(PDF p.204–205)

我们已有 MLE、矩估计、后验均值等多种点估计方法,如何选择?答案在决策理论(decision theory)——比较统计程序的形式理论。 参数 \(\theta\in\Theta\),估计量 \(\hat\theta\)。决策理论术语中,估计量称为决策规则(decision rule),其可能取值称为行动(actions)。用损失函数(loss function)\(L(\theta,\hat\theta):\Theta\times\Theta\to\mathbb R\) 度量 \(\theta\) 与 \(\hat\theta\) 的差异。例:

  • 平方误差损失 \(L=(\theta-\hat\theta)^2\);
  • 绝对误差损失 \(L=|\theta-\hat\theta|\);
  • \(L_p\) 损失 \(L=|\theta-\hat\theta|^p\);
  • 0-1 损失:\(\theta=\hat\theta\) 时 0,否则 1;
  • Kullback–Leibler 损失 \(L=\int\log\left(\frac{f(x;\theta)}{f(x;\hat\theta)}\right)f(x;\theta)dx\)。 估计量是数据的函数,有时写作 \(\hat\theta(X)\)。评价估计量用平均损失即风险: 定义 12.1:估计量的风险(risk)\(R(\theta,\hat\theta)=\mathbb E_\theta(L(\theta,\hat\theta))=\int L(\theta,\hat\theta(x))f(x;\theta)dx\)。 平方误差损失下风险就是 MSE:\(R(\theta,\hat\theta)=\mathbb E_\theta(\hat\theta-\theta)^2=\text{MSE}=\mathbb V_\theta(\hat\theta)+\text{bias}^2_\theta(\hat\theta)\)。本章未注明时默认平方误差损失。

12.2 比较风险函数(Comparing Risk Functions)(PDF p.205–208)

比较两个估计量可比较其风险函数,但通常得不到明确结论: 例 12.2:\(X\sim N(\theta,1)\),\(\hat\theta_1=X\),\(\hat\theta_2=3\)。\(R(\theta,\hat\theta_1)=1\),\(R(\theta,\hat\theta_2)=(3-\theta)^2\)。\(2<\theta<4\) 时 \(\hat\theta_2\) 风险更小,否则 \(\hat\theta_1\) 更小;两者都不一致占优(图 12.1)。 例 12.3:Bernoulli,\(\hat p_1=\bar X\),无偏,\(R(p,\hat p_1)=\mathbb V(\bar X)=\frac{p(1-p)}n\)。另一估计 \(\hat p_2=\frac{Y+\alpha}{\alpha+\beta+n}\)(\(Y=\sum X_i\)),是 Beta\((\alpha,\beta)\) 先验下的后验均值。

\[R(p,\hat p_2)=\mathbb V_p\left(\frac{Y+\alpha}{\alpha+\beta+n}\right)+\left(\mathbb E_p\left(\frac{Y+\alpha}{\alpha+\beta+n}\right)-p\right)^2=\frac{np(1-p)}{(\alpha+\beta+n)^2}+\left(\frac{np+\alpha}{\alpha+\beta+n}-p\right)^2.\]
取 \(\alpha=\beta=\sqrt{n/4}\)(例 12.12 解释),得 \(\hat p_2=\frac{Y+\sqrt{n/4}}{n+\sqrt n}\),风险 \(R(p,\hat p_2)=\frac n{4(n+\sqrt n)^2}\),为常数。图 12.2:两者都不一致占优。

需要风险函数的单数字概括。定义 12.4:最大风险(maximum risk)\(\bar R(\hat\theta)=\sup_\theta R(\theta,\hat\theta)\) (12.1);贝叶斯风险(Bayes risk)\(r(f,\hat\theta)=\int R(\theta,\hat\theta)f(\theta)d\theta\) (12.2),\(f\) 为先验。 例 12.5:续例 12.3。\(\bar R(\hat p_1)=\max_p\frac{p(1-p)}n=\frac1{4n}\),\(\bar R(\hat p_2)=\max_p\frac n{4(n+\sqrt n)^2}=\frac n{4(n+\sqrt n)^2}\)。按最大风险 \(\hat p_2\) 更好。但 \(n\) 大时,除 \(p=1/2\) 附近一小块外 \(\hat p_1\) 风险更小,因此许多人更喜欢 \(\hat p_1\)——单数字概括不完美。贝叶斯风险(取 \(f(p)=1\)):\(r(f,\hat p_1)=\int\frac{p(1-p)}ndp=\frac1{6n}\),\(r(f,\hat p_2)=\frac n{4(n+\sqrt n)^2}\)。\(n\ge20\) 时 \(r(f,\hat p_2)>r(f,\hat p_1)\),提示 \(\hat p_1\) 更好;直觉上合理,但依赖先验选择。最大风险虽有问题,但优势是不需要选择先验。 两种概括导出两种构造估计量的方法:最小化最大风险 → minimax 估计量;最小化贝叶斯风险 → 贝叶斯估计量。 定义 12.6:关于先验 \(f\) 的贝叶斯规则(Bayes rule)\(\hat\theta\) 满足 \(r(f,\hat\theta)=\inf_{\tilde\theta}r(f,\tilde\theta)\) (12.3);minimax 规则满足 \(\sup_\theta R(\theta,\hat\theta)=\inf_{\tilde\theta}\sup_\theta R(\theta,\tilde\theta)\) (12.4),下确界取遍所有估计量。

12.3 贝叶斯估计量(Bayes Estimators)(PDF p.208–209)

先验 \(f\),后验 \(f(\theta\mid x)=\frac{f(x\mid\theta)f(\theta)}{m(x)}=\frac{f(x\mid\theta)f(\theta)}{\int f(x\mid\theta)f(\theta)d\theta}\) (12.5),\(m(x)=\int f(x,\theta)d\theta=\int f(x\mid\theta)f(\theta)d\theta\) 为 \(X\) 的边缘分布。定义估计量 \(\hat\theta(x)\) 的后验风险(posterior risk)\(r(\hat\theta\mid x)=\int L(\theta,\hat\theta(x))f(\theta\mid x)d\theta\)。 定理 12.7:贝叶斯风险满足 \(r(f,\hat\theta)=\int r(\hat\theta\mid x)m(x)dx\) (12.6)。令 \(\hat\theta(x)\) 为使 \(r(\hat\theta\mid x)\) 最小的值,则 \(\hat\theta\) 是贝叶斯估计量。 证明:\(r(f,\hat\theta)=\int R(\theta,\hat\theta)f(\theta)d\theta=\int\left(\int L(\theta,\hat\theta(x))f(x\mid\theta)dx\right)f(\theta)d\theta=\iint L\,f(x,\theta)dxd\theta=\iint L\,f(\theta\mid x)m(x)dxd\theta=\int\left(\int L\,f(\theta\mid x)d\theta\right)m(x)dx=\int r(\hat\theta\mid x)m(x)dx\)。对每个 \(x\) 最小化被积函数即最小化积分。(实用含义:贝叶斯规则只需对观测到的 \(x\) 最小化后验期望损失。) 定理 12.8:平方误差损失下贝叶斯估计为后验均值 \(\hat\theta(x)=\int\theta f(\theta\mid x)d\theta=\mathbb E(\theta\mid X=x)\) (12.7);绝对误差损失下为后验中位数;0-1 损失下为后验众数。 证明(平方损失):\(r(\hat\theta\mid x)=\int(\theta-\hat\theta(x))^2f(\theta\mid x)d\theta\),对 \(\hat\theta(x)\) 求导令为 0:\(2\int(\theta-\hat\theta(x))f(\theta\mid x)d\theta=0\),解得 (12.7)。 例 12.9:\(X_i\sim N(\mu,\sigma^2)\),\(\sigma^2\) 已知,先验 \(\mu\sim N(a,b^2)\),平方损失下贝叶斯估计为后验均值

\[\hat\theta(X_1,\dots,X_n)=\frac{b^2}{b^2+\frac{\sigma^2}n}\bar X+\frac{\frac{\sigma^2}n}{b^2+\frac{\sigma^2}n}a.\]

12.4 Minimax 规则(Minimax Rules)(PDF p.209–211)

寻找 minimax 规则较复杂,本书只提几个关键结果。主要信息:具有常数风险函数的贝叶斯估计量是 minimax 的。 定理 12.10:令 \(\hat\theta^f\) 为某先验 \(f\) 的贝叶斯规则,\(r(f,\hat\theta^f)=\inf_{\hat\theta}r(f,\hat\theta)\) (12.8)。若 \(R(\theta,\hat\theta^f)\le r(f,\hat\theta^f)\) 对所有 \(\theta\) 成立 (12.9),则 \(\hat\theta^f\) 是 minimax 的,\(f\) 称为最不利先验(least favorable prior)。 证明:若 \(\hat\theta^f\) 非 minimax,存在 \(\hat\theta_0\) 使 \(\sup_\theta R(\theta,\hat\theta_0)<\sup_\theta R(\theta,\hat\theta^f)\)。函数的平均不超过其最大值,故 \(r(f,\hat\theta_0)\le\sup_\theta R(\theta,\hat\theta_0)<\sup_\theta R(\theta,\hat\theta^f)\le r(f,\hat\theta^f)\),与 (12.8) 矛盾。 定理 12.11:若 \(\hat\theta\) 是关于某先验 \(f\) 的贝叶斯规则且风险为常数 \(R(\theta,\hat\theta)=c\),则 \(\hat\theta\) 是 minimax 的。证明:\(r(f,\hat\theta)=\int cf=c\),故 \(R(\theta,\hat\theta)\le r(f,\hat\theta)\),用上一定理。 例 12.12:Bernoulli 平方损失下,例 12.3 的 \(\hat p=\frac{Y+\sqrt{n/4}}{n+\sqrt n}\) 风险为常数,且是 Beta\((\sqrt{n/4},\sqrt{n/4})\) 先验下的后验均值(贝叶斯规则),故 minimax。 例 12.13:Bernoulli,损失 \(L(p,\hat p)=\frac{(p-\hat p)^2}{p(1-p)}\),令 \(\hat p(X^n)=\bar X\)。风险 \(R(p,\hat p)=\mathbb E\left(\frac{(p-\hat p)^2}{p(1-p)}\right)=\frac1{p(1-p)}\frac{p(1-p)}n=\frac1n\),为常数。可证在此损失下 \(\hat p\) 是先验 \(f(p)=1\) 的贝叶斯估计,故 minimax。(说明 minimax 与否依赖损失函数。)

定理 12.14:\(X_1,\dots,X_n\sim N(\theta,1)\),\(\hat\theta=\bar X\) 对任何"良好"的损失函数都是 minimax 的(脚注:"良好"指水平集是凸的且关于原点对称;结果在测度零集意义下成立),而且是唯一具有此性质的估计量。 参数空间受限时上述定理不适用: 例 12.15:\(X\sim N(\theta,1)\),已知 \(\theta\in[-m,m]\),\(0<m<1\)。平方损失下唯一 minimax 估计为 \(\hat\theta(X)=m\tanh(mX)\),\(\tanh(z)=\frac{e^z-e^{-z}}{e^z+e^{-z}}\)。它是在 \(\pm m\) 各放 1/2 质量的先验下的贝叶斯规则;风险非常数,但满足 \(R(\theta,\hat\theta)\le r(f,\hat\theta)\) 对所有 \(\theta\) 成立(图 12.3,\(m=.5\)),由定理 12.10 为 minimax。

12.5 最大似然、Minimax 与贝叶斯(Maximum Likelihood, Minimax, and Bayes)(PDF p.212–213)

满足弱正则条件的参数模型中,MLE 近似 minimax。平方损失 = 偏差² + 方差;大样本参数模型中方差项主导偏差(脚注:通常偏差² 为 \(O(n^{-2})\),方差为 \(O(n^{-1})\)),故 \(R(\theta,\hat\theta)=\mathbb V_\theta(\hat\theta)+\text{bias}^2\approx\mathbb V_\theta(\hat\theta)\)。由第 9 章,\(\mathbb V(\hat\theta)\approx\frac1{nI(\theta)}\),因此

\[nR(\theta,\hat\theta)\approx\frac1{I(\theta)}.\tag{12.10}\]
对任何其他估计量 \(\theta'\),大 \(n\) 时 \(R(\theta,\theta')\ge R(\theta,\hat\theta)\),更精确地
\[\lim_{\epsilon\to0}\limsup_{n\to\infty}\sup_{|\theta-\theta'|<\epsilon}nR(\theta',\hat\theta)\ge\frac1{I(\theta)}.\tag{12.11}\]
即在局部、大样本意义下 MLE 是 minimax 的(局部渐近 minimax,Hájek–Le Cam 型结果);也可证明 MLE 近似为贝叶斯规则。 小结:多数参数模型、大样本下,MLE 近似 minimax 且近似贝叶斯。 注意:参数个数很多时这些结论失效: 例 12.16(多个正态均值,Many Normal means):\(Y_i\sim N(\theta_i,\sigma^2/n)\),\(i=1,\dots,n\),\(Y=(Y_1,\dots,Y_n)\),\(\theta=(\theta_1,\dots,\theta_n)\)。假设 \(\theta\in\Theta=\{\theta:\sum\theta_i^2\le c^2\}\),\(c>0\)。此模型参数与观测一样多(脚注:许多非参数估计问题在数学上等价于这个模型)。MLE \(\hat\theta=Y\),在损失 \(L(\theta,\hat\theta)=\sum(\hat\theta_i-\theta_i)^2\) 下风险 \(R(\theta,\hat\theta)=\sigma^2\)。可证 minimax 风险约为 \(\frac{\sigma^2c^2}{\sigma^2+c^2}\)(原文印刷为 \(\sigma^2/(\sigma^2+c^2)\),按 Pinsker 结果应含 \(c^2\)),且存在估计量 \(\tilde\theta\) 达到它;它小于 \(\sigma^2\),故 \(\tilde\theta\) 风险比 MLE 小,实践中差距可能很大。这说明高维问题中最大似然不是最优估计量。

12.6 可容许性(Admissibility)(PDF p.213–215)

Minimax 与贝叶斯估计量风险小,是"好估计量";刻画"坏估计量"也有用。 定义 12.17:若存在另一规则 \(\hat\theta'\) 使 \(R(\theta,\hat\theta')\le R(\theta,\hat\theta)\) 对所有 \(\theta\) 成立,且至少对一个 \(\theta\) 严格小于,则 \(\hat\theta\) 不可容许(inadmissible);否则可容许(admissible)。 例 12.18:\(X\sim N(\theta,1)\),平方损失,\(\hat\theta(X)=3\)。证明它可容许:若不然,存在风险更小的 \(\hat\theta'\),特别地 \(R(3,\hat\theta')\le R(3,\hat\theta)=0\),故 \(0=R(3,\hat\theta')=\int(\hat\theta'(x)-3)^2f(x;3)dx\),于是 \(\hat\theta'(x)=3\),没有规则能胜过它。它虽可容许,但显然是个糟糕的规则——可容许性只是很弱的要求。

定理 12.19(贝叶斯规则可容许):设 \(\Theta\subset\mathbb R\),且对每个 \(\hat\theta\),\(R(\theta,\hat\theta)\) 是 \(\theta\) 的连续函数。\(f\) 为全支撑先验(对每个 \(\theta\) 与 \(\epsilon>0\),\(\int_{\theta-\epsilon}^{\theta+\epsilon}f>0\))。令 \(\hat\theta^f\) 为贝叶斯规则,若贝叶斯风险有限,则 \(\hat\theta^f\) 可容许。 证明:设 \(\hat\theta^f\) 不可容许,存在更好的 \(\hat\theta\):对所有 \(\theta\),\(R(\theta,\hat\theta)\le R(\theta,\hat\theta^f)\),且某 \(\theta_0\) 处严格。令 \(\nu=R(\theta_0,\hat\theta^f)-R(\theta_0,\hat\theta)>0\)。由连续性存在 \(\epsilon>0\) 使在 \((\theta_0-\epsilon,\theta_0+\epsilon)\) 内 \(R(\theta,\hat\theta^f)-R(\theta,\hat\theta)>\nu/2\)。于是 \(r(f,\hat\theta^f)-r(f,\hat\theta)=\int[R(\theta,\hat\theta^f)-R(\theta,\hat\theta)]f(\theta)d\theta\ge\int_{\theta_0-\epsilon}^{\theta_0+\epsilon}[\cdots]f\,d\theta\ge\frac\nu2\int_{\theta_0-\epsilon}^{\theta_0+\epsilon}f(\theta)d\theta>0\),与 \(\hat\theta^f\) 最小化贝叶斯风险矛盾。

定理 12.20:\(X_i\sim N(\mu,\sigma^2)\),平方损失下 \(\bar X\) 可容许。证明技术性强,略;思路:任何严格正先验的后验均值可容许;取先验 \(N(a,b^2)\),\(b^2\) 很大时后验均值近似 \(\bar X\)。 可容许性与 minimax 一般无蕴含关系(规则可能是其一、两者、或都不是),但有以下联系: 定理 12.21:若 \(\hat\theta\) 风险为常数且可容许,则它是 minimax 的。证明:风险 \(=c\),若非 minimax,存在 \(\hat\theta'\) 使 \(R(\theta,\hat\theta')\le\sup_\theta R(\theta,\hat\theta')<\sup_\theta R(\theta,\hat\theta)=c\),则 \(\hat\theta\) 不可容许,矛盾。 定理 12.22:\(X_i\sim N(\theta,1)\),平方损失下 \(\hat\theta=\bar X\) 是 minimax 的(定理 12.14 的受限版本)。证明:由定理 12.20 可容许,风险 \(1/n\) 为常数,用定理 12.21。 minimax 规则不保证可容许,但"接近可容许":若存在规则 \(\hat\theta'\) 与 \(\epsilon>0\) 使 \(R(\theta,\hat\theta')<R(\theta,\hat\theta)-\epsilon\) 对所有 \(\theta\) 成立,称 \(\hat\theta\) 强不可容许(strongly inadmissible)。 定理 12.23:minimax 规则不是强不可容许的。

12.7 Stein 悖论(Stein's Paradox)(PDF p.215)

\(X\sim N(\theta,1)\),平方损失下 \(\hat\theta(X)=X\) 可容许。估计两个不相关的量 \(\theta=(\theta_1,\theta_2)\),\(X_1\sim N(\theta_1,1)\)、\(X_2\sim N(\theta_2,1)\) 独立,损失 \(\sum_{j=1}^2(\hat\theta_j-\theta_j)^2\),\(\hat\theta(X)=X\) 仍可容许。推广到 \(k\) 个正态均值:\(X_i\sim N(\theta_i,1)\) 独立,损失 \(\sum_{j=1}^k(\theta_j-\hat\theta_j)^2\)。Stein 证明了令人震惊的结果:若 \(k\ge3\),\(\hat\theta(X)=X\) 不可容许。James–Stein 估计量 \(\hat\theta^S=(\hat\theta_1^S,\dots,\hat\theta_k^S)\) 风险更小:

\[\hat\theta_i^S(X)=\left(1-\frac{k-2}{\sum_iX_i^2}\right)^+X_i,\tag{12.12}\]
\((z)^+=\max\{z,0\}\)。它把各 \(X_i\) 向 0 收缩。启示:同时估计许多参数时,收缩估计有巨大价值;这在现代非参数函数估计中起重要作用。

12.8 文献注(PDF p.215)

Casella & Berger (2002)、Berger (1985)、Ferguson (1967)、Lehmann & Casella (1998)。

12.9 习题(PDF p.215–216)概览

共 6 题:题 1 平方损失下的贝叶斯风险与贝叶斯估计:(a) Binomial + Beta;(b) Poisson + Gamma;(c) 正态(方差已知)+ 正态。题 2 损失 \((\theta-\hat\theta)^2/\sigma^2\) 下 \(\bar X\) 可容许且 minimax。题 3 有限参数空间下 0-1 损失的贝叶斯估计为后验众数。题 4(Casella & Berger)对形如 \(bS^2\) 的方差估计,在 Stein 损失 \(L(\sigma^2,\hat\sigma^2)=\frac{\hat\sigma^2}{\sigma^2}-1-\log\frac{\hat\sigma^2}{\sigma^2}\) 下求对所有 \(\sigma^2\) 风险最小的 \(b\)。题 5(Berliner 1983)\(X\sim\) Bin\((n,p)\),损失 \(L(p,\hat p)=(1-\hat p/p)^2\),证明 \(\hat p(X)=0\)(落在参数空间之外)是唯一 minimax 规则。题 6(计算机实验)模拟比较 MLE 与 James–Stein 估计量 (12.12) 的风险,尝试不同 \(n\) 与 \(\theta\) 向量。

本章要点

  1. 决策理论框架:损失函数、风险 \(R(\theta,\hat\theta)=\mathbb E_\theta L\);平方损失下风险即 MSE。
  2. 风险函数通常交叉,需单数字概括:最大风险(→ minimax)与贝叶斯风险(→ 贝叶斯规则)。
  3. 贝叶斯规则 = 对每个 \(x\) 最小化后验风险:平方损失取后验均值,绝对损失取后验中位数,0-1 损失取后验众数。
  4. 常数风险的贝叶斯规则是 minimax(Bernoulli 的 \(\frac{Y+\sqrt{n/4}}{n+\sqrt n}\));正态均值下 \(\bar X\) minimax 且可容许;受限参数空间的 minimax 估计可能是非线性的 \(m\tanh(mX)\)。
  5. 大样本参数模型中 MLE 近似 minimax 和贝叶斯;高维时失效(多个正态均值)。
  6. 可容许性是弱要求;全支撑先验的贝叶斯规则可容许;常数风险 + 可容许 ⇒ minimax。
  7. Stein 悖论:\(k\ge3\) 时同时估计多个正态均值,样本均值不可容许,James–Stein 收缩估计一致更优。

与量化交易的关联

  • 损失函数的选择决定最优估计:预测收益时若关心平方误差,用条件均值;若关心绝对误差或对极端值稳健,用条件中位数(分位数回归);VaR 估计对应分位数损失(pinball loss)。交易中不对称损失很常见(低估风险比高估代价大),应按真实损失设计估计量。
  • James–Stein 收缩是组合管理中最重要的实用结论之一:同时估计数百只股票的期望收益时,把个股样本均值向截面均值(或 0)收缩可以一致降低总均方误差——Jorion (1986) 的 Bayes–Stein 估计、Ledoit–Wolf 协方差收缩都基于这一思想。习题 6 的模拟非常适合作为教材实验。
  • 高维 MLE 失效(例 12.16):\(N\) 只股票、\(T\) 期数据,样本协方差矩阵(MLE)在 \(N\) 接近 \(T\) 时极不稳定,均值-方差优化会放大误差("误差最大化器"),需要收缩、因子结构或正则化。
  • Minimax 与稳健优化:minimax 思想对应稳健组合优化——在参数不确定集内最坏情形下优化(robust portfolio optimization),不需要先验;贝叶斯风险对应在先验下平均最优(贝叶斯组合优化)。例 12.5 显示二者可能给出不同偏好。
  • 可容许性的提醒:例 12.18 的"永远估计为 3"可容许但无用——策略评价中某些指标上的"不可被严格超越"并不意味着策略好。

推荐习题

  • 题 6(James–Stein vs MLE 模拟,必做);题 1(共轭模型的贝叶斯估计);题 4(Stein 损失下方差估计的最优缩放);题 5(minimax 规则的反直觉例子)。

第 III 部分 统计模型与方法(Statistical Models and Methods)(扉页 PDF p.217)

第 13 章 线性与 Logistic 回归(Linear and Logistic Regression)(PDF p.218–220,续见下一块)

引言(PDF p.218)

回归研究响应变量(response variable)\(Y\) 与协变量(covariate)\(X\) 的关系;协变量也称预测变量(predictor variable)或特征(feature)。(脚注:"回归"一词来自 Francis Galton (1822–1911),他注意到高个子和矮个子男性的儿子身高更接近平均值,称为"向均值回归"。)用回归函数概括 \(X\) 与 \(Y\) 的关系:

\[r(x)=\mathbb E(Y\mid X=x)=\int yf(y\mid x)dy.\tag{13.1}\]
目标是从数据 \((X_1,Y_1),\dots,(X_n,Y_n)\sim F_{X,Y}\) 估计 \(r(x)\)。本章采用参数方法,假设 \(r\) 是线性的;非参数回归见第 20、21 章。

13.1 简单线性回归(Simple Linear Regression)(PDF p.218–220,本节续见下一块)

最简单情形:\(X_i\) 一维,\(r(x)=\beta_0+\beta_1x\),称简单线性回归模型。进一步简化假设 \(\mathbb V(\epsilon_i\mid X=x)=\sigma^2\) 不依赖 \(x\)(同方差)。 定义 13.1(简单线性回归模型):

\[Y_i=\beta_0+\beta_1X_i+\epsilon_i,\quad\mathbb E(\epsilon_i\mid X_i)=0,\quad\mathbb V(\epsilon_i\mid X_i)=\sigma^2.\tag{13.2}\]
例 13.2:图 13.1 为附近恒星的对数表面温度 \(Y\) 对对数光强 \(X\) 的散点图,附估计的回归直线。 未知参数:截距 \(\beta_0\)、斜率 \(\beta_1\)、方差 \(\sigma^2\)。估计 \(\hat\beta_0,\hat\beta_1\),拟合直线
\[\hat r(x)=\hat\beta_0+\hat\beta_1x.\tag{13.3}\]
拟合值(fitted values / predicted values)\(\hat Y_i=\hat r(X_i)\);残差(residuals)
\[\hat\epsilon_i=Y_i-\hat Y_i=Y_i-(\hat\beta_0+\hat\beta_1X_i).\tag{13.4}\]
残差平方和(residual sum of squares, RSS)\(\text{RSS}=\sum_{i=1}^n\hat\epsilon_i^2\),衡量直线对数据的拟合程度。 定义 13.3:最小二乘估计(least squares estimates)是使 \(\text{RSS}=\sum\hat\epsilon_i^2\) 最小的 \(\hat\beta_0,\hat\beta_1\)。 定理 13.4:最小二乘估计为
\[\hat\beta_1=\frac{\sum_{i=1}^n(X_i-\bar X_n)(Y_i-\bar Y_n)}{\sum_{i=1}^n(X_i-\bar X_n)^2},\tag{13.5}\]
\[\hat\beta_0=\bar Y_n-\hat\beta_1\bar X_n.\tag{13.6}\]
\(\sigma^2\) 的无偏估计为
\[\hat\sigma^2=\left(\frac1{n-2}\right)\sum_{i=1}^n\hat\epsilon_i^2.\tag{13.7}\]
(除以 \(n-2\) 是因为估计了两个参数。推导:对 RSS 关于 \(\beta_0,\beta_1\) 求偏导令为 0 得正规方程。) 例 13.5:恒星数据 \(\hat\beta_0=3.58\),\(\hat\beta_1=0.166\),拟合线 \(\hat r(x)=3.58+0.166x\)(图 13.1)。 例 13.6(2001 年总统选举,佛罗里达):图 13.2 为各县 Buchanan 得票 \(Y\) 对 Bush 得票 \(X\)。最小二乘估计(剔除 Palm Beach 县):\(\hat\beta_0=66.0991\)(\(\widehat{\text{se}}=17.2926\)),\(\hat\beta_1=0.0035\)(\(\widehat{\text{se}}=0.0002\)),拟合线 Buchanan = 66.0991 + 0.0035 Bush(标准误的计算后面介绍)。图 13.2 也给出残差。残差表现得像随机正态数时线性回归推断最准确;从残差图看此例并非如此。若改用 log(票数) 重做:\(\hat\beta_0=-2.3298\)(\(\widehat{\text{se}}=0.3529\)),\(\hat\beta_1=0.730300\)(\(\widehat{\text{se}}=0.0358\))。(例 13.6 的后续分析——对数模型残差、Palm Beach 县的预测与异常——见下一块。)

(第 13 章其余内容:13.2 最小二乘与最大似然、13.3 最小二乘估计的性质、13.4 预测、13.5 多元回归、13.6 模型选择、13.7 logistic 回归等,以及本章要点、与量化交易的关联、推荐习题,续见下一块。)