第 11 章 贝叶斯推断
本章对应 Wasserman 原书第 11 章。前几章的方法属于频率学派:参数是固定未知常数,我们评价的是程序的长期表现(95% 的置信区间在重复抽样中 95% 的时候套住真值)。贝叶斯学派换了一个出发点:把对参数的不确定性也用概率描述,用数据去更新它。Wasserman 本人是频率学派立场,他对贝叶斯方法的介绍既讲清了"怎么做",也毫不客气地指出了它在高维问题中的失败。读完本章,你应能在两种语言之间切换,并知道各自回答的是什么问题。
学习目标
- 说清频率学派(F1–F3)与贝叶斯学派(B1–B3)的基本公设差异。
- 熟练运用"后验 ∝ 似然 × 先验",会用共轭先验(Beta–Bernoulli、Normal–Normal、Gamma–Poisson)得到闭式后验,并把后验均值解读为 MLE 与先验均值的加权平均(收缩)。
- 会用模拟(后验抽样再变换)求参数函数和多参数问题的边缘后验。
- 理解大样本下贝叶斯与频率推断近似一致(定理 11.5),以及先验选择的几种方案:主观先验、平坦先验、非正常先验、Jeffreys 先验。
- 会做简单的贝叶斯检验,理解它为何对先验敏感,能复述并计算 Jeffreys–Lindley 悖论。
- 认识贝叶斯方法在高维问题中的局限(Robins–Ritov 例、归一化常数例),并能把贝叶斯工具用于策略评估、A/B 测试和 Black–Litterman 组合构建。
读前导读
这一章在解决什么问题
一句话:看到数据之前你已经有看法,看到数据之后看法该怎么改? 贝叶斯推断给出的答案是一个机械的公式:新看法 ∝ 数据对各种可能的支持程度 × 旧看法。
这件事你在 CFA 里其实已经做过。CFA 一级的贝叶斯公式(用新信息更新某事件的概率,比如"盈利超预期时公司属于优质公司的概率")就是本章的离散版本。本章把"事件"换成"连续取值的参数"(胜率 \(p\)、均值 \(\theta\)、Sharpe 比率),把概率表换成概率密度,于是求和变成积分。你在 CFA 三级见过的 Black–Litterman 模型,本质上就是本章例 11.2 的多元版本:均衡收益是先验,主观观点是数据,后验收益是两者按"可信度"加权的结果。
本章的第二条主线是和前几章频率学派方法(置信区间、p 值)的比较。结论分三层:样本大、参数少时两派答案几乎一样;做假设检验时两派可以差得很远(p = 0.05 并不意味着原假设只有 5% 的可能为真);参数极多时贝叶斯方法可能彻底失灵。对量化研究最直接的收获是两条:小样本下用先验"刹车",以及不要把显著的 p 值当成策略有效的概率。
需要先想起来的数学
1. 条件密度与贝叶斯公式。 离散版 \(P(A\mid B)=P(B\mid A)P(A)/P(B)\);连续版把 \(P\) 换成密度 \(f\),分母的"对所有可能情况求和"换成"对 \(\theta\) 积分"。分母只是让总概率等于 1 的常数,所以经常先不管它,最后再补。小例子:两个假设先验各 0.5,数据在 A 下出现的概率 0.2、在 B 下 0.6,后验 A 的概率 \(=0.1/(0.1+0.3)=0.25\)。参见 第 00 册第 07 章 概率中的分析工具。
2. 定积分与"密度下的面积"。 \(\int f(\theta)d\theta\) 就是密度曲线下的总面积,等于 1;\(\int\theta f(\theta)d\theta\) 是均值(按密度加权平均)。本章大部分积分不需要真去算,因为可以"认出"分布族。参见 第 00 册第 03 章 积分。
3. 配方。 \(-\frac12A\theta^2+B\theta=-\frac A2(\theta-B/A)^2+\text{常数}\)。只要对数密度是 \(\theta\) 的开口向下的二次函数,它就是正态分布,均值 \(B/A\)、方差 \(1/A\)。例:\(-\theta^2+4\theta\) 中 \(A=2,B=4\),对应 \(N(2,\,1/2)\)。这是例 11.2 和定理 11.5 的核心技巧。
4. 导数与二阶泰勒展开。 \(\ell(\theta)\approx\ell(\hat\theta)+\ell'(\hat\theta)(\theta-\hat\theta)+\frac12\ell''(\hat\theta)(\theta-\hat\theta)^2\)。和久期–凸性近似债券价格是同一个公式:一阶项是久期,二阶项是凸性。在最大值点一阶导为 0,只剩二阶项。参见 第 00 册第 02 章 导数与泰勒展开。
5. 变量变换。 若 \(\psi=g(p)\) 单调,密度满足 \(f_\psi(\psi)=f_p(p)\,|dp/d\psi|\),即"概率质量守恒,区间被拉伸时密度变小"。这是 11.6 节"平坦先验不是真的平坦"和 Jeffreys 先验的基础。
另外两个符号:\(\Gamma(\cdot)\) 是 Gamma 函数,对正整数 \(\Gamma(k)=(k-1)!\),在 Beta 密度里只起归一化作用;\(\propto\) 读作"正比于",即两边只差一个与 \(\theta\) 无关的常数倍。Fisher 信息 \(I(\theta)\) 和 MLE 的标准误 \(\text{se}=1/\sqrt{nI}\) 在第 09 章讲过。
怎么读这一章
核心必读:11.2(三步走和两个共轭例子,尤其"精度相加、均值按精度加权")、11.4(模拟)、11.8(贝叶斯检验与 Lindley 悖论)、11.10.1–11.10.3 的量化实战。11.5 的定理先看结论"大样本下两派殊途同归",推导可第二遍再看。11.3 的解析推导可以跳过,直接看 11.4 的模拟替代方案。11.6 的 Jeffreys 先验和 11.9.2 的两个反例偏理论,第一次读只需记住结论:平坦先验依赖参数化;贝叶斯方法完全依赖似然函数,似然丢掉的信息它也用不上。
11.1 两种哲学
频率学派(frequentist)的公设:
- F1 概率是极限相对频率,是现实世界的客观性质。
- F2 参数是固定的未知常数。它们不波动,所以不能对参数作有意义的概率陈述。
- F3 统计程序应当有定义明确的长期频率性质,例如 95% 置信区间应当在至少 95% 的重复中套住真参数。
贝叶斯学派(Bayesian)的公设:
- B1 概率描述信念度(degree of belief),而不是极限频率。因此可以对很多事物作概率陈述,而不仅是受随机变化影响的数据。例如"爱因斯坦在 1948 年 8 月 1 日喝过一杯茶的概率是 0.35"——这不对应任何极限频率,只表达我对该命题相信的程度。
- B2 即使参数是固定常数,也可以对它作概率陈述。
- B3 对参数 \(\theta\) 的推断通过给出 \(\theta\) 的概率分布来完成;点估计、区间估计都从这个分布中提取。
贝叶斯推断有争议,因为它天然接纳主观概率,而且一般不保证长期表现。Wasserman 的态度是:统计学界更重视频率方法,但贝叶斯方法确有一席之地,机器学习界很多人热衷于它。先放下哲学,学会怎么做,章末再评价优劣。
量化读法:交易员天然是"贝叶斯"的——"我认为这个策略有效的可能性大概六成"这类话每天都在说。问题在于先验从哪来、是否被数据充分修正。本章给出把这种直觉形式化的工具,也给出它失灵的边界。
11.2 贝叶斯方法
11.2.1 三步走
- 选择先验分布(prior distribution)\(f(\theta)\),表达看到数据之前对参数的信念;
- 选择统计模型 \(f(x\mid\theta)\)(现在写成条件密度而不是 \(f(x;\theta)\),因为 \(\theta\) 被当作随机变量);
- 观测数据后,计算后验分布(posterior distribution)\(f(\theta\mid X_1,\dots,X_n)\)。
第 3 步就是贝叶斯定理。连续情形单个观测:
计算时可以先丢掉 \(c_n\),最后再归一化——很多时候只要认出后验属于哪个分布族,常数就自动确定了。
白话解释:公式里三样东西各有分工。似然 \(\mathcal L_n(\theta)\) 回答"如果参数是 \(\theta\),看到这批数据的可能性有多大";先验 \(f(\theta)\) 回答"看数据之前我觉得 \(\theta\) 有多可信";两者相乘,就是对每个候选 \(\theta\) 打的综合分。\(c_n\) 是把所有候选的分加起来(积分),作用只是把分数换算成总和为 1 的概率。 一个离散小例子:候选胜率只有 0.4、0.5、0.6 三种,先验各 1/3,观测 3 笔赢 2 笔。似然分别是 \(3\times0.4^2\times0.6=0.288\)、\(0.375\)、\(0.432\),乘先验后归一化,后验约为 0.26、0.34、0.40。数据把信念往 0.6 推了一点,但只有 3 笔,推得不多。
11.2.2 从后验中提取结论
- 点估计:后验均值 \(\bar\theta_n=\int\theta f(\theta\mid x^n)d\theta=\dfrac{\int\theta\mathcal L_n(\theta)f(\theta)d\theta}{\int\mathcal L_n(\theta)f(\theta)d\theta}\),或后验众数、后验中位数(第 12 章会说明它们分别对应哪种损失函数)。
- 区间估计:找 \(a,b\) 使两侧尾部后验概率各为 \(\alpha/2\),则 \(C=(a,b)\) 满足 \(\mathbb P(\theta\in C\mid x^n)=1-\alpha\),称为 \(1-\alpha\) 后验区间(posterior interval,也常称可信区间 credible interval)。
注意措辞的差别:后验区间可以说"给定数据,参数落在 \(C\) 中的概率是 95%";频率学派的置信区间只能说"这个程序在重复抽样中 95% 的时候套住参数"。
11.2.3 例 11.1:Bernoulli + Beta 先验
\(X_i\sim\text{Bernoulli}(p)\),先验 \(f(p)=1\)(均匀)。记 \(s=\sum x_i\),
更一般地取先验 \(p\sim\text{Beta}(\alpha,\beta)\),后验为 \(\text{Beta}(\alpha+s,\ \beta+n-s)\),
共轭先验(conjugate prior):先验和后验属于同一分布族。Beta 是 Bernoulli / 二项模型的共轭先验。
量化读法:一个新信号实盘 20 笔交易赢了 15 笔,MLE 胜率 75%。若根据同类信号的经验取先验 Beta(26,24)(相当于 50 笔、均值 52%),后验均值为 \((26+15)/(50+20)=58.6\%\)。小样本时先验起"刹车"作用,防止被几笔运气好的交易冲昏头脑。
11.2.4 例 11.2:Normal–Normal 共轭
\(X_i\sim N(\theta,\sigma^2)\),\(\sigma\) 已知,先验 \(\theta\sim N(a,b^2)\)。后验(原书习题 1 要求验证)为 \(\theta\mid X^n\sim N(\bar\theta,\tau^2)\),
推导要点。 对数后验是 \(\theta\) 的二次函数:
推导拆解: 第一步,写似然。\(n\) 个正态观测的对数似然是 \(-\sum(X_i-\theta)^2/(2\sigma^2)\)。利用 \(\sum(X_i-\theta)^2=\sum(X_i-\bar X)^2+n(\bar X-\theta)^2\)(交叉项 \(2(\bar X-\theta)\sum(X_i-\bar X)=0\)),第一部分与 \(\theta\) 无关,归入常数,剩下 \(-n(\bar X-\theta)^2/(2\sigma^2)=-(\bar X-\theta)^2/(2\,\text{se}^2)\)。 第二步,写先验的对数:\(-(\theta-a)^2/(2b^2)\)。两项相加就是上式左边。 第三步,展开平方,只保留含 \(\theta\) 的项:\(\theta^2\) 的系数是 \(-\frac12(1/\text{se}^2+1/b^2)\),\(\theta\) 的系数是 \(\bar X/\text{se}^2+a/b^2\)。 第四步,套配方公式(导读第 3 项):\(A=1/\text{se}^2+1/b^2\),\(B=\bar X/\text{se}^2+a/b^2\)。后验方差 \(\tau^2=1/A\),即 \(1/\tau^2=1/\text{se}^2+1/b^2\);后验均值 \(B/A=\dfrac{(1/\text{se}^2)\bar X+(1/b^2)a}{1/\text{se}^2+1/b^2}\),这正是 \(w\bar X+(1-w)a\)。
金融直觉:这和最小方差组合的权重是同一个逻辑。两个对 \(\theta\) 的独立"估计":数据给的 \(\bar X\)(方差 \(\text{se}^2\)),先验给的 \(a\)(方差 \(b^2\))。把它们组合成一个估计、让方差最小,最优权重就与各自方差成反比。合并后的精度等于两个精度之和,相当于两份独立信息的"信息量"直接相加。例:分析师预测 EPS 为 2.0(标准差 0.2,精度 25),模型预测 2.4(标准差 0.4,精度 6.25),合并后为 \((25\times2.0+6.25\times2.4)/31.25=2.08\),标准差 \(1/\sqrt{31.25}\approx0.18\),比两者都小。
两个极限:\(n\to\infty\) 时 \(w\to1\)、\(\tau/\text{se}\to1\);\(n\) 固定而 \(b\to\infty\)(先验变平)时也一样。此时后验近似 \(N(\hat\theta,\text{se}^2)\),95% 后验区间 \(\bar\theta\pm1.96\tau\approx\hat\theta\pm1.96\,\text{se}\),与频率学派置信区间重合。
这个"按精度加权"的公式是量化中收缩估计的原型:个股 Beta 向 1 收缩(Vasicek 调整)、个股期望收益向截面均值收缩、基金经理 alpha 向 0 收缩,以及下面要讲的 Black–Litterman 模型,都是它的变体。
11.3 参数的函数
要推断 \(\tau=g(\theta)\),思路和第 02 册求 \(Y=g(X)\) 的分布一样:
例 11.3。 Bernoulli + 均匀先验,\(\psi=\log\frac p{1-p}\)。\(p\le\frac{e^\psi}{1+e^\psi}\) 等价于 \(\psi\) 不超过某值,求导得
解析推导很快就变得繁琐,下一节的模拟方法几乎总是更好的选择。
11.4 用模拟代替积分
如果能从后验抽样 \(\theta_1,\dots,\theta_B\sim f(\theta\mid x^n)\),那么:
- 直方图近似后验密度;
- 后验均值 \(\approx\frac1B\sum\theta_j\);
- \(1-\alpha\) 后验区间 \(\approx\) 样本的 \(\alpha/2\) 与 \(1-\alpha/2\) 分位数;
- 参数函数:令 \(\tau_j=g(\theta_j)\),则 \(\tau_1,\dots,\tau_B\) 就是 \(f(\tau\mid x^n)\) 的样本——不需要任何微积分。
例 11.4。 续例 11.3:抽 \(P_j\sim\text{Beta}(s+1,n-s+1)\),令 \(\psi_j=\log\frac{P_j}{1-P_j}\),\(\psi_j\) 的直方图就是 \(h(\psi\mid x^n)\) 的估计。
共轭模型可以直接抽样;一般模型的后验抽样需要马尔可夫链蒙特卡罗(MCMC)等方法,见原书第 24 章(本册第 24b 章)。
量化读法:这就是"考虑参数不确定性的组合优化"的标准做法——从期望收益与协方差的后验中抽样,对每组抽样求最优权重或计算风险指标,再汇总。它比"把点估计当真值代入优化器"稳健得多。
11.5 大样本性质
定理 11.5(Bernstein–von Mises 型结论)。 设 \(\hat\theta_n\) 为 MLE,\(\widehat{\text{se}}=1/\sqrt{nI(\hat\theta_n)}\)。在正则条件下,后验近似为 \(N(\hat\theta_n,\widehat{\text{se}}^2)\),因此后验均值 \(\bar\theta_n\approx\hat\theta_n\)。并且频率学派的渐近置信区间 \(C_n=\hat\theta_n\pm z_{\alpha/2}\widehat{\text{se}}\) 同时也是近似的 \(1-\alpha\) 后验区间:\(\mathbb P(\theta\in C_n\mid X^n)\to1-\alpha\)。
证明思路(原书附录)。 \(n\) 增大时先验的影响相对减弱,\(\log f(\theta\mid x^n)\approx\ell(\theta)+\text{常数}\)。在 \(\hat\theta\) 处展开,一阶项因 \(\ell'(\hat\theta)=0\) 消失:
推导拆解:
- 为什么先验"影响减弱":\(\log f(\theta\mid x^n)=\ell(\theta)+\log f(\theta)-\log c_n\)。对数似然 \(\ell=\sum_i\ell_i\) 是 \(n\) 项之和,随 \(n\) 线性增长;\(\log f(\theta)\) 不随 \(n\) 变。\(n\) 大时前者主导。
- 为什么一阶项消失:\(\hat\theta\) 是 MLE,是 \(\ell\) 的最大值点,导数为 0。这和"在收益率曲线的极值点上,价格对收益率的一阶敏感度为零"是同一类事实。
- 为什么 \(\ell''(\hat\theta)<0\):最大值点处曲线向下弯。所以 \(\frac12\ell''(\hat\theta)(\theta-\hat\theta)^2\) 可以写成 \(-\frac{(\theta-\hat\theta)^2}{2\sigma_n^2}\),取指数后正是正态密度的形状。
- 为什么 \(-\ell''\approx nI\):\(-\ell''(\hat\theta)=\sum_i[-\ell_i''(\hat\theta)]\) 是 \(n\) 个同分布量之和,由大数定律约等于 \(n\) 乘以它的期望,而 Fisher 信息的定义之一正是 \(I(\theta)=\mathbb E[-\ell_i''(\theta)]\)。 直观含义:对数似然在峰值附近越"尖"(曲率越大),参数估计越精确。这与凸性越大价格对收益率越敏感同理。
贝叶斯 Delta 方法。 \(\tau=g(\theta)\) 的后验近似 \(N(g(\hat\theta),\ \widehat{\text{se}}^2g'(\hat\theta)^2)\),与频率版 Delta 方法一致。
结论:参数少、样本大时,两种方法在估计问题上殊途同归。 分歧出现在小样本、高维、以及检验问题中。
11.6 先验从哪里来
11.6.1 主观先验
主观主义(subjectivism)认为先验应反映收集数据前对 \(\theta\) 的真实看法。少数参数、有可靠经验时可行;但在复杂的多参数问题中不现实,而且把主观意见注入分析违背了科学推断尽量客观的目标。
11.6.2 平坦先验与非正常先验
"无信息先验"(noninformative prior)的最朴素候选是平坦先验 \(f(\theta)\propto\) 常数。
非正常先验(improper prior)。\(X\sim N(\theta,\sigma^2)\) 中取 \(f(\theta)\propto c\),\(\int f=\infty\),它不是概率密度。但形式地套用贝叶斯定理,\(f(\theta\mid x^n)\propto\mathcal L_n(\theta)\),得 \(\theta\mid X^n\sim N(\bar X,\sigma^2/n)\),与频率学派结果完全相同。只要后验是正常的概率分布,用非正常先验就没问题。
平坦先验不具有变换不变性。 Bernoulli 中用 \(f(p)=1\) 表示"对 \(p\) 一无所知"。但令 \(\psi=\log\frac p{1-p}\),由变量变换,\(\psi\) 的先验密度是 \(\frac{e^\psi}{(1+e^\psi)^2}\),并不平坦。如果对 \(p\) 一无所知,对 \(\psi\) 也应该一无所知——矛盾。"平坦"这个概念依赖参数化方式,所以没有良好定义。
11.6.3 Jeffreys 先验
取
推导拆解:
- \(I_\psi=I_\theta(d\theta/d\psi)^2\) 从哪来:Fisher 信息是得分函数(对数似然的一阶导)的方差。由链式法则 \(\frac{\partial\ell}{\partial\psi}=\frac{\partial\ell}{\partial\theta}\cdot\frac{d\theta}{d\psi}\),\(d\theta/d\psi\) 是常数倍,方差要乘它的平方。
- 两边开根号:\(\sqrt{I_\psi}=\sqrt{I_\theta}\,|d\theta/d\psi|\)。
- 对照导读第 5 项的变量变换公式:若在 \(\theta\) 上取密度 \(\sqrt{I_\theta}\),换到 \(\psi\) 上密度应是 \(\sqrt{I_\theta}\,|d\theta/d\psi|\),恰好等于 \(\sqrt{I_\psi}\)。所以"先在 \(\theta\) 上取 Jeffreys 再变换"和"直接在 \(\psi\) 上取 Jeffreys"是同一个分布。平坦先验做不到这一点,因为变换会额外乘上 \(|d\theta/d\psi|\)。
例 11.6。 Bernoulli 中 \(I(p)=\frac1{p(1-p)}\),Jeffreys 先验 \(\propto p^{-1/2}(1-p)^{-1/2}\),即 Beta(1/2,1/2),与均匀分布差别不大。多参数时 \(f(\theta)\propto\sqrt{\det I(\theta)}\)。
量化读法:参数化问题在实践中很真实。对波动率 \(\sigma\)、方差 \(\sigma^2\)、对数波动率 \(\log\sigma\) 分别取"平坦"先验,会得到不同的后验;正态模型中 \(\sigma\) 的 Jeffreys 先验是 \(f(\sigma)\propto1/\sigma\),等价于对 \(\log\sigma\) 平坦。
11.7 多参数问题
\(\theta=(\theta_1,\dots,\theta_p)\) 时后验仍为 \(f(\theta\mid x^n)\propto\mathcal L_n(\theta)f(\theta)\)。推断单个参数需要边缘后验
例 11.7(比较两个二项比例)。 对照组 \(n_1\) 人中 \(X_1\) 人存活,处理组 \(n_2\) 人中 \(X_2\) 人存活,关心 \(\tau=p_2-p_1\)。取 \(f(p_1,p_2)=1\),后验
11.8 贝叶斯检验
11.8.1 基本做法
检验 \(H_0:\theta=\theta_0\) vs \(H_1:\theta\ne\theta_0\)。贝叶斯做法是给假设本身也放先验,常取 \(\mathbb P(H_0)=\mathbb P(H_1)=1/2\),并在 \(H_1\) 下给 \(\theta\) 一个先验密度 \(f(\theta)\)。由贝叶斯定理
11.8.2 检验对先验敏感
估计问题中先验影响不大,贝叶斯与频率答案相近;检验问题中并非如此。\(H_1\) 下的先验 \(f(\theta)\) 越分散,\(\int\mathcal L(\theta)f(\theta)d\theta\) 越小(先验把质量摊到了数据不支持的区域),\(H_0\) 的后验概率越大。另外,检验中不能用非正常先验:\(f(\theta)\propto c\) 时分母里出现无法确定的常数 \(c\),结论可以任意。
与先验无关的下界。 因为 \(\int\mathcal L(\theta)f(\theta)d\theta\le\mathcal L(\hat\theta)\),
推导拆解:
- 为什么 \(\int\mathcal L(\theta)f(\theta)d\theta\le\mathcal L(\hat\theta)\):左边是似然按先验加权的平均值,平均值不会超过最大值,而 \(\mathcal L(\hat\theta)\) 正是似然的最大值。等号只在先验把全部质量押在 \(\hat\theta\) 上时成立,这是"事后诸葛亮"式的、对 \(H_1\) 最有利的先验。
- 把分母换成更大的数,分式变小,于是得到下界。
- 正态情形:\(\mathcal L(\theta)\propto\exp\{-n(\bar x-\theta)^2/(2\sigma^2)\}\),\(\hat\theta=\bar x\) 时指数为 0,\(\theta=\theta_0\) 时指数为 \(-w^2/2\),其中 \(w=(\bar x-\theta_0)/(\sigma/\sqrt n)\)。比值即 \(e^{-w^2/2}\)。代入:\(1/(1+e^{1.96^2/2})=1/(1+6.83)\approx0.128\)。
白话解释:p 值回答的是"如果 \(H_0\) 为真,看到这么极端的数据的概率",即 \(P(\text{数据}\mid H_0)\) 的一种尾部版本;我们真正关心的通常是 \(P(H_0\mid\text{数据})\)。两者的关系就像"优质公司盈利超预期的概率"和"盈利超预期的公司是优质公司的概率",方向反了,中间隔着先验和备择假设下的数据概率。上面的下界说明,即使对 \(H_1\) 最慷慨,这两个数也不会接近。
11.8.3 Jeffreys–Lindley 悖论(原书习题 8)
设 \(\bar X\sim N(\mu,1/n)\),\(H_0:\mu=0\),\(\mathbb P(H_0)=1/2\),\(H_1\) 下 \(\mu\sim N(0,b^2)\)。\(H_1\) 下 \(\bar X\) 的边缘分布为 \(N(0,b^2+1/n)\),于是
推导拆解:
- \(H_1\) 下 \(\bar X\) 的边缘分布:\(\bar X=\mu+(\bar X-\mu)\),其中 \(\mu\sim N(0,b^2)\),抽样误差 \(\bar X-\mu\sim N(0,1/n)\) 且与 \(\mu\) 独立。两个独立正态之和仍是正态,方差相加,得 \(N(0,b^2+1/n)\)。
- \(\phi(x;0,v)=\frac1{\sqrt{2\pi v}}e^{-x^2/(2v)}\)。两个密度相除,前面的系数比是 \(\sqrt{(b^2+1/n)/(1/n)}=\sqrt{1+nb^2}\)。
- 指数部分:\(-\frac{n\bar x^2}{2}+\frac{\bar x^2}{2(b^2+1/n)}\)。用 \(\bar x^2=w^2/n\) 代入,得 \(-\frac{w^2}{2}\big(1-\frac{1}{1+nb^2}\big)=-\frac{w^2}{2}\cdot\frac{nb^2}{1+nb^2}\)。
固定 Wald 统计量 \(w\)(因而固定 p 值),让 \(n\to\infty\):指数项趋于常数 \(e^{-w^2/2}\),前面的 \(\sqrt{1+nb^2}\to\infty\),所以 \(BF_{01}\to\infty\),\(\mathbb P(H_0\mid x)\to1\)。同一个 p 值,频率学派说"强烈拒绝",贝叶斯学派说"几乎肯定是 \(H_0\)"。
原因在于:样本很大时,固定的 \(w\) 对应的效应 \(\bar x=w/\sqrt n\) 非常小;这么小的效应与"恰好为 0"相当吻合,而与 \(H_1\) 先验所设想的"有一定规模的效应"不吻合。对量化而言,这是一个重要提醒:高频数据样本量巨大,p 值很容易"显著",但对应的效应可能小到没有经济意义,甚至在贝叶斯意义上更支持零假设。 看效应大小,而不仅看 p 值。
11.9 贝叶斯推断的优缺点
11.9.1 优点
有先验信息时,贝叶斯定理是把先验信息与数据结合起来的自然方式。它在心理上也更有吸引力:可以直接说"参数在这个区间里的概率是 95%"。但 Wasserman 提醒,心理吸引力不是选择推断方法的有力科学论据。
例 11.8(例 6.14 再访)。 \(Y_i=\theta+X_i\),\(X_i=\pm1\) 各半。观测到 \(Y_1=15,Y_2=17\)。原书第 6 章构造的 75% 置信集此时为 \(\{16\}\),而此时我们确切知道 \(\theta=16\)。称它为"75% 置信集"让很多人不安,尽管在长期频率意义下它确实是有效的 75% 置信集。贝叶斯解法更令人满意:对整数 \(\theta\) 取任何处处为正的先验,似然只在 \(\theta=16\) 处非零,后验 \(\mathbb P(\theta=16\mid Y)=1\)。
11.9.2 缺点:高维时贝叶斯可能失败
例 11.9(Robins & Ritov 例的简化版)。 设 \(B\) 是一个极大的有限数(如 \(100^{100}\)),任何现实样本量 \(n\ll B\)。未知参数 \(\theta=(\theta_1,\dots,\theta_B)\in[0,1]^B\);已知常数 \(\xi=(\xi_1,\dots,\xi_B)\),\(0<\delta\le\xi_j\le1-\delta\)。数据 \((X_i,R_i,Y_i)\) 这样生成:
- \(X_i\) 在 \(\{1,\dots,B\}\) 上均匀抽取;
- \(R_i\sim\text{Bernoulli}(\xi_{X_i})\);
- 若 \(R_i=1\),抽 \(Y_i\sim\text{Bernoulli}(\theta_{X_i})\);若 \(R_i=0\),\(Y_i\) 缺失。
目标是估计 \(\psi=\mathbb P(Y_i=1)=\frac1B\sum_j\theta_j\)。
贝叶斯 / 似然分析。 似然为
频率学派解法。 Horvitz–Thompson 估计量(原书拼作 Horwitz)
白话解释:为什么除以 \(\xi\) 就无偏?看一个格子 \(j\):它的结果只有 \(\xi_j\) 的概率被看到。被看到时记 \(Y/\xi_j\),没看到时记 0,平均下来 \(\xi_j\cdot\theta_j/\xi_j=\theta_j\),正好补回了"没看到的那部分"。再对均匀抽到的 \(j\) 取平均,就是 \(\frac1B\sum\theta_j=\psi\)。整个过程不需要知道每个 \(\theta_j\) 是多少,只需要知道"每个样本被观测到的概率"。这类似抽样审计:抽中概率低的凭证,每张代表的总体金额更大,要按抽中概率的倒数放大。 贝叶斯方法的问题不在于计算,而在于它只看似然;\(\xi\) 不含 \(\theta\),从似然的角度看是"无关常数",被丢掉后就再也用不上了。
量化读法:逆概率加权(inverse probability weighting)正是处理样本选择偏差的工具。例如只观测到成交了的限价单,要估计全部挂单的某个平均特征,就按"成交概率的倒数"加权;回测中处理幸存者偏差也是同一思路。
例 11.10(Edward George 提供)。 \(f(x)=cg(x)\),\(g>0\) 已知、\(c\) 未知(高维时 \(\int g\) 算不出来)。我们能从 \(f\) 抽样(原书第 24 章,本册第 24b 章),能否估计 \(c\)?
- 频率解:用任意相合的密度估计 \(\hat f_n\),取一点 \(x\),\(\hat c=\hat f_n(x)/g(x)\) 相合。
- 贝叶斯解:似然 \(\mathcal L_n(c)=\prod cg(X_i)\propto c^n\),后验 \(\propto c^n\pi(c)\)——完全不依赖数据;而且后验均值随 \(n\) 增大趋于无穷。
11.9.3 结论
Wasserman 的总结:"贝叶斯学派是似然函数的奴隶。似然出问题时,贝叶斯推断也会出问题。"更重要的是理解两种方法回答的是不同的问题:
- 想以有原则的方式把先验信念与数据结合起来——用贝叶斯推断;
- 想构造有长期表现保证的程序(例如真的能在 95% 的时候套住真值的区间)——用频率方法。
参数空间高维时贝叶斯方法尤其容易出问题,95% 后验区间在频率意义下未必能 95% 地包含真值。
11.10 量化实战
11.10.1 执行算法的贝叶斯 A/B 测试
两种限价单执行算法:A 在 120 单中有 78 单 5 分钟内成交,B 在 115 单中有 86 单。分别用频率方法(Wald 区间)和三种先验下的贝叶斯方法(原书例 11.7)比较,并对对数比值比做后验模拟与 Delta 方法的对照(原书习题 4 的思路)。
import numpy as np
from scipy import stats
rng = np.random.default_rng(3)
# 两种执行算法的 A/B 测试:限价单在 5 分钟内成交记为成功
nA, xA = 120, 78 # 算法 A:120 单成交 78
nB, xB = 115, 86 # 算法 B:115 单成交 86
# 频率学派:Wald 检验与 90% 区间(多参数 Delta 方法)
pA, pB = xA / nA, xB / nB
se = np.sqrt(pA * (1 - pA) / nA + pB * (1 - pB) / nB)
print(f"MLE: pA={pA:.3f}, pB={pB:.3f}, 差={pB-pA:.3f}, 90% 置信区间=[{pB-pA-1.645*se:.3f}, {pB-pA+1.645*se:.3f}], "
f"Wald p={2*stats.norm.sf(abs(pB-pA)/se):.3f}")
# 贝叶斯:独立 Beta 先验 → 独立 Beta 后验(原书例 11.7),模拟求差的后验
B = 200_000
for name, (a0, b0) in {"均匀先验 Beta(1,1)": (1, 1), "Jeffreys Beta(.5,.5)": (0.5, 0.5),
"信息先验 Beta(30,20)": (30, 20)}.items():
PA = rng.beta(a0 + xA, b0 + nA - xA, B)
PB = rng.beta(a0 + xB, b0 + nB - xB, B)
d = PB - PA
print(f"{name:<18} 后验均值差={d.mean():.3f}, 90% 后验区间=[{np.quantile(d,.05):.3f}, "
f"{np.quantile(d,.95):.3f}], P(pB>pA|数据)={np.mean(d>0):.3f}")
# 参数的函数:对数比值比的后验(原书习题 4 的思路),直接对抽样做变换
PA = rng.beta(1 + xA, 1 + nA - xA, B); PB = rng.beta(1 + xB, 1 + nB - xB, B)
lor = np.log(PB / (1 - PB)) - np.log(PA / (1 - PA))
lor_hat = np.log(pB / (1 - pB)) - np.log(pA / (1 - pA))
se_lor = np.sqrt(1 / xA + 1 / (nA - xA) + 1 / xB + 1 / (nB - xB))
print(f"对数比值比: 后验均值={lor.mean():.3f}, 后验 sd={lor.std():.3f}; MLE={lor_hat:.3f}, Delta se={se_lor:.3f}")
输出:
MLE: pA=0.650, pB=0.748, 差=0.098, 90% 置信区间=[0.000, 0.196], Wald p=0.100
均匀先验 Beta(1,1) 后验均值差=0.096, 90% 后验区间=[-0.001, 0.193], P(pB>pA|数据)=0.948
Jeffreys Beta(.5,.5) 后验均值差=0.097, 90% 后验区间=[-0.001, 0.194], P(pB>pA|数据)=0.948
信息先验 Beta(30,20) 后验均值差=0.068, 90% 后验区间=[-0.016, 0.151], P(pB>pA|数据)=0.908
对数比值比: 后验均值=0.462, 后验 sd=0.286; MLE=0.468, Delta se=0.288
读法:
- 均匀先验与 Jeffreys 先验下,后验区间与频率学派的 90% 置信区间几乎一样——定理 11.5 在 \(n\approx120\) 时已经很好地成立。
- 贝叶斯方法给出了频率方法给不出的量:"B 优于 A 的后验概率约 95%"。注意它约等于 1 减去单侧 p 值(0.05):平坦先验、近似正态时这是一般规律。业务决策("换不换算法")往往需要的正是这种概率,配合换算法的成本就能做期望收益决策(第 12 章)。
- 信息先验 Beta(30,20) 把两个成交率都往 60% 拉,差异被收缩到 0.068,\(P(p_B>p_A)\) 降到 0.91。先验的影响在这个样本量下仍然可见。
- 对数比值比的后验均值与标准差(0.462, 0.286)与 MLE + Delta 方法(0.468, 0.288)几乎一致,又一次印证大样本下两种方法殊途同归。
11.10.2 一个"显著"的策略,有效的概率有多大?
用 11.8.3 节的公式量化 Lindley 悖论:保持 \(t=2.5\)(双侧 p ≈ 0.012)不变,改变回测长度;\(H_1\) 下年化 Sharpe 的先验取 \(N(0,1)\)。最后看先验概率本身的影响。
import numpy as np
from scipy import stats
# Jeffreys–Lindley 悖论:保持 t 值 = 2.5(双侧 p≈0.012)不变,样本越长,H0 的后验概率越高
# 模型:日收益标准化后 xbar ~ N(SR_d, 1/n);H0: SR_d = 0;H1: SR_d ~ N(0, b^2)
w = 2.5
b = 1.0 / np.sqrt(252) # 先验:年化 Sharpe 的先验标准差为 1.0
print(f"t = {w},双侧 p = {2*stats.norm.sf(w):.4f},与先验无关的下界 P(H0|x) >= {1/(1+np.exp(w**2/2)):.3f}")
for years in [1, 5, 20, 100, 1000, 10000]:
n = 252 * years
xbar = w / np.sqrt(n)
f0 = stats.norm.pdf(xbar, 0, np.sqrt(1 / n)) # H0 下的边缘密度
f1 = stats.norm.pdf(xbar, 0, np.sqrt(b**2 + 1 / n)) # H1 下的边缘密度(对先验积分)
post0 = f0 / (f0 + f1) # P(H0)=P(H1)=1/2
print(f"{years:>5} 年:年化 SR 估计 {xbar*np.sqrt(252):.2f},贝叶斯因子 BF01 = {f0/f1:.2f},P(H0|数据) = {post0:.3f}")
# 先验概率的作用:同样 t=2.5、5 年数据,若"策略真有效"的先验概率只有 10%
n = 252 * 5; xbar = w / np.sqrt(n)
bf10 = stats.norm.pdf(xbar, 0, np.sqrt(b**2 + 1/n)) / stats.norm.pdf(xbar, 0, np.sqrt(1/n))
for prior1 in [0.5, 0.1]:
post1 = prior1 * bf10 / (prior1 * bf10 + 1 - prior1)
print(f"先验 P(H1)={prior1:.1f} → 后验 P(H1|数据)={post1:.3f}")
输出:
t = 2.5,双侧 p = 0.0124,与先验无关的下界 P(H0|x) >= 0.042
1 年:年化 SR 估计 2.50,贝叶斯因子 BF01 = 0.30,P(H0|数据) = 0.229
5 年:年化 SR 估计 1.12,贝叶斯因子 BF01 = 0.18,P(H0|数据) = 0.153
20 年:年化 SR 估计 0.56,贝叶斯因子 BF01 = 0.23,P(H0|数据) = 0.189
100 年:年化 SR 估计 0.25,贝叶斯因子 BF01 = 0.46,P(H0|数据) = 0.313
1000 年:年化 SR 估计 0.08,贝叶斯因子 BF01 = 1.39,P(H0|数据) = 0.582
10000 年:年化 SR 估计 0.03,贝叶斯因子 BF01 = 4.40,P(H0|数据) = 0.815
先验 P(H1)=0.5 → 后验 P(H1|数据)=0.847
先验 P(H1)=0.1 → 后验 P(H1|数据)=0.380
读法:
- p = 0.012 时,即使用对 \(H_1\) 最有利的先验,\(H_0\) 的后验概率也至少有 4.2%;用合理的先验,5 年数据下约 15%,远高于 p 值给人的印象。
- 保持 \(t\) 不变而拉长样本,对应的 Sharpe 越来越小,\(P(H_0\mid\text{数据})\) 先降后升并趋向 1——这就是 Lindley 悖论。"1000 年日频"看似荒唐,但几十万个观测在分钟级、tick 级数据里很常见:用高频数据检验一个微弱效应时,\(t=2.5\) 的说服力远不如它在日频数据里那么强。(前几行的先降后升来自先验尺度 \(b\) 与 \(1/\sqrt n\) 的相对大小。)
- 最后两行把第 10b 章练习 10 的思路形式化:若同类研究中真正有效的策略只占 10%,那么一个 5 年回测 \(t=2.5\) 的策略真实有效的后验概率只有 38%。先验概率(研究的"基率")与 p 值同样重要。
11.10.3 Black–Litterman:多元 Normal–Normal 共轭
Black–Litterman 模型以市场均衡隐含收益 \(\pi=\delta\Sigma w_{\text{mkt}}\) 为先验均值、\(\tau\Sigma\) 为先验协方差,把投资者观点 \(P\mu=q+\varepsilon\)(\(\varepsilon\sim N(0,\Omega)\))当作"数据",用例 11.2 的"精度相加、均值按精度加权"得到后验:
import numpy as np
# Black–Litterman = 多元正态-正态共轭(原书例 11.2 的多元版)
vol = np.array([0.20, 0.18, 0.25]) # 三类资产年化波动
corr = np.array([[1, .6, .4], [.6, 1, .5], [.4, .5, 1]])
Sigma = np.outer(vol, vol) * corr
w_mkt = np.array([0.5, 0.3, 0.2]) # 市场权重
delta, tau = 2.5, 0.05 # 风险厌恶系数、先验不确定性缩放
pi = delta * Sigma @ w_mkt # 先验均值:均衡隐含收益
# 观点("数据"):资产 1 比资产 2 每年多赚 3%,观点的不确定性 Omega
P = np.array([[1, -1, 0]]); q = np.array([0.03])
Omega = np.array([[P[0] @ (tau * Sigma) @ P[0]]]) # 常见取法:与先验同等可信
prec_prior = np.linalg.inv(tau * Sigma) # 先验精度
prec_view = P.T @ np.linalg.inv(Omega) @ P # 观点精度
M = np.linalg.inv(prec_prior + prec_view) # 后验协方差:精度相加再求逆
mu_bl = M @ (prec_prior @ pi + P.T @ np.linalg.inv(Omega) @ q) # 后验均值:按精度加权
w_bl = np.linalg.solve(delta * Sigma, mu_bl) # 均值-方差最优权重(无约束)
np.set_printoptions(precision=4, suppress=True)
print("先验均衡收益 pi :", pi)
print("后验收益 mu_BL :", mu_bl)
print("观点组合 P@pi -> P@mu_BL:", (P @ pi).round(4), "->", (P @ mu_bl).round(4), "(观点为 0.03)")
print("市场权重 :", w_mkt)
print("BL 最优权重 :", w_bl)
输出:
先验均衡收益 pi : [0.0762 0.0625 0.0731]
后验收益 mu_BL : [0.0814 0.0595 0.0724]
观点组合 P@pi -> P@mu_BL: [0.0137] -> [0.0218] (观点为 0.03)
市场权重 : [0.5 0.3 0.2]
BL 最优权重 : [0.612 0.188 0.2 ]
读法:先验认为资产 1 比资产 2 多赚 1.37%,观点说 3%,二者精度相同,后验正好落在中间 2.18%(\(=(1.37\%+3\%)/2\))——与一维 Normal–Normal 的 \(w=1/2\) 完全一样。由于资产相关,资产 1、2 的收益同时被调整;最优权重只在观点涉及的两个资产间转移,资产 3 保持市场权重。这是 BL 相对"直接把观点塞进优化器"的最大优点:结果稳健、可解释、偏离基准有度。
11.10.4 其他应用速记
- 基金经理 / 策略 alpha 的收缩:几百个经理的 alpha 估计向 0 或同类均值收缩,收缩强度由"真实 alpha 的离散度"与"估计误差"之比决定(经验贝叶斯,即用数据估计先验参数);第 12 章的 James–Stein 估计给出频率学派的理由。
- 贝叶斯在线更新:Normal–Normal 共轭可以逐日递推更新策略 alpha 的后验,这就是 Kalman 滤波的最简形式;时变 Beta、动态对冲比率都可以这样估计(第 06 册状态空间模型)。
- 模型平均:对多个候选模型按后验概率加权预测,比"选一个最好的模型"更能抵御过拟合。
本章小结
贝叶斯推断把参数当作随机变量,用"后验 ∝ 似然 × 先验"更新信念。共轭先验让后验有闭式解,且后验均值是 MLE 与先验均值按精度的加权平均——这种"收缩"是量化中最有用的思想之一(Vasicek Beta、Bayes–Stein 收益估计、Black–Litterman)。对参数函数和多参数边缘,直接从后验抽样再变换即可。大样本、低维时后验近似 \(N(\hat\theta,\widehat{\text{se}}^2)\),贝叶斯与频率区间几乎相同;分歧出现在先验选择(平坦先验不具变换不变性,Jeffreys 先验 \(\propto\sqrt{I(\theta)}\) 具有)、检验问题(对先验敏感、不能用非正常先验、Lindley 悖论表明 p 值夸大证据)和高维问题(贝叶斯是似然的奴隶,Horvitz–Thompson 这类用到设计信息的估计无法从似然导出)。两种方法回答不同的问题:要结合先验信念,用贝叶斯;要长期表现保证,用频率方法。
| 概念 | 公式 / 结论 |
|---|---|
| 贝叶斯定理 | \(f(\theta\mid x^n)=\mathcal L_n(\theta)f(\theta)/\int\mathcal L_nf\) |
| Beta–Bernoulli | 先验 Beta\((\alpha,\beta)\) → 后验 Beta\((\alpha+s,\beta+n-s)\) |
| 后验均值(Beta) | \(\frac{n}{\alpha+\beta+n}\hat p+\frac{\alpha+\beta}{\alpha+\beta+n}\frac{\alpha}{\alpha+\beta}\) |
| Normal–Normal | \(\frac1{\tau^2}=\frac1{\text{se}^2}+\frac1{b^2}\),\(\bar\theta=w\bar X+(1-w)a\),\(w=\frac{1/\text{se}^2}{1/\text{se}^2+1/b^2}\) |
| Gamma–Poisson | 先验 Gamma(形状 \(\alpha\), 率 \(\beta\)) → 后验 Gamma\((\alpha+\sum x_i,\ \beta+n)\)(此处 \(\beta\) 为率参数,与原书分布表及附录 A1 的尺度参数约定相反) |
| 后验区间 | 后验的 \(\alpha/2\) 与 \(1-\alpha/2\) 分位数 |
| 大样本 | \(\theta\mid X^n\approx N(\hat\theta,1/(nI(\hat\theta)))\) |
| Jeffreys 先验 | \(f(\theta)\propto\sqrt{I(\theta)}\);Bernoulli 为 Beta(1/2,1/2) |
| 贝叶斯检验 | \(\mathbb P(H_0\mid x)=\frac{\mathcal L(\theta_0)}{\mathcal L(\theta_0)+\int\mathcal L f}\) |
| 下界 | \(\mathbb P(H_0\mid x)\ge\frac{\mathcal L(\theta_0)}{\mathcal L(\theta_0)+\mathcal L(\hat\theta)}\);正态时 \(1/(1+e^{w^2/2})\) |
| Lindley | \(BF_{01}=\sqrt{1+nb^2}\exp\{-\frac{w^2}2\frac{nb^2}{1+nb^2}\}\to\infty\) |
| Horvitz–Thompson | \(\hat\psi=\frac1n\sum R_iY_i/\xi_{X_i}\) |
| Black–Litterman | \(\mu_{BL}=[(\tau\Sigma)^{-1}+P^T\Omega^{-1}P]^{-1}[(\tau\Sigma)^{-1}\pi+P^T\Omega^{-1}q]\) |
练习
基础
- 验证 Normal–Normal 共轭公式 (11.7)。(原书习题 1;提示:对数后验配方。)
- Bernoulli 数据 0101000000(\(n=10\),\(s=2\))。分别在 Beta(1/2,1/2)、Beta(1,1)、Beta(10,10)、Beta(100,100) 先验下写出后验与后验均值,说明先验强度的影响。(原书习题 5。答案:后验均值依次为 2.5/11≈0.227、3/12=0.25、12/30=0.40、102/210≈0.486。)
- \(X_i\sim\text{Poisson}(\lambda)\),先验 \(\lambda\sim\text{Gamma}(\alpha,\beta)\)(\(\beta\) 为率参数)。求后验与后验均值,并写成 MLE 与先验均值的加权平均;再求 Jeffreys 先验及其后验。(原书习题 6。答案:后验 Gamma\((\alpha+\sum x_i,\beta+n)\),均值 \(\frac{n}{\beta+n}\bar x+\frac{\beta}{\beta+n}\frac\alpha\beta\);\(I(\lambda)=1/\lambda\),Jeffreys 先验 \(\propto\lambda^{-1/2}\),后验 Gamma\((\sum x_i+1/2,\ n)\)。)
- 某券商每天的大额撤单次数服从 Poisson,历史经验均值约 4 次/天,取先验 Gamma(8, 2)。新系统上线后 5 天共观测到 31 次。求后验均值与 90% 后验区间(可用
scipy.stats.gamma,注意它用尺度参数,需写gamma(a=39, scale=1/7))。(提示:后验 Gamma(39, 7),均值约 5.57。) - 证明 Jeffreys 先验的不变性:若 \(\psi=g(\theta)\) 单调可微,则 \(\sqrt{I_\psi(\psi)}=\sqrt{I_\theta(\theta)}\,|d\theta/d\psi|\)。
进阶
- 推导 11.8.3 节的贝叶斯因子公式,并证明固定 \(w\) 时 \(n\to\infty\) 有 \(\mathbb P(H_0\mid x)\to1\);再证明固定 \(n\) 时 \(b\to\infty\) 也有 \(\mathbb P(H_0\mid x)\to1\),解释为什么检验中不能用"很平"的先验。(原书习题 8。)
- 原书习题 4:安慰剂 50 人中 30 人改善,治疗组 50 人中 40 人改善,\(\tau=p_2-p_1\)。(a) MLE 与 Delta 方法 90% 区间;(b) 参数 Bootstrap;(c) 平坦先验下模拟求后验均值与 90% 后验区间;(d)(e) 对对数比值比重复。比较三种方法。
- 验证 Horvitz–Thompson 估计量无偏且 \(\mathbb V(\hat\psi)\le1/(n\delta^2)\)。(原书习题 7;提示:\(\mathbb E[R_iY_i/\xi_{X_i}\mid X_i=j]=\theta_j\),且 \(R_iY_i/\xi_{X_i}\le1/\delta\)。)
- 修改 11.10.3 节代码:把观点不确定性 \(\Omega\) 依次乘以 0.1、1、10,观察 \(P\mu_{BL}\) 如何在 0.0137 与 0.03 之间移动,并用一维 Normal–Normal 公式解释。
- 设 200 个基金经理的年化 alpha 估计 \(\hat\alpha_i\sim N(\alpha_i,s^2)\),\(s=4\%\),真实 \(\alpha_i\sim N(0,\tau^2)\)。给出 \(\tau\) 的矩估计(\(\widehat{\tau^2}=\max(0,\overline{\hat\alpha^2}-s^2)\)),写出每个经理 alpha 的后验均值,并用模拟比较其总均方误差与直接用 \(\hat\alpha_i\) 的差别。(这与第 12 章 James–Stein 估计相呼应。)
原书推荐习题:第 11 章 4(频率、Bootstrap、贝叶斯三法对比,必做)、8(Jeffreys–Lindley 悖论)、5(先验强度的影响)、1、6(共轭先验推导)、2(后验模拟与参数变换)。
原书对照
| 本章内容 | 原书章节 | PDF 页码 |
|---|---|---|
| 频率学派与贝叶斯学派的公设 | 11.1 | p.186–187 |
| 贝叶斯方法、Beta–Bernoulli、Normal–Normal、共轭 | 11.2 | p.187–190 |
| 参数的函数 | 11.3 | p.191 |
| 模拟 | 11.4 | p.191–192 |
| 大样本性质、贝叶斯 Delta 方法 | 11.5 | p.192 |
| 平坦、非正常、Jeffreys 先验 | 11.6 | p.192–194 |
| 多参数问题、两比例比较 | 11.7 | p.194–195 |
| 贝叶斯检验 | 11.8 | p.195–196 |
| 优缺点、Robins–Ritov 例、归一化常数例 | 11.9 | p.196–200 |
| 文献注 | 11.10 | p.200–201 |
| 定理 11.5 证明 | 11.11 附录 | p.201 |
| 习题 | 11.12 | p.201–203 |
(PDF 页码 = 原书正文页码 + 17。)