量化交易中文教材

第 11 章 贝叶斯推断

本章对应 Wasserman 原书第 11 章。前几章的方法属于频率学派:参数是固定未知常数,我们评价的是程序的长期表现(95% 的置信区间在重复抽样中 95% 的时候套住真值)。贝叶斯学派换了一个出发点:把对参数的不确定性也用概率描述,用数据去更新它。Wasserman 本人是频率学派立场,他对贝叶斯方法的介绍既讲清了"怎么做",也毫不客气地指出了它在高维问题中的失败。读完本章,你应能在两种语言之间切换,并知道各自回答的是什么问题。

学习目标

  1. 说清频率学派(F1–F3)与贝叶斯学派(B1–B3)的基本公设差异。
  2. 熟练运用"后验 ∝ 似然 × 先验",会用共轭先验(Beta–Bernoulli、Normal–Normal、Gamma–Poisson)得到闭式后验,并把后验均值解读为 MLE 与先验均值的加权平均(收缩)。
  3. 会用模拟(后验抽样再变换)求参数函数和多参数问题的边缘后验。
  4. 理解大样本下贝叶斯与频率推断近似一致(定理 11.5),以及先验选择的几种方案:主观先验、平坦先验、非正常先验、Jeffreys 先验。
  5. 会做简单的贝叶斯检验,理解它为何对先验敏感,能复述并计算 Jeffreys–Lindley 悖论。
  6. 认识贝叶斯方法在高维问题中的局限(Robins–Ritov 例、归一化常数例),并能把贝叶斯工具用于策略评估、A/B 测试和 Black–Litterman 组合构建。

读前导读

这一章在解决什么问题

一句话:看到数据之前你已经有看法,看到数据之后看法该怎么改? 贝叶斯推断给出的答案是一个机械的公式:新看法 ∝ 数据对各种可能的支持程度 × 旧看法。

这件事你在 CFA 里其实已经做过。CFA 一级的贝叶斯公式(用新信息更新某事件的概率,比如"盈利超预期时公司属于优质公司的概率")就是本章的离散版本。本章把"事件"换成"连续取值的参数"(胜率 \(p\)、均值 \(\theta\)、Sharpe 比率),把概率表换成概率密度,于是求和变成积分。你在 CFA 三级见过的 Black–Litterman 模型,本质上就是本章例 11.2 的多元版本:均衡收益是先验,主观观点是数据,后验收益是两者按"可信度"加权的结果。

本章的第二条主线是和前几章频率学派方法(置信区间、p 值)的比较。结论分三层:样本大、参数少时两派答案几乎一样;做假设检验时两派可以差得很远(p = 0.05 并不意味着原假设只有 5% 的可能为真);参数极多时贝叶斯方法可能彻底失灵。对量化研究最直接的收获是两条:小样本下用先验"刹车",以及不要把显著的 p 值当成策略有效的概率。

需要先想起来的数学

1. 条件密度与贝叶斯公式。 离散版 \(P(A\mid B)=P(B\mid A)P(A)/P(B)\);连续版把 \(P\) 换成密度 \(f\),分母的"对所有可能情况求和"换成"对 \(\theta\) 积分"。分母只是让总概率等于 1 的常数,所以经常先不管它,最后再补。小例子:两个假设先验各 0.5,数据在 A 下出现的概率 0.2、在 B 下 0.6,后验 A 的概率 \(=0.1/(0.1+0.3)=0.25\)。参见 第 00 册第 07 章 概率中的分析工具。

2. 定积分与"密度下的面积"。 \(\int f(\theta)d\theta\) 就是密度曲线下的总面积,等于 1;\(\int\theta f(\theta)d\theta\) 是均值(按密度加权平均)。本章大部分积分不需要真去算,因为可以"认出"分布族。参见 第 00 册第 03 章 积分。

3. 配方。 \(-\frac12A\theta^2+B\theta=-\frac A2(\theta-B/A)^2+\text{常数}\)。只要对数密度是 \(\theta\) 的开口向下的二次函数,它就是正态分布,均值 \(B/A\)、方差 \(1/A\)。例:\(-\theta^2+4\theta\) 中 \(A=2,B=4\),对应 \(N(2,\,1/2)\)。这是例 11.2 和定理 11.5 的核心技巧。

4. 导数与二阶泰勒展开。 \(\ell(\theta)\approx\ell(\hat\theta)+\ell'(\hat\theta)(\theta-\hat\theta)+\frac12\ell''(\hat\theta)(\theta-\hat\theta)^2\)。和久期–凸性近似债券价格是同一个公式:一阶项是久期,二阶项是凸性。在最大值点一阶导为 0,只剩二阶项。参见 第 00 册第 02 章 导数与泰勒展开。

5. 变量变换。 若 \(\psi=g(p)\) 单调,密度满足 \(f_\psi(\psi)=f_p(p)\,|dp/d\psi|\),即"概率质量守恒,区间被拉伸时密度变小"。这是 11.6 节"平坦先验不是真的平坦"和 Jeffreys 先验的基础。

另外两个符号:\(\Gamma(\cdot)\) 是 Gamma 函数,对正整数 \(\Gamma(k)=(k-1)!\),在 Beta 密度里只起归一化作用;\(\propto\) 读作"正比于",即两边只差一个与 \(\theta\) 无关的常数倍。Fisher 信息 \(I(\theta)\) 和 MLE 的标准误 \(\text{se}=1/\sqrt{nI}\) 在第 09 章讲过。

怎么读这一章

核心必读:11.2(三步走和两个共轭例子,尤其"精度相加、均值按精度加权")、11.4(模拟)、11.8(贝叶斯检验与 Lindley 悖论)、11.10.1–11.10.3 的量化实战。11.5 的定理先看结论"大样本下两派殊途同归",推导可第二遍再看。11.3 的解析推导可以跳过,直接看 11.4 的模拟替代方案。11.6 的 Jeffreys 先验和 11.9.2 的两个反例偏理论,第一次读只需记住结论:平坦先验依赖参数化;贝叶斯方法完全依赖似然函数,似然丢掉的信息它也用不上。


11.1 两种哲学

频率学派(frequentist)的公设:

  • F1 概率是极限相对频率,是现实世界的客观性质。
  • F2 参数是固定的未知常数。它们不波动,所以不能对参数作有意义的概率陈述。
  • F3 统计程序应当有定义明确的长期频率性质,例如 95% 置信区间应当在至少 95% 的重复中套住真参数。

贝叶斯学派(Bayesian)的公设:

  • B1 概率描述信念度(degree of belief),而不是极限频率。因此可以对很多事物作概率陈述,而不仅是受随机变化影响的数据。例如"爱因斯坦在 1948 年 8 月 1 日喝过一杯茶的概率是 0.35"——这不对应任何极限频率,只表达我对该命题相信的程度。
  • B2 即使参数是固定常数,也可以对它作概率陈述。
  • B3 对参数 \(\theta\) 的推断通过给出 \(\theta\) 的概率分布来完成;点估计、区间估计都从这个分布中提取。

贝叶斯推断有争议,因为它天然接纳主观概率,而且一般不保证长期表现。Wasserman 的态度是:统计学界更重视频率方法,但贝叶斯方法确有一席之地,机器学习界很多人热衷于它。先放下哲学,学会怎么做,章末再评价优劣。

量化读法:交易员天然是"贝叶斯"的——"我认为这个策略有效的可能性大概六成"这类话每天都在说。问题在于先验从哪来、是否被数据充分修正。本章给出把这种直觉形式化的工具,也给出它失灵的边界。


11.2 贝叶斯方法

11.2.1 三步走

  1. 选择先验分布(prior distribution)\(f(\theta)\),表达看到数据之前对参数的信念;
  2. 选择统计模型 \(f(x\mid\theta)\)(现在写成条件密度而不是 \(f(x;\theta)\),因为 \(\theta\) 被当作随机变量);
  3. 观测数据后,计算后验分布(posterior distribution)\(f(\theta\mid X_1,\dots,X_n)\)。

第 3 步就是贝叶斯定理。连续情形单个观测:

\[f(\theta\mid x)=\frac{f(x\mid\theta)f(\theta)}{\int f(x\mid\theta)f(\theta)d\theta}.\]
\(n\) 个 IID 观测时,\(f(x^n\mid\theta)=\prod f(x_i\mid\theta)=\mathcal L_n(\theta)\),于是
\[f(\theta\mid x^n)=\frac{\mathcal L_n(\theta)f(\theta)}{c_n}\propto\mathcal L_n(\theta)f(\theta),\qquad c_n=\int\mathcal L_n(\theta)f(\theta)d\theta.\]
\(c_n\) 称为归一化常数(normalizing constant),不依赖 \(\theta\)。整章最重要的一句话:

\[\boxed{\text{后验}\ \propto\ \text{似然}\ \times\ \text{先验}}\]

计算时可以先丢掉 \(c_n\),最后再归一化——很多时候只要认出后验属于哪个分布族,常数就自动确定了。

白话解释:公式里三样东西各有分工。似然 \(\mathcal L_n(\theta)\) 回答"如果参数是 \(\theta\),看到这批数据的可能性有多大";先验 \(f(\theta)\) 回答"看数据之前我觉得 \(\theta\) 有多可信";两者相乘,就是对每个候选 \(\theta\) 打的综合分。\(c_n\) 是把所有候选的分加起来(积分),作用只是把分数换算成总和为 1 的概率。 一个离散小例子:候选胜率只有 0.4、0.5、0.6 三种,先验各 1/3,观测 3 笔赢 2 笔。似然分别是 \(3\times0.4^2\times0.6=0.288\)、\(0.375\)、\(0.432\),乘先验后归一化,后验约为 0.26、0.34、0.40。数据把信念往 0.6 推了一点,但只有 3 笔,推得不多。

11.2.2 从后验中提取结论

  • 点估计:后验均值 \(\bar\theta_n=\int\theta f(\theta\mid x^n)d\theta=\dfrac{\int\theta\mathcal L_n(\theta)f(\theta)d\theta}{\int\mathcal L_n(\theta)f(\theta)d\theta}\),或后验众数、后验中位数(第 12 章会说明它们分别对应哪种损失函数)。
  • 区间估计:找 \(a,b\) 使两侧尾部后验概率各为 \(\alpha/2\),则 \(C=(a,b)\) 满足 \(\mathbb P(\theta\in C\mid x^n)=1-\alpha\),称为 \(1-\alpha\) 后验区间(posterior interval,也常称可信区间 credible interval)。

注意措辞的差别:后验区间可以说"给定数据,参数落在 \(C\) 中的概率是 95%";频率学派的置信区间只能说"这个程序在重复抽样中 95% 的时候套住参数"。

11.2.3 例 11.1:Bernoulli + Beta 先验

\(X_i\sim\text{Bernoulli}(p)\),先验 \(f(p)=1\)(均匀)。记 \(s=\sum x_i\),

\[f(p\mid x^n)\propto p^s(1-p)^{n-s}=p^{(s+1)-1}(1-p)^{(n-s+1)-1}.\]
对照 Beta\((\alpha,\beta)\) 密度 \(\frac{\Gamma(\alpha+\beta)}{\Gamma(\alpha)\Gamma(\beta)}p^{\alpha-1}(1-p)^{\beta-1}\),立刻认出
\[p\mid x^n\sim\text{Beta}(s+1,\ n-s+1).\]
我们没有真去积分就得到了归一化常数。后验均值
\[\bar p=\frac{s+1}{n+2}=\lambda_n\hat p+(1-\lambda_n)\tilde p,\qquad\hat p=\frac sn,\ \tilde p=\frac12,\ \lambda_n=\frac{n}{n+2}.\]
后验均值是 MLE 与先验均值的加权平均,样本越大越接近 MLE。

更一般地取先验 \(p\sim\text{Beta}(\alpha,\beta)\),后验为 \(\text{Beta}(\alpha+s,\ \beta+n-s)\),

\[\bar p=\frac{\alpha+s}{\alpha+\beta+n}=\frac{n}{\alpha+\beta+n}\hat p+\frac{\alpha+\beta}{\alpha+\beta+n}p_0,\qquad p_0=\frac{\alpha}{\alpha+\beta}.\]
直观解释:Beta\((\alpha,\beta)\) 先验相当于事先看过 \(\alpha+\beta\) 个"伪观测",其中 \(\alpha\) 次成功。

共轭先验(conjugate prior):先验和后验属于同一分布族。Beta 是 Bernoulli / 二项模型的共轭先验。

量化读法:一个新信号实盘 20 笔交易赢了 15 笔,MLE 胜率 75%。若根据同类信号的经验取先验 Beta(26,24)(相当于 50 笔、均值 52%),后验均值为 \((26+15)/(50+20)=58.6\%\)。小样本时先验起"刹车"作用,防止被几笔运气好的交易冲昏头脑。

11.2.4 例 11.2:Normal–Normal 共轭

\(X_i\sim N(\theta,\sigma^2)\),\(\sigma\) 已知,先验 \(\theta\sim N(a,b^2)\)。后验(原书习题 1 要求验证)为 \(\theta\mid X^n\sim N(\bar\theta,\tau^2)\),

\[\bar\theta=w\bar X+(1-w)a,\qquad w=\frac{1/\text{se}^2}{1/\text{se}^2+1/b^2},\qquad\frac1{\tau^2}=\frac1{\text{se}^2}+\frac1{b^2},\]
其中 \(\text{se}=\sigma/\sqrt n\)。

推导要点。 对数后验是 \(\theta\) 的二次函数:

\[-\frac{n(\bar X-\theta)^2}{2\sigma^2}-\frac{(\theta-a)^2}{2b^2}+\text{常数}=-\frac12\Big(\frac1{\text{se}^2}+\frac1{b^2}\Big)\theta^2+\Big(\frac{\bar X}{\text{se}^2}+\frac a{b^2}\Big)\theta+\text{常数},\]
配方即得。口诀:精度(方差的倒数)相加,均值按精度加权。

推导拆解: 第一步,写似然。\(n\) 个正态观测的对数似然是 \(-\sum(X_i-\theta)^2/(2\sigma^2)\)。利用 \(\sum(X_i-\theta)^2=\sum(X_i-\bar X)^2+n(\bar X-\theta)^2\)(交叉项 \(2(\bar X-\theta)\sum(X_i-\bar X)=0\)),第一部分与 \(\theta\) 无关,归入常数,剩下 \(-n(\bar X-\theta)^2/(2\sigma^2)=-(\bar X-\theta)^2/(2\,\text{se}^2)\)。 第二步,写先验的对数:\(-(\theta-a)^2/(2b^2)\)。两项相加就是上式左边。 第三步,展开平方,只保留含 \(\theta\) 的项:\(\theta^2\) 的系数是 \(-\frac12(1/\text{se}^2+1/b^2)\),\(\theta\) 的系数是 \(\bar X/\text{se}^2+a/b^2\)。 第四步,套配方公式(导读第 3 项):\(A=1/\text{se}^2+1/b^2\),\(B=\bar X/\text{se}^2+a/b^2\)。后验方差 \(\tau^2=1/A\),即 \(1/\tau^2=1/\text{se}^2+1/b^2\);后验均值 \(B/A=\dfrac{(1/\text{se}^2)\bar X+(1/b^2)a}{1/\text{se}^2+1/b^2}\),这正是 \(w\bar X+(1-w)a\)。

金融直觉:这和最小方差组合的权重是同一个逻辑。两个对 \(\theta\) 的独立"估计":数据给的 \(\bar X\)(方差 \(\text{se}^2\)),先验给的 \(a\)(方差 \(b^2\))。把它们组合成一个估计、让方差最小,最优权重就与各自方差成反比。合并后的精度等于两个精度之和,相当于两份独立信息的"信息量"直接相加。例:分析师预测 EPS 为 2.0(标准差 0.2,精度 25),模型预测 2.4(标准差 0.4,精度 6.25),合并后为 \((25\times2.0+6.25\times2.4)/31.25=2.08\),标准差 \(1/\sqrt{31.25}\approx0.18\),比两者都小。

两个极限:\(n\to\infty\) 时 \(w\to1\)、\(\tau/\text{se}\to1\);\(n\) 固定而 \(b\to\infty\)(先验变平)时也一样。此时后验近似 \(N(\hat\theta,\text{se}^2)\),95% 后验区间 \(\bar\theta\pm1.96\tau\approx\hat\theta\pm1.96\,\text{se}\),与频率学派置信区间重合。

这个"按精度加权"的公式是量化中收缩估计的原型:个股 Beta 向 1 收缩(Vasicek 调整)、个股期望收益向截面均值收缩、基金经理 alpha 向 0 收缩,以及下面要讲的 Black–Litterman 模型,都是它的变体。


11.3 参数的函数

要推断 \(\tau=g(\theta)\),思路和第 02 册求 \(Y=g(X)\) 的分布一样:

\[H(\tau\mid x^n)=\mathbb P(g(\theta)\le\tau\mid x^n)=\int_{\{\theta:g(\theta)\le\tau\}}f(\theta\mid x^n)d\theta,\qquad h(\tau\mid x^n)=H'(\tau\mid x^n).\]

例 11.3。 Bernoulli + 均匀先验,\(\psi=\log\frac p{1-p}\)。\(p\le\frac{e^\psi}{1+e^\psi}\) 等价于 \(\psi\) 不超过某值,求导得

\[h(\psi\mid x^n)=\frac{\Gamma(n+2)}{\Gamma(s+1)\Gamma(n-s+1)}\Big(\frac{e^\psi}{1+e^\psi}\Big)^s\Big(\frac{1}{1+e^\psi}\Big)^{n-s}\frac{e^\psi}{(1+e^\psi)^2}.\]

解析推导很快就变得繁琐,下一节的模拟方法几乎总是更好的选择。


11.4 用模拟代替积分

如果能从后验抽样 \(\theta_1,\dots,\theta_B\sim f(\theta\mid x^n)\),那么:

  • 直方图近似后验密度;
  • 后验均值 \(\approx\frac1B\sum\theta_j\);
  • \(1-\alpha\) 后验区间 \(\approx\) 样本的 \(\alpha/2\) 与 \(1-\alpha/2\) 分位数;
  • 参数函数:令 \(\tau_j=g(\theta_j)\),则 \(\tau_1,\dots,\tau_B\) 就是 \(f(\tau\mid x^n)\) 的样本——不需要任何微积分。

例 11.4。 续例 11.3:抽 \(P_j\sim\text{Beta}(s+1,n-s+1)\),令 \(\psi_j=\log\frac{P_j}{1-P_j}\),\(\psi_j\) 的直方图就是 \(h(\psi\mid x^n)\) 的估计。

共轭模型可以直接抽样;一般模型的后验抽样需要马尔可夫链蒙特卡罗(MCMC)等方法,见原书第 24 章(本册第 24b 章)。

量化读法:这就是"考虑参数不确定性的组合优化"的标准做法——从期望收益与协方差的后验中抽样,对每组抽样求最优权重或计算风险指标,再汇总。它比"把点估计当真值代入优化器"稳健得多。


11.5 大样本性质

定理 11.5(Bernstein–von Mises 型结论)。 设 \(\hat\theta_n\) 为 MLE,\(\widehat{\text{se}}=1/\sqrt{nI(\hat\theta_n)}\)。在正则条件下,后验近似为 \(N(\hat\theta_n,\widehat{\text{se}}^2)\),因此后验均值 \(\bar\theta_n\approx\hat\theta_n\)。并且频率学派的渐近置信区间 \(C_n=\hat\theta_n\pm z_{\alpha/2}\widehat{\text{se}}\) 同时也是近似的 \(1-\alpha\) 后验区间:\(\mathbb P(\theta\in C_n\mid X^n)\to1-\alpha\)。

证明思路(原书附录)。 \(n\) 增大时先验的影响相对减弱,\(\log f(\theta\mid x^n)\approx\ell(\theta)+\text{常数}\)。在 \(\hat\theta\) 处展开,一阶项因 \(\ell'(\hat\theta)=0\) 消失:

\[\ell(\theta)\approx\ell(\hat\theta)+\frac{(\theta-\hat\theta)^2}{2}\ell''(\hat\theta).\]
取指数,后验 \(\propto\exp\{-\frac{(\theta-\hat\theta)^2}{2\sigma_n^2}\}\),\(\sigma_n^2=-1/\ell''(\hat\theta)\)。而 \(-\ell''(\hat\theta)=\sum_i-\ell_i''(\hat\theta)\approx nI(\hat\theta)\),故 \(\sigma_n\approx\widehat{\text{se}}\)。

推导拆解:

  1. 为什么先验"影响减弱":\(\log f(\theta\mid x^n)=\ell(\theta)+\log f(\theta)-\log c_n\)。对数似然 \(\ell=\sum_i\ell_i\) 是 \(n\) 项之和,随 \(n\) 线性增长;\(\log f(\theta)\) 不随 \(n\) 变。\(n\) 大时前者主导。
  2. 为什么一阶项消失:\(\hat\theta\) 是 MLE,是 \(\ell\) 的最大值点,导数为 0。这和"在收益率曲线的极值点上,价格对收益率的一阶敏感度为零"是同一类事实。
  3. 为什么 \(\ell''(\hat\theta)<0\):最大值点处曲线向下弯。所以 \(\frac12\ell''(\hat\theta)(\theta-\hat\theta)^2\) 可以写成 \(-\frac{(\theta-\hat\theta)^2}{2\sigma_n^2}\),取指数后正是正态密度的形状。
  4. 为什么 \(-\ell''\approx nI\):\(-\ell''(\hat\theta)=\sum_i[-\ell_i''(\hat\theta)]\) 是 \(n\) 个同分布量之和,由大数定律约等于 \(n\) 乘以它的期望,而 Fisher 信息的定义之一正是 \(I(\theta)=\mathbb E[-\ell_i''(\theta)]\)。 直观含义:对数似然在峰值附近越"尖"(曲率越大),参数估计越精确。这与凸性越大价格对收益率越敏感同理。

贝叶斯 Delta 方法。 \(\tau=g(\theta)\) 的后验近似 \(N(g(\hat\theta),\ \widehat{\text{se}}^2g'(\hat\theta)^2)\),与频率版 Delta 方法一致。

结论:参数少、样本大时,两种方法在估计问题上殊途同归。 分歧出现在小样本、高维、以及检验问题中。


11.6 先验从哪里来

11.6.1 主观先验

主观主义(subjectivism)认为先验应反映收集数据前对 \(\theta\) 的真实看法。少数参数、有可靠经验时可行;但在复杂的多参数问题中不现实,而且把主观意见注入分析违背了科学推断尽量客观的目标。

11.6.2 平坦先验与非正常先验

"无信息先验"(noninformative prior)的最朴素候选是平坦先验 \(f(\theta)\propto\) 常数。

非正常先验(improper prior)。\(X\sim N(\theta,\sigma^2)\) 中取 \(f(\theta)\propto c\),\(\int f=\infty\),它不是概率密度。但形式地套用贝叶斯定理,\(f(\theta\mid x^n)\propto\mathcal L_n(\theta)\),得 \(\theta\mid X^n\sim N(\bar X,\sigma^2/n)\),与频率学派结果完全相同。只要后验是正常的概率分布,用非正常先验就没问题。

平坦先验不具有变换不变性。 Bernoulli 中用 \(f(p)=1\) 表示"对 \(p\) 一无所知"。但令 \(\psi=\log\frac p{1-p}\),由变量变换,\(\psi\) 的先验密度是 \(\frac{e^\psi}{(1+e^\psi)^2}\),并不平坦。如果对 \(p\) 一无所知,对 \(\psi\) 也应该一无所知——矛盾。"平坦"这个概念依赖参数化方式,所以没有良好定义。

11.6.3 Jeffreys 先验

取

\[f(\theta)\propto I(\theta)^{1/2},\]
\(I(\theta)\) 为 Fisher 信息。它在重新参数化下保持不变:对 \(\psi=g(\theta)\),\(I_\psi(\psi)=I_\theta(\theta)\,(d\theta/d\psi)^2\),于是 \(\sqrt{I_\psi}\,d\psi=\sqrt{I_\theta}\,d\theta\),用哪种参数化得到的都是同一个先验。

推导拆解:

  1. \(I_\psi=I_\theta(d\theta/d\psi)^2\) 从哪来:Fisher 信息是得分函数(对数似然的一阶导)的方差。由链式法则 \(\frac{\partial\ell}{\partial\psi}=\frac{\partial\ell}{\partial\theta}\cdot\frac{d\theta}{d\psi}\),\(d\theta/d\psi\) 是常数倍,方差要乘它的平方。
  2. 两边开根号:\(\sqrt{I_\psi}=\sqrt{I_\theta}\,|d\theta/d\psi|\)。
  3. 对照导读第 5 项的变量变换公式:若在 \(\theta\) 上取密度 \(\sqrt{I_\theta}\),换到 \(\psi\) 上密度应是 \(\sqrt{I_\theta}\,|d\theta/d\psi|\),恰好等于 \(\sqrt{I_\psi}\)。所以"先在 \(\theta\) 上取 Jeffreys 再变换"和"直接在 \(\psi\) 上取 Jeffreys"是同一个分布。平坦先验做不到这一点,因为变换会额外乘上 \(|d\theta/d\psi|\)。

例 11.6。 Bernoulli 中 \(I(p)=\frac1{p(1-p)}\),Jeffreys 先验 \(\propto p^{-1/2}(1-p)^{-1/2}\),即 Beta(1/2,1/2),与均匀分布差别不大。多参数时 \(f(\theta)\propto\sqrt{\det I(\theta)}\)。

量化读法:参数化问题在实践中很真实。对波动率 \(\sigma\)、方差 \(\sigma^2\)、对数波动率 \(\log\sigma\) 分别取"平坦"先验,会得到不同的后验;正态模型中 \(\sigma\) 的 Jeffreys 先验是 \(f(\sigma)\propto1/\sigma\),等价于对 \(\log\sigma\) 平坦。


11.7 多参数问题

\(\theta=(\theta_1,\dots,\theta_p)\) 时后验仍为 \(f(\theta\mid x^n)\propto\mathcal L_n(\theta)f(\theta)\)。推断单个参数需要边缘后验

\[f(\theta_1\mid x^n)=\int\cdots\int f(\theta_1,\dots,\theta_p\mid x^n)\,d\theta_2\cdots d\theta_p.\]
高维积分通常算不出来,但模拟可以完全绕开它:从联合后验抽出向量 \(\theta^1,\dots,\theta^B\),只保留每个向量的第一个分量,就是 \(f(\theta_1\mid x^n)\) 的样本。

例 11.7(比较两个二项比例)。 对照组 \(n_1\) 人中 \(X_1\) 人存活,处理组 \(n_2\) 人中 \(X_2\) 人存活,关心 \(\tau=p_2-p_1\)。取 \(f(p_1,p_2)=1\),后验

\[f(p_1,p_2\mid x_1,x_2)\propto p_1^{x_1}(1-p_1)^{n_1-x_1}\,p_2^{x_2}(1-p_2)^{n_2-x_2}\]
可以分解为两个因子的乘积,所以后验下 \(p_1,p_2\) 独立:\(p_1\mid x_1\sim\text{Beta}(x_1+1,n_1-x_1+1)\),\(p_2\mid x_2\sim\text{Beta}(x_2+1,n_2-x_2+1)\)。分别抽样,\(\tau_b=P_{2,b}-P_{1,b}\) 就是 \(f(\tau\mid x_1,x_2)\) 的样本。量化实战的 A/B 测试就是这个例子。


11.8 贝叶斯检验

11.8.1 基本做法

检验 \(H_0:\theta=\theta_0\) vs \(H_1:\theta\ne\theta_0\)。贝叶斯做法是给假设本身也放先验,常取 \(\mathbb P(H_0)=\mathbb P(H_1)=1/2\),并在 \(H_1\) 下给 \(\theta\) 一个先验密度 \(f(\theta)\)。由贝叶斯定理

\[\mathbb P(H_0\mid x^n)=\frac{f(x^n\mid H_0)\mathbb P(H_0)}{f(x^n\mid H_0)\mathbb P(H_0)+f(x^n\mid H_1)\mathbb P(H_1)}=\frac{\mathcal L(\theta_0)}{\mathcal L(\theta_0)+\int\mathcal L(\theta)f(\theta)d\theta}.\]
比值 \(BF_{01}=\mathcal L(\theta_0)/\int\mathcal L(\theta)f(\theta)d\theta\) 称为贝叶斯因子(Bayes factor),后验几率 = 贝叶斯因子 × 先验几率。

11.8.2 检验对先验敏感

估计问题中先验影响不大,贝叶斯与频率答案相近;检验问题中并非如此。\(H_1\) 下的先验 \(f(\theta)\) 越分散,\(\int\mathcal L(\theta)f(\theta)d\theta\) 越小(先验把质量摊到了数据不支持的区域),\(H_0\) 的后验概率越大。另外,检验中不能用非正常先验:\(f(\theta)\propto c\) 时分母里出现无法确定的常数 \(c\),结论可以任意。

与先验无关的下界。 因为 \(\int\mathcal L(\theta)f(\theta)d\theta\le\mathcal L(\hat\theta)\),

\[\mathbb P(H_0\mid x^n)\ge\frac{\mathcal L(\theta_0)}{\mathcal L(\theta_0)+\mathcal L(\hat\theta)}.\]
对正态均值,\(\mathcal L(\theta_0)/\mathcal L(\hat\theta)=e^{-w^2/2}\)(\(w\) 为 Wald 统计量),下界为 \(1/(1+e^{w^2/2})\)。\(w=1.96\)(p = 0.05)时下界约 0.128;\(w=2.5\)(p ≈ 0.012)时约 0.042。也就是说,无论怎么选先验,p = 0.05 的结果都不能让 \(H_0\) 的后验概率低于约 13%。 p 值系统性地夸大了反对原假设的证据。

推导拆解:

  1. 为什么 \(\int\mathcal L(\theta)f(\theta)d\theta\le\mathcal L(\hat\theta)\):左边是似然按先验加权的平均值,平均值不会超过最大值,而 \(\mathcal L(\hat\theta)\) 正是似然的最大值。等号只在先验把全部质量押在 \(\hat\theta\) 上时成立,这是"事后诸葛亮"式的、对 \(H_1\) 最有利的先验。
  2. 把分母换成更大的数,分式变小,于是得到下界。
  3. 正态情形:\(\mathcal L(\theta)\propto\exp\{-n(\bar x-\theta)^2/(2\sigma^2)\}\),\(\hat\theta=\bar x\) 时指数为 0,\(\theta=\theta_0\) 时指数为 \(-w^2/2\),其中 \(w=(\bar x-\theta_0)/(\sigma/\sqrt n)\)。比值即 \(e^{-w^2/2}\)。代入:\(1/(1+e^{1.96^2/2})=1/(1+6.83)\approx0.128\)。

白话解释:p 值回答的是"如果 \(H_0\) 为真,看到这么极端的数据的概率",即 \(P(\text{数据}\mid H_0)\) 的一种尾部版本;我们真正关心的通常是 \(P(H_0\mid\text{数据})\)。两者的关系就像"优质公司盈利超预期的概率"和"盈利超预期的公司是优质公司的概率",方向反了,中间隔着先验和备择假设下的数据概率。上面的下界说明,即使对 \(H_1\) 最慷慨,这两个数也不会接近。

11.8.3 Jeffreys–Lindley 悖论(原书习题 8)

设 \(\bar X\sim N(\mu,1/n)\),\(H_0:\mu=0\),\(\mathbb P(H_0)=1/2\),\(H_1\) 下 \(\mu\sim N(0,b^2)\)。\(H_1\) 下 \(\bar X\) 的边缘分布为 \(N(0,b^2+1/n)\),于是

\[BF_{01}=\frac{\phi(\bar x;0,1/n)}{\phi(\bar x;0,b^2+1/n)}=\sqrt{1+nb^2}\,\exp\!\Big\{-\frac{w^2}{2}\cdot\frac{nb^2}{1+nb^2}\Big\},\qquad w=\sqrt n\,\bar x.\]

推导拆解:

  1. \(H_1\) 下 \(\bar X\) 的边缘分布:\(\bar X=\mu+(\bar X-\mu)\),其中 \(\mu\sim N(0,b^2)\),抽样误差 \(\bar X-\mu\sim N(0,1/n)\) 且与 \(\mu\) 独立。两个独立正态之和仍是正态,方差相加,得 \(N(0,b^2+1/n)\)。
  2. \(\phi(x;0,v)=\frac1{\sqrt{2\pi v}}e^{-x^2/(2v)}\)。两个密度相除,前面的系数比是 \(\sqrt{(b^2+1/n)/(1/n)}=\sqrt{1+nb^2}\)。
  3. 指数部分:\(-\frac{n\bar x^2}{2}+\frac{\bar x^2}{2(b^2+1/n)}\)。用 \(\bar x^2=w^2/n\) 代入,得 \(-\frac{w^2}{2}\big(1-\frac{1}{1+nb^2}\big)=-\frac{w^2}{2}\cdot\frac{nb^2}{1+nb^2}\)。

固定 Wald 统计量 \(w\)(因而固定 p 值),让 \(n\to\infty\):指数项趋于常数 \(e^{-w^2/2}\),前面的 \(\sqrt{1+nb^2}\to\infty\),所以 \(BF_{01}\to\infty\),\(\mathbb P(H_0\mid x)\to1\)。同一个 p 值,频率学派说"强烈拒绝",贝叶斯学派说"几乎肯定是 \(H_0\)"。

原因在于:样本很大时,固定的 \(w\) 对应的效应 \(\bar x=w/\sqrt n\) 非常小;这么小的效应与"恰好为 0"相当吻合,而与 \(H_1\) 先验所设想的"有一定规模的效应"不吻合。对量化而言,这是一个重要提醒:高频数据样本量巨大,p 值很容易"显著",但对应的效应可能小到没有经济意义,甚至在贝叶斯意义上更支持零假设。 看效应大小,而不仅看 p 值。


11.9 贝叶斯推断的优缺点

11.9.1 优点

有先验信息时,贝叶斯定理是把先验信息与数据结合起来的自然方式。它在心理上也更有吸引力:可以直接说"参数在这个区间里的概率是 95%"。但 Wasserman 提醒,心理吸引力不是选择推断方法的有力科学论据。

例 11.8(例 6.14 再访)。 \(Y_i=\theta+X_i\),\(X_i=\pm1\) 各半。观测到 \(Y_1=15,Y_2=17\)。原书第 6 章构造的 75% 置信集此时为 \(\{16\}\),而此时我们确切知道 \(\theta=16\)。称它为"75% 置信集"让很多人不安,尽管在长期频率意义下它确实是有效的 75% 置信集。贝叶斯解法更令人满意:对整数 \(\theta\) 取任何处处为正的先验,似然只在 \(\theta=16\) 处非零,后验 \(\mathbb P(\theta=16\mid Y)=1\)。

11.9.2 缺点:高维时贝叶斯可能失败

例 11.9(Robins & Ritov 例的简化版)。 设 \(B\) 是一个极大的有限数(如 \(100^{100}\)),任何现实样本量 \(n\ll B\)。未知参数 \(\theta=(\theta_1,\dots,\theta_B)\in[0,1]^B\);已知常数 \(\xi=(\xi_1,\dots,\xi_B)\),\(0<\delta\le\xi_j\le1-\delta\)。数据 \((X_i,R_i,Y_i)\) 这样生成:

  1. \(X_i\) 在 \(\{1,\dots,B\}\) 上均匀抽取;
  2. \(R_i\sim\text{Bernoulli}(\xi_{X_i})\);
  3. 若 \(R_i=1\),抽 \(Y_i\sim\text{Bernoulli}(\theta_{X_i})\);若 \(R_i=0\),\(Y_i\) 缺失。

目标是估计 \(\psi=\mathbb P(Y_i=1)=\frac1B\sum_j\theta_j\)。

贝叶斯 / 似然分析。 似然为

\[\mathcal L(\theta)\propto\prod_i\theta_{X_i}^{Y_iR_i}(1-\theta_{X_i})^{(1-Y_i)R_i}\]
(\(1/B\) 和 \(\xi\) 都是已知常数,被丢掉了)。由于 \(B\gg n\),绝大多数 \(\theta_j\) 根本没在数据里出现过,它们的后验就是先验;于是 \(f(\psi\mid\text{数据})\approx f(\psi)\)——数据几乎不提供关于 \(\psi\) 的信息。

频率学派解法。 Horvitz–Thompson 估计量(原书拼作 Horwitz)

\[\hat\psi=\frac1n\sum_{i=1}^n\frac{R_iY_i}{\xi_{X_i}}\]
无偏,且 \(\mathbb V(\hat\psi)\le\frac{1}{n\delta^2}\)(原书习题 7),无论 \(B\) 多大,误差都以 \(1/\sqrt n\) 速度下降。它用到了已知的观测概率 \(\xi\),而 \(\xi\) 在似然中作为常数被丢掉了,所以任何基于似然的方法(包括贝叶斯)都推不出它。

白话解释:为什么除以 \(\xi\) 就无偏?看一个格子 \(j\):它的结果只有 \(\xi_j\) 的概率被看到。被看到时记 \(Y/\xi_j\),没看到时记 0,平均下来 \(\xi_j\cdot\theta_j/\xi_j=\theta_j\),正好补回了"没看到的那部分"。再对均匀抽到的 \(j\) 取平均,就是 \(\frac1B\sum\theta_j=\psi\)。整个过程不需要知道每个 \(\theta_j\) 是多少,只需要知道"每个样本被观测到的概率"。这类似抽样审计:抽中概率低的凭证,每张代表的总体金额更大,要按抽中概率的倒数放大。 贝叶斯方法的问题不在于计算,而在于它只看似然;\(\xi\) 不含 \(\theta\),从似然的角度看是"无关常数",被丢掉后就再也用不上了。

量化读法:逆概率加权(inverse probability weighting)正是处理样本选择偏差的工具。例如只观测到成交了的限价单,要估计全部挂单的某个平均特征,就按"成交概率的倒数"加权;回测中处理幸存者偏差也是同一思路。

例 11.10(Edward George 提供)。 \(f(x)=cg(x)\),\(g>0\) 已知、\(c\) 未知(高维时 \(\int g\) 算不出来)。我们能从 \(f\) 抽样(原书第 24 章,本册第 24b 章),能否估计 \(c\)?

  • 频率解:用任意相合的密度估计 \(\hat f_n\),取一点 \(x\),\(\hat c=\hat f_n(x)/g(x)\) 相合。
  • 贝叶斯解:似然 \(\mathcal L_n(c)=\prod cg(X_i)\propto c^n\),后验 \(\propto c^n\pi(c)\)——完全不依赖数据;而且后验均值随 \(n\) 增大趋于无穷。

11.9.3 结论

Wasserman 的总结:"贝叶斯学派是似然函数的奴隶。似然出问题时,贝叶斯推断也会出问题。"更重要的是理解两种方法回答的是不同的问题:

  • 想以有原则的方式把先验信念与数据结合起来——用贝叶斯推断;
  • 想构造有长期表现保证的程序(例如真的能在 95% 的时候套住真值的区间)——用频率方法。

参数空间高维时贝叶斯方法尤其容易出问题,95% 后验区间在频率意义下未必能 95% 地包含真值。


11.10 量化实战

11.10.1 执行算法的贝叶斯 A/B 测试

两种限价单执行算法:A 在 120 单中有 78 单 5 分钟内成交,B 在 115 单中有 86 单。分别用频率方法(Wald 区间)和三种先验下的贝叶斯方法(原书例 11.7)比较,并对对数比值比做后验模拟与 Delta 方法的对照(原书习题 4 的思路)。

import numpy as np
from scipy import stats

rng = np.random.default_rng(3)
# 两种执行算法的 A/B 测试:限价单在 5 分钟内成交记为成功
nA, xA = 120, 78        # 算法 A:120 单成交 78
nB, xB = 115, 86        # 算法 B:115 单成交 86
# 频率学派:Wald 检验与 90% 区间(多参数 Delta 方法)
pA, pB = xA / nA, xB / nB
se = np.sqrt(pA * (1 - pA) / nA + pB * (1 - pB) / nB)
print(f"MLE: pA={pA:.3f}, pB={pB:.3f}, 差={pB-pA:.3f}, 90% 置信区间=[{pB-pA-1.645*se:.3f}, {pB-pA+1.645*se:.3f}], "
      f"Wald p={2*stats.norm.sf(abs(pB-pA)/se):.3f}")

# 贝叶斯:独立 Beta 先验 → 独立 Beta 后验(原书例 11.7),模拟求差的后验
B = 200_000
for name, (a0, b0) in {"均匀先验 Beta(1,1)": (1, 1), "Jeffreys Beta(.5,.5)": (0.5, 0.5),
                       "信息先验 Beta(30,20)": (30, 20)}.items():
    PA = rng.beta(a0 + xA, b0 + nA - xA, B)
    PB = rng.beta(a0 + xB, b0 + nB - xB, B)
    d = PB - PA
    print(f"{name:<18} 后验均值差={d.mean():.3f}, 90% 后验区间=[{np.quantile(d,.05):.3f}, "
          f"{np.quantile(d,.95):.3f}], P(pB>pA|数据)={np.mean(d>0):.3f}")

# 参数的函数:对数比值比的后验(原书习题 4 的思路),直接对抽样做变换
PA = rng.beta(1 + xA, 1 + nA - xA, B); PB = rng.beta(1 + xB, 1 + nB - xB, B)
lor = np.log(PB / (1 - PB)) - np.log(PA / (1 - PA))
lor_hat = np.log(pB / (1 - pB)) - np.log(pA / (1 - pA))
se_lor = np.sqrt(1 / xA + 1 / (nA - xA) + 1 / xB + 1 / (nB - xB))
print(f"对数比值比: 后验均值={lor.mean():.3f}, 后验 sd={lor.std():.3f}; MLE={lor_hat:.3f}, Delta se={se_lor:.3f}")

输出:

MLE: pA=0.650, pB=0.748, 差=0.098, 90% 置信区间=[0.000, 0.196], Wald p=0.100
均匀先验 Beta(1,1)     后验均值差=0.096, 90% 后验区间=[-0.001, 0.193], P(pB>pA|数据)=0.948
Jeffreys Beta(.5,.5) 后验均值差=0.097, 90% 后验区间=[-0.001, 0.194], P(pB>pA|数据)=0.948
信息先验 Beta(30,20)   后验均值差=0.068, 90% 后验区间=[-0.016, 0.151], P(pB>pA|数据)=0.908
对数比值比: 后验均值=0.462, 后验 sd=0.286; MLE=0.468, Delta se=0.288

读法:

  • 均匀先验与 Jeffreys 先验下,后验区间与频率学派的 90% 置信区间几乎一样——定理 11.5 在 \(n\approx120\) 时已经很好地成立。
  • 贝叶斯方法给出了频率方法给不出的量:"B 优于 A 的后验概率约 95%"。注意它约等于 1 减去单侧 p 值(0.05):平坦先验、近似正态时这是一般规律。业务决策("换不换算法")往往需要的正是这种概率,配合换算法的成本就能做期望收益决策(第 12 章)。
  • 信息先验 Beta(30,20) 把两个成交率都往 60% 拉,差异被收缩到 0.068,\(P(p_B>p_A)\) 降到 0.91。先验的影响在这个样本量下仍然可见。
  • 对数比值比的后验均值与标准差(0.462, 0.286)与 MLE + Delta 方法(0.468, 0.288)几乎一致,又一次印证大样本下两种方法殊途同归。

11.10.2 一个"显著"的策略,有效的概率有多大?

用 11.8.3 节的公式量化 Lindley 悖论:保持 \(t=2.5\)(双侧 p ≈ 0.012)不变,改变回测长度;\(H_1\) 下年化 Sharpe 的先验取 \(N(0,1)\)。最后看先验概率本身的影响。

import numpy as np
from scipy import stats

# Jeffreys–Lindley 悖论:保持 t 值 = 2.5(双侧 p≈0.012)不变,样本越长,H0 的后验概率越高
# 模型:日收益标准化后 xbar ~ N(SR_d, 1/n);H0: SR_d = 0;H1: SR_d ~ N(0, b^2)
w = 2.5
b = 1.0 / np.sqrt(252)               # 先验:年化 Sharpe 的先验标准差为 1.0
print(f"t = {w},双侧 p = {2*stats.norm.sf(w):.4f},与先验无关的下界 P(H0|x) >= {1/(1+np.exp(w**2/2)):.3f}")
for years in [1, 5, 20, 100, 1000, 10000]:
    n = 252 * years
    xbar = w / np.sqrt(n)
    f0 = stats.norm.pdf(xbar, 0, np.sqrt(1 / n))                # H0 下的边缘密度
    f1 = stats.norm.pdf(xbar, 0, np.sqrt(b**2 + 1 / n))         # H1 下的边缘密度(对先验积分)
    post0 = f0 / (f0 + f1)                                       # P(H0)=P(H1)=1/2
    print(f"{years:>5} 年:年化 SR 估计 {xbar*np.sqrt(252):.2f},贝叶斯因子 BF01 = {f0/f1:.2f},P(H0|数据) = {post0:.3f}")

# 先验概率的作用:同样 t=2.5、5 年数据,若"策略真有效"的先验概率只有 10%
n = 252 * 5; xbar = w / np.sqrt(n)
bf10 = stats.norm.pdf(xbar, 0, np.sqrt(b**2 + 1/n)) / stats.norm.pdf(xbar, 0, np.sqrt(1/n))
for prior1 in [0.5, 0.1]:
    post1 = prior1 * bf10 / (prior1 * bf10 + 1 - prior1)
    print(f"先验 P(H1)={prior1:.1f} → 后验 P(H1|数据)={post1:.3f}")

输出:

t = 2.5,双侧 p = 0.0124,与先验无关的下界 P(H0|x) >= 0.042
    1 年:年化 SR 估计 2.50,贝叶斯因子 BF01 = 0.30,P(H0|数据) = 0.229
    5 年:年化 SR 估计 1.12,贝叶斯因子 BF01 = 0.18,P(H0|数据) = 0.153
   20 年:年化 SR 估计 0.56,贝叶斯因子 BF01 = 0.23,P(H0|数据) = 0.189
  100 年:年化 SR 估计 0.25,贝叶斯因子 BF01 = 0.46,P(H0|数据) = 0.313
 1000 年:年化 SR 估计 0.08,贝叶斯因子 BF01 = 1.39,P(H0|数据) = 0.582
10000 年:年化 SR 估计 0.03,贝叶斯因子 BF01 = 4.40,P(H0|数据) = 0.815
先验 P(H1)=0.5 → 后验 P(H1|数据)=0.847
先验 P(H1)=0.1 → 后验 P(H1|数据)=0.380

读法:

  • p = 0.012 时,即使用对 \(H_1\) 最有利的先验,\(H_0\) 的后验概率也至少有 4.2%;用合理的先验,5 年数据下约 15%,远高于 p 值给人的印象。
  • 保持 \(t\) 不变而拉长样本,对应的 Sharpe 越来越小,\(P(H_0\mid\text{数据})\) 先降后升并趋向 1——这就是 Lindley 悖论。"1000 年日频"看似荒唐,但几十万个观测在分钟级、tick 级数据里很常见:用高频数据检验一个微弱效应时,\(t=2.5\) 的说服力远不如它在日频数据里那么强。(前几行的先降后升来自先验尺度 \(b\) 与 \(1/\sqrt n\) 的相对大小。)
  • 最后两行把第 10b 章练习 10 的思路形式化:若同类研究中真正有效的策略只占 10%,那么一个 5 年回测 \(t=2.5\) 的策略真实有效的后验概率只有 38%。先验概率(研究的"基率")与 p 值同样重要。

11.10.3 Black–Litterman:多元 Normal–Normal 共轭

Black–Litterman 模型以市场均衡隐含收益 \(\pi=\delta\Sigma w_{\text{mkt}}\) 为先验均值、\(\tau\Sigma\) 为先验协方差,把投资者观点 \(P\mu=q+\varepsilon\)(\(\varepsilon\sim N(0,\Omega)\))当作"数据",用例 11.2 的"精度相加、均值按精度加权"得到后验:

\[\mu_{BL}=\big[(\tau\Sigma)^{-1}+P^T\Omega^{-1}P\big]^{-1}\big[(\tau\Sigma)^{-1}\pi+P^T\Omega^{-1}q\big].\]

import numpy as np

# Black–Litterman = 多元正态-正态共轭(原书例 11.2 的多元版)
vol = np.array([0.20, 0.18, 0.25])                     # 三类资产年化波动
corr = np.array([[1, .6, .4], [.6, 1, .5], [.4, .5, 1]])
Sigma = np.outer(vol, vol) * corr
w_mkt = np.array([0.5, 0.3, 0.2])                      # 市场权重
delta, tau = 2.5, 0.05                                 # 风险厌恶系数、先验不确定性缩放
pi = delta * Sigma @ w_mkt                             # 先验均值:均衡隐含收益
# 观点("数据"):资产 1 比资产 2 每年多赚 3%,观点的不确定性 Omega
P = np.array([[1, -1, 0]]); q = np.array([0.03])
Omega = np.array([[P[0] @ (tau * Sigma) @ P[0]]])      # 常见取法:与先验同等可信

prec_prior = np.linalg.inv(tau * Sigma)                # 先验精度
prec_view = P.T @ np.linalg.inv(Omega) @ P             # 观点精度
M = np.linalg.inv(prec_prior + prec_view)              # 后验协方差:精度相加再求逆
mu_bl = M @ (prec_prior @ pi + P.T @ np.linalg.inv(Omega) @ q)   # 后验均值:按精度加权
w_bl = np.linalg.solve(delta * Sigma, mu_bl)           # 均值-方差最优权重(无约束)
np.set_printoptions(precision=4, suppress=True)
print("先验均衡收益 pi   :", pi)
print("后验收益 mu_BL    :", mu_bl)
print("观点组合 P@pi -> P@mu_BL:", (P @ pi).round(4), "->", (P @ mu_bl).round(4), "(观点为 0.03)")
print("市场权重          :", w_mkt)
print("BL 最优权重       :", w_bl)

输出:

先验均衡收益 pi   : [0.0762 0.0625 0.0731]
后验收益 mu_BL    : [0.0814 0.0595 0.0724]
观点组合 P@pi -> P@mu_BL: [0.0137] -> [0.0218] (观点为 0.03)
市场权重          : [0.5 0.3 0.2]
BL 最优权重       : [0.612 0.188 0.2  ]

读法:先验认为资产 1 比资产 2 多赚 1.37%,观点说 3%,二者精度相同,后验正好落在中间 2.18%(\(=(1.37\%+3\%)/2\))——与一维 Normal–Normal 的 \(w=1/2\) 完全一样。由于资产相关,资产 1、2 的收益同时被调整;最优权重只在观点涉及的两个资产间转移,资产 3 保持市场权重。这是 BL 相对"直接把观点塞进优化器"的最大优点:结果稳健、可解释、偏离基准有度。

11.10.4 其他应用速记

  • 基金经理 / 策略 alpha 的收缩:几百个经理的 alpha 估计向 0 或同类均值收缩,收缩强度由"真实 alpha 的离散度"与"估计误差"之比决定(经验贝叶斯,即用数据估计先验参数);第 12 章的 James–Stein 估计给出频率学派的理由。
  • 贝叶斯在线更新:Normal–Normal 共轭可以逐日递推更新策略 alpha 的后验,这就是 Kalman 滤波的最简形式;时变 Beta、动态对冲比率都可以这样估计(第 06 册状态空间模型)。
  • 模型平均:对多个候选模型按后验概率加权预测,比"选一个最好的模型"更能抵御过拟合。

本章小结

贝叶斯推断把参数当作随机变量,用"后验 ∝ 似然 × 先验"更新信念。共轭先验让后验有闭式解,且后验均值是 MLE 与先验均值按精度的加权平均——这种"收缩"是量化中最有用的思想之一(Vasicek Beta、Bayes–Stein 收益估计、Black–Litterman)。对参数函数和多参数边缘,直接从后验抽样再变换即可。大样本、低维时后验近似 \(N(\hat\theta,\widehat{\text{se}}^2)\),贝叶斯与频率区间几乎相同;分歧出现在先验选择(平坦先验不具变换不变性,Jeffreys 先验 \(\propto\sqrt{I(\theta)}\) 具有)、检验问题(对先验敏感、不能用非正常先验、Lindley 悖论表明 p 值夸大证据)和高维问题(贝叶斯是似然的奴隶,Horvitz–Thompson 这类用到设计信息的估计无法从似然导出)。两种方法回答不同的问题:要结合先验信念,用贝叶斯;要长期表现保证,用频率方法。

概念 公式 / 结论
贝叶斯定理 \(f(\theta\mid x^n)=\mathcal L_n(\theta)f(\theta)/\int\mathcal L_nf\)
Beta–Bernoulli 先验 Beta\((\alpha,\beta)\) → 后验 Beta\((\alpha+s,\beta+n-s)\)
后验均值(Beta) \(\frac{n}{\alpha+\beta+n}\hat p+\frac{\alpha+\beta}{\alpha+\beta+n}\frac{\alpha}{\alpha+\beta}\)
Normal–Normal \(\frac1{\tau^2}=\frac1{\text{se}^2}+\frac1{b^2}\),\(\bar\theta=w\bar X+(1-w)a\),\(w=\frac{1/\text{se}^2}{1/\text{se}^2+1/b^2}\)
Gamma–Poisson 先验 Gamma(形状 \(\alpha\), 率 \(\beta\)) → 后验 Gamma\((\alpha+\sum x_i,\ \beta+n)\)(此处 \(\beta\) 为率参数,与原书分布表及附录 A1 的尺度参数约定相反)
后验区间 后验的 \(\alpha/2\) 与 \(1-\alpha/2\) 分位数
大样本 \(\theta\mid X^n\approx N(\hat\theta,1/(nI(\hat\theta)))\)
Jeffreys 先验 \(f(\theta)\propto\sqrt{I(\theta)}\);Bernoulli 为 Beta(1/2,1/2)
贝叶斯检验 \(\mathbb P(H_0\mid x)=\frac{\mathcal L(\theta_0)}{\mathcal L(\theta_0)+\int\mathcal L f}\)
下界 \(\mathbb P(H_0\mid x)\ge\frac{\mathcal L(\theta_0)}{\mathcal L(\theta_0)+\mathcal L(\hat\theta)}\);正态时 \(1/(1+e^{w^2/2})\)
Lindley \(BF_{01}=\sqrt{1+nb^2}\exp\{-\frac{w^2}2\frac{nb^2}{1+nb^2}\}\to\infty\)
Horvitz–Thompson \(\hat\psi=\frac1n\sum R_iY_i/\xi_{X_i}\)
Black–Litterman \(\mu_{BL}=[(\tau\Sigma)^{-1}+P^T\Omega^{-1}P]^{-1}[(\tau\Sigma)^{-1}\pi+P^T\Omega^{-1}q]\)

练习

基础

  1. 验证 Normal–Normal 共轭公式 (11.7)。(原书习题 1;提示:对数后验配方。)
  2. Bernoulli 数据 0101000000(\(n=10\),\(s=2\))。分别在 Beta(1/2,1/2)、Beta(1,1)、Beta(10,10)、Beta(100,100) 先验下写出后验与后验均值,说明先验强度的影响。(原书习题 5。答案:后验均值依次为 2.5/11≈0.227、3/12=0.25、12/30=0.40、102/210≈0.486。)
  3. \(X_i\sim\text{Poisson}(\lambda)\),先验 \(\lambda\sim\text{Gamma}(\alpha,\beta)\)(\(\beta\) 为率参数)。求后验与后验均值,并写成 MLE 与先验均值的加权平均;再求 Jeffreys 先验及其后验。(原书习题 6。答案:后验 Gamma\((\alpha+\sum x_i,\beta+n)\),均值 \(\frac{n}{\beta+n}\bar x+\frac{\beta}{\beta+n}\frac\alpha\beta\);\(I(\lambda)=1/\lambda\),Jeffreys 先验 \(\propto\lambda^{-1/2}\),后验 Gamma\((\sum x_i+1/2,\ n)\)。)
  4. 某券商每天的大额撤单次数服从 Poisson,历史经验均值约 4 次/天,取先验 Gamma(8, 2)。新系统上线后 5 天共观测到 31 次。求后验均值与 90% 后验区间(可用 scipy.stats.gamma,注意它用尺度参数,需写 gamma(a=39, scale=1/7))。(提示:后验 Gamma(39, 7),均值约 5.57。)
  5. 证明 Jeffreys 先验的不变性:若 \(\psi=g(\theta)\) 单调可微,则 \(\sqrt{I_\psi(\psi)}=\sqrt{I_\theta(\theta)}\,|d\theta/d\psi|\)。

进阶

  1. 推导 11.8.3 节的贝叶斯因子公式,并证明固定 \(w\) 时 \(n\to\infty\) 有 \(\mathbb P(H_0\mid x)\to1\);再证明固定 \(n\) 时 \(b\to\infty\) 也有 \(\mathbb P(H_0\mid x)\to1\),解释为什么检验中不能用"很平"的先验。(原书习题 8。)
  2. 原书习题 4:安慰剂 50 人中 30 人改善,治疗组 50 人中 40 人改善,\(\tau=p_2-p_1\)。(a) MLE 与 Delta 方法 90% 区间;(b) 参数 Bootstrap;(c) 平坦先验下模拟求后验均值与 90% 后验区间;(d)(e) 对对数比值比重复。比较三种方法。
  3. 验证 Horvitz–Thompson 估计量无偏且 \(\mathbb V(\hat\psi)\le1/(n\delta^2)\)。(原书习题 7;提示:\(\mathbb E[R_iY_i/\xi_{X_i}\mid X_i=j]=\theta_j\),且 \(R_iY_i/\xi_{X_i}\le1/\delta\)。)
  4. 修改 11.10.3 节代码:把观点不确定性 \(\Omega\) 依次乘以 0.1、1、10,观察 \(P\mu_{BL}\) 如何在 0.0137 与 0.03 之间移动,并用一维 Normal–Normal 公式解释。
  5. 设 200 个基金经理的年化 alpha 估计 \(\hat\alpha_i\sim N(\alpha_i,s^2)\),\(s=4\%\),真实 \(\alpha_i\sim N(0,\tau^2)\)。给出 \(\tau\) 的矩估计(\(\widehat{\tau^2}=\max(0,\overline{\hat\alpha^2}-s^2)\)),写出每个经理 alpha 的后验均值,并用模拟比较其总均方误差与直接用 \(\hat\alpha_i\) 的差别。(这与第 12 章 James–Stein 估计相呼应。)

原书推荐习题:第 11 章 4(频率、Bootstrap、贝叶斯三法对比,必做)、8(Jeffreys–Lindley 悖论)、5(先验强度的影响)、1、6(共轭先验推导)、2(后验模拟与参数变换)。

原书对照

本章内容 原书章节 PDF 页码
频率学派与贝叶斯学派的公设 11.1 p.186–187
贝叶斯方法、Beta–Bernoulli、Normal–Normal、共轭 11.2 p.187–190
参数的函数 11.3 p.191
模拟 11.4 p.191–192
大样本性质、贝叶斯 Delta 方法 11.5 p.192
平坦、非正常、Jeffreys 先验 11.6 p.192–194
多参数问题、两比例比较 11.7 p.194–195
贝叶斯检验 11.8 p.195–196
优缺点、Robins–Ritov 例、归一化常数例 11.9 p.196–200
文献注 11.10 p.200–201
定理 11.5 证明 11.11 附录 p.201
习题 11.12 p.201–203

(PDF 页码 = 原书正文页码 + 17。)