第 03 章 条件概率与独立性
本章对应 Ross 第 3 章,是本册前半部分最重要的一章。条件概率有两层用途:一是已经掌握部分信息时,我们要算的本来就是条件概率;二是即使没有额外信息,"先对某件事取条件、再加权平均"(conditioning)也常常是算出答案最省力的办法。Bayes 公式、独立性、赌徒破产问题都在这里,它们分别是信号融合、风险建模和止损止盈分析的概率基础。
学习目标
- 理解条件概率的定义与"缩小样本空间"的直觉,熟练使用乘法法则。
- 掌握全概率公式和 Bayes 公式,特别是"后验赔率 = 先验赔率 × 似然比"的赔率形式;能识别基础率谬误。
- 掌握独立性的定义,分清两两独立与相互独立、独立与互斥、独立与条件独立。
- 会用"对第一步取条件 + 独立性使局面重新开始"建立递推方程,解出"\(E\) 先于 \(F\)"、点数问题、赌徒破产等经典问题。
- 理解条件独立是序贯 Bayes 更新成立的前提,并能把它用于策略有效性的在线判断。
- 能把赌徒破产公式用于止损止盈胜率、破产风险的计算。
读前导读
这一章在解决什么问题。 条件概率、全概率公式、Bayes 公式、独立性,你在 CFA 一级都做过题。CFA 的重点是"给定数字,代公式"。本章多出来的东西有三块。
第一块是把条件化当作解题方法。很多问题直接算很难,但"先假设第一步的结果已知"就好算了,再按第一步各种结果的概率加权平均。赌徒破产、"5 先于 7"、点数问题都是这样解的:对第一步取条件,得到一个关于未知概率的方程(递推式),解方程就得到答案。这一套在 CFA 里没有,但它是后面马尔可夫链、二叉树倒推定价的基本方法。CFA 单步二叉树里"期权价值 = 风险中性概率加权的下一期价值再贴现",就是对第一步取条件。
第二块是 Bayes 公式的赔率形式:"后验赔率 = 先验赔率 × 似然比"。它比 CFA 的分式写法更好用:每来一条新证据,乘一个似然比就行。量化研究中"回测显著的因子有多大可能是真的""连赢 10 年的经理有多大可能有能力"都是这个结构,答案往往远低于直觉,因为基础率(先验)很低。
第三块是条件独立。给定共同因子时各资产独立,无条件下却相关——这是单指数模型、信用组合模型(如 Vasicek 单因子违约模型)的结构。CFA 的单指数模型里"残差互不相关、相关性全部来自市场因子",就是条件独立的一个版本。
需要先想起来的数学。
- 几何级数。 \(1+r+r^2+\cdots+r^{n-1}=\frac{1-r^n}{1-r}\)(\(r\ne1\));若 \(|r|<1\),无穷项之和为 \(\frac1{1-r}\)。这就是你熟悉的年金现值公式的核心。例:\(1+\frac12+\frac14=\frac{1-1/8}{1/2}=1.75\)。例 4h 和赌徒破产都要用它。见 第 00 册第 04 章 级数与收敛。
- 递推式与"错位相减(望远镜求和)"。 若知道相邻两项的差 \(a_k-a_{k-1}=d_k\),把 \(k=1,\dots,i\) 的式子加起来,中间项全部抵消,得 \(a_i-a_0=\sum_{k=1}^id_k\)。赌徒破产的解法就是这一步。
- 极限 \(r^N\to0\)。 若 \(0<r<1\),\(N\to\infty\) 时 \(r^N\to0\);若 \(r>1\),\(r^N\to\infty\)。用于"对手无限富有"的情形。见 第 00 册第 01 章 函数极限与连续。
- 用积分近似求和。 \(\frac1k\sum_{i=0}^k f(i/k)\approx\int_0^1f(x)\,dx\),\(k\) 大时成立(把 \([0,1]\) 切成 \(k\) 段,每段宽 \(1/k\),高 \(f(i/k)\),面积之和逼近曲线下面积)。只在例 5e 用到。见 第 00 册第 03 章 积分。
- 记号 \(\propto\)。 读作"正比于",\(a_i\propto b_i\) 表示存在与 \(i\) 无关的常数 \(c\) 使 \(a_i=cb_i\)。Bayes 公式里常先写"后验 \(\propto\) 似然 × 先验",最后再除以总和归一化。
怎么读这一章。 3.1、3.2 是核心,3.2 中的赔率形式 (3.3) 和例 3d(基础率谬误)一定要读懂。3.3 的独立性定义和"两两独立不等于相互独立"要掌握;例 4h 方法二(对第一步取条件)是本章最重要的套路,务必自己推一遍。3.4 赌徒破产的推导要读懂,它直接对应止损止盈。3.5 的条件独立和例 5f(序贯更新)对量化最重要。第一次可以跳过:例 2c、2g(桥牌)、例 3m 之后的 3o 推导细节、例 4k、4l、例 4n(概率方法)、例 5d。
3.1 条件概率
定义与直觉
掷两颗骰子,36 种结果等可能。已知第一颗是 3,两颗之和为 8 的概率是多少?在这个信息下,可能的结果只剩 \((3,1),(3,2),\dots,(3,6)\) 六个,它们仍应等可能,各占 \(1/6\);其他 30 个结果的条件概率变为 0。和为 8 只有 \((3,5)\) 一种,所以答案是 \(1/6\)。
一般地,已知 \(F\) 发生,\(E\) 要发生,结果必须落在 \(EF\) 中。\(F\) 变成了新的、缩小后的样本空间,\(EF\) 的概率要相对于 \(F\) 的概率来衡量。
定义 若 \(P(F)>0\),事件 \(E\) 在给定 \(F\) 下的**条件概率(conditional probability)**为
频率解释与此一致:重复 \(n\) 次试验,\(F\) 大约发生 \(nP(F)\) 次,\(EF\) 大约发生 \(nP(EF)\) 次;在 \(F\) 发生的那些试验中,\(E\) 也发生的比例约为 \(P(EF)/P(F)\)。
例 2a Joe 80% 确信钥匙在夹克的两个口袋之一,左右各 40%。搜了左口袋没找到,钥匙在右口袋的条件概率为
缩小样本空间法:若有限样本空间的各结果等可能,则在 \(F\) 发生的条件下,\(F\) 中各结果仍然等可能,可以直接把 \(F\) 当作样本空间来数。
例 2b 抛两次硬币。(a) 已知第一次是正面,两次都是正面的概率为 \(\frac{1/4}{2/4}=\frac12\);(b) 已知至少一次正面,两次都是正面的概率为 \(\frac{1/4}{3/4}=\frac13\)。
常见误区:在 (b) 中以为只剩"两次正面"和"一次正面"两种等可能情形,答 1/2。实际剩下的是 \((h,h),(h,t),(t,h)\) 三个等可能结果。
例 2c(桥牌) 南北两家共有 8 张黑桃,东家拿到剩余 5 张黑桃中 3 张的概率是多少?在缩小的样本空间里,东西两家的 26 张牌(含 5 张黑桃)等可能地分配,答案为 \(\binom53\binom{21}{10}/\binom{26}{13}\approx.339\)。
乘法法则
由定义直接得到
推广为乘法法则(multiplication rule):
证明只需把右边每个条件概率按定义展开,逐项约分。乘法法则把一个复杂的联合事件拆成一串"在已知前面结果时,下一步发生"的条件概率,是建立概率模型最常用的方式。
推导拆解:以 \(n=3\) 为例,右边按定义展开是
\[P(E_1)\cdot\frac{P(E_1E_2)}{P(E_1)}\cdot\frac{P(E_1E_2E_3)}{P(E_1E_2)}.\]每个分子都和下一项的分母相同,逐个约掉,只剩最后一个分子 \(P(E_1E_2E_3)\)。一般 \(n\) 同理。 金融直觉:这就是信用分析里的"累积生存概率 = 各年边际生存概率之积":\(P(\text{前 3 年都不违约})=P(\text{第 1 年不违约})\cdot P(\text{第 2 年不违约}\mid\text{第 1 年未违约})\cdot P(\text{第 3 年不违约}\mid\text{前 2 年未违约})\)。评级机构的违约率表给的正是这些条件概率。
例 2d Celine 掷硬币决定选法语课(得 A 的概率 1/2)还是化学课(得 A 的概率 2/3),她选化学且得 A 的概率为 \(P(CA)=P(C)P(A\mid C)=\frac12\cdot\frac23=\frac13\)。
例 2e 瓮中 8 红 4 白,无放回取 2 个。(a) 两个都是红球的概率 \(P(R_1R_2)=P(R_1)P(R_2\mid R_1)=\frac{8}{12}\cdot\frac7{11}=\frac{14}{33}\),与 \(\binom82/\binom{12}2\) 相同。(b) 若红球重 \(r\)、白球重 \(w\),被取中的概率与重量成正比,则 \(P(R_1)=\frac{8r}{8r+4w}\),\(P(R_2\mid R_1)=\frac{7r}{7r+4w}\),两个都是红球的概率是二者之积。(b) 用计数法很难做,用乘法法则则很自然。
例 2g 52 张牌随机分成 4 堆各 13 张,每堆恰有一张 A 的概率(第 02 章例 5h(b) 的另一解法)。设 \(E_1\) 为"黑桃 A 在某一堆"(必然发生),\(E_2\) 为"黑桃 A 与红心 A 不在同一堆",\(E_3\) 为"黑桃、红心、方块 A 两两不同堆",\(E_4\) 为"四张 A 都在不同堆"。黑桃 A 所在堆的其余 12 张是其余 51 张中的随机 12 张,所以 \(P(E_2\mid E_1)=1-\frac{12}{51}=\frac{39}{51}\);同理 \(P(E_3\mid E_1E_2)=1-\frac{24}{50}=\frac{26}{50}\),\(P(E_4\mid E_1E_2E_3)=1-\frac{36}{49}=\frac{13}{49}\)。结果为 \(\frac{39\cdot26\cdot13}{51\cdot50\cdot49}\approx.105\)。
例 2f(配对问题续) 第 02 章已求出 \(N\) 人随机取帽、无人配对的概率 \(P_N=\sum_{i=0}^N(-1)^i/i!\)。现在求恰好 \(k\) 人配对的概率。固定一个 \(k\) 人集合,\(E\) 为"这 \(k\) 人都配对",\(G\) 为"其余 \(N-k\) 人都不配对"。由乘法法则 \(P(E)=\frac1N\cdot\frac1{N-1}\cdots\frac1{N-k+1}=\frac{(N-k)!}{N!}\);给定 \(E\),其余人在自己的 \(N-k\) 顶帽子中随机选,\(P(G\mid E)=P_{N-k}\)。这样的集合有 \(\binom Nk\) 个,所以
右边正是参数为 1 的泊松分布(第 04b 章)。
3.2 全概率公式与 Bayes 公式
全概率公式
由 \(E=EF\cup EF^c\)(互斥),
\(P(E)\) 是两个条件概率的加权平均,权重是所条件事件的概率。很多事件直接算很难,但"如果知道 \(F\) 是否发生"就容易算——这就是**条件化(conditioning)**技巧。
一般形式(全概率公式,law of total probability):若 \(F_1,\dots,F_n\) 互斥且 \(\bigcup F_i=S\)(恰有一个发生),则
例 3a(保险) 人群中 30% 是"易出事故者",其一年内出事故的概率为 .4,其余人为 .2。(1) 新投保人一年内出事故的概率 \(P(A_1)=(.4)(.3)+(.2)(.7)=.26\)。(2) 已知此人出了事故,他是易出事故者的概率 \(P(A\mid A_1)=\frac{(.3)(.4)}{.26}=\frac6{13}\)。
例 3h(估计同卵双胞胎比例,第 9 版新增) 同卵双胞胎总是同性别;异卵双胞胎与普通兄弟姐妹一样,同性别的概率为 1/2。医院数据显示约 64% 的双胞胎同性别。由全概率公式 \(P(SS)=1\cdot P(I)+\frac12[1-P(I)]=\frac12+\frac12P(I)\),代入 \(.64\) 得 \(P(I)\approx.28\)。要点:用可观测量通过全概率公式反推不可观测的比例。量化里用"观察到的整体胜率"反推"有效信号占比"是同一思路。
例 3b(猜黑桃 A) 52 张牌逐张翻开,玩家可以在任一时刻宣布"下一张是黑桃 A",猜中就赢(若到最后一张时仍没猜过,也算赢)。结论:任何策略的胜率都是 1/52。对牌数 \(n\) 归纳:固定任一策略,设它猜第一张的概率为 \(p\)。猜第一张时胜率为 \(1/n\);不猜时,胜率等于"第一张不是黑桃 A"的概率 \(\frac{n-1}{n}\) 乘以剩下 \(n-1\) 张时的胜率 \(\frac{1}{n-1}\),也是 \(\frac1n\)。所以总胜率 \(\frac1np+\frac1n(1-p)=\frac1n\)。这个例子是"没有择时能力就无法通过选择出手时机获利"的一个干净模型。
Bayes 公式
命题 3.1(Bayes 公式) 若 \(F_1,\dots,F_n\) 互斥且穷尽,则
把 \(F_j\) 看作关于世界的各种"假设",\(P(F_j)\) 是试验前的看法(先验,prior),\(P(F_j\mid E)\) 是看到证据 \(E\) 之后的看法(后验,posterior),\(P(E\mid F_j)\) 是各假设下证据出现的可能性(似然,likelihood)。Bayes 公式告诉我们如何用证据修正看法。
例 3c(选择题) 学生知道答案的概率为 \(p\),否则在 \(m\) 个选项中随机猜。已知答对,他确实知道答案的概率为
例 3d(医学检测,基础率谬误) 某检测对患者的检出率为 95%,对健康人的假阳性率为 1%,人群患病率为 0.5%。检测阳性者真正患病的概率为
例 3e、3f(用新信息修正主观概率) 医生的规则是至少 80% 确信才建议手术。他起初 60% 确信 Jones 患病;检验 A 对患者总是阳性,对健康的非糖尿病人几乎不会阳性,但对健康的糖尿病人有 30% 阳性。Jones 是糖尿病人且检验阳性:\(P(D\mid E)=\frac{(.6)(1)}{(.6)+(.3)(.4)}=.833>.8\),应建议手术。刑侦的例子结构相同:侦探 60% 确信嫌疑人有罪,新证据表明罪犯有某特征(人群中 20% 有),嫌疑人恰有此特征,则 \(P(G\mid C)=\frac{.6}{.6+(.2)(.4)}\approx.882\)。
证据何时支持假设:赔率形式
例 3g(桥牌作弊案) 1965 年世界桥牌锦标赛中,英国选手被指控用手指信号作弊。控方说他们的打法"与有罪假设一致",所以构成有罪证据;辩方指出这些打法同样符合他们的常规风格。谁对?设假设 \(H\)、新证据 \(E\):
可以看出 \(P(H\mid E)\ge P(H)\) 当且仅当 \(P(E\mid H)\ge P(E\mid H^c)\)。也就是说,证据支持某假设,当且仅当它在假设成立时比不成立时更可能出现。"与假设一致"本身不构成证据——控方从未证明这些打法在作弊时更常见。
定义事件 \(A\) 的**赔率(odds)**为
例如 \(P(A)=2/3\) 时赔率为 2,常说"2 比 1 支持 \(A\)"。Bayes 公式的赔率形式是
即后验赔率 = 先验赔率 × 似然比(likelihood ratio)。这个形式最清楚地展示了证据的作用:似然比大于 1 时赔率上升,小于 1 时下降,等于 1 时证据毫无信息量。
推导拆解:分别写出 \(H\) 与 \(H^c\) 的 Bayes 公式:
\[P(H\mid E)=\frac{P(E\mid H)P(H)}{P(E)},\qquad P(H^c\mid E)=\frac{P(E\mid H^c)P(H^c)}{P(E)}.\]两式相除,难算的分母 \(P(E)\) 直接约掉,就得到 (3.3)。这正是赔率形式好用的原因:不必算全概率 \(P(E)\)。 用例 3d 检验:先验赔率 \(0.005/0.995\approx1/199\),似然比 \(0.95/0.01=95\),后验赔率 \(95/199\approx0.477\),换回概率 \(0.477/1.477\approx0.323\),与原文一致。似然比高达 95,但先验赔率太低,后验仍不到一半。 多条证据给定假设下条件独立时,似然比可以连乘(见 3.5 节例 5f);取对数后变成相加,这就是"对数似然比逐笔累加"的序贯检验思想。
例 3i 瓮中 2 枚 A 型硬币(正面概率 1/4)、1 枚 B 型硬币(正面概率 3/4)。随机取一枚抛出正面,它是 A 型的赔率为 \(\frac{2/3}{1/3}\cdot\frac{1/4}{3/4}=\frac23\),即概率 \(2/5\)。
更多 Bayes 例子
例 3k(搜寻失踪飞机) 飞机等可能坠落在 3 个区域之一;若飞机在区域 \(i\),搜索该区域能找到它的概率为 \(1-\beta_i\)(\(\beta_i\) 叫漏检概率,overlook probability)。搜索区域 1 未果后,
例 3l(三张卡片) 一张两面红、一张两面黑、一张一红一黑。随机抽一张放在桌上,朝上一面是红色,背面是黑色的概率是多少?
例 3m(两个孩子问题:信息是怎么来的) 新搬来的一家有两个孩子。你遇到母亲带着一个女孩散步,两个孩子都是女孩的概率是多少?设 \(G_1,G_2\) 为老大、老二是女孩,\(G\) 为同行的孩子是女孩,则
例 3n(手电筒) 三类手电筒使用超过 100 小时的概率分别为 .7、.4、.3,占比 20%、30%、50%。(a) \(P(A)=(.7)(.2)+(.4)(.3)+(.3)(.5)=.41\);(b) 已知某个手电筒超过 100 小时,它属于第 1 类的概率为 \(14/41\approx.341\),第 2、3 类分别为 \(12/41\)、\(15/41\)。
例 3o(DNA 数据库匹配:后验对先验的敏感性) 镇上 100 万居民都可能是罪犯,其中 1 万名前科者的 DNA 在库。DNA 只能识别 5 条链,每个无辜者独立地以 \(10^{-5}\) 的概率全部匹配。检察官的先验:每名前科者有罪概率为 \(\alpha\),其余 99 万人各为 \(\beta\),\(\alpha=c\beta\)。比对后只有 A. J. Jones 一人匹配。经推导可得
3.3 独立事件
定义
一般来说 \(P(E\mid F)\ne P(E)\)。如果 \(P(E\mid F)=P(E)\),即知道 \(F\) 发生不改变 \(E\) 的概率,就说 \(E\) 独立于 \(F\)。由条件概率定义,这等价于
这个式子对 \(E\)、\(F\) 对称,而且不要求 \(P(F)>0\),所以把它作为定义:若 (4.1) 成立,称 \(E\) 与 \(F\) 独立(independent),否则称为相依(dependent)。
- 例 4a:随机抽一张牌,"是 A"与"是黑桃"独立:\(\frac1{52}=\frac4{52}\cdot\frac{13}{52}\)。
- 例 4c:掷两颗骰子,\(F\) 为"第一颗是 4"。\(E_1\)="和为 6" 与 \(F\) 不独立(\(\frac1{36}\ne\frac5{36}\cdot\frac16\)):第一颗若是 6,和就不可能为 6,所以和为 6 依赖第一颗。\(E_2\)="和为 7" 与 \(F\) 独立:不论第一颗是几,都恰有一个第二颗的值使和为 7。
- 例 4d:下任总统是否来自某党与明年是否发生大地震,多数人认为独立;但它与"选举后两年内出现衰退"是否独立就有争议。独立性通常是一个建模假设,而不是可以想当然的事实。
命题 4.1 若 \(E,F\) 独立,则 \(E,F^c\) 也独立。证明:\(P(EF^c)=P(E)-P(EF)=P(E)[1-P(F)]=P(E)P(F^c)\)。也就是说,\(F\) 发生与否的信息都不改变 \(E\) 的概率。
独立 ≠ 互斥。两个概率都为正的互斥事件一定不独立:知道一个发生,另一个就必然不发生(原书自测题 3.23)。
两两独立不等于相互独立
例 4e 掷两颗骰子,\(E\)="和为 7",\(F\)="第一颗是 4",\(G\)="第二颗是 3"。\(E\) 与 \(F\) 独立,\(E\) 与 \(G\) 独立,但 \(P(E\mid FG)=1\),\(E\) 与 \(FG\) 并不独立。
所以三个事件独立需要四个条件:
此时 \(E\) 与由 \(F,G\) 构成的任何事件都独立,例如 \(P[E(F\cup G)]=P(E)P(F\cup G)\)。一般地,\(E_1,\dots,E_n\) 独立,当且仅当对其任意子集都有乘积公式成立;无穷多个事件独立,当且仅当其每个有限子集独立。
若一个试验由一串子试验组成,只要 \(E_i\) 完全由第 \(i\) 个子试验决定,\(E_1,E_2,\dots\) 就必然独立,则称这些子试验独立;若各子试验的可能结果集合相同,就叫重复试验(trials),如反复抛硬币。
独立重复试验
例 4f(Bernoulli 试验) 每次成功概率为 \(p\),独立重复。(a) 前 \(n\) 次至少一次成功:\(1-(1-p)^n\)。(b) 前 \(n\) 次恰好 \(k\) 次成功:每个含 \(k\) 次成功的特定序列概率为 \(p^k(1-p)^{n-k}\),这样的序列有 \(\binom nk\) 个,
这就是二项分布(第 04b 章正式引入)。(c) 所有试验都成功:由概率的连续性,概率为 \(\lim_np^n\),\(p<1\) 时为 0。
例 4g(并联系统) \(n\) 个独立元件,元件 \(i\) 正常的概率为 \(p_i\),至少一个正常系统就工作:
对第一步取条件:"E 先于 F"
例 4h(5 先于 7) 反复掷两颗骰子,求点数和 5 先于 7 出现的概率。
方法一:令 \(E_n\) 为"前 \(n-1\) 次既无 5 也无 7、第 \(n\) 次为 5"。\(P(5)=4/36\),\(P(7)=6/36\),\(P(E_n)=(1-\frac{10}{36})^{n-1}\frac4{36}\),对 \(n\) 求和(可列可加性)得 \(\frac19\cdot\frac1{1-13/18}=\frac25\)。
方法二(对第一次结果取条件):设 \(F\)="第一次为 5",\(G\)="第一次为 7",\(H\)="都不是"。\(P(E\mid F)=1\),\(P(E\mid G)=0\),而由独立性,第一次既非 5 也非 7 之后,局面和开始时一模一样,所以 \(P(E\mid H)=P(E)\)。于是 \(P(E)=\frac19+\frac{13}{18}P(E)\),解得 \(P(E)=\frac25\)。
一般结论:若 \(E,F\) 是一次试验中的互斥事件,独立重复试验时 \(E\) 先于 \(F\) 发生的概率为
直观上,"5 与 7 的赔率是 4 比 6"。方法二的"对第一步取条件 + 独立性使局面重新开始"是本章最重要的解题套路,下面反复使用。
推导拆解:一般结论的推导与方法二完全相同。记 \(x\) 为所求概率。第一次试验有三种结果:\(E\)(概率 \(P(E)\),此时已赢),\(F\)(概率 \(P(F)\),此时已输),都不是(概率 \(1-P(E)-P(F)\),此时由独立性"从头再来",赢的概率仍是 \(x\))。全概率公式给出
\[x=P(E)\cdot1+P(F)\cdot0+[1-P(E)-P(F)]\,x.\]把含 \(x\) 的项移到左边:\(x[P(E)+P(F)]=P(E)\),即得结论。 这里关键的一步是"局面重新开始":它要求各次试验独立、且每次的概率相同,所以未来的胜率与已经过去了多少次无关。若试验之间有记忆(例如胜率随连败变化),这一步就不成立。 金融直觉:价格在每个时间单位里要么触及止盈(\(E\)),要么触及止损(\(F\)),要么都没碰到。若每段时间互相独立、分布相同,"先止盈"的概率只取决于单段内两者的相对可能性,与要等多久无关。
例 4i(优惠券收集) 共 \(n\) 种优惠券,每张独立地以概率 \(p_i\) 为第 \(i\) 种,收集 \(k\) 张。\(A_i\)="至少有一张第 \(i\) 种"。\(P(A_i)=1-(1-p_i)^k\),\(P(A_i\cup A_j)=1-(1-p_i-p_j)^k\),由加法公式 \(P(A_iA_j)=1-(1-p_i)^k-(1-p_j)^k+(1-p_i-p_j)^k\),从而可得 \(P(A_i\mid A_j)\)。
点数问题:概率论的诞生
1654 年,赌徒 de Méré 向 Pascal 提出:两人下注比赛,中途被迫停止,此时各有部分得分,赌注应如何分配?Pascal 的关键思想是:按若比赛继续进行、各自获胜的概率来分配。他与 Fermat 的通信完整解决了此问题,被很多人视为概率论的诞生。
例 4j(点数问题) 独立试验,成功概率为 \(p\)。求 \(n\) 次成功先于 \(m\) 次失败出现的概率 \(P_{n,m}\)。
- Pascal 解法:对第一次试验取条件,\(P_{n,m}=pP_{n-1,m}+(1-p)P_{n,m-1}\),边界 \(P_{n,0}=0\),\(P_{0,m}=1\)。
- Fermat 解法:\(n\) 次成功先于 \(m\) 次失败,当且仅当前 \(m+n-1\) 次试验中至少有 \(n\) 次成功(可以想象比赛结束后仍把 \(m+n-1\) 次试验做完:若至少 \(n\) 次成功,失败至多 \(m-1\) 次;反之失败至少 \(m\) 次)。于是
\[P_{n,m}=\sum_{k=n}^{m+n-1}\binom{m+n-1}{k}p^k(1-p)^{m+n-1-k}.\]
Fermat 的技巧——"假想比赛继续进行到固定的总局数"——把随机停止的问题变成了固定次数的二项问题。
白话解释:为什么是 \(m+n-1\) 局?比赛最多打这么多局就一定分出胜负:如果打满 \(m+n-1\) 局,成功和失败的次数加起来是 \(m+n-1\),不可能同时"成功不到 \(n\) 次且失败不到 \(m\) 次"(那样总数最多 \(n-1+m-1=m+n-2\))。比赛实际可能提前结束,但提前结束后多打的几局不会改变胜负:已经先拿到 \(n\) 次成功的一方,补打的局数里失败再多,前 \(m+n-1\) 局里的成功次数也已经 \(\ge n\)。所以"谁先到"与"打满后成功次数是否 \(\ge n\)"是同一个事件。Pascal 递推和 Fermat 公式的关系,就像二叉树的逐步倒推与直接对终点节点按二项概率求和,两者给出同一个数。
量化联系:Pascal"按继续下去时的获胜概率分配赌注",正是"按(风险中性)概率下的期望收益给未到期合约定价"的历史源头,第 08 册的二叉树定价就是 Pascal 递推的金融版本。
例 4k(发球规则,第 9 版新增) A、B 进行回合制比赛,先得 \(n\) 分者胜。A 发球时 A 赢该回合的概率为 \(p_A\),B 发球时为 \(p_B\),A 先发球。"胜者发球"与"轮流发球"两种规则下,A 获胜的概率相同。证明的思路仍是 Fermat 式的"假想打满 \(2n-1\) 个回合":可以论证两种规则下 A 都恰好发球 \(n\) 次、B 发球 \(n-1\) 次,所以 A 获胜的概率都等于"\(n\) 次成功率 \(p_A\)、\(n-1\) 次成功率 \(p_B\) 的独立试验中至少 \(n\) 次成功"的概率。细节见原书。
例 4l(多人赌博的最终胜者,选读) \(r\) 名玩家,玩家 \(i\) 初始有 \(n_i\) 单位,\(n=\sum n_i\)。每阶段任选两人公平对赌 1 单位,直到一人拥有全部。玩家 \(i\) 最终获胜的概率是 \(n_i/n\),与如何选对手无关。巧妙的论证:想象 \(n\) 个人各有 1 单位,由对称性每人获胜概率为 \(1/n\);把他们分成 \(r\) 队,第 \(i\) 队 \(n_i\) 人,队与队之间的输赢与原问题同构。
3.4 赌徒破产问题
例 4m(赌徒破产,gambler's ruin) A、B 对抛硬币下注:正面(概率 \(p\))A 从 B 赢 1 单位,反面 A 付 B 1 单位,直到一方输光。A 初始有 \(i\) 单位,B 有 \(N-i\) 单位。求 A 赢得全部资金的概率 \(P_i\)。
对第一次抛掷取条件:正面之后,由独立性,局面等价于 A 从 \(i+1\) 开始;反面之后等价于从 \(i-1\) 开始。记 \(q=1-p\),
边界条件 \(P_0=0\),\(P_N=1\)。利用 \(p+q=1\) 把左边写成 \(pP_i+qP_i\),整理得
由 \(P_0=0\) 递推,\(P_i-P_{i-1}=(q/p)^{i-1}P_1\)。前 \(i\) 个式子相加:
再由 \(P_N=1\) 定出 \(P_1\),最终
推导拆解:
- 从 (4.2) 到 (4.3):左边 \(P_i=(p+q)P_i=pP_i+qP_i\),代入 (4.2) 得 \(pP_i+qP_i=pP_{i+1}+qP_{i-1}\),移项 \(p(P_{i+1}-P_i)=q(P_i-P_{i-1})\),两边除以 \(p\)。它说:相邻两格的"胜率增量"按固定比例 \(q/p\) 变化。
- 反复用 (4.3):\(P_2-P_1=\frac qp(P_1-P_0)=\frac qpP_1\),\(P_3-P_2=(\frac qp)^2P_1\),……,一般 \(P_i-P_{i-1}=(q/p)^{i-1}P_1\)(用了边界 \(P_0=0\))。
- 把 \(k=1,\dots,i\) 的增量加起来,左边中间项全部抵消(望远镜求和),剩 \(P_i-P_0=P_i\);右边是公比 \(q/p\) 的几何级数,用 \(\sum_{k=0}^{i-1}r^k=\frac{1-r^i}{1-r}\) 求和。
- 令 \(i=N\):\(1=P_N=\frac{1-(q/p)^N}{1-(q/p)}P_1\),解出 \(P_1\) 代回即得 (4.5)。\(p=\frac12\) 时每步增量都等于 \(P_1\),\(P_i\) 是直线 \(i/N\)。
- 对手无限富有:\(N\to\infty\)。若 \(p>\frac12\),\(q/p<1\),\((q/p)^N\to0\),\(P_i\to1-(q/p)^i\),破产概率 \((q/p)^i\);若 \(p<\frac12\),\((q/p)^N\to\infty\),\(P_i\to0\);\(p=\frac12\) 时 \(i/N\to0\)。所以没有优势的一方,面对资金无限的对手终将破产。
由对称性(\(p\leftrightarrow q\),\(i\leftrightarrow N-i\)),B 赢得全部资金的概率 \(Q_i=\frac{1-(p/q)^{N-i}}{1-(p/q)^N}\)(\(p\ne1/2\))或 \(\frac{N-i}{N}\)。直接验证可得 \(P_i+Q_i=1\):游戏以概率 1 在有限时间内结束,"永远进行下去"的概率为 0。
数值例 A 有 5、B 有 10。\(p=1/2\) 时 A 获胜概率为 \(1/3\);\(p=.6\) 时为 \(\frac{1-(2/3)^5}{1-(2/3)^{15}}\approx.87\)。单局的小优势在长期对赌中被放大成压倒性优势。
与无限富有的对手对赌(原书理论练习 3.14):令 \(N\to\infty\),A 最终破产的概率在 \(p\le1/2\) 时为 1,在 \(p>1/2\) 时为 \((q/p)^i\)。散户与"市场"对赌就是这种情形。
历史 Fermat 于 1657 年向 Huygens 提出此问题的一个特例:A、B 各 12 枚硬币,掷 3 颗骰子,掷出 11 则 A 给 B 一枚,掷出 14 则 B 给 A 一枚。由 \(P(11)=27/216\)、\(P(14)=15/216\) 和"\(E\) 先于 \(F\)"公式,对 A 而言就是 \(p=\frac{15}{42}\)、\(i=12\)、\(N=24\) 的赌徒破产问题。一般形式由 James Bernoulli 解决,1713 年发表。
应用:序贯药物试验 两种新药治愈率 \(P_1,P_2\) 未知。成对给药,记录累计治愈差 \(\sum(X_j-Y_j)\),首次达到 \(M\) 时判定 \(P_1>P_2\),达到 \(-M\) 时判定 \(P_2>P_1\)。只看差值发生变化的那些对,差值上升的条件概率为
概率方法(例 4n,选读) 要证明集合中至少有一个元素具有某性质,可以随机选一个元素,若它不具有该性质的概率小于 1,则必然存在具有该性质的元素。原书用它证明:若 \(\binom nk<2^{k(k-1)/2-1}\),则可以把 \(n\) 顶点完全图的边涂成红蓝两色,使任意 \(k\) 个顶点之间的边都不全同色(随机着色,用 Boole 不等式估计"存在单色 \(k\) 子图"的概率)。
3.5 条件概率也是概率;条件独立
命题 5.1 固定 \(F\)(\(P(F)>0\)),\(Q(E)=P(E\mid F)\) 满足三条公理。因此前面所有命题对条件概率都成立,例如 \(P(E_1\cup E_2\mid F)=P(E_1\mid F)+P(E_2\mid F)-P(E_1E_2\mid F)\),以及条件版本的全概率公式
例 5a(保险续) 已知第一年出了事故,第二年出事故的概率是多少?对是否易出事故取条件:
条件独立(conditional independence) 若
称 \(E_1,E_2\) 在给定 \(F\) 时条件独立。
关键提醒:条件独立不意味着无条件独立。例 5a 中给定类型时两年独立,但无条件下 \(P(A_2\mid A_1)=.29\ne.26\):第一年出事故透露了"类型"的信息。反过来,独立也不意味着条件独立(原书理论练习 3.28)。
这正是因子模型和信用组合模型的核心结构:给定共同因子(宏观状态、行业)时个体条件独立,无条件下却相关。看似不相干的头寸,可能通过同一个共同因子一起出事。
金融直觉:用 CDO 的教训来理解。假设 100 笔房贷,给定房价走势(共同因子)时各自独立违约。若只看无条件违约率、再假设彼此独立去算"30 笔以上同时违约"的概率,会得到一个极小的数。但真实的联合违约来自"房价下跌"这一种情景:在这个情景下每笔违约率都抬高,大量同时违约就不再罕见。正确算法是全概率公式:先按情景分别计算(情景内可用独立性),再按情景概率加权。练习 6 就是这个结构的两资产版本。
例 5b(亲子鉴定) 先验:1 号雄猩猩是父亲的概率为 \(p\)。母亲基因型 (A,A),1 号 (a,a),2 号 (A,a),幼崽 (A,a)。\(P(M_1\mid B_{A,a})=\frac{p}{p+\frac12(1-p)}=\frac{2p}{1+p}>p\):1 号为父时幼崽必为 (A,a),2 号为父时只有 1/2 的可能,所以证据支持 1 号。
例 5c(游程竞赛) 独立试验成功概率为 \(p\)、失败概率为 \(q\)。求"连续 \(n\) 次成功"先于"连续 \(m\) 次失败"出现的概率。设 \(H\)="第一次成功"。给定 \(H\),若接下来 \(n-1\) 次都成功则事件发生;否则中途的失败抹掉之前的成功,局面等同于"以失败开始"。于是
例 5d(配对问题的递推解法) 设 \(P_n\) 为 \(n\) 人无人配对的概率。对第一个人是否拿到自己的帽子取条件,可得
例 5e(Laplace 继承法则) 盒中 \(k+1\) 枚硬币,第 \(i\) 枚正面概率为 \(i/k\)。随机取一枚反复抛,前 \(n\) 次都是正面,第 \(n+1\) 次也是正面的概率是多少?给定硬币,各次结果条件独立,所以
推导拆解:
- 分母:\(F_n\)="前 \(n\) 次全是正面"。对选中哪枚硬币取条件,每枚概率 \(\frac1{k+1}\),给定第 \(j\) 枚时各次独立,所以 \(P(F_n)=\frac1{k+1}\sum_{j=0}^k(j/k)^n\)。
- 分子:\(P(HF_n)=P(F_{n+1})=\frac1{k+1}\sum_{i=0}^k(i/k)^{n+1}\)。两者相除,\(\frac1{k+1}\) 约掉,得原文第一个等号。
- 近似:分子分母同乘 \(\frac1k\),\(\frac1k\sum_{i=0}^k(i/k)^{n+1}\) 是函数 \(x^{n+1}\) 在 \([0,1]\) 上的矩形面积和,\(k\) 大时逼近 \(\int_0^1x^{n+1}dx=\frac1{n+2}\);同理分母逼近 \(\frac1{n+1}\)。比值 \(\frac{n+1}{n+2}\)。 直觉:连续 \(n\) 次正面后,你对"硬币偏正面"的信心增加,但不会到 100%。\(n=0\) 时答案是 \(\frac12\)(毫无信息),\(n=8\) 时是 \(0.9\)。把它用到胜率估计上:一个策略 10 笔交易 7 笔赢,朴素估计 0.7,继承法则给 \(\frac{8}{12}\approx0.67\),向 0.5 收缩了一点。
推广:\(n\) 次中有 \(r\) 次正面时,下一次正面的概率约为 \(\frac{r+1}{n+2}\)(原书理论练习 3.30)。这是"对胜率做收缩估计"的最简单形式,第 06b 章会用 Beta 分布重新理解它。
序贯更新信息
例 5f 有 \(n\) 个互斥穷尽假设 \(H_i\),先验为 \(P(H_i)\)。先得知 \(E_1\)、再得知 \(E_2\) 时,能否把 \(P(H_i\mid E_1)\) 当作新的先验,再用 Bayes 公式处理 \(E_2\)?
答案:**当对每个 \(j\),\(E_1,E_2\) 在给定 \(H_j\) 下条件独立时可以。**证明:此时 \(P(E_1E_2\mid H_j)=P(E_1\mid H_j)P(E_2\mid H_j)\),于是
例如两枚硬币之一被选来抛,正面概率分别为 \(p_1,p_2\)。每抛一次,只需保存"当前是硬币 1 的后验概率",不必记录全部历史。这正是递推 Bayes 滤波的思想,第 06 册隐马尔可夫模型与状态识别都建立在它之上。
量化实战
1. 基础率谬误:显著因子有多少是真的
把例 3d 的"患病"换成"因子真有效","检测阳性"换成"回测显著":检验功效(真因子被判显著的概率)80%,显著性水平 5%,若候选因子中只有 10% 真的有效,那么显著因子中真因子的比例只有 \(\frac{.8\times.1}{.8\times.1+.05\times.9}=0.64\);若只有 2% 有效,比例降到约 25%。挖得越"野",先验越低,显著结果越不可信。
2. 序贯 Bayes:在线判断策略是否真有优势
假设只有两种可能:策略真有优势(胜率 .55),或只是噪声(胜率 .50),先验认为有优势的概率为 0.2。给定假设时各笔交易结果条件独立,所以可以用例 5f 的方法逐笔更新:每来一笔交易,把赔率乘以似然比。
3. 赌徒破产 = 止损止盈
原书习题 3.81:股价 25,跌到 10 止损、涨到 40 止盈,每步涨 1 的概率为 .55、跌 1 为 .45。以 10 为"0 点",这就是 \(i=15,N=30,p=.55\) 的赌徒破产问题。下面再看一个更贴近实务的问题:单笔优势很小(\(p=0.51\))时,资金规模(以单笔风险为单位)对"先翻倍还是先亏光"有多大影响。
import numpy as np
rng = np.random.default_rng(7)
# ---------- 1) 基础率:显著因子中真因子的比例 ----------
power, alpha = 0.8, 0.05
print("先验真因子比例 P(真|显著)")
for prior in (0.5, 0.2, 0.1, 0.02):
ppv = power * prior / (power * prior + alpha * (1 - prior))
print(f"{prior:12.2f} {ppv:10.3f}")
# ---------- 2) 序贯 Bayes:策略是真 alpha(胜率 .55) 还是噪声(胜率 .50)? ----------
p_H, p_N, prior_H = 0.55, 0.50, 0.2
trades = rng.random(400) < p_H # 真实情况:策略确有优势
post = prior_H
path = []
for w in trades: # 每笔交易后:后验赔率 = 先验赔率 × 似然比
lr = (p_H if w else 1 - p_H) / (p_N if w else 1 - p_N)
odds = post / (1 - post) * lr
post = odds / (1 + odds)
path.append(post)
k, n = trades.sum(), len(trades)
batch_odds = prior_H / (1 - prior_H) * (p_H / p_N) ** k * ((1 - p_H) / (1 - p_N)) ** (n - k)
print(f"\n{n} 笔交易中盈利 {k} 笔")
print("第 50/100/200/400 笔后的后验 P(真alpha):",
[round(path[i - 1], 3) for i in (50, 100, 200, 400)])
print(f"序贯更新结果 {post:.4f} vs 一次性 Bayes {batch_odds/(1+batch_odds):.4f}")
# ---------- 3) 赌徒破产 = 止损止盈:原书习题 3.81 ----------
def ruin_win_prob(i, N, p):
"""从 i 出发,先到 N 的概率(先到 0 则失败)"""
if p == 0.5:
return i / N
r = (1 - p) / p
return (1 - r**i) / (1 - r**N)
def mc_win_prob(i, N, p, n_paths=20000):
x = np.full(n_paths, i)
alive = np.ones(n_paths, bool)
while alive.any():
step = np.where(rng.random(alive.sum()) < p, 1, -1)
x[alive] += step
alive &= (x > 0) & (x < N)
return (x == N).mean()
# 股价 25,跌到 10 止损、涨到 40 止盈;每步 +1 概率 .55
print(f"\n习题 3.81: 公式 {ruin_win_prob(15, 30, 0.55):.4f} 蒙特卡洛 {mc_win_prob(15, 30, 0.55):.4f}")
# 单笔优势很小 (p=0.51),资金规模对"先翻倍还是先输光"的影响
print("\np=0.51, 起始资金 i, 目标 2i: P(先翻倍)")
for i in (5, 20, 50, 100, 200):
print(f" i={i:4d}: {ruin_win_prob(i, 2 * i, 0.51):.4f}")
print("p=0.51, 对手无限富有时最终破产概率 (q/p)^i:",
{i: round((0.49 / 0.51) ** i, 4) for i in (5, 20, 50, 100)})
关键输出:
先验真因子比例 P(真|显著)
0.50 0.941
0.20 0.800
0.10 0.640
0.02 0.246
400 笔交易中盈利 215 笔
第 50/100/200/400 笔后的后验 P(真alpha): [0.303, 0.381, 0.358, 0.405]
序贯更新结果 0.4046 vs 一次性 Bayes 0.4046
习题 3.81: 公式 0.9530 蒙特卡洛 0.9505
p=0.51, 起始资金 i, 目标 2i: P(先翻倍)
i= 5: 0.5498
i= 20: 0.6900
i= 50: 0.8808
i= 100: 0.9820
i= 200: 0.9997
p=0.51, 对手无限富有时最终破产概率 (q/p)^i: {5: 0.8187, 20: 0.4493, 50: 0.1353, 100: 0.0183}
几点读法:
- 序贯更新与一次性 Bayes 结果完全相同,验证了例 5f 的结论。更值得注意的是:即使策略真有 5 个百分点的胜率优势,400 笔交易后后验也只从 0.2 升到约 0.4。弱优势需要大量证据才能确认,这也是第 04b、05 章用二项分布和正态近似计算样本量的动机。
- 优势只有 1 个百分点时,若每笔风险占资金的 1/5(\(i=5\)),先翻倍的概率只有 55%;把单笔风险降到资金的 1/100(\(i=100\)),概率升到 98%。**正期望不等于不会破产,仓位大小决定了优势能否兑现。**这是破产风险(risk of ruin)分析和仓位管理的出发点。
- 价格的 \(\pm1\) 随机游走只是粗糙模型,但它给出的定性结论(漂移、波动、边界距离三者如何共同决定触达概率)在第 08 册的布朗运动首达时间问题中依然成立。
本章小结
条件概率 \(P(E\mid F)=P(EF)/P(F)\) 就是"把 \(F\) 当作新的样本空间",固定 \(F\) 时它本身满足全部公理。三件核心工具是:乘法法则(把联合概率拆成条件概率链)、全概率公式(对一个分割取条件再加权平均)、Bayes 公式(由 \(P(E\mid H)\) 反推 \(P(H\mid E)\))。赔率形式"后验赔率 = 先验赔率 × 似然比"最清楚地说明了证据的作用:证据支持假设当且仅当它在假设成立时更可能出现;后验对先验和基础率很敏感;观察机制会改变答案。独立的定义是乘积公式,多事件独立需要所有子集的乘积公式;独立与互斥、独立与条件独立都是不同的概念。"对第一步取条件 + 独立性使局面重新开始"是建立递推方程的通用方法,由此解出了"\(E\) 先于 \(F\)"、点数问题、赌徒破产、游程竞赛等经典问题。
| 概念 | 公式 |
|---|---|
| 条件概率 | \(P(E\mid F)=P(EF)/P(F)\) |
| 乘法法则 | \(P(E_1\cdots E_n)=P(E_1)P(E_2\mid E_1)\cdots P(E_n\mid E_1\cdots E_{n-1})\) |
| 全概率公式 | \(P(E)=\sum_iP(E\mid F_i)P(F_i)\) |
| Bayes 公式 | \(P(F_j\mid E)=\dfrac{P(E\mid F_j)P(F_j)}{\sum_iP(E\mid F_i)P(F_i)}\) |
| 赔率形式 | \(\dfrac{P(H\mid E)}{P(H^c\mid E)}=\dfrac{P(H)}{P(H^c)}\cdot\dfrac{P(E\mid H)}{P(E\mid H^c)}\) |
| 独立 | \(P(EF)=P(E)P(F)\);多事件需所有子集成立 |
| 条件独立 | \(P(E_1E_2\mid F)=P(E_1\mid F)P(E_2\mid F)\) |
| \(E\) 先于 \(F\) | \(\dfrac{P(E)}{P(E)+P(F)}\) |
| 点数问题(Fermat) | \(P_{n,m}=\sum_{k=n}^{m+n-1}\binom{m+n-1}{k}p^k(1-p)^{m+n-1-k}\) |
| 赌徒破产 | \(P_i=\dfrac{1-(q/p)^i}{1-(q/p)^N}\)(\(p\ne\frac12\)),\(\dfrac iN\)(\(p=\frac12\)) |
| 对无限富有对手 | 破产概率 \(=1\)(\(p\le\frac12\)),\((q/p)^i\)(\(p>\frac12\)) |
| Laplace 继承法则 | \(P(\text{下次成功}\mid n\text{ 次全成功})\approx\frac{n+1}{n+2}\) |
练习
基础
- 掷两颗骰子,已知两颗点数不同,求至少一颗是 6 的概率。(原书习题 3.1 类型) 答案:缩小样本空间 30 个结果,含 6 的有 10 个,概率 \(1/3\)。
- 某预警信号对"次日暴跌"的检出率为 90%,在非暴跌日的误报率为 10%,暴跌日占全部交易日的 2%。信号发出时次日暴跌的概率是多少? 答案:\(\frac{.9\times.02}{.9\times.02+.1\times.98}=\frac{.018}{.116}\approx0.155\)。
- 举一个两两独立但不相互独立的例子。(原书理论练习 3.9) 答案:抛两次硬币,\(A\)=第一次正面,\(B\)=第二次正面,\(C\)=两次结果相同。两两独立,但 \(P(ABC)=1/4\ne1/8\)。
- 反复掷两颗骰子,求点数和 6 先于 7 出现的概率。 答案:\(\frac{5/36}{5/36+6/36}=\frac5{11}\)。
- 证明:若 \(P(E)>0,P(F)>0\) 且 \(E,F\) 互斥,则 \(E,F\) 不独立。 提示:\(P(EF)=0<P(E)P(F)\)。
进阶
- 两只股票在给定宏观状态时各自独立:好状态(概率 0.7)下每只下跌的概率为 0.2,坏状态下为 0.6。求两只同时下跌的概率,并与"假设两只无条件独立"时的结果比较。 答案:\(0.7\times0.04+0.3\times0.36=0.136\);单只下跌概率 \(0.7\times0.2+0.3\times0.6=0.32\),若独立则为 \(0.1024\)。忽视共同因子会低估联合下跌风险约 25%。
- 用 Pascal 递推与 Fermat 公式分别计算 \(p=0.6\) 时 \(P_{2,3}\)(2 次成功先于 3 次失败),验证二者一致。 答案:Fermat:前 4 次中至少 2 次成功,\(1-0.4^4-4(0.6)(0.4)^3=1-0.0256-0.1536=0.8208\)。
- 交易员账户有 20 个单位资金,每笔交易赢 1 单位的概率为 0.52、输 1 单位为 0.48。(a) 他在资金达到 40 前亏光的概率是多少?(b) 若与"无限富有的市场"一直交易下去,最终亏光的概率是多少? 答案:(a) 记 \(r=0.48/0.52\),先到 40 的概率为 \(\frac{1-r^{20}}{1-r^{40}}\approx0.832\),所以先亏光的概率约 0.168;(b) \(r^{20}\approx0.20\)。
- 证明 \(P(E\mid E\cup F)=\frac{P(E)}{P(E)+P(F)}\) 对互斥的 \(E,F\) 成立,并解释它与"\(E\) 先于 \(F\)"公式的关系。(原书理论练习 3.5) 提示:第一次发生 \(E\) 或 \(F\) 的那次试验,其结果是 \(E\) 的条件概率。
- 某基金经理连续 10 年跑赢基准。假设"有能力者"每年跑赢的概率为 0.7、"无能力者"为 0.5,市场上有能力者占 5%,且给定能力时各年独立。求该经理有能力的后验概率;如果你是从 1 万名经理中专门挑出这位"连赢 10 年"的人,结论会有什么不同? 答案:似然比 \((1.4)^{10}\approx28.9\),先验赔率 \(1/19\),后验赔率约 1.52,后验概率约 0.60。若是在大量经理中事后挑出来的,观察机制决定了"总有人连赢"(1 万名无能力者中约 10 人会连赢 10 年),应当按挑选机制重新建模,不能把这次连赢当作随机抽样得到的证据。
原书推荐习题:Problems 3.24、3.44(观察机制:金漆问题、三囚犯问题)、3.25、3.27(抽样偏差)、3.49、3.52(序贯 Bayes 更新)、3.57(股价随机游走)、3.58(von Neumann 去偏法)、3.59(模式先出现)、3.66–3.67(条件化求可靠性)、3.81(止损止盈 = 赌徒破产)、3.90(独立与条件独立);Theoretical Exercises 3.7、3.8(Simpson 型反例)、3.9、3.14(对无限富有对手的破产概率)、3.15(负二项)、3.16、3.20、3.22(两状态马尔可夫链雏形)、3.21(选票问题)、3.28、3.30;Self-Test 3.5(可交换性)、3.7、3.18(赌徒谬误)、3.25(条件独立导致相关)、3.27(Pólya 瓮)。
原书对照
| 本章小节 | 原书章节 | PDF 页码 | 书内页码 |
|---|---|---|---|
| 3.1 条件概率 | 3.1 Introduction;3.2 Conditional Probabilities | p.69–75 | p.56–62 |
| 3.2 全概率公式与 Bayes 公式 | 3.3 Bayes's Formula | p.75–88 | p.62–75 |
| 3.3 独立事件 | 3.4 Independent Events(例 4a–4l) | p.88–97 | p.75–84 |
| 3.4 赌徒破产问题 | 3.4 Independent Events(例 4m、序贯药物试验、例 4n) | p.97–102 | p.84–89 |
| 3.5 条件概率也是概率;条件独立 | 3.5 \(P(\cdot\mid F)\) Is a Probability | p.102–110 | p.89–97 |
| 小结与习题 | Summary, Problems, Theoretical Exercises, Self-Test | p.110–124 | p.97–111 |
(书内页码 = PDF 页码 − 13。3.4 节内部的分界页码为根据精读笔记推定的近似值。)