第 22b 章 绩效评估(下):技能与运气的统计检验
对应 Harris《Trading and Exchanges》第 22 章后半部分(22.4–22.10)。这是全书对量化研究者最有警示意义的一节:用 t 检验和功效计算说明,从过去收益中区分技能与运气需要的数据远多于通常可得的数据;在“从一大群人中挑最好的”时,标准检验完全失效;比索问题、收益平滑与庞氏骗局让统计检验更不可靠;样本选择偏差可能比任何其他错误造成的损失都多。最后,作者给出经济学的替代方法:看比较优势。把文中的“经理”换成“策略”或“因子”,这一章就是回测过拟合与多重检验问题的入门课。
学习目标
读完本章,你应当能够:
- 写出检验经理技能的 t 统计量,计算检验的功效,复算原书表 22-2、22-3 并解释“2% 技能、7% 噪声”为何几乎不可检验。
- 说明功效取决于样本时长而非抽样频率,并给出所需年数的近似公式 \(T\approx\big((z_{\text{conf}}+z_{\text{power}})\sigma/\mu\big)^2\)。
- 用决策论复算表 22-5,理解“选择主动经理的期权价值”为何极小,即支持指数化的统计论证。
- 用顺序统计量计算 N 个无技能经理中最幸运者的表现分布(表 22-6),说明经理间相关性如何降低有效群体规模(表 22-7),并正确评估巴菲特的业绩。
- 识别比索问题、收益平滑、庞氏骗局和样本选择偏差(幸存者偏差、基金孵化、荐股信骗局、自我归因偏差),理解均值回归的含义。
- 用比较优势(而非绝对优势)的框架评估经理与策略,并把本章结论迁移到回测的多重检验问题上。
读前导读
这一章在解决什么问题。 CFA 的统计部分教你做 t 检验、看 p 值;绩效部分教你算信息比率、Jensen alpha;GIPS 教你规范地呈报业绩。这一章把三者放在一起,得出一个让从业者不舒服的结论:即使业绩数字完全真实、计算完全规范,用统计检验从过去收益中识别经理技能也几乎做不到。原因是信噪比太低:一个优秀经理一年多赚 2%,而运气带来的年度波动约 7%,要攒够把握需要几十年。更糟的是,我们看到的经理本来就是被"挑出来"的:媒体只报道赢家,基金公司只保留好产品,这让标准检验彻底失效。
和你已有知识的连接点很多。t 统计量 \(\bar r/(s/\sqrt n)\) 和 CFA 一级的均值检验完全一样;本章新增的是"功效"(检验有多大概率抓到真正有技能的人),也就是 1 减去第二类错误概率。市场调整收益的标准差 \(\sigma_{\text{Adj}}\) 就是 CFA 里的跟踪误差(主动风险),\(\mu/\sigma_{\text{Adj}}\) 就是信息比率,所以本章的核心公式可以记成"\(t\approx\text{IR}\times\sqrt{\text{年数}}\)"。样本选择偏差部分,则解释了 GIPS 为什么要求所有符合条件的组合都纳入综合(composite)、不得剔除已终止的组合:这正是在制度上防止幸存者偏差和"只展示赢家"。
需要先想起来的数学。
- 标准正态分布函数 \(\Phi\) 与分位数 \(\Phi^{-1}\)。 \(\Phi(x)\) 是标准正态变量小于 \(x\) 的概率,\(\Phi^{-1}(q)\) 是它的反函数(给概率求临界值)。例如 \(\Phi(1.645)=0.95\),\(\Phi^{-1}(0.75)=0.674\)。符号 \(z_c\) 就是 \(\Phi^{-1}(c)\)。见 第 00 册第 07 章 概率中的分析工具。
- 两个变量之差的方差。 \(\mathrm{Var}(X-Y)=\mathrm{Var}X+\mathrm{Var}Y-2\rho\sigma_X\sigma_Y\),用来算跟踪误差。
- 独立事件的概率相乘。 \(N\) 个独立经理都低于 \(x\) 的概率是单个概率的 \(N\) 次方,所以最佳者低于 \(x\) 的概率为 \(\Phi(\cdot)^N\)。至少一人超过的概率 \(=1-(1-p)^N\)。这是"顺序统计量"(把样本排序后第几大的值的分布)的最简单情形。
- 第一类、第二类错误。 第一类错误是把无技能者判为有技能(概率 \(=1-\) 置信水平),第二类错误是把有技能者判为无技能(概率 \(=1-\) 功效)。见 第 00 册第 08 章 读懂数学证明与符号 中关于条件与量词的部分,有助于读清"在……的条件下"的表述。
怎么读这一章。 22.5.1–22.5.3(t 检验、功效、所需年数)是全章的数学核心,必读,下面的推导拆解会把三个公式串起来。22.5.4 支持指数化的论证和 22.5.5 最幸运者的分布是两个最重要的应用,必读。22.5.6 讲降噪手段,可以快读。22.6 比索问题与欺诈性收益、22.7 样本选择偏差偏案例,读起来轻松但很重要,尤其是 22.7.3 均值回归。22.8 经济学方法是正面建议,读一遍抓住"比较优势"一词即可。如果你做量化研究,章末"迁移到回测"的七条值得反复看。
22.5 为什么统计评估如此困难
上一章的实证结论是:过去绩效几乎不能预测未来。主要原因是过去绩效通常更多由运气而非技能决定,不可预测的收益因素常常掩盖了技能能增加的价值。这并不奇怪:知情者让多数价格的信息含量很高,未来价格变化在很大程度上不可预测,即使对知情者也是如此;知情者之间的竞争确保很少有人对未来有很好的洞见,因此即使高技能经理,平均收益也不会特别高。
统计学家的做法是:先用概率论刻画“经理没有技能、只有运气”时收益的分布;如果实际的市场调整收益显著大于仅凭运气的典型值,就推断有运气以外的因素,可能是技能。作者强调的最重要原则是:统计绩效评估一般不可靠。实际中通常需要 20 年以上的数据才能对单个经理得到有用的结果;要判断从一大群经理中挑出的最成功者是有技能还是幸运,需要更多。
22.5.1 t 检验
把经理的平均市场调整收益除以均值的标准误(standard error of the mean):
标准误与“仅凭运气时预期观察到的平均收益的大小”成正比。\(t\) 大时,推断运气不太可能单独解释收益。例:经理无技能时,\(t>1.64\) 的概率只有 5%(单侧检验);以此为临界值判断技能,有 5% 的时候会把无技能者误判为有技能。
临界值主要取决于检验的置信水平(confidence level)(此例 95%),较少取决于样本量。判别力较弱的检验临界值更小:90% 置信水平对应约 1.28(原书写 1.31,是小样本 t 分布的值,正态下为 1.28);50% 置信水平对应 0——仅凭运气时,平均收益有一半时间为正。统计学家通常说显著性水平(significance level)= 1 − 置信水平,原书为避免混淆用置信水平。
检验为什么有效?运气与技能对平均收益的长期效应不同:运气完全随机,好坏运气一样常见,时间够长时净效应很小;技能有系统性正效应,长期内有技能的经理应跑赢市场。
原书专栏“Student 的啤酒样本”:t 检验和 t 分布由 W. S. Gosset 提出,他是健力士(Guinness)啤酒厂的统计学家,1908 年为分析小批量啤酒样本的质量发明了 t 检验;酒厂不让他用真名发表,他用了笔名 Student。
22.5.2 功效计算
功效(power):经理确有技能时,t 统计量超过临界值的概率,即“识别出有技能经理”的概率。它受四个因素影响:置信水平越低,临界值越小,功效越高;技能越高,功效越高;运气越重要,功效越低;数据年数越多,好坏运气相互抵消,功效越高。
参数设定:
- 技能用“预期每年平均跑赢市场多少”量化。知情者的竞争、信息成本和市场的信息效率使高预期超额收益不现实——多数职业经理若确信能平均每年跑赢市场 2%,会高兴得无法形容。 参照:巴菲特截至 2000 年的 36 年平均每年跑赢市场 11.8%,但 1991–2000 年降为 6.8%;彼得·林奇管理麦哲伦基金 13 年平均每年跑赢 12.7%,最后五年只有 5.1%。超级明星都没能维持早期表现,说明早期可能相当幸运(也可能是基金越来越大)。所以假设典型有技能经理的技能为 2% 是合理的。
- 运气用仅凭运气时市场调整收益的标准差量化:
\[ \sigma_{\text{Adj}}=\sqrt{\sigma_{\text{port}}^2+\sigma_{\text{mkt}}^2-2\rho\,\sigma_{\text{port}}\sigma_{\text{mkt}}}. \]分散化组合合理的年度参数为 \(\sigma_{\text{port}}=16\%\)、\(\sigma_{\text{mkt}}=14.5\%\)、\(\rho=0.9\),得 \(\sigma_{\text{Adj}}=\sqrt{256+210.25-417.6}\approx7.0\%\)。
金融直觉:\(\sigma_{\text{Adj}}\) 就是 CFA 里的跟踪误差(tracking error,主动风险):组合收益减市场收益的标准差。公式是"两资产组合方差"在权重 \(+1\)、\(-1\) 时的特例,第三项 \(2\rho\sigma_p\sigma_m=2\times0.9\times16\times14.5=417.6\)。注意相关系数的威力:组合本身波动 16%、市场 14.5%,两者都很大,但相关系数 0.9 让差值的波动只剩 7%;若相关系数降到 0.8,跟踪误差升到约 9.7%。技能 \(\mu\) 除以跟踪误差就是信息比率,这里 \(2\%/7\%\approx0.29\),在业内属于中等偏上的水平。
在正态假设下,t 统计量的“非中心参数”为
\(T\) 为年数。
推导拆解:功效公式从哪里来? 第一步,设经理真实技能为 \(\mu\)(年化),用 \(T\) 年数据估计的年均超额收益 \(\bar r\) 近似服从正态,均值 \(\mu\),标准差 \(\sigma/\sqrt T\)(均值的标准误)。 第二步,t 统计量 \(t=\bar r/(\sigma/\sqrt T)\) 于是近似服从均值为 \(\delta=\mu\sqrt T/\sigma\)、标准差为 1 的正态分布。\(\delta\) 叫"非中心参数",意思是有技能时 t 统计量的分布中心偏离了 0。无技能时 \(\delta=0\),t 围绕 0 波动。 第三步,判为有技能的条件是 \(t>z_{\text{conf}}\)。\(t-\delta\) 是标准正态,所以 \(P(t>z_{\text{conf}})=P(t-\delta>z_{\text{conf}}-\delta)=1-\Phi(z_{\text{conf}}-\delta)\)。 代入数字:\(\mu=2\%\),\(T=5\),\(\sigma=7\%\),\(\delta=0.02\times2.236/0.07\approx0.64\);95% 置信 \(z=1.645\),功效 \(=1-\Phi(1.645-0.64)=1-\Phi(1.01)\approx16\%\),即表中 5 年那格(原书 15%)。 换个说法:\(\delta=(\mu/\sigma)\sqrt T=\text{IR}\times\sqrt T\)。信息比率 0.29 的经理,要让 t 统计量的中心达到 1.645,需要 \((1.645/0.29)^2\approx33\) 年,这就是表 22-3 中"功效 50%、置信 95%"那格。
原书表 22-2(月度数据、年化标准差 7%):
| 真实技能 | 置信水平 | 1 年 | 5 年 | 10 年 |
|---|---|---|---|---|
| 0% | 50% / 75% / 95% | 50% / 25% / 5% | 同左 | 同左 |
| 2% | 50% | 61% | 74% | 82% |
| 2% | 75% | 34% | 48% | 59% |
| 2% | 95% | 8% | 15% | 23% |
| 4% | 50% | 71% | 90% | 96% |
| 4% | 75% | 45% | 72% | 87% |
| 4% | 95% | 12% | 35% | 56% |
(技能为 0 时,任意年数下被判为有技能的概率都等于 1 − 置信水平。精读笔记中这一行的抽取数值与置信水平列重复,这里按定义给出,下文代码也验证了这一点。)
解读:如果要 95% 确信不把无技能经理当成有技能,用 5 年月度数据识别出 2% 技能经理的概率只有 15%,再加 5 年也只升到 23%。降到 75% 置信水平(四次中有一次把无技能当有技能),5 年识别率 48%,10 年 59%。50% 置信水平下识别率 74%、82%——作为对比,抛硬币识别有技能者的概率也是 50%。
22.5.3 需要多少数据
把功效公式反解,得到达到置信水平 \(c\) 与功效 \(p\) 所需的年数:
例:\(\mu=2\%\)、\(\sigma=7\%\)、置信与功效都为 75%(\(z=0.674\)):\(T\approx(1.349\times3.5)^2\approx22\) 年。
推导拆解:反解只需一步。要求功效为 \(p\):\(1-\Phi(z_c-\delta)=p\),即 \(\Phi(z_c-\delta)=1-p\),所以 \(z_c-\delta=\Phi^{-1}(1-p)=-z_p\)(正态分布对称)。于是 \(\delta=z_c+z_p\)。再把 \(\delta=\mu\sqrt T/\sigma\) 代入、两边平方,得 \(T=((z_c+z_p)\sigma/\mu)^2\)。 两个读法:其一,公式对 \(z_c\) 和 \(z_p\) 对称,所以表中"置信 75%、功效 50%"与"置信 50%、功效 75%"所需年数相同,这正是脚注判断原表 50% 列有误的依据。其二,所需年数与 \((\sigma/\mu)^2\) 成正比:噪声减半或技能翻倍,所需年数降为四分之一。这和 CFA 里"样本量与标准误的平方成反比"是同一个关系。
原书表 22-3:
| 技能 | 功效 \ 置信水平 | 50% | 75% | 95% |
|---|---|---|---|---|
| 2%/年 | 50% | 0 | 6 | 33 |
| 2%/年 | 75% | 0* | 22 | 66 |
| 2%/年 | 95% | 0* | 66 | 132 |
| 4%/年 | 50% | 0 | 2 | 8 |
| 4%/年 | 75% | 0* | 6 | 17 |
| 4%/年 | 95% | 0* | 17 | 33 |
* 精读笔记中 50% 置信水平一列全为 0。但按上面的公式,所需年数对置信与功效是对称的:置信 50%、功效 75% 应与置信 75%、功效 50% 相同(约 6 年),置信 50%、功效 95% 应约为 33 年(4% 技能时为 1.4 和 8 年)。只有“置信 50%、功效 50%”才是 0。这一列很可能是抽取错误,下文代码给出按公式计算的值,需要时请核对原书。
结论:即使是低置信、低功效的检验,也需要多于通常可得的数据——技能 2%、置信 75%、功效 75% 要 22 年月度数据;即使技能高达 4%,同样标准也要 6 年。原书专栏“一年的数据根本不够”:在任何不会经常把无技能者判为有技能的检验中,一年数据正确识别真正有技能经理的概率不到 10%——报纸上满版宣传“去年收益”的基金广告,对判断经理技能基本毫无价值(当然,只有去年表现好的才做广告)。
22.5.4 支持指数化的统计论证
置信水平和功效该取多少,取决于检验结果的用途。设决策规则:检验认为经理有技能就投给他,否则投指数基金。在给定样本量下,选择置信水平(进而决定功效)以最大化预期市场调整收益。假设:
- 有技能经理费前平均每年产生 2% 市场调整收益;
- 交易是零和博弈,设 1/3 的经理有技能,则无技能经理费前平均每年跑输约 1%:\(\tfrac13\times2\%+\tfrac23\times(-1\%)=0\)(作者认为这一假设偏宽松);
- 所有主动经理扣费后平均每年跑输市场超过 1%(1962–1997 年美国股票共同基金平均每年跑输标普 500 1.4%),假设费用恰为 1%,于是有技能经理费后跑赢 1%,无技能经理费后跑输 2%;
- 指数基金跑输市场 0.15%。
四种状态(原书表 22-4):
| 检验结果 \ 真实状态 | 有技能(概率 1/3) | 无技能(概率 2/3) |
|---|---|---|
| 判为有技能 → 投主动经理 | +1.00%;概率 \(\tfrac13\times\text{Power}\) | −2.00%;概率 \(\tfrac23\times(1-\text{Conf})\)(第一类错误) |
| 判为无技能 → 投指数基金 | −0.15%;概率 \(\tfrac13\times(1-\text{Power})\)(第二类错误) | −0.15%;概率 \(\tfrac23\times\text{Conf}\) |
相对指数基金的预期超额收益为
其中功效按两类经理费后收益之差(3%)计算:\(\text{Power}=1-\Phi\big(z_{\text{Conf}}-0.03\sqrt T/0.07\big)\)。
推导拆解:\(E\) 的两个系数怎么来的?以"投指数基金"为参照(收益 −0.15%),只有"判为有技能"的两格与参照不同。 有技能且被选中:比指数多 \(1.00\%-(-0.15\%)=1.15\%\),概率 \(\tfrac13\times\text{Power}\)。 无技能却被选中:比指数少 \(-2.00\%-(-0.15\%)=-1.85\%\),概率 \(\tfrac23\times(1-\text{Conf})\)。 两者相加即 \(E\)。提高置信水平会同时压低第二项(少犯第一类错误)和第一项(功效下降),最优置信水平就是两者在边际上平衡的点,与上一章"激进程度的边际条件"是同一种权衡。 金融直觉:这和信贷审批的决策完全相同。批准一笔好贷款赚一点利差,批准一笔坏贷款损失大得多,而且好客户只占少数,所以最优审批标准一定很严;在信息很少(年数少)时,最优策略就是几乎全部拒绝,也就是投指数基金。
原书表 22-5 的最优结果:
| 年数 | 最优置信水平 | 最优功效 | 相对指数基金的最大年化超额 | 投资主动经理的概率 |
|---|---|---|---|---|
| 1 | 100% | 0% | 0.000% | 0% |
| 2 | 99% | 4% | 0.001% | 2% |
| 5 | 95% | 24% | 0.030% | 11% |
| 10 | 94% | 42% | 0.086% | 18% |
| 20 | 94% | 64% | 0.171% | 25% |
| 50 | 97% | 87% | 0.298% | 31% |
解读:所有样本量下最优检验都要求高置信水平——投给无技能经理的代价大,而有技能经理稀少。小样本时几乎总是投指数基金。即使检验能完美区分,预期价值也只有 \(\tfrac13\times1.15\%=0.383\%\);有 50 年数据时也只拿到其中 78%(0.298%)。这个最大化的预期超额收益,就是**“在主动经理与指数基金之间做选择”这一期权的价值**。10 年数据时它只有 8.6 个基点。难怪许多投资者干脆忽略这一期权,直接投指数基金。
22.5.5 在众多经理中选择:最幸运者的表现
现实中投资者很少只在一个经理和指数基金之间选,而是考察许多经理,而且通常只看已知表现好的那些。一大群经理中表现最好的人总是表现非常好——大群体中的极端运气可以产生惊人的结果;对他们做标准检验,总会显示“有技能”。
但这时标准检验极不可靠。标准检验回答的是“随机挑选的一个经理是否有技能”;而我们考察他,恰恰是因为知道他表现好。正确的问题是:“已知他是一大群经理中表现最好者之一,他是否有技能?”这是不同的问题,需要不同的检验——今天称之为多重检验(multiple testing)或数据窥探(data snooping)问题。
若 \(N\) 个无技能经理的年均市场调整收益独立同分布于 \(N(0,\sigma^2/T)\),则最佳者收益的分布函数为 \(\Phi(x\sqrt T/\sigma)^N\),其 \(q\) 分位数为
推导拆解:最大值的分布为什么是 \(\Phi(\cdot)^N\)? 第一步,"最佳者的收益不超过 \(x\)"等价于"所有 \(N\) 个人的收益都不超过 \(x\)"。 第二步,单个人不超过 \(x\) 的概率是 \(\Phi\big(x/(\sigma/\sqrt T)\big)=\Phi(x\sqrt T/\sigma)\)(先标准化,再查正态表)。 第三步,\(N\) 人独立,概率相乘,得 \(\Phi(x\sqrt T/\sigma)^N\)。 第四步,求 \(q\) 分位数:令 \(\Phi(x_q\sqrt T/\sigma)^N=q\),两边开 \(N\) 次方得 \(\Phi(x_q\sqrt T/\sigma)=q^{1/N}\),再取反函数即得原式。 数值例:\(N=10{,}000\)、\(T=1\)、中位数 \(q=0.5\)。\(0.5^{1/10000}=e^{\ln0.5/10000}\approx1-0.0000693\),对应的正态分位数约 3.81,所以最佳者中位数 \(\approx7\%\times3.81\approx26.7\%\),即表中 1 年、1 万人那格。直观上,\(N\) 越大,\(q^{1/N}\) 越接近 1,最佳者就落在越远的右尾。
原书表 22-6(作者用模拟得到,节选;年化标准差 7%):
| 期间 | 群体规模 | 最佳者:中位数 | 75 分位 | 95 分位 |
|---|---|---|---|---|
| 1 年 | 10 | 10.5% | 13.3% | 18.0% |
| 1 年 | 1,000 | 22.4% | 24.1% | 27.2% |
| 1 年 | 10,000 | 26.7% | 28.2% | 30.9% |
| 1 年 | 1,000,000 | 33.8% | 35.0% | 37.3% |
| 5 年 | 10,000 | 11.9% | 12.6% | 13.8% |
| 10 年 | 10 | 3.3% | 4.2% | 5.7% |
| 10 年 | 1,000 | 7.1% | 7.6% | 8.6% |
| 10 年 | 10,000 | 8.4% | 8.9% | 9.8% |
| 10 年 | 1,000,000 | 10.7% | 11.1% | 11.8% |
(原表还给出第 99 百分位经理的分布,例如 1 万人、10 年时其中位数约 5.1%。)
解读:一半的年份里,1 万名无技能经理中最好的一位跑赢市场近 27%;10 年期,最幸运者在一半的情形下年均跑赢 8% 以上。这些数字都远大于有技能经理平均能产生的 2%——很幸运比有技能但运气一般好得多。若想在考察 1 万人中最佳经理的 10 年收益时有 95% 以上把握不把无技能者当成有技能,必须把年均市场调整收益低于约 10% 的经理都判为无技能——这样的检验除了最幸运(或最有技能)者外基本没有功效。而且此表大大低估了最幸运经理的实际表现:表现最好(和最差)的经理通常持有不分散的组合,其收益标准差远大于 7%。
相关性降低有效群体规模(原书专栏“给统计学家的最后一句话”)。 实际中许多经理用相似策略,收益相关。极端情形下所有经理用同一策略、结果完全相同,最佳者的分布与人数无关——有效群体规模(effective group size)只有 1。原书表 22-7(1 万名经理、10 年):
| 相关系数 | 最佳者:中位数 | 75 分位 | 95 分位 |
|---|---|---|---|
| 0.00 | 8.4% | 8.9% | 9.8% |
| 0.25 | 7.4% | 8.2% | 9.5% |
| 0.50 | 6.0% | 7.1% | 8.7% |
| 0.75 | 4.3% | 5.6% | 7.5% |
| 1.00 | 0.0% | 1.5% | 3.7% |
相关系数 0.25 时,1 万名经理中最佳者的分布与约 2,000 名不相关经理中最佳者相近。给定群体规模,考虑相关性后,真正突出的经理显得更加非凡。
白话解释:相关性为什么让"最幸运者"没那么幸运?把每个经理的运气拆成两块:所有人共享的一块(比如大家都超配了成长股,那一年成长股的表现)和各自独有的一块。共享那块对所有人一样,取最大值时帮不上忙;只有独有那块才在 1 万人之间"抽签",而它的波动只占总波动的 \(\sqrt{1-\rho}\)。相关系数越高,可供抽签的独立运气越少,相当于参赛人数变少了。\(\rho=1\) 时大家完全一样,最佳者就是普通的一个人,所以中位数为 0。这和 CFA 里组合分散化的逻辑相同:资产之间相关性越高,"有效资产个数"越少。
巴菲特是有技能还是幸运?(原书专栏) Berkshire Hathaway 自 1965 年由巴菲特管理,账面价值到 2000 年 12 月增长 2,078 倍,复合年增长率 23.6%;同期标普 500 年均总收益 11.8%,即每年跑赢 11.8%。36 年间年度市场调整收益标准差 14.3%:
- 标准 t 检验:\(t=11.8/(14.3/\sqrt{36})\approx4.9\),原书称无技能经理 \(t>4.9\) 的概率仅 0.0011%。
- 但这不是正确的检验——他进入我们视野,正是因为收益异常高。正确的问题是:他是否显著好于一大群无技能经理中的最佳者?假设 1965 年他至少与 1 万名经理竞争:若 1 万名无技能经理的市场调整收益正态、均值 0、标准差 14.3%,最佳者年均跑赢 11.8% 或以上的概率仅 0.5%;若有 10 万名,概率为 5%。
- 样本外检验(原书专栏“重新审视巴菲特”):1965–1990 年他平均每年跑赢 13.2%,1991–2000 年只跑赢 6.84%,明显向均值回归。如果 1990 年你决定用此后 10 年的数据检验,标准 t 检验就是恰当的——后续收益不受样本选择影响。用 1991–2000 年的年度数据,\(t=1.95\),无技能经理超过它的概率略高于 4%。
结论:巴菲特很可能确实有技能。方法论上的要点比结论更重要:被挑选出来之后,要用挑选之后的新数据检验。
22.5.6 小结:信噪比太低
过去收益对判断技能用处不大,根源在于技能对收益的决定作用远小于运气——信噪比(signal to noise ratio)低。若有技能经理能增加远多于 2%,问题会容易很多,但交易是高度竞争的零和博弈,这个假设不合理;即使假设更高技能,也必须假设拥有者更少,检验的改进被稀缺性部分抵消。
若噪声更小,问题也会容易:若组合与市场的相关系数为 0.95 而非 0.9,市场调整收益标准差降为 5%,95% 置信、5 年、2% 技能的功效从 15% 升至 22%;相关系数 0.99 时标准差降为 2.6%,功效升至 52%。但多数股票经理与市场的相关性没那么高。
壁橱指数化者(closet indexers,原书专栏):主动经理的组合紧密复制基准指数,很少显著跑输,把重大失败的风险降到最低。客户为“主动管理”付高费用,实际只得到指数组合。由于收益与基准高度相关,判断他们是否有技能所需数据远少于真正的主动经理——但他们能增加的价值也很小。
降噪的办法是因子模型(factor models)。 市场调整是单因子模型;更复杂的模型把收益归因于利率、规模、预期增长等因子,因子调整后的超额收益波动更低,检验功效更高。但这类检验只识别扣除因子收益之后的技能,无法衡量善于预测因子收益并据此调整组合的经理。而且要求很高:用 5 年月度数据以 95% 置信、75% 功效识别 2% 技能,需要因子调整后的超额收益年化标准差只有 1.9%,即模型要解释总收益波动的 98.6%(\(1-(1.9/16)^2\approx0.986\))。因子模型在年度数据中的 \(R^2\) 通常低于 90%;作为对照,简单市场调整模型的 \(R^2=\rho^2=0.81=(16^2-7^2)/16^2\)。
原则上,若更了解经理的假定技能,可以构造更强的检验:例如认为经理只在上涨市场有技能,就只考察上涨市场的收益。原书专栏“一个好的论文题目”建议:有技能的经理在流动市场中应表现更好(建仓成本更低),技能检验应纳入时变流动性信息。
样本长度与观测数。 给定样本期,可以用更高频率增加观测数:10 年有 10 个年度、120 个月度、约 522 个周度收益。但统计功效主要取决于样本期长度,而非期内抽样频率——无论多频繁地观察,期内总绩效都一样。直观上,\(t\approx\mu\sqrt T/\sigma\) 只依赖总时长 \(T\)。不过更高频抽样能让标准误估计得更准,在观测数否则少于 20 时尤其有帮助,这也是原书用月度而非年度数据的原因。
推导拆解:用月度数据验证。月度超额收益的均值为 \(\mu/12\),标准差为 \(\sigma/\sqrt{12}\)(收益不相关时方差与时间成正比),观测数 \(n=12T\)。 \(t=\dfrac{\mu/12}{(\sigma/\sqrt{12})/\sqrt{12T}}=\dfrac{\mu/12}{\sigma/(12\sqrt T)}=\dfrac{\mu\sqrt T}{\sigma}\)。 频率 12 在分子分母中完全约掉。换成日度(250)也一样:均值缩小 250 倍,标准误也缩小 250 倍。增加观测数之所以不增加信息,是因为技能是"按时间"积累的,每个月的超额收益只有 1/12 年的技能,却仍带着相应比例的噪声。
22.6 更严重的问题:分布形态与虚假收益
上面的结果是在理想假设下得出的。现实更糟。
22.6.1 正态性与厚尾
实际组合收益相对正态分布是**厚尾(fat-tailed)**的。差异不大,但后果是 t 检验的功效低于正态时——前面令人沮丧的结果实际上还高估了 t 检验的可靠性。
22.6.2 比索问题
分散化组合的市场调整收益相当对称(组合与指数的不对称相互抵消)。但某些策略产生高度不对称的收益,对它们用 t 检验,真实的置信水平和功效与正态假设下的大相径庭。
比索问题(peso problem)是极端例子:策略几乎总是产生小的正收益,但极少数情况下产生巨大的负收益,足以抵消(甚至超过)所有小收益。灾难发生前,经理看起来很有技能,其实是幸运而非有技能。可靠评估需要足够长的数据让灾难在样本中充分体现,而灾难很罕见——客户判断经理是否在制造比索问题的唯一可靠方法,是直接检查经理所用的策略。
原书的几个专栏:
- “如何在大多数时候愚弄大多数人:卖出波动率”:持有指数组合并卖出虚值期权,多数年份产生“增强指数收益”,市场剧烈波动时遭受重大损失。设立此策略几乎不需要技能,是一种无信息交易策略(informationless trading strategy);只要没遇到坏运气,即使小样本 t 检验也会显示经理技能高超。
- 比索问题的由来(芝加哥大学经济系的民间传说):1960–70 年代墨西哥通胀和利率高于美国,但政府固定汇率,又不定期地让比索贬值。投资墨西哥债务在不贬值时系统性跑赢美元投资,一旦贬值收益一夜之间化为乌有。据说一位芝加哥教授投资墨西哥债券赚利差,同事提醒他时,他说他的墨西哥学生会在贬值前打电话问他意见——学生们确实打了电话,但他在外旅行。
- 圣彼得堡悖论:为何不加倍下注?:押 1 美元,输了就加倍再押,直到赢为止——财富无限时总能赢 1 美元,财富有限时玩得足够久终将破产,且与硬币是否公平无关(严格说这是“鞅”策略)。经理可以类似地“持有指数,再对某个想法做短期押注,押错就加倍”,只要基金不破产就能跑赢。它吸引无纪律的经理(逃避错误决策的心理后果),也吸引不道德的经理(怕表现差被解雇,为自己而非客户管理组合)。
金融直觉:用代码第 6 部分的参数算一笔账。每月 99% 概率赚 0.4%,1% 概率亏 50%,期望 \(0.99\times0.4\%-0.01\times50\%=-0.10\%\),是负的。但 5 年 60 个月一次都不出事的概率是 \(0.99^{60}\approx55\%\)。在这 55% 的样本里,收益几乎恒定在 0.4% 左右、波动极小,t 值和 Sharpe 比率都高得惊人。这类收益分布的特征是负偏度、高峰度,CFA 另类投资部分讲对冲基金风险时提到的"收益分布非正态、Sharpe 比率失真"说的就是它。识别办法:看偏度、最大回撤、压力情景,看持仓里是否有卖出期权、信用保护、套息等"卖保险"的成分,而不是只看历史 t 值。
22.6.3 欺诈性收益
统计检验假设收益是真实的——“垃圾进,垃圾出”。
收益平滑(return smoothing):为不常交易资产估值的经理调整估值过慢(第 22a 章),收益显得过于平滑、正自相关。这降低了波动率,于是人为低的标准误 → 人为高的 t 值 → 过度自信的结论。到某个时点,监管者、客户、审计师或托管人发现差异并要求调整;由于平滑总是延迟确认损失,重估会产生显著的负收益——平滑可以制造人为的比索问题,但从投资者角度看,这个问题一点也不“人为”。
金字塔骗局(pyramid schemes),又称庞氏骗局(Ponzi schemes):经理承诺高回报,用新投资者的钱向早期投资者支付高回报,早期投资者的高回报又吸引新投资者;某时骗局大到无法维持就会崩溃,尚未获偿者通常血本无归。崩溃前其收益非常好,用这些收益判断技能会得出“有技能”的结论。唯一的防护是确认经理的会计系统准确报告资产、负债、收入和分配。若推动者不太贪婪、超额收益不太大、能说服客户不撤资、又能控制审计,骗局可以长期不被发现。业绩记录不能替代尽职调查(due diligence)。
原书专栏“庞兹的庞氏骗局”:Charles Ponzi 1919 年 12 月在波士顿成立公司,声称交易国际回邮券(postal reply coupons)赚取汇率差,向投资者出售90 天回报 50% 的债券,实际上没有证据表明他兑换过超过微不足道数量的回邮券。他在 45 天就按面值偿付,引发狂热,到 1920 年 7 月每周进账 100 万美元;7 月 26 日被政府叫停时已从 1 万多名投资者处募集约 950 万美元,8 月 12 日被捕。
现状补充:原书出版后最著名的例子是 2008 年暴露的 Madoff 骗局,它几乎完美地符合作者描述的“不太贪婪”的特征:报告收益并不惊人,但异常平滑稳定,长期缺乏可信的独立审计和托管。
22.7 样本选择偏差
前两节说明统计检验在理想条件下就不太有用,现实中更没用。最重要的问题是样本选择问题——只要人们从过去学习,无论是正式分析还是凭经验判断,都会受到影响。
定义:当某个过程选择了你所看到的关于某对象的信息时,就产生样本选择偏差(sample selection bias)。如果这个过程不是随机选择,你只看到被选择的侧面,印象就不准确,据此做的决策很可能有缺陷。原书用盲人摸象作比:每个人只摸到一部分,得出的结论都错。
22.7.1 共同基金行业中的样本选择
你看一家大型基金公司的营销材料:每只基金都准确报告了相对合适基准的绩效,平均大幅跑赢,统计上显著——你可能会很失望,原因有三:
- 只展示表现最好的基金:全部基金的平均表现可能为负。
- 幸存者偏差(survivorship bias):分销商常关掉表现差的基金,通常并入表现较好的基金,存续基金的历史不包括被并基金的业绩。这抬高了存续基金的平均绩效。
- 基金孵化(incubation):一些基金公司每年推出许多新基金,留下表现好的、关掉失败的,以此制造营销所需的赢家。那只业绩优异的基金之所以进入你的视野,只是因为它是一大群基金中最好的之一。
金融直觉:GIPS 的许多条款可以看成是针对这三种偏差的制度性对策。针对"只展示最好的":所有付费、全权委托的组合都必须纳入至少一个综合(composite),不能挑账户。针对幸存者偏差:已终止组合的历史业绩必须保留在综合中直到其终止期,不能事后剔除;综合本身终止后也要保留记录。针对孵化:公司须维护并按要求提供全部综合(含已终止综合)的清单和说明,潜在客户可以看到"其他兄弟产品"的存在;业绩可携性(portability)规则也限制把别处的历史业绩随意嫁接到新综合上。但 GIPS 只能约束一家公司内部的挑选,管不了"在数千家公司里只听说过业绩最好的那家"这种外部选择,后者仍要用本章 22.5.5 的思路去校正。
22.7.2 如何避免
样本选择偏差可能比任何其他原因造成的交易损失都多。投资于过去表现好的经理时,其表现是否显著必须相对全体经理判断。要记住:差经理不会进入你的视野——没人谈论他们、写他们,他们也不写书;你知道最佳经理,只因为他们表现很好、人人都在谈论。要合理推断,必须知道有多少本可能幸运却没有幸运的经理。投资通讯(newsletters)同理:只有推荐记录好的存活下来被你看到。
原书专栏“我最喜欢的骗局”(违法,仅为说明):买一份 20,480 人的邮寄名单,自称成功交易者,给出下月预测——对一半人说涨、另一半说跌。一个月后,只给预测正确的 10,240 人写信,再给新预测(同样一半涨一半跌)。重复十个月,就有 \(20{,}480/2^{10}=\) 20 人看到你连续 10 次正确预测市场,他们会发誓你是天才。若也给预测错的人写信(“我只是凡人”),会有 200 人看到你恰好对了 9 次,900 人看到恰好对了 8 次。不知道这一机制的“幸运者”不可能正确推断你的技能;知道机制的话,唯一理性的推断是你没有技能。
22.7.3 均值回归
样本选择能使过去的平均收益向上偏,但不能影响后续收益。所以选择偏差最清楚的证据,是过去平均与后续平均之差:选择使过去平均偏高时,后续平均总是更低。这就是均值回归(regression to the mean)。
白话解释:把观测到的业绩写成"技能 + 运气"。按过去业绩挑出的前 1%,既可能技能高,也几乎一定运气好。未来的运气与过去无关,平均为零,所以未来业绩的期望只剩技能部分,必然低于过去。回落多少取决于过去业绩里运气占多大比重:用回归的语言,未来业绩对过去业绩的斜率约为"技能方差 / 总方差"。按本章参数,技能差异约 2%、一年运气约 7%,这个比值很小,所以挑出的赢家几乎会完全回落到平均。公开商品基金从月均 4.1% 掉到 0.23%,就是这种回落。
原书专栏“公开商品基金的回归”(Elton, Gruber & Rentzler, Journal of Business, 1989):1979 年 7 月至 1985 年 6 月,约 2,000 名注册商品交易顾问(CTA)每年向公众推出约 15 只新的公开商品基金,招股书报告顾问此前至少 36 个月的平均收益。发行前 36 个月平均月收益 4.1%——惊人;上市后第一年平均月收益只有 0.23%,之后也没好多少。佐证:同期全部公开商品基金月均收益约 0.7%、月标准差 11.3%;若收益按此正态分布,仅凭运气,2,000 名顾问中预计有约 70 人过去三年平均月收益超过 4.1%——运气本身就足以解释这些发行者的业绩(每年只有约 15 只发行)。
交易中样本选择偏差尤其重要,因为赢家比输家更常进入视野。这个问题特别难识别:多数人希望相信赢家是有技能的——我们天然倾向于把绩效归因于技能,相信凡事皆有原因(原书专栏“更多穴居人心理学”给了进化论解释)。而对自己的绩效,我们倾向于把好结果归于技能、坏结果归于运气,记住好结果、忘掉坏结果——这可能是我们面临的最危险的选择偏差。专栏“似乎人人都是赢家”:人们乐于谈论赢利、羞于承认错误,只听别人讲交易,你会以为多数人都是赢家。
避免样本选择偏差的唯一方法,是理解数据是如何进入你视野的;必须始终问:一个事件相对于产生它的过程是否显著,而不仅是相对于你对它的了解。
22.8 绩效预测的经济学方法
既然统计方法靠不住,经济理论(其实是简单的博弈论)给出另一条路:长期而言,相对对手拥有比较优势(comparative advantage)的参与者赢得博弈。 比较优势指比对手拥有更大的技能或更多的资源——当然须是有助于取胜的技能和资源,因此随策略而异。交易本质上是博弈,所以应能通过识别产生长期绩效的因素来预测长期绩效。
原书专栏“赢得奥运马拉松”:能跑进 2 小时 20 分的选手快得惊人,能赢下每年绝大多数马拉松——这是绝对优势(absolute advantage)。但这个成绩在 2000 年奥运会男子马拉松只能排第 36 名。要赢得比赛,不仅要做得好,还必须做得比对手更好。
原书表 22-8、22-9 列出了与经理/交易员个人和公司绩效相关的因素(节选):
| 层面 | 因素 | 理由 | 可观察的指标 |
|---|---|---|---|
| 个人 | 智力、创造力 | 识别理论上的机会、避免理论上的错误;善于解决问题 | 测验分数;书面作品中的见解 |
| 个人 | 经验、教育与培训 | 识别反复出现的机会;理解问题的理论基础 | 工作年限;正规教育与培训 |
| 个人 | 记忆力、组织能力 | 发现看似隐藏的机会;不错过机会 | 记事实与历史好;归档系统 |
| 个人 | 纪律、进取心 | 错误少,专注于自己擅长之事;工作努力高效 | 一致性;能阐明自己的比较优势;工作时长 |
| 个人 | 激励、人际与表演技能 | 薪酬与绩效挂钩;他人愿意合作;必要时能虚张声势 | 薪酬合同;性格;熟练的扑克玩家 |
| 公司 | 合格人员、信息资源、研究 | 人力资本;估值与交易是信息产业;研究把数据变成信息 | 数据库访问;好的模型与分析师 |
| 公司 | 组织结构、内部控制、交易设施、领导力 | 资源组织良好才有价值;只做打算做的事;想法需要实施 | 风控、会计与审计系统;交易台与通讯系统 |
作者的关键论断:经理或交易员最重要的比较优势,是透彻理解拥有比较优势的必要性。 理解它的人会同时考虑为何自己的策略应该有效以及为何预期别人会输给自己——交易是零和博弈,两者不可分。多数交易者只想自己为何会赚钱,而不想别人为何会亏。多数人还常把绝对优势误当比较优势——要赢零和博弈,不能只是好,必须更好。原书专栏“为何我们把绝对优势误当比较优势”:生存主要是与自然博弈,自然不会主动制定策略打败我们,进化训练我们重视绝对优势;交易的对手却在不断适应。
原书表 22-10:赛马让分与选择经理——两者本质上是同一过程,都在预测零和博弈的结果,都考虑三类因素:
| 因素 | 赛马 | 投资经理 |
|---|---|---|
| 过去绩效 | 过去跑得怎样?相对对手名次如何? | 过去收益如何?与市场及同类相比如何? |
| 绝对优势 | 是否具备决定速度的特征(步幅、肺活量、体重、负重、比赛经验)? | 是否具备决定绩效的特征(智力、教育、经验、纪律、创造力、数据)? |
| 比较优势 | 与同场其他马相比如何? | 与市场上其他经理相比如何? |
22.9 总结
好的过去绩效不必然预测好的未来收益,事实上很少能。在人类的时间尺度上,运气一般比技能更能决定绩效;产生过去好绩效的技能未必产生未来好绩效;过去有技能的经理未必仍有技能。即使最复杂的统计检验也很少能区分技能与运气。宁可幸运,不要有技能:大群体中最幸运的经理肯定比几乎所有运气一般的有技能经理表现好。
这不意味着没有有技能的经理——第 10–12 章说明他们存在且盈利,只是大概无法仅从过去收益识别。识别他们最好考察产生优异绩效的特征,并且要熟悉许多经理以便比较。也许有技能经理最重要的标志是:清楚理解成功来自比较优势,并能清楚阐明自己在零和博弈中的比较优势是什么。
量化实战:复算原书各表,并把结论迁移到回测
下面的代码用解析公式和模拟复算表 22-2、22-3、22-5、22-6、22-7,计算巴菲特与林奇的检验,并模拟一个“卖波动率”策略来展示比索问题。
import numpy as np, pandas as pd
from scipy import stats
sig = 0.07 # 市场调整收益的年化标准差(运气)
z = stats.norm.ppf
# ---------- 1) 功效:表 22-2(月度数据,单侧 t 检验) ----------
def power(mu, conf, years):
n = 12 * years
if conf == 0.5: crit = 0.0
else: crit = stats.t.ppf(conf, n - 1)
nc = mu * np.sqrt(years) / sig # 非中心参数 = mu*sqrt(T)/sigma,与采样频率无关
return 1 - stats.nct.cdf(crit, n - 1, nc)
rows = {(f"{mu:.0%}", f"{c:.0%}"): [power(mu, c, y) for y in (1, 5, 10)]
for mu in (0.0, 0.02, 0.04) for c in (0.5, 0.75, 0.95)}
print("表 22-2 复算:被判为有技能的概率(列:1、5、10 年)")
print(pd.DataFrame(rows, index=["1年", "5年", "10年"]).T.map(lambda x: f"{x:.0%}").to_string())
# ---------- 2) 表 22-3:需要多少年 ----------
print("\n表 22-3 复算:所需年数 T = ((z_conf + z_power) * sigma / mu)^2")
for mu in (0.02, 0.04):
for pw in (0.5, 0.75, 0.95):
yrs = [((z(c) + z(pw)) * sig / mu) ** 2 for c in (0.5, 0.75, 0.95)]
print(f"技能 {mu:.0%} 功效 {pw:.0%}: 置信 50%/75%/95% -> " + " / ".join(f"{y:5.1f}" for y in yrs))
# ---------- 3) 表 22-5:选主动经理还是指数基金 ----------
def best_test(years, p_skill=1/3, r_sk=0.01, r_un=-0.02, r_idx=-0.0015):
gap = (r_sk - r_un) * np.sqrt(years) / sig # 有技能与无技能经理费后收益之差(3%)的检验距离
best = None
for conf in np.linspace(0.5, 0.9999, 5000):
pw = 1 - stats.norm.cdf(z(conf) - gap)
ex = p_skill * pw * (r_sk - r_idx) + (1 - p_skill) * (1 - conf) * (r_un - r_idx)
if best is None or ex > best[2]:
best = (conf, pw, ex, p_skill * pw + (1 - p_skill) * (1 - conf))
return best
print("\n表 22-5 复算:最优置信水平、功效、相对指数基金的预期超额收益、投给主动经理的概率")
for y in (1, 2, 5, 10, 20, 50):
c, p, e, inv = best_test(y)
print(f"{y:>2} 年: 置信 {c:6.1%} 功效 {p:5.1%} 超额 {e:7.3%} 投主动 {inv:5.1%}")
# ---------- 4) 表 22-6/22-7:N 个无技能经理中最幸运者 ----------
def best_quantiles(N, years, qs=(0.5, 0.75, 0.95)):
s = sig / np.sqrt(years) # 年均市场调整收益的标准差
return [s * z(q ** (1 / N)) for q in qs] # 独立时最大值的分位数:Phi^{-1}(q^{1/N})
print("\n表 22-6 复算:无技能经理中最佳者的年均市场调整收益(中位数 / 75 分位 / 95 分位)")
for years in (1, 5, 10):
for N in (10, 100, 1_000, 10_000, 1_000_000):
q = best_quantiles(N, years)
print(f"{years:>2} 年, N={N:>9,}: " + " / ".join(f"{x:5.1%}" for x in q))
rng = np.random.default_rng(2207)
def best_with_corr(rho, N=10_000, years=10, reps=200_000):
s = sig / np.sqrt(years)
f = rng.standard_normal(reps) # 共同成分
m = z(rng.random(reps) ** (1 / N)) # N 个独立成分的最大值(精确抽样)
best = s * (np.sqrt(rho) * f + np.sqrt(1 - rho) * m)
return np.quantile(best, [0.5, 0.75, 0.95])
print("\n表 22-7 复算:1 万名经理、10 年,最佳者分布随经理间相关系数变化")
for rho in (0.0, 0.25, 0.5, 0.75, 1.0):
print(f"rho={rho:.2f}: " + " / ".join(f"{x:5.1%}" for x in best_with_corr(rho)))
# ---------- 5) 巴菲特与林奇 ----------
t_b = 0.118 / (0.143 / np.sqrt(36))
p_one = 1 - stats.norm.cdf(t_b)
print(f"\n巴菲特 1965-2000:t = {t_b:.2f};单个无技能经理(正态)超过的概率 {p_one:.2e}")
for N in (10_000, 100_000):
print(f" {N:,} 名无技能经理中至少一人达到其表现的概率:{1 - (1 - p_one) ** N:.1%}")
print(f"巴菲特 1991-2000 年度数据 t=1.95,自由度 9:单侧 p = {1 - stats.t.cdf(1.95, 9):.1%}")
print(f"林奇 156 个月:t = {1.03 / (2.21 / np.sqrt(156)):.1f}")
# ---------- 6) 比索问题:卖虚值期权的“增强指数” ----------
months, sims = 60, 20_000
crash = rng.random((sims, months)) < 0.01 # 每月 1% 概率发生大跌
adj = np.where(crash, -0.50, 0.004 + rng.normal(0, 0.005, (sims, months)))
tstat = adj.mean(1) / (adj.std(1, ddof=1) / np.sqrt(months))
print(f"\n卖波动率策略:真实月均市场调整收益 {0.99*0.004 - 0.01*0.50:+.2%}(负)")
print(f"5 年样本中无大跌的比例 {np.mean(~crash.any(1)):.1%};t > 1.645(被判有技能)的比例 {np.mean(tstat > 1.645):.1%};"
f"无大跌样本的 t 中位数 {np.median(tstat[~crash.any(1)]):.1f}")
输出:
表 22-2 复算:被判为有技能的概率(列:1、5、10 年)
1年 5年 10年
0% 50% 50% 50% 50%
75% 25% 25% 25%
95% 5% 5% 5%
2% 50% 61% 74% 82%
75% 35% 49% 59%
95% 8% 16% 23%
4% 50% 72% 90% 96%
75% 46% 73% 87%
95% 13% 35% 56%
表 22-3 复算:所需年数 T = ((z_conf + z_power) * sigma / mu)^2
技能 2% 功效 50%: 置信 50%/75%/95% -> 0.0 / 5.6 / 33.1
技能 2% 功效 75%: 置信 50%/75%/95% -> 5.6 / 22.3 / 65.9
技能 2% 功效 95%: 置信 50%/75%/95% -> 33.1 / 65.9 / 132.6
技能 4% 功效 50%: 置信 50%/75%/95% -> 0.0 / 1.4 / 8.3
技能 4% 功效 75%: 置信 50%/75%/95% -> 1.4 / 5.6 / 16.5
技能 4% 功效 95%: 置信 50%/75%/95% -> 8.3 / 16.5 / 33.1
表 22-5 复算:最优置信水平、功效、相对指数基金的预期超额收益、投给主动经理的概率
1 年: 置信 99.8% 功效 0.6% 超额 0.000% 投主动 0.3%
2 年: 置信 98.7% 功效 5.2% 超额 0.004% 投主动 2.6%
5 年: 置信 95.5% 功效 23.0% 超额 0.033% 投主动 10.6%
10 年: 置信 93.8% 功效 42.7% 超额 0.087% 投主动 18.3%
20 年: 置信 94.2% 功效 63.6% 超额 0.172% 投主动 25.1%
50 年: 置信 97.1% 功效 87.1% 超额 0.298% 投主动 30.9%
表 22-6 复算:无技能经理中最佳者的年均市场调整收益(中位数 / 75 分位 / 95 分位)
1 年, N= 10: 10.5% / 13.3% / 18.0%
1 年, N= 100: 17.2% / 19.3% / 23.0%
1 年, N= 1,000: 22.4% / 24.1% / 27.2%
1 年, N= 10,000: 26.7% / 28.2% / 30.9%
1 年, N=1,000,000: 33.8% / 35.0% / 37.3%
5 年, N= 10: 4.7% / 6.0% / 8.0%
5 年, N= 100: 7.7% / 8.6% / 10.3%
5 年, N= 1,000: 10.0% / 10.8% / 12.2%
5 年, N= 10,000: 11.9% / 12.6% / 13.8%
5 年, N=1,000,000: 15.1% / 15.7% / 16.7%
10 年, N= 10: 3.3% / 4.2% / 5.7%
10 年, N= 100: 5.4% / 6.1% / 7.3%
10 年, N= 1,000: 7.1% / 7.6% / 8.6%
10 年, N= 10,000: 8.4% / 8.9% / 9.8%
10 年, N=1,000,000: 10.7% / 11.1% / 11.8%
表 22-7 复算:1 万名经理、10 年,最佳者分布随经理间相关系数变化
rho=0.00: 8.4% / 8.9% / 9.8%
rho=0.25: 7.4% / 8.2% / 9.5%
rho=0.50: 6.0% / 7.1% / 8.7%
rho=0.75: 4.3% / 5.6% / 7.5%
rho=1.00: -0.0% / 1.5% / 3.6%
巴菲特 1965-2000:t = 4.95;单个无技能经理(正态)超过的概率 3.69e-07
10,000 名无技能经理中至少一人达到其表现的概率:0.4%
100,000 名无技能经理中至少一人达到其表现的概率:3.6%
巴菲特 1991-2000 年度数据 t=1.95,自由度 9:单侧 p = 4.1%
林奇 156 个月:t = 5.8
卖波动率策略:真实月均市场调整收益 -0.10%(负)
5 年样本中无大跌的比例 55.0%;t > 1.645(被判有技能)的比例 55.0%;无大跌样本的 t 中位数 6.2
几点说明:
- 表 22-2、22-5、22-6、22-7 几乎逐格复现(个别格子差 1 个百分点,来自原书用模拟或取整)。这说明原书的结论完全来自简单的正态模型:\(\delta=\mu\sqrt T/\sigma\) 太小。2% 技能、7% 噪声对应的年化信息比率(information ratio)只有 \(0.02/0.07\approx0.29\)。
- 表 22-3:按公式,置信水平 50% 一列并非全为 0(例如技能 2%、功效 75% 需约 5.6 年),与上文的判断一致;4% 技能、置信 75%、功效 50% 的 1.4 年,原表写 2 年,应是向上取整。
- 表 22-6 用的是精确公式而非模拟:独立同分布时最大值的分位数是 \(\Phi^{-1}(q^{1/N})\)。表 22-7 的相关情形用单因子结构 \(r_i=\sqrt\rho f+\sqrt{1-\rho}\,e_i\),最大值等于 \(\sqrt\rho f+\sqrt{1-\rho}\max_i e_i\),可以精确抽样,无须真的生成 1 万个经理。
- 巴菲特:按 \(t=4.95\) 计算,1 万、10 万名无技能经理中有人达到其表现的概率为 0.4% 和 3.6%;原书的 0.5% 和 5% 与按 \(t=4.9\) 取整计算的结果(约 0.48%、4.7%)一致。原书所说“无技能经理 \(t>4.9\) 的概率为 0.0011%”对应自由度 35 的 t 分布,正态尾概率还要小得多,但结论不变。
- 比索问题:这个“卖波动率”策略真实期望是负的,但 5 年里有 55% 的概率不遇到大跌;在这些样本中 t 统计量的中位数高达 6.2。只看 t 值或夏普比率,一半以上的情况下你会把它当成高技能经理。
迁移到回测:策略的多重检验
把“经理”换成“策略”,本章的结论直接适用于量化研究:
- 试验次数就是群体规模。测试 1 万个参数组合或因子,最好的那个即使毫无预测力,也会有惊人的回测收益(表 22-6)。设 \(N\) 个独立策略的年化夏普比率在零假设下近似服从 \(N(0,1/T)\),则最佳者夏普的期望约为 \(\Phi^{-1}(1-1/N)/\sqrt T\):\(N=1000\)、\(T=10\) 年时约为 \(3.09/3.16\approx0.98\)——一个“夏普接近 1 的十年回测”可以完全来自运气。
- 对策:提高门槛、估计有效试验次数、样本外验证。常用方法包括 Bonferroni/Holm 等多重检验校正;Harvey、Liu 和 Zhu(2016)主张新因子的 t 统计量门槛应提高到约 3;Bailey 和 López de Prado 的“通缩夏普比率”(Deflated Sharpe Ratio)把试验次数、偏度和峰度纳入夏普比率的显著性;White 的 Reality Check 与 Hansen 的 SPA 检验处理“从一组策略中选最好”的问题。策略之间相关时,有效试验次数小于名义次数(表 22-7 的逻辑)。
- 样本外与均值回归:巴菲特 1991–2000 的检验示范了“选出之后用新数据检验”。回测选出的最优策略,实盘表现几乎总是更差——这正是公开商品基金 4.1% → 0.23% 的翻版。纸面交易期(paper trading)、前推检验(walk-forward)的意义就在这里。
- 样本时长而非频率:用分钟数据检验一个年度 alpha,并不会比月度数据多出多少功效;但高频策略本身(信息比率很高、可以在很短的日历时间内积累很多独立下注)确实能更快得到验证。
- 看策略本身:比索问题只能靠理解策略来识别。评估卖期权、信用利差、套息、马丁格尔式加仓等策略时,要看偏度、峰度、最大回撤和压力测试,而不只是 t 值和夏普。
- 数据库的幸存者偏差:回测数据必须包含退市股票、已关闭基金、已摘牌合约;否则相当于只看了“营销材料”。
- 比较优势:设计策略时要能回答“对手方是谁、他为什么会亏给我”——提供流动性、承担风险溢价、利用行为偏差、信息或速度优势。答不出来,就没有理由预期它能持续。
本章小结
用 t 检验判断技能,功效由 \(\mu\sqrt T/\sigma\) 决定;在 2% 技能、7% 噪声下,95% 置信、5 年数据只有 15% 的功效,75%/75% 的宽松标准也要 22 年,功效只取决于样本时长。决策论视角下,用过去收益在主动经理与指数基金之间做选择,10 年数据的期权价值只有 8.6 个基点——这是支持指数化的统计论证。从大群体中挑最好的人时,标准检验失效:1 万名无技能经理中最幸运者一年跑赢约 27%、十年年均约 8.4%;相关性降低有效群体规模。厚尾、比索问题、收益平滑与庞氏骗局让统计检验更不可靠;样本选择偏差(只展示赢家、幸存者偏差、基金孵化、荐股信骗局、自我归因)可能是最昂贵的错误,均值回归是它的指纹。经济学方法看比较优势:要赢零和博弈,不能只是好,必须更好。
| 概念/公式 | 要点 |
|---|---|
| t 统计量 | \(t=\bar r_{\text{adj}}/(\hat\sigma_{\text{adj}}/\sqrt n)\) |
| 运气的大小 | \(\sigma_{\text{Adj}}=\sqrt{\sigma_p^2+\sigma_m^2-2\rho\sigma_p\sigma_m}\approx7\%\) |
| 功效 | \(\approx1-\Phi(z_{\text{conf}}-\mu\sqrt T/\sigma)\);2%/95%/5 年仅 15% |
| 所需年数 | \(T\approx((z_c+z_p)\sigma/\mu)^2\);2%、75%/75% 需 22 年 |
| 时长 vs 频率 | 功效取决于样本时长,不取决于抽样频率 |
| 选择期权的价值 | 10 年数据仅 8.6bp;支持指数化 |
| 最幸运者 | 分位数 \(\frac{\sigma}{\sqrt T}\Phi^{-1}(q^{1/N})\);1 万人 1 年约 27% |
| 有效群体规模 | 相关性越高越小;\(\rho=0.25\) 时 1 万人约等于 2,000 个独立者 |
| 巴菲特 | 标准 t≈4.9;考虑选择后 1 万人中达到其表现的概率约 0.5%;样本外 t=1.95 |
| 比索问题 | 小赚常有、大亏罕见;只能检查策略本身 |
| 欺诈性收益 | 平滑 → 低波动 → 高 t;庞氏骗局;业绩记录不能替代尽调 |
| 样本选择偏差 | 只看赢家、幸存者偏差、孵化、荐股信骗局;均值回归是其证据 |
| 比较优势 | 不只是好,而是比对手更好;回答“谁会亏给我” |
练习
基础
- 某经理 8 年间年均市场调整收益 3%,标准差 9%。计算 t 统计量;在 95% 置信水平(单侧)下能否判定其有技能? 答案:\(t=3/(9/\sqrt8)\approx0.94<1.89\)(自由度 7 的临界值),不能。
- 设技能 3%、噪声 6%,要以 95% 置信、80% 功效识别,需要多少年? 答案:\(((1.645+0.842)\times6/3)^2\approx24.7\) 年。
- 用公式计算:1,000 名无技能经理、5 年、噪声 7%,最佳者年均市场调整收益的中位数。 答案:\(\frac{7\%}{\sqrt5}\Phi^{-1}(0.5^{1/1000})\approx3.13\%\times3.19\approx10.0\%\)。
- 解释为什么把 10 年的月度数据换成日度数据,几乎不能提高检验技能的功效。
- 什么是幸存者偏差?什么是基金孵化?各举一个回测中的对应情形。
进阶
- 原书思考题 2:彼得·林奇在 1977 年 5 月至 1990 年 5 月的 13 年间,使麦哲伦基金每月跑赢市场 1.03%,月度市场调整收益标准差 2.21%。他是有技能还是幸运?你最初是如何得知他和麦哲伦基金的? 答案要点:\(t=1.03/(2.21/\sqrt{156})\approx5.8\),单看极其显著;但他是从大量基金经理中因业绩突出而被挑出来的,应与“N 个无技能经理中最佳者”比较。即使 N 取 10 万,月度 t 达到 5.8 的概率也很小(单个经理约 \(3\times10^{-9}\)),所以他很可能有技能;但还应考察他在被广泛知晓之后的表现(他最后五年超额大幅下降)。
- 修改本章代码第 4 部分,把噪声从 7% 改为 20%(不分散的集中组合),重新计算 1 万名经理、10 年中最佳者的中位数,并讨论这对评估明星基金经理意味着什么。 答案:中位数约 \(20\%/\sqrt{10}\times3.81\approx24\%\)。
- 假设你测试了 200 个因子,它们之间平均相关系数约 0.5,最好的一个 t 统计量为 3.2。用本章的思路,你会怎样判断它是否值得采用? 提示:估计有效试验次数,计算该数量下最大 t 统计量的零分布(可用本章的单因子相关结构模拟);检查样本外表现;能否说清其经济来源与对手方。
- 原书思考题 8:高技能经理可能要求更高薪酬,薪酬如何影响其后续收益?若更容易判断经理是否有技能,经理的劳动力市场和扣费后的投资收益会有何不同? 提示:技能可识别时,经理会通过收费拿走大部分超额收益,投资者扣费后的收益趋于市场水平(类似 Berk–Green 的逻辑)。
- 原书思考题 11:为何那么多投资者愿意给 Charles Ponzi 那么多信用?结合样本选择偏差与“业绩记录不能替代尽职调查”作答。
原书推荐习题:思考题 2(林奇:t 检验与样本选择的综合);思考题 3、5(报纸信息与自己的想法生成过程中的选择偏差);思考题 6、7(你有理由相信自己会成为或能选出成功的主动经理吗);思考题 8、11。另建议复现表 22-2、22-3、22-6、22-7(本章代码已给出框架)。
原书对照
- 原书第 22 章后半部分,PDF 第 465–494 页(原书页码约为 PDF 页码减 13,即第 452–481 页);PDF p.495 为空白页:
- 22.4 统计绩效评估(t 检验、功效计算、表 22-2;所需数据量、表 22-3;支持指数化的统计论证、表 22-4、22-5;在众多经理中选择、表 22-6、22-7、巴菲特专栏;小结与讨论、壁橱指数化者、样本长度与观测数):PDF p.465–479;
- 22.5 更重要的问题(正态性、比索问题、卖波动率、圣彼得堡悖论;收益平滑、金字塔骗局、庞兹专栏):p.479–483;
- 22.6 样本选择偏差(共同基金、我最喜欢的骗局、均值回归、商品基金、重新审视巴菲特):p.483–488;
- 22.7 经济学方法(马拉松专栏、表 22-8、22-9、22-10):p.488–493;
- 22.8 总结、22.9 要点回顾:p.489–493;22.10 思考题:p.493–494。
- 前半部分(22.1–22.3)见第 22a 章。