量化交易中文教材

第 10 章 知情交易者与市场效率

本章对应 Harris 第 10 章 Informed Traders and Market Efficiency,是原书第三部分“投机者”的第一章,也是本册对量化研究最重要的一章。几乎所有 alpha 都可以归结为一句话:**你比价格更早或更准地知道基本面价值,并且有足够便宜的流动性把这个认识变成头寸。**本章回答四个问题:价格是怎样变得有信息含量的;知情交易者有哪几种,各自靠什么赚钱、会犯什么错;知情交易的利润由什么决定,为什么“精确且正交”的信号最值钱;为什么价格不可能总是完全有效,alpha 为什么会存在、又为什么会衰减。

学习目标

  1. 准确区分基本面价值、完美预见值与市场价格,理解“价格 = 基本面价值 + 噪声”与基本面价值的鞅性质。
  2. 用代数模型说明市场如何聚合分散的信息:价格是各人估计的(精度加权)平均,误差随独立信息源数量下降。
  3. 掌握四类知情交易者(价值、新闻、信息导向技术、套利)的方法、组织、速度和典型错误,能把一个量化策略归入其中一类。
  4. 推导 Iowa 例中的最优交易量与利润 \(\Pi^*=\ell(\pi-0.3)^2\),理解“利润对流动性线性、对信息优势二次”;了解 Kyle 模型给出的同一结论。
  5. 理解正交性:为什么与他人不相关的信号更赚钱,能计算两个信号组合后的信息系数。
  6. 理解 Grossman–Stiglitz 式的市场悖论及其解答,掌握三种有效市场形式与 Harris 的微观结构定义,理解流动性与价格信息含量的权衡。

读前导读

**这一章在解决什么问题。**CFA 一级讲有效市场假说时,你学的是三种形式(弱式、半强式、强式)和一堆实证异象,但没人告诉你“价格是怎样变得有效的”。这一章补上这个机制:有人花钱研究、拿着研究结果去交易、交易把价格推向他们的估计,价格于是变得有信息含量。理解了机制,就能回答三个实际问题:alpha 从哪里来(别人还没研究、或研究错了的地方),alpha 为什么会衰减(更多人进来研究同一件事),以及策略容量由什么决定(你交易时的价格冲击)。

本章也是后面第 13、14 章交易商和买卖价差理论的前提:交易商输给知情交易者的钱,就是价差中“逆向选择成本”的来源。

需要先想起来的数学。

  • 条件期望与信息集:\(E[X\mid\mathcal I_t]\) 读作“在时刻 \(t\) 已知信息 \(\mathcal I_t\) 下对 \(X\) 的最佳预测”,花体 \(\mathcal I_t\) 表示到 \(t\) 为止所有可得信息的集合。关键性质是“塔性质”:今天对“明天的预测”的预测,等于今天的预测。例:今天预测公司全年 EPS 为 5 元;明天看到季报后会修正,但今天你无法预知会往哪边修正,否则今天就该直接写 5.2。见 第 00 册第 07 章 概率中的分析工具 中条件期望一节。
  • 鞅:一个序列,在任何时刻对下一期的期望都等于当前值,即“期望变化为零”。本章说基本面价值是鞅,意思是它的变化不可预测;随机游走是鞅的特例。
  • 方差的运算:\(\operatorname{Var}(aX)=a^2\operatorname{Var}(X)\),\(\operatorname{Var}(\sum X_i)=\sum_i\sum_j\operatorname{Cov}(X_i,X_j)\)。这正是 CFA 组合方差公式,本章用它推出“平均误差的方差 \(=\sigma^2(\rho+(1-\rho)/N)\)”,与等权组合方差随资产数增加趋于平均协方差完全是同一个式子。
  • 一元二次函数求最大值:\(\Pi(Q)=bQ-cQ^2\) 在 \(Q^*=b/(2c)\) 处最大,最大值 \(b^2/(4c)\)。用导数 \(\Pi'(Q)=b-2cQ=0\) 或配方都能得到。见 第 00 册第 02 章 导数与泰勒展开。
  • 正态分布下的线性预测:若 \((v,y)\) 联合正态,\(E[v\mid y]=E[v]+\dfrac{\operatorname{Cov}(v,y)}{\operatorname{Var}(y)}(y-E[y])\),系数就是 \(v\) 对 \(y\) 回归的斜率(与 CAPM 里 \(\beta=\operatorname{Cov}/\operatorname{Var}\) 同形)。Kyle 模型的做市商就是在做这个回归。

**怎么读这一章。**10.1、10.2 的“价格 = 价值 + 噪声”和信息聚合是全书基础,必读。10.4 的四类知情交易者是本章最有实务价值的部分,建议对照自己做过的策略逐类读。10.5 的 Iowa 例必读;Kyle 模型一段数学最重,第一次可以只记住三条结论(冲击系数、利润对流动性线性、竞争使价格更有效),读完第 14 章后再回来逐步推。10.6 的市场悖论和 10.7 的 Harris 效率定义必读,它们决定了你应该怎样评价一个“异象”。量化实战第 1、2 段可以先看输出,第 3、4 段与因子研究直接相关,值得细读。


10.1 基本面价值、噪声与价格

**知情交易者(informed traders)**是获取并依据基本面价值信息行动的投机者:价格低于其基本面价值估计时买,高于时卖。Harris 给出关注知情交易的三个理由:你自己可能就是知情交易者,只要你的交易决策以任何方式依赖你对价值的看法(遗憾的是,大多数自认为知情的交易者并不盈利);交易商和其他流动性提供者会输给知情交易者,理解知情交易才能理解提供流动性的风险;价格之所以有信息含量,是因为有人在做知情交易。

三个价值概念

  • 市场价值(market value):能买卖该工具的价格。
  • 基本面价值(fundamental value),也称内在价值(intrinsic value):持有该工具相关的所有当前和未来收益与成本的期望现值。如果所有人都掌握全部已知信息、都用正确的方法预测和贴现、对持有的收益与成本感受相同,大家会同意这个价值。这些条件从不成立,所以人们对基本面价值意见不一。
  • 完美预见值(perfect foresight value):依据所有当前和未来信息算出的价值。

基本面价值只依赖当前可得信息,它是完美预见值的最佳估计:

\[V_t=E\big[V^{PF}\mid\mathcal I_t\big].\]

由条件期望的塔性质立即得到一个重要结论:

\[E\big[V_{t+1}-V_t\mid\mathcal I_t\big]=E\big[E[V^{PF}\mid\mathcal I_{t+1}]\mid\mathcal I_t\big]-V_t=0,\]

即基本面价值是关于信息流的鞅,它的变化完全不可预测。只有当交易者得知意外的新信息时,基本面价值才会变化;如果它的变化可以预测,当前值就没有充分反映预测所依据的信息。(条件期望与鞅的基础见第 02 册第 07b 章。)

推导拆解:上面那行等式逐步看。 第一步,\(V_{t+1}=E[V^{PF}\mid\mathcal I_{t+1}]\) 是定义(明天的基本面价值,就是明天的信息下对完美预见值的预测)。 第二步,对它在今天的信息下再取期望:\(E[V_{t+1}\mid\mathcal I_t]=E\big[E[V^{PF}\mid\mathcal I_{t+1}]\mid\mathcal I_t\big]\)。 第三步,用塔性质:信息只会越来越多(\(\mathcal I_t\subseteq\mathcal I_{t+1}\),“\(\subseteq\)”表示“包含于”),所以“用少的信息去预测‘用多的信息做的预测’”,结果等于直接用少的信息去预测,即 \(E[V^{PF}\mid\mathcal I_t]=V_t\)。 第四步,两边减去 \(V_t\)(\(V_t\) 在 \(t\) 时刻已知,可以直接移进移出条件期望),得期望变化为 0。 直观上:如果你今天就能预期明天分析师会上调估值,那么今天的估值就已经该上调了。这和“远期价格是未来即期价格的无偏估计(在风险中性下)”是同一类论证。

白话解释:注意本章区分了两件事。基本面价值 \(V_t\) 是鞅,这是定义推出来的数学事实;价格 \(P_t\) 是不是鞅,取决于噪声。噪声如果持续存在并慢慢回归,价格就会表现出可预测性(例如短期反转),这正是价值交易者的利润来源(见练习 8)。所以“价格不可预测”不是前提,而是“知情交易者把噪声消除干净”时的结果。

价格与基本面价值之差称为噪声(noise):

\[P_t=V_t+\text{noise}_t .\]

价格等于基本面价值时,价格完全有信息含量(fully informative)。在有效市场中价格非常接近基本面价值,所以价格变化也相当不可预测,统计学家说价格服从随机游走(random walk)。知情交易者做的事,就是估计 \(V_t\),识别价格中的噪声。困难在于 \(V_t\) 观察不到,所以很难判断价格到底有多少信息、多少噪声。

侧栏:Fischer Black 论噪声。Black 在 1985 年美国金融学会主席演讲(“Noise”,发表于 1986 年)中认为,股价只要在基本面价值的一半到两倍之间,就应视为有信息含量。多数经济学家认为活跃交易证券的价格远在这个范围之内,但没有人能确知。

知情交易者也会亏钱

知情交易者把自己的价值估计与价格比较,买入显著低估的、卖出显著高估的,希望价格尽快朝有利方向变化。

  • 估计错了会亏钱:为高估的东西付太多,把低估的东西卖太便宜。持续估错的人最终亏到退出。
  • 估计对了也可能亏钱:价格可能先远离而不是趋向价值。但这类损失多是短期的,长期价格通常回归基本面。
  • 即使价格永不回归,估计正确又有耐心的人仍能获利:买入低估工具,就是以低于总价值的价格拿到了全部未来现金流(利息、股息、本金、清算分配);卖出高估工具,则可以把钱投到预期回报更高的地方。

10.2 知情交易者如何使价格有信息含量

知情交易者的买入推高价格,卖出压低价格。因为他们在价格低于估计时买、高于时卖,交易会把价格推向他们的估计;估计准确时,价格就更有信息含量。

代数示例:市场是一台统计计算器

设 \(N\) 个交易者各自预测真实价值 \(V\),第 \(i\) 人的预测 \(f_i=V+e_i\) 是无偏的,\(E[e_i]=0\),但单个误差可能很大。每人的意愿头寸与预测和价格之差成正比:

\[D_i=a\,(f_i-P).\]

假设证券零净供给(zero net supply),如期货和期权(这个假设只为简化算术,不影响结论)。市场出清要求 \(\sum_i D_i=0\):

\[a\sum_{i=1}^N f_i-NaP=0\quad\Longrightarrow\quad P=\frac1N\sum_{i=1}^N f_i=V+e_M,\qquad e_M=\frac1N\sum_i e_i .\]

若各人误差独立、方差同为 \(\sigma^2\),则 \(\operatorname{Var}(e_M)=\sigma^2/N\),\(N\to\infty\) 时 \(e_M\to0\)。即使 \(N\) 不大,只要个人误差不完全相同,市场的平均误差就小于个人的平均误差。所以市场价格比任何单个交易者都更好地估计基本面价值;当许多知情交易者独立收集信息时,价格最有信息含量。

两点推广值得记住(量化实战中有数值验证):

  1. 精度加权。若交易者的头寸强度 \(a_i\) 不同,出清价为 \(P=\sum_i a_if_i/\sum_i a_i\)。当 \(a_i\) 与预测精度 \(1/\sigma_i^2\) 成正比时,价格正是逆方差加权平均
    \[\hat V=\frac{\sum_i f_i/\sigma_i^2}{\sum_i 1/\sigma_i^2},\]
    这是合并独立无偏估计的最优方式。Harris 举的例子是两个同样准确的预测 30 和 50,最佳估计是 40;若第一个更准,最佳估计更接近 30。消息灵通的人倾向于持有更大头寸,所以市场给更准确的估计更大的权重。价格近似于不同精度价值估计的最优加权平均。
  2. 相关误差设下了地板。若误差两两相关系数为 \(\rho\),则 \(\operatorname{Var}(e_M)=\sigma^2\big(\rho+(1-\rho)/N\big)\),无论多少人参与,误差都降不到 \(\rho\sigma^2\) 以下。用同样数据、同样方法的人再多,也只相当于一个人。这正是 10.5 节“正交性”的伏笔。

推导拆解:两个方差公式的来历。 第一步,\(e_M=\frac1N\sum_i e_i\),所以 \(\operatorname{Var}(e_M)=\frac1{N^2}\operatorname{Var}\big(\sum_i e_i\big)\)(常数提到方差外要平方)。 第二步,\(\operatorname{Var}\big(\sum_i e_i\big)=\sum_i\sum_j\operatorname{Cov}(e_i,e_j)\)。这个双重求和里有 \(N\) 个对角项(\(i=j\)),每项是 \(\sigma^2\);有 \(N(N-1)\) 个非对角项,每项是 \(\rho\sigma^2\)。 第三步,合起来:\(\operatorname{Var}(e_M)=\frac{1}{N^2}\big[N\sigma^2+N(N-1)\rho\sigma^2\big]=\sigma^2\Big(\frac1N+\frac{N-1}{N}\rho\Big)=\sigma^2\Big(\rho+\frac{1-\rho}{N}\Big)\)。 第四步,令 \(\rho=0\) 得 \(\sigma^2/N\);令 \(N\to\infty\),第二项消失,只剩地板 \(\rho\sigma^2\)。 精度加权那个式子:在所有权重和为 1 的线性组合 \(\sum w_if_i\) 里,误差方差 \(\sum w_i^2\sigma_i^2\) 最小的权重是 \(w_i\propto1/\sigma_i^2\)(用拉格朗日乘子对 \(w_i\) 求导:\(2w_i\sigma_i^2=\lambda\)),最小方差为 \(1/\sum_i(1/\sigma_i^2)\),即量化实战里打印的“逆方差加权理论值”。

金融直觉:这两个式子你在 CFA 组合管理里都见过。第一个就是“等权组合方差随资产数 \(N\) 增加,收敛到资产间平均协方差”:分散化只能消除特有风险,消除不了系统性风险。这里“特有风险”是各人独立的研究误差,“系统性风险”是大家共用同一数据源、同一模型造成的共同误差。第二个是“只有一个约束的最小方差组合”:在资产互不相关时,最小方差组合的权重与各自方差成反比。市场价格就是一个由交易者头寸自动构建出来的“最小方差估计组合”。

错误会被淘汰,财富会向准确者集中

市场里如果有许多犯错的交易者,或者一个很大的犯错者,价格的信息含量会下降。但长期内,易犯错者的亏损使他们退出;估计最准的人变富,头寸更大,对价格影响更大。所以价格更接近最富有、通常也是最消息灵通的交易者的估计。

知情交易者并不想让价格有效

知情交易者交易是为了利润,不是为了让价格有信息含量。价格冲击对他们是成本,冲击越大赚得越少。他们要在流动且价格显著偏离基本面价值的市场里交易;在不流动的市场里,自己的交易会迅速消除获利机会。知情交易者希望价格在他们建好仓之后才向其估计调整。

10.3 激进交易还是隐秘交易

知情交易者要最小化价格冲击,最重要的决策是交易得多快:

  • 应当激进交易的情形:私有信息很快会成为共识(价值广为人知后,没人会以其他价格交易,必须在仍比别人懂的时候成交);或者许多其他知情者会依据同一信息行动(先交易者获利最多,大家争相成交)。代价是订单洪流会惊动其他人,他们不愿再提供流动性,冲击变得更大。
  • 应当缓慢交易的情形:确信信息优势不会很快消失。慢慢交易让别人难以推断你消息灵通,这叫隐秘交易(stealth trading)。

这个取舍就是执行算法中“紧迫性(urgency)”参数的经济学含义:信号衰减越快、竞争者越多,执行就应越激进。

10.4 知情交易的四种风格

按估计基本面价值的方法,知情交易者分四类。

价值交易者

**价值交易者(value traders)**收集尽可能多的信息,用经济模型估计完整的基本面价值:销售、成本、利率、管理质量、竞争、成长期权、新技术前景等,用于预测和贴现未来现金流,并为资产和持有工具本身附带的期权估值。大型价值交易者雇用分析师、统计学家、精算师、经济学家、会计师、工程师和程序员,建立庞大的资料库。

价值交易者最怕两种错误:过度乐观会买入高估的工具,过度悲观会卖出低估的工具。所以成功的价值交易者通常是金字塔型组织,多层审查确保两件事:

  • 分析师使用可比的假设。若汽车分析师假设未来利率 10%、航空分析师假设 5%,公司会相对波音低估福特,可能错误地卖出福特、买入波音。
  • 分析师没有忽略重要信息。若估值一家石油勘探公司时漏掉了一处重要油田最近的负面钻探结果,就会高估它。

审查使价值交易者成为慢速交易者,但保护他们免于代价高昂的错误。由于对价值非常了解,价值交易者常向大交易者提供流动性,是“最后的流动性提供者”(liquidity suppliers of last resort)(原书第 16 章详述)。

对量化交易者的启示:多因子模型的“可比假设”问题无处不在。不同行业用不同的估值口径、不同分析师用不同的盈利预测基准,都会在组合里制造系统性的行业偏差。横截面标准化、行业中性化和统一的数据口径,就是量化版的“金字塔审查”。

新闻交易者

新闻交易者(news traders)收集关于价值的新信息,预测价值在新信息下如何变化。能显著影响价值的信息称为重大信息(material information)。新闻交易者不从第一性原理估计价值,而是隐含地假设当前价格已准确反映了除这条新闻以外的一切,只估计新闻带来的变化:

\[\hat V=P_{\text{当前}}+\widehat{\Delta V}_{\text{新闻}} .\]

只有在新闻产生冲击之前交易的人才能获利,所以新闻交易者必须快。处理公开信息的要极快,因为许多人同时在看同一条新闻;靠调查研究自产信息的不必那么快,但仍须快于竞争者。依据**内幕信息(inside information)**交易的人也是新闻交易者,在美国和许多国家违法。

新闻交易者的组织是扁平的:层级少,经理在限度内可以自主决策。他们用各种系统迅速收集信息:奖励提供信息的记者、经纪人和分析师网络;读取和解释电子新闻源的计算机系统;桌上的财经电视和滚动新闻屏。

例(交易伟哥):1998 年 3 月 27 日 FDA 批准伟哥,辉瑞 4 月上市,到 5 月 22 日已有超过 100 万美国男性服用,渗透速度出乎许多人意料。辉瑞股价 3 月 27 日收于 95¾,一周后升至 102⅞,4 月 27 日收于 113.1。虽不能确定归因,但合理的结论是:最先获得、正确分析并据此行动的人赚了钱,后来者因价格已反映新闻而失去机会。

例(调查航空航天公司的招聘):一家公司在竞争一项重要的机密合同,公司不披露谈判进展,但聪明的研究员可以从它在招聘的人数和类型推断谈判进展。这是今天“另类数据”的早期例子。

信息、价格与伪知情交易者。 Harris 给出一个可操作的定义:如果某条信息不能用来预测未来的价格变化,它就“在价格里”了。已在价格里的信息是陈旧信息(stale information),依据它交易不可能盈利。最常见的错误就是依据陈旧信息交易,这样做的人称为伪知情交易者(pseudo-informed traders):他们自以为消息灵通,往往在价格已高时买、已低时卖,实际上是不知情交易者。

判断信息是否陈旧,最直接的办法是从第一性原理估值,但很少有新闻交易者做得到。可行的办法是看信息是怎么得到的:别人无法预料的独特信息大概不陈旧;行动迟缓、信息广为人知、别人能廉价获得或本可合理预期的,大概已经陈旧。

例(Greasy Earth Oil):GEOL 现价 90,找到石油值 100,找不到值 80。消息灵通者研究了周边地质和钻机丢弃的岩屑,认为会找到油,买入把价格推到 100。GEOL 确实找到了油,消息公开时已在价格里;伪知情交易者此时买入,可能把价格推到 110,价值交易者卖出使价格回落到 100 附近,伪知情交易者亏损。

例(西方石油):Armand Hammer 任 OXY 董事长兼 CEO 34 年,1990 年 12 月 10 日以 92 岁去世。他晚年的管理饱受批评,且控制近乎绝对。他去世次日 OXY 股价上涨 10%,再次日回落到原水平。Hammer 长期病重,大家都预期他很快会去世,唯一不确定的是日期,而日期对公司价值并不重要。死亡本身不是重大新闻,次日高价买入的人第二天就亏了。

反应幅度的错误。 新闻交易者通常能判断价值变化的方向,但常估错幅度。价值交易者最终得知新闻后会纠正价格(表 10-1):

对新信息的反应 初始价格变化 新闻交易者的错误 价值交易者的响应 随后的价格变化
反应不足(underreaction) 过小 没有充分利用机会 依据新信息继续交易 延续(continuation)
过度反应(overreaction) 过大 损失部分、全部或超过全部利润 反向交易 反转(reversal)

这张表是理解动量、短期反转和盈余公告后漂移(PEAD)的基本框架。设新闻带来的价值变化为 \(s\),公告当期价格只反映了 \(k\,s\),随后价值交易者把剩余的 \((1-k)s\) 推进价格,那么后续收益对公告期收益的回归斜率(忽略噪声)为 \((1-k)/k\):\(k<1\) 时为正(延续),\(k>1\) 时为负(反转)。量化实战中有模拟。

推导拆解:斜率 \((1-k)/k\) 的来历。公告期收益 \(r_0=ks\),后续收益 \(r_1=(1-k)s\)。一元回归斜率 \(=\operatorname{Cov}(r_1,r_0)/\operatorname{Var}(r_0)\)(与 CAPM 中 \(\beta\) 的定义同形)。\(\operatorname{Cov}(r_1,r_0)=k(1-k)\operatorname{Var}(s)\),\(\operatorname{Var}(r_0)=k^2\operatorname{Var}(s)\),相除得 \((1-k)/k\)。若公告期收益还带一个与 \(s\) 无关的噪声(方差 \(\sigma_0^2\)),分母多出 \(\sigma_0^2\),斜率被“稀释”为 \(k(1-k)\sigma_s^2/(k^2\sigma_s^2+\sigma_0^2)\),这就是量化实战第 3 段代码里的理论斜率。斜率的符号只由 \(1-k\) 决定,所以噪声不会改变“延续还是反转”的判断,只会削弱它。

信息导向技术交易者

技术交易者试图通过识别反复出现的价格模式来预测价格。模式的来源有两种:知情交易者犯了系统性错误,或者不知情交易者对价格产生了可预测的冲击。

  • 识别并利用知情交易者错误的,本身就成了知情交易者,他们纠正错误、使价格更准确,这就是信息导向技术交易者(information-oriented technical traders)。
  • 针对不知情交易者造成的模式交易的,若是向他们提供流动性,本质上是交易商,使价格更有信息含量;若是抢在他们前面交易,就是情绪导向技术交易者,使价格信息含量下降(原书第 11、13 章)。

例(盈利公告后的技术交易):假设伯利恒钢铁每次公布好于预期的盈利,新闻交易者或伪知情交易者都倾向于过度买入。意识到这一系统性错误的技术交易者会在公告后上涨时卖出,在价格回落到恰当(但仍较高)的水平时获利。卖得够早,会削弱过度反应;等太久,机会会被其他人抢走。

例(税收时点策略):美国股票中某年大跌的股票倾向于在次年初上涨,可能是因为投资者年底卖出以实现资本损失抵税,卖压把价格压到基本面以下。技术交易者年底买入输家、几周后卖出,他们的买入减少了年底的跌幅。随着这一现象广为人知,它似乎正在消失。

Harris 对信息导向技术交易者的定位很精准:他们识别的是对“有信息价格”所应具有的统计性质的违背。价值交易者和新闻交易者有效工作时,价格不会有可预测的变化;信息导向技术交易者捡拾的是这两类人留下的获利机会,Harris 称他们为“拾荒者(scavengers)”。

由此有两个推论:

  • 策略会衰减。只有知情交易者犯系统性错误时才有利可图;随着市场成熟、交易者从错误中学习,过去有效的策略会失效。
  • 方法不重要,模式识别才是定义。最常见的方法是看图,效果不佳,因为人眼常在不存在模式的地方看到模式;也有人用频数分布、回归、神经网络等方法。无论方法如何,技术交易的定义特征是强调模式识别,而不是对重大基本面信息的经济分析。

侧栏:食物链中的模式识别。认不出剑齿虎迹象的祖先常常沦为食物,没能留下后代。危险存在时判断失误的代价远大于没有危险时判断失误的代价,所以幸存者倾向于识别出比实际更多的危险。作为他们的后代,我们天生倾向于在没有模式的地方看到模式。这就是数据挖掘偏差和第一类错误的生物学根源。

侧栏:动量策略的心理学。金融经济学家观察到,过去一段时间(原书举的是约半年)大幅上涨的股票倾向于随后一年跑赢市场,大幅下跌的倾向于跑输。这是大量股票和多年数据的平均,任何单只股票跑赢的概率仍接近 50%,所以要同时买卖大量股票来控制风险。动量在新闻交易者和价值交易者反应不足时有利可图。可能的解释是人们抗拒改变现状:好消息使价值大增时,交易者难以相信价值会和近期差那么多,不敢买大涨的股票,坏消息时也不敢卖大跌的股票。随着效应广为人知,动量可能变得不那么赚钱。动量交易者必须小心做第一个而不是最后一个:先行者的冲击纠正了他人的错误,后来者只会造成过度反应。

套利者

**套利者(arbitrageurs)**同时买卖相似工具:买入相对便宜的,卖出相对贵的。只要买入的相对卖出的被低估,无论两者一起涨还是一起跌,净头寸都赚钱。

“相似”指价值依赖共同的基本面估值因子(fundamental valuation factors):宏观(利率、收入、通胀)、行业(销售、工资、竞争)、物理(天气、病虫害)、政治和社会因子。表 10-2 举了一些例子:

工具一 工具二 共同估值因子
伦敦黄金 纽约黄金 黄金价值
克莱斯勒股票 福特股票 汽车行业状况、大盘、劳资关系
S&P 500 指数期货 S&P 500 成分股组合 影响成分股的全部因子
豆油 豆粕 天气、病虫害、牲畜价格
政府债券 公司债券 利率
美元/欧元 美元/日元 三地利率、贸易、货币与财政政策

用因子语言写:若 \(r_A=\beta f+\epsilon_A\)、\(r_B=\beta f+\epsilon_B\),多 A 空 B 的收益为 \(r_A-r_B=\epsilon_A-\epsilon_B\),与共同因子 \(f\) 无关。**套利者要准确估计相对价值,但不必判断哪个工具(如果有的话)定价正确。**方法上,有人用统计方法刻画价格之间的正常关系(统计套利),有人用经济模型,有人用心理学模型;无论哪种,都在价格关系显著偏离模型预测时交易。

套利者的交易执行了一价定律(law of one price):相同工具应有相同价格;相似工具的价格应当对共同因子的取值保持一致。例如活牛和猪腩都依赖玉米价格(饲料是主要投入),两者的价格应反映关于玉米价格的相同信息。

套利者何时亏钱? 典型情形是一个工具的价格变了、相似工具的价格没变。第一个涨了,套利者卖它买第二个。是否盈利取决于价格变化的原因,有三种情形:

  1. 变化前后都相对定价正确:两工具相似但不相同,变化来自第一个工具的特有因子。套利交易不盈利,只付交易成本,往往亏损。
  2. 变化前定价正确,且没有特有因子变化:两者不再相对正确定价(要么第一个价格不该变,要么第二个也该同向变)。套利交易倾向于盈利。
  3. 变化前定价错误,变化后正确:价格变化本身是在纠错。套利交易不盈利。

**成功的套利者必须区分这三种情形。**能准确识别真正机会的盈利,把太多情形误认为机会的会被交易成本拖垮。对配对交易而言,情形 1 就是“结构性断裂”:价差扩大是因为一家公司出了特有新闻,这时进场就是在与新闻交易者对赌。

四类知情交易者小结

类型 最擅长估计 信息专长 典型速度
价值交易者 总价值 全部可得信息 慢
新闻交易者 价值变化 新闻 公开信息上快,私有信息上慢
信息导向技术交易者 系统性估值错误 统计异象(anomalies) 快
套利者 相对价值 相对因子价格 快

10.5 知情交易的利润

利润由什么决定

知情交易的利润取决于两件事:预测未来价格的能力,以及交易的价格冲击。预测准、冲击小时最赚钱。利润还必须覆盖获取和处理信息的成本、佣金、时间价值和其他经营成本,否则不可持续。

Iowa 例:流动性与可预测性

Harris 用一个预测市场的例子说明一个反直觉的结论:在非常流动的市场里做一个略有信息的交易者,可能好过在不流动的市场里做一个非常消息灵通的交易者。

Iowa 电子市场的合约在某事件发生时支付 1 美元,否则为零。若所有人都认为事件概率为 30%,且只关心期望值,合约价格为 30 美分。你研究后认为概率是 \(\pi>0.3\)。没人知道你消息灵通,但别人怀疑可能有人知情,所以你买得越多价格越高。设你买入 \(Q\) 张的平均价格为

\[P=0.3+\frac{Q}{4\ell},\]

\(\ell\) 刻画市场流动性(\(\ell\) 越大,大量买入的冲击越小)。头寸的期望价值为 \(\pi Q\),成本为 \(PQ\),期望利润

\[\Pi(Q)=\pi Q-\Big(0.3+\frac{Q}{4\ell}\Big)Q=(\pi-0.3)Q-\frac{Q^2}{4\ell}.\]

这是开口向下的抛物线,在 \(Q=0\) 与 \(Q=4\ell(\pi-0.3)\) 处为零,最大值在中点。对 \(Q\) 求导令其为零,\((\pi-0.3)-Q/(2\ell)=0\),得

\[Q^*=2\ell(\pi-0.3),\qquad \Pi^*=\ell(\pi-0.3)^2 .\]

**利润对流动性 \(\ell\) 是线性的,对信息优势 \(\pi-0.3\) 是二次的。**数例:

  • \(\ell=10{,}000\),\(\pi=0.40\)(只略有信息):\(Q^*=2{,}000\),\(\Pi^*=10{,}000\times0.01=100\) 美元;
  • \(\ell=100\),\(\pi=1.00\)(完全知道结果):\(Q^*=140\),\(\Pi^*=100\times0.49=49\) 美元。

信息差但流动性好的人,赚得是信息极好但流动性差的人的两倍。

白话解释:为什么利润对信息优势是“二次”的。信息优势 \(\pi-0.3\) 翻倍时,发生了两件事:每张合约的预期赚头翻倍,你愿意买的数量 \(Q^*\) 也翻倍(因为在同样的冲击成本下,赚头大的头寸值得做大)。单位利润 × 数量,两个翻倍相乘就是 4 倍。而流动性 \(\ell\) 翻倍只让你能买的量翻倍,单位利润不变,所以利润只翻倍。 另外注意 \(P=0.3+Q/(4\ell)\) 是“平均成交价”,买第 \(Q\) 张的边际价格是 \(0.3+Q/(2\ell)\)(总成本 \(PQ\) 对 \(Q\) 求导)。最优点上,边际价格正好等于你心中的价值 \(\pi\):再多买一张,付出的价格已经不低于它值的钱。这和厂商“边际成本 = 边际收益”是同一个条件。

金融直觉:这就是策略容量的雏形。把 \(\pi-0.3\) 想成预期 alpha,把 \(1/\ell\) 想成线性冲击系数。最优规模与 alpha 和流动性都成正比;超过 \(Q^*\) 继续加仓,冲击成本的增加快于 alpha 收入,总利润下降,加到 \(2Q^*\) 时利润归零。很多基金规模膨胀后业绩下滑,机制就在这里。

补充:Kyle 模型给出同样的结构

Iowa 例是 Kyle(1985)模型的简化版。这里简要给出单期 Kyle 模型的结论(原书未展开,属本书补充),它把“流动性从哪里来”也内生化了。

设资产价值 \(v\sim N(p_0,\Sigma_0)\);一个知情者观察到 \(v\),提交订单 \(x\);噪声交易者提交 \(u\sim N(0,\sigma_u^2)\),与 \(v\) 独立;竞争性做市商只看到总订单流 \(y=x+u\),按 \(p=E[v\mid y]\) 定价。线性均衡为

\[x=\beta\,(v-p_0),\quad p=p_0+\lambda y,\qquad \beta=\frac{\sigma_u}{\sqrt{\Sigma_0}},\quad \lambda=\frac{\sqrt{\Sigma_0}}{2\sigma_u}.\]

推导思路:给定 \(\lambda\),知情者最大化 \(E[(v-p_0-\lambda(x+u))x\mid v]\),得 \(x=(v-p_0)/(2\lambda)\),即 \(\beta=1/(2\lambda)\);给定 \(\beta\),做市商的投影系数 \(\lambda=\operatorname{Cov}(v,y)/\operatorname{Var}(y)=\beta\Sigma_0/(\beta^2\Sigma_0+\sigma_u^2)\);两式联立即得上面的解。三个结论:

推导拆解:把 Kyle 模型的“推导思路”逐步写出来。记号:\(v\sim N(p_0,\Sigma_0)\) 读作“\(v\) 服从均值 \(p_0\)、方差 \(\Sigma_0\) 的正态分布”(这里 \(\Sigma_0\) 是方差,不是求和号);\(\sigma_u\) 是噪声订单的标准差。 第一步(知情者的问题):他已知 \(v\),猜测做市商按 \(p=p_0+\lambda y\) 定价。他每单位赚 \(v-p\),所以期望利润是 \(E[(v-p_0-\lambda x-\lambda u)x\mid v]=(v-p_0)x-\lambda x^2\)。这里用了 \(E[u]=0\),且 \(u\) 与 \(v\) 独立,所以含 \(u\) 的项期望为零。 第二步,这是关于 \(x\) 的开口向下抛物线(和 Iowa 例同形),求导令为零:\((v-p_0)-2\lambda x=0\),得 \(x=(v-p_0)/(2\lambda)\),所以 \(\beta=1/(2\lambda)\)。 第三步(做市商的问题):他猜测知情者下单 \(x=\beta(v-p_0)\),于是看到的 \(y=\beta(v-p_0)+u\)。竞争使他按 \(E[v\mid y]\) 定价,联合正态下这是回归:\(\lambda=\operatorname{Cov}(v,y)/\operatorname{Var}(y)\)。算协方差:\(\operatorname{Cov}(v,y)=\beta\Sigma_0\);算方差:\(\operatorname{Var}(y)=\beta^2\Sigma_0+\sigma_u^2\)(两项独立,方差相加)。 第四步(联立):把 \(\beta=1/(2\lambda)\) 代入 \(\lambda=\beta\Sigma_0/(\beta^2\Sigma_0+\sigma_u^2)\),两边同乘 \(4\lambda^2\) 整理得 \(\Sigma_0+4\lambda^2\sigma_u^2=2\Sigma_0\),即 \(\lambda^2=\Sigma_0/(4\sigma_u^2)\),\(\lambda=\sqrt{\Sigma_0}/(2\sigma_u)\),再得 \(\beta=\sigma_u/\sqrt{\Sigma_0}\)。 第五步(利润):\(E[x(v-p)]=E[\beta(v-p_0)\cdot((v-p_0)-\lambda\beta(v-p_0)-\lambda u)]=\beta\Sigma_0(1-\lambda\beta)\)。因为 \(\lambda\beta=\tfrac12\),利润 \(=\tfrac12\beta\Sigma_0=\tfrac12\sigma_u\sqrt{\Sigma_0}\)。 第六步(价格吸收了多少信息):回归后剩余方差 \(=\Sigma_0-\lambda\operatorname{Cov}(v,y)=\Sigma_0-\lambda\beta\Sigma_0=\Sigma_0/2\)。 这种“各方先猜对方的策略、在猜测下各自最优、再要求猜测与实际一致”的解法叫“理性预期均衡”,第 14 章的 Glosten–Milgrom 模型用的是同样的逻辑。

金融直觉:为什么知情者交易强度 \(\beta=\sigma_u/\sqrt{\Sigma_0}\) 与噪声成正比?因为噪声订单是他的“掩护”。市场里散户和指数调仓的订单越多,他的订单越难被识别,可以下得越大。这就是机构偏爱在开盘、收盘这类成交集中的时段执行大单的原因。\(\lambda\) 则可以在实务中直接估计:用一段时间的价格变化对带符号的成交量回归,斜率就是该股票的 Kyle's lambda,它是常用的非流动性度量之一。

  • 价格冲击系数 \(\lambda\)(Kyle's lambda)与价值不确定性成正比、与噪声交易规模成反比。\(1/\lambda\) 就是 Iowa 例中的流动性 \(\ell\) 所刻画的“市场深度”。
  • 知情者的期望利润 \(E[(v-p)x]=\tfrac12\sigma_u\sqrt{\Sigma_0}\):对噪声交易规模(流动性)线性。它可以写成 \(E[(v-p_0)^2]/(4\lambda)=\Sigma_0/(4\lambda)\):给定市场深度 \(1/\lambda\),利润对信息优势是二次的,与 Iowa 例一致;但在均衡中做市商预见到信息风险更大,会把 \(\lambda\) 提高到与 \(\sqrt{\Sigma_0}\) 成正比,流动性随之变差,所以最终利润只与 \(\sqrt{\Sigma_0}\) 成正比。Iowa 例的流动性 \(\ell\) 是外生给定的,没有这一反馈。
  • 知情者赚的钱恰好等于噪声交易者亏的钱(零和),而价格吸收了一半信息:\(\operatorname{Var}(v\mid p)=\Sigma_0/2\)。

若有 \(N\) 个观察到同样信息的知情者相互竞争,可以同样推出(原书第 10 章第 3 题的答案)

\[\lambda=\frac{\sqrt{N\Sigma_0}}{(N+1)\sigma_u},\qquad \text{知情者合计利润}=\lambda\sigma_u^2=\frac{\sqrt{N\Sigma_0}\,\sigma_u}{N+1},\qquad \operatorname{Var}(v\mid p)=\frac{\Sigma_0}{N+1}.\]

竞争使每个人交易得更激进,合计利润下降,价格变得更有信息含量。这正是 10.7 节“知情交易者之间的竞争”的数学版本。

正交性:精确且与众不同

由于知情交易的盈利依赖流动性,最赚钱的知情交易者往往是在其他知情交易者都不想交易时想交易的人:他们不必与人争夺流动性,流动性对他们相对便宜。在别人不想交易时想交易,要么是有别人没有的洞见,要么是估错了:估错时,便宜的流动性降低了犯错的成本;估对时,便宜的流动性提高了利润。

用同样信息、同样方法的交易者,估计高度相关,必须相互竞争才能从洞见获利。与他人估计不相关的估计称为正交估计(orthogonal estimates),来自使用别人不用的信息,或者用不同方法分析数据。Harris 的结论是:

最赚钱的交易者估计非常准确,且与他人的估计不相关:精确且正交,在没有人正确时正确。

精确性与正交性都提高利润,两者之间存在权衡:精确但高度相关的估计,与不太精确但正交的估计,可能同样赚钱。“在没人正确时正确,即使不常发生,也能赚很多钱;但如果你错的时候大家都对,你会亏很多。”

量化中这个思想有精确的表述。设两个标准化信号与未来收益的相关系数(信息系数,IC)分别为 \(IC_1\)、\(IC_2\),两信号之间的相关系数为 \(\rho\),则用最小二乘组合后的 IC 为

\[IC_{\text{组合}}=\sqrt{\frac{IC_1^2+IC_2^2-2\,IC_1IC_2\,\rho}{1-\rho^2}} .\]

\(\rho=0\) 时 \(IC_{\text{组合}}^2=IC_1^2+IC_2^2\),信息完全叠加;\(\rho\) 很高时,第二个信号几乎不增加信息。这是本章 10.2 节“相关误差设下地板”的同一件事,只是换成了信号的语言。

推导拆解:这个公式就是“用两个标准化自变量做多元回归的 \(R^2\)”。记 \(c=(IC_1,IC_2)^\top\)(自变量与因变量的相关系数向量,上标 \(\top\) 表示转置,把行写成列),\(R=\begin{pmatrix}1&\rho\\\rho&1\end{pmatrix}\)(自变量之间的相关矩阵)。标准化变量回归的 \(R^2=c^\top R^{-1}c\)。 第一步,2×2 矩阵求逆:\(R^{-1}=\dfrac{1}{1-\rho^2}\begin{pmatrix}1&-\rho\\-\rho&1\end{pmatrix}\)(对角互换、非对角变号、除以行列式 \(1-\rho^2\))。 第二步,相乘:\(c^\top R^{-1}c=\dfrac{IC_1^2-2\rho IC_1IC_2+IC_2^2}{1-\rho^2}\),开方即为组合 IC。 第三步,验证两个特例:\(\rho=0\) 时分母为 1,平方相加;\(IC_1=IC_2=IC\)、\(\rho\to1\) 时,分子 \(2IC^2(1-\rho)\)、分母 \((1-\rho)(1+\rho)\),比值 \(\to IC^2\),第二个信号等于没加。 矩阵求逆与行列式见 第 00 册第 06 章 线性代数速成。 一个容易忽略的细节:当 \(\rho\) 较大而 \(IC_2\) 较小时,组合中第二个信号的权重可以是负的(用它来对冲第一个信号里的噪声),组合 IC 反而可能比只用第一个信号时更高。

10.6 不知情交易者与市场悖论

知情交易者需要不知情交易者

**知情交易者若只彼此交易,就无法盈利。**交易是零和的,较消息灵通者从较不灵通者处获利,输家停止交易;剩下的人再分出输赢,输家再退出……最终只剩最消息灵通的一个人想交易,却没人与他交易。没有知情交易,价格也就不反映知情交易者收集的信息。(这是“无交易定理”的直观版本。)

所以,**知情交易只有在与不知情交易者交易时才能盈利。**不知情交易者平均输给知情交易者,但他们容忍这些损失,因为市场为他们提供了其他有价值的服务:投资、借款、对冲、资产交换、娱乐(第 08 章)。

不知情交易者自然想识别并避开知情交易者,知情交易者则设法匿名或假装不知情。**在容易识别知情交易者的市场里,知情交易成本高,价格的信息含量可能更低。**知情交易在不知情交易者多的市场里最赚钱,于是许多知情交易者在那里竞争,价格非常有信息含量;这时知情交易者的大额获利机会很少,每个不知情交易者的损失很小,但总体损失仍然很大。

市场悖论

悖论:如果价格很有信息含量,知情交易就不盈利;如果知情交易不盈利,知情交易者就不交易,价格也就不会有信息含量!

这就是 Grossman 与 Stiglitz(1980)提出的“信息有效市场不可能存在”的悖论。前提推出了与自身矛盾的结论,必有某处出错。

  • 解释一:基本面价值广为人知,没有知情交易者价格也有效。但价值很少是共识,这个解释不吸引人。
  • 解释二(Harris 认为最合理):**价格并非总是很有信息含量。**价格显著偏离价值时,知情交易者交易赚钱,使价格更有信息含量,消除了进一步获利的机会,然后停止交易;之后价值或价格再次变化,再次偏离,知情交易者又能获利。知情交易者使价格有信息含量,但价格并非总是有信息含量。

金融直觉:股指期货的基差是最好的例子。理论上期货价格应等于现货的持有成本价格,但实际基差会在一个“无套利区间”里来回游荡,区间宽度由交易成本、融券成本和资金成本决定。基差在区间内时套利者不动,价格“不完全有效”;一旦越过区间边界,套利者立刻进场把它拉回。均衡状态不是“价格永远等于理论值”,而是“偏离刚好小到不值得去纠正”。把“套利成本”换成“研究成本 + 冲击成本”,就是 Grossman–Stiglitz 悖论的解答:价格的无效程度正好足以补偿知情交易者的成本。

价格偏离价值的两种方式

  1. 价值变了,价格没跟上,常发生在新闻到达时。最先得知新闻的新闻交易者获利最多;新闻交易者反应不足或过度时,价值交易者可以纠正;若新闻交易者或价值交易者犯了系统性错误,信息导向技术交易者可以获利;若变化来自共同因子,套利者可以发现相似工具不再相对正确定价。
  2. 价格变了,价值没变,发生在不知情交易者推动价格时,例如大额交易或许多小交易者同向交易。大多数人分辨不出价格变化是来自不知情交易还是知情者对新信息的反应。最能分辨的是价值交易者,他们在价格显著偏离价值时获利,但必须非常确定价格变化不是新信息引起的,否则就会与新闻交易者交易并输给他们。套利者面临同样的风险。

一句话:**新闻交易者倾向于在价值变化时赚钱,价值交易者倾向于在不知情交易者推动价格时赚钱。**这对应量化中两类截然不同的 alpha:一类追逐信息(事件驱动、动量),一类为流动性需求者提供对手方(反转、价值、流动性提供)。

10.7 竞争与市场效率

知情交易者之间的竞争

知情交易是一门竞争性生意。最成功的人更高效地收集重大信息、以更小的冲击交易;做不到的人最终失败。**仍在经营的最不成功的知情交易者,其交易利润恰好覆盖总费用。**知情交易特别赚钱时,会吸引许多人进入,他们争夺流动性、把价格推近价值,利润随之下降。

进入和退出都很慢,因为交易者很难预测自己的盈利能力:他们不分享信息,不知道自己相对别人有多灵通,只能依赖过去的业绩,而过去的业绩并不可靠。消息不灵通的人常因运气好而盈利,消息灵通的人有时因运气差而亏损。预测自己的盈利能力,是知情交易者面临的最重要问题(原书第 22 章讨论业绩评估)。

侧栏:一张五美元钞票的美元价格。用一美元钞票换五美元钞票,通常是 5 换 1,这个市场是强式有效的,因为五美元钞票的价值是共识。但在机场,行李车租赁机只收一美元钞票,你只有一张五美元,又没人愿意按常价换给你时,你可能愿意用它换不到五张一美元。即使价值是共识,流动性需求也会使价格偏离价值。

三种有效市场与 Harris 的定义

价格永远不会完全反映所有可能被收集的信息:获取成本高到无法从中获利的信息不会被收集。价格中的信息取决于获取信息的成本和利用信息的机会。

传统上,金融经济学家把有效市场分为三种形式:

  • 弱式有效(weak-form efficient):价格反映过去价格中的全部信息,图表和对过去价格的统计分析无用,价格看起来像随机游走。多数已发表的研究认为市场是弱式有效的。Harris 调侃道:如果研究者发现不是这样,他们大概会去交易而不是发表结果。
  • 半强式有效(semistrong-form efficient):价格反映全部公开信息,知情交易者只有靠非公开信息才能赚钱。实证表明,对容易获得且容易解读的公开信息,市场一般是半强式有效的。
  • 强式有效(strong-form efficient):价格立即反映全部公开和私有信息,知情交易者永远无法获利。唯一强式有效的市场是价值为共识的工具的市场,这种市场很少有意思。

这三种定义都没有承认获取和利用信息是有成本的。Harris 给出一个更贴近微观结构的定义:

在有效市场中,价格反映交易者能够获取、并能据以盈利交易的全部信息。

这个定义隐含地纳入了获取信息的成本、利用信息的成本和知情交易的价格冲击。对量化研究来说,它意味着:alpha 必须扣除信息成本和交易成本之后来评价;一个只在零成本下存在的“异象”与有效市场并不矛盾。

10.8 流动性与信息含量的权衡,以及公开信息的好处

权衡

信息含量高的价格对经济极为有益(第 09 章),但并不便宜:不知情交易者输给知情交易者的钱,支付了价格中大部分信息的成本。这降低了不知情交易者使用市场的净收益。所以挫败知情交易者的政策,可能在提高流动性的同时降低价格的信息含量,限制内幕交易就是例子。Harris 认为信息价格对经济的总收益很可能远超不知情交易者的损失,但比较市场结构时重要的是收益的变化,而这通常很难估计。

公开信息可以同时改善两者

促进公布重大基本面信息的政策,能同时提高流动性和价格效率。

  • 信息容易解读时,公布后价格立即反映,知情交易者无利可图;只有知情交易者能解读时,公布让所有知情交易者同时行动,竞相交易使价格迅速调整,他们赚得比慢慢交易时少。两种情况下,价格都更有信息含量,不知情交易者的损失都更少。
  • 公布信息还降低了成为知情交易者的成本,知情交易者可以对更小的偏离进行盈利交易,价格更有信息含量。

许多股票市场要求上市公司及时披露信息;没有这类要求的市场里,许多公司也自愿披露,因为投资者输给知情交易者的风险小,就愿意为股票付更高的价格,公司的资本成本因而降低。政府统计机构和大量私营数据公司生产并出售基本面信息。

侧栏:重大信息发布前暂停交易。许多股票市场要求上市公司在发布重大信息前通知交易所,交易所暂停交易,直到信息发布后所有人都有机会评估。这保护了不知情交易者(尤其是挂单提供流动性的人),但使价格形成推迟几分钟。Harris 认为保护不知情交易者更重要:几分钟的延迟难以显著降低资源配置质量,而知情交易对流动性提供者的伤害是明显的。

侧栏:《颠倒乾坤》(Trading Places)与 USDA 橙子产量报告。1983 年的这部喜剧里,两个邪恶的商品交易商设法提前拿到美国农业部的橙子产量报告,被他们坑害的两位主角截获报告并篡改成“收成很差”。交易大厅里,反派大量买入冷冻浓缩橙汁期货,主角在高位大量卖出;真实报告公布后价格暴跌,反派破产,主角发财。电影有夸张,但准确表现了这份报告的重要性。现实中 USDA 极其小心地防止泄露:统计员在封闭、没有电话和网络的房间里连夜编制报告。

本章要点(Harris 原书)

知情交易者使价格有信息含量;价值交易者估计基本面价值,新闻交易者估计价值的变化,信息导向技术交易者估计与价值不一致的模式,套利者估计价值的差异;获取信息和交易的成本都低时价格最有信息含量;价格充分反映全部信息时,没人能预测价格变化;价格不可能总是完全有信息含量;以相对市场收益衡量时交易是零和博弈;知情交易者只有在别人愿意输给他们时才能获利,所以市场需要功利型交易者才能产生有信息的价格。知情交易者最常犯的错误,是在没有比较优势时交易。


量化实战

本章是 alpha 的理论基础。下面四段代码分别验证信息聚合、知情交易的利润与容量、反应不足与过度反应,以及信号正交性。

1. 信息聚合:价格误差随独立信息源下降,相关性设下地板

import numpy as np, pandas as pd

rng = np.random.default_rng(1)
M, V = 20_000, 100.0                         # M 次独立"市场",真实价值 V

def market_price(f, a):
    """需求 D_i = a_i (f_i - P),零净供给出清 => P = sum(a_i f_i) / sum(a_i)。"""
    return (a * f).sum(axis=1) / a.sum(axis=1)

rows = []
for N in [1, 10, 100]:
    for rho in [0.0, 0.3]:                   # rho: 交易者误差中的共同成分占比(相关性)
        sig = 10.0
        common = rng.normal(0, sig * np.sqrt(rho), (M, 1))
        own = rng.normal(0, sig * np.sqrt(1 - rho), (M, N))
        f = V + common + own                 # f_i = V + e_i, Var(e_i)=sig^2, Corr(e_i,e_j)=rho
        P = market_price(f, np.ones((M, N)))
        rows.append(dict(N=N, rho=rho, 价格误差标准差=(P - V).std(),
                         理论值=sig * np.sqrt(rho + (1 - rho) / N)))
print(pd.DataFrame(rows).round(3).to_string(index=False))

# 精度不同的交易者:头寸强度 a_i 与精度 1/sigma_i^2 成正比 -> 价格就是逆方差加权平均
N = 10
sig_i = np.array([2.0] * 2 + [20.0] * 8)     # 2 个消息灵通者,8 个消息很差的人
f = V + rng.normal(0, 1, (M, N)) * sig_i
for name, a in [("等权(人人头寸强度相同)", np.ones(N)), ("精度加权 a_i∝1/σ_i²", 1 / sig_i**2)]:
    P = market_price(f, np.tile(a, (M, 1)))
    print(f"{name}: 价格误差标准差 {(P - V).std():.3f}")
print(f"最好的单个交易者误差标准差 {sig_i.min():.3f};逆方差加权理论值 {1/np.sqrt((1/sig_i**2).sum()):.3f}")

输出:

  N  rho  价格误差标准差    理论值
  1  0.0    9.936 10.000
  1  0.3   10.038 10.000
 10  0.0    3.143  3.162
 10  0.3    6.085  6.083
100  0.0    1.002  1.000
100  0.3    5.581  5.541
等权(人人头寸强度相同): 价格误差标准差 5.674
精度加权 a_i∝1/σ_i²: 价格误差标准差 1.388
最好的单个交易者误差标准差 2.000;逆方差加权理论值 1.387

误差独立时,100 个交易者把价格误差从 10 降到 1,符合 \(\sigma/\sqrt N\);误差相关系数为 0.3 时,100 个人只能降到约 5.5,地板是 \(\sigma\sqrt{\rho}\approx5.48\)。精度加权的市场价格(误差 1.39)比最好的单个交易者(2.0)还准,而等权平均(5.67)被 8 个差交易者拖累。这说明了两件事:财富和头寸向准确者集中,对价格效率至关重要;同样数据、同样模型的研究者再多,也只相当于一个人。

2. 知情交易的利润与策略容量

import numpy as np, pandas as pd

# ---- 1. 原书 Iowa 例:P = 0.3 + Q/(4l),利润 (pi-0.3)Q - Q^2/(4l) ----
def iowa(l, pi):
    Q = 2 * l * (pi - 0.3)
    return Q, (pi - 0.3) * Q - Q**2 / (4 * l)
for l, pi in [(10_000, 0.40), (100, 1.00)]:
    Q, prof = iowa(l, pi)
    print(f"流动性 l={l:>6}, 信念 pi={pi:.2f}: 最优买入 Q*={Q:,.0f}, 期望利润 {prof:,.1f} 美元")

# ---- 2. 单期 Kyle 模型(N 个同等知情者):理论 vs 蒙特卡洛 ----
def kyle_theory(Sigma0, su, N):
    lam = np.sqrt(N * Sigma0) / ((N + 1) * su)
    beta = su / np.sqrt(N * Sigma0)                   # 每个知情者的交易强度
    return dict(lam=lam, beta=beta, total_profit=lam * su**2,
                post_var=Sigma0 / (N + 1))

rng = np.random.default_rng(3)
Sigma0, su, M = 4.0, 1000.0, 400_000                  # 价值标准差 2 元;噪声交易量标准差 1000 股
rows = []
for N in [1, 2, 5]:
    th = kyle_theory(Sigma0, su, N)
    v = rng.normal(0, np.sqrt(Sigma0), M)             # 价值偏离先验均值 p0=0 的部分
    u = rng.normal(0, su, M)
    y = N * th["beta"] * v + u                        # 总订单流
    lam_hat = np.cov(v, y)[0, 1] / y.var()            # 做市商的最优线性定价 E[v|y]=lam*y
    p = lam_hat * y
    profit = (N * th["beta"] * v * (v - p)).mean()    # 知情者合计利润 = 噪声交易者损失
    rows.append(dict(N=N, λ理论x1000=th["lam"]*1e3, λ模拟x1000=lam_hat*1e3,
                     合计利润理论=th["total_profit"], 合计利润模拟=profit,
                     噪声者损失模拟=(u * (p - v)).mean(),
                     事后方差理论=th["post_var"], 事后方差模拟=((v - p)**2).mean()))
print(pd.DataFrame(rows).round(4).to_string(index=False))

输出:

流动性 l= 10000, 信念 pi=0.40: 最优买入 Q*=2,000, 期望利润 100.0 美元
流动性 l=   100, 信念 pi=1.00: 最优买入 Q*=140, 期望利润 49.0 美元
 N  λ理论x1000  λ模拟x1000   合计利润理论    合计利润模拟   噪声者损失模拟  事后方差理论  事后方差模拟
 1    1.0000    1.0002 1000.000 1002.7889 1002.7922  2.0000  2.0056
 2    0.9428    0.9425  942.809  943.0860  943.0946  1.3333  1.3337
 5    0.7454    0.7456  745.356  746.8112  746.8274  0.6667  0.6680

Iowa 例的两个数字与原书一致。Kyle 模型的模拟验证了三件事:做市商用最小二乘估出的冲击系数与理论 \(\lambda\) 一致;知情者合计利润与噪声交易者的损失逐元相等(零和);知情者从 1 个增加到 5 个,合计利润从 1000 降到约 745,而价格的事后方差从 2.0 降到 0.67,价格更有效了。

用于策略容量:Iowa 例和 Kyle 模型给出的是同一个结构,即最优规模与流动性成正比、利润在最优规模处达到峰值。实务中把冲击成本写成交易量的函数(线性或平方根冲击模型),在信号强度给定时求最优仓位,就是策略容量分析的最简模型。当多家机构用同一个信号交易时,它们就是 Kyle 模型里的 \(N\) 个知情者:总利润下降,单家利润按约 \(1/N^{1.5}\) 的速度下降,这就是“拥挤”的定量含义。

3. 反应不足与过度反应:动量与反转从哪里来

模拟 2000 次新闻事件:新闻使价值变化 \(s\),公告日价格只反映 \(k\,s\)(加噪声),随后 20 天价值交易者把剩余部分推进价格。

import numpy as np, pandas as pd
import statsmodels.api as sm

rng = np.random.default_rng(5)
n, ss, se0 = 2000, 0.05, 0.01                 # 事件数、新闻冲击标准差、公告日噪声标准差
rows = []
for k in [0.6, 1.0, 1.4]:                     # 公告日价格只反映了 k 倍的价值变化
    s = rng.normal(0, ss, n)                  # 新闻带来的基本面价值变化(对数收益)
    r0 = k * s + rng.normal(0, se0, n)        # 公告日收益:新闻交易者的反应(含噪声)
    r1 = (1 - k) * s + rng.normal(0, 0.02, n) # 随后 20 日:价值交易者把价格推回基本面
    fit = sm.OLS(r1, sm.add_constant(r0)).fit()
    pnl = np.sign(r0) * r1                    # 顺着公告日方向交易、持有 20 日
    rows.append(dict(k=k, 类型={0.6: "反应不足", 1.0: "反应正确", 1.4: "过度反应"}[k],
                     回归斜率=fit.params[1],
                     理论斜率=k * (1 - k) * ss**2 / (k**2 * ss**2 + se0**2),
                     t值=fit.tvalues[1], 顺势策略平均收益bp=pnl.mean() * 1e4))
print(pd.DataFrame(rows).round(3).to_string(index=False))

输出:

  k   类型   回归斜率  理论斜率      t值  顺势策略平均收益bp
0.6 反应不足  0.577  0.60  37.708     146.074
1.0 反应正确  0.010  0.00   1.087       7.653
1.4 过度反应 -0.276 -0.28 -42.229    -156.300

公告日收益含噪声时,理论斜率是 \(k(1-k)\sigma_s^2/(k^2\sigma_s^2+\sigma_0^2)\);没有噪声时就是正文中的 \((1-k)/k\)。反应不足时后续收益与公告日同号(延续),顺势策略每次事件赚约 146 bp;过度反应时反号(反转),顺势策略亏损同样多,反过来做就是短期反转策略;反应正确时没有可预测性。这就是表 10-1 的定量版本,也是检验一个市场或一类事件属于“反应不足”还是“过度反应”的标准做法:做事件研究,看事件后漂移的方向。

需要牢记 Harris 的提醒:这类机会来自知情交易者的系统性错误,错误会被学习纠正。\(k\) 不是常数,随着越来越多的人交易这个模式,\(k\) 会向 1 收敛,策略收益随之衰减。

4. 正交性:一个弱而正交的信号胜过一个强而相关的信号

import numpy as np

rng = np.random.default_rng(11)
T = 2_000_000
def combined_ic(ic1, ic2, rho):
    """两个标准化信号对收益做 OLS 组合后的相关系数(多元 R 的平方根)。"""
    return np.sqrt((ic1**2 + ic2**2 - 2 * ic1 * ic2 * rho) / (1 - rho**2))

def simulate(ic1, ic2, rho):
    # 构造 (s1, s2, r) 的联合正态,满足 Corr(s1,r)=ic1, Corr(s2,r)=ic2, Corr(s1,s2)=rho
    C = np.array([[1, rho, ic1], [rho, 1, ic2], [ic1, ic2, 1]])
    X = rng.multivariate_normal(np.zeros(3), C, T)
    S, r = X[:, :2], X[:, 2]
    w = np.linalg.lstsq(S, r, rcond=None)[0]
    return np.corrcoef(S @ w, r)[0, 1]

base = 0.05
for name, ic2, rho in [("加一个同样强但高度相关的信号", 0.05, 0.8),
                       ("加一个弱一些但正交的信号  ", 0.03, 0.0),
                       ("加一个同样强且正交的信号  ", 0.05, 0.0)]:
    print(f"{name}: 理论组合 IC {combined_ic(base, ic2, rho):.4f}, 模拟 {simulate(base, ic2, rho):.4f}")

输出:

加一个同样强但高度相关的信号: 理论组合 IC 0.0527, 模拟 0.0520
加一个弱一些但正交的信号  : 理论组合 IC 0.0583, 模拟 0.0587
加一个同样强且正交的信号  : 理论组合 IC 0.0707, 模拟 0.0718

在 IC 为 0.05 的信号上,再加一个同样强但相关系数 0.8 的信号,组合 IC 只升到 0.053;加一个只有 0.03 但正交的信号,反而升到 0.058。这还只是统计上的好处。Harris 的论证更进一步:正交信号的交易时点与别人不同,流动性更便宜,冲击成本更低,在同样的 IC 下净收益更高。所以因子研究不仅要看单因子 IC,还要看与现有因子库和市场主流因子的相关性。

5. 把本章用作研究清单

  • 定位 alpha 来源:价值类因子对应价值交易者(赚“不知情交易者推动价格”的钱,同时承担漏掉新信息的风险);事件驱动和新闻 NLP 对应新闻交易者(拼速度,警惕陈旧信息);动量、PEAD 和短期反转对应信息导向技术交易者(赚别人系统性错误的钱,会衰减);配对和统计套利对应套利者(必须区分三种情形)。
  • 陈旧信息检验:用事件研究看信息公开前是否已有漂移。公开前价格已经走完,说明信息在公开时就已陈旧,基于公告的策略是伪知情交易。另类数据的价值同样取决于它是否“在价格里”。
  • 配对交易的三种情形:价差扩大时,先查有没有一方的特有新闻。有,就是情形 1,不要进场;没有,再考虑是情形 2 还是流动性冲击。
  • 回测纪律:模式识别的天生偏差意味着必须做多重检验校正、样本外检验和衰减监控。“预测自己的盈利能力是最重要的问题”,要用统计方法区分技能与运气。
  • 净 alpha 标准:按 Harris 的效率定义,任何 alpha 都要扣除数据成本、研究成本和交易成本后再评价,并给出容量估计。
  • 作为流动性提供者:本章说明了流动性提供者会输给知情交易者,这是后续交易商与买卖价差理论(原书第 13–14 章)中逆向选择成本的来源。

本章小结

基本面价值是基于当前信息的期望现值,是完美预见值的最佳估计,它的变化不可预测,价格等于基本面价值加噪声。知情交易者在价格低于估计时买、高于时卖,把价格推向自己的估计;市场把众多独立的估计聚合成一个通常比任何个人都准的价格,并按精度和财富加权,但相关的误差会设下地板。知情交易者分为价值交易者(全部信息、慢、金字塔组织、最后的流动性提供者)、新闻交易者(新信息、快、扁平组织、易犯陈旧信息和反应幅度错误)、信息导向技术交易者(拾荒者,策略随学习衰减,动量来自反应不足)和套利者(相对价值、一价定律、必须区分三种情形)。知情交易的利润对流动性线性、对信息优势二次(Iowa 例;Kyle 模型给出同样结构),精确性与正交性都创造利润。知情交易者只有与不知情交易者交易才能获利;Grossman–Stiglitz 式悖论的解答是价格并非总是有效。Harris 把有效市场定义为“价格反映能够获取并据以盈利交易的全部信息”。流动性与价格信息含量之间常有权衡,而促进公开披露的政策可以同时改善两者。

概念 公式或要点
基本面价值 \(V_t=E[V^{PF}\mid\mathcal I_t]\),\(E[V_{t+1}-V_t\mid\mathcal I_t]=0\)
价格与噪声 \(P_t=V_t+\text{noise}_t\)
信息聚合 \(P=\frac1N\sum f_i\),\(\operatorname{Var}(P-V)=\sigma^2\big(\rho+\frac{1-\rho}{N}\big)\)
精度加权 \(\hat V=\sum(f_i/\sigma_i^2)/\sum(1/\sigma_i^2)\)
新闻交易者估值 \(\hat V=P_{\text{当前}}+\widehat{\Delta V}_{\text{新闻}}\)
反应不足 / 过度 后续收益对公告收益斜率 \((1-k)/k\):正为延续,负为反转
套利 \(r_A-r_B=\epsilon_A-\epsilon_B\);一价定律;三种情形
Iowa 例 \(Q^*=2\ell(\pi-0.3)\),\(\Pi^*=\ell(\pi-0.3)^2\)
Kyle 模型 \(\lambda=\sqrt{\Sigma_0}/(2\sigma_u)\),利润 \(\tfrac12\sigma_u\sqrt{\Sigma_0}\),\(\operatorname{Var}(v\mid p)=\Sigma_0/2\)
正交性 \(IC^2_{\text{组合}}=(IC_1^2+IC_2^2-2IC_1IC_2\rho)/(1-\rho^2)\)
市场悖论 价格并非总是有效,知情交易者在偏离出现时获利
Harris 的效率定义 价格反映能够获取并据以盈利交易的全部信息

练习

基础

  1. 数据(data)与信息(information)有什么区别?各自如何产生?(原书第 10 章第 1 题) 提示:数据是原始观测;信息是对价值有含义、尚未在价格里的那部分内容,需要分析才能从数据中提炼出来。
  2. 由 \(V_t=E[V^{PF}\mid\mathcal I_t]\) 证明 \(E[V_{t+2}-V_t\mid\mathcal I_t]=0\),并解释它为什么意味着“基本面价值的变化不可预测”。
  3. 在代数示例中,若 \(N=25\)、个人误差标准差为 8、误差两两相关系数为 0.2,市场价格误差的标准差是多少?若 \(N\to\infty\) 呢? 答案:\(8\sqrt{0.2+0.8/25}=8\sqrt{0.232}\approx3.85\);极限为 \(8\sqrt{0.2}\approx3.58\)。
  4. 用 Greasy Earth Oil 的例子说明什么是伪知情交易者,并给出两条判断信息是否陈旧的经验法则。
  5. 列出套利者在“一个价格变了、相似工具价格没变”时可能面对的三种情形,并说明哪种情形下套利交易盈利。

进阶

  1. Iowa 例中,若你是风险厌恶的,目标为最大化 \(\Pi(Q)-\tfrac{\gamma}{2}\operatorname{Var}\),其中头寸收益方差为 \(Q^2\pi(1-\pi)\),求最优 \(Q\)。若有其他知情交易者与你竞争,结论如何变化?(原书第 10 章第 3 题) 提示:一阶条件 \((\pi-0.3)-Q/(2\ell)-\gamma\pi(1-\pi)Q=0\),得 \(Q^*=(\pi-0.3)/\big(1/(2\ell)+\gamma\pi(1-\pi)\big)\),风险厌恶使头寸缩小;竞争的情形参考正文 Kyle 模型的 \(N\) 人结论:合计交易更激进、价格更有效、每人利润下降。
  2. 在单期 Kyle 模型中推导 \(N\) 个知情者的均衡:证明 \(\lambda=\sqrt{N\Sigma_0}/\big((N+1)\sigma_u\big)\),\(\operatorname{Var}(v\mid p)=\Sigma_0/(N+1)\)。 提示:知情者 \(i\) 的一阶条件给出 \(\beta=1/\big((N+1)\lambda\big)\);做市商的投影给出 \(\lambda=N\beta\Sigma_0/(N^2\beta^2\Sigma_0+\sigma_u^2)\);联立求解。
  3. 若基本面价值服从随机游走,价值交易者还能赚钱吗?(原书第 10 章第 11 题) 提示:能。价值不可预测,但价格 = 价值 + 噪声,噪声若有均值回复,价格相对价值的偏离就可预测。价值交易者的利润来自噪声的回复,而非价值本身的可预测性。
  4. 短期内玉米价格上涨,对牛和猪的价格有何影响?长期呢?(原书第 10 章第 2 题) 提示:一价定律要求两者反映相同的玉米信息。短期内饲养成本上升可能促使提前出栏,现货供给增加、价格反而承压;长期存栏减少,肉价上升。套利者需要区分短期与长期的关系。
  5. 知情交易的社会最优水平是多少?知情交易者是否应合谋以减少重复研究?(原书第 10 章第 7、8 题) 提示:边际上,再多一份研究带来的价格信息改善的社会价值,应等于它的成本。合谋会减少研究重复,但也会减少竞争,使价格调整变慢、不知情交易者损失更多。
  6. 用量化实战第 3 段的代码,令 \(k\) 在 2000 个事件中服从 0.6 到 1.4 的均匀分布,顺势策略的平均收益是多少?如果你能事先识别出哪些事件属于反应不足,收益又是多少?这说明了什么? 提示:平均下来几乎为零;能区分时两类事件都能赚钱(反应不足做顺势、过度反应做反转)。真正的 alpha 来自对“哪类事件、哪类股票会反应不足”的识别能力。

原书推荐习题:第 10 章思考题第 3 题(竞争与风险厌恶下的最优交易量,联系 Kyle 模型与策略容量)、第 11 题(价值交易者的利润来源)、第 2 题(一价定律的短期与长期动态)、第 7–8 题(知情交易的社会最优水平)、第 9 题(自我评估比较优势)。


原书对照

本章小节 原书章节 PDF 页码 书内页码
章首 第三部分导言、第 10 章开篇 p.233–235 p.220–222
10.1 基本面价值、噪声与价格 10.1 Fundamental Values;10.2 Informed Traders p.235–237 p.222–224
10.2 价格如何变得有信息含量 10.3(含 An Algebraic Illustration 侧栏) p.237–239 p.224–226
10.3 激进交易还是隐秘交易 10.4 Informed Trading Strategies p.238–239 p.225–226
10.4 知情交易的四种风格 10.5 Styles of Informed Trading(表 10-1 至 10-3) p.239–248 p.226–235
10.5 知情交易的利润 10.6.1–10.6.2(Liquidity and Predictability、Orthogonality) p.248–250 p.235–237
10.6 不知情交易者与市场悖论 10.6.3–10.6.4 p.250–252 p.237–239
10.7 竞争与市场效率 10.6.5–10.6.6 p.252–253 p.239–240
10.8 权衡与公开信息 10.6.7–10.6.8 p.253–256 p.240–243
小结与习题 10.7–10.9 p.256–257 p.243–244

(书内页码 ≈ PDF 页码 − 13。Kyle 模型、信号组合 IC 公式为本书补充,原书未展开。)