量化交易中文教材

元信息:书名《Analysis of Financial Time Series》(第 3 版,2010);作者 Ruey S. Tsay;出版社 Wiley;本笔记负责 PDF 第 233–456 页(原书页码约 213–436)。


第 4 章 非线性模型及其应用(Nonlinear Models and Their Applications)——后半部分(接上一块)

本块从第 4.2.2 节(参数检验)末尾的 TAR-F 检验收尾开始,覆盖 4.2.3 应用、4.3 建模、4.4 预测、4.5 应用(美国失业率)、附录 A/B、习题与参考文献。

4.2.2(末尾)TAR-F 检验的收尾说明(PDF p.233)(接上一块)

  • 上一块已给出 Tsay (1989) 的阈值检验构造:把自回归按阈值变量 \(x_{t-d}\) 的大小重新排序得到「排序自回归」(arranged autoregression,式 4.47),用递归最小二乘得到标准化预测残差,再把预测残差对回归变量做回归,得到 F 统计量。
  • 本页补充:该 F 比在原假设下渐近服从自由度为 \((p+1,\ T-d-m-p)\) 的 F 分布,其中 \(p\) 为 AR 阶,\(d\) 为延迟,\(m\) 为启动递归所用的观测数。称为 TAR-F 检验。
  • 原理:若原假设成立(排序自回归中不存在模型变化),标准化预测残差应近似 iid、均值 0、方差 1,因此与回归变量 \(x_{(m+j)+d-i}\) 不相关。递归最小二乘公式和模拟研究见 Tsay (1989)。
  • 优点:避开了似然比检验的「冗余参数(nuisance parameter)只在备择假设下出现」问题;不需要知道阈值 \(r_1\);也不依赖备择模型中有几个状态(regime)。
  • 缺点:若真实模型确实是已知新息分布的两状态 SETAR,它的功效不如似然比检验。

4.2.3 应用(Applications)(PDF p.233–234)

对 5 个序列做非线性检验。对真实金融序列,先用 AR 模型去除序列相关,再对残差做检验。

  1. \(r_{1t}\):模拟 iid \(N(0,1)\),500 个观测。
  2. \(r_{2t}\):模拟 iid Student-\(t_6\),500 个观测。
  3. \(a_{3t}\):CRSP 等权指数月对数收益(1926–1997,864 个观测)的 AR 残差,模型 \((1-0.180B+0.099B^3-0.105B^9)r_{3t}=0.0086+a_{3t}\)。
  4. \(a_{4t}\):CRSP 市值加权指数月对数收益残差,\((1-0.098B+0.111B^3-0.088B^5)r_{4t}=0.0078+a_{4t}\)。
  5. \(a_{5t}\):IBM 月对数收益残差,\((1-0.077B)r_{5t}=0.011+a_{5t}\)。

表 4.2 要点(BDS 检验取 \(k=2,\dots,5\),\(\delta=\hat\sigma_a\) 与 \(1.5\hat\sigma_a\);F 检验对模拟序列和 IBM 用 AR(6),对指数用上面的 AR 阶;延迟 \(d=1\)):

数据 Q(5) Q(10) BDS(δ=1.5σ̂, k=2…5) BDS(δ=σ̂, k=2…5) Ori-F TAR-F
N(0,1) 3.2 6.5 −0.32, −0.14, −0.15, −0.33 −0.77, −0.71, −1.04, −1.27 1.13 0.87
\(t_6\) 0.9 1.7 −0.87, −1.18, −1.56, −1.71 −0.35, −0.76, −1.25, −1.49 0.69 0.81
ln(ew) 2.9 4.9 9.94, 11.72, 12.83, 13.65 10.01, 11.85, 13.14, 14.45 5.05 6.77
ln(vw) 1.0 9.8 8.61, 9.88, 10.70, 11.29 7.01, 7.83, 8.64, 9.53 4.95 6.85
ln(ibm) 0.6 7.1 4.96, 6.09, 6.68, 6.82 3.82, 4.70, 5.45, 5.72 1.32 1.51

结论:Ljung–Box 统计量确认残差无序列相关;对模拟序列,BDS 与 F 检验在 5% 水平都不显著;对真实收益,BDS 检验高度显著;F 检验对两个指数显著,但对 IBM 不显著。总体上:模拟序列是线性的,股票收益是非线性的。注意 BDS(标准正态渐近分布)对任何偏离 iid 的情形都敏感(包括条件异方差),所以"BDS 显著"不等于"均值方程非线性"。

4.3 建模(Modeling)(PDF p.234–235)

非线性建模必然带有主观判断,但有一般流程:

  1. 先建立充分的线性模型,在其残差上做非线性检验。金融序列常用 Ljung–Box 统计量(对平方残差)和 Engle 的 ARCH 检验探测条件异方差;一般序列用 4.2 节的其他检验。
  2. 若非线性显著,选择一类非线性模型,选择取决于分析者经验与问题实质。
  3. 波动率模型:ARCH 阶数可由平方序列的 PACF 定;GARCH/EGARCH 通常只考虑 (1,1)、(1,2)、(2,1) 等低阶,高阶难估计也难解释。
  4. TAR 模型:按 Tong (1990)、Tsay (1989, 1998) 的程序建模。
  5. 样本量足够大时,可先用非参数方法探索非线性特征再选参数模型(Chen & Tsay 1993a 的函数系数 AR;Cai, Fan & Yao 2000);MARS(Lewis & Stevens 1991)也可用来探索动态结构。
  6. 用信息准则(AIC)或 Chen, McCulloch & Tsay (1997) 的广义几率比(generalized odds ratio)在竞争模型间选择。
  7. 用于预测前必须仔细做模型检验。

4.4 预测(Forecasting)(PDF p.235–238)

与线性模型不同,大多数非线性模型在预测步长 >1 时没有闭式预测公式,因此用参数自助法(parametric bootstrap)。前提是模型(动态结构 + 新息分布)已充分检验,有时把估计参数当作已知。

4.4.1 参数自助法

设预测原点为 \(T\),步长 \(\ell>0\)。顺序生成 \(x_{T+1},\dots,x_{T+\ell}\): (a) 从模型设定的新息分布中抽取一个新息; (b) 用模型、数据和之前的模拟值 \(x_{T+1},\dots,x_{T+i-1}\) 计算 \(x_{T+i}\)。 得到 \(x_{T+\ell}\) 的一个实现。重复 \(M\) 次得 \(\{x^{(j)}_{T+\ell}\}_{j=1}^M\)。点预测 \(x_T(\ell)\) 取样本均值;作者在应用中用 \(M=3000\) 效果不错。这些实现同时给出 \(x_{T+\ell}\) 的经验分布,用于后面的分布型评估。

常见误区:多步非线性预测不能简单把 1 步预测值代回模型迭代(即"把条件均值代入非线性函数"),因为 \(E[g(X)]\neq g(E[X])\);自助法正是为了解决这一点。

4.4.2 预测评估(Forecasting Evaluation)

评估分三类:方向型(directional)、幅度型(magnitude)、分布型(distributional)。例子:预测明天 S&P 500 涨跌是方向型;预测年末指数点位是幅度型;评估"从现在到年末上涨 ≥10% 的概率"需要未来条件分布,属于分布型。

实践中把数据分为估计子样本和预测子样本;也可用滚动预测(rolling forecasting):随着预测原点前移,把新数据点从预测子样本移入估计子样本。没有公认的单一比较指标,可能需要基于预测目标的效用函数。

方向型度量:2×2 列联表

实际 Up 实际 Down 合计
预测 Up \(m_{11}\) \(m_{12}\) \(m_{10}\)
预测 Down \(m_{21}\) \(m_{22}\) \(m_{20}\)
合计 \(m_{01}\) \(m_{02}\) \(m\)

(原书行为 Actual、列为 Predicted,含义相同:对角线为"命中"。)\(m\) 为 \(\ell\) 步预测总数,\(m_{11}\)、\(m_{22}\) 越大越好。检验统计量

\[\chi^2=\sum_{i=1}^2\sum_{j=1}^2\frac{(m_{ij}-m_{i0}m_{0j}/m)^2}{m_{i0}m_{0j}/m},\]

在温和条件下渐近服从 \(\chi^2_1\)。\(\chi^2\) 大说明模型优于随机选择(参见 Dahl & Hylleberg 1999)。

例:第 4 章前文 8–4–1 前馈神经网络(图 4.9)的 1 步概率预测,列联表为:实际 Up 行 (12, 2 | 14),实际 Down 行 (8, 2 | 10),列合计 (20, 4 | 24)。网络对上涨预测好,对下跌预测差;\(\chi^2=0.137\),p 值 0.71,不显著优于等概率涨跌的随机游走。

幅度型度量(\(m\) 为预测子样本中 \(\ell\) 步预测个数):

\[\text{MSE}(\ell)=\frac1m\sum_{j=0}^{m-1}[x_{T+\ell+j}-x_{T+j}(\ell)]^2,\tag{4.49}\]
\[\text{MAD}(\ell)=\frac1m\sum_{j=0}^{m-1}|x_{T+\ell+j}-x_{T+j}(\ell)|,\tag{4.50}\]
\[\text{MAPE}(\ell)=\frac1m\sum_{j=0}^{m-1}\left|\frac{x_{T+j}(\ell)}{x_{T+j+\ell}}-1\right|.\tag{4.51}\]

通常选其中一个,值最小者为最佳 \(\ell\) 步模型;不同 \(\ell\) 可能选出不同模型;这些度量还有其他局限(Clements & Hendry 1993)。MAPE 在实际值接近 0 时会爆炸,这对收益率序列尤其要注意。

分布型度量:严格说预测分布(predictive distribution)应包含参数不确定性;参数视为固定时称条件预测分布。参数自助法得到的经验分布即条件预测分布。令 \(u_T(\ell)\) 为实际观测 \(x_{T+\ell}\) 在事前经验分布中的分位(percentile,即概率积分变换 PIT)。得到 \(\{u_{T+j}(\ell)\}_{j=0}^{m-1}\);若模型充分,它应是 \(U[0,1]\) 的随机样本。\(m\) 足够大时,可计算其相对 \(U[0,1]\) 的 Kolmogorov–Smirnov 统计量,用于模型检验与预测比较。

4.5 应用:美国季度失业率(PDF p.238–242)

数据:美国季度民用失业率(季调),1948–1993,Montgomery et al. (1998) 详细分析过。图 4.11 显示:(a) 逆周期波动;(b) 上升快、下降慢——这种不对称暗示非线性动态。

令 \(\Delta x_t=x_t-x_{t-1}\)。基准线性模型(季节 ARIMA):

\[(1-0.31B^4)(1-0.65B)\Delta x_t=(1-0.78B^4)a_t,\quad \hat\sigma_a^2=0.090,\tag{4.52}\]

三个系数标准误为 0.11、0.06、0.07。数据虽经季调,模型仍含季节项,说明季调未完全去除季节性。

非线性检验(表 4.3,对 \(\Delta x_t\) 用 AR(5)):Ori-F 2.80 (p=.0007);LST(Luukkonen et al. 1988 平滑转移检验)2.83 (p=.0002);TAR(1) 2.41 (.0298);TAR(2) 2.16 (.0500);TAR(3) 2.84 (.0121);TAR(4) 2.98 (.0088)。全部拒绝线性;对 \(p=2,\dots,10\) 的所有 AR(p) 也都拒绝。

TAR 模型(Montgomery et al. 按 Tsay 1989 的程序):

\[\Delta x_t=\begin{cases}0.01+0.73\Delta x_{t-1}+0.10\Delta x_{t-2}+a_{1t}, & \Delta x_{t-2}\le 0.1,\\ 0.18+0.80\Delta x_{t-1}-0.56\Delta x_{t-2}+a_{2t}, & \text{否则}.\end{cases}\tag{4.53}\]

\(a_{1t},a_{2t}\) 样本方差分别为 0.76 和 0.165(原文如此);状态 1 系数标准误 0.03、0.10、0.12;状态 2 为 0.09、0.1、0.16。解释:阈值变量是 \(x_{t-2}-x_{t-3}\),阈值 0.1。状态 1(失业率下降或小幅上升)经济稳定,滞后 2 系数不显著,实际上是 AR(1)。状态 2(失业率跳升 ≥0.1)通常对应经济收缩期,也是政府干预、产业重组多发期;\(\Delta x_t\) 为带正常数的 AR(2),表示 \(x_t\) 上升趋势;AR(2) 多项式有一对复根,意味着周期性,转折点概率上升,所以失业率大幅上升的阶段较短——推论:美国经济收缩期比扩张期短。

马尔可夫转换模型(MSA)(MCMC 估计):

\[\Delta x_t=\begin{cases}-0.07+0.38\Delta x_{t-1}-0.05\Delta x_{t-2}+\epsilon_{1t}, & s_t=1,\\ 0.16+0.86\Delta x_{t-1}-0.38\Delta x_{t-2}+\epsilon_{2t}, & s_t=2.\end{cases}\tag{4.54}\]

条件均值:状态 1 为 −0.10(扩张期),状态 2 为 0.31(收缩期)。\(\epsilon_{1t},\epsilon_{2t}\) 方差 0.031、0.192;状态 1 参数标准误 0.03、0.14、0.11,状态 2 为 0.04、0.13、0.14。转移概率 \(P(s_t=2|s_{t-1}=1)=0.084\,(0.060)\),\(P(s_t=1|s_{t-1}=2)=0.126\,(0.053)\)。状态 2 与 TAR 的状态 2 类似(上升趋势 + 复根 AR(2));状态 1 略有下降趋势,自回归结构弱得多。

滚动预测程序:

  1. 从预测原点 \(T=83\)(1968.II,文献中常用来监控计量模型对失业率的预测)开始,用 1948.I 至原点(含)的数据估计线性、TAR、MSA 三个模型;
  2. 做 1–5 季度前预测并计算误差,非线性模型用 4.4 节参数自助法;
  3. 原点前移 1,重复估计和预测,直到数据用完;
  4. 用 MSE 和平均预测误差(偏差)比较。

表 4.4 主要数字(相对 MSE 以线性模型为 1;MSE 行为线性模型的绝对 MSE):

情形 模型 1步 2步 3步 4步 5步
全部 TAR 1.00 1.04 0.99 0.98 1.03
全部 MSA 1.19 1.39 1.40 1.45 1.61
全部 线性 MSE 0.08 0.31 0.67 1.13 1.54
收缩期原点 TAR 0.85 0.91 0.83 0.72 0.72
收缩期原点 MSA 0.97 1.03 0.96 0.86 1.02
收缩期原点 线性 MSE 0.22 0.97 2.14 3.38 3.46
扩张期原点 TAR 1.06 1.13 1.10 1.15 1.17
扩张期原点 MSA 1.31 1.64 1.73 1.84 1.87
扩张期原点 线性 MSE 0.06 0.21 0.45 0.78 1.24

平均预测误差:全部样本——线性 0.03, 0.09, 0.17, 0.25, 0.33;TAR −0.10, −0.02, −0.03, −0.03, −0.01;MSA 0.00, −0.02, −0.04, −0.07, −0.12。收缩期——线性 0.31, 0.68, 1.08, 1.41, 1.38;TAR 0.24, 0.56, 0.87, 1.01, 0.86;MSA 0.20, 0.41, 0.57, 0.52, 0.14。扩张期——线性 −0.01, 0.00, 0.03, 0.08, 0.17;TAR −0.05, −0.11, −0.17, −0.19, −0.14;MSA −0.03, −0.08, −0.13, −0.17, −0.16。

结论:

  1. 总体上 TAR 与线性模型 MSE 接近,但 TAR 偏差更小;MSA 的 MSE 最大、偏差最小。
  2. 预测原点处于收缩期时,TAR 在 MSE 和偏差上都优于线性模型;MSA 也有改进,但不如 TAR。
  3. 原点处于扩张期时,线性模型优于两个非线性模型。
  4. 非线性模型的贡献主要在经济收缩期——政府干预和产业重组等外部事件引入非线性;而收缩期恰恰是人们最关注经济预测的时候。

教学启示:非线性模型的价值往往是"状态依赖的",总体平均指标可能掩盖它在关键状态下的优势;评估时应按状态分组。

附录 A:非线性波动率模型的 RATS 程序(PDF p.242–243)

  1. IBM 日对数收益的 AR(2)–TAR–GARCH(1,1)(数据 d-ibmln03.txt,10446 个观测):均值 \(a_t=r_t-\mu-\phi_2 r_{t-2}\);方差 \(h_t=\alpha_0+\alpha_1a_{t-1}^2+\beta_1h_{t-1}+\mathbb 1(a_{t-1}<0)(\alpha_2a_{t-1}^2+\beta_2h_{t-1})\); 对数似然项 \(-0.5\ln h_t-0.5a_t^2/h_t\)。先用 simplex 迭代 10 次找初值,再用 BHHH 迭代 150 次;最后对标准化残差及其平方做 Ljung–Box(20 阶)。初值 mu=0.03, p2=−0.03, a0=0.07, a1=0.05, a2=0.05, b1=0.85, b2=0.05。
  2. 3M 月简单收益的平滑 TAR 波动率模型(m-3m4608.txt):\(\sigma_t^2=(\alpha_0+\alpha_1a_{t-1}^2+\alpha_2a_{t-2}^2)+\dfrac{\alpha_{00}+\alpha_{11}a_{t-1}^2}{1+\exp(-1000a_{t-1})}\),即用陡峭 logistic 函数近似阈值切换;BHHH 估计,同样做残差检验。

附录 B:神经网络的 R/S-Plus 命令(PDF p.243–244)

用 nnet 库建 Example 4.7 的 3–2–1 带跳层连接(skip layer)前馈网络:输入 \(r_{t-1},r_{t-2},r_{t-3}\)(m-ibmln.txt,用前 864 个观测训练),nnet(ibm.x, y, size=2, linout=T, skip=T, maxit=10000, decay=1e-2, reltol=1e-7, abstol=1e-7, range=1.0);计算残差平方和;在预测子样本(第 865–888 个观测,共 24 个)上 predict 并计算预测误差平方和。注释掉的一行用 nnet.Hess 的特征值检查 Hessian。

第 4 章习题(PDF p.244–246)

  • 4.1 J&J 日收益(1998–2008,d-jnj9808.txt)转为百分比对数收益:(a) 建 GJR 模型,杠杆效应在 1% 是否显著;(b) 建一般阈值波动率模型;(c) 比较两个 TGARCH。
  • 4.2 GE 月收益(1926–2008,996 个观测):建 GED 新息、以 \(a_{t-1}\) 为阈值变量、阈值 0 的 TGARCH,检验杠杆效应(5%)。
  • 4.3 GE 月对数收益的平滑阈值 IGARCH(1,1):\(r_t=1.14+a_t\),\(\sigma_t^2=0.119a_{t-1}^2+0.881\sigma_{t-1}^2+\frac{1}{1+\exp(-10a_{t-1})}(4.276-0.084\sigma_{t-1}^2)\)。已知 \(a_{996}=-5.06\)、\(\sigma^2_{996}=50.5\),求 1 步波动率预测;再求 \(a_{996}=5.06\) 时的值。(考查平滑转移函数的手算与不对称性。)
  • 4.4 马尔可夫转换 GARCH:\(r_t=1.25+a_t\),状态 1:\(\sigma_t^2=0.10a_{t-1}^2+0.93\sigma_{t-1}^2\);状态 2:\(\sigma_t^2=4.24+0.10a_{t-1}^2+0.78\sigma_{t-1}^2\);\(P(s_t=2|s_{t-1}=1)=0.15\),\(P(s_t=1|s_{t-1}=2)=0.05\)。\(a_{100}=6.0\)、\(\sigma^2_{100}=50.0\)、\(s_{100}=2\)(概率 1)时求 1 步波动率预测;若 \(P(s_{100}=2)=0.8\) 再求。(考查状态概率加权预测。)
  • 4.5 GE 月简单收益,最后 3 年作预测评估:(a) 3–2–1 前馈网络预测 1 步收益,算 MSE;(b) 用滞后收益及其符号建 6–5–1 网络预测方向(1 为上涨),算 MSE;提示 drtn = ifelse(rtn>0,1,0)。
  • 4.6 利率期限结构:因倒挂收益率曲线的存在,利差应是非线性的。用周度 1 年期和 3 年期国债固定期限利率(1962-01-05 至 2009-04-10):(a) \(s_t=r_{3t}-r_{1t}\) 是否线性(5% 水平做非线性检验);(b) 利差变化 \(s_t^*=s_t-s_{t-1}\) 是否线性;(c)(d) 分别为 \(s_t\) 与 \(s_t^*\) 建门限模型并检验。

第 4 章参考文献(PDF p.246–249)

列出约 70 条文献,核心包括:Tong (1978, 1983, 1990) 门限模型;Tsay (1986, 1989, 1998) 非线性/阈值检验;Hamilton (1989, 1990, 1994) 马尔可夫转换;Brock, Dechert & Scheinkman (1987) BDS 检验;Keenan (1985)、Ramsey (1969) RESET、McLeod & Li (1983)、Luukkonen et al. (1988)、Teräsvirta (1994) STAR;Hornik et al. (1989) 神经网络万能逼近;Chen & Tsay (1993a,b) 函数系数 AR 与 NAARX;Fan & Yao (2003);Nadaraya (1964)、Watson (1964) 核回归;Montgomery et al. (1998) 失业率预测;Andrews & Ploberger (1994)、Davis (1987) 冗余参数检验;Venables & Ripley (1999) 等。PDF p.250 为空白页。

第 4 章本章要点(就本块覆盖部分而言)

  • 非线性检验(BDS、Ori-F、TAR-F、LST 等)应作用于线性模型残差;TAR-F 不需知道阈值和状态数,但功效低于已知模型下的 LR 检验。
  • 非线性建模流程:线性模型 → 检验 → 选模型族 → 估计 → 信息准则选择 → 诊断。
  • 多步非线性预测用参数自助法;预测评估分方向(2×2 列联表 \(\chi^2_1\) 检验)、幅度(MSE/MAD/MAPE)、分布(PIT + KS 检验)三类。
  • 失业率实例:TAR 与 MSA 都刻画了"上升快、下降慢";非线性模型的预测优势集中在经济收缩期。

第 4 章与量化交易的关联

  • 因子与信号研究:TAR/马尔可夫转换是"状态(regime)依赖"信号的标准工具,例如在高波动或下跌状态下动量/反转的系数不同;4.5 节的教训——总体 MSE 不变但关键状态下显著改进——直接适用于按市场状态分组评估因子 IC。
  • 回测与评估:方向型 2×2 列联表 \(\chi^2\) 检验可用来检验涨跌预测是否优于随机(等价于检验胜率是否显著);PIT+KS 用于检验 VaR/分布预测是否校准;滚动预测程序就是标准的 walk-forward 回测。注意 MAPE 不适合收益率。
  • 风险建模:附录 A 的 TAR-GARCH、平滑转移 GARCH,以及习题 4.3、4.4 的马尔可夫转换 GARCH,用于刻画下跌时波动率上升的杠杆效应,可直接用于 VaR 与仓位缩放。
  • 神经网络部分(附录 B)只演示小型网络,现代机器学习选股中的过拟合与样本外检验原则在这里已有雏形。

第 4 章推荐习题

  • 4.3(平滑转移 IGARCH 手算,理解正负冲击不对称);
  • 4.4(马尔可夫转换 GARCH 的概率加权预测);
  • 4.6(期限利差的非线性检验与门限建模,最贴近实际利率交易);
  • 4.5(神经网络方向预测,可配合 4.4.2 的列联表检验)。

第 5 章 高频数据分析与市场微观结构(High-Frequency Data Analysis and Market Microstructure)(PDF p.251 起)

本章引言(PDF p.251–252)

  • 高频数据:在细时间间隔上取得的观测;金融中常指日频或更细。终极高频数据是逐笔成交(transaction-by-transaction / trade-by-trade)数据,时间以秒计。
  • 数据源:NYSE 的 TAQ(Trades and Quotes)数据库,收录 1992 年起 Consolidated Tape 上全部股票成交(含 NYSE、AMEX、NASDAQ 和地区交易所);Berkeley Options Data Base(1976.8–1996.12 期权成交);CBOE 网站。Wood (2000) 有高频研究的历史回顾。
  • 用途:比较不同交易制度的价格发现效率(如 NYSE 公开喊价 vs NASDAQ 电子交易);研究买卖报价动态(Hasbrouck 1999;Zhang, Russell & Tsay 2008);在订单驱动市场(如台湾证交所)研究订单动态和"谁提供流动性"。Cho, Russell, Tiao & Tsay (2003) 用台股 340 多只股票的 5 分钟收益研究日涨跌停板,发现价格向涨停板靠拢的磁吸效应(magnet effect)。
  • 本章内容:非同步交易、买卖价差、久期模型、价格变动模型、价格变化与久期的二元模型;方法也适用于通信、环境等领域。

5.1 非同步交易(Nonsynchronous Trading)(PDF p.252–255)

现象:不同股票交易频率不同,同一股票的交易强度也随时变化;日收盘价是当天最后一笔成交价,而最后一笔成交的实际时刻每天不同。把日收益当作严格等间隔 24 小时序列是错误假设,即使真实收益序列独立,也会得出关于可预测性的错误结论。

非同步交易会导致:(a) 股票收益之间的滞后 1 交叉相关;(b) 组合收益的滞后 1 序列相关;(c) 某些情形下单只股票收益的负序列相关。

直观例子:A、B 两只股票独立,A 交易更频繁。收盘前出现的市场消息当天就体现在 A 上,而 B 要到次日才反映。于是 A 看起来"领先" B,出现从 A 到 B 的显著滞后 1 交叉相关;持有 A、B 的组合则表现出显著的滞后 1 自相关。

Lo–MacKinlay (1990) 的简化模型:真实连续复利收益 \(\{r_t\}\) iid,\(E(r_t)=\mu\),\(\text{Var}(r_t)=\sigma^2\);每期不交易的概率为 \(\pi\)(不随时间变化,且与 \(r_t\) 独立)。观测收益 \(r_t^o\):无成交时 \(r_t^o=0\);有成交时 \(r_t^o\) 为自上次成交以来的累计收益 \(r_t+r_{t-1}+\dots+r_{t-k_t}\),\(k_t\) 为 \(t\) 之前连续无交易的期数。

\[r_t^o=\begin{cases}0 & \text{概率 } \pi\\ r_t & (1-\pi)^2\\ r_t+r_{t-1} & (1-\pi)^2\pi\\ \quad\vdots\\ \sum_{i=0}^k r_{t-i} & (1-\pi)^2\pi^k\\ \quad\vdots\end{cases}\tag{5.1}\]

解释:\(r_t^o=r_t\) 当且仅当 \(t\) 和 \(t-1\) 都有成交;\(r_t^o=r_t+r_{t-1}\) 当且仅当 \(t\)、\(t-2\) 有成交而 \(t-1\) 无成交,依此类推。总概率 \(\pi+(1-\pi)^2\sum_k\pi^k=\pi+(1-\pi)=1\)。

均值:利用 \(1+2\pi+3\pi^2+\dots=1/(1-\pi)^2\),

\[E(r_t^o)=(1-\pi)^2\mu(1+2\pi+3\pi^2+\cdots)=\mu.\tag{5.2}\]

方差:由 \(E[(\sum_{i=0}^k r_{t-i})^2]=(k+1)\sigma^2+[(k+1)\mu]^2\),

\[E[(r_t^o)^2]=(1-\pi)^2[\sigma^2(1+2\pi+3\pi^2+\cdots)+\mu^2(1+4\pi+9\pi^2+\cdots)]=\sigma^2+\mu^2\left(\frac{2}{1-\pi}-1\right).\tag{5.3–5.5}\]
其中恒等式 \(1+4\pi+9\pi^2+\dots=\frac{2}{(1-\pi)^3}-\frac{1}{(1-\pi)^2}\) 的推导:令 \(H=\sum (k+1)^2\pi^k\),\(G=1+3\pi+5\pi^2+\cdots\),则 \((1-\pi)H=G\),\((1-\pi)G=1+2\pi+2\pi^2+\dots=\frac{2}{1-\pi}-1\)。于是
\[\text{Var}(r_t^o)=\sigma^2+\frac{2\pi\mu^2}{1-\pi}.\tag{5.6}\]
即非交易会放大观测方差(当 \(\mu\neq0\))。

滞后 1 自协方差:\(r_t^or_{t-1}^o\) 在 \(t\) 或 \(t-1\) 无成交时为 0(概率 \(2\pi-\pi^2\));\(=r_tr_{t-1}\) 当 \(t-2,t-1,t\) 连续三次成交(概率 \((1-\pi)^3\));\(=r_t(\sum_{i=1}^k r_{t-i})\) 的概率为 \((1-\pi)^3\pi^{k-1}\)。(5.7)利用 \(E(r_tr_{t-j})=\mu^2\)(\(j>0\)),

\[E(r_t^or_{t-1}^o)=(1-\pi)^3\mu^2(1+2\pi+3\pi^2+\cdots)=(1-\pi)\mu^2,\]
\[\text{Cov}(r_t^o,r_{t-1}^o)=-\pi\mu^2.\tag{5.8}\]
\[\rho_1(r_t^o)=\frac{-(1-\pi)\pi\mu^2}{(1-\pi)\sigma^2+2\pi\mu^2}.\]
一般地 \(\text{Cov}(r_t^o,r_{t-j}^o)=-\mu^2\pi^j\),\(j\ge1\)。结论:只要 \(\mu\neq0\),非同步交易就在观测收益中诱导出负自相关,大小取决于 \(\mu,\pi,\sigma\),可能相当可观。可推广到 \(N\) 只证券组合(Campbell, Lo & MacKinlay 1997 第 3 章)。在时间序列文献中,单只证券的非同步交易效应等价于随机时间聚合(random temporal aggregation),由交易概率 \(\pi\) 支配聚合机制。

常见误区:组合(尤其小盘股指数)的显著正滞后 1 自相关未必是可交易的动量,可能来自成分股之间的非同步交易。

5.2 买卖价差(Bid–Ask Spread)(PDF p.255–257)

背景:在 NYSE 等市场,做市商(market maker)随时准备买卖,提供市场流动性(能迅速、匿名、低价格冲击地买卖大量证券)。作为回报,交易所授予其报出不同买卖价的垄断权:以买价(bid)\(P_b\) 买入、以更高的卖价(ask)\(P_a\) 卖出(对公众而言 \(P_b\) 是卖出价,\(P_a\) 是买入价)。\(P_a-P_b\) 为买卖价差,是做市商的主要收入来源,通常只有一两美分。

Roll (1984) 模型:

\[P_t=P_t^*+I_t\frac S2,\tag{5.9}\]
\(S=P_a-P_b\),\(P_t^*\) 为无摩擦市场中的基本价值,\(\{I_t\}\) 为独立二值变量,以各 0.5 的概率取 ±1(买方发起 +1,卖方发起 −1,即订单类型指示)。若 \(P_t^*\) 不变:
\[\Delta P_t=(I_t-I_{t-1})\frac S2,\tag{5.10}\]
\(E(I_t)=0\),\(\text{Var}(I_t)=1\),所以
\[E(\Delta P_t)=0,\quad \text{Var}(\Delta P_t)=S^2/2,\tag{5.11}\]
\[\text{Cov}(\Delta P_t,\Delta P_{t-1})=-S^2/4,\tag{5.12}\]
\[\text{Cov}(\Delta P_t,\Delta P_{t-j})=0,\ j>1,\tag{5.13}\]
\[\rho_j(\Delta P_t)=\begin{cases}-0.5 & j=1\\ 0 & j>1.\end{cases}\tag{5.14}\]
这就是买卖反弹(bid–ask bounce)。直观:设 \(P_t^*=(P_a+P_b)/2\),则成交价只取 \(P_a\) 或 \(P_b\);若上一笔在 \(P_a\),这一笔要么不变要么降到 \(P_b\)(\(\Delta P_t\in\{0,-S\}\));若上一笔在 \(P_b\),则 \(\Delta P_t\in\{0,S\}\)。价差不引入滞后 1 以外的相关。

更现实的设定:\(P_t^*\) 为随机游走,\(\Delta P_t^*=\epsilon_t\) iid,均值 0,方差 \(\sigma^2\),与 \(\{I_t\}\) 独立。则 \(\text{Var}(\Delta P_t)=\sigma^2+S^2/2\),协方差不变,

\[\rho_1(\Delta P_t)=\frac{-S^2/4}{S^2/2+\sigma^2}\le0.\]
负相关幅度减小但仍存在。由此可反推 Roll 价差估计 \(S=2\sqrt{-\text{Cov}(\Delta P_t,\Delta P_{t-1})}\)(原书未明写,但由 5.12 直接得到,可作为教材补充)。价差成分分析见 Campbell et al. (1997)。

多元情形:组合收益和多元序列中也存在价差效应。二元订单类型指示 \(I_t=(I_{1t},I_{2t})'\),若 \(I_{1t}\) 与 \(I_{2t}\) 同期正相关,价差会引入负的滞后 1 交叉相关。

5.3 逐笔成交数据的经验特征(Empirical Characteristics of Transactions Data)(PDF p.257–264)

记 \(t_i\) 为第 \(i\) 笔成交的日历时间(午夜起算的秒数),伴随变量有成交价、成交量、当时的买卖报价等。这些合称交易数据(transactions data),具有时间聚合后不存在的特征:

  1. 不等间隔(unequally spaced):成交不在等间隔时点发生,成交间的时间久期(duration)本身可能含有微观结构信息(如交易强度)。
  2. 离散取值的价格:2001-01-29 之前价格变化只能是最小价位(tick size)的整数倍;NYSE 在 1997-06-24 前 tick 为 1/8 美元,2001-01-29 前为 1/16 美元。十进制后,连续成交的价格变化仍集中在 1 美分的倍数,可近似视为离散。有些市场还有监管设定的涨跌幅限制。
  3. 日内周期(diurnal pattern):NYSE 开盘和收盘交易密集、午间稀疏,交易强度呈 U 形,因此成交间隔也有日周期。
  4. 同一秒内多笔成交:时间以秒计,在繁忙期一秒可能太粗,可出现多笔、甚至价格不同的成交。

例:IBM 1990-11-01 至 1991-01-31(TORQ 数据,Hasbrouck 1992):63 个交易日,60,328 笔成交;只取 9:30–16:00 正常交易时段,忽略跨日价格变化(隔夜收益与日内收益差别很大,见 Stoll & Whaley 1990)。

表 5.1(以 tick=1/8 美元计的价格变化频率,%):≤−3: 0.66;−2: 1.33;−1: 14.53;0: 67.06;+1: 14.53;+2: 1.27;≥3: 0.63。 观察:约 2/3 的成交价格不变;约 29% 变动 1 个 tick;2 个 tick 仅 2.6%;≥3 个 tick 约 1.3%;正负变化近似对称。

5 分钟成交笔数序列 \(x_t\)(图 5.1):ACF 呈周期 78 的循环(一天有 78 个 5 分钟区间),即强烈的日周期;63 天平均的 78 个区间成交数(图 5.2)呈"微笑"/U 形。

正常时段内共 59,838 个时间间隔(日内久期),其中 6,531 个为 0(同一秒多笔,约 10.91%),其中 1,002 个价格不同(约占总成交 1.67%)。零久期会给久期建模带来问题。

表 5.2:连续两笔成交的价格变动二维分类(行:第 \(i-1\) 笔;列:第 \(i\) 笔;+ 上涨、0 不变、− 下跌):

\((i-1)\) \ \(i\) + 0 − 合计
+ 441 5498 3948 9887
0 4867 29779 5473 40119
− 4580 4841 410 9831
合计 9888 40118 9831 59837

观察:(1) 连续上涨/连续下跌很少(441/59837=0.74%,410/59837=0.69%);(2) 上涨后更可能转为不变而非下跌(第 1 行);(3) 价格保持不变的倾向很强;(4) 下跌后转为上涨或不变的概率大致相同。第 1 点是买卖反弹的直接证据。方向序列 \(D_i\in\{+1,0,-1\}\) 的 ACF 只在滞后 1 有一个尖峰 −0.389,在 59,837 的样本下高度显著,确认连续成交的价格反转。

例:IBM 1999 年 12 月(TAQ):正常时段 9:30–16:00(12 月 31 日 13:00 收市)。两点变化:(1) 日内成交增加约 6 倍,仅 12 月就有 134,120 笔;零久期比例翻倍到 22.98%;极端情形 12 月 3 日有两次在同一秒内 42 笔成交。(2) tick 降为 1/16 美元,应缩小价差。图 5.3 为每日成交数箱线图(含盘后部分);图 5.4 显示成交间隔与日成交数反向关系,以及 12 月 3 日两次异常价格变动(跌 63 tick 后立即涨 64 tick;跌 68 tick 后立即涨 68 tick)——这类异常在数据清洗时需关注。 正常时段 133,475 笔中 61,149 笔价格不变(约 45.8%),显著低于 1990–91 年——缩小 tick 增加了价格变化的概率。表 5.3(价格变化幅度,以 1/16 美元计,%):下跌 1–7 及 >7 tick:18.03, 5.80, 1.79, 0.66, 0.25, 0.15, 0.09, 0.32;上涨:18.24, 5.57, 1.79, 0.71, 0.24, 0.17, 0.10, 0.31。仍近似对称,大幅变动罕见。

例:Boeing 2008-12-01:正常时段 43,894 笔成交;日内价格下行,但价格变化模式与十进制前相似(图 5.5)。直方图(图 5.6):关于 0 对称;集中在 1 美分的整数倍;58.5% 无变化。表 5.4(美分,%):<−3: 1.63;−3: 1.05;−2: 3.51;−1: 12.6;0: 58.5;1: 12.2;2: 3.45;3: 0.94;>3: 1.53;另有 4.59% 的变化不是 1 美分的整数倍。

注(数据清洗):高频数据记录质量通常不如低频;缺失观测有多种形式,部分成交时间戳可能不准(如在盘后交易开始前就出现 16:00 之后的时间戳)。正确的清洗需要深入理解市场运作,必须清楚准确地说明清洗方法,并在推断时考虑其影响。

记号:\(P_{t_i}\) 为成交价,价格变化 \(y_i\equiv\Delta P_{t_i}=P_{t_i}-P_{t_{i-1}}\),久期 \(\Delta t_i=t_i-t_{i-1}\);下标 \(i\) 是成交序号而非日历时间。下面分别及联合建模 \(y_i\) 与 \(\Delta t_i\)。

5.4 价格变化模型(Models for Price Changes)(PDF p.264–273)

日内价格变化的离散性和"零变化"集中使建模困难。Campbell et al. (1997) 讨论了多种模型。这里介绍两种可引入解释变量的模型:Hausman, Lo & MacKinlay (1992) 的有序 probit 模型;McCulloch & Tsay (2000) 考虑的、Rydberg & Shephard (2003) 模型的简化版——分解模型(另见 Ghysels 2000)。

5.4.1 有序 Probit 模型(Ordered Probit Model)

设 \(y_i^*=P^*_{t_i}-P^*_{t_{i-1}}\) 为不可观测的"虚拟价格"变化,连续随机变量:

\[y_i^*=\boldsymbol x_i\boldsymbol\beta+\epsilon_i,\tag{5.15}\]
\(\boldsymbol x_i\) 为 \(t_{i-1}\) 时可得的 \(p\) 维行向量,\(E(\epsilon_i|\boldsymbol x_i)=0\),\(\text{Var}(\epsilon_i|\boldsymbol x_i)=\sigma_i^2\),\(\text{Cov}(\epsilon_i,\epsilon_j)=0\)。条件方差为解释变量 \(\boldsymbol w_i\) 的正函数:
\[\sigma_i^2=g(\boldsymbol w_i),\tag{5.16}\]
\(\boldsymbol w_i\) 可含时间间隔 \(t_i-t_{i-1}\) 和条件异方差变量;通常假定 \(\epsilon_i\) 条件正态。

观测价格变化 \(y_i\) 取 \(k\) 个可能值 \(\{s_1,\dots,s_k\}\)(实践中 \(k\) 有限,可合并尾部类别,例如表 5.1 中 \(k=7\),"−3"表示 ≤−3 tick)。

\[y_i=s_j\quad\text{若 } \alpha_{j-1}<y_i^*\le\alpha_j,\ j=1,\dots,k,\tag{5.17}\]
\(-\infty=\alpha_0<\alpha_1<\dots<\alpha_{k-1}<\alpha_k=\infty\)。条件正态下
\[P(y_i=s_j|\boldsymbol x_i,\boldsymbol w_i)=\begin{cases}\Phi\!\left(\frac{\alpha_1-\boldsymbol x_i\boldsymbol\beta}{\sigma_i(\boldsymbol w_i)}\right) & j=1\\ \Phi\!\left(\frac{\alpha_j-\boldsymbol x_i\boldsymbol\beta}{\sigma_i(\boldsymbol w_i)}\right)-\Phi\!\left(\frac{\alpha_{j-1}-\boldsymbol x_i\boldsymbol\beta}{\sigma_i(\boldsymbol w_i)}\right) & j=2,\dots,k-1\\ 1-\Phi\!\left(\frac{\alpha_{k-1}-\boldsymbol x_i\boldsymbol\beta}{\sigma_i(\boldsymbol w_i)}\right) & j=k\end{cases}\tag{5.18}\]
\(\Phi\) 为标准正态 CDF。模型由不可观测的连续变量驱动,观测值是有自然顺序的类别。参数:\(\boldsymbol\beta\)、\(\alpha_1,\dots,\alpha_{k-1}\)、方差函数中的参数;用极大似然或 MCMC 估计。(识别上需要对方差做标准化,下面例子中方差函数常数项固定为 1.0。)

例 5.1(Hausman et al. 1992,IBM 1988 年数据):206,794 笔成交;价格变化 \(y_i\)、久期 \(\Delta t_i\)、买卖价差(tick)的样本均值(标准差)分别为 −0.0010 (0.753)、27.21 (34.13)、1.9470 (1.4625)。用 9 个类别 \(\{-4,\dots,4\}\) tick。设定

\[\boldsymbol x_i\boldsymbol\beta=\beta_1\Delta t_i^*+\sum_{v=1}^3\beta_{v+1}y_{i-v}+\sum_{v=1}^3\beta_{v+4}SP5_{i-v}+\sum_{v=1}^3\beta_{v+7}IBS_{i-v}+\sum_{v=1}^3\beta_{v+10}[T_\lambda(V_{i-v})\times IBS_{i-v}],\tag{5.19}\]
\[\sigma_i^2(\boldsymbol w_i)=1.0+\gamma_1^2\Delta t_i^*+\gamma_2^2AB_{i-1},\tag{5.20}\]
其中 \(T_\lambda(V)=(V^\lambda-1)/\lambda\) 为 Box–Cox 变换(\(\lambda\in[0,1]\));\(\Delta t_i^*=(t_i-t_{i-1})/100\)(秒);\(AB_{i-1}\) 为 \(t_{i-1}\) 时的买卖价差(tick);\(y_{i-v}\) 为滞后价格变化(tick);\(V_{i-v}\) 为第 \(i-v\) 笔的美元成交量(价格 × 股数(以百股计),单位为百美元);\(SP5_{i-v}\) 为 S&P 500 指数期货(最近月之后的合约)的 5 分钟连续复利收益(取 \(t_{i-v}\) 之前最近整分钟再前 1 分钟的价格和其前 5 分钟的价格);\(IBS_{i-v}\) 为成交价相对买卖中点的位置指示:高于中点 1,等于 0,低于 −1。

表 5.5 估计(t 比):边界 \(\alpha_1,\dots,\alpha_8\) = −4.67 (−145.7)、−4.16 (−157.8)、−3.11 (−171.6)、−1.34 (−155.5)、1.33 (154.9)、3.13 (167.8)、4.21 (152.2)、4.73 (138.9)。\(\gamma_1=0.40\) (15.6),\(\gamma_2=0.52\) (71.1);\(\beta_1\)(\(\Delta t^*\))=−0.12 (−11.4);\(\beta_2,\beta_3,\beta_4\)(\(y_{-1},y_{-2},y_{-3}\))=−1.01 (−135.6)、−0.53 (−85.0)、−0.21 (−47.2);\(\beta_5,\beta_6,\beta_7\)(SP5)=1.12 (54.2)、−0.26 (−12.1)、0.01 (0.26);\(\beta_8,\beta_9,\beta_{10}\)(IBS)=−1.14 (−63.6)、−0.37 (−21.6)、−0.17 (−10.3);\(\beta_{11},\beta_{12},\beta_{13}\)(量×IBS)=0.12 (47.4)、0.05 (18.6)、0.02 (7.7)。除 \(\beta_7\) 外全部显著(大样本下不意外)。 结论:(1) 分界点不等距但关于 0 近似对称;(2) 久期同时影响条件均值和条件方差;(3) 滞后价格变化系数为负且高度显著——价格反转;(4) 前一时刻的买卖价差显著影响条件方差。另可读出:期货指数的滞后 5 分钟收益正向领先个股(\(\beta_5=1.12\)),体现期货的价格发现作用。

5.4.2 分解模型(Decomposition Model, ADS)

Rydberg & Shephard (2003) 把价格变化分解为三个成分:是否变化、方向、大小:

\[y_i\equiv P_{t_i}-P_{t_{i-1}}=A_iD_iS_i,\tag{5.21}\]
\(A_i\in\{0,1\}\) 指示第 \(i\) 笔是否有价格变化(5.22);\(D_i|(A_i=1)\in\{1,-1\}\) 为方向(5.23);\(S_i\) 为变化大小(tick),有变化时为正整数,无变化时为 0。存在自然顺序:\(D_i\) 只在 \(A_i=1\) 时有定义,\(S_i\) 在 \(A_i=1\) 且 \(D_i\) 给定时才有意义。

设 \(F_i\) 为第 \(i\) 笔时的信息集(含 \(\Delta t_{i-j},A_{i-j},D_{i-j},S_{i-j}\),\(j\ge0\)),

\[P(y_i|F_{i-1})=P(S_i|D_i,A_i,F_{i-1})\,P(D_i|A_i,F_{i-1})\,P(A_i|F_{i-1}).\tag{5.24}\]

各成分设定:

\[\ln\frac{p_i}{1-p_i}=\boldsymbol x_i\boldsymbol\beta,\quad p_i=P(A_i=1)=\frac{e^{\boldsymbol x_i\boldsymbol\beta}}{1+e^{\boldsymbol x_i\boldsymbol\beta}},\tag{5.25}\]
\[\ln\frac{\delta_i}{1-\delta_i}=\boldsymbol z_i\boldsymbol\gamma,\quad \delta_i=P(D_i=1|A_i=1),\tag{5.26}\]
\[S_i|(D_i,A_i=1)\sim1+\begin{cases}g(\lambda_{u,i}) & D_i=1\\ g(\lambda_{d,i}) & D_i=-1\end{cases}\tag{5.27}\]
\[\ln\frac{\lambda_{j,i}}{1-\lambda_{j,i}}=\boldsymbol w_i\boldsymbol\theta_j,\ j=u,d.\tag{5.28}\]
\(g(\lambda)\) 为几何分布,\(p(x=m)=\lambda(1-\lambda)^m\),\(m=0,1,2,\dots\);加 1 保证有变化时至少 1 tick;logistic 变换保证 \(\lambda\in[0,1]\);上下分开参数以允许不对称。\(\boldsymbol x_i,\boldsymbol z_i,\boldsymbol w_i\) 均取自 \(F_{i-1}\)。

三类事件:无变化(概率 \(1-p_i\));上涨(\(p_i\delta_i\),幅度 \(1+g(\lambda_{u,i})\));下跌(\(p_i(1-\delta_i)\),幅度 \(1+g(\lambda_{d,i})\))。以 \(I_i(j)\) 为类别指示,

\[\ln P(y_i|F_{i-1})=I_i(1)\ln(1-p_i)+I_i(2)[\ln p_i+\ln\delta_i+\ln\lambda_{u,i}+(S_i-1)\ln(1-\lambda_{u,i})]+I_i(3)[\ln p_i+\ln(1-\delta_i)+\ln\lambda_{d,i}+(S_i-1)\ln(1-\lambda_{d,i})],\]
\[\ln P(y_1,\dots,y_n|F_0)=\sum_{i=1}^n\ln P(y_i|F_{i-1}).\tag{5.29}\]
似然可分解为三部分,\(\boldsymbol\beta\)、\(\boldsymbol\gamma\)、\(\boldsymbol\theta_u,\boldsymbol\theta_d\) 可分别估计(因此 R 中可直接用两次 logistic 回归估计前两部分)。

例 5.2(IBM 1990.11.01–1991.01.31,59,838 笔):候选解释变量 \(A_{i-1},D_{i-1},S_{i-1}\)、前一笔成交量/1000 \(V_{i-1}\)、前一久期 \(\Delta t_{i-1}\)、当前价差 \(BA_i\);因用滞后 1,有效样本 59,775。\(V_{i-1},\Delta t_{i-1},BA_i\) 不显著,只用前三个:

\[\ln\frac{p_i}{1-p_i}=\beta_0+\beta_1A_{i-1},\quad \ln\frac{\delta_i}{1-\delta_i}=\gamma_0+\gamma_1D_{i-1},\]
\[\ln\frac{\lambda_{u,i}}{1-\lambda_{u,i}}=\theta_{u,0}+\theta_{u,1}S_{i-1},\quad \ln\frac{\lambda_{d,i}}{1-\lambda_{d,i}}=\theta_{d,0}+\theta_{d,1}S_{i-1}.\tag{5.30}\]
表 5.6 估计(标准误):\(\beta_0=-1.057\) (0.104),\(\beta_1=0.962\) (0.044),\(\gamma_0=-0.067\) (0.023),\(\gamma_1=-2.307\) (0.056),\(\theta_{u,0}=2.235\) (0.029),\(\theta_{u,1}=-0.670\) (0.050),\(\theta_{d,0}=2.085\) (0.187),\(\theta_{d,1}=-0.509\) (0.139)。(表题写作 1990-12-01 起,正文为 11-01,系原书笔误。)

解读:

  1. 价格变化概率依赖前一笔:\(P(A_i=1|A_{i-1}=0)=0.258\),\(P(A_i=1|A_{i-1}=1)=0.476\)。价格变化成簇出现;无变化后约 1/4 的下一笔有变化,有变化后升至约 0.5。
  2. 方向:\(P(D_i=1|F_{i-1},A_i)=0.483\)(\(A_{i-1}=0\) 时),\(0.085\)(\(D_{i-1}=1\)),\(0.904\)(\(D_{i-1}=-1\))。前一笔无变化时涨跌机会均等;连续同向变化概率很低——上一笔上涨、本笔有变化时上涨的概率仅约 8.6%,上一笔下跌时上涨概率约 90%。即买卖反弹与价格反转。
  3. 大小:弱证据表明大变化后更可能跟随大变化。\(S_i|(D_i=1)\sim1+g(\lambda_{u,i})\),logit\((\lambda_{u,i})=2.235-0.670S_{i-1}\);上涨 1 tick 的概率在 \(S_{i-1}=1,2,3\) 时分别为 0.827、0.709、0.556。 (验算:\(\lambda=1/(1+e^{-(2.235-0.670)})=1/(1+e^{-1.565})\approx0.827\)。)

ADS 与有序 probit 的区别:ADS 不需要对价格变化大小做截断或分组。

R 演示(logistic 回归):glm(Ai~Aim1, family=binomial) 得截距 −1.05667(标准误 0.01142)、Aim1 0.96164(0.01827);在 \(A_i=1\) 的子样本上把 \(D_i\) 从 ±1 重编码为 1/0(di=(di+abs(di))/2),glm(di~dim1, family=binomial) 得截距 −0.06663(0.01728),dim1 −2.30693(0.03595)。(R 输出的标准误比表 5.6 小,可能表 5.6 来自不同的估计方法。)

5.5 久期模型(Duration Models)(PDF p.273–284)

动机:久期指成交之间的时间间隔。久期长说明交易不活跃、没有新信息;久期的动态包含日内市场活动信息。Engle & Russell (1998) 借鉴 ARCH 思想提出自回归条件久期(ACD, autoregressive conditional duration)模型;Zhang et al. (2001) 扩展到非线性与结构突变。

去除日内周期:由于日内 U 形模式,建模对象是调整久期

\[\Delta t_i^*=\Delta t_i/f(t_i),\tag{5.31}\]
\(f(t_i)\) 为久期的确定性周期成分,取决于资产和市场。估计方法很多(常用平滑样条),无一占优。本书用二次函数加指示变量(IBM 1990.11–1991.01 数据):
\[f(t_i)=\exp[d(t_i)],\quad d(t_i)=\beta_0+\sum_{j=1}^7\beta_jf_j(t_i),\tag{5.32}\]
\(t_i\) 以午夜起算秒数计(43200 = 正午 12:00):

  • \(f_1(t_i)=-\left(\frac{t_i-43200}{14400}\right)^2\);
  • \(f_2(t_i)=-\left(\frac{t_i-48300}{9300}\right)^2\);
  • \(f_3(t_i)=-\left(\frac{t_i-38700}{7500}\right)^2\)(\(t_i<43200\)),否则 0;
  • \(f_4(t_i)=-\left(\frac{t_i-48600}{9000}\right)^2\)(\(t_i\ge43200\)),否则 0;
  • \(f_5,f_6\):开盘后第一、第二个 5 分钟(9:30–9:35、9:35–9:40)的指示变量;\(f_7\):最后 30 分钟(15:30–16:00)指示变量。 图 5.7 画出 \(f_1\)–\(f_4\);\(f_3(43200)=f_4(43200)\)。用 OLS 回归 \(\ln(\Delta t_i)=\beta_0+\sum\beta_jf_j(t_i)+\epsilon_i\) 得
    \[\widehat{\ln(\Delta t_i)}=2.555+0.159f_1+0.270f_2+0.384f_3+0.061f_4-0.611f_5-0.157f_6+0.073f_7.\]
    图 5.8:调整前 5 分钟区间平均久期有明显日内模式(约 10–40 秒),调整后基本消除。

5.5.1 ACD 模型

记 \(x_i=\Delta t_i^*\),\(\psi_i=E(x_i|F_{i-1})\) 为给定第 \(i-1\) 笔信息时的期望调整久期。基本 ACD:

\[x_i=\psi_i\epsilon_i,\tag{5.33}\]
\(\{\epsilon_i\}\) iid 非负,\(E(\epsilon_i)=1\)。Engle–Russell 中 \(\epsilon_i\) 为标准指数或标准化 Weibull 分布,
\[\psi_i=\omega+\sum_{j=1}^r\gamma_jx_{i-j}+\sum_{j=1}^s\omega_j\psi_{i-j}.\tag{5.34}\]
称 ACD(r,s);\(\epsilon_i\) 指数分布时为 EACD(r,s),Weibull 时为 WACD(r,s)。与 GARCH 的对应:\(x_i\leftrightarrow a_t^2\),\(\psi_i\leftrightarrow\sigma_t^2\)。

ARMA 表示:\(\eta_i=x_i-\psi_i\) 是鞅差序列(\(E(\eta_i|F_{i-1})=0\)),

\[x_i=\omega+\sum_{j=1}^{\max(r,s)}(\gamma_j+\omega_j)x_{i-j}-\sum_{j=1}^s\omega_j\eta_{i-j}+\eta_i,\tag{5.35}\]
即非高斯新息的 ARMA 过程(\(j>r\) 时 \(\gamma_j=0\),\(j>s\) 时 \(\omega_j=0\))。弱平稳时
\[E(x_i)=\frac{\omega}{1-\sum_{j}(\gamma_j+\omega_j)},\]
因此要求 \(\omega>0\) 且 \(\sum_j(\gamma_j+\omega_j)<1\)。

EACD(1,1):\(x_i=\psi_i\epsilon_i\),\(\psi_i=\omega+\gamma_1x_{i-1}+\omega_1\psi_{i-1}\),\(\epsilon_i\) 标准指数:\(E(\epsilon_i)=1\),\(\text{Var}(\epsilon_i)=1\),\(E(\epsilon_i^2)=2\)。

  • 均值:\(\mu_x\equiv E(x_i)=E(\psi_i)=\dfrac{\omega}{1-\gamma_1-\omega_1}\)。(5.37–5.38)
  • 二阶矩:\(E(x_i^2)=2E(\psi_i^2)\);对 \(\psi_i\) 平方取期望,利用 \(E(x_{i-1}^2)=2E(\psi_{i-1}^2)\)、\(E(x_{i-1}\psi_{i-1})=E(\psi_{i-1}^2)\) 得
    \[E(\psi_i^2)=\mu_x^2\frac{1-(\gamma_1+\omega_1)^2}{1-2\gamma_1^2-\omega_1^2-2\gamma_1\omega_1}.\tag{5.39}\]
  • 方差:
    \[\text{Var}(x_i)=2E(\psi_i^2)-\mu_x^2=\mu_x^2\frac{1-\omega_1^2-2\gamma_1\omega_1}{1-\omega_1^2-2\gamma_1\omega_1-2\gamma_1^2}.\]
    方差有限的条件:\(1>2\gamma_1^2+\omega_1^2+2\gamma_1\omega_1\)。注意 \(\text{Var}(x_i)>\mu_x^2\),即久期过度离散(overdispersion),这是 ACD 能刻画成交聚集的原因。WACD(1,1) 的方差可用标准化 Weibull 的前两阶矩同样推导。

广义 Gamma 分布的 ACD(GACD):统计文献常用风险函数(hazard function)表达强度。附录 B 表明 EACD 的风险函数为常数,WACD 的风险函数单调,限制太强——交易强度未必常数或单调。Zhang et al. (2001) 用标准化广义 Gamma 分布作为 \(\epsilon_i\) 的分布,风险函数可呈 U 形或倒 U 形等多种形态,称 GACD(r,s)。

5.5.2 模拟

从 ACD(1,1) 生成 500 个观测:

\[x_i=\psi_i\epsilon_i,\quad\psi_i=0.3+0.2x_{i-1}+0.7\psi_{i-1}.\tag{5.40}\]
情形 1:\(\epsilon_i\) 为标准化 Weibull,\(\alpha=1.5\)(WACD);情形 2:标准化广义 Gamma,\(\kappa=1.5\)、\(\alpha=0.5\)(GACD)。图 5.9–5.13:两序列时序图、直方图差别明显(GACD 尾部更重,最大值约 80,WACD 约 10);原序列 ACF 有明显序列相关,标准化残差无。

5.5.3 估计

令 \(i_o=\max(r,s)\),似然 \(f(\boldsymbol x_T|\theta)=\left[\prod_{i=i_o+1}^Tf(x_i|F_{i-1},\theta)\right]f(\boldsymbol x_{i_o}|\theta)\)。边际密度 \(f(\boldsymbol x_{i_o}|\theta)\) 复杂,其影响随 \(T\) 增大而消失,故通常忽略,即条件似然法。

WACD(利用附录式 5.56 的标准化 Weibull 密度)条件对数似然:

\[\ell(\boldsymbol x|\theta,\boldsymbol x_{i_o})=\sum_{i=i_o+1}^T\left\{\alpha\ln\left[\Gamma\!\left(1+\tfrac1\alpha\right)\right]+\ln\left(\frac\alpha{x_i}\right)+\alpha\ln\left(\frac{x_i}{\psi_i}\right)-\left[\frac{\Gamma(1+1/\alpha)x_i}{\psi_i}\right]^\alpha\right\},\tag{5.41}\]
\(\theta=(\omega,\gamma_1,\dots,\gamma_r,\omega_1,\dots,\omega_s,\alpha)'\)。\(\alpha=1\) 时退化为 EACD 的对数似然 \(\sum[-\ln\psi_i-x_i/\psi_i]\)。

GACD 条件对数似然:

\[\ell=\sum_{i=i_o+1}^T\left\{\ln\left(\frac{\alpha}{\Gamma(\kappa)}\right)+(\kappa\alpha-1)\ln x_i-\kappa\alpha\ln(\lambda\psi_i)-\left(\frac{x_i}{\lambda\psi_i}\right)^\alpha\right\},\tag{5.42}\]
\(\lambda=\Gamma(\kappa)/\Gamma(\kappa+1/\alpha)\),\(\theta\) 另含 \(\kappa\)。\(\kappa=1\) 时 \(\lambda=1/\Gamma(1+1/\alpha)\),退化为 WACD。正则条件下条件 MLE 渐近正态(Engle & Russell 1998);实际可用模拟获得有限样本参考分布。

例 5.3(模拟序列续)(表 5.7,括号为标准误):

  • WACD(1,1):真值 \(\omega=0.3,\gamma_1=0.2,\omega_1=0.7,\alpha=1.5\);估计 0.364 (0.139)、0.100 (0.025)、0.767 (0.060)、1.477 (0.052)。
  • GACD(1,1):真值 0.3, 0.2, 0.7, \(\alpha=0.5\), \(\kappa=1.5\);估计 0.401 (0.117)、0.343 (0.074)、0.561 (0.065)、0.436 (0.078)、2.077 (0.653)。 标准化残差 \(\hat\epsilon_i=x_i/\hat\psi_i\) 若模型充分应为 iid;图示无显著序列相关。

例 5.4(IBM 1990 年 11 月 1–7 日前五个交易日):只取正久期,3,534 个调整后观测(已用式 5.32 去日内周期)。调整久期 ACF 有一定序列相关。拟合 WACD(1,1):

\[x_i=\psi_i\epsilon_i,\quad\psi_i=0.169+0.064x_{i-1}+0.885\psi_{i-1},\tag{5.43}\]
\(\hat\alpha=0.879\,(0.012)\);三个系数标准误 0.039、0.010、0.018,t 比均 >4.2,1% 显著。诊断:\(\hat\epsilon_i\) 的 \(Q(10)=4.96\)、\(Q(20)=10.75\);\(\hat\epsilon_i^2\) 的 \(Q(10)=6.20\)、\(Q(20)=11.16\)。\(\alpha=0.879\) 的标准化 Weibull 均值 1.00、标准差 1.14,与 \(\hat\epsilon_i\) 样本均值 1.01、标准差 1.22 接近,模型充分。持续性 \(\hat\gamma_1+\hat\omega_1\approx0.949\);期望调整久期 \(0.169/(1-0.064-0.885)=3.31\) 秒,接近样本均值 3.29。\(\hat\alpha<1\) 但接近 1:条件风险函数缓慢单调递减(刚成交后更可能马上再成交)。

GACD(1,1):

\[\psi_i=0.141+0.063x_{i-1}+0.897\psi_{i-1},\tag{5.44}\]
\(\kappa=4.248\,(1.046)\),\(\alpha=0.395\,(0.053)\);系数标准误 0.041、0.010、0.019,均 1% 显著。\(\hat\epsilon_i\):\(Q(10)=4.95\)、\(Q(20)=10.28\);\(\hat\epsilon_i^2\):\(Q(10)=6.36\)、\(Q(20)=10.89\)。期望久期 3.52,略大于 WACD;持续性 0.96。

注:EACD 可用 ARCH 程序稍加修改估计(Engle & Russell 1998,本质上指数似然与正态 GARCH 似然同构——QMLE 思想);作者用 RATS 或自编 Fortran;GACD 比 EACD/WACD 更难估计;RATS 程序见附录 C。

5.6 非线性久期模型(Nonlinear Duration Models)(PDF p.284–285)

对例 5.4 的 WACD(1,1) 标准化新息 \(\hat\epsilon_i\),基于 AR(4) 做第 4 章的非线性检验(表 5.8(a)):Ori-F 0.343 (p=0.969);TAR-F(1) 3.288 (0.006);TAR-F(2) 3.142 (0.008);TAR-F(3) 3.128 (0.008);TAR-F(4) 0.297 (0.915)。Ori-F 表明无二次非线性,但 TAR-F 显示强阈值非线性。

门限 WACD(1,1):阈值变量 \(x_{i-1}\),估计阈值 3.79:

\[\psi_i=\begin{cases}0.020+0.257x_{i-1}+0.847\psi_{i-1},\ \epsilon_i\sim w(0.901) & x_{i-1}\le3.79\\ 1.808+0.027x_{i-1}+0.501\psi_{i-1},\ \epsilon_i\sim w(0.845) & x_{i-1}>3.79\end{cases}\tag{5.45}\]
\(w(\alpha)\) 为标准化 Weibull。两状态观测数 2,503 和 1,030;状态 1 参数标准误 0.043、0.041、0.024、0.014,状态 2 为 0.526、0.020、0.147、0.020。诊断:\(\hat\epsilon_i\) 的 \(Q(12)=9.8\)、\(Q(24)=23.9\);\(\hat\epsilon_i^2\) 的 \(Q(12)=8.0\)、\(Q(24)=16.7\)。对新标准化新息重做非线性检验(表 5.8(b)):Ori-F 0.163 (0.998);TAR-F(1)–(4):0.746 (0.589)、1.899 (0.091)、1.752 (0.119)、0.270 (0.929),均不显著,模型充分。

解释:两状态可视为交易密集期和清淡期;即使去除日内周期,两者的交易动态仍不同——市场活动由新闻和信息到达驱动。

精简模型(去掉不显著参数):

\[\psi_i=\begin{cases}0.225x_{i-1}+0.867\psi_{i-1},\ \epsilon_i\sim w(0.902) & x_{i-1}\le3.79\\ 1.618+0.614\psi_{i-1},\ \epsilon_i\sim w(0.846) & x_{i-1}>3.79\end{cases}\]
全部高度显著;\(\hat\epsilon_i\):\(Q(10)=5.91\,(0.82)\)、\(Q(20)=16.04\,(0.71)\);\(\hat\epsilon_i^2\):\(Q(10)=5.35\,(0.87)\)、\(Q(20)=15.20\,(0.76)\)。模型充分。RATS 程序见附录 C。

5.7 价格变化与久期的二元模型(Bivariate Models for Price Change and Duration, PCD)(PDF p.285–290)

动机:大量日内成交价格不变,它们与交易强度高度相关,但不直接含价格变动信息。为简化,只关注有价格变化的成交,建立价格变化与久期(PCD)模型(McCulloch & Tsay 2000)。

重新定义记号:\(t_i\) 为第 \(i\) 次价格变化的日历时间;\(P_{t_i}\) 为该时刻成交价;\(\Delta t_i=t_i-t_{i-1}\) 为价格变化之间的久期;\(N_i\) 为区间 \((t_{i-1},t_i)\) 内价格不变的成交笔数(代表无价格变化期间的交易强度);\(D_i=\pm1\) 为方向;\(S_i\) 为变化大小(tick)。

\[P_{t_i}=P_{t_{i-1}}+D_iS_i,\tag{5.46}\]
数据为 \(\{\Delta t_i,N_i,D_i,S_i\}\)。

注:只看价格变化可大幅降低样本量——IBM 1990.11.01–1991.01.31 有 60,265 笔日内成交,只有 19,022 笔价格变化;而且价格变化之间的久期没有日内周期。例:1990-11-21 正常时段 726 笔成交中只有 195 笔价格变化,图 5.16 显示两者的价格路径相同(价格不变的成交不改变价格路径)。

联合分布分解:

\[f(\Delta t_i,N_i,D_i,S_i|F_{i-1})=f(S_i|D_i,N_i,\Delta t_i,F_{i-1})\,f(D_i|N_i,\Delta t_i,F_{i-1})\,f(N_i|\Delta t_i,F_{i-1})\,f(\Delta t_i|F_{i-1}).\tag{5.47}\]
离散变量用广义线性模型,连续变量 \(\ln\Delta t_i\) 用时间序列模型:

  1. 久期:
    \[\ln(\Delta t_i)=\beta_0+\beta_1\ln(\Delta t_{i-1})+\beta_2S_{i-1}+\sigma\epsilon_i,\quad\epsilon_i\sim\text{iid }N(0,1).\tag{5.48}\]
    带滞后变量的多元线性回归,取对数保证正性,可加入其他解释变量。
  2. \(N_i\) 在 0 处集中,分两部分:
    \[p(N_i=0|\Delta t_i,F_{i-1})=\text{logit}[\alpha_0+\alpha_1\ln(\Delta t_i)],\quad\text{logit}(x)=\frac{e^x}{1+e^x},\tag{5.49}\]
    \[N_i|(N_i>0,\Delta t_i,F_{i-1})\sim1+g(\lambda_i),\quad\lambda_i=\frac{\exp[\gamma_0+\gamma_1\ln(\Delta t_i)]}{1+\exp[\gamma_0+\gamma_1\ln(\Delta t_i)]},\tag{5.50}\]
    \(g(\lambda)\) 为几何分布,\(\lambda\in(0,1)\)。
  3. 方向:
    \[D_i|(N_i,\Delta t_i,F_{i-1})=\text{sign}(\mu_i+\sigma_i\epsilon),\quad\epsilon\sim N(0,1),\tag{5.51}\]
    \[\mu_i=\omega_0+\omega_1D_{i-1}+\omega_2\ln(\Delta t_i),\quad\ln(\sigma_i)=\beta\left|\sum_{j=1}^4D_{i-j}\right|=\beta|D_{i-1}+D_{i-2}+D_{i-3}+D_{i-4}|.\]
    即 \(D_i\) 由均值 \(\mu_i\)、方差 \(\sigma_i^2\) 的正态变量的符号决定(一种异方差 probit)。均值方程中负的 \(\omega_1\) 刻画相邻价格变化的反转;方差方程允许偶发的局部趋势:过去 4 次方向一致(\(|\sum D|\) 大)时增大方向不确定性。均值固定时增大方差使抽样正负概率趋于均等,从而提高"一连串同号"出现的机会,形成局部趋势。
  4. 大小(上下不同以允许不对称),\(p(\lambda)\) 为泊松分布,加 1 因有变化时至少 1 tick:
    \[S_i|(D_i=-1,N_i,\Delta t_i,F_{i-1})\sim p(\lambda_{d,i})+1,\quad\ln(\lambda_{d,i})=\eta_{d,0}+\eta_{d,1}N_i+\eta_{d,2}\ln(\Delta t_i)+\eta_{d,3}S_{i-1},\tag{5.52}\]
    \[S_i|(D_i=1,N_i,\Delta t_i,F_{i-1})\sim p(\lambda_{u,i})+1,\quad\ln(\lambda_{u,i})=\eta_{u,0}+\eta_{u,1}N_i+\eta_{u,2}\ln(\Delta t_i)+\eta_{u,3}S_{i-1}.\tag{5.53}\]
    式 (5.48)–(5.53) 可用 MLE 或 MCMC 联合估计;由 (5.47) 的分解,六个条件模型也可分别估计。

例 5.5(IBM 1990-11-21,194 次价格变化):图 5.17 为 \(\ln\Delta t_i\)、\(N_i\)、\(D_i\)、\(S_i\) 的直方图;涨跌大致各半;只有 7 次 2 tick、1 次 3 tick。MCMC(第 12 章)9,500 次迭代,报告后验均值与后验标准差:

  • 久期:\(\ln(\Delta t_i)=4.023+0.032\ln(\Delta t_{i-1})-0.025S_{i-1}+1.403\epsilon_i\),标准差 0.415、0.073、0.384、0.073——久期无动态依赖。
  • \(\Pr(N_i>0|\Delta t_i,F_{i-1})=\text{logit}[-0.637+1.740\ln(\Delta t_i)]\)(标准差 0.238、0.248)——区间越长,出现无价格变化成交的可能越大。(注意此处写的是 \(N_i>0\) 的概率,与 5.49 的 \(N_i=0\) 形式差一个符号约定。)
  • \(N_i|(N_i>0)\sim1+g(\lambda_i)\),\(\lambda_i=\text{logit}[0.178-0.910\ln(\Delta t_i)]\)(标准差 0.246、0.138)——系数为负说明久期越长 \(\lambda_i\) 越小,\(N_i\) 越大。
  • 方向:\(\mu_i=0.049-0.840D_{i-1}-0.004\ln(\Delta t_i)\)(标准差 0.129、0.132、0.082);\(\ln(\sigma_i)=0.244|D_{i-1}+\dots+D_{i-4}|\)(标准差 0.182)。\(D_{i-1}\) 系数显著为负——价格反转;方差方程参数边缘显著,符合预期。
  • 大小:\(\ln(\lambda_{d,i})=1.024-0.327N_i+0.412\ln(\Delta t_i)-4.474S_{i-1}\)(标准差 3.350、0.319、0.599、3.188);\(\ln(\lambda_{u,i})=-3.683-1.542N_i+0.419\ln(\Delta t_i)+0.921S_{i-1}\)(标准差 1.734、0.976、0.453、1.459)。有意思的是 \(N_i\) 系数为负:区间内无价格变化的成交越多,说明没有新信息,价格变化幅度应越小,小的泊松参数正好表达这一点。 总结:单日 194 个观测信息有限,但结果合理。McCulloch & Tsay (2000) 把 PCD 扩展为层次(hierarchical)框架,处理 63 个交易日、19,000 多个观测,许多参数变得显著,例如久期方程中 \(\ln\Delta t_{i-1}\) 的系数在 0.04–0.1 之间,小但显著。

用交易数据检验微观结构理论需要仔细设定变量,并深入理解市场运作和数据采集方式;但本章计量模型的思想在高频数据分析中广泛适用。

5.8 应用:用 ACD 模型刻画日内价格极差(PDF p.290–296)

数据:Apple 股票 1999-01-04 至 2007-11-20 的日对数价格极差(daily range = \(\ln H_t-\ln L_t\)),Yahoo Finance,2,235 个观测(Tsay 2009 分析过)。极差是波动率建模的稳健替代(见第 3 章及 Chou 2005)。期间有两次 1 拆 2(2000-06-21、2005-02-28),因用对数价格极差无需调整。美国市场 2001-01-29 由 1/16 美元改为十进制,影响买卖价差——用干预分析研究其对波动率的影响。

描述统计:均值 0.0407、标准差 0.0218、最小 0.0068、最大 0.1468;偏度 1.3,超额峰度 2.13。图 5.18(a):波动在 2000–2001 上升,2002 年后降到稳定水平,样本末又有所上升。ACF(图 5.19(a))高度显著且缓慢衰减。

把极差当作"久期"建模:正值序列、乘性误差结构,与 ACD 完全一致(即乘性误差模型 MEM 的思想)。拟合 EACD(1,1)、WACD(1,1)、GACD(1,1)(表 5.9;方程 \(\psi_i=\alpha_0+\alpha_1x_{i-1}+\beta_1\psi_{i-1}\);括号为标准误或 p 值;\(Q(10)\) 针对标准化残差,\(Q^*(10)\) 针对其平方):

模型 \(\alpha_0\) \(\alpha_1\) \(\beta_1\) \(\alpha\) \(\kappa\) \(Q(10)\) \(Q^*(10)\)
EACD 0.0007 (0.0005) 0.133 (0.036) 0.849 (0.044) — — 16.65 (0.082) 12.12 (0.277)
WACD 0.0013 (0.0003) 0.131 (0.015) 0.835 (0.021) 2.377 (0.031) — 13.66 (0.189) 9.74 (0.464)
GACD 0.0010 (0.0002) 0.133 (0.015) 0.843 (0.019) 1.622 (0.029) 2.104 (0.040) 14.62 (0.147) 11.21 (0.341)

三个模型的久期方程参数稳定,只有 EACD 的常数项在 5% 水平不显著;EACD 略差。WACD 与 GACD 之间略偏好 GACD(拟合更好、更灵活)。GACD 标准化残差 ACF 无显著相关(滞后 1 略超两倍标准误界,后面非线性 ACD 可消除);残差时序图无异常模式。原文给出残差"均值、标准差、最小值、最大值分别为 0.203, 4.497, 0.999, 0.436",顺序明显错乱,合理解读为:最小值 0.203、最大值 4.497、均值 0.999、标准差 0.436。 WACD 和 GACD 的形状参数 \(\alpha>1\),说明日极差的风险函数单调递增,与波动率聚集一致(大波动后跟大波动)。

门限 ACD:初步分析显示两状态的主要差别在 Weibull 形状参数,因此采用两状态、仅形状参数不同的 TWACD(2;1,1)。阈值变量 \(x_{i-1}\)(延迟 \(d=1\)),阈值在样本分位数 \(\{x_{(q)}:q=60,65,\dots,95\}\) 中网格搜索(表 5.10):

分位 q 60 65 70 75 80 85 90 95
r×100 4.03 4.37 4.75 5.15 5.58 6.16 7.07 8.47
ℓ(r)×10³ 6.073 6.076 6.079 6.076 6.078 6.074 6.072 6.066

选阈值 0.04753(70% 分位)。拟合:\(x_i=\psi_i\epsilon_i\),\(\psi_i=0.0013+0.1539x_{i-1}+0.8131\psi_{i-1}\)(标准误 0.0003、0.0164、0.0215),\(\epsilon_i\sim W(2.2756)\)(\(x_{i-1}\le0.04753\)),否则 \(W(2.7119)\)(标准误 0.0394、0.0717)。图 5.20:条件期望极差 \(\hat\psi_i\) 时序图与残差 ACF,全部在两倍标准误内:\(Q(1)=4.01\,(0.05)\)、\(Q(10)=9.84\,(0.45)\);平方 \(Q^*(1)=0.83\,(0.36)\)、\(Q^*(10)=9.35\,(0.50)\)。延迟也按对数似然选:\(d=2,3\) 时(同一阈值)对数似然为 \(6.069\times10^3\)、\(6.070\times10^3\),低于 \(d=1\)。

干预分析(Intervention Analysis):高频金融数据常受外部事件影响(如 FOMC 加减息、油价跳升),可用 Box & Tiao (1975) 干预分析。干预时点 \(t_o=522\)(2001-01-26,改用十进制前最后一个交易日)。因样本多数在干预后,定义"未干预"指示

\[I_i^{(t_o)}=\begin{cases}1 & i\le t_o\\0 & \text{否则}\end{cases}\]
较大的 tick 会增加观测日极差,因此预期干预前条件期望极差更高:
\[x_i=\psi_i\begin{cases}\epsilon_{1i} & x_{i-1}\le0.04753\\ \epsilon_{2i} & \text{否则}\end{cases},\quad\psi_i=\alpha_0+\gamma I_i^{(t_o)}+\alpha_1x_{i-1}+\beta_1\psi_{i-1},\tag{5.54}\]
干预前、后的期望极差分别为 \(\frac{\alpha_0+\gamma}{1-\alpha_1-\beta_1}\) 和 \(\frac{\alpha_0}{1-\alpha_1-\beta_1}\),预期 \(\gamma>0\)。 拟合:\(\psi_i=0.0021+0.0011I_i^{(522)}+0.1595x_{i-1}+0.7828\psi_{i-1}\)(标准误 0.0004、0.0003、0.0177、0.0264),\(\hat\gamma\) 在 1% 显著;\(\epsilon_i\sim W(2.2835)\) / \(W(2.7322)\)(标准误 0.0413、0.0780)。残差 \(Q(1)=2.37\,(0.12)\)、\(Q(10)=6.24\,(0.79)\);平方 \(Q^*(1)=0.34\,(0.56)\)、\(Q^*(10)=6.79\,(0.75)\)。结论:\(\hat\gamma>0\),十进制改革降低了 Apple 的期望日极差,即降低了波动率。 (可算:干预后期望极差 \(0.0021/(1-0.1595-0.7828)\approx0.0364\),干预前 \(0.0032/0.0577\approx0.0555\)。)

第 5 章附录 A:若干概率分布回顾(PDF p.296–299)

  • 指数分布 \(X\sim\exp(\beta)\):\(f(x|\beta)=\frac1\beta e^{-x/\beta}\)(\(x\ge0\)),\(E(X)=\beta\),\(\text{Var}(X)=\beta^2\),CDF \(F(x)=1-e^{-x/\beta}\);\(\beta=1\) 为标准指数分布。
  • Gamma 函数:\(\Gamma(\kappa)=\int_0^\infty x^{\kappa-1}e^{-x}dx\)(\(\kappa>0\));性质 \(\Gamma(\kappa)=(\kappa-1)\Gamma(\kappa-1)\)(\(\kappa>1\)),\(\Gamma(m)=(m-1)!\),\(\Gamma(1/2)=\sqrt\pi\)。不完全 Gamma 函数 \(\Gamma(y|\kappa)=\int_0^yx^{\kappa-1}e^{-x}dx\),可数值计算。
  • Gamma 分布:\(f(x|\kappa,\beta)=\frac{1}{\beta^\kappa\Gamma(\kappa)}x^{\kappa-1}e^{-x/\beta}\),\(E(X^m)=\beta^m\Gamma(\kappa+m)/\Gamma(\kappa)\),\(E(X)=\kappa\beta\),\(\text{Var}(X)=\kappa\beta^2\)。\(\beta=1\) 为标准 Gamma,\(G\sim\text{gamma}(\kappa)\),\(E(G^m)=\Gamma(\kappa+m)/\Gamma(\kappa)\)(5.55)。
  • Weibull 分布:\(f(x|\alpha,\beta)=\frac{\alpha}{\beta^\alpha}x^{\alpha-1}e^{-(x/\beta)^\alpha}\)(\(x\ge0\)),\(\beta\) 为尺度、\(\alpha\) 为形状参数;\(E(X)=\beta\Gamma(1+1/\alpha)\),\(\text{Var}(X)=\beta^2[\Gamma(1+2/\alpha)-\Gamma^2(1+1/\alpha)]\);CDF \(1-e^{-(x/\beta)^\alpha}\);\(\alpha=1\) 退化为指数。标准化 Weibull:\(Y=X/[\beta\Gamma(1+1/\alpha)]\),\(E(Y)=1\),
    \[f(y|\alpha)=\alpha\left[\Gamma\!\left(1+\tfrac1\alpha\right)\right]^\alpha y^{\alpha-1}\exp\left\{-\left[\Gamma\!\left(1+\tfrac1\alpha\right)y\right]^\alpha\right\},\ y\ge0,\tag{5.56}\]
    CDF \(1-\exp\{-[\Gamma(1+1/\alpha)y]^\alpha\}\),\(\text{Var}(Y)=\Gamma(1+2/\alpha)/[\Gamma(1+1/\alpha)]^2-1\)。WACD 的 MLE 使用此密度。
  • 广义 Gamma 分布:\(f(x|\alpha,\beta,\kappa)=\frac{\alpha x^{\kappa\alpha-1}}{\beta^{\kappa\alpha}\Gamma(\kappa)}\exp[-(x/\beta)^\alpha]\),\(\beta\) 尺度、\(\alpha,\kappa\) 形状。等价表示 \(G=(X/\beta)^\alpha\) 为参数 \(\kappa\) 的标准 Gamma。\(E(X^m)=\beta^m\Gamma(\kappa+m/\alpha)/\Gamma(\kappa)\)。\(\kappa=1\) 为 Weibull,因此指数、Weibull 都是其特例。\(E(X)=\beta\Gamma(\kappa+1/\alpha)/\Gamma(\kappa)\)。单位均值标准化:\(Y=\lambda X/\beta\),\(\lambda=\Gamma(\kappa)/\Gamma(\kappa+1/\alpha)\),
    \[f(y|\alpha,\kappa)=\frac{\alpha y^{\kappa\alpha-1}}{\lambda^{\kappa\alpha}\Gamma(\kappa)}\exp\left[-\left(\frac y\lambda\right)^\alpha\right],\ y>0.\tag{5.57}\]

第 5 章附录 B:风险函数(Hazard Function)(PDF p.299–300)

生存函数 \(S(x)=P(X>x)=1-\text{CDF}(x)\);风险(强度)函数

\[h(x)=\frac{f(x)}{S(x)}.\tag{5.58}\]
直观:已"存活"到 \(x\)(已经等了 \(x\) 秒没有成交)时,下一瞬间发生事件的条件强度。

例 5.6:Weibull 的 \(S(x|\alpha,\beta)=\exp[-(x/\beta)^\alpha]\),\(h(x|\alpha,\beta)=\frac{\alpha}{\beta^\alpha}x^{\alpha-1}\)。\(\alpha=1\) 时 \(h=1/\beta\) 常数(指数分布无记忆性);\(\alpha>1\) 单调递增;\(\alpha<1\) 单调递减。广义 Gamma 的生存与风险函数涉及不完全 Gamma 函数,可呈 U 形或倒 U 形,因而建模成交久期更灵活。标准化 Weibull:\(S(y|\alpha)=\exp\{-[\Gamma(1+1/\alpha)y]^\alpha\}\),\(h(y|\alpha)=\alpha[\Gamma(1+1/\alpha)]^\alpha y^{\alpha-1}\)。

第 5 章附录 C:久期模型的 RATS 程序(PDF p.300–302)

数据 ibm1to5.txt:IBM 1990 年 11 月前 5 个交易日的 3,534 个调整久期(原文写 11 月 1–9 日)。三个程序:

  1. WACD(1,1):gvar = a0+a1*x(t-1)+b1*psi(t-1),对数似然项 al*gma + log(al) - log(x) + al*log(x/psi) - (exp(gma)*x/psi)**al,其中 gma=%LNGAMMA(1+1/al);初值 a0=0.2, a1=0.1, b1=0.1, al=0.8;BHHH 迭代 150 次;对残差 \(x/\psi\) 及其平方做 Ljung–Box。
  2. GACD(1,1):lam = Γ(ka)/Γ(ka+1/al),xlam = x/(lam*psi),对数似然 -lnΓ(ka) + log(al/x) + ka*al*log(xlam) - xlam**al;初值 a0=0.238, a1=0.075, b1=0.857, al=0.5, ka=4.0。
  3. TAR-WACD(1,1):阈值 3.79 预先给定;用 u = ((x(t-1)-3.79)/|x(t-1)-3.79|+1)/2 构造状态指示;状态 1 方程 a1*x(t-1)+a2*psi(t-1)(无常数),状态 2 方程 b0+b2*psi(t-1),两状态 Weibull 形状参数 al、bl 不同;初值 a1=0.2, a2=0.85, al=0.9, b0=1.8, b2=0.5, bl=0.8。

第 5 章习题(PDF p.302–304)

  • 5.1 \(r_t\) 为均值 0.05、方差 1.5 的高斯白噪声,每期成交概率 40%(即 \(\pi=0.6\))且与 \(r_t\) 独立:观测收益是否序列相关?求前三阶自相关。(直接套 5.1 节公式:\(\rho_j=-\mu^2\pi^j/\text{Var}(r_t^o)\)。)
  • 5.2 Roll 模型,\(\Delta P_t^*\) 为方差 1.0 的高斯白噪声,价差 2 tick:tick 为 1/8 美元和 1/16 美元时 \(\Delta P_t\) 的滞后 1 自相关各是多少。
  • 5.3 IBM 1990-11-02 调整久期(ibm-d2-dur.txt):分别建 EACD、WACD、GACD 并检验、比较。
  • 5.4 3M 1999 年 12 月逐笔成交(mmm9912-dtp.txt):(a) 用 5 分钟成交数判断日内模式;(b) 用价格序列确认买卖反弹;(c) 按 1/16 美元 tick 制作价格变化频率表(±5 tick 及以上合并)。
  • 5.5 同上数据:(a) 构造 5 分钟对数收益(区间内所有成交价的简单平均作为价格),用前 10 阶 Ljung–Box 检验序列相关;(b) 每天 77 个 5 分钟收益,用平方和作为日波动率(即已实现波动率 realized volatility),计算 3M 12 月日波动率并讨论其有效性。(考查:平均价导致的平滑偏差、微观结构噪声。)
  • 5.6 3M 调整久期(mmm9912-adur.txt):每天 39 个 10 分钟区间,\(d_i\) 为第 \(i\) 个区间对数久期的跨日平均,调整久期 \(\Delta t_j/\exp(d_i)\)。(a) 调整后是否还有日内模式;(b)(c)(d) 分别用指数、Weibull、广义 Gamma 新息建模;(e) 比较。
  • 5.7 Boeing 2008-12-01 至 12-05 的 TAQ 成交(5 个文件,含时分秒、价格、成交量),构造 5 分钟成交笔数序列,用 ACF 判断日内模式。
  • 5.8 同上,构造 5 分钟收益(区间内最后一笔成交价,忽略隔夜),用 10 阶 ACF 在 5% 水平检验序列相关。
  • 5.9 同 5.8,但用 10 分钟区间。
  • 5.10 计算 Boeing 样本中连续成交无价格变化的比例。

第 5 章参考文献(PDF p.304–305)

Box & Cox (1964);Box & Tiao (1975) 干预分析;Campbell, Lo & MacKinlay (1997);Cho, Russell, Tiao & Tsay (2003) 涨跌停磁吸效应;Chou (2005) CARR 模型;Engle & Russell (1998) ACD;Ghysels (2000);Hasbrouck (1992, 1999);Hausman, Lo & MacKinlay (1992) 有序 probit;Lo & MacKinlay (1990) 非同步交易;McCulloch & Tsay (2000);Roll (1984);Rydberg & Shephard (2003);Stoll & Whaley (1990);Tsay (2009);Wood (2000);Zhang, Russell & Tsay (2001, 2008)。PDF p.306 为空白页。

第 5 章本章要点

  • 非同步交易:只要 \(\mu\ne0\),观测收益出现负自相关 \(\text{Cov}(r^o_t,r^o_{t-j})=-\mu^2\pi^j\),方差放大为 \(\sigma^2+2\pi\mu^2/(1-\pi)\);组合层面会出现虚假的正滞后相关。
  • 买卖反弹(Roll 模型):价格变化滞后 1 自相关为 \(-S^2/4/(S^2/2+\sigma^2)\),无基本面变化时为 −0.5,滞后 >1 为 0。
  • 逐笔数据四大特征:不等间隔、价格离散、日内 U 形、同秒多笔;数据清洗必须明确记录。
  • 价格变化建模:有序 probit(潜变量 + 分界点 + 异方差)与 ADS 分解(是否变化 × 方向 × 大小,logistic + 几何分布)。实证都显示强烈的价格反转。
  • 久期建模:先去日内周期,再用 ACD(GARCH 的久期版本);EACD/WACD/GACD 对应常数/单调/U 形风险函数;条件 MLE;门限 ACD 刻画密集与清淡交易两种状态。
  • PCD 模型联合刻画久期、无变化笔数、方向、大小,分解为条件分布乘积。
  • ACD 思想可用于任何正值序列(如日内价格极差),并可结合门限和干预分析(十进制改革降低了 Apple 波动率)。

第 5 章与量化交易的关联

  • 回测偏差:非同步交易与买卖反弹会制造虚假的短期反转(单只股票)和虚假的领先-滞后/动量(组合、小盘股指数)。做短周期反转或领先-滞后策略回测时,应用中间价(mid-quote)而非成交价计算收益、跳过一期再成交,或用 5.1、5.2 的公式估计偏差大小。
  • 交易成本估计:Roll 模型给出由价格变化自协方差估计有效价差的方法 \(S=2\sqrt{-\text{Cov}}\),常用于没有报价数据时估计交易成本(低频数据上也常用);ordered probit 中价差影响条件方差,与执行成本模型相关。
  • 执行与做市:ADS/有序 probit 给出下一笔成交价格上涨/下跌/不变的条件概率,例如上一笔上涨后下一次变化为上涨的概率只有约 8.5%——这是做市与短期执行算法中预测下一 tick 方向的基础;ACD 给出下一笔成交的期望等待时间,可用于判断流动性、安排拆单节奏(久期短=流动性好/信息到达)。
  • 风险建模:已实现波动率(习题 5.5)和日极差的 ACD/CARR 模型可作为日内或日频波动率预测器;门限 ACD 中的状态区分可用于识别高波动期。
  • 系统实现:TAQ 数据清洗(时间戳、同秒多笔、异常跳点如 IBM 跌 63 tick 后立即涨 64 tick)是高频研究的必经步骤;日内季节性调整(式 5.32)也可用于成交量曲线建模(VWAP 算法中的日内成交量 U 形曲线)。
  • 事件研究:5.8 节的干预分析框架可用于评估制度变化(tick size 改革、涨跌停、交易费用调整)对波动率与流动性的影响。

第 5 章推荐习题

  • 5.1、5.2:手算非同步交易与 Roll 模型的自相关,巩固公式。
  • 5.4、5.7、5.10:真实逐笔数据的日内模式与买卖反弹,是高频数据处理的入门练习。
  • 5.5:用 5 分钟收益计算已实现波动率并讨论其偏差,连接第 3 章和后续已实现波动率文献。
  • 5.6:完整的去季节性 + 三种 ACD 建模比较流程。
  • 5.8/5.9:对比不同采样频率下收益序列相关的变化,体会微观结构噪声随频率的变化。

第 6 章 连续时间模型及其应用(Continuous-Time Models and Their Applications)(PDF p.307–343)

本章引言(PDF p.307–308)

  • 资产价格随时间演化形成随机过程(stochastic process),观测价格是其一个实现。随机过程理论是分析价格和做统计推断的基础。
  • 两类过程:离散时间过程(价格只在离散时点变化,如日收盘价;前几章均属此类)与连续时间过程(价格连续变化,只是在离散时点被观测,可理解为始终存在的"真实价值")。两类过程中价格本身又可连续或离散:连续时间连续过程、连续时间离散过程等;第 5 章的价格变化序列是离散时间离散过程。
  • 本章把价格视为连续时间连续过程,目标是介绍建模和期权定价所需的统计理论与工具:期权术语 → 布朗运动(维纳过程)→ 扩散方程与随机微积分(Itô 引理)→ Black–Scholes 推导 → 带跳的扩散模型(应对如盈利预警之类的稀有事件)。
  • 价格服从扩散方程时,可用对冲方法得到期权价格;有跳时市场不完备(incomplete),无法完美对冲,需借助跳跃风险可分散的假设,或定义风险度量并选择使之最小的价格与对冲。参考 Cox & Rubinstein (1985)、Hull (2007)。

6.1 期权(Options)(PDF p.308)

  • 股票期权:赋予持有人在某日期前以指定价格买卖一定数量指定股票的权利。看涨期权(call)买入权,看跌期权(put)卖出权。指定价格称行权价(strike/exercise price),日期称到期日(expiration date/maturity)。美式期权到期前任何时刻可行权;欧式期权只能在到期日行权。
  • 记行权价 \(K\)、股价 \(P\):call 在 \(P>K\) 时实值(in-the-money),\(P=K\) 平值(at-the-money),\(P<K\) 虚值(out-of-the-money);put 相反。一般地,立即行权会带来正现金流即实值,负现金流即虚值,零现金流即平值。实践中只有实值期权会被行权。

6.2 若干连续时间随机过程(PDF p.308–312)

连续时间连续随机过程定义在概率空间 \((\Omega,\mathcal F,P)\) 上(\(\Omega\) 非空,\(\mathcal F\) 为 σ 域,\(P\) 为概率测度;见 Billingsley 1986 第 1 章)。过程记为 \(\{x(\eta,t)\}\),\(t\in[0,\infty)\);固定 \(t\) 时 \(x(\eta,t)\) 是实值随机变量;固定 \(\eta\) 时是一条随 \(t\) 变化的路径。为简便记 \(\{x_t\}\)。

6.2.1 维纳过程(Wiener Process)

离散时间模型中的冲击是不可预测的白噪声;连续时间中的对应物是维纳过程(标准布朗运动)的增量。定义(基于小增量):\(\{w_t\}\) 是维纳过程,若

  1. \(\Delta w_t=w_{t+\Delta t}-w_t=\epsilon\sqrt{\Delta t}\),\(\epsilon\sim N(0,1)\);
  2. \(\Delta w_t\) 与 \(w_j\)(\(j\le t\))独立。 第 2 条是马尔可夫性:给定现值,过去信息与未来无关;由此任意两个不重叠区间上的增量独立。在金融上与弱式有效市场相关。由第 1 条 \(\Delta w_t\sim N(0,\Delta t)\)。

取 \(w_0\) 固定(通常 0),\(T=t/\Delta t\),\(w_t-w_0=\sum_{i=1}^T\epsilon_i\sqrt{\Delta t}\),于是 \(E(w_t-w_0)=0\),\(\text{Var}(w_t-w_0)=T\Delta t=t\),即 \(w_t-w_0\sim N(0,t)\)——方差随时间长度线性增长。

图 6.1 用 Donsker 定理(\(n=3000\))模拟 [0,1] 上 4 条维纳路径,起点相同、随时间分散。 Donsker 定理:\(\{z_i\}_{i=1}^n\) 独立标准正态,\(w_{n,t}=\frac1{\sqrt n}\sum_{i=1}^{[nt]}z_i\),\(t\in[0,1]\),则 \(n\to\infty\) 时 \(w_{n,t}\) 依分布收敛到维纳过程。R 代码:epsi=rnorm(n); w=cumsum(epsi)/sqrt(n)。

注(正式定义):布朗运动是 \(t\ge0\) 上实值、连续、增量独立且平稳的过程:(1) 连续性:\(t\mapsto w_t\) 几乎必然连续;(2) 独立增量:\(s\le t\) 时 \(w_t-w_s\) 与 \(w_v\)(\(v\le s\))独立;(3) 平稳增量:\(w_t-w_s\) 与 \(w_{t-s}-w_0\) 同分布。可证增量 \(w_t-w_s\sim N(\mu(t-s),\sigma^2(t-s))\),任意有限维 \((w_{t_1},\dots,w_{t_k})\) 多元正态;\(w_0=0\)、\(\mu=0\)、\(\sigma^2=1\) 时为标准布朗运动。 注(不可微):布朗运动路径几乎处处不可微,\(dw_t/dt\) 除零测集外不存在,所以普通微积分不能处理含布朗运动的积分——需要 Itô 微积分。

6.2.2 广义维纳过程(Generalized Wiener Process)

维纳过程漂移 0、方差率 1。推广为漂移率 \(\mu\)、方差率 \(\sigma^2\):

\[dx_t=\mu\,dt+\sigma\,dw_t.\tag{6.1}\]
离散化 \(x_t-x_0=\mu t+\sigma\epsilon\sqrt t\),\(E(x_t-x_0)=\mu t\),\(\text{Var}(x_t-x_0)=\sigma^2t\)。\(\mu,\sigma\) 称漂移(drift)和波动率(volatility)参数。

6.2.3 Itô 过程

允许漂移和波动率依赖于 \(x_t\) 和 \(t\):

\[dx_t=\mu(x_t,t)\,dt+\sigma(x_t,t)\,dw_t,\tag{6.2}\]
等价于积分形式 \(x_t=x_0+\int_0^t\mu(x_s,s)ds+\int_0^t\sigma(x_s,s)dw_s\),最后一项为随机积分。(6.2) 称随机扩散方程,\(\mu(\cdot)\)、\(\sigma(\cdot)\) 为漂移函数和扩散函数。维纳过程是 \(\mu=0,\sigma=1\) 的特例。

6.3 Itô 引理(Ito's Lemma)(PDF p.312–317)

6.3.1 微分回顾

\(G(x)\) 可微:\(\Delta G=G'\Delta x+\frac12G''(\Delta x)^2+\frac16G'''(\Delta x)^3+\cdots\),取极限得 \(dG=\frac{\partial G}{\partial x}dx\);二元时 \(dG=\frac{\partial G}{\partial x}dx+\frac{\partial G}{\partial y}dy\)——普通微积分中二阶项都可忽略。

6.3.2 随机微分

\(G(x_t,t)\),\(x_t\) 为 Itô 过程,Taylor 展开

\[\Delta G=\frac{\partial G}{\partial x}\Delta x+\frac{\partial G}{\partial t}\Delta t+\frac12\frac{\partial^2G}{\partial x^2}(\Delta x)^2+\frac{\partial^2G}{\partial x\partial t}\Delta x\Delta t+\frac12\frac{\partial^2G}{\partial t^2}(\Delta t)^2+\cdots\tag{6.3}\]
离散化 \(\Delta x=\mu\Delta t+\sigma\epsilon\sqrt{\Delta t}\)(6.4),
\[(\Delta x)^2=\mu^2(\Delta t)^2+\sigma^2\epsilon^2\Delta t+2\mu\sigma\epsilon(\Delta t)^{3/2}=\sigma^2\epsilon^2\Delta t+H(\Delta t),\tag{6.5}\]
\((\Delta x)^2\) 含 \(\Delta t\) 阶项,不能忽略。又 \(E(\sigma^2\epsilon^2\Delta t)=\sigma^2\Delta t\),\(\text{Var}(\sigma^2\epsilon^2\Delta t)=2\sigma^4(\Delta t)^2\)(用 \(E\epsilon^4=3\))——方差是高阶小量,因此 \(\sigma^2\epsilon^2\Delta t\) 收敛到非随机量 \(\sigma^2\Delta t\),即 \((\Delta x)^2\to\sigma^2dt\)。代入得

Itô 引理:若 \(dx_t=\mu(x_t,t)dt+\sigma(x_t,t)dw_t\),\(G(x_t,t)\) 可微,则

\[dG=\left[\frac{\partial G}{\partial x}\mu(x_t,t)+\frac{\partial G}{\partial t}+\frac12\frac{\partial^2G}{\partial x^2}\sigma^2(x_t,t)\right]dt+\frac{\partial G}{\partial x}\sigma(x_t,t)\,dw_t.\tag{6.6}\]
与普通链式法则相比多了二阶修正项 \(\frac12G''\sigma^2dt\)。

例 6.1:\(G=w_t^2\),\(\mu=0,\sigma=1\),\(G_w=2w_t\),\(G_t=0\),\(G_{ww}=2\):

\[dw_t^2=dt+2w_t\,dw_t.\tag{6.7}\]

6.3.3 应用:几何布朗运动

股价常假设

\[dP_t=\mu P_tdt+\sigma P_tdw_t,\tag{6.8}\]
\(\mu,\sigma\) 为常数,即几何布朗运动(GBM)。对 \(G=\ln P_t\):\(G_P=1/P_t\),\(G_t=0\),\(\frac12G_{PP}=-\frac1{2P_t^2}\),
\[d\ln P_t=\left(\mu-\frac{\sigma^2}2\right)dt+\sigma\,dw_t.\]
即对数价格是漂移 \(\mu-\sigma^2/2\)、方差率 \(\sigma^2\) 的广义维纳过程;\(t\) 到 \(T\) 的对数收益 \(\sim N((\mu-\sigma^2/2)(T-t),\sigma^2(T-t))\);等间隔 \(\Delta\) 的对数收益序列是均值 \((\mu-\sigma^2/2)\Delta\)、方差 \(\sigma^2\Delta\) 的高斯(独立)过程。

6.3.4 \(\mu\) 与 \(\sigma\) 的估计

\(n+1\) 个等间隔价格(间隔 \(\Delta\),以年计),\(r_t=\ln P_t-\ln P_{t-1}\) 为连续复利收益,在 GBM 下 iid \(N((\mu-\sigma^2/2)\Delta,\sigma^2\Delta)\),无序列相关。记 \(\mu_r=(\mu-\sigma^2/2)\Delta\),\(\sigma_r^2=\sigma^2\Delta\),样本均值 \(\bar r\)、样本标准差 \(s_r=\sqrt{\frac1{n-1}\sum(r_t-\bar r)^2}\),二者相合。于是

\[\hat\sigma=\frac{s_r}{\sqrt\Delta},\quad \text{SE}(\hat\sigma)\approx\frac{\hat\sigma}{\sqrt{2n}},\qquad \hat\mu=\frac{\bar r}{\Delta}+\frac{\hat\sigma^2}2=\frac{\bar r}{\Delta}+\frac{s_r^2}{2\Delta}.\]
(原书写 \(\hat\mu=\bar r/\Delta+s_r^2/2\),按量纲应为 \(s_r^2/(2\Delta)\),即 \(\hat\sigma^2/2\)。)若 \(r_t\) 序列相关或价格不服从 GBM,需要其他方法(见 6.10)。

例 6.2(IBM 1998 年日对数收益,252 个观测):ACF 无显著相关,\(Q(10)=4.9\)。\(\bar r=0.002276\),\(s_r=0.01915\),\(\Delta=1/252\):\(\hat\sigma=0.3040\),\(\hat\mu=0.6198\),即年化期望收益 61.98%、年化波动 30.4%。但偏度 −0.464 (0.153)、超额峰度 2.396 (0.306) 使正态假设存疑。

例 6.3(Cisco 2007 年,251 个观测):\(\bar r=-3.81\times10^{-5}\),\(s_r=0.0174\),\(Q(12)=12.30\)(p=0.42)。\(\hat\sigma=0.0174/\sqrt{1/251}=0.275\),\(\hat\mu=-0.0094\):年化期望对数收益 −0.94%(原文措辞),年化标准差 27.5%。

注意:\(\hat\mu\) 的估计误差很大(标准误约 \(\hat\sigma/\sqrt{\text{年数}}\)),一年数据几乎无法可靠估计漂移,而 \(\sigma\) 的估计相对精确——这是"波动率可估、期望收益难估"的经典结论。

6.4 股价与对数收益的分布(PDF p.317–318)

GBM 下

\[\ln P_T-\ln P_t\sim N\left[\left(\mu-\frac{\sigma^2}2\right)(T-t),\ \sigma^2(T-t)\right],\tag{6.9}\]
\[\ln P_T\sim N\left[\ln P_t+\left(\mu-\frac{\sigma^2}2\right)(T-t),\ \sigma^2(T-t)\right].\tag{6.10}\]
由对数正态性质:\(E(P_T)=P_te^{\mu(T-t)}\)(证实 \(\mu\) 是期望收益率),\(\text{Var}(P_T)=P_t^2e^{2\mu(T-t)}[e^{\sigma^2(T-t)}-1]\)。

例:\(P_t=50\),\(\mu=15\%\),\(\sigma=40\%\),6 个月后 \(E(P_T)=50e^{0.075}=53.89\),\(\text{Var}(P_T)=2500e^{0.15}(e^{0.08}-1)=241.92\),标准差 15.55。

年化连续复利收益率 \(r=\frac1{T-t}\ln\frac{P_T}{P_t}\sim N\left(\mu-\frac{\sigma^2}2,\ \frac{\sigma^2}{T-t}\right)\)。例:\(\mu=15\%\),\(\sigma=10\%\),2 年期:均值 \(0.15-0.01/2=14.5\%\),标准差 \(0.1/\sqrt2=7.1\%\);95% 置信区间 \(0.145\pm1.96\times0.071\),即 (0.6%, 28.4%)。

6.5 Black–Scholes 微分方程的推导(PDF p.318–320)

设 \(P_t\) 服从 GBM,\(G_t=G(P_t,t)\) 为依附于 \(P_t\) 的衍生品(如看涨期权)价格。由 Itô 引理

\[dG_t=\left(\frac{\partial G_t}{\partial P_t}\mu P_t+\frac{\partial G_t}{\partial t}+\frac12\frac{\partial^2G_t}{\partial P_t^2}\sigma^2P_t^2\right)dt+\frac{\partial G_t}{\partial P_t}\sigma P_tdw_t.\]
离散化:
\[\Delta P_t=\mu P_t\Delta t+\sigma P_t\Delta w_t,\tag{6.11}\]
\[\Delta G_t=\left(\frac{\partial G_t}{\partial P_t}\mu P_t+\frac{\partial G_t}{\partial t}+\frac12\frac{\partial^2G_t}{\partial P_t^2}\sigma^2P_t^2\right)\Delta t+\frac{\partial G_t}{\partial P_t}\sigma P_t\Delta w_t.\tag{6.12}\]
两式中 \(\Delta w_t\) 相同,可构造不含维纳过程的组合:做空 1 份衍生品、做多 \(\partial G_t/\partial P_t\) 股股票:
\[V_t=-G_t+\frac{\partial G_t}{\partial P_t}P_t,\tag{6.13}\]
\[\Delta V_t=-\Delta G_t+\frac{\partial G_t}{\partial P_t}\Delta P_t\tag{6.14}\]
\[=\left(-\frac{\partial G_t}{\partial t}-\frac12\frac{\partial^2G_t}{\partial P_t^2}\sigma^2P_t^2\right)\Delta t.\tag{6.15}\]
不含随机项,因此在无套利假设下该组合在 \(\Delta t\) 内无风险,必须获得无风险利率 \(r\):\(\Delta V_t=rV_t\Delta t\)(6.16)。联立得
\[\frac{\partial G_t}{\partial t}+rP_t\frac{\partial G_t}{\partial P_t}+\frac12\sigma^2P_t^2\frac{\partial^2G_t}{\partial P_t^2}=rG_t.\tag{6.17}\]
这就是 Black–Scholes 偏微分方程。解依赖边界条件:欧式看涨 \(G_T=\max(P_T-K,0)\);欧式看跌 \(G_T=\max(K-P_T,0)\)。

例 6.4(无股息股票远期合约):\(G_t=P_t-Ke^{-r(T-t)}\)(\(K\) 为交割价)。\(G_t'=-rKe^{-r(T-t)}\),\(G_P=1\),\(G_{PP}=0\);左边 \(=-rKe^{-r(T-t)}+rP_t=r[P_t-Ke^{-r(T-t)}]\) = 右边,满足 BS 方程。

6.6 Black–Scholes 定价公式(PDF p.320–329)

6.6.1 风险中性世界

BS 方程中不含漂移 \(\mu\),即与风险偏好无关,因此可假设投资者风险中性。风险中性世界中:所有证券的期望收益为无风险利率 \(r\);任何现金流的现值等于其期望值按 \(r\) 贴现。

6.6.2 公式

\[c_t=e^{-r(T-t)}E^*[\max(P_T-K,0)],\tag{6.18}\]

风险中性下 \(\mu=r\),\(\ln P_T\sim N[\ln P_t+(r-\sigma^2/2)(T-t),\ \sigma^2(T-t)]\),\(c_t=e^{-r(T-t)}\int_K^\infty(P_T-K)g(P_T)dP_T\)。积分(附录 A)得

\[c_t=P_t\Phi(h_+)-Ke^{-r(T-t)}\Phi(h_-),\tag{6.19}\]
\[h_+=\frac{\ln(P_t/K)+(r+\sigma^2/2)(T-t)}{\sigma\sqrt{T-t}},\quad h_-=h_+-\sigma\sqrt{T-t}.\]
解释一:到期行权就是收到股票并支付行权价,只在 \(P_T>K\) 时发生;\(P_t\Phi(h_+)\) 是"当且仅当 \(P_T>K\) 时收到股票"的现值,\(Ke^{-r(T-t)}\Phi(h_-)\) 是"当且仅当 \(P_T>K\) 时支付行权价"的现值(\(\Phi(h_-)\) 为风险中性下实值概率)。 解释二(复制组合):\(\Phi(h_+)=\partial G_t/\partial P_t\) 就是 6.5 节无风险组合中的股数,即对冲中的 delta。\(c_t=P_t\Phi(h_+)+B_t\),\(B_t=-Ke^{-r(T-t)}\Phi(h_-)\) 为(借入的)无风险债券金额;第一项是投资于股票的金额,第二项是借款金额。

欧式看跌:

\[p_t=Ke^{-r(T-t)}\Phi(-h_-)-P_t\Phi(-h_+).\tag{6.20}\]
由 \(\Phi(x)=1-\Phi(-x)\),所需信息与看涨相同。买卖权平价(put–call parity):
\[p_t-c_t=Ke^{-r(T-t)}-P_t.\]
另一推导:组合 A = 1 份欧式 call + 现金 \(Ke^{-r(T-t)}\);组合 B = 1 份欧式 put + 1 股股票;到期价值都为 \(\max(P_T,K)\),因只能到期行权,今天价值必须相等:\(c_t+Ke^{-r(T-t)}=p_t+P_t\)。

例 6.5(Intel,深度虚值):\(P_t=80\),\(K=90\),\(T-t=0.25\),\(\sigma=0.2\),\(r=0.08\)。\(h_+=\frac{\ln(80/90)+(0.08+0.02)\times0.25}{0.2\times0.5}=-0.9278\),\(h_-=-1.0278\);\(\Phi(-0.9278)=0.1767\),\(\Phi(-1.0278)=0.1520\)。 \(c_t=80\times0.1767-90\times0.1520\times e^{-0.02}=\$0.73\);股价需上涨 $10.73 买方才能盈亏平衡。 \(p_t=90e^{-0.02}\Phi(1.0278)-80\Phi(0.9278)=\$8.95\);股价最多可再涨 $1.05(至 81.05)买方仍盈亏平衡。

例 6.6(近平值):\(K=81\),其他同上。\(h_+=0.125775\),\(h_-=0.025775\),\(\Phi(h_+)=0.5500\),\(\Phi(h_-)=0.5103\)。\(c_t=80\times0.5500-81e^{-0.02}\times0.5103=\$3.49\),需上涨 $4.49 盈亏平衡;\(p_t=81e^{-0.02}\times0.48972-80\times0.44996=\$2.89\),需下跌 $1.89 盈亏平衡。

附录 B 正态 CDF 近似(原书 p.320,此处提前汇总):\(x\ge0\) 时 \(\Phi(x)\approx1-f(x)[c_1k+c_2k^2+c_3k^3+c_4k^4+c_5k^5]\),\(f(x)=e^{-x^2/2}/\sqrt{2\pi}\),\(k=1/(1+0.2316419x)\),\(c_1=0.319381530\),\(c_2=-0.356563782\),\(c_3=1.781477937\),\(c_4=-1.821255978\),\(c_5=1.330274429\);\(x<0\) 时 \(\Phi(x)=1-\Phi(-x)\)。例:\(\Phi(1.96)=0.975002\),\(\Phi(0.82)=0.793892\),\(\Phi(-0.61)=0.270931\),与正态表非常接近。

6.6.3 欧式期权的下界

无股息股票欧式看涨:\(c_t\ge P_t-Ke^{-r(T-t)}\)。证明:组合 A(1 份 call + 现金 \(Ke^{-r(T-t)}\),现金按无风险利率增长到 \(K\))到期价值 \(\max(P_T,K)\);组合 B(1 股股票)到期价值 \(P_T\)。A 总不小于 B,故今天 \(c_t+Ke^{-r(T-t)}\ge P_t\)。又 \(c_t\ge0\),故

\[c_t\ge\max(P_t-Ke^{-r(T-t)},0),\qquad p_t\ge\max(Ke^{-r(T-t)}-P_t,0).\]

例 6.7(套利):\(P_t=30\),\(K=28\),\(r=6\%\),\(T-t=0.5\);下界 \(30-28e^{-0.03}\approx\$2.83\)。若 call 卖 $2.50(低于下界),套利者买入 call、卖空股票,得现金 $27.50,按无风险利率投资 6 个月增至 \(27.50e^{0.03}=\$28.34\)。到期若 \(P_T>28\),行权买股平仓,获利 $0.34;若 \(P_T<28\),在市场买股平仓获利更多,例如 \(P_T=27\) 时获利 $1.34。

6.6.4 讨论:五个变量的影响

期权价格取决于 \(P_t\)、\(K\)、\(T-t\)(年)、\(\sigma\)(年化)、\(r\)(年化)。

看涨期权的边际效应(固定其他变量):

  1. 股价 \(P_t\):\(c_t\) 与 \(\ln P_t\) 正相关;\(P_t\to0\) 时 \(c_t\to0\),\(P_t\to\infty\) 时 \(c_t\to\infty\)。图 6.3(a):\(K=80\),\(r=6\%\),\(T-t=0.25\),\(\sigma=30\%\)。
  2. 行权价 \(K\):与 \(\ln K\) 负相关;\(K\to0\) 时 \(c_t\to P_t\),\(K\to\infty\) 时 \(c_t\to0\)。
  3. 到期时间:把 \(h_\pm\) 写为 \(\frac{\ln(P_t/K)}{\sigma\sqrt{T-t}}+\frac{(r\pm\sigma^2/2)\sqrt{T-t}}{\sigma}\)。若 \(P_t<K\),\(T-t\to0\) 时 \(c_t\to0\);若 \(P_t>K\),\(T-t\to0\) 时 \(c_t\to P_t-K\);\(T-t\to\infty\) 时 \(c_t\to P_t\)。图 6.4(a):\(K=80\),\(r=6\%\),\(\sigma=30\%\),\(P_t=70,80,90\)。
  4. 波动率:把 \(h_\pm\) 写为 \(\frac{\ln(P_t/K)+r(T-t)}{\sigma\sqrt{T-t}}\pm\frac\sigma2\sqrt{T-t}\)。(a) 若 \(\ln(P_t/K)+r(T-t)<0\),\(\sigma\to0\) 时 \(c_t\to0\);(b) 若 \(\ge0\),\(\sigma\to0\) 时 \(c_t\to P_t-Ke^{-r(T-t)}\);\(\sigma\to\infty\) 时 \(c_t\to P_t\)。图 6.5(a)。
  5. 利率:\(c_t\) 与 \(r\) 正相关,\(r\to\infty\) 时 \(c_t\to P_t\)。 看跌期权的边际效应可类似得到(图 6.3(b)、6.4(b)、6.5(b);习题 6.5)。

联合效应:图 6.6(\(P_t=80\),\(r=0.06\),\(T-t=0.25\)):波动率高、行权价远低于现价时 call 价格高;图 6.7:波动率高、行权价远高于现价时 put 价格高,且波动率越高,put 价格对行权价的关系越接近线性。

6.7 Itô 引理的推广(多维)(PDF p.329–330)

衍生品可能依附于多个证券或多个因子(如利率期限结构的两因子模型)。设 \(\boldsymbol x_t=(x_{1t},\dots,x_{kt})'\),

\[dx_{it}=\mu_i(\boldsymbol x_t)dt+\sigma_i(\boldsymbol x_t)dw_{it},\quad i=1,\dots,k,\tag{6.21}\]
\(\mu_i,\sigma_i\) 也可依赖 \(t\);不同 \(i\) 的维纳过程不同,\(dw_{it}\) 与 \(dw_{jt}\) 的相关系数为 \(\rho_{ij}\)(即 \(\Delta w_{it}=\epsilon_i\sqrt{\Delta t}\) 中 \(\epsilon_i,\epsilon_j\) 的相关)。类似 (6.5) 的论证:
\[(\Delta x_{it})^2\to\sigma_i^2(\boldsymbol x_t)dt,\tag{6.22}\]
\[\Delta x_{it}\Delta x_{jt}\to\sigma_i(\boldsymbol x_t)\sigma_j(\boldsymbol x_t)\rho_{ij}dt.\tag{6.23}\]
于是
\[dG_t=\left[\sum_{i=1}^k\frac{\partial G_t}{\partial x_{it}}\mu_i+\frac{\partial G_t}{\partial t}+\frac12\sum_{i=1}^k\sum_{j=1}^k\frac{\partial^2G_t}{\partial x_{it}\partial x_{jt}}\sigma_i\sigma_j\rho_{ij}\right]dt+\sum_{i=1}^k\frac{\partial G_t}{\partial x_{it}}\sigma_idw_{it}.\tag{6.24}\]
(原书离散化式中把 \(\Delta x_{it}\) 误印为 \(\Delta w_{it}\)。)

6.8 随机积分(Stochastic Integral)(PDF p.330–331)

用 Itô 公式推出积分结果(严格处理见随机微积分教材)。积分是微分的逆:\(\int_0^tdx_s=x_t-x_0\);特别地 \(\int_0^tdw_s=w_t\)(\(w_0=0\))。对 (6.7) 积分:\(w_t^2=t+2\int_0^tw_sdw_s\),所以

\[\int_0^tw_s\,dw_s=\frac12(w_t^2-t),\]
不同于确定性积分 \(\int_0^ty\,dy=(y_t^2-y_0^2)/2\)——多出的 \(-t/2\) 来自 Itô 修正。

GBM \(dx_t=\mu x_tdt+\sigma x_tdw_t\)(\(\sigma>0\)):\(d\ln x_t=(\mu-\sigma^2/2)dt+\sigma dw_t\),积分得 \(\ln x_t=\ln x_0+(\mu-\sigma^2/2)t+\sigma w_t\),

\[P_t=P_0\exp\left[\left(\mu-\frac{\sigma^2}2\right)t+\sigma w_t\right].\tag{6.25}\]

6.9 跳跃扩散模型(Jump Diffusion Models)(PDF p.331–338)

动机:基于布朗运动的扩散模型无法解释资产收益及衍生品价格的某些特征,例如隐含波动率的波动率微笑(volatility smile)——隐含波动率是行权价的凸函数,实值和虚值期权的隐含波动率高于平值,外汇市场尤其明显,股票期权较弱(Bakshi, Cao & Chen 1997)。替代方案包括跳跃扩散和随机波动率模型(Merton 1976;Duffie 1995)。

泊松过程:\(X_t\) 为 \([0,t]\) 内特殊事件发生次数,若 \(\Pr(X_t=m)=\frac{\lambda^mt^m}{m!}e^{-\lambda t}\)(\(\lambda>0\)),即 \(X_t\sim\text{Poisson}(\lambda t)\),则为泊松过程,\(\lambda\) 为速率/强度。正式定义还要求右连续、有左极限的齐次马尔可夫过程。

Kou (2002) 双指数跳跃扩散:优点——隐含收益尖峰厚尾且关于 0 不对称;能重现波动率微笑;许多期权有解析公式。由 GBM 连续部分和跳跃部分组成:跳的发生由泊松过程决定,跳幅服从双指数分布。

\[\frac{dP_t}{P_t}=\mu\,dt+\sigma\,dw_t+d\left(\sum_{i=1}^{n_t}(J_i-1)\right),\tag{6.26}\]
\(n_t\) 为速率 \(\lambda\) 的泊松过程,\(\{J_i\}\) iid 非负,\(X=\ln J\) 服从双指数(Laplace)分布
\[f_X(x)=\frac1{2\eta}e^{-|x-\kappa|/\eta},\quad0<\eta<1.\tag{6.27}\]
\(n_t,w_t,J_i\) 相互独立;第 \(i\) 次跳的价格变动比例为 \(J_i-1\)。等价表示
\[X-\kappa=\begin{cases}\xi & \text{概率 }0.5\\ -\xi & \text{概率 }0.5\end{cases}\tag{6.28}\]
\(\xi\) 为均值 \(\eta\)、方差 \(\eta^2\) 的指数变量(密度 \(\frac1\eta e^{-x/\eta}\))。性质:\(E(X)=\kappa\),\(\text{Var}(X)=2\eta^2\),\(E(e^X)=\frac{e^\kappa}{1-\eta^2}\)。有限样本中双指数与 Student-t 很难区分,但双指数解析上更易处理,且在均值附近概率更集中(峰更高),契合收益直方图峰高于正态。图 6.8:均值 0、方差 0.0008 的双指数与正态密度对比,双指数尖峰明显。

解:

\[P_t=P_0\exp\left[\left(\mu-\frac{\sigma^2}2\right)t+\sigma w_t\right]\prod_{i=1}^{n_t}J_i,\tag{6.29}\]
(\(\prod_{i=1}^0=1\))。推导:设 \(t_i\) 为第 \(i\) 次跳的时刻;\([0,t_1)\) 内无跳,价格为 (6.25);左极限 \(P_{t_1^-}=P_0\exp[(\mu-\sigma^2/2)t_1+\sigma w_{t_1}]\);跳后 \(P_{t_1}=J_1P_{t_1^-}\);\((t_1,t_2)\) 内 \(P_t=P_{t_1}\exp[(\mu-\sigma^2/2)(t-t_1)+\sigma(w_t-w_{t_1})]=P_0\exp[(\mu-\sigma^2/2)t+\sigma w_t]J_1\);递推可得。

小区间内的简单收益:

\[\frac{P_{t+\Delta t}-P_t}{P_t}=\exp\left[\left(\mu-\tfrac12\sigma^2\right)\Delta t+\sigma(w_{t+\Delta t}-w_t)+\sum_{i=n_t+1}^{n_{t+\Delta t}}X_i\right]-1,\]
用 \(e^x\approx1+x+x^2/2\) 及 \((\Delta w_t)^2\approx\Delta t\):
\[\approx\mu\Delta t+\sigma\epsilon\sqrt{\Delta t}+\sum_{i=n_t+1}^{n_{t+\Delta t}}X_i.\]
泊松过程在 \((t,t+\Delta t]\) 内一跳的概率为 \(\lambda\Delta t\),多跳为 \(o(\Delta t)\),忽略多跳:
\[\frac{P_{t+\Delta t}-P_t}{P_t}\approx\mu\Delta t+\sigma\epsilon\sqrt{\Delta t}+I\times X,\tag{6.30}\]
\(I\) 为伯努利变量,\(\Pr(I=1)=\lambda\Delta t\);\(X\) 为双指数变量。无跳时退化为 GBM。 记右边为 \(G\),Kou (2002) 给出其密度
\[g(x)=\frac{\lambda\Delta t}{2\eta}e^{\sigma^2\Delta t/(2\eta^2)}\left[e^{-\omega/\eta}\Phi\!\left(\frac{\omega\eta-\sigma^2\Delta t}{\sigma\eta\sqrt{\Delta t}}\right)+e^{\omega/\eta}\Phi\!\left(-\frac{\omega\eta+\sigma^2\Delta t}{\sigma\eta\sqrt{\Delta t}}\right)\right]+(1-\lambda\Delta t)\frac{1}{\sigma\sqrt{\Delta t}}f\!\left(\frac{x-\mu\Delta t}{\sigma\sqrt{\Delta t}}\right),\tag{6.31}\]
\(\omega=x-\mu\Delta t-\kappa\),\(f,\Phi\) 为标准正态密度与 CDF(第二个 \(\Phi\) 的自变量符号依原论文应为负,抽取文本符号缺失)。均值与方差:
\[E(G)=\mu\Delta t+\kappa\lambda\Delta t,\qquad\text{Var}(G)=\sigma^2\Delta t+\lambda\Delta t[2\eta^2+\kappa^2(1-\lambda\Delta t)].\]
图 6.9:\(\mu=20\%\)、\(\sigma=20\%\)(年化),\(\Delta t=1/252\),\(\lambda=10\),\(\kappa=-0.02\),\(\eta=0.02\)(每年约 10 次跳,平均跳幅 −2%,跳幅标准误 2%,对美国股票合理),两分布均值 0、方差 \(2.0572\times10^{-4}\);跳跃扩散分布峰更高、尾更厚(左右尾都更厚,且因 \(\kappa<0\) 左尾更突出)。

6.9.1 跳跃扩散下的期权定价

有随机跳时市场不完备,标准对冲论证不适用。但若假设证券数量很多,跳跃风险可分散,市场不为其支付超额风险溢价,就可得到与风险偏好无关的定价公式;或者给定风险溢价,构造风险中性测度 \(P^*\):

\[\frac{dP_t}{P_t}=[r-\lambda E(J-1)]dt+\sigma dw_t+d\left(\sum_{i=1}^{n_t}(J_i-1)\right)=(r-\lambda\psi)dt+\sigma dw_t+d\left(\sum(J_i-1)\right),\]
\(\psi=E(J)-1=\frac{e^\kappa}{1-\eta^2}-1\);\(\kappa,\eta,\psi,\sigma\) 成为风险中性参数。漂移中减去 \(\lambda\psi\) 是为了补偿跳的平均贡献,使折现价格为鞅。唯一解 \(P_t=P_0\exp[(r-\sigma^2/2-\lambda\psi)t+\sigma w_t]\prod_{i=1}^{n_t}J_i\)。

欧式看涨:

\[c_t=E^*\left[e^{-r(T-t)}\left(P_t\exp\left[\left(r-\frac{\sigma^2}2-\lambda\psi\right)(T-t)+\sigma\sqrt{T-t}\,\epsilon\right]\prod_{i=1}^{n_T}J_i-K\right)_+\right].\tag{6.32}\]
Kou (2002) 的解析解:
\[c_t=\sum_{n=1}^\infty\sum_{j=1}^ne^{-\lambda(T-t)}\frac{\lambda^n(T-t)^n}{n!}\frac{2^j}{2^{2n-1}}\binom{2n-j-1}{n-1}(A_{1,n,j}+A_{2,n,j}+A_{3,n,j})+e^{-\lambda(T-t)}\left[P_te^{-\lambda\psi(T-t)}\Phi(h_+)-Ke^{-r(T-t)}\Phi(h_-)\right],\tag{6.33}\]
其中

  • \(A_{1,n,j}=P_te^{-\lambda\psi(T-t)+n\kappa}\frac12\left[\frac1{(1-\eta)^j}+\frac1{(1+\eta)^j}\right]\Phi(b_+)-e^{-r(T-t)}K\Phi(b_-)\);
  • \(A_{2,n,j}=\frac12e^{-r(T-t)-\omega/\eta+\sigma^2(T-t)/(2\eta^2)}K\sum_{i=0}^{j-1}\left[\frac1{(1-\eta)^{j-i}}-1\right]\left(\frac{\sigma\sqrt{T-t}}\eta\right)^i\frac1{\sqrt{2\pi}}Hh_i(c_-)\);
  • \(A_{3,n,j}=\frac12e^{-r(T-t)+\omega/\eta+\sigma^2(T-t)/(2\eta^2)}K\sum_{i=0}^{j-1}\left[1-\frac1{(1+\eta)^{j-i}}\right]\left(\frac{\sigma\sqrt{T-t}}\eta\right)^i\frac1{\sqrt{2\pi}}Hh_i(c_+)\);
  • \(b_\pm=\frac{\ln(P_t/K)+(r\pm\sigma^2/2-\lambda\psi)(T-t)+n\kappa}{\sigma\sqrt{T-t}}\),\(h_\pm=\frac{\ln(P_t/K)+(r\pm\sigma^2/2-\lambda\psi)(T-t)}{\sigma\sqrt{T-t}}\);
  • \(c_\pm=\frac{\sigma\sqrt{T-t}}\eta\pm\frac{\omega}{\sigma\sqrt{T-t}}\),\(\omega=\ln(K/P_t)+\lambda\psi(T-t)-(r-\sigma^2/2)(T-t)-n\kappa\);
  • \(Hh\) 函数:\(Hh_n(x)=\frac1{n!}\int_x^\infty(s-x)^ne^{-s^2/2}ds\)(\(n=0,1,\dots\))(6.34),\(Hh_{-1}(x)=e^{-x^2/2}=\sqrt{2\pi}f(x)\);递推 \(nHh_n(x)=Hh_{n-2}(x)-xHh_{n-1}(x)\)(\(n\ge1\)),初值 \(Hh_{-1}(x)=e^{-x^2/2}\),\(Hh_0(x)=\sqrt{2\pi}\Phi(-x)\)(6.35)(Abramowitz & Stegun 1972)。 无穷级数可截断(如前 10 项)快速准确计算;\(\lambda=0\) 时退化为 BS 公式。欧式看跌由平价 \(p_t=c_t+Ke^{-r(T-t)}-P_t\) 得到。其他期权见 Kou (2002)。

例 6.8:沿用例 6.6(\(P_t=80\),\(K=81\),\(r=0.08\),\(T-t=0.25\),\(\sigma=0.2\)),加跳 \(\lambda=10\),\(\kappa=-0.02\),\(\eta=0.02\):\(c_t=\$3.92\)(无跳时 $3.49),\(p_t=\$3.31\)(无跳时 $2.89)。保持其他参数不变时加入跳会提高两种期权价格;但实际应用中加入跳通常会导致对 \(\sigma\) 的估计不同(总波动被拆分为扩散与跳跃两部分)。

6.10 连续时间模型的估计(PDF p.338–339)

从离散采样数据直接估计扩散方程(漂移 \(\mu(x_t,t)\)、波动率 \(\sigma(x_t,t)\) 可能时变且无特定参数形式),只概述方法(另见 Lo 1988):

  1. 拟极大似然(QML):利用小区间内 \(dw_t\) 正态(Kessler 1997);
  2. 矩方法:Conley, Hansen, Luttmer & Scheinkman (1997);
  3. 非参数方法:Aït-Sahalia (1996, 2002);
  4. 半参数与再投影(reprojection)方法:Gallant & Long (1997),Gallant & Tauchen (1997);
  5. MCMC:Eraker (2001),Elerian, Chib & Shephard (2001)。

第 6 章附录 A:Black–Scholes 公式的积分推导(PDF p.339–340)

令 \(x=\ln P_T\),\(g(P_T)dP_T=f(x)dx\):

\[c_t=e^{-r(T-t)}\left[\int_{\ln K}^\infty e^xf(x)dx-K\int_{\ln K}^\infty f(x)dx\right].\tag{6.36}\]
\(x\sim N[\ln P_t+(r-\sigma^2/2)(T-t),\sigma^2(T-t)]\)。第二项 \(\int_{\ln K}^\infty f(x)dx=1-\Phi(-h_-)=\Phi(h_-)\),其中 \(-h_-=\frac{\ln K-\ln P_t-(r-\sigma^2/2)(T-t)}{\sigma\sqrt{T-t}}\)。 第一项配方:\(x-\frac{\{x-[\ln P_t+(r-\sigma^2/2)(T-t)]\}^2}{2\sigma^2(T-t)}=-\frac{\{x-[\ln P_t+(r+\sigma^2/2)(T-t)]\}^2}{2\sigma^2(T-t)}+\ln P_t+r(T-t)\),因此 \(\int_{\ln K}^\infty e^xf(x)dx=P_te^{r(T-t)}\Phi(h_+)\),即均值为 \(\ln P_t+(r+\sigma^2/2)(T-t)\) 的正态尾概率。合并:\(c_t=P_t\Phi(h_+)-Ke^{-r(T-t)}\Phi(h_-)\)。

第 6 章附录 B:标准正态概率近似(PDF p.340)

见 6.6.2 节末尾的汇总。

第 6 章习题(PDF p.341–342)

  • 6.1 对数价格 \(dp_t=\gamma dt+\sigma dw_t\),推导 \(P_t\) 的随机微分方程(Itô 引理逆向应用:\(dP_t=(\gamma+\sigma^2/2)P_tdt+\sigma P_tdw_t\))。
  • 6.2 无股息股票远期价格 \(F_{t,T}=P_te^{r(T-t)}\),\(P_t\) 为 GBM,推导 \(F_{t,T}\) 的扩散方程。
  • 6.3 IBM 1997 年日对数收益均值 0.00131、标准差 0.02215,252 个交易日,估计 \(\mu,\sigma\)。
  • 6.4 \(P_t=120\),\(\sigma=50\%\),\(r=7\%\),无股息:(a) \(K=125\)、3 个月欧式 call;(b) \(K=118\)、3 个月欧式 put;\(\sigma\) 升至 80% 时两者价格。
  • 6.5 推导五个变量对欧式看跌期权的极限边际效应。
  • 6.6 \(P_t=60\),\(\mu=20\%\),\(\sigma=40\%\):2 年后股价分布、均值、标准差及 95% 置信区间。(题中 SDE 印作 \(\sigma P_tdt\),应为 \(dw_t\)。)
  • 6.7 同上:2 年连续复利收益率的分布、均值、标准差。
  • 6.8 跳跃扩散:\(P_t=70\),\(r=8\%\),\(\sigma=30\%\),每年约 15 次跳,平均跳幅 −2%,跳幅标准误 3%:\(K=75\)、3 个月欧式 call 与 put 价格。
  • 6.9 \(P_t=20\),\(K=18\),\(r=6\%\),\(T-t=0.5\),欧式 call 售价 $2.10:是否有套利机会?(下界 \(20-18e^{-0.03}\approx2.53>2.10\),有。)
  • 6.10 \(P_t=44\),\(K=47\),\(r=6\%\),\(T-t=0.5\),欧式 put 售价 $1.00:套利机会?(下界 \(47e^{-0.03}-44\approx1.61>1.00\),有。)

第 6 章参考文献(PDF p.342–343)

Abramowitz & Stegun (1972);Aït-Sahalia (1996, 2002);Bakshi, Cao & Chen (1997);Billingsley (1968, 1986);Black & Scholes (1973);Conley et al. (1997);Cox & Rubinstein (1985);Donsker (1951);Duffie (1995);Elerian, Chib & Shephard (2001);Eraker (2001);Gallant & Long (1997);Gallant & Tauchen (1997);Hull (2007);Kessler (1997);Kou (2002);Lo (1988);Merton (1976) 等。

第 6 章本章要点

  • 维纳过程增量独立、\(N(0,\Delta t)\),路径连续但不可微;广义维纳过程与 Itô 过程依次放宽漂移与扩散设定。
  • Itô 引理的核心是 \((dw_t)^2=dt\),带来二阶修正项 \(\frac12G_{xx}\sigma^2dt\);多维时加入 \(\rho_{ij}\sigma_i\sigma_j\) 交叉项。
  • GBM 下对数价格漂移为 \(\mu-\sigma^2/2\);\(\hat\sigma=s_r/\sqrt\Delta\),\(\hat\mu=\bar r/\Delta+\hat\sigma^2/2\)。
  • 用 delta 对冲构造无风险组合 + 无套利得到 BS 偏微分方程;风险中性定价得到 BS 公式;买卖权平价与无套利下界由组合比较得到。
  • 跳跃扩散(Kou 双指数)产生尖峰厚尾和不对称,可生成波动率微笑;市场不完备,需风险中性测度下的漂移修正 \(-\lambda\psi\);定价有级数解析解。
  • 扩散方程估计方法:QML、矩方法、非参数、半参数/EMM、MCMC。

第 6 章与量化交易的关联

  • 定价与对冲:BS 公式和 delta(\(\Phi(h_+)\))是期权做市、波动率交易、隐含波动率计算的基础;例 6.7 的下界套利和平价关系是期权数据清洗(剔除违反无套利的报价)和套利监控的标准检查。
  • 波动率曲面:6.9 节解释了为何单一 \(\sigma\) 的 BS 无法拟合微笑/偏斜;跳跃扩散的负均值跳幅(\(\kappa<0\))对应股票期权的左偏斜,是构建波动率曲面和尾部风险定价的起点。
  • 风险建模与模拟:GBM 和跳跃扩散是蒙特卡洛 VaR、情景生成和策略压力测试中最常用的价格生成器;式 (6.30) 给出离散时间模拟方案。
  • 参数估计的现实约束:例 6.2/6.3 说明一年数据中 \(\mu\) 估计极不可靠——在组合优化中用历史均值估计期望收益要非常谨慎(这也是 Black–Litterman、收缩估计等方法存在的原因),而波动率估计相对稳健。
  • 执行与随机控制:Itô 引理是最优执行(Almgren–Chriss 等)和做市模型(Avellaneda–Stoikov)中推导价值函数 HJB 方程的基本工具,本章提供了数学基础。

第 6 章推荐习题

  • 6.1、6.2:Itô 引理基本功。
  • 6.3:用真实统计量估计 GBM 参数。
  • 6.4、6.5:BS 定价与比较静态(敏感性)分析。
  • 6.8:跳跃扩散定价(需编程实现 6.33 或用蒙特卡洛验证)。
  • 6.9、6.10:无套利下界与套利构造。

第 7 章 极值、分位数与风险价值(Extreme Values, Quantiles, and Value at Risk)(PDF p.345 起)

本章引言(PDF p.345–346)

  • 极端价格变动罕见但重要:1987 年 10 月股灾、LTCM、雷曼兄弟破产;近年全球金融危机中 VIX 大幅上升、市场指数暴跌,引发关于市场风险和保证金设定的讨论。VaR 已成为风险管理中市场风险的标准度量,其用处和弱点都被广泛讨论。
  • 本章讨论多种 VaR 计算方法及其统计理论,特别是研究稀有事件的**极值理论(EVT)**及其在 VaR 中的应用;包括无条件(只用历史收益)和条件(再用宏观、会计等解释变量)两种极值方法。其他方法:RiskMetrics、波动率模型的计量方法、经验分位数。
  • 统一用 IBM 日对数收益(1962-07-03 至 1998-12-31,9,190 个观测,图 7.1)演示各方法,便于比较。
  • VaR 是潜在损失的点估计,有不确定性,且在极端事件发生时倾向于低估实际损失;因此也讨论期望损失(expected shortfall)和损失分布等其他风险度量。

7.1 风险价值(Value at Risk)(PDF p.346–348)

风险类别:信用风险、操作风险、市场风险。VaR 主要针对市场风险,但概念可推广。VaR 是机构某类风险头寸在给定持有期内因一般市场变动可能下降金额的单一估计(Duffie & Pan 1997;Jorion 2006)。可用于机构自评风险,或监管机构设定保证金/资本要求,确保机构在灾难事件后仍能经营。

  • 机构视角:给定概率下、给定期间内金融头寸的最大损失(正常市场条件下的稀有事件损失)。
  • 监管视角:异常市场情况下的最小损失。两种定义得到同一 VaR。

概率定义:在 \(t\) 时关注未来 \(\ell\) 期的风险。\(\Delta V(\ell)\) 为头寸价值从 \(t\) 到 \(t+\ell\) 的变化,\(L(\ell)\) 为相应损失函数(以美元计,取决于多头或空头,为 \(\Delta V(\ell)\) 的正或负函数),其 CDF 为 \(F_\ell(x)\)。持有期 \(\ell\)、尾部概率 \(p\) 的 VaR 定义为

\[p=\Pr[L(\ell)\ge\text{VaR}]=1-\Pr[L(\ell)<\text{VaR}].\tag{7.1}\]
即持有人在 \(\ell\) 期内遭受 ≥VaR 损失的概率为 \(p\);或以概率 \(1-p\) 损失小于 VaR。

分位数:对任意 CDF \(F_\ell\) 与 \(0<q<1\),\(x_q=\inf\{x|F_\ell(x)\ge q\}\) 为第 \(q\) 分位数;\(L\) 连续时 \(q=\Pr[L\le x_q]\)。所以 VaR 就是损失分布的 \((1-p)\) 分位数,\(\text{VaR}=x_{1-p}\),也称"上 \(p\) 分位数"。实际中 CDF 未知,VaR 研究本质上是估计损失分布(尤其上尾)及其分位数。

计算 VaR 涉及的因素:

  1. 关注的概率 \(p\):风险管理常用 \(p=0.01\),压力测试用 \(p=0.001\);
  2. 持有期 \(\ell\):监管可能设定,市场风险常用 1 天或 10 天,信用风险用 1 年或 5 年;
  3. 数据频率(可与 \(\ell\) 不同),市场风险常用日数据;
  4. CDF \(F_\ell(x)\) 或其分位数——计量建模的重点,不同估计方法形成不同 VaR 方法;
  5. 头寸金额或组合的盯市价值。

注 1(符号与单位):VaR 基于损失的上尾。多头在收益为负时亏损,故对多头用负收益分析。对数收益近似为百分比变化,由 \(r_{t+1}|F_t\) 的上分位数得到的 VaR 是百分比,美元 VaR = 头寸价值 × 对数收益 VaR;必要时也可用 \(\text{VaR}=\text{Value}\times[\exp(\text{对数收益 VaR})-1]\)。 注 2(预测分布):VaR 是对未来损失的预测,应使用未来收益的预测分布(例如用日收益算 1 天 VaR 应用 \(r_{t+1}|F_t\))。统计上预测分布应包含参数不确定性,但很难得到,大多数方法忽略参数不确定性。 注 3(VaR 的局限):VaR 只是一个分位数,不能完整描述上尾;两个资产可能 VaR 相同但超过 VaR 后的损失不同。VaR 不满足次可加性(sub-additivity)——合并后组合的风险度量应不大于合并前之和。因此后文讨论期望损失(expected shortfall, ES),又称条件风险价值(CVaR)。

7.2 RiskMetrics(PDF p.348–353)

J.P. Morgan 开发(Longerstaey & More 1995)。简单形式假设组合连续复利日收益条件正态:\(r_t|F_{t-1}\sim N(\mu_t,\sigma_t^2)\),且

\[\mu_t=0,\qquad\sigma_t^2=\alpha\sigma_{t-1}^2+(1-\alpha)r_{t-1}^2,\quad1>\alpha>0.\tag{7.2}\]
即对数价格 \(p_t-p_{t-1}=a_t\),\(a_t=\sigma_t\epsilon_t\) 为无漂移的 IGARCH(1,1)(等价于指数加权移动平均 EWMA)。\(\alpha\) 通常在 (0.9, 1),典型值 0.94。

多期收益分布:\(k\) 期对数收益 \(r_t[k]=r_{t+1}+\dots+r_{t+k}\)。在 (7.2) 下 \(r_t[k]|F_t\sim N(0,\sigma_t^2[k])\),\(\sigma_t^2[k]=\sum_{i=1}^k\text{Var}(a_{t+i}|F_t)\),\(\text{Var}(a_{t+i}|F_t)=E(\sigma_{t+i}^2|F_t)\)。把波动方程改写为

\[\sigma_t^2=\sigma_{t-1}^2+(1-\alpha)\sigma_{t-1}^2(\epsilon_{t-1}^2-1),\]
\(i\ge2\) 时 \(E(\epsilon_{t+i-1}^2-1|F_t)=0\),所以
\[E(\sigma_{t+i}^2|F_t)=E(\sigma_{t+i-1}^2|F_t),\quad i=2,\dots,k.\tag{7.3}\]
又 \(\sigma_{t+1}^2=\alpha\sigma_t^2+(1-\alpha)r_t^2\) 在 \(t\) 时已知,因此 \(\text{Var}(r_{t+i}|F_t)=\sigma_{t+1}^2\)(\(i\ge1\)),\(\sigma_t^2[k]=k\sigma_{t+1}^2\),\(r_t[k]|F_t\sim N(0,k\sigma_{t+1}^2)\)——条件方差与持有期成正比,条件标准差为 \(\sqrt k\sigma_{t+1}\)。

VaR:尾部概率 5% 时下一交易日 \(\text{VaR}=1.65\sigma_{t+1}\)(\(N(0,\sigma_{t+1}^2)\) 的 95% 分位),\(k\) 日 \(\text{VaR}[k]=1.65\sqrt k\sigma_{t+1}\);1% 时分别为 \(2.326\sigma_{t+1}\) 和 \(2.326\sqrt k\sigma_{t+1}\)。以美元计:\(\text{VaR}=\text{头寸}\times2.326\sigma_{t+1}\),\(\text{VaR}(k)=\text{头寸}\times2.326\sqrt k\sigma_{t+1}\),因此

\[\text{VaR}(k)=\sqrt k\times\text{VaR},\]
即 RiskMetrics 的时间平方根法则(square root of time rule)。若收益以百分比计,需除以 100。由于假定零均值正态,损失函数对称,多头与空头 VaR 相同。

例 7.1:1997 年 6 月马克/美元汇率连续复利日收益标准差约 0.53%,多头 1,000 万美元。5% 1 日 VaR = \(10{,}000{,}000\times1.65\times0.0053=\$87{,}450\);10 日 VaR \(\approx\$276{,}541\)(乘 \(\sqrt{10}\))。

例 7.2(IBM 日对数收益):样本均值实际显著非零,但为演示假设零均值、无漂移 IGARCH(1,1):

\[r_t=a_t,\quad a_t=\sigma_t\epsilon_t,\quad\sigma_t^2=0.9396\sigma_{t-1}^2+(1-0.9396)a_{t-1}^2.\tag{7.4}\]
模型被 Q 统计量拒绝(标准化残差平方 \(Q(10)=56.19\))。\(r_{9190}=-0.0128\),\(\hat\sigma^2_{9190}=0.0003472\),于是 \(\hat\sigma^2_{9190}(1)=0.000336\)。95% 分位 \(1.65\times\sqrt{0.000336}=0.03025\),1,000 万美元多头 1 日 5% VaR = $302,500;99% 分位 \(2.326\sqrt{0.000336}=0.04265\),1% VaR = $426,500。

注(S-Plus 实现):mgarch(ibm~-1, ~ewma1) 估计 \(1-\alpha\),得 ALPHA 0.036,即 \(\alpha=0.964\);predict(ibm.risk,2) 得 \(\hat\sigma_{9190}(1)=0.01888\),对应 VaR 为 $311,520(p=0.05)和 $439,187(p=0.01),略高于 RATS 估计的结果。

7.2.1 讨论

优点:简单、易理解、提高市场风险透明度。缺点:收益重尾,正态假设常导致低估 VaR。时间平方根法则只是该特殊模型的结果;零均值或特殊 IGARCH(1,1) 假设任何一条不成立,法则就失效。例:\(r_t=\mu+a_t\),\(\mu\ne0\)(NYSE 许多活跃股票成立),\(\sigma_t^2=\alpha\sigma_{t-1}^2+(1-\alpha)a_{t-1}^2\)。则 \(r_{t+1}|F_t\sim N(\mu,\sigma_{t+1}^2)\),1 期 95% 分位为 \(\mu+1.65\sigma_{t+1}\);\(r_t[k]|F_t\sim N(k\mu,k\sigma_{t+1}^2)\),95% 分位 \(k\mu+1.65\sqrt k\sigma_{t+1}=\sqrt k(\sqrt k\mu+1.65\sigma_{t+1})\),所以 \(\text{VaR}(k)\ne\sqrt k\,\text{VaR}\)。波动率模型不是无漂移 IGARCH(1,1) 时法则也失效。

7.2.2 多头寸

假设各头寸日对数收益都服从随机游走 IGARCH(1,1),还需要收益间的相关系数。两头寸:\(\rho_{12}=\text{Cov}(r_{1t},r_{2t})/[\text{Var}(r_{1t})\text{Var}(r_{2t})]^{0.5}\),

\[\text{VaR}=\sqrt{\text{VaR}_1^2+\text{VaR}_2^2+2\rho_{12}\text{VaR}_1\text{VaR}_2}.\]
\(m\) 个工具:
\[\text{VaR}=\sqrt{\sum_{i=1}^m\text{VaR}_i^2+2\sum_{i<j}\rho_{ij}\text{VaR}_i\text{VaR}_j}.\]
依据:各资产对数收益联合服从零均值多元正态(协方差 \(\Sigma_{t+1}\)),组合收益为零均值正态(见第 8 章附录 B)。(注:这里 VaR 带符号,空头头寸的 VaR 应取负号以反映对冲效果;公式只在正态零均值下精确。)

7.2.3 期望损失(Expected Shortfall)

VaR 可能低估实际损失,因此考虑超过 VaR 时损失的期望。RiskMetrics 下损失正态,超过 VaR 的条件分布是(下侧)截断正态。对 \(X\sim N(0,1)\),上尾概率 \(p\),\(q=1-p\),\(\text{VaR}_q\) 为 \(X\) 的 \(q\) 分位:

\[E(X|X>\text{VaR}_q)=\frac{f(\text{VaR}_q)}p,\quad f(x)=\frac1{\sqrt{2\pi}}e^{-x^2/2}.\]
对条件分布 \(N(0,\sigma_t^2)\) 的对数收益:
\[\text{ES}_q=\frac{f(\text{VaR}_q)}p\sigma_t\quad\text{或}\quad\text{ES}_{1-p}=\frac{f(\text{VaR}_{1-p})}p\sigma_t.\]
例:\(p=0.05\),\(\text{VaR}_{0.95}\approx1.645\),\(f(1.645)/0.05=2.0627\),\(\text{ES}_{0.95}=2.0627\sigma_t\);\(p=0.01\) 时 \(\text{ES}_{0.99}=2.6652\sigma_t\)。

7.3 VaR 计算的计量方法(Econometric Approach)(PDF p.353–358)

用第 2–4 章的时间序列模型:均值方程用 ARMA,波动率用 GARCH(也可用第 4 章非线性模型)。

\[r_t=\phi_0+\sum_{i=1}^p\phi_ir_{t-i}+a_t-\sum_{j=1}^q\theta_ja_{t-j},\tag{7.5}\]
\[a_t=\sigma_t\epsilon_t,\quad\sigma_t^2=\alpha_0+\sum_{i=1}^u\alpha_ia_{t-i}^2+\sum_{j=1}^v\beta_j\sigma_{t-j}^2.\tag{7.6}\]
参数已知时 1 步预测:
\[\hat r_t(1)=\phi_0+\sum_{i=1}^p\phi_ir_{t+1-i}-\sum_{j=1}^q\theta_ja_{t+1-j},\quad\hat\sigma_t^2(1)=\alpha_0+\sum_{i=1}^u\alpha_ia_{t+1-i}^2+\sum_{j=1}^v\beta_j\sigma_{t+1-j}^2.\]
若 \(\epsilon_t\) 正态,\(r_{t+1}|F_t\sim N[\hat r_t(1),\hat\sigma_t^2(1)]\),95% 分位为 \(\hat r_t(1)+1.65\hat\sigma_t(1)\)。若 \(\epsilon_t\) 为自由度 \(v\) 的标准化 Student-t,分位为 \(\hat r_t(1)+t_v^*(1-p)\hat\sigma_t(1)\)。 标准化与非标准化 t 分位的关系(\(v>2\)):
\[p=\Pr(t_v\le q)=\Pr\left(\frac{t_v}{\sqrt{v/(v-2)}}\le\frac q{\sqrt{v/(v-2)}}\right)=\Pr\left(t_v^*\le\frac q{\sqrt{v/(v-2)}}\right),\]
即 \(q/\sqrt{v/(v-2)}\) 是标准化 t 的 \(p\) 分位。因此 1 期 VaR 分位为
\[\hat r_t(1)+\frac{t_v(1-p)\hat\sigma_t(1)}{\sqrt{v/(v-2)}}.\]
常见误区:直接用 qt(0.99, v) 乘以 \(\hat\sigma\) 会高估分位(未除以标准差 \(\sqrt{v/(v-2)}\))。

例 7.3(IBM,1,000 万美元多头,\(t=9190\) 的 1 日 VaR):多头用 \(r_t=-r_t^c\)(负收益)。

  • 情形 1(正态):\(r_t=-0.00066-0.0247r_{t-2}+a_t\),\(\sigma_t^2=0.00000389+0.0799a_{t-1}^2+0.9073\sigma_{t-1}^2\)。\(r_{9189}=0.00201\),\(r_{9190}=0.0128\),\(\sigma^2_{9190}=0.00033455\);预测 \(\hat r_{9190}(1)=-0.00071\),\(\hat\sigma^2_{9190}(1)=0.0003211\)。95% 分位 \(-0.00071+1.6449\sqrt{0.0003211}=0.02877\),VaR = $287,700(正文另一处误写作 $287,200);99% 分位 \(-0.00071+2.3262\sqrt{0.0003211}=0.0409738\),VaR = $409,738。
  • 情形 2(标准化 \(t_5\)):\(r_t=-0.0003-0.0335r_{t-2}+a_t\),\(\sigma_t^2=0.000003+0.0559a_{t-1}^2+0.9350\sigma_{t-1}^2\)。\(\sigma^2_{9190}=0.000349\);预测 \(\hat r_{9190}(1)=-0.000367\),\(\hat\sigma^2_{9190}(1)=0.0003386\)。\(t_5\) 的 95% 分位 2.015,标准化后 \(2.015/\sqrt{5/3}=1.5608\);95% 分位 \(-0.000367+1.5608\sqrt{0.0003386}=0.028354\),VaR ≈ $283,520(与正态几乎相同)。99% 分位 \(-0.000367+(3.3649/\sqrt{5/3})\sqrt{0.0003386}=0.0475943\),VaR = $475,943。 结论:厚尾 t 分布在尾部概率越小时 VaR 越大(5% 时相近,1% 时明显更大)。R/S-Plus 用 qt(p, m) 求 t 分位,如 qt(0.99, 5.23)。

7.3.1 多期 VaR

预测原点 \(h\),\(k\) 期对数收益 \(r_h[k]=r_{h+1}+\dots+r_{h+k}\)。 期望收益与预测误差:\(\hat r_h[k]=r_h(1)+\dots+r_h(k)\)(ARMA 递推预测)。由 MA 表示 \(r_t=\mu+a_t+\psi_1a_{t-1}+\cdots\),\(e_h(\ell)=a_{h+\ell}+\psi_1a_{h+\ell-1}+\dots+\psi_{\ell-1}a_{h+1}\),

\[e_h[k]=e_h(1)+\dots+e_h(k)=a_{h+k}+(1+\psi_1)a_{h+k-1}+\dots+\left(\sum_{i=0}^{k-1}\psi_i\right)a_{h+1},\quad\psi_0=1.\tag{7.7}\]
期望波动率:\(\epsilon_{t+i}\) 独立,
\[V_h(e_h[k])=\sigma_h^2(k)+(1+\psi_1)^2\sigma_h^2(k-1)+\dots+\left(\sum_{i=0}^{k-1}\psi_i\right)^2\sigma_h^2(1),\tag{7.8}\]
\(\sigma_h^2(\ell)\) 为 \(\ell\) 步波动率预测,GARCH 下递推得到。 特例 \(r_t=\mu+a_t\),GARCH(1,1):\(\psi_i=0\),\(\hat r_h[k]=k\mu\),\(e_h[k]=\sum_{\ell=1}^ka_{h+\ell}\),\(\text{Var}(e_h[k]|F_h)=\sum_{\ell=1}^k\sigma_h^2(\ell)\),
\[\sigma_h^2(1)=\alpha_0+\alpha_1a_h^2+\beta_1\sigma_h^2,\quad\sigma_h^2(\ell)=\alpha_0+(\alpha_1+\beta_1)\sigma_h^2(\ell-1),\ \ell=2,\dots,k,\tag{7.9}\]
\[\text{Var}(e_h[k]|F_h)=\frac{\alpha_0}{1-\phi}\left(k-\frac{1-\phi^k}{1-\phi}\right)+\frac{1-\phi^k}{1-\phi}\sigma_h^2(1),\quad\phi=\alpha_1+\beta_1<1.\tag{7.10}\]
(推导:\(\sigma_h^2(\ell)=\frac{\alpha_0(1-\phi^{\ell-1})}{1-\phi}+\phi^{\ell-1}\sigma_h^2(1)\),对 \(\ell\) 求和。原书 (7.10) 括号内印作 \(k-1-\phi^k/(1-\phi)\),应为 \(k-(1-\phi^k)/(1-\phi)\)。)\(\psi_i\ne0\) 时用 (7.8)。正态时 \(r_h[k]|F_h\sim N(k\mu,\text{Var}(e_h[k]|F_h))\);非正态(t、GED)时用模拟得到多期 VaR。

例 7.3(续):高斯 AR(2)–GARCH(1,1),原点 9190(1998-12-31),15 日持有期:条件均值 −0.00998,条件方差 0.0047948(由 7.9 递推)。95% 分位 \(-0.00998+1.6449\sqrt{0.0047948}=0.1039191\),15 日 5% VaR = $1,039,191,小于 \(287,700\times\sqrt{15}=\$1,114,257\)——再次说明时间平方根法则只对特殊的白噪声 IGARCH(1,1) 成立(这里 GARCH 均值回复且 \(\sigma_h^2(1)\) 高于长期水平)。

7.3.2 条件正态下的期望损失

\(r_t|F_{t-1}\sim N(\mu_t,\sigma_t^2)\) 时

\[\text{ES}_q=\mu_t+\frac{f(x_q)}p\sigma_t,\quad q=1-p,\]
\(x_q\) 为标准正态 \(q\) 分位。例 \(p=0.01\):\(\text{ES}_{0.99}=\mu_t+2.6652\sigma_t\)。

7.4 分位数估计(Quantile Estimation)(PDF p.358–362)

非参数方法,不对组合收益分布做具体假设,只假设预测期内分布不变。两类:直接用经验分位数;用分位数回归。

7.4.1 分位数与次序统计量

样本 \(r_1,\dots,r_n\) 的次序统计量 \(r_{(1)}\le r_{(2)}\le\dots\le r_{(n)}\),\(r_{(1)}\) 为最小值、\(r_{(n)}\) 为最大值。

结果(Cox & Hinkley 1974 附录 2):收益 iid,连续分布,pdf \(f\)、CDF \(F\),\(x_p=F^{-1}(p)\),\(f(x_p)\ne0\),则 \(\ell=np\) 时

\[r_{(\ell)}\sim N\left[x_p,\ \frac{p(1-p)}{n[f(x_p)]^2}\right].\tag{7.11}\]
所以可用 \(r_{(\ell)}\) 估计 \(x_p\)。\(np\) 非整数时插值:设 \(\ell_1<np<\ell_2\) 为相邻整数,\(p_i=\ell_i/n\),
\[\hat x_p=\frac{p_2-p}{p_2-p_1}r_{(\ell_1)}+\frac{p-p_1}{p_2-p_1}r_{(\ell_2)}.\tag{7.12}\]
注意 (7.11) 说明当 \(p\) 很小、\(f(x_p)\) 很小(尾部)时方差很大,经验分位数在尾部不精确。

例 7.4(Intel 日对数收益,1972-12-15 至 2008-12-31,9,096 个观测):多头用负对数收益。\(9096\times0.95=8641.2\),\(\ell_1=8641\),\(\ell_2=8642\),\(\hat x_{0.95}=0.8r_{(8641)}+0.2r_{(8642)}=4.2952\%\)(\(r_{(8641)}=4.2951\%\),\(r_{(8642)}=4.2954\%\))。R:quantile(nintc, 0.95) 得 0.04295213;等价地 quantile(rtn, 0.05) 得 −0.04295213。

例 7.5(IBM,9,190 个观测):\(np=8730.5\),95% 经验分位 \((r_{(8730)}+r_{(8731)})/2=0.021603\)(即 2.16%),1,000 万美元多头 VaR = $216,030,远小于计量方法结果。\(9098<9190\times0.99<9099\),\(p_1=9098/9190=0.98999\)(原文误印 9198),\(p_2=9099/9190=0.9901\),

\[\hat x_{0.99}=\frac{0.0001}{0.00011}(3.627)+\frac{0.00001}{0.00011}(3.657)\approx3.630\ (\%),\]
1% 1 日 VaR = $363,000,同样低于其他方法。

讨论:优点——简单、无分布假设。缺点:(1) 假设收益分布从样本期到预测期不变,意味着预测损失不会超过历史损失,现实中显然不成立;(2) \(p\) 小时经验分位数不是理论分位数的有效估计;(3) 未考虑相关解释变量。实际中经验分位数 VaR 可作为真实 VaR 的下界。

经验 ES:\(\hat x_q\) 为经验 \(q\) 分位,

\[\text{ES}_q=\frac1{N_q}\sum_{i=1}^nx_{(i)}I[x_{(i)}>\hat x_q],\]
\(N_q\) 为超过 \(\hat x_q\) 的观测数。IBM 负收益(%),\(p=0.01\):\(\hat x_{0.99}=3.630\),\(\text{ES}_{0.99}=5.097\)。R:q99=quantile(nibm,0.99); idx=c(1:length(nibm))[nibm>q99]; es=mean(nibm[idx])。

7.4.2 分位数回归(Quantile Regression)

常有重要解释变量(如美联储利率行动影响美股收益),应考虑 \(r_{t+1}|F_t\) 的分位数,即回归分位数(Koenker & Bassett 1978)。先把经验分位数写成优化问题:

\[\hat x_p=\arg\min_\beta\sum_{i=1}^nw_p(r_i-\beta),\quad w_p(z)=\begin{cases}pz & z\ge0\\(p-1)z & z<0\end{cases}\]
(\(w_p\) 即"检验函数/弹球损失 check/pinball loss")。推广到线性回归
\[r_t=\boldsymbol\beta'\boldsymbol x_t+a_t,\tag{7.13}\]
\(\boldsymbol x_t\in F_{t-1}\)。给定 \(F_{t-1}\) 时 \(r_t\) 的条件分布是 \(a_t\) 分布的平移。Koenker–Bassett 估计
\[\hat x_p|F_{t-1}\equiv\inf\{\boldsymbol\beta_o'\boldsymbol x|R_p(\boldsymbol\beta_o)=\min\},\quad\boldsymbol\beta_o=\arg\min_{\boldsymbol\beta}\sum_{t=1}^nw_p(r_t-\boldsymbol\beta'\boldsymbol x_t).\tag{7.14}\]
程序见 Koenker & D'Orey (1987);R 包 quantreg。

7.5 极值理论(Extreme Value Theory)(PDF p.362–373)

记固定间隔收益 \(r_t\),\(n\) 个收益中最小 \(r_{(1)}=\min_j r_j\),最大 \(r_{(n)}=\max_j r_j\)。沿用文献和损失函数,聚焦最大值;最小值可通过变号得到:\(r_{(1)}=-\max_j\{-r_j\}=-r^c_{(n)}\),\(r_t^c=-r_t\)。多头关心最小收益,故对多头用负对数收益做 VaR。

7.5.1 极值理论回顾

设 \(r_t\) 序列独立、共同 CDF \(F(x)\),取值范围 \([l,u]\)(对数收益为 \((-\infty,\infty)\))。最大值的 CDF:

\[F_{n,n}(x)=\Pr[r_{(n)}\le x]=\prod_{j=1}^n\Pr(r_j\le x)=[F(x)]^n.\tag{7.15}\]
\(F\) 未知;且 \(n\to\infty\) 时 \(F_{n,n}\) 退化(\(x<u\) 时 →0,\(x\ge u\) 时 →1),无实用价值。EVT 寻找位置序列 \(\{\beta_n\}\) 与尺度序列 \(\{\alpha_n>0\}\),使 \(r_{(n*)}\equiv(r_{(n)}-\beta_n)/\alpha_n\) 收敛到非退化分布。独立假设下,规范化最大值的极限分布为
\[F_*(x)=\begin{cases}\exp[-(1+\xi x)^{-1/\xi}] & \xi\ne0\\ \exp[-\exp(-x)] & \xi=0\end{cases}\tag{7.16}\]
\(\xi<0\) 时 \(x<-1/\xi\),\(\xi>0\) 时 \(x>-1/\xi\);\(\xi=0\) 取 \(\xi\to0\) 的极限。\(\xi\) 为形状参数,控制尾部行为;\(\alpha=1/\xi\) 称尾指数(tail index)。(原文写"normalized minimum",应为 maximum。)这是 Jenkinson (1955) 的广义极值分布(GEV),涵盖 Gnedenko (1943) 的三类极限分布:

  • I 型,\(\xi=0\),Gumbel 族:\(F_*(x)=\exp[-\exp(-x)]\),\(-\infty<x<\infty\)(7.17);
  • II 型,\(\xi>0\),Fréchet 族:\(F_*(x)=\exp[-(1+\xi x)^{-1/\xi}]\)(\(x>-1/\xi\)),否则 0(7.18);
  • III 型,\(\xi<0\),Weibull 族:\(F_*(x)=\exp[-(1+\xi x)^{-1/\xi}]\)(\(x<-1/\xi\)),否则 1。 图 7.2:Gumbel(实线)、Weibull(\(\xi=-0.5\),点线)、Fréchet(\(\xi=0.9\),虚线)的密度。

Gnedenko 给出 \(F\) 属于哪一类的充要条件:大致说,\(F\) 的尾部行为决定极限分布——右尾指数衰减对应 Gumbel,幂函数衰减对应 Fréchet,有限右端点对应 Weibull。全面论述见 Embrechts, Klüppelberg & Mikosch (1997)。风险管理主要关心 Fréchet 族(包含稳定分布、Student-t);Gumbel 族包含正态、对数正态等薄尾分布。

GEV 密度:

\[f_*(x)=\begin{cases}(1+\xi x)^{-1/\xi-1}\exp[-(1+\xi x)^{-1/\xi}] & \xi\ne0\\ \exp[-x-\exp(-x)] & \xi=0\end{cases}\tag{7.19}\]

两个重要含义:(1) 决定规范化最大值极限分布的是 \(F\) 的尾部行为而非具体分布,所以理论适用于很广的收益分布;但 \(\{\beta_n\},\{\alpha_n\}\) 依赖 \(F\)。(2) Feller (1971, p.279):尾指数 \(\xi\) 不依赖 \(r_t\) 的时间间隔,即在时间聚合下不变——这对 VaR 计算很方便。

弱相依推广:Berman (1964):对平稳正态序列,若 ACF 平方可和(\(\sum\rho_i^2<\infty\)),同样的极限分布成立。更多见 Leadbetter, Lindgren & Rootzén (1983, 第 3 章);7.8 节讨论严平稳序列的极值指数(extremal index)。

7.5.2 经验估计

GEV 有三个参数:形状 \(\xi\)、位置 \(\beta_n\)、尺度 \(\alpha_n\),可用参数或非参数方法估计。

分块(子样本)思路:一个样本只有一个最大值,无法估计三个参数。把 \(T=ng\) 个收益分为 \(g\) 个不重叠子样本,每个 \(n\) 个观测:\(\{r_1,\dots,r_n|r_{n+1},\dots,r_{2n}|\cdots|r_{(g-1)n+1},\dots,r_{ng}\}\),每个子样本对应一个子时期。\(n\) 足够大时希望 EVT 适用于每个子样本。\(n\) 的选择可依实际考虑:日数据 \(n=21\) 约一个月,\(n=63\) 约一个季度。子样本最大值

\[r_{n,i}=\max_{1\le j\le n}\{r_{(i-1)n+j}\},\quad i=1,\dots,g,\tag{7.20}\]
\(x_{n,i}=(r_{n,i}-\beta_n)/\alpha_n\) 近似服从 GEV,\(\{r_{n,i}\}\) 视为来自 GEV 的 \(g\) 个观测。估计结果可能依赖 \(n\)。 注:\(T\) 不是 \(n\) 的倍数时,可让最后一个子样本较小,或丢弃最初几个观测。

参数方法一:极大似然。\(r_{n,i}\) 的密度(变换自 7.19):

\[f(r_{n,i})=\begin{cases}\frac1{\alpha_n}\left[1+\frac{\xi_n(r_{n,i}-\beta_n)}{\alpha_n}\right]^{-(1+\xi_n)/\xi_n}\exp\left\{-\left[1+\frac{\xi_n(r_{n,i}-\beta_n)}{\alpha_n}\right]^{-1/\xi_n}\right\} & \xi_n\ne0\\ \frac1{\alpha_n}\exp\left[-\frac{r_{n,i}-\beta_n}{\alpha_n}-\exp\left(-\frac{r_{n,i}-\beta_n}{\alpha_n}\right)\right] & \xi_n=0\end{cases}\]
(\(\xi_n\ne0\) 时要求 \(1+\xi_n(r_{n,i}-\beta_n)/\alpha_n>0\);下标 \(n\) 强调估计依赖 \(n\)。)独立下似然 \(\ell=\prod_{i=1}^gf(r_{n,i})\),用非线性优化求 MLE;在适当假设下 MLE 渐近无偏、正态、方差最小(Embrechts et al. 1997;Coles 2001)。

参数方法二:回归法(Gumbel 1958):设 \(\{r_{n,i}\}\) 为 GEV 随机样本,次序统计量 \(r_{n(1)}\le\dots\le r_{n(g)}\),由次序统计量性质(Cox & Hinkley 1974, p.467)

\[E\{F_*[r_{n(i)}]\}=\frac i{g+1},\quad i=1,\dots,g.\tag{7.21}\]
\(\xi\ne0\) 时 \(F_*[r_{n(i)}]=\exp\{-[1+\xi_n(r_{n(i)}-\beta_n)/\alpha_n]^{-1/\xi_n}\}\)(7.22)。以观测值近似期望,取两次对数:
\[\ln\left[-\ln\left(\frac i{g+1}\right)\right]=-\frac1{\xi_n}\ln\left[1+\xi_n\frac{r_{n(i)}-\beta_n}{\alpha_n}\right]+e_i,\tag{7.23}\]
假设 \(e_i\) 无序列相关,最小化 \(\sum e_i^2\) 得 LS 估计。\(\xi_n=0\) 时 \(\ln[-\ln(i/(g+1))]=-\frac{r_{n(i)}}{\alpha_n}+\frac{\beta_n}{\alpha_n}+e_i\)(线性回归)。LS 估计相合但不如 MLE 有效,本章用 MLE。

非参数方法:直接作用于全部收益 \(\{r_t\}_{t=1}^T\),无需分块。次序统计量 \(r_{(1)}\le\dots\le r_{(T)}\),正整数 \(q\):

  • Pickands 估计:
    \[\xi_p(q)=\frac1{\ln2}\ln\left(\frac{r_{(T-q+1)}-r_{(T-2q+1)}}{r_{(T-2q+1)}-r_{(T-4q+1)}}\right),\quad q\le T/4,\tag{7.24}\]
  • Hill 估计:
    \[\xi_h(q)=\frac1q\sum_{i=1}^q\left[\ln r_{(T-i+1)}-\ln r_{(T-q)}\right].\tag{7.25}\]
    \(q\) 的选择无共识。Dekkers & de Haan (1989):\(q\) 随 \(T\) 以适当速度增大时 \(\xi_p(q)\) 相合,\(\sqrt q[\xi_p(q)-\xi]\) 渐近正态,均值 0,方差 \(\xi^2(2^{2\xi+1}+1)/[2(2^\xi-1)\ln2]^2\)。Hill 估计只适用于 Fréchet(\(\xi>0\)),但适用时比 Pickands 更有效;Goldie & Smith (1987):\(\sqrt q[\xi_h(q)-\xi]\) 渐近 \(N(0,\xi^2)\)。实践中画 \(\xi_h(q)\) 对 \(q\) 的图(Hill plot),选估计稳定的 \(q\);尾指数 \(\alpha=1/\xi_h(q)\) 可用于求极端分位数(Zivot & Wang 2003)。

7.5.3 在股票收益上的应用(PDF p.368–373)

IBM 日对数收益(%),1962-07-03 至 1998-12-31,\(T=9190\)。图 7.3:子期长度 21 天时的子期最大/最小日收益,1987 年 10 月股灾非常醒目;除此之外极端日收益在 0.5%–13% 之间。

Hill 估计(表 7.1,括号为标准误):

q 190 200 210
\(r_t\)(右尾) 0.300 (0.022) 0.299 (0.021) 0.305 (0.021)
\(-r_t\)(左尾) 0.290 (0.021) 0.292 (0.021) 0.289 (0.020)

图 7.4(Hill plot 及逐点 95% 置信区间):除 \(q\) 很小外估计稳定,形状参数约 0.30,在渐近 5% 水平显著异于 0;图中负极值的 \(\xi\) 似乎更大,提示左尾更重。结论:IBM 日对数收益属于 Fréchet 族,拒绝常用的正态假设,与 Longin (1996) 对美国股指的结论一致。

GEV 极大似然(表 7.2,括号为标准误):

子期长度 尺度 \(\alpha_n\) 位置 \(\beta_n\) 形状 \(\xi_n\)
最小收益(取负)
1 个月(n=21, g=437) 0.823 (0.035) 1.902 (0.044) 0.197 (0.036)
1 季(n=63, g=145) 0.945 (0.077) 2.583 (0.090) 0.335 (0.076)
6 个月(n=126, g=72) 1.147 (0.131) 3.141 (0.153) 0.330 (0.101)
1 年(n=252, g=36) 1.542 (0.242) 3.761 (0.285) 0.322 (0.127)
最大收益
1 个月 0.931 (0.039) 2.184 (0.050) 0.168 (0.036)
1 季 1.157 (0.087) 3.012 (0.108) 0.217 (0.066)
6 个月 1.292 (0.158) 3.471 (0.181) 0.349 (0.130)
1 年 1.624 (0.271) 4.475 (0.325) 0.264 (0.186)

观察:(1) 位置和尺度估计随 \(n\) 增大(子期极值是 \(n\) 的非减函数);(2) 负极值的形状参数在 \(n\ge63\) 时稳定,约 0.33;(3) 正极值的形状参数较不稳定、较小,但仍显著异于 0;(4) \(n=252\) 时 \(g\) 小,估计变异大。与 Longin (1996) 结论相似。

表 7.2 用 Richard Smith 编、作者修改的 Fortran 程序;R 包 evir 可做类似估计(S-Plus 也基于 evir)。evir 用子组最大值,故多头用负对数收益;xi, sigma, mu 对应 \((\xi_n,\alpha_n,\beta_n)\);结果与表 7.2 接近,差异来自表 7.2 在 \(T\) 非 \(n\) 倍数时删除开头几个观测,R 多一个子组。

R 演示:hill(ibm, option="xi", end=500) 画 Hill 图;自编 Hill(x,q):排序后取最大的 \(q+1\) 个值的对数,\(\hat\xi=\frac1q\sum_{i=1}^q\ln x_{(T-i+1)}-\ln x_{(T-q)}\),标准误 \(\hat\xi/\sqrt q\);Hill(ibm,190) 得 0.3000 (0.0218),Hill(nibm,190) 得 0.2904 (0.0211)。gev(nibm, block=21):438 个块,\(\hat\xi=0.1955\) (0.0355),\(\hat\sigma=0.8240\) (0.0348),\(\hat\mu=1.9034\) (0.0441),并给出协方差矩阵。

GEV 拟合诊断:定义残差

\[w_i=\left(1+\xi_n\frac{r_{n,i}-\beta_n}{\alpha_n}\right)^{-1/\xi_n},\]
模型正确时 \(\{w_i\}\) 应为 iid 指数分布(由概率积分变换可证)。图 7.5:\(n=21\) 时残差散点图与对指数分布的 QQ 图,拟合合理。其他 R 包:evd、POT、extRemes。

7.6 基于极值理论的 VaR(Extreme Value Approach to VaR)(PDF p.373–379)

方法类似 Longin (1999a,b) 的八步程序,分两部分。

第一部分(参数与子期极值分位数):样本 \(T\) 个观测分为 \(g\) 个长度 \(n\) 的子期(若 \(T=ng+m\),删除前 \(m\) 个)。用 MLE 估计 \(\beta_n,\alpha_n,\xi_n\)。设 \(p^*\) 为小的上尾概率,\(r_n^*\) 为子期最大值在 GEV 下的 \((1-p^*)\) 分位:

\[1-p^*=\exp\left\{-\left[1+\frac{\xi_n(r_n^*-\beta_n)}{\alpha_n}\right]^{-1/\xi_n}\right\}\ (\xi_n\ne0)\quad\text{或}\quad\exp\left[-\exp\left(-\frac{r_n^*-\beta_n}{\alpha_n}\right)\right]\ (\xi_n=0),\]
取对数后解得
\[r_n^*=\begin{cases}\beta_n-\dfrac{\alpha_n}{\xi_n}\left\{1-[-\ln(1-p^*)]^{-\xi_n}\right\} & \xi_n\ne0\\ \beta_n-\alpha_n\ln[-\ln(1-p^*)] & \xi_n=0\end{cases}\tag{7.26}\]
金融应用主要关心 \(\xi_n\ne0\)。

第二部分(从子期最大值回到日收益):收益序列不相关或弱相关,利用 (7.15):

\[1-p^*=P(r_{n,i}\le r_n^*)=[P(r_t\le r_n^*)]^n.\tag{7.27}\]
对指定的小上尾概率 \(p\),令 \(P(r_t\le r_n^*)=1-p\),即 \(1-p^*=(1-p)^n\),于是 \(-\ln(1-p^*)=-n\ln(1-p)\),得
\[\text{VaR}=\begin{cases}\beta_n-\dfrac{\alpha_n}{\xi_n}\left\{1-[-n\ln(1-p)]^{-\xi_n}\right\} & \xi_n\ne0\\ \beta_n-\alpha_n\ln[-n\ln(1-p)] & \xi_n=0\end{cases}\tag{7.28}\]

步骤总结:

  1. 选子期长度 \(n\),取子期最大值 \(\{r_{n,i}\}\),\(g=[T/n]\);
  2. MLE 估计 \(\beta_n,\alpha_n,\xi_n\);
  3. 检验拟合的极值模型(方法见下节);
  4. 模型充分时用 (7.28) 计算 VaR。 注:推导针对损失函数,用对数收益的最大值;多头所用损失序列是负对数收益。

例 7.6(IBM 日对数收益,%):\(n=63\):\(\hat\alpha_n=0.945\),\(\hat\beta_n=2.583\),\(\hat\xi_n=0.335\),\(p=0.01\):

\[\text{VaR}=2.583-\frac{0.945}{0.335}\{1-[-63\ln(0.99)]^{-0.335}\}=3.04969,\]
1,000 万美元多头 1% VaR = $304,969;\(p=0.05\) 时为 $166,641。 \(n=21\):\(\hat\alpha_n=0.823\),\(\hat\beta_n=1.902\),\(\hat\xi_n=0.197\):\(\text{VaR}=1.902-\frac{0.823}{0.197}\{1-[-21\ln(0.99)]^{-0.197}\}=3.40013\),即 $340,013(1%),$184,127(5%)。本例 \(n=21\) 给出更高的 VaR。

意外之处:EVT 的 VaR 比例 7.3 的 GARCH 还小,甚至小于例 7.5 的经验分位数。部分原因在于概率取 5%;若取 0.1%,高斯 AR(2)–GARCH(1,1) 的 VaR 为 $546,641,EVT(\(n=21\))为 $666,590。此外,传统 EVT 假设日收益独立(常被检验拒绝),且子期最大值忽略了波动聚集——下一节的新方法克服这些缺点。 注:传统 EVT 的 VaR 依赖 \(n\):极限分布成立需要大 \(n\),但 \(T\) 固定时大 \(n\) 意味着小 \(g\)(估计三参数的有效样本量),需要折中;建议检验所得 VaR 的稳定性。

7.6.1 讨论:各方法比较(IBM,1,000 万美元多头,下一交易日)

方法 p=5% p=1% p=0.1%
RiskMetrics 302,500 426,500 566,443
高斯 AR(2)–GARCH(1,1) 287,200 409,738 546,641
标准化 \(t_5\) AR(2)–GARCH(1,1) 283,520 475,943 836,341
经验分位数 216,030 365,709 780,712
传统 EVT(n=21,月度极值) 184,127 340,013 666,590

(1% 经验分位数 VaR 在例 7.5 正文为 $363,000,此处列为 $365,709,原书前后不一致。)

结论:

  • 不同方法差异很大,因为估计分布尾部本身有很大不确定性;没有"真实 VaR"可比较,建议同时用多种方法了解 VaR 的范围。
  • 尾部概率的选择很重要。IBM 样本 9,190 个,5% 和 1% 的经验分位数是不错的估计,可视为真实 VaR 的保守估计(下界);照此看传统 EVT 低估了 IBM 的 VaR,下一节的条件 EVT 方法克服这一点。
  • 尾部概率很小(0.1%)时经验分位数不可靠,不能再作下界。
  • 尾部概率小时重尾分布的效果明显:0.1% 时 \(t_5\) 和 EVT 的 VaR 都大于正态假设的结果。

7.6.2 多期 VaR

在 EVT 下,RiskMetrics 的时间平方根法则成为特例。\(\ell\) 日与 1 日 VaR 的正确关系(Danielsson & de Vries 1997a):

\[\text{VaR}(\ell)=\ell^{1/\alpha}\text{VaR}=\ell^{\xi}\text{VaR},\]
\(\alpha=1/\xi\) 为尾指数(不是尺度参数 \(\alpha_n\)),称α 次根时间法则(α-root of time rule)。例:IBM,\(p=0.01\),\(n=63\),30 日:\(\text{VaR}(30)=30^{0.335}\times\$304{,}969=3.125\times\$304{,}969=\$952{,}997\)。由于 \(\ell^{0.335}<\ell^{0.5}\),α 次根法则给出的多期 VaR 低于平方根法则。

7.6.3 回报水平(Return Level)

基于子期极值的另一风险度量。\(g\) 个 \(n\)-子期回报水平 \(L_{n,g}\):每 \(g\) 个长度 \(n\) 的子期中被超过一次的水平,

\[P(r_{n,i}>L_{n,g})=\frac1g,\]
被超过的子期称压力期(stress period)。\(n\) 足够大使规范化 \(r_{n,i}\) 服从 GEV 时(\(\xi_n\ne0\))
\[L_{n,g}=\beta_n-\frac{\alpha_n}{\xi_n}\left\{1-\left[-\ln\left(1-\frac1g\right)\right]^{-\xi_n}\right\},\]
正是 (7.26) 中 \(p^*=1/g\) 的分位数。回报水平针对子期最大值而非原收益——这是它与 VaR 的区别。IBM 负日对数收益,子期 21 天,\(g=12\)(约一年一遇的月度最大损失):回报水平 4.4835%。命令:S-Plus rlevel.gev(m1, k.blocks=12, type='profile') 得 4.483506(type='profile' 画剖面似然置信区间);R rlevel.gev(m1,k.blocks=12) 输出 4.177923, 4.481976, 4.858102(置信区间下限、估计、上限)。

7.7 基于极值理论的新方法(POT)(PDF p.379–397)

传统方法的困难:子期长度 \(n\) 定义不清;是无条件方法,不考虑解释变量。新方法(Davison & Smith 1990;Smith 1989)不关注极大/极小值,而关注观测值超过某个高阈值的超出量(exceedance)及其发生时间,称超阈值峰值法(peaks over thresholds, POT)。

以 IBM 多头为例:\(r_t\) 记负日对数收益,预设高阈值 \(\eta\)(如 2.5%);第 \(i\) 次超越发生在 \(t_i\)(原文写 \(r_{t_i}\le\eta\),对负收益序列应为 \(r_{t_i}>\eta\)),关注数据 \((t_i,r_{t_i}-\eta)\)。空头可取 \(\eta=2\%\),看正收益超过 \(\eta\) 的情形。发生时间 \(\{t_i\}\) 反映"稀有事件"的强度,\(t_i\) 成簇说明市场大幅下跌期;超出量 \(r_{t_i}-\eta\) 是实际关心的数量。

新方法不需选 \(n\),但需选 \(\eta\);不同 \(\eta\) 给出不同形状参数估计。有学者认为 \(\eta\) 的选择既是统计问题也是金融问题(不同机构风险容忍度不同,同一头寸也可能选不同阈值)。IBM 的 VaR 对 \(\eta\) 不敏感。\(\eta\) 也取决于收益序列:平稳序列多头用 2.5% 可能就行;高波动序列(如互联网股日收益)可能高达 10%。经验上让超越数足够多(约样本的 5%);正式研究见 Danielsson & de Vries (1997b)。

7.7.1 统计理论

关注超出量和超越时间带来统计思维的根本变化:不用边际分布(极大/极小值的极限分布),而用给定超过阈值时超出量的条件分布,超越事件的发生服从点过程(如泊松过程,见 6.9 节;强度 \(\lambda\) 不随时间变化为齐次,否则非齐次;可推广到多元)。

基于 (7.16) 的极限分布,考虑 \(r=x+\eta\) 给定 \(r>\eta\) 的条件分布(不再需要下标 \(n\)):

\[\Pr(r\le x+\eta|r>\eta)=\frac{\Pr(\eta\le r\le x+\eta)}{\Pr(r>\eta)}=\frac{\Pr(r\le x+\eta)-\Pr(r\le\eta)}{1-\Pr(r\le\eta)}.\tag{7.29}\]
代入 \(F_*\) 并用 \(e^{-y}\approx1-y\):
\[\Pr(r\le x+\eta|r>\eta)=\frac{F_*(x+\eta)-F_*(\eta)}{1-F_*(\eta)}\approx1-\left[1+\frac{\xi x}{\alpha+\xi(\eta-\beta)}\right]^{-1/\xi},\tag{7.30}\]
\(x>0\),\(1+\xi(\eta-\beta)/\alpha>0\);\(\xi=0\) 时取极限 \(\approx1-\exp(-x/\alpha)\)。这一近似明确了新旧方法的联系。

广义帕累托分布(GPD):

\[G_{\xi,\psi(\eta)}(x)=\begin{cases}1-\left[1+\dfrac{\xi x}{\psi(\eta)}\right]^{-1/\xi} & \xi\ne0\\ 1-\exp[-x/\psi(\eta)] & \xi=0\end{cases}\tag{7.31}\]
\(\psi(\eta)>0\);\(\xi\ge0\) 时 \(x\ge0\),\(\xi<0\) 时 \(0\le x\le-\psi(\eta)/\xi\)。所以给定 \(r>\eta\) 的超出量近似服从参数 \(\xi\)、\(\psi(\eta)=\alpha+\xi(\eta-\beta)\) 的 GPD(Embrechts et al. 1997)。 重要性质(阈值稳定性):若阈值 \(\eta_o\) 上的超出分布是 \(\text{GPD}(\xi,\psi(\eta_o))\),则对任何 \(\eta>\eta_o\),超出分布仍是 GPD,形状 \(\xi\) 不变,尺度 \(\psi(\eta)=\psi(\eta_o)+\xi(\eta-\eta_o)\)。 \(\xi=0\) 时 GPD 退化为指数分布,因此可画超出量对指数分布的 QQ 图判断尾部:\(\xi=0\) 时应为直线。图 7.6(a):IBM 负日对数收益、阈值 0.025 的 QQ 图明显非线性,说明左尾比正态更重(\(\xi\ne0\))。命令:qplot(-ibm, threshold=0.025)、meplot(-ibm)。

7.7.2 平均超出函数(Mean Excess Function)

阈值 \(\eta_o\) 上超出量服从 \(\text{GPD}(\xi,\psi(\eta_o))\),\(0<\xi<1\),则平均超出

\[E(r-\eta_o|r>\eta_o)=\frac{\psi(\eta_o)}{1-\xi}.\]
对 \(\eta>\eta_o\),平均超出函数
\[e(\eta)=E(r-\eta|r>\eta)=\frac{\psi(\eta_o)+\xi(\eta-\eta_o)}{1-\xi},\]
即 \(e(\eta_o+y)=\frac{\psi(\eta_o)+\xi y}{1-\xi}\),对固定 \(\xi\) 是 \(y=\eta-\eta_o\) 的线性函数(斜率 \(\xi/(1-\xi)\))。由此得到选择阈值的图形方法。经验平均超出函数
\[e_T(\eta)=\frac1{N_\eta}\sum_{i=1}^{N_\eta}(r_{t_i}-\eta),\tag{7.32}\]
\(N_\eta\) 为超过 \(\eta\) 的收益个数。\(e_T(\eta)\) 对 \(\eta\) 的散点图称平均超出图(mean excess plot)或平均剩余寿命图(mean residual life plot);在 GPD 下对 \(\eta>\eta_o\) 应近似线性。图 7.6(b):IBM 负收益约 3% 的阈值是合理的。evir 命令 meplot。

7.7.3 极值建模的新方法:二维泊松过程

Smith (1989) 提出用二维泊松过程联合建模 \((t_i,r_{t_i})\);Tsay (1999) 用于 VaR。基准时间区间 \(D\)(通常 1 年,美国用 \(D=252\) 个交易日);数据 \(t=1,\dots,T\);给定阈值 \(\eta\),超越时间 \(\{t_i,i=1,\dots,N_\eta\}\),对应收益 \(r_{t_i}\)。假设 \((t_i,r_{t_i})\) 构成二维泊松过程,强度测度

\[\Lambda[(D_2,D_1)\times(r,\infty)]=\frac{D_2-D_1}DS(r;\xi,\alpha,\beta),\quad S(r;\xi,\alpha,\beta)=\left[1+\frac{\xi(r-\beta)}\alpha\right]_+^{-1/\xi},\tag{7.33}\]
\(0\le D_1\le D_2\le T\),\(r>\eta\),\(\alpha>0\),\([x]_+=\max(x,0)\)。含义:超越发生次数与时间区间长度成正比,概率由类似 \(F_*\) 指数部分的生存函数控制(生存函数 \(S(x)=\Pr(X>x)\))。\(\xi=0\) 时取极限 \(\frac{D_2-D_1}D\exp[-(r-\beta)/\alpha]\)。时间长度相对于基准 \(D\) 计量。

与条件分布的联系:在 \([0,D]\) 上,

\[\frac{\Lambda[(0,D)\times(x+\eta,\infty)]}{\Lambda[(0,D)\times(\eta,\infty)]}=\left[\frac{1+\xi(x+\eta-\beta)/\alpha}{1+\xi(\eta-\beta)/\alpha}\right]^{-1/\xi}=\left[1+\frac{\xi x}{\alpha+\xi(\eta-\beta)}\right]^{-1/\xi},\]
正是 (7.30) 条件分布的生存函数;因此新方法与传统 EVT 直接相连,参数含义相同。

强度函数:\(\Lambda[(D_2,D_1)\times(r,\infty)]=\int_{D_1}^{D_2}\int_r^\infty\lambda(t,z;\xi,\alpha,\beta)dzdt\),

\[\lambda(t,z;\xi,\alpha,\beta)=\frac1Dg(z;\xi,\alpha,\beta),\quad g=\begin{cases}\frac1\alpha\left[1+\frac{\xi(z-\beta)}\alpha\right]^{-(1+\xi)/\xi} & \xi\ne0\\ \frac1\alpha\exp\left[-\frac{z-\beta}\alpha\right] & \xi=0\end{cases}\tag{7.34}\]
似然(二维空间 \([0,T]\times(\eta,\infty)\) 上的泊松过程):
\[L(\xi,\alpha,\beta)=\left[\prod_{i=1}^{N_\eta}\frac1Dg(r_{t_i};\xi,\alpha,\beta)\right]\exp\left[-\frac TDS(\eta;\xi,\alpha,\beta)\right].\tag{7.35}\]
最大化对数似然估计参数;因 \(\alpha\ge0\),估计时用 \(\ln\alpha\)。

例 7.7(IBM 负日对数收益,%,\(D=252\))(表 7.3,括号为标准误):

阈值 超越数 \(\xi\) \(\ln\alpha\) \(\beta\)
原始对数收益
3.0% 175 0.30697 (0.09015) 0.30699 (0.12380) 4.69204 (0.19058)
2.5% 310 0.26418 (0.06501) 0.31529 (0.11277) 4.74062 (0.18041)
2.0% 554 0.18751 (0.04394) 0.27655 (0.09867) 4.81003 (0.17209)
去除样本均值
3.0% 184 0.30516 (0.08824) 0.30807 (0.12395) 4.73804 (0.19151)
2.5% 334 0.28179 (0.06737) 0.31968 (0.12065) 4.76808 (0.18533)
2.0% 590 0.19260 (0.04357) 0.27917 (0.09913) 4.84859 (0.17255)

IBM 一天下跌 ≥2.5% 的概率约 310/9190 ≈ 3.4%。去除样本均值对估计影响很小。实际应用中需仔细检验泊松模型的充分性(下一节)。

7.7.4 基于新方法的 VaR

由于二维泊松模型与 GEV 参数相同,VaR 公式与 (7.28) 同形,只是用基准区间 \(D\) 代替 \(n\):

\[\text{VaR}=\begin{cases}\beta-\dfrac\alpha\xi\left\{1-[-D\ln(1-p)]^{-\xi}\right\} & \xi\ne0\\ \beta-\alpha\ln[-D\ln(1-p)] & \xi=0\end{cases}\tag{7.36}\]

例 7.8(IBM 1,000 万美元多头,1 日 VaR):

  • 情形 I(原始收益):\(\eta=3.0\%\):VaR(5%)=$228,239,VaR(1%)=$359,303;\(\eta=2.5\%\):$219,106,$361,119;\(\eta=2.0\%\):$212,981,$368,552。
  • 情形 II(去均值):\(\eta=3.0\%\):$232,094,$363,697;\(\eta=2.5\%\):$225,782,$364,254;\(\eta=2.0\%\):$217,740,$372,372。 去除(正的)样本均值略微提高 VaR;三个阈值下 VaR 相当稳定。建议先去均值再用新方法。 讨论:与例 7.6 的传统 EVT 相比,新方法 VaR 更稳定;传统方法对 \(n\) 很敏感。

R 演示(pot):m3=pot(nibm, 0.025):\(n=9190\),超越 310 次,低于阈值比例 0.9662677;par.ests:xi=0.264078835,sigma=0.003182365,mu=0.007557534,beta=0.007788551(beta 即 GPD 尺度 \(\psi(\eta)\));intensity=0.03373599(超越阈值的强度)。plot(m3) 提供超越点过程、间隔(gaps)散点图/QQ 图/ACF、残差散点图/QQ 图/ACF、GPD 图等诊断。riskmeasures(m3, c(0.95,0.99,0.999)):

p 分位数(VaR) 期望损失(sfall)
0.950 0.02208860 0.03162728
0.990 0.03616686 0.05075740
0.999 0.07019419 0.09699513

7.7.5 另一种参数化

给定阈值 \(\eta\),GPD 也可用形状 \(\xi\) 和尺度 \(\psi(\eta)=\alpha+\xi(\eta-\beta)\) 参数化——evir 采用这种,R/S-Plus 中 (xi, beta) 对应 \([\xi,\psi(\eta)]\),命令 gpd。IBM 负日对数收益:gpd(nibm, threshold=0.025):超越 310 个,方法 "ml",\(\hat\xi=0.264184649\) (0.0662),\(\hat\beta=0.007786063\) (0.000643)。与表 7.3 一致:表中 \(\hat\xi=0.26418\),\(\hat\psi(\eta)=\exp(0.31529)+0.26418\times(2.5-4.7406)=0.77873\)(%),换算成对数收益为 0.007787。plot(mgpd) 提供超出分布、原分布尾部、残差散点图、残差 QQ 图(图 7.7)。

图 7.7:GPD 拟合 IBM 负日对数收益的诊断图;QQ 图(右下)与对数尺度尾部概率估计(左下)与直线有轻微偏离,说明仍可改进。

基于 GPD 的尾部分位数(R/S-Plus 采用的方法):由 (7.29)–(7.31),\(\frac{F(y)-F(\eta)}{1-F(\eta)}\approx G_{\xi,\psi(\eta)}(x)\),\(y=x+\eta\)。用经验 CDF 估计 \(\hat F(\eta)=(T-N_\eta)/T\),则

\[F(y)=F(\eta)+G(x)[1-F(\eta)]\approx1-\frac{N_\eta}T\left[1+\frac{\xi(y-\eta)}{\psi(\eta)}\right]^{-1/\xi}.\]
对小上尾概率 \(p\)、\(q=1-p\),解出
\[\text{VaR}_q=\eta-\frac{\psi(\eta)}\xi\left\{1-\left[\frac T{N_\eta}(1-q)\right]^{-\xi}\right\}.\tag{7.37}\]

GPD 下的期望损失:

\[\text{ES}_q=E(r|r>\text{VaR}_q)=\text{VaR}_q+E(r-\text{VaR}_q|r>\text{VaR}_q),\tag{7.38}\]
由 GPD 阈值稳定性与平均超出函数,\(0<\xi<1\) 时 \(E(r-\text{VaR}_q|r>\text{VaR}_q)=\frac{\psi(\eta)+\xi(\text{VaR}_q-\eta)}{1-\xi}\),所以
\[\text{ES}_q=\frac{\text{VaR}_q}{1-\xi}+\frac{\psi(\eta)-\xi\eta}{1-\xi}.\]
IBM 负收益、阈值 2.5%:riskmeasures(mgpd, c(0.95,0.99,0.999)) 得分位数 0.02208959、0.03616405、0.07018944,ES 为 0.03162619、0.05075390、0.09699565。1,000 万美元头寸:VaR 为 $220,889(5%)和 $361,661(1%),与例 7.8 接近;ES 为 $316,272 和 $507,576。

7.7.6 使用解释变量(PDF p.391–392)

上面的二维泊松模型参数不随时间变化(齐次),可能不充分;而且常有影响 \(r_t\) 的解释变量。新 EVT 方法的优点是易于纳入解释变量。设 \(t\) 之前可得的 \(v\) 个解释变量 \(\boldsymbol x_t=(x_{1t},\dots,x_{vt})'\)(例如第 3 章的波动率 \(\sigma_t^2\)、美国 FOMC 会议指示变量)。设三个参数为解释变量的线性函数:

\[\xi_t=\gamma_0+\boldsymbol\gamma'\boldsymbol x_t,\quad\ln(\alpha_t)=\delta_0+\boldsymbol\delta'\boldsymbol x_t,\quad\beta_t=\theta_0+\boldsymbol\theta'\boldsymbol x_t.\tag{7.39}\]
\(\boldsymbol\gamma=0\) 时形状参数不随时间变化,因此检验 \(\boldsymbol\gamma\) 的显著性可判断解释变量对形状参数的贡献(尺度、位置同理)。三个参数可用不同的解释变量。参数时变时为非齐次泊松过程,强度测度
\[\Lambda[(D_1,D_2)\times(r,\infty)]=\frac{D_2-D_1}D\left[1+\frac{\xi_t(r-\beta_t)}{\alpha_t}\right]_+^{-1/\xi_t},\quad r>\eta.\tag{7.40}\]
似然 \(L=\left[\prod_{i=1}^{N_\eta}\frac1Dg(r_{t_i};\xi_{t_i},\alpha_{t_i},\beta_{t_i})\right]\exp\left[-\frac1D\int_0^TS(\eta;\xi_t,\alpha_t,\beta_t)dt\right]\);若参数在每个交易日内不变,则
\[L=\left[\prod_{i=1}^{N_\eta}\frac1Dg(r_{t_i};\xi_{t_i},\alpha_{t_i},\beta_{t_i})\right]\exp\left[-\frac1D\sum_{t=1}^TS(\eta;\xi_t,\alpha_t,\beta_t)\right].\tag{7.41}\]
给定 \(\{r_t,\boldsymbol x_t\}\)、\(D\)、\(\eta\),最大化对数似然;同样用 \(\ln\alpha_t\) 保证正性。 注:(7.39) 与第 3 章波动率模型类似——参数是 \(t\) 时可得信息的确定函数,必要时可用其他函数形式。

7.7.7 模型检验(PDF p.392–393)

检验二维泊松模型的三个方面:超越率、超出量分布、独立性。

  • 超越率:一元泊松过程相邻事件间隔独立且服从指数分布。Smith & Shively (1995) 建议检查相邻超越间的时间间隔:模型正确时(\(t_0=0\))\(z_{t_i}=\int_{t_{i-1}}^{t_i}\frac1Dg(\eta;\xi_s,\alpha_s,\beta_s)ds\) 应为 iid 标准指数。日数据离散,用
    \[z_{t_i}=\frac1D\sum_{t=t_{i-1}+1}^{t_i}S(\eta;\xi_t,\alpha_t,\beta_t),\tag{7.42}\]
    画 QQ 图:模型充分时应为过原点、斜率 1 的直线。
  • 超出量分布:超出量 \(x_t=r_t-\eta\) 的条件分布为 GPD,形状 \(\xi_t\)、尺度 \(\psi_t=\alpha_t+\xi_t(\eta-\beta_t)\)。定义
    \[w_{t_i}=\begin{cases}\frac1{\xi_{t_i}}\ln\left[1+\xi_{t_i}\frac{r_{t_i}-\eta}{\psi_{t_i}}\right]_+ & \xi_{t_i}\ne0\\ \frac{r_{t_i}-\eta}{\psi_{t_i}} & \xi_{t_i}=0\end{cases}\tag{7.43}\]
    模型充分时 \(\{w_{t_i}\}\) 独立且服从均值 1 的指数分布(Smith 1999),用 QQ 图检验 GPD 假设。
  • 独立性:调整解释变量影响后,检查 \(z_{t_i}\) 与 \(w_{t_i}\) 的样本 ACF,应无序列相关。

7.7.8 示例:非齐次二维泊松模型(PDF p.393–397)

IBM 日对数收益(%),1,000 万美元多头。例 7.7 的齐次模型未通过检验:阈值 2.5% 时 \(z_{t_i}\)、\(w_{t_i}\) 的 ACF 有显著序列相关(图 7.8(a)(b)),\(z_{t_i}\) 的 QQ 图有偏差(图 7.9(a)(b))。

改进:用去均值收益 \(r_t^o=r_t-\bar r\)(\(\bar r\) 为 9,190 个观测均值),解释变量(都在 \(t-1\) 时可得):

  1. \(x_{1t}\):10、11、12 月指示(第四季度/年末效应);
  2. \(x_{2t}\):前一交易日 \(r^o_{t-1}\le-2.5\%\) 的指示(捕捉恐慌性抛售);
  3. \(x_{3t}\):定性波动率——\(t-1\) 至 \(t-5\) 中 \(|r^o_{t-i}|\ge2.5\%\) 的天数;
  4. \(x_{4t}\):年度趋势 \((\text{年份}-1961)/38\);
  5. \(x_{5t}=\sigma_t\):高斯 GARCH(1,1) 拟合波动率,\(r_t^o=a_t\),\(\sigma_t^2=0.04565+0.0807a_{t-1}^2+0.9031\sigma_{t-1}^2\)。 由于 \(r_t\) 序列相关很弱,不用 ARMA 均值方程。删除不显著参数后得表 7.4;阈值 2.5% 时 \(z,w\) 的 ACF 全在两倍标准误内,QQ 图显著改善(图 7.8(c)(d)、7.9(c)(d)),非齐次模型看起来充分。

表 7.4(阈值 2.5%,334 次超越;括号为标准误)。列为常数、\(x_{3t}\)、\(x_{4t}\)、\(x_{5t}\) 的系数;抽取文本中各行数字位置不全,下表按用正文 \(\xi_{9190},\ln\alpha_{9190},\beta_{9190}\) 数值回代验证后的对应关系整理:

参数 常数 \(x_{3t}\) \(x_{4t}\) \(x_{5t}\)
\(\beta_t\) 0.3202 (0.3387) — 1.4772 (0.3222) 2.1991 (0.2450)
\(\ln\alpha_t\) −0.8119 (0.1798) 0.3305 (0.0826) 1.0324 (0.2619) —
\(\xi_t\) 0.1805 (0.1290) 0.2118 (0.0580) 0.3551 (0.1503) −0.2602 (0.0461)

(验证:\(x_3=0\)、\(x_4=0.9737\)、\(x_5=1.9766\) 时,\(\xi=0.1805+0.3551\times0.9737-0.2602\times1.9766=0.0120\),\(\ln\alpha=-0.8119+1.0324\times0.9737=0.1933\),\(\beta=0.3202+1.4772\times0.9737+2.1991\times1.9766=6.105\),与正文一致。) 阈值 3.0%(184 次超越):\(\beta_t\) 两个系数 1.1569 (0.4082)、2.1918 (0.2909);\(\ln\alpha_t\) 两个系数 −0.0316 (0.1201)、0.3336 (0.0861);\(\xi_t\) 三个系数 0.6008 (0.1454)、0.2480 (0.0731)、−0.3175 (0.0685)(所对应的解释变量列在抽取文本中无法确定)。表注:使用文中定义的四个解释变量,针对多头,已去均值。

阈值 2.5% 结果解读(原文):

  1. 三个参数都显著依赖年度趋势;原文称形状参数有负的年度趋势、说明 IBM 收益随时间越来越偏离正态,位置与尺度参数随时间增大。(按上表回代验证的系数,\(\xi\) 对趋势的系数为 +0.3551、对 GARCH 波动率为 −0.2602,与原文"负趋势""波动率正向影响形状参数"的文字描述不一致;但"越来越偏离正态"与 \(\xi\) 随时间增大相符。编写教材时以数值为准并说明此处原书文字存在矛盾。)
  2. 第四季度 \(x_{1t}\) 和恐慌抛售 \(x_{2t}\) 对三个参数都不显著。
  3. 位置参数受 GARCH 波动率正向影响(波动高时收益变异大);原文称形状参数也受正向影响,从而降低收益对尾指数的依赖。
  4. 尺度和形状参数显著依赖定性波动率 \(x_{3t}\),符号合理。

VaR 计算:1998-12-31 解释变量 \(x_{3,9190}=0\),\(x_{4,9190}=0.9737\),\(x_{5,9190}=1.9766\),得 \(\xi_{9190}=0.01195\),\(\ln\alpha_{9190}=0.19331\),\(\beta_{9190}=6.105\)。由 (7.36),5% VaR 分位 3.03756%,即 $303,756;1% VaR 为 $497,425。5% VaR 略大于例 7.3 高斯 AR(2)–GARCH(1,1);1% VaR 大于例 7.3 情形 1。尾部概率越小,极值(厚尾)效应越明显。 优点:参数随市场状况自适应。1998-12-30:\(x_{3,9189}=1\),\(x_{4,9189}=0.9737\),\(x_{5,9189}=1.8757\),得 \(\xi_{9189}=0.2500\),\(\ln\alpha_{9189}=0.52385\),\(\beta_{9189}=5.8834\);95% 分位 2.69139%,VaR = $269,139;1% VaR = $448,323。据此看,例 7.8 的齐次泊松模型似乎低估了 VaR。

7.8 极值指数(The Extremal Index)(PDF p.397–404)

前面假设数据 iid,但现实中因序列相依,极端事件成簇出现(如新闻后连续大幅涨跌)。本节把理论推广到严平稳时间序列,核心概念是极值指数 \(\theta\),刻画相依结构与极值行为的关系(参考 Beirlant et al. 2004 第 10 章;Embrechts et al. 1997)。

设 \(x_1,x_2,\dots\) 严平稳,边际 CDF \(F(x)\),\(x_{(n)}=\max\{x_i\}\),寻找 \((x_{(n)}-\beta_n)/\alpha_n\) 的极限分布。

启发式论证:若相依性衰减很快(远距离近似独立),把数据分为大小 \(k\) 的不相交块,\(g=[n/k]\),第 \(i\) 块 \(\{x_j:j=(i-1)k+1,\dots,ik\}\)(第 \(g+1\) 块可能不足 \(k\) 个),块最大值 \(x_{k,i}\),则

\[x_{(n)}=\max_{i=1,\dots,g+1}x_{k,i}.\tag{7.44}\]
\(k\) 足够大且块最大值不靠近块尾时,相邻块最大值近似独立,可视为 iid 样本,其最大值的极限仍是极值分布。但参数与 iid 情形不同,因为块最大值的边际分布不是 \(F\),而依赖 \(k\) 和相依强度。

7.8.1 \(D(u_n)\) 条件

令 \(u_n\) 为递增阈值序列,使超越 \(u_n\) 的期望次数有界:\(\limsup n[1-F(u_n)]<\infty\)。对任意正整数 \(p,q\),取下标 \(1\le i_1<\dots<i_p<j_1<\dots<j_q\le n\),且 \(j_1-i_p\ge\ell_n\),\(\ell_n/n\to0\)。记 \(A_1=\{i_1,\dots,i_p\}\),\(A_2=\{j_1,\dots,j_q\}\)。若

\[\left|P\left(\max_{i\in A_1\cup A_2}x_i\le u_n\right)-P\left(\max_{i\in A_1}x_i\le u_n\right)P\left(\max_{i\in A_2}x_i\le u_n\right)\right|\le\delta_{n,\ell_n},\quad\delta_{n,\ell_n}\to0,\tag{7.45}\]
则满足 \(D(u_n)\)(Leadbetter 1974):相隔足够远的两组"最大值不超过阈值"事件渐近独立。条件看似复杂但相对较弱,例如高斯序列只要 \(\rho_n\ln n\to0\) 即满足(Berman 1964)。

Leadbetter 定理 1:严平稳序列若存在 \(\alpha_n>0,\beta_n\) 与非退化 \(F_*\) 使 \(P[(x_{(n)}-\beta_n)/\alpha_n\le x]\to_dF_*(x)\),且对每个 \(F_*(x)>0\) 的 \(x\),\(D(u_n)\) 在 \(u_n=\alpha_nx+\beta_n\) 下成立,则 \(F_*\) 是极值分布。

Leadbetter 定理 2(1983):令 \(\{\tilde x_i\}\) 为与 \(x_i\) 同边际分布的 iid 序列,\(\tilde x_{(n)}\) 为其最大值。若 \(P[(\tilde x_{(n)}-\beta_n)/\alpha_n\le x]\to_d\tilde F_*(x)\)(非退化),\(D(u_n)\) 在 \(u_n=\alpha_nx+\beta_n\) 下对每个 \(\tilde F_*(x)>0\) 成立,且 \(P[(x_{(n)}-\beta_n)/\alpha_n\le x]\) 对某个 \(x\) 收敛,则

\[P\left[\frac{x_{(n)}-\beta_n}{\alpha_n}\le x\right]\to_dF_*(x)=\tilde F_*^\theta(x),\quad\theta\in(0,1].\]
\(\theta\) 即极值指数。

参数变化(\(\xi\ne0\)):设 \(\tilde F_*(x)=\exp\{-[1+\xi(x-\beta)/\alpha]^{-1/\xi}\}\),则

\[F_*(x)=\tilde F_*^\theta(x)=\exp\left\{-\theta\left[1+\xi\frac{x-\beta}\alpha\right]^{-1/\xi}\right\}=\exp\left\{-\left[1+\xi\frac{x-[\beta-\frac\alpha\xi(1-\theta^\xi)]}{\alpha\theta^\xi}\right]^{-1/\xi}\right\}=\exp\left\{-\left[1+\xi_*\frac{x-\beta_*}{\alpha_*}\right]^{-1/\xi_*}\right\},\tag{7.46}\]
\(\xi_*=\xi\),\(\alpha_*=\alpha\theta^\xi\),\(\beta_*=\beta-\alpha(1-\theta^\xi)/\xi\)。即满足 \(D(u_n)\) 的平稳序列,最大值极限仍是 GEV,形状参数与 iid 相同,位置和尺度受 \(\theta\) 影响。\(\xi=0\) 时 \(\alpha_*=\alpha\),\(\beta_*=\beta+\alpha\ln\theta\)。

正式定义:严平稳 \(\{x_i\}\),边际 CDF \(F\),\(\theta\ge0\)。若对每个 \(\tau>0\) 存在 \(u_n\) 使

\[\lim_{n\to\infty}n[1-F(u_n)]=\tau,\tag{7.47}\]
\[\lim_{n\to\infty}P(x_{(n)}\le u_n)=\exp(-\theta\tau),\tag{7.48}\]
则 \(\theta\) 为极值指数。对应 iid 序列:\(\lim P(\tilde x_{(n)}\le u_n)=\lim[F(u_n)]^n=\lim\left[1-\frac1nn(1-F(u_n))\right]^n=e^{-\tau}\)。\(\theta=1\) 对应无聚集;\(\theta<1\) 时极值成簇,\(1/\theta\) 可理解为平均簇大小。

7.8.2 极值指数的估计

块方法(Blocks Method):由定义,\(n\) 大时 \(P(x_{(n)}\le u_n)\approx P^\theta(\tilde x_{(n)}\le u_n)=[F(u_n)]^{n\theta}\)(\(n[1-F(u_n)]\to\tau>0\)),因此

\[\lim_{n\to\infty}\frac{\ln P(x_{(n)}\le u_n)}{n\ln F(u_n)}=\theta.\tag{7.49}\]
分母:\(\hat F(u_n)=1-N(u_n)/n\),\(N(u_n)\) 为超越 \(u_n\) 的个数。分子:取块大小 \(k=k(n)\),\(g=n/k\),由 (7.44) 与块最大值近似独立,\(P(x_{(n)}\le u_n)\approx[P(x_{k,i}\le u_n)]^g\),\(\hat P(x_{k,i}\le u_n)=1-G(u_n)/g\),\(G(u_n)\) 为块最大值超过 \(u_n\)(即含至少一次超越)的块数。于是
\[\hat\theta_b^{(1)}=\frac gn\frac{\ln[1-G(u_n)/g]}{\ln[1-N(u_n)/n]}=\frac1k\frac{\ln[1-G(u_n)/g]}{\ln[1-N(u_n)/n]}.\tag{7.50}\]
用 \(\ln(1-x)\approx-x\) 得第二个估计
\[\hat\theta_b^{(2)}=\frac1k\frac{G(u_n)/g}{N(u_n)/n}=\frac{G(u_n)}{N(u_n)},\]
据 Hsing et al. (1988),可解释为极限复合泊松过程平均簇大小的倒数(有超越的块数 / 超越总数)。

游程方法(Runs Method):O'Brien (1987) 证明在弱混合条件下 \(\lim P(x^*_{(n)}\le u_n|x_1>u_n)=\theta\),其中 \(x^*_{(n)}=\max_{2\le i\le s}x_i\),\(s\to\infty\)、\(s/n\to0\)。据此

\[\hat\theta_r^{(3)}=\frac{\sum_{i=1}^{n-k}I(A_{i,n})}{\sum_{i=1}^nI(x_i>u_n)}=\frac{\sum_{i=1}^{n-k}I(A_{i,n})}{N(u_n)},\quad A_{i,n}=\{x_i>u_n,x_{i+1}\le u_n,\dots,x_{i+k}\le u_n\},\]
\(A_{i,n}\) 表示一次超越之后紧跟 \(k\) 个不超越的游程(即一个簇的结束)。由于 \(k/n\to0\),可写为 \(\hat\theta_r^{(3)}\approx\frac{(n-k)^{-1}\sum I(A_{i,n})}{n^{-1}N(u_n)}\)。其他估计见 Beirlant et al. (2004)。

IBM 示例:负日对数收益,块大小 \(k=10\)(因日收益相依性弱),块方法 \(\hat\theta_b^{(1)}\) 对不同阈值的估计(图 7.10,919 个块):阈值 0.025 时 \(\hat\theta_b^{(1)}\approx0.82\),直接计算为 0.823。估计可能对阈值和块大小敏感。

7.8.3 平稳时间序列的 VaR

由 \(P(x_{(n)}\le u_n)\approx[F(x)]^{n\theta}\),\(F\) 的 \((1-p)\) 分位是 \(x_{(n)}\) 极限分布的 \((1-p)^{n\theta}\) 分位,于是 (7.28) 变为

\[\text{VaR}=\begin{cases}\beta_n-\dfrac{\alpha_n}{\xi_n}\left\{1-[-n\theta\ln(1-p)]^{-\xi_n}\right\} & \xi_n\ne0\\ \beta_n-\alpha_n\ln[-n\theta\ln(1-p)] & \xi_n=0\end{cases}\tag{7.51}\]
忽略极值指数会低估 VaR。IBM:\(\hat\theta_b^{(1)}=0.823\),\(n=63\),1% VaR 分位为 3.2714%(R:2.583-(.945/.335)*(1-(-63*.823*log(.99))^-.335) = 3.271388),高于例 7.6 忽略极值指数时的 3.0497。R:exindex(nibm, 10) 估计极值指数并画图 7.10。

第 7 章习题(PDF p.404–406)

  • 7.1 GE 日收益(1998–2008,d-ge9808.txt),转为对数收益,100 万美元多头,尾部概率 0.01,计算 1 日和 15 日 VaR:(a) RiskMetrics;(b) 高斯 ARMA–GARCH;(c) Student-t ARMA–GARCH(估计自由度);(d) 传统 EVT,\(n=21\)。(考查多期 VaR 与时间平方根法则的差别。)
  • 7.2 Cisco 日简单收益(1998–2008,2,767 个观测),100 万美元多头,下一交易日 \(p=0.01\):(a) RiskMetrics;(b) 高斯 GARCH;(c) t-GARCH;(d) 无条件样本分位数;(e) 阈值 2% 的二维齐次泊松过程并检验;(f) 阈值 2% 的非齐次泊松过程,解释变量为年度趋势、10–12 月虚拟变量、高斯 GARCH(1,1) 波动率,并诊断;(g) 用 2.5% 或 3% 阈值重复,讨论阈值选择。
  • 7.3 用 Hill 估计 Cisco 日对数收益的尾指数。
  • 7.4 HP、CRSP 市值加权指数、等权指数、S&P 500 日简单收益(1998–2008,含股息),\(p=0.01\),计算 2009 年第一个交易日 VaR:(a) HP 与 S&P 500 各 100 万美元多头,用 RiskMetrics(分别估计 IGARCH 的 \(\alpha\));(b) 同样头寸,各自用一元 ARMA–GARCH;(c) HP 100 万美元多头,用非齐次二维泊松模型,解释变量为年度趋势、HP 的 GARCH 波动率、S&P 500 的 GARCH 波动率、市值加权指数的 GARCH 波动率;检验市场波动率是否有助于刻画 HP 的尾部行为,可尝试多个阈值。
  • 7.5 Alcoa(AA)与 S&P 500(SPX)日收益(1998–2008),关注 AA 负对数收益(%):(a) 21 日子期拟合 GEV,给出估计、标准误,残差散点图与 QQ 图;(b) 24 个 21 日子期的回报水平;(c) 阈值 2.5% 对指数分布的 QQ 图及平均超出图;(d) 阈值 3.5% 拟合 GPD;(e) 超出分布图、原分布尾部图、残差散点图、残差 QQ 图;(f) 由 GPD 计算 \(q=0.99\)、0.999 的 VaR 与 ES。
  • 7.6 同 7.5,但针对 AA 正对数收益,GPD 阈值 3%。
  • 7.7 同 7.5 的问题,针对 SPX 负对数收益,GPD 阈值 2.5%。
  • 7.8 GE 日对数收益:用块大小 \(k=5\)、10 与阈值 2.5%,估计正、负收益序列的 \(\hat\theta_b^{(1)}\) 和 \(\hat\theta_r^{(3)}\)。

第 7 章参考文献(PDF p.407–408)

Beirlant et al. (2004);Berman (1964);Coles (2001);Cox & Hinkley (1974);Danielsson & de Vries (1997a,b);Davison & Smith (1990);Dekkers & de Haan (1989);Duffie & Pan (1997);Embrechts, Klüppelberg & Mikosch (1997);Feller (1971);Goldie & Smith (1987);Gnedenko (1943);Gumbel (1958);Hill (1975);Hsing, Hüsler & Leadbetter (1988);Jenkinson (1955);Jorion (2006);Koenker & Bassett (1978);Koenker & D'Orey (1987);Leadbetter (1974, 1983);Leadbetter, Lindgren & Rootzén (1983);Longerstaey & More (1995);Longin (1996, 1999a,b);O'Brien (1987);Pickands (1975);Smith (1989, 1999);Smith & Shively (1995);Tsay (1999);Zivot & Wang (2003)。

第 7 章本章要点

  • VaR = 损失分布的 \((1-p)\) 分位数;多头用负收益;VaR 不满足次可加性,应辅以 ES(CVaR)。
  • RiskMetrics = 零均值 + EWMA/IGARCH(1,1) + 正态,得到时间平方根法则;任何假设不成立法则即失效。正态 ES:\(\text{ES}_{0.95}=2.0627\sigma\),\(\text{ES}_{0.99}=2.6652\sigma\)。
  • 计量方法:ARMA–GARCH 给出条件均值与方差;t 分布需用标准化分位 \(t_v(1-p)/\sqrt{v/(v-2)}\);多期 VaR 用 (7.7)–(7.10)。
  • 经验分位数:简单无分布假设,但不能外推历史之外的损失,小 \(p\) 时不精确;分位数回归(check loss)可引入解释变量。
  • EVT:GEV 三类型(Gumbel/Fréchet/Weibull),金融收益属 Fréchet(\(\xi\approx0.2\)–0.35);估计方法:分块 MLE、回归法、Hill、Pickands;VaR 公式 (7.28);α 次根时间法则 \(\text{VaR}(\ell)=\ell^\xi\text{VaR}\);回报水平。
  • POT/GPD:阈值稳定性、平均超出图选阈值、二维泊松过程似然、可纳入解释变量形成条件 EVT、用 \(z\)/\(w\) 统计量做诊断;GPD 下 VaR 与 ES 有闭式。
  • 极值指数 \(\theta\) 刻画极值聚集,\(\xi\) 不变而位置、尺度变化;忽略 \(\theta\) 会低估 VaR。
  • 不同方法的 VaR 差别很大,应同时使用多种方法了解 VaR 的范围。

第 7 章与量化交易的关联

  • 风险建模与限额:本章就是组合风控系统中 VaR/ES 引擎的教科书版本——历史模拟(经验分位数)、参数法(RiskMetrics/GARCH)、EVT/POT 是业界三大类方法;多头寸 VaR 合成公式对应方差-协方差法。巴塞尔 FRTB 已从 VaR 转向 97.5% ES,7.2.3 和 7.7.5 的 ES 公式可直接用。
  • 回测(VaR backtesting):VaR 突破次数应服从二项分布;7.7.7 的 \(z\)(超越间隔应为指数分布)和 \(w\) 统计量的思想可直接用于检验 VaR 突破是否独立、是否聚集(类似 Christoffersen 检验)。
  • 仓位与杠杆:用条件 EVT 或 GARCH-t 的尾部分位数做风险预算、止损和杠杆上限;时间平方根法则在均值回复波动下会高估长期 VaR(例 7.3 续),在波动上升期会低估。
  • 组合优化:分位数回归和 ES 可作为优化目标(均值-CVaR 优化可写成线性规划,Rockafellar–Uryasev),check loss 也是训练分位数预测模型(如分位数梯度提升)的标准损失。
  • 尾部因子与压力测试:Hill 估计的尾指数、极值指数可作为个股尾部风险特征;回报水平(如"一年一遇的月度最大损失")是压力测试情景设定的自然语言。
  • 局限:例子均基于单只股票和日频数据,实盘组合需考虑相关性在危机中上升(尾部相依),这部分属于多元极值/Copula,本章未覆盖。

第 7 章推荐习题

  • 7.1、7.2:用同一数据系统比较 RiskMetrics、GARCH、t-GARCH、经验分位数、EVT、POT,是本章最核心的综合练习。
  • 7.5(或 7.7):完整的 GEV + GPD 流程(回报水平、平均超出图、诊断、VaR/ES)。
  • 7.4(c):用市场波动率作为解释变量的条件 EVT,体会"条件尾部风险"。
  • 7.8:极值指数估计,理解极端事件聚集。

第 8 章 多元时间序列分析及其应用(Multivariate Time Series Analysis and Its Applications)(PDF p.409 起,续见下一块)

本章引言(PDF p.409–410)

  • 经济全球化和互联网使世界金融市场加速一体化,一个市场的价格变动可以迅速传导到另一个市场;市场间的领先-滞后关系可能随情形而反转。持有多种资产的投资者也需要了解资产收益之间的动态关系。第 8–10 章介绍联合研究多个收益序列的计量模型,统计上属于向量(多元)时间序列分析。
  • 多元时间序列由多个分量序列组成,用粗体表示向量和矩阵;附录 A 回顾向量矩阵运算,附录 B 回顾多元正态分布(Johnson & Wichern 1998)。
  • 记 \(\boldsymbol r_t=(r_{1t},\dots,r_{kt})'\) 为 \(k\) 个资产在 \(t\) 时的对数收益。例:IBM、微软、埃克森美孚、通用汽车、沃尔玛的 5 维日收益;或 S&P 500、FTSE 100、日经 225 的 3 维收益。
  • 目标:(a) 研究 \(\boldsymbol r_t\) 的基本性质;(b) 研究分析多元数据的计量模型。很多单变量方法可直接推广,但有些推广需要注意,有些情况需要新模型。理论参考 Lütkepohl (2005)、Reinsel (1993)。

8.1 弱平稳性与交叉相关矩阵(PDF p.410–419)

\(k\) 维序列 \(\boldsymbol r_t\) 若一阶、二阶矩不随时间变化则弱平稳(除非另行说明,假设资产收益弱平稳)。均值向量与协方差矩阵:

\[\boldsymbol\mu=E(\boldsymbol r_t),\quad\boldsymbol\Gamma_0=E[(\boldsymbol r_t-\boldsymbol\mu)(\boldsymbol r_t-\boldsymbol\mu)'],\tag{8.1}\]
\(\boldsymbol\Gamma_0\) 第 \(i\) 个对角元是 \(r_{it}\) 的方差,\((i,j)\) 元是 \(r_{it}\) 与 \(r_{jt}\) 的协方差;记 \(\boldsymbol\Gamma_0=[\Gamma_{ij}(0)]\)。

8.1.1 交叉相关矩阵(Cross-Correlation Matrices, CCM)

\(\boldsymbol D=\text{diag}\{\sqrt{\Gamma_{11}(0)},\dots,\sqrt{\Gamma_{kk}(0)}\}\)。同期(滞后 0)相关矩阵 \(\boldsymbol\rho_0\equiv[\rho_{ij}(0)]=\boldsymbol D^{-1}\boldsymbol\Gamma_0\boldsymbol D^{-1}\),\(\rho_{ij}(0)=\frac{\Gamma_{ij}(0)}{\sqrt{\Gamma_{ii}(0)\Gamma_{jj}(0)}}\),即同期(contemporaneous)相关系数;对称、对角为 1、元素在 \([-1,1]\)。

滞后 \(\ell\) 交叉协方差矩阵:

\[\boldsymbol\Gamma_\ell\equiv[\Gamma_{ij}(\ell)]=E[(\boldsymbol r_t-\boldsymbol\mu)(\boldsymbol r_{t-\ell}-\boldsymbol\mu)'],\tag{8.2}\]
\((i,j)\) 元为 \(r_{it}\) 与 \(r_{j,t-\ell}\) 的协方差;弱平稳时只依赖 \(\ell\)。滞后 \(\ell\) 交叉相关矩阵:
\[\boldsymbol\rho_\ell\equiv[\rho_{ij}(\ell)]=\boldsymbol D^{-1}\boldsymbol\Gamma_\ell\boldsymbol D^{-1},\tag{8.3}\]
\[\rho_{ij}(\ell)=\frac{\Gamma_{ij}(\ell)}{\sqrt{\Gamma_{ii}(0)\Gamma_{jj}(0)}}=\frac{\text{Cov}(r_{it},r_{j,t-\ell})}{\text{std}(r_{it})\text{std}(r_{jt})}.\tag{8.4}\]
\(\ell>0\) 时 \(\rho_{ij}(\ell)\) 衡量 \(r_{it}\) 对过去值 \(r_{j,t-\ell}\) 的线性依赖;若 \(\rho_{ij}(\ell)\ne0\),称 \(r_{jt}\) 在滞后 \(\ell\) 领先 \(r_{it}\)。对角元 \(\rho_{ii}(\ell)\) 即 \(r_{it}\) 的滞后 \(\ell\) 自相关。

性质(\(\ell>0\)):(1) 一般 \(\rho_{ij}(\ell)\ne\rho_{ji}(\ell)\),故 \(\boldsymbol\Gamma_\ell\)、\(\boldsymbol\rho_\ell\) 一般不对称;(2) 由 \(\text{Cov}(r_{it},r_{j,t-\ell})=\text{Cov}(r_{jt},r_{i,t+\ell})\),得 \(\Gamma_{ij}(\ell)=\Gamma_{ji}(-\ell)\),即

\[\boldsymbol\Gamma_\ell=\boldsymbol\Gamma_{-\ell}',\quad\boldsymbol\rho_\ell=\boldsymbol\rho_{-\ell}'.\]
与单变量不同,\(\boldsymbol\rho_\ell\ne\boldsymbol\rho_{-\ell}\);实践中只需考虑 \(\ell\ge0\)。

8.1.2 线性相依

\(\{\boldsymbol\rho_\ell|\ell=0,1,\dots\}\) 包含的信息:对角元为各分量 ACF;\(\rho_{ij}(0)\) 为同期线性关系;\(\ell>0\) 时 \(\rho_{ij}(\ell)\) 衡量 \(r_{it}\) 对 \(r_{j,t-\ell}\) 的依赖。若对所有 \(\ell>0\) 有 \(\rho_{ij}(\ell)=0\),则 \(r_{it}\) 不线性依赖 \(r_{jt}\) 的任何过去值。 两序列关系的分类:

  1. 无线性关系:对所有 \(\ell\ge0\),\(\rho_{ij}(\ell)=\rho_{ji}(\ell)=0\);
  2. 同期相关:\(\rho_{ij}(0)\ne0\);
  3. 无领先-滞后关系(不耦合 uncoupled):对所有 \(\ell>0\),\(\rho_{ij}(\ell)=\rho_{ji}(\ell)=0\);
  4. 从 \(r_{it}\) 到 \(r_{jt}\) 的单向关系:对所有 \(\ell>0\),\(\rho_{ij}(\ell)=0\),但某 \(v>0\) 有 \(\rho_{ji}(v)\ne0\);
  5. 反馈关系:某 \(\ell>0\) 有 \(\rho_{ij}(\ell)\ne0\),某 \(v>0\) 有 \(\rho_{ji}(v)\ne0\)。 这些是充分条件;更有信息量的做法是建立多元模型,同时考虑序列相关和交叉相关。

8.1.3 样本交叉相关矩阵

\[\hat{\boldsymbol\Gamma}_\ell=\frac1T\sum_{t=\ell+1}^T(\boldsymbol r_t-\bar{\boldsymbol r})(\boldsymbol r_{t-\ell}-\bar{\boldsymbol r})',\ \ell\ge0,\tag{8.5}\]
\[\hat{\boldsymbol\rho}_\ell=\hat{\boldsymbol D}^{-1}\hat{\boldsymbol\Gamma}_\ell\hat{\boldsymbol D}^{-1},\ \ell\ge0,\tag{8.6}\]

\(\hat{\boldsymbol D}\) 为样本标准差对角阵。渐近性质见 Fuller (1976, 第 6 章):相合但有限样本有偏。资产收益因条件异方差和高峰度,有限样本分布复杂;需要时建议用适当的 bootstrap 重抽样近似。多数应用中粗略近似 \(\hat\rho_{ij}(\ell)\) 的方差(\(1/T\))就够了。

例 8.1(IBM 与 S&P 500 月对数收益,%,1926.1–2008.12,996 个观测,含股息):\(\boldsymbol r_t=(r_{1t},r_{2t})'\) 分别为 IBM 与 S&P 500。图 8.1 时序图;图 8.2 散点图:(a) IBM 对 S&P 500 同期,(b) S&P 500 对滞后 1 的 IBM,(c) IBM 对滞后 1 的 S&P 500,(d) S&P 500 对自身滞后 1。两者同期相关明显,样本同期相关 0.65(5% 显著);滞后 1 交叉相关很弱。

简化记号(Tiao & Box 1981):维数 \(k>3\) 时很难同时消化大量 CCM,用三种符号表示每个相关:\(+\) 表示 \(\ge2/\sqrt T\);\(-\) 表示 \(\le-2/\sqrt T\);\(\cdot\) 表示介于两者之间。\(2/\sqrt T\) 是白噪声假设下样本相关的渐近 5% 临界值(原文误写为 \(1/\sqrt T\))。

表 8.1:(a) 描述统计——IBM:均值 1.089,标准差 7.033,偏度 −0.068,超额峰度 2.622,最小 −30.37,最大 38.57;SP5:0.430,5.537,−0.521,7.927,−35.59,35.22。 (b) 交叉相关矩阵(行为 [IBM; SP5],列为 [IBM 滞后; SP5 滞后];按简化记号核对后的排列):

  • 滞后 1:\(\begin{bmatrix}0.04&0.10\\0.04&0.08\end{bmatrix}\);滞后 2:\(\begin{bmatrix}0.00&-0.08\\0.02&-0.02\end{bmatrix}\);滞后 3:\(\begin{bmatrix}-0.01&-0.06\\-0.06&-0.10\end{bmatrix}\);滞后 4:\(\begin{bmatrix}-0.03&-0.03\\0.04&0.03\end{bmatrix}\);滞后 5:\(\begin{bmatrix}0.02&0.08\\0.00&0.09\end{bmatrix}\)。 (c) 简化记号:滞后 1 \(\begin{bmatrix}\cdot&+\\\cdot&+\end{bmatrix}\),滞后 2 \(\begin{bmatrix}\cdot&-\\\cdot&\cdot\end{bmatrix}\),滞后 3 \(\begin{bmatrix}\cdot&\cdot\\\cdot&-\end{bmatrix}\),滞后 4 全 \(\cdot\),滞后 5 \(\begin{bmatrix}\cdot&+\\\cdot&+\end{bmatrix}\)。 结论:显著交叉相关(约 5% 水平)主要在滞后 1 和 3(原文措辞);(a) S&P 500 在滞后 1、2、3、5 有边际自相关;(b) IBM 收益弱依赖于 S&P 500 的过去收益(滞后 1、2、5 CCM 的 (1,2) 元显著)。图 8.3:样本 ACF/CCF 及两倍标准误线——两序列动态关系弱,但同期相关显著。

例 8.2(美国国债指数月简单收益,CRSP,1942.1–1999.12,696 个观测):期限 30、20、10、5、1 年,\(\boldsymbol r_t=(r_{1t},\dots,r_{5t})'\) 期限递减。图 8.4:1 年期波动远小于长期限。\(\hat{\boldsymbol\mu}=10^{-2}(0.43,0.45,0.45,0.46,0.44)'\),\(\hat{\boldsymbol\sigma}=10^{-2}(2.53,2.43,1.97,1.39,0.53)'\)。同期相关矩阵

\[\hat{\boldsymbol\rho}_0=\begin{bmatrix}1.00&0.98&0.92&0.85&0.63\\0.98&1.00&0.91&0.86&0.64\\0.92&0.91&1.00&0.90&0.68\\0.85&0.86&0.90&1.00&0.82\\0.63&0.64&0.68&0.82&1.00\end{bmatrix}.\]
同期相关高,长期债之间相关高于短期债之间。 表 8.2:滞后 1 CCM 全部为正且显著(如第 1 行 0.10, 0.08, 0.11, 0.12, 0.16;第 5 行 0.17, 0.15, 0.21, 0.22, 0.40);滞后 2 CCM 仅 (5,5) 元 0.22 显著,其余在 −0.04 至 0.07 之间。大多数显著交叉相关在滞后 1,五个序列相互关联;1 年期债券的滞后 1、2 自相关远高于长期限债券。

8.1.4 多元混成检验(Multivariate Portmanteau Tests)

Hosking (1980, 1981)、Li & McLeod (1981) 把 Ljung–Box 推广到多元。\(H_0:\boldsymbol\rho_1=\dots=\boldsymbol\rho_m=0\) vs \(H_a\):某 \(\boldsymbol\rho_i\ne0\),即检验向量序列无自相关和交叉相关:

\[Q_k(m)=T^2\sum_{\ell=1}^m\frac1{T-\ell}\text{tr}(\hat{\boldsymbol\Gamma}_\ell'\hat{\boldsymbol\Gamma}_0^{-1}\hat{\boldsymbol\Gamma}_\ell\hat{\boldsymbol\Gamma}_0^{-1}),\tag{8.7}\]
\(\text{tr}\) 为迹。原假设和正则条件下渐近 \(\chi^2_{k^2m}\)。 注:用 Kronecker 积与向量化,\(Q_k(m)=T^2\sum_{\ell=1}^m\frac1{T-\ell}\boldsymbol b_\ell'(\hat{\boldsymbol\rho}_0^{-1}\otimes\hat{\boldsymbol\rho}_0^{-1})\boldsymbol b_\ell\),\(\boldsymbol b_\ell=\text{vec}(\hat{\boldsymbol\rho}_\ell')\)。Li–McLeod 统计量 \(Q_k^*(m)=T\sum_{\ell=1}^m\boldsymbol b_\ell'(\hat{\boldsymbol\rho}_0^{-1}\otimes\hat{\boldsymbol\rho}_0^{-1})\boldsymbol b_\ell+\frac{k^2m(m+1)}{2T}\),与 \(Q_k(m)\) 渐近等价。

应用:例 8.1 的 IBM/S&P 500:\(Q_2(1)=9.81\),\(Q_2(5)=47.06\),\(Q_2(10)=71.65\),自由度 4、20、40,p 值 0.044、0.001、0.002——5% 水平下存在序列相依。例 8.2 债券:\(Q_5(5)=1065.63\),相对 \(\chi^2_{125}\) 高度显著。若拒绝原假设,就建立多元模型研究领先-滞后关系。

8.2 向量自回归模型(Vector Autoregressive Models, VAR)(PDF p.419–433)

VAR(1):

\[\boldsymbol r_t=\boldsymbol\phi_0+\boldsymbol\Phi\boldsymbol r_{t-1}+\boldsymbol a_t,\tag{8.8}\]
\(\boldsymbol\phi_0\) 为 \(k\) 维向量,\(\boldsymbol\Phi\) 为 \(k\times k\) 矩阵,\(\{\boldsymbol a_t\}\) 序列不相关、均值 0、协方差 \(\boldsymbol\Sigma\)(要求正定,否则可降维;常假设多元正态)。 二元情形:
\[r_{1t}=\phi_{10}+\Phi_{11}r_{1,t-1}+\Phi_{12}r_{2,t-1}+a_{1t},\quad r_{2t}=\phi_{20}+\Phi_{21}r_{1,t-1}+\Phi_{22}r_{2,t-1}+a_{2t}.\]
\(\Phi_{12}\) 是给定 \(r_{1,t-1}\) 时 \(r_{2,t-1}\) 对 \(r_{1t}\) 的条件效应;\(\Phi_{12}=0\) 则 \(r_{1t}\) 只依赖自身过去。联合看:\(\Phi_{12}=0\)、\(\Phi_{21}\ne0\) 为 \(r_{1t}\to r_{2t}\) 单向关系;\(\Phi_{12}=\Phi_{21}=0\) 为不耦合;都不为 0 为反馈关系。

8.2.1 简约式与结构式(Reduced and Structural Forms)

\(\boldsymbol\Phi\) 衡量动态依赖,同期关系体现在 \(\boldsymbol\Sigma\) 的非对角元 \(\sigma_{12}\)(为 0 则无同期线性关系)。(8.8) 称简约式(reduced form),没有显式表示同期依赖。由于 \(\boldsymbol\Sigma\) 正定,存在单位下三角阵 \(\boldsymbol L\) 与对角阵 \(\boldsymbol G\) 使 \(\boldsymbol\Sigma=\boldsymbol L\boldsymbol G\boldsymbol L'\)(Cholesky 分解,附录 A),于是 \(\boldsymbol L^{-1}\boldsymbol\Sigma(\boldsymbol L')^{-1}=\boldsymbol G\)。令 \(\boldsymbol b_t=\boldsymbol L^{-1}\boldsymbol a_t\),\(E(\boldsymbol b_t)=0\),\(\text{Cov}(\boldsymbol b_t)=\boldsymbol G\),分量互不相关。左乘 \(\boldsymbol L^{-1}\):

\[\boldsymbol L^{-1}\boldsymbol r_t=\boldsymbol\phi_0^*+\boldsymbol\Phi^*\boldsymbol r_{t-1}+\boldsymbol b_t,\quad\boldsymbol\phi_0^*=\boldsymbol L^{-1}\boldsymbol\phi_0,\ \boldsymbol\Phi^*=\boldsymbol L^{-1}\boldsymbol\Phi.\tag{8.9}\]
\(\boldsymbol L^{-1}\) 第 \(k\) 行形如 \((w_{k1},\dots,w_{k,k-1},1)\),故第 \(k\) 个方程
\[r_{kt}+\sum_{i=1}^{k-1}w_{ki}r_{it}=\phi^*_{k,0}+\sum_{i=1}^k\Phi^*_{ki}r_{i,t-1}+b_{kt},\tag{8.10}\]
显式表示 \(r_{kt}\) 对 \(r_{it}\)(\(i<k\))的同期依赖,称 \(r_{kt}\) 的结构方程。把任一分量排到最后即可得到其结构方程,因此简约式与计量经济学的结构式等价。时间序列分析常用简约式:一是易于估计;二是(主要原因)同期相关不能用于预测。

例 8.3:

\[\begin{bmatrix}r_{1t}\\r_{2t}\end{bmatrix}=\begin{bmatrix}0.2\\0.4\end{bmatrix}+\begin{bmatrix}0.2&0.3\\-0.6&1.1\end{bmatrix}\begin{bmatrix}r_{1,t-1}\\r_{2,t-1}\end{bmatrix}+\boldsymbol a_t,\quad\boldsymbol\Sigma=\begin{bmatrix}2&1\\1&1\end{bmatrix}.\]
\(\boldsymbol L^{-1}=\begin{bmatrix}1&0\\-0.5&1\end{bmatrix}\),变换后 \(\boldsymbol\phi_0^*=(0.2,0.3)'\),\(\boldsymbol\Phi^*=\begin{bmatrix}0.2&0.3\\-0.7&0.95\end{bmatrix}\),\(\boldsymbol G=\text{diag}(2,0.5)\)。第二个方程:
\[r_{2t}=0.3+0.5r_{1t}-0.7r_{1,t-1}+0.95r_{2,t-1}+b_{2t}.\]
交换顺序 \((r_{2t},r_{1t})'\):\(\boldsymbol\phi_0=(0.4,0.2)'\),\(\boldsymbol\Phi=\begin{bmatrix}1.1&-0.6\\0.3&0.2\end{bmatrix}\),\(\boldsymbol\Sigma=\begin{bmatrix}1&1\\1&2\end{bmatrix}\),\(\boldsymbol L^{-1}=\begin{bmatrix}1&0\\-1&1\end{bmatrix}\),变换后常数 \((0.4,-0.2)'\),系数 \(\begin{bmatrix}1.1&-0.6\\-0.8&0.8\end{bmatrix}\),\(\boldsymbol G=\boldsymbol I\),得
\[r_{1t}=-0.2+1.0r_{2t}-0.8r_{2,t-1}+0.8r_{1,t-1}+c_{2t}.\]
说明:结构方程依赖变量排序(Cholesky 排序不唯一)。

8.2.2 VAR(1) 的平稳条件与矩

弱平稳时取期望:\(\boldsymbol\mu=(\boldsymbol I-\boldsymbol\Phi)^{-1}\boldsymbol\phi_0\)(\(\boldsymbol I-\boldsymbol\Phi\) 非奇异)。去均值 \(\tilde{\boldsymbol r}_t=\boldsymbol r_t-\boldsymbol\mu\):

\[\tilde{\boldsymbol r}_t=\boldsymbol\Phi\tilde{\boldsymbol r}_{t-1}+\boldsymbol a_t,\tag{8.11}\]
反复代入 \(\tilde{\boldsymbol r}_t=\boldsymbol a_t+\boldsymbol\Phi\boldsymbol a_{t-1}+\boldsymbol\Phi^2\boldsymbol a_{t-2}+\cdots\)。由此:

  1. \(\boldsymbol a_t\) 与 \(\boldsymbol r_{t-\ell}\)(\(\ell>0\))不相关,称 \(t\) 时的冲击/新息;对所有时间序列模型都成立。
  2. \(\text{Cov}(\boldsymbol r_t,\boldsymbol a_t)=\boldsymbol\Sigma\)。
  3. \(\boldsymbol r_t\) 以系数 \(\boldsymbol\Phi^j\) 依赖 \(\boldsymbol a_{t-j}\),需 \(\boldsymbol\Phi^j\to0\),即 \(\boldsymbol\Phi\) 的 \(k\) 个特征值模都小于 1——这是弱平稳的充要条件(在 \(\boldsymbol a_t\) 协方差存在时),退化为单变量的 \(|\phi|<1\)。由 \(|\lambda\boldsymbol I-\boldsymbol\Phi|=\lambda^k|\boldsymbol I-\boldsymbol\Phi\frac1\lambda|\),\(\boldsymbol\Phi\) 的特征值是 \(|\boldsymbol I-\boldsymbol\Phi B|\) 零点的倒数,等价条件:\(|\boldsymbol\Phi(B)|\) 的所有零点模大于 1(在单位圆外)。
  4. \(\text{Cov}(\boldsymbol r_t)=\boldsymbol\Gamma_0=\boldsymbol\Sigma+\boldsymbol\Phi\boldsymbol\Sigma\boldsymbol\Phi'+\boldsymbol\Phi^2\boldsymbol\Sigma(\boldsymbol\Phi^2)'+\dots=\sum_{i=0}^\infty\boldsymbol\Phi^i\boldsymbol\Sigma(\boldsymbol\Phi^i)'\)。 右乘 \(\tilde{\boldsymbol r}_{t-\ell}'\) 取期望:
    \[\boldsymbol\Gamma_\ell=\boldsymbol\Phi\boldsymbol\Gamma_{\ell-1},\ \ell>0,\tag{8.12}\]
    所以 \(\boldsymbol\Gamma_\ell=\boldsymbol\Phi^\ell\boldsymbol\Gamma_0\)。左右乘 \(\boldsymbol D^{-1/2}\)(原文记号,这里 \(\boldsymbol D\) 指方差对角阵):\(\boldsymbol\rho_\ell=\boldsymbol\Upsilon\boldsymbol\rho_{\ell-1}\),\(\boldsymbol\Upsilon=\boldsymbol D^{-1/2}\boldsymbol\Phi\boldsymbol D^{1/2}\),于是 \(\boldsymbol\rho_\ell=\boldsymbol\Upsilon^\ell\boldsymbol\rho_0\)。

8.2.3 VAR(p) 模型

\[\boldsymbol r_t=\boldsymbol\phi_0+\boldsymbol\Phi_1\boldsymbol r_{t-1}+\dots+\boldsymbol\Phi_p\boldsymbol r_{t-p}+\boldsymbol a_t,\tag{8.13}\]

即 \(\boldsymbol\Phi(B)\boldsymbol r_t=\boldsymbol\phi_0+\boldsymbol a_t\),\(\boldsymbol\Phi(B)=\boldsymbol I-\boldsymbol\Phi_1B-\dots-\boldsymbol\Phi_pB^p\)。弱平稳时 \(\boldsymbol\mu=[\boldsymbol\Phi(1)]^{-1}\boldsymbol\phi_0\)。去均值:

\[\tilde{\boldsymbol r}_t=\boldsymbol\Phi_1\tilde{\boldsymbol r}_{t-1}+\dots+\boldsymbol\Phi_p\tilde{\boldsymbol r}_{t-p}+\boldsymbol a_t.\tag{8.14}\]
性质:\(\text{Cov}(\boldsymbol r_t,\boldsymbol a_t)=\boldsymbol\Sigma\);\(\text{Cov}(\boldsymbol r_{t-\ell},\boldsymbol a_t)=0\)(\(\ell>0\));矩方程(多元 Yule–Walker)\(\boldsymbol\Gamma_\ell=\boldsymbol\Phi_1\boldsymbol\Gamma_{\ell-1}+\dots+\boldsymbol\Phi_p\boldsymbol\Gamma_{\ell-p}\)(\(\ell>0\)),相关形式 \(\boldsymbol\rho_\ell=\boldsymbol\Upsilon_1\boldsymbol\rho_{\ell-1}+\dots+\boldsymbol\Upsilon_p\boldsymbol\rho_{\ell-p}\),\(\boldsymbol\Upsilon_i=\boldsymbol D^{-1/2}\boldsymbol\Phi_i\boldsymbol D^{1/2}\)。

化为 \(kp\) 维 VAR(1):\(\boldsymbol x_t=(\tilde{\boldsymbol r}_{t-p+1}',\dots,\tilde{\boldsymbol r}_t')'\),\(\boldsymbol b_t=(\boldsymbol 0,\dots,\boldsymbol 0,\boldsymbol a_t')'\)(协方差只有右下角为 \(\boldsymbol\Sigma\)),

\[\boldsymbol x_t=\boldsymbol\Phi^*\boldsymbol x_{t-1}+\boldsymbol b_t,\quad\boldsymbol\Phi^*=\begin{bmatrix}\boldsymbol 0&\boldsymbol I&\boldsymbol 0&\cdots&\boldsymbol 0\\\boldsymbol 0&\boldsymbol 0&\boldsymbol I&\cdots&\boldsymbol 0\\\vdots&&&\ddots&\vdots\\\boldsymbol 0&\boldsymbol 0&\boldsymbol 0&\cdots&\boldsymbol I\\\boldsymbol\Phi_p&\boldsymbol\Phi_{p-1}&\boldsymbol\Phi_{p-2}&\cdots&\boldsymbol\Phi_1\end{bmatrix},\tag{8.15}\]
\(\boldsymbol\Phi^*\) 称 \(\boldsymbol\Phi(B)\) 的伴随矩阵(companion matrix)。\(\boldsymbol x_t\) 弱平稳当且仅当 \(\boldsymbol r_t\) 弱平稳,因此 VAR(p) 平稳的充要条件是 \(\boldsymbol\Phi^*\) 的所有特征值模小于 1;又 \(|\boldsymbol I-\boldsymbol\Phi^*B|=|\boldsymbol\Phi(B)|\),等价于 \(|\boldsymbol\Phi(B)|\) 的零点都在单位圆外。 系数矩阵结构的意义:若对所有 \(\ell\),\(\boldsymbol\Phi_\ell\) 的 \((i,j)\) 元为 0,则 \(r_{it}\) 不依赖 \(r_{jt}\) 的过去值——系数结构揭示领先-滞后关系(即 Granger 因果的含义)。

8.2.4 建立 VAR(p) 模型

迭代流程:定阶 → 估计 → 检验。 定阶:推广单变量 PACF 思路,依次拟合

\[\boldsymbol r_t=\boldsymbol\phi_0+\boldsymbol\Phi_1\boldsymbol r_{t-1}+\dots+\boldsymbol\Phi_i\boldsymbol r_{t-i}+\boldsymbol a_t,\quad i=1,2,\dots\tag{8.16}\]
用 OLS(多元线性回归)估计。记 VAR(i) 的估计 \(\hat{\boldsymbol\Phi}_j^{(i)}\)、\(\hat{\boldsymbol\phi}_0^{(i)}\),残差 \(\hat{\boldsymbol a}_t^{(i)}\)(\(i=0\) 时为 \(\boldsymbol r_t-\bar{\boldsymbol r}\)),残差协方差
\[\hat{\boldsymbol\Sigma}_i=\frac1{T-2i-1}\sum_{t=i+1}^T\hat{\boldsymbol a}_t^{(i)}(\hat{\boldsymbol a}_t^{(i)})',\ i\ge0.\tag{8.17}\]
顺序检验 \(H_0:\boldsymbol\Phi_\ell=0\)。\(\ell=1\):\(M(1)=-\left(T-k-\frac52\right)\ln\frac{|\hat{\boldsymbol\Sigma}_1|}{|\hat{\boldsymbol\Sigma}_0|}\),渐近 \(\chi^2_{k^2}\)(Tiao & Box 1981)。一般地,VAR(i) vs VAR(i−1):
\[M(i)=-\left(T-k-i-\frac32\right)\ln\frac{|\hat{\boldsymbol\Sigma}_i|}{|\hat{\boldsymbol\Sigma}_{i-1}|}\sim\chi^2_{k^2}.\tag{8.18}\]
信息准则:\(\boldsymbol a_t\) 多元正态时,OLS 的 \(\boldsymbol\phi_0,\boldsymbol\Phi_j\) 等价于条件 MLE,但 \(\boldsymbol\Sigma\) 的 ML 估计为
\[\tilde{\boldsymbol\Sigma}_i=\frac1T\sum_{t=i+1}^T\hat{\boldsymbol a}_t^{(i)}[\hat{\boldsymbol a}_t^{(i)}]'.\tag{8.19}\]
\[\text{AIC}(i)=\ln|\tilde{\boldsymbol\Sigma}_i|+\frac{2k^2i}T,\quad\text{BIC}(i)=\ln|\tilde{\boldsymbol\Sigma}_i|+\frac{k^2i\ln T}T,\quad\text{HQ}(i)=\ln|\tilde{\boldsymbol\Sigma}_i|+\frac{2k^2i\ln\ln T}T\]
(HQ 由 Hannan & Quinn 1979 提出)。在 \(0\le i\le p_0\) 中选最小者。

例 8.4(IBM 与 S&P 500 月对数收益)(表 8.3;\(\chi^2_4\) 的 5%、1% 临界值 9.5、13.3):

阶 1 2 3 4 5 6
M(i) 10.76 13.41 10.34 7.78 12.07 1.93
AIC 6.795 6.789 6.786 6.786 6.782 6.788

两者都提示 VAR(5);M(i) 在滞后 1、3、5 处 5% 边际显著,AIC 在 5 阶最小;只在 \(i=2\) 时 1% 水平边际显著,确认两序列动态线性依赖较弱。

估计与检验:OLS 与 ML 渐近等价,估计渐近正态(Reinsel 1993)。残差用 \(Q_k(m)\) 检验,拟合 VAR(p) 后其渐近分布为 \(\chi^2_{k^2m-g}\),\(g\) 为 AR 系数矩阵中估计参数个数(Lütkepohl 2005)。

例 8.4(续):由于序列相依弱,不用滞后 4:

\[\boldsymbol r_t=\boldsymbol\phi_0+\boldsymbol\Phi_1\boldsymbol r_{t-1}+\boldsymbol\Phi_2\boldsymbol r_{t-2}+\boldsymbol\Phi_3\boldsymbol r_{t-3}+\boldsymbol\Phi_5\boldsymbol r_{t-5}+\boldsymbol a_t,\tag{8.20}\]
(一般地,若 M(i) 和 AIC 定为 5 阶,应使用全部 5 个滞后。)表 8.4(a) 全模型(第一行 IBM,第二行 SP5;每个 \(\boldsymbol\Phi\) 列出两列):IBM 行 \(\phi_0=1.0\) (0.23),其余 AR 系数依次为 −0.03, 0.15, 0.10, −0.17, 0.05, −0.11, −0.06, 0.14(标准误 0.04–0.05);SP5 行 \(\phi_0=0.4\) (0.18),系数 −0.03, 0.11, 0.04, −0.04, 0.02, −0.11, −0.07, 0.15(标准误 0.03–0.04);\(\hat{\boldsymbol\Sigma}=\begin{bmatrix}48&24\\24&30\end{bmatrix}\)。(抽取文本中全模型各系数与矩阵位置的对应不完全确定。) 表 8.4(b) 简化模型(去掉不显著参数;SCA 输出更精确):\(\hat{\boldsymbol\phi}_0=(1.039\,(0.223),\ 0.390\,(0.176))'\);\(\hat{\boldsymbol\Phi}_1=\begin{bmatrix}0&0.129\\0&0.080\end{bmatrix}\)(标准误 0.040、0.031);\(\hat{\boldsymbol\Phi}_2=\begin{bmatrix}0&-0.090\\0&0\end{bmatrix}\)(0.031);\(\hat{\boldsymbol\Phi}_3=\begin{bmatrix}0&0\\0&-0.061\end{bmatrix}\)(0.024);\(\hat{\boldsymbol\Phi}_5=\begin{bmatrix}0&0.093\\0&0.087\end{bmatrix}\)(0.040、0.032);\(\hat{\boldsymbol\Sigma}=\begin{bmatrix}48.33&24.36\\24.36&30.03\end{bmatrix}\)。 残差检验:\(Q_2(4)=16.64\),\(Q_2(8)=31.55\);6 个 AR 参数,自由度 10 和 26,p 值 0.083 和 0.208,5% 水平下充分。收益可能有条件异方差(第 10 章讨论多元波动率)。 解读:(a) 新息同期相关 \(24/\sqrt{48\times30}=0.63\),接近样本相关;(b) 两序列均值显著为正,对数价格有上升趋势;(c)
\[\text{IBM}_t=1.0+0.13\,\text{SP5}_{t-1}-0.09\,\text{SP5}_{t-2}+0.09\,\text{SP5}_{t-5}+a_{1t},\]
\[\text{SP5}_t=0.4+0.08\,\text{SP5}_{t-1}-0.06\,\text{SP5}_{t-3}+0.09\,\text{SP5}_{t-5}+a_{2t}.\]
5% 水平下存在从 S&P 500 到 IBM 的单向动态关系:IBM 受市场过去变动影响,但 IBM 过去收益不显著影响市场,尽管同期相关很强。写成向量形式可见 \(\text{SP5}_t\) 是这个二元系统的驱动因子。

预测:把模型当作真模型。VAR(p) 在原点 \(h\) 的 1 步预测 \(\boldsymbol r_h(1)=\boldsymbol\phi_0+\sum_{i=1}^p\boldsymbol\Phi_i\boldsymbol r_{h+1-i}\),误差 \(\boldsymbol e_h(1)=\boldsymbol a_{h+1}\),协方差 \(\boldsymbol\Sigma\)。2 步:\(\boldsymbol r_h(2)=\boldsymbol\phi_0+\boldsymbol\Phi_1\boldsymbol r_h(1)+\sum_{i=2}^p\boldsymbol\Phi_i\boldsymbol r_{h+2-i}\),误差 \(\boldsymbol e_h(2)=\boldsymbol a_{h+2}+\boldsymbol\Phi_1\boldsymbol a_{h+1}\),协方差 \(\boldsymbol\Sigma+\boldsymbol\Phi_1\boldsymbol\Sigma\boldsymbol\Phi_1'\)。弱平稳时 \(\ell\) 步预测收敛到 \(\boldsymbol\mu\),误差协方差收敛到 \(\text{Cov}(\boldsymbol r_t)\)。 表 8.5(原点 \(h=996\),即 2008 年 12 月,简化 VAR(5)):

步 1 2 3 4 5 6
IBM 预测 1.95 0.30 −0.82 0.14 1.16 1.29
标准误 6.95 6.99 7.00 7.00 7.00 7.00
SP 预测 1.70 0.17 −1.26 −0.49 0.41 0.65
标准误 5.48 5.50 5.50 5.51 5.51 5.53

标准误收敛到样本标准差 7.03 与 5.53。

建模三步总结:(a) 用 M(i) 或信息准则定阶;(b) 用最小二乘估计,必要时删除不显著参数重估;(c) 用残差 \(Q_k(m)\) 检验充分性,也可检查条件异方差和异常值。充分后用于预测和动态关系推断。

SCA 演示:miden ibm,sp5. arfits 1 to 12. 给出样本均值(IBM 1.0891,SP5 0.4301)、标准差(7.0298、5.5346)、相关系数近似标准误 \(1/\sqrt{996}=0.03169\)、同期相关 0.65、滞后 1–12 的简化 CCM,以及逐步自回归汇总(各阶残差方差、\(\hat{\boldsymbol\Sigma}\) 特征值、卡方检验 M(i)、AIC、显著的 AR 系数符号;7–12 阶 M(i) 分别为 2.68、7.09、5.23、1.43、1.81、1.88,AIC 递增至 6.815)。mtsm m1. series ibm,sp5. model (i-p1*b-p2*b**2-p3*b**3-p5*b**5)series=c+noise. 设定模型;mestim 估计;用 p2(2,2)=0; cp2(2,2)=1 等设定零约束;miden r1,r2. maxl 12. 计算残差 CCM;mfore m1. nofs 6. 预测(第 997 期:IBM 1.954 (6.952),SP5 1.698 (5.480))。

SCA 预测续(第 998–1002 期):IBM 0.304 (6.988)、−0.815 (7.001)、0.138 (7.001)、1.162 (7.002)、1.294 (7.022);SP5 0.173 (5.497)、−1.263 (5.497)、−0.494 (5.507)、0.408 (5.508)、0.649 (5.528)。

8.2.5 脉冲响应函数(Impulse Response Function)(PDF p.433–437)

VAR(p) 可写成过去新息的线性函数(MA 表示):

\[\boldsymbol r_t=\boldsymbol\mu+\boldsymbol a_t+\boldsymbol\Psi_1\boldsymbol a_{t-1}+\boldsymbol\Psi_2\boldsymbol a_{t-2}+\cdots,\tag{8.21}\]
\(\boldsymbol\mu=[\boldsymbol\Phi(1)]^{-1}\boldsymbol\phi_0\),\(\boldsymbol\Psi_i\) 由 \((\boldsymbol I-\boldsymbol\Phi_1B-\dots-\boldsymbol\Phi_pB^p)(\boldsymbol I+\boldsymbol\Psi_1B+\boldsymbol\Psi_2B^2+\cdots)=\boldsymbol I\) 比较 \(B^i\) 的系数得到(递推 \(\boldsymbol\Psi_i=\sum_{j=1}^{\min(i,p)}\boldsymbol\Phi_j\boldsymbol\Psi_{i-j}\),\(\boldsymbol\Psi_0=\boldsymbol I\))。\(\boldsymbol\Psi_i\) 是过去新息 \(\boldsymbol a_{t-i}\) 对 \(\boldsymbol r_t\) 的影响,等价于 \(\boldsymbol a_t\) 对 \(\boldsymbol r_{t+i}\) 的影响,称脉冲响应函数。 但 \(\boldsymbol a_t\) 分量通常相关,\(\boldsymbol\Psi_i\) 元素难以解释。用 Cholesky 分解 \(\boldsymbol\Sigma=\boldsymbol L\boldsymbol G\boldsymbol L'\),\(\boldsymbol b_t=\boldsymbol L^{-1}\boldsymbol a_t\)(\(\text{Cov}=\boldsymbol G\),分量不相关):
\[\boldsymbol r_t=\boldsymbol\mu+\boldsymbol\Psi_0^*\boldsymbol b_t+\boldsymbol\Psi_1^*\boldsymbol b_{t-1}+\boldsymbol\Psi_2^*\boldsymbol b_{t-2}+\cdots,\quad\boldsymbol\Psi_0^*=\boldsymbol L,\ \boldsymbol\Psi_i^*=\boldsymbol\Psi_i\boldsymbol L,\tag{8.22}\]
\(\boldsymbol\Psi_i^*\) 称关于正交新息的脉冲响应函数,\(\Psi^*_{ij}(\ell)\) 为 \(b_{jt}\) 对 \(r_{i,t+\ell}\) 的影响;实践中常把 \(b_{it}\) 标准化为单位方差。弱点:结果依赖分量排序(\(b_{1t}=a_{1t}\) 不被变换),不同排序可得不同脉冲响应;解释与所用新息序列相关联。

S-Plus(FinMetrics)演示(IBM/SP5 月对数收益):VAR(y1, max.ar=10) 默认用 BIC 选阶,选 VAR(1)(BIC:ar(1) 12325.41,ar(2) 12339.42,…,ar(10) 12510.91,单调递增);criterion='AIC' 选 VAR(5)(AIC:12296.04、12290.48、12288.07、12288.2、12283.91、12289.96、12295.22、12296.13、12298.82、12305.37)。两软件信息准则标准化不同,数值不同但不影响选阶。为简便演示用 VAR(1):

\[\text{IBM}_t=1.06-0.03\,\text{IBM}_{t-1}+0.15\,\text{SP5}_{t-1}+a_{1t},\quad\text{SP5}_t=0.41-0.02\,\text{IBM}_{t-1}+0.10\,\text{SP5}_{t-1}+a_{2t}\]
(截距标准误 0.2249、0.1773;IBM.lag1 系数 t 值 −0.77、−0.69;SP5.lag1 系数 0.1503 (0.0525, t=2.86)、0.1020 (0.0414, t=2.46);\(R^2\) 0.0101、0.0075;残差尺度 7.0078、5.5247;logL −6193.988,AIC 12399.977,BIC 12429.393,HQ 12411.159)。按 t 统计量只有 \(\text{SP5}_{t-1}\) 在两个方程中有信息。图 8.5 残差图显示成簇的异常值。 预测:1 步 IBM 1.0798 (7.0078),SP5 0.4192 (5.5247);2 步 1.0899 (7.0434)、0.4274 (5.5453);3–6 步收敛到 1.0909 (7.0436)、0.4280 (5.5454)。VAR(1) 预测比 VAR(5) 更快收敛到样本均值(图 8.6)。 脉冲响应(impRes(var1.fit, period=6, std.err='asymptotic'),行为响应、列为新息,IBM 排第一):滞后 0:\(\begin{bmatrix}6.9973&0\\3.5432&4.2280\end{bmatrix}\)(标准误 0.1569;0.1558、0.0948);滞后 1:\(\begin{bmatrix}0.3088&0.6353\\0.2050&0.4312\end{bmatrix}\)(标准误约 0.22、0.17)。图 8.7:由于动态依赖弱,脉冲响应形态简单、迅速衰减。

8.3 向量移动平均模型(Vector Moving-Average Models, VMA)(PDF p.437–442)

\[\boldsymbol r_t=\boldsymbol\theta_0+\boldsymbol a_t-\boldsymbol\Theta_1\boldsymbol a_{t-1}-\dots-\boldsymbol\Theta_q\boldsymbol a_{t-q}\quad\text{或}\quad\boldsymbol r_t=\boldsymbol\theta_0+\boldsymbol\Theta(B)\boldsymbol a_t,\tag{8.23}\]

\(\boldsymbol\Theta(B)=\boldsymbol I-\boldsymbol\Theta_1B-\dots-\boldsymbol\Theta_qB^q\)。只要 \(\boldsymbol\Sigma\) 存在,VMA(q) 弱平稳;\(\boldsymbol\mu=\boldsymbol\theta_0\)。性质(\(\tilde{\boldsymbol r}_t=\boldsymbol r_t-\boldsymbol\theta_0\)):

  1. \(\text{Cov}(\boldsymbol r_t,\boldsymbol a_t)=\boldsymbol\Sigma\);
  2. \(\boldsymbol\Gamma_0=\boldsymbol\Sigma+\boldsymbol\Theta_1\boldsymbol\Sigma\boldsymbol\Theta_1'+\dots+\boldsymbol\Theta_q\boldsymbol\Sigma\boldsymbol\Theta_q'\);
  3. \(\boldsymbol\Gamma_\ell=0\)(\(\ell>q\));
  4. \(\boldsymbol\Gamma_\ell=\sum_{j=\ell}^q\boldsymbol\Theta_j\boldsymbol\Sigma\boldsymbol\Theta_{j-\ell}'\)(\(1\le\ell\le q\)),\(\boldsymbol\Theta_0=-\boldsymbol I\)。 因此
    \[\boldsymbol\rho_\ell=0,\quad\ell>q,\tag{8.24}\]
    样本 CCM 可用于识别 VMA 的阶。

二元 VMA(1):

\[\boldsymbol r_t=\boldsymbol\mu+\boldsymbol a_t-\boldsymbol\Theta\boldsymbol a_{t-1},\tag{8.25}\]
\[\begin{bmatrix}r_{1t}\\r_{2t}\end{bmatrix}=\begin{bmatrix}\mu_1\\\mu_2\end{bmatrix}+\begin{bmatrix}a_{1t}\\a_{2t}\end{bmatrix}-\begin{bmatrix}\Theta_{11}&\Theta_{12}\\\Theta_{21}&\Theta_{22}\end{bmatrix}\begin{bmatrix}a_{1,t-1}\\a_{2,t-1}\end{bmatrix},\tag{8.26}\]
只依赖当前与过去冲击,是有限记忆模型。\(\Theta_{12}\) 表示给定 \(a_{1,t-1}\) 时 \(r_{1t}\) 对 \(a_{2,t-1}\) 的依赖;\(\Theta_{12}=0\) 则 \(r_{1t}\) 不依赖 \(a_{2t}\) 的滞后值(从而不依赖 \(r_{2t}\) 的滞后值)。分类:\(\Theta_{12}=\Theta_{21}=0\) 为不耦合;\(\Theta_{12}=0\)、\(\Theta_{21}\ne0\) 为 \(r_{1t}\to r_{2t}\) 单向;反之亦然;都非零为反馈。\(r_{it}\) 之间的同期相关等于 \(a_{it}\) 之间的同期相关。可推广到 VMA(q)。

估计:比 VAR 复杂得多(Hillmer & Tiao 1979;Lütkepohl 2005)。似然方法有两种:条件似然(设 \(t\le0\) 时 \(\boldsymbol a_t=0\))与精确似然(把 \(t\le0\) 的 \(\boldsymbol a_t\) 作为额外参数)。以 VMA(1)、多元正态为例,数据依赖 \(\boldsymbol a_0\)。

  • 条件 MLE:设 \(\boldsymbol a_0=0\),由 \(\boldsymbol a_t=\boldsymbol r_t-\boldsymbol\theta_0+\boldsymbol\Theta\boldsymbol a_{t-1}\) 递推 \(\boldsymbol a_1=\boldsymbol r_1-\boldsymbol\theta_0\),\(\boldsymbol a_2=\boldsymbol r_2-\boldsymbol\theta_0+\boldsymbol\Theta_1\boldsymbol a_1,\dots\);似然
    \[f(\boldsymbol r_1,\dots,\boldsymbol r_T|\boldsymbol\theta_0,\boldsymbol\Theta_1,\boldsymbol\Sigma)=\prod_{t=1}^T\frac1{(2\pi)^{k/2}|\boldsymbol\Sigma|^{1/2}}\exp\left(-\frac12\boldsymbol a_t'\boldsymbol\Sigma^{-1}\boldsymbol a_t\right).\]
  • 精确 MLE:\(\boldsymbol a_0\) 未知需估计。\(\boldsymbol a_t=\tilde{\boldsymbol r}_t+\boldsymbol\Theta\boldsymbol a_{t-1}\)(8.27),反复代入
    \[\boldsymbol a_T=\tilde{\boldsymbol r}_T+\boldsymbol\Theta\tilde{\boldsymbol r}_{T-1}+\dots+\boldsymbol\Theta^{T-1}\tilde{\boldsymbol r}_1+\boldsymbol\Theta^T\boldsymbol a_0,\tag{8.28}\]
    \(\boldsymbol a_0\) 是数据的线性函数。定义 \(\boldsymbol r_t^*=\tilde{\boldsymbol r}_t+\boldsymbol\Theta\tilde{\boldsymbol r}_{t-1}+\dots+\boldsymbol\Theta^{t-1}\tilde{\boldsymbol r}_1\),则 \(\boldsymbol r_t^*=-\boldsymbol\Theta^t\boldsymbol a_0+\boldsymbol a_t\),是以 \(\boldsymbol a_0\) 为参数的多元线性回归;左乘 \(\boldsymbol\Sigma^{-1/2}\) 后用 OLS 估计 \(\hat{\boldsymbol a}_0\)。再以 \(\boldsymbol a_1=\boldsymbol r_1-\boldsymbol\theta_0+\boldsymbol\Theta\hat{\boldsymbol a}_0\) 起递推。该递推是 \((\boldsymbol a_0,\boldsymbol r_1,\dots,\boldsymbol r_T)\to(\boldsymbol a_0,\boldsymbol a_1,\dots,\boldsymbol a_T)\) 的线性变换,可得 \(\boldsymbol a_0\) 与数据的联合分布,积分掉 \(\boldsymbol a_0\) 得精确似然(Hillmer & Tiao 1979)。算法:给定 \(\boldsymbol\theta_0,\boldsymbol\Theta,\boldsymbol\Sigma\) 初值 → 估计 \(\boldsymbol a_0\) → 递推 \(\boldsymbol a_t\) → 计算精确似然、更新参数 → 迭代至收敛;适用于一般 VMA(q)。 精确法计算量更大,但更准确,尤其当 \(\boldsymbol\Theta\) 有模接近 1 的特征值时。怀疑过度差分时(例如对协整系统的各分量分别差分)精确 MLE 尤为重要。

VMA 建模三步:(a) 用样本 CCM 定阶(\(\ell>q\) 时 \(\boldsymbol\rho_\ell=0\));(b) 用条件或精确似然估计,样本不大时首选精确法;(c) 用残差 \(Q_k(m)\) 检验。预测与单变量 MA 相同。

例 8.5(IBM/SP5,VMA(5)):显著交叉相关主要在滞后 1、2、3、5:

\[\boldsymbol r_t=\boldsymbol\theta_0+\boldsymbol a_t-\boldsymbol\Theta_1\boldsymbol a_{t-1}-\boldsymbol\Theta_2\boldsymbol a_{t-2}-\boldsymbol\Theta_3\boldsymbol a_{t-3}-\boldsymbol\Theta_5\boldsymbol a_{t-5}.\tag{8.29}\]
表 8.6:(a) 条件似然全模型与 (b) 精确似然全模型几乎相同(IBM 行 \(\theta_0=1.1\) (0.24),SP5 行 0.4 (0.19);MA 系数绝对值 0.01–0.15,标准误 0.03–0.05)。(c) 精确似然简化模型:IBM 行 \(\theta_0=1.1\),非零系数 −0.13 (0.04)、0.08 (0.03)、−0.10 (0.04);SP5 行 \(\theta_0=0.4\),非零系数 −0.09 (0.03)、0.07 (0.02)、−0.09 (0.03);非零元均位于 SP5 新息那一列(按正文结论推断)。残差协方差与表 8.4 相近。简化模型残差 \(Q_2(4)=16.00\)、\(Q_2(8)=29.46\),对 \(\chi^2_{10}\)、\(\chi^2_{26}\) 的 p 值 0.10、0.291,5% 水平充分。 观察:(1) 条件与精确估计差别很小——样本不小且动态结构弱;(2) VMA(5) 与 VAR(5) 给出相同的动态关系:IBM 月收益依赖 S&P 500 过去收益,市场收益不依赖 IBM 滞后收益,动态结构由市场驱动;同期相关依然很强。

8.4 向量 ARMA 模型(Vector ARMA Models, VARMA)(PDF p.442–448)

单变量 ARMA 推广到向量时出现新问题,首先是可识别性(identifiability)——VARMA 可能不唯一。

  • 无害的情形:VMA(1) \(\boldsymbol r_t=\boldsymbol a_t-\begin{bmatrix}0&2\\0&0\end{bmatrix}\boldsymbol a_{t-1}\) 与 VAR(1) \(\boldsymbol r_t-\begin{bmatrix}0&-2\\0&0\end{bmatrix}\boldsymbol r_{t-1}=\boldsymbol a_t\) 相同:前者 \(r_{1t}=a_{1t}-2a_{2,t-1}\),\(r_{2t}=a_{2t}\);后者 \(r_{1t}+2r_{2,t-1}=a_{1t}\),\(r_{2t}=a_{2t}\),而 \(r_{2,t-1}=a_{2,t-1}\)。实际中用哪个都可以。
  • 麻烦的情形:VARMA(1,1)
    \[\boldsymbol r_t-\begin{bmatrix}0.8&-2\\0&0\end{bmatrix}\boldsymbol r_{t-1}=\boldsymbol a_t-\begin{bmatrix}-0.5&0\\0&0\end{bmatrix}\boldsymbol a_{t-1}\]
    与
    \[\boldsymbol r_t-\begin{bmatrix}0.8&-2+\eta\\0&\omega\end{bmatrix}\boldsymbol r_{t-1}=\boldsymbol a_t-\begin{bmatrix}-0.5&\eta\\0&\omega\end{bmatrix}\boldsymbol a_{t-1}\]
    对任意非零 \(\omega,\eta\) 都相同(因 \(r_{2t}=a_{2t}\),\(\omega,\eta\) 在 AR 与 MA 部分相互抵消)。没有适当约束时似然函数不唯一,类似回归中的完全多重共线性;即使没有分量是白噪声也可能出现。 解决方法:结构设定(structural specification,Tiao & Tsay 1989;Tsay 1991),本书不详述,因为多数金融应用中 VAR 和 VMA 已足够;用 VARMA 时一般只考虑低阶(如 VARMA(1,1)、VARMA(2,1)),尤其非季节序列。

一般形式:

\[\boldsymbol\Phi(B)\boldsymbol r_t=\boldsymbol\phi_0+\boldsymbol\Theta(B)\boldsymbol a_t,\]
假设两个矩阵多项式无左公因子(否则可化简)。弱平稳充要条件与 VAR(p) 相同(取决于 \(\boldsymbol\Phi(B)\))。\(v>0\) 时 \(\boldsymbol\Phi_v\)、\(\boldsymbol\Theta_v\) 的 \((i,j)\) 元衡量 \(r_{it}\) 对 \(r_{j,t-v}\)、\(a_{j,t-v}\) 的线性依赖;若所有 AR、MA 矩阵的 \((i,j)\) 元为 0,则 \(r_{it}\) 不依赖 \(r_{jt}\) 的滞后值。但逆命题不成立:\((i,j)\) 元非零时 \(r_{it}\) 也可能不依赖 \(r_{jt}\) 的任何滞后值。 二元模型 \(\begin{bmatrix}\Phi_{11}(B)&\Phi_{12}(B)\\\Phi_{21}(B)&\Phi_{22}(B)\end{bmatrix}\boldsymbol r_t=\begin{bmatrix}\Theta_{11}(B)&\Theta_{12}(B)\\\Theta_{21}(B)&\Theta_{22}(B)\end{bmatrix}\boldsymbol a_t\) 中,从 \(r_{1t}\) 到 \(r_{2t}\) 存在单向动态关系的充要条件:
\[\Phi_{22}(B)\Theta_{12}(B)-\Phi_{12}(B)\Theta_{22}(B)=0,\quad\text{但}\quad\Phi_{11}(B)\Theta_{21}(B)-\Phi_{21}(B)\Theta_{11}(B)\ne0.\tag{8.30}\]
推导:令 \(\Delta(B)=|\boldsymbol\Phi(B)|=\Phi_{11}\Phi_{22}-\Phi_{12}\Phi_{21}\),左乘伴随矩阵 \(\begin{bmatrix}\Phi_{22}&-\Phi_{12}\\-\Phi_{21}&\Phi_{11}\end{bmatrix}\):
\[\Delta(B)\begin{bmatrix}r_{1t}\\r_{2t}\end{bmatrix}=\begin{bmatrix}\Phi_{22}\Theta_{11}-\Phi_{12}\Theta_{21}&\Phi_{22}\Theta_{12}-\Phi_{12}\Theta_{22}\\\Phi_{11}\Theta_{21}-\Phi_{21}\Theta_{11}&\Phi_{11}\Theta_{22}-\Phi_{21}\Theta_{12}\end{bmatrix}\begin{bmatrix}a_{1t}\\a_{2t}\end{bmatrix}.\]
第一条件使 \(r_{1t}\) 不依赖 \(a_{2t}\)、\(r_{2t}\) 的过去值;第二条件使 \(r_{2t}\) 确实依赖 \(a_{1t}\) 的某些过去值。\(\Phi_{12}(B)=\Theta_{12}(B)=0\) 是单向关系的充分但非必要条件。 估计与检验:条件或精确 MLE;残差 \(Q_k(m)\) 的自由度为 \(k^2m-g\),\(g\) 为 AR 与 MA 矩阵中估计参数总数。

例 8.6(美国 1 年期与 3 年期国债固定期限利率,月度,1953.4–2001.1,574 个观测,圣路易斯联储):为保证正值,分析对数序列;图 8.8 两序列走势非常接近。M(i) 与 AIC 定为 VAR(4),但因拟合相近而采用 VARMA(2,1),精确似然估计并删除不显著参数(表 8.7)。\(\boldsymbol r_t=(r_{1t},r_{3t})'\):

\[\hat{\boldsymbol\Phi}_1=\begin{bmatrix}1.82&-0.97\\0&0.99\end{bmatrix},\ \hat{\boldsymbol\Phi}_2=\begin{bmatrix}-0.84&0.98\\0&0\end{bmatrix},\ \hat{\boldsymbol\phi}_0=\begin{bmatrix}0.028\\0.025\end{bmatrix},\ \hat{\boldsymbol\Theta}_1=\begin{bmatrix}0.90&-1.66\\0&-0.47\end{bmatrix},\ \hat{\boldsymbol\Sigma}\times10^3=\begin{bmatrix}3.58&2.50\\2.50&2.19\end{bmatrix}\]
(标准误:\(\boldsymbol\Phi_1\) 0.03、0.08、0.01;\(\boldsymbol\Phi_2\) 0.03、0.08;\(\phi_0\) 0.014、0.011;\(\boldsymbol\Theta_1\) 0.03、0.10、0.04)。残差在滞后 7、11 处有轻微序列和交叉相关,图 8.9 显示有异常值;模型可改进,但较好地刻画了动态结构。 特征:(1) 高同期相关 \(2.5/\sqrt{3.58\times2.19}=0.893\);(2) 所有 AR、MA 矩阵的 (2,1) 元为 0、某些 (1,2) 元非零,故存在从 3 年期到 1 年期利率的单向线性关系:
\[r_{3t}=0.025+0.99r_{3,t-1}+a_{3t}+0.47a_{3,t-1},\]
\[r_{1t}=0.028+1.82r_{1,t-1}-0.84r_{1,t-2}-0.97r_{3,t-1}+0.98r_{3,t-2}+a_{1t}-0.90a_{1,t-1}+1.66a_{3,t-1};\]
3 年期利率不依赖 1 年期的过去值,1 年期依赖 3 年期的过去值。(3) 两序列似乎有单位根,近似写为
\[(1-B)r_{3t}=0.03+(1+0.47B)a_{3t},\]
\[(1-B)(1-0.82B)r_{1t}=0.03-0.97B(1-B)r_{3t}+(1-0.9B)a_{1t}+1.66Ba_{3t}.\]
SCA 命令见附录 C(下一块)。

8.4.1 分量的边际模型(Marginal Models of Components)

\(k\) 维 ARMA(p,q) 的各分量边际(单变量)模型为 ARMA[kp, (k−1)p+q](上界)。两步得到:

  1. VMA(q) 的边际模型为 MA(q):CCM 在滞后 \(q\) 后为 0,故 \(r_{it}\) 的 ACF 在 \(q\) 后为 0,\(r_{it}=\theta_{i,0}+\sum_{j=1}^q\theta_{i,j}b_{i,t-j}\),\(\{b_{it}\}\) 不相关,参数是 VMA 参数的函数。
  2. 对角化 AR 矩阵多项式。二元 AR(1):\(\begin{bmatrix}1-\Phi_{11}B&-\Phi_{12}B\\-\Phi_{21}B&1-\Phi_{22}B\end{bmatrix}\boldsymbol r_t=\boldsymbol a_t\),左乘 \(\begin{bmatrix}1-\Phi_{22}B&\Phi_{12}B\\\Phi_{21}B&1-\Phi_{11}B\end{bmatrix}\) 得
    \[[(1-\Phi_{11}B)(1-\Phi_{22}B)-\Phi_{12}\Phi_{21}B^2]\boldsymbol r_t=\begin{bmatrix}1-\Phi_{22}B&\Phi_{12}B\\\Phi_{21}B&1-\Phi_{11}B\end{bmatrix}\boldsymbol a_t,\]
    左边 AR 多项式为 2 阶,右边为 VMA(1),故边际为 ARMA(2,1)。(原文此处矩阵与左乘矩阵的符号印刷略有出入,按伴随矩阵应为上式。)推广:\(k\) 维 VAR(1) 边际为 ARMA(k, k−1);\(k\) 维 VAR(p) 为 ARMA[kp, (k−1)p];VARMA 结果随之可得。实际边际阶数可能低得多。 (启示:单变量看起来需要高阶 ARMA 的序列,可能来自低阶的多元系统。)

8.5 单位根非平稳与协整(Unit-Root Nonstationarity and Cointegration)(PDF p.448–452)

示例:二元 ARMA(1,1)

\[\boldsymbol x_t-\begin{bmatrix}0.5&-1.0\\-0.25&0.5\end{bmatrix}\boldsymbol x_{t-1}=\boldsymbol a_t-\begin{bmatrix}0.2&-0.4\\-0.1&0.2\end{bmatrix}\boldsymbol a_{t-1},\tag{8.31}\]
\(\boldsymbol\Sigma\) 正定。AR 系数矩阵特征值为 0 和 1,故非弱平稳。图 8.10、8.11:\(\boldsymbol\Sigma=\boldsymbol I\) 时模拟 200 个点,两分量自相关很高,呈单位根特征。改写为 \(\begin{bmatrix}1-0.5B&B\\0.25B&1-0.5B\end{bmatrix}\boldsymbol x_t=\begin{bmatrix}1-0.2B&0.4B\\0.1B&1-0.2B\end{bmatrix}\boldsymbol a_t\),左乘 \(\begin{bmatrix}1-0.5B&-B\\-0.25B&1-0.5B\end{bmatrix}\) 得
\[\begin{bmatrix}1-B&0\\0&1-B\end{bmatrix}\boldsymbol x_t=\begin{bmatrix}1-0.7B&-0.6B\\-0.15B&1-0.7B\end{bmatrix}\boldsymbol a_t,\]
每个分量都是 ARIMA(0,1,1),单位根非平稳。 线性变换 \(\boldsymbol y_t=\boldsymbol L\boldsymbol x_t\),\(\boldsymbol b_t=\boldsymbol L\boldsymbol a_t\),\(\boldsymbol L=\begin{bmatrix}1.0&-2.0\\0.5&1.0\end{bmatrix}\)。由 \(\boldsymbol L\boldsymbol x_t=\boldsymbol L\boldsymbol\Phi\boldsymbol L^{-1}(\boldsymbol L\boldsymbol x_{t-1})+\boldsymbol b_t-\boldsymbol L\boldsymbol\Theta\boldsymbol L^{-1}\boldsymbol b_{t-1}\) 得
\[\boldsymbol y_t-\begin{bmatrix}1.0&0\\0&0\end{bmatrix}\boldsymbol y_{t-1}=\boldsymbol b_t-\begin{bmatrix}0.4&0\\0&0\end{bmatrix}\boldsymbol b_{t-1}.\tag{8.32}\]
(a) \(y_{1t}\)、\(y_{2t}\) 不耦合,同期相关等于 \(b_{1t},b_{2t}\) 之间的;(b) \(y_{1t}\) 为 ARIMA(0,1,1);(c) \(y_{2t}=b_{2t}\) 为白噪声。系统中只有一个单位根,\(x_{1t},x_{2t}\) 的单位根都来自 \(y_{1t}\),称 \(y_{1t}\) 为二者的共同趋势(common trend)。

协整(cointegration)定义:\(x_{1t},x_{2t}\) 都是单位根非平稳,但向量系统只有一个单位根。等价定义:(a) 两者都单位根非平稳;(b) 存在单位根平稳的线性组合(本例 \(y_{2t}=0.5x_{1t}+x_{2t}\))。一般地,\(k\) 维单位根非平稳序列中单位根个数 \(h\) 满足 \(0<h<k\) 时存在协整;\(k-h\) 称协整因子个数,即单位根平稳的不同线性组合个数;这些组合的系数称协整向量(本例 \((0.5,1)'\))。参考 Box & Tiao (1977)、Engle & Granger (1987)、Stock & Watson (1988)、Johansen (1988)。 作者观点:协整检验在实际应用中有困难,主要原因是忽略了分量的尺度效应(Cochrane 1988;Tiao, Tsay & Wang 1993)。作者对协整检验的实用价值有所保留,但认为协整思想与金融高度相关:例如诺基亚在赫尔辛基的股价必须与其在纽约的 ADR 价格同步变动,否则存在套利机会;若股价有单位根,两价格序列必协整——实际中需考虑交易成本和汇率风险后才成立(8.7 节讨论)。

8.5.1 误差修正形式(An Error Correction Form)

协整系统中单位根非平稳分量多于单位根个数,对各分量分别差分会导致过度差分,使 MA 矩阵多项式出现单位根(不可逆),带来估计困难。Engle & Granger (1987) 提出误差修正表示。对 (8.31),\(\Delta\boldsymbol x_t=\boldsymbol x_t-\boldsymbol x_{t-1}\):

\[\Delta\boldsymbol x_t=\begin{bmatrix}-0.5&-1.0\\-0.25&-0.5\end{bmatrix}\boldsymbol x_{t-1}+\boldsymbol a_t-\begin{bmatrix}0.2&-0.4\\-0.1&0.2\end{bmatrix}\boldsymbol a_{t-1}=\begin{bmatrix}-1\\-0.5\end{bmatrix}[0.5,1.0]\boldsymbol x_{t-1}+\boldsymbol a_t-\boldsymbol\Theta\boldsymbol a_{t-1}.\]
\(\Delta\boldsymbol x_t\) 与 \([0.5,1.0]\boldsymbol x_t=y_{2t}\) 都单位根平稳,模型平稳;MA 多项式不变,没有不可逆问题,称误差修正模型(ECM)。一般协整 VARMA(p,q),\(m\) 个协整因子(\(m<k\)):
\[\Delta\boldsymbol x_t=\boldsymbol\alpha\boldsymbol\beta'\boldsymbol x_{t-1}+\sum_{i=1}^{p-1}\boldsymbol\Phi_i^*\Delta\boldsymbol x_{t-i}+\boldsymbol a_t-\sum_{j=1}^q\boldsymbol\Theta_j\boldsymbol a_{t-j},\tag{8.33}\]
\(\boldsymbol\alpha,\boldsymbol\beta\) 为 \(k\times m\) 满秩矩阵,
\[\boldsymbol\Phi_j^*=-\sum_{i=j+1}^p\boldsymbol\Phi_i,\ j=1,\dots,p-1;\qquad\boldsymbol\alpha\boldsymbol\beta'=\boldsymbol\Phi_p+\dots+\boldsymbol\Phi_1-\boldsymbol I=-\boldsymbol\Phi(1).\tag{8.34}\]
(比较 AR 多项式系数可得。)\(\boldsymbol\beta'\boldsymbol x_t\) 单位根平稳,\(\boldsymbol\beta\) 的列是协整向量。 直观:\(\boldsymbol\beta'\boldsymbol x_{t-1}\) 可看作对过度差分系统的"补偿"项。单位根理论表明单位根非平稳序列与平稳序列的样本相关随样本增大收敛到 0(Tsay & Tiao 1990),ECM 中 \(\boldsymbol x_{t-1}\) 非平稳而 \(\Delta\boldsymbol x_t\) 平稳,二者只能通过平稳组合 \(\boldsymbol\beta'\boldsymbol x_{t-1}\) 有意义地相关。 注:讨论假设单位根重数为 1,可推广;给定 \(m\) 时 (8.33) 可用似然方法估计;ECM 构造方式不唯一,可用任意 \(\boldsymbol\alpha\boldsymbol\beta'\boldsymbol x_{t-v}\)(\(1\le v\le p\))并相应修改 \(\boldsymbol\Phi_i^*\)。

8.6 协整 VAR 模型(Cointegrated VAR Models)(PDF p.452–456,续见下一块)

\(k\) 维 VAR(p) 可能含时间趋势:

\[\boldsymbol x_t=\boldsymbol\mu_t+\boldsymbol\Phi_1\boldsymbol x_{t-1}+\dots+\boldsymbol\Phi_p\boldsymbol x_{t-p}+\boldsymbol a_t,\tag{8.35}\]
\(\boldsymbol a_t\) 高斯,\(\boldsymbol\mu_t=\boldsymbol\mu_0+\boldsymbol\mu_1t\)。\(|\boldsymbol\Phi(B)|\) 零点全在单位圆外时 \(\boldsymbol x_t\) 单位根平稳,称 I(0)(非积分);\(|\boldsymbol\Phi(1)|=0\) 时单位根非平稳。假设至多 I(1)(若 \(x_{it}\) 非平稳则 \((1-B)x_{it}\) 平稳)。

ECM:

\[\Delta\boldsymbol x_t=\boldsymbol\mu_t+\boldsymbol\Pi\boldsymbol x_{t-1}+\boldsymbol\Phi_1^*\Delta\boldsymbol x_{t-1}+\dots+\boldsymbol\Phi_{p-1}^*\Delta\boldsymbol x_{t-p+1}+\boldsymbol a_t,\tag{8.36}\]
\(\boldsymbol\Pi=\boldsymbol\alpha\boldsymbol\beta'=-\boldsymbol\Phi(1)\),\(\boldsymbol\Pi\boldsymbol x_{t-1}\) 称误差修正项。由 ECM 恢复原系数:\(\boldsymbol\Phi_1=\boldsymbol I+\boldsymbol\Pi+\boldsymbol\Phi_1^*\),\(\boldsymbol\Phi_i=\boldsymbol\Phi_i^*-\boldsymbol\Phi_{i-1}^*\)(\(i=2,\dots,p\),\(\boldsymbol\Phi_p^*=0\))。\(\Delta\boldsymbol x_t\) 为 I(0)。 有单位根时 \(|\boldsymbol\Phi(1)|=0\),\(\boldsymbol\Pi\) 奇异。三种情形:

  1. \(\text{Rank}(\boldsymbol\Pi)=0\):\(\boldsymbol\Pi=0\),无协整,\(\Delta\boldsymbol x_t\) 为带确定趋势的 VAR(p−1)。
  2. \(\text{Rank}(\boldsymbol\Pi)=k\):\(|\boldsymbol\Phi(1)|\ne0\),无单位根,\(\boldsymbol x_t\) 为 I(0),直接研究 \(\boldsymbol x_t\)。
  3. \(0<\text{Rank}(\boldsymbol\Pi)=m<k\):\(\boldsymbol\Pi=\boldsymbol\alpha\boldsymbol\beta'\)(8.37),\(\boldsymbol\alpha,\boldsymbol\beta\) 为 \(k\times m\)、秩 \(m\),
    \[\Delta\boldsymbol x_t=\boldsymbol\mu_t+\boldsymbol\alpha\boldsymbol\beta'\boldsymbol x_{t-1}+\boldsymbol\Phi_1^*\Delta\boldsymbol x_{t-1}+\dots+\boldsymbol\Phi_{p-1}^*\Delta\boldsymbol x_{t-p+1}+\boldsymbol a_t,\tag{8.38}\]
    \(\boldsymbol x_t\) 有 \(m\) 个线性独立协整向量 \(\boldsymbol w_t=\boldsymbol\beta'\boldsymbol x_t\),以及 \(k-m\) 个单位根,构成 \(k-m\) 个共同随机趋势。

共同趋势的表示:取 \(\boldsymbol\alpha\) 的正交补 \(\boldsymbol\alpha_\perp\)(\(k\times(k-m)\),\(\boldsymbol\alpha_\perp'\boldsymbol\alpha=0\)),\(\boldsymbol y_t=\boldsymbol\alpha_\perp'\boldsymbol x_t\);左乘 ECM 后误差修正项消失,\(\boldsymbol y_t\) 有 \(k-m\) 个单位根。8.5.1 例中 \(\boldsymbol\alpha=(-1,-0.5)'\),\(\boldsymbol\alpha_\perp=(1,-2)'\),\(y_t=x_{1t}-2x_{2t}\),正是 (8.32) 中的 \(y_{1t}\)。 识别:分解不唯一——对任意 \(m\times m\) 正交阵 \(\boldsymbol\Omega\),\(\boldsymbol\alpha\boldsymbol\beta'=(\boldsymbol\alpha\boldsymbol\Omega)(\boldsymbol\beta\boldsymbol\Omega)'\)。常要求 \(\boldsymbol\beta'=[\boldsymbol I_m,\boldsymbol\beta_1']\)(\(\boldsymbol\beta_1\) 为 \((k-m)\times m\)),可能需要重排 \(\boldsymbol x_t\) 使前 \(m\) 个分量都有单位根。\(\boldsymbol\alpha,\boldsymbol\beta\) 还需满足使 \(\boldsymbol w_t\) 平稳的约束。例:二元 VAR(1)、一个协整向量,\(\Delta\boldsymbol x_t=\boldsymbol\mu_t+\begin{bmatrix}\alpha_1\\\alpha_2\end{bmatrix}[1,\beta_1]\boldsymbol x_{t-1}+\boldsymbol a_t\);左乘 \(\boldsymbol\beta'\) 得

\[w_t=\boldsymbol\beta'\boldsymbol\mu_t+(1+\alpha_1+\alpha_2\beta_1)w_{t-1}+b_t,\quad b_t=\boldsymbol\beta'\boldsymbol a_t,\]
\(w_t\) 为平稳 AR(1),需 \(|1+\alpha_1+\alpha_2\beta_1|<1\)。 \(\boldsymbol\Pi\) 的秩就是协整向量个数,因此检验协整就是检验 \(\boldsymbol\Pi\) 的秩(Johansen 1988, 1995;Reinsel & Ahn 1992)。

8.6.1 确定性函数的设定

与单变量一样,协整检验的极限分布依赖 \(\boldsymbol\mu_t\)(记住若协整,\(\boldsymbol\alpha_\perp'\boldsymbol x_t\) 表示共同随机趋势):

  1. \(\boldsymbol\mu_t=0\):所有分量为无漂移 I(1),\(\boldsymbol w_t=\boldsymbol\beta'\boldsymbol x_t\) 均值 0。
  2. \(\boldsymbol\mu_t=\boldsymbol\mu_0=\boldsymbol\alpha\boldsymbol c_0\)(\(\boldsymbol c_0\) 为 \(m\) 维非零常数):ECM 为 \(\Delta\boldsymbol x_t=\boldsymbol\alpha(\boldsymbol\beta'\boldsymbol x_{t-1}+\boldsymbol c_0)+\cdots\),分量为无漂移 I(1),\(\boldsymbol w_t\) 均值非零(\(-\boldsymbol c_0\))——受限常数(restricted constant)。
  3. \(\boldsymbol\mu_t=\boldsymbol\mu_0\ne0\):分量为带漂移 \(\boldsymbol\mu_0\) 的 I(1),\(\boldsymbol w_t\) 可有非零均值。
  4. \(\boldsymbol\mu_t=\boldsymbol\mu_0+\boldsymbol\alpha\boldsymbol c_1t\):ECM 为 \(\Delta\boldsymbol x_t=\boldsymbol\mu_0+\boldsymbol\alpha(\boldsymbol\beta'\boldsymbol x_{t-1}+\boldsymbol c_1t)+\cdots\),分量为带漂移 I(1),\(\boldsymbol w_t\) 有线性趋势——受限趋势(restricted trend)。
  5. \(\boldsymbol\mu_t=\boldsymbol\mu_0+\boldsymbol\mu_1t\) 都不受限:分量有二次趋势,\(\boldsymbol w_t\) 有线性趋势。 最后一种在实证中不常见;第一种对经济序列不常见,但可代表某些资产的对数价格;第三种也适合资产价格建模。

8.6.2 极大似然估计(Johansen 方法)

数据 \(\{\boldsymbol x_t\}_{t=1}^T\),记 \(\boldsymbol\mu_t=\boldsymbol\mu\boldsymbol d_t\),\(\boldsymbol d_t=[1,t]'\)(具体取决于上节设定)。给定秩 \(m\):

\[\Delta\boldsymbol x_t=\boldsymbol\mu\boldsymbol d_t+\boldsymbol\alpha\boldsymbol\beta'\boldsymbol x_{t-1}+\boldsymbol\Phi_1^*\Delta\boldsymbol x_{t-1}+\dots+\boldsymbol\Phi_{p-1}^*\Delta\boldsymbol x_{t-p+1}+\boldsymbol a_t,\quad t=p+1,\dots,T.\tag{8.39}\]
关键步骤:对确定项和平稳项"集中"似然,做两个多元线性回归:
\[\Delta\boldsymbol x_t=\boldsymbol\gamma_0\boldsymbol d_t+\boldsymbol\Omega_1\Delta\boldsymbol x_{t-1}+\dots+\boldsymbol\Omega_{p-1}\Delta\boldsymbol x_{t-p+1}+\boldsymbol u_t,\tag{8.40}\]
\[\boldsymbol x_{t-1}=\boldsymbol\gamma_1\boldsymbol d_t+\boldsymbol\Omega_1\Delta\boldsymbol x_{t-1}+\dots+\boldsymbol\Omega_{p-1}\Delta\boldsymbol x_{t-p+1}+\boldsymbol v_t,\tag{8.41}\]
残差 \(\hat{\boldsymbol u}_t,\hat{\boldsymbol v}_t\),样本协方差
\[\boldsymbol S_{00}=\frac1{T-p}\sum\hat{\boldsymbol u}_t\hat{\boldsymbol u}_t',\quad\boldsymbol S_{01}=\frac1{T-p}\sum\hat{\boldsymbol u}_t\hat{\boldsymbol v}_t',\quad\boldsymbol S_{11}=\frac1{T-p}\sum\hat{\boldsymbol v}_t\hat{\boldsymbol v}_t'.\]
求 \(\boldsymbol S_{10}\boldsymbol S_{00}^{-1}\boldsymbol S_{01}\) 关于 \(\boldsymbol S_{11}\) 的广义特征值问题
\[|\lambda\boldsymbol S_{11}-\boldsymbol S_{10}\boldsymbol S_{00}^{-1}\boldsymbol S_{01}|=0,\]
特征对 \((\hat\lambda_i,\boldsymbol e_i)\),\(\hat\lambda_1>\dots>\hat\lambda_k\),特征向量标准化为 \(\boldsymbol e'\boldsymbol S_{11}\boldsymbol e=\boldsymbol I\)。(\(\hat\lambda_i\) 即 \(\Delta\boldsymbol x_t\) 与 \(\boldsymbol x_{t-1}\) 在剔除确定项和短期动态后的平方典型相关系数。)

  • 未标准化的 \(\boldsymbol\beta\) 的 MLE:\(\hat{\boldsymbol\beta}=[\boldsymbol e_1,\dots,\boldsymbol e_m]\),再按识别约束和标准化得到 \(\hat{\boldsymbol\beta}_c\);
  • 其他参数由多元线性回归 \(\Delta\boldsymbol x_t=\boldsymbol\mu\boldsymbol d_t+\boldsymbol\alpha\hat{\boldsymbol\beta}_c'\boldsymbol x_{t-1}+\sum\boldsymbol\Phi_i^*\Delta\boldsymbol x_{t-i}+\boldsymbol a_t\) 得到;
  • \(m\) 个协整向量下最大化似然值:\(L_{\max}^{-2/T}\propto|\boldsymbol S_{00}|\prod_{i=1}^m(1-\hat\lambda_i)\),用于检验 \(\text{Rank}(\boldsymbol\Pi)=m\) 的似然比检验;
  • 正交补估计:\(\hat{\boldsymbol\alpha}_\perp=\boldsymbol S_{00}^{-1}\boldsymbol S_{11}[\boldsymbol e_{m+1},\dots,\boldsymbol e_k]\),\(\hat{\boldsymbol\beta}_\perp=\boldsymbol S_{11}[\boldsymbol e_{m+1},\dots,\boldsymbol e_k]\)。

8.6.3 协整检验(本块只到开头,续见下一块)

给定确定项 \(\boldsymbol\mu_t\),用似然比检验 \(\boldsymbol\Pi\) 的秩。\(H(m)\):\(\text{Rank}(\boldsymbol\Pi)=m\)(如 \(H(0)\) 表示 \(\boldsymbol\Pi=0\)、无协整)。嵌套关系 \(H(0)\subset\dots\subset H(m)\subset\dots\subset H(k)\)。检验用 ECM:\(\Delta\boldsymbol x_t=\boldsymbol\mu\boldsymbol d_t+\boldsymbol\Pi\boldsymbol x_{t-1}+\sum_{i=1}^{p-1}\boldsymbol\Phi_i^*\Delta\boldsymbol x_{t-i}+\boldsymbol a_t\)。\(\boldsymbol\Pi\) 的秩等于其非零特征值个数;由于这是多元线性回归形式,\(\boldsymbol\Pi\) 与剔除 \(\boldsymbol d_t\)、\(\Delta\boldsymbol x_{t-i}\) 影响后 \(\boldsymbol x_{t-1}\) 与 \(\Delta\boldsymbol x_t\) 之间的协方差矩阵相关……(PDF p.456 在此句中断,迹检验与最大特征值检验统计量见下一块。)

第 8 章(本块覆盖部分)要点

  • 交叉相关矩阵 \(\boldsymbol\rho_\ell\) 一般不对称,\(\boldsymbol\rho_\ell=\boldsymbol\rho_{-\ell}'\);用 \(+/-/\cdot\) 简化记号阅读多个 CCM;多元混成检验 \(Q_k(m)\sim\chi^2_{k^2m}\)。
  • VAR:简约式与结构式经 Cholesky 分解等价;平稳条件为伴随矩阵特征值在单位圆内;定阶用 M(i)、AIC/BIC/HQ;OLS 估计;\(Q_k(m)\) 自由度 \(k^2m-g\);预测误差协方差递推;正交脉冲响应依赖变量排序。
  • VMA:CCM 在 \(q\) 阶截尾;条件 vs 精确似然,过度差分时精确似然重要。
  • VARMA:可识别性问题;系数矩阵 \((i,j)\) 元为 0 是无领先-滞后的充分非必要条件;边际模型为 ARMA[kp, (k−1)p+q]。
  • 协整:分量 I(1) 但存在 I(0) 线性组合;ECM \(\Delta\boldsymbol x_t=\boldsymbol\alpha\boldsymbol\beta'\boldsymbol x_{t-1}+\cdots\) 避免过度差分;\(\text{Rank}(\boldsymbol\Pi)\) = 协整向量个数;Johansen MLE 基于广义特征值;确定项的五种设定影响检验分布。
  • 实证:IBM 月收益受 S&P 500 滞后收益影响,反之不成立;3 年期利率单向领先 1 年期利率。

第 8 章与量化交易的关联(本块部分)

  • 领先-滞后与信号研究:CCM、VAR 系数结构和单向关系检验(Granger 因果)是寻找跨资产/跨市场领先-滞后信号的标准工具,例如指数期货领先现货、大盘股领先小盘股、长端利率领先短端利率;但要警惕第 5 章的非同步交易会制造虚假的领先-滞后。
  • 风险建模:同期相关矩阵与 VAR 残差协方差 \(\boldsymbol\Sigma\) 是组合风险的核心输入;例 8.2 国债同期相关结构(长端相关高)直接对应利率曲线因子(水平/斜率)。
  • 配对交易与统计套利:协整是配对交易的理论基础——两价格 I(1) 但价差平稳,误差修正项 \(\boldsymbol\beta'\boldsymbol x_{t-1}\) 就是交易信号(价差偏离均衡后回归);8.6 节 Johansen 方法用于多资产篮子协整;\(|1+\alpha_1+\alpha_2\beta_1|\) 决定价差回归速度(半衰期)。作者关于协整检验实用性的保留意见提示实盘中应更重视经济逻辑(如诺基亚本地股与 ADR、期现)和样本外稳定性。
  • 预测与回测:VAR 多步预测快速收敛到均值,说明月度收益可预测性很弱(\(R^2\approx1\%\));BIC 与 AIC 定阶不同(例中 1 阶 vs 5 阶),过度参数化容易过拟合。
  • 宏观/利率:VARMA 与脉冲响应用于分析利率、宏观冲击对资产的传导;正交化顺序选择需要经济依据。

(第 8 章后续内容——协整检验统计量、8.7 门限协整与套利、附录与习题——见下一块。)