量化交易中文教材

元信息:《Analysis of Financial Time Series》第 3 版,Ruey S. Tsay(Wiley, 2010);本笔记负责 PDF 第 1–232 页(前置部分书页 i–xxiii;第 1–3 章完整;第 4 章至 4.2.2 节门限检验中途,即书页 175–212)。

Tsay《金融时间序列分析》精读笔记(PDF p.1–232)

前置部分(PDF p.1–20)

  • p.1 封面 / p.2 版权页:第 3 版,作者 Ruey S. Tsay(芝加哥大学 Booth 商学院),Wiley 2010,ISBN 978-0-470-41435-4,属 Wiley 概率统计丛书。
  • p.3–11 目录:全书 12 章:1 金融时间序列及其特征;2 线性时间序列分析;3 条件异方差模型;4 非线性模型;5 高频数据与市场微观结构;6 连续时间模型(Ito 引理、Black–Scholes、跳扩散);7 极值、分位数与 VaR;8 多元时间序列(VAR、协整、配对交易);9 主成分分析与因子模型;10 多元波动率模型;11 状态空间模型与 Kalman 滤波;12 MCMC 方法。
  • p.13–14 第 3 版前言:修订动机是 2008 年金融危机;目标是更新数据、加入 R(Rmetrics、FinTS 包)命令。新增内容:第 3 章偏态分布用于波动率建模;第 5 章高频交易数据新性质与非线性久期模型;第 7 章以损失函数统一 VaR、引入期望损失 ES(即 CVaR)和极值指数(extremal index,处理极值的聚集/相依);第 8 章协整用于配对交易;第 10 章动态相关模型。作者说明不涉及信用风险和操作风险。书网站 faculty.chicagobooth.edu/ruey.tsay/teaching/fts3。
  • p.15–16 第 2 版前言:提到 2003 年诺贝尔奖(Engle、Granger);新增第 9 章(PCA 与因子模型)、第 11 章(状态空间与 Kalman 滤波);第 2 章加入单位根检验与异方差/序列相关下的一致协方差估计;第 3 章加入高频数据与日内高低价的波动率估计;第 12 章加入前向滤波后向抽样(FFBS)估计随机波动率。
  • p.17–19 第 1 版前言:本书源于芝大 MBA 课程。特色:结合实证数据、涵盖 VaR、高频数据、MCMC。软件:SCA(线性模型)、RATS(波动率模型)、S-Plus(神经网络)。建议 MBA 课程以第 2、3 章为核心。
  • p.12、p.20 为空白页。

第 1 章 金融时间序列及其特征(Financial Time Series and Their Characteristics,PDF p.21–47)

章首导言(PDF p.21–22)

金融时间序列分析研究资产随时间的估值(asset valuation over time)。它与一般时间序列分析的关键区别是:金融理论本身及其实证序列都含有不确定性,例如波动率(volatility)有多种定义且不可直接观测,因此统计理论和方法特别重要。导言随后逐章概述全书(见上文目录),强调全书以真实数据和实证分析为主,并给出程序代码。

1.1 资产收益率(Asset Returns,PDF p.22–26)

为什么用收益率而非价格(Campbell, Lo & MacKinlay 1997):(1) 收益率是投资机会的完整且无量纲(scale-free)的概括;(2) 收益率序列统计性质更好(如更接近平稳)。

设 \(P_t\) 为 \(t\) 时刻资产价格,暂不考虑分红。

单期简单收益率(one-period simple return):简单总收益率(gross return)

\[1+R_t=\frac{P_t}{P_{t-1}},\qquad P_t=P_{t-1}(1+R_t)\tag{1.1}\]
简单净收益率
\[R_t=\frac{P_t}{P_{t-1}}-1=\frac{P_t-P_{t-1}}{P_{t-1}}.\tag{1.2}\]

多期简单收益率:持有 \(k\) 期的总收益率是各单期总收益率之积(复合收益率,compound return):

\[1+R_t[k]=\frac{P_t}{P_{t-k}}=\prod_{j=0}^{k-1}(1+R_{t-j}),\qquad R_t[k]=\frac{P_t-P_{t-k}}{P_{t-k}}.\]
未注明时间间隔时默认按年。持有 \(k\) 年的年化收益率(annualized return)是几何平均:
\[\text{Annualized}\{R_t[k]\}=\Big[\prod_{j=0}^{k-1}(1+R_{t-j})\Big]^{1/k}-1=\exp\Big[\frac1k\sum_{j=0}^{k-1}\ln(1+R_{t-j})\Big]-1.\]
单期收益率较小时用一阶 Taylor 展开近似为算术平均:
\[\text{Annualized}\{R_t[k]\}\approx\frac1k\sum_{j=0}^{k-1}R_{t-j}.\tag{1.3}\]
作者提醒某些应用中该近似精度不够(收益率大或波动大时算术平均高估几何平均)。

连续复利(continuous compounding):年利率 10%、本金 1 美元,一年付息 \(m\) 次则年末净值为 \((1+0.1/m)^m\)。表 1.1:年付 1.10000,半年 1.10250,季度 1.10381,月 1.10471,周 1.10506,日 1.10516,连续 \(e^{0.1}=1.10517\)。一般地

\[A=C\exp(r\times n),\tag{1.4}\qquad C=A\exp(-r\times n),\tag{1.5}\]
\(A\) 为终值,\(C\) 为初始资本,\(r\) 为年利率,\(n\) 为年数;(1.5) 即连续复利下的现值(present value)。

连续复利收益率 / 对数收益率(continuously compounded return, log return):

\[r_t=\ln(1+R_t)=\ln\frac{P_t}{P_{t-1}}=p_t-p_{t-1},\quad p_t=\ln P_t.\tag{1.6}\]
优点:(1) 多期对数收益率是单期之和,\(r_t[k]=r_t+r_{t-1}+\cdots+r_{t-k+1}\);(2) 统计性质更易处理。

组合收益率(portfolio return):权重 \(w_i\)(投入资产 \(i\) 的价值比例)时,组合简单收益率是加权平均 \(R_{p,t}=\sum_{i=1}^N w_iR_{it}\);但对数收益率无此性质,仅在收益率很小时近似 \(r_{p,t}\approx\sum w_i r_{it}\)。常见误区:直接用对数收益率加权得到组合收益,在大波动时有误差。

分红(dividend payment):\(D_t\) 为 \(t-1\) 到 \(t\) 间分红,\(P_t\) 不含分红,则

\[R_t=\frac{P_t+D_t}{P_{t-1}}-1,\qquad r_t=\ln(P_t+D_t)-\ln P_{t-1}.\]

超额收益率(excess return):相对参考资产(常取短期美国国债 T-bill)的收益差:

\[Z_t=R_t-R_{0t},\qquad z_t=r_t-r_{0t}.\tag{1.7}\]
金融文献中视之为"做多资产、做空参考资产、零初始投入"的套利组合收益。

注(多空头寸):多头(long)指持有资产;空头(short)指借入资产卖出,日后须买回同样股数归还,因此价格下跌对空头有利;持有空头期间若发放现金分红,空头须自掏腰包向出借方支付等额分红。

关系汇总:\(r_t=\ln(1+R_t)\),\(R_t=e^{r_t}-1\);若以百分比表示,\(r_t=100\ln(1+R_t/100)\),\(R_t=100(e^{r_t/100}-1)\)。时间聚合:简单总收益率相乘,对数收益率相加。

例 1.1:月对数收益率 4.46% 对应简单收益率 \(100[\exp(0.0446)-1]=4.56\%\);一季度内三个月对数收益率 4.46%、−7.34%、10.77%,则季度对数收益率为 \(4.46-7.34+10.77=7.89\%\)。

1.2 收益率的分布性质(Distributional Properties of Returns,PDF p.27–41)

研究对象:\(N\) 个资产、\(T\) 期的对数收益率 \(\{r_{it}\}\),也可是简单收益率 \(\{R_{it}\}\) 或对数超额收益率 \(\{z_{it}\}\)。目标是理解收益率在资产间和时间上的行为。

1.2.1 统计分布及其矩的回顾(PDF p.27–33)

联合分布(joint distribution):\(F_{X,Y}(x,y;\theta)=P(X\le x,Y\le y;\theta)\)(不等号逐分量),若联合密度存在则 \(F=\int_{-\infty}^x\int_{-\infty}^y f(w,z;\theta)\,dz\,dw\)。

边际分布(marginal distribution):\(F_X(x;\theta)=F_{X,Y}(x,\infty,\dots,\infty;\theta)\),即积分掉 \(Y\)。标量情形即累积分布函数 CDF,单调不减,\(F(-\infty)=0\),\(F(\infty)=1\)。分位数(quantile):\(x_p=\inf_x\{x\,|\,p\le F_X(x)\}\) 为第 \(100p\) 百分位数(后文 VaR 即基于此)。

条件分布(conditional distribution):\(F_{X|Y\le y}(x)=P(X\le x,Y\le y)/P(Y\le y)\);条件密度

\[f_{x|y}(x;\theta)=\frac{f_{x,y}(x,y;\theta)}{f_y(y;\theta)},\tag{1.8}\]
\[f_{x,y}(x,y;\theta)=f_{x|y}(x;\theta)\,f_y(y;\theta).\tag{1.9}\]
(1.9) 在时间序列极大似然估计中被反复使用。独立当且仅当 \(f_{x|y}=f_x\)。

矩(moments):第 \(\ell\) 阶原点矩 \(m'_\ell=E(X^\ell)\),中心矩 \(m_\ell=E[(X-\mu_x)^\ell]\)。一阶矩为均值 \(\mu_x\),二阶中心矩为方差 \(\sigma_x^2\)。正态分布由前两阶矩唯一确定。

偏度与峰度(skewness, kurtosis):

\[S(x)=E\Big[\frac{(X-\mu_x)^3}{\sigma_x^3}\Big],\qquad K(x)=E\Big[\frac{(X-\mu_x)^4}{\sigma_x^4}\Big].\]
\(K-3\) 称超额峰度(excess kurtosis),正态为 0。超额峰度为正称厚尾/尖峰(heavy tails, leptokurtic),样本中更易出现极端值;为负称短尾(platykurtic),如有限区间上的均匀分布。

样本估计:

\[\hat\mu_x=\frac1T\sum x_t\ (1.10),\quad \hat\sigma_x^2=\frac1{T-1}\sum(x_t-\hat\mu_x)^2\ (1.11),\]
\[\hat S(x)=\frac{1}{(T-1)\hat\sigma_x^3}\sum(x_t-\hat\mu_x)^3\ (1.12),\quad \hat K(x)=\frac{1}{(T-1)\hat\sigma_x^4}\sum(x_t-\hat\mu_x)^4\ (1.13).\]

正态性检验:正态假设下 \(\hat S\) 与 \(\hat K-3\) 渐近服从均值 0、方差分别为 \(6/T\) 与 \(24/T\) 的正态分布。

  • 偏度检验:\(H_0:S(r)=0\),\(t=\hat S(r)/\sqrt{6/T}\),\(|t|>Z_{\alpha/2}\) 时拒绝。
  • 峰度检验:\(H_0:K(r)-3=0\),\(t=(\hat K(r)-3)/\sqrt{24/T}\)。
  • Jarque–Bera 检验(1987):
    \[JB=\frac{\hat S^2(r)}{6/T}+\frac{[\hat K(r)-3]^2}{24/T}\ \xrightarrow{d}\ \chi^2_2,\]
    p 值小于显著性水平则拒绝正态。

例 1.2:IBM 日简单收益率(数据文件 d-ibm3dx7008.txt,1970-01-02 起,\(T=9845\))。注意 R 中 kurtosis 输出的是超额峰度。超额峰度很高,表明厚尾。偏度检验 \(t=0.0614/\sqrt{6/9845}=0.0614/0.0247=2.49\),p 值约 0.013,5% 水平下显著右偏。

表 1.2(PDF p.31)选定指数与个股日/月简单及对数收益率描述统计(百分比,样本截至 2008-12-31;SP=S&P 综合指数,VW/EW=CRSP 市值/等权指数)。代表性数字(均值 / 标准差 / 偏度 / 超额峰度 / 最小 / 最大):

  • 日简单收益:SP 0.029/1.056/−0.73/22.81/−20.47/11.58;IBM 0.040/1.693/0.06/9.92/−22.96/13.16;Intel 0.108/2.891/−0.15/6.13;Microsoft 0.123/2.359;Citi-Grp 0.067/2.602/1.80/55.25/−26.41/57.82。
  • 日对数收益:SP 0.023/1.062/−1.17/30.20/−22.90/10.96;IBM 0.026/1.694/−0.27/12.17。
  • 月简单收益(1926-01 起 996 个月):SP 0.58/5.53/0.32/9.47;VW 0.89/5.43;EW 1.22/7.40/1.52/14.94;IBM 1.35/7.15/0.44/3.43。
  • 月对数收益:SP 0.43/5.54/−0.52/7.93;IBM 1.09/7.03/−0.07/2.62;Intel 1.39/12.80,最小 −59.54。

R 演示(PDF p.32–34):library(fBasics);da=read.table("d-ibm3dx7008.txt",header=T)(列:Date, rtn, vwretd, ewretd, sprtrn);basicStats(sibm) 给出样本量、缺失值、最小/最大、四分位、均值 0.0402、中位数 0、均值标准误 0.0171、均值 95% 置信区间 [0.0067, 0.0736]、方差 2.865、标准差 1.693、偏度 0.0614、超额峰度 9.916。偏度检验 t1=s1/sqrt(6/9845)=2.487,pv=2*(1-pnorm(t1))=0.0129。对数收益 libm=log(ibm+1)*100,t.test(libm) 得 \(t=1.5126\),p=0.1304,即不能拒绝期望收益为零;normalTest(libm,method='jb') 得 JB=60921.9,p<2.2e-16,强烈拒绝正态。S-Plus(FinMetrics 模块)用 summaryStats,注意 S-Plus 的 kurtosis 是普通峰度(未减 3),故显示 12.92。

1.2.2 收益率的分布(Distributions of Returns,PDF p.34–38)

最一般模型:所有资产所有时期对数收益率的联合分布

\[F_r(r_{11},\dots,r_{N1};\ r_{12},\dots,r_{N2};\ \dots;\ r_{1T},\dots,r_{NT};\ \mathbf Y;\ \theta),\tag{1.14}\]
\(\mathbf Y\) 为描述决定收益率的经济环境的状态向量,\(\theta\) 为参数。通常把 \(\mathbf Y\) 视为给定,关心条件分布。此模型过于一般而无实用价值,但给出了定位各类计量模型的框架。CAPM(Sharpe 1964)关注同一时刻 \(N\) 个资产的横截面联合分布;另一类理论关注单个资产的动态结构。第 2–7 章的单变量分析关注单个资产 \(\{r_{it}\}_{t=1}^T\) 的联合分布,并按时间分解:
\[F(r_{i1},\dots,r_{iT};\theta)=F(r_{i1})\prod_{t=2}^T F(r_{it}\mid r_{i,t-1},\dots,r_{i1}).\tag{1.15}\]
核心问题是条件分布 \(F(r_{it}|r_{i,t-1},\dots)\) 的设定及其随时间的演化。随机游走假说(random-walk hypothesis)的一个版本即条件分布等于边际分布,此时收益率时间独立、不可预测。密度形式:
\[f(r_{i1},\dots,r_{iT};\theta)=f(r_{i1};\theta)\prod_{t=2}^T f(r_{it}\mid r_{i,t-1},\dots,r_{i1};\theta).\tag{1.16}\]

离散性:高频收益率不连续,NYSE 价格按最小报价单位(tick size)变动:1997 年 7 月前为 1/8 美元,1997-07 至 2001-01 为 1/16 美元。注:2000-08-28 NYSE 以 7 只股票试点十进制报价,AMEX 6 只股票及 2 类期权;2000-09-25、2000-12-04 NYSE 分别增加 57、94 只;2001-01-29 起 NYSE 与 AMEX 全部改为十进制。第 5 章再讨论。

条件分布比边际分布更重要,但边际分布更易估计;且很多资产收益序列相关很弱,边际分布接近条件分布。文献中提出的边际分布:

  1. 正态分布:传统假设简单收益 \(R_{it}\) iid 正态。困难:(a) 简单收益下界为 −1,正态无下界;(b) 若单期 \(R_{it}\) 正态,多期 \(R_{it}[k]\) 是乘积,不再正态;(c) 实证收益率普遍有正超额峰度。
  2. 对数正态分布(lognormal):设 \(r_t\) iid \(N(\mu,\sigma^2)\),则简单收益为对数正态:
    \[E(R_t)=\exp\Big(\mu+\frac{\sigma^2}{2}\Big)-1,\qquad \operatorname{Var}(R_t)=\exp(2\mu+\sigma^2)[\exp(\sigma^2)-1].\tag{1.17}\]
    反之,若 \(R_t\) 的均值 \(m_1\)、方差 \(m_2\),则
    \[E(r_t)=\ln\Big[\frac{m_1+1}{\sqrt{1+m_2/(1+m_1)^2}}\Big],\qquad \operatorname{Var}(r_t)=\ln\Big[1+\frac{m_2}{(1+m_1)^2}\Big].\]
    优点:\(r_t[k]\) 仍正态,\(1+R_t=e^{r_t}\) 自动满足下界;缺点:仍无法解释正超额峰度。(1.17) 在用对数收益模型预测简单收益时有用(注意 \(E(R_t)\neq e^{\mu}-1\),要加 \(\sigma^2/2\) 修正)。
  3. 稳定分布(stable distribution):对加法封闭,适合对数收益的时间聚合,能刻画超额峰度;但非正态稳定分布方差无穷,与多数金融理论冲突,统计建模也困难。例:Cauchy 分布,关于中位数对称、方差无穷,密度 \(f(x)=\frac{1}{\pi(1+x^2)}\)。
  4. 正态尺度混合(scale mixture of normals):\(r_t\sim N(\mu,\sigma^2)\) 但 \(\sigma^2\) 随机(如 \(\sigma^{-2}\) 服从 Gamma 分布)。有限混合例:\(r_t\sim(1-X)N(\mu,\sigma_1^2)+XN(\mu,\sigma_2^2)\),\(X\) 为 Bernoulli,\(P(X=1)=\alpha\),\(\sigma_1^2\) 小、\(\sigma_2^2\) 大。如 \(\alpha=0.05\) 表示 95% 的收益来自"平静"正态,5% 来自"剧烈"正态,从而尾部更厚。优点:保持正态的易处理性、高阶矩有限、能刻画超额峰度;缺点:混合参数(如 \(\alpha\))难估计。

图 1.1:比较标准正态、Cauchy 与有限混合 \((1-X)N(0,1)+XN(0,16)\)(\(P(X=1)=0.05\))的密度:Cauchy 尾最厚,混合正态次之,标准正态最薄。

1.2.3 多元收益率(Multivariate Returns,PDF p.38–39)

\(\mathbf r_t=(r_{1t},\dots,r_{Nt})'\)。第 8、10 章研究 \(\{\mathbf r_t\}\) 的联合分布,同样按 (1.15) 分解,重点是条件均值与条件协方差矩阵如何随时间演化。均值向量 \(E(\mathbf X)=\boldsymbol\mu_x\),协方差矩阵 \(\operatorname{Cov}(\mathbf X)=\boldsymbol\Sigma_x=E[(\mathbf X-\boldsymbol\mu_x)(\mathbf X-\boldsymbol\mu_x)']\);样本估计 \(\hat{\boldsymbol\mu}_x=\frac1T\sum\mathbf x_t\),\(\hat{\boldsymbol\Sigma}_x=\frac1{T-1}\sum(\mathbf x_t-\hat{\boldsymbol\mu}_x)(\mathbf x_t-\hat{\boldsymbol\mu}_x)'\),协方差存在时为一致估计。金融文献常假设 \(\mathbf r_t\) 多元正态。

1.2.4 收益率的似然函数(Likelihood Function of Returns,PDF p.39)

若条件分布 \(f(r_t|r_{t-1},\dots,r_1,\theta)\) 为均值 \(\mu_t\)、方差 \(\sigma_t^2\) 的正态,则

\[f(r_1,\dots,r_T;\theta)=f(r_1;\theta)\prod_{t=2}^T\frac{1}{\sqrt{2\pi}\sigma_t}\exp\Big[-\frac{(r_t-\mu_t)^2}{2\sigma_t^2}\Big],\tag{1.18}\]
对数似然
\[\ln f=\ln f(r_1;\theta)-\frac12\sum_{t=2}^T\Big[\ln(2\pi)+\ln\sigma_t^2+\frac{(r_t-\mu_t)^2}{\sigma_t^2}\Big].\]
使之最大的 \(\theta\) 即 MLE(maximum-likelihood estimate)。这就是后面 ARMA、GARCH 条件似然估计的统一形式;非正态条件分布可同理得到。

1.2.5 收益率的实证性质(Empirical Properties of Returns,PDF p.39–42)

数据来自芝大 CRSP,收益含分红。图 1.2、1.3:IBM 与 VW 指数 1926-01—2008-12 月度简单与对数收益时序图,两者形态相似。由表 1.2 得出:(a) 日收益(指数与个股)超额峰度高;月度上指数的超额峰度高于个股;(b) 日收益均值接近 0,月收益均值略大;(c) 月收益标准差大于日收益;(d) 日收益中指数标准差小于个股(分散化);(e) 偏度不是严重问题;(f) 简单收益与对数收益差别不大。图 1.4:IBM 月收益经验密度与同均值同方差的正态密度比较——经验密度峰更高、更瘦,但尾部更厚、支撑更宽(尖峰厚尾)。

1.3 本书考虑的过程(Processes Considered,PDF p.42–44)

除收益率外还研究:

  • 波动率过程(volatility process):条件方差随时间的演化。图 1.2、1.3 显示收益的变异性随时间变化且成簇出现(波动聚集),波动率在期权定价和风险管理中关键。
  • 极端收益:大的正负收益。负极端对风险管理重要,正极端对空头重要;第 7 章研究其发生频率、幅度及经济变量的影响。
  • 其他序列:利率、汇率、债券收益率、公司季度每股收益(EPS)。图 1.5:1953-04—2009-02 美国 10 年与 1 年期国债固定期限利率,二者同步变动,1 年期更易波动。图 1.6:2000-01-04—2009-03-27 美元/日元日汇率及其变化,偶有大幅变动。

表 1.3(百分比):月度 Fama 债券组合收益(1952-01—2008-12,\(T=684\)):期限 1–12 月均值 0.45、标准差 0.35、偏度 2.47、超额峰度 13.14;61–120 月均值 0.55、标准差 1.69、超额峰度 4.79。月度国债利率(1953-04—2009-02,\(T=671\)):1 年 5.59/2.98,10 年 6.40/2.69。周度国库券利率:3 月期 5.07/2.82,6 月期 5.52/2.73(样本量 2882、2625)。规律:利率的均值随期限增加而上升、标准差随期限增加而下降;债券收益的标准差随期限增加而上升、均值大致稳定;多数序列有正超额峰度。

本书分工:第 2–4 章关注收益的前四阶矩;第 7 章关注最小/最大收益;第 8、10 章关注多资产矩与关系;第 5 章关注小时间间隔;第 6 章介绍数理金融。

附录:R 软件包(PDF p.44–45)

R 免费,Rmetrics(Diethelm Wuertz 等)提供 fBasics、timeSeries、fGarch 等包。可用 ts(gm,frequency=12,start=c(1975,1)) 创建时间序列对象(frequency 表示每单位时间观测数,start 为起点)。以 GM 月简单收益(1975-01—2008-12,408 个观测,文件 m-gm3dx7508.txt)为例:图 1.7 时序图中 ts 对象以日历时间标注 x 轴(更好);图 1.8 ACF 中 ts 对象以"时间单位的分数"标注滞后(不如普通滞后数直观)。使用 ts 对象不是必需的。

习题(PDF p.45–47)

  • 1.1:AXP、CAT、SBUX 1999–2008 日简单收益(d-3stocks9908.txt):计算百分比简单收益和对数收益的均值、标准差、偏度、超额峰度、最小/最大;检验对数收益均值为零(5% 水平)。
  • 1.2:同 1.1,用 GM、VW、EW、SP 1975–2008 月收益(m-gm3dx7508.txt)。
  • 1.3:S&P 月收益:(a) 平均年对数收益;(b) 1975 年初投入 1 美元,2008 年末值多少(无交易成本)。
  • 1.4:AXP 日对数收益的偏度为零、超额峰度为零的检验。
  • 1.5:美元对加元、欧元、英镑、日元 2000-01-04—2009-03-27 日汇率:计算日对数收益和描述统计,讨论特征,画美元/欧元收益密度图。

参考文献(p.47):Campbell, Lo & MacKinlay (1997);Jarque & Bera (1987);Sharpe (1964);Snedecor & Cochran (1980)。p.48 空白。

第 1 章小结

本章要点

  • 简单收益率 \(R_t\) 与对数收益率 \(r_t=\ln(1+R_t)\):前者在横截面(组合)上可加权平均,后者在时间上可相加;年化收益是几何平均,算术平均只是一阶近似。
  • 收益率含分红、超额收益相对无风险资产定义;连续复利 \(A=Ce^{rn}\)。
  • 偏度、超额峰度及其渐近方差 \(6/T\)、\(24/T\);Jarque–Bera 统计量 \(\sim\chi^2_2\);实证收益普遍拒绝正态,呈尖峰厚尾,日频比月频更显著。
  • 联合分布按时间分解为条件分布之积 (1.15)/(1.16),这是所有时间序列似然估计 (1.18) 的基础。
  • 候选边际分布:正态、对数正态、稳定分布、正态尺度/有限混合,各有优缺点;(1.17) 给出对数正态与简单收益矩的换算。
  • 金融时间序列的三个主要对象:收益、波动率(时变、成簇)、极端值。

与量化交易的关联

  • 回测与绩效:组合 PnL 必须用简单收益加权;跨期累计用对数收益相加或简单收益连乘;年化收益应用几何平均(CAGR),用算术平均会高估,波动越大偏差越大(约 \(\sigma^2/2\))。
  • 数据处理:分红、拆股调整(总收益 \(P_t+D_t\))、超额收益(减无风险利率)是因子研究的标准预处理;空头需支付分红这一点影响做空回测的成本核算。
  • 风险建模:厚尾意味着正态 VaR 低估尾部风险;JB 检验、超额峰度是检查残差/收益分布的快速诊断;混合正态是简单的厚尾模拟工具(如压力情景生成)。
  • 预测转换:用对数收益模型预测价格或简单收益时需用 (1.17) 做 \(\sigma^2/2\) 修正,否则有系统性偏差。
  • 微观结构:tick size 与十进制改革说明高频价格离散,影响高频策略的收益分布与回测撮合假设。

推荐习题

  • 1.1/1.2:完整跑一遍描述统计和均值检验,熟悉日频与月频收益差异。
  • 1.3:区分平均对数收益与财富终值的复利计算(考查对数收益可加性)。
  • 1.4:偏度/峰度 t 检验的手算实现。
  • 1.5:汇率收益的厚尾特征,与股票比较。

第 2 章 线性时间序列分析及其应用(Linear Time Series Analysis and Its Applications,PDF p.49–128)

章首导言(PDF p.49)

本章讨论线性时间序列基本理论并应用于金融数据,参考 Box–Jenkins–Reinsel (1994) 第 2–3 章、Brockwell–Davis (1996) 第 1–3 章。把资产收益视为随时间的随机变量集合 \(\{r_t\}\),线性时间序列提供研究其动态结构的自然框架。理论包括平稳性、动态相依、自相关函数、建模、预测;模型包括 AR、MA、ARMA、季节模型、单位根非平稳、带时间序列误差的回归、长记忆的分数差分模型。简单模型试图刻画 \(r_t\) 与 \(t\) 之前信息(\(r_t\) 的历史值及 (1.14) 中的环境向量 \(\mathbf Y\))的线性关系,核心工具是序列相关(serial correlation)/自相关(autocorrelation)。

2.1 平稳性(Stationarity,PDF p.50)

  • 严平稳(strictly stationary):对任意 \(k\) 和任意时刻 \((t_1,\dots,t_k)\),\((r_{t_1},\dots,r_{t_k})\) 与 \((r_{t_1+t},\dots,r_{t_k+t})\) 联合分布相同,即联合分布对时间平移不变。条件很强,难以实证验证。
  • 弱平稳(weakly stationary):(a) \(E(r_t)=\mu\) 常数;(b) \(\operatorname{Cov}(r_t,r_{t-\ell})=\gamma_\ell\) 只依赖 \(\ell\)。直观上时序图围绕固定水平以恒定幅度波动。弱平稳使对未来的推断(预测)成为可能。
  • 关系:弱平稳隐含前两阶矩有限;严平稳且前两阶矩有限 ⇒ 弱平稳,反之一般不成立;但正态序列两者等价。本书主要研究弱平稳序列。
  • 自协方差(autocovariance)\(\gamma_\ell=\operatorname{Cov}(r_t,r_{t-\ell})\):\(\gamma_0=\operatorname{Var}(r_t)\),\(\gamma_{-\ell}=\gamma_\ell\)(令 \(t_1=t+\ell\) 即得)。
  • 金融中常假设收益弱平稳,可通过分子样本检查结果一致性来实证核验。

2.2 相关与自相关函数(Correlation and Autocorrelation Function,PDF p.50–56)

相关系数:\(\rho_{x,y}=\frac{\operatorname{Cov}(X,Y)}{\sqrt{\operatorname{Var}(X)\operatorname{Var}(Y)}}\),度量线性相依强度,\(-1\le\rho\le1\),对称;\(\rho=0\) 称不相关;若 \(X,Y\) 均正态(严格说联合正态),不相关等价于独立。样本估计

\[\hat\rho_{x,y}=\frac{\sum(x_t-\bar x)(y_t-\bar y)}{\sqrt{\sum(x_t-\bar x)^2\sum(y_t-\bar y)^2}}.\]

自相关函数 ACF(autocorrelation function):弱平稳序列的滞后 \(\ell\) 自相关

\[\rho_\ell=\frac{\operatorname{Cov}(r_t,r_{t-\ell})}{\sqrt{\operatorname{Var}(r_t)\operatorname{Var}(r_{t-\ell})}}=\frac{\gamma_\ell}{\gamma_0},\tag{2.1}\]
\(\rho_0=1\),\(\rho_\ell=\rho_{-\ell}\),\(|\rho_\ell|\le1\);弱平稳序列无序列相关当且仅当对所有 \(\ell>0\) 有 \(\rho_\ell=0\)。

样本 ACF:

\[\hat\rho_\ell=\frac{\sum_{t=\ell+1}^T(r_t-\bar r)(r_{t-\ell}-\bar r)}{\sum_{t=1}^T(r_t-\bar r)^2},\quad 0\le\ell<T-1.\tag{2.2}\]
若 \(\{r_t\}\) iid 且 \(E(r_t^2)<\infty\),对任意固定 \(\ell>0\),\(\hat\rho_\ell\) 渐近 \(N(0,1/T)\)(Brockwell–Davis 1991 定理 7.2.2),故检验 \(H_0:\rho_1=0\) 用 \(t=\sqrt T\hat\rho_1\)。 Bartlett 公式:若 \(r_t=\mu+\sum_{i=0}^q\psi_ia_{t-i}\)(\(\psi_0=1\),\(a_t\) iid 零均值,即 MA(\(q\))),则对 \(\ell>q\),\(\hat\rho_\ell\) 渐近正态,均值 0,方差 \((1+2\sum_{i=1}^q\rho_i^2)/T\)。

单个 ACF 检验:

\[t=\frac{\hat\rho_\ell}{\sqrt{(1+2\sum_{i=1}^{\ell-1}\hat\rho_i^2)/T}},\]
若序列是平稳高斯且 \(\rho_j=0\ (j>\ell)\),则渐近标准正态;\(|t|>Z_{\alpha/2}\) 拒绝。很多软件简化地对所有 \(\ell\) 用 \(1/T\)(即假设 iid)。有限样本中 \(\hat\rho_\ell\) 有 \(O(1/T)\) 偏差,金融数据样本大时影响不大。

混成检验 Portmanteau test:Box–Pierce (1970) \(Q^*(m)=T\sum_{\ell=1}^m\hat\rho_\ell^2\),检验 \(H_0:\rho_1=\cdots=\rho_m=0\),iid 下渐近 \(\chi^2_m\)。Ljung–Box (1978) 修正以提高小样本功效:

\[Q(m)=T(T+2)\sum_{\ell=1}^m\frac{\hat\rho_\ell^2}{T-\ell},\tag{2.3}\]
\(Q(m)>\chi^2_{m,\alpha}\) 或 p 值 \(\le\alpha\) 时拒绝。\(m\) 的选择影响功效,模拟研究建议 \(m\approx\ln T\);季节序列须关注季节倍数滞后。

样本 ACF \(\hat\rho_1,\hat\rho_2,\dots\) 是线性时间序列分析的核心:线性模型可由其 ACF 刻画,建模即用样本 ACF 捕捉线性动态。

实例(图 2.1、2.2):IBM 月简单与对数收益(1926–2008)样本 ACF 均落在两倍标准误界内;简单收益 \(Q(5)=3.37\)(p=0.64)、\(Q(10)=13.99\)(p=0.17);对数收益 \(Q(5)=3.52\)(p=0.62)、\(Q(10)=13.39\)(p=0.20)——IBM 月收益无显著序列相关。CRSP VW 指数月收益有显著序列相关:简单收益 \(Q(5)=29.71\)、\(Q(10)=39.55\);对数收益 \(Q(5)=28.38\)、\(Q(10)=36.16\),p 值均 <0.0001。即指数收益比个股收益有更强的序列相依。

金融文献中,CAPM 的一种版本认为收益不可预测、应无自相关,检验零自相关被用来检验有效市场假设。但价格形成机制和指数计算方式可能引入自相关(如买卖价反弹 bid–ask bounce、非同步交易 nonsynchronous trading,第 5 章),高频数据中尤甚——这也解释了指数收益自相关更强的现象。

R 演示(PDF p.55):Box.test(sibm,lag=5,type='Ljung') 得 \(Q(5)=3.3682\),p=0.6434;对数收益 \(Q(5)=3.5236\),p=0.6198。S-Plus 用 autocorTest(sibm,lag=5),结果相同(\(T=996\))。

2.3 白噪声与线性时间序列(White Noise and Linear Time Series,PDF p.56–57)

白噪声(white noise):\(\{r_t\}\) 为具有有限均值和方差的 iid 序列;若还服从 \(N(0,\sigma^2)\) 则为高斯白噪声。白噪声所有 ACF 为零;实践中样本 ACF 都接近零即视为白噪声。IBM 月收益接近白噪声,VW 指数则不是,说明对某些资产收益需先刻画序列相依再做后续分析。(注:本书的白噪声定义要求 iid,比"不相关"更强。)

线性时间序列(linear time series):

\[r_t=\mu+\sum_{i=0}^\infty\psi_ia_{t-i},\quad\psi_0=1,\tag{2.4}\]
\(\{a_t\}\) 为零均值 iid 白噪声,\(a_t\) 是 \(t\) 时刻的新信息,称新息(innovation)或冲击(shock)。\(\psi_i\) 称 \(\psi\) 权重(ψ-weights)。弱平稳时
\[E(r_t)=\mu,\qquad\operatorname{Var}(r_t)=\sigma_a^2\sum_{i=0}^\infty\psi_i^2,\tag{2.5}\]
方差有限要求 \(\psi_i^2\to0\),即远期冲击的影响逐渐消失。自协方差
\[\gamma_\ell=\sigma_a^2\sum_{j=0}^\infty\psi_j\psi_{j+\ell},\tag{2.6}\]
\[\rho_\ell=\frac{\sum_{i=0}^\infty\psi_i\psi_{i+\ell}}{1+\sum_{i=1}^\infty\psi_i^2},\quad\ell\ge0.\tag{2.7}\]
线性时间序列模型就是描述 \(\psi\) 权重模式的模型;平稳时 \(\rho_\ell\to0\),即当期收益对远期收益的线性依赖随滞后增大而减弱。并非所有金融序列都是线性的(第 4 章讨论非线性)。

2.4 简单 AR 模型(Simple AR Models,PDF p.57–77)

VW 指数月收益滞后 1 阶自相关显著,提示 \(r_{t-1}\) 可用于预测 \(r_t\)。AR(1):

\[r_t=\phi_0+\phi_1r_{t-1}+a_t,\tag{2.8}\]
\(a_t\) 为零均值、方差 \(\sigma_a^2\) 的白噪声。形式同简单线性回归(但有重要区别,后述)。AR(1) 也广泛用于随机波动率模型(以对数波动率替代 \(r_t\),见第 3、12 章)。条件矩:\(E(r_t|r_{t-1})=\phi_0+\phi_1r_{t-1}\),\(\operatorname{Var}(r_t|r_{t-1})=\sigma_a^2\)——马尔可夫性质:给定 \(r_{t-1}\),\(r_t\) 与 \(r_{t-i}\ (i>1)\) 不相关。推广为 AR(\(p\)):
\[r_t=\phi_0+\phi_1r_{t-1}+\cdots+\phi_pr_{t-p}+a_t,\tag{2.9}\]
形式同以滞后值为解释变量的多元线性回归。

2.4.1 AR 模型的性质(PDF p.58–66)

AR(1) 的均值:平稳时取期望得 \(\mu=\phi_0+\phi_1\mu\),故 \(E(r_t)=\mu=\phi_0/(1-\phi_1)\)(需 \(\phi_1\ne1\));均值为零当且仅当 \(\phi_0=0\)。改写为

\[r_t-\mu=\phi_1(r_{t-1}-\mu)+a_t.\tag{2.10}\]
反复代入得 MA(∞) 表示
\[r_t-\mu=\sum_{i=0}^\infty\phi_1^ia_{t-i},\tag{2.11}\]
即 \(\psi_i=\phi_1^i\)。由此 \(\operatorname{Cov}(r_{t-1},a_t)=0\)。

AR(1) 的方差与平稳条件:平方取期望得 \(\operatorname{Var}(r_t)=\phi_1^2\operatorname{Var}(r_{t-1})+\sigma_a^2\),平稳时 \(\operatorname{Var}(r_t)=\sigma_a^2/(1-\phi_1^2)\),需 \(\phi_1^2<1\)。反之 \(|\phi_1|<1\) 时由 (2.11) 与 (2.5)(2.6) 知均值、方差、自协方差均有限且时不变。结论:AR(1) 弱平稳的充要条件是 \(|\phi_1|<1\)。 金融文献常写作 \(r_t=(1-\phi_1)\mu+\phi_1r_{t-1}+a_t\),\(\phi_1\) 度量动态相依的持续性(persistence)。

AR(1) 的 ACF:(2.10) 乘 \(a_t\) 取期望得 \(E[a_t(r_t-\mu)]=\sigma_a^2\);乘 \((r_{t-\ell}-\mu)\) 取期望得

\[\gamma_\ell=\begin{cases}\phi_1\gamma_1+\sigma_a^2,&\ell=0\\ \phi_1\gamma_{\ell-1},&\ell>0\end{cases}\]
故 \(\rho_\ell=\phi_1\rho_{\ell-1}\),\(\rho_\ell=\phi_1^\ell\):ACF 以速率 \(\phi_1\) 从 1 指数衰减;\(\phi_1<0\) 时正负交替(两条以 \(\phi_1^2\) 衰减的指数曲线)。图 2.3 示 \(\phi_1=\pm0.8\)。

AR(2):

\[r_t=\phi_0+\phi_1r_{t-1}+\phi_2r_{t-2}+a_t.\tag{2.12}\]
均值 \(\mu=\phi_0/(1-\phi_1-\phi_2)\)(需 \(\phi_1+\phi_2\ne1\))。中心化后乘 \((r_{t-\ell}-\mu)\) 取期望得矩方程(moment equation)\(\gamma_\ell=\phi_1\gamma_{\ell-1}+\phi_2\gamma_{\ell-2}\),于是
\[\rho_\ell=\phi_1\rho_{\ell-1}+\phi_2\rho_{\ell-2},\quad\ell>0,\tag{2.13}\]
特别地 \(\rho_1=\phi_1/(1-\phi_2)\),\(\rho_\ell=\phi_1\rho_{\ell-1}+\phi_2\rho_{\ell-2}\ (\ell\ge2)\)。即 ACF 满足二阶差分方程 \((1-\phi_1B-\phi_2B^2)\rho_\ell=0\),\(B\) 为后移算子(back-shift operator),\(B\rho_\ell=\rho_{\ell-1}\);有的文献记作滞后算子 \(L\)(lag operator)。该差分方程决定 ACF 的性质和预测的行为。

特征方程:\(1-\phi_1x-\phi_2x^2=0\) (2.14),解为 \(x=\dfrac{\phi_1\pm\sqrt{\phi_1^2+4\phi_2}}{-2\phi_2}\),其倒数称特征根(characteristic roots)\(\omega_1,\omega_2\)。

  • 若两根为实数,差分方程可分解为 \((1-\omega_1B)(1-\omega_2B)\),AR(2) 相当于 AR(1) 叠加在另一 AR(1) 上,ACF 为两个指数衰减的混合。
  • 若 \(\phi_1^2+4\phi_2<0\),两根为共轭复数,ACF 呈阻尼正弦/余弦波(damping sine and cosine waves),对应经济中的商业周期(business cycles)。随机周期平均长度
    \[k=\frac{2\pi}{\cos^{-1}[\phi_1/(2\sqrt{-\phi_2})]}\]
    (弧度)。若复数解写作 \(a\pm bi\),则 \(\phi_1=2a\),\(\phi_2=-(a^2+b^2)\),\(k=2\pi/\cos^{-1}(a/\sqrt{a^2+b^2})\)。

图 2.4 示四个平稳 AR(2) 的 ACF:(a) \(\phi_1=1.2,\phi_2=-0.35\);(b) \(\phi_1=0.6,\phi_2=-0.4\)(\(0.36-1.6=-1.24<0\),复根,阻尼正弦);(c) \(0.2,0.35\);(d) \(-0.2,0.35\);后三者实根、指数衰减。

例 2.1 美国季度实际 GNP 增长率(季调,1947Q2–1991Q1,176 个观测,图 2.5):拟合 AR(3)

\[r_t=0.0047+0.348r_{t-1}+0.179r_{t-2}-0.142r_{t-3}+a_t,\quad\hat\sigma_a=0.0097.\tag{2.15}\]
特征多项式 \(1-0.348B-0.179B^2+0.142B^3\) 近似分解为 \((1+0.521B)(1-0.869B+0.274B^2)\)。前一因子表现指数衰减;后一因子 \(\phi_1^2+4\phi_2=0.869^2-4(0.274)=-0.341<0\),证实存在随机商业周期,平均周期 \(k=2\pi/\cos^{-1}[\phi_1/(2\sqrt{-\phi_2})]\approx10.62\) 季度,约 3 年。用非线性模型(第 4 章)分离扩张与收缩期时,收缩期平均约 3 个季度、扩张期约 3 年,10.62 季度是两者的折中。OECD 国家增长率普遍有类似特征。

R 演示:gnp1=ts(gnp,frequency=4,start=c(1947,2));m1=ar(gnp,method="mle") 按 AIC 选出 3 阶;m2=arima(gnp,order=c(3,0,0)) 得 ar1=0.3480(0.0745)、ar2=0.1793(0.0778)、ar3=−0.1423(0.0745)、intercept=0.0077(0.0012),\(\sigma^2=9.427\times10^{-5}\),对数似然 565.84,AIC=−1121.68。注意 R 中 intercept 是序列均值而非常数项,\(\phi_0=(1-0.348-0.1793+0.1423)\times0.0077=0.0047\)。polyroot(c(1,-coef)) 得根 \(1.590\pm1.064i\) 和 \(-1.920\),模长 1.913、1.920;k=2*pi/acos(1.590253/1.913308)=10.66。

平稳条件:AR(2) 平稳当且仅当两个特征根模长都小于 1,等价于特征方程的两个解模长都大于 1;此时 (2.13) 保证 ACF 随滞后趋于 0(平稳的必要性质)。AR(1) 特征根 \(\omega=\phi_1\),同样要求 \(|\phi_1|<1\)。

AR(\(p\)):平稳时 \(E(r_t)=\phi_0/(1-\phi_1-\cdots-\phi_p)\);特征方程 \(1-\phi_1x-\cdots-\phi_px^p=0\) 的所有解模长大于 1(即所有特征根模长小于 1)则平稳;ACF 满足 \((1-\phi_1B-\cdots-\phi_pB^p)\rho_\ell=0\ (\ell>0)\),图形是指数衰减与阻尼正弦的混合。

2.4.2 实践中识别 AR 模型(Identifying AR Models in Practice,PDF p.66–73)

阶数 \(p\) 需由数据确定(定阶,order determination/specification),两种方法:偏自相关函数和信息准则。

偏自相关函数 PACF(partial autocorrelation function):依次拟合

\[r_t=\phi_{0,j}+\phi_{1,j}r_{t-1}+\cdots+\phi_{j,j}r_{t-j}+e_{jt},\quad j=1,2,3,\dots\]
(最小二乘估计,类似多元回归中的偏 F 检验思想),第 \(j\) 个方程最后一个系数估计 \(\hat\phi_{j,j}\) 称滞后 \(j\) 样本 PACF,表示在 AR(\(j-1\)) 基础上加入 \(r_{t-j}\) 的额外贡献。对平稳高斯 AR(\(p\)):

  • \(\hat\phi_{p,p}\to\phi_p\);
  • 对所有 \(\ell>p\),\(\hat\phi_{\ell,\ell}\to0\);
  • \(\ell>p\) 时 \(\hat\phi_{\ell,\ell}\) 的渐近方差为 \(1/T\)。 即 AR(\(p\)) 的样本 PACF 在滞后 \(p\) 处截尾(cuts off)。

例:CRSP VW 月简单收益(1926–2008,\(T=996\)),标准误约 \(1/\sqrt{996}\approx0.032\)。表 2.1:PACF 滞后 1–12 为 0.115、−0.030、−0.102、0.033、0.062、−0.050、0.031、0.052、0.063、0.005、−0.005、0.011。5% 水平识别为 AR(3) 或 AR(9),1% 水平为 AR(3)。GNP 增长率的 PACF(图 2.6,界限 \(\pm2/\sqrt{176}\))前三阶较大,提示 AR(3)。

信息准则(information criteria,均基于似然):

  • AIC(Akaike 1973):
    \[\text{AIC}=\frac{-2}{T}\ln(\text{likelihood})+\frac{2}{T}\times(\text{参数个数}),\tag{2.16}\]
    高斯 AR(\(\ell\)) 化简为 \(\text{AIC}(\ell)=\ln\tilde\sigma_\ell^2+2\ell/T\),\(\tilde\sigma_\ell^2\) 为 \(\sigma_a^2\) 的 MLE。第一项衡量拟合优度,第二项为惩罚函数(penalty function)。
  • BIC(Schwarz–Bayesian):\(\text{BIC}(\ell)=\ln\tilde\sigma_\ell^2+\ell\ln T/T\)。
  • 每个参数的惩罚:AIC 为 2,BIC 为 \(\ln T\),故中大样本下 BIC 倾向选更低阶。
  • 选择规则:对 \(\ell=0,\dots,P\) 计算,取最小值对应阶数。

表 2.1 的 AIC(−5.838、−5.837、−5.846、−5.845、−5.847、−5.847、−5.846、−5.847、−5.849、−5.847、−5.845、−5.843)在 \(p=9\) 最小;BIC(−5.833、−5.827、−5.831、…)在 \(p=1\) 最小,\(p=3\) 次之(−5.831)。不同方法给出不同阶数,没有证据表明哪种方法在实际中更好;问题的实质背景与简洁性同样重要。GNP 例中 R 的 ar 给出的 AIC 已调整为最小值为 0(27.847, 2.742, 1.603, 0.000, 0.323, …),选 AR(3)。

参数估计:常用条件最小二乘(conditional least squares),以前 \(p\) 个观测为条件,对 \(t=p+1,\dots,T\) 做多元回归,得拟合值 \(\hat r_t\) 和残差 \(\hat a_t=r_t-\hat r_t\),

\[\hat\sigma_a^2=\frac{\sum_{t=p+1}^T\hat a_t^2}{T-2p-1}.\]
用条件似然法时 \(\phi_i\) 估计不变,\(\tilde\sigma_a^2=\hat\sigma_a^2(T-2p-1)/(T-p)\);有的软件用 \((T-2p-1)/T\)。

VW 月收益 AR(3):\(r_t=0.0091+0.116r_{t-1}-0.019r_{t-2}-0.104r_{t-3}+\hat a_t\),\(\hat\sigma_a=0.054\),标准误 0.002、0.032、0.032、0.032,除滞后 2 外均在 1% 水平显著。系数小说明序列相依弱(虽显著)。\(\hat\mu=0.0091/(1-0.116+0.019+0.104)=0.009\),月均值虽小但长期意义重大:年化简单总收益 \([\prod_{t=1}^{996}(1+R_t)]^{12/996}-1\approx0.093\),即 1926–2008 年约 9.3%/年;1926 年初 1 美元到 2008 年末约值 1593 美元(R:prod(vw+1)=1592.953)。

模型检验(model checking):充分的模型其残差应为白噪声,用残差 ACF 与 Ljung–Box 统计量检查。对 AR(\(p\)) 残差,\(Q(m)\) 渐近 \(\chi^2_{m-g}\),\(g\) 为模型中 AR 系数个数(自由度调整源于拟合对残差施加的约束)。若有不显著系数则简化,若残差仍有序列相关则扩展。注:多数软件不调整自由度(\(m\le g\) 时可以理解)。

VW 例:AR(3) 残差 \(Q(12)=16.35\),按 \(\chi^2_9\) 得 p=0.060,勉强不拒绝;去掉不显著的滞后 2 项后

\[r_t=0.0088+0.114r_{t-1}-0.106r_{t-3}+a_t,\quad\hat\sigma_a=0.0536,\]
所有系数 1% 显著,\(Q(12)=16.83\),按 \(\chi^2_{10}\) 得 p=0.078,模型充分。

R 演示:m3=arima(vw,order=c(3,0,0)) 得 ar1=0.1158、ar2=−0.0187、ar3=−0.1042、intercept=0.0089,\(\sigma^2=0.002875\);Box.test(m3$residuals,lag=12,type='Ljung') 用 df=12 给 p=0.1756,手动 1-pchisq(16.35,9)=0.0599。用 arima(vw,order=c(3,0,0),fixed=c(NA,0,NA,NA)) 把 ar2 固定为 0(NA 表示估计)。S-Plus:OLS(vw~ar(3)),\(R^2=0.0246\),DW=1.9913,残差 JB=1656.4。

2.4.3 拟合优度(Goodness of Fit,PDF p.73–74)

\[R^2=1-\frac{\text{残差平方和}}{\text{总平方和}}=1-\frac{\sum_{t=p+1}^T\hat a_t^2}{\sum_{t=p+1}^T(r_t-\bar r)^2},\quad\bar r=\frac{\sum_{t=p+1}^Tr_t}{T-p}.\]

\(0\le R^2\le1\),越大拟合越好,但只对平稳序列成立:对单位根非平稳序列,无论真实模型如何,AR(1) 拟合的 \(R^2\) 随样本增大趋于 1(伪高拟合)。\(R^2\) 随参数个数单调不减,故有调整 \(R^2\):\(\text{Adj-}R^2=1-\hat\sigma_a^2/\hat\sigma_r^2\),考虑了参数个数,但不再限于 [0,1]。

2.4.4 预测(Forecasting,PDF p.74–77)

预测原点(forecast origin)\(h\),预测步长(horizon)\(\ell\ge1\),\(F_h\) 为 \(h\) 时刻信息集。最小均方误差预测 \(\hat r_h(\ell)\) 满足 \(E\{[r_{h+\ell}-\hat r_h(\ell)]^2|F_h\}\le\min_gE[(r_{h+\ell}-g)^2|F_h]\),即条件期望。

  • 1 步预测:\(\hat r_h(1)=E(r_{h+1}|F_h)=\phi_0+\sum_{i=1}^p\phi_ir_{h+1-i}\),误差 \(e_h(1)=a_{h+1}\),方差 \(\sigma_a^2\);正态时 95% 区间 \(\hat r_h(1)\pm1.96\sigma_a\)。对线性模型 (2.4),\(a_{t+1}\) 既是 1 步预测误差,也是 \(t+1\) 时刻的冲击。
  • 实际中用估计参数得到的是条件预测,未计入参数不确定性;考虑参数与模型不确定性的自然方法是基于 MCMC 的贝叶斯预测(第 12 章)。样本大时二者接近。
  • 2 步预测:\(\hat r_h(2)=\phi_0+\phi_1\hat r_h(1)+\phi_2r_h+\cdots+\phi_pr_{h+2-p}\),误差 \(e_h(2)=a_{h+2}+\phi_1a_{h+1}\),方差 \((1+\phi_1^2)\sigma_a^2\ge\sigma_a^2\)——预测越远越不确定。
  • 多步预测:\(\hat r_h(\ell)=\phi_0+\sum_{i=1}^p\phi_i\hat r_h(\ell-i)\)(\(i\le0\) 时 \(\hat r_h(i)=r_{h+i}\)),递推计算。平稳 AR(\(p\)) 的 \(\hat r_h(\ell)\to E(r_t)\),即均值回复(mean reversion);预测误差方差趋于无条件方差。
  • 半衰期(half-life):AR(1) 中令 \(x_t=r_t-E(r_t)\),\(\hat x_h(\ell)=\phi_1^\ell x_h\),令 \(\phi_1^\ell=1/2\) 得
    \[\ell=\frac{\ln0.5}{\ln|\phi_1|}.\]

表 2.2:用前 984 个观测重估 AR(3):\(r_t=0.0098+0.1024r_{t-1}-0.0201r_{t-2}-0.1090r_{t-3}+a_t\),\(\hat\sigma_a=0.054\);原点 \(h=984\)(2007 年 12 月)做 1–12 步预测:预测值 0.0076、0.0161、0.0118、0.0099、0.0089、0.0093、0.0095、0.0097、0.0096…;标准误 0.0534、0.0537、0.0537、0.0540…;2008 年实际值 −0.0623、−0.0220、−0.0105、0.0511、0.0238、−0.0786、−0.0132、0.0110、−0.0981、−0.1847、−0.0852、0.0215。因序列相依弱,预测值和标准误迅速收敛到样本均值 0.0095 和标准差 0.0540。图 2.7:除 2008 年 10 月外,实际收益都落在 95% 预测区间内。

2.5 简单 MA 模型(Simple MA Models,PDF p.77–84)

动机:第 5 章将说明买卖价反弹(bid–ask bounce)会在收益序列中引入 MA(1) 结构。作者把 MA 模型看作带参数约束的无穷阶 AR 模型来引入:无穷阶 AR 参数太多不现实,令系数由单一参数决定,\(\phi_i=-\theta_1^i\):

\[r_t=\phi_0-\theta_1r_{t-1}-\theta_1^2r_{t-2}-\theta_1^3r_{t-3}-\cdots+a_t.\tag{2.17}\]
平稳需 \(|\theta_1|<1\),此时 \(r_{t-i}\) 的贡献指数衰减。写成 \(r_t+\theta_1r_{t-1}+\theta_1^2r_{t-2}+\cdots=\phi_0+a_t\) (2.18),对 \(t-1\) 写同式 (2.19),(2.18) 减 \(\theta_1\times\)(2.19) 得 \(r_t=\phi_0(1-\theta_1)+a_t-\theta_1a_{t-1}\),即除常数外 \(r_t\) 是冲击 \(a_t,a_{t-1}\) 的加权平均,故称移动平均模型 MA(1):
\[r_t=c_0+a_t-\theta_1a_{t-1}=c_0+(1-\theta_1B)a_t,\tag{2.20}\]
\[\text{MA(2)}:\ r_t=c_0+a_t-\theta_1a_{t-1}-\theta_2a_{t-2},\tag{2.21}\]
\[\text{MA}(q):\ r_t=c_0+a_t-\theta_1a_{t-1}-\cdots-\theta_qa_{t-q}=c_0+(1-\theta_1B-\cdots-\theta_qB^q)a_t.\tag{2.22}\]
(注意本书 MA 系数的符号约定为减号,R 的 arima 用加号,读软件输出时须换号。)

2.5.1 MA 模型的性质(PDF p.79–80)

  • 平稳性:MA 模型是白噪声的有限线性组合,总是弱平稳。\(E(r_t)=c_0\)(常数项即均值),\(\operatorname{Var}(r_t)=(1+\theta_1^2+\cdots+\theta_q^2)\sigma_a^2\)。
  • ACF:MA(1)(设 \(c_0=0\))乘 \(r_{t-\ell}\) 取期望得 \(\gamma_1=-\theta_1\sigma_a^2\),\(\gamma_\ell=0\ (\ell>1)\),故
    \[\rho_1=\frac{-\theta_1}{1+\theta_1^2},\qquad\rho_\ell=0\ (\ell>1),\]
    ACF 在滞后 1 截尾。MA(2):\(\rho_1=\dfrac{-\theta_1+\theta_1\theta_2}{1+\theta_1^2+\theta_2^2}\),\(\rho_2=\dfrac{-\theta_2}{1+\theta_1^2+\theta_2^2}\),\(\rho_\ell=0\ (\ell>2)\)。一般 MA(\(q\)) 的 ACF 在滞后 \(q\) 截尾,是"有限记忆"(finite-memory)模型。(推论:MA(1) 的 \(|\rho_1|\le0.5\)。)
  • 可逆性(invertibility):零均值 MA(1) 写作 \(a_t=r_t+\theta_1a_{t-1}\),反复代入得 \(a_t=r_t+\theta_1r_{t-1}+\theta_1^2r_{t-2}+\cdots\),即当前冲击是当前与过去收益的线性组合;远期收益影响应趋于零,故要求 \(|\theta_1|<1\),称可逆;\(|\theta_1|=1\) 为不可逆。

2.5.2 识别 MA 阶数(PDF p.80–81)

若 \(\rho_q\ne0\) 而 \(\rho_\ell=0\ (\ell>q)\),则 \(r_t\) 为 MA(\(q\))。例:CRSP 等权指数月简单收益(1926–2008,图 2.8),样本 ACF 在滞后 1、3、9 显著(更高滞后有少量边缘显著,忽略),识别为

\[r_t=c_0+a_t-\theta_1a_{t-1}-\theta_3a_{t-3}-\theta_9a_{t-9}.\]
与 PACF 不同,样本 ACF 能指出哪些 MA 滞后非零。

2.5.3 估计(Estimation,PDF p.81–82)

通常用极大似然,两种算法:

  • 条件似然法(conditional likelihood):假设初始冲击 \(a_t=0\ (t\le0)\),递推 \(a_1=r_1-c_0\),\(a_2=r_2-c_0+\theta_1a_1\),…,得条件 MLE。
  • 精确似然法(exact likelihood):把初始冲击作为附加参数联合估计。模型接近不可逆时精确法更好,但计算量更大;样本大时两者接近。

等权指数 MA(9) 例:条件 MLE

\[r_t=0.012+a_t+0.189a_{t-1}-0.121a_{t-3}+0.122a_{t-9},\quad\hat\sigma_a=0.0714,\tag{2.23}\]
标准误 0.003、0.031、0.031、0.031;残差 \(Q(12)=17.5\),按 \(\chi^2_9\) p=0.041(按 12 自由度 p=0.132),需要改进。精确 MLE
\[r_t=0.012+a_t+0.191a_{t-1}-0.120a_{t-3}+0.123a_{t-9},\quad\hat\sigma_a=0.0714,\tag{2.24}\]
\(Q(12)=17.6\),p=0.040(9 df)或 0.128(12 df),仅勉强充分。两种方法差异可忽略。

2.5.4 MA 模型预测(PDF p.82–84)

MA(1):\(r_{h+1}=c_0+a_{h+1}-\theta_1a_h\),故 \(\hat r_h(1)=c_0-\theta_1a_h\),\(e_h(1)=a_{h+1}\),方差 \(\sigma_a^2\)。\(a_h\) 可设 \(a_0=0\) 后由 \(a_t=r_t-c_0+\theta_1a_{t-1}\) 递推(即拟合残差),或用 AR 表示求得。\(\hat r_h(2)=c_0\),\(e_h(2)=a_{h+2}-\theta_1a_{h+1}\),方差 \((1+\theta_1^2)\sigma_a^2\) 即序列方差;一般 \(\hat r_h(\ell)=c_0\ (\ell\ge2)\),MA(1) 的均值回复只需一期。MA(2):\(\hat r_h(1)=c_0-\theta_1a_h-\theta_2a_{h-1}\),\(\hat r_h(2)=c_0-\theta_2a_h\),\(\hat r_h(\ell)=c_0\ (\ell>2)\)。一般 MA(\(q\)) 在 \(q\) 步后预测等于均值,误差方差等于序列方差。

表 2.3:等权指数 MA(9)(精确 MLE,前 986 个观测重估),原点 \(h=986\)(2008 年 2 月),样本均值 0.0128、标准差 0.0736。1–10 步预测 0.0043、0.0136、0.0150、0.0144、0.0120、0.0019、0.0122、0.0056、0.0085、0.0128(第 10 步即样本均值);标准误 0.0712→0.0734 收敛到序列标准差;实际值含 −0.1209、−0.2060、−0.1366(次贷危机与雷曼倒闭),点预测偏离很大。

AR 与 MA 小结:

  • MA(\(q\)) 的 ACF 在滞后 \(q\) 截尾,用 ACF 定阶;
  • AR(\(p\)) 的 PACF 在滞后 \(p\) 截尾,用 PACF 定阶;
  • MA 总平稳;AR 平稳需所有特征根模长小于 1;
  • 平稳序列的多步预测收敛到均值,预测误差方差收敛到序列方差。

2.6 简单 ARMA 模型(Simple ARMA Models,PDF p.84–91)

纯 AR 或 MA 可能需要高阶、多参数;ARMA(Box–Jenkins–Reinsel 1994)把二者结合以实现参数节约(parsimony)。金融收益序列直接用 ARMA 的机会不多,但其概念对波动率建模至关重要:GARCH 可视为 \(a_t^2\) 的(非标准)ARMA 模型(第 3 章)。

ARMA(1,1):

\[r_t-\phi_1r_{t-1}=\phi_0+a_t-\theta_1a_{t-1},\tag{2.25}\]
左边为 AR 部分,右边为 MA 部分;需 \(\phi_1\ne\theta_1\),否则约去后退化为白噪声。

2.6.1 ARMA(1,1) 的性质(PDF p.84–86)

  • 均值:\(E(r_t)=\mu=\phi_0/(1-\phi_1)\),与 AR(1) 相同。
  • 设 \(\phi_0=0\),乘 \(a_t\) 取期望得 \(E(r_ta_t)=\sigma_a^2\) (2.26)。方差:\(\operatorname{Var}(r_t)=\phi_1^2\operatorname{Var}(r_{t-1})+\sigma_a^2+\theta_1^2\sigma_a^2-2\phi_1\theta_1E(r_{t-1}a_{t-1})\),平稳时
    \[\operatorname{Var}(r_t)=\frac{(1-2\phi_1\theta_1+\theta_1^2)\sigma_a^2}{1-\phi_1^2},\]
    需 \(|\phi_1|<1\),平稳条件与 AR(1) 相同。
  • 自协方差:\(\gamma_1-\phi_1\gamma_0=-\theta_1\sigma_a^2\)(与 AR(1) 不同),\(\gamma_\ell-\phi_1\gamma_{\ell-1}=0\ (\ell>1)\) (2.27)。故
    \[\rho_1=\phi_1-\frac{\theta_1\sigma_a^2}{\gamma_0},\qquad\rho_\ell=\phi_1\rho_{\ell-1}\ (\ell>1).\]
    ACF 像 AR(1) 但指数衰减从滞后 2 开始,不在任何有限滞后截尾;PACF 也不截尾,像 MA(1) 但衰减从滞后 2 开始。

2.6.2 一般 ARMA 模型(PDF p.86)

\[r_t=\phi_0+\sum_{i=1}^p\phi_ir_{t-i}+a_t-\sum_{i=1}^q\theta_ia_{t-i},\]
\[(1-\phi_1B-\cdots-\phi_pB^p)r_t=\phi_0+(1-\theta_1B-\cdots-\theta_qB^q)a_t.\tag{2.28}\]

AR 多项式与 MA 多项式不能有公因子(否则可降阶)。AR 多项式给出特征方程;若所有特征根模长小于 1(原文写"解的绝对值小于 1",指特征根),则弱平稳,均值 \(E(r_t)=\phi_0/(1-\phi_1-\cdots-\phi_p)\)。

2.6.3 识别 ARMA 模型(PDF p.86–88)

ACF 和 PACF 对 ARMA 定阶信息不足。Tsay & Tiao (1984) 提出扩展自相关函数 EACF(extended autocorrelation function):若能一致估计 AR 部分,则可导出 MA 部分序列,再用其 ACF 识别 MA 阶数。输出为二维表,行为 AR 阶 \(p\),列为 MA 阶 \(q\)。

表 2.4(ARMA(1,1) 理论 EACF):第 0 行全为 X;第 1 行从 \(q=1\) 起全为 O;第 2 行 \(q=1\) 为 X、\(q\ge2\) 为 O;依此类推,形成以 (1,1) 为左上顶点的 O 三角形(* 表示可零可非零,不影响识别)。一般 ARMA(\(p,q\)) 的 O 三角左上顶点位于 \((p,q)\)。

例:3M 公司月对数收益(1946-02—2008-12,755 个观测,图 2.9),ACF 在 1% 水平无显著序列相关。简化 EACF 表规则:\(|\text{EACF}|\ge2/\sqrt T\) 记 X,否则记 O。表 2.5 简化表的 O 三角左上顶点在 (0,0);\(q=2,5,9,11\) 处有少数 X,但对应值仅 0.08–0.09,略大于 \(2/\sqrt{755}=0.073\),用 1% 临界值就变为 O。故 3M 月对数收益为 ARMA(0,0)(白噪声),与 ACF 一致。

信息准则法:对 \(0\le p\le P\)、\(0\le q\le Q\) 计算 AIC/BIC 取最小;需估计很多模型,可能遇到过度拟合问题。定阶后用条件或精确似然估计,残差 Ljung–Box \(Q(m)\sim\chi^2_{m-g}\),\(g\) 为 AR 与 MA 系数个数。

2.6.4 ARMA 模型预测(PDF p.88–89)

\[\hat r_h(1)=\phi_0+\sum_{i=1}^p\phi_ir_{h+1-i}-\sum_{i=1}^q\theta_ia_{h+1-i},\quad e_h(1)=a_{h+1},\]
\[\hat r_h(\ell)=\phi_0+\sum_{i=1}^p\phi_i\hat r_h(\ell-i)-\sum_{i=1}^q\theta_ia_h(\ell-i),\]

其中 \(\ell-i\le0\) 时 \(\hat r_h(\ell-i)=r_{h+\ell-i}\)、\(a_h(\ell-i)=a_{h+\ell-i}\);\(\ell-i>0\) 时 \(a_h(\ell-i)=0\)。递推计算;误差方差见 (2.34)。

2.6.5 ARMA 模型的三种表示(PDF p.89–91)

  1. ARMA 表示 (2.28):紧凑,用于参数估计与递推预测。
  2. 利用多项式长除法:
    \[\frac{\theta(B)}{\phi(B)}=1+\psi_1B+\psi_2B^2+\cdots\equiv\psi(B),\tag{2.29}\]
    \[\frac{\phi(B)}{\theta(B)}=1-\pi_1B-\pi_2B^2-\cdots\equiv\pi(B).\tag{2.30}\]
    ARMA(1,1) 例:\(\psi(B)=1+(\phi_1-\theta_1)B+\phi_1(\phi_1-\theta_1)B^2+\phi_1^2(\phi_1-\theta_1)B^3+\cdots\),\(\pi(B)=1-(\phi_1-\theta_1)B-\theta_1(\phi_1-\theta_1)B^2-\theta_1^2(\phi_1-\theta_1)B^3-\cdots\)。\(\psi(B)\pi(B)=1\);常数满足 \(Bc=c\),故 \(\phi_0/\theta(1)=\phi_0/(1-\theta_1-\cdots-\theta_q)\),\(\phi_0/\phi(1)=\phi_0/(1-\phi_1-\cdots-\phi_p)\)。

AR 表示:

\[r_t=\frac{\phi_0}{1-\theta_1-\cdots-\theta_q}+\pi_1r_{t-1}+\pi_2r_{t-2}+\cdots+a_t.\tag{2.31}\]
\(\pi_i\) 称 π 权重,体现当前收益对过去收益的依赖。若 \(\pi_i\to0\),称模型可逆。纯 AR 总可逆;一般 ARMA 可逆的充分条件是 \(\theta(B)\) 的所有零点模长大于 1。MA(1) 零点 \(B=1/\theta_1\),可逆当且仅当 \(|\theta_1|<1\)。可逆 ARMA 序列是当前冲击加上过去值的指数衰减加权平均。

MA 表示:

\[r_t=\mu+a_t+\psi_1a_{t-1}+\psi_2a_{t-2}+\cdots=\mu+\psi(B)a_t,\tag{2.32}\]
\(\mu=\phi_0/(1-\phi_1-\cdots-\phi_p)\)。\(\{\psi_i\}\) 称脉冲响应函数(impulse response function),平稳时指数衰减,冲击没有永久影响。用于预测误差方差:
\[\hat r_h(\ell)=\mu+\psi_\ell a_h+\psi_{\ell+1}a_{h-1}+\cdots,\tag{2.33}\]
\[e_h(\ell)=a_{h+\ell}+\psi_1a_{h+\ell-1}+\cdots+\psi_{\ell-1}a_{h+1},\]
\[\operatorname{Var}[e_h(\ell)]=(1+\psi_1^2+\cdots+\psi_{\ell-1}^2)\sigma_a^2,\tag{2.34}\]
是 \(\ell\) 的非减函数。MA 表示也给出均值回复的简单证明:\(\psi_i\to0\) 推出 \(\hat r_h(\ell)\to\mu\);又 \(\operatorname{Var}(r_t)=(1+\sum\psi_i^2)\sigma_a^2\),故 \(\operatorname{Var}[e_h(\ell)]\to\operatorname{Var}(r_t)\)。\(\hat r_h(\ell)\) 趋近 \(\mu\) 的速度即均值回复速度。

2.7 单位根非平稳(Unit-Root Nonstationarity,PDF p.91–101)

利率、汇率、资产价格往往非平稳——价格没有固定水平。这类序列称单位根非平稳序列,最典型的是随机游走。

2.7.1 随机游走(Random Walk,PDF p.92–93)

\[p_t=p_{t-1}+a_t,\tag{2.35}\]

\(p_0\) 为初值(如对数 IPO 价格),\(a_t\) 白噪声。若 \(a_t\) 关于 0 对称,则 \(p_t\) 涨跌各半。看作 AR(1) 时系数为 1,不满足平稳条件,故为单位根非平稳。随机游走被广泛用作对数股价模型,此时股价不可预测、不均值回复:\(\hat p_h(\ell)=p_h\) 对所有 \(\ell\) 成立,预测没有实际价值。

MA 表示 \(p_t=a_t+a_{t-1}+a_{t-2}+\cdots\) 的含义:

  1. \(e_h(\ell)=a_{h+\ell}+\cdots+a_{h+1}\),\(\operatorname{Var}[e_h(\ell)]=\ell\sigma_a^2\to\infty\),预测区间长度趋于无穷,点预测的有用性随步长降低;
  2. 无条件方差无界,\(p_t\) 理论上可取任意实数——对个股对数价格可接受,但对市场指数,负的对数价格极罕见,因此随机游走对指数的适当性存疑;
  3. \(\psi_i=1\) 对所有 \(i\),过去冲击的影响不衰减,序列有强记忆,经济学称冲击有永久效应(permanent effect);样本 ACF 随样本增大都趋近 1。

2.7.2 带漂移的随机游走(Random Walk with Drift,PDF p.93–95)

市场指数对数收益有小的正均值,故对数价格模型为

\[p_t=\mu+p_{t-1}+a_t,\tag{2.36}\]
\(\mu=E(p_t-p_{t-1})\) 称漂移(drift),代表对数价格的时间趋势。迭代得 \(p_t=t\mu+p_0+\sum_{i=1}^ta_i\):时间趋势 \(t\mu\) 加纯随机游走。条件标准差 \(\sqrt t\sigma_a\) 增长慢于条件期望 \(t\mu\),故图上呈斜率为 \(\mu\) 的趋势;\(\mu>0\) 时对数价格最终趋于 \(+\infty\)。

例(3M):月对数收益无显著序列相关,模型

\[r_t=0.0103+a_t,\quad\hat\sigma_a=0.0637,\tag{2.37}\]
均值标准误 0.0023,\(t=4.44\),1% 水平显著。构造 \(p_t=\sum_{i=1}^tr_i\)(假设 1946 年 1 月对数价格为 0)与去均值版本 \(p_t^*=\sum_{i=1}^ta_i\)(\(a_t=r_t-0.0103\))。图 2.10:\(p_t\) 呈明显上升趋势,斜率即 0.0103,\(p_t^*\) 无趋势,直观显示漂移项的重要性。

常数项的解释(对比动态模型与普通回归):MA(\(q\)) 中常数项即均值;平稳 AR(\(p\))/ARMA 中 \(\mu=\phi_0/(1-\phi_1-\cdots-\phi_p)\);带漂移随机游走中常数项是时间斜率。另一区别:AR(1) 有意义需 \(|\phi_1|\le1\),而回归 \(y_t=\beta_0+\beta_1x_t+a_t\) 中 \(\beta_1\) 可取任意实数。

2.7.3 趋势平稳时间序列(Trend-Stationary Time Series,PDF p.95)

\[p_t=\beta_0+\beta_1t+r_t,\]

\(r_t\) 平稳(如平稳 AR(\(p\)))。与带漂移随机游走外观相似,但本质不同:带漂移随机游走 \(E(p_t)=p_0+\mu t\)、\(\operatorname{Var}(p_t)=t\sigma_a^2\),均随时间变化;趋势平稳 \(E(p_t)=\beta_0+\beta_1t\) 随时间变化,但 \(\operatorname{Var}(p_t)=\operatorname{Var}(r_t)\) 有限且不变。趋势平稳序列可通过线性回归去除时间趋势变为平稳(方法见 2.9 节);而单位根序列需差分。

2.7.4 一般单位根非平稳模型(PDF p.95–96)

ARMA 的 AR 多项式允许以 1 为特征根,即得 ARIMA(autoregressive integrated moving-average)模型。与随机游走一样有强记忆,MA 表示中 \(\psi_i\) 不衰减,冲击永久影响。传统处理方法是差分(differencing):若 \(c_t=y_t-y_{t-1}=(1-B)y_t\) 服从平稳可逆 ARMA(\(p,q\)),则 \(y_t\) 为 ARIMA(\(p\),1,\(q\))。金融中价格非平稳但对数收益平稳,故对数价格可视为 ARIMA 过程。若 \(y_t\) 与一阶差分 \(c_t\) 都非平稳,而二阶差分 \(s_t=c_t-c_{t-1}=y_t-2y_{t-1}+y_{t-2}\) 平稳,则 \(y_t\) 有双单位根,若 \(s_t\) 服从 ARMA(\(p,q\)) 则 \(y_t\) 为 ARIMA(\(p\),2,\(q\));若 \(s_t\) 均值非零,则 \(y_t\) 有二次时间趋势。美国季度 GDP 隐含价格平减指数(季调)可能有双单位根,但二阶差分均值不显著(见习题)。

2.7.5 单位根检验(Unit-Root Test,PDF p.96–101)

检验对数价格是随机游走还是带漂移随机游走,采用

\[p_t=\phi_1p_{t-1}+e_t,\tag{2.38}\]
\[p_t=\phi_0+\phi_1p_{t-1}+e_t,\tag{2.39}\]
检验 \(H_0:\phi_1=1\) vs \(H_a:\phi_1<1\)(Dickey & Fuller 1979)。对 (2.38),LS 估计
\[\hat\phi_1=\frac{\sum_{t=1}^Tp_{t-1}p_t}{\sum_{t=1}^Tp_{t-1}^2},\qquad\hat\sigma_e^2=\frac{\sum_{t=1}^T(p_t-\hat\phi_1p_{t-1})^2}{T-1},\]
(\(p_0=0\)),Dickey–Fuller 统计量
\[DF\equiv t=\frac{\hat\phi_1-1}{\operatorname{std}(\hat\phi_1)}=\frac{\sum_{t=1}^Tp_{t-1}e_t}{\hat\sigma_e\sqrt{\sum_{t=1}^Tp_{t-1}^2}}.\]
若 \(e_t\) 为矩略高于 2 阶有限的白噪声,DF 统计量收敛到标准布朗运动的泛函(Chan & Wei 1988;Phillips 1987),非标准分布。若真实 \(\phi_0=0\) 却用 (2.39),\(t\) 统计量收敛到另一种非标准分布;两种情况都要模拟得到临界值(Fuller 1976 第 8 章)。若 \(\phi_0\ne0\) 且用 (2.39),\(t\) 统计量渐近正态,但需很大样本。

ADF 检验(augmented Dickey–Fuller):对 AR(\(p\)) 序列 \(x_t\),回归

\[x_t=c_t+\beta x_{t-1}+\sum_{i=1}^{p-1}\phi_i\Delta x_{t-i}+e_t,\tag{2.40}\]
\(c_t\) 为确定性时间函数(0、常数或 \(\omega_0+\omega_1t\)),\(\Delta x_j=x_j-x_{j-1}\)。检验 \(H_0:\beta=1\) vs \(H_a:\beta<1\),统计量
\[\text{ADF}=\frac{\hat\beta-1}{\operatorname{std}(\hat\beta)}.\]
(2.40) 等价于带确定性项的 AR(\(p\));亦可改写为 \(\Delta x_t=c_t+\beta_cx_{t-1}+\sum_{i=1}^{p-1}\phi_i\Delta x_{t-i}+e_t\),\(\beta_c=\beta-1\),检验 \(H_0:\beta_c=0\) vs \(H_a:\beta_c<0\)。

例 2.2 美国季度 GDP 对数(1947Q1–2008Q4,图 2.11):对数 GDP 上升趋势、样本 ACF 很高;一阶差分(增长率)围绕固定均值波动(近年波动变小)。根据差分序列 PACF 取 \(p=10\),ADF 统计量 −1.701,p=0.4297,不能拒绝单位根;\(\hat\beta=1+\hat\beta_c=1-0.0008=0.9992\)。R:library(fUnitRoots);adfTest(gdp,lags=10,type=c("c")) 得 −1.6109,p=0.4569。S-Plus:unitroot(gdp,trend='c',method='adf',lags=10),常数项 0.0134(显著),残差标准误 0.009318。

例:S&P 500 日对数指数(1950-01-03—2008-04-16,14,462 个观测,图 2.12):检验是否为带漂移随机游走,取 \(c_t=\omega_0+\omega_1t\),按差分序列 PACF 取 \(p=15\),ADF=−1.998,p=0.602,不能拒绝单位根;常数项显著(0.0019,t=2.39),时间趋势项在 5% 不显著(t=1.85,10% 显著)。结论:该期间 S&P 500 对数指数含单位根与正漂移,无强的时间趋势证据。R:ar(diff(sp5),method='mle') 选 2 阶;adfTest(sp5,lags=2,type="ct") 得 −2.0179,p=0.5708;lags=15 得 −1.9946,p=0.5807。

2.8 季节模型(Seasonal Models,PDF p.101–110)

某些金融序列(如公司季度每股收益 EPS)呈周期性,称季节时间序列。图 2.13:Johnson & Johnson 1960Q1–1980Q4 季度 EPS(数据来自 Shumway & Stoffer 2000),呈指数增长、强季节性、波动随时间增大;周期为 4(月度数据如沃尔玛月销售额周期为 12)。季节模型也用于天气衍生品和能源期货定价(环境序列季节性强)。

季节调整(seasonal adjustment):若季节性是次要的,可先去除(美国政府发布的 GDP 增长率、失业率等多为季调数据);但在预测中季节性与其他特征同等重要,须直接建模——本节采取后一思路。

2.8.1 季节差分(Seasonal Differencing,PDF p.102–104)

取对数的两个理由:(1) 处理指数增长(对数尺度下线性增长);(2) 稳定方差(图 2.13(b) 中波动递增的模式消失)。对数变换在金融经济序列中很常用;若有非正值,可先加正常数。

设 \(x_t\) 为对数 EPS。图 2.14:(a) \(x_t\) 的 ACF 很强;(b) 一阶差分 \(\Delta x_t=(1-B)x_t\) 的 ACF 在周期 4 的倍数处很强——季节序列的典型表现。按 Box–Jenkins–Reinsel (1994, 第 9 章) 再做季节差分:

\[\Delta_4(\Delta x_t)=(1-B^4)\Delta x_t=\Delta x_t-\Delta x_{t-4}=x_t-x_{t-1}-x_{t-4}+x_{t-5}.\]
一般周期 \(s\) 的季节差分 \(\Delta_sy_t=y_t-y_{t-s}=(1-B^s)y_t\);\(\Delta y_t=(1-B)y_t\) 称常规差分(regular differencing)。(d) \(\Delta_4\Delta x_t\) 的 ACF 在滞后 1 有显著负相关,滞后 4 有边缘负相关;(c) 为仅季节差分 \(\Delta_4x_t\) 的 ACF。

2.8.2 乘积季节模型(Multiplicative Seasonal Models,PDF p.104–110)

上述 ACF 形态在季节序列中很常见,由此产生航空模型(airline model,Box–Jenkins–Reinsel 1994 第 9 章):

\[(1-B^s)(1-B)x_t=(1-\theta B)(1-\Theta B^s)a_t,\tag{2.41}\]
\(|\theta|<1\),\(|\Theta|<1\)。AR 部分只是常规与季节差分,MA 部分两个参数。记 \(w_t=(1-B^s)(1-B)x_t=a_t-\theta a_{t-1}-\Theta a_{t-s}+\theta\Theta a_{t-s-1}\)(\(s>1\)),则 \(E(w_t)=0\),

  • \(\operatorname{Var}(w_t)=(1+\theta^2)(1+\Theta^2)\sigma_a^2\);
  • \(\operatorname{Cov}(w_t,w_{t-1})=-\theta(1+\Theta^2)\sigma_a^2\);
  • \(\operatorname{Cov}(w_t,w_{t-s+1})=\operatorname{Cov}(w_t,w_{t-s-1})=\theta\Theta\sigma_a^2\);
  • \(\operatorname{Cov}(w_t,w_{t-s})=-\Theta(1+\theta^2)\sigma_a^2\);其余滞后为 0。

故

\[\rho_1=\frac{-\theta}{1+\theta^2},\quad\rho_s=\frac{-\Theta}{1+\Theta^2},\quad\rho_{s-1}=\rho_{s+1}=\rho_1\rho_s=\frac{\theta\Theta}{(1+\theta^2)(1+\Theta^2)},\]
其他 \(\ell>0\) 的 ACF 为 0。季度数据 \(s=4\) 时只在滞后 1、3、4、5 非零。与 MA(1) \(y_t=(1-\theta B)a_t\) 和季节 MA \(z_t=(1-\Theta B^s)a_t\) 比较:\(\rho_1=\rho_1(y)\),\(\rho_s=\rho_s(z)\),\(\rho_{s\pm1}=\rho_1(y)\rho_s(z)\)——滞后 \(s\pm1\) 的 ACF 是滞后 1 与滞后 \(s\) 相依的交互作用,故称乘积季节 MA 模型(multiplicative seasonal MA)。实践含义:常规成分与季节成分的动态近似正交。

非乘积季节 MA:\(w_t=(1-\theta B-\Theta B^s)a_t\) (2.42),此时 \(\rho_{s+1}=0\)。参数个数相同,但乘积模型有更多非零 ACF,因此更节约(parsimonious)。

例 2.3 J&J 对数 EPS 的航空模型(精确似然):

\[(1-B)(1-B^4)x_t=(1-0.678B)(1-0.314B^4)a_t,\quad\hat\sigma_a=0.089,\]
MA 参数标准误 0.080、0.101;残差 \(Q(12)=10.0\),p=0.44,模型充分。用前 76 个观测重估、保留最后 8 个做检验:原点 \(h=76\)(1978Q4)做 1–8 步预测,再利用第 1 章正态与对数正态关系反变换(antilog)得 EPS 预测;图 2.15 显示预测呈强季节模式并接近实际值,95% 区间覆盖良好。另一种建模方法见例 11.3。

确定性季节性与虚拟变量:若季节模式稳定(近似确定性),可用虚拟变量(dummy variables)。确定性季节性是乘积季节模型的特例:\(\Theta=1\) 时 (2.41) 含确定性季节成分,此时虚拟变量与乘积季节模型预测相同;但季节模式非确定性时用虚拟变量预测较差。建议用精确似然法估计乘积季节模型,尤其样本小或可能存在确定性季节成分时。

例 2.4 CRSP Decile 1(最小市值组)指数月简单收益(1970-01—2008-12,468 个观测,图 2.16):时序图看不出季节性,但样本 ACF 在滞后 1、12、24、36 显著。识别季节 ARMA \((1-\phi_1B)(1-\phi_{12}B^{12})R_t=(1-\theta_{12}B^{12})a_t\)。条件似然:\((1-0.18B)(1-0.87B^{12})R_t=(1-0.74B^{12})a_t\),\(\tilde\sigma_a=0.069\);精确似然:\((1-0.188B)(1-0.951B^{12})R_t=(1-0.997B^{12})a_t\),\(\tilde\sigma_a=0.063\)。季节 AR 与 MA 因子几乎相互抵消,显示精确似然法的价值,并提示季节行为可能是确定性的。构造一月虚拟变量 \(\text{Jan}_t\),回归

\[R_t=\beta_0+\beta_1\text{Jan}_t+e_t\ \Rightarrow\ R_t=0.0029+0.1253\,\text{Jan}_t+e_t,\]
标准误 0.0033、0.0115(\(t=10.85\)),\(R^2=0.2016\)。残差的 ACF 在 12、24、36 处的相关基本消失——Decile 1 月收益的季节性主要来自一月效应(January effect),即小盘股一月平均多赚约 12.5%。

R 演示:jan=rep(c(1,rep(0,11)),39);lm(d1~jan);arima(d1,order=c(1,0,0),seasonal=list(order=c(1,0,1),period=12)) 得 ar1=0.1769、sar1=0.9882、sma1=−0.9144(R 的 MA 符号为正号约定);tsdiag(m2,gof=36) 做诊断;include.mean=F 去均值项。SCA 演示:tsm m1. model (1)(12)dec1=(12)noise.,estim m1.(条件)与 estim m1. method exact.(精确),精确法 MA(12)=0.9968、AR(12)=0.9505,\(R^2=0.328\)。

2.9 带时间序列误差的回归模型(Regression Models with Time Series Errors,PDF p.110–117)

很多应用关注两个时间序列之间的关系,如市场模型(个股超额收益对指数超额收益)和利率期限结构。考虑

\[y_t=\alpha+\beta x_t+e_t.\tag{2.43}\]
若 \(e_t\) 为白噪声,LS 估计一致;但 \(e_t\) 常有序列相关,此时 LS 估计可能不一致。该模型应用广泛,但也是最常被误用的计量模型之一,因为误差的序列相依常被忽略。

例:美国周度利率:\(r_{1t}\) = 1 年期、\(r_{3t}\) = 3 年期国债固定期限利率(1962-01-05—2009-04-10,2467 个观测,百分比,来源 St. Louis Fed)。严格说应用第 8 章多元方法联合建模,这里忽略联立性。图 2.17、2.18(a) 显示两者高度相关。

  • 朴素回归:
    \[r_{3t}=0.832+0.930r_{1t}+e_t,\quad\hat\sigma_e=0.523,\ R^2=96.5\%,\tag{2.44}\]
    标准误 0.024、0.004。但图 2.19 残差 ACF 高度显著且缓慢衰减,呈单位根非平稳特征。用现代术语:若两利率都是单位根序列,则残差非平稳说明两者不协整(not cointegrated,第 8 章),数据不支持二者存在长期均衡——样本期内确实出现过收益率曲线倒挂(inverted yield curve,利率与期限反向)。
  • 改用变化量 \(c_{1t}=(1-B)r_{1t}\)、\(c_{3t}=(1-B)r_{3t}\)(图 2.20、2.18(b)),回归
    \[c_{3t}=0.792c_{1t}+e_t,\quad\hat\sigma_e=0.0690,\ R^2=82.5\%,\tag{2.45}\]
    标准误 0.0073。图 2.21 残差 ACF 仍有显著但小得多的序列相关。
  • 由残差 ACF 设定 MA(1) 误差:
    \[c_{3t}=\beta c_{1t}+e_t,\quad e_t=a_t-\theta_1a_{t-1},\tag{2.46}\]
    在计算机普及前需 Cochrane–Orcutt 等专门方法(Greene 2003),如今若误差模型平稳可逆即可用 ML 联合估计。结果
    \[c_{3t}=0.794c_{1t}+e_t,\quad e_t=a_t+0.1823a_{t-1},\quad\hat\sigma_a=0.0678,\ R^2=83.1\%,\tag{2.47}\]
    标准误 0.0075、0.0196。滞后 1 残差 ACF 不再显著,滞后 4、6、7 仍有小相关,加 MA 项改进很小。

比较结论:(1) 模型 (2.44) 的高 \(R^2\) 与系数 0.930 具有误导性(残差强序列相关,伪回归);(2) 对变化量序列,(2.45) 与 (2.47) 的 \(R^2\) 和系数接近,加 MA(1) 只是边际改进(MA 系数数值小但高度显著);(3) 回归分析中检查残差序列相依至关重要。由 (2.47) 得 \(r_{3t}=r_{3,t-1}+0.794(r_{1t}-r_{1,t-1})+a_t+0.182a_{t-1}\):两利率同期相关且序列相关。

R:lm(r3~r1);lm(c3~-1+c1)(无截距);arima(c3,order=c(0,0,1),xreg=c1,include.mean=F);\(R^2\) 用 (sum(c3^2)-sum(m3$residuals^2))/sum(c3^2)=0.831 计算。

一般建模步骤:

  1. 拟合线性回归,检查残差序列相关;
  2. 若残差单位根非平稳,对因变量和解释变量都做一阶差分,回到第 1 步;若残差平稳,为残差识别 ARMA 模型并相应修改回归模型;
  3. 用 ML 联合估计,检查拟合模型并进一步改进。

检查残差序列相关应用 Ljung–Box 而非 Durbin–Watson,因为 DW 只考虑滞后 1,而残差相依可能出现在更高阶(尤其有季节性时)。注:

\[DW=\frac{\sum_{t=2}^T(e_t-e_{t-1})^2}{\sum_{t=1}^Te_t^2}\approx2(1-\hat\rho_1).\]
S-Plus:残差为 AR 时可用 OLS,滞后变量用 tslag(r,1),如 OLS(c3t~c1t+tslag(c3t,1)+tslag(c1t,1),na.rm=T)。

2.10 一致协方差矩阵估计(Consistent Covariance Matrix Estimation,PDF p.117–121)

当误差有序列相关和/或条件异方差,但主要目的是推断回归系数,且 OLS 系数估计仍一致时,可用一致的协方差矩阵估计:HC(heteroscedasticity consistent,Eicker 1967;White 1980)和 HAC(heteroscedasticity and autocorrelation consistent,Newey & West 1987)。

回归写成 \(y_t=\mathbf x_t'\boldsymbol\beta+e_t\) (2.48),\(\mathbf x_t\) 为含常数的 \(k\) 维解释变量。LS 估计与通常协方差

\[\hat{\boldsymbol\beta}=\Big(\sum\mathbf x_t\mathbf x_t'\Big)^{-1}\sum\mathbf x_ty_t,\qquad\operatorname{Cov}(\hat{\boldsymbol\beta})=\sigma_e^2\Big(\sum\mathbf x_t\mathbf x_t'\Big)^{-1}.\]
存在序列相关或条件异方差时后者不一致,通常夸大 t 值。

White 估计量(HC):

\[\operatorname{Cov}(\hat{\boldsymbol\beta})_{HC}=\Big(\sum\mathbf x_t\mathbf x_t'\Big)^{-1}\Big(\sum\hat e_t^2\mathbf x_t\mathbf x_t'\Big)\Big(\sum\mathbf x_t\mathbf x_t'\Big)^{-1},\tag{2.49}\]
\(\hat e_t=y_t-\mathbf x_t'\hat{\boldsymbol\beta}\)。

Newey–West 估计量(HAC):

\[\operatorname{Cov}(\hat{\boldsymbol\beta})_{HAC}=\Big(\sum\mathbf x_t\mathbf x_t'\Big)^{-1}\mathbf C_{HAC}\Big(\sum\mathbf x_t\mathbf x_t'\Big)^{-1},\tag{2.50}\]
\[\mathbf C_{HAC}=\sum_{t=1}^T\hat e_t^2\mathbf x_t\mathbf x_t'+\sum_{j=1}^\ell w_j\sum_{t=j+1}^T\big(\mathbf x_t\hat e_t\hat e_{t-j}\mathbf x_{t-j}'+\mathbf x_{t-j}\hat e_{t-j}\hat e_t\mathbf x_t'\big),\]
\(\ell\) 为截断参数,\(w_j\) 为权函数,如 Bartlett 权 \(w_j=1-j/(\ell+1)\)(保证正定)。Newey–West 建议 \(\ell\) 取 \(4(T/100)^{2/9}\) 的整数部分。本质上是用非参数方法估计 \(\sum\hat e_t\mathbf x_t\) 的协方差矩阵(长期方差)。

例:利率变化回归 (2.45) 中 \(c_{1t}\) 系数的 t 值:忽略序列相关与异方差时 107.91,HC 时 48.44(标准误 0.0163),HAC 时 39.92(标准误 0.0198)。S-Plus:summary(reg.fit,correction="white") 与 correction="nw"。也可在回归中加入 \(c_{1,t-1}\)、\(c_{3,t-1}\) 处理残差序列相关:\(c_{3t}=0.7971c_{1t}+0.1766c_{3,t-1}-0.1580c_{1,t-1}\),\(R^2=0.8312\),DW=1.9865;还可对其再用 HC/HAC 修正 t 值。

辅助回归求单个系数的 HC 方差:\(k>1\) 时,令 \(\mathbf x_{-j,t}\) 为去掉 \(x_{jt}\) 的 \((k-1)\) 维向量,做辅助回归 \(x_{jt}=\mathbf x_{-j,t}'\boldsymbol\gamma+v_t\) (2.51),残差 \(\hat v_t\),则

\[\operatorname{Var}(\hat\beta_j)_{HC}=\frac{\sum\hat e_t^2\hat v_t^2}{\big(\sum\hat v_t^2\big)^2}.\]
辅助回归使 \(\hat v_t\) 与其他回归元正交(Frisch–Waugh 思想),从而简化 (2.49)。

2.11 长记忆模型(Long-Memory Models,PDF p.121–123)

平稳序列 ACF 指数衰减;单位根序列样本 ACF 对所有固定滞后随样本增大趋于 1(Chan & Wei 1988;Tiao & Tsay 1983)。介于两者之间,有些序列 ACF 以多项式速率缓慢衰减,称长记忆(long-memory)序列。典型例子是分数差分过程(fractionally differenced process):

\[(1-B)^dx_t=a_t,\quad-0.5<d<0.5.\tag{2.52}\]
性质(Hosking 1981):

  1. \(d<0.5\) 时弱平稳,MA(∞) 表示 \(x_t=a_t+\sum\psi_ia_{t-i}\),\(\psi_k=\dfrac{d(1+d)\cdots(k-1+d)}{k!}=\dfrac{(k+d-1)!}{k!(d-1)!}\)。
  2. \(d>-0.5\) 时可逆,AR(∞) 表示 \(x_t=\sum\pi_ix_{t-i}+a_t\),\(\pi_k=\dfrac{-d(1-d)\cdots(k-1-d)}{k!}=\dfrac{(k-d-1)!}{k!(-d-1)!}\)。
  3. \(-0.5<d<0.5\) 时 ACF \(\rho_k=\dfrac{d(1+d)\cdots(k-1+d)}{(1-d)(2-d)\cdots(k-d)}\),\(\rho_1=d/(1-d)\),\(\rho_k\approx\dfrac{(-d)!}{(d-1)!}k^{2d-1}\)(\(k\to\infty\))。
  4. PACF \(\phi_{k,k}=d/(k-d)\)。
  5. 谱密度(ACF 的 Fourier 变换)\(f(\omega)\sim\omega^{-2d}\)(\(\omega\to0\))(2.53),\(\omega\in[0,2\pi]\)。

关键:\(\rho_k\sim k^{2d-1}\) 是多项式衰减而非指数衰减;谱密度在零频处发散(\(d>0\) 时),而平稳 ARMA 的谱密度在 \([0,2\pi]\) 上有界。

分数差分算子用非整数幂二项展开:\((1-B)^d=\sum_{k=0}^\infty(-1)^k\binom dkB^k\),\(\binom dk=\dfrac{d(d-1)\cdots(d-k+1)}{k!}\)。若 \((1-B)^dx_t\) 服从 ARMA(\(p,q\)),则 \(x_t\) 为 ARFIMA(\(p,d,q\)),即允许非整数 \(d\) 的广义 ARIMA。

识别:样本 ACF 数值不大但衰减很慢,提示长记忆。图 2.22:CRSP VW 与 EW 指数日简单收益绝对值序列(1970-01-02—2008-12-31)的 ACF 数值小但衰减极慢,300 阶后仍在 5% 水平显著(参见 Ding, Granger & Engle 1993)。纯分数差分模型的 \(d\) 可用 ML 或低频对数周期图回归(log-periodogram regression)估计。长记忆在金融文献中受关注部分源于连续时间模型中分数布朗运动的研究。

附录:SCA 命令(PDF p.123–124)

给出 2.9 节利率分析的 SCA 命令:input 读入 w-gs1yr.txt、w-gs3yr.txt;tsm m1. model rate3=b0+(b1)rate1+noise. 设定回归;estim m1. hold resi(r1). 估计并保存残差;acf r1. maxl 10.;diff old rate1,rate3. new c1t,c3t. compress. 差分;tsm m3. model c3t=g0+(g1)c1t+(1)noise. 设定 MA(1) 误差的回归;estim m3. method exact. 精确似然;(1,4,6,7)noise 加入更多 MA 滞后。

习题(PDF p.124–127)

(未特别说明时用 5% 显著性水平。)

  • 2.1:月度债券指数简单收益 \(R_t=a_t+0.2a_{t-1}\),\(\sigma_a=0.025\),\(a_{100}=0.01\),求原点 100 的 1、2 步预测及误差标准差,以及滞后 1、2 的 ACF(考查 MA(1) 预测与 ACF 公式)。
  • 2.2:\(r_t=0.01+0.2r_{t-2}+a_t\),\(\operatorname{Var}(a_t)=0.02\),求均值、方差、\(\rho_1,\rho_2\);给定 \(r_{100}=-0.01\)、\(r_{99}=0.02\) 求 1、2 步预测及误差标准差(考查 AR(2) 特例的矩与预测)。
  • 2.3:美国月度失业率(1948-01—2009-03,季调,m-unrate.txt)建模并预测 2009 年 4–7 月,判断是否隐含商业周期(考查复特征根)。
  • 2.4:CRSP 按市值 Decile 1、2、9、10 月收益(1970–2008):(a) Decile 2 与 10 的前 12 阶 ACF 联合检验;(b) 为 Decile 2 建 ARMA 并检验;(c) 1–12 步预测。
  • 2.5:IBM 日简单收益绝对值前 100 阶 ACF,是否有长程相依。
  • 2.6:某制造业月度用电需求(对数,power6.txt)建模并做 1–24 步预测(季节模型)。
  • 2.7:1980–2008 日收益(IBM、VW、EW、SP,含星期虚拟变量,d-ibm3dxwkdays8008.txt):用回归研究星期效应(weekday effect)对 EW 的影响,用 HAC 修正 t 值,检查残差序列相关,必要时建带时间序列误差的回归。
  • 2.8:对 S&P 日收益做同样分析,检验无周五效应。
  • 2.9:对 IBM 日收益做同样分析,并用带时间序列误差的回归改进。
  • 2.10:Moody's Aaa 与 Baa 周度债券收益率(1962-01-05—2009-04-10)描述统计,检验偏度与厚尾。
  • 2.11:为月度 Aaa 收益率建时间序列模型。
  • 2.12:以 Aaa 为因变量、Baa 为自变量建带时间序列误差的回归,研究两者关系。
  • 2.13:CRSP 等权指数月对数收益(1962–1999,456 个观测,m-ew6299.txt):分别建 AR 和 MA 模型并检验,计算 1、2 步预测并比较。
  • 2.14:S&P 500 指数与 6 月期货 1993 年 5 月的 1 分钟日内数据(sp5may.dat:对数期货价、对数现货价、持有成本),对 \(y_t=\Delta f_t\)、\(x_t=\Delta s_t\) 建带时间序列误差的回归(指数期货套利研究背景)。
  • 2.15:美国季度 GDP 隐含价格平减指数(1947Q1–2008Q4,2000=100,q-gdpdef.txt)建 ARIMA 并预测 2009 年各季通胀。

参考文献(p.127–128):Akaike (1973)、Box & Pierce (1970)、Box–Jenkins–Reinsel (1994)、Brockwell & Davis (1991, 1996)、Chan & Wei (1988)、Dickey & Fuller (1979)、Ding–Granger–Engle (1993)、Eicker (1967)、Fuller (1976)、Greene (2003)、Hosking (1981)、Ljung & Box (1978)、Newey & West (1987)、Phillips (1987)、Shumway & Stoffer (2000)、Tiao & Tsay (1983)、Tsay & Tiao (1984)、White (1980)。

第 2 章小结

本章要点

  • 弱平稳(一、二阶矩时不变)是线性时间序列分析的基础;ACF \(\rho_\ell=\gamma_\ell/\gamma_0\) 及其样本估计、\(1/T\) 渐近方差和 Bartlett 公式;Ljung–Box \(Q(m)\) 联合检验,\(m\approx\ln T\)。
  • 线性序列 = 白噪声冲击的加权和 (2.4);\(\psi\) 权重决定 ACF (2.7)。
  • AR(\(p\)):均值 \(\phi_0/(1-\sum\phi_i)\);平稳条件为特征根在单位圆内;ACF 拖尾(指数衰减/阻尼正弦),PACF 在 \(p\) 截尾;复根对应随机周期,周期长度 \(2\pi/\cos^{-1}[\phi_1/(2\sqrt{-\phi_2})]\);定阶用 PACF 或 AIC/BIC(BIC 偏好更低阶);条件 LS 估计;残差 \(Q(m)\sim\chi^2_{m-g}\)。
  • MA(\(q\)):恒平稳,常数即均值,ACF 在 \(q\) 截尾,可逆需 MA 多项式零点在单位圆外;条件似然与精确似然估计;\(q\) 步后预测等于均值。
  • ARMA:参数节约;ACF、PACF 均拖尾,用 EACF 的 O 三角顶点定阶;三种表示(ARMA/AR(π 权)/MA(ψ 权, 脉冲响应)),MA 表示给出预测误差方差 (2.34) 和均值回复证明;AR(1) 半衰期 \(\ln0.5/\ln|\phi_1|\)。
  • 单位根:随机游走不可预测、预测误差方差线性增长、冲击永久;带漂移随机游走的常数项是趋势斜率;趋势平稳与差分平稳的区别;DF/ADF 检验统计量服从非标准分布。
  • 季节模型:季节差分 \((1-B^s)\);航空模型 \((1-B)(1-B^s)x_t=(1-\theta B)(1-\Theta B^s)a_t\) 及其 ACF;确定性季节性可用虚拟变量(一月效应例)。
  • 带时间序列误差的回归:忽略误差序列相关会导致伪回归和错误推断;先检查残差,非平稳则差分,平稳则为残差建 ARMA 并联合估计;用 Ljung–Box 而非 DW。
  • HC(White)与 HAC(Newey–West)协方差估计在误差异方差/自相关时给出正确标准误。
  • 长记忆:分数差分 \((1-B)^d\),ACF 以 \(k^{2d-1}\) 多项式衰减;收益绝对值序列表现出长记忆。

与量化交易的关联

  • 因子/信号研究:检验收益可预测性的第一步就是 ACF 与 Ljung–Box;个股月收益接近白噪声,而指数收益有正一阶自相关(部分源于非同步交易),短周期反转/动量信号需先排除此类微观结构伪相关。
  • 回归推断(极常用):因子收益对特征的时间序列回归、Fama–MacBeth 的时间序列 t 统计、alpha 检验、事件研究中的残差相关,都应用 Newey–West HAC 标准误;重叠收益(如用日数据算月度前瞻收益)造成的 MA 结构使普通 t 值严重高估——本章利用 t 值 107.9→39.9 的例子很直观。
  • 伪回归与协整:价格/利率水平回归的高 \(R^2\) 不可信(例 2.44),配对交易和统计套利须先做单位根/协整检验(第 8 章展开);ADF 检验可直接用于价差序列的平稳性判断。
  • 均值回复策略:AR(1)/OU 型价差的半衰期 \(\ln0.5/\ln|\phi_1|\) 用于设定持仓周期和止损时间;ARMA 预测误差方差 (2.34) 用于设定入场阈值。
  • 季节性与日历效应:一月效应、星期效应(习题 2.7–2.9)是经典日历异象,虚拟变量回归 + HAC 是标准检验方法。
  • 模型选择:AIC/BIC、残差诊断的流程可迁移到任何预测模型的过拟合控制。
  • 波动率预测铺垫:GARCH 即 \(a_t^2\) 的 ARMA;绝对收益的长记忆提示长记忆波动模型(FIGARCH、HAR 类)的必要性。
  • 样本外评估:表 2.2、2.3 的滚动原点预测是回测中"只用原点前数据重估"的基本做法;2008 年的预测失败提醒线性模型在危机期的局限。

推荐习题

  • 2.1、2.2:手算 MA/AR 预测和 ACF,夯实公式。
  • 2.3:失业率 AR 建模与商业周期判断(复根应用)。
  • 2.7–2.9:日历效应回归 + HAC + 带时间序列误差的回归,最贴近量化实务的一组。
  • 2.13:同一序列 AR 与 MA 建模的比较,体会定阶与诊断。
  • 2.14:期现货高频数据的回归,联系指数套利。
  • 2.15:ARIMA 建模与单位根判断(可能双单位根)。

第 3 章 条件异方差模型(Conditional Heteroscedastic Models,PDF p.129–194)

章首导言(PDF p.129–130)

本章研究资产收益波动率(volatility,即标的资产收益的条件标准差)的建模方法,统称条件异方差模型。

期权中的波动率:欧式看涨期权(European call option)赋予持有人在到期日以执行价 \(K\)(strike price)买入一定股数的权利而非义务;\(\ell\) 为距到期时间(年)。Black–Scholes 公式:

\[c_t=P_t\Phi(x)-Ke^{-r\ell}\Phi(x-\sigma_t\sqrt\ell),\qquad x=\frac{\ln(P_t/K)+r\ell}{\sigma_t\sqrt\ell}+\frac12\sigma_t\sqrt\ell,\tag{3.1}\]
\(P_t\) 为现价,\(r\) 为连续复利无风险利率,\(\sigma_t\) 为对数收益的年化条件标准差,\(\Phi\) 为标准正态 CDF(推导见第 6 章)。条件标准差随时间演化。可在到期日前任何时间行权的称美式看涨期权(American call)。

其他应用:VaR 计算(第 7 章);均值–方差框架下的资产配置;对波动率建模能提高参数估计效率和区间预测精度;波动率指数本身成为交易品种——CBOE 的 VIX 期货于 2004-03-26 开始交易。

本章模型:ARCH(Engle 1982)、GARCH(Bollerslev 1986)、EGARCH(Nelson 1991)、TGARCH(Glosten–Jagannathan–Runkle 1993;Zakoian 1994)、CHARMA(Tsay 1987)、RCA(Nicholls & Quinn 1982)、随机波动率 SV(Melino & Turnbull 1990;Taylor 1994;Harvey–Ruiz–Shephard 1994;Jacquier–Polson–Rossi 1994);3.15 节介绍替代方法(高频数据、日内高低价)。多元波动率见第 10 章。

3.1 波动率的特征(Characteristics of Volatility,PDF p.130–131)

  • 不可直接观测:日波动率无法从每日一个收益观测得到;若有日内数据(如 10 分钟收益)可估计(3.15 节),但股票波动包括日内波动和隔夜波动,日内高频数据对隔夜波动信息很有限。不可观测性使评价波动率模型的预测表现变得困难。
  • 隐含波动率(implied volatility):若接受 Black–Scholes 等模型决定价格,可从期权价格反推 \(\sigma_t\)。但它依赖几何布朗运动等假设,可能偏离实际波动率;经验上隐含波动率往往高于 GARCH 类模型估计值,可能源于波动率风险溢价或日收益计算方式。VIX 就是隐含波动率。
  • 四个常见特征:(1) 波动聚集(volatility clusters)——某些时期高、某些时期低;(2) 波动随时间连续演化,跳跃罕见;(3) 波动不发散到无穷,在固定范围内变动,统计上通常是平稳的;(4) 波动对大涨与大跌反应不同,称杠杆效应(leverage effect)。这些特征推动了模型发展,例如 EGARCH 就是为刻画正负收益引起的不对称性而提出。

3.2 模型结构(Structure of a Model,PDF p.131–133)

基本思想:收益序列 \(\{r_t\}\) 序列不相关(或仅有低阶弱相关),但并非独立。例:Intel 月对数收益(1973-01—2008-12,图 3.1)。图 3.2:(a) \(r_t\) 的 ACF 除滞后 7 有小相关外不显著;(b) \(r_t^2\) 与 (c) \(|r_t|\) 的 ACF 明显显著;(d) \(r_t^2\) 的 PACF。即"不相关但相依",波动率模型就是要刻画这种相依。

条件均值与条件方差:

\[\mu_t=E(r_t|F_{t-1}),\qquad\sigma_t^2=\operatorname{Var}(r_t|F_{t-1})=E[(r_t-\mu_t)^2|F_{t-1}],\tag{3.2}\]
\(F_{t-1}\) 通常为过去收益所有线性函数构成的信息集。因为收益序列相依很弱,\(\mu_t\) 方程应简单,设为带解释变量的平稳 ARMA:
\[r_t=\mu_t+a_t,\quad\mu_t=\sum_{i=1}^p\phi_iy_{t-i}-\sum_{i=1}^q\theta_ia_{t-i},\quad y_t=r_t-\phi_0-\sum_{i=1}^k\beta_ix_{it},\tag{3.3}\]
\(y_t\) 为去除解释变量影响后的调整收益。这正是第 2 章"带时间序列误差的回归"的应用。\((p,q)\) 可能依数据频率而定(日指数收益常有小的序列相关,月度则可能没有)。解释变量灵活,如周一虚拟变量研究周末效应;CAPM 均值方程 \(r_t=\phi_0+\beta r_{m,t}+a_t\)。合并得
\[\sigma_t^2=\operatorname{Var}(r_t|F_{t-1})=\operatorname{Var}(a_t|F_{t-1}).\tag{3.4}\]
条件异方差模型关心 \(\sigma_t^2\) 的演化方式,不同的演化方式区分不同模型。两大类:用确定函数驱动 \(\sigma_t^2\)(GARCH 类)与用随机方程描述 \(\sigma_t^2\)(随机波动率类)。术语:\(a_t\) 称冲击/新息,\(\sigma_t\) 为其正平方根;\(\mu_t\) 的模型称均值方程(mean equation),\(\sigma_t^2\) 的模型称波动率方程(volatility equation)。条件异方差建模就是在时间序列模型上增加一个刻画条件方差演化的动态方程。

3.3 建模步骤(Model Building,PDF p.133–135)

  1. 检验序列相依,设定均值方程(如 ARMA)以去除线性相依;
  2. 用均值方程残差检验 ARCH 效应;
  3. 若 ARCH 效应显著,设定波动率模型,对均值与波动率方程联合估计;
  4. 仔细检查拟合模型,必要时改进。

多数资产收益序列相关很弱,均值方程常只是减去显著非零的样本均值;部分日收益需简单 AR;也可加入周末或一月效应虚拟变量。本章用 R(含/不含 OX)与 S-Plus 演示,也可用 Eviews、SCA、RATS。

3.3.1 检验 ARCH 效应(Testing for ARCH Effect,PDF p.134–135)

令 \(a_t=r_t-\mu_t\) 为均值方程残差,用 \(a_t^2\) 检验条件异方差(ARCH 效应):

  1. McLeod–Li 检验(1983):对 \(\{a_t^2\}\) 用 Ljung–Box \(Q(m)\),\(H_0\):\(a_t^2\) 的前 \(m\) 阶 ACF 为零。
  2. Engle (1982) 拉格朗日乘子(LM)检验:回归
    \[a_t^2=\alpha_0+\alpha_1a_{t-1}^2+\cdots+\alpha_ma_{t-m}^2+e_t,\quad t=m+1,\dots,T,\]
    检验 \(H_0:\alpha_1=\cdots=\alpha_m=0\)。令 \(SSR_0=\sum_{t=m+1}^T(a_t^2-\bar\omega)^2\)(\(\bar\omega\) 为 \(a_t^2\) 样本均值),\(SSR_1=\sum\hat e_t^2\),
    \[F=\frac{(SSR_0-SSR_1)/m}{SSR_1/(T-2m-1)},\]
    原文称其渐近服从 \(\chi^2_m\)(严格说 \(mF\) 渐近 \(\chi^2_m\),或常用 \(TR^2\sim\chi^2_m\) 形式),\(F>\chi^2_m(\alpha)\) 或 p 值小于 \(\alpha\) 时拒绝。

例(Intel 月对数收益):收益本身 \(Q(12)=18.26\),p=0.11,无序列相关,可直接检验;LM 检验统计量约 53.62,p≈0;\(a_t^2\) 的 \(Q(12)=89.85\),p≈0,ARCH 效应很强。S-Plus archTest(intc,lag=12) 直接作用于 \(a_t\) 而非 \(a_t^2\);R:at=intc-mean(intc),Box.test(at^2,lag=12,type='Ljung') 得 89.85,p=5.3e-14。

3.4 ARCH 模型(The ARCH Model,PDF p.135–151)

ARCH 是第一个系统的波动率建模框架(Engle 1982)。基本思想:(a) 冲击 \(a_t\) 序列不相关但相依;(b) 相依可用其滞后值的简单二次函数描述。ARCH(\(m\)):

\[a_t=\sigma_t\epsilon_t,\qquad\sigma_t^2=\alpha_0+\alpha_1a_{t-1}^2+\cdots+\alpha_ma_{t-m}^2,\tag{3.5}\]
\(\{\epsilon_t\}\) iid,均值 0、方差 1;\(\alpha_0>0\),\(\alpha_i\ge0\);系数还需满足保证 \(a_t\) 无条件方差有限的正则条件。\(\epsilon_t\) 常设为标准正态、标准化 Student-t 或广义误差分布(GED)。

直观:过去大的平方冲击导致大的条件方差,使 \(a_t\) 倾向于取大值("倾向"是因为大方差只提高出现大值的概率),即大冲击后往往跟随大冲击——与波动聚集一致。

其他序列中的 ARCH 效应:图 3.3 德国马克/美元 10 分钟收益(1989-06-05—06-19,2488 个观测)及其平方:偶有大变动,也有平稳期;图 3.4 收益 ACF 无序列相关,平方序列 PACF 有大的尖峰——不独立、有 ARCH 效应。注:有些作者用 \(h_t\) 表示条件方差,\(a_t=\sqrt{h_t}\epsilon_t\)。

3.4.1 ARCH 模型的性质(PDF p.137–139)

以 ARCH(1) \(a_t=\sigma_t\epsilon_t\),\(\sigma_t^2=\alpha_0+\alpha_1a_{t-1}^2\)(\(\alpha_0>0,\alpha_1\ge0\))为例:

  1. 无条件均值:\(E(a_t)=E[E(a_t|F_{t-1})]=E[\sigma_tE(\epsilon_t)]=0\)。
  2. 无条件方差:\(\operatorname{Var}(a_t)=E[E(a_t^2|F_{t-1})]=\alpha_0+\alpha_1E(a_{t-1}^2)\),平稳时 \(\operatorname{Var}(a_t)=\alpha_0/(1-\alpha_1)\),需 \(0\le\alpha_1<1\)。
  3. 四阶矩:正态下 \(E(a_t^4|F_{t-1})=3[E(a_t^2|F_{t-1})]^2=3(\alpha_0+\alpha_1a_{t-1}^2)^2\)。若四阶平稳,\(m_4=E(a_t^4)\) 满足
    \[m_4=3[\alpha_0^2+2\alpha_0\alpha_1\operatorname{Var}(a_t)+\alpha_1^2m_4]=3\alpha_0^2\Big(1+\frac{2\alpha_1}{1-\alpha_1}\Big)+3\alpha_1^2m_4,\]
    \[m_4=\frac{3\alpha_0^2(1+\alpha_1)}{(1-\alpha_1)(1-3\alpha_1^2)}.\]
    含义:(a) 需 \(1-3\alpha_1^2>0\),即 \(0\le\alpha_1^2<1/3\);(b) 无条件峰度
    \[\frac{E(a_t^4)}{[\operatorname{Var}(a_t)]^2}=3\,\frac{1-\alpha_1^2}{1-3\alpha_1^2}>3,\]
    超额峰度为正,尾部比正态厚。即条件高斯的 ARCH(1) 冲击比高斯白噪声更易产生"异常值",与实证一致。这些性质对一般 ARCH 成立,但公式更复杂。

正性条件的放松:\(\alpha_i\ge0\) 只是为保证 \(\sigma_t^2>0\)。更自然的写法

\[a_t=\sigma_t\epsilon_t,\qquad\sigma_t^2=\alpha_0+\mathbf A_{m,t-1}'\boldsymbol\Omega\mathbf A_{m,t-1},\tag{3.6}\]
\(\mathbf A_{m,t-1}=(a_{t-1},\dots,a_{t-m})'\),\(\boldsymbol\Omega\) 为 \(m\times m\) 非负定矩阵。ARCH(\(m\)) 要求 \(\boldsymbol\Omega\) 对角,是对一般二次函数的节约近似。随机系数模型(CHARMA、RCA)可实现 (3.6)。

3.4.2 ARCH 模型的弱点(PDF p.139)

  1. 依赖平方冲击,假设正负冲击对波动影响相同;而实际中资产价格对正负冲击反应不同。
  2. 约束严格:ARCH(1) 若要四阶矩有限,\(\alpha_1^2\in[0,1/3)\);高阶约束更复杂,限制了高斯 ARCH 刻画超额峰度的能力。
  3. 不提供理解波动来源的新见解,只是机械描述条件方差的行为。
  4. 对孤立的大冲击反应缓慢,容易高估波动率。

3.4.3 建立 ARCH 模型(PDF p.139–143)

定阶:用 \(a_t^2\) 的 PACF。理由:\(a_t^2\) 是 \(\sigma_t^2\) 的无偏估计(单个值不是有效估计,但对定阶有参考价值),故 \(a_t^2\) 与 \(a_{t-1}^2,\dots,a_{t-m}^2\) 呈类似 AR(\(m\)) 的线性关系。另一种论证:令 \(\eta_t=a_t^2-\sigma_t^2\),可证 \(\{\eta_t\}\) 零均值不相关,于是

\[a_t^2=\alpha_0+\alpha_1a_{t-1}^2+\cdots+\alpha_ma_{t-m}^2+\eta_t,\]
是 \(a_t^2\) 的 AR(\(m\)),只是 \(\eta_t\) 非 iid(非同分布),LS 估计一致但非有效;小样本时 PACF 可能不灵。

估计:

  • 正态:似然 \(f(a_1,\dots,a_T|\boldsymbol\alpha)=\prod_{t=m+1}^T\frac{1}{\sqrt{2\pi\sigma_t^2}}\exp\big(-\frac{a_t^2}{2\sigma_t^2}\big)\times f(a_1,\dots,a_m|\boldsymbol\alpha)\)。初始项形式复杂,大样本时通常略去,得条件似然;最大化得正态下的条件 MLE。对数似然(去掉常数)
    \[\ell=-\sum_{t=m+1}^T\Big[\frac12\ln\sigma_t^2+\frac12\frac{a_t^2}{\sigma_t^2}\Big],\]
    \(\sigma_t^2\) 递推计算。
  • 标准化 Student-t:\(x_v\) 为 \(v\) 自由度 t 分布,\(\operatorname{Var}(x_v)=v/(v-2)\)(\(v>2\)),令 \(\epsilon_t=x_v/\sqrt{v/(v-2)}\),密度
    \[f(\epsilon_t|v)=\frac{\Gamma[(v+1)/2]}{\Gamma(v/2)\sqrt{(v-2)\pi}}\Big(1+\frac{\epsilon_t^2}{v-2}\Big)^{-(v+1)/2},\quad v>2.\tag{3.7}\]
    条件似然为 \(\prod\frac{\Gamma[(v+1)/2]}{\Gamma(v/2)\sqrt{(v-2)\pi}}\frac1{\sigma_t}\big(1+\frac{a_t^2}{(v-2)\sigma_t^2}\big)^{-(v+1)/2}\)。\(v\) 可预设(常取 4–8)或联合估计。\(v\) 预设时
    \[\ell=-\sum_{t=m+1}^T\Big[\frac{v+1}{2}\ln\Big(1+\frac{a_t^2}{(v-2)\sigma_t^2}\Big)+\frac12\ln\sigma_t^2\Big];\tag{3.8}\]
    联合估计 \(v\) 时再加 \((T-m)\{\ln\Gamma[(v+1)/2]-\ln\Gamma(v/2)-0.5\ln[(v-2)\pi]\}\)。
  • 偏 Student-t(skew-Student-t):收益分布还可能偏斜。采用 Fernández & Steel (1998) 方法(可给任何关于 0 对称的单峰连续分布引入偏度),Lambert & Laurent (2001) 将其用于 (3.7) 得标准化偏 t 分布:
    \[g(\epsilon_t|\xi,v)=\begin{cases}\dfrac{2}{\xi+1/\xi}\,\varrho\,f[\xi(\varrho\epsilon_t+\varpi)|v],&\epsilon_t<-\varpi/\varrho\\[2mm]\dfrac{2}{\xi+1/\xi}\,\varrho\,f[(\varrho\epsilon_t+\varpi)/\xi|v],&\epsilon_t\ge-\varpi/\varrho\end{cases}\tag{3.9}\]
    \[\varpi=\frac{\Gamma[(v-1)/2]\sqrt{v-2}}{\sqrt\pi\,\Gamma(v/2)}\Big(\xi-\frac1\xi\Big),\qquad\varrho^2=\Big(\xi^2+\frac1{\xi^2}-1\Big)-\varpi^2.\]
    \(\xi\) 为偏度参数,\(\xi^2\) 等于众数以上与以下概率质量之比;\(\xi=1\) 时退化为对称 t。(\(\varpi\)、\(\varrho\) 是使分布均值 0、方差 1 的平移与尺度常数。)
  • 广义误差分布 GED:
    \[f(x)=\frac{v\exp(-\frac12|x/\lambda|^v)}{\lambda2^{(1+1/v)}\Gamma(1/v)},\quad0<v\le\infty,\qquad\lambda=\big[2^{(-2/v)}\Gamma(1/v)/\Gamma(3/v)\big]^{1/2}.\tag{3.10}\]
    \(v=2\) 为正态,\(v<2\) 厚尾。
  • 注:Rmetrics 的 fGarch 包提供偏 t、偏正态、偏 GED(sstd、snorm、sged)。

模型检验:标准化残差 \(\tilde a_t=a_t/\sigma_t\) 应 iid。\(\tilde a_t\) 的 Ljung–Box 检验均值方程,\(\tilde a_t^2\) 的 Ljung–Box 检验波动率方程;偏度、峰度、QQ 图检验分布假设。

预测:类似 AR 递推。原点 \(h\):\(\sigma_h^2(1)=\alpha_0+\alpha_1a_h^2+\cdots+\alpha_ma_{h+1-m}^2\);\(\sigma_h^2(2)=\alpha_0+\alpha_1\sigma_h^2(1)+\alpha_2a_h^2+\cdots+\alpha_ma_{h+2-m}^2\);

\[\sigma_h^2(\ell)=\alpha_0+\sum_{i=1}^m\alpha_i\sigma_h^2(\ell-i),\tag{3.11}\]
\(\ell-i\le0\) 时 \(\sigma_h^2(\ell-i)=a_{h+\ell-i}^2\)。

3.4.4 例子(Some Examples,PDF p.143–149)

例 3.1 Intel 月对数收益(1973–2008,\(T=432\)):\(r_t^2\) 的 PACF(图 3.2(d))提示 ARCH(3)。正态下:

\[r_t=0.0122+a_t,\quad\sigma_t^2=0.0106+0.2131a_{t-1}^2+0.0770a_{t-2}^2+0.0599a_{t-3}^2,\]
标准误 0.0057、0.0010、0.0757、0.0480、0.0688,\(\alpha_2,\alpha_3\) 在 5% 不显著,简化为 ARCH(1):
\[r_t=0.0126+a_t,\quad\sigma_t^2=0.0111+0.3560a_{t-1}^2,\tag{3.12}\]
标准误 0.0053、0.0010、0.0761,均高度显著。图 3.5:标准化残差 \(Q(10)=12.64\)(p=0.24),\(\tilde a_t^2\) 的 \(Q(10)=14.75\)(p=0.14),5% 水平下模型充分。性质:(1) 月期望对数收益约 1.26%(含互联网泡沫后时期仍如此高);(2) \(\hat\alpha_1^2=0.356^2<1/3\),四阶矩存在;(3) 无条件标准差 \(\sqrt{0.0111/(1-0.356)}\approx0.1315\);(4) 可用于预测月波动。S-Plus:garch(intc~1,~garch(3,0)),arch1$asymp.sd=0.1315,plot(arch1) 可得拟合波动率;AIC=−570.02,BIC=−557.81;但 S-Plus 输出的 \(\tilde a_t^2\) 的 \(Q(12)=32.11\)(p=0.0013)。

t 新息:

\[r_t=0.0169+a_t,\quad\sigma_t^2=0.0120+0.2845a_{t-1}^2,\tag{3.13}\]
标准误 0.0053、0.0017、0.1120,估计自由度 6.01(标准误 1.50);无条件标准差 \(\sqrt{0.0120/(1-0.2845)}\approx0.1295\)。\(\tilde a_t\) 的 \(Q(12)=14.88\)(p=0.25),均值方程充分;但 \(\tilde a_t^2\) 的 \(Q(12)=35.42\)(p=0.0004),波动方程在 1% 水平不充分,原因是 \(\tilde a_t^2\) 滞后 12 的 ACF 较大(0.188);\(Q(10)=15.90\)(p=0.10)。比较:(a) 厚尾分布会降低 ARCH 系数;(b) 本例两模型差别小。更合适的是 GARCH(1,1)。S-Plus 用 cond.dist="t" 或 "ged";AIC=−597.34。

R 演示(fGarch):m1=garchFit(intc~garch(1,0),data=intc,trace=F) 得 mu=0.012637、omega=0.011195、alpha1=0.379492(标准误 0.1155),对数似然 288.06;标准化残差 JB=137.9、Shapiro–Wilk 拒绝正态;\(R\) 的 \(Q(10)=12.54\)(p=0.25),\(R^2\) 的 \(Q(10)=16.02\)(p=0.099)、\(Q(15)=36.08\)(p=0.0017);LM ARCH 检验 \(TR^2=26.58\)(p=0.009)。predict(m1,5) 给出 1–5 步预测:均值 0.01264,标准差 0.1098、0.1256、0.1311、0.1331、0.1339(趋近无条件标准差)。garchFit(intc~garch(1,1)) 得 mu=0.01073、omega=0.000954、alpha1=0.0874、beta1=0.8512,标准化残差 \(Q(10)=8.27\)(p=0.60),\(R^2\) 的 \(Q(10)=0.99\)(p≈1.0)——GARCH(1,1) 更充分。(续见下文) GARCH(1,1) 的 LM ARCH 检验 \(TR^2=10.70\)(p=0.55)。t 分布 ARCH(1):cond.dist='std' 得 mu=0.016731、omega=0.011939、alpha1=0.285320、shape(自由度)=6.015(标准误 1.56)。偏 t:cond.dist='sstd';ARMA(1,0)+GARCH(1,1):garchFit(intc~arma(1,0)+garch(1,1))。

R + Ox(G@RCH 4.2):source("garchoxfit_R.txt"),garchOxFit(formula.mean=~arma(0,0),formula.var=~garch(0,1),series=intc)。注意 G@RCH 中 ARCH(1) 写作 GARCH(0,1)(阶数顺序与 fGarch 相反)。正态:Cst(M)=0.012630、Cst(V)=0.011129、ARCH(Alpha1)=0.387223;\(\tilde a_t^2\) 的 \(Q(10)=15.78\)(p=0.072,已按 1 个自由度调整)、\(Q(20)=37.02\)(p=0.008);ARCH 1–10 检验 F(10,410)=1.44(p=0.16)。t 分布:自由度 6.02,Alpha1=0.2923。

例 3.2 马克/美元 10 分钟收益:收益无序列相关,\(a_t^2\) 的 PACF 在滞后 1、3 有大尖峰(高阶也有,但低阶更重要),设定 ARCH(3)。条件高斯似然:\(r_t=0.0018+\sigma_t\epsilon_t\),

\[\sigma_t^2=0.22\times10^{-2}+0.322a_{t-1}^2+0.074a_{t-2}^2+0.093a_{t-3}^2,\]
标准误 \(0.47\times10^{-6}\)、0.017、0.016、0.014,全部 5% 显著,标准化残差检验显示模型充分。

3.5 GARCH 模型(The GARCH Model,PDF p.151–160)

ARCH 常需很多参数(如例 3.3 S&P 500 月超额收益需 ARCH(9))。Bollerslev (1986) 提出广义 ARCH。设 \(a_t=r_t-\mu_t\),GARCH(\(m,s\)):

\[a_t=\sigma_t\epsilon_t,\qquad\sigma_t^2=\alpha_0+\sum_{i=1}^m\alpha_ia_{t-i}^2+\sum_{j=1}^s\beta_j\sigma_{t-j}^2,\tag{3.14}\]
\(\epsilon_t\) iid 均值 0 方差 1,\(\alpha_0>0\),\(\alpha_i\ge0\),\(\beta_j\ge0\),\(\sum_{i=1}^{\max(m,s)}(\alpha_i+\beta_i)<1\)(\(i>m\) 时 \(\alpha_i=0\),\(j>s\) 时 \(\beta_j=0\))。后一条件保证无条件方差有限而条件方差时变。\(s=0\) 即 ARCH(\(m\))。\(\alpha_i\) 称 ARCH 参数,\(\beta_j\) 称 GARCH 参数。(注意本书 GARCH(\(m,s\)) 中 \(m\) 是 ARCH 阶、\(s\) 是 GARCH 阶。)

ARMA 表示:令 \(\eta_t=a_t^2-\sigma_t^2\),代入 \(\sigma_{t-i}^2=a_{t-i}^2-\eta_{t-i}\) 得

\[a_t^2=\alpha_0+\sum_{i=1}^{\max(m,s)}(\alpha_i+\beta_i)a_{t-i}^2+\eta_t-\sum_{j=1}^s\beta_j\eta_{t-j}.\tag{3.15}\]
\(\{\eta_t\}\) 是鞅差序列(martingale difference,\(E(\eta_t)=0\),\(\operatorname{Cov}(\eta_t,\eta_{t-j})=0\)),但一般非 iid。即 GARCH 是 \(a_t^2\) 的 ARMA,故
\[E(a_t^2)=\frac{\alpha_0}{1-\sum_{i=1}^{\max(m,s)}(\alpha_i+\beta_i)}\quad(\text{分母为正时}).\]

GARCH(1,1):

\[\sigma_t^2=\alpha_0+\alpha_1a_{t-1}^2+\beta_1\sigma_{t-1}^2,\quad0\le\alpha_1,\beta_1\le1,\ \alpha_1+\beta_1<1.\tag{3.16}\]

  • 大的 \(a_{t-1}^2\) 或 \(\sigma_{t-1}^2\) 导致大的 \(\sigma_t^2\)——波动聚集。
  • 若 \(1-2\alpha_1^2-(\alpha_1+\beta_1)^2>0\),则
    \[\frac{E(a_t^4)}{[E(a_t^2)]^2}=\frac{3[1-(\alpha_1+\beta_1)^2]}{1-(\alpha_1+\beta_1)^2-2\alpha_1^2}>3,\]
    尾部比正态厚。
  • 给出描述波动演化的简单参数函数。

预测:\(\sigma_h^2(1)=\alpha_0+\alpha_1a_h^2+\beta_1\sigma_h^2\)。多步时用 \(a_t^2=\sigma_t^2\epsilon_t^2\) 改写 \(\sigma_{t+1}^2=\alpha_0+(\alpha_1+\beta_1)\sigma_t^2+\alpha_1\sigma_t^2(\epsilon_t^2-1)\),因 \(E(\epsilon_{h+1}^2-1|F_h)=0\),

\[\sigma_h^2(\ell)=\alpha_0+(\alpha_1+\beta_1)\sigma_h^2(\ell-1),\quad\ell>1,\tag{3.17}\]
与 AR 多项式为 \(1-(\alpha_1+\beta_1)B\) 的 ARMA(1,1) 相同。迭代得
\[\sigma_h^2(\ell)=\frac{\alpha_0[1-(\alpha_1+\beta_1)^{\ell-1}]}{1-\alpha_1-\beta_1}+(\alpha_1+\beta_1)^{\ell-1}\sigma_h^2(1)\ \to\ \frac{\alpha_0}{1-\alpha_1-\beta_1},\]
多步波动预测收敛到无条件方差(若存在),收敛速度由持续性 \(\alpha_1+\beta_1\) 决定。

弱点:文献极多(Bollerslev–Chou–Kroner 1992;Bollerslev–Engle–Nelson 1994)。与 ARCH 一样对正负冲击反应相同;高频数据研究表明即使用标准化 t 新息,GARCH 的尾部仍然偏短(见 3.16 节)。

3.5.1 示例(An Illustrative Example,PDF p.154–159)

GARCH 定阶不易,实践中多用低阶 GARCH(1,1)、(2,1)、(1,2)。只要假设波动初值已知,条件 MLE 仍适用:GARCH(1,1) 中将 \(\sigma_1^2\) 固定后可递推,常用 \(a_t\) 的样本方差作初值。用 \(\tilde a_t=a_t/\sigma_t\) 及其平方检验。

例 3.3 S&P 500 月超额收益(1926–1991,792 个观测,图 3.6):图 3.7 \(r_t\) 在滞后 1、3 有序列相关,\(r_t^2\) 的 PACF 显示强线性相依。MA(3):\(r_t=0.0062+a_t+0.0944a_{t-1}-0.1407a_{t-3}\),\(\hat\sigma_a=0.0576\);为简便改用 AR(3):

\[r_t=0.088r_{t-1}-0.023r_{t-2}-0.123r_{t-3}+0.0066+a_t,\quad\hat\sigma_a^2=0.00333.\tag{3.18}\]
AR(3)–GARCH(1,1) 联合估计:\(r_t=0.0078+0.032r_{t-1}-0.029r_{t-2}-0.008r_{t-3}+a_t\),\(\sigma_t^2=0.000084+0.1213a_{t-1}^2+0.8523\sigma_{t-1}^2\);隐含无条件方差 \(0.000084/(1-0.8523-0.1213)=0.00317\),接近 (3.18)。但三个 AR 系数在加入 GARCH 后都不显著(波动建模改变了均值方程的推断),去掉后
\[r_t=0.0076+a_t,\quad\sigma_t^2=0.000086+0.1216a_{t-1}^2+0.8511\sigma_{t-1}^2,\tag{3.19}\]
标准误 0.0015;0.000024、0.0197、0.0190;无条件方差 0.00314。图 3.8 估计波动 \(\sigma_t\) 与标准化冲击;图 3.9:\(\tilde a_t\) 的 \(Q(12)=11.99\)(0.45)、\(Q(24)=28.52\)(0.24),\(\tilde a_t^2\) 的 \(Q(12)=13.11\)(0.36)、\(Q(24)=26.45\)(0.33),模型充分。\(\hat\alpha_1+\hat\beta_1=0.9772\) 接近 1——实践中常见,导致施加约束 \(\alpha_1+\beta_1=1\) 的 IGARCH。

预测:\(\sigma_h^2(1)=0.000086+0.1216a_h^2+0.8511\sigma_h^2\),\(\sigma_0^2\) 取 0 或无条件方差,多步用 (3.17)。表 3.1(原点 \(h=792\),1991 年 12 月):收益预测均为 0.0076;波动(条件标准差)1–5 步 0.0536、0.0537、0.0537、0.0538、0.0538,∞ 步 0.0560。S-Plus:garch(sp~ar(3),~garch(1,1))、fit$sigma.t、fit$residuals、predict(fit,5)。

t 新息(5 自由度固定):

\[r_t=0.0085+a_t,\quad\sigma_t^2=0.00012+0.1121a_{t-1}^2+0.8432\sigma_{t-1}^2,\tag{3.20}\]
标准误 0.0015、\(0.51\times10^{-4}\)、0.0296、0.0371;\(\hat\alpha_1+\hat\beta_1\approx0.95\),近似 IGARCH。\(\tilde a_t\) 的 \(Q(10)=11.38\)(0.33),\(\tilde a_t^2\) 的 \(Q(10)=10.48\)(0.40),充分。S-Plus:cond.dist='t',cond.par=5,cond.est=F。 估计自由度:(3.21) 系数同 (3.20),自由度估计 7.02(标准误 1.78),5% 水平不能拒绝 \(v=5\)。R:garchFit(~arma(3,0)+garch(1,1),data=sp5);garchFit(~garch(1,1),data=sp5,cond.dist="std");residuals(m2,standardize=T)。

3.5.2 预测评价(Forecasting Evaluation,PDF p.159–160)

波动不可观测,比较模型预测能力很难。有研究用样本外 \(a_{h+\ell}^2\) 与 \(\sigma_h^2(\ell)\) 比较,常得到很低的相关(低 \(R^2\))。这并不奇怪:虽然 \(E(a_{h+1}^2|F_h)=\sigma_{h+1}^2\),\(a_{h+1}^2\) 是一致(无偏)的,但单个观测无法准确估计方差,噪声极大。严格说该评价方法不恰当;参见 Andersen & Bollerslev (1998)(用已实现波动率作为代理)。

3.5.3 两步估计法(A Two-Pass Estimation Method,PDF p.160)

基于 (3.15):第一步忽略 ARCH 效应,用第 2 章方法估计均值方程,得残差 \(a_t\);第二步把 \(\{a_t^2\}\) 当作观测序列,用 ML 拟合 ARMA (3.15),得 AR 系数 \(\hat\phi_i\) 与 MA 系数 \(\hat\theta_i\),则

\[\hat\beta_i=\hat\theta_i,\qquad\hat\alpha_i=\hat\phi_i-\hat\theta_i.\]
统计性质未被严格研究,但经验上中大样本时近似良好。例 3.3 用 SCA 条件 MLE:\(r_t=0.0061+a_t\),\(a_t^2=0.00014+0.9583a_{t-1}^2+\eta_t-0.8456\eta_{t-1}\),得 \(\hat\beta_1=0.8456\),\(\hat\alpha_1=0.9583-0.8456=0.1127\),与 (3.19)/(3.21) 非常接近,拟合波动也接近图 3.8(a)。

3.6 求和 GARCH 模型(The Integrated GARCH Model,PDF p.160–162)

若 (3.15) 的 AR 多项式有单位根,即为 IGARCH——单位根 GARCH。与 ARIMA 类似,过去平方冲击 \(\eta_{t-i}\) 对 \(a_t^2\) 的影响是持久的。IGARCH(1,1):

\[a_t=\sigma_t\epsilon_t,\qquad\sigma_t^2=\alpha_0+\beta_1\sigma_{t-1}^2+(1-\beta_1)a_{t-1}^2,\quad0<\beta_1<1.\]
S&P 500 月超额收益:\(r_t=0.0067+a_t\),\(\sigma_t^2=0.000119+0.8059\sigma_{t-1}^2+0.1941a_{t-1}^2\)(标准误 0.0017、0.000013、0.0144)。参数与 GARCH(1,1) 接近,但无条件方差不存在,这对超额收益序列难以解释。理论上 IGARCH 现象可能由波动的偶发水平移动(level shifts)引起,持续性的真正原因值得深究。

当 \(\alpha_1+\beta_1=1\),由 (3.17) 得

\[\sigma_h^2(\ell)=\sigma_h^2(1)+(\ell-1)\alpha_0,\quad\ell\ge1,\tag{3.22}\]
\(\sigma_h^2(1)\) 的影响持久,预测是斜率为 \(\alpha_0\) 的直线。Nelson (1990):IGARCH 下 \(\sigma_t^2\) 是鞅,在一定条件下严平稳但非弱平稳(前两阶矩不存在)。

\(\alpha_0=0\) 的特例:所有步长的预测都等于 \(\sigma_h^2(1)\)——这正是 RiskMetrics 的波动率模型(第 7 章 VaR)。它也是 \(\{a_t^2\}\) 的指数平滑:

\[\sigma_t^2=(1-\beta_1)a_{t-1}^2+\beta_1\sigma_{t-1}^2=(1-\beta_1)(a_{t-1}^2+\beta_1a_{t-2}^2+\beta_1^2a_{t-3}^2+\cdots),\]
\(\beta_1\) 为折扣因子(原文 \(a_{t-3}^3\) 为排印错误,应为 \(a_{t-3}^2\)),可用指数平滑方法估计(RiskMetrics 日数据常取 \(\beta_1=0.94\))。

3.7 GARCH-M 模型(The GARCH-M Model,PDF p.162–163)

证券收益可能依赖其波动(风险–收益权衡),GARCH in the mean:

\[r_t=\mu+c\sigma_t^2+a_t,\quad a_t=\sigma_t\epsilon_t,\quad\sigma_t^2=\alpha_0+\alpha_1a_{t-1}^2+\beta_1\sigma_{t-1}^2,\tag{3.23}\]
\(c\) 称风险溢价参数(risk premium parameter),\(c>0\) 表示收益与波动正相关。其他设定:\(r_t=\mu+c\sigma_t+a_t\)、\(r_t=\mu+c\ln\sigma_t^2+a_t\)。(3.23) 意味着 \(r_t\) 有序列相关(由 \(\sigma_t^2\) 的序列相关引入)——这是某些历史股票收益存在序列相关的另一原因。

例:S&P 500 月超额收益(1926-01—1991-12)高斯 GARCH(1,1)-M:

\[r_t=0.0055+1.09\sigma_t^2+a_t,\quad\sigma_t^2=8.76\times10^{-5}+0.123a_{t-1}^2+0.849\sigma_{t-1}^2,\]
均值方程标准误 0.0023、0.818,波动方程 \(2.51\times10^{-5}\)、0.0205、0.0196。风险溢价为正但 5% 不显著。表 3.2(S-Plus 的 GARCH-M 设定,均值方程 \(r_t=\mu+cg(\sigma_t)+a_t\)):\(g=\sigma_t^2\) 用 var.in.mean,\(\sigma_t\) 用 sd.in.mean,\(\ln\sigma_t^2\) 用 logvar.in.mean;如 garch(sp~1+var.in.mean,~garch(1,1))。风险溢价思想可用于其他 GARCH 模型。

3.8 指数 GARCH 模型(The Exponential GARCH Model,PDF p.163–169)

Nelson (1991) 为允许正负收益的不对称效应,引入加权新息

\[g(\epsilon_t)=\theta\epsilon_t+\gamma[|\epsilon_t|-E(|\epsilon_t|)],\tag{3.24}\]
\(\epsilon_t\) 与 \(|\epsilon_t|-E|\epsilon_t|\) 均为零均值 iid,故 \(E[g(\epsilon_t)]=0\)。不对称性:
\[g(\epsilon_t)=\begin{cases}(\theta+\gamma)\epsilon_t-\gamma E(|\epsilon_t|),&\epsilon_t\ge0\\(\theta-\gamma)\epsilon_t-\gamma E(|\epsilon_t|),&\epsilon_t<0.\end{cases}\]
注:标准正态 \(E|\epsilon_t|=\sqrt{2/\pi}\);标准化 t (3.7) 下 \(E|\epsilon_t|=\dfrac{2\sqrt{v-2}\,\Gamma[(v+1)/2]}{(v-1)\Gamma(v/2)\sqrt\pi}\)。

EGARCH(\(m,s\)):

\[a_t=\sigma_t\epsilon_t,\qquad\ln\sigma_t^2=\alpha_0+\frac{1+\beta_1B+\cdots+\beta_{s-1}B^{s-1}}{1-\alpha_1B-\cdots-\alpha_mB^m}g(\epsilon_{t-1}),\tag{3.25}\]
两多项式零点在单位圆外、无公因子。用 ARMA 参数化描述对数条件方差,\(\ln\sigma_t^2\) 的无条件均值为 \(\alpha_0\)。与 GARCH 的区别:(1) 用对数条件方差,放松了系数正性约束;(2) \(g(\epsilon_t)\) 使模型对正负滞后冲击反应不对称。

EGARCH(1,1)(\(\epsilon_t\) 标准正态):

\[(1-\alpha B)\ln\sigma_t^2=(1-\alpha)\alpha_0+g(\epsilon_{t-1}),\tag{3.26}\]
\[(1-\alpha B)\ln\sigma_t^2=\begin{cases}\alpha_*+(\gamma+\theta)\epsilon_{t-1},&\epsilon_{t-1}\ge0\\\alpha_*+(\gamma-\theta)(-\epsilon_{t-1}),&\epsilon_{t-1}<0\end{cases}\tag{3.27}\]
\(\alpha_*=(1-\alpha)\alpha_0-\sqrt{2/\pi}\gamma\),类似 Tong (1978, 1990) 的门限自回归(TAR)非线性函数。即
\[\sigma_t^2=\sigma_{t-1}^{2\alpha}\exp(\alpha_*)\begin{cases}\exp\big[(\gamma+\theta)\frac{a_{t-1}}{\sigma_{t-1}}\big],&a_{t-1}\ge0\\\exp\big[(\gamma-\theta)\frac{|a_{t-1}|}{\sigma_{t-1}}\big],&a_{t-1}<0.\end{cases}\]
\(\theta\ne0\) 时非线性;负冲击影响更大,故预期 \(\theta<0\)。Cao & Tsay (1992) 用含 EGARCH 的非线性模型做多步波动预测。

3.8.1 替代形式(Alternative Model Form,PDF p.164)

\[\ln\sigma_t^2=\alpha_0+\sum_{i=1}^s\alpha_i\frac{|a_{t-i}|+\gamma_ia_{t-i}}{\sigma_{t-i}}+\sum_{j=1}^m\beta_j\ln\sigma_{t-j}^2.\tag{3.28}\]

正的 \(a_{t-i}\) 对对数波动贡献 \(\alpha_i(1+\gamma_i)|\epsilon_{t-i}|\),负的贡献 \(\alpha_i(1-\gamma_i)|\epsilon_{t-i}|\),\(\gamma_i\) 表示杠杆效应,实践中预期为负。S-Plus 采用此形式。

3.8.2 示例:Nelson (1991)(PDF p.165)

CRSP VW 指数日超额收益(1962-07—1987-12,6408 个观测;超额收益用月度国库券收益扣除,假设月内每日相同):

\[r_t=\phi_0+\phi_1r_{t-1}+c\sigma_t^2+a_t,\]
\[\ln\sigma_t^2=\alpha_0+\ln(1+wN_t)+\frac{1+\beta B}{1-\alpha_1B-\alpha_2B^2}g(\epsilon_{t-1}),\tag{3.29}\]
\(N_t\) 为 \(t-1\) 与 \(t\) 之间的非交易日数(周末/假日效应),\(\epsilon_t\) 服从 GED。表 3.3:\(\alpha_0=-10.06\)(0.346),\(w=0.183\)(0.028),\(\gamma=0.156\)(0.013),\(\alpha_1=1.929\)(0.015),\(\alpha_2=-0.929\)(0.015),\(\beta=-0.978\)(0.006),\(\theta=-0.118\)(0.009),\(\phi_0=3.5\times10^{-4}\),\(\phi_1=0.205\)(0.012),\(c=-3.361\)(2.026),GED 参数 \(v=1.576\)(0.032)。均值方程用 AR(1) 处理序列相关、用 \(\sigma_t^2\) 作回归元刻画风险溢价;估计的风险溢价为负但不显著。

3.8.3 第二个例子(PDF p.165–167)

IBM 月对数收益(1926-01—1997-12,864 个观测),AR(1)–EGARCH(1,1):

\[r_t=0.0105+0.092r_{t-1}+a_t,\quad a_t=\sigma_t\epsilon_t,\tag{3.30}\]
\[\ln\sigma_t^2=-5.496+\frac{g(\epsilon_{t-1})}{1-0.856B},\quad g(\epsilon_{t-1})=-0.0795\epsilon_{t-1}+0.2647\big(|\epsilon_{t-1}|-\sqrt{2/\pi}\big),\tag{3.31}\]
\(\epsilon_t\) 标准正态,均 5% 显著。\(\tilde a_t\) 的 \(Q(10)=6.31\)(0.71)、\(Q(20)=21.4\)(0.32);\(\tilde a_t^2\) 的 \(Q(10)=4.13\)(0.90)、\(Q(20)=15.93\)(0.66),充分。用 \(\sqrt{2/\pi}\approx0.7979\) 展开:
\[\ln\sigma_t^2=-1.001+0.856\ln\sigma_{t-1}^2+\begin{cases}0.1852\epsilon_{t-1},&\epsilon_{t-1}\ge0\\-0.3442\epsilon_{t-1},&\epsilon_{t-1}<0\end{cases}\]
\[\sigma_t^2=\sigma_{t-1}^{2\times0.856}e^{-1.001}\times\begin{cases}e^{0.1852\epsilon_{t-1}}\\e^{-0.3442\epsilon_{t-1}}\end{cases}\]
两倍标准差冲击:\(\sigma_t^2(\epsilon_{t-1}=-2)/\sigma_t^2(\epsilon_{t-1}=2)=\exp(0.6884)/\exp(0.3704)=e^{0.318}=1.374\),负冲击影响比同幅正冲击高约 37.4%;冲击越大,差异越大。

样本延长到 2003 年(936 个观测),S-Plus garch(ibmln~1,~egarch(1,1),leverage=T,cond.dist='ged'):GED 参数 1.5003(0.0991),

\[r_t=0.0118+a_t,\quad\ln\sigma_t^2=-0.557+0.220\frac{|a_{t-1}|-0.264a_{t-1}}{\sigma_{t-1}}+0.929\ln\sigma_{t-1}^2,\tag{3.32}\]
(即 ARCH(1)=0.22025、LEV(1)=−0.26400,t=−2.094,GARCH(1)=0.92910);\(\tilde a_t\) 的 \(Q(12)=17.87\)(0.12),\(\tilde a_t^2\) 的 \(Q(12)=6.72\)(0.88),充分;杠杆效应为负且 5% 显著。(原文称"fitted GARCH(1,1)"实为 EGARCH(1,1)。)

3.8.4 EGARCH 预测(PDF p.167–169)

设参数已知、新息标准正态,EGARCH(1,1):\(\ln\sigma_t^2=(1-\alpha_1)\alpha_0+\alpha_1\ln\sigma_{t-1}^2+g(\epsilon_{t-1})\),

\[\sigma_t^2=\sigma_{t-1}^{2\alpha_1}\exp[(1-\alpha_1)\alpha_0]\exp[g(\epsilon_{t-1})].\tag{3.33}\]
1 步:\(\hat\sigma_h^2(1)=\sigma_{h+1}^2=\sigma_h^{2\alpha_1}\exp[(1-\alpha_1)\alpha_0]\exp[g(\epsilon_h)]\),右边均已知。2 步:\(\hat\sigma_h^2(2)=\hat\sigma_h^{2\alpha_1}(1)\exp[(1-\alpha_1)\alpha_0]E_h\{\exp[g(\epsilon_{h+1})]\}\),其中
\[E\{\exp[g(\epsilon)]\}=\exp\big(-\gamma\sqrt{2/\pi}\big)\Big[e^{(\theta+\gamma)^2/2}\Phi(\theta+\gamma)+e^{(\theta-\gamma)^2/2}\Phi(\gamma-\theta)\Big]\]
(对正负半轴分别积分正态密度)。递推公式
\[\hat\sigma_h^2(j)=\hat\sigma_h^{2\alpha_1}(j-1)\exp(\omega)\Big\{e^{(\theta+\gamma)^2/2}\Phi(\theta+\gamma)+e^{(\theta-\gamma)^2/2}\Phi(\gamma-\theta)\Big\},\quad\omega=(1-\alpha_1)\alpha_0-\gamma\sqrt{2/\pi}.\]
\(\Phi\) 值可从统计软件或第 6 章附录 B 的近似得到。(注:严格说用 \(\hat\sigma_h^{2\alpha_1}(j-1)\) 代替 \(E[\sigma^{2\alpha_1}]\) 是近似。) 例:IBM AR(1)–EGARCH(1,1),原点 \(t=864\):\(\hat\sigma_{864}^2(1)=6.05\times10^{-3}\),(2)=\(5.82\times10^{-3}\),(3)=\(5.63\times10^{-3}\),(10)=\(4.94\times10^{-3}\),逐渐收敛到冲击序列样本方差 \(4.37\times10^{-3}\)。

3.9 门限 GARCH 模型(The Threshold GARCH Model,PDF p.169–170)

另一个处理杠杆效应的常用模型(Glosten–Jagannathan–Runkle 1993;Zakoian 1994)。TGARCH(\(m,s\)):

\[\sigma_t^2=\alpha_0+\sum_{i=1}^s(\alpha_i+\gamma_iN_{t-i})a_{t-i}^2+\sum_{j=1}^m\beta_j\sigma_{t-j}^2,\tag{3.34}\]
\(N_{t-i}=1\) 若 \(a_{t-i}<0\),否则为 0;\(\alpha_i,\gamma_i,\beta_j\) 非负且满足类似 GARCH 的条件。正冲击贡献 \(\alpha_ia_{t-i}^2\),负冲击贡献 \((\alpha_i+\gamma_i)a_{t-i}^2\)(\(\gamma_i>0\) 更大)。以 0 为门限,也可用其他门限(第 4 章)。又称 GJR 模型。

例:IBM 月对数收益(1926–2003),GED 新息 TGARCH(1,1):

\[r_t=0.0121+a_t,\quad\sigma_t^2=3.45\times10^{-4}+(0.0658+0.0843N_{t-1})a_{t-1}^2+0.8182\sigma_{t-1}^2,\tag{3.35}\]
GED 参数 1.51(0.099);标准误:均值 0.002,波动方程 \(1.26\times10^{-4}\)、0.0314、0.0395、0.049。\(\tilde a_t\) 的 \(Q(12)=18.34\)(0.106),\(\tilde a_t^2\) 的 \(Q(12)=5.36\)(0.95),充分;杠杆效应 5% 显著。S-Plus:garch(ibmln~1,~tgarch(1,1),leverage=T,cond.dist='ged')。

EGARCH 与 TGARCH 比较(\(\epsilon_{t-1}=\pm2\)):EGARCH(1,1) (3.32) 中 \(\epsilon_{t-1}=-2\) 时对数波动贡献 \(0.22(2+0.528)\),\(+2\) 时为 \(0.22(2-0.528)\),差为 \(0.22\times2\times2\times0.264\approx0.232\),比值约 \(e^{0.232}\approx1.26\)(原文写作 \(e^{0.22\times2\times0.632}\approx1.264\),指数表达式疑有排印错误,结论约 1.26);TGARCH(1,1) 忽略常数项给出

\[\frac{[(0.0658+0.0843)\times4+0.8182]\sigma_{t-1}^2}{(0.0658\times4+0.8182)\sigma_{t-1}^2}=1.312.\]
两模型给出的杠杆效应相近。

3.10 CHARMA 模型(The CHARMA Model,PDF p.170–172)

条件异方差自回归移动平均模型(Tsay 1987)用随机系数产生条件异方差,与 ARCH 不同但二阶条件性质相似:

\[r_t=\mu_t+a_t,\qquad a_t=\delta_{1t}a_{t-1}+\delta_{2t}a_{t-2}+\cdots+\delta_{mt}a_{t-m}+\eta_t,\tag{3.36}\]
\(\{\eta_t\}\) 为零均值、方差 \(\sigma_\eta^2\) 的高斯白噪声;\(\{\boldsymbol\delta_t\}=\{(\delta_{1t},\dots,\delta_{mt})'\}\) 为零均值、协方差矩阵 \(\boldsymbol\Omega\)(非负定)的 iid 随机向量,与 \(\eta_t\) 独立。写作 \(a_t=\mathbf a_{t-1}'\boldsymbol\delta_t+\eta_t\),\(\mathbf a_{t-1}=(a_{t-1},\dots,a_{t-m})'\),条件方差
\[\sigma_t^2=\sigma_\eta^2+\mathbf a_{t-1}'\operatorname{Cov}(\boldsymbol\delta_t)\mathbf a_{t-1}=\sigma_\eta^2+(a_{t-1},\dots,a_{t-m})\boldsymbol\Omega(a_{t-1},\dots,a_{t-m})'.\tag{3.37}\]
\(m=1\):\(\sigma_t^2=\sigma_\eta^2+\omega_{11}a_{t-1}^2\),即 ARCH(1);\(m=2\):\(\sigma_t^2=\sigma_\eta^2+\omega_{11}a_{t-1}^2+2\omega_{12}a_{t-1}a_{t-2}+\omega_{22}a_{t-2}^2\),比 ARCH(2) 多交叉项。\(\boldsymbol\Omega\) 对角时等价于 ARCH(\(m\))。因 \(\boldsymbol\Omega\) 非负定、\(\sigma_\eta^2>0\),自动有 \(\sigma_t^2\ge\sigma_\eta^2>0\)(实现了 (3.6))。 与 ARCH 的区别:(1) 波动方程含滞后冲击的交叉乘积,可表示过去收益间的交互作用;但交叉项随 \(m\) 快速增加,需约束(如只用少数交叉项);(2) 高阶性质更难求。

例:S&P 500 月超额收益,\(r_t=\phi_0+a_t\),\(a_t=\delta_{1t}a_{t-1}+\delta_{2t}a_{t-2}+\eta_t\):

\[r_t=0.00635+a_t,\quad\sigma_t^2=0.00179+(a_{t-1},a_{t-2})\boldsymbol\Omega(a_{t-1},a_{t-2})',\quad\boldsymbol\Omega=\begin{bmatrix}0.1417_{(0.0333)}&-0.0594_{(0.0365)}\\-0.0594_{(0.0365)}&0.3081_{(0.0340)}\end{bmatrix},\]
交叉项 t=−1.63,10% 水平边缘显著。扩展到三阶并设 \(\delta_{3t}\) 与 \((\delta_{1t},\delta_{2t})\) 不相关:
\[r_t=0.0068+a_t,\quad\sigma_t^2=0.00136+\mathbf a_{t-1}'\boldsymbol\Omega\mathbf a_{t-1},\quad\boldsymbol\Omega=\begin{bmatrix}0.1212_{(0.0355)}&-0.0622_{(0.0283)}&0\\-0.0622_{(0.0283)}&0.1913_{(0.0254)}&0\\0&0&0.2988_{(0.0420)}\end{bmatrix}.\]
所有估计在 5% 水平显著。\(a_t=r_t-0.0068\) 为月超额收益对均值的偏离,前两期偏离存在交互效应,近似为
\[\sigma_t^2=0.00136+0.12a_{t-1}^2-0.12a_{t-1}a_{t-2}+0.19a_{t-2}^2+0.30a_{t-3}^2,\]
当 \(a_{t-1}a_{t-2}<0\)(前两期偏离反向)时条件方差略大。

3.10.1 解释变量的影响(Effects of Explanatory Variables,PDF p.172)

CHARMA 易推广为波动依赖解释变量:

\[r_t=\mu_t+a_t,\qquad a_t=\sum_{i=1}^m\delta_{it}x_{i,t-1}+\eta_t,\tag{3.38}\]
\(\boldsymbol\delta_t\)、\(\eta_t\) 同 (3.36),则 \(\sigma_t^2=\sigma_\eta^2+(x_{1,t-1},\dots,x_{m,t-1})\boldsymbol\Omega(x_{1,t-1},\dots,x_{m,t-1})'\)。解释变量可包含 \(a_t\) 的滞后值。

3.11 随机系数自回归模型(Random Coefficient Autoregressive Models,PDF p.172–173)

RCA 原用于刻画不同研究对象间的变异(类似面板数据与分层模型),历史上用于让参数随时间演化以更好地描述条件均值;这里归入条件异方差模型。RCA(\(p\))(Nicholls & Quinn 1982):

\[r_t=\phi_0+\sum_{i=1}^p(\phi_i+\delta_{it})r_{t-i}+a_t,\tag{3.39}\]
\(\{\boldsymbol\delta_t\}\) 为零均值、协方差 \(\boldsymbol\Omega_\delta\) 的独立随机向量序列,与 \(\{a_t\}\) 独立。条件矩:
\[\mu_t=\phi_0+\sum_{i=1}^p\phi_ir_{t-i},\qquad\sigma_t^2=\sigma_a^2+(r_{t-1},\dots,r_{t-p})\boldsymbol\Omega_\delta(r_{t-1},\dots,r_{t-p})'.\]
形式同 CHARMA,细微区别:RCA 的波动是滞后观测值 \(r_{t-i}\) 的二次函数,CHARMA 是滞后新息 \(a_{t-i}\) 的二次函数。

3.12 随机波动率模型(Stochastic Volatility Model,PDF p.173–174)

另一种思路是在条件方差方程中引入新息(Melino & Turnbull 1990;Taylor 1994;Harvey–Ruiz–Shephard 1994;Jacquier–Polson–Rossi 1994)。与 EGARCH 一样用 \(\ln\sigma_t^2\) 保证正性。SV 模型:

\[a_t=\sigma_t\epsilon_t,\qquad(1-\alpha_1B-\cdots-\alpha_mB^m)\ln\sigma_t^2=\alpha_0+v_t,\tag{3.40}\]
\(\epsilon_t\) iid \(N(0,1)\),\(v_t\) iid \(N(0,\sigma_v^2)\),两者独立;多项式零点模长大于 1。新息 \(v_t\) 显著增加了灵活性,但也增加了估计难度——每个冲击对应两个新息 \(\epsilon_t\) 和 \(v_t\),似然无闭式,需通过 Kalman 滤波的拟似然(quasi-likelihood)或蒙特卡洛方法估计;Jacquier–Polson–Rossi (1994) 比较了拟似然与 MCMC,第 12 章介绍 MCMC 估计。

\(m=1\) 时性质(JPR 1994 附录):

\[\ln\sigma_t^2\sim N\Big(\frac{\alpha_0}{1-\alpha_1},\frac{\sigma_v^2}{1-\alpha_1^2}\Big)\equiv N(\mu_h,\sigma_h^2),\]
\(E(a_t^2)=\exp(\mu_h+\sigma_h^2/2)\),\(E(a_t^4)=3\exp(2\mu_h+2\sigma_h^2)\)(原文写 \(2\mu_h^2\) 为排印错误),\(\operatorname{corr}(a_t^2,a_{t-i}^2)=[\exp(\sigma_h^2\alpha_1^i)-1]/[3\exp(\sigma_h^2)-1]\)。经验:SV 常改善拟合,但对样本外波动预测的贡献好坏参半。

3.13 长记忆随机波动率模型(Long-Memory Stochastic Volatility Model,PDF p.174–175)

动机:收益本身无序列相关,但其平方或绝对值的 ACF 衰减很慢(Ding–Granger–Engle 1993)。图 3.10:S&P 500 指数与 IBM 日绝对对数收益(1962-07-03—2003-12-31)的 ACF 为正、数值中等、缓慢衰减(200 阶内仍在 5% 界外)。LMSV:

\[a_t=\sigma_t\epsilon_t,\qquad\sigma_t=\sigma\exp(u_t/2),\qquad(1-B)^du_t=\eta_t,\tag{3.41}\]
\(\sigma>0\),\(\epsilon_t\) iid \(N(0,1)\),\(\eta_t\) iid \(N(0,\sigma_\eta^2)\) 独立于 \(\epsilon_t\),\(0<d<0.5\)。分数差分使 \(u_t\) 的 ACF 双曲(多项式)衰减。于是
\[\ln a_t^2=[\ln\sigma^2+E(\ln\epsilon_t^2)]+u_t+[\ln\epsilon_t^2-E(\ln\epsilon_t^2)]\equiv\mu+u_t+e_t,\]
即高斯长记忆信号加非高斯白噪声(Breidt–Crato–de Lima 1998)。完整估计复杂,但 \(d\) 可用拟极大似然或回归法估计。用 S&P 500 成分股日收益平方的对数,Bollerslev & Jubinski (1999)、Ray & Tsay (2000) 发现 \(d\) 的中位数约 0.38。Ray & Tsay (2000) 还发现同一行业/板块的公司有更多共同长记忆成分(如美国大型全国性银行与金融机构)。

3.14 应用(Application,PDF p.175–179)

数据:IBM 与 S&P 500 月对数收益(1926-01—1999-12,888 个观测,百分比,含分红;图 3.11),用 RATS 估计。

例 3.4 夏季效应:股票日波动在夏季是否更低、低多少?这对期权定价有实际意义。IBM 高斯 GARCH(1,1):

\[r_t=1.23+0.099r_{t-1}+a_t,\quad\sigma_t^2=3.206+0.103a_{t-1}^2+0.825\sigma_{t-1}^2,\tag{3.42}\]
标准误:均值 0.222、0.037;波动 0.947、0.021、0.037。\(\tilde a_t\) 的 \(Q(10)=7.82\)(0.553)、\(Q(20)=21.22\)(0.325);\(\tilde a_t^2\) 的 \(Q(10)=2.89\)(0.98)、\(Q(20)=7.26\)(0.99),模型充分。定义夏季指示变量
\[u_t=\begin{cases}1,&t\text{ 为 6、7、8 月}\\0,&\text{其他}\end{cases}\tag{3.43}\]
波动方程改为 \(\sigma_t^2=\alpha_0+\alpha_1a_{t-1}^2+\beta_1\sigma_{t-1}^2+u_t(\alpha_{00}+\alpha_{10}a_{t-1}^2+\beta_{10}\sigma_{t-1}^2)\)(夏季与非夏季两个 GARCH(1,1))。\(\alpha_{10},\beta_{10}\) 在 10% 不显著,精简得
\[r_t=1.21+0.099r_{t-1}+a_t,\quad\sigma_t^2=4.539+0.113a_{t-1}^2+0.816\sigma_{t-1}^2-5.154u_t,\tag{3.44}\]
标准误:均值 0.218、0.037;波动 1.071、0.022、0.037、1.900;\(\tilde a_t\) 的 \(Q(10)=7.66\)、\(Q(20)=21.64\),\(\tilde a_t^2\) 的 \(Q(10)=3.38\)、\(Q(20)=6.82\),充分。结论:(1) 夏季系数(原文此处写 −5.514,与式中 −5.154 不一致,属排印问题)显著(p=0.0067),1% 水平下夏季效应显著,且为负——夏季波动更低;(2) 夏季常数项 \(4.539-5.514=-0.615\) 为负,违反直觉,但两者标准误较大,差值可能不显著。施加夏季常数为零的约束 \(\sigma_t^2=\alpha_1a_{t-1}^2+\beta_1\sigma_{t-1}^2+\gamma(1-u_t)\):
\[r_t=1.21+0.099r_{t-1}+a_t,\quad\sigma_t^2=0.114a_{t-1}^2+0.811\sigma_{t-1}^2+4.552(1-u_t),\tag{3.45}\]
标准误 0.219、0.038;0.022、0.034、1.094;诊断统计量与前相近且不显著。量化夏季效应:1999 年 IBM 的 \(a_t^2\) 与 \(\sigma_t^2\) 中位数分别为 29.4 与 75.1,夏季 \(\sigma_t^2=0.114\times29.4+0.811\times75.1=64.3\),其他月 68.8,比值约 93%,即夏季月对数收益波动降低约 7%。

例 3.5 成分股收益对指数波动的贡献:S&P 500 月对数收益的特殊 GARCH(2,1)(只含 \(a_{t-2}^2\)):

\[r_t=0.609+a_t,\quad\sigma_t^2=0.717+0.147a_{t-2}^2+0.839\sigma_{t-1}^2,\tag{3.46}\]
标准误 0.138;0.214、0.021、0.017;\(\tilde a_t\) 的 \(Q(10)=11.51\)(0.32)、\(Q(20)=23.71\)(0.26),\(\tilde a_t^2\) 的 \(Q(10)=9.42\)(0.49)、\(Q(20)=13.01\)(0.88),充分。加入 IBM 滞后收益(\(x_t\) 为 IBM 月对数收益,1.24 为样本均值):
\[r_t=0.616+a_t,\quad\sigma_t^2=1.069+0.148a_{t-2}^2+0.834\sigma_{t-1}^2-0.007(x_{t-1}-1.24)^2,\tag{3.47}\]
标准误 0.139;0.271、0.020、0.018、0.002;诊断充分。检验 \(\gamma=0\) 的 p=0.0039,1% 水平显著;负号表示使用 IBM 滞后收益降低了指数波动估计。表 3.4(1999 年 7–12 月拟合波动):(3.46) 为 26.30、26.01、24.73、21.69、20.71、22.46;(3.47) 为 23.32、23.13、22.46、20.00、19.45、18.27。

3.15 替代方法(Alternative Approaches,PDF p.179–184)

3.15.1 使用高频数据(Use of High-Frequency Data,PDF p.179–182)

French–Schwert–Stambaugh (1987) 用高频数据计算低频收益的波动;随着高频数据普及受到广泛关注(Andersen–Bollerslev–Diebold–Labys 2001a,b)。设月对数收益 \(r_t^m=\sum_{i=1}^nr_{t,i}\)(\(n\) 个交易日),

\[\operatorname{Var}(r_t^m|F_{t-1})=\sum_{i=1}^n\operatorname{Var}(r_{t,i}|F_{t-1})+2\sum_{i<j}\operatorname{Cov}[(r_{t,i},r_{t,j})|F_{t-1}].\tag{3.48}\]

  • 若日收益为白噪声:\(\operatorname{Var}(r_t^m|F_{t-1})=n\operatorname{Var}(r_{t,1})\),用 \(\hat\sigma^2=\sum(r_{t,i}-\bar r_t)^2/(n-1)\) 估计,
    \[\hat\sigma_m^2=\frac{n}{n-1}\sum_{i=1}^n(r_{t,i}-\bar r_t)^2.\tag{3.49}\]
  • 若日收益为 MA(1):\(\operatorname{Var}=n\operatorname{Var}(r_{t,1})+2(n-1)\operatorname{Cov}(r_{t,1},r_{t,2})\),
    \[\hat\sigma_m^2=\frac{n}{n-1}\sum_{i=1}^n(r_{t,i}-\bar r_t)^2+2\sum_{i=1}^{n-1}(r_{t,i}-\bar r_t)(r_{t,i+1}-\bar r_t).\tag{3.50}\]
    困难:(1) 日收益模型未知,协方差难估;(2) 每月约 21 个交易日,样本小,精度存疑;若日收益超额峰度高且有序列相关,(3.49)(3.50) 甚至可能不一致(Bai–Russell–Tiao 2004)。

例 3.6:S&P 500 月波动(1980-01—1999-12)三种估计:(a) 日收益白噪声 (3.49);(b) 日收益 MA(1) (3.50);(c) 用 1962–1999 月收益拟合 GARCH(1,1):\(r_t^m=0.658+a_t\),\(\sigma_t^2=3.349+0.086a_{t-1}^2+0.735\sigma_{t-1}^2\)。图 3.12:基于日收益的估计远高于 GARCH 估计,1987 年 10 月日收益法约达 680(图截断到同一尺度)。

已实现波动率(realized volatility):若进一步设 \(\bar r_t=0\),则 \(\hat\sigma_m^2\approx\sum r_{t,i}^2\)。推广到用日内收益估计日波动:\(r_t=\sum_{i=1}^nr_{t,i}\),

\[RV_t=\sum_{i=1}^nr_{t,i}^2,\]
数学上是 \(r_t\) 的二次变差(quadratic variation),假设 \(r_{t,i}\) 为零均值有限方差 iid。经验上 \(\ln RV_t\) 近似服从高斯 ARIMA(0,1,\(q\)),可用于预测。优点:简单、利用日内信息。直觉上 \(n\) 越大越好,但间隔太短时受市场微观结构(如买卖价反弹)影响而有偏;最优采样间隔是研究热点,美国活跃资产常用 4–15 分钟。另一问题:股票的隔夜收益(前日收盘到当日开盘)往往很大,忽略会严重低估波动;但指数与外汇的隔夜收益似乎较小。Barndorff-Nielsen & Shephard (2004) 用高频收益研究双幂变差(bi-power variation)并发展了检测波动跳跃的方法。

3.15.2 使用日开高低收价(Use of Daily Open, High, Low, and Close Prices,PDF p.182–184)

Parkinson (1980)、Garman & Klass (1980)、Rogers & Satchell (1991)、Yang & Zhang (2000) 表明 OHLC 信息可改进波动估计。记 \(C_t\) 收盘价、\(O_t\) 开盘价、\(f\in[0,1]\) 为一天中休市时间的比例、\(H_t\) 最高价、\(L_t\) 最低价(图 3.13)。常规方差 \(\sigma_t^2=E[(C_t-C_{t-1})^2|F_{t-1}]\)。Garman–Klass 在无漂移简单扩散假设下考虑:

  • \(\hat\sigma_{0,t}^2=(C_t-C_{t-1})^2\);
  • \(\hat\sigma_{1,t}^2=\dfrac{(O_t-C_{t-1})^2}{2f}+\dfrac{(C_t-O_t)^2}{2(1-f)}\),\(0<f<1\);
  • \(\hat\sigma_{2,t}^2=\dfrac{(H_t-L_t)^2}{4\ln2}\approx0.3607(H_t-L_t)^2\)(Parkinson 1980,\(f=0\));
  • \(\hat\sigma_{3,t}^2=0.17\dfrac{(O_t-C_{t-1})^2}{f}+0.83\dfrac{(H_t-L_t)^2}{(1-f)4\ln2}\);
  • \(\hat\sigma_{5,t}^2=0.5(H_t-L_t)^2-[2\ln2-1](C_t-O_t)^2\approx0.5(H_t-L_t)^2-0.386(C_t-O_t)^2\);
  • \(\hat\sigma_{6,t}^2=0.12\dfrac{(O_t-C_{t-1})^2}{f}+0.88\dfrac{\hat\sigma_{5,t}^2}{1-f}\)。

(另有更精确但复杂的 \(\hat\sigma_{4,t}^2\),接近 \(\hat\sigma_{5,t}^2\)。)效率因子 \(\text{Eff}(\hat\sigma_{i,t}^2)=\operatorname{Var}(\hat\sigma_{0,t}^2)/\operatorname{Var}(\hat\sigma_{i,t}^2)\):\(i=1,2,3,5,6\) 分别约 2、5.2、6.2、7.4、8.4。

对数形式与 Yang–Zhang 估计量:\(o_t=\ln O_t-\ln C_{t-1}\)(标准化开盘)、\(u_t=\ln H_t-\ln O_t\)(标准化最高)、\(d_t=\ln L_t-\ln O_t\)(标准化最低)、\(c_t=\ln C_t-\ln O_t\)(标准化收盘)。\(n\) 天内波动不变时,Yang & Zhang (2000) 推荐稳健估计

\[\hat\sigma_{yz}^2=\hat\sigma_o^2+k\hat\sigma_c^2+(1-k)\hat\sigma_{rs}^2,\]
\(\hat\sigma_o^2=\frac1{n-1}\sum(o_t-\bar o)^2\),\(\hat\sigma_c^2=\frac1{n-1}\sum(c_t-\bar c)^2\),Rogers–Satchell 估计 \(\hat\sigma_{rs}^2=\frac1n\sum[u_t(u_t-c_t)+d_t(d_t-c_t)]\)(与漂移无关),\(k=\dfrac{0.34}{1.34+(n+1)/(n-1)}\) 使组合估计量方差最小。

\(H_t-L_t\) 称极差(range),引出基于极差的波动估计(Alizadeh–Brandt–Diebold 2002)。实践中价格只在离散时点观测,观测到的最高价偏低、最低价偏高,极差被低估,从而波动被低估;偏差依交易频率与 tick size 而定,活跃股票可忽略,其他股票需进一步研究。

3.16 GARCH 模型的峰度(Kurtosis of GARCH Models,PDF p.185–186)

波动估计的不确定性常被忽视,评估它需考虑模型峰度。GARCH(1,1):\(a_t=\sigma_t\epsilon_t\),\(\sigma_t^2=\alpha_0+\alpha_1a_{t-1}^2+\beta_1\sigma_{t-1}^2\),\(\alpha_0>0,\alpha_1,\beta_1\ge0,\alpha_1+\beta_1<1\),\(E(\epsilon_t)=0\),\(\operatorname{Var}(\epsilon_t)=1\),\(E(\epsilon_t^4)=K_\epsilon+3\)(\(K_\epsilon\) 为新息超额峰度)。则 \(\operatorname{Var}(a_t)=E(\sigma_t^2)=\alpha_0/[1-(\alpha_1+\beta_1)]\),\(E(a_t^4)=(K_\epsilon+3)E(\sigma_t^4)\)。对波动方程平方

\[\sigma_t^4=\alpha_0^2+\alpha_1^2a_{t-1}^4+\beta_1^2\sigma_{t-1}^4+2\alpha_0\alpha_1a_{t-1}^2+2\alpha_0\beta_1\sigma_{t-1}^2+2\alpha_1\beta_1\sigma_{t-1}^2a_{t-1}^2,\]
取期望得
\[E(\sigma_t^4)=\frac{\alpha_0^2(1+\alpha_1+\beta_1)}{[1-(\alpha_1+\beta_1)][1-\alpha_1^2(K_\epsilon+2)-(\alpha_1+\beta_1)^2]},\]
需 \(1-\alpha_1^2(K_\epsilon+2)-(\alpha_1+\beta_1)^2>0\)。超额峰度
\[K_a=\frac{(K_\epsilon+3)[1-(\alpha_1+\beta_1)^2]}{1-2\alpha_1^2-(\alpha_1+\beta_1)^2-K_\epsilon\alpha_1^2}-3.\]

  • 高斯新息(\(K_\epsilon=0\)):\(K_a^{(g)}=\dfrac{6\alpha_1^2}{1-2\alpha_1^2-(\alpha_1+\beta_1)^2}\)。含义:(a) 峰度存在需 \(1-2\alpha_1^2-(\alpha_1+\beta_1)^2>0\);(b) \(\alpha_1=0\) 时 \(K_a^{(g)}=0\),无厚尾。
  • 非高斯新息:
    \[K_a=\frac{K_\epsilon+K_a^{(g)}+\frac56K_\epsilon K_a^{(g)}}{1-\frac16K_\epsilon K_a^{(g)}}.\]
    此结果源自 George C. Tiao(见 Bai–Russell–Tiao 2003),对峰度存在的所有 GARCH 模型成立。如 ARCH(1)(\(\beta_1=0\)):\(K_a^{(g)}=6\alpha_1^2/(1-3\alpha_1^2)\),\(K_a=\dfrac{(K_\epsilon+3)(1-\alpha_1^2)}{1-(K_\epsilon+3)\alpha_1^2}-3\),同样满足上式。
  • 结论:\(\alpha_1\) 决定尾部行为;\(\alpha_1=0\) 时 \(K_a=K_\epsilon\)(与新息同尾),\(\alpha_1>0\) 时 \(K_a^{(g)}>0\),\(a_t\) 厚尾。
  • 标准化 Student-t(\(v>4\)):\(E(\epsilon_t^4)=6/(v-4)+3\),\(K_\epsilon=6/(v-4)\)——这是本章预设自由度时取 \(t_5\) 的部分原因。此时 \(K_a=[6+(v+1)K_a^{(g)}]/[v-4-K_a^{(g)}]\),需 \(1-2\alpha_1^2(v-1)/(v-4)-(\alpha_1+\beta_1)^2>0\)。

附录:估计波动率模型的 RATS 程序(PDF p.187–188)

数据 sp500.txt(792 个月超额收益)。三个程序:(1) 常数均值的高斯 GARCH(1,1):set h=0.0 初始化条件方差;nonlin mu a0 a1 b1;frml at=rt(t)-mu;frml gvar=a0+a1*at(t-1)**2+b1*h(t-1);frml garchln=-0.5*log(h(t)=gvar(t))-0.5*at(t)**2/h(t);smpl 2 792;初值 a0=0.01、a1=0.1、b1=0.5、mu=0.1;maximize(method=bhhh,recursive,iterations=150);用 cor(qstats,number=20,span=10) 检验标准化残差及其平方。(2) Student-t 新息 GARCH(1,1):增加参数 v(初值 10),对数似然含 %LNGAMMA((v+1)/2.)-%LNGAMMA(v/2.)-0.5*log(v-2.) 与 -((v+1)/2.)*log(1.0+tt(t)/(v-2.0))-0.5*log(h(t))。(3) IBM 月对数收益(864 个)AR(1)–EGARCH(1,1):h 表示 \(\ln\sigma_t^2\),frml g=th*epsi(t)+ga*(abs(epsi(t))-sqrt(2./%PI)),frml gvar=a1*h(t-1)+(1-a1)*a0+g(t-1)。

习题(PDF p.188–191)

  • 3.1、3.2:推导 GARCH(1,2)、GARCH(2,1) 的多步预测(考查 ARMA 表示与递推)。
  • 3.3、3.4:推导 AR(1)–GARCH(1,1) 在高斯/标准化 t 新息下的条件对数似然。
  • 3.5:Intel 月对数收益(1973–2008)建 GARCH,计算 2008 年 12 月为原点的 1–5 步波动预测。
  • 3.6:Merck 月收益(1946-06—2008-12):序列相关检验、ARCH 效应检验(\(Q(6)\)、\(Q(12)\))、识别并拟合 ARCH。
  • 3.7:3M 月收益:ARCH 效应检验;PACF 定阶 ARCH;前 750 个观测重估并预测 751–755;ARCH-M 风险溢价检验;EGARCH 及 1–5 步预测。
  • 3.8:GM 月收益(1950–2008):高斯 GARCH、GARCH-M、估计自由度的 t-GARCH(检验 \(H_0:v=6\))、EGARCH,比较 1–6 步波动预测。
  • 3.9:GM 月收益 TGARCH,检验杠杆效应并预测。
  • 3.10:S&P 500 月收益高斯 GARCH;检验夏季效应;GM 滞后收益是否有助于指数波动建模(复现例 3.4、3.5)。
  • 3.11:GM 日收益(1999–2008):ARCH 效应检验、平方收益 PACF、高斯与 GED GARCH。
  • 3.12:S&P 日简单收益:ARCH 检验、GARCH 建模、1–4 步收益与波动预测。
  • 3.13:GM 日收益 GARCH-M 与 EGARCH(杠杆效应检验)。
  • 3.14:S&P 对数收益拟合 AR(5)(仅滞后 3、5)–GARCH(1,1)-GED,得 spvol,把它作为 GM 波动方程的外生变量(S-Plus:garch(gm~1,~garch(1,1)+spvol,cond.dist='ged')),讨论市场波动对个股波动的意义。
  • 3.15:反过来用 GM 波动 gmvol 作为 S&P 波动方程的外生变量,判断个股波动是否有助于指数波动建模。

参考文献(p.191–193):Alizadeh–Brandt–Diebold (2002)、Andersen & Bollerslev (1998)、Andersen 等 (2001a,b)、Bai–Russell–Tiao (2003, 2004)、Barndorff-Nielsen & Shephard (2004)、Bollerslev (1986)、Bollerslev & Jubinski (1999)、Bollerslev–Chou–Kroner (1992)、Bollerslev–Engle–Nelson (1994)、Breidt–Crato–de Lima (1998)、Cao & Tsay (1992)、Ding–Granger–Engle (1993)、Engle (1982)、Fernández & Steel (1998)、French–Schwert–Stambaugh (1987)、Garman & Klass (1980)、Glosten–Jagannathan–Runkle (1993)、Harvey–Ruiz–Shephard (1994)、Jacquier–Polson–Rossi (1994)、Lambert & Laurent (2001)、McLeod & Li (1983)、Melino & Turnbull (1990)、Nelson (1990, 1991)、Nicholls & Quinn (1982)、Parkinson (1980)、Ray & Tsay (2000)、Rogers & Satchell (1991)、Taylor (1994)、Tong (1978, 1990)、Tsay (1987)、Yang & Zhang (2000)、Zakoian (1994)。p.194 空白。

第 3 章小结

本章要点

  • 波动率 = 条件标准差,不可直接观测;四个典型特征:聚集、连续演化、平稳有界、杠杆效应。
  • 建模框架:均值方程 + 波动方程;收益"不相关但相依",用残差平方的 Ljung–Box(McLeod–Li)或 Engle LM 检验 ARCH 效应;四步建模流程。
  • ARCH(\(m\)):\(\sigma_t^2=\alpha_0+\sum\alpha_ia_{t-i}^2\);ARCH(1) 无条件方差 \(\alpha_0/(1-\alpha_1)\),峰度 \(3(1-\alpha_1^2)/(1-3\alpha_1^2)>3\);用 \(a_t^2\) 的 PACF 定阶;条件似然估计(正态、t、偏 t、GED);用标准化残差及其平方诊断。
  • GARCH(\(m,s\)) 是 \(a_t^2\) 的 ARMA (3.15);GARCH(1,1) 的持续性 \(\alpha_1+\beta_1\) 决定多步预测向无条件方差 \(\alpha_0/(1-\alpha_1-\beta_1)\) 收敛的速度;实证中 \(\alpha_1+\beta_1\) 常接近 1。
  • 用 \(a_{h+1}^2\) 评价波动预测不恰当(噪声太大);两步估计法是简便近似。
  • IGARCH:无条件方差不存在,预测线性增长;\(\alpha_0=0\) 时即 RiskMetrics 的 EWMA。
  • GARCH-M 把波动放入均值方程刻画风险溢价,会引入收益序列相关。
  • 不对称模型:EGARCH(对数方差、\(g(\epsilon)\) 不对称、无正性约束)与 TGARCH/GJR(负冲击额外系数 \(\gamma\));IBM 例中两倍标准差负冲击使方差高出约 26%–37%。
  • CHARMA/RCA 以随机系数产生条件异方差(含交叉项);SV 在波动方程中加入独立新息,估计需 Kalman 拟似然或 MCMC;LMSV 用分数差分刻画波动长记忆(\(d\approx0.38\))。
  • 外生变量可进入波动方程(夏季效应、成分股收益)。
  • 替代估计:已实现波动率(日内收益平方和,注意微观结构噪声与隔夜收益);OHLC 估计量(Parkinson、Garman–Klass、Rogers–Satchell、Yang–Zhang),效率可达收盘价估计的 5–8 倍。
  • GARCH 峰度公式 \(K_a=\frac{K_\epsilon+K_a^{(g)}+\frac56K_\epsilon K_a^{(g)}}{1-\frac16K_\epsilon K_a^{(g)}}\),\(\alpha_1\) 决定尾部。

与量化交易的关联

  • 风险建模与 VaR:GARCH/EWMA 波动预测是日度 VaR、ES、保证金和风险预算的核心输入;RiskMetrics 即 IGARCH(1,1) 无截距特例(第 7 章);t/偏 t 新息改善尾部风险刻画。
  • 波动率目标与仓位管理:波动率择时(volatility targeting)、风险平价按预测波动缩放头寸;GARCH 多步预测的均值回复决定不同持有期的风险预算;持续性接近 1 意味着波动冲击衰减很慢。
  • 期权定价与波动交易:Black–Scholes 需要 \(\sigma\);隐含波动通常高于 GARCH 波动(波动风险溢价),是卖方波动策略的收益来源之一;夏季效应等季节性可用于期权定价调整;VIX 期货是可交易工具。
  • 杠杆效应:EGARCH/GJR 的不对称性对下行风险、偏度交易、看跌期权偏斜(skew)建模有用。
  • 因子与信号:波动率本身是常用因子(低波动异象);GARCH-M 检验风险–收益关系;把市场波动作为个股波动方程的外生变量(习题 3.14)对应 beta/系统性风险分解。
  • 数据工程:已实现波动率需要处理采样频率(4–15 分钟)、微观结构噪声和隔夜跳空;只有日线 OHLC 时,Parkinson/Garman–Klass/Yang–Zhang 估计量能以很低成本大幅提高波动估计效率,是日频风险模型和回测中常用的实用工具。
  • 模型评价:用平方收益做预测评价会严重低估模型能力,回测波动模型应以已实现波动或 QLIKE 等稳健损失评价。

推荐习题

  • 3.1/3.2:GARCH 多步预测推导,理解 ARMA 表示。
  • 3.3/3.4:自己写出条件对数似然,为手写 GARCH 估计器打基础。
  • 3.7:3M 完整流程(检验—定阶—样本外预测—ARCH-M—EGARCH),覆盖本章主要工具。
  • 3.8:多种模型的预测比较与 t 分布自由度检验。
  • 3.10:复现夏季效应和成分股外生变量的分析方法。
  • 3.14/3.15:市场波动与个股波动的相互作用,贴近多因子风险模型。

第 4 章 非线性模型及其应用(Nonlinear Models and Their Applications,PDF p.195–232,续见下一块)

章首导言(PDF p.195–197)

单变量序列 \(\{x_t\}_{t=1}^T\)。如第 2 章,纯随机序列若可写成

\[x_t=\mu+\sum_{i=0}^\infty\psi_ia_{t-i}\tag{4.1}\]
(\(\psi_0=1\),\(a_t\) iid 连续分布、零均值,常设方差 \(\sigma_a^2\) 或高斯)则为线性;\(\sigma_a^2\sum\psi_i^2<\infty\) 时弱平稳。ARMA 有 MA 表示故为线性。不满足 (4.1) 的随机过程为非线性。(可把均值推广为外生变量、时间指数、周期函数的线性函数,但这可用第 2 章方法处理,此处不讨论。)数学上纯随机模型是当前与过去冲击的函数
\[x_t=f(a_t,a_{t-1},\dots),\tag{4.2}\]
线性模型即 \(f\) 为线性函数;任何 \(f\) 的非线性都产生非线性模型。(4.2) 参数过多不能直接用。

用条件矩表述:\(F_{t-1}\) 为 \(t-1\) 时刻(含)可得信息生成的 σ 域(通常是 \(\{x_{t-1},x_{t-2},\dots\}\) 和 \(\{a_{t-1},a_{t-2},\dots\}\) 的线性组合),

\[\mu_t=E(x_t|F_{t-1})\equiv g(F_{t-1}),\qquad\sigma_t^2=\operatorname{Var}(x_t|F_{t-1})\equiv h(F_{t-1}),\tag{4.3}\]
\(h>0\),于是 \(x_t=g(F_{t-1})+\sqrt{h(F_{t-1})}\epsilon_t\),\(\epsilon_t=a_t/\sigma_t\)。线性序列中 \(g\) 线性、\(h=\sigma_a^2\)。\(g\) 非线性称均值非线性(nonlinear in mean);\(h\) 时变称方差非线性(nonlinear in variance)。第 3 章的波动率模型(除 GARCH-M 外)都是方差非线性;本章模型主要修改条件均值方程。由 Wold 分解,弱平稳纯随机序列可表示为不相关冲击的线性函数;对平稳波动序列,这些冲击不相关但相依。

文献中的非线性模型:双线性模型(Granger & Andersen 1978)、门限自回归 TAR(Tong 1978)、状态相依模型(Priestley 1980)、马尔可夫转换模型(Hamilton 1989)——让 \(\mu_t\) 按简单参数非线性函数演化。借助计算进步的新模型:非线性状态空间(Carlin–Polson–Stoffer 1992)、函数系数 AR(Chen & Tsay 1993a)、非线性可加 AR(Chen & Tsay 1993b)、多元自适应回归样条 MARS(Lewis & Stevens 1991)——用模拟描述条件分布演化或用数据驱动方法探索非线性。还有核回归、人工神经网络等非参数/半参数方法。另一方向是区分线性与非线性的检验:参数检验多用 LM 或似然比统计量,非参数检验依赖高阶谱或混沌序列中的关联维数概念。本章结构:4.1 模型;4.2 非线性检验;4.3–4.4 建模与预测;4.5 应用。

4.1 非线性模型(Nonlinear Models,PDF p.197–225)

多数非线性模型关注条件均值方程(综述见 Priestley 1988;Tong 1990),这里介绍适用于金融序列的模型。

4.1.1 双线性模型(Bilinear Model,PDF p.197–198)

线性模型 (4.1) 是 (4.2) 中 \(f\) 的一阶 Taylor 展开,自然的推广是加入二阶项:

\[x_t=c+\sum_{i=1}^p\phi_ix_{t-i}-\sum_{j=1}^q\theta_ja_{t-j}+\sum_{i=1}^m\sum_{j=1}^s\beta_{ij}x_{t-i}a_{t-j}+a_t,\tag{4.4}\]
(Granger & Andersen 1978;性质与应用见 Subba Rao & Gabr 1984;一般双线性模型见 Liu & Brockwell 1988)。平稳条件等性质常通过 (a) 写成状态空间形式(第 11 章)、(b) 用状态转移方程把状态表示为过去新息与随机系数向量之积来推导。一个具有条件异方差的特例:
\[x_t=\mu+\sum_{i=1}^s\beta_ia_{t-i}a_t+a_t,\tag{4.5}\]
\(E(x_t|F_{t-1})=\mu\),\(\operatorname{Var}(x_t|F_{t-1})=(1+\sum_{i=1}^s\beta_ia_{t-i})^2\sigma_a^2\),与 RCA/CHARMA 类似。

例 4.1 CRSP 等权指数月简单收益(1926-01—2008-12,996 个观测):PACF 在滞后 1、3 显著,用 AR(3);残差平方提示条件异方差依赖滞后 1、3、8(为简便略去 8)。特殊双线性模型 \(R_t=\mu+\phi_1R_{t-1}+\phi_3R_{t-3}+(1+\beta_1a_{t-1}+\beta_3a_{t-3})a_t\),\(a_t=\beta_0\epsilon_t\)。条件正态 MLE:

\[R_t=0.0114+0.167R_{t-1}-0.095R_{t-3}+0.071(1+0.377a_{t-1}-0.646a_{t-3})\epsilon_t,\tag{4.6}\]
标准误 0.0023、0.032、0.027、0.002、0.147、0.136,均 5% 显著。标准化残差 \(\hat\epsilon_t=\dfrac{R_t-0.0114-0.167R_{t-1}+0.095R_{t-3}}{0.071(1+0.377\hat a_{t-1}-0.646\hat a_{t-3})}\)(\(t\le3\) 时为 0)无序列相关,但其平方有显著序列相关,模型有效性存疑。对比 AR(3)–ARCH(3):
\[R_t=0.013+0.223R_{t-1}+0.006R_{t-2}-0.013R_{t-3}+a_t,\quad\sigma_t^2=0.002+0.185a_{t-1}^2+0.301a_{t-2}^2+0.197a_{t-3}^2,\tag{4.7}\]
除 \(R_{t-2},R_{t-3}\) 系数外高度显著;标准化残差平方 \(Q(10)=19.78\)(p=0.031)。两者相似,(4.7) 拟合更好;进一步研究表明 AR(1)–GARCH(1,1) 拟合良好。

4.1.2 门限自回归模型(Threshold Autoregressive (TAR) Model,PDF p.199–204)

动机:实际中常见的非线性特征,如过程下降与上升模式不对称。TAR 用分段线性模型逼近条件均值,但与传统在"时间"空间分段不同,TAR 在门限空间分段。

简单两区制 AR(1):

\[x_t=\begin{cases}-1.5x_{t-1}+a_t,&x_{t-1}<0\\0.5x_{t-1}+a_t,&x_{t-1}\ge0\end{cases}\tag{4.8}\]
\(a_t\) iid \(N(0,1)\),门限变量 \(x_{t-1}\)(延迟 1),门限 0。图 4.1(200 个模拟观测)说明三点:

  1. 尽管第一区制系数 −1.5(爆炸性),过程仍几何遍历(geometrically ergodic)且平稳。(4.8) 几何遍历的充要条件是 \(\phi_1^{(1)}<1\)、\(\phi_1^{(2)}<1\)、\(\phi_1^{(1)}\phi_1^{(2)}<1\)(Petruccelli & Woolford 1984;Chen & Tsay 1991)。遍历性很重要:样本均值收敛到总体均值的结论称遍历定理(ergodic theorem),相当于 iid 情形的大数定律/中心极限理论的对应物。
  2. 上升与下降不对称:\(x_{t-1}<0\) 时由于负的爆炸系数,\(x_t\) 倾向于跳到正值;\(x_{t-1}>0\) 时需多期才回落到负值。故区制 2 观测更多,变负后出现大的向上跳跃——序列不可时间反转(not time reversible)。
  3. 无常数项但 \(E(x_t)\ne0\):该样本均值 0.61(标准差 0.07)。一般 \(E(x_t)\) 是两区制条件均值按平稳分布下处于各区制概率的加权平均;要使 TAR 均值为零,某些区制需非零常数——与线性平稳模型(非零常数意味均值非零)截然不同。

\(k\) 区制自激 TAR(SETAR),门限变量 \(x_{t-d}\):

\[x_t=\phi_0^{(j)}+\phi_1^{(j)}x_{t-1}-\cdots-\phi_p^{(j)}x_{t-p}+a_t^{(j)},\quad\gamma_{j-1}\le x_{t-d}<\gamma_j,\tag{4.9}\]
\(j=1,\dots,k\),\(-\infty=\gamma_0<\gamma_1<\cdots<\gamma_{k-1}<\gamma_k=\infty\);\(\{a_t^{(j)}\}\) 为均值 0、方差 \(\sigma_j^2\) 的 iid 序列,不同区制相互独立。\(d\) 称延迟参数(delay),\(\gamma_j\) 称门限(thresholds)。各区制 AR 模型必须不同(否则可减少区制数)。(原式中 \(-\phi_p^{(j)}\) 的负号应为正号,属排印问题。)SETAR 是门限空间中的分段线性 AR;\(k>1\) 时为非线性。一般性质难求(Tong 1990;Chan 1993;Chan & Tsay 1998);应用见 Hansen (1997)、Tsay (1998)、Montgomery 等 (1998);Tsay (1989) 提出单变量 SETAR 的检验与建模程序。推广:用 \(F_{t-1}\) 可测的门限变量 \(z_t\)(平稳、在实数紧子集上有连续分布,\(z_{t-d}\) 在 \(t\) 时已知),称开环 TAR(open-loop TAR)。

例 4.2 美国月度失业率(季调,百分比,1948-01—2009-03,735 个观测,图 4.2):整体缓慢上升;上升快、下降慢——不可时间反转,可能也非单位根平稳。样本 ACF 衰减慢,用一阶差分 \(y_t=(1-B)u_t\)。ARIMA:

\[(1-1.13B+0.27B^2)(1-0.51B^{12})y_t=(1-1.12B+0.44B^2)(1-0.82B^{12})a_t,\tag{4.10}\]
\(\hat\sigma_a=0.187\),除 AR(2) 系数(t=−1.66)外均 5% 显著;残差 \(Q(12)=12.3\)(\(\chi^2_6\),p=0.056)、\(Q(24)=25.5\)(\(\chi^2_{18}\),p=0.11),充分。虽已季调,季节 AR、MA 系数仍高度显著(标准误 0.049、0.035),季调是否充分值得研究。1 步预测 2009 年 4 月失业率 8.8,实际 8.9。TAR 模型:
\[y_t=\begin{cases}0.083y_{t-2}+0.158y_{t-3}+0.118y_{t-4}-0.180y_{t-12}+a_{1t},&y_{t-1}\le0.1\\0.421y_{t-2}+0.239y_{t-3}-0.127y_{t-12}+a_{2t},&y_{t-1}>0.1\end{cases}\tag{4.11}\]
\(a_{it}\) 标准差 0.180、0.217;区制 1 系数标准误 0.046、0.043、0.042、0.037,区制 2 为 0.054、0.057、0.075;两区制观测数 460、262;标准化残差仅在滞后 12 有轻微相关。当月失业率变化大于 0.1% 时动态相依更强——失业率大幅上升意味经济走弱,政策制定者更可能出手,从而影响失业率动态。(4.10) 的 MA 表示 \(\psi(B)\approx1+0.01B+0.18B^2+0.20B^3+0.18B^4+0.15B^5+\cdots\),因此 (4.11) 中没有 \(y_{t-1}\) 项不足为奇。

门限思想用于波动率:门限模型可处理正负收益的波动不对称,也可研究指数期货与现货的套利(第 8 章)。这里介绍比第 3 章 GJR 更一般的 TGARCH 参数化。

例 4.3 IBM 日对数收益(百分比,含分红,1962-07-03—2003-12-31,10,446 个观测,图 4.3;后期波动更大;用 SCA 估计):

  • AR(2)–GARCH(1,1):
    \[r_t=0.062-0.024r_{t-2}+a_t,\quad\sigma_t^2=0.037+0.077a_{t-1}^2+0.913\sigma_{t-1}^2,\tag{4.12}\]
    标准误 0.015、0.010;0.004、0.003、0.003,均显著。\(\tilde a_t\) 的 \(Q(10)=5.19\)(0.82)、\(Q(20)=24.38\)(0.18)(因估计了 AR(2) 系数用 \(\chi^2_{m-1}\)),\(\tilde a_t^2\) 的 \(Q(10)=11.67\)(0.31)、\(Q(20)=18.25\)(0.57)。但模型隐含无条件均值 0.060,远大于样本均值 0.039,可能设定错误。
  • GJR 型 TGARCH:
    \[r_t=0.014-0.028r_{t-2}+a_t,\quad\sigma_t^2=0.075+0.081P_{t-1}a_{t-1}^2+0.157N_{t-1}a_{t-1}^2+0.863\sigma_{t-1}^2,\tag{4.13}\]
    \(P_{t-1}=1-N_{t-1}\);标准误 0.013、0.009;0.007、0.008、0.010、0.010,除均值常数外均显著。\(\tilde a_t\) 的 \(Q(10)=2.47\)、\(Q(20)=25.90\),但 \(\tilde a_t^2\) 的 \(Q(10)=97.07\)、\(Q(20)=170.3\)(p=0.00)——未能刻画条件异方差。
  • AR(2)–TAR–GARCH(1,1)(允许 \(\sigma_{t-1}^2\) 的系数也依赖 \(a_{t-1}\) 的符号):
    \[r_t=0.033-0.023r_{t-2}+a_t,\quad\sigma_t^2=0.075+0.041a_{t-1}^2+0.903\sigma_{t-1}^2+(0.030a_{t-1}^2+0.062\sigma_{t-1}^2)N_{t-1},\tag{4.14}\]
    全部 1% 显著;\(\hat a_t\) 的 \(Q(10)=6.09\)(0.73)、\(Q(20)=25.29\)(0.15),\(\hat a_t^2\) 的 \(Q(10)=13.54\)(0.20)、\(Q(20)=19.56\)(0.49),充分;无条件均值 0.033,更接近样本均值 0.039。结论:IBM 日波动的不对称性远强于 GJR 所允许的;可进一步约束 \(a_{t-1}<0\) 时 \(a_{t-1}^2\) 与 \(\sigma_{t-1}^2\) 系数之和为 1(负冲击区制为 IGARCH)。注:附录 A 给出估计该模型的 RATS 程序,结果可能与 SCA 略有差异。

4.1.3 平滑转移 AR 模型(Smooth Transition AR (STAR) Model,PDF p.204–206)

对 SETAR 的批评:条件均值在门限处不连续。平滑 TAR(Chan & Tong 1986;Teräsvirta 1994)。两区制 STAR(\(p\)):

\[x_t=c_0+\sum_{i=1}^p\phi_{0,i}x_{t-i}+F\Big(\frac{x_{t-d}-\Delta}{s}\Big)\Big(c_1+\sum_{i=1}^p\phi_{1,i}x_{t-i}\Big)+a_t,\tag{4.15}\]
\(d\) 为延迟,\(\Delta\) 与 \(s\) 为转移的位置与尺度参数,\(F(\cdot)\) 为平滑转移函数,常取 logistic、指数或某 CDF。\(0\le F\le1\),条件均值是两个方程的连续加权组合:
\[\mu_{1t}=c_0+\sum_{i=1}^p\phi_{0,i}x_{t-i},\qquad\mu_{2t}=(c_0+c_1)+\sum_{i=1}^p(\phi_{0,i}+\phi_{1,i})x_{t-i}.\]
平稳的前提之一是两个 AR 多项式的零点都在单位圆外。优点:条件均值可微。缺点:\(\Delta\) 与 \(s\) 难估计,标准误常很大(t 值约 1.0,Teräsvirta 1994),给解释带来困难。

例 4.4 3M 月简单收益(1946-02—2008-12):ARCH(2)

\[R_t=0.013+a_t,\quad\sigma_t^2=0.003+0.088a_{t-1}^2+0.109a_{t-2}^2,\tag{4.16}\]
标准误 0.002、0.0003、0.047、0.050,无法表现正负冲击的不对称。STAR 波动模型:
\[R_t=0.015+a_t,\quad\sigma_t^2=(0.003+0.205a_{t-1}^2+0.092a_{t-2}^2)+\frac{0.001-0.239a_{t-1}^2}{1+\exp(-1000a_{t-1})},\tag{4.17}\]
标准误:均值 0.002;波动 0.0002、0.074、0.043、0.0004、0.080;logistic 尺度参数 1000 预先固定以简化估计。大的负 \(a_{t-1}\)(转移函数→0):\(\sigma_t^2\approx0.003+0.205a_{t-1}^2+0.092a_{t-2}^2\);大的正 \(a_{t-1}\)(转移函数→1):\(\sigma_t^2\approx0.004-0.034a_{t-1}^2+0.092a_{t-2}^2\)。正冲击下 \(a_{t-1}^2\) 的负系数违反直觉但数值很小,即大的正冲击后 ARCH 效应很弱——支持不对称反应。用 R 的 optim(BFGS,hessian=T)最小化负对数似然:自定义函数 star(par) 对 \(t\ge3\) 递推 \(a_t=R_t-\mu\)、sig=par[2]+par[3]*at[t-1]^2+par[4]*at[t-2]^2、sig1=par[5]+par[6]*at[t-1]^2、tt=sqrt(sig+sig1/(1+exp(-1000*at[t-1]))),累加 log(tt)+0.5*x^2;初值 c(.001,.002,.256,.141,.002,-.314)。RATS 程序见附录 A。

4.1.4 马尔可夫转换模型(Markov Switching Model,PDF p.206–209)

概率转换思想见 Tong (1983);Hamilton (1989) 强调经济状态间的非周期转换,提出马尔可夫转换自回归(MSA),由隐藏的两状态马尔可夫链驱动:

\[x_t=\begin{cases}c_1+\sum_{i=1}^p\phi_{1,i}x_{t-i}+a_{1t},&s_t=1\\c_2+\sum_{i=1}^p\phi_{2,i}x_{t-i}+a_{2t},&s_t=2\end{cases}\tag{4.18}\]
\(s_t\in\{1,2\}\) 为一阶马尔可夫链,转移概率 \(P(s_t=2|s_{t-1}=1)=w_1\),\(P(s_t=1|s_{t-1}=2)=w_2\);\(\{a_{1t}\},\{a_{2t}\}\) 为零均值有限方差 iid,相互独立。\(w_i\) 小表示在状态 \(i\) 停留更久,\(1/w_i\) 为在状态 \(i\) 的期望持续期。

与 SETAR 的区别:MSA 用隐藏马尔可夫链(随机机制)控制转换,SETAR 由特定滞后变量(确定机制)决定。MSA 中永远无法确知 \(x_t\) 所处状态,样本大时可用滤波推断;SETAR 中只要 \(x_{t-d}\) 已观测,区制就已知。预测上:MSA 的预测总是各状态子模型预测的线性组合;SETAR 预测只来自单一区制(只要 \(x_{t-d}\) 已观测),预测步长超过 \(d\) 后才成为各区制预测的组合。MSA 因状态不可观测更难估计:Hamilton (1990) 用 EM 算法(期望与最大化迭代);McCulloch & Tsay (1994) 用 MCMC(第 12 章)。推广:McCulloch & Tsay (1993) 令转移概率为 \(t-1\) 时可得解释变量的 logistic 或 probit 函数;Chen–McCulloch–Tsay (1997) 用马尔可夫转换做非嵌套非线性模型(如双线性与 SETAR)的比较选择,每个竞争模型对应一个状态,是贝叶斯优比(odds ratio)的推广;可推广到多于两状态,但计算量急剧增加。参见 Hamilton (1994, 第 22 章)。

例 4.5 美国季度实际 GNP 增长率(季调,百分比,1947Q2–1991Q1,图 4.4):该序列广泛用于非线性分析(TAR:Tiao & Tsay 1994、Potter 1995;马尔可夫转换:Hamilton 1989、McCulloch & Tsay 1994)。MSA(\(p=4\)),Gibbs 抽样 5000 次迭代,表 4.1(后验均值,括号为后验标准差):

  • 状态 1:\(c=0.909\)(0.202),\(\phi_1=0.265\)(0.113),\(\phi_2=0.029\)(0.126),\(\phi_3=-0.126\)(0.103),\(\phi_4=-0.110\)(0.109),\(\sigma=0.816\)(0.125),\(w=0.118\)(0.053);
  • 状态 2:\(c=-0.420\)(0.324),\(\phi_1=0.216\)(0.347),\(\phi_2=0.628\)(0.377),\(\phi_3=-0.073\)(0.364),\(\phi_4=-0.097\)(0.404),\(\sigma=1.017\)(0.293),\(w=0.286\)(0.064)。

发现:(1) 状态 1 边际均值 \(0.909/(1-0.265-0.029+0.126+0.110)=0.965\),状态 2 为 \(-0.42/(1-0.216-0.628+0.073+0.097)=-1.288\),即状态 1 为扩张、状态 2 为收缩;(2) 状态 2 后验标准差大,因为负增长季度少;(3) 转移概率不同,走出收缩(0.286)比陷入收缩(0.118)更容易;(4) 期望持续期:收缩约 \(1/0.286\approx3.69\) 季度(约一年),扩张约 \(1/0.118\approx11.31\) 季度(约 3 年);(5) \(x_{t-2}\) 的系数在两状态差异很大,扩张与收缩期的经济动态不同。

4.1.5 非参数方法(Nonparametric Methods,PDF p.209–218)

当无法预先设定 \(Y\) 与 \(X\) 的非线性结构,或想利用计算能力探索函数关系时,用非参数方法。代价:高度依赖数据、易过拟合。本节介绍核回归、局部最小二乘(局部线性回归)和神经网络。

平滑的本质:

\[Y_t=m(X_t)+a_t,\tag{4.19}\]
\(m(\cdot)\) 为任意光滑未知函数,\(a_t\) 白噪声。若在 \(X=x\) 处有重复独立观测 \(y_1,\dots,y_T\),则 \(\bar y=m(x)+\bar a\to m(x)\)(大数定律),这显示了平滑的威力。金融序列在 \(X=x\) 处无重复观测,但若 \(m\) 足够光滑,\(X_t\approx x\) 的 \(Y_t\) 仍能很好近似 \(m(x)\),远离的近似较差,故用加权平均
\[\hat m(x)=\frac1T\sum_{t=1}^Tw_t(x)y_t,\tag{4.20}\]
权重之和为 \(T\)(也可把 \(1/T\) 并入权重使其和为 1),\(x_t\) 离 \(x\) 越近权重越大。距离度量与按距离分配权重的方式不同,就得到不同的非参数方法。

核回归(kernel regression):核 \(K(x)\) 通常是密度函数,\(K(x)\ge0\),\(\int K(z)dz=1\)。用带宽(bandwidth)\(h>0\) 重标度:

\[K_h(x)=\frac1hK(x/h),\quad\int K_h(z)dz=1,\tag{4.21}\]
\[w_t(x)=\frac{K_h(x-x_t)}{\sum_{t=1}^TK_h(x-x_t)},\tag{4.22}\]
分母为归一化常数,使平滑器适应 \(X\) 的局部密度且权重和为 1。代入得 Nadaraya–Watson 核估计(Nadaraya 1964;Watson 1964):
\[\hat m(x)=\sum_{t=1}^Tw_t(x)y_t=\frac{\sum_{t=1}^TK_h(x-x_t)y_t}{\sum_{t=1}^TK_h(x-x_t)}.\tag{4.23}\]
常用核:高斯核 \(K_h(x)=\frac{1}{h\sqrt{2\pi}}\exp(-\frac{x^2}{2h^2})\);Epanechnikov 核(1969)\(K_h(x)=\frac{0.75}{h}(1-\frac{x^2}{h^2})I(|x/h|\le1)\),\(I(\cdot)\) 为示性函数。图 4.5 比较 \(h=1\) 时两者。

带宽的作用(以 Epanechnikov 核在观测点处为例):\(h\to0\) 时 \(\hat m(x_t)\to K_h(0)y_t/K_h(0)=y_t\),即小带宽复现数据(欠平滑);\(h\to\infty\) 时 \(\hat m(x_t)\to\bar y\),即大带宽过度平滑为样本均值。\(h\) 小则权重集中于少数邻近观测,\(h\) 大则权重分散到更大邻域——带宽选择是核回归的关键问题。

带宽选择(Härdle 1990;Fan & Yao 2003):

  1. 插入法(plug-in):基于平均积分平方误差 \(\text{MISE}=E\int[\hat m(x)-m(x)]^2dx\) 的渐近展开(\(E[\hat m(x)-m(x)]^2\) 为 \(x\) 处的逐点 MSE),在正则条件下导出最小化 MISE 的最优带宽;但它依赖需要初步平滑估计的未知量,常需多次迭代,初步平滑的选择本身可能成问题。Fan & Yao (2003) 的正态参考带宽:高斯核 \(\hat h_{opt}=1.06sT^{-1/5}\),Epanechnikov 核 \(\hat h_{opt}=2.34sT^{-1/5}\),\(s\) 为(平稳)自变量的样本标准差。
  2. 留一交叉验证(leave-one-out CV):去掉 \((x_j,y_j)\),用其余 \(T-1\) 个点在 \(x_j\) 处得 \(\hat m_{h,j}(x_j)=\frac1{T-1}\sum_{t\ne j}w_t(x_j)y_t\)(权重和为 \(T-1\));对 \(j=1,\dots,T\) 重复,定义
    \[CV(h)=\frac1T\sum_{j=1}^T[y_j-\hat m_{h,j}(x_j)]^2W(x_j),\]
    \(W(\cdot)\) 为非负权函数(\(\sum W(x_j)=T\)),用于降低边界点权重(边界点邻居少)。取使 \(CV(h)\) 最小的 \(h\)。

局部线性回归(local linear regression):设 \(m\) 在 \(x\) 处二阶导存在且连续,求 \(a,b\) 最小化

\[L(a,b)=\sum_{t=1}^T[y_t-a-b(x-x_t)]^2K_h(x-x_t),\tag{4.24}\]
\(\hat m(x)=\hat a\),\(\hat b\) 可作为 \(m'(x)\) 的估计(实践中 \(x\) 取自变量的观测值)。这是加权最小二乘,令 \(s_{T,\ell}=\sum_{t=1}^TK_h(x-x_t)(x-x_t)^\ell\)(\(\ell=0,1,2\)),正规方程
\[\begin{bmatrix}s_{T,0}&s_{T,1}\\s_{T,1}&s_{T,2}\end{bmatrix}\begin{bmatrix}a\\b\end{bmatrix}=\begin{bmatrix}\sum K_h(x-x_t)y_t\\\sum(x-x_t)K_h(x-x_t)y_t\end{bmatrix},\]
\[\hat a=\frac{s_{T,2}\sum K_h(x-x_t)y_t-s_{T,1}\sum(x-x_t)K_h(x-x_t)y_t}{s_{T,0}s_{T,2}-s_{T,1}^2}=\frac{\sum_{t=1}^Tw_ty_t}{\sum_{t=1}^Tw_t},\tag{4.25}\]
\(w_t=K_h(x-x_t)[s_{T,2}-(x-x_t)s_{T,1}]\)(分子分母化简后都可写成 \(\sum K_h(x-x_t)[s_{T,2}-(x-x_t)s_{T,1}]\times(\cdot)\))。为避免分母为零,实际用
\[\hat m(x)=\frac{\sum_{t=1}^Tw_ty_t}{\sum_{t=1}^Tw_t+1/T^2}.\tag{4.26}\]
权重满足 \(\sum(x-x_t)w_t=0\)。若只假设一阶导存在并最小化 \(\sum(y_t-a)^2K_h(x-x_t)\),得到的正是 Nadaraya–Watson 估计(局部常数)。若 \(m\) 有有界 \(k\) 阶导,可用 \(k-1\) 阶局部多项式。Fan (1993) 证明局部线性估计有重要抽样性质(如边界偏差小);带宽选择方法同上。

时间序列应用:解释变量常为滞后值,单变量时 \(x_t=m(x_{t-1})+a_t\),上述方法直接适用。多个解释变量时:核回归可用多元核,如带预设正定矩阵 \(\boldsymbol\Sigma\) 的多元正态密度

\[K_h(\mathbf x)=\frac{1}{(h\sqrt{2\pi})^p|\boldsymbol\Sigma|^{1/2}}\exp\Big(-\frac{1}{2h^2}\mathbf x'\boldsymbol\Sigma^{-1}\mathbf x\Big),\]
或单变量核之积 \(K_h(\mathbf x)=\prod_{i=1}^p\frac{0.75}{h_i}(1-\frac{x_i^2}{h_i^2})I(|x_i/h_i|<1)\)(简单,但忽略解释变量间的关系)。

例 4.6 美国 3 个月国库券周度二级市场利率(1970–1997,1461 个观测,图 4.6;文献中常用于由离散数据估计随机扩散方程,见第 6 章)。简单模型

\[y_t=\mu(x_{t-1})dt+\sigma(x_{t-1})dw_t,\]
\(x_t\) 为利率,\(y_t=x_t-x_{t-1}\),\(w_t\) 为标准布朗运动,\(\mu(\cdot)\)、\(\sigma(\cdot)\) 为光滑函数。用 R/S-Plus 的局部平滑函数 lowess(Cleveland 1979)非参数估计 \(\mu(\cdot)\) 和 \(\sigma(\cdot)\),以 \(|y_t|\) 作为波动的代理。\(\mu(x_{t-1})=E(y_t|x_{t-1})\)。图 4.7(a) 为 \(y_t\) 对 \(x_{t-1}\) 的散点及 lowess 估计,整体近乎为零;(b) 放大后可见 \(\hat\mu(x_{t-1})\) 在利率低时为正、利率高时为负——符合利率均值回复的常识(续见下文)。 图 4.7(c) 为 \(|y_t|\) 对 \(x_{t-1}\) 的散点及 lowess 估计的 \(\hat\sigma(x_{t-1})\):利率越高波动越大;(d) 放大显示 \(\hat\sigma(x_{t-1})\) 是 \(x_{t-1}\) 的增函数,且在接近 10% 时斜率加速(即"水平效应",与 CIR 等 \(\sigma\propto x^\gamma\) 模型一致)。该例说明简单非参数方法有助于理解金融序列的动态结构。R 命令:z1=read.table('w-3mtbs7097.txt',header=T);x=z1[4,1:1460]/100;y=(z1[4,2:1461]-z1[4,1:1460])/100;lines(lowess(x,y));fit=lowess(x,y);lowess(x,abs(y))。

以下非线性模型是在非参数方法帮助下提出的。

4.1.6 函数系数 AR 模型(Functional Coefficient AR Model,PDF p.218)

非参数技术使研究者能放松参数约束;非参数方法也可在初步研究中帮助选择参数非线性模型。Chen & Tsay (1993a) 的 FAR 模型:

\[x_t=f_1(\mathbf X_{t-1})x_{t-1}+\cdots+f_p(\mathbf X_{t-1})x_{t-p}+a_t,\tag{4.27}\]
\(\mathbf X_{t-1}=(x_{t-1},\dots,x_{t-k})'\),必要时可含 \(t-1\) 时可得的其他解释变量;\(f_i(\cdot)\) 几乎处处连续甚至二阶可微。前面多数非线性模型(如 TAR:\(f_i\) 为阶梯函数;STAR、EXPAR 等)都是 FAR 特例。\(\mathbf X_{t-1}\) 维数低(如标量)时可用核回归或局部线性回归估计 \(f_i\);Cai, Fan & Yao (2000) 用局部线性回归估计,显示 FAR 能显著改进 1 步预测。

4.1.7 非线性可加 AR 模型(Nonlinear Additive AR Model,PDF p.218–219)

非参数方法用于非线性时间序列的主要困难是维数灾难(curse of dimensionality):一般非线性 AR(\(p\)) \(x_t=f(x_{t-1},\dots,x_{t-p})+a_t\) 需 \(p\) 维平滑,\(p\) 大而样本不大时很难。简单有效的办法是可加模型,NAAR:

\[x_t=f_0(t)+\sum_{i=1}^pf_i(x_{t-i})+a_t,\tag{4.28}\]
\(f_i\) 几乎处处连续,每个只有一个自变量,可用一维平滑估计,避免维数灾难。估计采用迭代法:在给定其他 \(f_j\)(\(j\ne i\))估计的条件下非参数估计 \(f_i\)(backfitting 思想),见 Chen & Tsay (1993b)。可加性假设较强,需仔细检验;Chen, Liu & Tsay (1995) 给出可加性检验统计量。

4.1.8 非线性状态空间模型(Nonlinear State-Space Model,PDF p.219)

借助 MCMC(Gelfand & Smith 1990),Carlin, Polson & Stoffer (1992) 提出非线性状态空间的蒙特卡洛方法:

\[S_t=f_t(S_{t-1})+u_t,\qquad x_t=g_t(S_t)+v_t,\tag{4.29}\]
\(S_t\) 为状态向量,\(f_t,g_t\) 为依赖未知参数的已知函数,\(\{u_t\}\) 为零均值、协方差 \(\boldsymbol\Sigma_u\)(非负定)的 iid 随机向量,\(\{v_t\}\) 为零均值方差 \(\sigma_v^2\) 的 iid,两者独立。非线性系统需要 \(S_t|S_{t-1}\) 的完整条件分布,故用蒙特卡洛处理状态转移。Kitagawa (1998) 等考虑了其他数值平滑方法。MCMC 等计算密集方法是非线性时间序列的强大工具,潜力尚未充分发掘;但要求已知 \(f_t,g_t\) 可能限制实用,可先用 FAR、NAAR 等非参数分析来设定 \(f_t,g_t\)。

4.1.9 神经网络(Neural Networks,PDF p.219–225)

神经网络可视为半参数方法,文献极多、应用广泛但成效不一(Ripley 1993 第 2 节列应用、第 10 节评论金融应用;Cheng & Titterington 1994 从统计角度介绍)。只讨论前馈神经网络(feed-forward neural networks):输入连到输入层节点(神经元),逐层向前连接直到输出层。图 4.8:单变量时间序列用的单隐层网络,输入层 2 个节点、隐层 3 个,每个输入节点连到每个隐节点,隐节点连到单个输出节点,记为 2–3–1 网络。有反馈连接的更复杂网络也存在,但与本书最相关的是前馈网络。

前馈网络:信息经激活函数(activation function)逐层传递。单隐层中第 \(j\) 个隐节点

\[h_j=f_j\Big(\alpha_{0j}+\sum_{i\to j}w_{ij}x_i\Big),\tag{4.30}\]
\(x_i\) 为第 \(i\) 个输入,\(f_j\) 常取 logistic \(f_j(z)=\frac{\exp(z)}{1+\exp(z)}\),\(\alpha_{0j}\) 称偏置(bias),\(w_{ij}\) 为权重,\(i\to j\) 表示对所有连到 \(j\) 的输入节点求和。2–3–1 网络中
\[h_j=\frac{\exp(\alpha_{0j}+w_{1j}x_1+w_{2j}x_2)}{1+\exp(\alpha_{0j}+w_{1j}x_1+w_{2j}x_2)},\quad j=1,2,3.\tag{4.31}\]
输出节点
\[o=f_o\Big(\alpha_{0o}+\sum_{j\to o}w_{jo}h_j\Big),\tag{4.32}\]
\(f_o\) 为线性或 Heaviside 函数。线性时 \(o=\alpha_{0o}+\sum_{j=1}^kw_{jo}h_j\)(\(k\) 为隐节点数);Heaviside 函数 \(f_o(z)=1\)(\(z>0\))否则 0,这种神经元称门限神经元(threshold neuron),1 表示神经元"激发"。合并各层:
\[o=f_o\Big[\alpha_{0o}+\sum_{j\to o}w_{jo}f_j\Big(\alpha_{0j}+\sum_{i\to j}w_{ij}x_i\Big)\Big].\tag{4.33}\]
允许输入层直连输出层:
\[o=f_o\Big[\alpha_{0o}+\sum_{i\to o}\alpha_{io}x_i+\sum_{j\to o}w_{jo}f_j\Big(\alpha_{0j}+\sum_{i\to j}w_{ij}x_i\Big)\Big].\tag{4.34}\]
输出激活为线性时,直连部分表示输入与输出的线性关系,故 (4.34) 是线性模型的推广。2–3–1 网络线性输出:(4.33) 有 13 个参数(隐层 3×3=9,输出层 1+3=4);(4.34) 加两个直连系数共 15 个参数。

(4.33)/(4.34) 称半参数函数:函数形式已知,但节点数、偏置、权重未知。(4.34) 可跳过隐层,称跳层前馈网络(skip-layer feed-forward network)。前馈网络在神经网络文献中称多层感知器(multilayer perceptrons);增加隐节点数可在紧集上一致逼近任意连续函数(Hornik, Stinchcombe & White 1989;Hornik 1993;Chen & Chen 1995),即万能逼近性质(universal approximation property)。简言之,单隐层前馈网络是参数化一般连续非线性函数的一种方式。

训练与预测:两步——训练(确定节点数、估计偏置与权重)与推断(尤其预测)。训练阶段常把数据分为两个不重叠子样本:第一个估计给定网络的参数,第二个计算预测精度,选预测表现最好的网络——即交叉验证思想(也有其他模型选择方法)。时间序列中,数据 \(\{(r_t,\mathbf x_t)\}\),\(\mathbf x_t\) 为输入向量,\(o_t\) 为网络输出,训练即选择偏置与权重最小化拟合准则,如最小二乘

\[S^2=\sum_{t=1}^T(r_t-o_t)^2,\]
这是非线性估计问题,可用迭代法求解;可加约束以保证拟合函数光滑(正则化)。常用反向传播(back propagation, BP)学习算法(Bryson & Ho 1969):从输出层向后,用梯度规则迭代修改偏置与权重(推导见 Ripley 1993 附录 2A)。

例 4.7 IBM 月对数收益(百分比,含分红,1926-01—1999-12):前 864 个观测(1926–1997)建模。(4.34) 型 3–2–1 网络,输入 \(r_{t-1},r_{t-2},r_{t-3}\):

\[\hat r_t=3.22-1.81f_1(\mathbf r_{t-1})-2.28f_2(\mathbf r_{t-1})-0.09r_{t-1}-0.05r_{t-2}-0.12r_{t-3},\tag{4.35}\]
\[f_1=\frac{\exp(-8.34-18.97r_{t-1}+2.17r_{t-2}-19.17r_{t-3})}{1+\exp(\cdot)},\quad f_2=\frac{\exp(39.25-22.17r_{t-1}-17.34r_{t-2}-5.98r_{t-3})}{1+\exp(\cdot)},\]
残差标准误 6.56。对比 AR 模型
\[r_t=1.101+0.077r_{t-1}+a_t,\quad\sigma_a=6.61,\tag{4.36}\]
残差标准误略大。样本外比较(1998–1999 月收益作为第二子样本,1 步预测的均方预测误差 MSFE):基准为第一子样本均值(对数价格为带漂移随机游走)MSFE=91.85;AR(1) 为 91.70(略优于基准);3–2–1 网络为 91.74,与 AR(1) 基本相同。注:用 S-Plus 的 nnet 包(默认初始权重,Venables & Ripley 1999)估计,结果随初值而变:3–2–1 网络样本外 MSE 可低至 89.46、高至 93.65;改变隐节点数范围更宽。命令见附录 B。

例 4.8 方向预测:输出层用 Heaviside 激活预测 IBM 涨跌方向。方向变量 \(d_t=1\)(\(r_t\ge0\))否则 0。8 个输入(\(r_t\) 与 \(d_t\) 各前 4 个滞后),4 个隐节点,8–4–1 网络(49 个参数),在第一子样本训练,对第二子样本计算下月上涨概率的 1 步预测(图 4.9,0.5 水平线;圆圈为实际方向)。按概率 \(\ge0.5\) 判为上涨,成功率 0.58,但每次估计差异很大。模拟 500 次:预测错误数(共 24 个月)均值 11.28、中位数 11、最大 18、最小 4。对照带漂移随机游走 \(\hat d_t=1\) 若 \(\hat r_t=1.19+\epsilon_t\ge0\)(1.19 为 1926–1997 平均月对数收益,\(\epsilon_t\) iid \(N(0,1)\)),500 次模拟错误数均值 10.53、中位数 11、最大 17、最小 5。图 4.10 两者错误数直方图。结论:8–4–1 神经网络并不优于带漂移随机游走。

4.2 非线性检验(Nonlinearity Tests,PDF p.225–232,续见下一块)

本节讨论对 4.1 节非线性模型有一定功效的检验,包括参数与非参数统计量。非参数:残差平方的 Ljung–Box、双谱检验、BDS 检验;参数(依赖特定参数函数):RESET(Ramsey 1969)、Tsay (1986, 1989) 的 F 检验以及其他 LM、似然比检验。非线性可能以多种方式出现,不存在在所有情形下都占优的检验。

4.2.1 非参数检验(Nonparametric Tests,PDF p.226–229)

基本思想:在线性原假设下,正确设定的线性模型残差应独立,任何独立性破坏都提示模型不足(包括线性假设)。部分检验专门检查二次形式的违背。

残差平方的 Q 统计量(McLeod & Li 1983):对 ARMA(\(p,q\)) 残差平方

\[Q(m)=T(T+2)\sum_{i=1}^m\frac{\hat\rho_i^2(a_t^2)}{T-i},\]
模型充分时渐近 \(\chi^2_{m-p-q}\)。可检测 \(a_t\) 的条件异方差,渐近等价于 Engle (1982) 的 ARCH LM 检验(3.4.3 节),原假设 \(H_0:\beta_1=\cdots=\beta_m=0\)(回归 \(a_t^2=\beta_0+\beta_1a_{t-1}^2+\cdots+\beta_ma_{t-m}^2+e_t\))。因用残差计算,自由度为 \(m-p-q\)。

双谱检验(bispectral test):可同时检验线性与高斯性。依据:线性序列适当标准化的双谱在所有频率上为常数,正态时该常数为零。双谱是三阶矩的 Fourier 变换。对 (4.1) 的平稳序列,三阶矩

\[c(u,v)=g\sum_{k=-\infty}^\infty\psi_k\psi_{k+u}\psi_{k+v},\tag{4.37}\]
\(g=E(a_t^3)\),\(\psi_0=1\),\(k<0\) 时 \(\psi_k=0\)。Fourier 变换
\[b_3(w_1,w_2)=\frac{g}{4\pi^2}\Gamma[-(w_1+w_2)]\Gamma(w_1)\Gamma(w_2),\tag{4.38}\]
\(\Gamma(w)=\sum_{u=0}^\infty\psi_u\exp(-iwu)\)。谱密度 \(p(w)=\frac{\sigma_a^2}{2\pi}|\Gamma(w)|^2\)。故
\[b(w_1,w_2)=\frac{|b_3(w_1,w_2)|^2}{p(w_1)p(w_2)p(w_1+w_2)}=\text{常数(对所有 }(w_1,w_2)).\tag{4.39}\]
检验在适当网格上估计 \(b(w_1,w_2)\),用类似 Hotelling \(T^2\) 的统计量检验其恒定性。线性高斯序列 \(g=0\),双谱处处为零。详见 Priestley (1988)、Subba Rao & Gabr (1984)、Hinich (1982);经验上样本大时功效尚可。

BDS 统计量(Brock, Dechert & Scheinkman 1987):检验 iid 假设,不同于只关注二阶或三阶性质的检验。利用混沌时间序列分析中的关联积分(correlation integral)。对 \(k\) 维序列 \(\mathbf X_t\)(\(T_k\) 个观测):

\[C_k(\delta)=\lim_{T_k\to\infty}\frac{2}{T_k(T_k-1)}\sum_{i<j}I_\delta(\mathbf X_i,\mathbf X_j),\tag{4.40}\]
\(I_\delta(\mathbf u,\mathbf v)=1\) 若 \(\|\mathbf u-\mathbf v\|<\delta\)(上确界范数),否则 0;即距离在 \(\delta\) 内的点对比例。对 \(x_t\) 构造 \(k\)-历史(\(k\) histories)\(\mathbf X_t^k=(x_t,x_{t+1},\dots,x_{t+k-1})'\)。若 \(x_t\) iid,\(k\)-历史在 \(k\) 维空间中无模式,故 \(C_k(\delta)=[C_1(\delta)]^k\),偏离说明非 iid。直观例:\([0,1]\) 上 iid 均匀分布,2-历史落入 \([a,b]\times[a,b]\) 的期望数应等于 \(x_t\) 落入 \([a,b]\) 期望数的平方。样本版本
\[C_\ell(\delta,T)=\frac{2}{T_k(T_k-1)}\sum_{i<j}I_\delta(\mathbf X_i^*,\mathbf X_j^*),\quad\ell=1,k,\]
\(T_\ell=T-\ell+1\),\(\ell=1\) 时 \(\mathbf X_i^*=x_i\),\(\ell=k\) 时为 \(\mathbf X_i^k\)。在 \(x_t\) iid 且分布非退化原假设下,\(C_k(\delta,T)\to[C_1(\delta)]^k\)(a.s.),且 \(\sqrt T\{C_k(\delta,T)-[C_1(\delta,T)]^k\}\) 渐近正态,均值 0,方差
\[\sigma_k^2(\delta)=4\Big[N^k+2\sum_{j=1}^{k-1}N^{k-j}C^{2j}+(k-1)^2C^{2k}-k^2NC^{2k-2}\Big],\]
\(C=\int[F(z+\delta)-F(z-\delta)]dF(z)\),\(N=\int[F(z+\delta)-F(z-\delta)]^2dF(z)\)(原文 \(N_k\)、\(N_{k-j}\) 应为幂次 \(N^k\)、\(N^{k-j}\))。\(C_1(\delta,T)\) 一致估计 \(C\),\(N\) 由 \(N(\delta,T)=\frac{6}{T_k(T_k-1)(T_k-2)}\sum_{t<s<u}I_\delta(x_t,x_s)I_\delta(x_s,x_u)\) 一致估计。BDS 统计量
\[D_k(\delta,T)=\frac{\sqrt T\{C_k(\delta,T)-[C_1(\delta,T)]^k\}}{\sigma_k(\delta,T)}\ \xrightarrow{d}\ N(0,1).\tag{4.41}\]
应用见 Hsieh (1989)、Brock, Hsieh & LeBaron (1991)。实践中应先去除线性相依再做 BDS;检验可能对 \(\delta\) 与 \(k\) 的选择敏感,\(k\) 大时尤甚。

4.2.2 参数检验(Parametric Tests,PDF p.229–232,续见下一块)

RESET 检验(Ramsey 1969):线性 LS 回归的设定检验,可直接用于线性 AR。线性 AR(\(p\)):

\[x_t=\mathbf X_{t-1}'\boldsymbol\phi+a_t,\tag{4.42}\]
\(\mathbf X_{t-1}=(1,x_{t-1},\dots,x_{t-p})'\),\(\boldsymbol\phi=(\phi_0,\dots,\phi_p)'\)。第一步:LS 估计得拟合 \(\hat x_t=\mathbf X_{t-1}'\hat{\boldsymbol\phi}\)、残差 \(\hat a_t\)、\(SSR_0=\sum_{t=p+1}^T\hat a_t^2\)。第二步:回归
\[\hat a_t=\mathbf X_{t-1}'\boldsymbol\alpha_1+\mathbf M_{t-1}'\boldsymbol\alpha_2+v_t,\tag{4.43}\]
\(\mathbf M_{t-1}=(\hat x_t^2,\dots,\hat x_t^{s+1})'\)(\(s\ge1\)),得残差 \(\hat v_t\) 与 \(SSR_1=\sum\hat v_t^2\)。若线性 AR 充分,\(\boldsymbol\alpha_1,\boldsymbol\alpha_2\) 应为零,用
\[F=\frac{(SSR_0-SSR_1)/g}{SSR_1/(T-p-g)},\quad g=s+p+1,\tag{4.44}\]
在线性与正态假设下服从 \(F(g,T-p-g)\)。注:\(\hat x_t^k\) 之间以及与 \(\mathbf X_{t-1}\) 高度相关,常用 \(\mathbf M_{t-1}\) 中与 \(\mathbf X_{t-1}\) 不共线的主成分拟合 (4.43)(主成分分析见后续章节)。

Keenan (1985) 检验:只用 \(\hat x_t^2\),并把第二步分为两步以避免与 \(\mathbf X_{t-1}\) 的多重共线:(2a) 回归 \(\hat x_t^2=\mathbf X_{t-1}'\boldsymbol\beta+u_t\) 得残差 \(\hat u_t\)(去除对 \(\mathbf X_{t-1}\) 的线性依赖);(2b) 回归 \(\hat a_t=\hat u_t\alpha+v_t\),用 \(SSR_1=\sum(\hat a_t-\hat u_t\hat\alpha)^2\) 检验 \(\alpha=0\)。

F 检验(Ori-F)(Tsay 1986):为提高 Keenan 与 RESET 的功效,取 \(\mathbf M_{t-1}=\operatorname{vech}(\mathbf X_{t-1}\mathbf X_{t-1}')\)——矩阵对角线及以下元素的半堆叠向量,即所有二次项与交叉项;如 \(p=2\) 时 \(\mathbf M_{t-1}=(x_{t-1}^2,x_{t-1}x_{t-2},x_{t-2}^2)'\),维数 \(p(p+1)/2\)。实际就是在回归 \(x_t=\mathbf X_{t-1}'\boldsymbol\phi+\mathbf M_{t-1}'\boldsymbol\alpha+e_t\) 中检验 \(\boldsymbol\alpha=0\) 的偏 F 统计量,线性 AR(\(p\)) 下服从 \(F(g,T-p-g-1)\),\(g=p(p+1)/2\)。Luukkonen, Saikkonen & Teräsvirta (1988) 进一步加入三次项 \(x_{t-i}^3\)。

门限检验(threshold test):备择为 SETAR 时可构造专门检验提高功效。两种思路:似然比检验,以及把门限非线性转化为模型变点检测。设备择为门限变量 \(x_{t-d}\) 的两区制 SETAR。\(H_0\):

\[x_t=\phi_0+\sum_{i=1}^p\phi_ix_{t-i}+a_t;\tag{4.45}\]
\(H_a\):
\[x_t=\begin{cases}\phi_0^{(1)}+\sum_{i=1}^p\phi_i^{(1)}x_{t-i}+a_{1t},&x_{t-d}<r_1\\\phi_0^{(2)}+\sum_{i=1}^p\phi_i^{(2)}x_{t-i}+a_{2t},&x_{t-d}\ge r_1\end{cases}\tag{4.46}\]

  • 似然比:正态下 \(l_0(\hat{\boldsymbol\phi},\hat\sigma_a^2)\) 易算;给定 \(r_1\) 时备择下 \(l_1(r_1;\hat{\boldsymbol\phi}_1,\hat\sigma_1^2;\hat{\boldsymbol\phi}_2,\hat\sigma_2^2)\) 也易算,对数似然比 \(l(r_1)=l_1-l_0\) 是未知 \(r_1\) 的函数。但原假设下无门限,\(r_1\) 无定义——称原假设下的冗余参数(nuisance parameter),故似然比渐近分布与常规情形很不同(Chan 1991 给出细节与临界值)。常用 \(l_{\max}=\sup_{v<r_1<u}l(r_1)\)(\(v,u\) 为预设上下界),也可用 \(l(r_1)\) 在 \([v,u]\) 上的平均(Andrews & Ploberger 1994);相关理论见 Davis (1987)、Andrews & Ploberger (1994);临界值依赖 \(v,u\),常由模拟获得。
  • Tsay (1989) 排序自回归检验:利用排序自回归(arranged autoregression)与递归估计,把 SETAR 转化为以门限 \(r_1\) 为变点的模型变化问题。\(x_{t-d}\) 取值 \(\{x_1,\dots,x_{T-d}\}\),令 \(x_{(1)}\le\cdots\le x_{(T-d)}\) 为顺序统计量,SETAR 可写为
    \[x_{(j)+d}=\beta_0+\sum_{i=1}^p\beta_ix_{(j)+d-i}+a_{(j)+d},\quad j=1,\dots,T-d,\tag{4.47}\]
    \(x_{(j)}<r_1\) 时 \(\beta_i=\phi_i^{(1)}\),否则 \(\beta_i=\phi_i^{(2)}\),故 \(r_1\) 是该线性回归的变点。排序不改变 \(x_t\) 对 \(x_{t-i}\) 的动态依赖,只是把模型从时间空间改为门限空间呈现(\(x_{t-d}\) 小的方程排在前面)。步骤:
    1. 用 \(j=1,\dots,m\)(如 \(m=30\))拟合 (4.47),得 LS 估计 \(\hat\beta_{i,m}\);
    2. 计算预测残差 \(\hat a_{(m+1)+d}=x_{(m+1)+d}-\hat\beta_{0,m}-\sum_{i=1}^p\hat\beta_{i,m}x_{(m+1)+d-i}\) 及其标准误,得标准化预测残差 \(\hat e_{(m+1)+d}\);
    3. 用递归最小二乘把新数据点纳入,更新为 \(\hat\beta_{i,m+1}\);
    4. 重复 2、3 直到处理完所有数据;
    5. 回归 \(\hat e_{(m+j)+d}=\alpha_0+\sum_{i=1}^p\alpha_ix_{(m+j)+d-i}+v_t\)(\(j=1,\dots,T-d-m\))(4.48),计算检验 \(\alpha_i=0\ (i=0,\dots,p)\) 的常规 F 统计量。在 \(x_t\) 为线性 AR(\(p\)) 的原假设下……(本块至 PDF p.232 截止,F 统计量的分布及其后内容续见下一块)

注:第 4 章在本块内未结束(剩余 4.2.2 后半、4.2.3 应用、4.3 建模、4.4 预测、4.5 应用、附录、习题),故第 4 章的「本章要点」「与量化交易的关联」「推荐习题」由下一块负责撰写。本块已覆盖的第 4 章内容要点:线性/非线性定义与均值非线性、方差非线性的区分;双线性、TAR/SETAR(几何遍历条件、不可时间反转、均值非零)、TAR-GARCH、STAR、马尔可夫转换(期望持续期 \(1/w_i\)、与 SETAR 的预测差异);核回归、带宽选择、局部线性回归、FAR、NAAR、非线性状态空间、前馈神经网络(及其在 IBM 收益与方向预测上未胜过随机游走的实证);McLeod–Li、双谱、BDS、RESET、Keenan、Ori-F 与门限检验。对量化交易而言,这部分直接对应:区制识别(牛熊/危机状态的马尔可夫转换、门限模型)、波动不对称建模(TAR-GARCH、STAR 波动)、非参数/机器学习信号的过拟合风险(例 4.7、4.8 说明复杂模型在样本外未必胜过朴素基准,需以随机游走等基准做严格样本外比较并考察估计随初值的波动),以及用 BDS/RESET/Tsay F 检验判断线性模型残差中是否仍有可利用的非线性结构。