元信息:《Analysis of Financial Time Series》第 3 版,Ruey S. Tsay(Wiley, 2010);本笔记负责 PDF 第 1–232 页(前置部分书页 i–xxiii;第 1–3 章完整;第 4 章至 4.2.2 节门限检验中途,即书页 175–212)。
Tsay《金融时间序列分析》精读笔记(PDF p.1–232)
前置部分(PDF p.1–20)
- p.1 封面 / p.2 版权页:第 3 版,作者 Ruey S. Tsay(芝加哥大学 Booth 商学院),Wiley 2010,ISBN 978-0-470-41435-4,属 Wiley 概率统计丛书。
- p.3–11 目录:全书 12 章:1 金融时间序列及其特征;2 线性时间序列分析;3 条件异方差模型;4 非线性模型;5 高频数据与市场微观结构;6 连续时间模型(Ito 引理、Black–Scholes、跳扩散);7 极值、分位数与 VaR;8 多元时间序列(VAR、协整、配对交易);9 主成分分析与因子模型;10 多元波动率模型;11 状态空间模型与 Kalman 滤波;12 MCMC 方法。
- p.13–14 第 3 版前言:修订动机是 2008 年金融危机;目标是更新数据、加入 R(Rmetrics、FinTS 包)命令。新增内容:第 3 章偏态分布用于波动率建模;第 5 章高频交易数据新性质与非线性久期模型;第 7 章以损失函数统一 VaR、引入期望损失 ES(即 CVaR)和极值指数(extremal index,处理极值的聚集/相依);第 8 章协整用于配对交易;第 10 章动态相关模型。作者说明不涉及信用风险和操作风险。书网站 faculty.chicagobooth.edu/ruey.tsay/teaching/fts3。
- p.15–16 第 2 版前言:提到 2003 年诺贝尔奖(Engle、Granger);新增第 9 章(PCA 与因子模型)、第 11 章(状态空间与 Kalman 滤波);第 2 章加入单位根检验与异方差/序列相关下的一致协方差估计;第 3 章加入高频数据与日内高低价的波动率估计;第 12 章加入前向滤波后向抽样(FFBS)估计随机波动率。
- p.17–19 第 1 版前言:本书源于芝大 MBA 课程。特色:结合实证数据、涵盖 VaR、高频数据、MCMC。软件:SCA(线性模型)、RATS(波动率模型)、S-Plus(神经网络)。建议 MBA 课程以第 2、3 章为核心。
- p.12、p.20 为空白页。
第 1 章 金融时间序列及其特征(Financial Time Series and Their Characteristics,PDF p.21–47)
章首导言(PDF p.21–22)
金融时间序列分析研究资产随时间的估值(asset valuation over time)。它与一般时间序列分析的关键区别是:金融理论本身及其实证序列都含有不确定性,例如波动率(volatility)有多种定义且不可直接观测,因此统计理论和方法特别重要。导言随后逐章概述全书(见上文目录),强调全书以真实数据和实证分析为主,并给出程序代码。
1.1 资产收益率(Asset Returns,PDF p.22–26)
为什么用收益率而非价格(Campbell, Lo & MacKinlay 1997):(1) 收益率是投资机会的完整且无量纲(scale-free)的概括;(2) 收益率序列统计性质更好(如更接近平稳)。
设 \(P_t\) 为 \(t\) 时刻资产价格,暂不考虑分红。
单期简单收益率(one-period simple return):简单总收益率(gross return)
多期简单收益率:持有 \(k\) 期的总收益率是各单期总收益率之积(复合收益率,compound return):
连续复利(continuous compounding):年利率 10%、本金 1 美元,一年付息 \(m\) 次则年末净值为 \((1+0.1/m)^m\)。表 1.1:年付 1.10000,半年 1.10250,季度 1.10381,月 1.10471,周 1.10506,日 1.10516,连续 \(e^{0.1}=1.10517\)。一般地
连续复利收益率 / 对数收益率(continuously compounded return, log return):
组合收益率(portfolio return):权重 \(w_i\)(投入资产 \(i\) 的价值比例)时,组合简单收益率是加权平均 \(R_{p,t}=\sum_{i=1}^N w_iR_{it}\);但对数收益率无此性质,仅在收益率很小时近似 \(r_{p,t}\approx\sum w_i r_{it}\)。常见误区:直接用对数收益率加权得到组合收益,在大波动时有误差。
分红(dividend payment):\(D_t\) 为 \(t-1\) 到 \(t\) 间分红,\(P_t\) 不含分红,则
超额收益率(excess return):相对参考资产(常取短期美国国债 T-bill)的收益差:
注(多空头寸):多头(long)指持有资产;空头(short)指借入资产卖出,日后须买回同样股数归还,因此价格下跌对空头有利;持有空头期间若发放现金分红,空头须自掏腰包向出借方支付等额分红。
关系汇总:\(r_t=\ln(1+R_t)\),\(R_t=e^{r_t}-1\);若以百分比表示,\(r_t=100\ln(1+R_t/100)\),\(R_t=100(e^{r_t/100}-1)\)。时间聚合:简单总收益率相乘,对数收益率相加。
例 1.1:月对数收益率 4.46% 对应简单收益率 \(100[\exp(0.0446)-1]=4.56\%\);一季度内三个月对数收益率 4.46%、−7.34%、10.77%,则季度对数收益率为 \(4.46-7.34+10.77=7.89\%\)。
1.2 收益率的分布性质(Distributional Properties of Returns,PDF p.27–41)
研究对象:\(N\) 个资产、\(T\) 期的对数收益率 \(\{r_{it}\}\),也可是简单收益率 \(\{R_{it}\}\) 或对数超额收益率 \(\{z_{it}\}\)。目标是理解收益率在资产间和时间上的行为。
1.2.1 统计分布及其矩的回顾(PDF p.27–33)
联合分布(joint distribution):\(F_{X,Y}(x,y;\theta)=P(X\le x,Y\le y;\theta)\)(不等号逐分量),若联合密度存在则 \(F=\int_{-\infty}^x\int_{-\infty}^y f(w,z;\theta)\,dz\,dw\)。
边际分布(marginal distribution):\(F_X(x;\theta)=F_{X,Y}(x,\infty,\dots,\infty;\theta)\),即积分掉 \(Y\)。标量情形即累积分布函数 CDF,单调不减,\(F(-\infty)=0\),\(F(\infty)=1\)。分位数(quantile):\(x_p=\inf_x\{x\,|\,p\le F_X(x)\}\) 为第 \(100p\) 百分位数(后文 VaR 即基于此)。
条件分布(conditional distribution):\(F_{X|Y\le y}(x)=P(X\le x,Y\le y)/P(Y\le y)\);条件密度
矩(moments):第 \(\ell\) 阶原点矩 \(m'_\ell=E(X^\ell)\),中心矩 \(m_\ell=E[(X-\mu_x)^\ell]\)。一阶矩为均值 \(\mu_x\),二阶中心矩为方差 \(\sigma_x^2\)。正态分布由前两阶矩唯一确定。
偏度与峰度(skewness, kurtosis):
样本估计:
正态性检验:正态假设下 \(\hat S\) 与 \(\hat K-3\) 渐近服从均值 0、方差分别为 \(6/T\) 与 \(24/T\) 的正态分布。
- 偏度检验:\(H_0:S(r)=0\),\(t=\hat S(r)/\sqrt{6/T}\),\(|t|>Z_{\alpha/2}\) 时拒绝。
- 峰度检验:\(H_0:K(r)-3=0\),\(t=(\hat K(r)-3)/\sqrt{24/T}\)。
- Jarque–Bera 检验(1987):
\[JB=\frac{\hat S^2(r)}{6/T}+\frac{[\hat K(r)-3]^2}{24/T}\ \xrightarrow{d}\ \chi^2_2,\]p 值小于显著性水平则拒绝正态。
例 1.2:IBM 日简单收益率(数据文件 d-ibm3dx7008.txt,1970-01-02 起,\(T=9845\))。注意 R 中 kurtosis 输出的是超额峰度。超额峰度很高,表明厚尾。偏度检验 \(t=0.0614/\sqrt{6/9845}=0.0614/0.0247=2.49\),p 值约 0.013,5% 水平下显著右偏。
表 1.2(PDF p.31)选定指数与个股日/月简单及对数收益率描述统计(百分比,样本截至 2008-12-31;SP=S&P 综合指数,VW/EW=CRSP 市值/等权指数)。代表性数字(均值 / 标准差 / 偏度 / 超额峰度 / 最小 / 最大):
- 日简单收益:SP 0.029/1.056/−0.73/22.81/−20.47/11.58;IBM 0.040/1.693/0.06/9.92/−22.96/13.16;Intel 0.108/2.891/−0.15/6.13;Microsoft 0.123/2.359;Citi-Grp 0.067/2.602/1.80/55.25/−26.41/57.82。
- 日对数收益:SP 0.023/1.062/−1.17/30.20/−22.90/10.96;IBM 0.026/1.694/−0.27/12.17。
- 月简单收益(1926-01 起 996 个月):SP 0.58/5.53/0.32/9.47;VW 0.89/5.43;EW 1.22/7.40/1.52/14.94;IBM 1.35/7.15/0.44/3.43。
- 月对数收益:SP 0.43/5.54/−0.52/7.93;IBM 1.09/7.03/−0.07/2.62;Intel 1.39/12.80,最小 −59.54。
R 演示(PDF p.32–34):library(fBasics);da=read.table("d-ibm3dx7008.txt",header=T)(列:Date, rtn, vwretd, ewretd, sprtrn);basicStats(sibm) 给出样本量、缺失值、最小/最大、四分位、均值 0.0402、中位数 0、均值标准误 0.0171、均值 95% 置信区间 [0.0067, 0.0736]、方差 2.865、标准差 1.693、偏度 0.0614、超额峰度 9.916。偏度检验 t1=s1/sqrt(6/9845)=2.487,pv=2*(1-pnorm(t1))=0.0129。对数收益 libm=log(ibm+1)*100,t.test(libm) 得 \(t=1.5126\),p=0.1304,即不能拒绝期望收益为零;normalTest(libm,method='jb') 得 JB=60921.9,p<2.2e-16,强烈拒绝正态。S-Plus(FinMetrics 模块)用 summaryStats,注意 S-Plus 的 kurtosis 是普通峰度(未减 3),故显示 12.92。
1.2.2 收益率的分布(Distributions of Returns,PDF p.34–38)
最一般模型:所有资产所有时期对数收益率的联合分布
离散性:高频收益率不连续,NYSE 价格按最小报价单位(tick size)变动:1997 年 7 月前为 1/8 美元,1997-07 至 2001-01 为 1/16 美元。注:2000-08-28 NYSE 以 7 只股票试点十进制报价,AMEX 6 只股票及 2 类期权;2000-09-25、2000-12-04 NYSE 分别增加 57、94 只;2001-01-29 起 NYSE 与 AMEX 全部改为十进制。第 5 章再讨论。
条件分布比边际分布更重要,但边际分布更易估计;且很多资产收益序列相关很弱,边际分布接近条件分布。文献中提出的边际分布:
- 正态分布:传统假设简单收益 \(R_{it}\) iid 正态。困难:(a) 简单收益下界为 −1,正态无下界;(b) 若单期 \(R_{it}\) 正态,多期 \(R_{it}[k]\) 是乘积,不再正态;(c) 实证收益率普遍有正超额峰度。
- 对数正态分布(lognormal):设 \(r_t\) iid \(N(\mu,\sigma^2)\),则简单收益为对数正态:
\[E(R_t)=\exp\Big(\mu+\frac{\sigma^2}{2}\Big)-1,\qquad \operatorname{Var}(R_t)=\exp(2\mu+\sigma^2)[\exp(\sigma^2)-1].\tag{1.17}\]反之,若 \(R_t\) 的均值 \(m_1\)、方差 \(m_2\),则\[E(r_t)=\ln\Big[\frac{m_1+1}{\sqrt{1+m_2/(1+m_1)^2}}\Big],\qquad \operatorname{Var}(r_t)=\ln\Big[1+\frac{m_2}{(1+m_1)^2}\Big].\]优点:\(r_t[k]\) 仍正态,\(1+R_t=e^{r_t}\) 自动满足下界;缺点:仍无法解释正超额峰度。(1.17) 在用对数收益模型预测简单收益时有用(注意 \(E(R_t)\neq e^{\mu}-1\),要加 \(\sigma^2/2\) 修正)。
- 稳定分布(stable distribution):对加法封闭,适合对数收益的时间聚合,能刻画超额峰度;但非正态稳定分布方差无穷,与多数金融理论冲突,统计建模也困难。例:Cauchy 分布,关于中位数对称、方差无穷,密度 \(f(x)=\frac{1}{\pi(1+x^2)}\)。
- 正态尺度混合(scale mixture of normals):\(r_t\sim N(\mu,\sigma^2)\) 但 \(\sigma^2\) 随机(如 \(\sigma^{-2}\) 服从 Gamma 分布)。有限混合例:\(r_t\sim(1-X)N(\mu,\sigma_1^2)+XN(\mu,\sigma_2^2)\),\(X\) 为 Bernoulli,\(P(X=1)=\alpha\),\(\sigma_1^2\) 小、\(\sigma_2^2\) 大。如 \(\alpha=0.05\) 表示 95% 的收益来自"平静"正态,5% 来自"剧烈"正态,从而尾部更厚。优点:保持正态的易处理性、高阶矩有限、能刻画超额峰度;缺点:混合参数(如 \(\alpha\))难估计。
图 1.1:比较标准正态、Cauchy 与有限混合 \((1-X)N(0,1)+XN(0,16)\)(\(P(X=1)=0.05\))的密度:Cauchy 尾最厚,混合正态次之,标准正态最薄。
1.2.3 多元收益率(Multivariate Returns,PDF p.38–39)
\(\mathbf r_t=(r_{1t},\dots,r_{Nt})'\)。第 8、10 章研究 \(\{\mathbf r_t\}\) 的联合分布,同样按 (1.15) 分解,重点是条件均值与条件协方差矩阵如何随时间演化。均值向量 \(E(\mathbf X)=\boldsymbol\mu_x\),协方差矩阵 \(\operatorname{Cov}(\mathbf X)=\boldsymbol\Sigma_x=E[(\mathbf X-\boldsymbol\mu_x)(\mathbf X-\boldsymbol\mu_x)']\);样本估计 \(\hat{\boldsymbol\mu}_x=\frac1T\sum\mathbf x_t\),\(\hat{\boldsymbol\Sigma}_x=\frac1{T-1}\sum(\mathbf x_t-\hat{\boldsymbol\mu}_x)(\mathbf x_t-\hat{\boldsymbol\mu}_x)'\),协方差存在时为一致估计。金融文献常假设 \(\mathbf r_t\) 多元正态。
1.2.4 收益率的似然函数(Likelihood Function of Returns,PDF p.39)
若条件分布 \(f(r_t|r_{t-1},\dots,r_1,\theta)\) 为均值 \(\mu_t\)、方差 \(\sigma_t^2\) 的正态,则
1.2.5 收益率的实证性质(Empirical Properties of Returns,PDF p.39–42)
数据来自芝大 CRSP,收益含分红。图 1.2、1.3:IBM 与 VW 指数 1926-01—2008-12 月度简单与对数收益时序图,两者形态相似。由表 1.2 得出:(a) 日收益(指数与个股)超额峰度高;月度上指数的超额峰度高于个股;(b) 日收益均值接近 0,月收益均值略大;(c) 月收益标准差大于日收益;(d) 日收益中指数标准差小于个股(分散化);(e) 偏度不是严重问题;(f) 简单收益与对数收益差别不大。图 1.4:IBM 月收益经验密度与同均值同方差的正态密度比较——经验密度峰更高、更瘦,但尾部更厚、支撑更宽(尖峰厚尾)。
1.3 本书考虑的过程(Processes Considered,PDF p.42–44)
除收益率外还研究:
- 波动率过程(volatility process):条件方差随时间的演化。图 1.2、1.3 显示收益的变异性随时间变化且成簇出现(波动聚集),波动率在期权定价和风险管理中关键。
- 极端收益:大的正负收益。负极端对风险管理重要,正极端对空头重要;第 7 章研究其发生频率、幅度及经济变量的影响。
- 其他序列:利率、汇率、债券收益率、公司季度每股收益(EPS)。图 1.5:1953-04—2009-02 美国 10 年与 1 年期国债固定期限利率,二者同步变动,1 年期更易波动。图 1.6:2000-01-04—2009-03-27 美元/日元日汇率及其变化,偶有大幅变动。
表 1.3(百分比):月度 Fama 债券组合收益(1952-01—2008-12,\(T=684\)):期限 1–12 月均值 0.45、标准差 0.35、偏度 2.47、超额峰度 13.14;61–120 月均值 0.55、标准差 1.69、超额峰度 4.79。月度国债利率(1953-04—2009-02,\(T=671\)):1 年 5.59/2.98,10 年 6.40/2.69。周度国库券利率:3 月期 5.07/2.82,6 月期 5.52/2.73(样本量 2882、2625)。规律:利率的均值随期限增加而上升、标准差随期限增加而下降;债券收益的标准差随期限增加而上升、均值大致稳定;多数序列有正超额峰度。
本书分工:第 2–4 章关注收益的前四阶矩;第 7 章关注最小/最大收益;第 8、10 章关注多资产矩与关系;第 5 章关注小时间间隔;第 6 章介绍数理金融。
附录:R 软件包(PDF p.44–45)
R 免费,Rmetrics(Diethelm Wuertz 等)提供 fBasics、timeSeries、fGarch 等包。可用 ts(gm,frequency=12,start=c(1975,1)) 创建时间序列对象(frequency 表示每单位时间观测数,start 为起点)。以 GM 月简单收益(1975-01—2008-12,408 个观测,文件 m-gm3dx7508.txt)为例:图 1.7 时序图中 ts 对象以日历时间标注 x 轴(更好);图 1.8 ACF 中 ts 对象以"时间单位的分数"标注滞后(不如普通滞后数直观)。使用 ts 对象不是必需的。
习题(PDF p.45–47)
- 1.1:AXP、CAT、SBUX 1999–2008 日简单收益(d-3stocks9908.txt):计算百分比简单收益和对数收益的均值、标准差、偏度、超额峰度、最小/最大;检验对数收益均值为零(5% 水平)。
- 1.2:同 1.1,用 GM、VW、EW、SP 1975–2008 月收益(m-gm3dx7508.txt)。
- 1.3:S&P 月收益:(a) 平均年对数收益;(b) 1975 年初投入 1 美元,2008 年末值多少(无交易成本)。
- 1.4:AXP 日对数收益的偏度为零、超额峰度为零的检验。
- 1.5:美元对加元、欧元、英镑、日元 2000-01-04—2009-03-27 日汇率:计算日对数收益和描述统计,讨论特征,画美元/欧元收益密度图。
参考文献(p.47):Campbell, Lo & MacKinlay (1997);Jarque & Bera (1987);Sharpe (1964);Snedecor & Cochran (1980)。p.48 空白。
第 1 章小结
本章要点
- 简单收益率 \(R_t\) 与对数收益率 \(r_t=\ln(1+R_t)\):前者在横截面(组合)上可加权平均,后者在时间上可相加;年化收益是几何平均,算术平均只是一阶近似。
- 收益率含分红、超额收益相对无风险资产定义;连续复利 \(A=Ce^{rn}\)。
- 偏度、超额峰度及其渐近方差 \(6/T\)、\(24/T\);Jarque–Bera 统计量 \(\sim\chi^2_2\);实证收益普遍拒绝正态,呈尖峰厚尾,日频比月频更显著。
- 联合分布按时间分解为条件分布之积 (1.15)/(1.16),这是所有时间序列似然估计 (1.18) 的基础。
- 候选边际分布:正态、对数正态、稳定分布、正态尺度/有限混合,各有优缺点;(1.17) 给出对数正态与简单收益矩的换算。
- 金融时间序列的三个主要对象:收益、波动率(时变、成簇)、极端值。
与量化交易的关联
- 回测与绩效:组合 PnL 必须用简单收益加权;跨期累计用对数收益相加或简单收益连乘;年化收益应用几何平均(CAGR),用算术平均会高估,波动越大偏差越大(约 \(\sigma^2/2\))。
- 数据处理:分红、拆股调整(总收益 \(P_t+D_t\))、超额收益(减无风险利率)是因子研究的标准预处理;空头需支付分红这一点影响做空回测的成本核算。
- 风险建模:厚尾意味着正态 VaR 低估尾部风险;JB 检验、超额峰度是检查残差/收益分布的快速诊断;混合正态是简单的厚尾模拟工具(如压力情景生成)。
- 预测转换:用对数收益模型预测价格或简单收益时需用 (1.17) 做 \(\sigma^2/2\) 修正,否则有系统性偏差。
- 微观结构:tick size 与十进制改革说明高频价格离散,影响高频策略的收益分布与回测撮合假设。
推荐习题
- 1.1/1.2:完整跑一遍描述统计和均值检验,熟悉日频与月频收益差异。
- 1.3:区分平均对数收益与财富终值的复利计算(考查对数收益可加性)。
- 1.4:偏度/峰度 t 检验的手算实现。
- 1.5:汇率收益的厚尾特征,与股票比较。
第 2 章 线性时间序列分析及其应用(Linear Time Series Analysis and Its Applications,PDF p.49–128)
章首导言(PDF p.49)
本章讨论线性时间序列基本理论并应用于金融数据,参考 Box–Jenkins–Reinsel (1994) 第 2–3 章、Brockwell–Davis (1996) 第 1–3 章。把资产收益视为随时间的随机变量集合 \(\{r_t\}\),线性时间序列提供研究其动态结构的自然框架。理论包括平稳性、动态相依、自相关函数、建模、预测;模型包括 AR、MA、ARMA、季节模型、单位根非平稳、带时间序列误差的回归、长记忆的分数差分模型。简单模型试图刻画 \(r_t\) 与 \(t\) 之前信息(\(r_t\) 的历史值及 (1.14) 中的环境向量 \(\mathbf Y\))的线性关系,核心工具是序列相关(serial correlation)/自相关(autocorrelation)。
2.1 平稳性(Stationarity,PDF p.50)
- 严平稳(strictly stationary):对任意 \(k\) 和任意时刻 \((t_1,\dots,t_k)\),\((r_{t_1},\dots,r_{t_k})\) 与 \((r_{t_1+t},\dots,r_{t_k+t})\) 联合分布相同,即联合分布对时间平移不变。条件很强,难以实证验证。
- 弱平稳(weakly stationary):(a) \(E(r_t)=\mu\) 常数;(b) \(\operatorname{Cov}(r_t,r_{t-\ell})=\gamma_\ell\) 只依赖 \(\ell\)。直观上时序图围绕固定水平以恒定幅度波动。弱平稳使对未来的推断(预测)成为可能。
- 关系:弱平稳隐含前两阶矩有限;严平稳且前两阶矩有限 ⇒ 弱平稳,反之一般不成立;但正态序列两者等价。本书主要研究弱平稳序列。
- 自协方差(autocovariance)\(\gamma_\ell=\operatorname{Cov}(r_t,r_{t-\ell})\):\(\gamma_0=\operatorname{Var}(r_t)\),\(\gamma_{-\ell}=\gamma_\ell\)(令 \(t_1=t+\ell\) 即得)。
- 金融中常假设收益弱平稳,可通过分子样本检查结果一致性来实证核验。
2.2 相关与自相关函数(Correlation and Autocorrelation Function,PDF p.50–56)
相关系数:\(\rho_{x,y}=\frac{\operatorname{Cov}(X,Y)}{\sqrt{\operatorname{Var}(X)\operatorname{Var}(Y)}}\),度量线性相依强度,\(-1\le\rho\le1\),对称;\(\rho=0\) 称不相关;若 \(X,Y\) 均正态(严格说联合正态),不相关等价于独立。样本估计
自相关函数 ACF(autocorrelation function):弱平稳序列的滞后 \(\ell\) 自相关
样本 ACF:
单个 ACF 检验:
混成检验 Portmanteau test:Box–Pierce (1970) \(Q^*(m)=T\sum_{\ell=1}^m\hat\rho_\ell^2\),检验 \(H_0:\rho_1=\cdots=\rho_m=0\),iid 下渐近 \(\chi^2_m\)。Ljung–Box (1978) 修正以提高小样本功效:
样本 ACF \(\hat\rho_1,\hat\rho_2,\dots\) 是线性时间序列分析的核心:线性模型可由其 ACF 刻画,建模即用样本 ACF 捕捉线性动态。
实例(图 2.1、2.2):IBM 月简单与对数收益(1926–2008)样本 ACF 均落在两倍标准误界内;简单收益 \(Q(5)=3.37\)(p=0.64)、\(Q(10)=13.99\)(p=0.17);对数收益 \(Q(5)=3.52\)(p=0.62)、\(Q(10)=13.39\)(p=0.20)——IBM 月收益无显著序列相关。CRSP VW 指数月收益有显著序列相关:简单收益 \(Q(5)=29.71\)、\(Q(10)=39.55\);对数收益 \(Q(5)=28.38\)、\(Q(10)=36.16\),p 值均 <0.0001。即指数收益比个股收益有更强的序列相依。
金融文献中,CAPM 的一种版本认为收益不可预测、应无自相关,检验零自相关被用来检验有效市场假设。但价格形成机制和指数计算方式可能引入自相关(如买卖价反弹 bid–ask bounce、非同步交易 nonsynchronous trading,第 5 章),高频数据中尤甚——这也解释了指数收益自相关更强的现象。
R 演示(PDF p.55):Box.test(sibm,lag=5,type='Ljung') 得 \(Q(5)=3.3682\),p=0.6434;对数收益 \(Q(5)=3.5236\),p=0.6198。S-Plus 用 autocorTest(sibm,lag=5),结果相同(\(T=996\))。
2.3 白噪声与线性时间序列(White Noise and Linear Time Series,PDF p.56–57)
白噪声(white noise):\(\{r_t\}\) 为具有有限均值和方差的 iid 序列;若还服从 \(N(0,\sigma^2)\) 则为高斯白噪声。白噪声所有 ACF 为零;实践中样本 ACF 都接近零即视为白噪声。IBM 月收益接近白噪声,VW 指数则不是,说明对某些资产收益需先刻画序列相依再做后续分析。(注:本书的白噪声定义要求 iid,比"不相关"更强。)
线性时间序列(linear time series):
2.4 简单 AR 模型(Simple AR Models,PDF p.57–77)
VW 指数月收益滞后 1 阶自相关显著,提示 \(r_{t-1}\) 可用于预测 \(r_t\)。AR(1):
2.4.1 AR 模型的性质(PDF p.58–66)
AR(1) 的均值:平稳时取期望得 \(\mu=\phi_0+\phi_1\mu\),故 \(E(r_t)=\mu=\phi_0/(1-\phi_1)\)(需 \(\phi_1\ne1\));均值为零当且仅当 \(\phi_0=0\)。改写为
AR(1) 的方差与平稳条件:平方取期望得 \(\operatorname{Var}(r_t)=\phi_1^2\operatorname{Var}(r_{t-1})+\sigma_a^2\),平稳时 \(\operatorname{Var}(r_t)=\sigma_a^2/(1-\phi_1^2)\),需 \(\phi_1^2<1\)。反之 \(|\phi_1|<1\) 时由 (2.11) 与 (2.5)(2.6) 知均值、方差、自协方差均有限且时不变。结论:AR(1) 弱平稳的充要条件是 \(|\phi_1|<1\)。 金融文献常写作 \(r_t=(1-\phi_1)\mu+\phi_1r_{t-1}+a_t\),\(\phi_1\) 度量动态相依的持续性(persistence)。
AR(1) 的 ACF:(2.10) 乘 \(a_t\) 取期望得 \(E[a_t(r_t-\mu)]=\sigma_a^2\);乘 \((r_{t-\ell}-\mu)\) 取期望得
AR(2):
特征方程:\(1-\phi_1x-\phi_2x^2=0\) (2.14),解为 \(x=\dfrac{\phi_1\pm\sqrt{\phi_1^2+4\phi_2}}{-2\phi_2}\),其倒数称特征根(characteristic roots)\(\omega_1,\omega_2\)。
- 若两根为实数,差分方程可分解为 \((1-\omega_1B)(1-\omega_2B)\),AR(2) 相当于 AR(1) 叠加在另一 AR(1) 上,ACF 为两个指数衰减的混合。
- 若 \(\phi_1^2+4\phi_2<0\),两根为共轭复数,ACF 呈阻尼正弦/余弦波(damping sine and cosine waves),对应经济中的商业周期(business cycles)。随机周期平均长度
\[k=\frac{2\pi}{\cos^{-1}[\phi_1/(2\sqrt{-\phi_2})]}\](弧度)。若复数解写作 \(a\pm bi\),则 \(\phi_1=2a\),\(\phi_2=-(a^2+b^2)\),\(k=2\pi/\cos^{-1}(a/\sqrt{a^2+b^2})\)。
图 2.4 示四个平稳 AR(2) 的 ACF:(a) \(\phi_1=1.2,\phi_2=-0.35\);(b) \(\phi_1=0.6,\phi_2=-0.4\)(\(0.36-1.6=-1.24<0\),复根,阻尼正弦);(c) \(0.2,0.35\);(d) \(-0.2,0.35\);后三者实根、指数衰减。
例 2.1 美国季度实际 GNP 增长率(季调,1947Q2–1991Q1,176 个观测,图 2.5):拟合 AR(3)
R 演示:gnp1=ts(gnp,frequency=4,start=c(1947,2));m1=ar(gnp,method="mle") 按 AIC 选出 3 阶;m2=arima(gnp,order=c(3,0,0)) 得 ar1=0.3480(0.0745)、ar2=0.1793(0.0778)、ar3=−0.1423(0.0745)、intercept=0.0077(0.0012),\(\sigma^2=9.427\times10^{-5}\),对数似然 565.84,AIC=−1121.68。注意 R 中 intercept 是序列均值而非常数项,\(\phi_0=(1-0.348-0.1793+0.1423)\times0.0077=0.0047\)。polyroot(c(1,-coef)) 得根 \(1.590\pm1.064i\) 和 \(-1.920\),模长 1.913、1.920;k=2*pi/acos(1.590253/1.913308)=10.66。
平稳条件:AR(2) 平稳当且仅当两个特征根模长都小于 1,等价于特征方程的两个解模长都大于 1;此时 (2.13) 保证 ACF 随滞后趋于 0(平稳的必要性质)。AR(1) 特征根 \(\omega=\phi_1\),同样要求 \(|\phi_1|<1\)。
AR(\(p\)):平稳时 \(E(r_t)=\phi_0/(1-\phi_1-\cdots-\phi_p)\);特征方程 \(1-\phi_1x-\cdots-\phi_px^p=0\) 的所有解模长大于 1(即所有特征根模长小于 1)则平稳;ACF 满足 \((1-\phi_1B-\cdots-\phi_pB^p)\rho_\ell=0\ (\ell>0)\),图形是指数衰减与阻尼正弦的混合。
2.4.2 实践中识别 AR 模型(Identifying AR Models in Practice,PDF p.66–73)
阶数 \(p\) 需由数据确定(定阶,order determination/specification),两种方法:偏自相关函数和信息准则。
偏自相关函数 PACF(partial autocorrelation function):依次拟合
- \(\hat\phi_{p,p}\to\phi_p\);
- 对所有 \(\ell>p\),\(\hat\phi_{\ell,\ell}\to0\);
- \(\ell>p\) 时 \(\hat\phi_{\ell,\ell}\) 的渐近方差为 \(1/T\)。 即 AR(\(p\)) 的样本 PACF 在滞后 \(p\) 处截尾(cuts off)。
例:CRSP VW 月简单收益(1926–2008,\(T=996\)),标准误约 \(1/\sqrt{996}\approx0.032\)。表 2.1:PACF 滞后 1–12 为 0.115、−0.030、−0.102、0.033、0.062、−0.050、0.031、0.052、0.063、0.005、−0.005、0.011。5% 水平识别为 AR(3) 或 AR(9),1% 水平为 AR(3)。GNP 增长率的 PACF(图 2.6,界限 \(\pm2/\sqrt{176}\))前三阶较大,提示 AR(3)。
信息准则(information criteria,均基于似然):
- AIC(Akaike 1973):
\[\text{AIC}=\frac{-2}{T}\ln(\text{likelihood})+\frac{2}{T}\times(\text{参数个数}),\tag{2.16}\]高斯 AR(\(\ell\)) 化简为 \(\text{AIC}(\ell)=\ln\tilde\sigma_\ell^2+2\ell/T\),\(\tilde\sigma_\ell^2\) 为 \(\sigma_a^2\) 的 MLE。第一项衡量拟合优度,第二项为惩罚函数(penalty function)。
- BIC(Schwarz–Bayesian):\(\text{BIC}(\ell)=\ln\tilde\sigma_\ell^2+\ell\ln T/T\)。
- 每个参数的惩罚:AIC 为 2,BIC 为 \(\ln T\),故中大样本下 BIC 倾向选更低阶。
- 选择规则:对 \(\ell=0,\dots,P\) 计算,取最小值对应阶数。
表 2.1 的 AIC(−5.838、−5.837、−5.846、−5.845、−5.847、−5.847、−5.846、−5.847、−5.849、−5.847、−5.845、−5.843)在 \(p=9\) 最小;BIC(−5.833、−5.827、−5.831、…)在 \(p=1\) 最小,\(p=3\) 次之(−5.831)。不同方法给出不同阶数,没有证据表明哪种方法在实际中更好;问题的实质背景与简洁性同样重要。GNP 例中 R 的 ar 给出的 AIC 已调整为最小值为 0(27.847, 2.742, 1.603, 0.000, 0.323, …),选 AR(3)。
参数估计:常用条件最小二乘(conditional least squares),以前 \(p\) 个观测为条件,对 \(t=p+1,\dots,T\) 做多元回归,得拟合值 \(\hat r_t\) 和残差 \(\hat a_t=r_t-\hat r_t\),
VW 月收益 AR(3):\(r_t=0.0091+0.116r_{t-1}-0.019r_{t-2}-0.104r_{t-3}+\hat a_t\),\(\hat\sigma_a=0.054\),标准误 0.002、0.032、0.032、0.032,除滞后 2 外均在 1% 水平显著。系数小说明序列相依弱(虽显著)。\(\hat\mu=0.0091/(1-0.116+0.019+0.104)=0.009\),月均值虽小但长期意义重大:年化简单总收益 \([\prod_{t=1}^{996}(1+R_t)]^{12/996}-1\approx0.093\),即 1926–2008 年约 9.3%/年;1926 年初 1 美元到 2008 年末约值 1593 美元(R:prod(vw+1)=1592.953)。
模型检验(model checking):充分的模型其残差应为白噪声,用残差 ACF 与 Ljung–Box 统计量检查。对 AR(\(p\)) 残差,\(Q(m)\) 渐近 \(\chi^2_{m-g}\),\(g\) 为模型中 AR 系数个数(自由度调整源于拟合对残差施加的约束)。若有不显著系数则简化,若残差仍有序列相关则扩展。注:多数软件不调整自由度(\(m\le g\) 时可以理解)。
VW 例:AR(3) 残差 \(Q(12)=16.35\),按 \(\chi^2_9\) 得 p=0.060,勉强不拒绝;去掉不显著的滞后 2 项后
R 演示:m3=arima(vw,order=c(3,0,0)) 得 ar1=0.1158、ar2=−0.0187、ar3=−0.1042、intercept=0.0089,\(\sigma^2=0.002875\);Box.test(m3$residuals,lag=12,type='Ljung') 用 df=12 给 p=0.1756,手动 1-pchisq(16.35,9)=0.0599。用 arima(vw,order=c(3,0,0),fixed=c(NA,0,NA,NA)) 把 ar2 固定为 0(NA 表示估计)。S-Plus:OLS(vw~ar(3)),\(R^2=0.0246\),DW=1.9913,残差 JB=1656.4。
2.4.3 拟合优度(Goodness of Fit,PDF p.73–74)
\(0\le R^2\le1\),越大拟合越好,但只对平稳序列成立:对单位根非平稳序列,无论真实模型如何,AR(1) 拟合的 \(R^2\) 随样本增大趋于 1(伪高拟合)。\(R^2\) 随参数个数单调不减,故有调整 \(R^2\):\(\text{Adj-}R^2=1-\hat\sigma_a^2/\hat\sigma_r^2\),考虑了参数个数,但不再限于 [0,1]。
2.4.4 预测(Forecasting,PDF p.74–77)
预测原点(forecast origin)\(h\),预测步长(horizon)\(\ell\ge1\),\(F_h\) 为 \(h\) 时刻信息集。最小均方误差预测 \(\hat r_h(\ell)\) 满足 \(E\{[r_{h+\ell}-\hat r_h(\ell)]^2|F_h\}\le\min_gE[(r_{h+\ell}-g)^2|F_h]\),即条件期望。
- 1 步预测:\(\hat r_h(1)=E(r_{h+1}|F_h)=\phi_0+\sum_{i=1}^p\phi_ir_{h+1-i}\),误差 \(e_h(1)=a_{h+1}\),方差 \(\sigma_a^2\);正态时 95% 区间 \(\hat r_h(1)\pm1.96\sigma_a\)。对线性模型 (2.4),\(a_{t+1}\) 既是 1 步预测误差,也是 \(t+1\) 时刻的冲击。
- 实际中用估计参数得到的是条件预测,未计入参数不确定性;考虑参数与模型不确定性的自然方法是基于 MCMC 的贝叶斯预测(第 12 章)。样本大时二者接近。
- 2 步预测:\(\hat r_h(2)=\phi_0+\phi_1\hat r_h(1)+\phi_2r_h+\cdots+\phi_pr_{h+2-p}\),误差 \(e_h(2)=a_{h+2}+\phi_1a_{h+1}\),方差 \((1+\phi_1^2)\sigma_a^2\ge\sigma_a^2\)——预测越远越不确定。
- 多步预测:\(\hat r_h(\ell)=\phi_0+\sum_{i=1}^p\phi_i\hat r_h(\ell-i)\)(\(i\le0\) 时 \(\hat r_h(i)=r_{h+i}\)),递推计算。平稳 AR(\(p\)) 的 \(\hat r_h(\ell)\to E(r_t)\),即均值回复(mean reversion);预测误差方差趋于无条件方差。
- 半衰期(half-life):AR(1) 中令 \(x_t=r_t-E(r_t)\),\(\hat x_h(\ell)=\phi_1^\ell x_h\),令 \(\phi_1^\ell=1/2\) 得
\[\ell=\frac{\ln0.5}{\ln|\phi_1|}.\]
表 2.2:用前 984 个观测重估 AR(3):\(r_t=0.0098+0.1024r_{t-1}-0.0201r_{t-2}-0.1090r_{t-3}+a_t\),\(\hat\sigma_a=0.054\);原点 \(h=984\)(2007 年 12 月)做 1–12 步预测:预测值 0.0076、0.0161、0.0118、0.0099、0.0089、0.0093、0.0095、0.0097、0.0096…;标准误 0.0534、0.0537、0.0537、0.0540…;2008 年实际值 −0.0623、−0.0220、−0.0105、0.0511、0.0238、−0.0786、−0.0132、0.0110、−0.0981、−0.1847、−0.0852、0.0215。因序列相依弱,预测值和标准误迅速收敛到样本均值 0.0095 和标准差 0.0540。图 2.7:除 2008 年 10 月外,实际收益都落在 95% 预测区间内。
2.5 简单 MA 模型(Simple MA Models,PDF p.77–84)
动机:第 5 章将说明买卖价反弹(bid–ask bounce)会在收益序列中引入 MA(1) 结构。作者把 MA 模型看作带参数约束的无穷阶 AR 模型来引入:无穷阶 AR 参数太多不现实,令系数由单一参数决定,\(\phi_i=-\theta_1^i\):
arima 用加号,读软件输出时须换号。)
2.5.1 MA 模型的性质(PDF p.79–80)
- 平稳性:MA 模型是白噪声的有限线性组合,总是弱平稳。\(E(r_t)=c_0\)(常数项即均值),\(\operatorname{Var}(r_t)=(1+\theta_1^2+\cdots+\theta_q^2)\sigma_a^2\)。
- ACF:MA(1)(设 \(c_0=0\))乘 \(r_{t-\ell}\) 取期望得 \(\gamma_1=-\theta_1\sigma_a^2\),\(\gamma_\ell=0\ (\ell>1)\),故
\[\rho_1=\frac{-\theta_1}{1+\theta_1^2},\qquad\rho_\ell=0\ (\ell>1),\]ACF 在滞后 1 截尾。MA(2):\(\rho_1=\dfrac{-\theta_1+\theta_1\theta_2}{1+\theta_1^2+\theta_2^2}\),\(\rho_2=\dfrac{-\theta_2}{1+\theta_1^2+\theta_2^2}\),\(\rho_\ell=0\ (\ell>2)\)。一般 MA(\(q\)) 的 ACF 在滞后 \(q\) 截尾,是"有限记忆"(finite-memory)模型。(推论:MA(1) 的 \(|\rho_1|\le0.5\)。)
- 可逆性(invertibility):零均值 MA(1) 写作 \(a_t=r_t+\theta_1a_{t-1}\),反复代入得 \(a_t=r_t+\theta_1r_{t-1}+\theta_1^2r_{t-2}+\cdots\),即当前冲击是当前与过去收益的线性组合;远期收益影响应趋于零,故要求 \(|\theta_1|<1\),称可逆;\(|\theta_1|=1\) 为不可逆。
2.5.2 识别 MA 阶数(PDF p.80–81)
若 \(\rho_q\ne0\) 而 \(\rho_\ell=0\ (\ell>q)\),则 \(r_t\) 为 MA(\(q\))。例:CRSP 等权指数月简单收益(1926–2008,图 2.8),样本 ACF 在滞后 1、3、9 显著(更高滞后有少量边缘显著,忽略),识别为
2.5.3 估计(Estimation,PDF p.81–82)
通常用极大似然,两种算法:
- 条件似然法(conditional likelihood):假设初始冲击 \(a_t=0\ (t\le0)\),递推 \(a_1=r_1-c_0\),\(a_2=r_2-c_0+\theta_1a_1\),…,得条件 MLE。
- 精确似然法(exact likelihood):把初始冲击作为附加参数联合估计。模型接近不可逆时精确法更好,但计算量更大;样本大时两者接近。
等权指数 MA(9) 例:条件 MLE
2.5.4 MA 模型预测(PDF p.82–84)
MA(1):\(r_{h+1}=c_0+a_{h+1}-\theta_1a_h\),故 \(\hat r_h(1)=c_0-\theta_1a_h\),\(e_h(1)=a_{h+1}\),方差 \(\sigma_a^2\)。\(a_h\) 可设 \(a_0=0\) 后由 \(a_t=r_t-c_0+\theta_1a_{t-1}\) 递推(即拟合残差),或用 AR 表示求得。\(\hat r_h(2)=c_0\),\(e_h(2)=a_{h+2}-\theta_1a_{h+1}\),方差 \((1+\theta_1^2)\sigma_a^2\) 即序列方差;一般 \(\hat r_h(\ell)=c_0\ (\ell\ge2)\),MA(1) 的均值回复只需一期。MA(2):\(\hat r_h(1)=c_0-\theta_1a_h-\theta_2a_{h-1}\),\(\hat r_h(2)=c_0-\theta_2a_h\),\(\hat r_h(\ell)=c_0\ (\ell>2)\)。一般 MA(\(q\)) 在 \(q\) 步后预测等于均值,误差方差等于序列方差。
表 2.3:等权指数 MA(9)(精确 MLE,前 986 个观测重估),原点 \(h=986\)(2008 年 2 月),样本均值 0.0128、标准差 0.0736。1–10 步预测 0.0043、0.0136、0.0150、0.0144、0.0120、0.0019、0.0122、0.0056、0.0085、0.0128(第 10 步即样本均值);标准误 0.0712→0.0734 收敛到序列标准差;实际值含 −0.1209、−0.2060、−0.1366(次贷危机与雷曼倒闭),点预测偏离很大。
AR 与 MA 小结:
- MA(\(q\)) 的 ACF 在滞后 \(q\) 截尾,用 ACF 定阶;
- AR(\(p\)) 的 PACF 在滞后 \(p\) 截尾,用 PACF 定阶;
- MA 总平稳;AR 平稳需所有特征根模长小于 1;
- 平稳序列的多步预测收敛到均值,预测误差方差收敛到序列方差。
2.6 简单 ARMA 模型(Simple ARMA Models,PDF p.84–91)
纯 AR 或 MA 可能需要高阶、多参数;ARMA(Box–Jenkins–Reinsel 1994)把二者结合以实现参数节约(parsimony)。金融收益序列直接用 ARMA 的机会不多,但其概念对波动率建模至关重要:GARCH 可视为 \(a_t^2\) 的(非标准)ARMA 模型(第 3 章)。
ARMA(1,1):
2.6.1 ARMA(1,1) 的性质(PDF p.84–86)
- 均值:\(E(r_t)=\mu=\phi_0/(1-\phi_1)\),与 AR(1) 相同。
- 设 \(\phi_0=0\),乘 \(a_t\) 取期望得 \(E(r_ta_t)=\sigma_a^2\) (2.26)。方差:\(\operatorname{Var}(r_t)=\phi_1^2\operatorname{Var}(r_{t-1})+\sigma_a^2+\theta_1^2\sigma_a^2-2\phi_1\theta_1E(r_{t-1}a_{t-1})\),平稳时
\[\operatorname{Var}(r_t)=\frac{(1-2\phi_1\theta_1+\theta_1^2)\sigma_a^2}{1-\phi_1^2},\]需 \(|\phi_1|<1\),平稳条件与 AR(1) 相同。
- 自协方差:\(\gamma_1-\phi_1\gamma_0=-\theta_1\sigma_a^2\)(与 AR(1) 不同),\(\gamma_\ell-\phi_1\gamma_{\ell-1}=0\ (\ell>1)\) (2.27)。故
\[\rho_1=\phi_1-\frac{\theta_1\sigma_a^2}{\gamma_0},\qquad\rho_\ell=\phi_1\rho_{\ell-1}\ (\ell>1).\]ACF 像 AR(1) 但指数衰减从滞后 2 开始,不在任何有限滞后截尾;PACF 也不截尾,像 MA(1) 但衰减从滞后 2 开始。
2.6.2 一般 ARMA 模型(PDF p.86)
AR 多项式与 MA 多项式不能有公因子(否则可降阶)。AR 多项式给出特征方程;若所有特征根模长小于 1(原文写"解的绝对值小于 1",指特征根),则弱平稳,均值 \(E(r_t)=\phi_0/(1-\phi_1-\cdots-\phi_p)\)。
2.6.3 识别 ARMA 模型(PDF p.86–88)
ACF 和 PACF 对 ARMA 定阶信息不足。Tsay & Tiao (1984) 提出扩展自相关函数 EACF(extended autocorrelation function):若能一致估计 AR 部分,则可导出 MA 部分序列,再用其 ACF 识别 MA 阶数。输出为二维表,行为 AR 阶 \(p\),列为 MA 阶 \(q\)。
表 2.4(ARMA(1,1) 理论 EACF):第 0 行全为 X;第 1 行从 \(q=1\) 起全为 O;第 2 行 \(q=1\) 为 X、\(q\ge2\) 为 O;依此类推,形成以 (1,1) 为左上顶点的 O 三角形(* 表示可零可非零,不影响识别)。一般 ARMA(\(p,q\)) 的 O 三角左上顶点位于 \((p,q)\)。
例:3M 公司月对数收益(1946-02—2008-12,755 个观测,图 2.9),ACF 在 1% 水平无显著序列相关。简化 EACF 表规则:\(|\text{EACF}|\ge2/\sqrt T\) 记 X,否则记 O。表 2.5 简化表的 O 三角左上顶点在 (0,0);\(q=2,5,9,11\) 处有少数 X,但对应值仅 0.08–0.09,略大于 \(2/\sqrt{755}=0.073\),用 1% 临界值就变为 O。故 3M 月对数收益为 ARMA(0,0)(白噪声),与 ACF 一致。
信息准则法:对 \(0\le p\le P\)、\(0\le q\le Q\) 计算 AIC/BIC 取最小;需估计很多模型,可能遇到过度拟合问题。定阶后用条件或精确似然估计,残差 Ljung–Box \(Q(m)\sim\chi^2_{m-g}\),\(g\) 为 AR 与 MA 系数个数。
2.6.4 ARMA 模型预测(PDF p.88–89)
其中 \(\ell-i\le0\) 时 \(\hat r_h(\ell-i)=r_{h+\ell-i}\)、\(a_h(\ell-i)=a_{h+\ell-i}\);\(\ell-i>0\) 时 \(a_h(\ell-i)=0\)。递推计算;误差方差见 (2.34)。
2.6.5 ARMA 模型的三种表示(PDF p.89–91)
- ARMA 表示 (2.28):紧凑,用于参数估计与递推预测。
- 利用多项式长除法:
\[\frac{\theta(B)}{\phi(B)}=1+\psi_1B+\psi_2B^2+\cdots\equiv\psi(B),\tag{2.29}\]\[\frac{\phi(B)}{\theta(B)}=1-\pi_1B-\pi_2B^2-\cdots\equiv\pi(B).\tag{2.30}\]ARMA(1,1) 例:\(\psi(B)=1+(\phi_1-\theta_1)B+\phi_1(\phi_1-\theta_1)B^2+\phi_1^2(\phi_1-\theta_1)B^3+\cdots\),\(\pi(B)=1-(\phi_1-\theta_1)B-\theta_1(\phi_1-\theta_1)B^2-\theta_1^2(\phi_1-\theta_1)B^3-\cdots\)。\(\psi(B)\pi(B)=1\);常数满足 \(Bc=c\),故 \(\phi_0/\theta(1)=\phi_0/(1-\theta_1-\cdots-\theta_q)\),\(\phi_0/\phi(1)=\phi_0/(1-\phi_1-\cdots-\phi_p)\)。
AR 表示:
MA 表示:
2.7 单位根非平稳(Unit-Root Nonstationarity,PDF p.91–101)
利率、汇率、资产价格往往非平稳——价格没有固定水平。这类序列称单位根非平稳序列,最典型的是随机游走。
2.7.1 随机游走(Random Walk,PDF p.92–93)
\(p_0\) 为初值(如对数 IPO 价格),\(a_t\) 白噪声。若 \(a_t\) 关于 0 对称,则 \(p_t\) 涨跌各半。看作 AR(1) 时系数为 1,不满足平稳条件,故为单位根非平稳。随机游走被广泛用作对数股价模型,此时股价不可预测、不均值回复:\(\hat p_h(\ell)=p_h\) 对所有 \(\ell\) 成立,预测没有实际价值。
MA 表示 \(p_t=a_t+a_{t-1}+a_{t-2}+\cdots\) 的含义:
- \(e_h(\ell)=a_{h+\ell}+\cdots+a_{h+1}\),\(\operatorname{Var}[e_h(\ell)]=\ell\sigma_a^2\to\infty\),预测区间长度趋于无穷,点预测的有用性随步长降低;
- 无条件方差无界,\(p_t\) 理论上可取任意实数——对个股对数价格可接受,但对市场指数,负的对数价格极罕见,因此随机游走对指数的适当性存疑;
- \(\psi_i=1\) 对所有 \(i\),过去冲击的影响不衰减,序列有强记忆,经济学称冲击有永久效应(permanent effect);样本 ACF 随样本增大都趋近 1。
2.7.2 带漂移的随机游走(Random Walk with Drift,PDF p.93–95)
市场指数对数收益有小的正均值,故对数价格模型为
例(3M):月对数收益无显著序列相关,模型
常数项的解释(对比动态模型与普通回归):MA(\(q\)) 中常数项即均值;平稳 AR(\(p\))/ARMA 中 \(\mu=\phi_0/(1-\phi_1-\cdots-\phi_p)\);带漂移随机游走中常数项是时间斜率。另一区别:AR(1) 有意义需 \(|\phi_1|\le1\),而回归 \(y_t=\beta_0+\beta_1x_t+a_t\) 中 \(\beta_1\) 可取任意实数。
2.7.3 趋势平稳时间序列(Trend-Stationary Time Series,PDF p.95)
\(r_t\) 平稳(如平稳 AR(\(p\)))。与带漂移随机游走外观相似,但本质不同:带漂移随机游走 \(E(p_t)=p_0+\mu t\)、\(\operatorname{Var}(p_t)=t\sigma_a^2\),均随时间变化;趋势平稳 \(E(p_t)=\beta_0+\beta_1t\) 随时间变化,但 \(\operatorname{Var}(p_t)=\operatorname{Var}(r_t)\) 有限且不变。趋势平稳序列可通过线性回归去除时间趋势变为平稳(方法见 2.9 节);而单位根序列需差分。
2.7.4 一般单位根非平稳模型(PDF p.95–96)
ARMA 的 AR 多项式允许以 1 为特征根,即得 ARIMA(autoregressive integrated moving-average)模型。与随机游走一样有强记忆,MA 表示中 \(\psi_i\) 不衰减,冲击永久影响。传统处理方法是差分(differencing):若 \(c_t=y_t-y_{t-1}=(1-B)y_t\) 服从平稳可逆 ARMA(\(p,q\)),则 \(y_t\) 为 ARIMA(\(p\),1,\(q\))。金融中价格非平稳但对数收益平稳,故对数价格可视为 ARIMA 过程。若 \(y_t\) 与一阶差分 \(c_t\) 都非平稳,而二阶差分 \(s_t=c_t-c_{t-1}=y_t-2y_{t-1}+y_{t-2}\) 平稳,则 \(y_t\) 有双单位根,若 \(s_t\) 服从 ARMA(\(p,q\)) 则 \(y_t\) 为 ARIMA(\(p\),2,\(q\));若 \(s_t\) 均值非零,则 \(y_t\) 有二次时间趋势。美国季度 GDP 隐含价格平减指数(季调)可能有双单位根,但二阶差分均值不显著(见习题)。
2.7.5 单位根检验(Unit-Root Test,PDF p.96–101)
检验对数价格是随机游走还是带漂移随机游走,采用
ADF 检验(augmented Dickey–Fuller):对 AR(\(p\)) 序列 \(x_t\),回归
例 2.2 美国季度 GDP 对数(1947Q1–2008Q4,图 2.11):对数 GDP 上升趋势、样本 ACF 很高;一阶差分(增长率)围绕固定均值波动(近年波动变小)。根据差分序列 PACF 取 \(p=10\),ADF 统计量 −1.701,p=0.4297,不能拒绝单位根;\(\hat\beta=1+\hat\beta_c=1-0.0008=0.9992\)。R:library(fUnitRoots);adfTest(gdp,lags=10,type=c("c")) 得 −1.6109,p=0.4569。S-Plus:unitroot(gdp,trend='c',method='adf',lags=10),常数项 0.0134(显著),残差标准误 0.009318。
例:S&P 500 日对数指数(1950-01-03—2008-04-16,14,462 个观测,图 2.12):检验是否为带漂移随机游走,取 \(c_t=\omega_0+\omega_1t\),按差分序列 PACF 取 \(p=15\),ADF=−1.998,p=0.602,不能拒绝单位根;常数项显著(0.0019,t=2.39),时间趋势项在 5% 不显著(t=1.85,10% 显著)。结论:该期间 S&P 500 对数指数含单位根与正漂移,无强的时间趋势证据。R:ar(diff(sp5),method='mle') 选 2 阶;adfTest(sp5,lags=2,type="ct") 得 −2.0179,p=0.5708;lags=15 得 −1.9946,p=0.5807。
2.8 季节模型(Seasonal Models,PDF p.101–110)
某些金融序列(如公司季度每股收益 EPS)呈周期性,称季节时间序列。图 2.13:Johnson & Johnson 1960Q1–1980Q4 季度 EPS(数据来自 Shumway & Stoffer 2000),呈指数增长、强季节性、波动随时间增大;周期为 4(月度数据如沃尔玛月销售额周期为 12)。季节模型也用于天气衍生品和能源期货定价(环境序列季节性强)。
季节调整(seasonal adjustment):若季节性是次要的,可先去除(美国政府发布的 GDP 增长率、失业率等多为季调数据);但在预测中季节性与其他特征同等重要,须直接建模——本节采取后一思路。
2.8.1 季节差分(Seasonal Differencing,PDF p.102–104)
取对数的两个理由:(1) 处理指数增长(对数尺度下线性增长);(2) 稳定方差(图 2.13(b) 中波动递增的模式消失)。对数变换在金融经济序列中很常用;若有非正值,可先加正常数。
设 \(x_t\) 为对数 EPS。图 2.14:(a) \(x_t\) 的 ACF 很强;(b) 一阶差分 \(\Delta x_t=(1-B)x_t\) 的 ACF 在周期 4 的倍数处很强——季节序列的典型表现。按 Box–Jenkins–Reinsel (1994, 第 9 章) 再做季节差分:
2.8.2 乘积季节模型(Multiplicative Seasonal Models,PDF p.104–110)
上述 ACF 形态在季节序列中很常见,由此产生航空模型(airline model,Box–Jenkins–Reinsel 1994 第 9 章):
- \(\operatorname{Var}(w_t)=(1+\theta^2)(1+\Theta^2)\sigma_a^2\);
- \(\operatorname{Cov}(w_t,w_{t-1})=-\theta(1+\Theta^2)\sigma_a^2\);
- \(\operatorname{Cov}(w_t,w_{t-s+1})=\operatorname{Cov}(w_t,w_{t-s-1})=\theta\Theta\sigma_a^2\);
- \(\operatorname{Cov}(w_t,w_{t-s})=-\Theta(1+\theta^2)\sigma_a^2\);其余滞后为 0。
故
非乘积季节 MA:\(w_t=(1-\theta B-\Theta B^s)a_t\) (2.42),此时 \(\rho_{s+1}=0\)。参数个数相同,但乘积模型有更多非零 ACF,因此更节约(parsimonious)。
例 2.3 J&J 对数 EPS 的航空模型(精确似然):
确定性季节性与虚拟变量:若季节模式稳定(近似确定性),可用虚拟变量(dummy variables)。确定性季节性是乘积季节模型的特例:\(\Theta=1\) 时 (2.41) 含确定性季节成分,此时虚拟变量与乘积季节模型预测相同;但季节模式非确定性时用虚拟变量预测较差。建议用精确似然法估计乘积季节模型,尤其样本小或可能存在确定性季节成分时。
例 2.4 CRSP Decile 1(最小市值组)指数月简单收益(1970-01—2008-12,468 个观测,图 2.16):时序图看不出季节性,但样本 ACF 在滞后 1、12、24、36 显著。识别季节 ARMA \((1-\phi_1B)(1-\phi_{12}B^{12})R_t=(1-\theta_{12}B^{12})a_t\)。条件似然:\((1-0.18B)(1-0.87B^{12})R_t=(1-0.74B^{12})a_t\),\(\tilde\sigma_a=0.069\);精确似然:\((1-0.188B)(1-0.951B^{12})R_t=(1-0.997B^{12})a_t\),\(\tilde\sigma_a=0.063\)。季节 AR 与 MA 因子几乎相互抵消,显示精确似然法的价值,并提示季节行为可能是确定性的。构造一月虚拟变量 \(\text{Jan}_t\),回归
R 演示:jan=rep(c(1,rep(0,11)),39);lm(d1~jan);arima(d1,order=c(1,0,0),seasonal=list(order=c(1,0,1),period=12)) 得 ar1=0.1769、sar1=0.9882、sma1=−0.9144(R 的 MA 符号为正号约定);tsdiag(m2,gof=36) 做诊断;include.mean=F 去均值项。SCA 演示:tsm m1. model (1)(12)dec1=(12)noise.,estim m1.(条件)与 estim m1. method exact.(精确),精确法 MA(12)=0.9968、AR(12)=0.9505,\(R^2=0.328\)。
2.9 带时间序列误差的回归模型(Regression Models with Time Series Errors,PDF p.110–117)
很多应用关注两个时间序列之间的关系,如市场模型(个股超额收益对指数超额收益)和利率期限结构。考虑
例:美国周度利率:\(r_{1t}\) = 1 年期、\(r_{3t}\) = 3 年期国债固定期限利率(1962-01-05—2009-04-10,2467 个观测,百分比,来源 St. Louis Fed)。严格说应用第 8 章多元方法联合建模,这里忽略联立性。图 2.17、2.18(a) 显示两者高度相关。
- 朴素回归:
\[r_{3t}=0.832+0.930r_{1t}+e_t,\quad\hat\sigma_e=0.523,\ R^2=96.5\%,\tag{2.44}\]标准误 0.024、0.004。但图 2.19 残差 ACF 高度显著且缓慢衰减,呈单位根非平稳特征。用现代术语:若两利率都是单位根序列,则残差非平稳说明两者不协整(not cointegrated,第 8 章),数据不支持二者存在长期均衡——样本期内确实出现过收益率曲线倒挂(inverted yield curve,利率与期限反向)。
- 改用变化量 \(c_{1t}=(1-B)r_{1t}\)、\(c_{3t}=(1-B)r_{3t}\)(图 2.20、2.18(b)),回归
\[c_{3t}=0.792c_{1t}+e_t,\quad\hat\sigma_e=0.0690,\ R^2=82.5\%,\tag{2.45}\]标准误 0.0073。图 2.21 残差 ACF 仍有显著但小得多的序列相关。
- 由残差 ACF 设定 MA(1) 误差:
\[c_{3t}=\beta c_{1t}+e_t,\quad e_t=a_t-\theta_1a_{t-1},\tag{2.46}\]在计算机普及前需 Cochrane–Orcutt 等专门方法(Greene 2003),如今若误差模型平稳可逆即可用 ML 联合估计。结果\[c_{3t}=0.794c_{1t}+e_t,\quad e_t=a_t+0.1823a_{t-1},\quad\hat\sigma_a=0.0678,\ R^2=83.1\%,\tag{2.47}\]标准误 0.0075、0.0196。滞后 1 残差 ACF 不再显著,滞后 4、6、7 仍有小相关,加 MA 项改进很小。
比较结论:(1) 模型 (2.44) 的高 \(R^2\) 与系数 0.930 具有误导性(残差强序列相关,伪回归);(2) 对变化量序列,(2.45) 与 (2.47) 的 \(R^2\) 和系数接近,加 MA(1) 只是边际改进(MA 系数数值小但高度显著);(3) 回归分析中检查残差序列相依至关重要。由 (2.47) 得 \(r_{3t}=r_{3,t-1}+0.794(r_{1t}-r_{1,t-1})+a_t+0.182a_{t-1}\):两利率同期相关且序列相关。
R:lm(r3~r1);lm(c3~-1+c1)(无截距);arima(c3,order=c(0,0,1),xreg=c1,include.mean=F);\(R^2\) 用 (sum(c3^2)-sum(m3$residuals^2))/sum(c3^2)=0.831 计算。
一般建模步骤:
- 拟合线性回归,检查残差序列相关;
- 若残差单位根非平稳,对因变量和解释变量都做一阶差分,回到第 1 步;若残差平稳,为残差识别 ARMA 模型并相应修改回归模型;
- 用 ML 联合估计,检查拟合模型并进一步改进。
检查残差序列相关应用 Ljung–Box 而非 Durbin–Watson,因为 DW 只考虑滞后 1,而残差相依可能出现在更高阶(尤其有季节性时)。注:
OLS,滞后变量用 tslag(r,1),如 OLS(c3t~c1t+tslag(c3t,1)+tslag(c1t,1),na.rm=T)。
2.10 一致协方差矩阵估计(Consistent Covariance Matrix Estimation,PDF p.117–121)
当误差有序列相关和/或条件异方差,但主要目的是推断回归系数,且 OLS 系数估计仍一致时,可用一致的协方差矩阵估计:HC(heteroscedasticity consistent,Eicker 1967;White 1980)和 HAC(heteroscedasticity and autocorrelation consistent,Newey & West 1987)。
回归写成 \(y_t=\mathbf x_t'\boldsymbol\beta+e_t\) (2.48),\(\mathbf x_t\) 为含常数的 \(k\) 维解释变量。LS 估计与通常协方差
White 估计量(HC):
Newey–West 估计量(HAC):
例:利率变化回归 (2.45) 中 \(c_{1t}\) 系数的 t 值:忽略序列相关与异方差时 107.91,HC 时 48.44(标准误 0.0163),HAC 时 39.92(标准误 0.0198)。S-Plus:summary(reg.fit,correction="white") 与 correction="nw"。也可在回归中加入 \(c_{1,t-1}\)、\(c_{3,t-1}\) 处理残差序列相关:\(c_{3t}=0.7971c_{1t}+0.1766c_{3,t-1}-0.1580c_{1,t-1}\),\(R^2=0.8312\),DW=1.9865;还可对其再用 HC/HAC 修正 t 值。
辅助回归求单个系数的 HC 方差:\(k>1\) 时,令 \(\mathbf x_{-j,t}\) 为去掉 \(x_{jt}\) 的 \((k-1)\) 维向量,做辅助回归 \(x_{jt}=\mathbf x_{-j,t}'\boldsymbol\gamma+v_t\) (2.51),残差 \(\hat v_t\),则
2.11 长记忆模型(Long-Memory Models,PDF p.121–123)
平稳序列 ACF 指数衰减;单位根序列样本 ACF 对所有固定滞后随样本增大趋于 1(Chan & Wei 1988;Tiao & Tsay 1983)。介于两者之间,有些序列 ACF 以多项式速率缓慢衰减,称长记忆(long-memory)序列。典型例子是分数差分过程(fractionally differenced process):
- \(d<0.5\) 时弱平稳,MA(∞) 表示 \(x_t=a_t+\sum\psi_ia_{t-i}\),\(\psi_k=\dfrac{d(1+d)\cdots(k-1+d)}{k!}=\dfrac{(k+d-1)!}{k!(d-1)!}\)。
- \(d>-0.5\) 时可逆,AR(∞) 表示 \(x_t=\sum\pi_ix_{t-i}+a_t\),\(\pi_k=\dfrac{-d(1-d)\cdots(k-1-d)}{k!}=\dfrac{(k-d-1)!}{k!(-d-1)!}\)。
- \(-0.5<d<0.5\) 时 ACF \(\rho_k=\dfrac{d(1+d)\cdots(k-1+d)}{(1-d)(2-d)\cdots(k-d)}\),\(\rho_1=d/(1-d)\),\(\rho_k\approx\dfrac{(-d)!}{(d-1)!}k^{2d-1}\)(\(k\to\infty\))。
- PACF \(\phi_{k,k}=d/(k-d)\)。
- 谱密度(ACF 的 Fourier 变换)\(f(\omega)\sim\omega^{-2d}\)(\(\omega\to0\))(2.53),\(\omega\in[0,2\pi]\)。
关键:\(\rho_k\sim k^{2d-1}\) 是多项式衰减而非指数衰减;谱密度在零频处发散(\(d>0\) 时),而平稳 ARMA 的谱密度在 \([0,2\pi]\) 上有界。
分数差分算子用非整数幂二项展开:\((1-B)^d=\sum_{k=0}^\infty(-1)^k\binom dkB^k\),\(\binom dk=\dfrac{d(d-1)\cdots(d-k+1)}{k!}\)。若 \((1-B)^dx_t\) 服从 ARMA(\(p,q\)),则 \(x_t\) 为 ARFIMA(\(p,d,q\)),即允许非整数 \(d\) 的广义 ARIMA。
识别:样本 ACF 数值不大但衰减很慢,提示长记忆。图 2.22:CRSP VW 与 EW 指数日简单收益绝对值序列(1970-01-02—2008-12-31)的 ACF 数值小但衰减极慢,300 阶后仍在 5% 水平显著(参见 Ding, Granger & Engle 1993)。纯分数差分模型的 \(d\) 可用 ML 或低频对数周期图回归(log-periodogram regression)估计。长记忆在金融文献中受关注部分源于连续时间模型中分数布朗运动的研究。
附录:SCA 命令(PDF p.123–124)
给出 2.9 节利率分析的 SCA 命令:input 读入 w-gs1yr.txt、w-gs3yr.txt;tsm m1. model rate3=b0+(b1)rate1+noise. 设定回归;estim m1. hold resi(r1). 估计并保存残差;acf r1. maxl 10.;diff old rate1,rate3. new c1t,c3t. compress. 差分;tsm m3. model c3t=g0+(g1)c1t+(1)noise. 设定 MA(1) 误差的回归;estim m3. method exact. 精确似然;(1,4,6,7)noise 加入更多 MA 滞后。
习题(PDF p.124–127)
(未特别说明时用 5% 显著性水平。)
- 2.1:月度债券指数简单收益 \(R_t=a_t+0.2a_{t-1}\),\(\sigma_a=0.025\),\(a_{100}=0.01\),求原点 100 的 1、2 步预测及误差标准差,以及滞后 1、2 的 ACF(考查 MA(1) 预测与 ACF 公式)。
- 2.2:\(r_t=0.01+0.2r_{t-2}+a_t\),\(\operatorname{Var}(a_t)=0.02\),求均值、方差、\(\rho_1,\rho_2\);给定 \(r_{100}=-0.01\)、\(r_{99}=0.02\) 求 1、2 步预测及误差标准差(考查 AR(2) 特例的矩与预测)。
- 2.3:美国月度失业率(1948-01—2009-03,季调,m-unrate.txt)建模并预测 2009 年 4–7 月,判断是否隐含商业周期(考查复特征根)。
- 2.4:CRSP 按市值 Decile 1、2、9、10 月收益(1970–2008):(a) Decile 2 与 10 的前 12 阶 ACF 联合检验;(b) 为 Decile 2 建 ARMA 并检验;(c) 1–12 步预测。
- 2.5:IBM 日简单收益绝对值前 100 阶 ACF,是否有长程相依。
- 2.6:某制造业月度用电需求(对数,power6.txt)建模并做 1–24 步预测(季节模型)。
- 2.7:1980–2008 日收益(IBM、VW、EW、SP,含星期虚拟变量,d-ibm3dxwkdays8008.txt):用回归研究星期效应(weekday effect)对 EW 的影响,用 HAC 修正 t 值,检查残差序列相关,必要时建带时间序列误差的回归。
- 2.8:对 S&P 日收益做同样分析,检验无周五效应。
- 2.9:对 IBM 日收益做同样分析,并用带时间序列误差的回归改进。
- 2.10:Moody's Aaa 与 Baa 周度债券收益率(1962-01-05—2009-04-10)描述统计,检验偏度与厚尾。
- 2.11:为月度 Aaa 收益率建时间序列模型。
- 2.12:以 Aaa 为因变量、Baa 为自变量建带时间序列误差的回归,研究两者关系。
- 2.13:CRSP 等权指数月对数收益(1962–1999,456 个观测,m-ew6299.txt):分别建 AR 和 MA 模型并检验,计算 1、2 步预测并比较。
- 2.14:S&P 500 指数与 6 月期货 1993 年 5 月的 1 分钟日内数据(sp5may.dat:对数期货价、对数现货价、持有成本),对 \(y_t=\Delta f_t\)、\(x_t=\Delta s_t\) 建带时间序列误差的回归(指数期货套利研究背景)。
- 2.15:美国季度 GDP 隐含价格平减指数(1947Q1–2008Q4,2000=100,q-gdpdef.txt)建 ARIMA 并预测 2009 年各季通胀。
参考文献(p.127–128):Akaike (1973)、Box & Pierce (1970)、Box–Jenkins–Reinsel (1994)、Brockwell & Davis (1991, 1996)、Chan & Wei (1988)、Dickey & Fuller (1979)、Ding–Granger–Engle (1993)、Eicker (1967)、Fuller (1976)、Greene (2003)、Hosking (1981)、Ljung & Box (1978)、Newey & West (1987)、Phillips (1987)、Shumway & Stoffer (2000)、Tiao & Tsay (1983)、Tsay & Tiao (1984)、White (1980)。
第 2 章小结
本章要点
- 弱平稳(一、二阶矩时不变)是线性时间序列分析的基础;ACF \(\rho_\ell=\gamma_\ell/\gamma_0\) 及其样本估计、\(1/T\) 渐近方差和 Bartlett 公式;Ljung–Box \(Q(m)\) 联合检验,\(m\approx\ln T\)。
- 线性序列 = 白噪声冲击的加权和 (2.4);\(\psi\) 权重决定 ACF (2.7)。
- AR(\(p\)):均值 \(\phi_0/(1-\sum\phi_i)\);平稳条件为特征根在单位圆内;ACF 拖尾(指数衰减/阻尼正弦),PACF 在 \(p\) 截尾;复根对应随机周期,周期长度 \(2\pi/\cos^{-1}[\phi_1/(2\sqrt{-\phi_2})]\);定阶用 PACF 或 AIC/BIC(BIC 偏好更低阶);条件 LS 估计;残差 \(Q(m)\sim\chi^2_{m-g}\)。
- MA(\(q\)):恒平稳,常数即均值,ACF 在 \(q\) 截尾,可逆需 MA 多项式零点在单位圆外;条件似然与精确似然估计;\(q\) 步后预测等于均值。
- ARMA:参数节约;ACF、PACF 均拖尾,用 EACF 的 O 三角顶点定阶;三种表示(ARMA/AR(π 权)/MA(ψ 权, 脉冲响应)),MA 表示给出预测误差方差 (2.34) 和均值回复证明;AR(1) 半衰期 \(\ln0.5/\ln|\phi_1|\)。
- 单位根:随机游走不可预测、预测误差方差线性增长、冲击永久;带漂移随机游走的常数项是趋势斜率;趋势平稳与差分平稳的区别;DF/ADF 检验统计量服从非标准分布。
- 季节模型:季节差分 \((1-B^s)\);航空模型 \((1-B)(1-B^s)x_t=(1-\theta B)(1-\Theta B^s)a_t\) 及其 ACF;确定性季节性可用虚拟变量(一月效应例)。
- 带时间序列误差的回归:忽略误差序列相关会导致伪回归和错误推断;先检查残差,非平稳则差分,平稳则为残差建 ARMA 并联合估计;用 Ljung–Box 而非 DW。
- HC(White)与 HAC(Newey–West)协方差估计在误差异方差/自相关时给出正确标准误。
- 长记忆:分数差分 \((1-B)^d\),ACF 以 \(k^{2d-1}\) 多项式衰减;收益绝对值序列表现出长记忆。
与量化交易的关联
- 因子/信号研究:检验收益可预测性的第一步就是 ACF 与 Ljung–Box;个股月收益接近白噪声,而指数收益有正一阶自相关(部分源于非同步交易),短周期反转/动量信号需先排除此类微观结构伪相关。
- 回归推断(极常用):因子收益对特征的时间序列回归、Fama–MacBeth 的时间序列 t 统计、alpha 检验、事件研究中的残差相关,都应用 Newey–West HAC 标准误;重叠收益(如用日数据算月度前瞻收益)造成的 MA 结构使普通 t 值严重高估——本章利用 t 值 107.9→39.9 的例子很直观。
- 伪回归与协整:价格/利率水平回归的高 \(R^2\) 不可信(例 2.44),配对交易和统计套利须先做单位根/协整检验(第 8 章展开);ADF 检验可直接用于价差序列的平稳性判断。
- 均值回复策略:AR(1)/OU 型价差的半衰期 \(\ln0.5/\ln|\phi_1|\) 用于设定持仓周期和止损时间;ARMA 预测误差方差 (2.34) 用于设定入场阈值。
- 季节性与日历效应:一月效应、星期效应(习题 2.7–2.9)是经典日历异象,虚拟变量回归 + HAC 是标准检验方法。
- 模型选择:AIC/BIC、残差诊断的流程可迁移到任何预测模型的过拟合控制。
- 波动率预测铺垫:GARCH 即 \(a_t^2\) 的 ARMA;绝对收益的长记忆提示长记忆波动模型(FIGARCH、HAR 类)的必要性。
- 样本外评估:表 2.2、2.3 的滚动原点预测是回测中"只用原点前数据重估"的基本做法;2008 年的预测失败提醒线性模型在危机期的局限。
推荐习题
- 2.1、2.2:手算 MA/AR 预测和 ACF,夯实公式。
- 2.3:失业率 AR 建模与商业周期判断(复根应用)。
- 2.7–2.9:日历效应回归 + HAC + 带时间序列误差的回归,最贴近量化实务的一组。
- 2.13:同一序列 AR 与 MA 建模的比较,体会定阶与诊断。
- 2.14:期现货高频数据的回归,联系指数套利。
- 2.15:ARIMA 建模与单位根判断(可能双单位根)。
第 3 章 条件异方差模型(Conditional Heteroscedastic Models,PDF p.129–194)
章首导言(PDF p.129–130)
本章研究资产收益波动率(volatility,即标的资产收益的条件标准差)的建模方法,统称条件异方差模型。
期权中的波动率:欧式看涨期权(European call option)赋予持有人在到期日以执行价 \(K\)(strike price)买入一定股数的权利而非义务;\(\ell\) 为距到期时间(年)。Black–Scholes 公式:
其他应用:VaR 计算(第 7 章);均值–方差框架下的资产配置;对波动率建模能提高参数估计效率和区间预测精度;波动率指数本身成为交易品种——CBOE 的 VIX 期货于 2004-03-26 开始交易。
本章模型:ARCH(Engle 1982)、GARCH(Bollerslev 1986)、EGARCH(Nelson 1991)、TGARCH(Glosten–Jagannathan–Runkle 1993;Zakoian 1994)、CHARMA(Tsay 1987)、RCA(Nicholls & Quinn 1982)、随机波动率 SV(Melino & Turnbull 1990;Taylor 1994;Harvey–Ruiz–Shephard 1994;Jacquier–Polson–Rossi 1994);3.15 节介绍替代方法(高频数据、日内高低价)。多元波动率见第 10 章。
3.1 波动率的特征(Characteristics of Volatility,PDF p.130–131)
- 不可直接观测:日波动率无法从每日一个收益观测得到;若有日内数据(如 10 分钟收益)可估计(3.15 节),但股票波动包括日内波动和隔夜波动,日内高频数据对隔夜波动信息很有限。不可观测性使评价波动率模型的预测表现变得困难。
- 隐含波动率(implied volatility):若接受 Black–Scholes 等模型决定价格,可从期权价格反推 \(\sigma_t\)。但它依赖几何布朗运动等假设,可能偏离实际波动率;经验上隐含波动率往往高于 GARCH 类模型估计值,可能源于波动率风险溢价或日收益计算方式。VIX 就是隐含波动率。
- 四个常见特征:(1) 波动聚集(volatility clusters)——某些时期高、某些时期低;(2) 波动随时间连续演化,跳跃罕见;(3) 波动不发散到无穷,在固定范围内变动,统计上通常是平稳的;(4) 波动对大涨与大跌反应不同,称杠杆效应(leverage effect)。这些特征推动了模型发展,例如 EGARCH 就是为刻画正负收益引起的不对称性而提出。
3.2 模型结构(Structure of a Model,PDF p.131–133)
基本思想:收益序列 \(\{r_t\}\) 序列不相关(或仅有低阶弱相关),但并非独立。例:Intel 月对数收益(1973-01—2008-12,图 3.1)。图 3.2:(a) \(r_t\) 的 ACF 除滞后 7 有小相关外不显著;(b) \(r_t^2\) 与 (c) \(|r_t|\) 的 ACF 明显显著;(d) \(r_t^2\) 的 PACF。即"不相关但相依",波动率模型就是要刻画这种相依。
条件均值与条件方差:
3.3 建模步骤(Model Building,PDF p.133–135)
- 检验序列相依,设定均值方程(如 ARMA)以去除线性相依;
- 用均值方程残差检验 ARCH 效应;
- 若 ARCH 效应显著,设定波动率模型,对均值与波动率方程联合估计;
- 仔细检查拟合模型,必要时改进。
多数资产收益序列相关很弱,均值方程常只是减去显著非零的样本均值;部分日收益需简单 AR;也可加入周末或一月效应虚拟变量。本章用 R(含/不含 OX)与 S-Plus 演示,也可用 Eviews、SCA、RATS。
3.3.1 检验 ARCH 效应(Testing for ARCH Effect,PDF p.134–135)
令 \(a_t=r_t-\mu_t\) 为均值方程残差,用 \(a_t^2\) 检验条件异方差(ARCH 效应):
- McLeod–Li 检验(1983):对 \(\{a_t^2\}\) 用 Ljung–Box \(Q(m)\),\(H_0\):\(a_t^2\) 的前 \(m\) 阶 ACF 为零。
- Engle (1982) 拉格朗日乘子(LM)检验:回归
\[a_t^2=\alpha_0+\alpha_1a_{t-1}^2+\cdots+\alpha_ma_{t-m}^2+e_t,\quad t=m+1,\dots,T,\]检验 \(H_0:\alpha_1=\cdots=\alpha_m=0\)。令 \(SSR_0=\sum_{t=m+1}^T(a_t^2-\bar\omega)^2\)(\(\bar\omega\) 为 \(a_t^2\) 样本均值),\(SSR_1=\sum\hat e_t^2\),\[F=\frac{(SSR_0-SSR_1)/m}{SSR_1/(T-2m-1)},\]原文称其渐近服从 \(\chi^2_m\)(严格说 \(mF\) 渐近 \(\chi^2_m\),或常用 \(TR^2\sim\chi^2_m\) 形式),\(F>\chi^2_m(\alpha)\) 或 p 值小于 \(\alpha\) 时拒绝。
例(Intel 月对数收益):收益本身 \(Q(12)=18.26\),p=0.11,无序列相关,可直接检验;LM 检验统计量约 53.62,p≈0;\(a_t^2\) 的 \(Q(12)=89.85\),p≈0,ARCH 效应很强。S-Plus archTest(intc,lag=12) 直接作用于 \(a_t\) 而非 \(a_t^2\);R:at=intc-mean(intc),Box.test(at^2,lag=12,type='Ljung') 得 89.85,p=5.3e-14。
3.4 ARCH 模型(The ARCH Model,PDF p.135–151)
ARCH 是第一个系统的波动率建模框架(Engle 1982)。基本思想:(a) 冲击 \(a_t\) 序列不相关但相依;(b) 相依可用其滞后值的简单二次函数描述。ARCH(\(m\)):
直观:过去大的平方冲击导致大的条件方差,使 \(a_t\) 倾向于取大值("倾向"是因为大方差只提高出现大值的概率),即大冲击后往往跟随大冲击——与波动聚集一致。
其他序列中的 ARCH 效应:图 3.3 德国马克/美元 10 分钟收益(1989-06-05—06-19,2488 个观测)及其平方:偶有大变动,也有平稳期;图 3.4 收益 ACF 无序列相关,平方序列 PACF 有大的尖峰——不独立、有 ARCH 效应。注:有些作者用 \(h_t\) 表示条件方差,\(a_t=\sqrt{h_t}\epsilon_t\)。
3.4.1 ARCH 模型的性质(PDF p.137–139)
以 ARCH(1) \(a_t=\sigma_t\epsilon_t\),\(\sigma_t^2=\alpha_0+\alpha_1a_{t-1}^2\)(\(\alpha_0>0,\alpha_1\ge0\))为例:
- 无条件均值:\(E(a_t)=E[E(a_t|F_{t-1})]=E[\sigma_tE(\epsilon_t)]=0\)。
- 无条件方差:\(\operatorname{Var}(a_t)=E[E(a_t^2|F_{t-1})]=\alpha_0+\alpha_1E(a_{t-1}^2)\),平稳时 \(\operatorname{Var}(a_t)=\alpha_0/(1-\alpha_1)\),需 \(0\le\alpha_1<1\)。
- 四阶矩:正态下 \(E(a_t^4|F_{t-1})=3[E(a_t^2|F_{t-1})]^2=3(\alpha_0+\alpha_1a_{t-1}^2)^2\)。若四阶平稳,\(m_4=E(a_t^4)\) 满足
\[m_4=3[\alpha_0^2+2\alpha_0\alpha_1\operatorname{Var}(a_t)+\alpha_1^2m_4]=3\alpha_0^2\Big(1+\frac{2\alpha_1}{1-\alpha_1}\Big)+3\alpha_1^2m_4,\]\[m_4=\frac{3\alpha_0^2(1+\alpha_1)}{(1-\alpha_1)(1-3\alpha_1^2)}.\]含义:(a) 需 \(1-3\alpha_1^2>0\),即 \(0\le\alpha_1^2<1/3\);(b) 无条件峰度\[\frac{E(a_t^4)}{[\operatorname{Var}(a_t)]^2}=3\,\frac{1-\alpha_1^2}{1-3\alpha_1^2}>3,\]超额峰度为正,尾部比正态厚。即条件高斯的 ARCH(1) 冲击比高斯白噪声更易产生"异常值",与实证一致。这些性质对一般 ARCH 成立,但公式更复杂。
正性条件的放松:\(\alpha_i\ge0\) 只是为保证 \(\sigma_t^2>0\)。更自然的写法
3.4.2 ARCH 模型的弱点(PDF p.139)
- 依赖平方冲击,假设正负冲击对波动影响相同;而实际中资产价格对正负冲击反应不同。
- 约束严格:ARCH(1) 若要四阶矩有限,\(\alpha_1^2\in[0,1/3)\);高阶约束更复杂,限制了高斯 ARCH 刻画超额峰度的能力。
- 不提供理解波动来源的新见解,只是机械描述条件方差的行为。
- 对孤立的大冲击反应缓慢,容易高估波动率。
3.4.3 建立 ARCH 模型(PDF p.139–143)
定阶:用 \(a_t^2\) 的 PACF。理由:\(a_t^2\) 是 \(\sigma_t^2\) 的无偏估计(单个值不是有效估计,但对定阶有参考价值),故 \(a_t^2\) 与 \(a_{t-1}^2,\dots,a_{t-m}^2\) 呈类似 AR(\(m\)) 的线性关系。另一种论证:令 \(\eta_t=a_t^2-\sigma_t^2\),可证 \(\{\eta_t\}\) 零均值不相关,于是
估计:
- 正态:似然 \(f(a_1,\dots,a_T|\boldsymbol\alpha)=\prod_{t=m+1}^T\frac{1}{\sqrt{2\pi\sigma_t^2}}\exp\big(-\frac{a_t^2}{2\sigma_t^2}\big)\times f(a_1,\dots,a_m|\boldsymbol\alpha)\)。初始项形式复杂,大样本时通常略去,得条件似然;最大化得正态下的条件 MLE。对数似然(去掉常数)
\[\ell=-\sum_{t=m+1}^T\Big[\frac12\ln\sigma_t^2+\frac12\frac{a_t^2}{\sigma_t^2}\Big],\]\(\sigma_t^2\) 递推计算。
- 标准化 Student-t:\(x_v\) 为 \(v\) 自由度 t 分布,\(\operatorname{Var}(x_v)=v/(v-2)\)(\(v>2\)),令 \(\epsilon_t=x_v/\sqrt{v/(v-2)}\),密度
\[f(\epsilon_t|v)=\frac{\Gamma[(v+1)/2]}{\Gamma(v/2)\sqrt{(v-2)\pi}}\Big(1+\frac{\epsilon_t^2}{v-2}\Big)^{-(v+1)/2},\quad v>2.\tag{3.7}\]条件似然为 \(\prod\frac{\Gamma[(v+1)/2]}{\Gamma(v/2)\sqrt{(v-2)\pi}}\frac1{\sigma_t}\big(1+\frac{a_t^2}{(v-2)\sigma_t^2}\big)^{-(v+1)/2}\)。\(v\) 可预设(常取 4–8)或联合估计。\(v\) 预设时\[\ell=-\sum_{t=m+1}^T\Big[\frac{v+1}{2}\ln\Big(1+\frac{a_t^2}{(v-2)\sigma_t^2}\Big)+\frac12\ln\sigma_t^2\Big];\tag{3.8}\]联合估计 \(v\) 时再加 \((T-m)\{\ln\Gamma[(v+1)/2]-\ln\Gamma(v/2)-0.5\ln[(v-2)\pi]\}\)。
- 偏 Student-t(skew-Student-t):收益分布还可能偏斜。采用 Fernández & Steel (1998) 方法(可给任何关于 0 对称的单峰连续分布引入偏度),Lambert & Laurent (2001) 将其用于 (3.7) 得标准化偏 t 分布:
\[g(\epsilon_t|\xi,v)=\begin{cases}\dfrac{2}{\xi+1/\xi}\,\varrho\,f[\xi(\varrho\epsilon_t+\varpi)|v],&\epsilon_t<-\varpi/\varrho\\[2mm]\dfrac{2}{\xi+1/\xi}\,\varrho\,f[(\varrho\epsilon_t+\varpi)/\xi|v],&\epsilon_t\ge-\varpi/\varrho\end{cases}\tag{3.9}\]\[\varpi=\frac{\Gamma[(v-1)/2]\sqrt{v-2}}{\sqrt\pi\,\Gamma(v/2)}\Big(\xi-\frac1\xi\Big),\qquad\varrho^2=\Big(\xi^2+\frac1{\xi^2}-1\Big)-\varpi^2.\]\(\xi\) 为偏度参数,\(\xi^2\) 等于众数以上与以下概率质量之比;\(\xi=1\) 时退化为对称 t。(\(\varpi\)、\(\varrho\) 是使分布均值 0、方差 1 的平移与尺度常数。)
- 广义误差分布 GED:
\[f(x)=\frac{v\exp(-\frac12|x/\lambda|^v)}{\lambda2^{(1+1/v)}\Gamma(1/v)},\quad0<v\le\infty,\qquad\lambda=\big[2^{(-2/v)}\Gamma(1/v)/\Gamma(3/v)\big]^{1/2}.\tag{3.10}\]\(v=2\) 为正态,\(v<2\) 厚尾。
- 注:Rmetrics 的 fGarch 包提供偏 t、偏正态、偏 GED(
sstd、snorm、sged)。
模型检验:标准化残差 \(\tilde a_t=a_t/\sigma_t\) 应 iid。\(\tilde a_t\) 的 Ljung–Box 检验均值方程,\(\tilde a_t^2\) 的 Ljung–Box 检验波动率方程;偏度、峰度、QQ 图检验分布假设。
预测:类似 AR 递推。原点 \(h\):\(\sigma_h^2(1)=\alpha_0+\alpha_1a_h^2+\cdots+\alpha_ma_{h+1-m}^2\);\(\sigma_h^2(2)=\alpha_0+\alpha_1\sigma_h^2(1)+\alpha_2a_h^2+\cdots+\alpha_ma_{h+2-m}^2\);
3.4.4 例子(Some Examples,PDF p.143–149)
例 3.1 Intel 月对数收益(1973–2008,\(T=432\)):\(r_t^2\) 的 PACF(图 3.2(d))提示 ARCH(3)。正态下:
garch(intc~1,~garch(3,0)),arch1$asymp.sd=0.1315,plot(arch1) 可得拟合波动率;AIC=−570.02,BIC=−557.81;但 S-Plus 输出的 \(\tilde a_t^2\) 的 \(Q(12)=32.11\)(p=0.0013)。
t 新息:
cond.dist="t" 或 "ged";AIC=−597.34。
R 演示(fGarch):m1=garchFit(intc~garch(1,0),data=intc,trace=F) 得 mu=0.012637、omega=0.011195、alpha1=0.379492(标准误 0.1155),对数似然 288.06;标准化残差 JB=137.9、Shapiro–Wilk 拒绝正态;\(R\) 的 \(Q(10)=12.54\)(p=0.25),\(R^2\) 的 \(Q(10)=16.02\)(p=0.099)、\(Q(15)=36.08\)(p=0.0017);LM ARCH 检验 \(TR^2=26.58\)(p=0.009)。predict(m1,5) 给出 1–5 步预测:均值 0.01264,标准差 0.1098、0.1256、0.1311、0.1331、0.1339(趋近无条件标准差)。garchFit(intc~garch(1,1)) 得 mu=0.01073、omega=0.000954、alpha1=0.0874、beta1=0.8512,标准化残差 \(Q(10)=8.27\)(p=0.60),\(R^2\) 的 \(Q(10)=0.99\)(p≈1.0)——GARCH(1,1) 更充分。(续见下文)
GARCH(1,1) 的 LM ARCH 检验 \(TR^2=10.70\)(p=0.55)。t 分布 ARCH(1):cond.dist='std' 得 mu=0.016731、omega=0.011939、alpha1=0.285320、shape(自由度)=6.015(标准误 1.56)。偏 t:cond.dist='sstd';ARMA(1,0)+GARCH(1,1):garchFit(intc~arma(1,0)+garch(1,1))。
R + Ox(G@RCH 4.2):source("garchoxfit_R.txt"),garchOxFit(formula.mean=~arma(0,0),formula.var=~garch(0,1),series=intc)。注意 G@RCH 中 ARCH(1) 写作 GARCH(0,1)(阶数顺序与 fGarch 相反)。正态:Cst(M)=0.012630、Cst(V)=0.011129、ARCH(Alpha1)=0.387223;\(\tilde a_t^2\) 的 \(Q(10)=15.78\)(p=0.072,已按 1 个自由度调整)、\(Q(20)=37.02\)(p=0.008);ARCH 1–10 检验 F(10,410)=1.44(p=0.16)。t 分布:自由度 6.02,Alpha1=0.2923。
例 3.2 马克/美元 10 分钟收益:收益无序列相关,\(a_t^2\) 的 PACF 在滞后 1、3 有大尖峰(高阶也有,但低阶更重要),设定 ARCH(3)。条件高斯似然:\(r_t=0.0018+\sigma_t\epsilon_t\),
3.5 GARCH 模型(The GARCH Model,PDF p.151–160)
ARCH 常需很多参数(如例 3.3 S&P 500 月超额收益需 ARCH(9))。Bollerslev (1986) 提出广义 ARCH。设 \(a_t=r_t-\mu_t\),GARCH(\(m,s\)):
ARMA 表示:令 \(\eta_t=a_t^2-\sigma_t^2\),代入 \(\sigma_{t-i}^2=a_{t-i}^2-\eta_{t-i}\) 得
GARCH(1,1):
- 大的 \(a_{t-1}^2\) 或 \(\sigma_{t-1}^2\) 导致大的 \(\sigma_t^2\)——波动聚集。
- 若 \(1-2\alpha_1^2-(\alpha_1+\beta_1)^2>0\),则
\[\frac{E(a_t^4)}{[E(a_t^2)]^2}=\frac{3[1-(\alpha_1+\beta_1)^2]}{1-(\alpha_1+\beta_1)^2-2\alpha_1^2}>3,\]尾部比正态厚。
- 给出描述波动演化的简单参数函数。
预测:\(\sigma_h^2(1)=\alpha_0+\alpha_1a_h^2+\beta_1\sigma_h^2\)。多步时用 \(a_t^2=\sigma_t^2\epsilon_t^2\) 改写 \(\sigma_{t+1}^2=\alpha_0+(\alpha_1+\beta_1)\sigma_t^2+\alpha_1\sigma_t^2(\epsilon_t^2-1)\),因 \(E(\epsilon_{h+1}^2-1|F_h)=0\),
弱点:文献极多(Bollerslev–Chou–Kroner 1992;Bollerslev–Engle–Nelson 1994)。与 ARCH 一样对正负冲击反应相同;高频数据研究表明即使用标准化 t 新息,GARCH 的尾部仍然偏短(见 3.16 节)。
3.5.1 示例(An Illustrative Example,PDF p.154–159)
GARCH 定阶不易,实践中多用低阶 GARCH(1,1)、(2,1)、(1,2)。只要假设波动初值已知,条件 MLE 仍适用:GARCH(1,1) 中将 \(\sigma_1^2\) 固定后可递推,常用 \(a_t\) 的样本方差作初值。用 \(\tilde a_t=a_t/\sigma_t\) 及其平方检验。
例 3.3 S&P 500 月超额收益(1926–1991,792 个观测,图 3.6):图 3.7 \(r_t\) 在滞后 1、3 有序列相关,\(r_t^2\) 的 PACF 显示强线性相依。MA(3):\(r_t=0.0062+a_t+0.0944a_{t-1}-0.1407a_{t-3}\),\(\hat\sigma_a=0.0576\);为简便改用 AR(3):
预测:\(\sigma_h^2(1)=0.000086+0.1216a_h^2+0.8511\sigma_h^2\),\(\sigma_0^2\) 取 0 或无条件方差,多步用 (3.17)。表 3.1(原点 \(h=792\),1991 年 12 月):收益预测均为 0.0076;波动(条件标准差)1–5 步 0.0536、0.0537、0.0537、0.0538、0.0538,∞ 步 0.0560。S-Plus:garch(sp~ar(3),~garch(1,1))、fit$sigma.t、fit$residuals、predict(fit,5)。
t 新息(5 自由度固定):
cond.dist='t',cond.par=5,cond.est=F。
估计自由度:(3.21) 系数同 (3.20),自由度估计 7.02(标准误 1.78),5% 水平不能拒绝 \(v=5\)。R:garchFit(~arma(3,0)+garch(1,1),data=sp5);garchFit(~garch(1,1),data=sp5,cond.dist="std");residuals(m2,standardize=T)。
3.5.2 预测评价(Forecasting Evaluation,PDF p.159–160)
波动不可观测,比较模型预测能力很难。有研究用样本外 \(a_{h+\ell}^2\) 与 \(\sigma_h^2(\ell)\) 比较,常得到很低的相关(低 \(R^2\))。这并不奇怪:虽然 \(E(a_{h+1}^2|F_h)=\sigma_{h+1}^2\),\(a_{h+1}^2\) 是一致(无偏)的,但单个观测无法准确估计方差,噪声极大。严格说该评价方法不恰当;参见 Andersen & Bollerslev (1998)(用已实现波动率作为代理)。
3.5.3 两步估计法(A Two-Pass Estimation Method,PDF p.160)
基于 (3.15):第一步忽略 ARCH 效应,用第 2 章方法估计均值方程,得残差 \(a_t\);第二步把 \(\{a_t^2\}\) 当作观测序列,用 ML 拟合 ARMA (3.15),得 AR 系数 \(\hat\phi_i\) 与 MA 系数 \(\hat\theta_i\),则
3.6 求和 GARCH 模型(The Integrated GARCH Model,PDF p.160–162)
若 (3.15) 的 AR 多项式有单位根,即为 IGARCH——单位根 GARCH。与 ARIMA 类似,过去平方冲击 \(\eta_{t-i}\) 对 \(a_t^2\) 的影响是持久的。IGARCH(1,1):
当 \(\alpha_1+\beta_1=1\),由 (3.17) 得
\(\alpha_0=0\) 的特例:所有步长的预测都等于 \(\sigma_h^2(1)\)——这正是 RiskMetrics 的波动率模型(第 7 章 VaR)。它也是 \(\{a_t^2\}\) 的指数平滑:
3.7 GARCH-M 模型(The GARCH-M Model,PDF p.162–163)
证券收益可能依赖其波动(风险–收益权衡),GARCH in the mean:
例:S&P 500 月超额收益(1926-01—1991-12)高斯 GARCH(1,1)-M:
var.in.mean,\(\sigma_t\) 用 sd.in.mean,\(\ln\sigma_t^2\) 用 logvar.in.mean;如 garch(sp~1+var.in.mean,~garch(1,1))。风险溢价思想可用于其他 GARCH 模型。
3.8 指数 GARCH 模型(The Exponential GARCH Model,PDF p.163–169)
Nelson (1991) 为允许正负收益的不对称效应,引入加权新息
EGARCH(\(m,s\)):
EGARCH(1,1)(\(\epsilon_t\) 标准正态):
3.8.1 替代形式(Alternative Model Form,PDF p.164)
正的 \(a_{t-i}\) 对对数波动贡献 \(\alpha_i(1+\gamma_i)|\epsilon_{t-i}|\),负的贡献 \(\alpha_i(1-\gamma_i)|\epsilon_{t-i}|\),\(\gamma_i\) 表示杠杆效应,实践中预期为负。S-Plus 采用此形式。
3.8.2 示例:Nelson (1991)(PDF p.165)
CRSP VW 指数日超额收益(1962-07—1987-12,6408 个观测;超额收益用月度国库券收益扣除,假设月内每日相同):
3.8.3 第二个例子(PDF p.165–167)
IBM 月对数收益(1926-01—1997-12,864 个观测),AR(1)–EGARCH(1,1):
样本延长到 2003 年(936 个观测),S-Plus garch(ibmln~1,~egarch(1,1),leverage=T,cond.dist='ged'):GED 参数 1.5003(0.0991),
3.8.4 EGARCH 预测(PDF p.167–169)
设参数已知、新息标准正态,EGARCH(1,1):\(\ln\sigma_t^2=(1-\alpha_1)\alpha_0+\alpha_1\ln\sigma_{t-1}^2+g(\epsilon_{t-1})\),
3.9 门限 GARCH 模型(The Threshold GARCH Model,PDF p.169–170)
另一个处理杠杆效应的常用模型(Glosten–Jagannathan–Runkle 1993;Zakoian 1994)。TGARCH(\(m,s\)):
例:IBM 月对数收益(1926–2003),GED 新息 TGARCH(1,1):
garch(ibmln~1,~tgarch(1,1),leverage=T,cond.dist='ged')。
EGARCH 与 TGARCH 比较(\(\epsilon_{t-1}=\pm2\)):EGARCH(1,1) (3.32) 中 \(\epsilon_{t-1}=-2\) 时对数波动贡献 \(0.22(2+0.528)\),\(+2\) 时为 \(0.22(2-0.528)\),差为 \(0.22\times2\times2\times0.264\approx0.232\),比值约 \(e^{0.232}\approx1.26\)(原文写作 \(e^{0.22\times2\times0.632}\approx1.264\),指数表达式疑有排印错误,结论约 1.26);TGARCH(1,1) 忽略常数项给出
3.10 CHARMA 模型(The CHARMA Model,PDF p.170–172)
条件异方差自回归移动平均模型(Tsay 1987)用随机系数产生条件异方差,与 ARCH 不同但二阶条件性质相似:
例:S&P 500 月超额收益,\(r_t=\phi_0+a_t\),\(a_t=\delta_{1t}a_{t-1}+\delta_{2t}a_{t-2}+\eta_t\):
3.10.1 解释变量的影响(Effects of Explanatory Variables,PDF p.172)
CHARMA 易推广为波动依赖解释变量:
3.11 随机系数自回归模型(Random Coefficient Autoregressive Models,PDF p.172–173)
RCA 原用于刻画不同研究对象间的变异(类似面板数据与分层模型),历史上用于让参数随时间演化以更好地描述条件均值;这里归入条件异方差模型。RCA(\(p\))(Nicholls & Quinn 1982):
3.12 随机波动率模型(Stochastic Volatility Model,PDF p.173–174)
另一种思路是在条件方差方程中引入新息(Melino & Turnbull 1990;Taylor 1994;Harvey–Ruiz–Shephard 1994;Jacquier–Polson–Rossi 1994)。与 EGARCH 一样用 \(\ln\sigma_t^2\) 保证正性。SV 模型:
\(m=1\) 时性质(JPR 1994 附录):
3.13 长记忆随机波动率模型(Long-Memory Stochastic Volatility Model,PDF p.174–175)
动机:收益本身无序列相关,但其平方或绝对值的 ACF 衰减很慢(Ding–Granger–Engle 1993)。图 3.10:S&P 500 指数与 IBM 日绝对对数收益(1962-07-03—2003-12-31)的 ACF 为正、数值中等、缓慢衰减(200 阶内仍在 5% 界外)。LMSV:
3.14 应用(Application,PDF p.175–179)
数据:IBM 与 S&P 500 月对数收益(1926-01—1999-12,888 个观测,百分比,含分红;图 3.11),用 RATS 估计。
例 3.4 夏季效应:股票日波动在夏季是否更低、低多少?这对期权定价有实际意义。IBM 高斯 GARCH(1,1):
例 3.5 成分股收益对指数波动的贡献:S&P 500 月对数收益的特殊 GARCH(2,1)(只含 \(a_{t-2}^2\)):
3.15 替代方法(Alternative Approaches,PDF p.179–184)
3.15.1 使用高频数据(Use of High-Frequency Data,PDF p.179–182)
French–Schwert–Stambaugh (1987) 用高频数据计算低频收益的波动;随着高频数据普及受到广泛关注(Andersen–Bollerslev–Diebold–Labys 2001a,b)。设月对数收益 \(r_t^m=\sum_{i=1}^nr_{t,i}\)(\(n\) 个交易日),
- 若日收益为白噪声:\(\operatorname{Var}(r_t^m|F_{t-1})=n\operatorname{Var}(r_{t,1})\),用 \(\hat\sigma^2=\sum(r_{t,i}-\bar r_t)^2/(n-1)\) 估计,
\[\hat\sigma_m^2=\frac{n}{n-1}\sum_{i=1}^n(r_{t,i}-\bar r_t)^2.\tag{3.49}\]
- 若日收益为 MA(1):\(\operatorname{Var}=n\operatorname{Var}(r_{t,1})+2(n-1)\operatorname{Cov}(r_{t,1},r_{t,2})\),
\[\hat\sigma_m^2=\frac{n}{n-1}\sum_{i=1}^n(r_{t,i}-\bar r_t)^2+2\sum_{i=1}^{n-1}(r_{t,i}-\bar r_t)(r_{t,i+1}-\bar r_t).\tag{3.50}\]困难:(1) 日收益模型未知,协方差难估;(2) 每月约 21 个交易日,样本小,精度存疑;若日收益超额峰度高且有序列相关,(3.49)(3.50) 甚至可能不一致(Bai–Russell–Tiao 2004)。
例 3.6:S&P 500 月波动(1980-01—1999-12)三种估计:(a) 日收益白噪声 (3.49);(b) 日收益 MA(1) (3.50);(c) 用 1962–1999 月收益拟合 GARCH(1,1):\(r_t^m=0.658+a_t\),\(\sigma_t^2=3.349+0.086a_{t-1}^2+0.735\sigma_{t-1}^2\)。图 3.12:基于日收益的估计远高于 GARCH 估计,1987 年 10 月日收益法约达 680(图截断到同一尺度)。
已实现波动率(realized volatility):若进一步设 \(\bar r_t=0\),则 \(\hat\sigma_m^2\approx\sum r_{t,i}^2\)。推广到用日内收益估计日波动:\(r_t=\sum_{i=1}^nr_{t,i}\),
3.15.2 使用日开高低收价(Use of Daily Open, High, Low, and Close Prices,PDF p.182–184)
Parkinson (1980)、Garman & Klass (1980)、Rogers & Satchell (1991)、Yang & Zhang (2000) 表明 OHLC 信息可改进波动估计。记 \(C_t\) 收盘价、\(O_t\) 开盘价、\(f\in[0,1]\) 为一天中休市时间的比例、\(H_t\) 最高价、\(L_t\) 最低价(图 3.13)。常规方差 \(\sigma_t^2=E[(C_t-C_{t-1})^2|F_{t-1}]\)。Garman–Klass 在无漂移简单扩散假设下考虑:
- \(\hat\sigma_{0,t}^2=(C_t-C_{t-1})^2\);
- \(\hat\sigma_{1,t}^2=\dfrac{(O_t-C_{t-1})^2}{2f}+\dfrac{(C_t-O_t)^2}{2(1-f)}\),\(0<f<1\);
- \(\hat\sigma_{2,t}^2=\dfrac{(H_t-L_t)^2}{4\ln2}\approx0.3607(H_t-L_t)^2\)(Parkinson 1980,\(f=0\));
- \(\hat\sigma_{3,t}^2=0.17\dfrac{(O_t-C_{t-1})^2}{f}+0.83\dfrac{(H_t-L_t)^2}{(1-f)4\ln2}\);
- \(\hat\sigma_{5,t}^2=0.5(H_t-L_t)^2-[2\ln2-1](C_t-O_t)^2\approx0.5(H_t-L_t)^2-0.386(C_t-O_t)^2\);
- \(\hat\sigma_{6,t}^2=0.12\dfrac{(O_t-C_{t-1})^2}{f}+0.88\dfrac{\hat\sigma_{5,t}^2}{1-f}\)。
(另有更精确但复杂的 \(\hat\sigma_{4,t}^2\),接近 \(\hat\sigma_{5,t}^2\)。)效率因子 \(\text{Eff}(\hat\sigma_{i,t}^2)=\operatorname{Var}(\hat\sigma_{0,t}^2)/\operatorname{Var}(\hat\sigma_{i,t}^2)\):\(i=1,2,3,5,6\) 分别约 2、5.2、6.2、7.4、8.4。
对数形式与 Yang–Zhang 估计量:\(o_t=\ln O_t-\ln C_{t-1}\)(标准化开盘)、\(u_t=\ln H_t-\ln O_t\)(标准化最高)、\(d_t=\ln L_t-\ln O_t\)(标准化最低)、\(c_t=\ln C_t-\ln O_t\)(标准化收盘)。\(n\) 天内波动不变时,Yang & Zhang (2000) 推荐稳健估计
\(H_t-L_t\) 称极差(range),引出基于极差的波动估计(Alizadeh–Brandt–Diebold 2002)。实践中价格只在离散时点观测,观测到的最高价偏低、最低价偏高,极差被低估,从而波动被低估;偏差依交易频率与 tick size 而定,活跃股票可忽略,其他股票需进一步研究。
3.16 GARCH 模型的峰度(Kurtosis of GARCH Models,PDF p.185–186)
波动估计的不确定性常被忽视,评估它需考虑模型峰度。GARCH(1,1):\(a_t=\sigma_t\epsilon_t\),\(\sigma_t^2=\alpha_0+\alpha_1a_{t-1}^2+\beta_1\sigma_{t-1}^2\),\(\alpha_0>0,\alpha_1,\beta_1\ge0,\alpha_1+\beta_1<1\),\(E(\epsilon_t)=0\),\(\operatorname{Var}(\epsilon_t)=1\),\(E(\epsilon_t^4)=K_\epsilon+3\)(\(K_\epsilon\) 为新息超额峰度)。则 \(\operatorname{Var}(a_t)=E(\sigma_t^2)=\alpha_0/[1-(\alpha_1+\beta_1)]\),\(E(a_t^4)=(K_\epsilon+3)E(\sigma_t^4)\)。对波动方程平方
- 高斯新息(\(K_\epsilon=0\)):\(K_a^{(g)}=\dfrac{6\alpha_1^2}{1-2\alpha_1^2-(\alpha_1+\beta_1)^2}\)。含义:(a) 峰度存在需 \(1-2\alpha_1^2-(\alpha_1+\beta_1)^2>0\);(b) \(\alpha_1=0\) 时 \(K_a^{(g)}=0\),无厚尾。
- 非高斯新息:
\[K_a=\frac{K_\epsilon+K_a^{(g)}+\frac56K_\epsilon K_a^{(g)}}{1-\frac16K_\epsilon K_a^{(g)}}.\]此结果源自 George C. Tiao(见 Bai–Russell–Tiao 2003),对峰度存在的所有 GARCH 模型成立。如 ARCH(1)(\(\beta_1=0\)):\(K_a^{(g)}=6\alpha_1^2/(1-3\alpha_1^2)\),\(K_a=\dfrac{(K_\epsilon+3)(1-\alpha_1^2)}{1-(K_\epsilon+3)\alpha_1^2}-3\),同样满足上式。
- 结论:\(\alpha_1\) 决定尾部行为;\(\alpha_1=0\) 时 \(K_a=K_\epsilon\)(与新息同尾),\(\alpha_1>0\) 时 \(K_a^{(g)}>0\),\(a_t\) 厚尾。
- 标准化 Student-t(\(v>4\)):\(E(\epsilon_t^4)=6/(v-4)+3\),\(K_\epsilon=6/(v-4)\)——这是本章预设自由度时取 \(t_5\) 的部分原因。此时 \(K_a=[6+(v+1)K_a^{(g)}]/[v-4-K_a^{(g)}]\),需 \(1-2\alpha_1^2(v-1)/(v-4)-(\alpha_1+\beta_1)^2>0\)。
附录:估计波动率模型的 RATS 程序(PDF p.187–188)
数据 sp500.txt(792 个月超额收益)。三个程序:(1) 常数均值的高斯 GARCH(1,1):set h=0.0 初始化条件方差;nonlin mu a0 a1 b1;frml at=rt(t)-mu;frml gvar=a0+a1*at(t-1)**2+b1*h(t-1);frml garchln=-0.5*log(h(t)=gvar(t))-0.5*at(t)**2/h(t);smpl 2 792;初值 a0=0.01、a1=0.1、b1=0.5、mu=0.1;maximize(method=bhhh,recursive,iterations=150);用 cor(qstats,number=20,span=10) 检验标准化残差及其平方。(2) Student-t 新息 GARCH(1,1):增加参数 v(初值 10),对数似然含 %LNGAMMA((v+1)/2.)-%LNGAMMA(v/2.)-0.5*log(v-2.) 与 -((v+1)/2.)*log(1.0+tt(t)/(v-2.0))-0.5*log(h(t))。(3) IBM 月对数收益(864 个)AR(1)–EGARCH(1,1):h 表示 \(\ln\sigma_t^2\),frml g=th*epsi(t)+ga*(abs(epsi(t))-sqrt(2./%PI)),frml gvar=a1*h(t-1)+(1-a1)*a0+g(t-1)。
习题(PDF p.188–191)
- 3.1、3.2:推导 GARCH(1,2)、GARCH(2,1) 的多步预测(考查 ARMA 表示与递推)。
- 3.3、3.4:推导 AR(1)–GARCH(1,1) 在高斯/标准化 t 新息下的条件对数似然。
- 3.5:Intel 月对数收益(1973–2008)建 GARCH,计算 2008 年 12 月为原点的 1–5 步波动预测。
- 3.6:Merck 月收益(1946-06—2008-12):序列相关检验、ARCH 效应检验(\(Q(6)\)、\(Q(12)\))、识别并拟合 ARCH。
- 3.7:3M 月收益:ARCH 效应检验;PACF 定阶 ARCH;前 750 个观测重估并预测 751–755;ARCH-M 风险溢价检验;EGARCH 及 1–5 步预测。
- 3.8:GM 月收益(1950–2008):高斯 GARCH、GARCH-M、估计自由度的 t-GARCH(检验 \(H_0:v=6\))、EGARCH,比较 1–6 步波动预测。
- 3.9:GM 月收益 TGARCH,检验杠杆效应并预测。
- 3.10:S&P 500 月收益高斯 GARCH;检验夏季效应;GM 滞后收益是否有助于指数波动建模(复现例 3.4、3.5)。
- 3.11:GM 日收益(1999–2008):ARCH 效应检验、平方收益 PACF、高斯与 GED GARCH。
- 3.12:S&P 日简单收益:ARCH 检验、GARCH 建模、1–4 步收益与波动预测。
- 3.13:GM 日收益 GARCH-M 与 EGARCH(杠杆效应检验)。
- 3.14:S&P 对数收益拟合 AR(5)(仅滞后 3、5)–GARCH(1,1)-GED,得 spvol,把它作为 GM 波动方程的外生变量(S-Plus:
garch(gm~1,~garch(1,1)+spvol,cond.dist='ged')),讨论市场波动对个股波动的意义。 - 3.15:反过来用 GM 波动 gmvol 作为 S&P 波动方程的外生变量,判断个股波动是否有助于指数波动建模。
参考文献(p.191–193):Alizadeh–Brandt–Diebold (2002)、Andersen & Bollerslev (1998)、Andersen 等 (2001a,b)、Bai–Russell–Tiao (2003, 2004)、Barndorff-Nielsen & Shephard (2004)、Bollerslev (1986)、Bollerslev & Jubinski (1999)、Bollerslev–Chou–Kroner (1992)、Bollerslev–Engle–Nelson (1994)、Breidt–Crato–de Lima (1998)、Cao & Tsay (1992)、Ding–Granger–Engle (1993)、Engle (1982)、Fernández & Steel (1998)、French–Schwert–Stambaugh (1987)、Garman & Klass (1980)、Glosten–Jagannathan–Runkle (1993)、Harvey–Ruiz–Shephard (1994)、Jacquier–Polson–Rossi (1994)、Lambert & Laurent (2001)、McLeod & Li (1983)、Melino & Turnbull (1990)、Nelson (1990, 1991)、Nicholls & Quinn (1982)、Parkinson (1980)、Ray & Tsay (2000)、Rogers & Satchell (1991)、Taylor (1994)、Tong (1978, 1990)、Tsay (1987)、Yang & Zhang (2000)、Zakoian (1994)。p.194 空白。
第 3 章小结
本章要点
- 波动率 = 条件标准差,不可直接观测;四个典型特征:聚集、连续演化、平稳有界、杠杆效应。
- 建模框架:均值方程 + 波动方程;收益"不相关但相依",用残差平方的 Ljung–Box(McLeod–Li)或 Engle LM 检验 ARCH 效应;四步建模流程。
- ARCH(\(m\)):\(\sigma_t^2=\alpha_0+\sum\alpha_ia_{t-i}^2\);ARCH(1) 无条件方差 \(\alpha_0/(1-\alpha_1)\),峰度 \(3(1-\alpha_1^2)/(1-3\alpha_1^2)>3\);用 \(a_t^2\) 的 PACF 定阶;条件似然估计(正态、t、偏 t、GED);用标准化残差及其平方诊断。
- GARCH(\(m,s\)) 是 \(a_t^2\) 的 ARMA (3.15);GARCH(1,1) 的持续性 \(\alpha_1+\beta_1\) 决定多步预测向无条件方差 \(\alpha_0/(1-\alpha_1-\beta_1)\) 收敛的速度;实证中 \(\alpha_1+\beta_1\) 常接近 1。
- 用 \(a_{h+1}^2\) 评价波动预测不恰当(噪声太大);两步估计法是简便近似。
- IGARCH:无条件方差不存在,预测线性增长;\(\alpha_0=0\) 时即 RiskMetrics 的 EWMA。
- GARCH-M 把波动放入均值方程刻画风险溢价,会引入收益序列相关。
- 不对称模型:EGARCH(对数方差、\(g(\epsilon)\) 不对称、无正性约束)与 TGARCH/GJR(负冲击额外系数 \(\gamma\));IBM 例中两倍标准差负冲击使方差高出约 26%–37%。
- CHARMA/RCA 以随机系数产生条件异方差(含交叉项);SV 在波动方程中加入独立新息,估计需 Kalman 拟似然或 MCMC;LMSV 用分数差分刻画波动长记忆(\(d\approx0.38\))。
- 外生变量可进入波动方程(夏季效应、成分股收益)。
- 替代估计:已实现波动率(日内收益平方和,注意微观结构噪声与隔夜收益);OHLC 估计量(Parkinson、Garman–Klass、Rogers–Satchell、Yang–Zhang),效率可达收盘价估计的 5–8 倍。
- GARCH 峰度公式 \(K_a=\frac{K_\epsilon+K_a^{(g)}+\frac56K_\epsilon K_a^{(g)}}{1-\frac16K_\epsilon K_a^{(g)}}\),\(\alpha_1\) 决定尾部。
与量化交易的关联
- 风险建模与 VaR:GARCH/EWMA 波动预测是日度 VaR、ES、保证金和风险预算的核心输入;RiskMetrics 即 IGARCH(1,1) 无截距特例(第 7 章);t/偏 t 新息改善尾部风险刻画。
- 波动率目标与仓位管理:波动率择时(volatility targeting)、风险平价按预测波动缩放头寸;GARCH 多步预测的均值回复决定不同持有期的风险预算;持续性接近 1 意味着波动冲击衰减很慢。
- 期权定价与波动交易:Black–Scholes 需要 \(\sigma\);隐含波动通常高于 GARCH 波动(波动风险溢价),是卖方波动策略的收益来源之一;夏季效应等季节性可用于期权定价调整;VIX 期货是可交易工具。
- 杠杆效应:EGARCH/GJR 的不对称性对下行风险、偏度交易、看跌期权偏斜(skew)建模有用。
- 因子与信号:波动率本身是常用因子(低波动异象);GARCH-M 检验风险–收益关系;把市场波动作为个股波动方程的外生变量(习题 3.14)对应 beta/系统性风险分解。
- 数据工程:已实现波动率需要处理采样频率(4–15 分钟)、微观结构噪声和隔夜跳空;只有日线 OHLC 时,Parkinson/Garman–Klass/Yang–Zhang 估计量能以很低成本大幅提高波动估计效率,是日频风险模型和回测中常用的实用工具。
- 模型评价:用平方收益做预测评价会严重低估模型能力,回测波动模型应以已实现波动或 QLIKE 等稳健损失评价。
推荐习题
- 3.1/3.2:GARCH 多步预测推导,理解 ARMA 表示。
- 3.3/3.4:自己写出条件对数似然,为手写 GARCH 估计器打基础。
- 3.7:3M 完整流程(检验—定阶—样本外预测—ARCH-M—EGARCH),覆盖本章主要工具。
- 3.8:多种模型的预测比较与 t 分布自由度检验。
- 3.10:复现夏季效应和成分股外生变量的分析方法。
- 3.14/3.15:市场波动与个股波动的相互作用,贴近多因子风险模型。
第 4 章 非线性模型及其应用(Nonlinear Models and Their Applications,PDF p.195–232,续见下一块)
章首导言(PDF p.195–197)
单变量序列 \(\{x_t\}_{t=1}^T\)。如第 2 章,纯随机序列若可写成
用条件矩表述:\(F_{t-1}\) 为 \(t-1\) 时刻(含)可得信息生成的 σ 域(通常是 \(\{x_{t-1},x_{t-2},\dots\}\) 和 \(\{a_{t-1},a_{t-2},\dots\}\) 的线性组合),
文献中的非线性模型:双线性模型(Granger & Andersen 1978)、门限自回归 TAR(Tong 1978)、状态相依模型(Priestley 1980)、马尔可夫转换模型(Hamilton 1989)——让 \(\mu_t\) 按简单参数非线性函数演化。借助计算进步的新模型:非线性状态空间(Carlin–Polson–Stoffer 1992)、函数系数 AR(Chen & Tsay 1993a)、非线性可加 AR(Chen & Tsay 1993b)、多元自适应回归样条 MARS(Lewis & Stevens 1991)——用模拟描述条件分布演化或用数据驱动方法探索非线性。还有核回归、人工神经网络等非参数/半参数方法。另一方向是区分线性与非线性的检验:参数检验多用 LM 或似然比统计量,非参数检验依赖高阶谱或混沌序列中的关联维数概念。本章结构:4.1 模型;4.2 非线性检验;4.3–4.4 建模与预测;4.5 应用。
4.1 非线性模型(Nonlinear Models,PDF p.197–225)
多数非线性模型关注条件均值方程(综述见 Priestley 1988;Tong 1990),这里介绍适用于金融序列的模型。
4.1.1 双线性模型(Bilinear Model,PDF p.197–198)
线性模型 (4.1) 是 (4.2) 中 \(f\) 的一阶 Taylor 展开,自然的推广是加入二阶项:
例 4.1 CRSP 等权指数月简单收益(1926-01—2008-12,996 个观测):PACF 在滞后 1、3 显著,用 AR(3);残差平方提示条件异方差依赖滞后 1、3、8(为简便略去 8)。特殊双线性模型 \(R_t=\mu+\phi_1R_{t-1}+\phi_3R_{t-3}+(1+\beta_1a_{t-1}+\beta_3a_{t-3})a_t\),\(a_t=\beta_0\epsilon_t\)。条件正态 MLE:
4.1.2 门限自回归模型(Threshold Autoregressive (TAR) Model,PDF p.199–204)
动机:实际中常见的非线性特征,如过程下降与上升模式不对称。TAR 用分段线性模型逼近条件均值,但与传统在"时间"空间分段不同,TAR 在门限空间分段。
简单两区制 AR(1):
- 尽管第一区制系数 −1.5(爆炸性),过程仍几何遍历(geometrically ergodic)且平稳。(4.8) 几何遍历的充要条件是 \(\phi_1^{(1)}<1\)、\(\phi_1^{(2)}<1\)、\(\phi_1^{(1)}\phi_1^{(2)}<1\)(Petruccelli & Woolford 1984;Chen & Tsay 1991)。遍历性很重要:样本均值收敛到总体均值的结论称遍历定理(ergodic theorem),相当于 iid 情形的大数定律/中心极限理论的对应物。
- 上升与下降不对称:\(x_{t-1}<0\) 时由于负的爆炸系数,\(x_t\) 倾向于跳到正值;\(x_{t-1}>0\) 时需多期才回落到负值。故区制 2 观测更多,变负后出现大的向上跳跃——序列不可时间反转(not time reversible)。
- 无常数项但 \(E(x_t)\ne0\):该样本均值 0.61(标准差 0.07)。一般 \(E(x_t)\) 是两区制条件均值按平稳分布下处于各区制概率的加权平均;要使 TAR 均值为零,某些区制需非零常数——与线性平稳模型(非零常数意味均值非零)截然不同。
\(k\) 区制自激 TAR(SETAR),门限变量 \(x_{t-d}\):
例 4.2 美国月度失业率(季调,百分比,1948-01—2009-03,735 个观测,图 4.2):整体缓慢上升;上升快、下降慢——不可时间反转,可能也非单位根平稳。样本 ACF 衰减慢,用一阶差分 \(y_t=(1-B)u_t\)。ARIMA:
门限思想用于波动率:门限模型可处理正负收益的波动不对称,也可研究指数期货与现货的套利(第 8 章)。这里介绍比第 3 章 GJR 更一般的 TGARCH 参数化。
例 4.3 IBM 日对数收益(百分比,含分红,1962-07-03—2003-12-31,10,446 个观测,图 4.3;后期波动更大;用 SCA 估计):
- AR(2)–GARCH(1,1):
\[r_t=0.062-0.024r_{t-2}+a_t,\quad\sigma_t^2=0.037+0.077a_{t-1}^2+0.913\sigma_{t-1}^2,\tag{4.12}\]标准误 0.015、0.010;0.004、0.003、0.003,均显著。\(\tilde a_t\) 的 \(Q(10)=5.19\)(0.82)、\(Q(20)=24.38\)(0.18)(因估计了 AR(2) 系数用 \(\chi^2_{m-1}\)),\(\tilde a_t^2\) 的 \(Q(10)=11.67\)(0.31)、\(Q(20)=18.25\)(0.57)。但模型隐含无条件均值 0.060,远大于样本均值 0.039,可能设定错误。
- GJR 型 TGARCH:
\[r_t=0.014-0.028r_{t-2}+a_t,\quad\sigma_t^2=0.075+0.081P_{t-1}a_{t-1}^2+0.157N_{t-1}a_{t-1}^2+0.863\sigma_{t-1}^2,\tag{4.13}\]\(P_{t-1}=1-N_{t-1}\);标准误 0.013、0.009;0.007、0.008、0.010、0.010,除均值常数外均显著。\(\tilde a_t\) 的 \(Q(10)=2.47\)、\(Q(20)=25.90\),但 \(\tilde a_t^2\) 的 \(Q(10)=97.07\)、\(Q(20)=170.3\)(p=0.00)——未能刻画条件异方差。
- AR(2)–TAR–GARCH(1,1)(允许 \(\sigma_{t-1}^2\) 的系数也依赖 \(a_{t-1}\) 的符号):
\[r_t=0.033-0.023r_{t-2}+a_t,\quad\sigma_t^2=0.075+0.041a_{t-1}^2+0.903\sigma_{t-1}^2+(0.030a_{t-1}^2+0.062\sigma_{t-1}^2)N_{t-1},\tag{4.14}\]全部 1% 显著;\(\hat a_t\) 的 \(Q(10)=6.09\)(0.73)、\(Q(20)=25.29\)(0.15),\(\hat a_t^2\) 的 \(Q(10)=13.54\)(0.20)、\(Q(20)=19.56\)(0.49),充分;无条件均值 0.033,更接近样本均值 0.039。结论:IBM 日波动的不对称性远强于 GJR 所允许的;可进一步约束 \(a_{t-1}<0\) 时 \(a_{t-1}^2\) 与 \(\sigma_{t-1}^2\) 系数之和为 1(负冲击区制为 IGARCH)。注:附录 A 给出估计该模型的 RATS 程序,结果可能与 SCA 略有差异。
4.1.3 平滑转移 AR 模型(Smooth Transition AR (STAR) Model,PDF p.204–206)
对 SETAR 的批评:条件均值在门限处不连续。平滑 TAR(Chan & Tong 1986;Teräsvirta 1994)。两区制 STAR(\(p\)):
例 4.4 3M 月简单收益(1946-02—2008-12):ARCH(2)
optim(BFGS,hessian=T)最小化负对数似然:自定义函数 star(par) 对 \(t\ge3\) 递推 \(a_t=R_t-\mu\)、sig=par[2]+par[3]*at[t-1]^2+par[4]*at[t-2]^2、sig1=par[5]+par[6]*at[t-1]^2、tt=sqrt(sig+sig1/(1+exp(-1000*at[t-1]))),累加 log(tt)+0.5*x^2;初值 c(.001,.002,.256,.141,.002,-.314)。RATS 程序见附录 A。
4.1.4 马尔可夫转换模型(Markov Switching Model,PDF p.206–209)
概率转换思想见 Tong (1983);Hamilton (1989) 强调经济状态间的非周期转换,提出马尔可夫转换自回归(MSA),由隐藏的两状态马尔可夫链驱动:
与 SETAR 的区别:MSA 用隐藏马尔可夫链(随机机制)控制转换,SETAR 由特定滞后变量(确定机制)决定。MSA 中永远无法确知 \(x_t\) 所处状态,样本大时可用滤波推断;SETAR 中只要 \(x_{t-d}\) 已观测,区制就已知。预测上:MSA 的预测总是各状态子模型预测的线性组合;SETAR 预测只来自单一区制(只要 \(x_{t-d}\) 已观测),预测步长超过 \(d\) 后才成为各区制预测的组合。MSA 因状态不可观测更难估计:Hamilton (1990) 用 EM 算法(期望与最大化迭代);McCulloch & Tsay (1994) 用 MCMC(第 12 章)。推广:McCulloch & Tsay (1993) 令转移概率为 \(t-1\) 时可得解释变量的 logistic 或 probit 函数;Chen–McCulloch–Tsay (1997) 用马尔可夫转换做非嵌套非线性模型(如双线性与 SETAR)的比较选择,每个竞争模型对应一个状态,是贝叶斯优比(odds ratio)的推广;可推广到多于两状态,但计算量急剧增加。参见 Hamilton (1994, 第 22 章)。
例 4.5 美国季度实际 GNP 增长率(季调,百分比,1947Q2–1991Q1,图 4.4):该序列广泛用于非线性分析(TAR:Tiao & Tsay 1994、Potter 1995;马尔可夫转换:Hamilton 1989、McCulloch & Tsay 1994)。MSA(\(p=4\)),Gibbs 抽样 5000 次迭代,表 4.1(后验均值,括号为后验标准差):
- 状态 1:\(c=0.909\)(0.202),\(\phi_1=0.265\)(0.113),\(\phi_2=0.029\)(0.126),\(\phi_3=-0.126\)(0.103),\(\phi_4=-0.110\)(0.109),\(\sigma=0.816\)(0.125),\(w=0.118\)(0.053);
- 状态 2:\(c=-0.420\)(0.324),\(\phi_1=0.216\)(0.347),\(\phi_2=0.628\)(0.377),\(\phi_3=-0.073\)(0.364),\(\phi_4=-0.097\)(0.404),\(\sigma=1.017\)(0.293),\(w=0.286\)(0.064)。
发现:(1) 状态 1 边际均值 \(0.909/(1-0.265-0.029+0.126+0.110)=0.965\),状态 2 为 \(-0.42/(1-0.216-0.628+0.073+0.097)=-1.288\),即状态 1 为扩张、状态 2 为收缩;(2) 状态 2 后验标准差大,因为负增长季度少;(3) 转移概率不同,走出收缩(0.286)比陷入收缩(0.118)更容易;(4) 期望持续期:收缩约 \(1/0.286\approx3.69\) 季度(约一年),扩张约 \(1/0.118\approx11.31\) 季度(约 3 年);(5) \(x_{t-2}\) 的系数在两状态差异很大,扩张与收缩期的经济动态不同。
4.1.5 非参数方法(Nonparametric Methods,PDF p.209–218)
当无法预先设定 \(Y\) 与 \(X\) 的非线性结构,或想利用计算能力探索函数关系时,用非参数方法。代价:高度依赖数据、易过拟合。本节介绍核回归、局部最小二乘(局部线性回归)和神经网络。
平滑的本质:
核回归(kernel regression):核 \(K(x)\) 通常是密度函数,\(K(x)\ge0\),\(\int K(z)dz=1\)。用带宽(bandwidth)\(h>0\) 重标度:
带宽的作用(以 Epanechnikov 核在观测点处为例):\(h\to0\) 时 \(\hat m(x_t)\to K_h(0)y_t/K_h(0)=y_t\),即小带宽复现数据(欠平滑);\(h\to\infty\) 时 \(\hat m(x_t)\to\bar y\),即大带宽过度平滑为样本均值。\(h\) 小则权重集中于少数邻近观测,\(h\) 大则权重分散到更大邻域——带宽选择是核回归的关键问题。
带宽选择(Härdle 1990;Fan & Yao 2003):
- 插入法(plug-in):基于平均积分平方误差 \(\text{MISE}=E\int[\hat m(x)-m(x)]^2dx\) 的渐近展开(\(E[\hat m(x)-m(x)]^2\) 为 \(x\) 处的逐点 MSE),在正则条件下导出最小化 MISE 的最优带宽;但它依赖需要初步平滑估计的未知量,常需多次迭代,初步平滑的选择本身可能成问题。Fan & Yao (2003) 的正态参考带宽:高斯核 \(\hat h_{opt}=1.06sT^{-1/5}\),Epanechnikov 核 \(\hat h_{opt}=2.34sT^{-1/5}\),\(s\) 为(平稳)自变量的样本标准差。
- 留一交叉验证(leave-one-out CV):去掉 \((x_j,y_j)\),用其余 \(T-1\) 个点在 \(x_j\) 处得 \(\hat m_{h,j}(x_j)=\frac1{T-1}\sum_{t\ne j}w_t(x_j)y_t\)(权重和为 \(T-1\));对 \(j=1,\dots,T\) 重复,定义
\[CV(h)=\frac1T\sum_{j=1}^T[y_j-\hat m_{h,j}(x_j)]^2W(x_j),\]\(W(\cdot)\) 为非负权函数(\(\sum W(x_j)=T\)),用于降低边界点权重(边界点邻居少)。取使 \(CV(h)\) 最小的 \(h\)。
局部线性回归(local linear regression):设 \(m\) 在 \(x\) 处二阶导存在且连续,求 \(a,b\) 最小化
时间序列应用:解释变量常为滞后值,单变量时 \(x_t=m(x_{t-1})+a_t\),上述方法直接适用。多个解释变量时:核回归可用多元核,如带预设正定矩阵 \(\boldsymbol\Sigma\) 的多元正态密度
例 4.6 美国 3 个月国库券周度二级市场利率(1970–1997,1461 个观测,图 4.6;文献中常用于由离散数据估计随机扩散方程,见第 6 章)。简单模型
lowess(Cleveland 1979)非参数估计 \(\mu(\cdot)\) 和 \(\sigma(\cdot)\),以 \(|y_t|\) 作为波动的代理。\(\mu(x_{t-1})=E(y_t|x_{t-1})\)。图 4.7(a) 为 \(y_t\) 对 \(x_{t-1}\) 的散点及 lowess 估计,整体近乎为零;(b) 放大后可见 \(\hat\mu(x_{t-1})\) 在利率低时为正、利率高时为负——符合利率均值回复的常识(续见下文)。
图 4.7(c) 为 \(|y_t|\) 对 \(x_{t-1}\) 的散点及 lowess 估计的 \(\hat\sigma(x_{t-1})\):利率越高波动越大;(d) 放大显示 \(\hat\sigma(x_{t-1})\) 是 \(x_{t-1}\) 的增函数,且在接近 10% 时斜率加速(即"水平效应",与 CIR 等 \(\sigma\propto x^\gamma\) 模型一致)。该例说明简单非参数方法有助于理解金融序列的动态结构。R 命令:z1=read.table('w-3mtbs7097.txt',header=T);x=z1[4,1:1460]/100;y=(z1[4,2:1461]-z1[4,1:1460])/100;lines(lowess(x,y));fit=lowess(x,y);lowess(x,abs(y))。
以下非线性模型是在非参数方法帮助下提出的。
4.1.6 函数系数 AR 模型(Functional Coefficient AR Model,PDF p.218)
非参数技术使研究者能放松参数约束;非参数方法也可在初步研究中帮助选择参数非线性模型。Chen & Tsay (1993a) 的 FAR 模型:
4.1.7 非线性可加 AR 模型(Nonlinear Additive AR Model,PDF p.218–219)
非参数方法用于非线性时间序列的主要困难是维数灾难(curse of dimensionality):一般非线性 AR(\(p\)) \(x_t=f(x_{t-1},\dots,x_{t-p})+a_t\) 需 \(p\) 维平滑,\(p\) 大而样本不大时很难。简单有效的办法是可加模型,NAAR:
4.1.8 非线性状态空间模型(Nonlinear State-Space Model,PDF p.219)
借助 MCMC(Gelfand & Smith 1990),Carlin, Polson & Stoffer (1992) 提出非线性状态空间的蒙特卡洛方法:
4.1.9 神经网络(Neural Networks,PDF p.219–225)
神经网络可视为半参数方法,文献极多、应用广泛但成效不一(Ripley 1993 第 2 节列应用、第 10 节评论金融应用;Cheng & Titterington 1994 从统计角度介绍)。只讨论前馈神经网络(feed-forward neural networks):输入连到输入层节点(神经元),逐层向前连接直到输出层。图 4.8:单变量时间序列用的单隐层网络,输入层 2 个节点、隐层 3 个,每个输入节点连到每个隐节点,隐节点连到单个输出节点,记为 2–3–1 网络。有反馈连接的更复杂网络也存在,但与本书最相关的是前馈网络。
前馈网络:信息经激活函数(activation function)逐层传递。单隐层中第 \(j\) 个隐节点
(4.33)/(4.34) 称半参数函数:函数形式已知,但节点数、偏置、权重未知。(4.34) 可跳过隐层,称跳层前馈网络(skip-layer feed-forward network)。前馈网络在神经网络文献中称多层感知器(multilayer perceptrons);增加隐节点数可在紧集上一致逼近任意连续函数(Hornik, Stinchcombe & White 1989;Hornik 1993;Chen & Chen 1995),即万能逼近性质(universal approximation property)。简言之,单隐层前馈网络是参数化一般连续非线性函数的一种方式。
训练与预测:两步——训练(确定节点数、估计偏置与权重)与推断(尤其预测)。训练阶段常把数据分为两个不重叠子样本:第一个估计给定网络的参数,第二个计算预测精度,选预测表现最好的网络——即交叉验证思想(也有其他模型选择方法)。时间序列中,数据 \(\{(r_t,\mathbf x_t)\}\),\(\mathbf x_t\) 为输入向量,\(o_t\) 为网络输出,训练即选择偏置与权重最小化拟合准则,如最小二乘
例 4.7 IBM 月对数收益(百分比,含分红,1926-01—1999-12):前 864 个观测(1926–1997)建模。(4.34) 型 3–2–1 网络,输入 \(r_{t-1},r_{t-2},r_{t-3}\):
nnet 包(默认初始权重,Venables & Ripley 1999)估计,结果随初值而变:3–2–1 网络样本外 MSE 可低至 89.46、高至 93.65;改变隐节点数范围更宽。命令见附录 B。
例 4.8 方向预测:输出层用 Heaviside 激活预测 IBM 涨跌方向。方向变量 \(d_t=1\)(\(r_t\ge0\))否则 0。8 个输入(\(r_t\) 与 \(d_t\) 各前 4 个滞后),4 个隐节点,8–4–1 网络(49 个参数),在第一子样本训练,对第二子样本计算下月上涨概率的 1 步预测(图 4.9,0.5 水平线;圆圈为实际方向)。按概率 \(\ge0.5\) 判为上涨,成功率 0.58,但每次估计差异很大。模拟 500 次:预测错误数(共 24 个月)均值 11.28、中位数 11、最大 18、最小 4。对照带漂移随机游走 \(\hat d_t=1\) 若 \(\hat r_t=1.19+\epsilon_t\ge0\)(1.19 为 1926–1997 平均月对数收益,\(\epsilon_t\) iid \(N(0,1)\)),500 次模拟错误数均值 10.53、中位数 11、最大 17、最小 5。图 4.10 两者错误数直方图。结论:8–4–1 神经网络并不优于带漂移随机游走。
4.2 非线性检验(Nonlinearity Tests,PDF p.225–232,续见下一块)
本节讨论对 4.1 节非线性模型有一定功效的检验,包括参数与非参数统计量。非参数:残差平方的 Ljung–Box、双谱检验、BDS 检验;参数(依赖特定参数函数):RESET(Ramsey 1969)、Tsay (1986, 1989) 的 F 检验以及其他 LM、似然比检验。非线性可能以多种方式出现,不存在在所有情形下都占优的检验。
4.2.1 非参数检验(Nonparametric Tests,PDF p.226–229)
基本思想:在线性原假设下,正确设定的线性模型残差应独立,任何独立性破坏都提示模型不足(包括线性假设)。部分检验专门检查二次形式的违背。
残差平方的 Q 统计量(McLeod & Li 1983):对 ARMA(\(p,q\)) 残差平方
双谱检验(bispectral test):可同时检验线性与高斯性。依据:线性序列适当标准化的双谱在所有频率上为常数,正态时该常数为零。双谱是三阶矩的 Fourier 变换。对 (4.1) 的平稳序列,三阶矩
BDS 统计量(Brock, Dechert & Scheinkman 1987):检验 iid 假设,不同于只关注二阶或三阶性质的检验。利用混沌时间序列分析中的关联积分(correlation integral)。对 \(k\) 维序列 \(\mathbf X_t\)(\(T_k\) 个观测):
4.2.2 参数检验(Parametric Tests,PDF p.229–232,续见下一块)
RESET 检验(Ramsey 1969):线性 LS 回归的设定检验,可直接用于线性 AR。线性 AR(\(p\)):
Keenan (1985) 检验:只用 \(\hat x_t^2\),并把第二步分为两步以避免与 \(\mathbf X_{t-1}\) 的多重共线:(2a) 回归 \(\hat x_t^2=\mathbf X_{t-1}'\boldsymbol\beta+u_t\) 得残差 \(\hat u_t\)(去除对 \(\mathbf X_{t-1}\) 的线性依赖);(2b) 回归 \(\hat a_t=\hat u_t\alpha+v_t\),用 \(SSR_1=\sum(\hat a_t-\hat u_t\hat\alpha)^2\) 检验 \(\alpha=0\)。
F 检验(Ori-F)(Tsay 1986):为提高 Keenan 与 RESET 的功效,取 \(\mathbf M_{t-1}=\operatorname{vech}(\mathbf X_{t-1}\mathbf X_{t-1}')\)——矩阵对角线及以下元素的半堆叠向量,即所有二次项与交叉项;如 \(p=2\) 时 \(\mathbf M_{t-1}=(x_{t-1}^2,x_{t-1}x_{t-2},x_{t-2}^2)'\),维数 \(p(p+1)/2\)。实际就是在回归 \(x_t=\mathbf X_{t-1}'\boldsymbol\phi+\mathbf M_{t-1}'\boldsymbol\alpha+e_t\) 中检验 \(\boldsymbol\alpha=0\) 的偏 F 统计量,线性 AR(\(p\)) 下服从 \(F(g,T-p-g-1)\),\(g=p(p+1)/2\)。Luukkonen, Saikkonen & Teräsvirta (1988) 进一步加入三次项 \(x_{t-i}^3\)。
门限检验(threshold test):备择为 SETAR 时可构造专门检验提高功效。两种思路:似然比检验,以及把门限非线性转化为模型变点检测。设备择为门限变量 \(x_{t-d}\) 的两区制 SETAR。\(H_0\):
- 似然比:正态下 \(l_0(\hat{\boldsymbol\phi},\hat\sigma_a^2)\) 易算;给定 \(r_1\) 时备择下 \(l_1(r_1;\hat{\boldsymbol\phi}_1,\hat\sigma_1^2;\hat{\boldsymbol\phi}_2,\hat\sigma_2^2)\) 也易算,对数似然比 \(l(r_1)=l_1-l_0\) 是未知 \(r_1\) 的函数。但原假设下无门限,\(r_1\) 无定义——称原假设下的冗余参数(nuisance parameter),故似然比渐近分布与常规情形很不同(Chan 1991 给出细节与临界值)。常用 \(l_{\max}=\sup_{v<r_1<u}l(r_1)\)(\(v,u\) 为预设上下界),也可用 \(l(r_1)\) 在 \([v,u]\) 上的平均(Andrews & Ploberger 1994);相关理论见 Davis (1987)、Andrews & Ploberger (1994);临界值依赖 \(v,u\),常由模拟获得。
- Tsay (1989) 排序自回归检验:利用排序自回归(arranged autoregression)与递归估计,把 SETAR 转化为以门限 \(r_1\) 为变点的模型变化问题。\(x_{t-d}\) 取值 \(\{x_1,\dots,x_{T-d}\}\),令 \(x_{(1)}\le\cdots\le x_{(T-d)}\) 为顺序统计量,SETAR 可写为
\[x_{(j)+d}=\beta_0+\sum_{i=1}^p\beta_ix_{(j)+d-i}+a_{(j)+d},\quad j=1,\dots,T-d,\tag{4.47}\]\(x_{(j)}<r_1\) 时 \(\beta_i=\phi_i^{(1)}\),否则 \(\beta_i=\phi_i^{(2)}\),故 \(r_1\) 是该线性回归的变点。排序不改变 \(x_t\) 对 \(x_{t-i}\) 的动态依赖,只是把模型从时间空间改为门限空间呈现(\(x_{t-d}\) 小的方程排在前面)。步骤:
- 用 \(j=1,\dots,m\)(如 \(m=30\))拟合 (4.47),得 LS 估计 \(\hat\beta_{i,m}\);
- 计算预测残差 \(\hat a_{(m+1)+d}=x_{(m+1)+d}-\hat\beta_{0,m}-\sum_{i=1}^p\hat\beta_{i,m}x_{(m+1)+d-i}\) 及其标准误,得标准化预测残差 \(\hat e_{(m+1)+d}\);
- 用递归最小二乘把新数据点纳入,更新为 \(\hat\beta_{i,m+1}\);
- 重复 2、3 直到处理完所有数据;
- 回归 \(\hat e_{(m+j)+d}=\alpha_0+\sum_{i=1}^p\alpha_ix_{(m+j)+d-i}+v_t\)(\(j=1,\dots,T-d-m\))(4.48),计算检验 \(\alpha_i=0\ (i=0,\dots,p)\) 的常规 F 统计量。在 \(x_t\) 为线性 AR(\(p\)) 的原假设下……(本块至 PDF p.232 截止,F 统计量的分布及其后内容续见下一块)
注:第 4 章在本块内未结束(剩余 4.2.2 后半、4.2.3 应用、4.3 建模、4.4 预测、4.5 应用、附录、习题),故第 4 章的「本章要点」「与量化交易的关联」「推荐习题」由下一块负责撰写。本块已覆盖的第 4 章内容要点:线性/非线性定义与均值非线性、方差非线性的区分;双线性、TAR/SETAR(几何遍历条件、不可时间反转、均值非零)、TAR-GARCH、STAR、马尔可夫转换(期望持续期 \(1/w_i\)、与 SETAR 的预测差异);核回归、带宽选择、局部线性回归、FAR、NAAR、非线性状态空间、前馈神经网络(及其在 IBM 收益与方向预测上未胜过随机游走的实证);McLeod–Li、双谱、BDS、RESET、Keenan、Ori-F 与门限检验。对量化交易而言,这部分直接对应:区制识别(牛熊/危机状态的马尔可夫转换、门限模型)、波动不对称建模(TAR-GARCH、STAR 波动)、非参数/机器学习信号的过拟合风险(例 4.7、4.8 说明复杂模型在样本外未必胜过朴素基准,需以随机游走等基准做严格样本外比较并考察估计随初值的波动),以及用 BDS/RESET/Tsay F 检验判断线性模型残差中是否仍有可利用的非线性结构。