量化交易中文教材

元信息:Larry Wasserman《All of Statistics: A Concise Course in Statistical Inference》(Springer, 2004);本笔记覆盖 PDF 第 221–446 页(原书页码约 212–437),即第 13 章后半至书末(第 13–24 章、附录/参考文献/索引)。


第 13 章 线性回归与 Logistic 回归(Linear and Logistic Regression)(接上一块)

本块从 13.1 节末尾的例 13.6(2000 年美国大选佛罗里达县级数据)开始。

13.1(末尾)例 13.6 选举数据的对数变换(PDF p.221)

  • 图 13.2 展示了佛罗里达各县 Bush 得票数与 Buchanan 得票数的散点图(原始尺度与对数尺度)以及残差图。原始尺度下数据呈扇形、残差方差随 x 增大,对数尺度更合理。
  • 对数尺度上的最小二乘拟合:
    \[\log(\text{Buchanan}) = -2.3298 + 0.7303\,\log(\text{Bush}).\]
  • 变换后残差图"健康得多"(无明显异方差和结构)。留下的问题:Palm Beach 县的结果是否统计上可信?(在 13.4 节预测区间中回答。)
  • 教学要点:回归之前先画图,必要时对变量做对数变换以稳定方差、线性化关系。

13.2 最小二乘与最大似然(Least Squares and Maximum Likelihood)(PDF p.221–222)

  • 附加正态性假设:\(\epsilon_i \mid X_i \sim N(0,\sigma^2)\),即 \(Y_i\mid X_i \sim N(\mu_i,\sigma^2)\),其中 \(\mu_i=\beta_0+\beta_1X_i\)。
  • 似然函数分解:
    \[\prod_{i=1}^n f(X_i,Y_i)=\prod_{i=1}^n f_X(X_i)\,\prod_{i=1}^n f_{Y|X}(Y_i\mid X_i)=\mathcal L_1\times\mathcal L_2 .\]
    \(\mathcal L_1\) 与参数 \((\beta_0,\beta_1)\) 无关,只需关注条件似然(conditional likelihood) \(\mathcal L_2\):
    \[\mathcal L_2=\mathcal L(\beta_0,\beta_1,\sigma)\propto \sigma^{-n}\exp\Big\{-\frac{1}{2\sigma^2}\sum_i (Y_i-\mu_i)^2\Big\}.\]
  • 条件对数似然:
    \[\ell(\beta_0,\beta_1,\sigma)=-n\log\sigma-\frac{1}{2\sigma^2}\sum_{i=1}^n\big(Y_i-(\beta_0+\beta_1X_i)\big)^2. \tag{13.9}\]
    对 \((\beta_0,\beta_1)\) 最大化等价于最小化残差平方和 RSS \(=\sum_i (Y_i-(\beta_0+\beta_1X_i))^2\)。
  • 定理 13.7:在正态假设下,最小二乘估计量也是最大似然估计量(MLE)。
  • 对 \(\sigma\) 最大化得 \(\hat\sigma^2_{\rm MLE}=\frac1n\sum_i\hat\epsilon_i^2\)(13.10)。它与无偏估计 \(\hat\sigma^2=\frac{1}{n-2}\sum_i\hat\epsilon_i^2\)(13.7)相似但不同;实务中常用无偏版本。
  • 误区:最小二乘本身不需要正态假设;正态假设只是使其获得 MLE 的解释(以及精确的小样本分布)。

13.3 最小二乘估计量的性质(Properties of the Least Squares Estimators)(PDF p.223–224)

  • 回归问题中通常以协变量 \(X^n=(X_1,\dots,X_n)\) 为条件陈述均值和方差。
  • 定理 13.8:令 \(\hat\beta=(\hat\beta_0,\hat\beta_1)^T\) 为最小二乘估计,则
    \[\mathbb E(\hat\beta\mid X^n)=\begin{pmatrix}\beta_0\\\beta_1\end{pmatrix},\qquad \mathbb V(\hat\beta\mid X^n)=\frac{\sigma^2}{n s_X^2}\begin{pmatrix}\frac1n\sum_i X_i^2 & -\bar X_n\\ -\bar X_n & 1\end{pmatrix}, \tag{13.11}\]
    其中 \(s_X^2=n^{-1}\sum_i (X_i-\bar X_n)^2\)。
  • 估计标准误:取上述矩阵对角元平方根并以 \(\hat\sigma\) 代替 \(\sigma\):
    \[\widehat{\rm se}(\hat\beta_0)=\frac{\hat\sigma}{s_X\sqrt n}\sqrt{\frac{\sum_i X_i^2}{n}},\qquad \widehat{\rm se}(\hat\beta_1)=\frac{\hat\sigma}{s_X\sqrt n}. \tag{13.12–13.13}\]
    严格应写 \(\widehat{\rm se}(\hat\beta_0\mid X^n)\),书中简写。
  • 定理 13.9(适当条件下):
    1. 相合性:\(\hat\beta_0\xrightarrow{P}\beta_0\),\(\hat\beta_1\xrightarrow{P}\beta_1\);
    2. 渐近正态:\((\hat\beta_j-\beta_j)/\widehat{\rm se}(\hat\beta_j)\rightsquigarrow N(0,1)\),\(j=0,1\);
    3. 近似 \(1-\alpha\) 置信区间:\(\hat\beta_j\pm z_{\alpha/2}\,\widehat{\rm se}(\hat\beta_j)\)(13.14);
    4. 检验 \(H_0:\beta_1=0\) vs \(H_1:\beta_1\neq0\) 的 Wald 检验:当 \(|W|>z_{\alpha/2}\) 时拒绝,\(W=\hat\beta_1/\widehat{\rm se}(\hat\beta_1)\)。(脚注回顾 (10.5):\(W=(\hat\beta-\beta_0)/\widehat{\rm se}(\hat\beta)\)。)
  • 例 13.10(选举数据,对数尺度):斜率 95% CI 为 \(0.7303\pm2(0.0358)=(0.66,0.80)\);\(|W|=|0.7303-0|/0.0358=20.40\),p 值 \(\mathbb P(|Z|>20.40)\approx0\),强烈表明斜率非零。

13.4 预测(Prediction)(PDF p.224–225)

  • 已拟合 \(\hat r(x)=\hat\beta_0+\hat\beta_1x\),对新个体的协变量 \(X=x_*\) 预测其结果 \(Y_*\):
    \[\hat Y_*=\hat\beta_0+\hat\beta_1x_*. \tag{13.15}\]
    其方差 \(\mathbb V(\hat Y_*)=\mathbb V(\hat\beta_0)+x_*^2\mathbb V(\hat\beta_1)+2x_*\mathrm{Cov}(\hat\beta_0,\hat\beta_1)\),由定理 13.8 给出各项。
  • 关键点:\(Y_*\) 的置信区间不是 \(\hat Y_*\pm z_{\alpha/2}\widehat{\rm se}(\hat Y_*)\),因为 \(Y_*\) 本身含有新噪声 \(\epsilon\)(见习题 10)。
  • 定理 13.11(预测区间 Prediction Interval):令
    \[\hat\xi_n^2=\hat\sigma^2\left(\frac{\sum_{i=1}^n (X_i-x_*)^2}{n\sum_i (X_i-\bar X)^2}+1\right), \tag{13.16}\]
    则近似 \(1-\alpha\) 预测区间为 \(\hat Y_*\pm z_{\alpha/2}\hat\xi_n\)(13.17)。直观:\(\hat\xi_n^2=\widehat{\mathbb V}(\hat Y_*)+\hat\sigma^2\),"参数估计误差 + 新观测噪声"。
  • 例 13.12(选举数据再分析):Palm Beach 县 Bush 得 152,954 票、Buchanan 得 3,467 票,对数为 11.93789 与 8.151045。预测值 \(-2.3298+0.7303\times11.93789=6.388441\)。计算得 \(\hat\xi_n=0.093775\),近似 95% 区间 \((6.200,6.578)\),明显不含 8.151;8.151 距预测值近 20 个标准误。取指数回到票数尺度,区间为 \((493,717)\),而实际票数为 3,467——Palm Beach 结果极不寻常("蝴蝶选票"事件)。

13.5 多元回归(Multiple Regression)(PDF p.225–227)

  • 数据 \((Y_1,X_1),\dots,(Y_n,X_n)\),\(X_i=(X_{i1},\dots,X_{ik})\) 为 \(k\) 维协变量。模型

    \[Y_i=\sum_{j=1}^k\beta_jX_{ij}+\epsilon_i,\quad \mathbb E(\epsilon_i\mid X_{1i},\dots,X_{ki})=0. \tag{13.18}\]
    加截距:令 \(X_{i1}=1\)。

  • 矩阵形式:\(Y=(Y_1,\dots,Y_n)^T\),\(X\) 为 \(n\times k\) 设计矩阵(每行一个观测,每列一个协变量),\(\beta=(\beta_1,\dots,\beta_k)^T\),\(\epsilon=(\epsilon_1,\dots,\epsilon_n)^T\),则 \(Y=X\beta+\epsilon\)(13.19)。

  • 定理 13.13:若 \(k\times k\) 矩阵 \(X^TX\) 可逆,则

    \[\hat\beta=(X^TX)^{-1}X^TY,\quad \mathbb V(\hat\beta\mid X^n)=\sigma^2(X^TX)^{-1},\quad \hat\beta\approx N(\beta,\sigma^2(X^TX)^{-1}). \tag{13.20–13.22}\]

  • 估计回归函数 \(\hat r(x)=\sum_j\hat\beta_jx_j\)。\(\sigma^2\) 的无偏估计

    \[\hat\sigma^2=\frac{1}{n-k}\sum_{i=1}^n\hat\epsilon_i^2,\qquad \hat\epsilon=X\hat\beta-Y.\]

  • \(\beta_j\) 的近似 \(1-\alpha\) 置信区间:\(\hat\beta_j\pm z_{\alpha/2}\widehat{\rm se}(\hat\beta_j)\),\(\widehat{\rm se}^2(\hat\beta_j)\) 为 \(\hat\sigma^2(X^TX)^{-1}\) 的第 \(j\) 个对角元(13.23)。

  • 例 13.14(美国 47 州 1960 年犯罪数据):犯罪率对 10 个变量回归,结果表(\(\hat\beta_j\) / se / t 值 / p 值):

    • 截距 −589.39 / 167.59 / −3.51 / 0.001**
    • Age 1.04 / 0.45 / 2.33 / 0.025*
    • Southern State 11.29 / 13.24 / 0.85 / 0.399
    • Education 1.18 / 0.68 / 1.7 / 0.093
    • Expenditures 0.96 / 0.25 / 3.86 / 0.000***
    • Labor 0.11 / 0.15 / 0.69 / 0.493
    • Number of Males 0.30 / 0.22 / 1.36 / 0.181
    • Population 0.09 / 0.14 / 0.65 / 0.518
    • Unemployment(14–24) −0.68 / 0.48 / −1.4 / 0.165
    • Unemployment(25–39) 2.15 / 0.95 / 2.26 / 0.030*
    • Wealth −0.08 / 0.09 / −0.91 / 0.367

    "t value"即检验 \(H_0:\beta_j=0\) 的 Wald 统计量;星号越多 p 值越小。引出两个问题:(1) 是否应剔除部分变量(模型选择,见 13.6);(2) 能否作因果解释(如"低预防支出导致高犯罪"?)——留到第 16 章。注意 Expenditures 系数为正,显然不能解释为"支出导致犯罪"。

13.6 模型选择(Model Selection)(PDF p.227–232)

偏差–方差权衡。 小模型的两个好处:预测可能更好、更简约(parsimonious)。加入变量通常使预测偏差下降、方差上升:协变量过少→高偏差,称欠拟合(underfitting);过多→高方差,称过拟合(overfitting)。模型选择两个子问题:(i) 给每个模型打分;(ii) 在模型空间中搜索最高分模型。

记号。 \(S\subset\{1,\dots,k\}\),\(X_S\) 为子集协变量,\(\hat\beta_S\) 为其最小二乘估计,\(\hat r_S\) 为估计回归函数,\(\hat Y_i(S)=\hat r_S(X_i)\)。

  • 预测风险(prediction risk):
    \[R(S)=\sum_{i=1}^n\mathbb E\big(\hat Y_i(S)-Y_i^*\big)^2, \tag{13.24}\]
    \(Y_i^*\) 是在协变量 \(X_i\) 处的未来观测。
  • 训练误差(training error):\(\hat R_{\rm tr}(S)=\sum_i(\hat Y_i(S)-Y_i)^2\)。
  • 定理 13.15:训练误差是预测风险的向下有偏估计,\(\mathbb E(\hat R_{\rm tr}(S))<R(S)\),且
    \[\mathrm{bias}(\hat R_{\rm tr}(S))=\mathbb E\hat R_{\rm tr}(S)-R(S)=-2\sum_{i=1}^n\mathrm{Cov}(\hat Y_i,Y_i). \tag{13.25}\]
    原因:数据用了两次(估计参数 + 估计风险)。模型越复杂,\(\mathrm{Cov}(\hat Y_i,Y_i)\) 越大,偏差越严重。(线性回归中 \(\sum_i\mathrm{Cov}(\hat Y_i,Y_i)=|S|\sigma^2\)。)

风险估计方法:

  1. Mallows \(C_p\):
    \[\hat R(S)=\hat R_{\rm tr}(S)+2|S|\hat\sigma^2, \tag{13.26}\]
    \(|S|\) 为模型项数,\(\hat\sigma^2\) 取自全模型。即"拟合不足 + 复杂度惩罚"(lack of fit + complexity penalty)。
  2. AIC(Akaike Information Criterion):选 \(S\) 最大化
    \[\ell_S-|S|, \tag{13.27}\]
    \(\ell_S\) 为该模型在 MLE 处的对数似然;"拟合优度减复杂度"。正态误差线性回归中(\(\sigma\) 取最大模型估计值)最大化 AIC 等价于最小化 \(C_p\)(习题 8)。脚注:有的书把 AIC 乘以 2 或 −2,不影响选出的模型。
  3. 留一交叉验证(leave-one-out cross-validation):
    \[\hat R_{CV}(S)=\sum_{i=1}^n\big(Y_i-\hat Y_{(i)}\big)^2, \tag{13.28}\]
    \(\hat Y_{(i)}\) 为去掉第 \(i\) 个观测后拟合模型对 \(Y_i\) 的预测。线性回归有捷径公式
    \[\hat R_{CV}(S)=\sum_{i=1}^n\left(\frac{Y_i-\hat Y_i(S)}{1-U_{ii}(S)}\right)^2, \tag{13.29}\]
    \(U_{ii}(S)\) 是帽子矩阵 \(U(S)=X_S(X_S^TX_S)^{-1}X_S^T\)(13.30)的第 \(i\) 个对角元(杠杆值)。因此无需真的逐个删除重拟合。
    • k 折交叉验证(k-fold CV):把数据分为 \(k\) 组(常取 \(k=10\)),每次留一组作测试,其余拟合,计算 \(\sum(Y_i-\hat Y_i)^2\)(求和于留出组),对 \(k\) 次结果平均。
    • 线性回归中 \(C_p\) 与 CV 往往结果几乎相同,可直接用 \(C_p\);在后面更复杂的问题中 CV 更有用。
  4. BIC(Bayesian Information Criterion):选模型最大化
    \[\mathrm{BIC}(S)=\ell_S-\frac{|S|}{2}\log n. \tag{13.31}\]
    贝叶斯解释:模型集合 \(\{S_1,\dots,S_m\}\),先验 \(\mathbb P(S_j)=1/m\),模型内参数取光滑先验,则后验近似
    \[\mathbb P(S_j\mid\text{data})\approx\frac{e^{\mathrm{BIC}(S_j)}}{\sum_r e^{\mathrm{BIC}(S_r)}}.\]
    故选 BIC 最高 ≈ 选后验概率最大的模型。BIC 还有最小描述长度(minimum description length)的信息论解释。BIC 形式同 \(C_p\) 但复杂度惩罚更重(\(\log n\) vs 2),倾向于选更小的模型。

模型搜索。 \(k\) 个协变量有 \(2^k\) 个模型。\(k\) 不大时可全搜索;\(k\) 大时不可行,只能搜索子集:

  • 前向逐步回归(forward stepwise):从空模型开始,每次加入使得分最优的变量,直到得分不再改善。
  • 后向逐步回归(backward stepwise):从全模型开始,每次删一个变量。
  • 两者都是贪心搜索,不保证找到最优得分模型。随机搜索也常用,但没理由认为优于确定性搜索。

例 13.16(犯罪数据后向逐步 + AIC):R 中的 AIC 定义不同(取最小值),等价于最小化 \(C_p\)。全模型 AIC = 310.37。删除单个变量后的 AIC(升序):Pop 308、Labor 309、South 309、Wealth 309、Males 310、U1 310、Educ 312、U2 314、Age 315、Expend 324。先删 Pop(AIC 308)。第二轮:South 308、Labor 308、Wealth 308、Males 309、U1 309、Education 310、U2 313、Age 313、Expend 329,删 South。如此继续直到删除任何变量都不再改善 AIC。最终模型:

\[\text{Crime}=1.2\,\text{Age}+0.75\,\text{Education}+0.87\,\text{Expenditure}+0.34\,\text{Males}-0.86\,U_1+2.31\,U_2 .\]
警告:这仍未回答哪些变量是犯罪的原因。

Zheng–Loh 模型选择法(Zheng and Loh 1995)。 不以最小化预测误差为目标,而是假设部分 \(\beta_j\) 恰好为 0,试图找出"真模型"(由非零 \(\beta_j\) 组成的最小子模型)。步骤:

  1. 拟合全模型,计算 Wald 统计量 \(W_j=\hat\beta_j/\widehat{\rm se}(\hat\beta_j)\);
  2. 按绝对值从大到小排序:\(|W_{(1)}|\ge|W_{(2)}|\ge\dots\ge|W_{(k)}|\);
  3. 令 \(\hat j\) 为最小化 \(\mathrm{RSS}(j)+j\,\hat\sigma^2\log n\) 的 \(j\),\(\mathrm{RSS}(j)\) 是包含 Wald 统计量最大的 \(j\) 个变量模型的残差平方和;
  4. 最终模型取 Wald 统计量绝对值最大的 \(\hat j\) 个项。

只需检查 \(k\) 个嵌套模型而不是 \(2^k\) 个。Zheng 与 Loh 证明在适当条件下,该方法选中真模型的概率随样本量增大趋于 1(脚注:\(j\log n\) 只是可选惩罚函数之一)。

常见误区:预测最优(AIC/CV)与识别真模型(BIC/Zheng–Loh,相合选择)是两个不同目标;逐步回归选出的变量不代表因果。

13.7 Logistic 回归(Logistic Regression)(PDF p.232–234)

  • 用于二元响应 \(Y_i\in\{0,1\}\) 的参数回归。\(k\) 维协变量下:
    \[p_i\equiv p_i(\beta)\equiv\mathbb P(Y_i=1\mid X=x)=\frac{e^{\beta_0+\sum_{j=1}^k\beta_jx_{ij}}}{1+e^{\beta_0+\sum_{j=1}^k\beta_jx_{ij}}} \tag{13.32}\]
    等价地 \(\mathrm{logit}(p_i)=\beta_0+\sum_j\beta_jx_{ij}\)(13.33),其中 \(\mathrm{logit}(p)=\log\frac{p}{1-p}\)(13.34)。名称来自 logistic 函数 \(e^x/(1+e^x)\)(图 13.3:S 形曲线,从 0 升至 1,在 \(x=0\) 处为 1/2)。
  • \(Y_i\mid X_i=x_i\sim\mathrm{Bernoulli}(p_i)\),条件似然
    \[\mathcal L(\beta)=\prod_{i=1}^n p_i(\beta)^{Y_i}(1-p_i(\beta))^{1-Y_i}. \tag{13.35}\]
  • MLE 需数值求解。**迭代重加权最小二乘(reweighted least squares, IRLS)**算法:
    • 取初值 \(\hat\beta^0\),由(13.32)计算 \(p_i^0\),令 \(s=0\),迭代至收敛:
    1. 工作响应:\(Z_i=\mathrm{logit}(p_i^s)+\dfrac{Y_i-p_i^s}{p_i^s(1-p_i^s)}\),\(i=1,\dots,n\);
    2. \(W\) 为对角阵,第 \((i,i)\) 元为 \(p_i^s(1-p_i^s)\);
    3. \(\hat\beta^{s+1}=(X^TWX)^{-1}X^TWZ\)——即 \(Z\) 对 \(X\) 的加权线性回归(原文误写为"Z on Y");
    4. \(s\leftarrow s+1\),回到第 1 步。 (这本质是 Newton–Raphson / Fisher scoring。)
  • Fisher 信息矩阵 \(I\) 也可数值求得;\(\hat\beta_j\) 的标准误为 \(J=I^{-1}\) 的 \((j,j)\) 元的平方根。模型选择通常用 AIC 得分 \(\ell_S-|S|\)。
  • 例 13.17(CORIS 冠心病风险因子研究):南非三个农村地区 462 名 15–64 岁男性,\(Y\)=是否有冠心病,9 个协变量:sbp(收缩压)、tobacco(累计烟草 kg)、ldl(低密度脂蛋白)、adiposity、famhist(家族史)、typea(A 型行为)、obesity、alcohol、age。估计(\(\hat\beta_j\) / se / \(W_j\) / p):截距 −6.145/1.300/−4.738/0.000;sbp 0.007/0.006/1.138/0.255;tobacco 0.079/0.027/2.991/0.003;ldl 0.174/0.059/2.925/0.003;adiposity 0.019/0.029/0.637/0.524;famhist 0.925/0.227/4.078/0.000;typea 0.040/0.012/3.233/0.001;obesity −0.063/0.044/−1.427/0.153;alcohol 0.000/0.004/0.027/0.979;age 0.045/0.012/3.754/0.000。
    • 讨论:若你对收缩压不显著、肥胖系数为负感到意外,说明你混淆了关联与因果(第 16 章)。血压不显著不代表它不是心脏病的重要原因,只表示在已有其它变量时它不是重要的预测因子。

13.8 文献评注(PDF p.234)

Weisberg (1985) 线性回归简明教材;Hastie et al. (2001) 数据挖掘视角;AIC 来自 Akaike (1973),BIC 来自 Schwarz (1978);logistic 回归参考 Agresti (1990)、Dobson (2001)。

13.9 附录:AIC 的推导思想(PDF p.234–235)

  • 模型集 \(\{M_1,M_2,\dots\}\),\(\hat f_j(x)=f(x;\hat\beta_j)\) 为模型 \(M_j\) 下 MLE 给出的估计概率函数。损失取 Kullback–Leibler 距离
    \[D(f,g)=\sum_x f(x)\log\frac{f(x)}{g(x)},\]
    风险 \(R(f,\hat f)=\mathbb E\,D(f,\hat f)\)。\(D(f,\hat f)=c-A(f,\hat f)\),其中 \(c=\sum_x f\log f\) 与 \(\hat f\) 无关,\(A(f,\hat f)=\sum_x f(x)\log\hat f(x)\)。故最小化风险等价于最大化 \(a(f,\hat f)\equiv\mathbb E(A(f,\hat f))\)。
  • 直接用 \(\sum_x\hat f(x)\log\hat f(x)\)(或 \(\frac1n\ell\))估计 \(a\) 有严重偏差(类似训练误差),偏差约为 \(|M_j|\)(模型参数个数)。
  • 定理 13.18:\(\mathrm{AIC}(M_j)\) 是 \(a(f,\hat f_j)\) 的近似无偏估计。

13.10 习题概括(PDF p.235–238)

  1. 证明定理 13.4(简单线性回归最小二乘估计公式)。
  2. 视 \(X_i\) 为常数,证明定理 13.8 的标准误公式。
  3. 过原点回归 \(Y_i=\beta X_i+\epsilon_i\):求最小二乘估计、标准误及相合条件。
  4. 证明式(13.25)(训练误差偏差)。
  5. 简单线性回归中构造 \(H_0:\beta_1=17\beta_0\) 的 Wald 检验(delta 方法/线性组合方差)。
  6. 汽车油耗数据:MPG 对 HP 简单回归,再用 log(MPG) 比较。
  7. 同数据多元回归;用 \(C_p\) 配合前向/后向逐步选子模型;Zheng–Loh 法比较;全子集回归比较 \(C_p\) 与 BIC。
  8. 正态误差、\(\sigma\) 已知时证明 AIC 最高的模型就是 \(C_p\) 最低的模型。
  9. AIC 的深入分析:\(M_0:N(0,1)\) vs \(M_1:N(\theta,1)\)。(a) 当 \(\theta=0\) 时求 \(\lim_n\mathbb P(J_n=0)\)(结果不为 1,即 AIC"过拟合",约为 \(\mathbb P(\chi^2_1<2)\approx0.843\)),\(\theta\ne0\) 时极限为 0;(b) 证明无论 \(\theta\) 是否为零,选出密度 \(\hat f_n\) 与真密度的 KL 距离 \(\to_P0\),即 AIC 虽"多选"但仍相合地估计真密度;(c) 对 BIC(对数似然减 \((p/2)\log n\))重做。
  10. 预测区间:令 \(\theta=\beta_0+\beta_1x_*\),\(\hat\theta=\hat\beta_0+\hat\beta_1x_*\),\(\hat Y_*=\hat\theta\),\(Y_*=\theta+\epsilon\)。(a) 设 \(s=\sqrt{\mathbb V(\hat Y_*)}\),证明 \(\mathbb P(\hat Y_*-2s<Y_*<\hat Y_*+2s)\approx\mathbb P(-2<N(0,1+\sigma^2/s^2)<2)\neq0.95\);(b) 定义 \(\xi_n^2=s^2+\sigma^2\),证明 \(\hat Y_*\pm2\hat\xi_n\) 覆盖概率约为 0.95。
  11. CORIS 数据用 AIC 后向逐步 logistic 回归选模型。

第 13 章 本章要点

  • 正态误差下 OLS = MLE;\(\hat\beta=(X^TX)^{-1}X^TY\),\(\mathbb V(\hat\beta)=\sigma^2(X^TX)^{-1}\),\(\hat\sigma^2=\mathrm{RSS}/(n-k)\)。
  • 系数推断用 Wald 统计量("t 值")与正态近似置信区间;预测区间必须加上新观测噪声 \(\sigma^2\),比均值置信区间宽。
  • 训练误差低估预测风险,偏差 \(=-2\sum\mathrm{Cov}(\hat Y_i,Y_i)\);修正方法有 \(C_p\)、AIC、CV(含帽子矩阵捷径)、BIC;BIC 惩罚更重、倾向小模型;Zheng–Loh 用 Wald 统计量排序把搜索降为 \(k\) 个嵌套模型。
  • 逐步回归是贪心搜索,不保证全局最优。
  • Logistic 回归用 logit 链接,MLE 由 IRLS 求解,标准误来自 Fisher 信息逆矩阵。
  • 回归系数显著与否只说明预测关联,不说明因果。

第 13 章 与量化交易的关联

  • 因子研究:横截面回归(Fama–MacBeth)、因子暴露估计、alpha 检验本质都是多元线性回归;系数 t 值即本章 Wald 统计量。注意金融数据有异方差与自相关,实际需改用稳健(White/Newey–West)标准误,本章的 \(\sigma^2(X^TX)^{-1}\) 只在同方差独立误差下成立。
  • 过拟合与回测:定理 13.15 是"样本内表现高估样本外表现"的数学表述,直接对应回测过拟合;\(C_p\)/AIC/BIC/交叉验证是因子筛选、模型复杂度控制的标准工具。时间序列中交叉验证须用前推(walk-forward)或分组清洗(purged)CV,不能随机打乱。
  • 预测区间:收益预测的不确定性应包括参数误差和噪声,用于仓位与风险预算。
  • Logistic 回归:涨跌方向分类、违约概率(信用模型)、订单成交概率(执行)建模。
  • 逐步回归风险:在大量候选因子中贪心选择会产生数据窥探偏差,需结合多重检验校正(第 10 章)。

第 13 章 推荐习题

  • 习题 4:证明训练误差偏差公式,理解过拟合根源。
  • 习题 8:AIC 与 \(C_p\) 等价性。
  • 习题 9:AIC 与 BIC 在选择相合性与密度估计相合性上的差异(核心概念题)。
  • 习题 10:预测区间与置信区间的区别。
  • 习题 7、11:模型选择方法的实证比较(可替换为股票因子数据)。

第 14 章 多元模型(Multivariate Models)(PDF p.239–246)

本章回顾多项分布与多元正态分布。

线性代数记号(PDF p.239)

\(x^Ty=\sum_jx_jy_j\)(内积);\(|A|\) 行列式;\(A^T\) 转置;\(A^{-1}\) 逆;\(I\) 单位阵;\(\mathrm{tr}(A)\) 迹(对角元之和);\(A^{1/2}\) 平方根矩阵。迹满足 \(\mathrm{tr}(AB)=\mathrm{tr}(BA)\)、\(\mathrm{tr}(A+B)=\mathrm{tr}(A)+\mathrm{tr}(B)\),标量 \(\mathrm{tr}(a)=a\)。若对所有非零 \(x\) 有 \(x^T\Sigma x>0\),称矩阵正定(positive definite)。对称正定 \(A\) 的平方根 \(A^{1/2}\) 存在,且 (1) 对称;(2) \(A=A^{1/2}A^{1/2}\);(3) \(A^{1/2}A^{-1/2}=A^{-1/2}A^{1/2}=I\),\(A^{-1/2}=(A^{1/2})^{-1}\)。

14.1 随机向量(Random Vectors)(PDF p.240–241)

  • 随机向量 \(X=(X_1,\dots,X_k)^T\),均值 \(\mu=\mathbb E(X)=(\mu_1,\dots,\mu_k)^T\)(14.1)。
  • 协方差矩阵(covariance matrix) \(\Sigma=\mathbb V(X)\),第 \((i,j)\) 元为 \(\mathrm{Cov}(X_i,X_j)\),对角元为 \(\mathbb V(X_i)\)(14.2),也称方差矩阵、方差–协方差矩阵。其逆 \(\Sigma^{-1}\) 称精度矩阵(precision matrix)。
  • 定理 14.1:\(a\) 为长度 \(k\) 的向量,则 \(\mathbb E(a^TX)=a^T\mu\),\(\mathbb V(a^TX)=a^T\Sigma a\);若 \(A\) 有 \(k\) 列,则 \(\mathbb E(AX)=A\mu\),\(\mathbb V(AX)=A\Sigma A^T\)。
  • 样本 \(X_1,\dots,X_n\)(每个 \(X_i=(X_{1i},\dots,X_{ki})^T\)),样本均值向量 \(\bar X=(\bar X_1,\dots,\bar X_k)^T\),\(\bar X_j=n^{-1}\sum_i X_{ji}\)。样本协方差矩阵 \(S=(s_{jl})\)(14.4),
    \[s_{jl}=\frac{1}{n-1}\sum_{i=1}^n(X_{ji}-\bar X_j)(X_{li}-\bar X_l).\]
    有 \(\mathbb E(\bar X)=\mu\),\(\mathbb E(S)=\Sigma\)。

14.2 相关系数的估计(Estimating the Correlation)(PDF p.241–242)

  • 二元数据 \((X_{11},X_{21}),\dots,(X_{1n},X_{2n})\)。相关系数
    \[\rho=\frac{\mathbb E\big((X_1-\mu_1)(X_2-\mu_2)\big)}{\sigma_1\sigma_2}, \tag{14.5}\]
    \(\sigma_j^2=\mathbb V(X_{ji})\)。非参数插入估计为样本相关系数
    \[\hat\rho=\frac{\sum_i(X_{1i}-\bar X_1)(X_{2i}-\bar X_2)}{(n-1)s_1s_2}, \tag{14.6}\]
    \(s_j^2=\frac{1}{n-1}\sum_i(X_{ji}-\bar X_j)^2\)(脚注:严格的插入估计用 \(n\) 而非 \(n-1\),差别很小)。
  • 可用 delta 方法构造 \(\rho\) 的 CI,但更准确的做法是先对 \(\theta=f(\rho)\) 构造 CI 再逆变换。Fisher z 变换:
    \[f(r)=\tfrac12\big(\log(1+r)-\log(1-r)\big)\ (=\operatorname{artanh} r),\qquad f^{-1}(z)=\frac{e^{2z}-1}{e^{2z}+1}.\]
  • 相关系数的近似置信区间:
    1. 计算 \(\hat\theta=f(\hat\rho)=\tfrac12(\log(1+\hat\rho)-\log(1-\hat\rho))\);
    2. 近似标准误 \(\widehat{\rm se}(\hat\theta)=1/\sqrt{n-3}\);
    3. \(\theta\) 的 \(1-\alpha\) CI:\((a,b)=\big(\hat\theta-z_{\alpha/2}/\sqrt{n-3},\ \hat\theta+z_{\alpha/2}/\sqrt{n-3}\big)\);
    4. 逆变换得 \(\rho\) 的 CI:\(\left(\dfrac{e^{2a}-1}{e^{2a}+1},\dfrac{e^{2b}-1}{e^{2b}+1}\right)\)。
  • 另一方法:bootstrap。
  • 直观:\(\hat\rho\) 的分布在 \(|\rho|\) 接近 1 时高度偏斜、方差依赖 \(\rho\);z 变换使其近似正态且方差稳定(variance-stabilizing)。

14.3 多元正态(Multivariate Normal)(PDF p.242–243)

  • \(X\sim N(\mu,\Sigma)\) 的密度:
    \[f(x;\mu,\Sigma)=\frac{1}{(2\pi)^{k/2}|\Sigma|^{1/2}}\exp\Big\{-\tfrac12(x-\mu)^T\Sigma^{-1}(x-\mu)\Big\}, \tag{14.7}\]
    \(\mu\) 为 \(k\) 维向量,\(\Sigma\) 为 \(k\times k\) 对称正定阵;\(\mathbb E X=\mu\),\(\mathbb V(X)=\Sigma\)。
  • 定理 14.2:
    1. 若 \(Z\sim N(0,I)\) 且 \(X=\mu+\Sigma^{1/2}Z\),则 \(X\sim N(\mu,\Sigma)\)(模拟多元正态的方法);
    2. 若 \(X\sim N(\mu,\Sigma)\),则 \(\Sigma^{-1/2}(X-\mu)\sim N(0,I)\)(白化/标准化);
    3. \(a^TX\sim N(a^T\mu,a^T\Sigma a)\);
    4. \(V=(X-\mu)^T\Sigma^{-1}(X-\mu)\sim\chi^2_k\)。
  • 定理 14.3:来自 \(N(\mu,\Sigma)\) 的样本量 \(n\) 的随机样本,对数似然(去掉与参数无关的常数)为
    \[\ell(\mu,\Sigma)=-\frac n2(\bar X-\mu)^T\Sigma^{-1}(\bar X-\mu)-\frac n2\mathrm{tr}(\Sigma^{-1}S)-\frac n2\log|\Sigma|,\]
    (此处 \(S\) 为除以 \(n\) 的版本)。MLE 为 \(\hat\mu=\bar X\),\(\hat\Sigma=\frac{n-1}{n}S\)(14.8,\(S\) 为 \(n-1\) 版样本协方差)。
  • 证明(附录 14.6):\(\ell=-\frac{kn}{2}\log(2\pi)-\frac n2\log|\Sigma|-\frac12\sum_i(X_i-\mu)^T\Sigma^{-1}(X_i-\mu)\);利用 \(\sum_i(X_i-\mu)^T\Sigma^{-1}(X_i-\mu)=\sum_i(X_i-\bar X)^T\Sigma^{-1}(X_i-\bar X)+n(\bar X-\mu)^T\Sigma^{-1}(\bar X-\mu)\)(交叉项因 \(\sum_i(X_i-\bar X)=0\) 消失);再用"标量等于其迹"与迹的轮换性:\(\sum_i\mathrm{tr}[(X_i-\bar X)^T\Sigma^{-1}(X_i-\bar X)]=\mathrm{tr}[\Sigma^{-1}\sum_i(X_i-\bar X)(X_i-\bar X)^T]=n\,\mathrm{tr}[\Sigma^{-1}S]\)。

14.4 多项分布(Multinomial)(PDF p.243–245)

  • \(X=(X_1,\dots,X_k)\) 为计数。从有 \(k\) 种颜色球的瓮中有放回抽 \(n\) 次,\(X_j\) 为颜色 \(j\) 的个数,\(p=(p_1,\dots,p_k)\),\(p_j\ge0\),\(\sum p_j=1\)。
  • 定理 14.4:\(X\sim\mathrm{Multinomial}(n,p)\),则边际 \(X_j\sim\mathrm{Binomial}(n,p_j)\),
    \[\mathbb E(X)=\begin{pmatrix}np_1\\\vdots\\np_k\end{pmatrix},\quad \mathbb V(X)=\begin{pmatrix}np_1(1-p_1)&-np_1p_2&\cdots&-np_1p_k\\-np_1p_2&np_2(1-p_2)&\cdots&-np_2p_k\\\vdots&&\ddots&\vdots\\-np_1p_k&-np_2p_k&\cdots&np_k(1-p_k)\end{pmatrix}.\]
    证明协方差:\(X_i+X_j\sim\mathrm{Binomial}(n,p_i+p_j)\),故 \(\mathbb V(X_i+X_j)=n(p_i+p_j)(1-p_i-p_j)\);又等于 \(np_i(1-p_i)+np_j(1-p_j)+2\mathrm{Cov}(X_i,X_j)\),联立得 \(\mathrm{Cov}(X_i,X_j)=-np_ip_j\)。
  • 定理 14.5:\(p\) 的 MLE 为 \(\hat p=X/n=(X_1/n,\dots,X_k/n)\)。证明:对数似然 \(\ell(p)=\sum_jX_j\log p_j\),约束 \(\sum p_j=1\),用 Lagrange 乘子最大化 \(A(p)=\sum_jX_j\log p_j+\lambda(\sum_jp_j-1)\);\(\partial A/\partial p_j=X_j/p_j+\lambda=0\Rightarrow\hat p_j=-X_j/\lambda\);由 \(\sum\hat p_j=1\) 得 \(\lambda=-n\),故 \(\hat p_j=X_j/n\)。
  • MLE 的变异性:可直接算,也可用 Fisher 信息,本例两者相同。直接:\(\mathbb V(\hat p)=n^{-2}\mathbb V(X)=\frac1n\Sigma\),\(\Sigma\) 对角为 \(p_j(1-p_j)\)、非对角为 \(-p_ip_j\)。
  • 定理 14.6:\(\sqrt n(\hat p-p)\rightsquigarrow N(0,\Sigma)\)。

14.5 文献评注 与 14.6 附录(PDF p.245–246)

参考 Johnson & Wichern (1982)、Anderson (1984);相关系数 CI 方法来自 Fisher (1921)。附录为定理 14.3 证明(已并入上文)。

14.7 习题概括(PDF p.246)

  1. 证明定理 14.1。
  2. 求多项分布 MLE 的 Fisher 信息矩阵。
  3. (计算机实验)编写函数生成 nsim 个 Multinomial\((n,p)\) 观测。
  4. (计算机实验)生成给定 \(\mu,\Sigma\) 的多元正态(用 Cholesky/平方根矩阵)。
  5. (计算机实验)生成 100 个 \(N(\mu,\Sigma)\) 向量(书中给定具体 \(\mu\) 与 \(2\times2\) 的 \(\Sigma\),抽取文本中数值缺失),画散点,估计均值与协方差,求真实相关 \(\rho\) 与样本相关比较,用 bootstrap 与 Fisher 法求 95% CI 并比较。
  6. (计算机实验)重复上题 1000 次,比较两种 CI 的覆盖率。

第 14 章 本章要点

  • 线性变换下均值、协方差的变换规则 \(\mathbb V(AX)=A\Sigma A^T\)。
  • 样本协方差矩阵无偏;多元正态 MLE 协方差除以 \(n\)。
  • 多元正态可由 \(\mu+\Sigma^{1/2}Z\) 生成;马氏距离二次型服从 \(\chi^2_k\)。
  • 相关系数的 CI 宜用 Fisher z 变换,标准误 \(1/\sqrt{n-3}\)。
  • 多项分布各分量负相关,\(\mathrm{Cov}(X_i,X_j)=-np_ip_j\);MLE \(\hat p=X/n\) 渐近正态。

第 14 章 与量化交易的关联

  • 组合优化与风险建模:组合方差 \(w^T\Sigma w\) 就是定理 14.1;精度矩阵 \(\Sigma^{-1}\) 出现在均值–方差最优权重 \(w\propto\Sigma^{-1}\mu\) 中。样本协方差在资产数接近样本数时病态,需收缩估计或因子模型(本书不涉及)。
  • 蒙特卡洛:用 \(\mu+\Sigma^{1/2}Z\)(实践中 Cholesky)模拟相关资产收益,用于 VaR、情景分析、期权定价。
  • 马氏距离:\((x-\mu)^T\Sigma^{-1}(x-\mu)\sim\chi^2_k\) 用于异常检测、市场"湍流指数"(turbulence index)。
  • 相关系数推断:Fisher z 变换可用于检验两只资产/因子相关性是否显著、比较不同时段相关性变化(配对交易选对、相关性 regime 判别)。金融收益厚尾时正态近似变差,需用 bootstrap。
  • 多项分布:离散状态频率(如涨/平/跌分类计数、订单类型比例)的估计与置信区间。

第 14 章 推荐习题

  • 习题 2:多项分布 Fisher 信息(含约束的信息矩阵)。
  • 习题 4–6:多元正态模拟与相关系数 CI 覆盖率比较(直接可迁移到资产收益模拟)。

第 15 章 关于独立性的推断(Inference About Independence)(PDF p.247–257)

本章两个问题:(1) 如何检验两个随机变量是否独立;(2) 如何估计依赖强度。\(Y\) 与 \(Z\) 不独立称为相依(dependent)、关联(associated)或相关(related);关联不意味着因果(第 16 章)。记号 \(Y\amalg Z\) 表示独立,\(Y\not\amalg Z\) 表示相依。

15.1 两个二元变量(Two Binary Variables)(PDF p.247–251)

  • 数据 \((Y_1,Z_1),\dots,(Y_n,Z_n)\),均为二元,汇总为 \(2\times2\) 列联表,\(X_{ij}\) = 满足 \(Y=i,Z=j\) 的观测数(书中行列标记略有不一致,不影响结论)。点下标表示求和:\(X_{i\cdot}=\sum_jX_{ij}\),\(X_{\cdot j}=\sum_iX_{ij}\),\(n=X_{\cdot\cdot}=\sum_{i,j}X_{ij}\)。此约定贯穿全书余下部分。

  • 概率表 \(p_{ij}\),边际 \(p_{i\cdot},p_{\cdot j}\)。计数向量 \(X=(X_{00},X_{01},X_{10},X_{11})\sim\mathrm{Multinomial}(n,p)\)。

  • 定义 15.1:优势比(odds ratio)

    \[\psi=\frac{p_{00}p_{11}}{p_{01}p_{10}}, \tag{15.1}\]
    对数优势比(log odds ratio) \(\gamma=\log\psi\)(15.2)。

  • 定理 15.2:以下等价:(1) \(Y\amalg Z\);(2) \(\psi=1\);(3) \(\gamma=0\);(4) 对 \(i,j\in\{0,1\}\),\(p_{ij}=p_{i\cdot}p_{\cdot j}\)。

  • 检验 \(H_0:Y\amalg Z\) vs \(H_1:Y\not\amalg Z\)(15.3)。

    • 似然比检验(定理 15.3):\(H_1\) 下 MLE \(\hat p=X/n\);\(H_0\) 下受约束 MLE 满足 \(p_{ij}=p_{i\cdot}p_{\cdot j}\)。统计量
      \[T=2\sum_{i=0}^1\sum_{j=0}^1X_{ij}\log\left(\frac{X_{ij}X_{\cdot\cdot}}{X_{i\cdot}X_{\cdot j}}\right). \tag{15.4}\]
      \(H_0\) 下 \(T\rightsquigarrow\chi^2_1\),当 \(T>\chi^2_{1,\alpha}\) 时拒绝(自由度 = 3 个自由参数 − 2 个)。
    • Pearson \(\chi^2\) 检验(定理 15.4):
      \[U=\sum_{i=0}^1\sum_{j=0}^1\frac{(X_{ij}-E_{ij})^2}{E_{ij}},\qquad E_{ij}=\frac{X_{i\cdot}X_{\cdot j}}{n}. \tag{15.5}\]
      \(H_0\) 下 \(U\rightsquigarrow\chi^2_1\)。直观:\(H_0\) 下 \(p_{ij}\) 的 MLE 为 \(\hat p_{i\cdot}\hat p_{\cdot j}=\frac{X_{i\cdot}}{n}\frac{X_{\cdot j}}{n}\),期望频数 \(E_{ij}=n\hat p_{ij}\);\(U\) 比较观测频数与期望频数。
  • 例 15.5(扁桃体切除与霍奇金病,Johnson & Johnson 1972):

    切除 未切除 合计
    霍奇金病 90 84 174
    无病 165 307 472
    合计 255 391 646

    似然比 \(T=14.75\),p 值 \(\mathbb P(\chi^2_1>14.75)=0.0001\);\(\chi^2\) 统计量 \(U=14.96\),p 值 0.0001。拒绝独立,结论:扁桃体切除与霍奇金病有关联。但不代表因果——例如医生可能给病情最重的病人做扁桃体切除,于是关联来自"病重"这一共同因素。(脚注:数据实际来自病例对照研究,见附录。)

  • 依赖强度估计(定理 15.6):MLE

    \[\hat\psi=\frac{X_{00}X_{11}}{X_{01}X_{10}},\qquad\hat\gamma=\log\hat\psi. \tag{15.6}\]
    delta 方法得渐近标准误
    \[\widehat{\rm se}(\hat\gamma)=\sqrt{\frac1{X_{00}}+\frac1{X_{01}}+\frac1{X_{10}}+\frac1{X_{11}}},\qquad \widehat{\rm se}(\hat\psi)=\hat\psi\,\widehat{\rm se}(\hat\gamma). \tag{15.7–15.8}\]

  • 注 15.7:小样本时 \(\hat\psi,\hat\gamma\) 方差可能很大(某格为 0 时无定义),常用修正估计

    \[\tilde\psi=\frac{(X_{00}+\frac12)(X_{11}+\frac12)}{(X_{01}+\frac12)(X_{10}+\frac12)}. \tag{15.9}\]

  • 关于 \(\gamma=0\) 的 Wald 检验:\(W=(\hat\gamma-0)/\widehat{\rm se}(\hat\gamma)\);\(\gamma\) 的 \(1-\alpha\) CI:\(\hat\gamma\pm z_{\alpha/2}\widehat{\rm se}(\hat\gamma)\)。\(\psi\) 的 CI 两种做法:\(\hat\psi\pm z_{\alpha/2}\widehat{\rm se}(\hat\psi)\);或利用 \(\psi=e^\gamma\) 取 \(\big(\exp(\hat\gamma-z_{\alpha/2}\widehat{\rm se}(\hat\gamma)),\exp(\hat\gamma+z_{\alpha/2}\widehat{\rm se}(\hat\gamma))\big)\)(15.10),后者通常更准确。

  • 例 15.8:\(\hat\psi=\frac{90\times307}{165\times84}=1.99\),\(\hat\gamma=\log1.99=0.69\)——切除者患病的优势约为两倍。\(\widehat{\rm se}(\hat\gamma)=\sqrt{1/90+1/84+1/165+1/307}=0.18\);\(W=0.69/0.18=3.84\),p 值 0.0001;\(\gamma\) 的 95% CI \(0.69\pm2(0.18)=(0.33,1.05)\);\(\psi\) 的 95% CI \((e^{0.33},e^{1.05})=(1.39,2.86)\)。

15.2 两个离散变量(Two Discrete Variables)(PDF p.251–252)

  • \(Y\in\{1,\dots,J\}\),\(Z\in\{1,\dots,I\}\),\(I\times J\) 列联表,\(X_{ij}\) = 满足 \(Z=i,Y=j\) 的观测数。检验 \(H_0:Y\amalg Z\)(15.11)。

  • 定理 15.9:似然比统计量

    \[T=2\sum_{i=1}^I\sum_{j=1}^JX_{ij}\log\left(\frac{X_{ij}X_{\cdot\cdot}}{X_{i\cdot}X_{\cdot j}}\right), \tag{15.12}\]
    \(H_0\) 下渐近 \(\chi^2_\nu\),\(\nu=(I-1)(J-1)\)。Pearson 统计量 \(U=\sum_{i,j}(X_{ij}-E_{ij})^2/E_{ij}\)(15.13),同样渐近 \(\chi^2_\nu\)。

  • 例 15.10(Dunsmore et al. 1987,霍奇金病患者组织学类型 × 治疗反应):

    类型 完全缓解 部分缓解 无反应 合计
    LP 74 18 12 104
    NS 68 16 12 96
    MC 154 54 58 266
    LD 18 10 44 72

    \(\chi^2=75.89\),自由度 \(3\times2=6\),p 值 ≈ 0;似然比 68.30,p 值 ≈ 0。强证据表明治疗反应与组织学类型有关。

15.3 两个连续变量(Two Continuous Variables)(PDF p.252)

若假设 \((Y,Z)\) 二元正态,则用相关系数 \(\rho\) 度量依赖,检验、估计与 CI 见 14.2 节。不假设正态时仍可用 14.2 节方法推断 \(\rho\),但若结论 \(\rho=0\),只能说不相关、不能推出独立;反方向成立:若结论为相关,则可推出相依。

15.4 一个连续、一个离散变量(One Continuous Variable and One Discrete)(PDF p.252–253)

  • \(Y\in\{1,\dots,I\}\) 离散,\(Z\) 连续,\(F_i(z)=\mathbb P(Z\le z\mid Y=i)\)。
  • 定理 15.11:\(Y\amalg Z\) 当且仅当 \(F_1=\dots=F_I\)。于是检验 \(H_0:F_1=\dots=F_I\) vs 非 \(H_0\)。
  • 取 \(I=2\),用两样本 Kolmogorov–Smirnov 检验。\(n_1,n_2\) 为 \(Y=1,2\) 的观测数,
    \[\hat F_1(z)=\frac1{n_1}\sum_{i=1}^nI(Z_i\le z)I(Y_i=1),\quad \hat F_2(z)=\frac1{n_2}\sum_{i=1}^nI(Z_i\le z)I(Y_i=2),\]
    统计量 \(D=\sup_x|\hat F_1(x)-\hat F_2(x)|\)。
  • 定理 15.12:令 \(H(t)=1-2\sum_{j=1}^\infty(-1)^{j-1}e^{-2j^2t^2}\)。\(H_0\) 下
    \[\lim_{n\to\infty}\mathbb P\left(\sqrt{\frac{n_1n_2}{n_1+n_2}}\,D\le t\right)=H(t). \tag{15.14}\]
    于是近似水平 \(\alpha\) 检验:当 \(\sqrt{\frac{n_1n_2}{n_1+n_2}}D>H^{-1}(1-\alpha)\) 时拒绝 \(H_0\)。

15.5 附录:优势比的解释与抽样设计(PDF p.253–256)

  • 事件 \(A\) 的优势(odds) \(\mathrm{odds}(A)=\mathbb P(A)/(1-\mathbb P(A))\),反之 \(\mathbb P(A)=\mathrm{odds}(A)/(1+\mathrm{odds}(A))\)。\(E\) = 暴露(吸烟、辐射等),\(D\) = 患病。暴露下患病优势 \(\mathrm{odds}(D\mid E)=\frac{\mathbb P(D|E)}{1-\mathbb P(D|E)}\),非暴露下 \(\mathrm{odds}(D\mid E^c)\) 类似。优势比 \(\psi=\mathrm{odds}(D|E)/\mathrm{odds}(D|E^c)\)。\(\psi=1\) ⇔ 暴露与否患病概率相同 ⇔ 独立;\(\gamma=\log\psi=0\) 对应独立。
  • 以行 \(E^c/E\)、列 \(D^c/D\) 的概率表 \(p_{00},p_{01},p_{10},p_{11}\):\(\mathbb P(D|E)=\frac{p_{11}}{p_{10}+p_{11}}\),\(\mathrm{odds}(D|E)=\frac{p_{11}}{p_{10}}\);\(\mathbb P(D|E^c)=\frac{p_{01}}{p_{00}+p_{01}}\),\(\mathrm{odds}(D|E^c)=\frac{p_{01}}{p_{00}}\);故 \(\psi=\frac{p_{11}p_{00}}{p_{01}p_{10}}\)。
  • 估计方法取决于数据收集方式,三种设计:
    1. 多项抽样(multinomial sampling):从总体随机抽样并记录暴露与患病状况,\(X\sim\mathrm{Multinomial}(n,p)\),\(\hat p_{ij}=X_{ij}/n\),\(\hat\psi=\frac{X_{11}X_{00}}{X_{01}X_{10}}\)。
    2. 前瞻抽样 / 队列抽样(prospective / cohort sampling):选定暴露与非暴露人群(\(X_{0\cdot},X_{1\cdot}\) 固定),数各组患病人数:\(X_{01}\sim\mathrm{Binomial}(X_{0\cdot},\mathbb P(D|E^c))\),\(X_{11}\sim\mathrm{Binomial}(X_{1\cdot},\mathbb P(D|E))\)。不能估计表中所有概率,但 \(\psi\) 只依赖 \(\mathbb P(D|E)\) 与 \(\mathbb P(D|E^c)\),故 \(\widehat{\mathbb P}(D|E)=X_{11}/X_{1\cdot}\)、\(\widehat{\mathbb P}(D|E^c)=X_{01}/X_{0\cdot}\),代入得同样的 \(\hat\psi=\frac{X_{00}X_{11}}{X_{01}X_{10}}\)。
    3. 病例对照 / 回顾性抽样(case-control / retrospective sampling):选定患病与不患病者,观察暴露比例;疾病罕见时效率高得多。\(X_{10}\sim\mathrm{Binomial}(X_{\cdot0},\mathbb P(E|D^c))\),\(X_{11}\sim\mathrm{Binomial}(X_{\cdot1},\mathbb P(E|D))\)。令人意外地仍可估计 \(\psi\):\(\mathbb P(E|D)=\frac{p_{11}}{p_{01}+p_{11}}\),\(\mathrm{odds}(E|D)=\frac{p_{11}}{p_{01}}\),\(\mathrm{odds}(E|D^c)=\frac{p_{10}}{p_{00}}\),于是 \(\frac{\mathrm{odds}(E|D)}{\mathrm{odds}(E|D^c)}=\frac{p_{11}p_{00}}{p_{01}p_{10}}=\psi\)(优势比的对称性)。估计仍为 \(\hat\psi=\frac{X_{00}X_{11}}{X_{01}X_{10}}\)。
    • 结论:三种设计下 \(\psi\) 的估计相同。
  • 病例对照设计下 \(\mathbb P(D|E)-\mathbb P(D|E^c)\) 不可估计:由 Bayes 定理 \(\mathbb P(D|E)=\frac{\mathbb P(E|D)\mathbb P(D)}{\mathbb P(E|D)\mathbb P(D)+\mathbb P(E|D^c)(1-\mathbb P(D))}\),而 \(\mathbb P(D)\) 无法从数据估计。
  • 相对风险(relative risk) \(\rho=\mathbb P(D|E)/\mathbb P(D|E^c)\)。定理 15.13:当 \(\mathbb P(D)\to0\) 时 \(\psi/\rho\to1\)。即在罕见病假设下相对风险约等于优势比,而后者可估计。

15.6 习题概括(PDF p.256–257)

1–3. 证明定理 15.2、15.3、15.6。 4. 马里兰州死刑判决与受害者种族数据(纽约时报 2003):黑人受害者 死刑 14 / 非死刑 641;白人受害者 死刑 62 / 非死刑 594。用本章工具分析并解释为何不能据此做因果结论。 5. Montana 数据中 Age 与 Financial Status 的独立性分析(两个离散变量)。 6. 用相关系数估计气温与纬度的相关,给出估计、检验、CI。 7. 检验钙摄入量与血压下降是否相关(一离散一连续,适用 KS 检验)。

第 15 章 本章要点

  • \(2\times2\) 表:独立 ⇔ 优势比 \(\psi=1\) ⇔ \(\gamma=0\);检验用似然比 \(T\) 或 Pearson \(U\),自由度 1;\(I\times J\) 表自由度 \((I-1)(J-1)\)。
  • 对数优势比标准误为四格倒数和的平方根;\(\psi\) 的 CI 宜先在对数尺度构造再取指数。
  • 连续变量:不相关 ≠ 独立;离散 × 连续:独立 ⇔ 条件分布相同,用两样本 KS 检验。
  • 优势比在多项、队列、病例对照三种设计下都可同样估计;罕见事件下优势比≈相对风险。

第 15 章 与量化交易的关联

  • 信号评估:把"信号方向 × 次日涨跌"做成 \(2\times2\) 表,用 \(\chi^2\)/似然比检验信号与收益方向是否独立,用对数优势比度量命中率提升及其置信区间;但需注意收益序列的自相关会使独立同分布假设失效、低估标准误。
  • 分类变量依赖:行业 × 状态(如违约/不违约、是否涨停)列联表分析;\(I\times J\) 表检验 regime 与资产表现的关联。
  • KS 两样本检验:比较两个时段或两类条件下收益分布是否相同(分布漂移检测、样本内外收益分布一致性、交易成本分布对比)。
  • 抽样设计与偏差:病例对照设计思想对应事件研究中的"按结果抽样"——只研究崩盘/违约公司会导致绝对概率不可估计,只能估计相对量;这是幸存者偏差和选择偏差的统计根源。
  • 不相关不等于独立:收益可能线性不相关但波动率相依(GARCH 效应),这正是 15.3 节警告的情形。

第 15 章 推荐习题

  • 习题 4:完整练习 \(2\times2\) 表的检验、优势比 CI 与因果谨慎解释。
  • 习题 3:delta 方法推导对数优势比标准误。
  • 习题 7:两样本 KS 检验应用。

第 16 章 因果推断(Causal Inference)(PDF p.258–269)

粗略地说,"X 导致 Y"意为改变 X 的值会改变 Y 的分布。X 导致 Y 时二者必然关联,但反之一般不成立:关联不必然意味着因果。两个框架:本章的反事实随机变量;下一章的有向无环图。

16.1 反事实模型(The Counterfactual Model)(PDF p.258–262)

  • \(X\) 为二元处理变量(\(X=1\) 处理/暴露,\(X=0\) 未处理),"处理"含义广泛(服药、吸烟等)。\(Y\) 为结果。
  • 引入潜在结果(potential outcomes) \((C_0,C_1)\):\(C_0\) 为未处理时的结果,\(C_1\) 为处理时的结果。于是
    \[Y=\begin{cases}C_0 & X=0\\ C_1 & X=1\end{cases}\quad\Longleftrightarrow\quad Y=C_X. \tag{16.1}\]
    (16.1) 称为一致性关系(consistency relationship)。
  • 玩具数据(星号为未观测):\(X=0\) 的 4 人 \(Y=C_0=4,7,2,8\),\(C_1=*\);\(X=1\) 的 4 人 \(Y=C_1=3,5,8,9\),\(C_0=*\)。\(X=0\) 时 \(C_1\) 不可观测,称为反事实(counterfactual)——"如果与事实相反地接受了处理会得到的结果";同理 \(X=1\) 时 \(C_0\) 是反事实。
  • 二元结果下四类个体:Survivors \((C_0,C_1)=(1,1)\);Responders \((0,1)\);Anti-responders \((1,0)\);Doomed \((0,0)\)。可把 \((C_0,C_1)\) 看作包含个体所有相关信息的隐变量。
  • 平均因果效应 / 平均处理效应(average causal effect / average treatment effect):
    \[\theta=\mathbb E(C_1)-\mathbb E(C_0), \tag{16.2}\]
    即"所有人都接受处理时的均值"减"所有人都不接受时的均值"。其它度量:二元时的因果优势比 \(\frac{\mathbb P(C_1=1)}{\mathbb P(C_1=0)}\Big/\frac{\mathbb P(C_0=1)}{\mathbb P(C_0=0)}\),因果相对风险 \(\mathbb P(C_1=1)/\mathbb P(C_0=1)\)。主要思想对各种效应度量相同,下面用 \(\theta\)。
  • 关联(association):
    \[\alpha=\mathbb E(Y\mid X=1)-\mathbb E(Y\mid X=0). \tag{16.3}\]
  • 定理 16.1(关联不是因果):一般地 \(\theta\ne\alpha\)。
  • 例 16.2:8 人总体,前 4 人 \(X=0,Y=0,C_0=0,C_1=0^*\);后 4 人 \(X=1,Y=1,C_0=1^*,C_1=1\)。每人 \(C_0=C_1\),处理无效:\(\theta=\frac18\sum C_{1i}-\frac18\sum C_{0i}=\frac{4}{8}-\frac48=0\)。但观测数据给出 \(\alpha=\frac{1+1+1+1}{4}-\frac{0+0+0+0}{4}=1\),故 \(\theta\neq\alpha\)。
    • 直观:\(Y=1\) 健康、\(X=1\) 服维生素 C。维生素 C 无因果效应;人分两类:健康型 \((1,1)\) 与不健康型 \((0,0)\);健康的人倾向服维生素 C。正是 \((C_0,C_1)\) 与 \(X\) 之间的关联制造了 \(X\) 与 \(Y\) 的关联。若错误地作因果解读并劝所有人服用,且大多数人照做(例如 7 人服用:4 个不健康者中 3 个改为 \(X=1\)),新总体中 \(\alpha=4/7-0/1=4/7\),关联从 1 降到 4/7。因果效应从未改变,但不区分关联与因果的观察者会困惑——建议似乎让情况变糟。
  • 可以构造 \(\alpha>0\) 而 \(\theta<0\) 的例子(习题 1):关联与因果效应符号可以相反。\(\theta\ne\alpha\) 的原因是 \((C_0,C_1)\) 与 \(X\) 不独立,即处理分配依赖于个体类型。
  • 定理 16.3:若随机分配处理,且 \(\mathbb P(X=0)>0,\mathbb P(X=1)>0\),则 \(\alpha=\theta\)。于是 \(\alpha\) 的任何相合估计都是 \(\theta\) 的相合估计,特别是
    \[\hat\theta=\hat{\mathbb E}(Y|X=1)-\hat{\mathbb E}(Y|X=0)=\bar Y_1-\bar Y_0,\quad \bar Y_1=\frac1{n_1}\sum_iY_iX_i,\ \bar Y_0=\frac1{n_0}\sum_iY_i(1-X_i),\]
    \(n_1=\sum_iX_i\),\(n_0=\sum_i(1-X_i)\)。证明:随机分配 ⇒ \(X\amalg(C_0,C_1)\),故 \(\theta=\mathbb E(C_1)-\mathbb E(C_0)=\mathbb E(C_1|X=1)-\mathbb E(C_0|X=0)=\mathbb E(Y|X=1)-\mathbb E(Y|X=0)=\alpha\)(第二步用独立,第三步用一致性 \(Y=C_X\));相合性来自大数定律。
  • 条件因果效应:协变量 \(Z\),\(\theta_z=\mathbb E(C_1|Z=z)-\mathbb E(C_0|Z=z)\)。如 \(Z\) 为性别,\(\theta_0\) 是女性中的因果效应、\(\theta_1\) 是男性中的。随机试验中 \(\theta_z=\mathbb E(Y|X=1,Z=z)-\mathbb E(Y|X=0,Z=z)\),可用相应子样本均值估计。
  • 反事实模型小结:随机变量 \((C_0,C_1,X,Y)\);一致性 \(Y=C_X\);因果效应 \(\theta=\mathbb E(C_1)-\mathbb E(C_0)\);关联 \(\alpha=\mathbb E(Y|X=1)-\mathbb E(Y|X=0)\);随机分配 ⇒ \((C_0,C_1)\amalg X\) ⇒ \(\theta=\alpha\)。

16.2 超越二元处理(Beyond Binary Treatments)(PDF p.262–264)

  • \(X\in\mathcal X\)(如药物剂量 \(X\in\mathbb R\))。反事实向量推广为反事实函数 \(C(x)\):个体接受剂量 \(x\) 时的结果。观测结果由一致性关系 \(Y\equiv C(X)\)(16.4)给出(图 16.1:\(Y\) 是曲线 \(C(x)\) 在观测剂量 \(X\) 处的取值)。
  • 因果回归函数(causal regression function) \(\theta(x)=\mathbb E(C(x))\)(16.5);度量关联的回归函数 \(r(x)=\mathbb E(Y|X=x)\)。
  • 定理 16.4:一般 \(\theta(x)\ne r(x)\);但 \(X\) 随机分配时 \(\theta(x)=r(x)\)。
  • 例 16.5(图 16.2):4 个个体的反事实函数 \(C_i(x)\) 都是水平线(取值 3、2、1、0),无因果效应,\(\theta(x)=\frac14\sum_iC_i(x)\) 为常数,改变剂量不会改变任何人的结果。但观测点 \(Y_i=C_i(X_i)\) 中 \(C\) 值高者恰好 \(X\) 小(\(X_1<X_2<X_3<X_4\)),于是回归曲线 \(r(x)\) 递减、非常数——无因果却有关联。

16.3 观察性研究与混杂(Observational Studies and Confounding)(PDF p.264–266)

  • 处理非随机分配的研究称为观察性研究(observational study):个体自选暴露水平(报纸上大多数健康研究属此类)。关联与因果不同是因为潜在结果 \(C\) 与 \(X\) 不独立。
  • 若能找到分组使组内 \(X\) 与 \(\{C(x):x\in\mathcal X\}\) 独立(如年龄、性别、教育、族裔都很相似的人群,组内 \(X\) 的选择近似随机),这些变量称为混杂变量(confounding variables),记为 \(Z\):
    \[\{C(x):x\in\mathcal X\}\amalg X\mid Z. \tag{16.6}\]
    若(16.6)成立且 \(Z\) 被观测,称无未观测混杂(no unmeasured confounding)。
  • 定理 16.6:若(16.6)成立,则
    \[\theta(x)=\int\mathbb E(Y\mid X=x,Z=z)\,dF_Z(z). \tag{16.7}\]
    若 \(\hat r(x,z)\) 是 \(\mathbb E(Y|X=x,Z=z)\) 的相合估计,则 \(\hat\theta(x)=\frac1n\sum_{i=1}^n\hat r(x,Z_i)\) 是 \(\theta(x)\) 的相合估计。特别地,若 \(r(x,z)=\beta_0+\beta_1x+\beta_2z\) 线性,则
    \[\hat\theta(x)=\hat\beta_0+\hat\beta_1x+\hat\beta_2\bar Z_n, \tag{16.8}\]
    \((\hat\beta_0,\hat\beta_1,\hat\beta_2)\) 为最小二乘估计。(即 \(Z\) 线性可加时,控制 \(Z\) 后 \(X\) 的回归系数就是因果斜率。)
  • 注 16.7:对比 \(\mathbb E(Y|X=x)=\int\mathbb E(Y|X=x,Z=z)\,dF_{Z|X}(z|x)\)——区别在于对 \(Z\) 的边际分布还是条件分布积分。流行病学称(16.7)为调整后处理效应(adjusted treatment effect),此过程称为对混杂进行调整(adjusting / controlling)。
  • 选择测量与控制哪些混杂变量需要科学洞见;调整后仍不能确定没有遗漏混杂,因此观察性研究应保持健康的怀疑。观察性结果开始可信的条件:(i) 多项研究重复出相同结果;(ii) 每项研究都控制了合理的混杂;(iii) 有合理的科学机制解释。吸烟与癌症是好例子:多项研究调整混杂后仍显示关系,实验室证明吸烟损伤肺细胞,随机动物实验也发现因果联系。单一观察性研究本身不是强证据。

16.4 辛普森悖论(Simpson's Paradox)(PDF p.266–268)

  • 多数教材的解释令人困惑甚至错误,因为不用反事实(或 DAG)几乎无法讲清。

  • \(X\) 二元处理,\(Y\) 二元结果,\(Z\) 二元(性别)。联合分布:

    \(Z=1\)(男)\(Y=1\) \(Y=0\) \(Z=0\)(女)\(Y=1\) \(Y=0\)
    \(X=1\) .1500 .2250 .1000 .0250
    \(X=0\) .0375 .0875 .2625 .1125

    \((X,Y)\) 边际:\(X=1\):\(Y=1\) .25,\(Y=0\) .25;\(X=0\):\(Y=1\) .30,\(Y=0\) .20。

  • 计算:\(\mathbb P(Y=1|X=1)-\mathbb P(Y=1|X=0)=0.5-0.6=-0.1\);男性中 \(0.4-0.3=0.1\);女性中 \(0.8-0.7=0.1\)。

  • 看似"处理总体有害、对男性有益、对女性有益"——矛盾。问题出在数学到英语的翻译:\(\mathbb P(Y=1|X=1)<\mathbb P(Y=1|X=0)\) 不意味着处理有害。"处理有害"应写作 \(\mathbb P(C_1=1)<\mathbb P(C_0=1)\);"对男性有害"应写作 \(\mathbb P(C_1=1|Z=1)<\mathbb P(C_0=1|Z=1)\)。表中三个数学陈述毫不矛盾。

  • 真正的辛普森悖论不可能发生:若对所有 \(z\) 有 \(\mathbb P(C_1=1|Z=z)>\mathbb P(C_0=1|Z=z)\),则

    \[\mathbb P(C_1=1)=\sum_z\mathbb P(C_1=1|Z=z)\mathbb P(Z=z)>\sum_z\mathbb P(C_0=1|Z=z)\mathbb P(Z=z)=\mathbb P(C_0=1).\]
    处理对每个子群有益则对总体有益,无悖论。

16.5 文献评注(PDF p.268)

潜在结果框架主要归功于 Jerzy Neyman 与 Donald Rubin,后续有 Jamie Robins、Paul Rosenbaum 等;计量经济学中有 James Heckman、Charles Manski 的平行发展。教材:Pearl (2000)、Rosenbaum (2002)、Spirtes et al. (2000)、van der Laan & Robins (2003)。

16.6 习题概括(PDF p.268–269)

  1. 构造类似例 16.2 的例子使 \(\alpha>0\) 而 \(\theta<0\)。
  2. 证明定理 16.4。
  3. 观察性研究中 \(X_i,Y_i\in\{0,1\}\):\(\theta\) 不可估计但可给出可相合估计的上下界(Manski 界),并证明界宽为 1。提示:\(\mathbb E(C_1)=\mathbb E(C_1|X=1)\mathbb P(X=1)+\mathbb E(C_1|X=0)\mathbb P(X=0)\),后一项未知但在 \([0,1]\) 中。
  4. \(C_i(x)=\beta_{1i}x\),个体斜率各异;构造 \((\beta_1,X)\) 的联合分布使 \(\mathbb P(\beta_1>0)=1\) 但 \(\mathbb E(Y|X=x)\) 关于 \(x\) 递减,并解释(个体全为正效应,回归却为负)。
  5. 随机分配下,以 \(C_0,C_1\) 中位数之差 \(\theta=m_1-m_0\) 为因果效应,用 \((X,Y)\) 联合分布表示 \(\theta\)(答:\(F_{Y|X=1}^{-1}(1/2)-F_{Y|X=0}^{-1}(1/2)\))。

第 16 章 本章要点

  • 潜在结果 \((C_0,C_1)\) + 一致性 \(Y=C_X\) 精确区分因果效应 \(\theta=\mathbb E C_1-\mathbb E C_0\) 与关联 \(\alpha=\mathbb E(Y|X=1)-\mathbb E(Y|X=0)\)。
  • 二者一般不等,符号甚至可以相反;随机分配使 \((C_0,C_1)\amalg X\),从而 \(\theta=\alpha\)。
  • 连续处理:因果回归函数 \(\theta(x)=\mathbb E C(x)\) vs 回归函数 \(r(x)\)。
  • 观察性研究中若无未观测混杂,因果效应 = 对 \(Z\) 的边际分布积分的调整回归 \(\int\mathbb E(Y|X=x,Z=z)dF_Z(z)\)。
  • 辛普森悖论的根源是把条件概率误译为因果陈述。

第 16 章 与量化交易的关联

  • 因子与 alpha 的因果性:因子收益与特征的关联可能来自混杂(如规模、行业、流动性同时影响特征与收益),需在横截面回归中控制这些变量——对应(16.7)的调整思想;但遗漏变量永远可能存在,这是因子"失效"的原因之一。
  • 策略/事件评估:评估某个交易规则、新闻事件、政策(如纳入指数、回购)对价格的效应,本质是观察性研究;可用匹配、分组控制、双重差分等思想,注意选择偏差(公司自主选择回购时机)。
  • A/B 测试与执行算法:执行策略(如不同下单算法、路由)随机分配订单是唯一能干净估计因果效应的方式(定理 16.3),券商/做市商会对执行算法做随机化实验以估计市场冲击。
  • 辛普森悖论在组合归因中:总体上某策略收益低于基准,但在每个行业/市值分组中都更好——原因是分组权重差异;绩效归因(Brinson 分解)需按分组看。
  • Manski 界(习题 3)提示:在不可识别时给出效应区间而非点估计,适合稳健决策。

第 16 章 推荐习题

  • 习题 1:构造关联与因果符号相反的例子(理解混杂)。
  • 习题 3:部分识别的界。
  • 习题 4:个体正效应但总体回归为负(与横截面回归误读密切相关)。

第 17 章 有向图与条件独立(Directed Graphs and Conditional Independence)(PDF p.270–286)

17.1 引言(PDF p.270–271)

有向图由节点及部分节点间的箭头组成(图 17.1:\(V=\{X,Y,Z\}\),\(E=\{(Y,X),(Y,Z)\}\))。图可表示变量间独立关系,也可替代反事实表示因果关系。有人把带概率分布的有向图称为"贝叶斯网络(Bayesian network)",作者认为这是糟糕的术语:有向图上的推断可以用频率派或贝叶斯方法。

17.2 条件独立(Conditional Independence)(PDF p.271)

  • 定义 17.1:给定 \(Z\) 时 \(X\) 与 \(Y\) 条件独立,记 \(X\amalg Y\mid Z\),若对所有 \(x,y,z\)
    \[f_{X,Y|Z}(x,y\mid z)=f_{X|Z}(x\mid z)\,f_{Y|Z}(y\mid z). \tag{17.1}\]
    直观:已知 \(Z\) 后,\(Y\) 不再提供关于 \(X\) 的额外信息。等价定义 \(f(x\mid y,z)=f(x\mid z)\)(17.2)。
  • 定理 17.2(条件独立的基本性质):
    1. 对称性:\(X\amalg Y|Z\Rightarrow Y\amalg X|Z\);
    2. 分解:\(X\amalg Y|Z\) 且 \(U=h(X)\) ⇒ \(U\amalg Y|Z\);
    3. 弱联合:\(X\amalg Y|Z\) 且 \(U=h(X)\) ⇒ \(X\amalg Y|(Z,U)\);
    4. 收缩:\(X\amalg Y|Z\) 且 \(X\amalg W|(Y,Z)\) ⇒ \(X\amalg(W,Y)|Z\);
    5. 交:\(X\amalg Y|Z\) 且 \(X\amalg Z|Y\) ⇒ \(X\amalg(Y,Z)\)。(脚注:最后一条需要所有事件概率为正,前四条不需要。)

17.3 DAG(PDF p.271–273)

  • 有向图 \(\mathcal G\):顶点集 \(V\)、边集 \(E\)(有序对);每个顶点对应一个随机变量;\((X,Y)\in E\) 表示 \(X\to Y\)。
  • 术语:相邻(adjacent)——有箭头相连(任意方向);\(X\to Y\) 时 \(X\) 是 \(Y\) 的父节点(parent)、\(Y\) 是 \(X\) 的子节点(child);\(X\) 的父节点集记 \(\pi_X\) 或 \(\pi(X)\)。有向路径(directed path):箭头方向一致的连接序列;忽略方向的相邻顶点序列为无向路径(undirected path)(如图 17.1 中 \(\{X,Y,Z\}\))。存在从 \(X\) 到 \(Y\) 的有向路径(或 \(X=Y\))时,\(X\) 是 \(Y\) 的祖先(ancestor),\(Y\) 是 \(X\) 的后代(descendant)。
  • 碰撞点(collider):\(X\to Y\leftarrow Z\) 称在 \(Y\) 处碰撞;其它形式(\(X\to Y\to Z\)、\(X\leftarrow Y\to Z\))为非碰撞点(non-collider)。碰撞性依赖路径:图 17.7 中 \(Y\) 在路径 \(\{X,Y,Z\}\) 上是碰撞点,在 \(\{X,Y,W\}\) 上不是。指向碰撞点的两个变量不相邻时称非屏蔽碰撞点(unshielded collider)。
  • 起止于同一变量的有向路径为环(cycle);无环有向图即 DAG。此后只讨论 DAG。

17.4 概率与 DAG(Probability and DAGs)(PDF p.273–274)

  • 定义 17.3:\(\mathcal G\) 的顶点 \(V=(X_1,\dots,X_k)\)。若分布 \(\mathbb P\) 的概率函数满足
    \[f(v)=\prod_{i=1}^kf(x_i\mid\pi_i), \tag{17.3}\]
    (\(\pi_i\) 为 \(X_i\) 的父节点),称 \(\mathbb P\) 对 \(\mathcal G\) 马尔可夫(Markov to \(\mathcal G\)),或 \(\mathcal G\) 表示 \(\mathbb P\)。\(\mathcal G\) 表示的分布集记 \(M(\mathcal G)\)。
  • 例 17.4(图 17.2:overweight → heart disease ← smoking → cough):\(f(\text{ow},\text{sm},\text{hd},\text{co})=f(\text{ow})f(\text{sm})f(\text{hd}\mid\text{ow},\text{sm})f(\text{co}\mid\text{sm})\)。
  • 例 17.5(图 17.3:\(X\to Z\leftarrow Y\),\(Z\to W\)):\(\mathbb P\in M(\mathcal G)\) 当且仅当 \(f(x,y,z,w)=f(x)f(y)f(z|x,y)f(w|z)\)。
  • 定理 17.6(马尔可夫条件 Markov Condition):\(\mathbb P\in M(\mathcal G)\) 当且仅当对每个变量 \(W\),
    \[W\amalg\widetilde W\mid\pi_W, \tag{17.4}\]
    \(\widetilde W\) 为除 \(W\) 的父节点和后代以外的所有其他变量。粗略说:给定父节点,每个变量独立于其"过去"(非后代)。
  • 例 17.7(图 17.3):\(X\amalg Y\),\(W\amalg\{X,Y\}\mid Z\)。
  • 例 17.8(图 17.4:\(A\to B\),\(A\to C\),\(B\to D\leftarrow C\),\(D\to E\)):\(f(a,b,c,d,e)=f(a)f(b|a)f(c|a)f(d|b,c)f(e|d)\);马尔可夫条件给出 \(D\amalg A\mid\{B,C\}\),\(E\amalg\{A,B,C\}\mid D\),\(B\amalg C\mid A\)。

17.5 更多独立关系与 d-分离(More Independence Relations)(PDF p.274–278)

  • 马尔可夫条件列出的独立关系还会蕴含其它不明显的独立关系(图 17.5 的例子;抽取文本中具体关系式缺失)。找出这些关系的工具是 d-分离(d-separation,directed separation)。
  • 图 17.6:前三个 DAG 无碰撞点(\(X\to Y\to Z\)、\(X\leftarrow Y\leftarrow Z\)、\(X\leftarrow Y\to Z\)),第四个 \(X\to Y\leftarrow Z\) 有碰撞点;图 17.7:\(X\to Y\leftarrow Z\) 且 \(Y\to W\)(带后代的碰撞点)。
  • d-分离三条规则:
    1. \(Y\) 不是碰撞点时,\(X\) 与 \(Z\) d-连通(d-connected),但给定 \(Y\) 时 d-分离;
    2. \(X\) 与 \(Z\) 在 \(Y\) 处碰撞时,\(X\) 与 \(Z\) d-分离,但给定 \(Y\) 时 d-连通;
    3. 以碰撞点的后代为条件与以碰撞点本身为条件效果相同:图 17.7 中 \(X\)、\(Z\) d-分离,但给定 \(W\) 时 d-连通。
  • 形式定义:\(X,Y\) 为不同顶点,\(W\) 为不含 \(X,Y\) 的顶点集。若不存在 \(X\) 与 \(Y\) 之间的无向路径 \(U\) 使得 (i) \(U\) 上每个碰撞点在 \(W\) 中都有后代(含自身),且 (ii) \(U\) 上其它顶点都不在 \(W\) 中,则称 \(X\) 与 \(Y\) 给定 \(W\) d-分离。对非空不交集合 \(A,B\):若对任意 \(X\in A,Y\in B\) 都给定 \(W\) d-分离,则 \(A\)、\(B\) 给定 \(W\) d-分离;否则称 d-连通。(即:存在一条"激活"路径则 d-连通。)
  • 例 17.9(图 17.8:\(X\to U\leftarrow V\to W\leftarrow Y\),\(U\to S_1\),\(W\to S_2\)):\(X\) 与 \(Y\) d-分离(给定空集);给定 \(\{S_1,S_2\}\) 时 d-连通(两个碰撞点的后代被条件化,路径激活);给定 \(\{S_1,S_2,V\}\) 时 d-分离(非碰撞点 \(V\) 被条件化,路径阻断)。
  • 定理 17.10:\(A,B,C\) 为不交顶点集,则 \(A\amalg B\mid C\) 当且仅当 \(A\) 与 \(B\) 被 \(C\) d-分离。(脚注:隐含假设 \(\mathbb P\) 对 \(\mathcal G\) 忠实(faithful),即 \(\mathbb P\) 除马尔可夫条件逻辑蕴含的独立关系外没有额外独立关系。严格说,"d-分离 ⇒ 条件独立"对所有马尔可夫分布成立,反方向需忠实性。)
  • 例 17.11(Jordan 2004 的外星人例子)(图 17.9:aliens → late ← watch):朋友迟到,两种解释:被外星人绑架,或你忘了调夏令时手表。Aliens 与 Watch 被碰撞点阻断,边际独立(合理:在知道迟到之前二者无关)。\(\mathbb P(\text{Aliens}=\text{yes}\mid\text{Late}=\text{yes})>\mathbb P(\text{Aliens}=\text{yes})\);但得知你忘调表后会降低绑架概率,故 \(\mathbb P(\text{Aliens}=\text{yes}|\text{Late}=\text{yes})\neq\mathbb P(\text{Aliens}=\text{yes}|\text{Late}=\text{yes},\text{Watch}=\text{no})\):给定 Late 时二者相依("解释消除 explaining away")。
  • 例 17.12:图 17.2 中 overweight 与 smoking 边际独立,但给定 heart disease 后相依。
  • 马尔可夫等价:\(I(\mathcal G)\) 为 \(\mathcal G\) 蕴含的全部独立陈述。若 \(I(\mathcal G_1)=I(\mathcal G_2)\),称两 DAG 马尔可夫等价(Markov equivalent)。\(\mathrm{skeleton}(\mathcal G)\):把箭头换成无向边得到的无向图。
  • 定理 17.13:\(\mathcal G_1,\mathcal G_2\) 马尔可夫等价当且仅当 (i) 骨架相同;(ii) 非屏蔽碰撞点相同。
  • 例 17.14:图 17.6 前三个 DAG 马尔可夫等价;第四个(碰撞点)与其余不等价。

17.6 DAG 的估计(Estimation for DAGs)(PDF p.279)

  • 两个问题:给定 DAG \(\mathcal G\) 与数据估计 \(f\)(纯估计);仅给数据估计 \(\mathcal G\)(模型选择)。超出本书范围,只述要点。
  • 通常对每个条件密度用参数模型 \(f(x\mid\pi_x;\theta_x)\),似然
    \[\mathcal L(\theta)=\prod_{i=1}^nf(V_i;\theta)=\prod_{i=1}^n\prod_{j=1}^mf(X_{ij}\mid\pi_j;\theta_j),\]
    \(X_{ij}\) 为第 \(i\) 个数据点的 \(X_j\) 值;按 MLE 估计(似然按节点分解,可逐节点分别估计)。
  • 结构估计:可对每个可能的 DAG 用 MLE 拟合,再用 AIC 等选择。但 DAG 数量巨大,需要大量数据才可靠,搜索计算量也极大;为 DAG 结构构造有效且准确的置信集需要天文数字的样本量。若有关于部分结构的先验知识,问题可部分缓解。

17.7 文献评注(PDF p.279)

Edwards (1995)、Jordan (2004);首次用 DAG 表示因果关系的是 Wright (1934)(路径分析);现代处理见 Spirtes et al. (2000)、Pearl (2000);Robins et al. (2003) 讨论从数据估计因果结构的问题。

17.8 附录:再论因果——条件化与干预(PDF p.279–283)

  • DAG 方法与反事实方法数学上等价,形式不同;DAG 方法的额外要素是干预(intervention)。
  • 图 17.10:\(X\to Y\),\(X\to Z\),\(Y\to Z\),\(f(x,y,z)=f(x)f(y|x)f(z|x,y)\)。生成伪代码:for \(i=1..n\):\(x_i\leftarrow p_X(x_i)\);\(y_i\leftarrow p_{Y|X}(y_i|x_i)\);\(z_i\leftarrow p_{Z|X,Y}(z_i|x_i,y_i)\)。
  • "在所有观测到 \(Y=y\) 的时候,\(Z=z\) 的频率"由条件分布给出:
    \[\mathbb P(Z=z|Y=y)=\frac{\sum_xf(x)f(y|x)f(z|x,y)}{f(y)}=\sum_xf(z|x,y)\frac{f(x,y)}{f(y)}=\sum_xf(z|x,y)f(x|y).\]
  • 干预:改代码把 \(Y\) 固定为 \(y\):set \(Y=y\);for \(i\):\(x_i\leftarrow p_X(x_i)\);\(z_i\leftarrow p_{Z|X,Y}(z_i|x_i,y)\)。联合分布变为 \(f^*(x,z)=f(x)f(z|x,y)\),于是
    \[f^*(z)=\sum_xf(x)f(z|x,y)\equiv\mathbb P(Z=z\mid Y:=y)=f(z\mid Y:=y).\]
    区别:\(f(x|y)\) vs \(f(x)\)。
  • \(\mathbb P(Z=z|Y=y)\) 称观察条件化 / 被动条件化(conditioning by observation / passive conditioning),回答预测问题:"已知 Joe 吸烟,他患肺癌的概率?";\(\mathbb P(Z=z|Y:=y)\) 称干预条件化 / 主动条件化(conditioning by intervention / active conditioning),回答因果问题:"如果 Joe 戒烟,他患肺癌的概率?"
  • 一般规则:对 \((\mathcal G,\mathbb P)\) 施行干预"设定 \(X=x\)":(1) 删除所有指向 \(X\) 的箭头,得新图 \(\mathcal G^*\);(2) 从 \(f(v)\) 中去掉因子 \(f(x\mid\pi_X)\),得 \(f^*(v)=\mathbb P(V=v\mid X:=x)\)。\((\mathcal G^*,f^*)\) 表示该干预(截断因子分解 truncated factorization)。
  • 例 17.15(雨与湿草坪):R(Rain)与 W(Wet Lawn)相关,\(p_{R,W}(r,w)\neq p_R(r)p_W(w)\)。两个 DAG:Rain → Wet Lawn(\(f(w,r)=f(r)f(w|r)\))与 Rain ← Wet Lawn(\(f(w,r)=f(w)f(r|w)\))。无论联合分布如何,两图作为概率模型都正确(都表示 R、W 不独立)。但作为因果图只有第一个对:在第一图上干预 \(W:=1\),删除指向 W 的箭头,\(f^*(r)=f(r)\),即 \(\mathbb P(R=r|W:=w)=\mathbb P(R=r)\),"湿草坪不导致下雨"。若错误地以第二图为因果图,W 没有入箭头,干预图不变,\(f^*(r)=f(r|w)\),意味着改变草坪湿度会改变下雨——荒谬。正确因果图靠背景知识确定。
  • 注 17.16:试图从数据学习因果图是危险的:两个变量时不可能;多于两个变量时在某些假设下有方法可找出因果图,但都是大样本方法,且无法知道样本量是否足够大。
  • 用 DAG 表示混杂:\(X\) 处理、\(Y\) 结果,混杂变量 \(Z\) 同时有箭头指向 \(X\) 与 \(Y\)(图 17.11 三种情形):
    • 随机化研究:\(Z\to X\) 的箭头被切断,即使 \(Z\) 未观测(画圈表示),\(\mathbb E(Y|X:=x)=\mathbb E(Y|X=x)\),因果关系可估计;
    • 混杂全部观测的观察性研究:\(\mathbb E(Y|X:=x)=\int\mathbb E(Y|X=x,Z=z)dF_Z(z)\),即(16.7)(后门调整);
    • 存在未观测混杂:上式涉及未观测 \(Z\),无法估计因果效应;此时 \(\mathbb P(Y=y|X=x)\ne\mathbb P(Y=y|X:=x)\)——"因果不是关联"的另一种说法。
  • DAG 与反事实的精确联系(\(X,Y\) 二元):定义混杂变量 \(Z=1,2,3,4\) 分别对应 \((C_0,C_1)=(0,0),(0,1),(1,0),(1,1)\),即可显式建立对应关系(留给读者)。

17.9 习题概括(PDF p.283–286)

  1. 证明(17.1)与(17.2)等价。
  2. 证明定理 17.2。
  3. 给定联合分布(\(Z=0\) 时:\((X,Y)=(0,0)\) .405、\((0,1)\) .045、\((1,0)\) .045、\((1,1)\) .005;\(Z=1\) 时四格均为 .125):(a) 求给定 \(Z=0\)、\(Z=1\) 的 \((X,Y)\) 条件分布;(b) 证明 \(X\amalg Y|Z\);(c) 求 \((X,Y)\) 边际分布;(d) 证明 \(X,Y\) 边际不独立。(条件独立不蕴含边际独立。)
  4. 对图 17.6 三个无碰撞点 DAG 证明 \(X\amalg Z|Y\)。
  5. 对碰撞点 DAG 证明 \(X\amalg Z\) 但给定 \(Y\) 时相依。
  6. \(X,Y\in\{0,1\}\),\(Z\in\{0,1,2\}\),对 \(X\to Y\to Z\) 马尔可夫:构造分布、生成 1000 个样本、MLE 估计并与真值比较;对 12 个参数 \(\theta_{rst}=\mathbb P(X=r,Y=s,Z=t)\) 用 bootstrap 求标准误与 95% CI。
  7. 图 17.12 的 DAG:写出因子分解,证明 \(X\amalg Z_j\)。
  8. \(X\sim\mathrm{Bernoulli}(1/2)\),\(Y|X=x\sim\mathrm{Bernoulli}\big(\frac{e^{4x-2}}{1+e^{4x-2}}\big)\),\(Z|X=x,Y=y\sim\mathrm{Bernoulli}\big(\frac{e^{2(x+y)-2}}{1+e^{2(x+y)-2}}\big)\)。(a) 求 \(\mathbb P(Z=z|Y=y)\),特别是 \(\mathbb P(Z=1|Y=1)\);(b) 模拟并画出经验值随模拟规模 \(N\) 收敛;(c) 求 \(\mathbb P(Z=1|Y:=1)\);(d) 模拟干预"设 \(Y=1\)"验证。
  9. 高斯版本(结构方程模型 structural equation models):\(X\sim N(0,1)\),\(Y|X=x\sim N(\alpha x,1)\),\(Z|X=x,Y=y\sim N(\beta y+\gamma x,1)\)。(a) 求 \(f(z|y)\) 与 \(\mathbb E(Z|Y=y)\);(b) 求 \(f(z|Y:=y)\) 与 \(\mathbb E(Z|Y:=y)\) 并比较;(c) 求 \((Y,Z)\) 联合分布与相关 \(\rho\);(d) 若 \(X\) 未观测(未观测混杂),以"\(\rho\ne0\) 则 Y 导致 Z"判断会出错;(e) 随机化实验(\(Y\sim N(\alpha,1)\) 独立于 \(X\))时 \(\rho=0\) 当且仅当 \(f(z|Y:=y)\) 不依赖 \(y\),该判断法变得正确。

第 17 章 本章要点

  • 条件独立 \(X\amalg Y|Z\) ⇔ \(f(x|y,z)=f(x|z)\);满足对称、分解、弱联合、收缩、(正概率下)交等性质。
  • DAG 上分布的马尔可夫因子分解 \(f(v)=\prod f(x_i|\pi_i)\) ⇔ 每个变量给定父节点独立于非后代。
  • d-分离:链与分叉在中间节点条件化时阻断,碰撞点在条件化(自身或后代)时打开;忠实性下 d-分离 ⇔ 条件独立。
  • 马尔可夫等价 ⇔ 骨架相同且非屏蔽碰撞点相同;因此仅凭数据无法区分等价类内的因果方向。
  • 观察条件化 \(\mathbb P(Z|Y=y)\) 与干预条件化 \(\mathbb P(Z|Y:=y)\) 不同;干预 = 删除入箭头 + 去掉对应因子。
  • 混杂可在 DAG 中表示;随机化切断混杂箭头;观测到全部混杂时可用调整公式。

第 17 章 与量化交易的关联

  • 碰撞点偏差 / 选择偏差:以"碰撞点"为条件会制造虚假相关。例如只研究"仍在指数中的股票"或"已上榜的基金"相当于对结果变量的后代条件化,会使原本独立的因素出现相关——幸存者偏差的图模型解释。
  • 因子模型的条件独立结构:因子模型假设"给定共同因子,个股残差独立",正是条件独立(分叉结构 \(X\leftarrow F\to Y\));残差相关检验即检验该结构。
  • 干预 vs 观察:价格冲击估计、做市商报价策略、政策冲击(如降息)对资产的影响是干预问题;从历史共变直接推断"如果我买入 X 价格会怎样"属于把被动条件化误当主动条件化。
  • 贝叶斯网络/因果发现:用于宏观变量、行业间传导关系建模;注 17.16 提醒:结构学习不可靠,尤其在金融小样本、非平稳环境中。
  • 结构方程:习题 9 的高斯 SEM 与计量经济学中的工具变量、联立方程直接相关。

第 17 章 推荐习题

  • 习题 3:条件独立不推出边际独立(数值例)。
  • 习题 5:碰撞点打开路径的证明。
  • 习题 8、9:观察条件化与干预条件化的计算与模拟,理解未观测混杂如何误导相关性推断。

第 18 章 无向图(Undirected Graphs)(PDF p.287–295)

无向图是有向图之外表示独立关系的另一种方式;两者在实践中都常用,主要区别在于从图中读取独立关系的规则不同。

18.1 无向图(PDF p.287–288)

  • 无向图 \(\mathcal G=(V,E)\):有限顶点(节点)集 \(V\) 与边(弧)集 \(E\)(无序顶点对);顶点对应随机变量。图 18.1:\(V=\{X,Y,Z\}\),\(E=\{(X,Y),(Y,Z)\}\)。
  • 相邻 \(X\sim Y\):有边相连。路径(path) \(X_0,\dots,X_n\):\(X_{i-1}\sim X_i\)。完全图(complete):任意两顶点间都有边。顶点子集 \(U\subset V\) 连同其边称子图(subgraph)。
  • 分离(separates):\(A,B,C\) 为 \(V\) 的不同子集,若从 \(A\) 中任一变量到 \(B\) 中任一变量的每条路径都经过 \(C\) 中某个变量,则称 \(C\) 分离 \(A\) 与 \(B\)。图 18.2(\(W-Y-X-Z\) 型):\(\{X\}\) 分离 \(\{Y,W\}\) 与 \(\{Z\}\);\(\{X,Y\}\) 分离 \(W\) 与 \(Z\)。

18.2 概率与图(Probability and Graphs)(PDF p.288–290)

  • 构造:每个随机变量一个顶点;若一对变量给定其余全部变量时条件独立,则省去它们之间的边:
    \[X\text{ 与 }Y\text{ 之间无边}\iff X\amalg Y\mid\text{rest}.\]
    所得图称成对马尔可夫图(pairwise Markov graph)。例:图 18.3(\(X-Y-Z\))表示 \(X\amalg Z|Y\);图 18.4(三角形完全图)无任何独立关系;图 18.5(四顶点环 \(X-Y-Z-W-X\))表示 \(X\amalg Z|\{Y,W\}\) 与 \(Y\amalg W|\{X,Z\}\);图 18.6(链 \(X-Y-Z-W\))成对性质给出 \(X\amalg Z|\{Y,W\}\),但是否 \(X\amalg Z|Y\)?
  • 定理 18.1(分离定理):\(\mathcal G\) 为 \(\mathbb P\) 的成对马尔可夫图,\(A,B,C\) 为不同子集且 \(C\) 分离 \(A\) 与 \(B\),则 \(A\amalg B\mid C\)。
  • 注 18.2:若 \(A\) 与 \(B\) 之间无路径(不连通),可视为被空集分离,于是 \(A\amalg B\)(边际独立)。
  • 定理 18.1 中的独立性条件称全局马尔可夫性质(global Markov property)。\(M_{\rm pair}(\mathcal G)\):满足成对马尔可夫性质(\(X\amalg Y|\text{rest}\) ⇔ 无边)的分布集;\(M_{\rm global}(\mathcal G)\):满足全局马尔可夫性质(\(A\amalg B|C\) ⇔ \(C\) 分离 \(A,B\))的分布集。
  • 定理 18.3:\(M_{\rm pair}(\mathcal G)=M_{\rm global}(\mathcal G)\)。(严格成立需正概率等条件。)意义:用简单的成对性质建图,再用图分离读出其它独立关系,比代数推导容易得多。回到图 18.6:现在可知 \(X\amalg Z|Y\) 且 \(Y\amalg W|Z\)。
  • 例 18.4(图 18.7:\(X\) 孤立,\(Y-Z\) 相连):\(X\amalg Y\),\(X\amalg Z\),\(X\amalg(Y,Z)\)。
  • 例 18.5(图 18.8):\(X\amalg W|(Y,Z)\),\(X\amalg Z|Y\)。
  • 与 DAG 的区别:无向图中条件化只会阻断路径(无碰撞点概念),读取规则就是普通图分离。

18.3 团与势函数(Cliques and Potentials)(PDF p.291–292)

  • 团(clique):两两相邻的变量集合。极大团(maximal clique):是团且无法再加入变量仍为团。势函数(potential):任意正函数。
  • 在一定条件下(如正概率,Hammersley–Clifford 定理),\(\mathbb P\) 对 \(\mathcal G\) 马尔可夫当且仅当其概率函数可写为
    \[f(x)=\frac{\prod_{C\in\mathcal C}\psi_C(x_C)}{Z},\qquad Z=\sum_x\prod_{C\in\mathcal C}\psi_C(x_C), \tag{18.1}\]
    \(\mathcal C\) 为极大团集合,\(Z\) 为归一化常数。
  • 例 18.6:图 18.1 极大团 \(C_1=\{X,Y\}\),\(C_2=\{Y,Z\}\),故 \(f(x,y,z)\propto\psi_1(x,y)\psi_2(y,z)\)。
  • 例 18.7(图 18.9):极大团 \(\{X_1,X_2\},\{X_1,X_3\},\{X_2,X_4\},\{X_3,X_5\},\{X_2,X_5,X_6\}\),
    \[f(x_1,\dots,x_6)\propto\psi_{12}(x_1,x_2)\psi_{13}(x_1,x_3)\psi_{24}(x_2,x_4)\psi_{35}(x_3,x_5)\psi_{256}(x_2,x_5,x_6).\]

18.4 用数据拟合图(PDF p.292)

大课题,不展开;离散情形可用对数线性模型(第 19 章)拟合图。

18.5 文献评注(PDF p.292)

Whittaker (1990)、Lauritzen (1996);部分习题取自 Whittaker。

18.6 习题概括(PDF p.292–295)

  1. 三个变量:对给定独立关系画图:(a) \(X_1\amalg X_3|X_2\);(b) \(X_1\amalg X_2|X_3\) 且 \(X_1\amalg X_3|X_2\);(c) 三对条件独立同时成立。
  2. 四个变量:(a) \(X_1\amalg X_3|X_2,X_4\),\(X_1\amalg X_4|X_2,X_3\),\(X_2\amalg X_4|X_1,X_3\);(b) \(X_1\amalg X_2|X_3,X_4\),\(X_1\amalg X_3|X_2,X_4\),\(X_2\amalg X_3|X_1,X_4\);(c) \(X_1\amalg X_3|X_2,X_4\),\(X_2\amalg X_4|X_1,X_3\)。
  3. 极小条件独立(minimal conditional independence):无法再用分离定理从条件集中删去任何变量;对图 18.10–18.13 写出所有极小条件独立。
  4. 三个二元变量:构造 \(X_1\amalg X_2|X_3\) vs \(X_1\not\amalg X_2|X_3\) 的似然比检验。
  5. 乳腺癌数据(Morrison et al. 1973):诊断中心 \(X_1\)(Boston/Glamorgan)、核分级 \(X_2\)(malignant/benign)、生存 \(X_3\)(died/survived)。Boston:35, 59, 47, 112;Glamorgan:42, 77, 26, 76(依次为恶性-死亡、恶性-存活、良性-死亡、良性-存活)。(a) 作为多项分布求 MLE;(b) Glamorgan 诊所良性肿瘤者死亡概率估计及其标准误;(c) 用第 4 题的检验检验三对条件独立,画出并解释所得图。

第 18 章 本章要点

  • 无向图:缺边 ⇔ 给定其余全部变量条件独立(成对马尔可夫);图分离 ⇒ 条件独立(全局马尔可夫),二者等价。
  • 不连通分量之间边际独立。
  • 正分布可分解为极大团上势函数之积除以归一化常数。

第 18 章 与量化交易的关联

  • 高斯图模型与精度矩阵:多元正态下"\(X_i\amalg X_j|\text{rest}\)"⇔ 精度矩阵 \(\Sigma^{-1}\) 的 \((i,j)\) 元为 0(本书未明说,但与第 14 章精度矩阵直接相连)。由此可用稀疏精度矩阵(graphical lasso)估计资产间的"偏相关网络",用于识别直接联动、行业聚类、风险传染与配对选择。
  • 组合与风险:稀疏精度矩阵估计也给出更稳定的协方差逆,用于均值–方差优化。
  • 马尔可夫随机场:可用于状态(regime)间依赖结构建模,但实际应用较少。

第 18 章 推荐习题

  • 习题 2、3:练习由独立关系画图及用分离定理读出极小条件独立。
  • 习题 4、5:条件独立的似然比检验与列联表数据实证。

第 19 章 对数线性模型(Log-Linear Models)(PDF p.296–306)

对数线性模型用于多元离散数据建模,与无向图联系紧密。

19.1 对数线性模型(The Log-Linear Model)(PDF p.296–299)

  • \(X=(X_1,\dots,X_m)\) 为离散随机向量,概率函数 \(f(x)=\mathbb P(X=x)=\mathbb P(X_1=x_1,\dots,X_m=x_m)\)。\(X_j\) 取 \(r_j\) 个值,不妨设 \(X_j\in\{0,1,\dots,r_j-1\}\)。\(n\) 个这样的向量可视为 \(N=r_1\times\dots\times r_m\) 类的多项分布样本,用 \(r_1\times\dots\times r_m\) 列联表计数表示,多项参数 \(p=(p_1,\dots,p_N)\)。
  • 记 \(S=\{1,\dots,m\}\),对子集 \(A\subset S\),\(x_A=(x_j:j\in A)\),如 \(A=\{1,3\}\) 时 \(x_A=(x_1,x_3)\)。
  • 定理 19.1(对数线性展开 log-linear expansion):
    \[\log f(x)=\sum_{A\subset S}\psi_A(x), \tag{19.1}\]
    求和遍历 \(S\) 的所有子集,\(\psi\) 满足:(1) \(\psi_\emptyset(x)\) 为常数;(2) 对每个 \(A\),\(\psi_A(x)\) 只依赖 \(x_A\);(3) 若 \(i\in A\) 且 \(x_i=0\),则 \(\psi_A(x)=0\)(以 0 为基准水平的识别约束)。
  • 每个 \(\psi_A\) 依赖未知参数 \(\beta_A\);\(\beta=(\beta_A:A\subset S)\),写 \(f(x)=f(x;\beta)\)。多项参数空间 \(\mathcal P=\{p:p_j\ge0,\sum p_j=1\}\) 是 \(N-1\) 维;对数线性参数空间 \(\Theta=\{\beta=(\beta_1,\dots,\beta_N):\beta=\beta(p),p\in\mathcal P\}\) 是 \(\mathbb R^N\) 中 \(N-1\) 维曲面。两种参数化可相互转换:\(\beta=\beta(p)\),\(p=p(\beta)\)。
  • 例 19.2:\(X\sim\mathrm{Bernoulli}(p)\),\(f(x)=p_1^xp_2^{1-x}\)(\(p_1=p,p_2=1-p\))。\(\log f(x)=\psi_\emptyset(x)+\psi_1(x)\),\(\psi_\emptyset=\log p_2\),\(\psi_1(x)=x\log(p_1/p_2)\)。满足三条件。对数线性参数 \(\beta_0=\log p_2\),\(\beta_1=\log(p_1/p_2)\);参数空间 \(\Theta=\{(\beta_0,\beta_1):e^{\beta_0+\beta_1}+e^{\beta_0}=1\}\)。
  • 例 19.3:\(X_1\in\{0,1\}\),\(X_2\in\{0,1,2\}\),\(n\) 个向量为 6 类多项分布;参数 \(2\times3\) 表 \(p_{ij}\),计数 \(C_{ij}\)。展开 \(\log f(x)=\psi_\emptyset+\psi_1(x)+\psi_2(x)+\psi_{12}(x)\):
    \[\psi_\emptyset=\log p_{00},\quad\psi_1=x_1\log\frac{p_{10}}{p_{00}},\quad\psi_2=I(x_2=1)\log\frac{p_{01}}{p_{00}}+I(x_2=2)\log\frac{p_{02}}{p_{00}},\]
    \[\psi_{12}=I(x_1=1,x_2=1)\log\frac{p_{11}p_{00}}{p_{01}p_{10}}+I(x_1=1,x_2=2)\log\frac{p_{12}p_{00}}{p_{02}p_{10}}.\]
    六个参数:\(\beta_1=\log p_{00}\),\(\beta_2=\log(p_{10}/p_{00})\),\(\beta_3=\log(p_{01}/p_{00})\),\(\beta_4=\log(p_{02}/p_{00})\),\(\beta_5=\log\frac{p_{11}p_{00}}{p_{01}p_{10}}\),\(\beta_6=\log\frac{p_{12}p_{00}}{p_{02}p_{10}}\)。交互项参数就是对数优势比。
  • 定理 19.4:\((X_a,X_b,X_c)\) 为 \((X_1,\dots,X_m)\) 的一个划分。\(X_b\amalg X_c\mid X_a\) 当且仅当对数线性展开中所有同时含 \(b\) 中至少一个坐标和 \(c\) 中至少一个坐标的 \(\psi\) 项都为 0。
  • 引理 19.5:\(X_b\amalg X_c|X_a\) 当且仅当 \(f(x_a,x_b,x_c)=g(x_a,x_b)h(x_a,x_c)\)(由条件独立定义易证)。
  • 定理 19.4 证明:若跨 \(b,c\) 的项都为 0,则每个非零 \(\psi_t\) 满足 \(t\subset a\cup b\) 或 \(t\subset a\cup c\),于是
    \[\log f(x)=\sum_{t\subset a\cup b}\psi_t(x)+\sum_{t\subset a\cup c}\psi_t(x)-\sum_{t\subset a}\psi_t(x),\]
    取指数即为 \(g(x_a,x_b)h(x_a,x_c)\) 形式,由引理 19.5 得条件独立;反向论证逆推即可。

19.2 图对数线性模型(Graphical Log-Linear Models)(PDF p.299–301)

  • 若缺失的项只对应条件独立约束,则对数线性模型是图模型(graphical)。
  • 定义 19.6:\(\log f(x)=\sum_A\psi_A(x)\) 是图模型,若存在图 \(\mathcal G\),使得除"含某对不在边集中的坐标"的项外所有 \(\psi\) 项都非零。即 \(\psi_A(x)=0\) ⇔ 存在 \(\{i,j\}\subset A\) 且 \((i,j)\) 不是边。
  • 判别口诀:若向模型加入一项而图不变,则该模型不是图模型。
  • 例 19.7(图 19.1,5 个变量,边 (1,2),(2,3),(2,5),(3,4),(3,5),(4,5)):对应图模型
    \[\log f=\psi_\emptyset+\psi_1+\psi_2+\psi_3+\psi_4+\psi_5+\psi_{12}+\psi_{23}+\psi_{25}+\psi_{34}+\psi_{35}+\psi_{45}+\psi_{235}+\psi_{345}.\]
    缺边 (1,5),故含 {1,5} 的项(\(\psi_{15},\psi_{125},\psi_{135},\psi_{145},\psi_{1235},\psi_{1245},\psi_{1345},\psi_{12345}\))全部省略;缺边 (2,4),含 {2,4} 的项(\(\psi_{24},\psi_{124},\psi_{234},\psi_{245},\dots\))全部省略;其它缺边同理。若去掉三阶交互 \(\psi_{235},\psi_{345}\),所得模型画出的图相同,但它额外省略了项,因而不是图模型——除条件独立外还有其它约束。这不是坏事,只是若只关心条件独立关系,就无需考虑这类模型。\(\psi_{235}\) 存在表示 \(X_2\) 与 \(X_3\) 的关联强度随 \(X_5\) 变化;不存在则不随之变化。

19.3 层次对数线性模型(Hierarchical Log-Linear Models)(PDF p.301–302)

  • 定义 19.8:若 \(\psi_A=0\) 且 \(A\subset B\) 蕴含 \(\psi_B=0\),则模型是层次的(hierarchical)。(等价:高阶项出现则其所有低阶子项都出现。)
  • 引理 19.9:图模型必是层次模型,反之不然。
  • 例 19.10:\(\log f=\psi_\emptyset+\psi_1+\psi_2+\psi_3+\psi_{12}+\psi_{13}\),图 19.2(\(2-1-3\));含 (2,3) 的项都省略,是图模型,也是层次模型。
  • 例 19.11:\(\log f=\psi_\emptyset+\psi_1+\psi_2+\psi_3+\psi_{12}+\psi_{13}+\psi_{23}\):层次但非图模型;对应图完全(图 19.3),而 \(\psi_{123}=0\) 不对应任何成对条件独立("无三阶交互"模型)。
  • 例 19.12:\(\log f=\psi_\emptyset+\psi_1+\psi_3+\psi_{12}\)(图 19.4):\(\psi_2=0\) 而 \(\psi_{12}\ne0\),非层次,因此也非图模型。

19.4 模型生成元(Model Generators)(PDF p.302–303)

  • 层次模型可用**生成元(generators)**简写。\(X=(X_1,X_2,X_3)\):
    • \(M=1.2+1.3\) 表示 \(\log f=\psi_\emptyset+\psi_1+\psi_2+\psi_3+\psi_{12}+\psi_{13}\)(含 \(\psi_{12},\psi_{13}\),并必须包含低阶项以保持层次性);
    • \(M=1.2.3\) 为饱和模型(saturated model),包含全部项 \(\psi_\emptyset+\psi_1+\psi_2+\psi_3+\psi_{12}+\psi_{13}+\psi_{23}+\psi_{123}\),等价于无约束多项分布;
    • \(M=1+2+3\):\(\psi_\emptyset+\psi_1+\psi_2+\psi_3\),即相互独立模型;
    • \(M=1.2\):\(\psi_\emptyset+\psi_1+\psi_2+\psi_{12}\),此模型使 \(X_3|X_2=x_2,X_1=x_1\) 为均匀分布。

19.5 用数据拟合对数线性模型(PDF p.303–305)

  • 对数似然 \(\ell(\beta)=\sum_{i=1}^n\log f(X_i;\beta)\),\(f\) 由(19.1)给出。MLE 一般需数值求解;Fisher 信息矩阵也数值计算,由其逆得标准误。
  • 模型选择问题:包含哪些 \(\psi\) 项——与线性回归模型选择本质相同。
  • AIC 方法:选择最大化
    \[\mathrm{AIC}(M)=\hat\ell(M)-|M| \tag{19.2}\]
    的模型,\(|M|\) 为参数个数。通常只在层次模型中搜索以缩小空间(也有人认为其它模型不易解释)。
  • 假设检验方法:包含全部 \(\psi\) 项的模型为饱和模型 \(M_{\rm sat}\)。对每个 \(M\) 检验 \(H_0\):真模型为 \(M\) vs \(H_1\):真模型为 \(M_{\rm sat}\),其似然比检验称为偏差(deviance)。
  • 定义 19.13:\(\mathrm{dev}(M)=2(\hat\ell_{\rm sat}-\hat\ell_M)\)。
  • 定理 19.14:偏差就是上述检验的似然比统计量;\(H_0\) 下 \(\mathrm{dev}(M)\rightsquigarrow\chi^2_\nu\),\(\nu\) = 饱和模型与 \(M\) 的参数个数之差。
  • 用偏差检验每个子模型、把未被拒绝的都视为合理模型——不是好策略:(1) 检验次数多,第一类和第二类错误机会多;(2) 会使用"未能拒绝 \(H_0\)"的模型,而未拒绝可能只是功效低,结果因功效低而得到坏模型。
  • 找到"最佳模型"后可画出相应的图。
  • 例 19.15(乳腺癌数据,见第 18 章习题 5):饱和模型估计(\(\hat\beta\) / se / \(W\) / p):截距 3.56/0.17/21.03/0.00;center 0.18/0.22/0.79/0.42;grade 0.29/0.22/1.32/0.18;survival 0.52/0.21/2.44/0.01;center×grade −0.77/0.33/−2.31/0.02;center×survival 0.08/0.28/0.29/0.76;grade×survival 0.34/0.27/1.25/0.20;center×grade×survival 0.12/0.40/0.29/0.76。AIC 后向搜索得最佳子模型:截距 3.52/0.13/25.62/<0.001;center 0.23/0.13/1.70/0.08;grade 0.26/0.18/1.43/0.15;survival 0.56/0.14/3.98/6.65e-05;center×grade −0.67/0.18/−3.62/0.00;grade×survival 0.37/0.19/1.90/0.05。对应图 19.5:Center — Grade — Survival,即 Center \(\amalg\) Survival | Grade(中心与生存在给定分级时条件独立)。拟合检验:偏差 0.6,自由度 \(8-6=2\),p 值 \(\mathbb P(\chi^2_2>0.6)=0.74\),无证据表明模型拟合差。

19.6 文献评注(PDF p.305)

主要依据 Whittaker (1990);经典参考 Bishop et al. (1975)。

19.7 习题概括(PDF p.306)

  1. 例 19.3 中用 \(\beta\) 解出 \(p_{ij}\)。
  2. 证明引理 19.5。
  3. 证明引理 19.9。
  4. 给定四变量对数密度(含若干交互项):(a) 画图;(b) 写出图蕴含的全部(条件)独立关系;(c) 判断是否图模型、层次模型。
  5. \(p(x_1,x_2,x_3)\) 正比于:\(x_1=0\) 行 2, 8, 4, 16;\(x_1=1\) 行 16, 128, 32, 256(列依次为 \((x_2,x_3)=(0,0),(0,1),(1,0),(1,1)\))。求 \(\psi\) 项并评论模型(可发现交互项结构)。
  6. 四个二元变量,对下列模型画独立图并判断图/层次性:(a) \(\log f=7+11x_1+2x_2+1.5x_3+17x_4\);(b) 再加 \(12x_2x_3+78x_2x_4+3x_3x_4+32x_2x_3x_4\);(c) \(7+11x_1+2x_2+1.5x_3+17x_4+12x_2x_3+3x_3x_4+x_1x_4+2x_1x_2\);(d) \(\log f=7+5055x_1x_2x_3x_4\)。

第 19 章 本章要点

  • 任何离散联合分布都可写成对数线性展开 \(\log f=\sum_A\psi_A\);交互项对应(广义)对数优势比。
  • 条件独立 \(X_b\amalg X_c|X_a\) ⇔ 所有跨 \(b,c\) 的交互项为 0。
  • 图模型 ⊂ 层次模型;层次模型可用生成元简写;饱和模型 = 无约束多项。
  • 拟合用数值 MLE;模型选择用 AIC 或偏差(似然比,\(\chi^2\) 自由度为参数差);大量检验找模型有多重检验与低功效问题。

第 19 章 与量化交易的关联

  • 直接关联有限。可用于多维离散状态的依赖分析:如(行业 × 市场状态 × 涨跌方向)三维列联表,检验"给定市场状态,行业与涨跌是否条件独立",或分析信用评级迁移、交易所订单类型、多个技术信号离散化后的联合依赖结构。
  • 偏差统计量与 AIC 的思想与 GLM(Poisson 回归、logistic 回归)一致,可用于事件计数建模(如每日跳跃次数、成交笔数)。
  • "因低功效未拒绝就接受模型"的警告同样适用于回测中"无显著差异就认为策略稳健"的误判。

第 19 章 推荐习题

  • 习题 1:理解两种参数化的互换。
  • 习题 5:从概率表计算 \(\psi\) 项并读出独立结构。
  • 习题 6:图模型/层次模型判别练习。

第 20 章 非参数曲线估计(Nonparametric Curve Estimation)(PDF p.307–330)

本章讨论概率密度函数和回归函数的非参数估计,统称曲线估计(curve estimation)或平滑(smoothing)。第 7 章中 CDF \(F\) 无需任何假设即可相合估计;但密度 \(f\) 或回归函数 \(r(x)=\mathbb E(Y|X=x)\) 不加光滑性假设就无法相合估计,必须对数据做某种平滑。直方图是密度估计的例子:把实轴分成互不相交的箱(bins),估计为分段常数,高度正比于箱内观测数。箱数是**平滑参数(smoothing parameter)**的一个例子:平滑过度(箱太宽)→ 高偏差;平滑不足(箱太窄)→ 高方差。曲线估计的核心就是最优地平衡偏差与方差。

20.1 偏差–方差权衡(The Bias-Variance Tradeoff)(PDF p.308–309)

  • \(g\) 为未知函数(密度或回归函数),\(\hat g_n\) 为估计;\(\hat g_n(x)\) 是在固定点 \(x\) 取值的随机函数——随机性来自数据,\(x\) 不是随机变量(图 20.1)。
  • 损失取积分平方误差(integrated squared error, ISE):
    \[L(g,\hat g_n)=\int(g(u)-\hat g_n(u))^2du. \tag{20.1}\]
    (脚注:也可用其它损失,结论类似但分析复杂得多。)
  • 风险 / 平均积分平方误差(mean integrated squared error, MISE):\(R(g,\hat g_n)=\mathbb E\,L(g,\hat g_n)\)(20.2)。
  • 引理 20.1:
    \[R(g,\hat g_n)=\int b^2(x)dx+\int v(x)dx, \tag{20.3}\]
    其中 \(b(x)=\mathbb E(\hat g_n(x))-g(x)\) 为固定 \(x\) 处的偏差(20.4),\(v(x)=\mathbb V(\hat g_n(x))\) 为方差(20.5)。即
    \[\text{RISK}=\text{BIAS}^2+\text{VARIANCE}. \tag{20.6}\]
  • 过度平滑:偏差大、方差小;平滑不足:相反(图 20.2)。最优平滑量使风险 = 偏差² + 方差最小。

20.2 直方图(Histograms)(PDF p.309–316)

  • \(X_1,\dots,X_n\) IID,密度 \(f\) 支撑在 \([0,1]\)(可重新缩放)。整数 \(m\),箱
    \[B_1=\Big[0,\frac1m\Big),\ B_2=\Big[\frac1m,\frac2m\Big),\dots,B_m=\Big[\frac{m-1}m,1\Big]. \tag{20.7}\]
    箱宽 \(h=1/m\),\(\nu_j\) 为 \(B_j\) 中观测数,\(\hat p_j=\nu_j/n\),\(p_j=\int_{B_j}f(u)du\)。
  • 直方图估计量:
    \[\hat f_n(x)=\begin{cases}\hat p_1/h & x\in B_1\\ \ \vdots\\ \hat p_m/h & x\in B_m\end{cases}\quad\Longleftrightarrow\quad\hat f_n(x)=\sum_{j=1}^m\frac{\hat p_j}{h}I(x\in B_j). \tag{20.8}\]
    动机:\(x\in B_j\) 且 \(h\) 小时,\(\mathbb E\hat f_n(x)=\frac{\mathbb E\hat p_j}{h}=\frac{p_j}{h}=\frac{\int_{B_j}f}{h}\approx\frac{f(x)h}{h}=f(x)\)。
  • 例 20.2(天文数据):\(n=1266\) 个星系距离("铅笔束"巡天,越远即越早)。图 20.3:箱太少(过平滑)、箱太多(欠平滑)、恰当(右上);右下为估计风险随箱数变化。直方图揭示星系团,帮助宇宙学家理解宇宙演化。
  • 定理 20.3:固定 \(x\) 与 \(m\),\(B_j\) 为含 \(x\) 的箱,则
    \[\mathbb E(\hat f_n(x))=\frac{p_j}{h},\qquad\mathbb V(\hat f_n(x))=\frac{p_j(1-p_j)}{nh^2}. \tag{20.9}\]
  • 偏差推导:\(u\in B_j\) 时 \(f(u)\approx f(x)+(u-x)f'(x)\),于是 \(p_j\approx f(x)h+hf'(x)\big(h(j-\tfrac12)-x\big)\),偏差
    \[b(x)=\frac{p_j}{h}-f(x)\approx f'(x)\Big(h\big(j-\tfrac12\big)-x\Big).\]
    若 \(\tilde x_j=(j-\frac12)h\) 为箱中心,则 \(\int_{B_j}b^2(x)dx\approx(f'(\tilde x_j))^2\int_{B_j}(h(j-\frac12)-x)^2dx=(f'(\tilde x_j))^2\frac{h^3}{12}\),故
    \[\int_0^1b^2(x)dx=\sum_j\int_{B_j}b^2\approx\sum_j(f'(\tilde x_j))^2\frac{h^3}{12}=\frac{h^2}{12}\sum_jh(f'(\tilde x_j))^2\approx\frac{h^2}{12}\int_0^1(f'(x))^2dx,\]
    随 \(h\) 增大。方差:\(h\) 小时 \(1-p_j\approx1\),\(v(x)\approx\frac{p_j}{nh^2}\approx\frac{f(x)}{nh}\)(保留主项),\(\int_0^1v(x)dx\approx\frac1{nh}\),随 \(h\) 减小。
  • 定理 20.4:若 \(\int(f'(u))^2du<\infty\),则
    \[R(\hat f_n,f)\approx\frac{h^2}{12}\int(f'(u))^2du+\frac1{nh}. \tag{20.10}\]
    最优箱宽
    \[h^*=\frac1{n^{1/3}}\left(\frac{6}{\int(f'(u))^2du}\right)^{1/3}, \tag{20.11}\]
    此时 \(R(\hat f_n,f)\approx\frac{C}{n^{2/3}}\)(20.12),\(C=(3/4)^{2/3}\left(\int(f'(u))^2du\right)^{1/3}\)。
  • 解读:最优箱宽下 MISE 以 \(n^{-2/3}\) 速率趋于 0,慢于多数参数估计的 \(n^{-1}\)——这是非参数的代价。\(h^*\) 依赖未知 \(f\),只有理论意义。
  • 实用选择:估计风险并最小化。 损失写为 \(h\) 的函数:
    \[L(h)=\int(\hat f_n(x)-f(x))^2dx=\int\hat f_n^2(x)dx-2\int\hat f_n(x)f(x)dx+\int f^2(x)dx.\]
    末项与 \(h\) 无关,等价于最小化 \(J(h)=\int\hat f_n^2(x)dx-2\int\hat f_n(x)f(x)dx\) 的期望(称 \(\mathbb E J(h)\) 为风险,与真风险差常数 \(\int f^2\))。
  • 定义 20.5:交叉验证风险估计
    \[\hat J(h)=\int\big(\hat f_n(x)\big)^2dx-\frac2n\sum_{i=1}^n\hat f_{(-i)}(X_i), \tag{20.13}\]
    \(\hat f_{(-i)}\) 为删除第 \(i\) 个观测后的直方图。\(\hat J(h)\) 称交叉验证得分或估计风险。
  • 定理 20.6:交叉验证估计近似无偏,\(\mathbb E(\hat J(h))\approx\mathbb E(J(h))\)。
  • 定理 20.7(捷径公式):
    \[\hat J(h)=\frac{2}{(n-1)h}-\frac{n+1}{(n-1)h}\sum_{j=1}^m\hat p_j^2. \tag{20.14}\]
    无需对每个 \(h\) 重算 \(n\) 次直方图。
  • 例 20.8:天文数据交叉验证函数在最小值附近很平,\(m\) 取 73 到 310 都近似最优,直方图变化不大;图 20.3 右上用 \(m=73\)。
  • 置信带:无法对真密度的细节作置信陈述,只能在直方图分辨率上陈述。定义"直方图化"的 \(f\):
    \[\bar f_n(x)=\mathbb E(\hat f_n(x))=\frac{p_j}{h},\quad x\in B_j. \tag{20.15}\]
  • 定义 20.9:一对函数 \((\ell_n(x),u_n(x))\) 是 \(1-\alpha\) 置信带(confidence band / envelope),若
    \[\mathbb P\big(\ell_n(x)\le\bar f_n(x)\le u_n(x)\ \text{对所有 }x\big)\ge1-\alpha. \tag{20.16}\]
  • 定理 20.10:设箱数 \(m=m(n)\to\infty\) 且 \(m(n)\log n/n\to0\)。定义
    \[\ell_n(x)=\Big(\max\{\sqrt{\hat f_n(x)}-c,0\}\Big)^2,\quad u_n(x)=\Big(\sqrt{\hat f_n(x)}+c\Big)^2,\quad c=\frac{z_{\alpha/(2m)}}{2}\sqrt{\frac mn}, \tag{20.17–20.18}\]
    则 \((\ell_n,u_n)\) 是近似 \(1-\alpha\) 置信带。 证明梗概:CLT 给出 \(\hat p_j\approx N(p_j,p_j(1-p_j)/n)\);delta 方法得 \(\sqrt{\hat p_j}\approx N(\sqrt{p_j},1/(4n))\)(平方根是方差稳定变换);\(\sqrt{\hat p_j}\) 近似独立,故 \(2\sqrt n(\sqrt{\hat p_j}-\sqrt{p_j})\approx Z_j\)(20.19)。由 \(\sqrt{\hat f_n(x)}-\sqrt{\bar f_n(x)}=\sqrt{\hat p_j/h}-\sqrt{p_j/h}\),
    \[\mathbb P\Big(\max_x|\sqrt{\hat f_n(x)}-\sqrt{\bar f(x)}|>c\Big)=\mathbb P\Big(\max_j2\sqrt n|\sqrt{\hat p_j}-\sqrt{p_j}|>z_{\alpha/(2m)}\Big)\approx\mathbb P(\max_j|Z_j|>z_{\alpha/(2m)})\le\sum_{j=1}^m\frac{\alpha}{m}=\alpha\]
    (Bonferroni)。
  • 例 20.11:天文数据 \(m=73\) 的 95% 置信包络(图 20.4):即使超过 1000 个数据点,不确定性仍相当大。

20.3 核密度估计(Kernel Density Estimation)(PDF p.316–323)

  • 直方图不连续;核密度估计更光滑,且收敛更快。
  • 本章中核(kernel)为满足 \(K(x)\ge0\)、\(\int K=1\)、\(\int xK=0\)、\(\sigma_K^2\equiv\int x^2K(x)dx>0\) 的光滑函数。例:Epanechnikov 核
    \[K(x)=\begin{cases}\frac34\big(1-x^2/5\big)/\sqrt5 & |x|<\sqrt5\\ 0 & \text{其他}\end{cases} \tag{20.20}\]
    和
    高斯核
    \(K(x)=(2\pi)^{-1/2}e^{-x^2/2}\)。
  • 定义 20.12:给定核 \(K\) 与正数 \(h\)(带宽 bandwidth),核密度估计量
    \[\hat f_n(x)=\frac1n\sum_{i=1}^n\frac1hK\left(\frac{x-X_i}{h}\right). \tag{20.21}\]
    直观(图 20.5):在每个数据点上放一块质量 \(1/n\) 的平滑"小丘",\(\hat f(x)\) 是这些核的平均。\(h\to0\) 时变成每个数据点处的尖刺(高度趋于无穷);\(h\to\infty\) 时趋于均匀密度。
  • 例 20.13:天文数据三种带宽的高斯核估计(图 20.6);恰当平滑的估计显示与直方图类似的结构,但更容易看出星系团。
  • 核 \(K\) 的选择不关键(脚注:Epanechnikov 核在渐近 MSE 意义下最优,但关键是带宽),带宽 \(h\) 的选择非常重要。
  • 定理 20.14:在 \(f\) 与 \(K\) 的弱假设下,
    \[R(f,\hat f_n)\approx\frac14\sigma_K^4h^4\int(f''(x))^2dx+\frac{\int K^2(x)dx}{nh}, \tag{20.22}\]
    \(\sigma_K^2=\int x^2K(x)dx\)。最优带宽
    \[h^*=\frac{c_1^{-2/5}c_2^{1/5}c_3^{-1/5}}{n^{1/5}}, \tag{20.23}\]
    \(c_1=\int x^2K\),\(c_2=\int K^2\),\(c_3=\int(f'')^2\)。此时 \(R(f,\hat f_n)\approx c_4/n^{4/5}\)。 证明:记 \(K_h(x,X)=h^{-1}K((x-X)/h)\),\(\hat f_n(x)=n^{-1}\sum_iK_h(x,X_i)\),故 \(\mathbb E\hat f_n(x)=\mathbb E K_h(x,X)\),\(\mathbb V\hat f_n(x)=n^{-1}\mathbb V K_h(x,X)\)。
    \[\mathbb E K_h(x,X)=\int\frac1hK\Big(\frac{x-t}h\Big)f(t)dt=\int K(u)f(x-hu)du=\int K(u)\Big[f(x)-huf'(x)+\frac{h^2u^2}{2}f''(x)+\cdots\Big]du=f(x)+\frac12h^2f''(x)\int u^2K(u)du+\cdots\]
    (用 \(\int K=1,\int uK=0\)),故偏差 \(\approx\frac12\sigma_K^2h^2f''(x)\);类似地 \(\mathbb V\hat f_n(x)\approx\frac{f(x)\int K^2}{nh}\)。对偏差平方与方差积分即得。
  • 核估计以 \(n^{-4/5}\) 收敛,快于直方图的 \(n^{-2/3}\);可证在弱假设下不存在收敛快于 \(n^{-4/5}\) 的非参数估计(对二阶光滑密度)。
  • \(h^*\) 依赖未知 \(f\),实用中用交叉验证:
    \[\hat J(h)=\int\hat f^2(x)dx-\frac2n\sum_{i=1}^n\hat f_{-i}(X_i), \tag{20.24}\]
    \(\hat f_{-i}\) 为删除第 \(i\) 个观测的核估计。
  • 定理 20.15:对任何 \(h>0\),\(\mathbb E[\hat J(h)]=\mathbb E[J(h)]\)(精确无偏)。且
    \[\hat J(h)\approx\frac{1}{hn^2}\sum_i\sum_jK^*\Big(\frac{X_i-X_j}{h}\Big)+\frac{2}{nh}K(0), \tag{20.25}\]
    \(K^*(x)=K^{(2)}(x)-2K(x)\),\(K^{(2)}(z)=\int K(z-y)K(y)dy\)(核的自卷积)。若 \(K\) 为 \(N(0,1)\) 高斯核,则 \(K^{(2)}\) 是 \(N(0,2)\) 密度。选取最小化 \(\hat J(h)\) 的 \(\hat h_n\)(脚注:大数据集可用 FFT 快速计算)。
  • 定理 20.16(Stone 定理):设 \(f\) 有界,\(\hat f_h\) 为带宽 \(h\) 的核估计,\(\hat h_n\) 为交叉验证选出的带宽,则
    \[\frac{\int(f(x)-\hat f_{\hat h_n}(x))^2dx}{\inf_h\int(f(x)-\hat f_h(x))^2dx}\xrightarrow{P}1. \tag{20.26}\]
    即交叉验证带宽渐近达到最优(oracle)损失。
  • 例 20.17:天文数据是四舍五入过的,导致交叉验证最小值在 \(h=0\);解决:给数据加少量正态噪声(jitter),之后 \(\hat J(h)\) 平滑且有明确最小值。
  • 注 20.18:不要因为估计看起来"抖动"就认为交叉验证失败——肉眼不是风险的好裁判。
  • 核密度置信带(针对平滑版本 \(\bar f_n(x)=\mathbb E\hat f_n(x)=\int\frac1hK(\frac{x-u}{h})f(u)du\);脚注:改编自 Chaudhuri & Marron 1999)。密度支撑在 \((a,b)\):
    \[\ell_n(x)=\hat f_n(x)-q\,\widehat{\rm se}(x),\quad u_n(x)=\hat f_n(x)+q\,\widehat{\rm se}(x),\]
    \[\widehat{\rm se}(x)=\frac{s(x)}{\sqrt n},\quad s^2(x)=\frac1{n-1}\sum_{i=1}^n(Y_i(x)-\bar Y_n(x))^2,\quad Y_i(x)=\frac1hK\Big(\frac{x-X_i}{h}\Big),\]
    \[q=\Phi^{-1}\left(\frac{1+(1-\alpha)^{1/m}}{2}\right),\quad m=\frac{b-a}{w}, \tag{20.27}\]
    \(w\) 为核宽度(无限支撑核取有效宽度,正态核取 \(w=3h\))。直观:\(m\) 约为"独立块"的个数,\(q\) 是 \(m\) 个独立正态同时覆盖的临界值(Šidák 校正)。
  • 例 20.19:天文数据 95% 置信带(图 20.7)。
  • 多维核估计:\(X_i=(X_{i1},\dots,X_{id})\),带宽向量 \(h=(h_1,\dots,h_d)\),
    \[\hat f_n(x)=\frac1n\sum_{i=1}^nK_h(x-X_i),\qquad K_h(x-X_i)=\frac{1}{h_1\cdots h_d}\prod_{j=1}^dK\Big(\frac{x_j-X_{ij}}{h_j}\Big) \tag{20.28–20.29}\]
    (乘积核)。简化可取 \(h_j=s_jh\)(\(s_j\) 为第 \(j\) 个变量标准差),只需选一个 \(h\)。风险
    \[R(f,\hat f_n)\approx\frac14\sigma_K^4\Big[\sum_jh_j^4\int f_{jj}^2(x)dx+\sum_{j\ne k}h_j^2h_k^2\int f_{jj}f_{kk}dx\Big]+\frac{(\int K^2)^d}{nh_1\cdots h_d},\]
    \(f_{jj}\) 为二阶偏导。最优带宽 \(h_j\approx c_1n^{-1/(4+d)}\),风险阶 \(n^{-4/(4+d)}\):风险随维数迅速变差,即维数灾难(curse of dimensionality)。
  • Silverman (1986) 表:多元正态密度、最优带宽下,使 0 点处相对均方误差 < 0.1 所需样本量:维数 1:4;2:19;3:67;4:223;5:768;6:2790;7:10,700;8:43,700;9:187,000;10:842,000。即十维问题中 842,000 个观测只相当于一维问题中的 4 个观测。

20.4 非参数回归(Nonparametric Regression)(PDF p.323–328)

  • 数据 \((x_1,Y_1),\dots,(x_n,Y_n)\),\(Y_i=r(x_i)+\epsilon_i\),\(\mathbb E(\epsilon_i)=0\)(20.30)。\(x_i\) 视为固定(回归只关心给定 \(X\) 时 \(Y\) 的均值)。估计 \(r(x)=\mathbb E(Y|X=x)\)。多数非参数回归估计是 \(Y_i\) 的加权平均,靠近 \(x\) 的点权重大。
  • 定义 20.20:Nadaraya–Watson 核估计量
    \[\hat r(x)=\sum_{i=1}^nw_i(x)Y_i,\qquad w_i(x)=\frac{K\big(\frac{x-x_i}{h}\big)}{\sum_{j=1}^nK\big(\frac{x-x_j}{h}\big)}. \tag{20.31–20.32}\]
    来源:先用核密度估计联合密度 \(f(x,y)\),再代入 \(r(x)=\mathbb E(Y|X=x)=\int yf(y|x)dy=\frac{\int yf(x,y)dy}{\int f(x,y)dy}\)。
  • 定理 20.21:设 \(\mathbb V(\epsilon_i)=\sigma^2\),NW 估计的风险
    \[R(\hat r_n,r)\approx\frac{h^4}{4}\Big(\int x^2K(x)dx\Big)^2\int\Big(r''(x)+2r'(x)\frac{f'(x)}{f(x)}\Big)^2dx+\int\frac{\sigma^2\int K^2(x)dx}{nhf(x)}dx, \tag{20.33}\]
    (\(f\) 为 \(x_i\) 的设计密度)。最优带宽以 \(n^{-1/5}\) 递减,风险以 \(n^{-4/5}\) 递减。注意偏差项中 \(2r'f'/f\) 是设计偏差(design bias),这是 NW 估计的缺点(局部线性回归可消除)。
  • 带宽选择:最小化交叉验证得分 \(\hat J(h)=\sum_{i=1}^n(Y_i-\hat r_{-i}(x_i))^2\)(20.34),\(\hat r_{-i}\) 为删去第 \(i\) 个点的估计。
  • 定理 20.22(捷径):
    \[\hat J(h)=\sum_{i=1}^n(Y_i-\hat r(x_i))^2\frac{1}{\Big(1-\frac{K(0)}{\sum_{j=1}^nK\big(\frac{x_i-x_j}{h}\big)}\Big)^2}. \tag{20.35}\]
    (与 13.6 节线性回归 LOOCV 捷径同构:\(K(0)/\sum_jK\) 即第 \(i\) 点的"杠杆值" \(w_i(x_i)\)。)
  • 例 20.23(宇宙微波背景 CMB 数据):BOOMERaNG、Maxima、DASI 数据,\(x_i\) 为多极矩(multipole moment),\(Y_i\) 为温度涨落的估计功率谱,\(Y_i=r(x_i)+\epsilon_i\)。看到的是大爆炸遗留热辐射中的声波,峰的位置与大小提供早期宇宙的线索。图 20.8:欠平滑、过平滑、交叉验证拟合及风险–带宽曲线;交叉验证拟合显示三个明确的峰,与大爆炸物理预测一致。
  • 估计 \(\sigma^2\):\(x_i\) 排好序,\(r\) 光滑时 \(r(x_{i+1})-r(x_i)\approx0\),故 \(Y_{i+1}-Y_i\approx\epsilon_{i+1}-\epsilon_i\),\(\mathbb V(Y_{i+1}-Y_i)\approx2\sigma^2\)。用 \(n-1\) 个差分估计:
    \[\hat\sigma^2=\frac{1}{2(n-1)}\sum_{i=1}^{n-1}(Y_{i+1}-Y_i)^2. \tag{20.36}\]
  • 核回归置信带(针对平滑版本 \(\bar r_n(x)=\mathbb E(\hat r_n(x))\)):近似 \(1-\alpha\) 置信带为 \(\big(\hat r_n(x)-q\,\widehat{\rm se}(x),\ \hat r_n(x)+q\,\widehat{\rm se}(x)\big)\),
    \[\widehat{\rm se}(x)=\hat\sigma\sqrt{\sum_{i=1}^nw_i^2(x)},\quad q=\Phi^{-1}\left(\frac{1+(1-\alpha)^{1/m}}{2}\right),\quad m=\frac{b-a}{w}, \tag{20.37}\]
    \(w\) 为核宽度(正态核取 \(3h\))。
  • 例 20.24:CMB 数据 95% 置信包络(图 20.9):对第一个峰的存在与位置高度确信,对第二、三个峰较不确定(写作时更精确数据正在出现)。
  • 多个回归变量:\(X=(X_1,\dots,X_p)\) 时换成多元核,但同样受维数灾难影响。可对回归函数加约束以减轻:可加回归(additive regression)
    \[Y=\sum_{j=1}^pr_j(X_j)+\epsilon, \tag{20.38}\]
    只需拟合 \(p\) 个一维函数;可加入交互 \(Y=\sum_jr_j(X_j)+\sum_{j<k}r_{jk}(X_jX_k)+\epsilon\)(20.39)。
  • 回拟合算法(backfitting):
    1. 初始化 \(\hat r_1(x_1),\dots,\hat r_p(x_p)\);
    2. 对 \(j=1,\dots,p\):(a) 偏残差 \(\epsilon_i=Y_i-\sum_{s\ne j}\hat r_s(x_i)\);(b) 把 \(\epsilon_i\) 对第 \(j\) 个协变量做(非参数)回归得 \(\hat r_j\);
    3. 收敛则停,否则回到 2。
  • 可加模型避免维数灾难、拟合快;缺点是不完全非参数,真回归函数可能不是可加形式。

20.5 附录:置信集与偏差(PDF p.328–329)

  • 前面的置信带不是针对真实密度/回归函数,而是针对用同一带宽核平滑后的函数。为何难以对真函数给置信集:设 \(\hat f_n(x)\) 均值 \(\bar f_n(x)\)、标准差 \(s_n(x)\),
    \[\frac{\hat f_n(x)-f(x)}{s_n(x)}=\frac{\hat f_n(x)-\bar f_n(x)}{s_n(x)}+\frac{\bar f_n(x)-f(x)}{s_n(x)}.\]
    第一项通常收敛到标准正态,由此导出置信带;第二项是偏差/标准差。参数推断中偏差通常小于标准差,该项 → 0;非参数推断中最优平滑恰恰平衡偏差与标准差,故第二项即使大样本也不消失——置信区间不以真函数为中心。(实务对策:欠平滑或偏差校正。)

20.6 文献评注(PDF p.329)

密度估计:Scott (1992)、Silverman (1986);非参数回归:Härdle (1990)、Loader (1999)(强调局部似然方法)。

20.7 习题概括(PDF p.329–330)

  1. 箱型核(boxcar)\(K(x)=1\)(\(-\frac12<x<\frac12\)):(a) 证明 \(\mathbb E\hat f(x)=\frac1h\int_{x-h/2}^{x+h/2}f(y)dy\),\(\mathbb V\hat f(x)=\frac1{nh^2}\Big[\int_{x-h/2}^{x+h/2}f-\Big(\int_{x-h/2}^{x+h/2}f\Big)^2\Big]\);(b) 证明 \(h\to0\)、\(nh\to\infty\) 时 \(\hat f_n(x)\xrightarrow{P}f(x)\)。
  2. 法医玻璃碎片数据:对折射率用直方图与核估计、交叉验证选平滑量、比较并构造 95% 置信带。
  3. 同数据:折射率对铝含量做非参数回归,交叉验证选带宽并构造置信带。 4–7. 证明引理 20.1、定理 20.3、20.7、20.15。
  4. 回归直方图(regressogram):\(0\le x_i\le1\),按(20.7)分箱,\(x\in B_j\) 时 \(\hat r_n(x)=\bar Y_j\)(箱内 \(Y\) 均值);求近似风险、最优箱宽及风险收敛速率。
  5. 证明光滑性假设下(20.36)的 \(\hat\sigma^2\) 相合。
  6. 证明定理 20.22。

第 20 章 本章要点

  • 曲线估计必须平滑;风险 = 积分偏差² + 积分方差;平滑参数(箱宽、带宽)控制权衡。
  • 直方图:偏差 \(\propto h^2\)、方差 \(\propto 1/(nh)\),\(h^*\sim n^{-1/3}\),MISE \(\sim n^{-2/3}\)。
  • 核密度:偏差 \(\approx\frac12\sigma_K^2h^2f''\)、方差 \(\approx f\int K^2/(nh)\),\(h^*\sim n^{-1/5}\),MISE \(\sim n^{-4/5}\)(最优速率);核形状不重要、带宽重要。
  • 带宽/箱宽用交叉验证选择,有捷径公式;Stone 定理保证渐近最优。
  • 置信带针对平滑后的函数,偏差使其不以真函数为中心。
  • 维数灾难:\(d\) 维风险 \(n^{-4/(4+d)}\);可加模型 + backfitting 是缓解方案。
  • NW 核回归是局部加权平均,\(\sigma^2\) 可用相邻差分估计。

第 20 章 与量化交易的关联

  • 收益分布估计:核密度估计用于描绘收益分布、厚尾与偏度,构造非参数 VaR/ES;带宽选择直接影响尾部估计(尾部数据少,固定带宽会低估尾部,需自适应带宽或极值理论)。
  • 非线性因子–收益关系:用核回归/可加模型刻画因子暴露与未来收益的非线性关系(如动量的非单调性、波动率因子的 U 型),比线性回归更灵活;但维数灾难意味着多因子非参数回归需要可加结构或降维。
  • 期权定价:从期权价格估计风险中性密度(Breeden–Litzenberger)时需要非参数平滑;局部波动率曲面平滑亦属此类。
  • 执行与微观结构:市场冲击函数(冲击 vs 订单规模)常用非参数回归估计其凹形。
  • 偏差–方差与回测:平滑参数的选择对应策略参数(回看窗口、平滑系数)的选择;交叉验证选择必须遵循时间顺序。
  • \(\sigma^2\) 差分估计:思想类似于高频数据中用相邻差分估计噪声方差(已实现方差中的微观结构噪声估计)。

第 20 章 推荐习题

  • 习题 1:箱型核的偏差方差与相合性(基础推导)。
  • 习题 6、7:交叉验证捷径公式证明。
  • 习题 8:regressogram 的风险与最优箱宽(把直方图分析迁移到回归)。
  • 习题 2、3:完整的实证平滑流程(可换成收益率数据)。

第 21 章 用正交函数平滑(Smoothing Using Orthogonal Functions)(PDF p.331–352)

本章介绍基于正交函数的非参数曲线估计:先简述正交函数理论,再讲密度估计与回归,最后介绍小波。

21.1 正交函数与 \(L_2\) 空间(Orthogonal Functions and L2 Spaces)(PDF p.331–335)

  • 向量类比:三维向量 \(v=(v_1,v_2,v_3)\),数乘、加法;内积 \(\langle v,w\rangle=\sum_iv_iw_i\);范数 \(\|v\|=\sqrt{\langle v,v\rangle}=\sqrt{\sum v_i^2}\)(21.1)。\(\langle v,w\rangle=0\) 为正交;\(\|v\|=1\) 为单位(normal)。
  • \(\phi_1=(1,0,0),\phi_2=(0,1,0),\phi_3=(0,0,1)\) 是 \(V\) 的标准正交基(orthonormal basis):(i) 正交,(ii) 单位,(iii) 张成 \(V\):\(v=\sum_{j=1}^3\beta_j\phi_j\),\(\beta_j=\langle\phi_j,v\rangle\)(21.2)。例 \(v=(12,3,4)=12\phi_1+3\phi_2+4\phi_3\)。另一组标准正交基 \(\psi_1=(\frac1{\sqrt3},\frac1{\sqrt3},\frac1{\sqrt3})\),\(\psi_2=(\frac1{\sqrt2},-\frac1{\sqrt2},0)\),\(\psi_3=(\frac1{\sqrt6},\frac1{\sqrt6},-\frac2{\sqrt6})\),此时 \(v=10.97\psi_1+6.36\psi_2+2.86\psi_3\)。
  • 从向量到函数:向量换成函数、求和换成积分。\(L_2(a,b)=\{f:[a,b]\to\mathbb R,\ \int_a^bf(x)^2dx<\infty\}\)(21.3)。内积 \(\int f(x)g(x)dx\),范数 \(\|f\|=\sqrt{\int f^2(x)dx}\)(21.4)。正交:\(\int fg=0\);单位:\(\|f\|=1\)。
  • 函数序列 \(\phi_1,\phi_2,\dots\) 标准正交:\(\int\phi_j^2=1\),\(\int\phi_i\phi_j=0\ (i\ne j)\)。若与每个 \(\phi_j\) 都正交的函数只有零函数,则称完备(complete),此时构成基:对 \(f\in L_2\),
    \[f(x)=\sum_{j=1}^\infty\beta_j\phi_j(x),\qquad\beta_j=\int_a^bf(x)\phi_j(x)dx. \tag{21.5}\]
    (脚注:等号含义为 \(\int(f-f_n)^2\to0\),\(f_n=\sum_{j=1}^n\beta_j\phi_j\)。)
  • Parseval 关系:
    \[\|f\|^2\equiv\int f^2(x)dx=\sum_{j=1}^\infty\beta_j^2\equiv\|\beta\|^2. \tag{21.6}\]
  • 例 21.1 余弦基(cosine basis):\(L_2(0,1)\) 上 \(\phi_0(x)=1\),\(\phi_j(x)=\sqrt2\cos(j\pi x)\),\(j\ge1\)(图 21.1 画前六个)。
  • 例 21.2 Doppler 函数:
    \[f(x)=\sqrt{x(1-x)}\,\sin\left(\frac{2.1\pi}{x+0.05}\right), \tag{21.7}\]
    其余弦展开近似 \(f_J(x)=\sum_{j=1}^J\beta_j\phi_j(x)\),\(J=5,20,200\)(图 21.2):\(J\) 越大越接近 \(f\);系数数值计算。该函数在 \(x\) 小处振荡剧烈。
  • 例 21.3 Legendre 多项式(\([-1,1]\)):
    \[P_j(x)=\frac{1}{2^jj!}\frac{d^j}{dx^j}(x^2-1)^j,\quad j=0,1,2,\dots \tag{21.8}\]
    完备且正交,\(\int_{-1}^1P_j^2(x)dx=\frac{2}{2j+1}\)(21.9),故 \(\phi_j(x)=\sqrt{(2j+1)/2}\,P_j(x)\) 构成 \(L_2(-1,1)\) 的标准正交基。前几个:\(P_0=1\),\(P_1=x\),\(P_2=\frac12(3x^2-1)\),\(P_3=\frac12(5x^3-3x)\)。递推:
    \[P_{j+1}(x)=\frac{(2j+1)xP_j(x)-jP_{j-1}(x)}{j+1}. \tag{21.10}\]
  • 系数与光滑性:若 \(f\) 光滑,则对某 \(k\) 有 \(\int_0^1(f^{(k)}(x))^2dx<\infty\)。对余弦基 \(f=\sum_j\beta_j\phi_j\),
    \[\int_0^1(f^{(k)}(x))^2dx=\sum_{j=1}^\infty\beta_j^2(\pi j)^{2k}.\]
    它有限只能是 \(j\) 大时 \(\beta_j\) 很小。结论:函数越光滑,高阶系数衰减越快。 本章其余部分默认使用余弦基。

21.2 密度估计(Density Estimation)(PDF p.335–339)

  • \(X_1,\dots,X_n\) IID,密度 \(f\) 在 \([0,1]\),\(f\in L_2\):\(f(x)=\sum_{j=0}^\infty\beta_j\phi_j(x)\)(\(\beta_0=\int f\phi_0=1\))。定义
    \[\hat\beta_j=\frac1n\sum_{i=1}^n\phi_j(X_i). \tag{21.11}\]
  • 定理 21.4:\(\mathbb E(\hat\beta_j)=\beta_j\),\(\mathbb V(\hat\beta_j)=\sigma_j^2/n\)(21.12),其中
    \[\sigma_j^2=\mathbb V(\phi_j(X_i))=\int(\phi_j(x)-\beta_j)^2f(x)dx. \tag{21.13}\]
    证明:\(\mathbb E\phi_j(X_1)=\int\phi_jf=\beta_j\);方差类似。
  • 用全部项 \(\sum_{j}\hat\beta_j\phi_j\) 方差极大。改用截断估计
    \[\hat f(x)=\sum_{j=1}^J\hat\beta_j\phi_j(x)\quad(\text{加上常数项 }\phi_0=1), \tag{21.14}\]
    项数 \(J\) 为平滑参数:\(J\) 增大偏差减小、方差增大。技术上限定 \(1\le J\le p\),\(p=p(n)=\sqrt n\)。
  • 定理 21.5:风险
    \[R(J)=\sum_{j=1}^J\frac{\sigma_j^2}{n}+\sum_{j=J+1}^\infty\beta_j^2. \tag{21.15}\]
    (方差项 + 截断偏差项,由 Parseval 得。)风险估计
    \[\hat R(J)=\sum_{j=1}^J\frac{\hat\sigma_j^2}{n}+\sum_{j=J+1}^p\left(\hat\beta_j^2-\frac{\hat\sigma_j^2}{n}\right)_+, \tag{21.16}\]
    \(a_+=\max\{a,0\}\),\(\hat\sigma_j^2=\frac1{n-1}\sum_{i=1}^n(\phi_j(X_i)-\hat\beta_j)^2\)(21.17)。动机:\(\hat\sigma_j^2\) 无偏估计 \(\sigma_j^2\);\(\hat\beta_j^2-\hat\sigma_j^2/n\) 无偏估计 \(\beta_j^2\)(因 \(\mathbb E\hat\beta_j^2=\beta_j^2+\sigma_j^2/n\)),取正部因 \(\beta_j^2\ge0\)。
  • 正交函数密度估计小结:
    1. 计算 \(\hat\beta_j=\frac1n\sum_i\phi_j(X_i)\);
    2. 在 \(1\le J\le p=\sqrt n\) 上选 \(J\) 最小化 \(\hat R(J)\);
    3. \(\hat f(x)=\sum_{j=1}^J\hat\beta_j\phi_j(x)\)(含常数项)。
  • \(\hat f_n\) 可能为负。探索形状时无妨;若需要合法密度,可截断并归一化:\(\hat f^*=\max\{\hat f_n(x),0\}/\int_0^1\max\{\hat f_n(u),0\}du\)。
  • 置信带:用 \(J\) 项时实际估计的是 \(f_J(x)=\sum_{j=1}^J\beta_j\phi_j(x)\),带针对 \(f_J\)。
  • 定理 21.6:近似 \(1-\alpha\) 置信带 \((\ell(x),u(x))\):
    \[\ell(x)=\hat f_n(x)-c,\quad u(x)=\hat f_n(x)+c,\quad c=K^2\sqrt{\frac{J\chi^2_{J,\alpha}}{n}},\quad K=\max_{1\le j\le J}\max_x|\phi_j(x)|. \tag{21.18–21.19}\]
    余弦基 \(K=\sqrt2\)。 证明梗概:令 \(L=\sum_{j=1}^J(\hat\beta_j-\beta_j)^2\)。CLT:\(\hat\beta_j\approx\beta_j+\sigma_j\epsilon_j/\sqrt n\),\(\epsilon_j\sim N(0,1)\),故 \(L\approx\frac1n\sum_j\sigma_j^2\epsilon_j^2\le\frac{K^2}{n}\sum_j\epsilon_j^2=\frac{K^2}{n}\chi^2_J\)(21.20),于是 \(\mathbb P(L>\frac{K^2}{n}\chi^2_{J,\alpha})\le\alpha\)。又由 Cauchy–Schwarz(定理 4.8)
    \[\max_x|\hat f_J(x)-f_J(x)|\le\max_x\sum_j|\phi_j(x)||\hat\beta_j-\beta_j|\le K\sum_j|\hat\beta_j-\beta_j|\le\sqrt JK\sqrt L,\]
    故 \(\mathbb P\big(\max_x|\hat f_J-f_J|>K^2\sqrt{J\chi^2_{J,\alpha}/n}\big)\le\mathbb P(L>K^2\chi^2_{J,\alpha}/n)\le\alpha\)。
  • 例 21.7("爪形/Bart Simpson"密度,Marron & Wand 1992):\(f(x)=\frac12\phi(x;0,1)+\frac1{10}\sum_{j=1}^5\phi(x;\mu_j,0.1)\)(按 Marron–Wand 爪形密度的标准权重;抽取文本中权重系数字符损坏),\((\mu_1,\dots,\mu_5)=(-1,-\frac12,0,\frac12,1)\),\(\phi(x;\mu,\sigma)\) 为正态密度。用 \(y=(x+3)/6\) 缩放到 \([0,1]\)。图 21.3:真密度与基于 \(n=5000\) 的正交函数估计及 95% 置信带。

21.3 回归(Regression)(PDF p.339–344)

  • 模型 \(Y_i=r(x_i)+\epsilon_i\)(21.21),\(\epsilon_i\) 独立、均值 0、方差 \(\sigma^2\)。先考虑等间距设计 \(x_i=i/n\)。\(r\in L_2(0,1)\):\(r(x)=\sum_j\beta_j\phi_j(x)\),\(\beta_j=\int_0^1r(x)\phi_j(x)dx\)(21.22)。
  • 定义
    \[\hat\beta_j=\frac1n\sum_{i=1}^nY_i\phi_j(x_i),\quad j=1,2,\dots \tag{21.23}\]
    它是平均,CLT 下近似正态。
  • 定理 21.8:\(\hat\beta_j\approx N\big(\beta_j,\frac{\sigma^2}{n}\big)\)(21.24)。证明:\(\mathbb E\hat\beta_j=\frac1n\sum_ir(x_i)\phi_j(x_i)\approx\int r\phi_j=\beta_j\)(Riemann 和:\(\sum_i\Delta_nh(x_i)\to\int_0^1h\),\(\Delta_n=1/n\));\(\mathbb V\hat\beta_j=\frac{\sigma^2}{n^2}\sum_i\phi_j^2(x_i)\approx\frac{\sigma^2}{n}\int\phi_j^2=\frac{\sigma^2}{n}\)。
  • 估计 \(\hat r(x)=\sum_{j=1}^J\hat\beta_j\phi_j(x)\),风险 \(R(J)=\mathbb E\int(r(x)-\hat r(x))^2dx\)。
  • 定理 21.9:
    \[R(J)=\frac{J\sigma^2}{n}+\sum_{j=J+1}^\infty\beta_j^2. \tag{21.25}\]
  • 估计 \(\sigma^2\):
    \[\hat\sigma^2=\frac nk\sum_{i=n-k+1}^n\hat\beta_i^2,\quad k=n/4. \tag{21.26}\]
    动机:\(r\) 光滑时 \(j\) 大则 \(\beta_j\approx0\),故 \(j\ge n-k+1\) 时 \(\hat\beta_j\approx N(0,\sigma^2/n)\),即 \(\hat\beta_j\approx\sigma Z_j/\sqrt n\)。于是 \(\hat\sigma^2\approx\frac nk\sum(\sigma Z_j/\sqrt n)^2=\frac{\sigma^2}{k}\chi^2_k\)。\(\mathbb E\chi^2_k=k\) ⇒ \(\mathbb E\hat\sigma^2\approx\sigma^2\);\(\mathbb V\chi^2_k=2k\) ⇒ \(\mathbb V\hat\sigma^2\approx\frac{\sigma^4}{k^2}2k=\frac{2\sigma^4}{k}\to0\),故相合。\(k=n/4\) 无特殊意义,随 \(n\) 适当增长即可。
  • 风险估计:
    \[\hat R(J)=J\frac{\hat\sigma^2}{n}+\sum_{j=J+1}^n\left(\hat\beta_j^2-\frac{\hat\sigma^2}{n}\right)_+. \tag{21.27}\]
  • 例 21.10:Doppler 函数,\(n=2048\),\(x_i=i/n\),\(\epsilon_i\sim N(0,0.1^2)\);估计用 \(J=234\) 项(图 21.4)。
  • 正交级数回归估计量(完整流程):
    1. \(\hat\beta_j=\frac1n\sum_iY_i\phi_j(x_i)\),\(j=1,\dots,n\);
    2. \(\hat\sigma^2=\frac nk\sum_{i=n-k+1}^n\hat\beta_i^2\),\(k\approx n/4\)(21.28);
    3. 对 \(1\le J\le n\) 计算 \(\hat R(J)\);
    4. 选 \(\hat J\) 最小化 \(\hat R(J)\);
    5. \(\hat r(x)=\sum_{j=1}^{\hat J}\hat\beta_j\phi_j(x)\)。
  • 定理 21.11(置信带):估计基于 \(J\) 项,\(\hat\sigma\) 如(21.28),\(J<n-k+1\)。\(r_J(x)=\sum_{j=1}^J\beta_j\phi_j(x)\) 的近似 \(1-\alpha\) 置信带为
    \[\ell(x)=\hat r_n(x)-c(x),\quad u(x)=\hat r_n(x)+c(x),\quad c(x)=\frac{a(x)\hat\sigma\sqrt{\chi^2_{J,\alpha}}}{\sqrt n},\quad a(x)=\sqrt{\sum_{j=1}^J\phi_j^2(x)}. \tag{21.29}\]
    证明:\(L=\sum_{j\le J}(\hat\beta_j-\beta_j)^2\approx\frac{\sigma^2}{n}\chi^2_J\),\(\mathbb P(L>\frac{\sigma^2}{n}\chi^2_{J,\alpha})=\alpha\);Cauchy–Schwarz:\(|\hat r(x)-r_J(x)|\le\sqrt{\sum_j\phi_j^2(x)}\sqrt{\sum_j(\hat\beta_j-\beta_j)^2}=a(x)\sqrt L\)。
  • 例 21.12:Doppler 置信包络(图 21.5),\(J=234\)(最小化估计风险)与 \(J=45\approx\sqrt n\)。\(J\) 大:分辨率高但置信带宽;\(J\) 小:分辨率低但带窄。
  • 设计点推广:\(x_i\) 在 \([a,b]\) 可缩放到 \([0,1]\);不等距但"铺满"区间、不过度聚集时方法仍适用;若把 \(x_i\) 视为随机,方法需大幅修改(不讨论)。

21.4 小波(Wavelets)(PDF p.344–349)

  • 空间非齐性(spatially inhomogeneous):函数在某处有尖峰/跳跃,其余处很光滑(如 Doppler:\(x\) 大处光滑、小处剧烈)。余弦基只保留低阶项会漏掉尖峰,保留高阶项会使其它地方抖动;核回归的大/小带宽同理。解决办法:选用能在局部小区域加"小突起"而不在别处引入抖动的基——小波(wavelets)。
  • Haar 父小波 / 尺度函数(father wavelet / scaling function):
    \[\phi(x)=\begin{cases}1&0\le x<1\\0&\text{其他}\end{cases} \tag{21.30}\]
    Haar 母小波(mother wavelet):
    \[\psi(x)=\begin{cases}-1&0\le x\le\frac12\\ 1&\frac12<x\le1\end{cases} \tag{21.31}\]
    对整数 \(j,k\):
    \[\psi_{j,k}(x)=2^{j/2}\psi(2^jx-k), \tag{21.32}\]
    形状同 \(\psi\),按 \(2^{j/2}\) 缩放幅度、平移 \(k\)(图 21.6:\(\psi\) 与 \(\psi_{2,2}\))。\(j\) 大时 \(\psi_{j,k}\) 高度局部化;增大 \(j\) 犹如提高显微镜分辨率——小波提供 \(L_2(0,1)\) 的多分辨率分析(multiresolution analysis)。
  • \(W_j=\{\psi_{jk},\ k=0,1,\dots,2^j-1\}\) 为分辨率 \(j\) 的小波集合。
  • 定理 21.13:\(\{\phi,W_0,W_1,W_2,\dots\}\) 是 \(L_2(0,1)\) 的标准正交基。于是
    \[f(x)=\alpha\phi(x)+\sum_{j=0}^\infty\sum_{k=0}^{2^j-1}\beta_{j,k}\psi_{j,k}(x),\quad\alpha=\int_0^1f\phi,\ \beta_{j,k}=\int_0^1f\psi_{j,k}. \tag{21.33}\]
    \(\alpha\) 为尺度系数(scaling coefficient),\(\beta_{j,k}\) 为细节系数(detail coefficients)。有限和
    \[f_J(x)=\alpha\phi(x)+\sum_{j=0}^{J-1}\sum_{k=0}^{2^j-1}\beta_{j,k}\psi_{j,k}(x) \tag{21.34}\]
    称分辨率 \(J\) 近似,共 \(1+\sum_{j=0}^{J-1}2^j=2^J\) 项。
  • 例 21.14:Doppler 信号及 \(J=3,5,8\) 的重构(图 21.7)。
  • Haar 小波局部化(区间外为零)但不光滑。1988 年 Ingrid Daubechies 证明存在光滑、局部化且构成标准正交基的小波;它们无闭式表达,只能数值构造。本书继续用 Haar。
  • 小波回归:\(Y_i=r(x_i)+\sigma\epsilon_i\),\(\epsilon_i\sim N(0,1)\),\(x_i=i/n\),设 \(n=2^J\)。与余弦基的主要区别:余弦基用全部 \(1\le j\le J\) 项,以 \(J\) 为平滑参数;小波用阈值化(thresholding)控制平滑——系数大则保留该项,否则丢弃。最简单的是硬阈值、通用阈值(hard, universal thresholding)。令 \(J=\log_2n\),
    \[\hat\alpha=\frac1n\sum_i\phi(x_i)Y_i,\qquad D_{j,k}=\frac1n\sum_i\psi_{j,k}(x_i)Y_i,\quad0\le j\le J-1. \tag{21.35}\]
  • Haar 小波回归步骤:
    1. 按(21.35)计算 \(\hat\alpha\) 和 \(D_{j,k}\)(实际用离散小波变换);
    2. 估计 \(\sigma\)(21.37);
    3. 通用阈值:
      \[\hat\beta_{j,k}=\begin{cases}D_{j,k}&|D_{j,k}|>\hat\sigma\sqrt{\frac{2\log n}{n}}\\0&\text{其他}\end{cases} \tag{21.36}\]
    4. \(\hat r(x)=\hat\alpha\phi(x)+\sum_{j=0}^{J-1}\sum_k\hat\beta_{j,k}\psi_{j,k}(x)\)。
  • 实际中用**离散小波变换(discrete wavelet transform, DWT)**计算,非常快(\(O(n)\))。\(\sigma\) 的估计:
    \[\hat\sigma=\sqrt n\times\frac{\mathrm{median}\big(|D_{J-1,k}|:k=0,\dots,2^{J-1}-1\big)}{0.6745}. \tag{21.37}\]
    与余弦基的估计类似(用最细尺度系数),但用中位数绝对值以对尖峰不敏感(0.6745 是标准正态 \(|Z|\) 的中位数,即 MAD 估计)。
  • 定理 21.15(通用阈值直觉):若无信号(所有 \(\beta_{j,k}=0\)),\(\hat\beta_{j,k}\) 为通用阈值估计,则 \(\mathbb P(\hat\beta_{j,k}=0\ \forall j,k)\to1\)。 证明(设 \(\sigma\) 已知):\(D_{j,k}\approx N(0,\sigma^2/n)\)。Mill 不等式(定理 4.7):\(Z\sim N(0,1)\) 时 \(\mathbb P(|Z|>t)\le\frac ct e^{-t^2/2}\),\(c=\sqrt{2/\pi}\)。令 \(\lambda=\sigma\sqrt{2\log n/n}\),
    \[\mathbb P(\max|D_{j,k}|>\lambda)\le\sum_{j,k}\mathbb P\Big(\frac{\sqrt n|D_{j,k}|}{\sigma}>\frac{\sqrt n\lambda}{\sigma}\Big)\le\sum_{j,k}\frac{c\sigma}{\lambda\sqrt n}\exp\Big\{-\frac{n\lambda^2}{2\sigma^2}\Big\}=n\cdot\frac{c}{\sqrt{2\log n}}\cdot\frac1n=\frac{c}{\sqrt{2\log n}}\to0.\]
    即阈值恰好高到足以以高概率去除所有纯噪声系数。
  • 例 21.16:Doppler,\(\sigma=0.1\),\(n=2048\),通用阈值估计(图 21.8):因 Haar 不光滑,估计呈阶梯状,但相当准确。

21.5 附录:Haar 的 DWT(PDF p.349)

\(y\) 为长度 \(n\) 的 \(Y_i\) 向量,\(J=\log_2n\),建列表 \(D[[0]],\dots,D[[J-1]]\)。令 temp \(\leftarrow y/\sqrt n\)。然后 for \(j\) in \((J-1):0\):\(m\leftarrow2^j\);\(I\leftarrow(1:m)\);\(D[[j]]\leftarrow(\text{temp}[2I]-\text{temp}[2I-1])/\sqrt2\);temp \(\leftarrow(\text{temp}[2I]+\text{temp}[2I-1])/\sqrt2\)。即逐层两两求差(细节)与求和(平滑),复杂度 \(O(n)\)。

21.6 文献评注(PDF p.350)

正交函数方法:Efromovich (1999)、Beran (2000)、Beran & Dümbgen (1998);小波入门 Ogden (1997),进阶 Härdle et al. (1998);小波统计理论主要由 Donoho 与 Johnstone 发展(1994, 1995, 1998;Donoho et al. 1995)。

21.7 习题概括(PDF p.350–352)

1–2. 证明定理 21.5、21.9。 3. 验证给定的三个向量范数为 1 且两两正交。 4. 证明 Parseval 关系。 5. 画前五个 Legendre 多项式并数值验证标准正交。 6. 用余弦基展开:(a) \(\sqrt2\cos(3\pi x)\);(b) \(\sin(\pi x)\)(解析求系数);(c) 阶梯函数 \(\sum_{j=1}^{11}h_jK(x-t_j)\),\(K(t)=(1+\mathrm{sign}(t))/2\),\(t=(.1,.13,.15,.23,.25,.40,.44,.65,.76,.78,.81)\),\(h=(4,-5,3,-4,5,-4.2,2.1,4.3,-3.1,2.1,-4.2)\)("blocks"函数);(d) Doppler(数值求系数 \(\beta_j\approx\frac1N\sum_rf(r/N)\phi_j(r/N)\)),画部分和。 7. 玻璃数据:折射率对铝含量,(a) 余弦基回归(先按 \(x\) 排序,忽略非等距),给出估计、风险估计、置信带;(b) 小波法。 8. 证明 Haar 小波标准正交。 9. Doppler,\(n=1024\),\(\sigma=0.1\):(a) 余弦基拟合并画 \(J=10,20,\dots,100\) 的估计与置信带;(b) Haar 小波拟合。 10. Haar 密度估计(小波直方图):\(\hat\beta_{j,k}=\frac1n\sum_i\psi_{j,k}(X_i)\),(a) 证明无偏;(b) 定义到分辨率 \(B\) 的 Haar 直方图;(c) 求 MSE 关于 \(B\) 的近似表达;(d) 对 Beta(15,4) 的 \(n=1000\) 样本估计并用留一交叉验证选 \(B\)。 11. 解释(21.37):\(X_i\sim N(0,\sigma^2)\),\(\hat\sigma=\sqrt n\times\mathrm{median}(|X_i|)/0.6745\)(原文如此;实质是 MAD 型估计):(a) 证明近似无偏;(b) 模拟比较与通常估计的 MSE;(c) 加入离群值(以 0.95 概率来自 \(N(0,1)\)、0.05 概率来自 \(N(0,10)\);原文误写为 0.95)再比较——中位数法稳健。 12. 用 Haar 基重做第 6 题。

第 21 章 本章要点

  • \(L_2\) 中完备标准正交基可展开任意函数,Parseval 关系连接函数范数与系数平方和;越光滑的函数高阶系数衰减越快。
  • 正交级数估计:系数用样本均值无偏估计;截断项数 \(J\) 为平滑参数;风险 = \(\sum_{j\le J}\)方差 + \(\sum_{j>J}\beta_j^2\),可无偏估计并最小化。
  • 回归中 \(\hat\beta_j\approx N(\beta_j,\sigma^2/n)\),\(\sigma^2\) 用最高阶系数估计;置信带通过 \(\chi^2_J\) 与 Cauchy–Schwarz 得到,针对 \(r_J\) 而非 \(r\)。
  • 小波(Haar)提供多分辨率局部基,适合空间非齐性函数;以阈值化代替截断,通用阈值 \(\hat\sigma\sqrt{2\log n/n}\) 保证纯噪声系数被清零;\(\sigma\) 用最细尺度 MAD 估计;DWT 为 \(O(n)\)。

第 21 章 与量化交易的关联

  • 小波去噪与多尺度分析:小波阈值去噪常用于价格/成交量序列平滑、跳跃检测(局部大系数即跳跃),多尺度分解用于分析不同时间尺度(日内、日、周)的波动与相关结构(小波相关、小波方差)。注意:标准小波平滑是双边的,用于交易信号会引入前视偏差,实盘只能用因果(单边)滤波。
  • MAD 稳健尺度估计:\(\mathrm{median}|x|/0.6745\) 是金融数据中估计波动率、识别异常值(如成交价离群、坏点清洗)的标准工具。
  • 正交基展开:Legendre/Chebyshev 多项式用于期权定价中最小二乘蒙特卡洛(Longstaff–Schwartz)的基函数、收益率曲线与波动率曲面拟合;余弦展开即 COS 期权定价法的核心思想(用余弦级数展开密度)。
  • 通用阈值与多重检验:\(\sqrt{2\log n}\) 阈值与多重比较中的 Bonferroni 思想同源,可借鉴于大量因子筛选时设置更高的 t 值门槛。

第 21 章 推荐习题

  • 习题 4:Parseval 关系(理解系数与 \(L_2\) 误差的关系)。
  • 习题 9:余弦基与 Haar 小波在空间非齐性函数上的对比。
  • 习题 10:小波直方图与交叉验证。
  • 习题 11:MAD 稳健尺度估计的模拟比较。

第 22 章 分类(Classification)(PDF p.353–383)

22.1 引言(PDF p.353–354)

  • 用随机变量 \(X\) 预测离散随机变量 \(Y\) 的问题称为分类(classification),也称监督学习(supervised learning)、判别(discrimination)、模式识别(pattern recognition)。
  • IID 数据 \((X_1,Y_1),\dots,(X_n,Y_n)\),\(X_i=(X_{i1},\dots,X_{id})\in\mathcal X\subset\mathbb R^d\),\(Y_i\) 取值于有限集 \(\mathcal Y\)。分类规则 \(h:\mathcal X\to\mathcal Y\),新观测 \(X\) 预测为 \(h(X)\)。
  • 例 22.1(模拟数据):100 点,\(X=(X_1,X_2)\),\(Y\in\{0,1\}\),线性规则 \(h(x)=1\) 若 \(a+b_1x_1+b_2x_2>0\),否则 0;两组被直线完全分开(真实数据很少如此)。
  • 例 22.2(CORIS 心脏病数据,见例 13.17):用收缩压与烟草两个协变量做 LDA 线性决策边界;两组难以区分,462 人中 141 人被误分。
  • 统计学 / 计算机科学术语对照:classification ↔ supervised learning(由 \(X\) 预测离散 \(Y\));data ↔ training sample(\((X_1,Y_1),\dots\));covariates ↔ features(\(X_i\));classifier ↔ hypothesis(映射 \(h\));estimation ↔ learning(找好的分类器)。

22.2 错误率与 Bayes 分类器(Error Rates and the Bayes Classifier)(PDF p.354–356)

  • 定义 22.3:真实错误率(true error rate) \(L(h)=\mathbb P(\{h(X)\ne Y\})\);经验 / 训练错误率(empirical / training error rate) \(\hat L_n(h)=\frac1n\sum_{i=1}^nI(h(X_i)\ne Y_i)\)。(脚注:也可用其它损失,这里用错误率。)
  • 二分类 \(\mathcal Y=\{0,1\}\):回归函数 \(r(x)=\mathbb E(Y|X=x)=\mathbb P(Y=1|X=x)\)。由 Bayes 定理
    \[r(x)=\frac{f(x|Y=1)\mathbb P(Y=1)}{f(x|Y=1)\mathbb P(Y=1)+f(x|Y=0)\mathbb P(Y=0)}=\frac{\pi f_1(x)}{\pi f_1(x)+(1-\pi)f_0(x)}, \tag{22.1}\]
    \(f_0(x)=f(x|Y=0)\),\(f_1(x)=f(x|Y=1)\),\(\pi=\mathbb P(Y=1)\)(22.2–22.3)。
  • 定义 22.4:Bayes 分类规则 \(h^*(x)=1\) 若 \(r(x)>\frac12\),否则 0(22.4)。集合 \(D(h)=\{x:\mathbb P(Y=1|X=x)=\mathbb P(Y=0|X=x)\}\) 称决策边界(decision boundary)。
  • 警告:Bayes 规则与贝叶斯推断无关,可用频率派或贝叶斯方法估计它。
  • 等价形式:\(h^*(x)=1\) 若 \(\mathbb P(Y=1|X=x)>\mathbb P(Y=0|X=x)\)(22.5);\(h^*(x)=1\) 若 \(\pi f_1(x)>(1-\pi)f_0(x)\)(22.6)。
  • 定理 22.5:Bayes 规则最优:对任意分类规则 \(h\),\(L(h^*)\le L(h)\)。
  • Bayes 规则依赖未知量,需用数据近似。三大方法(简化表述):
    1. 经验风险最小化(empirical risk minimization):选分类器集合 \(\mathcal H\),找使 \(L(h)\) 某估计最小的 \(h\in\mathcal H\);
    2. 回归:估计 \(\hat r\),令 \(\hat h(x)=1\) 若 \(\hat r(x)>1/2\);
    3. 密度估计:用 \(Y_i=0\) 的数据估计 \(\hat f_0\),\(Y_i=1\) 的估计 \(\hat f_1\),\(\hat\pi=\frac1n\sum Y_i\),\(\hat r(x)=\frac{\hat\pi\hat f_1(x)}{\hat\pi\hat f_1(x)+(1-\hat\pi)\hat f_0(x)}\),再取阈值 1/2。
  • 定理 22.6(多类 \(\mathcal Y=\{1,\dots,K\}\)):最优规则
    \[h(x)=\arg\max_k\mathbb P(Y=k|X=x)=\arg\max_k\pi_kf_k(x),\qquad\mathbb P(Y=k|X=x)=\frac{f_k(x)\pi_k}{\sum_rf_r(x)\pi_r}, \tag{22.7–22.9}\]
    \(\pi_r=\mathbb P(Y=r)\),\(f_r(x)=f(x|Y=r)\)。

22.3 高斯与线性分类器(Gaussian and Linear Classifiers)(PDF p.357–360)

  • 密度估计策略 + 参数模型:\(X|Y=k\sim N(\mu_k,\Sigma_k)\),
    \[f_k(x)=\frac{1}{(2\pi)^{d/2}|\Sigma_k|^{1/2}}\exp\Big\{-\frac12(x-\mu_k)^T\Sigma_k^{-1}(x-\mu_k)\Big\},\ k=0,1.\]
  • 定理 22.7:此时 Bayes 规则为
    \[h^*(x)=\begin{cases}1&r_1^2<r_0^2+2\log\big(\frac{\pi_1}{\pi_0}\big)+\log\big(\frac{|\Sigma_0|}{|\Sigma_1|}\big)\\0&\text{其他}\end{cases} \tag{22.10}\]
    其中 \(r_i^2=(x-\mu_i)^T\Sigma_i^{-1}(x-\mu_i)\) 为马氏距离(Mahalanobis distance)(22.11)。等价地 \(h^*(x)=\arg\max_k\delta_k(x)\),
    \[\delta_k(x)=-\frac12\log|\Sigma_k|-\frac12(x-\mu_k)^T\Sigma_k^{-1}(x-\mu_k)+\log\pi_k. \tag{22.12}\]
    决策边界是二次的,故称二次判别分析(quadratic discriminant analysis, QDA)。实际用样本估计代入:\(\hat\pi_0=\frac1n\sum(1-Y_i)\),\(\hat\pi_1=\frac1n\sum Y_i\),\(\hat\mu_k=\frac1{n_k}\sum_{i:Y_i=k}X_i\),\(S_k=\frac1{n_k}\sum_{i:Y_i=k}(X_i-\hat\mu_k)(X_i-\hat\mu_k)^T\)。
  • 若 \(\Sigma_0=\Sigma_1=\Sigma\),Bayes 规则化为 \(h^*(x)=\arg\max_k\delta_k(x)\),
    \[\delta_k(x)=x^T\Sigma^{-1}\mu_k-\frac12\mu_k^T\Sigma^{-1}\mu_k+\log\pi_k. \tag{22.13}\]
    \(\Sigma\) 的 MLE 为合并估计 \(S=\frac{n_0S_0+n_1S_1}{n_0+n_1}\)。规则:\(h^*(x)=1\) 若 \(\hat\delta_1(x)>\hat\delta_0(x)\)(22.14),\(\hat\delta_j(x)=x^TS^{-1}\hat\mu_j-\frac12\hat\mu_j^TS^{-1}\hat\mu_j+\log\hat\pi_j\)(22.15)称判别函数(discriminant function)。决策边界 \(\{x:\delta_0(x)=\delta_1(x)\}\) 线性,故称线性判别分析(linear discriminant analysis, LDA)。
  • 例 22.8(CORIS):两协变量 LDA 混淆矩阵:真实 \(Y=0\):判 0 为 277、判 1 为 25;真实 \(Y=1\):判 0 为 116、判 1 为 44。错误率 \(141/462=0.31\);用全部协变量降至 0.27。QDA:\(Y=0\):272/30;\(Y=1\):113/47;错误率 \(143/462=0.31\);全部协变量 0.26。本例 QDA 相对 LDA 几乎无优势。
  • 定理 22.9(多类高斯):Bayes 规则 \(h(x)=\arg\max_k\delta_k(x)\),\(\delta_k(x)=-\frac12\log|\Sigma_k|-\frac12(x-\mu_k)^T\Sigma_k^{-1}(x-\mu_k)+\log\pi_k\)(22.16);等方差时 \(\delta_k(x)=x^T\Sigma^{-1}\mu_k-\frac12\mu_k^T\Sigma^{-1}\mu_k+\log\pi_k\)(22.17)。代入估计量使用。
  • Fisher 线性判别:先把协变量投影到一条直线 \(U=w^TX=\sum_jw_jX_j\) 降至一维,选择"最能分开两组"的 \(w\),再用一维变量分类。分离度:组均值相距远、相对组内离散小。\(\mathbb E(U|Y=j)=w^T\mu_j\),\(\mathbb V(U)=w^T\Sigma w\),定义
    \[J(w)=\frac{(\mathbb E(U|Y=0)-\mathbb E(U|Y=1))^2}{w^T\Sigma w}=\frac{w^T(\mu_0-\mu_1)(\mu_0-\mu_1)^Tw}{w^T\Sigma w}\]
    (物理中称 Rayleigh 系数)。估计:\(n_j\) 组样本数、\(\bar X_j\) 组均值、\(S_j\) 组样本协方差,
    \[\hat J(w)=\frac{w^TS_Bw}{w^TS_Ww},\quad S_B=(\bar X_0-\bar X_1)(\bar X_0-\bar X_1)^T,\quad S_W=\frac{(n_0-1)S_0+(n_1-1)S_1}{(n_0-1)+(n_1-1)}. \tag{22.18}\]
  • 定理 22.10:\(w=S_W^{-1}(\bar X_0-\bar X_1)\) 是 \(\hat J(w)\) 的最优解(22.19)。\(U=w^TX=(\bar X_0-\bar X_1)^TS_W^{-1}X\)(22.20)称 Fisher 线性判别函数。中点 \(m=\frac12(\bar X_0-\bar X_1)^TS_W^{-1}(\bar X_0+\bar X_1)\)。Fisher 规则:\(h(x)=0\) 若 \(w^Tx\ge m\),\(=1\) 若 \(w^Tx<m\)(22.21)。当 \(\hat\pi=1/2\) 时 Fisher 规则与 Bayes 线性分类器(22.14)相同。

22.4 线性回归与 Logistic 回归(PDF p.360–362)

  • 直接估计 \(r(x)=\mathbb E(Y|X=x)=\mathbb P(Y=1|X=x)\)(\(\mathcal Y=\{0,1\}\)),规则 \(\hat h(x)=1\) 若 \(\hat r(x)>\frac12\)(22.22)。
  • 线性回归:\(Y=r(x)+\epsilon=\beta_0+\sum_{j=1}^d\beta_jX_j+\epsilon\)(22.23)。模型不可能正确(不强制 \(Y\in\{0,1\}\)),但有时是不错的分类器。\(\hat\beta=(X^TX)^{-1}X^TY\)(\(X\) 为 \(n\times(d+1)\) 设计矩阵,首列全 1),预测 \(\hat Y=X\hat\beta\)。
  • Logistic 回归:\(r(x)=\mathbb P(Y=1|X=x)=\frac{e^{\beta_0+\sum_j\beta_jx_j}}{1+e^{\beta_0+\sum_j\beta_jx_j}}\)(22.24),MLE 数值求解。
  • 例 22.11:CORIS 数据 logistic 分类错误率 0.27;线性回归 0.26。
  • 更丰富的模型:\(\mathrm{logit}\,\mathbb P(Y=1|X=x)=\beta_0+\sum_j\beta_jx_j+\sum_{j,k}\beta_{jk}x_jx_k\)(22.25),更一般地加至 \(r\) 阶项;\(r\) 大拟合更好但有偏差–方差权衡。例 22.12:\(r=2\) 时错误率降至 0.22。

22.5 Logistic 回归与 LDA 的关系(PDF p.362–363)

  • 等协方差高斯假设下:
    \[\log\frac{\mathbb P(Y=1|X=x)}{\mathbb P(Y=0|X=x)}=\log\frac{\pi_1}{\pi_0}-\frac12(\mu_0+\mu_1)^T\Sigma^{-1}(\mu_1-\mu_0)+x^T\Sigma^{-1}(\mu_1-\mu_0)\equiv\alpha_0+\alpha^Tx.\]
    logistic 模型假设 \(\log\frac{\mathbb P(Y=1|x)}{\mathbb P(Y=0|x)}=\beta_0+\beta^Tx\)。两者都给出线性分类规则,模型形式相同,区别在于参数估计方式。
  • 单个观测的联合密度 \(f(x,y)=f(x|y)f(y)=f(y|x)f(x)\)。LDA 最大化完整联合似然
    \[\prod_if(X_i,Y_i)=\underbrace{\prod_if(X_i|Y_i)}_{\text{Gaussian}}\underbrace{\prod_if(Y_i)}_{\text{Bernoulli}}; \tag{22.26}\]
    logistic 只最大化条件似然,忽略 \(f(X_i)\):
    \[\prod_if(X_i,Y_i)=\underbrace{\prod_if(Y_i|X_i)}_{\text{logistic}}\underbrace{\prod_if(X_i)}_{\text{ignored}}. \tag{22.27}\]
  • 分类只需 \(f(y|x)\),不必估计整个联合分布。logistic 不对边际 \(f(x)\) 作假设,比 LDA 更"非参数",这是其优点。(LDA 若高斯假设成立则更有效。)

22.6 密度估计与朴素 Bayes(Density Estimation and Naive Bayes)(PDF p.363–364)

  • Bayes 规则 \(h(x)=\arg\max_k\pi_kf_k(x)\)。\(\pi_k\) 易估计;\(f_k\) 可假设高斯,或用核密度等非参数估计——但 \(x\) 高维时非参数密度估计不可靠(维数灾难)。若假设 \(X_1,\dots,X_d\) 在每个类内独立:\(f_k(x_1,\dots,x_d)=\prod_{j=1}^df_{kj}(x_j)\),问题化为每组 \(d\) 个一维密度估计,得朴素 Bayes 分类器(naive Bayes classifier)。独立性假设通常错误,但分类器仍可能准确。
  • 朴素 Bayes 步骤:
    1. 对每组 \(k\),用 \(Y_i=k\) 的数据估计 \(X_j\) 的一维密度 \(\hat f_{kj}\);
    2. \(\hat f_k(x)=\prod_{j=1}^d\hat f_{kj}(x_j)\);
    3. \(\hat\pi_k=\frac1n\sum_iI(Y_i=k)\);
    4. \(h(x)=\arg\max_k\hat\pi_k\hat f_k(x)\)。
  • \(x\) 高维且离散时最流行(\(\hat f_{kj}\) 就是频率)。

22.7 树(Trees)(PDF p.364–366)

  • 树把协变量空间划分为不相交块,按所在块分类,可表示为树形。例(图 22.2、22.3):\(X_1\)=年龄,\(X_2\)=血压。若 Age ≥ 50 判 \(Y=1\);若 Age < 50 看血压:收缩压 < 100 判 1,否则判 0。
  • 构造:先设 \(\mathcal Y=\{0,1\}\)、单协变量 \(X\)。选分割点 \(t\),\(A_1=(-\infty,t]\),\(A_2=(t,\infty)\),
    \[\hat p_s(j)=\frac{\sum_iI(Y_i=j,X_i\in A_s)}{\sum_iI(X_i\in A_s)},\quad s=1,2;\ j=0,1. \tag{22.28}\]
    分割 \(t\) 的不纯度(impurity) \(I(t)=\sum_{s=1}^2\gamma_s\)(22.29),\(\gamma_s=1-\sum_{j=0}^1\hat p_s(j)^2\)(22.30)——Gini 指数。若 \(A_s\) 全为 0 或全为 1,\(\gamma_s=0\),否则 \(>0\)。选 \(t\) 最小化不纯度(也可用其它不纯度指标)。
  • 多协变量时,选使不纯度最低的协变量及分割点;递归进行直到满足停止准则(如每块少于 \(n_0\) 个点)。底层节点为叶(leaves),按块内多数类标 0 或 1。多类推广:\(\gamma_s=1-\sum_{j=1}^K\hat p_s(j)^2\)(22.31)。
  • 例 22.13:CORIS 分类树误分率 0.21;只用 tobacco 和 age 的树误分率 0.29(图 22.4:先按 age 31.5、再按 tobacco 0.51、age 50.5、tobacco 7.47 分割)。
  • 描述不完整:一直分到每叶很少样本会过拟合,应选树的复杂度使估计的真实错误率低(下节)。

22.8 错误率评估与分类器选择(PDF p.366–372)

  • 训练错误率 \(\hat L_n(h)\) 向下有偏,不能直接估计 \(L(h)\)。
  • 例 22.14:CORIS 上依次拟合含 1、2、…、9 个协变量的 logistic 模型,再逐个加入平方项,共 18 个复杂度递增的分类器。观测错误率(图 22.5 实线)单调下降(继续加可达零);10 折交叉验证估计(虚线)先降后升——即第 20 章的偏差–方差权衡。
  • 交叉验证:最简单版本随机分为训练集 \(\mathcal T\) 与验证集 \(\mathcal V\)(常留约 10%);用 \(\mathcal T\) 构造 \(\hat h\),估计
    \[\hat L(\hat h)=\frac1m\sum_{X_i\in\mathcal V}I(\hat h(X_i)\ne Y_i), \tag{22.32}\]
    \(m\) 为验证集大小(图 22.6)。
  • K 折交叉验证:1. 随机分成大小近似相等的 \(K\) 块(常取 \(K=10\));2. 对 \(k=1..K\):(a) 删去第 \(k\) 块;(b) 用其余数据算 \(\hat h_{(k)}\);(c) 预测第 \(k\) 块,得观测错误率 \(\hat L_{(k)}\);3. \(\hat L(h)=\frac1K\sum_{k=1}^K\hat L_{(k)}\)(22.33)。
  • 例 22.15:CORIS 树的 10 折 CV 误差在 6 个叶时最小(图 22.7):age < 31.5 → 0;31.5 ≤ age < 50.5:typeA < 68.5 → 0,≥ 68.5 → 1;age ≥ 50.5:家族史 yes → 1;no 时 tobacco < 7.605 → 0,≥ 7.605 → 1。
  • 概率不等式方法:给出 \(L(\hat h)\) 的置信区间,适用于经验风险最小化。\(\mathcal H\) 为分类器集合(如全部线性分类器),ERM:
    \[\hat h=\arg\min_{h\in\mathcal H}\hat L_n(h)=\arg\min_{h\in\mathcal H}\Big(\frac1n\sum_iI(h(X_i)\ne Y_i)\Big). \tag{22.34}\]
    \(\hat L_n(\hat h)\) 因选择而低估 \(L(\hat h)\)。工具:Hoeffding 不等式(定理 4.5):\(X_i\sim\) Bernoulli\((p)\) 时
    \[\mathbb P(|\hat p-p|>\epsilon)\le2e^{-2n\epsilon^2},\quad\hat p=\frac1n\sum X_i. \tag{22.35}\]
  • 定理 22.16(一致收敛 Uniform Convergence):\(\mathcal H\) 有限,含 \(m\) 个元素,则
    \[\mathbb P\Big(\max_{h\in\mathcal H}|\hat L_n(h)-L(h)|>\epsilon\Big)\le2me^{-2n\epsilon^2}.\]
    证明:并集界 \(\mathbb P(\cup A_i)\le\sum\mathbb P(A_i)\) 加 Hoeffding。
  • 定理 22.17:令 \(\epsilon=\sqrt{\frac{1}{2n}\log\frac{2m}{\alpha}}\),则 \(\hat L_n(\hat h)\pm\epsilon\) 是 \(L(\hat h)\) 的 \(1-\alpha\) 置信区间(因 \(\mathbb P(|\hat L_n(\hat h)-L(\hat h)|>\epsilon)\le\mathbb P(\max_h|\hat L_n(h)-L(h)|>\epsilon)\le\alpha\))。\(\mathcal H\) 越大区间越宽——函数越多越可能"过拟合",以更宽区间补偿。
  • VC 理论(\(\mathcal H\) 无限时):\(\mathcal A\) 为集合类。对有限集 \(F=\{x_1,\dots,x_n\}\),
    \[N_{\mathcal A}(F)=\#\{F\cap A:A\in\mathcal A\} \tag{22.36}\]
    为 \(\mathcal A\) "挑出"的 \(F\) 的子集数。粉碎系数(shatter coefficient) \(s(\mathcal A,n)=\max_{F\in\mathcal F_n}N_{\mathcal A}(F)\)(22.37),\(\mathcal F_n\) 为所有大小 \(n\) 的有限集。经验概率测度 \(\mathbb P_n(A)=\frac1n\sum_iI(X_i\in A)\)。
  • 定理 22.18(Vapnik & Chervonenkis 1971):对任意 \(\mathbb P\)、\(n\)、\(\epsilon>0\),
    \[\mathbb P\Big\{\sup_{A\in\mathcal A}|\mathbb P_n(A)-\mathbb P(A)|>\epsilon\Big\}\le8s(\mathcal A,n)e^{-n\epsilon^2/32}. \tag{22.38}\]
    (证明优雅但长,略。)对分类器集合 \(\mathcal H\),令 \(\mathcal A=\{\{x:h(x)=1\}:h\in\mathcal H\}\),\(s(\mathcal H,n)=s(\mathcal A,n)\)。
  • 定理 22.19:\(\mathbb P\{\sup_{h\in\mathcal H}|\hat L_n(h)-L(h)|>\epsilon\}\le8s(\mathcal H,n)e^{-n\epsilon^2/32}\)。\(L(\hat h)\) 的 \(1-\alpha\) 置信区间为 \(\hat L_n(\hat h)\pm\epsilon_n\),\(\epsilon_n^2=\frac{32}{n}\log\Big(\frac{8s(\mathcal H,n)}{\alpha}\Big)\)。只有粉碎系数增长不太快时才有用。
  • 定义 22.20(VC 维):若对所有 \(n\) 有 \(s(\mathcal A,n)=2^n\),则 \(VC(\mathcal A)=\infty\);否则 \(VC(\mathcal A)\) 为使 \(s(\mathcal A,k)=2^k\) 的最大 \(k\)。即 \(\mathcal A\) 能粉碎(shatter)(挑出所有子集)的最大有限集大小。\(VC(\mathcal H)=VC(\mathcal A)\)。
  • 定理 22.21:若 \(\mathcal A\) 的 VC 维 \(v\) 有限,则 \(s(\mathcal A,n)\le n^v+1\)(多项式增长)。
  • 例 22.22:\(\mathcal A=\{(-\infty,a]\}\) 能粉碎任意单点集但不能粉碎 \(\{x,y\}\)(无法只挑出较大者),\(VC=1\)。
  • 例 22.23:实轴闭区间能粉碎两点集,不能粉碎三点 \(x<y<z\)(无法挑出 \(\{x,z\}\)),\(VC=2\)。
  • 例 22.24:平面线性半空间能粉碎任意不共线三点,不能粉碎任何四点(如菱形,左右两点无法单独挑出),\(VC=3\);一般地 \(\mathbb R^d\) 中半空间 VC 维为 \(d+1\)。
  • 例 22.25:平面上边平行于坐标轴的矩形能粉碎某 4 点集;任意 5 点中总有一点不是最左、最右、最上、最下,去掉它的其余 4 点无法被挑出,\(VC=4\)。
  • 定理 22.26:\(x\) 为 \(d\) 维,\(\mathcal H\) 为线性分类器,VC 维为 \(d+1\),故真实错误率 \(1-\alpha\) 置信区间为 \(\hat L(\hat h)\pm\epsilon_n\),\(\epsilon_n^2=\frac{32}{n}\log\Big(\frac{8(n^{d+1}+1)}{\alpha}\Big)\)。

22.9 支持向量机(Support Vector Machines)(PDF p.372–375)

  • 二分类,标签记为 \(-1,+1\)。线性分类器 \(h(x)=\mathrm{sign}(H(x))\),\(H(x)=a_0+\sum_{i=1}^da_ix_i\),\(\mathrm{sign}(z)=-1,0,1\)(\(z<0,=0,>0\))。
  • 先设数据线性可分(linearly separable)。引理 22.27:数据可被超平面分开当且仅当存在 \(H(x)=a_0+\sum a_ix_i\) 使
    \[Y_iH(X_i)\ge1,\quad i=1,\dots,n. \tag{22.39}\]
    证明:若 \(W(x)=b_0+\sum b_ix_i\) 分开数据,则存在 \(c>0\) 使 \(Y_i=1\Rightarrow W(X_i)\ge c\),\(Y_i=-1\Rightarrow W(X_i)\le-c\),即 \(Y_iW(X_i)\ge c\);令 \(a_j=b_j/c\) 即可。反向显然。
  • 可分时分离超平面有很多,直观上选离数据"最远"者:最大间隔超平面(maximum margin hyperplane);间隔(margin)为超平面到最近点的距离;间隔边界上的点称支持向量(support vectors)(图 22.8)。
  • 定理 22.28:分离数据且间隔最大的超平面由在约束(22.39)下最小化 \(\frac12\sum_{i=1}^da_i^2\) 得到(间隔 \(=1/\|a\|\))。
  • 可改写为二次规划。记 \(\langle X_i,X_k\rangle=X_i^TX_k\)。定理 22.29:最优超平面满足 \(\hat a_j=\sum_{i=1}^n\hat\alpha_iY_iX_j(i)\)(\(X_j(i)\) 为第 \(i\) 个点的第 \(j\) 个协变量),\(\hat\alpha\) 最大化
    \[\sum_{i=1}^n\alpha_i-\frac12\sum_{i=1}^n\sum_{k=1}^n\alpha_i\alpha_kY_iY_k\langle X_i,X_k\rangle \tag{22.40}\]
    约束 \(\alpha_i\ge0\)、\(0=\sum_i\alpha_iY_i\)。\(\alpha_i\ne0\) 的点为支持向量。\(\hat a_0\) 由任一支持点满足 \(Y_i(X_i^T\hat a+\hat a_0)=1\) 解出。\(\hat H(x)=\hat a_0+\sum_i\hat\alpha_iY_i\langle x,X_i\rangle\)。
  • 不可分时允许重叠:约束改为 \(Y_iH(X_i)\ge1-\xi_i\),\(\xi_i\ge0\)(22.41),\(\xi_i\) 为松弛变量(slack variables)。此时最大化(22.40)约束 \(0\le\alpha_i\le c\)、\(\sum\alpha_iY_i=0\);常数 \(c\) 为控制重叠量的调节参数。

22.10 核化(Kernelization)(PDF p.375–379)

  • 思想:把协变量 \(X\in\mathcal X\) 映射到更高维空间 \(\mathcal Z\),在 \(\mathcal Z\) 中用简单分类器,得到更灵活的分类器并保持计算简单。
  • 标准例(图 22.9):\(x=(x_1,x_2)\),两组可用椭圆分开。映射 \(\phi(x)=(z_1,z_2,z_3)=(x_1^2,\sqrt2x_1x_2,x_2^2)\),\(\mathbb R^2\to\mathbb R^3\),在 \(\mathcal Z\) 中线性可分。高维空间中的线性分类器对应原空间的非线性分类器——类似用多项式扩充线性回归。
  • 潜在问题:维数膨胀带来计算负担,如 \(d=256\) 用全部四阶项,\(z\) 维数为 183,181,376。两点使我们免于此:(1) 许多分类器只需点对的内积;(2) \(\langle z,\tilde z\rangle=\langle\phi(x),\phi(\tilde x)\rangle=x_1^2\tilde x_1^2+2x_1\tilde x_1x_2\tilde x_2+x_2^2\tilde x_2^2=(\langle x,\tilde x\rangle)^2\equiv K(x,\tilde x)\),无需计算 \(\phi\)。
  • 核化要点:找映射 \(\phi:\mathcal X\to\mathcal Z\) 和分类器使:1. \(\mathcal Z\) 维数更高、分类器更丰富;2. 分类器只需内积;3. 存在核函数 \(K\) 使 \(\langle\phi(x),\phi(\tilde x)\rangle=K(x,\tilde x)\);4. 算法中所有 \(\langle x,\tilde x\rangle\) 换成 \(K(x,\tilde x)\)。
  • 实际上无需构造 \(\phi\),只需指定一个对应某 \(\phi\) 的核。何时存在?Mercer 定理:粗略地,若 \(K\) 正定,即对平方可积 \(f\) 有 \(\iint K(x,y)f(x)f(y)dxdy\ge0\),则存在 \(\phi\)。常用核:多项式 \(K(x,\tilde x)=(\langle x,\tilde x\rangle+a)^r\);sigmoid \(K=\tanh(a\langle x,\tilde x\rangle+b)\);高斯 \(K=\exp(-\|x-\tilde x\|^2/(2\sigma^2))\)。
  • 核化 Fisher LDA:原问题最大化 Rayleigh 系数 \(J(w)=\frac{w^TS_Bw}{w^TS_Ww}\)。核化:\(X_i\) 换成 \(Z_i=\phi(X_i)\),在 \(Z\) 空间最大化(22.42),\(S_B=(\bar Z_0-\bar Z_1)(\bar Z_0-\bar Z_1)^T\),\(S_W\) 为 \(Z\) 的合并组内协方差。可证最优 \(w\) 是 \(Z_i\) 的线性组合 \(w=\sum_i\alpha_iZ_i\)。又 \(\bar Z_j=\frac1{n_j}\sum_i\phi(X_i)I(Y_i=j)\),于是
    \[w^T\bar Z_j=\frac1{n_j}\sum_i\alpha_i\sum_sI(Y_s=j)K(X_i,X_s)=\alpha^TM_j,\quad(M_j)_i=\frac1{n_j}\sum_{s=1}^nK(X_i,X_s)I(Y_s=j).\]
    故 \(w^TS_Bw=\alpha^TM\alpha\),\(M=(M_0-M_1)(M_0-M_1)^T\);类似地 \(w^TS_Ww=\alpha^TN\alpha\),
    \[N=K_0\Big(I-\frac1{n_0}\mathbf 1\Big)K_0^T+K_1\Big(I-\frac1{n_1}\mathbf 1\Big)K_1^T,\]
    \(I\) 单位阵,\(\mathbf 1\) 全 1 矩阵,\(K_j\) 为 \(n\times n_j\) 矩阵 \((K_j)_{rs}=K(x_r,x_s)\)(\(x_s\) 取遍组 \(j\) 的观测)。求 \(\alpha\) 最大化 \(J(\alpha)=\frac{\alpha^TM\alpha}{\alpha^TN\alpha}\),形式解 \(\hat\alpha=N^{-1}(M_0-M_1)\);\(N\) 可能不可逆,此时用 \(N+bI\) 代替。投影 \(u=w^T\phi(x)=\sum_i\hat\alpha_iK(X_i,x)\)。
  • 核化 SVM:把 \(\langle X_i,X_j\rangle\) 换成 \(K(X_i,X_j)\),即最大化
    \[\sum_{i=1}^n\alpha_i-\frac12\sum_{i=1}^n\sum_{k=1}^n\alpha_i\alpha_kY_iY_kK(X_i,X_k), \tag{22.43}\]
    超平面 \(\hat H(x)=\hat a_0+\sum_i\hat\alpha_iY_iK(x,X_i)\)。

22.11 其它分类器(Other Classifiers)(PDF p.379–380)

  • \(k\) 近邻(k-nearest-neighbors):找离 \(x\) 最近的 \(k\) 个数据点,多数投票分类,平局随机打破;\(k\) 用交叉验证选。
  • Bagging:降低分类器变异性,对树等高度非线性分类器最有用。抽 \(B\) 个 bootstrap 样本,第 \(b\) 个得 \(\hat h_b\),最终 \(\hat h(x)=1\) 若 \(\frac1B\sum_b\hat h_b(x)\ge\frac12\),否则 0。
  • Boosting:从简单分类器出发,逐步给误分样本更高权重重新拟合。\(\mathcal H\) 如仅一次分割的树(stump),\(Y_i\in\{-1,1\}\),\(h(x)\in\{-1,1\}\)。多数算法易于加权(如树用加权不纯度)。AdaBoost:
    1. 权重 \(w_i=1/n\);
    2. 对 \(j=1,\dots,J\):(a) 用权重构造分类器 \(h_j\);(b) 加权错误率 \(\hat L_j=\frac{\sum_iw_iI(Y_i\ne h_j(X_i))}{\sum_iw_i}\);(c) \(\alpha_j=\log((1-\hat L_j)/\hat L_j)\);(d) 更新 \(w_i\leftarrow w_ie^{\alpha_jI(Y_i\ne h_j(X_i))}\);
    3. 最终分类器 \(\hat h(x)=\mathrm{sign}\big(\sum_{j=1}^J\alpha_jh_j(x)\big)\)。 bagging 是方差缩减技术,boosting 可看作偏差缩减技术(从高偏差简单分类器逐步降低偏差);缺点是最终分类器很复杂。
  • 神经网络(neural networks):最简版本 \(Y=\beta_0+\sum_{j=1}^p\beta_j\sigma(\alpha_0+\alpha^TX)\),\(\sigma\) 光滑,常取 \(\sigma(v)=e^v/(1+e^v)\)。本质是非线性回归。曾流行一时,但计算困难:最小二乘常遇多个局部极小;项数 \(p\) 本质上是平滑参数,需权衡偏差与方差。(作者 2004 年的评价。)

22.12 文献评注(PDF p.381)

Hastie et al. (2001);理论见 Devroye et al. (1996)、Vapnik (1998);核方法 Schölkopf & Smola (2002)、Herbrich (2002)。

22.13 习题概括(PDF p.381–383)

1–2. 证明定理 22.5(Bayes 规则最优)、22.7。 3. 垃圾邮件数据(57 个协变量):(a) LDA、QDA、logistic、分类树,报告训练误分率和 2×2 混淆表;(b) 5 折 CV 估计 LDA 与 logistic 预测准确率;(c) 对每个协变量做两组均值检验,保留 p 值最小的 10 个再做 LDA 与 logistic。 4. 求平面圆盘类 \(\{(x,y):(x-a)^2+(y-b)^2\le c^2\}\) 的 VC 维。 5. 用 SVM 分类垃圾邮件。 6. 用 VC 理论给 iris 数据 LDA 分类器的真实错误率置信区间。 7. \(X_i\in\mathbb R\),\(|X_i|\le1\) 时 \(Y_i=1\),否则 0:证明无线性分类器可完美分类,而核化 \(Z_i=(X_i,X_i^2)\) 可线性分开。 8. 用核 \(K(x,\tilde x)=(1+x^T\tilde x)^p\) 重做第 5 题,CV 选 \(p\)。 9. iris 数据 \(k\) 近邻,CV 选 \(k\)。 10. 维数灾难:\(X\) 在 \([-\frac12,\frac12]^d\) 上均匀,\(R\) 为原点到最近邻的距离,证明 \(R\) 的中位数为 \(\Big(\frac{1-(1/2)^{1/n}}{v_d(1)}\Big)^{1/d}\),\(v_d(r)=r^d\frac{\pi^{d/2}}{\Gamma((d/2)+1)}\) 为半径 \(r\) 球体积;对 \(n=100,1000,10000\),求中位数超过立方体边缘(1/2)的维数(Hastie et al. 2001)。 11. 对第 3 题拟合树,再用 bagging。 12. 单次分割树 + boosting。 13. (Friedman 1997)\(\hat r(x)\approx N(\bar r(x),\sigma^2(x))\),证明固定 \(x\) 时

\[\mathbb P(Y\ne\hat h(x))\approx\mathbb P(Y\ne h^*(x))+|2r(x)-1|\times\Big[1-\Phi\Big(\frac{\mathrm{sign}(r(x)-\frac12)(\bar r(x)-\frac12)}{\sigma(x)}\Big)\Big],\]
把 \(\mathrm{sign}((r(x)-\frac12)(\bar r(x)-\frac12))\) 视为偏差项,解释分类中的偏差–方差权衡(提示:\(\mathbb P(Y\ne\hat h(x))=|2r(x)-1|\mathbb P(\hat h(x)\ne h^*(x))+\mathbb P(Y\ne h^*(x))\))。要点:分类中只要偏差不改变 \(\bar r\) 在 1/2 的哪一侧,减小方差就能降低错误率;分类对偏差的容忍度高于回归。

第 22 章 本章要点

  • 0-1 损失下 Bayes 规则 \(\arg\max_k\pi_kf_k(x)\) 最优;三条近似路径:ERM、回归、密度估计。
  • 高斯类条件密度 → QDA(二次边界);等协方差 → LDA(线性边界);Fisher 判别 \(w=S_W^{-1}(\bar X_0-\bar X_1)\) 在 \(\pi=1/2\) 时与 LDA 一致。
  • LDA 与 logistic 模型形式相同,LDA 用联合似然、logistic 用条件似然(更稳健)。
  • 朴素 Bayes 用条件独立假设缓解高维密度估计;树用 Gini 不纯度递归划分,需用 CV 控制复杂度。
  • 训练误差低估真实误差;用验证集 / K 折 CV 估计;或用 Hoeffding(有限类)与 VC 不等式(无限类)给出一致置信区间,线性分类器 VC 维 \(d+1\)。
  • SVM:最大间隔 ⇔ 最小化 \(\|a\|^2/2\),对偶二次规划只依赖内积,因而可核化;软间隔用松弛变量和上界 \(c\)。
  • 核技巧:高维线性 = 原空间非线性;Mercer 正定核。bagging 降方差,boosting 降偏差,kNN、神经网络简述。

第 22 章 与量化交易的关联

  • 方向预测与信号分类:涨跌/超额收益正负的预测是二分类问题;logistic、LDA、树、boosting(如 GBDT)、SVM 都被用于横截面选股和择时。分类阈值可按交易成本与赔率调整,而非固定 1/2。
  • 错误率估计与过拟合:例 22.14 的"训练误差单调降、CV 误差 U 形"是回测过拟合的典型画像。金融时间序列必须用时间顺序的 CV(walk-forward、purged/embargoed K-fold),随机 K 折会因自相关与重叠标签造成信息泄露。
  • VC 维与模型容量:解释为何高容量模型在低信噪比金融数据上容易过拟合;一致收敛界思想与"测试了 m 个策略后最优策略表现的置信区间"一致(类似 Hoeffding + 并集界的策略数据窥探校正)。
  • 信用与风险:违约预测(LDA 即 Altman Z-score 的方法基础)、欺诈交易检测、市场状态(regime)分类。
  • 核与非线性:核方法处理因子间非线性交互;但核矩阵 \(O(n^2)\) 计算在大样本高频数据上代价高。
  • Bagging/Boosting:现代量化中树模型集成(随机森林、XGBoost/LightGBM)是主流非线性 alpha 模型的直接后代。

第 22 章 推荐习题

  • 习题 1:Bayes 规则最优性证明(理解 0-1 损失)。
  • 习题 3:多分类器实证对比与 CV(可替换为股票涨跌数据)。
  • 习题 4、7:VC 维计算与核化可分性。
  • 习题 10:维数灾难的定量体会。
  • 习题 13:分类中的偏差–方差(与回归不同)。

第 23 章 概率再访:随机过程(Probability Redux: Stochastic Processes)(PDF p.384–404)

23.1 引言(PDF p.384–385)

  • 本书大部分讨论 IID 序列,本章考虑相依随机变量序列(如每日气温)。
  • 随机过程(stochastic process) \(\{X_t:t\in T\}\) 是随机变量的集合,也写 \(X(t)\)。\(X_t\) 取值集合 \(\mathcal X\) 称状态空间(state space);\(T\) 称指标集(index set),可视为时间,可离散 \(T=\{0,1,2,\dots\}\) 或连续 \(T=[0,\infty)\)。
  • 例 23.1:IID 序列是随机过程。例 23.2(天气):\(\mathcal X=\{\text{sunny},\text{cloudy}\}\),离散状态、离散指标。例 23.3(股价,图 23.1):连续监测,指标集连续;价格离散但可视为连续。例 23.4(经验 CDF):\(\hat F_n(t)=\frac1n\sum_iI(X_i\le t)\),固定 \(t\) 是随机变量,整体 \(\{\hat F_n(t):t\in[0,1]\}\) 是状态与指标都连续的随机过程。
  • 基本事实:联合密度总可写为 \(f(x_1,\dots,x_n)=\prod_{i=1}^nf(x_i\mid\text{past}_i)\)(23.1),\(\text{past}_i=(X_1,\dots,X_{i-1})\)。

23.2 马尔可夫链(Markov Chains)(PDF p.386–397)

  • 状态空间离散(\(\{1,\dots,N\}\) 或 \(\{1,2,\dots\}\)),指标 \(T=\{0,1,2,\dots\}\),写 \(X_n\)。
  • 定义 23.5:\(\{X_n\}\) 是马尔可夫链,若对所有 \(n\) 与 \(x\),
    \[\mathbb P(X_n=x\mid X_0,\dots,X_{n-1})=\mathbb P(X_n=x\mid X_{n-1}). \tag{23.2}\]
    此时(23.1)化为 \(f(x_1,\dots,x_n)=f(x_1)f(x_2|x_1)\cdots f(x_n|x_{n-1})\)。DAG 表示 \(X_0\to X_1\to X_2\to\cdots\),每个变量唯一父节点为前一观测。
  • 三个目标问题:1. 链何时"安定"于某种平衡?2. 如何估计链的参数?3. 如何构造收敛到给定平衡分布的链、为何要这样做(第 24 章 MCMC)?图 23.2:一条链永远振荡,另一条最终达到平衡(直方图收敛到固定分布)。
  • 转移概率:若 \(\mathbb P(X_{n+1}=j|X_n=i)\) 不随时间变化,称链齐次(homogeneous),只讨论齐次链。
  • 定义 23.6:\(p_{ij}\equiv\mathbb P(X_{n+1}=j|X_n=i)\)(23.3)为转移概率,矩阵 \(P=(p_{ij})\) 为转移矩阵(transition matrix)。性质:\(p_{ij}\ge0\),\(\sum_jp_{ij}=1\)——每行是一个概率质量函数。
  • 例 23.7(带吸收壁的随机游走):\(\mathcal X=\{1,\dots,N\}\),掷硬币,正面(概率 \(p\))右移一步,反面(\(q=1-p\))左移,到端点即停留。\(P\) 首行 \((1,0,\dots,0)\),末行 \((0,\dots,0,1)\),中间第 \(i\) 行在 \(i-1\) 处为 \(q\)、\(i+1\) 处为 \(p\)。
  • 例 23.8(天气):转移矩阵 Sunny→Sunny 0.4、Sunny→Cloudy 0.6;Cloudy→Sunny 0.8、Cloudy→Cloudy 0.2。今天晴则明天多云概率 60%。
  • \(n\) 步转移概率 \(p_{ij}(n)=\mathbb P(X_{m+n}=j|X_m=i)\)(23.4),矩阵 \(P_n\)。
  • 定理 23.9(Chapman–Kolmogorov 方程):
    \[p_{ij}(m+n)=\sum_kp_{ik}(m)p_{kj}(n). \tag{23.5}\]
    证明:用 \(\mathbb P(X=x,Y=y|Z=z)=\mathbb P(X=x|Z=z)\mathbb P(Y=y|X=x,Z=z)\)、全概率公式和马尔可夫性:\(p_{ij}(m+n)=\sum_k\mathbb P(X_{m+n}=j|X_m=k,X_0=i)\mathbb P(X_m=k|X_0=i)=\sum_kp_{kj}(n)p_{ik}(m)\)。
  • (23.5)就是矩阵乘法:\(P_{m+n}=P_mP_n\)(23.6)。\(P_1=P\),故 \(P_n=P^n\)(23.7)。
  • 边际分布 \(\mu_n=(\mu_n(1),\dots,\mu_n(N))\)(行向量),\(\mu_n(i)=\mathbb P(X_n=i)\)(23.8);\(\mu_0\) 为初始分布。模拟只需 \(\mu_0\) 与 \(P\):先 \(X_0\sim\mu_0\),若结果为 \(i\),再按第 \(i\) 行抽 \(X_1\),依此类推。\(\mu_n\) 可理解为多次模拟后时刻 \(n\) 结果的直方图。
  • 引理 23.10:\(\mu_n=\mu_0P^n\)。证明:\(\mathbb P(X_n=j)=\sum_i\mathbb P(X_n=j|X_0=i)\mathbb P(X_0=i)=\sum_i\mu_0(i)p_{ij}(n)\)。
  • 术语小结:转移矩阵 \(P(i,j)=p_{ij}\);\(n\) 步矩阵 \(P_n(i,j)\);\(P_n=P^n\);边际 \(\mu_n(i)\),\(\mu_n=\mu_0P^n\)。
  • 状态分类:
    • 定义 23.11:若某 \(n\) 使 \(p_{ij}(n)>0\),称 \(i\) 可达 \(j\),记 \(i\to j\);若 \(i\to j\) 且 \(j\to i\),记 \(i\leftrightarrow j\),称互通(communicate)。
    • 定理 23.12:互通是等价关系(自反、对称、传递),状态空间可分解为互不相交的类,同类状态互通。
    • 所有状态互通称不可约(irreducible)。一旦进入就不离开的状态集为闭集(closed);单个状态的闭集为吸收态(absorbing state)。
    • 例 23.13:\(\mathcal X=\{1,2,3,4\}\),\(P\) 的行为 \((\frac13,\frac23,0,0)\)、\((\frac23,\frac13,0,0)\)、\((\frac14,\frac14,\frac14,\frac14)\)、\((0,0,0,1)\)。类为 \(\{1,2\},\{3\},\{4\}\);4 是吸收态。
  • 常返与暂留:
    • 定义 23.14:若 \(\mathbb P(X_n=i\text{ 对某 }n\ge1\mid X_0=i)=1\),称 \(i\) 常返(recurrent / persistent),否则暂留(transient)。
    • 定理 23.15:\(i\) 常返 ⇔ \(\sum_np_{ii}(n)=\infty\)(23.9);暂留 ⇔ \(\sum_np_{ii}(n)<\infty\)(23.10)。证明:令 \(I_n=I(X_n=i)\),访问次数 \(Y=\sum_{n\ge0}I_n\),\(\mathbb E(Y|X_0=i)=\sum_n\mathbb P(X_n=i|X_0=i)=\sum_np_{ii}(n)\)。令 \(a_i=\mathbb P(\text{返回 }i|X_0=i)\)。常返时 \(a_i=1\),每次返回后又必然再返回,\(\mathbb E(Y)=\infty\);暂留时每次在 \(i\) 有 \(1-a_i>0\) 的概率永不返回,恰访问 \(n\) 次的概率 \(a_i^{n-1}(1-a_i)\)(几何分布),均值有限。
    • 定理 23.16:1. \(i\) 常返且 \(i\leftrightarrow j\) ⇒ \(j\) 常返;2. \(i\) 暂留且 \(i\leftrightarrow j\) ⇒ \(j\) 暂留;3. 有限马尔可夫链至少有一个常返态;4. 有限不可约链的状态全部常返。
    • 定理 23.17(分解定理):\(\mathcal X=\mathcal X_T\cup\mathcal X_1\cup\mathcal X_2\cup\cdots\),\(\mathcal X_T\) 为暂留态,每个 \(\mathcal X_i\) 为常返态构成的闭不可约集。
    • 例 23.18(整数上的随机游走):\(p_{i,i+1}=p\),\(p_{i,i-1}=q\)。全部互通,故全常返或全暂留。从 0 出发:\(p_{00}(2n)=\binom{2n}{n}p^nq^n\)(23.11)(回到 0 需恰 \(n\) 次右移、\(n\) 次左移)。Stirling 公式 \(n!\approx n^n\sqrt ne^{-n}\sqrt{2\pi}\) 给出 \(p_{00}(2n)\sim\frac{(4pq)^n}{\sqrt{n\pi}}\)。\(\sum_np_{00}(2n)=\infty\) 当且仅当 \(p=q=\frac12\)(此时 \(4pq=1\),级数 \(\sum n^{-1/2}\) 发散)。故对称随机游走常返,否则暂留。
  • 收敛:
    • 从 \(X_0=i\) 出发,返回时间 \(T_{ij}=\min\{n>0:X_n=j\}\)(23.12,若永不到达则为 \(\infty\))。常返态 \(i\) 的平均返回时间 \(m_i=\mathbb E(T_{ii})=\sum_nnf_{ii}(n)\)(23.13),\(f_{ii}(n)=\mathbb P(X_1\ne i,\dots,X_{n-1}\ne i,X_n=i|X_0=i)\)。\(m_i=\infty\) 的常返态称零常返(null),否则正常返(non-null / positive)。
    • 引理 23.19:零常返态满足 \(p_{jj}(n)\to0\)。引理 23.20:有限状态链的常返态都是正常返。
    • 周期:三状态链 \(P=\begin{pmatrix}0&1&0\\0&0&1\\1&0&0\end{pmatrix}\),从 1 出发在时刻 3、6、9、… 处于状态 3——周期链。状态 \(i\) 的周期 \(d=\gcd\{n:p_{ii}(n)>0\}\);\(d(i)>1\) 为周期的,\(d(i)=1\) 为非周期(aperiodic)。
    • 引理 23.21:\(i\) 周期为 \(d\) 且 \(i\leftrightarrow j\),则 \(j\) 周期也为 \(d\)。
    • 定义 23.22:常返、正常返且非周期的状态称遍历(ergodic);所有状态遍历的链称遍历链。
    • 定义 23.23:非负、和为 1 的向量 \(\pi\) 若满足 \(\pi=\pi P\),称为平稳(不变)分布(stationary / invariant distribution)。直观:\(X_0\sim\pi\),则 \(X_1\) 分布 \(\pi P=\pi\),\(X_2\) 分布 \(\pi P^2=\pi\)……任何时刻分布为 \(\pi\) 则此后永远为 \(\pi\)。
    • 定义 23.24:若 \(P^n\to\begin{pmatrix}\pi\\\pi\\\vdots\\\pi\end{pmatrix}\),即 \(\pi_j=\lim_np_{ij}(n)\) 存在且与 \(i\) 无关,称链有极限分布(limiting distribution)。
    • 定理 23.25(主定理):不可约、遍历的马尔可夫链有唯一平稳分布 \(\pi\),极限分布存在且等于 \(\pi\)。对任何有界函数 \(g\),以概率 1
      \[\lim_{N\to\infty}\frac1N\sum_{n=1}^Ng(X_n)\to\mathbb E_\pi(g)\equiv\sum_jg(j)\pi_j. \tag{23.14}\]
      (马尔可夫链的大数定律。)
    • 细致平衡(detailed balance):\(\pi_ip_{ij}=p_{ji}\pi_j\)(23.15)。定理 23.26:满足细致平衡的 \(\pi\) 是平稳分布。证明:\((\pi P)_j=\sum_i\pi_ip_{ij}=\sum_i\pi_jp_{ji}=\pi_j\sum_ip_{ji}=\pi_j\)。(在第 24 章 MCMC 中关键。)
    • 警告:有平稳分布不等于收敛。例 23.27:上述三状态循环链,\(\pi=(\frac13,\frac13,\frac13)\) 满足 \(\pi P=\pi\);从 \(\pi\) 出发永远保持 \(\pi\),但链没有极限,永远循环(周期性)。
  • 例 23.28:\(\mathcal X=\{1,\dots,6\}\),\(P\) 行:\((\frac12,\frac12,0,0,0,0)\)、\((\frac14,\frac34,0,0,0,0)\)、\((\frac14,\frac14,\frac14,\frac14,0,0)\)、\((\frac14,0,\frac14,\frac14,0,\frac14)\)、\((0,0,0,0,\frac12,\frac12)\)、\((0,0,0,0,\frac12,\frac12)\)。\(C_1=\{1,2\}\)、\(C_2=\{5,6\}\) 为不可约闭集;3、4 暂留(存在路径 \(3\to4\to6\),到 6 后不能返回);\(p_{ii}(1)>0\) 故全部非周期。结论:3、4 暂留;1、2、5、6 遍历。
  • 例 23.29(Hardy–Weinberg 定律):基因 A/a,基因型 AA、Aa、aa 比例 \((p,q,r)\)。每人随机传一份基因给子女,随机婚配。基因池中 A 比例 \(P=p+q/2\),a 比例 \(Q=r+q/2\)。子女为 AA、Aa、aa 的概率 \(P^2,2PQ,Q^2\)。下一代 A 比例 \(P^2+\frac12\cdot2PQ=P^2+PQ=P(P+Q)=P\)(用 \(r=1-p-q\)),a 比例为 \(Q\);故自第二代起基因型比例稳定为 \((P^2,2PQ,Q^2)\)。设每人恰有一个孩子,固定某人,令 \(X_n\) 为其第 \(n\) 代后裔的基因型,构成马尔可夫链,状态 \(\{AA,Aa,aa\}\),转移矩阵(配偶随机):AA 行 \((P,Q,0)\);Aa 行 \((\frac P2,\frac{P+Q}2,\frac Q2)\);aa 行 \((0,P,Q)\)。平稳分布 \(\pi=(P^2,2PQ,Q^2)\)。
  • 例 23.30(MCMC 预告):密度 \(f(x)=cg(x)\),\(g\) 已知、\(c\) 未知(\(c=1/\int g\) 可能难算,算法也不需要)。从任意 \(X_0\) 出发,给定 \(X_i\):抽 \(W\sim N(X_i,b^2)\),\(r=\min\{\frac{g(W)}{g(X_i)},1\}\),抽 \(U\sim\) Uniform(0,1),若 \(U<r\) 令 \(X_{i+1}=W\),否则 \(X_{i+1}=X_i\)。在弱条件下这是以 \(f\) 为平稳分布的遍历链,可把抽样视为来自 \(f\) 的样本。
  • 马尔可夫链的推断:有限状态 \(\{1,\dots,N\}\),观测 \(X_0,\dots,X_n\)。参数为初始概率 \(\mu_0\) 与转移矩阵 \(P\) 的元素;每行是多项分布,即估计 \(N\) 个分布。\(n_{ij}\) 为观测到的 \(i\to j\) 转移次数。似然
    \[\mathcal L(\mu_0,P)=\mu_0(x_0)\prod_{r=1}^np_{X_{r-1},X_r}=\mu_0(x_0)\prod_{i=1}^N\prod_{j=1}^Np_{ij}^{n_{ij}}.\]
    \(\mu_0\) 只有一个观测无法估计,专注 \(P\)。在非负、行和为 1 约束下最大化得 MLE \(\hat p_{ij}=n_{ij}/n_i\),\(n_i=\sum_jn_{ij}\)(若 \(n_i=0\) 约定 \(\hat p_{ij}=0\))。
  • 定理 23.31(MLE 的相合性与渐近正态性):设链遍历,\(\hat p_{ij}(n)\) 为 \(n\) 个观测后的 MLE,则 \(\hat p_{ij}(n)\xrightarrow{P}p_{ij}\),且
    \[\big[\sqrt{N_i(n)}(\hat p_{ij}-p_{ij})\big]\rightsquigarrow N(0,\Sigma),\]
    左边是矩阵,\(N_i(n)=\sum_{r=1}^nI(X_r=i)\),
    \[\Sigma_{ij,k\ell}=\begin{cases}p_{ij}(1-p_{ij})&(i,j)=(k,\ell)\\-p_{ij}p_{i\ell}&i=k,j\ne\ell\\0&\text{其他}\end{cases}\]
    (每行像独立的多项分布,不同行渐近独立。)

23.3 泊松过程(Poisson Processes)(PDF p.397–400)

  • 用于计数随时间发生的事件(交通事故、放射性衰变、邮件到达)。
  • 泊松分布回顾:\(X\sim\) Poisson\((\lambda)\),\(\mathbb P(X=x)=e^{-\lambda}\lambda^x/x!\),\(\mathbb E X=\mathbb V X=\lambda\);独立泊松之和仍为泊松(参数相加);若 \(N\sim\) Poisson\((\lambda)\)、\(Y|N=n\sim\) Binomial\((n,p)\),则 \(Y\sim\) Poisson\((\lambda p)\)(稀释性)。
  • \(X_t\) 为到时刻 \(t\)(含)为止收到的邮件数,\(\{X_t:t\in[0,\infty)\}\) 状态空间 \(\{0,1,2,\dots\}\),称计数过程(counting process)。记号:\(f(h)=o(h)\) 若 \(f(h)/h\to0\)(\(h\to0\)),如 \(h^2=o(h)\)。
  • 定义 23.32:泊松过程是满足下列条件的计数过程:1. \(X(0)=0\);2. 对任意 \(0=t_0<t_1<\dots<t_n\),增量 \(X(t_1)-X(t_0),\dots,X(t_n)-X(t_{n-1})\) 独立;3. 存在函数 \(\lambda(t)\) 使
    \[\mathbb P(X(t+h)-X(t)=1)=\lambda(t)h+o(h),\qquad\mathbb P(X(t+h)-X(t)\ge2)=o(h). \tag{23.16–23.17}\]
    \(\lambda(t)\) 称强度函数(intensity function)。即 \([t,t+h]\) 内发生一次事件概率约 \(h\lambda(t)\),多于一次的概率很小。
  • 定理 23.33:强度为 \(\lambda(t)\) 的泊松过程满足 \(X(s+t)-X(s)\sim\) Poisson\((m(s+t)-m(s))\),\(m(t)=\int_0^t\lambda(s)ds\)。特别地 \(X(t)\sim\) Poisson\((m(t))\),\(\mathbb E X(t)=\mathbb V X(t)=m(t)\)。
  • 定义 23.34:\(\lambda(t)\equiv\lambda>0\) 时称速率为 \(\lambda\) 的齐次泊松过程,\(X(t)\sim\) Poisson\((\lambda t)\)。
  • 等待时间与逗留时间:\(W_n\) 为第 \(n\) 个事件发生时刻(\(W_0=0\)),称等待时间(waiting times);\(S_n=W_{n+1}-W_n\) 称逗留时间 / 到达间隔(sojourn / interarrival times)。
  • 定理 23.35:逗留时间 \(S_0,S_1,\dots\) IID,服从均值 \(1/\lambda\) 的指数分布,密度 \(f(s)=\lambda e^{-\lambda s}\)(\(s\ge0\))。等待时间 \(W_n\sim\) Gamma\((n,1/\lambda)\),密度 \(f(w)=\frac{1}{\Gamma(n)}\lambda^nw^{n-1}e^{-\lambda w}\)(\(w>0\))。证明:\(\mathbb P(S_1>t)=\mathbb P(X(t)=0)=e^{-\lambda t}\),故 \(S_1\) 指数分布;\(\mathbb P(S_2>t|S_1=s)=\mathbb P((s,s+t]\text{ 内无事件}|S_1=s)=\mathbb P((s,s+t]\text{ 内无事件})=e^{-\lambda t}\)(增量独立),故 \(S_2\) 指数且独立于 \(S_1\);重复论证;\(W_n\) 是指数之和故为 Gamma。
  • 例 23.36(Calgary 网站服务器请求,图 23.3):假设齐次泊松,\(N\equiv X(T)\sim\) Poisson\((\lambda T)\),似然 \(\mathcal L(\lambda)\propto e^{-\lambda T}(\lambda T)^N\),MLE \(\hat\lambda=N/T=48.0077\)(每分钟)。拟合优度检验:把 \([0,T]\) 等分为 4 段 \(I_1,\dots,I_4\);若为齐次泊松,给定总数,每个事件落入各段概率相等,\(H_0:p_1=\dots=p_4=1/4\)。\(\chi^2=\sum_{i=1}^4\frac{(O_i-E_i)^2}{E_i}\),\(E_i=n/4\)。得 \(\chi^2=252\),p 值 ≈ 0,拒绝齐次泊松——不意外,强度应随时间变化。

23.4 文献评注(PDF p.400)

Grimmett & Stirzaker (1982)、Taylor & Karlin (1994)、Guttorp (1995)、Ross (2002);习题取自这些书。

23.5 习题概括(PDF p.401–404)

  1. 三状态链 \(P=\begin{pmatrix}0.1&0.2&0.7\\0.9&0.1&0\\0.1&0.8&0.1\end{pmatrix}\),\(\mu_0=(0.3,0.4,0.3)\),求 \(\mathbb P(X_0=0,X_1=1,X_2=2)\) 与 \(\mathbb P(X_0=0,X_1=1,X_2=1)\)。
  2. \(Y_i\) IID 取 0,1,2,3 概率 0.1,0.3,0.2,0.4,\(X_0=0\),\(X_{n+1}=\max\{Y_1,\dots,Y_{n+1}\}\)(累积最大),证明是马尔可夫链并求转移矩阵。
  3. 两状态链 \(P=\begin{pmatrix}1-a&a\\b&1-b\end{pmatrix}\),证明 \(\lim P^n=\begin{pmatrix}\frac b{a+b}&\frac a{a+b}\\\frac b{a+b}&\frac a{a+b}\end{pmatrix}\)。
  4. \(a=0.1,b=0.3\) 模拟,画状态占比 \(\hat p_n(1),\hat p_n(2)\) 随 \(n\) 收敛。
  5. 分支过程(branching process):每个个体有 \(Y\) 个后代,\(p_k=\mathbb P(Y=k)\),\(X_{n+1}=Y_1^{(n)}+\dots+Y_{X_n}^{(n)}\),\(X_0=1\),\(\mu=\mathbb EY\),\(\sigma^2=\mathbb VY\)。(a) \(M(n+1)=\mu M(n)\),\(V(n+1)=\sigma^2M(n)+\mu^2V(n)\);(b) \(M(n)=\mu^n\),\(V(n)=\sigma^2\mu^{n-1}(1+\mu+\dots+\mu^{n-1})\);(c) 讨论 \(\mu>1,=1,<1\) 时方差行为;(d) 灭绝时间 \(N=\min\{n:X_n=0\}\) 的 CDF 满足 \(F(n)=\sum_kp_k(F(n-1))^k\);(e) \(p_0=\frac14,p_1=\frac12,p_2=\frac14\) 时计算 \(F(n)\)。
  6. \(P=\begin{pmatrix}0.40&0.50&0.10\\0.05&0.70&0.25\\0.05&0.50&0.45\end{pmatrix}\),求平稳分布。
  7. 证明 \(i\) 常返且 \(i\leftrightarrow j\) 则 \(j\) 常返。
  8. 给定 6×6 转移矩阵,判断哪些态暂留、哪些常返。
  9. \(P=\begin{pmatrix}0&1\\1&0\end{pmatrix}\),证明 \(\pi=(\frac12,\frac12)\) 平稳但链不收敛(周期 2)。
  10. 给定含 \(p,q\) 的四状态链求极限分布。
  11. 非齐次泊松过程时间变换:\(\Lambda(t)=\int_0^t\lambda(u)du\),\(Y(s)=X(t)\),\(s=\Lambda(t)\),证明 \(Y\) 是强度 1 的齐次泊松过程。
  12. 求 \(X(t)\) 在给定 \(X(t+s)=n\) 下的条件分布(二项分布 \(\mathrm{Binomial}(n,t/(t+s))\))。
  13. 求 \(X(t)\) 为奇数的概率(\(\frac12(1-e^{-2\lambda t})\))。
  14. 登录系统为强度 \(\lambda\) 泊松过程,在线时长 CDF \(G\) 独立,求 \(t\) 时刻在线人数 \(Y(t)\) 的分布(\(M/G/\infty\) 队列,泊松分布,均值 \(\lambda\int_0^t(1-G(s))ds\))。
  15. 证明 \(\mathbb E\big(\sum_{i=1}^{X(t)}f(W_i)\big)=\lambda\int_0^tf(w)dw\)(Campbell 定理)。
  16. 二维泊松点过程(面积 \(A\) 内点数 Poisson\((\lambda\mu(A))\)、不交区域独立),\(X\) 为任意点到最近随机点的距离,证明 \(\mathbb P(X>x)=e^{-\lambda\pi x^2}\),\(\mathbb E(X)=\frac{1}{2\sqrt\lambda}\)。

第 23 章 本章要点

  • 马尔可夫性:给定现在,未来与过去独立;齐次链由转移矩阵 \(P\) 刻画,\(n\) 步转移 \(P^n\),边际 \(\mu_n=\mu_0P^n\)(Chapman–Kolmogorov)。
  • 状态分类:互通类、闭集、吸收态;常返 ⇔ \(\sum p_{ii}(n)=\infty\);对称一维随机游走常返,非对称暂留;周期性;遍历 = 正常返 + 非周期。
  • 不可约遍历链有唯一平稳分布,即极限分布,且样本均值收敛到平稳期望;细致平衡 ⇒ 平稳;平稳不保证收敛(周期链)。
  • 转移概率 MLE \(\hat p_{ij}=n_{ij}/n_i\),渐近正态,协方差类似多项分布。
  • 泊松过程:独立增量、强度 \(\lambda(t)\);增量服从泊松(均值为强度积分);齐次时到达间隔 IID 指数、第 \(n\) 次到达时刻 Gamma。

第 23 章 与量化交易的关联

  • 市场状态(regime)模型:牛/熊、高/低波动等离散状态的马尔可夫链与隐马尔可夫模型;转移矩阵 MLE(\(n_{ij}/n_i\))与渐近标准误直接用于估计状态持续性;平稳分布给出长期各状态占比。
  • 信用评级迁移矩阵:评级转移即马尔可夫链,违约为吸收态;\(P^n\) 给出多期违约概率(CreditMetrics)。
  • 随机游走与价格:对称随机游走常返性、Stirling 近似是理解有效市场假说下价格模型的起点;分支过程可类比订单流的自激(Hawkes 过程是其连续时间推广)。
  • 泊松过程:订单到达、成交笔数、跳跃(Merton 跳跃扩散模型)、违约到达(约化形式信用模型中违约强度 \(\lambda(t)\) 即本章强度函数,生存概率 \(e^{-\int\lambda}\))。例 23.36 的检验思路可用于检验交易到达是否齐次(日内 U 形模式通常拒绝齐次性)。
  • MCMC 基础:遍历定理与细致平衡是贝叶斯量化模型(随机波动率、贝叶斯因子模型)参数估计的理论基础。

第 23 章 推荐习题

  • 习题 3、4:两状态链极限分布的推导与模拟(regime 模型原型)。
  • 习题 5:分支过程的均值方差与灭绝概率。
  • 习题 6、9:平稳分布求解与周期链不收敛。
  • 习题 11、15:非齐次泊松时间变换与 Campbell 定理(跳跃/违约建模常用)。

第 24 章 模拟方法(Simulation Methods)(PDF p.405–424)

本章说明如何用模拟近似积分。主例为贝叶斯推断中的积分计算,但技术通用。三种方法:(i) 基本 Monte Carlo 积分;(ii) 重要性抽样;(iii) 马尔可夫链 Monte Carlo(MCMC)。

24.1 贝叶斯推断回顾(PDF p.405–406)

  • 先验 \(f(\theta)\)、数据 \(x^n=(x_1,\dots,x_n)\),后验
    \[f(\theta|x^n)=\frac{\mathcal L(\theta)f(\theta)}{c},\qquad c=\int\mathcal L(\theta)f(\theta)d\theta.\]
    后验均值 \(\bar\theta=\int\theta f(\theta|x^n)d\theta=\frac{\int\theta\mathcal L(\theta)f(\theta)d\theta}{\int\mathcal L(\theta)f(\theta)d\theta}\)。
  • \(\theta=(\theta_1,\dots,\theta_k)\) 多维时,某分量边际后验 \(f(\theta_1|x^n)=\int\cdots\int f(\theta_1,\dots,\theta_k|x^n)d\theta_2\cdots d\theta_k\),涉及高维积分,常无法解析,需模拟。

24.2 基本 Monte Carlo 积分(Basic Monte Carlo Integration)(PDF p.406–410)

  • 求 \(I=\int_a^bh(x)dx\)。简单函数可闭式求解;复杂时可用 Simpson 法则、梯形法则、Gauss 求积等数值方法;Monte Carlo 积分以简单、通用、可扩展著称。
  • 写
    \[I=\int_a^bh(x)dx=\int_a^bw(x)f(x)dx,\quad w(x)=h(x)(b-a),\ f(x)=\frac1{b-a}, \tag{24.1}\]
    \(f\) 为 Uniform\((a,b)\) 密度,故 \(I=\mathbb E_f(w(X))\)。抽 \(X_1,\dots,X_N\sim\) Unif\((a,b)\),由大数定律
    \[\hat I\equiv\frac1N\sum_{i=1}^Nw(X_i)\xrightarrow{P}\mathbb E(w(X))=I. \tag{24.2}\]
    标准误 \(\widehat{\rm se}=s/\sqrt N\),\(s^2=\frac{\sum_i(Y_i-\hat I)^2}{N-1}\),\(Y_i=w(X_i)\);\(1-\alpha\) 置信区间 \(\hat I\pm z_{\alpha/2}\widehat{\rm se}\)。\(N\) 可任意大,故区间可任意窄(误差 \(O(N^{-1/2})\),与维数无关)。
  • 例 24.1:\(h(x)=x^3\),\(I=\int_0^1x^3dx=1/4\);\(N=10{,}000\) 个 Uniform(0,1) 得 \(\hat I=0.248\),se 0.0028。
  • 推广:\(I=\int h(x)f(x)dx\)(24.3),\(f\) 为概率密度;抽 \(X_1,\dots,X_N\sim f\),\(\hat I=\frac1N\sum h(X_i)\)。
  • 例 24.2:标准正态 CDF \(\Phi(x)=\int h(s)f(s)ds\),\(h(s)=I(s<x)\);抽 \(N(0,1)\) 样本,\(\hat I=\frac{\#\{X_i\le x\}}{N}\)。\(x=2\):真值 0.9772;\(N=10{,}000\) 得 0.9751;\(N=100{,}000\) 得 0.9771。
  • 例 24.3(两个二项的贝叶斯推断):\(X\sim\) Binomial\((n,p_1)\),\(Y\sim\) Binomial\((m,p_2)\),估计 \(\delta=p_2-p_1\)。MLE \(\hat\delta=Y/m-X/n\),delta 方法 \(\widehat{\rm se}=\sqrt{\frac{\hat p_1(1-\hat p_1)}{n}+\frac{\hat p_2(1-\hat p_2)}{m}}\),95% CI \(\hat\delta\pm2\widehat{\rm se}\)。贝叶斯:平坦先验 \(f(p_1,p_2)=1\),后验 \(f(p_1,p_2|X,Y)\propto p_1^X(1-p_1)^{n-X}p_2^Y(1-p_2)^{m-Y}\)。后验均值 \(\bar\delta=\int\int(p_2-p_1)f(p_1,p_2|X,Y)dp_1dp_2\);后验 CDF \(F(c|X,Y)=\int_Af(p_1,p_2|X,Y)\),\(A=\{p_2-p_1\le c\}\),求导得密度——积分繁琐。模拟:后验分解为 \(f(p_1|X)f(p_2|Y)\),后验下独立,\(p_1|X\sim\) Beta\((X+1,n-X+1)\),\(p_2|Y\sim\) Beta\((Y+1,m-Y+1)\)。抽 \(N\) 对,\(\delta^{(i)}=p_2^{(i)}-p_1^{(i)}\),\(\bar\delta\approx\frac1N\sum\delta^{(i)}\);排序取 2.5%、97.5% 分位数得 95% 后验区间;对 \(\delta^{(i)}\) 做直方图/密度估计得后验密度。数值:\(n=m=10\),\(X=8\),\(Y=6\),1000 次后验抽样得 95% 后验区间 \((-0.52,0.20)\)(图 24.1)。
  • 例 24.4(剂量–反应贝叶斯推断,LD50):10 个剂量 \(x_1<\dots<x_{10}\),每个剂量 \(n\) 只鼠,\(Y_i\) 为存活数,\(Y_i\sim\) Binomial\((n,p_i)\) 独立(\(p_i\) 为死亡概率时)。生物学知识:剂量越高死亡概率越高,\(p_1\le p_2\le\dots\le p_{10}\)。目标 LD50:\(\delta=x_j\),\(j=\min\{i:p_i\ge0.50\}\),是 \((p_1,\dots,p_{10})\) 的复杂函数 \(g\)。后验均值需在受限区域 \(A=\{p_1\le\dots\le p_{10}\}\) 上做 10 维积分。用截断于 \(A\) 的平坦先验,模拟步骤:(1) 抽 \(P_i\sim\) Beta\((Y_i+1,n-Y_i+1)\),\(i=1..10\);(2) 若 \(P_1\le\dots\le P_{10}\) 保留,否则丢弃重抽(拒绝抽样);(3) \(\delta=x_j\),\(j=\min\{i:P_i>0.50\}\)。重复 \(N\) 次得 \(\delta^{(1..N)}\),\(\bar\delta\approx\frac1N\sum\delta^{(i)}\),概率质量函数 \(\mathbb P(\delta=x_j|Y)\approx\frac1N\sum_iI(\delta^{(i)}=j)\)。数据:每剂量 15 只,原文标为“存活数”的计数依次为 0, 0, 2, 2, 8, 10, 12, 14, 15, 14(随剂量递增,与 \(p_i\) 递增的设定一致时应理解为死亡数,原书标签有误)。结果 \(\bar\delta=4.04\),95% 区间 \((3,5)\)。

24.3 重要性抽样(Importance Sampling)(PDF p.410–413)

  • 不会从 \(f\) 抽样时(如贝叶斯后验 \(\propto\mathcal L(\theta)f(\theta)\) 不一定是已知分布)。取已知如何抽样的密度 \(g\):
    \[I=\int h(x)f(x)dx=\int\frac{h(x)f(x)}{g(x)}g(x)dx=\mathbb E_g(Y),\quad Y=\frac{h(X)f(X)}{g(X)}. \tag{24.4}\]
    抽 \(X_1,\dots,X_N\sim g\),
    \[\hat I=\frac1N\sum_i\frac{h(X_i)f(X_i)}{g(X_i)}. \tag{24.5}\]
    称重要性抽样,大数定律保证 \(\hat I\xrightarrow{P}I\)。
  • 陷阱:\(\hat I\) 可能有无穷标准误。\(w(x)=h(x)f(x)/g(x)\) 的二阶矩
    \[\mathbb E_g(w^2(X))=\int\Big(\frac{h(x)f(x)}{g(x)}\Big)^2g(x)dx=\int\frac{h^2(x)f^2(x)}{g(x)}dx. \tag{24.6}\]
    若 \(g\) 尾部比 \(f\) 薄,积分可能无穷。基本规则:从尾部比 \(f\) 更厚的 \(g\) 抽样;若 \(g\) 在 \(f\) 大的区域很小,比值 \(f/g\) 会很大导致方差大,故 \(g\) 形状应与 \(f\) 相似。总结:好的 \(g\) 与 \(f\) 相似但尾部更厚。
  • 定理 24.5:使 \(\hat I\) 方差最小的 \(g\) 为
    \[g^*(x)=\frac{|h(x)|f(x)}{\int|h(s)|f(s)ds}.\]
    证明:\(w=fh/g\) 的方差 \(=\int\frac{h^2f^2}{g}dx-(\int hf)^2\),第二项与 \(g\) 无关;由 Jensen 不等式(定理 4.9)\(\mathbb E_g(W^2)\ge(\mathbb E_g(|W|))^2=(\int|h|f)^2\),而 \(g^*\) 恰达到此下界。仅有理论意义:若不会从 \(f\) 抽样,也很难从 \(|h|f/\int|h|f\) 抽样。实践中找与 \(f|h|\) 相似的厚尾分布 \(g\)。
  • 例 24.6(尾概率):\(I=\mathbb P(Z>3)=0.0013\),\(h(x)=I(x>3)\)。基本 MC(\(N=100\))多次模拟得 \(\mathbb E(\hat I)=0.0015\),波动约 0.0039(原文标为 \(\mathbb V\),按数值实为标准差);大部分抽样浪费在远离右尾处。改用 \(g=N(4,1)\),\(\hat I=N^{-1}\sum f(X_i)h(X_i)/g(X_i)\):\(\mathbb E(\hat I)=0.0011\),波动 0.0002,标准差降低约 20 倍。
  • 例 24.7(含离群值的测量模型):\(X_i=\theta+\epsilon_i\)。正态误差尾部薄、极端值罕见,不适合偶有"野值"的测量;改用自由度 \(\nu\) 的 t 分布
    \[t(x)=\frac{\Gamma(\frac{\nu+1}2)}{\Gamma(\frac\nu2)\sqrt{\nu\pi}}\Big(1+\frac{x^2}{\nu}\Big)^{-(\nu+1)/2},\]
    \(\nu\) 越小尾部越厚,取 \(\nu=3\)。平坦先验,似然 \(\mathcal L(\theta)=\prod_it(X_i-\theta)\),后验均值 \(\bar\theta=\frac{\int\theta\mathcal L(\theta)d\theta}{\int\mathcal L(\theta)d\theta}\)。分子分母都用重要性抽样:抽 \(\theta_1,\dots,\theta_N\sim g\),
    \[\bar\theta\approx\frac{\frac1N\sum_j\theta_j\mathcal L(\theta_j)/g(\theta_j)}{\frac1N\sum_j\mathcal L(\theta_j)/g(\theta_j)}.\]
    \(n=2\) 个观测,数值计算后验均值 −0.54;正态重要性分布得 −0.74(尾太薄,失败);Cauchy(t₁)重要性分布得 −0.53(厚尾,准确)。

24.4 MCMC 第一部分:Metropolis–Hastings 算法(PDF p.413–416)

  • 构造平稳分布为 \(f\) 的马尔可夫链 \(X_1,X_2,\dots\),在一定条件下 \(\frac1N\sum_ih(X_i)\xrightarrow{P}\mathbb E_f(h(X))=I\)(马尔可夫链大数定律,定理 23.25)。
  • 提议分布(proposal distribution) \(q(y|x)\):任意"友好"(易于抽样)的条件密度。
  • Metropolis–Hastings 算法:任选 \(X_0\);已生成 \(X_0,\dots,X_i\) 后:
    1. 生成候选 \(Y\sim q(y|X_i)\);
    2. 计算 \(r\equiv r(X_i,Y)\),
      \[r(x,y)=\min\Big\{\frac{f(y)}{f(x)}\frac{q(x|y)}{q(y|x)},1\Big\};\]
    3. 以概率 \(r\) 令 \(X_{i+1}=Y\),以概率 \(1-r\) 令 \(X_{i+1}=X_i\)。
  • 注 24.8:第 3 步实现:抽 \(U\sim\) Uniform(0,1),\(U<r\) 则接受 \(Y\),否则保留 \(X_i\)。注 24.9:常用 \(q(y|x)=N(x,b^2)\),对称 \(q(y|x)=q(x|y)\),\(r=\min\{f(Y)/f(X_i),1\}\)。注意 \(f\) 只需知道到比例常数。
  • 例 24.10(Cauchy 目标):\(f(x)=\frac1\pi\frac1{1+x^2}\),提议 \(N(x,b^2)\),\(r(x,y)=\min\{\frac{1+x^2}{1+y^2},1\}\)。图 24.2 三条长 1000 的链:\(b=0.1\) 步长太小,链"探索"不足,直方图与真密度差;\(b=10\) 提议常落到尾部,\(r\) 小、频繁拒绝,链常"卡住";\(b=1\) 居中,更快地代表目标密度。效率依赖调节参数。若链样本很快"像"目标分布,称混合良好(mixing well);构造混合良好的链有一定艺术性。
  • 为什么有效:连续状态记号,\(p(x,y)\) 为 \(x\to y\) 的转移密度。\(f\) 平稳 ⇔ \(f(x)=\int f(y)p(y,x)dy\);细致平衡
    \[f(x)p(x,y)=f(y)p(y,x) \tag{24.7}\]
    蕴含平稳:\(\int f(y)p(y,x)dy=\int f(x)p(x,y)dy=f(x)\int p(x,y)dy=f(x)\)。证明细致平衡:任取 \(x\ne y\),不妨设 \(f(x)q(y|x)>f(y)q(x|y)\)(忽略概率为 0 的相等情形),则 \(r(x,y)=\frac{f(y)q(x|y)}{f(x)q(y|x)}\),\(r(y,x)=1\)。从 \(x\) 跳到 \(y\) 需提议生成 \(y\) 且被接受:\(p(x,y)=q(y|x)r(x,y)=\frac{f(y)}{f(x)}q(x|y)\),故 \(f(x)p(x,y)=f(y)q(x|y)\)(24.8)。从 \(y\) 到 \(x\):\(p(y,x)=q(x|y)r(y,x)=q(x|y)\),故 \(f(y)p(y,x)=f(y)q(x|y)\)(24.9)。两式相等,细致平衡成立。

24.5 MCMC 第二部分:不同变体(Different Flavors)(PDF p.417–421)

  • 随机游走 Metropolis–Hastings(random-walk-MH):\(Y=X_i+\epsilon_i\),\(\epsilon_i\sim g\),即 \(q(y|x)=g(y-x)\)(\(g\) 对称时)\(r(x,y)=\min\{1,\frac{f(y)}{f(x)}\}\)。不做接受–拒绝就是随机游走,故名。\(g\) 常取 \(N(0,b^2)\);难点是选 \(b\) 使链混合良好。经验法则:选 \(b\) 使提议约 50% 被接受(高维时理论最优约 23%,本书未提)。警告:仅当 \(X\) 取值于整个实轴时合理;若受限(如 \(X\in(0,\infty)\)),应先变换(如 \(Y=\log X\))再模拟 \(Y\) 的分布(注意变换的 Jacobian)。
  • 独立 Metropolis–Hastings(independence-MH):重要性抽样版 MCMC,提议来自固定分布 \(g\)(通常近似 \(f\)),\(r(x,y)=\min\{1,\frac{f(y)}{f(x)}\frac{g(x)}{g(y)}\}\)。
  • Gibbs 抽样:前两法原则上可推广到高维,但实践中难以调到混合良好。Gibbs 把高维问题变为若干一维问题。二元情形 \((X,Y)\sim f_{X,Y}\),假设能从条件分布 \(f_{X|Y}\)、\(f_{Y|X}\) 抽样。从 \((X_0,Y_0)\) 出发,已得 \((X_n,Y_n)\),则
    \[X_{n+1}\sim f_{X|Y}(x|Y_n),\qquad Y_{n+1}\sim f_{Y|X}(y|X_{n+1}),\]
    重复。高维同理逐坐标抽样(总用各变量最新值)。
  • 例 24.11(正态分层模型 hierarchical model):抽 \(k\) 个城市,每城 \(n_i\) 人,\(Y_i\) 人患病,\(Y_i\sim\) Binomial\((n_i,p_i)\);各城患病率不同,视 \(p_i\) 为来自分布 \(F\) 的随机抽样:\(p_1,\dots,p_k\sim F\),\(Y_i|p_i\sim\) Binomial\((n_i,p_i)\)。目标:估计 \(p_i\) 与总体患病率 \(\int p\,dF(p)\)。
    • 为用正态近似做变换:\(\hat p_i=Y_i/n_i\approx N(p_i,s_i)\),\(s_i=\sqrt{\hat p_i(1-\hat p_i)/n_i}\);令 \(\psi_i=\log\frac{p_i}{1-p_i}\),\(Z_i\equiv\hat\psi_i=\log\frac{\hat p_i}{1-\hat p_i}\),delta 方法 \(\hat\psi_i\approx N(\psi_i,\sigma_i^2)\),\(\sigma_i^2=\frac{1}{n\hat p_i(1-\hat p_i)}\)(经验上 logit 尺度正态近似更准)。视 \(\sigma_i\) 已知,\(\psi_i\) 正态。模型:
      \[\psi_i\sim N(\mu,\tau^2),\qquad Z_i|\psi_i\sim N(\psi_i,\sigma_i^2),\]
      简化取 \(\tau=1\)。参数 \(\theta=(\mu,\psi_1,\dots,\psi_k)\),似然
      \[\mathcal L(\theta)\propto\prod_if(\psi_i|\mu)\prod_if(Z_i|\psi_i)\propto\prod_i\exp\Big\{-\frac12(\psi_i-\mu)^2\Big\}\exp\Big\{-\frac1{2\sigma_i^2}(Z_i-\psi_i)^2\Big\}.\]
      先验 \(f(\mu)\propto1\),后验正比于似然。
    • 全条件分布:\(f(\mu|\text{rest})\propto\prod_i\exp\{-\frac12(\psi_i-\mu)^2\}\propto\exp\{-\frac k2(\mu-b)^2\}\),\(b=\frac1k\sum_i\psi_i\),故 \(\mu|\text{rest}\sim N(b,1/k)\)。\(f(\psi_i|\text{rest})\propto\exp\{-\frac12(\psi_i-\mu)^2\}\exp\{-\frac1{2\sigma_i^2}(Z_i-\psi_i)^2\}\propto\exp\{-\frac1{2d_i^2}(\psi_i-e_i)^2\}\),
      \[e_i=\frac{\frac{Z_i}{\sigma_i^2}+\mu}{1+\frac1{\sigma_i^2}},\qquad d_i^2=\frac{1}{1+\frac1{\sigma_i^2}},\]
      故 \(\psi_i|\text{rest}\sim N(e_i,d_i^2)\)(精度加权平均)。
    • Gibbs:迭代 \(N\) 次:抽 \(\mu\sim N(b,1/k)\);抽 \(\psi_1\sim N(e_1,d_1^2)\);…;抽 \(\psi_k\sim N(e_k,d_k^2)\)(每步用最新值)。
    • 数值例:\(k=20\) 城,每城 20 人。运行后用 \(p_i=e^{\psi_i}/(1+e^{\psi_i})\) 转回。图 24.3 为 \(p_1\) 与 \(\mu\) 的轨迹图(trace plots);图 24.4 为 \(\mu\) 后验直方图以及原始比例与 Bayes 估计——Bayes 估计被"收缩(shrunk)"到一起。\(\tau\) 控制收缩程度;此处固定 \(\tau=1\),实践中应把 \(\tau\) 当未知参数由数据决定。
  • Metropolis-within-Gibbs:不会从条件分布抽样时,每个坐标用一步 MH。\(q\)、\(\tilde q\) 分别为 \(x\)、\(y\) 的提议分布:
    • (1a) 抽 \(Z\sim q(z|X_n)\);(1b) \(r=\min\Big\{\frac{f(Z,Y_n)}{f(X_n,Y_n)}\frac{q(X_n|Z)}{q(Z|X_n)},1\Big\}\);(1c) 以概率 \(r\) 令 \(X_{n+1}=Z\),否则 \(X_{n+1}=X_n\)。
    • (2a) 抽 \(Z\sim\tilde q(z|Y_n)\);(2b) \(r=\min\Big\{\frac{f(X_{n+1},Z)}{f(X_{n+1},Y_n)}\frac{\tilde q(Y_n|Z)}{\tilde q(Z|Y_n)},1\Big\}\);(2c) 以概率 \(r\) 令 \(Y_{n+1}=Z\),否则 \(Y_{n+1}=Y_n\)。
    • 对 \(X\) 做 MH 步时 \(Y\) 固定,反之亦然;可推广到高维。

24.6 文献评注(PDF p.422)

MCMC 起源于二战原子弹研制,之后用于空间统计等,1990 年代掀起新热潮并持续。主要参考 Robert & Casella (1999),另见 Gelman et al. (1995)、Gilks et al. (1998)。

24.7 习题概括(PDF p.422–424)

  1. \(I=\int_1^2\frac{e^{-x^2/2}}{\sqrt{2\pi}}dx\):(a) 基本 MC(\(N=100{,}000\))与估计标准误;(b) 解析标准误并比较;(c) 用 \(g=N(1.5,v^2)\),\(v=0.1,1,10\) 做重要性抽样,计算真实标准误并画被平均值的直方图看极端值;(d) 求最优 \(g^*\) 及其标准误(为 0,因 \(h\ge0\))。
  2. 用重要性抽样估计边际密度:\((X_i,Y_i)\sim f_{X,Y}\),\(w\) 为任意密度,\(\hat f_X(x)=\frac1N\sum_i\frac{f_{X,Y}(x,Y_i)w(X_i)}{f_{X,Y}(X_i,Y_i)}\),(a) 证明 \(\hat f_X(x)\xrightarrow{P}f_X(x)\) 并求方差;(b) \(Y\sim N(0,1)\)、\(X|Y=y\sim N(y,1+y^2)\) 时估计 \(f_X\)。
  3. 接受–拒绝抽样(accept-reject sampling):若 \(f(x)\le Mg(x)\),步骤:抽 \(X\sim g\)、\(U\sim\) Unif(0,1);若 \(U\le f(X)/(Mg(X))\) 令 \(Y=X\),否则重来。(a) 证明 \(Y\sim f\);(b) 用 Cauchy 提议抽 1000 个标准正态并画直方图。
  4. 逆高斯分布 \(f(z)\propto z^{-3/2}\exp\{-\theta_1z-\frac{\theta_2}{z}+2\sqrt{\theta_1\theta_2}+\log\sqrt{2\theta_2}\}\),\(\mathbb E(Z)=\sqrt{\theta_2/\theta_1}\),\(\mathbb E(1/Z)=\sqrt{\theta_1/\theta_2}+\frac1{2\theta_2}\)。\(\theta_1=1.5,\theta_2=2\):(a) 用 Gamma 提议的独立 MH 抽 1000 个,比较样本与理论均值;(b) 令 \(W=\log Z\),求其密度,用随机游走 MH 抽样再取指数。
  5. 心脏病数据的贝叶斯 logistic 回归,平坦先验,用 Gibbs–Metropolis 抽 10,000 个后验样本,画各 \(\beta_j\) 后验直方图,给出后验均值与 95% 后验区间;(b) 与 MLE 频率派分析比较。

第 24 章 本章要点

  • 基本 MC:\(\hat I=\frac1N\sum h(X_i)\),\(X_i\sim f\),标准误 \(s/\sqrt N\),收敛速率与维数无关。
  • 贝叶斯后验的均值、分位数、函数的分布都可由后验样本直接近似(例:两比例之差、LD50)。
  • 重要性抽样:\(\hat I=\frac1N\sum hf/g\);\(g\) 应与 \(|h|f\) 相似且尾部更厚,否则方差可能无穷;最优 \(g^*\propto|h|f\)。
  • MH 算法:接受率 \(\min\{\frac{f(y)q(x|y)}{f(x)q(y|x)},1\}\),只需 \(f\) 的比例形式;细致平衡保证 \(f\) 平稳;提议尺度决定混合效率(接受率约 50% 的经验法则)。
  • 变体:随机游走 MH、独立 MH、Gibbs(逐坐标从全条件分布抽样)、Metropolis-within-Gibbs;分层模型的 Gibbs 抽样产生收缩估计。

第 24 章 与量化交易的关联

  • 衍生品定价:Monte Carlo 积分是路径依赖期权(亚式、障碍、篮子期权)定价的标准方法;标准误 \(s/\sqrt N\) 用于确定所需路径数;重要性抽样用于深度虚值期权和尾部风险(如例 24.6 的 \(\mathbb P(Z>3)\) 即 VaR/ES 尾部估计的原型,均值平移的指数倾斜是标准做法)。
  • 风险管理:蒙特卡洛 VaR/ES、信用组合损失分布(稀有事件需重要性抽样)、压力测试情景模拟。
  • 贝叶斯量化模型:MCMC 用于随机波动率模型、贝叶斯 VAR、贝叶斯收缩的期望收益估计(Black–Litterman 的贝叶斯视角);例 24.11 的分层收缩正是"把各资产/基金经理的 alpha 估计向总体均值收缩"的方法,可降低噪声驱动的过度配置。
  • 参数不确定性:用后验样本而非点估计做组合优化(贝叶斯组合选择),把参数估计误差纳入决策。
  • 实现层面:MCMC 诊断(轨迹图、接受率、混合)、随机数质量、并行化与方差缩减(对偶变量、控制变量——本书未展开)是系统实现要点。

第 24 章 推荐习题

  • 习题 1:基本 MC 与重要性抽样的标准误比较及最优 \(g^*\)。
  • 习题 3:接受–拒绝抽样的正确性证明与实现。
  • 习题 4:独立 MH 与带变换的随机游走 MH。
  • 习题 5:贝叶斯 logistic 回归的 Metropolis-within-Gibbs 全流程。

书末部分:参考文献、符号表、分布表、索引(PDF p.425–446)

参考文献(Bibliography)(PDF p.425–432)

按作者字母排列的全书参考文献,约 120 条。与本块章节相关的主要有:Agresti (1990) 分类数据;Akaike (1973) AIC;Schwarz (1978) BIC;Zheng & Loh (1995) 相合变量选择;Weisberg (1985) 线性回归;Hastie, Tibshirani & Friedman (2001)《统计学习基础》;Johnson & Wichern (1982)、Anderson (1984) 多元分析;Fisher (1921) 相关系数 z 变换;Pearl (2000)、Rosenbaum (2002)、Spirtes et al. (2000)、van der Laan & Robins (2003) 因果推断;Wright (1934) 路径系数;Whittaker (1990)、Lauritzen (1996)、Edwards (1995)、Jordan (2004) 图模型;Bishop, Fienberg & Holland (1975) 离散多元分析;Scott (1992)、Silverman (1986) 密度估计;Härdle (1990)、Loader (1999) 非参数回归;Chaudhuri & Marron (1999) SiZer;Marron & Wand (1992);Efromovich (1999)、Beran (2000) 正交级数;Ogden (1997)、Härdle et al. (1998)、Donoho & Johnstone (1994/1995/1998) 小波;Devroye, Györfi & Lugosi (1996)、Vapnik (1998)、Schölkopf & Smola (2002)、Herbrich (2002) 分类与核方法;Friedman (1997) 分类偏差–方差;Grimmett & Stirzaker (1982)、Taylor & Karlin (1994)、Guttorp (1995)、Ross (2002) 随机过程;Robert & Casella (1999)、Gelman et al. (1995)、Gilks et al. (1998) MCMC;以及前半书引用的 Efron (1979)、Efron & Tibshirani (1993) bootstrap、Benjamini & Hochberg (1995) FDR、Casella & Berger (2002)、van der Vaart (1998) 等。

符号表(List of Symbols)(PDF p.433–434)

  • 一般符号:\(\mathbb R\) 实数;\(\inf_{x\in A}f(x)\) 下确界(可视为最小值);\(\sup_{x\in A}f(x)\) 上确界;\(n!\);\(\binom nk=\frac{n!}{k!(n-k)!}\);\(\Gamma(\alpha)=\int_0^\infty y^{\alpha-1}e^{-y}dy\);\(\Omega\) 样本空间,\(\omega\) 结果,\(A\) 事件,\(I_A(\omega)\) 示性函数,\(|A|\) 集合元素数。
  • 概率符号:\(\mathbb P(A)\);\(A\amalg B\) 独立;\(F_X(x)=\mathbb P(X\le x)\);\(f_X\) 密度/质量函数;\(X\sim F\)、\(X\sim f\)、\(X\overset{d}{=}Y\);IID;\(X_1,\dots,X_n\sim F\);\(\phi\)、\(\Phi\) 标准正态密度与 CDF;\(z_\alpha=\Phi^{-1}(1-\alpha)\) 上 \(\alpha\) 分位数;\(\mathbb E(X)=\int xdF(x)\);\(\mathbb E(r(X))=\int r(x)dF(x)\);\(\mathbb V(X)\);\(\mathrm{Cov}(X,Y)\)。
  • 收敛符号:\(\xrightarrow{P}\) 依概率收敛;\(\rightsquigarrow\) 依分布收敛;\(\xrightarrow{qm}\) 均方收敛;\(X_n\approx N(\mu,\sigma_n^2)\) 表示 \((X_n-\mu)/\sigma_n\rightsquigarrow N(0,1)\);\(x_n=o(a_n)\) 即 \(x_n/a_n\to0\);\(x_n=O(a_n)\) 即 \(|x_n/a_n|\) 有界;\(X_n=o_P(a_n)\) 即 \(X_n/a_n\xrightarrow{P}0\);\(X_n=O_P(a_n)\) 即依概率有界。
  • 统计模型符号:\(\mathfrak F\) 统计模型;\(\theta\) 参数;\(\hat\theta\) 估计;\(T(F)\) 统计泛函;\(\mathcal L(\theta)\) 似然函数。
  • 常用数学事实:\(e^x=\sum_{k\ge0}x^k/k!\);\(\sum_{j\ge k}r^j=\frac{r^k}{1-r}\)(\(0<r<1\));\(\lim_n(1+a/n)^n=e^a\);Stirling:\(n!\approx n^ne^{-n}\sqrt{2\pi n}\);Gamma 函数:\(\Gamma(\alpha)=(\alpha-1)\Gamma(\alpha-1)\),\(\Gamma(n)=(n-1)!\),\(\Gamma(1)=1\),\(\Gamma(1/2)=\sqrt\pi\)。

分布表(Table of Distributions)(PDF p.435)

分布 概率函数 / 密度 均值 方差 MGF
点质量 \(a\) \(I(x=a)\) \(a\) 0 \(e^{at}\)
Bernoulli\((p)\) \(p^x(1-p)^{1-x}\) \(p\) \(p(1-p)\) \(pe^t+(1-p)\)
Binomial\((n,p)\) \(\binom nxp^x(1-p)^{n-x}\) \(np\) \(np(1-p)\) \((pe^t+1-p)^n\)
Geometric\((p)\) \(p(1-p)^{x-1}I(x\ge1)\) \(1/p\) \((1-p)/p^2\) \(\frac{pe^t}{1-(1-p)e^t}\),\(t<-\log(1-p)\)
Poisson\((\lambda)\) \(\lambda^xe^{-\lambda}/x!\) \(\lambda\) \(\lambda\) \(e^{\lambda(e^t-1)}\)
Uniform\((a,b)\) \(I(a<x<b)/(b-a)\) \(\frac{a+b}2\) \(\frac{(b-a)^2}{12}\) \(\frac{e^{bt}-e^{at}}{(b-a)t}\)
Normal\((\mu,\sigma^2)\) \(\frac1{\sigma\sqrt{2\pi}}e^{-(x-\mu)^2/(2\sigma^2)}\) \(\mu\) \(\sigma^2\) \(\exp\{\mu t+\sigma^2t^2/2\}\)
Exponential\((\beta)\) \(e^{-x/\beta}/\beta\) \(\beta\) \(\beta^2\) \(\frac1{1-\beta t}\),\(t<1/\beta\)
Gamma\((\alpha,\beta)\) \(\frac{x^{\alpha-1}e^{-x/\beta}}{\Gamma(\alpha)\beta^\alpha}\) \(\alpha\beta\) \(\alpha\beta^2\) \((\frac1{1-\beta t})^\alpha\),\(t<1/\beta\)
Beta\((\alpha,\beta)\) \(\frac{\Gamma(\alpha+\beta)}{\Gamma(\alpha)\Gamma(\beta)}x^{\alpha-1}(1-x)^{\beta-1}\) \(\frac\alpha{\alpha+\beta}\) \(\frac{\alpha\beta}{(\alpha+\beta)^2(\alpha+\beta+1)}\) \(1+\sum_{k\ge1}\big(\prod_{r=0}^{k-1}\frac{\alpha+r}{\alpha+\beta+r}\big)\frac{t^k}{k!}\)
\(t_\nu\) \(\frac{\Gamma(\frac{\nu+1}2)}{\sqrt{\nu\pi}\Gamma(\frac\nu2)}\big(1+\frac{x^2}\nu\big)^{-(\nu+1)/2}\) 0(\(\nu>1\)) \(\frac{\nu}{\nu-2}\)(\(\nu>2\)) 不存在
\(\chi^2_p\) \(\frac{1}{\Gamma(p/2)2^{p/2}}x^{(p/2)-1}e^{-x/2}\) \(p\) \(2p\) \((\frac1{1-2t})^{p/2}\),\(t<1/2\)

索引(Index)(PDF p.436–444)

全书英文术语索引(按字母,附页码与定理编号),从 "\(\chi^2\) distribution" 到 "Zheng–Loh method"。可作为编写中文教材时的术语对照来源,例如:accept-reject sampling 421、AIC 220、backfitting 324、bagging/boosting 375、bandwidth 313、Bayes classification rule 351、Chapman–Kolmogorov equations 385、collider 265、confounding variables 257、cross-validation 363、curse of dimensionality 319、d-separated 270、detailed balance 391/413、deviance 299、Gibbs sampling 416、Gini index 361、importance sampling 408、kernelization 371、Markov condition 267、Mercer's theorem 373、Metropolis–Hastings 411、Nadaraya–Watson 319、odds ratio 240、Parseval's relation 329、Poisson process 394–395、Simpson's paradox 259、Stone's theorem 316、support vector machines 368、thresholding 342、Vapnik–Chervonenkis 366、wavelets 340 等。

出版社广告页(PDF p.445–446)

Springer Texts in Statistics 系列书目续表(含 Ruppert《Statistics and Finance》、Shumway & Stoffer《Time Series Analysis and Its Applications》等),以及 Springer 其它统计书广告(Atkinson 等《Exploring Multivariate Data with the Forward Search》、Santner 等《The Design and Analysis of Computer Experiments》、Simon 等《Design and Analysis of DNA Microarray Investigations》)。与教材内容无关。