量化交易中文教材

第 13a 章 线性回归与最小二乘推断

本章对应 Wasserman 原书第 13 章前半(13.1–13.5 节)。原书第 13 章内容较多,本册拆成两章:本章讲线性回归模型本身——最小二乘估计、它与最大似然的关系、系数的标准误与 Wald 检验、预测区间、多元回归的矩阵形式;第 13b 章讲本书最有特色的部分——模型选择(\(C_p\)、AIC、BIC、交叉验证)与 logistic 回归。

线性回归在第 05 册(计量经济学)中会从另一个角度系统展开:那里重点是 OLS 的因果解释、遗漏变量偏差、异方差稳健推断、工具变量与面板数据。本章不重复这些内容,只建立统计推断的骨架:回归函数是什么、最小二乘为什么合理、标准误从哪里来、"预测一个新观测"和"估计一个条件均值"为什么是两件事。读完本章再读第 05 册会顺很多。

学习目标

  1. 理解回归函数 \(r(x)=\mathbb E(Y\mid X=x)\) 的含义,能写出简单线性回归与多元线性回归模型。
  2. 会推导简单线性回归的最小二乘估计,会写出多元情形的矩阵解 \(\hat\beta=(X^TX)^{-1}X^TY\),知道 \(\sigma^2\) 的无偏估计为什么除以 \(n-k\)。
  3. 理解"正态误差下最小二乘就是最大似然",并知道最小二乘本身并不需要正态假设。
  4. 会用 \(\sigma^2(X^TX)^{-1}\) 计算系数标准误,构造置信区间与 Wald 检验,并能读懂一张标准的回归输出表。
  5. 能区分条件均值的置信区间与新观测的预测区间,会计算预测区间,理解原书 Palm Beach 县的例子。
  6. 知道教科书标准误的适用前提(同方差、独立),以及在金融数据中它通常需要被替换为稳健标准误。

读前导读

这一章在解决什么问题

回归你在 CFA 一级和二级都做过:会读回归输出表,会算 t 值,知道 \(R^2\),知道多重共线性和异方差的名字。CFA 教的是"怎么用、怎么读";这一章讲的是"为什么是这些公式":斜率公式从哪里来,标准误为什么长这个样子,为什么预测新观测的区间比估计均值的区间宽得多,以及哪个假设一旦被打破,输出表里的 t 值就不可信。

最直接的联系是 CAPM 贝塔。\(\beta=\text{Cov}(r_i,r_m)/\mathbb V(r_m)\) 就是简单回归的斜率;本章告诉你这个贝塔估计的误差有多大、取决于什么(样本长度、市场波动、残差波动),以及多因子模型 \(r=\alpha+\beta_1F_1+\beta_2F_2+\epsilon\) 的系数为什么要写成矩阵形式 \((X^TX)^{-1}X^TY\)。章末的量化实战把这些放在一只股票的因子贝塔估计上演示,并说明异方差下教科书标准误为什么偏小。

需要先想起来的数学

1. 偏导数与"令导数为 0"。 多个变量的函数,对其中一个求导时把其他变量当常数,叫偏导数,记作 \(\partial Q/\partial\beta_0\)。最小值点上所有偏导都为 0。例:\(Q(a,b)=(a-1)^2+(b-2)^2\),\(\partial Q/\partial a=2(a-1)=0\) 得 \(a=1\),同理 \(b=2\)。参见 第 00 册第 05 章 多元微积分与优化。

2. 求和记号的几个小技巧。 \(\sum_i(X_i-\bar X)=0\)(离差之和为 0);因此 \(\sum_i c(X_i-\bar X)=0\) 对任何常数 \(c\) 成立;\(\sum(X_i-\bar X)(Y_i-\bar Y)=\sum X_i(Y_i-\bar Y)\)。例:\(X=(1,2,3)\),离差 \((-1,0,1)\) 之和为 0。正规方程的推导全靠这几条。参见 第 00 册第 07 章 概率中的分析工具。

3. 矩阵乘法、转置与逆。 \(X\) 是 \(n\times k\) 矩阵(\(n\) 行观测、\(k\) 列变量),\(X^T\) 是把行列互换。\(X^TX\) 是 \(k\times k\) 方阵,其 \((j,l)\) 元素是 \(\sum_iX_{ij}X_{il}\),即"第 \(j\) 列与第 \(l\) 列的内积"。逆矩阵 \(A^{-1}\) 满足 \(A^{-1}A=I\),相当于矩阵版的"除以 \(A\)"。不可逆就像除以 0。参见 第 00 册第 06 章 线性代数速成。

4. 线性变换的方差。 一维:\(\mathbb V(aZ)=a^2\mathbb V(Z)\)。多维:\(\mathbb V(AZ)=A\,\mathbb V(Z)A^T\)。你在 CFA 里算组合方差 \(w^T\Sigma w\) 用的就是它(\(A=w^T\) 是一行权重)。

5. 渐近正态与 \(\rightsquigarrow\)。 \(\xrightarrow{P}\) 表示"依概率收敛"(样本越大,估计越接近真值),\(\rightsquigarrow\) 表示"依分布收敛"(标准化后的分布越来越像正态)。读的时候把后者理解为"大样本下可以当正态处理"即可。参见第 05 章。

怎么读这一章

核心必读:13a.2(最小二乘与正规方程)、13a.4(标准误公式及其含义)、13a.5(预测区间)、13a.6(矩阵形式)、13a.7(标准误的前提)。13a.3 只需记住两句结论:正态误差下 OLS = MLE;OLS 本身不需要正态。例 13.6 和例 13.14 的教学要点比数字重要。13a.8 的实战建议对照代码输出逐条读"读法",这是本章与实际工作连接最紧的部分。


13a.1 回归函数:我们到底在估计什么

回归(regression)研究响应变量(response variable)\(Y\) 与协变量(covariate)\(X\) 之间的关系。协变量也叫预测变量(predictor)或特征(feature)。在量化语境里,\(Y\) 可以是股票下期收益,\(X\) 可以是市场收益、估值、动量等因子暴露。回归函数 \(r(x)=\mathbb E(Y\mid X=x)\) 已在第 06 章 6.2.4 节作为推断对象出现过,本章把它落到线性模型上。

"回归"一词来自 Francis Galton:他发现高个子父亲的儿子平均来说没那么高,矮个子父亲的儿子平均来说没那么矮,身高"向均值回归"。这个名字流传了下来,虽然今天的回归分析与"回归均值"已经关系不大。

概括 \(X\) 与 \(Y\) 关系的核心对象是回归函数(regression function):

\[r(x)=\mathbb E(Y\mid X=x)=\int y\,f(y\mid x)\,dy.\tag{13.1}\]
它回答的问题是:在 \(X=x\) 的条件下,\(Y\) 平均是多少。我们的任务是根据样本 \((X_1,Y_1),\dots,(X_n,Y_n)\sim F_{X,Y}\) 去估计 \(r(x)\)。

估计 \(r\) 有两条路。参数方法假设 \(r\) 属于某个有限维的函数族,最常见的是线性族 \(r(x)=\beta_0+\beta_1x\),然后估计参数——这是本章和下一章的内容。非参数方法不假设 \(r\) 的形状,用核平滑、样条、正交函数展开等方法直接估计——原书第 20、21 章(本册后续章节)讲。参数方法的好处是估计精度高、结果好解释;代价是模型可能是错的。理解这一取舍,是理解第 13b 章模型选择的前提。

一个容易忽略的事实:回归函数只描述关联,不描述因果。\(r(x)\) 告诉你"观察到 \(X=x\) 的那些个体,\(Y\) 平均是多少",不告诉你"如果把 \(X\) 改成 \(x\),\(Y\) 会变成多少"。后者需要第 16 章的因果框架。原书在本章的两个数据例子里反复提醒这一点,我们也会在适当位置提醒。


13a.2 简单线性回归与最小二乘

模型

最简单的情形是 \(X\) 一维、\(r(x)\) 为直线,并进一步假设误差的条件方差不随 \(x\) 变化(同方差,homoscedasticity)。

定义 13.1(简单线性回归模型,simple linear regression model)

\[Y_i=\beta_0+\beta_1X_i+\epsilon_i,\qquad\mathbb E(\epsilon_i\mid X_i)=0,\qquad\mathbb V(\epsilon_i\mid X_i)=\sigma^2.\tag{13.2}\]

未知参数有三个:截距 \(\beta_0\)、斜率 \(\beta_1\)、误差方差 \(\sigma^2\)。注意 \(\mathbb E(\epsilon_i\mid X_i)=0\) 是关键假设:它保证 \(\beta_0+\beta_1x\) 确实是条件均值 \(r(x)\)。

给定估计 \(\hat\beta_0,\hat\beta_1\),得到拟合直线

\[\hat r(x)=\hat\beta_0+\hat\beta_1x,\tag{13.3}\]
拟合值(fitted values)\(\hat Y_i=\hat r(X_i)\),以及残差(residuals)
\[\hat\epsilon_i=Y_i-\hat Y_i=Y_i-(\hat\beta_0+\hat\beta_1X_i).\tag{13.4}\]
残差平方和(residual sum of squares, RSS)\(\text{RSS}=\sum_{i=1}^n\hat\epsilon_i^2\) 衡量直线对数据的拟合程度。

最小二乘估计

定义 13.3。 最小二乘估计(least squares estimates)是使 RSS 最小的 \(\hat\beta_0,\hat\beta_1\)。

定理 13.4。 最小二乘估计为

\[\hat\beta_1=\frac{\sum_{i=1}^n(X_i-\bar X_n)(Y_i-\bar Y_n)}{\sum_{i=1}^n(X_i-\bar X_n)^2},\tag{13.5}\]
\[\hat\beta_0=\bar Y_n-\hat\beta_1\bar X_n.\tag{13.6}\]
\(\sigma^2\) 的无偏估计为
\[\hat\sigma^2=\frac{1}{n-2}\sum_{i=1}^n\hat\epsilon_i^2.\tag{13.7}\]

推导思路。 记 \(Q(\beta_0,\beta_1)=\sum(Y_i-\beta_0-\beta_1X_i)^2\)。对 \(\beta_0\) 求偏导并令其为零:\(\sum(Y_i-\beta_0-\beta_1X_i)=0\),得 \(\beta_0=\bar Y-\beta_1\bar X\),即拟合直线必过点 \((\bar X,\bar Y)\)。对 \(\beta_1\) 求偏导:\(\sum X_i(Y_i-\beta_0-\beta_1X_i)=0\)。把 \(\beta_0\) 代入,整理得

\[\beta_1\sum X_i(X_i-\bar X)=\sum X_i(Y_i-\bar Y),\]
再利用 \(\sum\bar X(X_i-\bar X)=0\)、\(\sum\bar X(Y_i-\bar Y)=0\) 把左右两边都"中心化",即得 (13.5)。这两个一阶条件称为正规方程(normal equations)。

推导拆解:

  1. 对 \(\beta_0\) 求偏导:\(Q\) 的每一项是 \((Y_i-\beta_0-\beta_1X_i)^2\),用链式法则,外层平方求导得 \(2(\cdot)\),内层对 \(\beta_0\) 求导得 \(-1\)。合起来 \(-2\sum(Y_i-\beta_0-\beta_1X_i)=0\)。两边除以 \(-2n\):\(\bar Y-\beta_0-\beta_1\bar X=0\)。
  2. 对 \(\beta_1\) 求偏导:内层对 \(\beta_1\) 求导得 \(-X_i\),所以 \(-2\sum X_i(Y_i-\beta_0-\beta_1X_i)=0\)。
  3. 把 \(\beta_0=\bar Y-\beta_1\bar X\) 代入第 2 步:\(\sum X_i(Y_i-\bar Y-\beta_1(X_i-\bar X))=0\),移项得 \(\beta_1\sum X_i(X_i-\bar X)=\sum X_i(Y_i-\bar Y)\)。
  4. "中心化":在左边减去 \(\sum\bar X(X_i-\bar X)\)(它等于 0),左边变成 \(\sum(X_i-\bar X)^2\);右边同理减去 \(\sum\bar X(Y_i-\bar Y)=0\),变成 \(\sum(X_i-\bar X)(Y_i-\bar Y)\)。两边相除得 (13.5)。
  5. 第 1 步的副产品:残差之和 \(\sum\hat\epsilon_i=0\);第 2 步的副产品:\(\sum X_i\hat\epsilon_i=0\),即残差与协变量不相关。这两条就是下文说的"两个线性约束"。

两个直觉值得记住。第一,(13.5) 可写成 \(\hat\beta_1=\widehat{\text{Cov}}(X,Y)/\widehat{\mathbb V}(X)\),斜率就是"样本协方差除以样本方差"。在金融里这正是 CAPM 贝塔的定义:\(\beta=\text{Cov}(r_i,r_m)/\mathbb V(r_m)\)。第二,(13.7) 除以 \(n-2\) 而不是 \(n\),是因为估计 \(\beta_0,\beta_1\) 用掉了两个自由度:残差满足两个线性约束(正规方程),只有 \(n-2\) 个"自由"的残差。

白话解释:为什么丢了自由度就要把分母变小?拟合直线是"照着这批数据量身定做的",残差天然比真实误差 \(\epsilon_i\) 小一些(最小二乘本来就在让残差平方和尽量小)。直接除以 \(n\) 会系统性低估 \(\sigma^2\)。可以证明 \(\mathbb E[\text{RSS}]=(n-2)\sigma^2\),所以除以 \(n-2\) 恰好纠正。你熟悉的样本方差除以 \(n-1\) 是同一道理:那里只估计了一个均值,用掉一个自由度。例:\(n=5\) 时,除以 3 而不是 5,差别 67%;\(n=250\) 时,除以 248 还是 250 几乎没差别。

例 13.5(恒星数据)。 原书图 13.1 为附近恒星的对数表面温度 \(Y\) 对对数光强 \(X\) 的散点图,最小二乘拟合为 \(\hat r(x)=3.58+0.166x\)。

例 13.6(2000 年美国大选佛罗里达县级数据)。 原书图 13.2 画出了各县 Buchanan 得票数 \(Y\) 对 Bush 得票数 \(X\)。剔除 Palm Beach 县后,最小二乘给出

\[\text{Buchanan}=66.0991+0.0035\,\text{Bush},\]
\(\widehat{\text{se}}(\hat\beta_0)=17.2926\),\(\widehat{\text{se}}(\hat\beta_1)=0.0002\)。但残差图呈扇形:Bush 票数越大,残差散得越开——同方差假设明显不成立。对两个变量取对数后重做:
\[\log(\text{Buchanan})=-2.3298+0.7303\,\log(\text{Bush}),\]
\(\widehat{\text{se}}(\hat\beta_0)=0.3529\),\(\widehat{\text{se}}(\hat\beta_1)=0.0358\),残差图"健康得多"。

这个例子的教学要点是:回归之前先画图,必要时做变换。对数变换能稳定方差、把乘法关系变成加法关系。金融里我们用对数收益、对数成交量、对数市值,道理完全相同——市值从 1 亿到 1 万亿跨四个数量级,不取对数的回归几乎必然被少数大市值股票主导。


13a.3 最小二乘与最大似然

最小二乘是一个"几何"准则(让残差平方和最小),它和第 09 章的最大似然有什么关系?答案是:在正态误差假设下,二者完全一致。

假设 \(\epsilon_i\mid X_i\sim N(0,\sigma^2)\),即 \(Y_i\mid X_i\sim N(\mu_i,\sigma^2)\),\(\mu_i=\beta_0+\beta_1X_i\)。全部数据的似然可以分解为

\[\prod_{i=1}^nf(X_i,Y_i)=\underbrace{\prod_{i=1}^nf_X(X_i)}_{\mathcal L_1}\times\underbrace{\prod_{i=1}^nf_{Y\mid X}(Y_i\mid X_i)}_{\mathcal L_2}.\]
\(\mathcal L_1\) 是协变量自身的分布,与 \((\beta_0,\beta_1,\sigma)\) 无关,因此只需关注条件似然(conditional likelihood)\(\mathcal L_2\):
\[\mathcal L_2\propto\sigma^{-n}\exp\Big\{-\frac1{2\sigma^2}\sum_i(Y_i-\mu_i)^2\Big\},\]
\[\ell(\beta_0,\beta_1,\sigma)=-n\log\sigma-\frac1{2\sigma^2}\sum_{i=1}^n\big(Y_i-(\beta_0+\beta_1X_i)\big)^2.\tag{13.9}\]

推导拆解:

  1. 为什么能把 \(\mathcal L_1\) 丢掉:似然是参数的函数,乘上一个不含参数的因子,最大值点的位置不变。就像给所有候选组合的收益都加同一个常数,最优组合不变。
  2. 单个观测的正态密度是 \(\frac1{\sqrt{2\pi}\sigma}\exp\{-(Y_i-\mu_i)^2/(2\sigma^2)\}\),\(n\) 个相乘,系数变成 \((2\pi)^{-n/2}\sigma^{-n}\),指数里的平方项相加。丢掉常数 \((2\pi)^{-n/2}\) 得 \(\mathcal L_2\)。
  3. 取对数:\(\log\sigma^{-n}=-n\log\sigma\),\(\log\exp\{\cdot\}=\{\cdot\}\),得 (13.9)。
  4. 在 (13.9) 中,\(\beta\) 只出现在 \(-\frac1{2\sigma^2}\sum(\cdot)^2\) 里,系数是负数,所以让它最大就是让平方和最小。

对 \((\beta_0,\beta_1)\) 最大化 \(\ell\) 等价于最小化平方和,于是:

定理 13.7。 在正态误差假设下,最小二乘估计就是最大似然估计。

再对 \(\sigma\) 求导,得 \(\hat\sigma^2_{\text{MLE}}=\frac1n\sum\hat\epsilon_i^2\)(13.10),它和无偏估计 (13.7) 只差分母 \(n\) 与 \(n-2\)。样本量大时差别可以忽略,实务中通常用无偏版本。

需要澄清一个常见误区:最小二乘本身不需要正态假设。最小二乘估计的无偏性、方差公式只要求 \(\mathbb E(\epsilon\mid X)=0\) 和同方差;正态假设只是额外给了它"最大似然"的身份,以及精确的小样本分布(\(t\) 分布、\(F\) 分布)。对金融收益这种厚尾数据,这一点很重要:最小二乘依然可用,但它不再是最有效的估计,而且会被极端值强烈拉动(平方损失对大残差惩罚很重)。若采用第 09 章的思路,把误差设为 \(t\) 分布再做最大似然,就得到一种对极端值更稳健的回归。


13a.4 最小二乘估计的性质:标准误、置信区间与检验

回归中习惯以协变量 \(X^n=(X_1,\dots,X_n)\) 为条件来陈述均值与方差,即把 \(X_i\) 视为固定常数。这样做的好处是不需要对 \(X\) 的分布做任何假设。

定理 13.8。 记 \(\hat\beta=(\hat\beta_0,\hat\beta_1)^T\),\(s_X^2=n^{-1}\sum_i(X_i-\bar X_n)^2\),则

\[\mathbb E(\hat\beta\mid X^n)=\begin{pmatrix}\beta_0\\\beta_1\end{pmatrix},\qquad \mathbb V(\hat\beta\mid X^n)=\frac{\sigma^2}{ns_X^2}\begin{pmatrix}\frac1n\sum_iX_i^2&-\bar X_n\\-\bar X_n&1\end{pmatrix}.\tag{13.11}\]

证明要点。 把 \(\hat\beta_1\) 写成 \(Y_i\) 的线性组合:\(\hat\beta_1=\sum_iw_iY_i\),\(w_i=(X_i-\bar X)/\sum_j(X_j-\bar X)^2\)。由于 \(\sum w_i=0\)、\(\sum w_iX_i=1\),代入 \(Y_i=\beta_0+\beta_1X_i+\epsilon_i\) 得 \(\hat\beta_1=\beta_1+\sum w_i\epsilon_i\),故无偏,且 \(\mathbb V(\hat\beta_1\mid X^n)=\sigma^2\sum w_i^2=\sigma^2/\sum(X_i-\bar X)^2=\sigma^2/(ns_X^2)\)。\(\hat\beta_0\) 的方差与协方差同理。

推导拆解:

  1. 为什么 \(\hat\beta_1=\sum w_iY_i\):(13.5) 分子 \(\sum(X_i-\bar X)(Y_i-\bar Y)=\sum(X_i-\bar X)Y_i\)(因为 \(\bar Y\sum(X_i-\bar X)=0\)),除以分母即得。以 \(X\) 为条件时 \(w_i\) 是常数,所以斜率是 \(Y\) 的加权和。
  2. \(\sum w_i=0\):分子是离差之和,为 0。\(\sum w_iX_i=1\):分子 \(\sum(X_i-\bar X)X_i=\sum(X_i-\bar X)^2\),正好等于分母。
  3. 代入:\(\sum w_i(\beta_0+\beta_1X_i+\epsilon_i)=\beta_0\cdot0+\beta_1\cdot1+\sum w_i\epsilon_i\)。取条件期望,\(\mathbb E(\epsilon_i\mid X)=0\),得无偏。
  4. 方差:\(\epsilon_i\) 互不相关且方差都是 \(\sigma^2\),所以 \(\mathbb V(\sum w_i\epsilon_i)=\sigma^2\sum w_i^2\),而 \(\sum w_i^2=\sum(X_i-\bar X)^2/[\sum(X_i-\bar X)^2]^2=1/\sum(X_i-\bar X)^2\)。 这和"等权组合 vs 集中组合"的方差计算一模一样:权重 \(w_i\) 越平均、数量越多,\(\sum w_i^2\) 越小。

把对角元开方、用 \(\hat\sigma\) 代替 \(\sigma\),得到估计标准误:

\[\widehat{\text{se}}(\hat\beta_0)=\frac{\hat\sigma}{s_X\sqrt n}\sqrt{\frac{\sum_iX_i^2}{n}},\qquad\widehat{\text{se}}(\hat\beta_1)=\frac{\hat\sigma}{s_X\sqrt n}.\tag{13.12–13.13}\]

\(\widehat{\text{se}}(\hat\beta_1)=\hat\sigma/(s_X\sqrt n)\) 这个公式值得细读,它告诉你斜率估计精度由三件事决定:噪声 \(\hat\sigma\) 越小越好;样本量 \(n\) 越大越好;协变量的离散程度 \(s_X\) 越大越好。最后一点有很直接的量化含义:用平静市场期的数据估计股票贝塔,市场收益的波动小(\(s_X\) 小),贝塔就估得不准;包含大涨大跌的样本反而能把贝塔"钉住"。

定理 13.9。 在适当条件下:

  1. 相合性:\(\hat\beta_0\xrightarrow{P}\beta_0\),\(\hat\beta_1\xrightarrow{P}\beta_1\);
  2. 渐近正态:\((\hat\beta_j-\beta_j)/\widehat{\text{se}}(\hat\beta_j)\rightsquigarrow N(0,1)\);
  3. 近似 \(1-\alpha\) 置信区间:\(\hat\beta_j\pm z_{\alpha/2}\,\widehat{\text{se}}(\hat\beta_j)\);(13.14)
  4. 检验 \(H_0:\beta_1=0\) 对 \(H_1:\beta_1\neq0\) 的 Wald 检验:当 \(|W|>z_{\alpha/2}\) 时拒绝,\(W=\hat\beta_1/\widehat{\text{se}}(\hat\beta_1)\)。

这里的 Wald 检验就是第 10a 章 Wald 检验 \(W=(\hat\theta-\theta_0)/\widehat{\text{se}}(\hat\theta)\) 的直接应用。回归软件输出表里的 "t value" 就是这个 \(W\)。

例 13.10(选举数据,对数尺度)。 斜率的 95% 置信区间为 \(0.7303\pm2(0.0358)=(0.66,0.80)\)。检验斜率为零:\(|W|=0.7303/0.0358=20.40\),p 值 \(\mathbb P(|Z|>20.40)\approx0\),强烈表明斜率不为零。


13a.5 预测:置信区间与预测区间

拟合好 \(\hat r(x)\) 之后,常见任务是对一个新个体(协变量 \(X=x_*\))预测其结果 \(Y_*\)。点预测自然是

\[\hat Y_*=\hat\beta_0+\hat\beta_1x_*.\tag{13.15}\]
其方差由定理 13.8 得到:
\[\mathbb V(\hat Y_*)=\mathbb V(\hat\beta_0)+x_*^2\mathbb V(\hat\beta_1)+2x_*\text{Cov}(\hat\beta_0,\hat\beta_1).\]

关键问题在于:\(Y_*\) 的区间不是 \(\hat Y_*\pm z_{\alpha/2}\widehat{\text{se}}(\hat Y_*)\)。\(\widehat{\text{se}}(\hat Y_*)\) 只度量"直线估得准不准",而 \(Y_*=\beta_0+\beta_1x_*+\epsilon\) 自己还带着一份新的噪声 \(\epsilon\),这份噪声与样本无关,样本再大也消除不了。

定理 13.11(预测区间,prediction interval)。 令

\[\hat\xi_n^2=\hat\sigma^2\left(\frac{\sum_{i=1}^n(X_i-x_*)^2}{n\sum_i(X_i-\bar X)^2}+1\right),\tag{13.16}\]
则 \(Y_*\) 的近似 \(1-\alpha\) 预测区间为
\[\hat Y_*\pm z_{\alpha/2}\,\hat\xi_n.\tag{13.17}\]

把括号里第一项展开会更清楚:由 \(\sum(X_i-x_*)^2=\sum(X_i-\bar X)^2+n(\bar X-x_*)^2\),

\[\hat\xi_n^2=\underbrace{\hat\sigma^2\Big(\frac1n+\frac{(x_*-\bar X)^2}{\sum(X_i-\bar X)^2}\Big)}_{\widehat{\mathbb V}(\hat Y_*)\text{:参数估计误差}}+\underbrace{\hat\sigma^2}_{\text{新观测噪声}}.\]
由此可读出两条规律:预测点 \(x_*\) 离样本中心 \(\bar X\) 越远,参数误差项越大(外推越远越不准);当 \(n\to\infty\) 时参数误差项趋于零,但预测区间宽度趋于 \(2z_{\alpha/2}\sigma\) 而不会趋于零。原书习题 10 把这一点做成了证明题:若错用 \(\hat Y_*\pm2s\)(\(s=\sqrt{\mathbb V(\hat Y_*)}\)),覆盖概率约为 \(\mathbb P(-2<N(0,1+\sigma^2/s^2)<2)\),远低于 0.95。

例 13.12(Palm Beach 县)。 Palm Beach 县 Bush 得 152,954 票、Buchanan 得 3,467 票,取对数分别为 11.93789 与 8.151045。用剔除该县后的对数模型预测:

\[-2.3298+0.7303\times11.93789=6.388441.\]
计算得 \(\hat\xi_n=0.093775\),近似 95% 预测区间为 \((6.200,6.578)\),远不包含实际值 8.151——实际值距预测值将近 20 个标准误。回到票数尺度,区间为 \((493,717)\),实际却是 3,467 票。Palm Beach 的结果极不寻常,这与当年该县"蝴蝶选票"设计引发的误投争议相吻合。

金融直觉:置信区间与预测区间的区别,相当于"这只股票明天的期望收益"与"这只股票明天的实际收益"。前者只受你估计贝塔的误差影响,数据越多越准;后者还包含当天的特质冲击 \(\epsilon\),这是任何模型都消除不了的。例:贝塔估计误差带来的不确定性是 0.24%,特质波动 1.2%,预测标准差 \(=\sqrt{0.24^2+1.2^2}\approx1.22\%\),几乎全是特质噪声。做风险预算、止损或 VaR 时要用的是预测区间。

这个例子展示了预测区间的一个标准用法:用其余数据建立"正常"模型,再看某个观测是否落在预测区间之外——这就是基于回归的异常检测。


13a.6 多元回归

模型与矩阵形式

现在协变量是 \(k\) 维的:\(X_i=(X_{i1},\dots,X_{ik})\)。模型为

\[Y_i=\sum_{j=1}^k\beta_jX_{ij}+\epsilon_i,\qquad\mathbb E(\epsilon_i\mid X_{i1},\dots,X_{ik})=0.\tag{13.18}\]
需要截距时令 \(X_{i1}\equiv1\)。把 \(Y=(Y_1,\dots,Y_n)^T\) 排成列向量,\(X\) 是 \(n\times k\) 的设计矩阵(design matrix,每行一个观测、每列一个协变量),\(\beta=(\beta_1,\dots,\beta_k)^T\),\(\epsilon=(\epsilon_1,\dots,\epsilon_n)^T\),则
\[Y=X\beta+\epsilon.\tag{13.19}\]

定理 13.13。 若 \(k\times k\) 矩阵 \(X^TX\) 可逆,则

\[\hat\beta=(X^TX)^{-1}X^TY,\tag{13.20}\]
\[\mathbb V(\hat\beta\mid X^n)=\sigma^2(X^TX)^{-1},\tag{13.21}\]
\[\hat\beta\approx N\big(\beta,\sigma^2(X^TX)^{-1}\big).\tag{13.22}\]

推导思路。 最小化 \(\|Y-X\beta\|^2\),对 \(\beta\) 求梯度:\(-2X^T(Y-X\beta)=0\),即正规方程 \(X^TX\beta=X^TY\)。方差:\(\hat\beta-\beta=(X^TX)^{-1}X^T\epsilon\),于是

\[\mathbb V(\hat\beta\mid X)=(X^TX)^{-1}X^T(\sigma^2I)X(X^TX)^{-1}=\sigma^2(X^TX)^{-1}.\]
这一步用到了第 14 章的规则 \(\mathbb V(AZ)=A\,\mathbb V(Z)A^T\),以及误差"同方差且互不相关"即 \(\mathbb V(\epsilon)=\sigma^2I\)。正是这个 \(\sigma^2I\) 假设在金融数据里最容易出问题,见 13a.7 节。

推导拆解:

  1. 展开目标:\(\|Y-X\beta\|^2=(Y-X\beta)^T(Y-X\beta)=Y^TY-2\beta^TX^TY+\beta^TX^TX\beta\)。
  2. 对向量 \(\beta\) 求梯度(把每个 \(\beta_j\) 的偏导排成一列)。两条规则:\(\nabla_\beta(\beta^Ta)=a\),\(\nabla_\beta(\beta^TA\beta)=2A\beta\)(\(A\) 对称时)。它们是一维 \(\frac{d}{db}(ab)=a\)、\(\frac{d}{db}(ab^2)=2ab\) 的矩阵版。得梯度 \(-2X^TY+2X^TX\beta\),令其为 0 即正规方程。
  3. \(\hat\beta-\beta\) 的来历:把 \(Y=X\beta+\epsilon\) 代入 \(\hat\beta=(X^TX)^{-1}X^TY\),得 \((X^TX)^{-1}X^TX\beta+(X^TX)^{-1}X^T\epsilon=\beta+(X^TX)^{-1}X^T\epsilon\)。
  4. 方差:令 \(A=(X^TX)^{-1}X^T\),套 \(\mathbb V(A\epsilon)=A(\sigma^2I)A^T=\sigma^2AA^T\)。\(AA^T=(X^TX)^{-1}X^TX(X^TX)^{-1}=(X^TX)^{-1}\)(\(X^TX\) 对称,其逆的转置等于自身)。
  5. 简单回归是特例:\(X\) 的两列是全 1 列和 \(X_i\) 列,\(X^TX=\begin{pmatrix}n&\sum X_i\\\sum X_i&\sum X_i^2\end{pmatrix}\),求逆就得到 (13.11)。

几何上,\(\hat Y=X\hat\beta=X(X^TX)^{-1}X^TY\) 是 \(Y\) 在 \(X\) 的列空间上的正交投影。投影矩阵 \(U=X(X^TX)^{-1}X^T\) 称为帽子矩阵(hat matrix,"给 \(Y\) 戴上帽子"),下一章交叉验证的捷径公式会用到它。线性代数背景见第 01 册(投影、正定矩阵、条件数)。

白话解释:把 \(n\) 个观测的 \(Y\) 看成 \(n\) 维空间里的一个点。\(X\beta\) 在 \(\beta\) 取遍所有值时,扫出的是由 \(X\) 的各列"张成"的一个平面(列空间)。最小二乘就是在这个平面上找离 \(Y\) 最近的点,也就是从 \(Y\) 向平面作垂线的垂足。垂直意味着残差与平面上每个方向都正交,正是 \(X^T\hat\epsilon=0\)。金融上的对应:把一只基金的收益"投影"到若干因子收益上,投影部分是因子能解释的风格收益,垂直的残差部分就是因子解释不了的选股收益,两者互不相关。

估计的回归函数为 \(\hat r(x)=\sum_j\hat\beta_jx_j\)。\(\sigma^2\) 的无偏估计为

\[\hat\sigma^2=\frac1{n-k}\sum_{i=1}^n\hat\epsilon_i^2,\qquad\hat\epsilon=Y-X\hat\beta.\]
\(\beta_j\) 的近似 \(1-\alpha\) 置信区间为
\[\hat\beta_j\pm z_{\alpha/2}\,\widehat{\text{se}}(\hat\beta_j),\tag{13.23}\]
其中 \(\widehat{\text{se}}^2(\hat\beta_j)\) 是矩阵 \(\hat\sigma^2(X^TX)^{-1}\) 的第 \(j\) 个对角元。

\(X^TX\) 不可逆的情形对应完全共线(某一列是其他列的线性组合);接近不可逆时(高度共线),\((X^TX)^{-1}\) 的对角元很大,系数标准误被放大。因子研究中把高度相关的因子(例如几种不同口径的估值因子)同时放进回归,系数会忽正忽负、标准误很大,原因就在这里。

推导拆解(共线性为什么放大标准误):两个已中心化的协变量、各自样本方差为 1、相关系数为 \(\rho\) 时,\(X^TX=n\begin{pmatrix}1&\rho\\\rho&1\end{pmatrix}\),其逆为 \(\frac1{n(1-\rho^2)}\begin{pmatrix}1&-\rho\\-\rho&1\end{pmatrix}\)。对角元比不相关时大了 \(\frac1{1-\rho^2}\) 倍,这就是 CFA 里见过的方差膨胀因子 VIF。\(\rho=0.95\) 时 VIF \(\approx10.3\),标准误放大约 3.2 倍。直观上,两个因子几乎同涨同跌,数据无法分辨收益该归功于谁,只能确定"两者系数之和"。

例 13.14:犯罪数据

原书用美国 47 个州 1960 年的数据,把犯罪率对 10 个变量做多元回归,结果如下:

变量 \(\hat\beta_j\) \(\widehat{\text{se}}\) \(t\) 值 p 值
截距 −589.39 167.59 −3.51 0.001 **
Age 1.04 0.45 2.33 0.025 *
Southern State 11.29 13.24 0.85 0.399
Education 1.18 0.68 1.70 0.093
Expenditures 0.96 0.25 3.86 0.000 ***
Labor 0.11 0.15 0.69 0.493
Number of Males 0.30 0.22 1.36 0.181
Population 0.09 0.14 0.65 0.518
Unemployment (14–24) −0.68 0.48 −1.40 0.165
Unemployment (25–39) 2.15 0.95 2.26 0.030 *
Wealth −0.08 0.09 −0.91 0.367

"t value" 就是检验 \(H_0:\beta_j=0\) 的 Wald 统计量,星号越多 p 值越小。这张表引出两个问题。第一,要不要剔除一些不显著的变量?这是模型选择问题,第 13b 章用这份数据演示后向逐步回归。第二,能不能做因果解释?Expenditures(警务支出)系数显著为正,显然不能读成"警务支出导致犯罪"——更可能是犯罪多的州投入更多警务。这是第 16 章的主题:回归系数度量的是"在其他变量固定时的关联",不是因果效应。


13a.7 标准误公式的前提:同方差与独立

本章所有标准误都来自 \(\mathbb V(\epsilon\mid X)=\sigma^2I\)。这个假设包含两部分:同方差(每个观测误差方差相同)和不相关(不同观测误差互不相关)。金融数据两条都常常违反:

  • 异方差:股票收益的残差波动在市场剧烈波动时放大,小盘股残差波动大于大盘股。此时 \(\mathbb V(\hat\beta\mid X)=(X^TX)^{-1}X^T\Omega X(X^TX)^{-1}\),其中 \(\Omega=\text{diag}(\sigma_i^2)\)。用残差平方 \(\hat\epsilon_i^2\) 估计 \(\sigma_i^2\) 得到 White 异方差稳健标准误(HC 标准误)——这正是第 09 章 QMLE "三明治"协方差 \(A^{-1}BA^{-1}\) 在回归中的形式。
  • 自相关:重叠收益(如用日频数据算的月度滚动收益)、慢变的因子暴露都会造成误差序列相关,需要 Newey–West(HAC)标准误。
  • 横截面相关:同一天所有股票受共同冲击,横截面回归的误差互相关联;Fama–MacBeth 两步法或按时间聚类的标准误是标准对策。

白话解释(三明治公式):对比两个公式。同方差时 \(\Omega=\sigma^2I\),中间的 \(X^T\Omega X=\sigma^2X^TX\) 与一侧的 \((X^TX)^{-1}\) 抵消,"三明治"塌缩成 \(\sigma^2(X^TX)^{-1}\)。异方差时抵消不了:\(X^T\Omega X=\sum_i\sigma_i^2x_ix_i^T\),每个观测按自己的方差加权。若方差大的观测恰好是 \(|x_i|\) 大的观测(暴跌日),这一项比"平均方差 × \(X^TX\)"更大,经典公式就低估了不确定性。White 的做法是不去建模 \(\sigma_i^2\),直接用每个观测的残差平方 \(\hat\epsilon_i^2\) 代入。单个 \(\hat\epsilon_i^2\) 很不准,但加总之后误差会平均掉。

这些方法的细节在第 05 册(异方差稳健推断)与第 06 册(时间序列)中展开。在本册只需建立一个习惯:看到回归输出里的 t 值,先问它的标准误基于什么假设。下面的实战会看到,在异方差数据上教科书标准误会明显偏小。


13a.8 量化实战:估计因子贝塔、检验与预测区间

场景。 用一年日频数据(\(n=250\))估计一只股票对市场因子与规模因子的暴露:

\[r_t=\alpha+\beta_{\text{mkt}}\,\text{MKT}_t+\beta_{\text{smb}}\,\text{SMB}_t+\epsilon_t.\]
模拟时设真值 \(\alpha=0\)、\(\beta_{\text{mkt}}=1.2\)、\(\beta_{\text{smb}}=0.5\),并让残差波动随市场波动放大(\(\text{sd}(\epsilon_t)=0.008+0.6|\text{MKT}_t|\)),以模拟真实市场中的异方差。我们要做四件事:手写 OLS 并与 statsmodels 对照;比较经典标准误与 White 稳健标准误;检验"贝塔是否等于 1";对"明天市场跌 3%"给出收益的预测区间,并检查其实际覆盖率。

import numpy as np
import statsmodels.api as sm
from scipy import stats

rng = np.random.default_rng(13)
n = 250                                   # 一年日频
mkt = rng.normal(0.0004, 0.010, n)        # 市场日收益
smb = rng.normal(0.0, 0.006, n)           # 规模因子
# 真实模型:alpha=0, beta_mkt=1.2, beta_smb=0.5;误差随市场波动放大(异方差)
eps = rng.normal(0, 1, n) * (0.008 + 0.6 * np.abs(mkt))
r = 0.0 + 1.2 * mkt + 0.5 * smb + eps

# 1) 手写 OLS:beta = (X'X)^{-1} X'Y, se 来自 sigma^2 (X'X)^{-1}
X = np.column_stack([np.ones(n), mkt, smb])
XtX_inv = np.linalg.inv(X.T @ X)
beta = XtX_inv @ X.T @ r
resid = r - X @ beta
k = X.shape[1]
sigma2 = resid @ resid / (n - k)
se = np.sqrt(np.diag(sigma2 * XtX_inv))
W = beta / se
print("手写OLS  beta:", beta.round(4), " se:", se.round(4), " Wald:", W.round(2))

# 2) statsmodels 对照,并比较 White(HC1) 稳健标准误
fit = sm.OLS(r, X).fit()
rob = sm.OLS(r, X).fit(cov_type="HC1")
print("statsmodels se:", fit.bse.round(4), "  HC1 se:", rob.bse.round(4))

# 3) beta_mkt 的 95% 置信区间,与检验 H0: beta_mkt = 1
lo, hi = beta[1] - 1.96 * se[1], beta[1] + 1.96 * se[1]
w1 = (beta[1] - 1) / se[1]
print(f"beta_mkt 95% CI: ({lo:.3f}, {hi:.3f});  H0:beta=1 的 Wald={w1:.2f}, p={2*stats.norm.sf(abs(w1)):.3f}")

# 4) 明天的预测:均值的置信区间 vs 新观测的预测区间
x_star = np.array([1.0, -0.03, 0.0])      # 假设明天市场跌 3%
y_hat = x_star @ beta
se_mean = np.sqrt(x_star @ (sigma2 * XtX_inv) @ x_star)
xi = np.sqrt(se_mean**2 + sigma2)
print(f"预测收益 {y_hat:.4f}; 均值CI 半宽 {1.96*se_mean:.4f}; 预测区间半宽 {1.96*xi:.4f}")

# 5) 预测区间覆盖率(模拟 2000 个新观测,含异方差)
mk_new = np.full(2000, -0.03)
y_new = 1.2 * mk_new + 0.5 * rng.normal(0, 0.006, 2000) + rng.normal(0, 1, 2000) * (0.008 + 0.6 * 0.03)
cover = np.mean(np.abs(y_new - y_hat) < 1.96 * xi)
print(f"在市场跌3%时,名义95%预测区间的实际覆盖率: {cover:.3f}")

关键输出:

手写OLS  beta: [8.000e-04 1.234e+00 3.280e-01]  se: [0.0008 0.0745 0.1267]  Wald: [ 0.96 16.57  2.59]
statsmodels se: [0.0008 0.0745 0.1267]   HC1 se: [0.0008 0.0912 0.1383]
beta_mkt 95% CI: (1.088, 1.380);  H0:beta=1 的 Wald=3.14, p=0.002
预测收益 -0.0363; 均值CI 半宽 0.0048; 预测区间半宽 0.0249
在市场跌3%时,名义95%预测区间的实际覆盖率: 0.650

读法。

  1. 手写公式与 statsmodels 完全一致,说明 (13.20)–(13.23) 就是软件在做的事。
  2. 市场贝塔的经典标准误为 0.0745,White 稳健标准误为 0.0912,大了约 22%。原因是残差在市场大幅波动时放大,而恰恰是这些"大 \(|X|\)"观测对斜率影响最大,经典公式低估了它们带来的不确定性。用稳健标准误重算 \(H_0:\beta=1\) 的 Wald 统计量为 \((1.234-1)/0.0912\approx2.57\),结论不变但证据变弱。在因子 alpha 检验中,这种差别经常决定一个 t 值是 2.1 还是 1.7。
  3. SMB 贝塔估计为 0.33(真值 0.5),95% 区间大约是 \(0.33\pm0.25\),覆盖了真值。一年日频数据对小因子的暴露估计相当粗糙,这就是 \(\widehat{\text{se}}(\hat\beta_1)=\hat\sigma/(s_X\sqrt n)\) 中 \(s_X\) 小的代价。
  4. 对"明天市场跌 3%":条件均值的 95% 置信区间半宽只有 0.48%,而单日收益的预测区间半宽是 2.49%——新观测噪声占了绝大部分。用前者来设定止损或风险预算会严重低估风险。
  5. 更值得警惕的是最后一行:名义 95% 的预测区间在暴跌日的实际覆盖率只有 65%。\(\hat\sigma^2\) 是全样本的平均残差方差,而暴跌日的残差方差远大于平均水平。异方差下,预测区间应该用条件方差模型(如 GARCH,见第 06 册)来给出 \(\sigma^2(x_*)\),而不是常数 \(\hat\sigma^2\)。

其他用法速记。

  • 基于回归的异常检测:仿照 Palm Beach 例,对行业内其他股票建立"估值 ~ 盈利增速 + 规模"回归,看某只股票是否落在预测区间外,作为相对价值信号的初筛。
  • 对冲比率:期货最小方差对冲比率就是现货收益对期货收益回归的斜率(第 08 册),其标准误告诉你对冲比率本身有多不确定。
  • 对数变换:成交量、市值、价差等变量回归前几乎总要取对数,与例 13.6 同理。

本章小结

线性回归的目标是估计条件均值 \(r(x)=\mathbb E(Y\mid X=x)\)。最小二乘给出 \(\hat\beta=(X^TX)^{-1}X^TY\);在正态误差下它也是最大似然估计,但其无偏性与方差公式并不依赖正态性。在同方差、互不相关的误差下,\(\mathbb V(\hat\beta)=\sigma^2(X^TX)^{-1}\),由此得到系数的标准误、置信区间与 Wald 检验(软件输出的 t 值)。对新观测的预测必须同时考虑参数估计误差和新噪声,因此预测区间比条件均值的置信区间宽得多,且样本量再大也不会收缩到零。回归系数只度量关联;教科书标准误只在同方差、独立误差下成立,金融数据通常需要稳健标准误。

概念 公式 / 结论
回归函数 \(r(x)=\mathbb E(Y\mid X=x)\)
简单回归斜率 \(\hat\beta_1=\dfrac{\sum(X_i-\bar X)(Y_i-\bar Y)}{\sum(X_i-\bar X)^2}\),\(\hat\beta_0=\bar Y-\hat\beta_1\bar X\)
误差方差 \(\hat\sigma^2=\text{RSS}/(n-k)\)(简单回归 \(k=2\));MLE 为 \(\text{RSS}/n\)
斜率标准误 \(\widehat{\text{se}}(\hat\beta_1)=\hat\sigma/(s_X\sqrt n)\)
多元 OLS \(\hat\beta=(X^TX)^{-1}X^TY\),\(\mathbb V(\hat\beta\mid X)=\sigma^2(X^TX)^{-1}\)
Wald 检验 \(W=\hat\beta_j/\widehat{\text{se}}(\hat\beta_j)\),\(\lvert W\rvert>z_{\alpha/2}\) 拒绝
置信区间 \(\hat\beta_j\pm z_{\alpha/2}\widehat{\text{se}}(\hat\beta_j)\)
预测区间 \(\hat Y_*\pm z_{\alpha/2}\hat\xi_n\),\(\hat\xi_n^2=\widehat{\mathbb V}(\hat Y_*)+\hat\sigma^2\)
帽子矩阵 \(U=X(X^TX)^{-1}X^T\),\(\hat Y=UY\)
稳健协方差 \((X^TX)^{-1}X^T\hat\Omega X(X^TX)^{-1}\),\(\hat\Omega=\text{diag}(\hat\epsilon_i^2)\)

练习

基础

  1. 证明定理 13.4:对 RSS 求偏导得到正规方程,再解出 \(\hat\beta_0,\hat\beta_1\)。(原书习题 1。)
  2. 视 \(X_i\) 为常数,证明 \(\mathbb V(\hat\beta_1\mid X^n)=\sigma^2/\sum(X_i-\bar X)^2\)。(提示:\(\hat\beta_1=\beta_1+\sum w_i\epsilon_i\),\(\sum w_i^2=1/\sum(X_i-\bar X)^2\)。原书习题 2。)
  3. 过原点回归 \(Y_i=\beta X_i+\epsilon_i\):求最小二乘估计与标准误,并说明在什么条件下估计相合。(答案:\(\hat\beta=\sum X_iY_i/\sum X_i^2\),\(\text{se}=\sigma/\sqrt{\sum X_i^2}\);只要 \(\sum X_i^2\to\infty\) 即相合。原书习题 3。量化中"不带截距估计贝塔"就是这个模型,它强行假设 \(\alpha=0\)。)
  4. 用 250 个日收益估计贝塔,\(\hat\sigma=1.5\%\),市场日波动 \(s_X=1\%\)。求 \(\widehat{\text{se}}(\hat\beta)\)。若只用 60 天数据呢?若改用市场日波动为 2% 的危机期 60 天数据呢?(答案:约 0.095;约 0.19;约 0.097。)
  5. 解释为什么 \(n\to\infty\) 时预测区间宽度不趋于零,而均值的置信区间宽度趋于零。(原书习题 10 的直观版。)

进阶

  1. 在简单线性回归中构造 \(H_0:\beta_1=17\beta_0\) 的 Wald 检验。(提示:检验 \(\theta=\beta_1-17\beta_0=0\),\(\mathbb V(\hat\theta)=\mathbb V(\hat\beta_1)+289\mathbb V(\hat\beta_0)-34\,\text{Cov}(\hat\beta_0,\hat\beta_1)\),各项取自 (13.11)。原书习题 5。量化中检验"两个因子贝塔相等"或"贝塔之和为 1"是同一结构。)
  2. 证明 \(\sum_i(X_i-x_*)^2=\sum_i(X_i-\bar X)^2+n(\bar X-x_*)^2\),并由此验证 (13.16) 中的第一项等于 \(\widehat{\mathbb V}(\hat Y_*)/\hat\sigma^2\)。
  3. 修改 13a.8 节代码:把误差改成同方差(\(\text{sd}=0.012\)),比较经典标准误与 HC1 标准误、以及预测区间覆盖率;再把误差改为自由度 3 的 \(t\) 分布,观察系数估计的抽样波动(重复 1000 次)。
  4. 在 13a.8 节代码中加入一个与 MKT 相关系数 0.95 的"伪因子",观察 \(\beta_{\text{mkt}}\) 的标准误如何变化,并用 \((X^TX)^{-1}\) 的对角元解释。

原书推荐习题:第 13 章 1、2、3、5、10(预测区间与置信区间的区别,必做)、6(汽车油耗数据的简单回归与对数变换)。


原书对照

本章内容 原书章节 PDF 页码
回归函数、引言 第 13 章引言 p.218
简单线性回归、例 13.5–13.6 13.1 p.218–221
最小二乘与最大似然 13.2 p.221–222
最小二乘估计的性质、例 13.10 13.3 p.223–224
预测区间、例 13.12(Palm Beach) 13.4 p.224–225
多元回归、例 13.14(犯罪数据) 13.5 p.225–227
习题 1–3、5、6、10 13.10 p.235–238