量化交易中文教材

第 11 章 二元因变量回归

学习目标

读完本章,你应当能够:

  1. 说明为什么二元因变量的回归函数就是条件概率 \(E(Y\mid X)=\Pr(Y=1\mid X)\),并据此解释线性概率模型(linear probability model, LPM)的系数。
  2. 写出 probit 与 logit 模型,用「先算 \(z\) 值、再算概率、取差」的三步法计算预测概率和回归元变化的效应。
  3. 写出伯努利样本和 probit/logit 的对数似然函数,理解最大似然估计(maximum likelihood estimation, MLE)为什么需要数值优化,以及推断方式与 OLS 相同。
  4. 使用并批判二元模型的拟合度量:正确预测比例、伪 \(R^2\),并知道量化实务更常用的 AUC 与对数损失。
  5. 用 delta 方法计算预测概率的标准误;知道 tobit、Heckman 样本选择、计数模型、有序 probit、多项 logit 各自解决什么问题。
  6. 把这些模型用于违约预测、涨跌方向预测和事件概率建模。

读前导读

这一章在解决什么问题

前面所有章节的因变量都是连续的数(成绩、收入、收益率)。这一章处理因变量只有「是 / 否」两种取值的情形:贷款被拒还是通过,公司违约还是不违约,明天涨还是跌。

核心结论很简单:对 0/1 变量做回归,回归线预测的就是概率。 直接用 OLS(线性概率模型)可以,但会预测出负概率或超过 100% 的概率。所以要找一个把任意实数压进 0 到 1 之间的函数,最常用的两个就是正态分布的累积分布函数(probit)和 logistic 函数(logit)。

你其实早已见过这种结构。Merton 信用模型里,违约概率是 \(N(-DD)\):先算出违约距离 DD(一个线性指标),再用正态分布函数把它变成概率。这就是 probit 的骨架。信用评分卡用的是 logit,评分卡上的「分数」本质是对数几率。Black–Scholes 中的 \(N(d_2)\) 是风险中性下期权到期处于实值的概率,形式也一样。

因为模型对参数是非线性的,OLS 不再适用,要换用最大似然估计(MLE)。这是本章第二个新工具,后面的 GARCH、时间序列模型都会再用。好在推断方式(t 检验、置信区间)和 OLS 完全相同。

需要先想起来的数学

1. 累积分布函数 \(\Phi\) 与密度 \(\phi\)。 \(\Phi(z)=\Pr(Z\le z)\),\(Z\) 为标准正态,就是 CFA 查表用的那个函数,例如 \(\Phi(1.96)=0.975\)、\(\Phi(0)=0.5\)、\(\Phi(-0.8)=0.212\)。\(\phi(z)\) 是正态密度(钟形曲线的高度),它是 \(\Phi\) 的导数:\(\Phi'(z)=\phi(z)\)。\(\phi(0)=0.399\),越往两边越小。见 第 00 册第 03 章 积分(密度与分布函数的关系)。

2. 链式法则。 \(\frac{d}{dx}g(h(x))=g'(h(x))\cdot h'(x)\)。例:\(\frac{d}{dx}\Phi(2+3x)=\phi(2+3x)\times3\)。probit 的边际效应 \(\phi(z)\beta_j\) 就是这么来的。见 第 00 册第 02 章 导数与泰勒展开。

3. 对数与求导找最大值。 \(\ln(ab)=\ln a+\ln b\),所以连乘取对数变连加;\((\ln p)'=1/p\)。求函数最大值:令导数等于零。对数函数单调递增,所以最大化似然和最大化对数似然得到同一个参数。见 第 00 册第 04 章 级数与收敛。

4. 梯度、Hessian 与牛顿法。 多个参数时,一阶导数排成向量叫梯度(这里叫「得分」),二阶导数排成矩阵叫 Hessian。牛顿法是「用当前点的一阶、二阶导数近似出一条抛物线,跳到抛物线顶点,再重复」。你用计算器求债券 YTM 时,计算器内部做的就是一维牛顿迭代。Hessian 负定(多元版的「二阶导数为负」)意味着函数是凹的,只有一个山顶。见 第 00 册第 05 章 多元微积分与优化。

5. 一阶泰勒近似。 \(g(\hat\theta)\approx g(\theta)+g'(\theta)(\hat\theta-\theta)\)。这就是久期近似的一般形式。delta 方法用它把系数的不确定性传递到预测概率上。见 第 00 册第 02 章。

怎么读这一章

11.1 和 11.2 是核心:理解「回归函数就是概率」,会用 Key Concept 11.2 的三步法算预测概率和效应,知道 logit 系数的几率解释。11.3 节的 MLE 是重要的新工具,11.3.2 的伯努利例子一定要跟着讲解框手算一遍,它是理解所有 MLE 的入口;Newton 迭代和 IRLS 第一次可以只看结论。11.3.4 的拟合度量和量化实战中 AUC、对数损失的讨论对实务很重要。11.3.5 的 delta 方法可以先跳过,需要给预测概率算置信区间时再回来。11.4 节是完整案例,读结论和表 11.2 即可。11.5 节只需知道每种模型解决什么问题。


11.0 动机:因变量只取 0 和 1

两个除种族外完全相同的人向银行申请抵押贷款,会被一视同仁吗?原书用 1990 年波士顿地区的抵押贷款申请数据研究这一问题。黑人申请者被拒 28%,白人只有 9%。但两组人在收入、负债、信用记录上并不相同,必须在保持其他特征不变的情况下比较——这是多元回归的任务。转折在于:因变量「是否被拒」是二元的。

第 II 部分常把二元变量当回归元,这没有问题。但当因变量只取 0 和 1 时,「拟合一条直线」意味着什么?答案是:把回归函数解释为概率。二元因变量是受限因变量(limited dependent variable)的一种,本章还会简要介绍其他受限因变量模型。

量化里的二元问题随处可见:明天涨还是跌、是否跑赢基准、公司是否违约、股票是否被 ST、是否被纳入指数、限价单是否成交。本章的模型是处理它们的基础工具。


11.1 线性概率模型

11.1.1 回归函数就是概率

数据中 \(deny=1\) 表示被拒;关键回归元是 \(P/I\ ratio\),即预期每月总还款除以月收入。P/I 低于 0.3 的申请者很少被拒,超过 0.4 的多数被拒。

两个事实给出解释:

  1. 总体回归函数是条件期望 \(E(Y\mid X_1,\dots,X_k)\);
  2. 若 \(Y\) 只取 0 和 1,\(E(Y)=0\cdot\Pr(Y=0)+1\cdot\Pr(Y=1)=\Pr(Y=1)\)。

所以

\[E(Y\mid X_1,\dots,X_k)=\Pr(Y=1\mid X_1,\dots,X_k).\]

预测值 0.20 的意思是:在这样的 \(X\) 下,被拒概率估计为 20%。

Key Concept 11.1(线性概率模型) 把线性多元回归

\[Y_i=\beta_0+\beta_1X_{1i}+\cdots+\beta_kX_{ki}+u_i\tag{11.2}\]
用于二元因变量,则 \(\Pr(Y=1\mid X)=\beta_0+\beta_1X_1+\cdots+\beta_kX_k\)。\(\beta_1\) 是保持其他回归元不变时 \(X_1\) 变化一单位引起的 \(Y=1\) 概率的变化。系数用 OLS 估计,用异方差稳健标准误做推断。

第 II 部分的工具几乎都能用:OLS、\(\pm1.96\) 个标准误的置信区间、F 检验、交互项。有两点要注意:

  • 误差必然异方差。\(Y\) 是伯努利变量,\(\mathrm{var}(u\mid X)=p(X)[1-p(X)]\),随 \(X\) 变化(习题 11.8)。所以必须用异方差稳健标准误。

    推导拆解:给定 \(X\),\(u=Y-p(X)\),其中 \(p(X)\) 是常数,所以 \(\mathrm{var}(u\mid X)=\mathrm{var}(Y\mid X)\)。\(Y\) 只取 0、1,\(Y^2=Y\),于是 \(E(Y^2\mid X)=p\),\(\mathrm{var}(Y\mid X)=E(Y^2\mid X)-[E(Y\mid X)]^2=p-p^2=p(1-p)\)。\(p=0.5\) 时方差最大(0.25),\(p=0.05\) 时只有 0.0475。不同 \(X\) 对应不同 \(p\),方差自然不同。这和 CFA 里二项分布方差 \(np(1-p)\) 取 \(n=1\) 是同一个公式。

  • \(R^2\) 用处不大。因变量连续时,所有点落在回归线上可得 \(R^2=1\);因变量二元时(除非回归元也是二元),这不可能。

11.1.2 应用

用全部 2380 个观测:

\[\widehat{deny}=\underset{(0.032)}{-0.080}+\underset{(0.098)}{0.604}\,P/I\ ratio.\tag{11.1}\]

P/I 上升 0.1,被拒概率增加 \(0.604\times0.1\approx6.0\) 个百分点。P/I = 0.3 时预测被拒概率为 \(-0.080+0.604\times0.3=0.101\)。

加入种族指示变量 \(black\):

\[\widehat{deny}=\underset{(0.029)}{-0.091}+\underset{(0.089)}{0.559}\,P/I\ ratio+\underset{(0.025)}{0.177}\,black.\tag{11.3}\]

保持 P/I 不变,黑人申请者被拒概率高 17.7 个百分点(\(t=7.11\))。但信贷员还会看收入潜力、信用记录等,若它们在给定 P/I 时与种族相关,这个估计就有遗漏变量偏误。11.4 节做完整分析。

11.1.3 缺陷

让 LPM 好用的线性也是它的主要缺陷。概率不能超过 1,所以 \(X\) 对概率的影响必然是非线性的:P/I 从 0.3 升到 0.4 可能大幅提高被拒概率,但 P/I 已经大到几乎必被拒时,再升高影响甚微。LPM 让效应恒定,于是 P/I 很低时预测概率小于 0,很高时大于 1。这推动我们使用专门的非线性模型。


11.2 Probit 与 Logit 回归

要让预测值始终落在 \([0,1]\) 内,自然的办法是套一个累积分布函数(c.d.f.)。probit 用标准正态 c.d.f.,logit 用 logistic c.d.f.。

金融直觉:为什么偏偏是 c.d.f.?有一个比「凑出 0–1 之间的函数」更深的理由,叫潜变量(latent variable)解释。设每个申请者有一个看不见的「风险分数」\(Y^*=\beta_0+\beta_1X+\varepsilon\),\(\varepsilon\sim N(0,1)\),分数超过 0 就被拒(\(Y=1\))。于是

\[\Pr(Y=1\mid X)=\Pr(\varepsilon>-(\beta_0+\beta_1X))=\Phi(\beta_0+\beta_1X),\]
最后一步用了正态分布的对称性。若 \(\varepsilon\) 服从 logistic 分布,就得到 logit。 Merton 模型是同一个结构:公司资产价值到期时低于负债就违约,资产对数收益正态,所以违约概率 \(=N(-DD)\)。\(-DD\) 就是 \(z\) 值,\(N(\cdot)\) 就是 \(\Phi\)。理解了这一点,probit 的系数就是「\(X\) 变一单位,违约距离缩短多少个标准差」。

11.2.1 Probit

单回归元:

\[\Pr(Y=1\mid X)=\Phi(\beta_0+\beta_1X).\tag{11.4}\]

例:设 \(\beta_0=-2\),\(\beta_1=3\),\(P/I=0.4\)。先算「\(z\) 值」\(z=-2+3\times0.4=-0.8\),再查表 \(\Phi(-0.8)=21.2\%\)。

系数的含义:\(\beta_1\) 是 \(X\) 变化一单位引起的 \(z\) 值变化。\(X\) 对 \(z\) 是线性的,对概率是非线性的。\(\beta_1>0\) 表示 \(X\) 增大提高 \(Y=1\) 的概率。实际解释时最好直接算预测概率及其变化。

用 127 个观测估计的 probit 曲线呈拉长的 S 形:P/I = 0.2 时被拒概率 2.1%,0.3 时 16.1%,0.4 时 51.9%,0.6 时 98.3%。

多回归元。例:\(\beta_0=-1.6\),\(\beta_1=2\),\(\beta_2=0.5\),\(X_1=0.4\),\(X_2=1\),则 \(z=-1.6+0.8+0.5=-0.3\),\(\Pr=\Phi(-0.3)=38\%\)。

Key Concept 11.2(Probit 模型、预测概率与估计效应)

\[\Pr(Y=1\mid X_1,\dots,X_k)=\Phi(\beta_0+\beta_1X_1+\cdots+\beta_kX_k).\tag{11.6}\]
预测概率:算出 \(z=\beta_0+\beta_1X_1+\cdots+\beta_kX_k\),再求 \(\Phi(z)\)。回归元变化的效应:(1) 算初值处的预测概率;(2) 算新值处的预测概率;(3) 取差。

这正是第 08 章 Key Concept 8.1 处理任意非线性模型的三步法。

应用:

\[\widehat{\Pr}(deny=1\mid P/I)=\Phi(\underset{(0.16)}{-2.19}+\underset{(0.47)}{2.97}\,P/I\ ratio).\tag{11.7}\]

P/I 从 0.3 升到 0.4:\(\Phi(-2.19+0.891)=\Phi(-1.30)=0.097\),\(\Phi(-2.19+1.188)=\Phi(-1.00)=0.159\),增加 6.2 个百分点。从 0.4 升到 0.5:\(\Phi(-0.71)=0.239\),增加 8.0 个百分点。同样的 \(\Delta X\),效应依赖于起点。

加入种族:

\[\widehat{\Pr}(deny=1\mid P/I,black)=\Phi(\underset{(0.16)}{-2.26}+\underset{(0.44)}{2.74}\,P/I\ ratio+\underset{(0.083)}{0.71}\,black).\tag{11.8}\]

P/I = 0.3 时,白人预测被拒概率 \(\Phi(-1.438)=7.5\%\),黑人 \(\Phi(-0.728)=23.3\%\),相差 15.8 个百分点。

边际效应的解析形式(补充)。对连续回归元求导:

\[\frac{\partial\Pr(Y=1\mid X)}{\partial X_j}=\phi(\beta_0+\beta_1X_1+\cdots+\beta_kX_k)\,\beta_j,\]

\(\phi\) 是标准正态密度。它在 \(z=0\)(概率 50%)处最大,越到两端越小——这就是 S 形曲线「中段陡、两端平」的数学表述。

推导拆解:这里用了链式法则。外层函数是 \(\Phi(z)\),导数是 \(\phi(z)\)(c.d.f. 的导数就是密度);内层函数是 \(z=\beta_0+\beta_1X_1+\cdots+\beta_kX_k\),对 \(X_j\) 的偏导数是 \(\beta_j\)。两者相乘即得。 数值检验:(11.7) 中 P/I = 0.4 时 \(z=-1.00\),\(\phi(-1)=0.242\),边际效应 \(0.242\times2.97=0.72\),即 P/I 每升 0.01,被拒概率约升 0.72 个百分点。用离散差分算 0.4→0.5 是 8.0 个百分点,平均每 0.01 为 0.8,比导数略大,因为曲线在这一段还在变陡。 金融直觉:\(\phi(z)\) 的形状很像期权 gamma 随标的价格的分布:平值附近(概率 50%)对输入最敏感,深度实值或虚值时几乎不动。一家已经几乎肯定违约(或几乎不可能违约)的公司,杠杆率再变一点,违约概率几乎不变。

11.2.2 Logit

Key Concept 11.3(Logit 回归)

\[\Pr(Y=1\mid X_1,\dots,X_k)=F(\beta_0+\beta_1X_1+\cdots+\beta_kX_k)=\frac{1}{1+e^{-(\beta_0+\beta_1X_1+\cdots+\beta_kX_k)}}.\tag{11.9}\]
Logit 与 probit 的唯一区别是所用的 c.d.f. 不同。

Logit 又叫 logistic 回归。历史上用它是因为 logistic c.d.f. 比正态 c.d.f. 算得快,如今这个优势已不重要。两者的拟合曲线几乎重合。

应用:

\[\widehat{\Pr}(deny=1\mid P/I,black)=F(\underset{(0.35)}{-4.13}+\underset{(0.96)}{5.37}\,P/I\ ratio+\underset{(0.15)}{1.27}\,black).\tag{11.10}\]

P/I = 0.3 的白人:\(1/(1+e^{2.52})=7.4\%\);黑人:\(1/(1+e^{1.25})=22.2\%\);相差 14.8 个百分点(原书在比较段落中写作 14.9,是四舍五入差异)。

补充:logit 系数的几率解释。由 (11.9) 可得

\[\ln\frac{p}{1-p}=\beta_0+\beta_1X_1+\cdots+\beta_kX_k,\]

推导拆解:记 \(z=\beta_0+\beta_1X_1+\cdots\),\(p=\frac1{1+e^{-z}}\)。 第一步,\(1-p=\frac{e^{-z}}{1+e^{-z}}\)。 第二步,两者相除,分母约掉:\(\frac p{1-p}=\frac1{e^{-z}}=e^{z}\)。 第三步,取对数得 \(\ln\frac p{1-p}=z\)。 「几率」(odds) 就是赌场里说的赔率:\(p=0.2\) 时几率为 \(0.2/0.8=0.25\),即「1 比 4」。\(X_j\) 增加 1,\(z\) 增加 \(\beta_j\),几率乘以 \(e^{\beta_j}\),与起点无关。这是 logit 独有的好性质:概率的变化依赖起点,几率的倍数变化却不依赖。 顺带可得 logit 的边际效应:\(\frac{dp}{dz}=\frac{e^{-z}}{(1+e^{-z})^2}=p(1-p)\),所以 \(\partial p/\partial X_j=p(1-p)\beta_j\)。在 \(p=0.5\) 处为 \(0.25\beta_j\),这就是下文「logistic 密度在 0 处为 1/4」的来源。

左边是对数几率(log odds)。所以 \(\beta_j\) 是 \(X_j\) 变化一单位时对数几率的变化,\(e^{\beta_j}\) 是几率比(odds ratio)。例如 (11.10) 中 \(e^{1.27}\approx3.6\):保持 P/I 不变,黑人被拒的几率是白人的 3.6 倍。原书本章没有展开这一解释,但它在信用评分卡中很常用。

系数尺度:logistic 分布的密度在 0 处为 \(1/4\),正态密度在 0 处为 \(1/\sqrt{2\pi}\approx0.399\)。为了在概率 50% 附近给出相同的边际效应,logit 系数大约是 probit 系数的 \(0.399/0.25\approx1.6\) 倍;在表 11.2 中,\(black\) 的 logit 与 probit 系数之比为 \(0.688/0.389\approx1.8\)。尾部(概率很小或很大)时比值更大。

11.2.3 三种模型怎么选

三者都只是未知总体回归函数 \(\Pr(Y=1\mid X)\) 的近似。LPM 最易用、易解释,但不能刻画非线性;probit 和 logit 能刻画非线性,但系数难以直接解释。没有唯一正确答案。probit 与 logit 结果通常很接近(P/I = 0.3 时的种族差距:probit 15.8,logit 14.8 个百分点),选你的软件里更方便的即可。LPM 在回归元极端值少的数据中也可能是足够好的近似:(11.3) 给出 17.7 个百分点,偏大但定性相同。唯一可靠的办法是都估计一遍,比较预测概率。


11.3 估计与推断:最大似然

11.3.1 为什么不能用 OLS

第 08 章的多项式、对数等模型对参数是线性的,可以用 OLS。probit 和 logit 的参数在 \(\Phi(\cdot)\) 或 \(F(\cdot)\) 内部,对参数是非线性的,不能用 OLS。

非线性最小二乘(nonlinear least squares, NLLS)是一种选择:最小化

\[\sum_{i=1}^n\big[Y_i-\Phi(\beta_0+\beta_1X_{1i}+\cdots+\beta_kX_{ki})\big]^2.\tag{11.11}\]

NLLS 一致、大样本正态,但不是有效的(inefficient)——存在方差更小的估计量。所以实践中用最大似然。

11.3.2 最大似然的思想

似然函数(likelihood function)是数据的联合概率分布,被看作未知参数的函数。最大似然估计量(MLE)是使似然函数最大的参数值,也就是让「抽到眼前这批数据」的概率最大的参数值。

例:\(n\) 个 i.i.d. 伯努利观测。\(\Pr(Y=y)=p^y(1-p)^{1-y}\),独立性给出联合分布

\[\Pr(Y_1=y_1,\dots,Y_n=y_n)=p^{S}(1-p)^{n-S},\qquad S=\sum_iy_i.\tag{11.13–11.14}\]

取对数 \(S\ln p+(n-S)\ln(1-p)\),对 \(p\) 求导:

\[\frac{S}{p}-\frac{n-S}{1-p}=0\quad\Rightarrow\quad\hat p=\frac Sn=\bar Y.\tag{11.15}\]

伯努利概率的 MLE 就是样本中 1 的比例。

推导拆解:用一个具体数字走一遍。10 只债券中 2 只违约(\(n=10\),\(S=2\))。 第一步,写出联合概率。每只违约债券贡献因子 \(p\),每只未违约贡献 \(1-p\),独立事件的概率相乘:\(L(p)=p^2(1-p)^8\)。\(p^y(1-p)^{1-y}\) 只是把这两种情况写成一个式子的技巧:\(y=1\) 时等于 \(p\),\(y=0\) 时等于 \(1-p\)。 第二步,试几个值感受一下:\(L(0.1)=0.0043\),\(L(0.2)=0.0067\),\(L(0.3)=0.0052\)。\(p=0.2\) 时「看到 2 只违约」最可能。 第三步,取对数把乘积变成求和:\(\ln L=2\ln p+8\ln(1-p)\)。取对数不改变最大值的位置,但让求导容易得多。 第四步,求导令其为零:\(\frac2p-\frac8{1-p}=0\)(\(\ln(1-p)\) 的导数用了链式法则,内层导数为 \(-1\)),解得 \(p=0.2\)。 结论符合常识:估计违约率就是数违约比例。MLE 的价值在于,当 \(p\) 依赖 \(X\) 时,同样的思路仍然适用,而常识不再够用。

Probit 的似然。成功概率不再是常数,而是 \(p_i=\Phi(\beta_0+\beta_1X_{1i}+\cdots+\beta_kX_{ki})\)。在 i.i.d. 假设下,条件联合分布是各观测概率之积,对数似然为

\[\ln f_{probit}=\sum_{i=1}^nY_i\ln\Phi(X_i'\beta)+\sum_{i=1}^n(1-Y_i)\ln[1-\Phi(X_i'\beta)].\tag{11.17}\]

Logit 只需把 \(\Phi\) 换成 logistic 函数。两者都没有闭式解,必须用数值算法最大化,常用 Newton–Raphson。probit 和 logit 的对数似然都是参数的凹函数,所以数值优化可靠地收敛到唯一最大值。

对 logit,Newton 迭代有简洁的形式(补充)。记 \(p_i=F(X_i'\beta)\):

\[\text{得分 }g=\sum_iX_i(Y_i-p_i),\qquad\text{Hessian }H=-\sum_ip_i(1-p_i)X_iX_i',\qquad\beta^{new}=\beta-H^{-1}g.\]

这等价于反复做加权最小二乘,所以也叫迭代重加权最小二乘(IRLS)。

白话解释:(11.17) 的每一项只有一半「起作用」:\(Y_i=1\) 的观测贡献 \(\ln\Phi(X_i'\beta)\)(希望预测违约概率高),\(Y_i=0\) 的贡献 \(\ln[1-\Phi(X_i'\beta)]\)(希望预测违约概率低)。MLE 在所有观测间寻找折中。\(X_i'\beta\) 是 \(\beta_0+\beta_1X_{1i}+\cdots+\beta_kX_{ki}\) 的向量简写。 得分 \(g=\sum X_i(Y_i-p_i)\) 的形式很直观:\(Y_i-p_i\) 是「实际减预测」的残差,乘上回归元后加总。最优点处得分为零,意味着残差与每个回归元正交,这与 OLS 的正规方程 \(\sum X_i\hat u_i=0\) 如出一辙。 金融直觉:牛顿法你其实用过。求债券 YTM 时,价格对收益率的一阶导数(与久期相关)告诉你往哪个方向调、调多少,计算器反复迭代直到价格吻合。这里的得分相当于一阶导数,Hessian 相当于二阶导数(类比凸性),用它们决定下一步的步长。对数似然是凹的,就像一个只有一个山顶的山,从哪里出发都能爬到同一个顶点。

11.3.3 推断

在一般条件下 MLE 一致、大样本正态,而且是有效的。所以推断与 OLS 完全相同:\(t\) 统计量、\(\pm1.96\) 个标准误、F 统计量。

实用要点:有的软件用 F 统计量报告联合检验,有的用卡方统计量。两者的关系是 \(\chi^2=qF\),\(q\) 为约束个数;原假设下 \(qF\) 大样本服从 \(\chi^2_q\)。结论相同,但要知道软件报告的是哪个,才能用对临界值。

11.3.4 拟合度量

正确预测比例(fraction correctly predicted):\(Y_i=1\) 且预测概率 > 50%,或 \(Y_i=0\) 且预测概率 < 50%,算作预测正确。优点是易懂;缺点是不反映预测质量——51% 和 90% 都算对。

伪 \(R^2\)(pseudo-\(R^2\)):加入回归元会提高最大化的似然值,就像 OLS 加回归元会降低残差平方和。比较含全部回归元与不含任何回归元的最大似然值:

\[\text{pseudo-}R^2=1-\frac{\ln f^{max}_{probit}}{\ln f^{max}_{Bernoulli}},\tag{11.18}\]

\(f^{max}_{Bernoulli}\) 是只有常数项的模型的最大似然值。因为似然值在 0 到 1 之间,两个对数都为负,比值在 0 到 1 之间。这就是 McFadden 伪 \(R^2\)。

白话解释:分母是「只知道平均违约率、对每家公司一视同仁」时的对数似然,相当于基准模型;分子是用上全部回归元后的对数似然。伪 \(R^2\) 衡量回归元把「不可解释的程度」降低了多少比例,思路同 \(R^2=1-SSR/TSS\)。 数量感:伪 \(R^2\) 的数值通常远低于 OLS 的 \(R^2\),0.2–0.4 已经算拟合很好,不能用线性回归的标准去判断。量化实战中的违约模型伪 \(R^2\) 为 0.18,AUC 却达到 0.80,就说明了这一点。

11.3.5 预测概率的标准误:delta 方法

单回归元 probit 在 \(x\) 处的预测概率 \(\hat p(x)=\Phi(\hat\beta_0+\hat\beta_1x)\) 依赖于估计量,本身也有抽样分布。一阶泰勒展开:

\[\hat p(x)\cong c+a_0(\hat\beta_0-\beta_0)+a_1(\hat\beta_1-\beta_1),\qquad a_0=\phi(\beta_0+\beta_1x),\ a_1=\phi(\beta_0+\beta_1x)\,x,\tag{11.19}\]
\[\mathrm{var}[\hat p(x)]\cong a_0^2\mathrm{var}(\hat\beta_0)+a_1^2\mathrm{var}(\hat\beta_1)+2a_0a_1\mathrm{cov}(\hat\beta_0,\hat\beta_1).\tag{11.20}\]

把 \(a_0,a_1\) 在估计值处求值,并代入 MLE 的方差–协方差矩阵,即得标准误。这就是 delta 方法。矩阵形式是 \(\mathrm{var}[\hat p]\cong g'\hat V g\),\(g=\partial p/\partial\beta\)。

推导拆解: 第一步,(11.19) 中的 \(c=\Phi(\beta_0+\beta_1x)\) 是真实概率,是常数。\(a_0\)、\(a_1\) 是 \(\Phi(\beta_0+\beta_1x)\) 分别对 \(\beta_0\)、\(\beta_1\) 的偏导数:由链式法则,对 \(\beta_0\) 求导得 \(\phi(\cdot)\times1\),对 \(\beta_1\) 求导得 \(\phi(\cdot)\times x\)。 第二步,一阶泰勒展开把非线性的 \(\hat p\) 近似成 \(\hat\beta_0\)、\(\hat\beta_1\) 的线性组合。常数不影响方差,于是 (11.20) 就是熟悉的「两资产组合方差」公式,\(a_0\)、\(a_1\) 扮演权重。 第三步,\(\beta\) 未知,所以在 \(\hat\beta\) 处计算 \(a_0\)、\(a_1\)。 金融直觉:这和用久期估计债券价格风险完全同构。价格 \(P(y)\) 是收益率的非线性函数,用 \(\Delta P\approx P'(y)\Delta y\) 把收益率的波动传递为价格的波动,\(\sigma_P\approx|P'(y)|\sigma_y\)。delta 方法把「收益率」换成「估计的系数」,把「价格」换成「预测概率」。名字中的 delta 也和期权 delta 一样,指一阶敏感度。 适用条件也一样:一阶近似在变化小时可靠。样本小、系数不确定性大、或预测概率接近 0 或 1(曲线弯曲剧烈)时,可以像量化实战那样用 bootstrap 对照。


11.4 应用:波士顿 HMDA 数据

目标是在保持信贷员可以合法考虑的因素不变时,估计种族对被拒概率的效应。

表 11.1 主要变量(最后一列为样本均值)

变量 定义 均值
P/I ratio 每月总债务还款 / 月收入 0.331
住房支出/收入 每月住房支出 / 月收入 0.255
贷款价值比 贷款额 / 房产评估价 0.738
消费信用评分 1(无拖欠)到 6(逾期 90 天不良记录) 2.1
房贷信用评分 1(无迟付)到 4(两次以上迟付) 1.7
公开不良信用记录 破产、坏账核销等为 1 0.074
抵押贷款保险被拒 是为 1 0.020
自雇 是为 1 0.116
单身 是为 1 0.393
高中文凭 是为 1 0.984
行业失业率 申请人所在行业 1989 年失业率 3.8
共管公寓 是为 1 0.288
black 黑人为 1 0.142
deny 被拒为 1 0.120

当时信贷员对贷款价值比常用阈值,所以用两个指示变量表示中(0.80–0.95)和高(> 0.95),低于 0.8 为省略组。私人抵押贷款保险在贷款价值比超过 80% 时通常必须购买;保险被拒对申请不利。

表 11.2 拒贷回归(2380 个观测;* 和 ** 分别表示 5% 和 1% 水平显著;节选)

回归元 (1) LPM (2) Logit (3) Probit (4) Probit (5) Probit (6) Probit
black 0.084** (0.023) 0.688** (0.182) 0.389** (0.098) 0.371** (0.099) 0.363** (0.100) 0.246 (0.448)
P/I ratio 0.449** (0.114) 4.76** (1.33) 2.44** (0.61) 2.46** (0.60) 2.62** (0.61) 2.57** (0.66)
高贷款价值比 0.189** (0.050) 1.49** (0.32) 0.79** (0.18) 0.79** (0.18) 0.84** (0.18) 0.79** (0.18)
消费信用评分 0.031** (0.005) 0.29** (0.04) 0.15** (0.02) 0.16** (0.02) 0.34** (0.11) 0.16** (0.02)
公开不良信用记录 0.197** (0.035) 1.23** (0.20) 0.70** (0.12) 0.70** (0.12) 0.72** (0.12) 0.70** (0.12)
抵押贷款保险被拒 0.702** (0.045) 4.55** (0.57) 2.56** (0.30) 2.59** (0.29) 2.59** (0.30) 2.59** (0.29)
自雇 0.060** (0.021) 0.67** (0.21) 0.36** (0.11) 0.35** (0.11) 0.34** (0.11) 0.35** (0.11)
其他申请人特征 否 否 否 是 是 是
信用评分改为指示变量 否 否 否 否 是 否
black × P/I、black × 住房支出 否 否 否 否 否 是
F:种族交互项 = 0 0.27 (0.766)
F:black 与交互项 = 0 4.96 (0.002)
黑白预测拒贷概率差 8.4% 6.0% 7.1% 6.6% 6.3% 6.5%

(表中省略了住房支出比、中等贷款价值比、房贷信用评分、单身、高中文凭等行;最后一行对除种族外各回归元取样本均值的「平均申请者」计算。)

LPM(列 1):P/I 上升 0.1,被拒概率增加约 4.5 个百分点;贷款价值比超过 95% 增加 18.9 个百分点;公开不良记录增加 19.7 个百分点;保险被拒几乎是决定性的,增加 70.2 个百分点。消费信用显著而房贷信用不显著。种族差距 8.4 个百分点(\(t=3.65\))。

Logit 与 probit(列 2–3):结论相同。因为非线性,计算种族差距必须选定其他回归元的取值,惯例是取样本均值。三种模型给出 6.0–8.4 个百分点,都小于只含 P/I 和种族时的估计,说明早先的估计有遗漏变量偏误。

敏感性分析(列 4–6):加入单身、高中文凭、行业失业率,这些变量有预测力但几乎不改变种族差距;把信用评分拆成指示变量,不拒绝它们线性进入的原假设;检验对黑人和白人是否用不同标准评估 P/I 和住房支出——交互项联合不显著(\(p=0.766\)),但种族与交互项联合在 1% 水平显著(\(p=0.002\))。

结论:六个设定中,种族效应都在 1% 水平显著,差距为 6.0–8.4 个百分点。按列 (3),平均白人申请者被拒概率 7.4%,黑人 14.5%,黑人被拒的可能性几乎是白人的两倍。

用第 09 章的框架审视:内部有效性方面,原始数据经过仔细审计;其他函数形式和变量组合给出可比的结果;最难排除的是面谈中获得的、申请表上没有记录、又与种族相关的财务信息造成的遗漏变量偏误。外部有效性方面,1990 年的波士顿不能代表今天的其他地方,在线审批也可能减少歧视,唯一的办法是考察其他地点和年份的数据。


11.5 其他受限因变量模型(原书附录 11.3)

多数情况下,受限因变量模型参数的 OLS 估计量不一致,通常用最大似然估计。

  • 截尾回归与 tobit(censored regression):购车支出在未买车者处为 0,分布是「0 处的质点 + 连续部分」。Tobin (1958) 设意愿支出 \(Y_i^*=\beta_0+\beta_1X_i+u_i\),超过阈值才观测到 \(Y_i=Y_i^*\),否则观测到 0。在 \(u_i\) 正态的假设下写出似然函数用 MLE 估计,称为 tobit 模型。
  • 断尾回归与样本选择模型(truncated regression, sample selection):若数据来自销售税记录,只有买车者的数据,非买者完全缺失,称为断尾数据。选择机制与因变量相关,正是第 09 章的样本选择问题。做法是建立两个方程——\(Y_i^*\) 的方程和「是否被观测」的方程——用 MLE 联合估计,或者先估计选择方程(一个 probit)再估计结果方程,即 Heckman 两步法。
  • 计数数据(count data):每周去餐馆的次数。OLS 可用,但可能预测出负数;专门模型是泊松回归和负二项回归。
  • 有序响应(ordered responses):高中毕业 < 上过大学 < 大学毕业,有顺序但没有自然数值,用有序 probit。
  • 离散选择(discrete choice):通勤方式在地铁、公交、开车、步行之间选择,无自然顺序。从效用最大化出发可得多项 logit 和多项 probit。

原书专栏:2000 年诺贝尔奖得主 Heckman 与 McFadden。Heckman 获奖是因为发展了处理样本选择的工具:例如只用有正收入的就业者估计工资方程会有选择偏误,他把「是否就业」的二元方程与工资方程作为联立方程组处理。McFadden 获奖是因为发展了离散选择模型:从个人在各选项之间最大化期望效用出发,推导出可用 MLE 估计的选择概率模型。


量化实战

本章模型在量化中的位置

  • 方向与事件预测:预测「下期是否上涨」「是否跑赢基准」本质是二元问题。logistic 回归是最基础的分类器,输出的概率可以直接作为信号强度:例如把 \(\hat p-0.5\) 映射为仓位。本章的「边际效应依赖于起点」提醒我们,因子对上涨概率的影响在概率中段最大,在两端饱和。
  • 信用风险:HMDA 案例本身就是信贷审批模型。违约概率(PD)模型、信用评分卡、Ohlson O-score 都是 logit/probit;债券和可转债策略中的违约风险因子、A 股 ST/退市风险预测都用这一框架。几率比 \(e^{\beta_j}\) 是评分卡里「分数」的来源。
  • 事件驱动:并购目标、指数成分调整、分析师评级上调、业绩超预期等事件概率建模。有序 probit 可用于信用评级迁移,多项 logit 可用于买入/持有/卖出三分类。
  • 执行:限价单是否成交、是否被撤销的概率模型常用 logit;单位时间成交笔数可用泊松回归。
  • 样本选择:只观测到成交的订单、只观测到成功发行的 IPO,都是 Heckman 问题。

评估指标。违约、ST 这类事件发生率很低。若违约率是 9%,「全部猜不违约」的正确预测比例就有 91%,所以正确预测比例几乎没有信息。量化实务更常用:

  • AUC(ROC 曲线下面积):随机抽一个正例和一个负例,模型给正例更高概率的比例;只看排序,适合选股、打分。
  • 对数损失(log loss)\(=-\frac1n\sum[Y_i\ln\hat p_i+(1-Y_i)\ln(1-\hat p_i)]\):它就是平均负对数似然,与伪 \(R^2\) 同源,衡量概率是否校准(calibrated)。用预测概率做仓位或定价时,校准比排序更重要。

边际效应的两种算法。均值处边际效应(marginal effect at the mean, MEM)在一个假想的「平均个体」处求导,原书 11.4 节就是这样算种族差距的;平均边际效应(average marginal effect, AME)对每个样本个体求导再平均。事件稀少时,平均个体的概率很低,处于 S 曲线的平坦段,MEM 会明显小于 AME。

示例:违约预测中的 LPM、probit、logit 与 MLE

模拟 20000 家公司,违约概率由资产负债率、ROA 和一个负面标记(如非标审计意见)决定,真实模型是 logit。依次比较三种模型的系数与边际效应、LPM 的越界问题,手写 Newton–Raphson 验证 MLE,比较拟合度量,最后用 delta 方法和 bootstrap 计算某家公司违约概率的标准误。

import numpy as np
import pandas as pd
import statsmodels.api as sm
from scipy.stats import norm
from sklearn.metrics import roc_auc_score, log_loss

rng = np.random.default_rng(11)
n = 20000
# ---- 模拟一个违约(或 ST)预测样本 ----
lev = rng.beta(2, 3, n)                      # 资产负债率 0~1
roa = rng.normal(0.04, 0.06, n)              # 资产收益率
neg = (rng.random(n) < 0.08).astype(float)   # 非标审计意见等负面标记
z = -4.0 + 4.0 * lev - 15.0 * roa + 1.5 * neg
y = (rng.random(n) < 1 / (1 + np.exp(-z))).astype(float)   # 真实模型是 logit
X = sm.add_constant(pd.DataFrame({"lev": lev, "roa": roa, "neg": neg}))
print(f"违约率 {y.mean():.3f}")

lpm = sm.OLS(y, X).fit(cov_type="HC1")
pro = sm.Probit(y, X).fit(disp=0)
lgt = sm.Logit(y, X).fit(disp=0)
tab = pd.DataFrame({"LPM": lpm.params, "Probit": pro.params, "Logit": lgt.params})
print(tab.round(3))
print("Logit/Probit 系数比:", (lgt.params / pro.params).round(2).values[1:])

# ---- 边际效应:均值处(MEM)与平均边际效应(AME)----
for name, m in [("Probit", pro), ("Logit", lgt)]:
    mem = m.get_margeff(at="mean").margeff
    ame = m.get_margeff(at="overall").margeff
    print(f"{name} MEM {np.round(mem,4)}  AME {np.round(ame,4)}")
print(f"LPM 斜率      {np.round(lpm.params.values[1:],4)}")
p_lpm = lpm.fittedvalues
print(f"LPM 预测概率 <0 的比例 {np.mean(p_lpm<0):.3f}, >1 的比例 {np.mean(p_lpm>1):.4f}")

# ---- 手写 Newton-Raphson 求 Logit MLE(对数似然是凹的)----
Xa = X.values; b = np.zeros(Xa.shape[1])
for it in range(25):
    p = 1 / (1 + np.exp(-Xa @ b))
    grad = Xa.T @ (y - p)                    # 得分
    H = -(Xa * (p * (1 - p))[:, None]).T @ Xa   # Hessian
    step = np.linalg.solve(H, grad)
    b = b - step
    if np.max(np.abs(step)) < 1e-10: break
print(f"Newton 迭代 {it+1} 次, 与 statsmodels 最大差 {np.max(np.abs(b - lgt.params.values)):.2e}")

# ---- 拟合优度:正确预测比例、伪 R2、AUC、对数损失 ----
for name, m in [("Probit", pro), ("Logit", lgt)]:
    ph = m.predict(X)
    print(f"{name}: 正确预测比例 {np.mean((ph>0.5)==(y==1)):.4f} (全猜不违约 {1-y.mean():.4f}), "
          f"伪R2 {m.prsquared:.3f}, 手算伪R2 {1 - m.llf/m.llnull:.3f}, "
          f"AUC {roc_auc_score(y, ph):.3f}, logloss {log_loss(y, ph):.4f}")

# ---- 预测概率的 delta 方法标准误(Logit,某家公司)----
x0 = np.array([1.0, 0.7, -0.05, 1.0])       # 高杠杆、亏损、负面标记
p0 = 1 / (1 + np.exp(-x0 @ lgt.params.values))
grad = p0 * (1 - p0) * x0                    # dp/db
se_delta = np.sqrt(grad @ lgt.cov_params().values @ grad)
boot = []
for r in range(300):
    idx = rng.integers(0, n, n)
    bb = sm.Logit(y[idx], Xa[idx]).fit(disp=0).params
    boot.append(1 / (1 + np.exp(-x0 @ bb)))
print(f"该公司违约概率 {p0:.3f}, delta 法 SE {se_delta:.4f}, bootstrap SE {np.std(boot):.4f}")

输出:

违约率 0.090
         LPM  Probit   Logit
const  0.005  -2.158  -3.970
lev    0.290   2.027   3.926
roa   -1.051  -7.783 -15.045
neg    0.150   0.784   1.463
Logit/Probit 系数比: [1.94 1.93 1.87]
Probit MEM [ 0.2243 -0.8611  0.0868]  AME [ 0.2733 -1.0495  0.1058]
Logit MEM [ 0.1948 -0.7467  0.0726]  AME [ 0.2757 -1.0567  0.1028]
LPM 斜率      [ 0.2903 -1.0514  0.1497]
LPM 预测概率 <0 的比例 0.170, >1 的比例 0.0000
Newton 迭代 8 次, 与 statsmodels 最大差 0.00e+00
Probit: 正确预测比例 0.9143 (全猜不违约 0.9099), 伪R2 0.180, 手算伪R2 0.180, AUC 0.801, logloss 0.2482
Logit: 正确预测比例 0.9140 (全猜不违约 0.9099), 伪R2 0.181, 手算伪R2 0.181, AUC 0.801, logloss 0.2481
该公司违约概率 0.730, delta 法 SE 0.0167, bootstrap SE 0.0154

读法:

  • 系数尺度不同,边际效应相近。logit 系数约为 probit 的 1.9 倍(违约率 9%,处在分布尾部,所以比 1.6 大);但两者的平均边际效应几乎相同(杠杆率:0.273 与 0.276),也接近 LPM 斜率 0.290。这就是原书复习题 11.2 的答案:系数差异巨大,概率效应却相近。
  • MEM 与 AME 不同。平均公司的违约概率很低,处于 S 曲线平坦段,MEM 比 AME 小约 20%–30%。报告边际效应时要说明用的是哪一种。
  • LPM 越界:17% 的公司预测违约概率为负。这在排序打分中也许无伤大雅,但若用作定价或仓位输入就不可接受。
  • Newton 法 8 次迭代就收敛到 statsmodels 的结果,体现了对数似然的凹性。
  • 正确预测比例几乎没有信息:模型 91.4%,全猜不违约 91.0%。AUC 0.80 和对数损失才是有用的指标。伪 \(R^2\) 按 (11.18) 手算与软件一致。
  • delta 方法给出的标准误(0.0167)与 300 次 bootstrap(0.0154)接近,说明一阶近似在这个样本量下可靠。

本章小结

因变量二元时,总体回归函数是给定回归元时 \(Y=1\) 的概率,预测值是概率,效应是概率的变化。线性概率模型用 OLS 估计、系数直接可读,但误差必然异方差、预测可能越出 \([0,1]\)、效应恒定。probit 和 logit 用 c.d.f. 把线性指数映射到 \([0,1]\),效应依赖于起点,最好通过「在给定 \(X\) 处算预测概率并取差」来解释。它们的参数非线性,用最大似然估计;MLE 一致、渐近正态、有效,推断与 OLS 相同,只需注意软件报告的是 \(F\) 还是 \(\chi^2=qF\)。\(R^2\) 不适用,可用正确预测比例和伪 \(R^2\),在量化中更常用 AUC 和对数损失。HMDA 数据上,三种模型一致表明控制其他因素后黑人被拒概率高 6–8 个百分点。其他受限因变量有 tobit、样本选择、计数、有序和多项选择模型。

概念 公式 / 要点
二元回归函数 \(E(Y\mid X)=\Pr(Y=1\mid X)\)
LPM \(\Pr(Y=1\mid X)=X'\beta\);\(\mathrm{var}(u\mid X)=p(1-p)\),须用稳健 SE
Probit \(\Pr=\Phi(X'\beta)\);\(\partial p/\partial X_j=\phi(X'\beta)\beta_j\)
Logit \(\Pr=1/(1+e^{-X'\beta})\);\(\ln\frac p{1-p}=X'\beta\);\(\partial p/\partial X_j=p(1-p)\beta_j\)
系数尺度 logit ≈ 1.6–1.8 × probit(尾部更大)
伯努利 MLE \(\hat p=\bar Y\)
Probit 对数似然 \(\sum Y_i\ln\Phi(X_i'\beta)+(1-Y_i)\ln[1-\Phi(X_i'\beta)]\)
联合检验 \(\chi^2=qF\)
伪 \(R^2\) \(1-\ln f^{max}/\ln f^{max}_{Bernoulli}\)
Delta 方法 \(\mathrm{var}(\hat p)\approx g'\hat Vg\),\(g=\partial p/\partial\beta\)

练习

基础

  1. 线性概率模型给出某观测的预测值 1.3,这意味着什么?为什么荒谬?(原书复习题 11.1) 提示:概率不能超过 1;这是线性函数形式的必然后果。
  2. 用 (11.8):P/I = 0.35 的黑人申请者被拒概率是多少?P/I 降到 0.30 呢?对白人重复,并说明 P/I 的效应是否依赖种族。(原书习题 11.6) 答案要点:黑人 \(\Phi(-2.26+0.959+0.71)=\Phi(-0.591)\approx27.7\%\),降到 0.30 时 23.3%,差 4.4 个百分点;白人 \(\Phi(-1.301)\approx9.7\%\) 降到 7.5%,差 2.1 个百分点。效应依赖种族,因为非线性。
  3. 用 (11.10) 的 logit 计算 \(black\) 的几率比,并解释。 提示:\(e^{1.27}\approx3.56\)。
  4. 某软件报告 3 个约束的联合检验统计量为 12.6,另一软件报告 4.2。它们矛盾吗? 提示:\(12.6=3\times4.2\),一个是 \(\chi^2_3\),一个是 F,结论相同。
  5. 在一个违约率为 2% 的样本上,模型的正确预测比例是 97.5%。这个模型好吗?应当看什么指标? 提示:全猜不违约就有 98%;看 AUC、对数损失、校准曲线。

进阶

  1. (原书习题 11.8)证明线性概率模型中 \(\mathrm{var}(u_i\mid X_i)=(\beta_0+\beta_1X_i)[1-(\beta_0+\beta_1X_i)]\),并写出其似然函数。 提示:给定 \(X\),\(Y\) 是成功概率为 \(\beta_0+\beta_1X\) 的伯努利变量。
  2. (原书习题 11.4)只有一个二元回归元 \(Male\) 时,probit、logit、LPM 给出的男性和女性预测概率为什么完全相同? 提示:只有两个单元格,三种模型都有两个参数,都能恰好拟合两组的样本比例(饱和模型)。
  3. (原书习题 11.10)\(Y\) 取 1、2、3 的概率分别为 \(p\)、\(q\)、\(1-p-q\)。写出 \(n\) 个 i.i.d. 观测的似然函数,求 MLE。 答案要点:\(\hat p\)、\(\hat q\) 分别为样本中取 1、取 2 的比例。
  4. 推导 logit 对数似然的得分与 Hessian,说明 Hessian 负定,从而对数似然是凹的。 提示:\(\partial p_i/\partial\beta=p_i(1-p_i)X_i\);\(H=-\sum p_i(1-p_i)X_iX_i'\),在 \(X\) 列满秩时负定。
  5. 你用 logistic 回归预测次日上涨概率,样本内 AUC 0.56,样本外 0.51。结合第 09 章 9.3 节,列出可能的原因。 提示:过拟合(预测变量太多)、样本内外分布不同(体制切换)、前视偏差使样本内虚高。

原书推荐习题:11.8(LPM 误差的异方差与似然函数);11.6、11.7(probit 与 logit 下的预测概率与效应);11.1–11.5(同一数据在三种模型下的比较,尤其 11.1(d) 的样本外外推、11.4 饱和模型、11.5 交互项);11.10(多项分布的 MLE);复习题 11.2(系数尺度与边际效应);实证题 E11.1(大衰退中谁更易失业:完整的 LPM/probit/logit 比较流程)。


原书对照

本章内容 原书章节 PDF 页码
章首导言 第 11 章开篇 p.392–393
二元因变量与线性概率模型(Key Concept 11.1,式 11.1–11.3) 11.1 p.393–397
Probit(Key Concept 11.2,式 11.4–11.8) 11.2 p.397–401
Logit(Key Concept 11.3,式 11.9–11.10)与三模型比较 11.2 p.401–403
NLLS、MLE、推断、拟合度量(选读) 11.3 p.404–407
波士顿 HMDA 数据应用(表 11.1–11.2) 11.4 p.407–413
结论、Heckman 与 McFadden 专栏 11.5 p.413–414
小结、习题 第 11 章末 p.415–421
HMDA 数据集 附录 11.1 p.421
最大似然估计、伪 \(R^2\)、delta 方法(式 11.13–11.20) 附录 11.2 p.421–423
其他受限因变量模型(tobit、样本选择、计数、有序、离散选择) 附录 11.3 p.424–426

注:原书页码 = PDF 页码 − 1。