第 19 章 对数线性模型
本章对应 Wasserman 原书第 19 章《Log-Linear Models》。对数线性模型是多维离散数据(多维列联表)的标准建模工具,它把"哪些变量之间有关联、哪些在给定别的变量后条件独立"翻译成"对数概率展开式里哪些项为零"。它与第 17 章介绍的无向图紧密相连。对量化交易而言,这是一章"知道即可"的内容:当你把市场状态、行业、信号、涨跌方向等离散化后做多维交叉表时,它提供了检验条件独立的正规方法。本章做压缩处理,保留核心定理、模型分类和拟合方法。
学习目标
- 会写出离散随机向量的对数线性展开 \(\log f(x)=\sum_{A\subset S}\psi_A(x)\),知道交互项就是(广义)对数优势比。
- 理解定理 19.4:条件独立 \(X_b\amalg X_c\mid X_a\) 等价于所有"跨 \(b\)、\(c\)"的交互项为零。
- 能区分图模型、层次模型与非层次模型,会用生成元记号(如 \(1.2+1.3\))描述层次模型。
- 会用 Poisson GLM 拟合对数线性模型,用 AIC 或偏差(deviance)做模型选择,并知道"逐个检验、未拒绝即接受"的缺陷。
读前导读
这一章在解决什么问题
结论先说:本章把"多维交叉表里谁和谁有关"变成"回归里哪些系数为零",于是可以用熟悉的回归和似然比工具来检验。
你在 CFA 里做过 \(2\times2\) 列联表的卡方独立性检验,例如"信号出现与否 × 次日涨跌"。问题是现实中总有第三个变量(市场状态、行业、市值档)。只看两维表会被第三个变量误导——这就是第 16 章的辛普森悖论。对数线性模型的做法是:对每个格子的概率取对数,写成"总水平 + 各变量主效应 + 两两交互 + 三阶交互……",结构和含交互项的回归一模一样。某个交互项为零,就代表某种独立或条件独立。
和第 17 章的关系:第 17 章的无向图告诉你"缺边 = 给定其余变量条件独立";本章给出离散变量下这句话的参数形式,以及用数据拟合、选择这种图的方法。
需要先想起来的数学
1. 对数把乘法变加法。 \(\log(ab)=\log a+\log b\)。独立意味着 \(f(x,y)=f(x)f(y)\),取对数就变成 \(\log f(x)+\log f(y)\),没有"同时含 \(x\) 和 \(y\)"的项。这正是"交互项为零 ⟺ 独立"的根源。参见 第 00 册第 04 章 级数与收敛 中 e 与指数对数部分。
2. 优势比(odds ratio)。 \(2\times2\) 表中 \(\frac{p_{11}p_{00}}{p_{01}p_{10}}\) 等于 1 时两变量独立,大于 1 时正相关。例:信号出现时上涨 60 次、下跌 40 次;未出现时上涨 50 次、下跌 50 次,优势比 \(=\frac{60\times50}{40\times50}=1.5\),对数优势比 \(\log1.5\approx0.405\)。
3. 示性函数 \(I(\cdot)\)。 \(I(x_2=1)\) 在 \(x_2=1\) 时取 1,否则取 0,作用就是回归里的哑变量(dummy)。
4. 似然比检验与 \(\chi^2\) 分布。 两个嵌套模型的对数似然差的 2 倍,在原假设下近似服从 \(\chi^2\),自由度为参数个数之差。你在第 10a 章见过。符号 \(\rightsquigarrow\) 表示"分布收敛到",见 第 00 册第 07 章 概率中的分析工具。
怎么读这一章
核心必读:例 19.3(理解交互项就是对数优势比)、定理 19.4 的陈述、生成元表格、19.4 节实战与解读。定理 19.4 的证明思路、定义 19.6 与例 19.7 的图模型判别第一次可以只看结论。建议先读例 19.2–19.3,再直接跳到 19.4 节实战建立直觉,然后回头读 19.1.1 与 19.2,最后读 19.3 的模型选择。
19.1 对数线性展开
设 \(X=(X_1,\dots,X_m)\) 是离散随机向量,概率函数 \(f(x)=\mathbb P(X_1=x_1,\dots,X_m=x_m)\)。第 \(j\) 个分量取 \(r_j\) 个值,不妨记为 \(\{0,1,\dots,r_j-1\}\)。\(n\) 个这样的向量就是一个 \(N=r_1\times\cdots\times r_m\) 类的多项分布样本,数据可以写成 \(r_1\times\cdots\times r_m\) 的列联表(contingency table),参数是多项概率 \(p=(p_1,\dots,p_N)\)。
记 \(S=\{1,\dots,m\}\),对子集 \(A\subset S\) 记 \(x_A=(x_j:j\in A)\),例如 \(A=\{1,3\}\) 时 \(x_A=(x_1,x_3)\)。
定理 19.1(对数线性展开,log-linear expansion)。 联合概率函数总可以写成
- \(\psi_\emptyset(x)\) 是常数;
- 每个 \(\psi_A(x)\) 只依赖于 \(x_A\);
- 若 \(i\in A\) 且 \(x_i=0\),则 \(\psi_A(x)=0\)(以 0 为基准水平的识别约束)。
白话解释:这就是"把 \(\log\) 概率表写成带全部交互项的哑变量回归"。三个二元变量时,子集共有 \(2^3=8\) 个:\(\emptyset,\{1\},\{2\},\{3\},\{1,2\},\{1,3\},\{2,3\},\{1,2,3\}\),对应截距、三个主效应、三个两两交互、一个三阶交互。格子也恰好 8 个,所以这个展开总是能写出来(参数数等于格子数),这就是"饱和"的意思。第 3 条约束和回归里"以某一类为基准、哑变量少设一个"是同一回事,否则参数不唯一。
每个 \(\psi_A\) 由一组参数 \(\beta_A\) 决定,合起来记 \(\beta=(\beta_A:A\subset S)\),写作 \(f(x)=f(x;\beta)\)。多项参数 \(p\) 与对数线性参数 \(\beta\) 一一对应,只是两种参数化:多项参数空间是 \(N-1\) 维单纯形,\(\beta\) 的参数空间是 \(\mathbb R^N\) 中一张 \(N-1\) 维曲面(多出来的一维被"概率和为 1"吃掉)。
例 19.2(Bernoulli)。 \(f(x)=p_1^xp_2^{1-x}\),\(p_1=p\),\(p_2=1-p\)。于是
例 19.3(\(2\times3\) 表)。 \(X_1\in\{0,1\}\),\(X_2\in\{0,1,2\}\),概率 \(p_{ij}\)。展开为 \(\log f=\psi_\emptyset+\psi_1+\psi_2+\psi_{12}\),
推导拆解:为什么 \(\beta_5\) 是对数优势比?把四个格子的 \(\log p\) 分别代入展开式: (沿用练习 1 的编号:\(\beta_1=\log p_{00}\),\(\beta_2=\log\frac{p_{10}}{p_{00}}\),\(\beta_3=\log\frac{p_{01}}{p_{00}}\)。) \(\log p_{00}=\beta_1\);\(\log p_{10}=\beta_1+\beta_2\)(只有 \(x_1=1\) 的主效应激活);\(\log p_{01}=\beta_1+\beta_3\)(只有 \(x_2=1\) 的主效应激活);\(\log p_{11}=\beta_1+\beta_2+\beta_3+\beta_5\)。 做"二阶差分":\(\log p_{11}-\log p_{10}-\log p_{01}+\log p_{00}=\beta_5\),即 \(\beta_5=\log\frac{p_{11}p_{00}}{p_{10}p_{01}}\)。主效应在差分中全部抵消,只剩交互。这和双重差分(DID)的逻辑完全一样:交互项衡量"\(x_1\) 的效应是否随 \(x_2\) 变化"。
19.1.1 条件独立与交互项
引理 19.5。 \(X_b\amalg X_c\mid X_a\) 当且仅当 \(f(x_a,x_b,x_c)=g(x_a,x_b)\,h(x_a,x_c)\) 对某两个函数 \(g,h\) 成立。
定理 19.4。 设 \((X_a,X_b,X_c)\) 是 \((X_1,\dots,X_m)\) 的一个划分。\(X_b\amalg X_c\mid X_a\) 当且仅当对数线性展开中所有同时含有 \(b\) 中至少一个坐标和 \(c\) 中至少一个坐标的 \(\psi_t\) 都为零。
证明思路。 若跨 \(b,c\) 的项都为零,那么每个非零的 \(\psi_t\) 要么 \(t\subset a\cup b\),要么 \(t\subset a\cup c\)(只含 \(a\) 的项两边都算到,需减去一次):
推导拆解:用三变量的最小例子走一遍。设 \(a=\{1\}\)、\(b=\{2\}\)、\(c=\{3\}\),要检验 \(X_2\amalg X_3\mid X_1\)。"跨 \(b,c\)"的项是同时含 2 和 3 的项:\(\psi_{23}\) 与 \(\psi_{123}\)。令它们为零,剩下 \(\log f=\underbrace{\psi_\emptyset+\psi_1+\psi_2+\psi_{12}}_{\text{只含 }x_1,x_2}+\underbrace{\psi_3+\psi_{13}}_{\text{只含 }x_1,x_3}\)。 取指数后 \(f=g(x_1,x_2)\,h(x_1,x_3)\)。引理 19.5 的理由是:\(f(x_2,x_3\mid x_1)=f/f(x_1)\),分母只含 \(x_1\),可以并入 \(g\),于是在每个 \(x_1\) 层内,联合概率拆成"只含 \(x_2\)"乘"只含 \(x_3\)",这就是条件独立。
白话解释:符号 \(\psi_t\) 中的 \(t\) 是变量下标的集合;"\(t\subset a\cup b\)"读作"\(t\) 里的变量都来自 \(a\) 或 \(b\)"。
19.2 三类模型:图模型、层次模型、非层次模型
把某些 \(\psi\) 项设为零,就得到一个"子模型"。子模型按约束的性质分成三类。
图模型(graphical model)。 定义 19.6:若存在一张无向图 \(\mathcal G\),使得 \(\psi_A=0\) 当且仅当 \(A\) 中含有某对在图中不相连的顶点,则称模型是图模型。换言之,图模型里"缺失的项"全部来自条件独立约束,没有别的约束。判别口诀:往模型里加一项而图不变,则原模型不是图模型。
例 19.7。 5 个变量,边为 \((1,2),(2,3),(2,5),(3,4),(3,5),(4,5)\)。对应图模型是
层次模型(hierarchical model)。 定义 19.8:若 \(\psi_A=0\) 且 \(A\subset B\) 蕴含 \(\psi_B=0\),则模型是层次的。等价地,高阶项出现时它的所有低阶"子项"都必须出现。
引理 19.9。 图模型一定是层次模型,反之不然。
- 例 19.10:\(\log f=\psi_\emptyset+\psi_1+\psi_2+\psi_3+\psi_{12}+\psi_{13}\)。图为 \(2-1-3\),是图模型,也是层次模型,表达 \(X_2\amalg X_3\mid X_1\)。
- 例 19.11:\(\log f=\psi_\emptyset+\psi_1+\psi_2+\psi_3+\psi_{12}+\psi_{13}+\psi_{23}\)。层次但非图模型:对应的图是完全图,而 \(\psi_{123}=0\) 不对应任何条件独立,称为"无三阶交互"模型(每两个变量的优势比不随第三个变量变化)。
- 例 19.12:\(\log f=\psi_\emptyset+\psi_1+\psi_3+\psi_{12}\)。\(\psi_2=0\) 却有 \(\psi_{12}\ne0\),非层次,当然也非图模型。这类模型很难解释,一般不用。
生成元(generators)记号。 层次模型只需列出"最高阶"的项,低阶项自动包含。三变量时:
| 生成元 | 展开 | 含义 |
|---|---|---|
| \(1.2.3\) | 全部 8 项 | 饱和模型(saturated),等价于无约束多项分布 |
| \(1.2+1.3+2.3\) | 去掉 \(\psi_{123}\) | 无三阶交互 |
| \(1.2+1.3\) | \(\psi_\emptyset+\psi_1+\psi_2+\psi_3+\psi_{12}+\psi_{13}\) | \(X_2\amalg X_3\mid X_1\) |
| \(1.2+3\) | \(\psi_\emptyset+\psi_1+\psi_2+\psi_3+\psi_{12}\) | \(X_3\amalg(X_1,X_2)\) |
| \(1+2+3\) | \(\psi_\emptyset+\psi_1+\psi_2+\psi_3\) | 相互独立 |
| \(1.2\) | \(\psi_\emptyset+\psi_1+\psi_2+\psi_{12}\) | 此外 \(X_3\) 在给定 \((X_1,X_2)\) 时均匀分布 |
白话解释:生成元里的"."表示"放在同一个交互项里","+"表示"并列的块"。读 \(1.2+1.3\) 时,把它想成两张小表:一张 \(X_1\times X_2\),一张 \(X_1\times X_3\),模型只保留这两张表里的关联,没有任何直接连接 \(X_2\) 与 \(X_3\) 的项,所以给定 \(X_1\) 后二者独立。最后一行"\(X_3\) 均匀分布"是因为连主效应 \(\psi_3\) 都没有,\(X_3\) 的每个取值概率相同;这类模型在实务中很少用到。
金融直觉:例 19.11 的"无三阶交互"在量化中有具体含义。设三个变量为信号、次日涨跌、市场状态,\(\psi_{123}=0\) 表示"信号与涨跌之间的优势比在平稳期与高波动期相同"。若 \(\psi_{123}\ne0\),说明信号只在某种状态下有效——这正是"状态依赖型信号"的形式化表述。
19.3 拟合与模型选择
拟合。 对数似然 \(\ell(\beta)=\sum_{i=1}^n\log f(X_i;\beta)\),MLE 一般要数值求解,标准误由 Fisher 信息矩阵(也数值计算)的逆给出。实务中最方便的做法是:把列联表每个格子的计数当作响应变量,用 Poisson 回归(Poisson GLM)、以 \(\log\) 为联系函数、以各变量的示性项及其交互为协变量。可以证明,在给定总数 \(n\) 的条件下,Poisson 似然与多项似然给出相同的 \(\beta\)(截距除外)和相同的偏差。
模型选择本质上与线性回归中的变量选择相同:决定保留哪些 \(\psi\) 项。原书给了两种办法。
-
AIC。 选择使
\[\mathrm{AIC}(M)=\hat\ell(M)-|M|\tag{19.2}\]最大的模型,\(|M|\) 是参数个数(注意 Wasserman 的 AIC 符号约定是"越大越好",等于常见定义 \(-2\hat\ell+2|M|\) 的 \(-1/2\) 倍)。通常只在层次模型里搜索。 -
偏差检验。 定义 19.13:
\[\mathrm{dev}(M)=2(\hat\ell_{\rm sat}-\hat\ell_M).\]定理 19.14:它是检验 \(H_0\):"真模型为 \(M\)" 对 \(H_1\):"真模型为饱和模型" 的似然比统计量,\(H_0\) 下 \(\mathrm{dev}(M)\rightsquigarrow\chi^2_\nu\),\(\nu\) 等于两模型参数个数之差。
白话解释:饱和模型对每个格子都给一个自由参数,能把观测频率拟合得分毫不差,是"最好可能的拟合"。偏差衡量模型 \(M\) 离这个上限差多少。可以把它类比回归中的残差平方和:残差越小拟合越好,但要和自由度对照才知道"小"是否足够小。
用实战输出验证:\(R.S+R.U\) 的对数似然 \(-30.973\),饱和模型 \(-30.466\),偏差 \(=2\times(-30.466+30.973)=1.014\);参数数 \(8-6=2\) 为自由度;\(\mathbb P(\chi^2_2>1.014)\approx0.60\),与表中一致。
为什么能用 Poisson 回归:每个格子的计数可以看成独立的 Poisson 变量,期望 \(\mu_{\text{格}}=n\,p_{\text{格}}\),于是 \(\log\mu=\log n+\log p\)——对数线性展开前面多了一个常数,被截距吸收。这就是"除截距外参数相同"的原因。
原书特别警告:用偏差检验逐个检验子模型、把未被拒绝的都当作合理模型,不是好策略。 原因有二:检验次数多,第一类和第二类错误的机会都多(第 10b 章的多重检验问题);未拒绝 \(H_0\) 可能只是功效太低,结果是因为"数据不够"而接受了一个坏模型。偏差更适合在选定模型后做拟合优度检查。
例 19.15(乳腺癌数据)。 三个变量:治疗中心(center)、肿瘤分级(grade)、生存(survival)。饱和模型中只有截距、survival 和 center×grade 显著;三阶交互估计为 0.12(se 0.40,p = 0.76)。AIC 后向搜索得到的最佳子模型保留 center×grade(−0.67,se 0.18)与 grade×survival(0.37,se 0.19),去掉 center×survival 与三阶项,对应图
即 Center \(\amalg\) Survival \(\mid\) Grade:给定肿瘤分级后,在哪个中心治疗与是否生存无关。拟合优度:偏差 0.6,自由度 \(8-6=2\),p 值 \(\mathbb P(\chi^2_2>0.6)=0.74\),没有证据表明模型拟合差。
19.4 量化实战:检验"信号与涨跌在给定市场状态下条件独立"
场景。 你有一个离散信号 \(S\)(例如"放量突破"是否出现),想知道它是否预测次日方向 \(U\)(涨 / 跌)。直接做 \(S\times U\) 的 \(2\times2\) 卡方检验发现显著。但信号出现的频率和次日涨跌概率都依赖于市场状态 \(R\)(高波动 / 平稳):高波动期信号更常触发,次日下跌也更多。这时 \(S\) 与 \(U\) 的边际相关可能完全由 \(R\) 造成——这就是第 16 章辛普森悖论在离散数据中的形式。对数线性模型的问题等价于:\(S\amalg U\mid R\) 是否成立,即模型 \(R.S+R.U\) 是否足够。
下面的模拟中,真实结构就是 \(S\amalg U\mid R\)。
import warnings; warnings.filterwarnings("ignore")
import numpy as np, pandas as pd, itertools
import statsmodels.api as sm, statsmodels.formula.api as smf
from scipy import stats
rng = np.random.default_rng(19)
# 模拟 3000 个“股票-日”观测:R=市场状态(0平稳/1高波动), S=信号(0无/1有), U=次日方向(0跌/1涨)
# 真实结构:S 与 U 只通过 R 相关联 -> S ⟂ U | R (模型 R.S + R.U)
n = 3000
R = rng.binomial(1, 0.3, n)
S = rng.binomial(1, np.where(R == 1, 0.6, 0.3))
U = rng.binomial(1, np.where(R == 1, 0.42, 0.53))
df = pd.DataFrame({"R": R, "S": S, "U": U})
tab = df.value_counts().rename("count").reset_index()
full = pd.DataFrame(list(itertools.product([0, 1], repeat=3)), columns=["R", "S", "U"])
tab = full.merge(tab, how="left").fillna(0)
print(tab.pivot_table(index=["R", "S"], columns="U", values="count"))
models = {
"R+S+U (完全独立)": "count ~ C(R)+C(S)+C(U)",
"R.S+U": "count ~ C(R)*C(S)+C(U)",
"R.S+R.U (S⟂U|R)": "count ~ C(R)*C(S)+C(R)*C(U)",
"R.S+R.U+S.U (无三阶)": "count ~ (C(R)+C(S)+C(U))**2",
"R.S.U (饱和)": "count ~ C(R)*C(S)*C(U)",
}
rows = []
for name, f in models.items():
m = smf.glm(f, data=tab, family=sm.families.Poisson()).fit()
k = len(m.params)
rows.append([name, k, m.llf, m.deviance, 8 - k,
stats.chi2.sf(m.deviance, 8 - k) if k < 8 else np.nan,
m.llf - k])
out = pd.DataFrame(rows, columns=["模型", "参数数", "对数似然", "偏差dev", "自由度", "p值", "AIC(=ℓ-|M|)"])
pd.set_option("display.width", 200)
print(out.round(3).to_string(index=False))
# 边际上看 S 与 U 是否相关?(忽略 R 时会出现伪相关)
ct = pd.crosstab(df.S, df.U)
chi2, p, _, _ = stats.chi2_contingency(ct, correction=False)
print("忽略 R 的 S-U 列联表卡方检验: chi2=%.2f, p=%.4f" % (chi2, p))
关键输出:
U 0 1
R S
0 0 693.0 788.0
1 298.0 309.0
1 0 207.0 152.0
1 313.0 240.0
模型 参数数 对数似然 偏差dev 自由度 p值 AIC(=ℓ-|M|)
R+S+U (完全独立) 4 -174.324 287.716 4 0.000 -178.324
R.S+U 5 -42.596 24.260 3 0.000 -47.596
R.S+R.U (S⟂U|R) 6 -30.973 1.014 2 0.602 -36.973
R.S+R.U+S.U (无三阶) 7 -30.793 0.654 1 0.419 -37.793
R.S.U (饱和) 8 -30.466 0.000 0 NaN -38.466
忽略 R 的 S-U 列联表卡方检验: chi2=4.02, p=0.0449
解读。 忽略市场状态时,信号与次日方向的卡方检验在 5% 水平下"显著"(p = 0.045),似乎信号有预测力。对数线性模型给出不同结论:\(R.S+R.U\) 的偏差为 1.01(自由度 2,p = 0.60),拟合良好;加入 \(S.U\) 项后偏差只降低 0.36,AIC 反而变差。按 AIC,\(R.S+R.U\) 是最佳模型,即 \(S\amalg U\mid R\)——信号的"预测力"只是市场状态的代理。实务上这提示我们:评估离散信号时,要在状态变量内做条件检验(或用 logistic 回归控制 \(R\),两者在本例中等价,因为 logistic 回归 \(U\sim R+S\) 恰好对应对数线性模型里含 \(R.S\) 的部分)。
同样的方法可以用于:信用评级 × 行业 × 是否违约的三维表;订单类型 × 时段 × 是否成交;多个离散化技术信号的联合依赖结构。变量多于 4–5 个、每个水平较多时,格子会大量为零,此时应改用 logistic 回归或正则化方法。
本章小结
任何离散联合分布都可以写成对数线性展开 \(\log f=\sum_A\psi_A\),交互项是广义对数优势比。条件独立 \(X_b\amalg X_c\mid X_a\) 等价于所有跨 \(b,c\) 的交互项为零,这把条件独立检验转化为"某些参数是否为零"。模型分三层:图模型(只有条件独立约束)⊂ 层次模型(高阶项在则低阶项必在)⊂ 一般模型;层次模型可以用生成元记号简写。拟合用数值 MLE(实务上用 Poisson GLM),模型选择用 AIC 或偏差;逐个检验、未拒绝即接受会掉进多重检验和低功效的陷阱。
| 概念 | 公式 / 要点 |
|---|---|
| 对数线性展开 | \(\log f(x)=\sum_{A\subset S}\psi_A(x)\),\(\psi_A\) 只依赖 \(x_A\),基准水平处为 0 |
| 交互项 | 例:\(\beta_{12}=\log\frac{p_{11}p_{00}}{p_{01}p_{10}}\)(对数优势比) |
| 条件独立 | \(X_b\amalg X_c\mid X_a\) ⇔ 跨 \(b,c\) 的 \(\psi\) 全为 0 |
| 图模型 | \(\psi_A=0\) ⇔ \(A\) 含一对不相连的顶点 |
| 层次模型 | \(\psi_A=0,\ A\subset B\Rightarrow\psi_B=0\);图模型 ⊂ 层次模型 |
| 生成元 | \(1.2+1.3\):含 \(\psi_{12},\psi_{13}\) 及其全部低阶项 |
| AIC(原书约定) | \(\hat\ell(M)-\vert M\vert \),越大越好 |
| 偏差 | \(\mathrm{dev}(M)=2(\hat\ell_{\rm sat}-\hat\ell_M)\rightsquigarrow\chi^2_{\nu}\) |
练习
基础
- 例 19.3 中,用 \(\beta_1,\dots,\beta_6\) 表示全部 \(p_{ij}\)(原书习题 1)。(提示:\(p_{00}=e^{\beta_1}\),\(p_{10}=e^{\beta_1+\beta_2}\),\(p_{01}=e^{\beta_1+\beta_3}\),\(p_{02}=e^{\beta_1+\beta_4}\),\(p_{11}=e^{\beta_1+\beta_2+\beta_3+\beta_5}\),\(p_{12}=e^{\beta_1+\beta_2+\beta_4+\beta_6}\);\(\beta_1\) 由六项和为 1 决定。)
- 证明引理 19.5(原书习题 2)。(提示:若 \(f=gh\),计算 \(f(x_b,x_c\mid x_a)\) 并证明它分解为 \(x_b\) 的函数乘 \(x_c\) 的函数。)
- 说明为什么图模型一定是层次模型(引理 19.9,原书习题 3)。(提示:若 \(A\) 含一对不相连顶点,任何 \(B\supset A\) 也含这对顶点。)
- 三个二元变量,写出生成元为 \(1.3+2\) 的模型的全部 \(\psi\) 项,并说出它表达的独立关系。(答案:\(\psi_\emptyset,\psi_1,\psi_2,\psi_3,\psi_{13}\);\(X_2\amalg(X_1,X_3)\)。)
- 原书习题 5:\(p(x_1,x_2,x_3)\) 正比于下表(列依次为 \((x_2,x_3)=(0,0),(0,1),(1,0),(1,1)\)):\(x_1=0\):2, 8, 4, 16;\(x_1=1\):16, 128, 32, 256。求全部 \(\psi\) 项。(提示:\(\psi_1\) 系数 \(\log8\),\(\psi_2\) 系数 \(\log2\),\(\psi_3\) 系数 \(\log4\),\(\psi_{13}\) 系数 \(\log2\),\(\psi_{12}=\psi_{23}=\psi_{123}=0\)。模型为 \(1.3+2\)。)
进阶
- 原书习题 6:四个二元变量,判断 (a) \(\log f=7+11x_1+2x_2+1.5x_3+17x_4\);(c) \(\log f=7+11x_1+2x_2+1.5x_3+17x_4+12x_2x_3+3x_3x_4+x_1x_4+2x_1x_2\) 是否为图模型、层次模型,并画出独立图。(提示:(a) 是相互独立模型,图无边,图模型;(c) 图为环 \(1-2-3-4-1\),层次,且四条边都不构成三角形,没有可补的高阶项,所以是图模型。)
- 在 19.4 节代码中把
U的生成概率改为同时依赖 \(R\) 和 \(S\)(例如 \(S=1\) 时次日上涨概率再加 0.04),重跑模型比较。在 \(n=3000\) 时 AIC 能否选出 \(R.S+R.U+S.U\)?把 \(n\) 改为 30000 呢?这说明了什么? - 为什么"未被偏差检验拒绝"不足以说明模型正确?用第 10a 章的功效概念解释,并结合第 10b 章说明在 \(2^m\) 个候选子模型中逐个检验的问题。
原书推荐习题:第 19 章习题 1、5、6。
原书对照
| 本章内容 | 原书章节 | PDF 页码 |
|---|---|---|
| 对数线性展开,例 19.2–19.3,定理 19.4 | 19.1 | p.296–299 |
| 图对数线性模型,例 19.7 | 19.2 | p.299–301 |
| 层次模型,例 19.10–19.12 | 19.3 | p.301–302 |
| 生成元 | 19.4 | p.302–303 |
| 拟合、AIC、偏差,例 19.15 | 19.5 | p.303–305 |
| 文献注(Whittaker 1990;Bishop et al. 1975) | 19.6 | p.305 |
| 习题 | 19.7 | p.306 |