第 03a 章 Jordan 标准形、最小多项式与线性动态
对应原书:Horn & Johnson《Matrix Analysis》第 2 版,第 3 章 Canonical Forms for Similarity and Triangular Factorizations 的 3.0–3.4.1 节(书 p.163–203,PDF p.183–223)。第 3 章其余部分(Weyr 标准形、LU 分解)见第 03b 章。
第 02a、02b 章用酉相似把矩阵化成上三角(Schur),用酉等价化成对角(SVD)。本章回到一般的相似变换,回答第 01 章留下的问题:两个矩阵什么时候相似?不能对角化的矩阵"最简"能化成什么样? 答案是 Jordan 标准形。对量化而言,Jordan 形的价值不在于计算(它数值上不稳定,实际中不应计算),而在于理解线性动态:VAR/AR 模型、差分方程、线性微分方程的解中为什么会出现 \(h\lambda^h\)、\(te^{\lambda t}\) 这样的项,单位根为什么有"\(I(1)\)"和"\(I(2)\)"之分,马尔可夫链何时收敛、收敛到什么。最小多项式和友矩阵则把 AR(\(p\)) 模型与矩阵理论直接连起来。
学习目标
读完本章,你应当能够:
- 写出 Jordan 块与 Jordan 矩阵,陈述 Jordan 标准形定理,理解其存在性的"三步走"思路。
- 用秩序列 \(\operatorname{rank}(A-\lambda I)^k\) 求 Weyr 特征与各阶 Jordan 块的个数,从而判定两个矩阵是否相似。
- 用 Jordan 形分析 \(A^m\) 与 \(e^{At}\):收敛 ⇔ \(\rho(A)<1\),幂有界 ⇔ 单位圆上的特征值半单;理解 Jordan 块如何产生"驼峰型"脉冲响应与多项式增长。
- 掌握最小多项式:可对角化 ⇔ 最小多项式无重根;会用友矩阵表示 AR(\(p\)) 过程并判断平稳性。
- 了解 Jordan 分解(可对角化 + 幂零)、Drazin 逆与马尔可夫链长期分布的关系,以及实 Jordan 形中的振荡块。
读前导读
这一章在解决什么问题。 你在 CFA 里见过 AR(1):\(y_t=\phi y_{t-1}+\varepsilon_t\),\(|\phi|<1\) 就平稳,冲击按 \(\phi^h\) 衰减。多变量时(VAR、多因子利率模型、信用评级迁移矩阵),\(\phi\) 变成矩阵 \(A\),冲击的 \(h\) 期影响变成 \(A^h\)。要看懂 \(A^h\) 怎么变化,最方便的办法是换一组坐标,让 \(A\) 变得尽量简单——这叫"相似变换" \(A=SJS^{-1}\),于是 \(A^h=SJ^hS^{-1}\)。如果 \(A\) 能对角化,\(J\) 就是对角阵,每个方向各自按 \(\lambda^h\) 衰减,和标量 AR(1) 一模一样。麻烦在于有些矩阵不能对角化,这时最简单只能化到 Jordan 形:对角线上是特征值,紧挨着对角线上方还残留一些 1。这些 1 正是脉冲响应里 \(h\lambda^h\)(先升后降的"驼峰")、\(I(2)\) 过程里线性增长的来源。本章就是讲:这种"最简形"一定存在、唯一,以及怎样不用真的算出它就能读出它的结构(秩序列、最小多项式)。
对你最有用的结论只有几条:\(A^h\to0\) 当且仅当所有特征值模小于 1(VAR 平稳条件);单位圆上的特征值如果有大于 \(1\times1\) 的 Jordan 块,就会出现多项式增长;AR(\(p\)) 可以写成一个"友矩阵"的 VAR(1),平稳性就变成友矩阵的特征值问题。其余大量定理是为这些结论服务的工具。
需要先想起来的数学。
- 特征值与特征向量:\(Av=\lambda v\),即 \(A\) 作用在方向 \(v\) 上只是拉伸 \(\lambda\) 倍。例:\(A=\begin{bmatrix}2&0\\0&0.5\end{bmatrix}\),\(e_1\) 方向拉伸 2 倍,\(e_2\) 方向压缩一半。\(\rho(A)\)(谱半径)是所有特征值模的最大值。见 第 00 册第 06 章 线性代数速成。
- 秩与零空间:\(\operatorname{rank}M\) 是 \(M\) 线性无关的列数;\(n-\operatorname{rank}M\) 是方程 \(Mx=0\) 解空间的维数。例:\(\begin{bmatrix}0&1\\0&0\end{bmatrix}\) 秩为 1,所以 \(Mx=0\) 只有一维解。本章反复用"\(n-\operatorname{rank}(A-\lambda I)\) = 特征值 \(\lambda\) 的独立特征向量个数"。
- 相似:\(B=S^{-1}AS\) 表示同一个线性映射在另一组基(坐标系)下的矩阵。相似矩阵有相同的特征值、秩、迹、行列式——就像同一笔现金流用美元或欧元记账,数字变了,经济实质没变。
- 多项式的整除与重根:\((t-1)^2\) 有重根 1,\((t-1)(t-2)\) 没有重根。"\(q\) 整除 \(p\)"写作 \(q\mid p\),意思是 \(p=q\cdot h\)。
- 二项式定理与 \(e^x\) 的级数:\((a+b)^m=\sum_j\binom mj a^{m-j}b^j\);\(e^{x}=\sum_j x^j/j!\),矩阵指数 \(e^{At}\) 也用这个级数定义。见 第 00 册第 04 章 级数与收敛。
符号提示:\(\oplus\) 表示"直和",即把几个方阵沿对角线拼成分块对角阵,其余位置补 0;\(M_n\) 表示全部 \(n\times n\) 复矩阵;\(\#\{\cdots\}\) 表示集合里元素的个数;\(\sim\) 表示"相似于"。
怎么读这一章。 核心必读:3.2(Jordan 块长什么样)、3.3.1 的定理陈述与 \(S\) 列的含义(证明可以只看思路)、3.3.2、3.4.1–3.4.2(秩序列怎么读出块结构)、3.5(为什么不能数值计算)、3.6.1(幂的收敛,全章最重要)、3.7.2 的推论 3.3.8、3.8(友矩阵与 AR(\(p\))),以及实战 1、3。第一遍可以跳过或只看结论:3.3.1 的归纳证明细节、3.4.3 的习题推论列表、3.6.3–3.6.4、3.6.7(选读)、3.8.3、3.9 中推论 3.4.1.7 之后的内容。建议顺序:先读 3.2 → 3.6.1 → 3.8 抓住"动态"主线,再回头读 3.3–3.4 理解结构从何而来。
3.1 相似分类问题
3.1.1 一个例子
原书 3.0 节的例子:
两者特征值都是四个 0,特征多项式、迹、行列式、秩(都是 2)全部相同。但 \(A^2=0\) 而 \(B^2\ne0\),所以不相似(若 \(A=SBS^{-1}\),则 \(A^2=SB^2S^{-1}\))。可见第 01 章那些不变量不足以判断相似。
白话解释:把 \(A\) 想成一个"移位"操作。\(A\) 把 \(e_2\) 送到 \(e_1\)、\(e_4\) 送到 \(e_3\),其余送到 0——两条长度为 2 的链 \(e_2\to e_1\to0\)、\(e_4\to e_3\to0\),所以作用两次后全部归零。\(B\) 是一条长度为 3 的链 \(e_3\to e_2\to e_1\to0\) 加一个孤立的 \(e_4\to0\),作用两次后 \(e_3\) 还剩 \(e_1\)。特征值、迹、行列式只看"对角线上有什么",看不出"链有多长"。本章的全部工作,就是找到能刻画链长的不变量(秩序列)。
3.1.2 标准形的思路
对一个等价关系,标准形(canonical form) 是从每个等价类中挑出的一个代表,要求:(a) 每个类都有代表;(b) 不同代表互不等价。判断两个矩阵是否等价,就把它们都化成代表,看是否相同。前面已经见过两个例子:正规矩阵在酉相似下的标准形是对角阵(谱定理);任意矩阵在酉等价下的标准形是奇异值对角阵(SVD)。
对一般相似:
- 上三角阵太大:同一相似类中有许多不同的上三角阵(Schur 形不唯一),不满足 (b)。
- 对角阵太小:有些相似类根本不含对角阵(如 \(\begin{bmatrix}0&1\\0&0\end{bmatrix}\)),不满足 (a)。
Jordan 矩阵恰好介于两者之间:每个复方阵都相似于一个 Jordan 矩阵;两个 Jordan 矩阵相似当且仅当它们的块相同(不计顺序);而且在整个相似类中,没有矩阵的非零非对角元比 Jordan 形更少。
3.2 Jordan 块与 Jordan 矩阵
定义 3.1.1 Jordan 块 \(J_k(\lambda)\) 是 \(k\times k\) 上三角矩阵,对角线上是 \(k\) 个 \(\lambda\),第一超对角线上是 \(k-1\) 个 1,其余为 0:
Jordan 矩阵是 Jordan 块的直和
块大小 \(n_i\) 和特征值 \(\lambda_i\) 都允许重复。
幂零 Jordan 块 \(N=J_k(0)\) 是"移位算子":\(Ne_{i+1}=e_i\),\(Ne_1=0\)。它的幂把 1 逐条往右上推:\(N^p\) 的第 \(p\) 条超对角线全为 1,其余为 0;\(N^p=0\)(\(p\ge k\))。所以
还有一个技术性等式(引理 3.1.4):\(J_k(0)^TJ_k(0)=\begin{bmatrix}0&0\\0&I_{k-1}\end{bmatrix}\),于是 \([I-J_k(0)^TJ_k(0)]x=(x^Te_1)e_1\),存在性证明要用它。
关于单个 Jordan 块的基本事实(3.1.P5):\(J_k(\lambda)\) 的特征值 \(\lambda\) 代数重数为 \(k\),几何重数为 1(特征空间只有 \(e_1\) 方向)。
白话解释:两个"重数"是本章最常用的词。代数重数是 \(\lambda\) 在特征多项式里作为根出现的次数("账面上数到几个 \(\lambda\)");几何重数是 \(Ax=\lambda x\) 有几个线性无关的解("实际找得到几个独立方向")。以 \(J_2(\lambda)=\begin{bmatrix}\lambda&1\\0&\lambda\end{bmatrix}\) 为例:对角线上有两个 \(\lambda\),代数重数 2;但 \((J_2(\lambda)-\lambda I)x=\begin{bmatrix}x_2\\0\end{bmatrix}=0\) 只要求 \(x_2=0\),解只有 \(e_1\) 一个方向,几何重数 1。"账面"比"实际"多出来的部分,就是对角化失败的那部分。
3.3 Jordan 标准形定理
3.3.1 存在性:三步走
- 第 1 步(Schur,2.3.1):任意复矩阵相似(甚至酉相似)于上三角阵,相同的特征值排在一起。
- 第 2 步(分块对角化,2.4.6.1):用 Sylvester 方程把不同特征值之间的耦合消掉,相似于 \(T_{11}\oplus\cdots\oplus T_{dd}\),每个 \(T_{ii}\) 上三角且对角元都等于 \(\lambda_i\)。
- 第 3 步(本节):对角元全相等的上三角阵相似于 Jordan 矩阵。
第 3 步只需处理 \(T_{ii}-\lambda_iI\),即严格上三角(幂零)矩阵。
定理 3.1.5 严格上三角的 \(A\in M_n\) 相似于 \(J_{n_1}(0)\oplus\cdots\oplus J_{n_m}(0)\),\(n_1\ge\cdots\ge n_m\ge1\)。\(A\) 实时相似变换可取实。
证明思路(对 \(n\) 归纳) 写 \(A=\begin{bmatrix}0&a^T\\0&A_1\end{bmatrix}\),由归纳假设把 \(A_1\) 化为 Jordan 形 \(J_{k_1}\oplus J\)(\(J_{k_1}\) 是最大块)。于是 \(A\) 相似于
利用 \((I-J^T_{k_1}J_{k_1})x=(x^Te_1)e_1\) 做一次相似,把 \(a_1^T\) 化成只剩第一个分量 \((a_1^Te_1)e_1^T\)。分两种情况:
- 若 \(a_1^Te_1\ne0\),缩放后左上角变成 \(J_{k_1+1}(0)\)(第一行接上了最大块),剩下的右上耦合 \(e_1a_2^T\) 可以借助 \(\tilde Je_{i+1}=e_i\) 一步步往下推,因为 \(J^{k_1}=0\),至多 \(k_1\) 步后消失。结果 \(A\sim J_{k_1+1}(0)\oplus J\)。
- 若 \(a_1^Te_1=0\),把 \(J_{k_1}\) 置换到最前面,剩下一个更小的严格上三角矩阵,用归纳假设。∎
这个证明本质上是一个算法(原书说明它遵循 Fletcher–Sorensen 的算法推导),但见 3.5 节的数值警告。
定理 3.1.11(Jordan 标准形定理) 对任意 \(A\in M_n\),存在非奇异 \(S\) 使
Jordan 矩阵 \(J_A\) 在块的排列意义下由 \(A\) 唯一决定,称为 \(A\) 的 Jordan 标准形。若 \(A\) 实且特征值全实,\(S\) 可取实。
\(S\) 的列有清楚的意义:对一个块 \(J_k(\lambda)\),对应的 \(k\) 列 \(s_1,\dots,s_k\) 满足
\(s_1\) 是特征向量,其余是一条"广义特征向量链"。
推导拆解:这组链式方程直接来自 \(AS=SJ\)(把 \(A=SJS^{-1}\) 两边右乘 \(S\))。看 \(SJ\) 的第 \(j\) 列:\(J_k(\lambda)\) 的第 1 列是 \(\lambda e_1\),所以 \(As_1=\lambda s_1\);第 \(j\ge2\) 列是 \(e_{j-1}+\lambda e_j\),所以 \(As_j=s_{j-1}+\lambda s_j\),移项即 \((A-\lambda I)s_j=s_{j-1}\)。反复作用得 \((A-\lambda I)^js_j=0\):\(s_j\) 不是特征向量,但被 \((A-\lambda I)\) 作用 \(j\) 次后归零,所以叫"广义"特征向量。 以 \(2\times2\) 为例:\(A=\begin{bmatrix}1&1\\0&1\end{bmatrix}\),\(s_1=e_1\) 是特征向量,\(s_2=e_2\) 满足 \((A-I)e_2=e_1\)。在动态 \(x_{h+1}=Ax_h\) 里,从 \(s_2\) 出发的状态每一期都"漏"一点到 \(s_1\) 方向,漏的量逐期累积,这就是 \(h\lambda^{h-1}\) 项的来源(见 3.6.1)。
3.3.2 Jordan 矩阵的结构读法
对 \(J=J_{n_1}(\lambda_1)\oplus\cdots\oplus J_{n_k}(\lambda_k)\)(3.2.1 节):
- 块数 \(k\) = 线性无关特征向量的最大个数;\(J\) 可对角化 ⇔ 所有块都是 \(1\times1\)。
- 特征值 \(\lambda\) 的块数 = 几何重数;块大小之和 = 代数重数。所以几何重数 ≤ 代数重数(3.2.6),相等时称 \(\lambda\) 半单(semisimple),即其 Jordan 块都是 \(1\times1\)。
- 特征值 \(\lambda\) 的最大块阶数称为 \(\lambda\) 的指标(index)。
3.4 唯一性:秩序列、Weyr 特征与 Segre 特征
3.4.1 秩序列决定一切
唯一性的证明用到两个事实:相似矩阵同时减去同一个 \(\lambda I\) 仍相似;秩是相似不变量。若 \(A=SJS^{-1}\),则 \((A-\lambda I)^k\sim(J-\lambda I)^k\)。把 \(J\) 中特征值为 \(\lambda\) 的块记作 \(J_{m_1}(\lambda),\dots,J_{m_p}(\lambda)\),其余块减去 \(\lambda I\) 后可逆,贡献固定的秩 \(m=n-\sum m_i\):
定义秩序列与 Weyr 特征:
由 \(\operatorname{rank}J_\ell(0)^{k-1}-\operatorname{rank}J_\ell(0)^k=1\)(\(k\le\ell\))或 \(0\)(\(k>\ell\)),得到
于是:
- \(w_1\) = 块数 = 几何重数;
- \(w_k-w_{k+1}\) = 阶数恰为 \(k\) 的块数;等价地 \(r_{k-1}-2r_k+r_{k+1}\)(3.1.P7);
- \(w_1\ge w_2\ge\cdots\);\(\lambda\) 的指标 \(q\) 是使 \(r_k=r_{k+1}\) 的最小 \(k\);\(w_1+\cdots+w_q\) = 代数重数。
推导拆解:为什么 \(w_k\) 恰好数出"阶数 \(\ge k\) 的块"? 第 1 步,由 3.2 节 \(\operatorname{rank}J_\ell(0)^k=\max\{\ell-k,0\}\):每作用一次,长度为 \(\ell\) 的链就"缩短"一格,秩减 1,直到减到 0 不再变。 第 2 步,\(w_k=r_{k-1}-r_k\) 是第 \(k\) 次作用时秩减少的总量。公式里与 \(\lambda\) 无关的常数 \(m\) 在相减时抵消。 第 3 步,一个长度为 \(\ell\) 的块在第 \(k\) 次作用时秩减 1 当且仅当 \(\ell\ge k\)(链还没缩没),否则减 0。所以总减少量 = 长度 \(\ge k\) 的块的个数。 小例子:\(J_2(0)\oplus J_1(0)\),\(r_0=3,r_1=1,r_2=0\),所以 \(w_1=2\)(两个块)、\(w_2=1\)(一个块长度 \(\ge2\)),\(w_1-w_2=1\) 个 \(1\times1\) 块,\(w_2-w_3=1\) 个 \(2\times2\) 块。
引理 3.1.18 \(A,B\) 相似 ⇔ 它们的不同特征值相同,且对每个特征值 \(\lambda\) 和每个 \(k\),\(w_k(A,\lambda)=w_k(B,\lambda)\)(等价地,\(\operatorname{rank}(A-\lambda I)^k=\operatorname{rank}(B-\lambda I)^k\),3.1.P28)。
3.4.2 例子
原书例 (3.1.16a):\(J=J_3(0)\oplus J_3(0)\oplus J_2(0)\oplus J_2(0)\oplus J_2(0)\oplus J_1(0)\),\(n=13\)。
| \(k\) | 0 | 1 | 2 | 3 | 4 |
|---|---|---|---|---|---|
| \(r_k=\operatorname{rank}J^k\) | 13 | 7 | 2 | 0 | 0 |
| \(w_k=r_{k-1}-r_k\) | 6 | 5 | 2 | 0 |
读法:\(w_1=6\) 个块;\(w_1-w_2=1\) 个 \(1\times1\) 块,\(w_2-w_3=3\) 个 \(2\times2\) 块,\(w_3-w_4=2\) 个 \(3\times3\) 块。
Segre 特征是块大小的降序列表:上例为 \(3,3,2,2,2,1\)。Weyr 特征 \(6,5,2\) 与 Segre 特征 \(3,3,2,2,2,1\) 是同一个整数 13 的共轭分拆:画一个点图(Young 图),第 \(k\) 行放 \(w_k\) 个点,则各列的长度就是 Segre 特征(3.1.P11)。
w1 = 6: ● ● ● ● ● ●
w2 = 5: ● ● ● ● ●
w3 = 2: ● ●
列长: 3 3 2 2 2 1 ← Segre 特征
回到 (3.0.0):\(A\) 的 Jordan 形是 \(J_2(0)\oplus J_2(0)\)(\(r_1=2,r_2=0\)),\(B\) 是 \(J_3(0)\oplus J_1(0)\)(\(r_1=2,r_2=1,r_3=0\))。\(r_2\) 不同,所以不相似。
3.4.3 几个推论(3.1 节习题)
- 3.1.P8:\(A^2=0\)、秩 \(r\) ⇒ Jordan 形为 \(J_2(0)^{\oplus r}\oplus0_{n-2r}\)。
- 3.1.P9:\(J_n(0)^2\) 的 Jordan 形:\(n=2m\) 时为 \(J_m(0)\oplus J_m(0)\),\(n=2m+1\) 时为 \(J_{m+1}(0)\oplus J_m(0)\)。(平方会把一个幂零块"劈开"。)
- 3.1.P14:\(A\) 与 \(A^T\) 相似(Weyr 特征相同)。
- 3.1.P15:秩一矩阵 \(xy^*\) 的 Jordan 形:\(y^*x\ne0\) 时为 \([y^*x]\oplus0_{n-1}\),\(y^*x=0\) 时为 \(J_2(0)\oplus0_{n-2}\)。秩一矩阵可对角化 ⇔ 迹非零。
- 3.1.P16:\(\lambda\ne0\) 时 \(J_k(\lambda)^{-1}\) 的 Jordan 形是 \(J_k(\lambda^{-1})\)。
- 3.1.P4:\(A\) 相似于 \(cA\)(某个 \(|c|\ne1\))⇒ \(A\) 幂零;幂零矩阵对所有 \(c\ne0\) 都相似于 \(cA\)。
- 3.1.P21:不可约上 Hessenberg 矩阵每个特征值几何重数为 1;因此 Hermite 三对角矩阵(次对角元非零)的特征值互异。
- 3.1.P25:\(A\) 可对角化 ⇔ 对每个特征值,\((A-\lambda I)^2x=0\Rightarrow(A-\lambda I)x=0\)。
- 3.1.P19(Heisenberg 群):矩阵 \(A_{x,y,t}=\begin{bmatrix}1&x^T&t\\0&I_n&y\\0&0&1\end{bmatrix}\) 构成群,其 Jordan 形按 \(x^Ty\ne0\) 等情形分为 \(J_3(1)\oplus I_{n-1}\)、\(J_2(1)\oplus J_2(1)\oplus I_{n-2}\)、\(J_2(1)\oplus I_n\)、\(I_{n+2}\),且总与其逆相似。注意:原书把乘法律印作 \(A_{x,y,t}A_{\xi,\eta,\tau}=A_{x+\xi,y+\eta,t+\tau}\),按矩阵乘法直接计算,右上角应为 \(t+\tau+x^T\eta\),即 \(A_{x,y,t}A_{\xi,\eta,\tau}=A_{x+\xi,\,y+\eta,\,t+\tau+x^T\eta}\)。这不影响"构成群"的结论。
3.5 数值警告:Jordan 形不能用浮点数计算
上面的推导是一个显式算法,但原书明确提醒它不适合在软件中计算。例:
\(\epsilon\ne0\) 时 Jordan 形是对角阵;\(\epsilon\to0\) 时它趋于 \(J_1(0)\oplus J_1(0)=0\),但 \(A_\epsilon\to A_0=\begin{bmatrix}0&0\\1&0\end{bmatrix}\),后者的 Jordan 形是 \(J_2(0)\)。元素的微小变化导致 Jordan 形突变,相似变换 \(S_\epsilon\) 也趋于奇异。根源是秩不是元素的连续函数,而 Jordan 结构完全由秩决定。
实践原则:需要非对称矩阵的结构信息时,用 Schur 分解(酉变换,稳定);Jordan 形只用于理论分析。 实战 2 会定量展示两者的差别。
金融直觉:这和"用估计出的 VAR 系数判断是否有重根"是同一个问题。你从数据估出的 \(\hat A\) 带抽样误差,两个真实相等的特征值几乎一定被估成两个略有差别的数,于是 \(\hat A\)"可以对角化"——但对角化所需的特征向量矩阵 \(S\) 几乎奇异,条件数巨大(实战 1 中达到 \(4\times10^8\))。用这样的 \(S\) 去分解脉冲响应,结果对误差极度敏感。所以实务上不问"Jordan 形是什么",而是问"\(\|A^h\|\) 如何随 \(h\) 变化",后者是稳定的。
推论 3.1.21(\(\epsilon\)-Jordan 形) 对任意 \(\epsilon\ne0\),\(A\) 相似于把 Jordan 形超对角线上的 1 换成 \(\epsilon\) 的矩阵(用 \(\operatorname{diag}(1,\epsilon,\epsilon^2,\dots)\) 做相似)。这在理论上很有用:它说明可以找到一个基,使 \(A\) "几乎是对角的";原书第 5 章用同类的对角缩放技巧构造使 \(\|A\|\) 任意接近 \(\rho(A)\) 的矩阵范数。代价是 \(\epsilon\to0\) 时相似矩阵的条件数趋于无穷。
3.6 Jordan 形的推论
3.6.1 矩阵幂:收敛与幂有界
这是对量化最重要的推论。\(A^m=SJ^mS^{-1}\),只需看单个 Jordan 块。由二项式定理和 \(N=J_k(0)\) 的幂零性(\(N^k=0\)),
即 \(J_k(\lambda)^m\) 是上三角 Toeplitz 矩阵,第 \(j\) 条超对角线上是 \(\binom mj\lambda^{m-j}\)。例如
- 若 \(0<|\lambda|<1\):\(|\binom mj\lambda^{m-j}|\le\frac{m^j|\lambda|^m}{j!|\lambda|^j}\to0\)(指数衰减压过多项式增长)。
- 若 \(|\lambda|=1\) 且 \(k\ge2\):超对角元 \(m\lambda^{m-1}\) 的模为 \(m\),无界。
推导拆解:为什么能用二项式定理?二项式定理 \((a+b)^m=\sum\binom mj a^{m-j}b^j\) 对矩阵成立的前提是 \(a,b\) 可交换(\(ab=ba\))。这里 \(a=\lambda I\) 是纯量矩阵,与任何矩阵交换,所以可以用。又因为 \(N^j=0\)(\(j\ge k\)),求和到 \(j=k-1\) 就截断。 以 \(J_2(\lambda)\) 为例逐项写出:\(J_2(\lambda)^m=\lambda^mI+m\lambda^{m-1}N\),即 \(\begin{bmatrix}\lambda^m&m\lambda^{m-1}\\0&\lambda^m\end{bmatrix}\)。取 \(\lambda=0.8\):\(m=1,2,3,4,5\) 时右上元为 \(1,\ 1.6,\ 1.92,\ 2.048,\ 2.048\),然后才开始下降。指数衰减最终总会赢过多项式增长,但在赢之前有一段"放大期"。 上面不等式的来源:\(\binom mj=\frac{m(m-1)\cdots(m-j+1)}{j!}\le\frac{m^j}{j!}\),再拆 \(|\lambda|^{m-j}=|\lambda|^m/|\lambda|^j\)。\(m^j|\lambda|^m\to0\) 是"多项式乘以几何衰减趋于 0",可用 \(\ln(m^j|\lambda|^m)=j\ln m+m\ln|\lambda|\to-\infty\) 看出(\(\ln m\) 的增长远慢于 \(m\))。
定理 3.2.5.2 (a) \(A\) 收敛(\(A^m\to0\))⇔ \(\rho(A)<1\);(b) \(A\) 幂有界(\(\{A^m\}\) 有界)⇔ \(\rho(A)\le1\),且模为 1 的特征值都半单(对应 Jordan 块都是 \(1\times1\))。
半收敛(3.2.P37) \(\lim_{k\to\infty}A^k\) 存在 ⇔ \(\rho(A)\le1\),且单位圆上只能有特征值 1,且 1 半单。此时
\((I-A)^D\) 是 Drazin 逆(3.6.6 节)。马尔可夫转移矩阵 \(P\) 正是这种情形(特征值 1 半单):极限矩阵的每一行都是长期分布。
白话解释:三种情况对应三种长期行为。收敛:所有模态都衰减,冲击最终消失(平稳 VAR)。半收敛:特征值 1 的模态原样保留、其余衰减,系统停在一个依赖初值的稳态上(马尔可夫链收敛到长期分布;评级迁移最终全部落入违约吸收态)。幂有界但不收敛:单位圆上还有 \(-1\) 或复特征值 \(e^{i\theta}\),系统永远振荡或旋转,不爆炸也不收敛(实战 3 中的周期链)。三种情况共同的"禁区"是:单位圆上的特征值带有 \(2\times2\) 以上的 Jordan 块,那会导致多项式增长。
量化翻译:
- VAR(1) \(x_{t+1}=Ax_t+\varepsilon_t\) 平稳 ⇔ \(\rho(A)<1\)。\(h\) 期脉冲响应 \(A^h\) 中,若某个特征值 \(\lambda\) 有 \(k\times k\) Jordan 块,就会出现 \(h\lambda^h,\ h^2\lambda^h,\dots,h^{k-1}\lambda^h\) 型的项——驼峰型(hump-shaped)响应:先升后降。重根 AR(2) 的脉冲响应恰为 \((h+1)r^h\)(实战 1)。
- 单位根:特征值 1 半单(\(1\times1\) 块)时,\(A^h\) 有界,对应 \(I(1)\) 随机游走式的"持久但不爆炸";若特征值 1 有 \(J_2(1)\) 块,\(A^h\) 中出现 \(h\) 的线性增长,对应 \(I(2)\) 过程(如"价格的变化量本身是随机游走")。积分阶数在矩阵层面就是单位根的 Jordan 块大小。
- 协整分析(Johansen 检验)关心 \(\Pi=A-I\) 的秩,正是特征值 1 的几何重数问题:\(\operatorname{rank}\Pi=n-\#\{\text{特征值 1 的 Jordan 块}\}\)。详见第 06 册。
3.6.2 线性微分方程组
初值问题 \(x'(t)=Ax(t)\),\(x(0)=x_0\) 的解是 \(x(t)=e^{At}x_0\)。令 \(A=SJS^{-1}\)、\(y=S^{-1}x\),不同 Jordan 块互不耦合。对单块 \(J_m(\lambda)\),\(y_i'=\lambda y_i+y_{i+1}\),自下而上解得
结论(3.2.2):解的每个分量形如
\(p_i\) 是多项式,次数严格小于 \(\lambda_i\) 的指标。实特征值给出指数项,复特征值 \(a\pm ib\) 给出 \(e^{at}\cos bt\)、\(e^{at}\sin bt\) 型振荡。
量化翻译:多因子 Ornstein–Uhlenbeck 或仿射利率模型 \(dx=A(x-\theta)dt+\Sigma dW\) 的均值路径就是 \(e^{At}\)。特征值实部决定均值回复速度,虚部带来周期性;若均值回复矩阵有 \(J_2(-\kappa)\) 块("临界阻尼"),条件均值中出现 \(te^{-\kappa t}\):一个因子的偏离先把另一个因子推离均值,之后才一起回归。
原书 3.3.P27 还指出:\(n\) 阶常系数线性 ODE \(y^{(n)}+a_{n-1}y^{(n-1)}+\cdots+a_0y=0\) 化为一阶系统后,系数矩阵的转置正是友矩阵(3.8 节)。
3.6.3 矩阵与其转置相似,任何矩阵是两个对称矩阵之积
反序矩阵 \(K_m\)(反对角线全 1)满足 \(K_mJ_m(\lambda)K_m=J_m(\lambda)^T\)。拼起来得:
定理 3.2.3.1 对任意 \(A\),存在非奇异对称矩阵 \(S\) 使 \(A^T=SAS^{-1}\)。
定理 3.2.3.2 每个复方阵都是两个复对称矩阵之积,且可任选其中一个非奇异。实方阵经实对称矩阵相似于其转置。
3.6.4 交换与非减次矩阵
\(p(A)\) 总与 \(A\) 交换。反过来,与 \(A\) 交换的矩阵是否都是 \(A\) 的多项式?对 \(A=I\) 显然不是(\(I\) 与一切矩阵交换,而 \(p(I)\) 只能是纯量矩阵)。关键在于 \(A\) 是否"足够一般"。
定义 3.2.4.1 \(A\) 称为非减次(nonderogatory),若每个特征值的几何重数都是 1,即每个不同特征值在 Jordan 形中只有一个块。例:特征值互异的矩阵;相似于单个 Jordan 块的矩阵。
与单个 Jordan 块 \(J_m(\lambda)\) 交换的矩阵恰好是上三角 Toeplitz 矩阵,也就是 \(J_m(0)\) 的多项式。由此:
定理 3.2.4.2 若 \(A\) 非减次,\(B\) 与 \(A\) 交换,则存在次数 \(\le n-1\) 的多项式 \(p\) 使 \(B=p(A)\)。反之亦然(3.2.P2)。
3.6.5 Jordan 分解:可对角化 + 幂零
每个 Jordan 块 \(J_k(\lambda)=\lambda I+J_k(0)\)。把 Jordan 形拆成对角部分 \(D\) 和幂零部分 \(N\),得
\(A_D\) 可对角化,\(A_N\) 幂零,且 \(A_DA_N=A_NA_D\)。这叫 Jordan 分解。它是唯一的(3.2.P18):若 \(A=B+C\),\(BC=CB\),\(B\) 可对角化、\(C\) 幂零,则 \(B=A_D\)、\(C=A_N\)。\(A_D,A_N\) 都是 \(A\) 的多项式。
用途:\(e^{At}=e^{A_Dt}e^{A_Nt}\)(因为交换),而 \(e^{A_Nt}=\sum_{j<k}\frac{t^j}{j!}A_N^j\) 是有限和——这就是 3.6.2 中多项式因子的来源。
3.6.6 Drazin 逆
满足 \(AXA=A\) 的 \(X\) 称为广义逆。除了第 02b 章基于 SVD 的 Moore–Penrose 伪逆,还有一种基于 Jordan 结构的广义逆。
定义 3.2.12.1 把 \(A\) 写成 \(A=S\begin{bmatrix}B&0\\0&N\end{bmatrix}S^{-1}\),\(B\) 非奇异(所有非零特征值的块),\(N\) 幂零(零特征值的块)。Drazin 逆
它与 \(S\) 的选取无关。设 \(q\) 为零特征值的指标,\(A^D\) 是满足以下三条的唯一矩阵:
性质:\(A\) 可逆时 \(A^D=A^{-1}\);\(Ax=\lambda x\)(\(\lambda\ne0\))⇒ \(A^Dx=\lambda^{-1}x\);\(A^D\) 是 \(A\) 的多项式;\(AA^D\) 与 \(I-AA^D\) 是互补投影(3.2.P22);\(A^D=\lim_{t\to0}(A^{k+1}+tI)^{-1}A^k\)(\(k\ge q\),3.2.P23)。
白话解释:Drazin 逆的做法是"能逆的部分照常求逆,逆不了的部分(零特征值那一块)直接置零"。为什么这样定义有用?以马尔可夫链为例,\(I-P\) 在长期分布方向上是 0(因为 \(\pi P=\pi\)),不可逆;但在其余"会衰减的"方向上可逆。\((I-P)^D\) 只在衰减方向上求逆,相当于把 \(\sum_{k\ge0}(P^k-P^\infty)\) 这类"偏离稳态的累计量"加总起来——平均首达时间、期望违约年数这类量正是这样的累计量。\(I-(I-P)(I-P)^D\) 则是把衰减部分全部剔除后剩下的投影,即长期分布。
与伪逆的区别:伪逆关心正交结构(range 与 kernel 的正交补),Drazin 逆关心动力学结构(特征值的 Jordan 分解)。马尔可夫链的长期分布、平均首达时间、"基本矩阵"都用 \(I-P\) 的 Drazin 逆(指标为 1 时也称群逆)表达。
3.6.7 其他推论(选读)
- \(AB\) 与 \(BA\)(3.2.11.1):对每个非零特征值,\(AB\) 与 \(BA\) 的 Jordan 结构完全相同;零特征值的结构可以不同(3.2.P21 给出 \(J_3(0)\) 与 \(J_2(0)\oplus J_1(0)\) 的例子)。第 01 章的高维 PCA 对偶技巧在 Jordan 层面也成立。
- 秩一扰动的 Jordan 形(3.2.13.1):若特征值 \(\lambda\) 有非正交的左右特征向量 \(x,y\)(\(y^*x\ne0\)),则 \(A+xv^*\) 把 \(\lambda\) 移到 \(\lambda+v^*x\),其余 Jordan 结构完全不变。3.2.P28 的 Google 矩阵 \(cA+(1-c)\lambda xv^*\) 把其余特征值整体乘以 \(c\),块结构不变。
- 最优性(3.2.9.5):在一个相似类中,Jordan 形的非零非对角元个数最少(为 \(n\) 减块数)。证明借助"岛与桥"的图论论证:置换相似下不可分解的 \(m\times m\) 矩阵至少有 \(m-1\) 个非零非对角元。
- 块上三角的指标(3.2.10.1):块上三角矩阵中特征值 \(\lambda\) 的指标不超过各对角块中指标之和。
- 伴随矩阵的 Jordan 形(3.2.P9–P12)、相似的消去律(3.2.P13–P15):\(A\oplus B\sim A\oplus C\iff B\sim C\)。
3.7 最小多项式
3.7.1 定义与基本性质
若 \(p(A)=0\),称多项式 \(p\) 零化(annihilate) \(A\)。Cayley–Hamilton 说特征多项式零化 \(A\),但可能有次数更低的。
定理 3.3.1 存在唯一的次数最低的首一零化多项式 \(q_A\),称为最小多项式(minimal polynomial);任何零化多项式都被 \(q_A\) 整除。
证明用带余除法:\(p=q_Ah+r\),\(\deg r<\deg q_A\),代入 \(A\) 得 \(r(A)=0\),由最小性 \(r=0\)。
推论 3.3.3–3.3.4 相似矩阵有相同的最小多项式;\(q_A\mid p_A\);\(q_A\) 的根恰好是 \(A\) 的全部特征值。因此若 \(p_A(t)=\prod(t-\lambda_i)^{s_i}\),则 \(q_A(t)=\prod(t-\lambda_i)^{r_i}\),\(1\le r_i\le s_i\)。
最小多项式不是完全的相似不变量:\(J_2(0)\oplus J_2(0)\) 与 \(J_2(0)\oplus0_2\) 的最小多项式都是 \(t^2\)、特征多项式都是 \(t^4\),但不相似。(3.3.P1:\(3\times3\) 幂零矩阵恰好由最小多项式区分,\(4\times4\) 就不行了。)
3.7.2 与 Jordan 形的关系
定理 3.3.6 \(q_A(t)=\prod_{i=1}^d(t-\lambda_i)^{r_i}\),\(r_i\) 是 \(\lambda_i\) 的指标(最大 Jordan 块的阶)。
理由:\(J_k(\lambda)\) 被 \((t-\lambda)^k\) 零化但不被更低次幂零化;直和的零化多项式要同时零化每个块,所以取各特征值的最大块。
推论 3.3.8(可对角化的实用判据) 设 \(A\) 的不同特征值为 \(\lambda_1,\dots,\lambda_d\),令 \(q(t)=(t-\lambda_1)\cdots(t-\lambda_d)\)。则
原书强调这个判据在已知不同特征值时确实实用:不需要求任何特征向量,只要算一个矩阵乘积。
推导拆解:为什么 \(q(A)=0\) 就等价于可对角化?换到 Jordan 坐标下看单个块 \(J_k(\lambda_i)\)。\(q(J)\) 里只有因子 \((J-\lambda_iI)\) 在这个块上是幂零的 \(N\),其他因子 \((J-\lambda_jI)\)(\(j\ne i\))在这个块上都是可逆的(对角元 \(\lambda_i-\lambda_j\ne0\))。可逆矩阵乘 \(N\) 等于 0 当且仅当 \(N=0\),即 \(k=1\)。所以 \(q(A)=0\) ⇔ 每个块都是 \(1\times1\) ⇔ 可对角化。 数值例:\(A=\begin{bmatrix}1&1\\0&1\end{bmatrix}\),唯一特征值 1,\(q(t)=t-1\),\(q(A)=\begin{bmatrix}0&1\\0&0\end{bmatrix}\ne0\),不可对角化;\(A=\begin{bmatrix}1&1\\0&2\end{bmatrix}\),\(q(A)=(A-I)(A-2I)=\begin{bmatrix}0&1\\0&1\end{bmatrix}\begin{bmatrix}-1&1\\0&0\end{bmatrix}=0\),可对角化。
推论 3.3.10 以下等价:\(q_A\) 是互异一次因子之积;每个特征值都是 \(q_A\) 的单根;\(A\) 可对角化。
由此立得一批"可对角化"结论(3.3.P3、3.2.P7):幂等矩阵(\(A^2=A\),最小多项式整除 \(t(t-1)\))、对合矩阵(\(A^2=I\))、\(A^3=A\)、\(A^k=I\) 的矩阵都可对角化。OLS 的帽子矩阵 \(H\) 是幂等的,所以可对角化,特征值只有 0 和 1。
求最小多项式的算法:(1) 求特征值及代数重数;(2) 对每个 \(\lambda_i\),\(r_i\) 是使 \(\operatorname{rank}(A-\lambda_iI)^k=\operatorname{rank}(A-\lambda_iI)^{k+1}\) 的最小 \(k\)(3.3.P2)。原书 3.3.P5 还给出不需要特征值的算法:把 \(I,A,A^2,\dots\) 拉直成向量依次做 Gram–Schmidt,第一次出现线性相关时的组合系数就是最小多项式的系数。例(3.3.P6):\(\begin{bmatrix}1&1\\0&2\end{bmatrix}\)、\(\begin{bmatrix}1&1\\0&1\end{bmatrix}\)、\(I_2\) 的最小多项式分别是 \((t-1)(t-2)\)、\((t-1)^2\)、\(t-1\)。
其他结论:直和的最小多项式是各块最小多项式的最小公倍式(3.3.P8);\(\deg q_A\le\operatorname{rank}A+1\)(3.3.P22);秩一矩阵的最小多项式是 \(t(t-\operatorname{tr}A)\)(3.3.P35);\(\{p(A)\}\) 构成的代数维数等于 \(\deg q_A\)(3.3.P15)。例(3.3.P9):\(5\times5\) 矩阵 \(p_A=(t-4)^3(t+6)^2\)、\(q_A=(t-4)^2(t+6)\),则 Jordan 形为 \(J_2(4)\oplus J_1(4)\oplus J_1(-6)\oplus J_1(-6)\)。
3.8 友矩阵与 AR(\(p\)) 模型
3.8.1 友矩阵
反问题:给定首一多项式
是否有矩阵以它为最小多项式?原书构造
\(C(p)e_k=e_{k+1}\)(\(k<n\)),即 \(e_k=C^{k-1}e_1\),而 \(Ce_n=-\sum a_ie_{i+1}\) 正好给出 \(p(C)e_1=0\),进而 \(p(C)e_k=C^{k-1}p(C)e_1=0\)。更低次的首一多项式 \(q\) 若零化 \(C\),则 \(q(C)e_1=e_{m+1}+\cdots=0\),与 \(e_1,\dots,e_{m+1}\) 线性无关矛盾。
定理 3.3.14 每个首一多项式既是其友矩阵(companion matrix) 的最小多项式,也是特征多项式。
定理 3.3.15 以下等价:(a) \(\deg q_A=n\);(b) \(p_A=q_A\);(c) \(A\) 非减次;(d) \(A\) 相似于 \(p_A\) 的友矩阵。特别地,友矩阵总是非减次的:每个特征值只有一个 Jordan 块。所以友矩阵可对角化 ⇔ 特征值互异(3.3.P23)。
友矩阵还有转置、反序等几种等价写法(3.3.P11),它们彼此相似。
3.8.2 AR(\(p\)) 的状态空间形式
AR(\(p\)) 过程 \(y_t=\phi_1y_{t-1}+\cdots+\phi_py_{t-p}+\varepsilon_t\) 取状态 \(s_t=(y_t,y_{t-1},\dots,y_{t-p+1})^T\),写成一阶系统
\(\Phi\) 是多项式 \(t^p-\phi_1t^{p-1}-\cdots-\phi_p\) 的友矩阵的一种形式(与 (3.3.12) 相差转置和反序,相似)。于是:
- 平稳 ⇔ \(\rho(\Phi)<1\) ⇔ \(t^p-\phi_1t^{p-1}-\cdots-\phi_p\) 的根都在单位圆内(等价于时间序列教材里"\(1-\phi_1z-\cdots-\phi_pz^p\) 的根都在单位圆外")。
- \(\Phi\) 非减次:重根一定对应一个大 Jordan 块,不可能是"重根但可对角化"。所以 AR(\(p\)) 只要有重特征根,脉冲响应里就一定有 \(h\lambda^h\) 项。
- 脉冲响应 \(\psi_h=e_1^T\Phi^he_1\);\(h\) 步预测 \(E_ts_{t+h}=\Phi^hs_t\)。
推导拆解:以 AR(2) \(y_t=\phi_1y_{t-1}+\phi_2y_{t-2}+\varepsilon_t\) 为例逐行验证。状态 \(s_t=(y_t,y_{t-1})^T\),\(\Phi=\begin{bmatrix}\phi_1&\phi_2\\1&0\end{bmatrix}\)。第一行:\(y_t=\phi_1y_{t-1}+\phi_2y_{t-2}+\varepsilon_t\),就是模型本身;第二行:\(y_{t-1}=y_{t-1}\),只是把旧值"往下挪一格"存起来。特征多项式 \(\det(tI-\Phi)=t^2-\phi_1t-\phi_2\)。 代入实战 1 的重根情形 \(\phi_1=1.6,\phi_2=-0.64\):\(t^2-1.6t+0.64=(t-0.8)^2\),重根 0.8。由于第二行那个固定的 1,\(\Phi-0.8I=\begin{bmatrix}0.8&-0.64\\1&-0.8\end{bmatrix}\ne0\),秩为 1,几何重数只有 1,必然是 \(J_2(0.8)\)——这就是"友矩阵非减次"在 AR(2) 上的样子。 两种"根在单位圆内/外"的说法互为倒数关系:\(z\) 是 \(1-\phi_1z-\phi_2z^2\) 的根 ⇔ \(t=1/z\) 是 \(t^2-\phi_1t-\phi_2\) 的根。
VAR(\(p\)) 同理,状态矩阵是分块友矩阵。
3.8.3 友矩阵的奇异值与根的界
任意 \(n\) 个复数都可以是友矩阵的特征值,但奇异值受严格限制(3.3.P13):对 (3.3.12) 型友矩阵,记 \(s=|a_0|^2+|a_1|^2+\cdots+|a_{n-1}|^2\),则 \(\sigma_2=\cdots=\sigma_{n-1}=1\),且
对友矩阵用 Schur 不等式 \(\sum|\lambda_i|^2\le\|C\|_F^2=(n-1)+s\),得到多项式根的界(3.3.P33):
有理标准形(了解,3.3.P32):把 Jordan 块按"每轮每个特征值取一个最大块"重新组合,每组对应一个友矩阵,得到 \(A\sim C_1\oplus\cdots\oplus C_r\),各友矩阵的多项式 \(p_1,\dots,p_r\)(不变因子)满足 \(p_{j+1}\mid p_j\),\(p_1=q_A\),\(p_1\cdots p_r=p_A\)。它的好处是只需有理运算、不需求特征值,对任意域成立。
3.9 实 Jordan 标准形
实矩阵的非实特征值成共轭对出现。由于 \(\operatorname{rank}(A-\lambda I)^k=\operatorname{rank}\overline{(A-\lambda I)^k}=\operatorname{rank}(A-\bar\lambda I)^k\),共轭特征值的 Weyr 特征相同:非实特征值的 Jordan 块以同样大小的共轭对出现。
一对 \(J_k(\lambda)\oplus J_k(\bar\lambda)\) 经置换相似变成以 \(D(\lambda)=\operatorname{diag}(\lambda,\bar\lambda)\) 为对角块、\(I_2\) 为超对角块的块双对角阵;再用
逐块相似,得到实的块矩阵
定理 3.4.1.5(实 Jordan 标准形) 每个 \(A\in M_n(\mathbf R)\) 经实相似相似于
\(a_k+ib_k\)(\(b_k>0\))是非实特征值,\(\mu_j\) 是实特征值。证明:在 \(\mathbf C\) 上相似已经得到,再用"两个实矩阵复相似则实相似"(原书定理 1.3.29,见第 01 章)。
推论 3.4.1.10 实可对角化矩阵经实相似化为 \(C(a_j,b_j)\) 块与实 \(1\times1\) 块的直和。这正是实系数线性系统 \(x_{t+1}=Ax_t\) 中振荡模态的标准表示:\(C(a,b)=r\begin{bmatrix}\cos\theta&\sin\theta\\-\sin\theta&\cos\theta\end{bmatrix}\),每期乘 \(r=|\lambda|\)、转 \(\theta=\arg\lambda\),伪周期 \(2\pi/\theta\)。
金融直觉:复特征值听上去抽象,在实数世界里它就是"旋转加缩放"。设 \(\lambda=0.8e^{i0.5}\),把二维状态(例如产出缺口与通胀,或两个相互影响的利差)看成平面上的一个点,每期把它绕原点转 0.5 弧度(约 29°)、离原点的距离乘 0.8。投影到某一个坐标上看,就是一条振幅逐期缩小的正弦波,转满一圈约需 \(2\pi/0.5\approx12.6\) 期——这就是实战 1 里复根 AR(2) 脉冲响应先正后负的原因。商业周期、库存周期这类"有节奏的均值回复",在线性模型里都靠这种 \(C(a,b)\) 块表达。
推论 3.4.1.7 复矩阵 \(A\) 相似于某个实矩阵 ⇔ 对每个非实特征值,\(J_k(\lambda)\) 与 \(J_k(\bar\lambda)\) 个数相同 ⇔ \(A\) 相似于 \(\bar A\)。推论 3.4.1.9:对任意 \(A\),\(A\bar A\) 相似于 \(\bar AA\),且相似于实矩阵(第 04b 章"共轭相似"的基础)。
量化实战
实战 1:AR(2) 的三种根、驼峰响应与单位根的 Jordan 块
import numpy as np
from scipy.linalg import expm
def companion(phi):
"""AR(p) y_t = φ1 y_{t-1} + ... + φp y_{t-p} 的状态矩阵(友矩阵的转置形式)"""
p = len(phi)
A = np.zeros((p, p)); A[0] = phi; A[1:, :-1] = np.eye(p - 1)
return A
def irf(phi, H):
A = companion(phi); e1 = np.eye(len(phi))[0]
return np.array([(np.linalg.matrix_power(A, h) @ e1)[0] for h in range(H)])
# ---------- 1. 三个 AR(2):互异实根、重根(Jordan 块)、复根 ----------
cases = {"互异实根 0.9, 0.5": [1.4, -0.45],
"重根 0.8(J_2)": [1.6, -0.64],
"复根 0.8e^{±i0.5}": [2 * 0.8 * np.cos(0.5), -0.64]}
for name, phi in cases.items():
A = companion(phi)
lam, S = np.linalg.eig(A)
geo = [int(2 - np.linalg.matrix_rank(A - l * np.eye(2), tol=1e-6)) for l in lam]
print("%-18s 特征值 %s 几何重数 %s cond(S) = %.2e"
% (name, np.round(lam, 4), geo, np.linalg.cond(S)))
H = 13
r = 0.8
psi = irf([1.6, -0.64], H)
print("\n重根 AR(2) 脉冲响应:", psi[:8].round(4))
print("理论 (h+1) r^h :", np.array([(h + 1) * r ** h for h in range(8)]).round(4))
print("h=3 与 h=4 处的响应: %.4f, %.4f(连续极值点 -1/ln r - 1 = %.2f)" % (psi[3], psi[4], -1 / np.log(r) - 1))
print("互异根 AR(2) 脉冲响应:", irf([1.4, -0.45], 8).round(4))
print("复根 AR(2) 脉冲响应:", irf(cases["复根 0.8e^{±i0.5}"], 8).round(4))
# ---------- 2. 单位根与 Jordan 块:幂有界 vs 多项式增长 ----------
for name, A in [("I_2(两个独立随机游走)", np.eye(2)),
("J_2(1)(I(2) 过程)", np.array([[1.0, 1.0], [0.0, 1.0]])),
("diag(1, 0.5)(一个单位根)", np.diag([1.0, 0.5]))]:
print("%-26s ‖A^50‖ = %7.2f ‖A^100‖ = %7.2f" % (name, np.linalg.norm(np.linalg.matrix_power(A, 50), 2),
np.linalg.norm(np.linalg.matrix_power(A, 100), 2)))
# ---------- 3. 连续时间:临界阻尼的均值回复 x' = A x,A = J_2(-κ) ----------
kappa = 0.5
A = np.array([[-kappa, 1.0], [0.0, -kappa]])
for t in [1.0, 2.0, 4.0]:
E = expm(A * t)
print("t=%.0f e^{At} = [[%.4f, %.4f],[0, %.4f]] 理论右上元 t·e^{-κt} = %.4f"
% (t, E[0, 0], E[0, 1], E[1, 1], t * np.exp(-kappa * t)))
关键输出:
互异实根 0.9, 0.5 特征值 [0.9+0.j 0.5+0.j] 几何重数 [1, 1] cond(S) = 7.39e+00
重根 0.8(J_2) 特征值 [0.8+0.j 0.8+0.j] 几何重数 [1, 1] cond(S) = 4.15e+08
复根 0.8e^{±i0.5} 特征值 [0.7021+0.3835j 0.7021-0.3835j] 几何重数 [1, 1] cond(S) = 4.03e+00
重根 AR(2) 脉冲响应: [1. 1.6 1.92 2.048 2.048 1.9661 1.835 1.6777]
理论 (h+1) r^h : [1. 1.6 1.92 2.048 2.048 1.9661 1.835 1.6777]
h=3 与 h=4 处的响应: 2.0480, 2.0480(连续极值点 -1/ln r - 1 = 3.48)
互异根 AR(2) 脉冲响应: [1. 1.4 1.51 1.484 1.3981 1.2895 1.1762 1.0664]
复根 AR(2) 脉冲响应: [ 1. 1.4041 1.3316 0.9711 0.5113 0.0965 -0.1918 -0.331 ]
I_2(两个独立随机游走) ‖A^50‖ = 1.00 ‖A^100‖ = 1.00
J_2(1)(I(2) 过程) ‖A^50‖ = 50.02 ‖A^100‖ = 100.01
diag(1, 0.5)(一个单位根) ‖A^50‖ = 1.00 ‖A^100‖ = 1.00
t=1 e^{At} = [[0.6065, 0.6065],[0, 0.6065]] 理论右上元 t·e^{-κt} = 0.6065
t=2 e^{At} = [[0.3679, 0.7358],[0, 0.3679]] 理论右上元 t·e^{-κt} = 0.7358
t=4 e^{At} = [[0.1353, 0.5413],[0, 0.1353]] 理论右上元 t·e^{-κt} = 0.5413
读法:
- 重根情形,特征值 0.8 的几何重数是 1(友矩阵非减次),Jordan 形是 \(J_2(0.8)\)。
numpy.linalg.eig仍然返回两个"特征向量",但它们几乎平行,特征向量矩阵的条件数 \(4\times10^8\)——这就是 3.5 节说的"在 Jordan 块附近,对角化在数值上崩溃"。 - 重根 AR(2) 的脉冲响应精确等于 \((h+1)0.8^h\),在 \(h=3,4\) 达到峰值 2.05 后才衰减:冲击的影响先被放大一倍多。互异实根的响应也有驼峰但较平缓;复根的响应在第 6 期穿过零线,呈阻尼振荡(伪周期 \(2\pi/0.5\approx12.6\) 期)。
- 单位根:\(I_2\) 与 \(\operatorname{diag}(1,0.5)\) 的幂有界(特征值 1 半单);\(J_2(1)\) 的 \(\|A^h\|\) 线性增长,这就是 \(I(2)\) 过程的预测方差以 \(h^3\) 速度增长的矩阵根源。
- 连续时间临界阻尼:\(e^{J_2(-\kappa)t}\) 的右上元恰为 \(te^{-\kappa t}\),在 \(t=1/\kappa=2\) 处达到最大。
实战 2:用秩序列"读出" Jordan 结构;可对角化判据;Jordan 与 Schur 的稳定性对比
import numpy as np
from scipy.linalg import block_diag, schur
rng = np.random.default_rng(0)
def jordan_block(lam, k):
return lam * np.eye(k) + np.diag(np.ones(k - 1), 1)
def weyr(A, lam, tol=1e-8):
"""由秩序列 r_k = rank (A - λI)^k 求 Weyr 特征 w_k = r_{k-1} - r_k"""
n = A.shape[0]; M = A - lam * np.eye(n); r = [n]; P = np.eye(n)
while True:
P = P @ M
r.append(int(np.linalg.matrix_rank(P, tol=tol)))
if r[-1] == r[-2]:
break
return [r[k - 1] - r[k] for k in range(1, len(r) - 1)], r
def segre_from_weyr(w):
w = list(w) + [0]
return sorted([k for k in range(1, len(w)) for _ in range(w[k - 1] - w[k])], reverse=True)
# ---------- 1. 原书例 (3.1.16a):J = J3⊕J3⊕J2⊕J2⊕J2⊕J1(特征值 0),再加一个 J2(2) ----------
blocks = [jordan_block(0, 3), jordan_block(0, 3), jordan_block(0, 2), jordan_block(0, 2),
jordan_block(0, 2), jordan_block(0, 1), jordan_block(2.0, 2)]
J = block_diag(*blocks)
n = J.shape[0]
Q, _ = np.linalg.qr(rng.normal(size=(n, n))) # 用随机正交相似把结构"藏起来"
A = Q @ J @ Q.T
for lam in [0.0, 2.0]:
w, r = weyr(A, lam)
print("λ=%.0f 秩序列 r_k = %s Weyr 特征 = %s Segre(块大小)= %s" % (lam, r, w, segre_from_weyr(w)))
# ---------- 2. 最小多项式判定可对角化:q(t) = Π (t - λ_i) 是否零化 A ----------
def is_diagonalizable(A, distinct, tol=1e-8):
P = np.eye(A.shape[0])
for l in distinct:
P = P @ (A - l * np.eye(A.shape[0]))
return np.linalg.norm(P) < tol * max(1, np.linalg.norm(A)) ** len(distinct)
D = Q @ np.diag([0, 0, 0, 1, 1, 2, 2, 2, 3, 3, 3, 3, 3, 3, 3]) @ Q.T
print("\n对角化后藏起来的矩阵: q(A)=0 ?", is_diagonalizable(D, [0, 1, 2, 3]))
print("上面的 Jordan 型矩阵: q(A)=0 ?", is_diagonalizable(A, [0, 2]))
print(" (A)(A-2I) 的 Frobenius 范数 = %.3f;A^3(A-2I)^2 的范数 = %.2e(最小多项式 t^3 (t-2)^2)"
% (np.linalg.norm(A @ (A - 2 * np.eye(n))),
np.linalg.norm(np.linalg.matrix_power(A, 3) @ np.linalg.matrix_power(A - 2 * np.eye(n), 2))))
# ---------- 3. Jordan 形的数值不稳定 vs Schur 形的稳定 ----------
Jn = jordan_block(0.0, 6)
for eps in [1e-6, 1e-12]:
E = np.zeros((6, 6)); E[5, 0] = eps
lam, S = np.linalg.eig(Jn + E)
print("\nε=%.0e 特征值模 = %s(理论 ε^{1/6} = %.4f) cond(特征向量矩阵) = %.1e"
% (eps, np.abs(lam).round(4), eps ** (1 / 6), np.linalg.cond(S)))
T, Z = schur(Jn + E, output="complex")
print(" Schur 因子 Z 的条件数 = %.1f,‖Z T Z* - A‖ = %.1e" % (np.linalg.cond(Z), np.linalg.norm(Z @ T @ Z.conj().T - (Jn + E))))
关键输出:
λ=0 秩序列 r_k = [15, 9, 4, 2, 2] Weyr 特征 = [6, 5, 2] Segre(块大小)= [3, 3, 2, 2, 2, 1]
λ=2 秩序列 r_k = [15, 14, 13, 13] Weyr 特征 = [1, 1] Segre(块大小)= [2]
对角化后藏起来的矩阵: q(A)=0 ? True
上面的 Jordan 型矩阵: q(A)=0 ? False
(A)(A-2I) 的 Frobenius 范数 = 5.831;A^3(A-2I)^2 的范数 = 2.53e-14(最小多项式 t^3 (t-2)^2)
ε=1e-06 特征值模 = [0.1 0.1 0.1 0.1 0.1 0.1](理论 ε^{1/6} = 0.1000) cond(特征向量矩阵) = 1.0e+05
Schur 因子 Z 的条件数 = 1.0,‖Z T Z* - A‖ = 3.7e-15
ε=1e-12 特征值模 = [0.01 0.01 0.01 0.01 0.01 0.01](理论 ε^{1/6} = 0.0100) cond(特征向量矩阵) = 1.0e+10
Schur 因子 Z 的条件数 = 1.0,‖Z T Z* - A‖ = 7.1e-15
读法:
- 把原书例 (3.1.16a) 的 Jordan 矩阵(再加一个 \(J_2(2)\))用随机正交相似"藏起来",只靠 \(\operatorname{rank}(A-\lambda I)^k\) 就完整读回了块结构:\(\lambda=0\) 的秩序列 \(15,9,4,2\)(多出的 2 是 \(J_2(2)\) 贡献的可逆部分,对应公式中的 \(m\)),Weyr 特征 \(6,5,2\),Segre 特征 \(3,3,2,2,2,1\)。这里能成功,是因为矩阵是精确构造的、秩的阈值容易设定;对带噪声的估计矩阵,秩的判断本身就不可靠。
- 可对角化判据:只需检查 \(\prod(A-\lambda_iI)\) 是否为零。Jordan 型矩阵不满足,而 \(A^3(A-2I)^2=0\),最小多项式是 \(t^3(t-2)^2\)——指数恰好是两个特征值的指标(最大块阶 3 和 2)。
- 在 \(J_6(0)\) 的角上放 \(10^{-12}\),特征值移动到模 \(10^{-2}\)(放大 \(10^{10}\) 倍),"特征向量矩阵"的条件数 \(10^{10}\);而 Schur 分解的酉因子条件数恒为 1,重构误差在机器精度。结论与 3.5 节一致:对非对称矩阵,相信 Schur,不要相信 Jordan。
实战 3:信用评级迁移矩阵的长期行为与 Drazin 逆
场景:年度信用评级迁移矩阵(A、B、C 三个评级加违约 D,违约为吸收态)。用半收敛定理计算长期分布,用基本矩阵计算期望违约时间。
import numpy as np
def drazin(A, tol=1e-10):
"""A^D = A^l (A^{2l+1})^+ A^l,l ≥ index(A);index 由秩序列稳定点确定"""
n = A.shape[0]; l = 0; r_prev = n; P = np.eye(n)
while True:
P = P @ A; r = np.linalg.matrix_rank(P, tol=tol)
if r == r_prev:
break
r_prev, l = r, l + 1
Al = np.linalg.matrix_power(A, l)
return Al @ np.linalg.pinv(np.linalg.matrix_power(A, 2 * l + 1)) @ Al, l
# ---------- 1. 信用评级迁移(年度),D 为吸收态 ----------
states = ["A", "B", "C", "D"]
P = np.array([[0.90, 0.08, 0.015, 0.005],
[0.05, 0.85, 0.08, 0.02],
[0.01, 0.09, 0.80, 0.10],
[0.00, 0.00, 0.00, 1.00]])
lam = np.linalg.eigvals(P)
print("特征值:", np.sort_complex(lam).round(4))
M = np.eye(4) - P
MD, idx = drazin(M)
print("I-P 的零特征值指标 =", idx, "(=1 说明特征值 1 半单)")
print("Drazin 三条件:", np.allclose(M @ MD, MD @ M), np.allclose(M @ M @ MD, M), np.allclose(MD @ M @ MD, MD))
Lim = np.eye(4) - M @ MD
print("lim P^k = I - (I-P)(I-P)^D =\n", Lim.round(6))
print("P^500 =\n", np.linalg.matrix_power(P, 500).round(6))
# 违约前的期望年数 = 基本矩阵 N = (I - Q)^{-1} 的行和(Q 为非吸收态子块)
Nf = np.linalg.inv(np.eye(3) - P[:3, :3])
print("从 A/B/C 出发的期望违约时间(年):", Nf.sum(axis=1).round(2))
# ---------- 2. 周期链:特征值 -1 在单位圆上,P^k 不收敛 ----------
Pc = np.array([[0, 1.0], [1.0, 0]])
print("\n周期链特征值:", np.linalg.eigvals(Pc), " P^100 =", np.linalg.matrix_power(Pc, 100).ravel(),
" P^101 =", np.linalg.matrix_power(Pc, 101).ravel())
# Cesàro 平均仍收敛到 I - (I-P)(I-P)^D
McD, _ = drazin(np.eye(2) - Pc)
avg = sum(np.linalg.matrix_power(Pc, k) for k in range(1000)) / 1000
print("Cesàro 平均:", avg.ravel().round(4), " I-(I-P)(I-P)^D:", (np.eye(2) - (np.eye(2) - Pc) @ McD).ravel().round(4))
关键输出:
特征值: [0.7313+0.j 0.8521+0.j 0.9666+0.j 1. +0.j]
I-P 的零特征值指标 = 1 (=1 说明特征值 1 半单)
Drazin 三条件: True True True
lim P^k = I - (I-P)(I-P)^D =
[[-0. -0. -0. 1.]
[-0. -0. 0. 1.]
[ 0. 0. -0. 1.]
[ 0. 0. 0. 1.]]
P^500 =
[[0. 0. 0. 1.]
[0. 0. 0. 1.]
[0. 0. 0. 1.]
[0. 0. 0. 1.]]
从 A/B/C 出发的期望违约时间(年): [36.8 29.71 20.21]
周期链特征值: [ 1.+0.j -1.+0.j] P^100 = [1. 0. 0. 1.] P^101 = [0. 1. 1. 0.]
Cesàro 平均: [0.5 0.5 0.5 0.5] I-(I-P)(I-P)^D: [0.5 0.5 0.5 0.5]
读法:
- 迁移矩阵的特征值 1 半单(\(I-P\) 的零特征值指标为 1),其余特征值都在单位圆内,所以 \(P^k\) 收敛(半收敛定理),极限 \(I-(I-P)(I-P)^D\) 与 \(P^{500}\) 一致:长期看所有发行人都违约(吸收态)。收敛速度由第二大特征值 0.9666 决定,半衰期约 \(\ln0.5/\ln0.9666\approx20\) 年。
- Drazin 逆用公式 \(A^D=A^l(A^{2l+1})^+A^l\)(\(l\ge\) 指标)计算,并验证了三条刻画等式。这个公式用的是伪逆,但结果是 Drazin 逆——两种广义逆在这里配合使用。
- 非吸收子块 \(Q\) 的基本矩阵 \((I-Q)^{-1}\) 的行和给出期望违约时间:A 级约 36.8 年、C 级约 20.2 年。\(\rho(Q)<1\) 保证了 \((I-Q)^{-1}=\sum_kQ^k\) 收敛。
- 周期链的特征值 \(-1\) 在单位圆上,\(P^k\) 在两个矩阵之间来回跳,不收敛;但时间平均(Cesàro 平均)仍收敛到 \(I-(I-P)(I-P)^D\)。这一点超出原书范围,属于马尔可夫链理论的标准结论,这里只做数值演示。
本章小结
Jordan 标准形回答了"两个矩阵何时相似":每个复方阵都相似于 Jordan 块的直和,块结构在排列意义下唯一。存在性分三步——Schur 三角化、用 Sylvester 方程分块对角化、把幂零上三角阵化成幂零 Jordan 块;唯一性来自秩序列 \(r_k=\operatorname{rank}(A-\lambda I)^k\),Weyr 特征 \(w_k=r_{k-1}-r_k\) 是阶数不小于 \(k\) 的块数,与 Segre 特征(块大小列表)互为共轭分拆。Jordan 形在理论上是分析线性动态的利器:\(J_k(\lambda)^m\) 含 \(\binom mj\lambda^{m-j}\) 项,所以收敛 ⇔ \(\rho(A)<1\),幂有界 ⇔ 单位圆上的特征值半单,半收敛矩阵的极限是 \(I-(I-A)(I-A)^D\);\(e^{At}\) 的分量是 \(e^{\lambda t}\) 乘以次数低于指标的多项式。但 Jordan 形由秩决定,秩不连续,所以它在数值上极不稳定,实践中应使用 Schur 分解。最小多项式 \(q_A=\prod(t-\lambda_i)^{r_i}\) 的指数是各特征值的指标,可对角化 ⇔ 最小多项式无重根 ⇔ \(\prod(A-\lambda_iI)=0\)。友矩阵的最小多项式和特征多项式都等于给定多项式,非减次矩阵恰好相似于友矩阵;AR(\(p\)) 的状态矩阵就是友矩阵,所以重特征根必然产生 Jordan 块和驼峰型响应。实矩阵有实 Jordan 形,复特征值对应旋转–伸缩块 \(C(a,b)\)。Jordan 分解(可对角化 + 幂零、交换、唯一)和 Drazin 逆是两个常用的副产品。
| 概念/公式 | 表达式 | 用途 |
|---|---|---|
| Jordan 块 | \(J_k(\lambda)=\lambda I+N\),\(N^k=0\) | |
| Jordan 标准形 | \(A=SJS^{-1}\),块结构唯一 | 相似分类 |
| 秩序列 | \(r_k=\operatorname{rank}(A-\lambda I)^k\) | 判定相似 |
| Weyr 特征 | \(w_k=r_{k-1}-r_k=\#\{\text{阶}\ge k\text{ 的块}\}\) | |
| 恰为 \(k\) 阶的块数 | \(w_k-w_{k+1}=r_{k-1}-2r_k+r_{k+1}\) | |
| 几何/代数重数 | \(w_1\) / \(\sum w_k\) | 半单性 |
| Jordan 块的幂 | \(J_k(\lambda)^m=\sum_j\binom mj\lambda^{m-j}N^j\) | 脉冲响应 |
| 收敛 | \(A^m\to0\iff\rho(A)<1\) | VAR 平稳性 |
| 幂有界 | \(\rho\le1\) 且单位圆上半单 | 单位根 \(I(1)\) vs \(I(2)\) |
| 半收敛极限 | \(\lim A^k=I-(I-A)(I-A)^D\) | 马尔可夫链长期分布 |
| ODE 解 | \(x_j(t)=\sum e^{\lambda_it}p_i(t)\),\(\deg p_i<\) 指标 | OU、仿射模型 |
| Jordan 分解 | \(A=A_D+A_N\),交换、唯一 | \(e^{At}\) 计算 |
| Drazin 逆 | \(AX=XA\),\(A^{q+1}X=A^q\),\(XAX=X\) | 马尔可夫链 |
| 最小多项式 | \(q_A=\prod(t-\lambda_i)^{r_i}\),\(r_i\) = 指标 | |
| 可对角化判据 | \(\prod_{\text{不同}}(A-\lambda_iI)=0\) | |
| 友矩阵 | \(p_C=q_C=p\);非减次 \(\iff\) 相似于友矩阵 | AR(\(p\)) 状态空间 |
| AR(\(p\)) 平稳 | \(t^p-\phi_1t^{p-1}-\cdots-\phi_p\) 的根在单位圆内 | |
| 实 Jordan 块 | \(C(a,b)=\begin{bmatrix}a&b\\-b&a\end{bmatrix}\) | 振荡模态 |
练习
基础
- 求 \(\begin{bmatrix}3&1&2\\0&3&0\\0&0&3\end{bmatrix}\) 的 Jordan 形与最小多项式(原书 3.1.P6)。 答案要点:\(A-3I\) 秩为 1,\((A-3I)^2=0\);\(w_1=2\),\(w_2=1\);Jordan 形 \(J_2(3)\oplus J_1(3)\),最小多项式 \((t-3)^2\)。
- 列出特征多项式为 \((t+3)^4(t-4)^2\) 的 \(6\times6\) 矩阵所有可能的 Jordan 形,各自的最小多项式是什么?(原书 3.2.P8) 答案要点:特征值 \(-3\) 的块对应 4 的分拆(5 种),特征值 4 对应 2 的分拆(2 种),共 10 种;最小多项式的指数是各自最大块的阶。
- 判断 AR(2) 过程 \(y_t=1.2y_{t-1}-0.36y_{t-2}+\varepsilon_t\) 是否平稳,求其状态矩阵的 Jordan 形,并写出脉冲响应的闭式。 答案要点:\(t^2-1.2t+0.36=(t-0.6)^2\),平稳;Jordan 形 \(J_2(0.6)\);\(\psi_h=(h+1)0.6^h\)。
- 证明幂等矩阵、对合矩阵都可对角化,并说明 OLS 帽子矩阵的 Jordan 形。 提示:最小多项式整除 \(t(t-1)\) 或 \(t^2-1\),无重根。帽子矩阵相似于 \(I_k\oplus0_{T-k}\)。
- 设 \(A=\begin{bmatrix}0.5&1\\0&0.5\end{bmatrix}\),写出 \(A^m\) 的闭式,求 \(\max_m\|A^m\|_\infty\) 出现在哪个 \(m\)。 答案要点:\(A^m=\begin{bmatrix}0.5^m&m0.5^{m-1}\\0&0.5^m\end{bmatrix}\);第一行和 \(0.5^m+m0.5^{m-1}\) 依次为 \(1,1.5,1.25,1,\dots\),在 \(m=1\) 处取最大值 1.5。
- 用 Weyr 特征说明 (3.0.0) 中 \(A\) 与 \(B\) 不相似。
进阶
- 证明:若 \(A\) 非减次且 \(AB=BA\),则 \(B\) 是 \(A\) 的多项式。用此说明:与友矩阵交换的矩阵都是该友矩阵的多项式(原书 3.3.P17)。
- 设 VAR(1) 系数矩阵 \(A\) 的特征值 1 有一个 \(J_2(1)\) 块,其余特征值在单位圆内。说明 \(h\) 步预测误差方差 \(\sum_{j<h}A^jQA^{jT}\) 的增长阶,并与特征值 1 半单的情形比较。 提示:\(\|A^j\|\sim j\),求和得 \(h^3\) 阶;半单时 \(\|A^j\|\) 有界,增长为 \(h\) 阶。
- 证明 Jordan 分解的唯一性(原书 3.2.P18):若 \(A=B+C\),\(BC=CB\),\(B\) 可对角化,\(C\) 幂零,则 \(B=A_D\),\(C=A_N\)。 提示:\(B,C\) 与 \(A\) 交换,从而与 \(A\) 的多项式 \(A_D,A_N\) 交换;\(A_D-B=C-A_N\) 左边可对角化,右边幂零。
- 对 \(n\) 次首一多项式的友矩阵,用 Schur 不等式证明根的平方平均界 \(\frac1n\sum|z_i|^2\le1-\frac1n+\frac1n\sum|a_i|^2\),并对 AR(2) \(y_t=1.2y_{t-1}-0.36y_{t-2}\) 验证(注意多项式为 \(t^2-1.2t+0.36\))。 答案要点:左边 \(0.36\),右边 \(\frac12+\frac12(1.44+0.1296)=1.2848\),界成立但较松。
原书推荐习题
- 3.1.P7、3.1.P28:用秩序列判定 Jordan 结构与相似。
- 3.1.P11:点图与 Weyr/Segre 共轭分拆。
- 3.1.P25–P27:不用谱定理证明正规矩阵可(酉)对角化。
- 3.2.P17、3.2.P18:可对角化的秩判据;Jordan 分解的唯一性。
- 3.2.P37:半收敛矩阵与极限公式(马尔可夫链长期行为)。
- 3.3.P5:用 Gram–Schmidt 求最小多项式(可编程)。
- 3.3.P13:友矩阵的奇异值公式。
- 3.3.P27:高阶 ODE 与友矩阵——对应 AR(\(p\)) 的状态空间表示。
- 3.3.P32:有理标准形与不变因子。
原书对照
| 本章小节 | 原书小节 | 书页 | PDF 页 |
|---|---|---|---|
| 3.1 相似分类问题 | 3.0 Introduction | 163–164 | 183–184 |
| 3.2–3.5 Jordan 块、Jordan 定理、秩序列、数值警告 | 3.1 The Jordan canonical form theorem(含习题 3.1) | 164–175 | 184–195 |
| 3.6 Jordan 形的推论 | 3.2 Consequences of the Jordan canonical form(正文 p.175–187,习题 p.187–191) | 175–191 | 195–211 |
| 3.7–3.8 最小多项式与友矩阵 | 3.3 The minimal polynomial and the companion matrix(习题 p.195–200) | 191–200 | 211–220 |
| 3.9 实 Jordan 标准形 | 3.4.1 The real Jordan canonical form | 201–203 | 221–223 |
第 03b 章继续第 3 章:Weyr 标准形(对研究交换矩阵族比 Jordan 形更好用)、酉 Weyr 形,以及 LU、LDU、PLU 等三角分解。