量化交易中文教材

第 03a 章 Jordan 标准形、最小多项式与线性动态

对应原书:Horn & Johnson《Matrix Analysis》第 2 版,第 3 章 Canonical Forms for Similarity and Triangular Factorizations 的 3.0–3.4.1 节(书 p.163–203,PDF p.183–223)。第 3 章其余部分(Weyr 标准形、LU 分解)见第 03b 章。

第 02a、02b 章用酉相似把矩阵化成上三角(Schur),用酉等价化成对角(SVD)。本章回到一般的相似变换,回答第 01 章留下的问题:两个矩阵什么时候相似?不能对角化的矩阵"最简"能化成什么样? 答案是 Jordan 标准形。对量化而言,Jordan 形的价值不在于计算(它数值上不稳定,实际中不应计算),而在于理解线性动态:VAR/AR 模型、差分方程、线性微分方程的解中为什么会出现 \(h\lambda^h\)、\(te^{\lambda t}\) 这样的项,单位根为什么有"\(I(1)\)"和"\(I(2)\)"之分,马尔可夫链何时收敛、收敛到什么。最小多项式和友矩阵则把 AR(\(p\)) 模型与矩阵理论直接连起来。

学习目标

读完本章,你应当能够:

  1. 写出 Jordan 块与 Jordan 矩阵,陈述 Jordan 标准形定理,理解其存在性的"三步走"思路。
  2. 用秩序列 \(\operatorname{rank}(A-\lambda I)^k\) 求 Weyr 特征与各阶 Jordan 块的个数,从而判定两个矩阵是否相似。
  3. 用 Jordan 形分析 \(A^m\) 与 \(e^{At}\):收敛 ⇔ \(\rho(A)<1\),幂有界 ⇔ 单位圆上的特征值半单;理解 Jordan 块如何产生"驼峰型"脉冲响应与多项式增长。
  4. 掌握最小多项式:可对角化 ⇔ 最小多项式无重根;会用友矩阵表示 AR(\(p\)) 过程并判断平稳性。
  5. 了解 Jordan 分解(可对角化 + 幂零)、Drazin 逆与马尔可夫链长期分布的关系,以及实 Jordan 形中的振荡块。

读前导读

这一章在解决什么问题。 你在 CFA 里见过 AR(1):\(y_t=\phi y_{t-1}+\varepsilon_t\),\(|\phi|<1\) 就平稳,冲击按 \(\phi^h\) 衰减。多变量时(VAR、多因子利率模型、信用评级迁移矩阵),\(\phi\) 变成矩阵 \(A\),冲击的 \(h\) 期影响变成 \(A^h\)。要看懂 \(A^h\) 怎么变化,最方便的办法是换一组坐标,让 \(A\) 变得尽量简单——这叫"相似变换" \(A=SJS^{-1}\),于是 \(A^h=SJ^hS^{-1}\)。如果 \(A\) 能对角化,\(J\) 就是对角阵,每个方向各自按 \(\lambda^h\) 衰减,和标量 AR(1) 一模一样。麻烦在于有些矩阵不能对角化,这时最简单只能化到 Jordan 形:对角线上是特征值,紧挨着对角线上方还残留一些 1。这些 1 正是脉冲响应里 \(h\lambda^h\)(先升后降的"驼峰")、\(I(2)\) 过程里线性增长的来源。本章就是讲:这种"最简形"一定存在、唯一,以及怎样不用真的算出它就能读出它的结构(秩序列、最小多项式)。

对你最有用的结论只有几条:\(A^h\to0\) 当且仅当所有特征值模小于 1(VAR 平稳条件);单位圆上的特征值如果有大于 \(1\times1\) 的 Jordan 块,就会出现多项式增长;AR(\(p\)) 可以写成一个"友矩阵"的 VAR(1),平稳性就变成友矩阵的特征值问题。其余大量定理是为这些结论服务的工具。

需要先想起来的数学。

  • 特征值与特征向量:\(Av=\lambda v\),即 \(A\) 作用在方向 \(v\) 上只是拉伸 \(\lambda\) 倍。例:\(A=\begin{bmatrix}2&0\\0&0.5\end{bmatrix}\),\(e_1\) 方向拉伸 2 倍,\(e_2\) 方向压缩一半。\(\rho(A)\)(谱半径)是所有特征值模的最大值。见 第 00 册第 06 章 线性代数速成。
  • 秩与零空间:\(\operatorname{rank}M\) 是 \(M\) 线性无关的列数;\(n-\operatorname{rank}M\) 是方程 \(Mx=0\) 解空间的维数。例:\(\begin{bmatrix}0&1\\0&0\end{bmatrix}\) 秩为 1,所以 \(Mx=0\) 只有一维解。本章反复用"\(n-\operatorname{rank}(A-\lambda I)\) = 特征值 \(\lambda\) 的独立特征向量个数"。
  • 相似:\(B=S^{-1}AS\) 表示同一个线性映射在另一组基(坐标系)下的矩阵。相似矩阵有相同的特征值、秩、迹、行列式——就像同一笔现金流用美元或欧元记账,数字变了,经济实质没变。
  • 多项式的整除与重根:\((t-1)^2\) 有重根 1,\((t-1)(t-2)\) 没有重根。"\(q\) 整除 \(p\)"写作 \(q\mid p\),意思是 \(p=q\cdot h\)。
  • 二项式定理与 \(e^x\) 的级数:\((a+b)^m=\sum_j\binom mj a^{m-j}b^j\);\(e^{x}=\sum_j x^j/j!\),矩阵指数 \(e^{At}\) 也用这个级数定义。见 第 00 册第 04 章 级数与收敛。

符号提示:\(\oplus\) 表示"直和",即把几个方阵沿对角线拼成分块对角阵,其余位置补 0;\(M_n\) 表示全部 \(n\times n\) 复矩阵;\(\#\{\cdots\}\) 表示集合里元素的个数;\(\sim\) 表示"相似于"。

怎么读这一章。 核心必读:3.2(Jordan 块长什么样)、3.3.1 的定理陈述与 \(S\) 列的含义(证明可以只看思路)、3.3.2、3.4.1–3.4.2(秩序列怎么读出块结构)、3.5(为什么不能数值计算)、3.6.1(幂的收敛,全章最重要)、3.7.2 的推论 3.3.8、3.8(友矩阵与 AR(\(p\))),以及实战 1、3。第一遍可以跳过或只看结论:3.3.1 的归纳证明细节、3.4.3 的习题推论列表、3.6.3–3.6.4、3.6.7(选读)、3.8.3、3.9 中推论 3.4.1.7 之后的内容。建议顺序:先读 3.2 → 3.6.1 → 3.8 抓住"动态"主线,再回头读 3.3–3.4 理解结构从何而来。


3.1 相似分类问题

3.1.1 一个例子

原书 3.0 节的例子:

\[A=\begin{bmatrix}0&1&0&0\\0&0&0&0\\0&0&0&1\\0&0&0&0\end{bmatrix},\qquad B=\begin{bmatrix}0&1&0&0\\0&0&1&0\\0&0&0&0\\0&0&0&0\end{bmatrix}.\tag{3.0.0}\]

两者特征值都是四个 0,特征多项式、迹、行列式、秩(都是 2)全部相同。但 \(A^2=0\) 而 \(B^2\ne0\),所以不相似(若 \(A=SBS^{-1}\),则 \(A^2=SB^2S^{-1}\))。可见第 01 章那些不变量不足以判断相似。

白话解释:把 \(A\) 想成一个"移位"操作。\(A\) 把 \(e_2\) 送到 \(e_1\)、\(e_4\) 送到 \(e_3\),其余送到 0——两条长度为 2 的链 \(e_2\to e_1\to0\)、\(e_4\to e_3\to0\),所以作用两次后全部归零。\(B\) 是一条长度为 3 的链 \(e_3\to e_2\to e_1\to0\) 加一个孤立的 \(e_4\to0\),作用两次后 \(e_3\) 还剩 \(e_1\)。特征值、迹、行列式只看"对角线上有什么",看不出"链有多长"。本章的全部工作,就是找到能刻画链长的不变量(秩序列)。

3.1.2 标准形的思路

对一个等价关系,标准形(canonical form) 是从每个等价类中挑出的一个代表,要求:(a) 每个类都有代表;(b) 不同代表互不等价。判断两个矩阵是否等价,就把它们都化成代表,看是否相同。前面已经见过两个例子:正规矩阵在酉相似下的标准形是对角阵(谱定理);任意矩阵在酉等价下的标准形是奇异值对角阵(SVD)。

对一般相似:

  • 上三角阵太大:同一相似类中有许多不同的上三角阵(Schur 形不唯一),不满足 (b)。
  • 对角阵太小:有些相似类根本不含对角阵(如 \(\begin{bmatrix}0&1\\0&0\end{bmatrix}\)),不满足 (a)。

Jordan 矩阵恰好介于两者之间:每个复方阵都相似于一个 Jordan 矩阵;两个 Jordan 矩阵相似当且仅当它们的块相同(不计顺序);而且在整个相似类中,没有矩阵的非零非对角元比 Jordan 形更少。


3.2 Jordan 块与 Jordan 矩阵

定义 3.1.1 Jordan 块 \(J_k(\lambda)\) 是 \(k\times k\) 上三角矩阵,对角线上是 \(k\) 个 \(\lambda\),第一超对角线上是 \(k-1\) 个 1,其余为 0:

\[J_1(\lambda)=[\lambda],\quad J_2(\lambda)=\begin{bmatrix}\lambda&1\\0&\lambda\end{bmatrix},\quad J_k(\lambda)=\begin{bmatrix}\lambda&1&&\\&\lambda&\ddots&\\&&\ddots&1\\&&&\lambda\end{bmatrix}.\]

Jordan 矩阵是 Jordan 块的直和

\[J=J_{n_1}(\lambda_1)\oplus J_{n_2}(\lambda_2)\oplus\cdots\oplus J_{n_q}(\lambda_q),\qquad n_1+\cdots+n_q=n,\]

块大小 \(n_i\) 和特征值 \(\lambda_i\) 都允许重复。

幂零 Jordan 块 \(N=J_k(0)\) 是"移位算子":\(Ne_{i+1}=e_i\),\(Ne_1=0\)。它的幂把 1 逐条往右上推:\(N^p\) 的第 \(p\) 条超对角线全为 1,其余为 0;\(N^p=0\)(\(p\ge k\))。所以

\[\operatorname{rank}J_k(0)^p=\max\{k-p,0\}.\tag{3.1.14 的来源}\]

还有一个技术性等式(引理 3.1.4):\(J_k(0)^TJ_k(0)=\begin{bmatrix}0&0\\0&I_{k-1}\end{bmatrix}\),于是 \([I-J_k(0)^TJ_k(0)]x=(x^Te_1)e_1\),存在性证明要用它。

关于单个 Jordan 块的基本事实(3.1.P5):\(J_k(\lambda)\) 的特征值 \(\lambda\) 代数重数为 \(k\),几何重数为 1(特征空间只有 \(e_1\) 方向)。

白话解释:两个"重数"是本章最常用的词。代数重数是 \(\lambda\) 在特征多项式里作为根出现的次数("账面上数到几个 \(\lambda\)");几何重数是 \(Ax=\lambda x\) 有几个线性无关的解("实际找得到几个独立方向")。以 \(J_2(\lambda)=\begin{bmatrix}\lambda&1\\0&\lambda\end{bmatrix}\) 为例:对角线上有两个 \(\lambda\),代数重数 2;但 \((J_2(\lambda)-\lambda I)x=\begin{bmatrix}x_2\\0\end{bmatrix}=0\) 只要求 \(x_2=0\),解只有 \(e_1\) 一个方向,几何重数 1。"账面"比"实际"多出来的部分,就是对角化失败的那部分。


3.3 Jordan 标准形定理

3.3.1 存在性:三步走

  • 第 1 步(Schur,2.3.1):任意复矩阵相似(甚至酉相似)于上三角阵,相同的特征值排在一起。
  • 第 2 步(分块对角化,2.4.6.1):用 Sylvester 方程把不同特征值之间的耦合消掉,相似于 \(T_{11}\oplus\cdots\oplus T_{dd}\),每个 \(T_{ii}\) 上三角且对角元都等于 \(\lambda_i\)。
  • 第 3 步(本节):对角元全相等的上三角阵相似于 Jordan 矩阵。

第 3 步只需处理 \(T_{ii}-\lambda_iI\),即严格上三角(幂零)矩阵。

定理 3.1.5 严格上三角的 \(A\in M_n\) 相似于 \(J_{n_1}(0)\oplus\cdots\oplus J_{n_m}(0)\),\(n_1\ge\cdots\ge n_m\ge1\)。\(A\) 实时相似变换可取实。

证明思路(对 \(n\) 归纳) 写 \(A=\begin{bmatrix}0&a^T\\0&A_1\end{bmatrix}\),由归纳假设把 \(A_1\) 化为 Jordan 形 \(J_{k_1}\oplus J\)(\(J_{k_1}\) 是最大块)。于是 \(A\) 相似于

\[\begin{bmatrix}0&a_1^T&a_2^T\\0&J_{k_1}&0\\0&0&J\end{bmatrix}.\]

利用 \((I-J^T_{k_1}J_{k_1})x=(x^Te_1)e_1\) 做一次相似,把 \(a_1^T\) 化成只剩第一个分量 \((a_1^Te_1)e_1^T\)。分两种情况:

  • 若 \(a_1^Te_1\ne0\),缩放后左上角变成 \(J_{k_1+1}(0)\)(第一行接上了最大块),剩下的右上耦合 \(e_1a_2^T\) 可以借助 \(\tilde Je_{i+1}=e_i\) 一步步往下推,因为 \(J^{k_1}=0\),至多 \(k_1\) 步后消失。结果 \(A\sim J_{k_1+1}(0)\oplus J\)。
  • 若 \(a_1^Te_1=0\),把 \(J_{k_1}\) 置换到最前面,剩下一个更小的严格上三角矩阵,用归纳假设。∎

这个证明本质上是一个算法(原书说明它遵循 Fletcher–Sorensen 的算法推导),但见 3.5 节的数值警告。

定理 3.1.11(Jordan 标准形定理) 对任意 \(A\in M_n\),存在非奇异 \(S\) 使

\[A=S\big(J_{n_1}(\lambda_1)\oplus\cdots\oplus J_{n_q}(\lambda_q)\big)S^{-1}.\]

Jordan 矩阵 \(J_A\) 在块的排列意义下由 \(A\) 唯一决定,称为 \(A\) 的 Jordan 标准形。若 \(A\) 实且特征值全实,\(S\) 可取实。

\(S\) 的列有清楚的意义:对一个块 \(J_k(\lambda)\),对应的 \(k\) 列 \(s_1,\dots,s_k\) 满足

\[(A-\lambda I)s_1=0,\quad(A-\lambda I)s_2=s_1,\quad\dots,\quad(A-\lambda I)s_k=s_{k-1},\]

\(s_1\) 是特征向量,其余是一条"广义特征向量链"。

推导拆解:这组链式方程直接来自 \(AS=SJ\)(把 \(A=SJS^{-1}\) 两边右乘 \(S\))。看 \(SJ\) 的第 \(j\) 列:\(J_k(\lambda)\) 的第 1 列是 \(\lambda e_1\),所以 \(As_1=\lambda s_1\);第 \(j\ge2\) 列是 \(e_{j-1}+\lambda e_j\),所以 \(As_j=s_{j-1}+\lambda s_j\),移项即 \((A-\lambda I)s_j=s_{j-1}\)。反复作用得 \((A-\lambda I)^js_j=0\):\(s_j\) 不是特征向量,但被 \((A-\lambda I)\) 作用 \(j\) 次后归零,所以叫"广义"特征向量。 以 \(2\times2\) 为例:\(A=\begin{bmatrix}1&1\\0&1\end{bmatrix}\),\(s_1=e_1\) 是特征向量,\(s_2=e_2\) 满足 \((A-I)e_2=e_1\)。在动态 \(x_{h+1}=Ax_h\) 里,从 \(s_2\) 出发的状态每一期都"漏"一点到 \(s_1\) 方向,漏的量逐期累积,这就是 \(h\lambda^{h-1}\) 项的来源(见 3.6.1)。

3.3.2 Jordan 矩阵的结构读法

对 \(J=J_{n_1}(\lambda_1)\oplus\cdots\oplus J_{n_k}(\lambda_k)\)(3.2.1 节):

  1. 块数 \(k\) = 线性无关特征向量的最大个数;\(J\) 可对角化 ⇔ 所有块都是 \(1\times1\)。
  2. 特征值 \(\lambda\) 的块数 = 几何重数;块大小之和 = 代数重数。所以几何重数 ≤ 代数重数(3.2.6),相等时称 \(\lambda\) 半单(semisimple),即其 Jordan 块都是 \(1\times1\)。
  3. 特征值 \(\lambda\) 的最大块阶数称为 \(\lambda\) 的指标(index)。

3.4 唯一性:秩序列、Weyr 特征与 Segre 特征

3.4.1 秩序列决定一切

唯一性的证明用到两个事实:相似矩阵同时减去同一个 \(\lambda I\) 仍相似;秩是相似不变量。若 \(A=SJS^{-1}\),则 \((A-\lambda I)^k\sim(J-\lambda I)^k\)。把 \(J\) 中特征值为 \(\lambda\) 的块记作 \(J_{m_1}(\lambda),\dots,J_{m_p}(\lambda)\),其余块减去 \(\lambda I\) 后可逆,贡献固定的秩 \(m=n-\sum m_i\):

\[\operatorname{rank}(A-\lambda I)^k=\sum_{i=1}^p\operatorname{rank}J_{m_i}(0)^k+m .\]

定义秩序列与 Weyr 特征:

\[r_k(A,\lambda)=\operatorname{rank}(A-\lambda I)^k,\quad r_0=n;\qquad w_k(A,\lambda)=r_{k-1}(A,\lambda)-r_k(A,\lambda).\]

由 \(\operatorname{rank}J_\ell(0)^{k-1}-\operatorname{rank}J_\ell(0)^k=1\)(\(k\le\ell\))或 \(0\)(\(k>\ell\)),得到

\[w_k(A,\lambda)=\#\{\text{特征值为 }\lambda\text{、阶数}\ge k\text{ 的 Jordan 块}\}.\tag{3.1.17}\]

于是:

  • \(w_1\) = 块数 = 几何重数;
  • \(w_k-w_{k+1}\) = 阶数恰为 \(k\) 的块数;等价地 \(r_{k-1}-2r_k+r_{k+1}\)(3.1.P7);
  • \(w_1\ge w_2\ge\cdots\);\(\lambda\) 的指标 \(q\) 是使 \(r_k=r_{k+1}\) 的最小 \(k\);\(w_1+\cdots+w_q\) = 代数重数。

推导拆解:为什么 \(w_k\) 恰好数出"阶数 \(\ge k\) 的块"? 第 1 步,由 3.2 节 \(\operatorname{rank}J_\ell(0)^k=\max\{\ell-k,0\}\):每作用一次,长度为 \(\ell\) 的链就"缩短"一格,秩减 1,直到减到 0 不再变。 第 2 步,\(w_k=r_{k-1}-r_k\) 是第 \(k\) 次作用时秩减少的总量。公式里与 \(\lambda\) 无关的常数 \(m\) 在相减时抵消。 第 3 步,一个长度为 \(\ell\) 的块在第 \(k\) 次作用时秩减 1 当且仅当 \(\ell\ge k\)(链还没缩没),否则减 0。所以总减少量 = 长度 \(\ge k\) 的块的个数。 小例子:\(J_2(0)\oplus J_1(0)\),\(r_0=3,r_1=1,r_2=0\),所以 \(w_1=2\)(两个块)、\(w_2=1\)(一个块长度 \(\ge2\)),\(w_1-w_2=1\) 个 \(1\times1\) 块,\(w_2-w_3=1\) 个 \(2\times2\) 块。

引理 3.1.18 \(A,B\) 相似 ⇔ 它们的不同特征值相同,且对每个特征值 \(\lambda\) 和每个 \(k\),\(w_k(A,\lambda)=w_k(B,\lambda)\)(等价地,\(\operatorname{rank}(A-\lambda I)^k=\operatorname{rank}(B-\lambda I)^k\),3.1.P28)。

3.4.2 例子

原书例 (3.1.16a):\(J=J_3(0)\oplus J_3(0)\oplus J_2(0)\oplus J_2(0)\oplus J_2(0)\oplus J_1(0)\),\(n=13\)。

\(k\) 0 1 2 3 4
\(r_k=\operatorname{rank}J^k\) 13 7 2 0 0
\(w_k=r_{k-1}-r_k\) 6 5 2 0

读法:\(w_1=6\) 个块;\(w_1-w_2=1\) 个 \(1\times1\) 块,\(w_2-w_3=3\) 个 \(2\times2\) 块,\(w_3-w_4=2\) 个 \(3\times3\) 块。

Segre 特征是块大小的降序列表:上例为 \(3,3,2,2,2,1\)。Weyr 特征 \(6,5,2\) 与 Segre 特征 \(3,3,2,2,2,1\) 是同一个整数 13 的共轭分拆:画一个点图(Young 图),第 \(k\) 行放 \(w_k\) 个点,则各列的长度就是 Segre 特征(3.1.P11)。

w1 = 6:  ● ● ● ● ● ●
w2 = 5:  ● ● ● ● ●
w3 = 2:  ● ●
列长:    3 3 2 2 2 1   ← Segre 特征

回到 (3.0.0):\(A\) 的 Jordan 形是 \(J_2(0)\oplus J_2(0)\)(\(r_1=2,r_2=0\)),\(B\) 是 \(J_3(0)\oplus J_1(0)\)(\(r_1=2,r_2=1,r_3=0\))。\(r_2\) 不同,所以不相似。

3.4.3 几个推论(3.1 节习题)

  • 3.1.P8:\(A^2=0\)、秩 \(r\) ⇒ Jordan 形为 \(J_2(0)^{\oplus r}\oplus0_{n-2r}\)。
  • 3.1.P9:\(J_n(0)^2\) 的 Jordan 形:\(n=2m\) 时为 \(J_m(0)\oplus J_m(0)\),\(n=2m+1\) 时为 \(J_{m+1}(0)\oplus J_m(0)\)。(平方会把一个幂零块"劈开"。)
  • 3.1.P14:\(A\) 与 \(A^T\) 相似(Weyr 特征相同)。
  • 3.1.P15:秩一矩阵 \(xy^*\) 的 Jordan 形:\(y^*x\ne0\) 时为 \([y^*x]\oplus0_{n-1}\),\(y^*x=0\) 时为 \(J_2(0)\oplus0_{n-2}\)。秩一矩阵可对角化 ⇔ 迹非零。
  • 3.1.P16:\(\lambda\ne0\) 时 \(J_k(\lambda)^{-1}\) 的 Jordan 形是 \(J_k(\lambda^{-1})\)。
  • 3.1.P4:\(A\) 相似于 \(cA\)(某个 \(|c|\ne1\))⇒ \(A\) 幂零;幂零矩阵对所有 \(c\ne0\) 都相似于 \(cA\)。
  • 3.1.P21:不可约上 Hessenberg 矩阵每个特征值几何重数为 1;因此 Hermite 三对角矩阵(次对角元非零)的特征值互异。
  • 3.1.P25:\(A\) 可对角化 ⇔ 对每个特征值,\((A-\lambda I)^2x=0\Rightarrow(A-\lambda I)x=0\)。
  • 3.1.P19(Heisenberg 群):矩阵 \(A_{x,y,t}=\begin{bmatrix}1&x^T&t\\0&I_n&y\\0&0&1\end{bmatrix}\) 构成群,其 Jordan 形按 \(x^Ty\ne0\) 等情形分为 \(J_3(1)\oplus I_{n-1}\)、\(J_2(1)\oplus J_2(1)\oplus I_{n-2}\)、\(J_2(1)\oplus I_n\)、\(I_{n+2}\),且总与其逆相似。注意:原书把乘法律印作 \(A_{x,y,t}A_{\xi,\eta,\tau}=A_{x+\xi,y+\eta,t+\tau}\),按矩阵乘法直接计算,右上角应为 \(t+\tau+x^T\eta\),即 \(A_{x,y,t}A_{\xi,\eta,\tau}=A_{x+\xi,\,y+\eta,\,t+\tau+x^T\eta}\)。这不影响"构成群"的结论。

3.5 数值警告:Jordan 形不能用浮点数计算

上面的推导是一个显式算法,但原书明确提醒它不适合在软件中计算。例:

\[A_\epsilon=\begin{bmatrix}\epsilon&0\\1&0\end{bmatrix}=S_\epsilon\begin{bmatrix}0&0\\0&\epsilon\end{bmatrix}S_\epsilon^{-1},\qquad S_\epsilon=\begin{bmatrix}0&\epsilon\\1&1\end{bmatrix}.\]

\(\epsilon\ne0\) 时 Jordan 形是对角阵;\(\epsilon\to0\) 时它趋于 \(J_1(0)\oplus J_1(0)=0\),但 \(A_\epsilon\to A_0=\begin{bmatrix}0&0\\1&0\end{bmatrix}\),后者的 Jordan 形是 \(J_2(0)\)。元素的微小变化导致 Jordan 形突变,相似变换 \(S_\epsilon\) 也趋于奇异。根源是秩不是元素的连续函数,而 Jordan 结构完全由秩决定。

实践原则:需要非对称矩阵的结构信息时,用 Schur 分解(酉变换,稳定);Jordan 形只用于理论分析。 实战 2 会定量展示两者的差别。

金融直觉:这和"用估计出的 VAR 系数判断是否有重根"是同一个问题。你从数据估出的 \(\hat A\) 带抽样误差,两个真实相等的特征值几乎一定被估成两个略有差别的数,于是 \(\hat A\)"可以对角化"——但对角化所需的特征向量矩阵 \(S\) 几乎奇异,条件数巨大(实战 1 中达到 \(4\times10^8\))。用这样的 \(S\) 去分解脉冲响应,结果对误差极度敏感。所以实务上不问"Jordan 形是什么",而是问"\(\|A^h\|\) 如何随 \(h\) 变化",后者是稳定的。

推论 3.1.21(\(\epsilon\)-Jordan 形) 对任意 \(\epsilon\ne0\),\(A\) 相似于把 Jordan 形超对角线上的 1 换成 \(\epsilon\) 的矩阵(用 \(\operatorname{diag}(1,\epsilon,\epsilon^2,\dots)\) 做相似)。这在理论上很有用:它说明可以找到一个基,使 \(A\) "几乎是对角的";原书第 5 章用同类的对角缩放技巧构造使 \(\|A\|\) 任意接近 \(\rho(A)\) 的矩阵范数。代价是 \(\epsilon\to0\) 时相似矩阵的条件数趋于无穷。


3.6 Jordan 形的推论

3.6.1 矩阵幂:收敛与幂有界

这是对量化最重要的推论。\(A^m=SJ^mS^{-1}\),只需看单个 Jordan 块。由二项式定理和 \(N=J_k(0)\) 的幂零性(\(N^k=0\)),

\[J_k(\lambda)^m=(\lambda I+N)^m=\sum_{j=0}^{k-1}\binom{m}{j}\lambda^{m-j}N^j\qquad(m\ge k).\]

即 \(J_k(\lambda)^m\) 是上三角 Toeplitz 矩阵,第 \(j\) 条超对角线上是 \(\binom mj\lambda^{m-j}\)。例如

\[J_3(\lambda)^m=\begin{bmatrix}\lambda^m&m\lambda^{m-1}&\binom m2\lambda^{m-2}\\0&\lambda^m&m\lambda^{m-1}\\0&0&\lambda^m\end{bmatrix}.\]
  • 若 \(0<|\lambda|<1\):\(|\binom mj\lambda^{m-j}|\le\frac{m^j|\lambda|^m}{j!|\lambda|^j}\to0\)(指数衰减压过多项式增长)。
  • 若 \(|\lambda|=1\) 且 \(k\ge2\):超对角元 \(m\lambda^{m-1}\) 的模为 \(m\),无界。

推导拆解:为什么能用二项式定理?二项式定理 \((a+b)^m=\sum\binom mj a^{m-j}b^j\) 对矩阵成立的前提是 \(a,b\) 可交换(\(ab=ba\))。这里 \(a=\lambda I\) 是纯量矩阵,与任何矩阵交换,所以可以用。又因为 \(N^j=0\)(\(j\ge k\)),求和到 \(j=k-1\) 就截断。 以 \(J_2(\lambda)\) 为例逐项写出:\(J_2(\lambda)^m=\lambda^mI+m\lambda^{m-1}N\),即 \(\begin{bmatrix}\lambda^m&m\lambda^{m-1}\\0&\lambda^m\end{bmatrix}\)。取 \(\lambda=0.8\):\(m=1,2,3,4,5\) 时右上元为 \(1,\ 1.6,\ 1.92,\ 2.048,\ 2.048\),然后才开始下降。指数衰减最终总会赢过多项式增长,但在赢之前有一段"放大期"。 上面不等式的来源:\(\binom mj=\frac{m(m-1)\cdots(m-j+1)}{j!}\le\frac{m^j}{j!}\),再拆 \(|\lambda|^{m-j}=|\lambda|^m/|\lambda|^j\)。\(m^j|\lambda|^m\to0\) 是"多项式乘以几何衰减趋于 0",可用 \(\ln(m^j|\lambda|^m)=j\ln m+m\ln|\lambda|\to-\infty\) 看出(\(\ln m\) 的增长远慢于 \(m\))。

定理 3.2.5.2 (a) \(A\) 收敛(\(A^m\to0\))⇔ \(\rho(A)<1\);(b) \(A\) 幂有界(\(\{A^m\}\) 有界)⇔ \(\rho(A)\le1\),且模为 1 的特征值都半单(对应 Jordan 块都是 \(1\times1\))。

半收敛(3.2.P37) \(\lim_{k\to\infty}A^k\) 存在 ⇔ \(\rho(A)\le1\),且单位圆上只能有特征值 1,且 1 半单。此时

\[\lim_{k\to\infty}A^k=I-(I-A)(I-A)^D,\]

\((I-A)^D\) 是 Drazin 逆(3.6.6 节)。马尔可夫转移矩阵 \(P\) 正是这种情形(特征值 1 半单):极限矩阵的每一行都是长期分布。

白话解释:三种情况对应三种长期行为。收敛:所有模态都衰减,冲击最终消失(平稳 VAR)。半收敛:特征值 1 的模态原样保留、其余衰减,系统停在一个依赖初值的稳态上(马尔可夫链收敛到长期分布;评级迁移最终全部落入违约吸收态)。幂有界但不收敛:单位圆上还有 \(-1\) 或复特征值 \(e^{i\theta}\),系统永远振荡或旋转,不爆炸也不收敛(实战 3 中的周期链)。三种情况共同的"禁区"是:单位圆上的特征值带有 \(2\times2\) 以上的 Jordan 块,那会导致多项式增长。

量化翻译:

  • VAR(1) \(x_{t+1}=Ax_t+\varepsilon_t\) 平稳 ⇔ \(\rho(A)<1\)。\(h\) 期脉冲响应 \(A^h\) 中,若某个特征值 \(\lambda\) 有 \(k\times k\) Jordan 块,就会出现 \(h\lambda^h,\ h^2\lambda^h,\dots,h^{k-1}\lambda^h\) 型的项——驼峰型(hump-shaped)响应:先升后降。重根 AR(2) 的脉冲响应恰为 \((h+1)r^h\)(实战 1)。
  • 单位根:特征值 1 半单(\(1\times1\) 块)时,\(A^h\) 有界,对应 \(I(1)\) 随机游走式的"持久但不爆炸";若特征值 1 有 \(J_2(1)\) 块,\(A^h\) 中出现 \(h\) 的线性增长,对应 \(I(2)\) 过程(如"价格的变化量本身是随机游走")。积分阶数在矩阵层面就是单位根的 Jordan 块大小。
  • 协整分析(Johansen 检验)关心 \(\Pi=A-I\) 的秩,正是特征值 1 的几何重数问题:\(\operatorname{rank}\Pi=n-\#\{\text{特征值 1 的 Jordan 块}\}\)。详见第 06 册。

3.6.2 线性微分方程组

初值问题 \(x'(t)=Ax(t)\),\(x(0)=x_0\) 的解是 \(x(t)=e^{At}x_0\)。令 \(A=SJS^{-1}\)、\(y=S^{-1}x\),不同 Jordan 块互不耦合。对单块 \(J_m(\lambda)\),\(y_i'=\lambda y_i+y_{i+1}\),自下而上解得

\[y_k(t)=e^{\lambda t}\sum_{i=k}^my_i(0)\frac{t^{i-k}}{(i-k)!}.\]

结论(3.2.2):解的每个分量形如

\[x_j(t)=e^{\lambda_1t}p_1(t)+\cdots+e^{\lambda_dt}p_d(t),\]

\(p_i\) 是多项式,次数严格小于 \(\lambda_i\) 的指标。实特征值给出指数项,复特征值 \(a\pm ib\) 给出 \(e^{at}\cos bt\)、\(e^{at}\sin bt\) 型振荡。

量化翻译:多因子 Ornstein–Uhlenbeck 或仿射利率模型 \(dx=A(x-\theta)dt+\Sigma dW\) 的均值路径就是 \(e^{At}\)。特征值实部决定均值回复速度,虚部带来周期性;若均值回复矩阵有 \(J_2(-\kappa)\) 块("临界阻尼"),条件均值中出现 \(te^{-\kappa t}\):一个因子的偏离先把另一个因子推离均值,之后才一起回归。

原书 3.3.P27 还指出:\(n\) 阶常系数线性 ODE \(y^{(n)}+a_{n-1}y^{(n-1)}+\cdots+a_0y=0\) 化为一阶系统后,系数矩阵的转置正是友矩阵(3.8 节)。

3.6.3 矩阵与其转置相似,任何矩阵是两个对称矩阵之积

反序矩阵 \(K_m\)(反对角线全 1)满足 \(K_mJ_m(\lambda)K_m=J_m(\lambda)^T\)。拼起来得:

定理 3.2.3.1 对任意 \(A\),存在非奇异对称矩阵 \(S\) 使 \(A^T=SAS^{-1}\)。

定理 3.2.3.2 每个复方阵都是两个复对称矩阵之积,且可任选其中一个非奇异。实方阵经实对称矩阵相似于其转置。

3.6.4 交换与非减次矩阵

\(p(A)\) 总与 \(A\) 交换。反过来,与 \(A\) 交换的矩阵是否都是 \(A\) 的多项式?对 \(A=I\) 显然不是(\(I\) 与一切矩阵交换,而 \(p(I)\) 只能是纯量矩阵)。关键在于 \(A\) 是否"足够一般"。

定义 3.2.4.1 \(A\) 称为非减次(nonderogatory),若每个特征值的几何重数都是 1,即每个不同特征值在 Jordan 形中只有一个块。例:特征值互异的矩阵;相似于单个 Jordan 块的矩阵。

与单个 Jordan 块 \(J_m(\lambda)\) 交换的矩阵恰好是上三角 Toeplitz 矩阵,也就是 \(J_m(0)\) 的多项式。由此:

定理 3.2.4.2 若 \(A\) 非减次,\(B\) 与 \(A\) 交换,则存在次数 \(\le n-1\) 的多项式 \(p\) 使 \(B=p(A)\)。反之亦然(3.2.P2)。

3.6.5 Jordan 分解:可对角化 + 幂零

每个 Jordan 块 \(J_k(\lambda)=\lambda I+J_k(0)\)。把 Jordan 形拆成对角部分 \(D\) 和幂零部分 \(N\),得

\[A=SDS^{-1}+SNS^{-1}=A_D+A_N,\]

\(A_D\) 可对角化,\(A_N\) 幂零,且 \(A_DA_N=A_NA_D\)。这叫 Jordan 分解。它是唯一的(3.2.P18):若 \(A=B+C\),\(BC=CB\),\(B\) 可对角化、\(C\) 幂零,则 \(B=A_D\)、\(C=A_N\)。\(A_D,A_N\) 都是 \(A\) 的多项式。

用途:\(e^{At}=e^{A_Dt}e^{A_Nt}\)(因为交换),而 \(e^{A_Nt}=\sum_{j<k}\frac{t^j}{j!}A_N^j\) 是有限和——这就是 3.6.2 中多项式因子的来源。

3.6.6 Drazin 逆

满足 \(AXA=A\) 的 \(X\) 称为广义逆。除了第 02b 章基于 SVD 的 Moore–Penrose 伪逆,还有一种基于 Jordan 结构的广义逆。

定义 3.2.12.1 把 \(A\) 写成 \(A=S\begin{bmatrix}B&0\\0&N\end{bmatrix}S^{-1}\),\(B\) 非奇异(所有非零特征值的块),\(N\) 幂零(零特征值的块)。Drazin 逆

\[A^D=S\begin{bmatrix}B^{-1}&0\\0&0\end{bmatrix}S^{-1}.\]

它与 \(S\) 的选取无关。设 \(q\) 为零特征值的指标,\(A^D\) 是满足以下三条的唯一矩阵:

\[AX=XA,\qquad A^{q+1}X=A^q,\qquad XAX=X.\]

性质:\(A\) 可逆时 \(A^D=A^{-1}\);\(Ax=\lambda x\)(\(\lambda\ne0\))⇒ \(A^Dx=\lambda^{-1}x\);\(A^D\) 是 \(A\) 的多项式;\(AA^D\) 与 \(I-AA^D\) 是互补投影(3.2.P22);\(A^D=\lim_{t\to0}(A^{k+1}+tI)^{-1}A^k\)(\(k\ge q\),3.2.P23)。

白话解释:Drazin 逆的做法是"能逆的部分照常求逆,逆不了的部分(零特征值那一块)直接置零"。为什么这样定义有用?以马尔可夫链为例,\(I-P\) 在长期分布方向上是 0(因为 \(\pi P=\pi\)),不可逆;但在其余"会衰减的"方向上可逆。\((I-P)^D\) 只在衰减方向上求逆,相当于把 \(\sum_{k\ge0}(P^k-P^\infty)\) 这类"偏离稳态的累计量"加总起来——平均首达时间、期望违约年数这类量正是这样的累计量。\(I-(I-P)(I-P)^D\) 则是把衰减部分全部剔除后剩下的投影,即长期分布。

与伪逆的区别:伪逆关心正交结构(range 与 kernel 的正交补),Drazin 逆关心动力学结构(特征值的 Jordan 分解)。马尔可夫链的长期分布、平均首达时间、"基本矩阵"都用 \(I-P\) 的 Drazin 逆(指标为 1 时也称群逆)表达。

3.6.7 其他推论(选读)

  • \(AB\) 与 \(BA\)(3.2.11.1):对每个非零特征值,\(AB\) 与 \(BA\) 的 Jordan 结构完全相同;零特征值的结构可以不同(3.2.P21 给出 \(J_3(0)\) 与 \(J_2(0)\oplus J_1(0)\) 的例子)。第 01 章的高维 PCA 对偶技巧在 Jordan 层面也成立。
  • 秩一扰动的 Jordan 形(3.2.13.1):若特征值 \(\lambda\) 有非正交的左右特征向量 \(x,y\)(\(y^*x\ne0\)),则 \(A+xv^*\) 把 \(\lambda\) 移到 \(\lambda+v^*x\),其余 Jordan 结构完全不变。3.2.P28 的 Google 矩阵 \(cA+(1-c)\lambda xv^*\) 把其余特征值整体乘以 \(c\),块结构不变。
  • 最优性(3.2.9.5):在一个相似类中,Jordan 形的非零非对角元个数最少(为 \(n\) 减块数)。证明借助"岛与桥"的图论论证:置换相似下不可分解的 \(m\times m\) 矩阵至少有 \(m-1\) 个非零非对角元。
  • 块上三角的指标(3.2.10.1):块上三角矩阵中特征值 \(\lambda\) 的指标不超过各对角块中指标之和。
  • 伴随矩阵的 Jordan 形(3.2.P9–P12)、相似的消去律(3.2.P13–P15):\(A\oplus B\sim A\oplus C\iff B\sim C\)。

3.7 最小多项式

3.7.1 定义与基本性质

若 \(p(A)=0\),称多项式 \(p\) 零化(annihilate) \(A\)。Cayley–Hamilton 说特征多项式零化 \(A\),但可能有次数更低的。

定理 3.3.1 存在唯一的次数最低的首一零化多项式 \(q_A\),称为最小多项式(minimal polynomial);任何零化多项式都被 \(q_A\) 整除。

证明用带余除法:\(p=q_Ah+r\),\(\deg r<\deg q_A\),代入 \(A\) 得 \(r(A)=0\),由最小性 \(r=0\)。

推论 3.3.3–3.3.4 相似矩阵有相同的最小多项式;\(q_A\mid p_A\);\(q_A\) 的根恰好是 \(A\) 的全部特征值。因此若 \(p_A(t)=\prod(t-\lambda_i)^{s_i}\),则 \(q_A(t)=\prod(t-\lambda_i)^{r_i}\),\(1\le r_i\le s_i\)。

最小多项式不是完全的相似不变量:\(J_2(0)\oplus J_2(0)\) 与 \(J_2(0)\oplus0_2\) 的最小多项式都是 \(t^2\)、特征多项式都是 \(t^4\),但不相似。(3.3.P1:\(3\times3\) 幂零矩阵恰好由最小多项式区分,\(4\times4\) 就不行了。)

3.7.2 与 Jordan 形的关系

定理 3.3.6 \(q_A(t)=\prod_{i=1}^d(t-\lambda_i)^{r_i}\),\(r_i\) 是 \(\lambda_i\) 的指标(最大 Jordan 块的阶)。

理由:\(J_k(\lambda)\) 被 \((t-\lambda)^k\) 零化但不被更低次幂零化;直和的零化多项式要同时零化每个块,所以取各特征值的最大块。

推论 3.3.8(可对角化的实用判据) 设 \(A\) 的不同特征值为 \(\lambda_1,\dots,\lambda_d\),令 \(q(t)=(t-\lambda_1)\cdots(t-\lambda_d)\)。则

\[A\text{ 可对角化}\iff q(A)=0 .\]

原书强调这个判据在已知不同特征值时确实实用:不需要求任何特征向量,只要算一个矩阵乘积。

推导拆解:为什么 \(q(A)=0\) 就等价于可对角化?换到 Jordan 坐标下看单个块 \(J_k(\lambda_i)\)。\(q(J)\) 里只有因子 \((J-\lambda_iI)\) 在这个块上是幂零的 \(N\),其他因子 \((J-\lambda_jI)\)(\(j\ne i\))在这个块上都是可逆的(对角元 \(\lambda_i-\lambda_j\ne0\))。可逆矩阵乘 \(N\) 等于 0 当且仅当 \(N=0\),即 \(k=1\)。所以 \(q(A)=0\) ⇔ 每个块都是 \(1\times1\) ⇔ 可对角化。 数值例:\(A=\begin{bmatrix}1&1\\0&1\end{bmatrix}\),唯一特征值 1,\(q(t)=t-1\),\(q(A)=\begin{bmatrix}0&1\\0&0\end{bmatrix}\ne0\),不可对角化;\(A=\begin{bmatrix}1&1\\0&2\end{bmatrix}\),\(q(A)=(A-I)(A-2I)=\begin{bmatrix}0&1\\0&1\end{bmatrix}\begin{bmatrix}-1&1\\0&0\end{bmatrix}=0\),可对角化。

推论 3.3.10 以下等价:\(q_A\) 是互异一次因子之积;每个特征值都是 \(q_A\) 的单根;\(A\) 可对角化。

由此立得一批"可对角化"结论(3.3.P3、3.2.P7):幂等矩阵(\(A^2=A\),最小多项式整除 \(t(t-1)\))、对合矩阵(\(A^2=I\))、\(A^3=A\)、\(A^k=I\) 的矩阵都可对角化。OLS 的帽子矩阵 \(H\) 是幂等的,所以可对角化,特征值只有 0 和 1。

求最小多项式的算法:(1) 求特征值及代数重数;(2) 对每个 \(\lambda_i\),\(r_i\) 是使 \(\operatorname{rank}(A-\lambda_iI)^k=\operatorname{rank}(A-\lambda_iI)^{k+1}\) 的最小 \(k\)(3.3.P2)。原书 3.3.P5 还给出不需要特征值的算法:把 \(I,A,A^2,\dots\) 拉直成向量依次做 Gram–Schmidt,第一次出现线性相关时的组合系数就是最小多项式的系数。例(3.3.P6):\(\begin{bmatrix}1&1\\0&2\end{bmatrix}\)、\(\begin{bmatrix}1&1\\0&1\end{bmatrix}\)、\(I_2\) 的最小多项式分别是 \((t-1)(t-2)\)、\((t-1)^2\)、\(t-1\)。

其他结论:直和的最小多项式是各块最小多项式的最小公倍式(3.3.P8);\(\deg q_A\le\operatorname{rank}A+1\)(3.3.P22);秩一矩阵的最小多项式是 \(t(t-\operatorname{tr}A)\)(3.3.P35);\(\{p(A)\}\) 构成的代数维数等于 \(\deg q_A\)(3.3.P15)。例(3.3.P9):\(5\times5\) 矩阵 \(p_A=(t-4)^3(t+6)^2\)、\(q_A=(t-4)^2(t+6)\),则 Jordan 形为 \(J_2(4)\oplus J_1(4)\oplus J_1(-6)\oplus J_1(-6)\)。


3.8 友矩阵与 AR(\(p\)) 模型

3.8.1 友矩阵

反问题:给定首一多项式

\[p(t)=t^n+a_{n-1}t^{n-1}+\cdots+a_1t+a_0,\]

是否有矩阵以它为最小多项式?原书构造

\[C(p)=\begin{bmatrix}0&&&&-a_0\\1&0&&&-a_1\\&1&\ddots&&\vdots\\&&\ddots&0&-a_{n-2}\\&&&1&-a_{n-1}\end{bmatrix}.\tag{3.3.12}\]

\(C(p)e_k=e_{k+1}\)(\(k<n\)),即 \(e_k=C^{k-1}e_1\),而 \(Ce_n=-\sum a_ie_{i+1}\) 正好给出 \(p(C)e_1=0\),进而 \(p(C)e_k=C^{k-1}p(C)e_1=0\)。更低次的首一多项式 \(q\) 若零化 \(C\),则 \(q(C)e_1=e_{m+1}+\cdots=0\),与 \(e_1,\dots,e_{m+1}\) 线性无关矛盾。

定理 3.3.14 每个首一多项式既是其友矩阵(companion matrix) 的最小多项式,也是特征多项式。

定理 3.3.15 以下等价:(a) \(\deg q_A=n\);(b) \(p_A=q_A\);(c) \(A\) 非减次;(d) \(A\) 相似于 \(p_A\) 的友矩阵。特别地,友矩阵总是非减次的:每个特征值只有一个 Jordan 块。所以友矩阵可对角化 ⇔ 特征值互异(3.3.P23)。

友矩阵还有转置、反序等几种等价写法(3.3.P11),它们彼此相似。

3.8.2 AR(\(p\)) 的状态空间形式

AR(\(p\)) 过程 \(y_t=\phi_1y_{t-1}+\cdots+\phi_py_{t-p}+\varepsilon_t\) 取状态 \(s_t=(y_t,y_{t-1},\dots,y_{t-p+1})^T\),写成一阶系统

\[s_t=\Phi s_{t-1}+e_1\varepsilon_t,\qquad\Phi=\begin{bmatrix}\phi_1&\phi_2&\cdots&\phi_{p-1}&\phi_p\\1&0&\cdots&0&0\\0&1&&&0\\&&\ddots&&\vdots\\0&&&1&0\end{bmatrix}.\]

\(\Phi\) 是多项式 \(t^p-\phi_1t^{p-1}-\cdots-\phi_p\) 的友矩阵的一种形式(与 (3.3.12) 相差转置和反序,相似)。于是:

  • 平稳 ⇔ \(\rho(\Phi)<1\) ⇔ \(t^p-\phi_1t^{p-1}-\cdots-\phi_p\) 的根都在单位圆内(等价于时间序列教材里"\(1-\phi_1z-\cdots-\phi_pz^p\) 的根都在单位圆外")。
  • \(\Phi\) 非减次:重根一定对应一个大 Jordan 块,不可能是"重根但可对角化"。所以 AR(\(p\)) 只要有重特征根,脉冲响应里就一定有 \(h\lambda^h\) 项。
  • 脉冲响应 \(\psi_h=e_1^T\Phi^he_1\);\(h\) 步预测 \(E_ts_{t+h}=\Phi^hs_t\)。

推导拆解:以 AR(2) \(y_t=\phi_1y_{t-1}+\phi_2y_{t-2}+\varepsilon_t\) 为例逐行验证。状态 \(s_t=(y_t,y_{t-1})^T\),\(\Phi=\begin{bmatrix}\phi_1&\phi_2\\1&0\end{bmatrix}\)。第一行:\(y_t=\phi_1y_{t-1}+\phi_2y_{t-2}+\varepsilon_t\),就是模型本身;第二行:\(y_{t-1}=y_{t-1}\),只是把旧值"往下挪一格"存起来。特征多项式 \(\det(tI-\Phi)=t^2-\phi_1t-\phi_2\)。 代入实战 1 的重根情形 \(\phi_1=1.6,\phi_2=-0.64\):\(t^2-1.6t+0.64=(t-0.8)^2\),重根 0.8。由于第二行那个固定的 1,\(\Phi-0.8I=\begin{bmatrix}0.8&-0.64\\1&-0.8\end{bmatrix}\ne0\),秩为 1,几何重数只有 1,必然是 \(J_2(0.8)\)——这就是"友矩阵非减次"在 AR(2) 上的样子。 两种"根在单位圆内/外"的说法互为倒数关系:\(z\) 是 \(1-\phi_1z-\phi_2z^2\) 的根 ⇔ \(t=1/z\) 是 \(t^2-\phi_1t-\phi_2\) 的根。

VAR(\(p\)) 同理,状态矩阵是分块友矩阵。

3.8.3 友矩阵的奇异值与根的界

任意 \(n\) 个复数都可以是友矩阵的特征值,但奇异值受严格限制(3.3.P13):对 (3.3.12) 型友矩阵,记 \(s=|a_0|^2+|a_1|^2+\cdots+|a_{n-1}|^2\),则 \(\sigma_2=\cdots=\sigma_{n-1}=1\),且

\[\sigma_{1,n}^2=\tfrac12\Big(s+1\pm\sqrt{(s+1)^2-4|a_0|^2}\Big),\qquad\sigma_1\sigma_n=|a_0|.\]

对友矩阵用 Schur 不等式 \(\sum|\lambda_i|^2\le\|C\|_F^2=(n-1)+s\),得到多项式根的界(3.3.P33):

\[\frac1n\sum_{i=1}^n|z_i|^2\le1-\frac1n+\frac1n\sum_{i=0}^{n-1}|a_i|^2 .\]

有理标准形(了解,3.3.P32):把 Jordan 块按"每轮每个特征值取一个最大块"重新组合,每组对应一个友矩阵,得到 \(A\sim C_1\oplus\cdots\oplus C_r\),各友矩阵的多项式 \(p_1,\dots,p_r\)(不变因子)满足 \(p_{j+1}\mid p_j\),\(p_1=q_A\),\(p_1\cdots p_r=p_A\)。它的好处是只需有理运算、不需求特征值,对任意域成立。


3.9 实 Jordan 标准形

实矩阵的非实特征值成共轭对出现。由于 \(\operatorname{rank}(A-\lambda I)^k=\operatorname{rank}\overline{(A-\lambda I)^k}=\operatorname{rank}(A-\bar\lambda I)^k\),共轭特征值的 Weyr 特征相同:非实特征值的 Jordan 块以同样大小的共轭对出现。

一对 \(J_k(\lambda)\oplus J_k(\bar\lambda)\) 经置换相似变成以 \(D(\lambda)=\operatorname{diag}(\lambda,\bar\lambda)\) 为对角块、\(I_2\) 为超对角块的块双对角阵;再用

\[C(a,b)=\begin{bmatrix}a&b\\-b&a\end{bmatrix}=SD(\lambda)S^{-1},\qquad\lambda=a+ib,\quad S=\begin{bmatrix}-i&-i\\1&-1\end{bmatrix}\]

逐块相似,得到实的块矩阵

\[C_k(a,b)=\begin{bmatrix}C(a,b)&I_2&&\\&C(a,b)&\ddots&\\&&\ddots&I_2\\&&&C(a,b)\end{bmatrix}\in M_{2k}.\]

定理 3.4.1.5(实 Jordan 标准形) 每个 \(A\in M_n(\mathbf R)\) 经实相似相似于

\[C_{n_1}(a_1,b_1)\oplus\cdots\oplus C_{n_p}(a_p,b_p)\oplus J_{m_1}(\mu_1)\oplus\cdots\oplus J_{m_r}(\mu_r),\]

\(a_k+ib_k\)(\(b_k>0\))是非实特征值,\(\mu_j\) 是实特征值。证明:在 \(\mathbf C\) 上相似已经得到,再用"两个实矩阵复相似则实相似"(原书定理 1.3.29,见第 01 章)。

推论 3.4.1.10 实可对角化矩阵经实相似化为 \(C(a_j,b_j)\) 块与实 \(1\times1\) 块的直和。这正是实系数线性系统 \(x_{t+1}=Ax_t\) 中振荡模态的标准表示:\(C(a,b)=r\begin{bmatrix}\cos\theta&\sin\theta\\-\sin\theta&\cos\theta\end{bmatrix}\),每期乘 \(r=|\lambda|\)、转 \(\theta=\arg\lambda\),伪周期 \(2\pi/\theta\)。

金融直觉:复特征值听上去抽象,在实数世界里它就是"旋转加缩放"。设 \(\lambda=0.8e^{i0.5}\),把二维状态(例如产出缺口与通胀,或两个相互影响的利差)看成平面上的一个点,每期把它绕原点转 0.5 弧度(约 29°)、离原点的距离乘 0.8。投影到某一个坐标上看,就是一条振幅逐期缩小的正弦波,转满一圈约需 \(2\pi/0.5\approx12.6\) 期——这就是实战 1 里复根 AR(2) 脉冲响应先正后负的原因。商业周期、库存周期这类"有节奏的均值回复",在线性模型里都靠这种 \(C(a,b)\) 块表达。

推论 3.4.1.7 复矩阵 \(A\) 相似于某个实矩阵 ⇔ 对每个非实特征值,\(J_k(\lambda)\) 与 \(J_k(\bar\lambda)\) 个数相同 ⇔ \(A\) 相似于 \(\bar A\)。推论 3.4.1.9:对任意 \(A\),\(A\bar A\) 相似于 \(\bar AA\),且相似于实矩阵(第 04b 章"共轭相似"的基础)。


量化实战

实战 1:AR(2) 的三种根、驼峰响应与单位根的 Jordan 块

import numpy as np
from scipy.linalg import expm

def companion(phi):
    """AR(p) y_t = φ1 y_{t-1} + ... + φp y_{t-p} 的状态矩阵(友矩阵的转置形式)"""
    p = len(phi)
    A = np.zeros((p, p)); A[0] = phi; A[1:, :-1] = np.eye(p - 1)
    return A

def irf(phi, H):
    A = companion(phi); e1 = np.eye(len(phi))[0]
    return np.array([(np.linalg.matrix_power(A, h) @ e1)[0] for h in range(H)])

# ---------- 1. 三个 AR(2):互异实根、重根(Jordan 块)、复根 ----------
cases = {"互异实根 0.9, 0.5": [1.4, -0.45],
         "重根 0.8(J_2)":   [1.6, -0.64],
         "复根 0.8e^{±i0.5}": [2 * 0.8 * np.cos(0.5), -0.64]}
for name, phi in cases.items():
    A = companion(phi)
    lam, S = np.linalg.eig(A)
    geo = [int(2 - np.linalg.matrix_rank(A - l * np.eye(2), tol=1e-6)) for l in lam]
    print("%-18s 特征值 %s  几何重数 %s  cond(S) = %.2e"
          % (name, np.round(lam, 4), geo, np.linalg.cond(S)))

H = 13
r = 0.8
psi = irf([1.6, -0.64], H)
print("\n重根 AR(2) 脉冲响应:", psi[:8].round(4))
print("理论 (h+1) r^h      :", np.array([(h + 1) * r ** h for h in range(8)]).round(4))
print("h=3 与 h=4 处的响应: %.4f, %.4f(连续极值点 -1/ln r - 1 = %.2f)" % (psi[3], psi[4], -1 / np.log(r) - 1))
print("互异根 AR(2) 脉冲响应:", irf([1.4, -0.45], 8).round(4))
print("复根   AR(2) 脉冲响应:", irf(cases["复根 0.8e^{±i0.5}"], 8).round(4))

# ---------- 2. 单位根与 Jordan 块:幂有界 vs 多项式增长 ----------
for name, A in [("I_2(两个独立随机游走)", np.eye(2)),
                ("J_2(1)(I(2) 过程)", np.array([[1.0, 1.0], [0.0, 1.0]])),
                ("diag(1, 0.5)(一个单位根)", np.diag([1.0, 0.5]))]:
    print("%-26s ‖A^50‖ = %7.2f  ‖A^100‖ = %7.2f" % (name, np.linalg.norm(np.linalg.matrix_power(A, 50), 2),
                                                    np.linalg.norm(np.linalg.matrix_power(A, 100), 2)))

# ---------- 3. 连续时间:临界阻尼的均值回复 x' = A x,A = J_2(-κ) ----------
kappa = 0.5
A = np.array([[-kappa, 1.0], [0.0, -kappa]])
for t in [1.0, 2.0, 4.0]:
    E = expm(A * t)
    print("t=%.0f  e^{At} = [[%.4f, %.4f],[0, %.4f]]   理论右上元 t·e^{-κt} = %.4f"
          % (t, E[0, 0], E[0, 1], E[1, 1], t * np.exp(-kappa * t)))

关键输出:

互异实根 0.9, 0.5      特征值 [0.9+0.j 0.5+0.j]  几何重数 [1, 1]  cond(S) = 7.39e+00
重根 0.8(J_2)        特征值 [0.8+0.j 0.8+0.j]  几何重数 [1, 1]  cond(S) = 4.15e+08
复根 0.8e^{±i0.5}    特征值 [0.7021+0.3835j 0.7021-0.3835j]  几何重数 [1, 1]  cond(S) = 4.03e+00

重根 AR(2) 脉冲响应: [1.     1.6    1.92   2.048  2.048  1.9661 1.835  1.6777]
理论 (h+1) r^h      : [1.     1.6    1.92   2.048  2.048  1.9661 1.835  1.6777]
h=3 与 h=4 处的响应: 2.0480, 2.0480(连续极值点 -1/ln r - 1 = 3.48)
互异根 AR(2) 脉冲响应: [1.     1.4    1.51   1.484  1.3981 1.2895 1.1762 1.0664]
复根   AR(2) 脉冲响应: [ 1.      1.4041  1.3316  0.9711  0.5113  0.0965 -0.1918 -0.331 ]
I_2(两个独立随机游走)              ‖A^50‖ =    1.00  ‖A^100‖ =    1.00
J_2(1)(I(2) 过程)            ‖A^50‖ =   50.02  ‖A^100‖ =  100.01
diag(1, 0.5)(一个单位根)        ‖A^50‖ =    1.00  ‖A^100‖ =    1.00
t=1  e^{At} = [[0.6065, 0.6065],[0, 0.6065]]   理论右上元 t·e^{-κt} = 0.6065
t=2  e^{At} = [[0.3679, 0.7358],[0, 0.3679]]   理论右上元 t·e^{-κt} = 0.7358
t=4  e^{At} = [[0.1353, 0.5413],[0, 0.1353]]   理论右上元 t·e^{-κt} = 0.5413

读法:

  1. 重根情形,特征值 0.8 的几何重数是 1(友矩阵非减次),Jordan 形是 \(J_2(0.8)\)。numpy.linalg.eig 仍然返回两个"特征向量",但它们几乎平行,特征向量矩阵的条件数 \(4\times10^8\)——这就是 3.5 节说的"在 Jordan 块附近,对角化在数值上崩溃"。
  2. 重根 AR(2) 的脉冲响应精确等于 \((h+1)0.8^h\),在 \(h=3,4\) 达到峰值 2.05 后才衰减:冲击的影响先被放大一倍多。互异实根的响应也有驼峰但较平缓;复根的响应在第 6 期穿过零线,呈阻尼振荡(伪周期 \(2\pi/0.5\approx12.6\) 期)。
  3. 单位根:\(I_2\) 与 \(\operatorname{diag}(1,0.5)\) 的幂有界(特征值 1 半单);\(J_2(1)\) 的 \(\|A^h\|\) 线性增长,这就是 \(I(2)\) 过程的预测方差以 \(h^3\) 速度增长的矩阵根源。
  4. 连续时间临界阻尼:\(e^{J_2(-\kappa)t}\) 的右上元恰为 \(te^{-\kappa t}\),在 \(t=1/\kappa=2\) 处达到最大。

实战 2:用秩序列"读出" Jordan 结构;可对角化判据;Jordan 与 Schur 的稳定性对比

import numpy as np
from scipy.linalg import block_diag, schur

rng = np.random.default_rng(0)

def jordan_block(lam, k):
    return lam * np.eye(k) + np.diag(np.ones(k - 1), 1)

def weyr(A, lam, tol=1e-8):
    """由秩序列 r_k = rank (A - λI)^k 求 Weyr 特征 w_k = r_{k-1} - r_k"""
    n = A.shape[0]; M = A - lam * np.eye(n); r = [n]; P = np.eye(n)
    while True:
        P = P @ M
        r.append(int(np.linalg.matrix_rank(P, tol=tol)))
        if r[-1] == r[-2]:
            break
    return [r[k - 1] - r[k] for k in range(1, len(r) - 1)], r

def segre_from_weyr(w):
    w = list(w) + [0]
    return sorted([k for k in range(1, len(w)) for _ in range(w[k - 1] - w[k])], reverse=True)

# ---------- 1. 原书例 (3.1.16a):J = J3⊕J3⊕J2⊕J2⊕J2⊕J1(特征值 0),再加一个 J2(2) ----------
blocks = [jordan_block(0, 3), jordan_block(0, 3), jordan_block(0, 2), jordan_block(0, 2),
          jordan_block(0, 2), jordan_block(0, 1), jordan_block(2.0, 2)]
J = block_diag(*blocks)
n = J.shape[0]
Q, _ = np.linalg.qr(rng.normal(size=(n, n)))      # 用随机正交相似把结构"藏起来"
A = Q @ J @ Q.T
for lam in [0.0, 2.0]:
    w, r = weyr(A, lam)
    print("λ=%.0f  秩序列 r_k = %s  Weyr 特征 = %s  Segre(块大小)= %s" % (lam, r, w, segre_from_weyr(w)))

# ---------- 2. 最小多项式判定可对角化:q(t) = Π (t - λ_i) 是否零化 A ----------
def is_diagonalizable(A, distinct, tol=1e-8):
    P = np.eye(A.shape[0])
    for l in distinct:
        P = P @ (A - l * np.eye(A.shape[0]))
    return np.linalg.norm(P) < tol * max(1, np.linalg.norm(A)) ** len(distinct)

D = Q @ np.diag([0, 0, 0, 1, 1, 2, 2, 2, 3, 3, 3, 3, 3, 3, 3]) @ Q.T
print("\n对角化后藏起来的矩阵: q(A)=0 ?", is_diagonalizable(D, [0, 1, 2, 3]))
print("上面的 Jordan 型矩阵: q(A)=0 ?", is_diagonalizable(A, [0, 2]))
print("  (A)(A-2I) 的 Frobenius 范数 = %.3f;A^3(A-2I)^2 的范数 = %.2e(最小多项式 t^3 (t-2)^2)"
      % (np.linalg.norm(A @ (A - 2 * np.eye(n))),
         np.linalg.norm(np.linalg.matrix_power(A, 3) @ np.linalg.matrix_power(A - 2 * np.eye(n), 2))))

# ---------- 3. Jordan 形的数值不稳定 vs Schur 形的稳定 ----------
Jn = jordan_block(0.0, 6)
for eps in [1e-6, 1e-12]:
    E = np.zeros((6, 6)); E[5, 0] = eps
    lam, S = np.linalg.eig(Jn + E)
    print("\nε=%.0e  特征值模 = %s(理论 ε^{1/6} = %.4f)  cond(特征向量矩阵) = %.1e"
          % (eps, np.abs(lam).round(4), eps ** (1 / 6), np.linalg.cond(S)))
    T, Z = schur(Jn + E, output="complex")
    print("        Schur 因子 Z 的条件数 = %.1f,‖Z T Z* - A‖ = %.1e" % (np.linalg.cond(Z), np.linalg.norm(Z @ T @ Z.conj().T - (Jn + E))))

关键输出:

λ=0  秩序列 r_k = [15, 9, 4, 2, 2]  Weyr 特征 = [6, 5, 2]  Segre(块大小)= [3, 3, 2, 2, 2, 1]
λ=2  秩序列 r_k = [15, 14, 13, 13]  Weyr 特征 = [1, 1]  Segre(块大小)= [2]

对角化后藏起来的矩阵: q(A)=0 ? True
上面的 Jordan 型矩阵: q(A)=0 ? False
  (A)(A-2I) 的 Frobenius 范数 = 5.831;A^3(A-2I)^2 的范数 = 2.53e-14(最小多项式 t^3 (t-2)^2)

ε=1e-06  特征值模 = [0.1 0.1 0.1 0.1 0.1 0.1](理论 ε^{1/6} = 0.1000)  cond(特征向量矩阵) = 1.0e+05
        Schur 因子 Z 的条件数 = 1.0,‖Z T Z* - A‖ = 3.7e-15

ε=1e-12  特征值模 = [0.01 0.01 0.01 0.01 0.01 0.01](理论 ε^{1/6} = 0.0100)  cond(特征向量矩阵) = 1.0e+10
        Schur 因子 Z 的条件数 = 1.0,‖Z T Z* - A‖ = 7.1e-15

读法:

  1. 把原书例 (3.1.16a) 的 Jordan 矩阵(再加一个 \(J_2(2)\))用随机正交相似"藏起来",只靠 \(\operatorname{rank}(A-\lambda I)^k\) 就完整读回了块结构:\(\lambda=0\) 的秩序列 \(15,9,4,2\)(多出的 2 是 \(J_2(2)\) 贡献的可逆部分,对应公式中的 \(m\)),Weyr 特征 \(6,5,2\),Segre 特征 \(3,3,2,2,2,1\)。这里能成功,是因为矩阵是精确构造的、秩的阈值容易设定;对带噪声的估计矩阵,秩的判断本身就不可靠。
  2. 可对角化判据:只需检查 \(\prod(A-\lambda_iI)\) 是否为零。Jordan 型矩阵不满足,而 \(A^3(A-2I)^2=0\),最小多项式是 \(t^3(t-2)^2\)——指数恰好是两个特征值的指标(最大块阶 3 和 2)。
  3. 在 \(J_6(0)\) 的角上放 \(10^{-12}\),特征值移动到模 \(10^{-2}\)(放大 \(10^{10}\) 倍),"特征向量矩阵"的条件数 \(10^{10}\);而 Schur 分解的酉因子条件数恒为 1,重构误差在机器精度。结论与 3.5 节一致:对非对称矩阵,相信 Schur,不要相信 Jordan。

实战 3:信用评级迁移矩阵的长期行为与 Drazin 逆

场景:年度信用评级迁移矩阵(A、B、C 三个评级加违约 D,违约为吸收态)。用半收敛定理计算长期分布,用基本矩阵计算期望违约时间。

import numpy as np

def drazin(A, tol=1e-10):
    """A^D = A^l (A^{2l+1})^+ A^l,l ≥ index(A);index 由秩序列稳定点确定"""
    n = A.shape[0]; l = 0; r_prev = n; P = np.eye(n)
    while True:
        P = P @ A; r = np.linalg.matrix_rank(P, tol=tol)
        if r == r_prev:
            break
        r_prev, l = r, l + 1
    Al = np.linalg.matrix_power(A, l)
    return Al @ np.linalg.pinv(np.linalg.matrix_power(A, 2 * l + 1)) @ Al, l

# ---------- 1. 信用评级迁移(年度),D 为吸收态 ----------
states = ["A", "B", "C", "D"]
P = np.array([[0.90, 0.08, 0.015, 0.005],
              [0.05, 0.85, 0.08, 0.02],
              [0.01, 0.09, 0.80, 0.10],
              [0.00, 0.00, 0.00, 1.00]])
lam = np.linalg.eigvals(P)
print("特征值:", np.sort_complex(lam).round(4))
M = np.eye(4) - P
MD, idx = drazin(M)
print("I-P 的零特征值指标 =", idx, "(=1 说明特征值 1 半单)")
print("Drazin 三条件:", np.allclose(M @ MD, MD @ M), np.allclose(M @ M @ MD, M), np.allclose(MD @ M @ MD, MD))
Lim = np.eye(4) - M @ MD
print("lim P^k = I - (I-P)(I-P)^D =\n", Lim.round(6))
print("P^500 =\n", np.linalg.matrix_power(P, 500).round(6))
# 违约前的期望年数 = 基本矩阵 N = (I - Q)^{-1} 的行和(Q 为非吸收态子块)
Nf = np.linalg.inv(np.eye(3) - P[:3, :3])
print("从 A/B/C 出发的期望违约时间(年):", Nf.sum(axis=1).round(2))

# ---------- 2. 周期链:特征值 -1 在单位圆上,P^k 不收敛 ----------
Pc = np.array([[0, 1.0], [1.0, 0]])
print("\n周期链特征值:", np.linalg.eigvals(Pc), " P^100 =", np.linalg.matrix_power(Pc, 100).ravel(),
      " P^101 =", np.linalg.matrix_power(Pc, 101).ravel())
# Cesàro 平均仍收敛到 I - (I-P)(I-P)^D
McD, _ = drazin(np.eye(2) - Pc)
avg = sum(np.linalg.matrix_power(Pc, k) for k in range(1000)) / 1000
print("Cesàro 平均:", avg.ravel().round(4), "  I-(I-P)(I-P)^D:", (np.eye(2) - (np.eye(2) - Pc) @ McD).ravel().round(4))

关键输出:

特征值: [0.7313+0.j 0.8521+0.j 0.9666+0.j 1.    +0.j]
I-P 的零特征值指标 = 1 (=1 说明特征值 1 半单)
Drazin 三条件: True True True
lim P^k = I - (I-P)(I-P)^D =
 [[-0. -0. -0.  1.]
 [-0. -0.  0.  1.]
 [ 0.  0. -0.  1.]
 [ 0.  0.  0.  1.]]
P^500 =
 [[0. 0. 0. 1.]
 [0. 0. 0. 1.]
 [0. 0. 0. 1.]
 [0. 0. 0. 1.]]
从 A/B/C 出发的期望违约时间(年): [36.8  29.71 20.21]

周期链特征值: [ 1.+0.j -1.+0.j]  P^100 = [1. 0. 0. 1.]  P^101 = [0. 1. 1. 0.]
Cesàro 平均: [0.5 0.5 0.5 0.5]   I-(I-P)(I-P)^D: [0.5 0.5 0.5 0.5]

读法:

  1. 迁移矩阵的特征值 1 半单(\(I-P\) 的零特征值指标为 1),其余特征值都在单位圆内,所以 \(P^k\) 收敛(半收敛定理),极限 \(I-(I-P)(I-P)^D\) 与 \(P^{500}\) 一致:长期看所有发行人都违约(吸收态)。收敛速度由第二大特征值 0.9666 决定,半衰期约 \(\ln0.5/\ln0.9666\approx20\) 年。
  2. Drazin 逆用公式 \(A^D=A^l(A^{2l+1})^+A^l\)(\(l\ge\) 指标)计算,并验证了三条刻画等式。这个公式用的是伪逆,但结果是 Drazin 逆——两种广义逆在这里配合使用。
  3. 非吸收子块 \(Q\) 的基本矩阵 \((I-Q)^{-1}\) 的行和给出期望违约时间:A 级约 36.8 年、C 级约 20.2 年。\(\rho(Q)<1\) 保证了 \((I-Q)^{-1}=\sum_kQ^k\) 收敛。
  4. 周期链的特征值 \(-1\) 在单位圆上,\(P^k\) 在两个矩阵之间来回跳,不收敛;但时间平均(Cesàro 平均)仍收敛到 \(I-(I-P)(I-P)^D\)。这一点超出原书范围,属于马尔可夫链理论的标准结论,这里只做数值演示。

本章小结

Jordan 标准形回答了"两个矩阵何时相似":每个复方阵都相似于 Jordan 块的直和,块结构在排列意义下唯一。存在性分三步——Schur 三角化、用 Sylvester 方程分块对角化、把幂零上三角阵化成幂零 Jordan 块;唯一性来自秩序列 \(r_k=\operatorname{rank}(A-\lambda I)^k\),Weyr 特征 \(w_k=r_{k-1}-r_k\) 是阶数不小于 \(k\) 的块数,与 Segre 特征(块大小列表)互为共轭分拆。Jordan 形在理论上是分析线性动态的利器:\(J_k(\lambda)^m\) 含 \(\binom mj\lambda^{m-j}\) 项,所以收敛 ⇔ \(\rho(A)<1\),幂有界 ⇔ 单位圆上的特征值半单,半收敛矩阵的极限是 \(I-(I-A)(I-A)^D\);\(e^{At}\) 的分量是 \(e^{\lambda t}\) 乘以次数低于指标的多项式。但 Jordan 形由秩决定,秩不连续,所以它在数值上极不稳定,实践中应使用 Schur 分解。最小多项式 \(q_A=\prod(t-\lambda_i)^{r_i}\) 的指数是各特征值的指标,可对角化 ⇔ 最小多项式无重根 ⇔ \(\prod(A-\lambda_iI)=0\)。友矩阵的最小多项式和特征多项式都等于给定多项式,非减次矩阵恰好相似于友矩阵;AR(\(p\)) 的状态矩阵就是友矩阵,所以重特征根必然产生 Jordan 块和驼峰型响应。实矩阵有实 Jordan 形,复特征值对应旋转–伸缩块 \(C(a,b)\)。Jordan 分解(可对角化 + 幂零、交换、唯一)和 Drazin 逆是两个常用的副产品。

概念/公式 表达式 用途
Jordan 块 \(J_k(\lambda)=\lambda I+N\),\(N^k=0\)
Jordan 标准形 \(A=SJS^{-1}\),块结构唯一 相似分类
秩序列 \(r_k=\operatorname{rank}(A-\lambda I)^k\) 判定相似
Weyr 特征 \(w_k=r_{k-1}-r_k=\#\{\text{阶}\ge k\text{ 的块}\}\)
恰为 \(k\) 阶的块数 \(w_k-w_{k+1}=r_{k-1}-2r_k+r_{k+1}\)
几何/代数重数 \(w_1\) / \(\sum w_k\) 半单性
Jordan 块的幂 \(J_k(\lambda)^m=\sum_j\binom mj\lambda^{m-j}N^j\) 脉冲响应
收敛 \(A^m\to0\iff\rho(A)<1\) VAR 平稳性
幂有界 \(\rho\le1\) 且单位圆上半单 单位根 \(I(1)\) vs \(I(2)\)
半收敛极限 \(\lim A^k=I-(I-A)(I-A)^D\) 马尔可夫链长期分布
ODE 解 \(x_j(t)=\sum e^{\lambda_it}p_i(t)\),\(\deg p_i<\) 指标 OU、仿射模型
Jordan 分解 \(A=A_D+A_N\),交换、唯一 \(e^{At}\) 计算
Drazin 逆 \(AX=XA\),\(A^{q+1}X=A^q\),\(XAX=X\) 马尔可夫链
最小多项式 \(q_A=\prod(t-\lambda_i)^{r_i}\),\(r_i\) = 指标
可对角化判据 \(\prod_{\text{不同}}(A-\lambda_iI)=0\)
友矩阵 \(p_C=q_C=p\);非减次 \(\iff\) 相似于友矩阵 AR(\(p\)) 状态空间
AR(\(p\)) 平稳 \(t^p-\phi_1t^{p-1}-\cdots-\phi_p\) 的根在单位圆内
实 Jordan 块 \(C(a,b)=\begin{bmatrix}a&b\\-b&a\end{bmatrix}\) 振荡模态

练习

基础

  1. 求 \(\begin{bmatrix}3&1&2\\0&3&0\\0&0&3\end{bmatrix}\) 的 Jordan 形与最小多项式(原书 3.1.P6)。 答案要点:\(A-3I\) 秩为 1,\((A-3I)^2=0\);\(w_1=2\),\(w_2=1\);Jordan 形 \(J_2(3)\oplus J_1(3)\),最小多项式 \((t-3)^2\)。
  2. 列出特征多项式为 \((t+3)^4(t-4)^2\) 的 \(6\times6\) 矩阵所有可能的 Jordan 形,各自的最小多项式是什么?(原书 3.2.P8) 答案要点:特征值 \(-3\) 的块对应 4 的分拆(5 种),特征值 4 对应 2 的分拆(2 种),共 10 种;最小多项式的指数是各自最大块的阶。
  3. 判断 AR(2) 过程 \(y_t=1.2y_{t-1}-0.36y_{t-2}+\varepsilon_t\) 是否平稳,求其状态矩阵的 Jordan 形,并写出脉冲响应的闭式。 答案要点:\(t^2-1.2t+0.36=(t-0.6)^2\),平稳;Jordan 形 \(J_2(0.6)\);\(\psi_h=(h+1)0.6^h\)。
  4. 证明幂等矩阵、对合矩阵都可对角化,并说明 OLS 帽子矩阵的 Jordan 形。 提示:最小多项式整除 \(t(t-1)\) 或 \(t^2-1\),无重根。帽子矩阵相似于 \(I_k\oplus0_{T-k}\)。
  5. 设 \(A=\begin{bmatrix}0.5&1\\0&0.5\end{bmatrix}\),写出 \(A^m\) 的闭式,求 \(\max_m\|A^m\|_\infty\) 出现在哪个 \(m\)。 答案要点:\(A^m=\begin{bmatrix}0.5^m&m0.5^{m-1}\\0&0.5^m\end{bmatrix}\);第一行和 \(0.5^m+m0.5^{m-1}\) 依次为 \(1,1.5,1.25,1,\dots\),在 \(m=1\) 处取最大值 1.5。
  6. 用 Weyr 特征说明 (3.0.0) 中 \(A\) 与 \(B\) 不相似。

进阶

  1. 证明:若 \(A\) 非减次且 \(AB=BA\),则 \(B\) 是 \(A\) 的多项式。用此说明:与友矩阵交换的矩阵都是该友矩阵的多项式(原书 3.3.P17)。
  2. 设 VAR(1) 系数矩阵 \(A\) 的特征值 1 有一个 \(J_2(1)\) 块,其余特征值在单位圆内。说明 \(h\) 步预测误差方差 \(\sum_{j<h}A^jQA^{jT}\) 的增长阶,并与特征值 1 半单的情形比较。 提示:\(\|A^j\|\sim j\),求和得 \(h^3\) 阶;半单时 \(\|A^j\|\) 有界,增长为 \(h\) 阶。
  3. 证明 Jordan 分解的唯一性(原书 3.2.P18):若 \(A=B+C\),\(BC=CB\),\(B\) 可对角化,\(C\) 幂零,则 \(B=A_D\),\(C=A_N\)。 提示:\(B,C\) 与 \(A\) 交换,从而与 \(A\) 的多项式 \(A_D,A_N\) 交换;\(A_D-B=C-A_N\) 左边可对角化,右边幂零。
  4. 对 \(n\) 次首一多项式的友矩阵,用 Schur 不等式证明根的平方平均界 \(\frac1n\sum|z_i|^2\le1-\frac1n+\frac1n\sum|a_i|^2\),并对 AR(2) \(y_t=1.2y_{t-1}-0.36y_{t-2}\) 验证(注意多项式为 \(t^2-1.2t+0.36\))。 答案要点:左边 \(0.36\),右边 \(\frac12+\frac12(1.44+0.1296)=1.2848\),界成立但较松。

原书推荐习题

  • 3.1.P7、3.1.P28:用秩序列判定 Jordan 结构与相似。
  • 3.1.P11:点图与 Weyr/Segre 共轭分拆。
  • 3.1.P25–P27:不用谱定理证明正规矩阵可(酉)对角化。
  • 3.2.P17、3.2.P18:可对角化的秩判据;Jordan 分解的唯一性。
  • 3.2.P37:半收敛矩阵与极限公式(马尔可夫链长期行为)。
  • 3.3.P5:用 Gram–Schmidt 求最小多项式(可编程)。
  • 3.3.P13:友矩阵的奇异值公式。
  • 3.3.P27:高阶 ODE 与友矩阵——对应 AR(\(p\)) 的状态空间表示。
  • 3.3.P32:有理标准形与不变因子。

原书对照

本章小节 原书小节 书页 PDF 页
3.1 相似分类问题 3.0 Introduction 163–164 183–184
3.2–3.5 Jordan 块、Jordan 定理、秩序列、数值警告 3.1 The Jordan canonical form theorem(含习题 3.1) 164–175 184–195
3.6 Jordan 形的推论 3.2 Consequences of the Jordan canonical form(正文 p.175–187,习题 p.187–191) 175–191 195–211
3.7–3.8 最小多项式与友矩阵 3.3 The minimal polynomial and the companion matrix(习题 p.195–200) 191–200 211–220
3.9 实 Jordan 标准形 3.4.1 The real Jordan canonical form 201–203 221–223

第 03b 章继续第 3 章:Weyr 标准形(对研究交换矩阵族比 Jordan 形更好用)、酉 Weyr 形,以及 LU、LDU、PLU 等三角分解。