量化交易中文教材

第 06 章 特征值的定位与扰动

对应原书:Horn & Johnson《Matrix Analysis》第 2 版,第 6 章 Location and Perturbation of Eigenvalues 的 6.0–6.4 节(书 p.387–424,PDF p.407–444)。原书第 6 章止于 6.4 节。

第 04a 章的 Weyl 不等式只适用于 Hermitian 矩阵。本章处理一般矩阵,回答两个问题:(1) 不算特征值,只看矩阵元素,能把特征值圈在什么范围里? Geršgorin 圆盘给出最简单的答案:每个特征值都落在某个以对角元为圆心、以该行非对角元绝对值之和为半径的圆盘里。由此得到"严格对角占优 ⇒ 非奇异 / 正定"等实用判据。(2) 矩阵被扰动后特征值移动多少? 正规矩阵(包括协方差矩阵)移动不超过 \(\|E\|_2\);非正规矩阵(VAR 系数矩阵、转移矩阵)的移动量要乘以特征向量矩阵的条件数,可能大得多。本章还说明了一个对 PCA 很重要的事实:特征值稳定,特征向量未必稳定——当两个特征值接近时,主成分方向可能在样本之间剧烈旋转。

学习目标

读完本章,你应当能够:

  1. 叙述并证明 Geršgorin 圆盘定理(包括"不交圆盘恰含相应个数特征值"的计数部分),会用对角相似加权改进它,并用它估计谱半径。
  2. 掌握严格对角占优、不可约对角占优与非奇异性 / 正定性的关系,理解不可约性的图论刻画。
  3. 掌握 Bauer–Fike 定理与 Hoffman–Wielandt 定理,区分正规矩阵与非正规矩阵特征值扰动的本质差异。
  4. 会用单特征值的导数公式 \(\partial\lambda/\partial a_{ij}=\bar y_ix_j/y^*x\) 做灵敏度分析,并理解特征向量在小间隙下的不稳定性。
  5. 会用残差给出近似特征值的后验误差界。
  6. 了解 Ostrowski、Brauer(Cassini 卵形)、Brualdi 等更精细的包含集。

读前导读

这一章在解决什么问题。 两件事:一是"不算特征值,只看矩阵元素就大致知道特征值在哪";二是"矩阵有估计误差时,特征值和特征向量会偏多少"。

第一件事的实务版本是:风控系统里每天要检查几百个协方差、相关矩阵是不是正定(正定 = 任何非零组合的方差都为正)。求特征值慢且依赖数值库,Geršgorin 定理给出一个只用加减法的检查:每一行"对角元减去其余元素绝对值之和"如果都为正,矩阵就正定。它也能不求特征值就判断 VAR 是否平稳。

第二件事和你熟悉的"估计风险"直接相关。CFA 讲 PCA 和因子模型时默认主成分是确定的,但实际中协方差是从有限样本估出来的。本章告诉你:主成分的方差(特征值)对估计误差很稳,误差不超过协方差误差的谱范数;主成分的方向(特征向量、因子载荷)却可能很不稳,相邻两个主成分方差接近时,方向可以转 60°。另一个结论是:对称矩阵(协方差)的特征值稳定,非对称矩阵(VAR 系数、转移矩阵、网络敞口)的特征值可能被误差放大几百倍——这直接影响"估计的 VAR 是否平稳"这种判断能不能信。

需要先想起来的数学。

  • 复数的模与复平面上的圆盘。一般矩阵的特征值可能是复数 \(a+bi\),模 \(|a+bi|=\sqrt{a^2+b^2}\) 是它到原点的距离。\(\{z:|z-c|\le r\}\) 是以 \(c\) 为圆心、半径 \(r\) 的圆盘。对称矩阵特征值都是实数,圆盘就退化为实数区间 \([c-r,c+r]\)。
  • 特征值、特征向量与相似。\(Ax=\lambda x\);\(S^{-1}AS\) 与 \(A\) 特征值相同(换坐标不改变"伸缩倍数")。左特征向量 \(y\) 满足 \(y^*A=\lambda y^*\),即 \(A^*\) 的特征向量;对称矩阵左右特征向量相同。见 第 00 册第 06 章 线性代数速成。
  • 正规矩阵与 Hermitian。Hermitian 指 \(A^*=A\)(实矩阵就是对称);正规指 \(AA^*=A^*A\),等价于能用正交(酉)矩阵对角化。协方差矩阵是对称的,因而是正规的;VAR 系数矩阵一般不是。
  • 条件数与谱范数。\(\|E\|_2\) 是 \(E\) 的最大奇异值,\(\|E\|_F=\sqrt{\sum e_{ij}^2}\);\(\kappa(S)=|||S|||\,|||S^{-1}|||\) 是误差放大倍数。见第 05b 章。
  • 导数与一阶近似。\(\lambda(t)\approx\lambda(0)+t\lambda'(0)\),和用久期近似债券价格变化是同一个动作。见 第 00 册第 02 章 导数与泰勒展开。

怎么读这一章。 核心必读:6.2.1(Geršgorin 定理和那个"看最大分量"的证明)、6.2.4(对角占优与正定)、6.4.1(Bauer–Fike)、6.4.3(特征值导数)、6.4.4(特征向量不稳定)。6.2.1 的计数部分用了复变函数的辐角原理(\(N(\epsilon)\) 那个积分只是"数曲线内有几个根"的工具),第一次只记结论即可。6.3 节的不可约与有向图可以只看定义和量化含义框;6.4.2 的 Hoffman–Wielandt 证明和 6.5 节第一次可以跳过。实战 2 的第 3 部分(主成分方向误差随间隙变化)建议细看。


6.1 问题的提出(6.0 节)

对角矩阵的特征值一目了然,而特征值连续依赖于矩阵元素,所以自然要问:"近似对角"的矩阵,特征值在哪里?原书举的动机包括:

  • 椭圆型偏微分方程离散化得到的大型线性方程组,系数矩阵通常近似对角;
  • 振荡系统的长期稳定性要求所有特征值在左半平面;统计或数值分析中常要证明某个 Hermitian 矩阵的特征值全为正;
  • 我们已经知道所有特征值都在半径 \(|||A|||\) 的圆盘内(第 05b 章),但想要更小、更易计算的包含集;
  • 扰动 \(A\to A+E\) 时,特征值的连续性只说"变化不大",我们要显式的界。

量化场景:验证一个估计出的协方差 / 相关矩阵是否正定、给出 \(\lambda_{\min}\) 的廉价下界(从而给出条件数上界);判断一个 VAR 系数矩阵或网络矩阵的谱半径是否小于 1;评估协方差估计误差对主成分方差和方向的影响;计算组合风险对单个协方差元素的灵敏度。


6.2 Geršgorin 圆盘(6.1 节)

6.2.1 定理与证明

把 \(A\) 写成对角部分加非对角部分 \(A=D+B\),考察 \(A_\epsilon=D+\epsilon B\):\(\epsilon=0\) 时特征值是 \(a_{ii}\),\(\epsilon\) 小时特征值在 \(a_{ii}\) 附近。Geršgorin 定理把这个直觉精确化。

记去心绝对行和(deleted absolute row sums)

\[R_i'(A)=\sum_{j\ne i}|a_{ij}|.\]

定理 6.1.1(Geršgorin) \(A\in M_n\) 的所有特征值都落在

\[G(A)=\bigcup_{i=1}^n\{z\in\mathbf C:|z-a_{ii}|\le R_i'(A)\}\tag{6.1.2}\]

中。进一步,若其中 \(k\) 个圆盘的并与其余 \(n-k\) 个圆盘不相交,则这 \(k\) 个圆盘的并恰好含有 \(A\) 的 \(k\) 个特征值(按代数重数计)。

证明(包含部分) 设 \(Ax=\lambda x\),取 \(p\) 使 \(|x_p|=\|x\|_\infty>0\)。看第 \(p\) 个分量:\((\lambda-a_{pp})x_p=\sum_{j\ne p}a_{pj}x_j\),于是

\[|x_p|\,|\lambda-a_{pp}|\le\sum_{j\ne p}|a_{pj}|\,|x_j|\le|x_p|\,R_p'.\]

除以 \(|x_p|\) 得 \(|\lambda-a_{pp}|\le R_p'\)。\(\square\)

证明只用了一个想法:看特征向量最大的那个分量。这个想法在本章反复出现。

推导拆解:

  1. \(Ax=\lambda x\) 的第 \(p\) 行写开是 \(\sum_ja_{pj}x_j=\lambda x_p\)。把 \(j=p\) 那项 \(a_{pp}x_p\) 移到右边,得 \((\lambda-a_{pp})x_p=\sum_{j\ne p}a_{pj}x_j\)。
  2. 两边取绝对值,右边用三角不等式:\(\le\sum_{j\ne p}|a_{pj}|\,|x_j|\)。
  3. 关键一步:\(p\) 是选出来的"最大分量",所以每个 \(|x_j|\le|x_p|\),替换后提出 \(|x_p|\),剩下的就是 \(R_p'\)。
  4. \(x\ne0\) 保证 \(|x_p|>0\),可以约掉。 注意定理只说"每个特征值落在某个圆盘里",至于是哪个圆盘,取决于它的特征向量最大分量在哪一位,事先不知道。 小例子:\(A=\begin{bmatrix}4&1\\0.5&1\end{bmatrix}\),圆盘为 \(|z-4|\le1\) 和 \(|z-1|\le0.5\),不相交,所以各含一个特征值。实际特征值约 \(4.16\) 和 \(0.84\),确实分别落在 \([3,5]\) 与 \([0.5,1.5]\) 中。 白话解释:对角元是"自己对自己的影响",非对角元是"别人对自己的影响"。别人的影响越小,特征值就越接近对角元。相关矩阵对角元都是 1,所以特征值离 1 有多远,取决于每只股票与其他股票相关系数绝对值之和。

证明(计数部分) 经置换相似,设前 \(k\) 个圆盘的并 \(G_k\) 与其余圆盘的并不交。对 \(\epsilon\in[0,1]\),\(A_\epsilon=D+\epsilon B\) 的圆盘半径是 \(\epsilon R_i'\),所以每个圆盘都含在 \(A\) 的对应圆盘里,\(G_k(A_\epsilon)\) 始终与其余部分不交。取一条包围 \(G_k\) 且与其余圆盘不交的闭曲线 \(\Gamma\),由辐角原理,\(\Gamma\) 内特征多项式 \(p_\epsilon(z)=\det(zI-A_\epsilon)\) 的零点个数

\[N(\epsilon)=\frac1{2\pi i}\oint_\Gamma\frac{p_\epsilon'(z)}{p_\epsilon(z)}dz\]

是 \(\epsilon\) 的连续整数值函数,因而是常数。\(N(0)=k\)(零点 \(a_{11},\dots,a_{kk}\)),所以 \(N(1)=k\)。\(\square\)

注意:计数部分不要求 \(G_k\) 连通;若一组圆盘相互重叠连成一片,只能断言这一片里的特征值总数,不能断言每个圆盘里各有一个。

白话解释:计数部分的思路是"连续变形,个数不会跳"。从纯对角矩阵(\(\epsilon=0\),特征值就是对角元,个数一目了然)开始,慢慢把非对角元"调大"到原值(\(\epsilon=1\))。特征值随 \(\epsilon\) 连续移动,而且始终被关在各自不断变大的圆盘里。因为前 \(k\) 个圆盘和其余圆盘之间始终隔着空隙,特征值无法"跳"过空隙,所以前 \(k\) 个圆盘里的特征值个数从头到尾都是 \(k\)。积分 \(N(\epsilon)\) 只是把"数根"写成连续函数的技术工具:一个只取整数值的连续函数必然是常数。

6.2.2 列版本与谱半径界

\(A\) 与 \(A^T\) 特征值相同,对 \(A^T\) 用定理得到用去心绝对列和 \(C_j'=\sum_{i\ne j}|a_{ij}|\) 的列版本(推论 6.1.3)。特征值落在行、列两个 Geršgorin 集的交 \(G(A)\cap G(A^T)\) 中。

第 \(i\) 个圆盘离原点最远的点的模是 \(|a_{ii}|+R_i'=\sum_j|a_{ij}|\),所以(推论 6.1.5)

\[\rho(A)\le\min\Big\{\max_i\sum_j|a_{ij}|,\ \max_j\sum_i|a_{ij}|\Big\}=\min\{|||A|||_\infty,|||A|||_1\},\]

与第 05b 章的 \(\rho(A)\le|||A|||\) 一致,但这里是几何推导。

6.2.3 对角相似加权

\(D=\operatorname{diag}(p_1,\dots,p_n)\),\(p_i>0\),\(D^{-1}AD=[p_ja_{ij}/p_i]\) 与 \(A\) 特征值相同,对角元不变,非对角元被重新加权。

推论 6.1.6 对任意正数 \(p_1,\dots,p_n\),\(A\) 的特征值落在

\[\bigcup_i\Big\{z:|z-a_{ii}|\le\frac1{p_i}\sum_{j\ne i}p_j|a_{ij}|\Big\}\]

中,计数结论同样成立。

例(原书图 6.1.7):\(A=\begin{bmatrix}1&1\\0&2\end{bmatrix}\) 的特征值是 1、2。直接用 Geršgorin,得到圆盘 \(|z-1|\le1\) 和点 \(\{2\}\),估计很粗;取 \(D=\operatorname{diag}(1,r)\),第一个圆盘半径变成 \(r\),可以任意小——适当加权可以让估计任意精确。

推论 6.1.8(谱半径的加权界)

\[\rho(A)\le\min_{p_1,\dots,p_n>0}\max_i\frac1{p_i}\sum_jp_j|a_{ij}|.\]

对正矩阵(或非负不可约矩阵),最优权重是 Perron 特征向量,此时界恰好等于 \(\rho(A)\)(原书 8.1.31,即原书第 8 章的 Perron–Frobenius 理论)。

白话解释:\(D^{-1}AD\) 是"换单位"——把第 \(i\) 个变量的单位放大 \(p_i\) 倍。就像把一个组合里的资产从"按股数"改成"按百元市值"计量,经济含义不变(特征值不变),但矩阵的数字变了,Geršgorin 圆盘的半径也跟着变。所以可以挑一组单位让圆盘尽量小。 为什么 Perron 向量最优:若 \(A\ge0\)、\(Ap=\rho p\)、\(p>0\),则 \(D^{-1}AD\) 第 \(i\) 行的和是 \(\frac1{p_i}\sum_ja_{ij}p_j=\frac{(Ap)_i}{p_i}=\rho\),每一行都正好等于 \(\rho\),上界就是精确值。练习 3 是一个 \(2\times2\) 的手算例子。有负元素时不一定能取到:\(A=\begin{bmatrix}1&1\\-1.5&2\end{bmatrix}\) 有 \(\rho(A)<\min_D|||D^{-1}AD|||_\infty\)。

最优性:只用对角元和非对角元绝对值的信息,闭集 \(\bigcap_DG(D^{-1}AD)\)(\(D\) 取遍正对角阵)不能再改进——R. Varga 证明,它边界上的每个点 \(z\) 都是某个 \(B\)(\(b_{ii}=a_{ii}\)、\(|b_{ij}|=|a_{ij}|\))的特征值。

利用额外信息:Hermitian 矩阵的特征值是实数,所以落在 \(\mathbf R\cap G(A)\)(若干实区间的并)中。原书练习:\(A=\begin{bmatrix}7&-16&8\\-16&7&-8\\8&-8&-5\end{bmatrix}\) 对称,行圆盘给出区间 \([-17,31]\)、\([-17,31]\)、\([-21,11]\),真实特征值为 \(-9,-9,27\)。

6.2.4 对角占优

矩阵非奇异当且仅当 0 不是特征值,所以只要 0 不在包含集中,矩阵就非奇异。

定义 6.1.9 \(A\) 对角占优(diagonally dominant):\(|a_{ii}|\ge R_i'\) 对所有 \(i\);严格对角占优:\(|a_{ii}|>R_i'\) 对所有 \(i\)。

定理 6.1.10 设 \(A\) 严格对角占优,则

  • (a) \(A\) 非奇异(Levy–Desplanques 定理,第 05b 章用 Neumann 级数证过);
  • (b) 若所有 \(a_{ii}>0\),则每个特征值实部为正;
  • (c) 若 \(A\) Hermitian 且所有 \(a_{ii}>0\),则 \(A\) 正定。

推导拆解:三条都是"0 不在圆盘里"的推论。 (a) 严格占优 ⇒ 每个圆盘 \(|z-a_{ii}|\le R_i'<|a_{ii}|\) 都不含原点 ⇒ 0 不是特征值 ⇒ 非奇异。 (b) 若还有 \(a_{ii}>0\),圆盘的圆心在正实轴上、半径小于圆心到原点的距离,整个圆盘都在右半平面(实部 \(\ge a_{ii}-R_i'>0\))。 (c) Hermitian 矩阵的特征值都是实数,结合 (b) 就全为正;Hermitian 且特征值全为正,就是正定(第 04a 章)。 正定的意义:对任何非零权重 \(w\),\(w^*Aw>0\)。对协方差矩阵,就是"没有方差为零或为负的组合"。

对角占优不够:\(\begin{bmatrix}1&1\\1&1\end{bmatrix}\) 对角占优但奇异;严格对角占优也不是必要条件:\(\begin{bmatrix}1&1\\1-\epsilon&1\end{bmatrix}\) 非奇异但不严格占优。

定理 6.1.11 若 \(A\) 对角元非零、对角占优,且至少 \(n-1\) 行严格占优,则 \(A\) 非奇异。证明:对唯一不严格的第 \(k\) 行,取权重 \(p_k=1+\epsilon\)、其余 \(p_i=1\),第 \(k\) 个圆盘缩小到不含 0,其余圆盘半径只增加 \(\epsilon|a_{ik}|\),\(\epsilon\) 足够小时仍不含 0。

量化含义:正定性的"证书"。对称矩阵若对角元为正且严格对角占优,就一定正定,并且

\[\lambda_{\min}\ge\min_i(a_{ii}-R_i'),\qquad\lambda_{\max}\le\max_i(a_{ii}+R_i').\]
对相关矩阵(对角元为 1),严格对角占优即 \(\max_iR_i'<1\),此时 \(\kappa_2\le\frac{1+\max R_i'}{1-\max R_i'}\)。这个判据对稠密的相关矩阵没用(50 只股票、平均相关 0.4,每行去心和约 20,下界是负数),但对稀疏或近似对角的矩阵非常有效:剔除因子后的残差相关矩阵、阈值化(thresholding)后的稀疏协方差估计、局部化的协方差(如只保留同行业的相关)。在高维协方差估计中,阈值化估计量是否正定是一个实际问题,Geršgorin 给出无需特征分解的充分条件。实战 1 演示。

6.2.5 习题 6.1 的要点

  • 6.1.P1、P9(迭代法收敛):解 \(Ax=y\) 的 Jacobi 迭代 \(x^{(m+1)}=(I-D^{-1}A)x^{(m)}+D^{-1}y\),误差按 \((I-D^{-1}A)^m\) 衰减。严格对角占优时 \(\rho(I-D^{-1}A)\le|||I-D^{-1}A|||_\infty<1\),迭代对任意初值收敛。
  • 6.1.P6、P10–P11(秩的下界):若有 \(k\) 行严格占优,\(\operatorname{rank}A\ge k\);更一般地 \(\operatorname{rank}A\ge\sum_{a_i\ne0}|a_{ii}|^2/\|a_i\|_2^2\)(\(a_i\) 为第 \(i\) 行)。
  • 6.1.P13:实严格对角占优矩阵的 \(\det A\) 与 \(a_{11}\cdots a_{nn}\) 同号。
  • 6.1.P14:若 \(|a_{ii}-a_{jj}|>R_i'+R_j'\) 对所有 \(i\ne j\),圆盘两两不交,\(A\) 有 \(n\) 个不同的特征值;\(A\) 实时它们都是实数(复特征值成对出现,而每个圆盘恰含一个)。
  • 6.1.P16(Gauss 消元保持严格对角占优):严格对角占优矩阵消去一列后的 Schur 补仍严格对角占优,所以做 LU 分解无需选主元。三对角的严格对角占优系统(如三次样条插值、隐式有限差分格式)可以用 \(O(n)\) 的追赶法稳定求解。
  • 6.1.P17(分块 Geršgorin):用分块范数 \(\mathcal R_i'=\sum_{j\ne i}|||A_{ij}|||\),特征值落在 \(\bigcup_i\sigma(A_{ii})\cup\{z:|||(zI-A_{ii})^{-1}|||^{-1}\le\mathcal R_i'\}\) 中。谱范数且对角块正规时,包含集是以各对角块特征值为心、半径 \(\sum_{k\ne i}|||A_{ik}|||_2\) 的圆盘。例:\(A_{11}=A_{22}=\begin{bmatrix}0&1\\1&0\end{bmatrix}\)、\(A_{12}=A_{21}^T=\begin{bmatrix}0&0\\.5&0\end{bmatrix}\),不对角占优但分块占优,分块 Geršgorin 给出 \([-1.5,-0.5]\cup[0.5,1.5]\),真实特征值 \(\pm0.78,\pm1.28\)。(分块结构的协方差矩阵——行业块内强相关、块间弱相关——正适合这种估计。)
  • 6.1.P18–P20(Hall–Marsli):几何重数为 \(k\) 的特征值至少落在 \(k\) 个不同的 Geršgorin 圆盘中。

6.3 Geršgorin 再探:不可约性与图(6.2 节)

6.3.1 只差一点的对角占优

严格对角占优 ⇒ 非奇异;对角占优不够。"对角占优 + 至少一行严格"够不够?不够:

\[\begin{bmatrix}4&2&1\\0&1&1\\0&1&1\end{bmatrix}\tag{6.2.1a}\]

对角占优、第一行严格,但右下角 \(2\times2\) 块奇异。问题出在"严格占优"的第一行与其他行"不连通"。

引理 6.2.3 设 \(Ax=\lambda x\),\(\lambda\) 不在任何 Geršgorin 圆盘的内部(即 \(|\lambda-a_{ii}|\ge R_i'\) 对所有 \(i\))。若 \(|x_p|=\|x\|_\infty\),则 (a) 第 \(p\) 个 Geršgorin 圆经过 \(\lambda\);(b) 若 \(a_{pq}\ne0\),则 \(|x_q|=\|x\|_\infty\) 也成立。

证明:6.2.1 节的不等式链两端被夹住,所以全部取等号,\(\sum_{j\ne p}|a_{pj}|(\|x\|_\infty-|x_j|)=0\),每项非负故为零。

所以"取到最大分量"这个性质会沿着非零元素传播。只要非零元素把所有下标连起来,就能推出每个圆都经过 \(\lambda\)。

6.3.2 有向图、强连通与不可约

定义 6.2.11 \(A\) 的有向图 \(\Gamma(A)\):\(n\) 个结点,\(a_{ij}\ne0\) 时有一条从 \(P_i\) 到 \(P_j\) 的弧。强连通:任意两个结点之间都有有向路径。

定义 6.2.21 \(A\) 可约(reducible):存在置换矩阵 \(P\) 使

\[P^TAP=\begin{bmatrix}B&C\\0&D\end{bmatrix},\qquad B,D\text{ 至少 }1\times1;\]

否则称不可约(irreducible)。

定理 6.2.24 以下等价:(a) \(A\) 不可约;(b) \((I+|A|)^{n-1}>0\)(逐元素);(c) \((I+M(A))^{n-1}>0\)(\(M(A)\) 为非零元的 0-1 指示矩阵);(d) \(\Gamma(A)\) 强连通;(e) \(A\) 有性质 SC(任意 \(p\ne q\) 之间有一串非零元 \(a_{pk_2},a_{k_2k_3},\dots,a_{k_{m-1}q}\))。

关键事实(定理 6.2.16):\((|A|^m)_{ij}\ne0\) 当且仅当 \(\Gamma(A)\) 中有从 \(P_i\) 到 \(P_j\) 长度为 \(m\) 的路径——非负数相加不会相消。两结点之间若有路径,就有长度不超过 \(n-1\) 的路径。检验时反复平方 \((I+|A|)^2,(I+|A|)^4,\dots\),约 \(\log_2n\) 次矩阵乘法即可。

白话解释:把 \(a_{ij}\ne0\) 读成"\(i\) 受 \(j\) 影响"(或"\(i\) 对 \(j\) 有敞口"),矩阵就是一张有向网络。"可约"是说可以把结点分成两组,其中一组从不受另一组影响——分块形式里左下角那块 \(0\) 就是"这条路不通"。"不可约"就是网络里任意两点都能沿箭头走到。 为什么 \(|A|^m\) 能检测路径:\((|A|^2)_{ij}=\sum_k|a_{ik}|\,|a_{kj}|\),只要存在某个中转结点 \(k\) 使两段都非零,这一项就为正,而非负数相加不会抵消。同理 \((|A|^m)_{ij}>0\) 当且仅当存在一条恰好 \(m\) 步的路径。加上 \(I\) 允许"原地停一步",所以 \((I+|A|)^{n-1}>0\) 表示任意两点之间在 \(n-1\) 步内都能到达。 小例子:(6.2.1a) 中结点 2、3 只指向彼此(第 2、3 行第 1 列都是 0),永远到不了结点 1,所以可约。

可约的好处:\(A\) 可约时,方程组 \(Ax=y\) 可以分成两个更小的方程组先后求解(先解 \(D\zeta=\omega\),再解 \(Bz=w-C\zeta\))。

量化含义:不可约 = 网络强连通。资产收益的 Granger 因果网络、银行间敞口网络、Markov 转移矩阵、投入产出矩阵,是否不可约决定了冲击能否从任何一个结点传到所有结点、Markov 链是否只有一个"连通的"长期状态。原书第 8 章的 Perron–Frobenius 理论(非负不可约矩阵有正的 Perron 特征向量)建立在这个概念上。

6.3.3 Taussky 定理

定理 6.2.26(Taussky) 设 \(A\) 不可约,\(\lambda\) 满足 \(|\lambda-a_{ii}|\ge R_i'\)(例如 \(\lambda\) 在 \(G(A)\) 的边界上)。若 \(\lambda\) 是特征值,则每个 Geršgorin 圆都经过 \(\lambda\)。等价地:只要有一个圆不经过 \(\lambda\),\(\lambda\) 就不是特征值。

定义 6.2.25 不可约对角占优:不可约、对角占优、且至少一行严格占优。

推论 6.2.27(Taussky) 设 \(A\) 不可约对角占优,则 (a) 非奇异;(b) 若对角元为正实数,每个特征值实部为正;(c) 若还是 Hermitian,则正定。

例(6.2.P7):对角元为 2、上下次对角元为 \(-1\) 的三对角矩阵(离散 Laplace 算子 / 二阶差分矩阵)不可约、对角占优,首末两行严格占优,所以正定。中间各行都只是"刚好"占优(\(2=|-1|+|-1|\)),严格对角占优判据用不上,Taussky 推论正好补上。这个矩阵是有限差分法解热方程(以及变量替换后的 Black–Scholes 方程)的核心,正定性保证隐式格式每一步的线性方程组可解且稳定。

其他习题:6.2.P3——若 \(|A|x=\lambda x\)、\(x>0\),令 \(D=\operatorname{diag}(x)\),则 \(D^{-1}|A|D\) 的所有绝对行和都等于 \(\lambda=\rho(|A|)\);6.2.P4——\(\rho(A)\le\rho(|A|)\);6.2.P8——\(A\) 不可约且绝对行和不全相等时 \(\rho(A)<|||A|||_\infty\)(严格)。


6.4 特征值扰动定理(6.3 节)

6.4.1 Bauer–Fike 定理

先看对角矩阵 \(D=\operatorname{diag}(\lambda_i)\) 加扰动 \(E\):对 \(D+E\) 用 Geršgorin,每个特征值 \(\hat\lambda\) 都满足 \(|\hat\lambda-\lambda_i|\le\sum_j|e_{ij}|\le|||E|||_\infty\)(对某个 \(i\))。可对角化矩阵 \(A=S\Lambda S^{-1}\) 可以先变换到对角形(观察 6.3.1)。用范数理论推广:

定理 6.3.2(Bauer–Fike) 设 \(A=S\Lambda S^{-1}\) 可对角化,\(|||\cdot|||\) 是由绝对向量范数诱导的矩阵范数(如 \(|||\cdot|||_1,|||\cdot|||_2,|||\cdot|||_\infty\))。若 \(\hat\lambda\) 是 \(A+E\) 的特征值,则存在 \(A\) 的特征值 \(\lambda\) 使

\[|\hat\lambda-\lambda|\le|||S|||\,|||S^{-1}|||\,|||E|||=\kappa(S)\,|||E|||.\tag{6.3.3}\]

证明 设 \(\hat\lambda\) 不是 \(A\) 的特征值。\(\hat\lambda I-(A+E)\) 奇异,左乘 \(S^{-1}\)、右乘 \(S\) 得 \(\hat\lambda I-\Lambda-S^{-1}ES\) 奇异,即 \(I-(\hat\lambda I-\Lambda)^{-1}S^{-1}ES\) 奇异。由 Neumann 级数(第 05b 章),奇异意味着

\[1\le|||(\hat\lambda I-\Lambda)^{-1}S^{-1}ES|||\le|||(\hat\lambda I-\Lambda)^{-1}|||\cdot|||S^{-1}ES|||=\frac{|||S^{-1}ES|||}{\min_i|\hat\lambda-\lambda_i|},\]

最后一步用了绝对范数诱导的范数对对角阵取最大模(定理 5.6.36)。所以 \(\min_i|\hat\lambda-\lambda_i|\le|||S^{-1}ES|||\le\kappa(S)|||E|||\)。\(\square\)

推导拆解:

  1. \(\hat\lambda\) 是 \(A+E\) 的特征值 ⇔ \(\hat\lambda I-A-E\) 奇异。左乘 \(S^{-1}\)、右乘 \(S\) 不改变奇异性,且 \(S^{-1}AS=\Lambda\),得 \(\hat\lambda I-\Lambda-S^{-1}ES\) 奇异。
  2. 因为假设了 \(\hat\lambda\) 不是 \(A\) 的特征值,对角阵 \(\hat\lambda I-\Lambda\) 可逆,把它提到左边:\((\hat\lambda I-\Lambda)\big[I-(\hat\lambda I-\Lambda)^{-1}S^{-1}ES\big]\),于是方括号里的矩阵奇异。
  3. 第 05b 章 Neumann 级数说:若 \(|||M|||<1\),则 \(I-M\) 可逆。现在 \(I-M\) 奇异,所以 \(|||M|||\ge1\)。
  4. 用次乘性拆开 \(M\)。对角阵 \((\hat\lambda I-\Lambda)^{-1}\) 的对角元是 \(1/(\hat\lambda-\lambda_i)\),绝对范数诱导的范数对它取最大模,即 \(1/\min_i|\hat\lambda-\lambda_i|\)。
  5. 移项得 \(\min_i|\hat\lambda-\lambda_i|\le|||S^{-1}ES|||\),最后再用一次次乘性 \(\le|||S^{-1}|||\,|||E|||\,|||S|||\)。 若 \(\hat\lambda\) 本来就是 \(A\) 的特征值,左边是 0,结论自动成立。

解释:条件数又出现了。第 05b 章中它是求逆和解方程的误差放大倍数;这里特征向量矩阵的条件数 \(\kappa(S)\) 是特征值计算的误差放大倍数。

推论 6.3.4(正规矩阵) 若 \(A\) 正规,可取 \(S\) 为酉矩阵,谱范数下 \(\kappa(S)=1\):

\[|\hat\lambda-\lambda|\le|||E|||_2.\]

注意 \(E\) 和 \(A+E\) 都不必正规,例如实对称矩阵受到非对称扰动。正规矩阵的特征值计算是良态的。

Hermitian 情形更强(6.3.4.1):\(A,E\) 都 Hermitian 时,第 04a 章的 Weyl 不等式给出按序配对的界 \(\lambda_1(E)\le\lambda_k(A+E)-\lambda_k(A)\le\lambda_n(E)\),不需要去找哪个和哪个对应。

量化含义:协方差矩阵是对称的,它的特征值(主成分方差)对估计误差是稳定的:误差不超过 \(\|\hat\Sigma-\Sigma\|_2\)。VAR 系数矩阵、状态转移矩阵、网络矩阵一般不对称,它们的特征值可能对估计误差极其敏感——误差被放大 \(\kappa(S)\) 倍。判断"VAR 是否平稳"(\(\rho(\hat A)<1\)?)时,若 \(\hat A\) 的特征向量矩阵病态,估计出的谱半径可能完全不可信。实战 2 中同一组特征值,对称矩阵在 \(\|E\|=10^{-3}\) 扰动下移动 \(5\times10^{-4}\),非正规矩阵移动 \(6\times10^{-3}\),相差 12 倍。

6.4.2 Hoffman–Wielandt 定理:整体扰动

Bauer–Fike 只说每个 \(\hat\lambda\) 离某个 \(\lambda\) 近。正规矩阵有更强的"整体"结论:

定理 6.3.5(Hoffman–Wielandt) 设 \(A\) 与 \(A+E\) 都正规,特征值分别为 \(\lambda_i\)、\(\hat\lambda_i\)。则存在置换 \(\sigma\) 使

\[\sum_{i=1}^n|\hat\lambda_{\sigma(i)}-\lambda_i|^2\le\|E\|_F^2.\tag{6.3.6}\]

证明 \(A=V\Lambda V^*\),\(A+E=W\hat\Lambda W^*\),\(U=V^*W=[u_{ij}]\)。Frobenius 范数酉不变,

\[\|E\|_F^2=\|U\hat\Lambda-\Lambda U\|_F^2=\sum_{i,j}|\hat\lambda_j-\lambda_i|^2|u_{ij}|^2.\]

\([|u_{ij}|^2]\) 是双随机矩阵(酉矩阵的行、列都是单位向量),所以右边不小于线性函数 \(\sum_{i,j}|\hat\lambda_j-\lambda_i|^2s_{ij}\) 在双随机矩阵集上的最小值。线性函数在紧凸集上的最小值在顶点取到,而由 Birkhoff 定理,双随机矩阵集的顶点是置换矩阵。\(\square\)

这个证明把第 04a 章的双随机矩阵和优超理论用到了扰动分析上。

推导拆解:

  1. 为什么 \(\|E\|_F=\|U\hat\Lambda-\Lambda U\|_F\):\(E=W\hat\Lambda W^*-V\Lambda V^*\),左乘 \(V^*\)、右乘 \(W\)(都是酉矩阵,不改变 Frobenius 范数)得 \(V^*W\hat\Lambda-\Lambda V^*W=U\hat\Lambda-\Lambda U\)。
  2. 逐元素计算:\((U\hat\Lambda)_{ij}=u_{ij}\hat\lambda_j\),\((\Lambda U)_{ij}=\lambda_iu_{ij}\),所以 \((i,j)\) 元是 \((\hat\lambda_j-\lambda_i)u_{ij}\),平方求和即得。
  3. 双随机矩阵指每个元素非负、每行每列之和都为 1。\(U\) 酉,每行、每列都是单位向量,所以 \(|u_{ij}|^2\) 每行每列之和为 1。
  4. 把 \(s_{ij}=|u_{ij}|^2\) 当作变量,目标 \(\sum c_{ij}s_{ij}\)(\(c_{ij}=|\hat\lambda_j-\lambda_i|^2\))是线性的;线性规划的最优解落在可行域的顶点上,而 Birkhoff 定理说双随机矩阵集合的顶点就是置换矩阵。置换矩阵代入后,目标恰好是 \(\sum_i|\hat\lambda_{\sigma(i)}-\lambda_i|^2\)。 白话解释:\(s_{ij}\) 可以看作"旧的第 \(i\) 个主成分有多少比例变成了新的第 \(j\) 个"。整体误差是加权平均,而加权平均不会小于"一一配对"中最好的那种。

推论 6.3.8 若 \(A\) Hermitian、\(A+E\) 正规,\(A\) 的特征值递增、\(A+E\) 的特征值按实部递增排列,则按序配对即可:\(\sum|\hat\lambda_i-\lambda_i|^2\le\|E\|_F^2\)。(证明:相邻两项未按序时交换它们不增加平方和,"冒泡排序"即可。)特别地,\(A,E\) 都 Hermitian 时,

\[\sum_i\big(\lambda_i(A+E)-\lambda_i(A)\big)^2\le\|E\|_F^2.\]

正规性假设不可去:\(A=\begin{bmatrix}0&0\\0&4\end{bmatrix}\),\(E=\begin{bmatrix}-1&-1\\1&-3\end{bmatrix}\),\(A+E=\begin{bmatrix}-1&-1\\1&1\end{bmatrix}\) 幂零(非正规),任何配对下平方和都是 16,而 \(\|E\|_F^2=12\)。另外,6.3.P8 说明总存在某个置换使不等式反向,所以"存在一个置换"不能改成"任意置换"。

量化含义:Weyl 界控制最坏的一个特征值的误差(用谱范数),Hoffman–Wielandt 控制所有特征值误差的平方和(用 Frobenius 范数)。对样本协方差,\(\|\hat\Sigma-\Sigma\|_F^2=\sum_{i,j}(\hat\sigma_{ij}-\sigma_{ij})^2\) 是逐元素估计误差的平方和,容易从元素的抽样方差估计;Hoffman–Wielandt 说整个特征值谱的误差不会超过它。

6.4.3 单特征值的导数

\(A\) 不可对角化时没有 Bauer–Fike 这样的界(6.3.P7:\(A=J_2(0)\),\(A+tE_{21}\) 的特征值 \(\pm\sqrt t\),在 \(t=0\) 处连续但不可微,不存在 \(c\) 使 \(|\lambda(t)-\lambda|\le c|t|\))。但单特征值有精确的一阶公式。

定理 6.3.12 设 \(\lambda\) 是 \(A\) 的单特征值,\(x,y\) 分别为右、左特征向量(\(Ax=\lambda x\),\(y^*A=\lambda y^*\))。则 \(|t|\) 足够小时,\(A+tE\) 在 \(\lambda\) 附近恰有一个特征值 \(\lambda(t)\),它在 \(t=0\) 可微,且

\[\left.\frac{d\lambda(t)}{dt}\right|_{t=0}=\frac{y^*Ex}{y^*x}.\tag{6.3.13}\]

(单特征值保证 \(y^*x\ne0\),见第 01 章 1.5 节左右特征向量部分。)

推导拆解:不用 Geršgorin,用"假设可微、再求导"也能看出公式从哪来(这是启发式推导,严格性由下面的证明思路保证)。

  1. 设 \((A+tE)x(t)=\lambda(t)x(t)\),\(x(0)=x\),\(\lambda(0)=\lambda\)。
  2. 两边对 \(t\) 求导(乘积法则),在 \(t=0\) 处:\(Ex+Ax'=\lambda'x+\lambda x'\)。
  3. 左乘 \(y^*\):因为 \(y^*A=\lambda y^*\),\(y^*Ax'\) 与右边的 \(\lambda y^*x'\) 抵消,剩下 \(y^*Ex=\lambda'\,y^*x\)。
  4. 除以 \(y^*x\) 即得 (6.3.13)。左特征向量的作用就是把未知的 \(x'\) 消掉。 对称矩阵 \(y=x\)、\(\|x\|_2=1\) 时,公式变成 \(\lambda'=x^TEx\)——特征值的变化率等于扰动在该主成分方向上的"方差"。 金融直觉:这就是特征值的"久期"。久期告诉你收益率变 1bp 价格变多少;这里告诉你矩阵沿 \(E\) 方向变一点,特征值变多少。分母 \(y^*x\) 小,就像久期很大的长债,对同样的冲击反应剧烈。

证明思路:把 \(A\) 相似到 \(\begin{bmatrix}\lambda&0\\0&A_1\end{bmatrix}\)(\(\lambda\) 不是 \(A_1\) 的特征值),再用相似把 \(A_1\) 变成"几乎对角"的上三角形,最后用一个缩放 \([1]\oplus rI\) 把第一行的非对角元压小。这样 \(A+tE\) 相似于一个矩阵,其第一个 Geršgorin 圆盘以 \(\lambda+ty^*Ex/y^*x\) 为心、半径 \(\le|t|\varepsilon\),并与其余圆盘不交;由 Geršgorin 计数定理,这个小圆盘里恰有一个特征值。——Geršgorin 定理在这里成了证明可微性的工具。

取 \(E=E_{ij}\)(只有 \((i,j)\) 元为 1)得特征值对矩阵元素的偏导数

\[\frac{\partial\lambda}{\partial a_{ij}}=\frac{\bar y_ix_j}{y^*x}.\tag{6.3.13b}\]

例:\(A=\begin{bmatrix}1&1\\0&1+\epsilon\end{bmatrix}\),单特征值 1 的 \(x=[1,0]^T\),\(y=[\epsilon,-1]^T\),\(y^*x=\epsilon\),偏导数是 \(O(1/\epsilon)\) 量级。左右特征向量接近正交时,特征值对扰动极其敏感;单位化后的 \(1/|y^*x|\) 就是特征值的条件数(第 01 章 1.5.4 节)。

量化含义:风险对协方差元素的灵敏度。对称矩阵 \(y=x\),单位化后 \(\partial\lambda/\partial a_{ij}=x_ix_j\)。对协方差矩阵要同时改动 \(\sigma_{ij}\) 和 \(\sigma_{ji}\),所以

\[\frac{\partial\lambda_{\max}}{\partial\sigma_{ij}}=2x_ix_j\ (i\ne j),\qquad\frac{\partial\lambda_{\max}}{\partial\sigma_{ii}}=x_i^2.\]
第一主成分的方差对哪两只股票的协方差最敏感,就看这两只股票在第一主成分上的载荷乘积。同样的公式给出组合风险对相关性冲击的一阶敏感度,用于相关性压力测试。(若 \(\lambda_{\max}\) 是重特征值,导数公式不适用,这就是 6.3.P10 的情形。)

6.4.4 特征向量可能不稳定

与特征值不同,特征向量可能因微小扰动剧烈变化。原书的例子:\(A=I_2\),\(E=\begin{bmatrix}\epsilon&\delta\\0&0\end{bmatrix}\),\(A+E\) 的特征值 \(1\) 和 \(1+\epsilon\),第二个单位特征向量是 \((\epsilon^2+\delta^2)^{-1/2}[-\delta,\epsilon]^T\)。调节 \(\epsilon/\delta\),它可以指向任何方向,而 \(\epsilon,\delta\) 可以任意小。根源是 \(A\) 有重特征值——特征值间隙为零。

推导拆解:\(A+E=\begin{bmatrix}1+\epsilon&\delta\\0&1\end{bmatrix}\) 是上三角,特征值就是对角元 \(1+\epsilon\) 和 \(1\)。 对特征值 \(1+\epsilon\):\((A+E-(1+\epsilon)I)v=\begin{bmatrix}0&\delta\\0&-\epsilon\end{bmatrix}v=0\),得 \(v=[1,0]^T\),方向固定。 对特征值 \(1\):\(\begin{bmatrix}\epsilon&\delta\\0&0\end{bmatrix}v=0\),得 \(\epsilon v_1+\delta v_2=0\),即 \(v\propto[-\delta,\epsilon]^T\)。 所以原文中"第二个单位特征向量" \([-\delta,\epsilon]^T/\sqrt{\epsilon^2+\delta^2}\) 对应的是特征值 \(1\)(按"特征值 1 和 \(1+\epsilon\)"的列举顺序它是第一个,阅读时注意配对)。结论不受影响:它的方向由比值 \(\epsilon/\delta\) 决定,取 \(\epsilon=\delta=10^{-10}\) 时指向 \([-1,1]^T\) 方向,取 \(\epsilon=10^{-10}\)、\(\delta=0\) 时指向 \([0,1]^T\)——扰动几乎为零,方向却可以任意。 金融直觉:两个主成分方差相同,就像一个圆形的"风险碗",碗里没有哪个方向更特殊。样本噪声稍微把圆压成椭圆,长轴落在哪个方向完全由噪声决定。

间隙不为零时,特征向量的变化量大约与 \(\|E\|/\text{间隙}\) 成正比。(这一定量结论是 Davis–Kahan \(\sin\Theta\) 定理,不在本书范围内,见 Stewart–Sun《Matrix Perturbation Theory》;一个常用的版本是:对称矩阵某个单特征值的单位特征向量,扰动前后夹角满足 \(\sin\theta\le2\|E\|_2/\delta\),\(\delta\) 是该特征值与其余特征值的最小距离。)

量化含义:PCA 因子"旋转"与"换位"。当两个主成分的方差接近时,样本主成分方向在不同估计窗口之间可能大幅旋转甚至交换次序。实战 2 中,第一、第二主成分方差差 0.1 时,样本第一主成分与真实方向的夹角中位数约 20°、90% 分位约 61°;差 0.8 时只有 3°。实务含义:(1) 统计因子模型的第 2、3……个因子的载荷往往不稳定,滚动估计时要做因子对齐(按载荷相关性匹配、处理符号翻转);(2) 只有那些与相邻特征值间隙大的主成分(通常是市场因子)的方向才可信;(3) 基于特征向量的策略(如用第 \(k\) 个主成分构造统计套利组合)对估计误差非常敏感。

6.4.5 后验界:残差

以上都是先验界。若已有近似特征向量 \(\hat x\ne0\) 和近似特征值 \(\hat\lambda\),残差 \(r=A\hat x-\hat\lambda\hat x\):

定理 6.3.14 设 \(A=S\Lambda S^{-1}\) 可对角化,\(|||\cdot|||\) 由绝对范数 \(\|\cdot\|\) 诱导。则存在 \(A\) 的特征值 \(\lambda\) 使

\[|\hat\lambda-\lambda|\le\kappa(S)\frac{\|r\|}{\|\hat x\|};\qquad A\text{ 正规时 }|\hat\lambda-\lambda|\le\frac{\|r\|_2}{\|\hat x\|_2}.\tag{6.3.15–16}\]

证明:\(\hat x=S(\Lambda-\hat\lambda I)^{-1}S^{-1}r\),取范数即得。

推导拆解:设 \(\hat\lambda\) 不是特征值(否则结论自明)。

  1. 残差定义 \(r=(A-\hat\lambda I)\hat x\),而 \(A-\hat\lambda I=S(\Lambda-\hat\lambda I)S^{-1}\) 可逆,所以 \(\hat x=S(\Lambda-\hat\lambda I)^{-1}S^{-1}r\)。
  2. 取范数并用次乘性:\(\|\hat x\|\le|||S|||\cdot\frac1{\min_i|\lambda_i-\hat\lambda|}\cdot|||S^{-1}|||\,\|r\|\)(对角阵的范数仍是对角元最大模,同 Bauer–Fike 第 4 步)。
  3. 整理即 \(\min_i|\lambda_i-\hat\lambda|\le\kappa(S)\|r\|/\|\hat x\|\)。正规时 \(S\) 取酉矩阵,\(\kappa_2(S)=1\)。 实务读法:用幂法或 Lanczos 估计协方差矩阵的最大特征值时,每一步算一次残差范数 \(\|\Sigma v-\theta v\|_2\)(\(v\) 单位化),它就是特征值误差的保证上界,降到容忍度以下即可停止。

与线性方程组对比:第 05b 章说病态方程组的小残差不保证小误差;而 (6.3.16) 说正规矩阵的近似特征对残差小,近似特征值的绝对误差就一定小,界里没有条件数。但特征向量没有这种好结果(6.3 节练习:\(A=\begin{bmatrix}1&\epsilon\\\epsilon&1\end{bmatrix}\),\(\hat x=[1,0]^T\),\(\hat\lambda=1\),残差只有 \(\epsilon\),但 \(\hat x\) 与两个真特征向量 \([1,\pm1]^T\) 都成 45°)。

习题 6.3.P2:给定 \(\hat x\)(\(\|\hat x\|_2=1\)),使残差最小的 \(\hat\lambda\) 是 Rayleigh 商 \(\hat x^*A\hat x\);正规矩阵在圆盘 \(|z-y^*Ay|\le(\|Ay\|_2^2-|y^*Ay|^2)^{1/2}\) 内至少有一个特征值,Hermitian 时是一个实区间。这给出幂法、Lanczos 等迭代算法的停止准则。

6.4.6 其他习题要点

  • 6.3.P1:正规矩阵存在置换使 \(\sum_i|a_{ii}-\lambda_{\sigma(i)}|^2\le\sum_{i\ne j}|a_{ij}|^2\)——对角元近似特征值的误差由非对角元控制(Hoffman–Wielandt 用于 \(A=D+(A-D)\))。对协方差矩阵:资产方差与主成分方差之间的差异由协方差项的平方和控制。
  • 6.3.P5–P6(不要用特征多项式求特征值):\(p(t)=(t-t_0)^2\) 的系数扰动 \(\epsilon\) 使零点变为 \(t_0\pm\sqrt\epsilon\)——多项式零点对系数可以极端敏感。正规矩阵的特征值问题本来是良态的,先算特征多项式再求根会把它变成病态问题。
  • 6.3.P3:正规矩阵 \(\begin{bmatrix}B&X\\Y&C\end{bmatrix}\) 中,\(B\) 的每个特征值 \(\beta\) 附近 \(|z-\beta|\le|||Y|||_2\) 内有 \(A\) 的特征值——弱耦合的块,特征值近似等于各块自己的特征值。

6.5 其他特征值包含集(6.4 节)

Geršgorin 的思想有许多推广。这一节的结果在量化中很少直接使用,主要价值在于理解"用元素信息定位特征值"能做到多精细。

定理 6.4.1(Ostrowski) 对任意 \(\alpha\in[0,1]\),特征值落在

\[\bigcup_i\{z:|z-a_{ii}|\le R_i'^{\,\alpha}C_i'^{\,1-\alpha}\}\]

中,在行版(\(\alpha=1\))与列版(\(\alpha=0\))Geršgorin 之间插值。证明用 Hölder 不等式(\(p=1/\alpha\))。例:\(A=\begin{bmatrix}1&4\\1&6\end{bmatrix}\),行版圆盘 \(|z-1|\le4\)、\(|z-6|\le1\),列版 \(|z-1|\le1\)、\(|z-6|\le4\),\(\alpha=\tfrac12\) 时两个圆盘半径都是 2 且不交,真实特征值约 0.30 与 6.70。

定理 6.4.7(Brauer,Cassini 卵形) \(n\ge2\) 时,特征值落在 \(n(n-1)/2\) 个 Cassini 卵形之并

\[\bigcup_{i\ne j}\{z:|z-a_{ii}|\,|z-a_{jj}|\le R_i'R_j'\}\]

中,且这个集合含于 Geršgorin 集。

证明 取特征向量模最大的两个分量 \(|x_p|\ge|x_q|\ge\) 其余。第 \(p\) 行给出 \(|\lambda-a_{pp}|\le R_p'|x_q|/|x_p|\),第 \(q\) 行给出 \(|\lambda-a_{qq}|\le R_q'|x_p|/|x_q|\),相乘消去未知的比值。包含关系:若 \(z\) 在卵形 \(C_{ij}\) 中,\(\frac{|z-a_{ii}|}{R_i'}\cdot\frac{|z-a_{jj}|}{R_j'}\le1\),两个因子不能都大于 1。\(\square\)

推论 6.4.11 若 \(|a_{ii}|\,|a_{jj}|>R_i'R_j'\) 对所有 \(i\ne j\)(Brauer),或存在 \(\alpha\) 使 \(|a_{ii}|>R_i'^{\,\alpha}C_i'^{\,1-\alpha}\) 对所有 \(i\)(Ostrowski),则 \(A\) 非奇异。例(6.4.P2):\(\begin{bmatrix}2&3\\1&3\end{bmatrix}\) 不对角占优,但 \(2\times3>3\times1\),Brauer 条件保证非奇异。(6.4.P1:Brauer 条件下至多一行不严格占优。)

三行以上的乘积不再是包含集:\(A=\begin{bmatrix}1&1\\1&1\end{bmatrix}\oplus I_2\) 的特征值 \(0,1,1,2\),但三行、四行的"乘积卵形"都退化为点 \(z=1\)。关键在于有向图的圈:

定理 6.4.18(Brualdi) 设 \(A\) 弱不可约(每个结点都在某个非平凡圈上),则特征值落在

\[\bigcup_{\gamma\in C(A)}\Big\{z:\prod_{P_i\in\gamma}|z-a_{ii}|\le\prod_{P_i\in\gamma}R_i'\Big\}\]

中,\(C(A)\) 是 \(\Gamma(A)\) 中全部非平凡圈的集合。证明沿着"每步走到出邻居中特征向量分量最大者"的路径找到一个圈,沿圈把 Geršgorin 不等式相乘。不可约时还有 Taussky 型的边界定理(6.4.26)。

定理 6.4.30(Kolotilina) \(A\) 不可约时,只需要 \(a_{ij}\) 或 \(a_{ji}\) 非零的那些行对 \((i,j)\) 的 Cassini 卵形。对稀疏矩阵能大幅减少卵形个数。

习题 6.4.P7:对角元全为 0 时,\(\rho(A)\le\sqrt{R'_{[1]}R'_{[2]}}\)(两个最大的去心行和的几何平均)——比 \(\rho\le\max R_i'\) 更好。


量化实战

实战 1:Geršgorin 证明正定、条件数上界与加权谱半径界

import numpy as np

rng = np.random.default_rng(17)

def gersh(A):
    """返回各行 Geršgorin 圆盘的圆心与半径"""
    c = np.diag(A).copy()
    r = np.abs(A).sum(1) - np.abs(c)
    return c, r

# ---------- 1. 稠密相关矩阵:Geršgorin 下界没用 ----------
N, T = 50, 500
beta = rng.normal(1, 0.25, N)
X = np.outer(rng.standard_normal(T), beta) + 1.2 * rng.standard_normal((T, N))
C = np.corrcoef(X, rowvar=False)
c, r = gersh(C)
print(f"原始相关矩阵:λ_min = {np.linalg.eigvalsh(C)[0]:.3f},Geršgorin 下界 min(1-R_i') = {(c - r).min():.2f}")

# ---------- 2. 剔除市场因子 + 阈值化后的残差相关:Geršgorin 可以"证明"正定 ----------
mkt = X.mean(1, keepdims=True)
b = np.linalg.lstsq(mkt, X, rcond=None)[0]
E = X - mkt @ b                                   # 市场模型残差
Cr = np.corrcoef(E, rowvar=False)
Ct = np.where(np.abs(Cr) >= 0.1, Cr, 0.0); np.fill_diagonal(Ct, 1.0)   # 硬阈值 0.1
c, r = gersh(Ct)
lam = np.linalg.eigvalsh(Ct)
print(f"阈值化残差相关:非零非对角元占比 {(np.count_nonzero(Ct) - N) / (N * N - N):.1%},"
      f"最大去心行和 {r.max():.3f}")
print(f"  严格对角占优?{np.all(c > r)} ⇒ 正定;λ ∈ [{lam[0]:.3f}, {lam[-1]:.3f}],"
      f"Geršgorin 区间 [{(c - r).min():.3f}, {(c + r).max():.3f}]")
print(f"  条件数 ≤ (1+max R')/(1-max R') = {(1 + r.max()) / (1 - r.max()):.2f}(真值 {lam[-1]/lam[0]:.2f})")

# ---------- 3. 加权 Geršgorin(6.1.6/6.1.8):非负 VAR 矩阵的谱半径 ----------
A = np.array([[0.30, 0.40, 0.05],
              [0.10, 0.50, 0.30],
              [0.02, 0.05, 0.60]])
rho = max(abs(np.linalg.eigvals(A)))
print(f"\nρ(A) = {rho:.4f};行和界 {A.sum(1).max():.2f},列和界 {A.sum(0).max():.2f}")
lamv, V = np.linalg.eig(A)
p = np.abs(V[:, np.argmax(abs(lamv))].real)        # Perron 向量(正)
D = np.diag(p)
print(f"用 Perron 向量加权:max_i (D⁻¹AD 的行和) = {(np.linalg.inv(D) @ A @ D).sum(1).max():.4f} = ρ(A)")
best = min((np.diag(1/q) @ A @ np.diag(q)).sum(1).max()
           for q in rng.uniform(0.2, 1.0, (20000, 3)))
print(f"2 万组随机正权重中的最好界 {best:.4f}")

关键输出:

原始相关矩阵:λ_min = 0.281,Geršgorin 下界 min(1-R_i') = -21.07
阈值化残差相关:非零非对角元占比 4.6%,最大去心行和 0.883
  严格对角占优?True ⇒ 正定;λ ∈ [0.604, 1.373],Geršgorin 区间 [0.117, 1.883]
  条件数 ≤ (1+max R')/(1-max R') = 16.13(真值 2.27)

ρ(A) = 0.7421;行和界 0.90,列和界 0.95
用 Perron 向量加权:max_i (D⁻¹AD 的行和) = 0.7421 = ρ(A)
2 万组随机正权重中的最好界 0.7425

读法:

  1. 稠密相关矩阵(单因子结构,平均相关约 0.4)的 Geršgorin 下界是 \(-21\),毫无用处——每行有 49 个不小的非对角元。
  2. 剔除市场因子、再把绝对值小于 0.1 的残差相关置零后,只剩 4.6% 的非对角元非零,最大去心行和 0.88 < 1,矩阵严格对角占优,不做特征分解就能断定它正定,并给出 \(\lambda_{\min}\ge0.117\)、\(\kappa\le16\) 的保证(真值 0.604 与 2.27,界是保守的但安全)。高维协方差估计中,阈值化估计量不保证正定,这种廉价检查很实用;若检查失败,再考虑特征值修正(第 05a 章)。
  3. 非负 VAR 矩阵的行和界 0.90、列和界 0.95 都证明了平稳性,但不精确;用 Perron 向量做对角加权后,加权行和恰好都等于谱半径 0.7421(推论 6.1.8 的界取到)。随机搜索 2 万组权重也只能逼近它。

实战 2:扰动理论的数值检验——Bauer–Fike、Hoffman–Wielandt、主成分方向的稳定性、灵敏度与残差界

import numpy as np

rng = np.random.default_rng(23)
norm2 = lambda M: np.linalg.norm(M, 2)

# ---------- 1. Bauer–Fike:正规 vs 非正规 ----------
n = 6
Q = np.linalg.qr(rng.standard_normal((n, n)))[0]
lam0 = np.arange(1, n + 1) * 0.1
A_sym = Q @ np.diag(lam0) @ Q.T                       # 对称:κ(S)=1
S = np.eye(n) + np.triu(rng.normal(0, 3, (n, n)), 1)  # 病态的特征向量矩阵
A_non = S @ np.diag(lam0) @ np.linalg.inv(S)          # 同样的特征值,非正规
E = rng.standard_normal((n, n)); E *= 1e-3 / norm2(E)  # ‖E‖₂ = 1e-3
for name, A, kS in [("对称", A_sym, 1.0), ("非正规", A_non, np.linalg.cond(S))]:
    mu = np.linalg.eigvals(A + E)
    shift = max(min(abs(m - lam0)) for m in mu)
    print(f"{name:<4s}: κ(S) = {kS:9.1f},特征值最大移动 {shift:.2e},Bauer–Fike 界 κ(S)‖E‖₂ = {kS * 1e-3:.2e}")

# ---------- 2. 样本协方差:Weyl(逐个)与 Hoffman–Wielandt(整体) ----------
N, T = 30, 120
B = rng.normal(0, 1, (N, 2)) * [1.0, 0.6]
Sigma = B @ B.T * 0.02 + np.diag(rng.uniform(0.02, 0.05, N))
L = np.linalg.cholesky(Sigma)
X = rng.standard_normal((T, N)) @ L.T
Shat = X.T @ X / T
Eh = Shat - Sigma
l, lh = np.linalg.eigvalsh(Sigma), np.linalg.eigvalsh(Shat)
print(f"\nmax|λ̂_i-λ_i| = {np.abs(lh - l).max():.4f} ≤ ‖E‖₂ = {norm2(Eh):.4f}")
print(f"Σ(λ̂_i-λ_i)² = {((lh - l)**2).sum():.5f} ≤ ‖E‖_F² = {np.linalg.norm(Eh)**2:.5f}")

# ---------- 3. 特征向量(因子载荷)的不稳定性:取决于特征值间隙 ----------
def angle_deg(u, v):
    return np.degrees(np.arccos(min(1.0, abs(u @ v) / np.linalg.norm(u) / np.linalg.norm(v))))

N, T = 30, 250
f1 = rng.normal(0, 1, N); f2 = rng.normal(0, 1, N)
f2 -= (f2 @ f1) / (f1 @ f1) * f1                     # 两个正交的因子方向
f1 /= np.linalg.norm(f1); f2 /= np.linalg.norm(f2)
for v2 in [0.9, 0.5, 0.2]:                          # 第二因子方差:越接近 1,间隙越小
    Sig = 1.0 * np.outer(f1, f1) + v2 * np.outer(f2, f2) + 0.02 * np.eye(N)
    lv, Vv = np.linalg.eigh(Sig)
    gap = lv[-1] - lv[-2]
    Lc = np.linalg.cholesky(Sig)
    angs, bounds = [], []
    for _ in range(200):
        Xs = rng.standard_normal((T, N)) @ Lc.T
        Sh = Xs.T @ Xs / T
        angs.append(angle_deg(np.linalg.eigh(Sh)[1][:, -1], Vv[:, -1]))
        bounds.append(min(1.0, 2 * norm2(Sh - Sig) / gap))
    print(f"间隙 {gap:.2f}: 第一主成分方向误差 中位数 {np.median(angs):5.1f}°,"
          f"90% 分位 {np.percentile(angs, 90):5.1f}°;Davis–Kahan 型界 sinθ ≤ 2‖E‖/gap 中位数 {np.median(bounds):.2f}")

# ---------- 4. 特征值的导数:∂λ_max/∂Σ_ij(6.3.13b,对称情形 x_i x_j) ----------
lv, Vv = np.linalg.eigh(Sigma)
x = Vv[:, -1]
i, j, h = 0, 1, 1e-6
Ep = np.zeros_like(Sigma); Ep[i, j] = Ep[j, i] = h   # 对称扰动:同时改 (i,j) 与 (j,i)
fd = (np.linalg.eigvalsh(Sigma + Ep)[-1] - lv[-1]) / h
print(f"\n改动协方差 Σ_01=Σ_10:有限差分 dλ_max = {fd:.6f},公式 2·x_0·x_1 = {2 * x[i] * x[j]:.6f}")

# ---------- 5. 后验(残差)界:幂法几步得到的近似主成分 ----------
v = np.ones(N)
for k in range(3):
    v = Sigma @ v; v /= np.linalg.norm(v)
theta = v @ Sigma @ v                                 # Rayleigh 商
r = Sigma @ v - theta * v
print(f"幂法 3 步:Rayleigh 商 {theta:.6f},真 λ_max {lv[-1]:.6f},误差 {abs(theta - lv[-1]):.2e} "
      f"≤ ‖r‖ = {np.linalg.norm(r):.2e};方向误差 {angle_deg(v, Vv[:, -1]):.2f}°")

关键输出:

对称  : κ(S) =       1.0,特征值最大移动 4.72e-04,Bauer–Fike 界 κ(S)‖E‖₂ = 1.00e-03
非正规 : κ(S) =     598.0,特征值最大移动 5.85e-03,Bauer–Fike 界 κ(S)‖E‖₂ = 5.98e-01

max|λ̂_i-λ_i| = 0.0645 ≤ ‖E‖₂ = 0.0873
Σ(λ̂_i-λ_i)² = 0.01221 ≤ ‖E‖_F² = 0.02363
间隙 0.10: 第一主成分方向误差 中位数  19.6°,90% 分位  60.9°;Davis–Kahan 型界 sinθ ≤ 2‖E‖/gap 中位数 1.00
间隙 0.50: 第一主成分方向误差 中位数   4.2°,90% 分位   9.4°;Davis–Kahan 型界 sinθ ≤ 2‖E‖/gap 中位数 0.43
间隙 0.80: 第一主成分方向误差 中位数   3.2°,90% 分位   4.5°;Davis–Kahan 型界 sinθ ≤ 2‖E‖/gap 中位数 0.23

改动协方差 Σ_01=Σ_10:有限差分 dλ_max = 0.048364,公式 2·x_0·x_1 = 0.048364
幂法 3 步:Rayleigh 商 0.663698,真 λ_max 0.673721,误差 1.00e-02 ≤ ‖r‖ = 6.62e-02;方向误差 8.61°

读法:

  1. 同样的特征值、同样大小的扰动:对称矩阵的特征值最多移动 \(4.7\times10^{-4}\)(不超过 \(\|E\|_2=10^{-3}\));特征向量矩阵条件数约 600 的非正规矩阵,特征值移动 \(5.9\times10^{-3}\),大 12 倍。Bauer–Fike 界 0.6 在这里很保守,但它正确地指出了风险的来源。
  2. 样本协方差:120 天、30 只股票,最坏的一个特征值误差 0.065,不超过 \(\|E\|_2=0.087\)(Weyl);全部特征值误差平方和 0.012,不超过 \(\|E\|_F^2=0.024\)(Hoffman–Wielandt)。
  3. 主成分方向:特征值间隙从 0.8 缩到 0.1,第一主成分方向的误差中位数从 3° 涨到 20°,90% 分位从 4.5° 涨到 61°——有一成的样本里,"第一主成分"实际上已经接近真实的第二主成分方向。间隙 0.1 时 Davis–Kahan 型的界已经大于 1(无信息),说明在这种情形下理论上就不能指望方向稳定。
  4. 灵敏度:有限差分与公式 \(2x_0x_1\) 完全吻合。
  5. 残差界:幂法 3 步得到的 Rayleigh 商误差 0.010,在残差界 0.066 之内。实际误差远小于界,因为对称矩阵的 Rayleigh 商误差是特征向量误差的二阶量(方向误差 8.6°,\(\sin^2\) 量级约 0.02),这个更精细的结论超出本书范围。

本章小结

Geršgorin 定理用最简单的论证(看特征向量的最大分量)把特征值圈在以对角元为心、去心绝对行和为半径的圆盘之并中,并且不交的 \(k\) 个圆盘恰含 \(k\) 个特征值;对角相似加权可以改进估计,对非负不可约矩阵用 Perron 向量加权恰好得到谱半径。由此得到严格对角占优 ⇒ 非奇异,对角元为正时特征值实部为正,Hermitian 时正定;若只是对角占优,则需要不可约性(有向图强连通)加上至少一行严格占优(Taussky)。扰动方面,可对角化矩阵的特征值误差不超过特征向量矩阵的条件数乘以扰动范数(Bauer–Fike),正规矩阵的这个条件数为 1,Hermitian 矩阵还能按序配对(Weyl),整个谱的平方误差不超过 \(\|E\|_F^2\)(Hoffman–Wielandt,用双随机矩阵与 Birkhoff 定理证明)。单特征值的导数为 \(y^*Ex/y^*x\),左右特征向量接近正交时特征值很敏感;特征向量的稳定性取决于特征值间隙,间隙小时主成分方向可以剧烈旋转。正规矩阵的近似特征值误差不超过残差范数。Ostrowski、Brauer、Brualdi 等包含集是 Geršgorin 思想的精细化。对量化而言,最有用的是:对稀疏或近似对角的协方差 / 相关矩阵用 Geršgorin 廉价地验证正定性和给出条件数上界;协方差的特征值对估计误差稳定而非对称矩阵(VAR、网络)的特征值可能不稳定;相邻特征值接近的主成分方向不可信。

概念 / 定理 公式 量化用途
Geršgorin \(\lambda\in\bigcup_i\{\vert z-a_{ii}\vert \le R_i'\}\) 特征值的廉价定位
计数 \(k\) 个圆盘的并与其余不交 ⇒ 恰含 \(k\) 个特征值
加权 Geršgorin \(\rho(A)\le\min_{p>0}\max_i\frac1{p_i}\sum_jp_j\vert a_{ij}\vert \) VAR / 网络谱半径
严格对角占优 \(\vert a_{ii}\vert >R_i'\) ⇒ 非奇异;Hermitian 且 \(a_{ii}>0\) ⇒ 正定 正定性证书
相关矩阵的谱界 \(1-\max R_i'\le\lambda\le1+\max R_i'\) 条件数上界
不可约 \((I+\vert A\vert )^{n-1}>0\iff\Gamma(A)\) 强连通 网络连通性
Taussky 不可约对角占优 ⇒ 非奇异 差分矩阵正定
Bauer–Fike \(\vert \hat\lambda-\lambda\vert \le\kappa(S)\vert \vert \vert E\vert \vert \vert \) 非对称矩阵的风险
正规矩阵 \(\vert \hat\lambda-\lambda\vert \le|E|_2\) 协方差特征值稳定
Hoffman–Wielandt \(\sum\vert \hat\lambda_{\sigma(i)}-\lambda_i\vert ^2\le|E|_F^2\) 整个谱的误差
单特征值导数 \(\frac{\partial\lambda}{\partial a_{ij}}=\frac{\bar y_ix_j}{y^*x}\);对称时 \(x_ix_j\) 风险灵敏度、压力测试
特征向量 误差 \(\sim|E|/\text{间隙}\) PCA 因子对齐
残差界 正规时 \(\vert \hat\lambda-\lambda\vert \le|r|_2/|\hat x|_2\) 迭代算法停止准则
Brauer \(\vert z-a_{ii}\vert \vert z-a_{jj}\vert \le R_i'R_j'\) 更紧的包含集

练习

基础

  1. 画出 \(A=\begin{bmatrix}5&1&0\\1&2&0.5\\0&0.5&-3\end{bmatrix}\) 的 Geršgorin 圆盘。哪些圆盘互不相交?每个区域各含几个特征值?\(A\) 是否非奇异? 答案要点:\([4,6]\)、\([0.5,3.5]\)、\([-3.5,-2.5]\) 两两不交(对称矩阵,取实区间),各含一个实特征值;0 不在其中,非奇异。
  2. 相关矩阵 \(R=\begin{bmatrix}1&0.3&-0.2\\0.3&1&0.4\\-0.2&0.4&1\end{bmatrix}\)。不求特征值,证明 \(R\) 正定,给出 \(\lambda_{\min}\) 的下界和 \(\kappa_2(R)\) 的上界。 答案要点:去心行和 \(0.5,0.7,0.6\),最大 0.7 < 1;\(\lambda_{\min}\ge0.3\),\(\kappa\le1.7/0.3\approx5.7\)。
  3. 用 Geršgorin 给出 \(A=\begin{bmatrix}0.6&0.3\\0.1&0.7\end{bmatrix}\) 的谱半径上界;再取 \(D=\operatorname{diag}(1,p)\) 优化 \(p\),看能得到多好的界。 答案要点:行和为 \(0.9\) 与 \(0.8\),界为 \(0.9\)。\(D^{-1}AD=\begin{bmatrix}0.6&0.3p\\0.1/p&0.7\end{bmatrix}\),令两行和相等:\(0.3p^2-0.1p-0.1=0\),\(p\approx0.768\),界约 \(0.830\),恰好等于 \(\rho(A)\)(特征值 \(0.830\) 与 \(0.470\))——正矩阵的最优权重是 Perron 向量。
  4. 说明为什么 \(\begin{bmatrix}4&2&1\\0&1&1\\0&1&1\end{bmatrix}\) 对角占优、第一行严格占优却奇异,并画出它的有向图,指出它为何可约。
  5. 对称矩阵 \(\Sigma\) 的最大特征值 \(\lambda=0.5\),单位特征向量 \(x=(0.6,0.8)\)。若 \(\sigma_{12}\) 增加 0.01,\(\lambda\) 大约变化多少?若 \(\sigma_{11}\) 增加 0.01 呢? 答案要点:\(2\times0.6\times0.8\times0.01=0.0096\);\(0.36\times0.01=0.0036\)。

进阶

  1. 证明定理 6.1.10(c):Hermitian、对角元为正、严格对角占优 ⇒ 正定。再举例说明"严格"不能去掉,但可以换成"不可约 + 至少一行严格"。
  2. 设 \(A=S\Lambda S^{-1}\) 是 VAR(1) 系数矩阵,\(\rho(A)=0.95\),\(\kappa_2(S)=50\),系数的估计误差 \(\|E\|_2=0.002\)。用 Bauer–Fike 定理说明估计出的 \(\hat A=A+E\) 的谱半径可能落在什么范围。这对"根据估计的 VAR 判断平稳性"意味着什么? 答案要点:\(\hat A\) 的每个特征值离 \(A\) 的某个特征值不超过 0.1,故 \(\rho(\hat A)\le1.05\)——估计出的模型可能显示非平稳,或者真实非平稳而估计显示平稳。
  3. 用 Hoffman–Wielandt 定理证明:对实对称矩阵 \(A\),\(\sum_i(a_{ii}-\lambda_{\sigma(i)})^2\le\sum_{i\ne j}a_{ij}^2\) 对某个置换成立。解释它对"资产方差与主成分方差之间的差距"的含义。
  4. 证明:对称矩阵 \(A\) 与单位向量 \(y\),区间 \([y^TAy-s,\ y^TAy+s]\)(\(s=(\|Ay\|_2^2-(y^TAy)^2)^{1/2}\))内至少有一个特征值。并说明 \(s\) 是给定 \(y\) 时残差 \(\|Ay-\theta y\|_2\) 的最小值。
  5. 编程:模拟两个方差非常接近的因子(如 1.0 与 0.95)。用滚动 250 天窗口估计样本协方差,记录前两个主成分的载荷,观察它们在相邻窗口之间是否"交换"或旋转;实现一个简单的对齐方法(按与上一窗口载荷的绝对内积匹配并修正符号),比较对齐前后载荷时间序列的平滑程度。

原书推荐习题

  • 6.1.P1、P9(迭代法收敛条件)、6.1.P16(Gauss 消元保持严格对角占优)、6.1.P17(分块 Geršgorin)。
  • 6.2.P4(\(\rho(A)\le\rho(|A|)\))、6.2.P7(离散 Laplace 矩阵正定)。
  • 6.3.P1(Hoffman–Wielandt 推论)、6.3.P2(Rayleigh 商与残差圆盘)、6.3.P5–P6(不要用特征多项式求特征值)、6.3.P7(非对角化时特征值的 \(\sqrt t\) 敏感性)。
  • 6.4.P2(Brauer 条件 vs 对角占优)、6.4.P7(零对角矩阵的谱半径界)。

原书对照

本章小节 原书小节 书页 PDF 页
6.1 问题的提出 6.0 Introduction 387 407
6.2 Geršgorin 圆盘 6.1 Geršgorin discs(含习题) 387–396 407–416
6.3 不可约性与图 6.2 Geršgorin discs – a closer look(含习题) 396–404 416–424
6.4 特征值扰动定理 6.3 Eigenvalue perturbation theorems(含习题) 405–413 425–433
6.5 其他特征值包含集 6.4 Other eigenvalue inclusion sets(含习题) 413–424 433–444

延伸阅读:Varga《Geršgorin and His Circles》(2004)系统介绍各种包含集;Bauer–Fike (1960)、Hoffman–Wielandt (1953);特征向量与不变子空间的扰动(Davis–Kahan \(\sin\Theta\) 定理)见 Stewart–Sun《Matrix Perturbation Theory》(1990);一般 Jordan 结构下的特征值扰动见 Moro、Burke、Overton (1997) 与 Kato《Perturbation Theory for Linear Operators》。原书第 7 章(正定与半正定矩阵)在本册第 07a–07d 章讲述,其中原书 7.3–7.4 节(本册第 07b 章)把本章的扰动理论推广到奇异值。