元信息:Roger A. Horn & Charles R. Johnson《Matrix Analysis》(2nd ed., Cambridge University Press, 2013);本块负责 PDF 第 556–665 页(原书页码 536–645;PDF 页码 = 原书页码 + 20)。内容:第 8 章「正矩阵与非负矩阵」后半(8.4 末尾—8.7)、附录 A–F、参考文献、符号表、提示(Hints)、索引。
第 8 章 正矩阵与非负矩阵(Positive and Nonnegative Matrices)(接上一块)
8.4 不可约非负矩阵(Irreducible nonnegative matrices)(接上一块,PDF p.556–560)
Theorem 8.4.6 证明收尾(PDF p.556):设 \(A\in M_n\) 不可约非负,有 \(k\) 个最大模特征值 \(\rho(A)e^{i\varphi_m}\),\(0=\varphi_0<\varphi_1<\dots<\varphi_{k-1}<2\pi\)。记角集合 \(\mathcal S=\{\varphi_0,\dots,\varphi_{k-1}\}\)(在模 \(2\pi\) 加法下封闭:因 \(A\) 相似于 \(e^{i\varphi}A\),若 \(\varphi,\psi\in\mathcal S\) 则 \(\varphi+\psi\in\mathcal S\))。证明要点:\(\varphi_1,2\varphi_1,\dots,(k+1)\varphi_1\) 模 \(2\pi\) 都在 \(\mathcal S\) 中,而 \(\mathcal S\) 只有 \(k\) 个元素,故有 \(r>s\ge1\) 使 \(r\varphi_1\equiv s\varphi_1\),从而 \(e^{i\varphi_1}\) 是单位根。令 \(p\) 为使 \(e^{ip\varphi_1}=1\) 的最小正整数(\(p\le k\))。任取 \(\varphi_m\in\mathcal S\),把 \([0,2\pi)\) 分成 \(p\) 个长 \(\varphi_1\) 的半开区间,存在 \(q\) 使 \(0\le\varphi_m-q\varphi_1<\varphi_1\);而 \(\varphi_m-q\varphi_1\in\mathcal S\) 且 \(\varphi_1\) 是 \(\mathcal S\) 最小非零元,故 \(\varphi_m=q\varphi_1\)。于是 \(\mathcal S\subseteq\{0,\varphi_1,2\varphi_1,\dots\}\),若 \(p<k\) 则元素不足 \(k\) 个,矛盾;所以 \(p=k\),\(\varphi_m=2\pi m/k\),最大模特征值恰为
推论性观察:由 8.4.6(\(A\) 相似于 \(e^{2\pi i/k}A\)),\(A\) 在任意圆周 \(\{|z|=r>0\}\) 上的特征值个数(计重数)是 \(k\) 的非负整数倍,因此 \(k\) 整除 \(A\) 的非零特征值个数。
练习:非负 \(A\) 满足 \(\operatorname{tr}A^m\ge0\);不可约非负 \(A\in M_3\)、\(\rho(A)=1\) 能否有特征值 \(1,i,-i\)?(不能:由推论特征值集合须在旋转 \(e^{2\pi i/k}\) 下不变,\(k\) 只能为 1 或 3,均不符;或看 \(\operatorname{tr}A^2=1-1-1=-1<0\) 与非负性矛盾。去掉不可约条件也不可能,因 \(\operatorname{tr}A^2<0\)。)
Corollary 8.4.7:\(A\in M_n\) 不可约非负,若有 \(k>1\) 个最大模特征值,则 \(A\) 的主对角元全为 0;更一般,对每个不被 \(k\) 整除的正整数 \(m\),\(A^m\) 的主对角元全为 0。 证明:令 \(\varphi=2\pi/k\),由 8.4.6a,\(A\) 相似于 \(e^{i\varphi}A\),故 \(A^m\) 相似于 \(e^{im\varphi}A^m\),\(\operatorname{tr}A^m=e^{im\varphi}\operatorname{tr}A^m\)。\(e^{im\varphi}\) 为正实数当且仅当 \(k\mid m\);若 \(A^m\) 有正对角元,则 \(\operatorname{tr}A^m>0\),只能 \(k\mid m\)。
练习:不可约非负 \(A\) 只要有一个正对角元,\(\rho(A)\) 就是唯一最大模特征值(充分条件);但并非必要:\(J_3-I=\begin{bmatrix}0&1&1\\1&0&1\\1&1&0\end{bmatrix}\) 对角全零,特征值 \(2,-1,-1\),唯一最大模。(2×2 例子不存在:2×2 不可约且对角全零只能是 \(\begin{bmatrix}0&a\\b&0\end{bmatrix}\),特征值 \(\pm\sqrt{ab}\)。)
循环块形(Frobenius normal form for cyclic matrices,式 (8.4.8)):若 \(A\) 不可约非负且有 \(k>1\) 个最大模特征值,则存在置换矩阵 \(P\) 使
8.4 习题概要(8.4.P1–P26,PDF p.557–560)
- P1:8.2.11 中正矩阵的性质哪些对不可约非负矩阵不成立(举反例)。P2:\(\rho(I+A)\ne\rho(A)+1\) 的例子;\(\rho(I+A)=\rho(A)+1\) 的充要条件是 \(\rho(A)\) 本身是 \(A\) 的特征值(非负矩阵自动满足)。
- P3:不可约只是非负矩阵有正特征向量的充分而非必要条件:\(\begin{bmatrix}1&1\\0&0\end{bmatrix}\)(特征值 1 的特征向量 \(e_1\),特征值 0 的为 \((1,-1)\),无正特征向量)与 \(\begin{bmatrix}1&0\\1&0\end{bmatrix}\)(\((1,1)^T\) 是正特征向量)都可约,说明可约非负矩阵可有也可无正特征向量。
- P4:不可约非负 \(A\) 的 \((\rho(A)^{-1}A)^m\) 元素一致有界。P5:\(AB\) 与 \(BA\) 同特征值,但 \(A=\begin{bmatrix}0&1\\0&1\end{bmatrix}\)、\(B=\begin{bmatrix}0&0\\1&1\end{bmatrix}\) 显示 \(AB\) 不可约而 \(BA\) 可约;不可约矩阵可(酉)相似于可约矩阵——不可约性不是相似不变量。
- P6:8.3.P6(a) 中 \(B\) 正可放宽为不可约非负。P7:多项式 \(t^k-1\) 的友矩阵是有 \(k\) 个最大模特征值(\(k\) 次单位根)的非负矩阵。P8:构造 \(p+q+r\) 阶非负矩阵,其最大模特征值为全部 \(p\)、\(q\)、\(r\) 次单位根(直和三个循环置换)。
- P9:不可约非负矩阵若有 \(k\) 个最大模特征值称为指数为 \(k\) 的循环矩阵(cyclic of index \(k\))。P10:此时特征多项式形如 \(p_A(t)=t^r(t^k-\rho(A)^k)(t^k-\mu_2^k)\cdots(t^k-\mu_m^k)\),\(|\mu_i|<\rho(A)\);只有一个最大模特征值的判别可从多项式中非零系数的模式读出。
- P11:\(n\) 为素数时,不可约非负非奇异 \(A\) 要么 \(\rho(A)\) 是唯一最大模特征值,要么全部特征值都最大模(因 \(k\mid n\))。
- P12:多项式 \(p(t)\)(\(a_0\ne0\))与 \(\tilde p(t)=t^n-|a_{n-1}|t^{n-1}-\dots-|a_0|\):\(\tilde p\) 有一个简单正根 \(r\),不小于 \(\tilde p\)、\(p\) 任何根的模(用友矩阵 + Perron–Frobenius,即 Cauchy 根界)。
- P13(谱半径的灵敏度):\(x,y\) 为不可约非负 \(A\) 的右、左 Perron 向量(\(y^Tx=1\) 规范化),则 \(\rho(A)\) 对 \(a_{ij}\) 可微且 \(\partial\rho(A)/\partial a_{ij}=x_iy_j>0\)。P14:\(A\) 不可约非负、\(B\ge0\) 非零,则 \(\rho(A+B)>\rho(A)\)(两种证法:用 P13 积分,或用 8.4.5)。
- P15:不可约非负矩阵的任何非负特征向量是 Perron 向量的正倍数;有两个线性无关非负特征向量的非负矩阵必可约。
- P16:非负 \(A\) 不可约 ⇔ 存在多项式 \(p\) 使 \(p(A)\) 每个元素非零;若 \(\deg p\le d\) 则 \((I+A)^d>0\);若极小多项式次数为 \(m\),则 \(A\) 不可约 ⇔ \((I+A)^{m-1}>0\)。
- P17–P18(最佳秩一逼近):非负 \(A\),若 \(AA^T\) 或 \(A^TA\) 不可约,则 Frobenius 范数下最佳秩一逼近唯一、非负,\(X=\sqrt{\rho(AA^T)}\,vw^T\),\(v,w\) 为 \(AA^T\)、\(A^TA\) 对应 \(\rho(AA^T)\) 的正单位特征向量(即首奇异向量取正)。P18:对 \(\begin{bmatrix}1&1\\1&1\end{bmatrix}\)、\(\begin{bmatrix}1&1\\0&1\end{bmatrix}\)、\(\begin{bmatrix}0&0\\1&1\end{bmatrix}\) 求最佳秩一逼近;\(I_n\)(\(n>1\))的最佳秩一逼近不唯一。
- P19:8.2.P9 的结论在不可约非负假设下成立。P20:实 \(A\),\(A^2\) 的负特征值代数、几何重数均为偶数;用若干例子(如 \(\begin{bmatrix}0&2\\-1&-1/2\end{bmatrix}\)、\(\begin{bmatrix}0&-1&1\\0&0&1\\0&-1&0\end{bmatrix}\) 及一个 \(n\) 阶例子)说明 \(A^2\le0\) 且 \(A^2\ne0\) 可能;\(A^2\) 可以只有一个正元素而无零元;若 \(A^2\le0\) 则 \(A^2\) 必可约;若 \(n>2\) 且至少 \(n^2-n+2\) 个元素为负,则 \(A^2\) 至少有一个正元。
- P21:不可约非负 \(A\),若非负非零 \(x\) 与 \(\alpha>0\) 满足 \(Ax\le\alpha x\),则 \(x>0\);推出非负特征向量必为 Perron 向量正倍数。
- P22:\(\mathbf R^n\) 中单位向量 \(x_1,\dots,x_{n+2}\) 的 Gram 矩阵 \(G\),若 \(I-G\ge0\),则它(及 \(G\))可约;推出 \(\mathbf R^n\) 中两两夹角大于 \(\pi/2\) 的向量至多 \(n+1\) 个。
- P23:不可约非负 \(A\),\(\operatorname{adj}(\rho(A)I-A)\) 是秩一正矩阵 \(xy^T\) 的正倍数。
- P24:非负 \(A\)、\(\rho(A)>0\),若 \(\lambda\) 是最大模特征值,则 \(\lambda/\rho(A)=e^{i\theta}\) 是单位根且 \(e^{ip\theta}\rho(A)\) 都是特征值(用 8.3.6 不可约标准形 + 8.4.6);它们未必是全部最大模特征值,也未必简单。
- P25(式 (8.4.9)):\(A_1=\begin{bmatrix}0&1\\1&0\end{bmatrix}\) 显示 \(\lim(\operatorname{tr}A^m)^{1/m}\) 可不存在(8.2.P13 对非正矩阵不成立),但对任意非负 \(A\):
\[\limsup_{m\to\infty}(\operatorname{tr}A^m)^{1/m}=\rho(A).\tag{8.4.9}\]证明步骤:(a) \(\operatorname{tr}A^m=|\sum\lambda_i(A^m)|\le\sum\sigma_i(A^m)=\|A^m\|_{\rm tr}\)(迹范数);(b) \(\limsup\le\lim\|A^m\|_{\rm tr}^{1/m}=\rho(A)\)(Gelfand 公式);(c) 取不可约标准形中 \(\rho(A_{i_\ell})=\rho(A)\) 的对角块,若它有 \(k_\ell\) 个最大模特征值,则 \(\rho(A)^{k_\ell}\) 是 \(A_{i_\ell}^{k_\ell}\) 的 \(k_\ell\) 重特征值,\(\operatorname{tr}A_{i_\ell}^{pk_\ell}=\rho(A)^{pk_\ell}(k_\ell+o(1))\);取 \(m_j\) 为诸 \(k_\ell\) 公倍数的倍数;(d) \(\operatorname{tr}A^{m_j}\ge(k_1+\dots+k_g+o(1))\rho(A)^{m_j}\);(e) 得下界。
- P26:非负 \(A\) 及非负 \(x,y\) 满足 \(Ax=\rho(A)x\)、\(y^TA=\rho(A)y^T\)。则 \(A\) 不可约 ⇔ \(\rho(A)I-A\) 无零主子式 ⇔ \(\operatorname{adj}(\rho(A)I-A)=cxy^T\) 为正。要点:不可约 ⇒ \(\rho\) 简单、\(x,y>0\),\(\operatorname{adj}\) 的对角元 \(cx_iy_i\) 等于 \(\rho I-A\) 的 \(n-1\) 阶主子式,非零故 \(c>0\);反向用 8.3.P7。
8.5 本原矩阵(Primitive matrices)(PDF p.560–565)
动机:8.2.7(正矩阵 \((\rho^{-1}A)^m\to xy^T\))的证明对不可约非负矩阵依然有效,只要再加一个条件:除 \(\rho(A)\) 外没有其他最大模特征值。
Definition 8.5.0:非负 \(A\in M_n\) 称为本原的(primitive),若它不可约且只有一个非零最大模特征值。(概念源自 Frobenius 1912。)
Theorem 8.5.1:非负本原 \(A\),\(x,y\) 为右、左 Perron 向量(\(x^Ty=1\)),则
Theorem 8.5.2(本原的刻画):非负 \(A\) 本原 ⇔ 存在 \(m\ge1\) 使 \(A^m>0\)。 证明:若 \(A^m>0\),则 \(\Gamma(A)\) 中任意两节点间有长 \(m\) 的有向路,强连通,\(A\) 不可约;再由 8.4.3(\(A^m\) 正 ⇒ 最大模特征值只有 \(\rho\))。反之由 8.5.1,\((\rho^{-1}A)^m\to xy^T>0\),故某个 \(m\) 使 \(A^m>0\)。 练习:不可约非负且 \(A^m>0\) ⇒ 对所有 \(p>m\) 有 \(A^p>0\)(不可约保证每列有非零元,\(A^{m+1}=A^mA>0\))。
Theorem 8.5.3(图论判据):\(A\) 不可约非负,节点 \(P_1,\dots,P_n\);\(L_i\) 为从 \(P_i\) 出发回到 \(P_i\) 的所有有向路(闭路)长度集合,\(g_i=\gcd(L_i)\)。则 \(A\) 本原 ⇔ \(g_1=\dots=g_n=1\)。 证明:不可约保证 \(L_i\) 非空。若本原,则 \(k\ge m\) 时 \(A^k>0\),于是 \(m+p\in L_i\) 对所有 \(p\ge1\),\(g_i=1\)。若不本原、有 \(k>1\) 个最大模特征值,由 8.4.7(书中引作 8.4.8),对 \(k\nmid m\),\(A^m\) 主对角全零,即不存在长 \(m\) 的闭路,故 \(L_i\subset\{k,2k,\dots\}\),\(g_i\ge k>1\)。 Romanovsky 定理:\(A\) 不可约非负,则 \(g_1=\dots=g_n=k\) 恰为最大模特征值个数(周期 period)。
Lemma 8.5.4:\(A\) 不可约非负且主对角元全正,则 \(A^{n-1}>0\),从而本原。 证明:\(\alpha=\min a_{ii}>0\),\(B=A-\operatorname{diag}(a_{ii})\ge0\) 不可约,\(A\ge\alpha I+B=\alpha(I+B/\alpha)\),由 8.4.1,\(A^{n-1}\ge\alpha^{n-1}(I+B/\alpha)^{n-1}>0\)。 练习:非负 \(A\) 对角为正时,\(A^m\) 的 \((i,j)\) 元为正 ⇒ \(A^{m+p}\) 的 \((i,j)\) 元为正。
Lemma 8.5.5:非负本原 \(A\) 的所有幂 \(A^m\) 仍非负本原。证明:\(A\) 的充分大幂为正,故 \(A^m\) 的充分大幂也为正;若 \(A^m\) 可约,\(A^{mp}\) 都可约,不可能为正,矛盾。(注意:不可约矩阵的幂可以可约,例 \(\begin{bmatrix}0&1\\1&0\end{bmatrix}^2=I\)。)
Theorem 8.5.6:非负本原 \(A\),则存在 \(k\le(n-1)n^n\) 使 \(A^k>0\)。 证明:取 \(P_1\) 回到自身的最短闭路长 \(k_1\le n\),\(A^{k_1}\) 的 \((1,1)\) 元为正且其任意幂亦然;\(A^{k_1}\) 本原(8.5.5)故不可约,再取 \(\Gamma(A^{k_1})\) 中 \(P_2\) 的最短闭路长 \(k_2\le n\),\(A^{k_1k_2}\) 的 \((1,1),(2,2)\) 元为正;依次进行得 \(A^{k_1\cdots k_n}\) 不可约且对角全正,由 8.5.4 得 \((A^{k_1\cdots k_n})^{n-1}>0\),而 \(k_1\cdots k_n(n-1)\le n^n(n-1)\)。
本原指数(index of primitivity):使 \(A^k>0\) 的最小 \(k\),记 \(\gamma(A)\)。已知 \(\gamma(A)\le n^n(n-1)\);对角全正时 \(\gamma(A)\le n-1\)。最短圈长度 \(s\):\(\Gamma(A)\) 中存在长 \(s\) 的圈且无更短者。
Theorem 8.5.7:非负本原 \(A\),\(\Gamma(A)\) 最短圈长 \(s\),则 \(\gamma(A)\le n+s(n-2)\),即 \(A^{n+s(n-2)}>0\)。 证明要点:最短圈长 \(\le n\),设其节点为 \(P_1,\dots,P_s\)。\(n+s(n-2)=n-s+s(n-1)\),考虑 \(A^{n-s}(A^s)^{n-1}\)。分块 \(A^{n-s}=\begin{bmatrix}X_{11}&X_{12}\\X_{21}&X_{22}\end{bmatrix}\)(\(X_{11}\in M_s\)):因 \(P_1..P_s\) 成圈,从圈上任一点出发任意长度 \(m\) 都有路到达圈上某点,故 \(X_{11}\) 每行有正元;圈外节点 \(P_i\) 有长 \(r\le n-s\) 的路到圈上,不足就绕圈补足到恰好 \(n-s\),故 \(X_{21}\) 每行有正元。再分块 \((A^s)^{n-1}=\begin{bmatrix}Y_{11}&Y_{12}\\Y_{21}&Y_{22}\end{bmatrix}\):\(\Gamma(A^s)\) 在 \(P_1..P_s\) 处有自环,\(A^s\) 本原故不可约,任意 \(P_i\to P_j\) 有长 \(\le n-1\) 的路,先在自环上绕足够次数可使长度恰为 \(n-1\),故 \(Y_{11}>0\)、\(Y_{12}>0\)。最后
Corollary 8.5.8(Wielandt 定理):非负 \(A\in M_n\) 本原 ⇔ \(A^{n^2-2n+2}>0\)。 证明:\(n>1\) 时若最短圈长为 \(n\),则每个圈长都是 \(n\) 的倍数,由 8.5.3 不本原;故 \(s\le n-1\),\(\gamma(A)\le n+(n-1)(n-2)=n^2-2n+2\)。Wielandt 给出例子(8.5.P4)说明对零对角矩阵此界是最优的。
Theorem 8.5.9(Holladay–Varga):\(A\) 不可约非负,有 \(d\) 个正对角元(\(1\le d\le n\)),则 \(A^{2n-d-1}>0\),即 \(\gamma(A)\le2n-d-1\)。 证明:\(A\) 必本原,\(\Gamma(A)\) 有 \(d\) 个长 1 的圈(自环),设在 \(P_1..P_d\)。\(A^{2n-d-1}=A^{n-d}(A^1)^{n-1}\),分块方式同 8.5.7(\(s\) 换成 1、块大小换成 \(d\)):\(X_{11},X_{21}\) 每行有正元,\(Y_{11},Y_{12}>0\)。 练习:\(A=\begin{bmatrix}0&1\\1&1\end{bmatrix}\) 本原,特征值 \((1\pm\sqrt5)/2\);8.5.7 给 \(\gamma\le2+1\cdot0=2\),8.5.9 给 \(\gamma\le2\cdot2-1-1=2\),实际 \(\gamma(A)=2\)(\(A^2=\begin{bmatrix}1&1\\1&2\end{bmatrix}\))。
实用检验策略:验证本原性可检查不可约 + Wielandt 条件。不可约且有正对角元必本原。零对角的大型无结构矩阵,用反复平方:\(n=10\) 时验证不可约只需算 \((I+A)^2,(I+A)^4,(I+A)^8,(I+A)^{16}\)(4 次乘法而非 8.4.1 直接要求的 8 次,因 \((I+A)^{16}\ge(I+A)^9\) 的零模式包含关系);验证本原需 \(A^2,A^4,\dots,A^{128}\)(\(128\ge82=n^2-2n+2\),7 次乘法而非 81 次)。依据:8.5.P3 类型的事实(正性一旦出现在幂中则保持)。实际中只需关心零/非零模式(布尔矩阵乘法)。
8.5 习题概要(8.5.P1–P20,PDF p.564–565)
- P1:另一定义“存在 \(m\) 使 \(A^m>0\)”与 8.5.0 等价(即 8.5.2)。P2:本原时 \(\lim_m(a_{ij}^{(m)})^{1/m}=\rho(A)\) 对所有 \(i,j\)。P3:本原矩阵之积未必本原(举例)。
- P4 Wielandt 矩阵:\(a_{12}=a_{23}=\dots=a_{n-1,n}=a_{n1}=a_{n2}=1\),其余 0(\(n\ge3\))。图含长 \(n\) 与 \(n-1\) 的圈,不可约本原;\(A^{n^2-2n+1}\) 的 \((1,1)\) 元为 0,而 \(A^{n^2-2n+2}>0\)——Wielandt 界紧。
- P5:不可约非负且有正对角元 ⇒ 本原;该条件对 \(n=2\) 必要,对 \(n\ge3\) 不必要。P6:补全 8.5.9 证明。P7:讨论反复平方的计算捷径。
- P8:幂等 \(A\) 有 \(A=\lim A^m\);不可约非负幂等矩阵是秩一正矩阵。P9:\(\lim(\rho^{-1}A)^m\) 存在不需本原(可约、多个最大模特征值也可,如 \(I\))。P10:部分逆命题:\(A\) 不可约非负且极限存在 ⇒ 本原。P11:\(\begin{bmatrix}0&1\\1&0\end{bmatrix}\) 不可约但平方可约,不与 8.5.5 矛盾(它不本原)。P12:不可约非负但极限不存在的例子。P13:\(A\) 不可约非负、\(\epsilon>0\) ⇒ \(A+\epsilon I\) 本原;故不可约非负矩阵是本原矩阵的极限。
- P14:组合对称(combinatorially symmetric):\(a_{ij}>0\Leftrightarrow a_{ji}>0\)。组合对称本原 ⇒ \(A^{2n-2}>0\)。
- P15:\(n\) 素数、不可约非负非奇异 ⇒ 要么本原,要么相似于 \(x^n-\rho(A)^n\) 的友矩阵(全部特征值最大模)。
- P16 幂法(power method):\(x^{(0)}>0\)、\(\sum x_i^{(0)}=1\);\(y^{(m+1)}=Ax^{(m)}\),\(x^{(m+1)}=y^{(m+1)}/\sum_iy_i^{(m+1)}\)。若 \(A\) 本原,则 \(x^{(m)}\to\) 右 Perron 向量,\(\sum_iy_i^{(m+1)}\to\rho(A)\);收敛速率由 \(|\lambda_2|/\rho(A)\) 决定;不本原时(如 \(\begin{bmatrix}0&1\\1&0\end{bmatrix}\))可能振荡不收敛。(PageRank 计算的数学基础。)
- P17:本原性只依赖零元的位置而与非零元大小无关。P18:对称不可约非负 \(A\) 本原 ⇔ \(A+\rho(A)I\) 非奇异(即 \(-\rho(A)\) 不是特征值);半正定时自动成立。(无向图邻接矩阵:本原 ⇔ 连通且非二部图。)
- P19:对 8 个 2×2 0-1 矩阵求特征值、特征向量并按非负/不可约/本原/正分类。P20:8.5.7 证明中 \(X_{11},X_{12}\) 每列有非零元、\(Y_{21}>0\) 的理由。
延伸阅读:Romanovsky 定理见 V. Romanovsky, Acta Math. 66 (1936);Wielandt 定理即 \(A^{(n-1)^2+1}>0\);以极小多项式次数 \(m\) 改进为 \(A^{(m-1)^2+1}>0\) 见 J. Shen, LAA 216 (1995)。
8.6 一般极限定理(A general limit theorem)(PDF p.565–567)
即使 \(A\) 不可约,\((\rho^{-1}A)^m\) 也可能无极限(如 \(\begin{bmatrix}0&1\\1&0\end{bmatrix}\)),但其 Cesàro 平均 有极限。
两个练习(引理):
- \(\theta\in(0,2\pi)\):\((1-e^{i\theta})\sum_{m=1}^Ne^{im\theta}=e^{i\theta}-e^{i(N+1)\theta}\),故 \(\frac1N\sum_{m=1}^Ne^{im\theta}=\frac{e^{i\theta}-e^{i(N+1)\theta}}{N(1-e^{i\theta})}\to0\)。
- \(\rho(B)<1\):\((I-B)\sum_{m=1}^NB^m=B-B^{N+1}\),故 \(\frac1N\sum_{m=1}^NB^m=\frac1N(B-B^{N+1})(I-B)^{-1}\to0\)。
Theorem 8.6.1:\(A\in M_n\) 不可约非负,\(n\ge2\),\(x,y\) 为右、左 Perron 向量(\(x^Ty=1\)),则
8.6 习题概要
- P1:\(A=\begin{bmatrix}0&1\\1&0\end{bmatrix}\) 时计算 (8.6.5) 中的直和因子,说明 \(O(1/N)\) 界不能改进(奇数 \(N\) 时误差恰为 \(\frac1{2N}\) 量级)。
- P2:\(A\) 不可约非负 ⇒ 对每对 \(i,j\),\(a_{ij}^{(m)}>0\) 对无穷多个 \(m\) 成立;但也可能对无穷多个 \(m\) 为 0(周期矩阵)。
8.7 随机矩阵与双随机矩阵(Stochastic and doubly stochastic matrices)(PDF p.567–573)
定义:非负 \(A\in M_n\) 若 \(Ae=e\)(\(e\) 为全 1 向量,每行和为 1),称为**(行)随机矩阵(row stochastic matrix)**,每行可视为 \(n\) 点样本空间上的离散概率分布;**列随机矩阵(column stochastic)**是其转置,\(e^TA=e^T\)(8.0 节城市间人口迁移模型即此类)。随机矩阵出现于 Markov 链、经济学与运筹学建模。
- 由 \(Ae=e\) 与 8.3.4,\(+1\) 不仅是特征值,而且就是谱半径 \(\rho(A)=1\)。
- 随机矩阵集合是紧凸集(元素在 \([0,1]\);\((\alpha A+(1-\alpha)B)e=e\))。它们是“拥有同一正特征向量 \(e\)”的非负矩阵族,因此自动继承 8.1.30、8.1.31、8.1.33、8.3.4 等关于“有正特征向量的非负矩阵”的性质。
- 练习:\(n\times n\) 随机矩阵至少有 \(n\) 个非零元(每行至少一个)。
双随机矩阵(doubly stochastic):\(A\) 与 \(A^T\) 均随机,即非负且 \(Ae=e\)、\(e^TA=e^T\)。集合为两个紧凸集的交,仍紧凸。特例:
- 4.3.49、6.3.5 中的正交随机 / 酉随机矩阵(orthostochastic / unistochastic) \(A=[|u_{ij}|^2]\),\(U\) 实正交或酉;
- 置换矩阵(构成群),是“原型”双随机矩阵——Birkhoff 定理说任何双随机矩阵都是有限个置换矩阵的凸组合。
练习:\(n\ge2\),\(A\) 双随机且某 \(a_{ii}=1\),则 (a) 第 \(i\) 行、第 \(i\) 列其余元全为 0;(b) \(A\) 置换相似于 \([1]\oplus B\),\(B\) 双随机;(c) \(B\) 的对角元即 \(A\) 的对角元去掉一个 1;(d) \(p_A(t)=(t-1)p_B(t)\)。
Lemma 8.7.1:\(A\in M_n\) 双随机且 \(A\ne I\),则存在非恒等置换 \(\sigma\) 使 \(a_{1\sigma(1)}\cdots a_{n\sigma(n)}>0\)。 证明(反证):设所有非恒等置换 \(\sigma\) 的乘积都为 0,则由行列式展开 (0.3.2.1)
练习:双随机矩阵若恰有 \(n\) 个正元,则为置换矩阵;若非置换矩阵,零元至多 \(n^2-n-1\) 个。
Theorem 8.7.2(Birkhoff 定理):\(A\in M_n\) 双随机 ⇔ 存在置换矩阵 \(P_1,\dots,P_N\) 与正数 \(t_1,\dots,t_N\),\(\sum t_i=1\),使
Corollary 8.7.4:凸(凹)实值函数在双随机矩阵集合上的最大值(最小值)在某置换矩阵处取得。 证明:设 \(f\) 凸,最大值在 \(A\) 取得,\(A=\sum t_iP_i\),取 \(f(P_k)=\max_if(P_i)\),则 \(f(A)\le\sum t_if(P_i)\le f(P_k)\),故 \(f(A)=f(P_k)\)。凹函数最小值同理。(这正是 6.3.5 Hoffman–Wielandt 定理证明的关键;凸集、极点见附录 B。)
双次随机矩阵(doubly substochastic):非负且 \(Ae\le e\)、\(e^TA\le e^T\)(行和、列和均 \(\le1\))。
Lemma 8.7.5:双次随机 \(A\) 必被某双随机矩阵 \(S\) 控制:\(A\le S\)(逐元素)。 证明:令 \(N(S)\) 为行和与列和中小于 1 的个数;\(N(A)=0\) 即双随机。若 \(N(A)>0\),因行和总和 = 列和总和,必存在行 \(i\) 与列 \(j\) 的和都 \(<1\),增大 \(a_{ij}\) 直到第 \(i\) 行或第 \(j\) 列之和等于 1,得 \(C\ge A\) 双次随机且 \(N(C)<N(A)\);有限归纳完成。
练习:\(U=[u_{ij}],V=[v_{ij}]\) 酉,则 \(S=[|u_{ij}v_{ji}|]\) 双次随机(Cauchy–Schwarz:\(\sum_j|u_{ij}v_{ji}|\le(\sum_j|u_{ij}|^2)^{1/2}(\sum_j|v_{ji}|^2)^{1/2}=1\))。
Theorem 8.7.6(von Neumann 迹定理,方阵情形):\(A,B\in M_n\) 奇异值 \(\sigma_1(A)\ge\dots\ge\sigma_n(A)\)、\(\sigma_1(B)\ge\dots\ge\sigma_n(B)\),则
8.7 习题概要(8.7.P1–P15,PDF p.571–572)
- P1:(双)随机矩阵在乘法下构成半群。
- P2:随机矩阵幂有界,故每个模为 1 的特征值都是半单(semisimple)的。P3:非负 \(A\) 有正特征向量 \(x\),\(D=\operatorname{diag}(x)\),则 \(\rho(A)^{-1}D^{-1}AD\) 是随机矩阵——许多问题可化归随机矩阵。P4:由此有正特征向量的非负矩阵的最大模特征值都半单。
- P5:双随机矩阵 \(\sigma_1(A)=\rho(A)=1\)(谱矩阵 spectral matrix);两种证法:用 (8.7.3) 与范数凸性,或用 2.6.P29。P6:由置换不变向量范数诱导的矩阵范数对双随机矩阵取值 1。
- P7–P8:置换矩阵是双随机矩阵集合的极点(extreme point),且极点恰为置换矩阵。
- P9:双随机矩阵不能恰有 \(n+1\) 个正元;非置换矩阵时零元至多 \(n^2-n-2\)。P10:2×2 双随机矩阵对称且对角元相等(形如 \(\begin{bmatrix}a&1-a\\1-a&a\end{bmatrix}\))。P11:(8.7.3) 表示不唯一。
- P12:\(A\) 双随机、对称、半正定,则 \(A^{1/2}e=e\)(\(A^{1/2}\) 行列和为 1);\(A^{1/2}\) 一般未必非负,但 \(n=2\) 时非负(从而双随机)。P13:酉不变矩阵范数满足 \(\|A\|\le\|I\|\)(\(A\) 双随机)。P14:可约双随机矩阵置换相似于 \(A_1\oplus A_2\)(两块均双随机,即可约 ⇒ 完全可分解)。
- P15(Birkhoff 项数改进):双随机矩阵满足 \(2n-1\) 个独立线性方程(\(n\) 个行和 + \(n-1\) 个列和);写成 \(A\operatorname{vec}S=e\in\mathbf R^{2n-1}\),\(A\in M_{2n-1,n^2}\) 行满秩,零空间维数 \(n^2-2n+1\),双随机矩阵集合是 \(\mathbf R^{n^2-2n+1}\) 中的凸多面体;结合 Carathéodory 定理(附录 B)得任一双随机矩阵是至多 \(n^2-2n+2\) 个置换矩阵的凸组合。
注记与延伸阅读:8.7.2 见 G. Birkhoff (1946, Univ. Nac. Tucumán Rev.);D. Kőnig 1916 对非负有理元情形已得等价结论,故亦称 Birkhoff–Kőnig 定理。证明中唯一非构造的部分是找 \(\sigma\) 使 \(\prod a_{i\sigma(i)}>0\);构造性算法见 Bapat & Raghavan (1997) pp.64–65(该书第 2 章系统讨论双随机矩阵)。PDF p.574 为空白页。
第 8 章(本块所覆盖部分)本章要点
- 不可约非负矩阵的最大模特征值恰为 \(\rho(A)\) 乘以全部 \(k\) 次单位根(8.4.6),且都简单;\(k\) 整除非零特征值个数;\(k>1\) 时对角元为 0、可置换成循环块形 (8.4.8)。
- 本原 = 不可约 + 唯一最大模特征值 ⇔ 某幂为正(8.5.2)⇔ 各节点闭路长度 gcd 为 1(8.5.3)。本原时 \((\rho^{-1}A)^m\to xy^T\)(8.5.1,即遍历 Markov 链收敛)。
- 本原指数界:对角全正 \(\le n-1\)(8.5.4);最短圈 \(s\) 时 \(\le n+s(n-2)\)(8.5.7);Wielandt 一般界 \(n^2-2n+2\) 且紧(8.5.8);\(d\) 个正对角元时 \(\le2n-d-1\)(8.5.9)。
- 不可约非负矩阵的 Cesàro 平均总收敛到 \(xy^T\),误差 \(O(1/N)\)(8.6.1)。
- 随机矩阵谱半径为 1;双随机矩阵 = 置换矩阵的凸包(Birkhoff,8.7.2),凸函数在其上的最大值在置换矩阵取得(8.7.4);由此推出 von Neumann 迹不等式(8.7.6)。
与量化交易的关联
- Markov 链与状态转移:行随机矩阵即离散 Markov 链转移矩阵(信用评级迁移矩阵、市场状态 regime 切换模型、订单簿状态模型)。8.5.1 给出“本原(不可约且非周期)链 \(P^m\to e\pi^T\)”的严格依据,\(\pi\) 为平稳分布(左 Perron 向量);收敛速度由次大特征值模 \(|\lambda_2|\) 决定(混合时间)。周期链只有 Cesàro 平均收敛(8.6.1)——蒙特卡洛模拟中用时间平均估计稳态是合理的。
- 评级迁移矩阵的多期推算:\(P^m\) 的计算、判断某评级是否终会到达(不可约性、\((I+A)^{n-1}>0\) 检测)、用反复平方降低计算量(8.5 节末的技巧)。
- 幂法与 PageRank / 网络中心性:8.5.P16 幂法用于计算 Perron 向量,可用于资产关联网络(相关性网络、供应链网络、资金流网络)的特征向量中心性;本原性保证收敛。
- 谱半径灵敏度 8.4.P13:\(\partial\rho/\partial a_{ij}=x_iy_j\),可用于系统性风险传染模型(如银行间敞口矩阵的放大因子)中识别最关键的连边。
- Birkhoff 定理:在组合优化里,“分配问题”(如交易指令与执行通道/券商的一一匹配、配对交易中的资产配对)在线性目标下的 LP 松弛最优解必在置换矩阵取得(8.7.4),所以可用 LP 或匈牙利算法求整数解。
- von Neumann 迹不等式:\(\operatorname{tr}(AB)\le\sum\sigma_i(A)\sigma_i(B)\) 是 Procrustes 问题(因子旋转对齐、协方差矩阵的最近正交变换)和低秩逼近证明的核心工具,在因子模型的旋转、风险模型对齐中会用到。
推荐习题
- 8.4.P13(Perron 根对元素的导数)、8.4.P25(\(\limsup(\operatorname{tr}A^m)^{1/m}=\rho(A)\)):谱半径的分析性质。
- 8.5.P4(Wielandt 矩阵,界的紧性)、8.5.P16(幂法收敛性)、8.5.P18(对称矩阵本原性 ⇔ \(-\rho\) 非特征值,对应无向图非二部)。
- 8.6.P1(\(O(1/N)\) 界的最优性)。
- 8.7.P2、P3(随机矩阵特征值半单;对角相似化归为随机矩阵)、8.7.P5(双随机矩阵谱范数为 1)、8.7.P15(Birkhoff 项数 \(n^2-2n+2\),Carathéodory 定理应用)。
附录(Appendices)
附录 A 复数(Complex Numbers)(PDF p.575–576)
- 定义与运算:\(z=a+ib\),\(a=\operatorname{Re}z\)(实部 real part),\(b=\operatorname{Im}z\)(虚部 imaginary part),\(i^2=-1\);共轭(complex conjugate)\(\bar z=a-ib\)。加法分量相加;乘法 \(z_1z_2=a_1a_2-b_1b_2+i(a_1b_2+a_2b_1)\)。\(z\ne0\) 时
\[\frac1z=\frac{a-ib}{a^2+b^2}=\frac{a}{a^2+b^2}+i\frac{-b}{a^2+b^2},\qquad \frac{z_1}{z_2}=\frac{z_1\bar z_2}{z_2\bar z_2}.\]\(\mathbf C\) 是域,\(\mathbf R\) 是其子域。
- 模(modulus / absolute value):\(|z|=+(z\bar z)^{1/2}=((\operatorname{Re}z)^2+(\operatorname{Im}z)^2)^{1/2}\);\(|z|=0\Leftrightarrow z=0\)。共轭与乘法交换 \(\overline{z_1z_2}=\bar z_1\bar z_2\),\(\bar{\bar z}=z\);\(\operatorname{Re}z=\frac12(z+\bar z)\),\(\operatorname{Im}z=\frac1{2i}(z-\bar z)\);实数 ⇔ \(z=\bar z\)。\(\operatorname{Re}z\le|z|\),等号 ⇔ \(z\) 为非负实数。
- 几何:复平面(实轴、虚轴);共轭 = 关于实轴反射;开(闭)右半平面 \(\operatorname{Re}z>(\ge)0\),上半平面 \(\operatorname{Im}z>(\ge)0\);单位圆盘 \(|z|\le1\);以 \(a\) 为心半径 \(r\) 的圆盘 \(|z-a|\le r\)。
- 极坐标:\(z=re^{i\theta}\),\(e^{i\theta}=\cos\theta+i\sin\theta\),\(\theta=\arg z\)(辐角,模 \(2\pi\) 确定,主值取 \([0,2\pi)\));\(|e^{i\theta}|=1\),\((e^{i\theta})^{-1}=e^{-i\theta}\),\(|e^{i\theta}z|=|z|\)。对每个 \(z\) 存在实数 \(\theta\) 使 \(e^{-i\theta}z=|z|\)。
- 三角不等式(triangle inequality)及等号条件:\(|z_1+\dots+z_m|\le|z_1|+\dots+|z_m|\)。证明:取 \(\theta\) 使 \(e^{-i\theta}\sum z_k=|\sum z_k|\),则 \(|\sum z_k|=\sum\operatorname{Re}(e^{-i\theta}z_k)\le\sum|z_k|\);等号 ⇔ 每个 \(z_k=e^{i\theta}|z_k|\) 落在同一射线 \(\{re^{i\theta}:r\ge0\}\) 上。
附录 B 凸集与凸函数(Convex Sets and Functions)(PDF p.577–580)
- 凸组合(convex combination):\(\sum\alpha_iv_i\),\(\alpha_i\ge0\),\(\sum\alpha_i=1\)。凸集:对凸组合封闭(等价于对两点凸组合封闭,即连接两点的线段在集合内)。凸锥(convex cone):凸集且 \(\alpha>0\) 时 \(\alpha x\in K\)。凸集(凸锥)的集合和与交仍为凸集(凸锥)。
- 极点(extreme point):\(z=\alpha x+(1-\alpha)y\)(\(0<\alpha<1\),\(x,y\in K\))必有 \(x=y=z\)。闭凸集可有有限个(多面体)、无穷个(闭圆盘)或没有(\(\mathbf R^2\) 闭上半平面)极点;紧凸集一定有极点。
- 凸包(convex hull) \(\operatorname{Co}(S)\):\(S\) 中点的所有凸组合 = 包含 \(S\) 的最小凸集。Krein–Milman 定理:紧凸集是其极点凸包的闭包。有限个极点的紧凸集称有限生成,极点为生成元。Carathéodory(–Steinitz)定理:\(S\subset\mathbf R^n\) 凸包中任一点是 \(S\) 中至多 \(n+1\) 个点的凸组合(8.7.P15 用到)。
- 分离超平面定理(separating hyperplane theorem):实内积空间中,\(K_1\) 闭凸、\(K_2\) 紧凸且不相交,则存在超平面 \(H=\{x:\langle x-p,q\rangle=0\}\)(\(q\ne0\))使 \(K_1\subseteq H_0^+\),\(K_2\subseteq H_0^-\)(闭半空间 \(H_0^\pm=H^\pm\cup H\),开半空间 \(H^+=\{\langle x-p,q\rangle>0\}\),\(H^-\) 类似)。若两者闭包不交,可严格分离。有界集凸包的闭包 = 所有包含它的闭半空间之交。\(\mathbf C^n\) 时把 \(x+iy\) 等同于 \(\begin{bmatrix}x\\y\end{bmatrix}\in\mathbf R^{2n}\),用实内积 \(\operatorname{Re}\langle\cdot,\cdot\rangle\)(\(\operatorname{Re}\langle x_1+iy_1,x_2+iy_2\rangle=\langle x_1,x_2\rangle+\langle y_1,y_2\rangle\))。
- 凸函数:
\[f(\alpha x+(1-\alpha)y)\le\alpha f(x)+(1-\alpha)f(y),\quad0<\alpha<1,\ x\ne y\tag{B1}\]恒严格时称严格凸;反向为凹(concave)。几何:弦在图像上方。线性函数既凸又凹。\(\mathbf R^n\) 开凸集上,Hessian \(H(x)=[\partial^2f/\partial x_i\partial x_j]\) 对有界凸函数几乎处处存在且半正定(严格凸时正定);反之 Hessian 处处半正定(正定)⇒ 凸(严格凸)。负定对应凹。
- 优化性质:紧凸集上凸(凹)函数的最大(最小)值在极点取得(8.7.4 即其特例);凸集上凸函数的最小点集是凸的,局部极小即全局极小;严格凸函数至多在一点取最小值,临界点必为最小点。
- 经典不等式:
- (B2) \(\min x_i\le\sum\alpha_ix_i\le\max x_i\)。
- (B3) Jensen 型 \(n\) 点不等式 \(f(\sum\alpha_ix_i)\le\sum\alpha_if(x_i)\)(由 (B1) 归纳)。
- (B4) 加权算术–几何平均不等式:对 \(f=-\log x\) 得 \(\sum\alpha_ix_i\ge\prod x_i^{\alpha_i}\)(\(x_i\ge0\));(B5) \(\alpha_i=1/n\) 时 \(\frac1n\sum x_i\ge(\prod x_i)^{1/n}\),等号 ⇔ 全相等。
- (B6) Hölder 不等式:\(\sum x_iy_i\le(\sum x_i^p)^{1/p}(\sum y_i^q)^{1/q}\),\(x_i,y_i>0\),\(p>1\),\(1/p+1/q=1\)(用 \(f=x^p\)),等号 ⇔ \([x_i^p]\) 与 \([y_i^q]\) 线性相关。(B7) \(p=q=2\) 为 Cauchy–Schwarz。(B8) 极限情形 \(\sum x_iy_i\le(\sum x_i)\max y_i\)(\(x_i,y_i\ge0\))。
- (B9) Minkowski 和不等式:\((\sum(x_i+y_i)^p)^{1/p}\le(\sum x_i^p)^{1/p}+(\sum y_i^p)^{1/p}\)(\(p>1\)),由 Hölder 推出,等号 ⇔ 线性相关。
- (B10) Minkowski 积不等式:\((\prod(x_i+y_i))^{1/n}\ge(\prod x_i)^{1/n}+(\prod y_i)^{1/n}\)(由 AM–GM 推出)。
- (B11)(书中称 Jensen 不等式)\(\ell_p\) 范数关于 \(p\) 递减:\(0<p_1<p_2\) 时 \((\sum x_i^{p_1})^{1/p_1}>(\sum x_i^{p_2})^{1/p_2}\)。证明:\(\frac{(\sum x_i^{p_2})^{1/p_2}}{(\sum x_i^{p_1})^{1/p_1}}=\Big(\sum_i\big(\tfrac{x_i^{p_1}}{\sum_jx_j^{p_1}}\big)^{p_2/p_1}\Big)^{1/p_2}<\Big(\sum_i\tfrac{x_i^{p_1}}{\sum_jx_j^{p_1}}\Big)^{1/p_2}=1\)(每项小于 1 且指数 \(p_2/p_1>1\);\(n\ge2\))。
- 延伸阅读:Valentine (1964) 凸几何;Boas (1972) 凸函数;B4–B11 证明见 Beckenbach & Bellman (1965)、Hardy–Littlewood–Pólya (1959)。
附录 C 代数基本定理(The Fundamental Theorem of Algebra)(PDF p.581)
- 动机:实系数多项式可无实根,如 \(t^2-2t+2\) 的根为 \(1\pm i\)。\(\mathbf C\) 是代数闭域(algebraically closed field)。
- 代数基本定理:次数 \(\ge1\) 的复系数多项式在 \(\mathbf C\) 中至少有一个根。由综合除法,\(p(z)=0\) ⇒ \(p(t)=(t-z)q(t)\),\(\deg q=\deg p-1\)。
- Theorem:\(n\ge1\) 次复系数多项式计重数恰有 \(n\) 个复根。根 \(z\) 的重数 = 使 \((t-z)^k\mid p(t)\) 的最大 \(k\)。故复多项式可分解为一次因式之积。
- 实系数多项式的非实根成共轭对(\(p(\bar z)=\overline{p(z)}\));\((x-z)(x-\bar z)=x^2-2\operatorname{Re}(z)x+|z|^2\),故实多项式可分解为实一次与不可约实二次因式之积。初等证明见 Childs (1979)。PDF p.582 为空白页。
附录 D 多项式零点与矩阵特征值的连续性(Continuity of Polynomial Zeroes and Matrix Eigenvalues)(PDF p.583–584)
- \(n\) 次多项式的零点连续依赖于系数(通常用复分析证明)。难点:零点没有自然的排序,不能直接定义“系数 → 零点”的函数,所以用“存在一个匹配置换”的定量形式表述。
- Theorem D1:\(p(t)=t^n+a_1t^{n-1}+\dots+a_n\),\(q(t)=t^n+b_1t^{n-1}+\dots+b_n\),零点分别为 \(\lambda_1..\lambda_n\)、\(\mu_1..\mu_n\)(计重数)。令 \(\gamma=2\max_{1\le k\le n}\{|a_k|^{1/k},|b_k|^{1/k}\}\),则存在置换 \(\tau\) 使
\[\max_{1\le j\le n}|\lambda_j-\mu_{\tau(j)}|\le2^{\frac{2n-1}{n}}\Big(\sum_{k=1}^n|a_k-b_k|\gamma^{n-k}\Big)^{1/n}.\]
- Theorem D2:\(A,B\in M_n\),特征值 \(\lambda_j\)、\(\mu_j\),存在置换 \(\tau\) 使
\[\max_j|\lambda_j-\mu_{\tau(j)}|\le2^{\frac{2n-1}{n}}(\|A\|_2+\|B\|_2)^{\frac{n-1}{n}}\|A-B\|_2^{\frac1n}\](\(\|\cdot\|_2\) 为谱范数)。要点:一般矩阵特征值对扰动只有 \(1/n\) 次 Hölder 连续(Jordan 块 \(J_n(0)\) 加 \(\varepsilon\) 扰动角元,特征值变化 \(\varepsilon^{1/n}\));而 Hermitian/正规矩阵有 Weyl、Hoffman–Wielandt 的 Lipschitz 界。出处:Bhatia, Elsner, Krause, LAA 142 (1990)。
附录 E 连续性、紧性与 Weierstrass 定理(Continuity, Compactness, and Weierstrass's Theorem)(PDF p.585–586)
- 有限维赋范空间 \(V\):闭球 \(B_\epsilon(x)=\{\|y-x\|\le\epsilon\}\),开球(严格不等号);开集、闭集(补集开 ⇔ 收敛序列极限仍在集内)、有界集(含于某有限半径球)、紧集(compact)= 有界闭集(有限维下)。
- \(\inf f\)、\(\sup f\) 可能不有限,有限也未必取到。连续、一致连续的 \(\epsilon\)-\(\delta\) 定义。
- Weierstrass 定理:\(S\) 为有限维实/复赋范空间的紧子集,\(f:S\to\mathbf R\) 连续,则存在 \(x_{\min},x_{\max}\in S\) 使 \(f(x_{\min})\le f(x)\le f(x_{\max})\) 对所有 \(x\in S\)。最值点可不唯一;紧性或连续性任一不满足结论可能失败;有限维不是本质的(一般拓扑空间的紧子集上亦成立)。参考 Kreyszig (1978) 第 2 章、Conway (1990) 第 3 章。
附录 F 典范对(Canonical Pairs)(PDF p.587–589)
- 任意 \(A\in M_n(\mathbf C)\) 唯一分解为 \(A=S(A)+C(A)\),\(S(A)=\frac12(A+A^T)\) 对称、\(C(A)=\frac12(A-A^T)\) 反对称;也唯一分解为 \(A=H(A)+iK(A)\),\(H(A)=\frac12(A+A^*)\)、\(K(A)=\frac1{2i}(A-A^*)\) 均 Hermitian。对 \((S(A),C(A))\) 的同时合同(congruence)对应 \(A\) 的合同;对 \((H(A),K(A))\) 的同时 *合同(*congruence)对应 \(A\) 的 *合同。因此 4.5 节合同 / *合同典范形可翻译为典范对(canonical pairs)。
- 使用的 \(k\times k\) 矩阵:\(M_k\)(次对角与超对角全为 1 的对称三对角矩阵)、\(N_k\)(超对角为 1、次对角为 \(-1\) 的反对称矩阵)、\(X_k\)、\(Y_k\)(反对角线附近带交错符号 \(\pm1\) 的矩阵:\(X_k\) 的反对角元自左下起为 \(1,-1,1,\dots,(-1)^{k+1}\);\(Y_k\) 的非零元位于反对角线下方相邻的一条斜线上,交错为 \(1,-1,\dots\),右上角附近为 \((-1)^k\));以及 4.5.19 第一类矩阵的两参数版 \(\Delta_k(a,b)\)(反对角元为 \(a\),紧挨在反对角线下方的斜线元为 \(b\),其余为 0)。
- 矩阵对:同阶方阵的有序对 \((A,B)\);直和 \((A_1,A_2)\oplus(B_1,B_2)=(A_1\oplus B_1,A_2\oplus B_2)\);斜和(skew sum) \([A\backslash B]=\begin{bmatrix}0&B\\A&0\end{bmatrix}\)。\((A_1,A_2)\) 与 \((B_1,B_2)\) 同时合同(同时 *合同):存在非奇异 \(R\) 使 \(A_1=R^TB_1R\)、\(A_2=R^TB_2R\)(相应地用 \(R^*\))。
- Theorem F1(a):对称 \(S\) 与反对称 \(C\) 的对 \((S,C)\) 同时合同于下列三型对的直和(除排列外唯一),对应 \(A=S+C\) 的合同典范型 (4.5.25):
- Type 0:\(J_n(0)\) ↔ \((M_n,N_n)\);
- Type I:\(\Gamma_n\) ↔ \(n\) 奇数时 \((X_n,Y_n)\),\(n\) 偶数时 \((Y_n,X_n)\);
- Type II:\(H_{2n}(\mu)\) ↔ \(([J_n(\mu+1)\backslash J_n(\mu+1)^T],\ [J_n(\mu-1)\backslash-J_n(\mu-1)^T])\),\(0\ne\mu\ne(-1)^{n+1}\),\(\mu\) 在 \(\mu\leftrightarrow\mu^{-1}\) 意义下确定。 Type II 也可换成两种替代形式:\(0\ne\mu\ne-1\)(\(n\) 奇时 \(\mu\ne1\))时用 \(([I_n\backslash I_n],[J_n(\nu)\backslash-J_n(\nu)^T])\),\(\nu=\frac{\mu-1}{\mu+1}\)(\(n\) 奇时 \(\nu\ne0\),\(\nu\ne\pm1\),\(\nu\) 在 \(\nu\leftrightarrow-\nu\) 意义下确定);\(\mu=-1\)、\(n\) 奇时用 \(([J_n(0)\backslash J_n(0)^T],[I_n\backslash-I_n])\)。
- Theorem F1(b):Hermitian 对 \((H,K)\) 同时 *合同于下列四型对的直和(除排列外唯一),对应 \(A=H+iK\) 的 *合同典范型 (4.5.21):
- Type 0:\(J_n(0)\) ↔ \((M_n,iN_n)\);
- Type I:\(\lambda\Delta_n\),\(|\lambda|=1\)、\(\lambda^2\ne-1\) ↔ \(\pm(\Delta_n(1,0),\Delta_n(c,1))\),\(c=\operatorname{Im}\lambda/\operatorname{Re}\lambda\in\mathbf R\);
- Type I:\(\lambda\Delta_n\),\(\lambda^2=-1\) ↔ \(\pm(\Delta_n(0,1),\Delta_n(1,0))\);
- Type II:\(H_{2n}(\mu)\),\(|\mu|>1\) ↔ \(([I_n\backslash I_n],[J_n(a+ib)\backslash J_n(a+ib)^*])\),\(a=\frac{2\operatorname{Im}\mu}{|1+\mu|^2}\),\(b=\frac{|\mu|^2-1}{|1+\mu|^2}>0\),\(a+bi\ne i\)。
- 出处:Horn & Sergeichuk, LAA 416 (2006);其他版本见 Lancaster & Rodman (SIAM Review 2005;LAA 2005)、Thompson (LAA 1991)、Sergeichuk (1988)。PDF p.590 为空白页。
附录小结与量化关联
- 附录 B 是组合优化、均值–方差优化的基础:Hessian 半正定 ⇔ 凸(组合方差 \(w^T\Sigma w\) 凸的依据);局部最优即全局最优;分离超平面定理是对偶理论、无套利定理(Farkas 引理 / 资产定价基本定理)的几何核心;Carathéodory 定理说明有限资产时最优组合只需有限个“顶点”。Hölder、Minkowski、AM–GM 常用于风险度量与范数约束(\(\ell_p\) 正则)的推导;(B11) 的 \(\ell_p\) 范数单调性在换手率 / 稀疏约束比较中用得上。
- 附录 D 提醒:非对称矩阵(如 VAR 伴随矩阵、转移矩阵)的特征值对估计误差可能极其敏感(\(\epsilon^{1/n}\)),协方差等对称矩阵则稳定得多。
- 附录 E 的 Weierstrass 定理保证紧约束集(如带上下限、预算约束的权重集合)上连续目标函数有最优解。
- 附录 A、C、F 与量化实务无直接关联(A、C 为基础工具;F 为纯理论的合同典范形)。
参考文献(References)(PDF p.591–594,原书 p.571–574)
按作者字母排序的约 110 条专著与讲义(期刊论文已在各节“延伸阅读”中给出)。对编写教材较有用的条目:
- 非负矩阵:Bapat & Raghavan (1997) Nonnegative Matrices and Applications;Berman & Plemmons (1994) Nonnegative Matrices in the Mathematical Sciences;Berman, Neumann & Stern (1989);Minc (1988);Seneta (1973) Nonnegative Matrices(Markov 链方向);Fallatt & Johnson (2011) Totally Nonnegative Matrices;Karlin (1960) Total Positivity。
- 矩阵分析 / 不等式:Bhatia (1987) Perturbation Bounds for Matrix Eigenvalues、(1997) Matrix Analysis、(2007) Positive Definite Matrices;Horn & Johnson (1991) Topics in Matrix Analysis;Marshall & Olkin (1979) Inequalities: Theory of Majorization;Zhan (2002) Matrix Inequalities;Hardy–Littlewood–Pólya (1959) Inequalities;Beckenbach & Bellman (1965);Marcus & Minc (1964);Stewart & Sun (1990) Matrix Perturbation Theory;Kato (1980);Baumgärtel (1985)。
- 数值线性代数:Golub & Van Loan (1996) Matrix Computations 3rd ed.;Wilkinson (1965) The Algebraic Eigenvalue Problem;Parlett (1998) The Symmetric Eigenvalue Problem;Higham (2008) Functions of Matrices;Lawson & Hanson (1974) Solving Least Squares Problems;Householder (1964);Stewart (1973);Varga (2000) Matrix Iterative Analysis、(2004) Geršgorin and His Circles;Campbell & Meyer (1991) Generalized Inverses。
- 经典矩阵论与线性代数:Gantmacher (1959) The Theory of Matrices(2 卷);Lancaster & Tismenetsky (1985);Halmos (1958);Hoffman & Kunze (1971);Axler (1996);Lax (2007);Bellman (1997);Horn & Sergeichuk 等关于典范形的工作;Gohberg–Lancaster–Rodman 系列(矩阵多项式、不定内积、不变子空间);Zhang (2005) The Schur Complement and its Applications;Turnbull & Aitken (1962) 典范矩阵;Clark, O'Meara & Vinsonhaler (2011) Weyr 形。
- 统计 / 应用:Graybill (1983) Matrices with Applications to Statistics;Rogers (1980) Matrix Derivatives;Graham (1981) Kronecker Products and Matrix Calculus;Bapat (1993) Linear Algebra and Linear Models;Barnett 系列(控制理论);Hirsch & Smale (1974)。
- 分析与凸性:Rudin (1976);Kreyszig (1978);Conway (1990);Valentine (1964) Convex Sets;Boas (1972);Childs (1979)。
- 历史:Muir (1930) 行列式史;Crilly (2006) Cayley 传;Parshall (2006) Sylvester 传;Kőnig (1936/1990) 图论。
- 量化相关的推荐延伸:Seneta(Markov 链/非负矩阵)、Golub & Van Loan(数值计算)、Higham(矩阵函数、最近相关矩阵)、Marshall & Olkin(优超与组合不等式)、Bhatia(扰动界)。
符号表(Notation)(PDF p.595–597,原书 p.575–577)
列出全书符号(PDF p.598 空白)。要点整理:
- 空间与矩阵:\(\mathbf R,\mathbf C,\mathbf F\)(域);\(\mathbf F^n\);\(M_{m,n}(\mathbf F)\);\(M_{m,n}=M_{m,n}(\mathbf C)\),\(M_n=M_{n,n}\);\(I_n\)、\(0_{m,n}\);\(\bar A\)、\(A^T\)、\(A^*=\bar A^T\)、\(A^{-1}\)、\(A^{-T}\)、\(A^{-*}\);\(|A|=[|a_{ij}|]\);\(\operatorname{adj}A\)(伴随,转置余子式矩阵);\(A^\dagger\)(Moore–Penrose 逆);\(A^D\)(Drazin 逆);\(\mathcal B\)(基),\(e_i\)(标准基),\(e\)(全 1 向量;亦为自然对数底);\([v]_{\mathcal B}\)、\({}_{\mathcal B_1}[T]_{\mathcal B_2}\)(坐标与基表示);\(\binom nk\);\(p_A(\cdot)\) 特征多项式,\(q_A(\cdot)\) 极小多项式。
- 数值量:\(\kappa(A)\) 条件数;\(\det A\);\(\oplus\) 直和;\(\Gamma(A)\) 有向图;\(\|\cdot\|^D\)、\(f^D\) 对偶(预)范数;\(\lambda\)、\([\lambda_i(A)]\) 特征值向量;\(G_k(A)\)、\(G(A)\) Geršgorin 圆盘与区域;\(GL(n,\mathbf F)\);\(A\circ B\) Hadamard 积;\(\gamma(A)\) 本原指数;\(M(A)\) 指示矩阵;\(J_k(\lambda)\) Jordan 块。
- 范数:\(\|\cdot\|_1,\|\cdot\|_2\)(向量 Euclid 范数;矩阵 Frobenius 范数)\(,\|\cdot\|_\infty,\|\cdot\|_p\);\(\|x\|_{[k]}\) 向量 \(k\)-范数;\(\|A\|_1\) 最大列和、\(\|A\|_2\) 谱范数(最大奇异值)、\(\|A\|_\infty\) 最大行和(三者为诱导矩阵范数,书中用三竖线);\(N_\infty(A)\);\(\|A\|_{\rm tr}\) 迹范数;\(\|A\|_{[k]}\) Ky Fan \(k\)-范数;\(r(A)\) 数值半径。
- 其他:\(\perp\);\(\operatorname{per}A\) 积和式;\(\operatorname{rank}\);\(\operatorname{sgn}\tau\);\(\sigma\)、\(\sigma_1(A)\)、\([\sigma_i(A)]\) 奇异值;\(\operatorname{span}\)、\(\operatorname{range}\)、\(\operatorname{nullspace}\);\(\rho(A)\) 谱半径;\(\sigma(A)\) 谱;\(A[\alpha,\beta]\)、\(A[\alpha]\) 子矩阵与主子矩阵;\(\operatorname{tr}A\);\(E_k(A)\) \(k\) 阶主子式之和;\(S_k(A)\) 特征值的第 \(k\) 个初等对称函数;\(A/A_{11}\) Schur 补;\(C_r(A)\) 第 \(r\) 复合矩阵;\(\Lambda,\Sigma\) 对角阵;\([A,B]=AB-BA\) 交换子;\(]A,B[=AB+BA\) Jordan 积;\(C(a,b)=\begin{bmatrix}a&b\\-b&a\end{bmatrix}\) 实 Jordan 块;\(w(A,\lambda)\) Weyr 特征;\(x_i^\downarrow\)、\(x_i^\uparrow\) 递减 / 递增重排;\(\Delta_k\)、\(H_{2k}(\mu)\)、\(\Gamma_k\) 合同 / *合同典范块;\(\langle A,B\rangle_F\) Frobenius 内积;\(B_{\|\cdot\|}(r;x)\) 范数球;\(F(A)\) 数值域(field of values);\(R_i'(A)\)、\(C_i'(A)\) 去心行和 / 列和;\(A\succeq B\) Loewner 偏序;\(H(A)\) Hermitian 部分。
习题提示(Hints for Problems)(PDF p.599 起,原书 p.579 起)
按节给出部分习题的提示。下面逐节概括提示内容(只记录有实质思路的提示,供编写习题解答时参考)。
第 1 章
- 1.0.P1:\(f(x)=x^TAx\) 在紧集(单位球面)上连续,用 Weierstrass 定理取到最值。
- 1.1.P7:\(Ax=\lambda x\) ⇒ \(x^*Ax=\lambda x^*x\),而 \(x^*x>0\)、\(x^*Ax\) 为实数(Hermitian),故 \(\lambda\) 实。
- 1.1.P13:\(Ax=\lambda x\) ⇒ \((\det A)x=(\operatorname{adj}A)Ax=\lambda(\operatorname{adj}A)x\);\(\lambda\ne0\) 时 \((\operatorname{adj}A)x=(\lambda^{-1}\det A)x\);\(\lambda=0\) 时 \(\operatorname{adj}A=0\)(\(\operatorname{rank}A<n-1\))或 \(\operatorname{adj}A=\alpha xy^T\)(\(\operatorname{rank}A=n-1\),见 0.8.2)。
- 1.2.P10:实系数多项式的非实根成共轭对,\(A\) 实时 \(p_A\) 实系数。1.2.P11:取基 \(\mathcal B\) 考虑 \([T]_{\mathcal B}\)。1.2.P14:\(\det(tI-A)\) 先按第一列再按第一行展开。1.2.P21:见例 1.2.8。1.2.P23:看 \(p_A(t)\) 最后两项(1.2.13)。
- 1.3.P4:复习 1.3.12 证明,说明 \(A,B\) 可同时对角化;用 0.9.11 与 Lagrange 插值,存在次数 \(\le n-1\) 的多项式 \(p\) 使 \(B\) 的特征值为 \(p(\alpha_i)\)。
- 1.3.P7:\(A^2=B\)、\(Ax=\lambda x\) ⇒ \(\lambda^4x=B^2x=0\),故 \(A\) 的特征值都为零;\(\operatorname{tr}A=0\) 得 \(A=\begin{bmatrix}a&b\\c&-a\end{bmatrix}\),\(\det A=0\) 得 \(a^2+bc=0\),再计算 \(A^2\)。
- 1.3.P10:若线性组合 \(0=\sum_i\sum_jc_{ij}x_j^{(i)}=\sum_iy^{(i)}\),用 1.3.8(不同特征值的特征向量线性无关)证每个 \(y^{(i)}=0\)。1.3.P13:反例 \(\begin{bmatrix}0&0\\0&0\end{bmatrix}\) 与 \(\begin{bmatrix}0&1\\0&0\end{bmatrix}\)(同特征值不相似)。1.3.P16:\(p_A(t)=t^{n-r}(t^r-t^{r-1}\operatorname{tr}B+\dots\pm\det B)\),故 \(E_r(A)\ne0\);考虑 \(\begin{bmatrix}1&i\\i&-1\end{bmatrix}\)(复对称幂零)。
- 1.3.P17:\(S=C+iD\),\(C=(S+\bar S)/2\)、\(D=(S-\bar S)/(2i)\);\(AS=SB\)、\(A\bar S=\bar SB\) ⇒ \(AC=CB\)、\(AD=DB\),仿 1.3.28 证明(实矩阵复相似 ⇒ 实相似)。1.3.P23:用 \(\begin{bmatrix}I_n&X\\0&I_m\end{bmatrix}\) 做相似(Sylvester 方程与块对角化)。1.3.P26(b):\(\tilde A_{pq}=\sum P_{pi}A_{ij}P_{qj}^T=\sum(e_p^TA_{ij}e_q)\varepsilon_i\varepsilon_j^T\)。
- 1.3.P35(Burnside 型定理):(f) 若 \(\mathcal A^*x\) 不是全空间,取与之正交的 \(z\ne0\);(g) 设 \(d=\min\{\operatorname{rank}A:0\ne A\in\mathcal A\}>1\),取秩 \(d\) 的 \(A_d\)、\(B\) 使 \(B(A_de_i)=e_j\),由 \(A_dB\) 在 \(\operatorname{range}A_d\) 上有特征向量构造 \(A_dBA_d-\lambda_0A_d\) 秩更小且非零,矛盾,故 \(d=1\);(h) \(\eta\zeta^*=A(yz^*)B\in\mathcal A\),所以 \(\mathcal A=M_n\)。1.3.P40(b):\(B=\sum\alpha_iA_i=0\) ⇒ \(0=\,]A_i,B[\,=\alpha_iA_i^2\)。1.3.P41(a):考虑 \(D_2D_1AD_2D_1^{-1}\) 类型的对角相似。
- 1.4.P6(a):双正交原理(biorthogonality)。1.4.P7(幂法收敛证明):设 \(\lambda_n=1\) 为严格占优特征值,\(x^{(0)}=\sum\alpha_iy^{(i)}\)(\(\alpha_n\ne0\)),\(x^{(k)}=c_k(\alpha_1\lambda_1^ky^{(1)}+\dots+\alpha_{n-1}\lambda_{n-1}^ky^{(n-1)}+\alpha_ny^{(n)})\),\(|\lambda_i|^k\to0\),故收敛到 \(y^{(n)}\) 的倍数。1.4.P9(b):\(S=\begin{bmatrix}I&0\\z^T&1\end{bmatrix}\) 相似(收缩 deflation)。1.4.P11:为何 \(A-\lambda I\) 前 \(n-1\) 列线性无关(不可约三对角 ⇒ 特征值几何重数 1)。1.4.P15:\((A-\lambda I+\kappa zw^*)u=0\) ⇒ \(w^*u=0\) ⇒ \(u=\alpha x\) ⇒ \(w^*x=0\)。
- 1.4.P16(三对角 Toeplitz 矩阵的特征值):\(A\) 主对角 \(a\)、超对角 \(b\)、次对角 \(c\)。\((A-\lambda I)x=0\) 化为二阶差分方程 \(x_{k+1}+\frac{a-\lambda}bx_k+\frac cbx_{k-1}=0\),边界 \(x_0=x_{n+1}=0\);特征方程根 \(r_1r_2=c/b\)、\(r_1+r_2=-(a-\lambda)/b\);重根导致 \(x=0\),故 \(r_1\ne r_2\),\((r_1/r_2)^{n+1}=1\),\(r_1/r_2=e^{2\pi i\kappa/(n+1)}\),于是特征值为
\[\lambda_\kappa=a+2\sqrt{bc}\cos\frac{\pi\kappa}{n+1},\quad\kappa=1,\dots,n.\]
第 2 章
- 2.1.P2:用 2.1.4(g) 与 1.1.P1。2.1.P14:\(U^{-1}=U^T=U^*\)。2.1.P16(g):\([w\ x]^T[-(w^Tw)^{-1}w\ y]\in M_2(\mathbf R)\) 的特征值为 \(\frac12(x^Ty-1\pm i(1-(x^Ty)^2)^{1/2})\)。2.1.P24(b):\(\det B\le\sqrt{27}\)。2.1.P25:比较 \(C_r(U^*)\) 与 \(C_r(U^{-1})\)(复合矩阵保持酉性)。2.1.P28(a):把上一题构造(Householder 型)先作用于第一列(\(k=n-1\)),再作用于变换后第二列(\(k=n-2\))——即逐列化为 Hessenberg / 三角形的思路。
- 2.2.P8–P9:\(\operatorname{tr}C=?\),\(\begin{bmatrix}0&b\\a&0\end{bmatrix}^2=?\);写 \(A=UBU^*\),\(B\) 对角全零(迹零矩阵酉相似于零对角矩阵),再分 \(B=B_L+B_R\)(下三角含对角部分与严格上三角部分)——用于证明迹零矩阵是交换子。2.2.P10:\(\lambda_\ell=0\) 时 \(|a_i|\le\sum_{j\ne i}|a_j|\)。
- 2.3.P6:两个上三角矩阵的交换子主对角为零。2.3.P8:\(\begin{bmatrix}a&b\\0&c\end{bmatrix}\) 何时复正交。2.3.P11:严格上三角 \(T\) 的幂逐次把非零带推向右上,\(T^n=0\)。2.3.P12:原书印作 \(C_r(UTU^*)=C_r(U)C_r(T)C_r(T)^*\),按 0.8.1 应为 \(C_r(U)C_r(T)C_r(U)^*\)(疑为排印错误;配合 2.1.P25)。2.3.P13:2.3.4。2.3.P14:由 2.3.1,\(\sum|\lambda_i|=\operatorname{tr}(DT)=\operatorname{tr}(DU^*AU)\),\(D\) 为适当对角酉阵。
- 2.4.P12(交换子 \(C=AB-BA\) 相关):(b) 可设 \(A,B\) 上三角、\(C\) 严格上三角;(c) \(A=S\Lambda S^{-1}\),\(\Lambda=\lambda_1I_{n_1}\oplus\dots\) 互异,若 \(\Lambda\) 与 \(\mathcal C=S^{-1}CS\) 交换则 \(\mathcal C\) 块对角,而 \(\mathcal C=\Lambda\mathcal B-\mathcal B\Lambda\) 对角块为零,故 \(C=0\);(f) \(C=0\) 或 \(\operatorname{rank}C=1\),用 Laffey 定理;(g) \(A,B,C\) 幂零但 \(B^2-C^2\) 不是,\(A+B\) 甚至非奇异;(h) \(A=\operatorname{diag}(e^{4i\theta},e^{2i\theta},e^{2i\theta})\)、\(B\) 为 3 阶循环置换、\(\theta=\pi/3\):\(C^3=0\) 而 \(AB\) 某特征值不是 \(e^{ik\theta}\) 形式。
- 2.4.P14:\(U_2\) 的列为 \(A^*\) 零空间的标准正交基,\(U=[U_1\ U_2]\),\(U^*AU=\begin{bmatrix}U_1^*AU_1&U_1^*AU_2\\0&0\end{bmatrix}\),再对 \(U_1^*AU_1=V\Delta V^*\) 做 Schur 分解,\(W=V\oplus I_{n-r}\)。2.4.P15(c):\(p_{A,I}(1,t)\) 是什么,为何 \(p_{A,I}(I,A)=0\)。2.4.P19:若 \(A,B\) 可同时上三角化,则对任何非交换二元多项式 \(p\),\(p(A,B)(AB-BA)\) 幂零(2.4.8.7)。2.4.P22:\(K_m=[\sum_k\nu_k\mu_k^{i+j-2}]=\sum\nu_kv_k^{(m)}(v_k^{(m)})^T\)(Hankel 矩阵的 Vandermonde 分解),\(\operatorname{rank}K_m\le d\),\(K_d\) 非奇异 ⇒ \(\operatorname{rank}K_m\ge d\)。2.4.P27:取 \(p(t)=p_{CB}(t)\)。2.4.P28:0.4.6(e)。2.4.P31:此时 \(p_A(t)\) 为何。2.4.P33:仿 2.4.6.1,\(A=SDS^{-1}\),\(D=A_{11}\oplus A_{22}\),\(S=\begin{bmatrix}I_k&S_{12}\\0&I_{n-k}\end{bmatrix}\),\(C=S^{-1}BS\),\(C^p=D\) ⇒ \(D\) 与 \(C\) 交换 ⇒ \(C\) 块对角。2.4.P35:\(\mathbf F=\mathbf C\) 取 \(U=\operatorname{diag}(e^{i\theta_1},\dots)\);\(\mathbf F=\mathbf R\) 取 \(\operatorname{diag}(\pm1)\)(\(n-1\) 个同号、1 个异号);并考虑 \(\begin{bmatrix}0&1\\1&0\end{bmatrix}\oplus I_{n-2}\) 的变形。
- 2.5 节:P18 考虑 \(A=\begin{bmatrix}0&1\\2&0\end{bmatrix}\) 与 \(A^2\);P20 正规矩阵 \(\|(A-\lambda I)x\|_2=\|(A-\lambda I)^*x\|_2\)(故 \(A\) 与 \(A^*\) 特征向量相同);P26(h) 都是经典多项式插值问题(0.9.11.4);P27:(a) 2.5.16,\((AB^*)A=A(B^*A)\);(b) \(B=A\bar A\) 的正规性推导;P28(b) \((AB)A=A(BA)\);P31 用 2.5.8;P33:\(U\) 同时对角化族 \(\mathcal F\),\(B=U\operatorname{diag}(1,\dots,n)U^*\),Lagrange 插值多项式 \(p_\alpha(k)=\lambda_k^{(\alpha)}\) 使 \(A_\alpha=p_\alpha(B)\)(交换正规族都是同一矩阵的多项式);P35:\(xx^*=yy^*\)、\(x_k\ne0\) ⇒ \(x_j=\overline{(y_k/x_k)}y_j\);\(AA^*=A^*A\Leftrightarrow uu^*=vv^*\);P43 用正规性亏量(defect from normality,2.5.P42);P44(b) \(\operatorname{tr}(A^2B^2)=\operatorname{tr}((AB)(AB)^*)\);P46 实 \(A\) 的 Schur 形 \(T\) 与 \(\bar T=U^TA\bar U\) 对角元集合相同(非实特征值成共轭对);P49 \(A=S\Lambda S^{-1}\),\(S=RQ\),则 \(R^{-1}AR\) 正规;P57 用 2.5.17 判断哪些块(反)对称;P60 \(x^T(ne_j-e)=nx_j\) 用 Cauchy–Schwarz;P67 \(\Lambda=\Lambda_r\oplus0\),\(\Lambda B=0\) ⇒ \(B_{11}=B_{12}=0\) ⇒ \(B_{21}=0\) ⇒ \(B\Lambda=0\);P68 \(A\) 酉相似于 \(A_r\oplus0_{n-r}\),\(A_r\) 非奇异;P69 比较 \(M_AW=WM_B\) 的分块,从 \((k,1)\) 块开始向右再逐行上移;P74 考虑 \(A=\begin{bmatrix}0&i\\i+1&0\end{bmatrix}\)、\(B=A^T\)、\(X=\operatorname{diag}(i,i+1)\)。
- 2.6 节(SVD):P3(\(\Sigma B^*\)、\(B^*\Sigma\) 正规时的同时 SVD):设 \(A=\Sigma\),\(\Sigma\Sigma^TB=B\Sigma^T\Sigma\),\(\Sigma=[\Sigma_q\ 0]\),\(\Sigma_q=s_1I_{n_1}\oplus\dots\oplus s_dI_{n_d}\),推出 \(B_1\) 块对角且各块正规,\(s_d=0\) 时对 \([B_{dd}\ C]\) 做 SVD;P8 \(\operatorname{rank}AB=\operatorname{rank}\Sigma W^*B\) 且 \(\Sigma W^*B\) 至多 \(\operatorname{rank}A\) 个非零行;P9 \(D=\Sigma_1\oplus I_{n-r}\),\((AWD^{-1})^*(AWD^{-1})=I_r\oplus0\),故 \(AWD^{-1}=[V_1\ 0]\);P13 只需考虑 \(A=\Sigma\);P14(b) \(A\) 正规 ⇔ \(\Sigma^2\) 与 \(W^*V\) 交换;P19(CS 分解相关):比较 \(U^*U=I\)、\(UU^*=I\) 的对角块,\(U_{11}U_{11}^*=I_k-U_{12}U_{12}^*\) ⇒ \(\sigma_i^2(U_{11})=1-\sigma_{k-i+1}^2(U_{12})\);P21 复对称矩阵的 Takagi 型结论(\(A=U\Sigma U^T\),\(\Sigma\bar{\mathcal B}\) 正规且 \(\mathcal B\) 对称 ⇒ 块对角,用 2.5.P57、2.6.6a)。
- 2.6 节(续):P25 \(A=V\Sigma W^*\),\(\Sigma=\Sigma_r\oplus0\),写 \(A=V\Sigma(W^*V)V^*\) 并分块 \(W^*V=\begin{bmatrix}K&L\\M&N\end{bmatrix}\);P26 \(L=0\Rightarrow M=0\Rightarrow K\) 酉;P28 \(W_1=V_1U\) ⇒ \(A=V\begin{bmatrix}\Sigma_1U&0\\0&0\end{bmatrix}V^*\);P32 考虑 \(\begin{bmatrix}0&I_n\\I_n&0\end{bmatrix}\mathcal A\) 并用 2.6.P7;P33 \(C_r(V\Sigma W^*)=C_r(V)C_r(\Sigma)C_r(W)^*\)(复合矩阵的奇异值是奇异值的 \(r\) 元乘积);P35 对 \(A-(\frac1n\operatorname{tr}A)I\) 用 2.6.9。
- 2.7 节(CS 分解 / 压缩的酉扩张):P1 置换并分块;P2:\(m=n\),\(A=V\Sigma W^*\),\(\Sigma=C\oplus I_{n-\nu}\),\(C=\operatorname{diag}(c_j)\),\(c_j\in[0,1)\),\(S=\operatorname{diag}((1-c_j^2)^{1/2})\),则
\[(V_1\oplus V)\begin{bmatrix}C&S&0\\-S&C&0\\0&0&I_{n-\nu}\end{bmatrix}(W_1\oplus W)^*\in M_{n+\nu}\]是 \(A\) 的酉扩张(unitary dilation);\(m\ne n\) 时补零块。P6(b):\(u_{12}\ne0\)、\(u_{12}/u_{21}=e^{i\phi}\) 时用 \(D=\operatorname{diag}(1,e^{i\phi/2})\) 做相似。
第 3 章
- 3.1.P12(e):两者都说明 Jordan 形中恰有 \(k\) 个大小 \(p\) 的块 \(J_p(\lambda)\)。3.1.P16–P20:分别用 3.1.18、3.1.P16、3.1.P17 与 1.3.22、3.1.18、1.3.P16。3.1.P22:(a) 存在正对角 \(D\) 使 \(DAD^{-1}\) 对称(三对角且 \(a_{i,i+1}a_{i+1,i}>0\)),再用 3.1.P21;(b) 扰动 + 连续性。3.1.P23:(a) 取正对角 \(D\) 使 \(DAD^{-1}\) Hermitian;(c) 考虑 \(iA\) 与 1.4.P4。3.1.P24(d):看 \(A,B\) 的有向图(6.2)。3.1.P26:只需证 \(A^2x=0\Rightarrow Ax=0\)(正规矩阵指标 \(\le1\)):\(0=\|A^2x\|^2=x^*A^*A^*AAx=x^*A^*AA^*Ax=\|A^*Ax\|^2\) ⇒ \(0=x^*A^*Ax=\|Ax\|^2\)。3.1.P27:\(A=S\Lambda S^{-1}=QR\Lambda R^{-1}Q^*\) ⇒ \(R\Lambda R^{-1}\) 正规且上三角,故对角。
- 3.2.P2:可设 \(A\) 为 Jordan 矩阵;若 \(A=J_k(\lambda)\oplus J_\ell(\lambda)\oplus J\),任意多项式 \(p(A)\) 前 \(k+\ell\) 个对角元都等于 \(p(\lambda)\),但 \(-I_k\oplus I_\ell\oplus I\) 与 \(A\) 交换却不是 \(A\) 的多项式(与 \(A\) 交换的矩阵都是 \(A\) 的多项式 ⇔ \(A\) 非减次 nonderogatory)。3.2.P3:1.3.P20(f)。3.2.P15:用前两题。3.2.P19:1.4.7。3.2.P20(a):3.2.11.1。
- 3.2.P24(\(AB-BA^T\) 型交换问题,Jacobson 引理的应用):(a) \(A^T=SAS^{-1}\),\(D=AB-B(SAS^{-1})\) ⇒ \(DS=A(BS)-(BS)A\),又 \(A(DS)=(DS)A\),由 Jacobson 引理(与 \(A\) 交换的交换子 \([A,X]\) 幂零)得 \(DS\) 幂零;(b) 可对角化情形 \(\mathcal D=0\);(c) \(D^2=A(BD)-(BD)A\) 且 \(AD^2=D^2A\) ⇒ \(D^2\) 幂零;(d) Jordan 形 \(J=J_{n_1}(\lambda_1)\oplus\dots\),\(\mathcal D_i=J_i\mathcal B_i-\mathcal B_iJ_i^T\),\(J_i^T=S_iJ_iS_i^{-1}\),再用 Jacobson 引理。3.2.P26:\((B-B^T)A=0\),\(\operatorname{rank}(B-B^T)\le1\),见 2.6.P27。3.2.P29(a):\(\operatorname{tr}C=0\) 或 Jacobson 引理。3.2.P31:(c') 存在非奇异 \(X\) 使 \(XA=A^TX\);(d') 非奇异 \(Y\) 使 \(YA_{11}^T=A_{11}Y\),\(C=Y\oplus0\);(f') \(B=CX\) 则 \(AB=BA\)。3.2.P32:可对角化情形见 2.4.P12(c);只需考虑 \(A=J_2(\lambda)\),用 3.2.4.2 证 \(C\) 严格上三角,进而 \(B\) 严格上三角。3.2.P33:用 2.3.1 酉相似成上三角,\(B\) 既是 \(A\) 的多项式又是 \(A^*\) 的多项式,故既上三角又下三角。3.2.P34(a):\(\bar A\)、\(A^T\) 都是 \(A\) 的多项式,故交换。3.2.P36(a):3.2.5.2。
- 3.3.P3:\(t^2-t\) 零化 \(A\)(幂等矩阵可对角化)。3.3.P10:余子式展开求行列式。3.3.P13:1.2.20。3.3.P19:设 \(C^{n-1}\ne0\),用 3.2.4.2。3.3.P22:3.2.P4。3.3.P26(f):\((\lambda_iI-A)q_i(A)=q_A(A)\)。3.3.P28:\(K^2=I\),极小多项式三种可能。3.3.P29:\(K=SDS^{-1}\),\(D=I_m\oplus(-I_{n-m})\),\(\mathcal A=S^{-1}AS\),\(KA\) 相似于 \(DA\),\(\mathcal A=D\mathcal AD\) ⇒ \(\mathcal A_{12}=\mathcal A_{21}=0\)。3.3.P30:\(T=iI_m\oplus I_{n-m}\),计算 \(T\mathcal BT^{-1}\)。3.3.P31:3.3.4。3.3.P33:对 \(p\) 的友矩阵用 Schur 不等式 2.3.2a(得根的模平方和上界)。
- 3.4.P1:\(A\) 的实 Jordan 形。3.4.P4:(a) 用 3.4.2.10 与 3.4.2.12;(b) \(w_i(A,\lambda_j)^2\ge w_i(A,\lambda_j)\)。3.4.P5:仿 3.4.3.3 用 3.4.3.1,酉 Weyr 形仍是 2×2 分块但 \(F_{12}\) 列满秩。3.4.P8(c):\(W\) 恰有 \(p\) 个对角块时分析 \(P^TWP\) 的前 \(p\) 行列、领先 \(p\times p\) 主子矩阵,以及 \(w_p(J,0)>1\) 或 \(=1\) 的情形。
第 4 章
- 4.1.P3:\(A=SBS^{-1}\)(\(A,B\) Hermitian)⇒ \(A=U\Lambda U^*\)、\(B=V\Lambda V^*\),故 \(U^*AU=\Lambda=V^*BV\)(相似的 Hermitian 矩阵酉相似)。4.1.P6:\(x^*Ax=0\ \forall x\) ⇒ \(A\) Hermitian(4.1.4),且每个特征值为 0,故 \(A=0\)。4.1.P9:\(|x^*Ax|=|x^*Bx|\) 型条件:取 \(x=e_i\)、\(y=e_j\) 得 \(|a_{ij}|=|b_{ij}|\);取 \(x=e_i\)、\(y=se_j+te_k\) 得 \(|sa_{ij}+ta_{ik}|^2=|sb_{ij}+tb_{ik}|^2\),从而 \(\operatorname{Re}(s\bar t[a_{ij}\bar a_{ik}-b_{ij}\bar b_{ik}])=0\),推出 \(a_{ij}/b_{ij}=a_{ik}/b_{ik}\)。4.1.P12:反例 \(\begin{bmatrix}0&1\\0&0\end{bmatrix}\)。4.1.P13:2.4.P2、4.1.P12。4.1.P18:2.5.P44。4.1.P19:\(x=(I-A)x+Ax\) 是零空间与值域向量之和;若二者正交则 \(x^*Ax=x^*(A^*A)x\) 实。4.1.P20:\((A-A^*)^3=0\) 且 \(A-A^*\) 正规 ⇒ \(A=A^*\)。4.1.P25:0.8.1、2.3.P12。
- 4.2.P3:取 \(x=e_i\)。4.2.P7(维数公式):\(X\in M_{n,p}\)、\(Y\in M_{n,q}\) 分别为 \(S_1,S_2\) 的基,\(Z=[X\ Y]\),\(\operatorname{rank}Z=\dim(S_1+S_2)\),\(\operatorname{rank}+\operatorname{nullity}=p+q\),只需证 \(\operatorname{nullity}Z=\dim(\operatorname{range}X\cap\operatorname{range}Y)\)。4.2.P8:\(x^*(A+B)x=x^*Ax+x^*Bx\ge x^*Ax\)(\(B\) 半正定,特征值单调性)。
- 4.3 节:P5 用交错;P6 考虑 \(\begin{bmatrix}0&i&1\\-i&0&1\\1&1&0\end{bmatrix}\);P8 用 4.3.48、4.3.49 或定义;P9 取 \(x=e\) 与 \(x=e_i\);P12:\(\sum_{i,j\le m}|b_{ij}|^2\le\sum|b_{ij}|^2+\sum|c_{ij}|^2\le\sum_{i\le m}R_i^2\le\sum_{i\le m}\sigma_i^2\),若 \(\sum\sigma_i^2=\sum|b_{ij}|^2\) 则 \(\sum|c_{ij}|^2=0\)(Ky Fan 型等号情形);P14、P29 用准线性化 4.3.39;P15(b) \(X=VR\),\(\det X^*X=\det R^*R\);P16 (a) \(A=U^*\Lambda U\),\(\Lambda=\lambda_1I+(\lambda_2-\lambda_1)E_{22}\),\(a_{12}=(\lambda_2-\lambda_1)\bar u_{21}u_{22}\),(b) 交错;P17 (a) 看 \(Ax=\lambda x\) 第 \(n\) 个分量,(f) \(p_n(\lambda)=p_{n-1}(\lambda)=0\Rightarrow\dots\Rightarrow p_0(\lambda)=0\)(三对角矩阵特征值的 Sturm 序列论证,矛盾说明特征值简单);P19 计算 \(\operatorname{tr}(A+zz^*)\);P20 1.2.P13;P21 特征值交错;P22 为何 \(\operatorname{rank}A\le2\),\(a_i\ne a_j\) 时主子矩阵 \(\begin{bmatrix}2a_i&a_i+a_j\\a_i+a_j&2a_j\end{bmatrix}\) 一正一负特征值(行列式 \(-(a_i-a_j)^2<0\)),对比 1.3.25;P23 考虑 \(A=\operatorname{diag}x\)、\(B=\operatorname{diag}y\);P25 (a) \(AA^*\) 的元素,(b) 对 \(AA^*\) 用 4.3.P17;P30:\(U_{ii}^*A_{ii}U_{ii}=\Lambda_i\),\(U=\oplus U_{ii}\),\(d(A)\) 被 \(\lambda(A_{11}\oplus\dots\oplus A_{kk})=d(U^*AU)\) 优超,而 \(d(U^*AU)\) 被 \(\lambda(A)\) 优超(Schur 优超定理的分块推广)。
- 4.4 节(复对称矩阵、Takagi 分解):P1 用 4.4.4c,\(S=U\Sigma^{1/2}\);P4 \(A=Q\Lambda Q^T\)(实),\(\Lambda=\Sigma D^2\),\(U=QD\),何时 \(A=U\Sigma U^T\) 的因子可全取实;P5 \(W=U^*V\) 按 \(\Sigma\) 分块,\(\Sigma\bar W=W\Sigma\) ⇒ \(s_iW_{ij}=s_j\bar W_{ij}\) ⇒ \(s_i\ne0\) 时 \(W_{ii}\) 实且 \((s_i-s_j)\operatorname{tr}W_{ij}W_{ij}^*=0\);P6 考虑 \(p_{A\bar A}\) 的判别式 \(r(A)=(\operatorname{tr}A\bar A)^2-4|\det A|^2\) 符号,\(A\bar A\) 有两个负特征值时 \(\operatorname{tr}A\bar A<0\),特征值之积为 \(|\det A|^2\);P9(b) 4.4.P1;P19 用 4.4.10 表示与 Schur 不等式、4.4.11a,b、4.4.12a,b 证 \(\operatorname{tr}AA^*\ge\operatorname{tr}\Delta\Delta^*+\sum\operatorname{tr}\Gamma_{jj}\Gamma_{jj}^*\ge\operatorname{tr}\Delta\bar\Delta+\operatorname{tr}\Gamma\bar\Gamma=\operatorname{tr}A\bar A\);P22 3.3.P28;P23 0.9.8;P24 1.4.12(a)/(b) 或 2.4.11.1(b);P26 \(Q\) 复正交、\(A=QBQ^T\) 时每个字 \(W(A,A^*)=W(A,A^T)\) 经 \(Q\) 相似于 \(W(B,B^T)=W(B,B^*)\),用 2.2.6 与 2.5.21;P28 \(\det(I+X)=\prod(1+\lambda_i(X))\) 与 4.4.13;P29 (b) 0.8.5.1、上题及连续性,(e) 3.4.1.7,(f) 3.2.P30;P30 \(SAS^{-1}=SBS^TS^{-T}CS^{-1}\);P31 4.4.25;P32 3.2.3.1 与 3.2.11;P33(b) 证两条件的否定互推,用 3.1.P12;P35 2.5.3 与 2.5.14;P38(d) 1.3.P19;P39 \(A=B\Lambda B^{-1}=B^{-T}\Lambda B^T\) ⇒ \(B^TB\Lambda=\Lambda B^TB\) ⇒ \(S\Lambda=\Lambda S\) ⇒ \(A=Q\Lambda Q^T\)(可对角化的复对称矩阵可复正交对角化);P44(a) \(A\bar A=AA^*\) 对 4.4.31 分块意味着什么;P45 4.4.22;P46(b) 2.5.P69–P70;P47(a) 按 2.5.P69(a) 的提示;P48 2.5.10。
- 4.5 节(合同 / *合同、惯性):P2 4.4.19;P4:用 1.3.2 与 4.5.17(a) 证明;\(SA_1^{-1}A_iS^{-1}\) 都实对角,令 \(B_i=S^{-*}A_iS^{-1}\) 为交换 Hermitian 族,存在酉 \(U\) 使 \(UB_iU^*\) 都对角,\(T=US\) 给出所需 *合同(同时 *合同对角化);P10 由 4.5.P9(c),\(A=U(B\oplus0)U^*=U_1BU_1^*\),取置换 \(P\) 使 \(PU_1=\begin{bmatrix}X\\Y\end{bmatrix}\),\(X\) 非奇异,求 \(PAP^T\);P11 (a) 为何 \(0_{n-r}\) 是关于 *合同的奇异部分、\(\Lambda\) 是正则部分,\(\Lambda\) 的 *余平方(cosquare)是什么,(b) 用酉 *合同对角化并用 4.5.21 的唯一性;P13 酉矩阵的 Jordan 形与 *合同典范形;P14 (b) \(Ax=0\) ⇒ \(H^{-1}Kx=ix\),(c) 4.5.23;P18 \(A^{-1}B\) 的特征值;P20(d):连续函数 \(a_{n-r}(A)\) 在连通集 \(\mathcal S\) 上符号不变;若 \(A,B\in\mathcal S\) 惯性不同,取连续路径 \(f:[0,1]\to\mathcal S\),考虑 \(g(t)=a_{n-r}(f(t))\)(介值定理);P22:若交错不等式 4.3.18 不成立,取最小 \(k\) 使 (a) \(\lambda_k(A)>\lambda_k(B)\) 或 (b) \(\lambda_k(B)>\lambda_{k+1}(A)\);对 (a) 取 \(\alpha\in(\lambda_k(B),\lambda_k(A))\),\(B-\alpha I\) 非奇异,由 Haynsworth 定理 \(i_-(A-\alpha I)\ge i_-(B-\alpha I)\),而 \(A-\alpha I\) 只有 \(k-1\) 个负特征值、\(B-\alpha I\) 至少 \(k\) 个,矛盾;P26 用 4.5.27 及其前的练习,\(H_{2k}(\mu)\) 与 \(H_{2k}(\bar\mu)\) 的余平方相似 ⇔ \(\mu=\bar\mu\) 或 \(\mu=\bar\mu^{-1}\);P31 \(A\) 非奇异且 *合同于实矩阵 ⇒ \(A^{-*}A\) 相似于实矩阵;P33 \(J_k(0)\) 用 3.2.3,\(\Gamma_k\)、\(H_{2k}(\mu)\) 用 4.5.27;P34 \(J_k(\mu)^T=SJ_k(\mu)S^{-1}\),\(\mathcal S=\begin{bmatrix}0_n&S^*\\S^{-1}&0_n\end{bmatrix}\) 则 \(\mathcal SH_{2k}(\mu)^T\mathcal S^*=H_{2k}(\mu)\)。
- 4.5.P36(c)(若 \(x^*Ax=0\Rightarrow x^*Bx=0\),则 \(B\) 是 \(A\) 的实倍数一类结论):由 4.5.7 化为 \(A=I_{i_+}\oplus(-I_{i_-})\oplus0_{i_0}\),\(i_+i_->0\),指标集 \(\alpha,\beta,\gamma\)。用模 1 的可调参数 \(c,d\) 选取一系列使 \(x^*Ax=0\) 的测试向量:(1) \(x=e_1+ce_j\)(\(j\in\beta\))得 \(b_{jj}=-b_{11}\);\(x=e_i+ce_j\) 得 \(b_{ij}=0\)、\(b_{ii}=b_{11}\),于是 \(B[\alpha,\beta]=0\)、\(\operatorname{diag}B[\alpha]=b_{11}e\)、\(\operatorname{diag}B[\beta]=-b_{11}e\);(2) \(x=e_k\)(\(k\in\gamma\))得 \(b_{kk}=0\),\(x=e_i+ce_j+de_k\) 得 \(|b_{ik}|=\pm|b_{jk}|\),进而 \(B[\alpha,\gamma]=B[\beta,\gamma]=0\);(3) \(|\gamma|>1\) 时 \(x=e_i+ce_j\)(\(i,j\in\gamma\))得 \(B[\gamma]=0\);(4) \(|\alpha|>1\) 时 \(x=3e_i+4ce_j+5e_k\) 得 \(B[\alpha]=b_{11}I_{i_+}\);(5) \(|\beta|>1\) 时 \(x=5e_i+3e_j+4ce_k\) 得 \(B[\beta]=-b_{11}I_{i_-}\)。结论 \(B=b_{11}A\)。
- 4.6 节(\(A\bar A\)、反线性 / 共轭相似、复对称的 coninvolutory 等):P3 若 \(z=\sum c_kx_k=0\) 则 \(A\bar z=\lambda\sum\bar c_kx_k=0\),从而实部、虚部组合分别为零(\(\mathbf C\) 上与 \(\mathbf R\) 上线性无关的关系);P6 4.4.4(c);P7 用 4.6.9 表示;P9 为何 \(A\bar A\) 至少有一个非负特征值;P14 \(\mu\ne0\) 时考虑 \(H_{2k}(\mu)^{-1}\overline{H_{2k}(\mu)}\);P16 (a) \(A\bar Az_j=?\),(b) 看 Type I 块,(c) \(\mathbf C\) 上无关 ⇒ \(\mathbf R\) 上无关,(d) 此情形下(一般不成立)反之亦然;P17 线性系统 \(A\bar x_1=Xb_1\) 的相容性(0.4.2)与唯一性;P18(f) \(g\) 等于 \(\sigma^2\) 作为 \(R_2(A)^2\) 特征值几何重数的一半,即 \(\sigma^2\) 作为 \(A\bar A\) 特征值的几何重数;P19 1.3.P21(m)(c) 与 4.6.18;P21 4.6.11、4.6.7、4.6.P17、P20;P24(b) 1.3.P19;P26 \(D^2\Delta=\Delta\bar\Delta\Delta=\Delta(\overline{\Delta\bar\Delta})=\Delta D^2\)(注:原书写法以共轭记号表示);P27(a) 从 4.6.3 出发,若 \(A\) 酉合同于 \(\Delta\),正规性保证 \(\Delta\) 块对角,分 \(\Delta_j\bar\Delta_j=0\) 与 \(\Delta_j\bar\Delta_j=\lambda I_{n_j}\)(\(\lambda>0\))两种情形。
第 5 章(范数)
- 5.1.P4(a):用内积表达 5.1.9 的四项(极化恒等式)。5.1.P10:\(\|\vec0\|=\|0\vec0\|=0\);\(0=\|x-x\|\le2\|x\|\) ⇒ 非负性(范数公理中非负性可由其余公理推出)。5.1.P14(样本偏离均值的界):\(\sum(x_i-\mu)=0\) ⇒ \((x_j-\mu)^2=(\sum_{i\ne j}(x_i-\mu))^2\le(n-1)\sum_{i\ne j}(x_i-\mu)^2=n(n-1)\sigma^2-(n-1)(x_j-\mu)^2\),故 \(|x_j-\mu|\le\sqrt{n-1}\,\sigma\)(\(\sigma^2\) 为总体方差 \(\frac1n\sum(x_i-\mu)^2\))——即 Samuelson 不等式。
- 5.2.P6:2.1.13。5.2.P7:(a) \(\|x\|\,\big\|\frac x{\|x\|}-\frac y{\|y\|}\big\|\le\|x-y\|+|\|y\|-\|x\||\le2\|x-y\|\)(Massera–Schäffer 型不等式);(c) 内积范数下 \(\|x\|\|y\|\big\|\frac x{\|x\|}-\frac y{\|y\|}\big\|^2=\|x-y\|^2-(\|x\|-\|y\|)^2\),并推出更精细的估计。5.2.P9:考虑单位向量 \(u(t)=(b-a)^{-1/2}\),\(\lambda=(b-a)^{1/2}(\alpha+\beta)/2\)、\(\mu=(b-a)^{1/2}(\gamma+\delta)/2\)。5.2.P11:设 \(\|x\|\le\|y\|\),把 \(x+y\) 写成 \(\frac{\|x\|}{\|x\|}x+\frac{\|x\|}{\|y\|}y+(1-\frac{\|x\|}{\|y\|})y\) 得上界 \(\|x\|+\|y\|+\|x\|(\|\frac x{\|x\|}+\frac y{\|y\|}\|-2)\),类似得下界。5.2.P12:由 5.2.16,\(\max\{\|x\|,\|y\|\}\|\frac x{\|x\|}-\frac y{\|y\|}\|\le\|x-y\|+|\|x\|-\|y\||\)。5.2.P13(a):为何 \(\langle H,iK\rangle_F+\langle iK,H\rangle_F=0\)(Hermitian 部分与反 Hermitian 部分 Frobenius 正交)。
- 5.3.P2:考虑 \(y=e_2\)、\(z=e_1\)。
- 5.4.P3(\(\ell_p\) 范数比较):\(0<p_1<p_2\),由 Hölder:\(\|x\|_{p_1}^{p_1}=\sum|x_i|^{p_1}\le(\sum|x_i|^{p_2})^{p_1/p_2}(\sum1)^{(p_2-p_1)/p_2}=n^{(p_2-p_1)/p_2}\|x\|_{p_2}^{p_1}\),即 \(\|x\|_{p_2}\le\|x\|_{p_1}\le n^{1/p_1-1/p_2}\|x\|_{p_2}\)(前一不等式即附录 B 的 (B11))。5.4.P4:\(f(x)=1/\|x\|_\alpha\) 在 \(\|\cdot\|_\beta\) 单位球面上若无界则与范数等价矛盾。5.4.P8:\(1<k<n\) 时化为在 \(y_1\ge\dots\ge y_n\ge0\)、\(x_1\ge\dots\ge x_k\ge0\)、\(x_k=\dots=x_n\)、\(\sum_{i\le k}x_i=1\) 下最大化 \(\sum x_iy_i\);令 \(x_i=x_k+t_i\),目标在凸集 \(\mathcal S=\{kx_k+t_1+\dots+t_{k-1}=1,\ \ge0\}\) 的极点取最大:\(x_k=1/k\)、\(t_i=0\),或 \(x_k=0\)、某 \(t_i=1\)(向量 \(k\)-范数的对偶范数计算)。5.4.P9:5.4.13、5.4.14 配合 \(A=\begin{bmatrix}1&-1\\0&1\end{bmatrix}\)、\(\|x\|=\|Ax\|_1\)。5.4.P12:\(\|A^*y\|^D=\max_{\|x\|=1}|y^*Ax|=\max_{\|A^{-1}z\|=1}|y^*z|=\|y\|^D\)。5.4.P13(\(\ell_p\) 等距同构,\(p\ne2\)):等距 \(A\) 满足 \(\|Ae_j\|_p=1\) ⇒ \(\sum_i|a_{ij}|^p=1\)、\(|a_{ij}|\le1\)、\(\sum_{i,j}|a_{ij}|^p=n\);对 \(A^*\) 与对偶指数 \(q\) 同理 \(\sum|a_{ij}|^q=n\);但 \(|a_{ij}|^q\le|a_{ij}|^p\) 等号仅当 \(a_{ij}\in\{0\}\cup\{|a|=1\}\),所以每列恰一个单位模非零元——\(\ell_p\)(\(p\ne2\))的等距矩阵是广义置换矩阵(置换 × 单位模对角)。5.4.P18:考虑连续函数 \(\det Y\),\(Y=[y_1\dots y_n]\)。
- 5.5.P8:5.4.16 与 5.5.14。5.5.P10:5.4.22 与对偶定理。5.5.P11:\(\|[x_1\dots\alpha x_k\dots x_n]^T\|=\|(1-\alpha)[\dots0\dots]^T+\alpha x\|\le\|x\|\)(单调范数相关,\(0\le\alpha\le1\))。
- 5.6 节(矩阵范数):P7 \(\max_kN_k(A)=N_j(A)\) 时 \(\|AB\|\le(\max_kN_k(A))\|B\|\le\dots\le\|A\|\|B\|\);P9 考虑 \(N_1=\|\cdot\|_1\)、\(N_2=\|\cdot\|_2\)、\(A=\begin{bmatrix}0&1\\0&1\end{bmatrix}\)、\(B=A^T\);P10:(a) 诱导范数特征的推导;(d) \(|\det B|\le\rho(B)^n\);(g) \(|\det(AD_A^{-1})|\le1\) 只需 \(\rho(AD_A^{-1})\le1\),但非必要:\(A=\begin{bmatrix}1&1\\1&2\end{bmatrix}\) 时 \(\rho(AD_A^{-1})\approx1.37\),而 \(1=|\det A|\le\|a_1\|_2\|a_2\|_2=\sqrt{10}<\|a_1\|_1\|a_2\|_1=6\)(Hadamard 型列范数积不等式);P12(a) Hermitian 矩阵特征值与奇异值关系,\(A-\frac12\|A\|_2I\) 的特征值在 \([-\frac12\|A\|_2,\frac12\|A\|_2]\);P17 级数中仅三项非零;P18 选对角 \(D\) 使 \(DA\) 对角全为 1;P19(c) 考虑 \(\begin{bmatrix}0&1\\0&0\end{bmatrix}\) 等四个 2×2 矩阵;P20 Frobenius 范数酉不变且单调,\(\|\Sigma C\|_2^2=\sum|\sigma_ic_{ij}|^2\le\sigma_1^2\sum|c_{ij}|^2\);P21 \(\rho(AA^*)\le\|AA^*\|\);P22 关于 \(\|A\|^D\) 与 \(\|I\|\) 的对偶论证(\(\|I\|\ge1\) 对任何矩阵范数)。
- 5.6.P23(\(M_n\) 上六个常用范数之间的最佳常数表):记 (1) \(\|A\|_1\) 最大列和;(2) \(\|A\|_2\) 谱范数;(3) \(\|A\|_\infty\) 最大行和;(4) \(\|A\|_1\) 元素绝对值和(\(\ell_1\));(5) \(\|A\|_2\) Frobenius;(6) \(\|A\|_\infty\) 最大元素模。提示逐项给出 \(\|A\|_\alpha\le C_{\alpha\beta}\|A\|_\beta\) 的推导与取等矩阵(\(I\)、\(J=ee^T\)、\(A_1=ee_1^T\)(第一列全 1)、\(E_{11}\))。代表性的:最大列和 \(\le\ell_1\le n\cdot\)最大行和(取等 \(A_1\));\((\text{最大列和})^2\le\sum_j(\sum_i|a_{ij}|)^2\le n\|A\|_F^2\)(Cauchy–Schwarz,取等 \(A_1\));最大列和 \(\le n\max|a_{ij}|\)(取等 \(J\));\(\sigma_1\le\|A\|_F\)(取等 \(A_1\));\(\ell_1\le n\cdot\)最大列和(取等 \(I\));\((\ell_1)^2\le n^2\|A\|_F^2\) 由 AM–GM(取等 \(J\));\(\ell_1\le n^2\max|a_{ij}|\)(\(J\));\(\|A\|_F^2\le n(\max\text{列和})^2\)(\(I\));\(\|A\|_F^2=\operatorname{tr}A^*A=\sum\sigma_i^2\le n\sigma_1^2\)(\(I\));\(\|A\|_F^2\le(\ell_1)^2\)(\(E_{11}\));\(\|A\|_F^2\le n^2\max|a_{ij}|^2\)(\(J\));\(\max|a_{ij}|\le\) 最大列和(\(I\));\(\max|a_{ij}|^2\le\max_i(A^*A)_{ii}\le\rho(A^*A)\)(4.2.P3,\(I\));\(\max|a_{ij}|\le\ell_1\)、\(\max|a_{ij}|^2\le\|A\|_F^2\)(\(E_{11}\));(4,2) 用 Fourier 矩阵(2.2.P10)取等。其余项由对称性(\(A\mapsto A^*\),5.6.21)或两步复合得到。
- 5.6 节(续):P24 \(\operatorname{rank}A\) = 非零奇异值个数,\(\|A\|_F=(\sum\sigma_i^2)^{1/2}\);P25 用 2.2.9 与 0.9.6.3,\(C_n\) 酉;P26:\(\rho(A)<1\) 时 Neumann 级数 \(I+A+A^2+\dots\) 收敛到 \((I-A)^{-1}\);P36 \(\|\hat A\|_2=\rho(\hat A^*\hat A)^{1/2}\);P37 考虑 \(\begin{bmatrix}1&0\\1&0\end{bmatrix}\)、\(\begin{bmatrix}0&1\\0&0\end{bmatrix}\) 与平行四边形恒等式;P38:(⇒) \(B=A/\|A\|\),\(\|B^m\|\) 有界,若 \(B\) 有 \(J_k(e^{i\theta})\)(\(k>1\))块则其幂无界;(⇐) 非数量阵时用 3.1.21 与范数 \(\|X\|=\|S(\varepsilon)^{-1}XS(\varepsilon)\|_\infty\)(\(0<\varepsilon<\max\{\rho(A)-|\lambda|\}\))——"存在矩阵范数使 \(\|A\|=\rho(A)\)" 的刻画;P39(b) Schur 三角化 \(A/\rho(A)=UTU^*\),模小于 1 的特征值排前,谱范数为 1 则每列欧氏范数 \(\le1\),看含模 1 对角元的列;(c) 见 5.6.9 后练习;P40 \(\|Ax\|_2=\||Ax|\|_2\le\||A||x|\|_2\le\|B|x|\|_2\)(\(|A|\le B\) 时谱范数单调);P41 绝对范数 / 单调范数下 \(\||A|\|\) 与 \(\|A\|\) 的关系,\(\||A|\|_2\le\|A\|_F\) 类结论;P43 \(T\) 对角元 \(\lambda_i\) ⇒ \(e^T\) 对角元 \(e^{\lambda_i}\)(\(\det e^A=e^{\operatorname{tr}A}\));P44 考虑矩阵范数 \(n\|\cdot\|_\infty\);P47:\(B=A-(A-B)=A(I-A^{-1}(A-B))\) 奇异 ⇒ \(\|A^{-1}(A-B)\|\ge1\)(到奇异矩阵的距离 \(\ge1/\|A^{-1}\|\));P48(c) 5.6.55;P56 \(\|A\|_2^2=\rho(A^*A)\le\|A^*A\|\le\|A\|^2\);P58(b) \((AB)^*(AB)=(A^*B)^*(A^*B)\) 且 \(\|\cdot\|_2\) 自伴。
- 5.7 节(广义矩阵范数、谱半径函数 \(m(G)\)、数值半径):P3 若 \(Ax=\lambda x\) 考虑 \(G(A^kxe^T)\),(c) 用向量范数讨论矩阵幂级数收敛;P11(b) 前题说明 \(r(J_2(0))r(J_2(0)^T)\ge1\) 是相容的必要条件;P16 (a) \(N\) 相似于 \(2N\)(幂零),(b) 零对角 \(B\) 是幂零矩阵的线性组合故 \(G(B)=0\),用 2.2.3 与 5.1.2 得 \(G(A)=G((n^{-1}\operatorname{tr}A)I_n+B)=n^{-1}|\operatorname{tr}A|G(I_n)\)(相似不变的广义范数只能是 \(|\operatorname{tr}|\) 的倍数,故不存在相似不变的矩阵范数);P19:需证 \(m(\alpha G_1+(1-\alpha)G_2)\le\alpha m(G_1)+(1-\alpha)m(G_2)\),即 \(\max\frac{\rho(A)}{\alpha G_1(A)+(1-\alpha)G_2(A)}\le\dots\),归结为 \(f(x)=x^{-1}\) 的凸性 \((\alpha a+(1-\alpha)b)^{-1}\le\alpha/a+(1-\alpha)/b\);P20(d) \(A=H(A)+iK(A)\),\(\|A\|_2\le\|H\|_2+\|K\|_2=r(H)+r(K)\le r(A)+r(A^*)=2r(A)\)(谱范数 \(\le2\times\)数值半径),(e) 用 \(E_{11}\)、\(J_2(0)\) 的 \(n\) 阶版本说明常数最优;P23 Cauchy–Schwarz 或 5.6.41(a);P25(b) \(p(z)=\frac1m\sum_j(1-z^m)/(1-w_jz)\) 次数 \(\le m-1\) 且 \(p(z)=p(w_jz)\),故为常数 \(p(0)=1\)(\(w_j\) 为 \(m\) 次单位根)。
- 5.8.P7:考虑 \(A=\lambda I\)。5.8.P14:3.3.17。
第 6 章(特征值的定位与扰动)
- 6.1.P3(Hadamard 型行列式界):若某列 \(a_j=0\) 无需证明;否则 \(B=A\operatorname{diag}(\|a_1\|_1,\dots,\|a_n\|_1)^{-1}\),由 6.1.5 得 \(\rho(B)\le1\),故 \(|\det B|\le1\),即 \(|\det A|\le\prod\|a_j\|_1\)。6.1.P4:对 \(\lambda I-A\) 用 6.1.10a(对角占优非奇异)。6.1.P6:对主子矩阵用 6.1.10 与 0.4.4d。6.1.P9:推论 6.1.5。6.1.P10(秩的下界):\(\operatorname{rank}A=\operatorname{rank}(AD)\),可设 \(a_{ii}\ge0\)、列 \(\ell_1\) 范数为 0 或 1,此时特征值都在单位圆盘内,\(\sum a_{ii}=\sum\lambda_i\le\sum|\lambda_i|\le\) 非零特征值个数 \(\le\operatorname{rank}A\)——即 \(\operatorname{rank}A\ge\sum_i|a_{ii}|/\|a_i\|_1\)。6.1.P11:类似地可设 \(\|a_i\|_2\in\{0,1\}\),证 \(\operatorname{rank}A\ge\sum|a_{ii}|^2=\sum|e_i^*a_i|^2\):取 \(\operatorname{span}\{a_i\}\) 的标准正交基 \(v_1..v_k\),\(a_i=\sum_j(v_j^*a_i)v_j\),由 Cauchy–Schwarz \(\sum_i|e_i^*a_i|^2\le\sum_i\sum_j|e_i^*v_j|^2=k\)。6.1.P13:取实正交对角 \(D\) 使 \(DA\) 对角为正,用 6.1.10(b)。6.1.P16(b):\(|a^{-1}|\sum|y_j|<1\) 等条件推出 Schur 补仍严格对角占优:\(\sum_{j\ne i}|c_{ij}|=\sum_{j\ne i}|b_{ij}-a^{-1}x_iy_j|\le\sum_{j\ne i}|b_{ij}|+|x_i|(|a^{-1}|\sum|y_j|)\);(c) Schur 补的唯一性 0.8.5(a)。6.1.P18:选置换 \(P_1\) 把第一列模最大元放到 \((1,1)\),\(R_1=\begin{bmatrix}e^{i\theta}&z^*\\0&I_{k-1}\end{bmatrix}\) 使 \(P_1XR_1=\begin{bmatrix}\|x_1\|_\infty&0\\ *&X_2\end{bmatrix}\),仿 2.3.1 依次收缩,得 \(P\)、上三角 \(R\) 使 \(PXR\) 上三角且对角元为各列最大范数,令 \(Y=XR\)。6.1.P20:上一题。
- 6.2.P4:先处理无零元的 \(A\),再连续性论证。6.2.P5:\(a_0\ne0\) 时友矩阵 \(C(p)\)(3.3.12)不可约。6.2.P8:6.2.26 与 6.2.1a。
- 6.3.P1:对 \(B=\operatorname{diag}(a_{11},\dots,a_{nn})\)、\(E=A-B\) 用 6.3.5(Hoffman–Wielandt)。6.3.P3:(a) \(B\xi=\beta\xi\) 单位向量,\(x=\begin{bmatrix}\xi\\0\end{bmatrix}\),考虑残差 \(Ax-\beta x\);(b) 2.5.P37。6.3.P4:\(A\) 正规时 \(B=(A-\gamma I)^*(A-\gamma I)\) 的特征值为 \(|\lambda_i-\gamma|^2\);若对子空间 \(\mathcal S\) 中单位向量 \(x^*Bx\le\delta^2\),用 4.2.10(b)(Courant–Fischer)得至少 \(\dim\mathcal S\) 个特征值落在以 \(\gamma\) 为心、半径 \(\delta\) 的圆盘内。6.4.P7:6.4.7。
第 7 章(正定矩阵)
- 7.1.P1:7.1.2 与 7.1.5。7.1.P3:用适当对角矩阵做合同。7.1.P5:\(A\) 半正定 ⇒ \((\operatorname{tr}A)^2\ge\operatorname{tr}A^2\)。7.1.P7:\(\det[f(t_i-t_j)]\ge0\)(正定函数),(a) 取 \(n=1\),(b) \(n=2\),(c) \(n=3\) 得 \(f(0)\ge0\)、\(|f(t)|\le f(0)\) 等。7.1.P10:\(\cos t=(e^{it}+e^{-it})/2\)。7.1.P14:7.1.10。7.1.P15:考虑 \(t_1=0,t_2=-\tau,t_3=-t\) 的 \([f(t_i-t_j)]\)。7.1.P16:考虑 \(\int_0^\infty|\sum x_ke^{-\lambda_ks}|^2ds\ge0\)(Cauchy 型矩阵 \([1/(\lambda_i+\bar\lambda_j)]\) 正定);若 \(f(s)=\sum x_ke^{-\lambda_ks}\equiv0\),则 \(f(0)=f'(0)=\dots=f^{(n-1)}(0)=0\),得关于 \(x\) 的 Vandermonde 线性方程组,\(x=0\)。7.1.P18:(a) 上题;(b) 排序对应 min 矩阵的置换相似,(a) 的表示中部分加项为零;(c) 考虑 \([\min\{\beta_i^{-1},\beta_j^{-1}\}]\)。
- 7.1.P19:把积分写成 \([0,N]\) 上等距分划 Riemann 和的极限(积分核正定 ⇒ 离散矩阵正定)。7.1.P20:二重积分写成累次积分再分部积分。7.1.P21:(f) \(A^{-1}=(S^{-*})D^{-1}(S^{-*})^*\),或 \(A^{-*}\) *合同于 \(A=A^{-*}AA^{-1}\) 且 \(H(A^{-*})=H(A^{-1})\);(g) 直和项对应 *合同典范形中 Type 0、Type I 块的 Toeplitz 分解各种可能。7.1.P24:\(\operatorname{rank}A\le\operatorname{rank}[A_{11}\ A_{12}]+\operatorname{rank}[A_{12}^*\ A_{22}]=\operatorname{rank}[A_{11}\ A_{11}X]+\operatorname{rank}[A_{22}Y\ A_{22}]\)(半正定矩阵 \(A_{12}=A_{11}X\),秩不超过对角块秩之和)。7.1.P26:7.1.2 与 3.5.3。7.1.P27:(a) \(A=\begin{bmatrix}A_{11}&A_{11}X\\ \star&\star\end{bmatrix}\)、\(B=\begin{bmatrix}B_{11}&\star\\Y^*B_{11}&\star\end{bmatrix}\),\((AB)[\alpha]=A_{11}(I+XY^*)B_{11}\);\(A=B\) 时 \(X=Y\),\(I+XX^*\) 正定;(c) \(\operatorname{rank}A^{2^k}[\alpha]\le\operatorname{rank}A^k[\alpha]\le\operatorname{rank}A[\alpha]\)。7.1.P28:(b) \(X^*B=Y^*B\) ⇒ \(X^*BX=Y^*BX=Y^*BY\);(c) 取 \(X=B^{-1}C\)(Schur 补的极值刻画)。7.1.P29:\(A=S_1DS_1^*\)、\(B=S_2DS_2^*\),\(D=\operatorname{diag}(e^{i\theta_j})\),\(\theta_j\in(-\pi/2,\pi/2)\);\(D=\Gamma+i\Sigma\),\(\Gamma=\operatorname{diag}(\cos\theta_j)\)、\(\Sigma=\operatorname{diag}(\sin\theta_j)\);(b) 相似于 \(D^2\),在开右半平面有唯一平方根;(d) 相似于 \(T=\operatorname{diag}(\tan\theta_j)\)。
- 7.2 节:P6 交错——若 \(A\) 最小特征值为负,则其非零特征值比 \(B\) 多;P10 \(A^*=BAB^{-1}\)、\(B\) 正定 ⇒ \(B^{-1/2}A^*B^{1/2}=B^{1/2}AB^{-1/2}\)(Hermitian,故 \(A\) 相似于实对角);反之 \(A=S\Lambda S^{-1}\) 时 \(A=BA^*B^{-1}\),\(B=SS^*\);P11 (a) \(\operatorname{adj}(\operatorname{adj}A)=(\det A)^{n-2}A\)(原书印作 \(n+2\),疑误),(c) 2.5.P47 或 \(A_\epsilon=A+\epsilon I\),(d) \(n\ge3\)、\(\operatorname{rank}A\le n-2\) 时 \(\operatorname{adj}A=0\);P12(Markov 矩阵 \(M(r,n)=[r^{|i-j|}]\)):(a) \(i=1,j>2\) 时 \(M_{1j}\) 的第一列是第二列的倍数(余子式为零,逆矩阵三对角);(e) \(s=i/m\)、\(t=j/m\),\(f(s-t)=e^{-|i-j|/m}=r^{|i-j|}\),\(r=e^{-1/m}\in(0,1)\),取极限证 \(e^{-|t|}\) 正定;P13 由 7.2.P12(a) 及 \(MM^{-1}=I\) 定逆矩阵元素;P14(f) 仿 7.2.P12(e)(\(e^{-t^2}\));P15 用 \(A+cI_n\)、\(B+cI_{n+1}\) 化为半正定情形(仿 4.3.17 证明);P17 令 \(D=A^{1/2}+BA^{-1/2}\),计算 \(DD^*\);P18 \(B=A(I+(A^*A)^{-1})\);P19:(a) \(\|x\|_2^2=(A^{1/2}x)^*(A^{-1/2}x)\) 用 Cauchy–Schwarz 得 \((x^*Ax)(x^*A^{-1}x)\ge\|x\|^4\),(b) 取 \(x=e_i\) 得 \(a_{ii}(A^{-1})_{ii}\ge1\);P20(c) \(A=SBS^*\) ⇒ \(B^{1/2}AB^{1/2}=(B^{1/2}SB^{1/2})^2\);P21(a) 4.1.6;P22(d) 7.2.P21;P23(几何平均)(c) 上题,(e) \(GA^{-1}G=\bar A\) ⇒ \(\bar A=\bar GA^{-1}\bar G\),(f) \(GA^{-1}G=A^{-T}\) ⇒ \(A^{-T}=G^{-T}A^{-1}G^{-T}\);P24(b) 7.2.10;P26 Frobenius 内积的 Cauchy–Schwarz、5.4.P3 的表与 AM–GM;P27 \(\operatorname{tr}((\sum A_i)^*(\sum A_i))=\sum_{i,j}\operatorname{tr}(A_iA_j)\ge\sum\operatorname{tr}A_i^2\);P28(b) \(x_i=-\sum_{j\ne i}b_i^*b_jx_j\);P29(a) 7.1.P1;P30 (a) \(A^{-1/2}ABA^{1/2}=A^{1/2}BA^{1/2}\) 与 4.5.8,(b) 反例 \(A=\begin{bmatrix}1&0\\0&0\end{bmatrix}\)、\(C=\begin{bmatrix}0&1\\1&0\end{bmatrix}\);P33(b) 7.2.P30(c);P34(c) Frobenius 内积的 Cauchy–Schwarz;P36 (a) \(X^*RX\) 与 \(R^{1/4}XR^{1/2}X^*R^{1/4}\) 半正定,(e) 5.6.P58。
- 7.3 节(极分解、奇异值):P6(c) 考虑 \(\frac{d}{dt}\sigma_1(A(t_0)+tE)|_{t=0}\),\(E=0_n\oplus[1]\);P7(f)(Moore–Penrose 逆唯一性):若 \(X,Y\) 都满足 (a)–(c),则 \(X=X(AX)^*=XX^*A^*=X(AX)^*(AY)^*=XAY=(XA)^*(YA)^*Y=\dots=Y\);或写出 \(A^\dagger\) 的 SVD 证明三因子由 (a)–(c) 唯一确定;P11 \(|x^*Ay|\le\|x\|_2\|Ay\|_2\);P13 对 \(P\) 用谱定理;P14 \(A=S\Lambda S^{-1}\),\(S=PU\);P16 (c) \(A=\operatorname{diag}(1,0)\)、\(B=\operatorname{diag}(0,1)\),(d) \(\sigma_i(A)=\sigma_i((A+B)-B)\le\sigma_i(A+B)+\sigma_1(B)\)(Weyl 型奇异值扰动);P19(d) \(\Lambda,M\) 对角、\(U\) 酉时 \(\Lambda UM\) 与 \(\bar\Lambda U\bar M\) 对角酉等价;P22 2.4.P9;P23(a) 7.3.1;P25 (a) \(\operatorname{tr}(UA)=\sum u_{ij}a_{ji}\),(b) \(\operatorname{tr}\Sigma=\operatorname{tr}(V^*AW)=\operatorname{tr}(WV^*\Sigma)\)(\(\max_U\operatorname{Re}\operatorname{tr}(UA)=\sum\sigma_i\));P26(a) 用 \(p_A(A)=0\) 证 \((A^{1/2})^2=A\);P28(c) \(A=V\Sigma W^*\),分 \(A\) 非奇异与奇异两情形;P34 \(m\ge n\) 时 \(A^*A=R^*R\)(\(R\) 上三角,QR 与 Cholesky 的关系);P35 \(A\) 正规时 7.3.1 中 \(P=Q\);P36 用极分解 \(A=PU\) 与上题;P37 \(A=SBS^{-1}=S^{-*}BS^*\) ⇒ \(B\) 与 \(S^*S\) 交换,从而与 \(Q\) 交换;P38 \(V=SWS^*\) ⇒ \(P^{-1}V=(UWU^*)P\) ⇒ \(V=UWU^*\)(极分解酉因子唯一);P39–P41 前题;P43 7.3.P35,\(\|AB\|=\|BA^*\|=\|BPU^*\|=\|BPU\|=\|BA\|\)(\(A\) 正规时酉不变范数下 \(\|AB\|=\|BA\|\) 类结论)。
- 7.4 节(Kantorovich、奇异值不等式):P3:\(B=U\Lambda U^*\)、\(C=UMU^*\),换元 \(y=U^*x\)、\(z=(\Lambda M)^{1/2}y\),对 \(B=\Lambda M^{-1}\) 用 7.4.12.1,得最优常数形如 \(\lambda_1\lambda_n\mu_j\mu_k/(\lambda_1\mu_j+\lambda_n\mu_k)^2\),最小者在 \(j=1,k=n\);P4 取 \(B=A^{1/2}\)、\(C=I\);P5 \(|x^*Ax|^2=|x^*PUx|^2\le(x^*Px)((Ux)^*P(Ux))\),两次用 7.4.12.1;P10(a) \(x^*y=(A^{1/2}x)^*(A^{-1/2}y)\);P11 (a) 0.8.5.10,(d) 写 \(A=\begin{bmatrix}A_n&\xi\\\xi^*&a_{nn}\end{bmatrix}\) 代入 7.4.12.20 证 7.4.12.19(\(i=n\)),再置换得一般情形;P13 \(A-\frac12(A+A^*)=\frac12(A-H)+\frac12(H-A^*)\) ⇒ \(\|A-\frac12(A+A^*)\|\le\frac12\|A-H\|+\frac12\|H-A^*\|\)(最近 Hermitian 矩阵是 Hermitian 部分);P16 上界用 7.3.P16 证 \(\sigma_i(A-U)\le\sigma_i(A)+1\),即 \(\|A-U\|_{[k]}\le\|\Sigma(A)+I\|_{[k]}\),再用 7.4.8.4(最近酉矩阵是极分解酉因子);P17(d):用 4.3.51 取等条件 4.3.52a,\(w_i=\sigma_i(A)\)、\(y_i=\lambda_i\)、\(x_i=\sigma_i(B)\),按不同奇异值 \(s_1>\dots>s_d\) 由上而下逐层推出 \(\lambda_1=\dots=\lambda_{n_1}=s_1\) 等;(e) 2.6.5;P18 \(\sigma_k(A)\le\sigma_k(|A|)\):\(\|Ax\|_2\le\||A||x|\|_2\),再用 7.3.8 与 7.4.8.4。
- 7.5 节(Hadamard 积、Schur 积定理):P1(a) 7.2.7;P3 考虑 \(A\circ\bar A\);P7(正定核的矩阵刻画):充分性用 Riemann 和逼近 \(\iint K(x,y)f(x)\bar f(y)dxdy\approx\sum K(x_i,x_j)f(x_i)\bar f(x_j)\Delta x_i\Delta x_j\);必要性取 \(f=\sum a_i\delta_\epsilon(x-x_i)\)(近似 δ 函数)并令 \(\epsilon\to0\);P11 7.1.P16;P12 对 \(A\) 与 \(A^{(-1)}\)(Hadamard 逆)都用 7.1.P1 的不等式,得所有 2 阶主子式为零,再用 7.2.P24;P14(a):\(x\) 单位向量,\(B=A^{1/2}(\operatorname{diag}x)A^{-1/2}\) 特征值为 \(x_i\),\(\|B\|_F^2\ge\|x\|^2=1\);\(x^*(A\circ A^{-1})x=\operatorname{tr}((\operatorname{diag}\bar x)A(\operatorname{diag}x)A^{-1})=\operatorname{tr}(B^*B)=\|B\|_F^2\),故 \(A\circ A^{-1}\succeq I\)(Fiedler 不等式);P15(c) 7.5.9(b) 取 \(f(t)=1/(1-t)\);P17 (c) 7.1.P18,(d) 7.5.9(b) 取 \(f_k(t)=e^{t\ln p_k}\);P18 \(t>0\) 时 \(tA\) 半正定(无穷可分性);P20 \(n=2\) 显然;\(n\ge3\),\(\alpha=a_{pp}\),置换后 \(p=1,q=2\),领先 2×2 主子矩阵 \(P=\begin{bmatrix}\alpha&\alpha\\\alpha&\alpha\end{bmatrix}\),由 7.1.10 每个 \(\begin{bmatrix}a_{1j}\\a_{2j}\end{bmatrix}\) 在 \(P\) 的值域中;P22(d) 0.9.11;P23(b) 7.5.P21 与 7.5.P22 的思路;P25(b) \(H=\alpha(X\circ Y)\),\(\alpha>0\),\(X\) 半正定 / 正定,\(Y\) 是对角为正的秩一半正定矩阵。
- 7.6 节(同时对角化、乘积的特征值、椭球):P1(d) \(A^*=S^{-1}AS\) ⇒ \(AS\) Hermitian,用 7.6.4;P5 7.6.4 后练习;P6 7.6.4;P7 \(A+B=A(I+A^{-1}B)\);P8(b) 上题;P10:\(S=(AB)C=EC\),\(E\) 特征值为正;若 \(S\) Hermitian,\(E=SC^{-1}\) 与 \(S\) 正特征值个数相同,故 \(S\) 正定;反例矩阵 \(\begin{bmatrix}10&0\\0&1\end{bmatrix}\)、\(\begin{bmatrix}1&-1\\-1&2\end{bmatrix}\)、\(\begin{bmatrix}3&5\\5&10\end{bmatrix}\);P12(a) 交错,\(B_{11}\) 是 \(S^{-*}BS^{-1}\) 的主子矩阵;P15 上题;P16 7.6.3;P17 \(\mu\ge\det((A_1+A_2)/2)\ge(\det A_1\det A_2)^{1/2}=\mu\)(\(\log\det\) 凹性);P18 5.2.6;P19:椭球 \(\mathcal E(A)=\{x:x^*Ax\le1\}\) 体积 \(=\int_{\|y\|_2\le1}|\det J(y)|dV(y)\),\(J\) 为换元 \(y=A^{1/2}x\) 的 Jacobi 矩阵,故体积 \(=(\det A)^{-1/2}\times\)单位球体积;P20 (b) 5.4.4,(e) 7.6.P17;P21 (b) 7.6.P20,(c) \((LAL^{-1})^*(LAL^{-1})=?\);P24 \(U_k\) 为第 \(k\) 个对角元 \(+1\) 其余 \(-1\) 的对角阵,是 \(\|\cdot\|\) 的等距,由 7.6.11 与 \(Q\) 交换,依次取 \(k\) 并用 2.4.4.3;P25 上题保证 \(L\) 为正对角;对任意置换 \(P^TL^2P=L^2\);\(\|x\|\) 的单位球包含于(并触及)\(\mathcal E(\alpha^2I)\),故 \(\|x/\|x\|\|_2\le\alpha^{-1}\);P26 5.4.21;P27(a) \(Q=[q_{ij}]\),\(e_i^*Qe_i\le\|e_i\|^2\),Hadamard 不等式 \(\prod\|e_i\|^2\ge\prod q_{ii}\ge\det Q\)。
- 7.7 节(Loewner 序):P6 7.7.3(a) 与 7.2.6(c);P7 上题与 7.7.2(\(A\) 非奇异),奇异时用 SVD 化归;P9 \(B=A^{1/2}XC^{1/2}\);P10 用 7.7.11、7.7.16 或 Cauchy–Schwarz \(x^*y=(A^{-1}x)^*(Ay)\);P14(a) 7.6.4;P15 (a) 7.7.14,(b) 幂级数与三角不等式;P16 仿 7.7.12 证明,(b) 写作 \(\overline{x^*Ax}+y^*Ay\ge2|x^TBy|\),令 \(x\to\bar x\),对 \(A\to\bar A\)、\(B^*=\bar B\) 用 7.7.9,\((\bar A+\varepsilon I)^{-1/2}B(A+\varepsilon I)^{-1/2}\) 对称;P17 用上题 (c);P19 上题;P21 需 \(cA\succeq J=ee^T\);P22 对实 \(x\) 考虑 \(x^*Ax\);P25 见上题 (b);P30 看 \(A^{-1}\) 元素的余子式表示;P31 7.7.15;P33(a) 上题;P34(b) 7.7.4(d);P35:\(A=PU=UQ\) 极分解,\(A^*(AA^*)^{-1/2}A=(U^*P)P^{-1}(UQ)=Q=(A^*A)^{1/2}\);P37 考虑 7.7.11(b)、\(\begin{bmatrix}A&I\\I&A^{-1}\end{bmatrix}\) 与 \(\begin{bmatrix}B^{-1}&I\\I&B\end{bmatrix}\)(均半正定,用于 \(A\succeq B\Rightarrow B^{-1}\succeq A^{-1}\));P41(广义 Schur 补的单调性 / 超可加性):(a) \(H_2-\begin{bmatrix}0&0\\0&S_{H_2}(A_2)\end{bmatrix}\succeq0\) 且 \(H_1\succeq H_2\) ⇒ \(S_{H_1}(A_1)\succeq S_{H_2}(A_2)\);(b) \(S_{H_1+H_2}(A_1+A_2)\succeq S_{H_1}(A_1)+S_{H_2}(A_2)\);(c) 7.7.P4;P42 \(\operatorname{Re}z>0\) 时 \((\operatorname{Re}z)^{-1}\ge\operatorname{Re}(z^{-1})\);P43 \(\det(A+B)=\det A\det(I+A^{-1}B)\) 且 \(\rho(A^{-1}B)\le1\)。
- 7.8 节(行列式不等式):P2 对 \(A^*A\) 用 Fischer 不等式并用 \(|\det B|\le\|B\|_2^k\)(\(B\in M_k\));P3 7.8.18:\((a_{11}\cdots a_{nn}-\det A)\det B+(b_{11}\cdots b_{nn}-\det B)\det A\le0\)(Oppenheim 型);P4(a) 7.6.2b 与 AM–GM:\(\sum\lambda_i(AB)\ge n(\prod\lambda_i(AB))^{1/n}\),即 \(\operatorname{tr}(AB)\ge n(\det A\det B)^{1/n}\);P6 7.7.4(e);P9 \(V=[v_1\dots v_n]\),对 \(V^*AV\) 用 7.8.2(Hadamard);P11 \(\det A=\det A_{11}\det(A/A_{11})\) 且 \(A_{11}\succeq A/A_{22}\);P13 \(E_k(\lambda)\) 是 \(k\) 阶主子式之和,每个被 \(k\) 个不同对角元之积控制(\(E_k(\lambda(A))\le E_k(\operatorname{diag}A)\));P17 \(\prod|\cos\theta_j|+\prod|\sin\theta_j|\le|\cos\theta_1\cos\theta_2|+|\sin\theta_1\sin\theta_2|\le1\);P18、P19 用 Minkowski 积不等式 (B10):\((\prod\cos^2\theta_j)^{1/n}+(\prod\sin^2\theta_j)^{1/n}\le1\)。
第 8 章(非负矩阵)
- 8.0.P2(f):令 \(B_\epsilon=(1+\epsilon)A_\epsilon\),仿正文做对角化。
- 8.1.P5:参看 8.1.26 之前的说明。8.1.P8:\(\|A\|_2^2=\rho(A^TA)\),为何 \(A^TA\ge B^TB\)(\(A\ge B\ge0\) 时谱范数单调)。8.1.P9:\(\rho(A^*A)\le\rho(|A^*A|)\)。8.1.P10(分块矩阵谱半径的上界):\(|A|>0\) 时取 \(x>0\) 使 \(|A|x=\rho(|A|)x\),按块分 \(x=[x_1^T\dots x_k^T]^T\),\(\xi_i=\|x_i\|\),则 \(\rho(|A|)\xi_i=\|\sum_j|A_{ij}|x_j\|\le\sum_jG(|A_{ij}|)\xi_j\),即 \(\mathcal A\xi\ge\rho(|A|)\xi\),由 8.1.29 得 \(\rho(|A|)\le\rho(\mathcal A)\)(\(\mathcal A=[G(|A_{ij}|)]\) 为块范数构成的 \(k\times k\) 矩阵);有零元时用 \(A+\epsilon J_n\) 与连续性。8.1.P11:\(A^n\) 的对角元 \(=\sum a_{ii_2}a_{i_2i_3}\cdots a_{i_ni}\),为何 \(\gamma\) 是其中一项(8.1.20)。
- 8.2.P1:三种情形 \(A^m\to0\)、发散、收敛到正矩阵,分别刻画。8.2.P5:取 \(A\) 的 Perron 向量 \(x\) 使 \(Ax>Bx\)。8.2.P9(a):若 \(\min_i\sum_ja_{ij}=\rho(A)\),取 \(x_p=\min x_i\),则 \(\rho(A)x_p=\sum_ja_{pj}x_j\ge\sum_ja_{pj}x_p\ge\rho(A)x_p\),故所有 \(x_i=x_p\)(行和相等的刻画)。8.2.P10:交错与 8.2.8 保证每个 2×2 主子矩阵恰有一个正特征值。8.2.P11(j):1.4.P13,非实特征值成共轭对。8.2.P13:对任意 \(\varepsilon\) 存在 \(N\),\(m>N\) 时 \(1-\varepsilon<\operatorname{tr}((\rho^{-1}A)^m)=1+r_2^m+\dots+r_n^m<1+\varepsilon\)(\(r_k=\lambda_k/\rho\)),故 \((\operatorname{tr}A^m)^{1/m}\to\rho(A)\)。8.2.P14(c):8.2.P11。8.2.P15(b):若 \(A\) 有零元,略微增大得正矩阵 \(A'\),\(0\le A'\le B\)、\(A'\ne B\);\(y\) 为 \(A'\) 的左 Perron 向量、\(x\) 为 \(B\) 的右 Perron 向量,则 \(\rho(B')y^Tx=y^TB'x<y^TAx=\rho(A)y^Tx\)(严格单调性)。
- 8.3.P1:考虑 \(\begin{bmatrix}1&1\\0&1\end{bmatrix}\)、\(I_2\)、\(\begin{bmatrix}0&1\\1&0\end{bmatrix}\)。8.3.P2:\(x>0\)、\(A^kx=\rho(A^k)x\) ⇒ \(A^k(Ax)=\rho(A^k)(Ax)\),用 8.2.5 与 8.3.4。8.3.P3:次、超对角元都正时存在正对角 \(D\) 使 \(D^{-1}AD\) 对称,再取极限。8.3.P6(b):\(BAx=ABx=\rho(B)Ax\),用 8.2.6 与 8.3.4;或 \(B=S([\rho(B)]\oplus B_1)S^{-1}\)、\(A=S([\lambda]\oplus A_1)S^{-1}\),\(S\) 首列为 \(B\) 的 Perron 向量(交换的非负矩阵有公共 Perron 向量)。8.3.P9:\(\lambda I+A\) 特征值为 \(\lambda+\lambda_i\)。8.3.P10:由 8.3.1,\(\rho(A)\le\max\{y^TAy:y\ge0,\|y\|_2=1\}\le\max\{y^TH(A)y\}\),即 \(\rho(A)\le\lambda_{\max}(H(A))\)。8.3.P12:(a) \(\lambda\in\sigma(A)\) 实则 \(r-\lambda\ge0\),非实则 \(\bar\lambda\in\sigma(A)\) 且 \((r-\lambda)(r-\bar\lambda)>0\)(所以 \(\det(rI-A)\ge0\) 类结论),(b) 5.6.16,(c) 连续性。8.3.P13:1.2.13、1.2.15 与上题;\(\rho(A)\) 不简单 ⇒ \(S_{n-1}(\rho I-A)=0\) ⇒ \(E_{n-1}=0\) ⇒ \(\operatorname{tr}\operatorname{adj}(\rho I-A)=0\) ⇒ 各对角元为零。8.3.P16(a):\(Ax\ge0\Rightarrow x\ge0\)(单调矩阵 monotone matrix);\(Ax=0\) ⇒ \(x\ge0\) 且 \(-x\ge0\) ⇒ \(A\) 非奇异;\(z\) 为 \(A^{-1}\) 的列 ⇒ \(Az=e_i\ge0\) ⇒ \(z\ge0\),即 \(A^{-1}\ge0\)。
- 8.4 节:P6 8.4.1;P16(c) \((1+t)^{n-1}=q_A(t)h(t)+r(t)\),\(\deg r\le m-1\);P17 用 7.4.1 的最佳秩一逼近刻画;P19:由 8.2.P9 的提示,\(a_{pj}>0\) 时 \(x_j=x_p\);不可约性给出路径 \(p=k_1\to k_2\to\dots\to k_m=q\) 且各边正,故 \(x_p=x_{k_2}=\dots=x_q\);P20 (c) \(A^2\) 不可约、非正、非零时考虑负特征值 \(-\rho(A^2)\) 的重数,(d) 可约矩阵最少有多少零元;P21(a) \((I+A)x\le(\alpha+1)x\) ⇒ \((I+A)^{n-1}x\le(\alpha+1)^{n-1}x\);P22(a) \(\operatorname{rank}G\le n\) ⇒ \(1\) 是 \(I-G\) 至少二重特征值;P24 \(A_1=\begin{bmatrix}0&1\\1&0\end{bmatrix}\)、\(A_2\) 为 \(t^3-1\) 的友矩阵,考虑 \(A_1\oplus A_1\) 与 \(A_1\oplus A_2\);P26 (a) 1.4.11、8.3.P12–P13,(b) 8.3.P14。
- 8.5 节:P3 考虑 \(\begin{bmatrix}1&1\\1&0\end{bmatrix}\) 与 \(\begin{bmatrix}0&1\\1&1\end{bmatrix}\)(两个本原矩阵之积不本原?);P4 把 Wielandt 矩阵看作作用在标准基上的线性变换:\(A:e_i\to?\),\(A^{n-1}:e_i\to?\),\(A^{(n-1)(n-1)}:e_1\to?\);P10 若 \(|\mu|=\rho(A)\)、\(\mu\ne\rho(A)\)、\(Az=\mu z\),则 \((\rho^{-1}A)^mz\) 不收敛;P14 考虑 \(A^2\),用 8.5.5、8.5.6、8.5.8。
- 8.7 节:P2 上题与 3.2.5.2;P4 前几题;P5 \(\|A\|_2\le\sum\alpha_i\|P_i\|_2=1\);P6 \(Ae=e\) ⇒ \(\|A\|\ge1\),\(\|P\|=1\) ⇒ \(\|A\|\le1\);P7 \(A=\alpha_1B+\alpha_2C\)(\(\alpha_i\in(0,1)\)),\(A\) 的零元位置上 \(B,C\) 也为零(用于证明置换矩阵是极点);P8 8.7.2;P9:若有 \(n+1\) 个正元,某行至少两个正元,于是两列各至少两个正元,其余 \(n-2\) 列至多 \(n-3\) 个正元,矛盾;P13 用 Fan 优势定理(Fan dominance theorem)与 8.7.3;P14 若 \(A\) 置换相似于 6.2.21 的分块形式,块 \(B\) 的列和是多少,其行和之和必须为多少。
(PDF p.626 后半页空白,习题提示到此结束。)
索引(Index)(PDF p.627–663,原书 p.607–643)
按英文字母排序的主题索引(含人名),条目下分子条目并给原书页码(原书页码 + 20 = PDF 页码)。PDF p.664 为空白页,p.665 为电子档生成说明页(非原书内容)。以下摘录编写教材时最常需要回查的条目(原书页码):
- 分解与典范形:Cholesky factorization 441–442(推出 QR 456);LU / LDU / PLU / LPU 216–222;QR factorization 89–94、155;SVD 150–159(thin SVD 450、456;与极分解等价 454);polar decomposition 449–458;Schur triangularization 101(实 Schur 形 103);Jordan canonical form 164–191;Weyr canonical form 204–211;Autonne–Takagi factorization \(A=U\Sigma U^T\) 153、263、278;CS decomposition 160–162;spectral theorem 133–135、229、234。
- 特征值理论:Courant–Fischer(min-max)236;Rayleigh quotient 234;Cauchy 交错定理 242、298;Weyl 定理 239–241、454;Lidskii 优超不等式 250、259;Schur majorization theorem 249;Hoffman–Wielandt 407、451、468;Bauer–Fike 405;Geršgorin 388–398;Brauer / Ostrowski 卵形 415–424;Gelfand formula 349;Perron 定理 526;Perron–Frobenius 定理 534;Romanovsky 541;Wielandt 本原指数 543;Birkhoff 定理 253、548;von Neumann 迹定理 458、550(等号情形 460)。
- 正定矩阵:定义 429;Sylvester 判据 439;Gram 矩阵 440–446;Schur 补 25、437、453、495–504;Loewner 偏序 493–505(逆的反单调 495、平方根单调 495、\(\log\det\) 严格凹 488、\(\operatorname{tr}A^{-1}\) 严格凸 489);Hadamard 不等式 93、443、505–514;Fischer 不等式 506–514;Oppenheim 不等式 509;Schur 乘积定理 479;Kantorovich 不等式 470–473;Markovian / Gaussian 矩阵 443–444;相关矩阵 434、445;协方差矩阵 280、426;positive definite function 435、482;Bochner 定理 427;Mercer 定理 478。
- 范数:向量范数 314–340;对偶范数 329–339;矩阵范数 340–370;诱导范数 344–358;谱范数 346;Frobenius 范数 321、341;Ky Fan \(k\)-范数 466;Schatten \(p\)-范数 465;酉不变范数 357、464–470(symmetric gauge function 464);条件数 382–386;Neumann series 365;矩阵指数 350、369。
- 非负矩阵(本块正文涉及):irreducible 402、532–538;primitive matrix 540–545;stochastic / doubly stochastic 547–553;M-matrix 533;power method 81、545;Perron vector 525–534。
- 最佳逼近:最近奇异矩阵 369、461;最近秩 \(k\) 矩阵 462;最近酉矩阵 476;最近 Hermitian 矩阵 476;最小二乘 379、453、462;Moore–Penrose 逆 453–454;unitary Procrustes problem 463。
- 其他常查:Sherman–Morrison–Woodbury 19;Cauchy–Binet 28;Sylvester 惯性定律 282;Hessian 225、426、558;Toeplitz / Hankel / circulant 33–35、100、427;Vandermonde 37;Kronecker 定理 27;Jensen 不等式 333、560;Hölder 不等式 414、559;Minkowski 不等式 320、510–511、560;Samuelson 319(样本偏离均值界)。
全块总结
本块要点
- 第 8 章后半完成了 Perron–Frobenius 理论:不可约 → 最大模特征值的旋转对称(单位根)结构;本原 ⇔ 幂为正 ⇔ 非周期;本原指数的各种上界(Wielandt \(n^2-2n+2\));Cesàro 极限定理;随机与双随机矩阵、Birkhoff 定理与 von Neumann 迹不等式。
- 附录给出全书依赖的分析基础:复数、凸集与凸函数(含 Hölder、Minkowski、AM–GM 等不等式与分离超平面、Krein–Milman、Carathéodory)、代数基本定理、特征值的连续性(\(1/n\) 次 Hölder 界)、Weierstrass 定理、合同典范对。
- 习题提示部分为第 1–8 章大部分重要习题提供了关键一步,编写习题解答时可直接对照本笔记的“习题提示”节。
与量化交易的关联(全块)
- Markov 链 / 评级迁移 / 状态切换模型:本原性与 Perron 向量决定平稳分布与收敛速度;周期链用时间平均(8.5、8.6)。
- 网络与系统性风险:Perron 根灵敏度、幂法、特征向量中心性(8.4.P13、8.5.P16)。
- 组合优化:凸性判据、分离超平面(无套利)、Birkhoff 定理(分配 / 匹配问题的 LP 整数性)、Weierstrass 存在性(附录 B、E,8.7)。
- 风险模型:von Neumann 迹不等式与 Procrustes 问题(因子对齐),范数比较常数(5.6.P23 提示表)用于误差界换算;附录 D 提示非对称矩阵特征值估计的不稳定性。
- 参考文献、符号表、索引与量化无直接关联,只作查阅工具。
推荐习题(全块)
- 8.4.P13、8.4.P25、8.5.P4、8.5.P16、8.5.P18、8.6.P1、8.7.P5、8.7.P15(见第 8 章“推荐习题”)。
- 结合“习题提示”可优先练习:5.1.P14(Samuelson 不等式)、5.4.P3(\(\ell_p\) 范数比较)、5.6.P23(矩阵范数等价常数表)、5.6.P47(到奇异矩阵的距离)、7.2.P12–P14(Markov / Gauss 相关矩阵的正定性)、7.2.P19(\(a_{ii}(A^{-1})_{ii}\ge1\),即 VIF \(\ge1\))、7.5.P14(\(A\circ A^{-1}\succeq I\))、7.6.P19(椭球体积 \(\propto(\det A)^{-1/2}\))、7.7.P35、7.8.P4(\(\operatorname{tr}AB\ge n(\det A\det B)^{1/n}\))。