量化交易中文教材

元信息:Roger A. Horn & Charles R. Johnson《Matrix Analysis》(2nd ed., Cambridge University Press, 2013);本块负责 PDF 第 445–555 页(原书页码 425–535;PDF 页码 = 原书页码 + 20)。内容:第 7 章「正定与半正定矩阵」全章(7.0–7.8,PDF p.445–535,p.536 空白)及第 8 章「正矩阵与非负矩阵」8.0–8.4 开头(PDF p.537–555,止于 Corollary 8.4.6 证明中途)。

第 7 章 正定与半正定矩阵(Positive Definite and Semidefinite Matrices)

记号约定(沿用全书):\(M_n\) 为 \(n\times n\) 复矩阵;\(M_{m,n}\) 为 \(m\times n\) 复矩阵;\(A^*\) 为共轭转置;\(H(A)=\tfrac12(A+A^*)\) 为 Hermitian 部分(Hermitian part);\(A[\alpha]\) 为由指标集 \(\alpha\) 确定的主子矩阵(principal submatrix);\(\alpha^c\) 为补集;\(\|\cdot\|_2\) 在向量上为 Euclid 范数、在矩阵上为 Frobenius 范数;\(\lambda_1\le\cdots\le\lambda_n\) 表示 Hermitian 矩阵按递增排列的特征值(第 4 章约定)。

7.0 引言(PDF p.445–449,原书 p.425–429)

本章研究具有特殊“正性”的 Hermitian 矩阵——它们是“正数”概念在矩阵上的推广。引言用五个例子说明这类矩阵的来源。

7.0.1 Hessian、极小化与凸性(Hessians, minimization, and convexity)

设 \(f\) 是区域 \(D\subset\mathbf R^n\) 上光滑实值函数,\(y\) 为内点。Taylor 展开:

\[f(x)=f(y)+\sum_i (x_i-y_i)\frac{\partial f}{\partial x_i}\Big|_y+\frac12\sum_{i,j}(x_i-y_i)(x_j-y_j)\frac{\partial^2 f}{\partial x_i\partial x_j}\Big|_y+\cdots\]
若 \(y\) 为临界点(critical point,一阶偏导全为零),则 \(f(x)-f(y)=\tfrac12(x-y)^TH(f;y)(x-y)+\cdots\),其中 Hessian 矩阵 \(H(f;y)=[\partial^2 f/\partial x_i\partial x_j|_y]\),由混合偏导相等而对称。

  • 若二次型 \(z^TH(f;y)z>0\) 对所有 \(z\ne0\) 成立(式 (7.0.1.1)),则 \(y\) 为相对极小点(relative minimum);恒负则为相对极大点。\(n=1\) 时就是二阶导数判别法。
  • 若该二次型在 \(D\) 的所有点(不只是临界点)都非负,则 \(f\) 在 \(D\) 上是凸函数(convex function)。

7.0.2 协方差矩阵(Covariance matrices)

设 \(X_1,\dots,X_n\) 为有有限二阶矩的实或复随机变量,均值 \(\mu_i=E(X_i)\)。协方差矩阵 \(A=[a_{ij}]\),\(a_{ij}=E[(\bar X_i-\bar\mu_i)(X_j-\mu_j)]\),显然 Hermitian,且对任意 \(z\in\mathbf C^n\):

\[z^*Az=E\Big(\sum_{i,j}\bar z_i(\bar X_i-\bar\mu_i)z_j(X_j-\mu_j)\Big)=E\Big|\sum_i z_i(X_i-\mu_i)\Big|^2\ge0.\]
只用到期望泛函的线性、齐次性与非负性(\(Y\ge0\Rightarrow E[Y]\ge0\))。非概率版本:对函数族 \(f_1,\dots,f_n\) 与实函数 \(g\),若积分 \(a_{ij}=\int_{-\infty}^{\infty}\overline{f_i(x)}f_j(x)g(x)\,dx\) 收敛,则 \(A\) Hermitian,且 \(z^*Az=\int|\sum_i z_if_i(x)|^2g(x)\,dx\),当 \(g\ge0\) 时非负。

7.0.3 非负函数的代数矩(Algebraic moments)

\(f\) 在 \([0,1]\) 上绝对可积,\(a_k=\int_0^1x^kf(x)\,dx\)(式 (7.0.3.1)),称 Hausdorff 矩序列(Hausdorff moment sequence)。

\[\sum_{j,k=0}^n a_{j+k}z_jz_k=\int_0^1\Big(\sum_k z_kx^k\Big)^2f(x)\,dx\quad(7.0.3.2)\]
矩阵 \(A=[a_{i+j}]\) 实对称;\(f\ge0\) 时对所有 \(n\) 和 \(z\in\mathbf R^{n+1}\) 有 \(z^TAz\ge0\)。元素只依赖 \(i+j\) 的矩阵叫 Hankel 矩阵(见 0.9.8)。

7.0.4 非负函数的三角矩(Trigonometric moments)

\(f\) 在 \([0,2\pi]\) 上绝对可积,\(a_k=\int_0^{2\pi}e^{ik\theta}f(\theta)\,d\theta\),\(k=0,\pm1,\pm2,\dots\)(式 (7.0.4.1)),称 Toeplitz 矩序列。

\[\sum_{j,k=0}^n a_{j-k}z_j\bar z_k=\int_0^{2\pi}\Big|\sum_k z_ke^{ik\theta}\Big|^2f(\theta)\,d\theta\quad(7.0.4.2)\]
\(A=[a_{i-j}]\) Hermitian,\(f\ge0\) 时半正定。元素只依赖 \(i-j\) 的矩阵叫 Toeplitz 矩阵(0.9.7)。Bochner 定理:二次型 (7.0.4.2) 非负,当且仅当 \(a_k\) 可由 (7.0.4.1) 的推广形式(用非负测度 \(d\mu\) 代替 \(f(\theta)d\theta\))生成。(金融中平稳时间序列自协方差矩阵就是 Toeplitz 半正定矩阵,正是此结论的应用场景。)

7.0.5 微分方程差分格式(Discretization and difference schemes)

两点边值问题 \(-y''+\sigma(x)y=f(x)\),\(0\le x\le1\),\(y(0)=\alpha,\ y(1)=\beta\)。取 \(h=1/(n+1)\),\(y''(kh)\approx(y_{k+1}-2y_k+y_{k-1})/h^2\),得线性方程组 \(Ay=w\),其中

\[A=\begin{bmatrix}2+h^2\sigma_1&-1&&\\-1&2+h^2\sigma_2&-1&\\&\ddots&\ddots&\ddots\\&&-1&2+h^2\sigma_n\end{bmatrix}\quad(7.0.5.1)\]
\(w=[h^2f_1+\alpha,h^2f_2,\dots,h^2f_{n-1},h^2f_n+\beta]^T\)。二次型
\[x^TAx=\Big(x_1^2+\sum_{i=1}^{n-1}(x_i-x_{i+1})^2+x_n^2\Big)+h^2\sum_i\sigma_ix_i^2 .\]
若 \(\sigma\ge0\),则 \(x^TAx\ge(\cdots)\ge0\)(式 (7.0.5.2));括号项为零当且仅当 \(x=0\),故 \(A\) 非奇异(若 \(A\hat x=0\) 则 \(\hat x^TA\hat x=0\Rightarrow\hat x=0\)),离散问题对任意边界值可解。设计离散格式时希望得到正定系数矩阵以保证计算稳定,椭圆型方程通常能做到。

正定矩阵还出现在调和分析、复分析、力学振动理论,以及奇异值分解和线性最小二乘中。

习题 7.0:P1 证明 \(\sum a_{i+j+1}z_iz_j\) 与 \(\sum(a_{i+j}-a_{i+j+1})z_iz_j\) 非负(\(f\ge0\) 生成的 Hausdorff 矩);P2 画图说明 Hankel / Toeplitz 矩阵哪些对角线为常数;P3 证明 (7.0.5.1) 不可约、\(\sigma\ge0\) 时不可约对角占优,用 (6.2.27) 得出非奇异且特征值全正。延伸阅读:C. R. Johnson (1970, Amer. Math. Monthly)、O. Taussky 的综述;Bhatia (2007)《Positive Definite Matrices》专著。

7.1 定义与性质(Definitions and properties)(PDF p.449–458,原书 p.429–438)

定义(式 (7.1.1a/b)):Hermitian 矩阵 \(A\in M_n\) 是

  • 正定(positive definite):\(x^*Ax>0\) 对所有非零 \(x\in\mathbf C^n\);
  • 半正定(positive semidefinite):\(x^*Ax\ge0\) 对所有 \(x\)。

\(A\) Hermitian 时 \(x^*Ax\) 恒为实数(4.1.3);反之若 \(x^*Ax\) 对所有复 \(x\) 为实数则 \(A\) 必 Hermitian(4.1.4),所以在复数域上“假设 Hermitian”其实多余(实数域上则不然)。负定 / 负半定:反向不等式,等价于 \(-A\) 正定 / 半正定;\(x^*Ax\) 既取正值又取负值的 Hermitian 矩阵称为不定(indefinite)。

练习要点:\(M_1\) 中正定即正实数;\(\begin{bmatrix}1&1\\1&1\end{bmatrix}\) 半正定非正定;\(A\) 正定则 \(\bar A, A^T, A^*, A^{-1}\) 正定(提示:\(Ay=x\) 时 \(x^*A^{-1}x=y^*A^*y\))。

Observation 7.1.2(主子矩阵继承):\(A\) 正定(半正定)⇒ 所有主子矩阵 \(A[\alpha]\) 正定(半正定)。 证明:取 \(x\) 使 \(x[\alpha]\neq0\)、\(x[\alpha^c]=0\),则 \(x[\alpha]^*A[\alpha]x[\alpha]=x^*Ax>0\)。推论:正定(半正定)矩阵的对角元为正(非负)实数。

Observation 7.1.3(锥性质):\(A_1,\dots,A_k\) 半正定、\(\alpha_i\ge0\) ⇒ \(\sum\alpha_iA_i\) 半正定;若存在某 \(\alpha_j>0\) 且 \(A_j\) 正定,则和为正定。证明:\(x^*(\sum\alpha_iA_i)x=\sum\alpha_i(x^*A_ix)\)。(即半正定矩阵组成凸锥。)

Observation 7.1.4:正定(半正定)矩阵的特征值均为正(非负)实数。证明:\(Ax=\lambda x\) ⇒ \(\lambda=x^*Ax/x^*x\)。

Corollary 7.1.5:\(A\) 半正定(正定)⇒ \(\operatorname{tr}A\)、\(\det A\) 及所有主子式非负(正);且 \(\operatorname{tr}A=0\iff A=0\)。证明:迹 = 特征值和,若为 0 则特征值全 0,而可对角化矩阵特征值全零即为零矩阵(1.3.4);行列式 = 特征值积;主子式是主子矩阵行列式,用 7.1.2。 练习:负定矩阵的特征值与迹为负,\(\det A\) 在 \(n\) 奇时为负、偶时为正。对不定矩阵 \(\operatorname{diag}(1,-1)\),\(x=(1,1)^T\) 使 \(x^*Ax=0\) 但 \(Ax\ne0\)——下一结论说明半正定矩阵不会这样。

Observation 7.1.6(关键引理):\(A\) 半正定,则 \(x^*Ax=0\iff Ax=0\)。 证明:设 \(x\ne0\)、\(x^*Ax=0\)。令 \(p(t)=(tx+Ax)^*A(tx+Ax)=t^2x^*Ax+2t\,x^*A^2x+x^*A^3x=2t\|Ax\|_2^2+x^*A^3x\ge0\) 对所有实 \(t\)。若 \(\|Ax\|_2\ne0\),\(t\to-\infty\) 时 \(p(t)<0\),矛盾。

Corollary 7.1.7:半正定矩阵正定 ⇔ 非奇异。(等价链:奇异 ⇔ 存在 \(x\ne0\), \(Ax=0\) ⇔ 存在 \(x\ne0\), \(x^*Ax=0\) ⇔ 非正定。)

Observation 7.1.8(*合同保持半正定性,*congruence):\(A\in M_n\) Hermitian,\(C\in M_{n,m}\)。 (a) \(A\) 半正定 ⇒ \(C^*AC\) 半正定,且 \(\operatorname{null}(C^*AC)=\operatorname{null}(AC)\),\(\operatorname{rank}C^*AC=\operatorname{rank}AC\)。 (b) \(A\) 正定 ⇒ \(\operatorname{rank}C^*AC=\operatorname{rank}C\),且 \(C^*AC\) 正定 ⇔ \(\operatorname{rank}C=m\)(\(C\) 列满秩)。 证明:\(x^*C^*ACx=(Cx)^*A(Cx)\ge0\);由 7.1.6,\(C^*ACx=0\iff (Cx)^*A(Cx)=0\iff ACx=0\)。(b) 中 \(A\) 非奇异故 \(\operatorname{rank}AC=\operatorname{rank}C\),再用 7.1.7。 练习:\(m>n\) 时 \(C^*AC\)(\(C\in M_{n,m}\))可以……(书中练习:举例说明 \(A\) 仅半正定时 \(C^*AC\) 也可能正定——注意维数关系)。

Observation 7.1.9(连续性论证的基础):Hermitian \(A\) 半正定 ⇔ 存在正定矩阵序列 \(A_k\to A\)。证明:取 \(A_k=A+k^{-1}I\);反向取极限 \(x^*A_kx>0\Rightarrow x^*Ax\ge0\)。这使许多正定矩阵结论可用连续性推广到半正定。

行/列包含性质(row and column inclusion property)(在 3.5.3 LU 分解中出现过):把 \(A=\begin{bmatrix}A_{11}&A_{12}\\A_{21}&A_{22}\end{bmatrix}\),\(A_{11}\in M_k\)。若对每个 \(k\in\{1,\dots,n-1\}\) 都有 \(\operatorname{range}A_{12}\subset\operatorname{range}A_{11}\),称 \(A\) 有列包含性质;\(A^*\) 有列包含性质时称 \(A\) 有行包含性质。等价表述(练习):(b) \(\operatorname{null}A_{11}^*\subset\operatorname{null}A_{12}^*\);(c) \(A_{12}\) 每列是 \(A_{11}\) 列的线性组合;(d) 存在 \(X\in M_{k,n-k}\) 使 \(A_{12}=A_{11}X\);(e) \(\operatorname{rank}[A_{11}\ A_{12}]=\operatorname{rank}A_{11}\)。Hermitian 矩阵的行、列包含性质等价。

Observation 7.1.10:每个半正定矩阵都具有行、列包含性质。特别地,若 \(a_{kk}=0\),则第 \(k\) 行与第 \(k\) 列全为零。 证明:需证 \(\operatorname{null}A_{11}\subset\operatorname{null}A_{12}^*\)。设 \(\xi^*A_{11}=0\),令 \(x=[\xi;0]\),则 \(x^*Ax=\xi^*A_{11}\xi=0\),由 7.1.6 得 \(x^*A=0\),即 \([\xi^*A_{11}\ \ \xi^*A_{12}]=[0\ \ \xi^*A_{12}]=0\)。第二个断言:行包含意味着 \(a_{ik}\) 是 \(a_{kk}\) 的倍数。 练习:半正定分块矩阵若 \(A_{11}=0\) 或 \(A_{22}=0\),则 \(A_{12}=0\);半正定 \(A\) 的任一列限制到 \(\alpha\) 上 \(a_j[\alpha]\) 位于 \(A[\alpha]\) 列空间中(用置换相似保持正定性)。

更大的一类:Hermitian 部分半正定的矩阵(4.1.2)。练习:\(A=H+iK\)(\(H,K\) Hermitian),则 \(x^*Ax=0\iff x^*A^*x=0\iff x^*Hx=x^*Kx=0\)。

Lemma 7.1.11:设 \(A\in M_n\) 的 Hermitian 部分 \(H(A)\) 半正定,则 (a) \(\operatorname{null}A\subset\operatorname{null}H(A)\) 且 \(\operatorname{null}A^*\subset\operatorname{null}H(A)\); (b) \(\operatorname{rank}H(A)\le\operatorname{rank}A\); (c) 以下等价:(i) \(A\) 与 \(H(A)\) 零空间相同;(ii) \(A^*\) 与 \(H(A)\) 零空间相同;(iii) \(\operatorname{rank}A=\operatorname{rank}H(A)\)。 证明:\(Ax=0\) 或 \(x^*A=0\) ⇒ \(x^*Ax=0\) ⇒ \(x^*Hx=0\) ⇒(7.1.6)\(Hx=0\)。 练习:\(H(A)\) 正定 ⇒ \(A\) 非奇异。

Observation 7.1.12:若 \(H(A)\) 半正定且 \(\operatorname{rank}A=\operatorname{rank}H(A)\),则 \(A\) 有行、列包含性质。 证明:由 7.1.11,\(A, A^*, H(A)\) 零空间相同。设 \(\xi^*A_{11}=0\),\(x=[\xi;0]\),则 \(0=\xi^*A_{11}\xi=x^*Ax=x^*H(A)x+ix^*K(A)x\),故 \(x^*H(A)x=0\),\(H(A)x=0\),从而 \(A^*x=0\),即 \(x^*A=0\),得 \(\xi^*A_{12}=0\)。行包含同理。 练习:条件非必要——\(A=\operatorname{diag}(i,-i)\) 有行列包含但 \(\operatorname{rank}A=2>\operatorname{rank}H(A)=0\);由 7.1.12 推出 7.1.10。

Corollary 7.1.13:\(H(A)\) 正定 ⇒ \(A\) 有行、列包含性质(因 \(\operatorname{rank}A=n=\operatorname{rank}H(A)\))。

Observation 7.1.14(推广“\(a,b\ge0\) 且 \(a+b=0\) ⇒ \(a=b=0\)”):\(A,B\) 半正定,则 (a) \(A+B=0\iff A=B=0\);(b) \(\operatorname{rank}(A+B)>0\iff A,B\) 至少一个非零。证明:对角元 \(a_{ii}+b_{ii}=0\) 且均非负 ⇒ 对角元全零,再由 7.1.10 第二断言得矩阵为零。

7.1 习题概要(P1–P30)

  • P1–P2:半正定 ⇒ \(a_{ii}a_{jj}\ge|a_{ij}|^2\);正定时严格;等号成立 ⇒ 奇异;由此再证 7.1.10。
  • P3–P4 相关矩阵(correlation matrix):\(A\) 半正定且对角元为正,则 \([a_{ij}/\sqrt{a_{ii}a_{jj}}]\) 半正定、对角元为 1、元素模 \(\le1\);讨论等号是否可在正定时取到(不能)。
  • P5:Hermitian 且 \(|\operatorname{tr}A|<\|A\|_2\)(Frobenius)⇒ 不定。P6:\(A\oplus B\) 半正定 ⇔ 两者都半正定。
  • P7–P13 正定函数(positive definite function):\(f:\mathbf R\to\mathbf C\) 使 \([f(t_i-t_j)]\) 对任意点组半正定。性质 \(f(-t)=\overline{f(t)}\),\(f(0)\ge0\),\(|f(t)|\le f(0)\),在 0 连续则处处连续;非负组合仍是正定函数;\(e^{ist}\)、\(\sum a_ke^{is_kt}\)、\(\cos t\) 是正定函数,\(\sin t\) 不是;若 \(g\ge0\) 可积,\(f(t)=\int e^{its}g(s)ds\) 正定,例如 \(\sin(\alpha t)/(\alpha t)\)、\(e^{-t^2}\)、\(e^{-|t|}\)、\((1+it)/(1+t^2)=1/(1-it)\);\(\bar f\)、\(\operatorname{Re}f\) 正定,\(1/(1+t^2)\) 正定,而 \(it/(1+t^2)\) 不是。(这是 Bochner 定理的离散形式,金融中构造有效协方差核时用到。)
  • P14–P15:加边矩阵 \(\begin{bmatrix}A&y\\y^*&\alpha\end{bmatrix}\) 半正定 ⇒ \(y\in\operatorname{range}A\);正定函数若 \(f(\tau)=f(0)\)(\(\tau>0\))则以 \(\tau\) 为周期。
  • P16:\(\operatorname{Re}\lambda_j>0\) 时 Cauchy 型矩阵 \([(\lambda_i+\bar\lambda_j)^{-1}]\) 半正定,\(\lambda_j\) 互异时正定;推出 Hilbert 型 Hankel 矩阵 \([(i+j)^{-1}]\)、\([(i+j-1)^{-1}]\) 正定。
  • P17:全 1 矩阵 \(J_n\) 半正定(\(x^*J_nx=|\sum x_i|^2\))。
  • P18–P20 min 矩阵:\(0<\alpha_1<\dots<\alpha_n\) 时 \([\min\{\alpha_i,\alpha_j\}]=\alpha_1J_n+(\alpha_2-\alpha_1)(0_1\oplus J_{n-1})+\dots\) 正定;一般 \(\beta_i>0\) 时 min 矩阵半正定(互异时正定);倒数 max 矩阵 \([(\max\{\beta_i,\beta_j\})^{-1}]\) 同样;核 \(K(s,t)=\min\{s,t\}\)(Brown 运动协方差核)在 \([0,N]\) 上半正定,且 \(\iint\min\{s,t\}\bar f(s)f(t)=\int_0^N|\int_t^Nf(s)ds|^2dt\)(式 (7.1.15)),从而正定。
  • P21:Hermitian 部分半正定的矩阵的 *合同标准形分析;\(H(A)\) 正定 ⇔ \(A=S\operatorname{diag}(e^{i\theta_1},\dots,e^{i\theta_n})S^*\),\(\theta_j\in(-\pi/2,\pi/2)\)(式 (7.1.15));\(H(A)\) 半正定 ⇔ \(A\) *合同于 \((I_p+i\Lambda_p)\oplus(0_q+i\Gamma_q)\oplus(E_{2r}+iF_{2r})\)(式 (7.1.16))。
  • P22–P23:若 \(H(A)\) 与 \(H(A^2)\) 都半正定则 \(\operatorname{rank}A=\operatorname{rank}H(A)\);反例 \(\begin{bmatrix}1&-2\\2&1\end{bmatrix}\)。
  • P24:半正定分块 ⇒ \(\operatorname{rank}A\le\operatorname{rank}A_{11}+\operatorname{rank}A_{22}\)。
  • P25 部分迹(partial trace):\(A\) 半正定按 \(m\times m\) 块分块,则 \([\operatorname{tr}A_{ij}]\) 半正定(写成 \(\sum_pX_p^*AX_p\))。
  • P26:\(H(A)\) 半正定且秩相等 ⇒ 存在 LU 分解。P27:半正定 \(A\) 的 \(\operatorname{rank}A^k=\operatorname{rank}A\) 等。
  • P28 广义 Schur 补(generalized Schur complement):\(A=\begin{bmatrix}B&C\\C^*&D\end{bmatrix}\) 半正定,由列包含 \(C=BX\),\(\begin{bmatrix}I&0\\-X^*&I\end{bmatrix}A\begin{bmatrix}I&-X\\0&I\end{bmatrix}=B\oplus(D-X^*BX)\);\(\tilde S=D-X^*BX\) 与 \(X\) 的选取无关,半正定,且 \(\operatorname{rank}A=\operatorname{rank}B+\operatorname{rank}\tilde S\)(类比 Haynsworth 惯性公式 4.5.28)。
  • P29–P30:\(H\) 正定时 *合同判别(\(A^{-*}A\) 与 \(B^{-*}B\) 相似等价);\(A^{-*}A\) 相似于酉矩阵,\(I+A^{-*}A\) 非奇异。

7.2 刻画与性质(Characterizations and properties)(PDF p.458–468,原书 p.438–448)

正定 / 半正定矩阵有多种等价刻画。第一个已在 4.1.8 出现:

Theorem 7.2.1(特征值刻画):Hermitian 矩阵半正定 ⇔ 全部特征值非负;正定 ⇔ 全部特征值为正。(由谱分解 \(A=U\Lambda U^*\),\(x^*Ax=\sum\lambda_i|y_i|^2\),\(y=U^*x\)。) 练习:非奇异 Hermitian \(A\) 正定 ⇔ \(A^{-1}\) 正定;半正定 \(A\) 正定 ⇔ \(\operatorname{rank}A=n\)。

Corollary 7.2.2:\(A\) 半正定 ⇒ \(A^k\)(\(k=1,2,\dots\))半正定(特征值 \(\lambda_i^k\ge0\))。

Corollary 7.2.3:Hermitian、严格对角占优(strictly diagonally dominant)且 \(a_{ii}>0\) ⇒ 正定。证明:即 6.1.10(c),所有 Geršgorin 圆盘落在开右半平面,而特征值为实数,故全正。(实用判据:数值上可快速确认某些协方差 / 刚度矩阵正定。)

Corollary 7.2.4(特征多项式系数判据,理论用途):Hermitian \(A\) 的特征多项式 \(p_A(t)=a_nt^n+a_{n-1}t^{n-1}+\dots+a_{n-m}t^{n-m}\),\(a_n=1\),\(a_{n-m}\ne0\),\(1\le m\le n\)。则 \(A\) 半正定 ⇔ \(a_ka_{k+1}<0\) 对 \(k=n-m,\dots,n-1\)(非零系数严格交错变号)。证明:若交错,则 \(p_A\) 无负根(Descartes 符号规则思想:代入 \(t<0\) 各项同号);反之若半正定,正特征值 \(\lambda_1,\dots,\lambda_m\),用归纳法知 \((t-\lambda_1)\cdots(t-\lambda_m)\) 系数严格交错,乘 \(t^{n-m}\) 得 \(p_A\)。

Theorem 7.2.5(Sylvester 判据,Sylvester's criterion):\(A\in M_n\) Hermitian。 (a) 若所有主子式(含 \(\det A\))非负,则 \(A\) 半正定。 (b) 若所有顺序(leading,左上角)主子式为正(或所有尾部(trailing,右下角)主子式为正),则 \(A\) 正定。 (c) 若前 \(n-1\) 个顺序主子式为正(或后 \(n-1\) 个尾部主子式为正)且 \(\det A\ge0\),则 \(A\) 半正定。 证明要点:

  • (a) 设 \(r=\operatorname{rank}A\ge1\)。\(E_k(A)\) 为所有 \(k\) 阶主子式之和,假设下均 \(\ge0\)。Hermitian 矩阵是“秩主”的(rank principal,0.7.6),存在 \(r\times r\) 非奇异主子矩阵,故 \(E_r>0\);\(k>r\) 时 \(E_k=0\)。由 (1.2.13)
    \[p_A(t)=t^{n-r}\big(t^r-E_1t^{r-1}+\dots+(-1)^{r-1}E_{r-1}t+(-1)^rE_r\big),\]
    括号内多项式系数符号交错,在 \((-\infty,0]\) 无零点,故特征值非负。
  • (b) 令 \(A_k=A[\{1,\dots,k\}]\)。\(\det A_1>0\) ⇒ \(A_1\) 正定。若 \(A_k\) 正定,由交错不等式(interlacing,4.3.18)\(A_{k+1}\) 除最小特征值外其余特征值都为正;又 \(\det A_{k+1}>0\) 是全部特征值之积,故最小特征值也正。归纳得 \(A_n=A\) 正定。尾部情形用置换相似。
  • (c) 同 (b) 的交错论证得至少 \(n-1\) 个正特征值,若 \(\det A=0\) 剩下一个为 0。 常见误区:半正定不能只看顺序主子式非负——反例 \(\begin{bmatrix}0&0\\0&-1\end{bmatrix}\),顺序主子式 \(0,0\) 都非负但不半正定。半正定需要检查所有主子式((a)),或用 (c) 的加强条件。

Theorem 7.2.6(唯一 \(k\) 次方根):\(A\) Hermitian 半正定,\(r=\operatorname{rank}A\),\(k\in\{2,3,\dots\}\)。 (a) 存在唯一 Hermitian 半正定 \(B\) 使 \(B^k=A\); (b) 存在实系数多项式 \(p\) 使 \(B=p(A)\),因而 \(B\) 与任何和 \(A\) 交换的矩阵交换; (c) \(\operatorname{range}A=\operatorname{range}B\),\(\operatorname{rank}A=\operatorname{rank}B\); (d) \(A\) 实则 \(B\) 实。 证明:\(A=U\Lambda U^*\),\(U=[U_1\ U_2]\),\(\Lambda=\operatorname{diag}(\lambda_1,\dots,\lambda_r)\oplus0_{n-r}\),令 \(B=U\Lambda^{1/k}U^*\)(取非负 \(k\) 次根)。值域都是 \(U_1\) 的列空间。\(A\) 实时可取实正交 \(U\)。取 Lagrange 插值多项式 \(p\) 使 \(p(\lambda_i)=\lambda_i^{1/k}\)、\(p(0)=0\)(0.9.11,实系数),则 \(p(A)=Up(\Lambda)U^*=B\)。唯一性:若 \(C\) 半正定且 \(C^k=A\),则 \(B=p(A)=p(C^k)\) 与 \(C\) 交换,由 4.1.6 可同时酉对角化 \(B=V\Lambda_1V^*\)、\(C=V\Lambda_2V^*\),\(\Lambda_1^k=\Lambda_2^k\),非负 \(k\) 次根唯一 ⇒ \(\Lambda_1=\Lambda_2\)。 记号:\(A^{1/2}\) 为唯一半正定平方根,\(A^{1/k}\) 为唯一半正定 \(k\) 次根。练习:计算 \(\begin{bmatrix}5&4\\4&5\end{bmatrix}^{1/2}\)(特征值 9、1,特征向量 \((1,\pm1)/\sqrt2\),结果为 \(\begin{bmatrix}2&1\\1&2\end{bmatrix}\));\(A\) 正定时 \((A^{1/2})^{-1}=(A^{-1})^{1/2}\)。

Theorem 7.2.7(Gram 型分解 \(A=B^*B\)):\(A\in M_n\) Hermitian。 (a) \(A\) 半正定 ⇔ 存在 \(B\in M_{m,n}\) 使 \(A=B^*B\); (b) 若 \(A=B^*B\),则 \(Ax=0\iff Bx=0\),故 \(\operatorname{null}A=\operatorname{null}B\),\(\operatorname{rank}A=\operatorname{rank}B\); (c) 若 \(A=B^*B\),则 \(A\) 正定 ⇔ \(B\) 列满秩。 证明:\(x^*B^*Bx=\|Bx\|_2^2\ge0\);分解可取 \(B=A^{1/2}\),\(m=n\)。(b) \(Ax=0\Rightarrow\|Bx\|^2=x^*Ax=0\)。

Corollary 7.2.8:Hermitian \(A\) 正定 ⇔ \(A\) *合同于单位阵。 练习:\(A\) 正定且 \(A=C^*C\)(\(C\in M_n\)),则存在酉 \(V\) 使 \(C=VA^{1/2}\)(证 \((CA^{-1/2})^*(CA^{-1/2})=I\))。即同一正定矩阵的不同“平方根因子”只差一个左酉因子。

\(A=B^*B\) 的实现方式很多:任意方阵 \(C=QR\)(2.1.14,\(Q\) 酉,\(R\) 上三角、对角非负、与 \(C\) 同秩),\(C^*C=R^*R\)。

Corollary 7.2.9(Cholesky 分解):Hermitian \(A\) 半正定(正定)⇔ 存在对角元非负(正)的下三角 \(L\) 使 \(A=LL^*\)。\(A\) 正定时 \(L\) 唯一;\(A\) 实时 \(L\) 可取实。证明:对 \(A^{1/2}=QR\),令 \(L=R^*\),\(A=A^{1/2}A^{1/2}=R^*Q^*QR=R^*R=LL^*\)。

Gram 矩阵(Gram matrix):内积空间 \(V\) 中向量 \(v_1,\dots,v_m\) 的 Gram 矩阵 \(G=[\langle v_j,v_i\rangle]_{i,j=1}^m\)。若 \(A\) 半正定,把 \(A^{1/2}=[v_1\ \dots\ v_n]\) 按列分块,则 \(A=(A^{1/2})^*A^{1/2}=[v_i^*v_j]\)——每个半正定矩阵都是 Gram 矩阵。反过来:

Theorem 7.2.10:\(v_1,\dots,v_m\) 在任意(可无穷维)内积空间中,\(G=[\langle v_j,v_i\rangle]\)。则 (a) \(G\) Hermitian 半正定;(b) \(G\) 正定 ⇔ \(v_1,\dots,v_m\) 线性无关;(c) \(\operatorname{rank}G=\dim\operatorname{span}\{v_1,\dots,v_m\}\)。 证明:

\[x^*Gx=\sum_{i,j}\langle v_j,v_i\rangle\bar x_ix_j=\Big\langle\sum_jx_jv_j,\sum_ix_iv_i\Big\rangle=\Big\|\sum_ix_iv_i\Big\|^2\ge0\quad(7.2.11)\]
等号 ⇔ \(\sum x_iv_i=0\),得 (b)。(c):\(r=\operatorname{rank}G\),秩主性给出 \(r\times r\) 正定主子矩阵,它是 \(r\) 个向量的 Gram 矩阵,由 (b) 这些向量无关,\(r\le d\);反之 \(d\) 个无关向量的 Gram 矩阵是 \(G\) 的正定主子矩阵,\(d\le r\)。 练习:秩 \(r\) 半正定矩阵可写成 \([v_i^*v_j]\) 且 \(\operatorname{rank}[v_1\dots v_n]=r\);Gram 矩阵的主子矩阵是子向量组的 Gram 矩阵;用 7.2.10 重新理解 7.1.P25、P12、P16(分别对应哪个内积空间与向量)。 量化直观:协方差矩阵 = 去均值收益向量在 \(L^2\) 内积下的 Gram 矩阵;秩 = 收益张成空间维数;奇异协方差 ⇔ 资产收益线性相关(存在零方差组合)。

7.2 习题概要(P1–P36)

  • P1:\(A\) Hermitian ⇒ \(A^{2k}\) 半正定,\(e^A\) 正定。P2:\(x^*Ax=\|A^{1/2}x\|_2^2\),由此再证 7.1.6。
  • P3:\([\min\{i,j\}]=R^TR\)(\(R\) 为上三角全 1),故正定;\(R^{-1}\) 为上双对角(主对角 \(+1\)、上次对角 \(-1\));\(A^{-1}\) 是主对角 2、次对角 \(-1\) 的三对角阵(与 7.0.5 离散 Laplacian 联系)。
  • P4:顺序主子式全正时 LDU 分解中 \(U=L^*\)、\(D\) 正对角,给出 7.2.5(b) 的非交错证明。
  • P5 Hadamard 不等式(Hadamard's inequality):Cholesky \(A=LL^*\),\(\det A=\prod c_{ii}^2\),\(a_{ii}=\sum_{k<i}|c_{ik}|^2+c_{ii}^2\ge c_{ii}^2\),故 \(\det A\le a_{11}\cdots a_{nn}\),等号 ⇔ \(A\) 对角。例:\(\begin{bmatrix}4&2\\2&4\end{bmatrix}=L_1L_1^*\),\(L_1=\begin{bmatrix}2&0\\1&\sqrt3\end{bmatrix}\),\(4\cdot4\ge 2^2(\sqrt3)^2=12\)。
  • P6:\(n-1\) 阶顺序主子矩阵 \(B\) 半正定且 \(\operatorname{rank}B=\operatorname{rank}A\) ⇒ \(A\) 半正定。P7:负定 / 负半定的子式符号条件(顺序主子式交错变号)。
  • P8:半正定矩阵可有非 Hermitian 或非半正定的平方根,如 \(\begin{bmatrix}a&b\\-a^2/b&-a\end{bmatrix}^2=0\),\(\begin{bmatrix}1&1\\0&-1\end{bmatrix}^2=I\)。
  • P9:\(A=B^*B\) 可取 \(B=\Lambda_r^{1/2}U_1^*\in M_{r,n}\) 行满秩且行正交;秩 1 半正定矩阵必为 \(xx^*\)。
  • P10:\(A\) 经 Hermitian 正定矩阵相似于 \(A^*\) ⇔ \(A\) 相似于实对角阵。P11:伴随矩阵 \(\operatorname{adj}A\) 与正定性的关系(\(A\) 正定 ⇔ \(\operatorname{adj}A\) 正定且 \(\det A>0\))。
  • P12–P13 Markov 矩阵(Markovian matrix) \(M(r,n)=[r^{|i-j|}]\)(AR(1) 过程相关矩阵!):\(\det M(r,n)=(1-r^2)^{n-1}\);\(r\ne\pm1\) 时非奇异;\(r\in(-1,1)\) 时正定,从而 \(e^{-|t|}\) 是正定函数;逆矩阵是对称三对角,\((1-r^2)M^{-1}\) 主对角 \(1,1+r^2,\dots,1+r^2,1\),次对角 \(-r\)。
  • P14 Gauss 矩阵 \(G(r,n)=[r^{(i-j)^2}]\):\(\det G=\prod_{k=1}^{n-1}(1-r^{2k})^{n-k}\);\(r\in(-1,1)\) 正定,从而 \(e^{-t^2}\) 正定函数。
  • P15:秩 1 扰动 \(A+zz^*\) 的特征值交错 \(\lambda_1\le\mu_1\le\lambda_2\le\dots\le\mu_n\le\lambda_{n+1}\)(借助 \(\begin{bmatrix}A^{1/2}\\z^*\end{bmatrix}[A^{1/2}\ z]\) 与 1.3.22)。
  • P16:\(A\) 正定非数量阵,则谱条件数 \(\kappa(A+tI)\) 在 \(t\ge0\) 上严格单调递减且凸(岭回归 / 收缩估计改善条件数的数学依据)。
  • P17:\(A\) 正定 ⇒ \(A+B+B^*+BA^{-1}B^*\) 半正定(\(n=1\) 时为 \(|a+b|^2/a\))。P18:\(A\) 非奇异 ⇒ \(A+A^{-*}\) 非奇异。
  • P19:\(A\) 正定、\(\|x\|=1\) ⇒ \((x^*Ax)^{-1}\le x^*A^{-1}x\),等号 ⇔ \(x\) 为特征向量;相关矩阵逆的对角元 \(\alpha_{ii}\ge1\),等号 ⇔ 第 \(p\) 行除对角外全零。(\(\alpha_{ii}\) 即回归中的方差膨胀因子 VIF。)
  • P20:正定 \(A,B\) 满足 \(A=SBS^*\) 的唯一正定 \(S=B^{-1/2}(B^{1/2}AB^{1/2})^{1/2}B^{-1/2}\)。
  • P21:半正定 \(A,B\) 交换 ⇒ \(AB\) 半正定;一般 \(AB\) 与 \(A^{1/2}BA^{1/2}\) 同特征值(实非负),\(A\) 正定时 \(AB\) 相似于非负对角阵。P22:正定 \(A,G,H\) 且 \(GAG=HAH\) ⇒ \(G=H\)。
  • P23 几何平均(geometric mean) \(G(A,B)=A^{1/2}(A^{-1/2}BA^{-1/2})^{1/2}A^{1/2}\):正定;交换时为 \(A^{1/2}B^{1/2}\);是 Riccati 方程 \(XA^{-1}X=B\) 的唯一正定解;\(G(A,B)=G(B,A)\);\(G(A,\bar A)\) 实等。
  • P24:半正定 \(A=X^*X\),所有 \(k\) 阶主子式为零 ⇔ 任意 \(k\) 列线性相关 ⇒ \(\operatorname{rank}A<k\);非半正定反例 \(\begin{bmatrix}0&1\\1&0\end{bmatrix}\)。
  • P25:分块半正定矩阵的压缩 \([\operatorname{tr}A_{ij}]\)、\([C_p(A_{ij})]\)、\([E_p(A_{ij})]\)、\([\det A_{ij}]\) 均半正定(Gram 矩阵论证)。
  • P26:半正定 \(A,B\):\(0\le\operatorname{tr}AB\le\|A\|_2\operatorname{tr}B\)(谱范数),\(\sqrt{\operatorname{tr}AB}\le\sqrt{\operatorname{tr}A}\sqrt{\operatorname{tr}B}\le\tfrac12(\operatorname{tr}A+\operatorname{tr}B)\)。P27:\(\|\sum A_i\|_2^2\ge\sum\|A_i\|_2^2\)(Frobenius)。
  • P28–P29:相关矩阵 ⇔ \(B\) 各列为单位向量;零空间向量“平衡”(\(|x_i|\le\sum_{j\ne i}|x_j|\));相关矩阵谱 \(\subset[0,n]\)(\(J_n\) 说明最优),正定时 \(\subset(0,n)\);三对角相关矩阵谱 \(\subset[0,2]\) 且关于 1 对称。
  • P30:\(A\) 正定、\(B\) Hermitian ⇒ \(AB\) 相似于实对角阵,且与 \(B\) 正负零特征值个数相同;\(A\) 奇异半正定时 \(AB\) 未必可对角化。
  • P31:实对称正定且非对角元 \(\le0\)(即 M 矩阵)⇒ \(A^{-1}\ge0\)(Neumann 级数 \(A^{-1}=\mu^{-1}\sum(\mu^{-1}B)^k\))。
  • P32:\(\mathbf C^n\) 上内积 ⇔ 存在正定 \(G\) 使 \(\langle x,y\rangle=y^*Gx\)。
  • P33:Jordan 积 \(]A,B[=AB+BA\):Hermitian;\(A,B\) 正定时迹为正但可有负特征值(例 \(A=\operatorname{diag}(20,1)\),\(B=\begin{bmatrix}2&1\\1&2\end{bmatrix}\));交换子 \([A,B]\) 反 Hermitian、迹 0。
  • P34–P36 量子系统:密度矩阵 \(R\)(半正定、迹 1;秩 1 为纯态)。协方差 \(\operatorname{Cov}_R(X,Y)=\operatorname{tr}(RXY^*)-\operatorname{tr}(RX)\operatorname{tr}(RY^*)\) 是半内积,\(\operatorname{Var}_R(X)=\operatorname{tr}(RXX^*)-|\operatorname{tr}(RX)|^2\),Cauchy–Schwarz:\(\operatorname{Var}_R(X)\operatorname{Var}_R(Y)\ge|\operatorname{Cov}_R(X,Y)|^2\)(7.2.12);Schrödinger 不确定性原理(7.2.13)\(\operatorname{Var}_R(A)\operatorname{Var}_R(B)\ge\tfrac14|\operatorname{tr}(R[A,B])|^2+\tfrac14(\operatorname{Cov}_R(A,B)+\operatorname{Cov}_R(B,A))^2\),弱化为 Heisenberg 不确定性原理(7.2.14)。Wigner–Yanase 相关 \(\operatorname{Corr}_R(X,Y)=\operatorname{tr}(RXY^*)-\operatorname{tr}(R^{1/2}XR^{1/2}Y^*)\) 与斜信息 \(I_R(A)=-\tfrac12\operatorname{tr}([R^{1/2},A]^2)\)(7.2.15),极化恒等式(7.2.16–17),不等式 (7.2.18),且 \(I_R(A)\le\operatorname{Var}_R(A)\);反例 \(R=\operatorname{diag}(4,9)\) 时 \(I_R(J_2(0))=-2\)(非正规 \(X\) 时可为负)。

7.3 极分解与奇异值分解(The polar and singular value decompositions)(PDF p.468–478,原书 p.448–458)

动机:复数 \(z=re^{i\theta}\),\(r=|z|\ge0\) 唯一(视为 \(1\times1\) 半正定阵),\(e^{i\theta}\) 模 1(\(1\times1\) 酉阵),仅当 \(z\ne0\) 时唯一。极分解是其矩阵版本,是 SVD 的直接推论。

Theorem 7.3.1(极分解,Polar decomposition):\(A\in M_{n,m}\)。 (a) \(n<m\):\(A=PU\),\(P\in M_n\) 半正定,\(U\in M_{n,m}\) 行正交规范。\(P=(AA^*)^{1/2}\) 唯一,且是 \(AA^*\) 的多项式;\(\operatorname{rank}A=n\) 时 \(U\) 唯一。 (b) \(n=m\):\(A=PU=UQ\),\(P,Q\) 半正定,\(U\) 酉。\(P=(AA^*)^{1/2}\)、\(Q=(A^*A)^{1/2}\) 唯一(分别是 \(AA^*\)、\(A^*A\) 的多项式);\(A\) 非奇异时 \(U\) 唯一。 (c) \(n>m\):\(A=UQ\),\(Q\in M_m\) 半正定,\(U\in M_{n,m}\) 列正交规范;\(Q=(A^*A)^{1/2}\) 唯一;\(\operatorname{rank}A=m\) 时 \(U\) 唯一。 (d) \(A\) 实时 \(P,Q,U\) 都可取实。 证明(基于 SVD 2.6.3:\(A=V\Sigma W^*\),\(q=\min\{n,m\}\),\(\Sigma_q\) 为奇异值对角阵):

  • (a) \(W=[W_1\ W_2]\),\(W_1\in M_{m,n}\),\(A=V[\Sigma_n\ 0]W^*=V\Sigma_nW_1^*=(V\Sigma_nV^*)(VW_1^*)=PU\)。\(P^2=V\Sigma_n^2V^*=AA^*\),由 7.2.6 唯一;\(\operatorname{rank}A=n\) 时 \(P\) 正定,\(U=P^{-1}A\) 唯一。
  • (b) \(A=(V\Sigma V^*)(VW^*)=(VW^*)(W\Sigma W^*)\),\(P=V\Sigma V^*\),\(Q=W\Sigma W^*\),\(U=VW^*\);非奇异时 \(U=P^{-1}A=AQ^{-1}\)。
  • (c) 对 \(A^*\) 用 (a)。(d) 实矩阵的 SVD 可取实正交因子(2.6.7)。 练习:非零向量 \(x\in M_{n,1}\) 的极分解 \(x=up\),\(p=\|x\|_2\),\(u=x/\|x\|_2\);用极分解证明 \(AA^*\) 与 \(A^*A\) 酉相似(\(A=PU\) ⇒ \(AA^*=P^2=U(U^*P^2U)=UA^*AU^*\),相似矩阵为 \(U\))。

Theorem 7.3.2(薄 SVD;任意对角化 \(A^*A\) 的酉阵都可作右奇异向量阵):\(A\in M_{n,m}\),\(r=\operatorname{rank}A\),设 \(A^*A=W\Lambda W^*\),\(W\in M_m\) 酉,\(\Lambda=\operatorname{diag}(\sigma_1^2,\dots,\sigma_r^2)\oplus0_{m-r}\),\(\sigma_1\ge\dots\ge\sigma_r>0\) 为正奇异值。\(\Sigma_r=\operatorname{diag}(\sigma_1,\dots,\sigma_r)\),\(\Sigma=\begin{bmatrix}\Sigma_r&0\\0&0\end{bmatrix}\in M_{n,m}\)。 (a) thin SVD:\(W=[W_1\ W_2]\),\(W_1\in M_{m,r}\),存在列正交规范 \(V_1\in M_{n,r}\) 使 \(A=V_1\Sigma_rW_1^*\); (b) 存在酉 \(V\in M_n\) 使 \(A=V\Sigma W^*\);(c) \(A\) 实时 \(W,V,V_1\) 可取实。 证明:\(D=\Sigma_r\oplus I_{m-r}\),\(X=AWD^{-1}=[V_1\ Z]\),则 \(X^*X=D^{-1}\Lambda D^{-1}=I_r\oplus0_{m-r}\),比较分块得 \(Z=0\)、\(V_1^*V_1=I\),于是 \(A=XDW^*=V_1\Sigma_rW_1^*\);把 \(V_1\) 扩充为酉阵 \(V=[V_1\ V_2]\) 得 (b)。(意义:计算上可先对 \(A^*A\) 做特征分解,再得左奇异向量 \(V_1=AW_1\Sigma_r^{-1}\)——即 PCA 中由协方差特征向量求主成分得分的公式。)

Theorem 7.3.3(Jordan–Wielandt 矩阵):\(A\in M_{n,m}\),\(q=\min\{n,m\}\),奇异值 \(\sigma_1\ge\dots\ge\sigma_q\)。Hermitian 矩阵

\[\mathcal A=\begin{bmatrix}0&A\\A^*&0\end{bmatrix}\quad(7.3.4)\]
的特征值依次为 \(-\sigma_1\le\dots\le-\sigma_q\le\underbrace{0=\dots=0}_{|n-m|}\le\sigma_q\le\dots\le\sigma_1\)。 证明:设 \(n\ge m\),\(A=V\Sigma W^*\),\(\Sigma=[\Sigma_m\ 0]^T\),\(V=[V_1\ V_2]\),\(\hat V=V_1/\sqrt2\),\(\hat W=W/\sqrt2\),\(U=\begin{bmatrix}\hat V&-\hat V&V_2\\\hat W&\hat W&0\end{bmatrix}\) 为酉阵,且 \(\mathcal A=U(\Sigma_m\oplus(-\Sigma_m)\oplus0_{n-m})U^*\)。\(m<n\) 时考虑 \(A^*\)。(实情形由 C. Jordan 1874 发表;\(\mathcal A\) 又称 Wielandt 矩阵。) 这是把 Hermitian 特征值结论“搬运”到一般矩阵奇异值的桥梁(与 \(A^*A\) 相比,它与奇异值关系是线性的)。

Corollary 7.3.5(奇异值扰动界):\(A,B\in M_{n,m}\),\(q=\min\{m,n\}\),奇异值递减排列。 (a) \(|\sigma_i(A)-\sigma_i(B)|\le\|A-B\|_2\)(谱范数 \(\|\cdot\|_2\) 即最大奇异值),\(i=1,\dots,q\); (b) \(\sum_{i=1}^q(\sigma_i(A)-\sigma_i(B))^2\le\|A-B\|_2^2\)(Frobenius 范数)。 证明:令 \(E=A-B\),对 \(\mathcal A\) 与 \(\mathcal E\) 分别用 Weyl 不等式(6.3.4.1)和 Hermitian 情形的 Hoffman–Wielandt 定理(6.3.9)。意义:奇异值关于矩阵扰动是 1-Lipschitz 的,数值稳定。

Corollary 7.3.6(删行/列的奇异值交错):\(\hat A\) 为 \(A\) 删去一行或一列,\(\hat\sigma\) 为其奇异值(若 \(n\ge m\) 删列或 \(n\le m\) 删行,令 \(\hat\sigma_q=0\))。则

\[\sigma_1\ge\hat\sigma_1\ge\sigma_2\ge\hat\sigma_2\ge\dots\ge\sigma_q\ge\hat\sigma_q\quad(7.3.7)\]
证明:删 \(A\) 的第 \(i\) 行对应删 \(\mathcal A\) 的第 \(i\) 行第 \(i\) 列;删第 \(j\) 列对应删 \(\mathcal A\) 的第 \(n+j\) 行列。用加边矩阵的 Cauchy 交错定理(4.3.17)。

Theorem 7.3.8(奇异值的 Courant–Fischer 极小极大刻画):\(A\in M_{n,m}\),\(k\in\{1,\dots,q\}\):

\[\sigma_k(A)=\min_{\{S:\dim S=m-k+1\}}\ \max_{\{x:0\ne x\in S\}}\frac{\|Ax\|_2}{\|x\|_2}\quad(7.3.9)\]
\[\sigma_k(A)=\max_{\{S:\dim S=k\}}\ \min_{\{x:0\ne x\in S\}}\frac{\|Ax\|_2}{\|x\|_2}\quad(7.3.10)\]
证明:\(\sigma_k^2(A)=\lambda_{m-k+1}(A^*A)\)(特征值递增排列),代入 4.2.7、4.2.8 的 Courant–Fischer,\(x^*A^*Ax/x^*x=\|Ax\|_2^2/\|x\|_2^2\)。 练习:\(\|Ax\|_2\le\sigma_1(A)\|x\|_2\);\(\sigma_k(AB)\le\sigma_1(A)\sigma_k(B)\)。

Theorem 7.3.11(\(A^*A=B^*B\) 的刻画):\(p\le q\),\(A\in M_{p,n}\),\(B\in M_{q,n}\)。则 \(A^*A=B^*B\) ⇔ 存在列正交规范 \(V\in M_{q,p}\) 使 \(B=VA\)。实情形 \(V\) 可取实。 证明:充分性显然。必要性:由 7.3.2 写 \(A=V_1\Sigma_rW_1^*\)、\(B=V_2\Sigma_rW_1^*\)(同一 \(W_1\)、同一 \(\Sigma_r\)),\(\hat V_1=\begin{bmatrix}V_1\\0\end{bmatrix}\in M_{q,r}\);由 2.1.18 存在酉 \(U\) 使 \(V_2=U\hat V_1\);分块 \(U=[V\ Z]\),\(V\in M_{q,p}\),则 \(V_2=VV_1\),\(B=VV_1\Sigma_rW_1^*=VA\)。 典型用法:已知 \(X^*X=Y^*Y\) 且 \(Y\) 有特殊结构,则 \(X=VY\)(见 P34:由 Cholesky 推 QR)。量化意义:两个数据矩阵具有相同 Gram(协方差)矩阵,当且仅当它们相差一个正交变换——因子模型旋转不定性的本质。

7.3 习题概要(P1–P45)

  • P1:奇异值 = 极分解中 \(P\)、\(Q\) 的特征值。P2:\(A,B\) 酉等价 ⇔ \(P_1,P_2\) 酉相似。P3:方阵有零奇异值 ⇔ 有零特征值。
  • P4:左右奇异向量关系 \(A^*v_k=\sigma_kw_k\),\(Aw_k=\sigma_kv_k\),\(v_k^*Aw_k=\sigma_k\);\(\sigma_i=\max\{\|Ax\|:x\in\operatorname{span}\{w_i,\dots,w_n\}\}=\min\{\|Ax\|:x\in\operatorname{span}\{w_1,\dots,w_i\}\}\)。
  • P5:单重非零奇异值的导数 \(\frac{d}{dt}\sigma_k(A+tE)|_{t=0}=\operatorname{Re}v_k^*Ew_k\)(7.3.12)。P6:\(\sigma_1\) 关于加边参数的极小化。
  • P7 Moore–Penrose 广义逆(Moore–Penrose generalized inverse):\(A^\dagger=W\Sigma^\dagger V^*\),满足 \(AA^\dagger\)、\(A^\dagger A\) Hermitian,\(AA^\dagger A=A\),\(A^\dagger AA^\dagger=A^\dagger\),且由此三条(加 Hermitian 条件)唯一确定;非奇异时 \(A^\dagger=A^{-1}\),\((A^\dagger)^\dagger=A\)。
  • P8:广义 Schur 补 \(D-C^*B^\dagger C\),半正定 \(A\) *合同于 \(B\oplus(D-C^*B^\dagger C)\)。
  • P9 最小二乘:\(x=A^\dagger b\) 是 \(Ax=b\) 的唯一最小范数最小二乘解。P15:\(A^\dagger=\lim_{t\to0}A^*(AA^*+tI)^{-1}\)(岭回归在 \(\lambda\to0\) 的极限)。
  • P10:SVD 给出四个基本子空间的正交基(\(W\) 后 \(n-r\) 列为零空间,\(V\) 前 \(r\) 列为值域,等)。P11:\(\sigma_1(A)=\max|x^*Ay|\)(单位向量)。P12:堆叠矩阵 SVD 求零空间交与值域和。P13:由极分解推 SVD。P14:\(A\) 可对角化 ⇔ 存在正定 \(P\) 使 \(P^{-1}AP\) 正规。
  • P16:奇异值的 Weyl 不等式 \(\sigma_{i+j-1}(A+B)\le\sigma_i(A)+\sigma_j(B)\)(7.3.13),\(\sigma_{i+j-1}(AB^*)\le\sigma_i(A)\sigma_j(B)\)(7.3.14);推论 \(|\sigma_i(A+B)-\sigma_i(A)|\le\sigma_1(B)\)(7.3.15)。
  • P17:Weyl 乘积不等式(乘性优超)\(|\lambda_1\cdots\lambda_k|\le\sigma_1\cdots\sigma_k\)(7.3.16,\(k=n\) 时取等)及加性 \(\sum_{i\le k}|\lambda_i|\le\sum_{i\le k}\sigma_i\)(7.3.17)。
  • P18:\(\sum|\lambda_i|\le\sum\sigma_i\)(7.3.18),等号 ⇔ \(A\) 正规;\(|\operatorname{tr}A|\le\sum\sigma_i\)(7.3.19),等号 ⇔ \(A\) 半正定 Hermitian(借助 Schur 三角化与对角酉阵证明)。
  • P19:\(AB\) 与 \(BA\) 特征值相同但奇异值可不同;\(A,B\) Hermitian 或正规时相同。P20:用 Rayleigh 商估计奇异值所在区间。P21:小扰动不能降秩、但可升秩(“小”指小于最小正奇异值)。
  • P22:\(A,B\) 酉等价 ⇔ \(\operatorname{tr}((A^*A)^k)=\operatorname{tr}((B^*B)^k)\),\(k=1..n\)。P23:\(AA^*=BB^*\) ⇔ \(A=BU\);P24:酉等价 ⇔ \(\begin{bmatrix}0&A\\A^*&0\end{bmatrix}\) 与 \(\begin{bmatrix}0&B\\B^*&0\end{bmatrix}\) 酉相似。
  • P25:\(|\operatorname{tr}(UA)|\le\sum|a_{ij}|\),\(\sum\sigma_i\le\sum|a_{ij}|\)。
  • P26–P29 \(2\times2\) 显式公式:半正定 \(A\in M_2\):\(A^{1/2}=\tau^{-1}(A+\sqrt{\det A}I_2)\),\(\tau=(\operatorname{tr}A+2\sqrt{\det A})^{1/2}\);极分解 \(P=s^{-1}(AA^*+|\det A|I)\),\(Q=s^{-1}(A^*A+|\det A|I)\),\(s=(\|A\|_2^2+2|\det A|)^{1/2}\);\(U=\delta^{-1/2}(A+e^{i\theta}\operatorname{adj}A^*)\),\(\delta=(\sigma_1+\sigma_2)^2\);P29 对 \(\begin{bmatrix}0&-1\\0&0\end{bmatrix}\) 计算。
  • P30:\(\sigma_i(A^{-1})=\sigma_{n-i+1}^{-1}\)。P31:\(A\) 为酉阵的数量倍 ⇔ 奇异值全等。P32:薄 SVD 给出满秩分解 \(A=XY^*\),\(r\) 个无关行与 \(r\) 个无关列交出的子矩阵非奇异。P33:薄 SVD 的另一推导。P34:由 Cholesky(及 7.3.11)推出 QR 分解。 P35:\(A=PU\) 正规 ⇔ \(PU=UP\)。P36:奇异值互异的正规阵。
  • P37–P41:*合同、相似与极分解酉因子的关系;正规矩阵 *合同 ⇔ 秩相同且每条从原点出发的射线上非零特征值个数相同。P42:补零不改变非零奇异值。P43:酉不变范数下 \(A\) 正规、\(B\) Hermitian ⇒ \(\|AB\|=\|BA\|\)。P44:删去 \(p\) 行列后奇异值交错 \(\sigma_i(A)\ge\sigma_i(\hat A)\ge\sigma_{i+p}(A)\)(7.3.20)。P45:\(A\) 与 \(B\) 酉相似 ⇔ 存在 \(S\) 使 \(A=SBS^{-1}\) 且 \(A^*=SB^*S^{-1}\)。
  • 注记与延伸阅读:Horn & Olkin (1996) “When does \(A^*A=B^*B\)…”;\(2\times2\) 与伴随矩阵的显式极分解文献。

7.4 极分解与奇异值分解的推论(Consequences of the polar and singular value decompositions)(PDF p.478–,原书 p.458–)

本节记号:\(X\in M_{m,n}\),\(q=\min\{m,n\}\),奇异值 \(\sigma_1(X)\ge\dots\ge\sigma_q(X)\);\(\Sigma(X)=[s_{ij}]\in M_{m,n}\) 为对角阵,\(s_{ii}=\sigma_i(X)\)。Frobenius 内积 \(\langle A,B\rangle_F=\operatorname{tr}(AB^*)\)。

7.4.1 von Neumann 迹定理(von Neumann's trace theorem)(PDF p.478–481)

Theorem 7.4.1.1(von Neumann):\(A,B\in M_{m,n}\),则

\[\operatorname{Re}\operatorname{tr}(AB^*)\le\sum_{i=1}^q\sigma_i(A)\sigma_i(B)\quad(7.4.1.2)\]
证明:\(m=n\) 时即 8.7.6(第 8 章用 Birkhoff 定理证明核心不等式)。\(m>n\) 时补零列 \(\mathcal A=[A\ 0]\)、\(\mathcal B=[B\ 0]\in M_m\),\(\mathcal A\mathcal B^*=AB^*\);\(m<n\) 时补零行,\(\mathcal A\mathcal B^*=\begin{bmatrix}AB^*&0\\0&0\end{bmatrix}\)。补零不改变非零奇异值。

Corollary 7.4.1.3: (a) \(\|A-B\|_2^2\ge\sum_{i=1}^q(\sigma_i(A)-\sigma_i(B))^2\)(Frobenius); (b) \(\sum_{i=1}^q\sigma_i(A)=\max_{U\in M_n\text{ 酉}}\operatorname{Re}\operatorname{tr}(AU)\)(\(m\le n\)),\(=\max_{U\in M_m\text{ 酉}}\operatorname{Re}\operatorname{tr}(UA)\)(\(m\ge n\)); (c) \(\sum_i\sigma_i(A)\sigma_i(B)=\max\{\operatorname{Re}\operatorname{tr}(ATB^*U):T\in M_n,U\in M_m\text{ 酉}\}\); (d) \(\sum_i\sigma_i(AB^*)\le\sum_i\sigma_i(A)\sigma_i(B)\)。 证明:(a) \(\|A-B\|_2^2=\sum\sigma_i^2(A)-2\operatorname{Re}\operatorname{tr}(AB^*)+\sum\sigma_i^2(B)\ge\sum(\sigma_i(A)-\sigma_i(B))^2\)。(b) 由 7.4.1.2 及 \(\sigma_i(U^*)=1\) 得上界;取极分解 \(A=PU\) 时 \(\operatorname{Re}\operatorname{tr}(AU^*)=\operatorname{tr}P=\sum\sigma_i\) 达到上界(\(m\ge n\) 用 \(A=UQ\))。(c) 上界同理;取 \(A=V_1\Sigma_1W_1^*\),\(B=V_2\Sigma_2W_2^*\),\(T=W_1W_2^*\),\(U=V_2V_1^*\),则 \(ATB^*U=V_1\Sigma_1\Sigma_2^TV_1^*\),迹 \(=\sum\sigma_i(A)\sigma_i(B)\)。(d) 设 \(AB^*=PU\),\(\sum\sigma_i(AB^*)=\operatorname{tr}P=\operatorname{Re}\operatorname{tr}(AB^*U^*)\le\sum\sigma_i(A)\sigma_i(U^*B)\)……\(=\sum\sigma_i(A)\sigma_i(B)\)。

Theorem 7.4.1.4(\(\operatorname{Re}\operatorname{tr}A=\sum\sigma_i\) 的等号刻画):\(A=[a_{ij}]\in M_{m,n}\),\(p=\max\{m,n\}\),\(\alpha=\{1,\dots,q\}\)。则 \(\operatorname{Re}\operatorname{tr}A\le\sum_{i=1}^q\sigma_i\),等号 ⇔ 主子矩阵 \(A[\alpha]\) 半正定且 \(A\) 在其外无非零元。特别地,方阵 \(A\):\(\operatorname{Re}\operatorname{tr}A=\sum\sigma_i(A)\) ⇔ \(A\) 半正定。 证明(必要性):补零成 \(\mathcal A\in M_p\),薄 SVD \(\mathcal A=V\Sigma_rW^*\),\(V=[v_1\dots v_r]\),\(W=[w_1\dots w_r]\)。

\[\operatorname{Re}\operatorname{tr}\mathcal A=\operatorname{Re}\sum_i\sum_k v_{ik}\sigma_k\bar w_{ik}=\sum_k\sigma_k\operatorname{Re}(w_k^*v_k)=\sum_k\sigma_k\]
因 \(\operatorname{Re}(w_k^*v_k)\le|w_k^*v_k|\le\|v_k\|\|w_k\|=1\),必须每个 \(\operatorname{Re}(w_k^*v_k)=1\);Cauchy–Schwarz 等号得 \(v_k=d_kw_k\),再由实部为 1 得 \(d_k=1\)。故 \(V=W\),\(\mathcal A=V\Sigma_rV^*\) 半正定,用 7.1.2 与 7.1.10 收尾。

Corollary 7.4.1.5:(a) 7.4.1.3(a) 取等 ⇔ \(\operatorname{Re}\operatorname{tr}(AB^*)=\sum\sigma_i(A)\sigma_i(B)\);(b) 若取等,则 \(AB^*\) 与 \(B^*A\) 都半正定,从而 \(\operatorname{tr}(AB^*)\) 实非负。证明:\(\operatorname{Re}\operatorname{tr}(AB^*)\le\sum\sigma_i(AB^*)\le\sum\sigma_i(A)\sigma_i(B)=\operatorname{Re}\operatorname{tr}(AB^*)\),由 7.4.1.4 得 \(AB^*\) 半正定;对 \(\|B^*-A^*\|\) 同理得 \(B^*A\) 半正定。

7.4.2 最近奇异矩阵与最佳秩 \(k\) 逼近(Eckart–Young)(PDF p.481–482)

设 \(A=V\Sigma W^*\in M_n\),\(\sigma_n(A)>0\)。若 \(B\) 奇异则 \(\sigma_n(B)=0\),由 7.4.1.3(a)

\[\|A-B\|_2^2\ge\sum_{i=1}^{n-1}(\sigma_i(A)-\sigma_i(B))^2+\sigma_n^2(A)\ge\sigma_n^2(A).\]
取 \(\Sigma_0=\operatorname{diag}(\sigma_1,\dots,\sigma_{n-1},0)\),\(B_0=V\Sigma_0W^*\),\(\|A-B_0\|_2=\sigma_n(A)\)——\(A\) 到奇异矩阵集合的 Frobenius 距离为 \(\sigma_n(A)\),最近奇异矩阵的奇异值必为 \(\sigma_1,\dots,\sigma_{n-1},0\),且 \(AB_0^*\)、\(B_0^*A\) 半正定(符合 7.4.1.5)。唯一性:若 \(\sigma_{n-1}=\sigma_n\),可取 \(\hat\Sigma_0=\operatorname{diag}(\sigma_1,\dots,\sigma_{n-2},0,\sigma_n)\) 得另一最近奇异阵 \(C_0\ne B_0\),不唯一;若 \(\sigma_{n-1}>\sigma_n\) 则 \(B_0\) 唯一(P17)。 最佳秩 \(k\) 逼近:\(A\in M_{m,n}\),\(\operatorname{rank}A=r\),\(1\le k<r\)。对任意 \(\operatorname{rank}B=k\):
\[\|A-B\|_2^2\ge\sum_{i=1}^k(\sigma_i(A)-\sigma_i(B))^2+\sum_{i=k+1}^q\sigma_i^2(A)\ge\sum_{i=k+1}^q\sigma_i^2(A).\]
截断 SVD \(B_0=V\Sigma_0W^*\)(保留前 \(k\) 个奇异值)达到下界;最佳逼近唯一 ⇔ \(\sigma_k(A)>\sigma_{k+1}(A)\);Frobenius 距离为 \((\sum_{i>k}\sigma_i^2)^{1/2}\)。(这就是 PCA / 低秩因子模型的数学基础。)

7.4.3 线性方程组的最小二乘解(PDF p.482)

\(A\in M_{m,n}\),\(m\ge n\),\(\operatorname{rank}A=k\),\(A=V\Sigma W^*\),\(V=[v_1\dots v_m]\),\(W=[w_1\dots w_n]\)。\(\|Ax-b\|_2=\|\Sigma W^*x-V^*b\|_2\)。令 \(\xi=W^*x\),\(\beta=V^*b\),则

\[\Sigma\xi-\beta=[\sigma_1\xi_1-\beta_1,\dots,\sigma_k\xi_k-\beta_k,\beta_{k+1},\dots,\beta_m]^T,\]
取 \(\xi_i=\sigma_i^{-1}\beta_i=\sigma_i^{-1}v_i^*b\)(\(i\le k\))使残差最小,取 \(\xi_i=0\)(\(i>k\))使 \(\|x\|\) 最小。于是
\[x=\sum_{i=1}^k(\sigma_i^{-1}v_i^*b)\,w_i\]
是使 \(\|Ax-b\|_2\) 达到最小值 \((\sum_{i=k+1}^m|v_i^*b|^2)^{1/2}\) 的最小范数解(即 \(x=A^\dagger b\))。练习:\(\operatorname{rank}A=n\) 时 \(Ax=b\) 有解 ⇔ \(b\perp\operatorname{null}A^*\);解唯一,\(x=(A^*A)^{-1}A^*b\)(正规方程,OLS 公式)。

7.4.4 用酉阵的数量倍逼近(PDF p.482–483)

对任意酉 \(U\) 和 \(c\in\mathbf C\):\(\|A-cU\|_2^2\ge\sum(\sigma_i(A)-|c|)^2=\sum\sigma_i^2-2|c|\sum\sigma_i+n|c|^2\),在 \(|c|=\mu=\frac1n\sum\sigma_i(A)\)(奇异值均值)处最小,下界 \(\sum(\sigma_i(A)-\mu)^2=\|A\|_2^2-n\mu^2\)。取极分解 \(A=PU_0\),\(\|PU_0-\mu U_0\|_2^2=\|P-\mu I\|_2^2=\operatorname{tr}P^2-2\mu\operatorname{tr}P+n\mu^2=\|A\|_2^2-n\mu^2\),故 \((\frac1n\operatorname{tr}P)U_0\) 为最佳逼近。

7.4.5 酉 Procrustes 问题(The unitary Procrustes problem)(PDF p.483)

\(A,B\in M_{m,n}\),求酉 \(U\in M_m\) 使 \(\|A-UB\|_2\) 最小(因子分析中的“Procrustes 旋转”)。

\[\|A-UB\|_2^2=\|A\|_2^2-2\operatorname{Re}\operatorname{tr}(AB^*U^*)+\|B\|_2^2\ge\|A\|_2^2-2\sum_{i=1}^m\sigma_i(AB^*)+\|B\|_2^2\quad(7.4.5.1)\]
等号 ⇔ \(AB^*U^*\) 半正定。若 \(AB^*=PU_0\) 为极分解,则 \(AB^*U_0^*=P\),\(U_0B\) 为最佳逼近,最小值 \(\|A\|_2^2-2\operatorname{tr}P+\|B\|_2^2\)。算法:计算 \(AB^*\) 的 SVD \(V\Sigma W^*\),取 \(U_0=VW^*\)。

7.4.6 双边旋转问题(PDF p.483)

求酉 \(U\in M_m\)、\(T\in M_n\) 使 \(\|A-UBT\|_2\) 最小。由 7.4.1.3(a),\(\|A-UBT\|_2^2\ge\sum(\sigma_i(A)-\sigma_i(B))^2\)(7.4.6.1);取 \(A=V_1\Sigma_1W_1^*\),\(B=V_2\Sigma_2W_2^*\),\(U_0=V_1V_2^*\),\(T_0=W_2W_1^*\),则 \(\|A-U_0BT_0\|_2^2=\|\Sigma_1-\Sigma_2\|_2^2\) 达到下界。

7.4.7 酉不变范数与对称规范函数(Unitarily invariant norms and symmetric gauge functions)(PDF p.484–485)

酉不变范数(unitarily invariant norm)满足 \(\|UAV\|=\|A\|\),故 \(\|A\|=\|\Sigma\|\) 只依赖奇异值。对 \(x\in\mathbf C^q\),令 \(X\) 为对角元 \(x_i\) 的对角阵(奇异值为 \(|x_1|,\dots,|x_q|\)),定义 \(g(x)=\|X\|\)。\(g\) 继承:(a) 非负;(b) 正定;(c) 齐次;(d) 三角不等式——故为 \(\mathbf C^q\) 上的范数;且 (e) 是绝对范数(absolute norm,\(g(x)=g(|x|)\));(f) 置换不变 \(g(Px)=g(x)\)。 练习:Frobenius 范数、谱范数、迹范数对应的 \(g\) 分别为 Euclid 范数、max 范数、sum 范数。

Definition 7.4.7.1:\(g:\mathbf C^q\to\mathbf R^+\) 若为绝对向量范数且置换不变,称为对称规范函数(symmetric gauge function)。

Theorem 7.4.7.2(von Neumann 对应):记 \(s(A)=[\sigma_1(A)\dots\sigma_q(A)]^T\)。 (a) 若 \(\|\cdot\|\) 为 \(M_{m,n}\) 上酉不变范数,则 \(g(x)=\|\operatorname{diag}(x)\|\) 是 \(\mathbf C^q\) 上对称规范函数; (b) 若 \(g\) 是对称规范函数,则 \(\|A\|=g(s(A))\) 是 \(M_{m,n}\) 上酉不变范数。 二者一一对应。证明 (b):良定义、酉不变、正定、齐次都直接;三角不等式利用对偶范数 \(g^D\) 与 \(g^{DD}=g\)(5.5.9(c)、5.5.10)及 7.4.1.3(c):

\[\|A+B\|=g^{DD}(s(A+B))=\max_{g^D(y)=1}\operatorname{Re}(y^*s(A+B))=\max_{g^D(s(\Sigma))=1}\max_{T,U}\operatorname{Re}\operatorname{tr}((A+B)T\Sigma^*U)\]
\[\le\max\max\operatorname{Re}\operatorname{tr}(AT\Sigma^*U)+\max\max\operatorname{Re}\operatorname{tr}(BT\Sigma^*U)=g(s(A))+g(s(B)).\]
(用到 \(s(\cdot)\) 非负,只需在非负 \(y\) 上取最大,以及 4.3.52。) 例:\(\ell_p\) 范数对应的酉不变范数称 Schatten \(p\)-范数(\(p=1\) 核范数 / 迹范数,\(p=2\) Frobenius,\(p=\infty\) 谱范数)。

7.4.8 Ky Fan 占优定理(Ky Fan's dominance theorem)(PDF p.486–487)

Ky Fan \(k\)-范数:

\[\|A\|_{[k]}=\sigma_1(A)+\dots+\sigma_k(A),\quad k=1,\dots,q\quad(7.4.8.1)\]
对任一酉不变范数及其规范函数 \(g\):\(\|A\|=\max_{g^D(s(\Sigma))=1}\sum_i\sigma_i(A)\sigma_i(\Sigma)\)(7.4.8.2)。分部求和(Abel summation):
\[\sum_{i=1}^q\sigma_i(A)\sigma_i(\Sigma)=\sum_{i=1}^{q-1}(\sigma_i(\Sigma)-\sigma_{i+1}(\Sigma))\|A\|_{[i]}+\sigma_q(\Sigma)\|A\|_{[q]}\quad(7.4.8.3)\]
系数全非负,所以若 \(\|A\|_{[k]}\le\|B\|_{[k]}\) 对所有 \(k\) 成立,则每个 \(\sum\sigma_i(A)\sigma_i(\Sigma)\le\sum\sigma_i(B)\sigma_i(\Sigma)\),取最大得 \(\|A\|\le\|B\|\)。

Theorem 7.4.8.4(Ky Fan 占优定理):\(\|A\|\le\|B\|\) 对所有酉不变范数成立 ⇔ \(\|A\|_{[k]}\le\|B\|_{[k]}\),\(k=1,\dots,q\)(即奇异值向量弱优超)。

7.4.9 酉不变范数下的逼近界(PDF p.487–489)

Theorem 7.4.9.1:\(A=V_1\Sigma(A)W_1^*\),\(B=V_2\Sigma(B)W_2^*\),则对每个酉不变范数 \(\|A-B\|\ge\|\Sigma(A)-\Sigma(B)\|\)。 证明:\(\mathcal A=\begin{bmatrix}0&A\\A^*&0\end{bmatrix}\)、\(\mathcal B\) 同理。由 7.3.3,\(\mathcal A\) 与 \(\mathcal B\) 递减特征值之差为 \(\pm(\sigma_i(A)-\sigma_i(B))\) 及 \(|m-n|\) 个零,代数最大的 \(q\) 个是 \(|\sigma_i(A)-\sigma_i(B)|\)。由 4.3.47(b),\(\lambda(\mathcal A-\mathcal B)\) 优超 \(\lambda^\downarrow(\mathcal A)-\lambda^\downarrow(\mathcal B)\),即 \(\sum_{i\le k}\sigma_i(A-B)\ge\max_{i_1<\dots<i_k}\sum_j|\sigma_{i_j}(A)-\sigma_{i_j}(B)|\),也就是 \(\|A-B\|_{[k]}\ge\|\Sigma(A)-\Sigma(B)\|_{[k]}\),再用 Ky Fan 占优定理。 推论(Eckart–Young–Mirsky):对 \(\operatorname{rank}B=k\),利用对角阵上酉不变范数是单调范数,

\[\|A-B\|\ge\|\operatorname{diag}(\sigma_1(A)-\sigma_1(B),\dots,\sigma_k(A)-\sigma_k(B),\sigma_{k+1}(A),\dots,\sigma_q(A))\|\ge\|\operatorname{diag}(0,\dots,0,\sigma_{k+1}(A),\dots,\sigma_q(A))\|\quad(7.4.9.2)\]
截断 SVD 在所有酉不变范数下同时为最佳秩 \(k\) 逼近。练习:谱范数下的最小误差为 \(\sigma_{k+1}(A)\)。

Corollary 7.4.9.3(Mirsky):\(A,B\in M_n\) Hermitian,\(\operatorname{diag}\lambda^\downarrow(\cdot)\) 为递减特征值对角阵,则对任意酉不变范数

\[\|\operatorname{diag}\lambda^\downarrow(A)-\operatorname{diag}\lambda^\downarrow(B)\|\le\|A-B\|\quad(7.4.9.4)\]
证明:取 \(\mu\ge0\) 使 \(A+\mu I\)、\(B+\mu I\) 半正定,此时 \(\Sigma(A+\mu I)=\operatorname{diag}\lambda^\downarrow(A)+\mu I\),代入 7.4.9.1。这是 Hoffman–Wielandt 定理(6.3.8)对所有酉不变范数的推广;Weyl 界(6.3.4)是谱范数特例。

7.4.10 酉不变矩阵范数(PDF p.489)

矩阵范数(matrix norm)需满足次乘性 \(\|AB\|\le\|A\|\|B\|\)。对任意酉不变矩阵范数有 \(\|A\|\ge\sigma_1(A)\)(5.6.34(d))。 Theorem 7.4.10.1:\(M_n\) 上酉不变范数是矩阵范数 ⇔ \(\|A\|\ge\sigma_1(A)\) 对所有 \(A\)。证明:用 \(g\) 的单调性与 \(\sigma_k(AB)\le\sigma_1(A)\sigma_k(B)\):\(\|AB\|=g(s(AB))\le g(\sigma_1(A)s(B))=\sigma_1(A)\|B\|\le\|A\|\|B\|\)。 推论:Ky Fan \(k\)-范数、Schatten \(p\)-范数(\(p\ge1\))都是酉不变矩阵范数。 Corollary 7.4.10.2:酉不变矩阵范数的凸组合仍是酉不变矩阵范数(一般矩阵范数的凸组合未必是矩阵范数,见 5.6.P9)。

7.4.11 绝对酉不变范数(PDF p.489–490)

Frobenius 范数 \(\|A\|_2=(\sum\sigma_i^2)^{1/2}=(\sum|a_{ij}|^2)^{1/2}\) 既酉不变又是绝对范数(只依赖 \(|a_{ij}|\))。 练习(构造工具):\(\alpha\ge\beta>0\),\(a=\frac12(\sqrt{\alpha^2+\beta^2}+\alpha-\beta)\),\(b=\sqrt{\alpha\beta/2}\),\(c=\frac12(\sqrt{\alpha^2+\beta^2}-\alpha+\beta)\),\(B_\pm=\begin{bmatrix}a&b\\b&\pm c\end{bmatrix}\):\(B_+\) 奇异值为 \(\sqrt{\alpha^2+\beta^2}\) 与 0,\(B_-\) 奇异值为 \(\alpha,\beta\);二者元素绝对值相同。 Theorem 7.4.11.1:\(M_{m,n}\) 上酉不变范数是绝对范数 ⇔ 它是 Frobenius 范数的正数倍。 证明:归一化 \(\|E_{11}\|=1\)。秩 1:\(\|A\|=\sigma_1\|E_{11}\|=\sigma_1=\|A\|_2\)。秩 2:用上面的 \(A_\pm\)(\(B_\pm\) 以 \(\sigma_1,\sigma_2\) 构造),\(A_-\) 与 \(A\) 同奇异值,\(A_+\) 秩 1 且 \(\|A_+\|=\sqrt{\sigma_1^2+\sigma_2^2}=\|A\|_2\);绝对性给出 \(\|A_-\|=\|A_+\|\),故 \(\|A\|=\|A\|_2\)。对秩归纳(把 \(\sigma_1,\sigma_r\) 合并为 \(\sqrt{\sigma_1^2+\sigma_r^2}\) 降秩)。练习:由此知 \(n\ge2\) 时谱范数不是绝对范数。

7.4.12 Kantorovich 与 Wielandt 不等式(Inequalities of Kantorovich and Wielandt)(PDF p.490–493)

设 \(A\in M_n\) 正定,\(\lambda_1\)、\(\lambda_n\) 为最小、最大特征值。 Kantorovich 不等式:

\[(x^*Ax)(x^*A^{-1}x)\le\frac{(\lambda_1+\lambda_n)^2}{4\lambda_1\lambda_n}\|x\|_2^4\quad\forall x\in\mathbf C^n\quad(7.4.12.1)\]
Wielandt 不等式:
\[|x^*Ay|^2\le\Big(\frac{\lambda_1-\lambda_n}{\lambda_1+\lambda_n}\Big)^2(x^*Ax)(y^*Ay)\quad\forall\ x\perp y\quad(7.4.12.2)\]
Kantorovich 的证明:\(\lambda_nI-A\)、\(A-\lambda_1I\) 半正定,\(A^{-1}\) 正定,三者交换,乘积半正定:
\[0\le x^*(\lambda_nI-A)(A-\lambda_1I)A^{-1}x=x^*((\lambda_1+\lambda_n)I-\lambda_1\lambda_nA^{-1}-A)x,\]
即 \(x^*Ax+\lambda_1\lambda_n(x^*A^{-1}x)\le(\lambda_1+\lambda_n)x^*x\)(7.4.12.3)。令 \(t_0=\lambda_1\lambda_n(x^*A^{-1}x)\),乘以 \(t_0\):\(t_0(x^*Ax)\le t_0(\lambda_1+\lambda_n)(x^*x)-t_0^2\)(7.4.12.4)。右端是 \(t\) 的凹二次函数,最大值 \((x^*x)^2(\lambda_1+\lambda_n)^2/4\),得结论。 Kantorovich ⇒ Wielandt:对 \(2\times2\) 正定 \(B=\begin{bmatrix}a&b\\\bar b&c\end{bmatrix}\)(特征值 \(\mu_1\le\mu_2\)),取 \(x=e_1\):\(\frac{(\mu_1+\mu_2)^2}{4\mu_1\mu_2}\ge\frac{ac}{ac-|b|^2}\),整理得
\[\frac{|b|^2}{ac}\le\Big(\frac{\mu_1-\mu_2}{\mu_1+\mu_2}\Big)^2=\Big(\frac{1-\mu_2/\mu_1}{1+\mu_2/\mu_1}\Big)^2\quad(7.4.12.5)\]
对正交规范 \(x,y\),取 \(B=[x\ y]^*A[x\ y]\);Poincaré 分离定理(4.3.38)给出 \(\lambda_1\le\mu_1\le\mu_2\le\lambda_n\),而 \(f(t)=(1-t)^2/(1+t)^2\) 在 \((1,\infty)\) 递增,得 Wielandt。 Wielandt ⇒ Kantorovich:单位向量 \(x\) 非特征向量时令 \(y=A^{-1}x-(x^*A^{-1}x)x\),则 \(x^*y=0\),\(x^*Ay=1-(x^*Ax)(x^*A^{-1}x)<0\),\(y^*Ay=-(x^*A^{-1}x)(x^*Ay)\),代入 Wielandt 推出 Kantorovich。故二者等价。 练习:特征向量时两者成立(AM–GM);单位向量 \(x\) 有 \((x^*Ax)(x^*A^{-1}x)\ge1\)(Cauchy–Schwarz:\(1=(x^*A^{1/2}A^{-1/2}x)^2\le\|A^{1/2}x\|^2\|A^{-1/2}x\|^2\)),非特征向量时严格;取 \(Au=\lambda_1u\)、\(Av=\lambda_nv\),\(x=(u+v)/\sqrt2\)、\(y=(u-v)/\sqrt2\) 时两不等式都取等。 几何意义:\(B\) 非奇异,\(\kappa=\sigma_1/\sigma_n\)(谱条件数),对 \(A=B^*B\) 用 Wielandt:
\[|\langle Bx,By\rangle|\le\frac{\kappa^2-1}{\kappa^2+1}\|Bx\|\|By\|\quad(x\perp y)\quad(7.4.12.6)\]
定义 \(\theta_\kappa\in(0,\pi/2]\),\(\cos\theta_\kappa=(\kappa^2-1)/(\kappa^2+1)\)(练习:\(\sin\theta_\kappa=2\kappa/(\kappa^2+1)\),\(\cot(\theta_\kappa/2)=\kappa\))。实情形 \(\cos\theta_{Bx,By}\le\cos\theta_\kappa\)(7.4.12.7):\(\theta_\kappa\) 是正交向量对经 \(B\) 映射后夹角的最小值;\(\kappa\) 大 ⇔ 存在正交 \(x,y\) 使 \(Bx,By\) 几乎平行(病态 = 把正交方向压成近共线)。练习:对 \(A=B^*B\) 用 Kantorovich 得 \(\|Bx\|_2\|B^{-*}x\|_2\le\frac{\kappa^2+1}{2\kappa}\|x\|_2^2\)(7.4.12.8),等价于 \(\sin\theta_\kappa\|Bx\|_2\|B^{-*}x\|_2\le\|x\|_2^2\)(7.4.12.9)。(注意:扫描页上 (7.4.12.8) 印成系数 \(\frac{2\kappa}{\kappa^2+1}\),与 (7.4.12.9) 及推导矛盾,应为其倒数,疑为印刷错误。)

7.4 习题概要(P1–P18)

  • P1:标量 Kantorovich 不等式 \((\sum\alpha_i\lambda_i)(\sum\alpha_i\lambda_i^{-1})\le A^2G^{-2}\)(\(\alpha_i\ge0\),\(\sum\alpha_i=1\),\(A,G\) 为 \(\lambda_1,\lambda_n\) 的算术、几何平均)(7.4.12.10)。(最速下降法收敛率 \(((\kappa-1)/(\kappa+1))^2\) 正是由此得出。)
  • P2:正定矩阵 \(|a_{ij}|^2\le\big(\frac{\lambda_1-\lambda_n}{\lambda_1+\lambda_n}\big)^2a_{ii}a_{jj}\)——相关系数上界由条件数控制。
  • P3:Greub–Rheinboldt 不等式(交换正定 \(B,C\))\((x^*B^2x)(x^*C^2x)\le\frac{(\lambda_1\mu_1+\lambda_n\mu_n)^2}{4\lambda_1\lambda_n\mu_1\mu_n}(x^*BCx)^2\)(7.4.12.11),等价角度形式(7.4.12.12)。
  • P4:\(\frac{\langle x,Ax\rangle}{\|x\|\|Ax\|}\ge\frac{2\sqrt\kappa}{\kappa+1}\)(7.4.12.13–14),\(x_0=\lambda_n^{1/2}u_1+\lambda_1^{1/2}u_n\) 取等:\(x\) 与 \(Ax\) 夹角上界。
  • P5–P8:非奇异 \(A\) 的 \(|(x^*Ax)(x^*A^{-1}x)|\le\frac14(\kappa^{1/2}+\kappa^{-1/2})^2\|x\|^4\)(7.4.12.15);正定情形 Kantorovich 与 Wielandt 的条件数写法 (7.4.12.16)–(7.4.12.17):\(|x^*Ay|^2\le(\frac{\kappa-1}{\kappa+1})^2(x^*Ax)(y^*Ay)\);Hermitian 时 \(\max_{\|x\|=1}\|Ax\|\|A^{-1}x\|=\frac12(\kappa+\kappa^{-1})\);特征值在 \([m,M]\) 时 \((x^*Ax)(x^*A^{-1}x)\le\frac{(m+M)^2}{4mM}\|x\|^4\)。
  • P9:重排不等式的反向 \(\sum\alpha_i^\downarrow\beta_i^\downarrow\le\frac{m+M}{2\sqrt{mM}}\sum\alpha_i\beta_i\)(7.4.12.18)。
  • P10:\(|x^*y|^2\le(x^*Ax)(y^*A^{-1}y)\);\(f(A,y)=(y^*A^{-1}y)^{-1}=\min_{x^*y\ne0}x^*Ax/|x^*y|^2\) 超可加 ⇒ Bergström 不等式 \(\gamma_{ii}^{-1}\ge\alpha_{ii}^{-1}+\beta_{ii}^{-1}\),即 \(\frac{\det(A+B)}{\det(A+B)[\{i\}^c]}\ge\frac{\det A}{\det A[\{i\}^c]}+\frac{\det B}{\det B[\{i\}^c]}\)(7.4.12.19)。
  • P11:与 Berenstein–Veinstein 不等式 \(x^*A^{-1}x+y^*B^{-1}y\ge(x+y)^*(A+B)^{-1}(x+y)\)(7.4.12.21,即 \((x,A)\mapsto x^*A^{-1}x\) 的联合凸性)等价。
  • P12:两个酉不变范数之比在秩 1 矩阵上为常数。P13:\(\|A-\frac12(A+A^*)\|\le\|A-H\|\)(任意 Hermitian \(H\),7.4.12.22)——到 Hermitian 矩阵集的距离为 \(\frac12\|A-A^*\|\)。P14:Hermitian 部分、对称部分、实部的范数不超过 \(\|A\|\)。
  • P15–P16:到酉矩阵集的距离为 \(\|\Sigma(A)-I\|\),由极分解酉因子达到;\(\|\Sigma(A)-I\|\le\|A-U\|\le\|\Sigma(A)+I\|\)(7.4.12.23)。(“最近正交矩阵”问题。)
  • P17:\(\sigma_{n-1}>\sigma_n\) 时最近奇异矩阵唯一的证明。P18:\(\|A\|\le\||A|\|\)。
  • 注记:Clausing (1982) Kantorovich 型不等式综述;Mirsky (1960) 对称规范函数;Fan & Hoffman (1955);C. R. Rao (1980) 将矩阵逼近用于多元统计降维。

7.5 Schur 乘积定理(The Schur product theorem)(PDF p.497–505,原书 p.477–485)

Definition 7.5.1:\(A=[a_{ij}],B=[b_{ij}]\in M_{m,n}\) 的 Hadamard 积(Schur 积,Hadamard product / Schur product)\(A\circ B=[a_{ij}b_{ij}]\)(逐元素乘积)。满足分配律,且可交换 \(A\circ B=B\circ A\)。

两个自然来源:

  1. 卷积:\(f,g\) 为 \(2\pi\) 周期连续函数,三角矩 \(a_k,b_k\);卷积 \(h(\theta)=\int_0^{2\pi}f(\theta-t)g(t)dt\) 的三角矩 \(c_k=a_kb_k\),故 Toeplitz 矩阵 \([c_{i-j}]=[a_{i-j}]\circ[b_{i-j}]\)。\(f,g\ge0\) 时卷积非负,三者都半正定——Schur 乘积定理的一个实例。
  2. 积分核:核 \(K(x,y)\) 称半正定核(positive semidefinite kernel),若 \(\iint K(x,y)f(x)\bar f(y)dxdy\ge0\) 对所有 \(f\in C[a,b]\)。Mercer 定理:连续半正定核 \(K(x,y)=\sum_i\phi_i(x)\bar\phi_i(y)/\lambda_i\)(\(\lambda_i>0\),绝对一致收敛)。两核逐点乘积 \(L=KH=\sum_{i,j}\phi_i\psi_j\bar\phi_i\bar\psi_j/(\lambda_i\mu_j)\),于是 \(\iint Lf\bar f=\sum_{i,j}\frac1{\lambda_i\mu_j}|\int\phi_i\psi_jf|^2\ge0\)。(机器学习中“核的乘积仍是核”。)

练习:两个 Hermitian 矩阵的普通乘积 Hermitian ⇔ 二者交换;Hadamard 积总是 Hermitian。\(A=\begin{bmatrix}2&1\\1&1\end{bmatrix}\)、\(B=\begin{bmatrix}2&1\\1&3\end{bmatrix}\) 正定,\(A\circ B\) 正定,但 \(AB\) 不对称故非半正定(不过它可对角化、特征值为正,见 7.2.P21)。练习:\(\sum_{i,j}a_{ij}b_{ij}=\operatorname{tr}(AB^T)\)。

Lemma 7.5.2:\(x^*(A\circ B)y=\operatorname{tr}((\operatorname{diag}\bar x)A(\operatorname{diag}y)B^T)\)。证明:\((\operatorname{diag}\bar x)A=[\bar x_ia_{ij}]\),\(B\operatorname{diag}y=[b_{ij}y_j]\),用上面的迹恒等式。练习:\((xy^*)\circ A=(\operatorname{diag}x)A(\operatorname{diag}\bar y)\);Hermitian 矩阵 \(A^T=\bar A\)。

Theorem 7.5.3(Schur 乘积定理):\(A,B\in M_n\) 半正定。 (a) \(A\circ B\) 半正定; (b) 若 \(A\) 正定且 \(B\) 的对角元全为正,则 \(A\circ B\) 正定; (c) \(A,B\) 都正定 ⇒ \(A\circ B\) 正定。 证明:(a) 令 \(C=(\operatorname{diag}x)\bar B^{1/2}\),由引理 \(x^*(A\circ B)x=\operatorname{tr}((\operatorname{diag}\bar x)A(\operatorname{diag}x)\bar B)=\operatorname{tr}(\bar B^{1/2}(\operatorname{diag}\bar x)A(\operatorname{diag}x)\bar B^{1/2})=\operatorname{tr}(C^*AC)\ge0\)(7.1.8(a))。(b) \(\lambda_1>0\) 为 \(A\) 最小特征值,\(\beta>0\) 为 \(B\) 最小对角元;\(A-\lambda_1I\) 半正定 ⇒ \((A-\lambda_1I)\circ B\) 半正定 ⇒ \(x^*(A\circ B)x\ge\lambda_1x^*(I\circ B)x=\lambda_1\sum b_{ii}|x_i|^2\ge\lambda_1\beta\|x\|_2^2>0\)。(c) 正定矩阵对角元为正。 练习:\(xx^*\)、\(\bar xx^T\) 半正定。

Theorem 7.5.4(Moutard, 1894):\(A\) 半正定 ⇔ \(\operatorname{tr}(AB^T)=\sum a_{ij}b_{ij}\ge0\) 对所有半正定 \(B\)。证明:⇒ 取全 1 向量 \(e\),\(\operatorname{tr}(AB^T)=e^*(A\circ B)e\ge0\);⇐ 取 \(B=\bar xx^T\),\(\operatorname{tr}(AB^T)=\sum a_{ij}\bar x_ix_j=x^*Ax\)。(即半正定锥是自对偶锥,self-dual cone;Fejér 1918 指出它蕴含 Schur 定理。)

Application 7.5.5(椭圆型算子):\(D\subset\mathbf R^n\) 有界开集,

\[Lu=\sum_{i,j}a_{ij}(x)\frac{\partial^2u}{\partial x_i\partial x_j}+\sum_ib_i(x)\frac{\partial u}{\partial x_i}+c(x)u\quad(7.5.6)\]
若 \(A(x)=[a_{ij}(x)]\) 处处正定则称椭圆(elliptic)。若 \(Lu=0\)、\(y\) 为局部极小点,则梯度为零、Hessian 半正定,由 Moutard 定理 \(-cu=\sum a_{ij}\partial^2u/\partial x_i\partial x_j\ge0\);若 \(c(y)<0\) 则 \(u(y)\ge0\)。 Weak minimum principle 7.5.7:\(L\) 椭圆、\(c<0\),\(Lu=0\) ⇒ \(u\) 无负的内部相对极小、无正的内部相对极大;若 \(u\) 在闭包连续且边界上非负,则在 \(D\) 内处处非负。 Fejér 唯一性定理 7.5.8:\(L\) 椭圆、\(c<0\),边值问题(\(u\in C^2(D)\),\(Lu=f\),\(u\) 在 \(\bar D\) 连续,\(u=g\) 于 \(\partial D\))至多一个解。证明:两解之差 \(\pm v\) 满足 \(Lv=0\)、边界为零,由弱极小原理 \(v\ge0\) 且 \(-v\ge0\)。练习:应用于 \(\sum\partial^2u/\partial x_i^2-\lambda u=0\)(\(\lambda>0\))。

Hadamard 幂与函数:\(A\) 半正定 ⇒ \(A\circ A=[a_{ij}^2]\) 半正定,归纳得 Hadamard 幂 \(A^{(k)}=[a_{ij}^k]\) 半正定;于是非负系数多项式 \(p\) 给出 \([p(a_{ij})]=a_0J_n+a_1A+a_2A^{(2)}+\dots\) 半正定;取极限,非负系数解析函数 \(f(z)=\sum a_kz^k\)(收敛半径 \(R\))在 \(|a_{ij}|<R\) 时 \([f(a_{ij})]\) 半正定。重要例子:\(f(z)=e^z\),Hadamard 指数矩阵 \([e^{a_{ij}}]\)。

Theorem 7.5.9:\(A\) 半正定。 (a) \(A^{(k)}\) 半正定;\(A\) 正定时正定。 (b) \(f\) 非负系数解析、收敛半径 \(R>0\),\(|a_{ij}|<R\) ⇒ \([f(a_{ij})]\) 半正定;若再有 \(A\) 正定且某个 \(a_i>0\)(\(i\ge1\)),则正定。 (c) \([e^{a_{ij}}]\) 半正定;正定 ⇔ \(A\) 没有两行相同。 证明:(a)(b) 由 7.5.3 与归纳;(c) 见 P18–P21。 (量化联系:高斯核 / 指数核 \(e^{-\|x_i-x_j\|^2}\)、协方差矩阵的逐元素函数变换是否保持半正定,靠的就是本节结论;也是“相关矩阵逐元素收缩”合法性的依据。)

7.5 习题概要(P1–P25)

  • P1:另证:\(A=\sum x_ix_i^*\),\(B=\sum y_jy_j^*\),\(A\circ B=\sum_{i,j}(x_ix_i^*)\circ(y_jy_j^*)\),而 \((\xi\xi^*)\circ(\eta\eta^*)=(\xi\circ\eta)(\xi\circ\eta)^*\) 秩 1 半正定。
  • P2:\(H(A)\) 正定、\(B\) 正定 ⇒ \(H(A\circ B)\) 正定。P3:\([|a_{ij}|^2]\) 半正定。
  • P4–P6 绝对值矩阵 \(|A|=[|a_{ij}|]\):\(n\le3\) 时 \(A\) 半正定 ⇒ \(|A|\) 半正定;\(n=4\) 反例:\(C=[\cos(t_i-t_j)]\),\(t=(0,\pi/4,\pi/2,3\pi/4)\),\(|C|\) 不半正定;但 \(|C|\circ|C|\) 半正定——半正定矩阵的非负“Hadamard 平方根”可以不半正定;具体反例 \(A=\begin{bmatrix}10&3&-2&1\\3&10&0&9\\-2&0&10&4\\1&9&4&10\end{bmatrix}\) 正定但 \(|A|\) 不半正定。
  • P7–P10:连续核半正定 ⇔ 所有取样矩阵 \([K(x_i,x_j)]\) 半正定;半正定核乘积仍半正定;\(f\) 正定函数 ⇔ \(K(s,t)=f(s-t)\) 半正定核;正定函数之积仍为正定函数。
  • P11:\([a_{ij}/(i+j)]\) 半正定。P12:Hadamard 逆 \([a_{ij}^{-1}]\) 半正定 ⇔ \(\operatorname{rank}A=1\)。P13:\(\operatorname{rank}(A\circ B)\ge\nu(B)\ge\operatorname{rank}B\)(\(A\) 正定,\(\nu(B)\) 为非零对角元个数)。
  • P14 相对增益阵(relative gain array) \(A\circ A^{-T}\)(化工过程控制):正定且 \(\lambda_{\min}\ge1\)。
  • P15、P22:Hilbert 矩阵 \(H_n=[1/(i+j-1)]\) 正定的两种证明(\(Z=[1/(1-\xi_{ij})]\),\(\xi_{ij}=(i-1)(j-1)/ij\))。P16:\(A\) 半正定 ⇔ 对所有半正定 \(B\),\(A\circ B\) 半正定。
  • P17:gcd 矩阵 \([\gcd(n_i,n_j)]\) 半正定(质因数分解后写成 min 型矩阵的 Hadamard 积)。
  • P18–P21:Hadamard 指数正定性的证明链:\(B_t=[e^{ta_{ij}}]\);奇异 ⇔ 存在 \(x\) 使 \(B_tx=0\) 对所有 \(t\);\(2\times2\) 情形 \(B\) 奇异 ⇔ \(\alpha_1=\alpha_2=\beta\)(7.5.10 AM–GM 论证);\(a_{pp}=a_{qq}=a_{pq}\) ⇒ 第 \(p\)、\(q\) 行相同;通过相关矩阵 \(C_t=D_tB_tD_t\) 在 \(t\to\infty\) 时趋于 \(I\) 的矛盾论证。
  • P23:\(z_i\) 互异时 \([e^{z_i\bar z_j}]\)、\([\cosh(z_i\bar z_j)]\) 正定,\(|z_i|<1\) 时 \([(1-(z_i\bar z_j)^3)^{-1}]\) 正定。
  • P24:\(\lambda_{\min}(A\circ B)\ge\lambda_{\min}(A)\min_ib_{ii}\),\(\lambda_{\max}(A\circ B)\le\lambda_{\max}(A)\max_ib_{ii}\)(Schur 1911)。
  • P25 条件半正定(conditionally positive semidefinite):\(B=A+ze^*+ez^*+cJ_n\) 未必半正定,但 \([e^{b_{ij}}]\) 半正定;\(x^*e=0\) 时 \(x^*Bx\ge0\)。(与负距离平方矩阵、变差函数相关。)
  • 注记:Schur (1911) 首次系统研究;Moutard 1894;Fejér 1918;Hadamard 1899;Horn & Johnson《Topics》(1991) 第 5 章及 6.3 节详述 Hadamard 积。

7.6 同时对角化、乘积与凸性(Simultaneous diagonalizations, products, and convexity)(PDF p.505–,原书 p.485–)

两种保持 Hermitian 性的同时对角化:一种(\(S^*\) 与 \(S^{-1}\) 搭配)适合处理乘积,另一种(*合同)适合处理线性组合。

Theorem 7.6.1:\(A,B\in M_n\) Hermitian。 (a) \(A\) 正定 ⇒ 存在非奇异 \(S\) 使 \(A=SIS^*\)、\(B=S^{-*}\Lambda S^{-1}\),\(\Lambda\) 实对角;\(B\) 与 \(\Lambda\) 惯性相同(\(B\) 半正定 / 正定 ⇒ \(\Lambda\) 非负 / 正)。 (b) \(A,B\) 半正定、\(\operatorname{rank}A=r\) ⇒ 存在非奇异 \(S\) 使 \(A=S(I_r\oplus0_{n-r})S^*\)、\(B=S^{-*}\Lambda S^{-1}\),\(\Lambda\) 非负对角。 证明:(a) 由 4.5.7 取 \(T\) 使 \(T^{-1}AT^{-*}=I\);\(T^*BT\) Hermitian,酉对角化 \(U^*(T^*BT)U=\Lambda\);\(S=TU\)。惯性由 Sylvester 惯性定律(4.5.8)。(b) 取 \(T\) 使 \(T^{-1}AT^{-*}=I_r\oplus0\),\(T^*BT=\begin{bmatrix}B_{11}&B_{12}\\B_{12}^*&B_{22}\end{bmatrix}\) 半正定,由列包含 \(B_{12}=B_{11}X\);\(R=\begin{bmatrix}I_r&-X\\0&I\end{bmatrix}\) 使 \(R^*(T^*BT)R=B_{11}\oplus(B_{22}-X^*B_{11}X)\);再分别酉对角化,\(S=TRU\)。练习:可取 \(T=A^{1/2}\),\(S=A^{1/2}U\),\(A^{1/2}BA^{1/2}=U\Lambda U^*\);实情形 \(S\) 可实。

Corollary 7.6.2:(a) \(A\) 正定、\(B\) Hermitian ⇒ \(AB\) 可对角化且特征值为实;\(B\) 正定 / 半正定时特征值为正 / 非负。证明:\(AB=SS^*S^{-*}\Lambda S^{-1}=S\Lambda S^{-1}\)。(b) \(A,B\) 都半正定 ⇒ \(AB\) 可对角化且特征值非负:\(AB=S(I_r\oplus0)\Lambda S^{-1}=S(\Lambda_1\oplus0)S^{-1}\)。 反例:\(A=\begin{bmatrix}1&0\\0&0\end{bmatrix}\)、\(B=\begin{bmatrix}0&1\\1&0\end{bmatrix}\),半正定与 Hermitian 之积可不可对角化。

Theorem 7.6.3:\(A\) 半正定奇异、\(B\) Hermitian ⇒ \(AB\) 相似于 \(\Lambda\oplus N\),\(\Lambda\) 实对角,\(N=J_2(0)\oplus\dots\oplus J_2(0)\)(可缺省)。即 \(AB\) 总是“准可对角化”,Jordan 形中的 \(2\times2\) 块都是幂零的。 证明:取 \(S\) 使 \(S^{-1}AS^{-*}=I_r\oplus0\),\(S^*BS=[B_{ij}]\),则 \(S^{-1}ABS=\begin{bmatrix}B_{11}&B_{12}\\0&0\end{bmatrix}\)。\(B_{11}\) 非奇异时由 2.4.6.1 相似于 \(B_{11}\oplus0\);否则 \(B_{11}\) 相似于 \(D\oplus0_{r-p}\)(\(D\) 非奇异实对角),分块 \(B_{12}=\begin{bmatrix}C_1\\C_2\end{bmatrix}\),相似变换消去 \(C_1\) 得 \(D\oplus\begin{bmatrix}0&C_2\\0&0\end{bmatrix}\),后者平方为零,Jordan 形为零块与 \(\operatorname{rank}C_2\) 个 \(J_2(0)\)。

Theorem 7.6.4(*合同同时对角化):\(A,B\) Hermitian。 (a) \(A\) 正定 ⇒ 存在非奇异 \(S\) 使 \(A=SIS^*\)、\(B=S\Lambda S^*\),\(\Lambda\) 实对角,惯性同 \(B\);\(\Lambda\) 的对角元是可对角化矩阵 \(A^{-1}B\) 的特征值(\(A^{-1}B=S^{-*}\Lambda S^*\))。 (b) \(A,B\) 半正定、\(\operatorname{rank}A=r\) ⇒ \(A=S(I_r\oplus0)S^*\)、\(B=S\Lambda S^*\),\(\Lambda\) 非负对角,\(\operatorname{rank}B=\operatorname{rank}\Lambda\)。 证明与 7.6.1 平行(对 \(T^{-1}BT^{-*}\) 酉对角化)。练习:可取 \(S=A^{1/2}U\),\(A^{-1/2}BA^{-1/2}=U\Lambda U^*\);也可用 Cholesky 因子作下三角 \(T\)。(这就是广义特征值问题 \(Bx=\lambda Ax\)——如 Markowitz 问题中两个二次型的同时对角化、Fisher 判别分析、广义 Rayleigh 商。)

Theorem 7.6.5:\(A\) 正定、\(B\) 复对称 ⇒ 存在非奇异 \(S\) 使 \(A=SIS^*\)、\(B=S\Lambda S^T\),\(\Lambda\) 非负对角;\(\Lambda^2\) 的对角元是可对角化矩阵 \(A^{-1}B\bar A^{-1}\bar B\) 的特征值。证明:\(R^{-1}AR^{-*}=I\),用 Takagi 分解(4.4.4(c))取酉 \(U\) 使 \(U^*R^{-1}BR^{-T}\bar U=\Lambda\),\(S=RU\)。应用:单叶解析函数的 Grunsky 不等式(4.4 节)。

Theorem 7.6.6(log det 严格凹):\(f(A)=\log\det A\) 在正定矩阵凸集上严格凹:

\[\log\det(\alpha A+(1-\alpha)B)\ge\alpha\log\det A+(1-\alpha)\log\det B,\quad\alpha\in(0,1)\quad(7.6.7)\]
等号 ⇔ \(A=B\)。证明:由 7.6.4(a) 写 \(A=SS^*\)、\(B=S\Lambda S^*\),\(f(\alpha A+(1-\alpha)B)=f(A)+f(\alpha I+(1-\alpha)\Lambda)\),\(\alpha f(A)+(1-\alpha)f(B)=f(A)+(1-\alpha)f(\Lambda)\)。只需证 \(\sum\log(\alpha+(1-\alpha)\lambda_i)\ge(1-\alpha)\sum\log\lambda_i\),这由 \(\log\) 的严格凹性逐项得到;等号 ⇔ 所有 \(\lambda_i=1\) ⇔ \(B=A\)。

Corollary 7.6.8:\(A,B\) 正定,\(0<\alpha<1\):

\[\det(\alpha A+(1-\alpha)B)\ge(\det A)^\alpha(\det B)^{1-\alpha}\quad(7.6.9a)\]
等号 ⇔ \(A=B\)。练习:\(\det\frac{A+B}{2}\ge\sqrt{\det AB}\)(7.6.9b),可看作行列式的 AM–GM 不等式。

Theorem 7.6.10(\(\operatorname{tr}A^{-1}\) 严格凸):\(f(A)=\operatorname{tr}A^{-1}\) 在正定矩阵上严格凸:\(\operatorname{tr}(\alpha A+(1-\alpha)B)^{-1}\le\alpha\operatorname{tr}A^{-1}+(1-\alpha)\operatorname{tr}B^{-1}\),等号 ⇔ \(A=B\)。证明:\(A=SS^*\)、\(B=S\Lambda S^*\),\(s_i>0\) 为 \(S^{-1}S^{-*}\) 对角元,\(\operatorname{tr}(\alpha A+(1-\alpha)B)^{-1}=\sum_i(\alpha+(1-\alpha)\lambda_i)^{-1}s_i\le\sum_i(\alpha s_i+(1-\alpha)\lambda_i^{-1}s_i)\)(\(t\mapsto1/t\) 凸)\(=\alpha\operatorname{tr}A^{-1}+(1-\alpha)\operatorname{tr}B^{-1}\)。更强结论见 7.7.P14(矩阵求逆是算子凸的)。 (量化联系:log det 凹性是高斯极大似然估计协方差、D-最优设计、熵/风险平价目标函数为凸优化问题的根据;\(\operatorname{tr}A^{-1}\) 凸性对应 A-最优设计。)

7.6 习题概要(P1– ,PDF p.509–)

  • P1:等价:\(A\) 相似于 Hermitian 矩阵 ⇔ 可对角化且特征值为实 ⇔ \(A=HK\)(\(H,K\) Hermitian,其一正定)⇔ \(A\) 经正定相似变为 \(A^*\)。
  • P2:若存在实 \(\alpha,\beta\) 使 \(\alpha A+\beta B\) 正定,则 \(A,B\) 可同时 *合同对角化。P3:\(A^{-1}B\bar A^{-1}\bar B\) 相似于一个与 \(A^{-T}\) *合同的矩阵。
  • P4:7.6.1(b) 的另一证法(\(A+B=S(I_m\oplus0)S^*\),用 7.1.14)。P5:两个实二次型 \(5x_1^2-2x_1x_2+x_2^2\) 与 \(x_1^2+2x_1x_2-x_2^2\) 可同时化为 \(\alpha_1\xi_1^2+\alpha_2\xi_2^2\) 与 \(\beta_1\xi_1^2-\beta_2\xi_2^2\):为何可以、如何求 \(S\)。
  • P6:\(A,B\) 半正定 ⇒ \(\det(A+B)\ge\det A+\det B\),等号 ⇔ \(A+B\) 奇异或 \(A=0\) 或 \(B=0\)。
  • P7:\(A\) 正定 ⇒ \(A+B\) 正定 ⇔ \(A^{-1}B\) 的特征值都 \(>-1\)。
  • P8:\(C=A+iB\) 正定(\(A\) 实对称,\(B\) 实反对称)⇒ \(|\det B|<\det A\)(H. P. Robertson)且 \(\det C\le\det A\),等号 ⇔ \(B=0\)(O. Taussky)。(推广见 7.8.19、7.8.24。)
  • P9:\(A\) 是两个正定矩阵之积 ⇔ 可对角化且特征值为正。
  • P10–P11:\(A,B,C\) 正定,\(ABC\) 正定 ⇔ \(ABC\) Hermitian;\(\operatorname{tr}(AB)>0\) 但 \(\operatorname{tr}(ABC)\) 可为负;连续性论证另证。
  • P12:(续见下文)\(A\) 半正定、\(B\) Hermitian 时 \(AB\) 相似于 \(D_+\oplus D_-\oplus0\oplus s\) 个 \(J_2(0)\) …… (7.6.P12 续)(a) 由 7.6.3 证明 \(\pi\le i_+(B)\)、\(\nu\le i_-(B)\)、\(s=\operatorname{rank}(AB)-\operatorname{rank}((AB)^2)\)(与 4.5.6 联系)。
  • P13:\(A,B\) 实对称正定,\(Ax''(t)=-Bx(t)\) 的每个解在 \((-\infty,\infty)\) 有界(同时对角化成解耦振子)。
  • P14–P15:\(A\) 正定或 \(A,B\) 都半正定时 \(\rho(AB)=0\iff AB=0\);\(\operatorname{tr}AB=\|A^{1/2}B^{1/2}\|_2^2\ge0\),等号 ⇔ \(AB=0\)。P16:\(A\) 半正定、\(B\) Hermitian 时 \(AB\) 相似于实对角阵 ⇔ \(\operatorname{rank}(AB)=\operatorname{rank}(AB)^2\)。
  • P17:含正定矩阵的紧凸半正定矩阵集中,行列式最大者唯一(由 7.6.9b)。
  • P18–P27 椭球与 Loewner–John 矩阵:\(\mathcal E(A)=\{x:x^*Ax\le1\}\) 是范数 \(\nu_A(x)=\|A^{1/2}x\|_2\) 的单位球(凸);实情形体积 \(\operatorname{vol}(\mathcal E(A))=c_n/\sqrt{\det A}\),\(c_n=\pi^{n/2}/\Gamma(1+n/2)\),递推 \(c_1=2,c_2=\pi,c_n=\frac{2\pi}{n}c_{n-2}\)(行列式越大体积越小)。对任一范数 \(\|\cdot\|\),\(E(\|\cdot\|)=\{B\succeq0:x^*Bx\le\|x\|^2\}\) 紧凸,含唯一行列式最大的正定 \(Q\);实情形 \(\mathcal E(Q)\) 是包含该范数单位球的体积最小椭球——Loewner 椭球,\(L=Q^{1/2}\) 称 Loewner–John 矩阵,\(\|Lx\|_2\le\|x\|\) 且在某 \(x_0\) 处取等。P21:范数的等距群 \(\mathcal F\) 中每个 \(A\) 满足 \(A^*QA=Q\)(7.6.11),\(LAL^{-1}\) 酉(实情形正交)(7.6.12)。P22–P23:Auerbach 定理:有界乘法矩阵群相似于酉(实正交)矩阵群。P24–P26:绝对范数的 Loewner–John 矩阵是正对角阵;对称规范函数时 \(L=\alpha I\),\(\alpha=\min\{\|x\|:\|x\|_2=1\}\);\(\ell_p\) 范数 \(\alpha=1\)(\(1\le p\le2\))或 \(n^{(p-2)/2p}\)(\(p\ge2\))。P27:\(\operatorname{vol}\mathcal E(Q)\ge c_n/\prod\|e_i\|\)。
  • P28–P29:由 4.5.17 的更一般结果推出 7.6.4(a) 与 7.6.5。
  • 延伸阅读:Ballantine & Johnson (1975) accretive 矩阵乘积;Horn & Hong (1991) Hermitian 与半正定矩阵乘积的 Jordan 形;Deutsch & Schneider (1974) 有界群与 Loewner–John 矩阵。

7.7 Loewner 偏序与分块矩阵(The Loewner partial order and block matrices)(PDF p.513–,原书 p.493–)

Definition 7.7.1:\(A\succeq B\) 指 \(A,B\) Hermitian 且 \(A-B\) 半正定;\(A\succ B\) 指 \(A-B\) 正定。\(A\succeq0\) 即半正定,\(A\succ0\) 即正定。 练习:\(A\succeq B\) 且 \(B\succeq A\) ⇔ \(A=B\);\(\succeq\) 自反、传递,但 \(n>1\) 时不是全序(存在不可比较的 Hermitian 矩阵)——称 Loewner 偏序(Loewner partial order);\(A\succeq B\)、\(C\succeq0\) ⇒ \(A\circ C\succeq B\circ C\);\(\lambda_{\max}(A)I\succeq A\succeq\lambda_{\min}(A)I\);\(I\succeq A\iff\lambda_{\max}(A)\le1\);\(A\succeq B\) 且 \(A\ne B\) 不蕴含 \(A\succ B\)。 一般地,实线性空间上的偏序可由一个闭凸锥定义(差落在锥中即“大于”):Loewner 序对应 Hermitian 矩阵空间与半正定锥;第 8 章则用 \(M_n(\mathbf R)\) 与非负矩阵锥(逐元素序)。 收缩(contraction):\(X\in M_{n,m}\),\(\sigma_1(X)=\lambda_{\max}(XX^*)^{1/2}=\sigma_1(X^*)\) 为谱范数;\(\sigma_1(X)\le1\) 称收缩,\(<1\) 称严格收缩(strict contraction)。

Theorem 7.7.2:\(A,B\in M_n\) Hermitian,\(S\in M_{n,m}\)。 (a) \(A\succeq B\Rightarrow S^*AS\succeq S^*BS\);(b) \(\operatorname{rank}S=m\) 时 \(A\succ B\Rightarrow S^*AS\succ S^*BS\);(c) \(S\) 非奇异方阵时 \(A\succ B\iff S^*AS\succ S^*BS\),\(\succeq\) 同理;(d) \(I_m\succ S^*S\)(或 \(I_n\succ SS^*\))⇔ \(S\) 严格收缩;\(I_m\succeq S^*S\) ⇔ \(S\) 收缩。 证明:由 7.1.8;(d) \(I\succeq S^*S\iff1\ge\lambda_{\max}(S^*S)=\sigma_1(S)^2\)。

Theorem 7.7.3:\(A,B\) Hermitian,\(A\) 正定。 (a) 若 \(B\) 半正定:\(A\succeq B\)(\(A\succ B\))⇔ \(\rho(A^{-1}B)\le1\)(\(<1\))⇔ 存在半正定收缩(严格收缩)\(X\) 使 \(B=A^{1/2}XA^{1/2}\)。 (b) \(A^2\succeq B^2\)(\(\succ\))⇔ \(\sigma_1(A^{-1}B)\le1\)(\(<1\))⇔ 存在收缩(严格收缩)\(X\) 使 \(B=AX=X^*A\)。 证明:(a) \(A\succeq B\iff I\succeq A^{-1/2}BA^{-1/2}\iff1\ge\sigma_1(A^{-1/2}BA^{-1/2})=\lambda_{\max}(A^{-1/2}BA^{-1/2})=\lambda_{\max}(A^{-1}B)=\rho(A^{-1}B)\)(7.6.2(a) 保证 \(A^{-1}B\) 特征值实非负)。反向:\(A^{-1}B=A^{-1/2}XA^{1/2}\) 相似于 \(X\)。(b) \(A^2\succeq B^2\iff I\succeq A^{-1}B^2A^{-1}=(A^{-1}B)(A^{-1}B)^*\) ⇔ \(\sigma_1(A^{-1}B)\le1\);令 \(X=A^{-1}B\);反之 \(A^2-B^2=A(I-XX^*)A\succeq0\)。 练习:\(A\) 正定、\(B\) 半正定且 \(\sigma_1(A^{-1}B)\le1\) ⇒ \(A\succeq B\) 与 \(A^2\succeq B^2\)(因 \(\sigma_1\ge\rho\))。

Corollary 7.7.4:\(A,B\) Hermitian,特征值递增排列。 (a) \(A\succ0,B\succ0\):\(A\succeq B\iff B^{-1}\succeq A^{-1}\)(求逆反序); (b) \(A\succ0,B\succeq0,A\succeq B\Rightarrow A^{1/2}\succeq B^{1/2}\)(平方根单调); (c) \(A\succeq B\Rightarrow\lambda_i(A)\ge\lambda_i(B)\),\(i=1..n\)(Weyl 单调性 4.3.12); (d) \(A\succeq B\Rightarrow\operatorname{tr}A\ge\operatorname{tr}B\),等号 ⇔ \(A=B\); (e) \(A\succeq B\succeq0\Rightarrow\det A\ge\det B\ge0\)。 证明:(a) \(\rho(A^{-1}B)=\rho(BA^{-1})\le1\iff B^{-1}\succeq A^{-1}\)。(b) 令 \(X=A^{-1/2}B^{1/2}\),\(1\ge\rho(A^{-1}B)=\rho(XX^*)=\sigma_1(X)^2\ge\rho(X)^2=\rho(A^{-1/2}B^{1/2})^2\),由 7.7.3(a) 得 \(A^{1/2}\succeq B^{1/2}\)。(c) \(A=B+(A-B)\)。(d) 由 (c) 与 7.1.5。(e) 特征值逐个比较。 练习:\(A=\begin{bmatrix}3&1\\1&2\end{bmatrix}\succ B=\begin{bmatrix}2&0\\0&1\end{bmatrix}\succ0\),但 \(A^2-B^2\) 不半正定——平方不保序,(b) 不可逆推。练习:严格序时各结论如何加强。

Schur 补与分块正定性:\(H=\begin{bmatrix}A&B\\B^*&C\end{bmatrix}\),\(A\) 非奇异,基本恒等式(0.8.5.3)

\[\begin{bmatrix}I&0\\Y^*&I\end{bmatrix}\begin{bmatrix}A&B\\B^*&C\end{bmatrix}\begin{bmatrix}I&Y\\0&I\end{bmatrix}=\begin{bmatrix}A&0\\0&C-B^*A^{-1}B\end{bmatrix},\quad Y=-A^{-1}B\quad(7.7.5)\]
故 \(H\succ0\iff A\succ0\) 且 Schur 补 \(C-B^*A^{-1}B\succ0\);\(H\succeq0\iff A\succ0\) 且 \(C-B^*A^{-1}B\succeq0\)(\(A\) 可逆时)。

Lemma 7.7.6:\(K=\begin{bmatrix}I_p&X\\X^*&I_q\end{bmatrix}\)。(a) \(K\succ0\iff X\) 严格收缩;(b) \(K\succeq0\iff X\) 收缩。证明:\(K\succ0\iff I_q-X^*X\succ0\iff\sigma_1(X)<1\)。

Theorem 7.7.7:\(H=\begin{bmatrix}A&B\\B^*&C\end{bmatrix}\) Hermitian,\(A\in M_p\),\(C\in M_q\)。以下等价: (a) \(H\) 正定;(b) \(A\) 正定且 \(C-B^*A^{-1}B\) 正定;(c) \(A,C\) 正定且 \(\rho(B^*A^{-1}BC^{-1})<1\);(d) \(A,C\) 正定且 \(\sigma_1(A^{-1/2}BC^{-1/2})<1\);(e) \(A,C\) 正定且存在严格收缩 \(X\in M_{p,q}\) 使 \(B=A^{1/2}XC^{1/2}\)。 证明:(b)⇒(c) 由 7.7.3(a);(c)⇔(d) 令 \(X=A^{-1/2}BC^{-1/2}\),\(\rho(B^*A^{-1}BC^{-1})=\rho(X^*X)=\sigma_1(X)^2\);(e)⇒(a):\(S=A^{1/2}\oplus C^{1/2}\),\(H=S^*\begin{bmatrix}I&X\\X^*&I\end{bmatrix}S\succ0\)。 (统计含义:\(X=A^{-1/2}BC^{-1/2}\) 是两组变量的“标准化互协方差”,其奇异值就是典型相关系数(canonical correlations);联合协方差正定 ⇔ 所有典型相关系数 \(<1\)。)

Lemma 7.7.8:\(A\) 半正定奇异,\(A_k=A+k^{-1}I\);\(X_k\) 为一列收缩。(a) \(A_k\) 正定且 \(A_k^{1/2}\to A^{1/2}\)(谱分解 + 平方根函数在 \([0,\infty)\) 连续);(b) 存在子列 \(X_{k_i}\to X\) 且 \(X\) 为收缩(收缩矩阵元素 \(|b_{ij}|\le\|Be_j\|_2\le\sigma_1(B)\le1\),有界序列有收敛子列;\(\sigma_1\) 连续,2.6.4)。

Theorem 7.7.9:\(H=\begin{bmatrix}A&B\\B^*&C\end{bmatrix}\) Hermitian。以下等价:(a) \(H\) 半正定;(b) \(A,C\) 半正定,且存在收缩 \(X\in M_{p,q}\) 使 \(B=A^{1/2}XC^{1/2}\)。 若 \(H\succeq0\),收缩可取为

\[X=\lim_{i\to\infty}(A+k_i^{-1}I_p)^{-1/2}B(C+k_i^{-1}I_q)^{-1/2}\quad(7.7.9.1)\]
若再有 \(A,C\) 非奇异,则 \(X=A^{-1/2}BC^{-1/2}\),且以下与 (a) 等价:(c) \(A,C\succ0\) 且 \(\rho(B^*A^{-1}BC^{-1})\le1\);(d) \(A,C\succ0\) 且 \(A^{-1/2}BC^{-1/2}\) 为收缩;(e) \(A,C\succ0\) 且 \(C-B^*A^{-1}B\succeq0\)。 证明:(a)⇒(b) 对 \(H_k=H+k^{-1}I\) 用 7.7.7(e) 得收缩 \(X_k\) 使 \(B=A_k^{1/2}X_kC_k^{1/2}\),由 7.7.8 取收敛子列取极限。(b)⇒(a) \(H=S\begin{bmatrix}I&X\\X^*&I\end{bmatrix}S^*\),\(S=A^{1/2}\oplus C^{1/2}\)。 重要推论:若对充分小 \(\varepsilon>0\),\((A+\varepsilon I)^{-1/2}B(C+\varepsilon I)^{-1/2}\) 恒为 Hermitian / 反 Hermitian / 对称 / 反对称 / 半正定 / 实,则收缩 \(X\) 也可取得同样性质。

Corollary 7.7.10:\(A,C\in M_p\) Hermitian。 (a) \(\begin{bmatrix}A&I\\I&C\end{bmatrix}\succeq0\Rightarrow A\succ0,C\succ0,A\succeq C^{-1},C\succeq A^{-1}\)(由 \(I=A^{1/2}XC^{1/2}\) 知 \(A,C\) 非奇异); (b) \(A,C\succ0\) 且 \(A\succeq C^{-1}\) 或 \(C\succeq A^{-1}\) ⇒ 该块矩阵 \(\succeq0\); (c) \(A\succ0\Rightarrow\begin{bmatrix}A&I\\I&A^{-1}\end{bmatrix}\succeq0\); (d) \(A\succ0\) 时等价:\(\begin{bmatrix}A&I\\I&A\end{bmatrix}\succeq0\) ⇔ \(A\succeq A^{-1}\) ⇔ \(A\succeq I\succeq A^{-1}\)(由 \(\rho(A^{-2})\le1\Rightarrow\rho(A^{-1})\le1\))。

Theorem 7.7.11(复分析、调和分析中出现的不等式):\(A\in M_p\)、\(C\in M_q\) 半正定,\(B\in M_{p,q}\)。以下等价: (a) \((x^*Ax)(y^*Cy)\ge|x^*By|^2\),\(\forall x,y\); (b) \(x^*Ax+y^*Cy\ge2|x^*By|\),\(\forall x,y\); (c) \(H=\begin{bmatrix}A&B\\B^*&C\end{bmatrix}\succeq0\); (d) 存在收缩 \(X\) 使 \(B=A^{1/2}XC^{1/2}\)。 \(A,C\) 正定时还等价于 (e) \(\rho(B^*A^{-1}BC^{-1})\le1\)。 证明:(a)⇒(b) AM–GM;(b)⇒(c) \(z=[x;y]\),\(z^*Hz=x^*Ax+y^*Cy+2\operatorname{Re}(x^*By)\ge x^*Ax+y^*Cy-2|x^*By|\ge0\);(c)⇒(d) 由 7.7.9;(d)⇒(a) Cauchy–Schwarz:\(|x^*By|^2=|(A^{1/2}x)^*(XC^{1/2}y)|^2\le\|A^{1/2}x\|^2\sigma_1(X)^2\|C^{1/2}y\|^2\le(x^*Ax)(y^*Cy)\)。 (统计意义:(a) 是协方差矩阵的广义 Cauchy–Schwarz:两组线性组合的协方差平方不超过方差之积。)

Corollary 7.7.12(正定性的推广:\(x^*Ax\ge|x^*Bx|\)):\(A\) 半正定、\(B\) Hermitian。以下等价:(a) \(x^*Ax\ge|x^*Bx|\) \(\forall x\);(b) \(x^*Ax+y^*Ay\ge2|x^*By|\);(c) \(\begin{bmatrix}A&B\\B&A\end{bmatrix}\succeq0\);(d) 存在 Hermitian 收缩 \(X\) 使 \(B=A^{1/2}XA^{1/2}\)。\(A\) 正定时还等价于 (e) \(\rho(A^{-1}B)\le1\)。 证明:(a)⇒(b) 由 \(2(x^*Ax+y^*Ay)=(x+y)^*A(x+y)+(x-y)^*A(x-y)\ge|(x+y)^*B(x+y)-(x-y)^*B(x-y)|=4|x^*By|\)(极化)。其余取 \(C=A\)、\(B=B^*\) 用 7.7.11,Hermitian 性由 7.7.9.1 的说明保证。

Corollary 7.7.13:\(A,B\) 半正定。等价:(a) \(A\succeq B\);(b) \(\begin{bmatrix}A&B\\B&A\end{bmatrix}\succeq0\);(c) 存在半正定收缩 \(X\) 使 \(B=A^{1/2}XA^{1/2}\)。(7.7.3(a) 的半正定版本。)

Corollary 7.7.14:\(A,C\) 半正定,\(B,D\) Hermitian,\(x^*Ax\ge|x^*Bx|\) 且 \(x^*Cx\ge|x^*Dx|\) ⇒ \(x^*(A\circ C)x\ge|x^*(B\circ D)x|\)。证明:两个 \(2\times2\) 块矩阵的 Hadamard 积 \(\begin{bmatrix}A\circ C&B\circ D\\B\circ D&A\circ C\end{bmatrix}\succeq0\)(Schur 定理),再用 7.7.12。

Theorem 7.7.15:\(H\) 正定,\(\alpha\subset\{1..n\}\),则

\[H^{-1}[\alpha]\succeq(H[\alpha])^{-1}.\]
证明:置换后 \(H=\begin{bmatrix}A&B\\B^*&C\end{bmatrix}\),由分块求逆公式(0.7.3.1)\(H^{-1}[\alpha]=(A-BC^{-1}B^*)^{-1}\);\(A\succeq A-BC^{-1}B^*\succ0\),由求逆反序(7.7.4(a))得结论。练习:\(A^{-1}=[\alpha_{ij}]\),\(\alpha_{ii}\ge1/a_{ii}\)。(统计:精度矩阵对角元 \(\ge\) 方差倒数,比值即 \(1/(1-R_i^2)\),\(R_i^2\) 为第 \(i\) 个变量对其余变量回归的决定系数。)

Theorem 7.7.16:\(A\) 正定,则下列矩阵半正定且奇异:(a) \(\begin{bmatrix}A&X\\X^*&X^*A^{-1}X\end{bmatrix}\)(任意 \(X\in M_{n,m}\));(b) \(\begin{bmatrix}A&I\\I&A^{-1}\end{bmatrix}\);(c) \(\begin{bmatrix}A&A\\A&A\end{bmatrix}\)。证明:Schur 补为零。练习:\(A\succeq0\) 时 \(\begin{bmatrix}A&A\\A&A\end{bmatrix}\succeq0\)(\(S\begin{bmatrix}I&I\\I&I\end{bmatrix}S^*\),\(S=A^{1/2}\oplus A^{1/2}\))。

技巧:许多 Hadamard 积不等式可由对适当的 \(2\times2\) 半正定块矩阵取 Hadamard 积得到。 Theorem 7.7.17:\(A,B\) 正定,则 (a) \(A^{-1}\circ B^{-1}\succeq(A\circ B)^{-1}\);(b) \(A^{-1}\circ A^{-1}\succeq(A\circ A)^{-1}\);(c) \(A^{-1}\circ A\succeq I\succeq(A^{-1}\circ A)^{-1}\)。证明:\(\begin{bmatrix}A&I\\I&A^{-1}\end{bmatrix}\circ\begin{bmatrix}B&I\\I&B^{-1}\end{bmatrix}=\begin{bmatrix}A\circ B&I\\I&A^{-1}\circ B^{-1}\end{bmatrix}\succeq0\),由 7.5.3(c) 与 7.7.10(a);(c) 取 \(B=A^{-1}\) 并用 7.7.10(d)。

Theorem 7.7.18:\(A,B\) 正定 ⇒ \(\lambda_{\min}(A\circ B)\ge\max\{\lambda_{\min}(AB),\lambda_{\min}(AB^T)\}\)。证明:\(B^{1/2}AB^{1/2}\succeq\lambda_{\min}(AB)I\) ⇔ \(A\succeq\lambda_{\min}(AB)B^{-1}\),于是 \(A\circ B\succeq\lambda_{\min}(AB)(B^{-1}\circ B)\succeq\lambda_{\min}(AB)I\)(7.7.17(c));转置版本用 7.5.P14。(是 Schur 乘积定理的定量版本,另一下界见 7.5.P24。)

7.7 习题概要(P1–P25+)

  • P1:\(\operatorname{diag}(4,2)\) 与 \(\operatorname{diag}(1,3)\) 说明 7.7.4(c) 不可逆;但若特征值逐个占优,则存在酉 \(W=UV^*\) 使 \(W^*AW\succeq B\)。P2:Loewner 序可相加。
  • P3:改进 7.7.4(b):\(A\succeq B\succeq0\Rightarrow A^{1/2}\succeq B^{1/2}\)(用 7.7.8 去掉 \(A\) 正定条件)。P4:\(A\succeq B\succeq0\)、\(C\succeq D\succeq0\) ⇒ \(A\circ C\succeq B\circ D\)。P5:主子矩阵保序。P6:\(A\succeq B\succeq0\Rightarrow\operatorname{range}B\subset\operatorname{range}A\)。P7:存在 \(\|x\|\le1\) 使 \(Ax=y\) ⇔ \(AA^*\succeq yy^*\)。
  • P8:7.7.15 严格 ⇔ \(B\) 列满秩。P9:\(H\succeq0\Rightarrow\min\{\operatorname{rank}A,\operatorname{rank}C\}\ge\operatorname{rank}B\)。P10:\((x^*Ax)(y^*A^{-1}y)\ge|x^*y|^2\)。P11:\(\det A\det C\ge|\det B|^2\)。P12:\(|\det(A+B)|^2\le\det(I+AA^*)\det(I+BB^*)\)。
  • P13–P14 算子凸性:\(\alpha A^2+(1-\alpha)B^2\succeq(\alpha A+(1-\alpha)B)^2+\alpha(1-\alpha)(A-B)^2\),故 \(t^2\) 在 Hermitian 矩阵上严格(算子)凸;\(\alpha A^{-1}+(1-\alpha)B^{-1}\succeq(\alpha A+(1-\alpha)B)^{-1}\),等号 ⇔ \(A=B\),故 \(t^{-1}\) 在正定矩阵上严格算子凸(强于 7.6.10)。
  • P15、P18:\(x^*Ax\ge|x^*Bx|\) 可传递到 Hadamard 幂 \([a_{ij}^k]\)、\([b_{ij}^k]\) 及 Hadamard 指数。
  • P16–P17:对称 \(B\) 的版本:\(x^*Ax\ge|x^TBx|\) ⇔ \(\begin{bmatrix}\bar A&B\\\bar B&A\end{bmatrix}\succeq0\) ⇔ 存在对称收缩 \(X\) 使 \(B=\bar A^{1/2}XA^{1/2}\) ⇔(\(A\) 正定时)\(\rho(\bar B\bar A^{-1}BA)\le1\) ⇔ \(\sigma_1(\bar A^{-1/2}BA^{-1/2})\le1\)。
  • P19:Grunsky 不等式的矩阵形式(7.7.19):\(f\) 单叶 ⇔ 对应二次型不等式成立。
  • P20:上述收缩可写为 \(X=(A^\dagger)^{1/2}B(C^\dagger)^{1/2}\);\(H\succeq0\iff A\succeq0\) 且 \(C\succeq B^*A^\dagger B\)(广义 Schur 补)。
  • P21:\(A\succ0,B\succeq0\):使 \(cA\succeq B\) 的最小 \(c=\rho(A^{-1}B)\);使 \(cA\circ X\succeq X\) 对所有 \(X\succeq0\) 成立的最小 \(c=e^TA^{-1}e\)。
  • P22–P25:\(A=A_1+iA_2\) 正定(\(A_1\) 实对称正定,\(A_2\) 实反对称);\(\operatorname{Re}A^{-1}\succeq(\operatorname{Re}A)^{-1}\),\(\operatorname{range}\operatorname{Im}A\subset\operatorname{range}\operatorname{Re}A\)(借助实表示 \(H=\begin{bmatrix}A_1&A_2\\-A_2&A_1\end{bmatrix}\) 酉相似于 \(A\oplus\bar A\));\(\operatorname{Im}A=(\operatorname{Re}A)^{1/2}X(\operatorname{Re}A)^{1/2}\),\(X\) 实反对称严格收缩;\(\det\operatorname{Re}A>|\det\operatorname{Im}A|\);Hermitian \(A\) 正定 ⇔ \(A_1\succ0\) 且 \(\rho(A_1^{-1}A_2)<1\)。P26:\(C_i\) 正定,\(E=\circ\operatorname{Re}C_i\)、\(F=\circ\operatorname{Im}C_i\),\(\det E>|\det F|\)。
  • P27:\(\sigma_1(A\circ B)\le\sigma_1(A)\sigma_1(B)\)(谱范数对 Hadamard 积次乘):\(\begin{bmatrix}I&X\\X^*&I\end{bmatrix}\circ\begin{bmatrix}I&Y\\Y^*&I\end{bmatrix}\succeq0\)。
  • P28:加边矩阵 \(\begin{bmatrix}A&x\\x^*&a\end{bmatrix}\) 正定 ⇔ \(a>x^*A^{-1}x\)。P29:\(A^{-1}\circ\dots\circ A^{-1}\succeq(A\circ\dots\circ A)^{-1}\)。P30:\((A^{-1}\circ A)e=e\),故 \(A^{-1}\circ A\succ I\) 不可能。P31:\(A\) 在子空间 \(\mathcal S\) 上正定,则 \(A\) 正定 ⇔ \(A^{-1}\) 在 \(\mathcal S^\perp\) 上正定(反例 \(A=\begin{bmatrix}1&2\\2&1\end{bmatrix}\))。
  • P32:\(A\succeq B\iff\begin{bmatrix}I&B^{1/2}\\B^{1/2}&A\end{bmatrix}\succeq0\iff\begin{bmatrix}B^{-1}&I\\I&A\end{bmatrix}\succeq0\)。P33:\(A_i\succeq B_i\)、凸组合 ⇒ \(\sum\alpha_iA_i\succeq(\sum\alpha_iB_i^{1/2})^2\) 与 \(\succeq(\sum\alpha_iB_i^{-1})^{-1}\)(标量情形即幂平均不等式)。P34:\(AA^*\succeq A^*A\) ⇔ \(A\) 正规;\((AA^*)^{1/2}\succeq(A^*A)^{1/2}\) ⇔ 正规。P35:\(\begin{bmatrix}(AA^*)^{1/2}&A\\A^*&(A^*A)^{1/2}\end{bmatrix}\) 半正定奇异。P36:\(\begin{bmatrix}A&B\\B&A\end{bmatrix}\succeq0\iff A\pm B\succeq0\)。P37:\(A\circ B^{-1}+A^{-1}\circ B\succeq2I\)。P38:Hermitian \(X\) 收缩 ⇔ \(I\succeq X^2\)。P39:\(A^*A\circ B^*B\succeq(A\circ B)^*(A\circ B)\)。
  • P40–P41 Schur 补的变分刻画:\(S_H(A)=C-B^*A^{-1}B=\max\{E=E^*:H\succeq0\oplus E\}\)(7.7.20,Loewner 序下的最大)。推论:Schur 补单调(\(H_1\succeq H_2\Rightarrow S_{H_1}(A_1)\succeq S_{H_2}(A_2)\))、凹(\(S_{H_1+H_2}(A_1+A_2)\succeq S_{H_1}(A_1)+S_{H_2}(A_2)\))、Hadamard 超乘(\(S_{H_1\circ H_2}(A_1\circ A_2)\succeq S_{H_1}(A_1)\circ S_{H_2}(A_2)\))。(条件协方差 = Schur 补,故条件协方差关于联合协方差单调且凹。)
  • P42:\(H(A)\succ0\Rightarrow H(A)^{-1}\succeq H(A^{-1})\succ0\)。P43:\(A\succeq B\succ0\Rightarrow\det(A+B)\ge\det A+n(\det A)^{(n-1)/n}(\det B)^{1/n}\ge\det A+n\det B\)。P44:由定义直接证 \(A\succeq B\succ0\Rightarrow B^{-1}\succeq A^{-1}\)。P45:\(H=\begin{bmatrix}B^{-1}&I\\I&A\end{bmatrix}\) 的 Schur 补 \(H/B^{-1}=A-B\)、\(H/A=B^{-1}-A^{-1}\),从而三者等价。
  • 注记(Loewner 矩阵单调函数理论):Loewner 1934:\(f\) 是矩阵单调函数(\(A\succeq B\Rightarrow f(A)\succeq f(B)\))⇔ 差商核 \(L_f(s,t)=(f(s)-f(t))/(s-t)\) 半正定。表:\(f(t)=-t^{-1}\),\(L_f=1/(st)\),\([\xi_i\xi_j]\succeq0\)(单调);\(f(t)=\sqrt t\),\(L_f=1/(\sqrt s+\sqrt t)\),\([(\xi_i+\xi_j)^{-1}]\succeq0\)(单调,7.1.P16);\(f(t)=t^2\),\(L_f=s+t\),\([\xi_i+\xi_j]\) 不定(不单调,1.3.25)。矩阵凸函数:\(t^2\)(Hermitian 上)、\(t^{-1}\)、\(-t^{1/2}\)、\(t^{-1/2}\)(正定上)严格凸。参考 Horn & Johnson (1991) 6.6 节、Bhatia (1997)、Donoghue (1974);FitzGerald & Horn (1977);C. R. Johnson (1978)。

7.8 涉及正定矩阵的不等式(Inequalities involving positive definite matrices)(PDF p.525–,原书 p.505–)

正定矩阵涉及大量关于行列式、特征值、对角元的不等式;最基本的是 Hadamard 不等式,许多其他不等式与它等价或是它的推广。

Theorem 7.8.1(Hadamard 不等式):\(A\) 正定,则

\[\det A\le a_{11}\cdots a_{nn}\quad(7.8.2)\]
等号 ⇔ \(A\) 对角。证明:\(D=\operatorname{diag}(a_{11}^{1/2},\dots,a_{nn}^{1/2})\),\(C=D^{-1}AD^{-1}\) 是相关矩阵(对角元 1,\(\operatorname{tr}C=n\));AM–GM:\(\det C=\prod\lambda_i\le(\frac1n\sum\lambda_i)^n=1\),等号 ⇔ 所有 \(\lambda_i=1\) ⇔ \(C=I\)。\(\det A=\det C\cdot\prod a_{ii}\le\prod a_{ii}\)。 (统计:相关矩阵行列式 \(\le1\),“广义方差 \(\le\) 各方差之积”,等号 ⇔ 变量不相关。)

Corollary 7.8.3(Hadamard 不等式,几何形式):\(B=[b_1\dots b_n]\) 非奇异,\(B^*=[\beta_1\dots\beta_n]\),则

\[|\det B|\le\|b_1\|_2\cdots\|b_n\|_2,\qquad|\det B|\le\|\beta_1\|_2\cdots\|\beta_n\|_2\quad(7.8.4)\]
等号 ⇔ 列(行)两两正交。证明:对 \(A=B^*B\) 用 (7.8.2),\(\det A=|\det B|^2\),\(a_{ii}=\|b_i\|^2\)。几何意义:平行多面体体积 \(\le\) 棱长之积,棱正交时取等。练习:(7.8.4) ⇒ (7.8.2)(\(A=B^*B\))。

Theorem 7.8.5(Fischer 不等式):\(H=\begin{bmatrix}A&B\\B^*&C\end{bmatrix}\) 正定,则

\[\det H\le(\det A)(\det C)\quad(7.8.6)\]
证明:\(A=U\Lambda U^*\),\(C=V\Gamma V^*\),\(W=U\oplus V\),\(W^*HW=\begin{bmatrix}\Lambda&U^*BV\\V^*B^*U&\Gamma\end{bmatrix}\),对其用 Hadamard:\(\det H\le\prod\lambda_i\prod\gamma_j=\det A\det C\)。 练习:归纳得 \(k\times k\) 分块时 \(\det H\le\prod\det H_{ii}\)(7.8.7);它蕴含 (7.8.2),故 Fischer 与 Hadamard 等价。

Koteljanskii 不等式(Hadamard–Fischer inequality):允许主子矩阵重叠;约定 \(\det A[\varnothing]=1\)。 Lemma 7.8.8:\(B\in M_m\) 正定,\(\alpha^c,\beta^c\) 非空不交且 \(\alpha\cup\beta=\{1..m\}\),则 \(\det B[\alpha^c\cup\beta^c]\le\det B[\alpha^c]\det B[\beta^c]\)(Fischer 应用于 \(B[\alpha^c\cup\beta^c]\))。 Theorem 7.8.9(Koteljanskii):\(A\) 正定,\(\alpha,\beta\subset\{1..n\}\):

\[\det A[\alpha\cup\beta]\cdot\det A[\alpha\cap\beta]\le\det A[\alpha]\cdot\det A[\beta]\quad(7.8.10)\]
证明:可设 \(\alpha\cup\beta=\{1..n\}\)、\(\alpha\cap\beta\neq\varnothing\)、\(\alpha^c,\beta^c\) 非空(不交)。Jacobi 恒等式(0.8.4.2)\(\det A^{-1}[\gamma^c]=\det A[\gamma]/\det A\):
\[\frac{\det A[\alpha\cap\beta]}{\det A}=\det A^{-1}[\alpha^c\cup\beta^c]\le\det A^{-1}[\alpha^c]\det A^{-1}[\beta^c]=\frac{\det A[\alpha]}{\det A}\frac{\det A[\beta]}{\det A}.\]
练习:(7.8.10) ⇒ (7.8.6),三者等价。(即 \(\log\det A[\cdot]\) 是子模集函数——与高斯熵 / 互信息非负性同源:\(I(X_\alpha;X_\beta|X_{\alpha\cap\beta})\ge0\)。)

Szász 不等式:\(P_k(A)\) 为全部 \(\binom nk\) 个 \(k\) 阶主子式之积,\(P_n=\det A\),\(P_1=\prod a_{ii}\)。 Theorem 7.8.11(Szász):\(A\) 正定,

\[P_{k+1}(A)^{\binom{n-1}{k}^{-1}}\le P_k(A)^{\binom{n-1}{k-1}^{-1}},\quad k=1,\dots,n-1\quad(7.8.12)\]
证明:\(A^{-1}=(\det A)^{-1}\operatorname{adj}A\),\(A^{-1}\) 对角元为 \(n-1\) 阶主子式除以 \(\det A\);对 \(A^{-1}\) 用 Hadamard:\(1/\det A\le P_{n-1}(A)/(\det A)^n\),得 \(P_n^{n-1}\le P_{n-1}\),即 \(P_n\le P_{n-1}^{1/(n-1)}\)(7.8.13,\(k=n-1\) 情形)。对每个 \(n-1\) 阶主子矩阵用 (7.8.13),每个 \(n-2\) 阶主子矩阵出现两次,得 \(P_{n-1}^{n-2}\le P_{n-2}^2\),即 \(k=n-2\) 情形;依此类推。 练习:得到单调链
\[a_{11}\cdots a_{nn}=P_1\ge P_2^{\binom{n-1}{1}^{-1}}\ge\dots\ge P_{k+1}^{\binom{n-1}{k}^{-1}}\ge\dots\ge P_n^{\binom{n-1}{n-1}^{-1}}=\det A\quad(7.8.14)\]
Szász 不等式是 Hadamard 不等式的加细且与之等价。

Lemma 7.8.15:\(A=\begin{bmatrix}a_{11}&x^*\\x&A_{22}\end{bmatrix}\) 半正定,定义 \(\alpha(A)=\det A/\det A_{22}\)(\(A_{22}\) 正定时)否则 0,则 \(\tilde A=\begin{bmatrix}a_{11}-\alpha(A)&x^*\\x&A_{22}\end{bmatrix}\) 半正定。 证明:\(A\) 奇异时 \(\tilde A=A\) 无需证明;\(A\) 正定时用 Sylvester 判据于尾部主子式:\(\det\tilde A[\{k..n\}]=\det A[\{k..n\}]>0\)(\(k\ge2\)),\(\det\tilde A=\det A-\alpha(A)\det A_{22}=0\),由 7.2.5(c) 得半正定。练习:用此引理归纳证 Hadamard 不等式。

Hadamard 不等式可写成 \(1\cdots1\cdot\det A\le\det(I\circ A)\),下面是其实质推广。 Theorem 7.8.16(Oppenheim–Schur 不等式):\(A,B\) 半正定,

\[\max\{a_{11}\cdots a_{nn}\det B,\ b_{11}\cdots b_{nn}\det A\}\le\det(A\circ B)\quad(7.8.17)\]
\[a_{11}\cdots a_{nn}\det B+b_{11}\cdots b_{nn}\det A\le\det(A\circ B)+\det(AB)\quad(7.8.18)\]
证明(归纳,用 7.8.15 的记号):\(\tilde A\circ B\succeq0\),按第一行展开
\[0\le\det(\tilde A\circ B)=\det(A\circ B)-\alpha(A)b_{11}\det(A_{22}\circ B_{22}),\]
由归纳假设 \(\det(A_{22}\circ B_{22})\ge b_{22}\cdots b_{nn}\det A_{22}\),得 \(\det(A\circ B)\ge\alpha(A)b_{11}b_{22}\cdots b_{nn}\det A_{22}=b_{11}\cdots b_{nn}\det A\);另一半由 \(A\circ B=B\circ A\)。(7.8.18):对 \(\tilde A\circ B\) 用 (7.8.17) 得 \((a_{11}-\alpha(A))a_{22}\cdots a_{nn}\det B\le\det(A\circ B)-\alpha(A)b_{11}\det(A_{22}\circ B_{22})\),再对 \(\det(A_{22}\circ B_{22})\) 用归纳假设,整理得
\[\det(A\circ B)+\det(AB)-\prod a_{ii}\det B-\prod b_{ii}\det A\ge\alpha(A)(a_{22}\cdots a_{nn}-\det A_{22})(b_{11}\det B_{22}-\det B)\ge0\]
(两个括号分别由 Hadamard 与 Fischer 不等式非负)。 练习:\(A,B\) 正定 ⇒ \(\det A\det B\le\det(A\circ B)\),故 \(\det(A\circ A^{-1})\ge1\)(对比 7.7.17(c));链 \(\det A\det B\le\prod a_{ii}\det B\le\det(A\circ B)\le\prod a_{ii}\prod b_{ii}\)。

Theorem 7.8.19(Ostrowski–Taussky 不等式):\(H,K\) Hermitian,\(A=H+iK\),\(H\) 正定,则

\[\det H\le|\det(H+iK)|=|\det A|\quad(7.8.20)\]
等号 ⇔ \(K=0\)。(标量类比 \(|z|\ge|\operatorname{Re}z|\)。)证明:\(A=H(I+iH^{-1}K)\),\(H^{-1}K\) 可对角化、特征值 \(\lambda_j\) 为实(7.6.2(a)),\(|\det(I+iH^{-1}K)|=\prod|1+i\lambda_j|\ge1\),因 \(|1+i\lambda|^2=1+\lambda^2\)。

Theorem 7.8.21(Minkowski 行列式不等式):\(A,B\) 正定,

\[(\det A)^{1/n}+(\det B)^{1/n}\le(\det(A+B))^{1/n}\quad(7.8.22)\]
等号 ⇔ \(A=cB\)(\(c>0\))。证明:同时对角化 \(A=SS^*\),\(B=S\Lambda S^*\),化为
\[1+\Big(\prod\lambda_j\Big)^{1/n}\le\Big(\prod(1+\lambda_j)\Big)^{1/n}\quad(7.8.23)\]
这是 Minkowski 乘积不等式(附录 B10)的特例,等号 ⇔ \(\lambda_j\) 全相等。练习:推出 \(\det(A+B)\ge\det A+\det B\)(对比 7.6.P6)。(即 \((\det)^{1/n}\) 在正定锥上凹且一次齐次。)

Theorem 7.8.24:\(n\ge2\),\(H\succ0\),\(K\) Hermitian,\(A=H+iK\):

\[\det H+|\det K|\le|\det(H+iK)|=|\det A|\quad(7.8.25)\]
\(n=2\) 时等号 ⇔ \(K=cH\)(\(c\in\mathbf R\));\(n\ge3\) 时等号 ⇔ \(K=0\)。(\(n=1\) 时会变成 \(\operatorname{Re}z+|\operatorname{Im}z|\le|z|\),一般不成立。)证明:化为
\[\prod_{j=1}^n(1+\lambda_j^2)\ge\Big(1+\prod|\lambda_j|\Big)^2\quad(7.8.26)\]
\(n=2\):\((1+\lambda_1^2)(1+\lambda_2^2)=1+\lambda_1^2+\lambda_2^2+\lambda_1^2\lambda_2^2\ge1+2|\lambda_1\lambda_2|+\lambda_1^2\lambda_2^2\)(AM–GM)。\(n\ge3\):展开后丢弃非负项,\(\ge1+(\prod_{j<n}\lambda_j^2+\lambda_n^2)+\prod\lambda_j^2\ge1+2\prod|\lambda_j|+\prod\lambda_j^2\);等号要求 \(\lambda_1=\dots=\lambda_{n-1}=0\) 且 \(\lambda_n=\prod_{j<n}\lambda_j=0\)。

Theorem 7.8.27(Fan 行列式不等式):同上假设,

\[(\det H)^{2/n}+|\det K|^{2/n}\le|\det(H+iK)|^{2/n}=|\det A|^{2/n}\quad(7.8.28)\]
等号 ⇔ \(H^{-1}K\) 的(实)特征值绝对值全相等。证明:化为 \(1+(\prod\lambda_j^2)^{1/n}\le(\prod(1+\lambda_j^2))^{1/n}\),又是 Minkowski 不等式特例。练习:等号 ⇔ \((H^{-1}K)^2=cI\);\(K=\gamma H\) 时取等;由 (7.8.25) 或 (7.8.28) 推出 (7.8.20)。

7.8 习题概要(P1– )

  • P1:用 (7.8.17) 重证 7.5.3(b)。P2:分块 Hadamard:\(|\det A|\le(\prod_i\sum_j|||A_{ij}|||_2^2)^{k/2}\)(\(A_{ij}\in M_k\))。
  • P3:\(A,B\) 正定,\(A\circ B=AB\) ⇔ \(\det(A\circ B)=\det(AB)\) ⇔ 两者都是正对角阵。
  • P4:\((\det A)^{1/n}=\min\{\frac1n\operatorname{tr}(AB):B\succ0,\det B=1\}\)(7.8.29),故 \((\det A)^{1/n}\) 凹,由此推 Minkowski 不等式。P5:\(H_+\succ0\Rightarrow H_-=\begin{bmatrix}A&-B\\-B^*&C\end{bmatrix}\succ0\),对 \(H_\pm\) 用 Minkowski 推出 Fischer。P6:用 Cholesky 证 Fischer。
  • P7:\(A\in M_3(\mathbf R)\),\(|a_{ij}|\le1\) ⇒ \(|\det A|<3\sqrt3\)(Hadamard 界不可达):\(\det A\) 对每个元素线性,极值在 \(a_{ij}=\pm1\) 处;复情形用最大模原理。
  • P8:\(|\det A|\le\|A\|_\infty^nn^{n/2}\)(Fredholm 积分方程理论中的著名不等式);特征多项式系数 \(|a_{n-k}|\le\binom nk\|A\|_\infty^kk^{k/2}\)。
  • P9–P10:\(\det A=\min\{\prod v_i^*Av_i:\{v_i\}\text{ 正交规范}\}\),等号 ⇔ \(u_i\) 为特征向量。P11:Schur 补的反向 Fischer 不等式 \(\det(A/A_{11})\det(A/A_{22})\le\det A\)。P12:\(\det A=(a_{nn}-x^*A_{11}^{-1}x)\det A_{11}\le a_{nn}\det A_{11}\),归纳证 Hadamard。P13:\(S_k(\lambda_1..\lambda_n)\le S_k(a_{11}..a_{nn})\)(初等对称函数版本)。
  • 之后 7 题(P14–P20)的统一框架:可经 *合同对角化的非奇异 \(A=SDS^*\),\(D=\operatorname{diag}(e^{i\theta_j})\),\(H=S\Gamma S^*\)、\(K=S\Sigma S^*\),\(\Gamma=\operatorname{diag}(\cos\theta_j)\)、\(\Sigma=\operatorname{diag}(\sin\theta_j)\)(4.5.24、4.5.P37);把 (7.8.20/25/28) 推广到这类矩阵(续见下)。
  • P14:Hermitian 部分正定的矩阵可经 *合同对角化(反之不然,需举例)。P15:\(|\det H|=|\det S|^2\prod|\cos\theta_j|\),\(|\det K|=|\det S|^2\prod|\sin\theta_j|\),\(|\det A|=|\det S|^2\)。
  • P16–P18:三个不等式的推广形式 \(|\det H|\le|\det A|\)、\(|\det H|+|\det K|\le|\det A|\)(\(n\ge2\))、\(|\det H|^{2/n}+|\det K|^{2/n}\le|\det A|^{2/n}\),分别归结为 \(\prod|\cos\theta_j|\le1\)、\(\prod|\cos\theta_j|+\prod|\sin\theta_j|\le1\)、\((\prod\cos^2\theta_j)^{1/n}+(\prod\sin^2\theta_j)^{1/n}\le1\)。
  • P19:Minkowski 不等式的另一证法:\((\prod\cos\theta_j)^{1/n}+(\prod\sin\theta_j)^{1/n}\le(\prod(\cos\theta_j+\sin\theta_j))^{1/n}\),\(\theta_j\in(0,\pi/2)\)。P20:由 P16–P18 推出 (7.8.20)(7.8.25)(7.8.28)。
  • (PDF p.536 为空白页。)

第 7 章 本章要点

  1. 半正定 / 正定的等价刻画:二次型非负(正)⇔ 特征值非负(正)⇔ 所有主子式非负(顺序主子式为正)⇔ \(A=B^*B\)(\(B\) 列满秩)⇔ 存在 Cholesky 分解 ⇔ 是 Gram 矩阵 ⇔(Moutard)与所有半正定矩阵的 Frobenius 内积非负。注意半正定不能只看顺序主子式。
  2. 关键技术引理:\(x^*Ax=0\iff Ax=0\)(半正定时),由此得行 / 列包含性质、广义 Schur 补、半正定矩阵的“零对角元 ⇒ 整行整列为零”。
  3. 唯一半正定 \(k\) 次方根 \(A^{1/k}\) 是 \(A\) 的多项式;极分解 \(A=PU=UQ\),\(P=(AA^*)^{1/2}\);薄 SVD 由 \(A^*A\) 的特征分解得到;\(A^*A=B^*B\iff B=VA\)(\(V\) 列正交规范)。
  4. 奇异值理论:Jordan–Wielandt 矩阵把 Hermitian 特征值结论(Weyl、交错、Courant–Fischer、Hoffman–Wielandt、Mirsky)移植到奇异值;von Neumann 迹不等式 \(\operatorname{Re}\operatorname{tr}(AB^*)\le\sum\sigma_i(A)\sigma_i(B)\) 是核心。由此得 Eckart–Young–Mirsky 最佳低秩逼近(对所有酉不变范数)、Procrustes 问题、最近酉 / Hermitian / 奇异矩阵、最小范数最小二乘解 \(A^\dagger b\)。
  5. 酉不变范数 ⇔ 对称规范函数(von Neumann);Ky Fan 占优定理:所有酉不变范数下 \(\|A\|\le\|B\|\) ⇔ 所有 Ky Fan \(k\)-范数下成立。
  6. Kantorovich / Wielandt 不等式(由条件数控制 Rayleigh 商乘积与正交向量像的夹角)。
  7. Schur 乘积定理:半正定矩阵的 Hadamard 积半正定;Hadamard 幂、非负系数解析函数(如 \(e^{a_{ij}}\))保持半正定;Oppenheim 不等式 \(\det(A\circ B)\ge\prod a_{ii}\det B\)。
  8. 同时对角化(\(A\succ0\) 时 \(A=SS^*\)、\(B=S\Lambda S^*\))是证明凸性与行列式不等式的主要工具:\(\log\det\) 严格凹、\(\operatorname{tr}A^{-1}\) 严格凸、Minkowski 行列式不等式、Ostrowski–Taussky、Fan。
  9. Loewner 偏序:合同保序、求逆反序、平方根单调但平方不单调;Schur 补刻画分块正定性(\(H\succeq0\iff A\succeq0,C\succeq0,B=A^{1/2}XC^{1/2}\),\(X\) 收缩);\(H^{-1}[\alpha]\succeq(H[\alpha])^{-1}\);Schur 补是 Loewner 序下的变分极大,单调且凹。
  10. 行列式不等式家族:Hadamard ⇔ Fischer ⇔ Koteljanskii ⇔ Szász,彼此等价;Oppenheim–Schur 将其推广到 Hadamard 积。

第 7 章 与量化交易的关联

  • 风险建模与协方差估计:样本协方差、因子模型协方差 \(B\Sigma_fB^T+D\) 都必须半正定。7.1–7.2 的刻画给出检验方法(Cholesky 是否成功、最小特征值是否非负;不要只看顺序主子式);7.2.3 的对角占优判据和 Hadamard 指数 / Schur 乘积定理说明哪些逐元素变换(收缩到常相关、指数核、逐元素乘以半正定“taper”矩阵)能保住半正定性。\(\min\) 矩阵(Brown 运动协方差)、Markov 矩阵 \([r^{|i-j|}]\)(AR(1) 相关)、Toeplitz 半正定性(平稳序列自协方差)都在本章出现。
  • 蒙特卡罗与情景生成:Cholesky 分解 \(\Sigma=LL^T\) 用于生成相关正态随机数;半正定(奇异)时需用 \(A^{1/2}\) 或 LDL 变体;7.3.11 说明任意满足 \(X^TX=\Sigma\) 的因子只差一个正交变换。
  • PCA、低秩因子模型与降维:Eckart–Young–Mirsky 定理保证截断 SVD / 特征分解是所有酉不变范数下最优低秩近似,误差 \((\sum_{i>k}\sigma_i^2)^{1/2}\);Ky Fan 和 Weyl 扰动界(7.3.5、Mirsky 7.4.9.3)用于评估估计误差对主成分的影响,奇异值关于扰动 1-Lipschitz。
  • 回归与最小二乘:最小范数最小二乘解 \(x=A^\dagger b=\sum\sigma_i^{-1}(v_i^*b)w_i\);岭回归 \((A^*A+tI)^{-1}A^*\) 在 \(t\to0\) 收敛到伪逆;7.2.P16 证明加 \(tI\) 严格降低条件数;7.7.15 / 7.2.P19 的精度矩阵对角元与 VIF 的关系。
  • 组合优化:最小方差 / 均值–方差问题需要 \(\Sigma\succ0\) 才有唯一解;同时对角化(7.6.4)把两个二次型(风险与跟踪误差、或两种风险模型)一起对角化,用于广义特征值问题与最大夏普 / 最大分散化组合;\(\log\det\) 凹性、\(\operatorname{tr}A^{-1}\) 凸性、\((\det)^{1/n}\) 凹性保证高斯似然、D/A-最优、某些风险平价目标是凸优化;Schur 补用于条件协方差(给定因子收益后的残差协方差)及 SDP 约束建模(\(\begin{bmatrix}A&B\\B^T&C\end{bmatrix}\succeq0\) 形式的 LMI)。
  • 协方差矩阵修复与旋转:最近相关矩阵 / 最近半正定矩阵问题建立在 7.4 的逼近理论之上(Frobenius 距离、酉不变范数);Procrustes 问题(7.4.5)用于因子载荷旋转对齐、不同时期风险模型的因子匹配;最近正交矩阵用于对冲比率 / 组合“正交化”。
  • 数值稳定性:Kantorovich 不等式给出最速下降收敛率 \(((\kappa-1)/(\kappa+1))^2\),Wielandt 不等式说明病态协方差会把正交方向压到几乎共线——优化器对估计误差敏感(“误差最大化”)的几何根源。
  • 典型相关分析:7.7.7 中的 \(A^{-1/2}BC^{-1/2}\) 的奇异值即典型相关系数,用于两组资产 / 因子之间的相关结构分析。
  • 7.5.5–7.5.8(椭圆型 PDE 极值原理与唯一性)与 Black–Scholes 类 PDE 的比较原理同源,但本书只给出线性代数部分。量子不确定性原理、Grunsky 不等式、Loewner–John 椭球等内容与量化交易没有直接关系。

第 7 章 推荐习题

  • 7.1.P1–P4(相关矩阵与 \(|a_{ij}|^2\le a_{ii}a_{jj}\))、7.1.P7–P13(正定函数,构造合法协方差核)、7.1.P18–P20(min 矩阵 / Brown 运动核)、7.1.P28(广义 Schur 补)。
  • 7.2.P3、P5(Cholesky 与 Hadamard 不等式)、7.2.P12–P14(Markov / Gauss 矩阵:AR(1) 相关矩阵行列式与逆)、7.2.P16(\(\kappa(A+tI)\) 单调——岭收缩)、7.2.P19(精度矩阵对角元)、7.2.P23(矩阵几何平均)。
  • 7.3.P7、P9、P15(Moore–Penrose 逆与最小二乘)、7.3.P16–P18(奇异值 Weyl 不等式与迹不等式)、7.3.P34(由 Cholesky 推 QR)。
  • 7.4.P1–P2(标量 Kantorovich、相关系数受条件数约束)、7.4.P10(Bergström 不等式)、7.4.P15–P17(最近酉矩阵 / 最近奇异矩阵唯一性)。
  • 7.5.P4–P6(\(|A|\) 不保半正定的反例)、7.5.P12、P18–P21(Hadamard 指数何时正定)、7.5.P24(\(\lambda_{\min}(A\circ B)\) 下界)。
  • 7.6.P6、P8(行列式不等式)、7.6.P18–P20(椭球体积与行列式)。
  • 7.7.P13–P14(\(t^2\)、\(t^{-1}\) 的算子凸性)、7.7.P27(\(\sigma_1(A\circ B)\le\sigma_1(A)\sigma_1(B)\))、7.7.P40–P41(Schur 补的变分刻画、单调性与凹性)。
  • 7.8.P4(\((\det A)^{1/n}\) 的变分刻画与凹性)、7.8.P9、P12(Hadamard 不等式的另证)。

第 8 章 正矩阵与非负矩阵(Positive and Nonnegative Matrices)(PDF p.537–,原书 p.517–;续见下一块)

8.0 引言(PDF p.537–539,原书 p.517–519)

人口迁移模型:\(n\ge2\) 个城市,每天 8:00 城市 \(j\) 当前人口的固定比例 \(a_{ij}\) 迁往城市 \(i\),\(a_{jj}\) 留在原地。第 \(m\) 天人口 \(p^{(m)}\):

\[p_i^{(m+1)}=a_{i1}p_1^{(m)}+\dots+a_{in}p_n^{(m)},\qquad p^{(m+1)}=Ap^{(m)}=\dots=A^{m+1}p^{(0)}\]
\(0\le a_{ij}\le1\),每列和为 1(列随机矩阵)。长期人口分布取决于 \(A^m\) 的渐近行为。

两城市详解:\(a_{21}=\alpha\)、\(a_{12}=\beta\),\(A=\begin{bmatrix}1-\alpha&\beta\\\alpha&1-\beta\end{bmatrix}\)。特征值 \(\lambda_2=1\)、\(\lambda_1=1-\alpha-\beta\);\(0\le\alpha,\beta\le1\) ⇒ \(|\lambda_1|\le1=\rho(A)\),谱半径本身就是特征值;除 \(\alpha=\beta=0\)(可约)外它是单特征值。\(\alpha+\beta\ne0\) 时特征向量 \(x=[\beta\ \alpha]^T\)(对应 1)、\(z=[1\ -1]^T\);\(A=S\Lambda S^{-1}\),\(S=\begin{bmatrix}\beta&1\\\alpha&-1\end{bmatrix}\),\(S^{-1}=\frac1{\alpha+\beta}\begin{bmatrix}1&1\\\alpha&-\beta\end{bmatrix}\)。\(x\) 非负,\(A\) 不可约时为正。若 \(\alpha,\beta\) 不同时为 1,则 \(|\lambda_1|<1\),

\[\lim_{m\to\infty}A^m=\frac1{\alpha+\beta}\begin{bmatrix}\beta&\beta\\\alpha&\alpha\end{bmatrix},\qquad\lim p^{(m)}=\frac{p_1^{(0)}+p_2^{(0)}}{\alpha+\beta}\begin{bmatrix}\beta\\\alpha\end{bmatrix}\]
均衡分布与初始分布无关,正比于 Perron 向量 \(x\);\(A^m\) 的极限是秩 1 矩阵,每列正比于 \(x\)。 例外:\(\alpha=\beta=0\) 时 \(A=I\),极限依赖初始分布;\(\alpha=\beta=1\) 时 \(A=\begin{bmatrix}0&1\\1&0\end{bmatrix}\),两城每天整体互换,\(A^m\) 不收敛,但 Cesàro 平均收敛:\(\lim\frac1m\sum_{k=1}^mA^k=\begin{bmatrix}.5&.5\\.5&.5\end{bmatrix}\),\(\lim\frac1m\sum p^{(k)}=\frac{p_1^{(0)}+p_2^{(0)}}2[1\ 1]^T\)。

例子给出的五条结论(第 8 章要对一般 \(n\) 证明):

  1. 谱半径 \(\rho(A)\) 本身是 \(A\) 的特征值(不只是某个特征值的模);
  2. 对应特征向量可取非负,\(A\) 不可约时为正;
  3. 若 \(A\) 每个元素为正,则 \(\rho(A)\) 是单特征值,且严格大于其他所有特征值的模;
  4. 若 \(A>0\),则 \(\lim(A/\rho(A))^m\) 存在且为秩 1 矩阵,每列正比于 \(x\);
  5. 即使有零元素,\(\lim\frac1m\sum_{k=1}^m(A/\rho(A))^k\) 仍存在。

习题 8.0:P1 \(\begin{bmatrix}1&1\\0&1\end{bmatrix}\) 谱半径 1 但幂无界;P2 \(A_\epsilon=\begin{bmatrix}(1+\epsilon)^{-1}&(1+\epsilon)^{-1}\\\epsilon^2(1+\epsilon)^{-1}&(1+\epsilon)^{-1}\end{bmatrix}\):\(\lambda=1\) 单重、左右特征向量 \(x=(1+\epsilon)^{-1}[1\ \epsilon]^T\)、\(y=(1+\epsilon)(2\epsilon)^{-1}[\epsilon\ 1]^T\),\(\lim A_\epsilon^m=\frac12\begin{bmatrix}1&\epsilon^{-1}\\\epsilon&1\end{bmatrix}=xy^T\),\(\epsilon\to0\) 时发散;P3 不可约迁移矩阵意味着任两城之间都能(经若干天)到达。延伸阅读:Berman & Plemmons (1994)、Seneta (1973)、Varga (2000)。

8.1 不等式与一般性质(Inequalities and generalities)(PDF p.539–,原书 p.519–)

记号:\(|A|=[|a_{ij}|]\)(逐元素绝对值)。实矩阵 \(A\ge0\) 指所有 \(a_{ij}\ge0\)(非负矩阵,nonnegative matrix),\(A>0\) 指所有 \(a_{ij}>0\)(正矩阵,positive matrix);\(A\ge B\) 指 \(A-B\ge0\),\(A>B\) 指 \(A-B>0\)。注意与第 7 章 Loewner 序 \(\succeq\) 区分——这里是逐元素序。 基本事实(练习 8.1.1–8.1.7):\(|A|\ge0\),\(=0\iff A=0\);\(|aA|=|a||A|\);\(|A+B|\le|A|+|B|\);\(A\ge0\) 且 \(A\ne0\) ⇒ \(A>0\) 仅当 \(m=n=1\);非负组合保持非负;不等式可相加、可传递。

Proposition 8.1.8:\(A\in M_n\),\(x\in\mathbf C^n\)。 (a) \(|Ax|\le|A||x|\); (b) 若 \(A\ge0\) 且有一行全正,\(|Ax|=A|x|\),则存在 \(\theta\) 使 \(e^{-i\theta}x=|x|\); (c) 若 \(x>0\) 且 \(Ax=|A|x\),则 \(A=|A|\)(\(A\) 非负)。 证明:(a) 三角不等式 \(|Ax|_k=|\sum_ja_{kj}x_j|\le\sum_j|a_{kj}||x_j|\)(8.1.8.1)。(b) 第 \(k\) 行全正时三角不等式取等,存在 \(\theta\) 使 \(e^{-i\theta}a_{kj}x_j=a_{kj}|x_j|\)(附录 A),\(a_{kj}>0\) ⇒ \(e^{-i\theta}x_j=|x_j|\)。(c) \(|A|x=\operatorname{Re}(|A|x)=\operatorname{Re}(Ax)=(\operatorname{Re}A)x\),\((|A|-\operatorname{Re}A)x=0\),而 \(|A|-\operatorname{Re}A\ge0\)、\(x>0\),由 8.1.1 得 \(|A|=\operatorname{Re}A\),于是 \(A=|A|\)。

练习(8.1.9–8.1.17):\(|AB|\le|A||B|\);\(|A^m|\le|A|^m\);\(0\le A\le B\)、\(0\le C\le D\) ⇒ \(0\le AC\le BD\);\(0\le A\le B\Rightarrow0\le A^m\le B^m\);\(A\ge0\Rightarrow A^m\ge0\),\(A>0\Rightarrow A^m>0\);\(A>0\)、\(x\ge0\)、\(x\ne0\) ⇒ \(Ax>0\);\(A\ge0\)、\(x>0\)、\(Ax=0\) ⇒ \(A=0\);\(|A|\le|B|\Rightarrow\|A\|_2\le\|B\|_2\);\(\|A\|_2=\||A|\|_2\)(对任何绝对向量范数都成立)。

Theorem 8.1.18:\(B\ge0\),\(|A|\le B\) ⇒ \(\rho(A)\le\rho(|A|)\le\rho(B)\)。证明:\(|A^m|\le|A|^m\le B^m\),于是 \(\|A^m\|_2\le\||A|^m\|_2\le\|B^m\|_2\),开 \(m\) 次方令 \(m\to\infty\),由 Gelfand 公式 \(\rho(A)=\lim\|A^m\|^{1/m}\)(5.6.14)。 Corollary 8.1.19:\(0\le A\le B\Rightarrow\rho(A)\le\rho(B)\)(谱半径关于逐元素序单调)。

Corollary 8.1.20:\(A\ge0\)。(a) 主子矩阵 \(\tilde A\) 满足 \(\rho(\tilde A)\le\rho(A)\);(b) \(\max_ia_{ii}\le\rho(A)\);(c) 若某对角元为正则 \(\rho(A)>0\)。证明:\(PAP^T=\begin{bmatrix}\tilde A&B\\C&D\end{bmatrix}\),\(\rho(\tilde A)=\rho(\tilde A\oplus0)\le\rho(PAP^T)\)(8.1.18);(b) 取 \(r=1\)。练习:非负假设必要——\(A=\begin{bmatrix}1&1\\-1&-1\end{bmatrix}\) 幂零,\(\rho(A)=0<1\);\(A>0\Rightarrow\rho(A)>0\)。

Lemma 8.1.21:\(A\ge0\) ⇒ \(\rho(A)\le|||A|||_\infty=\max_i\sum_ja_{ij}\)(最大行和),\(\rho(A)\le|||A|||_1\)(最大列和);行和全相等时 \(\rho(A)=|||A|||_\infty\)(\(e\) 是特征向量),列和全相等时 \(\rho(A)=|||A|||_1\)。

Theorem 8.1.22(行和 / 列和夹逼):\(A\ge0\),

\[\min_i\sum_ja_{ij}\le\rho(A)\le\max_i\sum_ja_{ij}\quad(8.1.23)\qquad\min_j\sum_ia_{ij}\le\rho(A)\le\max_j\sum_ia_{ij}\quad(8.1.24)\]
证明(下界,出人意料地是“最小行和”):\(\alpha=\min\) 行和;\(\alpha>0\) 时令 \(b_{ij}=\alpha a_{ij}/\sum_ka_{ik}\),则 \(A\ge B\ge0\)、\(B\) 行和全为 \(\alpha\),\(\rho(B)=\alpha\le\rho(A)\)(8.1.19)。列和对 \(A^T\)。

Corollary 8.1.25:\(A\ge0\) 且所有行和为正(或所有列和为正)⇒ \(\rho(A)>0\);特别地 \(n\ge2\) 时不可约非负矩阵 \(\rho(A)>0\)。练习:不可约 \(A\) 无零行 / 零列,但对角元可全为零;\(A\) 不可约、\(B>0\) ⇒ \(AB>0\)。

加权推广:\(S=\operatorname{diag}(x)\),\(x>0\),\(S^{-1}AS=[a_{ij}x_i^{-1}x_j]\ge0\) 与 \(A\) 同谱,套用 8.1.22: Theorem 8.1.26:\(A\ge0\),任意正向量 \(x\):

\[\min_i\frac1{x_i}\sum_ja_{ij}x_j\le\rho(A)\le\max_i\frac1{x_i}\sum_ja_{ij}x_j\quad(8.1.27)\]
\[\min_jx_j\sum_i\frac{a_{ij}}{x_i}\le\rho(A)\le\max_jx_j\sum_i\frac{a_{ij}}{x_i}\quad(8.1.28)\]
Corollary 8.1.29(Collatz–Wielandt 型比较):\(A\ge0\)、\(x>0\),若 \(\alpha x\le Ax\le\beta x\)(\(\alpha,\beta\ge0\))则 \(\alpha\le\rho(A)\le\beta\);\(\alpha x<Ax\) ⇒ \(\alpha<\rho(A)\);\(Ax<\beta x\) ⇒ \(\rho(A)<\beta\)。(严格情形:存在 \(\alpha'>\alpha\) 使 \(\alpha x<\alpha'x\le Ax\)。) Corollary 8.1.30:\(A\ge0\) 的正特征向量必对应 \(\rho(A)\):\(x>0\)、\(Ax=\lambda x\) ⇒ \(\lambda=\rho(A)\)(\(\lambda x\le Ax\le\lambda x\))。 Corollary 8.1.31:\(A\ge0\) 且有正特征向量,则
\[\rho(A)=\max_{x>0}\min_i\frac1{x_i}\sum_ja_{ij}x_j=\min_{x>0}\max_i\frac1{x_i}\sum_ja_{ij}x_j\quad(8.1.32)\]
(用正特征向量代入 8.1.27 取等。)

Corollary 8.1.33(幂的增长控制):\(A\ge0\) 有正特征向量 \(x\),\(A^m=[a_{ij}^{(m)}]\),则对所有 \(m,i\)

\[\sum_ja_{ij}^{(m)}\le\frac{\max_kx_k}{\min_kx_k}\rho(A)^m\quad(8.1.34a),\qquad\frac{\min_kx_k}{\max_kx_k}\rho(A)^m\le\sum_ja_{ij}^{(m)}\quad(8.1.34b)\]
\(\rho(A)>0\) 时 \([\rho(A)^{-1}A]^m\) 的元素一致有界。证明:\(A^mx=\rho(A)^mx\),\(\rho(A)^m\max x_k\ge(A^mx)_i=\sum_ja^{(m)}_{ij}x_j\ge\min x_k\sum_ja_{ij}^{(m)}\)。

8.1 习题概要(P1–P11)

  • P1:\(A\ge0\)、\(A^k>0\) ⇒ \(\rho(A)>0\)。P2:\(2\times2\) 例:\(A\ge0\) 非正但 \(A^2>0\)(如 \(\begin{bmatrix}0&1\\1&1\end{bmatrix}\))。P3:非零非负矩阵有正特征向量 ⇒ \(\rho(A)>0\)。
  • P4:一般 \(|A^m|\le(\rho(A)+\varepsilon)^mC(A,\varepsilon)\);有正特征向量时可取 \(\varepsilon=0\);\(\begin{bmatrix}1&1\\0&1\end{bmatrix}\) 说明该假设不能去掉。P5:有正特征向量 ⇒ 对角相似于行和全等于 \(\rho(A)\) 的非负矩阵。P6:可约非负矩阵也可有正特征向量(如 \(I\))。
  • P7:(8.1.27) 即 \(\min_i(Ax)_i/x_i\le\rho(A)\le\max_i(Ax)_i/x_i\);取 \(x=e\) 得 (8.1.23);取 \(x=Ae\)(行和向量 \(R\))得改进界 \(\min R_i\le\min_i\frac1{R_i}\sum_ja_{ij}R_j\le\rho(A)\le\max_i\frac1{R_i}\sum_ja_{ij}R_j\le\max R_i\)——这就是幂迭代的一步。
  • P8:\(A\ge B\ge0\Rightarrow|||A|||_2\ge|||B|||_2\)。P9:\(|||A|||_2\le|||\,|A|\,|||_2\)。P10:分块范数压缩矩阵 \(\mathcal A=[G(A_{ij})]\) 满足 \(\rho(A)\le\rho(\mathcal A)\)。P11:\(\rho(A)\ge\gamma^{1/n}\),\(\gamma=a_{1\sigma(1)}\cdots a_{n\sigma(n)}\)(有长度 \(n\) 的环时才有意义)。

8.2 正矩阵(Positive matrices)(PDF p.544–,原书 p.524–)

Perron (1907) 对正矩阵建立了最简洁的理论。先研究最大模特征值对应的特征向量。

Lemma 8.2.1:\(A>0\),\((\lambda,x)\) 为特征对且 \(|\lambda|=\rho(A)\),则 \(|x|>0\) 且 \(A|x|=\rho(A)|x|\)。 证明:\(z=A|x|>0\)(8.1.14),\(z\ge|Ax|=|\lambda||x|=\rho(A)|x|\),令 \(y=z-\rho(A)|x|\ge0\)。若 \(y\ne0\),则 \(0<Ay=Az-\rho(A)z\),即 \(Az>\rho(A)z\),由 8.1.29 得 \(\rho(A)>\rho(A)\),矛盾。故 \(y=0\),\(\rho(A)|x|=A|x|>0\)。

Theorem 8.2.2:\(A>0\) ⇒ 存在正向量 \(x,y\) 使 \(Ax=\rho(A)x\)、\(y^TA=\rho(A)y^T\)。练习:\(A>0\) 时 (8.2.2a) \(\rho(A)=\max_{x>0}\min_i\frac1{x_i}\sum_ja_{ij}x_j=\min_{x>0}\max_i\frac1{x_i}\sum_ja_{ij}x_j\)(Collatz–Wielandt 公式)。

Lemma 8.2.3:\(A>0\),\(Ax=\lambda x\),\(|\lambda|=\rho(A)\) ⇒ 存在 \(\theta\) 使 \(e^{-i\theta}x=|x|>0\)(由 8.2.1 与 8.1.8(b):\(|Ax|=A|x|\) 且 \(A\) 有正行)。

Theorem 8.2.4:\(A>0\),\(\lambda\ne\rho(A)\) 为特征值 ⇒ \(|\lambda|<\rho(A)\)。证明:若 \(|\lambda|=\rho(A)\),则 \(w=e^{-i\theta}x>0\) 是特征向量,由 8.1.30 得 \(\lambda=\rho(A)\)。即正矩阵的谱半径是唯一的最大模特征值(无其他特征值在谱圆上)。

Theorem 8.2.5:\(A>0\) ⇒ \(\rho(A)\) 的几何重数为 1。证明:设 \(Aw=\rho(A)w\)、\(Az=\rho(A)z\),由 8.2.3 取 \(p=e^{-i\theta_1}z>0\)、\(q=e^{-i\theta_2}w>0\);\(\beta=\min_iq_i/p_i\),\(r=q-\beta p\ge0\) 且有零分量。若 \(r\ne0\),则 \(0<Ar=\rho(A)r\),得 \(r>0\),矛盾;故 \(q=\beta p\),\(w=\beta e^{i(\theta_2-\theta_1)}z\)。 Corollary 8.2.6:\(A>0\) ⇒ 存在唯一 \(x\) 使 \(Ax=\rho(A)x\) 且 \(\sum x_i=1\),且 \(x>0\)。 定义:该归一化特征向量称 Perron 向量(右 Perron 向量),\(\rho(A)\) 称 Perron 根。\(A^T\) 的对应特征向量 \(y\) 按 \(\sum x_iy_i=1\) 归一化后称左 Perron 向量,同样正且唯一。

Theorem 8.2.7:\(A>0\) ⇒ \(\rho(A)\) 的代数重数为 1;且

\[\lim_{m\to\infty}(\rho(A)^{-1}A)^m=xy^T\quad(\text{正的秩 1 矩阵})\]
证明:\(x,y>0\),\(y^Tx=1\),由 1.4.12b 得代数单重;由 1.4.7b 存在非奇异 \(S=[x\ S_1]\),\(S^{-*}=[y\ Z_1]\),\(A=S([\rho(A)]\oplus B)S^{-1}\);\(\rho(B)<\rho(A)\),由 5.6.12
\[\Big(\frac{A}{\rho(A)}\Big)^m=S\begin{bmatrix}1&0\\0&(\rho(A)^{-1}B)^m\end{bmatrix}S^{-1}\to[x\ S_1]\begin{bmatrix}1&0\\0&0\end{bmatrix}\begin{bmatrix}y^T\\Z_1^T\end{bmatrix}=xy^T\quad(8.2.7a)\]

Theorem 8.2.8(Perron 定理):\(A\in M_n\),\(A>0\),则 (a) \(\rho(A)>0\);(b) \(\rho(A)\) 是代数单重特征值;(c) 存在唯一实向量 \(x\),\(Ax=\rho(A)x\),\(\sum x_i=1\),且 \(x>0\);(d) 存在唯一实向量 \(y\),\(y^TA=\rho(A)y^T\),\(\sum x_iy_i=1\),且 \(y>0\);(e) 对所有 \(\lambda\ne\rho(A)\),\(|\lambda|<\rho(A)\);(f) \((\rho(A)^{-1}A)^m\to xy^T\)。 (收敛速度由第二大模特征值与 \(\rho(A)\) 之比决定。)

Theorem 8.2.9(Fan):\(A\in M_n\),\(B\ge0\) 且 \(b_{ij}\ge|a_{ij}|\)(\(i\ne j\)),则 \(A\) 的每个特征值属于

\[\bigcup_{i=1}^n\{z\in\mathbf C:|z-a_{ii}|\le\rho(B)-b_{ii}\}\quad(8.2.9a)\]
特别地,若 \(|a_{ii}|>\rho(B)-b_{ii}\) 对所有 \(i\) 成立,则 \(A\) 非奇异。 证明:先设 \(B>0\),取 Perron 向量 \(x>0\),\(\sum_{j\ne i}|a_{ij}|x_j\le\sum_{j\ne i}b_{ij}x_j=\rho(B)x_i-b_{ii}x_i\),即 \(\frac1{x_i}\sum_{j\ne i}|a_{ij}|x_j\le\rho(B)-b_{ii}\),用加权 Geršgorin 定理(6.1.6,\(p_i=x_i\))。一般 \(B\ge0\) 用 \(B_\epsilon=B+\epsilon J_n\) 取极限,\(\rho(B_\epsilon)-(b_{ii}+\epsilon)\to\rho(B)-b_{ii}\)。

收敛速率:由 8.2.7 证明与 5.6.13,

\[\|(\rho(A)^{-1}A)^m-xy^T\|_\infty=\Big\|S\begin{bmatrix}1&0\\0&(\rho(A)^{-1}B)^m\end{bmatrix}S^{-1}-xy^T\Big\|_\infty\le Cr^m\quad(8.2.10)\]
\(r\) 为 \((|\lambda_{n-1}|/\rho(A),1)\) 中任意数,\(|\lambda_{n-1}|=\max\{|\lambda|:\lambda\ne\rho(A)\}\) 称次特征值(secondary eigenvalue)。已知易算的上界
\[\frac{|\lambda_{n-1}|}{\rho(A)}\le\frac{1-\kappa^2}{1+\kappa^2},\qquad\kappa=\frac{\min a_{ij}}{\max a_{ij}}\quad(8.2.11)\]
(Markov 链混合速度 / 幂迭代收敛速度的估计。)

8.2 习题概要(P1–P16)

  • P1:正矩阵幂的渐近行为 \(A^m\approx\rho(A)^mxy^T\)。P2–P4:\(2\times2\) 迁移矩阵(\(0<\alpha,\beta<1\))用 Perron 定理重新分析,特征值必互异;\(n\) 城市且全部系数为正时人口分布收敛到与初值无关的均衡(正比于 Perron 向量)。
  • P5:\(A>B>0\Rightarrow\rho(A)>\rho(B)\)(用 min-max 刻画)。P6:\(\rho(A)=\sum_{i,j}a_{ij}x_j\)(\(x\) 为归一化 Perron 向量)。
  • P7:\(n\ge2\) 时正矩阵的逆不可能非负;非负矩阵逆非负 ⇔ 每列恰一个非零元(广义置换矩阵 = 置换阵 × 正对角阵)。
  • P8:任意正的左右特征向量 \(x,y\):\((\rho(A)^{-1}A)^m\to(y^Tx)^{-1}xy^T\)。
  • P9:若最小行和或最大行和等于 \(\rho(A)\),则 Perron 向量各分量相等、所有行和相等;(8.1.23) 两端要么同时严格要么同时取等。P10:正对称且恰一个正特征值 ⇒ \(a_{ij}\ge\sqrt{a_{ii}a_{jj}}\ge\min\{a_{ii},a_{jj}\}\)。
  • P11:另证代数单重与 \(\operatorname{adj}(\rho(A)I-A)=\gamma xy^T\)(\(\gamma>0\)):\(B=D^{-1}AD\) 行和都等于 \(\rho(A)\);\(p_B'(t)=\sum_ip_{B_i}(t)\)(0.8.10.2),各 \(B_i\) 的谱半径 \(<\rho(B)\),故 \(p_{B_i}(\rho(B))>0\),\(p_B'(\rho(B))>0\);\(\gamma=(\rho(A)-\lambda_2)\cdots(\rho(A)-\lambda_n)/y^Tx\)。P12:用 \(|||B|||=\rho(B)\) 与 5.6.P38 再证。
  • P13:\(\rho(A)=\lim(\operatorname{tr}A^m)^{1/m}\)。P14:\(\operatorname{adj}(\rho(A)I-A)>0\),其每列是右 Perron 向量的正倍数、每行是左 Perron 向量的正倍数——已知 \(\rho(A)\) 时无需解线性方程即可得 Perron 向量。
  • P15:\(0\le A\le B\)、\(A\ne B\) 不保证严格 \(\rho(A)<\rho(B)\)(\(\begin{bmatrix}0&1\\0&0\end{bmatrix}\) 与 \(\begin{bmatrix}0&2\\0&0\end{bmatrix}\)),但 \(B>0\) 时严格。P16:正矩阵的非负非零特征向量只能属于 \(\rho(A)\)(双正交原理 1.4.P6),且必为正。
  • 延伸阅读:Rothblum & Tan (1985) 次特征值模的上界。

8.3 非负矩阵(Nonnegative matrices)(PDF p.549–,原书 p.529–)

Perron 定理中只有以下部分可经极限推广到一般非负矩阵: Theorem 8.3.1:\(A\ge0\) ⇒ \(\rho(A)\) 是 \(A\) 的特征值,且存在非负非零 \(x\) 使 \(Ax=\rho(A)x\)。 证明:\(A(\epsilon)=A+\epsilon J_n>0\),Perron 向量 \(x(\epsilon)>0\),\(\|x(\epsilon)\|_1=1\);紧性给出 \(\epsilon_k\downarrow0\) 使 \(x(\epsilon_k)\to x\),\(x\ge0\)、\(\|x\|_1=1\)。由 8.1.18,\(\rho(A(\epsilon_k))\) 单调递减且 \(\ge\rho(A)\),极限 \(\rho\ge\rho(A)\);\(Ax=\lim A(\epsilon_k)x(\epsilon_k)=\lim\rho(A(\epsilon_k))x(\epsilon_k)=\rho x\),故 \(\rho\) 是特征值,\(\rho\le\rho(A)\),于是 \(\rho=\rho(A)\)。

Theorem 8.3.2:\(A\ge0\),\(x\ge0\) 非零,\(Ax\ge\alpha x\)(\(\alpha\in\mathbf R\))⇒ \(\rho(A)\ge\alpha\)。证明:\(A(\epsilon)=A+\epsilon J>0\) 的左 Perron 向量 \(y(\epsilon)>0\);\(A(\epsilon)x-\alpha x>Ax-\alpha x\ge0\),故 \(y(\epsilon)^T(A(\epsilon)x-\alpha x)=(\rho(A(\epsilon))-\alpha)y(\epsilon)^Tx>0\),又 \(y(\epsilon)^Tx>0\),得 \(\rho(A(\epsilon))>\alpha\),令 \(\epsilon\to0\)。

Corollary 8.3.3(Collatz–Wielandt 的 max-min 部分):\(A\ge0\),

\[\rho(A)=\max_{x\ge0,x\ne0}\ \min_{x_i\ne0}\frac1{x_i}\sum_ja_{ij}x_j\quad(8.3.3a)\]
证明:对任意 \(x\),令 \(\alpha=\min_{x_i\neq0}(Ax)_i/x_i\),\(Ax\ge\alpha x\),由 8.3.2 得 \(\rho(A)\ge\alpha\);用 8.3.1 的非负特征向量取到等号。 练习:\(A=\begin{bmatrix}1&0\\0&2\end{bmatrix}\)、\(x=[1\ 0]^T\) 说明:8.1.29 的上界部分(\(Ax\le\beta x\Rightarrow\rho(A)\le\beta\))在 \(x\) 仅非负时不成立;(8.1.32) 的 min-max 刻画对一般非负矩阵也不成立。该矩阵没有正的左或右特征向量。

Theorem 8.3.4:\(A\ge0\),存在正向量 \(x\) 与 \(\lambda\ge0\) 使 \(Ax=\lambda x\) 或 \(x^TA=\lambda x^T\) ⇒ \(\lambda=\rho(A)\)。证明:\(D=\operatorname{diag}(x)\),\(B=D^{-1}AD\) 行和全为 \(\lambda\),由 8.1.21 \(\rho(B)=\lambda\)。 练习:\(e^TA=e^T\)(列和为 1,列随机)或 \(Ae=e\)(行随机)时 \(A^m\) 保持同样性质,元素都在 \([0,1]\),故幂有界(power bounded)。

Theorem 8.3.5:\(A\ge0\) 有正的左特征向量。 (a) 若 \(x\in\mathbf R^n\) 非零且 \(Ax\ge\rho(A)x\),则 \(Ax=\rho(A)x\); (b) 若 \(A\ne0\),则 \(\rho(A)>0\),且每个满足 \(|\lambda|=\rho(A)\) 的特征值都是半单的(semisimple,对应 Jordan 块均为 \(1\times1\))。 证明:\(y>0\),\(A^Ty=\rho(A)y\)(8.3.4)。(a) 若 \(Ax-\rho(A)x\ge0\) 非零,则 \(y^T(Ax-\rho(A)x)>0\),但它等于 \(\rho(A)y^Tx-\rho(A)y^Tx=0\),矛盾。(b) \(y^TA\) 有正分量 ⇒ \(\rho(A)>0\);\(D=\operatorname{diag}(y)\),\(B=\rho(A)^{-1}DAD^{-1}\),\(e^TB=e^T\),\(B\) 列随机、幂有界,由 3.2.5.2,单位模特征值半单。 练习:对右正特征向量的版本;非负假设不可去:\(A=\begin{bmatrix}1&-1\\2&-2\end{bmatrix}\)、\(x=e\)。

术语:非负矩阵的 \(\rho(A)\) 称 Perron 根;但其特征向量(即使归一化)未必唯一,所以一般非负矩阵没有良定义的“Perron 向量”。例如 \(A=I\) 时任意非负非零向量都是 Perron 根 1 的特征向量。

8.3 习题概要(P1–,本块读到 P7 开头)

  • P1:用例子说明 Perron 定理中 8.3.1 未包含的结论对一般非负矩阵不成立(如单重性、严格占优、正特征向量)。P2:\(A\ge0\)、\(A^k>0\) ⇒ 有正特征向量(本原矩阵)。P3:非负三对角矩阵特征值全为实数。
  • P4:反例:非负矩阵的非负特征向量不一定对应 \(\rho(A)\)。P5:\(A=\begin{bmatrix}0&1\\0&1\end{bmatrix}\)、\(x=[1\ 2]^T\) 说明 8.3.5 缺少“正左特征向量”假设时不成立。
  • P6:\(A\ge0\) 非零且与某正矩阵 \(B\) 交换 ⇒ \(B\) 的左右 Perron 向量是 \(A\) 对应 \(\rho(A)\) 的左右特征向量;与 1.3.19 比较;\(A\) 有正的左右特征向量时存在与之交换的正矩阵。
  • P7(续见下一块):\(A\ge0\) 有含 \(r\ge1\) 个正分量、\(n-r\) 个零分量的非负特征向量 ⇒ 存在置换 \(P\) 使 \(P^TAP=\begin{bmatrix}B&C\\0&D\end{bmatrix}\),\(B\in M_r\),\(B\) 有正特征向量…… (P7 续)若 \(r<n\) 则 \(A\) 可约;(b) \(A\) 不可约 ⇔ 它的所有非负特征向量都为正。
  • P8 不可约标准形(Frobenius 标准形,Frobenius normal form):任意非负 \(A\) 要么不可约,要么置换相似于分块上三角
    \[P^TAP=\begin{bmatrix}A_1&&\star\\&\ddots&\\0&&A_k\end{bmatrix}\quad(8.3.6)\]
    每个对角块不可约(可以是 \(1\times1\) 零块)。\(\sigma(A)=\sigma(A_1)\cup\dots\cup\sigma(A_k)\)(计重数),故非负矩阵的谱由若干零特征值与有限个非零不可约非负矩阵的谱组成;标准形不必唯一。(Markov 链状态分类:常返类 / 瞬时类的矩阵版本。)
  • P9 本质非负(essentially nonnegative,Metzler 矩阵):非对角元非负的实矩阵 \(A\),存在 \(\lambda>0\) 使 \(\lambda I+A\ge0\),由 8.3.1 有实特征值 \(r(A)\)(主导特征值,dominant eigenvalue)满足 \(r(A)\ge\operatorname{Re}\lambda_i\) 对所有特征值;\(r(A)\) 不一定模最大,但 \(A\ge0\) 时 \(r(A)=\rho(A)\)。(连续时间 Markov 链生成元、线性 ODE 稳定性。)
  • P10:\(\rho(A)\le\lambda_{\max}(\frac12(A+A^T))\)。P11:\(p_A(t)=(t-\rho(A))g(t)\),\(g(t)=t^{n-1}+\gamma_1t^{n-2}+\dots\),\(\gamma_1=\rho(A)-\operatorname{tr}A\);\(n=3\) 且 \(\operatorname{tr}A=\rho(A)>0\) 时特征值为 \(\rho(A)\)、\(\pm\sqrt{\det A/\rho(A)}\)(实或纯虚);幻方(元素为 \(1..n^2\) 的不同整数,行、列、主副对角线和相等)的 \(\rho(A)=\frac12n(n^2+1)\) 是特征值。
  • P12:\(\operatorname{adj}(\rho(A)I-A)\ge0\)(\(r>\rho(A)\) 时 \(\det(rI-A)>0\)、\((rI-A)^{-1}>0\)……此处 (b) 原文写“positive”,对一般非负 \(A\) 应为非负,取极限得结论)。P13:\(\rho(A)\) 几何重数 \(>1\) ⇒ \(\operatorname{adj}(\rho(A)I-A)=0\);代数重数 \(>1\) 时伴随阵对角元全为零。P14:几何重数 \(>1\) 仅当 \(\rho(A)I-A\) 所有子式为零……代数重数 \(>1\) 仅当 \(\rho(A)I-A\) 所有主子式为零。
  • P15 M 矩阵(M-matrix):非对角元 \(\le0\) 且所有实特征值为正 ⇒ \(A^{-1}\ge0\):\(\mu=\max a_{ii}>0\),\(B=\mu I-A\ge0\),\(\mu-\rho(B)\) 是 \(A\) 的实特征值,故 \(\mu>\rho(B)\),\(A^{-1}=\mu^{-1}\sum_{k\ge0}\mu^{-k}B^k\ge0\)(特例见 7.2.P31)。
  • P16 单调矩阵(monotone matrix):\(A\) 非奇异且 \(A^{-1}\ge0\) ⇔(\(Ax\ge Ay\Rightarrow x\ge y\));单调矩阵之积单调;M 矩阵都是单调矩阵。
  • 延伸阅读:Johnson, Kellogg & Stephens (1979) 给定图的非负矩阵复特征值;Johnson (1981) 行随机矩阵相似于双随机矩阵;Bapat & Raghavan (1997);Horn & Johnson (1991) 2.5 节给出 M 矩阵的 18 种等价刻画。

8.4 不可约非负矩阵(Irreducible nonnegative matrices)(PDF p.553–555,原书 p.533–535;续见下一块)

启发式原则:关于“无零元素”矩阵的结论常可推广到不可约矩阵(第 6 章 Geršgorin 定理已有一例,6.2.24)。

Lemma 8.4.1:\(A\ge0\) 不可约 ⇔ \((I+A)^{n-1}>0\)。练习:\(A\) 不可约 ⇔ \(A^T\) 不可约。 Lemma 8.4.2:\(A\) 的特征值 \(\lambda_i\) ⇒ \(I+A\) 的特征值为 \(\lambda_i+1\),\(\rho(I+A)\le\rho(A)+1\);\(A\ge0\) 时 \(\rho(I+A)=\rho(A)+1\)(由 8.3.1,\(\rho(A)+1\) 是 \(I+A\) 的特征值)。 Lemma 8.4.3:\(A\ge0\) 且某个 \(A^m>0\) ⇒ \(\rho(A)\) 是唯一的最大模特征值,且为正、代数单重。证明:\(A^m\) 的特征值 \(\lambda_i^m\) 中恰一个等于 \(\rho(A^m)=\rho(A)^m\),其余模严格更小(Perron 定理);故 \(n-1\) 个 \(\lambda_i\) 模 \(<\rho(A)\),剩下那个由 8.3.1 是 \(\rho(A)\)。(\(A^m>0\) 的非负矩阵称本原矩阵,primitive,见后续 8.5 节。)

Theorem 8.4.4(Perron–Frobenius 定理):\(A\in M_n\) 不可约非负,\(n\ge2\),则 (a) \(\rho(A)>0\);(b) \(\rho(A)\) 是代数单重特征值;(c) 存在唯一实向量 \(x\),\(Ax=\rho(A)x\),\(\sum x_i=1\),且 \(x>0\);(d) 存在唯一实向量 \(y\),\(y^TA=\rho(A)y^T\),\(\sum x_iy_i=1\),且 \(y>0\)。 证明:(a) 由 8.1.25。(b) 若 \(\rho(A)\) 多重,则 \(\rho(A)+1=\rho(I+A)\) 是 \(I+A\) 的多重特征值,于是 \((1+\rho(A))^{n-1}=\rho((I+A)^{n-1})\) 是正矩阵 \((I+A)^{n-1}\) 的多重特征值,与 Perron 定理 8.2.8(b) 矛盾。(c) 由 8.3.1 取非负非零 \(x\),\((I+A)^{n-1}x=(\rho(A)+1)^{n-1}x\),而 \((I+A)^{n-1}>0\),由 8.1.14 左端为正,故 \(x=(\rho(A)+1)^{1-n}(I+A)^{n-1}x>0\);归一化后由 (b) 唯一。(d) 对 \(A^T\)。 注意:与 Perron 定理相比,缺少“\(\rho(A)\) 是唯一最大模特征值”和“\((A/\rho(A))^m\) 收敛”两条(例如置换矩阵 \(\begin{bmatrix}0&1\\1&0\end{bmatrix}\) 有特征值 \(\pm1\),幂不收敛)。 定义:\(x\) 为不可约非负矩阵的(右)Perron 向量,\(y\) 为左 Perron 向量。由 (c)(d),8.1.30–8.1.33 与 8.3.4–8.3.5 的结论都适用于不可约非负矩阵,特别是变分刻画 (8.1.32)(Collatz–Wielandt 公式的 max-min 与 min-max 两半都成立)。

Theorem 8.4.5(8.1.18 等号情形的刻画,Wielandt 型):\(A\ge0\) 不可约,\(A\ge|B|\),\(\lambda=e^{i\varphi}\rho(B)\) 是 \(B\) 的最大模特征值。若 \(\rho(A)=\rho(B)\),则存在对角酉阵 \(D\) 使 \(B=e^{i\varphi}DAD^{-1}\)。 证明:\(Bx=\lambda x\),\(\rho=\rho(A)=\rho(B)\):

\[\rho|x|=|\lambda x|=|Bx|\le|B||x|\overset{(\alpha)}{\le}A|x|\quad(8.4.5a)\]
由 8.3.5(\(A\) 有正左特征向量)得 \(A|x|=\rho|x|\),由 8.4.4 \(|x|>0\);\((\alpha)\) 取等即 \((A-|B|)|x|=0\),由 8.1.1 得 \(A=|B|\)。取唯一对角酉 \(D\) 使 \(x=D|x|\),则 \(Bx=e^{i\varphi}\rho x\) 等价于 \(e^{-i\varphi}D^{-1}BD|x|=\rho|x|=A|x|=|B||x|\);令 \(C=e^{-i\varphi}D^{-1}BD\),\(C|x|=|C||x|\),由 8.1.8(c) \(C=|C|=|B|=A\),即 \(B=e^{i\varphi}DAD^{-1}\)。

Corollary 8.4.6(最大模特征值的旋转对称性):\(A\ge0\) 不可约,恰有 \(k\) 个不同的最大模特征值,则 (a) \(A\) 相似于 \(e^{2\pi ip/k}A\),\(p=0,1,\dots,k-1\); (b) 若 \(J_{m_1}(\lambda)\oplus\dots\oplus J_{m_\ell}(\lambda)\) 是 \(A\) 的 Jordan 形的直和项,则对 \(p\in\{1..k-1\}\),\(J_{m_1}(e^{2\pi ip/k}\lambda)\oplus\dots\oplus J_{m_\ell}(e^{2\pi ip/k}\lambda)\) 也是直和项(整个谱在旋转 \(2\pi/k\) 下不变); (c) 最大模特征值恰为 \(e^{2\pi ip/k}\rho(A)\),\(p=0..k-1\),且每个代数单重。 证明(读到 PDF p.555 为止):\(k\ge2\),最大模特征值 \(\lambda_p=e^{i\varphi_p}\rho(A)\),\(0=\varphi_0<\varphi_1<\dots<\varphi_{k-1}<2\pi\),\(\mathcal S=\{\varphi_p\}\)。实矩阵特征值共轭成对,故 \(\varphi_{k-p}+\varphi_p\equiv0\pmod{2\pi}\)。对 \(B=A\)、\(\lambda=e^{i\varphi_p}\rho(A)\) 用 8.4.5:\(A=e^{i\varphi_p}D_pAD_p^{-1}\),即 \(A\) 相似于 \(e^{i\varphi_p}A\),所以 Jordan 形中 \(J_m(\lambda)\) 的块组旋转 \(e^{i\varphi_p}\) 后仍在。取最大模特征值 \(e^{i\varphi_q}\rho(A)\) 与 \(p=k-q\),得 \(J_{m_1}(\rho(A))\oplus\dots\oplus J_{m_\ell}(\rho(A))\) 是直和项,由 8.4.4(b) \(\ell=1\)、\(m_1=1\),即每个最大模特征值都单重。\(A\) 相似于 \(e^{i\varphi_p}A\) 与 \(e^{i\varphi_q}A\),故相似于 \(e^{i(\varphi_p+\varphi_q)}A\),\(\mathcal S\) 对加法(模 \(2\pi\))封闭;归纳得 \(r\varphi_1\in\mathcal S\) 对所有 \(r\)……(续见下一块:由此 \(\mathcal S\) 是 \(k\) 次单位根的辐角群,\(\varphi_p=2\pi p/k\)。)

第 8 章(本块覆盖部分:8.0–8.4 开头)阶段性要点

  1. 非负矩阵用逐元素序 \(\ge\);\(|Ax|\le|A||x|\);\(|A|\le B\Rightarrow\rho(A)\le\rho(|A|)\le\rho(B)\)(由 Gelfand 公式),谱半径关于逐元素序单调、主子矩阵谱半径不超过整体。
  2. 谱半径被最小 / 最大行和(列和)夹住;用任意正向量加权得 Collatz–Wielandt 界 \(\min_i(Ax)_i/x_i\le\rho(A)\le\max_i(Ax)_i/x_i\);正特征向量必属于 \(\rho(A)\)。
  3. Perron 定理(正矩阵):\(\rho(A)>0\)、代数单重、严格占优,左右 Perron 向量为正,\((A/\rho(A))^m\to xy^T\),收敛速率由次特征值比 \(|\lambda_{n-1}|/\rho(A)\le(1-\kappa^2)/(1+\kappa^2)\) 控制。
  4. 一般非负矩阵只保留“\(\rho(A)\) 是特征值且有非负特征向量”与 max-min 刻画;有正左特征向量时最大模特征值半单、幂有界。
  5. Perron–Frobenius(不可约非负):恢复单重性与正的左右 Perron 向量,但最大模特征值可以有 \(k\) 个,均匀分布在半径 \(\rho(A)\) 的圆上,谱旋转 \(2\pi/k\) 不变。
  6. M 矩阵 / 单调矩阵的逆非负;本质非负(Metzler)矩阵有实主导特征值。

第 8 章(本块部分)与量化交易的关联

  • Markov 链与评级迁移:信用评级迁移矩阵、状态转移(市场体制 regime)矩阵是随机矩阵,8.0 的迁移模型、Perron 向量即平稳分布,\((A/\rho)^m\to xy^T\) 是长期分布收敛,次特征值比给出混合(收敛)速度——决定多期违约概率和体制持续性估计的稳定性。周期性(8.4.6 中 \(k>1\))对应链不收敛、只有 Cesàro 平均收敛的情形。
  • 网络与中心性:资产相关网络、供应链 / 持股网络的特征向量中心性(PageRank 是随机矩阵 Perron 向量)用于系统性风险、溢出效应分析;不可约性对应网络强连通。
  • 投入产出与经济增长模型:Leontief 模型 \((I-A)^{-1}\ge0\)(M 矩阵、8.3.P15),在行业轮动 / 宏观因子研究中解释冲击传导。
  • 谱半径界:8.1.22 行和界可快速判断风险传染矩阵、VAR 模型系数矩阵(非负时)的 \(\rho<1\) 稳定性;Fan 定理 8.2.9 给出特征值包含区域。
  • 本块中的幻方、Jordan 形细节、伴随矩阵符号等与量化没有直接关系。

第 8 章(本块部分)推荐习题

  • 8.0.P2(显式计算 \(A_\epsilon^m\) 极限与 \(xy^T\));8.1.P7(用 \(x=Ae\) 改进行和界——幂迭代的一步);8.2.P5、P8、P14(严格单调性、未归一化特征向量的极限、由伴随矩阵求 Perron 向量);8.2.P11(单重性的特征多项式证明);8.3.P8(Frobenius 标准形——Markov 链状态分类);8.3.P9(Metzler 矩阵主导特征值);8.3.P15–P16(M 矩阵与单调矩阵的逆非负)。