量化交易中文教材

第 04a 章 Hermitian 矩阵与特征值不等式

对应原书:Horn & Johnson《Matrix Analysis》第 2 版,第 4 章 Hermitian Matrices, Symmetric Matrices, and Congruences 的 4.0–4.3 节(书 p.225–260,PDF p.245–280)。第 4 章后半(合同、惯性、同时对角化、酉合同、共轭相似)见第 04b 章。

协方差矩阵、相关矩阵、Hessian 矩阵、二次型都是实对称矩阵,也就是 Hermitian 矩阵的实数特例。本章回答一个对量化极其重要的问题:一个对称矩阵被改动之后,它的特征值最多能移动多少? 改动可以是估计误差(样本协方差 = 真实协方差 + 噪声)、加入或剔除资产(加边 / 取主子矩阵)、加入一个因子(秩一扰动)、做收缩(加一个半正定矩阵)。答案是一整套"夹逼"不等式:Weyl 不等式、交错定理、包含原理和优超。它们的共同工具只有两样:Rayleigh 商和"两个大子空间必然相交"。

学习目标

读完本章,你应当能够:

  1. 掌握 Hermitian 矩阵的几种等价刻画(\(x^*Ax\) 恒为实数、正规且特征值为实数),以及正定、半正定的定义和实对称情形的陷阱。
  2. 用 Rayleigh 商和 Courant–Fischer 极小极大定理刻画每一个特征值,并能用"子空间交"论证推导特征值不等式。
  3. 熟练使用 Weyl 不等式及其推论:\(|\lambda_i(A+E)-\lambda_i(A)|\le\|E\|_2\)、秩 \(r\) 扰动只移动 \(r\) 个位置、半正定扰动只会抬高特征值。
  4. 掌握 Cauchy 交错定理、包含原理、Poincaré 分离定理与 Ky Fan 迹极值,并能解释 PCA "前 \(m\) 个主成分捕获方差最多"的含义。
  5. 理解优超(majorization):特征值优超对角元(Schur),Fan 与 Lidskii 不等式,优超与双随机矩阵的等价关系,以及迹不等式。
  6. 用上述工具分析样本协方差矩阵的特征值偏差、随机矩阵噪声和特征值收缩。

读前导读

这一章在解决什么问题。 你做组合时天天碰到协方差矩阵 \(\Sigma\),组合方差 \(w^T\Sigma w\) 就是本章的"二次型"。\(\Sigma\) 的特征值是各主成分(PCA 因子)的方差:最大的那个通常是市场因子,最小的那些对应"看起来几乎没风险"的对冲组合。问题在于你手里的永远是估计值 \(S=\Sigma+\text{噪声}\)。本章回答:噪声多大时,特征值最多偏多少(Weyl 不等式);往组合里加一只资产、删一只资产、加一个因子、做一次收缩,特征值会怎么动(交错定理、包含原理、单调性);为什么"前 \(m\) 个主成分解释的方差最多"(Ky Fan);为什么主成分方差总比单个资产方差更分散(Schur 优超)。

整章只有一个核心技巧,值得先记住:任何单位权重组合的方差 \(w^T\Sigma w\),都是各主成分方差的加权平均,权重是 \(w\) 在各主成分方向上的投影平方(Rayleigh 商)。几乎所有不等式都是"找一个合适的组合 \(w\),然后用这个加权平均夹逼"。

需要先想起来的数学。

  • 对称矩阵的特征分解:实对称 \(\Sigma=P\Lambda P^T\),\(P\) 的列是互相正交的单位特征向量(主成分方向),\(\Lambda\) 对角线是特征值(主成分方差)。例:\(\Sigma=\begin{bmatrix}1&0.5\\0.5&1\end{bmatrix}\) 的特征值是 \(1.5\)(方向 \((1,1)/\sqrt2\),"等权多头")和 \(0.5\)(方向 \((1,-1)/\sqrt2\),"多空对冲")。见 第 00 册第 06 章 线性代数速成。
  • 正定与半正定:\(\Sigma\) 半正定指对任何权重 \(w\),\(w^T\Sigma w\ge0\)——即任何组合的方差都不为负,等价于所有特征值 \(\ge0\)。正定是严格 \(>0\)。合格的协方差矩阵一定半正定。
  • 子空间与维数:\(\mathbf R^n\) 中由若干向量的所有线性组合构成的集合叫它们"张成的子空间"(\(\operatorname{span}\)),维数是其中线性无关向量的最大个数。关键事实:两个子空间维数之和超过 \(n\),就一定有公共的非零向量(就像 3 维空间里两个平面必然交于一条线)。
  • max/min 与凸组合:一组数的加权平均(权重非负、和为 1)一定介于最小值和最大值之间。本章把它用到特征值上。
  • 迹:\(\operatorname{tr}A=\sum a_{ii}=\sum\lambda_i\),对协方差矩阵就是"总方差"。

符号提示:\(A^*\) 是共轭转置,实矩阵时就是 \(A^T\),\(x^*Ax\) 读作 \(x^TAx\);\(\mathbf C^n\) 是 \(n\) 维复向量空间,实数情形读成 \(\mathbf R^n\) 即可;\(A\succeq0\) 表示 \(A\) 半正定,\(A\succeq B\) 表示 \(A-B\succeq0\)(Loewner 序);\(\|B\|_2\) 是谱范数,对称矩阵等于绝对值最大的特征值;\(\dim\) 表示维数;\(\square\) 表示证明结束。特别注意:本章特征值从小到大编号,\(\lambda_n\) 是最大的那个(第一主成分方差)。

怎么读这一章。 核心必读:4a.1.2(编号约定)、4a.2.3(正定)、4a.3.1(Rayleigh 商,全章基础)、4a.4(Weyl 不等式与推论,尤其单因子模型的量化含义)、4a.5.1–4a.5.3(交错、包含、Ky Fan),以及实战 1、2。第一遍可以只看结论:4a.2.1 的 Toeplitz 分解、4a.2.2 的 4.1.4 证明、4a.2.5 习题列表(但"有效秩"一条值得读)、4a.3.3 Courant–Fischer 的证明、4a.5.1 逆定理、4a.5.4 的 Jacobi 矩阵、4a.6.3 之后的 Fan/Lidskii 与迹不等式证明。读证明时抓住"找子空间 → 取公共向量 → 用 Rayleigh"这一个模板就够了。


4a.1 为什么单独研究 Hermitian 矩阵

4a.1.1 对称矩阵从哪里来

原书引言(4.0 节)列了几个自然来源:

  • Hessian 矩阵(例 4.0.1):二阶连续可微的 \(f:\mathbf R^n\to\mathbf R\) 的 Hessian \(H(x)=[\partial^2f/\partial x_i\partial x_j]\) 因为混合偏导相等而对称,它决定临界点是极大还是极小。组合优化的目标 \(\tfrac12w^T\Sigma w-\gamma\mu^Tw\) 的 Hessian 就是协方差矩阵 \(\Sigma\)。
  • 二次型(例 4.0.2):\(Q(x)=x^TAx=x^T\big[\tfrac12(A+A^T)\big]x\)。\(A\) 与它的对称部分给出同一个二次型,所以研究二次型只需研究对称矩阵。组合方差 \(w^T\Sigma w\) 就是二次型。
  • 无向图的邻接矩阵(例 4.0.5):\(a_{ij}=1\) 当且仅当 \(i,j\) 之间有边,天然对称。资产相关网络、行业关联图都属于此类。
  • sesquilinear 型(例 4.0.6):复情形用 \(H(x,y)=y^*Ax\),它对第一变量线性、对第二变量共轭线性,称为半双线性型(sesquilinear form)。\(H(x,y)=\overline{H(y,x)}\) 恒成立当且仅当 \(A=A^*\)。

复 Hermitian 矩阵在几乎所有方面都是实对称矩阵的自然推广;而"复的、非实的对称矩阵"(\(A=A^T\) 但 \(A\ne\bar A\))缺少实对称矩阵的大部分好性质,原书 4.4 节单独研究它(本册第 04b 章简介)。量化中遇到的几乎都是实对称矩阵,本章的结论对它们全部适用:把 \(*\) 读成转置、"酉矩阵"读成"正交矩阵"即可。

4a.1.2 记号约定:特征值从小到大

从本章起,Hermitian 矩阵的特征值一律按非减顺序排列(原书 4.2.1):

\[\lambda_{\min}=\lambda_1\le\lambda_2\le\cdots\le\lambda_n=\lambda_{\max}.\]

多个矩阵同时出现时写 \(\lambda_i(A)\)、\(\lambda_i(B)\)。这和 numpy.linalg.eigvalsh、scipy.linalg.eigh 的输出顺序一致,但和许多统计教材(主成分按方差从大到小编号)相反。读公式时请先看清下标的方向:本章的 \(\lambda_n\) 是"第一主成分方差"。


4a.2 Hermitian 矩阵的基本性质(4.1 节)

4a.2.1 定义与 Toeplitz 分解

定义 4.1.1 \(A\in M_n\) 若满足 \(A=A^*\),称为 Hermitian 矩阵;若 \(A=-A^*\),称为斜 Hermitian 矩阵(skew Hermitian)。

几条直接观察:\(A+A^*\)、\(AA^*\)、\(A^*A\) 总是 Hermitian;Hermitian 矩阵的幂和逆(若存在)仍是 Hermitian;Hermitian 矩阵的实线性组合仍是 Hermitian,复线性组合则一般不是(\(iA\) Hermitian 仅当 \(A=0\));Hermitian 矩阵的对角元必为实数;写 \(A=C+iD\)(\(C,D\) 实)时,\(A\) Hermitian 当且仅当 \(C\) 对称、\(D\) 斜对称。

定理 4.1.2(Toeplitz 分解) 每个 \(A\in M_n\) 可唯一写成

\[A=H(A)+iK(A),\qquad H(A)=\tfrac12(A+A^*),\quad K(A)=\tfrac1{2i}(A-A^*),\]

其中 \(H(A),K(A)\) 都是 Hermitian。\(H(A)\) 叫 \(A\) 的 Hermitian 部分。这是复数 \(z=s+it\) 的矩阵类比:Hermitian 矩阵扮演"实数",\(*\) 扮演共轭。

量化提示:实矩阵的对应版本是 \(A=\tfrac12(A+A^T)+\tfrac12(A-A^T)\)(对称部分 + 斜对称部分)。二次型只"看见"对称部分。例如用回归估出的"交叉影响矩阵"若不对称,它作为二次型(比如交易成本模型 \(x^T\Lambda x\))起作用的只是 \(\tfrac12(\Lambda+\Lambda^T)\)。

4a.2.2 Hermitian 的刻画与谱定理

定理 4.1.3 若 \(A\) Hermitian,则 (a) 对一切 \(x\in\mathbf C^n\),\(x^*Ax\) 是实数;(b) \(A\) 的特征值都是实数;(c) 对一切 \(S\in M_n\),\(S^*AS\) 仍是 Hermitian。

证明只需一行:\(\overline{x^*Ax}=(x^*Ax)^*=x^*A^*x=x^*Ax\);若 \(Ax=\lambda x\)、\(x^*x=1\),则 \(\lambda=x^*Ax\) 是实数。

定理 4.1.4(反过来的刻画) \(A\) Hermitian 当且仅当下面任一条成立:(a) \(x^*Ax\) 对一切复向量 \(x\) 为实数;(b) \(A\) 正规且特征值全为实数;(c) \(S^*AS\) 对一切 \(S\) 为 Hermitian。

(a) 的证明思路值得一看:把 \(x+y\) 代入,推出 \(x^*Ay+y^*Ax\) 为实;取 \(x=e_k,y=e_j\) 得 \(a_{kj}+a_{jk}\) 为实,取 \(x=ie_k,y=e_j\) 得 \(-ia_{kj}+ia_{jk}\) 为实,两者合起来就是 \(a_{kj}=\bar a_{jk}\)。注意这里必须允许复向量;对实向量,\(x^TAx\) 是实数对任何实矩阵都成立,它只约束对称部分。

Hermitian 矩阵是正规矩阵(\(AA^*=A^2=A^*A\)),所以第 02b 章关于正规矩阵的结论全部适用:

定理 4.1.5(Hermitian 矩阵的谱定理) \(A\) Hermitian 当且仅当存在酉矩阵 \(U\) 和实对角矩阵 \(\Lambda\) 使 \(A=U\Lambda U^*\)。\(A\) 实对称当且仅当存在实正交矩阵 \(P\) 和实对角矩阵 \(\Lambda\) 使 \(A=P\Lambda P^T\)。

于是不同特征值的特征向量自动正交,\(\mathbf C^n\) 有一组由特征向量组成的标准正交基。这就是 PCA 能给出"互不相关的主成分组合"的原因。

两个 Hermitian 矩阵的乘积:\(A,B\) Hermitian 时 \((AB)^*=BA\),所以 \(AB\) Hermitian 当且仅当 \(AB=BA\)。定理 4.1.6 进一步说:一族 Hermitian 矩阵可以被同一个酉矩阵同时对角化,当且仅当它们两两可交换。(反例在量化里很常见:两个不同时期的协方差矩阵一般不交换,它们的主成分方向不同。要"同时对角化"两个协方差矩阵,得放弃酉变换,改用合同变换,见第 04b 章的广义特征值问题。)

定理 4.1.7(选读)给出一个漂亮的刻画:\(A\) 相似于某个实矩阵 \(\iff\) \(A\) 相似于 \(A^*\) \(\iff\) \(A\) 是两个 Hermitian 矩阵的乘积。

4a.2.3 正定与半正定

定理 4.1.8 \(x^*Ax\) 对一切非零 \(x\in\mathbf C^n\) 为正实数(非负实数)\(\iff\) \(A\) Hermitian 且特征值全为正(非负)。

证明:由 4.1.4(a) 先得 Hermitian;单位特征向量 \(u\) 给出 \(\lambda=u^*Au>0\)。反过来,\(A=U\Lambda U^*\) 时

\[x^*Ax=\sum_k\lambda_k|u_k^*x|^2,\]

\(x\ne0\) 时至少有一个 \(u_k^*x\ne0\)。

推导拆解:中间那个求和式是全章最常用的一行。代入 \(A=U\Lambda U^*\):\(x^*Ax=(U^*x)^*\Lambda(U^*x)\)。令 \(c=U^*x\),它的第 \(k\) 个分量 \(c_k=u_k^*x\) 是 \(x\) 在第 \(k\) 个特征方向上的坐标;对角矩阵夹在中间,二次型变成 \(\sum_k\lambda_k|c_k|^2\)。 金融读法:\(x\) 是组合权重,\(c_k\) 是组合在第 \(k\) 个主成分上的暴露,组合方差 = \(\sum\)(主成分方差 × 暴露的平方)。主成分之间互不相关,所以没有交叉项。例:\(\Sigma=\begin{bmatrix}1&0.5\\0.5&1\end{bmatrix}\),\(w=(1,0)\)(全仓第一只资产),在两个主成分上的暴露都是 \(1/\sqrt2\),方差 \(=1.5\cdot\tfrac12+0.5\cdot\tfrac12=1\),与直接算 \(\sigma_{11}=1\) 一致。

定义 4.1.9 / 4.1.11 \(x^*Ax>0\)(\(\forall x\ne0\))称正定(positive definite);\(\ge0\) 称半正定(positive semidefinite);若 \(x^*Ax\) 总为实数且能取到正值和负值,称不定(indefinite)。

实情形的陷阱:对实矩阵、实向量,\(x^TAx>0\) 不能推出 \(A\) 对称。例如 \(A=\begin{bmatrix}1&1\\-1&1\end{bmatrix}\) 对一切非零实 \(x\) 有 \(x^TAx=x_1^2+x_2^2>0\),但它不对称,特征值 \(1\pm i\)。所以实正定矩阵的定义必须先假设对称(定理 4.1.10)。实务中拿到一个"协方差矩阵"先检查对称性,再谈正定。

一个小练习:半正定矩阵正定当且仅当非奇异;\(A^*A\) 总是半正定,因为 \(x^*A^*Ax=\|Ax\|_2^2\)。

4a.2.4 正部与负部:\(A=A_+-A_-\)

定义 4.1.12 与命题 4.1.13 设 \(A=U\Lambda U^*\) Hermitian。把负特征值换成 0 得 \(\Lambda_+\),令 \(A_+=U\Lambda_+U^*\),称为 \(A\) 的半正定部分(positive semidefinite part);类似地把正特征值换成 0、再取负号得 \(A_-\)。则

\[A=A_+-A_-,\quad A_\pm\succeq0,\quad A_+A_-=A_-A_+=0,\quad\operatorname{rank}A=\operatorname{rank}A_++\operatorname{rank}A_-.\]

因此 Hermitian 矩阵恰好是两个半正定矩阵之差。\(A_+\) 虽然通过 \(U\) 定义,但与 \(U\) 的选取无关(习题 4.1.P22)。

量化含义:用成对删除(pairwise deletion)处理缺失数据、或把不同频率的相关系数拼在一起时,得到的"相关矩阵"常常不是半正定的。把它的负特征值截成 0,正是取 \(A_+\)。第 05a 章会证明:在 Frobenius 范数下,\(A_+\) 是离 \(A\) 最近的半正定矩阵(原书 5.2.P14)。

4a.2.5 习题 4.1 中值得记住的结论

  • 4.1.P5:实三对角矩阵若 \(a_{i,i+1}a_{i+1,i}>0\),存在正对角矩阵 \(D\) 使 \(DAD^{-1}\) 对称,所以特征值全为实数。(生灭过程、有限差分格式的转移矩阵常是这种形式。)
  • 4.1.P11:\(A,B\) Hermitian 时 \(\operatorname{tr}(AB)^2\le\operatorname{tr}(A^2B^2)\),等号当且仅当 \(AB=BA\)。
  • 4.1.P12–P13:Hermitian 矩阵的秩等于非零特征值个数;并且
\[\operatorname{rank}A\ \ge\ \frac{(\operatorname{tr}A)^2}{\operatorname{tr}A^2}.\]

右边对协方差矩阵就是 \((\sum\lambda_i)^2/\sum\lambda_i^2\),量化里常称为有效秩或有效因子数(participation ratio)。它衡量风险在多少个独立方向上"摊开":所有特征值相等时等于 \(n\),只有一个非零特征值时等于 1。

  • 4.1.P16:\(2\times2\) Hermitian 矩阵的特征值差满足 \((\lambda_1-\lambda_2)^2=(a_{11}-a_{22})^2+4|a_{12}|^2\)。两只资产的相关越强,主成分方差的差距越大。
  • 4.1.P21:\(A=xy^*+yx^*\) 的特征值是 \(\operatorname{Re}y^*x\pm\big(\|x\|^2\|y\|^2-(\operatorname{Im}y^*x)^2\big)^{1/2}\) 和 \(n-2\) 个 0;\(x,y\) 线性无关时恰好一正一负。
  • 4.1.P30:秩为 \(r\) 的 Hermitian 矩阵,所有非零的 \(r\) 阶主子式同号,且至少有一个非零。

4a.3 Rayleigh 商与 Courant–Fischer 定理(4.2 节)

4a.3.1 Rayleigh 商:最大、最小特征值的变分刻画

定理 4.2.2(Rayleigh) 设 \(A\) Hermitian,\(x_{i_1},\dots,x_{i_k}\) 是对应特征值 \(\lambda_{i_1}\le\cdots\le\lambda_{i_k}\) 的标准正交特征向量,\(S\) 是它们张成的子空间。则

\[\lambda_{i_1}=\min_{0\ne x\in S}\frac{x^*Ax}{x^*x}\ \le\ \max_{0\ne x\in S}\frac{x^*Ax}{x^*x}=\lambda_{i_k},\]

且等号恰在 \(x\) 是相应特征向量时取到。特别地(\(S=\mathbf C^n\)):

\[\lambda_{\max}=\max_{x\ne0}\frac{x^*Ax}{x^*x},\qquad\lambda_{\min}=\min_{x\ne0}\frac{x^*Ax}{x^*x}.\]

比值 \(x^*Ax/x^*x\) 称为 Rayleigh 商(Rayleigh quotient)。

证明 单位向量 \(x\in S\) 写成 \(x=\sum_p\alpha_px_{i_p}\),\(\sum|\alpha_p|^2=1\),则

\[x^*Ax=\sum_p|\alpha_p|^2\lambda_{i_p},\]

它是 \(\lambda_{i_1},\dots,\lambda_{i_k}\) 的凸组合,当然介于最小值和最大值之间;等于最大值当且仅当所有非最大特征值的系数为零。\(\square\)

直觉:\(x^*Ax\) 是特征值的加权平均,权重 \(|\alpha_p|^2\) 是 \(x\) 在各特征方向上的"能量"。对协方差矩阵 \(\Sigma\) 和单位权重向量 \(w\),组合方差 \(w^T\Sigma w\) 就是各主成分方差按 \(w\) 在主成分上的投影平方加权平均。所以:

  • 任何单位 \(\ell_2\) 范数组合的方差都介于 \(\lambda_{\min}\) 和 \(\lambda_{\max}\) 之间;
  • 一个推论(习题 4.2.P3):取 \(x=e_i\) 得 \(\lambda_{\min}\le a_{ii}\le\lambda_{\max}\)——每只资产的方差都夹在最小和最大主成分方差之间;
  • 对 \(A^*A\) 用同样推理(4.2.P4):最大奇异值 \(\sigma_1\ge\) 任何一列的长度 \(\ge\) 任何一个元素的绝对值;
  • 对任意非零 \(x\),记 \(\alpha=x^*Ax/x^*x\),则 \((-\infty,\alpha]\) 和 \([\alpha,\infty)\) 中各至少有 \(A\) 的一个特征值。

Hermitian 假设不可去(4.2.P5):\(A=\begin{bmatrix}1&2\\0&1\end{bmatrix}\) 的特征值都是 1,但 \(\max x^TAx/x^Tx=2\)。

4a.3.2 子空间交引理

引理 4.2.3 设 \(S_1,\dots,S_k\) 是 \(\mathbf C^n\) 的子空间,若

\[\delta=\dim S_1+\cdots+\dim S_k-(k-1)n\ \ge1,\]

则 \(S_1\cap\cdots\cap S_k\) 中有 \(\delta\) 个标准正交向量;特别地它含有单位向量。

两个子空间的情形最常用:\(\dim S_1+\dim S_2\ge n+1\) 时,两者必有公共单位向量。三个子空间:维数和 \(\ge2n+1\) 时有公共单位向量。证明就是第 00 章的维数公式 \(\dim(S_1\cap S_2)\ge\dim S_1+\dim S_2-n\) 反复使用。

白话解释:可以用"约束条件计数"理解。在 \(n\) 只资产里,一个 \(k\) 维子空间可以看成"满足 \(n-k\) 条线性约束的组合全体"(例如"市场中性""行业中性"各是一条约束)。两个子空间的交 = 同时满足两组约束,共 \((n-k_1)+(n-k_2)\) 条。只要约束总数少于 \(n\),即 \(k_1+k_2\ge n+1\),就还剩下至少一个自由度,必然存在非零的组合同时满足全部约束。三维空间里两个平面(各 2 维,\(2+2=4\ge3+1\))必交于一条直线,就是最简单的例子。

本章几乎所有不等式都按同一个模板证明:找几个维数足够大的子空间 → 由引理得到公共单位向量 \(x\) → 对 \(x\) 用几次 Rayleigh 定理。

4a.3.3 Courant–Fischer 极小极大定理

Rayleigh 定理只刻画最大、最小特征值。中间的特征值怎么办?

定理 4.2.6(Courant–Fischer) 设 \(A\) Hermitian,特征值 \(\lambda_1\le\cdots\le\lambda_n\),\(k\in\{1,\dots,n\}\),\(S\) 取遍 \(\mathbf C^n\) 的子空间,则

\[\lambda_k=\min_{\dim S=k}\ \max_{0\ne x\in S}\frac{x^*Ax}{x^*x}\tag{4.2.7}\]
\[\lambda_k=\max_{\dim S=n-k+1}\ \min_{0\ne x\in S}\frac{x^*Ax}{x^*x}\tag{4.2.8}\]

证明(4.2.7) 取标准正交特征向量 \(x_1,\dots,x_n\)。任给 \(k\) 维子空间 \(S\),令 \(S'=\operatorname{span}\{x_k,\dots,x_n\}\)(\(n-k+1\) 维)。维数和为 \(n+1\),由引理 4.2.3,\(S\cap S'\) 中有单位向量 \(x\)。由 Rayleigh 定理,在 \(S'\) 上 Rayleigh 商 \(\ge\lambda_k\),所以

\[\max_{x\in S}\frac{x^*Ax}{x^*x}\ \ge\ \frac{x^*Ax}{x^*x}\Big|_{x\in S\cap S'}\ \ge\ \lambda_k.\]

这对任意 \(k\) 维 \(S\) 成立,故 \(\min_S\max\ge\lambda_k\)。另一方面取 \(S=\operatorname{span}\{x_1,\dots,x_k\}\),其上最大值恰为 \(\lambda_k\)(在 \(x_k\) 取到)。两边相等,且 min 和 max 都能取到。(4.2.8) 对 \(-A\) 应用 (4.2.7),再用 \(\lambda_k(-A)=-\lambda_{n-k+1}(A)\)(观察 4.2.5)。\(\square\)

推导拆解:证明的逻辑是"任何对手都打不过 \(\lambda_k\),而且有人恰好打平"。 第 1 步(下界):无论你挑哪个 \(k\) 维子空间 \(S\),它都和"后 \(n-k+1\) 个特征方向"张成的 \(S'\) 相交(\(k+(n-k+1)=n+1\),用引理 4.2.3)。交点 \(x\) 在 \(S'\) 里,只在 \(\lambda_k,\dots,\lambda_n\) 上有暴露,所以它的 Rayleigh 商是这些数的加权平均,\(\ge\lambda_k\)。\(S\) 里的最大值不会比这个点小,所以 \(\ge\lambda_k\)。 第 2 步(取到):挑 \(S\) 为前 \(k\) 个特征方向,其中任何向量都只在 \(\lambda_1,\dots,\lambda_k\) 上有暴露,最大值恰为 \(\lambda_k\)。 两步合起来:所有 \(k\) 维子空间里"最大值"的最小可能就是 \(\lambda_k\)。\(n=3\)、\(k=2\) 的例子:在任意一个平面上找方差最大的方向,不管平面怎么转,这个最大方差都至少是 \(\lambda_2\);只有选中前两个主成分张成的平面时才恰好等于 \(\lambda_2\)。

怎么理解:要"挤出"第 \(k\) 小的特征值,就在所有 \(k\) 维子空间中找一个,使其中最坏(最大)的 Rayleigh 商尽可能小。最优子空间是前 \(k\) 个特征向量张成的空间。用组合语言说:\(\lambda_k(\Sigma)\) 是"在一个 \(k\) 维的组合子空间里,最大可能方差"的最小值。\(k=n\) 的 (4.2.7) 和 \(k=1\) 的 (4.2.8) 退化成 Rayleigh 定理。

定理 4.2.10 与推论 4.2.12 若在某个 \(k\) 维子空间 \(S\) 上对所有单位向量 \(x^*Ax\ge c\),则 \(\lambda_{n-k+1}(A)\ge c\),即 \(A\) 至少有 \(k\) 个特征值 \(\ge c\)。特别地,若 \(x^*Ax\ge0\)(\(>0\))在某个 \(k\) 维子空间上成立,则 \(A\) 至少有 \(k\) 个非负(正)特征值。第 04b 章证明 Sylvester 惯性定律时要用它。

习题 4.2.P8 给出一个立刻就能用的结论:若 \(B\) 半正定,则 \(\lambda_k(A+B)\ge\lambda_k(A)\) 对每个 \(k\) 成立。证明:Courant–Fischer 中每个 Rayleigh 商都被加上了一个非负数。

历史注记:4.2.2 归功于 Rayleigh(1904 年因发现氩获诺贝尔物理学奖);极小极大刻画来自 E. Fischer(1905),Courant 把它推广到无穷维算子。


4a.4 Weyl 不等式:特征值的扰动界(4.3 节之一)

4a.4.1 定理与证明

定理 4.3.1(Weyl) 设 \(A,B\in M_n\) Hermitian,特征值非减排列。对每个 \(i=1,\dots,n\):

\[\lambda_i(A+B)\ \le\ \lambda_{i+j}(A)+\lambda_{n-j}(B),\qquad j=0,1,\dots,n-i,\tag{4.3.2a}\]
\[\lambda_{i-j+1}(A)+\lambda_j(B)\ \le\ \lambda_i(A+B),\qquad j=1,\dots,i.\tag{4.3.2b}\]

(4.3.2a) 对某对 \((i,j)\) 取等号,当且仅当存在非零 \(x\) 同时满足 \(Ax=\lambda_{i+j}(A)x\)、\(Bx=\lambda_{n-j}(B)x\)、\((A+B)x=\lambda_i(A+B)x\)。因此若 \(A,B\) 没有公共特征向量,所有不等式都严格。

证明(4.3.2a) 设 \(A,B,A+B\) 的标准正交特征向量分别为 \(x_i,y_i,z_i\)。令

\[S_1=\operatorname{span}\{x_1,\dots,x_{i+j}\},\quad S_2=\operatorname{span}\{y_1,\dots,y_{n-j}\},\quad S_3=\operatorname{span}\{z_i,\dots,z_n\}.\]

维数和为 \((i+j)+(n-j)+(n-i+1)=2n+1\),由引理 4.2.3 存在公共单位向量 \(x\)。三次用 Rayleigh 定理:

\[\lambda_i(A+B)\le x^*(A+B)x=x^*Ax+x^*Bx\le\lambda_{i+j}(A)+\lambda_{n-j}(B).\]

(4.3.2b) 对 \(-A,-B\) 应用 (4.3.2a) 即得。\(\square\)

整个证明只有三行,所有"重活"都由子空间交引理完成。

推导拆解:三个不等号各用了什么。 第一个 \(\lambda_i(A+B)\le x^*(A+B)x\):\(x\in S_3\),\(S_3\) 由 \(A+B\) 的第 \(i\) 到第 \(n\) 个特征向量张成,Rayleigh 商在其上 \(\ge\) 最小的那个,即 \(\lambda_i(A+B)\)。 中间的等号:二次型对矩阵是线性的,\(x^*(A+B)x=x^*Ax+x^*Bx\)。 第二个不等号拆成两半:\(x\in S_1\),所以 \(x^*Ax\le\lambda_{i+j}(A)\)(\(S_1\) 上的最大值);\(x\in S_2\),所以 \(x^*Bx\le\lambda_{n-j}(B)\)。 维数之所以要凑到 \(2n+1\),是因为三个子空间要同时相交(引理 4.2.3 中 \(k=3\) 的情形)。\(j\) 是一个"分配旋钮":它决定把下标的余量分给 \(A\) 还是 \(B\),取 \(j=0\) 就得到下面最常用的推论。

4a.4.2 最常用的推论

对 \(B\) 加不同的假设,Weyl 不等式给出一串推论。下面把它们按量化中的用途排列。

推论 4.3.15(最简单的扰动界) 取 (4.3.2a) 中 \(j=0\)、(4.3.2b) 中 \(j=1\):

\[\lambda_i(A)+\lambda_1(B)\ \le\ \lambda_i(A+B)\ \le\ \lambda_i(A)+\lambda_n(B).\tag{4.3.16}\]

由此

\[\boxed{\ |\lambda_i(A+B)-\lambda_i(A)|\le\rho(B)=\|B\|_2\ }\]

即 Hermitian 矩阵的每个有序特征值都是矩阵的 1-Lipschitz 函数(以谱范数度量)。

金融直觉:"1-Lipschitz"(输出的变化不超过输入变化的 1 倍)的意思是:协方差估计误差矩阵 \(E=S-\Sigma\) 最"坏"的方向上能让组合方差偏多少(\(\|E\|_2=\max_{\|w\|=1}|w^TEw|\)),每一个主成分方差就最多偏多少,不会被放大。这像一个风险预算:如果你知道任何单位组合的方差估计误差不超过 \(0.0008\),那么第 1 到第 \(n\) 个主成分方差的估计误差也都不超过 \(0.0008\)。 但要注意相对误差:最大特征值本身很大,偏 \(0.0008\) 只是零头;最小特征值本身很小,同样的绝对误差可能就是 100% 的相对误差。这就是实战 1 中最小特征值被大幅低估、而最大特征值偏差只有几个百分点的原因。注意这里的配对是"第 \(i\) 小对第 \(i\) 小",不需要去找哪个特征值和哪个对应。第 06 章会把它和一般矩阵的 Bauer–Fike 定理对比:非正规矩阵没有这么好的稳定性。

习题 4.3.P2 说明 Hermitian 假设不可去:\(A=\begin{bmatrix}0&1\\0&0\end{bmatrix}\)、\(B=\begin{bmatrix}0&0\\1&0\end{bmatrix}\) 的特征值全是 0,而 \(A+B\) 的特征值是 \(\pm1\)。

推论 4.3.12(单调性定理) 若 \(B\) 半正定,则

\[\lambda_i(A)\le\lambda_i(A+B),\qquad i=1,\dots,n;\]

若 \(B\) 正定则全部严格。等价的说法(4.3.P4):Loewner 序保持特征值序——若 \(A-B\succeq0\),则 \(\lambda_i(A)\ge\lambda_i(B)\) 对每个 \(i\)。

量化含义:协方差矩阵 = 因子部分 \(BFB^T\) + 特异风险 \(D\),后者半正定,所以加入特异风险只会抬高每一个特征值。线性收缩 \((1-\delta)S+\delta\nu I\) 中 \(\delta\nu I\) 部分把每个特征值都抬高 \(\delta\nu\),尤其抬高了最小的那些——这正是收缩能改善条件数的机制。

推论 4.3.3 若 \(B\) 恰有 \(\pi\) 个正特征值、\(\nu\) 个负特征值,则

\[\lambda_i(A+B)\le\lambda_{i+\pi}(A),\qquad\lambda_{i-\nu}(A)\le\lambda_i(A+B).\]

推论 4.3.5(秩 \(r\) 扰动) 若 \(\operatorname{rank}B=r\),则

\[\lambda_{i-r}(A)\le\lambda_i(A+B)\le\lambda_{i+r}(A).\]

秩 \(r\) 的扰动最多让每个特征值"挪动 \(r\) 个位置"。不管 \(B\) 的元素多大,\(A+B\) 的第 \(i\) 个特征值仍被 \(A\) 的第 \(i-r\) 和第 \(i+r\) 个特征值夹住。

推导拆解:从推论 4.3.3 到 4.3.5 只差一步。秩为 \(r\) 的 Hermitian 矩阵恰有 \(r\) 个非零特征值,所以正特征值个数 \(\pi\le r\)、负特征值个数 \(\nu\le r\)。特征值按从小到大排列,下标越大值越大,于是 \(\lambda_{i+\pi}(A)\le\lambda_{i+r}(A)\)、\(\lambda_{i-r}(A)\le\lambda_{i-\nu}(A)\),代入推论 4.3.3 即得。下标超出 \(1..n\) 的一侧视为没有约束(例如 \(i+r>n\) 时上界不存在)。 小例子:\(A=\operatorname{diag}(1,2,3,4)\),加一个秩一的 \(B=100\,e_1e_1^T\)。\(A+B=\operatorname{diag}(101,2,3,4)\),排序后特征值是 \(2,3,4,101\)。第 1 小从 1 变成 2,第 2 小从 2 变成 3……每个都只往上挪了"一格",只有最大的那个被推到了 101。

推论 4.3.9(秩一扰动的交错定理) \(z\ne0\) 时

\[\lambda_i(A)\le\lambda_i(A+zz^*)\le\lambda_{i+1}(A),\quad i=1,\dots,n-1;\qquad\lambda_n(A)\le\lambda_n(A+zz^*).\]

若 \(A\) 没有与 \(z\) 正交的特征向量,则全部严格。并且(4.3.P19)每个特征值的上移量 \(\mu_i\ge0\),总和 \(\sum\mu_i=\|z\|_2^2\)(比较两边的迹)。

量化含义:单因子模型的谱结构。\(\Sigma=D+bb^T\)(\(D\) 为特异方差对角阵,\(b\) 为 beta 乘因子波动)。把 \(d_i\) 从小到大排好,交错定理说

\[d_1\le\lambda_1\le d_2\le\lambda_2\le\cdots\le d_n\le\lambda_n.\]
也就是说,前 \(n-1\) 个特征值都被困在特异方差之间,只有最大的一个可以"逃出去",而且它吸收了几乎全部的 \(\|b\|^2\)。这就是实证中"第一个特征值远大于其余、其余特征值像噪声"的结构性解释。\(K\) 因子模型同理(秩 \(K\) 扰动),只有 \(K\) 个特征值能逃离特异方差的范围。实战 3 用数据验证。

推论 4.3.7 若 \(B\) 恰有一个正、一个负特征值,则 \(\lambda_{i-1}(A)\le\lambda_i(A+B)\le\lambda_{i+1}(A)\)。它是下一节 Cauchy 交错定理证明的关键一步。


4a.5 交错定理与包含原理(4.3 节之二、三)

4a.5.1 Cauchy 交错定理:加边

定理 4.3.17(Cauchy 交错定理 / 分离定理) 设 \(B\in M_n\) Hermitian,\(y\in\mathbf C^n\),\(a\in\mathbf R\),

\[A=\begin{bmatrix}B&y\\y^*&a\end{bmatrix}\in M_{n+1}.\]

则

\[\lambda_1(A)\le\lambda_1(B)\le\lambda_2(A)\le\lambda_2(B)\le\cdots\le\lambda_n(A)\le\lambda_n(B)\le\lambda_{n+1}(A).\tag{4.3.18}\]

若 \(B\) 没有与 \(y\) 正交的特征向量,则全部严格。

证明思路 平移 \(A\to A+\mu I\) 不改变交错关系,可设 \(A,B\) 正定。把 \(A\) 拆成

\[A=\underbrace{\begin{bmatrix}B&0\\0&0\end{bmatrix}}_{\mathcal H}+\underbrace{\begin{bmatrix}0_n&y\\y^*&a\end{bmatrix}}_{\mathcal K}.\]

\(\mathcal H\) 的特征值是 \(0\) 和 \(B\) 的特征值,因 \(B\) 正定,\(\lambda_{i+1}(\mathcal H)=\lambda_i(B)\)。\(\mathcal K\) 恰有一正一负特征值(\((a\pm\sqrt{a^2+4y^*y})/2\) 及 \(n-1\) 个零),用推论 4.3.7 得 \(\lambda_i(A)\le\lambda_{i+1}(\mathcal H)=\lambda_i(B)\)。另一半对 \(-A\) 同样处理。\(\square\)

推导拆解:用 \(2\times2\) 的例子核对。\(B=[1]\)(一只资产,方差 1),加入第二只资产,相关 0.5、方差 1:\(A=\begin{bmatrix}1&0.5\\0.5&1\end{bmatrix}\),特征值 \(0.5,\ 1.5\)。交错定理要求 \(\lambda_1(A)\le\lambda_1(B)\le\lambda_2(A)\),即 \(0.5\le1\le1.5\),成立。加入的资产相关越强,两个新特征值离旧值 1 越远(相关 0.9 时是 \(0.1\) 和 \(1.9\)),但旧值永远被夹在中间。 证明中"平移 \(A\to A+\mu I\) 不改变交错关系":加 \(\mu I\) 让 \(A\) 和 \(B\) 的所有特征值同时加 \(\mu\),不等式两边同加同一个数,所以可以先把矩阵平移成正定的,方便论证。

直觉:在 \(n\) 只资产的组合里再加入一只资产,新协方差矩阵的特征值与旧的交替排列。新的最小特征值不会比旧的大,新的最大特征值不会比旧的小;但每个旧特征值两侧各被一个新特征值"锁住"。

逆定理也成立(定理 4.3.21、4.3.26):任给满足交错不等式的两组实数,都能构造出相应的加边矩阵 \(\begin{bmatrix}\Lambda&y\\y^T&a\end{bmatrix}\) 或秩一扰动 \(\Lambda+zz^T\) 实现它们。证明是构造性的:迹条件定出 \(a=\sum\mu_i-\sum\lambda_i\),再由特征多项式

\[p_A(t)=(t-a)\prod_i(t-\lambda_i)-\sum_iy_i^2\prod_{j\ne i}(t-\lambda_j)\]

解出 \(y_i^2\),交错条件恰好保证这些 \(y_i^2\) 非负。所以交错不等式是加边/秩一扰动下特征值之间的全部约束,不能再改进。

4a.5.2 包含原理:主子矩阵

删去一只资产相当于删去一行一列。删去 \(n-m\) 只得到 \(m\) 阶主子矩阵:

定理 4.3.28(包含原理,inclusion principle) 设 \(A=\begin{bmatrix}B&C\\C^*&D\end{bmatrix}\in M_n\) Hermitian,\(B\in M_m\),则

\[\lambda_i(A)\ \le\ \lambda_i(B)\ \le\ \lambda_{i+n-m}(A),\qquad i=1,\dots,m.\tag{4.3.30}\]

证明仍是模板:取 \(S_1=\operatorname{span}\{x_1,\dots,x_{i+n-m}\}\)(\(A\) 的特征向量)和 \(S_2=\operatorname{span}\{\hat y_i,\dots,\hat y_m\}\)(\(B\) 的特征向量补零到 \(n\) 维),维数和 \(n+1\),公共单位向量 \(x=\begin{bmatrix}\xi\\0\end{bmatrix}\) 满足 \(x^*Ax=\xi^*B\xi\),两边各用一次 Rayleigh。

量化含义:取 \(i=1\) 和 \(i=m\):

\[\lambda_{\min}(A)\le\lambda_{\min}(B),\qquad\lambda_{\max}(B)\le\lambda_{\max}(A).\]
所以任何资产子集的协方差(或相关)矩阵的条件数都不超过全体的条件数。在大样本池上做均值–方差优化时数值困难最大;按行业或聚类拆成小块分别优化(如层次风险平价 HRP 的思路),每块天然更良态。

推论 4.3.34 对角元之和也被夹住:

\[\lambda_1(A)+\cdots+\lambda_m(A)\ \le\ a_{11}+\cdots+a_{mm}\ \le\ \lambda_{n-m+1}(A)+\cdots+\lambda_n(A).\]

任一边取等号,则 \(C=0\),\(A=B\oplus D\) 分块对角。

4a.5.3 Poincaré 分离定理与 Ky Fan 迹极值

把"删行删列"推广到"投影到任意 \(m\) 维子空间":

推论 4.3.37(Poincaré 分离定理) 设 \(u_1,\dots,u_m\) 标准正交,\(B_m=[u_i^*Au_j]\in M_m\)(即 \(V^*AV\),\(V=[u_1\cdots u_m]\)),则

\[\lambda_i(A)\le\lambda_i(V^*AV)\le\lambda_{i+n-m}(A),\qquad i=1,\dots,m.\]

证明:把 \(V\) 补全成酉矩阵 \(U\),\(V^*AV\) 就是 \(U^*AU\) 的主子矩阵。

对 \(i\) 求和得到:

推论 4.3.39(Ky Fan 迹极值) 对 \(1\le m\le n\),

\[\lambda_1(A)+\cdots+\lambda_m(A)=\min_{V^*V=I_m}\operatorname{tr}V^*AV,\qquad\lambda_{n-m+1}(A)+\cdots+\lambda_n(A)=\max_{V^*V=I_m}\operatorname{tr}V^*AV.\tag{4.3.40}\]

极值在 \(V\) 的列为相应特征向量时取到。

量化含义:PCA 的最优性。\(V\) 的列是 \(m\) 个正交单位组合(或因子方向),\(\operatorname{tr}V^T\Sigma V\) 是它们的方差之和,即 \(m\) 维子空间"捕获"的总方差。Ky Fan 定理说:在所有 \(m\) 维正交投影中,前 \(m\) 个主成分捕获的方差最多,等于前 \(m\) 大特征值之和。统计因子模型用"累计解释方差比例" \(\sum_{i>n-m}\lambda_i/\operatorname{tr}\Sigma\) 选因子个数,其理论依据就在这里。

习题 4.3.P14 由 (4.3.40) 的 min / max 表示(线性函数的下确界 / 上确界)立刻得到:

  • \(f_r(A)=\lambda_1+\cdots+\lambda_r\)(最小 \(r\) 个之和)是 Hermitian 矩阵空间上的凹函数;
  • \(g_r(A)=\lambda_{n-r+1}+\cdots+\lambda_n\)(最大 \(r\) 个之和)是凸函数。

这条看似抽象的结论有一个直接的统计推论,见实战 1:由 Jensen 不等式,\(\mathbb E[g_r(S)]\ge g_r(\mathbb E S)=g_r(\Sigma)\),样本协方差的最大几个特征值之和平均而言被高估,最小几个之和被低估。

习题 4.3.P15 给出行列式版本:\(A\) 半正定、\(V\) 列标准正交时 \(\lambda_1\cdots\lambda_m\le\det V^*AV\le\lambda_{n-m+1}\cdots\lambda_n\)。

4a.5.4 Sylvester 判据与 Jacobi 矩阵

习题 4.3.P5(Jacobi / Sylvester 符号规则) 设顺序主子式 \(a_k=\det A[\{1,\dots,k\}]\) 均非零,则 \(A\) 的负特征值个数等于序列 \(1,a_1,a_2,\dots,a_n\) 的变号次数。所以

\[A\ \text{正定}\iff\text{所有顺序主子式}>0\quad\text{(Sylvester 判据)}.\]

这条可以由交错定理归纳证明:逐个加边,交错定理保证每加一行一列,负特征值的个数要么不变、要么恰好加 1;行列式是特征值之积,所以加 1 当且仅当 \(a_k/a_{k-1}<0\)。数值实践中更常用的等价检验是尝试 Cholesky 分解:顺序主子式全正 \(\iff\) Cholesky 分解的所有主元为正。

习题 4.3.P17:不可约(次对角元全非零)的 Hermitian 三对角矩阵(Jacobi 矩阵)的特征值互不相同,与 \(n-1\) 阶主子矩阵严格交错;顺序主子式多项式满足三项递推

\[p_k(t)=(t-a_{kk})p_{k-1}(t)-|a_{k-1,k}|^2p_{k-2}(t),\]

构成 Sturm 序列,可以用二分法逐个定位特征值。对称三对角矩阵的特征值算法(LAPACK 的 stebz)就基于这一点。


4a.6 优超(4.3 节之四)

4a.6.1 定义:谁比谁"更分散"

定义 4.3.41 / 4.3.43 对 \(z\in\mathbf R^n\),记 \(z^\downarrow\) 为把分量从大到小重排的向量,\(z^\uparrow\) 为从小到大。称 \(x\) 优超(majorize) \(y\),若

\[\sum_{i=1}^kx_i^\downarrow\ \ge\ \sum_{i=1}^ky_i^\downarrow,\quad k=1,\dots,n-1,\qquad\text{且}\quad\sum_{i=1}^nx_i=\sum_{i=1}^ny_i.\]

等价地("自下而上")\(\sum_{i\le k}y_i^\uparrow\ge\sum_{i\le k}x_i^\uparrow\)。

直觉:总和相同,但 \(x\) 的"头部更重、尾部更轻",即 \(x\) 比 \(y\) 更分散。例如 \((1,0,0)\) 优超 \((\tfrac12,\tfrac12,0)\),后者优超 \((\tfrac13,\tfrac13,\tfrac13)\)。\(x\) 优超 \(y\) 时必有 \(x_1^\downarrow\ge y_1^\downarrow\) 且 \(x_n^\downarrow\le y_n^\downarrow\)。

金融直觉:优超就是"集中度"的严格比较。把向量看成组合在 \(n\) 个板块上的权重(总和都是 100%),\(x\) 优超 \(y\) 等价于:\(x\) 的前 1 大权重 \(\ge\) \(y\) 的前 1 大,\(x\) 的前 2 大之和 \(\ge\) \(y\) 的前 2 大之和……对每个 \(k\) 都成立。所以 \(x\) 在任何"前 \(k\) 大集中度"指标下都比 \(y\) 更集中。逐项核对 \((1,0,0)\) 与 \((\tfrac12,\tfrac12,0)\):\(k=1\) 时 \(1\ge\tfrac12\);\(k=2\) 时 \(1\ge1\);总和都是 1。 优超是"偏序":并非任意两个向量都能比较。\((0.6,0.2,0.2)\) 与 \((0.5,0.5,0)\):\(k=1\) 时前者大(0.6 vs 0.5),\(k=2\) 时后者大(1.0 vs 0.8),谁也不优超谁。HHI 这类单一指标总能排序,优超则要求"在所有集中度指标下都一致"。

4a.6.2 Schur 定理:特征值优超对角元

定理 4.3.45(Schur) Hermitian 矩阵 \(A\) 的特征值向量 \(\lambda(A)\) 优超其对角元向量 \(d(A)=(a_{11},\dots,a_{nn})\)。

证明:置换使对角元从大到小排列,然后对前 \(k\) 个对角元用推论 4.3.34 的右半部分。\(\square\)

推导拆解:为什么可以先置换?对 \(A\) 做置换相似 \(P^TAP\) 只是重新给资产编号,特征值不变,对角元只换了顺序。排好后,前 \(k\) 个对角元恰是最大的 \(k\) 个资产方差,它们构成一个 \(k\) 阶主子矩阵的迹,推论 4.3.34 右半说这个迹 \(\le\) 最大 \(k\) 个特征值之和。对每个 \(k\) 都成立,再加上"迹 = 对角元之和 = 特征值之和",正好是优超定义的全部条件。 数值核对:\(\begin{bmatrix}1&0.5\\0.5&1\end{bmatrix}\),对角元 \((1,1)\),特征值 \((1.5,0.5)\)。\(k=1\):\(1.5\ge1\);总和 \(2=2\)。特征值向量更分散。

逆定理 4.3.48(Schur–Horn 定理的逆向部分):若 \(x\) 优超 \(y\),则存在实对称矩阵,特征值为 \(x\)、对角元为 \(y\)。\(n=2\) 时可以直接写出旋转矩阵

\[P=\frac1{\sqrt{x_1-x_2}}\begin{bmatrix}\sqrt{x_1-y_2}&-\sqrt{y_2-x_2}\\\sqrt{y_2-x_2}&\sqrt{x_1-y_2}\end{bmatrix},\]

使 \(P^T\operatorname{diag}(x_1,x_2)P\) 的对角元为 \((y_1,y_2)\);一般 \(n\) 用归纳。两者合起来:优超恰好是 Hermitian 矩阵对角元与特征值之间的全部关系。(对一般矩阵,第 01 章说明唯一的约束是迹相等;对称性带来了强得多的约束。)

量化含义:协方差矩阵的对角元是各资产方差,特征值是主成分方差。Schur 定理说主成分方差比资产方差更分散:最大主成分方差 \(\ge\) 最大资产方差,最小主成分方差 \(\le\) 最小资产方差,并且前 \(k\) 大之和逐一占优。实战 1 中 50 只股票的例子:最大方差资产只占总方差的 6.8%,第一主成分却占 46%。资产之间的相关性越强,二者差距越大。

4a.6.3 优超与双随机矩阵

双随机矩阵(doubly stochastic):元素非负、每行每列之和都是 1。Birkhoff 定理(原书 8.7.2)说它恰好是置换矩阵的凸组合。

定理 4.3.49 对 \(x,y\in\mathbf R^n\),以下等价:

  1. \(x\) 优超 \(y\);
  2. 存在双随机矩阵 \(S\) 使 \(y=Sx\);
  3. \(y\) 落在 \(x\) 的所有置换 \(\{Px\}\) 的凸包中(置换多面体,permutohedron)。

(1)⇒(2) 的证明很巧妙:由 Schur–Horn 逆定理取正交矩阵 \(Q\) 使 \(y=\operatorname{diag}(Q\operatorname{diag}(x)Q^T)\),即 \(y_i=\sum_jq_{ij}^2x_j\);正交矩阵的行和列都是单位向量,所以 \([q_{ij}^2]\) 是双随机矩阵(称为正交随机矩阵,orthostochastic)。

直觉:"被 \(x\) 优超"="可以由 \(x\) 通过一系列平均操作得到"。双随机变换就是"把各分量按某种权重混合平均"。

量化含义:特征值收缩(shrinkage)几乎都是某种"平均":把噪声区的特征值换成它们的平均值(随机矩阵理论的特征值裁剪),或者把所有特征值向总平均拉近(线性收缩 \(\lambda_i\mapsto(1-\delta)\lambda_i+\delta\bar\lambda\),对应双随机矩阵 \((1-\delta)I+\frac\delta nee^T\))。这些操作都保持迹(总方差),而结果被原特征值向量优超——更不分散,从而条件数更小。实战 2 验证了这一点。

4a.6.4 Fan 与 Lidskii 不等式

Weyl 不等式比较单个特征值;优超可以一次比较特征值的"部分和":

定理 4.3.47 设 \(A,B\) Hermitian,

  • (a)(Fan)\(\lambda(A)^\downarrow+\lambda(B)^\downarrow\) 优超 \(\lambda(A+B)\);
  • (b)(Lidskii)\(\lambda(A+B)\) 优超 \(\lambda(A)^\downarrow+\lambda(B)^\uparrow\)。

(a) 由 Ky Fan 迹极值一行得到:\(\max\operatorname{tr}V^*(A+B)V\le\max\operatorname{tr}V^*AV+\max\operatorname{tr}V^*BV\)。(b) 的证明(取自 Li–Mathias 1999)先平移使 \(\lambda_k(B)^\downarrow=0\),再把 \(B\) 拆成 \(B_+-B_-\) 并用单调性定理。

Lidskii 不等式的一个等价形式(4.3.P24)最适合做扰动分析:\(\lambda(A-B)\) 优超 \(\lambda(A)^\downarrow-\lambda(B)^\downarrow\)。它说明特征值的变化量向量被扰动矩阵的特征值向量优超,于是对任何"对称凸函数" \(\phi\),\(\phi(\lambda(A)^\downarrow-\lambda(B)^\downarrow)\le\phi(\lambda(A-B))\)。取 \(\phi\) 为平方和就得到第 06 章的 Hoffman–Wielandt 不等式(Hermitian 情形);取 \(\phi\) 为最大绝对值就回到 Weyl 的 \(\|E\|_2\) 界。Weyl、Fan、Lidskii 都是更一般的 Horn 不等式的特例(Bhatia 2001)。

4a.6.5 迹不等式

引理 4.3.51 若 \(x\) 优超 \(y\),\(w\in\mathbf R^n\),则

\[\sum_iw_i^\downarrow x_i^\uparrow\ \le\ \sum_iw_i^\downarrow y_i\ \le\ \sum_iw_i^\downarrow x_i^\downarrow.\]

证明用 Abel 分部求和。

定理 4.3.53(迹不等式,von Neumann 迹不等式的 Hermitian 版本) 设 \(A,B\) Hermitian,

\[\sum_{i=1}^n\lambda_i(A)^\downarrow\lambda_i(B)^\uparrow\ \le\ \operatorname{tr}AB\ \le\ \sum_{i=1}^n\lambda_i(A)^\downarrow\lambda_i(B)^\downarrow.\tag{4.3.54}\]

右边取等号当且仅当 \(A,B\) 可以被同一个酉矩阵"同序"对角化;左边取等号当且仅当可以"反序"对角化。

证明:\(A=U\Lambda U^*\),\(\operatorname{tr}AB=\sum_i\lambda_i(A)\beta_{ii}\),其中 \(\beta_{ii}\) 是 \(U^*BU\) 的对角元;由 Schur 定理,\(\lambda(B)\) 优超 \((\beta_{ii})\),再用引理 4.3.51。

白话解释:引理 4.3.51 背后是一个"排序配对"原则(重排不等式):两列数逐项相乘再相加,大配大、小配小时和最大,大配小时和最小。例:\((3,1)\) 与 \((2,1)\),同序 \(3\cdot2+1\cdot1=7\),反序 \(3\cdot1+1\cdot2=5\)。迹不等式把它搬到矩阵上:\(\operatorname{tr}AB\) 的大小取决于两个矩阵的主方向怎样"配对"。一个直接应用是:组合在高方差主成分上的暴露越大,\(\operatorname{tr}(\Sigma ww^T)=w^T\Sigma w\) 越大;最小方差组合的本质就是把权重尽量"反序"地放到低方差方向上。

量化含义:\(\operatorname{tr}(\Sigma W)\) 型的量在量化中经常出现,例如 \(\operatorname{tr}(\Sigma ww^T)=w^T\Sigma w\)、多期组合的总方差、以及"用协方差 \(\hat\Sigma\) 优化的组合在真实协方差 \(\Sigma\) 下的风险"。迹不等式给出它与两矩阵特征值的关系:两矩阵主方向"同序对齐"时取最大,"反序对齐"时取最小。


量化实战

实战 1:样本协方差的特征值误差——Weyl、Ky Fan 与 Schur

场景:真实收益服从 3 因子模型,\(N=50\) 只股票,用 \(T=250\) 个交易日估计样本协方差 \(S\)。问题:(1) Weyl 界 \(|\lambda_i(S)-\lambda_i(\Sigma)|\le\|S-\Sigma\|_2\) 是否成立;(2) 样本特征值是否系统性地"更分散";(3) Schur 优超与 Ky Fan 极值在真实数据规模下长什么样。

import numpy as np

rng = np.random.default_rng(42)
N, T, K = 50, 250, 3

# ---------- 真实协方差:3 因子模型 Σ = B F Bᵀ + D ----------
B = rng.normal(0.0, 1.0, size=(N, K)) * np.array([1.0, 0.5, 0.3])
F = np.diag([0.04, 0.02, 0.01]) / 252          # 因子日方差
D = np.diag(rng.uniform(0.5, 1.5, N) * 0.03 / 252)  # 特异方差
Sigma = B @ F @ B.T + D
lam_true = np.linalg.eigvalsh(Sigma)            # 非减排列,与原书约定一致

# ---------- 1. Weyl:|λ_i(S) - λ_i(Σ)| ≤ ‖S - Σ‖₂ ----------
L = np.linalg.cholesky(Sigma)
X = rng.standard_normal((T, N)) @ L.T           # T 天收益(均值已知为 0)
S = X.T @ X / T                                 # 样本协方差
E = S - Sigma
lam_S = np.linalg.eigvalsh(S)
gap = np.abs(lam_S - lam_true)
print(f"‖S-Σ‖₂ = {np.linalg.norm(E, 2):.3e}   max_i |λ_i(S)-λ_i(Σ)| = {gap.max():.3e}")
print("更细的 Weyl 界 λ_1(E) ≤ λ_i(S)-λ_i(Σ) ≤ λ_n(E) 成立?",
      np.all(lam_S - lam_true >= np.linalg.eigvalsh(E)[0] - 1e-18) and
      np.all(lam_S - lam_true <= np.linalg.eigvalsh(E)[-1] + 1e-18))

# ---------- 2. Ky Fan 凸性 + Jensen:样本特征值"更分散" ----------
reps, k = 300, 5
top_bias, bot_bias = [], []
for _ in range(reps):
    X = rng.standard_normal((T, N)) @ L.T
    l = np.linalg.eigvalsh(X.T @ X / T)
    top_bias.append(l[-k:].sum() / lam_true[-k:].sum() - 1)
    bot_bias.append(l[:k].sum() / lam_true[:k].sum() - 1)
print(f"\n最大 {k} 个特征值之和的平均相对偏差: {np.mean(top_bias):+.2%}(理论: ≥ 0)")
print(f"最小 {k} 个特征值之和的平均相对偏差: {np.mean(bot_bias):+.2%}(理论: ≤ 0)")

# ---------- 3. Schur 优超:特征值向量优超方差(对角元)向量 ----------
d = np.sort(np.diag(Sigma))[::-1]
lam_desc = lam_true[::-1]
partial_ok = np.all(np.cumsum(lam_desc) >= np.cumsum(d) - 1e-15)
print(f"\nSchur 优超成立?{partial_ok};迹相等?{np.isclose(lam_desc.sum(), d.sum())}")
print(f"最大方差资产占总方差 {d[0]/d.sum():.1%},第一主成分占 {lam_desc[0]/lam_desc.sum():.1%}")

# ---------- 4. Ky Fan 极值:前 m 个主成分捕获的方差最大 ----------
m = 3
V_pca = np.linalg.eigh(Sigma)[1][:, -m:]
best_rand = max(np.trace(Q.T @ Sigma @ Q) for Q in
                (np.linalg.qr(rng.standard_normal((N, m)))[0] for _ in range(2000)))
print(f"\ntr(VᵀΣV):PCA = {np.trace(V_pca.T @ Sigma @ V_pca):.3e} = λ 前 {m} 大之和 "
      f"{lam_true[-m:].sum():.3e};2000 个随机正交 V 的最大值 = {best_rand:.3e}")

关键输出:

‖S-Σ‖₂ = 8.387e-04   max_i |λ_i(S)-λ_i(Σ)| = 7.076e-04
更细的 Weyl 界 λ_1(E) ≤ λ_i(S)-λ_i(Σ) ≤ λ_n(E) 成立? True

最大 5 个特征值之和的平均相对偏差: +3.87%(理论: ≥ 0)
最小 5 个特征值之和的平均相对偏差: -43.23%(理论: ≤ 0)

Schur 优超成立?True;迹相等?True
最大方差资产占总方差 6.8%,第一主成分占 46.4%

tr(VᵀΣV):PCA = 7.303e-03 = λ 前 3 大之和 7.303e-03;2000 个随机正交 V 的最大值 = 2.370e-03

读法:

  1. Weyl 界成立,而且在这个例子里比较紧:最大的特征值偏差(出现在第一主成分)约为 \(\|S-\Sigma\|_2\) 的 84%。Weyl 界的价值在于它不需要知道误差的结构,只需要误差的谱范数;后者可以用矩阵集中不等式估计,其量级大致随 \(\sqrt{N/T}\) 增长。
  2. 偏差方向完全符合 Ky Fan 凸性 + Jensen 的预测。最小的 5 个特征值之和平均被低估 43%——这是整个故事里最危险的一点:最小特征值对应"看起来几乎无风险"的组合方向,均值–方差优化恰恰会往这些方向加大仓位,而它们的真实风险被严重低估。
  3. Schur 优超在实际规模下的含义:单只股票最多只占 6.8% 的总方差,但第一主成分(市场因子)占了 46%。
  4. 2000 个随机正交 3 维子空间里最好的那个,也只捕获了 PCA 子空间方差的约三分之一。

实战 2:随机矩阵噪声、特征值裁剪与收缩

场景:\(N/T\) 不小时,样本协方差的特征值会被噪声"摊开"。先看纯噪声的情形,再在因子模型数据上比较三种协方差估计构造的最小方差组合的真实(样本外)风险。

import numpy as np
from sklearn.covariance import LedoitWolf

rng = np.random.default_rng(7)

# ---------- 1. 纯噪声:Σ = I,样本特征值铺满 Marchenko–Pastur 区间 ----------
N, T = 100, 400
q = N / T
X = rng.standard_normal((T, N))
l = np.linalg.eigvalsh(X.T @ X / T)
lo, hi = (1 - np.sqrt(q))**2, (1 + np.sqrt(q))**2
print(f"真实特征值全为 1;样本特征值范围 [{l[0]:.3f}, {l[-1]:.3f}],MP 理论边界 [{lo:.3f}, {hi:.3f}]")
print(f"样本条件数 {l[-1]/l[0]:.1f}(真实为 1)")

# ---------- 2. 因子模型 + 噪声:特征值裁剪(clipping)与 Ledoit–Wolf 收缩 ----------
N, T, K = 100, 200, 3
B = rng.normal(0, 1, (N, K)) * np.array([1.0, 0.6, 0.4])
Sigma = B @ np.diag([0.04, 0.02, 0.01]) @ B.T / 252 + np.diag(rng.uniform(0.02, 0.06, N)) / 252
L = np.linalg.cholesky(Sigma)
ones = np.ones(N)

def min_var_weights(C):
    x = np.linalg.solve(C, ones)
    return x / x.sum()

def clip(S, T):
    """把落在 MP 上界以内的特征值换成它们的平均值(保持迹不变)"""
    lam, V = np.linalg.eigh(S)
    sigma2 = np.trace(S) / S.shape[0]          # 粗略的噪声水平
    lam_plus = sigma2 * (1 + np.sqrt(S.shape[0] / T))**2
    noise = lam < lam_plus
    lam_c = lam.copy()
    lam_c[noise] = lam[noise].mean()
    return (V * lam_c) @ V.T, noise.sum(), lam, lam_c

res = {"样本协方差": [], "特征值裁剪": [], "Ledoit-Wolf": [], "真实Σ(上帝视角)": []}
for _ in range(100):
    Xs = rng.standard_normal((T, N)) @ L.T
    S = np.cov(Xs, rowvar=False)
    C_clip, n_noise, lam, lam_c = clip(S, T)
    C_lw = LedoitWolf().fit(Xs).covariance_
    for name, C in [("样本协方差", S), ("特征值裁剪", C_clip),
                    ("Ledoit-Wolf", C_lw), ("真实Σ(上帝视角)", Sigma)]:
        w = min_var_weights(C)
        res[name].append(np.sqrt(w @ Sigma @ w * 252))   # 真实(样本外)年化波动
print(f"\n最后一次:{n_noise}/{N} 个特征值被判为噪声;裁剪前条件数 {lam[-1]/lam[0]:.0f},"
      f"裁剪后 {lam_c[-1]/lam_c[0]:.0f}")
# 裁剪 = 对噪声特征值取平均 = 双随机变换,结果被原特征值向量优超
a, b = np.sort(lam)[::-1], np.sort(lam_c)[::-1]
print("原特征值优超裁剪后特征值?", np.all(np.cumsum(a) >= np.cumsum(b) - 1e-15),
      " 迹不变?", np.isclose(a.sum(), b.sum()))
print("\n最小方差组合的真实年化波动(100 次模拟平均):")
for name, v in res.items():
    print(f"  {name:<14s} {np.mean(v):.3%}")

关键输出:

真实特征值全为 1;样本特征值范围 [0.247, 2.123],MP 理论边界 [0.250, 2.250]
样本条件数 8.6(真实为 1)

最后一次:98/100 个特征值被判为噪声;裁剪前条件数 1024,裁剪后 90
原特征值优超裁剪后特征值? True  迹不变? True

最小方差组合的真实年化波动(100 次模拟平均):
  样本协方差          2.802%
  特征值裁剪          2.187%
  Ledoit-Wolf    2.569%
  真实Σ(上帝视角)      1.997%

读法:

  1. 纯噪声也会制造"结构"。真实协方差是单位阵(所有特征值为 1,条件数 1),但 \(N/T=0.25\) 时样本特征值铺满 \([0.25,2.25]\),条件数 8.6。这个区间就是 Marchenko–Pastur 分布的支撑 \([(1-\sqrt q)^2,(1+\sqrt q)^2]\)(随机矩阵理论的结论,本书不证明;概率背景见第 02、03 册)。由 Weyl 界反推,\(\|S-I\|_2\approx(1+\sqrt q)^2-1=2\sqrt q+q\),在 \(q=0.25\) 时约为 1.25——误差比真实特征值还大。
  2. 特征值裁剪把 MP 上界以内的特征值视为噪声并取平均。由 4a.6.3 节,取平均是双随机变换,结果被原特征值优超,迹(总方差)不变,条件数从 1024 降到 90。
  3. 用三种估计构造最小方差组合,再用真实 \(\Sigma\) 评估风险:样本协方差 2.80%,Ledoit–Wolf 线性收缩 2.57%,裁剪 2.19%,理论最优 2.00%。在"少数强因子 + 大量噪声"的结构下,裁剪的效果最好;Ledoit–Wolf 把所有特征值以同一比例拉向均值,对这种结构的适配不如裁剪。实务中两类方法(以及非线性收缩)都常用,选择取决于数据结构,应当用样本外风险来检验。
  4. 这里的"噪声水平"用 \(\operatorname{tr}S/N\) 粗略估计,有因子时会偏大,导致第三个较弱的因子也被当作噪声(只保留了 2 个)。更精细的做法是迭代地剔除因子特征值后重新估计噪声方差。

实战 3:因子模型的交错结构、剔除资产与单调性

import numpy as np

rng = np.random.default_rng(3)

# ---------- 1. 单因子模型 Σ = D + b bᵀ:秩一扰动交错(4.3.9) ----------
n = 8
d = np.sort(rng.uniform(0.02, 0.08, n))          # 特异方差(已排序)
b = rng.normal(0.15, 0.05, n)                    # 市场 beta × 因子波动
lam = np.linalg.eigvalsh(np.diag(d) + np.outer(b, b))
print("特异方差 d_i     :", d.round(4))
print("Σ 的特征值 λ_i   :", lam.round(4))
print("交错 d_i ≤ λ_i ≤ d_{i+1}?", np.all(d <= lam + 1e-15) and np.all(lam[:-1] <= d[1:] + 1e-15))
print(f"迹的增量 Σμ_i = {lam.sum()-d.sum():.4f} = ‖b‖² = {b @ b:.4f}")

# ---------- 2. 剔除资产:主子矩阵的特征值被夹住(包含原理 4.3.28) ----------
N = 60
A = rng.standard_normal((N, 3)); C = A @ A.T + np.diag(rng.uniform(0.1, 1.0, N))
C = C / np.sqrt(np.outer(np.diag(C), np.diag(C)))  # 相关矩阵
lam_full = np.linalg.eigvalsh(C)
keep = np.sort(rng.choice(N, 40, replace=False))
lam_sub = np.linalg.eigvalsh(C[np.ix_(keep, keep)])
m = len(keep)
ok = np.all(lam_full[:m] <= lam_sub + 1e-12) and np.all(lam_sub <= lam_full[N - m:] + 1e-12)
print(f"\n包含原理 λ_i(C) ≤ λ_i(C_sub) ≤ λ_(i+{N-m})(C) 成立?{ok}")
print(f"条件数:全体 {N} 只 {lam_full[-1]/lam_full[0]:.1f},子集 {m} 只 {lam_sub[-1]/lam_sub[0]:.1f}")

# ---------- 3. 半正定扰动只抬高特征值(单调性 4.3.12) ----------
P = np.diag(rng.uniform(0, 0.05, N))           # 例如加入额外的特异风险
print("λ_i(C+P) ≥ λ_i(C) 对所有 i 成立?",
      np.all(np.linalg.eigvalsh(C + P) >= lam_full - 1e-12))

关键输出:

特异方差 d_i     : [0.0251 0.0256 0.0296 0.0342 0.046  0.0487 0.0549 0.0681]
Σ 的特征值 λ_i   : [0.0252 0.0287 0.0332 0.0428 0.0478 0.0538 0.0652 0.2491]
交错 d_i ≤ λ_i ≤ d_{i+1}? True
迹的增量 Σμ_i = 0.2134 = ‖b‖² = 0.2134

包含原理 λ_i(C) ≤ λ_i(C_sub) ≤ λ_(i+20)(C) 成立?True
条件数:全体 60 只 427.3,子集 40 只 276.2
λ_i(C+P) ≥ λ_i(C) 对所有 i 成立? True

读法:(1) 前 7 个特征值都被困在相邻的特异方差之间,只有最大特征值 0.249 "逃逸",远超最大特异方差 0.068;特征值增量之和恰为 \(\|b\|^2\)。这就是"一个市场因子 + 一堆像噪声的小特征值"的谱结构的来源。(2) 剔除 20 只资产后条件数从 427 降到 276,符合包含原理的预测:子矩阵的特征值范围被母矩阵的范围夹住。(3) 加入任何半正定矩阵(额外的特异风险、收缩目标的一部分)都只会抬高每个特征值。


本章小结

Hermitian(实对称)矩阵的特征值是实数、可被酉(正交)矩阵对角化,正定性等价于特征值为正;实情形必须先假设对称。本章的核心是一组特征值"夹逼"不等式,它们都用同一个模板证明:用子空间维数公式找到公共单位向量,再对它用 Rayleigh 商。Rayleigh 商刻画最大、最小特征值,Courant–Fischer 用极小极大刻画每一个特征值。Weyl 不等式给出加性扰动下特征值的移动范围,其中最常用的是 \(|\lambda_i(A+E)-\lambda_i(A)|\le\|E\|_2\)(有序特征值 1-Lipschitz)、秩 \(r\) 扰动只移动 \(r\) 个位置、半正定扰动只抬高特征值。加边和取主子矩阵产生交错(Cauchy、包含原理、Poincaré),Ky Fan 迹极值说明 PCA 子空间捕获的方差最多,并推出部分特征值和的凸凹性。优超把这些不等式提升到"整体分布"层面:特征值优超对角元(Schur),Fan 与 Lidskii 不等式给出和的特征值的整体界,优超等价于双随机平均。对量化而言,最重要的结论是:样本协方差的特征值误差受 \(\|S-\Sigma\|_2\) 控制,且大特征值系统性高估、小特征值系统性低估;因子模型只有 \(K\) 个特征值能逃离特异方差的范围;特征值裁剪和线性收缩都是保持总方差的"平均"操作,它们降低条件数并改善样本外风险。

概念 / 定理 公式 量化用途
特征值排序约定 \(\lambda_1\le\cdots\le\lambda_n\) 与 eigh 一致
谱定理 \(A=U\Lambda U^*\),\(\Lambda\) 实 PCA
正部 / 负部 \(A=A_+-A_-\) 修复非正定相关矩阵
有效秩 \(\operatorname{rank}A\ge(\operatorname{tr}A)^2/\operatorname{tr}A^2\) 有效因子数
Rayleigh 商 \(\lambda_1\le x^*Ax/x^*x\le\lambda_n\) 组合方差的范围
Courant–Fischer \(\lambda_k=\min_{\dim S=k}\max_{x\in S}R_A(x)\) 证明工具
Weyl \(\lambda_i(A)+\lambda_1(E)\le\lambda_i(A+E)\le\lambda_i(A)+\lambda_n(E)\) 估计误差的特征值界
秩 \(r\) 扰动 \(\lambda_{i-r}(A)\le\lambda_i(A+B)\le\lambda_{i+r}(A)\) 因子模型谱结构
单调性 \(B\succeq0\Rightarrow\lambda_i(A+B)\ge\lambda_i(A)\) 收缩、特异风险
Cauchy 交错 \(\lambda_i(A)\le\lambda_i(B)\le\lambda_{i+1}(A)\)(加边) 加入 / 剔除资产
包含原理 \(\lambda_i(A)\le\lambda_i(A_{[m]})\le\lambda_{i+n-m}(A)\) 子集条件数更小
Ky Fan \(\sum_{i>n-m}\lambda_i=\max_{V^*V=I}\operatorname{tr}V^*AV\) PCA 最优性、解释方差
凸凹性 最大 \(r\) 个之和凸,最小 \(r\) 个之和凹 样本特征值偏差方向
Schur 优超 \(\lambda(A)\) 优超 \(\operatorname{diag}A\) 主成分比资产更分散
优超 ⇔ 双随机 \(y=Sx\),\(S\) 双随机 特征值收缩
Lidskii \(\lambda(A-B)\) 优超 \(\lambda(A)^\downarrow-\lambda(B)^\downarrow\) 整体扰动界
迹不等式 \(\sum\lambda_i^\downarrow(A)\lambda_i^\uparrow(B)\le\operatorname{tr}AB\le\sum\lambda_i^\downarrow(A)\lambda_i^\downarrow(B)\) 风险的上下界

练习

基础

  1. 设 \(A\) 实对称,\(\lambda_{\min}(A)=-1\),\(\lambda_{\max}(A)=3\)。对单位向量 \(x\),\(x^TAx\) 可能取哪些值?\(a_{11}\) 可能取哪些值?若 \(a_{11}=3\),第一行还能有非零的非对角元吗? 答案要点:\([-1,3]\);\(a_{11}\in[-1,3]\);不能(习题 4.3.P6:对角元等于极端特征值时,该行该列的非对角元全为零)。
  2. 构造一个 \(2\times2\) 实矩阵 \(A\),使 \(x^TAx>0\) 对所有非零实 \(x\) 成立,但 \(A\) 有非实特征值。这说明了什么? 提示:\(\begin{bmatrix}1&1\\-1&1\end{bmatrix}\)。实情形定义正定必须先要求对称。
  3. 设 \(\Sigma\succ0\) 是 \(n\) 只资产的协方差矩阵,\(P\succeq0\)。不计算特征值,比较 \(\Sigma\) 与 \(\Sigma+P\) 的条件数会怎样变化?若 \(P=cI\) 呢? 答案要点:一般无法确定(\(\lambda_{\max}\) 和 \(\lambda_{\min}\) 都可能变大);\(P=cI\) 时条件数 \(\frac{\lambda_n+c}{\lambda_1+c}\) 严格减小(若原来大于 1)。
  4. 单因子模型 \(\Sigma=D+bb^T\),\(D=\operatorname{diag}(0.01,0.02,0.04)\)。不计算,给出 \(\Sigma\) 三个特征值所在的区间。若已知 \(\|b\|^2=0.1\),最大特征值至少是多少? 答案要点:\(\lambda_1\in[0.01,0.02]\),\(\lambda_2\in[0.02,0.04]\),\(\lambda_3\ge0.04\);由迹 \(\lambda_3=0.07+0.1-\lambda_1-\lambda_2\ge0.17-0.06=0.11\)。
  5. 判断:\((5,2,2,1)\) 是否优超 \((3,3,2,2)\)?\((4,4,1,1)\) 是否优超 \((3,3,3,1)\)?能否构造一个 \(4\times4\) 实对称矩阵,特征值为第一个向量、对角元为第二个向量? 答案要点:第一对:部分和 \(5\ge3\),\(7\ge6\),\(9\ge8\),总和 \(10=10\),是;第二对:\(4\ge3\),\(8\ge6\),\(9\ge9\),\(10=10\),是。由 Schur–Horn 逆定理,可以构造。

进阶

  1. 用 Courant–Fischer 证明:对任意 Hermitian \(A,E\),\(\lambda_k(A+E)\le\lambda_k(A)+\lambda_{\max}(E)\)。再说明为什么这条不等式在 \(A,E\) 不是 Hermitian 时可以失败。 提示:在 (4.2.7) 中,每个 Rayleigh 商满足 \(R_{A+E}(x)\le R_A(x)+\lambda_{\max}(E)\);反例见习题 4.3.P2。
  2. 设 \(S\) 是样本协方差,\(\Sigma=\mathbb ES\)。证明 \(\mathbb E[\lambda_{\max}(S)]\ge\lambda_{\max}(\Sigma)\)、\(\mathbb E[\lambda_{\min}(S)]\le\lambda_{\min}(\Sigma)\)。这对最小方差组合意味着什么? 提示:\(\lambda_{\max}\) 是凸函数(Ky Fan,\(r=1\)),\(\lambda_{\min}\) 是凹函数,用 Jensen 不等式。最小方差组合往估计出的低风险方向集中,那里的风险被系统性低估。
  3. 设 \(A=\begin{bmatrix}B&C\\C^T&D\end{bmatrix}\) 是相关矩阵,\(B\) 是前 \(m\) 只资产的相关矩阵。证明 \(\kappa_2(B)\le\kappa_2(A)\),并说明等号何时可能成立。 提示:包含原理 \(i=1\) 与 \(i=m\)。
  4. 设 \(x\) 的分量是某组合在 \(n\) 只股票上的权重绝对值(和为 1)。证明集中度指标 \(H(x)=\sum x_i^2\)(Herfindahl 指数)在优超意义下单调:若 \(x\) 优超 \(y\),则 \(H(x)\ge H(y)\)。 提示:\(y=Sx\),\(S\) 双随机,写成置换矩阵的凸组合,用 \(\|\cdot\|_2^2\) 的凸性。
  5. 编程:取 \(N=200\),\(T\) 分别为 \(100,400,1600\),\(\Sigma=I\),模拟样本协方差的最大、最小特征值,与 MP 边界 \((1\pm\sqrt{N/T})^2\) 比较(\(T<N\) 时最小特征值为 0,此时比较最小非零特征值)。用 Weyl 不等式解释为何 \(T\) 增大时 \(\|S-I\|_2\) 下降。 答案要点:\(q=2,0.5,0.125\) 时上边界约 \(5.83,2.91,1.83\);\(\|S-I\|_2\approx2\sqrt q+q\)。

原书推荐习题

  • 4.1.P5(三对角矩阵的对称化)、4.1.P13(\(\operatorname{rank}A\ge(\operatorname{tr}A)^2/\operatorname{tr}A^2\),有效秩)、4.1.P21(\(xy^*+yx^*\) 的特征值)、4.1.P30(主子式的符号)。
  • 4.2.P3(对角元介于极端特征值之间)、4.2.P8(半正定扰动的单调性)。
  • 4.3.P1(最简单的扰动定理)、4.3.P4(Loewner 序保持特征值序)、4.3.P5(Sylvester 判据与 Jacobi 符号规则)、4.3.P14(部分特征值和的凸凹性)、4.3.P15(行列式的 Poincaré 型界)、4.3.P17(Jacobi 矩阵与 Sturm 序列)、4.3.P19(秩一扰动的特征值增量之和)、4.3.P24(Lidskii 的差形式)。

原书对照

本章小节 原书小节 书页 PDF 页
4a.1 为什么单独研究 Hermitian 矩阵 4.0 Introduction 225–227 245–247
4a.2 Hermitian 矩阵的基本性质 4.1 Properties and characterizations of Hermitian matrices(含习题) 227–234 247–254
4a.3 Rayleigh 商与 Courant–Fischer 4.2 Variational characterizations and subspace intersections(含习题) 234–239 254–259
4a.4 Weyl 不等式 4.3 Eigenvalue inequalities for Hermitian matrices(Weyl 部分) 239–243 259–263
4a.5 交错定理与包含原理 4.3(交错、包含原理、Poincaré、Ky Fan) 242–248 262–268
4a.6 优超 4.3(优超、Schur–Horn、迹不等式)及习题 4.3 248–260 268–280

延伸阅读:优超的系统论述见 Marshall–Olkin《Inequalities: Theory of Majorization》;Weyl、Fan、Lidskii 与 Horn 不等式的统一见 Bhatia《Matrix Analysis》(2001 年版本中的 Horn 猜想综述)。第 04b 章继续第 4 章后半:合同变换下保持不变的量(惯性)、两个二次型的同时对角化(广义特征值问题)。