量化交易中文教材

附录 A 背景材料:分析、几何与线性代数速查

原书附录 A 汇集了全书用到的分析、拓扑、可行集几何和数值线性代数基础。线性代数的系统讲解见第 01 册(Horn & Johnson),本附录只按"读本册时需要回查什么"整理,重点放在优化算法里反复出现的工具:方向导数、中值定理与 Taylor 定理、隐函数定理、切锥与法锥、矩阵分解、Sherman–Morrison–Woodbury 公式、条件数与浮点误差。

学习目标

  1. 能快速回查收敛、极限点、开闭集、紧性、相对内部等拓扑概念,以及 \(O(\cdot)\)、\(o(\cdot)\)、\(\Theta(\cdot)\) 记号。
  2. 会计算可微与不可微函数(如 \(\|x\|_1\))的方向导数,会用中值定理和二阶 Taylor 定理。
  3. 理解切锥、法锥的定义,以及它们与约束规范的关系(第 12 章)。
  4. 掌握 LU、Cholesky、QR 三种分解的用途、代价和稳定性,会用 QR 构造零空间基。
  5. 会用 Sherman–Morrison–Woodbury 公式处理"对角 + 低秩"矩阵(因子模型协方差),理解条件数、单位舍入、数值抵消。

读前导读

这个附录在解决什么问题。 它不是要从头读的一章,而是一本"查字典":读正文遇到"极限点""Lipschitz""切锥""条件数""Woodbury 公式"等词卡住时,翻到这里查定义和一个小例子。对你最有实用价值的是 A.2.4 和 A.3:因子模型协方差 \(\Sigma=D+BFB^T\)(Barra 那一类)求逆时,用 Woodbury 公式可以把几千维的求逆变成几十维,这是组合优化提速的常用技巧。

需要先想起来的数学。

  • 量词读法。 \(\forall\) 读作"对所有",\(\exists\) 读作"存在"。"\(\forall\epsilon>0,\exists K\)"是一场对赌:你随便给一个误差容忍度 \(\epsilon\),我总能找到一个时点 \(K\),此后序列都落在容忍度之内。见 第 00 册第 08 章 读懂数学证明与符号 和 第 01 章 函数极限与连续。
  • 泰勒展开。 \(f(x+p)\approx f(x)+\nabla f^Tp+\frac12p^T\nabla^2fp\),与债券价格的"久期 + 凸性"近似同一形式。A.1.2 的中值定理和 Taylor 定理是它的精确版本:把"≈"换成"=",代价是导数要在某个中间点 \(x+\alpha p\) 取值。见 第 00 册第 02 章、第 05 章。
  • 矩阵求逆与分解。 解 \(Ax=b\) 时实际做法是把 \(A\) 分解成三角矩阵再回代,而不是先算 \(A^{-1}\)。见 第 00 册第 06 章 线性代数速成。
  • 大 O 与小 o。 \(O(h)\) 是"至多与 \(h\) 同阶",\(o(h)\) 是"比 \(h\) 高阶的小量"。见 第 00 册第 07 章。

怎么读。 第一次只需通读 A.1.2(方向导数、Taylor 定理)、A.2.1(条件数)、A.2.4(Woodbury)和 A.3 的代码。A.1.1、A.1.3、A.1.4 和 A.2.3、A.2.5 在正文引用时再回查即可;A.1.4 的切锥、法锥是第 12 章约束规范的背景,抽象程度最高,可以最后读。


A.1 拓扑与分析

A.1.1 序列与集合

  • 收敛:\(x_k\to x\) 指 \(\forall\epsilon>0\),\(\exists K\),\(k\ge K\) 时 \(\|x_k-x\|\le\epsilon\)。例:\(x_k=(1-2^{-k},1/k^2)\to(1,0)\)。
  • 极限点(聚点):存在子列收敛到 \(\hat x\)。例:序列 \((1,1),(\frac12,\frac12),(1,1),(\frac14,\frac14),\dots\) 恰有两个极限点 \((0,0)\) 和 \((1,1)\);\(x_k=\sin k\) 以 \([-1,1]\) 中每一点为极限点。实数列的 \(\liminf\)、\(\limsup\) 是最小、最大的极限点。

    优化的收敛定理常说"迭代序列的每个极限点都是驻点",而不是"序列收敛"。这是因为序列可能在几个驻点之间来回而不收敛。

  • 开集:每点有一个小球含于集合中;闭集:包含自身所有序列的极限点。\((0,1]\) 既不开也不闭。内部 \(\mathrm{int}F\) 是最大开子集,闭包 \(\mathrm{cl}F\) 是最小闭超集。
  • 紧集:\(\mathbb R^n\) 中有界闭集。连续函数在紧集上取得最小值——这是"可行域有界闭、目标连续 ⇒ 最优解存在"的依据。
  • 锥:\(x\in F\Rightarrow\alpha x\in F\),\(\forall\alpha\ge0\)。
  • 仿射包与相对内部:\(\mathrm{ri}F\) 是相对于 \(\mathrm{aff}F\) 的内部。例:\(\{x_1,x_2\in[0,1],x_3=0\}\) 在 \(\mathbb R^3\) 中内部为空,但相对内部是 \(\{x_1,x_2\in(0,1),x_3=0\}\)。凸分析中的许多定理(如 Slater 条件)用的是相对内部。

A.1.2 连续、Lipschitz 与导数

  • Lipschitz 连续:\(\|f(x_1)-f(x_0)\|\le M\|x_1-x_0\|\)。优化收敛理论常假设梯度或 Hessian Lipschitz 连续(例如牛顿法、SQP 的二次收敛定理)。
  • 方向导数:
\[ D(f(x);p)=\lim_{\epsilon\to0}\frac{f(x+\epsilon p)-f(x)}\epsilon,\tag{A.14} \]

可微时等于 \(\nabla f(x)^Tp\)。不可微函数也可能处处有方向导数,最重要的例子是

\[ D(\|x\|_1;p)=-\sum_{x_i<0}p_i+\sum_{x_i>0}p_i+\sum_{x_i=0}|p_i|. \]

第 18 章分析 \(\ell_1\) 价值函数的下降性(引理 18.2)正是用这个公式。

推导拆解:逐个分量看 \(|x_i+\epsilon p_i|\) 在 \(\epsilon\) 很小时的变化。\(x_i>0\) 时绝对值号可以直接去掉,变化率是 \(p_i\);\(x_i<0\) 时 \(|x_i+\epsilon p_i|=-(x_i+\epsilon p_i)\),变化率是 \(-p_i\);\(x_i=0\) 时 \(|\epsilon p_i|=\epsilon|p_i|\)(\(\epsilon>0\)),变化率是 \(|p_i|\),无论往哪边走都增加,这正是"尖角"的表现。例:\(x=(2,0)\)、\(p=(-1,3)\),\(D(\|x\|_1;p)=-1+3=2\)。对应到组合上,\(\|w-w_0\|_1\) 是换手率,已经调过的仓位按方向增减,没动过的仓位(\(w_i=w_{0,i}\))无论买卖都增加换手。注意公式中极限要取 \(\epsilon\downarrow0\)(单侧),否则 \(x_i=0\) 处极限不存在。

  • 中值定理:\(f(x+p)=f(x)+\nabla f(x+\alpha p)^Tp\),\(\alpha\in(0,1)\)(A.18)。例 A.2:\(f=x_1^3+3x_1x_2^2\),\(x=0\),\(p=(1,2)\),\(f(x+p)=13\),\(\nabla f(\alpha p)^Tp=39\alpha^2\),取 \(\alpha=1/\sqrt{13}\) 成立。
  • 二阶 Taylor 定理:\(f(x+p)=f(x)+\nabla f(x)^Tp+\frac12p^T\nabla^2f(x+\alpha p)p\)(A.19)。全书的二次模型都建立在它上面。
  • 积分形式:\(\nabla f(x+p)=\nabla f(x)+\int_0^1\nabla^2f(x+tp)p\,dt\)。拟牛顿法的割线方程(第 08 章)和第 18 章的"平均 Hessian" (18.43) 都来自这里。

A.1.3 隐函数定理

定理 A.1:设 \(h:\mathbb R^n\times\mathbb R^m\to\mathbb R^n\) 满足 (i) \(h(z^*,0)=0\);(ii) 在 \((z^*,0)\) 附近 Lipschitz 连续可微;(iii) \(\nabla_zh(z^*,0)\) 非奇异。则方程 \(h(z(t),t)=0\) 在原点附近唯一确定一个 Lipschitz 连续的 \(z(t)\)。

常见用法:参数化线性系统 \(M(t)z=g(t)\),若 \(M(0)\) 非奇异,则 \(z(t)=M(t)^{-1}g(t)\) 在 0 附近 Lipschitz 连续。第 17 章"障碍法极小点 \(x(\mu)\) 是 \(\mu\) 的光滑函数"(定理 17.4)、第 13 章敏感性分析都是它的应用。

A.1.4 可行集的几何:切锥与法锥

可行集 \(\Omega=\{x:c_i(x)=0,\ i\in\mathcal E;\ c_i(x)\ge0,\ i\in\mathcal I\}\)。纯几何视角把问题写成 \(\min f\) s.t. \(x\in\Omega\),可以避开代数描述带来的冗余、线性相关等麻烦,但多数算法和软件仍需要代数描述。

  • 切向量(Clarke):\(w\) 是 \(\Omega\) 在 \(x\) 处的切向量,若对所有 \(x_i\to x\)(\(x_i\in\Omega\))和所有 \(t_i\downarrow0\),存在 \(w_i\to w\) 使 \(x_i+t_iw_i\in\Omega\)。全体切向量构成切锥 \(T_\Omega(x)\)。
  • 法锥:\(N_\Omega(x)=\{v:v^Tw\le0,\ \forall w\in T_\Omega(x)\}\)(A.22)。
  • 例:单个等式 \(h(x)=0\),\(\nabla h(x)\ne0\) 时,\(T=\mathrm{Null}(\nabla h(x)^T)\),\(N=\mathrm{Range}(\nabla h(x))\)。
  • 例:\(\Omega=\{x_2\ge0,\ x_2\le x_1^3\}\) 在原点处 \(T=\{(w_1,0):w_1\ge0\}\),\(N=\{v:v_1\le0\}\)。而按约束梯度线性化得到的锥是 \(\{w:w_2\ge0,\ w_2\le0\}=\{(w_1,0)\}\),比切锥大——这是 LICQ 不成立、几何与代数描述不一致的典型例子,也说明为什么第 12 章的 KKT 定理需要约束规范。

一阶最优性的几何形式是:\(-\nabla f(x^*)\in N_\Omega(x^*)\)。

白话解释:切锥是"从 \(x\) 出发、仍留在可行集里能走的方向";法锥是"与所有可行方向夹角都不小于 90° 的方向"。\(-\nabla f\) 是目标下降最快的方向。\(-\nabla f(x^*)\in N_\Omega(x^*)\) 的意思是:最速下降方向与每个可行方向都成钝角或直角,所以沿任何可行方向走,目标一阶上都不会下降。金融例子:长仓约束下某资产权重为 0、它的边际效用为负,想"卖空它"改进目标,但卖空方向不可行——此时负梯度指向可行集外,落在法锥里,这个零权重就是最优的。KKT 条件就是把"在法锥里"用约束梯度和非负乘子代数地写出来。

A.1.5 阶记号与标量求根

对非负序列:\(\eta_k=O(\nu_k)\) 指 \(|\eta_k|\le C|\nu_k|\);\(\eta_k=o(\nu_k)\) 指 \(\eta_k/\nu_k\to0\);\(\eta_k=\Theta(\nu_k)\) 指两边同阶。\(O(1)\) 表示有界,\(o(1)\) 表示趋于零。

标量方程 \(F(x)=0\) 的牛顿法 \(x_{k+1}=x_k-F(x_k)/F'(x_k)\) 与割线法 \(B_k=\frac{F(x_k)-F(x_{k-1})}{x_k-x_{k-1}}\)(Broyden 方法在 \(n=1\) 的特例)在信赖域子问题(求 \(\lambda\) 使 \(\|p(\lambda)\|=\Delta\))中用到。


A.2 线性代数

A.2.1 范数与条件数

  • 向量范数 \(\|x\|_1,\|x\|_2,\|x\|_\infty\),等价关系 \(\|x\|_\infty\le\|x\|_2\le\sqrt n\|x\|_\infty\),\(\|x\|_\infty\le\|x\|_1\le n\|x\|_\infty\)。
  • 诱导矩阵范数:\(\|A\|_1\) 为最大列和,\(\|A\|_\infty\) 为最大行和,\(\|A\|_2=\sigma_{\max}(A)\)。Frobenius 范数 \(\|A\|_F=(\sum a_{ij}^2)^{1/2}\)。
  • 条件数 \(\kappa(A)=\|A\|\|A^{-1}\|\)。线性系统的扰动界
\[ \frac{\|x-\tilde x\|}{\|x\|}\approx\kappa(A)\Big(\frac{\|A-\tilde A\|}{\|A\|}+\frac{\|b-\tilde b\|}{\|b\|}\Big). \]

金融直觉:条件数是"输入误差的放大倍数"。均值–方差的无约束最优权重 \(w\propto\Sigma^{-1}\alpha\):若 \(\kappa(\Sigma)=100\),\(\alpha\) 估计里 1% 的相对误差,最坏可让权重产生约 \(100\times1\%=100\%\) 的相对变化;股票协方差矩阵的 \(\kappa\) 常达 \(10^3\)–\(10^4\),放大更严重。这就是"均值–方差优化是误差放大器"(Michaud)的数学根源;协方差收缩(如 Ledoit–Wolf)通过把小特征值抬高来降低 \(\kappa\)。\(\sigma_1,\sigma_n\) 是最大、最小奇异值,对称正定矩阵的奇异值就是特征值。

  • 对称正定矩阵:\(\sigma_n\|x\|^2\le x^TAx\le\sigma_1\|x\|^2\),\(\|A^{-1}\|_2=1/\sigma_n\)。
  • 迹与行列式:\(\mathrm{tr}A=\sum\lambda_i\),\(\det A=\prod\lambda_i\)(第 08 章 BFGS 收敛分析的势函数 \(\mathrm{tr}B-\ln\det B\) 用到)。

A.2.2 子空间与线性代数基本定理

\(\{w:a_i^Tw=0\}\) 是子空间,\(\{w:a_i^Tw\ge0\}\) 一般不是(它是锥)。线性代数基本定理:\(\mathrm{Null}(A)\oplus\mathrm{Range}(A^T)=\mathbb R^n\)。零空间法(第 15、16、18 章)把步分解为 \(p=Yp_Y+Zp_Z\) 正是基于这一分解;第 17 章定理 17.5 的证明也用它把 \(u\) 拆成 \(w+A^Tv\)。

A.2.3 矩阵分解

分解 形式 适用 稠密代价 稳定性
LU(部分主元) \(PA=LU\) 一般方阵 \(\approx\frac23n^3\) 理论上增长因子可达 \(2^{n-1}\),实践中稳定
Cholesky \(A=LL^T\) 对称正定 \(\approx\frac13n^3\) 无需换行即稳定
QR(列主元) \(AP=QR\) 最小二乘、零空间基、秩判断 约为 LU 的 2 倍 稳定;稀疏时 \(Q\)、\(R\) 常稠密
\(LBL^T\) \(P^TKP=LBL^T\) 对称不定(KKT 矩阵) 约为 LU 的一半 带 Bunch–Kaufman 主元时稳定,可读出惯性

几个要点:

  • 不选主元的 Gauss 消元不稳定,连良态的 \(\begin{bmatrix}0&1\\1&2\end{bmatrix}\) 都分解不了。
  • 零空间基:对 \(A^T\)(\(m<n\),行满秩)做 QR,\(A^TP=[Q_1\ Q_2]R\),\(Q_2\) 的列是 \(A\) 零空间的标准正交基(第 15 章 (15.20));也可以用 LU:\(PA^T=\begin{bmatrix}L_1\\L_2\end{bmatrix}U\),零空间由 \(P^T\begin{bmatrix}L_1^{-T}L_2^T\\-I\end{bmatrix}U^{-T}\) 张成(A.52),更便宜但不正交。
  • 列满秩时 \(R^T\) 就是 \(P^TA^TAP\) 的 Cholesky 因子,所以 \(\|A\|_2=\|R\|_2\),可以用三角阵 \(R\) 估计条件数。
  • 解方程从不显式求逆,而是分解后做三角回代。

A.2.4 Sherman–Morrison–Woodbury 公式

秩一更新:

\[ (A+ab^T)^{-1}=A^{-1}-\frac{A^{-1}ab^TA^{-1}}{1+b^TA^{-1}a}.\tag{A.55} \]

秩 \(p\) 更新(\(U,V\in\mathbb R^{n\times p}\)):

\[ (A+UV^T)^{-1}=A^{-1}-A^{-1}U(I+V^TA^{-1}U)^{-1}V^TA^{-1}.\tag{A.56} \]

解 \((A+UV^T)x=d\) 只需用 \(A\) 解 \(p+1\) 个系统并求一个 \(p\times p\) 矩阵的逆,\(p\ll n\) 时非常便宜。

金融直觉:因子模型 \(\Sigma=D+BFB^T\) 中,\(D\) 是特质方差(对角),\(B\) 是 \(n\times k\) 的因子暴露,\(F\) 是 \(k\times k\) 因子协方差。取 \(A=D\)、\(U=BF\)、\(V=B\) 代入 (A.56):\(D^{-1}\) 只是把对角元取倒数,唯一需要真正求逆的是 \(k\times k\) 的 \(I+B^TD^{-1}BF\)。以 \(n=3000\) 只股票、\(k=40\) 个因子为例,直接分解 \(\Sigma\) 约需 \(\frac13n^3\approx9\times10^9\) 次运算,Woodbury 只需约 \(nk^2\approx5\times10^6\) 次,快上千倍,而且不用存储 \(3000\times3000\) 的稠密矩阵。秩一公式 (A.55) 的典型用途是"增加一只股票/一个约束后快速更新逆矩阵"。本册中的用途:BFGS/SR1 的逆形式(第 08 章)、单纯形法的最陡边递推(第 13 章)、因子模型协方差的快速求解(下面的代码)。

特征值交错定理(定理 A.2):\(A\) 对称,\(\|z\|=1\),\(A+\alpha zz^T\) 的特征值与 \(A\) 的特征值交错,总调整量 \(\sum(\xi_i-\lambda_i)=\alpha\)。秩一修正最多把每个特征值移动到相邻特征值的位置。

A.2.5 浮点运算与数值稳定性

  • 双精度的单位舍入 \(u=2^{-53}\approx1.1\times10^{-16}\),\(\mathrm{fl}(x)=x(1+\epsilon)\),\(|\epsilon|\le u\)。
  • 数值抵消(cancellation):两个相近的大数相减,相对误差约 \(2u|x|/|x-y|\),可能很大。若两数各有 \(k\) 位精度、前 \(\bar k\) 位相同,差只剩约 \(k-\bar k\) 位有效数字。第 15 章简单消元的不稳定、有限差分步长的选择都与此有关。
  • 条件 vs 稳定性:条件是问题的性质(数据小扰动是否导致解大变化),稳定性是算法的性质(对良态问题能否给出准确答案)。病态问题上,再稳定的算法也无能为力;稳定的算法在良态问题上给出的误差约为 \(\kappa(A)u\)。

A.3 量化实战:因子模型协方差的快速求解与病态

A.3.1 在哪里用

  • 因子模型:\(\Sigma=D+BFB^T\),\(D\) 为特质方差对角阵,\(B\) 为 \(n\times k\) 暴露矩阵(\(k\ll n\))。均值–方差无约束解 \(w\propto\Sigma^{-1}\alpha\)、值空间法中的 \(\Sigma^{-1}A^T\)、风险贡献计算都需要对 \(\Sigma\) 求解。用 (A.56)(\(U=BF\),\(V=B\))可把 \(O(n^3)\) 降到 \(O(nk^2)\)。
  • 病态的来源:两个高度共线的因子、几乎相同的两只股票(同一公司的 A/H 股、ETF 与其主要成分)、样本数少于资产数的样本协方差,都会使 \(\Sigma\) 病态,优化结果对输入极其敏感——这是做协方差收缩、合并共线因子的数值原因。

A.3.2 代码:Woodbury 公式与条件数

import numpy as np, time

rng = np.random.default_rng(0)
n, k = 3000, 10                                   # 3000 只股票,10 个因子
Bx = rng.standard_normal((n, k)) * 0.1            # 因子暴露
F = np.diag(rng.uniform(0.01, 0.04, k))           # 因子协方差
D = rng.uniform(0.01, 0.09, n)                    # 特质方差(对角)
alpha = rng.standard_normal(n) * 0.02

# 目标:解 Σ x = α,Σ = D + B F B^T(例如均值-方差无约束最优 w ∝ Σ^{-1} α)
t0 = time.perf_counter()
Sigma = np.diag(D) + Bx @ F @ Bx.T
x_direct = np.linalg.solve(Sigma, alpha)
t_direct = time.perf_counter() - t0

# Sherman–Morrison–Woodbury (A.56):U = B F, V = B
t0 = time.perf_counter()
Dinv_a = alpha / D
Dinv_U = (Bx @ F) / D[:, None]
small = np.eye(k) + Bx.T @ Dinv_U                 # k×k
x_smw = Dinv_a - Dinv_U @ np.linalg.solve(small, Bx.T @ Dinv_a)
t_smw = time.perf_counter() - t0
print(f"直接法 {t_direct:.3f}s,SMW {t_smw:.4f}s,相对差 {np.linalg.norm(x_smw-x_direct)/np.linalg.norm(x_direct):.1e}")

# 条件数与扰动:两个几乎共线的因子
A1 = np.array([[1, 2], [1, 1.]]); A2 = np.array([[1.00001, 1], [1, 1.]])
for A, b, db in [(A1, [3, 2], [3.00001, 2]), (A2, [2.00001, 2], [2, 2])]:
    print(f"cond={np.linalg.cond(A):9.1f}  x={np.linalg.solve(A, b).round(5)}  扰动后 x={np.linalg.solve(A, db).round(5)}")

输出:

直接法 0.074s,SMW 0.0002s,相对差 3.1e-15
cond=      6.9  x=[1. 1.]  扰动后 x=[0.99999 1.00001]
cond= 400002.0  x=[1. 1.]  扰动后 x=[0. 2.]

3000 只股票、10 个因子时,Woodbury 公式比直接求解快几百倍,结果一致到机器精度(具体用时随机器而异,比例随 \(n\) 增大而增大)。第二部分复现了原书的条件数例子:良态系统(\(\kappa\approx7\))上右端扰动 \(10^{-5}\),解只变化 \(10^{-5}\);病态系统(\(\kappa\approx4\times10^5\))上同样大小的扰动让解从 \((1,1)\) 跳到 \((0,2)\)。把它读成"两个几乎相同的资产":协方差估计的微小变化就能让最优组合在两者之间整体切换。


本附录小结

优化理论用到的分析工具主要是:极限点与紧性(存在性与收敛定理的表述)、方向导数(包括 \(\ell_1\) 范数这种不可微函数)、中值定理与 Taylor 定理(二次模型与割线方程)、隐函数定理(解对参数的光滑依赖)、切锥与法锥(最优性的几何形式与约束规范)。数值线性代数方面,LU、Cholesky、QR、\(LBL^T\) 分别对应一般方阵、对称正定、最小二乘与零空间、KKT 矩阵;Sherman–Morrison–Woodbury 公式让"对角 + 低秩"的因子模型协方差可以以 \(O(nk^2)\) 求解;条件数刻画问题的敏感性,单位舍入和数值抵消决定了算法能达到的精度。

工具 要点 本册用途
方向导数 \(D(|x|_1;p)=\sum_{x_i>0}p_i-\sum_{x_i<0}p_i+\sum_{x_i=0}\vert p_i\vert \) \(\ell_1\) 价值函数(第 18 章)
Taylor 定理 \(f(x+p)=f+\nabla f^Tp+\frac12p^T\nabla^2f(x+\alpha p)p\) 所有二次模型
隐函数定理 \(\nabla_zh\) 非奇异 ⇒ \(z(t)\) 局部唯一、Lipschitz 中心路径、敏感性分析
切锥 / 法锥 \(-\nabla f(x^*)\in N_\Omega(x^*)\) 约束规范(第 12 章)
QR 零空间基 \(A^TP=[Q_1\ Q_2]R\),\(Z=Q_2\) 零空间法(第 15、16、18 章)
SMW \((A+UV^T)^{-1}=A^{-1}-A^{-1}U(I+V^TA^{-1}U)^{-1}V^TA^{-1}\) 拟牛顿、单纯形更新、因子模型
条件数 \(\kappa(A)=|A||A^{-1}|\),误差 \(\approx\kappa u\) 罚函数/障碍法病态、协方差病态

练习

  1. 用链式法则求 \(f=x_1^2+x_1x_2\)、\(x_1=\sin t_1+t_2^2\)、\(x_2=(t_1+t_2)^2\) 对 \(t\) 的梯度,并与直接代入后求导比较(原书例 A.1)。
  2. 证明 \(\|x\|_1\) 的方向导数公式;用它计算 \(x=(1,0,-2)\)、\(p=(1,-1,1)\) 时的方向导数。
  3. 对 \(\Omega=\{x_1\ge x_2^2,\ x_2\ge x_1^2\}\) 验证原点处 \(T_\Omega=\{w\ge0\}\),特别是 \((0,1)\) 为切向量:取 \(x_i=(1/i^2,1/i)\),\(t_i=1/i\),找出 \(w_i\to(0,1)\) 使 \(x_i+t_iw_i\in\Omega\)。 提示:需要 \(1/i^2+w_{i,1}/i\ge4/i^2\),可取 \(w_i=(3/i,1)\)。(精读笔记中记为 \((\frac1{3i},1)\),代入后不满足 \(x_1\ge x_2^2\),应为 \((3/i,1)\)。)
  4. 证明秩一 Sherman–Morrison 公式 (A.55),并说明 \(1+b^TA^{-1}a=0\) 时会发生什么。
  5. 对 A.3.2 的因子模型,用 Woodbury 公式写出计算全部风险贡献 \(w_i(\Sigma w)_i\) 的 \(O(nk)\) 方法(不形成 \(\Sigma\))。
  6. 构造两只相关系数为 \(\rho\) 的资产,计算协方差矩阵条件数随 \(\rho\to1\) 的变化,并用第 16a 章 16.7.2 节的 KKT 闭式解观察最小方差组合权重如何变化。

原书对照

本附录内容 原书位置 PDF 页码
A.1 拓扑、连续、导数、方向导数、中值定理、隐函数定理(定理 A.1)、可行集几何(切锥、法锥)、阶记号、标量求根 §A.1 Elements of Analysis, Geometry, Topology,式 (A.1)–(A.32) PDF p.593–609
A.2 范数、条件数、子空间、特征值与 SVD、LU/Cholesky/QR(算法 A.1–A.2)、Sherman–Morrison–Woodbury、特征值交错(定理 A.2)、浮点误差、条件与稳定性 §A.2 Elements of Linear Algebra,式 (A.33)–(A.60) PDF p.609–626

说明:原书 (A.7) 的单侧极限应为 \(-1\);QR 求解中应为 \(x=Pz\)(原文写 \(P^Tz\));QR 定义中"\(A\) is \(m\times m\) orthogonal"应为 \(Q\)。原书所称的 Hölder 不等式在 \(\ell_2\) 情形即 Cauchy–Schwarz 不等式。原书正文页码 = PDF 页码减 18(已用 PDF 页眉核对,第 17 章至附录均如此)。