量化交易中文教材

第 05 章 连续型随机变量

本章对应 Ross 第 5 章。价格、收益率、等待时间、违约时间都是连续取值的量。本章介绍密度函数、连续型的期望与方差,以及七个常见连续分布:均匀、正态、指数、伽马、Weibull、柯西、贝塔。对量化最重要的是三块:正态分布(标准化、VaR、二项的正态近似与样本量)、指数分布与风险率(等待时间与违约强度)、随机变量的变换(对数正态价格模型、概率积分变换)。

学习目标

  1. 理解概率密度函数的含义(密度不是概率),会由密度求概率、CDF、期望、方差,掌握连续版 LOTUS 与尾积分公式。
  2. 熟练运用正态分布:线性变换封闭、标准化、查 \(\Phi\) 表与对称性,能计算正态假设下的 VaR。
  3. 掌握 DeMoivre–Laplace 定理与连续性修正,能估计"检验微弱优势需要多少样本"。
  4. 掌握指数分布的无记忆性及其唯一性,理解风险率函数与生存函数的关系 \(\bar F(t)=\exp\{-\int_0^t\lambda(s)ds\}\)。
  5. 了解伽马(含 Erlang、卡方)、Weibull、柯西、贝塔分布的来历与均值方差。
  6. 会用 CDF 法和单调变换公式求随机变量函数的分布,理解对数正态模型与概率积分变换。
  7. 理解"非对称线性损失下最优决策是分位数"的连续版本。

读前导读

这一章在解决什么问题。 收益率、价格、违约时间都可以取连续的值。CFA 里你已经大量使用正态分布:查 \(z\) 表、算置信区间、用 \(\mu-2.33\sigma\) 算参数法 VaR、用对数正态描述股价。但 CFA 通常把这些当作"给定的公式"。本章从定义出发,把它们推出来。

本册比 CFA 深的地方在这一章最集中:

  • 期望用积分定义。 离散情形 \(E[X]=\sum x\,p(x)\);连续情形每一点的概率都是 0,只能用密度 \(f(x)\) 乘以宽度 \(dx\) 近似"落在 \(x\) 附近的概率",再把无穷多个小块加起来,于是 \(E[X]=\int x f(x)\,dx\)。第 04a 章的每条结论(LOTUS、方差公式、线性性)都有对应的积分版本。
  • 密度是 CDF 的导数。 CFA 里"正态曲线下面积 = 概率",这里给出精确关系:\(F(a)=\int_{-\infty}^af\),\(F'=f\)。这是微积分基本定理。
  • 随机变量的变换需要乘导数。 已知 \(X\) 的密度,求 \(Y=g(X)\) 的密度,不能简单地"把 \(x\) 换成 \(g^{-1}(y)\)",还要乘 \(|dg^{-1}/dy|\)。原因是变换会把区间拉伸或压缩,密度(单位长度上的概率)必须相应调整。对数正态价格密度里那个 \(1/y\) 就是这么来的。第 06b 章多元变换时,这个导数会变成雅可比行列式。
  • 风险率与生存函数。 信用风险里的"违约强度"、生存概率 \(e^{-\int\lambda}\),本章用导数和积分把它们讲清楚。

需要先想起来的数学。

  • 定积分与微积分基本定理。 \(\int_a^bf(x)\,dx\) 是曲线下面积;若 \(F'=f\),则 \(\int_a^bf=F(b)-F(a)\)。常用原函数:\(\int x^n dx=\frac{x^{n+1}}{n+1}\),\(\int e^{-\lambda x}dx=-\frac1\lambda e^{-\lambda x}\),\(\int\frac1x dx=\ln x\)。例:\(\int_0^1 2x\,dx=[x^2]_0^1=1\)。见 第 00 册第 03 章 积分。
  • 反常积分。 积分区间无穷时,\(\int_0^\infty f=\lim_{b\to\infty}\int_0^bf\)。例:\(\int_0^\infty\lambda e^{-\lambda x}dx=\lim_b(1-e^{-\lambda b})=1\)。连续复利贴现 \(\int_0^\infty e^{-rt}dt=1/r\)(永续年金)是同一回事。
  • 分部积分与换元。 分部积分 \(\int u\,dv=uv-\int v\,du\),用于求指数、正态的矩;换元 \(x=g(y)\) 时 \(dx=g'(y)dy\),用于标准化与变换公式。
  • 导数与链式法则。 \((e^{u(x)})'=e^{u}u'\),\((\ln u(x))'=u'/u\),\(\frac{d}{dy}F(h(y))=f(h(y))h'(y)\)。风险率公式和变换公式都靠链式法则。见 第 00 册第 02 章 导数与泰勒展开。
  • 二重积分、交换积分次序与极坐标。 尾积分公式要交换积分次序;正态归一化用极坐标,其中 \(dx\,dy=r\,dr\,d\theta\) 里的 \(r\) 就是极坐标变换的雅可比行列式。见 第 00 册第 05 章 多元微积分与优化。

怎么读这一章。 5.1、5.2(密度、期望、LOTUS)是地基,必须读懂。5.4 正态分布全节必读,例 4f(VaR)和例 4j(样本量)对量化最重要。5.5 指数分布与风险率必读,(5.4) 式是信用风险强度模型的核心。5.7 的单调变换公式与对数正态必读,它是第 06b 章雅可比方法的一维版本。可以先只看结论:正态归一化的极坐标证明、指数分布唯一性的证明、5.6 中 Weibull 和柯西分布、例 3d(Bertrand 悖论)。


5.1 密度函数

有些随机变量的取值是不可数的,比如火车到站时间、晶体管寿命。

定义 若存在定义在整个实轴上的非负函数 \(f\),使得对任意(可测)实数集 \(B\),

\[P\{X\in B\}=\int_Bf(x)\,dx,\tag{1.1}\]

则称 \(X\) 为连续型随机变量(continuous random variable),\(f\) 为其概率密度函数(probability density function, PDF)。

由定义可得:

  • 归一:\(\int_{-\infty}^\infty f(x)dx=1\);
  • 区间概率:\(P\{a\le X\le b\}=\int_a^bf(x)dx\),即密度曲线下的面积;
  • 令 \(a=b\) 得 \(P\{X=a\}=0\)。连续随机变量取任何固定值的概率都是 0,所以 \(P\{X<a\}=P\{X\le a\}=F(a)=\int_{-\infty}^af(x)dx\)。

CDF 与密度的关系:\(F(a)=\int_{-\infty}^af(x)dx\),求导得 \(F'(a)=f(a)\)——密度是 CDF 的导数。若 \(f\) 在 \(a\) 处连续,

\[P\Big\{a-\frac\varepsilon2\le X\le a+\frac\varepsilon2\Big\}\approx\varepsilon f(a).\]

\(f(a)\) 衡量 \(X\) 落在 \(a\) 附近的可能性大小。它本身不是概率,可以大于 1。

白话解释:密度是"每单位长度上的概率",像人口密度是"每平方公里的人数"。一个点上的人数是 0,但一块区域的人数 = 密度 × 面积。日收益率的标准差约 1%,正态密度峰值是 \(\frac{1}{\sqrt{2\pi}\times0.01}\approx40\),远大于 1,但它的含义是"收益落在 0 附近宽 0.1%(0.001)的区间里的概率约为 \(40\times0.001=4\%\)"。密度的数值依赖于单位:把收益从小数改成百分数,密度会缩小 100 倍,而概率不变。

例 1a \(f(x)=C(4x-2x^2)\),\(0<x<2\)。由 \(C[2x^2-2x^3/3]_0^2=1\) 得 \(C=3/8\);\(P\{X>1\}=\frac38\int_1^2(4x-2x^2)dx=\frac12\)。

例 1b(计算机寿命) \(f(x)=\lambda e^{-x/100}\),\(x\ge0\),归一化得 \(\lambda=1/100\)。\(P\{50<X<150\}=e^{-1/2}-e^{-3/2}\approx.383\),\(P\{X<100\}=1-e^{-1}\approx.632\)。

例 1c(电子管) \(f(x)=100/x^2\),\(x>100\)。一只管在 150 小时内需更换的概率为 \(100\int_{100}^{150}x^{-2}dx=1/3\);5 只中恰好 2 只需更换:\(\binom52(1/3)^2(2/3)^3=80/243\)。

例 1d(\(Y=2X\) 的密度) CDF 法:\(F_Y(a)=P\{2X\le a\}=F_X(a/2)\),求导得 \(f_Y(a)=\frac12f_X(a/2)\)。也可以用微元法:\(\varepsilon f_Y(a)\approx P\{a/2-\varepsilon/4\le X\le a/2+\varepsilon/4\}\approx\frac\varepsilon2f_X(a/2)\)。

5.2 期望与方差

由 \(f(x)dx\approx P\{x\le X\le x+dx\}\),自然地定义

\[E[X]=\int_{-\infty}^\infty xf(x)\,dx.\]

白话解释:把实轴切成宽度 \(\Delta x\) 的小格,第 \(k\) 格中点为 \(x_k\)。\(X\) 落在这一格的概率约为 \(f(x_k)\Delta x\),于是可以把 \(X\) 近似成一个离散变量,取值 \(x_k\)、概率 \(f(x_k)\Delta x\)。按第 04a 章离散期望的定义,\(E[X]\approx\sum_kx_kf(x_k)\Delta x\)。格子越切越细,这个和就趋于积分 \(\int xf(x)\,dx\)。所以积分定义不是新概念,只是"概率加权平均"在格子无限细时的极限。CFA 里你只对离散情景算过期望,连续分布的均值是直接给出的;这里就是它们背后的计算。 一个提醒:积分要收敛,期望才存在。5.6 节的柯西分布就是 \(\int|x|f(x)dx=\infty\) 的例子,此时"平均值"没有定义。 \(f(x)=2x\)(\(0\le x\le1\)),\(E[X]=\int_0^12x^2dx=2/3\)。

例 2b \(X\sim U(0,1)\),求 \(E[e^X]\)。先求 \(Y=e^X\) 的分布:\(1\le x\le e\) 时 \(F_Y(x)=P\{X\le\ln x\}=\ln x\),\(f_Y(x)=1/x\),\(E[Y]=\int_1^ex\cdot\frac1xdx=e-1\)。

命题 2.1(连续版 LOTUS) \(E[g(X)]=\int_{-\infty}^\infty g(x)f(x)dx\)。例 2b 可直接算 \(\int_0^1e^xdx=e-1\)。

引理 2.1(尾积分公式) 对非负随机变量 \(Y\),

\[E[Y]=\int_0^\infty P\{Y>y\}\,dy.\]

证明(连续情形):\(\int_0^\infty P\{Y>y\}dy=\int_0^\infty\int_y^\infty f_Y(x)dx\,dy\),交换积分次序得 \(\int_0^\infty\Big(\int_0^xdy\Big)f_Y(x)dx=\int_0^\infty xf_Y(x)dx\)。

推导拆解:

  1. 第一个等号:\(P\{Y>y\}=\int_y^\infty f_Y(x)dx\),即密度在 \(y\) 右边的面积。
  2. 交换次序:二重积分的积分区域是平面上 \(\{(x,y):0\le y\le x\}\) 这个三角形(\(y\) 从 0 到 \(\infty\),对每个 \(y\),\(x\) 从 \(y\) 到 \(\infty\))。换一种扫法:先固定 \(x\)(从 0 到 \(\infty\)),\(y\) 就从 0 到 \(x\)。被积函数 \(f_Y(x)\) 非负,所以交换次序合法。
  3. 内层 \(\int_0^xdy=x\),于是得到 \(\int_0^\infty xf_Y(x)dx=E[Y]\)。 离散版是第 04a 章练习 3 的 \(E[N]=\sum_{i\ge1}P\{N\ge i\}\)。 金融直觉:保险里"止损再保险"的纯保费 \(E[(L-d)^+]=\int_d^\infty P\{L>y\}dy\) 就是这个公式的直接应用:只需生存函数(超越概率曲线),不需要密度。

用它可以证明 LOTUS(\(g\ge0\) 时):

\[E[g(X)]=\int_0^\infty P\{g(X)>y\}dy=\int_0^\infty\int_{x:g(x)>y}f(x)dx\,dy=\int_{x:g(x)>0}\int_0^{g(x)}dy\,f(x)dx=\int g(x)f(x)dx.\]

例 2c(断棍) 长为 1 的棍子在 \(U\sim U(0,1)\) 处折断,求包含点 \(p\) 的那一段的期望长度。\(U<p\) 时那段长 \(1-U\),\(U>p\) 时长 \(U\),

\[E[L_p(U)]=\int_0^p(1-u)du+\int_p^1u\,du=\frac12+p(1-p).\]
总大于 1/2,\(p=1/2\) 时最大——又一个规模偏倚现象:包含某个固定点的那段倾向于更长。

例 2d(出发时间:分位数决策) 早到 \(s\) 分钟的成本为 \(cs\),迟到 \(s\) 分钟的成本为 \(ks\),路程时间 \(X\) 的密度为 \(f\)。提前 \(t\) 分钟出发,成本为

\[C_t(X)=\begin{cases}c(t-X),&X\le t\\k(X-t),&X\ge t\end{cases}\]
求导可得 \(\frac{d}{dt}E[C_t(X)]=(k+c)F(t)-k\),令其为 0,最优 \(t^*\) 满足

\[F(t^*)=\frac{k}{k+c}.\]

推导拆解:\(E[C_t(X)]=\int_0^tc(t-x)f(x)dx+\int_t^\infty k(x-t)f(x)dx\)。对 \(t\) 求导时,\(t\) 既出现在积分上下限,又出现在被积函数里。上下限处的被积函数值 \(c(t-t)f(t)\) 和 \(k(t-t)f(t)\) 都是 0,所以只剩对被积函数求导:第一项得 \(\int_0^tcf(x)dx=cF(t)\),第二项得 \(\int_t^\infty(-k)f(x)dx=-k[1-F(t)]\)。相加即 \((k+c)F(t)-k\)。 直观读法同报童问题:多提前一分钟出发,以概率 \(F(t)\) 本来就会早到,多付 \(c\);以概率 \(1-F(t)\) 本来会迟到,少付 \(k\)。边际成本为零处即最优。 这是第 04a 章报童问题的连续版本:在非对称线性损失下,最优决策是分位数。统计学里分位数回归的 pinball loss 就是这个结构;若损失对称(\(k=c\)),最优决策是中位数(原书习题 5.31:\(E|X-a|\) 在 \(a\) 为中位数时最小)。

方差的定义对任何类型的随机变量都相同:\(\mathrm{Var}(X)=E[(X-\mu)^2]=E[X^2]-(E[X])^2\),且 \(E[aX+b]=aE[X]+b\),\(\mathrm{Var}(aX+b)=a^2\mathrm{Var}(X)\)。

例 2e 例 2a 中 \(E[X^2]=\int_0^12x^3dx=1/2\),\(\mathrm{Var}(X)=1/2-4/9=1/18\)。

5.3 均匀分布

\((0,1)\) 上的均匀分布(uniform distribution):\(f(x)=1\)(\(0<x<1\)),对 \(0<a<b<1\) 有 \(P\{a\le X\le b\}=b-a\),概率等于子区间长度。一般 \((\alpha,\beta)\) 上:

\[f(x)=\frac1{\beta-\alpha}\ (\alpha<x<\beta),\qquad F(a)=\frac{a-\alpha}{\beta-\alpha}\ (\alpha<a<\beta).\]

例 3a \(E[X]=\frac{\alpha+\beta}2\),\(E[X^2]=\frac{\beta^2+\alpha\beta+\alpha^2}3\),

\[\mathrm{Var}(X)=\frac{(\beta-\alpha)^2}{12}.\]

例 3b \(X\sim U(0,10)\):\(P\{X<3\}=3/10\),\(P\{X>6\}=4/10\),\(P\{3<X<8\}=1/2\)。

例 3c(等车) 7:00 起每 15 分钟一班车,乘客到达时间在 7:00–7:30 均匀分布。等待少于 5 分钟需在 (10,15) 或 (25,30) 到达,概率 1/3;等待超过 10 分钟需在 (0,5) 或 (15,20) 到达,概率也是 1/3。

例 3d(Bertrand 悖论) 在圆内"随机"取一条弦,它比内接正三角形的边长更长的概率是多少?若"随机"指弦到圆心的距离 \(D\sim U(0,r)\),条件为 \(D<r/2\),答案 1/2;若"随机"指弦与过一端点切线的夹角 \(\theta\sim U(0°,180°)\),条件为 \(60°<\theta<120°\),答案 1/3。两种都可以由实际实验实现。**教训:"随机"必须指明概率模型。**量化里,"随机组合""随机进场"同样必须说明是怎么随机的。

5.4 正态分布

定义与基本性质

参数为 \(\mu,\sigma^2\) 的**正态(normal)**随机变量,密度为

\[f(x)=\frac1{\sqrt{2\pi}\,\sigma}e^{-(x-\mu)^2/2\sigma^2},\qquad-\infty<x<\infty.\]

钟形、关于 \(\mu\) 对称,拐点在 \(\mu\pm\sigma\);标准正态的峰值约为 0.399。De Moivre 在 1733 年为近似大 \(n\) 的二项概率而引入它,后来 Laplace 等人推广为中心极限定理(第 08 章)——这解释了为什么测量误差、身高等许多量近似正态。

归一化(极坐标技巧) 令 \(y=(x-\mu)/\sigma\),只需证 \(I=\int e^{-y^2/2}dy=\sqrt{2\pi}\)。

\[I^2=\iint e^{-(x^2+y^2)/2}dx\,dy=\int_0^{2\pi}\int_0^\infty e^{-r^2/2}r\,dr\,d\theta=2\pi.\]

推导拆解:\(e^{-y^2/2}\) 没有初等原函数,所以直接算 \(I\) 不行,要绕道算 \(I^2\)。

  1. \(I^2=I\cdot I\),把两个 \(I\) 的积分变量分别叫 \(x\) 和 \(y\),乘积写成二重积分,指数相加得 \(e^{-(x^2+y^2)/2}\)。
  2. 换成极坐标 \(x=r\cos\theta,\ y=r\sin\theta\):\(x^2+y^2=r^2\),而面积元 \(dx\,dy\) 变成 \(r\,dr\,d\theta\)。多出来的 \(r\) 是这个变换的雅可比行列式:离原点越远,同样的 \(dr\)、\(d\theta\) 围出的小块面积越大(周长与 \(r\) 成正比)。第 06b 章会系统讲它。
  3. 正是这个 \(r\) 让积分可做:\(\int_0^\infty e^{-r^2/2}r\,dr\),令 \(u=r^2/2\),\(du=r\,dr\),得 \(\int_0^\infty e^{-u}du=1\)。再对 \(\theta\) 积分得 \(2\pi\)。
  4. \(I^2=2\pi\),\(I>0\),所以 \(I=\sqrt{2\pi}\)。这就是正态密度里 \(\frac1{\sqrt{2\pi}}\) 的来源。

线性变换封闭 若 \(X\sim N(\mu,\sigma^2)\),则 \(Y=aX+b\sim N(a\mu+b,a^2\sigma^2)\)。证明(\(a>0\)):\(F_Y(x)=F_X((x-b)/a)\),求导即得 \(N(a\mu+b,a^2\sigma^2)\) 的密度。特别地

\[Z=\frac{X-\mu}{\sigma}\sim N(0,1),\]

称为标准正态(standard normal)。

例 4a(均值与方差) \(E[Z]=\frac1{\sqrt{2\pi}}\int xe^{-x^2/2}dx=0\)(奇函数);分部积分(\(u=x\),\(dv=xe^{-x^2/2}dx\))得 \(\mathrm{Var}(Z)=E[Z^2]=1\)。由 \(X=\mu+\sigma Z\),\(E[X]=\mu\),\(\mathrm{Var}(X)=\sigma^2\):正态分布的两个参数就是均值和方差。

标准正态 CDF

\[\Phi(x)=\frac1{\sqrt{2\pi}}\int_{-\infty}^xe^{-y^2/2}dy.\]

原书表 5.1 给出了 \(x=0.00\)–\(3.49\) 的 \(\Phi(x)\)。几个常用值:\(\Phi(1)=.8413\),\(\Phi(1.5)=.9332\),\(\Phi(1.645)\approx.95\),\(\Phi(1.96)=.9750\),\(\Phi(2)=.9772\),\(\Phi(2.33)\approx.99\),\(\Phi(2.5)=.9938\),\(\Phi(3)=.9987\)。由对称性

\[\Phi(-x)=1-\Phi(x).\tag{4.1}\]

一般正态:\(F_X(a)=\Phi\big(\frac{a-\mu}{\sigma}\big)\)。

例 4b \(\mu=3,\sigma^2=9\):(a) \(P\{2<X<5\}=\Phi(2/3)-\Phi(-1/3)=\Phi(2/3)-[1-\Phi(1/3)]\approx.3779\);(b) \(P\{X>0\}=P\{Z>-1\}=\Phi(1)\approx.8413\);(c) \(P\{|X-3|>6\}=P\{|Z|>2\}=2[1-\Phi(2)]\approx.0456\)。

例 4c(按曲线打分) 高于 \(\mu+\sigma\) 得 A(约 16%),\((\mu,\mu+\sigma)\) 得 B(约 34%),\((\mu-\sigma,\mu)\) 得 C(约 34%),\((\mu-2\sigma,\mu-\sigma)\) 得 D(约 14%),低于 \(\mu-2\sigma\) 得 F(约 2%)。也就是熟知的"68–95–99.7 规则":\(\pm1\sigma\) 内约 68%,\(\pm2\sigma\) 内约 95%,\(\pm3\sigma\) 内约 99.7%。

例 4d(亲子鉴定) 孕期 \(\sim N(270,100)\)(天)。被告在孩子出生前 290 天到 240 天之间不在国内;若他是父亲,孕期须 \(>290\) 或 \(<240\),概率 \(1-\Phi(2)+1-\Phi(3)\approx.0241\)。

例 4e(二进制信道) 发送 1 时送出信号 \(+2\),发送 0 时送出 \(-2\),接收到 \(R=x+N\),噪声 \(N\sim N(0,1)\);规则:\(R\ge.5\) 判为 1。\(P\{\text{错}\mid1\}=P\{N<-1.5\}=1-\Phi(1.5)\approx.0668\);\(P\{\text{错}\mid0\}=P\{N\ge2.5\}=1-\Phi(2.5)\approx.0062\)。阈值不对称导致两类错误率不同——第 03 册假设检验的两类错误就是这个结构。

风险价值(VaR)

例 4f(Value at Risk) 一项投资的 99% **风险价值(VaR)**定义为这样的 \(v\):损失超过 \(v\) 的概率只有 1%。若收益 \(X\sim N(\mu,\sigma^2)\),损失 \(-X\sim N(-\mu,\sigma^2)\),

\[0.01=P\{-X>v\}=1-\Phi\Big(\frac{v+\mu}{\sigma}\Big)\ \Rightarrow\ \frac{v+\mu}{\sigma}=2.33\ \Rightarrow\ \mathrm{VaR}=2.33\sigma-\mu.\]

因此在收益正态的投资中,VaR 最小的是 \(\mu-2.33\sigma\) 最大的那个。这是参数法 VaR 的原型;本章量化实战会说明厚尾时它为什么会低估风险。

二项分布的正态近似

DeMoivre–Laplace 极限定理 \(S_n\) 为 \(n\) 次独立试验(成功概率 \(p\))的成功数,则对任意 \(a<b\),当 \(n\to\infty\) 时

\[P\Big\{a\le\frac{S_n-np}{\sqrt{np(1-p)}}\le b\Big\}\to\Phi(b)-\Phi(a).\]

De Moivre 在 1733 年证明了 \(p=1/2\) 的情形,Laplace 在 1812 年推广到一般 \(p\)。它是中心极限定理的特例,这里不证。

两种近似的分工:泊松近似适合 \(n\) 大、\(p\) 小;正态近似在 \(np(1-p)\) 较大时好,经验上 \(np(1-p)\ge10\) 即可。

连续性修正(continuity correction):二项只取整数,用连续分布近似时把 \(P\{X=i\}\) 写成 \(P\{i-1/2<X<i+1/2\}\)。

例 4g 公平硬币抛 40 次,\(P\{X=20\}\):正态近似 \(P\{19.5<X<20.5\}=\Phi(.16)-\Phi(-.16)\approx.1272\);精确值 \(\binom{40}{20}2^{-40}\approx.1254\)。

例 4h(超额录取) 理想规模 150 人,录取 450 人,每人到校概率 .3 且独立。\(P\{X\ge150.5\}\approx1-\Phi\big(\frac{150.5-135}{\sqrt{450\cdot.3\cdot.7}}\big)=1-\Phi(1.59)\approx.0559\)。

例 4i(饮食实验:第一类错误) 100 人试新饮食,至少 65 人胆固醇降低才背书。若饮食无效,每人降低的概率为 1/2,\(P\{X\ge64.5\}=P\{Z\ge\frac{64.5-50}{5}=2.9\}\approx.0019\)。这就是假设检验中"无效却被判有效"的概率。

例 4j(抽样民调:样本量) 纽约市 52% 的居民赞成某提案,随机抽 \(n\) 人,样本中赞成者过半的概率是多少?总体远大于样本,近似为 \(\mathrm{Bin}(n,.52)\),再用正态近似:

\[P\{S_n>.5n\}\approx\Phi(.04\sqrt n).\]

\(n=11\) 时 \(\Phi(.1328)=.5528\);\(n=101\) 时 \(\Phi(.4020)=.6562\);\(n=1001\) 时 \(\Phi(1.2665)=.8973\)。要使这个概率至少为 .95,需要 \(.04\sqrt n>1.645\),即 \(n\ge1692\)。

推导拆解:\(S_n\) 均值 \(.52n\),标准差 \(\sqrt{n\cdot.52\cdot.48}\approx.4996\sqrt n\)。标准化:

\[P\{S_n>.5n\}=P\Big\{\frac{S_n-.52n}{.4996\sqrt n}>\frac{.5n-.52n}{.4996\sqrt n}\Big\}\approx P\{Z>-.04\sqrt n\}=\Phi(.04\sqrt n).\]
中间一步:\(\frac{-.02n}{.4996\sqrt n}=-.04\sqrt n\)(\(n/\sqrt n=\sqrt n\),\(.02/.4996\approx.04\));最后一步用对称性 (4.1)。 样本量公式的一般形式:优势 \(\delta=p-0.5\),要求 \(\frac{\delta\sqrt n}{\sigma}\ge z\),即 \(n\ge(z\sigma/\delta)^2\)。\(\delta\) 在分母上取平方,这就是"样本量与优势的平方成反比"。它和 CFA 里"标准误 \(=\sigma/\sqrt n\)"是同一件事:要让标准误小到能分辨 \(\delta\),\(\sqrt n\) 必须与 \(1/\delta\) 同阶。

这个例子对量化极其重要。把"赞成率 52%"换成"策略胜率 52%",结论是:要以 95% 的把握在样本中看到胜率过半,大约需要 1700 笔交易。所需样本量与优势的平方成反比:优势减半,样本量要乘 4。

5.5 指数分布与风险率

定义与无记忆性

参数 \(\lambda>0\) 的指数分布(exponential distribution):

\[f(x)=\lambda e^{-\lambda x}\ (x\ge0),\qquad F(a)=1-e^{-\lambda a}\ (a\ge0).\]

例 5a(矩) 分部积分得递推 \(E[X^n]=\frac n\lambda E[X^{n-1}]\),所以 \(E[X]=1/\lambda\),\(E[X^2]=2/\lambda^2\),

\[\mathrm{Var}(X)=\frac1{\lambda^2}.\]

均值是参数的倒数,标准差等于均值。指数分布常用来描述"到某事件发生的等待时间",理论依据是第 04b 章的泊松过程:\(P\{X>t\}=P\{N(t)=0\}=e^{-\lambda t}\)。

例 5b 通话时长 \(\sim\) Exp(1/10)(分钟),前面有人刚开始打电话。你等待超过 10 分钟的概率为 \(e^{-1}\approx.368\),等待 10–20 分钟的概率为 \(e^{-1}-e^{-2}\approx.233\)。

无记忆性(memoryless) 非负随机变量 \(X\) 若满足

\[P\{X>s+t\mid X>t\}=P\{X>s\},\qquad\forall s,t\ge0,\tag{5.1}\]

等价于 \(P\{X>s+t\}=P\{X>s\}P\{X>t\}\),就称它无记忆。指数分布满足这一点:\(e^{-\lambda(s+t)}=e^{-\lambda s}e^{-\lambda t}\)。含义:已经用了 \(t\) 小时的仪器,剩余寿命的分布与新仪器相同。

例 5c(邮局) 两名职员分别在服务 Jones 和 Brown,Smith 在任一人离开后开始接受服务;服务时间都是 Exp(\(\lambda\))。Smith 最后离开的概率是多少?Smith 开始接受服务时,另一人的剩余服务时间由无记忆性仍是 Exp(\(\lambda\)),与 Smith 对称,所以答案是 1/2。

唯一性 指数分布是唯一的无记忆连续分布。令 \(\bar F(x)=P\{X>x\}\),无记忆性即 \(\bar F(s+t)=\bar F(s)\bar F(t)\)。由 \(g(m/n)=g(1/n)^m\)、\(g(1)=g(1/n)^n\) 得 \(g(m/n)=g(1)^{m/n}\),再由右连续性 \(g(x)=g(1)^x=e^{-\lambda x}\),\(\lambda=-\log g(1)\)。

例 5d(电池) 电池寿命服从均值 1 万英里的指数分布,5000 英里的旅程中不必换电池的概率是 \(e^{-1/2}\approx.607\),与电池已经用了多久无关。若寿命不是指数分布,则需要 \(\frac{1-F(t+5)}{1-F(t)}\),必须知道已用里程 \(t\)。

Laplace 分布(双指数分布) 正负等可能、绝对值服从 Exp(\(\lambda\)):

\[f(x)=\tfrac12\lambda e^{-\lambda|x|},\qquad F(x)=\begin{cases}\frac12e^{\lambda x},&x<0\\1-\frac12e^{-\lambda x},&x>0\end{cases}\]

例 5e 把例 4e 的信道噪声换成 Laplace(1):\(P\{\text{错}\mid1\}=\frac12e^{-1.5}\approx.1116\),\(P\{\text{错}\mid0\}=\frac12e^{-2.5}\approx.041\),都比正态噪声大得多——这就是厚尾的后果。日收益率的分布通常比正态更接近 Laplace 或 t 分布。

风险率函数

对取正值的连续寿命 \(X\),**风险率(hazard rate)或失效率(failure rate)**定义为

\[\lambda(t)=\frac{f(t)}{\bar F(t)},\qquad\bar F=1-F.\]

解释:

\[P\{X\in(t,t+dt)\mid X>t\}=\frac{P\{X\in(t,t+dt)\}}{P\{X>t\}}\approx\frac{f(t)}{\bar F(t)}dt,\]
即已经活到 \(t\) 的个体,在接下来一瞬间失效的条件概率强度。

  • 指数分布 \(\lambda(t)=\lambda e^{-\lambda t}/e^{-\lambda t}=\lambda\) 为常数,与无记忆性一致,所以 \(\lambda\) 称为速率(rate)。
  • 风险率唯一确定分布:\(\lambda(t)=\frac{F'(t)}{1-F(t)}=-\frac{d}{dt}\log(1-F(t))\),积分得
\[F(t)=1-\exp\Big\{-\int_0^t\lambda(s)ds\Big\}.\tag{5.4}\]

推导拆解:

  1. \(\frac{d}{dt}\log(1-F(t))=\frac{-F'(t)}{1-F(t)}\):对数函数的链式法则 \((\log u)'=u'/u\),这里 \(u=1-F\),\(u'=-f\)。所以 \(\lambda(t)=-\frac{d}{dt}\log\bar F(t)\)。
  2. 两边从 0 到 \(t\) 积分:\(\int_0^t\lambda(s)ds=-[\log\bar F(t)-\log\bar F(0)]\)。寿命取正值,\(\bar F(0)=1\),\(\log1=0\)。
  3. 于是 \(\log\bar F(t)=-\int_0^t\lambda(s)ds\),两边取指数即 (5.4)。 金融直觉:这和利率完全对应。瞬时远期利率 \(f(s)\) 与贴现因子 \(P(0,t)=\exp\{-\int_0^tf(s)ds\}\) 的关系,正是风险率与生存概率的关系。所以信用曲线可以像利率曲线一样搭建:生存概率是"信用贴现因子",违约强度是"信用远期利率",常数强度对应水平的收益率曲线。
  • 线性风险率 \(\lambda(t)=a+bt\):\(F(t)=1-e^{-at-bt^2/2}\);\(a=0\) 时为 Rayleigh 分布。

例 5f("吸烟者死亡率是不吸烟者的两倍") 这句话的意思是 \(\lambda_s(t)=2\lambda_n(t)\)。\(A\) 岁的不吸烟者活到 \(B\) 岁的概率为 \(\exp\{-\int_A^B\lambda_n(t)dt\}\),吸烟者为 \(\exp\{-2\int_A^B\lambda_n\}\)——是平方,而不是一半。例:\(\lambda_n(t)=1/30\)(\(50\le t\le60\)),50 岁不吸烟者活到 60 的概率为 \(e^{-1/3}\approx.7165\),吸烟者为 \(e^{-2/3}\approx.5134\)。

量化联系:信用风险的约化型(强度)模型就是把违约时间的风险率称为违约强度,生存概率由 (5.4) 给出。"违约强度加倍"意味着生存概率平方,而不是违约概率加倍。

5.6 其他连续分布

伽马分布

参数 \((\alpha,\lambda)\) 的伽马分布(gamma distribution):

\[f(x)=\frac{\lambda e^{-\lambda x}(\lambda x)^{\alpha-1}}{\Gamma(\alpha)},\ x\ge0;\qquad\Gamma(\alpha)=\int_0^\infty e^{-y}y^{\alpha-1}dy.\]

分部积分得 \(\Gamma(\alpha)=(\alpha-1)\Gamma(\alpha-1)\),又 \(\Gamma(1)=1\),所以整数 \(n\) 时 \(\Gamma(n)=(n-1)!\)。

与泊松过程的联系 速率为 \(\lambda\) 的泊松过程中,第 \(n\) 个事件的发生时刻 \(T_n\) 满足 \(\{T_n\le t\}=\{N(t)\ge n\}\),

\[P\{T_n\le t\}=\sum_{j\ge n}e^{-\lambda t}\frac{(\lambda t)^j}{j!}.\]

求导时相邻项相消,得 \(f(t)=\lambda e^{-\lambda t}\frac{(\lambda t)^{n-1}}{(n-1)!}\),即 Gamma(\(n,\lambda\)),也叫 \(n\)-Erlang 分布;\(n=1\) 就是指数分布。

推导拆解:对第 \(j\) 项 \(e^{-\lambda t}\frac{(\lambda t)^j}{j!}\) 用乘积法则求导,得两部分:\(-\lambda e^{-\lambda t}\frac{(\lambda t)^j}{j!}\) 和 \(\lambda e^{-\lambda t}\frac{(\lambda t)^{j-1}}{(j-1)!}\)。把 \(j=n,n+1,\dots\) 的结果排开,第 \(j\) 项的负部分与第 \(j+1\) 项的正部分完全相同,一正一负抵消。最后只剩第 \(n\) 项的正部分 \(\lambda e^{-\lambda t}\frac{(\lambda t)^{n-1}}{(n-1)!}\)。 第一个等式 \(\{T_n\le t\}=\{N(t)\ge n\}\) 的意思是:第 \(n\) 个事件在 \(t\) 之前发生,等价于到 \(t\) 为止至少发生了 \(n\) 个。"等待时间"和"计数"之间的这种互换是处理到达过程的常用手法。

\(\lambda=1/2\)、\(\alpha=n/2\) 的伽马分布叫自由度为 \(n\) 的卡方分布 \(\chi^2_n\)(chi-squared),第 06a 章会证明它是 \(n\) 个独立标准正态的平方和。

例 6a \(E[X]=\frac{\Gamma(\alpha+1)}{\lambda\Gamma(\alpha)}=\frac\alpha\lambda\),\(\mathrm{Var}(X)=\frac{\alpha}{\lambda^2}\)。

Weibull 分布

工程中广泛使用,最初用于材料疲劳数据。它适合"最弱环节(weakest link)"模型:由许多部件组成、任一部件失效即整体失效的物体寿命。CDF 为

\[F(x)=1-\exp\Big\{-\Big(\frac{x-\nu}{\alpha}\Big)^\beta\Big\},\qquad x>\nu.\tag{6.2}\]

\(\beta=1\) 时退化为平移的指数分布;\(\beta>1\) 时风险率递增,\(\beta<1\) 时风险率递减。

柯西分布

参数 \(\theta\) 的柯西分布(Cauchy distribution):\(f(x)=\frac1\pi\frac1{1+(x-\theta)^2}\)。

例 6b(旋转手电筒) 手电筒中心距 \(x\) 轴 1 个单位,随机旋转后光束与 \(x\) 轴的交点 \(X=\tan\theta\),\(\theta\sim U(-\pi/2,\pi/2)\)。\(F(x)=P\{\theta\le\tan^{-1}x\}=\frac12+\frac1\pi\tan^{-1}x\),\(f(x)=\frac1{\pi(1+x^2)}\),即标准柯西分布。它的均值不存在,是厚尾的极端例子:样本均值不会收敛,"平均"失去意义。

贝塔分布

\[f(x)=\frac{1}{B(a,b)}x^{a-1}(1-x)^{b-1},\ 0<x<1;\qquad B(a,b)=\int_0^1x^{a-1}(1-x)^{b-1}dx=\frac{\Gamma(a)\Gamma(b)}{\Gamma(a+b)}.\tag{6.3}\]

(最后一个等式在第 06b 章例 7c 证明。)**贝塔分布(beta distribution)**用于建模取值在有限区间内的随机现象。\(a=b\) 时关于 1/2 对称,\(a\) 越大越集中;\(a=b=1\) 时就是 \(U(0,1)\);\(b>a\) 时偏向小值。

\[E[X]=\frac a{a+b},\qquad\mathrm{Var}(X)=\frac{ab}{(a+b)^2(a+b+1)}.\]

在量化里,贝塔分布常用来描述胜率、违约回收率等 \([0,1]\) 上的量,也是胜率的贝叶斯先验(第 06b 章)。

5.7 随机变量函数的分布

基本方法:把 \(\{g(X)\le y\}\) 写成 \(X\) 属于某个集合的事件,先求 CDF,再求导。

  • 例 7a \(X\sim U(0,1)\),\(Y=X^n\):\(F_Y(y)=P\{X\le y^{1/n}\}=y^{1/n}\),\(f_Y(y)=\frac1ny^{1/n-1}\)(\(0\le y\le1\))。
  • 例 7b \(Y=X^2\):\(F_Y(y)=F_X(\sqrt y)-F_X(-\sqrt y)\),\(f_Y(y)=\frac1{2\sqrt y}[f_X(\sqrt y)+f_X(-\sqrt y)]\)(\(y\ge0\))。
  • 例 7c \(Y=|X|\):\(f_Y(y)=f_X(y)+f_X(-y)\)(\(y\ge0\))。

定理 7.1(单调变换的密度公式) \(X\) 有密度 \(f_X\),\(g\) 严格单调且可微,则 \(Y=g(X)\) 的密度为

\[f_Y(y)=f_X\big[g^{-1}(y)\big]\left|\frac{d}{dy}g^{-1}(y)\right|,\]

\(y\) 不在 \(g\) 的值域中时 \(f_Y(y)=0\)。证明(\(g\) 递增):\(F_Y(y)=P\{X\le g^{-1}(y)\}=F_X(g^{-1}(y))\),求导即得;\(g\) 递减时多一个负号,所以取绝对值。

推导拆解:

  1. 递增情形:\(g(X)\le y\) 等价于 \(X\le g^{-1}(y)\)(递增函数保持大小顺序)。对 \(F_X(g^{-1}(y))\) 用链式法则求导:外层导数 \(f_X(g^{-1}(y))\),乘内层导数 \(\frac{d}{dy}g^{-1}(y)\),后者为正。
  2. 递减情形:\(g(X)\le y\) 等价于 \(X\ge g^{-1}(y)\)(递减函数颠倒顺序),\(F_Y(y)=1-F_X(g^{-1}(y))\),求导得 \(-f_X(g^{-1}(y))\frac{d}{dy}g^{-1}(y)\),而此时 \(\frac{d}{dy}g^{-1}<0\),负负得正。两种情形合起来就是取绝对值。
  3. 为什么要乘导数:概率守恒。\(X\) 落在 \([x,x+dx]\) 与 \(Y\) 落在 \([y,y+dy]\) 是同一个事件,所以 \(f_Y(y)|dy|=f_X(x)|dx|\),即 \(f_Y(y)=f_X(x)\left|\frac{dx}{dy}\right|\)。变换把区间拉长了,密度就要按同样比例摊薄。 例:\(Y=2X\)(例 1d),区间被拉长 2 倍,\(\frac{dx}{dy}=\frac12\),所以 \(f_Y(y)=\frac12f_X(y/2)\)。 这个 \(|dx/dy|\) 是一维的"雅可比因子"。多元变换时,小区间变成小平行四边形(或高维小块),伸缩比例由雅可比矩阵的行列式给出,这正是第 06b 章的内容。

例 7e(对数正态分布) \(X\sim N(\mu,\sigma^2)\),\(Y=e^X\) 称为参数 \((\mu,\sigma^2)\) 的对数正态(lognormal)随机变量,即 \(\log Y\) 是正态的。原书指出,它常用于描述证券相邻两日的价格比 \(S_n/S_{n-1}\):假设价格比是对数正态,等价于对数收益 \(X=\log(S_n/S_{n-1})\) 是正态,\(S_n=S_{n-1}e^X\)。由 \(g^{-1}(y)=\log y\),\(\frac{d}{dy}g^{-1}=1/y\),

\[f_Y(y)=\frac{1}{\sqrt{2\pi}\,\sigma y}\exp\Big\{-\frac{(\log y-\mu)^2}{2\sigma^2}\Big\},\qquad y>0.\]

对数正态价格永远为正,对数收益可以按时间相加(第 06a 章例 3d),这正是几何布朗运动和 Black–Scholes 模型(第 08 册)的基础假设。

概率积分变换(probability integral transform)(原书理论练习 5.29):若 \(X\) 是连续随机变量、CDF 为 \(F\),则 \(F(X)\sim U(0,1)\)。反过来,若 \(U\sim U(0,1)\),则 \(F^{-1}(U)\) 的 CDF 就是 \(F\)。这是逆变换法生成任意分布随机数的依据,也是 copula 建模和"检验预测分布是否校准"(PIT 检验)的基础。

推导拆解:设 \(F\) 连续且严格递增(因此有反函数),\(0<u<1\)。

  1. \(P\{F(X)\le u\}=P\{X\le F^{-1}(u)\}\):两边同时作用递增函数 \(F^{-1}\),不等号方向不变。
  2. \(=F(F^{-1}(u))=u\)。CDF 等于 \(u\) 正是 \(U(0,1)\) 的 CDF。
  3. 反方向:\(P\{F^{-1}(U)\le x\}=P\{U\le F(x)\}=F(x)\)。 直观:\(F(X)\) 是"\(X\) 在自己分布中的分位排名"。任何分布下,排名落在前 10% 的概率都是 10%,所以排名是均匀的。PIT 检验就是把每天的实际收益代入前一天预测的 CDF,如果预测分布正确,这些"排名"应当均匀分布;若太多落在 0 或 1 附近,说明模型低估了尾部。

量化实战

1. 正态 VaR 与厚尾

日收益均值 0.05%、标准差 2%。按例 4f,正态假设下 99% VaR \(=2.33\sigma-\mu\)。若真实分布是同均值、同标准差的 Laplace 或自由度为 4 的 t 分布,99% VaR 增大约 15%–20%,99.9% VaR 增大 40%–65%,"单日跌幅超过 6%"(3 个标准差)的概率是正态假设下的 5 倍多。这就是正态 VaR 低估尾部风险的原因。

2. 看涨型期望:期权定价的核心积分

原书自测题 5.20 求出 \(E[(Z-c)^+]=\frac1{\sqrt{2\pi}}e^{-c^2/2}-c(1-\Phi(c))\)。若到期价格 \(X=S_0+\sigma Z\)(Bachelier 模型),行权价 \(K\),令 \(c=(K-S_0)/\sigma\),则看涨期权的期望收益为 \(\sigma[\varphi(c)-c(1-\Phi(c))]\)。把正态换成对数正态,同样的积分就给出 Black–Scholes 公式(第 08 册)。

3. 违约强度、生存概率与逆变换抽样

设违约强度 \(\lambda(t)=a+bt\)。由 (5.4),累计违约概率 \(F(t)=1-e^{-at-bt^2/2}\)。逆变换法:解 \(F(t)=u\) 得 \(t=F^{-1}(u)\),把均匀随机数代入就得到违约时间样本。

import numpy as np
from scipy import stats
rng = np.random.default_rng(5)

# ---------- 1) 参数法 VaR:正态 vs 厚尾(同均值、同标准差) ----------
mu, sigma = 0.0005, 0.02            # 日收益均值与标准差
var_normal = stats.norm.ppf(0.99) * sigma - mu          # Ross 例 4f: VaR = z_.99*sigma - mu
lap = stats.laplace(loc=mu, scale=sigma / np.sqrt(2))   # Laplace 方差 = 2b^2
nu = 4
t4 = stats.t(df=nu, loc=mu, scale=sigma * np.sqrt((nu - 2) / nu))   # t 分布方差 = s^2 nu/(nu-2)
print(f"z_0.99 = {stats.norm.ppf(0.99):.4f}")
for name, dist in (("正态", stats.norm(mu, sigma)), ("Laplace", lap), ("t(4)", t4)):
    for a in (0.99, 0.999):
        v = -dist.ppf(1 - a)
        print(f"{name:8s} {a:.1%} VaR = {v:.4f}", end="   ")
    print(f"P(日跌幅>6%) = {dist.cdf(-0.06):.2e}")
print(f"公式 2.33σ-μ = {2.33*sigma-mu:.4f}, 精确 = {var_normal:.4f}")

# ---------- 2) 正态下的看涨型期望 E[(X-c)^+](原书自测题 5.20)----------
S0, vol, K = 100.0, 8.0, 104.0      # 到期价格 X ~ N(S0, vol^2)(Bachelier 模型)
c = (K - S0) / vol
formula = vol * (stats.norm.pdf(c) - c * stats.norm.sf(c))   # σ[φ(c) - c(1-Φ(c))]
X = rng.normal(S0, vol, 1_000_000)
print(f"\nE[(X-K)^+]: 公式 {formula:.4f}   蒙特卡洛 {np.maximum(X - K, 0).mean():.4f}")

# ---------- 3) 风险率 -> 违约/生存概率,并用逆变换法抽样 ----------
a, b = 0.01, 0.004                  # 违约强度 λ(t) = a + b t(年)
F = lambda t: 1 - np.exp(-(a * t + b * t**2 / 2))           # (5.4)
def F_inv(u):                       # 解 a t + b t^2/2 = -log(1-u)
    h = -np.log1p(-u)
    return (-a + np.sqrt(a * a + 2 * b * h)) / b
U = rng.random(500_000)             # 概率积分变换:F^{-1}(U) 的分布函数就是 F
tau = F_inv(U)
for T in (1, 5, 10):
    print(f"{T:2d} 年累计违约概率: 公式 {F(T):.4f}   逆变换抽样 {np.mean(tau <= T):.4f}")
# 风险率加倍 => 生存概率平方(例 5f)
S5 = 1 - F(5)
print(f"5 年生存概率 {S5:.4f}; 强度加倍后 {np.exp(-2*(a*5+b*25/2)):.4f} = {S5:.4f}^2 = {S5**2:.4f}")

关键输出:

z_0.99 = 2.3263
正态       99.0% VaR = 0.0460   正态       99.9% VaR = 0.0613   P(日跌幅>6%) = 1.24e-03
Laplace  99.0% VaR = 0.0548   Laplace  99.9% VaR = 0.0874   P(日跌幅>6%) = 6.94e-03
t(4)     99.0% VaR = 0.0525   t(4)     99.9% VaR = 0.1009   P(日跌幅>6%) = 6.43e-03
公式 2.33σ-μ = 0.0461, 精确 = 0.0460

E[(X-K)^+]: 公式 1.5824   蒙特卡洛 1.5874

 1 年累计违约概率: 公式 0.0119   逆变换抽样 0.0121
 5 年累计违约概率: 公式 0.0952   逆变换抽样 0.0957
10 年累计违约概率: 公式 0.2592   逆变换抽样 0.2597
5 年生存概率 0.9048; 强度加倍后 0.8187 = 0.9048^2 = 0.8187

读法:三种分布方差相同,但在 99.9% 处 t(4) 的 VaR 比正态高约 65%,"3σ 暴跌"的概率高 5 倍多。期权型期望的公式与 100 万次模拟只差 0.005,属于蒙特卡洛误差范围(第 08 章的中心极限定理会给出误差的量级)。逆变换抽样得到的违约时间分布与 (5.4) 一致,强度加倍后生存概率恰为原来的平方。


本章小结

连续随机变量由密度描述,单点概率为 0,\(F'=f\),\(f(a)\varepsilon\) 近似落在 \(a\) 附近长度 \(\varepsilon\) 区间的概率。期望、LOTUS、方差的定义与离散情形平行,非负变量还有尾积分公式。非对称线性损失下的最优决策是分位数。正态分布对线性变换封闭,标准化后查 \(\Phi\) 表,\(\pm1,2,3\sigma\) 内约 68%、95%、99.7%;正态 VaR \(=2.33\sigma-\mu\);二项在 \(np(1-p)\ge10\) 时可用带连续性修正的正态近似,检验优势所需样本量与优势的平方成反比。指数分布是唯一的无记忆连续分布,风险率为常数,是泊松过程的等待时间;风险率唯一确定分布,强度加倍意味着生存概率平方。伽马(Erlang、卡方)、Weibull、柯西、贝塔各有来历。单调变换公式给出函数的密度,对数正态是股价比的标准模型,概率积分变换是随机数生成和 copula 的基础。

概念 公式
密度与 CDF \(P\{X\in B\}=\int_Bf\);\(F'=f\);\(P\{X=a\}=0\)
期望 / LOTUS \(E[X]=\int xf(x)dx\);\(E[g(X)]=\int g(x)f(x)dx\)
尾积分公式 \(E[Y]=\int_0^\infty P\{Y>y\}dy\)(\(Y\ge0\))
分位数决策 \(F(t^*)=\frac{k}{k+c}\)
均匀 \((\alpha,\beta)\) 均值 \(\frac{\alpha+\beta}2\),方差 \(\frac{(\beta-\alpha)^2}{12}\)
正态 \(f=\frac{1}{\sqrt{2\pi}\sigma}e^{-(x-\mu)^2/2\sigma^2}\);\(F(a)=\Phi(\frac{a-\mu}\sigma)\);\(\Phi(-x)=1-\Phi(x)\)
正态 VaR(99%) \(2.33\sigma-\mu\)
DeMoivre–Laplace \(\frac{S_n-np}{\sqrt{np(1-p)}}\approx N(0,1)\),配合连续性修正
指数 \(f=\lambda e^{-\lambda x}\),均值 \(1/\lambda\),方差 \(1/\lambda^2\),无记忆
风险率 \(\lambda(t)=f(t)/\bar F(t)\);\(\bar F(t)=\exp\{-\int_0^t\lambda(s)ds\}\)
伽马 \((\alpha,\lambda)\) 均值 \(\alpha/\lambda\),方差 \(\alpha/\lambda^2\);\(\chi^2_n=\mathrm{Gamma}(n/2,1/2)\)
贝塔 \((a,b)\) 均值 \(\frac a{a+b}\),方差 \(\frac{ab}{(a+b)^2(a+b+1)}\)
单调变换 \(f_Y(y)=f_X(g^{-1}(y))\lvert\frac{d}{dy}g^{-1}(y)\rvert\)
对数正态 \(f_Y(y)=\frac1{\sqrt{2\pi}\sigma y}e^{-(\log y-\mu)^2/2\sigma^2}\)
概率积分变换 \(F(X)\sim U(0,1)\);\(F^{-1}(U)\sim F\)

练习

基础

  1. \(X\) 的密度为 \(f(x)=cx^2\)(\(0<x<1\))。求 \(c\)、\(F(x)\)、\(E[X]\)、\(\mathrm{Var}(X)\)。 答案:\(c=3\),\(F(x)=x^3\),\(E[X]=3/4\),\(E[X^2]=3/5\),\(\mathrm{Var}=3/80\)。
  2. 某股票日收益服从 \(N(0.001,0.015^2)\)。求单日下跌超过 3% 的概率,以及 95% 与 99% VaR。 答案:\(P\{X<-0.03\}=\Phi(-2.067)\approx0.0194\);95% VaR \(=1.645\times0.015-0.001\approx0.0237\);99% VaR \(\approx2.33\times0.015-0.001\approx0.0340\)。
  3. 订单到达间隔服从均值 2 秒的指数分布。已经 5 秒没有新订单,再等超过 3 秒的概率是多少? 答案:无记忆性,\(e^{-3/2}\approx0.223\)。
  4. 抛公平硬币 100 次,用带连续性修正的正态近似求正面不少于 60 次的概率。 答案:\(P\{Z\ge(59.5-50)/5=1.9\}\approx0.0287\)。
  5. 证明 \(X\sim U(0,1)\) 时 \(-\frac1\lambda\log U\) 服从 Exp(\(\lambda\))。 提示:\(P\{-\frac1\lambda\log U\le x\}=P\{U\ge e^{-\lambda x}\}=1-e^{-\lambda x}\);这就是逆变换法。

进阶

  1. 一个策略真实胜率为 51%,盈亏金额对称。要以 95% 的把握使样本胜率高于 50%,大约需要多少笔交易?若真实胜率为 53% 呢? 答案:仿例 4j,\(\frac{0.01\sqrt n}{\sqrt{0.51\times0.49}}\ge1.645\),\(n\approx6760\);胜率 53% 时 \(n\approx750\)。优势变 3 倍,样本量约降为 1/9。
  2. 某公司债的违约强度为常数 \(\lambda=0.02\)/年。求 5 年内违约的概率;若信用评级下调使强度变为 0.05,5 年生存概率变为原来的多少倍? 答案:\(1-e^{-0.1}\approx0.0952\);生存概率从 \(e^{-0.1}\) 变为 \(e^{-0.25}\),为原来的 \(e^{-0.15}\approx0.861\) 倍。
  3. 证明对任意连续随机变量,\(E|X-a|\) 在 \(a\) 取中位数时最小。(原书习题 5.31) 提示:对 \(a\) 求导得 \(2F(a)-1\),或套用例 2d 的结果(\(k=c\))。
  4. 设对数收益 \(X\sim N(\mu,\sigma^2)\),价格比 \(Y=e^X\)。用 LOTUS 证明 \(E[Y]=e^{\mu+\sigma^2/2}\),并说明为什么"对数收益期望为 0"不等于"价格期望不变"。 提示:对 \(e^x\) 乘正态密度配方。\(\mu=0\) 时 \(E[Y]=e^{\sigma^2/2}>1\)。
  5. 证明 Stein 恒等式:若 \(Z\sim N(0,1)\),则 \(E[g'(Z)]=E[Zg(Z)]\),并由此得到 \(E[Z^4]=3\)。(原书理论练习 5.11) 提示:分部积分,利用 \(\varphi'(z)=-z\varphi(z)\);取 \(g(z)=z^3\)。\(E[Z^4]=3\) 是度量收益峰度(厚尾程度)的基准。

原书推荐习题:Problems 5.9(连续报童临界分位数)、5.17–5.19(由分位数反推正态参数)、5.26、5.27(硬币是否有偏)、5.29(二叉树股价的正态近似)、5.31(\(E|X-a|\) 与中位数)、5.35、5.36(由风险率求生存概率);Theoretical Exercises 5.5(\(E[X^n]\) 的尾积分)、5.8(有界变量方差上界)、5.11(Stein 恒等式)、5.29(概率积分变换);Self-Test 5.18(指数混合的剩余寿命)、5.20(\(E[(Z-c)^+]\))。


原书对照

本章小节 原书章节 PDF 页码 书内页码
5.1 密度函数 5.1 Introduction p.189–192 p.176–179
5.2 期望与方差 5.2 Expectation and Variance of Continuous Random Variables p.192–196 p.179–183
5.3 均匀分布 5.3 The Uniform Random Variable p.197–200 p.184–187
5.4 正态分布 5.4 Normal Random Variables(含 5.4.1) p.200–210 p.187–197
5.5 指数分布与风险率 5.5 Exponential Random Variables(含 5.5.1) p.210–216 p.197–203
5.6 其他连续分布 5.6 Other Continuous Distributions p.216–221 p.203–208
5.7 随机变量函数的分布 5.7 The Distribution of a Function of a Random Variable p.221–223 p.208–210
小结与习题 Summary, Problems, Theoretical Exercises, Self-Test p.223–232 p.210–219

(书内页码 = PDF 页码 − 13。)