概率分布可以由分布函数、概率质量函数或概率密度函数描述,也可以转换到“频域”研究。特征函数(Characteristic Function)就是概率分布的傅里叶变换。它始终存在,能够唯一确定分布,并且会把独立随机变量之和转化为函数的乘积,因此特别适合处理卷积、分布收敛与中心极限定理。
设 X 是实值随机变量,其特征函数定义为
φX(t)=E[eitX],t∈R,
其中 i2=−1。由欧拉公式 eiu=cosu+isinu,也可以写成
φX(t)=E[cos(tX)]+iE[sin(tX)].
若 X 的分布函数为 FX,则更一般地有
φX(t)=∫−∞∞eitxdFX(x).
离散型和连续型随机变量分别对应
φX(t)=k∑eitxkP(X=xk),
以及
φX(t)=∫−∞∞eitxfX(x)dx.
这里最后一个式子要求 X 有概率密度 fX。
为什么特征函数总是存在?
对任意实数 x,t,都有 ∣eitx∣=1。因此
E[∣eitX∣]=1<∞,
无论 X 是否具有有限期望、方差或矩母函数,φX(t) 都有定义。
由定义立即得到
φX(0)=1,∣φX(t)∣≤1,φX(−t)=φX(t).
第三个等式说明实部是偶函数、虚部是奇函数。若 X 关于原点对称,则 X 与 −X 同分布,进而 φX(t) 是实值偶函数。
特征函数还在整个实数轴上一致连续。并非每一个满足 f(0)=1、∣f(t)∣≤1 的连续函数都是特征函数;完整刻画还需要正定性,这正是 Bochner 定理的内容。
对常数 a,b∈R,
φaX+b(t)=E[eit(aX+b)]=eibtφX(at).
平移 b 对应乘上相位因子 eibt,缩放 a 对应把自变量改为 at。
若 X 与 Y 相互独立,则
φX+Y(t)=E[eit(X+Y)]=E[eitXeitY]=E[eitX]E[eitY]=φX(t)φY(t).
因此,对相互独立的 X1,…,Xn,
φX1+⋯+Xn(t)=k=1∏nφXk(t).
在分布一侧,随机变量相加需要计算卷积;在特征函数一侧,卷积变成了普通乘法。这是特征函数最重要的计算优势之一。
如果 E[∣X∣n]<∞,那么 φX 至少可以求 n 阶导数,且
φX(n)(t)=E[(iX)neitX].
令 t=0,得到
E[Xn]=inφX(n)(0)=i−nφX(n)(0).
前两阶矩满足
E[X]=iφX′(0)=−iφX′(0),E[X2]=−φX′′(0),
所以
Var(X)=−φX′′(0)+(φX′(0))2.
导数与矩不能无条件互推
“n 阶矩存在”足以推出上述求导公式,但仅知道特征函数在原点存在某阶导数,通常不能直接断言对应阶绝对矩存在。偶数阶存在更强的逆向结论;使用逆推时必须核对具体条件。
若各阶矩存在且相应展开确实收敛,可以在原点附近写出
φX(t)=n=0∑∞n!(it)nE[Xn].
但“所有阶矩都存在”本身并不总能保证这个级数唯一恢复分布,因此不能把上式当作无条件成立的全局公式。
| 分布 | 参数约定 | 特征函数 φX(t) |
|---|
| 退化分布 | P(X=c)=1 | eict |
| Bernoulli 分布 | X∼Bernoulli(p) | 1−p+peit |
| 二项分布 | X∼Binomial(n,p) | (1−p+peit)n |
| Poisson 分布 | X∼Poisson(λ) | exp{λ(eit−1)} |
| 均匀分布 | X∼U(a,b) | it(b−a)eitb−eita,t=0;t=0 时为 1 |
| 正态分布 | X∼N(μ,σ2) | exp(iμt−2σ2t2) |
| 指数分布 | X∼Exp(λ),λ>0 为率参数 | λ−itλ |
| Cauchy 分布 | 位置 x0、尺度 γ>0 | $\exp(ix_0t-\gamma |
Cauchy 分布没有有限期望和方差,矩母函数也不在原点附近存在,但其特征函数仍对所有实数 t 有定义。这很好地体现了特征函数相对于矩母函数的适用范围优势。
先取标准正态随机变量 Z∼N(0,1)。其特征函数为
φZ(t)=2π1∫−∞∞eitxe−x2/2dx.
不必直接处理复积分。对 t 求导,并利用 xe−x2/2=−dxde−x2/2,分部积分可得
φZ′(t)=−tφZ(t).
结合初值 φZ(0)=1,解这个微分方程得到
φZ(t)=e−t2/2.
若 X=μ+σZ,利用线性变换性质便有
φX(t)=eiμtφZ(σt)=exp(iμt−2σ2t2).
若两个随机变量 X 和 Y 满足
φX(t)=φY(t),∀t∈R,
那么它们具有相同的分布,即 X=dY。因此,证明两个随机变量同分布时,可以不直接比较分布函数或密度,只需证明它们的特征函数相同。
在特征函数绝对可积,即
∫−∞∞∣φX(t)∣dt<∞
时,X 存在连续密度,并可由傅里叶反演公式恢复:
fX(x)=2π1∫−∞∞e−itxφX(t)dt.
绝对可积是这条简洁密度反演公式的一个充分条件,而不是所有分布都必须满足的条件。更一般的反演定理可以直接恢复分布在区间上的概率。
Lévy 连续性定理建立了特征函数收敛与依分布收敛之间的联系。常用形式是:若 Xn 的特征函数满足
φXn(t)⟶φ(t),∀t∈R,
并且极限函数 φ 在 t=0 处连续,那么 φ 是某个随机变量 X 的特征函数,并且
XndX.
反过来,若 XndX,则对每个 t 都有 φXn(t)→φX(t)。
设 X1,X2,… 独立同分布,满足
E[Xk]=μ,Var(Xk)=σ2>0.
令
Zn=σn∑k=1nXk−nμ.
对标准化变量 Yk=(Xk−μ)/σ,其特征函数在原点附近满足
φY(u)=1−2u2+o(u2).
由独立性,
φZn(t)=[φY(nt)]n=[1−2nt2+o(n1)]n⟶e−t2/2.
e−t2/2 正是标准正态分布的特征函数。由 Lévy 连续性定理,得到
ZndN(0,1).
这段推导展示了特征函数方法的核心思路:先把随机变量之和转化为特征函数的乘积,再通过函数极限识别极限分布。
| 工具 | 定义 | 主要适用对象 | 是否总存在 |
|---|
| 特征函数 | φX(t)=E[eitX] | 任意实值随机变量 | 是,对所有 t∈R |
| 矩母函数 | MX(t)=E[etX] | 在原点邻域内指数矩有限的随机变量 | 否 |
| 概率生成函数 | GX(s)=E[sX] | 非负整数值随机变量 | 至少在 $ |
三者都能把独立随机变量之和转化为乘积,但适用范围不同。若 X 为非负整数值随机变量,则
φX(t)=GX(eit).
如果矩母函数在 0 的某个邻域内存在,则在允许复数代入的意义下有 φX(t)=MX(it)。反向使用时要谨慎:特征函数总存在,并不意味着矩母函数也存在。
对随机向量 X∈Rd,其特征函数定义为
φX(t)=E[eitTX],t∈Rd.
一维情形中的唯一性、独立和乘积以及连续性定理都有相应的多维版本。特别地,向量各分量 X1,…,Xd 相互独立,当且仅当联合特征函数可以分解为
φX(t1,…,td)=k=1∏dφXk(tk).
- 特征函数不是概率密度。它一般是复值函数,也不要求非负。
- 独立性不可省略。φX+Y=φXφY 通常只在 X,Y 独立时成立。
- 特征函数存在不代表矩存在。Cauchy 分布就是典型反例。
- 点态极限还要检查原点连续性。应用 Lévy 连续性定理时,这一条件保证极限确实对应某个概率分布。
- 傅里叶变换的符号约定可能不同。本文采用 eitx 定义特征函数,因此密度反演中使用 e−itx 和系数 1/(2π)。