EE7402-Statistical-Signal-Processing-Part1-1-引入与最小方差无偏估计
引入
课程引入
统计信号处理(Statistical Signal Processing)是电磁学、通信、雷达、声纳、控制、图像分析等领域的核心课程之一,它将概率论与数理统计的理论工具应用于信号的建模、估计、检测与滤波。
在本科阶段学习的信号处理课程中,例如DSP,并没有真正的考虑噪声的影响。但真实的世界充斥着噪声,这就是这门课存在的意义。这门课将使用统计理论,使用某种方法来估算该兴趣的量,并确定这种估算的准确性。
估计理论可以被用来:1、估计扰动和系统参数(例如噪声方差、信道参数等)2、估计信号参数(幅度、频率、时间延迟、多普勒、方位角等)3、估计信号波形
这门课中的符号
在这门课中:
- $\mathbf{X}$表示观测矩阵
- $\mathbf{\theta}$表示参数向量(即,用来被估计的原始值)
- $\hat \theta(x)$表示对某个数据进行估计,有时用$\hat \theta$来直接表示估计后的数据,它是一个向量。
- $\epsilon(x)=\hat \theta(x)-\theta$表示估计误差,这是一个随机量
- 均方差(Mean-Square Error) $MSE=E\{\epsilon^T(x)\epsilon(x)\}$
概率估计中的常见概念
偏差(bias):
偏差$b(\theta)$是一个估计量与真实参数之间的差,它衡量了估计值与真实值之间的接近程度。对于偏差一个例子是:就像你用一个仪器多次测量一个长度 $L$,每次测量值是随机的(受噪声影响),但你可以计算这些测量值的平均值 $E[\hat{L}]$,然后问:这个仪器的平均测量值偏离真实长度 $L$ 多少?这就是偏差。对于本课的信号估计而言,偏差公式中的$\theta$是样本信号的均值。
如果在大量观测下$b(\theta)=0$,则称其为无偏的(unbiased );否则则为有偏(biased),有偏通常取决于观测值的数量。许多无偏估计的平均值将更接近真实值,但是这并不意味无偏估计相较于有偏估计有更小的误差。
一个偏差的例子
试想一个直流信号(下图红色),经过噪声影响后,它变成了下面的波浪线(红色线上面叠加那条)。波浪信号的期望与DC信号的均值相同,则此为无偏的。如果是下方那条波浪线,它的期望是小于DC信号的均值,则它是有偏的。

一致性(Consistency):
在样本数量趋于无穷时,如果估计量的均方差(MSE)趋于0,则称该估计量是一致的。不一致的估计在样本数量有限时仍能提供有意义的估计,但是其估计精度并不会随着样本数量提升而提升。
对于偏差,就算样本数量只有寥寥几个甚至1个,它的估计结果都有可能是无偏的。但是要使统计的MSE=0,只能是样本趋于无穷时,任意有限的样本MSE都不可能等于0,除非这不是一个随机量。
效率(Efficiency):
这个效率并非计算效率之类的,这是统计信号处理里的特殊概念。估计效率是衡量一个估计量在给定信息量下的“好坏”的指标。直观来说,它反映了估计量的方差是否接近理论最小值。
这里需要引入另一个概念:克拉默-拉奥下界(Cramer-Rao Lower Bound, CRLB) 是无偏估计量方差的理论下界,它告诉我们在满足一定正则条件下,任何无偏估计量的方差都不可能低于这个界限。如果一个无偏估计的方差等于CRLB,则称其为最优的。
由于$MSE=Var(\hat \theta)+(E\{\hat \theta\}-\theta)^2$(这个公式将在介绍CRLB时详细推导)。而无偏估计的$E\{\hat \theta\}-\theta=0$,因此,当这个估计是无偏估计时,MSE的理论下界也是CRLB。
当一个估计量的MSE=CRLB时,则称该估计是有效率的。对于一个有效的估计,CRLB是最小的均方误差。
对于许多问题,有效估计是不存在的。
Recall:常见的概率分布
概率论基础知识
概率论基础
随机变量(Random Variable):随机变量是一个函数,它将样本空间中每一个可能得结果映射为一个实数。就像是掷骰子的点数,它可能是1-6,这是样本空间;定义掷骰子这个事情为一个随机变量,那么这个随机变量的值就是掷的点数。随机变量的值并非固定的。
概率分布函数(Cumulative Distribution Function, CDF):表示随机变量$X$小于或等于某个值$x$的概率:$F(x)=P(X\leq x)$。概率分布函数是单调不减的,且$\lim _{x\rightarrow-\infty}F(x)=0$,$\lim _{x\rightarrow+\infty}F(x)=1$。概率分布函数是概率密度函数的积分。
概率密度函数(Probability Density Function, PDF):通常使用$f(x)$或者$p(x)$来表示。它表示随机变量取值的概率分布情况,它就像是随机变量的值等于数轴上某一值的概率的“浓度”。或者说,它是概率分布函数的“斜率”,如果概率分布函数的斜率越大,则说明在随机变量落在数轴的这一点的概率越大,落在这一点的概率“越浓”(但PDF数值上并不等于随机变量落在该点的概率)。要求一个连续随机变量在某个区间[a,b]内分布的概率,可以用$\int^b_af(x)dx$得到。
联合概率密度函数:
高斯分布(Gaussian/Normal)
高斯是最重要的一个分布
1.高斯分布的PDF
高斯分布的PDF为:

其中:
- $\mu$是高斯分布的均值,控制钟型曲线的中心。
- $\sigma^2$是高斯分布的方差,控制曲线更突出还是更均匀
- 高斯分布常记作x~N($\mu$,$\sigma^2$)。标准高斯分布为x~N(0,1)
标准高斯分布分PDF为:
2.高斯分布的CDF与$\phi$函数
高斯分布的CDF应使用PDF积分$\int_{-\infty}^x\frac{1}{\sqrt{2\pi}\sigma_X}e^{-(x-\mu)^2/2\sigma^2}$,但这个积分没有解析解。因此常用标准高斯分布的CDF来迁移计算PDF。标准高斯分布的CDF为:
它表示标准正态随机变量小于等于x的概率。$\phi(x)$ 没有初等函数的解析表达式,通常通过数值积分或误差函数$ erf(x) $来近似计算:
将$\phi(x)$替换为$\phi(\frac{x-\mu}{\sigma})$即可计算任意高斯分布的CDF。例如计算$\mu=175$,$\sigma=7$的高斯分布大于180的概率,使用$\phi(\frac{180-175}{7})$,然后查表拿到$\phi$的值即可。
$\phi$函数具有如下性质:
- $\phi(-x)=1-\phi(x)$
- $\phi(x)|_{x\rightarrow \infty}=1$
- $\phi(x)|_{x\rightarrow -\infty}=0$
- 单调递增
3.高斯分布的尾数函数Q
另一个高斯分布常用的函数是尾数函数(Q function/ right-tail probability function):
其代表的是高斯分布的随机变量$X$大于某一$x$的概率。$Q(x)$具有如下性质:
- $Q(-x)=1-Q(x)$
- $Q(0)=0.5$
- $Q(-\infty)=1$
- $Q(\infty)=0$
- 单调递减
4.高斯分布的原点矩与中心矩
高斯分布的原点矩具有如下特性:
这是由于高斯分布是关于均值对称的,奇数阶原点矩具有反对称性,积分结果为 0;偶数阶原点矩与方差相关。推导证明如下:
- 当n为奇数时,对于函数$f(x)=x^n$有$f(-x)=(-x)^n=-(x^n)$,其是奇函数。而高斯分布的PDF$p(x)$是偶函数,因此$x^np(x)$是$奇函数 \times 偶函数=奇函数$。奇函数在$[-\infty,\infty]$区间内的积分为0。
- 当n为偶数时,令$n=2k$来表示它是偶数阶,则$E(X^n)$可写为:
令$t=\frac{x}{\sigma}$来简化积分,$dx=\sigma dt$:
记$I_{2k}=\int_{-\infty}^{\infty}{t}^{2k}\frac{1}{\sqrt{2\pi}}\exp{[-\frac{t^2}{2}]}dt$,这是标准正态分布的偶数阶矩。它有一个经典递推公式:
其中!!表示双阶乘,对于奇数,它是表示从某一数值开始逐个$-2$阶乘。奇数到1,偶数到2。例如:
将$n=2k$带回原式:
5.高斯分布的中心极限定理
中心极限定理(Central Limit Theorem):当一组独立同分布的随机变量数量足够大时,其平均值的分布将趋近于正态分布(高斯分布),无论原始变量的分布是什么。
中心极限定理可以用骰子的例子来形象地理解。如果手上只有一个骰子,那么它的结果应该是均匀分布的,因为掷到每一面概率相等。但假如手上有2个骰子,将他们的结果加在一起,掷到6,7的概率会增加到最高。因为他们可能是3+3=6,可能是4+2=6,可能是5+1=6…。同时掷到2或12的概率将会变成最低,因为只能是1+1和6+6能得到这两个结果。这样就形成了中间高两端低的PDF,而非原来的均匀分布。当手上的骰子更多时,他们的结果将会越趋近于高斯分布。
6. 多元高斯分布(Multivariate Gaussian)
多元高斯分布是一元高斯分布在多维空间上的推广,常用于描述多个随机变量联合分布的情况。假设有一个服从多元高斯分布的n维随机向量$\mathbf{X}=[X_1,X_2,…X_n]^T$。其PDF为:
其中$\mathbf{C}=E[(\mathbf{x}-E(\mathbf{x}))(\mathbf{x}-E(\mathbf{x}))^T]$,是高斯分布的向量的协方差。
n维随机向量$\mathbf{X}=[X_1,X_2,…X_n]^T$表示一个向量内每一个元素都是一个随机变量。例如包含身高、体重、年龄的3维随机向量。
$E[\mathbf{X}]$为随机向量$\mathbf{X}$的均值向量,$E[\mathbf{X}]=[E(X_1),E(X_2)…E(X_n)]^T$
$\mathbf{x}-E[\mathbf{X}]$是中心化随机向量,将随机向量的每个分量减去自身均值,消除 “整体偏移”,得到围绕原点波动的向量
卡方分布(Chi-Squared)
卡方分布定义为若干个独立标准正态随机变量的平方和:
其中$z_{i} \sim N(0,1)$ 。其中$v$为卡方分布的自由度(degree of freedom, dof),等于独立标准正态随机变量的个数,它表示了构成卡方分布的独立信息的数量。
通常,将自由度为$v$的卡方分布记为$X_v^2$
1.卡方分布的概率密度函数
卡方分布的PDF为:
当自由度$v$较小时 ,卡方分布的概率密度曲线呈现出左偏态,曲线在左侧较为陡峭,右侧有较长的尾巴;随着自由度$v$逐渐增大,卡方分布的概率密度曲线会变得越来越对称,越来越接近正态分布的形状。如下图所示(下图将$v$记作$k$)

$\Gamma(u)$为伽马函数,其通式为:
$\Gamma$有以下性质:
- $\Gamma(u)=(u-1)\Gamma(u-1)$
- $\Gamma(\frac{1}{2})=\sqrt{\pi}$
- 若n是整数,$\Gamma(n)=(n-1)!$
2. 卡方分布的期望与方差
卡方分布的期望$E(x)=v$;方差$Var(x)=2v$。证明如下:
期望:
由于期望有性质$E(\sum_{i = 1}^{v}z_{i}^{2})=\sum_{i = 1}^{v}E(z_{i}^{2})$,因此卡方分布的期望等于$v$个标准正态分布的二阶原点矩期望求和。
标准正态分布二阶原点矩在高斯分布章节中有介绍,当$n=even$时,$E(z_i^n)=1\cdot3\cdot5…\cdot(n-1)\sigma^n\quad=1\times(1)^2=1$
因此卡方分布的期望:
方差:
根据方差与期望的关系式有:$Var(x)=E(X^2)-E^2(X)$。前面已经推出$E(X)=v$。需要求$E(X^2)$。还是将卡方分布展开为标准正态分布求和:
同样地,根据高斯分布偶阶原点矩的公式:$E(Z^2)=1,E(Z^4)=3\times1=3$。因此
因此:$Var(x)=v^2+2v-v^2=2v$
3.卡方分布当$v=2$时退化为指数分布
若$v=2$,则卡方分布的PDF为:
这退化为了指数分布
3.卡方分布的尾数函数
对于随机变量$X_v^2$,其尾数函数$Q_{X_v^2}(x)=\int_x^{\infty}p(t)dt$。这个函数同样需要使用正态分布的尾数函数来简化,简化后有如下规律:
4.非中心卡方分布
非中心卡方分布是中心卡方分布的推广,它是由独立同分布但均值不为零的高斯随机变量的平方和得到的,即$x=\sum_{i=1}^vz_i^2$,$z_i \sim N(\mu_i,1)$。非中心参数$\lambda=\sum_{i=1}^ν\mu_i^2$。
瑞利分布(Raleigh)
瑞利分布是由两个相互独立的,服从$z_1,z_2 \sim N(0,\sigma^2)$的正态分布由$x=\sqrt{z_1^2+z_2^2}$得到的。其PDF为:
均匀分布(Uniform)
1.均匀分布的概率密度函数
均匀分布代表连续的随机变量X在[a,b]内概率密度均匀地分布其中。因此:
2. 均匀分布的概率分布函数
当$a\leq x\leq b$时:
另当$xb$时,$F(x)=1$
3. 均匀分布的期望和方差
均匀分布期望推导如下:
均匀分布方差推导如下:
最小方差无偏估计 (Minimum Variance Unbiased Estimation)
MVUE的基本介绍
MVUE介绍
最小方差无偏估计(MVUE):如其名字,无偏代表估计量的期望等于被估计的真实值,方差最小。这就是MVUE的核心诉求。
方差为0的情况只能在采样无穷的条件下实现。否则最优结果只能是方差最小
一个MVUE的例子
假设现在有一个叠加AWGN的直流信号:$x[n]=A+w[n]$,其中$A$为信号振幅,$w[n]$为均值为零的AWGN。
我们使用“这一系列采样样本的均值”做为估计量。其数学表达式为:$\hat A=\frac{1}{N}\sum_{n=0}^{N-1}x[n]$
无偏性验证:
这个估计量的期望为:
与实际直流信号的的相等,因此说其无偏。
最小方差验证:
这个估计量的方差为:
由于$x[n]$相互独立,根据方差的性质有$Var(c\sum X_i) = c^2\sum Var(X_i)$:
对于这个估计量,其CRLB为$\frac{\sigma^2}{N}$,因此这个方差是最小的。
观察可以发现,当$N\rightarrow \infty$时,$Var(\hat A)=0$,因此说“方差为0的情况只能在采样无穷的条件下实现。否则最优结果只能是方差最小”
估计量也是高斯分布:中心极限定理
根据高斯分布的中心极限定理,当一组独立同分布的随机变量数量足够大时,其平均值的分布将趋近于正态分布(高斯分布),无论原始变量的分布是什么。这恰好就是上面例子中干的事情,因此估计量$\hat A$也是服从高斯分布的随机变量,根据上面的计算,其均值为$A$,方差为$\sigma^2/N$。$\hat A \sim N(A,\frac{\sigma^2}{N})$
这个结果还可以用另一个定理解释:高斯随机变量的和仍是高斯随机变量。
有偏估计与为什么选择最小方差无偏估计
同样地考虑上面的例子,假设我们现在使用有偏估计来估计这个直流信号。估计量为:
其中$a$代表权重,$a\neq 1$。通过$a$来引入偏差。
- 此时的期望$E[\hat A]=aA$。
- 偏差$Bias(\hat A)=aA-A$
- 方差$Var(\hat A)= \frac{a^2}{N^2}\sum_{n=0}^{N-1}Var(x[n]) = \frac{a^2}{N^2} \cdot N\sigma^2 = \frac{a^2\sigma^2}{N}$
- 最小均方误差$MSE=Var(\hat A)+Bias^2(\hat A)=\frac{a^2\sigma^2}{N}-(aA-A)^2=\frac{a^2\sigma^2}{N}+(a-1)^2A^2$
试着使得方差更小:
由$Var(\hat A)=\frac{a^2\sigma^2}{N}$可知,当$a<1$时,有偏估计的方差比无偏估计更小
试着使得MSE更小:
在引入中有介绍:无偏估计的MSE等于方差。而有偏估计的$MSE\frac{a^2\sigma^2}{N}+(a-1)^2A^2$,通过使其导数为0,可以求得一个$a$使得MSE最小:(这是由微积分的极值必要条件得来的:若函数$f(x)$在点$x = x_0$处可导且取得极值,则$f’(x_0) = 0$)
此时的$MSE = \frac{ A^2 \sigma^2 (A^2 + \sigma^2) }{ N \left( A^2 + \sigma^2 / N \right)^2 }$
为什么要使用MVUE:
纵然有偏估计方差会随a减小,但偏差会增大。即使我们通过求导找到 “MSE 最小” 的$a$,这个$a$也依赖于未知的$A$,因此最小 MSE 的有偏估计量理论存在但是它无法实际实现。
有偏估计的最小MSE不可实现的根源在于$Bias(\hat A)=2(a-1)A^2$引入了未知的$A$。那么,对此的解决方案就是放弃 “最小 MSE”,转向 “无偏约束下的最小方差”,即MVUE。由于无偏估计的$Bias(\hat A)=0$,恰好就消除了这个未知的量。
MVUE的存在性:并非所有情况都有MVUE
为什么会没有MVUE

在部分估计中,方差可能会随着被估计值$\theta$变化而变动。不乏出现两种估方式方差交叉的情况。如上图左,有一种估计方差一直最小,因此其有MVUE。而上图右$\theta_2$和$\theta_3$两种估计方式的方差存在了交叉,因此没有恒定的最小方差,因此无MVUE。
一个没有MVUE的例子
假设现有两个独立的观测量:$x[0],x[1]$。他们服从:
假设现在有$\hat \theta_1$和$\hat \theta_2$两种估计方式:
他们的期望分别为:
因此他们是无偏的,最小MSE等于方差。他们的方差为:
当$\theta \geq 0$时:
当$\theta < 0$时:
它的方差长这样:

因此这两种估计在$\theta>0$时和$\theta<0$时的最小方差不一样。故MVUE不存在。
如何寻找MVUE
尽管在最小方差无偏估计(MVUE)存在时,也没有一种 “按部就班” 的流程能找到它。通常来说,有两种方法:一种是知道MVUE长啥样,然后去试你是不是长这样;一种是通过假设线性特性,寻找方差最小的。
- 克拉默 - 拉奥下界(CRLB)法:CRLB是无偏估计量方差的一个下限。如果某个无偏估计量的方差恰好等于这个下界,那它就是 MVUE。可以在算得CRLB后,通过满足CRLB的估计函数的定义$\frac{\partial \ln p(\mathbf{x};\theta)}{\partial \theta} = I(\theta)[g(\mathbf{x}) - \theta]$,逆推估计函数$g(x)$
- 最佳线性无偏估计(BLUE)法:先假设无偏估计量是线性的(即估计量是观测值的线性组合),然后在所有线性无偏估计中,寻找方差最小的那个。不过这种方法有局限性,因为它限制了估计量必须是线性形式,而实际中可能存在非线性的 MVUE。
这两种方法将在下面的笔记中详细探讨。