引入

课程引入

统计信号处理(Statistical Signal Processing)是电磁学、通信、雷达、声纳、控制、图像分析等领域的核心课程之一,它将概率论与数理统计的理论工具应用于信号的建模、估计、检测与滤波。

在本科阶段学习的信号处理课程中,例如DSP,并没有真正的考虑噪声的影响。但真实的世界充斥着噪声,这就是这门课存在的意义。这门课将使用统计理论,使用某种方法来估算该兴趣的量,并确定这种估算的准确性。

估计理论可以被用来:1、估计扰动和系统参数(例如噪声方差、信道参数等)2、估计信号参数(幅度、频率、时间延迟、多普勒、方位角等)3、估计信号波形

这门课中的符号

在这门课中:

  • $\mathbf{X}$表示观测矩阵
  • $\mathbf{\theta}$表示参数向量(即,用来被估计的原始值)
  • $\hat \theta(x)$表示对某个数据进行估计,有时用$\hat \theta$来直接表示估计后的数据,它是一个向量。
  • $\epsilon(x)=\hat \theta(x)-\theta$表示估计误差,这是一个随机量
  • 均方差(Mean-Square Error) $MSE=E\{\epsilon^T(x)\epsilon(x)\}$

概率估计中的常见概念

偏差(bias):

偏差$b(\theta)$是一个估计量与真实参数之间的差,它衡量了估计值与真实值之间的接近程度。对于偏差一个例子是:就像你用一个仪器多次测量一个长度 $L$,每次测量值是随机的(受噪声影响),但你可以计算这些测量值的平均值 $E[\hat{L}]$,然后问:这个仪器的平均测量值偏离真实长度 $L$ 多少?这就是偏差。对于本课的信号估计而言,偏差公式中的$\theta$是样本信号的均值。

如果在大量观测下$b(\theta)=0$,则称其为无偏的(unbiased );否则则为有偏(biased),有偏通常取决于观测值的数量。许多无偏估计的平均值将更接近真实值,但是这并不意味无偏估计相较于有偏估计有更小的误差。

一个偏差的例子

试想一个直流信号(下图红色),经过噪声影响后,它变成了下面的波浪线(红色线上面叠加那条)。波浪信号的期望与DC信号的均值相同,则此为无偏的。如果是下方那条波浪线,它的期望是小于DC信号的均值,则它是有偏的。

image-20250827211249151

一致性(Consistency):

在样本数量趋于无穷时,如果估计量的均方差(MSE)趋于0,则称该估计量是一致的。不一致的估计在样本数量有限时仍能提供有意义的估计,但是其估计精度并不会随着样本数量提升而提升。

对于偏差,就算样本数量只有寥寥几个甚至1个,它的估计结果都有可能是无偏的。但是要使统计的MSE=0,只能是样本趋于无穷时,任意有限的样本MSE都不可能等于0,除非这不是一个随机量。

效率(Efficiency):

这个效率并非计算效率之类的,这是统计信号处理里的特殊概念。估计效率是衡量一个估计量在给定信息量下的“好坏”的指标。直观来说,它反映了估计量的方差是否接近理论最小值。

这里需要引入另一个概念:克拉默-拉奥下界(Cramer-Rao Lower Bound, CRLB) 是无偏估计量方差的理论下界,它告诉我们在满足一定正则条件下,任何无偏估计量的方差都不可能低于这个界限。如果一个无偏估计的方差等于CRLB,则称其为最优的。

由于$MSE=Var(\hat \theta)+(E\{\hat \theta\}-\theta)^2$(这个公式将在介绍CRLB时详细推导)。而无偏估计的$E\{\hat \theta\}-\theta=0$,因此,当这个估计是无偏估计时,MSE的理论下界也是CRLB。

当一个估计量的MSE=CRLB时,则称该估计是有效率的。对于一个有效的估计,CRLB是最小的均方误差。

对于许多问题,有效估计是不存在的。

Recall:常见的概率分布

概率论基础知识

概率论基础

随机变量(Random Variable):随机变量是一个函数,它将样本空间中每一个可能得结果映射为一个实数。就像是掷骰子的点数,它可能是1-6,这是样本空间;定义掷骰子这个事情为一个随机变量,那么这个随机变量的值就是掷的点数。随机变量的值并非固定的。

概率分布函数(Cumulative Distribution Function, CDF):表示随机变量$X$小于或等于某个值$x$的概率:$F(x)=P(X\leq x)$。概率分布函数是单调不减的,且$\lim _{x\rightarrow-\infty}F(x)=0$,$\lim _{x\rightarrow+\infty}F(x)=1$。概率分布函数是概率密度函数的积分。

概率密度函数(Probability Density Function, PDF):通常使用$f(x)$或者$p(x)$来表示。它表示随机变量取值的概率分布情况,它就像是随机变量的值等于数轴上某一值的概率的“浓度”。或者说,它是概率分布函数的“斜率”,如果概率分布函数的斜率越大,则说明在随机变量落在数轴的这一点的概率越大,落在这一点的概率“越浓”(但PDF数值上并不等于随机变量落在该点的概率)。要求一个连续随机变量在某个区间[a,b]内分布的概率,可以用$\int^b_af(x)dx$得到。

联合概率密度函数:

高斯分布(Gaussian/Normal)

高斯是最重要的一个分布

1.高斯分布的PDF

高斯分布的PDF为:

高斯分布-CSDN博客

其中:

  • $\mu$是高斯分布的均值,控制钟型曲线的中心。
  • $\sigma^2$是高斯分布的方差,控制曲线更突出还是更均匀
  • 高斯分布常记作x~N($\mu$,$\sigma^2$)。标准高斯分布为x~N(0,1)

标准高斯分布分PDF为:

2.高斯分布的CDF与$\phi$函数

高斯分布的CDF应使用PDF积分$\int_{-\infty}^x\frac{1}{\sqrt{2\pi}\sigma_X}e^{-(x-\mu)^2/2\sigma^2}$,但这个积分没有解析解。因此常用标准高斯分布的CDF来迁移计算PDF。标准高斯分布的CDF为:

它表示标准正态随机变量小于等于x的概率。$\phi(x)$ 没有初等函数的解析表达式,通常通过数值积分或误差函数$ erf(x) $来近似计算:

将$\phi(x)$替换为$\phi(\frac{x-\mu}{\sigma})$即可计算任意高斯分布的CDF。例如计算$\mu=175$,$\sigma=7$的高斯分布大于180的概率,使用$\phi(\frac{180-175}{7})$,然后查表拿到$\phi$的值即可。

$\phi$函数具有如下性质:

  • $\phi(-x)=1-\phi(x)$
  • $\phi(x)|_{x\rightarrow \infty}=1$
  • $\phi(x)|_{x\rightarrow -\infty}=0$
  • 单调递增

3.高斯分布的尾数函数Q

另一个高斯分布常用的函数是尾数函数(Q function/ right-tail probability function):

其代表的是高斯分布的随机变量$X$大于某一$x$的概率。$Q(x)$具有如下性质:

  • $Q(-x)=1-Q(x)$
  • $Q(0)=0.5$
  • $Q(-\infty)=1$
  • $Q(\infty)=0$
  • 单调递减

4.高斯分布的原点矩与中心矩

高斯分布的原点矩具有如下特性:

这是由于高斯分布是关于均值对称的,奇数阶原点矩具有反对称性,积分结果为 0;偶数阶原点矩与方差相关。推导证明如下:

  • 当n为奇数时,对于函数$f(x)=x^n$有$f(-x)=(-x)^n=-(x^n)$,其是奇函数。而高斯分布的PDF$p(x)$是偶函数,因此$x^np(x)$是$奇函数 \times 偶函数=奇函数$。奇函数在$[-\infty,\infty]$区间内的积分为0。
  • 当n为偶数时,令$n=2k$来表示它是偶数阶,则$E(X^n)$可写为:

令$t=\frac{x}{\sigma}$来简化积分,$dx=\sigma dt$:

记$I_{2k}=\int_{-\infty}^{\infty}{t}^{2k}\frac{1}{\sqrt{2\pi}}\exp{[-\frac{t^2}{2}]}dt$,这是标准正态分布的偶数阶矩。它有一个经典递推公式:

其中!!表示双阶乘,对于奇数,它是表示从某一数值开始逐个$-2$阶乘。奇数到1,偶数到2。例如:

将$n=2k$带回原式:

5.高斯分布的中心极限定理

中心极限定理(Central Limit Theorem):当一组独立同分布的随机变量数量足够大时,其平均值的分布将趋近于正态分布(高斯分布),无论原始变量的分布是什么。

中心极限定理可以用骰子的例子来形象地理解。如果手上只有一个骰子,那么它的结果应该是均匀分布的,因为掷到每一面概率相等。但假如手上有2个骰子,将他们的结果加在一起,掷到6,7的概率会增加到最高。因为他们可能是3+3=6,可能是4+2=6,可能是5+1=6…。同时掷到2或12的概率将会变成最低,因为只能是1+1和6+6能得到这两个结果。这样就形成了中间高两端低的PDF,而非原来的均匀分布。当手上的骰子更多时,他们的结果将会越趋近于高斯分布。

6. 多元高斯分布(Multivariate Gaussian)

多元高斯分布是一元高斯分布在多维空间上的推广,常用于描述多个随机变量联合分布的情况。假设有一个服从多元高斯分布的n维随机向量$\mathbf{X}=[X_1,X_2,…X_n]^T$。其PDF为:

其中$\mathbf{C}=E[(\mathbf{x}-E(\mathbf{x}))(\mathbf{x}-E(\mathbf{x}))^T]$,是高斯分布的向量的协方差。

n维随机向量$\mathbf{X}=[X_1,X_2,…X_n]^T$表示一个向量内每一个元素都是一个随机变量。例如包含身高、体重、年龄的3维随机向量。

$E[\mathbf{X}]$为随机向量$\mathbf{X}$的均值向量,$E[\mathbf{X}]=[E(X_1),E(X_2)…E(X_n)]^T$

$\mathbf{x}-E[\mathbf{X}]$是中心化随机向量,将随机向量的每个分量减去自身均值,消除 “整体偏移”,得到围绕原点波动的向量

卡方分布(Chi-Squared)

卡方分布定义为若干个独立标准正态随机变量的平方和:

其中$z_{i} \sim N(0,1)$ 。其中$v$为卡方分布的自由度(degree of freedom, dof),等于独立标准正态随机变量的个数,它表示了构成卡方分布的独立信息的数量。

通常,将自由度为$v$的卡方分布记为$X_v^2$

1.卡方分布的概率密度函数

卡方分布的PDF为:

当自由度$v$较小时 ,卡方分布的概率密度曲线呈现出左偏态,曲线在左侧较为陡峭,右侧有较长的尾巴;随着自由度$v$逐渐增大,卡方分布的概率密度曲线会变得越来越对称,越来越接近正态分布的形状。如下图所示(下图将$v$记作$k$)

$\Gamma(u)$为伽马函数,其通式为:

$\Gamma$有以下性质:

  • $\Gamma(u)=(u-1)\Gamma(u-1)$
  • $\Gamma(\frac{1}{2})=\sqrt{\pi}$
  • 若n是整数,$\Gamma(n)=(n-1)!$

2. 卡方分布的期望与方差

卡方分布的期望$E(x)=v$;方差$Var(x)=2v$。证明如下:

期望:

由于期望有性质$E(\sum_{i = 1}^{v}z_{i}^{2})=\sum_{i = 1}^{v}E(z_{i}^{2})$,因此卡方分布的期望等于$v$个标准正态分布的二阶原点矩期望求和。

标准正态分布二阶原点矩在高斯分布章节中有介绍,当$n=even$时,$E(z_i^n)=1\cdot3\cdot5…\cdot(n-1)\sigma^n\quad=1\times(1)^2=1$

因此卡方分布的期望:

方差:

根据方差与期望的关系式有:$Var(x)=E(X^2)-E^2(X)$。前面已经推出$E(X)=v$。需要求$E(X^2)$。还是将卡方分布展开为标准正态分布求和:

同样地,根据高斯分布偶阶原点矩的公式:$E(Z^2)=1,E(Z^4)=3\times1=3$。因此

因此:$Var(x)=v^2+2v-v^2=2v$

3.卡方分布当$v=2$时退化为指数分布

若$v=2$,则卡方分布的PDF为:

这退化为了指数分布

3.卡方分布的尾数函数

对于随机变量$X_v^2$,其尾数函数$Q_{X_v^2}(x)=\int_x^{\infty}p(t)dt$。这个函数同样需要使用正态分布的尾数函数来简化,简化后有如下规律:

4.非中心卡方分布

非中心卡方分布是中心卡方分布的推广,它是由独立同分布但均值不为零的高斯随机变量的平方和得到的,即$x=\sum_{i=1}^vz_i^2$,$z_i \sim N(\mu_i,1)$。非中心参数$\lambda=\sum_{i=1}^ν\mu_i^2$。

瑞利分布(Raleigh)

瑞利分布是由两个相互独立的,服从$z_1,z_2 \sim N(0,\sigma^2)$的正态分布由$x=\sqrt{z_1^2+z_2^2}$得到的。其PDF为:

均匀分布(Uniform)

1.均匀分布的概率密度函数

均匀分布代表连续的随机变量X在[a,b]内概率密度均匀地分布其中。因此:

2. 均匀分布的概率分布函数

当$a\leq x\leq b$时:

另当$xb$时,$F(x)=1$

3. 均匀分布的期望和方差

均匀分布期望推导如下:

均匀分布方差推导如下:

最小方差无偏估计 (Minimum Variance Unbiased Estimation)

MVUE的基本介绍

MVUE介绍

最小方差无偏估计(MVUE):如其名字,无偏代表估计量的期望等于被估计的真实值,方差最小。这就是MVUE的核心诉求。

方差为0的情况只能在采样无穷的条件下实现。否则最优结果只能是方差最小

一个MVUE的例子

假设现在有一个叠加AWGN的直流信号:$x[n]=A+w[n]$,其中$A$为信号振幅,$w[n]$为均值为零的AWGN。

我们使用“这一系列采样样本的均值”做为估计量。其数学表达式为:$\hat A=\frac{1}{N}\sum_{n=0}^{N-1}x[n]$

无偏性验证:

这个估计量的期望为:

与实际直流信号的的相等,因此说其无偏。

最小方差验证:

这个估计量的方差为:

由于$x[n]$相互独立,根据方差的性质有$Var(c\sum X_i) = c^2\sum Var(X_i)$:

对于这个估计量,其CRLB为$\frac{\sigma^2}{N}$,因此这个方差是最小的。

观察可以发现,当$N\rightarrow \infty$时,$Var(\hat A)=0$,因此说“方差为0的情况只能在采样无穷的条件下实现。否则最优结果只能是方差最小”

估计量也是高斯分布:中心极限定理

根据高斯分布的中心极限定理,当一组独立同分布的随机变量数量足够大时,其平均值的分布将趋近于正态分布(高斯分布),无论原始变量的分布是什么。这恰好就是上面例子中干的事情,因此估计量$\hat A$也是服从高斯分布的随机变量,根据上面的计算,其均值为$A$,方差为$\sigma^2/N$。$\hat A \sim N(A,\frac{\sigma^2}{N})$

这个结果还可以用另一个定理解释:高斯随机变量的和仍是高斯随机变量。

有偏估计与为什么选择最小方差无偏估计

同样地考虑上面的例子,假设我们现在使用有偏估计来估计这个直流信号。估计量为:

其中$a$代表权重,$a\neq 1$。通过$a$来引入偏差。

  • 此时的期望$E[\hat A]=aA$。
  • 偏差$Bias(\hat A)=aA-A$
  • 方差$Var(\hat A)= \frac{a^2}{N^2}\sum_{n=0}^{N-1}Var(x[n]) = \frac{a^2}{N^2} \cdot N\sigma^2 = \frac{a^2\sigma^2}{N}$
  • 最小均方误差$MSE=Var(\hat A)+Bias^2(\hat A)=\frac{a^2\sigma^2}{N}-(aA-A)^2=\frac{a^2\sigma^2}{N}+(a-1)^2A^2$

试着使得方差更小:

由$Var(\hat A)=\frac{a^2\sigma^2}{N}$可知,当$a<1$时,有偏估计的方差比无偏估计更小

试着使得MSE更小:

在引入中有介绍:无偏估计的MSE等于方差。而有偏估计的$MSE\frac{a^2\sigma^2}{N}+(a-1)^2A^2$,通过使其导数为0,可以求得一个$a$使得MSE最小:(这是由微积分的极值必要条件得来的:若函数$f(x)$在点$x = x_0$处可导且取得极值,则$f’(x_0) = 0$)

此时的$MSE = \frac{ A^2 \sigma^2 (A^2 + \sigma^2) }{ N \left( A^2 + \sigma^2 / N \right)^2 }$

为什么要使用MVUE:

纵然有偏估计方差会随a减小,但偏差会增大。即使我们通过求导找到 “MSE 最小” 的$a$,这个$a$也依赖于未知的$A$,因此最小 MSE 的有偏估计量理论存在但是它无法实际实现。

有偏估计的最小MSE不可实现的根源在于$Bias(\hat A)=2(a-1)A^2$引入了未知的$A$。那么,对此的解决方案就是放弃 “最小 MSE”,转向 “无偏约束下的最小方差”,即MVUE。由于无偏估计的$Bias(\hat A)=0$,恰好就消除了这个未知的量。

MVUE的存在性:并非所有情况都有MVUE

为什么会没有MVUE

image-20250923162203902

在部分估计中,方差可能会随着被估计值$\theta$变化而变动。不乏出现两种估方式方差交叉的情况。如上图左,有一种估计方差一直最小,因此其有MVUE。而上图右$\theta_2$和$\theta_3$两种估计方式的方差存在了交叉,因此没有恒定的最小方差,因此无MVUE。

一个没有MVUE的例子

假设现有两个独立的观测量:$x[0],x[1]$。他们服从:

假设现在有$\hat \theta_1$和$\hat \theta_2$两种估计方式:

他们的期望分别为:

因此他们是无偏的,最小MSE等于方差。他们的方差为:

当$\theta \geq 0$时:

当$\theta < 0$时:

它的方差长这样:

image-20250923162046064

因此这两种估计在$\theta>0$时和$\theta<0$时的最小方差不一样。故MVUE不存在。

如何寻找MVUE

尽管在最小方差无偏估计(MVUE)存在时,也没有一种 “按部就班” 的流程能找到它。通常来说,有两种方法:一种是知道MVUE长啥样,然后去试你是不是长这样;一种是通过假设线性特性,寻找方差最小的。

  • 克拉默 - 拉奥下界(CRLB)法:CRLB是无偏估计量方差的一个下限。如果某个无偏估计量的方差恰好等于这个下界,那它就是 MVUE。可以在算得CRLB后,通过满足CRLB的估计函数的定义$\frac{\partial \ln p(\mathbf{x};\theta)}{\partial \theta} = I(\theta)[g(\mathbf{x}) - \theta]$,逆推估计函数$g(x)$
  • 最佳线性无偏估计(BLUE)法:先假设无偏估计量是线性的(即估计量是观测值的线性组合),然后在所有线性无偏估计中,寻找方差最小的那个。不过这种方法有局限性,因为它限制了估计量必须是线性形式,而实际中可能存在非线性的 MVUE。

这两种方法将在下面的笔记中详细探讨。