贝叶斯估计

在前面学习的VMUE、BLUE、MLE、SLE估计中,都假设感被估计的参数是已经确定但未知具体数字的一个常数。但参数可能本身就是一个随机变量,而贝叶斯估计就是为了处理这样的估计量而诞生的。

贝叶斯估计使用一个初始的“先验概率”来表达被估计的参数,然后根据当前观测的数据得到“后验概率”。这次的后验概率会作为下一次估计的先验概率,因此贝叶斯估计可以使用序列数据进行迭代。

贝叶斯估计为最小方差无偏估计(MVUE)提供了另一种替代方法。当 MVUE 无法找到时,这很有用。

贝叶斯定理

设(\hat{\theta}(\mathbf{x}))为信号观测(\mathbf{x})的参数(\theta)的估计器。假设观测和随机参数的联合概率密度函数$p(\mathbf{x},\theta)$是已知的。贝叶斯定理告诉我们:

还可以把它写成:

其中:

  • $p(\theta)$是先验PDF,表示在拿到观测数据之前对随机变量$\theta$的主观PDF;
  • (p(\mathbf{x}|\theta))是给定(\theta)时(\mathbf{x})的 PDF,或称似然函数,表示数据在给定估计$\theta$下出现的可能性
  • $p(x)$是是边缘概率密度,是所有可能的估计值$\theta$下数据的加权平均概率,$p(x)=\int p(x|\theta)p(\theta)d\theta$
  • (p(\theta|\mathbf{x}))是给定(\mathbf{x})时(\theta)的 PDF,又称后验证概率,是拿到数据$x$后对估计$\theta$的更新结果

贝叶斯估计的核心思想,是通过已有的知识与新获得的证据,来推断某个参数的取值。

风险函数(Risk Functions)

是什么

假设在估计误差中存在 “要付出的代价” 或成本,我们的目标是寻求代价最少,可以通过引入成本函数(C(\hat{\theta},\theta))来量化这一点,量化后更方便寻找极值点。

对于标量估计,常用的代价函数是

  • 二次误差:(C(\hat{\theta},\theta)=(\hat{\theta}-\theta)^2)。
  • 绝对误差:(C(\hat{\theta},\theta)=|\hat{\theta}-\theta|)。
  • 命中或未命中误差:(C(\hat{\theta},\theta)=\begin{cases}1, & |\hat{\theta}-\theta|>\delta \\ 0, & |\hat{\theta}-\theta|<\delta\end{cases})

二次误差函数在实践中较为常用,它能求得小均方误差(MMSE)估计器,且在解析上很方便。

平均代价与总代价

现在考虑在给定观测(\mathbf{x})的情况下,一组估计(\hat{\theta}(\mathbf{x}))的平均代价是对参数所有可能值取平均后的条件代价:

贝叶斯风险

贝叶斯风险是通过对所有(\mathbf{x})和(\theta)的成本函数取平均得到的,它是总平均的代价。

使贝叶斯风险最小的估计器(\hat{\theta}(\mathbf{x}))称为贝叶斯估计器。要使贝叶斯风险最小,对每个固定的观测 (\mathbf{x}),选择 (\hat{\boldsymbol{\theta}}(\mathbf{x})) 使得条件代价 (C(\hat{\boldsymbol{\theta}}|\mathbf{x})) 最小。

一个贝叶斯风险最小化的例子:MMSE估计

条件代价定义为:(C(\hat{\theta}|\mathbf{x}) = \int (\hat{\theta} - \theta)^2 \, p(\theta|\mathbf{x}) d\theta)。(p(\theta|\mathbf{x})) 是参数 (\theta) 关于观测 (\mathbf{x}) 的后验概率密度,代价是 “估计值(\hat{\theta})与真实值(\theta)的平方误差” 的后验期望。

要最小化 (C(\hat{\theta}|\mathbf{x})),将其对 (\hat{\theta}) 求导并令导数为 0:

由于后验概率密度满足归一性 (\int p(\theta|\mathbf{x})d\theta = 1),因此导数简化为:

将估计器$\hat \theta$整理到一侧得:

上式的积分正是后验概率密度的均值,即:(\hat{\theta} = E\{\theta | \mathbf{x}\})

这说明:二次代价下,贝叶斯估计量(MMSE 估计量)等于参数(\theta)关于观测(\mathbf{x})的后验期望。

一般来说,不同的代价函数会导致不同的贝叶斯估计量。事实证明,对于某些后验概率密度函数(如高斯分布),不同的代价函数可能产生相同的估计量。

先验知识在估计中的作用

在估计理论中有一个基本规则:利用先验知识会得到更准确的估计。例如,如果一个参数被限制在已知区间内,那么任何好的估计量都应该只产生位于该区间内的估计值。

在贝叶斯估计中,一旦选择了先验概率密度函数(PDF),贝叶斯估计量可以直接从后验概率密度函数得出。这里不存在MVUE那样的存在性问题。唯一的实际障碍是后验概率密度函数的统计量(例如$\hat \theta=E\{\theta|x\}$)是否能够以闭式形式确定。

例子

Ex8.1:白高斯噪声(WGN)中直流电平的贝叶斯估计(均匀先验)

问题:观测模型为 (x[n] = A + w[n])((n=0,1,…,N-1)),(w[n]) 是方差为(\sigma^2)的白高斯噪声

已知先验概率密度:(p(A) = \begin{cases} \frac{1}{2A_0}, & |A| \leq A_0 \\ 0, & |A| > A_0 \end{cases})(A在([-A_0, A_0])上均匀分布);

估计直流电平A。

由于是高斯噪声,观测量的条件PDF是:

根据 MMSE 估计量的定义(后验均值):(\hat{A} = E\{A | \mathbf{x}\} = \frac{\int A \, p(\mathbf{x}|A) p(A) dA}{\int p(\mathbf{x}|A) p(A) dA})

将(p(A))和(p(\mathbf{x}|A))代入,由于(p(A))仅在([-A_0, A_0])非零,积分限变为([-A_0, A_0]):

分子分母的公共因子((\frac{1}{(2\pi\sigma^2)^{N/2}} \cdot \frac{1}{2A_0}))可约去,简化为:

利用平方和展开公式:(\sum_{n=0}^{N-1} (x[n]-A)^2 = N(A - \bar{x})^2 + N(\overline{x^2} - \bar{x}^2))其中:

  • (\bar{x} = \frac{1}{N}\sum_{n=0}^{N-1} x[n])(样本均值);
  • (\overline{x^2} = \frac{1}{N}\sum_{n=0}^{N-1} x[n]^2)(样本二阶矩)。

由于 (N(\overline{x^2} - \bar{x}^2)) 与A无关,指数项中的这一项可作为常数提出积分(分子分母的常数会约去),因此积分简化为:

积分计算(利用误差函数(\text{erf}(x)))

令 (t = \sqrt{\frac{N}{2\sigma^2}} (A - \bar{x})),则 (A = \bar{x} + t \cdot \sqrt{\frac{2\sigma^2}{N}}),(dA = \sqrt{\frac{2\sigma^2}{N}} dt)。

代入分子积分:

其中 (t_1 = -\sqrt{\frac{N}{2\sigma^2}} (A_0 + \bar{x})),(t_2 = \sqrt{\frac{N}{2\sigma^2}} (A_0 - \bar{x}))。

拆分积分并利用(\int t \exp(-t^2)dt = -\frac{1}{2}\exp(-t^2))、(\int \exp(-t^2)dt = \frac{\sqrt{\pi}}{2}\text{erf}(t)),最终化简得:

  • 当观测数N很大时:(\hat{A} \approx \bar{x})(估计由样本均值主导);
  • 当先验分布很宽((A_0 \to \infty)):(\hat{A} \approx \bar{x})(估计由样本均值主导)。

最大后验估计(Maximum a Posteriori Estimation MAP)

是什么

MAP是代价函数是0-1函数下的贝叶斯估计。即:“估计值与真实值的偏差是否超过阈值(\delta)”

若估计值(\hat{\theta})与真实值(\theta)的差距小于(\delta),代价为 0(“命中”);否则代价为 1(“未命中”)。

由于条件代价是 “代价函数关于后验分布的期望”,即:(C(\hat{\theta}|\mathbf{x}) = \int C(\hat{\theta},\theta) p(\theta|\mathbf{x}) d\theta)

代入 0-1 代价函数的定义,积分可拆分为 “偏差超过(\delta)” 和 “偏差小于(\delta)” 两部分:

由于后验分布满足归一性(\int_{-\infty}^{\infty} p(\theta|\mathbf{x}) d\theta = 1),因此条件代价可改写为:

那么,要最小化(C(\hat{\theta}|\mathbf{x})),等价于最大化积分项(\int_{\hat{\theta}-\delta}^{\hat{\theta}+\delta} p(\theta|\mathbf{x}) d\theta)。

当(\delta)很小时((\delta \to 0)),积分项近似为 “后验密度在(\hat{\theta})处的取值 × 区间长度(2\delta)”:

由于(2\delta)是常数,最大化积分项等价于最大化后验概率密度(p(\theta|\mathbf{x}))。

因此,0-1 代价下的贝叶斯估计量是后验概率密度的众数(Mode),即:

MAP和MLE

MLE 是 MAP 的特殊情况 —— 当先验(p(\theta))为 “无信息先验”(如均匀分布,(\ln p(\theta))为常数)时,MAP 估计退化为 MLE((\hat{\theta}_{\text{MAP}} = \arg\max \ln p(\mathbf{x}|\theta) = \hat{\theta}_{\text{MLE}}))。

MAP 不需要计算后验分布的积分(仅需最大化后验密度),计算复杂度通常低于 MMSE 估计。

数个例子

ex8.3:指数PDF

问题:观测(x[n])((n=0,…,N-1))是独立同分布(IID)的指数分布,似然为:

先验分布(p(\theta))是指数分布:

寻找其MAP。

1. 构造对数似然+对数先验

想想贝叶斯公式:$p(\theta|\mathbf{x})=\frac{p(\mathbf{x}|\theta)p(\theta)}{p(\mathbf{x})}$,后验概率要最大,就是要求到最大的$p(\mathbf{x}|\theta)p(\theta)$。

对贝叶斯公式两边取对数:

但 (\ln p(\mathbf{x})) 是与(\theta)无关的常数((p(\mathbf{x}))是观测数据的边缘分布,不包含参数(\theta)),因此在 “最大化(\ln p(\theta|\mathbf{x}))” 的过程中,(\ln p(\mathbf{x}))可以被忽略。最终得到:

首先观测量的联合似然函数(IID 样本的似然是各样本似然的乘积):

取对数:

再计算对数先验:(\ln p(\theta) = \ln \lambda - \lambda \theta)

2.寻找对数后验的最大值

对数后验为:

对(\theta)求导并令导数为 0:

整理导数为 0 的方程:

这样,我们就求到了最大后验估计。

  • 当观测数(N \to \infty)时:(\frac{\lambda}{N} \to 0),(\hat{\theta} \to \frac{1}{\bar{x}})(退化为 MLE);
  • 当先验强度(\lambda \to 0)时:先验变得 “无信息”,(\hat{\theta} \to \frac{1}{\bar{x}})(也退化为 MLE)。

Ex.8.4估计均匀先验概率下的WGN中DC电平

观测量(x[n] = A + w[n])((w[n])是 WGN,方差(\sigma^2)).

先验(p(A))是([-A_0, A_0])上的均匀分布,后验分布满足:

MAP分析

后验分布的核是 “关于(\bar{x})的高斯分布”,其最大值出现在均值(\bar{x})处(高斯分布的钟型曲线顶端),但先验限制了A的范围是([-A_0, A_0]),因此:

  • 若(\bar{x} < -A_0):后验密度的最大值在(A=-A_0)处;
  • 若(-A_0 \leq \bar{x} \leq A_0):后验密度的最大值在(A=\bar{x})处;
  • 若(\bar{x} > A_0):后验密度的最大值在(A=A_0)处。

最终 MAP 估计量为: