EE7402-Statistical-Signal-Processing-Part2-2-统计决策理论
引入
检测问题的 “难易程度” 直接取决于我们对信号和噪声 pdf 的了解程度:
- 如果能完全掌握信号和噪声的PDF,理论上可以设计出最优检测器(性能最好的检测器)
- 而噪声PDF无法完全已知时,此时设计 “好的检测器” 会更困难,且一般无法达到 “最优”,只能追求 “尽可能好” 的次优解。
在设计检测器时,需要将噪声的PDF假设为数学上可处理的,高斯PDF就是其中典中典的一个假设。
在这个章节中,会介绍基于Neyman-Pearson方法设计的检测器与基于贝叶斯方法设计的检测器。
- NP方法完全依赖采样信号(无先验信息)。在声呐、雷达领域应用广泛(这类场景中,我们往往没有 “信号出现概率” 的先验知识,只能通过采样数据做决策。)
- 贝叶斯方法使用先验知识(例如信号中0和1被传递的概率,发送的信号波形的波形样子等),结合后期采样信号来优化贝叶斯风险,使其最小化。贝叶斯方法在通信领域往往更实用(因为通信中信号波形通常是既定的,我们可以利用 “信号出现概率” 等先验信息优化检测)
(本章节会花更多时间介绍NP方法。)
奈曼-皮尔逊方法(Neyman-Pearson Approach)
引入:二元假设检验
假设我们收到的信号有两种,$H_0$或$H_1$,信道中存在WGN。此时我们根据观测量决策时,有两类错误:
- 当发送$H_0$决策为了$H_1$时,称为一类错误。虚警概率((P_{\text{FA}}))( 比如雷达系统中 “没有目标却误报有目标” 的概率。)
- 当发送$H_1$决策为了$H_0$时,称为二类错误。也叫漏检概率((P_{\text{M}}))(比如雷达系统中 “有目标却没检测到” 的概率。)
如果信号$H_0$时电平为$a_2$的,信号$H_1$电平为$a_1$,那么我们的观测量条件PDF就会如下图所示。左侧是发送$H_0$时,观测量的PDF,记为$p(x;H_0)$。左侧是发送$H_1$时,观测量的PDF,记为$p(x;H_1)$。

我们假设现在有一个阈值$\gamma_0$,根据阈值它判为归属$H_0$还是$H_1$。若把阈值调高,第一类错误(虚警)的概率会减小,但第二类错误(漏检)的概率会增大;反之亦然。或许科学一些的做法就是取上图中$\frac{a_1+a_2}{2}$的位置。
但是,实际应用中或许有:”你可以赢我上百次,但是只要你输一次就就寄了”的情况。因此这个阈值或许并非在最中央,而是由人为决定的。这也就是NP方法:确定虚警概率,通过特定的检测方法来判决。
NP方法的核心理念
在NP方法中,我们固定一个错误的概率为定值,然后去优化另一个值。这里是将虚警概率 (P(\mathcal{H}_1;\mathcal{H}_0))(或称$P_{FA}$)的定为某一值 (\alpha);再最大化正确检测到信号的概率$P_D$。$P_D=1-P(H_0;H_1)=P(H_1;H_1)$
换句话说,就是在“虚警概率不超过(\alpha)” 的约束下,尽可能多地检测到真实信号。这个$\alpha$又称显著性水平。
NP方法:以二元检测为例
继续来看前面二元检测的例子。
虚警概率的表达式
首先我们将$P_{FA}$定为$\alpha$。若裁决阈值是$\gamma$, $P_{FA}=P(H_1;H_0)=P(x[0]>\gamma;H_0)$,即,虚警的概率是在发送$H_0$时,观测PDF超过$\gamma$的区域。即下图红色区域

因此虚警概率可以用高斯分布的尾数函数Q function求出来:
临界区域
在假设检验中,检测器的作用是将观测数据集$\{x[0],x[1]…x[n]\}$映射为决策(选择(\mathcal{H}_0)或(\mathcal{H}_1))。为了形式化这个过程,引入 “临界区域” 的概念:
- 临界区域(R_1):所有使检测器决策为(\mathcal{H}_1)(或 “拒绝(\mathcal{H}_0)”)的数据集合,即 (R_1 = \{\mathbf{x}: \text{decide } \mathcal{H}_1\})。
- 补集区域(R_0):所有使检测器决策为(\mathcal{H}_0)(或 “拒绝(\mathcal{H}_1)”)的数据集合,即 (R_0 = \{\mathbf{x}: \text{decide } \mathcal{H}_0\}),且(R_0 \cup R_1 = \mathbb{R}^N)((\mathbb{R}^N)是所有可能数据的空间)。
$R_1$和$R_2$就分别对应下图$\gamma_0$的左侧和右侧。

将各个概率表达式化
虚警概率(P_{\text{FA}})是 “(\mathcal{H}_0)为时,数据落在(R_1)的概率”,即:
检测概率(P_D)是 “(\mathcal{H}_1)为真时,数据落在(R_1)的概率”,即 :
下图中蓝色区域就是$P_{FA}$,绿色区域就是$P_D$(注意绿色区域有一部分被蓝色遮挡)。

在二元决策中,有4类决策结果:
- 是$H_1$但决策为$H_0$;
- 是$H_1$且决策为$H_1$;
- 是$H_0$但决策为$H_1$;
- 是$H_0$且决策为$H_0$;
(P_{FA})(虚警概率,Probability of False Alarm):对应 “是(\mathcal{H}_0)但决策为(\mathcal{H}_1)” ;
(P_D)(检测概率,Probability of Detection):对应 “是(\mathcal{H}_1)且决策为(\mathcal{H}_1)” ;
“是(\mathcal{H}_1)但决策为(\mathcal{H}_0)” 的概率称为漏检概率((P_M),Probability of Miss),满足(P_M = 1 - P_D)。
“是(\mathcal{H}_0)且决策为(\mathcal{H}_0)” 的概率称为正确拒绝概率,满足(1 - P_{FA})。
NP方法的决策规则:似然比检验
要找到最大化的$P_D$,就是找到一个合适的临界区域(R_1)。为了找到 “最佳临界区域(R_1)”,NP 定理给出了最优决策规则,核心是似然比(Likelihood Ratio)。
似然比(L(\mathbf{x}))定义为 “(\mathcal{H}_1)的似然度与(\mathcal{H}_0)的似然度之比”,即:
对于一个单次观测量,它比的就是在条件PDF下,观测量的值$x[0]$处$p(\mathbf{x};\mathcal{H}_1)$更大还是$p(\mathbf{x};\mathcal{H}_0)$更大(这对应地代表是$H_1$的概率更大还是$H_0$的概率更大)。如果前者更大则$L(x[0])>1$,反之则小于,一样大时等于1。对于多次观测的向量(\mathbf{x} = \{x[0], x[1], \dots, x[N-1]\}),似然比(L(\mathbf{x}))的本质仍是 “(\mathcal{H}_1)下联合概率密度与(\mathcal{H}_0)下联合概率密度的比值”,即
若观测样本独立同分布,则联合概率密度可分解为各样本概率密度的乘积,此时似然比可简化为多次观测的似然比等于各单次观测似然比的乘积:
其物理意义与单次观测一致:量化 “整个观测向量(\mathbf{x})来自(\mathcal{H}_1)的可能性相对于来自(\mathcal{H}_0)的可能性的比例”。
NP方法根据指定的$P_{FA}=\alpha$,推导处了一个对应的作用于条件PDF上的$\gamma$,只要$L(\mathbf{x}) = \frac{p(\mathbf{x};\mathcal{H}_1)}{p(\mathbf{x};\mathcal{H}_0)}>\gamma$就裁决为$H_1$,否则为$H_0$,这样就可以实现最大化的$P_D$,这个过程被称为似然比检验。
$\gamma$与$\alpha$的关系是:
关于似然比检验最大化$P_D$的证明
这里我也看球不懂,PPT这么写的。
为什么通过似然比检验来裁决就可以最大化$P_D$呢?证明如下
这是一个 “带约束的最大化问题”,我们引入拉格朗日乘数 (\lambda),构造拉格朗日函数 F:
我们的目标是选择 (R_1) 使 F 最大。由于 (-\lambda \alpha) 是与 (R_1) 无关的常数,只需关注积分项 (\int_{R_1} \left[ p(\mathbf{x};\mathcal{H}_1) + \lambda p(\mathbf{x};\mathcal{H}_0) \right] d\mathbf{x}) 的最大化。
要最大化积分 (\int_{R_1} \left[ p(\mathbf{x};\mathcal{H}_1) + \lambda p(\mathbf{x};\mathcal{H}_0) \right] d\mathbf{x}),需遵循 “将使被积函数为正的 (\mathbf{x}) 全部纳入 (R_1)” 的原则:
- 若 (p(\mathbf{x};\mathcal{H}_1) + \lambda p(\mathbf{x};\mathcal{H}_0) > 0),则 (\mathbf{x}) 应属于 (R_1);
- 若 (p(\mathbf{x};\mathcal{H}_1) + \lambda p(\mathbf{x};\mathcal{H}_0) = 0),(\mathbf{x}) 可任意归入 (R_0) 或 (R_1)(因连续 PDF 下该情况概率为 0,可忽略)。
对不等式 (p(\mathbf{x};\mathcal{H}_1) + \lambda p(\mathbf{x};\mathcal{H}_0) > 0) 变形:(p(\mathbf{x};\mathcal{H}_1) > -\lambda p(\mathbf{x};\mathcal{H}_0))
此时需分析 (\lambda) 的符号:
- 若 (\lambda \geq 0),则右边 (-\lambda p(\mathbf{x};\mathcal{H}_0) \leq 0),而左边 (p(\mathbf{x};\mathcal{H}_1)) 是概率密度(非负),不等式 (p(\mathbf{x};\mathcal{H}_1) > -\lambda p(\mathbf{x};\mathcal{H}_0)) 会恒成立—— 这会导致 (R_1) 包含所有数据,即 “无论如何都决策 (\mathcal{H}_1)”,这是不合理的(会导致虚警概率失控)。
- 因此,必须有 (\lambda < 0),令 (\gamma = -\lambda)(则 (\gamma > 0)),不等式可重写为:$\frac{p(\mathbf{x};\mathcal{H}_1)}{p(\mathbf{x};\mathcal{H}_0)} > \gamma$
数个例子
单样本高斯假设检验
我们需要基于单次观测 (x[0]),检验两个假设:(\mathcal{H}_0: \mu = 0)(观测来自 (\mathcal{N}(0,1)) 分布);(\mathcal{H}_1: \mu = 1)(观测来自 (\mathcal{N}(1,1)) 分布)。规定虚警概率 (P_{\text{FA}} = 10^{-3})
首先写出似然比:
当似然比$\exp\{x[0]-\frac{1}{2}\}>\gamma$时,裁决为$H_1$。因为尾数函数是$x[0]$大于某一值的概率,因此需要将似然比两边取对数,直接写针对观测量$x[0]$的阈值$\gamma’$:
因此记$\gamma’=\ln(\gamma)+\frac{1}{2}$,当$x[0]>\gamma’$时就裁决为$H_1$。然后通过$Q^{-1}$求得$\gamma’$
也就是说,应该将观测的值与$3.0902$进行比较,来进行裁决。这样就可以在虚警概率$P_{\text{FA}} = 10^{-3}$的约束下,尽可能地检出信号。此时正确检出信号的概率为:
由于$p(x;\mathcal{H}_1)$是服从$\mathcal{N}(1,1)$的分布:
可以看到虽然我们虚检的概率很低,但是检出正确信号的概率同样很低。此时就相当于这个阈值被划定在了两个PDF的末尾的情况。
如果我们接受更高的虚警概率,也可以对应得到更高的检出正确信号的概率,例如当$P_{FA}=0.5$时,可以得到$P_D=0.8413$。
多元高斯分布的均值检验
假设$H_0=w[n]$,$H_1=A+w[n]$。其中A是直流信号的振幅:$s[n]=A$。
信道中WGN的方差是$\sigma^2$。与上一个例子不同的是,这一次我们观测的不是单个$x[0]$,而是一组观测值$\mathbf{x} = [x[0], x[1], \dots, x[N-1]]^T$。在虚警概率$P_{FA}=\alpha$($\alpha$已知)的约束下,求得NP方法似然比检验的阈值。再求性能($P_{FA}$和$P_D$的通式)与信号能量-噪声比(Energy-to-Noise Ratio ENR)的关系。
SNR 是信号功率与噪声功率的比值;ENR 是信号总能量与噪声能量强度的比值
1.写出似然比检验
首先由于$H_0=w[n]$:
由于$H_1=A+w[n]$
2. 取对数化简后求出阈值
似然比检验是:
由于$A>0$,两边同除以A无需变号,因此:
3. 检测器的性能分析
- 当 (\mathcal{H}_0) 为真时,(x[n] \sim \mathcal{N}(0, \sigma^2)),因此样本均值 (\bar{x} \sim \mathcal{N}\left( 0, \frac{\sigma^2}{N} \right))(高斯分布的均值性质:(E[\bar{x}] = 0),(\text{var}(\bar{x}) = \frac{\sigma^2}{N}))。
- 当 (\mathcal{H}_1) 为真时,(x[n] \sim \mathcal{N}(A, \sigma^2)),因此样本均值 (\bar{x} \sim \mathcal{N}\left( A, \frac{\sigma^2}{N} \right))(同理,(E[\bar{x}] = A),(\text{var}(\bar{x}) = \frac{\sigma^2}{N}))。
将$\bar{x} \sim \mathcal{N}\left( 0, \frac{\sigma^2}{N} \right)$通过尾数函数求得$P_{FA}$:
同理求得$P_D$
4. 性能与ENR的关系
对于直流信号$s[n]=A$,其能量是$\sum_{n=0}^{N-1} A^2 = N \cdot A^2$
对于方差是$\sigma^2$,均值是0的WGN,其能量$E[w[n]^2] = \sigma^2$
因此信号能量-噪声比$ENR=\frac{NA^2}{\sigma^2}$。那么$P_D$可以进一步写成:
- 在虚警概率固定时,信号能量 - 噪声比(ENR)越高,检测概率 (P_D) 越大。
- 在ENR固定时,(P_{\text{FA}}) 越大(虚警概率越宽松),检测概率 (P_D) 越大。

均值偏移的高斯 - 高斯问题
是什么
对于观测检验统计量T,若(T > \gamma’)则判决为(\mathcal{H}_1),否则判决为(\mathcal{H}_0)。统计量T的概率密度函数(pdf)满足:
其中(\mu_1 > \mu_0)。这类问题我们称为Mean-Shifted Gauss-Gauss Problem(均值偏移的高斯 - 高斯问题)。
也就是说,我们需要在两个仅均值偏移的高斯分布假设之间做判决。
其似然比为:
NP决策的性能
对于这类检测器,检测性能完全由偏移系数(deflection coefficient) (d^2) 刻画,其定义为
其中(E(T; \mathcal{H}))表示在假设(\mathcal{H})下T的期望,(\text{var}(T; \mathcal{H}_0))是(\mathcal{H}_0)下T的方差。
若(\mu_0 = 0),则(d^2 = \mu_1^2 / \sigma^2),可解释为信噪比(SNR)。
在 Neyman-Pearson(NP)裁决器中,(d^2)(偏移系数,deflection coefficient)起到量化两个假设下分布差异程度的关键作用(即,量化 “信号 - 噪声” 分离度),它直接决定了检测概率(P_D)与虚警概率(P_{FA})的关系。对于高斯PDF下,通过推导可知:
其中(Q(\cdot))是高斯 Q 函数)。
虚警概率((P_{FA}))是在(\mathcal{H}_0)下(T > \gamma’)的概率,由高斯分布的Q函数表示:
裁决阈值可以用$P_{FA}$表示出来:
检测概率$P_D$为:
一个例子
- 假设(\mathcal{H}_0):(x[n] \sim \mathcal{N}(0, \sigma_0^2)),(n = 0,1,\dots,N-1),且(x[n])是独立同分布(iid)的。
- 假设(\mathcal{H}_1):(x[n] \sim \mathcal{N}(0, \sigma_1^2)),(n = 0,1,\dots,N-1),且(x[n])是独立同分布的。
奈曼 - 皮尔逊(NP)检验的核心是似然比检验:若似然比(L(\mathbf{x}) = \frac{p(\mathbf{x}; \mathcal{H}_1)}{p(\mathbf{x}; \mathcal{H}_0)} > \gamma),则判决(\mathcal{H}_1)。其中似然函数为:
似然比取对数,化简不等式:
由于假设(\sigma_1^2 > \sigma_0^2),则(\frac{1}{\sigma_0^2} - \frac{1}{\sigma_1^2} > 0),不等式两边乘以负数需变号,最终可整理为:
检验统计量(\frac{1}{N} \sum_{n=0}^{N-1} x^2[n])这是求其功率的表达式,由于这是零均值高斯信号,这就等于方差。
当观测样本的 “能量”(功率)足够大时,判决(\mathcal{H}_1)(即认为方差从(\sigma_0^2)变为(\sigma_1^2))。如下图所示,(\mathcal{H}_0)的分布更 “集中”(方差小),(\mathcal{H}_1)的分布更 “分散”(方差大)。判决区域为:当(x[0] < -\sqrt{\gamma’})或(x[0] > \sqrt{\gamma’})时判决(\mathcal{H}_1),中间区域判决(\mathcal{H}_0)

NP方法的性能评估标准
奈曼 - 皮尔逊方法的检测性能可通过接收机工作特性(Receiver Operating Characteristics, ROC)曲线评估。
ROC 曲线是检测概率(P_D)对虚警概率(P_{FA})的关系图,其以$P_{FA}$作为X轴,$P_D$作为y轴,绘制不同其关系。
以 “白高斯噪声(WGN)中的直流电平” 为例说明:
虚警概率:(P_{FA} = Q\left( \frac{\gamma’}{\sqrt{\sigma^2 / N}} \right))
检测概率:(P_D = Q\left( \frac{\gamma’ - A}{\sqrt{\sigma^2 / N}} \right) = Q\left( Q^{-1}(P_{FA}) - \sqrt{d^2} \right))
其中偏移系数(d^2 = \frac{N A^2}{\sigma^2})(A是直流电平,N是样本数,(\sigma^2)是噪声方差)。我们试着通过改变$d^2$,绘制ROC图像如下:

ROC 曲线始终在 45° 线上方:因为 45° 线对应 “正确检测(\mathcal{H}_1)的概率” 和 “错误检测(\mathcal{H}_0)为(\mathcal{H}_1)的概率” 相等。这是“抛硬币式” 的随机判决,只要以0.5的概率在$H_0$和$H_1$之间猜一个就可以达成。而合理的检测器利用了数据信息,性能必然优于随机猜测。
不妨回顾一下下面这幅图,蓝色是$P_{FA}$,绿色是$P_D$:当$\gamma$增大时,$P_{FA}$和$P_D$一起减少,再看上面ROC的图,也是这样的,要少一起少,要多一起多。

贝叶斯准则(Bayes Criterion)
基础贝叶斯检测(MAP检测)
是什么
贝叶斯准则允许我们为假设分配根据经验人为设定的“先验概率”。
根据贝叶斯公式,有:
其中:
- $P(H_i|\mathbf{x})$是后验概率(Posterior Probability),为观测到数据 x后,假设$H_i$为真的概率。
- $p(\mathbf{x}|H_i)$是似然函数(Likehood),是假设$H_i$为真时,观测到数据 x 的概率(或概率密度)。
- $P(H_i)$是先验概率(Prior Probability),是假设$H_i$为真的概率。
贝叶斯检测器在是在寻找让$P(H_i|\mathbf{x})$最大的$H_i$,即,寻找最最大后验概率(Maximum A Posteriori, MAP)。由于贝叶斯公式的分母$p(\mathbf{x})$是用于归一化的,通常寻找MAP时,只看分子就行了。
在雷达或声呐中,无法使用贝叶斯准则,因此目标物出现的先验概率无法确定。
通过一个例子来看看MAP
假设数字通信系统中认为发送0和发送1是等概的,那么就记$P(H_0)=P(H_1)=\frac{1}{2}$。我们用贝叶斯公式的分子来比大小,就是:
其中(P(\mathcal{H}_0|\mathcal{H}_1)) 是 “(\mathcal{H}_1) 为真时,判决 (\mathcal{H}_0)” 的条件概率(又称似然函数),它依 (\mathcal{H}_j) 的先验概率。当$p(\mathbf{x}|H_1)P(H_1)>p(\mathbf{x}|H_0)P(H_0)$时,判定为$H_1$,否则判定为$H_0$。
(P(H_i|H_j)) 是条件概率,表示 “当 (H_j) 为真时,判决为 (H_i) 的概率”。
在贝叶斯框架中,我们会给 “假设 (H_j) 为真” 赋予先验概率 (P(H_j))(比如数字通信里 “发 0” 和 “发 1” 的概率各为 1/2)。此时 (P(H_i|H_j)) 的含义是:既考虑了 “(H_j) 为真” 的先验概率,也考虑了 “观测到的信息对 (H_j) 为真的支持程度(似然)”,是一个带概率意义的条件概率
NP 方法的核心是不假设先验概率(比如雷达中 “目标出现” 的概率无法提前赋值)。此时 (P(H_i;H_j)) 的含义是:仅表示 “当 (H_j) 为真时,判决为 (H_i) 的概率”,没有对 “(H_j) 为真” 本身赋予概率意义(即不考虑 (H_j) 发生的先验概率)。它更像是一种 “逻辑上的条件关系”,而非贝叶斯框架下的概率条件关系。
我们再定义一个判别错误的概率$P_e$。当发送$1$时被判别为0,是判定错误;当发送0被判定为1时,是判定错误。那么总的错误概率就是$P(判定1|发送0)P(发送0)+P(判定0|发送1)P(发送1)$。
贝叶斯检测器的优化目标是最小化$P_e$,只需要寻找到最大的后验概率,即可最小化$P_e$。后验概率的判决是:$\frac{p(\mathbf{x}|H_1)P(H_1)}{p(\mathbf{x})} $与$\frac{p(\mathbf{x}|H_0)P(H_0)}{p(\mathbf{x})}$比大小。约掉分母就得到了判决规则:若$p(\mathbf{x}|H_1)P(H_1)>p(\mathbf{x}|H_0)P(H_0)$则判定为$H_1$
不妨将判决规则$p(\mathbf{x}|H_1)P(H_1)>p(\mathbf{x}|H_0)P(H_0)$改写一下:记贝叶斯检验的阈值$\gamma=\frac{P(H_0)}{P(H_1)}$,然后通过对比$\frac{P(H_0|H_1)}{P(H_1|H_0)}$与阈值的大小,来判定是$H_1$还是$H_0$。
在雷达 / 声呐无法分配先验概率,因为目标出现的可能性难以预先确定。由此可以看出贝叶斯方法的使用有一定的限制。
MAP退化为最大似然检测器
如果先验概率相等,即,(P(H_0) = P(H_1)),那么直接对比$P(H_1|H_0)$与$P(H_0|H_1)$的大小即可得出选择谁。这样的选择就是在选择“条件似然更大的假设”。从下图可以直接看出:在$z_a(T)$这个点,$p(z|s_1)$的似然函数(条件概率)更大,故判定为$s_1$。

这种直接对似然比大小的检测器称为最大似然(ML)检测器。
当先验概率相等时 (P(\mathcal{H}_0) = P(\mathcal{H}_1))),$\gamma=\frac{P(H_0)}{P(H_1)}=1$,直接对似然比大小就行。此时MAP 检测器与最大似然(ML)检测器等价(或称先验概率相等时,“后验概率最大” 等价于 “似然函数最大”)。
一个例子:等概情况(ML检测器)
假设接收的是单极性DC信号,$H_0=w[n]$, $H_1=A+w[n]$。其中$w[n]$为高斯白噪声,方差是$\sigma^2$。
假设先验概率$P(H_0)=P(H_1)=\frac{1}{2}$,即,发送$0$和$1$的概率相等。那么,根据贝叶斯判决的规则, (\frac{p(\mathbf{x}|\mathcal{H}_1)}{p(\mathbf{x}|\mathcal{H}_0)} >1)判决为$H_1$,否则判决为$H_0$.
1.写出条件概率密度
对于$p(\mathbf{x}|\mathcal{H}_1)$,在收到时$H_1=A+w[n]$的前提下,高斯分布的均值被抬到了A,观测值x[n]的扰动来自于高斯白噪声。因此,对于单次观测,$p(\mathbf{x}[n]|\mathcal{H}_1)\sim N(A,\sigma^2)$。由于每次观测是独立同分布的,因此联合概率密度可以由n次边缘概率密度相乘得到。
同理可得,$p(\mathbf{x}[n]|\mathcal{H}_0)\sim N(0,\sigma^2)$
2.计算似然比
$\frac{p(\mathbf{x}|\mathcal{H}_1)}{p(\mathbf{x}|\mathcal{H}_0)}$为似然比。
3.将似然比转化
根据判定规则$\exp[\frac{N}{2\sigma^2} \left( 2A\bar{x} - A^2 \right)]>1$判定为$H_1$,否则判定为$H_0$;两边同取对数,得$\frac{N}{2\sigma^2} \left( 2A\bar{x} - A^2 \right)>0$,由于$\frac{N}{2\sigma^2} $一定大于0,故只需要$2A\bar{x} - A^2>0$,进一步移项得到:
4. 求解误判率
观察下图,可以得到$P(\overline x>\frac{A}{2}|H_0)=P(\overline x<\frac{A}{2}|H_1)$,即,下图阴影部分关于$\gamma_0=\frac{A}{2}$对称。那么条件概率就可以由高斯分布的尾数函数求到:

此时误判率就是:
拓展贝叶斯检测(考虑错误成本)
错误成本(Cost)
不同类型的错误,造成的损失(成本)可能不同。因此,贝叶斯准则可拓展为 “考虑错误成本,最小化总损失”。
以一个“机械零件检测”例子来详细阐述,假设 (\mathcal{H}_0):零件有缺陷;(\mathcal{H}_1):零件合格。使用(C_{ij}) 来表示 “决策 (\mathcal{H}_i),但 (\mathcal{H}_j) 为真” 的成本
- 错误类型 1:零件实际有缺陷((\mathcal{H}_0) 为真),却判为合格(决策 (\mathcal{H}_1))。 会导致 “整个产品缺陷”,损失极大,因此错误成本 (C_{10}) 很高。
- 错误类型 2:零件实际合格((\mathcal{H}_1) 为真),却判为缺陷(决策 (\mathcal{H}_0))。仅损失 “这个零件”,损失较小,因此错误成本 (C_{01}) 较低
贝叶斯风险(Bayes Risk)
错误成本的期望,就是贝叶斯风险,用$R$表示。
其中:
- (C_{ij}):决策 (\mathcal{H}_i)、但 (\mathcal{H}_j) 为真的成本;
- (P(\mathcal{H}_i|\mathcal{H}_j)):(\mathcal{H}_j) 为真时,决策 (\mathcal{H}_i) 的条件概率;
- (P(\mathcal{H}_j)):假设 (\mathcal{H}_j) 的先验概率。
上面机械零件合格与不合格的例子的贝叶斯风险就是:
考虑错误成本的贝叶斯检测
引入错误成本后,贝叶斯检测(后称拓展贝叶斯检测)从之前基础贝叶斯的最小化$P_e$变成了最小化贝叶斯风险。
但是他们之间仍然是有关联的:例如若 “无错误时成本为 0”((C_{00} = C_{11} = 0)),且 “两类错误成本均为 1”((C_{10} = C_{01} = 1)),则贝叶斯风险R的式子会退化为:
这表面拓展贝叶斯检测退化为了基本贝叶斯检测。
同样的,在2元检测中,若 (\frac{p(\mathbf{x}|\mathcal{H}_1)}{p(\mathbf{x}|\mathcal{H}_0)} > \frac{(C_{10} - C_{00}) P(\mathcal{H}_0)}{(C_{01} - C_{11}) P(\mathcal{H}_1)} = \gamma)则判决 (\mathcal{H}_1),此时贝叶斯风险最小。这个结论的证明如下:
首先作如下定义:
- (R_1):决策为 (\mathcal{H}_1) 的区域;
- (R_0):(R_1) 的补集,即决策为 (\mathcal{H}_0) 的区域;
如下图所示

风险函数$\mathcal{R} = E(C) = \sum_{i=0}^{1} \sum_{j=0}^{1} C_{ij} P(\mathcal{H}_i|\mathcal{H}_j) P(\mathcal{H}_j)$可以看作以下四项相加:
- (\mathcal{H}_0) 为真,决策 (\mathcal{H}_0)($i=j=0$)的风险;
- (\mathcal{H}_1) 为真,决策 (\mathcal{H}_0)($i=0,j=1$)的风险;
- (\mathcal{H}_0) 为真,决策 (\mathcal{H}_1)($i=1,j=0$)的风险;
- (\mathcal{H}_1) 为真,决策 (\mathcal{H}_1)($i=1,j=1$)的风险;
这四项对应的决策范围如下图:

风险函数重写为四个区域的积分:
由于 (R_1) 和 (R_0)有(R_1 \cup R_0 = \text{全空间}),因此对任意 (\mathcal{H}_i),有:(\int_{R_0} p(\mathbf{x}|\mathcal{H}_i) d\mathbf{x} = 1 - \int_{R_1} p(\mathbf{x}|\mathcal{H}_i) d\mathbf{x})
将 (\int_{R_0} p(\mathbf{x}|\mathcal{H}_0) d\mathbf{x} = 1 - \int_{R_1} p(\mathbf{x}|\mathcal{H}_0) d\mathbf{x}) 和 (\int_{R_0} p(\mathbf{x}|\mathcal{H}_1) d\mathbf{x} = 1 - \int_{R_1} p(\mathbf{x}|\mathcal{H}_1) d\mathbf{x}) 代入 (\mathcal{R}) 展开式:
(\mathcal{R} = \underbrace{C_{01} P(\mathcal{H}_1) + C_{00} P(\mathcal{H}_0)}_{\text{常数项 } K} + \underbrace{\int_{R_1} f(\mathbf{x}) d\mathbf{x}}_{\text{积分项 } I})。此时风险仅与$R_1$相关积分有关,让风险最小就等于让$R_1$这个积分最小。如果我们可以让这个被积函数为负数,那一定可以拿到比较小的R。也就是,仅将满足(f(\mathbf{x}) < 0)的观测(\mathbf{x})划入决策区域(R_1)(即决策为(\mathcal{H}_1))。
- 即,在满足下$(C_{10} - C_{00}) P(\mathcal{H}_0) p(\mathbf{x} | \mathcal{H}_0) < (C_{01} - C_{11}) P(\mathcal{H}_1) p(\mathbf{x} | \mathcal{H}_1)$决策为$H_1$
- 否则决策为$H_0$
这个式子变换一下即可得到:
多假设检验(Multiple Hypothesis Testing)
多假设检验
在前面的讨论中,我们一直局限于2元检测的情况。那么如果现在有多重假设(例如通信中进行了M进制的调制),要在M个假设之间进行裁决,应该如何处理呢?
在这门课中只讨论简化了的多元检测情况。并非通式。
奈曼 - 皮尔逊(NP)准则虽能用于 M 元假设检验,但实际中很少使用;贝叶斯方法更常用。
让我们从最小化贝叶斯风险来推导:
给定观测 (\mathbf{x}) 时,对于每个假设 (\mathcal{H}_i),条件期望代价 (C_i(\mathbf{x})) 计算公式为:
注:$P(H_i|\mathbf{x})=\frac{p(\mathbf{x}|H_i)P(H_i)}{p(\mathbf{x})}$,是后验概率
为了继续推导我们将其简化为特殊情况:如果观测为$H_i$,决策为$H_i$,那么它的cost应当是0,即$C_{ij}=0|_{i=j}$;如果观测为$H_i$,决策为其他的,那么它的cost是1,即$C_{ij}=1|_{i\neq j}$
此时$C_i(\mathbf{x})$可以简化为:
给定观测 (\mathbf{x}) 时,所有假设的总代价为:
每个观测(\mathbf{x})对应的总代价(\sum_{i=0}^{M-1} C_i(\mathbf{x}))”,按照(\mathbf{x})出现的概率(p(\mathbf{x}))进行加权平均,就可以计算出贝叶斯风险R
因此,最小化贝叶斯风险的操作可以等价为最小化每个$C_i(\mathbf{x})$,那么就需对每个 (\mathbf{x}),选择使 (C_i(\mathbf{x})) 最小的假设 (\mathcal{H}_i)。
由于$C_i(\mathbf{x}) = \sum_{\substack{j=0 \\ j \neq i}}^{M-1} P(\mathcal{H}_j|\mathbf{x}) = 1 - P(\mathcal{H}_i|\mathbf{x})$, 最小化 (C_i(\mathbf{x})) 等价于最大化 (P(\mathcal{H}_i|\mathbf{x}))
那么在M元决策下,最小化贝叶斯风险就变成了选择 “后验概率 (P(\mathcal{H}_k|\mathbf{x})) 最大” 的假设 (\mathcal{H}_k),这其实是ML检测。是由于简化引入的$C_{ij}=0|_{i=j}$和$C_{ij}=1|_{i\neq j}$使MAP退化成了ML。
于是最后就是根据观测$\mathbf{x}$,挑一个联合PDF在观测点最大的就行。下面通过一个例子来看看
一个例子
假设我们要检测三个可能的直流电平,信号模型如下:
- (H_0: x[n] = -A + w[n])(发送电平 (-A),叠加 WGN (w[n]))
- (H_1: x[n] = 0 + w[n])(发送电平 0,叠加 WGN (w[n]))
- (H_2: x[n] = A + w[n])(发送电平 A,叠加 WGN (w[n]))
WGN的方差为$\sigma^2$
1. 写出似然函数
根据高斯分布的概率密度函数,每个假设 (H_i) 对应的条件似然 (p(\mathbf{x}|H_i)) 为:
其中 (A_0 = -A),(A_1 = 0),(A_2 = A),N 是观测样本数。
2. 进行ML检测
我们现在的目标是要找到一个$i=0,1,2$时,哪个$p(\mathbf{x}|H_i)$最大。先对其取对数来化简一下(对数不改变单调性):
前面一项是常数项不管它,对于第二项,由于 (-\frac{1}{2\sigma^2} < 0),最大化 (\ln p(\mathbf{x}|H_i)) 等价于最小化 (\sum_{n=0}^{N-1} (x[n] - A_i)^2)。
令 (D_i^2 = \sum_{n=0}^{N-1} (x[n] - A_i)^2)(即 “距离项”),则最大化 (p(\mathbf{x}|H_i)) 等价于最小化 (D_i^2)。距离项的物理意义是观测信号与假设信号之间的 “误差能量”。
对 (D_i^2) 做展开:
由于(\sum_{n=0}^{N-1} (x[n] - \bar{x}) = \sum_{n=0}^{N-1} x[n] - \sum_{n=0}^{N-1} \bar{x} = N\bar{x} - N\bar{x} = 0),中间项直接等于0。$D_i^2$可写为:
由于 (\sum_{n=0}^{N-1} (x[n] - \bar{x})^2) 是与 i 无关的公共项,因此最小化 (D_i^2) 等价于最小化 (N(\bar{x} - A_i)^2),即选择与样本均值 (\bar{x}) 最接近的 (A_i)。
由此得到决策规则:
- 若 (\bar{x} < -A/2),判决 (H_0)(电平 (-A));
- 若 (-A/2 < \bar{x} < A/2),判决 (H_1)(电平 0);
- 若 (\bar{x} > A/2),判决 (H_2)(电平 A)
3. 误判率分析
正确概率 (P_c) 是 “真实假设为 (H_i) 时判决正确” 的概率加权和(先验概率均为 (1/3)):
用Q函数来分别表达$P(\bar{x} < -A/2 | H_0)$,$P(-A/2 < \bar{x} < A/2 | H_1) + P(\bar{x} > A/2 | H_2)$和$P(\bar{x} > A/2 | H_2)$
因此$P_c$可以写为:
由于$P_c=1-P_e$,刚好就可以看出来$P_e$是:
4. 判决课程的可视化
我们假设双极性信号直流振幅A=2,那么上面这个例子的决策就是:

可以看到,我们观测一组信号$\mathbf{x}$,然后对其求均值$\bar{x}$,如果$\bar{x}=0.2$,$H_1$的条件PDF具有最大值。因此我们选择$H_1$。
在$x<-\frac{A}{2}$时,$H_0$的PDF最大;在$-\frac{A}{2}