引入

在前面的章节中,我们假设在 H0 和 H1 下完全了解概率密度函数(pdf)。

现在,我们假设概率PDF并非完全已知,这在实际问题中更为现实。

例如,在雷达应用中,来自目标的回波信号会由于传播时间而延迟,其到达时间通常是未知的。在通信接收机中,我们可能无法完美地知道传输信号的频率/幅度,由于未知参数,信号的概率密度函数将是未知的。在声纳中,噪声可能被认为是高斯噪声,但由于环境条件未知,其方差也可能未知。

因此,设计能够处理具有未知参数的概率密度函数的检测器在实际应用中非常重要。而这一类检测器通常被称作复合假设检验(composite hypothesis testing)

在复合情况下,在 H0 或 H1 下的概率密度函数(或在两者下的概率密度函数)可能无法完全确定。因此,我们在概率密度函数中包含未知参数,设计过程必须适应这些未知参数。

一致最优势检验(Uniformly Most Powerful Test,UMP Test)

UMP处理复合假设的核心思路是:

  1. 先假设未知参数已知,设计 Neyman-Pearson(NP)检验;
  2. 再调整检验,让它不依赖未知参数,最终得到最优检验。

是什么:一个例子

以 “高斯白噪声(WGN)中检测未知幅度的直流信号” 为例:

我们要检测的信号模型是:

其中 (w[n]) 是方差为 (\sigma^2) 的 WGN,A 是未知的直流幅度。

此时 (\mathcal{H}_1) 对应的 pdf 是含未知参数 A 的:

因为 A 未知,(\mathcal{H}_1) 不是 “单一 pdf”,而是由 A 参数化的一族 pdf—— 这就是 “复合假设”。

1. 首先我们假设A已知,构造NP检验

似然比:

取对数似然比来化简:

展开分子的平方项 ((x[n]-A)^2 = x[n]^2 - 2A x[n] + A^2),代入求和式:

因此对数似然比化简为:

整理不等式(两边乘 (2\sigma^2))

因为 (A>0)(直流幅度为正),两边除以 A 不改变不等号:

2. 构造不依赖A的检验统计量

两边除以 N,得到:

这里 (T(\mathbf{x})) 是样本均值 (\bar{x}),它本身不依赖未知参数 A;但此时阈值 (\gamma’) 看起来和 A 有关 —— 接下来要证明:阈值 (\gamma’) 可以不依赖 A。

NP 检验要求 “给定虚警概率 (P_{FA})”,而 (P_{FA} = \Pr\{T(\mathbf{x}) > \gamma’; \mathcal{H}_0\})。

在 (\mathcal{H}_0) 下,(x[n] = w[n]) 是 WGN,因此样本均值 (\bar{x}) 服从高斯分布:

虚警概率 (P_{FA}) 是高斯分布的右尾概率:

对 Q 函数取逆,得到阈值 (\gamma’):

可以看到:阈值 (\gamma’) 仅由 (P_{FA})、(\sigma^2)、N 决定,和未知参数 A 无关。而NP检验的$P_{FA}$是由人为给定的,所以,这个检测器不依赖A,能得到最大的检测概率 (P_D)。

而这样在 “给定虚警概率 (P_{FA})” 的前提下,对任意 (A>0) 都能得到最大的检测概率 (P_D)的检验就叫做一致最优势检验(Uniformly Most Powerful Test,UMP Test)

3. $P_D$的性质

在 (\mathcal{H}_1) 下,(x[n] = A + w[n]),因此样本均值 (\bar{x}) 服从高斯分布:(T(\mathbf{x}) = \bar{x} \sim \mathcal{N}\left( A, \frac{\sigma^2}{N} \right))

检测概率 (P_D = \Pr\{T(\mathbf{x}) > \gamma’; \mathcal{H}_1\}),同样用 Q 函数表示:

显然:A 越大(信号越强),(P_D) 越大(因为 (\sqrt{\frac{N A^2}{\sigma^2}}) 增大,Q 函数的自变量减小,Q 函数值减小,检测概率增大)。

UMP 检验的局限性:很少存在

以 “直流信号幅度 (A \in \mathbb{R})(可正可负)” 为例:

  • 当 (A>0) 时,检验是 “样本均值 (> \gamma’)”(因为信号使样本均值偏大);
  • 当 (A<0) 时,检验会变成 “样本均值 (< -\gamma’)”(因为信号使样本均值偏小);

但如果 A 未知(不知道正负),我们无法确定用 “大于” 还是 “小于” 阈值 —— 此时 NP 方法无法得到唯一的检验,自然也不存在 UMP 检验。

类似于这样A的取值范围,假设可以检验分为单边检验和双边检验:

  • 单边检验:(\mathcal{H}_0: A=0),(\mathcal{H}_1: A>0)(或 (A<0))—— 参数只在 “一侧” 取值;
  • 双边检验:(\mathcal{H}_0: A=0),(\mathcal{H}_1: A \neq 0)—— 参数在 “两侧” 取值;

只有单边参数的问题 “可能” 存在 UMP 检验,双边问题一定不存在 UMP 检验。

复合假设检验的两种主要方法

当 UMP 检验不存在时,需要用其他方法处理复合假设检验。

贝叶斯方法(Bayesian Approach)

思路:把未知参数视为随机变量,并给每个参数分配一个先验概率密度函数(prior pdf)。

举个例子:如果未知幅度 A 的先验是 (p(A)),那么 (\mathcal{H}_1) 对应的似然函数会变成 “对 A 积分(加权平均)”:

然后用 “积分后的似然函数” 构造似然比检验。

但贝叶斯方法的缺点是:需要计算高维积分,通常无法得到闭式解(即解析表达式),实际实现较复杂。

广义似然比检验(GLRT)

思路:先估计未知参数,再代入似然比检验。

  1. 对每个假设,最大化似然函数以估计未知参数(即求 “最大似然估计(MLE)”):
    • 对 (\mathcal{H}_0),估计参数 (\hat{\boldsymbol{\theta}}_0 = \arg\max_{\boldsymbol{\theta}_0} p(\mathbf{x}; \boldsymbol{\theta}_0, \mathcal{H}_0));
    • 对 (\mathcal{H}_1),估计参数 (\hat{\boldsymbol{\theta}}_1 = \arg\max_{\boldsymbol{\theta}_1} p(\mathbf{x}; \boldsymbol{\theta}_1, \mathcal{H}_1));
  2. 构造广义似然比:(L_G(\mathbf{x}) = \frac{\max_{\boldsymbol{\theta}_1} p(\mathbf{x}; \boldsymbol{\theta}_1, \mathcal{H}_1)}{\max_{\boldsymbol{\theta}_0} p(\mathbf{x}; \boldsymbol{\theta}_0, \mathcal{H}_0)})
  3. 判决规则:若 (L_G(\mathbf{x}) = \frac{\max_{\boldsymbol{\theta}_1} p(\mathbf{x}; \boldsymbol{\theta}_1, \mathcal{H}_1)}{\max_{\boldsymbol{\theta}_0} p(\mathbf{x}; \boldsymbol{\theta}_0, \mathcal{H}_0)}>\gamma),则判决 (\mathcal{H}_1)。

GLRT 实现简单(只需要求参数的最大似然估计),因此在实际中应用更广泛。

GRLT

GLRT 的本质是:用 “最大似然估计(MLE)” 替代假设中的未知参数,再构造似然比检验。

具体步骤是:

  1. 对每个假设((\mathcal{H}_0)、(\mathcal{H}_1)),求未知参数的MLE(即使得该假设下似然函数最大的参数值);
  2. 把 MLE 代入似然函数,构造广义似然比;
  3. 根据广义似然比与阈值的比较,做出判决。

GLRT没有严格的最优性保证,但实际中性能通常很好。

一个例子:使用GRLT在WGN 中检测未知幅度直流信号

检测问题的假设是:

  • (\mathcal{H}_0) 无未知参数,所以 (\hat{\boldsymbol{\theta}}_0) 就是 “无参数”,直接用 (p(\mathbf{x}; \mathcal{H}_0));
  • (\mathcal{H}_1) 的未知参数是 A,需要求 A 的 MLE (\hat{A})。

1. 求$H_1$下A的MLE

(\mathcal{H}_1) 对应的似然函数是:

对其取对数来简化计算:

MLE估计是寻找这个未知参数让似然最大的点,即,对A求到寻找极值点:

令导数=0寻找极值点:

解得 A 的 MLE:

2. 把 MLE 代入似然函数,构造广义似然比

广义似然比 (L_G(\mathbf{x})) 是 “(\mathcal{H}_1) 下 MLE 对应的似然” 除以 “(\mathcal{H}_0) 下的似然”:

代入 (\hat{A} = \bar{x}) 和 (\mathcal{H}_0) 的似然函数:

约掉常数项,简化为:

3.化简广义似然比,寻找判决门限

对 (L_G(\mathbf{x})) 取自然对数:

展开 ((x[n]-\bar{x})^2 = x[n]^2 - 2x[n]\bar{x} + \bar{x}^2),代入求和式:

将其代入对数似然比的表达式:

GLRT 的判决规则是 “若 (L_G(\mathbf{x}) > \gamma)”,等价于 “若 (\ln L_G(\mathbf{x}) > \ln\gamma)”,即:

进一步整理成统计检验量为$\bar{x}$的状态:

GRLT的另一种表达方式

GLRT 也可以表示为 “对每个假设下的似然函数取最大值,再做比”:

代入上面的例子,如果 (\mathcal{H}_0) 没有未知参数(即似然函数完全确定),则 (\max_{\boldsymbol{\theta}_0} p(\mathbf{x}; \boldsymbol{\theta}_0, \mathcal{H}_0) = p(\mathbf{x}; \mathcal{H}_0)),此时 GLRT 等价于 “对 (\mathcal{H}_1) 的似然比取最大值”:

一个例子:WGN 中检测未知幅度 + 未知方差的直流信号

这次的检测问题是:

这里的 (\sigma^2) 是冗余参数(Nuisance Parameter):它不是我们关注的 “信号参数”,但会影响似然函数,必须一起估计。

同时,因为 A 可取任意实数(双边检验),UMP 检验不存在,因此用 GLRT 处理。

1.步骤1:估计$H_1$下的A和$\sigma^2$

(\mathcal{H}_1) 的似然函数是:

对似然函数取对数(简化):

对 A 求偏导:

对 (\sigma^2) 求偏导(代入$A=\bar x$):

解得:

2.估计 (\mathcal{H}_0) 下的参数(仅 (\sigma^2))

同样取对数后对 (\sigma^2) 求偏导并令其为 0:

3.构造广义似然比并化简

广义似然比 (L_G(\mathbf{x})) 是 “(\mathcal{H}_1) 下 MLE 对应的似然” 除以 “(\mathcal{H}_0) 下 MLE 对应的似然”:

代入 (\hat{A} = \bar{x}) 和 (\hat{\sigma}_1^2) 到 (\mathcal{H}_1) 的似然:

注意到 (\sum_{n=0}^{N-1} (x[n]-\bar{x})^2 = N\hat{\sigma}_1^2),因此指数项化简为:(\exp\left[ -\frac{N\hat{\sigma}_1^2}{2\hat{\sigma}_1^2} \right] = \exp\left( -\frac{N}{2} \right))

代入 (\hat{\sigma}_0^2) 到 (\mathcal{H}_0) 的似然:

同理,(\sum_{n=0}^{N-1} x[n]^2 = N\hat{\sigma}_0^2),指数项化简为 (\exp\left( -\frac{N}{2} \right))。

分子和分母的指数项 (\exp\left( -\frac{N}{2} \right)) 可以约去,那么最终的GRL就是:

对 (L_G(\mathbf{x})) 取 2 倍自然对数(方便后续处理):

注意到 (\hat{\sigma}_0^2 = \frac{1}{N}\sum x[n]^2),而

代入对数项中,得到:

对应的检验统计量可以简化为:

判决规则等价于 “若 (T(\mathbf{x}) > \gamma’),则判决 (\mathcal{H}_1)”。

GLRT 的性质(与已知方差情况对比)

  • 已知 (\sigma^2) 时,检验统计量是 (\bar{x}^2);而这里因为 (\sigma^2) 未知,GLRT 用样本方差 (\hat{\sigma}_1^2) 对 (\bar{x}^2) 做了归一化,使得阈值不依赖真实的 (\sigma^2)。
  • 性能上:未知方差的 GLRT 性能略差于已知方差的情况,但当样本数 N 很大时,性能损失会很小。

Part2总结

一、检测器的分类

首先根据 “假设是否含未知参数”,检测器分为两大类:

类型 特点 例子
简单假设检验 无未知参数,pdf 完全确定 简单二元 / 多元假设检验
复合假设检验 含未知参数,pdf 依赖参数 复合二元 / 参数 / 单边参数检验

二、简单二元假设检验(无未知参数)

方法 1:Neyman-Pearson(NP)检验

  • 适用场景:已知 (p(\mathbf{x};\mathcal{H}_0)) 和 (p(\mathbf{x};\mathcal{H}_1)),要求 “给定虚警概率 (P_{FA}=\alpha)”。
  • 判决规则:构造似然比 (L(\mathbf{x}) = \frac{p(\mathbf{x};\mathcal{H}_1)}{p(\mathbf{x};\mathcal{H}_0)}),若 (L(\mathbf{x}) > \gamma),则判决 (\mathcal{H}_1)。
  • 阈值 (\gamma) 的确定:由 (P_{FA} = \Pr\{L(\mathbf{x}) > \gamma; \mathcal{H}_0\} = \alpha) 计算。
  • 优势:在给定 (P_{FA}) 时,能最大化检测概率 (P_D)(最优性)。

方法 2:最小错误概率检验

  • 适用场景:已知 (p(\mathbf{x};\mathcal{H}_0))、(p(\mathbf{x};\mathcal{H}_1)),且已知两个假设的先验概率 (P(\mathcal{H}_0))、(P(\mathcal{H}_1))。
  • 判决规则:若 (L(\mathbf{x}) > \frac{P(\mathcal{H}_0)}{P(\mathcal{H}_1)} = \gamma),则判决 (\mathcal{H}_1)(等价于 “后验概率 (p(\mathcal{H}_1|\mathbf{x}) > p(\mathcal{H}_0|\mathbf{x}))”)。
  • 优势:能最小化总错误概率 (P_e = P(\text{误判}\mathcal{H}_0\rightarrow\mathcal{H}_1)P(\mathcal{H}_0) + P(\text{误判}\mathcal{H}_1\rightarrow\mathcal{H}_0)P(\mathcal{H}_1))。

三、简单多元假设检验(无未知参数)

当假设数量超过 2 个((\mathcal{H}_0, \mathcal{H}_1, …, \mathcal{H}_{M-1})),同样用 “最小错误概率” 思路:

  • MAP 规则:若 (p(\mathcal{H}_k|\mathbf{x}) > p(\mathcal{H}_i|\mathbf{x}))(对所有 (i\neq k)),则判决 (\mathcal{H}_k)。(后验概率最大的假设)
  • ML 规则:若先验概率相等((P(\mathcal{H}_0)=…=P(\mathcal{H}_{M-1}))),则简化为 “似然最大”:若 (p(\mathbf{x}|\mathcal{H}_k) > p(\mathbf{x}|\mathcal{H}_i))(对所有 (i\neq k)),判决 (\mathcal{H}_k)。

四、复合二元假设检验(含未知参数)

当假设含未知参数时,常用广义似然比检验(GLRT):

  • 适用场景:pdf 已知但依赖未知参数((\mathcal{H}_0) 依赖 (\boldsymbol{\theta}_0),(\mathcal{H}_1) 依赖 (\boldsymbol{\theta}_1))。
  • 判决规则:
    1. 对每个假设,求未知参数的最大似然估计(MLE):(\hat{\boldsymbol{\theta}}_0 = \arg\max_{\boldsymbol{\theta}_0} p(\mathbf{x};\boldsymbol{\theta}_0,\mathcal{H}_0)),(\hat{\boldsymbol{\theta}}_1 = \arg\max_{\boldsymbol{\theta}_1} p(\mathbf{x};\boldsymbol{\theta}_1,\mathcal{H}_1));
    2. 构造广义似然比 (L_G(\mathbf{x}) = \frac{p(\mathbf{x};\hat{\boldsymbol{\theta}}_1,\mathcal{H}_1)}{p(\mathbf{x};\hat{\boldsymbol{\theta}}_0,\mathcal{H}_0)});
    3. 若 (L_G(\mathbf{x}) > \gamma),则判决 (\mathcal{H}_1)。

特殊情况:无冗余参数的复合参数检验

若 (\mathcal{H}_0) 的参数已知(如 (\mathcal{H}_0: \theta=\theta_0)),(\mathcal{H}_1) 含未知参数 (\theta),则 GLRT 简化为:(L_G(\mathbf{x}) = \frac{p(\mathbf{x};\hat{\theta}_1,\mathcal{H}_1)}{p(\mathbf{x};\theta_0,\mathcal{H}_0)})

GLRT 的渐近性能

当样本数 N 很大时,(2\ln L_G(\mathbf{x})) 近似服从卡方分布:

  • 若 (\mathcal{H}_0) 为真:(2\ln L_G(\mathbf{x}) \sim \chi^2_r)(r 是参数维度差);
  • 若 (\mathcal{H}_1) 为真:(2\ln L_G(\mathbf{x}) \sim \chi^2_{r’}(\lambda))(非中心卡方分布,(\lambda) 是信号强度相关的非中心参数)。