南京昱声科技

前沿语音技术:利用束搜索信息实现端到端语音识别置信度估计

1. 论文速览

这篇发表于 ICASSP 2026 的论文《Leveraging Beam Search Information for Confidence Estimation in E2E ASR》提出了一个令人耳目一新的置信度估计方法——评分-排名置信度估计模块(Score-Rank Confidence Estimation Module, SR-CEM)。它不走寻常路,不依赖 ASR 模型内部的编码器或解码器状态,而是仅从束搜索(beam search)输出的 n-best 假设列表中提取每个词元(token)的得分和排名信息,组合成特征向量,再通过一个轻量级多层感知器(MLP)映射为置信度分数。

这样做的好处立竿见影:SR-CEM 完全与 ASR 模型架构解耦,可即插即用于任何能输出束搜索假设的端到端(end-to-end)系统。在域内英语测试集上,SR-CEM 将词元级最大校准误差(Maximum Calibration Error, MCE)压至 4.50%,期望校准误差(Expected Calibration Error, ECE)仅 0.30%,而传统的 softmax 置信度基线分别为 20.04% 和 1.75%。词级表现同样亮眼:MCE 8.17%、ECE 0.35%,远优于 softmax 的 17.91% 和 1.67%。这些数字意味着,SR-CEM 给出的置信度分数与真实正确率高度吻合,不再出现“自信满满却错得离谱”的尴尬。

2. 研究背景与挑战

语音识别系统的输出不止是一串文字,还要附带“这句话我说得对不对”的置信度。这对下游任务至关重要,比如语音助手要在嘈杂环境中决定是否执行指令,对话系统需要判断是否应该请求用户重复。然而,现有的端到端 ASR 置信度估计方法大多存在一个通病:架构依赖。它们通常从编码器或解码器内部提取隐藏状态、注意力权重等特征,这些特征与特定模型结构绑定,换一个 ASR 架构就得重新设计,难以跨模型复用。

更棘手的是 softmax 置信度的校准性能糟糕。Softmax 输出概率常被当作置信度使用,但它往往过度估计(高置信度却识别错误)或欠估计(低置信度却识别正确)。论文中基线 softmax 的 MCE 高达 20.04%,意味着在某些置信度区间,预测准确率与真实准确率的最大偏差可达 20 个百分点。对于高风险场景——比如医疗听写、工业控制指令——这样的偏差直接威胁系统可靠性。域外泛化(out-of-domain generalization)更是一大痛点,训练数据分布之外的语音输入会让校准误差进一步放大。

3. 核心方法

SR-CEM 的设计哲学是“只看搜索结果,不看模型内部”。束搜索解码会输出一个 n-best 假设列表,每个假设对应一条候选识别文本,并附带一个累积得分。SR-CEM 从这份列表中为每个词元提取两类信息:得分排名。具体来说,对于某个词元,特征包括它在不同假设中的得分分布、排名变化,以及该假设整体的得分与排名。这些信息反映了词元在搜索空间中的“稳定性”——如果一个词元在所有高排名假设中都出现且得分波动小,它大概率是正确的。

特征向量被送入一个轻量级 MLP,输出一个经过校准的置信度分数。训练时使用二元交叉熵损失,以词元或词与参考文本的对齐正确性作为标签,让模块学会将特征映射为真实的正确概率。SR-CEM 不触碰 ASR 模型参数,训练只需 n-best 假设和参考文本,计算开销极低。该方法可应用于任何能输出束搜索假设的 ASR 模型,包括混合系统(CTC+注意力)和Transducer 模型,且在不同解码策略(贪婪解码、束搜索)下均能保持性能。

4. 实验与结果

论文的实验设计全面且严苛。在域内英语测试集上,SR-CEM 的词元级 MCE 为 4.50%,ECE 为 0.30%,与 softmax 基线的 20.04% 和 1.75% 相比,MCE 降低了 15.54 个百分点,ECE 降低了 1.45 个百分点。词级同样显著:MCE 从 17.91% 降至 8.17%,ECE 从 1.67% 降至 0.35%。这些数据表明,SR-CEM 在置信度校准的两个核心指标上取得了压倒性优势。

跨架构验证进一步证明了方法的泛化能力。在混合 CTC-注意力系统和 Transducer 模型上,SR-CEM 均能有效降低校准误差,且在不同解码策略下表现稳定。更令人印象深刻的是跨语言和跨场景的鲁棒性:在荷兰语数据上,SR-CEM 同样显著优于 softmax 基线;在噪声环境和对话语音条件下,校准误差依然保持低位。这种域外泛化能力对于实际部署至关重要,因为真实世界的语音输入远比实验室数据复杂多变。

指标 Softmax 基线 SR-CEM 改进
词元级 MCE 20.04% 4.50% 降低 15.54 个百分点
词元级 ECE 1.75% 0.30% 降低 1.45 个百分点
词级 MCE 17.91% 8.17% 降低 9.74 个百分点
词级 ECE 1.67% 0.35% 降低 1.32 个百分点

5. 创新点与工程价值

SR-CEM 的核心创新在于它首次证明了仅利用束搜索得分和排名信息就能构建高效置信度估计模块,完全摆脱对 ASR 内部结构的依赖。这种架构无关性(architecture independence)意味着一个训练好的 SR-CEM 模块可以直接插入不同的 ASR 推理管线,无需修改原模型参数,也无需针对不同架构重新训练。轻量级 MLP 的推理开销几乎可以忽略不计,不会成为端到端延迟的瓶颈。

工程价值方面,SR-CEM 大幅降低了 MCE,这对于高风险决策场景尤为关键。在语音指令确认、自动字幕生成等应用中,一个经过良好校准的置信度分数可以充当可靠的过滤器,自动拒绝低置信度输出,从而显著降低词错误率(Word Error Rate)对下游任务的影响。部署成本低是另一大优势:无需重新训练庞大的 ASR 模型,只需收集 n-best 假设和参考文本即可训练 SR-CEM,这在计算资源和时间上都极为经济。

6. 我们的思考

在南京昱声科技的机器人语音交互业务中,端到端 ASR 常面临指令误识别问题,尤其在家居噪声环境下,吸尘器、电视、厨房电器等背景噪声会使识别准确率下降,错误的指令执行可能引发安全风险。SR-CEM 可后接一个置信度阈值过滤模块,当置信度低于阈值时触发确认机制或请求用户重复,从而避免错误动作。这直接对应我们在机器人语音交互方案中反复强调的“可靠性优先”原则。

SR-CEM 的思想同样可以迁移到声学检测领域。在产线音频质检中,异常声事件检测器(如电机异音检测、碰撞声检测)常输出多个候选结果及其得分。如果能借鉴 SR-CEM 的得分-排名特征构建方法,对检测器输出进行置信度校准,就能大幅降低误报率和漏报率。在声学检测产线质检方案中,我们已经在探索类似思路,将检测器输出的多候选结果得分和排名作为特征,训练一个轻量级校准模块,提升报警可靠性。此外,在语音降噪方案的多模态场景中,降噪后的语音信号送入 ASR 系统,SR-CEM 的校准能力可以进一步弥补降噪可能引入的失真,形成从信号处理到识别再到置信度评估的完整可靠性链路。

SR-CEM 的出现传递了一个重要信号:在 ASR 系统中,置信度校准不应被视为可有可无的后处理步骤,而应作为推理管线的一等公民来设计。对于南京昱声科技这样深耕机器人语音交互和声学检测的企业,这一思路值得认真吸收并落地到实际产品中。

原文链接:https://arxiv.org/abs/2607.29299

作者:Yichen Jia; Hugo Van hamme

发布日期:2026-07-31T11:15:22Z

收录:ICASSP 2026

相关问题解答

SR-CEM与传统的softmax置信度相比有什么优势?
传统softmax置信度校准误差大,容易出现过度自信或信心不足,而SR-CEM利用束搜索中的得分和排名信息,能有效降低最大校准误差和期望校准误差,更适合下游任务中的可靠决策。
SR-CEM是否只能用于特定类型的ASR模型?
不是,SR-CEM是架构无关的,只需ASR模型提供束搜索输出的n-best假设及其得分和排名,即可工作。论文验证了在混合系统和transducer模型上均有效,并可适配不同解码策略。
SR-CEM在噪声环境下的表现如何?
论文在噪声和对话语音条件下测试,SR-CEM仍能保持较低的校准误差,表现出对噪声和口语化表达的鲁棒性,适合实际部署场景。

需要专业服务?立即联系我们

南京昱声科技

联系电话请访问官网