1. 论文速览
ABSE-NET是INTERSPEECH 2026收录的一篇双耳语音增强(Binaural Speech Enhancement, BSE)论文,针对开放耳(Open-Fit)助听器场景提出了一套主动增强框架。该框架将双耳MVDR(Binaural Minimum Variance Distortionless Response)波束成形与轻量神经网络(Lightweight Neural Network, LNN)级联,在无需耳内麦克风的前提下,同时完成目标语音增强和声学泄漏抑制。
核心性能数据方面,在模拟开放耳场景的测试中,ABSE-NET相比现有最优方法,PESQ(Perceptual Evaluation of Speech Quality)指标提升0.27,STOI(Short-Time Objective Intelligibility)提升2.8个百分点,DNSMOS(Deep Noise Suppression Mean Opinion Score)提升0.19。模型参数量仅约0.5M,具备在嵌入式DSP平台实时运行的潜力。
论文的工程价值在于,传统主动噪声控制(Active Noise Control, ANC)方案依赖耳内误差麦克风来采集残余噪声信号,而ABSE-NET在训练阶段学习声泄漏的映射关系,部署时仅需双耳外置麦克风,显著简化了硬件设计。模型代码已在GitHub开源(https://github.com/Bream101/ABSE-NET),便于学术复现和工程移植。
2. 研究背景与挑战
开放耳助听器因佩戴舒适性受到市场青睐,但其耳道开放设计带来了一个根本性难题:外部环境噪声通过开放缝隙直接泄漏进入耳道,与助听器播放的增强语音混合,严重降低语音清晰度。传统BSE方法建立在封闭耳道假设之上,无法应对这种声学泄漏路径。
ANC技术虽然能主动产生反相噪声来抵消泄漏,但经典方案需要耳内放置误差麦克风来实时监测残余噪声。这不仅增加了助听器的硬件体积和功耗,还提高了制造成本。对于耳道空间有限的开放耳设备,额外安放麦克风在工程上并不现实。
现有BSE+ANC级联方案尝试将两者结合,但通常采用自适应滤波(Adaptive Filtering)实现,BSE和ANC模块各自独立优化,缺乏端到端的联合训练机制。级联结构中的误差会在模块间传递放大,且自适应滤波的收敛速度在动态噪声环境下难以保证。这些限制使得传统方案在开放耳场景中的实际表现大打折扣,难以满足用户对语音清晰度和聆听舒适度的双重需求。正如语音交互公司怎么选?远场识别、降噪参数等8个技术问题一次讲透中提到的,多麦克风降噪方案的设计需要综合考虑硬件约束与算法鲁棒性,开放耳助听器面临的正是这一典型挑战。
3. 核心方法
ABSE-NET采用两级流水线架构。第一级是双耳MVDR波束成形器,利用左右耳外置麦克风阵列的空间信息,在目标语音方向形成波束增益,同时对非目标方向的干扰噪声进行初步抑制。MVDR的优势在于无需噪声参考信号即可实现空间滤波,为后续神经网络提供经过粗增强的信号。
第二级是轻量神经网络,采用编码器-解码器(Encoder-Decoder)结构。编码器将MVDR输出和参考噪声信号映射到特征空间,解码器则从特征中重建增强后的语音。网络的创新核心在于特征融合模块(Feature Fusion Module, FFM),该模块由两个子组件构成:频时依赖学习(Frequency-Time Dependency Learning, FTDL)单元和卷积注意力块(Convolutional Attention Block, CAB)。
FTDL单元专门建模频谱维度与时间维度之间的依赖关系。语音信号在频域和时域上的相关性并非独立,例如共振峰结构在时间上的演化规律、谐波成分的频域关联等,FTDL通过跨维度的交互机制捕捉这些模式。CAB则引入通道注意力和空间注意力,让网络自适应地关注关键频带和时间帧,对声泄漏成分和MVDR引入的失真进行精准补偿。
训练阶段,LNN以耳内虚拟麦克风信号作为监督目标,学习从外置麦克风信号到干净耳内信号的映射。这一策略使得网络隐式地建模了声泄漏路径和残余噪声的分布。部署时,耳内麦克风不再需要,系统仅依赖双耳外置麦克风即可完成推理。整个框架实现了BSE和ANC的联合优化,避免了传统级联方案中的误差累积问题。
4. 实验与结果
实验在模拟开放耳声学场景下进行,使用多种噪声类型(包括稳态噪声、非稳态噪声、竞争说话人语音)和不同混响条件(RT60范围为0.2s至0.8s)构建测试集。对比方法涵盖MVDR基线、传统BSE方案、ANC级联方案以及多种神经网络降噪模型。
下表展示了ABSE-NET与代表性基线方法在三个核心指标上的对比结果:
| 方法 | PESQ | STOI (%) | DNSMOS |
|---|---|---|---|
| 未处理 | 1.52 | 78.3 | 2.41 |
| BMVDR | 1.71 | 81.5 | 2.58 |
| BSE+ANC级联 | 1.95 | 84.7 | 2.82 |
| ABSE-NET | 2.22 | 87.5 | 3.01 |
ABSE-NET在全部指标上均取得最优结果。相比BSE+ANC级联方案,PESQ提升0.27,STOI提升2.8个百分点,DNSMOS提升0.19。值得注意的是,仅靠BMVDR粗增强就能带来明显改善,但级联LNN后的增益更为显著,说明神经网络的声学泄漏补偿和失真修复起到了关键作用。
消融实验进一步验证了各模块的贡献。移除FFM模块后,PESQ下降0.11,STOI降低1.5个百分点;移除CAB子模块同样导致性能退化。模型参数量仅0.5M,在CPU上的推理时延满足实时处理要求(单帧处理时间低于帧移长度),证明了轻量级设计的工程可行性。
5. 创新点与工程价值
ABSE-NET的核心创新在于首次将ANC的思想融入端到端BSE神经网络框架。传统上,ANC和BSE被视为两个独立的技术分支,前者依赖自适应滤波和参考麦克风,后者依赖波束成形和深度学习。ABSE-NET打破了这一界限,在统一网络中完成空间滤波、声泄漏抑制和失真补偿三项任务。
无需耳内麦克风的特性是工程落地层面的重要突破。开放耳助听器的耳道空间极为有限,省去耳内麦克风意味着更小的设备体积、更低的功耗和更简单的生产工艺。这套方案将硬件复杂度从助听器本体转移到了训练阶段的算法设计上,是一种"以软代硬"的实用策略。对于机器人语音交互公司怎么选?麦克风、芯片与算法选型指南中讨论的嵌入式语音处理场景,这种思路同样具有参考价值。
轻量级神经网络设计(0.5M参数)使得模型可以在低功耗DSP或NPU上运行,满足助听器对续航和实时性的严苛要求。编码器-解码器搭配FFM的架构在保持低计算量的同时,实现了对频谱-时间二维依赖关系的有效建模。代码开源进一步降低了技术门槛,研究人员和工程师可以在此基础上针对具体声学场景进行微调和迁移。该框架的联合优化策略也为其他多麦克风降噪任务提供了新范式——将传统信号处理模块与神经网络深度融合,在统一目标下训练,减少级联损失。
6. 我们的思考
南京昱声科技在机器人语音交互产品中广泛应用麦克风阵列方案,ABSE-NET的双耳MVDR加轻量网络级联思路可直接借鉴。将BMVDR替换为适用于机器人几何形态的多通道波束成形器,后端接入定制化的FFM网络,有望在远场人机对话场景中同时抑制环境噪声和机器人自噪声,提升语音识别鲁棒性。相关技术路径与语音合成公司如何构建高可用机器人对话系统?技术深度解析中讨论的前端声学处理链条高度互补。
在声学检测业务中,产线音频质检常面临设备自噪声和车间环境干扰。ABSE-NET的主动噪声抑制思路——即在训练阶段学习噪声映射、推理时无需参考麦克风——可用于设计针对特定产线噪声的降噪模型,提高异常声音检测的准确率。特征融合模块中的FTDL和CAB组件本身也具有通用性,可以迁移到声学场景分类、音频事件检测等任务中,作为特征提取的增强模块。
开源代码已在GitHub发布,我们计划在机器人声学前端平台上进行移植测试,评估模型在真实远场拾音条件下的泛化能力。同时,FFM的频时依赖建模机制值得深入研究,探索其在多通道声源定位和声场重建中的潜力。ABSE-NET所代表的"信号处理+神经网络联合优化"范式,为构建端到端声学处理流水线提供了清晰的技术路线,有助于减少传统级联架构中的误差传递和调参复杂度。
原文链接:https://arxiv.org/abs/2609.00966
作者:De Hu; Xue Du; Qingying Zhao; Qintuya Si
发布日期:2026-09-01T09:21:00Z
收录:INTERSPEECH 2026
相关问题解答
- ABSE-NET是否真的不需要耳内麦克风?
- 是的,ABSE-NET在训练时使用仿真数据学习声泄漏的映射,部署时仅需双耳外置麦克风。LNN通过输入MVDR输出和参考噪声,能够补偿声泄漏和失真,无需耳内误差信号。这不同于传统ANC方法,简化了硬件设计。