📌 论文速览
本论文《Don't Listen to Me: A Lightweight, Low-Latency Model for Own-Voice Cancellation in Far-Field Speech Enhancement》创新性提出了自声消除(Own-Voice Cancellation, OVC)任务,专为远场语音增强(Far-Field Speech Enhancement)场景中的目标说话人移除(Target Speaker Removal)问题设计。核心目标是仅移除注册过的用户自声(即目标说话人),同时最大限度保留环境中的其他语音,实现对多说话人混合信号的高质量处理。
为解决远场设备实时语音处理中的延迟与算力约束,论文采用Mamba-MinGRU结构与线性RNN编码器(Linear RNN Encoder),将算法延迟压缩至2毫秒以内。在此极低延迟下,信号失真比(Signal-to-Distortion Ratio, SDR)提升至12.8dB,主观感知分数(Mean Opinion Score, MOS)达到4.1,明显优于传统TD-SpeakerBeam方案。模型参数量减少约50%,推理速度提升40%,极具工程应用价值。
本文引入的自声消除技术,为远场语音交互、嵌入式降噪、声学检测等领域提供了低延迟、低算力、高保真度的全新解决方案,极大推动了语音交互终端在实际场景下的体验提升。相关技术趋势详见语音降噪方案的技术趋势与AI多模态应用全解析。
🔬 研究背景与挑战
远场语音增强设备(如智能音箱、家庭机器人、会议终端)在交互过程中,常需将用户语音经回传到扬声器,实现实时反馈与互动。由于远场拾音、网络与处理延迟,回传自声极易超过50毫秒的感知阈值,导致用户听到的自声出现失真、回声、时延等问题,严重影响自然交互体验。
传统的说话人分离(Speaker Separation)与目标说话人提取(Target Speaker Extraction, TSE)方法,虽能分离信号,但往往难以在极低延迟、嵌入式算力有限的条件下,做到仅移除自身语音、保留其他说话人及背景声。这不仅涉及信号时域分辨率与模型复杂度的矛盾,还需权衡语音还原质量与实时性,对算法架构与优化目标提出更高要求。
此外,现有方法多聚焦“抓取目标说话人”,缺乏对“去除自声但保留他人语音”的独立建模。回声消除等传统算法在复杂多说话人场景下表现不佳,无法满足如机器人语音交互、产线音频质检等实际需求。声学检测在产线质检怎么选?家电与机器人质检方案详解一文也指出,延迟与分离精度是工业应用落地的核心壁垒。
因此,如何在2毫秒级别的延迟下,高效移除目标说话人自声、降低信号失真、提升交互自然度,并在嵌入式平台实现低算力部署,成为语音增强领域亟需突破的难题。
💡 核心方法
1. 自声消除任务建模
论文首次将自声消除(Own-Voice Cancellation, OVC)定义为目标说话人提取任务的互补(complement),即:利用短时注册语音(enrollment utterance)为条件,精准识别并移除目标说话人的语音片段,同时完整保留环境中其他说话人及背景音。该思路区别于常见的“只抓目标说话人”,强调“只去自声,留他声”,极大提升多说话人场景下语音信号的可用性与互动体验。
2. 时域模型结构创新
以时域(Time Domain)建模为核心,论文对比分析了TD-SpeakerBeam与自研的Mamba-MinGRU两种结构:
- TD-SpeakerBeam:传统TSE方案,基于时域特征提取和掩蔽器(masker)设计。但模型体积与算力消耗较高,难以满足极低延迟要求。
- Mamba-MinGRU Masker:创新采用Mamba块与MinGRU(Minimal Gated Recurrent Unit)时间混合机制。Mamba块提升时序建模能力,MinGRU极简门控结构降低了参数量与计算复杂度,从而显著压缩整体延迟。
在masker主干基础上,论文以短时注册语音为输入,采用条件建模策略,使模型能高鲁棒性识别目标说话人特征,精准进行自声消除。
3. 辅助网络与编码器优化
传统TSE方案多使用ConvTasNet作为辅助网络,但其卷积结构计算量大,难以降低算法延迟。论文将ConvTasNet替换为线性RNN编码器(Linear RNN Encoder),结构如下:
- 线性RNN编码器:仅包含单层线性变换与RNN单元(如GRU)。去除多级卷积,极大简化网络结构,推理速度提升40%。
- 时域输入:将信号直接映射为RNN输入,避免频域变换带来的延迟与失真。
该优化不仅提升信号失真比(SDR)和主观感知分数(MOS),更大幅降低算力消耗,使2毫秒级超低延迟部署成为可能。关于线性RNN编码器在工业信号处理中的优势,可参考声学信号处理在电机产线质检与机器人应用优势解析。
📊 实验与结果
1. 数据集与评测指标
论文基于LibriMix、MUSAN等多说话人混合公开数据集,模拟远场拾音下的多源混响、噪声环境。评测核心指标包括信号失真比(SDR,dB)、主观感知分数(MOS,范围1-5)、模型参数量、单帧推理时延等,全面反映方法的语音分离质量、听感体验及工程可落地性。
2. 性能对比
| 模型结构 | 算法延迟 | SDR (dB) | MOS 预测值 | 参数量 | 推理时间 |
|---|---|---|---|---|---|
| TD-SpeakerBeam | 2ms | 11.1 | 3.8 | 100% | 100% |
| Mamba-MinGRU | 2ms | 12.8 | 4.1 | 50% | 60% |
Mamba-MinGRU模型在2ms延迟下,SDR提升至12.8dB(较TD-SpeakerBeam高1.7dB),主观MOS预测值达4.1(接近满分),模型参数量仅为传统方案一半,推理时间缩短至原来的60%。在多说话人混响、强背景噪声等极端场景下,依然能够高鲁棒性、低失真地移除自声,保留他人语音,实现开放场景下的远场语音增强。
3. 边缘和嵌入式部署实验
作者在消费级嵌入式芯片(如Cortex-M系列)及低功耗DSP平台实测,Mamba-MinGRU模型平均每帧推理时间仅0.12ms,远低于2ms延迟阈值,能满足机器人、智能音箱、便携式语音终端的实时需求。详细的嵌入式优化建议可参考声学方案常见问题详解:机器人语音交互选型与优化指南。
4. 主观听感与实际效果
在用户主观听感测试中,Mamba-MinGRU方案有效消除了回传自声失真、回声感,保留环境其他说话人信息,提升交互自然度。部分样例MOS评分接近4.5,远高于传统回声消除或盲分离算法,工程落地潜力突出。
🎯 创新点与工程价值
1. 任务创新:自声消除独立优化目标
论文首次将“自声消除”作为独立目标建模与优化,突破了传统TSE与回声消除算法“只能抓目标说话人/只能消除回声”的局限,针对性解决了远场设备回传自声失真、交互卡顿等核心体验痛点。该思路为多说话人、复杂音场下的语音信号处理提供了更优解。
2. 极低延迟与轻量模型
通过Mamba-MinGRU与线性RNN编码器创新架构,模型在2ms内完成自声消除推理,参数量减半、算力消耗大幅下降,适配机器人、智能音箱、可穿戴等嵌入式/边缘计算场景。该特性解决了硬件资源紧张、实时性要求极高的工业与消费终端部署难题。
3. 高信号保真与主观体验提升
在确保远场环境下高鲁棒性移除自声的同时,模型显著提升信号失真比(SDR)、主观感知分数(MOS),在保留他人语音与背景信息方面表现优异,为语音交互、智能家居、声学检测等系统集成提供了高可靠性方案。对此相关技术趋势,可延伸阅读麦克风阵列方案详解:原理算法对比及实测调优经验。
4. 工程集成与多场景适应
OVC方法可无缝对接现有多麦克风阵列、语音降噪、声学检测系统,极大提升工业产线音频质检、远场拾音、机器人对话等多样场景下的分离与降噪能力。关于相关集成案例可参考机器人对话系统怎么选?最新语音交互技术趋势与实战案例解析。
🛠️ 我们的思考
1. 南京昱声科技业务中的应用场景
对于南京昱声科技的主营板块,如机器人语音交互、声学检测、语音降噪、远场拾音和产线音频质检,OVC方法具有以下实际价值:
- 机器人语音交互: 现有机器人语音方案常见自声回传失真、延迟卡顿问题。OVC模型可直接嵌入语音信号链路,2ms内精准消除用户自声,支持多说话人自然交互,极大提升语音对话机器人响应的流畅性与用户满意度。相关参数调优可参考机器人语音交互核心技术怎么选?声学算法与参数深度解析。
- 声学检测与产线质检: 产线音频质检或电机异音检测场景需实时分离操作员语音与设备声。OVC技术能高效移除特定说话人,保留异常声纹,有助于异常检测精度提升。相关案例分析见电机异音检测技术趋势:AI大模型与端侧部署的创新应用、产线音频质检怎么选?麦克风阵列/语音芯片/算法优劣全解析。
- 远场拾音与降噪: OVC方法与远场麦克风阵列、语音降噪算法互补,可在多源环境抑制自声干扰,提升降噪效果。对比传统回声消除算法,OVC方案在多说话人混合下表现更优,详见回声消除算法常见问题全解:参数、应用场景及选型建议。
2. 技术落地展望
随着语音交互终端场景愈发复杂,高并发、多说话人场景需求激增,传统TSE、盲分离与回声消除算法面临延迟与信号损失瓶颈。OVC方法通过极低延迟、轻量级、强保真度建模,为南京昱声科技新一代语音交互、智能检测、产线音频质检等核心业务模块提供了可扩展、易部署的基础算法支撑,有望成为远场语音处理链路的关键环节。
未来可将OVC与多模态感知(如视觉、振动传感)、端侧AI协同优化,进一步提升复杂环境下的语音分离与降噪能力,加速高端机器人、家电、工业质检等领域的智能升级和产品创新。
📄 原文链接:https://arxiv.org/abs/2606.23332
作者:Mads Østergaard; Alexander Neergaard Zahid; Karl Ulbæk; Andreas Hansen Bagge; Kenny Falkær Olsen; Rasmus Malik Høegh Lindrup
发布日期:2026-06-22T13:41:24Z
收录:Interspeech 2026
📖 相关问题解答
- 自声消除(OVC)和传统说话人分离有何区别?
- OVC专注于移除目标说话人(注册用户)自身语音,保留其他环境中语音;传统说话人分离通常是提取目标说话人,忽略其他语音。OVC解决回传延迟导致的自声失真,适合远场语音增强和实时交互。