论文速览:SE-AGCNet端到端语音增强与响度控制联合优化
SE-AGCNet首次提出将语音增强(Speech Enhancement,SE)和自动增益控制(Automatic Gain Control,AGC)融合为端到端(End-to-End)网络,针对会议场景复杂的音量变化与噪声环境优化语音前处理链路。传统音频处理常将SE与AGC分步串行:先降噪再调响度,或先调响度再降噪,实测存在噪声放大或弱语音被过度压制等问题。SE-AGCNet通过多任务学习(Multi-Task Learning),实现语音增强与响度均衡的协同优化,提升信噪比(SNR)与语音可懂度。
论文在合成会议语音数据集上评测,关键指标达到了行业标准:输出响度稳定在-23 LUFS(Loudness Units relative to Full Scale)±1 LU范围,语音质量PESQ(Perceptual Evaluation of Speech Quality)从2.83提升至3.00,ASR(Automatic Speech Recognition)识别准确率提升1.5%,低音量语音可懂度大幅优化。与分步串行处理方案相比,SE-AGCNet在语音质量、响度规范、ASR准确率等多维度均实现突破,首次在会议场景实现端到端联合优化,解决了传统链路中的核心矛盾。
会议语音场景下,SE-AGCNet为语音前处理提供了更智能、更稳定的技术路径,对于机器人语音交互、远程协作、产线音频质检等场景具有直接工程价值。更多会议语音信号优化内容,可参考声学信号处理在电机产线质检与机器人应用优势解析。
研究背景与挑战
传统语音前处理链路的局限
现有音频系统普遍将语音增强与自动增益控制割裂为独立模块:SE负责降噪、回声消除,AGC负责响度规范化。串行处理存在如下典型问题:
- AGC先于SE:噪声未降前增益放大,导致背景噪声同步被增强,信噪比恶化。
- SE先于AGC:弱语音被过度压制,AGC难以有效提升低音量语音响度,影响语音可懂度与ASR准确率。
会议场景的复杂性
会议语音信号处理需满足两大核心指标:
- 语音可懂度(Intelligibility):降噪、回声消除保证清晰度,支持ASR准确率提升。
- 响度标准化(Loudness Normalization):输出语音响度要符合LUFS行业规范,方便后续录音、转写、远程协作。
核心方法
SE-AGCNet端到端协同优化网络架构
SE-AGCNet采用端到端神经网络架构,将语音增强与自动增益控制集成为单一模型。网络输入为会议原始混合语音信号,输出为降噪且响度标准化的语音。核心创新在于:
- 多任务损失函数设计:联合优化语音增强损失(如SNR、PESQ)与响度损失(LUFS、LRA),实现降噪与响度均衡协同提升。
- 网络结构融入自适应增益模块:增强低音量语音保留,同时自动抑制噪声增益,确保输出符合响度规范。
会议场景专用数据仿真管线:SE-AGC-DataGen
论文提出SE-AGC-DataGen数据模拟管线,针对会议场景多说话人、复杂噪声、极端音量分布进行数据增强。包含:
- 多说话人音量分布模拟:随机分配说话人音量(低、中、高),覆盖实际会议动态范围。
- 环境噪声合成:叠加空调、敲键盘、翻页等多种噪声,信噪比(SNR)覆盖-5~20 dB。
- 响度标签标准化:预标注LUFS、LRA等响度标准,便于模型训练与评测。
响度标准化评价指标集成
将LUFS(Integrated Loudness)、St LUFS(Short-Term Loudness)、LRA(Loudness Range)等响度标准化指标集成到模型训练与评测流程。具体实现:
- 训练阶段:响度损失与语音增强损失联合优化,确保输出语音既降噪又响度一致。
- 评测阶段:输出LUFS误差控制在0.8 LU以内,LRA符合会议行业标准(3~6 LU)。
实验与结果
输出响度与稳定性
在合成会议语音集(含多说话人、噪声环境)上,SE-AGCNet输出响度(LUFS)平均值为-23.1 LU,标准差仅0.8 LU,显著优于传统串行系统(标准差2.1 LU)。不同说话人音量输入下,SE-AGCNet均能将输出响度控制在行业标准区间(-23 LUFS±1 LU),保证远程协作、录音等场景的响度一致性。
语音质量与ASR识别准确率
降噪效果以PESQ(主观语音质量)评估,SE-AGCNet处理后PESQ从2.83提升至3.00,低音量语音PESQ提升尤为显著(提升0.24)。ASR识别准确率(Word Error Rate,WER)由串行系统的8.6%降至7.1%,提升1.5%。低音量语音可懂度提升,ASR误差率降低,满足会议场景对语音质量与语音识别的双重需求。
信噪比与响度均衡协同提升
SE-AGCNet在信噪比提升与响度均衡方面实现协同优化:
- 信噪比(SNR)平均提升2.1 dB。
- LRA(响度动态范围)减小至4.2 LU,弱语音响度提升,强噪声未被过度放大。
创新点与工程价值
端到端联合优化的突破
SE-AGCNet首次实现语音增强与自动增益控制的端到端联合优化,打破了传统串行处理链路的天然矛盾。多任务学习机制确保降噪与响度均衡协同提升,无需分步调参,极大减少工程部署难度。
端到端方案对会议系统、机器人语音交互、远程协作等场景具有极强可复用性与工程落地价值。
专用数据生成与标准化响度指标引入
SE-AGC-DataGen仿真管线针对会议场景多说话人、极端音量分布、复杂环境噪声进行数据增强,保证模型泛化能力、适应真实音频信号。集成LUFS、LRA等行业响度标准,输出语音直接适用于录音、转写、远程会议等场景,工程部署更高效。
工程落地路径
SE-AGCNet为会议、机器人、产线音频检测等场景提供了可复用技术方案,通过端到端学习实现语音信号降噪与响度均衡协同优化,可直接应用于南京昱声科技的语音交互、声学检测、远场拾音等产品线。更多工程落地案例可参考产线音频质检怎么选?麦克风阵列/语音芯片/算法优劣全解析。
我们的思考:端到端SE+AGC对昱声科技的启发
机器人语音交互与远场降噪优化
南京昱声科技在机器人语音交互、远场降噪等产品线,面临语音信号动态范围大、噪声干扰强等挑战。SE-AGCNet端到端协同优化方案可直接提升语音拾音信噪比与响度一致性,增强机器人语音理解与交互体验。相关机器人语音技术可参考机器人语音交互核心技术怎么选?声学算法与参数深度解析。
声学检测与产线音频质检场景
产线音频质检、声学检测场景需稳定、可控的语音信号作为检测输入。SE-AGCNet可确保检测信号响度标准化、噪声抑制,提升检测算法鲁棒性和准确率。对于电机异音检测、家电质检等场景,端到端SE+AGC方案为声学前处理提供更智能的技术基础。相关检测方案可参考声学检测在产线质检怎么选?家电与机器人质检方案详解。
未来拓展与集成融合
SE-AGCNet端到端协同优化为多场景语音前处理框架奠定基础。未来可探索与说话人分离、回声消除、麦克风阵列拾音等模块的深度集成,打造更智能的多模态语音处理链路。相关技术趋势可参考麦克风阵列方案详解:原理算法对比及实测调优经验,以及回声消除算法常见问题全解:参数、应用场景及选型建议。
结语:会议语音前处理新方案的技术趋势
SE-AGCNet以端到端学习为核心,实现语音增强与自动增益控制的联合优化,显著提升会议语音信号的质量、响度一致性和ASR准确率。专用数据仿真与标准化响度指标保障了模型的泛化与工程落地。该方案为机器人语音交互、产线音频质检、远场拾音等场景提供了可复用的技术路径,是语音前处理链路智能化演进的重要里程碑。更多智能语音前处理技术可参考声学方案常见问题详解:机器人语音交互选型与优化指南。
📄 原文链接:https://arxiv.org/abs/2606.25959
作者:Jinming Zhang; Wei Rao; Xionghu Zhong; Eng Siong Chng
发布日期:2026-06-24T15:32:42Z
收录:Interspeech 2026
📖 相关问题解答
- SE-AGCNet适用于哪些实际场景?
- 会议系统、远程办公、语音机器人、智能麦克风阵列等需要语音增强与响度一致性的应用