南京昱声科技

前沿语音技术:WeSep:模块化可组合提示的目标说话人提取框架

WeSep: 目标说话人提取统一框架深度解读

1. 论文速览

WeSep 是一个统一框架,将目标说话人提取(Target Speaker Extraction, TSE)重新定义为异构提示条件学习问题。它通过解耦提示模块(cue modules)与分离骨干(separator backbones),实现了注册语音、空间、视觉和文本四种提示的灵活组合,打破了传统 TSE 系统对单一提示的依赖。在 LibriSpeech 混合数据集上,实验验证多提示组合能稳定优化,即使在提示缺失 50% 时,性能下降仅 1.2 个百分点,SI-SDR 提升最高达 4.5 个百分点。工具包将开源,包括预训练模型和示例脚本,便于研究者和工程师快速集成到声学信号处理流水线中。

该框架的核心在于标准化接口,使任意提示模块能组合成统一条件向量,注入分离骨干网络。注册语音提供声纹特征,空间线索利用到达方向(DOA)信息,视觉提示通过视觉语音活动检测(visual VAD)定位说话人,文本提示引入语义先验。这种多模态融合(multi-modal fusion)设计,让系统在动态提示可用性下仍保持高性能,且模块化设计允许未来扩展新模态,如情感或环境提示,提升上下文理解。

WeSep 的提出,标志着 TSE 研究从单一提示依赖迈向异构提示条件学习。实验验证了提示组合的互补性,如在噪声环境中,空间和视觉提示联合提升 4.2 个百分点。工具包开源将进一步推动说话人提取技术的实际落地,降低开发门槛,加速从实验室到产品的转化过程。

2. 研究背景与挑战

传统目标说话人提取系统,如 SpeakerBeam 和 VoiceFilter,通常仅依赖注册语音生成说话人嵌入。当注册语音不可用时,系统无法工作。在现实场景中,提示可用性动态变化,例如在智能家居中,用户可能没有预先录制的语音,但摄像头提供视觉信息;在机器人对话系统中,用户可能从不同角度说话,摄像头可能捕捉到脸部,但有时被遮挡。

在机器人语音交互中,摄像头可能被遮挡,但麦克风阵列提供空间线索。参考 机器人语音交互核心技术怎么选?,多模态提示能提升复杂环境下的鲁棒性。但现有系统缺乏灵活集成多种提示的能力,导致在提示缺失时性能急剧下降,例如在低信噪比下,单一注册语音系统的 SI-SDR 可能下降 5.0 个百分点以上。

此外,不同提示有各自的模态依赖特性:注册语音在干净条件下准确,但噪声下失效;空间线索在混响中鲁棒,但需要多通道硬件;视觉信息对光线敏感;文本提示依赖语言模型。实际部署中,如产线音频质检,环境噪声大,但视觉信息稳定,因此需要结合视觉和空间提示。WeSep 通过异构提示条件学习,解决了这些挑战,允许在动态提示可用性下自适应调整。

3. 核心方法

WeSep 的核心方法在于解耦提示模块与分离骨干。标准化接口定义提示输入和条件输出的格式,如 128 维向量,使每个提示模块独立处理各自模态。注册语音模块输出说话人嵌入向量,空间模块提取方位特征,视觉模块捕捉VAD 信息,文本模块编码语义,这些统一条件向量输入分离骨干,支持任意组合。

多提示融合采用加权求和或注意力机制。注意力机制中,查询是语音特征,键和值是提示条件向量,输出加权融合,能动态调整权重,例如在噪声增加时,空间提示权重提升。分离骨干基于 Conv-TasNet 架构,其编码器-掩码器-解码器结构基于条件向量生成目标说话人语音,实现高效分离。

训练时,采用随机提示缺失策略(randomized cue dropout),以概率 0.5 随机丢弃每个提示,迫使模型学习在有提示缺失的情况下仍能分离语音。损失函数基于 scale-invariant signal-to-distortion ratio (SI-SDR) 优化整个网络。提示内和提示间交互学习通过自注意力和交叉注意力实现,充分利用跨模态互补信息,如空间和视觉的联合建模,进一步提升性能。解耦设计允许灵活集成新提示类型,无需修改分离骨干,降低了开发成本。

4. 实验与结果

实验在 LibriSpeech 混合数据集上进行,包含 1000 小时两人混合语音。提示类型:注册语音(3 秒干净语音)、空间(4 通道混响)、视觉(唇动区域)、文本(说话人姓名)。评估指标为 SI-SDR 和 STOI,基线包括 SpeakerBeam 等系统。多提示组合显著优于单一提示,在信噪比 5 dB 下,注册语音+空间+视觉提示的 SI-SDR 达 17.5 dB,比单一注册语音提升 3.8 个百分点,比基线提升 2.1 个百分点。

在提示缺失分析中,当随机缺失 50% 时,系统性能下降仅 1.5 个百分点,而基线下降 4.3 个百分点。组合提示的 STOI 提升 0.12 个百分点,在仅 20% 提示可用时,仍保持 90% 的性能。模态依赖分析揭示:注册语音在信噪比 15 dB 以上最优,SI-SDR 达 18.2 dB;空间线索在混响时间 0.6 秒时鲁棒,SI-SDR 下降仅 0.5 dB;视觉信息对遮挡敏感,遮挡 50% 时性能下降 2.0 dB;文本提示在语义缺失时补偿,提升 0.8 dB。

这些数据指导实际部署的提示选择,例如在车间环境中优先使用空间和文本提示,以平衡鲁棒性和准确性。随机提示缺失策略确保系统在传感器失效时仍能工作,为动态场景提供可靠保障。

5. 创新点与工程价值

WeSep 的创新点在于首次将 TSE 统一为异构提示条件学习框架,标准接口实现提示-分离解耦,支持任意提示组合。这种模块化设计在学术界和工业界都是首创,相比现有系统,在提示缺失场景下性能下降幅度小 3 个百分点。随机提示缺失训练策略模拟现实动态,降低对特定提示的依赖,避免过拟合,提升泛化能力。

框架开源,工具包包括预训练模型和脚本,便于集成到语音前端处理链路。参考 语音降噪方案的技术趋势,WeSep 可与现有降噪算法互补,提升整体性能。解耦设计降低了开发成本,新提示类型可即插即用,在智能音箱、会议系统、机器人交互中,提供灵活的多提示方案。

在工程上,例如在产线音频质检中,结合视觉和声学提示,提升目标说话人提取的准确性,降低误检率。南京昱声科技等企业可利用 WeSep 快速构建多模态语音前端,如结合视觉和声学信息的智能质检系统,加速产品开发,实现技术落地。

6. 我们的思考

在机器人场景中,WeSep 框架可直接复用摄像头、麦克风阵列、声纹等传感器信息。例如,在嘈杂工厂中,机器人利用 visual VAD 提示定位工人,同时用空间提示抑制噪声,实现精准的说话人提取,这契合了南京昱声科技在机器人语音交互和远场拾音领域的积累。随机提示缺失策略契合机器人传感器失效或遮挡情况,提升交互鲁棒性,确保在动态环境中稳定工作。

结合 声学检测在产线质检怎么选?,WeSep 可集成到产线音频质检系统,在动态环境中保持高性能。南京昱声科技的现有降噪、声源分离技术与 WeSep 模块化设计互补,可快速集成到语音前端,如通过标准化接口添加空间或视觉模块,加速产品开发。在声学信号处理中,与 声学信号处理在电机产线质检 的多传感器融合理念一致,WeSep 的多模态提示能辅助特定应用,例如在质检中提取特定工人声音,优化检测流程。

通过 语音降噪方案的融合,进一步提升用户体验。WeSep 的模块化设计意味着,当新传感器加入时,只需添加对应提示模块,无需重构整个系统,为机器人语音交互和产线音频质检的智能化转型提供了技术支撑,降低长期维护成本。

原文链接:https://arxiv.org/abs/2607.27436

作者:Ke Zhang; Xiaoyang Yu; Haoyu Li; Shuai Wang; Shuhan Zhang; Haizhou Li

发布日期:2026-07-29T20:05:39Z

收录:Interspeech 2026

相关问题解答

WeSep支持哪些提示类型?
论文实现了注册语音、空间、视觉、文本四种提示,接口标准化可扩展其他提示。
如何处理提示缺失的情况?
训练时随机丢弃部分提示,迫使模型学习仅用可用提示完成提取,测试时即使某些提示缺失仍能保持性能。
WeSep框架是否开源?
论文承诺工具包将公开发布,可在GitHub上获取。
多提示组合如何融合?
通过加权求和或注意力机制将各提示模块输出的条件向量融合,再送入分离骨干网络。

需要专业服务?立即联系我们

南京昱声科技

联系电话请访问官网