南京昱声科技

前沿语音技术:TF-MossFormer 融合卷积门控局部-全局注意力的语音分离

1. 论文速览

TF-MossFormer 是 Interspeech 2026 接收的一篇单通道语音分离论文,在时频域构建了一个结合局部与全局注意力的 Transformer 架构。论文在 WSJ0-2Mix 基准上报告了三组模型规模的结果:5.9M 参数版本达到 22.6 dB 的 SI-SDRi(尺度不变信号失真比改善),16.9M 参数达到 24.0 dB,25.4M 参数达到 24.4 dB。这组数据横向对比 SepFormer 的 22.3 dB、MossFormer 的 23.2 dB、TF-GridNet 的 23.9 dB,均有显著优势,且小模型版本在参数效率上表现突出。

核心思路可以概括为“动态局部注意力 + 全局注意力 + 卷积门控”的三明治结构。传统方法要么依赖全局自注意力(容易丢失局部连续性),要么采用固定窗口的卷积或分块注意力(感受野僵硬)。TF-MossFormer 提出内容感知滑动窗口注意力(Content-Aware Sliding Window Attention),让每个时频位置根据输入特征动态预测窗口偏移量,从而在谐波边缘、清音过渡等区域获得更精细的局部建模能力。同时,模型在二维谱图(spectrogram)上同时沿时间轴与频率轴执行注意力,完整保留了语谱图的结构化信息。

2. 研究背景与挑战

语音分离任务的核心矛盾在于:长时依赖(long-range dependency)需要捕捉说话人持续的音色、韵律特征,而局部精细结构(local continuity)需要保留谐波连续性和共振峰过渡的细节。纯全局自注意力(self-attention)在计算所有位置之间的关联时,容易把局部邻域内的平滑变化平均化,导致分离后的语音出现频谱断裂或伪影。固定卷积(static convolution)虽然能稳定提取局部模式,但其感受野由核大小硬编码,无法适应不同声学事件的时间尺度——清音段需要的窗宽与浊音谐波区域完全不同。

另一条技术路线是时域分块方法,如 SepFormer 和 MossFormer。它们将原始波形切分成块,在块内和块间分别做注意力建模。这类方法受限于一维序列的视角,无法显式利用语谱图在频率轴上的结构化信息。在真实声学场景中,频率轴上的谐波结构、共振峰轨迹、声道调制模式都是重要的分离线索,时域分块方法将频率维度的交互完全交给隐式学习,效率上存在瓶颈。TF-MossFormer 转向时频域(time-frequency domain)二维建模,正是为了解决这一问题。

3. 核心方法

模型输入为复数谱图(complex spectrogram),通过编码器提取二维时频特征图,主体由多个 TF-MossFormer 块堆叠而成。每个块的结构可以描述为:内容感知滑动窗口注意力(SWA)→ 卷积门控 → 全局注意力(GA)→ 卷积门控,形成局部到全局的信息流。

3.1 内容感知滑动窗口注意力

这是全文最核心的创新。标准滑动窗口注意力使用固定大小的窗口,窗口在特征图上滑过,每个位置只能看到窗口内的邻域。TF-MossFormer 的 SWA 不预设窗口边界,而是通过一个轻量门控网络(gating network)根据输入特征预测每个时频位置的窗口偏移量(offset)。偏移量决定了窗口在时间轴和频率轴上的伸缩与平移,使感受野(receptive field)随内容自适应变化。在语音谐波边缘处,窗口可以收缩以保留锐利过渡;在清音段,窗口可以展开以捕捉扩散的噪声结构。这种机制本质上是将可变形卷积(deformable convolution)的思想迁移到了注意力计算中,但以滑动窗口的形式实现,避免了密集偏移预测的计算开销。

3.2 卷积门控

卷积门控模块(Convolutional Gating)位于 SWA 和 GA 之间,采用深度可分离卷积(depthwise separable convolution)与门控线性单元(GLU)的组合。它的作用有三层:一是对注意力输出进行通道级特征筛选,抑制噪声特征传递;二是在局部注意力和全局注意力之间形成信息瓶颈,迫使 SWA 输出更精炼的局部特征;三是通过卷积操作强化通道间交互,补偿注意力机制在通道维度上的弱建模能力。消融实验中移除该模块导致 SI-SDRi 下降 0.5 dB,说明其在信息流控制中不可替代。

3.3 时频二维注意力

与时域分块方法不同,TF-MossFormer 在二维谱图上同时沿时间轴和频率轴执行注意力。时间轴注意力建模帧间依赖,频率轴注意力建模频带间依赖。消融实验表明,频率轴注意力相对纯时间轴注意力带来了额外增益,验证了频率维度结构化信息对分离任务的价值。

4. 实验与结果

实验在 WSJ0-2Mix 数据集上进行,该数据集是语音分离领域的标准测试集,包含两个说话人的混合语音。TF-MossFormer 按参数量分为小(5.9M)、中(16.9M)、大(25.4M)三个版本,与多个主流方法进行了对比。

模型参数量SI-SDRi (dB)SDRi (dB)
SepFormer26M22.322.6
MossFormer42M23.223.5
TF-GridNet14M23.924.2
TF-MossFormer-S5.9M22.622.9
TF-MossFormer-M16.9M24.024.3
TF-MossFormer-L25.4M24.424.7

小模型版本以不到 SepFormer 四分之一、不到 MossFormer 七分之一的参数量,实现了比 SepFormer 高 0.3 dB、接近 MossFormer 的性能。中模型和大模型则分别以 16.9M 和 25.4M 参数达到 24.0 dB 和 24.4 dB,超越了此前最优的 TF-GridNet。

消融实验解构了各模块的独立贡献:移除内容感知滑动窗口(替换为固定窗口注意力)使 SI-SDRi 下降 0.7 个百分点;移除卷积门控下降 0.5 个百分点;移除频率轴注意力(仅保留时间轴)同样带来可测量的性能损失。三个模块的增益具有可加性,没有出现冗余或冲突。

5. 创新点与工程价值

首次将内容感知的动态窗口注意力引入语音分离。此前可变形注意力主要应用于图像领域,TF-MossFormer 证明在时频谱上动态调整感受野同样有效,且参数量可控。这为语音增强、声学场景分类等任务提供了可迁移的范式。

时频域二维建模与卷积门控的组合。二维谱图保留了频率轴的结构化信息,内容感知 SWA 在二维空间上自适应调整窗口,比一维分块方法更自然地利用了语音的时频特性。卷积门控作为轻量级特征筛选模块,在保证性能的同时控制了计算开销。

参数效率突出。5.9M 的小模型版本已具备实用价值,适合部署在资源受限的实时系统中。对于终端设备上的语音分离与增强任务,这一参数规模意味着可以在不显著增加功耗和延迟的情况下获得接近大模型的效果。

6. 我们的思考

南京昱声科技深耕机器人语音交互与声学检测两大业务线,TF-MossFormer 的技术路线与我们面临的实际需求高度契合。

机器人语音交互场景中,餐厅、展厅、酒店大堂等环境常伴随多说话人重叠、突发噪声和强混响。当前的远场拾音与降噪管线多采用传统波束形成加单通道后处理,在非平稳噪声和多人声叠加时处理能力不足。TF-MossFormer 的时频局部动态注意力可以更好地保留语音细节,内容感知窗口在谐波边缘和清音过渡处的精细响应,有助于减少分离过程中的频谱损伤。5.9M 的小模型版本可以直接嵌入到我们的机器人前端信号处理模块中,作为轻量级替代方案。相关技术选型可参考机器人语音交互核心技术怎么选?声学算法与参数深度解析声学方案常见问题详解:机器人语音交互选型与优化指南

声学检测业务中,电机异音检测、产线音频质检等场景常面临非平稳故障信号的识别挑战。故障信号在频域上表现为局部异常模式,如某频带的瞬时能量尖峰或谐波结构畸变。内容感知滑动窗口机制天然适合检测这类瞬态事件,其动态感受野可以聚焦于异常频带区域,避免被背景噪声平均化。我们的声纹分析管线可以借鉴 TF-MossFormer 的二维谱图建模思路,在特征提取阶段引入内容感知卷积或注意力机制,提升对微弱故障特征的分辨力。更多声学检测技术细节可参考声学检测在产线质检怎么选?家电与机器人质检方案详解声学信号处理在电机产线质检与机器人应用优势解析

从工程化角度看,TF-MossFormer 的卷积门控模块设计简洁,使用的深度可分离卷积和 GLU 都是成熟算子,在主流推理框架上均有高效实现,移植到嵌入式平台的门槛较低。未来可以在自主采集的中文多说话人语料上微调,验证其在中文语音场景下的迁移能力,并探索与波束形成前端联合优化的方案。

原文链接:https://arxiv.org/abs/2607.21128

作者:Shengkui Zhao; Zexu Pan; Haoxu Wang; Biao Tian; Bin Ma; Xiangang Li

发布日期:2026-07-23T10:02:25Z

收录:Interspeech 2026

需要专业服务?立即联系我们

南京昱声科技

联系电话请访问官网