论文速览
多通道语音增强(Multi-channel Speech Enhancement)长期面临一个根本性矛盾:性能越强的模型,对麦克风阵列几何的绑定越紧密。本文提出的几何感知动态卷积(Geo-DConv)框架,用精巧的坐标编码机制打破了这一僵局。核心思路直截了当——将每个麦克风的三维坐标通过MLP映射为高维嵌入,再用这些嵌入动态生成卷积核,使原本“空间盲”的固定卷积运算获得显式的几何感知能力。
实验在RealMAN真实录制数据集上展开,覆盖线性、环形、随机、矩形四种阵列拓扑。FaSNet和TDANet两款主流固定阵列模型接入Geo-DConv后,性能一致提升:FaSNet的PESQ平均提高0.18,SDR提升1.1 dB,STOI改善0.012;TDANet也获得类似增益。该工作已被Interspeech 2026收录,为多通道语音增强的实际部署提供了从“一模型一阵列”到“一模型多阵列”的迁移路径。
研究背景与挑战
单通道语音增强在噪声抑制上已取得长足进步,但面对复杂声学场景时,空间信息缺失成为瓶颈。多通道系统通过波束成形(Beamforming)和空间滤波(Spatial Filtering)利用麦克风间相位差,能显著提升分离效果。然而,传统多通道模型在设计阶段就与特定阵列几何深度耦合——卷积核尺寸、通道排列顺序、甚至网络结构本身都隐含了对麦克风数量与空间布局的假设。一旦更换设备,模型需要重新训练,工程成本陡增。
近期出现的阵列无关(Array-agnostic)方法试图解决这一问题,通过置换不变性设计处理麦克风数量和排列顺序的可变性。但这类方法忽略了一个关键事实:麦克风坐标本身就是空间滤波的最强先验。丢掉坐标,等于蒙上眼睛做波束成形。工程需求很明确——需要一种既保留几何先验,又能自适应不同阵列拓扑的方法,打通从研发到手机、智能音箱、机器人等多设备部署的壁垒。关于麦克风阵列选型与优化的更多细节,可参考麦克风阵列方案详解:原理算法对比及实测调优经验。
核心方法
Geo-DConv框架的设计遵循“即插即用”原则,不修改原有网络结构,仅在卷积运算处引入几何感知机制。其核心组件是坐标编码器(Coordinate Encoder)——一个轻量级MLP,接受每个麦克风的三维坐标(x, y, z),输出高维几何嵌入向量。该嵌入向量随后被送入动态卷积核生成模块,为阵列中每一对麦克风生成专属的卷积权重。
与传统固定卷积核不同,Geo-DConv的卷积核在每次前向传播时根据实际坐标动态计算。这意味着同一个模型,面对线性阵列时自动生成适合线阵的空间滤波模式,面对环形阵列时则切换到相应的环阵模式。该机制无缝嵌入FaSNet和TDANet的原有卷积层,无需重新设计网络架构。训练策略采用混合多种阵列几何的数据,迫使模型学会从坐标中提取空间关系,而非记忆特定拓扑。测试时,只需提供目标设备的麦克风坐标,模型即可泛化——这是阵列不变(Array-invariant)能力的关键所在。
从信号处理角度看,这一设计等价于让神经网络学习一个以麦克风几何为条件的波束成形器。坐标信息被显式编码,使得空间滤波不再依赖隐式的通道排列假设,而是直接利用物理空间关系建模。与语音降噪方案的技术趋势与AI多模态应用全解析中讨论的传统降噪方法相比,Geo-DConv在空间维度上引入了一种更灵活的适配机制。
实验与结果
实验在RealMAN数据集上进行,这是近年来发布的真实录制多通道语音数据集,包含四种阵列拓扑:线性阵列(Linear)、环形阵列(Circular)、随机阵列(Random)和矩形阵列(Rectangular)。评估指标覆盖感知质量(PESQ)、可懂度(STOI)和信号失真比(SDR)。
当FaSNet应用Geo-DConv后,与固定阵列训练基线相比,各拓扑下性能提升显著。下表汇总了主要实验结果:
| 阵列拓扑 | PESQ提升 | STOI提升 | SDR提升(dB) |
|---|---|---|---|
| 线性阵列 | 0.17 | 0.011 | 1.0 |
| 环形阵列 | 0.19 | 0.013 | 1.2 |
| 随机阵列 | 0.18 | 0.012 | 1.1 |
| 矩形阵列 | 0.17 | 0.011 | 1.0 |
TDANet应用Geo-DConv后同样获得稳定提升,验证了方法的通用性和对主流模型的兼容性。值得注意的是,Geo-DConv在环形阵列和随机阵列上的提升略高于线性阵列和矩形阵列,这可能是因为非规则几何带来更大的空间多样性,坐标信息在此类场景下更具区分度。这一结果也印证了显式几何感知对空间滤波的增益并非均等,而是与阵列拓扑本身的结构复杂度相关。
创新点与工程价值
Geo-DConv的核心创新在于首次将麦克风坐标作为显式条件引入动态卷积,实现真正的阵列不变语音增强。与现有阵列无关方法处理排列不变性不同,Geo-DConv直接操作物理空间坐标,保留了完整的空间滤波能力。这一差异在原理上决定了其性能上限更高——坐标信息是空间滤波的充分统计量,而排列顺序只是坐标的粗糙投影。
工程价值同样突出。Geo-DConv是即插即用框架,无需改变原有网络结构,这意味着企业已有的固定阵列模型可以快速升级为阵列不变版本,保护前期研发投入。更关键的是,泛化部署(Generalized Deployment)成本大幅降低:同一模型可部署到手机、智能音箱、机器人等不同设备,只需在推理时传入目标设备的麦克风坐标。对于拥有多产品线的硬件厂商,这消除了为每款设备单独训练和维护模型的负担。结合机器人语音交互核心技术怎么选?声学算法与参数深度解析中提到的工程挑战,Geo-DConv提供了一种更经济的多设备适配方案。
我们的思考
南京昱声科技在机器人语音交互和声学检测领域积累了大量实战经验,Geo-DConv的思路与我们的工程痛点高度契合。在机器人语音交互场景中,不同型号的机器人往往搭载不同阵列几何的麦克风——有的采用线性阵列,有的采用环形阵列,甚至同一型号在硬件迭代中也会调整麦克风位置。Geo-DConv的阵列不变特性可以让一个模型适配所有机器人,大幅减少重复开发。尤其对移动机器人,机械结构限制导致麦克风布局常需妥协,利用坐标信息可动态调整空间滤波,保持拾音质量。
在声学检测场景中,工业异响检测的麦克风阵列几何常因产线布局、设备形态而变化,传统固定阵列模型难以泛化。Geo-DConv的几何感知动态卷积可让模型在阵列几何变化时保持检测精度,这在声学检测在产线质检怎么选?家电与机器人质检方案详解中讨论的多变产线环境下尤为实用。结合昱声已有的降噪算法,Geo-DConv可提供更灵活的空间滤波层,尤其适合移动机器人中阵列位置动态变化的场景。下一步计划在真实机器人平台上部署验证,评估在远场、多噪声源、混响等复杂条件下的实际增益。
原文链接:https://arxiv.org/abs/2607.18658
作者:Zhenglong Liu; Wangyou Zhang; Chenda Li; Yanmin Qian
发布日期:2026-07-21T03:02:57Z
收录:Interspeech 2026
相关问题解答
- Geo-DConv如何利用麦克风坐标实现阵列不变?
- 坐标编码器将3D坐标映射为高维嵌入,再生成动态卷积核,替代固定卷积核,使网络能根据麦克风位置自适应调整空间滤波,训练时混合多种阵列数据,模型学会泛化到新阵列。
- 该方法测试时需要知道阵列的具体拓扑结构吗?
- 只需提供每个麦克风的3D坐标,无需提前知道拓扑类型,模型即可根据坐标生成合适的卷积核,实现推理。