南京昱声科技

前沿语音技术:基于模块化网络扩展的嵌入式关键词识别可扩展方法

1. 论文速览

这篇入选Interspeech 2026的论文提出了一种参数受限的模块化扩展方法,解决了嵌入式设备上关键词识别(Keyword Spotting, KWS)模型部署后无法安全添加新关键词的工程难题。核心思路是:基础网络完全冻结,包括所有卷积层、批量归一化(Batch Normalization)统计量和核心分类器,只训练一个轻量级扩展分支和独立的新关键词分类头。

在固定操作点、参数预算不超过10k的条件下,该方法将新关键词的平均误拒率(False Reject Rate, FRR)从参数匹配的单独模型基线的6.46降至4.37,相对改善约2.09个百分点。同时,MACs(乘累加运算次数)从18.45M和20.52M降至16.34M,计算效率显著优于adapters和LoRA等参数高效微调基线。

这种方法的关键优势在于:旧关键词的logits输出、softmax概率和判断阈值完全保持原样,彻底消除了增量学习(Incremental Learning)中常见的灾难性遗忘(Catastrophic Forgetting)问题。整个扩展过程只需新关键词的训练数据,无需原始训练集。

2. 研究背景与挑战

嵌入式语音交互设备(如智能音箱、车载语音助手、机器人语音交互终端)在部署后面临一个现实问题:需要不断增加新的唤醒词或命令词。传统的解决思路是重新收集完整的训练数据、重新训练整个模型并OTA推送更新,但这面临三重障碍:原始训练数据通常因隐私或存储成本无法长期保留;重新训练周期长、计算成本高;最关键的是,任何对基础模型的修改都可能导致已部署旧关键词的性能退化。

直接微调(Fine-tuning)即使只训练少量epoch,也会因批量归一化统计量的漂移和特征表示的偏移,造成旧关键词的误拒率上升和误接受率失控。对于已通过严格认证的产品,这种回归(Regression)风险不可接受——召回和重新认证的成本往往远超模型训练本身。

现有的参数高效微调(Parameter-Efficient Tuning)方案,如适配器微调(Adapter Tuning)和低秩分解(Low-Rank Adaptation, LoRA),虽然参数增量小,但仍会修改基础网络的前向传播路径。Adapter在层间插入可训练模块,LoRA通过低秩矩阵更新权重,两者都会改变基础网络对旧关键词的中间表示,进而干扰已校准的输出阈值。此外,这些方法引入的额外计算量对资源受限设备(Resource-Constrained Devices)的实时推理并不友好。

3. 核心方法

该研究的核心设计遵循一个原则:基础网络的所有状态和行为必须保持位级不变。具体实现包括三个层面的冻结:

第一,结构参数冻结。所有卷积层权重、偏置项不参与梯度更新,前向传播路径完全保留。这意味着即使扩展分支被训练,基础网络对旧关键词的中间特征图(Feature Map)输出与训练前完全一致。

第二,批量归一化统计量冻结。这是该工作区别于以往方案的关键点。BN层的运行均值(Running Mean)和运行方差(Running Variance)在训练扩展分支时固定不变,防止因统计量漂移导致特征分布偏移。许多微调方案忽略这一点,仅冻结权重却允许BN统计量更新,结果仍会造成旧关键词的隐式退化。

第三,核心分类器与输出逻辑冻结。旧关键词的logits、softmax概率和判断阈值原封不动,确保已部署的唤醒逻辑无需重新验证。新增的扩展分支从基础网络某中间层接出,经少量卷积或全连接层处理后,尾接一个独立的新关键词分类头。训练时仅使用新关键词数据,优化扩展分支和分类头,基础网络不参与梯度更新,总新增参数严格控制在10k以内。

这种设计的本质是模型压缩与可扩展性(Scalability)的折中:用极小的参数和计算代价换取旧关键词性能的零退化保证,同时实现新关键词的有效识别。

4. 实验与结果

实验在固定操作点下进行,参数预算统一设定为≤10k,评估指标包括新关键词的FRR、MACs,以及旧关键词的FRR和误接受率(False Accept Rate, FAR)。对比基线包括:参数匹配的单独模型(Separate Model)、Adapter微调和LoRA微调。

新关键词的FRR表现如下:

方法 新关键词FRR MACs 旧关键词退化
参数匹配单独模型 6.46 16.34M
Adapter微调 6.01 18.45M
LoRA微调 5.89 20.52M
本方法(模块化扩展) 4.37 16.34M 零退化

值得注意的是,单独模型方案虽然旧关键词性能无退化,但新关键词的FRR高达6.46,且需要完整部署两套模型,存储开销翻倍。Adapter和LoRA在降低FRR方面有一定效果,但未能完全消除旧关键词退化,且MACs分别增加了13%和25%。本方法在FRR最低的同时,MACs与单独模型持平,且旧关键词的FRR和FAR保持零退化。这验证了冻结BN统计量和核心分类器对保证增量学习安全性的关键作用。

5. 创新点与工程价值

该研究的创新点集中在三个维度:

第一,BN统计量冻结策略。这是首次在KWS增量学习场景中明确将BN统计量纳入冻结范围,并从实验层面验证了其对旧关键词性能保持的必要性。以往的参数高效微调方案多关注权重更新,忽略了BN统计量漂移对特征分布的隐性影响。

第二,参数受限的扩展分支设计。在≤10k的极严格参数预算下,通过精心设计的轻量分支结构,实现了新关键词FRR低于所有基线的效果。这种设计思路与模型压缩(Model Compression)领域的精神一致:用最少的资源换取最大的性能增益。

第三,彻底的输出逻辑隔离。独立的新关键词分类头与旧关键词logits完全解耦,消除了联合训练或联合校准的需求。这在实际工程中意味着:添加新关键词时无需重新测试、重新认证旧关键词的唤醒性能,直接降低了嵌入式语音交互产品的维护成本和召回风险。

工程价值体现在:已部署的智能设备可通过OTA推送轻量级扩展包(仅含扩展分支权重和新分类头参数),无需更新基础模型,即可安全获得新关键词识别能力。这对需要频繁迭代关键词列表的产品(如可定制唤醒词的智能音箱、多命令词机器人)具有直接的应用价值。

6. 我们的思考

这项研究对南京昱声科技的业务方向有直接的借鉴意义。在机器人语音交互核心技术怎么选?声学算法与参数深度解析一文中,我们曾讨论过已部署语音模组的升级痛点:每次新增命令词都需要重新训练、重新验证,甚至召回设备。模块化扩展方法提供了一种优雅的增量升级方案。

在机器人语音交互场景中,可借鉴此方法为已部署的唤醒/命令词模型增量添加新指令。基础模型冻结后,扩展分支仅需新增命令词的少量录音数据即可训练,完全避免干扰现有功能。对于已通过安全认证的机器人产品,这显著降低了重新认证和召回的成本。结合声学方案常见问题详解:机器人语音交互选型与优化指南中提到的远场拾音和降噪链路,前端处理模块保持不变,仅扩展后端分类分支,可实现快速迭代。

在声学事件检测业务中,该方法同样适用。例如电机异音检测技术趋势:AI大模型与端侧部署的创新应用中提及的产线质检场景,已部署的异常声音检测模型需要扩展新异响类别时,可冻结基础特征提取网络,只训练异常类别扩展分支。前端降噪模块(如语音降噪方案的技术趋势与AI多模态应用全解析中介绍的方案)保持不变,后端分类灵活扩展,实现产线音频质检的快速迭代。

工程化层面,我们可设计标准化的即插即用扩展模块,配合南京昱声科技的嵌入式语音模组,形成可持续升级的产品生态。但需注意扩展分支的架构选择对实时性和内存的影响:在30ms推理延迟的约束下,扩展分支的卷积层数和通道数需精细调优,避免超越设备算力预算。此外,当扩展次数累积增多时,多个扩展分支的管理和调度也需要统一的框架设计。

原文链接:https://arxiv.org/abs/2607.19918

作者:Viktor Khaymonenko; Dzmitry Saladukha; Aliaksei Rak; Alexander Rostov

发布日期:2026-07-22T08:48:13Z

收录:Interspeech 2026

需要专业服务?立即联系我们

南京昱声科技

联系电话请访问官网