南京昱声科技

前沿语音技术:零样本跨语种情感识别的情感判别表示学习新方法

📌 论文速览

本论文《Learning Emotion-discriminative Representations for Zero-Shot Cross-lingual Speech Emotion Recognition》首次将监督对比学习(Supervised Contrastive Learning)与说话人对抗学习(Speaker Adversarial Learning)相结合,系统性解决了零样本学习(Zero-shot Learning)条件下的跨语种(Cross-lingual)语音情感识别(Speech Emotion Recognition,SER)泛化性差难题。论文重点针对语种分布不匹配(Distribution Mismatch)与说话人属性干扰,提出了情感判别声学表示(Emotion-discriminative Acoustic Representation)学习框架,增强模型的情感对齐(Emotion Alignment)能力与说话人无关表示(Speaker-invariant Representation)能力。

在IEMOCAP(英语)训练、EMODB(德语)测试的典型零样本场景下,传统交叉熵训练SER模型的UAR(Unweighted Average Recall)仅为42.9%。新方法将UAR提升至48.7%,绝对提升5.8%,显著优于当前主流做法。该框架无需目标语言情感标注,降低了数据迁移与系统部署成本,为机器人语音交互、声学检测等多语种低资源场景提供了技术突破。相关业务应用详见机器人语音交互核心技术怎么选?声学算法与参数深度解析

🔬 研究背景与挑战

在多语种及低资源语音场景下,情感识别(Emotion Recognition)任务面临巨大挑战。不同语言之间音素结构、情感表达方式差异明显,导致声学分布不匹配(Distribution Mismatch)。目标语言缺乏情感标注数据,模型只能在源语言上训练,迁移到新语言时性能大幅下降。现有方法在零样本跨语种学习(Zero-shot Cross-lingual Learning)下,往往无法有效对齐源语言与目标语言的情感特征。

传统SER模型受限于情感标签不一致、说话人属性和语言因素干扰,深度学习(Deep Learning)模型在泛化能力上表现不佳。情感嵌入(Emotion Embedding)容易混入说话人特征,造成情感判别混淆,尤其在远场拾音、声学检测和机器人语音交互场景下,极易出现性能波动。为解决此类问题,亟需构建具有跨语种情感对齐、说话人无关表示能力的声学表示学习框架。

此外,低资源语种普遍缺乏情感标签,人工标注成本高,限制了新语种SER系统的快速部署。在产线音频质检、国际化机器人语音交互等场景,如何实现无标注目标语种的高效情感识别,成为产业界与学术界共同关注的问题。更多产线场景可参考产线音频质检怎么选?麦克风阵列/语音芯片/算法优劣全解析

💡 核心方法

论文提出了基于情感判别表示(Emotion-discriminative Representation)的深度学习框架,融合监督对比学习(Supervised Contrastive Learning)与说话人对抗学习(Speaker Adversarial Learning),解决跨语种情感识别中的分布不匹配与说话人干扰问题。整体结构如下表所示:

模块 功能 技术细节
监督对比学习 情感对齐 同类情感样本嵌入拉近,异类拉远
说话人对抗学习 说话人无关表示 梯度反转层抑制说话人信息
判别头 情感分类 交叉熵损失,输出情感概率

监督对比学习通过将同类情感样本的声学嵌入(Acoustic Embedding)在高维空间内拉近,异类样本拉远,实现跨语种情感特征的对齐。其损失函数引导模型学习到与情感强相关、与语种弱相关的声学表示,有效缓解分布不匹配问题。该思想源于对比学习在图像、语音领域的表征优化技术,首次应用于跨语种情感识别。

说话人对抗学习采用梯度反转层(Gradient Reversal Layer,GRL),在训练过程中对抗说话人判别任务,使主模型学习到说话人无关的情感特征。具体做法为:在嵌入层后插入GRL,使说话人判别损失与情感分类损失对抗,最大限度抑制说话人属性。此机制显著提升了模型在目标语种未知说话人上的泛化能力,适用于机器人语音交互、麦克风阵列等多说话人场景。

两种机制耦合后,模型既能实现跨语种情感对齐,又能消除说话人干扰,获得高判别性、高鲁棒性的情感声学表示。该框架无需目标语种情感标注,极大降低了跨语种迁移与系统部署难度。

📊 实验与结果

论文在典型零样本跨语种场景——IEMOCAP(英语)训练,EMODB(德语)测试——进行系统实验。实验流程详见下表:

训练语料 测试语料 评价指标 方法 UAR (%)
IEMOCAP(英语) EMODB(德语) Unweighted Average Recall 交叉熵训练 42.9
IEMOCAP(英语) EMODB(德语) Unweighted Average Recall 对比学习 44.3
IEMOCAP(英语) EMODB(德语) Unweighted Average Recall 说话人对抗学习 45.1
IEMOCAP(英语) EMODB(德语) Unweighted Average Recall 对比+说话人对抗(本论文方法) 48.7

结果表明,单独使用对比学习或说话人对抗机制,UAR提升有限,分别为44.3%与45.1%。两者结合后,UAR提升至48.7%,绝对提升5.8%,相对提升13.5%。说明两种机制具备互补性,协同优化了情感对齐与说话人无关表示能力。该性能已接近跨语种情感识别领域的最新水平。

此外,实验还验证了方法的鲁棒性:在不同说话人、不同语种、不同情感类别下,模型均表现稳定。该方法适用于大规模多语种、远场拾音、复杂环境下的情感识别,有助于智能语音机器人、声学信号处理等场景的应用落地。

针对低资源语种和未标注目标语种,框架无需额外情感标签,仅凭源语种数据即可实现高效情感迁移,极大降低了数据标注与系统升级成本。为机器人语音交互选型与优化、国际化产品部署提供了新技术路径。

🎯 创新点与工程价值

本论文创新性地将监督对比学习说话人对抗学习机制系统性结合,首次针对跨语种情感识别中的说话人、语言干扰问题提出解决方案。主要创新点如下:

  • 提出跨语种情感判别声学表示学习框架,实现情感对齐与说话人无关表示的协同优化。
  • 首次将监督对比学习引入语音情感嵌入,提升跨语种情感特征对齐能力,解决分布不匹配问题。
  • 采用梯度反转层对抗说话人判别,增强模型在新语种、新说话人上的泛化能力,适用于多说话人、远场拾音场景。
  • 方法无需目标语种情感标注,极大降低数据迁移、系统部署成本,适用于多语种、低资源语音交互系统。

该方法为智能语音机器人、远场拾音、产线音频质检等多语种复杂场景提供了技术突破。工程价值体现在:1)加速国际化语音产品部署,2)降低情感识别系统数据标注与迁移成本,3)提升多语言交互系统的情感识别鲁棒性。相关技术趋势可参考语音降噪方案的技术趋势与AI多模态应用全解析

🛠️ 我们的思考

南京昱声科技在机器人语音交互、声学检测、降噪、远场拾音、产线音频质检等业务场景,对跨语种、低资源情感识别能力有迫切需求。该论文方法为以下关键场景提供技术借鉴:

未来可探索该框架与自监督学习、端到端声学建模的深度结合,进一步提升跨语种、跨场景的情感识别能力。例如:将相关对比学习思想应用于声学信号处理、麦克风阵列阵列检测等领域,增强多模态感知能力。框架的说话人无关表征机制也可作为多任务学习、声学特征分离的基础模块,提升整体系统的鲁棒性和可迁移性。针对低资源场景,配合自监督预训练,可实现高效的数据利用与性能突破。

综上,论文提出的创新技术为南京昱声科技在机器人语音交互、产线音频质检、远场拾音等业务场景提供了可落地、可迁移的解决方案,极大推动了智能语音系统的国际化与多语种应用边界。

📄 原文链接:https://arxiv.org/abs/2606.06200

作者:Jinyi Mi; Ding Ma; Tomoki Toda

发布日期:2026-06-04T14:05:38Z

收录:Interspeech 2026

📖 相关问题解答

该论文方法在多语种实际应用中会遇到哪些挑战?
关注模型部署时对于说话人、情感类别多样性和实际语音质量的适应性,以及对真实场景下未见语言泛化能力的评估。

需要专业服务?立即联系我们

南京昱声科技

联系电话请访问官网