📌 论文速览
DNSMOS-C 是一款端到端语音质量评估(Speech Quality Assessment)模型,聚焦利用 MOS(Mean Opinion Score,主观均分)指导的对比学习提升质量预测能力。论文提出以 MOS 为距离度量,将三元组对比损失(Triplet-based Contrastive Loss)直接施加在模型的声学特征嵌入(Acoustic Embedding)空间。这种方式不仅优化了嵌入空间的语音感知质量排序,还保留了 DNSMOS Pro 的高效、简洁架构。
实验结果显示,DNSMOS-C 在多个主流测试集上均超过 DNSMOS Pro:如皮尔逊相关系数(PCC)由 0.89 提升到 0.93,斯皮尔曼相关系数(Spearman’s ρ)由 0.87 升至 0.91。尤其在跨域泛化测试中,DNSMOS-C 展现出更强的稳定性与适应性,能为实际语音降噪、声学检测等任务提供更稳健的质量反馈和排序结果。
该模型无需大规模自监督学习(Self-supervised Learning, SSL)编码器和多阶段训练,实现 端到端 MOS 回归(MOS Regression)与声学表征学习的统一训练。这使得 DNSMOS-C 适合于高并发、低延迟等对实时性和计算资源敏感的工业场景。
值得注意的是,DNSMOS-C 不仅提升了评估精度,还增强了模型解释性(Interpretability),为后续语音增强、降噪、机器人语音交互等领域的质量监控与算法反馈提供了开放、可扩展的基础。
🔬 研究背景与挑战
语音质量评估(Speech Quality Assessment, SQA)是语音增强与通信系统核心环节。传统的评估方式通常依赖专业听音员对每条语音样本进行 MOS 打分,效率低下且主观波动大。为摆脱人工评估的限制,自动化模型成为主流趋势。
目前主流自动语音质量评估工具分为两类:一类借助大规模自监督学习(SSL)编码器提取语音特征,如 Wav2Vec2.0 或 HuBERT,然后再训练回归头导出 MOS 预测;另一类如 DNSMOS Pro,则直接采用端到端模型结构,输入端到 MOS 回归输出,无需复杂的预训练。
但 SSL 编码器参数量大、训练与推理速度慢,不适合实际部署。即便端到端模型如 DNSMOS Pro,虽然参数量小、响应快,但其嵌入空间缺乏对 MOS 的有序组织,导致模型对质量排序的敏感性和稳健性不足,泛化能力也有限。尤其在面对新域或极端噪声下,预测结果波动较大,难以支撑高可靠的在线语音降噪、机器人语音交互等实时场景需求。
此外,传统模型嵌入空间为高维度向量,缺乏明确的感知质量解释,使得调试和缺陷分析效率低下。随着语音降噪与声学检测工程需求对模型解释性的要求提升,业界亟需一种泛化能力强、轻量高效且具备有序嵌入的 SQA 方案。相关应用详见 语音降噪方案的技术趋势与AI多模态应用全解析。
💡 核心方法
三元组对比损失与 MOS 指导
DNSMOS-C 的创新点在于将 MOS(主观均分)直接作为嵌入空间的距离度量,通过三元组损失(Triplet Loss)优化声学特征嵌入。具体做法是,从训练集中抽取三元组:锚点(Anchor,MOSa)、正样本(Positive,MOSp,相近质量)、负样本(Negative,MOSn,质量差异大),通过损失函数将锚点与正样本拉近,锚点与负样本拉远。
对比于传统的欧氏距离或类别标签,这种 MOS 指导的对比学习直接反映人的感知排序,使得模型嵌入空间自动形成高质量、中质量、低质量的自然分布。三元组损失公式如下:
- Ltriplet = max(0, d(a, p) - d(a, n) + margin),其中 d 表示嵌入向量距离,margin 为安全边界。
轻量化端到端结构
与依赖 SSL 编码器的方案不同,DNSMOS-C 的三元组损失直接作用于声学网络的中间嵌入层,无需引入庞大的预训练模型。模型结构包括声学编码层(如堆叠卷积或轻量 RNN)、全连接层及 MOS 回归头,所有参数可端到端联合训练(Joint Training),避免多阶段训练和特征迁移的复杂流程。
这一设计兼顾了模型高效(推理延迟低)、参数量小(便于嵌入端部署)与训练稳定性。目标损失函数为 MOS 回归损失与三元组对比损失的加权和,实现语音表征学习与 MOS 预测的协同优化。
模型训练过程中,嵌入空间逐步呈现出明显的质量分层,这种自然排序结构不仅提升了 MOS 预测的准确性,也极大增强了模型解释性。相关端到端声学系统的部署经验,可参考 声学信号处理在电机产线质检与机器人应用优势解析。
📊 实验与结果
主观与客观评测提升
DNSMOS-C 在公开 DNS Challenge(2020、2021)和 VCTK 数据集上进行了充分实验。最关键的皮尔逊相关系数(PCC)在多种噪声、增益、说话人条件下均优于 DNSMOS Pro:PCC 由 0.89 提升到 0.93,Spearman 相关系数(ρ)由 0.87 提升至 0.91。
在主观 MOS 预测误差(MAE)上,DNSMOS-C 也实现了进一步降低。模型不仅在 Seen Domain(已知场景)表现优异,在 Cross-domain(未知场景)泛化测试中,PCC 维持在 0.89,远优于 DNSMOS Pro 的 0.80 左右,Spearman 相关系数同样高达 0.86。
嵌入空间结构与解释性
论文通过 t-SNE 降维显示,DNSMOS-C 的嵌入空间在二维投影下出现了自发的质量分层:高质量语音聚集在一端,低质量语音分布于另一端,形成梯度明显的排序带。这种结构让模型输出具备天然的可解释性,有助于系统工程师分析语音增强或降噪算法的性能瓶颈。
在对比学习的支撑下,模型训练过程中的损失收敛更快,泛化能力显著提升,尤其适用于噪声类型、语者、采集设备多变的复杂场景。相关工程案例可参考 声学检测在产线质检怎么选?家电与机器人质检方案详解。
推理效率与部署可行性
最终模型参数量约 2.3M,远低于基于 SSL 编码器的 SQA 模型(动辄 10M+)。平均单条语音评估延迟 9ms(CPU 环境),可满足实时语音降噪、机器人语音交互等低延迟需求。推理效率和模型轻量化为大规模部署与边缘端场景提供了坚实基础。
🎯 创新点与工程价值
- 引入 MOS 指导的对比学习(Contrastive Learning)。DNSMOS-C 首次将 MOS 作为声学特征嵌入空间的距离标尺,通过三元组损失组织嵌入结构,实现端到端模型对语音质量的有序感知。这一设计极大提升了模型的解释性和训练稳定性。
- 无须多阶段训练与复杂编码器(Self-supervised Learning Encoder)。传统高性能 SQA 方案依赖大体量 SSL 固定编码器,DNSMOS-C 则在轻量结构中直接融合对比损失,实现端到端 MOS 回归和表征自适应,简化了部署和运维流程。
- 提升泛化能力,适合多域低延迟场景。实验证明,DNSMOS-C 在跨域噪声、语者、设备变化下依然保持高相关性和稳定性,极其适合于机器人语音交互、远场拾音、质检产线等对实时反馈和泛化能力有高要求的工程环境。相关讨论可参考 机器人语音交互核心技术怎么选?声学算法与参数深度解析。
- 模型低维可解释嵌入便于算法优化。DNSMOS-C 让开发者可直观分析质量分层,不仅提升了自动语音增益、降噪算法的调优效率,也便于与其他声学检测及反馈机制协同工作。对于声学检测、音频质检等应用场景,相关方案详见 产线音频质检怎么选?麦克风阵列/语音芯片/算法优劣全解析。
- 部署便捷,适配多种硬件平台。模型参数仅 2.3M,推理延迟低,可灵活部署于嵌入式设备、边缘服务器、云端及产线音频质检系统,赋能智能家电、机器人、远场拾音等多元产业落地。
🛠️ 我们的思考
DNSMOS-C 的方法论与南京昱声科技的多条业务线深度契合。首先,在 机器人语音交互场景,质量评估模型可实时反馈每条语音的主观感知得分,驱动 TTS(语音合成)、ASR(识别)、降噪等模块的动态参数调整,提升机器人对话体验。相关技术难点可参考 声学方案常见问题详解:机器人语音交互选型与优化指南。
在 声学检测与 降噪业务中,DNSMOS-C 可直接集成到声学质检流水线,实现对语音清晰度、残留噪声的自动分级,为算法调优和产品出厂检测提供客观依据。其低延迟和强泛化能力能够适应家电、机器人、远场拾音等多域复杂噪声环境,大幅提升产线音频质检的自动化水平。相关场景可参考 电机异音检测技术趋势:AI大模型与端侧部署的创新应用。
对于 远场拾音和 产线音频质检,DNSMOS-C 提供的有序质量嵌入支持多维特征协同分析,可实现异常音频自动预警、语音降噪算法性能回溯等功能,极大提升质检效率与产品一致性。其端到端结构便于与现有声学算法(如回声消除、麦克风阵列处理等)无缝集成,相关算法详见 回声消除算法常见问题全解:参数、应用场景及选型建议 与 麦克风阵列方案详解:原理算法对比及实测调优经验。
结合 DNSMOS-C 的低维嵌入解释性与端到端高效训练,南京昱声科技有望进一步优化语音前端处理、增强模块调优和智能质检反馈,在语音降噪、机器人语音交互及产线音频质检领域持续提升系统稳定性和用户体验。
📄 原文链接:https://arxiv.org/abs/2606.26903
作者:Xinyu Liang; Fredrik Cumlin; Victor Ungureanu; Chandan K. A. Reddy; Christian Schuldt; Saikat Chatterjee
发布日期:2026-06-25T11:35:12Z
收录:Interspeech 2026
📖 相关问题解答
- DNSMOS-C模型如何避免依赖大型自监督编码器?
- 通过MOS引导的三元组对比损失直接作用于中间嵌入,联合学习表征与回归,简化结构。