南京昱声科技

前沿语音技术:利用声音设计构建人声与动物声数据集,推动非人类语音转换研究

Designed Vocalizations Dataset 论文深度解读

1. 论文速览

这篇被 InterSpeech 2026 收录的论文,首次公开了一个专为非人类语音转换(voice conversion)设计的声乐数据集——《Designed Vocalizations Dataset》。它并非简单收集自然语音,而是将多源人声与动物原始发声,经专业音频工程师使用失真、合唱、滤波、调制等效果器处理后,生成一对一的“原始-效果”平行声样。数据集覆盖了怪物咆哮、机器人声、幽灵低语等电影游戏中高频出现的风格化声音,弥补了该领域长期缺乏公开资源的痛点。

论文同时提供了一套标准化测试集,按声源音色组(不同说话人、不同动物)划分为已见(seen)和未见(unseen)子集,并跨预设效果风格(如“机器人”“怪物”“幽灵”等)进行控制。这使研究者能在统一条件下评估模型在未知音色上的风格迁移(style transfer)泛化能力。作者还公布了多个基线模型的客观指标与主观评分,为后续研究设立了可复现的对比基准。数据集和示例均已开源,工程落地参考价值极高。

2. 研究背景与挑战

当前语音转换研究,尤其是依托深度学习的说话人转换(speaker conversion)和风格迁移,几乎全部聚焦于自然人类语音。大量的公开基准(如 VCTK、CMU ARCTIC)都只包含常规朗读或对话,而影视、游戏、有声书等创意产业对设计性声音的需求却在急剧增长。怪物嘶吼、机械合成音、魔法咒语等声音,需要人工反复采样和后期处理,成本高昂且难以动态生成。

核心挑战在于,音效处理引入的声学特征变化远超出典型说话人差异。失真(distortion)会剧烈改变频谱包络(spectral envelope)的谐波结构,移调直接拉伸或压缩基频(F0),深混响则叠加了复杂的房间冲激响应。这些非线性变换让依赖源滤波器模型(source-filter model)的传统语音转换方法近乎失效,模型既要适应陌生发声模式,又要解耦音色与效果,而现有自然语音数据集无法提供此类训练信号。

另一个障碍是评测体系的缺失。不同团队各自设计测试,未见/已见分割不统一,很难公平比较方法。缺乏标准化泛化测试,直接拖慢了该方向从论文到工程落地的进度。

3. 核心方法

数据构建:团队首先收集了多样化的原始声源,包括多名说话人的语音和多类动物(如猫、狗、鸟)的发声。随后,由专业音频工程师使用硬件效果器或软件插件,对每条原始音频逐一施加预设效果链,生成对应的效果变体。效果类型涵盖失真、移调、合唱、镶边、滤波、调制、混响等,最终形成大规模平行数据集,每条样本都有清晰的“干声-湿声”映射。

测试集设计:为了让泛化评估更具说服力,测试集按声源音色组划分已见/未见子集。具体而言,训练时模型可见部分说话人和动物的全部效果风格,但测试集中会出现全新的说话人或动物类别,且这些新声源同样覆盖了所有效果风格。这样,模型在训练阶段已见过全部效果类型,考验的是在未知音色上执行风格迁移的能力,避免了因效果风格陌生导致的混淆。

基线实验:作者选用了两类代表性语音转换模型——基于 GAN 的架构和自编码器(autoencoder)架构——进行训练和评估。客观评测方面,计算了梅尔倒谱失真(MCD,Mel-cepstral distortion)和基频相关系数等指标,衡量转换后语音频谱与目标的接近程度;主观评测则采用平均意见分(MOS,Mean Opinion Score),由听者对自然度和风格相似度打分。这些多维度指标共同构成了基线基准。

4. 实验与结果

论文展示的基线结果清晰地揭示了泛化瓶颈。在已见音色组上,表现最好的模型能将 MCD 压低至 5.23 dB,MOS 达到 3.5 分,表明在训练见过的声源内部,风格转换质量尚可。然而,一旦切换到未见音色组,MCD 骤升至 6.78 dB,MOS 跌至 2.4 分,性能下降幅度超过 1.5 dB 和 1.1 分,说明现有模型在陌生音色上的风格迁移能力严重不足。

不同效果风格的难度差异也十分显著。混响、调制类效果(如合唱、镶边)相对容易转换,因为这类效果在频谱上主要体现为线性叠加或周期性调制,模型尚能捕捉其规律。而强失真、大幅变调(如将人声变为低沉怪兽声)则导致质量急剧恶化,MCD 可超过 8 dB,MOS 不足 2.0。这暴露了现有模型在极端非线性频谱变换上的局限,尤其是当源滤波器模型的假设被打破时,生成器很难同时重构正确的基频轨迹和频谱包络。

5. 创新点与工程价值

该工作的最大贡献在于首次公开发布了专门面向非人类语音转换的声音设计数据集,覆盖多种声源与效果,并配套提供了标准化的泛化评测方案。这解决了以往研究者只能自建小规模私有数据、无法横向比较的痛点,为整个方向注入了可复现的公共资源。

工程价值直接体现在创意产业。游戏开发者可以输入普通人类语音,实时转换为怪物咆哮或机器人音效,无需预先录制上万条配音线;影视后期能用它快速生成背景角色群体的风格化声音,大幅降低人工采样和逐条处理的成本。数据集提供的基线结果,也为后续模型改进设定了明确的优化目标,例如在未见音色上把 MCD 降至 5.5 dB 以下、MOS 提升至 3.0 以上,推动语音转换从实验室走向实际生产线。

6. 我们的思考

南京昱声科技在机器人语音交互领域深耕多年,该数据集的出现为我们的产品升级提供了直接动力。我们可以借助其多风格声样,训练一个轻量化语音转换模型,部署在机器人本地端侧,让同一台机器人根据场景随时切换角色声线——陪护时用温柔卡通音,告警时用严肃合成音。这能极大提升交互的趣味性和沉浸感,尤其适用于儿童陪伴和智能客服场景。我们此前在机器人语音交互核心技术怎么选?声学算法与参数深度解析一文中详细讨论过声学算法选型,本次数据集恰好填补了风格化语音的数据缺口。

在声学检测和降噪业务中,该数据集的构建思路同样值得借鉴。我们可以参考其音效处理流水线,人工合成大量带效果噪声的语音——例如叠加失真、混响、调制等声学干扰——来扩充降噪模型的训练集。这能让模型在训练阶段就见过更多非标准畸变,增强对异常声、强混响等干扰的鲁棒性。比如,在产线音频质检中,设备异常音往往伴随非线性畸变,借鉴该数据集的变体生成方式,可以低成本得到大量故障样本,提升检测精度。相关方案已在声学检测在产线质检怎么选?家电与机器人质检方案详解中有过探讨。

此外,该数据集的多源动物声与音效变体,还能直接用于声音事件检测模型的训练,拓展昱声在工业声学监测中识别异常声音的能力。例如,将动物嘶吼视为一种“异常事件”,其频谱特征与机器故障声有相似的高频冲击和瞬态成分,通过迁移学习可强化模型对突发性异响的敏感度,为智能工厂的预测性维护提供新的声学线索。

原文链接:https://arxiv.org/abs/2607.20951

作者:Seolhee Lee; Minsu Kang; Yangsun Lee; Woosun Min; Choonghyeon Lee; Namhyun Cho

发布日期:2026-07-23T06:04:10Z

收录:InterSpeech 2026

相关问题解答

这个数据集包含哪些语言和动物声音?
数据集主要收录英语语音和多种动物(如猫、狗、鸟等)的发声,经过专业音效处理后生成对应效果版本,不限定语言,但以英语语音为主。

需要专业服务?立即联系我们

南京昱声科技

联系电话请访问官网