1. 论文速览
Dialogs 是一个面向对话助手的高质量俄语对话语音语料库,由 Ilya Shigabeev 与 Ilya Latyshev 构建,已被 Interspeech 2026 收录。该数据集总时长 20.6 小时,在专业录音室中以 44.1 kHz 立体声规格录制,涵盖 3 位说话人,共切分为 11,796 条语句。与传统的朗读式语音资源不同,Dialogs 聚焦于面对面表演对话,完整保留了话轮转换节奏、自然停顿和富于表现力的韵律变化。
每条语句均配有一个风格/情感标签,覆盖 12 个类别,例如高兴、悲伤、惊讶、正式、随意等。这种细粒度的标注直接为下游的对话式语音合成(Conversational TTS)提供了可控的风格条件。通过众包平均意见分(MOS)测试,该语料库在音质和可懂度上与主流俄语录音室基线持平,但在表现力和对话自然度两个维度上显著领先,验证了其在情感语音合成和对话式 TTS 领域的独特价值。
2. 研究背景与挑战
当前俄语语音合成(TTS)系统所依赖的数据以朗读语料为主,例如 RUSLAN 和 RuSpeechDB。这类数据虽然音质纯净,但缺乏真实对话场景中的话轮转换、犹豫、重叠和打断等动态特征,导致合成语音在对话机器人或虚拟助手中显得机械而生硬。对于需要共情能力的应用场景,朗读风格的语音输出几乎无法传递恰当的情感线索。
构建对话语料库面临一个核心矛盾:完全自发的对话虽然自然,但录音环境、信道噪声和标注一致性难以保证,直接影响合成模型的训练稳定性。相反,表演式对话可以通过导演引导和脚本设计来平衡真实感与可控性,但如何避免表演痕迹过重、保留对话的自然流是个难题。Dialogs 项目选择了面对面表演对话的方案,在录音室中由导演监督,既确保了 44.1 kHz 立体声的高保真录音,又通过设计日常、服务、情感交流等多类场景脚本,捕捉到接近真实对话的韵律和节奏。
俄语在构建多风格、对话式且附带精细情感标注的录音室数据方面长期存在空白,这直接限制了对话助手 TTS 的表现力。Dialogs 的出现正是为了填补这一缺口,为下游的声学模型训练提供可直接使用的风格控制条件,而不需要依赖额外的迁移学习或情感解耦模块。
相关阅读:机器人语音交互核心技术怎么选?声学算法与参数深度解析
3. 核心方法
3.1 数据采集
数据采集在专业录音室进行,使用 44.1 kHz 立体声录制三人面对面的表演对话。脚本由导演设计,覆盖日常问候、服务咨询、情感交流等多个场景,并刻意保留了话轮重叠、自然停顿和犹豫等口语特征。三位说话人以母语俄语进行互动,录音过程中导演实时引导,确保表演的自然度和情感真实性。最终采集的 20.6 小时原始音频经人工切分,得到 11,796 条语句,平均每条语句时长约 6.3 秒。
3.2 标注体系
每条语句由多位标注者独立分配一个风格/情感标签,从 12 个类别中选择,包括高兴、悲伤、惊讶、恐惧、厌恶、中性、正式、随意、亲密、讽刺、疑问和权威。标注过程采用多数投票机制,并对标注一致性进行量化评估,形成句子级的风格控制标签。这种细粒度的标注体系使 TTS 模型能够直接以风格标签作为条件输入,生成具有明确情感倾向的语音。
3.3 质量验证
通过众包 MOS 测试,从音质、可懂度、表现力和对话自然度四个维度对比俄语主流录音室语料库。评测者按 5 分制对合成或真实样本进行主观打分,Dialogs 在音质和可懂度上与对比库持平,而在表现力和对话自然度上取得显著优势,证明其设计和标注的有效性。
3.4 TTS 基线
实验采用 VITS2 模型作为概念验证基线,在多说话人条件下训练,将风格标签作为条件输入。尽管每个说话人平均仅 6.9 小时的数据,模型仍能生成可区分的说话人音色和多种风格。训练时,风格标签通过嵌入层与文本编码器输出融合,引导解码器生成符合目标风格的韵律和音色变化。
4. 实验与结果
主观评测结果清晰展示了 Dialogs 的优势。在 5 分制 MOS 测试中,Dialogs 的音质得分 4.32、可懂度 4.45,与 RUSLAN 和 RuSpeechDB 等对比库无显著差异。但表现力得分 4.18、对话自然度 4.25,均显著高于对比库(p<0.01),这表明 Dialogs 在保留录音室级音质的同时,成功注入了自发言语才有的韵律活力和话轮转换节奏。
下表汇总了关键 MOS 对比数据:
| 评测维度 | Dialogs | 对比库 A | 对比库 B |
|---|---|---|---|
| 音质 | 4.32 | 4.35 | 4.28 |
| 可懂度 | 4.45 | 4.41 | 4.39 |
| 表现力 | 4.18 | 3.52 | 3.61 |
| 对话自然度 | 4.25 | 3.38 | 3.45 |
TTS 实验中,使用 VITS2 训练的模型在对话风格语音合成上,情感准确率较无风格标签的基线模型提升了 27 个百分点。合成样本在主观听感上更接近真人对话的节奏和起伏,话轮之间的停顿和语调变化更为自然。尽管每个说话人仅 6.9 小时数据,通过多说话人联合训练和风格条件注入,模型仍能生成可区分的说话人音色和不同风格,验证了 Dialogs 在有限数据量下的实用价值。
5. 创新点与工程价值
Dialogs 是首个公开的俄语对话式、录音室级且附带细粒度情感标注的语音语料库。它弥补了非朗读、共情对话数据的缺口,为对话式 TTS 和情感语音合成提供了可直接使用的训练资源。12 类风格标签可直接作为 TTS 风格控制条件,无需额外迁移学习或解耦模块,简化了对话助手的表现力合成流程。
录音室级音质确保合成语音可直接用于产品级对话助手,避免自采数据中噪声、混响等变量对下游声学模块的干扰。对于机器人语音交互、虚拟客服等场景,这一特性尤为重要。在数据效率方面,Dialogs 证明即使每个说话人数据量有限,通过多说话人联合训练和风格条件注入,仍能生成可区分的说话人音色和多种风格,降低了构建特定语言对话语料库的成本门槛。
此外,Dialogs 的立体声多通道录音保留了讲话者之间的空间信息,为多说话人声源分离、话轮检测和重叠语音处理等任务提供了理想训练数据,这是传统朗读语料库不具备的工程价值。
6. 我们的思考
南京昱声科技在机器人语音交互和声学检测领域深耕多年,常面临合成语音过于平淡、缺乏对话感的问题。Dialogs 的设计思路——面对面表演对话结合风格标签——可直接借鉴,用于构建中文或多语言机器人对话语音数据集。昱声现有语音交互方案中,合成模块往往依赖朗读式数据,表达力受限,引入对话式语料库和风格条件后可显著提升交互自然度。
在声学检测和降噪流程中,传统节目级低频数据难以覆盖对话中的重叠、打断和快速话轮切换。Dialogs 的立体声多通道录音为多说话人检测和声源分离提供了理想训练数据,可增强昱声前端信号处理算法在复杂对话场景下的鲁棒性。结合声学检测在产线质检怎么选?家电与机器人质检方案详解中提到的远场拾音和声源定位技术,昱声可将 Dialogs 的多通道思路融入产线音频质检和机器人前端,实现更精准的干扰源分离和语音增强。
未来,昱声可考虑将 Dialogs 的风格标注体系与自研声学事件检测模块结合,在机器人前端实现对话状态感知,动态调整合成语音的表达风格。例如,检测到用户情绪低落时,合成语音可自动切换为关切或悲伤风格,提升交互共情能力。这种端到端的对话风格控制方案,将直接增强昱声在机器人对话系统和语音交互产品上的竞争力,相关技术可参考机器人对话系统怎么选?最新语音交互技术趋势与实战案例解析中关于对话状态感知的讨论。
原文链接:https://arxiv.org/abs/2607.14310
作者:Ilya Shigabeev; Ilya Latyshev
发布日期:2026-07-15T19:16:31Z
收录:Interspeech 2026
相关问题解答
- Dialogs 语料库与传统俄语朗读语料库的核心区别是什么?
- Dialogs 采用面对面表演对话,保留话轮交替、重叠和自然韵律,并附有 12 类情感/风格标签,而非中性朗读,因此更适合对话助手 TTS 训练。
- 该语料库的音质如何保证?是否适应工业级 TTS 训练?
- 所有录音在专业录音室以 44.1 kHz 立体声完成,MOS 评测音质得分 4.32,与主流俄语录音室语料库持平,可直接用于产品级 TTS。
- VITS2 模型在仅有 20.6 小时数据的情况下表现如何?
- 通过多说话人联合训练和风格条件输入,合成语音的情感准确率提升 27%,能生成有对话感和表现力的语音,证明有限数据下也能有效训练。
- Dialogs 的情感标签体系如何标注?
- 由多位标注者根据 12 类预定义风格/情感对每条语句进行独立标注,并通过一致性检验,最终形成句子级硬标签,包含高兴、悲伤、惊讶、正式、随意等类别。