1. 论文速览
这篇被 INTERSPEECH 2026 收录的论文,直面一个极其实用却长期受数据瓶颈困扰的问题:如何让语音合成系统(TTS)像人类配音演员一样,根据导演的指令灵活调整演绎方式。作者提出了一套可扩展的伪三元组构造管道,核心思路是绕开昂贵的人工标注,用印象可控 TTS 模型与大型语言模型(LLM)自动生成形如(参考语音, 方向文本, 修改语音) 的训练三元组。
所谓“方向文本”,就是类似“读得快一点,带点悲伤”的自然语言指令。整套管道首先生成多条不同风格的语音,然后计算风格向量间的差异,最后由 LLM 将差异转化为口语化的方向描述。实验表明,仅用这些伪三元组训练,方向跟随 TTS 就实现了稳定的说话人身份保持修改;方向分类准确率达到 76.2%,说话人余弦相似度 0.873。
当把伪三元组与少量真实录音数据结合后,方向对齐准确率进一步攀升至 82.5%,说话人相似度轻微下降至 0.865,仍保持高度可辨识。该方法完全自动化,无需任何人工标注,显著降低了方向跟随 TTS 系统的数据获取门槛,为配音辅助、智能语音交互等场景提供了可工程化的技术路径。音频示例可在官方演示页面收听。
2. 研究背景与挑战
在专业配音行业,导演给出抽象或具体的表演指导,演员据此重新演绎同一段脚本,这是一项高度依赖经验与直觉的工作。方向跟随 TTS 正是要模拟这一过程:系统接收一段参考语音和一条自然语言方向描述,生成一段既保留原说话人身份和文本内容,又体现方向要求的修改语音。这类技术对影视配音、有声书制作、虚拟角色对话等场景意义重大。
然而,目前最大的痛点在于训练数据极度稀缺。一个高质量的方向跟随三元组需要:同一说话人对同一文本的至少两个不同演绎版本,外加精确描述两者差异的自然语言标注。录音成本本就高昂,而让标注员逐条聆听并书写风格变化描述,不仅耗时,还面临主观性强、一致性低的问题。千万级数据标注在经济上不可行,这直接制约了方向跟随 TTS 从实验室走向产业。
此前的一些研究尝试用启发式规则生成少量训练对,但覆盖的风格维度有限,难以泛化。因此,业界迫切需要一种可扩展的自动化数据构造方案,能够低成本、大规模地生成高质量三元组,同时保证风格变化的多样性和方向文本的自然度。本文正是瞄准这一缺口,提出了基于印象差异的伪三元组构建框架。
3. 核心方法
论文提出的伪三元组构造管道分为三个紧密衔接的阶段,每个阶段都充分利用了现有先进模型的能力。
3.1 伪三元组构造
首先,作者使用一个印象可控 TTS 模型(Impression-Controllable TTS),对同一段文本生成多条风格迥异的语音。该模型内部维护一个可解耦的“印象向量”,通过调节该向量的不同维度,可以独立控制语速、音高、情感强度等声学特征。模型针对同一文本生成一个参考语音和多个变体,则天然形成了“参考-修改”的语音对。
随后,系统计算参考语音印象向量与变体印象向量之间的差值,形成印象差异向量。这个向量捕获了从参考风格到修改风格在连续空间中的位移,是连接声学变化与语言描述的桥梁。
3.2 LLM 方向生成
印象差异向量本身是数值形式,无法直接用于训练方向跟随 TTS。作者将差异向量输入一个经过微调的大型语言模型,LLM 将其“翻译”成自然语言方向文本。这个翻译过程并非简单映射,而是让 LLM 学习将向量空间中的偏移与情感、语速、语调等词汇关联起来。例如,一个表现为“语速维度升高 + 悲伤维度升高”的差异向量,可能被 LLM 描述为“读得更快一些,带点悲伤”。
LLM 生成的描述具有高自然度和多样性,避免了模板化表达,这对于模型的泛化至关重要。通过控制印象向量各维度的变化幅度,管道可以批量生成数百万条三元组,覆盖丰富的风格变化组合。
3.3 方向跟随 TTS 训练
构造好的伪三元组被送入一个条件生成网络进行训练。该网络以参考语音和方向文本为联合条件,目标是生成与目标修改语音高度一致的输出,同时由一个说话人嵌入模块强制保持说话人身份不变。训练过程中,模型逐步学会解析方向文本中的语义信息,并将其转化为相应的声学特征变化,实现从自然语言指令到精细语音修改的端到端映射。
4. 实验与结果
论文在客观指标和主观评测两个维度上验证了方法的有效性,所有实验均基于一个内部多说话人数据集。
方向对齐度是评价模型是否准确执行方向指令的核心指标。作者训练了一个方向分类器,对生成语音进行风格归类,并与指令意图对比。仅用伪三元组训练时,方向分类准确率为 76.2%,已远超随机水平;加入少量真实录音数据(约 10% 比例)后,准确率提升至 82.5%,提升了 6.3 个百分点。这表明伪三元组提供了扎实的基座能力,而真实数据带来的精细分布对齐进一步优化了指令跟随精度。
说话人相似度通过说话人嵌入向量间的余弦距离衡量。伪三元组单独训练时,余弦相似度为 0.873;混合数据训练后微降至 0.865,下降幅度仅为 0.8 个百分点。这一轻微折衷在可接受范围内,音频示例中说话人特征依然清晰可辨。主观听力测试(MOS)也给出一致结论:混合数据训练的模型在自然度与方向跟随性上得分最高。
| 训练数据 | 方向对齐准确率 | 说话人余弦相似度 |
|---|---|---|
| 仅伪三元组 | 76.2% | 0.873 |
| 伪三元组 + 真实数据 | 82.5% | 0.865 |
消融实验还揭示,LLM 生成的方向文本质量对最终性能影响显著——若用模板化描述替代 LLM 生成,方向对齐准确率下降超过 5 个百分点,证明自然语言多样性是方向跟随能力的关键。
5. 创新点与工程价值
这篇论文的核心创新在于首次将印象可控 TTS 与 LLM 联合用于方向跟随训练数据的自动构造。以往类似工作或依赖人工标注,或仅能操控有限的离散标签,作者通过引入连续印象空间和自然语言生成,打通了从声学变化到语义描述的自动化链路。
这套管道具有极强的可扩展性。一旦印象可控 TTS 和 LLM 部署完成,生成百万级三元组仅需计算资源,几乎不产生额外人工成本。同时,管道中的印象向量维度可以根据需求扩展,支持更复杂的风格组合,如“严肃中带着一丝关切”等复合指令,这是传统离散标签无法实现的。
从工程价值看,该技术为配音行业提供了高效的辅助工具。配音导演可以通过自然语言指令快速生成多个备选演绎版本,大幅缩短试音周期;在机器人语音交互公司怎么选?麦克风、芯片与算法选型指南中提到的智能语音交互场景中,系统可根据用户指令实时调整合成语音的表现力,例如将默认播报语调瞬间切换为安抚或鼓励模式,显著提升交互体验。此外,方向跟随能力还可嵌入到虚拟偶像、有声内容创作平台,实现低成本的风格化语音生产。
6. 我们的思考
将视线拉回南京昱声科技的业务版图,这项技术至少可以从三个方向与现有产品线产生深度协同。
在机器人语音交互领域,昱声的远场拾音和语音交互模组已广泛应用于商用服务机器人。方向跟随 TTS 的引入,可以让机器人在对话中根据上下文灵活调整语气——当检测到用户情绪低落时,自动切换为安抚性的柔和语调;当传达紧急通知时,则采用严肃、清晰的强调风格。这种超越简单文本播报的表达修改能力,能从情感层面极大提升人机交互的自然度与信任感。结合 语音交互公司怎么选?远场识别、降噪参数等8个技术问题一次讲透 中提到的技术要点,方向跟随让语音交互从“能听会说”迈向“善解人意”。
在声学检测与降噪方面,昱声的产线音频质检系统依赖大量测试样本评估设备在不同声学环境下的鲁棒性。方向跟随 TTS 可以批量生成同一文本在不同情感强度、不同语速下的语音,用于测试质检系统对情感变化、语速变化的容忍度。同时,可探索在噪声场中叠加方向修改语音,验证降噪算法对快速语流或低沉语调的适应性,这对于提升工业场景的检测一致性至关重要。
在远场拾音与语音识别上,方向跟随生成的多样化语音可作为扩充训练集,改善前端信号处理算法对非平稳语音的鲁棒性。例如,语音识别公司怎么选?2025选型指南与关键参数对比 中强调的个性化识别需求,就可以通过方向跟随 TTS 为不同用户生成带有个性化风格的语音模板,增强自适应识别能力。昱声有望将这套伪三元组管道内部化,定制面向特定垂直行业(如客服、教育、医疗)的方向跟随语音库,进一步巩固在定向音频处理领域的竞争力。
原文链接:https://arxiv.org/abs/2609.02623
作者:Kenichi Fujita; Yusuke Ijima
发布日期:2026-09-02T14:02:15Z
收录:INTERSPEECH 2026
相关问题解答
- 什么是方向跟随TTS?它与传统TTS有何不同?
- 方向跟随TTS不仅合成给定的文本,还根据参考语音和自然语言方向(如“读得更快、更悲伤”)来修改表达方式,同时保持说话人身份和内容不变。传统TTS通常只考虑文本到语音的映射,缺乏对演绎风格的精细控制。