1. 论文速览
这篇来自INTERSPEECH 2026的论文,由Wangzixi Zhou、Bagus Tris Atmaja和Sakriani Sakti三位研究者共同完成,直指情感语音合成(emotional TTS)领域一个长期被忽视的核心问题:情感感知不存在“标准答案”。
当前主流情感TTS系统大多采用离散标签(如“高兴”“悲伤”),或基于Russell的唤醒度-效价(arousal-valence,简称A-V)二维模型进行连续控制。但问题在于,同样的A-V坐标值,不同听者感知到的情感可能截然不同。论文提出了一种基于交互式遗传算法(Interactive Genetic Algorithm,IGA)的个性化框架,通过让系统与每位听者进行多轮交互式优化,动态构建个体专属的A-V感知空间映射。
实验覆盖日本、中国、印尼三国共90名参与者,评估高兴、悲伤、愤怒、中性四种情感。结果显示,个性化模型的情感一致性评分比使用群体平均值的通用模型高出0.62分(5分制),唤醒度维度主观评分误差降低18.2个百分点,效价维度降低22.7个百分点。这一结果有力证明了“一刀切”式情感建模的局限性,以及个性化适配的必要性。
2. 研究背景与挑战
情感语音合成在智能客服、教育机器人、虚拟伴侣等场景中需求日益增长。然而,传统系统依赖离散情感类别(如Ekman六类基本情感),这无法捕捉情感的连续性和细微变化。维度模型(dimensional model)的引入,尤其是A-V二维空间,为情感表达提供了更精细的“调色盘”。
但维度模型并未解决根本问题:情感感知具有高度主观性。一篇相关研究指出,机器人语音交互核心技术怎么选?声学算法与参数深度解析中强调了语音交互中个体差异对用户体验的显著影响。同一段语音,有人听出“兴奋”,有人却感知为“焦躁”。这种差异不仅源于个体性格与经历,更深植于文化背景。
文化对情感感知的塑造是深层的。高唤醒度在西方文化中常关联积极情绪,但在东亚文化中可能被解读为失礼或攻击性。论文指出,使用通用A-V模型时,跨文化参与者对同一语音样本的情感归因离散度显著增大,说明“平均模型”在文化维度上产生了系统性感知错位。这为个性化语音合成(personalized speech synthesis)提出了明确的技术挑战:如何在保留文化群体共性约束的同时,精准适配个体差异。
3. 核心方法
论文将情感TTS重新定义为以个体听者为中心的交互式优化过程。系统不再预设固定的情感-声学映射函数,而是通过交互式遗传算法(IGA),在每轮迭代中生成多个A-V参数略有不同的语音样本,供听者进行比较和偏好评分。
具体流程如下:初始种群包含若干组A-V候选值,系统合成对应语音并播放给听者。听者通过对比界面打分,表达“哪个更符合目标情感”的主观判断。算法依据这些评分执行选择、交叉、变异操作,进化出更符合该听者感知偏好的A-V参数组合。经过若干轮迭代(论文中设定为8-10轮),算法收敛至个体特定的情感-声学映射函数,即该听者的个性化感知空间。
这一框架的巧妙之处在于,它不要求听者具备任何声学或情感理论知识,只需凭借直觉做出偏好选择。同时,IGA的种群进化机制天然保留了文化群体的共性特征作为搜索空间的约束边界,避免了个性化过度偏离群体规范。优化收敛后获得的映射函数可被持久化存储,使后续合成语音的情感表达与听者主观感知高度一致,实现了真正意义上的“千人千声”。
4. 实验与结果
研究团队招募了日本、中国、印尼各30名参与者,年龄跨度从20岁到45岁,确保了样本的跨文化代表性。实验选取高兴、悲伤、愤怒、中性四种情感类别,每种情感由系统生成多组A-V变体语音样本,采用5分制Likert量表进行情感一致性主观评分。
实验设置了两组对照:基线模型使用从公开数据集统计得出的群体平均A-V值;个性化模型则经过IGA迭代优化。下表展示了核心对比数据。
| 评估指标 | 平均模型 | 个性化模型 | 改善幅度 |
|---|---|---|---|
| 情感一致性评分(5分制) | 3.41 | 4.03 | +0.62分 |
| 唤醒度主观评分误差 | — | — | 降低18.2个百分点 |
| 效价主观评分误差 | — | — | 降低22.7个百分点 |
跨文化分析进一步揭示,日本参与者对低唤醒度情感的偏好更明显,印尼参与者对高唤醒度的容忍度更高,而中国参与者居中。个性化模型有效吸收了这些文化差异,使三组参与者的满意度均显著提升,组间差异较基线模型收窄约40%。
5. 创新点与工程价值
论文的核心贡献在于首次将交互式遗传算法引入情感TTS的个性化感知空间优化,从方法论层面突破了“群体平均即最优”的传统假设。不同于事后调参或预定义风格标签,IGA驱动的交互式优化让系统在真实人机交互中动态学习个体偏好,这是一种在线、增量、以用户为中心的情感建模范式。
工程价值同样显著。在智能语音助手领域,用户对“热情”的定义千差万别,有人喜欢干脆利落的回应,有人偏好温和亲切的语气。该框架使系统能够通过几次简短交互,快速建立用户的情感偏好模型,输出更贴合个体预期的语音表达。在教育机器人、虚拟心理咨询等场景中,情感表达的自然度与准确性直接关系到交互效果与用户信任。
值得关注的是,即使只进行5轮交互优化,个性化模型的评分就已显著超过平均模型,表明该框架的收敛速度能够满足实际部署需求。在移动端或嵌入式设备上,轻量化的IGA可以高效运行,无需大量计算资源。对于当前蓬勃发展的机器人对话系统而言,这种用户自适应的情感表达机制有望成为提升交互自然度的关键差异化能力。
6. 我们的思考
南京昱声科技在机器人语音交互和声学方案领域深耕多年,这篇论文的启发是多维度的。在服务机器人场景中,语音不仅是信息传递的载体,更是建立情感连接、塑造品牌个性的核心媒介。当前多数商用机器人使用固定风格的合成语音,无法根据用户偏好动态调整。借鉴IGA框架,完全可以让机器人通过对用户反馈的少量交互,学习其情感偏好,生成更亲切、更具信任感的个性化语音。
这种思路可以延伸至声学检测与降噪场景。不同用户对语音清晰度、降噪强度、频谱平衡的舒适度感知存在显著差异。例如,在嘈杂产线环境中,一些操作员偏好强力降噪带来的“干净”听感,另一些则认为适度保留环境音更有安全感。在声学检测在产线质检怎么选?家电与机器人质检方案详解中,我们探讨过主观评价在声学方案设计中的重要性。引入个性化感知优化思想,系统可以根据用户对降噪后语音的实时反馈,自适应调整降噪算法的参数组合,在信噪比提升与听觉舒适度之间找到个体最优平衡点。
在远场拾音和产线音频质检等场景中,操作员对异常声音的判断阈值同样存在个体差异。通过交互式优化,检测系统可以学习特定质检员的听觉敏感度曲线,降低误报率与漏检率。这一技术路径与南京昱声科技“让声学系统更懂人”的研发理念高度契合,值得在后续产品迭代中深入探索。
原文链接:https://arxiv.org/abs/2608.00998
作者:Wangzixi Zhou; Bagus Tris Atmaja; Sakriani Sakti
发布日期:2026-08-02T04:54:12Z
收录:INTERSPEECH 2026
相关问题解答
- 交互式遗传算法在情感TTS中具体如何工作?
- 系统不断生成不同情感参数的语音,听者通过比较界面选择更符合自己感知的样本,算法根据选择结果进化个体情感感知空间,直至收敛。
- 个性化情感语音合成需要多少轮交互才能达到较好的效果?
- 实验中通常需要10-15轮交互即可收敛,每轮仅需听者做出简单偏好选择,实际应用中可进一步优化减少交互次数。