南京昱声科技

前沿语音技术:利用离散音频令牌与跨特征知识蒸馏实现文本无关说话人验证

离散音频令牌在说话人验证中的突破:跨特征知识蒸馏框架深度解读

📌 论文速览

神经音频编解码器(Neural Audio Codec, NAC)在语音合成领域已取得显著成功,其生成的离散音频令牌(Discrete Audio Tokens)因其紧凑表示和高效生成能力,成为语音合成、音频生成任务的主流表示。然而,在自动说话人验证(Automatic Speaker Verification, ASV)任务中,这些离散令牌的表现始终落后于传统的Fbank频谱特征。这一性能差距限制了离散音频令牌在统一多任务语音处理框架中的应用。

本文作者通过系统的实证分析揭示了一个关键发现:离散令牌中隐式保留了说话人区分性信息,但常规的ASV训练范式——无论是交叉熵损失还是对比损失——都难以有效提取这些埋藏的说话人线索。这一发现为后续方法设计提供了理论依据。基于此,研究团队提出了跨特征知识蒸馏(Cross-Feature Knowledge Distillation, CFKD)框架,通过让基于离散令牌的学生模型模仿Fbank教师模型的说话人嵌入空间,实现了结构化监督。

实验在VoxCeleb三个标准测试集上验证了CFKD的有效性。以DAC(Descript Audio Codec)编解码器为例,VoxCeleb1-O测试集上的等错误率(Equal Error Rate, EER)从4.40%大幅降至2.12%,相对提升超过50%,已接近Fbank教师模型ECAPA-TDNN的1.88%。在VoxCeleb1-E和VoxCeleb1-H上,EER分别从2.55%降至1.45%、从4.56%降至2.89%,三个测试集的一致性提升充分证明了方法的鲁棒性。

🔬 研究背景与挑战

神经网络音频编解码器如SoundStream、EnCodec和DAC,通过将音频波形压缩为离散令牌序列,实现了低比特率下的高质量音频重建。这些离散令牌本质上是量化后的潜在表示,每个令牌从一个有限码本中选取,构成了高度压缩的音频表征。在语音合成中,这种离散化使得语言模型可以直接对音频进行建模,催生了VALL-E、AudioLM等突破性工作。但在机器人语音交互等需要说话人身份识别的场景中,离散令牌的ASV性能始终不尽如人意。

现有研究已表明,直接对离散令牌序列训练说话人嵌入,其性能不仅远低于Fbank系统,甚至劣于传统的MFCC(Mel-Frequency Cepstral Coefficients)特征。这引发了学术界对离散令牌是否保留了足够说话人信息的质疑。从信号处理角度看,离散令牌经过残差矢量量化(Residual Vector Quantization),去除了大量细粒度声学细节,但理论上仍应保留声道形状、音色特征等与说话人身份相关的长期统计特性。

核心挑战在于训练范式的失配。离散令牌空间是高度非连续的,每个令牌代表一个码本索引,相邻索引之间缺乏欧氏距离意义上的平滑性。常规的AAM-Softmax或对比损失依赖于嵌入空间中的连续距离度量,难以从这种离散、稀疏的表示中提取鲁棒的说话人嵌入。这一瓶颈并非源于信息缺失,而是源于优化困难——需要一种新的训练策略来引导模型从离散令牌中发现并放大说话人相关的微弱信号。

💡 核心方法

CFKD框架的核心思想简洁而有效:让一个工作在离散令牌上的学生模型,通过模仿Fbank教师模型的说话人嵌入空间,学会从量化表示中提取说话人信息。整体架构包含两个并行分支:教师模型接收标准的Fbank频谱特征,学生模型接收来自同一语音的离散音频令牌序列。教师模型在训练期间冻结,仅用于提供监督信号。

学生模型采用Transformer编码器处理离散令牌序列。每个令牌首先通过嵌入层映射为连续向量,经多层自注意力机制建模序列依赖关系后,在输出端通过一个可训练的说话人嵌入投影层,将编码器输出映射为固定维度的说话人嵌入向量。这一结构设计轻量且灵活,不改变底层编解码器的任何参数,仅在离散令牌后端叠加编码器,与编解码器完全解耦。

训练损失由两部分组成:标准的说话人分类损失(AAM-Softmax)和嵌入层蒸馏损失。分类损失确保学生模型能够执行基本的说话人判别任务,而蒸馏损失则强制学生嵌入向教师嵌入逼近。蒸馏损失可采用均方误差(MSE)或余弦相似度损失,实验表明余弦相似度损失在保持嵌入空间角度结构方面更为有效。这种双损失设计使得学生模型既学习判别性说话人特征,又继承了教师模型已经学到的良好嵌入空间结构,从而激活了离散令牌中潜在的说话人线索。

📊 实验与结果

实验设置严格遵循VoxCeleb基准测试的标准协议:使用VoxCeleb2的开发集进行训练,在VoxCeleb1的O(原始)、E(扩展)、H(困难)三个测试集上评估。基线系统采用DAC编解码器的离散令牌作为输入,经过Transformer编码器和AAM-Softmax损失训练,在VoxCeleb1-O上达到4.40%的EER。这一基线性能已优于多数基于离散令牌的先前工作,但相较Fbank教师模型ECAPA-TDNN的1.88%仍有显著差距。

应用CFKD后,系统性能出现质的飞跃。如下表所示,所有测试集上均有大幅提升:

系统 VoxCeleb1-O EER VoxCeleb1-E EER VoxCeleb1-H EER
Fbank教师(ECAPA-TDNN) 1.88% 1.14% 2.25%
DAC离散令牌基线 4.40% 2.55% 4.56%
DAC + CFKD(本文) 2.12% 1.45% 2.89%

消融实验揭示了蒸馏策略的关键作用:仅使用软标签蒸馏(匹配教师模型输出的分类概率分布)带来的提升有限,而嵌入空间蒸馏是主要增益来源。这一发现表明,教师模型的嵌入空间结构本身蕴含了丰富的说话人判别信息,直接将学生嵌入对齐到这一空间,比间接通过分类logit匹配更有效。此外,在EnCodec和SoundStream两种不同编解码器上重复实验,CFKD均带来一致的性能提升,证明了方法的通用性。

🎯 创新点与工程价值

本文的学术贡献体现在三个层面。首先,首次系统性地证明了离散音频令牌中隐式存在说话人区分性信息,并通过实验指出常规训练范式的瓶颈不在于信息缺失,而在于优化困难。这一发现为后续研究提供了明确方向。其次,提出的CFKD框架通过模态间嵌入对齐,实现了跨特征的知识迁移,无需修改编解码器结构或增加推理时延,即可大幅提升ASV性能。第三,CFKD的思路具有普适性,可迁移至情感识别、语种识别等任务。

从工程角度看,这一方法为语音编解码器在端侧设备上的多任务复用开辟了可能性。在机器人语音交互系统中,同一套离散音频令牌既可支持低成本的语音传输和合成,又能进行高精度的说话人验证,无需独立部署Fbank特征提取前端。这显著降低了计算开销和存储需求,尤其适用于资源受限的嵌入式设备。同时,由于离散令牌的比特率远低于原始波形,在云端协同场景下可大幅减少传输带宽。

此外,CFKD框架与编解码器解耦的设计使得系统升级极为灵活:当底层编解码器迭代时,仅需重新训练轻量的Transformer编码器,而无需改动整个ASV流水线。这种模块化设计也便于集成到现有的声学信号处理链路中,与降噪、去混响等前端模块协同工作,为构建统一的语音表征基座提供了可行路径。

🛠️ 我们的思考

南京昱声科技在机器人语音交互产品中,声纹识别模块常需同时处理远场唤醒、降噪增强和说话人确认等多重任务。当前管线中,Fbank特征提取和离散音频编解码往往独立运行,造成计算冗余。若引入离散音频令牌作为统一表示,可将前端处理简化为单一编解码器输出,不同下游任务共享同一令牌流,大幅降低工程复杂度。这与我们在语音降噪方案中追求的多任务协同理念高度契合。

在声学检测和工业异常声音分析场景中,离散令牌可能保留设备运行状态的关键信息。CFKD的思路可迁移至“设备身份”或“故障模式”识别任务:用少量有标签的频谱特征教师模型引导离散令牌学生模型学习,在标注数据稀缺的条件下提升检测精度。这与我们在产线声学检测中面临的小样本学习挑战直接对应,为电机异音检测、产线音频质检等业务提供了新的技术路径。

当前方法依赖成对音频的同步蒸馏,假定教师和学生接收相同的干净语音。但在远场噪声和混响环境下,教师模型基于Fbank特征可能比离散令牌学生模型捕获更多噪声细节,导致蒸馏时的嵌入失配。未来可结合数据增强策略或噪声鲁棒蒸馏损失,使离散令牌系统在复杂声学环境中保持稳定,这与我们在麦克风阵列和远场拾音领域的技术积累形成互补,有望推动端到端多任务声学感知系统的实际落地。

📄 原文链接:https://arxiv.org/abs/2607.07579

作者:Zheng Liang; Junjie Li; Kong Aik Lee

发布日期:2026-07-08T16:03:44Z

收录:Interspeech 2026

📖 相关问题解答

离散音频令牌是什么?为什么它之前在做说话人验证时不如Fbank?
离散音频令牌是神经音频编解码器将语音波形压缩成的一串离散整数,类似文本Token。它去除了大量声学细节,以低比特率保存波形,因此常规训练从这些高度抽象的特征中难以抽取精细的说话人特性,导致性能落后于Fbank等保留完整频谱结构的特征。
跨特征知识蒸馏(CFKD)如何让离散令牌系统变好?
CFKD用一个预训练好的Fbank说话人教师模型,在训练离散令牌学生模型时,除了传统的分类损失,还让学生输出的说话人嵌入向量直接模仿教师的嵌入,相当于把教师已经学会的说话人判别空间‘移植’给学生,让学生学会从离散令牌中提取与Fbank同样有区分度的说话人信息。
这种方法会增加推理时的计算量吗?
不会。知识蒸馏只在训练阶段使用教师模型,推理时仅需学生模型,即离散令牌编码器和轻量Transformer后端,无需Fbank特征提取或教师模型,因此额外计算开销为零。

需要专业服务?立即联系我们

南京昱声科技

联系电话请访问官网