论文速览
这篇入选 ICASSP 2026 的论文推出了首个面向大音频语言模型(Large Audio Language Models,LALMs)的听觉错觉基准——AIB(Auditory Illusion Benchmark)。研究团队从音乐、声音、语音三大领域精选了 10 种经典听觉错觉,包括 Shepard 音调、语音到歌曲错觉(Speech-to-Song Illusion)和 McGurk 效应等,并对每个错觉标注了是否依赖知识先验(knowledge-based priors)。
评测覆盖了 7 个主流 LALMs,包括 Qwen2-Audio、SALMONN、Gemini 1.5 Pro 和 GPT-4o 等。研究者同步开展了受控人类听力实验,让模型与人类在相同刺激条件下做出感知判断。结果显示了一个清晰的模式:在低级声学错觉上,大多数模型保持对物理信号的忠实;但当语言或音乐先验介入时,部分模型开始表现出类人感知偏差,不过没有任何模型能完全复现人类感知分布。这项工作为探测神经网络黑箱模型提供了全新视角。
研究背景与挑战
感知错觉在认知科学中扮演着特殊角色——它们像一面镜子,映照出人类感知系统中的偏见与局限。视觉错觉早已被广泛研究,但在听觉领域,类似的错觉同样揭示了大脑如何处理声音信息的有趣机制。当一段语音被反复播放,听者会逐渐觉得它像在唱歌,这就是语音到歌曲错觉的典型表现。这类现象为测试大音频语言模型是否复现人类感知倾向提供了独特视角。
然而,当前大多数音频模型基准集中在通用任务上,如语音识别、音频分类或声学场景分析。听觉错觉领域长期缺乏系统评估,这形成了一个明显的评估缺口。构建这样的基准面临三重挑战:第一,需要覆盖音乐、声音、语音等多领域错觉,确保评估的全面性;第二,必须控制知识先验这一关键变量,因为有些错觉完全由低级声学特性驱动,而另一些则需要语言或音乐经验的参与;第三,设计可对比的人类与模型评测范式,确保两者接受的刺激条件一致,才能进行有意义的统计比较。
在语音交互公司怎么选?远场识别、降噪参数等8个技术问题一次讲透一文中,我们曾讨论过真实声学环境中的感知挑战,而听觉错觉恰恰揭示了更深层的机制问题。
核心方法
AIB 基准的构建遵循了严格的实验设计原则。研究团队从文献中筛选出 10 个代表性听觉错觉,每个错觉被转化为问答任务。例如,在 Shepard 音调错觉中,模型需要判断音高是上升还是下降;在语音到歌曲错觉中,模型需描述听到的内容是语音还是歌曲。每个错觉明确标注了是否存在基于知识或经验的先验驱动,这一设计使得研究者能够区分模型对声学信号本身的响应与对更高层认知因素的响应。
人类对照实验部分,研究者招募了参与者进行相同条件下的听力测试。刺激呈现方式与模型输入保持一致,确保对比的公平性。通过收集人类感知分布作为基线,研究者能够量化模型与人类在每个错觉上的偏差程度。这种受控对比设计是本文方法论的核心亮点。
模型评测采用零样本方式,直接向 7 个主流 LALMs 提供音频输入和问题,收集其文字回答。统计检验方法被用于比较模型与人类的回答分布差异,揭示不同先验条件下模型的感知行为模式。这种设计使得研究结果不仅具有描述性,还具备统计学意义上的可解释性。在机器人语音交互公司怎么选?麦克风、芯片与算法选型指南中提到的音频处理链路,同样需要应对这类感知层面的挑战。
实验与结果
实验数据揭示了模型与人类之间系统性的感知差异。在 Shepard 音调、Zwicker 音调等低级声学错觉上,模型整体表现更接近物理信号。以连续音高错觉为例,模型正确识别物理音高的平均比例为 72%,而人类仅为 45%,差距达 27 个百分点。这反映出模型缺少人类感知中那种对整体音高结构的错觉倾向。
当涉及知识先验时,情况变得更有趣。语音到歌曲错觉中,Qwen2-Audio 在经过重复播放后产生歌曲感知的比例达到 45%,接近人类的 60%,而其他模型如 SALMONN 和 Gemini 1.5 Pro 普遍低于 20%。这表明某些模型在语言和音乐先验的介入下,开始表现出类人感知偏差,但程度因模型架构而异。
McGurk 效应的测试结果更值得关注。这一经典的多模态错觉涉及视觉口型对听觉感知的影响,大多数模型未能表现出视听觉整合的类人效应,仅少数模型有微弱倾向。整体而言,没有一个模型能在全部 10 种错觉上完美复现人类感知分布。AIB 基准提供了可量化的对比数据,代码已在 GitHub 开源。
创新点与工程价值
这项工作的核心创新在于首次将听觉错觉系统化地构建为 LALMs 的认知测试床。此前的研究要么聚焦视觉错觉,要么仅关注音频模型的功能性指标,忽视了感知层面的评估。AIB 通过引入控制性人类对比研究,建立了一个可量化的感知偏差度量体系。显式标注知识先验的设计,使得研究者能够区分模型对不同类型线索的依赖程度,这是对现有评估方法的重要补充。
从工程角度看,AIB 为语音交互、声学检测等场景提供了感知鲁棒性评估工具。开发者可以利用这一基准识别模型在特定听觉错觉下的误判风险,例如语音到歌曲错觉可能导致指令识别错误,McGurk 效应则可能影响多模态交互系统在嘈杂环境中的表现。这些洞察可直接指导模型训练中融入人类感知约束,提升产品在真实环境中的可靠性。在语音识别公司怎么选?2025选型指南与关键参数对比中讨论的评估维度,同样需要纳入这类感知层面的考量。
我们的思考
南京昱声科技在机器人语音交互业务中,直接面临听觉错觉带来的工程挑战。语音到歌曲错觉是一个典型场景:当机器人反复接收相似的语音指令时,模型可能产生歌曲感知偏差,导致误触发或指令识别错误。AIB 基准可作为一种诊断工具,帮助我们评测自研音频模型在类似场景下的感知偏差,识别出对特定错觉敏感的模型组件。
在声学检测与降噪算法方面,模型对错觉的敏感性同样值得关注。降噪处理后的语音自然度可能因模型对音乐性先验的放大而受损——如果降噪算法过度压制了语音的韵律特征,反而会触发模型将其误判为歌曲。借鉴人类听觉掩蔽效应的研究,我们可以优化模型的感知特性,在降噪和自然度之间找到更好的平衡点,提升语音清晰度和用户体验。
产线音频质检场景中,重复性机械噪声可能引发类似纯音错觉的感知偏差,影响缺陷检测的准确性。将听觉错觉测试集成到产品开发流程中,作为质量评估的一环,能够提前发现潜在风险。未来,我们还可以探索利用知识先验增强模型在复杂声学环境下的理解能力,让机器人听觉系统不仅忠实于信号,更能贴近人类感知,实现更自然的智能交互。
原文链接:https://arxiv.org/abs/2609.02277
作者:Hayoon Kim; Eunice Hong; Kyogu Lee
发布日期:2026-09-02T08:23:36Z
收录:ICASSP 2026
相关问题解答
- AIB基准具体包含哪些听觉错觉?
- 涵盖音乐领域的Shepard音调、旋律完形,声音领域的Zwicker音调、连续音高错觉,以及语音领域的语音到歌曲错觉、McGurk效应等,共10种代表性错觉,并标注了每个错觉是否依赖知识先验。
- 大音频语言模型在听觉错觉上与人类的主要差异是什么?
- 在低级声学错觉上,模型更倾向于物理信号忠实,不易被错觉诱导;而在涉及语言或音乐先验的错觉中,部分模型表现出类人倾向,但程度和一致性远不及人类,且不同模型之间差异显著,整体上不具备稳定的人类感知分布。
- 这个基准如何用于改进语音交互系统?
- 可以利用AIB测试语音交互模型在特定听觉错觉下的响应,识别出可能导致误判或非自然反应的场景,进而通过调整模型训练数据或架构,减少感知偏差,增强系统在真实噪声环境中的鲁棒性和交互自然度。