证据顺序竟能改变判断:多模态大模型的"证据不可交换性"

证据排列顺序而非模态本身,才是多模态模型判断偏向的隐藏驱动力。
一篇 arXiv 论文指出,多模态大语言模型(MLLM)在处理图文或音文冲突时,研究者长期以来关注的"文本依赖度"其实混入了一个隐性变量——证据在序列中出现的先后顺序。论文采用配对比较设计,在严格固定指令与内容的前提下,仅交换感知证据(图像或语音)与文字的排列位置,从而干净地分离出位置效应。实验跨越视觉与语音模型,一致发现:将感知证据放在冲突文本之后,模型对感知内容的采信率显著提升。论文将这一现象命名为"跨模态证据不可交换性",并借此重新审视了此前关于文本偏见的研究,指出那些未控制顺序变量的结论可能存在系统性偏差,对整个多模态评测方法论具有重要警示意义。
一个被忽视的变量:证据出现的位置
多模态大语言模型(MLLM)在处理图像、语音与文本的组合信息时,常常面临一个棘手问题:当图像或语音的内容与配套文字相互矛盾时,模型会更相信哪一方?过去的研究通常用"文本依赖度"(text reliance)来衡量这种模态偏好,但一篇新发布的 arXiv 论文(arXiv:2609.26986v1)指出,这类测量可能存在一个被长期低估的混淆因素——证据出现的先后顺序。
论文作者提出的核心观察是:以往关于"文本偏见"的研究,往往固定了证据的排列顺序,或者把任务指令与证据一起移动,导致研究者无法分离出"顺序"本身的贡献。换句话说,我们以为在测量模型的模态偏好,实际上可能把"位置效应"也一并算了进去。

多模态大语言模型(MLLM)是在预训练语言模型基础上扩展而来的系统,能够同时处理文本、图像、音频等多种输入形式。典型代表包括 GPT-4V、Gemini、LLaVA 等。这类模型通常通过一个"投影层"或"适配器"将图像/语音特征映射到与文本相同的嵌入空间,再交由 Transformer 解码器统一处理。这种架构意味着不同模态的信息在进入注意力机制之前会被拼接成一个连续的上下文序列——图像 token、语音 token 与文字 token 在序列中各占据不同位置。这个"位置"不只是逻辑上的先后,在 Transformer 的注意力计算中对应着不同的位置编码,因此序列中靠前还是靠后,本质上会影响各 token 对最终生成结果的贡献权重,这正是本文位置效应得以成立的底层机制。
用配对比较隔离"顺序"这个变量
为了干净地量化位置的影响,论文采用了一种**配对比较(paired comparison)**的实验设计。这个设计的巧妙之处在于严格控制变量:保持任务指令不变、保持两路证据(例如一张图片和一段文字)的内容不变,唯一改变的只是这两个来源出现的先后位置。
这种"只交换位置、其余全部固定"的方法,把此前研究中纠缠不清的两个因素——模态偏好与证据位置——彻底分开。任何在交换顺序后出现的答案变化,都可以直接归因于位置本身,而不再被内容或指令的差异所污染。这是本文方法论上最关键的贡献。
配对比较设计(paired comparison design)是实验心理学与因果推断中的经典方法,其核心思想是通过让同一受试对象在两种条件下各经历一次,从而消除个体差异带来的噪音。在机器学习评测中,这一设计尤为有效:对同一个模型实例,分别输入"图像在前、文本在后"与"文本在前、图像在后"两种版本,若两次输入的内容完全相同,则输出差异只能归因于排列顺序。这等价于统计学中的"配对 t 检验"逻辑——通过自我对照,大幅提升了检验效能,并使得在相对小规模的实验集上就能得到统计显著的结论。论文正是利用这一设计,将顺序效应从模态偏好中外科手术式地剥离出来。
核心发现:把感知证据放在后面更"管用"
跨越视觉模型与语音模型的实验得出了一个一致的结论:当图像或录音被放置在与之冲突的文本之后时,模型的答案会明显偏向图像/语音的内容。
也就是说,同样一组相互矛盾的证据,仅仅因为感知证据(图像或语音)出现得更晚,模型就会更倾向于采信它。这揭示了一个作者称之为**跨模态证据不可交换性(cross-modal evidence noncommutativity)**的现象:
- 相同的证据,顺序不同,判断可能不同;
- 把感知证据放在后面,会增加模型对其内容的依赖。
"不可交换"这个借自数学的术语用得相当贴切——如同矩阵乘法 AB ≠ BA,证据 A 在前、证据 B 在后所得到的结论,未必等于 B 在前、A 在后的结论。信息的顺序,成了影响模型判断的实质性因素。
从 Transformer 的注意力机制角度,"靠后出现的内容更有影响力"并非反直觉的。一方面,自回归生成模型在预测下一个 token 时对近期上下文(即序列末尾)有天然的"就近偏好",这一现象在纯文本研究中早已有"序列末端效应(recency bias)"的记录;另一方面,许多 MLLM 在指令微调阶段,任务描述往往紧跟在证据之后,模型可能因此习得了"优先消化最新读入的证据再作答"的归纳偏置。跨模态证据不可交换性很可能正是这两种机制在多模态设置下的叠加体现,而非某种模型对图像或语音内容本身的"主观偏好"。
重新审视旧结论:实验设置如何误导我们
论文并没有止步于提出新现象,还回过头重新分析了此前的相关研究,指出它们的实验设置为何可能导向误导性的结论。
如果过往研究在测量"文本偏见"时,恰好总是把文本放在前面、把图像放在后面(或反之),那么它们观察到的所谓模态偏好,很可能部分甚至大部分来自位置效应,而非模型对某一模态的真实偏好。这意味着"MLLM 更相信文本"这类广为流传的判断,可能需要在控制顺序变量之后被重新检验。
这一点对整个多模态评测领域都有警示意义:当我们设计冲突场景来探测模型行为时,证据的排列顺序绝不是可以随意固定的无关细节,而是必须显式控制的实验变量。
对实践与评测的启示
对于研究者而言,这项工作提醒我们在设计模态冲突实验时必须引入顺序对照,否则得到的"模态偏好"结论可能站不住脚。对于应用开发者而言,这个发现也有直接的工程含义:如果在一个多模态提示中,感知证据(图像、音频)与文本描述可能冲突,那么它们在上下文中的排列位置,会实实在在地影响模型最终采信哪一方。
换个角度看,位置效应也提供了一种潜在的"引导"手段——若希望模型更重视图像内容,把图像放在文本之后或许是一个可以尝试的低成本策略。不过论文本身聚焦于揭示现象与修正评测方法,实际应用中的稳健性仍有待进一步验证。
结语
这篇论文的价值不在于提出复杂的新模型,而在于用一个干净的实验设计,戳破了多模态评测中一个隐藏已久的方法论盲点。当同样的证据因为顺序不同就能导致不同判断时,我们对模型"偏好"的很多既有认知,或许都需要重新打上问号。证据不可交换性,值得被纳入未来每一份多模态可靠性评测的考量之中。
相关推荐

当AI一天解出372道数学难题:数学家为何愤怒而非欢呼
OpenAI 的大语言模型一天解出 372 个开放数学问题,陶哲轩等数学家却集体抵制。本文解析数学家愤怒背后的两大理由、装箱问题与整数乘法下界的争议,以及AI对数学与软件工程人才培养的深远冲击。

决策模型对决LLM:4.8倍速度、7.4倍成本的实测启示
开发者在1000条真实招聘数据上实测决策模型(Jev)与大模型(Gemini):速度快4.8倍、成本低7.4倍、准确率仅差1.6个百分点。最优解并非替换LLM,而是决策模型加置信度检查再由LLM兜底的分层架构。

无需VAE训练文生图模型:扩散架构的新探索
探讨无需VAE训练文生图模型的新思路:为何扩散模型长期依赖变分自编码器,去掉VAE的潜在收益与挑战,以及对开源生成模型生态的可能影响。