[控场AI]
基准误导性图片压力测试 / Misleading Image Stress Test

MIST

MIST是一个专为测试视觉语言模型抗干扰能力设计的基准测试集,通过在习语识别任务中引入对齐或误导性图片,评估模型是否会被无关图片干扰标注判断

时间轴 (近 90 天)

10月5日

研究者构建了MIST(误导性图片压力测试),包含200个英文条目,每个条目是一个含潜在习语的句子,正确标签完全由句子决定

待验证50%
10月5日

MIST测试集涵盖四个条件:比喻意句子配字面意图片、比喻意句子配比喻意图片、字面意句子配字面意图片、字面意句子配比喻意图片,每个条件50个样本

待验证50%
10月5日

人类标注由两组各三名流利英语使用者完成,两组Fleiss' Kappa分别为0.65和0.57,无显著差异

待验证50%
10月5日

13个被评估的VLM中有7个在至少一种配置下通过了替代测试

待验证50%
10月5日

7个通过测试的模型中,加对齐图片导致15.9%的标签变化,加误导图片导致14.7%,而仅修改提示词的控制组只有8.8%

待验证50%
10月5日

13个模型中标签变化的样本仅37%偏向误导图片含义,63%走向相反方向,均低于50%随机水平,说明图片只是随机打乱模型判断而非引导它

待验证50%
10月5日

整体准确率几乎不变:无图片时与人类一致性为54.4%,加对齐图片53.7%,加误导图片54.7%

待验证50%
10月5日

71%的标签变化没有跨越比喻意与字面意的核心边界,只是在同一类别内微调

待验证50%
10月5日

7个通过替代测试的模型变化率为15.9%,而6个未通过的模型高达25.8%,性能更好的模型受干扰程度较低但仍高于提示词修改影响

待验证50%
10月5日

每个模型搭配零样本、少样本、思维链、少样本+思维链四种提示词,每种分两组,总共产生约52,000个标签

待验证50%

还有 3 条时间轴事件

全部知识事实 (13)

待验证

该研究的局限包括:两种图片都与习语相关未测试完全无关图片、标签部分有序、每个人类标注者只看一个条件、样本全为英文习语且关闭了模型推理模式

50%
待验证

MIST测试集涵盖四个条件:比喻意句子配字面意图片、比喻意句子配比喻意图片、字面意句子配字面意图片、字面意句子配比喻意图片,每个条件50个样本

50%
待验证

人类标注由两组各三名流利英语使用者完成,两组Fleiss' Kappa分别为0.65和0.57,无显著差异

50%
待验证

13个被评估的VLM中有7个在至少一种配置下通过了替代测试

50%
待验证

7个通过测试的模型中,加对齐图片导致15.9%的标签变化,加误导图片导致14.7%,而仅修改提示词的控制组只有8.8%

50%
待验证

13个模型中标签变化的样本仅37%偏向误导图片含义,63%走向相反方向,均低于50%随机水平,说明图片只是随机打乱模型判断而非引导它

50%
待验证

整体准确率几乎不变:无图片时与人类一致性为54.4%,加对齐图片53.7%,加误导图片54.7%

50%
待验证

71%的标签变化没有跨越比喻意与字面意的核心边界,只是在同一类别内微调

50%
待验证

7个通过替代测试的模型变化率为15.9%,而6个未通过的模型高达25.8%,性能更好的模型受干扰程度较低但仍高于提示词修改影响

50%
待验证

每个模型搭配零样本、少样本、思维链、少样本+思维链四种提示词,每种分两组,总共产生约52,000个标签

50%
待验证

研究者构建了MIST(误导性图片压力测试),包含200个英文条目,每个条目是一个含潜在习语的句子,正确标签完全由句子决定

50%
待验证

论文建议发布模型部署报告时必须明确说明所用提示词以及是否附加任何无关上下文,不能只说模型通过了替代测试

50%
待验证

MIST数据集已公开在Hugging Face,名称为Nagham/Mist-VLM-Judges

50%

来源文章