[控场AI]
论文Structured Latent Visual Reasoning

SLVR

提出结构化潜在视觉推理框架的研究论文,通过带类型的潜在推理阶段(规划、定位、证据选择、推理整合)结合两阶段训练策略,提升多模态大语言模型的视觉推理能力

时间轴 (近 90 天)

10月9日

SLVR(Structured Latent Visual Reasoning)将多模态推理组织成若干带类型的潜在阶段,对应规划、定位、证据选择和推理整合四个环节

待验证50%
10月9日

SLVR采用两阶段训练策略:第一步通过遮蔽泄露答案的文本并用视觉干扰项迫使模型依赖图像,第二步进行结构化的分阶段监督

待验证50%
10月9日

SLVR的定位阶段用边界框监督,证据选择对应视觉证据,整合对应最终推理理由,规划对应计划

待验证50%
10月9日

SLVR构建在Qwen2.5-VL-7B之上

待验证50%
10月9日

SLVR在MMVP基准上取得绝对提升+9.4

待验证50%
10月9日

SLVR在BLINK Relation基准上取得绝对提升+14.2

待验证50%
10月9日

SLVR在V*、MathVista、ChartQA等基准上也有不同程度的改善

待验证50%
10月9日

SLVR与连续思维链(Coconut)不同,后者在隐空间中自由迭代但不施加阶段划分,而SLVR明确要求每个潜在状态与特定语义功能对齐

待验证50%
10月9日

SLVR是一篇来自arXiv的新研究预印本

待验证50%
10月9日

研究者认为结构化的潜在监督能够提升细粒度视觉推理能力,同时避免文本思维链带来的解码开销

待验证50%

全部知识事实 (10)

来源文章