VICO
VICO是一个视觉语言模型后训练协同进化框架,通过引入环境改写器(EnvRewriter)动态生成校准难度的训练样本,使视觉环境与模型能力共同进化,无需额外人工标注
Timeline (last 90 days)
VICO论文指出当模型能力提升时,固定不变的训练任务会偏离其学习前沿,导致学习信号坍塌
VICO(Visual Environments Co-Evolving)是一个让视觉环境与视觉语言模型协同进化的后训练框架
VICO引入了名为环境改写器(EnvRewriter)的组件,与actor联合训练
VICO使用基于通过率的奖励(pass-rate-based reward)来校准生成任务的难度,使任务落在模型学习前沿
VICO先编辑结构化中间表示再渲染成图像,从而在不依赖人工标注的前提下生成有效训练样本
VICO在九个多模态基准上进行了验证,覆盖数学推理和视觉落地理解两大类任务
VICO与专门针对图表优化的RLVR方法表现相当,但所用标注样本少了16到160倍
VICO将VLM后训练从人工标注监督转向图像编辑协同进化,提供了超越静态语料RLVR的可规模化路径
VICO的协同进化可看作课程学习与自对弈思路在视觉语言模态的融合,EnvRewriter扮演根据学生能力动态出题的教师角色
All Facts (9)
VICO论文指出当模型能力提升时,固定不变的训练任务会偏离其学习前沿,导致学习信号坍塌
50%UnverifiedVICO(Visual Environments Co-Evolving)是一个让视觉环境与视觉语言模型协同进化的后训练框架
50%UnverifiedVICO引入了名为环境改写器(EnvRewriter)的组件,与actor联合训练
50%UnverifiedVICO使用基于通过率的奖励(pass-rate-based reward)来校准生成任务的难度,使任务落在模型学习前沿
50%UnverifiedVICO先编辑结构化中间表示再渲染成图像,从而在不依赖人工标注的前提下生成有效训练样本
50%UnverifiedVICO在九个多模态基准上进行了验证,覆盖数学推理和视觉落地理解两大类任务
50%UnverifiedVICO与专门针对图表优化的RLVR方法表现相当,但所用标注样本少了16到160倍
50%UnverifiedVICO将VLM后训练从人工标注监督转向图像编辑协同进化,提供了超越静态语料RLVR的可规模化路径
50%UnverifiedVICO的协同进化可看作课程学习与自对弈思路在视觉语言模态的融合,EnvRewriter扮演根据学生能力动态出题的教师角色
50%