SymCE
发表于arXiv的论文,提出通过构建符号验证器来研究大语言模型反例生成任务,揭示监督微调中的模仿陷阱现象,并发布包含4707条错误猜想的SymCE语料库
时间轴 (近 90 天)
SymCE 论文将反例生成任务重新建模为'面向确定性验证器的约束见证发射',模型需针对每个错误命题产出能被 Python 验证器判定为有效的反例
SymCE 语料库包含 4,707 条本科水平的代数与实分析领域的错误猜想,每条都配有可执行的验证器
SymCE 的验证器既用于评测,又直接充当强化学习的奖励函数
对 177 个验证器判定结果的人工审查显示准确率达到 97.7%
以 Qwen3-4B 为基础模型,仅用反例数据做监督微调会让模型对真定理的识别能力从 0.27 崩溃到 0.00
使用稀疏的仅基于最终结果的强化学习奖励信号,模型修复了被 SFT 破坏的真定理识别能力并将识别率提升到 0.66,超越基础模型
稀疏奖励与密集奖励在域内成功率上统计意义无法区分,但在留出的校准探针测试中差距高达 33 个百分点
研究者将稀疏奖励与密集奖励的校准差异追溯到密集奖励中的'部分得分'项
经过训练的 4B 参数模型在反例生成任务上超越了所有参与评测的 7B 开源数学专用模型,并与六个前沿商用 API 保持竞争力
在提示词不变的情况下,SymCE 训练的模型能力可迁移到 GSM8K、MATH-500 和 MMLU-college-math 等主流数学推理基准
还有 1 条时间轴事件
全部知识事实 (11)
SymCE 论文将反例生成任务重新建模为'面向确定性验证器的约束见证发射',模型需针对每个错误命题产出能被 Python 验证器判定为有效的反例
50%待验证SymCE 语料库包含 4,707 条本科水平的代数与实分析领域的错误猜想,每条都配有可执行的验证器
50%待验证SymCE 的验证器既用于评测,又直接充当强化学习的奖励函数
50%待验证对 177 个验证器判定结果的人工审查显示准确率达到 97.7%
50%待验证以 Qwen3-4B 为基础模型,仅用反例数据做监督微调会让模型对真定理的识别能力从 0.27 崩溃到 0.00
50%待验证使用稀疏的仅基于最终结果的强化学习奖励信号,模型修复了被 SFT 破坏的真定理识别能力并将识别率提升到 0.66,超越基础模型
50%待验证稀疏奖励与密集奖励在域内成功率上统计意义无法区分,但在留出的校准探针测试中差距高达 33 个百分点
50%待验证研究者将稀疏奖励与密集奖励的校准差异追溯到密集奖励中的'部分得分'项
50%待验证经过训练的 4B 参数模型在反例生成任务上超越了所有参与评测的 7B 开源数学专用模型,并与六个前沿商用 API 保持竞争力
50%待验证在提示词不变的情况下,SymCE 训练的模型能力可迁移到 GSM8K、MATH-500 和 MMLU-college-math 等主流数学推理基准
50%待验证SymCE 团队已将代码、数据、验证器模块与标注全部开源(github.com/ce-rlvr/SymCE)
50%