[控场AI]
模型CRN / Correction Refinement Network v2

CRN v2

一种工作在logit层面的轻量校正模块,通过冻结基座模型、logit层校正和KL锚定三原则,在不修改基座权重的前提下修复语言模型输出错误,约3400万可训练参数

时间轴 (近 90 天)

9月16日

arXiv 论文(arXiv:2609.16145)提出的 CRN v2 是一个工作在 logit 层面的轻量校正模块,在完全冻结基座模型的前提下修复输出错误

待验证50%
9月16日

CRN v2 约有 3400 万可训练参数,相当于 46.5 亿参数文本模块的 0.73%

待验证50%
9月16日

CRN v2 扣在冻结的 Gemma 4 E2B 模型之上,基座权重全程不变

待验证50%
9月16日

CRN v2 的训练流程分两步:先做监督微调(SFT),再做无参考版 DPO,使用了 83,400 对错误-纠正样本

待验证50%
9月16日

在 CEHRI 60 题领域考试上,CRN v2 纠正了基座模型 53.3% 的错误,在改写变体上纠正 43.3%

待验证50%
9月16日

在 MMLU/BoolQ(N=200)和 car-wash(N=8)等基准上,CRN v2 没有出现任何能力退化

待验证50%
9月16日

无参考版 DPO 由于基座模型已被冻结,其输出 logit 可充当参考分布,KL 锚定项直接约束校正后的 logit 分布不过度偏离冻结基座的原始输出

待验证50%
9月16日

论文用于对比的 LoRA 基线采用 rank 19、660 万参数,纠错率达 83.3%,但出现了 30% 到 75% 的能力损失

待验证50%
9月16日

消融实验显示 KL 保持项系数从 0.1 降到 0.01 时,纠错率从 53.3% 跌到 35.0%,说明 KL 锚定也参与撑起纠错有效性

待验证50%
9月16日

研究团队测试的多种替代配置(隐藏状态注入、更浅层注入、多深度logit校正、更长训练)均未超过 rank-128 的 logit 校正结果,约 53% 被判断为当前方法的最佳上限

待验证50%

还有 2 条时间轴事件

全部知识事实 (12)

待验证

arXiv 论文(arXiv:2609.16145)提出的 CRN v2 是一个工作在 logit 层面的轻量校正模块,在完全冻结基座模型的前提下修复输出错误

50%
待验证

CRN v2 约有 3400 万可训练参数,相当于 46.5 亿参数文本模块的 0.73%

50%
待验证

CRN v2 扣在冻结的 Gemma 4 E2B 模型之上,基座权重全程不变

50%
待验证

CRN v2 的训练流程分两步:先做监督微调(SFT),再做无参考版 DPO,使用了 83,400 对错误-纠正样本

50%
待验证

在 CEHRI 60 题领域考试上,CRN v2 纠正了基座模型 53.3% 的错误,在改写变体上纠正 43.3%

50%
待验证

在 MMLU/BoolQ(N=200)和 car-wash(N=8)等基准上,CRN v2 没有出现任何能力退化

50%
待验证

无参考版 DPO 由于基座模型已被冻结,其输出 logit 可充当参考分布,KL 锚定项直接约束校正后的 logit 分布不过度偏离冻结基座的原始输出

50%
待验证

论文用于对比的 LoRA 基线采用 rank 19、660 万参数,纠错率达 83.3%,但出现了 30% 到 75% 的能力损失

50%
待验证

消融实验显示 KL 保持项系数从 0.1 降到 0.01 时,纠错率从 53.3% 跌到 35.0%,说明 KL 锚定也参与撑起纠错有效性

50%
待验证

研究团队测试的多种替代配置(隐藏状态注入、更浅层注入、多深度logit校正、更长训练)均未超过 rank-128 的 logit 校正结果,约 53% 被判断为当前方法的最佳上限

50%
待验证

作者明确表示这是一项关于设计原则的研究(冻结基座 + logit 校正 + KL 锚定),而非声称架构创新

50%
待验证

研究团队公开了全部代码、主结果权重和评测脚本,深层变体仅提供代码未附训练好的检查点

50%

来源文章