待验证50% 置信基准精确时间
经过训练的 4B 参数模型在反例生成任务上超越了所有参与评测的 7B 开源数学专用模型,并与六个前沿商用 API 保持竞争力
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/5
首次发现
有效期至:2027/1/3
来源
涉及实体
相关事实
待验证基座模型是在大规模数据上完成预训练但未经特定任务微调的原始版本,保留最完整的参数空间与泛化潜力72% 相似待验证对一个4B参数的小模型进行任务特定的强化学习,使其映射推理准确率提升了15.7个百分点71% 相似已验证对于训练数据不足的小众领域,大模型会倾向于幻觉式补全,生成看似合理但实际错误的API调用、参数名或返回结构69% 相似待验证选择 4B 规模基础模型是为了在承载复杂分类逻辑与控制微调推理算力开销之间取得权衡69% 相似待验证使用Gemma 4系列模型验证了模型权重与Harness状态的联合学习效果,发现单独的监督微调和离线强化学习预热都不能让模型取得里程碑进展,只有联合学习循环才能产生持续提升69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/975477API
curl https://kongchang.com/api/v1/knowledge/claims/975477MCP
get_claim(id=975477)