待验证50% 置信事实精确时间
论文在一个10亿参数模型上用2000亿token的Numeratron数学与Dolma混合语料做训练,展示了中训练损失与RL性能之间的关系
1
来源数
50%
置信度
长期有效
时效性
2026/8/13
首次发现
来源
相关事实
待验证提示词与模型版本存在深度绑定关系,不同版本模型在RLHF训练数据、指令微调策略上的差异会导致相同提示词产生不同输出,这种现象被称为「提示词漂移」70% 相似待验证斯坦福CRFM团队的HELM基准测试发现,经过RLHF对齐的模型在创意写作任务上的词汇多样性指标普遍低于对应的基础预训练模型70% 相似待验证DeepMind的Chinchilla定律证明训练数据量与模型参数量的最优配比会随时间演进而改变,同等FLOP投入可产生能力差异显著的模型70% 相似待验证Claude系列模型与基于o3/o4-mini的Codex由于训练数据来源、RLHF策略、推理架构的差异,会形成不同的认知偏差,使得多模型交叉验证能有效降低Bug率68% 相似待验证规模定律由OpenAI研究员Jared Kaplan等人于2020年系统论证,核心发现是语言模型交叉熵损失与模型参数量、训练数据量、计算量之间存在幂律关系67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/742562API
curl https://kongchang.com/api/v1/knowledge/claims/742562MCP
get_claim(id=742562)