Unverified50% confidenceFactExact time
论文在一个10亿参数模型上用2000亿token的Numeratron数学与Dolma混合语料做训练,展示了中训练损失与RL性能之间的关系
1
Sources
50%
Confidence
Long-term
Relevance
8/13/2026
First Seen
Sources
Related Claims
Unverified提示词与模型版本存在深度绑定关系,不同版本模型在RLHF训练数据、指令微调策略上的差异会导致相同提示词产生不同输出,这种现象被称为「提示词漂移」70% similarUnverified斯坦福CRFM团队的HELM基准测试发现,经过RLHF对齐的模型在创意写作任务上的词汇多样性指标普遍低于对应的基础预训练模型70% similarUnverifiedDeepMind的Chinchilla定律证明训练数据量与模型参数量的最优配比会随时间演进而改变,同等FLOP投入可产生能力差异显著的模型70% similarUnverifiedClaude系列模型与基于o3/o4-mini的Codex由于训练数据来源、RLHF策略、推理架构的差异,会形成不同的认知偏差,使得多模型交叉验证能有效降低Bug率68% similarUnverified规模定律由OpenAI研究员Jared Kaplan等人于2020年系统论证,核心发现是语言模型交叉熵损失与模型参数量、训练数据量、计算量之间存在幂律关系67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/742562API
curl https://kongchang.com/api/v1/knowledge/claims/742562MCP
get_claim(id=742562)