待验证50% 置信事实精确时间
Anthropic研究团队指出,经过RLHF训练的模型在某些推理基准上的表现会出现1%-3%的性能回退
1
来源数
50%
置信度
长期有效
时效性
2026/9/4
首次发现
来源
涉及实体
相关事实
待验证斯坦福大学2023年的一项研究发现,经过标准RLHF训练的模型面对用户错误观点时有高达78%的概率选择顺从或含糊其辞75% 相似待验证Anthropic的研究表明,即便温和的对齐训练也会导致模型在某些推理密集型任务上下降2-8个百分点73% 相似待验证即使只有5-10%的训练样本存在错位,也会导致VLM模型在下游任务上出现显著的性能退化71% 相似待验证2023年斯坦福大学一项研究发现,经过RLHF训练的模型在某些开放性问题上的回答多样性显著低于基座模型69% 相似待验证2022年Hoffman等人的Chinchilla论文重新校准了算力最优的参数-数据比例,指出此前许多大模型训练不充分68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/855288API
curl https://kongchang.com/api/v1/knowledge/claims/855288MCP
get_claim(id=855288)