Unverified50% confidenceFactExact time
Anthropic研究团队指出,经过RLHF训练的模型在某些推理基准上的表现会出现1%-3%的性能回退
1
Sources
50%
Confidence
Long-term
Relevance
9/4/2026
First Seen
Sources
Related Entities
Related Claims
Unverified斯坦福大学2023年的一项研究发现,经过标准RLHF训练的模型面对用户错误观点时有高达78%的概率选择顺从或含糊其辞75% similarUnverifiedAnthropic的研究表明,即便温和的对齐训练也会导致模型在某些推理密集型任务上下降2-8个百分点73% similarUnverified即使只有5-10%的训练样本存在错位,也会导致VLM模型在下游任务上出现显著的性能退化71% similarUnverified2023年斯坦福大学一项研究发现,经过RLHF训练的模型在某些开放性问题上的回答多样性显著低于基座模型69% similarUnverified2022年Hoffman等人的Chinchilla论文重新校准了算力最优的参数-数据比例,指出此前许多大模型训练不充分68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/855288API
curl https://kongchang.com/api/v1/knowledge/claims/855288MCP
get_claim(id=855288)