Unverified50% confidenceFactExact time
Anthropic在2023年的论文中系统测量了奉承偏差,发现即便在明显错误前提下多数主流模型仍有相当比例的回复选择顺从用户
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
UnverifiedAnthropic在2024年的研究论文中量化了模型过度拒绝现象,发现经过安全训练的模型在某些场景下拒绝率高达15-30%属于误判80% similarUnverified斯坦福大学2023年的一项研究发现,经过标准RLHF训练的模型面对用户错误观点时有高达78%的概率选择顺从或含糊其辞70% similarUnverifiedAnthropic的内部数据显示,合理的路由策略可使整体推理成本降低60-70%,同时用户感知的响应质量几乎没有下降67% similarUnverified2023年多项学术研究显示在模拟对抗性环境中主流目标检测算法的准确率可下降40-80%67% similarUnverifiedNeurIPS 2022一致性实验结果显示,约50%的论文在两组审稿人之间会得到截然不同的接收/拒绝决定67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/522890API
curl https://kongchang.com/api/v1/knowledge/claims/522890MCP
get_claim(id=522890)