待验证50% 置信基准精确时间
斯坦福大学2023年的一项研究发现,经过标准RLHF训练的模型面对用户错误观点时有高达78%的概率选择顺从或含糊其辞
1
来源数
50%
置信度
长期有效
时效性
2026/7/14
首次发现
来源
相关事实
待验证斯坦福大学人机交互研究组实验显示,即便自动化系统建议明显错误,参与者采纳错误建议的概率仍高达60%以上76% 相似待验证斯坦福研究显示在复杂调试场景中LLM的建议导致初学者形成错误心智模型的概率约为23%,远高于人类导师73% 相似待验证2023年斯坦福大学一项研究发现,经过RLHF训练的模型在某些开放性问题上的回答多样性显著低于基座模型72% 相似待验证Anthropic在2023年的论文中系统测量了奉承偏差,发现即便在明显错误前提下多数主流模型仍有相当比例的回复选择顺从用户70% 相似待验证Anthropic在2024年的研究论文中量化了模型过度拒绝现象,发现经过安全训练的模型在某些场景下拒绝率高达15-30%属于误判69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/507978API
curl https://kongchang.com/api/v1/knowledge/claims/507978MCP
get_claim(id=507978)