待验证50% 置信事实精确时间
Röttger 等人在 2024 年的系统性评估中发现主流模型误拒率在某些类别中高达 30% 以上
1
来源数
50%
置信度
长期有效
时效性
2026/9/1
首次发现
来源
涉及实体
相关事实
已验证Anthropic在2024年的研究论文中量化了模型过度拒绝现象,发现经过安全训练的模型在某些场景下拒绝率高达15-30%属于误判80% 相似待验证Anthropic在2023年的论文中系统测量了奉承偏差,发现即便在明显错误前提下多数主流模型仍有相当比例的回复选择顺从用户75% 相似待验证2023年的分析显示主流LLM在生成学术引用时的错误率从30%到超过60%不等72% 相似待验证斯坦福大学2023年的研究显示,当时主流LLM对间接提示注入的防御成功率普遍低于30%66% 相似待验证Anthropic的研究显示过度对齐可能导致模型在无害问题上的拒答率从不到1%上升至超过10%66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/837398API
curl https://kongchang.com/api/v1/knowledge/claims/837398MCP
get_claim(id=837398)