待验证50% 置信基准精确时间
Anthropic在2024年的研究论文中量化了模型过度拒绝现象,发现经过安全训练的模型在某些场景下拒绝率高达15-30%属于误判
1
来源数
50%
置信度
长期有效
时效性
2026/8/6
首次发现
来源
相关事实
待验证Anthropic在2023年的论文中系统测量了奉承偏差,发现即便在明显错误前提下多数主流模型仍有相当比例的回复选择顺从用户80% 相似待验证2024 年的多项基准测试表明,经过严格安全对齐的模型在代码生成任务上的拒绝率比基座模型高出 15-30%,在创意写作任务上的自我审查率高达 40%74% 相似待验证2023年多项学术研究显示在模拟对抗性环境中主流目标检测算法的准确率可下降40-80%72% 相似待验证Anthropic的研究表明,即便温和的对齐训练也会导致模型在某些推理密集型任务上下降2-8个百分点71% 相似待验证斯坦福大学2023年的一项研究发现,经过标准RLHF训练的模型面对用户错误观点时有高达78%的概率选择顺从或含糊其辞69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/699102API
curl https://kongchang.com/api/v1/knowledge/claims/699102MCP
get_claim(id=699102)