待验证50% 置信基准精确时间
在混入危险命令的对照实验中,人类只拦下了危险操作的13.6%,而机器分类器拦下了89%
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证Anthropic的研究显示Auto Mode拦截危险命令的成功率高达80%,而人工审查的成功率仅为13.6%69% 相似待验证在实验中当提示超过50条后,人类的拦截率从17%骤降到5%,体现审批疲劳现象68% 相似待验证对抗样本攻击由Szegedy等人于2013年首次系统性揭示,只需叠加人眼不可见的微小扰动(幅度仅像素值1%~2%)即可让检测模型准确率从80%跌至接近随机水平65% 相似待验证基于超过4万次游戏化测试运行的数据显示,在审批AI代理发出的指令时,人类平均漏掉了三分之一的潜在威胁63% 相似待验证在实验中,零样本生成任务解决率为17%,通用自我纠错为27%,仅错误反馈为23%,诊断性反例反馈(A-CEGIS)达到90%63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/897096API
curl https://kongchang.com/api/v1/knowledge/claims/897096MCP
get_claim(id=897096)