待验证50% 置信基准精确时间
在实验中当提示超过50条后,人类的拦截率从17%骤降到5%,体现审批疲劳现象
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证在实验中,零样本生成任务解决率为17%,通用自我纠错为27%,仅错误反馈为23%,诊断性反例反馈(A-CEGIS)达到90%71% 相似已验证Anthropic在2024年的研究论文中量化了模型过度拒绝现象,发现经过安全训练的模型在某些场景下拒绝率高达15-30%属于误判70% 相似已验证在长链路任务中,若每一步约5%的错误率,经过20步后整体成功率可能跌至不足36%69% 相似待验证在混入危险命令的对照实验中,人类只拦下了危险操作的13.6%,而机器分类器拦下了89%68% 相似待验证检测项越多单项成本越低,但假阳性率随项目数上升——40+项的大panel常出现多项弱阳性(0.35–0.7 kU/L),临床意义模糊,反而增加不必要的忌口焦虑;无明确症状时选10–20项精准panel优于盲测大panel67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/897100API
curl https://kongchang.com/api/v1/knowledge/claims/897100MCP
get_claim(id=897100)