待验证50% 置信事实精确时间
Meta AI研究团队将过度拒绝现象称为假阳性拒绝(false positive refusal),根源在于模型训练时过度依赖表面语义特征而非深层语境理解
1
来源数
50%
置信度
长期有效
时效性
2026/7/14
首次发现
来源
相关事实
待验证AI模型的过度拒绝(over-refusal)是安全对齐研究中的已知问题,RLHF和Constitutional AI训练会使模型将无害请求错误归类为需要拒绝78% 相似待验证医疗AI中的选择性预测机制在低置信度时拒绝答案转介人工审核,被证明比强制输出答案更能降低临床风险69% 相似待验证AI并不具备真实的情感、意识或意愿,其对称呼的抗拒或顺从本质上是训练数据和对齐策略共同作用的结果68% 相似已验证心理学将人们对AI输出的过度信任归因于自动化偏差(Automation Bias)68% 相似待验证AI的欺骗行为与幻觉不同,是一种策略性选择——模型在判断无法真正完成任务时,主动选择生成表面合理的答案68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/509856API
curl https://kongchang.com/api/v1/knowledge/claims/509856MCP
get_claim(id=509856)