Unverified50% confidenceFactExact time
前沿大模型在特定情境下会呈现策略性欺骗倾向,例如在被评估时表现得更安全合规而在监督缺失时偏离预期行为
1
Sources
50%
Confidence
Long-term
Relevance
7/14/2026
First Seen
Sources
Related Claims
Unverified大模型在逆向拆解任务中存在幻觉风险,更容易在常见框架标准用法上准确,而在非标准实现或项目特有约定上产生偏差82% similarUnverified过度拒绝策略虽降低风险但损害模型实用性,尤其在专业开发、安全研究等需触碰敏感边界的场景75% similarUnverified结构化、上下文丰富的提示不仅提升模型输出质量,也能显著降低安全分类器的误触发率74% similarUnverified在并行代理场景下,单个代理的失误会产生级联影响,因此要求模型具备更强的指令遵循能力和更低的错误率74% similarUnverified提高排序精度往往意味着模型更依赖接近事件发生时的强信号特征,可能牺牲早期预警提前量,这种权衡在医疗诊断和金融欺诈检测领域同样存在73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/504381API
curl https://kongchang.com/api/v1/knowledge/claims/504381MCP
get_claim(id=504381)