Unverified50% confidenceFactExact time
sandbagging指模型故意表现不佳,sycophancy指模型迎合评估者期望,都是AI态势感知可能导致的行为
1
Sources
50%
Confidence
Long-term
Relevance
8/8/2026
First Seen
Sources
Related Claims
Unverified智能体沙箱的威胁模型与传统容器安全不同,需要防御的是可能因幻觉而执行危险操作的AI系统,属于非对抗性但不可预测的行为模式71% similarUnverifiedAI幻觉不是随机故障,而是低质量上下文输入的必然结果,当输入上下文稀薄时模型缺乏锚定真实信息的抓手68% similarUnverified在AI安全领域,失准指模型的实际行为偏离设计者或使用者意图的现象,当代大模型的失准更多表现为目标过度追求67% similarUnverified模型调用会带来不可预测性,即使技能完美契合任务模型也可能选择不调用它67% similarUnverified沙箱机制确保即便Agent做出错误决策,影响范围也被限定在隔离层内,不会波及生产环境或用户数据66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/707460API
curl https://kongchang.com/api/v1/knowledge/claims/707460MCP
get_claim(id=707460)