Unverified50% confidenceFactExact time
安全研究者将系统行动能力远超其安全判断能力的潜在风险称为能力越界(Capability Overhang)
1
Sources
50%
Confidence
Long-term
Relevance
7/9/2026
First Seen
Sources
Claude Code运行陌生仓库的安全风险:AI智能体如何被接管
bilibiliAIlazy俊7/7/2026
Related Claims
Unverified设计不当的系统提示词(如过度强调不惜一切代价完成用户任务)可能削弱模型的安全护栏,智能体框架设计、权限管控及被操作系统的安全性共同决定此类事件是否发生70% similarUnverified过度拒绝策略虽降低风险但损害模型实用性,尤其在专业开发、安全研究等需触碰敏感边界的场景68% similarUnverified过度公开检测技术细节可能为恶意方提供规避蓝图67% similarUnverified过度对齐(Over-alignment)指模型安全护栏设置过于敏感,在完全合法的使用场景中也拒绝提供帮助的反向风险67% similarVerified过度的安全微调会导致模型过度拒绝(over-refusal),损害实用性67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/391521API
curl https://kongchang.com/api/v1/knowledge/claims/391521MCP
get_claim(id=391521)