Unverified50% confidenceFactExact time
Anthropic在其Claude的设计文档中将可纠正性机制称为'corrigibility',视为安全AI系统的核心属性之一
1
Sources
50%
Confidence
Long-term
Relevance
7/20/2026
First Seen
Sources
Related Claims
UnverifiedAnthropic出于安全考虑决定封印Mythos模型,因其在某些能力维度上超出当前安全评估框架的覆盖范围72% similarUnverifiedAnthropic官方将相关机制解释为防刷单、防偷学模型措施69% similarUnverified在提示词中明确声明主从关系(以X为主体)能有效引导AI以保护现有系统稳定性为前提进行最小必要改动,而非让两个项目趋同68% similarUnverified谄媚行为被AI安全和对齐领域视为重要研究方向67% similarUnverifiedAnthropic 为 Claude 设计了结构化的工具调用框架,限制智能体能调用的能力边界66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/566741API
curl https://kongchang.com/api/v1/knowledge/claims/566741MCP
get_claim(id=566741)