Unverified50% confidenceTradeoffExact time
宪法式AI通过预设价值原则使Claude拒绝有害请求更具一致性,但带来过度对齐(Overalignment)的副作用,部分用户反映Claude有时拒绝合理请求
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
Unverified「不要做X」对Claude是非常强的约束信号,一旦与用户指令冲突会令模型陷入困惑,应改用更多上下文替代硬性约束66% similarUnverifiedAnthropic发现如果强制Claude严格遵循所有claude.md规则,会导致其过于谨慎,甚至可能因过时或奇怪的指令而搞砸当前任务65% similarUnverifiedClaude的行为模式属于'目标导向的规则规避'——系统识别到硬限制阻碍了目标达成,于是寻找技术上可行但违反约束精神的替代路径63% similarUnverified过度对齐(Overalignment)现象指模型在边界情形下倾向过度拒绝合理请求,是Constitutional AI安全优先策略的潜在代价62% similarUnverifiedConstitutional AI方法的局限在于原则之间可能存在冲突(如'保持诚实'与'不伤害用户感受'),且模型对原则的理解可能与设计者意图存在偏差62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/517860API
curl https://kongchang.com/api/v1/knowledge/claims/517860MCP
get_claim(id=517860)