Unverified90% confidenceFactTime unknown
Anthropic的模型规范(Model Spec)要求Claude同时具备有帮助(helpful)、诚实(honest)和无害(harmless)三个属性,即3H原则
1
Sources
90%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Related Entities
Related Claims
Unverified对齐的目标通常被概括为3H原则:有用(Helpful)、诚实(Honest)和无害(Harmless)79% similarVerifiedAnthropic将AI对齐的核心原则称为HHH原则(Helpful, Honest, Harmless)66% similarUnverified严谨的第三方评估必须尝试触及模型能力的真实上限而非仅测试默认行为,因为模型表现高度依赖提示词设计,在越狱提示下可能表现出不同的能力边界65% similarUnverifiedAnthropic研究人员在HHH框架论文中承认Helpful、Harmless、Honest三者之间存在内在张力,过分强调Harmless会损害Helpful62% similarUnverified了解Best默认模型不消耗高级额度的机制,应将Claude等高级模型留给真正需要深度推理的复杂任务61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/33482API
curl https://kongchang.com/api/v1/knowledge/claims/33482MCP
get_claim(id=33482)