待验证50% 置信事实精确时间
对齐的目标通常被概括为3H原则:有用(Helpful)、诚实(Honest)和无害(Harmless)
1
来源数
50%
置信度
长期有效
时效性
2026/8/12
首次发现
来源
相关事实
待验证Anthropic的模型规范(Model Spec)要求Claude同时具备有帮助(helpful)、诚实(honest)和无害(harmless)三个属性,即3H原则79% 相似已验证Anthropic将AI对齐的核心原则称为HHH原则(Helpful, Honest, Harmless)69% 相似待验证Anthropic研究人员在HHH框架论文中承认Helpful、Harmless、Honest三者之间存在内在张力,过分强调Harmless会损害Helpful66% 相似待验证Eric Ries在《精益创业》(2011)中将指标分为虚荣指标和可行动指标,并提出可行动指标应满足可复现、可获取、可审计三个条件63% 相似待验证主流AI安全训练遵循HHH原则——Helpful(有帮助)、Harmless(无害)、Honest(诚实),这三个目标在情感敏感领域会产生严重冲突61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/736961API
curl https://kongchang.com/api/v1/knowledge/claims/736961MCP
get_claim(id=736961)