待验证85% 置信事实精确时间
Anthropic在模型对齐研究中将诚实性(Honesty)列为核心价值观
1
来源数
85%
置信度
长期有效
时效性
2026/5/29
首次发现
来源
Claude Opus 4.8深度解析:判断力、诚实度与性价比全面评测
bilibili程序员晓刘2026/5/29
涉及实体
相关事实
待验证Anthropic将新一代模型对齐目标表述为培养诚实且有建设性的不同意(honest and constructive disagreement)73% 相似待验证Anthropic强调Constitutional AI中的无害性和诚实性原则,OpenAI的标注指南侧重有用性与流利度69% 相似待验证Anthropic作为Claude的开发方,一直强调AI的有益、诚实、无害三原则67% 相似待验证Anthropic是最早公开将模型福利纳入研究方向的AI实验室之一,其2023年发布的研究方向文档明确提到需要考虑模型是否可能具有某种形式的道德地位66% 相似待验证Anthropic在设计Claude人格时一直在试图平衡友善和诚实这两个目标66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/1556API
curl https://kongchang.com/api/v1/knowledge/claims/1556MCP
get_claim(id=1556)