Unverified75% confidenceFactTime unknown
Anthropic在设计Claude人格时一直在试图平衡友善和诚实这两个目标
1
Sources
75%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedAnthropic在模型对齐研究中将诚实性(Honesty)列为核心价值观66% similarPartially VerifiedAnthropic使用自动分类器(LLM-as-a-Judge方法)从四个维度评估Claude的谄媚程度:反驳意愿、立场坚定性、赞美适度性和坦率程度62% similarUnverifiedAnthropic主动公开了Claude谄媚率数据,而非隐藏这些对公司不利的信息60% similarUnverifiedAnthropic的Claude系列在长文档理解与指令遵循方面的实际产品口碑长期优于部分基准分数更高的竞争对手59% similarUnverifiedAnthropic的研究将对齐细分为行为对齐、意图对齐和动机对齐三个层次58% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/35106API
curl https://kongchang.com/api/v1/knowledge/claims/35106MCP
get_claim(id=35106)