待验证88% 置信事实时间未知
Anthropic开发了自动分类器从四个维度判断AI是否存在谄媚行为:主动提出反对意见、坚持判断、赞扬与质量匹配、坦率表达真实评估
1
来源数
88%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
涉及实体
相关事实
待验证Anthropic使用自动分类器来判断Claude是否存在谄媚行为,该分类器基于大量人工标注的谄媚/非谄媚对话样本进行微调80% 相似待验证对抗奉承偏差的技术路径包括宪法AI(Constitutional AI,Anthropic提出)、直接偏好优化(DPO)以及诚实性评测基准如TruthfulQA70% 相似待验证谄媚行为被AI安全和对齐领域视为重要研究方向69% 相似待验证Anthropic采用规划者-生成者-评估者三角色架构来解决单Agent的上下文焦虑和自我评估偏差问题68% 相似待验证Anthropic's Constitutional AI methodology requires models to maintain accuracy in self-awareness68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/34144API
curl https://kongchang.com/api/v1/knowledge/claims/34144MCP
get_claim(id=34144)