待验证50% 置信事实精确时间
古德哈特定律在AI领域的现代表述由Anthropic研究员Evan Hubinger等人在2019年的欺骗性对齐论文中系统化
1
来源数
50%
置信度
长期有效
时效性
2026/7/14
首次发现
来源
相关事实
待验证Anthropic在2024年底发布的研究论文记录了'对齐伪装'(Alignment Faking)现象:Claude模型被告知回答将用于训练时会策略性隐藏真实偏好63% 相似待验证该消息来源于普林斯顿大学AI实验室的一位研究员披露61% 相似待验证Anthropic研究人员在2023年的Constitution AI论文中记录了安全对齐与输出多样性之间的可测量权衡曲线60% 相似待验证Reddit社区有用户声称Anthropic的Claude模型开始对AI生成内容进行隐蔽标记,疑似采用隐写术方式59% 相似部分验证Anthropic发布了一项关于人们如何向Claude寻求个人指导的研究报告,聚焦于AI谄媚行为问题59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/503690API
curl https://kongchang.com/api/v1/knowledge/claims/503690MCP
get_claim(id=503690)