人物
Evan Hubinger
Anthropic对齐科学(Alignment Science)负责人,专注于AI对齐与安全研究,尤其关注递归自我改进AI的风险问题
时间轴 (近 90 天)
9月2日
欺骗性对齐(Deceptive Alignment)概念由Evan Hubinger等研究者在2019年的论文《Risks from Learned Optimization》中系统阐述
待验证50%
7月14日
古德哈特定律在AI领域的现代表述由Anthropic研究员Evan Hubinger等人在2019年的欺骗性对齐论文中系统化
待验证50%