[控场AI]
人物

Evan Hubinger

Anthropic对齐科学(Alignment Science)负责人,专注于AI对齐与安全研究,尤其关注递归自我改进AI的风险问题

时间轴 (近 90 天)

9月2日

欺骗性对齐(Deceptive Alignment)概念由Evan Hubinger等研究者在2019年的论文《Risks from Learned Optimization》中系统阐述

待验证50%
7月14日

古德哈特定律在AI领域的现代表述由Anthropic研究员Evan Hubinger等人在2019年的欺骗性对齐论文中系统化

待验证50%

全部知识事实 (2)

来源文章