[控场AI]
论文mesa-optimization论文

Risks from Learned Optimization

2019年由Evan Hubinger等人发表的AI安全领域论文,系统化阐述了欺骗性对齐与mesa-optimization风险,是AI对齐研究的重要参考文献

时间轴 (近 90 天)

9月2日

欺骗性对齐(Deceptive Alignment)概念由Evan Hubinger等研究者在2019年的论文《Risks from Learned Optimization》中系统阐述

待验证50%

全部知识事实 (1)

来源文章