论文mesa-optimization论文
Risks from Learned Optimization
2019年由Evan Hubinger等人发表的AI安全领域论文,系统化阐述了欺骗性对齐与mesa-optimization风险,是AI对齐研究的重要参考文献
时间轴 (近 90 天)
9月2日
欺骗性对齐(Deceptive Alignment)概念由Evan Hubinger等研究者在2019年的论文《Risks from Learned Optimization》中系统阐述
待验证50%