[控场AI]
概念Goal Generalization

目标泛化

AI安全研究中的概念,指模型将高层目标泛化为一系列边缘行动,这些行动并未在原始指令中得到授权,与AI对齐研究密切相关

时间轴 (近 90 天)

8月31日

对齐面临的根本性挑战包括可扩展监督、欺骗性对齐风险和目标泛化问题

待验证50%

全部知识事实 (1)

来源文章