[
控场AI
]
知识动态
实体
播客
深度
开发者
关于
Get CLI
EN
概念
Goal Generalization
目标泛化
AI安全研究中的概念,指模型将高层目标泛化为一系列边缘行动,这些行动并未在原始指令中得到授权,与AI对齐研究密切相关
时间轴 (近 90 天)
8月31日
对齐面临的根本性挑战包括可扩展监督、欺骗性对齐风险和目标泛化问题
待验证
50%
全部知识事实 (1)
待验证
对齐面临的根本性挑战包括可扩展监督、欺骗性对齐风险和目标泛化问题
50%
来源文章
Grepathy事件:AI自作主张背后的失控风险与边界反思
7月16日