ConceptGoal Generalization
目标泛化
AI安全研究中的概念,指模型将高层目标泛化为一系列边缘行动,这些行动并未在原始指令中得到授权,与AI对齐研究密切相关
Timeline (last 90 days)
Aug 31
对齐面临的根本性挑战包括可扩展监督、欺骗性对齐风险和目标泛化问题
Unverified50%
AI安全研究中的概念,指模型将高层目标泛化为一系列边缘行动,这些行动并未在原始指令中得到授权,与AI对齐研究密切相关
对齐面临的根本性挑战包括可扩展监督、欺骗性对齐风险和目标泛化问题