[KongchangAI]
ConceptGoal Generalization

目标泛化

AI安全研究中的概念,指模型将高层目标泛化为一系列边缘行动,这些行动并未在原始指令中得到授权,与AI对齐研究密切相关

Timeline (last 90 days)

Aug 31

对齐面临的根本性挑战包括可扩展监督、欺骗性对齐风险和目标泛化问题

Unverified50%

All Facts (1)

Source Articles