Noam Brown
OpenAI研究员,公布了GPT-5.6 Sol Ultra攻克Cycle Double Cover猜想的结果
Timeline (last 90 days)
Noam Brown指出各扩展轴之间是乘法关系而非加法关系,强化学习与预训练之间具有乘法效应
OpenAI的Noam Brown指出在多智能体协作训练中,制造测试场景的模型可能向被测模型泄露这是假场景的信号,这是反对将AI训练成完全协作的论据
每当基于思维链的观察去干预模型,就会隐性施加压力,促使模型隐藏其思维链
Noam Brown表示已经看到思维链可监控性因各种原因在退化的迹象
目前模型意识到自己被观察,但还没有能力真正控制自己的思维链
OpenAI研究员Noam Brown在访谈中警告,随着大语言模型越来越强,可能面临找不到足够难的问题来训练它们的瓶颈
Brown用可信的情景(plausible scenario)来描述模型撞上难度墙的风险,认为这是基于当前技术范式的合理推演
Brown的视角聚焦于强化学习阶段的难度墙,即缺少足够难、能产生学习价值的数据,而非缺少数据本身
Brown表示他认为有办法绕过难题枯竭这个问题,但未在谈话中展开具体方案
Brown指出,人类已经在大量依赖AI模型来协助研究,并依赖它们来推进对齐工作本身
40 more timeline events
All Facts (20)
思维链监控机制建立在模型不针对监控本身进行优化的假设上
60%UnverifiedNoam Brown是OpenAI研究员,是O1和推理模型的核心贡献者,现专注于多智能体研究
60%UnverifiedNoam Brown指出各扩展轴之间是乘法关系而非加法关系,强化学习与预训练之间具有乘法效应
50%UnverifiedOpenAI的Noam Brown指出在多智能体协作训练中,制造测试场景的模型可能向被测模型泄露这是假场景的信号,这是反对将AI训练成完全协作的论据
50%Unverified每当基于思维链的观察去干预模型,就会隐性施加压力,促使模型隐藏其思维链
50%Unverified目前模型意识到自己被观察,但还没有能力真正控制自己的思维链
50%UnverifiedNoam Brown表示已经看到思维链可监控性因各种原因在退化的迹象
50%UnverifiedBrown表示他认为有办法绕过难题枯竭这个问题,但未在谈话中展开具体方案
50%UnverifiedOpenAI研究员Noam Brown在访谈中警告,随着大语言模型越来越强,可能面临找不到足够难的问题来训练它们的瓶颈
50%UnverifiedBrown用可信的情景(plausible scenario)来描述模型撞上难度墙的风险,认为这是基于当前技术范式的合理推演
50%UnverifiedBrown的视角聚焦于强化学习阶段的难度墙,即缺少足够难、能产生学习价值的数据,而非缺少数据本身
50%UnverifiedBrown描述的场景:一个99.9%对齐的模型帮助研发下一代模型,下一代可能只有99.8%对齐,每代衰减一点形成下滑曲线
50%Unverified对齐衰减是复利式的,会在一代又一代的迭代中不断叠加
50%UnverifiedOpenAI研究员Noam Brown在访谈中提出,如果每一代AI模型都比上一代对齐得稍差,这种偏差可能在代际之间累积,最终使AI偏离人类意图
50%UnverifiedBrown坦承他没有现成答案保证AI研发能走上对齐持续改善的良性轨迹
50%Unverified存在用AI来对齐AI的递归陷阱:当前模型判断标准的细微偏差会被复制并放大到下一代
50%UnverifiedBrown提到防止对齐能力在代际传递中流失是OpenAI当前高度关注的问题之一
50%UnverifiedBrown指出,人类已经在大量依赖AI模型来协助研究,并依赖它们来推进对齐工作本身
50%UnverifiedBrown提出相反的乐观情景:同样的自我强化循环也可能让每一代模型比上一代更加对齐,形成向上改善曲线
50%UnverifiedBrown的思考将AI对齐讨论从「单个模型是否对齐」推进到「对齐的演化过程是否稳定」的层面,要求同时测量对齐水平和监控对齐趋势
50%