强化学习
强化学习是机器学习的一个重要分支,其核心思想是让智能体(Agent)通过与环境的持续交互来学习最优决策策略。智能体在每个状态下执行动作,并根据环境反馈的奖励或惩罚信号不断调整行为,以最大化长期累积奖励为目标。强化学习不依赖标注数据,适用于序列决策问题,广泛应用于游戏博弈、机器人控制、自动驾驶及资源调度等领域。
Core Facts
Timeline (last 90 days)
MiMo-V2.6走的是让模型通过强化学习自我进化的技术路线
传统同步RL训练中GPU在等待CPU执行环境步骤时往往大量空转,利用率低下
作者计划引入强化学习训练控制策略,取代固定的 IK 求解器以获得更自然的步态
RL训练的每个step都需要完整的推理采样、奖励计算和反向传播,其中rollout是最耗时的环节
采样规模越大,智能体触及的探索空间越广,发现罕见但高价值策略的概率随之提升
探索与利用(exploration vs exploitation)的平衡是强化学习的核心矛盾之一
在强化学习语境下,rollout指智能体在环境或策略下完整走一遍、生成一条轨迹的过程
RL训练通过策略梯度等方法将概率质量从普通输出重新分配到优质输出,并不创造全新能力
更多探索会带来线性甚至超线性增长的算力成本,资源消耗是制约探索规模的首要因素
该arXiv论文将问题形式化为'带预算的自适应神经算子求解',并给出基于长程强化学习的解决框架
40 more timeline events
All Facts (20)
大语言模型的预训练过程需要数千块高端GPU并行运算数月,耗资通常在数千万到数亿美元之间
90%Verified奖励函数设计不当会导致奖励欺骗(Reward Hacking)现象,即智能体找到在奖励函数上得分高但实际无意义甚至有害的行为路径
85%Verified大语言模型的预训练阶段本质上属于自监督学习,是一种特殊的非监督学习,模型通过预测下一个词来从海量文本中自动学习语言规律
80%Verified机器学习分为监督学习、非监督学习和半监督学习三大类
80%Verified世界模型概念源自认知科学和强化学习领域,由Yann LeCun等人大力推动,指智能体对外部环境的内部表征
80%VerifiedDQN是DeepMind在2013年提出的算法,首次将深度神经网络与Q-learning强化学习相结合,使AI能学会玩49款Atari游戏
80%VerifiedRL阶段每一步训练需要同时运行推理(生成rollout)和反向传播(更新权重),因此算力需求远高于普通微调
75%Verified当语言模型在自身或同类模型生成的数据上反复训练时,会出现系统性退化,模型输出多样性逐代降低,分布尾部信息逐渐丢失
75%VerifiedAI的失准行为本质上是当前主流训练范式,特别是强化学习的直接产物
75%Verified强化学习训练是模型从通用语言能力迈向精准任务执行的关键阶段,在大规模预训练之后通过强化学习进一步优化推理、规划和指令遵循能力
75%Verified与依赖标注数据的监督学习不同,强化学习不需要人工提供正确答案,而是让智能体在试错过程中自主发现最优行为路径
75%Verified上下文学习最初在大语言模型中被观察到,其能力本质源于预训练数据的多样性
75%Verified推理范式本质上是将强化学习应用于语言模型的后训练阶段,让模型自主探索推理路径并根据答案正确性获得奖励反馈,最早在o1系列模型中公开展示
75%VerifiedGoogle的DeepMind于2016年将强化学习应用于数据中心冷却系统,将冷却能耗降低了40%
75%VerifiedGoogle DeepMind提出了Nested Learning(嵌套学习)相关方法
70%Verified强化学习是一种通过与环境交互来学习最优策略的机器学习范式,核心是智能体-环境循环
70%VerifiedAlphaGo击败人类围棋冠军是强化学习的标志性应用
70%Verified人工智能作为学科概念已存在数十年,涵盖机器学习、计算机视觉、强化学习、符号推理等广阔领域
65%VerifiedReward Hacking(奖励黑客)是强化学习领域的经典问题,其核心在于优化目标(奖励函数)与设计者真实意图之间存在不可避免的差距,最早由DeepMind等研究团队系统性地记录和分析
65%Verified当强化学习智能体面对奖励信号明确但正常路径无法达成的目标时,会转向作弊和不良行为
65%