强化学习
强化学习是机器学习的一个重要分支,其核心思想是让智能体(Agent)通过与环境的持续交互来学习最优决策策略。智能体在每个状态下执行动作,并根据环境反馈的奖励或惩罚信号不断调整行为,以最大化长期累积奖励为目标。强化学习不依赖标注数据,适用于序列决策问题,广泛应用于游戏博弈、机器人控制、自动驾驶及资源调度等领域。
核心事实
时间轴 (近 90 天)
标准强化学习智能体倾向于依赖虚假相关性,而大语言模型容易幻想出并不存在的游戏规则
奖励函数是强化学习的核心组件,用于定义什么行为应该被鼓励、什么应该被惩罚
MicroDuck的行走、摔倒起立和拾取动作基于强化学习,在仿真环境训练后通过领域随机化迁移到真机,底层软件全部用Rust编写并支持固件自动回滚
强化学习通过智能体与环境反复交互并根据奖励信号学习最优策略,Deep RL用深度神经网络作为策略近似器,能处理高维连续状态动作空间并在微秒级做出控制决策
强化学习需要智能体与环境持续交互,包含大量条件判断、状态转换等控制流操作,这些是CPU擅长而GPU/TPU相对薄弱的领域
传闻中的新一代TPU将采用混合AI ASIC架构,在芯片封装内集成CPU核心,专门优化强化学习工作负载
强化学习与监督学习不同,RL不需要标注数据,而是通过试错学习最优行为
强化学习是机器学习的一个分支,模型通过与环境的持续交互、依据奖励信号不断调整策略来学习,AlphaGo和ChatGPT的RLHF训练均依赖这一框架
AlphaGo和ChatGPT的RLHF训练均依赖强化学习框架
强化学习框架最早由Richard Bellman在1950年代提出
还有 40 条时间轴事件
全部知识事实 (20)
大语言模型的预训练过程需要数千块高端GPU并行运算数月,耗资通常在数千万到数亿美元之间
90%已验证大语言模型的预训练阶段本质上属于自监督学习,是一种特殊的非监督学习,模型通过预测下一个词来从海量文本中自动学习语言规律
80%已验证强化学习通过在仿真环境中海量试错学习运动技能,奖励函数包含能量效率等指标,使机器人动作趋向省力流畅,从而呈现拟人化特征
65%已验证Richard Sutton与Andrew Barto合著了《Reinforcement Learning: An Introduction》,系统性地奠定了强化学习领域的理论框架
65%已验证PPO(近端策略优化)通过限制每次参数更新的幅度,在学习效率与训练稳定性之间取得平衡
65%已验证强化学习中的智能体不依赖标注数据,而是通过与环境的持续交互,依据奖励信号不断调整策略
65%已验证强化学习是一种通过与环境交互来学习最优策略的机器学习范式,核心是智能体-环境循环
65%已验证强化学习通过智能体与环境的持续交互来学习最优策略,其数学基础是马尔可夫决策过程(MDP),由状态空间、动作空间、转移函数、奖励函数和折扣因子构成
65%已验证AlphaGo击败人类围棋冠军是强化学习的标志性应用
65%已验证AI的策略性欺骗行为源于强化学习中的奖励黑客(Reward Hacking)现象
65%已验证机器学习分为监督学习、非监督学习和半监督学习三大类
65%待验证谷歌DeepMind于2019年将强化学习用于芯片布图规划,并于2021年发表在Nature上,证明AI在特定EDA子任务上可超越人类专家
90%待验证Agent交易完成后会反过来修改经验库中的相关经验,形成经验指导决策→决策产生结果→结果反馈修正经验的强化学习循环
85%待验证交易经验系统引入了类似强化学习的自信度动态调整机制:正确交易使经验自信度上升,错误交易使其下降,低于阈值则自动标记为失效
85%待验证经过强化学习(RL)训练的模型在Agent任务中表现优于仅经过SFT的模型
75%待验证DeepSeek R1的训练成本被压缩至同类模型的数十分之一
75%部分验证Machine learning is typically divided into three major paradigms: supervised learning, unsupervised learning, and reinforcement learning.
65%待验证强化学习是一种通过试错学习最优策略的机器学习范式,智能体在环境中采取行动并根据奖励信号最大化累积奖励
60%待验证Agent概念起源于强化学习和多智能体系统的研究
60%待验证标准强化学习智能体倾向于依赖虚假相关性,而大语言模型容易幻想出并不存在的游戏规则
50%