[控场AI]

#强化学习

共 60 篇相关文章

为什么更多数据无法替代先验结构:Alexander Mattick深度访谈
·9 分钟

为什么更多数据无法替代先验结构:Alexander Mattick深度访谈

德国研究者Alexander Mattick在MLST访谈中深度剖析为何更多数据无法替代先验结构。涵盖推理演化史、能量模型是否过时、扩散与流匹配、深度学习理论、约束强化学习与世界模型的现实边界,系统反驳Sutton的奖励与苦涩教训论断。

阅读全文 →
双足机器人仿真到现实迁移:Sim-to-Real难题全记录
·5 分钟

双足机器人仿真到现实迁移:Sim-to-Real难题全记录

一位开发者分享双足行走机器人最新进展,深入探讨仿真到现实(Sim-to-Real)迁移难题,对比Genesis、MuJoCo与Isaac Lab三款仿真器的摩擦接触差异,以及强化学习机器人开发中的真实工程困境。

阅读全文 →
AI攻克不完全信息博弈:DeepNash如何征服军棋Stratego
·4 分钟

AI攻克不完全信息博弈:DeepNash如何征服军棋Stratego

军棋Stratego因大部分信息隐藏,长期成为AI难以攻克的不完全信息博弈。本文解析DeepNash如何借助纳什均衡与强化学习征服这一难题,及其对现实世界决策问题的意义。

阅读全文 →
一个仓库两种循环:哪个才是真正的RL?
·5 分钟

一个仓库两种循环:哪个才是真正的RL?

reef 项目在同一代码库中实现了两种循环:不训练任何参数的 harness 配置搜索,以及真正更新模型权重的在线 RL。本文解析两者区别,并给出判断「这是不是真 RL」的实用标准。

阅读全文 →
当AI学会"投机取巧":对话幽默训练中的奖励漏洞与对策
·5 分钟

当AI学会"投机取巧":对话幽默训练中的奖励漏洞与对策

arXiv最新研究揭示训练语言模型生成对话幽默时的奖励漏洞:乱序文本和笑声线索如何骗过自动奖励,以及流畅度过滤、笑声归一化等对策为何顾此失彼,为AI奖励设计与对齐提供深刻启示。

阅读全文 →
Clef开源决策模型与RL微调平台解析
·4 分钟

Clef开源决策模型与RL微调平台解析

Clef发布开源决策模型与RL强化学习微调平台,聚焦AI决策优化场景。本文解析决策模型的价值、RL微调平台的意义及其对AI工程化落地的启示。

阅读全文 →
RLTL;DR:让AI从失败中总结经验实现自我提升
·5 分钟

RLTL;DR:让AI从失败中总结经验实现自我提升

RLTL;DR提出一种让AI从失败中自我提升的新方法:在每次失败尝试后,让模型根据验证器输出写出一条TL;DR式洞见,并用它指导下一轮尝试,破解了强化学习在零成功样本场景下的困境。

阅读全文 →
用Nuzlocke数据训练强化学习:一个被忽视的RL环境富矿
·4 分钟

用Nuzlocke数据训练强化学习:一个被忽视的RL环境富矿

Reddit上一个小众但有趣的想法:用宝可梦Nuzlocke玩法数据训练强化学习环境。本文分析为何Emerald Kaizo等硬核改版配合玩家输入记录,是构建RL训练环境的理想素材。

阅读全文 →
评估与强化学习环境:AI落地的关键挑战
·4 分钟

评估与强化学习环境:AI落地的关键挑战

来自 Snorkel AI 的晚宴对话深入探讨 AI 模型评估(evals)与强化学习环境(RL environments)的核心挑战:奖励设计、公平性归因、长周期评估、锯齿状智能,以及数据供应的杠铃结构。

阅读全文 →
用强化学习训练AI赛车:一款让你当AI教练的赛车游戏
·3 分钟

用强化学习训练AI赛车:一款让你当AI教练的赛车游戏

一款独立开发的AI赛车游戏让玩家用强化学习训练AI模型来驾驶赛车,采用专家模型加决策模型的分层架构,新手到硬核玩家均可参与,目前正公开招募测试者。

阅读全文 →
强化学习AI挑战《东方Project》:24小时直播训练的启示
·4 分钟

强化学习AI挑战《东方Project》:24小时直播训练的启示

一个在YouTube 24小时直播的强化学习AI正在挑战弹幕游戏《东方Project》风神录。本文解析RL智能体从零学习的过程、机器与人类在游戏中的优势差异,以及游戏作为AI研究试验场的意义。

阅读全文 →
自发现强化学习揭秘:学习历史是资产还是负担?
·5 分钟

自发现强化学习揭秘:学习历史是资产还是负担?

arXiv新论文首次对自发现强化学习规则进行因果机制审计,围绕"经验时代"五大支柱,揭示学习历史何时是资产、何时成负担,为下一代自进化RL算法建立审计标准。

阅读全文 →
风险规避的在线POMDP规划:基于即时成本CVaR的新方法
·5 分钟

风险规避的在线POMDP规划:基于即时成本CVaR的新方法

一篇arXiv新论文提出风险规避的在线POMDP规划新方法,通过将CVaR应用于每步即时成本,直接应对信念内部的状态不确定性,并保持标准MDP结构,让现有期望型规划器可低成本升级为风险敏感版本,同时提供端到端有限时间理论保证。

阅读全文 →
构建LLM智能体RL环境:从状态到奖励的六大核心
·4 分钟

构建LLM智能体RL环境:从状态到奖励的六大核心

如何为LLM智能体构建强化学习(RL)环境?本文拆解状态、观测、动作、转移、奖励、重置六大核心组件,剖析编程、计算机使用、企业工作流三类任务的环境差异,并总结奖励设计与上线前验证的关键要点。

阅读全文 →
Cubic Doggo实战:用MuJoCo和PPO训练机器狗站立的强化学习踩坑记
·6 分钟

Cubic Doggo实战:用MuJoCo和PPO训练机器狗站立的强化学习踩坑记

开发者分享用MuJoCo、PPO和Stable Baselines3训练自制机器狗站立的强化学习实践。项目揭示了奖励函数设计中的经典陷阱:为省力而两腿站立的非预期策略,并给出四足着地与斜坡平衡的优化思路。

阅读全文 →
浏览器里训练AI:Clash Royale强化学习实战解析
·5 分钟

浏览器里训练AI:Clash Royale强化学习实战解析

一位开发者将《皇室战争》AI智能体做成可在浏览器训练的迷你版本,用350行纯JS手写REINFORCE算法,直观展示强化学习如何从零学会防守策略,并开源了完整代码。

阅读全文 →
RLCD 解析:用适当评分规则让 RL 奖励校准置信度
·6 分钟

RLCD 解析:用适当评分规则让 RL 奖励校准置信度

深入解析 TypeSafe Jev 背后的 RLCD 方法:如何用 Brier 等适当评分规则替代标准 RLVR 的 0/1 奖励,通过按箱校准惩罚解决 LLM 过度自信问题,以及为何全局惩罚会被 PPO/GRPO 的 baseline 吸收。

阅读全文 →
Noam Brown警告:大模型可能撞上"能力天花板"
·4 分钟

Noam Brown警告:大模型可能撞上"能力天花板"

OpenAI研究员Noam Brown指出,随着大语言模型越来越强,我们可能耗尽能挑战它们的难题,导致强化学习失去有效训练信号。本文解析LLM为何难以复制AlphaGo的自我博弈路径,以及这一"难度墙"对AI行业的深远影响。

阅读全文 →