Unverified50% confidenceFactExact time
DeepMind、Tesla Optimus、Unitree 等团队均采用了强化学习驱动的运动控制方案
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/29/2026
First Seen
Valid until: 11/27/2026
Sources
Related Entities
Related Claims
VerifiedDeepMind的Dreamer系列模型在潜空间中进行规划,提升了强化学习的样本效率74% similarUnverifiedDeepMind提出RLAM(强化学习辅助记忆),OpenAI探索过程监督(Process Supervision)方法,将奖励信号延伸至中间推理步骤72% similarVerifiedDeepMind的AlphaStar使用人类对局数据进行行为克隆初始化,再通过自我对弈强化学习达到职业选手水平72% similarUnverifiedDeepMind的AlphaGo是强化学习赋予Agent自主学习策略路径的标志性成果72% similarUnverifiedDeepMind在《星际争霸II》中使用了大规模分布式训练集群,因为单机无法在可接受时间内完成训练72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/821019API
curl https://kongchang.com/api/v1/knowledge/claims/821019MCP
get_claim(id=821019)