Unverified50% confidenceFactExact time
MuZero将世界模型与蒙特卡洛树搜索(MCTS)结合,只需预测价值、策略与即时奖励三个量
1
Sources
50%
Confidence
Long-term
Relevance
7/19/2026
First Seen
Sources
Related Claims
Unverifiedo系列针对链式思维推理进行强化训练,引入了蒙特卡洛树搜索(MCTS)与过程奖励模型67% similarUnverified推理时计算扩展的具体路径包括蒙特卡洛树搜索(MCTS)、最佳N采样(Best-of-N Sampling)和过程奖励模型(PRM)66% similarUnverifiedMuZero(2019)学习了隐式的环境动态模型,使MCTS可以在学到的潜在空间中进行规划,无需访问真实环境规则61% similarUnverifiedAlphaGo通过蒙特卡洛树搜索(MCTS)在推理阶段投入大量计算资源进行棋局评估,是推理时计算扩展范式的理论渊源61% similarUnverifiedToT 允许模型同时维护多条推理分支,通过启发式评估函数对各分支打分,在推理空间中进行类似蒙特卡洛树搜索(MCTS)的系统性探索59% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/564477API
curl https://kongchang.com/api/v1/knowledge/claims/564477MCP
get_claim(id=564477)