Unverified50% confidenceFactExact time
推理时计算扩展的具体路径包括蒙特卡洛树搜索(MCTS)、最佳N采样(Best-of-N Sampling)和过程奖励模型(PRM)
1
Sources
50%
Confidence
Long-term
Relevance
7/14/2026
First Seen
Sources
Related Claims
Unverifiedo系列针对链式思维推理进行强化训练,引入了蒙特卡洛树搜索(MCTS)与过程奖励模型73% similarUnverified推理时扩展在推理阶段增加计算量(如beam search、Best-of-N采样、蒙特卡洛树搜索),模型性能可随计算量增加持续提升并存在幂律关系71% similarUnverifiedTree-of-Thought允许模型同时展开多条推理路径,从中筛选出最优执行路径71% similarUnverifiedToT 允许模型同时维护多条推理分支,通过启发式评估函数对各分支打分,在推理空间中进行类似蒙特卡洛树搜索(MCTS)的系统性探索70% similarUnverified推理时计算扩展通过延长思维链、多路径采样择优、自我验证反思等方式在推理阶段投入更多计算可提升复杂推理任务性能69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/503435API
curl https://kongchang.com/api/v1/knowledge/claims/503435MCP
get_claim(id=503435)