[KongchangAI]
Unverified50% confidenceFactExact time

推理范式本质上是将强化学习应用于语言模型的后训练阶段,让模型自主探索推理路径并根据答案正确性获得奖励反馈,最早在o1系列模型中公开展示

1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/490922
API
curl https://kongchang.com/api/v1/knowledge/claims/490922
MCP
get_claim(id=490922)