[KongchangAI]
Unverified50% confidenceFactExact time

大语言模型从自回归预测转向强化学习驱动的推理增强(如Chain-of-Thought推理链、Process Reward Model过程奖励模型)

1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/490835
API
curl https://kongchang.com/api/v1/knowledge/claims/490835
MCP
get_claim(id=490835)