Unverified50% confidenceFactExact time
OpenAI o1模型于2024年9月发布,通过强化学习训练出在输出最终答案前进行内部推演的能力,中间推理步骤以特殊Token形式存在且对用户不可见
1
Sources
50%
Confidence
Long-term
Relevance
7/21/2026
First Seen
Sources
Related Claims
UnverifiedOpenAI的o系列模型(o1、o3)是强化学习推理(RLR)路线的代表性产物,以可验证的客观标准作为奖励信号77% similarVerifiedOpenAI o1 系列通过强化学习训练出链式推理(Chain-of-Thought)能力,在数学证明、算法设计和复杂逻辑推理上远超传统 GPT-475% similarVerifiedOpenAI的o1系列代表了「推理时计算」(test-time compute)这一新范式74% similarUnverifiedOpenAI于2025年初推出了基于o3模型的Deep Research功能,能够在数分钟内完成人类研究员数小时才能完成的文献梳理工作73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/575742API
curl https://kongchang.com/api/v1/knowledge/claims/575742MCP
get_claim(id=575742)