Unverified90% confidenceFactTime unknown
QwQ-32B采用两阶段强化学习训练策略:第一阶段在数学和编程任务上进行强化学习,第二阶段扩展到通用领域
1
Sources
90%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
阿里QwQ-32B开源:32B参数如何媲美671B的DeepSeek R1
bilibiliAI大模型全栈
Related Entities
Related Claims
UnverifiedLLaVA的训练分为两个阶段:第一阶段是预训练对齐(冻结视觉编码器和语言模型,仅训练投影层),第二阶段是指令微调(解冻语言模型进行端到端训练)68% similarUnverifiedComposer 2采用了双阶段推进策略:中期训练加大规模强化学习68% similarUnverified子曰大模型在预训练和微调阶段大量使用了教材、习题、解题过程等教育语料,使其在教育任务上具备更强的专业性68% similarUnverifiedQwen3.7 Max的训练采用了环境驱动的工具训练方法,是强化学习在大模型训练中的一种具体应用形式67% similarUnverified该教程采用四阶段递进的学习路径,从核心模块到实战闭环67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/23196API
curl https://kongchang.com/api/v1/knowledge/claims/23196MCP
get_claim(id=23196)