[控场AI]
模型DeepSeek R1

DeepSeek-R1

DeepSeek-R1是由深度求索(DeepSeek)公司开发的大型语言推理模型,专注于复杂逻辑推理、数学运算和代码生成任务。该模型通过强化学习与思维链技术训练,具备较强的多步骤推理能力,支持开源部署,可在多种硬件平台上运行,是DeepSeek推理模型系列的代表性版本之一。

核心事实

时间轴 (近 90 天)

9月10日

DeepSeek-R1 蒸馏模型在 AIME 2024、MATH-500、LiveCodeBench 等任务上表现出色,在多数场景下与 GPT-4o 和 DeepSeek V3 相当,部分指标超越 OpenAI o1-mini

待验证50%
9月10日

DeepSeek-R1的训练在华为昇腾集群上完成,昇腾的CANN平台在中国市场发展迅速

待验证50%
9月4日

Meta的LLaMA系列、Mistral AI的Mixtral、DeepSeek的DeepSeek-V3/R1等开源模型在编程、推理等任务上的表现已逐步逼近甚至部分场景超越闭源商业模型

待验证50%
9月3日

推理型模型(如OpenAI o1系列、DeepSeek-R1等)因需要更长的思考过程和更多计算资源,API定价通常高于标准对话模型

待验证50%
8月31日

开源大模型如Meta的Llama系列、阿里Qwen系列、DeepSeek-V3/R1、Mistral AI系列已达到接近甚至部分超越闭源商业模型的水平

待验证50%
8月30日

DeepSeek-R1等推理增强模型在生成最终答案前会产生大量中间推理Token,这些思考Token计入输出Token费用

待验证50%
8月30日

DeepSeek-R1的蒸馏版本是蒸馏技术的成功案例,量化或蒸馏后的版本在消费级显卡甚至笔记本电脑上即可部署

待验证50%
8月26日

一些推理增强型模型(如DeepSeek-R1、Kimi K3)会生成非常长的思维链,有时推理过程的Token数量是最终答案的数十倍

待验证50%
8月24日

根据Unsloth数据,此前最受欢迎的GGUF量化模型Qwen3.6-35B-A3B获得1.54K点赞,DeepSeek-R1获得1.12K点赞

已过期50%
8月6日

GRPO是DeepSeek团队提出的强化学习算法,它取消了PPO中的Critic Model,通过对同一问题生成一组回答计算组内相对奖励作为基线

待验证50%

还有 9 条时间轴事件

全部知识事实 (20)

已验证

DeepSeek-R1是专注于推理能力的模型,通过强化学习训练具备链式思考能力

80%
已验证

OpenAI o1系列模型于2024年9月发布,代表了LLM从快速直觉式回答向深度推理的范式转变

80%
已验证

OpenAI o1和DeepSeek-R1通过延长思考链在数学竞赛题等复杂基准上取得突破,本质上是在推理阶段动态分配更多计算预算

75%
已验证

推理模型以OpenAI o1、DeepSeek-R1、QwQ为代表,核心机制是思维链扩展,在给出最终答案前生成大量中间推理步骤

65%
待验证

Google的Gemini 2.0 Flash Thinking和DeepSeek-R1等模型跟进了o1的推理时计算扩展技术路线

85%
待验证

DeepSeek-R1能够自主生成长达数千token的思维链

80%
待验证

2024-2025年间Llama 3、Qwen 2.5等开源模型在多项基准测试中已接近甚至匹敌闭源商业模型

75%
待验证

DeepSeek-R1 蒸馏模型在 AIME 2024、MATH-500、LiveCodeBench 等任务上表现出色,在多数场景下与 GPT-4o 和 DeepSeek V3 相当,部分指标超越 OpenAI o1-mini

50%
待验证

DeepSeek-R1的训练在华为昇腾集群上完成,昇腾的CANN平台在中国市场发展迅速

50%
待验证

Meta的LLaMA系列、Mistral AI的Mixtral、DeepSeek的DeepSeek-V3/R1等开源模型在编程、推理等任务上的表现已逐步逼近甚至部分场景超越闭源商业模型

50%
待验证

推理型模型(如OpenAI o1系列、DeepSeek-R1等)因需要更长的思考过程和更多计算资源,API定价通常高于标准对话模型

50%
待验证

开源大模型如Meta的Llama系列、阿里Qwen系列、DeepSeek-V3/R1、Mistral AI系列已达到接近甚至部分超越闭源商业模型的水平

50%
待验证

DeepSeek-R1等推理增强模型在生成最终答案前会产生大量中间推理Token,这些思考Token计入输出Token费用

50%
待验证

DeepSeek-R1的蒸馏版本是蒸馏技术的成功案例,量化或蒸馏后的版本在消费级显卡甚至笔记本电脑上即可部署

50%
待验证

一些推理增强型模型(如DeepSeek-R1、Kimi K3)会生成非常长的思维链,有时推理过程的Token数量是最终答案的数十倍

50%
待验证

GRPO是DeepSeek团队提出的强化学习算法,它取消了PPO中的Critic Model,通过对同一问题生成一组回答计算组内相对奖励作为基线

50%
待验证

OpenAI的o1/o3系列和Google的Gemini Thinking采用类似扩展思考的慢思考机制

50%
待验证

推理模型在输出最终答案前内部思维链可能消耗3000至20000个Token,远超普通模型的约500个Token

50%
待验证

Meta的Llama系列、DeepSeek-R1、Mistral等主流开源模型大多属于开放权重模型

50%
待验证

GRPO由DeepSeek团队系统化提出并在训练DeepSeek-R1系列模型时得到大规模验证

50%

来源文章