Chain-of-Thought
Chain-of-Thought(思维链)是大型语言模型提示领域的一种推理技术,通过在输入提示中引入逐步推导的中间推理步骤,引导模型以分解问题、逐步分析的方式生成答案。该技术能够显著提升模型在数学推理、逻辑判断和多步骤问题求解等复杂任务上的表现,相较于直接给出答案的标准提示方式具有更强的可解释性与准确性。
核心事实
时间轴 (近 90 天)
当前缓解幻觉的主要方法包括检索增强生成(RAG)、基于人类反馈的强化学习(RLHF)以及链式思维(Chain-of-Thought)提示,但只能降低而非根除幻觉
研究表明模型可能产生不忠实的思维链,即表面推理步骤与实际决策依据不一致
Prompt优化技术包括思维链提示(Chain-of-Thought)、自洽性、ReAct模式以及结构化输出
ReAct架构将推理链(Chain-of-Thought)与外部工具调用相结合,为后续Agent框架(如LangChain、AutoGPT)奠定了理论基础
让模型先思考再行动(如 Chain-of-Thought)能显著降低错误率,这一点得到 OpenAI 和 Anthropic 研究支持
蒸馏后的小模型往往能学会表面推理格式,却在推理链的第3-4步开始出现逻辑断裂
CoT能力具有明显的涌现特性,通常认为只有当模型参数规模超过60B-100B参数以上时才能稳定带来性能提升
2022年Chain-of-Thought提示的提出使LLM具备了分步推理能力
推理模型引入了链式思维等机制,体现了 AI 从 System 1 快速直觉反应向 System 2 慢速深度思考的演进
OpenAI的o1系列和Google的Gemini 2.5系列将CoT内化为模型的默认行为,模型在训练阶段被教会自动进行内部推理
还有 25 条时间轴事件
全部知识事实 (20)
2022年Google Brain的Jason Wei等人发表的思维链(Chain-of-Thought)提示论文首次系统证明加入逐步推理示例能使PaLM等大模型在数学推理任务上准确率大幅提升
90%已验证Chain of Thought能显著提升模型在数学推理、逻辑判断等需要多步推导的任务上的表现
90%已验证Agent的实现通常通过ReAct(Reasoning + Acting)框架来实现规划能力
90%已验证ReAct融合了链式思考(Chain-of-Thought)和直接工具调用两条研究路线,形成「思考→行动→观察」的迭代循环
80%已验证DeepSeek-R1是专注于推理能力的模型,通过强化学习训练具备链式思考能力
80%已验证ReAct(Reasoning + Acting)框架由Yao等人在2022年提出,将Chain-of-Thought推理与外部工具交互交替进行
80%已验证O3属于OpenAI的o系列推理模型,引入了思维链(Chain-of-Thought)机制进行多步内部推理
80%已验证Chain-of-Thought提示技术由Google Brain团队在2022年的论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》中正式提出
80%已验证思维链(Chain-of-Thought)提示技术由Google Research于2022年提出
80%已验证OpenAI的o1系列模型和DeepSeek-R1采用了类似Chain-of-Thought的显式推理机制
80%已验证推理能力基于思维链(Chain-of-Thought, CoT)技术,模型在给出最终答案前生成内部逐步推导过程
80%已验证CoT提示将PaLM 540B在GSM8K数学基准测试中的准确率从17.9%提升至58.1%
75%已验证2022年Google的研究表明,在提示中加入'Let's think step by step'能显著提升模型在数学和逻辑推理任务上的表现
75%已验证Anthropic在2023年发表的研究《Language Models Don't Always Say What They Think》中发现,模型展示的推理步骤有时与其实际决策依据存在系统性偏差
65%已验证Chain-of-Thought(思维链)提示技术通过强制模型先输出中间步骤来部分缓解自回归模型在逻辑推理中的缺陷
65%已验证Claude的扩展思考(Extended Thinking)模式会让模型在输出前进行显式内部推理链,提升复杂任务质量,但Token消耗量大幅增加
65%已验证思考模型在输出前会经历内部链式推理(Chain-of-Thought)过程,在数学证明、代码调试、复杂逻辑推理等任务上表现优于标准模型,代价是延迟更高、计算成本更大
65%已验证思维链提示(Chain-of-Thought Prompting)通过引导模型显式输出推理步骤,在复杂推理任务中能显著减少跳跃性错误
65%已验证Chain-of-Thought Prompting由Wei等人于2022年提出
65%已验证Chain-of-Thought技术最初由Google Brain团队的Jason Wei等人在2022年的论文中系统化提出
65%