Extended Thinking
一种让模型在输出最终答案前投入更多计算进行链式推理的能力,是Chain-of-Thought技术的产品化演进形式,已被多家AI厂商作为差异化功能对外开放
核心事实
时间轴 (近 90 天)
Effort设置是Anthropic在扩展思维功能中引入的调节旋钮,允许指定模型在生成回复前投入多少计算资源用于内部推理
扩展思考模式(Extended Thinking)会增加延迟,官方建议日常简单问题关闭该模式以获得最快输出
effort 分档是 Anthropic 为 Claude 3.7 系列引入的推理预算控制机制,通过 thinking 参数的 budget_tokens 字段指定推理 token 上限
Claude系列开启扩展思考(Extended Thinking)后,单次请求token消耗可能数倍于普通模式
盲目拉高思考努力参数未必带来更好结果,反而可能造成资源浪费和任务失败
完整的思维链推理需要生成大量 token,对算力消耗极高
Anthropic Claude 的 Extended Thinking 功能明确要求在多轮对话中必须回传推理内容,否则会返回错误
在Arkham Banking基准测试中,开启Extended Thinking模式的Gemini 3.8 Live得分35.1%,排名第一
传统的延展思考往往以增加延迟为代价,与语音场景对低延迟的要求存在张力
Gemini 3.8 Live 的 Extended Thinking 版本在语音回应前加入更充分的思考过程,适合复杂推理场景,标准版更侧重响应速度
还有 5 条时间轴事件
全部知识事实 (18)
Claude 3.7 Sonnet具有extended thinking功能,让模型在回答前进行更长时间的深度思考
90%已验证Claude的Extended Thinking功能开启后,模型会在生成最终回答前先输出一段内部推理过程(thinking块),这段推理对用户可见但不计入对话上下文
80%已验证Gemini 3.8 Live 的 Extended Thinking 版本在语音回应前加入更充分的思考过程,适合复杂推理场景,标准版更侧重响应速度
75%已验证推理模型在返回最终结果前进行内部链式思考(Chain-of-Thought),消耗大量token和计算时间以换取更深层理解和更低错误率
75%已验证过度的提前思考会带来延迟和计算成本的上升,在追求响应速度的场景中未必合算
75%待验证Claude Opus 4属于推理增强型模型,处理复杂任务时会启动扩展思维链(Extended Thinking),单次复杂推理的算力成本可达普通模型的20-50倍
70%待验证Extended Thinking功能需要在API请求中传入thinking参数对象,指定type: 'enabled'以及budget_tokens来控制推理深度
60%待验证Effort设置是Anthropic在扩展思维功能中引入的调节旋钮,允许指定模型在生成回复前投入多少计算资源用于内部推理
50%待验证扩展思考模式(Extended Thinking)会增加延迟,官方建议日常简单问题关闭该模式以获得最快输出
50%待验证effort 分档是 Anthropic 为 Claude 3.7 系列引入的推理预算控制机制,通过 thinking 参数的 budget_tokens 字段指定推理 token 上限
50%待验证Claude系列开启扩展思考(Extended Thinking)后,单次请求token消耗可能数倍于普通模式
50%待验证盲目拉高思考努力参数未必带来更好结果,反而可能造成资源浪费和任务失败
50%待验证完整的思维链推理需要生成大量 token,对算力消耗极高
50%待验证Anthropic Claude 的 Extended Thinking 功能明确要求在多轮对话中必须回传推理内容,否则会返回错误
50%待验证传统的延展思考往往以增加延迟为代价,与语音场景对低延迟的要求存在张力
50%待验证Claude 的 Extended Thinking 思考模式产生的推理 Token 虽对用户不可见(API 层标记为 thinking_content),但同样经过完整 Decode 过程并按输出价格计费
50%待验证面对格式转换、简单重命名等机械性任务,建议直接关闭思考模式以消除不必要的Decode成本
50%待验证Opus 5默认启用扩展思考(Extended Thinking),思考只能在努力等级为高或以下时禁用,官方强烈建议不要禁用思考
50%