[控场AI]
· 9 分钟阅读· 4,582 字

Claude Code省钱技巧:让AI自主判断与多模型分工

Claude Code省钱技巧:让AI自主判断与多模型分工

文章正文

在使用 Claude Code 这类 AI 编码代理工具时,很多开发者习惯用详尽的指令告诉 AI 该怎么做。但知名开发者 Simon Willison 在与 Claude Code 团队的炉边对话中获得了一个反直觉的启发:与其事无巨细地下指令,不如放手让 AI 运用自己的判断力。 这一思路不仅能提升工作效率,还能显著节省宝贵的 token 额度。

Claude Code 与 AI 编码代理:一个新范式

Claude Code 是 Anthropic 推出的命令行 AI 编码代理工具,代表了新一代「代理式」AI 编程助手的范式转变。Anthropic 由前 OpenAI 核心成员于 2021 年创立,专注于 AI 安全研究,其 Claude 系列模型以强大的长文本理解和指令遵循能力著称。与早期的 GitHub Copilot 等代码补全工具不同——后者本质上是基于光标位置预测下一段代码的「自动补全增强版」——编码代理能够自主规划任务、调用工具、读写文件、执行命令,甚至协调多个子任务并行处理。这一代际跨越的核心在于「工具调用」(Tool Use / Function Calling)能力的成熟:模型不再只是输出文本,而是可以像程序员一样打开终端、搜索代码库、运行测试,并根据结果迭代调整策略。这类工具的核心挑战在于如何在「自主性」与「可控性」之间取得平衡——给予过多限制会抹杀其效能,而放任自流则可能产生不符合预期的结果。Simon Willison 的实践经验,正是在这一张力中摸索出的平衡之道。

核心理念:让模型自己做判断

Simon Willison 在 AI Engineer World's Fair(AIE)大会上主持了一场炉边对话,嘉宾是 Claude Code 团队的 Cat Wu 和 Thariq Shihipar。AIE 是面向 AI 工程师群体的顶级行业峰会,汇聚了大量一线 AI 产品构建者的实战经验分享。对话中最有价值的建议是:让模型运用自身判断力,而非硬性规定它该如何工作。

以测试策略为例。传统做法是给出精确规则:"只对较大的功能使用自动化测试,不要为小的文案或设计改动更新和运行测试。" 但更高效的做法其实更简单——直接告诉 Claude Code「在决定是否编写测试时,使用你自己的判断」。

为什么"声明意图"优于"堆砌规则"

这一建议背后,隐藏着软件工程领域两大经典编程范式的深层逻辑迁移。「命令式」编程(Imperative Programming)起源于早期冯·诺依曼架构,程序员需要精确描述计算机执行每一步操作,如 C 语言的手动内存管理和循环控制。「声明式」编程(Declarative Programming)则在 1970-80 年代随 SQL、Prolog 和函数式语言兴起,开发者只需描述「目标状态」,底层运行时负责寻找实现路径——React 的 UI 状态声明、Kubernetes 的期望状态配置均是现代典范。过度详尽的规则列表本质上是命令式思维,而「使用你自己的判断」则是声明式思维的体现。

手写规则往往是脆弱且不完整的:你无法穷举所有场景,规则之间还可能相互冲突。而现代大模型已具备相当程度的上下文理解与常识判断能力——这得益于在海量代码和技术文档上的预训练,以及 RLHF(人类反馈强化学习)对编程最佳实践的内化。当你把决策权交给模型,它可以根据任务的性质、规模和风险综合权衡,做出更灵活、更贴合实际的选择。随着模型能力的持续提升,声明式提示往往更具鲁棒性——模型能根据上下文灵活解释意图,而非机械执行可能相互矛盾的规则集。

这本质上是从「命令式指令」转向「声明式意图」的一次思维转变——也是与新一代 AI 工具高效协作的关键技能。

实战技巧:用低功率模型跑子任务省 Token

要理解这套技巧的价值,首先需要了解 token 的经济重量。Token 是大语言模型处理文本的基本计量单位,由分词器(Tokenizer)将连续文本切割为离散单元,大致对应英文中的 3/4 个单词或中文的 1-2 个汉字。主流模型按输入+输出 token 数量计费,采用「每百万 token 价格」(price per million tokens,简称 MTok)作为标准计价单位。不同模型的价格差异悬殊:以 Anthropic 官方定价为参考,Claude Opus 的成本约是 Haiku 的 60 倍以上,而 OpenAI 的 GPT-4o 与 GPT-4o-mini 之间也存在约 30 倍的价差。在复杂编码代理任务中,模型需要反复读取代码库(输入 token)、生成分析、输出代码(输出 token),且输出 token 通常比输入 token 贵 3-5 倍,消耗量极易失控。对重度用户而言,token 开销已成为真实的运营成本,多模型分工因此从「技术选项」升级为「成本必需」。

Simon 正是从开发者 Jesse Vincent 处获得了一个节省 token 的实用技巧:告诉 Claude Code 对较小的任务使用其他模型,并让它自行判断该用哪个。

Simon 给 Claude Code 的实际提示词是:

For all coding tasks use your judgement to decide an appropriate lower power model and run that in a subagent (对于所有编码任务,运用你的判断力选择一个合适的低功率模型,并在子代理中运行它)

子代理架构:分布式执行的底层原理

这里的「子代理」(Subagent)并非比喻,而是 AI 代理系统中一种成熟的架构模式,学术上常被称为「多代理框架」(Multi-Agent Framework)或「代理编排」(Agent Orchestration)。这一概念源于分布式系统和多智能体系统(Multi-Agent Systems, MAS)的研究传统,在 AutoGPT、LangGraph、CrewAI 等框架的工程实践中得到广泛验证。主代理负责任务分解、结果整合与质量把关,将具体的原子性任务委派给独立运行的子代理处理,每个子代理可以使用不同的模型配置、工具集和上下文窗口。这一模式借鉴了软件工程中的微服务思想,将单一复杂系统拆解为职责清晰的组件。在 Claude Code 的实现中,子代理通过「模型覆盖」参数(model override)指定使用较小的模型,并接收「自包含的提示词」——即不依赖主循环上下文的完整任务描述,从而实现真正的解耦执行。这种设计还有一个重要的技术收益:子代理拥有独立的上下文窗口,避免了主代理上下文膨胀导致的注意力稀释问题(attention dilution),有助于在长时任务中保持更高的输出质量。

Claude 如何理解并持久化这条指令

值得关注的是,Claude 将这条指令自动保存成了一个记忆文件,路径为 ~/.claude/projects/name-of-project/memory/delegate-coding-to-subagents.md。这个记忆文件不仅记录了用户的原始意图,还生成了清晰的执行策略:

  • 原因(Why):出于成本与效率考量——具体实现工作很少需要顶级模型;判断、审查和综合类工作仍保留在主循环中。
  • 执行方式(How):当任务主要是编写或编辑代码时,派生一个带模型覆盖设置的子代理(重要实现用 Sonnet,琐碎/机械性编辑用 Haiku),并配上自包含的提示词;在提交前于主循环中审查结果。设计、审计、数据综合及需要重度判断的工作,保留给主模型处理。

Claude Code 的记忆持久化机制通过 Markdown 文件实现,分为全局配置(~/.claude/CLAUDE.md)和项目级记忆(~/.claude/projects/<name>/memory/)两个层级。这种设计与传统 AI 助手将偏好隐式存储在不透明数据库中的做法截然不同——选择纯文本 Markdown 格式意味着这些「记忆」对开发者完全可审查、可 diff、可纳入 Git 版本控制,甚至可以作为团队共享的配置文件。这种「自我文档化」的记忆模式在提示工程领域代表了一种更成熟的工程化实践:将每次调优的成果固化为可复用的配置资产,减少每次会话重复说明的认知负担,本质上是将隐性的提示工程知识转化为显性的团队资产。

主从模型分工:降低成本的架构思路

这套方法的精髓在于分层委派——主模型(如 Opus)负责高层次的判断、审查与综合,将具体代码实现下放给更经济的子代理模型(Sonnet 或 Haiku)。

这对应了软件工程中一个经典分工原则:把稀缺的高价值资源用在最需要判断力的环节,把重复性工作交给成本更低的执行者。这一原则在企业架构中对应「架构师 - 高级工程师 - 初级工程师」的层级分工,在云计算中对应「按需实例 vs 竞价实例」的混合部署策略。在 AI 编码代理的语境下,具体分工如下:

模型适用场景
Haiku琐碎、机械的代码编辑
Sonnet实质性的功能实现
Opus / 主循环决策、代码审查、跨模块综合

Simon 报告称这套方法运行良好——他完成了大量工作,而 token 额度的消耗速度比以往明显放慢。

对开发者的两点启示

第一,信任模型的判断力。 随着模型能力提升,过度详尽的指令有时反而会束缚模型,限制其灵活性。这一现象在提示工程研究中已有实验依据:过度约束的提示词会导致模型陷入「规则遵从」而牺牲「任务理解」,在边界情况下表现尤其脆弱。用高层意图引导、而非低层规则约束,是驾驭新一代 AI 工具的核心技能。声明式提示工程的思维,正逐渐成为高效 AI 协作的基础素养。

第二,主动进行成本管理。 在 token 定价成为真实开销的今天,多模型分工是控制成本的有效手段。强模型做决策、轻模型做执行,既保证质量,又降低花费。这与云计算领域的「FinOps」理念高度契合——FinOps(Financial Operations for Cloud)强调工程师对云资源成本的主动感知与精细化管理,而非将费用视为黑盒交给财务部门。在 AI 原生应用时代,类似的「AI 成本工程」意识将成为开发者的核心竞争力之一。更进一步的做法,是把「选择哪个模型」这个决策本身也交给 AI 来判断——这正是元层次提示工程的精髓所在。

随着 AI 编码代理日益普及,这类「元层次」的提示工程技巧——即引导 AI 如何调度自身资源——将成为高效开发者的必备能力。就像软件架构师不会亲手敲每一行代码,未来的 AI 原生开发者也需要掌握「编排智能」而非仅仅「使用智能」的能力。

核心要点

分享:

相关推荐