Claude的聪明,一半来自系统提示词

一场关于"模型到底有多自主"的讨论
最近,Hacker News上一则关于"Claude System Prompts"的讨论获得了662分和256条评论。表面上,这似乎又是一次关于Prompt技巧的常规交流,但真正引发热议的,是一个更为基础、也更容易被忽视的问题:我们看到的Claude,有多少其实是被预先规定好的行为?
当我们惊叹于Claude回答问题时的谨慎、条理和边界感时,往往会下意识地把这些表现归因于"模型很聪明"。但这次讨论把问题推到了台前——模型的系统约束、工具规则和行为边界,究竟在多大程度上塑造了它的表现?

这个话题之所以重要,是因为它触及了当前大模型应用的核心逻辑:用户看到的"智能",是模型基础能力与外部规则叠加后的产物,而非纯粹的模型能力本身。
系统提示词:一套持续运行的行为操作系统
讨论首先从最容易被忽略的一层开始——系统提示词(System Prompt)。
很多人对系统提示词的理解还停留在"用户临时输入的一句指令"。但实际上,系统提示词更像是一套持续运行的行为操作系统。它在对话开始之前就已经生效,并贯穿整个交互过程。
从技术实现层面来看,系统提示词是大语言模型API调用中一个独立的消息角色(role: system),它与用户消息(role: user)和助手回复(role: assistant)共同构成完整的对话结构。在每次推理时,系统提示词会被放在对话上下文的最前端,模型在生成回复时将其作为最高优先级的指令参考。这与用户随手输入的提示有本质区别——用户提示是单次任务指令,而系统提示词是跨越整个会话生命周期的持久性约束。OpenAI、Anthropic、Google等主要模型提供商都在API层面支持这一机制,但各家的实现细节和优先级处理略有不同。
它规定了几件关键的事:
- 模型自己扮演什么角色
- 用什么格式来组织答案
- 哪些事情需要格外谨慎
- 在什么条件下必须停下来

从这个角度看,用户输入的消息其实只是"进入这套规则之后的一次任务"。也就是说,同一个模型,一旦换上一层不同的系统约束,它的语气、结构和边界都可能随之改变。
这解释了一个常见现象:为什么不同产品接入相同的底层模型,却呈现出截然不同的"性格"。差异往往不在模型本身,而在那层看不见的系统提示词。
工具规则:真正改变模型"动作"的关键
如果说系统提示词决定了模型"怎么说",那么真正改变模型"怎么做"的,是工具规则。
当Claude具备读文件、查资料、调用外部工具的能力时,系统提示词的作用就不再局限于表达层面,而是延伸到了行动层面。
这些能力的技术基础是Function Calling(函数调用)机制。自2023年OpenAI率先在GPT系列中引入这一能力以来,主流大模型厂商纷纷跟进。其核心原理是:开发者在API调用时以JSON Schema的格式定义可用工具的名称、功能描述、参数类型和约束条件,模型在推理过程中判断是否需要调用某个工具,并生成结构化的调用请求。关键在于,模型本身并不直接执行工具操作,而是输出一个调用意图,由外部系统负责实际执行并将结果回传给模型。这意味着工具描述的措辞、参数约束的严格程度,都会直接影响模型的调用决策——描述越精确,模型的行为就越可预测。

具体来说,工具规则可以做到:
- 要求模型在调用工具前先确认参数
- 规定高风险动作必须停下来、请人批准
- 定义工具描述、输入格式、失败处理和结果回传方式
这些规则会成为模型下一步判断的重要依据。换句话说,工具的描述和约束本身,就是在引导模型的行为路径。
这一点对理解当下的AI Agent尤为关键。AI Agent(智能体)是当前大模型应用最热门的方向之一,它指的是能够自主感知环境、制定计划、调用工具并迭代执行任务的AI系统。与传统的单轮问答不同,Agent强调多步骤推理和自主决策能力。典型的Agent架构包括ReAct(推理+行动)、Plan-and-Execute(规划+执行)等范式,它们依赖一个核心循环:模型观察当前状态→思考下一步→调用工具→获取结果→再次思考。我们常说的"Agent行为",很多时候并不是模型独立涌现出的能力,而是模型能力与工具规则共同作用的结果。许多看似智能的Agent行为,实际上是通过精心设计的提示词链和工具约束来实现的,而非模型真正具备了完全自主的规划能力。
同一句请求,为什么会触发不同的行动?
讨论中一个很有启发性的例子,很好地说明了系统规则如何左右模型的行为。

设想一个用户说:"把这批文件全部发出去。"
面对这句完全相同的请求,不同系统的表现可能天差地别:
- 一个只追求完成任务的系统,可能直接开始操作,把文件一股脑发出去;
- 一个把权限和风险写进系统规则的系统,则会先追问范围、确认收件人,或者在执行高风险动作前主动停下来等待确认。
这里的关键在于:两者行为的差异,不一定来自模型本身变得更聪明或更谨慎,而是来自系统层面对行为边界的定义。
这个例子实际上触及了AI安全领域的一个核心概念——对齐(Alignment)。对齐分为多个层次:最底层是通过RLHF(基于人类反馈的强化学习)和Constitutional AI等训练方法,将安全行为内化到模型权重中;中间层是通过系统提示词设定运行时的行为规范;最外层则是通过工具权限、审核过滤器等工程手段构建安全护栏(Guardrails)。Anthropic在Claude的开发中特别强调"分层防御"策略,即不依赖单一安全机制,而是通过训练层、提示层和系统层的多重约束来降低风险。这也解释了为什么同一个模型在不同产品中的安全表现可能差异巨大——并非模型变了,而是外层防护的厚度不同。
同样一个模型,被放进"只管完成"的框架里,就会表现得莽撞;被放进"先评估风险"的框架里,就会表现得成熟稳重。用户实际体验到的"智能",其实是这套规则筛选和约束之后的能力。
对开发者和用户的实际启示
这次讨论虽然以Claude为切入点,但它揭示的规律具有普遍意义。
对于产品开发者而言,这意味着系统提示词和工具规则的设计,其重要性丝毫不亚于选择哪个底层模型。同样的模型,好的系统设计可以让它更安全、更可控、更符合业务需求;糟糕的设计则可能让强大的模型做出危险或失控的动作。在实际工程实践中,这已经催生出一个新兴的专业方向——Prompt Engineering不再仅仅是"写好提示词",而是演变为系统级的行为架构设计,涵盖提示词分层管理、工具权限矩阵、异常回退策略等一整套工程方法论。
对于普通用户而言,理解这一层有助于我们更理性地看待AI的表现。当Claude表现得谨慎周到时,我们应该意识到,这背后可能是精心设计的行为约束在起作用,而非模型"天生善良"。反过来,当某个AI产品表现得鲁莽时,问题也未必出在模型,而可能是系统规则的缺失。这种认知也有助于用户在选择AI工具时做出更明智的判断——评估一个AI产品的优劣,不能只看它背后用了哪个大模型,更要关注产品团队在系统设计层面的功力。
结语:能力与规则的双重奏
回到最初的那个问题:Claude真的很聪明吗?
答案是——它确实具备强大的基础能力,但我们最终使用到的,是经过系统提示词和工具规则塑造之后的那部分能力。模型提供了潜力,系统规则则决定了这份潜力以何种方式、在何种边界内释放出来。
理解这一点,或许比学会任何一套Prompt技巧都更重要。因为它让我们看清了当代AI应用的真实结构:你看到的智能,是能力与规则合奏出的结果。
核心要点
相关推荐

AI Agent成本优化实战:一小时省下百万美元的工程智慧
Databricks工程团队仅用一小时消除每年100万美元的AI Agent无效支出。本文深度解析Agent成本失控的根源、可观测性驱动的优化方法,以及模型分级、上下文精简、缓存去重等关键策略,为团队提供AI成本治理的实践指南。

FDA如何在Databricks上构建AI就绪的数据底座
深入解析FDA如何借助Databricks for Government平台,在保障联邦级安全合规的前提下,构建统一的湖仓架构与AI就绪数据底座,破解遗留系统数据孤岛难题,为药品监管和公共卫生AI应用奠定基础。

安全协作的力量:为什么漏洞发现离不开人的智慧
探讨安全协作如何胜过单纯依赖工具,解析漏洞背后的故事价值、跨团队知识共享实践路径,以及如何通过投资于人与协作来构建更强大的安全防线。