从Chat到Agent:用AI代理自动化你的业务全流程

AI应用的两个阶段:从对话到代理
在这场深度访谈中,自学成才的AI实践者Remy分享了他过去两年沉浸在AI领域的全部心得。他并非技术工程师出身,此前经营广告代理公司,如今为全球增长最快的电商品牌之一管理AI代理团队。他的核心论断直击要害:每家公司都必须把AI放在所有运营的最前沿,否则就会输给这样做的对手。
Remy将AI应用划分为两个清晰的阶段。阶段一是「Chat」——几乎所有创始人和从业者都在使用ChatGPT、Claude或Gemini这类聊天模型。阶段二则是「Agent」(代理)。他指出,正在使用代理的创始人和员工,工作效率比只用聊天的人高出「5到10倍」,哪怕取中间值7倍,也意味着「一个工作日等于一周,一周等于五到七周」。
要理解Chat与Agent的分野,有必要回顾支撑二者的底层技术。ChatGPT、Claude、Gemini都建立在2017年谷歌提出的Transformer架构之上——这一架构通过「自注意力机制」让模型能够并行处理长文本序列并捕捉词与词之间的远距离依赖关系,彻底取代了此前的循环神经网络(RNN)。OpenAI的GPT系列、Anthropic的Claude系列、谷歌的Gemini均属于「生成式预训练」模型,先在海量文本上进行无监督预训练,再通过「基于人类反馈的强化学习」(RLHF)对齐人类偏好,使模型输出更符合人类期待。这也解释了为何聊天模型如此擅长「问答」——它们本质上是被训练成了极其强大的文本补全与对话引擎,但默认状态下并不具备主动调用外部工具、持续执行多步骤任务的能力。
这种差距正在制造一道鸿沟:一边是使用代理的人,一边是困在聊天里的人。而对员工而言,Remy认为这反而是巨大机遇——那些主动学习这套方法的人,会变成「百倍员工」,一个人能承担十人团队的工作量。
Chat与Agent的本质区别
Remy给出了一个极其精炼的定义:Chat是「问题到答案」,Agent是「目标到结果」。 聊天模型像一位聪明的顾问,它给你答案,但你仍需自己动手;而代理更像把这位聪明人招进公司,让他端到端地替你完成整件事。
他强调,「Agent」一词源于「agency」(能动性/代理权),即「行动并完成事情的能力」,并非科幻电影里的神秘角色。像日常小问题——「香蕉有多少卡路里」「地铁能否用Apple Pay」——用聊天足矣,「用代理相当于用火箭筒打苍蝇」。但任何有意义的实际工作,都应交给代理。


代理的运行原理:观察-思考-行动循环
要理解AI代理如何工作,必须弄清它内部的「循环」。Remy将其拆解为三个不断重复的步骤:观察(Observe)→ 思考(Think)→ 行动(Act)。代理会一遍遍地「看清现状、决定下一步、执行动作」,直到判定任务完成,才输出最终结果。
Remy描述的这一循环并非凭空而来,它对应了学术界2022年提出的ReAct(Reasoning + Acting)范式。这一框架的核心思想是让语言模型在推理(生成思维链)与行动(调用工具、获取环境反馈)之间交替进行,从而将纯粹的语言模型转变为能够与外部世界交互的智能体。此后,AutoGPT、BabyAGI等开源项目将这一理念推向大众视野,展示了让AI「自主分解目标、循环执行直到完成」的可能性。代理之所以能比聊天强大数倍,关键正在于这个闭环——它不再是「一问一答」的静态交互,而是能够根据每一步的执行结果动态调整策略,甚至衍生出「子代理」来处理并行子任务。
他现场用Claude Code演示:要求分析自己Instagram上表现最好的视频并生成HTML报告。代理先搜索电脑找到相关文件,再评估、读取数据、发现缺少「口播前5秒钩子」这一字段,于是启动子代理去检索,最终经过约20-30次循环、耗时20分钟,生成了一份分类完整、包含标题钩子和成因分析的报告。
你可能没注意到,代理何时停止循环,取决于你在目标里定义得多清晰。「如果你对最终输出很模糊,结果就会更主观。」因此,清晰定义「完成的样子」至关重要。
承载循环的「代理外壳」
Remy澄清了一个被滥用的概念。市面上所谓「我做了一个代理」,大多并非真的构建了循环,而是「调优」了一个代理。真正运行这个循环的应用程序,叫做代理外壳(Agent Harness)——Claude Code、Codex、Manus、Perplexity等都只是不同的外壳。
他打了一个精彩的比方:这些工具就像不同的车,Codex是法拉利、Claude Code是路虎、Manus是大G。而底层的LLM模型(如Opus、GPT-5)好比引擎。「只要你会开车——掌握转向、刹车、油门这些核心基本功——五分钟就能上手任何一辆。」 更关键的是:一辆沃尔沃如果上下文、技能和工具调校到位,完全可以击败一辆调校糟糕的兰博基尼。这是对「唯模型论」的有力反驳。
调优代理的三大支柱:像招聘员工一样
Remy提出的核心方法论是:把设置AI代理当作招聘一名真实员工来对待。 一个开箱即用的代理虽然能力强,但如果不了解你和你的业务、没有工具、不懂你的流程,就毫无用处。他把代理形容为「极其能干的陌生人」——你花每月100美元把这个拥有无限带宽的聪明人请进公司,但你必须完成三件事的「入职培训」:上下文(Context)、工具(Tools)、技能(Skills)。
上下文:让代理了解你的一切
上下文是代理在接到任务前就应知道的所有信息——关于你、你的业务、品牌调性、理想客户画像、产品目录等。这些都以Markdown文件(.md)的形式存在。Remy解释,Markdown比纯文本多一层简单格式(标题、加粗、列表),代理可以直接「秒读」,而PDF则需要费力拆解,成本更高、速度更慢。
他电脑里有「数百个」md文件。构建时,他会在Claude里说「采访我,把信息从我脑子里提取出来」,配合语音输入工具Whisperflow,坐上三小时把答案「吸」进文件。这些文件是公司的资产,必须逐行审阅——如果理想客户画像里有一句错误描述(比如误把「红斑」当成痛点),会污染所有营销文案。
最关键的是AGENTS.md(Claude里叫CLAUDE.md)文件,它会在每次新会话时自动加载,是「北极星」上下文文件。其他上下文文件则放在一个context文件夹里,在CLAUDE.md中指向它。此外还需一个memory.md用于记录纠正与偏好,构建一套自我改进的记忆系统。他还提醒要警惕「上下文腐烂」——会话越长,模型越容易遗忘和幻觉,因此文件要保持精简、高密度。
「上下文腐烂」现象背后有着明确的技术机理。大语言模型处理信息的能力受限于「上下文窗口」(context window),即模型单次能够「看到」的token数量上限。当前主流模型的窗口已扩展至数十万甚至上百万token,但研究表明,模型对上下文中不同位置信息的利用并不均衡——存在所谓「中间迷失」(lost in the middle)效应,即模型往往更关注文本开头和结尾,而容易忽略中段的信息。随着会话变长、上下文被大量历史对话填满,模型不仅计算成本上升,还更容易产生遗忘和幻觉(生成看似合理实则错误的内容)。这正是Remy强调文件要「精简、高密度」,并通过CLAUDE.md自动加载核心上下文、通过memory.md维护记忆系统的深层原因——本质上是在有限的注意力资源内做信息的精细化管理。
工具:通过MCP连接一切
要让代理真正干活,必须给它工具。实现方式是MCP(模型上下文协议,Model Context Protocol)。Remy用一个来自Ross Mike的比喻解释:Claude说英语,Gmail说法语、Notion说西班牙语、Slack说中文,MCP就是坐在中间的「翻译官」,让Claude无需学会所有语言就能与各种工具对话。
MCP是Anthropic于2024年11月正式推出并开源的一项开放标准,其设计目标是解决AI应用与外部数据源、工具之间碎片化集成的难题。在MCP出现之前,每个AI应用若想连接一个新工具,都需要单独开发定制化的接口,导致「N个模型对接M个工具」的组合爆炸问题。MCP借鉴了软件工程中「通用协议」的思路——正如USB-C统一了设备的物理接口,MCP试图成为AI与工具之间的「通用插头」。它定义了标准化的客户端-服务器通信规范,使得任何遵循协议的工具都能被任何支持MCP的AI外壳调用。这一标准发布后迅速获得行业响应,OpenAI、谷歌等也相继表示支持,MCP正逐渐成为构建AI代理生态的事实基础设施。
他透露自己现在几乎不再使用任何应用的前端界面——Gmail、Slack、Stripe、Cal.com全部接入Claude,把AI外壳当作所有工具之上的「智能层」。他甚至把「是否提供MCP」作为采购软件的决定性标准,这正反映了该协议在实操层面的重要性。他推荐了六个必备工具:Apify(数千个网络爬虫的市场)、Firecrawl(能真正「读取」网页而非只搜索)、Composio(连接上千工具的「MCP的MCP」,可跨平台迁移)、Chrome DevTools与Playwright(让代理操控浏览器执行动作)、以及Higgsfield(图像与视频生成,被称为「图像模型界的Composio」)。
关于安全,Remy坦言这是个权衡:他给了Claude包括Stripe在内的完全访问权限,八个月无事故。对谨慎者,他建议从「只读权限」起步,逐步升级。
技能:把你的IP打包成SOP
技能是三大支柱中最重要的部分,本质是**「给AI的标准作业流程(SOP)」**。它同样是md文件,包含三部分:名称、描述、内容。Remy用「书架」比喻:代理旁边有一排书,书脊上是每个技能的名称与描述(始终占用少量上下文),当任务需要时才「抽出」对应的书,加载完整内容——这叫「渐进式披露」。
构建技能有两种方式:目标优先(直接说「帮我建一个品牌指南技能」)和流程优先(他90%的技能采用此法:先带着Claude完整走一遍流程,满意后说「把刚才的过程存成技能」)。技能从来不是一次成型的,他常用的技能大多迭代到了V5到V10版本,只需反复告诉Claude「更新这个技能」即可。
他现场演示了两个惊艳的技能:一个是广告分析师技能,输入竞品广告库链接,自动抓取所有广告和落地页,生成完整策略报告;另一个是产品拍摄技能,只需给一张产品参考图,就能生成多张编辑级的产品营销大片。技能还能相互编排——他的「YouTube发布工作流」技能就是一个「编排器」,按顺序调用标题、缩略图等四个子技能。
整体架构:把个人操作系统当作控股公司
Remy展示了他历经数月打磨的文件结构:一切都从一个名为**OS(操作系统)**的顶层文件夹运行。他曾尝试建立高度专门化的细分代理,但发现「模型已经足够聪明」,专门化只会增加管理负担。
他用控股公司类比整体架构:OS是控股公司,下面是各个「子公司」文件夹(如不同业务品牌、personal个人事务)。上下文、工具、技能都可分为全局层(如描述「我是一名学习中的非技术创始人」的全局CLAUDE.md,适用于所有会话)和项目层(如只在特定项目才用到的技能)。工作时他保持OS文件夹开启,用@符号标记具体子文件夹以引导代理定位。
他坦率地打破了社交媒体上的神话:那些声称「我的营销代理团队通宵工作」的人,实际上「只是有一个marketing文件夹、几个技能,以及一个定时任务」——比如「每晚做一份Facebook广告报告发到我邮箱」。真相远比想象简单。
企业AI化路径与成本
关于企业如何走向AI原生,Remy认为有两条路:自上而下(引入AI专家为员工构建)和自下而上(培训员工成为AI素养者、自动化自己的工作)。他倾向后者——目标不是裁掉团队,而是留住最优秀的人并训练成「百倍员工」,从而在冻结招聘的情况下继续增长。而主持人则补充认为,最佳实践是两者混合:先用一份统一问卷摸清全员AI使用现状,再针对性培训。
在成本上,Remy透露自己每月AI开销约1000美元(约合每年12000美元换取「上百名员工」的产能)。他还揭示了一个行业现实:OpenAI、Anthropic等公司目前都在巨额补贴真实算力成本以抢占市场——一个300美元/月的Claude套餐实际对应约6000美元的token用量。随着这些公司推进盈利(如Anthropic为IPO),套餐额度正被逐步收紧,未来开源模型和本地部署将迎来更大市场。
这一「算力补贴」现象反映了当前AI行业的资本逻辑。训练和运行大语言模型需要海量的GPU算力,尤其是英伟达的高端芯片,单次推理的真实成本相当可观。OpenAI、Anthropic等前沿实验室在激烈的市场竞争中,普遍采取「以低于成本定价换取用户增长与数据飞轮」的策略,这与互联网时代打车、外卖平台的补贴大战如出一辙。然而,随着这些公司面临商业化与盈利压力(如寻求上市或维持巨额融资的回报预期),补贴难以长期持续,套餐额度收紧、单价上涨几乎是必然趋势。这也正是开源模型(如Meta的Llama系列、DeepSeek广告、Mistral等)与本地部署价值凸显的背景——当API成本不再低廉,能够在自有硬件上运行、数据不出本地、成本可控的开源方案将获得更大的战略意义。
从零开始的AI代理行动清单
Remy给出的起步建议清晰而务实:
- 第一步:创建那个「控股公司」文件夹OS。
- 第二步:开一个全新Claude或ChatGPT会话,让它「采访你」,构建about me、理想客户画像、产品服务、品牌调性等上下文md文件。
- 第三步:连接你的工具(上下文与工具几个小时就能搞定)。
- 第四步:设定目标——尝试完全在代理外壳内完成一整个工作日。过程中,只要某个任务未来还会重复,就把它做成技能。
正如主持人所言:「如果你能做到今天所讲内容的10%,你就已经进入了从Chat毕业者的前0.0001%。」这套方法论的价值不在于追逐某个特定模型或工具,而在于掌握「如何驾驶」的永恒基本功——而这,正是当下每个创始人和员工都不应错过的机遇。
核心要点
相关推荐

Vibe Coding是什么?程序员必须掌握的AI编程能力
Vibe Coding(AI编程)到底是什么?本文解析AI编程如何重塑研发流程、为何传统程序员面临淘汰、Cursor与Claude Code两大工具,以及程序员、PM、运营等岗位为何都该掌握这项能力。

让石头思考:生成式AI与信息压缩的哲学思考
从Reddit热帖「让石头思考」出发,探讨生成式AI的信息论本质:为何压缩等价于理解,巴别图书馆式的可能性空间思辨,以及语义压缩、Hutter Prize与AI原理的深层联系。

让Claude"浪费"额度:一场AI创造力的意外实验
一位Reddit用户让Claude用剩余额度"做件荒唐的事",结果AI生成了监控一块石头的企业级平台RockOps。本文分析这一趣味案例背后的AI创造力与产品设计能力。