[控场AI]
· 8 分钟阅读· 4,113 字

Grok Bot复盘:小团队一个月如何做出AI同事级Agent

Grok Bot复盘:小团队一个月如何做出AI同事级Agent

Grok Bot核心成员复盘:小团队闭关一个月,用"AI同事"理念打造最火知识工作产品。

前Cursor第15号员工罗曼·乌加特在访谈中完整复盘了Grok Bot从零到发布的过程。团队选择放弃在现有产品上叠加功能,以几人小团队闭关一个月从白纸开始,核心理念是让AI像真正的同事:一切运行在云端、每个机器人拥有独立电脑。团队亲手带两三百名早期用户上手,刻意接触硅谷圈外的普通用户,由此发现产品对非开发者价值更大。发布前两周大量删减功能,用"又能帮你做什么"替代"新增了什么按钮"的叙事。罗曼强调,AI把工作"做完九成"与"完全做完"感受截然不同,团队为此反复打磨十几个极具体的底层故障,最终赢得用户真正的信任与委托。

一个只有几个人的团队,闭关一个月,从第一行代码到内部原型;再用三周迭代打磨,就推出了被称为"当下最火AI产品"的Grok Bot。在这场访谈中,Grok Bot核心成员、前Cursor第15号员工罗曼·乌加特(Roman Ugarte)复盘了整个开发过程,也讲清了这款产品与Codex、Cowork等竞品在理念上的根本分歧。

本文基于该访谈完整梳理,尝试还原一个真正好用的AI Agent产品背后,那些"当时并不明显、现在看却至关重要"的决定。

为什么另起炉灶,而不是往Cursor里加功能

Anthropic和OpenAI的路径很相似:先做编程智能体,再发现机会远不止编程,于是把知识工作能力塞回原产品。Codex至今仍在朝"把所有东西合成一个"的方向走。Grok Bot团队却做了相反的选择——从一张白纸开始,做一个全新的产品。

罗曼把竞品的问题描述得很具体:所有东西堆在一个界面里,每多一种形态就加一个标签页,结果越来越拥挤。用户能感觉到背后不是一个统一的工作理念,"更像是三套不同的想法硬挤在同一块屏幕里",本质上是把公司的组织架构原样塞进了产品。

我想先强调一点

全新产品意味着每一个细节都由自己掌握,对知识工作未来的理解可以完整一致地落在同一个产品里。团队也坦承这不是唯一正确的路径——Codex走另一条路同样可能成功,"走过的路会影响后面的选择"。但对Grok Bot而言,从零开始带来的自由度,正是它最终好用的关键前提。

Codex是OpenAI推出的云端编程智能体产品,用户可以在不打开本地IDE的情况下,通过自然语言描述让其在沙箱环境中完成代码任务。Cowork则是Anthropic方向上针对多智能体协作场景的探索。这两款产品与Cursor的路径相似:从编程场景出发,逐步向更广泛的知识工作延伸,但核心交互框架和产品心智仍脱胎于代码编辑器。罗曼所说的"三套不同的想法硬挤在同一块屏幕里",指的正是这种在原有产品架构上不断打补丁的演进方式——每新增一种使用形态,就叠加一个标签页或模式切换,产品整体体验日趋碎片化。

小团队闭关:一个月做出能用的原型

产品从零搭建,内部组了一个"真的就那么几个人"的小团队,与公司其他部分完全隔开——单独办公、私密聊天频道,只有一个目标:做出一款让非开发者也能用的知识工作产品。

罗曼强调,正是这种独立小团队模式让推进如此之快。"如果团队太大,这件事可能根本做不成。"每天都有大量细小决定要拍板,而一大群人整天讨论半年到一年的宏大愿景,反而到不了今天的位置。快速动手、先把简陋但能用的原型搭出来,是这套方法论的核心。

从第一行代码到内部发布原型,总共约一个月。之后在全员会上向整个公司展示,把它推广到SpaceX内部。第一周的热情"超出想象",一些原本想不到的部门反响格外热烈,很多原来每天用ChatGPT的人开始把日常智能体任务迁移过来。这才是真正面向现实的测试。

手动带两三百人上手,从煎熬里学到什么

团队做了一件反直觉的事:核心成员亲自手把手带早期用户上手,前后约两周、带了几百人。有人会质疑这是否耽误开发,但罗曼说结论很清楚——"这绝不是耽误开发,而是成功的重要原因。"

最初几次上手体验"简直是煎熬":电脑始终启动不了,就在通话里陪用户等20分钟;看着用户在引导流程里完全摸不着头脑。每一次糟糕体验都逼出一个"明天必须解决"的问题,因为明天还要带下一个人。

团队还刻意接触圈子之外的人。一位咖啡店老板成了重度用户,反馈的问题(Shopify连接不稳、产品文案不合要求)与硅谷内部完全不同。这让他们意识到两点:这是一款对非开发者价值可能更大的通用产品;以及必须主动走出硅谷AI圈,因为这类产品有机会成为普通人接触AI的主要入口。

让机器人像同事:两个真正的关键决定

很多人质疑Grok Bot能做的,Codex和Cowork基本也能做。罗曼承认技术上确实如此,但他把成功归因于两个早期、当时并不明显的决定。

第一,一切放到云端运行。 用户不用操心本地和云端的区别,不用管电脑是否一直开着。它是一位"持续在线的同事",有自己的电脑,无论你从手机还是别处交互,都保持同一份状态。这打开了很多可能性,也省去了竞品留下的大量日常小麻烦。

让你把它当成一个独立对象

第二,每个机器人拥有自己的电脑。 很多任务根本没有好用的MCP接口或API,人类工作靠的是操作电脑——点击屏幕、在输入框打字,机器人也得会。罗曼用了一个精彩的比喻:现在的AI共事方式,就像新人第一天来上班,你却告诉他没有自己的笔记本、要永远和你共用一台电脑、互相打断、共用账号——现实里没人这么工作。未来的AI同事也需要类似人类的"入职"方式。

围绕这套理念,团队还创造了"机器人"这个叫法:每种任务、每类用途对应一个有名字的机器人,而不是一个临时聊天窗口。内部甚至演化出"幕僚长"用法——用户把一个机器人"升职"为管理者,由它把任务分派给其他机器人。

每个机器人拥有独立电脑这一决定,技术上依赖的是"计算机使用"(Computer Use)能力——即让AI模型直接操控图形界面,模拟鼠标点击、键盘输入、截图识别等人类操作电脑的方式。Anthropic于2024年底率先在Claude中开放这一能力,随后各主流模型陆续跟进。这与传统API调用或MCP(Model Context Protocol)接口的本质区别在于:API需要目标软件预先开放结构化接口,而Computer Use让AI像真人一样操作任何有界面的软件,无需对方做任何适配。这正是Grok Bot能处理Salesforce、Shopify等企业软件的底层原因——这些工具的API要么封闭、要么对自动化场景限制极多,但它们都有界面。代价是速度较慢、偶发操作失误,这也是团队需要反复打磨"鼠标点不中某个位置"此类具体故障的根源。

删功能,比加功能更难也更重要

发布前两周,团队做的最大一件事是"删掉很多功能"。核心团队此前塞进了大量实验性、偏开发者的调试工具(展示模型内部思考、显示保存了哪些记忆),发布前必须狠狠做减法。

罗曼提出一个判断标准:讨论任何功能时先问"发布时怎么向用户介绍"。如果连一条吸引人的推文都写不出,也许根本不该做。更进一步,他们把叙事从"产品新增了什么按钮"换成"Grok Bot又能帮你做哪些事"——前者是软件思维,后者是描述一个人的能力。

会越来越有价值

典型例子是自动任务。竞品需要打开侧边栏、点加号、选触发条件和动作,笨重到大多数人根本不会用。Grok Bot则让用户直接用自然语言说"每天早上八点提醒我",平台上99%的自动任务都是这样创建的,用户完全不需要看见那个创建界面。技能同理——藏在后台自动创建,用户不必知道"技能"这个概念的存在。

真正办成事:从九成到十成的信任差

罗曼有一条被反复引用的推文:AI把工作"完全做完"和"只做完九成",感觉完全是两回事。

如果你只有九成信任,把工作交出去后心里还是放不下,最后往往得亲自介入纠偏——那这件事仍然压在你身上,负担并没有消失。而真正的委派像篮球场上的不看人传球:把背景讲清楚,让它放手去做,然后相信它能接住。

还建立在这些竞争对手的平台之上

为了兑现这个承诺,团队盯住后台约五个关键基础问题反复打磨。市场拓展和销售团队是重度用户,常用工具缺乏好用的API,Grok Bot的电脑操作能力带来了巨大变化。团队解决了十几二十个具体问题——比如"鼠标点不中Salesforce面板某个位置"这种极其具体的故障。每发布一项不起眼的底层改进,第二天销售团队就会兴奋致谢,"过去一周一直失败的工作流终于跑通了"。招聘团队则用它做全天候人才搜寻:抓取会议网站的新论文、找出共同作者、交叉比对公司内部是否有人认识——这类过去全靠人工的工作,现在可以交给机器人。

Salesforce是全球最广泛使用的CRM(客户关系管理)系统,Shopify则是中小电商的主流建站平台。二者都以对外API限制较多、操作界面复杂著称,内部自动化改造成本极高,长期是"AI能帮上忙但实际很难落地"的典型场景。这也解释了为什么销售和市场团队对Grok Bot的反应格外强烈——他们每天大量时间消耗在这两个系统的手工操作上,一旦机器人能可靠地替代这部分工作,效率提升几乎是立竿见影。"每天一直失败的工作流终于跑通了"这类反馈,反映的正是从"偶尔好用"到"可以真正依赖"的质变,也是罗曼所说"九成到十成"的现实写照。

速度、文化与"护城河"

关于为什么Cursor能在OpenAI、Anthropic这类史上增长最快的公司夹击下持续领先,罗曼把答案归于文化:从不自满、始终看下一件事,"如果不能每半年就彻底重塑自己,很可能就会输"。当年AI编程领域有十几二十家对手,大多已不在最前沿,问题往往不在某个决策,而在文化上无法足够快地随环境改变。

对护城河,他的看法值得创业者深思:真正让Cursor有吸引力的,是对"今天能否做出有用东西"近乎执着的关注,而不是从战略图倒推。持续把"三个月后才可能的事"提前带到今天,用户就会因为信任而留下,用户触达、数据等优势也在这个过程中自然形成——"护城河往往是后来发现的,不是事先规划的"。

最终愿景其实很简单:每个人都应该有一支AI机器人团队,帮你工作也帮你生活,你可以引导它们却不必事事过问。团队内部把决策方法称为"同事思维"——遇到产品争论时退一步问:"如果是真人同事,你希望他怎么做?"答案往往一下就清楚,且大家很容易达成一致。

分享:

相关推荐