Cursor创始人深度对话:代码之死与"品味"的崛起

Cursor联合创始人Truell:AI编程的终局是取代代码本身,"品味"是工程师唯一不可替代的能力。
Cursor联合创始人Michael Truell在对话中阐述了一套激进而连贯的技术判断:编程的终极归宿不是更快地写代码,而是用更高层次的意图表达取代传统代码。当前"vibe coding"在专业大型代码库中并不奏效,AI平均承担了约40%到50%的代码量,但工程师仍需逐行审查。阻碍Agent达到超人水平的核心瓶颈包括长上下文与持续学习、长时间跨度任务自主推进、以及多模态工具使用能力。他认为未来工程师唯一不可替代的能力是"品味"——即定义你究竟想造什么的判断力,程序员将转型为"逻辑设计师"。Cursor本身从机械工程CAD方向起步,历经约一年旷野期后转向,这段模型训练经历成为支撑日后大规模推理能力的基础。
AI编程工具Cursor背后的公司AnySphere刚刚达到90亿美元估值,成为史上增长最快的创业公司之一——上线仅20个月便实现1亿美元年度经常性收入(ARR)。在最新一期《How to Build the Future》对话中,Cursor联合创始人兼CEO Michael Truell分享了他对编程未来的激进判断:代码本身终将被某种"更好的东西"取代,而人类工程师真正不可替代的能力,是"品味"(taste)。
终极目标:不是辅助编程,而是取代编程
Truell开门见山地抛出了一个颇具野心的观点:公司的目标不是把现有编程做得更快,而是"用某种更好的东西取代编程"。他和三位联合创始人都是资深程序员,他们对编程的热爱源于"能快速把东西造出来"。但现实是,哪怕是描述起来很简单的功能,也需要编辑数百万行晦涩的形式化编程语言代码。
他预判在未来五到十年内,软件构建方式将演化为一种更高层次、更聚焦的形态——开发者只需定义"软件应该如何工作、如何呈现",而不必亲手编写每一个for循环和if语句。Cursor的路径是:在任何时间点都做"用AI编程的最佳方式",然后不断把这个过程推离传统编程,演化成完全不同的东西。

"Vibe Coding"行不通?专业开发的真实现状
面对"我们是不是已经到了描述即生成的时代"的追问,Truell给出了相当克制的回答。他承认在小型代码库、小团队场景下,变化已经发生,人们正在"跃升到代码之上",直接让Agent完成修改。但在专业世界里,所谓"vibe coding"(不看代码、不理解代码就编程)"并不真正奏效"。
原因在于复杂系统的"n阶效应":当你面对数百万行代码、几十上百人协作多年的项目时,无法回避对代码的思考。他透露,Cursor用户平均让AI编写了40%到50%的代码行数,但整个过程仍然是"阅读AI输出的每一行"。
他把当前AI编程归纳为两种形态:一种是把任务委派给Agent("去帮我做这件事"),另一种是AI盯着你的屏幕、偶尔接管键盘的Tab自动补全形态。未来六个月到一年的游戏规则,就是把这两种形态的实用性提升一个数量级。他预测当这些成熟后,专业开发中约25%到30%的工作可以端到端依赖AI完成,无需逐行审查。
**年度经常性收入(ARR,Annual Recurring Revenue)**是SaaS行业衡量订阅制业务规模的核心指标,指将当前订阅合同折算为一年周期后的预期收入总额。ARR排除了一次性收入,更能反映业务的可持续性与增长势头。对于投资人而言,ARR增速是判断公司成长轨迹的关键依据——上线20个月达到1亿美元ARR,意味着Cursor的收入增长曲线几乎是垂直的,这在B2B SaaS历史上极为罕见。相比之下,Salesforce用了约五年才达到同等规模。
**"n阶效应"**在软件工程语境中,指对系统某一部分的修改会通过依赖链传导,引发多层级的连锁反应。在大型代码库中,改动一个模块可能触发测试失败、接口不兼容、性能回归等一系列问题,且这些影响往往难以在修改前完全预判。这正是"屎山"代码难以重构、也难以完全交由AI自动处理的根本原因。
让Agent达到超人水平的真实瓶颈
Truell冷静地列举了阻碍编程Agent达到人类水平的技术障碍,这部分内容对理解AI编程的天花板尤为重要。
上下文窗口与持续学习:1000万行代码约等于1亿token,不仅需要模型能物理吞下这些内容,还要以成本可控的方式"真正有效地关注"这些上下文。他特别指出,这不只是代码库的问题,更是一个持续学习(continual learning)问题——模型需要知道组织的历史、过去尝试过什么、同事是谁。而业界目前"对此还没有真正好的解决方案"。他也坦言,训练机构普遍缺乏高质量的长上下文数据。
长时间跨度任务:他引用了一张广为流传的图表——AI能在单个任务上持续推进的最长时间,过去一两年从"几秒"增长到了"大约一小时"。
多模态与工具使用:软件工程师需要运行代码、查看输出、翻阅Datadog日志。"如果不需要这些,AI早就超人了,那会很疯狂。"因此计算机操作能力(computer use)是编程未来的关键。

**持续学习(Continual Learning)**是机器学习领域的一个核心难题,又称"终身学习"。传统深度学习模型在训练完成后参数固定,当需要学习新知识时,往往会出现"灾难性遗忘"(catastrophic forgetting)——模型在吸收新信息的过程中覆盖了原有知识。对编程Agent而言,这意味着它需要在不忘记通用编程能力的前提下,持续内化某个特定代码库的历史决策、组织约定和团队文化。当前主流解决方案包括检索增强生成(RAG)——将历史信息存入外部向量数据库实时检索,以及微调(fine-tuning)——在特定数据上继续训练。但两者都有明显局限:RAG受限于检索精度和上下文窗口,微调成本高且易遗忘。Truell指出业界"对此还没有真正好的解决方案",正是点明了这一领域的核心工程瓶颈。
品味:唯一不可替代的能力
这是整场对话最具启发性的部分。Truell认为,无论技术如何演进,有一样东西永远不会消失——品味(taste),即"定义你究竟想造什么"。
人们通常只在视觉层面讨论品味,但他强调逻辑层面同样存在品味问题——软件逻辑该如何运作。当前的编程行为其实捆绑了两件事:一是搞清楚你到底想要什么产品,二是把它映射到物理计算机上的实现细节。后者本质上是一种"人肉编译"——你心里清楚要什么,却必须用for循环、if语句、变量和方法把一切拼写出来给计算机。
他的判断是,这种"人肉编译"步骤会越来越多地消失,计算机将能填补空白。但对"什么才是真正有用、符合你意图"的品味,永远不会消失。他借用了一句话来形容:优秀的人能帮你达到某个标准,但真正大师级的人,能达到一个你甚至看不见的高度。
由此,他提出未来程序员将成为"逻辑设计师"(logic designers)——转向意图驱动的编程。
更深远的影响:专业开发者的生产力与长尾软件
Truell描绘了技术成熟后的两个二阶效应。其一是专业开发者生产力的巨大跃升。他指出大型软件项目"慢得惊人",很大程度源于既有逻辑的重量——改一个地方就会牵连一堆东西崩掉。当编程被自动化后,下一个分布式训练框架、下一个数据库、下一个AI模型都会快得多。而据他了解,各大实验室在很大程度上正是被工程产能所瓶颈制约。
其二是大量利基软件的涌现。他回忆自己第一份工作是在一家生物科技公司担任首位软件工程师,那家公司的核心能力是湿实验室科学,却不得不费尽周折组建软件团队来做内部工具。未来这类公司将拥有多得多的选择——"你想在计算机上发生的事情,就能发生"。
从CAD到Cursor:一次价值连城的"错误"
Cursor并非一蹴而就。四位MIT出身的创始人在2022年起步时,最初做的竟是机械工程方向——为CAD(计算机辅助设计)打造副驾驶,训练"3D自动补全"模型,尝试预测用户在SOLIDWORKS或Fusion 360中的下一步几何操作。
这段"旷野期"持续了约一年,最终因两个原因搁置:团队对机械工程远不如对编程热情,且当时的科学还没准备好处理3D——预训练模型表现不佳,互联网上的CAD数据比代码数据少几个数量级。但这段经历并非徒劳:训练数十亿参数规模模型的实战经验(当时fork了Megatron-LM和Microsoft DeepSpeed并改写内核),为日后Cursor每天超过5亿次模型调用的推理能力打下了基础。

驱使他们转向的核心信念,Truell称之为"跟随那条线"(follow the line)——即规模化定律:只要扩大数据和算力,模型就会持续变好。这个在2022年还属于"没人相信"的信念,比Sam Altman后来公开强调"永远要押注模型会变得更聪明"早了整整一年。
**规模化定律(Scaling Laws)**是由OpenAI研究人员(Kaplan等人,2020年)系统提出的一组经验规律:神经语言模型的性能(以损失值衡量)会随着模型参数量、训练数据量和计算量的增加,呈现出可预测的幂律式提升,三者之间存在可量化的最优配比关系。这一发现的革命性在于:它让"模型变大就会变聪明"从直觉猜测变成了有数学依据的工程信念,也为GPT-3、GPT-4等大模型的研发提供了理论基础。Truell在2022年便以此为核心信念,在当时主流舆论普遍对大模型持怀疑态度的背景下押注"跟随那条线",这一判断在此后两年间被市场充分验证。Megatron-LM是英伟达开源的大规模语言模型训练框架,DeepSpeed是微软开源的分布式训练优化库,两者均专为在数千块GPU上高效训练数十亿至数千亿参数规模的模型而设计。
关键的产品抉择:为什么是编辑器而非插件
一个在当时非常不被看好、如今却被证明正确的决定,是构建完整编辑器而非VS Code插件。Truell解释,这源于"所有编程都将流经这些模型、未来形态会截然不同、需要一个控制UI"的信念。
他还透露了关于GitHub Copilot诞生的二手故事:团队在"沙漠中徘徊"了近一年,尝试过自动化PR等各种疯狂想法,最终才落到简单的自动补全上;即便如此,仅仅为了显示ghost text(灰色预览文本),他们也不得不修改VS Code主线并暴露新API。Cursor团队由此判断:"既然连ghost text这么简单的东西都需要改编辑器,那我们将来肯定要改一大堆。"

护城河与度量:警惕"为Demo优化"的塞壬之歌
在增长度量上,Cursor盯的不是DAU/MAU,而是付费重度用户——即每周七天中有四到五天使用AI的付费用户。Truell解释,作为服务专业人士的工具,交付本身有真实成本,让用户"毕业"到付费层级才是可持续的。
他特别警示了AI产品的一个陷阱——"为Demo优化"。用几个精选案例拼出一段看似革命性的视频很容易,但从漂亮Demo到真正可用的产品之间,隔着速度、可靠性、智能和产品体验的大量打磨工作。Cursor的做法是把编辑器变成团队内部每天真实使用的工具(dogfooding)。
谈到护城河,Truell认为AI编程市场更像90年代末的搜索,而非传统企业软件:产品天花板极高,可以持续变好很久。规模化分发带来的数据飞轮至关重要——通过观察用户在哪里接受、在哪里拒绝、拒绝后又如何修正,反哺研发和底层模型,从而造出更好的产品。他把ChatGPT时刻类比为这个时代的iPod/iPhone时刻,认为这个领域还有几个这样的突破点等待抢占。
**数据飞轮(Data Flywheel)**是互联网平台竞争中的核心护城河逻辑:用户使用产品产生行为数据,数据用于改进模型,更好的模型吸引更多用户,形成自我强化的正反馈循环。对AI编程工具而言,这一飞轮尤为关键——用户接受或拒绝AI建议的信号(accept/reject信号),是训练更贴合真实开发场景模型的高价值标注数据,而这类数据在公开互联网上几乎不存在。规模越大的平台,每天能收集到的此类信号越多,模型迭代越快,后来者的复制成本也就越高。这也解释了为何Cursor尽管面对微软GitHub Copilot等巨头竞争,仍能以产品质量形成差异化:不同用户群体产生的行为分布不同,飞轮转速和方向都会产生实质性差异。
招聘哲学:面试仍然禁用AI
一个有趣的细节:尽管自家产品就是AI编程工具,Cursor在技术初筛面试中仍然只允许候选人使用自动补全,不允许用AI。原因有二:无AI编程仍是衡量技能和智力的绝佳限时测试;同时,他们招了许多没有AI工具经验的顶尖程序员,不希望因此不公平地让他们吃亏——这些人反而能贡献"初学者视角"的产品洞察。
对于最后两天的onsite,团队会直接让候选人加入项目、一起吃饭、一起工作,以此考察对问题空间的热情与激情。Truell强调前10名员工的质量至关重要:"如果在以年为单位的尺度上想跑快,那么在以六个月为单位的尺度上慢下来会极有帮助。"
相关推荐

HF Buckets与Xet:只上传变化的数据,告别带宽浪费
Hugging Face Xet 技术让你只上传数据集中真正变化的部分,告别重复上传带来的带宽浪费。本文解析 HF Buckets 工作原理、Parquet 内容定义分块配置及生产环境注意事项。

Google徽章认证:开发者求职的新凭证
Google与GeeksforGeeks合作推出面向开发者和学生的数字徽章计划,强调技能需要被证明而非仅仅声称。本文解析数字徽章作为求职凭证的价值、信号作用及理性看待的要点。

Lovable Pro Plus 管理面板营销分析:免费积分噱头与风险提示
针对 YouTube 上「Lovable Pro Plus 管理面板、无限免费积分、899 卢比终身访问」的营销素材进行拆解,分析其卖点、Lovable 官方积分机制及潜在的账号与资金风险,并给出理性选择 AI 建站工具的建议。