通用Agent为何走不通?一场面试重塑Agent开发者认知

从一场三轮面试说起
最近,一位名叫Joy的Agent开发者在B站分享了一段引发热议的经历。她刚刚经历了一家公司的三轮面试并拿到了offer——第一轮技术面、第二轮产品面(CTO面)、第三轮联创面(CEO面)。这家公司原本做文档写作(类似飞书文档),如今拿到一笔海外融资后,决定转型做「AI时代下的Canva」,目标市场是海外,2C与2B兼顾。
有意思的是,整场技术面几乎没有出现传统的「八股文」问题,取而代之的是大量场景设计题和产品思维题。这次面试彻底打碎了Joy对Agent的既有认知,也让她意识到:在Agent时代,产品的重要性正在超越纯粹的技术。
她给出的核心判断很直接——通用Agent这条路,对初创公司和个人开发者来说走不通。
那些没有标准答案的面试题
如何让AI「有审美、有品位」?
面试官抛出了一个经典问题:如何用Codex或Claude Code设计出有审美、有taste的前端网站或Landing Page?这个问题没有标准答案,Joy的回答梳理了市面上几种主流思路:
- Skill方案:本质并非让AI学会了品位,而是把作者认为「有品位」的产品设计规范(design.md)包装成预制提示词。它更像是经验的封装,而非能力的提升。
- RL方案:可以用强化学习让AI更有审美,但数据和成本都难以估量。强化学习用于提升AI审美能力,技术上对应RLHF(基于人类反馈的强化学习)和RLAIF(基于AI反馈的强化学习)范式。OpenAI的InstructGPT论文(2022)首次系统性地证明了RLHF在对齐人类偏好方面的有效性。将这一方法迁移到视觉审美领域,需要建立「审美评分模型」作为奖励函数,而收集大规模、高质量的视觉偏好标注数据成本极高——Adobe、Canva等公司因拥有海量用户行为数据而具有天然优势。这也解释了为何真正提升审美能力,还是要靠OpenAI这样的模型厂商在训练阶段发力。
- 数据沉淀方案:对2B产品而言,只要有客户,就能收集使用数据和反馈,从而沉淀用户偏好——这本身就是一种护城河。

如何设计Agent的文件系统?
另一道场景题考察的是:如何为设计类Agent设计文件系统?比如用户上传了PDF、PPT、CSV,该如何让Agent分类处理?
Joy的思路是先做意图识别。用户上传的附件并非都是「素材」,可能是:想要参考的目标网站、必须放进设计稿的素材(截图/sticker),或是批量生成指令(比如一个555行的CSV,每行代表一个待做设计稿)。先区分意图,再决定处理方式,这才是设计产品该有的Agent逻辑。
软件交互范式正在被重写
Joy梳理了AI Agent的三个发展阶段,清晰地展现了交互范式的演变:
第一阶段:文本问答机器
最早的AI连Agent能力都没有,甚至是「瞎子」——用户必须主动打开官网提问,交流仅限于文本。

第二阶段:本地与IDE Agent
这一阶段出现了一个经典过渡形态——AI+浏览器。从最早的Arc,到Perplexity的Comet、ChatGPT的Atlas。随后是本地IDE Agent的崛起:Cursor、Codex、Windsurf,Agent开始真正具备执行能力。
第三阶段:常驻组织的Agent
以Claude for Slack为代表,Agent开始常驻于你的组织和公司,成为团队的长期合作伙伴。
Slack于2013年创立,2021年被Salesforce以277亿美元收购,目前在海外B2B协作市场占据主导地位,月活跃用户超3200万。这里有个耐人寻味的细节:Slack作为海外主流协作工具,其锁定效应来自三个层面:一是历史消息与文件的数据沉淀(企业平均在Slack中积累数年的沟通记录);二是与第三方工具的深度集成生态(超过2600个应用集成);三是团队习惯与组织文化的嵌入。公司用了一年后想更换,历史数据很难迁出。Claude for Slack的战略意义在于:Anthropic借助Slack的组织级渗透,让Claude获得了传统SaaS无法触及的「工作流上下文」——包括团队决策模式、项目背景和沟通风格。当一个Agent深度嵌入团队工作流、沉淀大量上下文之后,迁移成本将数倍放大。这对企业而言既是依赖,也是锁定。

Agent的护城河到底在哪?
重新定义Agent:不只是 LLM + Tools
Hugging Face课程里有句名言:「Agent就是LLM加工具」。但Joy认为这个定义已经过时。AI Agent的技术定义经历了显著演变——早期学术定义将Agent描述为「能感知环境并采取行动以实现目标的自主系统」,这一概念源自1990年代的多智能体系统研究。Hugging Face的简化定义虽然通俗,却遮蔽了现代Agent系统的核心复杂性:状态持久化、多步规划、工具编排、错误恢复等能力。如果Agent只是LLM调用工具,那ChatGPT网页版早就实现了——豆包生成图片算不算Agent?
她提出,真正有边界、有上限、有护城河的Agent,关键在于以下几个维度:
- State(状态管理):持久化Agent、管理上下文状态、避免用户信息丢失
- Permission(权限控制):细粒度的操作授权机制
- Workflow(工作流编排):支持多步骤、长链路任务的协调执行
- Evals(评估体系):持续量化产品质量、驱动迭代优化
- Feedback & Distribution(反馈与分发):构建用户反馈闭环,逐层提升产品能力
真正的生产级Agent需要处理长上下文窗口管理、工具调用的幂等性、任务中断与续接等工程难题,这些都远超简单的API调用封装。她坦言,如果做的Agent只是「LLM+Tool」的简单封装,那可能只是个「Agent wrapper(打包者)」,而非真正的Agent工程师——就像过去调侃的「你只是个会调API的开发者」。
为什么通用Agent走不通?
Manus是由中国团队Monica开发的通用AI Agent产品,2025年初以受邀制发布后引发全球关注,其多步骤自主任务执行能力(如自动完成市场调研、代码编写、文件处理等复杂工作流)被视为通用Agent的标杆之作。Manus以2.1亿美元被Meta收购,让Agent进入大众视野;Codex和Claude Code则真正把Agent带出了开发者圈子。Meta收购Manus折射出大厂对Agent人才与技术储备的紧迫性争夺——大厂收购通用Agent产品有双重动机:将通用能力内化为平台基础设施,同时通过人才收编阻止竞争对手构建同类能力。但正是这些大厂产品,堵死了通用Agent的路。
大厂专注通用赛道,市场份额已然固化,初创公司和个人开发者根本挤不进去。 Coding Agent领域尤其如此——你做不过Codex和Claude Code。
出路在于垂类Agent。因为你拥有特定领域的深度上下文,这是通用大模型天然缺失的。垂类Agent的核心竞争力在于「领域上下文的不可替代性」——在RAG(检索增强生成)架构普及后,通用大模型训练数据覆盖广但垂类深度有限,而垂类Agent可以通过积累行业专属知识库、用户行为数据和业务规则,构建通用模型难以复刻的推理优势。常见的垂类方向包括:AI+招聘、AI+设计、AI+商业研究等。
以AI+招聘为例:服务行业(如蓝领招聘)的JD往往连老板都不知道怎么写,很多岗位靠的是「面对面看一眼觉得合适」的软性判断,而非技术岗那种「前端三件套」的硬性要求。这类「tacit knowledge(隐性知识)」需要大量真实业务数据才能沉淀,RAG+Fine-tuning的组合方案是当前垂类Agent构建领域护城河的主流技术路径,其中数据飞轮效应(用户越多→数据越丰富→产品越精准→用户越多)是判断垂类Agent长期价值的关键指标。把这种行业经验沉淀为领域上下文,才是产品有人买单、有人愿意投资的核心逻辑。
护城河的动态本质
但垂类也有隐患。Joy强调,你的产品功能与工具编排的迭代速度必须持续快于底层通用模型的进化速度,否则迟早会被大模型的能力边界吞噬。迭代加速度,才是护城河和定价权的真正来源。

垂类也要连接通用生态
垂类做得再深,也不能只盯着自己的细分圈子。HeyGen成立于2020年,是数字人视频生成领域的头部产品,以AI换脸、口型同步和多语言视频翻译著称,估值一度超过5亿美元。HeyGen是个典型案例——这家产品最近推出了Hyperframes插件(本质是用Agent写HTML来做视频),并将其接入Claude Code、Codex等主流Agent进行推广。这代表了一种新兴的「Agent-as-distribution(Agent即分发渠道)」战略:通过将垂类能力封装为插件接入主流Agent平台,HeyGen得以在不改变用户工作流的前提下实现触点扩展。在Agent时代,分发入口从App Store变成了主流LLM的工具调用层(Function Calling / MCP协议),借助大众化入口在自媒体上快速破圈。垂类产品终究需要借助更广泛的Agent分发渠道来获取增长,成为主流Agent的「首选工具」,意味着获得了被动的流量红利。
给Agent从业者的实战建议
面试时一定要反问产品
Joy反复强调:面试时不要只聚焦技术,产品才是核心变量。尤其对初创公司而言,产品力和增长能力的重要性远超纯粹的技术实现。她的建议是:
- 直接问面试官在做什么产品,与市面上的顶级竞品相比,差异化优势在哪里
- 在CEO/CTO面时,观察高层对自己产品是否有真实信心——如果连创始人都说不清楚,这家公司不去也罢
- 珍惜面试的反问环节,即使最终拿不到offer,也能积累对Agent市场的一手认知
她曾面试一家AI+剪辑公司,直接问CEO:「对比顶级产品,你们的核心优势是什么?还是只是做一个不一定更好的替代品?」这类直球问题,是检测产品成色的有效方式。
名词会变,判断力才是根本
最后,Joy给出了一个清醒的预判:做Agent的人很快可能会被说成「没有护城河、只是Agent wrapper」,就像当年调侃「只会调API」一样。
但她并不悲观。「Agent」这个词也许明年就换了叫法,变成Proactive Agent或其他形态,但这并不重要。重要的是它代表了AI Native时代下软件交互范式的根本性变革——我们实现需求的方式变了:以前遇到bug要去CSDN逐层排查,现在只需把问题交给AI搜索、定位、写测试。
正如那句总结:名词会变,产品形态会变,留下来的是判断的品位(taste)。 在AI时代,看待事物的洞察力和理解底层逻辑的能力,才是最难被复制的护城河。
核心要点
相关推荐

AI+SRC自动化挖洞实战:用AI智能体重构漏洞挖掘三步法
本文详解AI+SRC自动化漏洞挖掘的完整思路,对比传统挖洞三步法与AI智能体加持后的变化,涵盖资产盘点、误报筛选、报告生成及AI Agent选型要点,助你高效入门SRC漏洞挖掘。

实测DeepSeek桌面Agent:0.35美元自动生成视频
海外博主实测DeepSeek桌面Agent(DeepSeek Harness):仅0.35美元自动生成完整视频,设置每日自动简报,两分钟从大白话构建可运行App。三项任务全部完成仅花0.59美元,附详细表现与成本分析。

Antigravity 2.0 保姆级教程:MCP、Skill与自动化全解析
Antigravity 2.0 保姆级教程,详解项目/会话/Agent 三大核心概念、消息队列与权限设置、自动化任务、MCP 连接 Figma、Skill 专业技能,并演示设计稿转代码、Android 应用生成、产品页 1:1 复刻等 6 个实战案例。