图工程(Graph Engineering):超越提示词的AI工作流设计法

图工程将AI任务拆解为可管理的工作流图,用规划、并行研究、独立审查和人工批准替代单一对话框,是提示词工程之后的下一个范式。
图工程(Graph Engineering)是一种将复杂AI任务结构化为有向工作流的方法论,区别于提示词工程(问得更好)和上下文工程(给更好信息),它关注的是"围绕AI设计工作本身"。其核心是"钻石"结构:一个规划者拆解问题,多个研究者并行工作,一个独立的怀疑者检查结论,合并者综合证据,最后由人类批准。工作中的每个角色对应图中的节点,节点间的流转关系是边,系统当前掌握的信息是状态。落地路径分三层:手动泳道、每步写文件留痕、使用LangGraph或n8n等编排工具,且工具应在理清工作流之后再引入。图工程的深层价值在于,每次运行都在积累可复用的记忆资产,让工作流随时间持续变好,形成护城河。
从提示词到工作流:一个正在走红的新概念
最近,"图工程"(Graph Engineering)这个词在推特上频繁出现。AI领域每隔几周就冒出一个新术语——提示词工程、上下文工程、Agent工程、Vibe Coding……有些是纯粹的炒作,有些则真正有用。创业播客主持人Greg Eisenberg认为,图工程属于后者,因为它提供了一种理解"AI如何真正把活干完"的更好视角。
用最简单的方式区分这三个概念:提示词工程是如何向AI提出更好的问题,上下文工程是如何给AI提供更好的信息,而图工程则是如何围绕AI设计工作本身——让整个任务不再挤在一个混乱的大型对话框里。
举个例子。大多数人调研一个创业点子时,会打开对话框直接问"我该做这个吗"。模型会给出一个听起来相当聪明的答案:市场规模、几个竞争对手、一份进入市场的计划。你感觉自己完成了调研。但仔细想想会有点不安——一个模型在一次生成中,决定了什么重要、调研了市场、解读了证据、写了建议,还给自己的信心打了分。你可能会基于这一段文字投入数年时间,却做错了方向。
什么是图工程:把AI任务拆成一张流程图
图工程的核心,是把一个混乱的AI任务变成一个你真正能用的工作流。以调研创业点子为例,"图"版本的做法完全不同:
- **规划者(Planner)**先把问题拆成多个角度
- 一个研究员看客户,一个看竞品,一个看分发渠道,一个看定价,一个看风险
- **怀疑者(Skeptic)**尝试推翻那些薄弱的结论
- **合并者(Merger)**把幸存下来的证据整理成一页纸的建议
- 最后由**你(人类)**在行动前批准这个决策

这里涉及几个基本词汇。**节点(Node)**就是每一项工作,**边(Edge)是工作之间的流转关系,而状态(State)**指系统目前掌握的信息。听起来技术,但这正是现实中工作展开的方式。想想客户支持:客户来信后,你很少直接"回答工单",而是先判断问题类型、查客户历史、搜相关政策、起草回复、再决定是否需要人工审核。把这些步骤按依赖关系连起来,就是一张图。
关键在于,大多数人用AI是走"直线"的——因为对话框让一切显得顺序化:先要调研,再要总结,再要草稿,再要修改。这对简单任务没问题,但当工作有多个部分时,直线式对话会变慢、变模糊、变得难以信任。而图让你像管理一个小团队那样设计工作:一部分负责规划,几部分并行工作,一部分负责检查,一部分负责合并,最后人类批准。
知识图谱 vs Agent图:容易混淆的两种"图"
很多困惑来自于"图"在AI里其实有两种含义。
**知识图谱(Knowledge Graph)**帮助AI理解事物之间的关系:这个客户在这家公司,这家公司用这个产品,这个产品连接到那个工具,这个支持问题关联到某个功能,而这个功能归某个团队负责。普通的RAG往往只能检索与问题文本相似的段落,但当答案需要跨越不同人、公司、话题和主张进行连接时就会吃力。微软的GraphRAG就是这类工具的代表。
**Agent图(Agent Graph)**则关注"工作如何流动":规划者把任务交给研究员,研究员并行工作,怀疑者检查结论,合成者合并,人类批准最终答案。
记住区别的最简单方式是:知识图谱帮AI理解信息如何连接,Agent图帮AI理解工作如何流动。最好的系统最终会两者兼用,但对创业者、创作者、运营者和小团队来说,Agent图是今天就能上手的版本。
微软GraphRAG是理解知识图谱价值的好案例。传统RAG(检索增强生成)把文档切成片段,通过向量相似度检索与问题最接近的段落,本质上是"找相似文字"。GraphRAG在此基础上,预先从文档中提取实体(人、公司、产品、事件)及其关系,构建成图结构。查询时不仅能找到直接相关的段落,还能沿图的边"游走"——例如从一个客户出发,找到他所在的公司,再找到该公司使用的产品,再找到相关的支持记录。这种多跳推理(Multi-hop Reasoning)在处理复杂调查报告、企业知识库或法律文件时,准确率显著高于普通RAG。代价是需要额外的图构建步骤,以及图数据库(如Neo4j)的存储与查询开销,因此适合信息关系复杂、需要跨文档推理的场景,而非所有检索任务。
什么时候该用图工程

判断规则很简单:当工作有多个步骤、多个来源、多条路径、需要检查、涉及风险或审批时,图思维才真正重要。
如果只是让AI给新项目起10个名字,或总结一封短邮件,你不需要图。但如果你要做深度调研、制定进入市场计划、处理支持工单分流、审查代码、准备销售电话、综合客户反馈或产出周期性内容,图工程的价值就会凸显。
更具体的三条标准:工作有多个步骤;部分步骤可以同时进行;最终输出在生效前需要检查。这形成一个"钻石"结构——从一个问题出发,分裂成多条并行路径,检查工作,再合并回一个答案。
以"是否该为Shopify商家做AI记账产品"为例:规划者先拆解出客户痛点、竞争格局、切入点、定价压力和风险;然后一个研究员深挖Shopify商家的记账痛点(他们用QuickBooks还是电子表格?是否报税时头疼?),另一个研究竞品,第三个研究分发渠道——这三项因互不依赖可并行。接着怀疑者追问:哪些主张真正有支撑?哪些证据已经过时?哪个竞品被忽略了?
这一步比人们以为的更重要。很多AI调研失败,是因为写答案的模型同时给答案打分——这就像让人写自己的绩效评估,然后惊讶于他把自己描述成"有远见的人"。在好的图里,检查是独立的一项工作。
从手动到自动:三个层级的落地路径
这里是人们最容易"用力过猛"的地方。你会在推特上看到有人第一天就上LangGraph、AutoGen或自定义Agent框架。但作者建议起点要简单得多。

第一层(初级):手动运行。 给每项工作单独一条"泳道":一条做客户调研,一条做竞品调研,一条做分发调研,检查泳道攻击证据,合并泳道产出建议。这就是最基础的图工程。虽然比全自动系统慢,但更容易理解。作者建议用Excalidraw或tldraw白板,把最终目标写在顶部,画出各个角色和箭头。第一步是"在自动化之前先画出这张图"。
第二层(中级):让每一步写文件。 用Claude Code、Codex或一个代码仓库,规划者写plan.md,研究员写customer.md、competitors.md、distribution.md,怀疑者写review.md,合并步骤写recommendation.md。这样会留下一条清晰的"纸面轨迹",可以对比版本、复用结构。
第三层(高级):真正的编排工具。 LangGraph适合需要状态检查点、持久化和人机协作审批的场景;AutoGen GraphFlow适合有序步骤、并行、条件分支和循环的定向工作流;n8n、Make.com则适合工作流需要接触Slack、邮件、Airtable或CRM等日常业务系统时。

但核心观点是:工具不是重点,工具应该在工作流之后出现。 如果你自动化了一个你并不理解的工作流,得到的是一团乱麻;如果你先理解工作流,自动化就会变得显而易见。手动版本如果不能产出明显更好的成果,自动化只会更快地产出平庸的东西。
LangGraph、AutoGen和n8n代表了三种不同的设计哲学,选错工具会带来不必要的复杂度。LangGraph是LangChain团队推出的图编排框架,核心优势是"有状态的循环图"——节点可以循环执行、状态可以持久化到数据库、支持人机协作中断点(human-in-the-loop),适合需要条件分支、回溯或长期记忆的Agent系统,但学习曲线较陡。AutoGen是微软研究院的多Agent对话框架,适合多个Agent通过消息传递协作完成任务,GraphFlow是其结构化工作流的扩展,适合有明确顺序和并行的场景。n8n和Make.com则是"无代码/低代码"的可视化工作流工具,其价值在于与真实业务系统的连接器生态——Slack、Gmail、Notion、Salesforce等数百种集成开箱即用,对于不写代码的运营或创作团队,这是最低摩擦的自动化路径。
三个实战场景与一个常见误区
客户支持图:先分类问题(账单/产品困惑/Bug/流失风险)→检查账户上下文(新客户?高价值?是否投诉过?)→搜索文档或内部政策→起草回复→检查者审核准确性、语气和风险→人类批准任何涉及退款、账户变更、愤怒客户或法律风险的动作。
内容图:调研→提出论点→找案例→写钩子→起草脚本→检查者追问案例是否具体、节奏是否合适、写作是否像真人→分支出标题、缩略图、字幕、B-roll。
编程图:制定计划→一个Agent改代码→另一个审查diff→另一个跑测试→另一个在浏览器检查UI→另一个找边界情况→人类批准最终的PR。这基本上就是所有AI编程工具正在走的方向——写代码的模型只是工作流的一部分,杠杆在于规划、测试、审查和判断什么能安全上线。
要警惕的误区:更多Agent不等于更好的输出。 有时更多Agent意味着更多噪音,意味着五个AI自信地重复同一个错误想法,或者系统花在协调上的时间比思考还多。目标不是造最大的图,而是造能提升工作质量的最小的图。好的图应该消除"假等待"、把工人和检查者分开、在错误代价高昂处保留人工批准、在答案足够好时停止,并留下有用的状态。
图工程的复利:工作开始产生记忆
图工程真正被低估的价值,不只是让单个任务变好,而是让你的工作开始产生记忆。每次客户调研图都在积累更好的客户笔记,每次内容图都在积累更好的案例和受众洞察,每次支持图都在积累更好的产品反馈。图既产出工作,也产出让下一张图更聪明的记忆——这就是上下文成为护城河的地方。
如何开始?作者给出清晰路径:挑一个你每周已经在用AI跑的工作流;用一句话写出最终产出;列出一个优秀的人类会做的所有工作;在真正存在依赖的地方画箭头;在昂贵决策前加一个人工关卡;然后手动跑一遍。
跑完一次后,你看待AI的方式会变。你不再执着于"什么才是完美的提示词",而是开始思考"什么才是完美的工作流"。这正是图工程值得关注的原因——它是提示词之后合乎逻辑的下一步。从AI使用者到"AI工作管理者",你不再只是提示AI,而是在管理AI的工作。
这里的"记忆"在技术层面对应的是Agent系统中的长期记忆机制。与对话窗口关闭后状态即消失的短期记忆不同,长期记忆将每次运行的关键输出——客户洞察、有效论点、已排除的竞品——持久化到向量数据库或结构化存储中,供下一次同类任务检索调用。这使得工作流具有"学习效应":第10次运行的客户调研图,能自动引用前9次积累的客户访谈摘要和失败假设,避免重复踩坑。从产品角度看,这正是个人或小团队能建立差异化护城河的机制——相同的LLM,谁的工作流积累了更多高质量的领域记忆,谁的输出质量就越高,且这种优势会随时间复利增长,难以被简单复制。
相关推荐

LynnReal-Omni:32B统一视频扩散模型开源,四步生成多任务全覆盖
LynnReal-Omni 是基于 MiniMax H3 架构的 32B 统一视频扩散模型,支持文生视频、图生视频、姿态引导、视频修复等多任务,四步快速生成,Flash 版单张 H100 上 377ms 完成 540p 视频,权重与 ComfyUI 节点已开源。

Anthropic联合创始人:AI"紧急停止开关"或应强制立法
Anthropic联合创始人向BBC表示,AI系统的"紧急停止开关"(kill switch)可能需要通过法律强制推行。本文分析这一呼吁背后的产业逻辑、技术挑战以及监管与创新之间的张力。

AI数据中心建设热潮,正冲击工业创伤深重的城市
AI数据中心建设热潮正与曾受重工业创伤的城市社区激烈碰撞。以费城为例,全国性反对声浪聚焦能耗、水资源与环境公平问题,揭示AI增长与地方利益的结构性冲突。