用Excel实现AI智能体:任务规划与分解实战教程

引言:当智能体遇到复杂任务
在AI智能体(Agent)的构建过程中,"推理与规划"是核心能力之一——即将一个大目标分解为可执行的多步子任务。AI智能体是指能够感知环境、做出决策并采取行动以实现特定目标的自主系统。与传统的单轮问答式AI不同,智能体具备持续交互、工具调用和多步推理的能力。在大语言模型(LLM)驱动的智能体架构中,推理与规划是连接用户意图与实际执行的桥梁。
这一能力的理论基础可以追溯到经典AI中的STRIPS规划器和层次任务网络(HTN)。STRIPS(Stanford Research Institute Problem Solver)是1971年由Fikes和Nilsson提出的经典AI规划语言,通过定义"初始状态、目标状态、操作符(前提条件+效果)"三元组来描述规划问题,奠定了自动规划领域的理论基础。STRIPS的核心贡献在于将规划问题形式化为状态空间搜索:每个操作符都有明确的前提条件(Preconditions)和效果(Effects),规划器通过搜索从初始状态到目标状态的操作序列来生成计划。这种形式化方法催生了后续数十年的规划研究,包括PDDL(Planning Domain Definition Language)这一至今仍在学术界广泛使用的规划语言标准。HTN则在STRIPS基础上引入了任务分解的层次结构,允许将高层抽象任务递归分解为更具体的子任务,更接近人类解决问题的方式——例如"做一顿饭"可以分解为"准备食材"、"烹饪"、"摆盘",每个子任务再进一步分解,直到达到可直接执行的原子操作层级。现代LLM通过海量文本训练获得了隐式的规划能力——模型通过大量"步骤说明"、"操作手册"等内容,内化了将目标分解为有序子任务的能力,能够在提示词引导下将复杂目标分解为有序的子任务序列。
本文基于一个用Excel实现AI智能体的系列教程,深入讲解如何通过提示词工程让大语言模型具备任务规划能力,从而处理多步骤的复杂数据分析任务。
上一期我们已经实现了智能体的Skill(技能)层,能够对指定单元格进行求和、求平均等简单操作。但当任务变得复杂——比如需要先打开某个Sheet页、逐行读取数据、进行统计分析、最后还要画图——原有的智能体就力不从心了。这正是"任务规划"要解决的问题。
简单智能体为何无法处理复杂任务
我们先来看一个具体场景。Excel中有一个名为"Test"的工作表,里面包含日期和体重两列数据。我们希望智能体能够:
- 自动找到并打开Test工作表
- 读取里面的所有数据
- 进行统计分析(求和、平均值、最大值、最小值等)
- 绘制数据变化图表

这是一个典型的需要"将大目标分解为多步子任务"的场景。用之前没有规划能力的智能体来执行,结果是:它只能读取到Test页A1单元格的内容,然后就卡住了,提示"需要提供更多细节"。显然,缺少任务规划能力的智能体无法胜任这类工作。
从技术角度看,这种失败的根本原因在于:没有规划能力的智能体采用的是"刺激-响应"模式,它只能对当前输入做出即时反应,无法维护一个跨越多步的执行计划。这类似于认知科学中"系统1"(快速直觉)与"系统2"(慢速推理)的区别——复杂任务需要"系统2"式的深思熟虑。心理学家Daniel Kahneman在《思考,快与慢》中提出的这一双系统理论,恰好映射了AI智能体的两种工作模式:系统1对应直接的模式匹配与即时响应,适合简单、高频的任务;系统2对应需要逐步推理、计划制定和状态追踪的复杂任务。缺乏规划能力的智能体本质上只有"系统1",面对需要多步协调的任务时,就如同人类试图用直觉解决需要严密逻辑推理的数学证明题——注定力不从心。
核心方案:一段提示词赋予AI智能体规划能力
解决方案其实出奇地简单——在系统提示词(System Prompt)中加入一段关于任务规划的指令。这就是本期的核心内容。
提示词工程(Prompt Engineering)是指通过精心设计输入文本来引导大语言模型产生期望输出的技术。其核心原理在于LLM是基于条件概率的自回归模型——给定前文(prompt),模型会生成最可能的后续token序列。System Prompt作为系统级指令,会在整个对话过程中持续影响模型的行为模式。常见的提示词工程技术包括零样本提示(Zero-shot)、少样本提示(Few-shot)、思维链(Chain-of-Thought, CoT)等。其中,思维链提示由Wei等人于2022年在论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》中系统提出,核心发现是:通过在提示词中加入"让我们一步一步思考"(Let's think step by step)或提供推理示例,可以显著提升LLM在算术推理、常识推理和符号推理任务上的表现。这一发现揭示了一个重要规律:LLM的推理能力并非固定不变,而是高度依赖于输入格式的激活——正确的提示词可以"解锁"模型在训练中习得但默认不展示的推理能力。本文所用的任务规划提示词本质上是一种结构化CoT的变体,它不仅要求模型展示推理过程,还要求模型以特定格式组织其规划输出。
关键提示词设计
在智能体的系统角色定义中,除了指定它是一个"Excel助手"、列出可用工具之外,新增了这样一段关键提示词:
对于复杂的任务,先制定一个清晰的任务清单,使用数字列表,逐步执行。每完成一步,在后续回复中更新任务清单的完成状态(例如用 [X] 标记已完成的项目)。尽可能在一次响应中先输出单行计划和下一步,再调用相应的工具。

这段提示词的本质是告诉大语言模型三件事:
- 先规划再执行:遇到复杂任务时,先列出任务清单,不要盲目行动
- 逐步推进:按照清单一步一步执行,不要跳步
- 状态追踪:每完成一步就标记完成状态,保持执行过程的可追溯性
这种设计与学术界提出的ReAct(Reasoning + Acting)框架高度一致。ReAct由Shunyu Yao等人于2022年在论文《ReAct: Synergizing Reasoning and Acting in Language Models》中提出,其核心思想是让LLM交替进行推理(Thought)和行动(Action),并观察(Observation)行动结果后继续推理。该框架的关键创新在于将推理轨迹与任务行动交织在一起——推理步骤帮助模型追踪进度、处理异常;行动步骤则通过与外部环境交互获取新信息,突破了纯语言推理的知识局限。在ReAct的标准循环中,每一轮迭代包含三个要素:Thought(模型对当前状态的分析和下一步计划)、Action(调用工具或执行操作)、Observation(工具返回的结果)。这三者形成一个闭环,使模型能够根据实际执行结果动态调整计划,而非机械地执行预设步骤。实验表明,ReAct在HotpotQA、FEVER等知识密集型任务和ALFWorld、WebShop等决策型任务上均优于纯推理(Chain-of-Thought)或纯行动的基线方法,且生成的推理轨迹具有更好的可解释性和可调试性。本文的任务清单机制正是ReAct中Thought步骤的具体实现——模型在每次行动前明确当前计划,在观察结果后更新状态,形成完整的推理-执行闭环。
API调用链路分析
从实际的API请求日志中可以看到,第一次请求的payload里,系统角色(system role)中就包含了上述任务规划的提示词。大模型收到这个指令后,会在每次响应时自觉地:
- 先输出一个任务清单
- 标明当前正在执行哪一步
- 调用对应的工具
- 返回结果后更新清单状态

在OpenAI等主流LLM API的设计中,消息分为system、user和assistant三种角色。System消息定义了模型的行为准则和能力边界,它在每次API调用时都会被包含在上下文中,确保模型行为的一致性。值得注意的是,不同模型对system消息的遵循程度存在差异——GPT-4系列对system指令的遵循度通常高于GPT-3.5,而部分开源模型在经过指令微调(Instruction Fine-tuning)后也能较好地响应system级别的行为约束。这意味着提示词工程的效果并非与模型无关,选择对指令遵循能力更强的模型,往往能让任务规划提示词发挥更稳定的效果。
多轮对话中,**上下文窗口(Context Window)**的管理至关重要。上下文窗口是LLM在单次推理中能够处理的最大token数量——早期GPT-3仅为4K tokens,而GPT-4 Turbo已扩展至128K tokens,Claude 3系列更达到200K tokens。然而,上下文窗口的扩大并不意味着所有信息都能被模型同等关注。斯坦福大学2023年的研究《Lost in the Middle: How Language Models Use Long Contexts》揭示了一个关键问题:当相关信息位于长上下文的中间位置时,模型的检索准确率会显著下降,而位于开头或结尾的信息则更容易被模型利用。这一"中间遗忘"现象对智能体设计有重要启示:关键的系统指令(如任务规划要求)应置于system消息开头,而最新的执行状态应保持在对话末尾,以确保模型始终能够准确感知当前任务进度。在智能体场景中,上下文窗口承担着"工作记忆"的角色,对话历史、工具调用结果、任务状态都需要在有限窗口内维护。本文中智能体通过在每次响应中更新任务清单状态([X]标记),巧妙地将执行状态编码为简洁符号,是一种轻量级的状态压缩策略,避免了需要外部数据库存储执行状态的复杂性。
工具调用(Function Calling)是这一过程中的关键技术环节。OpenAI于2023年6月在GPT-3.5/GPT-4 API中正式引入这一功能,此后成为主流LLM API的标准能力。其工作原理是:开发者在API请求的tools字段中以JSON Schema格式描述可用函数(包括函数名、描述、参数名称、类型和必填项),模型在推理过程中判断何时需要调用工具,并生成符合Schema的结构化参数。值得关注的是,工具描述(description字段)的质量对模型的调用决策有决定性影响——描述清晰、边界明确的工具能让模型更准确地判断何时调用、如何传参,而描述模糊的工具则容易导致误调用或参数错误。这意味着工具设计本身也是一种提示词工程:工具的命名、描述和参数设计,共同构成了模型理解工具能力的"说明书"。API返回tool_calls字段后,应用层执行实际函数并将结果以tool角色消息回传给模型,形成"推理-调用-观察-再推理"的循环。这种设计将"决策"(何时调用、如何构造参数)交给LLM,将"执行"(实际运算、系统操作)交给确定性代码,使智能体既能灵活理解自然语言指令,又能精确操作外部系统。
这种设计巧妙地利用了大语言模型的上下文理解能力,让模型自己成为"项目经理",管理自己的执行流程。
实战效果:多场景验证任务规划能力
场景一:基础统计分析与图表生成
输入指令:"分析Test页的数据,进行统计分析,最后把数据图列出来。"
智能体的执行过程如下:
- 第一步:获取工作表名称,确认Test表存在
- 第二步:读取Test表的数据内容
- 第三步:对数据进行统计分析(总和、平均值、最大值、最小值、中位数)
- 第四步:创建体重变化折线图
每一步完成后,智能体都会更新任务清单,用 [X] 标记已完成的项目。最终不仅输出了完整的统计结果,还在工作表中生成了折线图。
场景二:动态适应未知数据结构
更有意思的是,当我们在Test表中新增一列"身高"数据时,智能体无需预先知道数据格式,就能自动识别并分析所有列。

输入"分析Test1的数据"后,智能体自动发现了日期、体重、身高三列数据,并分别进行了统计分析,甚至主动创建了图表——这一步并没有在指令中明确要求。
这种自适应能力体现了LLM的一个重要特性:它不仅能执行明确指令,还能基于上下文推断用户的隐含意图。当模型读取到数值型时间序列数据时,它"理解"了可视化是数据分析的自然延伸,因此主动添加了图表生成步骤。这种能力在NLP领域被称为"意图推断"(Intent Inference)或"目标补全"(Goal Completion)——模型不仅理解用户说了什么,还能推断用户想要什么。这一能力源于LLM在训练过程中接触了大量的数据分析报告、教程和最佳实践文档,从中习得了"数据分析通常包含可视化"这一隐性知识。这种行为在传统的硬编码流程中是不可能实现的,它代表了AI智能体相对于规则引擎的核心优势:能够处理训练时未明确见过的新情境,通过泛化能力填补指令的空白。
场景三:多维度数据分析
进一步测试,在表中加入姓名和区域列(北京、长沙、上海等),智能体同样能够:
- 识别出数值型数据(身高、体重)并进行统计
- 识别出分类型数据(姓名、区域)并进行汇总
- 统计出共4名人员、3个城市等信息
这说明任务规划能力让智能体具备了对未知数据结构的自适应分析能力。智能体在规划阶段会先"探索"数据结构,然后根据数据类型动态调整分析策略——这本质上是一种数据驱动的自适应规划,而非预设的固定流程。从数据科学的角度看,这种自动区分数值型(Numerical)和分类型(Categorical)数据并采用不同分析策略的能力,对应了统计学中的基本数据类型理论。传统的数据分析工具需要用户手动指定数据类型和分析方法,而LLM驱动的智能体能够通过语义理解自动完成这一判断——"姓名"和"区域"在语义上显然是分类变量,"身高"和"体重"则是连续数值变量,这种常识性判断对人类而言轻而易举,对传统程序而言却需要复杂的规则系统,而LLM则通过语言理解自然地完成了这一推断。
场景四:能力边界的体现
当尝试让智能体"新建一个Sum页,将Test页数据复制过去"时,由于工具列表中没有"新建Sheet"的方法,智能体虽然理解了意图并制定了计划,但在执行时出现了错误。这也体现了智能体的一个重要原则:能力边界由工具决定,规划能力不能超越工具能力。
这一原则在AI安全领域具有重要意义。在安全性和可控性方面,这种设计遵循了最小权限原则(Principle of Least Privilege)——智能体只能执行预定义工具所允许的操作,不能随意扩展能力范围。这与操作系统中的沙箱机制类似,确保AI系统不会执行未经授权的操作。在AI安全研究中,这种通过工具边界约束智能体行为的方法被称为"能力限制"(Capability Restriction),是防止AI系统产生意外副作用的重要手段之一。与之相对的是"目标限制"(Goal Restriction)——通过在提示词中明确禁止某些目标来约束行为。两种方法各有优劣:能力限制更为可靠(工具不存在则物理上无法执行),但灵活性较低;目标限制更灵活,但依赖模型对指令的遵循,存在被绕过的风险。在实际工程中,工具的粒度设计需要权衡:粒度太细会导致规划步骤过多、效率低下;粒度太粗则缺乏灵活性。理想的工具设计应该是原子化但有意义的操作单元,每个工具完成一个明确的、可验证的子任务。
AI智能体任务规划的设计原理
从这个案例中,我们可以提炼出AI智能体任务规划的核心设计思路:
| 设计要素 | 具体实现 |
|---|---|
| 规划触发 | 在System Prompt中明确要求"复杂任务先列清单" |
| 执行策略 | 数字列表 + 逐步执行 + 状态标记 |
| 状态管理 | 用 [X] 标记已完成项,保持上下文连贯 |
| 工具调用 | 每步计划对应一次工具调用 |
| 容错处理 | 工具不存在时给出手动操作建议 |
本质上,这种任务规划能力并不是通过复杂的代码逻辑实现的,而是通过精心设计的提示词,引导大语言模型发挥其内在的推理和规划能力。这也是当前AI Agent开发中一个非常实用的技巧——用提示词工程替代硬编码的流程控制。
值得注意的是,这种方法与业界其他智能体框架的核心思路一致,但实现方式更加轻量。LangChain是目前最流行的LLM应用开发框架之一,由Harrison Chase于2022年10月发布,其Agent模块通过AgentExecutor实现了完整的"规划-执行-观察"循环,内置了多种规划策略(如Zero-shot ReAct、Plan-and-Execute、OpenAI Functions Agent等)以及记忆管理、工具链编排等高级功能。LangChain的Plan-and-Execute策略尤其值得关注:它将规划(Planning)和执行(Execution)分离为两个独立的LLM调用——规划器负责生成完整的任务分解方案,执行器则逐步实施各子任务,这种分离使得规划阶段可以使用更强大(但更慢)的模型,执行阶段则使用更快速(但更轻量)的模型,在效果和成本之间取得平衡。AutoGPT则是早期探索完全自主智能体的代表项目,通过递归自我提示实现长期目标的自主分解与执行,其核心创新在于引入了持久化记忆(通过向量数据库存储长期信息)和自我批评机制(模型评估自己的输出质量并决定是否重试)。相比之下,本文所展示的"提示词驱动"方法属于极简主义路线:无需引入外部框架依赖,直接利用LLM的原生能力,透明度高、调试简单、延迟低。其局限在于缺乏内置的错误重试机制、并行执行能力和长期记忆管理。在需要复杂错误恢复、并行执行或长期记忆的生产场景中,两种方法往往结合使用——用提示词定义行为模式,用框架提供工程化保障。
写在最后
任务规划是AI智能体从"能用"到"好用"的关键一步。通过在提示词中加入清晰的规划指令,我们可以让大语言模型自主地将复杂任务分解、排序、执行和追踪。这种方法简单但有效,特别适合在Excel这类场景中处理多步骤的数据分析任务。
对于有数据分析需求的用户来说,这种Excel智能体的实际应用价值不容小觑——你只需要描述你想要的分析结果,智能体就能自动规划执行路径,完成从数据读取到图表生成的全流程。
从更宏观的视角来看,这个案例展示了一个重要趋势:AI智能体的能力提升越来越多地依赖于"软件层"(提示词设计、工具编排)而非"硬件层"(模型参数、训练数据)的优化。斯坦福大学HAI研究院将这一趋势称为"基础模型的能力涌现"(Emergent Capabilities of Foundation Models)——随着模型规模的增大,许多能力(包括规划、推理、代码生成等)并非通过专门训练获得,而是在达到某一规模阈值后自然涌现。这意味着提示词工程本质上是在"激活"模型已经具备但尚未显现的潜在能力,而非凭空创造新能力。对于开发者而言,掌握提示词工程和工具设计的技巧,可能比等待下一代更强大的基础模型更具即时价值。
核心要点
核心要点
相关推荐

特朗普手机悄然涨价250美元,T1 Phone定价升至749美元
Trump Mobile旗舰T1 Phone从499美元悄然涨至749美元,涨幅达250美元,硬件配置未做任何升级。深入分析特朗普手机静默涨价背后的供应链压力、品牌定价策略及市场竞争困境。

DeepSeek V4-1 Flash发布:552B参数MoE多模态模型支持百万上下文
DeepSeek发布V4-1 Flash多模态大模型,采用552B参数混合专家架构(MoE),支持100万tokens超长上下文窗口。深入解析其MoE架构、多模态能力、成本优势及对AI行业的影响。

沃尔沃XC40插混版回归:传感器升级+Gemini AI加持
沃尔沃XC40 PHEV插电式混动版时隔三年重返市场,带来全新外观设计、升级传感器套件及谷歌Gemini AI车机系统。了解这款车型的核心升级亮点、插混回归的市场逻辑及生成式AI进入座舱的深远意义。