AI Agent实战指南:三层用法让效率翻倍

从聊天问答到自主完成任务,本文系统讲解AI Agent的三层用法与能力叠加方式。
本文以B站UP主实操分享为基础,梳理了AI Agent与普通聊天框的本质区别:前者交付"做完的事",后者只给"一段回答"。文章将Agent用法分为三层递进:第一层是把填表格、视频转录、查资料等机械杂事直接交出去;第二层通过CLI(软件专用接口)、Skill(操作手册)、插件(专业能力包)为Agent叠加能力;第三层是给出复杂目标,让Agent调动全部工具自主实现,典型案例包括行程规划PDF、飞书目标拆解录入待办,以及用Final Cut Pro完成视频初剪。文章最后强调,效率工具再强,决策与判断始终属于人,提升自身认知才是根本。
同样一个AI聊天框,如今已经分化出两种截然不同的用法。有人还停留在"问AI怎么做,再自己动手"的阶段;另一部分人则直接把文件夹丢给AI,让它读资料、整理数据、生成表格,最后直接交出成品。后一种做法,正是当下AI应用最重要的变化——AI Agent。
这篇文章基于B站UP主的实操分享,系统梳理AI Agent的用法与技巧。无论你是各行各业的上班族,还是独立工作者,这套方法都能派上用场。
从"回答问题"到"完成任务"的根本转变
普通聊天框的逻辑很简单:你问一句,它答一段,对话就此结束。Agent则完全不同——你交给它一个目标,它会想一步、做一步、看一眼结果,再决定下一步。走错路会换方向,信息不够会继续查,直到把事情真正做完。
这套工作方法被称为 ReAct(Reason + Act),是让 Agent 走通任务路径的核心机制。过去 AI 交付给你的是一段回答,现在 Agent 交付的是一件做完的事。
值得关注的一个技术细节:传统 AI 聊天框的单次回答有 Token 上限,一次最多能写多长是固定的。但在 Agent 场景下这个限制基本消失了——它会自驱式地一轮轮干活,写不完就接着写,直到整件事交付出来。
正因如此,从年初 Claude Code 带火这个概念开始,OpenAI 的 Codex、各家的 Agent 应用都在朝成熟方向演进。使用方式高度趋同,随便挑一个顺手的就能上手。
ReAct 框架由 Google 研究人员于 2022 年提出,全称 Reasoning and Acting。其核心思路是让语言模型交替执行「思考」(Thought)和「行动」(Action)两类步骤,并在每次行动后观察环境反馈(Observation),再决定下一步。这与人类解决问题的方式高度相似:先分析情况,再动手,看结果,再调整。传统的一次性生成(Generate-only)模式无法处理需要多步骤、依赖中间结果的复杂任务,而 ReAct 让 Agent 能够根据实际进展动态修正路径,而不是在开始时就把所有步骤"猜完"。现代主流 Agent 框架(如 LangChain、AutoGen、Claude Code)均以 ReAct 或其变体作为任务推进的底层逻辑。
第一层:把手头杂事原样交出去
最简单的实践,就是把你手头的机械杂活直接扔给它。
填表格是最典型的例子。有一份 Excel 模板要填,内容你都有,但搬运工作很枯燥。你可以直接说:"这张 Excel 是模板,这是我准备的材料,帮我基于模板尽量把内容填进去。"从结果能看到它做了两件事:一是动手——真的在操作电脑里的文件,而不是教你怎么填;二是动脑——填之前它要先想清楚每一栏要什么、材料哪部分对得上。

丢一段视频问内容难度更高。大模型本身听不了视频,但 Agent 会自己想办法:先把音频从视频里拆出来,再找一个开源的语音转文字模型把声音转成文字,最后读完给你总结。整个过程你不需要教它任何一步,它会自行构思出一条能"听"视频的路线。
查最新信息做对照表则暴露了另一个能力。比如让它列一份最新的 Mac mini 全系配置和售价对照表——这类信息在模型脑子里往往是过时的,所以它会自己打开浏览器,去苹果官网像人一样一页页翻,再整理成表。
这三件小事归纳起来,说明这个助手已经具备三样本领:直接操作电脑、没有现成能力时自己想办法、信息不够时自己上网查。这体现了一个思维方式的转变——从现在起,你和电脑之间多了一个实操者,你要做的是发号施令、验收成果,而不是亲自上手。
第二层:给 Agent 叠加能力
Agent 的能力不是固定的,可以往上叠加。叠加方式主要有三种:CLI、Skill、插件。
CLI:给程序留的一扇门
以飞书文档为例。飞书不是公开网页,有自己的门禁和操作逻辑,Agent 一开始读不了。但飞书官方提供了一个叫飞书 CLI 的东西——你可以把 CLI 理解成软件专门给程序留的一扇门,还附了一本开门说明书。图形界面是给人用的,这扇门是给程序走的,而 Agent 恰好擅长走这种门。
你只需说"帮我安装飞书 CLI",装好并读完说明书后,再让它"把这份内容更新到我飞书的某某文档",它就能直接做到。留这种门的软件很多,包括谷歌全家桶、Notion、GitHub,以及 Mac 自带的快捷指令。你常用的软件有没有这扇门,直接问 Agent 就行。

CLI 全称 Command Line Interface(命令行界面),是软件提供给程序或脚本调用的文字指令接口。与人通过鼠标点击图形界面操作软件不同,CLI 允许另一段程序用标准化的文字命令来触发同样的功能——例如"创建文档""读取内容""更新字段"。对 Agent 而言,CLI 的价值在于确定性:每条指令的输入输出格式固定,不会因为界面改版而失效,且可以批量、高速执行。许多企业级软件和开发者工具都提供官方 CLI,包括文中提到的飞书、Notion、GitHub,以及 AWS、Vercel 等云服务平台。判断一个软件有没有 CLI,最直接的方式就是在搜索引擎里查"软件名 + CLI"或"软件名 + API"。
Skill:别人走通的操作手册
比如让它下载一条视频并保留最高画质,它默认可能只搞到低清版本,因为很多网站的最高画质视频和音频是分开存储的。这时你可以说"帮我找一个能下载最高画质某平台视频的 Skill",装上后它就掌握了完整流程:先查网站提供哪些格式、分别下载最高质量的视频和音频、合并、最后检查能否正常播放。
Skill 相当于一份别人已经走通的操作手册。互联网上的 Skill 库已经非常庞大,问 AI 去找就好。更实用的一点是:你和 AI 磨合出来的流程也能反过来沉淀成 Skill——某个工作折腾了一下午才跑通,补一句"把刚才这套流程总结成 Skill",下次直接复用。用得越久,Agent 越顺手。

插件:一整套外部专业能力
插件是 Skill 和 CLI 的更进一步,相当于给模型接上整套外部专业能力。以给 AI 做动效为例,大模型本就擅长写网页代码,而开源的动画框架插件能结合大模型能力,直接把需求变成动画视频。装上插件后你说"把这段讲解做成一条 10 秒动画",它会自己设计画面、生成动画、预览、渲染。Agent 只是接了一条别人跑通的生产线,却实现了以前想都不敢想的能力。
小结第二层:CLI 是操作软件的门,Skill 是手册,插件是完整的装备箱。结合第一层,此时的 Agent 已经是一个有手有眼、还背着工具包和操作手册的助手。
第三层:给一个复杂目标,让它自主实现
前两层都是你指定一件具体的事。第三层换个玩法——给它一个更复杂、更大的目标,让它调动全部能力自主实现。
此时的 Agent 会看、会听、会查,能操作浏览器、会想会写、能操作软件;有门就走 CLI 和插件,没门就直接看屏幕、像人一样动鼠标敲键盘(Computer Use)。相当于电脑里有了一个样样都会的助理。
行程规划是入门例子。把大致路线丢给它:从某地出发去某地玩三天,想吃牛肉火锅也想去海边,帮忙查会不会下雨台风、排好每天行程、生成一份 PDF。它会先查沿途天气,结合路线判断哪天适合去海边、哪天有雨安排室内活动,最后写出一份 PDF,连吃什么去哪里都安排清楚,末尾还单列天气风险提醒。这里的"写"已不是一段文字,而是直接产出 PDF。
从工作目标到待办清单用到了 CLI、思考和 Computer Use。把飞书里的月度目标文档拆成本周任务、录进提醒事项 App:它先用飞书 CLI 读出目标文档,思考如何拆解,因为待办软件没留 CLI,它就直接用 Computer Use 打开软件,把任务一条条录进去。
用 Final Cut Pro 剪片是最复杂的案例,也是最令人震惊的一次。把口播素材、脚本、B-Roll 素材一起给它,要求完成初剪。它的做法是:先把视频里的声音转成带时间点的文字,对照脚本判断哪句是重复口播并删除;然后找到苹果官方文档,学会 FCPXML(Final Cut Pro 工程文件格式)的用法,把剪辑决定变成工程文件;再看 B-Roll 素材,结合上下文判断哪段画面该叠在哪句话上;最后用 Computer Use 在 FCP 里把一切落到时间线上。

实事求是地说,这整套跑下来要花不少时间,初剪也不等于成片。但第三层的含金量在于:除了更高层的决策,剩下的活只要给足时间和 Token,它都有可能替你办到。你要做的只有一件事——把目标说清楚。
Computer Use 是指 AI Agent 直接操控计算机图形界面的能力——像人一样移动鼠标、点击按钮、输入文字、截图观察屏幕变化。Anthropic 于 2024 年 10 月率先在 Claude 3.5 Sonnet 中公开演示了这项能力。它的意义在于,当一款软件既没有 CLI 也没有开放 API 时,Agent 仍然可以通过"看屏幕、动鼠标"的方式完成操作,相当于把任何有图形界面的软件都变成可被调用的工具。目前 Computer Use 的速度和稳定性仍不及 CLI 方式,复杂界面操作容易出错,因此实际使用中通常作为 CLI 不可用时的兜底手段,而非首选路径。
Project:给长期任务开一个专属工位
不同场景磨合出的默契,可以归到 Project。它相当于给一件长期的事单独开一个工位,相关资料、规则、历史对话都存在项目里。进了这个门,Agent 就知道自己在给谁干活、按什么标准干。
比如一个专门做脚本创作的 Project,里面放着人设、语言习惯、写作规范和过去几十期脚本。写新脚本只需给一个主题和想法,它就会带着既定风格产出初稿。
关键提醒:交出任务,但别交出判断
"把尽量多的事交给 AI"这个思路,并不意味着把判断和责任也一起交出去。做决策的永远是人。AI 达成结果的上限,就是你的认知上限。它目前能做的还只是提升效率,让工作结果更出色的不是 AI,而是你自己。
每次准备干一个任务前,都可以先问自己一句:这件事是不是可以交给 AI?如果是,就先试着交给 Agent。AI 真正给你的,是让你把省下来的时间投入到更值得坚持的事情上——提升自己的认知,永远是最重要的那件事。
相关推荐

Ollama入门指南:让本地电脑轻松运行大模型
Ollama 让大模型在本地电脑离线运行,无需联网、免费无 token。本文详解 Ollama 的安装、命令行与 Web UI 使用、模型下载与管理方法,以及运行大模型的硬件要求。

24GB MacBook Air 跑本地 AI:为什么我选 Qwen 9B?
在 24GB M5 MacBook Air 上跑本地大模型,为什么选千问 3.5 的 9B?实测对比内存占用、翻译自然度、看图能力与工作流配置,给出务实的本地 AI 选型建议。

OpenAI Agents API 公测上手:托管沙箱、Artifacts 与 Skills 实测
OpenAI 发布公测版 Agents API,将 Codex 背后的 Agent Harness、托管沙箱、Artifacts 和 Skills 开放给开发者。本文基于B站实测演示,解析其架构与两个真实请求的完整工作流程。