上海交大开源《动手学AI》:从API调用到RAG、Agent实战入门

上海交大开源《动手学AI》教程,以实战案例拆解API调用、提示词工程与推理增强全流程。
上海交通大学张卓胜教授团队开源的《动手学AI》教程,以「零基础动手实操」为定位,覆盖从API调用到Agent开发的完整工程链路。文章重点拆解了两个典型案例:其一是旅游景点结构化提取,涉及环境变量安全管理、Few-shot提示词设计、正则解析及try...except容错等实用工程细节;其二是多约束逻辑推理题,通过思维链(Chain-of-Thought)提示显著提升模型推理准确率。教程的核心价值不在于理论深度,而在于将实战中高频却被教科书忽略的细节讲透,适合想入行大模型工程的零基础新手对照代码边学边练。
一套让AI圈热议的高校开源教程
最近AI社区里流传着一套颇受关注的实操教程——由上海交通大学团队开源的《动手学AI》系列。这套教程由张卓胜教授主导,联合多位业内专家共同打造,主打「零基础也能上手」的实战路线。
与市面上大量停留在理论层面的课程不同,它的核心卖点在于「动手」二字:从最基础的API调用讲起,逐步深入到模型部署、微调、安全防御,直至自动化智能体(Agent)开发。教程强调本地化部署能力,学完后可以在自己的电脑上运行专属大模型,不依赖外网,隐私与数据安全也更有保障。
对于想入门大模型工程的新手来说,这类「把知识喂到嘴边」的实操路径确实降低了门槛。本文以教程中的两个典型案例为切入点,拆解它到底教了什么、思路是否值得借鉴。
案例一:用大模型做结构化信息提取
教程的第一个实战案例,是一个「旅游景点提取」任务:给定一段文本,让模型从中抽取中国的旅游景点,并输出成结构化列表。

环境变量与API密钥管理
案例演示了工程中的一个基础规范——不要把API密钥硬编码到代码里。讲师以火山方舟平台为例,先在「API Key管理」中新建并复制密钥,再写入 .env 文件,通过 os.getenv() 从环境变量中读取。
值得留意的是,演示过程中一度报错 missing credits, pass an API key,排查后发现是漏写了 load_dotenv() 这一行——环境变量没有被加载进来。这个「翻车」细节反而真实:环境变量加载失败是新手最常踩的坑之一,补上加载语句后即恢复正常。
提示词工程是效果的关键
讲师反复强调提示词(Prompt)写作的重要性,并总结了几个通用要点:
- 角色分配:明确告诉模型「你是一个旅游景点提取大师」
- 任务边界指定:限定模型只做提取、不做发散
- 输出格式强制约定:要求以特定格式返回,便于后续解析
- Few-shot Learning:通过示例引导模型输出
构建消息列表时,用户问题通过 prompt.format(query=...) 填充到提示词模板中,再作为 user 角色的 content 传入模型。由于这是单次任务而非对话系统,因此省去了历史消息列表(history message list)。

Few-shot Learning(少样本学习)是提示词工程中的一种重要技巧:通过在提示词中提供少量输入-输出示例,让模型「类比推理」出期望的输出格式和风格,而无需对模型权重做任何修改。与之对应的是 Zero-shot(零样本,直接给指令不给例子)和 Fine-tuning(微调,需要大量数据重新训练)。在结构化信息提取场景中,Few-shot 特别有效——给模型展示一两条「输入文本→输出列表」的完整示例后,模型会自动对齐输出格式,大幅降低格式错误率。示例数量通常 2-5 条即可,过多反而会占用大量 token 并可能分散模型注意力。
用正则表达式解析模型输出
模型返回的往往是带格式的文本(如用竖线分隔、括号包裹的列表),需要解析成Python列表才能被程序使用。有意思的是,讲师直接演示了一个「偷懒但高效」的方法:把「请帮我用Python正则写一个解析成list的脚本」这个需求丢给大模型,让它自动生成解析函数。

生成的解析逻辑核心是:先用正则匹配出括号内的 pattern,再按竖线(|)切分,得到最终列表。为增强兼容性,正则还考虑了括号前后可能存在多余文字的情况。

此外还有两个工程细节:一是用 try...except 包裹解析逻辑,一旦模型输出无法解析就返回空列表,保证程序不崩溃;二是对输出中多余的双引号做了清理,最终得到干净的单元素列表。这套「结构化输出 + 结构化解析」的组合,是把大模型接入实际业务的基础套路。
案例二:逻辑推理任务与思维链
第二个案例是一道逻辑推理题:ABCD四名员工分别对应运营、设计、技术、人事四个岗位,通过若干约束条件(如A不做技术和设计、B负责员工对接与考勤、C精通代码开发但不做运营、D不做设计)反推每个人的岗位。
这类问题对大模型并不友好——约束条件之间存在多重依赖,模型容易「跳步」出错。教程给出的应对思路,是通过提示词引导模型使用思维链(Chain-of-Thought):明确要求它「严格按照思维链模式完成推理,逐步拆解解题过程」。
通过角色设定(「你是一个严格的推理大师」)加上强制的逐步推理约束,能显著提升模型在这类逻辑题上的表现。这也印证了一个业界共识:对于推理密集型任务,引导模型「把思考过程写出来」往往比直接要答案更可靠。
思维链(Chain-of-Thought,CoT)由谷歌研究员 Wei et al. 在 2022 年提出,核心发现是:当提示词中要求模型「一步一步思考」或提供带有中间推理步骤的示例时,模型在算术、常识推理和符号推理等任务上的准确率会显著提升。其背后机制是让模型在生成最终答案前,先在 token 序列中「写出」中间推理过程,相当于给模型提供了一个「草稿纸」。后续研究进一步衍生出 Zero-shot CoT(只需在提示中加入"Let's think step by step"之类的触发语)以及 Tree-of-Thought、Self-Consistency 等变体,统称为推理增强提示技术。对于多约束逻辑题,CoT 的效果尤为明显,因为逐步排除法正好契合模型逐 token 生成的工作方式。
这套教程适合谁
从演示内容看,《动手学AI》的定位相当明确——面向想入行的工程新手,覆盖从API调用、提示词工程、结构化解析到推理增强的完整链路,后续还延伸到RAG、Agent、MCP、模型部署与微调、安全防御等进阶主题。
它的价值不在于讲多深的原理,而在于把「怎么动手做」讲透。像环境变量管理、try...except 容错、正则解析这些细节,恰恰是教科书容易忽略、实战中却天天用到的部分。演示中真实出现的报错与排查过程,反而比一帆风顺的Demo更有教学意义。
对于零基础学习者,建议配合官方开源资源边看边敲代码,把每个案例在本地跑通,再尝试改写提示词观察输出变化,这样才能真正把「喂到嘴边」的知识吃进去。
RAG(Retrieval-Augmented Generation,检索增强生成)和 Agent 是教程后续章节涉及的两个核心进阶方向,理解它们有助于判断学习路径的价值。RAG 的思路是:不把所有知识塞进模型参数,而是在推理时动态检索外部文档库,将相关片段拼入提示词后再让模型生成答案,从而解决大模型知识截止日期和幻觉问题。Agent 则更进一步,让模型不仅能「说」还能「做」——通过调用工具(搜索、代码执行、文件读写等)完成多步骤任务,MCP(Model Context Protocol)是近期兴起的用于规范 Agent 工具调用接口的协议标准。这两项技术目前是大模型落地应用的核心架构,掌握它们意味着能构建真正可用于生产环境的 AI 应用。
相关推荐

AI早报:千问全模态Qwen3-Omni发布,华为昇腾960与Grok新模型齐现身
9月18日AI早报:千问推出原生全模态模型Qwen3-Omni Flash,音视频成本降超93%;华为披露百万级处理器计算架构并传昇腾960将发布;Grok新版现身谷歌云,OpenAI推ChatGPT for Word,N8N爆满分漏洞。

小米MiMo-V2.6直播训练:一天半烧850万,每秒约10美元
小米MiMo大模型团队直播MiMo-V2.6 Pro/Flash的强化学习训练过程,一天半已花费约855万人民币,每秒烧约10美元。本文解析其三方向算力扩展路径、开源计划与DeepSWE基准跑分对比。

字节Trae Work上手指南:11个应用场景解析
字节通用AI agent产品Trae Work上手指南,详解Work、Code、Design三大板块及PPT生成、数据分析、深度研究、代码开发等11个应用场景,帮零代码用户快速判断如何用它解决实际问题。