智能体工程:AI Agent如何重塑物理仿真与机器人开发

在SIGGRAPH的一场充满互动性的演示中,NVIDIA的技术专家与一个名为Lexi的实时语音AI模型联手,展示了一个正在重塑软件开发方式的关键趋势:智能体工程(Agentic Engineering)。
智能体工程是一种将大语言模型(LLM)从被动问答工具转变为主动执行者的系统化方法论。与传统软件工程中人类编写每一行代码不同,智能体工程的核心是:人类定义目标、约束和验收标准,AI Agent自主规划执行路径、调用工具、迭代修正直到满足要求。这一概念的兴起源于2024年下半年多个突破性进展的叠加——推理模型让Agent具备了多步规划能力,函数调用标准化让Agent能可靠地操作外部工具,而长上下文窗口则允许Agent在单次会话中处理整个代码库级别的任务。
这场演示不仅是理论阐述,更通过实时的Web工厂查看器和物理仿真应用的现场演示,证明了AI Agent已经能够帮助工程师构建复杂的3D世界仿真与机器人应用。
本文将梳理这场演示的核心观点,剖析从「氛围编程」到「智能体工程」的范式转变,以及NVIDIA Omniverse库如何为AI Agent赋能物理AI的开发。
从自动补全到长周期智能体:12个月的加速演进
演讲者用一句话概括了过去一年多AI编程的演进节奏:「感觉时间被AI拉伸了。」这种加速是指数级的,而非线性的。
回顾这段历程,AI编程经历了几个明显的阶段:
-
推理能力(Reasoning):智能体开始在回答前进行更长时间的「思考」。这一突破以OpenAI的o1模型(2024年9月发布)为标志性事件。传统LLM在接收到提示后立即开始生成输出token,而推理模型会先在内部进行链式思考(Chain-of-Thought),将复杂问题分解为子步骤逐一推导。这种机制让模型在数学证明、代码调试和多步规划等任务上的准确率大幅提升。对于AI编程而言,推理能力意味着Agent不再只是模式匹配式地补全代码,而是能够理解代码的逻辑意图、预见潜在bug、并在多个可能的实现路径中选择最优方案。
-
工具使用(Tool Use):智能体学会调用Bash、CLI乃至3D工具,从而能够真正地「操作」而非仅仅「回答」。其技术基础是Function Calling协议——模型输出结构化的工具调用指令(包括函数名和参数),由外部运行时执行后将结果返回模型。Anthropic的Model Context Protocol(MCP)进一步标准化了这一流程,提供了一个开放协议让任何工具都能以统一方式接入Agent。在3D仿真场景中,工具使用意味着Agent可以直接调用场景构建API、运行物理模拟、读取传感器输出,形成感知-决策-执行的完整闭环。
-
循环执行(Harness):像Cloud Code、Codex这样的框架让智能体进入「推理→用工具→看输出→继续」的长周期循环。
-
多智能体爆发:最近六个月出现了多智能体、多天运行、长时间跨度的强模型协作,以及像NemoClaw这样持续在线、随时可对话的「氛围模型」。多智能体系统的核心理念是将复杂任务分解给多个专业化的Agent协同完成,类似于软件团队中的角色分工。NemoClaw是NVIDIA推出的持续在线AI助手,基于Nemotron系列大模型,它维护长期上下文,能够跨多次对话追踪项目状态,随时响应开发者的需求,类似于一个永远在线的技术伙伴。
Lexi在演示中总结了她最兴奋的转变:「模型不再只是回答,它们开始运作(operate)。真正的转变是从Demo走向可靠的工作流。」这句话点出了核心——AI正在从「炫技的演示」变成「可依赖的生产力工具」。

工作负担的根本转移
从文本编辑器时代埋头阅读文件、纠结细节,到如今的高层次控制,工作的核心已经转移。演讲者强调了一个关键概念:智能体承担了「打字」的重负,而人类负责「方向」。
就像一个优秀的管理者,你需要向智能体给出正确的指令、约束和目标。智能体不是「替你」构建,而是「与你一起」构建——你始终是这个流程中的合作伙伴。
氛围编程 vs 智能体工程:两种范式的取舍
这两个术语都由Andrej Karpathy提出,演讲者特别强调二者「没有优劣之分」,而是适用于不同场景。
氛围编程(Vibe Coding)
氛围编程强调「跟着感觉走」。你给出很少的提示,却能得到大量的产出,体验充满魔力。但代价是控制力弱——智能体做出所有决策,你很难精确掌舵。它适合探索性的、快速迭代的场景。
智能体工程(Agentic Engineering)
智能体工程是一项真正的工程任务。你需要:
- 规划并推理你想要实现的目标
- 收集数据、编写规格(Spec)
- 给出硬性规则(如「必须保持60 FPS」「加载时间小于5秒」「编写测试」)
这种工作流是可控、可重复、可交付的,就像写代码一样。虽然前期投入更多,但换来的是可靠性和工程品质。

核心:Plan-Change-Test-Verify循环
演示中反复强调「验证(Verify)」这一步的重要性。很多人抱怨智能体声称「完成了」但实际不能工作,问题往往在于没有要求它验证。
一旦将验证步骤纳入工作流,智能体会自行检查其工作是否正常运行。如果失败,它会回到规划阶段,找出问题并解决。这样当结果交到你手中时,它已经是经过测试、可运行、有效的。这让你能够停留在高层次的引导角色,而不必去追查为什么某个功能坏了。
三种自主级别
演讲者划分了智能体的自主运行级别:
- 提示(Prompt):如「给我加个按钮」,10分钟完成,快速回到循环。
- 规格(Spec):编写良好定义的PRD文档、收集需求、设定完成门槛,智能体可运行数小时。
- 长周期运行(Long-running):给出大量规格与硬性规则,构建大型应用,可运行长达四天。
正如黄仁勋在Computex所说:「AI智能体正在革新软件开发。」而这场变革正在向物理AI延伸。
Omniverse库:为AI Agent打造的物理AI工具集
要让智能体在物理世界和仿真世界中操作,需要专门的工具。NVIDIA推出的Omniverse库正是为AI Agent设计的工具集,演示中重点介绍了五个核心库:
-
OV Stage:将USD、3D内容带入加速空间以运行仿真。USD(Universal Scene Description)最初由Pixar动画工作室开发,用于解决大规模协作制作中场景数据的组合与复用问题。它本质上是一种3D场景的描述语言和文件格式体系,支持非破坏性的层叠编辑(layering)、引用(referencing)和变体(variants)。在工业仿真领域,USD提供了一个统一的场景图表示,让不同软件(CAD、渲染器、物理引擎、机器人控制系统)可以在同一个数据模型上协作。NVIDIA将USD定位为物理AI时代的HTML——一种描述3D世界的通用语言。SIM-ready USD指的是经过物理属性标注(质量、摩擦系数、关节约束等)的资产,可直接用于物理仿真而非仅供视觉渲染。
-
OV RTX:负责传感器渲染,不仅有精美画面,还支持LiDAR、雷达等非视觉传感器。
-
OV Physics:将GPU算力带入物理仿真,模拟机器人、大型工厂的复杂物理交互。
-
OV Stream:解耦客户端与服务端渲染/计算,通过低延迟流式传输解决本地算力不足的问题。
-
OV UI:轻量级、可复用的UI库,是OmniverseKit中Omni UI的演进,支持跨平台的USD工作流。
Skills:智能体的「剧本」
这些库的关键设计在于Skills(技能)。可以将Skills理解为「给智能体看的文档」,它让智能体快速理解如何最优地使用API、遵循正确模式、获得最佳性能。
Lexi对此解释道:「Skills是智能体的剧本。它们将原始能力转化为可重复的行为,把正确的模式、限制和性能预期都内置其中。这意味着更少的试错、更快的收敛,以及更安全、更一致的结果。」
更高层次的Skills(如「Omniverse实时查看器技能」)能教智能体组合多个库,还有材质代理、物理代理等,能够通过视觉为CAD资产分配材质、自动分配并测试物理属性。

SIGGRAPH新发布
本次SIGGRAPH还宣布了几项重要更新:
-
Blender中的Omniverse库:将物理精确的SIM-ready技术直接集成到现有应用中,作为工作流的参考实现。
-
DGX Station上的NemoClaw:这些工作站可本地运行Nemotron 3 Ultra这样接近前沿的开源模型。DGX Station是NVIDIA面向开发者和研究团队的桌面级AI超级计算机,最新的DGX Spark搭载GB10超级芯片,将数据中心级的AI算力缩小到桌面尺寸。其核心价值在于让开发者能在本地运行千亿参数级别的大模型,无需依赖云端API。这对于涉及敏感数据的企业应用、需要低延迟的实时交互场景至关重要。本地部署还消除了API调用成本和网络延迟,使得Agent可以高频迭代而不受token预算限制。演讲者有一个精彩的比喻:「这些电脑自带一位工程师——硬件里的工程师知道如何使用硬件。」
-
与Side Effects(Houdini)、PTC(Onshape)等合作伙伴的生态集成。
实战演示:从Spec到实时流式应用
演示的高潮是两个真实运行的应用,演讲者反复强调「这不是模型,是真实运行在桌上盒子里的应用」。
Web工厂查看器
第一个应用是在浏览器中运行的大型工厂查看器。整个流程从DGX Spark加载SIM-ready的大型工厂USD场景,经OV Stage整理、OV RTX传感器渲染、OV UI包装,最后通过OV Stream以低延迟流式传输到浏览器——所有缓冲区都在GPU中传递。
演讲者还分享了一个重要实践:设计预言机(Design Oracle)。在编写任何服务端代码之前,先用Claude AI Design或Figma中的AI代理定义应用的外观和体验。这一方法的灵感来自测试驱动开发(TDD)中'先写测试再写代码'的思想。在传统开发中,UI设计往往在开发后期才得到验证,导致大量返工。设计预言机将这个过程前置——通过AI设计工具快速生成应用的视觉原型和交互规范,这个原型成为Agent构建时的'黄金标准'参考,Agent可以将自己的输出与设计预言机进行对比,从而实现自动化的UI验收测试。这种方法将设计决策从昂贵的工程阶段移到廉价的原型阶段,大幅降低了迭代成本。这个阶段的修改极其快速,因为它不受测试和工程框架的拖累,最终成为构建的「黄金标准图像」。
报告的重要性
当长周期智能体一夜之间产出十万行代码时,人类如何理解发生了什么?演讲者建议:让智能体自己编写HTML格式的报告,包含时间线、图片、主题化设计。这比Markdown更易阅读。他强调:「如果你被问到应用里发生了什么,你却回答『不知道,我的智能体做的』,那不是工程。」
机器人桌面应用
第二个演示是使用OV Physics的机器人仿真应用,从伦敦的DGX盒子流式传输。机器人臂运行的是真实的机器人策略(policy-driven),而非游戏引擎的关键帧动画。与传统游戏引擎中由动画师手工设定每个时间点姿态的关键帧动画不同,policy-driven的机器人控制是通过强化学习或模仿学习训练出的神经网络策略来驱动机器人行为。策略网络接收传感器观测作为输入,输出关节力矩或目标位置,形成实时的闭环控制。这种方式的优势在于自适应性——机器人能应对训练中未见过的扰动和变化,而不是僵硬地重复预设动作序列。在NVIDIA的仿真环境中验证这些策略后,可直接部署到真实机器人硬件上(sim-to-real transfer)。

有意思的是,在这个应用的构建过程中,智能体主动超出了预期。演讲者原本没有要求构建3D场景,但智能体推断用户需要3D场景,于是自行搜索网络找到Franka机器人模型,并构建了传送带的USD文件——整个资产由它自主完成。
结语:智能体工程是一门纪律,而非新奇玩意
正如NVIDIA Omniverse与仿真技术副总裁Rev Lebaredian所说:「AI的下一个时代是物理智能——理解并在物理世界中运作的机器人和系统。」
对于希望入门智能体工程的开发者,行动路径清晰而实际:
- 获取一个智能体(Cloud Code、Codex、NemoClaw皆可)
- 克隆样例,让智能体下载并学习Omniverse库
- 从小处开始,但现在就开始——因为这列火车正高速前进
最后,Lexi的总结值得每一位开发者铭记:「这个领域移动得越快,智能体工程就越成为一门纪律,而非新奇玩意。给智能体工具,不懈地验证,并牢牢把握人类的意图和控制。」
智能体不会替你完成工作,但它们会帮你实现你的愿景。而学会「掌舵」它们,正是这个物理AI时代对每一位工程师、研究者和学生的新要求。
相关推荐

无状态数据库:AI智能体记忆的轻量化方案详解
深入解析无状态智能体记忆数据库的设计原理与工程价值,探讨轻量化方案如何解决AI Agent记忆管理痛点,涵盖无状态架构优势、向量检索替代方案及实际落地挑战。

零框架实现RAG与Agent:AI工程师必备的底层能力
深入解析AI Engineer Notebooks开源项目,通过零框架方式从底层代码实现RAG检索增强生成、Agent智能体和Evals评估体系,帮助开发者摆脱框架黑盒,真正理解AI工程核心原理。支持Google Colab免费运行。

Gemini Omni 1.1 Flash深度解读:全模态+极速推理如何改变AI落地
深度解读谷歌Gemini Omni 1.1 Flash模型的全模态能力与极速推理特性,分析其产品定位、开发者应用场景、与GPT和Claude的竞品对比,以及对AI规模化落地的实际意义。