AI生图到3D建模:用Blender浏览器查看器打通多模态工作流

Simon Willison 用 GPT-4o 生图、Codex 智能体驱动 Blender,17分钟内从一句提示词生成可浏览器查看的3D法贝热彩蛋。
开发者 Simon Willison 分享了一个完整的多模态 AI 工作流实验:首先用 ChatGPT Images 2.5 生成一枚以电视剧《Pluribus》为主题的法贝热彩蛋图像,随后将图片输入运行 GPT-4o(Codex)的编码智能体,借助预先定义好的 Blender Skill 文件,智能体在约18分钟内自主编写并执行 Blender 脚本,产出包含78万顶点、17种材质的复杂 .blend 文件。最终通过他此前"氛围编程"搭建的浏览器 .blend 查看器,任何人无需安装 Blender 即可在线预览该3D模型。这一案例的核心价值不在于单个模型的能力,而在于图像生成、编码智能体、三维渲染、浏览器工具四个环节的有机串联——每个环节各司其职,人类仅需在关键节点给出高层次意图。
知名开发者 Simon Willison 最近分享了一个颇具趣味的实验:他用 GPT-6 Astra 结合 Blender,从一张 AI 生成的图片出发,最终得到一个可在浏览器中直接查看的 3D 模型。这个案例串联起了图像生成、编码智能体(coding agents)与三维建模三个环节,展示了当下多模态 AI 工具链的整合能力。

从法贝热彩蛋说起:AI生图的创意起点
实验的起点是一个有趣的创意。作为俄罗斯帝国"法贝热彩蛋"(Fabergé egg)的爱好者,Willison 一直想制作一些以流行文化为主题的新彩蛋。他借助 ChatGPT Images 2.5,输入了这样一段提示词:
Generate a photo of a faberge egg that's themed after the TV show Pluribus - research first(生成一张以电视剧《Pluribus》为主题的法贝热彩蛋照片——请先做调研)
你可能没注意到提示词中的 "research first"——它要求模型先理解剧集内容再动手。生成结果相当惊艳:一枚半开的黄色彩蛋,内部清晰呈现了剧中主角 Carol 身着黑衣、与一群诡异的白脸联体人对峙的场景,配上仙人掌与新墨西哥州阿尔伯克基的荒漠氛围,蛋座上还带有 Pluribus 铭牌。作者评价这个首次尝试"实话说相当不错"。
图像到3D建模:编码智能体的自动接力
真正体现工具链威力的是下一步。Willison 把这张生成的图片粘贴进运行 GPT-6 Astra(high)的 Codex,然后给出指令:
Use your blender local skill to create a blender model of this faverge egg(使用你的 blender 本地技能,为这枚法贝热彩蛋创建一个 blender 模型)
这里的关键是他预先定义好的"skill"(技能文件)。这是一种让编码智能体理解如何调用 Blender 的能力封装,作者此前已通过实践总结出这套本地 Blender 技能的用法。有了这层能力,智能体就能自主编写并执行 Blender 脚本,完成建模工作。
整个过程耗时 17 分 51 秒,最终产出了多个 .blend 文件。从图像到三维模型,全程由 AI 智能体自动驱动,人类只需给出高层次的意图指令。
Blender浏览器查看器:无需安装即可预览3D模型
光有 .blend 文件还不够——普通用户很难打开它。于是 Willison 拿出了自己早先通过"氛围编程"(vibe-coded)搞出的一个实验工具,把它整合进了自己的工具集,命名为 .blend URL Viewer。
这个浏览器查看器的巧妙之处在于:你只需提供一个 .blend 文件的 URL,就能直接在浏览器里看到渲染后的 3D 模型,无需安装 Blender 客户端。它甚至能直接解析 GitHub 上的文件链接(通过 jsDelivr CDN 代理)。
从查看器的信息面板可以看出这个模型的规模相当可观:
- 文件大小 7.2 MB
- 387 个网格(meshes)、1099 条曲线(curves)
- 783,764 个顶点、1,446,560 个三角面
- 17 种材质
最终3D模型效果:细节还原度如何
最终呈现的是一枚金色宝石镶嵌的法贝热风格彩蛋:顶部掀开,露出内部微缩的沙漠场景——绿色仙人掌、棕色岩石,以及中央一个身着黑西装的小人像;蛋壳上装饰着绿色宝石、珍珠、繁复的卷草纹,一圈微笑的白色蛋形脸孔,还有绘制着仙人掌与沙漠场景的椭圆奖章。彩蛋由四条金腿支撑,立于黑色大理石底座之上,底座刻有 PLURIBUS 铭牌。
查看器还贴心地标注了当前预览的局限:"材质与文字为近似渲染;未应用的修改器被省略"——这是对技术边界的诚实说明。
这条多模态AI工作流揭示了什么
抛开彩蛋本身的趣味性,这次实验的真正价值在于它演示了一条完整的多模态 AI 工作流:
能力的可复用封装
通过定义 skill 文件,作者把"如何操作 Blender"这项复杂技能沉淀下来,让编码智能体可以反复调用。这正是当前 AI 智能体走向实用的关键——把领域知识固化为可复用的能力单元。
跨模态的自然衔接
图像生成模型负责"创意可视化",编码智能体负责"把图像翻译成三维脚本",浏览器工具负责"呈现结果"。每个环节各司其职,人类只需在关键节点给出意图。
工具生态的自建自用
Willison 长期以"氛围编程"的方式积累各种小工具,这个 Blender 浏览器查看器就是现成拿来即用的例子。当个人拥有足够多的自建工具时,新的实验往往能快速拼装完成。
对于开发者而言,这个案例传递出一个清晰的信号:AI 智能体的强大不在于单个模型有多聪明,而在于如何把生成、编码、渲染等能力有机串联起来,形成端到端的自动化流程。从一句自然语言到一个可交互的 3D 作品,这段距离正在被急速压缩。
相关推荐

Agent Harness六大模块拆解:企业级AI Agent系统落地指南
深度拆解Agent Harness六大核心模块:上下文工程、工具编排、验证机制、状态管理、可观测性、人类接管,提供从入门到企业级AI Agent系统落地的完整架构蓝图与实践建议。

WorkBuddy入门指南:从AI提问者到AI管理者的转变
WorkBuddy是一款桌面AI智能体,能直接操作本地电脑完成办公任务。本文详解WorkBuddy与CodeX的区别、核心功能、积分机制及学习路径,帮你从AI提问者升级为AI管理者,真正用AI提升工作效率。

iPhone Duo上手体验:苹果首款折叠屏三大核心看点解读
苹果首款折叠屏手机iPhone Duo正式亮相,采用护照式书本折叠形态,配备7.6英寸OLED内屏,折痕几乎不可见,起售价2000美元。本文基于MKBHD第一手体验,深入解读形态设计、铰链工艺与定价策略三大看点。