Opus 5.5 对决 Sonnet 5.5:3D 蒸汽朋克鲸鱼建模实测

同一流程下实测Claude Opus 5.5与Sonnet 5.5的3D蒸汽朋克鲸鱼建模,Opus质量更优但成本高出约43%。
一位开发者以蒸汽朋克机械鲸鱼为对象,在完全相同的结构化prompt序列下对比了Claude Opus 5.5与Sonnet 5.5的3D建模能力。工作流为:通过blendermcp(Blender的MCP协议适配层)驱动两款模型在Blender中建模,再导出至three.js于浏览器渲染。结果显示,Opus 5.5在输出token和API等价成本上约为Sonnet 5.5的1.5倍($156 vs $109),质量上也明显更优;但Sonnet 5.5的表现超出预期,在成本敏感场景中具备实用价值。此次实测还揭示了一个普遍规律:Sonnet 5.5的高基准测试分数并不包含3D建模项,印证了"benchmark高分不等于全场景通用"的判断。
一场关于 3D 建模的模型横评
一位 Reddit 用户在 Twitter 上看到不少用 AI 生成精细机甲、机器人的演示后,决定亲手复现类似效果。他选择用 Claude Opus 5.5 来搭建一个 3D 场景——一头蒸汽朋克风格的机械鲸鱼。恰逢 Anthropic 在他制作过程中发布了新的 Sonnet 5.5,加之该模型的基准测试成绩相当亮眼,于是他索性把两款模型放在同一套流程下做了对比。
这类第一手的实测远比冷冰冰的 benchmark 数字更有参考价值,因为它揭示了模型在真实、复杂、需要多步推理的创作任务中的实际表现。

实验设置与工作流
整个作品并非靠单条 prompt 完成,而是通过一系列结构化的分步指令逐渐搭建出来的——两款模型使用的是完全相同的 prompt 序列,以保证对比的公平性。
技术链路上,鲸鱼模型先在 Blender 中建模,随后导出到 three.js,最终得以在浏览器中运行呈现。作者的具体配置是:两个 Claude 模型均通过订阅账户接入,并借助 atomic.chat 内的 blendermcp(Blender 的 MCP 接口)驱动建模操作。
这种 Blender + three.js 的组合,本质上考验的是模型对空间结构、几何关系以及跨工具数据转换的综合理解能力,而这恰恰是当前大语言模型的薄弱环节之一。
MCP(Model Context Protocol) 是 Anthropic 于 2024 年底推出的开放协议,用于将大语言模型与外部工具、数据源和应用程序连接起来。其核心思想是为 LLM 提供一套标准化的"工具调用接口",使模型能够像操作 API 一样与本地软件交互。blendermcp 正是基于这一协议为 Blender 开发的适配层——它在 Blender 内部启动一个 MCP 服务端,接收来自模型的指令(如创建网格、调整材质、移动物体),并将操作结果返回给模型,形成感知-决策-执行的闭环。这种架构意味着模型需要理解 Blender 的场景层级(Scene → Object → Mesh → Material)和坐标系,并将自然语言意图转化为精确的几何操作序列,对空间推理能力要求极高。
成本与消耗对比
从资源消耗的角度看,两款模型呈现出明显差异。作者给出的数据如下:
| 指标 | Opus 5.5 | Sonnet 5.5 |
|---|---|---|
| 输出 token | 2.50M | 1.68M |
| 总 token(含缓存) | 342M | 297M |
| API 等价成本 | 约 $156 | 约 $109 |
Opus 5.5 在输出 token 上比 Sonnet 5.5 多出约 49%,总 token 消耗也更高,对应的 API 等价成本几乎贵了一半。对于需要长时间、多轮迭代的创作型任务而言,这样的成本差距在实际项目中会被进一步放大,是选型时不可忽视的因素。
表中"总 token(含缓存)"远高于"输出 token",原因在于多轮对话中每次请求都需将完整上下文重新传入,导致输入 token 随对话轮数线性累积。Anthropic 提供的 Prompt Caching 机制可对重复出现的前缀上下文按折扣价计费,这正是两者总 token 差距(342M vs 297M)与成本差距($156 vs $109)的换算比例不完全一致的原因——缓存命中率的差异会影响实际计费。对于此类需要数十轮迭代的创作任务,合理设计上下文结构、最大化缓存命中是控制成本的关键手段。
质量表现:Sonnet 惊喜,但 Opus 仍胜一筹
作者的核心结论是:Sonnet 5.5 在这项 3D 建模任务上的表现出乎意料地好,但整体质量距离 Opus 5.5 仍有不小差距。
他也给出了一个相当中肯的补充说明:Sonnet 5.5 亮眼的基准测试成绩并未包含任何关于 3D 建模的评测项,因此它在这一维度上落后于 Opus,其实是可以预期的。
这里揭示了一个值得从业者反复咀嚼的道理——benchmark 高分不等于全场景通用。基准测试往往集中在编程、数学、推理等可量化的领域,而像 3D 空间建模这类高度依赖几何直觉与工具链协作的任务,很可能完全不在测试覆盖范围内。当你的实际需求偏离主流评测方向时,跑分排名的参考意义会大打折扣。
对开发者的启示
这次非正式的横评虽然样本有限,却提供了几个实用视角。
对于追求极致质量、且预算充足的创作型任务,Opus 5.5 仍是更稳妥的选择;而当任务允许一定质量妥协、或需要控制成本时,Sonnet 5.5 已经能提供相当可用的产出,性价比优势明显。
更重要的是,将 LLM 接入 Blender(通过 MCP)再输出到 three.js 的这套工作流,展示了 AI 辅助 3D 内容生产的现实可行性。随着 MCP 生态的成熟,模型直接操控专业创作软件正从演示走向实用。对于想探索 AI 3D 建模的开发者,这套 atomic.chat + blendermcp 的组合值得一试。
需要提醒的是,本文数据来自单一用户的个人实验,任务类型也较为特殊,结论不宜过度泛化。真实选型时,最好针对自己的具体场景做一轮小规模实测。
three.js 是一个基于 WebGL 的 JavaScript 3D 渲染库,能够在浏览器中无需插件地渲染复杂三维场景。将 Blender 模型导出为 GLTF/GLB 格式后载入 three.js,是目前 Web 端 3D 内容分发的主流路径。这一导出步骤本身也构成了对模型能力的额外考验:模型需确保在 Blender 中生成的几何体、UV 展开、材质节点均符合 GLTF 规范的约束,否则导出产物在 three.js 中可能出现材质丢失或网格破损。这也解释了为何"跨工具数据转换"被作者视为衡量模型综合理解能力的重要维度。
相关推荐

Opus 5.5实测:一个Skill把PDF变成交互式动画电子书
开发者基于 Claude Opus 5.5 打造开源 Skill「Papermorph」,通过 PDF→规划→分镜→旁白→动画测验的流水线,把静态 PDF 自动转化为带交互测验的动画网页电子书,且暂未使用图像模型。本文拆解其工作流与技术亮点。

Perplexity押注垂直整合:Vera芯片替代x86背后的Agent基建野心
Perplexity宣布垂直整合其智能体基础设施,自建沙箱并押注Vera架构替代x86,开始部署Perplexity Computer。本文解析这一战略背后的技术逻辑与行业意义。

Extra Big Ass Intelligence:一场对AI炒作的幽默反讽
Extra Big Ass Intelligence是一个在Hacker News走红的恶搞项目,用幽默反讽调侃AI行业的过度炒作与命名通胀,引发技术社区对AI营销泡沫的集体反思。