GPT-6.1 Sol 实测:能否击败同价位的 Claude Sonnet 5.5?

GPT-6.1 Sol 与 Claude Sonnet 5.5 同价竞争,速度与 token 效率占优,但 3D 游戏生成能力略逊一筹。
OpenAI 开发者日发布的 GPT-6.1 Sol 以与 Claude Sonnet 5.5 完全相同的定价(输入 2 美元、输出 10 美元/百万 token)直接切入同价位竞争。科技博主 Bijan Bowen 的实测显示,该模型在 3D 游戏生成类任务上整体不及 Sonnet 5.5 惊艳,角色建模和视觉效果存在明显差距;但在静态场景建模(Seinfeld 公寓、RuneScape UI 复刻)上表现出色,视觉理解能力可能是其真正强项。此外,模型生成速度快、token 消耗极低,大量高档位测试仅用掉约 3% 的订阅额度。机械臂抓取任务虽以失败告终,但模型动作细腻且懂得主动放弃,体现出更好的判断分寸。总体而言,GPT-6.1 Sol 并非在所有维度上全面超越竞品,其真正优势或许在尚未充分探索的边缘设备优化与底层软件领域。
OpenAI 在开发者日推出了全新的 GPT-6.1 Sol 模型,科技博主 Bijan Bowen 第一时间进行了系列实测。这款模型最大的看点在于——官方宣称它逼近当前旗舰 Astra 的智能水平,但价格只有后者的五分之一。本文基于其完整测试过程,梳理 GPT-6.1 Sol 在 3D 建模、游戏生成等任务上的真实表现,并与前一天刚发布的 Claude Sonnet 5.5 进行横向对比。
价格与规格:直接对标 Sonnet 5.5
GPT-6.1 Sol 的定价为输入每百万 token 2 美元、输出每百万 token 10 美元,这与 Anthropic 的 Claude Sonnet 5.5 完全一致。换句话说,OpenAI 这次是用一个主力级模型,在价格上正面切入 Sonnet 的腹地。
从参数看,该模型拥有超过百万 token 的上下文窗口,最大输出 128k token,知识截止日期为 4 月 30 日,输入模态支持文本和图像。相比前代 GPT-6 Sol,仅 0.1 版本号的提升却带来了明显的能力增长。
测试者特别提到一个有趣的现象:在 DeepSWE 基准上,模型在 high 推理档位表现最佳,而非更高的 max 或 ultra 档。这印证了业界近期的观察——更高推理强度不一定产出更优结果,有时反而因为模型「做了超出评测范围的事」而丢分。
DeepSWE 是一个专门用于评估大语言模型软件工程能力的基准测试,主要考察模型在真实代码库中完成端到端编程任务的能力,包括理解需求、修改代码、运行测试等环节。推理档位(如 fast、high、max、ultra)是 OpenAI 等厂商为推理型模型提供的算力调节机制——档位越高,模型在生成答案前投入的「思考步骤」越多,理论上更适合复杂问题,但也意味着更高的延迟和 token 消耗。测试中 high 档优于 max/ultra 的现象,反映出推理增强并非线性收益:过度推理可能导致模型偏离任务目标,在严格的自动化评测框架中反而因「答非所问」而失分。
3D 游戏生成:泳池派对测试的落差
测试的核心项目之一是全新引入的「后院泳池派对」(Backyard Pool Party)测试,要求用 Blender 和 Godot 生成一个 3D 跳水游戏。由于是全新 prompt,模型此前不可能见过,可以排除「刷榜」嫌疑。

结果略显尴尬。Bijan 分别在 ultra+fast 和纯 max 模式下各跑了一次,并彻底清除了系统中所有缓存,确保没有先前结果的残留。但两次输出高度相似,且在视觉效果上明显不及 Sonnet 5.5 一天前的表现——尤其是角色建模。他直言:「拿它和 Sonnet 比,那简直是被拖地板摩擦。」
不过他也强调了优点:速度极快。相比 Sonnet 曾经跑两小时的情况,GPT-6.1 Sol 在最高推理档下仍能快速出结果,这本身就是一项不可忽视的工程优势。
Blender 是开源的专业级 3D 建模与渲染软件,Godot 则是一款开源游戏引擎,两者组合代表了从资产制作到游戏运行的完整开发链路。要求模型同时驾驭这两个工具并生成可运行的 3D 游戏,涉及 Python/GDScript 脚本编写、场景图管理、物理碰撞配置等多个技术层面,难度远超单纯的代码生成。测试者清除缓存的操作是为了规避某些推理服务在同一会话内复用中间结果的可能性,确保两次运行完全独立,从而验证模型的真实生成能力而非缓存命中。
Halo OS 与多款游戏:竞争力尚可但不惊艳
在「浏览器操作系统」类任务中,模型生成了一个名为 Halo OS 的桌面环境,带有命令中心、文件管理、可调壁纸和随机种子等细节。值得玩味的是,它刻意取消了右键菜单——这被解读为一种「避免看起来像在应对基准测试」的行为。
随后测试的多款游戏中,Orbital Run(轨道飞行) 获得了较高评价,音效随速度升高而变调、邮件 app 能启动游戏、飞行后生成状态报告等细节都令人满意。测试者注意到一个跨厂商模型「趋同」的有趣现象:不同来源的模型都不约而同地把邮件 app 与游戏功能关联起来。
滑板游戏回放功能:亮点所在
自包含 C++ 滑板游戏测试加入了来自观众建议的新要求——按 Z 键触发电影级招式回放。这成为整场测试的高光时刻。

初版结果偏「骨架化」,纽约街区缺乏行人互动。但在被告知「参考 Sonnet 的结果、放开单文件限制」后,模型进行了显著优化:水面效果、建筑在水中的倒影、带时间判定的招式回放镜头,都达到了「X Games Pro Skate」级别的观感。测试者评价这次迭代「是一次实质性的巨大改进」。
机械臂抓取:失败但有「分寸感」
在机械臂抓取汽车的物理模拟测试中,模型工作了约 18 分钟后主动「放弃」了。虽然这在评分上算作失败,但 Bijan 给予了尊重:与 Sonnet 5.5 靠近乎暴力、破坏性的动作「侥幸完成」相比,GPT-6.1 Sol 的机械臂动作更细腻、更少破坏性,并在判断无法完成时选择停止,而非胡乱挣扎。
场景建模的惊喜:Seinfeld 公寓与 RuneScape

如果说游戏测试令人失望,那么静态场景建模则扭转了印象。模型复刻的《宋飞正传》Jerry 公寓被评为「绝对惊艳」:门、自行车链条、电脑屏幕上的台词彩蛋(「飞机花生是怎么回事」)、窗外建筑、甚至引用了布景资料来源,细节丰富到令人惊讶。虽然整体布局仍未完全还原剧中样貌,但单个元素的完成度极高。
RuneScape 2007 的 PVP 画面复刻同样出色,UI 元素、武器图标、药水栏近乎像素级精确——以至于测试者怀疑它是直接「截取」了参考图。这也暗示 GPT-6.1 Sol 的视觉理解能力可能相当强。
复杂 3D 模型:萨博 900 Turbo 的考验

测试者特意选择了外形怪异的萨博 900 Turbo 汽车,因为它无法套用通用跑车模板。结果虽非完美复刻,但发动机舱、减震塔、电池、轮毂、保险杠饰条等细节都相当到位,网页交互(开盖、换色、进入驾驶位、多视角预设)也做得完整,具备用于游戏资产的潜力。
Token 效率是隐藏优势
整场涵盖 ultra 和 max 档位的大量测试,只消耗了约 3% 的 200 美元订阅额度(从 98% 降至 95%)。这说明 GPT-6.1 Sol 在 token 效率上表现相当优秀。考虑到其价格仅为旗舰的五分之一,这种「又便宜又省」的特性对实际部署极具吸引力。
Token 效率衡量的是模型完成特定任务所消耗的 token 数量与输出质量之间的比值。对于需要大量上下文、多轮迭代的复杂任务(如 3D 代码生成),token 消耗往往是实际部署成本的核心变量,远比名义单价更能反映真实开销。200 美元订阅额度下仅消耗 3% 意味着同等预算可支撑约 33 次同等规模的完整测试流程,这对于需要频繁迭代的开发者或企业用户而言,意味着更低的试错成本和更高的并发可行性。结合其输入 2 美元/百万 token 的定价,GPT-6.1 Sol 的性价比优势在高频调用场景下会被进一步放大。
结论:竞争力在别处
测试者的总体判断颇为诚实:在他们擅长的 3D 可视化任务上,GPT-6.1 Sol 不如同价位的 Claude Sonnet 5.5 惊艳。按过往定位,Sol 本应是 Opus 的竞争对手,但如今它与 Sonnet 同价,表现却未能全面压制。
不过这并不意味着它是一个「差」模型——它只是在该频道偏好的测试类型上不占优。它速度快、token 消耗低、价格便宜,视觉理解和静态建模能力强,也懂得在无法完成任务时体面退出。它真正的强项,或许在边缘设备优化、底层软件等尚未充分探索的领域。对这款模型下定论,还为时尚早。
相关推荐

Opus 5.5实测:一个Skill把PDF变成交互式动画电子书
开发者基于 Claude Opus 5.5 打造开源 Skill「Papermorph」,通过 PDF→规划→分镜→旁白→动画测验的流水线,把静态 PDF 自动转化为带交互测验的动画网页电子书,且暂未使用图像模型。本文拆解其工作流与技术亮点。

Perplexity押注垂直整合:Vera芯片替代x86背后的Agent基建野心
Perplexity宣布垂直整合其智能体基础设施,自建沙箱并押注Vera架构替代x86,开始部署Perplexity Computer。本文解析这一战略背后的技术逻辑与行业意义。

Extra Big Ass Intelligence:一场对AI炒作的幽默反讽
Extra Big Ass Intelligence是一个在Hacker News走红的恶搞项目,用幽默反讽调侃AI行业的过度炒作与命名通胀,引发技术社区对AI营销泡沫的集体反思。