烧掉20万美元测试GPT-5.6:Agent能力的真实极限在哪里

一位科技UP主在GPT-5.6正式发布前获得了长达一个半月的早期访问权限。在这段时间里,他做了一件常人难以想象的事:按照快速模式的定价估算,他消耗了约18万到24万美元的推理成本,横跨67个项目,将这个模型推向了前所未有的极限。
这不是一篇标准评测——作者刻意强调,他在录制视频前没有看过任何关于GPT-5.6的媒体报道、基准测试或社区评价,只想分享最真实的使用体验。正因如此,这份「烧掉20万美元」的实战记录反而格外有参考价值。
一个能持续工作20小时的AI Agent
作者对GPT-5.6最直观的感受是:它不再「迷路」。
他坦言,上一代GPT-5.5最大的问题在于容易在长任务中失去方向——一旦上下文里混入了不良信息,就得推倒重来、新建线程。而GPT-5.6彻底改变了这一点:「我可以让一个线程一直跑下去,完全没问题。」
更夸张的是任务持续时长。作者表示,他曾在不设置任何目标锚点的情况下,让模型连续运行超过20小时完成一个大型任务,模型始终紧咬目标不放,直至完成。这种「工作马」般的专注力,让他重新审视了过去觉得鸡肋的自动化功能。

他特别提到,即便按快速模式价格计算,他在单个项目上的开销也高达数万美元。但他也澄清,快速模式并非必需——普通模式价格几乎是快速模式的一半,而200美元/月的订阅计划本身就包含约1.4万美元的推理额度。换句话说,他的部分极限用法其实可以被常规订阅覆盖。
真实工程落地:从Lakebed到T3 Code
作者最花心思的项目之一是名为Lakebed的云平台。GPT-5.6在此完成了大量硬核工作:
- 将GPT-5.5写出的巨型单体JavaScript文件重构为组织良好的TypeScript项目;
- 搭建全新的CI流水线、预览和发布工作流;
- 实现工件存储、白名单访问控制、CLI登录鉴权等复杂系统;
- 加固数据库层的响应式逻辑,设计文件对象存储的完整契约。
他强调,这些改动「绝大部分都是GPT-5.6写的」,而他即将把这个从「奇怪的小副项目」蜕变而来的平台开源发布。

另一个重点项目是T3 Code——一个统一管理各类AI Agent的平台,覆盖桌面端、Web端和移动端。作者过去在移动端吃尽苦头,各种高端模型表现均不理想,但GPT-5.6在移动开发上的表现让他决定「加大剂量」:他让模型从零重写了整个React Native应用,一次用AppKit和Swift,一次用SwiftUI,相当于完成了两次完整的原生重写。
结果令他震惊——两个版本都是端到端完整可用、功能对齐的成品,每次重写仅花了2到4小时。结合模型出色的「计算机使用」能力(可直接启动模拟器验证效果),整个开发流程形成了完整闭环。
大胆移植:用Rust重写TypeScript编译器
受到「bun被用Rust重写」的启发,作者尝试了一系列大胆的移植实验。
他先将自己的Hermes Agent用Rust完整重写,让GPT-5.6遍历所有历史记录、识别真正在用的约50%功能并逐一实现。最终得到的Rust版本仅占用约15MB内存,远比原Python版本精简。

最令他兴奋的是重写TypeScript编译器。他成功得到了一个100%可用的转译器(负责将TS转为JS),全部用Rust编写,速度比等效的Go版本快达18倍。整个代码库最终膨胀至近20万行Rust代码,横跨29个crate。
不过作者也如实呈现了局限性:Fable分析这份代码后得出结论——「一个宽泛的原型,仅有极小的已验证切片,远未达到可交付状态」,大约完成了可用工具的15-20%,但只是完整TS-Go替代品的5%左右,类型检查部分进展有限,大量测试仍未通过。这种诚实的自我剖析,恰恰体现了深度用户的专业态度。
「我们真的到了」:计算机使用能力的高光时刻
如果本文有一个高潮,那一定是作者修复故障机器的经历。
当时他在拆装SSD时搞坏了引导分区,机器只能进入残缺的GRUB界面。他向GPT-5.6求助后,模型起初「幻觉」出一些并不存在的BIOS选项,但当作者给它开放了远程KVM的直接控制权限后,局面发生了逆转。
模型自主重启了几次、进入GRUB shell、正确引导系统,随后通过计算机使用能力远程操控电脑、打开终端、自动修复了引导分区——全程无需人工干预。

作者形容这是他遇到过「最『卧槽,我们真的到了』的时刻之一」。这类任务过去让他做噩梦——虽然大致会做,但需要大量研究、耐心和风险承受力。而GPT-5.6毫不费力地完成了。这次经历也直接推动他更激进地探索计算机使用的边界。
此后,他还用模型搭建了一个可启动的Linux恢复U盘(内置Codex和Claude),以及一个管理全部机器配置的仓库——每拿到新机器,只需告诉模型用途,它就能自动完成配置。
保持冷静:前端能力仍是明显短板
作者并没有一味吹捧。他明确指出,GPT-5.6并不是魔法般完美的前端模型。它比其他模型更「可被引导」、默认审美也更不容易出错,但「无论如何算不上出色的前端模型」。
他在制作3D游戏Demo时观察到,模型对3D的理解「很奇怪」——能自己生成环境、岩石、纹理,部分纹理甚至优于Grok的输出,但怪物和鱼的模型「丑得离谱」,控制逻辑也频频出错。不过他也承认,这一领域的进步速度足够快,值得持续关注。
对于UI开发,他的做法是让GPT-5.6搭好功能骨架,再交给Opus打磨界面——这种扬长避短的组合拳,或许才是当前阶段最务实的使用姿势。
总结:一个让工程师「想得更大」的模型
综合来看,作者对GPT-5.6的核心评价是「工作马」(workhorse):
它不再需要像GPT-5.5那样精细地被引导,只需说「去做」,它就会持续工作、自主管理上下文、不迷失、不半途而废。这种Agent能力的质变,直接影响了作者近期演讲的方向——因为简单任务对它来说太简单了,他不得不给它更难、更宏大的挑战。
当然,20万美元的推理量绝非普通人的合理用法,作者本人也强调「没人应该每月这么做」。但这份极限压测式的实战记录,让我们提前窥见了AI Agent在真实工程场景中的能力天花板正在快速抬升。正如作者所说:「这个模型让我真心兴奋,想去构建更多、思考更大。」
相关推荐

遗传算法+神经网络:登机效率超越Steffen法9.6%
Reddit开发者用遗传算法结合多层感知机(MLP)优化飞机登机顺序,在模拟中实现比Steffen方法快9.6%的登机效率。本文拆解其技术思路、实际意义与局限性。

DeepSeek V4 Pro与Grok 4.6同日发布:AI大厂Agent之战全面打响
DeepSeek V4 Pro、Grok 4.6、腾讯混元WorldCloud、阿里万亿开源模型同日发布,Agent能力成主战场,价格战全面开打。深度解析四大发布的核心亮点与产业趋势。

Gmail点号忽略机制为何导致邮件误送给同名用户
解析Gmail地址容错机制如何导致邮件误送问题。深入分析点号忽略、大小写归一化等设计特性,探讨同名用户频繁收到他人邮件的根源及应对策略。