Anthropic突袭发布Sonnet 5.5:真香却劝你别直接用

Sonnet 5.5是一款性价比惊人但定价有陷阱、最适合作为子Agent调用而非直接使用的代码模型。
Anthropic悄然发布的Sonnet 5.5在Terminal Bench 4上以70.6%创下历史最高分,相比前代实现7倍飞跃,整体质感也从"垃圾级"蜕变为"稍慢一些的Fable"。然而知名测评人Theo明确建议大多数人不要直接使用它,核心原因有二:一是缓存读取成本未随标称价格下降,导致Agent场景下实际花费与Opus相当甚至更贵;二是Max推理模式会强制过度思考,token暴增15倍却可能损害表现,应当完全忽略。Sonnet 5.5真正的定位是作为Opus或Fable在多Agent编排中调用的子Agent,用于代码库深度分析等调查型任务——在相关基准中它以半价实现了优于Opus的性价比,完成时间也更短。前端设计是其明显短板,但对OpenAI而言,这款模型的发布再次印证了其在性能、效率与成本三个维度的全面落后。
Anthropic最近的节奏快得让人喘不过气。从被Theo称为"史上最爱代码模型"的Fable 5.1,到接管了几乎所有人工作流的Opus 5.5,再到这次毫无预告突袭发布的Sonnet 5.5——这家公司正在用密集的产品攻势,把压力精准地传导给OpenAI。
有意思的是,这款Sonnet 5.5在知名测评人Theo(t3.gg)眼里是一个"充满矛盾"的模型:它本身很出色,但他却明确建议大多数人"别直接用它"。这背后的逻辑,恰恰揭示了当下AI代码模型竞争的真实格局。
Sonnet回归:从"垃圾级"到惊喜之作
Sonnet 5是Theo最不喜欢的模型发布之一,被他直接形容为"garbage tier(垃圾级)"。正因如此,他原本打算直接跳过Sonnet 5.5,连视频都不想做——毕竟Opus 5.5的性价比已经让他彻底折服。
但他承认自己判断错了。Sonnet 5.5在Terminal Bench 4上拿下了史上最高分70.6%,相比Sonnet 5的10.3%是整整7倍的飞跃。这个数字高到连Theo自己都开始怀疑Terminal Bench这个基准本身的可信度。它还是第一个仅凭截图就能通关《宝可梦红》的Sonnet模型。

Theo的评价很形象:"这些模型现在感觉就像是稍微笨一点、但快得多的Fable版本。"他推测Anthropic(视频中戏称InfraOpix)近期在强化学习上有了内部突破——此前除了最大最强的模型外,其他小模型总给人一种"机器人在机械执行任务"的感觉,而现在的Sonnet终于有了"理解工作内容"的那种灵性。此外,Anthropic还在努力去除饱受诟病的"Claude腔"(Claude-isms),让Sonnet 5.5的输出表达更清晰,更适合协作。
价格的猫腻:缓存读取成本是关键陷阱
Anthropic官方宣称Sonnet 5.5"比前代快30%、便宜30%",价格维持在每百万输入token 2美元、输出10美元。但Theo毫不客气地指出,这个说法"在重要信息上刻意绕圈子",尤其是在缓存token读取(cache reads)这一项上。
关键在于:在如今的Agent代码工作中,缓存读取和写入才是成本的大头。Fable 5.1把缓存读取成本砍了90%,Opus砍了约60%,而Sonnet 5.5的缓存读取却维持在每百万token 20美分没有下降。
Theo算了一笔账来说明问题:当你沿着模型层级往下走,缓存读取在总成本中的占比会越来越大。在Fable上这个比例不到5%,在Opus上约20%,到了Sonnet 5.5竟高达50%以上。结果就是,在真实的同类工作中,Sonnet 5.5的实际花费"和Opus相当,甚至更贵"。按Artificial Analysis智能指数衡量,Sonnet 5.5做真实任务的成本几乎和定位更高的Fable 5.1打平。
提示缓存(Prompt Caching)机制是理解这段成本分析的前提。大型语言模型在处理每次请求时,需要对输入的所有token重新计算注意力(attention),这一过程既耗时又昂贵。提示缓存技术允许模型将重复出现的上下文——例如系统提示、代码库内容、对话历史——的中间计算结果缓存起来,后续请求可直接复用,从而跳过重复计算。在Agent代码工作流中,每次调用都会携带大量相同的上下文(如完整的代码库片段),因此缓存读取(cache reads)的次数和token量往往远超新鲜输入,这使得缓存读取价格成为决定实际账单的核心变量,而非模型标称的每百万输入/输出单价。Anthropic对不同模型的缓存读取定价差异悬殊,正是这一差异让Sonnet 5.5在纸面价格相近的情况下,在真实工作负载下实际成本反超定位更高的Opus。
千万别碰Max模式
Theo这次花了大量篇幅专门"炮轰"Max推理模式,这是他给出"别用"建议的核心技术理由之一。
他解释,推理档位(low/medium/high/x-high)本质上不是"应该推理多少",而是"预算上限"——允许模型最多推理到某个程度。而Max模式的问题在于,它不是在抬高推理token的"天花板",而是在抬高"地板",强制模型必须用掉一定数量的推理token才算完成。
后果有多夸张?Theo实测,从low到x-high,token使用量仅增长5%;但从x-high到Max,token使用量暴增1500%,也就是15倍。更糟的是,强迫模型过度思考反而会损害表现——模型会开始自我怀疑,把简单题想错。
实测数据印证了这点:Sonnet 5.5在Max档跑基准花了7.6美元,比竞品Astra贵了一倍多;而同样的任务,high档只要1.08美元,medium档仅0.59美元。Theo的建议很直接:"假装Max模式不存在,你的生活会轻松很多。"同时他也提醒,Anthropic模型在low档表现很差(现在甚至取消了无推理选项),所以应当"避开low、避开Max,medium大致够用"。

Anthropic的**扩展思考(Extended Thinking)**功能允许模型在给出最终答案前先生成一段不对外显示的"思维链"(chain-of-thought),这些内部推理步骤消耗的token被称为推理token(thinking tokens)。推理档位(low/medium/high/x-high)本质上是对这部分token数量设定的预算上限,让模型可以按需调用,避免对简单问题过度消耗资源。Max模式则打破了这一逻辑:它从"上限控制"变成"下限强制",要求模型无论问题难易都必须消耗大量推理token,结果导致模型在处理本可直接回答的任务时反复自我质疑、重复验证,不仅成本暴增,反而引入更多错误。这种"强迫思考"的现象与认知科学中的"过度分析导致表现下降"(analysis paralysis)高度吻合,也是Theo建议完全忽略Max模式的根本原因。
真正的价值:它是给其他模型调用的"工具"
那么Theo到底为什么喜欢这个模型?他的答案颠覆直觉:"我不认为你或我应该直接选用这个模型。"
Sonnet 5.5的真正定位,是作为Opus或Fable在拆解复杂任务时可以调用的子Agent(sub-agent)。它不该被直接调用,而应该成为编排体系里的一环。
Theo用一个代码库深度审计的基准验证了这一点。他让各模型对T3 code中一个庞大的"orchestrator V2"PR(数十万行代码)做深度分析,提出拆分落地策略。这类任务不是传统编码,而是需要遍历大量代码、做架构判断、并向他人清晰解释的分析型工作。
结果令他震惊:Sonnet 5.5的表现略优于Opus,价格却只有Opus的一半,更关键的是只花了约5分钟——Opus耗时近两倍,Astra(分析质量最佳)耗时近三倍。"每分的成本低得离谱,是我在这个基准里见过的最佳性价比。"
他还分享了一个有趣的实际案例:在用Rust重写TypeScript编译器的项目中,他要求模型清理遗留的"slop"代码。在一个充满数字讨论的线程里追问进度时,Sonnet没有强行揣测意图,而是基于线程上下文做出了合理判断。最终这项任务删掉了约160万行代码。这说明它对意图和上下文的理解相当到位。
**多Agent编排(Multi-Agent Orchestration)**是当前复杂AI任务的主流架构范式。在这种模式下,一个"编排器"模型(Orchestrator)负责理解目标、拆解任务并分配子任务,而多个"执行器"模型(Sub-agents)负责执行具体操作,如代码搜索、文件读写、API调用等。这种分工的优势在于:编排器可以使用最强、最贵的模型保证规划质量,而子Agent则优先选用在特定子任务上性价比最高的模型。Sonnet 5.5在代码库分析类任务上速度快、成本低、准确度接近Opus,使其成为理想的调查型子Agent候选——负责遍历大量代码、汇总信息,再将结论返回给上层的Opus或Fable做最终决策。这也是为何Theo认为"你不应该直接用它",因为它在编排体系中才能发挥最大价值,而非作为用户的主要对话入口。
前端设计仍是短板,鱼游戏Demo惊艳
在Witch.ai设计展示平台上,Sonnet 5.5的前端表现并不理想——卡片设计"丑陋"、动画"糟糕"、背景线条影响可读性。Theo认为它"明显不如Opus,更远不如Fable"。他依然把Fable 5.1视为最佳设计模型,而Opus则胜在可引导性强、遵循设计指令。
但在"fish slop"游戏生成Demo中,Sonnet 5.5交出了他"见过最好的成果之一":可爱的3D鱼、珊瑚、海草,甚至还有造型最佳的外星人,整个游戏在笔记本上跑出丝滑的120 FPS。

不过速度和token效率是另一个槽点。Sonnet 5.5在Cursor Bench里又拿了个"史上之最"——每任务27万token的消耗,几乎是Gemini 3.8 Flash的两倍、GPT-6 Sol的5倍以上。尽管生成速度更快(约150 TPS vs Opus的约100 TPS),但因为token消耗太大,fish slop任务实际反而比Opus慢:Sonnet用了43分钟,Opus只要36分钟。
OpenAI的处境:全面落后
Theo多次提到,这款模型"几乎就是冲着OpenAI去的",尤其瞄准GPT-6 Sol。而他对Sol的评价相当冷淡——"DOA(出生即死)",几乎没理由在视频里讨论它。
他给出的总结相当尖锐:OpenAI在所有最擅长的领域都输了。"他们没有最聪明的模型,没有最高效的模型,没有最便宜的模型,也没有最适合调用其他模型的模型。"从订阅性价比看,200美元的Codex套餐带来的真实代码产出,远不及他的200美元Claude订阅(粗估每周约2300美元的用量额度)。
结论是:Sonnet 5.5本身你不必亲自去用,但它是这个新模型家族里出色的一块拼图。如果能正确配置让Opus在恰当时机调用Sonnet做代码库深挖、验证猜想之类的调查性工作,Opus整体会感觉更快、成本更低。而这,正是它存在的真正意义。
相关推荐

Opus 5.5实测:一个Skill把PDF变成交互式动画电子书
开发者基于 Claude Opus 5.5 打造开源 Skill「Papermorph」,通过 PDF→规划→分镜→旁白→动画测验的流水线,把静态 PDF 自动转化为带交互测验的动画网页电子书,且暂未使用图像模型。本文拆解其工作流与技术亮点。

Perplexity押注垂直整合:Vera芯片替代x86背后的Agent基建野心
Perplexity宣布垂直整合其智能体基础设施,自建沙箱并押注Vera架构替代x86,开始部署Perplexity Computer。本文解析这一战略背后的技术逻辑与行业意义。

Extra Big Ass Intelligence:一场对AI炒作的幽默反讽
Extra Big Ass Intelligence是一个在Hacker News走红的恶搞项目,用幽默反讽调侃AI行业的过度炒作与命名通胀,引发技术社区对AI营销泡沫的集体反思。