Claude Sonnet 5.5
Anthropic推出的Sonnet系列最新大语言模型,具备百万级上下文窗口,支持长代码库与超长会话处理,是Claude Code的默认推理模型
Core Facts
Timeline (last 90 days)
从 Sonnet 级别默认切换到 Haiku 级别反映了在成本、速度与能力之间的权衡,Haiku 更轻量、响应更快、成本更低
多个提供商默认模型切换到 Claude Haiku 5.5,包括 Google Vertex AI(从 Claude Sonnet 5.5 改为 Claude Haiku 5.5)、Cortecs、DevPass、Eden AI、GitHub Copilot、LLM Gateway、NanoGPT、OpenCode Go、Requesty 以及 Vivgrid
Haiku 5.5可以作为子代理(sub-agent)与Claude Opus 5.5和Sonnet 5.5搭配完成编程工作
Opus 5.5 偏向复杂推理,Sonnet 5.5 偏向速度与成本平衡
Anthropic 的 Claude Opus 5.5 与 Claude Sonnet 5.5 现已在 Amazon Bedrock 的 AWS GovCloud (US) 区域上线
Sonnet 5.5在写作时倾向使用英式拼写(如将color拼成colour),但可通过明确指示纠正
测试者用Sonnet 5.5在Unreal Engine 5中重建了超写实旧金山市中心,包含约12万人口和2400辆行驶车辆
在多个基准测试中Sonnet 5.5与Opus 5.5分差极小,如GDP Val为1844对1846、OS World为80.1%对81%、Humanity's Last Exam为64.5对67.7
Sonnet 5.5在生成音效和音乐方面表现很差
在乐高创建器中应强调不让AI直接摆放积木,而是让其描述形状并由程序转化为真实零件,以保证成品可搭建
40 more timeline events
All Facts (20)
Anthropic发布了Claude Sonnet 5,是该系列迄今最大的一次更新
85%VerifiedClaude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%
75%VerifiedOpus 5.5在终端智能体基准拿到66分,高于Sonnet的55分和Astra的57.9分
70%Verified官方称Sonnet 5在推理、工具使用、编码和知识工作方面相比Sonnet 4.6均有显著提升,整体性能已逼近OPUS 4.8但价格更低
70%Verified在SWE Bench Pro编程基准测试中,Sonnet 5取得63.2%,Opus 4.8取得69.2%
70%VerifiedSonnet 5.5的缓存读取成本维持在每百万token 20美分没有下降,而Fable 5.1砍了90%、Opus砍了约60%
65%VerifiedAnthropic 为 Sonnet 5 默认启用了网络安全防护措施(cyber safeguards)
65%VerifiedClaude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点
65%VerifiedAnthropic 发布了 Claude Sonnet 5,官方宣称其性能接近 Opus 4.8 且价格更低
60%Unverified多个提供商默认模型切换到 Claude Haiku 5.5,包括 Google Vertex AI(从 Claude Sonnet 5.5 改为 Claude Haiku 5.5)、Cortecs、DevPass、Eden AI、GitHub Copilot、LLM Gateway、NanoGPT、OpenCode Go、Requesty 以及 Vivgrid
70%Partially VerifiedSonnet 5.5 运行速度相比 Sonnet 5 提升超过 30%
70%Partially VerifiedGPT-6.1 Sol与Sonnet 5.5每百万Token价格一致,均为输入2美元、输出10美元
65%Partially Verified综合评价 GPT-6.1 Sol 是能力合格、Token 效率高、价格有竞争力的模型,但在动态 3D 游戏视觉震撼力上被同价的 Claude Sonnet 5.5 压制
65%Partially VerifiedSonnet 5.5在网络攻防能力上与Opus 5.5处于同一水准,是Sonnet系列中首款采用同等网络安全防护机制的模型
65%Partially VerifiedSonnet 5.5 是第一个带网络安全防护发布的 Sonnet 模型,高风险网络安全任务会明确切回 Sonnet 5
65%Partially VerifiedOpus 5.5 在输出 token 上比 Sonnet 5.5 多出约 49%,对应的 API 等价成本几乎贵了一半
65%UnverifiedGPT-6.1 Sol 的定价与前一天发布的 Claude Sonnet 5.5 完全一致
60%Unverified在 Terminal Bench 上,中档 Sonnet 5.5 得分 28.8%,每任务约 0.83 美元;Sonnet 5 最高档只有 10.3%,每任务约 11.6 美元
60%Unverified从 Sonnet 级别默认切换到 Haiku 级别反映了在成本、速度与能力之间的权衡,Haiku 更轻量、响应更快、成本更低
50%UnverifiedHaiku 5.5可以作为子代理(sub-agent)与Claude Opus 5.5和Sonnet 5.5搭配完成编程工作
50%