[控场AI]
模型Claude Sonnet 5.5

Sonnet 5.5

Anthropic推出的Claude Sonnet系列新版本,属于Claude模型家族中的中端产品线

核心事实

时间轴 (近 90 天)

10月2日

有用户使用 Sonnet 5.5 完成 Jellyfin 自定义插件的 JS 重写等复杂任务

待验证50%
10月2日

Sonnet 5.5的缓存读取成本维持在每百万token 20美分没有下降,而Fable 5.1砍了90%、Opus砍了约60%

待验证50%
10月2日

Sonnet 5.5在前端设计上明显不如Opus,远不如Fable,而Theo认为Fable 5.1是最佳设计模型

待验证50%
10月2日

在代码库深度审计基准中,Sonnet 5.5表现略优于Opus,价格只有Opus的一半,仅花约5分钟,而Opus耗时近两倍、Astra耗时近三倍

待验证50%
10月2日

Theo建议应避开low档和Max档,使用medium档大致够用

待验证50%
10月2日

Sonnet 5.5成为首个仅通过截图读取和操作就通关《精灵宝可梦红》的Sonnet模型

待验证60%
10月2日

在代码库审计基准任务中,Sonnet成本约为Opus一半但得分略高,每分成本最佳,且Sonnet仅用约5分钟而Opus用了近两倍时间

待验证50%
10月2日

在Cursor Bench上Sonnet 5.5单任务消耗271,920个token,超过Opus的218k和Gemini 3.8 Flash的162k

待验证50%
10月2日

Theo实测Sonnet 5.5通过官方订阅平均约150 TPS,Opus约100 TPS

待验证50%
10月2日

Sonnet 5.5的推理档位分为low/medium/high/x-high/Max,从low到x-high的token用量仅增加5%至8%,但从x-high跳到Max token用量暴涨约1500%(15倍)

待验证50%

还有 40 条时间轴事件

全部知识事实 (20)

已验证

Claude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%

75%
已验证

官方称Sonnet 5在推理、工具使用、编码和知识工作方面相比Sonnet 4.6均有显著提升,整体性能已逼近OPUS 4.8但价格更低

70%
已验证

按标准价格(3美元/15美元)计算,Sonnet 5 在 Intelligence Index 上平均每任务成本 2.29 美元,而 Opus 4.8 只要 1.99 美元,Sonnet 5 反而比 Opus 4.8 贵约 15%

65%
已验证

Sonnet 5在Terminal Bench 2.1上取得80.4%的成绩,接近Opus 4.8

65%
已验证

Anthropic表示Sonnet 5.5和Haiku 5.5即将推出

70%
部分验证

Max模式抬高推理token的下限而非上限,强制模型达到一定推理量才算完成,常常损害性能

65%
部分验证

Sonnet 5.5在网络攻防能力上与Opus 5.5处于同一水准,是Sonnet系列中首款采用同等网络安全防护机制的模型

65%
部分验证

Opus 5.5 在输出 token 上比 Sonnet 5.5 多出约 49%,对应的 API 等价成本几乎贵了一半

65%
待验证

Sonnet 5.5成为首个仅通过截图读取和操作就通关《精灵宝可梦红》的Sonnet模型

60%
待验证

Sonnet 5.5在前端设计上明显不如Opus,远不如Fable,而Theo认为Fable 5.1是最佳设计模型

50%
待验证

Sonnet 5.5的缓存读取成本维持在每百万token 20美分没有下降,而Fable 5.1砍了90%、Opus砍了约60%

50%
待验证

Theo建议应避开low档和Max档,使用medium档大致够用

50%
待验证

在代码库深度审计基准中,Sonnet 5.5表现略优于Opus,价格只有Opus的一半,仅花约5分钟,而Opus耗时近两倍、Astra耗时近三倍

50%
待验证

在Cursor Bench上Sonnet 5.5单任务消耗271,920个token,超过Opus的218k和Gemini 3.8 Flash的162k

50%
待验证

在代码库审计基准任务中,Sonnet成本约为Opus一半但得分略高,每分成本最佳,且Sonnet仅用约5分钟而Opus用了近两倍时间

50%
待验证

Sonnet 5.5的推理档位分为low/medium/high/x-high/Max,从low到x-high的token用量仅增加5%至8%,但从x-high跳到Max token用量暴涨约1500%(15倍)

50%
待验证

Theo实测Sonnet 5.5通过官方订阅平均约150 TPS,Opus约100 TPS

50%
待验证

在改进T3 code的测试中,6.1 Sol得87.4分(Astra 83.8,Grok 4.7 80.7),成本仅2.15美元,而Opus 5.5需5美元、Sonnet 5.5近9美元

50%
待验证

测试者评价Sonnet 5.5配色不好看,在视觉观感上存在短板

50%
待验证

作者建议Sonnet 5.5不应被直接调用,而应作为Opus或Fable在拆解复杂工作时编排的子agent组件使用

50%

来源文章