Sonnet 5.5
Anthropic推出的Claude Sonnet系列新版本,属于Claude模型家族中的中端产品线
核心事实
时间轴 (近 90 天)
有用户使用 Sonnet 5.5 完成 Jellyfin 自定义插件的 JS 重写等复杂任务
Sonnet 5.5的缓存读取成本维持在每百万token 20美分没有下降,而Fable 5.1砍了90%、Opus砍了约60%
Sonnet 5.5在前端设计上明显不如Opus,远不如Fable,而Theo认为Fable 5.1是最佳设计模型
在代码库深度审计基准中,Sonnet 5.5表现略优于Opus,价格只有Opus的一半,仅花约5分钟,而Opus耗时近两倍、Astra耗时近三倍
Theo建议应避开low档和Max档,使用medium档大致够用
Sonnet 5.5成为首个仅通过截图读取和操作就通关《精灵宝可梦红》的Sonnet模型
在代码库审计基准任务中,Sonnet成本约为Opus一半但得分略高,每分成本最佳,且Sonnet仅用约5分钟而Opus用了近两倍时间
在Cursor Bench上Sonnet 5.5单任务消耗271,920个token,超过Opus的218k和Gemini 3.8 Flash的162k
Theo实测Sonnet 5.5通过官方订阅平均约150 TPS,Opus约100 TPS
Sonnet 5.5的推理档位分为low/medium/high/x-high/Max,从low到x-high的token用量仅增加5%至8%,但从x-high跳到Max token用量暴涨约1500%(15倍)
还有 40 条时间轴事件
全部知识事实 (20)
Claude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%
75%已验证官方称Sonnet 5在推理、工具使用、编码和知识工作方面相比Sonnet 4.6均有显著提升,整体性能已逼近OPUS 4.8但价格更低
70%已验证按标准价格(3美元/15美元)计算,Sonnet 5 在 Intelligence Index 上平均每任务成本 2.29 美元,而 Opus 4.8 只要 1.99 美元,Sonnet 5 反而比 Opus 4.8 贵约 15%
65%已验证Sonnet 5在Terminal Bench 2.1上取得80.4%的成绩,接近Opus 4.8
65%已验证Anthropic表示Sonnet 5.5和Haiku 5.5即将推出
70%部分验证Max模式抬高推理token的下限而非上限,强制模型达到一定推理量才算完成,常常损害性能
65%部分验证Sonnet 5.5在网络攻防能力上与Opus 5.5处于同一水准,是Sonnet系列中首款采用同等网络安全防护机制的模型
65%部分验证Opus 5.5 在输出 token 上比 Sonnet 5.5 多出约 49%,对应的 API 等价成本几乎贵了一半
65%待验证Sonnet 5.5成为首个仅通过截图读取和操作就通关《精灵宝可梦红》的Sonnet模型
60%待验证Sonnet 5.5在前端设计上明显不如Opus,远不如Fable,而Theo认为Fable 5.1是最佳设计模型
50%待验证Sonnet 5.5的缓存读取成本维持在每百万token 20美分没有下降,而Fable 5.1砍了90%、Opus砍了约60%
50%待验证Theo建议应避开low档和Max档,使用medium档大致够用
50%待验证在代码库深度审计基准中,Sonnet 5.5表现略优于Opus,价格只有Opus的一半,仅花约5分钟,而Opus耗时近两倍、Astra耗时近三倍
50%待验证在Cursor Bench上Sonnet 5.5单任务消耗271,920个token,超过Opus的218k和Gemini 3.8 Flash的162k
50%待验证在代码库审计基准任务中,Sonnet成本约为Opus一半但得分略高,每分成本最佳,且Sonnet仅用约5分钟而Opus用了近两倍时间
50%待验证Sonnet 5.5的推理档位分为low/medium/high/x-high/Max,从low到x-high的token用量仅增加5%至8%,但从x-high跳到Max token用量暴涨约1500%(15倍)
50%待验证Theo实测Sonnet 5.5通过官方订阅平均约150 TPS,Opus约100 TPS
50%待验证在改进T3 code的测试中,6.1 Sol得87.4分(Astra 83.8,Grok 4.7 80.7),成本仅2.15美元,而Opus 5.5需5美元、Sonnet 5.5近9美元
50%待验证测试者评价Sonnet 5.5配色不好看,在视觉观感上存在短板
50%待验证作者建议Sonnet 5.5不应被直接调用,而应作为Opus或Fable在拆解复杂工作时编排的子agent组件使用
50%