[控场AI]
模型claude-sonnet-5-5

Claude Sonnet 5.5

Anthropic推出的Sonnet系列最新大语言模型,具备百万级上下文窗口,支持长代码库与超长会话处理,是Claude Code的默认推理模型

核心事实

时间轴 (近 90 天)

10月3日

Argon的发布价为每百万输入令牌2美元、输出10美元,与Sonnet 5.5持平,仅为GPT-6 Astra的五分之一;优惠期结束后将翻倍至输入4美元、输出20美元

待验证50%
10月3日

在VALS的Vibe Code Bench编码测试中,Claude Sonnet 5.5以92.4对91.9险胜Argon

待验证50%
10月2日

Claude Sonnet 5.5发布,2块、10块的单价维持不变,但单任务成本最多下降三成

待验证50%
10月1日

在泳池派对和游戏3D生成测试中,GPT-6.1 Sol的视觉表现尤其是角色建模明显不如Sonnet 5.5

待验证50%
10月1日

在机械臂抓取汽车的物理模拟测试中,GPT-6.1 Sol 工作约 18 分钟后主动放弃,动作比 Sonnet 5.5 更细腻、更少破坏性

待验证50%
10月1日

按过往定位 Sol 本应是 Opus 的竞争对手,但现在与 Sonnet 同价,表现未能全面压制 Sonnet 5.5

待验证50%
10月1日

Opus 5.5和Sonnet 5.5在水面效果上都存在问题,导入Godot引擎后未能保持Blender渲染时的质感

待验证50%
10月1日

在不使用任何图片贴图、纯靠代码在Blender建模并导入Godot制作地牢游戏的实测中,Sonnet 5.5的成品表现逼近旗舰Opus 5.5

待验证50%
10月1日

在复杂带物理表现的动画(如骷髅击败后散架)上Sonnet 5.5表现接近Opus 5.5,而简单动作(史莱姆移动、蝙蝠飞行)三家差距不明显

待验证50%
10月1日

第一阶段中Sonnet 5.5耗时4小时50分、调用1670次、等价账单164.79美元,其中缓存读取花费114美元

待验证50%

还有 40 条时间轴事件

全部知识事实 (20)

已验证

Anthropic发布了Claude Sonnet 5,是该系列迄今最大的一次更新

85%
已验证

Claude Sonnet 5.5 在终端(Terminal)基准上达到 70.6%,而上一代仅有 10.3%

75%
已验证

在SWE Bench Pro编程基准测试中,Sonnet 5取得63.2%,Opus 4.8取得69.2%

70%
已验证

Anthropic 为 Sonnet 5 默认启用了网络安全防护措施(cyber safeguards)

65%
已验证

Claude Sonnet 5 在 SWE-bench Verified(Agentic Coding)上得分 63.22%,距 Opus 4.8 约差 6 个百分点

65%
已验证

Sonnet 5 的 Intelligence Index 比 Sonnet 4.6 高出 6 分,在代理知识工作任务上超过了 Opus 4.8

65%
已验证

按标准价格(3美元/15美元)计算,Sonnet 5 在 Intelligence Index 上平均每任务成本 2.29 美元,而 Opus 4.8 只要 1.99 美元,Sonnet 5 反而比 Opus 4.8 贵约 15%

65%
已验证

Anthropic 发布了 Claude Sonnet 5,官方宣称其性能接近 Opus 4.8 且价格更低

60%
已验证

Anthropic表示Sonnet 5.5和Haiku 5.5即将推出

70%
已验证

Anthropic正式推出Claude Sonnet 5,官方定位为「最具Agentic能力的Sonnet模型」

80%
部分验证

Sonnet 5.5 运行速度相比 Sonnet 5 提升超过 30%

70%
部分验证

综合评价 GPT-6.1 Sol 是能力合格、Token 效率高、价格有竞争力的模型,但在动态 3D 游戏视觉震撼力上被同价的 Claude Sonnet 5.5 压制

65%
部分验证

Sonnet 5.5在网络攻防能力上与Opus 5.5处于同一水准,是Sonnet系列中首款采用同等网络安全防护机制的模型

65%
部分验证

Sonnet 5.5 是第一个带网络安全防护发布的 Sonnet 模型,高风险网络安全任务会明确切回 Sonnet 5

65%
部分验证

Opus 5.5 在输出 token 上比 Sonnet 5.5 多出约 49%,对应的 API 等价成本几乎贵了一半

65%
部分验证

Opus 5.5在终端智能体基准拿到66分,高于Sonnet的55分和Astra的57.9分

65%
待验证

GPT-6.1 Sol 的定价与前一天发布的 Claude Sonnet 5.5 完全一致

60%
待验证

在 Terminal Bench 上,中档 Sonnet 5.5 得分 28.8%,每任务约 0.83 美元;Sonnet 5 最高档只有 10.3%,每任务约 11.6 美元

60%
待验证

在VALS的Vibe Code Bench编码测试中,Claude Sonnet 5.5以92.4对91.9险胜Argon

50%
待验证

Argon的发布价为每百万输入令牌2美元、输出10美元,与Sonnet 5.5持平,仅为GPT-6 Astra的五分之一;优惠期结束后将翻倍至输入4美元、输出20美元

50%

来源文章