[KongchangAI]
ModelClaude Opus 5.5

Opus 5.5

Anthropic旗舰大语言模型,采用MoE架构,定位高性能推理与多模态任务,以较低定价对标顶级模型

Core Facts

Timeline (last 90 days)

Oct 9

Anthropic的Opus和Sonnet 5.5取消了无推理选项,Haiku 5.5保留了该选项但在该模式下表现不好

Unverified50%
Oct 9

在Anthropic官方demo中,Opus单独完成鸡蛋降落任务用时3.5分钟、25次尝试、花费47美分;Opus搭配10个Haiku子agent则用时不到1分钟、86次尝试、仅花费14美分

Unverified50%
Oct 8

Haiku 5.5在不同推理强度之间的能力跃升明显,从high到max/X-high有相当大的提升幅度,不像Opus 5.5或Sonnet

Unverified50%
Oct 8

在夺旗速通测试中,Mistral Large 4在19个安全挑战中完成了18个,其网络安全表现超越Opus 5.5和GPT-6 Astra,部分因为后两者约40%任务被安全过滤器拦截

Unverified50%
Oct 8

Mistral Large 4在视觉定位任务上以42%对41%的微弱优势略胜GPT-6 Astra

Unverified50%
Oct 8

基准测试环境为 Claude Code 搭配 Opus 5.5,共 39 个任务(含一个真实的 FastAPI + React 仓库),每个任务运行 5 次

Unverified50%
Oct 8

Claude Fable 5 和 Opus 5.5 不支持关闭 thinking,发送 thinking: {type: "disabled"} 会返回错误 "thinking.type.disabled" is not supported for this model

Unverified50%
Oct 7

在Terminal Bench测试中GPT-6.1 Soul的max/high表现几乎与Opus 5.5打平,但每任务成本约$0.96美分,Opus每任务为$0.11到$0.13,价格约为十三分之一

Unverified50%
Oct 7

该用户称仅完成调整网页界面顺序、编写测试以及用Opus 5.5修复一个由Grok 4.7引入的bug,就消耗了约21%的月度配额

Unverified50%
Oct 7

Haiku 5.5可以作为子代理(sub-agent)与Claude Opus 5.5和Sonnet 5.5搭配完成编程工作

Unverified50%

40 more timeline events

All Facts (20)

Verified

Google 表示引导期结束后 Gemini 4 Argon 价格将上调至每百万输入 4 美元、输出 20 美元,对标 Opus 5.5 级别

80%
Verified

GPT-6.1 Sol的缓存读取价格为每百万token仅0.10美元

80%
Verified

Opus 5.5 在多数任务上达到 Fable 5.1 的水平,但运行成本降低约 40%,速度也更快

80%
Verified

推理时间长并不总是带来更好的结果,模型可能陷入过度思考的陷阱,真正决定输出质量的是模型的基础能力和对齐程度

75%
Verified

在 Automation Bench 上 Gemini 4 Argon 得分 51.3%,超过 Fable 5.1 的 31.4% 和 Opus 5.5 的 42.5%

70%
Verified

Opus 5.5在终端智能体基准拿到66分,高于Sonnet的55分和Astra的57.9分

70%
Verified

Anthropic称Opus 5.5典型任务总成本可降低约40%,输出速度提升30%以上

70%
Verified

Claude Opus 5.5的生成速度比Opus 5快超过30%

70%
Verified

GPT-6 Astra与以往的模型迭代明显不同,在某些方面强大但在另一些场景下提升不明显甚至像退步

65%
Verified

缓存读取机制对重复出现的长提示词前缀保留KV缓存,命中时按极低价格计费,Opus 5.5泄露的缓存读取价格约为输入价格的1/20

65%
Verified

长周期Agent的核心挑战包括任务容易偏离目标、错误会级联放大、资源消耗难以预估

65%
Verified

Opus 5 在 Low Effort 下的通过率约为 60%,超过了 Opus 4.8 在 Max 级别下的 59%,后者单任务成本高达 13 美元

65%
Verified

Claude Opus 5能力接近上一代旗舰Opus水平,但推理成本显著降低

65%
Verified

GPT-5.6 Sol具备持续运行数天的长周期任务能力,只需给定目标即可反复迭代产出详尽结果,且UI生成质量显著提升

65%
Verified

在Agents' Last Exam评测中,GPT-5.6 Sol取得53.6分,比采用自适应推理的Claude Fable 5高出13.1分

65%
Verified

Anthropic 发布了 Claude Sonnet 5,官方宣称其性能接近 Opus 4.8 且价格更低

60%
Verified

GPT-6 Sol 与 Anthropic 的 Opus 5.5 同日发布

70%
Verified

2026年7月9日,OpenAI同时发布了GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna三个模型

80%
Partially Verified

测评者建议让Opus 5.5负责实现和长程构建,让GPT-6.1 Sol负责审查、根因分析、代码库调查和任务分诊

65%
Partially Verified

在DeepSWE基准中,GPT-6.1 Sol的low档单次运行成本约0.21美元,而Astra同档需1.46美元,Opus 5.5在max档取得相同分数需14.65美元

65%

Source Articles