[控场AI]
模型Claude 3.5

Claude 3.5 Sonnet

Anthropic发布的Claude 3.5 Sonnet模型,在编程基准测试上通过率超过80%,代码生成能力强,是vibe coding场景下的主流AI编程工具之一

核心事实

时间轴 (近 90 天)

9月17日

中转服务商可以在转发时替换模型版本,如将Claude 3.5 Sonnet替换为更廉价的旧版本

待验证50%
9月16日

n8n AI助手允许用户在会话中途切换底层模型(如从GPT-4o切换到Claude 3.5 Sonnet)

待验证50%
9月12日

前沿级别(frontier-grade)是AI行业用来描述当前最顶尖大模型能力层次的术语,通常指代GPT-4、Claude 3、Gemini Ultra等模型

待验证50%
9月11日

满血不降智宣传语暗指使用GPT-4o、Claude 3.5 Sonnet等完整版本模型,但模型路由由第三方控制,用户无从验证

待验证50%
9月11日

Claude 3.5 Sonnet原本支持200K上下文窗口,部分参数压缩服务将其压缩到32K甚至更短

待验证50%
9月11日

参数压缩指中转服务降低模型上下文窗口或输出Token上限,如将Claude 3.5 Sonnet的200K上下文窗口压缩到32K或更短

待验证50%
9月6日

Anthropic的Computer Use在2024年10月随Claude 3.5 Sonnet推出,直接操控桌面环境的鼠标和键盘

待验证50%
9月5日

Computer Use功能于2024年10月随Claude 3.5 Sonnet发布,允许AI模型直接观察屏幕截图、移动鼠标、点击按钮和输入文字,操控桌面应用程序

待验证50%
9月5日

Claude Fable 5.1是Claude系列在代码生成领域的最新迭代,相比Claude 3.5 Sonnet在代码理解、架构规划和长序列生成一致性上进行了专项优化

待验证50%
9月3日

到 2024-2025 年,随着 Claude 3.5 Sonnet、Gemini 2.5 Pro 等模型发布,三大厂商在核心编程任务上的表现已高度趋同

待验证50%

还有 25 条时间轴事件

全部知识事实 (20)

已验证

GPT-3时代的上下文窗口仅有2,048个Token,而Google Gemini已支持百万级Token,Claude支持200K Token,GPT-4 Turbo支持128K Token

90%
已验证

Claude 3.5 Sonnet的上下文窗口为200K Token

90%
已验证

Claude 3.5系列支持最高200K token的上下文窗口,约相当于15万字中文

80%
已验证

Claude 3.5 Sonnet支持200K Token的上下文长度,可一次性处理约15万字的文本

80%
已验证

Claude 3.5 Sonnet在SWE-bench等代码基准测试中长期领先

80%
已验证

Computer Use技术最早由Anthropic在2024年10月随Claude 3.5 Sonnet发布时公开展示

80%
已验证

Claude 3.5支持200K Token上下文窗口,GPT-4o支持128K Token上下文窗口

80%
已验证

Claude 3.5 Sonnet的API定价约为每百万输入Token 3美元、每百万输出Token 15美元

80%
已验证

Claude 3.5 Sonnet的API输入价格约为3美元/百万token,输出约为15美元/百万token

80%
已验证

Claude 3.5 Sonnet在多项基准测试中与GPT-4o不相上下

80%
已验证

Claude 3.5 Sonnet是Anthropic于2024年推出的模型,在代码生成基准测试HumanEval上超越了同期GPT-4o

80%
已验证

目前主流的Agent底座模型包括GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro等闭源模型,以及Llama 3、Qwen2.5、DeepSeek等开源模型

75%
已验证

Artifacts功能最早由Anthropic在2024年6月随Claude 3.5 Sonnet一同推出

75%
已验证

DeepSeek V4 Pro的价格远低于GPT-4o和Claude 3.5 Sonnet等国际主流模型

75%
已验证

Claude 3.5 Sonnet支持200K token上下文,GPT-4 Turbo支持100K token上下文

70%
已验证

Claude 3.5 Sonnet在长文本理解、代码生成和指令遵循方面表现突出,尤其适合需要精确格式输出的任务

70%
已验证

在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内

65%
已验证

GPT-4、Claude 3.5 Sonnet、Gemini 1.5 Pro等新一代大语言模型在HumanEval、SWE-bench等代码能力基准测试上的得分已大幅超越此前版本

65%
已验证

Claude 3.5 Sonnet在SWE-bench软件工程基准测试上突破49%的解题率

65%
已验证

Claude 3.5 Sonnet在代码生成基准测试HumanEval中达到了92%的通过率

65%

来源文章