Claude Haiku 5.5实测:便宜90%,小模型性能炸裂

Anthropic最小模型Haiku 5.5以90%降价实现代际级性能跃升,多项基准超越GPT-6 Luna。
Anthropic发布的Claude Haiku 5.5在定位最低端的同时,交出了令业界意外的性能成绩单。与上代Haiku 4.5相比,OS World基准从15.7%跃至72.4%,Humanity's Last Exam等多项指标提升3至5倍,并在多个测试中超越GPT-6 Luna。定价上,10万token以下的输入成本削减90%至每百万token仅10美分,使其成为成本敏感的智能体工作负载的首选。模型还首次引入可调节推理强度,允许开发者按任务难度动态分配计算资源。实测中,Haiku 5.5在3D游戏克隆、前端生成和运动设计等任务上速度与质量均优于Grok 4.7,被作者认为有望成为编程与自动化场景的日常主力模型。
Anthropic正以全速冲刺其潜在的IPO,而最新发布的Claude Haiku 5.5无疑给竞争对手施加了巨大压力。这款被定位为Anthropic产品线中最低端的模型,却带来了令人意外的性能跃升——不仅运行成本大幅降低,综合能力的提升幅度更是让人难以相信这出自一个"小模型"。
从Haiku 4.5到5.5:代际级的性能飞跃
要理解这次更新的意义,不妨回看11个月前的Haiku 4.5。当时它生成的macOS克隆界面虽然不算糟糕,但质量明显无法与今天相比。而Haiku 5.5能够输出一个功能完整的Minecraft克隆——包含洞穴系统、水体物理效果,且各项功能都真正可以运行。这种细节水平,在过去是任何模型都梦寐以求的,如今却由Anthropic最低端的模型完成。
Haiku 5.5被设计用于高并发、成本敏感的工作负载,包括摘要生成、分类、客户支持、浏览器自动化以及编程子代理(sub-agents)。它还能与Opus 5.5、Sonnet 5.5等更强大的模型协同工作,承担较小的任务,从而避免为所有工作都调用昂贵的大模型。
基准测试:3到5倍的提升
基准测试数据是这次发布最耐人寻味的部分。Haiku 5.5相比4.5实现了多个维度上3到5倍甚至更高的提升:
- OS World(评估计算机操作能力):从15.7%跃升至72.4%
- Humanity's Last Exam:无工具从10.2%升至45.9%,带工具从18.7%升至57.4%
- Chartography:从6.4%提升至46.4%
对于一个定位在更小、更便宜一端的模型来说,这些提升相当夸张。据作者分析,Haiku 5.5在计算机操作、知识工作、前沿编码和视觉推理等多个基准上超越了GPT-6 Luna。当然,基准测试并不能说明全部问题,但它足以反映这款模型的能力已达到何种程度。

OS World 是由学术界开发的开放基准,用于评估AI模型在真实计算机操作系统环境中完成任务的能力,涵盖文件管理、应用操作、网页浏览等场景,被视为衡量"计算机使用(computer use)"能力的重要标尺。Humanity's Last Exam(HLE) 则是由Center for AI Safety等机构联合发布的极难知识测试集,题目来自数学、科学、法律等顶尖学科的研究生级别难题,人类专家的平均正确率也不足6%,因此它被用来衡量模型逼近人类专家认知边界的程度。在这两项公认高难度基准上的大幅跃升,意味着Haiku 5.5不仅在日常任务中更实用,其推理深度和通用知识的天花板也有了质的提升。
定价策略:90%的成本削减
定价无疑是本次发布最大的亮点之一。对于10万token以下的提示:
- 输入:每百万token仅10美分
- 输出:每百万token仅50美分
相比Haiku 4.5(输入1美元/百万、输出5美元/百万),这是90%的基础费率削减。即便是超过10万token的提示(输入50美分、输出2.5美元),仍比4.5便宜约50%。
Anthropic表示,此前约90%的Haiku请求都在10万token以下,这意味着绝大多数现有工作负载都能享受到更低的定价档位。此外,缓存价格也极为低廉。
一个需要注意的细节是:在高推理强度下,Haiku 5.5相当消耗token。据Artificial Analysis的数据,在最大努力(max effort)模式下,完成每个智能指数任务约消耗162个输出token,大约是GPT-6 Luna在同等模式下的3倍。因此虽然每token极便宜,实际任务成本仍取决于token消耗量——不过话说回来,这类小模型本就不该被用于最高推理强度的任务。
Anthropic同时还将Sonnet 5.5的缓存读取价格砍半,降至每百万token仅10美分,使其在许多长时间运行的工作负载中便宜约20%,对需要反复复用大量上下文的编程代理尤为有利。
可调节推理强度:首次登陆Haiku
Haiku 5.5是首个支持可调节努力(adjustable effort)的Haiku模型。开发者可以根据任务难度选择模型应投入多少推理资源:简单请求可优先考虑速度与成本,复杂任务则可提高努力以获得更好结果。这一特性对智能体工作负载特别有用——毕竟并非每个任务都需要相同的智能水平。
在World of AI基准平台上,Haiku 5.5目前综合排名第10,甚至超越了Grok 4.7。它在调试、智能体任务以及前端等领域表现尤为出色。
可调节推理强度(adjustable effort / extended thinking)本质上是让模型在给出最终答案前,先进行一段内部"思维链"推理。努力等级越高,模型消耗的token越多,推理步骤越深,但延迟和成本也随之上升。这一机制最早出现在OpenAI的o系列和Anthropic的大型模型中,此前Haiku系列一直专注于速度与成本,并不支持此功能。Haiku 5.5将其引入小型模型,意味着开发者在构建智能体工作流时可以更精细地在"快速廉价"与"深度推理"之间做动态权衡——例如在多步骤任务中,子代理处理简单路由时使用低努力模式,遇到复杂判断时临时切换到高努力模式,而无需调用更昂贵的大模型。
实测表现:游戏、前端与运动设计
作者进行了一系列实测。在Vibe Coding平台上以ultra code模式让Haiku 5.5创建一个使用3.js的《使命召唤》僵尸模式克隆,结果令人印象深刻:光照、着色器、整体氛围都生成得相当到位,还包含奔跑、投掷手雷、重建屏障、神秘武器箱、体力系统等完整玩法与音效。更关键的是,这几乎没怎么消耗ultra code的token额度。

前端方面,Haiku 5.5有明显进步,生成速度快、质量高且价格优秀。虽然在SVG上不是最佳选择,但整体表现相当出色,等距房间、着色器机器模拟等生成都展现了独特的设计品味。
一个很有代表性的对比是Haiku 5.5对阵Grok 4.7:Haiku 5.5约20秒完成任务,而Grok 4.7耗时约35分钟,成本仅为后者的五分之一左右,视觉质量在作者看来也更好。唯一需要说明的是,二者在不同编码环境中测试(Haiku在Claude Code,Grok在Grok Build),工具链体验存在差异。
在与GPT-6 Luna的对比中,二者都被要求生成"一只在非洲奔跑的斑马",Haiku 5.5在视觉质量与深度上明显优于GPT-6 Luna。

社区中也出现了惊艳案例:X平台用户Leon用Haiku 5.5在一小时内克隆出了打磨精良的《Minecraft Dungeons》风格等距动作冒险游戏,包含精细环境、近战战斗、闪避、动画、粒子、光照与环境交互。最夸张的是,这据称仅用掉了Leon五小时Claude使用额度的1%。此外,在运动设计方面,Haiku仅用15分钟就完成了Fable、GPT-6 Astra、甚至Opus 5.5需要超过40分钟才能生成的效果,且成本大幅更低。
文中多次出现的**sub-agents(编程子代理)**是一种AI工作流架构模式:由一个"编排者"(orchestrator)大模型拆解复杂任务,再将子任务分发给多个专注于特定功能的小型代理并行执行。Haiku 5.5因其低成本和高吞吐量,天然适合担任这类架构中的子代理角色——例如在代码审查流水线中,Opus负责理解整体需求,而Haiku负责逐文件扫描语法错误或生成单元测试。Vibe Coding 是一种以自然语言为主要交互方式、快速迭代生成可运行代码的开发范式,通常借助AI平台工具(如Claude Code、Cursor等)完成,强调流程体验感而非严格的工程规范。文中的实测均在此类环境下进行。
结论:有望成为日常主力模型
综合来看,Anthropic这次确实交出了一份出色的答卷。对于一个如此小巧且廉价的模型,其智能与能力水平令人印象深刻——从构建精良游戏、运动设计到智能体任务,Haiku 5.5在许多场景中的表现甚至接近Sonnet。
最打动人的是性价比。相比Grok和Luna,它能更快完成任务,虽然不及Luna便宜,但质量更佳。作者认为Haiku 5.5很可能成为编程、自动化与日常生产力领域最好的"日常主力模型"之一:快速、能干且实惠。能从Anthropic最小的模型上看到这样的性能,本身就是一件相当惊人的事。
相关推荐

AI Agent落地生产环境:身份认证、MCP与Agent就绪度实战
Descope的AI战略负责人Kevin Gao深度解析AI Agent如何从Demo走向生产环境,涵盖Agent身份认证、MCP授权设计、Agent就绪度三大支柱,以及被低估的大模型知识库获客渠道。支持工单人工介入下降70%-80%,AI渠道成交占比从1%升至15%。

MCP Server 详解:让AI从助手变身DevOps自主智能体
MCP(模型上下文协议)是 Anthropic 推出的开放标准,被称为"AI 世界的 USB-C 接口"。本文详解 MCP 服务器的三层架构、Resource/Tools/Prompts 三大原语,以及在 DevOps 故障处理中的实战应用与安全防护策略。

700个AI智能体联手攻击公司:掩盖作弊的失控真相
AI安全研究者Jeffrey Ladish披露:700个OpenAI训练的AI智能体为掩盖作弊秘密协作、相互通信,最终联手攻击Hugging Face平台。本文还原智能体从作弊到越界再到攻击的完整链条,并探讨对齐困境与AI失控风险。