[控场AI]
· 6 分钟阅读· 3,312 字

Claude Opus 5.5成本降四成,GPT-6双模型API价格腰斩

Claude Opus 5.5成本降四成,GPT-6双模型API价格腰斩

头部AI厂商全面转向成本竞争,同期安全风险从技术层扩散至从业者身心健康层面。

本期AI早报呈现出三条并行主线。其一,以Anthropic、OpenAI和阿里为代表的头部厂商集体将竞争重心从性能跃升转向成本压缩,Claude Opus 5.5典型任务成本降四成,GPT-6新系列API价格较促销价再减半,行业正从"谁更聪明"转向"谁更便宜"。其二,图像生成赛道持续升温,阿里Qwen-Image-2.1在Arena双榜登顶开源第一,与闭源头部差距已缩至个位数分,腾讯混元Image 3.5同步跟进,国内厂商密集发布将该领域推向白热化。其三,安全议题从技术漏洞(Meta Muse零日漏洞)延伸至AI心理陪伴风险,再蔓延到从业者自身的心理健康压力,OpenAI以开放外部审查作为应对,行业对AI快速部署的代价正在多个维度同步显现。

AI早报速览:模型迭代提速,成本战全面打响

本期AI早报由B站UP主阿黎整理,涵盖模型更新、图像生成、AI芯片与安全风险等多条动态。整体来看,头部厂商正在同时打两场仗——一是性能对标,二是成本压缩。以下是核心动态的梳理与分析。

头部模型集体降价,成本成为核心战场

Anthropic发布Claude Opus 5.5,多数任务性能对标Claude 5.1,运行速度较Opus 5提升约三成,典型任务成本下降约四成,输入与输出定价同步下调,Pro Max和Team用户的使用限额也已提高。这意味着Anthropic在保持能力的前提下,把重心明显放在了推理效率和单位成本上。

OpenAI则推出GPT-6 Sol与Luna两款模型,主打更强的缓存和推理效率,面向大规模低成本应用。据UP主介绍,两款模型的API价格较GPT-5.6促销价直接下降一半,综合能力大致持平前代,但自动化任务的单次成本更低。

把两家动态放在一起看,行业趋势已经很清晰:在能力提升边际收窄的阶段,谁能把同等智能做得更便宜、更快,谁就能拿下大规模应用场景。降价不再是促销手段,而是竞争的主战场。

阿里巴巴方面公布了Qwen系列模型,涵盖Max、Flash、Plus和27B版本,分别对应高性能、快速响应及不同规模的应用需求。市场预计下一次重大升级可能迈向5万亿至10万亿参数级别,参数规模的想象空间依然被拉得很大。

图像生成竞争白热化,Qwen-Image-2.1开源登顶

阿里通义千问广告开源发布Qwen-Image-2.1,在Arena图像编辑和文生图两项榜单中均位列开源模型第一,图像编辑项目进入总榜第16位,与GPT-Image 1.5、High Fidelity相差三分。作为开源模型能拿下双榜第一,说明开源阵营在图像生成上正快速逼近闭源第一梯队。

在Arena图像编辑和文生图两项榜单中

腾讯的混元Image 3.5预览版也已上线,支持文生图和图生图,最高可输出2K分辨率,并提升生成结果的一致性。官方称模型在人类评测中的胜率较混元Image 3.0提高30%,腾讯云广告API每张定价0.15元。从开源到闭源,国内厂商在图像生成赛道的密集发布,正在把这一领域推向白热化。

Arena榜单(即LMSYS Chatbot Arena的图像版)是目前业界最具公信力的AI图像生成评测平台之一,采用人类盲测对战制:用户同时看到两张由不同模型生成的图片,在不知道模型身份的情况下投票选出更好的结果,最终以Elo积分排名。这种评测方式相比固定测试集更难"刷榜",因为模型需要在真实用户偏好下持续胜出,所以在Arena榜上进入前列对开源模型而言含金量较高。Qwen-Image-2.1在图像编辑和文生图两个子榜均拿下开源第一,意味着其在两类截然不同的任务(修改已有图片 vs. 从文字描述从零生成)上都得到了人类评测者的认可,而非单一维度的优化。

工具生态更新:从桌面端到移动端自动化

DeepSeek相关工具Harness发布V0.1.7版本,支持长时间命令和工作流转入后台运行,并加入表格文件预览、绘图置顶归档、本地语音转写和统一模型服务商管理,同时修复多项桌面端问题。

谷歌开源了ART EMIS工具,让AI能在安卓真机上识别屏幕、点击滑动并跨应用完成任务,执行节奏约每步3秒,支持日志、截图回放和报告,有望提升移动端测试、调试与自动化效率。

截图回放和报告

Kimi则推出浏览器扩展(由Kimi Web Bridge更名而来),用户可在侧边栏对话,协助导航网页、填写表单和完成任务,重复操作可录制为技能后续交由AI自动执行,产品已上线官网和Chrome应用商店。这一系列更新指向同一个方向——AI Agent正从对话走向真实操作环境。

AI芯片与本地推理:算力与端侧同步推进

阿里平头哥发布PPU(真5V900)迅推一体AI芯片,算力达到上一代M890的3倍,支持216GB显存及FP8、FP4精度。搭载这款芯片的盘九超节点服务器计划2027年一季度上市,后续芯片预计2028年推出,时间表拉得较长。

端侧方面,Underdog发布Husky推理引擎,称其速度较苹果MLX最高快4.5倍,MacBook本地推理可达每秒730个token,配套私密AI助手体积不足4GB,数据留在设备端,可处理邮件和会议纪要等任务,涉及下单等操作前需人工确认。

MacBook本地推理可达每秒730个次元

本地推理引擎的进步,意味着隐私敏感场景有了更多脱离云端的选择,这对个人助手类应用是重要利好。

FP8和FP4是浮点数精度格式,数字代表用于存储每个数值的比特位数。传统AI训练多用FP32或FP16,而FP8(8位)和FP4(4位)通过降低数值精度来大幅减少显存占用和计算功耗,同时在可接受的精度损失范围内维持推理质量。支持FP4意味着同等显存可以装载参数量更大的模型,或以更低能耗运行同等规模模型,这对数据中心降低单Token成本至关重要。MLX是苹果专为Apple Silicon芯片(M系列)设计的机器学习框架,针对统一内存架构做了深度优化,是目前Mac本地推理的主流方案。Underdog Husky宣称比MLX快4.5倍,若属实则意味着Mac用户运行本地大模型的体验将有显著提升,但独立测试验证前该数据仍需审慎看待。

安全风险持续暴露,行业压力浮出水面

本期早报中安全议题占据不小篇幅。有消息称Claude Opus 5.5或将为少数高风险开发任务引入自动降级机制,在内核开发和前沿大模型研发等场景,系统可能切换至能力较弱的模型以限制能力输出。这是一种颇具争议的安全设计思路。

Meta AI助手Muse被曝存在严重零日漏洞,本地应用或终端命令可窃取账户认证令牌,攻击者可能借此完全接管智能体、写入恶意文件或调用摄像头,Meta在披露约12小时后紧急修复。Agent权限越大,攻击面也越大,这类漏洞值得警惕。

英国AI安全研究所

更值得关注的是人的问题。一项AI心理支持试点中,14名参与者里有3人出现自杀意念或轻躁狂等明显精神问题,专家认为AI心理陪伴若进入高风险人群又缺少专业人员支持,可能加剧伤害,筛查标准和安全边界亟待明确。另一边,英国AI安全研究所多名员工因工作压力请病假并接受心理辅导,紧张的测试周期和对AI快速部署的担忧正在推高压力。

作为应对,OpenAI宣布向第三方评估机构开放训练、评测和部署全流程的深度访问,外部机构可检验安全假设、发现潜在风险并判断防护措施是否有效,并列出四个优先评估领域。开放外部审查,或许是当前重建信任的务实一步。

零日漏洞(Zero-Day Vulnerability)指软件中已被攻击者发现、但开发商尚未察觉或尚未发布补丁的安全缺陷,"零日"意指开发商有零天时间提前防御。Meta Muse此次曝光的漏洞属于认证令牌窃取类攻击:认证令牌是应用登录后由服务器颁发的凭证,用于证明用户身份,一旦被窃取,攻击者无需密码即可以受害者身份执行任何操作。对AI Agent而言,此类漏洞的危险性被成倍放大——普通应用被攻破最多导致数据泄露,而拥有调用摄像头、写入文件、跨应用操作权限的智能体一旦被接管,实际上是把一个具备自主行动能力的"数字手"交给了攻击者,这也是为什么安全研究者普遍认为Agent权限边界的设计比传统软件更需要谨慎。

小结

综合本期动态,行业主线可以概括为三条:模型能力趋同下的成本竞赛、图像生成的开源突围、以及安全风险从技术层面向从业者身心层面的蔓延。前两条决定谁能拿下市场,第三条则决定这场竞速能走多远。

分享:

相关推荐