AI日报:速度战与成本战全面开打

引言:AI竞赛进入速度与成本双线作战
AI行业的竞争焦点正在从单纯的模型能力,转向推理速度与运营成本两条战线。据Conner AI日报的整理,OpenAI推出可提速14倍的UltraFast模式,Google DeepMind将Gemini新版本价格直接砍半,同时芯片供应紧张与新型存储技术的突破,正在重塑整个行业的算力经济格局。
这一系列动态传递出一个清晰信号:当模型能力逐渐趋同,谁能在保证质量的前提下跑得更快、更便宜,谁就能赢得下一阶段的市场。
OpenAI GPT 5.6 UltraFast:推理速度提升14倍
OpenAI官方宣布预览GPT 5.6的UltraFast模式,运行速度最高提升14倍,输出速度达到每秒750个Token。
要理解这个数字的含义,需要先了解Token的概念。Token是大语言模型处理文本的基本单位,一个Token大致对应英文中的一个单词或中文中的一到两个字。传统大模型的输出速度通常在每秒50-150个Token之间,高性能模型如Claude、GPT-4o等在优化后可达每秒200-400个Token。每秒750个Token意味着模型可以在一秒内生成约500-600个英文单词的内容,远超人类阅读速度。推理速度的提升依赖于多种技术手段,包括推测解码(Speculative Decoding)、KV Cache优化、模型量化以及硬件层面的张量并行等。这一数字在当前主流大模型的推理性能中处于绝对领先水平。
你可能没注意到推出策略——该模式将首先向部分API客户开放,并随着容量增长逐步向更多企业推出。这种"容量约束下的分级放量"策略,也从侧面印证了一个现实:高性能推理背后是巨大的算力压力。速度的提升往往意味着更激进的硬件调度和推理优化,而这些资源在当前的芯片短缺环境下并不容易获得。
对于智能体(Agent)应用和实时交互场景而言,每秒750个Token的输出速度是一个关键门槛。它意味着更流畅的多轮对话、更快的代码生成,以及更低的用户等待成本。对于AI编程助手的代码补全、客服机器人的即时响应、以及多智能体协作中的高频通信等场景,推理延迟往往是决定用户体验和产品可用性的核心因素。
Gemini 3.7 Flash:价格减半,编码能力大涨
Google DeepMind推出的Gemini 3.7 Flash,是这轮成本战中最直接的一击。该模型专为编码和智能体工作流设计,首发价格仅为3.6 Flash的一半。

价格腰斩的同时,性能不降反升。评测数据显示:
- Frontier Code得分从34.4%提升至43.6%
- DeepSWE得分从49.0%大幅提升至65.3%
DeepSWE作为衡量软件工程能力的重要基准,超过16个百分点的提升相当可观。该基准测试模拟真实的软件开发场景,要求模型理解复杂代码库、定位Bug并生成修复补丁,是衡量AI是否能胜任实际软件工程任务的核心指标。这表明Gemini 3.7 Flash并非简单的"降价换量",而是在编码这一高价值场景中实现了成本与性能的双重优化。
对开发者而言,这意味着以更低的成本获得更强的代码智能体能力,这将进一步推动AI编程工具的普及。
新玩家入场:Red Note与美团的MOE模型
除了头部厂商的正面交锋,几家新玩家也带来了值得关注的技术方案,且不约而同地选择了MOE(混合专家)架构这一降本增效的路线。
MOE(Mixture of Experts,混合专家)是一种稀疏激活的神经网络架构,其核心思想是将模型分成多个"专家"子网络,每次推理时只激活其中一小部分。例如,一个280亿参数的MOE模型可能包含数十个专家模块,但每个输入Token只会被路由到2-4个专家进行处理,因此实际激活的参数量远小于总参数量。这种设计巧妙地解耦了模型容量与计算成本:总参数量决定了模型的知识储备和能力上限,而激活参数量决定了单次推理的实际计算开销。路由机制(Router)是MOE架构的关键组件,它负责决定每个Token应该由哪些专家处理。当前主流的MOE模型包括Mistral的Mixtral系列、Google的Switch Transformer,以及DeepSeek-V3等。
Red Note DOS 3 Note
据爆料,Red Note的AI实验室推出了DOS 3 Note预览版。这是一个280亿参数的MOE模型,激活参数仅16亿,支持512K超长上下文和多模态。

该模型采用了新的强化学习方案Tempo,在ARC-AGI 3基准上得分超过30%。ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)是由Kaggle创始人François Chollet设计的通用智能基准测试,旨在衡量AI系统的抽象推理能力而非记忆能力。该测试要求模型从少量示例中推断出转换规则并应用到新输入上,测试的是模型在全新、未见过的任务上的泛化能力。在ARC-AGI 3上超过30%的得分意味着模型已具备一定程度的抽象推理能力,虽然距离人类水平(通常在85%以上)仍有差距,但相比早期大模型接近零分的表现已有质的飞跃。
较小的激活参数意味着更低的推理成本,这正是MOE架构的核心优势——用大参数量保证能力上限,用小激活量控制运行开销。
美团Longcat 2.0
美团Longcat团队开发的Longcat 2.0模型已在相关平台免费发布。这是一个1.6万亿参数的MOE巨型模型,但激活参数仅约48亿,在Terminal Bench 2.1上得分70.8。
从280亿到1.6万亿,这两个模型代表了MOE架构在不同规模下的探索,也说明国内团队在稀疏化大模型上的技术积累正在快速追赶。值得注意的是,MOE架构的挑战在于负载均衡——需要确保各专家被均匀调用,避免部分专家过载而其他专家闲置,这在1.6万亿参数这样的超大规模下尤为考验工程能力。
算力战场:芯片短缺与存储技术突破
速度战与成本战的背后,是算力供给的根本约束。
据媒体报道,英伟达H100 GPU的一年期租赁成本在6个月内上涨了50%,部分大型芯片集群的等待时间已长达12至18个月。这组数据揭示了AI行业当前最真实的瓶颈——不是算法,而是硬件供给。
不过,好消息来自存储技术。Sandisk在HBF(高带宽闪存)方面取得进展,已完成流片,计划2027年提供样品,有望以1%的成本实现类似HBM的带宽。

要理解这一突破的意义,需要了解HBM与HBF的技术差异。HBM(High Bandwidth Memory,高带宽存储器)是当前AI加速器的核心存储组件,采用垂直堆叠的DRAM芯片通过硅通孔(TSV)技术互连,提供极高的内存带宽——例如英伟达H100使用的HBM3可提供超过3TB/s的带宽。然而HBM的制造工艺复杂、良率较低,导致成本极高且供应紧张,目前主要由SK海力士、三星和美光三家厂商垄断。HBF则是一种新兴替代方案,试图通过将NAND闪存进行类似HBM的高密度封装和接口优化,在大幅降低成本的同时接近HBM的带宽性能。闪存本身的单位存储成本仅为DRAM的几十分之一,这就是"1%成本实现类似带宽"这一愿景的技术基础。HBF特别适合推理场景,因为推理阶段对带宽的需求高但对延迟的容忍度相对较大,恰好匹配闪存的特性。
如果HBF技术能够如期落地,将在很大程度上缓解高带宽存储的成本压力,为大规模模型部署打开新的可能。
此外,Epoch AI发布的分析颇具启发性:根据2023年至2025年每季度实际购买的芯片数据,每亿美元每年能买到的AI算力约增加49%,相当于每21个月翻一番。这一"算力性价比翻倍周期"可以类比半导体行业著名的摩尔定律(每18-24个月晶体管密度翻一番),但两者的驱动机制有所不同:摩尔定律主要依赖制程工艺的微缩,而AI算力性价比的提升则来自多个层面的叠加效应——芯片架构创新(如从通用GPU到专用AI加速器)、制程进步、封装技术(如Chiplet和CoWoS)、软件编译优化、以及模型本身的效率提升(如量化、蒸馏、稀疏化)。49%的年增长率意味着三年后同等预算可购买的算力将是今天的约3.3倍,五年后接近7.5倍,这预示着今天只有大型科技公司才能负担的训练和推理规模,在几年后将变得中型企业甚至创业公司也能触及。
推理优化:Prime Flash MOE内核加速
在软件层面,推理优化同样在加速。Prime Intellect官方宣布推出Prime Flash MOE,这是一套针对Blackwell架构优化的CUDA内核,专用于MOE推理。

Blackwell是英伟达在2024年推出的最新GPU架构,代表产品为B100和B200。相较于前代Hopper架构(H100/H200),Blackwell在AI推理方面引入了多项重要改进:原生支持FP4精度计算、第二代Transformer引擎、以及更高效的NVLink互连。CUDA内核是运行在英伟达GPU上的并行计算程序单元,针对特定计算模式的定制化CUDA内核可以显著提升性能。
该内核支持BF16和MXFP8两种精度路径,并已在B200上完成基准测试。BF16(Brain Float 16)是Google提出的16位浮点格式,在保持足够数值范围的同时降低精度开销;MXFP8是微软和英伟达联合提出的8位混合精度格式,能在进一步减半内存和计算开销的同时保持模型精度。对MOE模型而言,稀疏激活模式导致GPU计算资源的利用率往往不如稠密模型,因此专门优化的内核能够通过更高效的专家分发、负载均衡和内存访问模式来弥补这一短板。
随着MOE架构成为主流,专门针对稀疏计算优化的底层内核将变得越来越重要——它们能在同样的硬件上榨取更多性能,从而进一步降低推理成本。
结语:能力趋同后,效率决定胜负
综观这一轮行业动态,一个明确的趋势正在形成:当模型能力逐渐逼近天花板,竞争的重心正在转向速度、成本与效率。
无论是OpenAI的14倍提速、Gemini的价格腰斩,还是MOE架构的广泛采用、HBF存储的技术突破,本质上都指向同一个目标——让AI能力以更低的成本、更快的速度触达更多用户和场景。
对于开发者和企业而言,这是一个值得庆祝的信号:AI的使用门槛正在持续降低,而算力性价比每21个月翻一番的规律,也预示着未来几年AI应用将迎来更大规模的爆发。
核心要点
相关推荐

Prequel评测:Mac屏幕录制自动缩放+4K导出的电影级录屏工具
深度评测Prequel这款macOS屏幕录制工具,支持智能自动缩放、4K导出、背景美化等功能,录完即出成片。对比Screen Studio,解析其核心优势与不足。

AI辅助创作实战:用Astra打造交互式奥德赛叙事卷轴
一位3D技术薄弱的开发者,借助AI工具Astra完成了交互式《奥德赛》叙事卷轴项目。本文详解Astra在故事理解、并行工作流、前端设计迭代中的关键优势,以及AI辅助创作降低技术门槛的实战经验。

互联网档案馆募资困境:8000亿网页背后的服务器运营挑战
互联网档案馆(Internet Archive)面临服务器运营资金压力,发起3倍匹配捐赠活动。本文分析Wayback Machine存档8000亿网页的成本挑战、非营利数字保存机构的生存困境及可持续发展路径。