CLM-8B推理提速9倍,Gemini 4进入后训练:AI日报速览

CLM-8B以9倍推理速度刷新Agent编程SOTA,百万上下文成标配,头部厂商发布节奏持续压缩。
本期AI日报呈现两条主线:推理效率与上下文窗口的持续内卷,以及智能体基础设施的加速成型。对比语言模型CLM-8B凭借对比学习目标实现最高9倍推理提速,微调后在DeepSWE基准创下81.6%新SOTA;Claude系列与Qwen 3.8 Max Prime均支持百万级上下文,百万上下文正从卖点变为标配,竞争焦点转向吞吐效率与多模态完整度。Google首次确认Gemini 4已进入后训练阶段,OpenAI内部代号Bell的万亿参数模型传闻亦同步曝光,头部厂商发布节奏持续压缩。基础设施层面,DeepSeek发布弹性计算平台DSCC与桌面客户端,英伟达开源语音模型PersonaPlex 7B,AI能力从Demo走向规模化落地的配套条件正在快速补齐。
对比语言模型的路线突破、企业级前沿模型上线、以及多家大厂的下一代模型进度曝光,构成了这期AI日报的核心。以下梳理几个信息密度最高的进展,并对其技术意义做简要分析。
CLM-8B:用对比学习换来9倍推理速度
对比语言模型(Contrastive Language Model, CLM)采用对比学习目标来连接「状态」与「动作」,被定位为一种超快的「系统一」模型。据介绍,CLM-8B经过互联网规模数据训练后,推理速度最高可比同类模型快9倍,同时在计算机操作、游戏与工具调用等任务上性能相当。
更值得关注的是它在智能体编程场景的表现:经过轻量微调后,CLM-8B在DeepSWE等智能体编程基准上创下81.6%的新SOTA。这说明「小模型+快速推理+针对性微调」的组合,在特定Agent任务上完全可以对标更大的模型。对于需要高频调用、低延迟响应的智能体工作流来说,推理速度9倍的提升几乎是决定产品可用性的关键变量。
对比学习(Contrastive Learning)源自自监督视觉表征领域,核心思想是让相似样本在向量空间中彼此靠近、不相似样本彼此远离,通过这种「拉近/推远」的训练信号替代传统的逐token预测目标。应用到语言模型中时,「状态-动作」对(即当前环境观测与应采取操作的配对)充当正负样本,使模型学会直接映射「感知→决策」,而非像标准自回归模型那样逐步生成推理链。这在概念上更接近心理学中的「系统一」——快速、直觉性的判断,而非需要多步展开的「系统二」深思熟虑。正因省去了大量中间token的生成过程,推理延迟得以大幅压缩。DeepSWE是一个评估AI在真实软件工程任务(如修复Bug、实现功能)中自主完成度的基准,81.6%的Pass@1意味着模型在超过八成的任务上能一次性给出可通过测试的代码,是当前Agent编程领域的顶尖水准。
Claude与Qwen:上下文窗口竞赛升级
泄露的模型规格显示,一款Claude系列模型(对应传闻中的Sonnet/Opus 5.5系列)配备了100万上下文窗口,最大输出12.8万token,思考模式默认自适应,可在低、中、高三档间调节,high与max档不可禁用。定价方面,输入2美元、输出10美元、缓存读取0.20美元每百万token。合作伙伴的访问权限被限制在仅24小时,且强制工具调用——这类限制通常出现在模型尚处于内测、厂商希望控制外泄风险的阶段。
阿里巴巴的Qwen 3.8 Max Prime同日上线Open Router,作为Qwen 3.8 Max的高吞吐版本,它保留了2.4万亿参数的旗舰能力,支持100万上下文,可接受文本、图像与视频输入,并提供可调节力度的推理、工具调用及结构化输出。百万级上下文正在从「旗舰卖点」变成「标配」,竞争焦点开始转向吞吐效率与多模态输入的完整度。
Gemini 4进入后训练,多家下一代模型进度曝光

Google DeepMind新负责人表示,Gemini 4已进入后训练早期阶段,团队准备尽快放出早期版本,希望发布时间远早于年底,但暂无具体日期。这是Google首次确认Gemini 4从预训练推进到后训练阶段,该模型已在内部供工程师使用。
围绕下一代模型的传闻同样密集:据泄露信息,OpenAI内部一款代号为Bell的AGI模型属于10万亿参数以上的预训练模型,据称能力超过下一代旗舰,进度或领先业界普遍预期。另有说法称,某款Opus 5.5发布后给对手模型带来明显压力,其定价也显著更低,促使相关厂商加紧准备新更新以应对。这些消息目前均为单一来源,需保持审慎,但共同指向一个趋势:头部厂商正在把发布节奏压缩得越来越紧。
「后训练」(Post-training)是指预训练完成后的一系列对齐与能力强化阶段,通常包括监督微调(SFT)、基于人类反馈的强化学习(RLHF)、以及近期流行的基于过程奖励模型的强化学习(如GRPO、DAPO等)。预训练阶段决定模型的基础知识与世界理解,后训练阶段则决定模型是否「好用」——是否听从指令、是否安全、是否能在推理类任务上稳定发挥。一个模型进入后训练意味着其底层参数基本固定,团队的工作重心转向行为塑造与能力激发。对外部观察者而言,「进入后训练」是判断模型发布时间线最可靠的信号之一,通常距离公开发布还有数周到数月不等。
Meta、DeepSeek与英伟达的工程化动作

Meta超级智能实验室的前沿模型Muse Spark 1.3已登陆Gemini Enterprise平台,企业用户可在Google Cloud的安全基础设施上直接部署调用。同时Meta发布Muse Real-Time Avatar,可将其实时语音能力转化为可交互的虚拟形象,并宣布推出搭载AI原生操作系统、深度集成Muse助手的新款VR眼镜,支持眼动、手势与语音组合操控。

DeepSeek广告这边的动作偏向工程基础设施:官方推出覆盖Windows与Mac的桌面客户端,直接提供安装包,降低了此前需安装Node、在终端运行命令的使用门槛。更重要的是DeepSeek发布了弹性计算平台DSCC,定位为大规模智能体训练与评估的生产及沙箱环境——智能体在会话中会突发式创建隔离的有状态环境,需要检查代码仓库、调用工具、运行命令,单一运行时难以覆盖,因此需要弹性执行平台支撑。这类基础设施的完善,往往是Agent能力从Demo走向规模化落地的前置条件。
弹性计算平台在智能体场景中的必要性,源于Agent工作负载与传统推理请求的根本差异。传统LLM调用是无状态的短请求,单一容器即可应对;而智能体执行一项任务时,往往需要在同一会话内持续读写文件、运行脚本、调用外部API,且不同子任务可能并发触发新的计算需求。「隔离的有状态环境」指每个Agent实例拥有独立的文件系统、进程空间和网络命名空间,确保并发任务互不干扰,同时在会话结束后可被快速销毁回收资源。这与云原生领域的容器编排思路一脉相承,但对启动延迟、状态持久化和资源调度的实时性要求更为苛刻。DSCC的发布意味着DeepSeek正在将此前用于自身模型训练的基础设施能力对外开放,降低外部开发者构建规模化Agent系统的门槛。
语音与开源:英伟达PersonaPlex与AI Builder

英伟达发布实时对话AI语音模型PersonaPlex 7B,以免费加开源方式向公众开放,主打实时对话语音能力。Fish Audio也发布了语音模型Drama 3预览版,主打更精细的语音控制——用自然语言描述语气、节奏与角色即可生成,支持剧中换声、一次生成多角色对话,不满意还能只重做单个词而无需整段重生成。
开源应用层面,PUTER团队按Apache 2.0协议开源了AI Builder,对标Lovable、V0、Replit等产品,上线三天收获112星。它支持大白话描述需求、实时预览、点选元素修改、一键发布公网地址与版本回滚,底座为开源网页操作系统PUTER。
模型能力排行榜
在今日的AI Builder模型能力智力榜上,头部三甲为:Claude Opus 5.5 Max(with Fallback)以58分登顶;Claude Fable 5.1 Max与GPT-6 Astra Max同以53分并列第二。国产开源双雄表现亦不俗:小米MiMo V2.6 Pro以46分列第9,Qwen 3.8 Max以45分列第10,与头部差距在12至13分之间。
整体来看,这一天的进展呈现两条主线:一是推理效率与上下文窗口的持续内卷,二是智能体基础设施(沙箱、桌面客户端、企业级部署)的加速成型。前者决定模型的天花板,后者决定这些能力能否真正被用起来。
相关推荐

Opus 5.5实测:一个Skill把PDF变成交互式动画电子书
开发者基于 Claude Opus 5.5 打造开源 Skill「Papermorph」,通过 PDF→规划→分镜→旁白→动画测验的流水线,把静态 PDF 自动转化为带交互测验的动画网页电子书,且暂未使用图像模型。本文拆解其工作流与技术亮点。

Perplexity押注垂直整合:Vera芯片替代x86背后的Agent基建野心
Perplexity宣布垂直整合其智能体基础设施,自建沙箱并押注Vera架构替代x86,开始部署Perplexity Computer。本文解析这一战略背后的技术逻辑与行业意义。

Extra Big Ass Intelligence:一场对AI炒作的幽默反讽
Extra Big Ass Intelligence是一个在Hacker News走红的恶搞项目,用幽默反讽调侃AI行业的过度炒作与命名通胀,引发技术社区对AI营销泡沫的集体反思。