OpenAI Astra即将发布,Qwen本地模型逼近闭源前沿

Astra临近发布:从Codex的蛛丝马迹说起
过去一周,AI圈子里最劲爆的消息几乎都围绕着OpenAI下一代模型Astra展开。事情的起点颇具戏剧性——就在Anthropic遭遇服务中断的时候,OpenAI迅速发布了一张展示Codex达到99.9%运行时长的图片,隐隐透着一丝挑衅意味。
Codex是OpenAI推出的云端AI编码智能体平台,允许开发者将编程任务委派给AI在沙盒环境中自主完成。与传统的代码补全工具不同,Codex能够独立执行完整的开发工作流——包括理解需求、编写代码、运行测试、提交pull request等。其99.9%运行时长(uptime)的数据意味着该服务几乎从不中断,这对依赖AI持续工作的企业级用户至关重要。
随后,OpenAI的Thibault公开抛出了几个关键信息:Codex的可靠性正逼近100%,其技术栈部分可能会开源,而最重磅的一句话则是——"我们还将拥有Astra"。
这句轻描淡写的话瞬间点燃了整个社区。紧接着,多名OpenAI员工开始就Astra进行"模糊发帖",种种迹象都指向这款下一代模型正在快速接近发布,甚至可能在本月底前就与大家见面。
Mew4之谜:production代码中的隐藏模型
真正让人浮想联翩的,是社区在OpenClause部署记录中发现的一个代号:Mew4。
据挖掘者披露,在8月5日的部署活动中,维护者Peter Steinberg正在处理实际的生产UI代码,而部署历史里有一行非常具体的记录——"engine codex model Mew4, thinking x-high"。这意味着Mew4并非某个凭空提及的神秘名字,而是作为一个独立代码审查者,以"x-high"推理模式被实际接入了Codex,用来审查真实的pull request,涉及composer菜单、connectors、工具访问、skills、侧边栏控制等界面组件。
这里的"x-high"推理模式值得解释:现代推理模型(如o系列)允许用户设置不同的"思考强度"等级,从low到high再到x-high,等级越高意味着模型在生成最终回答前会花更多时间进行内部推理链条的展开和验证。x-high通常用于需要极高准确性的复杂任务,如代码审查中的逻辑正确性验证。

然而蹊跷的是,Mew4的公开引用随后开始消失。据统计,8月7日Mew4的名字从52个pull request中被抹去,而这些引用后来被替换成了"GPT-5.6-Sol"。更耐人寻味的是,六天后Mew4的名字又出现在OpenAI自家的Codex仓库中。
这一系列操作引发了大量猜测。如果Mew4确实是一个内部模型,其名字后来被隐藏在GPT-5.6-Sol之下,那么它很可能是OpenAI尚未准备公开的内部检查点或部署候选版本。在深度学习领域,"检查点"(checkpoint)指的是模型训练过程中某个特定阶段保存的参数快照,研究团队通常会对多个检查点进行评估和后训练(post-training),包括RLHF对齐、指令微调等步骤,最终选出表现最佳的版本作为发布候选。
当然,目前没有直接证据将Mew4与Astra画上等号——它可能是Astra的一个检查点、一个后训练分支,也可能是完全无关的研究模型。但结合最近的种种动向(Thibault公开确认Codex将拥有Astra,甚至Sam Altman前往华盛顿确认Astra发布),这种关联的可能性正变得越来越大。
Astra为何值得期待:多智能体编排能力
抛开泄露不谈,Astra本身的定位才是最值得关注的。此前有报道称,Astra训练的核心目标是让多个智能体能够协作,在长时间跨度内共同解决极其困难的问题。而OpenAI已经在Codex内部搭建了正好匹配这一目标的基础设施。
多智能体编排(Multi-Agent Orchestration)是一种日益成熟的AI系统架构模式,其中多个专门化的AI智能体各自承担不同的子任务,由一个中央编排者协调它们的工作。这与单一大模型处理所有任务的范式形成对比。在编码场景中,编排者可以将一个复杂项目拆解为前端、后端、测试等子任务,分别交给不同智能体并行处理,最后整合结果。这种架构的优势在于:可以为简单任务使用低成本模型以节省资源,同时通过并行执行大幅缩短完成时间,且各智能体可以相互审查以提高输出质量。

目前的Sol和Terra可以并行工作并相互通信,而Luna则可以作为Codex多智能体系统中的子智能体运行。在这种架构下,Astra很可能扮演"编排者"(orchestrator)的角色:你给它一个庞大的任务,Astra将其拆解,把工作分派给Luna这类更廉价的模型,让多个智能体同时运转,再审查它们的输出并整合成最终结果。
这种模式在软件工程中并非全新概念——它类似于分布式系统中的主从架构(master-worker pattern),但将"工人"从传统的计算进程替换为具备推理能力的AI智能体,使系统能够处理需要创造性判断的复杂任务,而非仅仅是可并行化的计算工作。
如果关于Astra是全新预训练模型的传闻属实,那么这些多智能体能力可能是从模型底层就训练进去的。正如Claude Code在agentic coding领域的突破一样,Astra或许会成为长周期、多智能体能力上的一次重大突破。
Codex解锁100万token上下文窗口
另一个几乎被忽略的更新是,Thibault记录了如何在Codex中为GPT-5.6 Sol解锁100万token的上下文窗口。默认情况下,Codex使用较小的调优上下文以平衡性能和成本,但Sol本身支持约100万token。用户只需打开Codex配置,添加对应的model slug并将上下文窗口设为100万、auto-compact阈值设为90万,即可手动启用。
上下文窗口(Context Window)指模型在单次推理中能够"看到"和处理的最大文本量。100万token大约相当于75万个英文单词或数百个代码文件的总量。对于大型代码库而言,传统的有限上下文窗口迫使智能体频繁"遗忘"之前处理过的内容,导致决策不连贯。auto-compact阈值则是一种自动压缩机制,当上下文接近上限时自动摘要早期内容以腾出空间。将其设为90万意味着在消耗90%容量前都保持完整记忆,只有在极端情况下才触发压缩。
这对超大型代码库和长时间编码会话意义重大——智能体不再那么容易"忘记"早期的决策。许多人此前甚至不知道这一功能的存在,一旦开始测试,长上下文编码就展现出令人印象深刻的效果。
Cursor推出Origin代码托管平台:正面挑战GitHub
开发工具赛道也不平静。Cursor推出了自己的代码托管平台Origin,最直接的理解就是Cursor对GitHub发起了正面冲击。
GitHub自2008年成立以来,已成为全球开发者协作的事实标准平台,托管超过3亿个代码仓库,2018年被微软以75亿美元收购。其核心功能包括Git版本控制托管、代码审查(Pull Request)、CI/CD(持续集成/持续部署)等。Cursor作为AI原生代码编辑器推出Origin,本质上是试图打造一个从编写、托管到部署的闭环生态,绕过GitHub这一中间层。

Origin允许你同步现有的GitHub仓库,主打快速、简洁,并与Cursor工作流深度集成。它还与Vercel、Buildkite、Depot等主流集成建立了合作,更多合作方也将陆续加入。Vercel是前端部署平台的领导者,Buildkite和Depot则专注于CI/CD流水线加速——这些工具共同构成了现代开发者从编码到上线的完整工具链。目前该功能处于beta阶段并正在逐步推出。
如果Cursor能让托管、编码、审查和部署真正融为一体、形成无缝工作流,那么Origin有望成为开发者技术栈中举足轻重的一环。这一战略的底层逻辑在于:当AI能够承担越来越多的编码工作时,开发者工具的竞争焦点将从"谁的编辑器更好用"转向"谁的端到端自动化流程更顺畅"。
Qwen 3.8 27B:本地模型性能逼近闭源前沿
如果说Astra代表着闭源前沿的天花板,那么Qwen 3.8的27B参数模型则展示了本地模型令人瞠目的进步速度。
27B(270亿)参数的模型之所以被称为"可在消费级硬件本地运行",是因为经过量化压缩(如4-bit量化)后,该模型约需16-20GB显存,一张高端消费级显卡(如RTX 4090的24GB显存)即可加载运行。相比之下,GPT-5.6等闭源模型据推测可能拥有数千亿甚至万亿级参数,只能在大规模数据中心的集群上运行。本地运行意味着数据完全不离开用户设备,兼具隐私性和零延迟的优势,且无需按token付费。
据Artificial Analysis的最新数据,这个仅270亿参数的模型在Agentic指数上拿到了51分,超过了GPT-5.6 Terra、DeepSeek v4 Pro、GPT-5.6 Luna以及Gemini 3.7 Flash。Agentic指数衡量的是模型在自主执行多步骤任务时的综合能力,包括工具调用、计划制定、错误恢复等——这正是编码智能体最需要的能力。在更综合的Artificial Analysis智能指数上,它也达到了DeepSeek v4 Pro和GPT-5.6 Luna的水平。

更关键的是,这些跑分能较好地转化为真实世界的结果。有人让Qwen 3.8 27B构建一款《使命召唤》风格的游戏,结果它在本地消费级硬件上就完成了相当复杂的项目。这意味着本地模型正逐渐达到无需持续为昂贵的前沿模型API和订阅付费、也能生成真正复杂项目的水平。本地模型与闭源前沿模型之间的差距,正在以惊人的速度缩小。
Qwen系列由阿里巴巴旗下的通义实验室开发并开源,其快速迭代也反映了当前开源模型社区的活力——Meta的Llama、Mistral、DeepSeek以及Qwen形成了多极竞争格局,彼此的技术突破会迅速被整个社区吸收和改进。
Sol价格战与DeepSeek v5传闻
另一边,GPT-5.6 Sol突然打起了价格战。Vercel宣布Sol在AI Gateway上截至9月18日五折优惠(标准和快速模式均适用),OpenRouter随即也推出了自己的五折优惠,涵盖Batch、Flex、Priority层级,其中Flex模式低至每百万输入token 1.25美元。
AI模型的定价通常按token计费——每百万输入token 1.25美元意味着处理约75万个英文单词的输入仅需1.25美元。这一价格在一年前几乎不可想象,彼时同等能力模型的成本要高出一到两个数量级。价格战的深层逻辑在于AI服务存在强烈的网络效应和切换成本:开发者一旦围绕某个模型API构建了应用、积累了prompt工程经验和评估流水线,迁移成本极高。因此,短期内的激进定价实质上是在争夺长期生态锁定,类似于云计算早期AWS与Azure的价格竞争。
为何大家突然争相降价?最简单的解释是提升使用量——OpenAI此前大幅下调Luna和Terra价格后,用量随即暴涨。但结合Astra即将到来的背景,这一时间点耐人寻味:如果OpenAI准备推出一款比Sol更强、也可能更贵的模型,那么提前让开发者深度绑定GPT-5.6生态就顺理成章了。Sol降价可以视为一种"钩子"——开发者被吸引进入生态后,面对更强大的Astra自然会考虑升级。
此外,关于DeepSeek v5的传闻也开始流传,可能的发布窗口在9月。虽然架构和模型细节尚不明朗,但考虑到v4 flash模型的超高性价比,一款真正的下一代flash模型极具想象空间。DeepSeek以其MoE(Mixture of Experts,混合专家)架构闻名,该架构通过在推理时仅激活部分参数来大幅降低计算成本,同时保持接近全参数模型的性能。有消息称,如果DeepSeek v5 flash能达到某些顶级模型的水平,凭借其定价将"直接改写格局"。
结语:AI能力边界正在多方向同时突破
值得一提的是,OpenAI联合创始人Greg Brockman近期透露,OpenAI已开始专门训练模型编写所谓"超人级安全"的代码,能在工程师面前直接呈现安全修复方案。这意味着AI不仅在生成代码,更在理解代码中的安全漏洞模式——如SQL注入、跨站脚本攻击(XSS)、缓冲区溢出等——并主动修复它们。结合Astra和日益强大的编码智能体,网络安全或将成为这些模型的下一个重要战场。
从Astra的多智能体编排,到Qwen本地模型逼近前沿,再到DeepSeek v5的传闻和Cursor对GitHub的正面挑战,这一周的种种动向共同勾勒出一个清晰的趋势:AI能力的边界正在多个方向同时被快速推开。闭源模型在推理深度和系统集成上持续攀升,开源模型在效率和可及性上快速追赶,而开发工具生态则在争夺谁能定义下一代软件工程的工作流。这三股力量的交汇,正在重塑整个软件行业的面貌。
核心要点
相关推荐

机器学习研究入门:必读论文清单与研究实习申请路径
为ML初学者整理从零到研究实习的完整路径,包括必读经典论文清单(AlexNet、ResNet、Transformer等)、论文阅读方法、复现技巧及研究实习申请的实用建议。

Claude Code 入门实战教程:安装配置到自动化开发完整指南
详解Claude Code从环境搭建、权限配置、Go目标自主循环、Skills技能系统、MCP协议集成到版本控制的完整开发流程,帮助开发者快速掌握AI编程自动化工具。

Gemini 3.7 Flash发布与GPT-5.6极速模式:AI开源迈向生态时代
谷歌发布Gemini 3.7 Flash专注编程与Agent优化,OpenAI推出GPT-5.6 Ultra-Fast模式实现14倍速度提升。AI开源从开放模型转向开放生态,Agent工具链与成本监控工具密集涌现,智能体工作流进入实用化阶段。