谷歌DeepMind疑达成RSI递归自我改进,AI行业迎变局

谷歌疑似达成AI递归自我改进,Kimi K2.8提升推理效率,OpenAI快速修复Astra配置故障。
AI行业近期多条重磅传闻与事件密集涌现。谷歌DeepMind被曝或已实现递归自我改进(RSI),内部或存在让AI自主训练下一代AI的闭环系统,若属实将对Gemini 4的能力跃升产生深远影响。Moonshot AI意外发布Kimi K2.8预览版,性能对标K3但着力解决过度推理问题,支持百万token上下文与多档推理模式。OpenAI的GPT-6 Astra则经历"降智"风波,调查显示根源在于遗留技能配置冲突与推理引擎错误,真实受影响用户约5000人,OpenAI在36小时内完成修复并向全体付费用户补偿一周额度。此外,Anthropic CEO呼吁放缓前沿AI开发并提出三方评估计划,GPT Live 1也正式向开发者开放API。整体来看,前沿模型竞赛正同时在能力、效率与治理三个维度加速演进。
AI领域近期动态密集,几条重磅传闻正把行业推向新的转折点。谷歌被曝可能已实现递归自我改进(RSI),Moonshot AI悄然放出Kimi K2.8预览版,而OpenAI的GPT-6 Astra则经历了一场"降智"风波。这些消息背后,透露出前沿模型竞赛正在进入一个更微妙、也更值得关注的阶段。
需要说明的是,本文所依据的多为泄露信息与社区分析,尚未获得官方确认,读者应保持理性判断。
谷歌DeepMind疑似达成RSI,可能是最大的技术拐点
据可靠爆料者透露,谷歌DeepMind可能已经正式实现了RSI(Recursive Self-Improvement,递归自我改进)——即AI智能体能够自主提升自身能力。爆料指向一个被称为"RSI Model"的检查点(checkpoint),据称是在Google Vertex平台内部被发现的。

这条传闻之所以引发关注,与谷歌高层的公开动向高度吻合。报道称Demis Hassabis正将主要精力投向AGI,而Sergey Brin则被描述为对RSI和AGI都"极度投入",并大力调配资源推动RSI研究。谷歌此前也公开谈到过使用"智能体循环"(agentic loops)来递归评估和优化模型,DeepMind更将RSI描述为整体投资论中的重要一环。
爆料者提出了一个很有说服力的观察角度:谷歌近期Flash系列模型的迭代速度异常之快,Gemini 3.7和3.8几乎在一个月内相继发布。若没有某种内部机制的加持,很难解释这种迭代节奏。据称在内部待办列表中还出现了名为"RSI model"以及"live RL"的配置项,与此前关于RSI的说法相互印证。
核心理论是:谷歌可能拥有一套内部系统,让AI去评估、训练并改进下一代AI——也就是"训练那个训练者"。如果这一反馈循环在内部被显著推进,那么外界翘首以待的Gemini 4,可能会带来远超预期的能力跃升。当然,这一切目前都未获证实,但如果属实,这或许将成为谷歌AI的一次重大回归。
**递归自我改进(RSI)**是AI安全与能力研究领域长期关注的核心概念,指AI系统能够自主修改或优化自身的算法、架构或训练流程,从而在无需人类直接干预的情况下持续提升性能。其核心挑战在于"反馈闭环"的稳定性——每一轮自我改进的输出会成为下一轮的输入,理论上可产生指数级加速效应。这正是早期AI安全研究者(如Nick Bostrom)将RSI视为"智能爆炸"潜在触发点的原因。
现实中,RSI并非非此即彼的二元状态,而是一个程度连续体。目前业界已知的"弱RSI"形式包括:用AI生成合成训练数据、用模型评估自身输出质量(即RLHF中的奖励模型)、以及用AI辅助代码生成来加速模型开发本身。谷歌此前公开的"智能体循环"(agentic loops)就属于这类渐进式RSI实践。若爆料中的"RSI Model"代表的是更强形式——AI能够自主设计并执行完整的训练实验——则意味着人类工程师在改进循环中的参与度被系统性降低,这在能力和安全两个维度上都具有里程碑意义。
Kimi K2.8意外发布:性能持平K3,思考效率大幅提升
Moonshot AI的Kimi K2.8预览版突然出现在Kimi Code中,正逐步向订阅用户推送。这次发布颇为意外,因为外界普遍没有预期到会在此时看到新模型。
根据文档描述,Kimi K2.8的性能水平与K3相当,但带来了"更高效的思考"。它支持高达100万token的上下文窗口,可接受图像和视频输入,并提供低、高、max三档推理模式。
效率提升可能才是这次升级的真正亮点。Kimi K3虽然是当前最出色的开源模型之一,但它有个显著痛点:面对请求时思考时间过长,即便是简单任务也倾向于过度推理,这正是许多用户望而却步的原因。如果K2.8能在保持相近性能的同时大幅缩短推理时间,它的实用价值反而可能超过K3。
有意思的是命名逻辑——从K3"退回"到K2.8。用更小的版本号来发布更新的模型,这在业界确实少见,也反映出Moonshot在版本命名上的独特思路。
Kimi K2.8所强调的"更高效的思考",指向当前推理模型(Reasoning Model)领域的一个普遍痛点:过度推理(overthinking)。以DeepSeek-R1、Kimi K3为代表的强推理模型,在训练时鼓励模型生成长链式思维(Chain-of-Thought)来提升复杂任务准确率,但这也导致模型对简单问题同样花费大量token进行"思考",既拖慢响应速度,又显著增加推理成本。
解决过度推理的技术路径通常包括:动态计算预算(根据问题难度自适应分配推理步数)、蒸馏压缩(将大型推理模型的能力迁移到参数更少的模型)、以及多档推理模式(如K2.8提供的低/高/max三档)。多档模式让用户和开发者可以在速度与精度之间手动权衡,尤其适合在生产环境中为不同任务类型差异化配置资源。K2.8若能在效率与性能间取得更优平衡,将直接提升其在API调用场景下的商业竞争力。
GPT-6 Astra"降智"风波:真相是配置问题而非刻意削弱
过去几天,大量报告声称GPT-6 Astra自发布以来质量下降。从社区放出的对比演示看,质疑并非空穴来风。

用户用完全相同的提示词和推理设置,对比了Astra发布日与当前的表现:发布版明显更具照片级真实感、更锐利,在生成复杂3D场景上更强;而部分新近生成的结果则显得更平淡、更"合成感"、整体逊色。社区随即断言Astra被"阉割",并质疑为何前沿模型实验室总在初期热度过后削弱模型。
但OpenAI的调查给出了不同答案。他们在核查X平台上的用户反馈后,发现了几个真实问题:一是为旧模型构建的遗留技能(legacy skills)触发过于频繁,有时会阻止Astra正确检查自己的输出;二是一项可选的上下文管理实验导致过早停止或对旧消息作出响应,估计影响约4000至5000名用户;最关键的是,配置错误的推理引擎(inference engines)导致部分Astra流量出现了质量下降。

这些问题现已修复或禁用,并附带了一些让Astra更稳定、更善于自查的小改进。换句话说,"降智"传闻部分属实,但对大多数用户而言并非事实。真正受影响的仅约5000人。
值得肯定的是OpenAI的响应速度——在约24至36小时内识别并推送了修复。更进一步,他们为所有OpenAI付费用户重置了整整一周的使用额度,即便多数人并未受到影响。
此外,GPT Live 1已正式通过API开放,将ChatGPT更自然的语音对话能力带给开发者。核心特性是语音智能体能够"边说边听",类似Gemini Live的体验,让对话更自然,而非一方说完另一方才能接话。开发者还能将GPT Live 1与自选的模型和智能体框架搭配,为构建实时语音助手、客服智能体等应用打开了更大空间。
这次事件折射出大型语言模型在生产部署阶段面临的系统性复杂度挑战。现代前沿模型上线后并非以单一固定版本运行,而是同时维护多个配置层:针对不同用户群体的A/B实验、兼容旧版功能的遗留技能层、动态分配流量的推理引擎集群,以及用于控制上下文长度和记忆的实验性功能。这些层级之间的交互往往难以在发布前完全预测。
"遗留技能(legacy skills)触发过于频繁"这一问题尤具代表性:当新模型上线时,为老版本设计的行为模块若未被及时停用,可能与新模型的输出逻辑产生干扰,导致用户观察到的表现与模型本身能力不符。这类"配置漂移"问题在微服务架构的大规模部署中并不罕见,但在AI模型中因输出的主观性而更难被自动化监控捕捉,通常需要依赖用户反馈才能发现。OpenAI此次在36小时内完成定位与修复,并主动补偿未受影响的用户,在行业响应规范上树立了一定参照。
Anthropic呼吁放慢前沿开发,引发争议
Anthropic CEO Dario Amodei发表了一篇新文章,呼吁AI行业放慢前沿开发步伐。他提出了一个三部分计划,Anthropic已承诺向第三方评估者提供员工级别的系统访问权限。

这一表态引发了讨论。有观点认为,在公司即将IPO之际主动挑起"AI应当放缓"的辩论,某种程度上是在给自己"设限"。不过从安全治理角度看,向第三方评估者开放访问权限、推动外部监督,也是行业逐渐走向成熟的信号之一。这场争论本身,恰恰反映了前沿AI发展速度与安全治理之间日益凸显的张力。
结语:竞赛格局正在悄然重塑
从谷歌疑似达成RSI,到Kimi以更高效率对标K3,再到OpenAI快速修复Astra并主动补偿用户,这一轮动态勾勒出的是一个越来越"内卷"却也越来越注重响应速度的市场。如果谷歌的RSI传闻属实,那么它可能不只是在训练下一个前沿模型,而是在构建一套能持续加速模型进化的底层机制——这才是真正值得警惕、也值得期待的变量。
(提醒:本文多数信息来源于泄露与社区分析,尚未获官方证实。)
相关推荐

Automattic高管在Mullenweg短暂离任期间签署互惠离职协议
Automattic公司CFO Mark Davies与法务负责人Andy Missan在Matt Mullenweg短暂离任期间相互签署离职补偿协议,包含一年薪资与额外股权归属,引发公司治理透明度关注。

H3 Singularity优化技巧:加速40%还能提升画质
Reddit社区分享的Minimax Singularity工作流优化技巧:在H3 Latent前插入RTX上采样器,实现40%加速同时提升画质,附参数取舍与12bit输出实践经验。

X上线Cashtags股票交易功能,社交与市场界限消融
X(原Twitter)宣布向美国用户开放通过Cashtags直接交易的功能,打通市场讨论与实际交易的通道。本文解析这一功能的运作逻辑、社交交易的机遇与风险,以及平台边界扩张背后的趋势。