谷歌DeepMind RSI泄露:AI训练AI时代或已到来

谷歌DeepMind疑现RSI内部实现,Kimi K2.8追求效率优先,Astra"降级"实为配置失误。
本文梳理了近期AI圈数条重磅动态。最受关注的是谷歌DeepMind疑似在内部实现递归式自我改进(RSI)——即让AI系统自动评估并训练下一代模型,但目前仅有单一来源泄露,尚未获官方证实。Moonshot AI低调发布Kimi K2.8 Code预览版,以小于K3的版本号带来对标K3性能、思考效率更高的模型,支持百万token上下文与多模态输入。OpenAI则就GPT-6 Astra"被削弱"的质疑给出解释,指出问题源于遗留技能文件触发过频、上下文管理实验及推理引擎配置错误,受影响用户约五千人,已在36小时内完成修复并为全体付费用户重置额度。此外,Anthropic CEO Dario呼吁行业放慢前沿开发,但其同时极度看好AI的立场引发矛盾质疑;OpenAI也通过API推出支持"边说边听"的GPT Live 1语音接口。
近期AI圈流传一则重磅传闻:谷歌DeepMind可能已在内部实现RSI(递归式自我改进,Recursive Self-Improvement),即让AI系统自主评估、训练并迭代下一代模型。话说回来,Moonshot AI悄然放出Kimi K2.8 Code预览版,OpenAI也针对GPT-6 Astra的"降级"质疑给出回应。本文对这几条消息逐一梳理,并厘清其中哪些是实锤、哪些仍是推测。
谷歌DeepMind的RSI传闻:训练"训练者"
最受关注的爆料指向谷歌可能已实现某种形式的递归自我改进。爆料的核心来自一位名为Lyra的信息源,据称在谷歌Vertex平台的内部记录中发现了一个名为"RSI Model"的检查点(checkpoint)配置。

RSI的概念并不复杂,却极具想象空间:AI智能体通过循环式的自动评估与再训练,持续提升自身能力,本质上是"用AI构建更智能的AI"。爆料者提出的一个佐证是节奏——Gemini 3.7与3.8据称在约一个月内相继发布,Flash类模型迭代速度异常之快,这与存在内部自动化训练循环的假设吻合。
从组织层面看,也有报道称Sergey Brin正大力向RSI研究倾斜资源,而Demis Hassabis则将全部注意力放在AGI上。谷歌内部一直将RSI视为整体投资方向的一部分。若这些信息属实,谷歌可能不只是在训练"下一个前沿模型",而是在训练能够训练模型的系统本身。
需要强调的是:这一切目前均未获官方确认,属于泄露与推测范畴。但假如内部反馈循环真的在运转,外界翘首以待的Gemini 4或许会带来超出预期的能力跃迁。这也可能成为谷歌在这一轮竞争中的翻身筹码。
RSI(递归式自我改进)的理论根源可追溯至AI安全研究先驱Eliezer Yudkowsky在2000年代初的论述。其核心逻辑是:一旦AI系统能够理解并改进自身的训练过程,改进速度便可能呈指数级加速,形成所谓"智能爆炸"。与传统的人工干预训练不同,RSI系统理论上可以全自动地生成训练数据、评估模型输出质量、调整超参数并启动下一轮训练,整个循环无需人类工程师介入。当前AI圈讨论的RSI更多是"弱RSI"形式——用AI辅助生成合成训练数据或自动优化提示词,而非完全自主的能力跃迁。谷歌此次泄露的"RSI Model"检查点若属实,很可能属于这一较温和的技术路径,但其潜在影响依然深远:自动化训练循环意味着研发成本大幅下降,同时模型迭代频率可以远超人力所能支撑的上限。
Kimi K2.8 Code:更小的版本号,更高的思考效率
Moonshot AI的Kimi K2.8预览版意外现身Kimi Code,这次发布几乎没有预告。根据文档说明,K2.8的性能水平与K3相当,但据称拥有明显更高效的思考能力,并支持100万token上下文窗口、图像与视频输入,以及低、高、最大三档推理模式。

Kimi K3作为当前最优秀的开源模型之一广受认可,但它有个突出短板:每次请求思考时间过长,对简单任务也频繁"过度思考",这直接影响了实际可用性。如果K2.8能在保持K3级别输出质量的同时大幅提升推理速度,它的实用价值将显著提升。
一个耐人寻味的细节是命名逻辑——从K3"回退"到K2.8。用更小的版本号发布更新的、思考更高效的模型,这在业界并不常见,或许是Moonshot AI想借此暗示这是一条侧重效率的分支路线,而非单纯的能力升级。目前订阅Kimi编程计划的用户已能在代码计划中看到该模型。
GPT-6 Astra"被削弱"?真相与误解
OpenAI这边则围绕GPT-6 Astra的一场争议。社区通过相同提示词和推理设置,对比了首发与近期的Astra生成结果,发现新版本在生成复杂3D场景时明显更平淡、更有"合成感",逼真度和清晰度下降。这立刻引发了"前沿实验室在热度过后偷偷削弱模型"的质疑。

OpenAI在调查X平台反馈后给出的解释是:模型本身并未降级,退化源于几个技术问题。一是为旧模型构建的遗留技能文件(legacy skills)触发过于频繁,有时阻碍了Astra对自身工作的检查;二是一项选择性加入的上下文管理实验导致响应过早停止或回应旧消息;最关键的是推理引擎配置错误,使部分Astra流量出现可测量的质量下降。
据报道,实际受影响的用户仅约五千人,并非全体。OpenAI在约24到36小时内推送了修复,禁用问题配置并进行微调,让Astra更稳定、更擅长自检。作为补偿,官方还为所有付费计划用户重置了额度,使其在整整一周内可继续使用Astra。这类"听劝"式的快速响应,从用户体验角度看确实值得肯定。
这一事件折射出AI产品发布后普遍存在的"模型退化"争议现象。由于大型语言模型和生成式AI系统的推理管线极为复杂,任何后端配置变更——包括负载均衡策略、缓存机制、A/B测试实验或基础设施迁移——都可能在用户侧产生可感知的质量波动,而用户往往会将其解读为"模型被悄悄削弱"。这类误解并非空穴来风:OpenAI此前曾因GPT-4在更新后被用户察觉到能力下滑而饱受质疑,并在2023年底承认进行了部分优化以降低推理成本。区分"模型权重本身被修改"与"基础设施配置导致的偶发性退化",对于评估实验室的诚信度至关重要。此次Astra事件中OpenAI的透明度处理——公开承认配置错误、说明受影响范围、快速回滚并补偿用户——相对于行业惯常做法而言已属积极。
其他动态:Dario的呼吁与GPT Live 1
Anthropic CEO Dario发文呼吁AI行业放慢前沿开发,并提出三部分计划,其中Anthropic承诺让第三方评估员持续监控安全与对齐。有意思的是,Dario本人同时极度看好AI——他相信AI能治愈多数重大疾病、推动经济增长,并在5到10年内创造一个富足世界。一边看多、一边呼吁踩刹车,这种立场本身显得有些矛盾,也引发了外界对其动机的讨论。
此外,OpenAI通过API推出了GPT Live 1,让开发者获得类似ChatGPT的自然语音对话能力。最大亮点是语音智能体现在能"边说边听",如同Gemini Live,无需一方始终等待,对话更自然。开发者还能将GPT Live 1与自选模型及智能体框架结合,这对构建语音助手和语音应用的团队是一次重要升级。
小结:泄露归泄露,验证仍需时间
这一波消息中,GPT-6 Astra的问题修复和Kimi K2.8的发布属于有据可查的动态,而谷歌DeepMind的RSI则仍停留在单一信息源的泄露层面,需要保持审慎。真正值得持续关注的信号是:如果AI真的开始有效地"训练AI",模型的迭代速度和能力曲线都可能被彻底改写。在Gemini 4正式亮相之前,这些传闻的真伪还有待时间检验。
相关推荐

Automattic高管在Mullenweg短暂离任期间签署互惠离职协议
Automattic公司CFO Mark Davies与法务负责人Andy Missan在Matt Mullenweg短暂离任期间相互签署离职补偿协议,包含一年薪资与额外股权归属,引发公司治理透明度关注。

H3 Singularity优化技巧:加速40%还能提升画质
Reddit社区分享的Minimax Singularity工作流优化技巧:在H3 Latent前插入RTX上采样器,实现40%加速同时提升画质,附参数取舍与12bit输出实践经验。

X上线Cashtags股票交易功能,社交与市场界限消融
X(原Twitter)宣布向美国用户开放通过Cashtags直接交易的功能,打通市场讨论与实际交易的通道。本文解析这一功能的运作逻辑、社交交易的机遇与风险,以及平台边界扩张背后的趋势。