Claude新模型泄露、AI自主设计蛋白质,本周AI大事盘点

本周AI领域再度迎来密集更新。从疑似泄露的Anthropic下一代模型,到OpenAI暂停前沿强化学习训练,再到Claude自主设计蛋白质结合剂的突破性实验,多条重磅消息接连出现。本文对这些进展逐一梳理,并分析其背后的行业信号。
注:原始素材中部分产品名称(如"Fable""Astra""Cloud"等)疑似为语音转录导致的误译,结合上下文,本文推测其实际指向Anthropic的Claude系列模型与OpenAI的下一代模型,特此说明。
Claude下一代模型疑似进入灰度测试
据爆料,Anthropic下一代模型(推测为Claude的小版本升级)目前正处于内部红队测试阶段,这意味着距离正式发布可能已经很近。有迹象显示,部分选择当前旗舰模型的Claude网页应用账户,在后台被悄悄切换到了不同的模型,而这种测试很可能也已扩展到Claude Code。

有意思的是,Anthropic此前多次采用这种"灰度推出"策略——在广泛发布前先对小范围用户放量测试。上一代旗舰在正式发布当天,也经历了极其类似的灰度阶段。因此,尽管官方尚未确认,但从测试信号强度来看,新模型的发布可能就在近期。
更耐人寻味的是技术层面的证据:来自Claude服务端"思考协议缓冲区"的一个字段,似乎暴露了生成响应的实际内部模型代号,即便模型选择器和API仍然显示为当前版本。这类代号可能是部署修订版,也可能就是新一代模型本身。当然,在官方正式确认之前,这些仍属推测。
OpenAI暂停前沿RL训练:安全信号值得关注
本周另一则引发广泛猜测的消息来自OpenAI:该公司透露已暂时暂停基于最新部署模型的强化学习训练两周,其规模最大的前沿RL运行也处于暂停状态。

暂停的原因相当严肃——OpenAI认为其即将推出的模型可能已经触及关键的网络安全能力阈值。官方声明意味着,这些模型已强大到需要在进一步推进前,建立更完善的安全监控与保障机制。具体措施包括:隔离高风险工作负载、加强研究环境、扩大对齐训练,以及对前沿模型引入更积极的监控。据称,新的监控要求适用于具备较强能力或工具使用能力的模型,而下一代旗舰将受到更严格对待。
消息一出,外界普遍猜测新旗舰是否会因此延期。但Sam Altman随后在X上澄清:新旗舰是一个非常出色的模型,此次暂停的影响只针对更远期的发布。这个区分至关重要——它表明近期即将发布的模型并未被推迟,反而可能暗示其能力已足够强大。
Claude自主设计蛋白质结合剂:AI药物发现的里程碑
本周最具震撼力的消息,来自Anthropic在科学领域的一次实验。研究人员给Claude下达了一个任务:从零开始设计一种新型蛋白质结合剂——这是开发能附着并影响体内特定靶点药物的关键早期步骤。

结果令人惊讶:在15个生物靶点中,Claude成功为其中14个自主设计出了结合剂。这些结合剂随后由Adaptive Biotechnologies和Twist Bioscience两家外部生物技术公司实际构建并测试。整个过程中,模型自己构建工具,几乎唯一的人类干预就是不断告诉它"继续"。
更有意思的是,长达约1.6万字的提示中,很大一部分并非生物学专属内容,而是聚焦于长时程(long-horizon)代理行为——即如何让模型在扩展任务中长时间自主操作。这说明推动突破的,是通用代理能力而非专门的领域训练。
需要强调的是,这并不意味着AI已经能治愈癌症。但它确实标志着一个重要信号:通用AI模型开始在狭窄却极其重要的科学领域,展示出真正强大的能力,且无需专门的模型微调。这才是真正开创性的部分。
Claude Code与Claude应用的实用升级
除了重磅研究,Anthropic也为Claude Code带来一系列实用改进:
- 使用限制提升50%:每周使用限制大幅提升,延长至8月底,并有望永久化
- 启动速度翻倍:桌面版启动速度较一个月前快约两倍
- GPU占用优化:CLI在P99场景下的GPU占用也减少约两倍
最亮眼的更新是处于研究预览阶段的"设计技能"——用户可在Claude Code中使用Design命令生成可编辑的UI草稿,选定设计并微调后,让Claude直接将其实现到应用中。
此外,Claude网页应用获得了对Gmail和Google Drive的更深访问权限。现在Claude可以直接在对话中起草、发送邮件,并管理Google Drive中的文件,同时保留用户对关键操作的批准权。该功能正向所有付费计划推出,标志着Claude从聊天机器人向真正的AI助手迈进了一大步。
Gemini大更新:迈向桌面代理
谷歌方面也在密集准备Gemini的多项升级。

据报道,Gemini Live将获得新的"引导视觉"模式,通过摄像头实时视觉引导用户操作应用;Gemini应用预计将新增类似Notebook的"项目"功能,方便用户对文件、指令和对话进行分组管理;其代理组件也可能获得独立的记忆系统。
更值得关注的是,谷歌的"计算机使用"功能被发现正在Gemini桌面应用中测试——这意味着Gemini将能够控制其他应用程序,并访问用户明确授权的文件夹。据称谷歌还在添加高级备份选项,可在Gemini修改文件前自动备份至Google Drive。这正是AI代理开始在个人电脑上采取实际行动所需要的安全保障,标志着Gemini从"回答问题"向"桌面代理"的转变。
其他值得关注的AI进展
无审查本地模型
Qwen 3系列衍生出针对Apple Silicon优化的本地MLX构建(拒绝移除版本),提供2/4/6/8位量化选项,无需依赖云端。这类模型在部分场景下降低了使用门槛,但用户务必阅读免责声明并注意合规风险。
开源多代理工作空间
Hermes重新引入了机器人模式,可视为Grok开源替代方案。用户能创建多个带有独立角色、模型、记忆和工具的命名机器人,且这些机器人之间可相互通信、协调任务——例如一个负责研究、一个负责编码、一个负责规划,在同一环境中协同工作。
推理芯片新突破
Cerebras推出的CS4号称是目前最快的AI推理硬件,据称最终可运行高达10万亿参数模型,速度约每秒1000个token。如果能在该规模真正交付,前沿级大模型将以近乎瞬时的速度生成响应,这将从根本上改变编码代理和长时程工作流的运作方式。
结语
综合本周动态可以看出几条清晰的主线:模型能力仍在快速逼近前沿,以至于安全对齐成为大厂不得不主动踩下的刹车;AI代理正从对话走向真实操作,无论是Claude接管邮件、Gemini操作桌面,还是Claude自主设计药物分子,都指向同一个方向——AI正在从"回答问题"进化为"完成任务"。而这一趋势背后,能否守住安全底线,将成为下一阶段行业竞争的核心议题。
相关推荐

LangGraph的边界:Agent何时变成分布式应用?
深入探讨LangGraph等Agent编排框架的能力边界,分析AI Agent系统从原型走向生产环境时,编排逻辑与分布式应用架构之间的临界点,提供实用的分层架构判断思路。

智谱GLM-5.3-Flash开源320B模型,通义Qwen4架构预览版同日发布
智谱开源GLM-5.3-Flash原生多模态模型(320B总参数/18B激活),通义千问发布Qwen3.8-Flash-Next作为Qwen4架构预览。两款国产大模型均采用稀疏MoE架构,以极低激活参数实现顶尖性能,重新定义大模型效率标准。

Instagram新规:AI账号不标注身份将被限流
Instagram推出AI账号强制披露新规,拒绝标注AI身份的账号将被系统限流。本文深入解析限流机制、执行难点及对创作者和社交媒体行业的深远影响。