Anthropic防蒸馏攻击新策略:限制思维块编辑,Fable 5.1降价75%

Anthropic通过限制思维块编辑防范模型蒸馏攻击,同日多项AI硬件、模型与产业动态集中释放。
9月2日,Anthropic发布Fable 5.1与Mythos 5.1两款同源分级模型,在降低API调用成本的同时,通过限制多轮对话中思维块的编辑权限来防范蒸馏攻击,将"防复刻"纳入常规安全工程。与此同时,Claude Fable 5.1超27万字符的系统提示词疑似泄露,暴露出提示词工程作为安全边界的固有脆弱性。在其他进展方面,讯飞开源了面向端侧agent的Spark X 2.5小模型,李飞飞World Labs发布全模态世界模型Atlas;苹果与OpenAI的商业机密诉讼持续升级,涉及前员工借助AI agent转移技术资料的新细节;英伟达将边缘AI开发套件价格压至249美元,而台积电拟上调代工价格10%至15%,为行业成本走势带来不确定性。
Anthropic的安全新招:限制思维块编辑防范蒸馏攻击
9月2日,Anthropic成为AI圈的绝对主角,一系列动作既有产品升级也有安全策略调整。首先是新模型的发布——Fable 5.1与Mythos 5.1同步登场。两者共享同一套基础模型权重,唯一的区别在于安全策略与开放范围的不同。这种"同源分级"的做法,本质上是让企业在能力与合规之间获得更灵活的选择空间。
新模型在编程、长程agent以及科研能力上均有明显强化。对于开发者而言最直接的利好是成本下降:Fable 5.1的缓存读取价格降低了75%,典型任务的整体成本约降25%。在大模型API调用成本持续压缩的当下,这一降幅足以影响不少中小团队的选型决策。
真正值得玩味的是安全层面的调整。Anthropic更新了Messages API,限制在多轮对话中编辑"思维块"之前的Claude上下文。官方给出的理由是——提升蒸馏攻击(distillation attack)的难度。所谓蒸馏攻击,是指攻击者通过精心构造的多轮交互,逐步套取模型的内部推理过程,从而"复刻"出一个能力相近的小模型。通过锁定历史上下文中的思维块,Anthropic实际上是在切断这类逆向工程的关键路径。

该新规目前仅针对使用Fable 5.1的新账号生效,后续将逐步推广至全体用户。这透露出一个趋势:随着模型能力愈发接近核心资产,头部厂商正把"防止被蒸馏"作为一项常规安全工程来对待。
27万字符的Claude系统提示词泄露
话说回来,Claude Fable 5.1的系统提示词疑似遭到泄露,长度超过27万字符——这是一个相当惊人的规模。泄露内容显示,其知识截止日期已更新至2026年6月底,并证实与Mythos 5.1共享权重,同时调整了安全与工具调用相关的规则。
如此庞大的系统提示词,一方面说明现代大模型的行为约束已经复杂到需要海量规则来维系,另一方面也暴露出"提示词工程"作为安全边界的脆弱性。当核心行为逻辑可以被完整还原时,厂商在API层面加固防护(如限制思维块编辑)的必要性也就摆在眼前的事实了。
端侧模型与世界模型的双线进展
在大厂动作之外,几支团队在细分方向上也有亮眼进展。
讯飞开源Spark X 2.5端侧小模型
讯飞开源了Spark X 2.5的4B与1.7B两个小模型,明确面向端侧agent场景。模型采用混合注意力架构,原生支持最高100万token的上下文长度,并针对代码、数学及指令遵循能力做了优化。对于希望在设备本地运行智能体的开发者而言,小参数量加超长上下文的组合颇具吸引力。讯飞同期还启动了"边缘agent挑战赛",报名截止至9月6日。

李飞飞World Labs发布世界模型Atlas
另一条线上,李飞飞创立的World Labs发布了全模态世界模型Atlas,将在数周内开放早期访问。Atlas支持像素及相机控制、单图重建大场景、原生3D输出,还能为机器人生成传感器及仿真数据。这类世界模型的价值不止于内容生成,更在于为具身智能提供廉价、可扩展的仿真训练环境——这可能是机器人规模化落地绕不开的一环。
苹果与OpenAI的商业机密诉讼升级
本期还牵出一桩重量级诉讼。苹果指控OpenAI在商业机密诉讼中销毁证据,并已申请加速取证程序。
据苹果方面陈述,前员工Chang Liu的MacBook记录显示了相关的证据销毁讨论,苹果还指控其离职后下载了机密电路图,并借助AI agent将这些资料带入OpenAI的工作流程。案件的核心焦点在于——OpenAI是否通过挖走三名前员工来获取苹果的技术机密。

这起诉讼折射出AI人才争夺战背后的暗流。当顶尖工程师在巨头之间频繁流动时,技术机密的边界变得异常模糊。而"借助AI agent带入工作流"这一细节尤其值得关注:它意味着AI工具本身可能成为知识产权流转的新载体,这对企业的信息安全防护提出了全新命题。
硬件与产业:算力平价与成本传导
英伟达Jetson Orin Nano Super降至249美元
硬件方面,英伟达推出了掌上AI超算Jetson Orin Nano Super开发者套件,价格降至249美元。该套件的生成式AI推理性能最高提升1.7倍,INT8算力达到67 TOPS,适用于RAG、聊天机器人、视觉智能体及机器人开发等场景,且旧款用户可免费升级。将可用的边缘AI算力压到250美元以内,无疑会进一步降低本地智能体开发的门槛。

AI产业投资持续高热
产业投资层面,多组数据反映出行业的高热度。智谱上半年收入9.54亿元,同比增长约400%,其MaaS API年化营收在半年内从2.5亿美元飙升至20亿美元并实现盈利,云部署收入已超过本地化部署。日本经济产业省则申请了创纪录的490亿美元预算,拟加速布局人工智能、半导体和机器人产业,强化关键技术竞争力与供应链韧性。
台积电涨价:上游成本压力显现
不过,成本端也传来压力信号。受AI芯片需求持续强劲影响,台积电拟将全制程代工价格上调10%至15%,三星的4nm、5nm报价预计同步上涨,市场预期先进制程或在2027年底前跟进调价。这部分成本压力最终或将向终端产品传导——算力越便宜的表象之下,是上游制造端持续收紧的现实。
相关推荐

Arm Mali G2-Ultra NX深度解析:AI原生图形如何实现移动桌面级GPU性能
深度解析Arm Mali G2-Ultra NX GPU的AI原生图形架构,探讨其如何将桌面级游戏性能带入移动平台,涵盖神经渲染、超分辨率重建等关键技术及对移动游戏生态的深远影响。

RAG做不好GTM智能体的原因:从信息检索到专家推理的跃迁
单靠RAG检索增强生成无法构建高效的GTM智能体。本文深入分析GTM知识的特殊性——模式识别而非事实检索,并探讨如何将操作者经验知识转化为可推理的智能体能力,实现从信息检索到专家推理的跃迁。

48小时150美元造SaaS:为智能体而非人构建的新范式
一位SaaS创作者用Grok 4.6在48小时内、150美元Token成本从零构建完整SaaS产品。深度解析其技术选型、产品决策与核心方法论——为什么未来的SaaS应该为AI智能体而非人类用户构建。