Kimi K3.1泄露、Claude Sonnet 5.5发布:智能体安全成焦点

AI智能体控制权之争:佛州要法院设闸,英伟达把安全焊进芯片,Manners反向给智能体发钱包
本文梳理了同一天内AI领域几条围绕"智能体控制权"这一核心议题展开的动态。月之暗面下一代模型Kimi K3.1被开发者从后台提前发现并调通,支持百万Token和多智能体协作;Anthropic发布Claude Sonnet 5.5,终端编程基准大幅领先上一代,但第三方测试揭示高推理强度下成本反而更贵;佛罗里达州总检察长提交49页动议,请求法院在独立安全审批到位前禁止OpenAI开发新模型;英伟达推出"开放智能体安全平台",通过内核级隔离软件OpenShell和芯片级硬件Sentry将安全控制置于智能体不可触及之处;与此同时,Manners反其道而行,给每个智能体配备邮箱、电话和钱包;AMD则以约82亿美元收购李飞飞创办的World Labs,布局空间智能与物理AI。文章最终将这些事件归结为同一个转变:业界开始不再相信智能体能自我约束,争议的焦点变成了"闸门该放在哪里"。
今天的AI圈围绕一个共同主题展开:当智能体的能力越来越强,那道控制它的"闸门"究竟该放在哪里?佛罗里达想把它交给法官,英伟达要把它焊进芯片,而另一家公司则反其道而行,直接给智能体发了电话、邮箱和钱包。以下是几条值得关注的动态。
Kimi K3.1 后台泄露,已可调用
月之暗面尚未发布的下一代模型 Kimi K3.1,被开发者提前从后台"翻"了出来。有开发者在月之暗面接口平台的模型注册表里发现了一个新标识 K3.1,尝试调用后发现竟然能调通。当天晚些时候,官方开发者平台上也出现了预览条目。
目前能看到的信息包括:上下文最长 100 万 Token;推理强度分为低、高、最高三档;可能新增一个智能体模式;还有一个名为 Swarm 的多智能体协作模式,以及搜索和批处理能力。开发者平台标注的价格与现有 K3 代相同,但这很可能只是占位数字。有开发者推测,三档推理强度背后对应的是不同算力分配与价格档位。
需要说明的是,月之暗面并未官方宣布,也没有给出发布日期,这些信息都是从后台和预览页扒出来的。但有一点确定——模型已经挂在接口上且能调通。按过去几次经验,走到这一步,离正式发布通常不远。作为背景,K3 代于 7 月发布,2.8 万亿参数是目前最大的开放权重模型,本月刚上线亚马逊云平台。如果 K3.1 本周发布,将正好撞上 OpenAI 的开发者大会。
Claude Sonnet 5.5:编程基准亮眼,但成本存疑
Anthropic 发布了 5.5 家族的第二个成员 Cloud Sonnet 5.5,距离前一个成员仅隔 6 天。价格维持不变,每百万输入 2 美元、输出 10 美元,是 Opus 5.5 的一半;上下文 100 万,且长上下文不加价。

厂商给出的成绩中,最抢眼的是终端编程基准达到 70.6%,而上一代 Sonnet 5 代仅为 10.3%,更贵的 Opus 5.5 是 66.4%。平均下来,它约能拿到 Opus 5.5 的 98% 分数,8 项里有 7 项仍是 Opus 更高,但差距只有 0.7 到 3.2 分。厂商还称其输出速度提升三成以上,单任务成本最多可降三成。
这里有一处值得念出来的矛盾:第三方机构 Artificial Analysis 在自己的测试套件上测到的结果是反的——在最高推理强度下,Sonnet 5.5 每个任务的成本达到 7.6 美元,比上一代还贵了约一半。两个说法并不矛盾,因为仅推理强度一项就能让账单相差 20 倍。这恰好说明,"便宜多少"这件事很看你怎么用。
开发者还需注意几处会导致现有代码报错的改动:思考模式不能再关掉;强制工具调用会直接报错;温度等采样参数只要不是默认值也会报错。安全方面,这是第一个带网络安全防护的 Sonnet,防护分三层,第一层直接查看模型内部的激活。需要提醒的是,上述所有成绩目前仍是厂商自己的口径。
文中提到的"终端编程基准"指的是 SWE-bench Verified,这是目前评估AI编程能力最被广泛引用的基准测试之一。它从真实的GitHub开源项目中抽取已解决的Bug报告,要求模型在不提供答案的情况下,通过读取代码仓库、定位问题并提交补丁来修复Bug,最后以能通过原有测试用例的比例计分。SWE-bench之所以被视为"含金量较高"的基准,在于它考察的是端到端的工程能力,而非孤立的代码补全。不过该基准同样存在饱和风险——随着越来越多厂商针对性优化,其区分度正在下降,这也是解读单一基准分数时需要保持谨慎的原因。
佛州要求法院叫停 OpenAI 新模型
佛罗里达州总检察长向州法院递交了一份 49 页的动议,请求法官发临时禁令:在有独立第三方的安全防护和审批之前,禁止 OpenAI 开发新的 AI 模型。这并非新官司,而是 6 月那场诉讼里的新动作——OpenAI 曾把案子转到联邦法院,本月法官又同意将其发回州法院。

动议还要求禁止 OpenAI 宣传自家产品"安全、准确、可靠",禁止给聊天机器人赋予人的特征,禁止故意拉长用户对话时长,并在佛州完全禁止未成年人使用 ChatGPT。总检察长在一段视频里放话:如果奥特曼说要放慢是认真的,他可以加入我们,一起向法院提出这个请求。
OpenAI 回应称,已于上周五宣布暂停最强模型的训练,只有在确信有额外保障后才会恢复,并表示愿意与佛州及其他州一起推动适用于整个行业的政策。需要说清楚的是,这目前只是一份动议,尚未裁定。
英伟达把安全焊进芯片
英伟达发布了名为"开放智能体安全平台"的产品,由软件和硬件两部分组成。起因说得很直接:最近好几起事件里,智能体都绕过了应用层的安全措施去完成任务。英伟达的判断是——一个智能体,不能指望它完全管住自己。

软件那半叫 OpenShell,开源。每个智能体跑在内核级隔离的环境中,旁边配一个监管进程,所有对外请求都必须先经过它,除此之外智能体没有任何其他联网路径。即使智能体运行自己写的代码,这些控制依然存在。硬件那半更狠,叫 Sentry,跑在英伟达的数据处理芯片上,在芯片里直接盯着智能体的活动、执行安全策略。它运行在一个独立信任域中,智能体和攻击者都看不见它。
目前该方案只能用在英伟达自家服务器上,但英伟达称已有一百多家机构在用,包括 Anthropic、微软、摩根大通。马斯克那家 AI 公司的总裁点出了核心:安全应该在模型之外,用智能体绕不过去的控制来执行。当天英伟达股价上涨两个多点,同时宣布再加 1500 亿美元回购。
英伟达所使用的"数据处理芯片"(DPU,Data Processing Unit)是近年来数据中心架构中兴起的第三类核心芯片,与CPU、GPU并列。DPU专门负责网络、存储、安全等基础设施任务的卸载与加速,运行在独立的处理域中,对宿主机上的应用程序不可见。Sentry正是利用了这一隔离特性:即使AI智能体获得了系统级权限,也无法感知或篡改运行在DPU上的安全监控逻辑。这种"带外监控"(out-of-band monitoring)的思路并非英伟达首创——安全领域长期用类似方式保护硬件可信执行环境(TEE),英伟达的创新在于将这套机制专门适配到AI智能体的行为审计场景。
Manners 给智能体发"钱包",AMD 收购 World Labs
与前面几条"关门"的思路相反,Manners 今天发布了 2.0,并推出个人智能体应用 Q。其最特别之处是给每个智能体配了一整套自己的东西:独立邮箱、电话号码、钱包,还有一台电脑。智能体可以自己发消息,在你设好的预算内自己付钱,在自己的机器上把一件事从头办到尾,还能替你接电话并留下通话摘要。多个智能体可拉进同一群组分工接力,也能接入日常服务如点餐排队取号。目前是抢先体验,需要邀请码。Manners 还提到正在组建团队开发面向国内市场的产品,与国产模型厂商的合作也在推进。

最后是一笔收购。AMD 宣布以全股票交易、约 82 亿美元收购李飞飞创办的 World Labs,这是 AMD 历史上第二大收购,仅次于当年 500 亿美元买赛灵思。交易预计年底前完成,仍需监管审批。完成后,李飞飞将以执行副总裁兼首席科学家身份加入 AMD,直接向苏姿丰汇报。World Labs 做的是空间智能——从文字、图片和视频里生成、重建和模拟可交互的三维环境,也做机器人学习与仿真。AMD 的逻辑是要造下一代 AI 算力平台,得先深刻理解模型往哪儿变,同时补上物理 AI 这块短板。市场不太买账,消息出来后 AMD 股价跌约 4%。
World Labs 所专注的"空间智能"(Spatial Intelligence)是李飞飞在斯坦福期间提出并持续推进的研究方向,核心命题是:真正通用的智能需要理解并推理三维物理世界,而不仅仅是处理文本和二维图像。从技术路径看,空间智能涵盖从单张图片或视频重建可交互三维场景(Novel View Synthesis)、物理仿真,到为机器人提供感知与操作的基础模型。这一方向与当前大模型以语言为中心的范式形成互补,也是"物理AI"(Physical AI)赛道的核心支撑技术。AMD收购World Labs的战略意图,除补齐技术短板外,还有一层:在英伟达主导AI训练算力的格局下,通过掌握下游应用层(尤其是机器人与具身智能)的核心模型技术,为自身芯片创造差异化的需求锚点。
同一个转变:闸门放在哪里?
把今天几件事放在一起看,说的其实是同一个转变:业界开始不再相信智能体能自己管住自己。区别只在于,你打算把那道闸放在哪——放在它能碰到的地方,还是它够不着的地方?佛罗里达想交给法官,英伟达焊进芯片放在智能体看不见的地方,Manners 则把一把能花钱的钥匙直接交到智能体手上,只在外面画了一个预算的圈。这场关于"控制权"的分歧,才刚刚开始。
相关推荐

人类造过最快的东西:帕克太阳探测器的43万英里时速
人类建造过最快的物体不是旅行者号或火箭,而是NASA帕克太阳探测器,时速约43万英里。本文解析它如何借助金星引力辅助与太阳引力井加速,以及为何以光速衡量人类仍刚刚起步。

美光CEO警告:内存供应将在未来两年持续趋紧
美光CEO表示存储芯片供应将在未来两年比当前更为紧张,AI需求激增与产能扩张滞后是主因。本文分析内存供应趋紧的原因及其对市场和消费者的影响。

用WhatsApp对话你的AI Agent:开源工具agent-bridge实测解读
开发者开源了AI Agent工具agent-bridge,可通过WhatsApp自我聊天直接与Agent框架对话。本文解读其TypeScript实现、npm包使用方式及这类IM交互工具的优势与风险。