GPT-5.6需政府审批:AI监管进入深水区

GPT-5.6发布,却成了"审批制"模型
OpenAI在6月27日发布了新一代最强模型GPT-5.6,但一个耐人寻味的细节让这次发布蒙上了不同以往的色彩:普通用户暂时无法使用它。
在政府要求下,GPT-5.6只对一小批经过审批的合作伙伴开放有限预览访问权限,而且还需要政府逐个客户批准。这意味着模型能力的强弱,第一次不再单纯由算力和参数决定,而是由监管机构的准入名单决定。
有意思的是,OpenAI自己也对这种安排表达了保留态度,明确表示"这种政府准入流程不该变成长期默认"。这句话背后,是前沿AI能力与国家安全审查之间日益尖锐的张力——当模型强大到一定程度,它的发布不再是纯粹的商业行为,而是要接受政府的逐案审核。
值得注意的是,这种"准入制"并非凭空出现。近年来美国政府对前沿AI的监管框架逐步成型,从拜登政府2023年签署的AI行政令,到成立于美国国家标准与技术研究院(NIST)下的AI安全研究所(AISI),监管机构越来越倾向于在最强模型发布前进行安全评估。GPT-5.6的逐案审批,可以看作这一趋势从'评估'走向'准入控制'的标志性升级。

为什么AI监管突然收紧了?
这一政策转向,很可能与另一条更劲爆的新闻直接相关。
Claude Mythos被下架背后:涉密系统告急
Anthropic的Claude Mythos模型已经被下架整整两周,至今没有解决,局面反而越来越僵。而这次,起因终于传了出来。
据《经济学人》报道,有参议员透露,NSA(美国国家安全局)负责人告诉他,在红队测试中,Mythos模型几个小时就攻破了几乎所有NSA的涉密系统。
这里有必要解释一下"红队测试"到底意味着什么。红队测试(Red Teaming)源自军事和网络安全领域,指由专门团队模拟攻击者视角,主动寻找系统漏洞的对抗性评估方法。在AI领域,红队测试被用来探测模型的能力边界与潜在危害,比如能否被诱导生成恶意代码、绕过安全护栏或协助网络攻击。需要注意的是,红队测试通常在受控环境中进行,测试者往往被预先告知系统架构、已知漏洞或给予特权访问,因此测试结果代表的是"理论上限"而非真实世界的攻击表现。OpenAI、Anthropic等公司均将红队测试纳入模型发布前的安全评估流程,美国政府也通过AI安全研究所(AISI)等机构参与前沿模型的评估。
正因如此,写下这句话的编辑随后进行了澄清,强调这话不能照字面理解,需要看具体的测试条件——红队测试往往在受控、给定漏洞信息的环境下进行,结果并不等同于真实世界中的攻击能力。
但即便打了折扣,这条消息依然极具冲击力。它解释了为什么监管机构会突然对前沿模型如此警惕:当一个AI模型在攻防测试中展现出"数小时攻破涉密系统"的能力时,政府对GPT-5.6采取逐案审批的谨慎态度,就变得不难理解了。这两条新闻放在一起看,勾勒出的是AI能力已经触及国家安全红线的现实。
成本压力下,前沿模型不再是唯一选择
在AI监管收紧的同时,市场另一端正在发生截然相反的变化——有公司开始主动放弃昂贵的前沿模型。
AI创业公司Lindy宣布把Claude全部换掉,改用DeepSeek。他们表示,这样一年能省下好几百万美元。

DeepSeek是中国深度求索公司推出的大模型系列,凭借极具竞争力的推理成本引发行业震动。其核心突破在于采用混合专家(MoE)架构与高效训练方法,在保持接近顶级模型能力的同时,将API调用价格压低至前沿模型的数十分之一。这种性价比优势对企业级应用意义重大:许多业务场景(如文本分类、信息抽取、客服问答)并不需要最强模型的全部能力,而调用量一旦规模化,成本差异就会被急剧放大。
这个案例传递出一个明确信号:在成本压力下,开始有公司主动"降级",用更便宜的模型替换前沿模型。对于很多实际业务场景来说,顶级模型的边际能力提升,并不足以覆盖其高昂的成本溢价。DeepSeek等高性价比模型的崛起,正在重塑企业的技术选型逻辑——能力够用即可,成本才是硬约束。
Mirror Code:衡量AI"长跑耐力"的新基准
随着AI编程能力的提升,如何评估模型的"持久力"成了新问题。Apoc.ai推出了一个新基准——Mirror Code,专门测试模型能否长时间连续工作。
在测试中,有一个模型在单个任务上不停编程了整整19天,光跑下来就花费了大约2600美元。这个基准用来衡量长程自主编程的耐力和稳定性。

要理解这一基准的意义,需要先了解AI Agent的概念。AI Agent(智能体)指能够自主规划、执行多步骤任务并与环境交互的AI系统,被视为大模型落地的下一个前沿。与传统的一问一答不同,Agent需要在长时间跨度内维持目标一致性、管理上下文记忆、自我纠错并调用外部工具。"长程自主性"恰恰是当前Agent的最大瓶颈——模型在长任务中容易出现目标漂移、错误累积和上下文丢失。此前业界常用的编程基准如SWE-bench主要评估单个问题的解决能力,而Mirror Code这类测试将评估维度延伸到"连续工作数天"的耐力层面。
这标志着AI编程评估进入了一个新维度。过去我们关注模型能否写对一段代码,现在关注的是它能否像人类工程师一样,在漫长的项目周期里保持稳定输出、不偏离目标、不累积错误。这种"长程自主性",正是Agent走向真正实用化的关键门槛。
版权战升级:近400家报纸联合起诉
内容版权的战火仍在蔓延。将近400家美国报纸联合起来,把OpenAI和微软告上法庭,指控这两家系统性地"偷爬"报纸文章去训练模型。
更具针对性的是,《纽约时报》还单独追加了一条指控,称微软专门搭建了一台超级计算机来帮助OpenAI实施侵权。这一诉讼将版权争议从"数据抓取"层面,推向了"基础设施共谋"的更严重指控。
AI训练数据的版权争议是过去两年最受关注的法律议题之一。争议核心在于:未经授权抓取受版权保护的内容用于模型训练,是否构成侵权,还是可以援引美国版权法中的"合理使用"(Fair Use)原则免责。《纽约时报》早在2023年底就起诉OpenAI和微软,此次近400家报纸的集体诉讼进一步扩大了战线。而"基础设施共谋"的指控尤为关键——它试图将微软从单纯的技术提供方,认定为侵权行为的主动参与者,这可能显著提高被告的法律责任。这类诉讼的判决结果,将深刻影响整个生成式AI行业的数据获取模式和商业合法性基础。AI训练数据的合法性问题,正在成为悬在所有大模型公司头上的长期风险。
高通收购Modular,剑指端云一体AI
硬件层面也有大动作。高通宣布收购Modular,还要联手Hugging Face。
Modular做的是一套能跨各种芯片运行的AI软件栈,实现"一次开发就能在CPU、GPU等不同硬件上部署"。Modular由TensorFlow的创始人之一Chris Lattner创立,其推出的Mojo编程语言和MAX推理引擎,核心目标就是打破AI软件对特定硬件(尤其是英伟达CUDA生态)的深度绑定,让开发者能够跨异构硬件高效部署模型。通过这笔收购,高通显然是想把AI从设备端一直延伸到云端,打通端云一体的AI部署链路。

这也反映出芯片巨头的战略焦虑与野心——单纯卖芯片已经不够,掌握跨硬件的软件生态才是构筑护城河的关键。在英伟达凭借CUDA生态形成事实垄断的背景下,高通、AMD等竞争对手要想突围,必须在软件层面提供足够开放且高效的替代方案,这正是Modular这类中立软件栈的战略价值所在。
资本狂热与就业冲击:AI浪潮的一体两面
最后两条新闻,一冷一热,恰好形成对照。
热的一面:国产AI公司中科闻歌今天在香港上市,被称为"决策大模型第一股",开盘就涨了81%,公开发售被超额认购了将近6000倍。这个夸张的数字,直观反映出国内AI在资本市场上的火热程度。近6000倍的超额认购在港股IPO历史上极为罕见,反映出市场资金对AI概念的高度追捧,但如此悬殊的认购倍数往往也预示着后续股价的高波动风险。
冷的一面:Anthropic直接表示,他们已经不再需要招聘初级工程师了,因为AI已经能干过去交给初级岗位的活。他们还发出警告,等别的行业也跟着这么做,可能会带来一轮经济冲击。Anthropic CEO Dario Amodei此前就曾多次公开预警,AI可能在未来数年内消灭大量初级白领岗位,这一表态与公司自身的招聘决策形成呼应,也让"AI替代就业"从抽象讨论变成了正在发生的现实。
资本的狂热与就业的隐忧同时出现,正是当下AI浪潮的一体两面:技术在创造巨大价值的同时,也在悄然改写就业结构。这场变革带来的社会阵痛,或许才刚刚开始。
核心要点
相关推荐

从Chat到Agent:用AI代理自动化你的业务全流程
资深AI实践者Remy深度拆解从聊天模型到AI代理的跨越:讲透代理运行原理、上下文/工具/技能三大支柱、MCP工具连接与实操架构,助你把AI放在业务最前沿,成为效率翻倍的「百倍员工」。

Understand Anything:代码变可交互知识图谱的AI Skill
Understand Anything是一个GitHub高星开源skill,能对任意代码库做静态分析,生成可交互知识图谱,支持Claude Code、Cursor、Copilot等主流agent,用自然语言提问并带路径引用,帮工程师快速读懂陌生代码。

Kimi K3发布:2.8万亿参数开源模型如何重塑AI性价比格局
月之暗面正式发布Kimi K3,2.8万亿参数、100万上下文、原生多模态开源模型。凭借KDA架构创新与超低成本,在编程、知识工作等基准测试中媲美GPT-5.6与Fable 5,重新定义AI竞赛性价比。