GPT-5.6被曝悄悄降级为5.5-mini:付费用户抓包揭露隐形回退

事件概述:付费用户遭遇隐形模型降级
一位ChatGPT Plus订阅用户在Reddit发帖,指控OpenAI在过去三天内持续将其付费享有的GPT-5.6 Sol High模型,悄悄替换为质量更低的5.5-mini响应。这一指控迅速引发大量共鸣,多位用户在评论区确认遭遇相同问题,但截至发帖时,OpenAI官方并未做出任何回应。
据发帖者描述,GPT-5.6 Sol的Medium/High推理档位此前数月运行正常。然而最近三天,即便手动选择High推理级别,模型却频繁给出"几乎即时"的浅层回答——上下文保持能力糟糕,甚至出现基础逻辑错误。用户直言,这些响应的质量"与免费账户几乎无法区分"。
值得注意的是,OpenAI的模型命名体系中,GPT-5.6 Sol属于旗舰级推理模型,具备更大的参数规模、更长的上下文窗口和更强的多步推理能力,特别是在复杂逻辑、代码生成和视觉理解等任务上表现突出。而带有"mini"后缀的模型(如5.5-mini)通常是经过蒸馏或剪枝的轻量化版本,虽然在日常对话中表现尚可,但在需要深度推理的场景下会明显逊色。两者的推理成本也存在数量级差异——旗舰模型每次推理消耗的算力资源可能是mini版本的数倍甚至十倍以上,这也是服务商有动机在高峰期进行降级路由的经济学原因。

技术证据:HAR/SSE抓包数据揭示真相
这起投诉之所以值得关注,在于它并非停留在"感觉变差了"的主观层面。发帖者明确指出,直接询问模型"你是谁"这种自我识别方式并不可靠,因此他们转而抓取了底层网络数据作为证据。
这里需要理解两个关键技术概念:HAR(HTTP Archive)是一种标准化的JSON格式文件,用于记录浏览器与服务器之间所有HTTP请求和响应的完整交互过程,包括请求头、响应体、时间戳和状态码等信息,开发者可以通过浏览器DevTools中的Network面板直接导出。SSE(Server-Sent Events)则是一种允许服务器向客户端单向推送数据的技术协议,ChatGPT等流式输出的AI产品广泛采用SSE来实现逐字生成的打字机效果。在SSE的数据流中,服务器会携带元数据字段,其中就包括标识实际调用模型的关键信息。正是因为这些技术细节对普通用户而言通常不可见,才使得模型路由的不一致在正常使用中难以被察觉。
resolved_model_slug字段暴露矛盾
多位用户通过抓取HAR和SSE数据发现了关键矛盾:当UI界面明确请求GPT-5.6 Sol或Pro模型时,服务器返回的字段却显示:
resolved_model_slug: gpt-5-5-mini
换句话说,前端展示的是用户选择的高级模型,但后端实际调用并解析的却是低一档的mini模型。这种前后端不一致的现象,成为"隐形降级"指控最有力的技术支撑。
在OpenAI的架构中,model_slug是标识具体模型版本的内部代号。当用户在前端界面选择某个模型时,请求会携带用户选择的模型标识发送到后端,而后端的路由系统会根据用户的订阅等级、当前服务器负载、配额使用情况等因素,决定实际调用哪个模型来处理请求。resolved_model_slug就是这个决策过程的最终结果——它代表服务器实际解析并调用的模型。这种动态路由机制在大规模分布式AI服务中类似于CDN的负载均衡策略,本身是合理的工程实践。但当路由结果与用户的显式选择不一致且系统没有任何提示时,就构成了对用户选择权的实质性侵蚀。
用户报告这一行为跨平台出现——网页版、桌面应用和移动应用无一幸免。
可复现的六指测试:快速自查是否被降级
为了让其他用户快速自查,发帖者设计了一个简单巧妙的A/B对比测试,这也是本次事件中最具传播力的部分。
测试方法与结果
测试使用一张包含六根手指(一根拇指加五根竖起的手指)的图片,向模型提问:"图中显示了几根手指?"正确答案是六。
这个测试的巧妙之处在于,它直接挑战了AI视觉理解中一个众所周知的难题——精确计数。旗舰模型由于具备更强的视觉推理能力和更精细的图像解析精度,能够克服"默认五指"的常识偏见,准确识别非常规数量;而轻量级模型则更容易受到训练数据中"人手通常有五指"这一统计规律的干扰,给出错误答案。
测试结果呈现出惊人的一致性差异:
- 普通ChatGPT界面:在所有推理档位下,反复测试均给出错误答案;
- Codex界面:GPT-5.6 Sol每次都能在第一次尝试就正确回答"六",无论选择何种推理强度。
发帖者强调,这并非偶发的视觉计数错误,而是两个都声称使用GPT-5.6 Sol的界面之间,呈现出"稳定且可复现"的能力差异。他补充说,此前Sol总能一次答对,如今的表现"应该会让问题一目了然"。
不过他也谨慎地澄清,这个测试并非正式基准或决定性证据,而是一个"快速且有用的指标",帮助用户判断自己的账户是否受到影响。
Codex的"特权"与配额陷阱
更令用户不满的是模型路由的另一层问题。据报告,Work和Codex界面似乎仍在使用真正的Sol模型,但这两个入口消耗的是有限的共享Work/Codex配额。
Codex是OpenAI推出的面向开发者和编程场景的专用界面,它在ChatGPT生态中拥有独立的交互模式和配额体系。Work模式则是面向企业和专业用户的工作流界面。这两个入口在设计上优先保障代码生成、调试和技术文档等高价值任务的模型质量,因此它们的模型路由策略可能与普通聊天界面有所不同。然而,它们共享一个有限的配额池,这意味着用户在这些界面上的每次交互都会消耗专用资源。
这就构成了一个尴尬的困境:付费用户为了获得一个称职的普通问答回复,被迫消耗本应用于编程任务的有限配额。原本应该在普通对话中就能享受的模型质量,现在需要绕道编程接口才能获得。当普通聊天界面被降级后,用户被迫转向专业界面来获取正常质量的回答,实际上是在用专业工具的配额补贴日常对话需求,这种资源错配会加速配额耗尽,显然违背了订阅服务的初衷。
官方文档与状态页的自相矛盾
发帖者仔细比对了OpenAI的官方说法,指出了几处矛盾:
- OpenAI当日更新的文档声称,ChatGPT Plus包含Medium和High档位的GPT-5.6 Sol;
- 文档确实说明了达到推理上限后会有回退机制,但受影响用户往往没有收到任何限额警告或重置计时,有人甚至在仅仅一两次提问后就被降级;
- OpenAI将8月20日的"Thinking mode"事件标记为已解决,但8月23日仍有相关报告出现;
- 部分用户在8月22日看到短暂恢复,却在次日再次被路由到5.5-mini;
- 官方状态页当前显示"所有系统运行正常"。
这里的"推理档位"机制需要进一步说明:OpenAI为其高级推理模型引入了Low、Medium和High三个等级的推理深度选项。这些档位本质上控制的是模型在生成最终答案之前进行"思考"的深度和时长——High档位允许模型花费更多的计算资源进行多轮内部推理(即chain-of-thought链式思考),从而在复杂问题上给出更准确的答案。这一机制源自OpenAI在o1系列模型中首创的"推理时间缩放"(test-time compute scaling)理念,即在推理阶段投入更多算力可以显著提升模型表现。因此,当系统将High档位的请求路由到mini模型时,不仅违背了用户的期望,也使得档位选择本身失去了意义。
发帖者表示,自己已经在X平台上分别联系了Tibo和OpenAI官方账号,均未得到回应。
五种可能的原因与用户核心诉求
值得肯定的是,这位发帖者的态度相对克制。他明确表示自己并不断言这是故意为之,而是要求OpenAI公开澄清问题的真实性质,列出了五种可能的解释:
- 模型路由bug;
- 基于容量的回退机制;
- 账户/IP分类器问题;
- 未公开的使用限制;
- 有意为之的产品变更。
他呼吁的核心诉求很清晰:需要的是官方承认问题并给出解决时间表(ETA),而不是又一次泛泛而谈的故障排查建议。
分析与启示:AI订阅服务的信任危机
无论这起事件的根本原因是技术bug还是成本控制策略,它都触及了AI订阅服务信任机制的核心问题。
对用户而言,最难以接受的并非模型偶尔出错,而是在支付费用、明确选择高级模型的前提下,被静默替换为低一档模型且毫无告知。这种前后端不一致(resolved_model_slug矛盾)如果属实,本质上是一种知情权的缺失。
从行业角度看,大模型推理服务面临着独特的基础设施挑战:单次高级模型推理可能需要占用多块高端GPU数秒乃至数十秒,成本远高于传统Web服务。随着推理成本高企,服务商在高峰期进行容量调度、动态路由甚至降级已成为常见的工程实践。Google的Gemini、Anthropic的Claude等竞品也面临类似的资源调度挑战。但透明度是这类操作能否被用户接受的关键分水岭——行业最佳实践要求降级必须对用户透明,例如通过弹窗提示、UI标记或邮件通知等方式告知。文档中若明确告知回退条件却不给实时提示,与彻底不告知,在体验上有着天壤之别。OpenAI此次事件的争议焦点,正是在于降级行为的"隐形"性质,即前端显示与后端实际之间的信息不对称。
对普通用户来说,这起事件也提供了一个实用的自查思路:不要仅凭主观感受判断模型质量,可以通过可复现的测试(如六指计数)或抓取网络请求的方式获取更客观的证据。在AI服务日益不透明的当下,这种"用数据说话"的用户监督或许会变得越来越重要。
核心要点
相关推荐

AI编程助手对资深开发者真的提效了吗?瓶颈迁移的真相
AI编程助手真的提升了资深开发者的生产力吗?本文深入分析AI代码生成工具在复杂代码库中的实际表现,揭示生产力瓶颈从代码编写向验证监督迁移的现象,帮助开发者重新定位AI辅助编程的真实价值。

异性恋悲观主义:为什么现代约会让人越来越绝望
异性恋悲观主义正成为一种文化现象:女性用自嘲谈论与男性的关系,背后是政治倒退、经济不平等与情感困境的交织。本文深入探讨这一趋势的成因,以及如何在悲观中保持希望。

用Claude Code整理机器学习笔记:CS189自学实践与方法论
一位自学者用Claude Code将UC Berkeley CS189机器学习课程的零散笔记按主题重构,采用双文档结构梳理知识脉络与概念空白,展示AI辅助学习的高效方法论。