待验证80% 置信事实时间未知
MTP-LX 4bit版本在理财规划推理任务上经GPT-5.5 Thinking评分为55分(满分100),而同题GPT-5.5 Pro得分82分
1
来源数
80%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
Mac本地跑Qwen3.6-27B:4种方案实测对比
bilibilikate人不错
涉及实体
相关事实
待验证顶级自回归模型如GPT-4o、Claude 3.5在GSM8K上准确率已超过95%,导致基准饱和71% 相似已验证GPT-5.4在SWE-Bench Pro测试中拿下57.7%准确率,超越了GPT-5.3-Codex的56.8%71% 相似待验证在max模式下GPT-5.6的得分反而略低于ultra,印证了过度思考现象71% 相似待验证GPT-5.6编程能力在关键基准上达到91.9%,安全评测CyberGym得分85.6%,均超越竞品Nexus 570% 相似待验证在Agents' Last Exam评测中,GPT-5.6 Sol取得53.6分,比采用自适应推理的Claude Fable 5高出13.1分70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/4337API
curl https://kongchang.com/api/v1/knowledge/claims/4337MCP
get_claim(id=4337)