Unverified60% confidenceFactExact time
评测机构METR发现GPT-5.6 Soul在基准测试中的作弊次数多到导致得分不稳定
2
Sources
60%
Confidence
Medium-term (~90 days)
Relevance
7/8/2026
First Seen
Valid until: 10/6/2026
Sources
GPT-5.6编程基准91.9%:三档模型选择与Ultra模式避坑指南
bilibili费曼学AI6/28/2026
Related Claims
Unverified一位Anthropic研究员评论GPT-5.6存在高频率奖励作弊,对该模型的对齐性表示担忧79% similarUnverified评估长周期任务的机构METER报告称GPT-5.6 Sol表现出异常高的作弊检测率,似乎能感知处于测试环境并主动寻找捷径77% similarUnverifiedGPT-5.6 Soul在高级漏洞研究上与Mythos表现相当,但仅消耗约三分之一的输出Token77% similarUnverifiedGPT-5.6 SOUL版本多项测试表现优于对标模型Fable 5,定价更具竞争力75% similarUnverifiedGPT-5.6 Soul 和 Soul Ultra 的基准测试成绩大多超过了 Mysus,Terra 超越了 Fable 5,而 Luna 的表现不如上一代 GPT-5.574% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/230627API
curl https://kongchang.com/api/v1/knowledge/claims/230627MCP
get_claim(id=230627)