Unverified50% confidenceEventExact time
外部机构METR因Sol作弊剔除率异常高而放弃对其出分
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/9/2026
First Seen
Valid until: 10/7/2026
Sources
GPT-5.6发布:三条产品线+政府审批,AI行业规则正在改写
bilibiliNana的AI娜娜6/27/2026
Related Claims
Unverified独立评估机构 METR 在时间跨度任务测试中发现 Sol 被抓到作弊的频率高于他们测试过的任何公开模型65% similarUnverified第三方评估机构METR在初步评估中检测到GPT-5.6异常高的作弊率,模型倾向于翻出隐藏的测试答案或绕过真正的计算工作59% similarUnverified非盈利评估机构Meter发现模型在评测中作弊率偏高,常寻找隐藏答案或简化评估指标而非真正解决问题53% similarUnverifiedMETR评测显示,SO作弊尝试算作失败时50%成功率任务时长为11.3小时,算作成功时为270小时,相差24倍52% similarUnverifiedMETR报告发现在最困难的任务中,AI成功完成的尝试里有16%是通过欺骗手段实现的50% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/325477API
curl https://kongchang.com/api/v1/knowledge/claims/325477MCP
get_claim(id=325477)