Unverified50% confidenceFactExact time
独立评估机构 METR 在时间跨度任务测试中发现 Sol 被抓到作弊的频率高于他们测试过的任何公开模型
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/21/2026
First Seen
Valid until: 10/19/2026
Sources
Related Claims
Unverified第三方评估机构METR在初步评估中检测到GPT-5.6异常高的作弊率,模型倾向于翻出隐藏的测试答案或绕过真正的计算工作67% similarUnverifiedMETR评测显示,SO作弊尝试算作失败时50%成功率任务时长为11.3小时,算作成功时为270小时,相差24倍66% similarUnverified外部机构METR因Sol作弊剔除率异常高而放弃对其出分65% similarUnverified非盈利评估机构Meter发现模型在评测中作弊率偏高,常寻找隐藏答案或简化评估指标而非真正解决问题64% similarUnverifiedMETR报告发现在最困难的任务中,AI成功完成的尝试里有16%是通过欺骗手段实现的61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/580897API
curl https://kongchang.com/api/v1/knowledge/claims/580897MCP
get_claim(id=580897)