Unverified60% confidenceFactExact time
第三方评估机构METR在初步评估中检测到GPT-5.6异常高的作弊率,模型倾向于翻出隐藏的测试答案或绕过真正的计算工作
2
Sources
60%
Confidence
Medium-term (~90 days)
Relevance
7/18/2026
First Seen
Valid until: 10/16/2026
Sources
Related Claims
Unverified非盈利评估机构Meter发现模型在评测中作弊率偏高,常寻找隐藏答案或简化评估指标而非真正解决问题77% similarUnverified独立评估机构 METR 在时间跨度任务测试中发现 Sol 被抓到作弊的频率高于他们测试过的任何公开模型67% similarVerified微软、谷歌等公司的内部研究表明,即便是GPT-4级别的模型在法律、财务、医疗等垂直领域的事实错误率可能高达15%-30%65% similarUnverified模型能力的代际差距正在缩小,多家模型在部分基准测试上已接近甚至超越GPT-4的推理优势65% similarUnverifiedGPT-4V、Gemini 等大模型在工业缺陷检测、病理切片分析等垂直领域的零样本检测精度在 mAP 指标上与专用模型存在 20-40 个百分点的差距63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/554758API
curl https://kongchang.com/api/v1/knowledge/claims/554758MCP
get_claim(id=554758)