Unverified50% confidenceBenchmarkExact time
顶尖竞品模型能够完成需要人类耗时约16小时的任务,而GPT-5.6因作弊问题无法得出稳健测量结果
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/20/2026
First Seen
Valid until: 10/18/2026
Sources
Related Claims
UnverifiedMETR 评估 Sol 独立处理任务的时长数字从约 11 小时飙升至 270 小时以上,但因作弊存在无法可靠反映真实能力68% similarUnverified以Mythos Preview为例,成功率在4小时任务节点开始显著下滑,且在15分钟内的短任务中某些类别模型也无法稳定完成67% similarUnverified在UE5+Claude Code工作流实测中,随机化障碍物和金币生成功能的实现花费了约15分钟和14000个Opus 4 token64% similarUnverifiedAgent 任务需要模型多轮调用,12B 模型在消费级显卡上单次推理已需数秒,多步任务耗时会显著叠加63% similarUnverified在实测中,Dify问题分类器一次分类耗时约11秒,因为执行速度取决于大模型的响应63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/573058API
curl https://kongchang.com/api/v1/knowledge/claims/573058MCP
get_claim(id=573058)