待验证50% 置信事件精确时间
本次测试选取了五款AI模型:DeepSeek R1、Claude Sonnet 3.7、ChatGPT o3 Mini、Grok 3、通义千问2.5 Max,通过统一提示词让它们各自生成可运行的网页版贪吃蛇游戏
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
五大AI模型做游戏实测对比:零基础编程谁最强
bilibiliso-PHI-a_902025/3/1
相关事实
待验证在图片隐藏虫子识别测试中,Sonnet 5的Max模式花费约10分钟并识别结果完全正确,而Gemini顶配模型只找到4只,GPT-5.5 X-High未能检测出66% 相似待验证在简单题中,GLM 5.1补了19行测试,Kimi K2.6补了12行,其他五个模型(包括Sonnet 4.6)一行测试都没写66% 相似待验证V4 Pro Max满血推理模式下算法竞赛3206分、编程93.5分、科学问答90.1分、软件工程80.6分、终端操作67.9分65% 相似待验证GLM4在World of AI基准测试工具中排名第五64% 相似待验证参与测试的四款模型是QDAM 3.7 Plus、LongCat 2.0、DeepSeek Feast Pro和MiniMax Mi364% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/60451API
curl https://kongchang.com/api/v1/knowledge/claims/60451MCP
get_claim(id=60451)