Unverified50% confidenceBenchmarkExact time
一项覆盖13个测试项目的横向评测对比了Kimi K3、Claude Opus 5、Grok 4.6和GPT-5.6 Sol(Max)四款模型的游戏开发能力
1
Sources
50%
Confidence
Short-term (~14 days)
Relevance
9/5/2026
First Seen
Valid until: 9/19/2026
Sources
Related Entities
Related Claims
UnverifiedKimi K2.6在SWE Bench Pro、深度搜索问答和Humanity's Last Exam等顶级基准测试上与GPT 5.4、Claude Opus 4.6和Gemini 3.1 Pro等闭源模型竞争73% similarUnverified本次测试选取了五款AI模型:DeepSeek R1、Claude Sonnet 3.7、ChatGPT o3 Mini、Grok 3、通义千问2.5 Max,通过统一提示词让它们各自生成可运行的网页版贪吃蛇游戏70% similarUnverified综合实测结果,四款模型能力排名为:Sol > GPT-5.5 > Terra > Luna66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/862062API
curl https://kongchang.com/api/v1/knowledge/claims/862062MCP
get_claim(id=862062)