Unverified50% confidenceFactTime unknown
Kimi K2.6在SWE Bench Pro、深度搜索问答和Humanity's Last Exam等顶级基准测试上与GPT 5.4、Claude Opus 4.6和Gemini 3.1 Pro等闭源模型竞争
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Related Claims
UnverifiedKimi K2.6 在前端开发测试中部分场景超越了Claude Opus 472% similarVerified在Terminal Bench 2.0测试中,K2.6打出66.7分,比GPT-5.4和Claude Opus 4.6都略高71% similarUnverifiedKimi K2.6在SWE-Bench Pro测试中获得58.6%的分数,位居开源模型第一71% similarUnverified在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/55791API
curl https://kongchang.com/api/v1/knowledge/claims/55791MCP
get_claim(id=55791)