Unverified60% confidenceOpinionTime unknown
Kimi K2.6 在前端开发测试中部分场景超越了Claude Opus 4
2
Sources
60%
Confidence
Medium-term (~90 days)
Relevance
5/31/2026
First Seen
Valid until: 8/29/2026
Sources
Kimi K2.6 深度实测:编程、多智能体、前端开发全面评测
bilibiliAI-seeker
Related Entities
Related Claims
UnverifiedKimi K2.6在SWE-Bench Pro测试中获得58.6%的分数,位居开源模型第一72% similarUnverifiedKimi K2.6在SWE Bench Pro、深度搜索问答和Humanity's Last Exam等顶级基准测试上与GPT 5.4、Claude Opus 4.6和Gemini 3.1 Pro等闭源模型竞争72% similarUnverified以Kimi K3实验,给它预填充1%的Claude Opus解码推理片段,其输出风格就会明显向Opus靠拢,某些区段Claude推理链从Kimi K3提取的容易程度比其他模型高出约6个数量级69% similarVerified在Terminal Bench 2.0测试中,K2.6打出66.7分,比GPT-5.4和Claude Opus 4.6都略高68% similarUnverifiedClaude Opus 4.6在SWE-bench基准测试中在现实世界的专家级任务中表现领先65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/3980API
curl https://kongchang.com/api/v1/knowledge/claims/3980MCP
get_claim(id=3980)