待验证75% 置信事实时间未知
在Velse AI 4月23日的最新排名中,Kimi K2.6排第一,DeepSeek V4排第二,两者仅差0.07个百分点
1
来源数
75%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
DeepSeek V4编码实测:榜单第一Kimi翻车,Claude稳居最强
bilibiliAGI_Ananas
涉及实体
相关事实
待验证Kimi K2.6和Claude在SWE-Bench上的性能差距不到1%,但价格差了7倍(Kimi每百万tokens 0.8美金,Claude 5美金)65% 相似待验证在综合性能排名中,Kimi K2.5得分64%,排名第五,前四名分别是Gemini 3 Pro(100%)、Claude Opus 4.5 Max(74%+)、GLM 4.7(65%)和GPT-5.2X(65%)65% 相似待验证Kimi K2.5的Token用量比排名第二、第三的Gemini和Claude小模型高出50%64% 相似待验证K2.7 Code目前尚未公布SWE-Bench成绩,所有性能数据均为月之暗面自报,此前K2.6曾出现自报成绩与第三方复现相差15-20个百分点的情况63% 相似待验证在独立测试者的综合排名中,Claude 4.5 Haiku分别排在第34和第37位,是主流AI实验室新一代模型中得分最低的一个63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13852API
curl https://kongchang.com/api/v1/knowledge/claims/13852MCP
get_claim(id=13852)