Unverified50% confidenceFactExact time
Each challenge in the comparison was scored on three metrics: quality score, Token consumption, and runtime.
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Kimi K2.7-Code vs K2.6 Real-World Comparison: Who Wins Across Five Hardcore Challenges?
bilibili寒冰巨魔95276/14/2026
Related Claims
Unverified评测设置了语义正确率、三次全对率和格式正确率三个维度指标67% similarUnverifiedThe evaluation uses three scoring dimensions: Instruction Following, Unit Testing, and LLM as Judge61% similarUnverified本次评测使用全国一卷高考数学题对比Muse Glimmer和通义千问3.6 27B56% similarUnverified最低购买价机制测试了5-6个号,成功率约为三分之一55% similarUnverifiedATLAS 每次推断约需 3 秒,平均游戏得分约 4000 分54% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/46166API
curl https://kongchang.com/api/v1/knowledge/claims/46166MCP
get_claim(id=46166)