部分验证65% 置信基准精确时间
在KingBench 3测评中Soul得55分(约78.6%),Tara得44分(约62.9%),Luna得31分(约44.3%)
3
来源数
65%
置信度
中期 (~90 天)
时效性
2026/7/10
首次发现
有效期至:2026/10/8
来源
GPT-5.6三款模型深度实测:Soul、Tara、Luna实力几何?
bilibiliAI-seeker2026/7/9
相关事实
待验证在综合基准测试中,So得55分(约78.6%),Terra得44分(约62.9%),Luna得31分(约44.3%)71% 相似待验证在自研基准PinBash 3测试中,SOL约得78.6%,TERRA约62.9%,LUNA约44.3%66% 相似待验证在测评中Qwen 3 Max领先Kimi K3(77.5%)、GLM(75%)和GPT-4系列(71.25%)66% 相似待验证在综合性能排名中,Kimi K2.5得分64%,排名第五,前四名分别是Gemini 3 Pro(100%)、Claude Opus 4.5 Max(74%+)、GLM 4.7(65%)和GPT-5.2X(65%)65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/457594API
curl https://kongchang.com/api/v1/knowledge/claims/457594MCP
get_claim(id=457594)