待验证50% 置信基准精确时间
在自研基准PinBash 3测试中,SOL约得78.6%,TERRA约62.9%,LUNA约44.3%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/11
首次发现
有效期至:2026/10/9
来源
GPT-5.6三款模型深度实测:SOL/TERRA/LUNA性能与定价全解析
bilibili薛定猫AI2026/7/9
相关事实
待验证在综合基准测试中,So得55分(约78.6%),Terra得44分(约62.9%),Luna得31分(约44.3%)76% 相似待验证通义千问3.6在SWE-Bench测试中得分78.8分,对比Claude Opus的80.9分67% 相似部分验证在KingBench 3测评中Soul得55分(约78.6%),Tara得44分(约62.9%),Luna得31分(约44.3%)66% 相似待验证Mistral Medium 3.5在HumanEval基准测试中通过率为77.6%65% 相似待验证在贴吧小站项目评测中,Sol以83.95分居首,GLM 5.2以76.59分位列第二,Terra 75.97分排第三,Luna 68.56分排第四61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/488170API
curl https://kongchang.com/api/v1/knowledge/claims/488170MCP
get_claim(id=488170)