待验证50% 置信基准精确时间
在综合基准测试中,So得55分(约78.6%),Terra得44分(约62.9%),Luna得31分(约44.3%)
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/10
首次发现
有效期至:2026/10/8
来源
GPT-5.6三款模型实测:So/Terra/Luna性价比全面解析
bilibili宙流AI小工坊主2026/7/9
相关事实
待验证在自研基准PinBash 3测试中,SOL约得78.6%,TERRA约62.9%,LUNA约44.3%76% 相似部分验证在KingBench 3测评中Soul得55分(约78.6%),Tara得44分(约62.9%),Luna得31分(约44.3%)71% 相似待验证Claude Opus 4.7中间检查点通过率达57%,最终准确率却只有39.8%71% 相似待验证在贴吧小站项目评测中,Sol以83.95分居首,GLM 5.2以76.59分位列第二,Terra 75.97分排第三,Luna 68.56分排第四66% 相似待验证引导模式下平均端到端准确率从28.6%提升到33.7%,歧义检测F1值从45.3%提升到64.9%65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/471364API
curl https://kongchang.com/api/v1/knowledge/claims/471364MCP
get_claim(id=471364)