待验证50% 置信基准精确时间
Artificial Analysis 给 GPT-6.1 Sol 52 分,仅比 Astra 低一分,基准测试运行成本只有 Astra 的四分之一,比 6 Sol 便宜 31%
1
来源数
50%
置信度
长期有效
时效性
2026/10/4
首次发现
来源
涉及实体
相关事实
待验证GPT-6.1 Sol「工具出故障时不如实告知」比例从 4.9% 降到 2.1%,Astra 为 1.5%77% 相似待验证在电脑操作类任务上Astra最强,Sol得分60.5%与Opus 5的60.3%接近,单任务成本约低八成75% 相似待验证Sol在编程测试中得分68.8%,接近上一代Fable 5的69.9%,但单项成本约低八成73% 相似待验证GPT-6 Astra按任务计算的成本比上一代更便宜,因为更强模型用更少步骤和token完成同一任务73% 相似待验证在Artificial Analysis智能指数综合测试中,GPT-5.6性能比Claude Opus 4.5略低约0.9分,但成本几乎减半73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/975162API
curl https://kongchang.com/api/v1/knowledge/claims/975162MCP
get_claim(id=975162)