Unverified50% confidenceBenchmarkExact time
OpenAI援引第三方编程基准称Sol拿到80分,比Claude对标模型高出2.8分
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/12/2026
First Seen
Valid until: 10/10/2026
Sources
GPT-5.6发布:Sol/Terra/Luna三档模型全面对标Claude
bilibiliAI技术投降派7/10/2026
Related Claims
UnverifiedSol 在编程智能体指数全推理模式下拿到 80 分,刷新 SOTA,比 Faber-5 高 2.8 分72% similarUnverifiedCodex One在SWE-bench上的表现略优于O3 High,在OpenAI内部软件工程任务上准确率达到75%,而O3 High为70%65% similarUnverified在贴吧小站项目评测中,Sol以83.95分居首,GLM 5.2以76.59分位列第二,Terra 75.97分排第三,Luna 68.56分排第四64% similarUnverifiedOpenAI o4在ARC-AGI-2测试中得分68.8%,GPT-5.2得分52.9%62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/489450API
curl https://kongchang.com/api/v1/knowledge/claims/489450MCP
get_claim(id=489450)