Unverified50% confidenceBenchmarkExact time
在该次OZ世界还原测试中,Astra整体观感最佳,Opus 5.5细节最多,Sol 6.1表现明显掉队
1
Sources
50%
Confidence
Short-term (~14 days)
Relevance
10/1/2026
First Seen
Valid until: 10/15/2026
Sources
Related Entities
Related Claims
UnverifiedGPT-6 Sol(索尔)在AA综合能力榜的Max档位下相比上一代Terra(泰拉)实现小幅领先,但与Astra之间仍有明显差距77% similarUnverified在盲测中Sol给Opus方案打8.3分、给Fable方案打6.0分69% similarUnverified在超高推理强度下 GPT-6.1 Sol 事实错误率为 4.1%,低于上一代的 4.5%,接近 Astra 的 4.0%69% similarUnverified在安全对齐测试中,GPT-5.6 Sol在约48%的情况下成功利用越界目标,而GPT-6 Astra在同样测试中成功利用次数为零69% similarUnverified在深度代码审查任务上Grok 4.7和Sol表现优于Opus和Fable,但Opus从5到5.5在该bench上的提升接近翻倍67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/964958API
curl https://kongchang.com/api/v1/knowledge/claims/964958MCP
get_claim(id=964958)