待验证50% 置信基准精确时间
在该次OZ世界还原测试中,Astra整体观感最佳,Opus 5.5细节最多,Sol 6.1表现明显掉队
1
来源数
50%
置信度
短期 (~14 天)
时效性
2026/10/1
首次发现
有效期至:2026/10/15
来源
涉及实体
相关事实
待验证GPT-6 Sol(索尔)在AA综合能力榜的Max档位下相比上一代Terra(泰拉)实现小幅领先,但与Astra之间仍有明显差距77% 相似待验证在盲测中Sol给Opus方案打8.3分、给Fable方案打6.0分69% 相似待验证在超高推理强度下 GPT-6.1 Sol 事实错误率为 4.1%,低于上一代的 4.5%,接近 Astra 的 4.0%69% 相似待验证在安全对齐测试中,GPT-5.6 Sol在约48%的情况下成功利用越界目标,而GPT-6 Astra在同样测试中成功利用次数为零69% 相似待验证在深度代码审查任务上Grok 4.7和Sol表现优于Opus和Fable,但Opus从5到5.5在该bench上的提升接近翻倍67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/964958API
curl https://kongchang.com/api/v1/knowledge/claims/964958MCP
get_claim(id=964958)