待验证50% 置信基准精确时间
在数学难题上SOL和TERRA均拿到满分10分,在自适应微调任务上三款GPT-5.6模型全部满分,而此前GPT-5.5和Opus 4.7在同一任务上仅能拿到两三分
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/11
首次发现
有效期至:2026/10/9
来源
GPT-5.6三款模型深度实测:SOL/TERRA/LUNA性能与定价全解析
bilibili薛定猫AI2026/7/9
相关事实
部分验证三个 GPT-5.6 模型在长程代理微调任务上均拿满分 10 分,而 GPT-5.5 和 Opus 4.7 在该任务只能拿两三分85% 相似待验证Sam Altman表示由于推理能力提升,GPT-5.5每个任务实际消耗的Token数量少于GPT-5.476% 相似待验证OpenAI 官方称 GPT-5.6 索拉纳执行同等复杂度编程任务时仅消耗 GPT-5.5 三分之一的 Token75% 相似已验证SOL的基准分数几乎是上一代GPT-5.5的两倍,实现了代际跃升,但整体仍落后于Fable 574% 相似待验证GPT系模型的Token利用率远高于对手,Sol通常仅用约三分之一的Token量完成同等任务74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/488171API
curl https://kongchang.com/api/v1/knowledge/claims/488171MCP
get_claim(id=488171)