待验证60% 置信基准精确时间
GPT-5.6 明显短板集中在前端视觉任务,Sol 在 Three.js、SVG 等项目仅六七分,而 Fable 5 能拿九分甚至满分
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/7/10
首次发现
有效期至:2026/10/8
来源
GPT-5.6三模型实测:Sol/Terra/Luna与Claude差距还有多远?
bilibili烟神殿副殿主2026/7/9
相关事实
待验证在前端与视觉任务(Three.js动画、SVG图形)上,GPT-5.6模型普遍只能拿到六七分,而竞品Fable 5能稳定达到九到十分85% 相似部分验证三个 GPT-5.6 模型在长程代理微调任务上均拿满分 10 分,而 GPT-5.5 和 Opus 4.7 在该任务只能拿两三分77% 相似待验证在数学难题上SOL和TERRA均拿到满分10分,在自适应微调任务上三款GPT-5.6模型全部满分,而此前GPT-5.5和Opus 4.7在同一任务上仅能拿到两三分74% 相似待验证在3D跑酷游戏生成任务中,GPT 5.5两次生成均为空屏,获得0分,DeepSeek V4 Pro和MiniMax M3并列获得7分73% 相似待验证GPT 5.1号称在简单任务上比GPT 5快2倍,复杂任务深度提升2倍,幻觉降低56%72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/452870API
curl https://kongchang.com/api/v1/knowledge/claims/452870MCP
get_claim(id=452870)