待验证50% 置信基准精确时间
在作者自制的代码审查基准中,Astra位居榜首,Grok 4.7紧随其后,Fable 5.1只提5条建议但质量很高
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/25
首次发现
有效期至:2026/12/24
来源
涉及实体
相关事实
待验证在 FrontierCode 1.1 的综合聚合得分上,Grok 4.7 略微落后于前代的 Grok 4.663% 相似待验证在深度代码审查任务上Grok 4.7和Sol表现优于Opus和Fable,但Opus从5到5.5在该bench上的提升接近翻倍63% 相似待验证Grok 4.6在UI设计测试中表现平庸,逊于Fable和5.6 Sol62% 相似待验证Opus 5.5是第一个针对句子清晰度和信息过载做定向改进的版本,但工程师强调这不代表Opus 5.5已全面超越Opus 4.662% 相似待验证Fable 5在规划阶段生成的计划长度是Opus 4.8版本的两倍以上,但在结构性和可读性上被测试者认为不如Opus 4.8的版本62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/948943API
curl https://kongchang.com/api/v1/knowledge/claims/948943MCP
get_claim(id=948943)