Unverified50% confidenceBenchmarkExact time
Astra在Artificial Analysis智能指数上低于GLM 5.3 Flash等小模型,因该指数基于已过时饱和的基准(如GPQA)
1
Sources
50%
Confidence
Short-term (~14 days)
Relevance
10/4/2026
First Seen
Valid until: 10/18/2026
Sources
Related Entities
Related Claims
UnverifiedGPT-6.1 Sol「工具出故障时不如实告知」比例从 4.9% 降到 2.1%,Astra 为 1.5%65% similarUnverified在Artificial Analysis智能指数综合测试中,GPT-5.6性能比Claude Opus 4.5略低约0.9分,但成本几乎减半64% similarUnverified据《华尔街日报》报道,Google内部评估显示这些中间检查点模型在性能上与Flash系列相比没有显著优势64% similarUnverifiedAstra的对齐表现优于旧版,寻找其他智能体的群体行为倾向从旧版Sol的43%降至不到4%64% similarVerifiedFlash模型每token的推理成本通常比Pro级模型低一个数量级63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/972631API
curl https://kongchang.com/api/v1/knowledge/claims/972631MCP
get_claim(id=972631)