待验证60% 置信基准精确时间
在Terminal Bench 4.0最高精度测试中,Fable 5.1准确率为55.8%,成本为19.50美元;Astra准确率为56.7%,成本为10.35美元
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/9/9
首次发现
有效期至:2026/12/8
来源
涉及实体
相关事实
待验证在 Frontier Code 准确率与成本基准测试中,低档位花费约 5 美元可达约 11% 得分,而 Opus 4.8 Max 花费约 11 美元才拿到相同得分73% 相似待验证AS5048 数据手册中标注的实际精度(考虑积分非线性误差 INL)通常在 ±0.5 度左右69% 相似待验证GPT-6 Astra在256K-512K token区间的八针基准测试中准确率达到100%66% 相似待验证微调后的Qwen3.5-4B模型在BU Bench V1基准上准确率从15%提升至53%65% 相似待验证GPT-5.6 Extreme High档位约需63美元获得53.6%得分,而Claude Sonnet自适应模式耗费约2000美元得分仅40.5%65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/881470API
curl https://kongchang.com/api/v1/knowledge/claims/881470MCP
get_claim(id=881470)