待验证50% 置信基准精确时间
Claude 5.1在Humanities Last Exam不带工具时得分60.9%,接入工具后升至65%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/4
首次发现
有效期至:2026/12/3
来源
涉及实体
相关事实
待验证在Terminal-Bench 4.0上,Claude 5.1标准版得分55.8%,受信版达到60.9%;OS World 2.0部分完成率为77.9%66% 相似待验证在长周期智能体工作流测试(Engines Last Exam)中,GPT-5.6 Sol 得分 53.6,比 Faber-5 高出 13.1 分66% 相似待验证在Agents' Last Exam评测中,GPT-5.6 Sol取得53.6分,比采用自适应推理的Claude Fable 5高出13.1分64% 相似待验证Claude 5.1在Terminal-Bench Science上得分52.6%,相比上一代的24.7%实现翻倍以上跃升64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/853482API
curl https://kongchang.com/api/v1/knowledge/claims/853482MCP
get_claim(id=853482)