Unverified50% confidenceBenchmarkExact time
在 Terminal Bench 2.1 测试中,AutoPrompt Scale 使 OpenCode 在 89 个任务中的失败数从 29 降到 16,多解决 13 题,分数提升 14.61 个百分点
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/27/2026
First Seen
Valid until: 11/25/2026
Sources
Related Entities
Related Claims
Unverified在SWE-Bench编程基准测试中,Claude Code得分80.8%,GitHub Copilot仅为72.5%62% similarUnverifiedMiniMax M3 received an average score of 58.3 across 7 high-difficulty coding tasks in a systematic evaluation61% similarUnverified实测中使用AnySearch Skill完成搜索任务消耗18个额度点,不使用时消耗23个额度点,节省约27%60% similarUnverifiedSWE-Bench Pro的提示词长度中位数为30,098个字符,而Frontier Code任务描述部分的中位数仅为9,082个字符59% similarUnverifiedTerminal Bench 2.1测试中GPT-5.6 Ultra得分接近92%,Fable 5为88%,考虑误差范围基本持平58% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/807691API
curl https://kongchang.com/api/v1/knowledge/claims/807691MCP
get_claim(id=807691)