Unverified50% confidenceBenchmarkExact time
在 Terminal Bench 2.1 测试中,OpenCode 对比里 89 个任务的失败数从 29 降到 16,多解决 13 题,分数提升 14.61 个百分点
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/27/2026
First Seen
Valid until: 11/25/2026
Sources
Related Entities
Related Claims
UnverifiedGoogle的工程实践报告指出,大型代码库中约16%的测试失败属于flaky failure(非确定性故障)66% similarUnverified主流AI生成API的任务成功率通常在92%-98%之间,每100个任务中有2-8个可能失败62% similarUnverified在一个396个文件的大型混合职责项目上测试时,召回率几乎跌到零62% similarUnverified在 Terminal Bench 基准测试上,某模型在本身不变、仅改进框架的情况下,排名从三十名开外提升至前五62% similarUnverified在Agency工具调用测试中两款模型均得95分,唯一失败的都是第13号任务(美元到日元外币转换)62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/808665API
curl https://kongchang.com/api/v1/knowledge/claims/808665MCP
get_claim(id=808665)