Unverified50% confidenceBenchmarkExact time
在 Terminal-Bench Core 0.1.1 试点中,跨 12 个精选任务,基线组与可靠性层组在严格试验下各通过 17/36,可靠性层多消耗了 37.49% 的输入 token 和 50.73% 的输出 token
1
Sources
50%
Confidence
Long-term
Relevance
10/2/2026
First Seen
Sources
Related Entities
Related Claims
Unverified在 Terminal Bench 2.1 测试中,OpenCode 对比里 89 个任务的失败数从 29 降到 16,多解决 13 题,分数提升 14.61 个百分点74% similarUnverified在 Terminal Bench 基准测试上,某模型在本身不变、仅改进框架的情况下,排名从三十名开外提升至前五66% similarUnverified在实验中,零样本生成任务解决率为17%,通用自我纠错为27%,仅错误反馈为23%,诊断性反例反馈(A-CEGIS)达到90%66% similarUnverifiedtoken 效率提升 54% 意味着完成同样一个编程任务所消耗的 token 数量减少近一半65% similarUnverified在DeepSWE测试中,全部输入Token中有99.6%是缓存命中(cache hits)63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/966703API
curl https://kongchang.com/api/v1/knowledge/claims/966703MCP
get_claim(id=966703)