待验证50% 置信基准精确时间
在 Terminal-Bench Core 0.1.1 试点中,跨 12 个精选任务,基线组与可靠性层组在严格试验下各通过 17/36,可靠性层多消耗了 37.49% 的输入 token 和 50.73% 的输出 token
1
来源数
50%
置信度
长期有效
时效性
2026/10/2
首次发现
来源
涉及实体
相关事实
待验证在 Terminal Bench 2.1 测试中,OpenCode 对比里 89 个任务的失败数从 29 降到 16,多解决 13 题,分数提升 14.61 个百分点74% 相似待验证在 Terminal Bench 基准测试上,某模型在本身不变、仅改进框架的情况下,排名从三十名开外提升至前五66% 相似待验证在实验中,零样本生成任务解决率为17%,通用自我纠错为27%,仅错误反馈为23%,诊断性反例反馈(A-CEGIS)达到90%66% 相似待验证token 效率提升 54% 意味着完成同样一个编程任务所消耗的 token 数量减少近一半65% 相似待验证在DeepSWE测试中,全部输入Token中有99.6%是缓存命中(cache hits)63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/966703API
curl https://kongchang.com/api/v1/knowledge/claims/966703MCP
get_claim(id=966703)