待验证50% 置信基准精确时间
Caveman给出的固定54次运行基准测试结果显示输入Token减少33.2%,且18/18项正确性检查全部通过
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/12
首次发现
有效期至:2026/12/11
来源
涉及实体
相关事实
待验证本地运行的Gemma 26B在453次评分预测中准确率仅为49.2%,其配对的永远说涨基准准确率为53.4%68% 相似待验证在 2456 个保留 prompt 上的测试中,把采样步数从 20 提到 50,FID 仅从 27.0 改善到 26.6(0.4),而去掉 shift 后 FID 从 27.0 升到 27.3、FD-DINOv2 从 218 升到 22867% 相似待验证Caveman是刚上线的新工具,评论数仅6条,54次运行的基准样本规模有限,验证仍属早期66% 相似待验证在 Terminal Bench 2.1 测试中,AutoPrompt Scale 使 OpenCode 在 89 个任务中的失败数从 29 降到 16,多解决 13 题,分数提升 14.61 个百分点64% 相似待验证引导模式下平均端到端准确率从28.6%提升到33.7%,歧义检测F1值从45.3%提升到64.9%64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/914494API
curl https://kongchang.com/api/v1/knowledge/claims/914494MCP
get_claim(id=914494)