Unverified50% confidenceBenchmarkExact time
Caveman给出的固定54次运行基准测试结果显示输入Token减少33.2%,且18/18项正确性检查全部通过
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/12/2026
First Seen
Valid until: 12/11/2026
Sources
Related Entities
Related Claims
Unverified本地运行的Gemma 26B在453次评分预测中准确率仅为49.2%,其配对的永远说涨基准准确率为53.4%68% similarUnverified在 2456 个保留 prompt 上的测试中,把采样步数从 20 提到 50,FID 仅从 27.0 改善到 26.6(0.4),而去掉 shift 后 FID 从 27.0 升到 27.3、FD-DINOv2 从 218 升到 22867% similarUnverifiedCaveman是刚上线的新工具,评论数仅6条,54次运行的基准样本规模有限,验证仍属早期66% similarUnverified在 Terminal Bench 2.1 测试中,AutoPrompt Scale 使 OpenCode 在 89 个任务中的失败数从 29 降到 16,多解决 13 题,分数提升 14.61 个百分点64% similarUnverified引导模式下平均端到端准确率从28.6%提升到33.7%,歧义检测F1值从45.3%提升到64.9%64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/914494API
curl https://kongchang.com/api/v1/knowledge/claims/914494MCP
get_claim(id=914494)