待验证50% 置信基准精确时间
在基准测试中,从x-high到Max模式,token使用量暴涨1500%(约15倍)
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/1
首次发现
有效期至:2026/12/30
来源
涉及实体
相关事实
待验证Max级别相比extra high最多多消耗两倍的token,但在各类基准测试中仅带来4%至10%的性能提升72% 相似待验证XHigh 档位推理 Token 消耗可能达到 High 档位的 3-5 倍,但准确率边际提升通常仅有 5-15 个百分点71% 相似待验证在全文筛选阶段,研究人员编写的理由说明能使模型性能提升约15%68% 相似待验证多角色流水线(Self-Refine)的输出质量通常比单次LLM调用提升15%-30%67% 相似待验证在Skatebench测试中,从x-high档到max档,每题推理token从约330暴涨到近5000(超过10倍),得分只提升1%67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/964511API
curl https://kongchang.com/api/v1/knowledge/claims/964511MCP
get_claim(id=964511)