待验证50% 置信基准精确时间
在Skatebench测试中,从x-high档到max档,每题推理token从约330暴涨到近5000(超过10倍),得分只提升1%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/25
首次发现
有效期至:2026/12/24
来源
涉及实体
相关事实
待验证XHigh 档位推理 Token 消耗可能达到 High 档位的 3-5 倍,但准确率边际提升通常仅有 5-15 个百分点69% 相似待验证消融分析显示片段范式微调在测试集带来+5.29分提升,而用2000检索词替换前4500转录词仅带来+1.55分提升69% 相似待验证Max级别相比extra high最多多消耗两倍的token,但在各类基准测试中仅带来4%至10%的性能提升68% 相似待验证检测项越多单项成本越低,但假阳性率随项目数上升——40+项的大panel常出现多项弱阳性(0.35–0.7 kU/L),临床意义模糊,反而增加不必要的忌口焦虑;无明确症状时选10–20项精准panel优于盲测大panel67% 相似待验证在歧义点的四类行为中,'先搜再问'成功率最高,平均通过率达93.4%,远高于'直接猜'的56.5%,'搜多次再猜'为51.5%67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/948925API
curl https://kongchang.com/api/v1/knowledge/claims/948925MCP
get_claim(id=948925)