Unverified50% confidenceBenchmarkExact time
在Skatebench测试中,从x-high档到max档,每题推理token从约330暴涨到近5000(超过10倍),得分只提升1%
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/25/2026
First Seen
Valid until: 12/24/2026
Sources
Related Entities
Related Claims
UnverifiedXHigh 档位推理 Token 消耗可能达到 High 档位的 3-5 倍,但准确率边际提升通常仅有 5-15 个百分点69% similarUnverified消融分析显示片段范式微调在测试集带来+5.29分提升,而用2000检索词替换前4500转录词仅带来+1.55分提升69% similarUnverifiedMax级别相比extra high最多多消耗两倍的token,但在各类基准测试中仅带来4%至10%的性能提升68% similarUnverified检测项越多单项成本越低,但假阳性率随项目数上升——40+项的大panel常出现多项弱阳性(0.35–0.7 kU/L),临床意义模糊,反而增加不必要的忌口焦虑;无明确症状时选10–20项精准panel优于盲测大panel67% similarUnverified在歧义点的四类行为中,'先搜再问'成功率最高,平均通过率达93.4%,远高于'直接猜'的56.5%,'搜多次再猜'为51.5%67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/948925API
curl https://kongchang.com/api/v1/knowledge/claims/948925MCP
get_claim(id=948925)