Unverified50% confidenceBenchmarkExact time
长上下文测试中普通模式最终完成到11.4万token,MTP2完成到8.1万token,到9.8万token时未能完成
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
10/5/2026
First Seen
Valid until: 1/3/2027
Sources
Related Entities
Related Claims
Unverified测试损失与计算量之间的幂律指数约为0.05,意味着计算量每增加10倍,模型性能提升约12%67% similarUnverified运行10次测试置信区间宽度约±31%,100次收窄至±10%,400次进一步收窄至±5%,推荐关键测试用例至少运行20-50次64% similarUnverifiedOS World的82项测试并非在完全相同条件下运行,一半任务沿用原基线分数,投入资源和尝试次数也不同,因此7个百分点提升不能全归功于记忆64% similarUnverified在基准测试中,从x-high到Max模式,token使用量暴涨1500%(约15倍)64% similarUnverified据官方性能测试,在一个11.8万节点的图谱上进行搜索,响应时间从24毫秒降到了0.004毫秒,提速约6000倍63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/978646API
curl https://kongchang.com/api/v1/knowledge/claims/978646MCP
get_claim(id=978646)