Unverified50% confidenceBenchmarkExact time
在256K上下文的大海捞针测试中,两款模型表现完全一致,均取得93%的成绩,仅在100%满上下文深度时各有一次失败
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/9/2026
First Seen
Valid until: 10/7/2026
Sources
16G显存实测:Ornith 35B vs Qwen 35B全方位对决
bilibili程序员-智能译站7/7/2026
Related Claims
Unverified在该压缩比下,模型保留了74.2%的top-1%准确率67% similarUnverified在同一复现实验中,ResNet-20测试准确率为90.4%,ResNet-56测试准确率为91.7%,训练准确率分别为97.4%和99.0%67% similarUnverified测试的准确率数据在n=100样本量下误差约为±8-10个百分点(基于95%置信水平的二项分布置信区间)66% similarUnverified记忆测试中保留全部上下文时模型95%的情况能准确找到学生提及的具体细节,而摘要压缩后准确率骤降至32%66% similarUnverified对同一测试用例执行多次调用统计成功比例得到通过率,比二元的通过/失败判断更能反映模型真实表现66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/342893API
curl https://kongchang.com/api/v1/knowledge/claims/342893MCP
get_claim(id=342893)