待验证50% 置信事实精确时间
许多经典基准已趋于饱和(如HellaSwag上多个模型得分超过95%),业界正在开发更具区分度的新基准如GPQA、SWE-bench、LiveBench
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/3
首次发现
有效期至:2026/12/2
来源
涉及实体
相关事实
待验证当前顶级模型的单步准确率约在90%至95%之间61% 相似待验证主流开源模型在消费级GPU上的推理速度通常在20-80 token/s之间61% 相似待验证社区在MMLU区分度下降后转向更难的评测基准,如GPQA(研究生级别专业问题集)、SWE-bench、MATH-500、LiveBench61% 相似待验证传统基准如MMLU、HumanEval因训练数据污染出现基准饱和,GPT-4发布时MMLU得分约86%,如今多个开源模型已突破90%59% 相似待验证通过Hybrid Search、Reranking、HyDE等优化技术组合,RAG系统准确率可从基础实现的60%级别提升至90%以上58% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/848832API
curl https://kongchang.com/api/v1/knowledge/claims/848832MCP
get_claim(id=848832)