Unverified50% confidenceFactExact time
许多经典基准已趋于饱和(如HellaSwag上多个模型得分超过95%),业界正在开发更具区分度的新基准如GPQA、SWE-bench、LiveBench
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/3/2026
First Seen
Valid until: 12/2/2026
Sources
Related Entities
Related Claims
Unverified当前顶级模型的单步准确率约在90%至95%之间61% similarUnverified主流开源模型在消费级GPU上的推理速度通常在20-80 token/s之间61% similarUnverified社区在MMLU区分度下降后转向更难的评测基准,如GPQA(研究生级别专业问题集)、SWE-bench、MATH-500、LiveBench61% similarUnverified传统基准如MMLU、HumanEval因训练数据污染出现基准饱和,GPT-4发布时MMLU得分约86%,如今多个开源模型已突破90%59% similarUnverified通过Hybrid Search、Reranking、HyDE等优化技术组合,RAG系统准确率可从基础实现的60%级别提升至90%以上58% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/848832API
curl https://kongchang.com/api/v1/knowledge/claims/848832MCP
get_claim(id=848832)