Unverified50% confidenceBenchmarkExact time
大语言模型在GSM8K、MATH等数学基准测试上的得分率从最初不到50%提升至90%以上
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/11/2026
First Seen
Valid until: 12/10/2026
Sources
Related Entities
Related Claims
Unverified在GSM8K小学数学应用题基准上,前沿模型的准确率已超过90%77% similarUnverified自洽性在GSM8K等数学推理基准上能带来5-20个百分点的提升74% similarUnverified在 GSM8K 等数学基准上,PAL 和 PoT 相比纯思维链可将准确率提升 10-20 个百分点71% similarUnverified所有反审查模型变体与基础模型在GSM8K数学推理测试中的差距都在1.2个百分点以内70% similarUnverifiedMATH基准的得分在2023-2024年间从约50%飙升至90%以上,GSM8K上顶级模型已接近满分69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/891779API
curl https://kongchang.com/api/v1/knowledge/claims/891779MCP
get_claim(id=891779)