Unverified50% confidenceBenchmarkExact time
所有反审查模型变体与基础模型在GSM8K数学推理测试中的差距都在1.2个百分点以内
1
Sources
50%
Confidence
Short-term (~14 days)
Relevance
9/7/2026
First Seen
Valid until: 9/21/2026
Sources
Related Entities
Related Claims
Unverified最优变体在GSM8K数学推理基准仅下降1.83%,MMLU综合知识基准保持不变73% similarVerified在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点68% similarUnverified研究表明,即使在 GSM8K 或 MATH 数据集上接近满分的模型,面对稍作变形或需要跨领域组合的问题时性能下降可达30-50个百分点67% similarUnverified自洽性在GSM8K等数学推理基准上能带来5-20个百分点的提升67% similarUnverifiedGLM5.2的推理速度明显慢于同级别模型,是其最大短板64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/871881API
curl https://kongchang.com/api/v1/knowledge/claims/871881MCP
get_claim(id=871881)