Unverified50% confidenceBenchmarkExact time
最优变体在GSM8K数学推理基准仅下降1.83%,MMLU综合知识基准保持不变
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/20/2026
First Seen
Valid until: 10/18/2026
Sources
Related Claims
Unverified接受率随位置逐级衰减:GSM8K从位置0的0.92下滑至约0.53,MTBench从0.78急跌至0.13,因误差在连续猜测中累积70% similarUnverified一项针对GPT-4的研究显示,对MMLU题目进行语义等价改写后,模型准确率在部分子集上下降超过10个百分点69% similarUnverified自洽性在GSM8K等数学推理基准上能带来5-20个百分点的提升68% similarUnverified在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点68% similarUnverified在GSM8K数学推理基准上,Self-Consistency相比单次贪婪解码可将准确率提升约17个百分点67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/568117API
curl https://kongchang.com/api/v1/knowledge/claims/568117MCP
get_claim(id=568117)