Unverified50% confidenceBenchmarkExact time
一项针对GPT-4的研究显示,对MMLU题目进行语义等价改写后,模型准确率在部分子集上下降超过10个百分点
1
Sources
50%
Confidence
Long-term
Relevance
7/5/2026
First Seen
Sources
GeneBench-Pro:基因组学AI评测基准,科研能力新标尺
rss6/30/2026
Related Claims
Unverified斯坦福大学2023年研究表明,GPT-4V等多模态模型解析嵌套条件逻辑流程图时,准确率比等效文字描述低约15-25个百分点79% similarUnverified2023年斯坦福大学研究实验证明,当关键信息被放置于输入文档中间位置时,GPT-4的正确召回率相比首尾位置下降约20-30%75% similarUnverifiedGPT-5.4相对于GPT-5.2,单独声明出错的概率降低了33%,整个回复包含任何错误的概率降低了18%74% similarUnverified大模型推理时实际GPU利用率往往不足10%73% similarUnverified部分模型在MMLU上的得分已超越人类平均水平90%,导致其区分度急剧下降73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/112194API
curl https://kongchang.com/api/v1/knowledge/claims/112194MCP
get_claim(id=112194)