待验证50% 置信事实精确时间
MMLU曾是衡量大语言模型知识水平的黄金标准,在ChatGPT问世年代几乎是每份模型发布报告的必备指标
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
待验证MMLU的生物医学部分主要来源于教材和标准化考试题库,主要考察概念性知识记忆而非数据分析推理能力71% 相似待验证MMLU(Massive Multitask Language Understanding)包含57个学科的选择题,用于测试模型的知识广度70% 相似待验证过去几年大模型能力评估多集中在MMLU、GSM8K、HumanEval等学术型基准上67% 相似待验证现代基于LLM的DST系统相较于早期基于规则或统计的方法,核心优势在于处理语义等价的多样化表达62% 相似待验证前沿模型的认定更多依赖于能力评估基准(如MMLU、HumanEval、MATH)的综合表现,而非单纯参数规模61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/910485API
curl https://kongchang.com/api/v1/knowledge/claims/910485MCP
get_claim(id=910485)