待验证50% 置信事实精确时间
MMMU(Massive Multidiscipline Multimodal Understanding)要求模型跨越医学、法律、艺术等30个学科回答需要图文联合推理的题目
1
来源数
50%
置信度
长期有效
时效性
2026/9/29
首次发现
来源
涉及实体
相关事实
已验证MMLU(Massive Multitask Language Understanding)包含57个学科的选择题,用于测试模型的知识广度75% 相似待验证MMLU的生物医学部分主要来源于教材和标准化考试题库,主要考察概念性知识记忆而非数据分析推理能力67% 相似待验证研究者将 LLM 的上下文理解定义为三个环节的能力:从给定上下文中正确提取相关信息、将其整合为连贯的内部表征、并在此基础上推理以产生事实一致且语境扎实的回答61% 相似待验证多智能体辩论的对照实验应设置基线组(单一LLM直接输出)和实验组(多智能体辩论后由裁判模型汇总)59% 相似待验证论文让LLM在目标模型上下文中解读每个变体的文本叙述并分配到最合适类别,用LLM的语义推理能力连接底层流程行为与高层业务目标59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/958370API
curl https://kongchang.com/api/v1/knowledge/claims/958370MCP
get_claim(id=958370)