基准
MCP Atlas
MCP Atlas 是一个用于评估大型语言模型在 Model Context Protocol(MCP)相关任务上能力的基准测试。它通过设计一系列标准化测试场景,衡量模型对 MCP 协议的理解、工具调用及上下文管理等核心能力,为不同模型在 MCP 生态中的性能对比提供客观、可重复的评估框架。
时间轴 (近 90 天)
9月11日
在MCP Atlas基准上Glimmer得75.5分,Gemma 4得54.2,Qwen 3.6得62.5
待验证50%
8月15日
Muse Glimmer在MCP Atlas工具调用基准得分75.5,领先Qwen 3.6;智能体搜索任务74.6分;数学推理AIME 94.7分
待验证60%