待验证50% 置信基准精确时间
Qwen2.5-27B是阿里云通义实验室发布的270亿参数开源模型,在MMLU、HumanEval、GSM8K等基准上接近GPT-4早期版本水平
1
来源数
50%
置信度
长期有效
时效性
2026/7/17
首次发现
来源
相关事实
待验证Qwen-7B、LLaMA-2-7B等开源模型经过Agent Tuning后在工具调用准确率上可以达到GPT-3.5甚至接近GPT-4的水平77% 相似待验证Llama 3.1(Meta)、Mistral 7B/8x7B、Qwen2.5-Coder(阿里云)等开源模型在代码和配置生成任务上达到接近 GPT-4 的实用水平76% 相似待验证Meta的Llama 3.1系列、DeepSeek-V3、阿里的Qwen2.5-Coder等开源模型在HumanEval、SWE-bench等代码生成基准上与GPT-4级别模型差距显著收窄72% 相似待验证在 MMLU、HumanEval、GSM8K 等主流基准上,开源模型已达到 GPT-4 早期版本 85-95% 的水平72% 相似已验证目前主流的Agent底座模型包括GPT-4o、Claude 3.5 Sonnet、Gemini 1.5 Pro等闭源模型,以及Llama 3、Qwen2.5、DeepSeek等开源模型71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/538898API
curl https://kongchang.com/api/v1/knowledge/claims/538898MCP
get_claim(id=538898)