待验证60% 置信基准精确时间
阿里云Qwen2.5-Coder-32B在2024年底的评测中,在HumanEval、MBPP等主流代码基准上超越GPT-4o
2
来源数
60%
置信度
中期 (~90 天)
时效性
2026/7/16
首次发现
有效期至:2026/10/14
来源
相关事实
待验证Qwen2.5-Coder 系列由阿里巴巴通义实验室出品,其32B参数版本在多项指标上超越了GPT-4o82% 相似待验证根据SWE-Bench Verified基准测试,Qwen 2.5 Coder 32B的编码能力评分达到61.7分71% 相似待验证对标 Qwen3.8-27B,Agens Volundr 32B 在 LiveCodeBench v6(+4.2)、HumanEval(+4.3)、AIME 2025(+2.9)、MATH-500(+1.6)领先70% 相似待验证智谱GLM-4系列在HumanEval、MBPP等代码基准测试中达到国际第一梯队水平69% 相似待验证Llama 3.1 405B在MMLU上的得分已接近GPT-4o的水平,Qwen 2.5 72B在数学和代码生成基准上某些指标超越了GPT-4 Turbo69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/531174API
curl https://kongchang.com/api/v1/knowledge/claims/531174MCP
get_claim(id=531174)