Unverified60% confidenceBenchmarkExact time
阿里云Qwen2.5-Coder-32B在2024年底的评测中,在HumanEval、MBPP等主流代码基准上超越GPT-4o
2
Sources
60%
Confidence
Medium-term (~90 days)
Relevance
7/16/2026
First Seen
Valid until: 10/14/2026
Sources
Related Claims
UnverifiedQwen2.5-Coder 系列由阿里巴巴通义实验室出品,其32B参数版本在多项指标上超越了GPT-4o82% similarUnverifiedQwen3.5在HLE博士级综合题评测中得分28.7,而GPT-5.2为35.566% similarUnverified千问3 Coder 30B在编程基准测试(如HumanEval、MBPP等)中的表现已接近甚至超过部分早期商业闭源模型66% similarUnverifiedCodex于2021年发布时在HumanEval基准上达到28.8%的pass@1得分,而GPT-4在同一基准上已超过67%63% similarUnverifiedClaude Opus 4.8在AI Coding基准测试中表现超越GPT-5.563% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/531174API
curl https://kongchang.com/api/v1/knowledge/claims/531174MCP
get_claim(id=531174)