待验证50% 置信基准精确时间
对标 Qwen3.8-27B,Agens Volundr 32B 在 LiveCodeBench v6(+4.2)、HumanEval(+4.3)、AIME 2025(+2.9)、MATH-500(+1.6)领先
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/5
首次发现
有效期至:2027/1/3
来源
涉及实体
相关事实
待验证阿里云Qwen2.5-Coder-32B在2024年底的评测中,在HumanEval、MBPP等主流代码基准上超越GPT-4o70% 相似待验证官方基准数据显示新版 Qwen3 27B 智能体解码从 13.3 提升到 42.2,软件工程类任务从 49.3 提升到 79,前沿智能体任务从 10.6 提升到 2067% 相似待验证Qwen2.5-Coder和DeepSeek-Coder-V2在HumanEval、MBPP等代码基准测试中的表现已非常接近Claude 3.5 Sonnet等顶级闭源模型65% 相似待验证数据集涵盖四个开源权重模型Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini和Qwen2.5-1.5B,各30条轨迹65% 相似待验证Reddit社区的大规模基准测试基于BeeLlama.cpp v0.4.0,在Qwen 3.6 27B和Gemma 4 31B两款模型上累计跑了413组配置对比,其中Qwen模型238组、Gemma模型175组64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/977117API
curl https://kongchang.com/api/v1/knowledge/claims/977117MCP
get_claim(id=977117)