待验证50% 置信基准精确时间
Qwen2.5-72B在MMLU、HumanEval等评测中接近GPT-4水平
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/6
首次发现
有效期至:2026/12/5
来源
涉及实体
相关事实
待验证Qwen2.5-27B是阿里云通义实验室发布的270亿参数开源模型,在MMLU、HumanEval、GSM8K等基准上接近GPT-4早期版本水平76% 相似待验证在文档摘要基准测试上,Qwen2.5-32B-Instruct和Llama-3.1-70B的量化版本已能达到GPT-4早期版本85%-92%的表现水平76% 相似待验证在 MMLU、HumanEval、GSM8K 等主流基准上,开源模型已达到 GPT-4 早期版本 85-95% 的水平75% 相似待验证Qwen2.5-Coder 在 HumanEval 等代码生成基准上展现出接近 GPT-4o 的表现,其7B版本量化后可在普通笔记本上运行75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/864374API
curl https://kongchang.com/api/v1/knowledge/claims/864374MCP
get_claim(id=864374)