Unverified65% confidenceFactTime unknown
千问3 Coder 30B在编程基准测试(如HumanEval、MBPP等)中的表现已接近甚至超过部分早期商业闭源模型
1
Sources
65%
Confidence
Medium-term (~90 days)
Relevance
6/1/2026
First Seen
Valid until: 8/30/2026
Sources
Ollama+OpenCode本地部署AI编程:零成本替代Cursor的完整方案
bilibili计算机-刘经纬教授
Related Entities
Related Claims
UnverifiedQwen3.6 27B在MMLU、HumanEval等主流基准测试中表现接近部分商业模型67% similarUnverified千问3的235B参数MoE旗舰版在多项权威基准测试中接近甚至超越闭源顶级模型67% similarUnverified阿里云Qwen2.5-Coder-32B在2024年底的评测中,在HumanEval、MBPP等主流代码基准上超越GPT-4o66% similarUnverified在27B混合架构、4B稠密模型、36B MoE三类模型上以8k上下文测试,Prefill阶段性能无变化,Decode阶段打补丁后快约1.4%65% similarUnverified测试者评估Codex大概能完成看板上30%的任务63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/22553API
curl https://kongchang.com/api/v1/knowledge/claims/22553MCP
get_claim(id=22553)