Unverified50% confidenceBenchmarkExact time
在文档摘要基准测试上,Qwen2.5-32B-Instruct和Llama-3.1-70B的量化版本已能达到GPT-4早期版本85%-92%的表现水平
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
8/10/2026
First Seen
Valid until: 11/8/2026
Sources
Related Claims
UnverifiedQwen-7B、LLaMA-2-7B等开源模型经过Agent Tuning后在工具调用准确率上可以达到GPT-3.5甚至接近GPT-4的水平80% similarUnverifiedQwen3-32B的4-bit量化版本在代码生成和中文理解等任务上的表现已接近早期GPT-4水平80% similarUnverified顶级自回归模型如GPT-4o、Claude 3.5在GSM8K上准确率已超过95%,导致基准饱和75% similarUnverifiedQwen2.5-Coder 在 HumanEval 等代码生成基准上展现出接近 GPT-4o 的表现,其7B版本量化后可在普通笔记本上运行74% similarVerifiedMeta发布的Llama 3.1 405B在多项基准测试中已接近GPT-4水平73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/723535API
curl https://kongchang.com/api/v1/knowledge/claims/723535MCP
get_claim(id=723535)