Unverified50% confidenceFactExact time
DeepSpec配套九个评测基准,涵盖数学推理(GSM8K、MATH-500)、代码生成(HumanEval、MBPP、LiveCodeBench)和通用对话(MT-Bench、Alpaca、Arena-Hard v2)
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/25/2026
First Seen
Valid until: 10/23/2026
Sources
Related Claims
UnverifiedDeepSpec集成三大主流Draft Model算法、九个Hugging Face预训练Checkpoint和九个评测基准75% similarVerifiedDeepSeek在多项代码基准测试(如HumanEval、MBPP、LiveCodeBench)中表现优异,部分指标接近甚至超越GPT-4级别模型74% similarUnverifiedDeepSeek-Coder-V2 在 HumanEval 等代码评测榜上长期位居前列73% similarUnverifiedDeepSeek Coder以DeepSeek Math为底层基础,DeepSeek Math在MATH、GSM8K等数学基准上表现优异72% similarUnverifiedDeepSeek开源了推理加速工具包DSpec(亦称DeepSpec),内置其推测性解码技术(DSPI/MTP系列),包含模型代码、训练脚本和评估工具的完整GitHub仓库72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/615365API
curl https://kongchang.com/api/v1/knowledge/claims/615365MCP
get_claim(id=615365)