Unverified50% confidenceFactExact time
传统代码评测基准(如HumanEval、MBPP)主要测试模型在孤立函数级别的生成准确率
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
Devin接入Kimi K2.7与GLM 5.2,双模型限时免费不消耗配额
rss6/24/2026
Related Claims
Unverified当前主流基准测试体系如HumanEval、MBPP等代码评估集往往关注平均性能,对分布式的场景特定退化现象敏感度不足82% similarUnverified代码大语言模型采用HumanEval、MBPP等可执行基准评估,即直接运行生成代码并检验输出是否正确79% similarUnverifiedCodex模型的评估通常使用HumanEval和MBPP等编码基准测试77% similarUnverified编程能力的评估通常参考HumanEval、MBPP、SWE-bench等标准化基准测试,但实际工程场景表现与基准测试结果存在差异77% similarUnverifiedHumanEval 和 MBPP 主要衡量模型代码生成能力,而代码审查是本质不同的任务,业界目前缺乏标准化的代码审查基准测试77% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/115218API
curl https://kongchang.com/api/v1/knowledge/claims/115218MCP
get_claim(id=115218)