Unverified50% confidenceBenchmarkExact time
代码大语言模型采用HumanEval、MBPP等可执行基准评估,即直接运行生成代码并检验输出是否正确
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
惠普携手OpenAI达成Frontier战略合作,三大方向全面落地AI
rss6/28/2026
Related Claims
UnverifiedCodex模型的评估通常使用HumanEval和MBPP等编码基准测试79% similarUnverified传统代码评测基准(如HumanEval、MBPP)主要测试模型在孤立函数级别的生成准确率79% similarUnverifiedHumanEval 和 MBPP 主要衡量模型代码生成能力,而代码审查是本质不同的任务,业界目前缺乏标准化的代码审查基准测试78% similarVerified评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench78% similarUnverifiedHumanEval测试代码生成能力,要求模型根据函数签名和文档字符串生成正确的Python代码77% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/112609API
curl https://kongchang.com/api/v1/knowledge/claims/112609MCP
get_claim(id=112609)