MBPP
MBPP(Mostly Basic Python Problems)是一个用于评估代码生成能力的Python编程基准测试集,由Google Research发布。该基准包含数百道面向入门至中级难度的Python编程题目,每道题目配有自然语言描述、参考代码解答及测试用例,主要用于衡量大语言模型在理解编程需求并生成正确Python代码方面的能力,是代码生成领域常用的标准评测基准之一。
核心事实
时间轴 (近 90 天)
HumanEval和MBPP主要评测单函数级代码生成,对Agent类工具的区分度相对有限
HumanEval 和 MBPP 的通过率通常远高于功能级基准,但被批评难以反映生产环境的真实挑战
HumanEval 和 MBPP 属于更早期、粒度更细的代码生成基准,主要考察单函数实现
当前AI领域广泛使用的benchmark包括代码能力的HumanEval、MBPP,数学推理的GSM8K、MATH,以及综合能力的MMLU等
Qwen模型在HumanEval、MBPP等编程基准测试,以及GSM8K等数学推理测试中持续刷新记录,成为开源模型中的性能标杆
MBPP包含974道Python入门级编程题
现有模型评测体系(如HumanEval、MBPP及各类Arena)主要衡量能力上限,很少将端到端任务完成率纳入评估维度
智谱GLM-4系列在HumanEval、MBPP等代码基准测试中达到国际第一梯队水平
Grok 3于2025年初发布,在数学推理和部分编程基准(如HumanEval、MBPP)上展示了竞争力
HumanEval 和 MBPP 主要衡量模型代码生成能力,而代码审查是本质不同的任务,业界目前缺乏标准化的代码审查基准测试
还有 4 条时间轴事件
全部知识事实 (17)
DeepSeek在多项代码基准测试(如HumanEval、MBPP、LiveCodeBench)中表现优异,部分指标接近甚至超越GPT-4级别模型
80%已验证评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench
75%已验证AI 编程领域最受认可的评测基准包括 HumanEval(测试从函数文档字符串生成正确实现)和 SWE-bench(在真实 GitHub 仓库中定位并修复实际 issue)
65%已验证MBPP(Mostly Basic Python Problems)由Google发布,包含约1,000个入门级编程问题
65%待验证Meta的Llama 3.1系列、DeepSeek-V3、阿里的Qwen2.5-Coder等开源模型在HumanEval、SWE-bench等代码生成基准上与GPT-4级别模型差距显著收窄
60%待验证HumanEval和MBPP主要评测单函数级代码生成,对Agent类工具的区分度相对有限
50%待验证HumanEval 和 MBPP 的通过率通常远高于功能级基准,但被批评难以反映生产环境的真实挑战
50%待验证HumanEval 和 MBPP 属于更早期、粒度更细的代码生成基准,主要考察单函数实现
50%待验证当前AI领域广泛使用的benchmark包括代码能力的HumanEval、MBPP,数学推理的GSM8K、MATH,以及综合能力的MMLU等
50%待验证Qwen模型在HumanEval、MBPP等编程基准测试,以及GSM8K等数学推理测试中持续刷新记录,成为开源模型中的性能标杆
50%待验证MBPP包含974道Python入门级编程题
50%待验证现有模型评测体系(如HumanEval、MBPP及各类Arena)主要衡量能力上限,很少将端到端任务完成率纳入评估维度
50%待验证智谱GLM-4系列在HumanEval、MBPP等代码基准测试中达到国际第一梯队水平
50%待验证HumanEval 和 MBPP 主要衡量模型代码生成能力,而代码审查是本质不同的任务,业界目前缺乏标准化的代码审查基准测试
50%待验证代码大语言模型采用HumanEval、MBPP等可执行基准评估,即直接运行生成代码并检验输出是否正确
50%待验证HumanEval、MBPP、SWE-bench是AI编程评测领域的行业标准基准测试
50%待验证Grok 3于2025年初发布,在数学推理和部分编程基准(如HumanEval、MBPP)上展示了竞争力
50%