[控场AI]
基准

MBPP

MBPP(Mostly Basic Python Problems)是一个用于评估代码生成能力的Python编程基准测试集,由Google Research发布。该基准包含数百道面向入门至中级难度的Python编程题目,每道题目配有自然语言描述、参考代码解答及测试用例,主要用于衡量大语言模型在理解编程需求并生成正确Python代码方面的能力,是代码生成领域常用的标准评测基准之一。

核心事实

时间轴 (近 90 天)

9月11日

HumanEval和MBPP主要评测单函数级代码生成,对Agent类工具的区分度相对有限

待验证50%
9月11日

HumanEval 和 MBPP 的通过率通常远高于功能级基准,但被批评难以反映生产环境的真实挑战

待验证50%
9月11日

HumanEval 和 MBPP 属于更早期、粒度更细的代码生成基准,主要考察单函数实现

待验证50%
9月9日

当前AI领域广泛使用的benchmark包括代码能力的HumanEval、MBPP,数学推理的GSM8K、MATH,以及综合能力的MMLU等

待验证50%
9月9日

Qwen模型在HumanEval、MBPP等编程基准测试,以及GSM8K等数学推理测试中持续刷新记录,成为开源模型中的性能标杆

待验证50%
9月2日

MBPP包含974道Python入门级编程题

待验证50%
9月2日

现有模型评测体系(如HumanEval、MBPP及各类Arena)主要衡量能力上限,很少将端到端任务完成率纳入评估维度

待验证50%
8月29日

智谱GLM-4系列在HumanEval、MBPP等代码基准测试中达到国际第一梯队水平

待验证50%
8月28日

Grok 3于2025年初发布,在数学推理和部分编程基准(如HumanEval、MBPP)上展示了竞争力

待验证50%
8月20日

HumanEval 和 MBPP 主要衡量模型代码生成能力,而代码审查是本质不同的任务,业界目前缺乏标准化的代码审查基准测试

待验证50%

还有 4 条时间轴事件

全部知识事实 (17)

已验证

DeepSeek在多项代码基准测试(如HumanEval、MBPP、LiveCodeBench)中表现优异,部分指标接近甚至超越GPT-4级别模型

80%
已验证

评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench

75%
已验证

AI 编程领域最受认可的评测基准包括 HumanEval(测试从函数文档字符串生成正确实现)和 SWE-bench(在真实 GitHub 仓库中定位并修复实际 issue)

65%
已验证

MBPP(Mostly Basic Python Problems)由Google发布,包含约1,000个入门级编程问题

65%
待验证

Meta的Llama 3.1系列、DeepSeek-V3、阿里的Qwen2.5-Coder等开源模型在HumanEval、SWE-bench等代码生成基准上与GPT-4级别模型差距显著收窄

60%
待验证

HumanEval和MBPP主要评测单函数级代码生成,对Agent类工具的区分度相对有限

50%
待验证

HumanEval 和 MBPP 的通过率通常远高于功能级基准,但被批评难以反映生产环境的真实挑战

50%
待验证

HumanEval 和 MBPP 属于更早期、粒度更细的代码生成基准,主要考察单函数实现

50%
待验证

当前AI领域广泛使用的benchmark包括代码能力的HumanEval、MBPP,数学推理的GSM8K、MATH,以及综合能力的MMLU等

50%
待验证

Qwen模型在HumanEval、MBPP等编程基准测试,以及GSM8K等数学推理测试中持续刷新记录,成为开源模型中的性能标杆

50%
待验证

MBPP包含974道Python入门级编程题

50%
待验证

现有模型评测体系(如HumanEval、MBPP及各类Arena)主要衡量能力上限,很少将端到端任务完成率纳入评估维度

50%
待验证

智谱GLM-4系列在HumanEval、MBPP等代码基准测试中达到国际第一梯队水平

50%
待验证

HumanEval 和 MBPP 主要衡量模型代码生成能力,而代码审查是本质不同的任务,业界目前缺乏标准化的代码审查基准测试

50%
待验证

代码大语言模型采用HumanEval、MBPP等可执行基准评估,即直接运行生成代码并检验输出是否正确

50%
待验证

HumanEval、MBPP、SWE-bench是AI编程评测领域的行业标准基准测试

50%
待验证

Grok 3于2025年初发布,在数学推理和部分编程基准(如HumanEval、MBPP)上展示了竞争力

50%

来源文章