[KongchangAI]
Benchmark

MBPP

MBPP(Mostly Basic Python Problems)是一个用于评估代码生成能力的Python编程基准测试集,由Google Research发布。该基准包含数百道面向入门至中级难度的Python编程题目,每道题目配有自然语言描述、参考代码解答及测试用例,主要用于衡量大语言模型在理解编程需求并生成正确Python代码方面的能力,是代码生成领域常用的标准评测基准之一。

Core Facts

Timeline (last 90 days)

Sep 11

HumanEval和MBPP主要评测单函数级代码生成,对Agent类工具的区分度相对有限

Unverified50%
Sep 11

HumanEval 和 MBPP 的通过率通常远高于功能级基准,但被批评难以反映生产环境的真实挑战

Unverified50%
Sep 11

HumanEval 和 MBPP 属于更早期、粒度更细的代码生成基准,主要考察单函数实现

Unverified50%
Sep 9

当前AI领域广泛使用的benchmark包括代码能力的HumanEval、MBPP,数学推理的GSM8K、MATH,以及综合能力的MMLU等

Unverified50%
Sep 9

Qwen模型在HumanEval、MBPP等编程基准测试,以及GSM8K等数学推理测试中持续刷新记录,成为开源模型中的性能标杆

Unverified50%
Sep 2

MBPP包含974道Python入门级编程题

Unverified50%
Sep 2

现有模型评测体系(如HumanEval、MBPP及各类Arena)主要衡量能力上限,很少将端到端任务完成率纳入评估维度

Unverified50%
Aug 29

智谱GLM-4系列在HumanEval、MBPP等代码基准测试中达到国际第一梯队水平

Unverified50%
Aug 28

Grok 3于2025年初发布,在数学推理和部分编程基准(如HumanEval、MBPP)上展示了竞争力

Unverified50%
Aug 20

HumanEval 和 MBPP 主要衡量模型代码生成能力,而代码审查是本质不同的任务,业界目前缺乏标准化的代码审查基准测试

Unverified50%

4 more timeline events

All Facts (17)

Verified

DeepSeek在多项代码基准测试(如HumanEval、MBPP、LiveCodeBench)中表现优异,部分指标接近甚至超越GPT-4级别模型

80%
Verified

评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench

75%
Verified

AI 编程领域最受认可的评测基准包括 HumanEval(测试从函数文档字符串生成正确实现)和 SWE-bench(在真实 GitHub 仓库中定位并修复实际 issue)

65%
Verified

MBPP(Mostly Basic Python Problems)由Google发布,包含约1,000个入门级编程问题

65%
Unverified

Meta的Llama 3.1系列、DeepSeek-V3、阿里的Qwen2.5-Coder等开源模型在HumanEval、SWE-bench等代码生成基准上与GPT-4级别模型差距显著收窄

60%
Unverified

HumanEval和MBPP主要评测单函数级代码生成,对Agent类工具的区分度相对有限

50%
Unverified

HumanEval 和 MBPP 的通过率通常远高于功能级基准,但被批评难以反映生产环境的真实挑战

50%
Unverified

HumanEval 和 MBPP 属于更早期、粒度更细的代码生成基准,主要考察单函数实现

50%
Unverified

当前AI领域广泛使用的benchmark包括代码能力的HumanEval、MBPP,数学推理的GSM8K、MATH,以及综合能力的MMLU等

50%
Unverified

Qwen模型在HumanEval、MBPP等编程基准测试,以及GSM8K等数学推理测试中持续刷新记录,成为开源模型中的性能标杆

50%
Unverified

MBPP包含974道Python入门级编程题

50%
Unverified

现有模型评测体系(如HumanEval、MBPP及各类Arena)主要衡量能力上限,很少将端到端任务完成率纳入评估维度

50%
Unverified

智谱GLM-4系列在HumanEval、MBPP等代码基准测试中达到国际第一梯队水平

50%
Unverified

HumanEval 和 MBPP 主要衡量模型代码生成能力,而代码审查是本质不同的任务,业界目前缺乏标准化的代码审查基准测试

50%
Unverified

代码大语言模型采用HumanEval、MBPP等可执行基准评估,即直接运行生成代码并检验输出是否正确

50%
Unverified

HumanEval、MBPP、SWE-bench是AI编程评测领域的行业标准基准测试

50%
Unverified

Grok 3于2025年初发布,在数学推理和部分编程基准(如HumanEval、MBPP)上展示了竞争力

50%

Source Articles