MBPP(Mostly Basic Python Problems)是一个用于评估代码生成能力的Python编程基准测试集,由Google Research发布。该基准包含数百道面向入门至中级难度的Python编程题目,每道题目配有自然语言描述、参考代码解答及测试用例,主要用于衡量大语言模型在理解编程需求并生成正确Python代码方面的能力,是代码生成领域常用的标准评测基准之一。
Codex模型的评估通常使用HumanEval和MBPP等编码基准测试
MBPP(Mostly Basic Python Problems)由Google发布,包含约1,000个入门级编程问题
千问3 Coder 30B在编程基准测试(如HumanEval、MBPP等)中的表现已接近甚至超过部分早期商业闭源模型
DeepSeek在多项代码基准测试(如HumanEval、MBPP、LiveCodeBench)中表现优异,部分指标接近甚至超越GPT-4级别模型
OmniMerge V4在MBPP代码测试中达到73.4%,相比原版Q6K量化的56.2%提升了15.8个百分点
专用编程模型的训练数据来源包括GitHub开源代码、编程竞赛题解、技术文档、代码审查记录等,并针对HumanEval、MBPP、SWE-bench等基准测试进行优化
评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench
GLM5.1等国产模型在HumanEval、MBPP等标准编程基准测试上的得分已接近甚至超越部分国际竞品