HumanEval
OpenAI发布的代码生成能力基准测试,用于评估模型根据函数签名和文档字符串生成正确代码的能力
核心事实
时间轴 (近 90 天)
HumanEval测试集仅包含164个Python编程题,仅测试函数级代码补全
当前AI领域广泛使用的benchmark包括代码能力的HumanEval、MBPP,数学推理的GSM8K、MATH,以及综合能力的MMLU等
Qwen模型在HumanEval、MBPP等编程基准测试,以及GSM8K等数学推理测试中持续刷新记录,成为开源模型中的性能标杆
通用基准衡量的是模型的通用能力上限,而非在特定提示词模板、特定输出格式要求下的实际表现
AdaptiveSpec在GSM8K、MATH-500和HumanEval三大基准上恢复了93%至完全无损的任务准确率
HumanEval基准仅有164道题且多年未更新
Qwen2.5-72B在MMLU、HumanEval等评测中接近GPT-4水平
标准化基准测试(如MMLU、HumanEval、GSM8K)往往无法完全反映AI模型在真实应用场景中的表现
ECI旨在解决传统基准测试(如MMLU、HumanEval等)各自为政、难以横向比较的问题,回答模型能力相当于什么时间节点技术水平的问题
极简模式只保留基本的 shell 和文件编辑功能,适合跑分和测试模型基础能力
还有 40 条时间轴事件
全部知识事实 (20)
HumanEval由OpenAI于2021年提出,考察函数级代码补全
90%已验证HumanEval由OpenAI提出,包含164道Python编程题,主要测试函数级别的代码生成能力
90%已验证Claude 3.5 Sonnet在SWE-bench等代码基准测试中长期领先
80%已验证HumanEval是由OpenAI于2021年发布的代码生成基准测试,包含164个手写的Python编程问题
80%已验证DeepSeek在多项代码基准测试(如HumanEval、MBPP、LiveCodeBench)中表现优异,部分指标接近甚至超越GPT-4级别模型
80%已验证大语言模型通过在数千亿乃至数万亿个词元(Token)的文本数据上进行自监督预训练
80%已验证到2024年中,顶级模型在MMLU上的分数已普遍超过85-90%,该基准的区分度急剧下降
75%已验证评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench
75%已验证标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)
70%已验证HumanEval由OpenAI在2021年发布,包含164个手写的Python编程题
65%已验证基准污染是指测试题目可能已出现在训练数据中,导致高分不能真正代表泛化能力
65%已验证在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内
65%已验证HumanEval基准包含164道编程题,是衡量代码生成能力的主流标准
65%已验证HumanEval由OpenAI自研,专门测试代码生成的功能正确率
65%已验证AI模型基准测试通常在MMLU、HumanEval、GSM8K等标准数据集上评估模型的推理、编码和数学能力
65%已验证HumanEval由OpenAI发布,包含164个手工编写的Python编程问题,以pass@k为核心指标
65%已验证AI 编程领域最受认可的评测基准包括 HumanEval(测试从函数文档字符串生成正确实现)和 SWE-bench(在真实 GitHub 仓库中定位并修复实际 issue)
65%已验证泛化能力的取舍需要通过MMLU、GSM8K、HumanEval等跨领域测试集系统验证
65%已验证HumanEval由OpenAI设计,包含164道Python编程题;GSM8K包含8500道小学数学应用题;MMLU涵盖57个学科领域的选择题
65%已验证Claude 3.5 Sonnet在代码生成基准测试HumanEval中达到了92%的通过率
65%