Benchmark
HumanEval
OpenAI发布的代码生成能力基准测试,用于评估模型根据函数签名和文档字符串生成正确代码的能力
Timeline (last 90 days)
Jun 2
Codex模型的评估通常使用HumanEval和MBPP等编码基准测试
Unverified85%
Jun 2
当前AI模型评测主要依赖标准化基准测试(如MMLU、HumanEval、GSM8K等),但存在数据污染风险和与实际应用脱节的问题
Unverified80%
Jun 1
目前主流LLM评测基准如MMLU、HumanEval、MT-Bench主要关注知识能力和指令遵循能力,对谄媚行为的系统性评估尚未形成行业标准
Unverified85%
Jun 1
代码生成模型在HumanEval等基准测试中的通过率从60%跃升至90%以上(2024-2025年间)
Unverified60%
Jun 1
在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点
Unverified70%
Jun 1
HumanEval等传统代码评测基准通常只要求模型根据函数签名和文档字符串生成独立函数,本质上是受限的代码补全任务
Unverified90%
Jun 1
HumanEval是由OpenAI于2021年发布的代码生成基准测试,包含164个手写的Python编程问题
Verified80%
Jun 1
Mistral Medium 3.5在HumanEval基准测试中通过率为77.6%
Unverified90%
Jun 1
千问3 Coder 30B在编程基准测试(如HumanEval、MBPP等)中的表现已接近甚至超过部分早期商业闭源模型
Unverified65%
Jun 1
DeepSeek在多项代码基准测试(如HumanEval、MBPP、LiveCodeBench)中表现优异,部分指标接近甚至超越GPT-4级别模型
Verified80%
17 more timeline events