OpenAI发布的代码生成能力基准测试,用于评估模型根据函数签名和文档字符串生成正确代码的能力
相较于 HumanEval 等仅考察单函数代码生成的基准,SWE-bench 更强调跨文件理解和多步骤规划
anypick支持按价格、延迟、基准测试分数(如MMLU、HumanEval)和能力维度(如函数调用、视觉输入、长上下文)过滤模型
作者采用GPT-3论文中的13-gram精确匹配阈值,在CodeAlpaca中发现了1644条泄露HumanEval测试逻辑的序列
EmsyAI使用230万参数的LoRA适配器在CodeAlpaca数据集上做指令微调,在HumanEval代码基准测试中得分为0.0%
学术界已有多项研究表明,在MMLU、HumanEval等主流基准上得分领先的模型,在同等难度的新颖题目上往往表现大幅下滑
过去几年大模型能力评估多集中在MMLU、GSM8K、HumanEval等学术型基准上
HumanEval和MBPP主要评测单函数级代码生成,对Agent类工具的区分度相对有限
测试套件共10个,大多数各跑1000题,HumanEval为164题,TruthfulQA为817题
在代码生成任务HumanEval上,8bit以92.7%明显高于OQ4E的89.6%
HumanEval 和 MBPP 属于更早期、粒度更细的代码生成基准,主要考察单函数实现
40 more timeline events
HumanEval由OpenAI于2021年提出,考察函数级代码补全
90%VerifiedHumanEval由OpenAI提出,包含164道Python编程题,主要测试函数级别的代码生成能力
90%VerifiedClaude 3.5 Sonnet在SWE-bench等代码基准测试中长期领先
80%VerifiedHumanEval是由OpenAI于2021年发布的代码生成基准测试,包含164个手写的Python编程问题
80%VerifiedDeepSeek在多项代码基准测试(如HumanEval、MBPP、LiveCodeBench)中表现优异,部分指标接近甚至超越GPT-4级别模型
80%Verified大语言模型通过在数千亿乃至数万亿个词元(Token)的文本数据上进行自监督预训练
80%Verified到2024年中,顶级模型在MMLU上的分数已普遍超过85-90%,该基准的区分度急剧下降
75%Verified评估编程大模型的主流基准包括HumanEval、MBPP、SWE-bench和LiveCodeBench
75%Verified标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)
70%VerifiedHumanEval由OpenAI在2021年发布,包含164个手写的Python编程题
65%Verified基准污染是指测试题目可能已出现在训练数据中,导致高分不能真正代表泛化能力
65%Verified在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内
65%VerifiedHumanEval基准包含164道编程题,是衡量代码生成能力的主流标准
65%VerifiedHumanEval由OpenAI自研,专门测试代码生成的功能正确率
65%VerifiedAI模型基准测试通常在MMLU、HumanEval、GSM8K等标准数据集上评估模型的推理、编码和数学能力
65%VerifiedHumanEval由OpenAI发布,包含164个手工编写的Python编程问题,以pass@k为核心指标
65%VerifiedAI 编程领域最受认可的评测基准包括 HumanEval(测试从函数文档字符串生成正确实现)和 SWE-bench(在真实 GitHub 仓库中定位并修复实际 issue)
65%Verified泛化能力的取舍需要通过MMLU、GSM8K、HumanEval等跨领域测试集系统验证
65%VerifiedHumanEval由OpenAI设计,包含164道Python编程题;GSM8K包含8500道小学数学应用题;MMLU涵盖57个学科领域的选择题
65%VerifiedClaude 3.5 Sonnet在代码生成基准测试HumanEval中达到了92%的通过率
65%