Verified90% confidenceFactTime unknown
HumanEval由OpenAI提出,包含164道Python编程题,主要测试函数级别的代码生成能力
19
Sources
90%
Confidence
Long-term
Relevance
5/31/2026
First Seen
Sources
Gemini 3.1 Pro编程实测:跑分第一实战第三,与Claude和GPT真实对比
bilibili程序员阿江-Relakkes
Related Entities
Related Claims
UnverifiedHumanEval由OpenAI设计,包含164道代码补全题目,考察模型将自然语言转化为可运行代码的能力85% similarVerifiedHumanEval由OpenAI设计,包含164道Python编程题;GSM8K包含8500道小学数学应用题;MMLU涵盖57个学科领域的选择题75% similarUnverifiedOpenAI的Evals框架和PromptFlow提供了Prompt的自动化测试能力70% similarUnverified测试使用 OpenCode 作为 AI 编程代理工具,该工具能理解完整项目上下文、自主规划开发步骤、生成多文件代码并根据错误反馈自我修正68% similarUnverifiedOpenAI曾用Codex做内部实验,目标是人类不手写任何代码只负责架构设计,编码全部交给智能体完成68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/9580API
curl https://kongchang.com/api/v1/knowledge/claims/9580MCP
get_claim(id=9580)