Unverified50% confidenceFactExact time
HumanEval以代码能否通过单元测试为唯一评判标准
1
Sources
50%
Confidence
Long-term
Relevance
7/10/2026
First Seen
Sources
LLM安全基准测试:现状、挑战与实践指南
hackernewshackernews7/6/2026
Related Claims
UnverifiedHumanEval等传统代码评测基准通常只要求模型根据函数签名和文档字符串生成独立函数,本质上是受限的代码补全任务75% similarUnverifiedHumanEval测试代码生成能力,要求模型根据函数签名和文档字符串生成正确的Python代码70% similarUnverifiedHumanEval由OpenAI自研,专门测试代码生成的功能正确率69% similarUnverifiedCodex模型的评估通常使用HumanEval和MBPP等编码基准测试68% similarUnverifiedHumanEval专注代码生成能力,以164道编程题检验模型的逻辑推理与代码正确性67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/429416API
curl https://kongchang.com/api/v1/knowledge/claims/429416MCP
get_claim(id=429416)