Unverified90% confidenceFactTime unknown
HumanEval等传统代码评测基准通常只要求模型根据函数签名和文档字符串生成独立函数,本质上是受限的代码补全任务
1
Sources
90%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
SWE-bench开放评测环境与训练方案:AI编程智能体研发门槛大幅降低
twitterSWEbench
Related Entities
Related Claims
UnverifiedHumanEval测试代码生成能力,要求模型根据函数签名和文档字符串生成正确的Python代码77% similarUnverifiedHumanEval通过让模型根据函数签名和文档字符串生成完整函数实现来衡量编码准确率76% similarUnverifiedHumanEval以代码能否通过单元测试为唯一评判标准75% similarUnverifiedHumanEval 和 MBPP 主要衡量模型代码生成能力,而代码审查是本质不同的任务,业界目前缺乏标准化的代码审查基准测试74% similarUnverified代码生成领域的模型评估如HumanEval、SWE-bench格外强调功能正确性而非流畅度73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/26954API
curl https://kongchang.com/api/v1/knowledge/claims/26954MCP
get_claim(id=26954)