待验证50% 置信事实精确时间
HumanEval和MBPP主要评测单函数级代码生成,对Agent类工具的区分度相对有限
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证HumanEval 和 MBPP 主要衡量模型代码生成能力,而代码审查是本质不同的任务,业界目前缺乏标准化的代码审查基准测试79% 相似待验证传统代码评测基准(如HumanEval、MBPP)主要测试模型在孤立函数级别的生成准确率76% 相似待验证HumanEval等传统代码评测基准通常只要求模型根据函数签名和文档字符串生成独立函数,本质上是受限的代码补全任务76% 相似待验证HumanEval、MBPP、SWE-bench是专门针对代码生成的标准评测集75% 相似待验证当前主流基准测试体系如HumanEval、MBPP等代码评估集往往关注平均性能,对分布式的场景特定退化现象敏感度不足72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/907388API
curl https://kongchang.com/api/v1/knowledge/claims/907388MCP
get_claim(id=907388)