Unverified50% confidenceBenchmarkExact time
不同AI模型在不同任务上的表现差异已被SWE-bench、HumanEval、MBPP等基准测试证实
1
Sources
50%
Confidence
Long-term
Relevance
8/20/2026
First Seen
Sources
Related Claims
Unverified编程能力的评估通常参考HumanEval、MBPP、SWE-bench等标准化基准测试,但实际工程场景表现与基准测试结果存在差异76% similarUnverifiedMMLU、HumanEval、MATH等基准测试用于量化模型能力差异75% similarUnverifiedHumanEval、MBPP、SWE-bench是AI编程评测领域的行业标准基准测试72% similarUnverifiedAI模型基准测试通常在MMLU、HumanEval、GSM8K等标准数据集上评估模型的推理、编码和数学能力71% similarUnverified标准化AI基准测试(如HumanEval、SWE-bench)存在基准过拟合的失真问题70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/778774API
curl https://kongchang.com/api/v1/knowledge/claims/778774MCP
get_claim(id=778774)