[KongchangAI]
Unverified50% confidenceFactExact time

当前AI领域广泛使用的benchmark包括代码能力的HumanEval、MBPP,数学推理的GSM8K、MATH,以及综合能力的MMLU等

1
Sources
50%
Confidence
Long-term
Relevance
9/9/2026
First Seen

Sources

Related Entities

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/881627
API
curl https://kongchang.com/api/v1/knowledge/claims/881627
MCP
get_claim(id=881627)