Unverified50% confidenceFactExact time
近年出现的高难度评测包括GPQA(研究生级科学问答)、SWE-bench(真实软件工程任务)以及各类Agentic评测
1
Sources
50%
Confidence
Long-term
Relevance
9/12/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedGPTZero等检测工具早期大量借助困惑度指标来判断文本来源68% similarVerified标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)67% similarUnverified业界常用的基准测试还包括GSM8K(数学推理)、GPQA(研究生级别问答)、ARC(科学推理)67% similarUnverified软件工程效能度量经历了从代码行数、功能点分析,到DORA指标,再到SPACE框架的多个演进阶段63% similarUnverified传统软件测试的核心是找Bug,验证功能是否按预期工作,存在明确的对错标准63% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/910489API
curl https://kongchang.com/api/v1/knowledge/claims/910489MCP
get_claim(id=910489)