待验证50% 置信事实精确时间
近年出现的高难度评测包括GPQA(研究生级科学问答)、SWE-bench(真实软件工程任务)以及各类Agentic评测
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
待验证GPTZero等检测工具早期大量借助困惑度指标来判断文本来源68% 相似已验证标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)67% 相似待验证业界常用的基准测试还包括GSM8K(数学推理)、GPQA(研究生级别问答)、ARC(科学推理)67% 相似待验证软件工程效能度量经历了从代码行数、功能点分析,到DORA指标,再到SPACE框架的多个演进阶段63% 相似待验证传统软件测试的核心是找Bug,验证功能是否按预期工作,存在明确的对错标准63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/910489API
curl https://kongchang.com/api/v1/knowledge/claims/910489MCP
get_claim(id=910489)