待验证50% 置信事实精确时间
GPQA Diamond是测试研究生级别科学推理能力的基准,普通人类表现约35%,顶级闭源模型在60-75%区间
1
来源数
50%
置信度
长期有效
时效性
2026/9/25
首次发现
来源
涉及实体
相关事实
待验证在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,人类领域专家基准线约为65%,随机猜测为25%75% 相似待验证GPQA是2023年推出的研究生级别问答基准,其题目即便借助搜索引擎辅助,非专业人士正确率也仅约30%70% 相似待验证评测覆盖MMLU-Pro、GPQA Diamond、GSM8K、德语MGSM和IFEval五个基准66% 相似待验证在 GPQA-Diamond xhigh 测试中,基座 Qwen3.8-27B 达 88.4% 准确率消耗 6,642 中位 token,Swift 保持 88.3% 准确率但 token 降至 2,77163% 相似待验证4Bit量化下模型的基准测试得分通常能保持原始精度的90%-95%63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/949604API
curl https://kongchang.com/api/v1/knowledge/claims/949604MCP
get_claim(id=949604)