待验证50% 置信基准精确时间
MATH包含12,500道竞赛数学题按难度分五级,GPQA收录研究生级别谷歌难以直接找到答案的科学问题
1
来源数
50%
置信度
长期有效
时效性
2026/7/10
首次发现
来源
「GPT-5.6」真相揭秘:虚假传闻与第三方充值陷阱辨析
bilibili小小阿白6662026/7/9
相关事实
待验证GPT-5 Codex的网络搜索功能生成的搜索查询质量极差,模型不擅长构造有效的搜索查询57% 相似待验证Google Deep Research在测试中直接遗漏了解说稿的输出,未完成全部任务56% 相似待验证Prisma生成的查询在某些复杂场景下可能不如手写SQL灵活,抽象层会带来学习成本和运行开销55% 相似待验证斯坦福大学研究者测试多个主流模型发现,措辞中性的医疗、法律或安全研究类查询也会因触发关键词匹配而被错误拒绝54% 相似待验证Because LLM training data typically comes from large-scale web scraping and many benchmark questions are publicly available online, benchmark contamination is an almost unavoidable systemic problem54% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/463387API
curl https://kongchang.com/api/v1/knowledge/claims/463387MCP
get_claim(id=463387)