待验证50% 置信事实精确时间
测试套件共10个,大多数各跑1000题,HumanEval为164题,TruthfulQA为817题
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证在使用Traework完整模拟产品开发流程的测试中,工具在调研阶段检索了100多个来源,但经人工核验后真正可用的只有约40个,另外60个需要剔除或再查69% 相似待验证运行10次测试置信区间宽度约±31%,100次收窄至±10%,400次进一步收窄至±5%,推荐关键测试用例至少运行20-50次67% 相似待验证在HumanEval测试中Ornith有45道题未作答,作答通过率97%,总得分70%;Qwen有29道题未答,作答通过率98%,总得分80%67% 相似待验证看实验数量要区分'总次数'和'独立主题数':标称100+实验的套装往往是同一原理换配方的重复,真正不同科学原理的独立实验能达到20-30个已属优质,购买前看实验清单目录65% 相似待验证在检验的约 2,000 篇论文中,超过 1,100 篇论文至少有一个关键论断被独立验证,其中266篇被完全复现,632篇通过小规模实验部分复现,约4,000个独立论断得到确认64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/907293API
curl https://kongchang.com/api/v1/knowledge/claims/907293MCP
get_claim(id=907293)