Unverified50% confidenceFactExact time
测试套件共10个,大多数各跑1000题,HumanEval为164题,TruthfulQA为817题
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
Unverified在使用Traework完整模拟产品开发流程的测试中,工具在调研阶段检索了100多个来源,但经人工核验后真正可用的只有约40个,另外60个需要剔除或再查69% similarUnverified运行10次测试置信区间宽度约±31%,100次收窄至±10%,400次进一步收窄至±5%,推荐关键测试用例至少运行20-50次67% similarUnverified在HumanEval测试中Ornith有45道题未作答,作答通过率97%,总得分70%;Qwen有29道题未答,作答通过率98%,总得分80%67% similarUnverified看实验数量要区分'总次数'和'独立主题数':标称100+实验的套装往往是同一原理换配方的重复,真正不同科学原理的独立实验能达到20-30个已属优质,购买前看实验清单目录65% similarUnverified在检验的约 2,000 篇论文中,超过 1,100 篇论文至少有一个关键论断被独立验证,其中266篇被完全复现,632篇通过小规模实验部分复现,约4,000个独立论断得到确认64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/907293API
curl https://kongchang.com/api/v1/knowledge/claims/907293MCP
get_claim(id=907293)