待验证50% 置信基准精确时间
在HumanEval测试中Ornith有45道题未作答,作答通过率97%,总得分70%;Qwen有29道题未答,作答通过率98%,总得分80%
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/9
首次发现
有效期至:2026/10/7
来源
16G显存实测:Ornith 35B vs Qwen 35B全方位对决
bilibili程序员-智能译站2026/7/7
相关事实
待验证测评题量与信度存在权衡:低于30题的『快测』因抽样不足信度偏低,但200题以上的专业量表易产生答题疲劳导致后半段随意作答,60-120题是兼顾信度与完成质量的区间70% 相似待验证题量并非越多越好:低于60题的测评难以覆盖多维度、信度不足;但超过300题会因答题疲劳导致后半段数据质量下降。个人自测选100-150题、20分钟内完成的版本较为均衡69% 相似待验证测试的准确率数据在n=100样本量下误差约为±8-10个百分点(基于95%置信水平的二项分布置信区间)66% 相似待验证在歧义点的四类行为中,'先搜再问'成功率最高,平均通过率达93.4%,远高于'直接猜'的56.5%,'搜多次再猜'为51.5%65% 相似待验证CVE-Zero 测试的样本量小(n=10),作者标注结果为方向性64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/342895API
curl https://kongchang.com/api/v1/knowledge/claims/342895MCP
get_claim(id=342895)