待验证50% 置信基准精确时间
放射诊断基准RadO 2.0中,16个AI模型最佳得分758,人类专家基线为988.7
1
来源数
50%
置信度
长期有效
时效性
2026/7/23
首次发现
来源
相关事实
待验证TI-RADS(甲状腺影像报告数据系统)分级:1类正常,2类良性(0%恶性风险),3类可能良性(<2%),4类可疑(2-90%,细分4a/4b/4c),5类高度可疑(>90%),4类以上通常建议穿刺,选机构应确认使用此规范分级体系63% 相似待验证在该心脏病预测实验中,逻辑回归模型的AUC达到0.8958% 相似待验证ARC-AGI-2由AI安全研究员François Chollet设计,早期GPT-4在该测试上得分不足10%,人类平均得分约85%58% 相似待验证人类在ARC-AGI测试上的平均得分约为85%,而顶尖AI模型长期徘徊在30%-60%区间58% 相似待验证皮尤的ATP设计效应通常在1.5到2.5之间,使得名义样本量1000的调查有效样本量可能只有400-66757% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/597242API
curl https://kongchang.com/api/v1/knowledge/claims/597242MCP
get_claim(id=597242)