Unverified50% confidenceBenchmarkExact time
放射诊断基准RadO 2.0中,16个AI模型最佳得分758,人类专家基线为988.7
1
Sources
50%
Confidence
Long-term
Relevance
7/23/2026
First Seen
Sources
Related Claims
UnverifiedTI-RADS(甲状腺影像报告数据系统)分级:1类正常,2类良性(0%恶性风险),3类可能良性(<2%),4类可疑(2-90%,细分4a/4b/4c),5类高度可疑(>90%),4类以上通常建议穿刺,选机构应确认使用此规范分级体系63% similarUnverified在该心脏病预测实验中,逻辑回归模型的AUC达到0.8958% similarUnverifiedARC-AGI-2由AI安全研究员François Chollet设计,早期GPT-4在该测试上得分不足10%,人类平均得分约85%58% similarUnverified人类在ARC-AGI测试上的平均得分约为85%,而顶尖AI模型长期徘徊在30%-60%区间58% similarUnverified皮尤的ATP设计效应通常在1.5到2.5之间,使得名义样本量1000的调查有效样本量可能只有400-66757% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/597242API
curl https://kongchang.com/api/v1/knowledge/claims/597242MCP
get_claim(id=597242)