待验证50% 置信基准精确时间
在 gpt-oss-120B 上,Asch 从众实验盲测条件下从众率为 0%,而范式被明确命名时从众率升至 83.3%
1
来源数
50%
置信度
长期有效
时效性
2026/9/22
首次发现
来源
涉及实体
相关事实
待验证GPT-6 Astra在ARC-AGI类测试中达到接近满分的99.9%,而普通人类测试者平均得分仅为48%72% 相似待验证在ARC-AGI-3基准上,GPT-5.6 Sol得分8%,其他模型普遍不足2%,Anthropic因成本过高未运行Fable67% 相似待验证ARC-AGI-2由AI安全研究员François Chollet设计,早期GPT-4在该测试上得分不足10%,人类平均得分约85%66% 相似待验证2023年人类在GAIA测试中的平均成功率约为90%,而当时最强的GPT-4在Level 1上仅勉强达到15%65% 相似待验证在提及级别,模型整体精确率为74.1%,召回率为70.5%65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/939987API
curl https://kongchang.com/api/v1/knowledge/claims/939987MCP
get_claim(id=939987)