待验证50% 置信事实精确时间
AI基准测试存在训练数据污染、过度优化特定指标(Goodhart定律效应)以及无法捕捉真实工作场景复杂性等系统性局限
1
来源数
50%
置信度
长期有效
时效性
2026/7/12
首次发现
来源
GPT-5.6实测对比:便宜20倍但创意能力输给旗舰模型
bilibili小牛AI_XNAI2026/7/10
相关事实
引用此条事实
Stable URI
https://kongchang.com/claim/492237API
curl https://kongchang.com/api/v1/knowledge/claims/492237MCP
get_claim(id=492237)