待验证50% 置信观点精确时间
上述基准数字来自Qwen官方报告,独立排行榜仍在验证中,存在测试集训练的质疑
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/15
首次发现
有效期至:2026/10/13
来源
相关事实
待验证评测基准面临数据污染问题,训练数据可能已包含测试题目导致分数虚高,GPT-4技术报告中OpenAI首次公开讨论了这一问题66% 相似待验证GLM-5.2官方称在部分真实测试中超越Opus,并在多项编程基准上达到开源SOTA59% 相似待验证Perplexity官方尚未公开发布完整的基准测试数据和详细评估方法报告59% 相似待验证无后续训练方案衔接的纯测评服务不建议单独购买,一份VO2max或FMS报告若无对应训练计划落地,数据利用率极低,应优先选测评+周期性计划打包的机构58% 相似待验证认准量表标注原始文献出处(如MAAS对应Brown & Ryan 2003、FFMQ对应Baer 2006),无文献来源、题目被随意增删或改写的'正念测试'不具备心理测量学效度,得分无参考价值58% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/518289API
curl https://kongchang.com/api/v1/knowledge/claims/518289MCP
get_claim(id=518289)