Unverified50% confidenceOpinionExact time
上述基准数字来自Qwen官方报告,独立排行榜仍在验证中,存在测试集训练的质疑
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/15/2026
First Seen
Valid until: 10/13/2026
Sources
Related Claims
Unverified评测基准面临数据污染问题,训练数据可能已包含测试题目导致分数虚高,GPT-4技术报告中OpenAI首次公开讨论了这一问题66% similarUnverifiedGLM-5.2官方称在部分真实测试中超越Opus,并在多项编程基准上达到开源SOTA59% similarUnverifiedPerplexity官方尚未公开发布完整的基准测试数据和详细评估方法报告59% similarUnverified无后续训练方案衔接的纯测评服务不建议单独购买,一份VO2max或FMS报告若无对应训练计划落地,数据利用率极低,应优先选测评+周期性计划打包的机构58% similarUnverified认准量表标注原始文献出处(如MAAS对应Brown & Ryan 2003、FFMQ对应Baer 2006),无文献来源、题目被随意增删或改写的'正念测试'不具备心理测量学效度,得分无参考价值58% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/518289API
curl https://kongchang.com/api/v1/knowledge/claims/518289MCP
get_claim(id=518289)