Unverified50% confidenceOpinionExact time
评估模型不能只看智能指标,还要看Token使用效率和工具调用次数,工具调用次数过多会导致上下文污染
1
Sources
50%
Confidence
Long-term
Relevance
7/25/2026
First Seen
Sources
Related Claims
Partially Verified基准污染指模型在训练过程中已见过测试题目,导致评分虚高、无法反映真实泛化能力72% similarUnverifiedScale AI的研究团队发现,部分模型在被污染的基准上的表现比在新编写的同等难度题目上高出10-15个百分点70% similarUnverified研究表明即使是部分污染(模型只见过题目而非答案),也可能显著提升得分69% similarUnverified模型的基准分数更高并不等于在所有场景下都更好用67% similarUnverified指标数量与数据可信度存在错觉权衡:标称20+项指标的低价秤不比8项的可靠,重点看电极数和App算法品牌而非指标条数65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/611276API
curl https://kongchang.com/api/v1/knowledge/claims/611276MCP
get_claim(id=611276)