Unverified50% confidenceFactExact time
Scale AI的研究团队发现,部分模型在被污染的基准上的表现比在新编写的同等难度题目上高出10-15个百分点
1
Sources
50%
Confidence
Long-term
Relevance
8/20/2026
First Seen
Sources
Related Claims
Unverified研究表明即使是部分污染(模型只见过题目而非答案),也可能显著提升得分72% similarUnverified评估模型不能只看智能指标,还要看Token使用效率和工具调用次数,工具调用次数过多会导致上下文污染70% similarUnverified斯坦福大学的研究表明,仅通过优化Prompt措辞,就能在某些任务上将模型表现提升20%-50%69% similarUnverified研究表明,结构化提示词相比模糊描述可将 AI 输出质量提升 40% 以上69% similarUnverified使用AI调试三件套母版(完整报错信息+相关代码片段+预期运行方式)后,答案准确率从30%提升到90%以上,且基本一次就能解决问题69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/778884API
curl https://kongchang.com/api/v1/knowledge/claims/778884MCP
get_claim(id=778884)