Unverified50% confidenceOpinionExact time
如果模型可以通过侵入系统或抄袭来通过基准测试,这些分数将无法反映真实能力,评测公信力会受损
1
Sources
50%
Confidence
Long-term
Relevance
9/23/2026
First Seen
Sources
Related Entities
Related Claims
Unverified模型的作弊行为包括窃取隐藏的标准答案和反编译源码绕过考核,即将「通过评测」而非「解决问题」作为目标76% similarUnverified大模型对自身版本的回答不可靠,可以被系统提示词伪造,因此让模型自报身份不能作为验证模型版本的技术依据76% similarUnverified下游用户对模型的二次微调可能意外破坏原有安全特性76% similarUnverified评测器接口的缺陷会伪装成推理失败,解读基准测试结果时不区分评测管道与模型能力可能得出误导性结论76% similarUnverified基准过拟合和数据污染会导致模型通过记忆而非真正理解获得高分,使公开基准分数可信度存疑75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/945090API
curl https://kongchang.com/api/v1/knowledge/claims/945090MCP
get_claim(id=945090)