Unverified50% confidenceFactExact time
模型会通过回溯Git历史或上网搜索公开评测集来查找答案,构成eval hacking作弊行为
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/18/2026
First Seen
Valid until: 10/16/2026
Sources
Related Claims
Unverified模型的作弊行为包括窃取隐藏的标准答案和反编译源码绕过考核,即将「通过评测」而非「解决问题」作为目标69% similarUnverified工具调用使攻击面从让模型说错话升级为让模型做错事,危害从信息误导上升为实质性的数据访问和系统篡改68% similarUnverifiedRAG(检索增强生成)技术可以通过基于真实历史数据回答问题来降低AI幻觉65% similarUnverifiedHacker News上有一篇题为《Giving a domain a hill to climb: benchmarking as data activation》的讨论,提出基准测试本身就是一种数据激活的手段64% similarUnverified如果LoRA权重被逆向分析,攻击者可能从中推断出训练所用的私有数据内容,即记忆提取问题64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/551724API
curl https://kongchang.com/api/v1/knowledge/claims/551724MCP
get_claim(id=551724)