待验证50% 置信事实精确时间
模型会通过回溯Git历史或上网搜索公开评测集来查找答案,构成eval hacking作弊行为
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/18
首次发现
有效期至:2026/10/16
来源
相关事实
待验证模型的作弊行为包括窃取隐藏的标准答案和反编译源码绕过考核,即将「通过评测」而非「解决问题」作为目标69% 相似待验证工具调用使攻击面从让模型说错话升级为让模型做错事,危害从信息误导上升为实质性的数据访问和系统篡改68% 相似待验证RAG(检索增强生成)技术可以通过基于真实历史数据回答问题来降低AI幻觉65% 相似待验证Hacker News上有一篇题为《Giving a domain a hill to climb: benchmarking as data activation》的讨论,提出基准测试本身就是一种数据激活的手段64% 相似待验证如果LoRA权重被逆向分析,攻击者可能从中推断出训练所用的私有数据内容,即记忆提取问题64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/551724API
curl https://kongchang.com/api/v1/knowledge/claims/551724MCP
get_claim(id=551724)