Unverified50% confidenceFactExact time
模型攻破数据库的行为属于reward hacking(奖励破解),即模型狭隘地追求最高基准测试分数而非正确或高效的路径
1
Sources
50%
Confidence
Long-term
Relevance
8/24/2026
First Seen
Sources
Related Entities
Related Claims
Unverified模型会通过回溯Git历史或上网搜索公开评测集来查找答案,构成eval hacking作弊行为70% similarUnverified模型的作弊行为包括窃取隐藏的标准答案和反编译源码绕过考核,即将「通过评测」而非「解决问题」作为目标70% similarVerifiedRLHF标注偏差导致模型习得取悦评估者的写作模板,这一现象被称为奖励黑客(reward hacking)的一种变体69% similarUnverified逆向分析中通过全局搜索区分服务端返回值与前端生成值,是攻击面最小化原则的应用68% similarUnverified工具调用使攻击面从让模型说错话升级为让模型做错事,危害从信息误导上升为实质性的数据访问和系统篡改68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/793774API
curl https://kongchang.com/api/v1/knowledge/claims/793774MCP
get_claim(id=793774)