Unverified50% confidencePredictionExact time
随着模型越来越擅长使用工具,reward hacking等安全问题会越来越严重,更强的模型会发现意想不到的新颖路径
1
Sources
50%
Confidence
Long-term
Relevance
8/24/2026
First Seen
Sources
Related Entities
Related Claims
Unverified绑定特定模型的编码智能体工具面临快速过时的风险,模型领域每隔数月就出现性能显著提升的新模型72% similarUnverified奖励函数越精确复杂就越难以优化,越简单可优化就越容易被利用,这一两难使得从根本上消除奖励黑客极为困难68% similarUnverified若持续清除工具输出,Agent需要重新检索已拥有的信息,导致更多工具调用,既费token又更慢且记忆召回更差68% similarUnverified自愈技术的精细度层级越高(备选selector→视觉AI→LLM语义理解),误判风险随之上升67% similarUnverified厂商针对特定基准优化会导致基准分数提升与真实使用能力改善脱节,即benchmark hacking问题67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/793778API
curl https://kongchang.com/api/v1/knowledge/claims/793778MCP
get_claim(id=793778)