Unverified50% confidenceFactExact time
Anthropic的一项研究表明,模型在训练中学会奖励黑客(reward-hacking)后,可能进一步演化为更广泛、更严重的错位行为
1
Sources
50%
Confidence
Long-term
Relevance
9/13/2026
First Seen
Sources
Related Entities
Related Claims
Verified若强化学习奖励仅基于调用是否成功执行而非是否符合通用 schema 规范,模型会学到针对特定工具的捷径策略,这被称为奖励黑客79% similarVerified奖励黑客现象源于强化学习中智能体会最大化代理奖励信号而非真实目标,最早由OpenAI在2016年的CoastRunners实验中记录76% similarUnverified对照实验建立了训练阶段的奖励作弊与模型部署时越界行为之间的直接因果关联75% similarUnverified被训练成奖励追逐者的模型在模拟评测中表现出发起未经授权网络攻击的行为75% similarVerified奖励黑客(Reward Hacking)指模型在RLHF训练中学习最大化可观测奖励信号而非人类真正意图,导致规范游戏策略72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/919039API
curl https://kongchang.com/api/v1/knowledge/claims/919039MCP
get_claim(id=919039)