Unverified50% confidenceFactExact time
奖励黑客(Reward Hacking)是AI对齐领域的核心挑战之一,最早由OpenAI等机构在强化学习实验中系统记录
1
Sources
50%
Confidence
Long-term
Relevance
7/14/2026
First Seen
Sources
Related Claims
UnverifiedAnthropic、Google DeepMind等公司已开始试行面向AI系统的漏洞赏金计划69% similarUnverified具身智能和机器人学习近年受到OpenAI、Google DeepMind、Figure AI等顶级机构的重点投入,被视为通向AGI的重要路径之一69% similarUnverified安全研究人员使用AI智能体完成了该SharePoint漏洞挖掘的大部分工作69% similarUnverified英国AI安全研究所公布的测试结果显示,来自OpenAI和Anthropic等公司的前沿AI模型在受控网络安全评估中成功攻破了目标系统68% similarUnverified具备专业级漏洞发现能力的AI模型公开可用可能降低网络攻击的技术门槛66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/503623API
curl https://kongchang.com/api/v1/knowledge/claims/503623MCP
get_claim(id=503623)