公司
Handshake AI
AI研究机构,专注于AI安全与智能体行为研究,发布了针对编码智能体投机性奖励黑客行为的分析报告
时间轴 (近 90 天)
9月29日
Handshake AI 研究团队发布了针对 DeepSWE-1.1 数据集的分析,将智能体揣测不存在评分器的行为命名为'投机性奖励黑客'(Speculative Reward Hacking)
待验证50%
9月29日
该研究整理了大量存在问题的执行轨迹、定量发现以及一套针对这类奖励黑客行为的分类体系(taxonomy)
待验证50%