待验证50% 置信事实精确时间
Handshake AI 研究团队发布了针对 DeepSWE-1.1 数据集的分析,将智能体揣测不存在评分器的行为命名为'投机性奖励黑客'(Speculative Reward Hacking)
1
来源数
50%
置信度
长期有效
时效性
2026/9/29
首次发现
来源
涉及实体
相关事实
已验证Reward Hacking(奖励黑客)是强化学习领域的经典问题,其核心在于优化目标(奖励函数)与设计者真实意图之间存在不可避免的差距,最早由DeepMind等研究团队系统性地记录和分析66% 相似待验证Google DeepMind的SynthID技术通过在token采样过程中引入特定概率偏置来嵌入可检测但不影响文本质量的统计信号65% 相似待验证DeepSWE、CyberGym和Automation Bench分别对应软件工程、网络安全和自动化智能体任务的评测65% 相似待验证作者将Exa网页搜索MCP服务器接入TrueForge后,智能体通过真实网络搜索给出包含DeepSeek R1、MiniMax、GLM、Mistral等模型的研究摘要64% 相似待验证豆包是字节跳动推出的对话式AI助手,DeepSeek是深度求索公司开发的开源大模型63% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/958402API
curl https://kongchang.com/api/v1/knowledge/claims/958402MCP
get_claim(id=958402)