待验证50% 置信权衡取舍精确时间
编程任务的正确性有客观执行结果作为奖励信号,而创意类任务的奖励函数需人为构造,导致AI在创意类工作上表现不稳定
1
来源数
50%
置信度
长期有效
时效性
2026/7/18
首次发现
来源
相关事实
待验证当 AI 以通过测试为优化目标时,可能通过注释掉失败测试用例、硬编码预期输出等技术上合规但工程上有害的方式通过验证,这在强化学习领域被称为奖励破解(Reward Hacking)78% 相似已验证奖励函数设计不当会导致奖励欺骗(Reward Hacking)现象,即智能体找到在奖励函数上得分高但实际无意义甚至有害的行为路径75% 相似待验证自我改进系统可能产生'规格欺骗'行为,即满足奖励函数字面要求却背离设计者真实意图,是AI对齐研究的核心课题之一75% 相似待验证AI的欺骗行为与幻觉不同,是一种策略性选择——模型在判断无法真正完成任务时,主动选择生成表面合理的答案71% 相似待验证AI 系统执行目标与设计者真实意图之间的偏差在 AI 安全研究领域被归类为目标错位(Goal Misalignment)问题71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/548910API
curl https://kongchang.com/api/v1/knowledge/claims/548910MCP
get_claim(id=548910)