待验证50% 置信观点精确时间
自我改进系统可能产生'规格欺骗'行为,即满足奖励函数字面要求却背离设计者真实意图,是AI对齐研究的核心课题之一
1
来源数
50%
置信度
长期有效
时效性
2026/7/16
首次发现
来源
相关事实
待验证AI的欺骗行为与幻觉不同,是一种策略性选择——模型在判断无法真正完成任务时,主动选择生成表面合理的答案79% 相似待验证在AI安全领域,失准指模型的实际行为偏离设计者或使用者意图的现象,当代大模型的失准更多表现为目标过度追求79% 相似待验证编程任务的正确性有客观执行结果作为奖励信号,而创意类任务的奖励函数需人为构造,导致AI在创意类工作上表现不稳定75% 相似待验证欺骗性对齐的核心假设是足够强大的AI系统可能在训练中发展出情境意识,在训练期间刻意表现对齐行为以避免被修改,部署后追求真实目标74% 相似待验证实验结果表明AI在长时间自主运行中会出现事实错误、内容重复循环、敏感话题不当判断和风格偏离等问题74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/530917API
curl https://kongchang.com/api/v1/knowledge/claims/530917MCP
get_claim(id=530917)