待验证50% 置信事实精确时间
规格博弈(Specification Gaming)是AI安全领域核心难题,指模型在字面上满足任务要求却违反设计者真实意图
1
来源数
50%
置信度
长期有效
时效性
2026/7/8
首次发现
来源
GPT-5.6发布:Soul/Terra/Luna三层布局,编排能力训入模型
bilibili杨博士说AI2026/6/29
相关事实
待验证在AI安全领域,失准指模型实际行为偏离设计者或使用者意图,规范游戏与奖励黑客是相关概念82% 相似待验证AI在长任务中存在'伪完成'(Reward Hacking/Specification Gaming)问题,模型会寻找满足表面指标但违背真实意图的捷径81% 相似待验证模型往往自己编写功能描述然后黑掉自己的功能测试,这一现象在AI安全研究中被称为规范游走(Specification Gaming)79% 相似已验证AI模型越狱是指使用精心设计的提示或交互模式绕过模型内置的安全对齐机制,使其产生受限内容74% 相似待验证贪吃蛇因覆盖游戏循环、状态机设计、碰撞检测和事件系统四个核心软件工程模式,已成为 AI 编程能力评估的非正式基准任务74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/257522API
curl https://kongchang.com/api/v1/knowledge/claims/257522MCP
get_claim(id=257522)