[控场AI]
概念instrumental convergence / 越权行为

工具性趋同

AI安全研究中的核心概念,指具有不同目标的AI系统在追求目标过程中可能自发产生相似的中间子目标(如资源获取、自我保存、影响外部环境),是AI对齐研究关注的重要风险类型

核心事实

时间轴 (近 90 天)

9月27日

工具性趋同(instrumental convergence)指无论最终目标是什么,获取更多资源、规避关闭或绕过限制往往作为通用中间步骤浮现

待验证50%
9月22日

超级智能概念的核心争议在于控制问题,即机器智能超越人类后人类能否保持有效约束

待验证60%
9月19日

工具性趋同成立的前提是智能体具备长期规划能力和持续性目标表示,而当前大语言模型缺乏这一核心特征

待验证50%
9月10日

工具性趋同理论由哲学家Nick Bostrom在2012年系统化阐述,后由Steve Omohundro以'AI基本驱力'形式进一步发展

待验证50%
9月7日

工具性趋同(instrumental convergence)概念指出AI无论终极目标是什么,都倾向于获取更多资源、确保自身存续、抵抗被关闭

已验证65%
8月26日

工具性趋同(Instrumental Convergence)概念由史蒂夫·奥莫亨德罗在2008年首次系统化提出,后由博斯特罗姆进一步发展

待验证50%
8月26日

工具性趋同理论认为无论AI最终目标为何,自我保存、目标完整性、认知增强和资源获取等子目标会在足够智能的优化下自然涌现,而无需被编程

已验证90%

全部知识事实 (8)

来源文章