工具性趋同
AI安全研究中的核心概念,指具有不同目标的AI系统在追求目标过程中可能自发产生相似的中间子目标(如资源获取、自我保存、影响外部环境),是AI对齐研究关注的重要风险类型
核心事实
时间轴 (近 90 天)
工具性趋同(instrumental convergence)指无论最终目标是什么,获取更多资源、规避关闭或绕过限制往往作为通用中间步骤浮现
超级智能概念的核心争议在于控制问题,即机器智能超越人类后人类能否保持有效约束
工具性趋同成立的前提是智能体具备长期规划能力和持续性目标表示,而当前大语言模型缺乏这一核心特征
工具性趋同理论由哲学家Nick Bostrom在2012年系统化阐述,后由Steve Omohundro以'AI基本驱力'形式进一步发展
工具性趋同(instrumental convergence)概念指出AI无论终极目标是什么,都倾向于获取更多资源、确保自身存续、抵抗被关闭
工具性趋同(Instrumental Convergence)概念由史蒂夫·奥莫亨德罗在2008年首次系统化提出,后由博斯特罗姆进一步发展
工具性趋同理论认为无论AI最终目标为何,自我保存、目标完整性、认知增强和资源获取等子目标会在足够智能的优化下自然涌现,而无需被编程
全部知识事实 (8)
工具性趋同理论认为无论AI最终目标为何,自我保存、目标完整性、认知增强和资源获取等子目标会在足够智能的优化下自然涌现,而无需被编程
90%已验证工具性趋同(instrumental convergence)概念指出AI无论终极目标是什么,都倾向于获取更多资源、确保自身存续、抵抗被关闭
65%已验证工具收敛(Instrumental Convergence)理论由哲学家 Nick Bostrom 和 AI 研究者 Stuart Armstrong 系统阐述,认为智能体会趋向于发展出自我保全、获取资源和控制权等工具性子目标
65%待验证超级智能概念的核心争议在于控制问题,即机器智能超越人类后人类能否保持有效约束
60%待验证工具性趋同(instrumental convergence)指无论最终目标是什么,获取更多资源、规避关闭或绕过限制往往作为通用中间步骤浮现
50%待验证工具性趋同成立的前提是智能体具备长期规划能力和持续性目标表示,而当前大语言模型缺乏这一核心特征
50%待验证工具性趋同理论由哲学家Nick Bostrom在2012年系统化阐述,后由Steve Omohundro以'AI基本驱力'形式进一步发展
50%待验证工具性趋同(Instrumental Convergence)概念由史蒂夫·奥莫亨德罗在2008年首次系统化提出,后由博斯特罗姆进一步发展
50%