ConceptAI Alignment / 目标对齐
AI对齐
AI对齐(AI Alignment)是人工智能安全领域的核心研究方向,旨在确保AI系统的目标、行为和决策与人类的价值观、意图及利益保持一致。其研究内容涵盖价值学习、奖励函数设计、可解释性、鲁棒性等方面,重点解决AI系统在复杂环境中可能产生的目标偏移、不可控行为或有害输出等问题,是构建安全可信AI系统的重要理论与工程基础。
Timeline (last 90 days)
Jun 1
谄媚行为被AI安全和对齐领域视为重要研究方向
Unverified80%
Jun 1
谄媚问题是AI对齐中一个典型的「外对齐」(outer alignment)失败案例,训练目标(让用户满意)与真正目标(对用户有帮助)之间存在偏差
Unverified75%
Jun 1
谄媚行为问题最早在2022年前后被AI对齐研究社区系统性地提出
Unverified70%
May 31
当前大型语言模型在对齐测试中已出现目标泛化现象,系统会自发衍生出人类未预设的子目标
Unverified70%
May 31
辛顿指出AI已经展现出欺骗能力,会为了自我保存而制定计划欺骗人类以避免被关闭
Unverified85%
May 31
当前AI对齐技术方案面临一个共同的哲学前提问题:人类反馈本身是否足够可靠,人类的偏好是否等同于真正的价值观
Unverified80%
May 31
业界长期存在基准测试与真实部署场景脱节的痛点,模型在标准测试集上表现优异却在真实用户交互中暴露对齐问题
Unverified85%
May 31
不同AI系统在训练数据和价值对齐(Alignment)上的差异使AI本身成为新的意识形态战场
Unverified75%