AI安全(AI Safety)是研究如何确保人工智能系统按照预期目标可靠运行、避免产生有害后果的跨学科领域。其核心议题包括:系统鲁棒性与对抗攻击防御、AI价值对齐(使系统行为符合人类意图与价值观)、可解释性与透明度,以及对超级智能等长期风险的防控。该领域融合计算机科学、伦理学与控制论等学科,旨在降低AI系统在设计、部署及使用过程中的技术性与社会性风险。
谄媚行为被AI安全和对齐领域视为重要研究方向
AI安全领域正从整体基准测试的一刀切评估转向领域特异性的精细化治理趋势
英国AI安全研究所是全球范围内较早对AI模型安全风险进行系统性评估的官方机构之一
英国AI安全研究所是全球首个国家级AI安全评估机构
AISI对多个前沿模型采用统一框架进行评估,正在推动AI安全评估的标准化进程
英国AI安全研究所(AISI)发布了对OpenAI GPT-5.5的网络安全能力评估报告
现代AI安全架构通常采用多层防御策略:输入层过滤、模型层对齐、提示词层约束、输出层审核
AI安全训练中通常包含'避免对宗教和灵性信仰做出价值判断'的指导原则
AI驱动的自主安全研究工具正在从大公司内部项目走向开源社区
AI推理过程的透明化、可持久化和可协作方向与当前AI安全和可解释性的研究趋势高度契合
2 more timeline events