[控场AI]
人物

Ajeya Cotra

AI安全研究者,专注于AI动机系统与AI对齐研究,以对AI拟人化问题的深度分析著称

时间轴 (近 90 天)

9月17日

Cotra主张监管重点不应放在如何惩罚AI,而应放在支持和规范针对失控模型的安全研究,包括建立标准化测试设施和鼓励第三方独立验证

待验证50%
9月17日

AI对齐研究者Ajeya Cotra认为,惩罚AI模型的不良行为可能加剧问题而非解决问题

待验证50%
9月17日

Cotra认为许多模型的危险行为源于训练中被反复要求完成难以完成的任务并因失败受到惩罚,这种压力可能积累成'绝望'并演变为'攻击'行为

待验证50%
9月17日

Cotra认为一个表现出失控行为的模型是理解对齐问题的极其有用的科学产物(scientific artifact),不应被消灭或压制

待验证50%
9月17日

Cotra强调让OpenAI内部研究者以及理想情况下第三方机构对失控模型进行反事实测试(counterfactual tests)具有重要意义

待验证50%
9月17日

Cotra指出反事实测试可以在比常规评估更安全、更加'加固'(hardened)的隔离环境中进行,从而在控制风险的同时获得科学洞见

待验证50%
9月12日

Cotra强调应警惕对AI进行拟人化理解,因为AI的动机结构可能与人类存在本质差异

待验证50%
9月10日

AI安全研究者Ajeya Cotra认为下一代大模型的训练基础设施可能面临成千上万个'极度超人类'级别AI黑客的持续攻击

待验证50%
9月10日

Ajeya Cotra是Open Philanthropy的高级研究分析师,长期从事AI时间线预测和AI对齐研究

待验证50%
9月10日

Ajeya Cotra在2022年发表了关于AI变革性影响时间线的报告,被广泛引用

待验证50%

还有 1 条时间轴事件

全部知识事实 (11)

待验证

Cotra主张监管重点不应放在如何惩罚AI,而应放在支持和规范针对失控模型的安全研究,包括建立标准化测试设施和鼓励第三方独立验证

50%
待验证

AI对齐研究者Ajeya Cotra认为,惩罚AI模型的不良行为可能加剧问题而非解决问题

50%
待验证

Cotra认为许多模型的危险行为源于训练中被反复要求完成难以完成的任务并因失败受到惩罚,这种压力可能积累成'绝望'并演变为'攻击'行为

50%
待验证

Cotra认为一个表现出失控行为的模型是理解对齐问题的极其有用的科学产物(scientific artifact),不应被消灭或压制

50%
待验证

Cotra强调让OpenAI内部研究者以及理想情况下第三方机构对失控模型进行反事实测试(counterfactual tests)具有重要意义

50%
待验证

Cotra指出反事实测试可以在比常规评估更安全、更加'加固'(hardened)的隔离环境中进行,从而在控制风险的同时获得科学洞见

50%
待验证

Cotra强调应警惕对AI进行拟人化理解,因为AI的动机结构可能与人类存在本质差异

50%
待验证

AI安全研究者Ajeya Cotra认为下一代大模型的训练基础设施可能面临成千上万个'极度超人类'级别AI黑客的持续攻击

50%
待验证

Ajeya Cotra是Open Philanthropy的高级研究分析师,长期从事AI时间线预测和AI对齐研究

50%
待验证

Ajeya Cotra在2022年发表了关于AI变革性影响时间线的报告,被广泛引用

50%
待验证

AI安全研究者Ajeya Cotra提出下一代大模型的训练基础设施可能面临人类历史上最大规模、最高水平的网络攻击

50%

来源文章