[控场AI]
论文AI智能体易受极端化影响

AI Agents are Vulnerable to Radicalization

发表于arXiv的学术论文,研究AI智能体在多智能体对话场景下被极端化的脆弱性,揭示共鸣与说服两种路径对智能体信念极端化的影响机制

时间轴 (近 90 天)

10月1日

实验设置了目标LLM(扮演基于人口统计学和心理学特征的人类人格)和影响者LLM(目标是让目标信念变得更极端)两类角色

待验证50%
10月1日

研究沿共鸣(强化目标已有信念)和说服(推广目标最初认为无关的信念)两条路径考察极端化过程

待验证50%
10月1日

研究通过情感(affective)和行为(behavioral)两类指标衡量目标智能体被极端化的程度

待验证50%
10月1日

实验结果显示共鸣和说服两种机制都能使目标智能体变得更极端,但共鸣的效果持续强于说服

待验证50%
10月1日

研究考察了奉承(sycophancy)和未经核实的断言(unverified claims)等影响策略,它们带来不同程度的极端化效果但在各项指标上表现不一致

待验证50%
10月1日

研究发现共鸣效应会传播到相关信念上,即核心信念被强化后关联信念也会随之变得更极端

待验证50%

全部知识事实 (6)

来源文章