论文AI智能体易受极端化影响
AI Agents are Vulnerable to Radicalization
发表于arXiv的学术论文,研究AI智能体在多智能体对话场景下被极端化的脆弱性,揭示共鸣与说服两种路径对智能体信念极端化的影响机制
时间轴 (近 90 天)
10月1日
实验设置了目标LLM(扮演基于人口统计学和心理学特征的人类人格)和影响者LLM(目标是让目标信念变得更极端)两类角色
待验证50%
10月1日
研究沿共鸣(强化目标已有信念)和说服(推广目标最初认为无关的信念)两条路径考察极端化过程
待验证50%
10月1日
研究通过情感(affective)和行为(behavioral)两类指标衡量目标智能体被极端化的程度
待验证50%
10月1日
实验结果显示共鸣和说服两种机制都能使目标智能体变得更极端,但共鸣的效果持续强于说服
待验证50%
10月1日
研究考察了奉承(sycophancy)和未经核实的断言(unverified claims)等影响策略,它们带来不同程度的极端化效果但在各项指标上表现不一致
待验证50%
10月1日
研究发现共鸣效应会传播到相关信念上,即核心信念被强化后关联信念也会随之变得更极端
待验证50%
全部知识事实 (6)
待验证
实验设置了目标LLM(扮演基于人口统计学和心理学特征的人类人格)和影响者LLM(目标是让目标信念变得更极端)两类角色
50%待验证研究沿共鸣(强化目标已有信念)和说服(推广目标最初认为无关的信念)两条路径考察极端化过程
50%待验证研究通过情感(affective)和行为(behavioral)两类指标衡量目标智能体被极端化的程度
50%待验证实验结果显示共鸣和说服两种机制都能使目标智能体变得更极端,但共鸣的效果持续强于说服
50%待验证研究考察了奉承(sycophancy)和未经核实的断言(unverified claims)等影响策略,它们带来不同程度的极端化效果但在各项指标上表现不一致
50%待验证研究发现共鸣效应会传播到相关信念上,即核心信念被强化后关联信念也会随之变得更极端
50%