[控场AI]
论文被说服而非被告知

Persuaded, Not Informed

研究语言模型代理在CRM场景中被利益偏见证词误导的学术论文,揭示模型系统性地采信带有偏见的陈述而非客观记录的失效模式

时间轴 (近 90 天)

9月25日

研究《Persuaded, Not Informed》发现语言模型代理会把带有利益倾向的当事人的单方断言当作证据,从而通过公司记录本应否决的交易

待验证50%
9月25日

研究明确指出模型规模扩大和显式推理能力增强都无法为这种说服性失效提供抵抗力

待验证50%
9月25日

仅阅读通话记录的模型在31个矛盾案例中通过了其中29个

待验证50%
9月25日

该失效模式在来自四家供应商的七个模型上高度一致,被误导比例高达87%到97%

待验证50%
9月25日

在35个真正的失败案例中,只有3个不涉及任何断言,说明绝大多数失败源于采信偏见陈述而非信息缺失

待验证50%
9月25日

当向模型提供完整公司记录时,严格准确率反而从41%下降到18%,同时召回率上升,精确率崩溃

待验证50%
9月25日

当预算和时间线计算交由外部可靠流程而非模型自行推断时,廉价模型上准确率提升高达42个百分点,强模型上仅提升2到5个百分点

待验证50%
9月25日

该失效模式的前提条件是政策必须在输入中被精确指定,只有当规则清晰可查而模型仍相信矛盾口头断言时才成立

待验证50%
9月25日

研究团队公开发布了所有评估工件以供复现和验证

待验证50%
9月25日

在最强的模型上实验各组差异落在置信区间之内,研究者将结果表述为方向性模式和健全性属性而非被证明的性能下限

待验证50%

全部知识事实 (10)

来源文章