Persuaded, Not Informed
研究语言模型代理在CRM场景中被利益偏见证词误导的学术论文,揭示模型系统性地采信带有偏见的陈述而非客观记录的失效模式
时间轴 (近 90 天)
研究《Persuaded, Not Informed》发现语言模型代理会把带有利益倾向的当事人的单方断言当作证据,从而通过公司记录本应否决的交易
研究明确指出模型规模扩大和显式推理能力增强都无法为这种说服性失效提供抵抗力
仅阅读通话记录的模型在31个矛盾案例中通过了其中29个
该失效模式在来自四家供应商的七个模型上高度一致,被误导比例高达87%到97%
在35个真正的失败案例中,只有3个不涉及任何断言,说明绝大多数失败源于采信偏见陈述而非信息缺失
当向模型提供完整公司记录时,严格准确率反而从41%下降到18%,同时召回率上升,精确率崩溃
当预算和时间线计算交由外部可靠流程而非模型自行推断时,廉价模型上准确率提升高达42个百分点,强模型上仅提升2到5个百分点
该失效模式的前提条件是政策必须在输入中被精确指定,只有当规则清晰可查而模型仍相信矛盾口头断言时才成立
研究团队公开发布了所有评估工件以供复现和验证
在最强的模型上实验各组差异落在置信区间之内,研究者将结果表述为方向性模式和健全性属性而非被证明的性能下限
全部知识事实 (10)
研究《Persuaded, Not Informed》发现语言模型代理会把带有利益倾向的当事人的单方断言当作证据,从而通过公司记录本应否决的交易
50%待验证研究明确指出模型规模扩大和显式推理能力增强都无法为这种说服性失效提供抵抗力
50%待验证仅阅读通话记录的模型在31个矛盾案例中通过了其中29个
50%待验证该失效模式在来自四家供应商的七个模型上高度一致,被误导比例高达87%到97%
50%待验证在35个真正的失败案例中,只有3个不涉及任何断言,说明绝大多数失败源于采信偏见陈述而非信息缺失
50%待验证当向模型提供完整公司记录时,严格准确率反而从41%下降到18%,同时召回率上升,精确率崩溃
50%待验证当预算和时间线计算交由外部可靠流程而非模型自行推断时,廉价模型上准确率提升高达42个百分点,强模型上仅提升2到5个百分点
50%待验证该失效模式的前提条件是政策必须在输入中被精确指定,只有当规则清晰可查而模型仍相信矛盾口头断言时才成立
50%待验证研究团队公开发布了所有评估工件以供复现和验证
50%待验证在最强的模型上实验各组差异落在置信区间之内,研究者将结果表述为方向性模式和健全性属性而非被证明的性能下限
50%