Multi-Agent Debate
一种多智能体协作推理范式,让多个大语言模型互相批评、辩论,通过来回交互提升推理准确率和事实性。由Du等人于2023年前后提出,并引发广泛研究与争议。
时间轴 (近 90 天)
在预算有限的场景下,对单模型做多次采样再投票比构建复杂的多智能体辩论框架更省钱省时
辩论过程中对话记录会溢出服务端上下文窗口,修正该溢出问题可将辩论对采样的比较结果从-1.8分拉回到持平
论文提出任何未来声称有效的辩论机制都必须跨过预算匹配且经过污染检查的基线门槛
一篇arXiv论文质疑多智能体辩论(MAD)的收益来自认知多样性的假设,认为其本质是集成采样效应而非认知多样性带来的独特优势
该实验覆盖11个厂商家族的23个模型、5项任务,累计运行5500多次辩论与对照实验
研究沿角色设定(personas)、采样温度(temperature)和模型身份(model identity)三个维度系统性引入多样性
辩论在有提升空间的任务上相比单智能体推理带来3到7个百分点的提升
在预算对齐后,辩论相对于自洽采样只能打平甚至落败,代价是1.6倍的墙钟时间和3.4倍的token成本
由不同模型组成的混合团队输给了对同一组模型直接做多数投票的结果,准确率更多取决于成员本身能力而非团队异质性
辩论的几乎全部收益都来自第一轮答案交换,后续多轮辩论没有带来实质性提升
还有 2 条时间轴事件
全部知识事实 (12)
在预算有限的场景下,对单模型做多次采样再投票比构建复杂的多智能体辩论框架更省钱省时
50%待验证辩论过程中对话记录会溢出服务端上下文窗口,修正该溢出问题可将辩论对采样的比较结果从-1.8分拉回到持平
50%待验证论文提出任何未来声称有效的辩论机制都必须跨过预算匹配且经过污染检查的基线门槛
50%待验证一篇arXiv论文质疑多智能体辩论(MAD)的收益来自认知多样性的假设,认为其本质是集成采样效应而非认知多样性带来的独特优势
50%待验证该实验覆盖11个厂商家族的23个模型、5项任务,累计运行5500多次辩论与对照实验
50%待验证研究沿角色设定(personas)、采样温度(temperature)和模型身份(model identity)三个维度系统性引入多样性
50%待验证辩论在有提升空间的任务上相比单智能体推理带来3到7个百分点的提升
50%待验证在预算对齐后,辩论相对于自洽采样只能打平甚至落败,代价是1.6倍的墙钟时间和3.4倍的token成本
50%待验证由不同模型组成的混合团队输给了对同一组模型直接做多数投票的结果,准确率更多取决于成员本身能力而非团队异质性
50%待验证辩论的几乎全部收益都来自第一轮答案交换,后续多轮辩论没有带来实质性提升
50%待验证Proposer/Critic双智能体架构源于多智能体辩论(Multi-Agent Debate)研究范式,用于缓解单一LLM的自我确认偏误
50%待验证多智能体辩论(MAD)范式在2023年前后受到广泛关注,但多项后续工作发现其优势难以稳定复现
50%