Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models? 论文《Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?》总结与翻译一、论文主要内容(一)研究背景与核心问题多智能体辩论(MAD)作为提升大型语言模型(LLMs)性能的热门框架,通过多智能体间的迭代讨论实现协同推理。但目前MAD有效性的核心驱动因素尚不明确,论文关键问题聚焦于:MAD的性能提升是源于智能体间有意义的辩论交互,还是仅来自多智能体输出的聚合(即集成效应)?(二)核心研究发现实证结果:多数投票是MAD性能提升的主因论文在7个NLP基准数据集(涵盖算术运算、数学推理、医学知识问答、形式逻辑、常识推理等任务)上,对比了单智能体、不同MAD变体(去中心化MAD、稀疏MAD、中心化MAD)与多数投票的性能。结果显示:多数投票(仅聚合智能体初始输出,无辩论过程)的性能与MAD相当,且在多数任务中占MAD性能提升的绝大部分。例如,在Qwen2.5-7B-Instruct模型上,多数投票在算术任务上准确率达0.99,远超各类MAD变体(最高0.84);平均准确率(0.7691)也高于所有MAD变体(最高0.7377)。扩展实验进一步验