文章主要内容和创新点
主要内容
本文聚焦于多智能体强化学习(MARL)在多机器人路径规划(MAPF)和任务分配(MRTA)中的探索效率问题,提出将大型语言模型(LLMs)作为“专家规划器”来提升MARL的探索性能。具体内容包括:
- 背景与问题:指出深度强化学习(DRL)和MARL存在样本效率低的问题,在稀疏奖励、长决策 horizon 等复杂环境中探索挑战加剧;而引入专家知识可引导智能体探索更有价值的轨迹。
- 方法设计:提出一种结合QMIX(MARL算法)与专家规划器(A*或Vicuna-7B)的框架,通过混合网络集合的Q值标准差估计模型不确定性,当不确定性超过阈值时调用专家规划器生成行动建议。
- 实验验证:在Simple Spread环境中设计5组对比实验(vanilla QMIX、带注意力机制的QMIX、QMIX+A*、QMIX+Vicuna-7B、QMIX+微调后的Vicuna-7B),结果显示QMIX+Vicuna-7B性能最优且更稳定,验证了LLM作为多智能体专家规划器的有效性。
- 未来方向:包括调整集合智能体数量、改进不确定性估计方法、使用更大模型(如Llama-2)、基于多智能体规划算法(M*)微调LLM等。
创新点
- LLM作为MARL专家规划器:首次将Vicuna-7B等LLM应用于多智能体协作任务的专家探索,通过