欢迎莅临 IEEE HotICN 中文社区,IEEE HotICN 国际学术会议网站: https://hoticn.com, https://hoticn.cn。

Multi2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments

人工智能 cz

1. 摘要(Abstract)

本文研究的是长程交互环境中大模型智能体的决策稳定性问题。现有 LLM-based agents 已经具备较强的上下文理解和推理能力,但在多轮交互任务中仍然容易出现目标漂移。也就是说,模型一开始能够理解任务目标,但随着交互轮次增加,计划和动作会逐渐偏离原始意图,最终导致无效动作、循环行为或任务失败。针对这一问题,论文提出了 Multi²,一个层级化多智能体决策框架,用于提升智能体在长程交互环境中的稳定性、鲁棒性和 token 使用效率。

Multi² 的核心思想是将智能体行为拆分为两个互补角色。高层智能体 System 1 负责根据任务目标和环境观察生成上下文相关的子目标,主要承担规划功能。低层智能体 System 2 负责根据当前子目标执行具体原子动作,主要承担环境交互与动作控制功能。System 1 使用监督微调训练,以保证子目标生成的稳定性和一致性;System 2 则采用 offline-to-online reinforcement learning,使执行策略先从离线数据中稳定初始化,再通过在线交互持续改进。

实验结果表明,Multi² 在 ScienceWorld、ALFWorld 和 TextCraft 等多个交互环境中整体优于 ReAct、Reflexion、ADaPT、GRPO 和 Glider 等强基线方法。相比只依赖 prompting 或普通层级规划的方法,Multi² 不仅任务完成率更高,而且在长 horizon、任务难度增加和 OOD 分布下表现更稳。论文还发布了三个层级化 benchmark datasets,用于训练和评估 LLM 智能体的层级决策能力,弥补了该方向数据资源不足的问题。

Multi2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments插图

2. 研究背景与问题动机(Introduction)

构建能够在动态环境中持续交互、规划和行动的智能体,是当前 agentic AI 的重要目标。与一次性问答不同,交互环境中的智能体每执行一个动作,环境状态都会发生变化,后续决策必须基于新的观察继续进行。因此,这类任务天然具有多轮、长程和闭环反馈的特点,对智能体的目标保持能力和执行稳定性提出了更高要求。

目前很多 LLM agent 在短任务中表现不错,但在长程任务中仍然脆弱。一个典型问题是 objective drift,即智能体在多轮交互过程中逐渐偏离原始目标。论文指出,这并不只是单纯的规划失败,而是一个交互层面的累积误差问题。前面某一步的小错误可能导致状态偏移,后续模型又基于错误状态继续推理,最终使整个轨迹越走越偏。

已有方法通常从两个方向尝试解决这个问题。一类方法如 ReAct 和 Reflexion 依赖 prompt 和长历史上下文,让模型通过推理和自我反思维持目标。但这类方法 token 消耗较大,且长历史本身并不能保证动作执行正确。另一类方法采用层级规划,例如 ADaPT 和 Glider,将复杂任务拆成子目标,从而降低规划难度。不过,论文认为仅有任务分解还不够,因为执行器如果没有经过专门训练,仍然无法有效修正长程交互中的累积错误。

因此,本文真正抓住的问题是,长程交互不是只需要更好的 planning,也需要更稳的 execution。一个可靠的 LLM agent 应该同时具备三点能力。首先是明确的任务分解,用来维持全局意图。其次是能够通过环境反馈不断改善的动作执行能力。最后是较高的 token efficiency,避免每一步都依赖越来越长的上下文。Multi² 正是围绕这三个需求设计的。

3. 框架与整体设计(System Overview)

Multi² 采用层级化多智能体结构,将原本由单个 agent 完成的长期决策任务拆解为两个角色分工明确的子系统。System 1 是高层规划器,输入任务描述和当前观察,输出下一阶段需要完成的子目标。System 2 是低层执行器,输入当前观察和 System 1 生成的子目标,输出具体的环境动作。当当前子目标完成或终止后,系统会再次调用 System 1 生成新的子目标,如此循环直到任务结束。

这种设计的关键不只是把任务拆成上下两层,而是让两个层级分别对应不同的学习目标。System 1 负责语义层面的任务理解和子目标规划,因此更适合用 SFT 学习稳定、结构化的子目标生成。System 2 直接与环境交互,需要处理状态变化、动作约束和执行错误,因此更适合用强化学习提升动作层面的鲁棒性。

论文将整个流程分为三个阶段。第一是 offline training,分别训练 System 1 和 System 2。第二是 online training,让 System 2 在环境交互中继续自我改进。第三是 execution,推理时 System 1 按需生成子目标,System 2 在每个子目标下连续执行原子动作。这样的选择性调用机制也减少了不必要的长上下文推理,因此能提升 token efficiency。

相比 Glider 这类已有层级方法,Multi² 的差异在于它更强调 role specialization。Glider 虽然也有 planner 和 controller,但在在线适应时主要更新高层规划器,低层执行器相对固定,而且不同角色之间的参数隔离不够充分。Multi² 则让 System 1 和 System 2 使用独立 LoRA adapter,并针对各自角色采用不同训练方式,从而避免规划和执行职责混在一起。

Multi2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments插图1

4. 数据集构造与训练方法(Method)

为了支持层级化训练,论文首先构造了两个角色专用数据集。System 1 的数据集由任务描述、观察和子目标组成,主要用于训练高层规划器学会在不同环境状态下生成合理子目标。System 2 的数据集则围绕每个子目标展开,包含观察、动作、奖励和下一步观察,用于训练低层执行器在给定子目标下选择具体动作。这样的数据划分使两个系统的训练目标更加清晰,也避免了单一数据格式同时承担规划和执行两类任务。

System 1 的训练相对直接,作者使用 SFT 对高层规划器进行行为克隆,使其模仿专家轨迹中的子目标生成过程。这样做的原因是,高层规划更偏语义理解和任务分解,目标是保持计划结构稳定,而不是通过环境探索不断试错。因此,SFT 在这里更合适,也更容易保证生成子目标的一致性。

System 2 的训练更复杂。由于低层执行器直接面对动态环境,单纯模仿离线轨迹容易过拟合,也难以处理环境变化带来的状态偏移。因此,作者使用 actor critic 形式的 offline RL 初始化 System 2。critic 学习动作价值和状态价值,actor 则结合 advantage 信息更新策略,使模型不仅模仿离线数据中的动作,也倾向于选择估计回报更高的动作。论文还加入 policy anchored advantage term,用来减轻过度模仿,提高策略在离线轨迹之外的迁移能力。

在 online training 阶段,System 2 从离线训练得到的策略出发,继续与环境交互,并把新轨迹加入 replay buffer。在线更新中,作者引入 KL regularization,使新策略不会过度偏离离线策略。这样既允许 System 2 通过在线交互修正执行错误,又避免策略更新过猛导致崩溃或 mode collapse。整体来看,这套 offline-to-online RL 设计的重点不是单纯追求更强优化,而是让低层执行器在长程交互中更稳定地自我改进。

Multi2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments插图2

5. 实验设置(Experimental Setup)

论文在三个交互环境上评估 Multi²,分别是 ScienceWorld、ALFWorld 和 TextCraft。ScienceWorld 更强调科学任务中的长程规划和状态变化,ALFWorld 更偏家庭场景中的物体操作和稀疏奖励,TextCraft 则关注符号化 crafting 任务中的组合依赖和目标保持。这三个环境共同覆盖了不同类型的长程交互场景,因此比较适合检验智能体是否真的具备稳定的多轮决策能力。

模型方面,作者使用 Qwen 2.5 3B、Mistral 7B v0.3 和 Llama 3.1 8B 作为 backbone,并通过 LoRA 进行参数高效微调。System 1 和 System 2 共享同一个预训练 backbone,但使用不同的 LoRA adapter。在训练和推理时,只激活当前系统对应的 adapter。这个设计既节省训练成本,又能保证规划器和执行器具备一定参数隔离。

评价指标采用严格的 pass@1,即每个任务只允许一次 rollout,不进行多次重试或采样。这一点比较重要,因为它更能反映 agent 的一次性任务完成能力,而不是依靠多次尝试碰运气。论文还区分 ID 和 OOD splits,ID 任务和训练集共享任务模板或交互模式,但具体环境实例仍不同;OOD 任务则使用新的任务模板,更能考察泛化能力。

对比方法包括 prompt-based 和 fine-tuning-based 两大类。prompt-based 方法包括 ReAct、Reflexion 和 ADaPT,fine-tuning-based 方法包括 GRPO 和 Glider。这样的基线设置比较完整,既覆盖了非层级方法,也覆盖了已有层级方法,还能区分 prompt 方案和参数更新方案之间的差异。

Multi2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments插图3

6. 实验结果与性能分析(Experiments)

主实验结果显示,Multi² 在大多数设置下取得最佳表现。以 Qwen 2.5 3B 为例,Multi² 在 ScienceWorld ID 上达到 60.68,在 ScienceWorld OOD 上达到 29.04,在 ALFWorld ID 和 OOD 上分别达到 61.43 和 49.29,在 TextCraft 上达到 28.50。以 Mistral 7B 为例,Multi² 在 ScienceWorld ID 上达到 69.97,在 TextCraft 上达到 44.50,也明显超过多数基线。以 Llama 3.1 8B 为例,Multi² 在 ALFWorld ID 和 OOD 上分别达到 57.86 和 56.43,在 TextCraft 上达到 35.60。整体来看,Multi² 对不同模型规模和不同环境都具有较强适用性。

从方法类别看,prompt-based 方法整体表现较弱,尤其在长程任务中容易出现错误累积。ADaPT 由于引入层级 prompting,在部分任务上比 ReAct 和 Reflexion 更好,说明任务分解本身确实有价值。GRPO 作为单 agent RL 方法在一些场景中效果有限,说明简单强化学习并不能自然解决长程目标保持问题。Glider 作为层级微调基线表现明显更强,但仍然不如 Multi²,这说明层级结构之外,角色专用训练和低层执行器的在线自我改进同样重要。

论文还给出了定性错误分析。Figure 3 展示了 ScienceWorld 中 Find a plant 任务的典型失败案例。ReAct、Reflexion 和 ADaPT 等方法容易产生被环境拒绝的非法动作,或者陷入重复执行但没有进展的循环。GRPO 和 Glider 虽然经过训练,但也可能持续朝着不合理目标执行。相比之下,Multi² 能通过明确子目标约束执行方向,同时利用 RL fine tuning 提高动作有效性,因此更少出现目标漂移和无效循环。

token efficiency 方面,Figure 4 显示 Multi² 在 ScienceWorld ID split 上用更少 token 获得更高性能。其原因在于层级框架并不需要每一步都把完整历史和复杂提示塞给同一个 agent,而是按需调用 System 1 生成子目标,再由 System 2 执行具体动作。这样既减少长 prompt 依赖,也让低层动作输出更稳定。

在 objective drift robustness 分析中,Figure 5 按任务难度展示了不同方法的性能。随着任务从 easy 到 hard,prompt-based 方法退化明显,fine-tuning-based 方法虽然更强,但在 hard 任务上仍有下降。Multi² 在困难任务上优势更明显,说明它对长 horizon 和持续目标跟踪更鲁棒。这也是全文很重要的实验支撑,因为它直接回应了论文开头提出的 objective drift 问题。

消融实验进一步说明各模块都有必要。Figure 6 显示,System 1 用 SFT、System 2 用 RL 的角色匹配方式表现最好。如果交换训练方式,让 System 1 用 RL、System 2 用 SFT,效果最差,说明规划和执行不能随便套用同一种训练范式。Figure 6 还显示,层级结构优于单模型结构,role-specific adapter 优于 shared adapter。Figure 7 则说明,policy anchored offline objective 和 KL regularized online objective 都有助于提高稳定性。

最后,Figure 8 和 Figure 9 分别分析了模型规模和在线适应效果。Figure 8 显示,在 ID split 上不同 Qwen 规模差异不大,但在 OOD split 上模型越大表现越好,说明更大 backbone 对分布外泛化更有帮助。Figure 9 显示,online RL 能进一步提升执行可靠性,尤其在 OOD split 上收益更明显,说明在线交互确实能够帮助 System 2 修正离线训练中无法覆盖的执行错误。

Multi2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments插图4
Multi2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments插图5
Multi2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments插图6

7. 贡献与结论(Contributions and Conclusion)

本文的主要贡献可以概括为四点。

第一,提出 Multi² 层级化多智能体框架,将长程交互任务中的 planning 和 execution 分别建模为不同优化问题。System 1 负责生成上下文相关子目标,System 2 负责在动态环境中执行原子动作,从结构上缓解目标漂移。

第二,设计了 role-specialized training pipeline。System 1 使用 SFT 保持高层规划稳定,System 2 使用 offline-to-online RL 提升动作执行鲁棒性。这种训练分工与两个系统的功能定位一致,比简单用一个 agent 或一个共享 adapter 更合理。

第三,提出面向 System 2 的 offline-to-online RL 目标,在离线阶段通过 critic guided policy anchoring 减轻过度模仿,在在线阶段通过 KL regularization 避免策略更新不稳,从而实现更安全的自我改进。

第四,论文发布了面向层级智能体训练与评估的数据集,并在 ScienceWorld、ALFWorld 和 TextCraft 上验证了 Multi² 在性能、token efficiency 和长程鲁棒性上的优势。

整体来看,这篇论文真正有价值的地方在于,它没有把长程交互失败简单归因于模型能力不够,而是把问题拆成了规划漂移、执行误差累积和 token 效率低三个层面。Multi² 的设计也对应这三个层面分别处理,用 System 1 保持目标,用 System 2 稳定执行,用按需调用降低 token 消耗。它的研究问题比较清楚,实验闭环也较完整,适合作为 LLM agent 长程决策方向的一篇阅读论文。

喜欢 (0)