人工智能Multi2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments 1. 摘要(Abstract) 本文研究的是长程交互环境中大模型智能体的决策稳定性问题。现有 LLM-based agents 已经具备较强的上下文理解和推理能力,但在多轮交互任务中仍然容易出现目标漂移。也就是说,模型一开始能够理解任务目标,但随着交互轮次增加,计划和动作... 1个月前 (07-30)
新型网络体系结构智能体网络的体系结构挑战与演进路径 摘要:大模型应用正在从生成式交互走向行动式协作。智能体不再只是回答问题,而是代表用户调用模型、访问内容、执行工具、写入状态并协调多个服务。这一变化使网络面对的核心问题从“端到端可达”扩展为“任务链路可控”:主体身份如何确认,委托授权如何传递,能力如何发现,内容如何鉴权,资源消耗... 1个月前 (07-30)
人工智能Large-Scale Terminal Agentic Trajectory Generation from Dockerized Environments 1. 摘要(Abstract) 本文研究的是面向终端环境的智能体训练数据构建问题。随着大模型智能体逐渐进入代码开发、系统运维、自动调试等真实任务,仅依赖静态文本数据已经难以训练出可靠的执行能力。终端任务的难点在于,模型不仅要理解指令,还要能在真实环境中执行命令、观察反馈、... 1个月前 (07-24)
人工智能Self-evolving LLM Agents with In-distribution Optimization 1. 摘要(Abstract) 本文研究的是长程交互型 LLM Agent 的训练问题,核心关注点是稀疏延迟奖励下的贡献归因。随着大语言模型从静态文本生成逐渐走向环境交互,LLM Agent 需要在网页购物、虚拟实验、家居任务等复杂环境中进行连续决策。然而,这类任务通常只... 3个月前 (06-11)
人工智能Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents 1. 摘要(Abstract) 本文研究的是 LLM Agents 在长程交互任务中的强化学习训练问题。现有大模型智能体在完成复杂环境任务时,通常会把完整的历史交互记录作为上下文输入,包括任务指令、过去观察、动作和中间状态等。这种做法虽然能帮助模型理解当前处境,但也带来了... 3个月前 (06-11)
人工智能Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights 1.摘要(Abstract) 本文研究的是 LLM hallucination detection benchmark(大模型幻觉检测基准) 的评测问题。随着大模型被用于电商、医疗、法律等真实场景,幻觉问题已经不只是模型效果问题,而是直接关系到生成式 AI 的安全使用。虽... 4个月前 (05-18)
人工智能A Switch-Centric In-Network Architecture for Accelerating LLM Inference in Shared-Memory Network 1. 摘要(Abstract) 本文研究的是大模型推理中的通信瓶颈问题,具体聚焦在 Tensor Parallelism(TP)推理场景下的 All-Reduce 加速。随着 LLM 参数规模不断扩大,单个 GPU 很难独立完成低延迟推理,多加速器并行已经成为常态。但在 ... 4个月前 (05-08)
人工智能Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization 1. 摘要(Abstract) 本文聚焦于 LLM-based Search Agent 的训练问题。现有方法在强化学习训练中主要面临一个核心难点credit assignment(贡献归因)。一方面,基于最终答案的 outcome supervision 虽然训练稳定,... 5个月前 (04-22)