AI 编程 › AI 资讯 › 正文

G2MAF: Test-Time Gradient Guidance for Multi-Agent Flow Policies

arxiv · arXiv · 2026-09-25 21:57 · 评分 73

针对离线多智能体强化学习部署时冻结策略一次联合动作常非最优,提出G2MAF方法,在测试时利用梯度引导搜索附近更优且与行为数据一致的联合动作,改善部署性能。

原文:arXiv | 返回 AI 资讯列表