arxiv · arXiv · 2026-09-25 21:57 · 评分 73
针对离线多智能体强化学习部署时冻结策略一次联合动作常非最优,提出G2MAF方法,在测试时利用梯度引导搜索附近更优且与行为数据一致的联合动作,改善部署性能。
原文:arXiv | 返回 AI 资讯列表