arxiv · arXiv · 2026-09-28 21:35 · 评分 80
论文提出 PEARL,为智能体强化学习的多轮 rollout 阶段优化 prefill/decode 执行与弹性 GPU 资源配置,解决增加副本收益递减、训练 GPU 空闲等问题,提升异步执行效率。
原文:arXiv | 返回 AI 资讯列表