arxiv · arXiv · 2026-09-29 15:45 · 评分 86
提出差分感知优势剪枝与自适应rollout采样的GRPO改进方法。GRPO系列依赖每问题多次rollout和逐token概率计算,开销大且低信息轨迹损害学习;该工作通过剪枝和自适应采样提升训练效率与性能。
原文:arXiv | 返回 AI 资讯列表