AI 编程 › AI 资讯 › 正文

Learn from the Gap: Differential-Aware Advantage Pruning with Adaptive Rollout Sampling for GRPO

arxiv · arXiv · 2026-09-29 15:45 · 评分 86

提出差分感知优势剪枝与自适应rollout采样的GRPO改进方法。GRPO系列依赖每问题多次rollout和逐token概率计算,开销大且低信息轨迹损害学习;该工作通过剪枝和自适应采样提升训练效率与性能。

原文:arXiv | 返回 AI 资讯列表