arxiv · arXiv · 2026-09-29 15:56 · 评分 88
研究发现生产环境RL中,重要性校正的GRPO存在“采样器陈旧悬崖”:在Qwen2.5-Math-1.5B和GSM8K上,每192步刷新采样器时,180步后模型性能严重退化。与现有方案作用于更新不同,该工作从采样器侧解决。
原文:arXiv | 返回 AI 资讯列表