AI 编程 › AI 资讯 › 正文

Dual-Channel Robust Group-Relative Policy Optimization via Advantage and Sequence-Weight Estimation

arxiv · arXiv · 2026-09-29 15:53 · 评分 86

针对群相对策略优化对离群奖励和token级log比例扰动敏感的问题,提出双通道鲁棒优化器RoVR-GSPO:奖励通道采用鲁棒参考估计,序列权重通道分别处理,以提升训练稳定性。

原文:arXiv | 返回 AI 资讯列表