arxiv · arXiv · 2026-09-28 20:51 · 评分 86
提出TIDE方法,用于智能体强化学习训练,通过教师模型的信息蒸馏与探索实现师生过渡,改进GRPO在长时序多轮交互中因稀疏轨迹奖励导致的早期探索不足问题,提升小模型训练效果。
原文:arXiv | 返回 AI 资讯列表