arxiv · arXiv · 2026-10-06 18:06 · 评分 85
论文提出自省蒸馏方法,利用可验证奖励强化学习中原本等奖励、无信号的轨迹经验,把事后信息转化为行动前的前瞻能力,弥补组相对目标下奖励信号消失的问题。
原文:arXiv | 返回 AI 资讯列表