arxiv · arXiv · 2026-10-02 01:59 · 评分 76
提出FERPO,一种在线最大熵强化学习算法。针对评论家价值预测准确但并不保证动作梯度可靠的问题,通过前向熵正则化改进策略更新,提升连续控制任务中的策略优化稳定性与性能。
原文:arXiv | 返回 AI 资讯列表