AI 编程 › AI 资讯 › 正文

FERPO: Forward Entropy-Regularized Policy Optimization

arxiv · arXiv · 2026-10-02 01:59 · 评分 76

提出FERPO,一种在线最大熵强化学习算法。针对评论家价值预测准确但并不保证动作梯度可靠的问题,通过前向熵正则化改进策略更新,提升连续控制任务中的策略优化稳定性与性能。

原文:arXiv | 返回 AI 资讯列表