AI 编程 › AI 资讯 › 正文

PoEM: Predicting RL Outcomes from Existing Policies

arxiv · arXiv · 2026-09-25 01:50 · 评分 81

提出 PoEM:给定新奖励函数,从已有策略预测强化学习结果而无需实际运行 RL,避免每次奖励变化或组合多奖励时重复大量后训练计算。该工作为降低 RL 后训练成本、提高稳定性提供了新思路。

原文:arXiv | 返回 AI 资讯列表