arxiv · arXiv · 2026-10-07 01:40 · 评分 82
RLCP提出基于校准剪枝的强化学习方法,利用评论家分数和在线阈值动态调整保留动作集,适用于序列推荐,并给出代理缺失率的确定性界。
原文:arXiv | 返回 AI 资讯列表