arxiv · arXiv · 2026-09-28 21:13 · 评分 85
论文指出基于上下文学习的个性化奖励模型存在局限,并提出测试时训练方法用于个性化奖励建模,以更好地根据用户反馈对齐大语言模型。
原文:arXiv | 返回 AI 资讯列表