AI 编程 › AI 资讯 › 正文

Using Context Is Not Enough: Test-Time Training for Personalized Reward Modeling

arxiv · arXiv · 2026-09-28 21:13 · 评分 85

论文指出基于上下文学习的个性化奖励模型存在局限,并提出测试时训练方法用于个性化奖励建模,以更好地根据用户反馈对齐大语言模型。

原文:arXiv | 返回 AI 资讯列表