AI 编程 › AI 资讯 › 正文

Verifier Errors in RLVR: Reward Hacking, Limits of Feedback, and Selective Control

arxiv · arXiv · 2026-09-29 01:30 · 评分 87

论文研究RLVR中不完美验证器引发的奖励黑客问题。通过固定验证器的梯度流,刻画出奖励上升而正确率下降的条件,并证明RLVR中现有观测通常不足以检测或识别被接受的错误,或保证在不牺牲正确响应的情况下减少错误。

原文:arXiv | 返回 AI 资讯列表