arxiv · arXiv · 2026-10-01 01:59 · 评分 76
论文提出半事实信用增强策略优化方法,研究RLVR大模型对任务无关提示特征的敏感性。通过半事实提示干预分析token级漂移,并在解码时抑制高漂移候选token,显著提升推理准确率,为强化学习推理稳定性提供新思路。
原文:arXiv | 返回 AI 资讯列表