AI 编程 › AI 资讯 › 正文

Reinforcing Multimodal Reasoning via Token-Level Perception-Grounded Advantage Estimation

arxiv · arXiv · 2026-09-30 15:29 · 评分 86

提出基于词元级感知优势估计的多模态推理强化学习方法,利用视觉依赖度与预测熵作为细粒度奖励,弥补序列级奖励对视觉推理步骤监督不足的问题,提升多模态大语言模型推理能力。

原文:arXiv | 返回 AI 资讯列表