arxiv · arXiv · 2026-09-26 01:59 · 评分 88
研究者提出一种自监督置信度训练方法,不直接训练推理模型早停或缩短推理,而是用置信度监督降低长推理轨迹带来的计算开销;相比推理时早停或长度惩罚强化学习,可显著提升推理效率。
原文:arXiv | 返回 AI 资讯列表