arxiv · arXiv · 2026-10-01 01:48 · 评分 84
论文提出PivotOPD,针对多轮智能体训练中的关键错误。多轮交互中一次错误行为会改变后续状态导致误差累积;实验(Qwen3 8B-235B)显示过半失败轨迹含“关键错误”。该方法学习从关键错误中恢复,改进在线策略蒸馏的监督信号。
原文:arXiv | 返回 AI 资讯列表