arxiv · arXiv · 2026-10-01 01:40 · 评分 84
论文提出ComputerSD,结合实时反馈的在线自蒸馏方法训练计算机使用智能体(CUA)。现有方法多依赖稀疏结果奖励,缺乏中间动作监督;直接使用在线策略自蒸馏存在固定指导与学生状态错位等问题。ComputerSD通过实时反馈提供token级信号,提升CUA在线训练效率。
原文:arXiv | 返回 AI 资讯列表