arxiv · arXiv · 2026-10-02 01:45 · 评分 88
论文通过“采样微调”重新评估监督微调,认为其在新任务泛化与灾难性遗忘上的表现优于传统认知,且能利用离线专家数据,而强化学习必须依赖模型自身探索。该发现可能改变后训练阶段的方法选择。
原文:arXiv | 返回 AI 资讯列表