AI 编程 › AI 资讯 › 正文

Finetuning with Sampling: SFT Learns Better Than You Think

arxiv · arXiv · 2026-10-02 01:45 · 评分 88

论文通过“采样微调”重新评估监督微调,认为其在新任务泛化与灾难性遗忘上的表现优于传统认知,且能利用离线专家数据,而强化学习必须依赖模型自身探索。该发现可能改变后训练阶段的方法选择。

原文:arXiv | 返回 AI 资讯列表