AI 编程 › AI 资讯 › 正文

Strategically Diverse Sampling for Self-Training

arxiv · arXiv · 2026-09-26 01:35 · 评分 85

该研究提出用策略多样性代替IID采样加正确性过滤的方式构造自训练数据,强调方案间有实质性差异;这能改善LLM自训练、RL和测试时扩展中重复采样收益低的问题。

原文:arXiv | 返回 AI 资讯列表