arxiv · arXiv · 2026-09-26 01:35 · 评分 85
该研究提出用策略多样性代替IID采样加正确性过滤的方式构造自训练数据,强调方案间有实质性差异;这能改善LLM自训练、RL和测试时扩展中重复采样收益低的问题。
原文:arXiv | 返回 AI 资讯列表