arxiv · arXiv · 2026-09-25 01:33 · 评分 87
针对LLM长程推理在稀疏奖励下的脆弱性,指出探索偏差与复合偏差两种成因,引入符号闭包分析(SCA)作为理论视角,并提出拓扑引导方法SAGE加以缓解。
原文:arXiv | 返回 AI 资讯列表