arxiv · arXiv · 2026-09-25 21:38 · 评分 82
针对长上下文语言模型中密集自注意力二次复杂度问题,提出MoSAR,将注意力近似视为几何问题,从数据中学习输入相关的交互几何,而非预先指定稀疏或局部模式,实现自适应且可近似的注意力机制。
原文:arXiv | 返回 AI 资讯列表