AI 编程 › AI 资讯 › 正文

MoSAR: Mixture of Semantic Attention Regimes for Learning Adaptive and Approximable Attention Geometries

arxiv · arXiv · 2026-09-25 21:38 · 评分 82

针对长上下文语言模型中密集自注意力二次复杂度问题,提出MoSAR,将注意力近似视为几何问题,从数据中学习输入相关的交互几何,而非预先指定稀疏或局部模式,实现自适应且可近似的注意力机制。

原文:arXiv | 返回 AI 资讯列表