AI 编程 › AI 资讯 › 正文

Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?

leiphone · 雷锋网 · 2026-09-30 15:45 · 评分 85

GLM-5.3-Flash架构中34层采用Kimi路线的线性注意力、11层采用DeepSeek路线的稀疏注意力,显示大模型混合注意力架构正从分流走向重组。

原文:雷锋网 | 返回 AI 资讯列表