AI 编程 › AI 资讯 › 正文

Distribution Matching Distillation for Continuous Diffusion Language Models

arxiv · arXiv · 2026-10-01 01:32 · 评分 85

扩散语言模型虽可并行生成全部 token,但高质量生成仍需数百次网络评估。该论文用分布匹配蒸馏降低这一成本,利用学生模型的概率化 token 输出,统一表述学生输出参数化与梯度估计器,提出 Simplex-DMD 等两种基于 reverse-KL 匹配的方法。

原文:arXiv | 返回 AI 资讯列表