arxiv · arXiv · 2026-10-04 02:05 · 评分 80
SepRQ是一个开源自监督语音表示学习框架,面向多说话人场景。它抛弃掩码预测,改用基于冻结随机投影码本的伪源分离目标,并采用无掩码多分辨率方法,在说话人日志和语音分离任务上达到最先进水平。对多说话人语音理解和下游应用有价值。
原文:arXiv | 返回 AI 资讯列表