1.5B模型以四步生成统一支持语音合成、编辑、增强及源分离。
推荐理由:AuK以十五亿参数和四步推理覆盖零样本合成、声学编辑、语音增强及源分离,意味着多项语音任务正被统一为自然语言驱动的单模型接口。
阅读原文