苹果提出低内存音频合成架构,用于Siri Expressive Voices端侧实时语音生成。
推荐理由:论文披露Siri端侧语音生成的关键工程路径:用解耦时序深度DiT和RVQ表示压低内存,使高保真合成能跑在AMX预算内。
阅读原文