Speech可依据文本、音色和曲风提示,一次生成融合朗读与原创配乐的完整音轨。
推荐理由:核心变化是把语音合成与配乐创作从后期拼接改为端到端联合生成,显著压缩播客、有声内容制作链路;但口音漂移和表演过度说明长程韵律控制仍未成熟。
阅读原文