合成超过2000小时语音,覆盖打断、附和、不完整表达、情绪及声音事件。
推荐理由:数据同时覆盖三类全双工行为、角色一致情绪和脚本化环境声,规模超过两千小时;它补齐语音智能体训练中交互动态与声学场景割裂的问题。
阅读原文