将思考、行动、发声与协调统一训练,面向可执行任务的实时语音交互。
推荐理由:模型不再只做语音问答,而以蒸馏迁移语言推理能力,并在可执行环境中用多粒度轨迹强化行动策略,标志实时语音模型正转向原生智能体接口。
阅读原文