两款模型支持实时音频、视觉定位、97种语言切换及对话中后台工具调用。
推荐理由:关键变化是推理、语音响应与工具调用可并行运行,助手无需停顿等待任务完成;这将降低复杂语音代理的交互延迟,并简化多模态应用接入。
阅读原文