面向物理智能体的多模态模型,可输入文本、图像、视频和音频并输出空间标注。
推荐理由:模型不只生成文本,还原生返回点、框、多边形及视频片段,意味着视觉理解结果可直接转成机器人定位与操作接口,减少感知到行动间的工程转换。
阅读原文