AI@NEWS

多模态Transformer中的虚拟编码器

研究发现共享Transformer可在早中层自行形成可用于任务的感知表征。

推荐理由:结果表明轻量投影后的图像或音频输入无需独立重型编码器,感知编码可内化进共享主干的早中层;这为简化多模态架构与统一训练提供机制依据。

阅读原文