研究发现共享Transformer可在早中层自行形成可用于任务的感知表征。
推荐理由:结果表明轻量投影后的图像或音频输入无需独立重型编码器,感知编码可内化进共享主干的早中层;这为简化多模态架构与统一训练提供机制依据。
阅读原文