AI@NEWS

DVP高效适配多模态模型

DVP用模态特定Transformer替换上层视觉处理,降低MLLM视觉指令微调成本。

推荐理由:核心判断是深层视觉Token和文本Token需求分化,没必要全参微调统一Transformer;这种替换式适配若稳健,可降低MLLM训练门槛。

阅读原文