DVP高效适配多模态模型
DVP用模态特定Transformer替换上层视觉处理,降低MLLM视觉指令微调成本。
推荐理由:核心判断是深层视觉Token和文本Token需求分化,没必要全参微调统一Transformer;这种替换式适配若稳健,可降低MLLM训练门槛。
DVP用模态特定Transformer替换上层视觉处理,降低MLLM视觉指令微调成本。
推荐理由:核心判断是深层视觉Token和文本Token需求分化,没必要全参微调统一Transformer;这种替换式适配若稳健,可降低MLLM训练门槛。