研究自动修改任务图像是否能提升视频基础模型表现。
推荐理由:把prompt engineering从文字扩展到视觉输入本身,实质是在输入空间做可学习干预;若有效,视频推理性能可通过前处理提升而非重训模型。
阅读原文