AdaThinkV通过强化学习让视频模型按问题难度决定是否展开显式推理。
推荐理由:它不靠人工难度标签、阈值或外部路由器,而是在显式推理与直接回答的匹配轨迹中学习省token,切中视频CoT推理成本痛点。
阅读原文