AI@NEWS

多轮智能体的自蒸馏存在信息错配

研究发现特权信息自蒸馏会让学生模仿无依据的自信行为,多轮任务表现甚至可能低于未训练模型。

推荐理由:教师凭特权信息产生动作,学生却被要求在看不到依据时复刻,结果学到的是虚假自信而非信息获取策略;这解释了多轮场景中自蒸馏为何可能输给普通RL。

阅读原文