AI@NEWS
离线到在线RL的三种状态
论文用稳定性-可塑性框架解释离线预训练到在线微调表现不一致的问题。
推荐理由:
它把在线微调失败归因于未保护更强的离线先验,而非单一算法缺陷;对机器人和智能体RL的调参策略有直接解释力。
阅读原文