SRPO将共同触发一次环境转移的多条输出作为一个集合式动作优化。
推荐理由:现有方法逐响应更新,却由多条输出共同决定环境状态,训练单位与真实动作错位;SRPO按最小活跃输出集合分配优势,有望改善多智能体协作中的信用归因。
阅读原文