AI@NEWS

SRPO按联合动作训练多智能体LLM

SRPO将共同触发一次环境转移的多条输出作为一个集合式动作优化。

推荐理由:现有方法逐响应更新,却由多条输出共同决定环境状态,训练单位与真实动作错位;SRPO按最小活跃输出集合分配优势,有望改善多智能体协作中的信用归因。

阅读原文