AI@NEWS

EPIG-Tree:计算最优的树状强化学习

把树状轨迹展开视为策略梯度的算力分配问题,提升奖励与梯度利用效率。

推荐理由:传统GRPO让整条轨迹共享一个优势值,难以区分关键决策与环境随机性;树状分支复用前缀并优化采样位置,可把有限推理算力集中到高信息决策点。

阅读原文