强化学习中BatchNorm模式的反转效应
特定前向阶段选择批统计或运行统计,可逆转BatchNorm在离散价值学习中的退化。
推荐理由:性能问题并非BatchNorm天然不适合离散Q学习,而是自举等前向环节使用了错误统计模式;这一小配置可改变C51和PQN结论,也提示复现实验须记录推理状态。
特定前向阶段选择批统计或运行统计,可逆转BatchNorm在离散价值学习中的退化。
推荐理由:性能问题并非BatchNorm天然不适合离散Q学习,而是自举等前向环节使用了错误统计模式;这一小配置可改变C51和PQN结论,也提示复现实验须记录推理状态。