AI@NEWS

恒定步长下稳定的正则强调TD

反例证明ETD均值收缩仍可能样本发散,并提出正则化修复方法。

推荐理由:两状态反例中ETD的期望映射虽收缩,随机更新乘积的顶Lyapunov指数仍为正,揭示均值稳定不等于训练稳定;RETD针对冲击后动态进行归一化修复。

阅读原文