AI@NEWS

用局部KL几何约束模型转向

MISVO以Fisher二次型限制预对数转向,在适配测试时奖励时减少输出分布破坏。

推荐理由:方法用词元分布的局部KL几何量化干预代价,并可解析计算梯度;这为冻结模型的测试时优化提供了兼顾奖励与生成质量的约束。

阅读原文