MISVO以Fisher二次型限制预对数转向,在适配测试时奖励时减少输出分布破坏。
推荐理由:方法用词元分布的局部KL几何量化干预代价,并可解析计算梯度;这为冻结模型的测试时优化提供了兼顾奖励与生成质量的约束。
阅读原文