GrammarRL针对语法有效但语义退化的问题,以强化学习优化受约束解码的内容质量。
推荐理由:语法约束只能保证输出可解析,却可能迫使模型走向低质量序列;用任务奖励直接训练约束下的决策,有望以低于宽束搜索的成本兼顾格式与语义。
阅读原文