AI@NEWS

用GRPO训练17亿参数模型生成SPARQL

研究以结果奖励训练Qwen3-1.7B,在DBLP领域探索零样本文本到SPARQL。

推荐理由:亮点是绕过金标准查询标注,直接用可执行结果奖励训练十七亿参数模型;若效果稳健,可明显降低垂直知识图谱问答的监督成本。

阅读原文