研究以结果奖励训练Qwen3-1.7B,在DBLP领域探索零样本文本到SPARQL。
推荐理由:亮点是绕过金标准查询标注,直接用可执行结果奖励训练十七亿参数模型;若效果稳健,可明显降低垂直知识图谱问答的监督成本。
阅读原文