Qwen论文用可演化技能库约束自生成任务,提升LLM训练数据质量。
推荐理由:关键点不是让Agent临场调用技能,而是把技能变成训练课程生成器:任务创建、校验和扩展都被模板化,试图解决自博弈数据失控与可验证性不足的问题。
阅读原文