HuatuoGPT-3-27B取消医疗监督微调前置阶段,并开放训练资产。
推荐理由:OnePO用单次强化学习完成医疗适配,并随模型进步撤除教师指导,省去领域监督微调;代码、数据和评分器开放也便于复现验证。
阅读原文