AI@NEWS

华佗GPT以单阶段强化学习训医疗模型

HuatuoGPT-3-27B取消医疗监督微调前置阶段,并开放训练资产。

推荐理由:OnePO用单次强化学习完成医疗适配,并随模型进步撤除教师指导,省去领域监督微调;代码、数据和评分器开放也便于复现验证。

阅读原文