华佗GPT-3以单阶段强化学习适配医疗
9B医疗模型基于Qwen3.5,以OnePO跳过领域监督微调,并开放代码、数据与评分器。
推荐理由:OnePO将医疗适配压缩为单次强化学习,教师回答只作临时引导并随能力提升退出;若效果可复现,可显著降低医疗模型对昂贵监督微调数据的依赖。
9B医疗模型基于Qwen3.5,以OnePO跳过领域监督微调,并开放代码、数据与评分器。
推荐理由:OnePO将医疗适配压缩为单次强化学习,教师回答只作临时引导并随能力提升退出;若效果可复现,可显著降低医疗模型对昂贵监督微调数据的依赖。