3.66B模型经多阶段后训练,Q4版本约2GB,可在4GB显存或CPU运行。
推荐理由:项目用LoRA、权重插值和熵加权GRPO把形式逻辑能力压入3.66B模型,体现竞争壁垒正从扩大预训练规模转向高效后训练与端侧适配。
阅读原文