TwIL-LM3-Pro结合逻辑微调、权重回融与验证器强化学习提升推理。
推荐理由:3.6B模型宣称以95.4分显著超过Qwen3-8B的63.7,真正有价值的是可编程验证器驱动的训练配方;若可复现,将增强端侧推理可行性。
阅读原文