该开源后训练模型称减少58%思考Token、提速1.95倍,准确率损失低于1%。
推荐理由:方法并非直接截断推理,而是惩罚与过度思考相关的Token,再用在线策略蒸馏补回精度;若结果可复现,将显著改善推理模型成本效率。
阅读原文