模型以评分指针头替代生成头,结合LoRA微调,实现百毫秒级本地决策。
推荐理由:仅用百万级评分头和rank-16 LoRA改造Qwen3.5-2B,即取得同级领先及113毫秒中位时延,表明智能体路由可摆脱大模型生成与云端依赖。
阅读原文