Thinking Machines推出276B总参数、12B激活的多模态MoE模型。
推荐理由:12B激活参数逼近大版Inkling多项成绩,说明MoE缩放正在从堆总参数转向训练配方和激活成本优化,利于低延迟代理任务。
阅读原文