5520亿参数MoE仅激活80亿输入及160亿输出参数,并大幅压缩缓存成本。
推荐理由:以输入80亿、输出160亿激活参数驱动5520亿规模模型,并将显存缓存降至四分之一,意味着大模型智能体的推理与长上下文成本可显著下降。
阅读原文