Qwen3.8-Flash开源发布
阿里发布125B MoE多模态模型,并开源Next架构权重,指向Qwen4方向。
推荐理由:125B总参、每token激活6B,却把1M上下文Attention加速到Prefill 7.6倍,说明长上下文成本瓶颈正从堆显存转向稀疏检索式架构。
阿里发布125B MoE多模态模型,并开源Next架构权重,指向Qwen4方向。
推荐理由:125B总参、每token激活6B,却把1M上下文Attention加速到Prefill 7.6倍,说明长上下文成本瓶颈正从堆显存转向稀疏检索式架构。