AI@NEWS

Qwen3.8-Flash开源发布

阿里发布125B MoE多模态模型,并开源Next架构权重,指向Qwen4方向。

推荐理由:125B总参、每token激活6B,却把1M上下文Attention加速到Prefill 7.6倍,说明长上下文成本瓶颈正从堆显存转向稀疏检索式架构。

阅读原文