AI@NEWS

Ox Alpha实为GLM-5.3-Flash

新模型以320B总参数、18B激活参数的稀疏MoE,融合混合注意力、四流残差与原生视觉编码器。

推荐理由:核心变化是以34层KDA搭配11层MLA/DSA,将模型由744B-A40B缩至320B-A18B;在保留稀疏能力的同时显著压低推理成本,并转向原生多模态。

阅读原文