AI@NEWS

M5 Ultra长上下文模型实测对决

同机无缓存测试中,Qwen3.8在200K上下文预填充速度约为Laguna的9.7倍。

推荐理由:排除KV缓存后,Qwen在8K至200K预填充稳定约4200 token/s,200K仅47.1秒、约为Laguna耗时一成,凸显长上下文推理栈优势。

阅读原文