模型宣称智能较前代提升40%,在常见英伟达GPU上达到每秒1107词元。
推荐理由:若第三方评测确认其以每秒1107词元达到主流低延迟模型水平,扩散式语言模型将不再只是速度演示,而可能重写实时推理的成本结构。
阅读原文