该模型支持26万词元上下文、可调推理、工具调用及文本图像视频理解。
推荐理由:其72层中仅18层采用全局注意力,其余使用状态大小不随序列增长的门控递归层,意在显著压低26万词元上下文的KV缓存成本。
阅读原文