AI@NEWS

双卡异构运行262K上下文Qwen 27B

作者为Ollama移植NVFP4 KV缓存,并按算力在RTX 5090与3090 Ti间分配模型层。

推荐理由:核心是通过NVFP4压缩KV缓存并按算力异构分层,让27B量化模型扩展至262K上下文;同时修复CUDA内核缺陷,但尚缺完整性能与精度数据验证收益。

阅读原文