开源方案将推测解码草稿模型迁至外部GPU,为上下文长度或量化精度释放显存。
推荐理由:方案通过TCP或RDMA把草稿模型卸载到闲置的10至24GB显卡,无需扩容Spark即可腾出显存,实质是在通信开销与上下文容量间做资源置换。
阅读原文