AI@NEWS

16GB显卡运行Qwen 27B达每秒60词元

用户以低比特主模型配合草稿模型,在RX 9070 XT上测得约60 tokens/s。

推荐理由:实测表明外置投机草稿模型可在16GB显存上明显优于内置MTP,但越界至共享内存会放大性能波动,收益高度依赖显存控制。

阅读原文