单张RTX 5090运行Qwen获50词每秒
FreeToken借助专家缓存,让Qwen-3.8-Flash-Next在单张RTX 5090上实现约50词每秒生成。
推荐理由:在llama.cpp尚未合入MoE专家缓存时,FreeToken将单卡RTX 5090生成速度提升至约40至60词每秒,表明缓存命中可显著降低本地MoE推理门槛。
FreeToken借助专家缓存,让Qwen-3.8-Flash-Next在单张RTX 5090上实现约50词每秒生成。
推荐理由:在llama.cpp尚未合入MoE专家缓存时,FreeToken将单卡RTX 5090生成速度提升至约40至60词每秒,表明缓存命中可显著降低本地MoE推理门槛。