Splash在苹果芯片实现原生8位推理
开发者扩展Splash引擎,在M5 Pro上以37至55词元每秒运行Qwen3.8-27B。
推荐理由:实测显示原生八位量化可在六十四GB统一内存设备上维持较高生成速度,并探索二十五万六千上下文扩展,为规避四位量化的推理能力断崖提供工程路径。
开发者扩展Splash引擎,在M5 Pro上以37至55词元每秒运行Qwen3.8-27B。
推荐理由:实测显示原生八位量化可在六十四GB统一内存设备上维持较高生成速度,并探索二十五万六千上下文扩展,为规避四位量化的推理能力断崖提供工程路径。