Mac运行DS4 Flash量化方案
用户分享在M3 Ultra上运行DeepSeek V4 Flash MXFP4 MLX量化版本的速度体验。
推荐理由:MXFP4量化加MLX适配让大模型在M3 Ultra本地跑到约34到43 tok/s,显示高内存Mac正成为个人端大模型实验平台,但证据来自单用户测试。
用户分享在M3 Ultra上运行DeepSeek V4 Flash MXFP4 MLX量化版本的速度体验。
推荐理由:MXFP4量化加MLX适配让大模型在M3 Ultra本地跑到约34到43 tok/s,显示高内存Mac正成为个人端大模型实验平台,但证据来自单用户测试。