AI@NEWS

Qwen3.8模型在M3 Ultra上的实测

社区公布Q4量化模型在M3 Ultra及llama.cpp配置下的推理性能数据。

推荐理由:实测给出千词预填充约559 token/s、首字延迟约3.31秒,并附量化文件与运行参数,可用于判断苹果本地长上下文部署成本。

阅读原文