社区公布Q4量化模型在M3 Ultra及llama.cpp配置下的推理性能数据。
推荐理由:实测给出千词预填充约559 token/s、首字延迟约3.31秒,并附量化文件与运行参数,可用于判断苹果本地长上下文部署成本。
阅读原文