llama.cpp为Qwen4启用稀疏Flash Attention
相关CUDA PR为Qwen4接入稀疏Flash Attention,以加速本地推理。
推荐理由:该改动把稀疏Flash Attention接入Qwen4的CUDA路径,指向更低的注意力计算开销与更快本地推理;但正文未提供基准数据,真实性能增益尚无法量化。
相关CUDA PR为Qwen4接入稀疏Flash Attention,以加速本地推理。
推荐理由:该改动把稀疏Flash Attention接入Qwen4的CUDA路径,指向更低的注意力计算开销与更快本地推理;但正文未提供基准数据,真实性能增益尚无法量化。