作者从购买5090到扩展小型算力集群,反思多数任务其实单卡已足够。
推荐理由:个人经历折射本地LLM部署的真实边界:上下文和百B模型推高显存需求,但实际任务常被单卡满足,算力投入需按工作负载校准。
阅读原文