开源方案将模型稠密部分、KV缓存和部分层分配给GPU,其余交由APU执行。
推荐理由:价值在于按组件拆分模型,而非要求整模装入独显,可利用大内存APU补足显存并提升本地推理;但“超过DGX Spark”仍需统一模型和功耗测试验证。
阅读原文