用旧设备池化内存运行30B本地模型
开发者通过局域网聚合迷你PC与Mac内存,分布式加载30B模型并实现约35 tokens/s。
推荐理由:仅用约17.5GB跨设备内存便加载30B模型,并在普通局域网上达到约35 tokens/s和一秒延迟;说明消费级异构设备可用通信开销换取更低部署成本。
开发者通过局域网聚合迷你PC与Mac内存,分布式加载30B模型并实现约35 tokens/s。
推荐理由:仅用约17.5GB跨设备内存便加载30B模型,并在普通局域网上达到约35 tokens/s和一秒延迟;说明消费级异构设备可用通信开销换取更低部署成本。