AI@NEWS

前缀感知路由显著降低大模型延迟

SageMaker按提示前缀聚合请求,使KV缓存命中率超80%,首词延迟最多降77%。

推荐理由:关键变化是把共享提示前缀的请求固定路由至同一实例,以调度策略换取缓存复用;70B模型数据表明其能显著改善在线推理首词延迟。

阅读原文