AI@NEWS

SageMaker半年上线13项推理能力

AWS集中升级托管端点与HyperPod推理,覆盖容量调度、分层KV缓存及预填充解耦。

推荐理由:重点不在发布数量,而是AWS将容量管理、分层KV缓存和预填充解耦纳入托管栈,表明云厂商正把大模型推理优化从工程技巧沉淀为标准基础设施。

阅读原文