作者训练小语言模型,尝试替代响应需近一秒的Gemini Flash来实时提示用户下一步操作。
推荐理由:案例揭示高频内部工具的核心约束不是模型能力而是端到端延迟:即便响应仅需0.9秒,也会打断连续操作,小模型因而有明确落地空间。
阅读原文