训练时以领域或实例优化的脚手架指导智能体,将其诱导行为内化到模型中。
推荐理由:它试图把外部脚手架带来的规划与交互增益蒸馏进模型,使部署时不再绑定特定编排系统;这可减少多领域脚手架路由和维护负担。
阅读原文