通过调整推理预算、上下文和工具输出策略,双3090上的平均单轮等待从28秒降至7秒。
推荐理由:四倍延迟改善主要来自显式设置推理强度,避免未配置角色默认使用xhigh;同时扩展输出上限并将大工具结果落盘,减少无效推理与截断。
阅读原文