新模型扩大基座与强化学习训练,重点提升长时编程、上下文管理和专业知识任务。
推荐理由:核心变化不是单项跑分,而是把训练重心转向耗时数小时的任务及输出自检;若成本与速度确实维持不变,将增强其在复杂代理工作流中的竞争力。
阅读原文