Kimi K3 被评最接近前沿, 但过度反复修改任务
知名研究者试用 Kimi K3 后称其是目前最接近前沿水平的开源模型, 但 agent 循环行为明显, 会反复回头微调已完成任务。
推荐理由:第三方实测把 K3 定位为开源侧最接近闭源前沿的一次, 但暴露 harness 层过度迭代的通病——能力上去后, agent 停止判据成为新瓶颈, 这是评估下一代编码 agent 的关键维度。
知名研究者试用 Kimi K3 后称其是目前最接近前沿水平的开源模型, 但 agent 循环行为明显, 会反复回头微调已完成任务。
推荐理由:第三方实测把 K3 定位为开源侧最接近闭源前沿的一次, 但暴露 harness 层过度迭代的通病——能力上去后, agent 停止判据成为新瓶颈, 这是评估下一代编码 agent 的关键维度。