ARC榜单争议暴露评测变量
GPT-5.6 Sol在官方ARC-AGI-3榜单仍落后Opus 5,但自定义记忆机制显著抬高成绩。
推荐理由:Sol从标准harness低分到带保留推理和压缩记忆后达38.3%,说明ARC-AGI-3已在测模型加代理记忆系统,排行榜可比性取决于上下文管理规则。
GPT-5.6 Sol在官方ARC-AGI-3榜单仍落后Opus 5,但自定义记忆机制显著抬高成绩。
推荐理由:Sol从标准harness低分到带保留推理和压缩记忆后达38.3%,说明ARC-AGI-3已在测模型加代理记忆系统,排行榜可比性取决于上下文管理规则。