AI@NEWS

推理强度并非与模型能力无关

作者援引R1-Zero,认为更长推理可显著提高数学成绩,但未证明所有配置都单调增益。

推荐理由:R1-Zero确实表明强化学习诱导的长推理能提升AIME,但这不能直接证明产品中max档必胜high档,二者机制未必等价。

阅读原文