观点认为LLM在形式领域变强的同时,也会迁移提升到较难验证的开放领域。
推荐理由:这条的关键判断是反对把“答案可验证性”视为LLM能力上限:若形式推理改进能外溢到开放任务,模型评估就不能只盯数学代码等硬指标。
阅读原文