科研智能体新基准揭示开闭源鸿沟
GPT-6 Astra与Claude Opus 5.5在70项真实科研任务中分别以63%和62%领先。
推荐理由:70项真实科研任务中,闭源领先模型仅约六成通过,而最佳开放权重模型不足一成,显示科研智能体能力与开放生态之间仍存在巨大断层。
GPT-6 Astra与Claude Opus 5.5在70项真实科研任务中分别以63%和62%领先。
推荐理由:70项真实科研任务中,闭源领先模型仅约六成通过,而最佳开放权重模型不足一成,显示科研智能体能力与开放生态之间仍存在巨大断层。