帖子称Opus 5.5与GPT-6在终端和跨应用自动化基准上表现突出。
推荐理由:真正信号是模型在终端操作与跨应用自动化任务上的能力分化,而非单一总分;但帖子未附成绩表和测试设置,抗污染结论尚无依据。
阅读原文