AI@NEWS

新模型基准成绩显示自动化能力分化

帖子称Opus 5.5与GPT-6在终端和跨应用自动化基准上表现突出。

推荐理由:真正信号是模型在终端操作与跨应用自动化任务上的能力分化,而非单一总分;但帖子未附成绩表和测试设置,抗污染结论尚无依据。

阅读原文