AI@NEWS

GAUGE检验LLM裁判能否正确选出智能体

协议比较模拟用户加LLM裁判的排名与可验证真实奖励,覆盖六家供应商25个智能体。

推荐理由:它直接检验离线评测能否选对模型,而非只看裁判分数相关性;跨六家供应商、二十五个代理的设计可暴露发布门禁中的系统性错排。

阅读原文