协议比较模拟用户加LLM裁判的排名与可验证真实奖励,覆盖六家供应商25个智能体。
推荐理由:它直接检验离线评测能否选对模型,而非只看裁判分数相关性;跨六家供应商、二十五个代理的设计可暴露发布门禁中的系统性错排。
阅读原文