作者搭建了30多个小型领域基准,用于比较本地模型在具体任务上的表现和失败点。
推荐理由:核心价值在于把本地模型评测从通用榜单拆到具体领域任务,并展示按问题定位失败模式;这更接近实际选型,可帮助判断小模型是否能胜任特定工作流。
阅读原文