用户询问本地推理机在代理、文档和家居场景下该用什么基准评测。
推荐理由:问题暴露本地LLM评测的核心错配:SWE-bench等通用榜单未必对应代理、OCR归档和家庭自动化任务,场景化任务集更有意义。
阅读原文