基于574次历史运行,比较抽样、缓存、固定子集和IRT自适应评测。
推荐理由:研究来自月活数万用户的真实分析智能体,并用时间切分检验574次历史运行;核心贡献是量化评测成本与稳定性的权衡,比静态基准更贴近持续发布决策。
阅读原文