作者汇总10个DeepSeek模型在35个提示上的242个oneshot结果。
推荐理由:242个样本能提供粗粒度体感对比,尤其暴露provider错误和空输出问题;但缺少评分协议,适合作为探索材料而非模型排名依据。
阅读原文