MiMo-V2.6以高强度强化学习显著提升综合智能与长程软件工程能力。
推荐理由:Pro版以约262万美元、六天内三十步强化学习,将AA指数从26推至46、DeepSWE升至65.7,显示扩展RL算力可快速改写开源模型上限。
阅读原文