AI@NEWS

MiniMax H3登陆Hugging Face

MiniMax H3支持文本、图像、视频、音频理解,并可生成最高2K、15秒立体声音视频。

推荐理由:H3把多模态理解和带立体声的视频生成放进统一系统,2K与15秒参数虽未必领先,但若预训练阶段已具备复杂指令泛化,说明国产模型正从拼单项指标转向端到端媒体生成。

阅读原文