AI@NEWS

SupraBrain发布50M混合语言模型

SupraBrain-50M采用线性递归、滑窗注意力和门控更新机制,并声称低数据训练接近基线。

推荐理由:50M小模型用5B token接近20B token训练基线,真正看点是线性递归与局部注意力混合是否能提升数据效率,但当前证据主要来自自报benchmark。

阅读原文