Hy3以295B总参、21B激活和256K上下文,在盲测中超过GLM-5.1。
推荐理由:Hy3的关键不只是盲测成绩,而是用21B激活参数和普通GQA实现256K上下文;若属实,说明中国大模型效率提升仍未吃满稀疏注意力等架构红利。
阅读原文