AI@NEWS

iLLaDA:改进版大语言扩散模型

iLLaDA从零训练8B全双向注意力掩码扩散模型,预训练扩到12T token。

推荐理由:8B全双向掩码扩散模型预训练扩至12T token,证明扩散范式在大规模下可与自回归竞争,为非自回归LLM路线再添一份硬实证。

阅读原文