iLLaDA从零训练8B全双向注意力掩码扩散模型,预训练扩到12T token。
推荐理由:8B全双向掩码扩散模型预训练扩至12T token,证明扩散范式在大规模下可与自回归竞争,为非自回归LLM路线再添一份硬实证。
阅读原文