AI@NEWS

LLM榜单与可用性脱节讨论

作者认为Gemma 4在实际写作迭代中优于部分更高排名模型。

推荐理由:核心价值在于把榜单分数和交互可控性拆开看:小模型可能在遵循迭代意图、避免过度改写上胜出,提示评测需补足真实任务体验维度。

阅读原文