作者认为Gemma 4在实际写作迭代中优于部分更高排名模型。
推荐理由:核心价值在于把榜单分数和交互可控性拆开看:小模型可能在遵循迭代意图、避免过度改写上胜出,提示评测需补足真实任务体验维度。
阅读原文