AI@NEWS

大模型写作退化的训练解释

作者从现代LLM训练流程推测新模型更啰嗦、机械和过度执行的成因。

推荐理由:这类观察击中RLHF与偏好优化的副作用:模型被奖励成“安全、完整、可控”,牺牲自然语气和意图边界;对产品调参与写作评测都有现实含义。

阅读原文