作者从现代LLM训练流程推测新模型更啰嗦、机械和过度执行的成因。
推荐理由:这类观察击中RLHF与偏好优化的副作用:模型被奖励成“安全、完整、可控”,牺牲自然语气和意图边界;对产品调参与写作评测都有现实含义。
阅读原文