作者观察到“去审查”LLM不只减少拒答,也显著改变预测语气。
推荐理由:关键点是abliteration可能改变模型行为分布,而非单纯移除安全拒答;若属实,金融预测等高风险任务会引入系统性乐观偏差。
阅读原文