AI@NEWS

去审查模型更乐观

作者观察到“去审查”LLM不只减少拒答,也显著改变预测语气。

推荐理由:关键点是abliteration可能改变模型行为分布,而非单纯移除安全拒答;若属实,金融预测等高风险任务会引入系统性乐观偏差。

阅读原文