AI@NEWS

涌现失配并非神秘现象

将窄域有害微调后的广泛失配解释为可预测、由数据决定的泛化。

推荐理由:论文反驳“邪恶人格”式解释,把涌现失配还原为训练数据驱动的泛化机制;这使安全研究可转向识别触发样本与可预测路径,而非依赖模糊表征方向。

阅读原文