从LLaMA-3.1-8B激活中训练1260万参数探针,以低开销识别有害提示。
推荐理由:研究直接利用模型内部激活而非外置护栏识别风险,1260万参数探针有望减少推理延迟;实质是把安全判断嵌入模型计算路径,但泛化仍待检验。
阅读原文