AI@NEWS

用模型隐状态检测有害内容

从LLaMA-3.1-8B激活中训练1260万参数探针,以低开销识别有害提示。

推荐理由:研究直接利用模型内部激活而非外置护栏识别风险,1260万参数探针有望减少推理延迟;实质是把安全判断嵌入模型计算路径,但泛化仍待检验。

阅读原文