AI@NEWS

形式化揭示机制可解释性的脆弱性

轻微语义扰动即可翻转可解释替代网络的主导特征,动摇其解释可信度。

推荐理由:即便原模型判断语义近似不变,解释网络展示的主导特征也可能翻转;这说明干净样本拟合度不足以证明机制解释忠实。

阅读原文