AI@NEWS
形式化揭示机制可解释性的脆弱性
轻微语义扰动即可翻转可解释替代网络的主导特征,动摇其解释可信度。
推荐理由:
即便原模型判断语义近似不变,解释网络展示的主导特征也可能翻转;这说明干净样本拟合度不足以证明机制解释忠实。
阅读原文