CRAF融合自监督声学特征与音频大模型语义表征,提升对未知语音伪造的泛化。
推荐理由:自监督模型擅长捕捉底层伪造痕迹,音频大模型提供高层上下文,CRAF以残差感知方式融合两者;核心诉求是减少检测器对已知攻击类型的依赖。
阅读原文