AI@NEWS

融合声学与语义视角检测伪造语音

CRAF融合自监督声学特征与音频大模型语义表征,提升对未知语音伪造的泛化。

推荐理由:自监督模型擅长捕捉底层伪造痕迹,音频大模型提供高层上下文,CRAF以残差感知方式融合两者;核心诉求是减少检测器对已知攻击类型的依赖。

阅读原文