AI@NEWS

音频大模型为何忽略声学线索

统一管线对比多种音频编码器,发现更换前端并不能解决声学信息利用不足。

推荐理由:在同一Qwen3.5-4B管线中替换Whisper、EnCodec等编码器后,声学线索利用仍未根治,且Whisper整体更强;瓶颈可能在跨模态对齐或语言模型读取机制。

阅读原文