)
1、论文链接Knowledge-Guided Dynamic Modality Attention Fusion Framework for Multimodal Sentiment Analysis - ACL Anthology2、模型名称KuDA3、研究思路1对于不同视频样本文本、音频和视觉的重要性并不相同模型能否根据当前样本动态判断哪一种模态更值得信任并据此调整融合权重。把“固定模态地位”改成“样本级动态主导模态”2利用单模态情感监督构造贡献比例并用贡献比例控制动态融合在模态分布均衡的数据集上验证优势。特色设计动态融合模态KuDA 其实没有让文本、视觉、音频轮流当 QKuDA 在动态注意力模块中使用的是QF^n−1 也就是上一层的多模态融合表示作为 Query。文本、视觉和音频分别作为三条分支的 Key 和 ValueAttention(Fn−1,Ut,Ut) Attention(Fn−1,Uv,Uv) Attention(Fn−1,Ua,Ua)它始终让多模态表示 F 当 Q再分别向三种模态检索信息。其“动态主导”来自两个方面。第一不同样本中融合表示与三种单模态表示的匹配程度不同因此三个跨模态注意力分支得到的信息量不同。第二训练阶段使用情感比例Rt,Rv,Ra,对三条分支进一步放大或缩小Rm×Fm→f 所以KuDA 的主导模态不是由“交换 Q”实现的而是由多模态 Query 与各单模态的匹配程度显式模态比例调节共同实现的效果数据集表现KuDA 的问题设定在 CH-SIMS、CH-SIMSv2 上更加充分在 MOSI、MOSEI 上则主要表现为对少量非文本主导样本的补充1、CH-SIMSv2 上提升最明显 这是整篇论文最有说服力的实验结果。因为 CH-SIMSv2 的单模态重要性分布相对均衡文本、视觉和音频都可能成为主导模态所以动态主导模态的设定与数据集特性高度匹配。2、MOSI 上只有小幅提升这很符合 MOSI 的数据分布文本本来就是绝对主导模态因此“允许任意模态动态成为主导”的空间并不大。3、MOSEI 并非所有指标最好KuDA 在 MOSEI 上的 MAE 和 Corr 较好Acc-2 与 F1 也有竞争力但 Acc-7 为 52.89低于 Self-MM 的 53.87、ALMT 的 53.62 和 CubeMLP 的 53.35。作者统计了 CH-SIMS 和 CH-SIMSv2 的单模态标签。在这两个数据集中以视觉、文本或音频作为主导模态的样本比例都不低单个模态大致能在 45%60% 的样本中成为主导模态。与此同时约一半样本至少包含一个与整体情感极性不一致的“噪声模态”。消融实验1、动态融合模块确实是整个模型的主要性能来源。模态删除实验传达了一个重要事实论文还分别删除某一种模态对 KuDA、ALMT 和 CubeMLP 进行比较。在 MOSI 上只保留视觉和音频时KuDA 的 Acc-7 只有 17.20ALMT 为 15.74CubeMLP 为 15.45一旦保留文本无论是文本视觉还是文本音频Acc-7 都能恢复到 4243 左右。这再次证明KuDA 并没有改变 MOSI 的文本主导事实。 它只是比其他模型更善于在文本以外寻找有限的补充信息并不意味着音频或视觉已经能够在 MOSI 上稳定取代文本。在 CH-SIMSv2 上删除某一模态后的下降相对更加均衡说明该数据集中的三种模态确实具有更均衡的重要性。这也是 KuDA 在 CH-SIMSv2 上提升明显、在 MOSI 上提升有限的根本原因。其他团队桂林电子科技大学广西可信软件重点实验室团队核心作者包括 Xinyu Feng、Yuming Lin 等。年份2024 年。平台Findings of EMNLP 2024。感悟1、但“谁当 Q”不等于“谁贡献最大”2、文本主导的范式不是唯一的至少可以有三种架构立场文本中心文本作为主要融合载体A/V 用来增强文本三模态对称三种模态平行交互不预设主导者动态主导根据样本内容和可靠性动态调整三种模态贡献。MOSI、MOSEI 强文本主导适合验证语言中心方法以及文本损坏后的鲁棒性CH-SIMS、CH-SIMSv2 提供更均衡的模态贡献分布其中不同样本可能由文本、视觉或音频主导更适合研究动态模态选择、模态贡献和非文本补偿。