-
题名融合自监督和多层交叉注意力的多模态情感分析网络
- 1
-
-
作者
薛凯鹏
徐涛
廖春节
-
机构
西北民族大学中国民族信息技术研究院
语言与文化计算教育部重点实验室(西北民族大学)
-
出处
《计算机应用》
CSCD
北大核心
2024年第8期2387-2392,共6页
-
基金
甘肃省高等学校青年博士基金资助项目(2022QB-016)
中央高校基本科研业务费专项(31920230069)
+1 种基金
甘肃省青年科技计划项目(21JR1RA21)
国家档案局科技项目(2021-X-56)。
-
文摘
针对多模态情感分析任务中模态内信息不完整、模态间交互能力差和难以训练的问题,将视觉语言预训练(VLP)模型应用于多模态情感分析领域,提出一种融合自监督和多层交叉注意力的多模态情感分析网络(MSSM)。通过自监督学习强化视觉编码器模块,并加入多层交叉注意力以更好地建模文本和视觉特征,使模态内部信息更丰富完整,同时使模态间的信息交互更充分。此外,通过具有感知意识的快速、内存效率高的精确注意力FlashAttention解决Transformer中注意力计算高复杂度的问题。实验结果表明,与目前主流的基于对比文本-图像对的模型(CLIP)相比,MSSM在处理后的MVSA-S数据集上的准确率提高3.6个百分点,在MVSA-M数据集上的准确率提高2.2个百分点,验证所提网络能在降低运算成本的同时有效提高多模态信息融合的完整性。
-
关键词
多模态
情感分析
自监督
注意力机制
视觉语言预训练模型
-
Keywords
multimodal
sentiment analysis
self-supervision
attention mechanism
Visual-and-Language Pre-training(VLP)model
-
分类号
TP391.41
[自动化与计算机技术—计算机应用技术]
-