跨媒体深层细粒度关联学习方法被引量：12

Cross-media Deep Fine-grained Correlation Learning

下载PDF

导出

摘要随着互联网与多媒体技术的迅猛发展,网络数据的呈现形式由单一文本扩展到包含图像、视频、文本、音频和3D模型等多种媒体,使得跨媒体检索成为信息检索的新趋势.然而,"异构鸿沟"问题导致不同媒体的数据表征不一致,难以直接进行相似性度量,因此,多种媒体之间的交叉检索面临着巨大挑战.随着深度学习的兴起,利用深度神经网络模型的非线性建模能力有望突破跨媒体信息表示的壁垒,但现有基于深度学习的跨媒体检索方法一般仅考虑图像和文本两种媒体数据之间的成对关联,难以实现更多种媒体的交叉检索.针对上述问题,提出了跨媒体深层细粒度关联学习方法,支持多达5种媒体类型数据(图像、视频、文本、音频和3D模型)的交叉检索.首先,提出了跨媒体循环神经网络,通过联合建模多达5种媒体类型数据的细粒度信息,充分挖掘不同媒体内部的细节信息以及上下文关联.然后,提出了跨媒体联合关联损失函数,通过将分布对齐和语义对齐相结合,更加准确地挖掘媒体内和媒体间的细粒度跨媒体关联,同时利用语义类别信息增强关联学习过程的语义辨识能力,提高跨媒体检索的准确率.在两个包含5种媒体的跨媒体数据集PKU XMedia和PKU XMediaNet上与现有方法进行实验对比,实验结果表明了所提方法的有效性. With the rapid development of the Internet and multimedia technology, data on the Internet is expanded from only text to image, video, text, audio, 3D model, and other media types, which makes cross-media retrieval become a new trend of information retrieval. However, the “heterogeneity gap” leads to inconsistent representations of different media types, and it is hard to measure the similarity between the data of any two kinds of media, which makes it quite challenging to realize cross-media retrieval across multiple media types. With the recent advances of deep learning, it is hopeful to break the boundaries between different media types with the strong learning ability of deep neural network. But most existing deep learning based methods mainly focus on the pairwise correlation between two media types as image and text, and it is difficult to extend them to multi-media scenario. To address the above problem, Deep Fine-grained Correlation Learning (DFCL) approach is proposed, which can support cross-media retrieval with up to five media types (image, video, text, audio, and 3D model). First, cross-media recurrent neural network is proposed to jointly model the fine-grained information of up to five media types, which can fully exploit the internal details and context information of different media types. Second, cross-media joint correlation loss is proposed, which combines distribution alignment and semantic alignment to exploit both intra-media and inter-media fine-grained correlation, while it can further enhance the semantic discrimination capability by semantic category information, aiming to promote the accuracy of cross-media retrieval effectively. Extensive experiments on 2 cross-media datasets are conducted, namely PKU XMedia and PKU XMediaNet datasets, which contain up to five media types. The experimental results verify the effectiveness of the proposed approach.

作者卓昀侃綦金玮彭宇新 ZHUO Yun-Kan;QI Jin-Wei;PENG Yu-Xin(Institute of Computer Science and Technology, Peking University, Beijing 100871, China)

机构地区北京大学计算机科学技术研究所

出处《软件学报》 EI CSCD 北大核心 2019年第4期884-895,共12页 Journal of Software

基金国家自然科学基金(61771025 61532005)~~

关键词跨媒体检索 5种媒体细粒度信息挖掘跨媒体循环神经网络跨媒体联合关联约束 cross-media retrieval quintuple-media fine-grained information mining cross-media recurrent neural network cross-media joint correlation constraint

分类号 TP37 [自动化与计算机技术—计算机系统结构]

引文网络
相关文献

参考文献1

1吴飞,庄越挺.互联网跨媒体分析与检索:理论与算法[J].计算机辅助设计与图形学学报,2010,22(1):1-9. 被引量：34

二级参考文献72

1Bushara K O, Hanakawa T, Immiseh I, et al. Neural correlates of cross-modal binding [J]. Nature Neuroseience, 2002, 6(2): 190-195.
2Ma Q, Nadamoto A, Tanaka K. Complementary information retrieval for cross-media news content [C] //Proceedings of the 2nd ACM International Workshop on Multimedia Databases, Washington D C, 2004:45-54.
3Zhu X J, Goldberg A B, Eldawy M, etal. A text-to-picture synthesis system for augmenting communication [C] // Proceedings of the 22nd AAAI Conference on Artificial Intelligence, Vancouver, 2007 : 681-687.
4Smoliar S W, Zhang H J. Content-based video indexing and retrieval[J]. IEEE Multimedia, 1994, 1(2): 62-72.
5Rui Y, Huang T S, Ortega M, et al. Relevance feedback: a power tool for interactive content based image retrieval [J]. IEEE Transactions on Circuits and Systems for Video Technology, 1998, 8(5): 644-655.
6Datta R, Joshi D, Li J, et al. Image retrieval: ideas, influences, and trends of the new age [J]. ACM Computing Surveys, 2008, 40(2): 5-60.
7Wu Y, Tian Q, Huang T S. Diseriminant-EM algorithm with application to image retrieval [C] //Proceedings of IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Hilton Head, 2000: 1222-1227.
8Tong S, Chang E. Support vector machine active learning for image retrieval [C] //Proceedings of the ACM International Conference on Multimedia, Ottawa, 2001:107-118.
9He X F, Ma W Y, Zhang H J. for retrieval [C] //Proceedings Conference on Multimedia, New Learning an image manifold of the ACM International York, 2004:17-23.
10Saul L K, Weinberger K Q, Sha F, et al. Spectral methods for dimensionality reduction [M]//Chapelle O, Scholkopf B, Zien A. Semisupervised Learning, Cambridge: MIT Press, 2006:293-308.

共引文献33

1曾庆春,韩月红,林海军.计算机与网络技术应用分析[J].科技创业家,2013(15). 被引量：1
2朱科,邵健,郭同强.局部样条嵌入的正交半监督子空间学习算法[J].计算机辅助设计与图形学学报,2010,22(12):2209-2214. 被引量：1
3毛楚祥,郑益.混合数据管理引擎[J].情报资料工作,2011,32(1):65-67. 被引量：2
4邵健,王霏.空间约束特征组合与选择的中国剪纸识别[J].计算机辅助设计与图形学学报,2011,23(5):778-783. 被引量：1
5张师林,李和平,张树武.稠密子图发现的视频语义挖掘方法[J].计算机工程与应用,2011,47(33):13-14. 被引量：3
6欧阳遄飞,张寅,张啸,邵健,吴飞.结构化稀疏谱哈希索引[J].计算机辅助设计与图形学学报,2012,24(1):60-67. 被引量：3
7訾玲玲,杜军平,胡娟.跨媒体搜索引擎TCSE的研究与实现[J].复杂系统与复杂性科学,2012,9(1):29-34. 被引量：1
8庄凌,庄越挺,吴江琴,叶振超,吴飞.一种基于稀疏典型性相关分析的图像检索方法[J].软件学报,2012,23(5):1295-1304. 被引量：23
9訾玲玲,杜军平.基于突发事件的跨媒体信息检索系统的研究[J].计算机仿真,2012,29(6):16-19. 被引量：3
10张寅,汤斯亮,罗杰斯,鲁伟明,邵健,吴飞.结合作者与地理信息的主题建模[J].计算机辅助设计与图形学学报,2012,24(9):1180-1187. 被引量：2

同被引文献59

1祁磊,于沛泽,高阳.弱监督场景下的行人重识别研究综述[J].软件学报,2020(9):2883-2902. 被引量：8
2何玲,黎加厚.促进学生深度学习[J].计算机教与学．现代教学,2005(5):29-30. 被引量：1307
3李峰,曾志明,付琨,吴一戎.遥感影像数据库基于内容检索系统的构建[J].武汉大学学报（信息科学版）,2005,30(9):787-790. 被引量：2
4张振亚,王进,程红梅,王煦法.基于余弦相似度的文本空间索引方法研究[J].计算机科学,2005,32(9):160-163. 被引量：51
5肖希明.信息资源建设:概念、内容与体系[J].中国图书馆学报,2006,32(5):5-8. 被引量：89
6庄毅,庄越挺,吴飞.一种支持海量跨媒体检索的集成索引结构[J].软件学报,2008,19(10):2667-2680. 被引量：13
7游泽清.画面语构学——多媒体画面语言的语法规则[J].中国信息技术教育,2011(21):23-27. 被引量：2
8曹喜信,刘京,杨旭东,吴帅,张奇惠.一种新的视频字幕提取算法(英文)[J].北京大学学报（自然科学版）,2013,49(2):197-202. 被引量：5
9张志武.跨领域迁移学习产品评论情感分析[J].现代图书情报技术,2013(6):49-54. 被引量：6
10庄福振,罗平,何清,史忠植.迁移学习研究进展[J].软件学报,2015,26(1):26-39. 被引量：458

引证文献12

1朱路,田晓梦,曹赛男,刘媛媛.基于高阶语义相关的子空间跨模态检索方法研究[J].数据分析与知识发现,2020,4(5):84-91. 被引量：4
2冯姣,陆昶谕.基于残差注意力网络的跨媒体检索方法[J].计算机科学,2021,48(S01):122-126. 被引量：2
3王金婉,朱学芳.迁移学习在信息资源开发及服务中的应用探索[J].情报理论与实践,2021,44(7):145-151. 被引量：1
4田枫,李闯,刘芳,李婷玉,张蕾,刘志刚.基于柯西分布的深度哈希跨媒体检索[J].计算机系统应用,2021,30(8):171-178. 被引量：1
5李春芳,刘永久,王楷翔,杨睿,张凌飞,李敏,邓智铭,石民勇.一种多模态跨媒体检索的融媒体影视系统[J].中国传媒大学学报（自然科学版）,2021,28(4):63-71. 被引量：2
6杜锦丰,王海荣,李明亮,梁焕.多层语义对齐的跨模态检索方法研究[J].郑州大学学报（理学版）,2021,53(4):83-88. 被引量：2
7梁美玉,王笑笑,杜军平.基于多模态图和对抗哈希注意力网络的跨媒体细粒度表示学习[J].模式识别与人工智能,2022,35(3):195-206. 被引量：2
8朱维乔.深度学习驱动的跨模态视觉数据搜索研究综述[J].高校图书馆工作,2022,42(5):41-45.
9曹夏琳,莫永华.“意向性”多媒体表征促进深度学习研究[J].教育信息化论坛,2022,6(19):27-29.
10吕亚飞,熊伟,张筱晗.一种通用的跨模态遥感信息关联学习方法[J].武汉大学学报（信息科学版）,2022,47(11):1887-1895. 被引量：3

二级引证文献17

1陈宁,段友祥,孙歧峰.跨模态检索研究文献综述[J].计算机科学与探索,2021,15(8):1390-1404. 被引量：8
2朱博文,李莲,姚建伟.迁移学习在医疗卫生领域中的应用[J].信息与电脑,2021,33(22):7-9.
3李星.基于语义匹配的外语翻译机器人自动问答检索研究[J].自动化与仪器仪表,2022(2):138-141. 被引量：2
4韩红旗,冉亚鑫,张运良,桂婕,高雄,易梦琳.基于共同子空间分类学习的跨媒体检索研究[J].计算机科学,2022,49(5):33-42.
5李春芳.《阮玲玉》计量分析与中国早期影人图谱[J].电影艺术,2022(4):34-45. 被引量：8
6朱维乔.深度学习驱动的跨模态视觉数据搜索研究综述[J].高校图书馆工作,2022,42(5):41-45.
7李浩然,熊伟,崔亚奇,顾祥岐,徐平亮.相似度矩阵辅助遥感图像无监督哈希跨模态关联[J].光子学报,2023,52(1):208-219.
8孟诗蓓,郑睿,常亮,陈玉珑,孟睿伟,程诺.基于全连接张量网络的多模态与多样性推荐算法[J].计算机系统应用,2023,32(2):63-74. 被引量：1
9谭钰,王小琴,蓝如师,刘振丙,罗笑南.基于判别性矩阵分解的多标签跨模态哈希检索[J].计算机应用,2023,43(5):1349-1354. 被引量：1
10李天煜,刘立波.基于模态内相似性与语义保留的深度跨模态哈希[J].数据分析与知识发现,2023,7(5):105-115.

1綦金玮,彭宇新,袁玉鑫.面向跨媒体检索的层级循环注意力网络模型[J].中国图象图形学报,2018,23(11):1751-1758. 被引量：5
2刘继斌.俄语动词体范畴的语义类别[J].学园,2018,11(27):141-142. 被引量：1
3杨晓英,熊永合,蔡延斌,孙增辉.Photoshop软件在影像数据接边中的应用[J].测绘与空间地理信息,2019,42(4):166-168. 被引量：3
4梁尔涛,张伟,施伟璜,邓成晨,彭攀,郑永艾.基于低轨卫星增强的非差高精度导航定位技术与在轨试验验证[J].上海航天,2019,36(1):16-22. 被引量：5
5韦冰琳.基于期待视野指导赏读经典美文[J].黑河教育,2019(5):43-44.
6胡亚南,田茂再.零膨胀计数数据的联合建模及变量选择[J].统计研究,2019,36(1):104-114. 被引量：5
7郑菲,孟朝晖,郭闯世.基于反卷积特征学习的图像语义分割算法[J].计算机系统应用,2019,28(1):147-155. 被引量：5
8盛光华,葛万达.社会互动视角下驱动消费者绿色购买的社会机制研究[J].华中农业大学学报（社会科学版）,2019(2):81-90. 被引量：12
9陈晓芳,蔡小庆,李丽芬.恩智浦智能车摄像头圆环处理方案[J].电工技术,2019(6):147-149. 被引量：3
10谢志华,江鹏,余新河,张帅.基于VGGNet和多谱带循环网络的高光谱人脸识别系统[J].计算机应用,2019,39(2):388-391. 被引量：12

软件学报

2019年第4期

浏览历史

内容加载中请稍等...

跨媒体深层细粒度关联学习方法被引量：12

参考文献1

二级参考文献72

共引文献33

同被引文献59

引证文献12

二级引证文献17

相关作者

相关机构

相关主题

浏览历史

跨媒体深层细粒度关联学习方法 被引量：12

参考文献1

二级参考文献72

共引文献33

同被引文献59

引证文献12

二级引证文献17

相关作者

相关机构

相关主题

浏览历史

跨媒体深层细粒度关联学习方法被引量：12