期刊导航
期刊开放获取
河南省图书馆
退出
期刊文献
+
任意字段
题名或关键词
题名
关键词
文摘
作者
第一作者
机构
刊名
分类号
参考文献
作者简介
基金资助
栏目信息
任意字段
题名或关键词
题名
关键词
文摘
作者
第一作者
机构
刊名
分类号
参考文献
作者简介
基金资助
栏目信息
检索
高级检索
期刊导航
共找到
1
篇文章
<
1
>
每页显示
20
50
100
已选择
0
条
导出题录
引用分析
参考文献
引证文献
统计分析
检索结果
已选文献
显示方式:
文摘
详细
列表
相关度排序
被引量排序
时效性排序
基于复合图文特征的视觉问答模型研究
1
作者
邱南
顾玉宛
+3 位作者
石林
李宁
庄丽华
徐守坤
《计算机应用研究》
CSCD
北大核心
2021年第8期2293-2298,共6页
针对当前主流视觉问答(visual question answering,VQA)任务使用区域特征作为图像表示而面临的训练复杂度高、推理速度慢等问题,提出一种基于复合视觉语言的卷积网络(composite visionlinguistic convnet,CVlCN)来对视觉问答任务中的图...
针对当前主流视觉问答(visual question answering,VQA)任务使用区域特征作为图像表示而面临的训练复杂度高、推理速度慢等问题,提出一种基于复合视觉语言的卷积网络(composite visionlinguistic convnet,CVlCN)来对视觉问答任务中的图像进行表征。该方法将图像特征和问题语义通过复合学习表示成复合图文特征,然后从空间和通道上计算复合图文特征的注意力分布,以选择性地保留与问题语义相关的视觉信息。在VQA-v2数据集上的测试结果表明,该方法在视觉问答任务上的准确率有明显的提升,整体准确率达到64.4%。模型的计算复杂度较低且推理速度更快。
展开更多
关键词
视觉
问答
复合视觉语言特征
区域
特征
多模态融合
下载PDF
职称材料
题名
基于复合图文特征的视觉问答模型研究
1
作者
邱南
顾玉宛
石林
李宁
庄丽华
徐守坤
机构
常州大学计算机与人工智能学院阿里云大数据学院
出处
《计算机应用研究》
CSCD
北大核心
2021年第8期2293-2298,共6页
基金
国家自然科学基金资助项目(61906021)
常州市城市大数据分析与应用技术重点实验室资助项目(CM20193007)
江苏省研究生科研创新计划资助项目(KYCX21-2829)。
文摘
针对当前主流视觉问答(visual question answering,VQA)任务使用区域特征作为图像表示而面临的训练复杂度高、推理速度慢等问题,提出一种基于复合视觉语言的卷积网络(composite visionlinguistic convnet,CVlCN)来对视觉问答任务中的图像进行表征。该方法将图像特征和问题语义通过复合学习表示成复合图文特征,然后从空间和通道上计算复合图文特征的注意力分布,以选择性地保留与问题语义相关的视觉信息。在VQA-v2数据集上的测试结果表明,该方法在视觉问答任务上的准确率有明显的提升,整体准确率达到64.4%。模型的计算复杂度较低且推理速度更快。
关键词
视觉
问答
复合视觉语言特征
区域
特征
多模态融合
Keywords
visual question answering
composite vision linguistic feature
regional feature
multimodal fusion
分类号
TP391 [自动化与计算机技术—计算机应用技术]
下载PDF
职称材料
题名
作者
出处
发文年
被引量
操作
1
基于复合图文特征的视觉问答模型研究
邱南
顾玉宛
石林
李宁
庄丽华
徐守坤
《计算机应用研究》
CSCD
北大核心
2021
0
下载PDF
职称材料
已选择
0
条
导出题录
引用分析
参考文献
引证文献
统计分析
检索结果
已选文献
上一页
1
下一页
到第
页
确定
用户登录
登录
IP登录
使用帮助
返回顶部