期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
基于交叉注意力Transformer的人体姿态估计方法 被引量:1
1
作者 王款 宣士斌 +2 位作者 何雪东 李紫薇 李嘉祥 《计算机工程》 CAS CSCD 北大核心 2023年第7期223-231,共9页
现有用于人体姿态估计的深度卷积网络方法大多采用堆叠Transformer编码器技术,未充分考虑低分辨率全局语义信息,存在模型学习困难、推理成本高等问题。提出基于交叉注意力的Transformer多尺度表征学习方法。利用深度卷积网络获取不同分... 现有用于人体姿态估计的深度卷积网络方法大多采用堆叠Transformer编码器技术,未充分考虑低分辨率全局语义信息,存在模型学习困难、推理成本高等问题。提出基于交叉注意力的Transformer多尺度表征学习方法。利用深度卷积网络获取不同分辨率特征图,将特征图转变为多尺度视觉标记,并且预估关键点在标记空间中的分布提高模型的收敛速度。为增强低分辨率全局语义的可识别性,提出多尺度交叉注意力模块,该模块通过对不同分辨率特征标记之间的多次交互,以及对关键点标记采取移动关键点策略,实现减少关键点标记冗余和交叉融合操作次数,交叉注意力融合模块从特征标记中抽取的不同尺度特征信息形成关键点标记,有助于降低上采样融合的不准确性。在多项基准数据集上的实验结果表明,与当前最先进的TokenPose方法相比,该方法能有效促进Transformer编码器对关键点之间关联关系的学习,在不降低性能的前提下计算代价下降11.8%。 展开更多
关键词 全局语义 多尺度交叉注意力 人体姿态估计 表征学习 交叉注意力融合 Transformer编码器
下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部