期刊导航
期刊开放获取
河南省图书馆
退出
期刊文献
+
任意字段
题名或关键词
题名
关键词
文摘
作者
第一作者
机构
刊名
分类号
参考文献
作者简介
基金资助
栏目信息
任意字段
题名或关键词
题名
关键词
文摘
作者
第一作者
机构
刊名
分类号
参考文献
作者简介
基金资助
栏目信息
检索
高级检索
期刊导航
共找到
2
篇文章
<
1
>
每页显示
20
50
100
已选择
0
条
导出题录
引用分析
参考文献
引证文献
统计分析
检索结果
已选文献
显示方式:
文摘
详细
列表
相关度排序
被引量排序
时效性排序
SIMD代码中的向量访存优化研究
被引量:
1
1
作者
徐金龙
赵荣彩
徐晓燕
《计算机科学》
CSCD
北大核心
2015年第12期18-22,共5页
向量程序来源于手工编写或由编译器自动生成。受限于编程人员和并行编译器的能力,得到的向量程序都存在一定的优化空间。优化编译器通常关注如何将串行程序向量化,但很少对向量程序进行优化。因此,提出了一种针对SIMD代码的向量访存优...
向量程序来源于手工编写或由编译器自动生成。受限于编程人员和并行编译器的能力,得到的向量程序都存在一定的优化空间。优化编译器通常关注如何将串行程序向量化,但很少对向量程序进行优化。因此,提出了一种针对SIMD代码的向量访存优化方法。该方法首先分析程序是否需要优化,若存在需求,则对程序同时进行深度冗余优化和对齐优化。实验数据显示,提出的方法可以明显提高程序的运行效率,达到了目标。
展开更多
关键词
向量化
SIMD
访
存
冗余
对齐优化
下载PDF
职称材料
一种冗余感知的高能效图计算加速器
2
作者
姚鹏程
廖小飞
+6 位作者
金海
周宇航
徐鹏
张伟
曾圳
潘晨高
朱冰
《中国科学:信息科学》
CSCD
北大核心
2024年第6期1369-1385,共17页
图作为一种灵活表达对象之间关系的数据结构,广泛地应用于各类重要的现实场景.近年来,随着性能提升速度放缓,通用处理器逐渐无法满足图计算应用的需求,并成为限制图计算发展的主要瓶颈.因此,面向图计算的领域专用加速器成为近年来的研...
图作为一种灵活表达对象之间关系的数据结构,广泛地应用于各类重要的现实场景.近年来,随着性能提升速度放缓,通用处理器逐渐无法满足图计算应用的需求,并成为限制图计算发展的主要瓶颈.因此,面向图计算的领域专用加速器成为近年来的研究热点.通过定制化的硬件设计,图计算加速器可以在图计算应用中取得通用处理器数十倍的性能.然而,现有的图计算加速器在运行宽度优先算法时会频繁地重复访问幂律顶点的相关数据,进而导致了严重的冗余访存问题.在特定场景下,现有的图计算加速器的性能甚至低于通用CPU.为了解决该问题,本文提出一种冗余感知的高能效图计算加速器JiFeng.当幂律顶点完成迭代计算时,JiFeng通过跳过剩余的相邻边大幅减少其被重复访问的次数.JiFeng实现了一系列软硬件协同设计,在保证负载均衡的同时提升硬件的执行效率.为了验证JiFeng的有效性,本文采用FPGA原型系统对相关设计进行性能评估.JiFeng在典型的生成图和现实图上实现最高每秒遍历4612亿条边的性能和每秒每瓦特遍历125亿条边的能效比,并在2023年11月的图计算超算排行榜GreenGraph500的小数据集榜单上取得第2名的成绩.
展开更多
关键词
图计算
加速器
宽度优先搜索
冗余访存
FPGA
原文传递
题名
SIMD代码中的向量访存优化研究
被引量:
1
1
作者
徐金龙
赵荣彩
徐晓燕
机构
信息工程大学数学工程与先进计算国家重点实验室
出处
《计算机科学》
CSCD
北大核心
2015年第12期18-22,共5页
基金
国家高技术研究发展计划(863)(2009AA01220)
"核高基"重大专项(2009zx10036-001-001)资助
文摘
向量程序来源于手工编写或由编译器自动生成。受限于编程人员和并行编译器的能力,得到的向量程序都存在一定的优化空间。优化编译器通常关注如何将串行程序向量化,但很少对向量程序进行优化。因此,提出了一种针对SIMD代码的向量访存优化方法。该方法首先分析程序是否需要优化,若存在需求,则对程序同时进行深度冗余优化和对齐优化。实验数据显示,提出的方法可以明显提高程序的运行效率,达到了目标。
关键词
向量化
SIMD
访
存
冗余
对齐优化
Keywords
Vectorization, Single instruction multiple data, Memory access redundant, Alignment optimization
分类号
TP311 [自动化与计算机技术—计算机软件与理论]
下载PDF
职称材料
题名
一种冗余感知的高能效图计算加速器
2
作者
姚鹏程
廖小飞
金海
周宇航
徐鹏
张伟
曾圳
潘晨高
朱冰
机构
华中科技大学大数据技术与系统国家地方联合工程研究中心
华中科技大学服务计算技术与系统教育部重点实验室
华中科技大学集群与网格计算湖北省重点实验室
华中科技大学计算机科学与技术学院
之江实验室
出处
《中国科学:信息科学》
CSCD
北大核心
2024年第6期1369-1385,共17页
基金
国家重点研发计划(批准号:2023YFB4502300)
中国博士后科学基金(批准号:BX20230333,2023M743257,2023TQ0328,2023TQ0327)
浙江省自然科学基金(批准号:LY24F020014)资助项目。
文摘
图作为一种灵活表达对象之间关系的数据结构,广泛地应用于各类重要的现实场景.近年来,随着性能提升速度放缓,通用处理器逐渐无法满足图计算应用的需求,并成为限制图计算发展的主要瓶颈.因此,面向图计算的领域专用加速器成为近年来的研究热点.通过定制化的硬件设计,图计算加速器可以在图计算应用中取得通用处理器数十倍的性能.然而,现有的图计算加速器在运行宽度优先算法时会频繁地重复访问幂律顶点的相关数据,进而导致了严重的冗余访存问题.在特定场景下,现有的图计算加速器的性能甚至低于通用CPU.为了解决该问题,本文提出一种冗余感知的高能效图计算加速器JiFeng.当幂律顶点完成迭代计算时,JiFeng通过跳过剩余的相邻边大幅减少其被重复访问的次数.JiFeng实现了一系列软硬件协同设计,在保证负载均衡的同时提升硬件的执行效率.为了验证JiFeng的有效性,本文采用FPGA原型系统对相关设计进行性能评估.JiFeng在典型的生成图和现实图上实现最高每秒遍历4612亿条边的性能和每秒每瓦特遍历125亿条边的能效比,并在2023年11月的图计算超算排行榜GreenGraph500的小数据集榜单上取得第2名的成绩.
关键词
图计算
加速器
宽度优先搜索
冗余访存
FPGA
Keywords
graph processing
accelerator
breadth-first search
redundant memory access
FPGA
分类号
TP311.12 [自动化与计算机技术—计算机软件与理论]
原文传递
题名
作者
出处
发文年
被引量
操作
1
SIMD代码中的向量访存优化研究
徐金龙
赵荣彩
徐晓燕
《计算机科学》
CSCD
北大核心
2015
1
下载PDF
职称材料
2
一种冗余感知的高能效图计算加速器
姚鹏程
廖小飞
金海
周宇航
徐鹏
张伟
曾圳
潘晨高
朱冰
《中国科学:信息科学》
CSCD
北大核心
2024
0
原文传递
已选择
0
条
导出题录
引用分析
参考文献
引证文献
统计分析
检索结果
已选文献
上一页
1
下一页
到第
页
确定
用户登录
登录
IP登录
使用帮助
返回顶部