并行计算框架Spark的自动检查点策略被引量：1

Automatic checkpoint strategy for parallel computing frame with Spark

下载PDF

导出

摘要针对现有的Spark检查点机制需要编程人员根据经验选择检查点,具有一定的风险和随机性,可能导致恢复开销较大的问题,通过对RDD属性的分析,提出了自动检查点策略,包括权重生成(WG)算法和检查点自动选择(CAS)算法.首先,WG算法分析作业的DAG结构,获取RDD的血统长度和操作复杂度等属性,计算RDD权重;然后,CAS算法选择权重大的RDD作为检查点进行异步备份,来实现数据的快速恢复.结果表明:在使用CAS算法时,不同数据集执行时间和检查点容量大小都有所增加,其中Wiki-Talk由于其计算量较大,增幅明显;使用CAS算法设置检查点后,在单点失效恢复的情况下,数据集的恢复时间较短.因此,自动检查点策略在略微增加执行时间开销的基础上,能够有效地降低作业的恢复开销. The existing Spark checkpoint mechanism required the programmer to choose the checkpoint according to the experience,thus it had a certain risk and randomness,resulting in large recovery overhead. To address this problem,the resilient distribution datasets（ RDD） characteristics were analyzed,and the weight generated（ WG） algorithm and checkpoint automatic selection（ CAS） algorithm were put forward. First,in the WG algorithm,the directed acyclic graph（ DAG） of the job was analyzed,and the lineage length and the operation complexity of RDD were obtained to compute the RDD weight. Secondly,in the CAS algorithm,the RDD with the maximum weight was selected for setting checkpoints asynchronously to fast recovery. The experimental results showthat comparing with the original Spark,the execution time and the checkpoint size of different datasets are increased by the CAS algorithm,while the increasing extent of Wiki-Talk is more obvious. For the single node failure recovery,the datasets have smaller recovery overhead after setting checkpoint by using the CAS algorithm. Therefore,the strategy can efficiently decrease the recovery overhead of jobs with sacrificing the slight extra overhead.

作者英昌甜于炯卞琛鲁亮钱育蓉 Ying Changtian Yu Jiong Bian Chen Lu Liang Qian Yurong(School of Information Science and Engineering, Xinjiang University, Urumqi 830046 , China School of Software, Xinjiang University, Urumqi 830008, China)

机构地区新疆大学信息科学与工程学院新疆大学软件学院

出处《东南大学学报（自然科学版）》 EI CAS CSCD 北大核心 2017年第2期231-235,共5页 Journal of Southeast University：Natural Science Edition

基金国家自然科学基金资助项目(61462079 61262088 61562086 61363083 61562078) 新疆维吾尔自治区高校科研计划资助项目(XJEDU2016S106)

关键词自动检查点 RDD权重 SPARK 恢复时间 automatic checkpoint resilient distribution dataset（RDD） weight Spark recovery time

分类号 TP311 [自动化与计算机技术—计算机软件与理论]

引文网络
相关文献

参考文献5

1孟小峰,慈祥.大数据管理:概念、技术与挑战[J].计算机研究与发展,2013,50(1):146-169. 被引量：2393
2王元卓,靳小龙,程学旗.网络大数据:现状与展望[J].计算机学报,2013,36(6):1125-1138. 被引量：714
3易会战,王锋,左克,杨灿群,杜云飞,马亚青.基于内存缓存的异步检查点容错技术[J].计算机研究与发展,2014,51(6):1229-1239. 被引量：8
4慈轶为,张展,左德承,吴智博,杨孝宗.可扩展的多周期检查点设置[J].软件学报,2010,21(2):218-230. 被引量：7
5吴俊.基于双优先级队列的异构分布式控制系统容错调度算法[J].东南大学学报（自然科学版）,2008,38(3):407-412. 被引量：2

二级参考文献275

1刘怀,费树岷.控制系统中实时任务的动态优化调度算法[J].控制与决策,2005,20(3):246-250. 被引量：11
2罗威,阳富民,庞丽萍,李俊.基于延迟主动副版本的分布式实时容错调度算法[J].计算机研究与发展,2007,44(3):521-528. 被引量：18
3Wang YM, Chung PY, Lin IJ, Fuchs WK. Checkpoint space reclamation for uncoordinated checkpointing in message-passing systems. IEEE Trans. on Parallel and Distributed Systems, 1995,6(5):546-554.
4Wang YM, Fuchs WK. Optimal message log reclamation for uncoordinated checkpointing. In: Proc. of the Conf. on Fault-Tolerant Parallel and Distributed Systems. Piscataway: IEEE Computer Society Press, 1995.24-29.
5Gupta B, Rahimi S, Yang Y. A novel roll-back mechanism for performance enhancement of asynchronous cheekpointing and recovery. Informatica, 2007,31(1):1-13.
6Elnozahy EN, Johnson DB, Zwaenepoel W. The performance of consistent checkpointing. In: Proc. of the 11th Syrup. on Reliable Distributed Systems. 1992.39-47.
7Koo R, Toueg S. Checkpointing and rollback-recovery for distributed systems. IEEE Trans. on Software Engineering, 1987, SE-13(1):23-31.
8Cao G, Singhal M. Low-Cost checkpointing with mutable checkpoints in mobile computing systems. In: Proc. of the 18th Int'l Conf. on Distributed Computing Systems. Piseataway: IEEE Computer Society Press, 1998. 464-471.
9Sakata TC, Garcia IC. Non-Blocking synchronous checkpointing based on rollback-dependency trackability. In: Proc. of the 25th IEEE Symp. on Reliable Distributed Systems. Piscataway: IEEE Computer Society Press, 2006.411-420.
10Tong Z, Kain RY, Tsai WT. A low overhead checkpointing and rollback recovery scheme for distributed systems. In: Proc. of the 8th Symp. on Reliable Distributed Systems. Piscataway: IEEE Computer Society Press, 1989. 12-20.

共引文献2983

1韩莹莹,钟专,褚月娇,康春阳,李东霓,王志佳,刘晓阳,张白羽.基于大数据智能化背景下神经病学实践教学体系构建的探索[J].中国实验诊断学,2023,27(8):1006-1009.
2李坪.大数据赋权正当性证成[J].中山大学法律评论,2020(1):3-21. 被引量：1
3孙昊鹏.大数据在新冠肺炎疫情中的应用和缺失[J].郑州师范教育,2020,9(3):91-96. 被引量：1
4闫妍.刍议大数据时代背景下全面预算管理对提升项目储备精益化管理水平的价值[J].质量与市场,2020,0(1):19-21. 被引量：6
5叶青.违法立案的检察监督机制研究[J].国家检察官学院学报,2024,32(1):53-68. 被引量：1
6刘厚营.大数据在安保工作情报分析中的应用[J].工程技术研究,2018,3(1):243-244. 被引量：1
7肖楠,陈红梅.从融媒体到智媒体:一种技术驱动下的传媒经济发展路径[J].新闻知识,2020(9):19-22. 被引量：3
8杨东,郑清洋.从TikTok事件看数字人民币的路径选择:从流量入口到金融优势的转化[J].新疆师范大学学报（哲学社会科学版）,2021,42(4):126-135. 被引量：6
9张丛铄.基于大数据的研究生心理危机预警机制的构建[J].中国新通信,2020,0(2):80-81. 被引量：2
10刘生龙,张晓明,杨竺松.互联网使用对农村居民收入的影响[J].数量经济技术经济研究,2021,38(4):103-119. 被引量：68

同被引文献2

1孔兰菊,李庆忠,史玉良,王学.面向SaaS应用基于键值对模式的多租户索引研究[J].计算机学报,2010,33(12):2239-2247. 被引量：17
2英昌甜,于炯,鲁亮,刘建矿.基于小文件的内存云存储优化策略[J].计算机应用,2014,34(11):3104-3108. 被引量：6

引证文献1

1英昌甜,王维庆,于炯,卞琛,国冰磊,祁雷.内存计算环境下基于索引结构的内存优化策略[J].新疆大学学报（自然科学版）,2018,35(1):13-21. 被引量：2

二级引证文献2

1于炯,蒲勇霖,鲁亮,刘粟.分布式处理平台节能计算研究综述[J].新疆大学学报（自然科学版）,2018,35(4):389-401. 被引量：1
2师康利,于炯,鲁亮.基于Storm的多租户槽感知调度策略[J].新疆大学学报（自然科学版）,2019,36(1):56-64. 被引量：1

1程国建,赵倩倩.K-means聚类算法在Spark平台上的应用[J].软件导刊,2016,15(2):146-148. 被引量：4
2邓万宇,李力,牛慧娟.基于Spark的并行极速神经网络[J].郑州大学学报（工学版）,2016,37(5):47-56. 被引量：4
3李天宏,谢志刚.数据中心系统的远程备份[J].软件工程师,2001(5):15-15.
4李吉勇,王雷.数据异步备份和管理的设计与实现[J].电脑编程技巧与维护,2010(24):59-60.
5赵海廷.Windows系统的消息及其处理技术[J].武汉工程职业技术学院学报,2004,16(2):41-45. 被引量：1
6鄢智强,王小峰.Windows消息机制剖析[J].福建电脑,2009,25(6):24-25. 被引量：1
7余涛,刘泽燊.基于Spark的并行遗传算法研究[J].计算机时代,2017,0(1):43-46. 被引量：5
8闻永萍.C语言在数据库系统开发中的应用[J].电脑编程技巧与维护,2011(24):62-64. 被引量：5
9刘汉忠,官元红.模糊PID自适应算法在流量压力控制系统中的应用[J].化工自动化及仪表,2011,38(5):567-569. 被引量：13
10李梅.Linux实时性能优化算法分析与研究[J].电子设计工程,2014,22(5):56-58. 被引量：1

东南大学学报（自然科学版）

2017年第2期

浏览历史

内容加载中请稍等...

并行计算框架Spark的自动检查点策略被引量：1

参考文献5

二级参考文献275

共引文献2983

同被引文献2

引证文献1

二级引证文献2

相关作者

相关机构

相关主题

浏览历史

并行计算框架Spark的自动检查点策略 被引量：1

参考文献5

二级参考文献275

共引文献2983

同被引文献2

引证文献1

二级引证文献2

相关作者

相关机构

相关主题

浏览历史

并行计算框架Spark的自动检查点策略被引量：1