期刊导航
期刊开放获取
河南省图书馆
退出
期刊文献
+
任意字段
题名或关键词
题名
关键词
文摘
作者
第一作者
机构
刊名
分类号
参考文献
作者简介
基金资助
栏目信息
任意字段
题名或关键词
题名
关键词
文摘
作者
第一作者
机构
刊名
分类号
参考文献
作者简介
基金资助
栏目信息
检索
高级检索
期刊导航
共找到
2
篇文章
<
1
>
每页显示
20
50
100
已选择
0
条
导出题录
引用分析
参考文献
引证文献
统计分析
检索结果
已选文献
显示方式:
文摘
详细
列表
相关度排序
被引量排序
时效性排序
一种基于Q-sample的局部相似连接并行算法
被引量:
1
1
作者
王晓霞
孙德才
《计算机科学》
CSCD
北大核心
2019年第12期38-44,共7页
局部相似连接能快速找出数据集间的局部相似记录对,是基因序列比对、剽窃检测和数据清洗等研究领域的基本操作。文中主要研究基于MapReduce框架的并行相似连接技术,提出了一种基于Q-sample的局部相似连接算法,解决了局部相似连接的定位...
局部相似连接能快速找出数据集间的局部相似记录对,是基因序列比对、剽窃检测和数据清洗等研究领域的基本操作。文中主要研究基于MapReduce框架的并行相似连接技术,提出了一种基于Q-sample的局部相似连接算法,解决了局部相似连接的定位问题。该算法采用了过滤验证二阶段模式:在过滤阶段,所提算法使用Q-sample分割方案拆分字符串集,在不丢失任何匹配的基础上生成了高质量的子串,抛弃了大量的无关字符串对;在验证阶段,所提算法优化了LS-Join算法的双向扩展验证方法,通过去除冗余匹配、合并连续匹配和合并非连续匹配等技术提高了算法的验证效率。通过实验对比了不同数据集和编辑距离参数下算法的性能表现,结果显示所提算法在大数据集上的局部相似连接速度快于当前的优秀算法LS-Join。理论分析和实验结果证明,所提算法的相关技术提高了局部相似的连接性能。
展开更多
关键词
相似连接
q-sample
MAPREDUCE
数据清洗
大数据
下载PDF
职称材料
大数据处理中MapReduce框架的Q-sample算法设计
2
作者
王晓霞
孙德才
《现代计算机》
2021年第36期44-48,共5页
为了解决大量重复数据导致MapReduce的混淆消耗过大及网络传输拥堵的问题,设计了一种基于MapReduce框架的相似连接算法Q-sample。该算法首先将Q-sample的子串进行分割以减少过滤阶段的子串数量,从而减少网络传输数量,进而减少相似连接...
为了解决大量重复数据导致MapReduce的混淆消耗过大及网络传输拥堵的问题,设计了一种基于MapReduce框架的相似连接算法Q-sample。该算法首先将Q-sample的子串进行分割以减少过滤阶段的子串数量,从而减少网络传输数量,进而减少相似连接所耗费的时间,然后通过设计三个匹配过滤器和一个统计特征过滤器的方法来提高过滤效率,最后进行相关实验。实验结果表明,算法有效地提高了MapReduce众局部相似自连接速度和字符匹配的过滤效率。
展开更多
关键词
大数据
相似连接
自连接
MAPREDUCE
q-sample
下载PDF
职称材料
题名
一种基于Q-sample的局部相似连接并行算法
被引量:
1
1
作者
王晓霞
孙德才
机构
渤海大学信息科学与技术学院
出处
《计算机科学》
CSCD
北大核心
2019年第12期38-44,共7页
基金
教育部人文社会科学研究青年基金项目(15YJC870021)
国家自然科学基金青年基金项目(61602056)
+3 种基金
国家社会科学基金项目(19BTQ028)
辽宁省自然科学基金(20170540015)
辽宁省社会科学基金(L18AXW001)
辽宁省教育厅科学研究项目(L2015010)资助
文摘
局部相似连接能快速找出数据集间的局部相似记录对,是基因序列比对、剽窃检测和数据清洗等研究领域的基本操作。文中主要研究基于MapReduce框架的并行相似连接技术,提出了一种基于Q-sample的局部相似连接算法,解决了局部相似连接的定位问题。该算法采用了过滤验证二阶段模式:在过滤阶段,所提算法使用Q-sample分割方案拆分字符串集,在不丢失任何匹配的基础上生成了高质量的子串,抛弃了大量的无关字符串对;在验证阶段,所提算法优化了LS-Join算法的双向扩展验证方法,通过去除冗余匹配、合并连续匹配和合并非连续匹配等技术提高了算法的验证效率。通过实验对比了不同数据集和编辑距离参数下算法的性能表现,结果显示所提算法在大数据集上的局部相似连接速度快于当前的优秀算法LS-Join。理论分析和实验结果证明,所提算法的相关技术提高了局部相似的连接性能。
关键词
相似连接
q-sample
MAPREDUCE
数据清洗
大数据
Keywords
Similarity join
q-sample
MapReduce
Data cleaning
Big data
分类号
TP391 [自动化与计算机技术—计算机应用技术]
下载PDF
职称材料
题名
大数据处理中MapReduce框架的Q-sample算法设计
2
作者
王晓霞
孙德才
机构
渤海大学信息科学与技术学院
出处
《现代计算机》
2021年第36期44-48,共5页
基金
渤海大学国家安全研究院项目(XK202134-30)。
文摘
为了解决大量重复数据导致MapReduce的混淆消耗过大及网络传输拥堵的问题,设计了一种基于MapReduce框架的相似连接算法Q-sample。该算法首先将Q-sample的子串进行分割以减少过滤阶段的子串数量,从而减少网络传输数量,进而减少相似连接所耗费的时间,然后通过设计三个匹配过滤器和一个统计特征过滤器的方法来提高过滤效率,最后进行相关实验。实验结果表明,算法有效地提高了MapReduce众局部相似自连接速度和字符匹配的过滤效率。
关键词
大数据
相似连接
自连接
MAPREDUCE
q-sample
Keywords
big data
similarity join
self-join
MapReduce
q-sample
分类号
TP311.13 [自动化与计算机技术—计算机软件与理论]
下载PDF
职称材料
题名
作者
出处
发文年
被引量
操作
1
一种基于Q-sample的局部相似连接并行算法
王晓霞
孙德才
《计算机科学》
CSCD
北大核心
2019
1
下载PDF
职称材料
2
大数据处理中MapReduce框架的Q-sample算法设计
王晓霞
孙德才
《现代计算机》
2021
0
下载PDF
职称材料
已选择
0
条
导出题录
引用分析
参考文献
引证文献
统计分析
检索结果
已选文献
上一页
1
下一页
到第
页
确定
用户登录
登录
IP登录
使用帮助
返回顶部