期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
一种改进的相似重复记录检测算法 被引量:7
1
作者 郭文龙 《计算机应用与软件》 CSCD 北大核心 2014年第1期293-295,共3页
数据仓库中相似重复记录的清洗对于提高数据质量有着重要意义,传统的判重算法有SNM算法、MPN算法及KNN算法等。针对MPN算法判重精度和时间效率不高等缺陷,提出一种改进的MPN算法。根据记录属性的重要性分别设定属性权值,将属性切分为原... 数据仓库中相似重复记录的清洗对于提高数据质量有着重要意义,传统的判重算法有SNM算法、MPN算法及KNN算法等。针对MPN算法判重精度和时间效率不高等缺陷,提出一种改进的MPN算法。根据记录属性的重要性分别设定属性权值,将属性切分为原子,进一步计算原子的权值,通过判定属性相似度进而判定记录相似度,提高查准率和查全率。采用均分大数据集为若干数据子集,并行采用MPN算法进行判重,提高判重时间效率。理论和实验分析表明该方法提高了相似重复记录检测的准确率和时间效率。 展开更多
关键词 相似重复记录属性检测 mpn算法
下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部