-
题名基于内码序值聚类的相似重复记录检测方法
被引量:8
- 1
-
-
作者
鲁均云
李星毅
施化吉
马素琴
-
机构
江苏大学计算机科学与通信工程学院
-
出处
《计算机应用研究》
CSCD
北大核心
2010年第3期874-878,共5页
-
基金
国家火炬计划资助项目(2004EB33006[0])
江苏省高校自然科学指导性计划资助项目(05JKD520050)
-
文摘
检测和消除相似重复记录是数据清理和提高数据质量要解决的关键问题之一,针对相似重复记录问题,提出了基于内码序值聚类的相似重复记录检测方法。该方法先选择关键字段或字段某些位,根据字符的内码序值,利用聚类思想将大数据集聚集成多个小数据集;然后,通过等级法计算各字段的权值,并将其应用在相似重复记录的检测算法中;最后,在各个小数据集中检测和消除相似重复记录。为避免关键字选择不当而造成记录漏查问题,采用多趟检测方法进行多次检测。通过实验表明,该方法具有较好的检测精度和时间效率,能很好地应用到中英文字符集,通用性很强,并能够有效地解决大数据量的相似重复记录检测问题。
-
关键词
相似重复记录
内码序值
聚类
等级法
-
Keywords
approximately duplicate records
inner code's sequence value
cluster
rank method
-
分类号
TP311
[自动化与计算机技术—计算机软件与理论]
-