-
题名基于字集特征向量的网页消重改进算法
- 1
-
-
作者
李洪奇
冯海波
张伟
杨中国
宋伟城
-
机构
中国石油大学(北京)计算机系
-
出处
《计算机工程与应用》
CSCD
北大核心
2017年第2期53-57,共5页
-
基金
国家"十五"科技攻关项目(No.2001BA605A09)
-
文摘
基于MD5算法计算数字指纹的网页消重算法简单而高效,在网页消重领域应用比较广泛。但是由于MD5算法是一种严格的信息加密算法,在文章内容变动很少的情况下得出的指纹结果完全不同,导致基于这种算法的网页消重技术召回率不是很高。提出了两种基于字集特征向量的网页消重改进算法,把文章内容映射到字集空间中去,计算字集空间距离来判断文章是否相似。提出的算法具有良好的泛化能力,段落中存在的调整语序和增删改个别字不会影响到对相似段落的识别,大大提高了网页消重算法的召回率。实验结果表明,算法的时间复杂度为O(n),空间复杂度为O(1),适合应用于大规模网页消重。
-
关键词
字集向量
机器码向量
网页消重
数字指纹
MD5
-
Keywords
alphabet vector
machine code vector
webpage duplicate removal
digital fingerprint
MD5
-
分类号
TP391
[自动化与计算机技术—计算机应用技术]
-