期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
基于字集特征向量的网页消重改进算法
1
作者 李洪奇 冯海波 +2 位作者 张伟 杨中国 宋伟城 《计算机工程与应用》 CSCD 北大核心 2017年第2期53-57,共5页
基于MD5算法计算数字指纹的网页消重算法简单而高效,在网页消重领域应用比较广泛。但是由于MD5算法是一种严格的信息加密算法,在文章内容变动很少的情况下得出的指纹结果完全不同,导致基于这种算法的网页消重技术召回率不是很高。提出... 基于MD5算法计算数字指纹的网页消重算法简单而高效,在网页消重领域应用比较广泛。但是由于MD5算法是一种严格的信息加密算法,在文章内容变动很少的情况下得出的指纹结果完全不同,导致基于这种算法的网页消重技术召回率不是很高。提出了两种基于字集特征向量的网页消重改进算法,把文章内容映射到字集空间中去,计算字集空间距离来判断文章是否相似。提出的算法具有良好的泛化能力,段落中存在的调整语序和增删改个别字不会影响到对相似段落的识别,大大提高了网页消重算法的召回率。实验结果表明,算法的时间复杂度为O(n),空间复杂度为O(1),适合应用于大规模网页消重。 展开更多
关键词 字集向量 机器码向量 网页消重 数字指纹 MD5
下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部