期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
基于网页正文结构和特征串的相似网页去重算法 被引量:11
1
作者 熊忠阳 牙漫 张玉芳 《计算机应用》 CSCD 北大核心 2013年第2期554-557,共4页
为了减少重复网页对用户的干扰,提高去重效率,提出一种新的大规模网页去重算法。首先利用预定义网页标签值建立网页正文结构树,实现了层次计算指纹相似度;其次,提取网页中高频标点字符所在句子中的首尾汉字作为特征码;最后,利用Bloom Fi... 为了减少重复网页对用户的干扰,提高去重效率,提出一种新的大规模网页去重算法。首先利用预定义网页标签值建立网页正文结构树,实现了层次计算指纹相似度;其次,提取网页中高频标点字符所在句子中的首尾汉字作为特征码;最后,利用Bloom Filter算法对获取的特征指纹进行网页相似度判别。实验表明,该算法将召回率提高到了90%以上,时间复杂度降低到了O(n)。 展开更多
关键词 网页去重 网页标签值 高频标点 特征码 网页指纹相似度
下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部