期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
基于局部标签树匹配的改进网页聚类算法 被引量:14
1
作者 李睿 曾俊瑀 周四望 《计算机应用》 CSCD 北大核心 2010年第3期818-820,共3页
Web信息抽取中需要对目标网站的网页进行聚类分析,以检测并生成信息抽取所需的模板。传统的基于DOM树编辑距离的网页聚类算法不适合文档对象模型(DOM)树结构复杂的动态模板网页,提出了一种基于局部标签树匹配的改进网页聚类算法,利用标... Web信息抽取中需要对目标网站的网页进行聚类分析,以检测并生成信息抽取所需的模板。传统的基于DOM树编辑距离的网页聚类算法不适合文档对象模型(DOM)树结构复杂的动态模板网页,提出了一种基于局部标签树匹配的改进网页聚类算法,利用标签树中模板节点和非模板节点的层次差异性,根据节点对布局影响的大小赋予节点不同的匹配权值,使用局部树匹配完成对网页结构相似性的有效计算。实验结果表明,改进的算法较传统的基于DOM树编辑距离的网页聚类算法,在对采用模板生成的动态网页进行聚类分析时具有更高的准确率,且时间复杂度低。 展开更多
关键词 WEB信息抽取 网页聚类 编辑距离 局部标签树匹配
下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部