期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
基于扩展标记树的网页正文抽取 被引量:2
1
作者 夏天 《广西师范大学学报(自然科学版)》 CAS 北大核心 2011年第1期133-137,共5页
本文给出了一种基于扩展标记树的网页正文抽取方法,通过构建网页扩展标记树,实现对网页的清理和抽取辅助信息的完善,并设置节点坐标定位节点位置;以构成正文内容的文本节点作为正文区域标志,挑选具有最大文本覆盖范围的近邻文本节点集,... 本文给出了一种基于扩展标记树的网页正文抽取方法,通过构建网页扩展标记树,实现对网页的清理和抽取辅助信息的完善,并设置节点坐标定位节点位置;以构成正文内容的文本节点作为正文区域标志,挑选具有最大文本覆盖范围的近邻文本节点集,并进行修正形成正文区域;通过近邻优先遍历算法,实现标题节点的定位和附加属性的抽取。实验结果表明:该方法可以实现常规文章类网页的高精度抽取,并具有良好的适应性。 展开更多
关键词 网页正文抽取 扩展标记树 近邻优先遍历
下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部