期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
自动抽取web数据的树对齐算法
1
作者 景寒星 陈少红 俞琨 《华东师范大学学报(自然科学版)》 CAS CSCD 北大核心 2010年第5期96-102,共7页
针对从模板生成的网页中自动抽取web数据的问题,提出了一种新的树对齐算法.该算法能够确定输入网页的最大匹配结构.经过一系列的对齐操作之后,多棵树被合并成为一棵记录着合并前多个网页上的统计信息的合并树,树对齐算法可以发现合并树... 针对从模板生成的网页中自动抽取web数据的问题,提出了一种新的树对齐算法.该算法能够确定输入网页的最大匹配结构.经过一系列的对齐操作之后,多棵树被合并成为一棵记录着合并前多个网页上的统计信息的合并树,树对齐算法可以发现合并树中的重复模式,在最可能内容块上构建包装器,并按照重复模式从网页上抽取数据.实验结果表明,该算法的抽取结果具有较高的准确性和良好的稳定性. 展开更多
关键词 数据抽取 包装器 树对齐
下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部