期刊文献+
共找到3篇文章
< 1 >
每页显示 20 50 100
结合有监督广度优先搜索策略的通用垂直爬虫方法 被引量:7
1
作者 高峰 刘震 高辉 《计算机工程》 CAS CSCD 北大核心 2018年第11期289-299,共11页
垂直爬虫程序无法直接移植到其他网站并且程序设计需要大量人工干预。为此,提出一种高可移植性的通用型垂直爬虫设计方法。自动识别目标主题和目录页面URL,并利用URL聚类生成URL正则表达式过滤器,以解决垂直爬虫中需人工维护初始URL队... 垂直爬虫程序无法直接移植到其他网站并且程序设计需要大量人工干预。为此,提出一种高可移植性的通用型垂直爬虫设计方法。自动识别目标主题和目录页面URL,并利用URL聚类生成URL正则表达式过滤器,以解决垂直爬虫中需人工维护初始URL队列的问题。然后,利用正则表达式过滤器和解析路径模板以及有监督的广度优先与网页赋权搜索策略,实现相关页面的精确定位和数据的快速准确提取。实验结果表明,该方法能够对不同网站实现高效、快速、通用的数据爬取。 展开更多
关键词 垂直爬虫 URL聚类 赋权网页 路径模板解析 有监督广度优先搜索策略
下载PDF
深层网页垂直爬虫技术研究综述 被引量:1
2
作者 何小明 《电子世界》 2018年第16期42-43,共2页
随着信息化时代的快速发展,大数据的价值正逐渐显现,如何利用爬虫技术从网页中采集高质量的海量数据成为大数据技术面临的一个基本问题。文章对深层网页垂直爬虫动态网页的加载、数据块的定位与抽取、数据实体的分析和爬取策略等关键技... 随着信息化时代的快速发展,大数据的价值正逐渐显现,如何利用爬虫技术从网页中采集高质量的海量数据成为大数据技术面临的一个基本问题。文章对深层网页垂直爬虫动态网页的加载、数据块的定位与抽取、数据实体的分析和爬取策略等关键技术进行系统介绍与分析。在此基础上,提出深层网页垂直爬虫所面临的困难与挑战,以及今后的研究方向。 展开更多
关键词 深层网页 垂直爬虫 动态网页 爬取策略 数据采集
下载PDF
基于智能双驱检测技术的APP一站式安全监测探索与实践 被引量:2
3
作者 车力军 黄炎生 徐丽 《电信技术》 2019年第4期31-34,共4页
当前业界的安全监测技术还处于初始探索阶段,针对APP业务暴露出的问题,云南电信联合中电福富公司采用智能双驱检测、深度垂直爬虫以及动静解析等技术手段,对APP安全防控监测进行创新能力整合,取得了较好实效,有效保障了APP业务的良性发... 当前业界的安全监测技术还处于初始探索阶段,针对APP业务暴露出的问题,云南电信联合中电福富公司采用智能双驱检测、深度垂直爬虫以及动静解析等技术手段,对APP安全防控监测进行创新能力整合,取得了较好实效,有效保障了APP业务的良性发展和安全运营。 展开更多
关键词 APP 内容安全 双驱检测 深度垂直爬虫 动静解析
下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部