期刊文献+
共找到911篇文章
< 1 2 46 >
每页显示 20 50 100
分布式Web Crawler的研究:结构、算法和策略 被引量:23
1
作者 叶允明 于水 +2 位作者 马范援 宋晖 张岭 《电子学报》 EI CAS CSCD 北大核心 2002年第12A期2008-2011,共4页
本文介绍了一个大型分布式Web Crawler系统——Igloo 1.2版。它采用分布式的系统结构,通过我们设计的二级哈希映射算法使系统可以进行高效的任务分割,并且系统的规模动态可扩展.爬行网页的质量是评价Crawler的一个重要指标,Igloo以PageR... 本文介绍了一个大型分布式Web Crawler系统——Igloo 1.2版。它采用分布式的系统结构,通过我们设计的二级哈希映射算法使系统可以进行高效的任务分割,并且系统的规模动态可扩展.爬行网页的质量是评价Crawler的一个重要指标,Igloo以PageRank值作为网页质量评价的标准,从而提高了爬行质量.加快爬行速度的关键是如何解除Crawler系统中的性能瓶颈,本文对此也作了详细的讨论,并提出了一种基于“滞后合并”策略的UBL数据库存取方法.实验表明,Igloo在保持高性能的同时能快速爬行到高质量的网页. 展开更多
关键词 web爬虫 爬行策略 分布式系统 计算机网络 网页
下载PDF
Design of a Web Crawler for Water Quality Monitoring Data and Data Visualization
2
作者 Ziwen Yu Jianjun Zhang +6 位作者 Wenwu Tan Ziyi Xiong Peilun Li Liangqing Meng Haijun Lin Guang Sun Peng Guo 《Journal on Big Data》 2022年第2期135-143,共9页
Many countries are paying more and more attention to the protection of water resources at present,and how to protect water resources has received extensive attention from society.Water quality monitoring is the key wo... Many countries are paying more and more attention to the protection of water resources at present,and how to protect water resources has received extensive attention from society.Water quality monitoring is the key work to water resources protection.How to efficiently collect and analyze water quality monitoring data is an important aspect of water resources protection.In this paper,python programming tools and regular expressions were used to design a web crawler for the acquisition of water quality monitoring data from Global Freshwater Quality Database(GEMStat)sites,and the multi-thread parallelism was added to improve the efficiency in the process of downloading and parsing.In order to analyze and process the crawled water quality data,Pandas and Pyecharts are used to visualize the water quality data to show the intrinsic correlation and spatiotemporal relationship of the data. 展开更多
关键词 Water quality monitoring data web crawler data visualization
下载PDF
BP网络在Web Crawler中的应用
3
作者 张艳艳 《微计算机信息》 北大核心 2008年第27期95-96,119,共3页
本文介绍了Web Crawler和BP网络的基本原理,在此基础上,应用BP网络对网页变化的时间间隔进行建模,通过BP算法训练得到一个预测模型,预测出各网页的变化时间间隔,通过与实际采集的时间间隔相比较判断网页是否发生变化。实验证明,BP网络... 本文介绍了Web Crawler和BP网络的基本原理,在此基础上,应用BP网络对网页变化的时间间隔进行建模,通过BP算法训练得到一个预测模型,预测出各网页的变化时间间隔,通过与实际采集的时间间隔相比较判断网页是否发生变化。实验证明,BP网络能够有效预测网页变化的时间间隔,指导增量更新。 展开更多
关键词 webcrawler BP网络 预测模型
下载PDF
基于机器学习的Web网络爬虫算法优化研究
4
作者 刘俊培 贾继洋 +2 位作者 班岚 迟欢 孙沛叶 《软件》 2024年第4期4-7,共4页
随着互联网的不断发展,网络爬虫在信息获取和数据挖掘等领域中的应用越来越广泛。同时在互联网相关应用中,机器学习技术成为一种非常重要的手段,能够完成更加高效和准确的网络爬取。然而,现有的网络爬虫算法还存在着很多问题,比如效率... 随着互联网的不断发展,网络爬虫在信息获取和数据挖掘等领域中的应用越来越广泛。同时在互联网相关应用中,机器学习技术成为一种非常重要的手段,能够完成更加高效和准确的网络爬取。然而,现有的网络爬虫算法还存在着很多问题,比如效率低下、容易被封禁等。因此,本文对现有的网络爬虫算法进行分析和总结,找出其中存在的问题和不足之处,提出一种基于机器学习的网络爬虫算法优化方法,使其更加智能和自适应,以期更好地满足实际应用的需求。 展开更多
关键词 机器学习 web网络爬虫算法 算法优化
下载PDF
增量更新Crawler进行Web收集方法研究 被引量:2
5
作者 程菲 汪建海 罗键 《计算机工程与科学》 CSCD 2006年第12期28-30,98,共4页
本文针对目前Web信息挖掘中存在的各种问题,对网络爬虫系统进行研究,提出了一种基于HTTP协议原理、旨在减少网络爬虫系统运行时网络流量的Web页面收集方法———增量更新Crawler方法。该方法通过Web预取技术对现有的Web链接数据库进行... 本文针对目前Web信息挖掘中存在的各种问题,对网络爬虫系统进行研究,提出了一种基于HTTP协议原理、旨在减少网络爬虫系统运行时网络流量的Web页面收集方法———增量更新Crawler方法。该方法通过Web预取技术对现有的Web链接数据库进行演化更新,可以在减少网络流量的同时获得接近现有网络爬虫系统的效果。 展开更多
关键词 信息检索 网络爬虫 增量更新
下载PDF
Weighted PageRank Algorithm Search Engine Ranking Model for Web Pages
6
作者 S.Samsudeen Shaffi I.Muthulakshmi 《Intelligent Automation & Soft Computing》 SCIE 2023年第4期183-192,共10页
As data grows in size,search engines face new challenges in extracting more relevant content for users’searches.As a result,a number of retrieval and ranking algorithms have been employed to ensure that the results a... As data grows in size,search engines face new challenges in extracting more relevant content for users’searches.As a result,a number of retrieval and ranking algorithms have been employed to ensure that the results are relevant to the user’s requirements.Unfortunately,most existing indexes and ranking algo-rithms crawl documents and web pages based on a limited set of criteria designed to meet user expectations,making it impossible to deliver exceptionally accurate results.As a result,this study investigates and analyses how search engines work,as well as the elements that contribute to higher ranks.This paper addresses the issue of bias by proposing a new ranking algorithm based on the PageRank(PR)algorithm,which is one of the most widely used page ranking algorithms We pro-pose weighted PageRank(WPR)algorithms to test the relationship between these various measures.The Weighted Page Rank(WPR)model was used in three dis-tinct trials to compare the rankings of documents and pages based on one or more user preferences criteria.Thefindings of utilizing the Weighted Page Rank model showed that using multiple criteria to rankfinal pages is better than using only one,and that some criteria had a greater impact on ranking results than others. 展开更多
关键词 Weighted pagerank algorithms search engines web pages web crawlers World Wide web
下载PDF
基于Web应用的全流程自动化性能测试方法分析
7
作者 鲍珊珊 侯伟 +1 位作者 赵辉 唐铭晨 《信息技术与标准化》 2023年第10期42-47,共6页
针对常规手工利用Jmeter对Web应用开展性能测试操作繁琐、效率低下的问题,在综合Jmeter和网络爬虫技术的基础上,设计一种全流程自动化性能测试方法,该方法详细介绍了实现从测试数据的获取,测试的执行到报告的输出全流程自动化操作,并通... 针对常规手工利用Jmeter对Web应用开展性能测试操作繁琐、效率低下的问题,在综合Jmeter和网络爬虫技术的基础上,设计一种全流程自动化性能测试方法,该方法详细介绍了实现从测试数据的获取,测试的执行到报告的输出全流程自动化操作,并通过实践与手工方法进行对比分析,证明该方法可行、有效,测试效率提升明显,具备良好的应用价值和推广意义。 展开更多
关键词 web 应用 JMETER 网络爬虫 性能测试 全流程自动化
下载PDF
基于在线评论分析法的童车产品优化设计研究
8
作者 胡康 计开禹 《设计》 2024年第4期105-109,共5页
为了提高婴童产品用户需求获取的效率及准确性,基于现有在线评论分析在实体产品设计中的应用研究,提出了基于在线评论分析的童车优化设计流程,利用在线评论挖掘等方法获取童车用户需求信息,并通过语义分析与情感分析,充分了解用户对于... 为了提高婴童产品用户需求获取的效率及准确性,基于现有在线评论分析在实体产品设计中的应用研究,提出了基于在线评论分析的童车优化设计流程,利用在线评论挖掘等方法获取童车用户需求信息,并通过语义分析与情感分析,充分了解用户对于产品的使用体验与使用需求,为产品优化提供准确的指导。准确及全面地洞察用户需求是设计迭代升级的基础,本文结合在线评论分析方法构建童车用户需求维度,为童车的优化设计研究提供了新思路。 展开更多
关键词 用户需求 需求分析 评论挖掘 网络爬虫 童车设计
下载PDF
数字空间生育议题的公众表达及性别差异:以新浪微博为例的分析
9
作者 吴帆 高旭瑶 《山东女子学院学报》 2024年第3期10-20,共11页
分析数字空间生育议题的公众表达,既能深化对人口动态变化微观逻辑的理解,也能为政策制定提供公众情感和态度方面的直接证据。研究基于5300条微博文本数据,采用LDA主题模型和SnowNLP情感分析工具,探讨三孩生育政策实施初期及两年后公众... 分析数字空间生育议题的公众表达,既能深化对人口动态变化微观逻辑的理解,也能为政策制定提供公众情感和态度方面的直接证据。研究基于5300条微博文本数据,采用LDA主题模型和SnowNLP情感分析工具,探讨三孩生育政策实施初期及两年后公众对生育议题的态度表达及变化。研究显示,支持和批评共同构成了生育政策公共讨论的主要内容,生育率—女性的共现频次最高,女性对生育的关注度明显更高,负面情绪也更多。同时,随着政策实施时间的推移,讨论从相对广泛议题逐渐聚焦于生育率问题。在数字空间里,公众对传统婚育观念的挑战、对个人幸福和自我实现的追求,反映出社会价值观、个人权利与政策导向之间的多维交织。 展开更多
关键词 数字空间 生育政策 微博 爬虫分析
下载PDF
基于震后舆情的灾情信息提取研究
10
作者 闫晓美 牛艳杰 +1 位作者 王宁 许振鹏 《山西地震》 2024年第1期1-4,16,共5页
大地震发生后,通常会出现大量关于地震灾害的信息并在网络中快速传播,为快速准确地获取地震灾情信息,开展基于震后舆情提取灾情信息的相关研究。首先构建灾情信息挖掘模型,建立灾情关键词表,通过计算词向量相似度,快速提取地震灾情等相... 大地震发生后,通常会出现大量关于地震灾害的信息并在网络中快速传播,为快速准确地获取地震灾情信息,开展基于震后舆情提取灾情信息的相关研究。首先构建灾情信息挖掘模型,建立灾情关键词表,通过计算词向量相似度,快速提取地震灾情等相关信息。同时以“山东德州原平5.5级地震”为案例,验证构建模型在地震灾情提取方面的效果及其可行性和实用性。结果表明,该研究可为震后快速应对和处置灾情提供一定的参考数据和决策依据。 展开更多
关键词 地震灾情 震后舆情 网络爬虫 文本挖掘 信息提取
下载PDF
一种通用Web信息采集系统的设计与实现 被引量:11
11
作者 吴丽辉 王斌 余智华 《计算机工程》 EI CAS CSCD 北大核心 2005年第3期123-124,194,共3页
介绍了一种通用的Web信息采集系统,给出了系统总体结构,分析了信息采集器、采集控制服务器和信息发布服务器,讨论了系统实际的应用。实践证明,该系统能够对Internet信息进行自动采集,并对今后的应用提供充分的支持,具有良好的通用性。
关键词 web信息 通用性 采集系统 服务器 信息发布 信息采集 设计 证明 实际 系统总体结构
下载PDF
面向Web的信息收集工具的设计与开发 被引量:14
12
作者 潘春华 常敏 武港山 《计算机应用研究》 CSCD 北大核心 2002年第6期144-147,共4页
随着互联网的发展以及网上信息的日益丰富 ,传统的信息处理已经延伸到互联网领域。在对互联网上的信息进行处理时 ,常常要将分布在互联网各处的Web页面下载到本地供进一步处理 ;这便是所讨论的Web页面收集工具的核心功能。该页面收集系... 随着互联网的发展以及网上信息的日益丰富 ,传统的信息处理已经延伸到互联网领域。在对互联网上的信息进行处理时 ,常常要将分布在互联网各处的Web页面下载到本地供进一步处理 ;这便是所讨论的Web页面收集工具的核心功能。该页面收集系统在综合使用Web页面间的链接关系和页面内容的基础上 ,增加了多层次的页面过滤模块 ,可用来收集特定领域内的Web页面 ;同时可采用多机并行收集的方法提高页面收集的效率 ;采用大型数据库存放元收集信息 ,并对收集到的页面进行压缩 ,能够支持海量数据的收集 ;动态更新机制的实施使得下载到本地的页面信息能够得到及时的更新。 展开更多
关键词 web 信息收集工具 设计 页面收集 信息处理 网络爬虫 万维网 INTERNET
下载PDF
基于主题的Web信息采集系统的设计与实现 被引量:23
13
作者 李盛韬 赵章界 余智华 《计算机工程》 CAS CSCD 北大核心 2003年第17期102-104,共3页
基于主题的Web信息采集是信息检索领域内一个新兴且有实用价值的方向,也是信息处理技术中的一个研究热点。文章分析了主题Web信息采集的基本问题,提出了难点以及相关的解决方案,并在此基础上设计实现了“天达”主题Web信息采集系统。
关键词 信息采集 信息检索 信息处理 主题采集
下载PDF
基于v3洋葱域名的比特币地址威胁程度分析
14
作者 胡锦枫 徐晓瑀 +1 位作者 陈云芳 张伟 《计算机工程》 CAS CSCD 北大核心 2024年第3期173-181,共9页
比特币可以在不透露使用者身份的情况下进行交换,导致其成为不法分子在暗网上进行违法活动的主要方式。为了追踪比特币非法交易,传统方法根据比特币的伪匿名性,在整个区块链上进行启发式地址聚类,没有充分利用比特币地址在暗网上的信息... 比特币可以在不透露使用者身份的情况下进行交换,导致其成为不法分子在暗网上进行违法活动的主要方式。为了追踪比特币非法交易,传统方法根据比特币的伪匿名性,在整个区块链上进行启发式地址聚类,没有充分利用比特币地址在暗网上的信息。2021年Tor官方全面启用v3洋葱域名,使得以往的v2洋葱域名数据无法再作为分析的依据。设计并实现基于v3洋葱域名的比特币地址威胁程度的一体化分析框架TLAFDB。信息收集模块使用境外服务器解决地域限制并设置socks5h代理以支持暗网爬虫运行,使用洋葱种子地址在暗网中爬行收集最新的v3洋葱域名数据,信息清洗模块采用可同时覆盖Base58和Bech32编码的正则表达式以提取v3洋葱域名网页中的比特币地址,通过区块链搜索引擎Blockchain.com筛选存在真实交易的比特币地址,并建立其和所在v3洋葱域名的关联关系,信息分析模块采用人工分析和关键词匹配相结合的方法分类v3洋葱域名,赋予其关联的比特币地址类别和流行度并判定威胁程度。实验结果表明,TLAFDB收集了23627个v3洋葱域名网页,提取并分析1141个存在真实交易的比特币地址的类别、流行度和威胁程度,发现在暗网中同一个比特币地址常出现在大量的镜像洋葱域名网页上,超过95%的比特币地址被恶意使用,并且庞氏骗局交易量占高危比特币地址总交易量的99%。 展开更多
关键词 暗网 爬虫 v3洋葱域名 比特币地址 分类
下载PDF
分布式Web信息采集系统的研究与设计 被引量:10
15
作者 李盛韬 成绫 余智华 《计算机工程与应用》 CSCD 北大核心 2003年第16期162-166,182,共6页
Web信息的急速膨胀,使得Web信息采集面临一个巨大的挑战。针对这一情况,实现了一个分布式Web信息采集系统,以提高一般Web信息采集的能力。文章论述了分布式信息采集的基本原理、分类、难点以及相应的对策,并就该分布式Web信息采集系统... Web信息的急速膨胀,使得Web信息采集面临一个巨大的挑战。针对这一情况,实现了一个分布式Web信息采集系统,以提高一般Web信息采集的能力。文章论述了分布式信息采集的基本原理、分类、难点以及相应的对策,并就该分布式Web信息采集系统进行了仔细的剖析。最后,对分布式Web信息采集的发展作了一个展望。 展开更多
关键词 信息采集 分布式 搜索引擎 信息处理 web
下载PDF
改进的PageRank在Web信息搜集中的应用 被引量:12
16
作者 秦拯 张玲 李娜 《计算机研究与发展》 EI CSCD 北大核心 2006年第6期1044-1049,共6页
PageRank是一种用于网页排序的算法,它利用网页间的相互引用关系评价网页的重要性·但由于它对每条出链赋予相同的权值,忽略了网页与主题的相关性,容易造成主题漂移现象·在分析了几种PageRank算法基础上,提出了一种新的基于主... PageRank是一种用于网页排序的算法,它利用网页间的相互引用关系评价网页的重要性·但由于它对每条出链赋予相同的权值,忽略了网页与主题的相关性,容易造成主题漂移现象·在分析了几种PageRank算法基础上,提出了一种新的基于主题分块的PageRank算法·该算法按照网页结构对网页进行分块,依照各块与主题的相关性大小对块中的链接传递不同的PageRank值,并能根据已访问的链接对块进行相关性反馈·实验表明,所提出的算法能较好地改进搜索结果的精确度· 展开更多
关键词 PAGERANK算法 主题分块 web信息搜集
下载PDF
Web恶意代码主动检测与分析系统的设计与实现 被引量:4
17
作者 倪平 陈正果 +1 位作者 欧阳雄弈 王冬 《计算机应用》 CSCD 北大核心 2011年第A02期106-108,共3页
在深入研究了客户端蜜罐的基础上,提出了动态与静态相结合的Web恶意代码检测方法,实现了Web恶意代码主动检测与分析系统(HoneyCat)。该系统主动对指定的网站进行检测,并对可疑的页面进行分析,通过动态跟踪检测IE进程对注册表和文件的操... 在深入研究了客户端蜜罐的基础上,提出了动态与静态相结合的Web恶意代码检测方法,实现了Web恶意代码主动检测与分析系统(HoneyCat)。该系统主动对指定的网站进行检测,并对可疑的页面进行分析,通过动态跟踪检测IE进程对注册表和文件的操作以及其网络行为,发现是否存在可疑行为,然后对有可疑行为的网页进行静态分析。静态分析利用漏洞特征库定位恶意代码的准确位置和所利用的漏洞。对于无法识别所利用漏洞的页面生成一个分析文件,为手工分析提供帮助,有助于对漏洞的研究,并有机会发掘未知漏洞。经过测试发现该系统运行稳定,准确率高,能有效地检测出页面中的恶意代码。 展开更多
关键词 web恶意代码 客户端蜜罐 网络爬虫 动态检测 静态分析
下载PDF
Deep Web爬虫爬行策略研究 被引量:13
18
作者 郑冬冬 崔志明 《计算机工程与设计》 CSCD 北大核心 2006年第17期3154-3158,共5页
如今Web上越来越多的信息可以通过查询接口来获得,为了获取某DeepWeb站点的页面用户不得不键入一系列的关键词集。由于没有直接指向DeepWeb页面的静态链接,当前大多搜索引擎不能发现和索引这些页面。然而,近来研究表明DeepWeb站点提供... 如今Web上越来越多的信息可以通过查询接口来获得,为了获取某DeepWeb站点的页面用户不得不键入一系列的关键词集。由于没有直接指向DeepWeb页面的静态链接,当前大多搜索引擎不能发现和索引这些页面。然而,近来研究表明DeepWeb站点提供的高质量的信息对许多用户来说是非常有价值。这里研究了怎样建立起一个有效的DeepWeb爬虫,它可以自动发现和下载DeepWeb页面。由于DeepWeb惟一“入口点”是查询接口,DeepWeb爬虫设计面对的主要挑战是怎样对查询接口自动产生有意义的查询。这里提出一种针对查询接口查询自动产生问题的理论框架。通过在实际DeepWeb站点上的实验证明了此方法是非常有效的。 展开更多
关键词 DEEP web DEEP web爬虫 查询选择 查询效能 适应性爬行算法
下载PDF
基于Web智能的网络广告监测器研究与设计 被引量:5
19
作者 陈治昂 张毅 李大学 《重庆邮电大学学报(自然科学版)》 北大核心 2009年第1期115-118,126,共5页
为了解决网络广告投放效果监测困难的问题,基于网络广告的搜索引擎和网络爬虫等Web智能技术,设计了一种独立的、第三方的网络广告监测器,描述了当前网络广告的发展现状、系统的结构模块设计、时序调度设计以及相应的系统实现方案和核心... 为了解决网络广告投放效果监测困难的问题,基于网络广告的搜索引擎和网络爬虫等Web智能技术,设计了一种独立的、第三方的网络广告监测器,描述了当前网络广告的发展现状、系统的结构模块设计、时序调度设计以及相应的系统实现方案和核心算法。通过实验评测表明,该系统能够取得较好的效果。 展开更多
关键词 网络广告 搜索引擎 网络爬虫 web智能 监测
下载PDF
科研人员Web数据自动抓取模式及其开源解决方案 被引量:9
20
作者 张婷婷 刘凯 王伟军 《信息资源管理学报》 2015年第2期21-27,共7页
大数据时代的科研竞争是数据之争,高质量数据的获取往往决定着研究结论的优劣乃至项目的成败。然而对于科研人员的Web数据自动抓取问题,学界目前尚未有系统性研究成果出现。本文对数据抓取的基本模式进行分析,归纳出四类科研人员Web数... 大数据时代的科研竞争是数据之争,高质量数据的获取往往决定着研究结论的优劣乃至项目的成败。然而对于科研人员的Web数据自动抓取问题,学界目前尚未有系统性研究成果出现。本文对数据抓取的基本模式进行分析,归纳出四类科研人员Web数据抓取的基本模式:单站静态抓取模式、跨站静态抓取模式、单站动态抓取模式及跨站动态抓取模式及其技术难点。本文同时也提出了科研人员Web数据自动抓取技术的两种开源解决方案:基于开源爬虫和自行定制爬虫,最后详细探讨了各方案的软件架构并给出了基本代码框架。 展开更多
关键词 科研人员 web数据抓取 技术方案 开源软件
下载PDF
上一页 1 2 46 下一页 到第
使用帮助 返回顶部