期刊文献+

“天网”目录导航服务研究 被引量:8

On the Directory Navigation Service in Tianwang
下载PDF
导出
摘要 为了提高搜索引擎的查准率 ,帮助用户快速地定位其感兴趣的网页 ,研究了如何在Spider式搜索引擎“天网”系统中提供目录导航服务 基本思想就是利用有指导的机器学习方法实现中文网页的自动分类 主要贡献有两点 :①搜集并建立了一个面向中文网页并且支持层次模型的大规模中文网页数据集 ,这是实现中文网页自动分类的前提和基础 ;②针对中文网页信息的自身特性以及CHI方法的固有缺陷 ,提出一种自动清除“噪音”的特征选取算法 ,并实现了一个能够处理海量中文网页的分类器 实验结果表明该分类器有较高的分类质量 。 To improve the precision of search engine and locate user interesting Web page promptly, an investigation is made of how to provide directory navigation service in Tianwang, a spider style search engine The main idea is to implement Chinese Web page categorization automatically using supervised machine learning technology There are two important contributions in this paper: ①a large scale Chinese Web page data set in a hierarchy model is gathered and built, and it is the basis and premises to implement the Chinese Web page classification automatically; ②in consideration of the features of Chinese Web page and the inherent faults of CHI method, a new feature selection algorithm is implemented, which can reduce noise automatically A classifier for massive Chinese Web pages is implemented The experimental results demonstrate that the classifier is effective and can satisfy category navigation service of search engine
出处 《计算机研究与发展》 EI CSCD 北大核心 2004年第4期653-659,共7页 Journal of Computer Research and Development
基金 国家"九七三"重点基础研究发展规化基金项目 (G19990 3 2 70 6)
关键词 搜索引擎 目录导航 WEB挖掘 中文网页分类 search engine directory navigation Web mining Chinese Web page classification
  • 相关文献

参考文献10

  • 1WebInfomallWebsitshttp://net.cs.pku.edu.cn/-webg/infomall/index.html . 2002
  • 2TianwangsearchengineWebsits http://e.pku.edu.cn . 1997
  • 3http://cn.yahoo.com . 2003
  • 4YYang,XLiu.Are examinationoftextcategorizationmethods[].ACMSIGIRConfonResearchandDevelopmentinInformationRetrieval.1999
  • 5FengShicong,ShanSongwei,ZhangZhigongetal.AdatasetofChineseWebpagesanditscategorization[].ProcoftheCross straitInformationTechnologyWorkshop.2002
  • 6YYang,JanOPedersen.Acomparativestudyonfeatureselectionintextcategorization[].ThethInt’’lConfonMachineLearning.1997
  • 7YYang.Astudyonthresholdingstrategiesfortextcategoriza tion[].ACMSIGIRConfonResearchandDevelopmentinInforma tionRetrieval.2001
  • 8SChakrabarti.Dataminingforhypertext:Atutorialsurvey[].ACMSIGKDDExplorations.2000
  • 9LeiMing,WangJianyong,ChenBaojueetal.Improvedrele vancerankinginwebgather[].JournalofComputerScienceandTechnology.2001
  • 10WangJianyong,ShanSongwei,LeiMingetal.Websearchen gine:Characteristicsofuserbehaviorsandtheirimplication[].Sci enceinChinaSeriesF.2001

同被引文献84

引证文献8

二级引证文献38

相关作者

内容加载中请稍等...

相关机构

内容加载中请稍等...

相关主题

内容加载中请稍等...

浏览历史

内容加载中请稍等...
;
使用帮助 返回顶部