突发事件Web新闻多层次自动分类方法被引量：6

Automated Multiple Hierarchical Classification of Web News of Unexpected Events

下载PDF

导出

摘要为了对突发事件Web新闻进行更精确的分类,研究了突发事件Web新闻的多层次自动分类方法.该方法初步分析了突发事件Web新闻的分类,给出3层分类器的构造方法,即第1级和第2级通过规则定制来完成,第3级通过统计学习训练并实现,并研究了HTML文本向量空间模型及特征项的抽取方法.将该自动分类方法在甲型H1N1、法国空难以及汶川大地震等突发事件的Web新闻中进行了训练和测试.实验结果表明,所提方法的分类效果优于改进前的方法. To accurately classify Web news of unexpected events,an automated multiple hierarchical classification method is proposed.Firstly,the classification of Web news of unexpected events is analyzed in brief and three classifiers are constructed.The first and the second classifier are accomplished by the rules,while the third one needs to be realized by machine learning.Much more attention then is paid to Vector Space Model and feature extraction in HTML text.At last,the experiments which include the subjects of H1N1 influenza,French air crash and Wenchuan earthquake are conducted and analyzed.The results show that the method introduced is better than traditional methods.

作者蔡华利刘鲁王理

机构地区北京航空航天大学经济管理学院

出处《北京工业大学学报》 EI CAS CSCD 北大核心 2011年第6期947-954,共8页 Journal of Beijing University of Technology

基金国家自然科学基金资助项目(70971005 90924020) 国家科技支撑计划重大专项(2006BAK04A23) 质检公益行业科研专项(200910088)

关键词文本分类分类器特征抽取多层次体系突发事件 text classification classifiers feature extraction hierarchical systems unexpected events

分类号 TP391 [自动化与计算机技术—计算机应用技术]

引文网络
相关文献

参考文献9

1曾致远,张莉.基于向量空间模型的网页文本表示改进算法[J].计算机工程,2006,32(3):134-135. 被引量：10
2刘少辉,董明楷,张海俊,李蓉,史忠植.一种基于向量空间模型的多层次文本分类方法[J].中文信息学报,2002,16(3):8-14. 被引量：75
3王维娜,康耀红,伍小芹.文本分类中特征选择方法研究[J].信息技术,2008,32(12):29-31. 被引量：3
4肖雪,何中市.基于向量空间模型的中文文本层次分类方法研究[J].计算机应用,2006,26(5):1125-1126. 被引量：12
5Zhou Shui geng 1, Guan Ji hong 2, He Yan xiang 2 1. State Key Laboratory of Software Engineering, Wuhan University, Wuhan 430072, China 2. School of Computer Science, Wuhan University, Wuhan 430072, China.Hierarchical Classification of Chinese Documents Based on N grams[J].Wuhan University Journal of Natural Sciences,2001,6(Z1):416-422. 被引量：1
6蒲筱哥.Web自动文本分类技术研究综述[J].情报学报,2009,28(2):233-241. 被引量：9
7李渝勤,孙丽华.基于规则的自动分类在文本分类中的应用[J].中文信息学报,2004,18(4):9-14. 被引量：20
8周炎涛,唐剑波,吴正国.基于向量空间模型的多主题Web文本分类方法[J].计算机应用研究,2008,25(1):142-144. 被引量：14
9蒲强,李鑫,刘启和,杨国纬.一种Web主题文本通用提取方法[J].计算机应用,2007,27(6):1394-1396. 被引量：5

二级参考文献104

1封化民,刘飚,刘艳敏,方勇,宋国森.含有位置坐标树的Web页面分析和内容提取框架[J].清华大学学报（自然科学版）,2005,45(S1):1767-1771. 被引量：8
2付雪峰,王明文.基于模糊-粗糙集的文本分类方法[J].华南理工大学学报（自然科学版）,2004,32(z1):73-76. 被引量：8
3曾雪强,王明文,陈素芬.一种基于潜在语义结构的文本分类模型[J].华南理工大学学报（自然科学版）,2004,32(z1):99-102. 被引量：27
4王本年,高阳,陈世福,谢俊元.Web智能研究现状与发展趋势[J].计算机研究与发展,2005,42(5):721-727. 被引量：23
5万中英,王明文,廖海波.基于投影寻踪的中文网页分类算法[J].中文信息学报,2005,19(4):60-67. 被引量：11
6凌云,刘军,王勋.多层次web文本分类[J].情报学报,2005,24(6):684-689. 被引量：12
7陈涛,谢阳群.文本分类中的特征降维方法综述[J].情报学报,2005,24(6):690-695. 被引量：79
8黄萱菁.大规模中文文本的检索、分类与摘要研究.复旦大学博士学位论文[M].,1998..
9Belkin N,Croft W B.Information Filtering and Information Retrieval,Two Wides of the Same Coin[J].Communications of the ACM,1992,35(12):29-39.
10Mostafa J,Mukhopadhyay S,Lam W,et al.A Multilevel Approach to Intelligent Information Filtering:Model,System,and Evaluation[J].ACM Transactions on Information Systems,1997,15(4):368-399.

共引文献137

1高伟锋,刘连芳.基于分词和基于N-Gram的网页分类系统比较研究[J].广西科学院学报,2005,21(S1):58-60. 被引量：1
2吴光远,何丕廉,曹桂宏,聂颂.基于向量空间模型的词共现研究及其在文本分类中的应用[J].计算机应用,2003,23(z1):138-140. 被引量：23
3徐朝军.基础教育资源目录系统的设计与实现[J].电化教育研究,2009,30(3):71-75. 被引量：3
4黄玲,陈龙.基于网页分块的正文信息提取方法[J].计算机应用,2008,28(S2):326-328. 被引量：13
5赵志滨,贾岩峰,姚兰,鲍玉斌.含有丰富结构化数据的Web页面分类技术的研究[J].计算机研究与发展,2013,50(S1):53-60. 被引量：5
6胡卓颖,徐可,万中英,陆玉昌,丁树良.专题型网页搜集系统的设计与实现[J].计算机与现代化,2004(10):1-5.
7徐建锁,王正欧.基于LSI和自组织神经网络的高效文本聚类方法[J].天津大学学报（自然科学与工程技术版）,2004,37(11):1026-1030. 被引量：7
8李嘉佑,何清,史忠植.机器学习与网络信息处理[J].计算机工程与应用,2004,40(33):189-191. 被引量：3
9徐凤亚,罗振声.文本自动分类中特征权重算法的改进研究[J].计算机工程与应用,2005,41(1):181-184. 被引量：56
10丁文斌,李斌,罗浩.基于改进贝叶斯的垃圾邮件过滤系统设计与实现[J].计算机工程与应用,2005,41(18):127-130. 被引量：14

同被引文献104

1张启蕊,张凌,董守斌,谭景华.训练集类别分布对文本分类的影响[J].清华大学学报（自然科学版）,2005,45(S1):1802-1805. 被引量：26
2张珣,余乐安,黎建强,汪寿阳.重大突发事件对原油价格的影响[J].系统工程理论与实践,2009,29(3):10-15. 被引量：37
3侯汉清,黄刚.电子计算机与文献分类[J].现代图书情报技术,1982(1):5-14. 被引量：10
4周科进.网络媒体表现形式的集大成者:网络专题[J].新闻战线,2004(6):64-67. 被引量：23
5贾自艳,何清,张海俊,李嘉佑,史忠植.一种基于动态进化模型的事件探测和追踪算法[J].计算机研究与发展,2004,41(7):1273-1280. 被引量：58
6薛澜,钟开斌.突发公共事件分类、分级与分期:应急体制的管理基础[J].中国行政管理,2005(2):102-107. 被引量：320
7刘云峰,齐欢,代建民.潜在语义分析在中文信息处理中的应用[J].计算机工程与应用,2005,41(3):91-93. 被引量：18
8张宁,贾自艳,史忠植.使用KNN算法的文本分类[J].计算机工程,2005,31(8):171-172. 被引量：97
9王飞跃.社会计算——科学、技术与人文的数字化动态交融[J].中国基础科学,2005,7(5):5-12. 被引量：41
10袁军鹏,朱东华,李毅,李连宏,黄进.文本挖掘技术研究进展[J].计算机应用研究,2006,23(2):1-4. 被引量：57

引证文献6

1李兵,安悦.危机事件近实时情境感知研究综述[J].图书情报工作,2012,56(19):133-139. 被引量：3
2薛春香,张玉芳.面向新闻领域的中文文本分类研究综述[J].图书情报工作,2013,57(14):134-139. 被引量：24
3黄莉,李湘东.数字图书馆馆藏资源的文献类型研究[J].高校图书情报论坛,2015,0(4):19-22. 被引量：2
4兰秋军,李卫康,刘文星.不同情境下中文文本分类模型的表现及选择[J].湖南大学学报（自然科学版）,2016,43(4):141-146. 被引量：4
5潘守慧,王开义,王书锋,刘忠强.基于改进Single-Pass的农产品安全事件在线检测方法[J].科学技术与工程,2018,18(13):98-103. 被引量：2
6张馨月,宋绍成.突发事件中基于支持向量机算法的文本分类研究[J].信息技术与信息化,2022(8):13-16. 被引量：5

二级引证文献39

1贺金龙,付立军,姚郑,吕鹏飞,黄徐胜.基于网格LSTM混合算法的地质领域用户意图识别[J].计算机系统应用,2020(10):44-52. 被引量：1
2张小平.周总理是中国少数民族语言广播事业的奠基人[J].中国广播电视学刊,2000(3):52-52. 被引量：1
3李文慧,张英俊,潘理虎.多因素影响特征选择的短文本分类方法[J].计算机系统应用,2018,27(12):216-221. 被引量：3
4武建军,罗文龙.基于SVM的热点话题跟踪实现过程研究[J].信息安全与技术,2016,7(3):21-23.
5卢玲,杨武,刘恒洋.差错网络的文本分类反馈校正方法[J].重庆邮电大学学报（自然科学版）,2014,26(6):790-795. 被引量：1
6易欣,郭武士.基于语言无关性语义Kernel学习的短文本分类[J].计算机应用与软件,2015,32(7):314-318. 被引量：1
7毛婷婷,吕学强,周强,刘殷.融合从底向上与自顶向下的中文复杂句人工标注方法[J].小型微型计算机系统,2016,37(4):716-721. 被引量：1
8韩芳芳,朱文娟.国外“情境感知”研究现状的可视化分析[J].中国科技资源导刊,2016,48(3):90-98. 被引量：1
9王利萍.论纸质版硕博学位论文的收集管理工作——以华中师范大学图书馆为例[J].内蒙古科技与经济,2017(18):148-148.
10徐禹洪,黄沛杰.基于优化样本分布抽样集成学习的半监督文本分类方法研究[J].中文信息学报,2017,31(6):180-189. 被引量：11

1徐永广,李宇辉.基于Internet的协同学习系统的一个应用模型[J].华南理工大学学报（自然科学版）,2001,29(9):95-99. 被引量：1
2马成前,杨英.SOA架构下多层次信息共享平台的实现[J].计算机与数字工程,2009,37(5):178-180. 被引量：6
3小数点引发的空难[J].小学数学大眼界,2010(4):4-4.
4DHCP服务器之安全设置篇[J].网上俱乐部（电脑安全专家）,2005(4):117-118.
5陈骁.Iframe攻击解读[J].网管员世界,2009(12):95-95.
6丁大勇.企业IT，Wiki-Wiki![J].信息系统工程,2007,20(9):25-25.
7徐超,于达维.追踪甲型H1N1[J].财经,2009(10):76-79.
8孟静.阻击甲型H1N1[J].信息方略,2009(13):28-30.
9崔航,盛步云.PDM系统中产品编码系统研究与应用[J].软件导刊,2015,14(3):103-105. 被引量：4
10胡小娟.低成本挤压民航业[J].互联网周刊,2005(1):60-61.

北京工业大学学报

2011年第6期

浏览历史

内容加载中请稍等...

突发事件Web新闻多层次自动分类方法被引量：6

参考文献9

二级参考文献104

共引文献137

同被引文献104

引证文献6

二级引证文献39

相关作者

相关机构

相关主题

浏览历史

突发事件Web新闻多层次自动分类方法 被引量：6

参考文献9

二级参考文献104

共引文献137

同被引文献104

引证文献6

二级引证文献39

相关作者

相关机构

相关主题

浏览历史

突发事件Web新闻多层次自动分类方法被引量：6