-
题名中文文本体裁的自动分类机制
被引量:5
- 1
-
-
作者
方鸷飞
林鸿飞
杨志豪
赵晶
-
机构
大连理工大学计算机系
-
出处
《中文信息学报》
CSCD
北大核心
2006年第2期24-32,共9页
-
基金
国家自然科学基金资助项目(60373095)
-
文摘
文本按体裁自动分类属于按文本的形式分类的范畴,所以它与按内容自动分类问题有许多的不同之处,本文提出了一种关于中文文本体裁自动分类的新机制。在体裁分类过程中首要的问题是分类特征的选取,体裁分类特征项分为两种方式加以描述,一是集合形式,如基于分类词典和语料统计的政论性词汇和情感词汇等,二是规则形式,如公文标识信息和条文句等。基于根据特征之间的关联性和差异性,采用样本分布决策的方法抽取相应的特征项。最后利用支撑向量机算法进行自动分类。该机制已经在五类体裁的语料上得到实现,并获得了较好的效果。
-
关键词
计算机应用
中文信息处理
体裁分类
特征项选取
样本分布决策
支撑向量机
-
Keywords
computer application
Chinese information processing
text genre classification, feature selection
parametric distribution
support vector machine
-
分类号
TP391
[自动化与计算机技术—计算机应用技术]
-