-
题名基于网络资源与用户行为信息的领域术语提取
被引量:8
- 1
-
-
作者
闫兴龙
刘奕群
方奇
张敏
马少平
茹立云
-
机构
智能技术与系统国家重点实验室(清华大学)
清华大学信息科学与技术国家实验室
清华大学计算机科学与技术系
总参陆航研究所
-
出处
《软件学报》
EI
CSCD
北大核心
2013年第9期2089-2100,共12页
-
基金
国家自然科学基金(60736044
60903107
+1 种基金
61073071)
高等学校博士学科点专项科研基金(20090002120005)
-
文摘
领域术语是反映领域特征的词语.领域术语自动抽取是自然语言处理中的一项重要任务,可以应用在领域本体抽取、专业搜索、文本分类、类语言建模等诸多研究领域,利用互联网上大规模的特定领域语料来构建领域词典成为一项既有挑战性又有实际价值的工作.当前,领域术语提取工作所利用的网络语料主要是网页对应的正文,但是由于网页正文信息抽取所面临的难题会影响领域术语抽取的效果,那么利用网页的锚文本和查询文本替代网页正文进行领域术语抽取,则可以避免网页正文信息抽取所面临的难题.针对锚文本和查询文本所存在的文本长度过短、语义信息不足等缺点,提出一种适用于各种类型网络数据及网络用户行为数据的领域数据提取方法,并使用该方法基于提取到的网页正文数据、网页锚文本数据、用户查询信息数据、用户浏览信息数据等开展了领域术语提取工作,重点考察不同类型网络资源和用户行为信息对领域术语提取工作的效果差异.在海量规模真实网络数据上的实验结果表明,基于用户查询信息和用户浏览过的锚文本信息比基于网页正文提取技术得到的正文取得了更好的领域术语提取效果.
-
关键词
领域术语自动抽取
新词发现
WEB数据挖掘
用户行为分析
-
Keywords
automatic domain-specific term extraction
novel term extraction
Web data mining
user behavior analysis
-
分类号
TP391
[自动化与计算机技术—计算机应用技术]
-