-
题名基于混合策略的高精度长术语自动抽取
被引量:18
- 1
-
-
作者
梁颖红
张文静
周德富
-
机构
江苏省现代企业信息化应用支撑软件工程技术研究开发中心
东北林业大学信息与计算机工程学院
-
出处
《中文信息学报》
CSCD
北大核心
2009年第6期26-30,共5页
-
基金
江苏省现代企业信息化应用支撑软件工程技术研究开发中心资助项目(SX200907)
黑龙江省博士后基金资助项目(520-415029)
+1 种基金
苏州市职业大学基金资助项目(SZD08L26)
"青蓝"工程资助项目
-
文摘
在目前的术语自动抽取中,双字词的精度已经达到了90.36%,但是三字以上的词的抽取精度只有66.63%,多字词的抽取成为了术语自动抽取的一个难点。该文提出了NC-value参数和互信息相结合的混合策略来识别三字以上的长术语的方法。该方法充分发挥了NC-value参数在利用词语上下文信息和互信息参数在词语结合强度两方面的优势,两者相互约束和配合,更有利于找到准确的长术语边界。采用生物信息领域Yapex语料进行实验,结果表明,三字以上长术语抽取正确率和召回率分别达到88.5%和76.6%,F测量值达到82.2%,稍高于其他方法的结果。
-
关键词
计算机应用
中文信息处理
术语抽取
Nc-value
互信息
-
Keywords
computer application
Chinese information processing
term recognition
Nc-value
mutual information
-
分类号
TP391
[自动化与计算机技术—计算机应用技术]
-
-
题名C值和互信息相结合的术语抽取
被引量:7
- 2
-
-
作者
梁颖红
张文静
张有承
-
机构
苏州市职业大学江苏省现代企业信息化应用支撑软件工程技术研究开发中心
东北林业大学信息与计算机工程学院
-
出处
《计算机应用与软件》
CSCD
2010年第4期108-110,共3页
-
基金
江苏省现代企业信息化应用支撑软件工程技术研究开发项目(SX200907)
黑龙江省博士后基金(520415029)
江苏省"青蓝"工程(2008)
-
文摘
在目前的生物信息领域开放语料的术语抽取实验中,前2000多个双字词的精度已经达到了90.36%,但是三字以上的词的抽取精度只有66.63%,多字词的抽取成为了名词术语自动抽取的一个难点问题。针对该难点,提出综合C-value参数在长术语抽取方面的优势,并与术语抽取中的互信息参数相结合的策略来识别术语。实验结果表明,长术语抽取正确率为75.7%,召回率为68.4%,F测量值为71.9%,高于相同语料下的其他方法。
-
关键词
术语抽取
C值
互信息
-
Keywords
term recognition c-value mutual information
-
分类号
TP391
[自动化与计算机技术—计算机应用技术]
-