-
题名基于百科语料的中英文双语词典提取
被引量:2
- 1
-
-
作者
王星
单力秋
侯磊
于济凡
陈吉
陶明阳
-
机构
辽宁工程技术大学电子与信息工程学院
清华大学计算机科学与技术系
清华大学人工智能研究院知识智能研究中心
清华大学北京信息科学与技术国家研究中心
-
出处
《中文信息学报》
CSCD
北大核心
2021年第1期25-33,共9页
-
基金
国家自然科学基金(61402212,61533018)
国家“十三五”重点研发计划(2017YFB1002101)
+4 种基金
NSFC-通用技术基础研究联合基金(U1736204)
辽宁省高等学校杰出青年学者成长计划(LJQ2015045)
中国博士后基金(2016M591452)
辽宁省自然科学基金(2015020098)
辽宁工程技术大学青年教师提升计划(拔尖人才)项目。
-
文摘
双语词典是跨语言自然语言处理中一项非常重要的资源。目前提取双语词典的方法主要是基于平行语料库和基于可比语料库,但是这两种方法在提取新词或者某些技术术语时都存在双语资源匮乏的问题。相比之下,基于部分双语语料的方法由于利用的是新闻或者百科知识,故可以很好地解决这个问题,然而目前基于部分双语语料的方法主要集中在对文本内容的提取上,缺乏对文本内容以外部分的提取。针对此不足,该文以中英文两种语言为例,提出了一种基于百科语料的中英文双语词典的提取方法。该方法是在对文本内容提取的基础上结合在线百科的结构特点,分别用五种不同的方法对百科语料进行提取,综合查重后得到的双语信息数量为969 308条。与以往的基于部分双语语料的双语词典的提取方法相比,该方法在在线百科语料上的提取数量提高了170.75%。
-
关键词
双语词典提取
跨语言自然语言处理
部分双语语料
-
Keywords
bilingual dictionary extraction
cross language natural language processing
part of bilingual corpus
-
分类号
TP391
[自动化与计算机技术—计算机应用技术]
-