-
题名跨语言相似文档检索
被引量:4
- 1
-
-
作者
王洪俊
施水才
俞士汶
肖诗斌
-
机构
北京大学计算语言研究所
北京信息工程学院中文信息处理研究中心
-
出处
《中文信息学报》
CSCD
北大核心
2007年第1期30-37,共8页
-
基金
国家973项目(2004CB318102)
863项目(2001AA114210
+3 种基金
2002AA117010)
北京市重大科技计划项目(H030130050610)
国家自然科学基金资助项目(60272084)
北京市教委重大项目(KZ200310772013)
-
文摘
检索一篇文档在其他语言中的译文对于双语平行语料库的建立是一件很有意义的工作。本文提出一种改进的跨语言相似文档检索算法,该算法使用双语词典或统计翻译模型作为双语知识库,查找两篇文档的共同翻译词对,把翻译词对的权重作为一种特征来进行相似度计算,用Dice方法的改进算法计算双语文档的相似度。在实验中,统计检索文档的译文排在检索结果前N位的总次数来评价算法的性能,并使用了两个噪音数据集来评价算法的有效性。实验表明,在噪音数据干扰比较大的情况下,译文排在检索结果前5位的译文结果接近90%。实验证明,翻译词对的权重对于相似度计算有很大帮助,本算法可以有效地发现一种语言书写的文档在另一种语言中的译稿。
-
关键词
计算机应用
中文信息处理
跨语言相似文档检索
文档相似度
双语文档对齐
-
Keywords
computer application
Chinese information processing
crossqanguage similar document retrieval
document similarity
bilingual document alignment
-
分类号
TP391
[自动化与计算机技术—计算机应用技术]
-