摘要
在对网络藏语文本做信息抽取时,往往由于有很多藏族人具有同一个名字,使研究人员得不到期望的结果。为了解决这种"信息丢失问题",本论述在分析其产生原因的基础上,提出可采用生物学中序列比对的方法与社会网络分析方法中的图聚类算法相结合,对藏语人名进行消重。将人名实体的各个属性抽象成各个序列,进而通过各个序列的对比来统计出每两个相同人名的相似度,在通过社会网络分析方法中图聚类算法的决定该两个人名所表示的是否为同一个人,将表示同一个人的相同人名忽略,进而达到消重。
出处
《甘肃科技纵横》
2011年第1期108-109,共2页
Scientific & Technical Information of Gansu