-
题名基于Hadoop平台的文本相似度检测系统的研究
被引量:5
- 1
-
-
作者
王小林
肖慧
邰伟鹏
-
机构
安徽工业大学计算机与技术学院
-
出处
《计算机技术与发展》
2015年第8期90-93,共4页
-
基金
国家自然科学基金资助项目(6100311)
安徽省自然科学研究重点项目(KJ2013Z023
KJ2013A058)
-
文摘
在现有的文本相似度计算方法中,获取关键词权值的TFIDF算法没有完全考虑到关键词在文本中的位置和其在文本库中的离散度对权值的影响,且当处理的文本库中信息量过大时,运行效率较低。针对上述问题,文中提出一种基于语义的信息熵与信息增益的TFIDF算法(TFIDFWGE)。该算法通过对给定的关键词添加位置权重与计算熵值和信息增益,得到关键词的最终权值,并利用Hadoop平台的Map/Reduce框架来实现TFIDFWGE算法和向量空间模型(VSM)的文本相似度计算过程。通过对两组真实的数据集进行的实验结果表明,与现有的TFIDF算法相比,TFIDFWGE算法的查全率和查准率更高,且在Hadoop平台上实现的文本相似度检测系统对信息量大的文本库处理效率更加高效。
-
关键词
文本相似度
语义
Map/Reduce框架
TFIDF算法
tfidfwge算法
-
Keywords
text similarity
semantic
Map/Reduce framework
TFIDF
tfidfwge
-
分类号
TP391
[自动化与计算机技术—计算机应用技术]
-