摘要
为了更加准确地计算文本特征权重,提高文本相似度计算的精确度,文章提出了一种基于《知网(HowNet)》语义知识库的加权语义复杂网络文本相似度计算方法.该方法首先以特征词为节点,以特征词窗口共现为边,以特征词的TF-IDF值为特征词节点的初始权重,以融合共现频率和概念间语义距离计算特征词节点之间边的权重,构建加权语义文本复杂网络.然后利用综合特征指数作为加权语义网中文本的特征权重.最后基于公开数据集和KNN算法进行文本聚类实验,实验结果表明,在基于F-度量值标准上本文提出的方法要优于传统基于向量空间模型的TF-IDF方法和另一种结合复杂网络权重的方法.
作者
张弛
周艳玲
张贯虹
ZHANG Chi;ZHOU Yan-ling;ZHANG Guan-hong
出处
《赤峰学院学报(自然科学版)》
2019年第5期19-23,共5页
Journal of Chifeng University(Natural Science Edition)
基金
合肥学院重点教学研究项目(2018hfjyxm08)
安徽省自然科学基金青年项目(051308085QF115)
高校优秀青年人才支持计划重点项目(GXYQZD2016275)