期刊文献+
共找到1篇文章
< 1 >
每页显示 20 50 100
基于核心词项平均划分相似度的短文本聚类算法
1
作者 马慧芳 朱志强 +1 位作者 成玉丹 贾俊杰 《计算机工程与科学》 CSCD 北大核心 2017年第8期1562-1569,共8页
针对短文本特征极度稀疏、上下文依赖性强等特点,以自顶向下的策略,提出一种基于核心词项平均划分相似度的短文本聚类算法CTMPS。该方法首先在整个短文本语料库中计算词项之间的概率相关性,以此为基础对短文本中词项进行加权,将权值较... 针对短文本特征极度稀疏、上下文依赖性强等特点,以自顶向下的策略,提出一种基于核心词项平均划分相似度的短文本聚类算法CTMPS。该方法首先在整个短文本语料库中计算词项之间的概率相关性,以此为基础对短文本中词项进行加权,将权值较大的词项作为最能代表该短文本的核心词项形成核心词项集;以信息论为基础,将核心词项作为划分依据计算平均划分相似度,选择平均划分相似度值最大包含该核心词项的短文本形成一类,用此策略反复迭代直到满足要求。最后,实验结果表明,本文提出的方法显著地提高了短文本聚类的性能。 展开更多
关键词 短文本聚类 核心词项 平均划分相似度 概率相关性
下载PDF
上一页 1 下一页 到第
使用帮助 返回顶部