-
题名一种基于链接聚类的查询扩展算法
被引量:2
- 1
-
-
作者
李珀瀚
何震瀛
向河林
-
机构
复旦大学计算机科学技术学院
-
出处
《计算机研究与发展》
EI
CSCD
北大核心
2011年第S3期197-204,共8页
-
基金
国家科技重大专项(2010ZX01042-003-004)
国家自然科学重点基金项目(61033010)
+2 种基金
国家自然科学基金项目(61073001)
国家"八六三"高技术研究发展计划基金项目(2009AA062803)
上海市科委现代服务业专项基金项目(10dz1511000)
-
文摘
潜在语义分析(LSA)是一种用于自动实现知识提取和表示的理论和方法,它通过对大量的文本集进行统计分析,从其中挖掘出词语之间的潜在联系.LSA有效地解决了一义多词的问题,但是,由于LSA在大矩阵的计算效率和存储上的不足,这限制了LSA在大规模数据集上的应用.另一方面,在关系数据库中,数据对象通过多种类型的链接连接到一起.这些链接中蕴藏了丰富的语义信息.数据对象之间的相似性也可以通过这些链接体现出来.针对这个特点,提出了一种基于链接聚类的查询算法:利用数据对象之间的链接对数据对象进行聚类,用聚类代替文档来进行LSA处理,有效地减少处理文档的个数;在检索的过程中,寻找与关键字序列相似度最接近的簇,然后将簇内的文档返回给用户.实验结果表明,所提出的方法能够充分利用数据对象之间的链接,聚类效果明显;利用聚类后进行LSA处理,能够成倍地提高空间和时间开销,对精确度有提高作用.
-
关键词
潜在语义分析
基于链接的聚类算法
查询扩展
-
Keywords
latent semantic analysis
linkage-based clustering algorithm
query expansion
-
分类号
TP3
[自动化与计算机技术—计算机科学与技术]
-
-
题名一种基于聚类的语义检索算法
- 2
-
-
作者
向河林
张明西
李珀瀚
何震瀛
汪卫
-
机构
复旦大学计算机科学技术学院
-
出处
《计算机工程》
CAS
CSCD
2012年第2期36-38,共3页
-
基金
国家自然科学基金资助项目(60703093)
-
文摘
潜在语义分析在进行大规模语义检索时计算效率较低、存储开销较大。针对该问题,提出一种基于聚类的潜在语义检索算法。通过文档之间的结构关系对文档进行聚类,利用簇代替文档分析潜在语义,以此减少处理文档的个数。实验结果表明,该算法能减少查询时间,且检索精确度较高。
-
关键词
潜在语义分析
信息检索
向量空间模型
图聚类算法
-
Keywords
Latent Semantic Analysis(LSA)
information retrieval
vector space model
graph clustering algorithm
-
分类号
TP301.6
[自动化与计算机技术—计算机系统结构]
-