伴随着智能设备的普及和无线通信技术的发展,用户在使用无线网络满足各种需求时,无线网络也记录下了用户上网留下的大量时空轨迹数据。针对时空轨迹数据的异常检测已经成为数据挖掘领域一个新的研究热点。为了更好地关注学生健康发展,...伴随着智能设备的普及和无线通信技术的发展,用户在使用无线网络满足各种需求时,无线网络也记录下了用户上网留下的大量时空轨迹数据。针对时空轨迹数据的异常检测已经成为数据挖掘领域一个新的研究热点。为了更好地关注学生健康发展,促进校园信息化建设,以真实校园上网数据为例,提出了一种基于多尺度阈值和密度相结合的谱聚类算法(Spectral Clustering Algorithm Based on The Combination of Multi-Scale Threshold And Density,MSTD-SC),使用基于最短时间距离子序列(Shortest Time Distance-Shortest Time Distance Subsequences,STD-STDSS)的亲和距离函数来构造初始相似度矩阵,进一步引入协方差尺度阈值和空间尺度阈值对相似度矩阵进行0-1化处理,以此得到更精确的样本相似度,接着对相似度矩阵进行特征值分解,得到新的特征向量空间,最后采用DBSCAN聚类避免了K-means算法需要人工确定聚类数目的缺陷。利用轮廓系数评估多种算法得到的实验结果,MSTD-SC算法体现出了更好的聚类性能。将其应用于用户个体的异常检测中,异常用户名单被验证是有效可信的。展开更多
文摘伴随着智能设备的普及和无线通信技术的发展,用户在使用无线网络满足各种需求时,无线网络也记录下了用户上网留下的大量时空轨迹数据。针对时空轨迹数据的异常检测已经成为数据挖掘领域一个新的研究热点。为了更好地关注学生健康发展,促进校园信息化建设,以真实校园上网数据为例,提出了一种基于多尺度阈值和密度相结合的谱聚类算法(Spectral Clustering Algorithm Based on The Combination of Multi-Scale Threshold And Density,MSTD-SC),使用基于最短时间距离子序列(Shortest Time Distance-Shortest Time Distance Subsequences,STD-STDSS)的亲和距离函数来构造初始相似度矩阵,进一步引入协方差尺度阈值和空间尺度阈值对相似度矩阵进行0-1化处理,以此得到更精确的样本相似度,接着对相似度矩阵进行特征值分解,得到新的特征向量空间,最后采用DBSCAN聚类避免了K-means算法需要人工确定聚类数目的缺陷。利用轮廓系数评估多种算法得到的实验结果,MSTD-SC算法体现出了更好的聚类性能。将其应用于用户个体的异常检测中,异常用户名单被验证是有效可信的。