为降低DBSCAN算法的运行时间,结合MCMC(Markov chain Monte Carlo,马尔可夫链蒙特卡洛)采样方法对DBSCAN进行改进,提出一种聚类算法,称为DBSCAN++。其基本思想是优先扩展拓展能力较强的核心对象。通过实验将DBSCAN++与DBSCAN和OPTICS进...为降低DBSCAN算法的运行时间,结合MCMC(Markov chain Monte Carlo,马尔可夫链蒙特卡洛)采样方法对DBSCAN进行改进,提出一种聚类算法,称为DBSCAN++。其基本思想是优先扩展拓展能力较强的核心对象。通过实验将DBSCAN++与DBSCAN和OPTICS进行对比,实验结果表明,从算法运行时间看,DBSCAN++比DBSCAN平均降低了60.7%,比OPTICS平均降低了70.2%;从聚类准确性角度看,DBSCAN++与DBSCAN和OPTICS相当。在没有影响聚类准确性的情况下,DBSCAN++具有更低的运行时间,是一种有效的聚类算法。展开更多
为提高浮动车数据中异常数据检测能力及不同载客状态下的模型检测分析能力,提出基于S-DTA-IIForest(Summation&Difference Third Order Average&Improvement-Isolation Forest)的浮动车数据异常检测算法。构建由相邻两项求和(S...为提高浮动车数据中异常数据检测能力及不同载客状态下的模型检测分析能力,提出基于S-DTA-IIForest(Summation&Difference Third Order Average&Improvement-Isolation Forest)的浮动车数据异常检测算法。构建由相邻两项求和(S)、三阶求和平均差分(DTA)的二维度空间SDTA特征向量;提出差额累计更新和动态区分辨识的改进孤立森林IIForest算法,通过设置停止阈值参数,避免当出现新样本异常值分数大于停止阈值时,仅更新样本不更新孤立森林模型的问题,设计每个二叉树区分辨识度参数,区分辨识度位于停止区间时停止二叉树生长,提高算法收敛性能,以ROC(Receiver Operating Characteristic)曲线下面积AUC(Area Under ROC Cure)、F1-score为指标对模型精度进行对比分析,并以重庆市中心城区学府大道开展实例验证。结果表明:本文S-DTA-IIForest组合算法AUC、F1-score分别为86.63%、0.89,AUC较传统孤立森林IForest(Isolation Forest)提高32.4%,运行效率提高1.29%,具有收敛速度更快、精度更高的优势,载客条件下模型AUC、F1-score较未载客分别提高7.7%、10.8%,组合算法对载客数据有更高的检测精度,且未载客状态数据异常率较载客状态增加71.4%,未载客数据异常率更高。展开更多
文摘为降低DBSCAN算法的运行时间,结合MCMC(Markov chain Monte Carlo,马尔可夫链蒙特卡洛)采样方法对DBSCAN进行改进,提出一种聚类算法,称为DBSCAN++。其基本思想是优先扩展拓展能力较强的核心对象。通过实验将DBSCAN++与DBSCAN和OPTICS进行对比,实验结果表明,从算法运行时间看,DBSCAN++比DBSCAN平均降低了60.7%,比OPTICS平均降低了70.2%;从聚类准确性角度看,DBSCAN++与DBSCAN和OPTICS相当。在没有影响聚类准确性的情况下,DBSCAN++具有更低的运行时间,是一种有效的聚类算法。
文摘为提高浮动车数据中异常数据检测能力及不同载客状态下的模型检测分析能力,提出基于S-DTA-IIForest(Summation&Difference Third Order Average&Improvement-Isolation Forest)的浮动车数据异常检测算法。构建由相邻两项求和(S)、三阶求和平均差分(DTA)的二维度空间SDTA特征向量;提出差额累计更新和动态区分辨识的改进孤立森林IIForest算法,通过设置停止阈值参数,避免当出现新样本异常值分数大于停止阈值时,仅更新样本不更新孤立森林模型的问题,设计每个二叉树区分辨识度参数,区分辨识度位于停止区间时停止二叉树生长,提高算法收敛性能,以ROC(Receiver Operating Characteristic)曲线下面积AUC(Area Under ROC Cure)、F1-score为指标对模型精度进行对比分析,并以重庆市中心城区学府大道开展实例验证。结果表明:本文S-DTA-IIForest组合算法AUC、F1-score分别为86.63%、0.89,AUC较传统孤立森林IForest(Isolation Forest)提高32.4%,运行效率提高1.29%,具有收敛速度更快、精度更高的优势,载客条件下模型AUC、F1-score较未载客分别提高7.7%、10.8%,组合算法对载客数据有更高的检测精度,且未载客状态数据异常率较载客状态增加71.4%,未载客数据异常率更高。