一种新的基于聚类的试探性SMOTE算法被引量：2

New tentative SMOTE algorithm based on clustering

下载PDF

导出

摘要针对传统过采样算法中常常出现的生成噪声点、数据分布边缘化、未增强足够特征的问题,提出了一种新算法:试探性少数类过采样技术(tentative synthetic minority over-sampling technique,TSMOTE)。该算法先将少数类样本进行K-means聚类,然后创建正类安全水平等指标,运用试探性的思想,放出试探点求出每个少数类样本对应的警戒点,获取最适合新样本生成的空间区域,最后在簇心和警戒点之间进行合成少数类过采样技术(synthetic minority over-sampling technique,SMOTE),确保新样本的生成质量。在12个公开数据集上的大量实验表明:TSMOTE算法可以有效提高分类器对少数类样本和整体数据集的分类性能。 Aiming at the phenomenon of generating noise points,marginal data distribution,and missing minority features that often occur in traditional oversampling algorithms,a new algorithm named by the Tentative Synthetic Minority Over-sampling Technique(TSMOTE)is proposed.The algorithm first performs K-means clustering of minority samples,and then introduces indicators such as positive safe level.Relying on tentative ideas,it releases tentative points to find the warning line corresponding to each minority sample,and obtains the most suitable new sample generation,Synthetic Minority Over-sampling Technique(SMOTE)is performed between the cluster center and the warning line to ensure the generation quality of new samples.A large number of experiments on 12 public data sets show that the TSMOTE algorithm can effectively improve the classification performance of the classifier on minority samples and overall data sets.

作者王曜郑列 WANG Yao;ZHENG Lie(School of Science, Hubei University of Technology, Wuhan 430068, China)

机构地区湖北工业大学理学院

出处《重庆理工大学学报（自然科学）》 CAS 北大核心 2022年第4期187-195,共9页 Journal of Chongqing University of Technology：Natural Science

基金教育部人文社会科学研究规划基金项目(17YJA790098)。

关键词不平衡数据试探性 K-MEANS SMOTE 安全水平 unbalanced data tentative K-means SMOTE safe level

分类号 TP301.6 [自动化与计算机技术—计算机系统结构]

引文网络
相关文献

参考文献4

1陈斌,苏一丹,黄山.基于KM-SMOTE和随机森林的不平衡数据分类[J].计算机技术与发展,2015,25(9):17-21. 被引量：22
2王波,邓科.DB-SMOTE及多层堆叠用于心律失常识别[J].西安电子科技大学学报,2021,48(4):136-143. 被引量：2
3石洪波,陈雨文,陈鑫.SMOTE过采样及其改进算法研究综述[J].智能系统学报,2019,14(6):1073-1083. 被引量：58
4崔鑫,徐华,宿晨.面向不均衡数据集的过抽样算法[J].计算机应用,2020,40(6):1662-1667. 被引量：9

二级参考文献31

1HanJiawei,KamberM,PeiJian.数据挖掘概念与技术[M].第3版.北京:机械工业出版社,2012.
2Breiman L. Random forests [ J ]. Machine Learning, 2001,45 ( 1 ) :5-32.
3Ishwaran H,Kogalur U B,Blackstone E H,et al. Random sur- vival forests [ J ]. The Annals of Applied Statistics, 2008,2 (3) :841-860.
4Chawla N V, Bowyer K W, Hall L O, et al. SMOTE:synthetic minority over-sampling technique [ J]. Journal of Artificial In- telligence Research ,2002,16:321-357.
5Han Hui, Wang Wenyuan, Mao Binghuan. Borderline-SMO- TE:a new over- sampling method in imbalanced data sets learning[ J ]. Advances in Intelligent Computing, 2005,3644 : 878-887.
6Vefikas A, Gelzinis A, Bacauskiene M. Mining data with ran- dom forests:a survey and results of new tests [ J ]. Pattern Rec- ognition, 2011,44 ( 2 ) :330-349.
7Wu G, Chang E. Class-boundary alignment for imbalanced da- ta set learning[ C]//Proc of workshop on learning from imbal- anced data sets II. Washington DC : [ s. n. ] ,2003:49-56.
8曾志强,吴群,廖备水,高济.一种基于核SMOTE的非平衡数据集分类方法[J].电子学报,2009,37(11):2489-2495. 被引量：49
9吴克寿,曾志强.非平衡数据集分类研究[J].计算机技术与发展,2011,21(9):39-42. 被引量：5
10陈铁明,马继霞,Samuel H.Huang,蔡家楣.一种新的快速特征选择和数据分类方法[J].计算机研究与发展,2012,49(4):735-745. 被引量：20

共引文献84

1杨鸿雁,田英杰.机器学习在食品安全风险预警及抽检方案制订中的应用研究[J].管理评论,2022,34(11):315-323. 被引量：3
2姜新盈,王舒梵,严涛.基于层次密度聚类的去噪自适应混合采样[J].计算机系统应用,2022,31(10):206-210.
3梁东,石英,谢长君,刘红丽,孙宇峰.引入权重分布RBO的CVT不平衡样本过采样算法[J].武汉理工大学学报,2021,43(5):92-98. 被引量：1
4梁硕,李海华.基于深度学习的布线违例预测方法[J].微电子学,2022,52(6):1027-1032. 被引量：2
5张旭东,孙圣力,王洪超.基于数据挖掘的触诊成像乳腺癌智能诊断模型和方法[J].大数据,2019,5(1):68-76. 被引量：4
6桂州,陈建国,王成彬.基于PCA-SMOTE-随机森林的地质不平衡数据分类方法——以东天山地球化学数据为例[J].桂林理工大学学报,2017,37(4):587-593. 被引量：7
7杜国栋,吕云辉,马磊,相艳,邵党国,雷强,胡蓉.基于ROSE和C5.0算法的打鼾者OSAHS初筛模型[J].计算机工程与应用,2018,54(3):250-254. 被引量：3
8戴昕琦.商业银行信用风险评估模型研究——基于线上供应链金融的实证[J].软科学,2018,32(5):139-144. 被引量：34
9王思晨,丁家满.一种不平衡数据集成分类方法[J].软件导刊,2018,17(8):76-80. 被引量：2
10刘新雯.基于综合改进随机森林算法的中国财政风险预警研究[J].计算机应用与软件,2018,35(9):73-78. 被引量：3

同被引文献15

1闫明松,周志华.代价敏感分类算法的实验比较[J].模式识别与人工智能,2005,18(5):628-635. 被引量：14
2李闯,丁晓青,吴佑寿.一种改进的AdaBoost算法——AD AdaBoost[J].计算机学报,2007,30(1):103-109. 被引量：53
3刘龙霞,吴军华.基于分类树和贪心算法的测试数据自动生成方法[J].计算机工程与设计,2011,32(8):2734-2736. 被引量：5
4郑伟,马楠.一种改进的决策树后剪枝算法[J].计算机与数字工程,2015,43(6):960-966. 被引量：17
5宋万洋,李国和,吴卫江,洪云峰,周晓明.基于平衡准确率和规模的决策树剪枝算法[J].科学技术与工程,2016,16(16):79-82. 被引量：4
6龚俭,臧小东,苏琪,胡晓艳,徐杰.网络安全态势感知综述[J].软件学报,2017,28(4):1010-1026. 被引量：168
7程家根,祁正华,陈天赋.基于RBF神经网络的网络安全态势感知[J].南京邮电大学学报（自然科学版）,2019,39(4):88-95. 被引量：35
8焦亚男,马杰.一种改进的MEP决策树剪枝算法[J].河北工业大学学报,2019,48(6):24-29. 被引量：11
9于安池,储茂祥,杨永辉,董秀.具有强化学习策略的决策树算法[J].合肥工业大学学报（自然科学版）,2021,44(5):616-620. 被引量：10
10周莉,李静毅.基于决策树算法的联级网络安全态势感知模型[J].计算机仿真,2021,38(5):264-268. 被引量：15

引证文献2

1谢兆贤,邹兴敏,张文静.面向大型数据集的高效决策树参数剪枝算法[J].计算机工程,2024,50(1):156-165. 被引量：3
2周玉,岳学震,孙红玉.考虑不平衡指数的不平衡数据集分类设计方法[J].计算机应用研究,2023,40(12):3566-3571.

二级引证文献3

1严志,邱春荣,王兆平.基于决策树算法的高职奖助金精准评判研究[J].长沙民政职业技术学院学报,2024,31(1):119-124.
2张宝雷,吴禹轲,唐雨风.基于CART决策树的FPSO单点系泊系统电滑环故障诊断[J].海洋工程装备与技术,2024,11(2):95-100.
3岳巧琳,林旭旭,杨菁岩.基于决策树模型的电动汽车目标客户销售策略[J].应用数学进展,2024,13(8):3885-3891.

1杨椿雪,原梦,张金玲,王天佐.基于轴位和矢状位T1WI增强图像影像组学模型术前预测脑膜瘤病理分级的初步研究[J].磁共振成像,2022,13(2):6-9. 被引量：5
2周艳聪,郝园媛.基于机器学习的运营商客户行为分析[J].科学技术与工程,2022,22(2):585-592. 被引量：6
3Mohammad Kazim Hooshmand,Doreswamy Hosahalli.Network anomaly detection using deep learning techniques[J].CAAI Transactions on Intelligence Technology,2022,7(2):228-243. 被引量：5
4邱灿华,吴杰.基于DBSCAN改进的SMOTE算法[J].计算机与网络,2022,48(7):62-66.
5张立灿,郭明旻,林志阳,张鹏,段雅丽.基于守恒高阶模型和支持向量机的多车道车辆换道模型[J].计算物理,2022,39(1):83-95. 被引量：2
6肖圳,何彦,李育锋,吴鹏程,刘德高,杜江.改进MDSMOTE与PSO-SVM在汽车组合仪表分类预测中的应用[J].工程设计学报,2022,29(1):20-27. 被引量：2
7姜万录,马歆宇,岳毅,赵亚鹏.类间数据不均衡条件下基于平衡随机森林的轴向柱塞泵故障诊断方法[J].液压与气动,2022,46(3):45-54. 被引量：5
8吴燃,唐清垚,姜小明,李欣蔚,李章勇.心电成分的多核尺度卷积神经网络分类算法研究[J].重庆邮电大学学报（自然科学版）,2022,34(2):243-249. 被引量：2
9吴万刚.基于乡村振兴的水环境生态修复技术方法体系研究--以长田湾水库为例[J].绿色科技,2022,24(8):68-71. 被引量：3
10穆朋,金桥,刘政波,邓云泽,刘宁.合成微生物群落构建技术在药用植物栽培领域的应用[J].中草药,2022,53(8):2506-2516. 被引量：2

重庆理工大学学报（自然科学）

2022年第4期

浏览历史

内容加载中请稍等...

一种新的基于聚类的试探性SMOTE算法被引量：2

参考文献4

二级参考文献31

共引文献84

同被引文献15

引证文献2

二级引证文献3

相关作者

相关机构

相关主题

浏览历史

一种新的基于聚类的试探性SMOTE算法 被引量：2

参考文献4

二级参考文献31

共引文献84

同被引文献15

引证文献2

二级引证文献3

相关作者

相关机构

相关主题

浏览历史

一种新的基于聚类的试探性SMOTE算法被引量：2