铁道客车轮对上的不平衡质量影响列车运行安全及速度的进一步提升,轮对安装前需要精确检测不平衡质量并进行动平衡处理。本文提出自适应小波消噪、MUSIC(Multiple Signal Classification)谱估计、相关分析法相结合的方法,实现铁道客车...铁道客车轮对上的不平衡质量影响列车运行安全及速度的进一步提升,轮对安装前需要精确检测不平衡质量并进行动平衡处理。本文提出自适应小波消噪、MUSIC(Multiple Signal Classification)谱估计、相关分析法相结合的方法,实现铁道客车轮对动平衡振动信号特征的提取。通过Labview软件与MATLAB混合编程实现软件开发,并搭建铁道客车轮对动平衡测试平台进行实验验证,实验验证结果表明,经过降噪和采样分辨率的控制,可以克服现场噪声及频率干扰问题,提取的信号幅值及相位具有较高的精度,可实现轮对上不平衡质量及位置的准确探测。展开更多
类偏斜问题(class i mbalance problem)是数据挖掘领域的常见问题之一,人们提出了各种策略来处理这个问题.当训练样本存在类偏斜问题时,kNN分类器会将小类中的样本错分到大类,导致分类的宏F1指标下降.针对kNN存在的这个缺陷,提出了文本...类偏斜问题(class i mbalance problem)是数据挖掘领域的常见问题之一,人们提出了各种策略来处理这个问题.当训练样本存在类偏斜问题时,kNN分类器会将小类中的样本错分到大类,导致分类的宏F1指标下降.针对kNN存在的这个缺陷,提出了文本训练集的临界点(critical point,CP)的概念并对其性质进行了探讨,给出了求CP,CP的下近似值LA、上近似值UA的算法.之后,根据LA或UA及训练样本数对传统的kNN决策函数进行修改,这就是自适应的加权kNN文本分类.为了验证自适应的加权kNN文本分类的有效性,设计了2组实验进行对比:一组为不同的收缩因子间进行对比,可看做是与Tan的工作进行对比,同时用来证实在LA或UA上分类器的宏F1较好;另一组则是与随机重取样进行实验对比,其中,传统kNN方法作为对比的基线.实验表明,所提的自适应加权kNN文本分类优于随机重取样,使得宏F1指标明显上升.该方法有点类似于代价相关学习.展开更多
虚拟样本是一种在学习过程中引入先验知识的有效手段,一定程度上提高了分类器的性能。然而由于生成的虚拟样本集的数据分布与原始训练集的分布不一致,因此利用虚拟样本扩充后的训练样本集进行学习的分类器分类性能上存在波动。针对这种...虚拟样本是一种在学习过程中引入先验知识的有效手段,一定程度上提高了分类器的性能。然而由于生成的虚拟样本集的数据分布与原始训练集的分布不一致,因此利用虚拟样本扩充后的训练样本集进行学习的分类器分类性能上存在波动。针对这种不足,提出一种基于权重选择虚拟样本的新分类算法。该方法首先利用TrAdaBoost算法对扩充后的样本集进行预处理,然后选取权重大于某一给定阈值的样本构造新训练样本集,最后根据新样本集进行训练得到分类器。由于排出了不重要的样本,因此在新样本集上得到的分类器具有更高的精度。在部分UCI标准数据集与KDD cup 99网络入侵检测数据集上的对比实验说明了该算法较不产生虚拟样本的直接分类算法和利用虚拟样本全集进行训练的分类算法具有更高的精度。展开更多
文摘铁道客车轮对上的不平衡质量影响列车运行安全及速度的进一步提升,轮对安装前需要精确检测不平衡质量并进行动平衡处理。本文提出自适应小波消噪、MUSIC(Multiple Signal Classification)谱估计、相关分析法相结合的方法,实现铁道客车轮对动平衡振动信号特征的提取。通过Labview软件与MATLAB混合编程实现软件开发,并搭建铁道客车轮对动平衡测试平台进行实验验证,实验验证结果表明,经过降噪和采样分辨率的控制,可以克服现场噪声及频率干扰问题,提取的信号幅值及相位具有较高的精度,可实现轮对上不平衡质量及位置的准确探测。
文摘类偏斜问题(class i mbalance problem)是数据挖掘领域的常见问题之一,人们提出了各种策略来处理这个问题.当训练样本存在类偏斜问题时,kNN分类器会将小类中的样本错分到大类,导致分类的宏F1指标下降.针对kNN存在的这个缺陷,提出了文本训练集的临界点(critical point,CP)的概念并对其性质进行了探讨,给出了求CP,CP的下近似值LA、上近似值UA的算法.之后,根据LA或UA及训练样本数对传统的kNN决策函数进行修改,这就是自适应的加权kNN文本分类.为了验证自适应的加权kNN文本分类的有效性,设计了2组实验进行对比:一组为不同的收缩因子间进行对比,可看做是与Tan的工作进行对比,同时用来证实在LA或UA上分类器的宏F1较好;另一组则是与随机重取样进行实验对比,其中,传统kNN方法作为对比的基线.实验表明,所提的自适应加权kNN文本分类优于随机重取样,使得宏F1指标明显上升.该方法有点类似于代价相关学习.
文摘虚拟样本是一种在学习过程中引入先验知识的有效手段,一定程度上提高了分类器的性能。然而由于生成的虚拟样本集的数据分布与原始训练集的分布不一致,因此利用虚拟样本扩充后的训练样本集进行学习的分类器分类性能上存在波动。针对这种不足,提出一种基于权重选择虚拟样本的新分类算法。该方法首先利用TrAdaBoost算法对扩充后的样本集进行预处理,然后选取权重大于某一给定阈值的样本构造新训练样本集,最后根据新样本集进行训练得到分类器。由于排出了不重要的样本,因此在新样本集上得到的分类器具有更高的精度。在部分UCI标准数据集与KDD cup 99网络入侵检测数据集上的对比实验说明了该算法较不产生虚拟样本的直接分类算法和利用虚拟样本全集进行训练的分类算法具有更高的精度。
文摘实际生活中,经常会遇到大规模数据的分类问题,传统k-近邻k-NN(k-Nearest Neighbor)分类方法需要遍历整个训练样本集,因此分类效率较低,无法处理具有大规模训练集的分类任务。针对这个问题,提出一种基于聚类的加速k-NN分类方法 C_kNN(Speeding k-NN Classification Method Based on Clustering)。该方法首先对训练样本进行聚类,得到初始聚类结果,并计算每个类的聚类中心,选择与聚类中心相似度最高的训练样本构成新的训练样本集,然后针对每个测试样本,计算新训练样本集中与其相似度最高的k个样本,并选择该k个近邻样本中最多的类别标签作为该测试样本的预测模式类别。实验结果表明,C_k-NN分类方法在保持较高分类精度的同时大幅度提高模型的分类效率。