-
题名基于自注意力机制时频谱同源特征融合的鸟鸣声分类
被引量:3
- 1
-
-
作者
刘志华
陈文洁
陈爱斌
-
机构
中南林业科技大学计算机与信息工程学院
中南林业科技大学人工智能应用研究所
-
出处
《计算机应用》
CSCD
北大核心
2022年第4期1260-1268,共9页
-
基金
智慧物流技术湖南省重点实验室资助项目(2019TP1015)。
-
文摘
目前深度学习模型大都难以应对复杂背景噪声下的鸟鸣声分类问题。考虑到鸟鸣声具有时域连续性、频域高低性特点,提出了一种利用同源谱图特征进行融合的模型用于复杂背景噪声下的鸟鸣声分类。首先,使用卷积神经网络(CNN)提取鸟鸣声梅尔时频谱特征;然后,使用特定的卷积以及下采样操作,将同一梅尔时频谱特征的时域和频域维度分别压缩至1,得到仅包含鸟鸣声高低特性的频域特征以及连续特性的时域特征。基于上述提取频域以及时域特征的操作,在时域和频域维度上同时对梅尔时频谱特征进行提取,得到具有连续性以及高低特性的时频域特征。然后,将自注意力机制分别用于得到的时域、频域、时频域特征以加强其各自拥有的特性。最后,将这三类同源谱图特征决策融合后的结果用于鸟鸣声分类。所提模型用于Xeno-canto网站的8种鸟类音频分类,并在分类对比实验中取得了平均精确率(MAP)为0.939的较好结果。实验结果表明该模型能应对复杂背景噪声下的鸟鸣声分类效果较差的问题。
-
关键词
深度学习
鸟鸣声分类
卷积神经网络
自注意力机制
同源谱图特征融合
-
Keywords
deep learning
bird sound classification
Convolutional Neural Network(CNN)
self-attention mechanism
homologous spectrogram feature fusion
-
分类号
TP183
[自动化与计算机技术—控制理论与控制工程]
-