-
题名基于尺度相关-双向长短期记忆网络模型的说话人识别
- 1
-
-
作者
曹书鑫
冯藤藤
葛凤培
梁春燕
-
机构
山东理工大学计算机科学与技术学院
北京邮电大学图书馆
-
出处
《计算机工程》
CAS
CSCD
北大核心
2023年第4期289-296,共8页
-
基金
国家自然科学基金(11704229)。
-
文摘
说话人识别通过语音对说话人进行身份认证,然而大部分语音在时域与频域具有分布多样性,目前说话人识别中的卷积神经网络深度学习模型普遍使用单一的卷积核进行特征提取,无法提取尺度相关特征及时频域特征。针对这一问题,提出一种尺度相关卷积神经网络-双向长短期记忆(SCCNN-BiLSTM)网络模型用于说话人识别。通过尺度相关卷积神经网络在每一层特征抽象过程中调整感受野大小,捕获由尺度相关块组成的尺度特征信息,同时引入双向长短期记忆网络保留与学习语音数据的多尺度特征信息,并在最大程度上提取时频域特征的上下文信息。实验结果表明,SCCNN-BiLSTM网络模型在LibriSpeech和AISHELL-1数据集上迭代50000次时的等错率为7.21%和6.55%,相比于ResCNN基线网络模型提升了25.3%和41.0%。
-
关键词
说话人识别
深度学习
尺度相关卷积
感受野
长短期记忆网络
-
Keywords
speaker recognition
deep learning
scale correlation convolution
receptive field
Long Short-Term Memory(LSTM)network
-
分类号
TP391.42
[自动化与计算机技术—计算机应用技术]
-