基于生成对抗网络的语音信号分离被引量：6

Speech Signal Separation Based on Generative Adversarial Networks

下载PDF

导出

摘要基于深度学习的单声道语音分离需要计算时频掩蔽,但现有语音分离方法中时频掩蔽不可学习,也未将其封装到深度学习中进行优化,通常依赖于维纳滤波法进行后续处理。为此,提出一种基于生成对抗网络的语音信号分离方法。在语音生成阶段引入递归推导算法和稀疏编码器来改进时频掩蔽生成结果,并将生成的语音输入至判别器进行分类,以降低信号源之间的扰动。实验结果表明,与基于深度神经网络的语音信号分离方法相比,该方法的SDR、SIR分离指标分别提高6.2 dB和5.0 dB。 The single-channel speech separation based on deep learning needs to calculate the time-frequency masking,which,however,cannot be learnt in the existing methods.Moreover,the time-frequency masking is not encapsulated in in-depth learning for optimization,so it relies on Wiener filtering for subsequent processing.Therefore,this paper proposes a speech signal separation method based on Generative Adversarial Networks(GAN).In the speech generation stage,the recursive derivation algorithm and sparse encoder are introduced to improve the time-frequency generation results.Then,the generated speach is eatered into the discriminator for classification,so as to reduce the disturbance between signal sources.The experimental results show that compared with other speech signal separation methods,such as the codec-based method and the recurrent neural network-based method,the SDR and SIR separation indexes of the proposed method increase by 6.2 dB and 5.0 dB respectively.

作者刘航李扬袁浩期王俊影 LIU Hang;LI Yang;YUAN Haoqi;WANG Junying(School of Electromechanical Engineering,Guangdong University of Technology,Guangzhou 510006,China)

机构地区广东工业大学机电工程学院

出处《计算机工程》 CAS CSCD 北大核心 2020年第1期302-308,共7页 Computer Engineering

基金广东省科技计划项目(2013B011304008,2013B090600031) 佛山市产学研专项资金项目(2012HC100195)

关键词单声道语音分离生成对抗网络时频掩蔽递归推导稀疏编码器 single-channel speech separation Generative Adversarial Networks(GAN) time-frequency masking recursive derivation sparse encoder

分类号 TP391 [自动化与计算机技术—计算机应用技术]

引文网络
相关文献

参考文献8

1曹仰杰,贾丽丽,陈永霞,林楠,李学相.生成式对抗网络及其计算机视觉应用研究综述[J].中国图象图形学报,2018,23(10):1433-1449. 被引量：65
2黄建军,张雄伟,张亚非,邹霞.时频字典学习的单通道语音增强算法[J].声学学报,2012,37(5):539-547. 被引量：13
3王方杰,金赟.基于维纳滤波的数字助听器语音增强算法[J].电子器件,2017,40(4):1021-1025. 被引量：3
4余亮,吴海军,蒋伟康.结合波束形成和GAN网络的多通道语音增强研究[J].噪声与振动控制,2018,38(A02):591-596. 被引量：5
5梁尧,朱杰,马志贤.基于深度神经网络的单通道语音分离算法[J].信息技术,2018,42(7):24-27. 被引量：4
6蒋茂松,王冬霞,牛芳琳,曹玉东.稀疏正则非负矩阵分解的语音增强算法[J].计算机应用,2018,38(4):1176-1180. 被引量：6
7屈俊玲,李鸿燕.基于计算听觉场景分析的混合语音信号分离算法研究[J].计算机应用研究,2014,31(12):3822-3824. 被引量：6
8刘晶.基于盲源分离和噪声抑制的语音信号识别[J].计算机测量与控制,2018,26(12):140-144. 被引量：6

二级参考文献48

1邹霞,陈亮,张雄伟.基于Gamma语音模型的语音增强算法[J].通信学报,2006,27(10):118-123. 被引量：11
2王珊,许刚.基于计算听觉场景分析的语音混叠信号分离[J].计算机工程,2007,33(18):211-213. 被引量：1
3YANG Lu, Loizou P C. A geometric approach to spectral subtraction. Speech Communication, 2008: 50:453-466.
4HAO Jiucang, Hagai Attias, Srikantan Nagarajan, Te-Won Lee, Terrence J. Sejnowski. Speech enhancement, gain, and noise Spectrum adaptation using approximate bayesian es- timation. IEEE Trans. on Audio, Speech and Language Processing, 2009: 17(1): 24-37.
5Kris Hermus, Patrick Wambacq, van Hamme H. A reviewof signal subspace speech enhancement and its application to noise robust speech recognition. EURASIP Journal on Advances in Signal Processing, 2007:1-15.
6Sriram Srinivasan, Jonas Samuelsson, Bastiaan Kleijn W. Codebook-based bayesian speech enhancement for nonsta- tionary environments. IEEE Trans. on Audio, Speech and Language Processing, 2007: 15(2): 441-452.
7Hiroko Kato Solvang, Yuichi Nagahara, Shoko Araki, Hi- roshi Sawada, Shoji Makino. Frequency-domain pearson distribution approach for independent component analy- sis (FD-Pearson-ICA) in blind source separation. IEEE Trans. on Audio, Speech and Language Processing, 2009: 17(4): 639-649.
8J-rSme Bobin, Jean-Luc Starck, Jalal M. Fadili, Yassir Moudden, David L. Donoho. Morphological component analysis: an adaptive thresholding strategy. IEEE Trans. on image processing, 2007: 16(11): 2675-2681.
9Romain Hennequin, Roland Badeau, Bertrand David. NMF with time-frequency activations to model non sta- tionary audio events. IEEE Trans. on Audio, Speech and Language Processing, 2010: 19(4): 744-753.
10XU Tao, WANG Wenwu. A block-based compressed sens- ing method for underdetermined blind speech separation incorporating binary mask. ICASSP, 2010:2022-2025.

共引文献98

1卫星,杨国强,李佳,陆阳,石雷.结合多尺度条件生成对抗网络的井下轨道检测[J].中国图象图形学报,2020,25(2):282-293. 被引量：2
2罗国强,梁奂晖,方斌.计算机视觉结构组成分析与应用途径研究[J].计算机产品与流通,2020,0(3):13-13.
3张立伟,贾冲,张雄伟,闵刚,曾理.稀疏卷积非负矩阵分解的语音增强算法[J].数据采集与处理,2014,29(2):259-264. 被引量：13
4周彬,邹霞,张雄伟.改进的噪声鲁棒语音稀疏线性预测算法[J].声学学报,2014,39(5):655-662. 被引量：1
5ZHOU Bin,ZOU Xia,ZHANG Xiongwei.An improved algorithm for noise-robust sparse linear prediction of speech[J].Chinese Journal of Acoustics,2015,34(1):84-95. 被引量：1
6李轶南,张雄伟,贾冲,陈亮,曾理.稀疏低秩噪声模型下无监督实时单通道语音增强算法[J].声学学报,2015,40(4):607-614. 被引量：8
7赖联有,金福江,吴浩瀚.语音信号的量子随机滤波降噪方法[J].信息与控制,2015,44(5):598-603. 被引量：2
8赵蓉蓉,李鸿燕,曹猛.基于CASA和谱减法的清音分离改进算法[J].电子技术应用,2016,42(1):68-71.
9胡永刚,张雄伟,邹霞,闵刚,张立伟,王健.ADMM稀疏非负矩阵分解语音增强算法[J].计算机工程与应用,2016,52(3):108-112. 被引量：2
10张雄伟,李轶南,时文华,胡永刚,陈栩杉.非负组合模型及其在声源分离中的应用[J].数据采集与处理,2017,32(2):266-277. 被引量：2

同被引文献34

1刘文举,聂帅,梁山,张学良.基于深度学习语音分离技术的研究现状与进展[J].自动化学报,2016,42(6):819-833. 被引量：67
2刘莹,赵彤洲,江逸琪,柴悦,李翔.基于自相关函数的钢琴乐音改进识别算法[J].武汉工程大学学报,2018,40(2):208-213. 被引量：6
3余亮,吴海军,蒋伟康.结合波束形成和GAN网络的多通道语音增强研究[J].噪声与振动控制,2018,38(A02):591-596. 被引量：5
4孙成立,王海武.生成式对抗网络在语音增强方面的研究[J].计算机技术与发展,2019,29(2):152-156. 被引量：5
5程显毅,谢璐,朱建新,胡彬,施佺.生成对抗网络GAN综述[J].计算机科学,2019,46(3):74-81. 被引量：29
6张晓龙,彭宜.基于残差网络和随机森林的音频识别方法[J].计算机工程与科学,2019,41(4):727-732. 被引量：8
7包瑞清.基于机器学习的风景园林智能化分析应用研究[J].风景园林,2019,26(5):29-34. 被引量：8
8范存航,刘斌,陶建华,温正棋,易江燕.一种基于卷积神经网络的端到端语音分离方法[J].信号处理,2019,35(4):542-548. 被引量：12
9Z.F.Li,M.-A.Meier,E.Hauksson,Z.W.Zhan,J.Andrews,王林.机器学习应用于地震预警中的地震波判别研究[J].世界地震译丛,2019,50(5):401-410. 被引量：2
10蔡云骧,石磊,田振锡.一种基于装备三维模型的数码迷彩图案设计方法[J].兵工学报,2019,40(11):2296-2303. 被引量：7

引证文献6

1王涛,全海燕.低信噪比下联合训练生成对抗网络的语音分离[J].计算机工程与科学,2021,43(6):1088-1094.
2黎思泉,万永菁,蒋翠玲.基于生成对抗网络去影像的多基频估计算法[J].计算机科学,2022,49(3):179-184. 被引量：2
3尹文兵,高戈,曾邦,王霄,陈怡.基于时频域生成对抗网络的语音增强算法[J].计算机科学,2022,49(6):187-192. 被引量：1
4李敏,刘冰清,彭庆龙,于淼.基于CycleGAN算法的迷彩服装图案设计方法研究[J].丝绸,2022,59(8):100-106. 被引量：4
5罗宇,胡维平,吴华楠.一种基于聚类的门控卷积网络语声分离方法[J].应用声学,2023,42(5):1099-1105.
6胡嘉欣,田军.基于生成对抗网络的数字音频信号多声道增强方法[J].现代电子技术,2023,46(19):41-44. 被引量：1

二级引证文献8

1刘玥彤,吴迪,滕华.基于改进胶囊神经网络的乐音主频识别研究[J].南京理工大学学报,2023,47(2):207-213.
2王伟珍,张功.基于CycleGAN的服装图像混搭风格迁移[J].现代纺织技术,2023,31(4):250-258. 被引量：1
3许华杰,张勃.基于生成对抗网络与特征融合的多尺度音频序列生成方法[J].计算机应用研究,2023,40(9):2770-2774.
4武田甜,李静.噪声环境中的双声道音频回波抵消模型构建[J].现代电子技术,2023,46(24):24-28.
5花芬,牛豫,程龙.唐代螺钿镜宝相花纹样的数字化创新设计与应用[J].毛纺科技,2024,52(2):67-75.
6郭宇轩,孙林.基于DCGAN算法的服装效果图生成方法[J].毛纺科技,2024,52(2):114-120. 被引量：1
7吴攸攸.AI在服装图案设计中的应用研究[J].化纤与纺织技术,2023,52(10):194-196. 被引量：1
8陈薄茹.基于多基频估计的多声部音乐和声自动编配算法[J].赤峰学院学报（自然科学版）,2024,40(3):10-14.

1叶静娴,吕中荣,汪利.基于逐步优化算法的随机波浪荷载反演[J].中山大学学报（自然科学版）,2019,58(5):33-38. 被引量：1
2刘伟波,曾庆宁,罗瀛,郑展恒.低信噪比环境下语音识别的鲁棒性方法研究[J].声学技术,2019,38(6):650-656. 被引量：6
3燕丽红.基于Matlab&GUI语音信号处理平台的设计[J].计算机与数字工程,2020,48(1):267-270. 被引量：6
4范珍艳,王莲子,庄晓东.基于FrFT的自适应阈值语音滤波降噪研究[J].青岛大学学报（工程技术版）,2019,34(4):18-23. 被引量：1
5孔祥阳,彭群聂,徐保根.基于方向和结构特征的遥感图像条带噪声分离方法[J].电光与控制,2020,27(1):6-11. 被引量：4
6张怀念,蔡宇翔,张芬,张婉玉,焦赵爽.BRCA2基因沉默介导ATM信号通路对前列腺癌细胞增殖和凋亡的调控机制[J].肿瘤药学,2019,9(6):886-891.
7石庆福.多模式融合的体育视频技术实验分析[J].实验室研究与探索,2019,38(12):177-181.
8李欣蔚,廖佳,董秀瑜,周新,杨贺棋,武龙,汪秋宽,周慧.功能性肽的分离及富集研究进展[J].食品科学,2020,41(1):267-276. 被引量：5
9曲建博,吴威,肖玲,孙惠惠,朱晖,邹振兴,张燕,陈思为,刘恒宇,周辉,徐康平.布朗卷柏黄酮类化学成分研究[J].肿瘤药学,2019,9(6):859-864. 被引量：2
10袁梅,刘洋,乔黎,吴双.表皮生长因子调控核因子κB诱导卵巢上皮性癌紫杉醇耐药的作用及机制[J].临床和实验医学杂志,2020,19(2):151-155. 被引量：1

计算机工程

2020年第1期

浏览历史

内容加载中请稍等...

基于生成对抗网络的语音信号分离被引量：6

参考文献8

二级参考文献48

共引文献98

同被引文献34

引证文献6

二级引证文献8

相关作者

相关机构

相关主题

浏览历史

基于生成对抗网络的语音信号分离 被引量：6

参考文献8

二级参考文献48

共引文献98

同被引文献34

引证文献6

二级引证文献8

相关作者

相关机构

相关主题

浏览历史

基于生成对抗网络的语音信号分离被引量：6