首站-论文投稿智能助手
典型文献
基于梅尔频谱分离和LSCNet的声学场景分类方法
文献摘要:
针对现有频谱分离方法进行声学场景分类研究时其分类准确率不高的问题,提出了一种基于梅尔频谱分离和长距离自校正卷积神经网络(long-distance self-calibration convolutional neural network,LSCNet)的声学场景分类方法.首先,介绍了频谱的谐波打击源分离原理,提出了一种梅尔频谱分离算法,将梅尔频谱分离出谐波分量、打击源分量和残差分量;然后,结合自校正神经网络和残差增强机制,提出了一种长距离自校正卷积神经网络;该模型采用频域自校正算法以及长距离增强机制来保留特征图原始信息,通过残差增强机制和通道注意力增强机制加强了深层特征与浅层特征间的关联度,且结合多尺度特征融合模块,以进一步提取模型训练中输出层的有效信息,从而提高模型的分类准确率;最后,基于Urbansound8K和ESC-50数据集开展了声学场景分类实验.实验结果表明:梅尔频谱的残差分量能够针对性地减少背景噪音的影响,从而具有更好的分类性能,且LSCNet实现了对特征图中频域信息的关注,其最佳分类准确率分别达到90.1%和88%,验证了该方法的有效性.
文献关键词:
声学场景分类;梅尔频谱分离算法;长距离自校正卷积神经网络;频域自校正算法;多尺度特征融合
作者姓名:
费鸿博;吴伟官;李平;曹毅
作者机构:
江南大学 机械工程学院,江苏 无锡214122;江苏省食品先进制造装备技术重点实验室(江南大学),江苏 无锡214122
引用格式:
[1]费鸿博;吴伟官;李平;曹毅-.基于梅尔频谱分离和LSCNet的声学场景分类方法)[J].哈尔滨工业大学学报,2022(05):124-130,123
A类:
LSCNet,声学场景分类,长距离自校正卷积神经网络,梅尔频谱分离算法,频域自校正算法
B类:
分类方法,分离方法,分类研究,分类准确率,long,distance,self,calibration,convolutional,neural,network,源分离,分离原理,谐波分量,增强机制,特征图,通道注意力,注意力增强,深层特征,多尺度特征融合,特征融合模块,提取模型,模型训练,出层,有效信息,Urbansound8K,ESC,少背,噪音,分类性能,中频,域信息
AB值:
0.198764
相似文献
机标中图分类号,由域田数据科技根据网络公开资料自动分析生成,仅供学习研究参考。