典型文献
融合图嵌入和注意力机制的代码搜索
文献摘要:
源代码检索任务是指将自然语言作为查询语句,从代码库中搜索相关代码片段.在代码检索任务中,大多数代码检索算法只考虑代码片段的文本序列信息而未考虑代码的结构信息,导致不能充分捕获代码片段包含的语义和语法信息.为了提高对程序语言的理解,提出了注意力机制和图嵌入相结合的代码检索算法(GraphCS).在特征提取部分,以LSTM提取文本特征向量表示,以Graph2Vec提取图的向量特征表示.在特征融合部分中引入注意力机制,更好地为每一个特征分配相应的权重,从而提升程序的理解.考虑源代码和自然语言为异构数据,将代码片段特征和自然语言特征映射到同一个向量空间,以排名损失来保证语义相似的点在特征空间拥有较近的距离.为了验证算法的高效性,与目前最好的算法CODEnn进行对比.实验结果表明,在Precision@1/5/10、SuccessRate@1/5/10以及MRR上均有一定的提升.
文献关键词:
源代码检索;注意力机制;图嵌入;自然语言;语义相似;向量空间
中图分类号:
作者姓名:
黄思远;赵宇海;梁燚铭
作者机构:
东北大学 计算机科学与工程学院,沈阳 110169
文献出处:
引用格式:
[1]黄思远;赵宇海;梁燚铭-.融合图嵌入和注意力机制的代码搜索)[J].计算机科学与探索,2022(04):844-854
A类:
源代码检索,GraphCS,Graph2Vec,CODEnn,SuccessRate
B类:
图嵌入,注意力机制,代码搜索,自然语言,语句,数代,检索算法,序列信息,结构信息,语法,程序语言,文本特征,特征向量,向量表示,特征表示,特征融合,升程,异构数据,语言特征,特征映射,射到,同一个,向量空间,语义相似,特征空间,Precision,MRR
AB值:
0.319947
相似文献
机标中图分类号,由域田数据科技根据网络公开资料自动分析生成,仅供学习研究参考。