国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:莫宏伟,田朋
单位:哈尔滨工程大学 智能科学与工程学院,哈尔滨 150001,,哈尔滨工程大学 智能科学与工程学院,哈尔滨 150001,
关键词:图像理解;语义层;语义特征;视觉关系;场景图;图像描述;注意力机制
基金:国家重点研发计划项目(2018AAA0102702).
视觉场景理解包括检测和识别物体、推理被检测物体之间的视觉关系以及使用语句描述图像区域.为了实现对场景图像更全面、更准确的理解,将物体检测、视觉关系检测和图像描述视为场景理解中3种不同语义层次的视觉任务,提出一种基于多层语义特征的图像理解模型,并将这3种不同语义层进行相互连接以共同解决场景理解任务.该模型通过一个信息传递图将物体、关系短语和图像描述的语义特征同时进行迭代和更新,更新后的语义特征被用于分类物体和视觉关系、生成场景图和描述,并引入融合注意力机制以提升描述的准确性.在视觉基因组和COCO数据集上的实验结果表明,所提出的方法在场景图生成和图像描述任务上拥有比现有方法更好的性能.
来源:2021年第12期
《控制与决策》期刊编辑部