控制与决策

北大核心,JST,Pж(AJ),EI,CSCD

国内刊号:21-1124/TP

国际刊号:1001-0920

控制与决策杂志2024年第3期:基于紧凑型Vision transformer的细粒度视觉分类

发布日期:

作者:徐昊,郭黎,李润泽

单位:重庆理工大学 计算机科学与工程学院,重庆 400054,,重庆理工大学 计算机科学与工程学院,重庆 400054;湖北民族大学 智能科学与工程学院, 湖北 恩施 445000,,南京航空航天大学 自动化学院,南京 211106,

关键词:紧凑型;Vision transformer;细粒度视觉分类;卷积块;归纳偏置;序列池化;混合损失

基金:国家自然科学基金项目(62263010,62020106003).

Vision transformer(ViT)已广泛应用于细粒度视觉分类中,针对其中存在的大数据量需求和高计算复杂度的问题,提出一种紧凑型ViT模型.首先,使用多层卷积块生成模型输入,保留更多底层信息和归纳偏置,减少对数据量的依赖;然后,使用序列池化技术取消分类令牌的使用,减少计算复杂度;最后,使用部位选择模块和混合损 失函数,进一步提升模型在细粒度视觉分类中的表现.所提出算法在公共数据集CUB-200-2011、Butterfly200、Stanford Dogs、Stanford Cars和NABirds中均进行了实验验证,在只使用少量的数据和计算资源条件下,分别获得了88.9%、87.4%、89.0%、93.4%和88.0%的准确率,训练时间平均比常用的ViT-B_16模型下降了73.8%,同时比TransFG模型下降了93.9%,并且训练过程中的参数量只有这两种模型的1/4左右.实验结果充分表明,所提出的模型较之其他主流的方法在数据量需求和计算复杂度方面具有明显的优越性,可广泛应用于工业过程控制、设备微小故障检测与诊断中.

来源:2024年第3期

《控制与决策》期刊编辑部

查看控制与决策杂志2024年第3期

联系我们

  • 地址:沈阳市和平区文化路3巷11号
  • 电话:024-83687766
  • E-mail:kzyjc@mail.neu.edu.cn

咨询工作人员