T COGN DEV SYST2021. Bioinspired Visual-Integrated Model for Multilabel Classification of Textile Defect Images

T COGN DEV SYST2022. Bioinspired Visual-Integrated Model for Multilabel Classification of Textile Defect Images

论文地址


现代纺织工业过程的识别和分类过程中,使用卷积神经网络在单标签分类任务具有优越的性能,但多标签分类任务中无法解决判别小尺寸缺陷、考虑互相关标签的问题。文章提出了生物启发的多标签纺织分类方法BIVI-ML,继承了视觉增益模块、视觉注意力模块和视觉记忆模块,以达到增强分辨率和特征判别性、获取纺织品缺陷和联系相关标签的目的。文章构建了多标签纺织品分类的数据集,BIVI-ML方法在单标签分类和多标签分类任务中都展示了最优的性能。

主要问题

现代纺织品工业中,大量研究集中于单标签分类问题,而多标签分类更有挑战性,且更符合现实中的情况。卷积神经网络在单标签分类问题上得到了广泛应用,但直接应用与多标签分类会有问题:

  • 缺陷尺寸很小,卷积网络提取的特征尺寸又经过压缩,难以正确分辨缺陷。
  • 缺陷的多种标签之间的耦合和干扰会提高分类问题的复杂性。
  • 相比不需要考虑相关性的单标签,多标签之间缺陷label的相关性像是同类缺陷的依赖性,需要被考虑。

另一方面,探索生物启发模型是构建视觉系统的重要思路来源,相关学者探索了包括视觉相关性、记忆机制、视觉注意力机制,但尚未用于解决多标签分类问题。

文章贡献/创新点

启发自生物视觉系统的研究,文章提出了一种集成学习框架bioinpired visual-integrated framework (BIVI-ML)来有效分类纺织品缺陷。

  • 文章将三种视觉机制集成到框架中用于解决纺织品缺陷的多标签分类问题。
  • 视觉增益模块(VGM)通过增强特征分辨率和判别性来解决难分类问题。
  • 视觉注意力模块被用来降低背景干扰,此外使用了视觉记忆模块来在注意力区域中顺序地预测标签分数。
  • 提出了统一的纺织品标签数据集。

所提方法

假定XRX\in\mathbb R表示d维样本空间,Y={y1,y2,yq}Y=\{y_1,y_2\cdots,y_q\}表示qq个可能的类别标签。多标签学习的任务是从多标签训练集{(xi,Yi)1im}\{(x_i,Y_i)|1\leqslant i\leqslant m\}学习到一个函数h:X2Yh:X\rightarrow 2^Y。对于每个样本(xi,Yi)(x_i,Y_i)xiXx_i\in X是d维特征向量(xi1,xi2,,xid)(x_{i1},x_{i2},\cdots,x_{id})^\topyiYy_i\subseteq Y是和xix_i相关的一组标签集合。BIVI-ML架构包含三个模块:VGM、视觉注意力模块(VAM)、MM。

首先,在ImageNet上预训练的特征提取网络VGG16用于提取特征,然后输入至VGM得到分辨率和判别性增强后的特征VgainV_\text{gain},然后VAM获得注意力感知特征VfeatV_\text{feat}用于描述对应层的语义信息,最后注意力模块的输出经过MM层,随后经过输出头得到分类结果。

视觉增益模块

神经科学中相关研究表明人脑的纹外皮质执行注意力相关的增益控制功能。文章提出VGM来实现这种增益控制的功能。VGG16网络包含5部分,最后两部分分别表示为net_conv4和net_conv5。VGM模块对net_conv5模块的输出通过卷积操作在通道维度增加,将形状从H×W×CH\times W\times C变换到H×W×4CH\times W\times 4C,卷积核尺寸为3×3×10243\times 3\times 1024。然后经过D2HW形状变换操作将其变换为2H×2W×C2H\times 2W\times C维度。

P(x)=D2HW(net_conv5)P(x)=D2HW(net\_conv5')

同时网络net_conv4的输出经过sigmoid函数来过滤非显著信息:

F(x)=sigmoid(net_conv4)F(x)=\mathrm{sigmoid}(net\_conv4)

最后两者拼接到一起:

O(x)=P(x)(1+F(x))O(x)=P(x)(1+F(x))

视觉注意力模块

注意力过程可以抑制和当前关注区域不相关的信息,从而发现能够搜索到相关信息的新位置的能力。文中主要用于关注和标签相关的区域。文中视觉注意力机制可以生成包含每个特征图权重的情景向量,然后在每次迭代中重点访问相关特征区域。视觉注意力基于先前的隐层状态ht1h_{t-1},对于注意力感知特征集VfeatV_\text{feat}中的每个元素viv_i,VAM会生成权重αi[0,1]\alpha_i\in[0,1]来表示图片ii特征的权重。

i,t=fatt(vi,ht1)αi,t=ei,tj=1mei,t \in_{i,t}=f_\text{att}(v_i,h_{t-1})\\ \alpha_{i,t}=\frac{e^{\in_{i,t}}}{\sum_{j=1}^m e^{\in_{i,t}}}

最后通过视觉注意力加权得到最终的情景向量:

zt=t=1mαi,tvi z_t=\sum_{t=1}^m\alpha_{i,t}v_i

记忆模块

从神经科学中生物神经视觉单元的记忆属性推断,可能存在记忆模块来更新视觉系统中的特征信息。文中使用LSTM来模仿记忆模块实现对多标签的调整,这种调整不需要按照某种特定的标签顺序。文中拼接先前时间步的预测向量VpredV_\text{pred}(注意当t=1t=1Vpred=VprobV_\text{pred}=V_{prob},其余情况Vpred=pt1V_\text{pred}=p_{t-1})、情景向量ztz_t和先前步骤的y~t1\tilde y_{t-1}来获取当前的隐藏状态hth_t

xt=(vpred,zt,y~t1) x_t=(v_\text{pred},z_t,\tilde y_{t-1})

情景向量ztz_t由VAM获得,硬标签y~t1\tilde y_{t-1}表示预测的类别标签,LSTM输入xtx_t来计算记忆单元和隐藏状态。最后经过全连接,得到预测的结果:

pt=fpred(vpred,zt,y~t1,ht)p_t=f_\text{pred}(v_\text{pred},z_t,\tilde y_{t-1},h_t)

时刻tt的损失函数采用交叉熵:

Lt=i=1cyilog(σ(pi,t))+(1yi)log(1σ(pi,t))L_t=-\sum_{i=1}^cy_i\log(\sigma(p_{i,t}))+(1-y_i)\log(1-\sigma(p_{i,t}))

训练过程中每次y~t1\tilde y_{t-1}pt1p_{t-1}产生之后,网络可以更新注意力模块VfeatV_\text{feat}和隐藏状态hth_t,然后计算新的ptp_t

实验评价和讨论

文章主要和早期一些方法进行了对比,包括CNN、AlexNet、CNN、VGG16、Inception V3、Multi-label decision tree、ML-KNN、Binary Relevance。文章发现Dropout为0.1时训练准确率为76.32%,Dropout为0.85时准确率为99.63%,这是一个值得深究的现象。此外文章指出模型权重数值的稳定性会反应训练是否收敛,选择了留个权重画出轨迹,发现最后稳定收敛。